Agent 评测、后训练与推理:用数据证明系统真的变好了
1. 第一性原理:Agent 是一个环境中的决策系统
普通模型评测常看一次输入对应的文本质量;Agent 评测要看它在一系列状态、工具和约束下是否完成目标。因此最终结果、行动过程、成本、时间、安全和恢复能力都属于质量。
一个有用的指标必须能改变决策。不能解释失败、不能指导发布门禁、不能区分模型和 Harness 的指标,通常只是展示数字。
2. Metric 的分层
建议把指标分为四层:
- Outcome:任务完成率、测试通过率、答案正确率、证据覆盖率。
- Process:Tool 成功率、无效调用率、重试次数、计划漂移率、验证覆盖率。
- Reliability:恢复成功率、重复副作用率、上下文冲突率、人工介入率。
- Cost/Experience:Token、延迟、Sandbox 时间、排队时间、用户等待和每次成功任务成本。
安全任务还要有硬门槛,例如越权率、敏感数据泄露率和危险动作拦截率。硬门槛不能被平均分抵消。
3. Offline Eval Pipeline
离线评测从固定任务集开始。每个 Case 应包含任务合同、仓库或环境版本、工具权限、初始状态、验收标准和可能的干扰。运行时采集完整 Rollout/Trajectory:模型请求、Tool Call、Observation、状态变化、压缩、人工事件、验证结果和 StopReason。
Pipeline 可以是:
Case → 多次 Rollout → 轨迹清洗 → 自动测试/规则评分
→ LLM Judge(必要时)→ 失败归因 → 报告与回归门禁
LLM Judge 适合评估开放式解释、风格和证据充分性,但不能替代确定性测试、权限检查和副作用核对。Judge 自身要做一致性和偏差校准。
4. Single Turn 与 Multi Turn
Single Turn 适合测试一次规划、单次 Tool 使用和短答案;Multi Turn 才能暴露目标更新、上下文压缩、用户中断、恢复和长期 Memory 问题。多轮 Case 应定义状态转移和每一轮允许的控制事件,而不是简单把多条消息串起来。
评测要区分“最终完成”和“完成路径”。一个 Agent 最终答对但中间越权、重复写入或丢失用户约束,不能视为可靠。
5. Online Eval 与灰度
线上先做 shadow 或小流量灰度,让新模型/新 Harness 在真实任务上产生轨迹但不承担全部副作用;再逐步扩大流量。分桶要固定任务类型、租户、模型、工具权限和版本,防止样本结构变化造成假提升。
线上监控不仅看成功率,还看长尾延迟、失败类型、人工介入、Token 成本、恢复次数和用户撤销。出现硬安全回归立即回滚;质量轻微波动则进入离线复现和分层归因。
6. 新模型或新特性上线
先冻结基线和任务集,再做离线 A/B;将变化拆成模型变化、Prompt/Skill 变化、Tool 变化和 Harness 变化。通过轨迹对比回答:成功提升来自哪里,是否牺牲成本、安全或恢复能力。
上线门禁建议包含:核心任务无回归、长程任务通过、工具错误可控、压缩后约束保留、停止和恢复正确、敏感动作权限不放大、SSE 和状态事件兼容。
7. 后训练的本质
后训练不是让模型背更多知识,而是让 Base Model 适配 Agentic Environment。训练对象包括 instruction following、结构化 Tool Use、规划与重规划、错误恢复、自验证、长程行为和 MultiAgent 协议遵循。
高价值样本不是只有成功轨迹,还包括高质量失败、错误分类、正确重试、拒绝危险动作、用户 Steer 后更新计划和恢复后的非重复执行。负例要标注“错在哪里、正确下一步是什么”,否则模型只学到表面拒绝。
8. Prefill、Decode 与 Agent 优化
Prefill 读取上下文并建立 KV Cache,Decode 逐 Token 生成。Coding Agent 的请求常有长且稳定的前缀、短而频繁的增量状态,因此要优化稳定前缀、缓存命中、Cache 失效和 Continuous Batching。
优化必须与质量联测:更高 KV 命中率不能使用过期权限;更激进的压缩不能丢失约束;更高并行度不能导致 Tool 乱序或租户隔离破坏。
9. Coding Agent Benchmark
SWE-bench 等基准可用于仓库级修复能力,但不能代表完整产品质量。还需要 Tool-use、长程恢复、安全、成本和交互体验任务。评测数据要保留 patch、测试、轨迹、工具错误和资源消耗,才能形成 Eval Pipeline 而不是一次分数。
10. 学习者练习
选 20 个真实小任务,分别跑单轮和多轮;注入一次 Tool 超时和一次上下文压缩;记录 outcome、process、reliability、cost 四层指标。对一个失败轨迹写出根因,而不是只给分数。