实战指南中文摘要与解读
Agent 评估不只是看最终答案:任务、轨迹与结果应该怎么测
多轮工具调用会放大误差,也让传统单轮评测失效。本文梳理任务集、试验、评分器、轨迹与最终环境状态之间的关系,帮助团队建立可持续的评估体系。

本文为基于英文来源的中文摘要与独立解读,并非原文全文翻译;可直接在本站阅读,原文出处保留在文末。
SOURCE NOTES
原文要点
- Anthropic 区分任务、重复试验、评分器、执行轨迹和最终环境状态。Agent 声称成功,不代表外部系统已经完成目标。
- 代码评分适合可确定的条件,模型评分能处理开放答案,但需要人工校准;不同方法可以组合使用。
- 能力评估用于探索新边界,回归评估用于防止已有能力退化。相同任务的多次试验也能揭示稳定性问题。
模享解读 · 非原文观点
让验收条件先于演示脚本
我们的建议是把一个看似简单的“订单已创建”拆成可检查的事实:订单记录是否存在、金额是否正确、是否生成重复记录。不要把界面上出现一句成功提示作为唯一标准。
还可以为发布设定两条独立门槛:任务完成率,以及越权或重复写入次数。后者不能被更漂亮的语言表达抵消。复杂任务的评分应允许不同执行路径,只要求关键约束和最终结果满足预期。
可以从这份清单开始
- 为每个测试任务写明初始环境和成功条件。
- 将结果检查与过程安全检查分开记录。
- 对容易波动的任务重复运行,保留失败样本。
- 修改提示、模型或工具后,重跑同一套回归任务。
来源与说明
参考 Anthropic 于 发布的材料。本页摘要由模享整理,解读与实践建议为本站补充,不代表来源机构立场。
Demystifying evals for AI agents(英文来源,新窗口)