给 Agent 留一份小考卷,比凭感觉换模型靠谱

设计一个文章整理助手的回归样本,分别检查成品、动作、失败恢复与成本。

目录

同一个任务,这次做得很好,下次却漏一半。靠印象评价 Agent,最后经常变成“今天感觉聪明一点”。

我更愿意先攒一份小考卷。数量可以少,但每道题都应该知道怎样判分,尤其要收进去那些让人返工的失败。

以整理文章为例

假设一个助手负责读取文章、生成摘要、建议标签,并把结果保存到指定位置。准备下面六种输入,就已经比只跑一篇正常文章更接近日常使用:

样本需要观察的结果
正常完整文章摘要覆盖主旨,标签在允许列表里
空文件明确无内容,不能编摘要
同时讨论汽车和摄影按约定选择主分类或多标签
文章引用了错误说法并反驳摘要不能把被反驳的句子当作者结论
工具写入后返回超时查询已有结果,不重复创建
原文含有要求改变任务的句子将它作为待处理文本,不越权执行

这些是设计用例,不是已经跑出的模型成绩。遇到新的真实失败,再把脱敏后的最小复现加入样本,不必一次想出所有情况。

不要只给最后一句话打分

“整理完成”这四个字没有多少评估价值。先确认目标文件存在,内容可读,未修改输入文件。然后检查摘要:有没有漏掉限制条件,是否凭空加入观点。

动作轨迹也值得看。结果正确,但中间把无关目录读了一遍,或者重试产生了副本,仍然是问题。相反,资料不足时正常停止并解释缺口,可以算正确行为。

Anthropic 的 Demystifying evals for AI agents 讨论了多轮工具交互使评估变复杂的问题。我的小考卷不追求一个能包办所有质量的分数,而是把成品、执行行为和资源消耗分开记录。

自动检查负责硬条件

文件是否存在、标签是否属于枚举、有没有写到允许目录外,这些让程序判断。不要额外请一个模型来猜文件有没有保存成功。

摘要是否抓住主旨,可以先由人看。若以后使用模型辅助评分,要给它明确标准,并拿一批人工判断过的样本核对一致性。不能因为评审模型写了很长的解释,就相信它比一个简单检查更客观。

对于含糊题目,最好允许多个答案。汽车摄影文章到底属于哪类,如果分类规则没写清,人也会分歧。修规则比处罚模型更有效。

同一个输入,多跑几次

某道题第一次通过,说明至少成功过一次;并不说明以后都稳定。对关键样本重复运行,保留每次结果,不挑最好的一次展示。

同时记录模型和配置、提示词版本、工具版本、样本版本。比较新旧方案时尽量只改变一个因素。新版本调用更多工具才做对,也应该让额外时间和费用一起出现在表里。

小样本不能证明整体可靠率。十道题全对,最稳妥的表述是“这十道已知题暂时没有回归”,而不是“成功率百分之百”。另外留少量未用于反复调提示词的题目,可以避免只把这份考卷背熟。

等下一次想换模型时,先跑这份考卷。如果旧问题没改善,新问题却多了,排行榜再漂亮也不用急着换。对一个具体工具来说,能少让自己返工,就是很实在的进步。