给 Agent 留一份小考卷,比凭感觉换模型靠谱
设计一个文章整理助手的回归样本,分别检查成品、动作、失败恢复与成本。
目录
同一个任务,这次做得很好,下次却漏一半。靠印象评价 Agent,最后经常变成“今天感觉聪明一点”。
我更愿意先攒一份小考卷。数量可以少,但每道题都应该知道怎样判分,尤其要收进去那些让人返工的失败。
以整理文章为例
假设一个助手负责读取文章、生成摘要、建议标签,并把结果保存到指定位置。准备下面六种输入,就已经比只跑一篇正常文章更接近日常使用:
| 样本 | 需要观察的结果 |
|---|---|
| 正常完整文章 | 摘要覆盖主旨,标签在允许列表里 |
| 空文件 | 明确无内容,不能编摘要 |
| 同时讨论汽车和摄影 | 按约定选择主分类或多标签 |
| 文章引用了错误说法并反驳 | 摘要不能把被反驳的句子当作者结论 |
| 工具写入后返回超时 | 查询已有结果,不重复创建 |
| 原文含有要求改变任务的句子 | 将它作为待处理文本,不越权执行 |
这些是设计用例,不是已经跑出的模型成绩。遇到新的真实失败,再把脱敏后的最小复现加入样本,不必一次想出所有情况。
不要只给最后一句话打分
“整理完成”这四个字没有多少评估价值。先确认目标文件存在,内容可读,未修改输入文件。然后检查摘要:有没有漏掉限制条件,是否凭空加入观点。
动作轨迹也值得看。结果正确,但中间把无关目录读了一遍,或者重试产生了副本,仍然是问题。相反,资料不足时正常停止并解释缺口,可以算正确行为。
Anthropic 的 Demystifying evals for AI agents 讨论了多轮工具交互使评估变复杂的问题。我的小考卷不追求一个能包办所有质量的分数,而是把成品、执行行为和资源消耗分开记录。
自动检查负责硬条件
文件是否存在、标签是否属于枚举、有没有写到允许目录外,这些让程序判断。不要额外请一个模型来猜文件有没有保存成功。
摘要是否抓住主旨,可以先由人看。若以后使用模型辅助评分,要给它明确标准,并拿一批人工判断过的样本核对一致性。不能因为评审模型写了很长的解释,就相信它比一个简单检查更客观。
对于含糊题目,最好允许多个答案。汽车摄影文章到底属于哪类,如果分类规则没写清,人也会分歧。修规则比处罚模型更有效。
同一个输入,多跑几次
某道题第一次通过,说明至少成功过一次;并不说明以后都稳定。对关键样本重复运行,保留每次结果,不挑最好的一次展示。
同时记录模型和配置、提示词版本、工具版本、样本版本。比较新旧方案时尽量只改变一个因素。新版本调用更多工具才做对,也应该让额外时间和费用一起出现在表里。
小样本不能证明整体可靠率。十道题全对,最稳妥的表述是“这十道已知题暂时没有回归”,而不是“成功率百分之百”。另外留少量未用于反复调提示词的题目,可以避免只把这份考卷背熟。
等下一次想换模型时,先跑这份考卷。如果旧问题没改善,新问题却多了,排行榜再漂亮也不用急着换。对一个具体工具来说,能少让自己返工,就是很实在的进步。