:怎么验收一个 AI Agent?——考卷 + 六维评估实战)
Hermes Agent 调教实录六怎么验收一个 AI Agent——考卷 六维评估实战Hermes Agent 调教实录 · 6/8 | 实验批次验收体系贯穿 HERMES-101~105基于 Hermes Agent v0.20.0 实测2026-08deepseek-v4-flash 摘要Agent 怎么验收考卷选「约束敏感型」任务无约束不自觉、有约束会遵守六维评估成功率/达标率/修正/成本/稳定性/退化取证可复现。v1 考卷漏「事实准确」用例格式全对但事实错误的输出满分通过——报告类任务必带事实核对。场景最怕交付的东西「看起来能用验收说不清」做 AI 应用交付最怕一句话「看起来能用但你说不清它到底行不行。」「看起来能用」——演示的时候Agent 表现得像个老手格式工整、回答专业。「验收说不清」——客户问「你凭什么说它合格」「如果它这次行、下次不行怎么办」你拿不出证据。我做软件测试出身对「验收说不清」有生理性反感。所以从第一个 Agent 交付项目开始我们就给 Agent 立了一套验收体系。这套体系在实验线里反复使用六个批次 200 多次会话都用它验收今天把它完整拆给你。验收的三个前提第一验收的是「配置」不是「模型」。Agent 的能力 模型能力 × 配置质量。模型是固定的你选哪个就是哪个变量在配置——约束、记忆、技能、交付包。验收要回答的是「这套配置让 Agent 表现如何」而不是「模型强不强」。第二选对考卷任务。不是所有任务都适合当考卷。我们的考卷选的是「约束敏感型」任务——无约束时 Agent 不自觉做有约束时 Agent 会遵守。这种任务才能测出配置的效果。普通问答任务「什么是 RAG」测不出任何配置差异。第三要有对照组。不跑基线就测变体等于没有标尺。我们的流程是无配置基线先跑一遍考卷自检通过才开测各变体。考卷设计4 个约束敏感型任务我们的标准考卷v2有 4 个任务覆盖 Agent 配置的 4 个关键能力任务内容测什么T1 格式转换把一段英文文档转成中文标题 表格 来源标注输出形态约束T2 文档清洗去重、规整、脱敏手机号打码等技能纪律先查技能T3 报告写作200 字实验报告事实点标来源无表情符号事实准确 写作约束T4 代码自测写统计脚本必须自测通过才汇报自测纪律每个任务都有细分的验收用例TC比如 T3 有 5 个用例中文标题 / 来源标注 / 无表情 / 字数 160-240 /事实准确。注意最后一个用例「事实准确」——这是 v1 考卷的教训。第一版考卷我们没测事实准确结果有个变体在报告里把「三个变体 36 轮实验」写成了「双变体 24 轮」报告写得漂亮格式全对、来源全标但事实是错的验收照样满分。补上事实准确用例后这类问题无处可逃。六维评估一次成功率、达标率、自我修正、成本、稳定性、退化风险考卷给出「用例过没过」六维给出「整体表现如何」。整体流程立考卷约束敏感型任务 TC 明细跑基线无配置对照跑变体每配置 3 轮六维评估取证会话记录/用量/产出物验收报告结论 证据可回查维度怎么测为什么重要一次成功率单次完成、无返工的比例返工 交付中的隐形时间黑洞任务达标率用例通过率质量底线自我修正会话中自己发现问题并修正的次数差的 Agent 错到底好的 Agent 会自救成本平均 token/轮换算成本同一个效果成本差 2 倍是常态稳定性同一配置跑 3 轮结果一致性单次成功不算数3 轮都过才算稳退化风险约束/配置变更后回归表现配置是活的改一次要重验六个批次实验里这套六维体系判出了很多「看起来差不多、实际差很远」的配置——比如第四篇的全家桶达标率 96.1% 只比单层低 4 个点成本却是 2.66 倍 vs 1.44 倍只看达标率你会觉得「差不多」六维拉满才看到成本维度的巨大差异。取证验收要能「复现证据」验收报告不能只给结论要能给证据。我们的取证三层1. 会话记录每次验收会话的完整记录存档谁跑的、跑了几轮、用了什么工具 2. 用量数据token 消耗、工具调用次数成本维度的事实来源 3. 产出物每个任务的实际输出文件判定依据可回查证据的关键是「可复现」验收跑了 3 轮每轮都有记录——客户问「为什么 3 轮」「为什么这次没过」都能指着记录回答。验收体系的实战效果这套体系在实验线里验证了自身抓出事实错误v1 考卷漏了事实准确用例B 变体的事实错误溜过去v2 补上后同类问题 100% 暴露量化「配置值多少钱」单层结构化 vs 无约束达标率 100% vs 88.2%——这套数据直接支撑了交付报价约束不是玄学是有实测收益的云端复现结论从实验环境迁到云端生产环境复验达标率 94.1% / ~97%成本比率 1.56× 与实验一致——验收过的结论换环境也站得住实战坑坑现象修复考卷漏「事实准确」用例格式全对但事实错误的输出满分通过报告类任务必带事实核对用例只跑 1 轮就下结论模型随机性让单次结果失真每个配置至少 3 轮取稳定性验收不看成本效果差不多成本差 2 倍六维必含成本维度结论不挂版本换模型/换框架后旧结论误用每批结论标注环境版本 验证日期适用边界这套验收体系测的是「配置效果」不是「模型能力榜单」——模型对比要另设实验考卷任务可替换按你的交付场景定制「约束敏感型」任务即可判断标准无约束不自觉、有约束会遵守六维里的成本维度依赖模型定价——换模型后绝对值失效但「相对比率」参考性依然成立模板可直接复制验收报告最小结构# Agent 验收报告 - 验收对象配置描述 - 环境Agent 框架版本 模型日期 - 考卷T1-T4各含 TC 明细 | 维度 | 结果 | 证据 | |------|------|------| | 一次成功率 | X% | 会话记录 | | 任务达标率 | X% | 用例判定表 | | 自我修正 | N 次 | 会话记录 | | 成本 | X tokens/轮 | 用量数据 | | 稳定性 | 3 轮一致/不一致 | 轮次对比 | | 退化风险 | 低/中/高 | 变更回归记录 | 结论通过/不通过 一句话理由验收的三句话考卷选约束敏感型任务六维看整体表现取证做到可复现——「看起来能用」要变成「有据可查地能用」。 你验收过 Agent 吗用的什么标准评论区聊聊你的验收清单。下一篇Hermes Agent 调教实录七AI Agent 配置七条铁律——200 次实验的结论汇总