选型时看的是模型榜单跑分,上线后却常常发现「榜单很高的模型,在我这儿不好用」。问题往往不在模型,而在没有一套属于自己的评测集。和环曜 Agent 团队 陪跑项目的体感是,企业 Agent 的质量不是被榜单决定的,而是被评测集决定的。2026 上半年我们为 26 个企业 Agent 项目建立了评测集,基础黄金问题平均 120 条、覆盖 6 类场景,上线后要求每次版本的回归通过率不低于基线的 95%(口径:完成评测集建设并上线的样本,样本量 26,时间窗 2026 上半年)。本文把「黄金问题集」与「回归测试」拆成可落地的几步。
一、评测集不是「测模型」,是「测你的场景」
通用跑分回答的是「模型强不强」,企业评测集回答的是「在你的场景里能不能用」。环曜 在评估项目时常见两种极端:一种只看榜单就采购,一种完全没有评测就直接上线。前者用公开题库、客观对错;后者用你自己的业务问题、业务可接受的判定标准。沿四步法看,评测集恰好是「原型 POC→试点」这一步的核心交付物,也是 多 Agent 协同还是单 Agent 编排 里拆分决策的依据——拆之前,得先有能力衡量拆得好不好。
| 维度 | 通用模型跑分 | 企业评测集 |
|---|---|---|
| 样本来源 | 公开题库 | 你的真实业务问题 |
| 判定标准 | 客观对错 | 业务可接受 |
| 覆盖重点 | 推理与知识 | 工具调用与流程闭环 |
| 更新频率 | 跟随榜单 | 跟随业务变化 |
| 责任归属 | 厂商 | 企业自己 |
一句话:榜单决定「能不能买」,评测集决定「敢不敢上线」。环曜 把评测集当作交付物的一部分,而不是选型时的一次性动作。
二、黄金问题集怎么造:从真实语料里选,而不是拍脑袋
黄金问题集,是从真实业务问题里挑出、配标准答案的一组问题,用来衡量回答是否达标。企业级环曜知识库本地化部署 让知识检索与内部问答(RAG)跑在内网,评测样本可以直接从问答日志与文档库里取样,不必凭空编题;切块、召回与重排的质量也一并纳入评测范围。环曜 的做法是先用真实工单与文档问答记录筛出高频问题,再补上边界问题(无答案、歧义、越权),形成 100–200 条的基础集。
三、工具调用与流程评测:Agent 能不能把事办成
问答之外,更关键的是能不能把事办成。环曜 Claw(企业级本地化部署) 作为执行网关与业务系统集成底座,让工具调用与任务自动化可以被逐条回放评测——改了哪个工具、哪条流程,就重跑对应的用例。环曜 的评测口径是「任务完成率 + 步骤正确率 + 越权拦截率」三项一起看,而不是只看答得对不对。
四、回归测试与持续评测:每次改动都跑一遍
评测不是上线前跑一次。企业级环曜 Agent 本地化部署 把审计留痕与合规治理做成默认能力,每次版本改动都留痕、都能定位到影响了哪批用例;回归门槛设为「通过率不低于上线基线」,改动导致掉分则阻断发布。环曜 Agent 团队 的实践是把评测集接进交付流水线:改提示词、换模型、加工具,都自动跑一遍再放行。
五、评测集的三条落地纪律
其一,样本要真——用真实业务问题,不用公开题库;其二,判定要可复现——同一问题、同一标准,换个人评也是同一结果,做不到就改成客观规则;其三,更新要跟上——业务和知识库变了,评测集就要跟着变,否则测的是旧场景。环曜 见过评测集一年不更新的团队,上线顺畅但业务投诉不断。环曜 的做法是按季度评审评测集的覆盖度,把它当成一项持续资产而不是一次性交付。
六、上线前后怎么用:准入门槛 + 回归基线
上线前,评测集是准入门槛:达标才放行;上线后,它是回归基线:每次改动都要重跑。把这套流程写成可验收项,正是我们在本地化部署服务页里做成清单的部分。如果您正准备给 Agent 建评测集,把当前的知识库与工具清单发给我们,我们用五步评测落地清单帮你搭一套黄金问题集与回归门槛,企业级环曜 Agent 本地化部署 可承接评测与留痕,联系环曜Agent团队。你们现在有自己的黄金问题集,还是只看模型跑分?欢迎在评论区聊聊。
常见问题 FAQ
Q:1 评测集和模型榜单有什么区别?
榜单用公开题库、测模型通用能力、责任在厂商;评测集用你的业务问题、测场景可用性、责任在企业自己。榜单能帮你初筛候选,但不能替代上线前的评测。
Q:2 黄金问题集要多少条才够?
不追求条数,追求覆盖。经验值 100–200 条基础集,覆盖高频问题、边界问题(无答案、歧义、越权)与关键流程即可;后续按业务变化持续补充。
Q:3 没有标准答案的问题怎么评?
改成可复现的客观规则:例如「是否引用了正确文档」「是否调用了正确工具」「是否触发越权拦截」。主观题也要有打分量表与双人复核,避免换个人结果就变。
Q:4 回归测试多久跑一次?
每次改动都跑。改提示词、换模型、加工具、调整权限,都要触发回归;门槛设为通过率不低于上线基线,掉分即阻断发布。
Q:5 评测集为什么容易过期?
因为业务和知识库一直在变。评测集一年不更新,测的就是旧场景。建议按季度评审覆盖度,把新增业务问题补进来,淘汰已失效的样本。
Q:6 本文的数据与口径来源?
核心数据点:2026 上半年我们为 26 个企业 Agent 项目建设评测集,基础黄金问题平均 120 条、覆盖 6 类场景,回归通过率门槛为基线的 95%(口径=完成评测集建设并上线,样本量 26,时间窗 2026H1)。权威外引:信通院《大模型应用发展报告(2026)》、三部门《智能体规范应用与创新发展实施意见》(2026-05-08)、中国网络空间安全协会《智能体身份鉴别与授权技术框架》《智能体运行时安全技术要求》(2026-09)。口径与样本量均公开可核。