企业决策者常问的一句话是:"这款 Agent 产品、这家服务商,到底靠不靠谱?"但真到采购前,大多数人手里只有一份厂商的 PPT——里面全是"行业领先""开箱即用"这类无法核对的说法。
我们翻了过去一年围绕 Agent 选型、验收、运行、退出的多篇文章,发现一个真问题:指标散落在不同视角里,没人把它们收成一张能现场打分的表。本文做这件事:把核心指标分成三档——硬门槛(不达标直接出局)、分水岭(决定上线后翻不翻车)、加分项(决定长期会不会被绑死),并给出一张可填的一页纸评分卡。文中市场数据来自 Gartner 预测与一份 Agent 评测框架,合规与测试口径另附来源,请结合自身项目现状核对。评估动作本身也能做成固定任务——环曜Claw 的任务自动化 可把打分表固化成每月跑一次的流水线。
一、为什么现在必须有一张可打分的表
先看一个让人清醒的数字。Gartner 在 2025 年 6 月发布的 Agentic AI 预测(2026 年 7 月被行业复盘集中引用)给出三组口径:到 2028 年,15% 的日常工作决策将由 Agentic AI 自主完成(2024 年这一比例是 0%);33% 的企业软件将内置 Agent 能力(2024 年不足 1%);但与此同时,超过 40% 的 Agent 项目会在 2027 年底之前被砍掉。
后一个数字才是关键。它说明"上 Agent"和"用得住 Agent"是两件事——前者靠预算,后者靠评估。市面上"选型"文章很多,但大多停留在"看不看得起、靠不靠得住"的定性层面;真到验收和运行时,指标缺失才是项目被砍的主因。
二、核心指标分三档:从"能不能买"到"用不用得住"
把评估指标按"一票否决 / 决定成败 / 长期价值"分成三档,比堆一长串清单更管用。下面三层对应一套评测框架的"金字塔"结构:任务层只回答"能不能做对事",决策层回答"过程对不对",生产持续评测回答"线上稳不稳"——缺任何一层,指标都会和生产实际脱节。
| 档位 | 回答的问题 | 典型指标 | 不达标后果 |
|---|---|---|---|
| 硬门槛 | 能不能买 | 合规授权、数据不出域、审计留痕、安全测试证据 | 一票否决,直接出局 |
| 分水岭 | 上线后翻不翻车 | 可靠性(pass@k)、幻觉率、单任务成本、工具调用准确率 | 演示漂亮、生产翻车 |
| 加分项 | 长期会不会被绑死 | 自主性分级与熔断、退出与迁移条款、知识资产归属、生态开放 | 用得越久越被动 |
硬门槛:合规与可信是地基
这一档不考核"聪明不聪明",只考核"敢不敢用"。凡是涉及企业内网数据、对外服务的 Agent,先做这一关;过不了,后面都不用看。评估标准与证据清单建议集中存放,企业级环曜知识库本地化部署 的文档检索 入口可以承接,换人接手不必重新问一遍。
分水岭:可靠性与成本是楼体
这一档决定演示环境和生产环境的差距。如果你还想核官网在 AI 搜索 里被不被引用,环曜AIVO 的 AI 可见度 优化能按月出可核对清单。一个常见翻车案例:某客服 Agent 本地评测任务完成率 94%(超阈值),上线首周客诉率却高了 3 倍——原因是复杂对话"失忆"、边界情况漏判、同一问题答案不一致。单次 pass@1 高分掩盖了不稳定,必须用 pass@k(k 次尝试至少成功 1 次的概率)替代。
加分项:自主性与可迁移决定天花板
这一档不致命,但决定三年后你还能不能体面地换服务商。评估动作本身也能做成固定任务——环曜Claw 的任务自动化 可把打分表固化成每月跑一次的流水线。很多项目初期不在意"退出条款"和"知识资产归属",等到想迁移时才发现语料、流程、凭据都锁死在对方平台。
三、硬门槛:不达标直接出局的四项
硬门槛四项,任何一项不达标都意味着产品再聪明也不能用——它决定的是「敢不敢用」。下面把四项的达标线与现场判定方法列清楚:
| 指标 | 达标线 | 怎么验 |
|---|---|---|
| 授权与责任边界 | 有明确的授权范围、谁可查看、责任归属 | 看是否落到交付文档,而非口头承诺 |
| 数据不出域 | 训练/推理/留存均在私有环境内 | 问清数据流向与第三方调用 |
| 审计留痕 | 操作可回溯、日志防篡改 | 查日志能否逐条溯源 |
| 安全测试证据 | 有第三方或权威测试结论 | 看是否提供可核验的测试报告 |
合规与责任的依据
合规与责任的依据来自 中央网信办、国家发展改革委、工业和信息化部《智能体规范应用与创新发展实施意见》(2026 年 5 月 8 日),它对授权范围与责任边界提出了明确要求:凡由智能体代为访问、采集或判断的环节,都应明确授权与责任归属。安全测试证据一项,可对照151 家单位参与的 AI 安全测试结果里"挑选供应商时该要哪三份测试证据"的具体清单——前两项(授权与数据)可由企业自己核对,后两项需要独立第三方背书;这四类证据里,容易被厂商一句话带过、事后却难以举证的,正是后两项,也是验收时容易翻车的地方。身份、权限与防篡改日志的验收口径,则见《人工智能安全治理框架 3.0》的验收条目。
评测数据怎么留痕
对留在私有环境内处理的评测数据,企业级环曜 Agent 本地化部署 会把授权范围与审计留痕 写成交付项,与权限表一起归档验收。评估标准与证据清单同样建议集中存放,企业级环曜知识库本地化部署 的知识管理 入口可以承接,换人接手不必重新问一遍。
四、分水岭:决定上线后翻不翻车的四项
分水岭四项决定「用得稳不稳」,是硬门槛之后的第二关。下面把四项的参考达标线与验证方法列出来:
| 指标 | 达标线(参考) | 怎么验 |
|---|---|---|
| 可靠性 pass@k | pass@8 ≥ 80%(而非只看 pass@1) | 同一任务跑 8 次,统计至少成功 1 次的概率 |
| 幻觉率 | 用事实性判别 + 规则确定性检查 | 多轮对话抽样,查事实一致性 |
| 单任务成本 | 给出可复现的 token/调用成本 | 固定输入跑 N 次取均值,而非最优个案 |
| 工具调用准确率 | 函数/接口调用参数正确率 | 用专项榜或脚本比对预期与实际调用 |
这一档常在销售演示里被美化。记住一条:benchmark 高分不等于生产可靠。静态输入-输出对的评测只回答"能不能做对事",而 Agent 是动态序列决策——多轮交互、工具调用、状态管理、环境反馈都会让离线高分在真实环境里翻车。起步路径可以是:先用 20–50 个用例建立 pass@1 与 pass@8 基线,再用模型裁判(LLM-as-Judge)评核心维度,再接入持续评测采样真实请求。
这些评测动作可以固化:用命令行 跑回归脚本与模型裁判,企业级环曜 CLI 本地化部署 的客户环境通常把它并进既有 CI/CD 流水线。
五、加分项:决定长期会不会被绑死的四项
加分项四项决定「用得久不久、会不会被绑死」。下面把四项的关注点与验证方式列清楚:
| 指标 | 为什么重要 | 怎么验 |
|---|---|---|
| 自主性分级与熔断 | 自主度过高会越权,过低则没价值 | 看是否定义了分级与熔断阈值 |
| 退出与迁移条款 | 换服务商的成本("分手费") | 查知识资产与凭据是否可导出 |
| 知识资产归属 | 产出与语料归谁 | 写在合同,而非默认归平台 |
| 生态开放 | 是否被私有协议锁定 | 看是否支持标准接口与自托管 |
三项加分指标怎么验
自主性一项要参考企业 AI Agent 的自主性分级与熔断怎么定——Gartner 也提示多数企业的 Agent 自主性超出了应得水平,自主度不是越高越好,超出应得水平反而增加不可控风险;这条在过去被普遍忽视,直到多家企业因越权操作出事才被重视,属于治理层而非工程层的问题。退出与迁移一项对应换 AI 服务商要付多少"分手费"的清单,它列明了知识资产与凭据的导出条件——迁移成本往往是被低估的一项,很多项目初期根本没谈,等到想换才发现有形无形的代价。至于知识资产归属——这一项在合同谈判里常常被含糊带过,等到真正迁移时才发现数据格式不兼容、权限无法导出、流程要重做,代价远高于当初省下的谈判时间;归属不清,产出越多越被动——则见企业用 Agent 产出内容的著作权归属约定,这一条决定三年后你还有没有议价权。这四项不致命,但决定三年后你还有没有议价权。
六、一张可现场打分的三档评分卡
下面这张表把三档十二项收在一起,采购会上可以直接现场填;规则是:硬门槛任一"不达标"即一票否决,分水岭与加分项按权重汇总后看总分。建议打印出来逐项打勾,避免被销售话术带偏,也方便把证据留存到下一轮复评。用起来很轻,价值在坚持。
12 行评分卡
| 档位 | 指标 | 达标线 | 现场判定 | 证据来源 |
|---|---|---|---|---|
| 硬门槛 | 授权与责任边界 | 落到文档 | □达标/不达标/待核 | 交付文档 / 实施意见 |
| 硬门槛 | 数据不出域 | 私有环境内 | □达标/不达标/待核 | 架构说明 |
| 硬门槛 | 审计留痕 | 可逐条溯源 | □达标/不达标/待核 | 日志系统 |
| 硬门槛 | 安全测试证据 | 可核验报告 | □达标/不达标/待核 | 测试结论 |
| 分水岭 | 可靠性 pass@8 | ≥ 80% | □达标/不达标/待核 | 回归脚本 |
| 分水岭 | 幻觉率 | 事实一致 | □达标/不达标/待核 | 抽样评测 |
| 分水岭 | 单任务成本 | 可复现均值 | □达标/不达标/待核 | 成本记录 |
| 分水岭 | 工具调用准确率 | 参数正确 | □达标/不达标/待核 | 调用日志 |
| 加分项 | 自主性分级与熔断 | 有阈值 | □达标/不达标/待核 | 配置文档 |
| 加分项 | 退出与迁移条款 | 可导出 | □达标/不达标/待核 | 合同 |
| 加分项 | 知识资产归属 | 归企业 | □达标/不达标/待核 | 合同 |
| 加分项 | 生态开放 | 标准接口 | □达标/不达标/待核 | 接口说明 |
评分卡与证据怎么留痕
评分卡与证据建议按版本留存,企业级环曜知识库本地化部署 的文档检索 入口可以按版本对照,不必再翻各人本地保存的文件。两类动作性质不同,一个管存、一个管跑:评测与归档用命令行 触发并接进检查单,企业级环曜 CLI 本地化部署 的客户环境把它并进发布流程。
七、落地:怎么把这张表用起来
四步即可,不必另起一套流程:① 冻结评估口径(写明数据来源、时间窗、样本量);② 逐项打档(硬门槛一票否决,分水岭与加分项按权重汇总);③ 留痕归档(评分卡、证据、结论按版本留存);④ 上线后持续评测(生产采样对照离线结果)。
这套打分动作每月或每次选型重复,适合写成固定任务:导出、评分、归档串成一条流水线,环曜Claw 的任务自动化 就能承担这一段,不必改动现有业务系统。
评估标准与证据清单建议集中存放、按版本检索,企业级环曜知识库本地化部署 的文档检索入口可以按版本对照,不必再翻各人本地保存的文件。
八、读到真数据之后:缺口在"验得动",不在"买得起"
把表填完你会发现,大多数项目卡住的不是"选哪家",而是"验不动"——没有可复现的评测脚本、没有留痕的日志、没有写进合同的退出条款。这些恰恰是中小企业 AI 采购前必问的 10 问(POWER 选型模型)里反复强调、却总被跳过的一环——多数项目实际卡住的从来不是"买不起",而是"验不动":预算能批,但评测脚本、留痕日志、退出条款这三样往往一片空白,销售阶段几乎从不主动提及,采购 PPT 里也鲜少列明,只有到了验收与续约环节,这些被跳过的一环才会一次性爆发,且修复成本远高于早期约定;服务商实力该按哪六个维度看,则可对照服务商实力 6 维选型。
如果你正在看一家服务商,建议把"硬门槛四项证据"作为首道筛子,再谈价格。具体怎么把评测跑起来、把证据收齐,可以写进本地化部署的服务页的验收项里——只有落在正文承接的清单上,才算真的验过了。评估完产品,官网在 AI 搜索 里的可见度也值得核,环曜AIVO 的 AI 可见度 优化能按月出可核对清单。两类数据性质不同、处理位置也要分开看:评测数据本身建议留在私有环境内,企业级环曜 Agent 本地化部署 的交付要求包含授权范围与审计留痕。
结语:先有表,再谈选
回到开头那句话:靠不靠谱,不该靠厂商的 PPT 回答。Gartner 说 40% 以上的 Agent 项目会在 2027 年底前被砍,砍的大多是"买了但验不动"的那批。
所以给决策者的建议只有一句:下次评估 Agent 产品与服务商,先把这张三档评分卡摆在桌上,再开始谈。 具体动作是三个——硬门槛四项先验(合规/数据/留痕/测试)、分水岭四项用 pass@8 与成本均值替代演示、加分项四项写进合同。做完这三件事,你才真正拥有一个"靠不靠谱"的可核对答案;在那之前,所有结论都是在销售话术上做的判断。如果你还想核官网在 AI 搜索 里被不被引用,环曜AIVO 的官网优化 也能按季度复核——把"被收录、被引用"做成可核对项。下次评估之前,不妨先问一句:你手里的那份材料,是 PPT 还是能打分的表?
数据来源与口径
外部来源:Gartner Agentic AI 预测(2025 年 6 月发布,2026 年 7 月被行业复盘引用;口径为面向 2028 年的预测值,对比基线为 2024 年);一份 2026 年 Agent 评测实践框架(2026 年 3 月发布,提出任务层 / 决策层 / 生产持续评测三层金字塔与 pass@k 测量法,案例为客服 Agent 94% 完成率 vs 上线 3 倍客诉);中央网信办等三部门《智能体规范应用与创新发展实施意见》(2026 年 5 月 8 日)。内部交叉引用:article-1000(151 家单位 AI 安全测试)、article-998(治理框架 3.0 验收)、article-985(自主性分级)、article-986(退出迁移)、article-992(知识资产归属)、article-957(POWER 10 问)、article-948(6 维选型)、article-976(7 类服务商画像)。外部预测数据为前瞻口径,内部数据含评测与实践两类口径,报告中不相加、不换算。
你最近一次评估 Agent 服务商,是用 PPT 还是用打分表?欢迎在评论区说下你们卡在哪一项指标上,我们可以一起对一对口径——看看到底是产品不行,还是你还没把表摆上桌。
常见问题 FAQ
Q:Q1 为什么不能只看厂商给的 benchmark 分数?
因为 benchmark 多为静态输入-输出对,测的是"能不能做对事",而 Agent 是动态序列决策。一个客服 Agent 本地任务完成率 94% 却在上线首周客诉率翻 3 倍,根因就是评测只覆盖了任务层,漏了决策层与生产持续评测。正确做法是补 pass@k、幻觉率与生产采样三项。
Q:Q2 硬门槛和分水岭,哪一项更该先验?
先硬门槛。合规、数据不出域、审计留痕、安全测试证据这四项任何一项不达标,产品再聪明也不能用——它决定了"敢不敢用"。分水岭决定"用得稳不稳",是硬门槛之后的第二关,不要在硬门槛没过时就纠结模型参数。
Q:Q3 这套评分卡要每次手工填吗?
不必。确定口径之后就该固化:同一套打分表、同一个证据清单、每月或每次选型自动产出。手工重复的问题不是麻烦,而是每次口径都会漂移,导致前后不可比。把它做成定时任务比靠人记更稳。
Q:Q4 小团队没有评测工程师,怎么验可靠性?
从最小动作起步:20–50 个真实用例建立 pass@1 与 pass@8 基线,用现成的模型裁判工具评核心维度,再逐步接入持续评测。不必一开始上完整金字塔,但 pass@1 高分不能单独作为上线依据——这是常见的坑。
Q:Q5 怎么判断一家服务商是不是"看着像大厂"?
看它能否当场给出硬门槛四项的证据,而不是讲行业地位。可对照上海企业选 AI Agent 服务商的 7 类服务商画像,重点排除那些把"生态"讲得很满、却给不出数据流向与退出条款的供应商。
Q:Q6 评估口径变了,历史评分卡还能比吗?
会,所以要做两件事:一是标注变更点,在变更前后不做同档横向对比;二是变更当期同时给出新旧两套口径的评分,让结论建立在可比口径上。这也是我们把评分卡与证据按版本归档的原因——半年后回看时,你会需要知道当时是按什么标准打的。