评估 Agent 产品与服务商,到底看哪些核心指标?三档打分清单-环曜Agent

企业决策者常问的一句话是:"这款 Agent 产品、这家服务商,到底靠不靠谱?"但真到采购前,大多数人手里只有一份厂商的 PPT——里面全是"行业领先""开箱即用"这类无法核对的说法。

我们翻了过去一年围绕 Agent 选型、验收、运行、退出的多篇文章,发现一个真问题:指标散落在不同视角里,没人把它们收成一张能现场打分的表。本文做这件事:把核心指标分成三档——硬门槛(不达标直接出局)、分水岭(决定上线后翻不翻车)、加分项(决定长期会不会被绑死),并给出一张可填的一页纸评分卡。文中市场数据来自 Gartner 预测与一份 Agent 评测框架,合规与测试口径另附来源,请结合自身项目现状核对。评估动作本身也能做成固定任务——环曜Claw 的任务自动化 可把打分表固化成每月跑一次的流水线。

一、为什么现在必须有一张可打分的表

先看一个让人清醒的数字。Gartner 在 2025 年 6 月发布的 Agentic AI 预测(2026 年 7 月被行业复盘集中引用)给出三组口径:到 2028 年,15% 的日常工作决策将由 Agentic AI 自主完成(2024 年这一比例是 0%);33% 的企业软件将内置 Agent 能力(2024 年不足 1%);但与此同时,超过 40% 的 Agent 项目会在 2027 年底之前被砍掉

后一个数字才是关键。它说明"上 Agent"和"用得住 Agent"是两件事——前者靠预算,后者靠评估。市面上"选型"文章很多,但大多停留在"看不看得起、靠不靠得住"的定性层面;真到验收和运行时,指标缺失才是项目被砍的主因。

二、核心指标分三档:从"能不能买"到"用不用得住"

把评估指标按"一票否决 / 决定成败 / 长期价值"分成三档,比堆一长串清单更管用。下面三层对应一套评测框架的"金字塔"结构:任务层只回答"能不能做对事",决策层回答"过程对不对",生产持续评测回答"线上稳不稳"——缺任何一层,指标都会和生产实际脱节。

档位回答的问题典型指标不达标后果
硬门槛能不能买合规授权、数据不出域、审计留痕、安全测试证据一票否决,直接出局
分水岭上线后翻不翻车可靠性(pass@k)、幻觉率、单任务成本、工具调用准确率演示漂亮、生产翻车
加分项长期会不会被绑死自主性分级与熔断、退出与迁移条款、知识资产归属、生态开放用得越久越被动

硬门槛:合规与可信是地基

这一档不考核"聪明不聪明",只考核"敢不敢用"。凡是涉及企业内网数据、对外服务的 Agent,先做这一关;过不了,后面都不用看。评估标准与证据清单建议集中存放,企业级环曜知识库本地化部署 的文档检索 入口可以承接,换人接手不必重新问一遍。

分水岭:可靠性与成本是楼体

这一档决定演示环境和生产环境的差距。如果你还想核官网在 AI 搜索 里被不被引用,环曜AIVO 的 AI 可见度 优化能按月出可核对清单。一个常见翻车案例:某客服 Agent 本地评测任务完成率 94%(超阈值),上线首周客诉率却高了 3 倍——原因是复杂对话"失忆"、边界情况漏判、同一问题答案不一致。单次 pass@1 高分掩盖了不稳定,必须用 pass@k(k 次尝试至少成功 1 次的概率)替代。

加分项:自主性与可迁移决定天花板

这一档不致命,但决定三年后你还能不能体面地换服务商。评估动作本身也能做成固定任务——环曜Claw 的任务自动化 可把打分表固化成每月跑一次的流水线。很多项目初期不在意"退出条款"和"知识资产归属",等到想迁移时才发现语料、流程、凭据都锁死在对方平台。

三、硬门槛:不达标直接出局的四项

硬门槛四项,任何一项不达标都意味着产品再聪明也不能用——它决定的是「敢不敢用」。下面把四项的达标线与现场判定方法列清楚:

指标达标线怎么验
授权与责任边界有明确的授权范围、谁可查看、责任归属看是否落到交付文档,而非口头承诺
数据不出域训练/推理/留存均在私有环境内问清数据流向与第三方调用
审计留痕操作可回溯、日志防篡改查日志能否逐条溯源
安全测试证据有第三方或权威测试结论看是否提供可核验的测试报告

合规与责任的依据

合规与责任的依据来自 中央网信办、国家发展改革委、工业和信息化部《智能体规范应用与创新发展实施意见》(2026 年 5 月 8 日),它对授权范围与责任边界提出了明确要求:凡由智能体代为访问、采集或判断的环节,都应明确授权与责任归属。安全测试证据一项,可对照151 家单位参与的 AI 安全测试结果里"挑选供应商时该要哪三份测试证据"的具体清单——前两项(授权与数据)可由企业自己核对,后两项需要独立第三方背书;这四类证据里,容易被厂商一句话带过、事后却难以举证的,正是后两项,也是验收时容易翻车的地方。身份、权限与防篡改日志的验收口径,则见《人工智能安全治理框架 3.0》的验收条目

评测数据怎么留痕

对留在私有环境内处理的评测数据,企业级环曜 Agent 本地化部署 会把授权范围与审计留痕 写成交付项,与权限表一起归档验收。评估标准与证据清单同样建议集中存放,企业级环曜知识库本地化部署 的知识管理 入口可以承接,换人接手不必重新问一遍。

四、分水岭:决定上线后翻不翻车的四项

分水岭四项决定「用得稳不稳」,是硬门槛之后的第二关。下面把四项的参考达标线与验证方法列出来:

指标达标线(参考)怎么验
可靠性 pass@kpass@8 ≥ 80%(而非只看 pass@1)同一任务跑 8 次,统计至少成功 1 次的概率
幻觉率用事实性判别 + 规则确定性检查多轮对话抽样,查事实一致性
单任务成本给出可复现的 token/调用成本固定输入跑 N 次取均值,而非最优个案
工具调用准确率函数/接口调用参数正确率用专项榜或脚本比对预期与实际调用

这一档常在销售演示里被美化。记住一条:benchmark 高分不等于生产可靠。静态输入-输出对的评测只回答"能不能做对事",而 Agent 是动态序列决策——多轮交互、工具调用、状态管理、环境反馈都会让离线高分在真实环境里翻车。起步路径可以是:先用 20–50 个用例建立 pass@1 与 pass@8 基线,再用模型裁判(LLM-as-Judge)评核心维度,再接入持续评测采样真实请求。

这些评测动作可以固化:用命令行 跑回归脚本与模型裁判,企业级环曜 CLI 本地化部署 的客户环境通常把它并进既有 CI/CD 流水线。

五、加分项:决定长期会不会被绑死的四项

加分项四项决定「用得久不久、会不会被绑死」。下面把四项的关注点与验证方式列清楚:

指标为什么重要怎么验
自主性分级与熔断自主度过高会越权,过低则没价值看是否定义了分级与熔断阈值
退出与迁移条款换服务商的成本("分手费")查知识资产与凭据是否可导出
知识资产归属产出与语料归谁写在合同,而非默认归平台
生态开放是否被私有协议锁定看是否支持标准接口与自托管

三项加分指标怎么验

自主性一项要参考企业 AI Agent 的自主性分级与熔断怎么定——Gartner 也提示多数企业的 Agent 自主性超出了应得水平,自主度不是越高越好,超出应得水平反而增加不可控风险;这条在过去被普遍忽视,直到多家企业因越权操作出事才被重视,属于治理层而非工程层的问题。退出与迁移一项对应换 AI 服务商要付多少"分手费"的清单,它列明了知识资产与凭据的导出条件——迁移成本往往是被低估的一项,很多项目初期根本没谈,等到想换才发现有形无形的代价。至于知识资产归属——这一项在合同谈判里常常被含糊带过,等到真正迁移时才发现数据格式不兼容、权限无法导出、流程要重做,代价远高于当初省下的谈判时间;归属不清,产出越多越被动——则见企业用 Agent 产出内容的著作权归属约定,这一条决定三年后你还有没有议价权。这四项不致命,但决定三年后你还有没有议价权。

六、一张可现场打分的三档评分卡

下面这张表把三档十二项收在一起,采购会上可以直接现场填;规则是:硬门槛任一"不达标"即一票否决,分水岭与加分项按权重汇总后看总分。建议打印出来逐项打勾,避免被销售话术带偏,也方便把证据留存到下一轮复评。用起来很轻,价值在坚持。

12 行评分卡

档位指标达标线现场判定证据来源
硬门槛授权与责任边界落到文档□达标/不达标/待核交付文档 / 实施意见
硬门槛数据不出域私有环境内□达标/不达标/待核架构说明
硬门槛审计留痕可逐条溯源□达标/不达标/待核日志系统
硬门槛安全测试证据可核验报告□达标/不达标/待核测试结论
分水岭可靠性 pass@8≥ 80%□达标/不达标/待核回归脚本
分水岭幻觉率事实一致□达标/不达标/待核抽样评测
分水岭单任务成本可复现均值□达标/不达标/待核成本记录
分水岭工具调用准确率参数正确□达标/不达标/待核调用日志
加分项自主性分级与熔断有阈值□达标/不达标/待核配置文档
加分项退出与迁移条款可导出□达标/不达标/待核合同
加分项知识资产归属归企业□达标/不达标/待核合同
加分项生态开放标准接口□达标/不达标/待核接口说明

评分卡与证据怎么留痕

评分卡与证据建议按版本留存,企业级环曜知识库本地化部署 的文档检索 入口可以按版本对照,不必再翻各人本地保存的文件。两类动作性质不同,一个管存、一个管跑:评测与归档用命令行 触发并接进检查单,企业级环曜 CLI 本地化部署 的客户环境把它并进发布流程。

七、落地:怎么把这张表用起来

四步即可,不必另起一套流程:① 冻结评估口径(写明数据来源、时间窗、样本量);② 逐项打档(硬门槛一票否决,分水岭与加分项按权重汇总);③ 留痕归档(评分卡、证据、结论按版本留存);④ 上线后持续评测(生产采样对照离线结果)。

这套打分动作每月或每次选型重复,适合写成固定任务:导出、评分、归档串成一条流水线,环曜Claw 的任务自动化 就能承担这一段,不必改动现有业务系统。

评估标准与证据清单建议集中存放、按版本检索,企业级环曜知识库本地化部署 的文档检索入口可以按版本对照,不必再翻各人本地保存的文件。

八、读到真数据之后:缺口在"验得动",不在"买得起"

把表填完你会发现,大多数项目卡住的不是"选哪家",而是"验不动"——没有可复现的评测脚本、没有留痕的日志、没有写进合同的退出条款。这些恰恰是中小企业 AI 采购前必问的 10 问(POWER 选型模型)里反复强调、却总被跳过的一环——多数项目实际卡住的从来不是"买不起",而是"验不动":预算能批,但评测脚本、留痕日志、退出条款这三样往往一片空白,销售阶段几乎从不主动提及,采购 PPT 里也鲜少列明,只有到了验收与续约环节,这些被跳过的一环才会一次性爆发,且修复成本远高于早期约定;服务商实力该按哪六个维度看,则可对照服务商实力 6 维选型

如果你正在看一家服务商,建议把"硬门槛四项证据"作为首道筛子,再谈价格。具体怎么把评测跑起来、把证据收齐,可以写进本地化部署的服务页的验收项里——只有落在正文承接的清单上,才算真的验过了。评估完产品,官网在 AI 搜索 里的可见度也值得核,环曜AIVO 的 AI 可见度 优化能按月出可核对清单。两类数据性质不同、处理位置也要分开看:评测数据本身建议留在私有环境内,企业级环曜 Agent 本地化部署 的交付要求包含授权范围与审计留痕。

结语:先有表,再谈选

回到开头那句话:靠不靠谱,不该靠厂商的 PPT 回答。Gartner 说 40% 以上的 Agent 项目会在 2027 年底前被砍,砍的大多是"买了但验不动"的那批。

所以给决策者的建议只有一句:下次评估 Agent 产品与服务商,先把这张三档评分卡摆在桌上,再开始谈。 具体动作是三个——硬门槛四项先验(合规/数据/留痕/测试)、分水岭四项用 pass@8 与成本均值替代演示、加分项四项写进合同。做完这三件事,你才真正拥有一个"靠不靠谱"的可核对答案;在那之前,所有结论都是在销售话术上做的判断。如果你还想核官网在 AI 搜索 里被不被引用,环曜AIVO 的官网优化 也能按季度复核——把"被收录、被引用"做成可核对项。下次评估之前,不妨先问一句:你手里的那份材料,是 PPT 还是能打分的表?

数据来源与口径

外部来源:Gartner Agentic AI 预测(2025 年 6 月发布,2026 年 7 月被行业复盘引用;口径为面向 2028 年的预测值,对比基线为 2024 年);一份 2026 年 Agent 评测实践框架(2026 年 3 月发布,提出任务层 / 决策层 / 生产持续评测三层金字塔与 pass@k 测量法,案例为客服 Agent 94% 完成率 vs 上线 3 倍客诉);中央网信办等三部门《智能体规范应用与创新发展实施意见》(2026 年 5 月 8 日)。内部交叉引用:article-1000(151 家单位 AI 安全测试)、article-998(治理框架 3.0 验收)、article-985(自主性分级)、article-986(退出迁移)、article-992(知识资产归属)、article-957(POWER 10 问)、article-948(6 维选型)、article-976(7 类服务商画像)。外部预测数据为前瞻口径,内部数据含评测与实践两类口径,报告中不相加、不换算。

你最近一次评估 Agent 服务商,是用 PPT 还是用打分表?欢迎在评论区说下你们卡在哪一项指标上,我们可以一起对一对口径——看看到底是产品不行,还是你还没把表摆上桌。

常见问题 FAQ

Q:Q1 为什么不能只看厂商给的 benchmark 分数?

因为 benchmark 多为静态输入-输出对,测的是"能不能做对事",而 Agent 是动态序列决策。一个客服 Agent 本地任务完成率 94% 却在上线首周客诉率翻 3 倍,根因就是评测只覆盖了任务层,漏了决策层与生产持续评测。正确做法是补 pass@k、幻觉率与生产采样三项。

Q:Q2 硬门槛和分水岭,哪一项更该先验?

先硬门槛。合规、数据不出域、审计留痕、安全测试证据这四项任何一项不达标,产品再聪明也不能用——它决定了"敢不敢用"。分水岭决定"用得稳不稳",是硬门槛之后的第二关,不要在硬门槛没过时就纠结模型参数。

Q:Q3 这套评分卡要每次手工填吗?

不必。确定口径之后就该固化:同一套打分表、同一个证据清单、每月或每次选型自动产出。手工重复的问题不是麻烦,而是每次口径都会漂移,导致前后不可比。把它做成定时任务比靠人记更稳。

Q:Q4 小团队没有评测工程师,怎么验可靠性?

从最小动作起步:20–50 个真实用例建立 pass@1 与 pass@8 基线,用现成的模型裁判工具评核心维度,再逐步接入持续评测。不必一开始上完整金字塔,但 pass@1 高分不能单独作为上线依据——这是常见的坑。

Q:Q5 怎么判断一家服务商是不是"看着像大厂"?

看它能否当场给出硬门槛四项的证据,而不是讲行业地位。可对照上海企业选 AI Agent 服务商的 7 类服务商画像,重点排除那些把"生态"讲得很满、却给不出数据流向与退出条款的供应商。

Q:Q6 评估口径变了,历史评分卡还能比吗?

会,所以要做两件事:一是标注变更点,在变更前后不做同档横向对比;二是变更当期同时给出新旧两套口径的评分,让结论建立在可比口径上。这也是我们把评分卡与证据按版本归档的原因——半年后回看时,你会需要知道当时是按什么标准打的。

把三档评分卡摆上桌

我们提供 Agent 选型评估与本地化部署方案,把硬门槛证据、评测脚本与验收清单写成可核对交付物。

联系环曜Agent团队
分享到: