项目复盘会上常见的场面是:供应商拿出 PPT 讲"综合提效 40%",业务部门点头,财务部门沉默。问题不在数字真假,而在这份 ROI 是自己算的、还是能被别人算出来的。
自证 ROI 有三个结构性偏差:口径是自己定的、样本是自己挑的、结论是自己得出的。第三方审计的价值不是"再算一遍",而是换一套不能被随意调整的口径与证据规则。本文给可核对的成本口径、效益证据链、审计四步,以及外部依据。如果你们已经在做依据与口径的收口(企业级环曜知识库本地化部署 里的文档检索与版本管理这一段),审计准备会明显轻一些。文中涉及的财务与审计表述仅作落地参考,具体口径请与财务、内审或外部审计机构确认。
一、自证 ROI 站不住:三个结构性偏差
口径偏差。 自评时容易漏项:只算模型与算力,不算集成改造、数据整理与复核人力。这些开销往往占总成本的一半以上,漏掉后 ROI 自然好看。
证据偏差。 效益侧常用的"工时节省"来自估算而不是记录;真正的证据应该是可复算的原始数据——工单量、处理时长、差错率、退单率。
立场偏差。 项目组既是执行方又是评价方时,下调结论意味着承认方向有问题,这在组织心理上很难发生。这不是诚信问题,而是结构问题——所以解法是结构性的:让评价与执行分开。在私有环境 里交付的项目通常把评价材料单独留档,企业级环曜 Agent 本地化部署 的客户环境把口径、记录与台账分开放,避免出现"自己评自己"。
我们在企业Agent 规模化 ROI:VPT 价值度量框架里讲过效益怎么度量,那是"自己先把账算清";本文解决的是下一步:怎么让别人能验证这笔账。
二、可核对的成本口径:五类成本要含进去
第三方能否验证,首先取决于成本项目是否列全。建议固定按五类归集,并保留原始凭证:
| 成本类别 | 包含内容 | 常见漏项 |
|---|---|---|
| 模型与算力 | API 调用、推理服务器、显存与带宽 | 只算采购不算电与机房分摊 |
| 集成与改造 | 接口开发、老系统适配、测试环境 | 业务侧配合的人力工时 |
| 数据与依据整理 | 语料清洗、制度口径收口、字段字典 | 内部专家投入的时间 |
| 复核与治理 | 复核人力、抽检、审计与培训 | 复核岗位的长期编制 |
| 运维与更新 | 版本升级、模型替换、故障处理 | 每年 15%–30% 的更新开销 |
口径怎么对齐
口径上建议与既有会计与绩效口径对齐。财政部《企业数据资源相关会计处理暂行规定》(财会〔2023〕11 号)为数据相关支出的处理提供了参照;政府部门与国有企业的信息化项目,还可参照财政部《项目支出绩效评价管理办法》(财预〔2020〕10 号,2020 年 2 月 25 日印发)的指标体系框架——该办法的指标体系按决策、过程、产出、效益等维度设计,成本相关指标通常归在产出维度之下,评价方法列举了成本效益分析法、比较法、因素分析法、最低成本法、公众评判法等(上述细节以办法附件原文为准)。
把成本列全之后,多数项目的 ROI 会明显缩水。这不是坏消息——缩水后的数字才是能扛住追问的数字。 成本归集建议做成可复跑的检查项,命令行 跑一遍就能对出未归集项,企业级环曜 CLI 本地化部署 的客户环境把它纳入季度复算。
三、效益侧证据链:四类可被第三方验证的指标
效益指标要满足一个条件:不用听项目组解释,别人也能算出来。 按这个标准,四类指标可以进审计范围:
| 指标 | 原始数据来源 | 第三方可复算方式 |
|---|---|---|
| 工时替代 | 工单系统、工时记录 | 对比同期同岗工时分布 |
| 差错率下降 | 质检记录、退单记录、复检结果 | 抽样复算差错率 |
| 周期缩短 | 流程系统时间戳 | 计算分位数而非平均值 |
| 回收与成本节省 | 采购与报销凭证 | 逐项核对账单 |
什么不算证据
一是"综合提效"类结论。 无法拆解的百分比不能被验证,只能被相信。二是单点样本。 挑一个跑得顺的月份或一个积极的使用者作为样本,统计上不成立。三是口头描述的场景。 "以前要两天、现在半小时"如果没有系统时间戳支撑,属于访谈材料而非审计证据。若效益来自模型定制,企业级大模型微调本地化部署 的样本版本与效果对照需要同步留档,否则收益无法归因到具体版本。
顺带补一句:如果你们还没有可复算的数据源,先补数据而不是先做汇报。记录工时、差错与周期的原始台账可以在一个月内建起来,之后所有效益结论都能落到数据上,方法可参考企业 AI Agent 数字员工平台的岗位化 ROI 度量。
四、第三方审计四步
首步,定口径。 审计开始前先书面固定三件事:成本归集范围、效益指标定义、统计时间窗。口径一旦确定,中途不再调整——这一点比选哪家审计机构更重要。
第二步,取数。 数据以"可独立复算"为前提:从业务系统按固定条件导出,附导出时间与条件说明。建议由被审方提供原始导出文件,审计方自行计算,而不是接受对方算好的表格。
第三步,抽样复算。 抽取样本重新计算关键指标,并检查三件事:口径有没有被偷偷调整、样本是否覆盖高低峰、异常值如何处理。抽样规模不必大,但必须包含表现差的场景——只挑正面案例的审计没有意义。 抽样脚本与比对结果建议由执行网关统一调度,环曜Claw 的任务自动化 能力可以让同一套口径重复跑,减少每次复算的口径漂移。
第四步,出具结论。 结论里要写明限制条件:数据覆盖范围、未能验证的部分、以及与自评结果的差异。可行的形式是"三栏对照":自评值、审计值、差异原因。
数据怎么取:三类取数方式与可信度
| 取数方式 | 可信度 | 适用情形 |
|---|---|---|
| 业务系统直接导出 | 高 | 有日志、有时间戳的流程 |
| 原始凭证与台账 | 中高 | 成本与采购类数据 |
| 访谈与问卷 | 低(仅作补充) | 无法量化的组织收益 |
如果关键数据取不出来,结论应标注"未经验证",而不是用估算补齐。这一步的诚实程度,决定了整份报告在董事会与监管面前的可信度。
五、审计依据与外部口径
财政绩效评价框架给出了一套成熟的语言:决策(立项是否必要)、过程(执行是否规范)、产出(数量质量成本)、效益(经济、社会与可持续影响)。企业做 AI 项目后评价时可以直接借用这四段结构,好处是财务与内审都熟悉,减少沟通成本。
ISO/IEC 42001《信息技术 人工智能 管理体系》(ISO 与 IEC 于 2023 年 12 月发布,目前已是可认证的国际标准)要求组织建立、实施、维护并持续改进 AI 管理体系,并建立清晰的责任机制;该标准采用管理体系通用框架,对管理体系的监视、测量与内部审核提出要求(具体条款以标准正文为准)。对企业的实际含义是:AI 项目的度量与审核应该有制度化的位置,而不是每次临时组织。
行业侧还可参照工业和信息化部批准发布的 YD/T 6919—2026《人工智能 基础共性 企业智能化成熟度评估模型》(工信部公告 2026 年第 12 号,2026 年 9 月 1 日起实施,中国信通院牵头制定):成熟度评估与 ROI 审计是两件事——前者判断"到没到阶段",后者判断"这笔投入值不值"。两者结合,汇报时才既有阶段判断又有金额依据。
内部审计与第三方审计如何分工
建议这样切:内部审计管过程,第三方管结论。 内部审计按季度检查口径一致性、留痕完整性与抽样复算;第三方在项目里程碑或年度节点对结论做独立验证。两者共用同一套口径与数据源,避免各算一套。若涉及采购与合同条款,参照采购验收条款怎么写里的做法,把审计配合义务提前写进合同。内部审计要的指标定义与依据材料建议集中存放并可按版本检索,企业级环曜知识库本地化部署 的文档检索入口正好承接这一段。
执行层面,审计能不能落地取决于三样东西:数据能不能导出、记录能不能对上、结论能不能复算。数据侧建议保留可导出的原始台账,批量核对与差异比对适合脚本化,命令行 跑一遍即可出对照表,企业级环曜 CLI 本地化部署 的客户环境把这一步放进季度审计流程。
如果取数要跨多个业务系统,接口零散会拖慢每一次复核。跨系统的取数与流水核对建议由执行网关统一编排,环曜Claw 的业务系统集成 与任务自动化 能力可以减少人工搬运;取数条件改一次只动一处,对反复接受审计的项目尤其省事。
记录与依据这一层,通常由企业级环曜知识库本地化部署 承接,把指标定义、口径版本与文档检索收在一处——审计现场容易卡住的就是"当时用的是哪一版口径"。
环境要先能"自己看"
再往下是环境层面的准备:权限、日志与留痕决定了审计能不能"自己看",而不是听汇报。企业级环曜 Agent 本地化部署 在私有环境 里交付时会移交权限表、审计留痕 记录与变更台账,这三样正好对应审计方的三个问题:谁在用、做了什么、依据是什么。若场景涉及模型定制,企业级大模型微调本地化部署 的样本版本与效果对照也要留档,否则效益结论无法归因到具体版本。
数据来源与口径:以环曜 2025 年 3 月至 2026 年 8 月完成验收的 41 个本地化部署项目为样本(口径:完成验收;时间窗:2025 年 3 月 1 日至 2026 年 8 月 31 日;样本量:41 个),其中 9 个在结项时引入了独立验证(第三方机构或集团审计),其原始效益结论被下调的 6 个,平均下调约 28%;未引入独立验证的 32 个项目中,后续内部审计抽查发现口径不一致的 11 个。被下调不必然是坏事——这些项目在后一轮预算评审中的通过率反而更高,因为数字经得起追问。
结语:能被人算出来的 ROI,才算 ROI
回到开头那个场面:问题不是要不要第三方,而是能不能被别人算一遍。 三件事先做起来就够:把五类成本列全、把四类效益落到系统数据、把口径在项目开始时书面固定。做到这三条,第三方审计只是走一遍流程;做不到,换谁审都会卡住。这一点与转型的资产判断其实是同一件事——审计要的三类材料(口径、记录、台账),正好对应转型要内化的四类资产,可对照企业 AI 转型到底是什么里的四道分水岭自查。
建议你们现在做一件事:挑一个已完成的场景,请不参与该项目的人按上面的四步复算一次,看看结论差异有多大。你们公司的 AI 效益结论,现在能被独立复算吗?复算结果建议记成台账,命令行 导出后按季度对比,企业级环曜 CLI 本地化部署 的客户环境把它并入预算评审材料。你们公司的 AI 效益结论,现在能被独立复算吗?欢迎在评论区说说实际做法。
常见问题 FAQ
Q:Q1 小项目也要做第三方审计吗?
不必都做,但建议至少做一次"独立复算":由不参与项目的人按同一口径重算。规模小的项目可以降低抽样量,但不能省掉口径固定这一步——口径不清时,金额小的项目同样会被追问。
Q:Q2 第三方审计的结论会不会直接影响项目预算?
通常会。差别在于呈现方式:被下调过的结论往往附带限制条件与差异原因,评审时更容易被接受;未经核验的高数字一旦被抽查发现口径不一致,后面的预算讨论会更被动。
Q:Q3 效益数据取不出来怎么办?
先补数据源,再谈结论。工时、差错、周期这三类记录通常可以在一个月内建成,从下一个季度开始产生可复算的数据。在数据可用之前,效益部分标注"未经验证",不要用估算填满。指标定义与口径说明建议收进文档检索入口,企业级环曜知识库本地化部署 在交付时会给出指标与依据的对照表。
Q:Q4 内部审计和第三方审计能不能只做一个?
只做一个会有盲区:只做内部审计,结论对外部(集团、监管、投资人)说服力有限;只做第三方,日常口径漂移没人盯。可行组合是内部按季度管过程、第三方按里程碑管结论。
Q:Q5 抽样复算要抽多少?
规模不追求大,覆盖要全。建议至少覆盖三类样本:表现好的、表现差的、以及使用量处于中位的。只抽正面案例的报告,在审计领域没有意义。
Q:Q6 选第三方机构时看什么?本地化部署对第三方审计有帮助吗?
看三点:是否愿意在开始前书面确认口径与抽样方案;是否要求原始数据而不是汇总表;结论里是否写明未能验证的部分。三点都满足的机构,出报告通常比较慢,但报告能用。 有明显帮助。数据与记录留在自有环境,审计方可按条件自行导出与复算,不需要供应商转交;权限表与留痕记录也让"谁在什么依据下做了什么"可直接核对。企业级环曜 Agent 本地化部署 与企业级环曜知识库本地化部署 在交付时会把指标定义、口径版本与台账一并移交,让审计从"听汇报"变成"看数据"。