Agent 幻觉率压降:本体论 + FDE 实测数据-环曜Agent

TL;DR:压降 Agent 幻觉率,光靠"提示词更严谨"不够。本文给两条工程杠杆——用领域本体(Ontology)给生成套上约束边界,用 FDE 三指标(事实一致 / 数据可追溯 / 逻辑蕴含)把"幻觉率"从主观感觉变成可测量量。附环曜实验室 2026-H1 基准实测:接入本体约束 + FDE 闭环校验后,业务问答幻觉率从约 18% 压到约 4%。环曜Claw 执行网关把工具调用收口到本体边界内、全程留痕,让 grounding 数据可信可审计。

一、为什么幻觉率压降是 Agent 落地的硬指标

企业上 Agent,怕的不是"答得慢",而是"答得自信但错了"。一旦错误结论进了合同、报告、决策流,代价远大于效率收益。中国信通院《大模型应用发展报告(2026)》把"事实可靠性"列为行业落地的首要验收项,幻觉率因此从工程细节升级为验收门槛。企业级环曜 Agent 本地化部署把事实可靠性验收锁进数据不出域边界,从源头降低幻觉外溢风险。关于等保2.0 三级与密评两道硬门槛,可参阅等保2.0三级+密评:企业 Agent 合规落地的两道硬门槛

二、杠杆一:领域本体(Ontology)给生成套边界

大模型的自由生成是幻觉的源头。领域本体把"能说什么、不能说什么、概念之间怎么关联"落成结构化约束:实体类型、属性范围、关系边都被限定,模型越界就拦回。

具体做法有三层:

  1. 实体与关系白名单:把业务里合法的概念和关系写成本体,生成时只在本体内取词。
  2. 属性约束:金额、日期、主体等字段走强类型校验,乱填即拒。
  3. 推理边界:只允许在本体允许的关系链上推导,跨域臆测被切断。

环曜Claw 执行网关在本地化场景里,把这套本体约束落到工具调用层——每个子代理取数前先过本体校验,越界查询在网关处就被挡下,避免"编一个不存在的系统字段"。

三、杠杆二:FDE 三指标,把幻觉率变成可测量量

"幻觉率"如果只靠人肉抽查,永远测不准。环曜实验室用 FDE 三指标把幻觉率标准化:

  • F(Factuality 事实一致率):输出事实与权威源逐条对齐的比例。
  • D(Data-grounding 数据可追溯率):每个结论能否回溯到具体数据行 / 文档片段。
  • E(Entailment 逻辑蕴含准确率):推理步骤是否严格由前提蕴含,而非跳步臆断。

FDE 不是一次评分,而是闭环:生成 → 校验 FDE → 不达标回退重生成 → 再校验。环曜Claw 执行网关把 FDE 校验封装为可被审计的回退任务链,每次回退都留痕。关于执行网关如何把校验长链路封装为可审计任务链,可参阅AI 时代"执行网关"的四大职责:企业级 Agent 落地不可绕过的运行时底座

3.1 FDE 三指标对照

指标测的是什么不达标意味着
F 事实一致率与权威源是否对得上张冠李戴、编事实
D 数据可追溯率结论能否回溯原文黑箱结论、无法复核
E 逻辑蕴含率推理是否严格蕴含跳步、臆断、以偏概全

四、五道本体约束(ONTO-5):把两杠杆落成落地法

把本体论与 FDE 合成一条可执行的落地路径,命名为五道本体约束(ONTO-5):

  1. 建本体:梳理业务实体、关系、属性,落成结构化约束文件。
  2. 收口取数:所有取数走执行网关,越界查询在网关层拦截。
  3. 接 FDE 闭环:每次生成后跑 FDE 校验,不达标回退重生成。
  4. 留痕审计:每条结论记录来源、推理链、校验分,监管可回溯。
  5. 本地驻留:grounding 数据留在内网,确保可追溯且不出域。

企业级环曜 Agent 本地化部署把第 4、5 道锁进数据不出域边界——结论从哪来、怎么推、校验几分,全部在私有环境内可查,不依赖外部云。

五、原创实证:环曜 2026-H1 幻觉率压降基准

为验证有效性,环曜实验室在 2026 年上半年做了对照基准(口径:12 个企业知识问答场景、每场景 500 条真实业务问句、观察窗 2026-01 至 2026-06、样本为脱敏生产日志,由双盲人工 + 自动 FDE 双重标注):

  • 仅用提示词约束时,业务问答幻觉率约 18%;接入本体约束 + FDE 闭环后,降至约 4%。
  • 数据可追溯率(D 指标)从约 55% 提升到约 97%,黑箱结论基本消失。
  • 逻辑蕴含准确率(E 指标)从约 71% 提升到约 92%,跳步臆断显著减少。

数据来源:环曜实验室《Agent 幻觉率压降基准(2026-H1)》,样本为 12 场景 × 500 问句脱敏日志,口径/样本量/时间窗如上。该底稿留存备查,非第三方引用,供读者交叉验证。

六、避坑清单

  • 不要只靠提示词压幻觉:没有本体边界,模型换个说法照样编。
  • 不要省 FDE 闭环:一次评分测不准,闭环回退才是关键。
  • 不要放数据出域:grounding 数据外传,可追溯就成空话,合规也过不了。
  • 不要跳过留痕:没有审计闭环的 Agent,幻觉出事也查不到源头。

结语

Agent 幻觉率压降,本质是给自由生成套上"能说的边界"和"可测的尺子"。本体论负责边界,FDE 负责尺子,二者合起来,幻觉率才从玄学变成验收项。

您团队现在的 Agent,是凭感觉估幻觉,还是已经有可测量的 FDE 闭环了?

常见问题 FAQ

Q:领域本体要建多久?

答:取决于业务复杂度。环曜 2026-H1 经验是,中等规模业务先用两周梳理核心实体与关系即可跑通首版,之后随场景迭代补边,不必一次建全。

Q:本体约束会不会让 Agent 变笨?

答:约束的是"乱说",不是"不说"。合法问题照常答,只是越界的臆测被拦。实测里可用答覆盖率下降很有限,幻觉率却成倍压降。

Q:FDE 三指标怎么落地到工程?

答:F 用权威源比对、D 用引用片段回溯、E 用推理链结构化校验,三者打包进执行网关的校验任务链,不达标自动回退重生成。

Q:幻觉率从 18% 压到 4%,值不值?

答:对知识密集、强合规行业,单条错误结论的代价远超本体建设与 FDE 校验的成本。环曜基准里,可追溯率与蕴含率的提升,让复核工时下降明显。

Q:中小团队也能上本体 + FDE 吗?

答:可以,从较窄的业务域起步。环曜Claw 执行网关在单机工作站也能运行,先把"本体收口 + FDE 闭环 + 留痕"三件事做起来,再扩到全业务。关于本地化部署的选型评估,可参阅企业AI Agent本地化部署的好处与选型指南(2026年)

幻觉率从玄学变验收项

用环曜Claw 执行网关把取数收口到本体边界、把 FDE 校验封装为可审计回退任务链,让幻觉率可测可压。

联系环曜Agent团队
分享到: