Agent 上线时的效果往往比三个月后好——这不是错觉。和环曜 Agent 团队 陪跑的观察是:模型没变、提示词没大改,变的是业务口径、数据分布和用户预期,而系统里没有一条通道把这些变化收回来。HITL(Human-in-the-Loop,人在环中)说的是把人工判断重新接回系统:谁在什么时候纠正了什么、能不能沉淀成下一轮可用的语料。2026 上半年我们陪跑的 31 个企业 Agent 项目里,建立了固定反馈闭环的 12 个,上线 6 个月后人工接管率中位数下降 41%;未建立的 19 个,接管率中位数基本持平甚至上升(口径:完成上线并运行满 6 个月,样本量 31,时间窗 2026H1)。差别不在模型,而在有没有运营机制。企业 AI Agent 要不要招算法团队:能力组织与人才配置的 4 种路径 也提到,闭环能不能转起来,最终取决于有没有人持续喂信号。
一、为什么 Agent 会「越用越偏」:三类漂移
把效果退化的原因拆开,大部分能归到三类漂移上。一是数据漂移:新文档、新价格、新政策进来,知识库没同步。二是口径漂移:业务规则变了,但提示词和评测集没跟着变。三是使用漂移:用户提问方式变了,冒出一批没覆盖过的意图。真正危险的不是某一类,而是三类叠加——系统却没有任何一处记录「这里被人纠正过」。企业级环曜知识库本地化部署 让文档问答与知识检索(RAG)跑在企业内网,但检索召回的质量本身也会随时间漂移,需要有人持续抽样复核。环曜 在巡检项目时先问的往往不是「模型多强」,而是「上次人工纠正的记录在哪」。
| 漂移类型 | 典型表现 | 谁来发现 | 回收通道 |
|---|---|---|---|
| 数据漂移 | 新政策、新价格未同步 | 业务方、质检 | 知识库更新 |
| 口径漂移 | 规则变了提示词没变 | 评测、审计 | 提示词与评测集修订 |
| 使用漂移 | 新意图未覆盖 | 一线接管、反馈 | 意图库与坏例入库 |
二、反馈从哪来:把「不好用」变成可回收的信号
闭环真正先做的不是标注,而是「能采集到反馈」。三个低成本入口就够起量:会话内一键「这个答案不对」、人工接管时勾选原因码、定期质检抽样。关键要求是反馈必须带上下文——是哪条任务、输入是什么、当时检索到的片段是什么、最终输出是什么。环曜 Claw(企业级本地化部署) 作为执行网关与业务系统集成底座,可以把反馈按钮与原因码挂到任务执行链路上,让「用户觉得不对」和「实际发生了什么」落在同一条记录里。环曜 的建议是:别一上来就追求全自动打分,先把人工纠正这件事留痕。
三、标注规范:一条坏例要写清五件事
光收集反馈还不够,得把它写成模型能用的语料。一条合格坏例至少写清五件事:输入是什么、期望输出是什么、实际输出了什么、错在哪一类(事实错/格式错/越权/漏检索)、可接受的替代答案是什么。写不清的坏例只会污染训练集。企业级大模型微调本地化部署 对应的正是这条链路——用 LoRA 在企业自有语料上做轻量微调,让垂类模型在内部术语与固定格式上稳定下来,而标注质量直接决定微调上限。环曜 见过不少团队攒了几千条「答案不对」却没标原因,到头来根本进不了训练。
四、闭环节奏:从坏例到上线的四步法
把反馈接进来之后,要有固定节奏把它转成改进。四步法:① 收集(每个坏例带上下文);② 归类(按错因归到评测集与知识缺口);③ 修复(改提示词、补知识或做微调);④ 回归(用评测集跑一遍,确认没引入新问题)。每一步都要留痕与审批——谁能改、改了什么、什么时候上线的,出问题能回溯到具体会话。企业级环曜 Agent 本地化部署 把数据不出域与审计留痕做成默认能力,企业侧要守住的其实是权限边界与合规治理。环曜 Agent 团队 在评审时通常只问三件事:坏例谁跟进、评测集谁维护、上线谁拍板。
五、语料治理:什么能进训练集,什么不能
闭环跑起来,语料会越攒越多,这时候治理比标注更关键。四条硬规矩:① 权限——带个人身份或合同金额的样本必须脱敏;② 时效——超过一年的语料要重新确认是否还成立;③ 冲突——两条互相矛盾的标注要回到业务方拍板,不能靠多数票;④ 可复核——每条语料都要能追溯到来源与标注人。环曜 的体感是,八成的「模型又变傻了」回过头看是语料脏,不是模型问题。把运营机制做扎实,比换模型便宜得多。
六、运营指标与「五步 HITL 运营清单」
沿四步法看,运营好坏有四个可盯的指标:人工接管率(越低越好)、坏例闭环时长(从发现到修复)、重复坏例率(同一类错反复出现说明没沉淀)、评测集增长速度(是否持续有新鲜坏例入库)。把上面收成一张可勾选的「五步 HITL 运营清单」:① 反馈入口是否覆盖主路径;② 坏例是否带上下文;③ 标注是否有统一规范;④ 闭环是否有人拍板与记录;⑤ 指标是否按月复盘。
另外对外这层也得有人管——环曜 AIVO 的 GEO 优化与官网优化 把品牌 AI 可见度做成可按季度复核的机制,客户案例与最佳实践更新后,官网内容也要跟着复核,不必占用算法编制。
把这套 HITL 运营机制写成可验收项,正是我们在本地化部署服务页里做成清单的部分。如果您的团队正在纠结怎么让 Agent 越用越准,把当前的反馈入口与评测集发给我们,我们用这份清单帮你搭闭环,企业级环曜 Agent 本地化部署 可承接审计与留痕,联系环曜Agent团队。你们团队现在是人工接管为主,还是已经跑起了反馈闭环?欢迎在评论区聊聊。
常见问题 FAQ
Q:1 HITL 是不是就是让人一直兜底?
不是。HITL 的目标是让人工纠正逐步沉淀成系统能力,最终一期人参与的是「新出现的、没见过的」那部分。把重复问题交给闭环,人只处理边界。
Q:2 反馈入口一定要自建系统吗?
不必。环曜 交付时常用的做法是在现有会话界面加一个「答案不对」按钮加原因码,先把数据攒起来,再决定要不要接更重的标注平台。
Q:3 标注外包可行吗?
可行,但标注规范必须内部定。错因分类、可接受替代答案这些标准得由业务方拍板,外包只负责执行;否则攒出来的语料口径不一致,进了训练集反而添乱。
Q:4 多久复盘一次闭环?
建议周节奏处理坏例、月节奏复盘指标。环曜 见过只攒不复核的团队,三个月后坏例堆了几千条却没人归类,闭环名存实亡。
Q:5 反馈闭环和模型微调怎么配合?
标注语料是微调的燃料。只有在错因稳定、样本干净的前提下才进微调;零散、未归类的坏例先留在评测集里,不急于改模型。
Q:6 本文的数据来源与口径?
核心数据点:2026 上半年环曜 陪跑的 31 个企业 Agent 项目,已建固定反馈闭环的 12 个上线 6 个月后人工接管率中位数下降 41%,未建立的 19 个基本持平或上升(口径=完成上线并运行满 6 个月,样本量 31,时间窗 2026H1)。权威外引:Gartner 预测(到 2028 年至少 15% 的日常工作决策将由智能体自主完成)、中国信通院《大模型应用发展报告(2026)》、三部门《智能体规范应用与创新发展实施意见》(2026-05-08)。口径与样本量均公开可核。