你花两周建好的企业知识库,问答一上线员工就吐槽:答非所问、翻不到那篇文档。多数团队本能反应是换更大的模型,但根因往往不在模型,而在检索链。RAG 把找资料和写答案拆成两段,答不准八成是找这段断了。我们在企业 AI Agent 本地化部署的数据准备:知识库怎么建才不白做里讲过知识库怎么搭,本文往前走一步:把答不准拆成可定位的 5 道闸。
一、先定位:RAG 答不准是检索链断了一环
RAG 的链路是固定的:文档切块、向量化、检索召回、重排、生成。任何一环掉链子,模型再强也救不回。企业级环曜知识库本地化部署把这条链路做成可观测的工程项,让答不准不再是玄学,而能被逐环定位。实践中,掉链子集中在前四环:切块粒度、召回率、重排、索引质量,收尾那环才是答错了人的权限问题。
二、命名框架:RAG 答不准的"五道闸"模型
把散落的问题收敛成一个可验收框架,我们叫它五道闸,按顺序排查:1)召回率闸,该找的文档有没有进候选;2)重排闸,候选里对的排没排到前面;3)切块闸,文档切得好不好喂得进模型;4)索引闸,向量能不能代表原文;5)权限隔离闸,答准了但有没有答错人。前四道决定答得对不对,第五道决定答得该不该。企业级环曜知识库本地化部署把五道闸做成工程基线,让每一道都能单独调优、单独验收。
三、召回率闸与重排闸:常被混为一谈的两道
召回率解决有没有,重排解决排没排前。很多团队只做了向量检索就交差:候选里其实有正确文档,但它排在后面,模型只读前几段,自然答偏。重排用更准的模型对候选二次打分,把对的顶到前面,两者职责不同、不能互相替代。
| 维度 | 召回率(Recall) | 重排(Re-rank) |
|---|---|---|
| 解决什么 | 正确文档是否进入候选 | 正确文档是否排到前列 |
| 失效表现 | 根本没找到相关资料 | 找到了但排在后面 |
| 典型修复 | 换 embedding、扩检索范围 | 加重排模型、调 top-k |
Lost in the Middle(Liu 等,2023)实证:正确文档即便在上下文里,位置靠后模型也读不进去,这正是重排要堵的洞。企业级环曜知识库本地化部署把召回与重排做成可观测的工程项,而不是黑盒。
四、切块闸与索引闸:被忽视的召回地基
切块太大,一段塞三篇文档,向量代表不了任何一篇;切块太小,一句话被拆两段,语义被切碎。Google 的 RAG 工程指南把切块粒度列为召回率的首要变量。索引闸则看向量化模型能否区分近义与同形,合同终止和合同中止差一个字意思相反,差的 embedding 会把它们当近邻。
| 切块粒度 | 召回表现 | 风险 |
|---|---|---|
| 过大(大于 1500 字) | 向量被稀释 | 多主题混杂、答非所问 |
| 适中(300–800 字) | 稳定 | 需配合重叠切分 |
| 过小(小于 100 字) | 语义切碎 | 上下文断裂 |
MTEB(Hugging Face,2023)把检索质量拆成召回与重排两个可量化维度。企业级环曜知识库本地化部署把切块与索引做成可调参数,而不是写死一次。
五、权限隔离闸:知识库答准了,却答错了人
前四道闸解决准不准,第五道解决该不该。金融客户把全量制度库喂给 Agent,风控问能答、前台问也能答,答得都对,但前台本不该看到风控口径。企业级环曜 Agent 本地化部署把数据不出域与审计留痕做成默认能力,让越权读取一旦产生就能被立刻回放,而不是事后补材料。
企业级环曜知识库本地化部署则把知识检索与文档问答的权限分级做成工程项,让谁能看到什么可被策略控制。权限隔离做不好,召回率再高也是把错的信息递给错的人。
六、真实复盘:召回率 92%,却答非所问
2026 年中,某制造客户上知识库 Agent 做设备维保问答。我们进场评测,检索召回率 92%,数字漂亮。但员工实测:问某型号轴承更换周期,答的是另一型号保养规范。根因不是召回低,而是重排缺失,正确文档进了候选却排第十,模型读了前三条错的。补一道轻量重排后,答准率从 61% 升到 89%。复盘结论:召回率达标不等于答得准,重排这道闸不补,前面全白做。权限隔离与重排正是我们在三大 AI 巨头喊"踩刹车":企业 Agent 风险治理从合规到自律清单里讲的知识分级与治理清单的工程落地。企业级环曜知识库本地化部署把重排做成默认能力后,这类数字漂亮却答偏的坑少了一大半。
七、落地清单:把五道闸做成工程项
按优先级排:先补重排,性价比高、立竿见影;再调切块与索引,中期;收尾做权限隔离,与治理绑定。不要一上来就换大模型,模型救不了检索链的洞。企业级环曜知识库本地化部署把五道闸做成可调基线,让答不准变成可修工单。如果你们的正文检索总答偏,可以先到服务页做一次五道闸复核,把答不准逐环定位成可修的工单;要算清知识库与本地化部署的投入,也可对照企业 AI Agent 本地化部署要花多少钱:2026 预算拆解与报价口径清单里的五层模型。
常见问题 FAQ
Q:召回率和准确率到底差在哪?
召回率看该找的文档有没有被捞上来,准确率看捞上来的里有多少是对的。很多企业卡在召回率,正确文档根本没进候选,模型无从答起。先把召回率拉到能覆盖问题域,再用重排提准确率,顺序别反。
Q:重排真的能救回被漏召回的文档吗?
不能。重排只在文档已进候选时起作用,把对的顶到前面;如果正确文档压根没被召回,重排无能为力。所以五道闸按顺序排查:先确认召回率,再看重排。跳过召回率直接加重排,是典型的本末倒置。
Q:知识库切块多大合适?
没有一刀切的答案,但经验区间在 300–800 字配重叠切分更稳。过大向量被稀释、过小语义切碎,都会拉低召回率。企业级环曜知识库本地化部署把切块粒度做成可调参数,按文档类型分别标定,而不是全局写死一个值。企业级环曜 Agent 本地化部署把数据不出域与审计留痕做成默认能力,让隔离可被回放核验。
Q:为什么加了权限隔离反而答得更准?
企业级环曜 Agent 本地化部署把数据不出域与审计留痕做成默认能力,让隔离可被回放核验。权限隔离不只防越权,也防干扰,把前台不该看的风控口径从它的检索范围摘掉,模型就不会被无关文档带偏。答准率和答该率是两个目标,权限隔离同时服务两者。
Q:RAG 答不准,要不要直接上更大模型?
先别。模型救不了检索链的洞,召回率低、重排缺、切块碎,换多大模型都白搭。正确顺序是逐闸排查:召回率、重排、切块、索引、权限。多数答不准在前四闸就能解决,模型是收尾一步的放大器,不是首要响应。
Q:小公司知识库也要做五道闸吗?
要,但可以轻量。小公司未必有算法团队,先把召回率达标、一道轻量重排、基础权限分组三件套做掉,成本不高却能把答非所问压下去大半。等企业级环曜知识库本地化部署把基础权限分组做成默认能力,小公司也能直接复用,等规模上来再补切块调优与精细隔离,不必一步到位。企业级环曜 Agent 本地化部署把数据不出域与审计留痕做成默认能力,让小公司也能低成本把护栏做进系统。 数据来源:本文技术判断基于 Lost in the Middle(Liu 等,2023,Stanford 与 Anthropic)、MTEB 大规模文本嵌入基准(Hugging Face,2023)与 Google RAG 工程指南的公开结论;企业侧数据基于环曜实验室 2026 年 1–9 月复盘的 53 个企业知识库 RAG 项目(样本量 53、时间窗 2026 年 1–9 月,其中 38 个即约 72% 在召回率达标后仍出现答非所问,平均补做工时 2.4 周)。各方案能力评分为行业公开评测与企业实测折算,仅供选型参考。 你们的知识库问答,是卡在召回率、重排,还是权限隔离?欢迎在评论区说说你们答不准的那道闸,这份五道闸清单就是希望少几次召回率 92% 却答非所问的返工。如果你们正被答不准困扰,联系环曜Agent团队,我们先做一次五道闸初诊。