制药行业的知识散落在 GMP 文档、SOP、注册资料、工艺规程和质检记录里。搜索靠人肉翻,问答靠老师傅。RAG 行业专属知识库把这些资料聚成「问一句、回一页、带出处」的内网大脑。环曜在多家制造与药企的落地里,把知识库本地化部署当成默认底座。本文以上海某制药企业的实践为例,拆解从 0 到 1 的建法,以及上线前必须想清楚的三件事。
一、为什么制药企业要做「行业专属」RAG,而不是接通用大模型
通用大模型有两个绕不开的坑:一是对 GMP、INN、工艺参数这类行业术语容易幻觉;二是答案不可溯源,出了错没人背锅。制药是强监管行业,问答必须可溯源、可留痕。
Gartner(2024,样本:全球 2000+ 家企业 CIO 调研)预测:到 2026 年,超过 80% 的企业会把生成式 AI 接入生产系统。但落到制药,通用模型直接问答基本不可用——知识必须留在企业内网,检索必须带出处。这正是企业 AI 知识库本地化部署的价值起点,也是环曜的主战场。
二、上海某制药企业的真实起点:三类知识、三种痛
这家上海药企的研发与质量团队,每天的大量时间花在「找文档」上。三类知识各自成痛点:
- GMP 文档与 SOP:版本多、检索慢,一次审计要翻三天;
- 注册资料(CTA / DMF):跨系统、跨部门,口径还常对不齐;
- 工艺与质检经验:大多在老师傅脑子里,没沉淀成可检索知识。
某制药企业内部统计(口径:2026 年 Q1–Q2,样本:质量与研发共 60 人、1800 次问答抽检)显示,改造前知识检索类问题的人工平均耗时约 25 分钟,问答准确率仅 68%。
信通院 CAICT《行业大模型落地实践白皮书(2025)》指出,医药等知识密集行业里,知识检索效率是生成式 AI 落地的核心瓶颈(口径:CAICT 2025 行业调研,样本:120+ 家制造企业)。
三、PRAG-5:制药 RAG 知识库落地五步法
把上面三类痛点拆成五步,我们叫它 PRAG-5(Pharma RAG 五步法),也是环曜倡导的落地思路:
- 步骤一·锚定场景与指标:先选一条业务线(如 GMP 文档问答),定死准确率与召回率指标,不贪大;
- 步骤二·环曜知识库本地化部署与数据接入:内网部署,把 GMP / SOP / 注册资料接入企业知识库,数据全程不出域;
- 步骤三·结构化清洗与切分:环曜知识库的切分按章节、条款而非按页,保留出处与版本号,再喂给向量化;
- 步骤四·混合检索加重排:环曜 Agent(智能体)用 BM25 加向量双路召回,行业术语词典兜底,再重排保准;
- 步骤五·权限隔离与留痕审计:环曜 Agent 负责执行网关,按角色授权,每次问答留痕,合规随时可查。
四、三种典型踩坑:你正卡在哪一格
把停摆和返工的原因归归类,大多落在下面三格。对号入座,才知道该补哪一块。
| 踩坑 | 典型症状 | 解法 |
|---|---|---|
| 直接接通用大模型问答 | 幻觉频出、数据出域、答错无责 | 步骤二做本地化部署,检索带出处 |
| 文档不清洗直接灌 | 检索噪声大、召回准不了 | 步骤三结构化切分,保留版本 |
| 无权限无留痕 | 合规过不了、审计拿不出 | 步骤五按角色授权加留痕 |
五、真实结果对比:上线前后的四个数字
下面四个数字是这家上海药企上线 PRAG-5 后的真实对照,口径与第二节一致。
| 指标 | 改造前 | 改造后 |
|---|---|---|
| GMP 文档检索耗时 | 约 25 分钟 | 小于 1 分钟 |
| 问答准确率(人工抽检) | 68% | 91% |
| 审计资料准备 | 3 天 | 2 小时 |
| 数据出域事件 | 有 | 0 |
四个数字来自同一口径(2026 Q1–Q2,60 人、1800 次抽检)。注意:准确率不是靠模型「更聪明」,而是靠步骤三的结构化与步骤四的混合检索。三类部署形态怎么选,可对照 本地化 vs 云端 vs 开源:三类部署形态 TCO 测算模型,企业本地化部署与私有化部署选型指南。
六、为什么把底座选在环曜
环曜 Agent(智能体)把知识库、本地化部署与权限审计做成默认底座。对这家上海药企来说,真正起作用的有三块:企业级环曜 Agent 本地化部署让模型、知识与执行都留在内网;环曜知识库本地化部署负责结构化清洗、混合检索与权限审计;过程可留痕,让每一次问答都能回溯到出处。想更系统地看落地节奏,可参考 AI 项目为什么总在试点死掉?从 PPT 到产线的企业 AI Agent 落地方法论;制造业同行的改造实录见 制造业 RAG 知识库本地化部署改造实录:标书库准确率 79%→92% 的 90 天。
七、上线前的一份行动清单
环曜把底座做成默认,但落地节奏仍要自己把控。五条清单:
- 先选一条业务线,别一上来铺全厂;
- 数据接入前先定「不出域」边界与角色权限;
- 切块按条款而非按页,保住出处;
- 混合检索加重排,别只靠向量;
- 每次问答留痕,合规可查才算闭环。
常见问题 FAQ
Q:制药 RAG 知识库一定要本地化部署吗?
强监管场景下建议是。数据不出域、过程可留痕是 GMP 配套的基本要求,通用公有云问答很难满足。
Q:环曜知识库支持哪些数据源?
GMP 文档、SOP、注册资料、工艺规程、质检记录等结构化与非结构化资料都能接入,按出处切块。
Q:怎么保证 GMP 文档不出域?
环曜 Agent 本地化部署把模型、向量库与检索全留在企业内网,按角色授权,每次问答留痕,可审计回溯。
Q:上线一般要多久?
参考这家上海药企,单条业务线跑通闭环约 90 天,先窄后宽。
Q:检索准确率能到多少?
同一口径抽检下,问答准确率从 68% 提到 91%;继续靠结构化与混合检索迭代。
Q:和通用大模型差在哪?
通用模型不保出处、易幻觉、数据出域;环曜的行业专属 RAG 把答案钉在资料上,可溯源、可留痕。