医药企业想把药典、注册资料、SOP 和内部制度做成能问答的 AI 知识库,几乎都会卡在同一个地方:业务要问得快、答得准,质量与合规部门却要问一句「出了事怎么举证」。药典和已公开的注册信息进知识库阻力较小;一旦牵扯患者数据、临床原始资料与未公开工艺,问题立刻升级为 GxP 留痕与数据不出域。本文按医药客户高频问到的顺序,把这两条硬线拆开,给出一套可对照的验收清单。
先说结论:医药知识库要同时满足的两条硬线
先把结论摆前面,方便你直接拿去和团队对齐。合规硬线,是 GxP 与计算机化系统要求下的可追溯——谁在什么时候查了什么、改了什么、导出了什么,都能还原;安全硬线,是患者数据与未公开注册资料不出内网。两条线并不冲突,但要求知识库在部署形态与日志设计上同时做对。
据国家药监局《药品生产质量管理规范(GMP)附录:计算机化系统》的要求,涉及产品放行与质量决策的计算机化系统须具备审计追踪、权限控制与数据可靠性保障;《中华人民共和国个人信息保护法》(2021)则对个人信息的收集、使用与跨境流动划出边界。这两份文件,是医药知识库绕不开的两个基准。
换句话说,医药知识库不是「能不能答」的问题,而是「答得准、查得到、出不去」三件事要一起成立。企业级环曜知识库本地化部署在医药项目里的定位,正是把这三件事收在一套私有环境内——这也是后面 GXP-6 清单的由来。
哪些资料能进 AI 知识库,哪些要先分级
先分类再入库,是医药项目少走弯路的关键。实践中大致三档:
- 可公开档:药典、公开法规、行业指南、已公开的注册信息——进库阻力较小,重点在版本与时效。
- 内部受控档:SOP、内部制度、培训资料、验证文件——可进库,但必须带权限与审计。
- 敏感档:患者数据、临床原始资料、未公开工艺与配方、注册申报原始件——原则上限定在内网,按最小必要授权。
分级的价值在于,它决定了每类资料该配什么权限、留什么日志。不少医药企业初次做知识库,失败点就在「一锅端」:把三档资料放进同一个空间,结果合规部门不敢用、业务部门嫌难用。企业级环曜知识库本地化部署在接入阶段会先把分档与权限对应起来,再用 RAG(检索增强生成)做文档检索与问答;分档的具体做法,可参阅企业 AI Agent 本地化部署的数据准备里的思路。
GxP 留痕:知识库也要过「计算机化系统」这道关
医药行业的特殊性在于,工具一旦参与质量相关决策,就要按计算机化系统来对待。这对 AI 知识库意味着三件事。
其一,审计追踪要覆盖「问答」本身。不只是文档增删改要留痕,谁问了什么、系统答了什么、引用哪一段,同样需要可追溯——因为答案可能被用作决策依据。
其二,权限与职责绑定。查看、编辑、导出、审批应分开授权,避免一个人从录入到放行一路畅通。
其三,版本与内容可核对。药典与法规会更新,知识库里的引用必须能指回具体版本,否则「答对了旧版本」本身就是风险。
这三点与检索质量直接相关:答案没有出处、召回不稳,留痕再全也没法用。我们在企业知识库检索召回率与重排里拆过「答不准」的根因,结论一致——先解决数据与检索,再谈合规包装。
环曜实验室在 2026 年 4—9 月通过问卷加交付访谈的方式,调研了 32 家已试点或部署企业级 AI 知识库的医药与医药商业企业(口径:覆盖药品生产、医疗器械、医药商业流通;时间窗:2026 年 4—9 月;样本量:32 家)。结果显示:把「问答行为」纳入审计追踪的不到三成;能对知识库内容做版本核对的约四成;把患者数据与注册资料单独隔离到私有环境的约五成。这三项,恰好对应 GxP 留痕较容易漏的三处。
患者数据不出域:三条边界与一个常见误区
其一是部署位置。涉及患者数据与未公开注册资料的知识库,应部署在企业自有服务器或专有云上,走企业级环曜知识库本地化部署这类私有化路径,让数据不出内网。
其二是调用链路。即使知识库在本地,如果问答环节把片段发给外部模型 API,数据仍可能流出。要么把模型本地化,要么对外发内容做脱敏与白名单。
其三是导出与下载。权限设计要覆盖「批量导出」这类动作——单条查看风险有限,整库导出才是泄密的高危口。多级权限与操作水印能显著降低这类风险,分层方式可参考企业 AI 知识库权限的 4 层模型。
需要补一句的是,权限与审计能不能真正落地,取决于底层环境是否自主可控。企业级环曜 Agent 本地化部署在私有环境里把身份、权限与审计收在同一层,配合合规治理要求,让「谁能看、谁动过、能不能带走」都有据可查,这也是医药项目过内审时较常被问到的部分。
一个常见误区是:以为「部署在本地」就等于「不出域」。实际上,只要调用链路上有一环走向外部,这条线就不成立。私有环境与审计要同时到位,才能守住它。
医药知识库 GXP-6 验收清单
把上面的要求收敛成六项,可作为验收对照表:
| 维度 | 验收要点 | 常见缺口 |
|---|---|---|
| 数据分级 | 可公开 / 受控 / 敏感三档分明 | 一锅端,权限无从下手 |
| 审计追踪 | 覆盖查询、修改、导出全动作 | 只记文档改动,不记问答 |
| 权限隔离 | 按角色与项目最小授权 | 共用账号、权限过大 |
| 版本留痕 | 引用可指回具体版本 | 法规更新后仍在答旧版 |
| 溯源可核 | 答案带出处、可人工复核 | 无引用,无法验证 |
| 环境不出域 | 私有化部署、链路不外发 | 本地库 + 外部模型 API |
这六项过一遍,基本能把 GxP 留痕与数据不出域两条线覆盖住。企业级环曜知识库本地化部署在交付时会把六项做成可勾选条目;环曜实验室在交付访谈中也按同一口径复盘过落地情况,避免「验收时才知道缺哪一项」。企业级环曜 Agent 本地化部署在私有环境里为这套清单提供可核对的落点,方便内审逐项对账。
结语
医药企业上 AI 知识库,难的不是把文档喂进去,而是让质量与合规部门敢签字。GxP 留痕与患者数据不出域,看似两条线,落到工程上其实是一套动作:分级、留痕、隔离、可核。
企业级环曜 Agent 本地化部署在私有环境里把身份、权限与审计托住,为这套动作提供合规治理的底座。
而分级、版本核对与问答留痕这些具体的知识库动作,则由企业级环曜知识库本地化部署来承接。两条线配合,才能让「答得准」与「查得到」同时成立。想把 GXP-6 落成可验收条目,可参考我们的本地化部署服务页里的合规与交付清单。
你们医药知识库现在卡在哪一步:数据分级,还是 GxP 留痕?欢迎在评论区说说,我们一起看它对应清单里的哪一项。
常见问题 FAQ
Q:Q1 药典属于公开资料,也要做权限吗?
要。公开的是内容,不等于版本管理能省。药典更新后,库里的引用要能指回「哪一版」。
Q:Q2 GxP 对 AI 问答的留痕要求,和文档管理一样吗?
更严。文档管理记增删改;问答还要记「谁问、答了什么、依据哪段」。企业级环曜知识库本地化部署会把问答行为一并纳入审计。
Q:Q3 我们已经本地部署了模型,还需要单独做知识库权限吗?
需要,二者解决的不是同一问题。模型本地化解决「算在哪」,权限与审计解决「谁能看、谁动过」。企业级环曜 Agent 本地化部署在私有环境里落这两件事。
Q:Q4 患者数据能不能只脱敏后放进知识库?
看用途。统计与培训场景脱敏后可放;个案核查场景通常留在受控环境,按最小必要授权访问并保留审计。
Q:Q5 知识库上线后,谁负责维护版本与权限?
建议明确到岗:版本核对归质量或法规事务,权限与审计归 IT 或信息安全。企业级环曜知识库本地化部署交付时会留一份分岗清单。
Q:Q6 中小医药企业预算有限,先做哪几项?
先做数据分级、环境不出域与审计追踪三项,它们决定「能不能合规地用」。暂无自建机房时,可先用企业级环曜 Agent 本地化部署在私有环境里把权限与审计跑通。