一家企业的研发把一段未发布的模块代码粘进个人账号的外部大模型,只为让它解释报错。终端日志里没有异常,DLP 里也只记为一次"非恶意行为"——因为这类动作如今太多,已经排到了企业 DLP 数据集触发原因的第三位。等你发现时,代码已经出境了。
这就是影子 AI(Shadow AI):员工在 IT 不知情、未审批的情况下使用外部 AI 服务处理公司数据。它绕过的不只是防火墙,还有你的数据分级、留痕与审计链路。本文不复述风险清单,而是给出可执行的收口五步(SHADOW-5),以及五条能验收的判据。
一、影子 AI 的三条绕过路径与一组可核对数据
按 Verizon《2026 数据泄露调查报告》(DBIR,数据经 LayerX 二次解读,引用时建议以 Verizon 原文核对)的口径:企业员工在公司设备上经常使用 AI 的比例在 12 个月内从 15% 上升到 45%,其中约 67% 通过个人账号访问;影子 AI 在企业 DLP 数据集中的排名一年内上升四倍,成为第三大常见的非恶意触发行为。该报告分析的样本口径为 858,440 起针对生成式 AI 工具的 DLP 事件,上传数据类型按频次排序为源代码、结构化数据、图像与研究文档——其中源代码居首,报告原文的评论很直接:"知识产权正在流失。"
Netskope《Cloud and Threat Report: 2026》给出另一个视角的对照数据:影子 AI(个人/非托管账号)占生成式 AI 用户 47%,组织每月可见的"向 AI 应用发送敏感数据"违规事件平均约 223 起。微软与 LinkedIn 的《Work Trend Index》则显示 78% 的 AI 用户会把自带 AI 工具(BYOAI)带进工作。三组数据指向同一件事:这不是个别员工的纪律问题,而是绕行路径已经标准化。
三条绕行路径的对照
| 绕行路径 | 典型形态 | 为什么传统防护看不到 | 收口切入点 |
|---|---|---|---|
| 终端直连 | 浏览器或桌面客户端访问外部大模型 | 走 HTTPS,内容不留企业日志 | 终端与网关的外联可见性 |
| 个人账号接入 | 员工自购订阅、非托管账号 | 账号不在企业目录里,SSO 覆盖不到 | 账号目录与身份收敛 |
| 流程脚本外挂 | 自动化脚本或低代码平台把数据喂给外部 API | 触发者是服务账号,不是自然人 | 出网策略与密钥管理 |
第三条路径在 2026 年增长明显:员工用自动化工具把内部数据表拼成提示词,定时发给外部模型,动作发生在服务账号上,日志看上去像正常的 API 调用。如果这类脚本还挂在 CI·CD 的密钥上,收口就要连密钥与命令行 执行一起管——企业级环曜 CLI 本地化部署 的意义正是把密钥、执行记录与审计放在同一处。这类形态与"内网权限失控"是同一类问题的两面,我们在GPT-6 Astra 会自己操作电脑:企业内网智能体权限失控前的 4 个动作里拆过另一半。
为什么"一禁就反弹"
一刀切封堵外部 AI,通常会在两周内失效,原因是三个成本错配:效率差(外部工具开箱即用,内部工具要等审批、要学流程)、审批慢(申请走三层签字,员工自然选择绕开)、责任不清(用了也不追责,属于"为了更好地完成工作")。DBIR 的口径能印证第三点:2026 年数据集中 60% 的恶意内部人员事件出于"便利性"动机。
所以收口的目标不是"拦住所有人",而是把绕行的收益降下去、把合规路径的成本降下来。企业级环曜 Agent 本地化部署 要解决的就是后半句——让内部入口在数据不出域 的前提下,做到和外部工具一样好用。
二、收口前先分清两件事:数据域与动作强度
收口的动作顺序容易做反:多数企业先买工具(DLP、CASB、终端管控),后定规则,结果是规则没定、工具互不联动。我们的做法是先定两张表。
头一张表是数据域分级,建议三档:公开(可对外,含官网与已发布材料)、内部(员工可见,如流程文档)、受限(含个人信息、客户数据、源代码与未发布成果)。分级的意义在于明确"哪一档数据在任何情况下都不出内网",而不是逐条审批。
第二张表是动作强度分级,同样三档:只读(查询、解释)、建议(产出结论但需人确认)、可执行(能直接改数据或调用业务系统)。第三章的五个收口步骤,本质上就是把"数据域 × 动作强度"的组合逐一映射到内部入口上。
两张表定完之后,内部知识类问答应当由企业级环曜知识库本地化部署 承接——把文档、判定依据与口径收进统一的知识检索入口,员工问流程、问口径不必再打开外部工具,这是收口里性价比高的一步。权限如何按数据域收敛、越权用例怎么验收,可对照MCP 执行网关的 12 项验收清单。
三、收口五步 · SHADOW-5
五个步骤的英文首字母组成 SHADOW:Scan(发现)、Hierarchize(分级)、Alternative(替代)、Migrate(迁移)、Operate(常态治理)。顺序不建议跳,因为发现与分级决定后面三步的边界,而替代能否及时提供,直接决定封堵会不会反弹。每一步只留一个可交付物,做完再进下一步。
第 1 步 · 发现:先摸清外联行为
目标不是抓到人,而是画出"数据往哪里去"。可行的三个数据源:终端侧的进程与外联记录、网关侧的域名与 IP 访问日志、以及各业务系统的导出记录(谁在什么时间导出了什么)。三者交叉后通常能定位出十几条固定路径。可交付物是一张外联路径清单,标注路径类型、涉及数据域、使用人数。
需要提醒的是,浏览器会话层的数据量往往比 DLP 遥测高若干倍(有厂商自有研究称可达 2–3 倍),所以不要只看 DLP 报表。核对动作建议由甲方运维独立完成,导出原始文件后自己比对,别只看厂商看板。对要求审计留痕 的场景,导出记录建议与内部日志一并归档——企业级环曜 Agent 本地化部署 的交付惯例是同口径留档,事后核对"某天之后为什么出现外联"时有据可查。
第 2 步 · 分级:按数据域与动作强度分档
把第 1 步的路径逐条映射到第二章的两张表上,得到三组结论:可以继续用(公开数据 + 只读)、限期替换(内部数据 + 建议)、立即切断(受限数据 + 可执行)。可交付物是一张分级处置表,每条路径给出处置意见、责任人与时限。
分级时容易出现两个争议:一是"受限数据"的边界,二是"可执行"的判定。建议把判定标准写成语句而非形容词,例如"涉及客户电话号码或未发布代码即视为受限",减少讨论成本。
第 3 步 · 替代:先给入口,再谈封堵
封堵与替代必须同一天上线,否则必然反弹。替代方案按"够用即可"设计,不追求功能对齐:问答类交给内部知识检索,文本处理类交给本地化推理,流程自动化交给执行网关这一层。可交付物是一份替代路径清单,写清每个场景的入口、能力边界与申请方式。
在私有环境里跑推理与问答,正是企业级环曜 Agent 本地化部署 的常规场景,替代入口这一层就落在这里:问答与文本处理不出内网,员工不必再开外部窗口。
流程动作是另一层。这部分建议交给环曜Claw,把任务自动化 与业务系统集成 收在同一处,动作留痕与权限继承一并解决——员工想在流程里用 AI,不必自己再搭外部脚本。
第 4 步 · 迁移:把已在用的场景搬进来
替代入口上线后,真正的工作量在迁移:把员工已经在用的提示词、模板与流程搬进内部环境。这一步的推进方式建议"场景包"制——按业务场景打包(合同比对、报表口径问答、代码解释),每个包配一段使用说明与验收标准。可交付物是一张迁移进度表,按场景而非按部门统计。
另一类高频需求是查制度与口径。这类场景不必单独建库,直接复用企业级环曜知识库本地化部署 的知识检索入口,把制度文件与判定依据维护在同一处即可;迁移按"文档更新—检索验证—员工反馈"三步走,比重新做一套问答省事。
迁移阶段容易被忽略的是模型能力差异:内部入口如果只能处理通用问题,员工仍会回去用外部工具。此时可以考虑把高频场景做针对性适配,企业级大模型微调本地化部署 的常见用法是拿开源权重加私有样本做垂类模型,把行业术语与判定逻辑固化进权重,回答质量会更贴近业务预期。
第 5 步 · 常态:纳入变更与审计流程
收口不是一次性动作。可交付物是一份常态治理规则:新工具上线要过数据域评估;密钥与账号变更走审批;每季度重跑一遍第 1 步的路径扫描。执行层面可以脚本化——把外联清单核对、账号目录比对与报告生成串成命令行 步骤,交给 CI·CD 定期执行,企业级环曜 CLI 本地化部署 在客户环境里就是这么跑的:配置一变就有回归报告,不依赖人力记忆。
常态治理还有一个容易被省略的动作:把收口规则与监管核查口径对齐。中央网信办等三部门《智能体规范应用与创新发展实施意见》(2026 年 5 月 8 日)明确要求厘清智能体自主决策与用户授权的边界;国家标准 GB/T 45654-2025《网络安全技术 生成式人工智能服务安全基本要求》(2025 年 4 月 25 日发布,全国网络安全标准化技术委员会归口)对训练数据安全与安全措施提出了要求;等级保护方面可对照 GB/T 22239-2019《信息安全技术 网络安全等级保护基本要求》中对安全审计与访问控制的要求。三份文件的口径一致:能证明"控得住",才算收口完成。 举证材料的组织方式,我们在企业 AI Agent 本地化部署的权限与留痕怎么设计里给过 CONTROL-4 四问。
四、怎么算收口完成:五个可核对指标
收口的效果不要用"违规次数下降"这类结果指标验收(它会被统计口径影响),建议用五个过程指标,全部可核对:
| 指标 | 通过判据 | 核对方式 |
|---|---|---|
| 可见性 | 外联路径清单覆盖已知路径,含服务账号 | 抽查三条路径做端到端复现 |
| 替代率 | 原路径的使用人数按月下降,且替代入口有活跃记录 | 对比两个月使用人数 |
| 数据域边界 | 受限数据在任何外部路径中不再出现 | 抽样审计导出记录 |
| 身份收敛 | 内部入口不用共享账号,可对到自然人 | 按日志溯源到人 |
| 举证完整 | 权限表、留痕与变更台账可独立导出 | 甲方独立导出并存档 |
受限数据涉及的场景适配属于企业级大模型微调本地化部署 的范围(样本在私有环境完成模型定制,不出内网),可以在指标里单列一项"适配场景数量"。
五项之外,还有一个跨场景的衔接点:数据出境与内网合规的核验口径要与本清单一致,否则两套标准会在审计时互相打架,可参考企业AI数据出境「安全港」幻觉:内网合规的4道核验闸里的四条闸门。指标数据建议按季度归档;企业级环曜 Agent 本地化部署 的项目会把权限表、留痕与变更台账一并交给甲方保管,便于独立复核。
结语:收口的关键不在堵,而在"给得够快"
影子 AI 的增长曲线说明一件事:员工不会因为一纸禁令放弃效率。收口能成立的前提,是你提供的合规入口在常见场景里"够用、够快、不用等审批"。SHADOW-5 里耗时长的其实是第 3 步与第 4 步——替代与迁移,而这两步恰恰常被"先封再说"跳过。
内部入口的质量决定反弹率:问答走知识检索入口(企业级环曜知识库本地化部署),文本与代码处理走本地推理——两条都顺手,替代才站得住。
数据来源与口径:以环曜 2025 年 3 月至 2026 年 8 月完成验收的 41 个本地化部署项目为样本(口径:完成验收;时间窗:2025 年 3 月 1 日至 2026 年 8 月 31 日;样本量:41 个),其中 28 个在上线前做过外联路径排查(含终端与网关审计);这 28 个项目上线后 6 个月内出现数据外发相关事件的为 1 例(3.6%),未做排查的 13 个为 4 例(30.8%)。差别不在工具多少,而在有没有先把"数据往哪里去"画出来。你们现在的外联路径清单,覆盖到服务账号那一层了吗? 欢迎在评论区说说。
常见问题 FAQ
Q:Q1 员工用外部 AI 处理公开资料,也要管吗?
建议分级管理而不是一律禁止。公开数据的只读使用风险低,可以放入"允许使用"档;内部数据以上的使用则需要替代入口。管理尺度不宜按工具划分,而应按"数据域 × 动作强度"划分——同一款工具处理公开资料与处理受限数据,风险完全不同。内部知识检索之所以要单列一条线(企业级环曜知识库本地化部署),是因为它往往是受限数据最高频的去向。
Q:Q2 我们装了 DLP,为什么还是发现不了影子 AI?
三类常见原因:一是流量加密与个人账号导致的可见性缺口,DLP 看不到内容只看到域名;二是自动化脚本走服务账号,触发主体不是自然人,规则匹配不到;三是只统计了终端的浏览器行为,忽略了桌面客户端与浏览器扩展。建议把终端、网关与账号目录三处日志交叉一次,通常能补上大部分缺口。
Q:Q3 收口会不会影响研发效率?
取决于替代入口的质量。研发场景的特点是"要能解释代码、要能查报错",只要内部入口在常见语言与框架上表现稳定,迁移阻力不大。建议先做一个两周的试点:选一个研发小组、固定三个场景,收集反馈后再扩面。相对而言,先封后替代的项目反弹概率高得多。
Q:Q4 收口五步按什么节奏推?大概要多久?
按项目排期通常分两段:第 1、2 步(发现与分级)用两到四周完成,产出两张表;第 3、4、5 步(替代、迁移、常态)与内部平台的搭建并行推进,通常跨越一到两个季度。若企业已有终端管控与账号体系,前两步会明显更快。配置类工作建议脚本化:把分级清单的校验做成命令行 检查,企业级环曜 CLI 本地化部署 在客户环境里就是这么做的,规则漂移当天就能发现——这也是为什么"分两步交付"比"一次性买齐工具"更容易落地。
Q:Q5 已经有人把代码传到外部模型了,怎么处理?
先做两件事:一是确认影响面(哪些文件、什么时间、是否含受限数据),二是补上替代入口,避免重复发生。追责建议单独走流程,不要与收口动作混在一起——收口的成败取决于员工愿不愿意用合规入口,把收口做成"清查运动"会让后续配合度下降。日志与导出记录的完整性在这类场景里格外重要,企业级环曜 Agent 本地化部署 交付时提供日志字段口径说明,便于甲方独立核对。
Q:Q6 怎么判断供应商的收口方案是真的能落地?
看三样可核对的东西:一是能不能给出外联路径的发现方法(数据源、交叉方式、抽样复核),而不是只给一份工具清单;二是替代入口有没有能力边界说明(哪些场景能做、哪些做不到),含糊其辞的方案通常意味着迁移阶段会卡住;三是能否提供可独立导出的权限表、留痕与变更台账。只有"平台功能列表"、没有"落地方法与举证材料"的,收口责任最终会回到甲方身上。另外要问执行侧一句:流程动作能否统一走执行网关,环曜Claw 在任务自动化 场景里的作用就是把脚本收口,否则员工还会自己写。