IDC《2025年中国企业AI大模型应用趋势报告》显示,超过 68% 的受访大型企业把"数据不出域"列为 AI 落地的第一约束。当 AI Agent(智能体,能自主调用工具完成任务的AI程序)要处理合同、财报、客户隐私等核心数据时,把模型和服务跑在公有云 API 上,往往意味着数据要离开企业内网——这对金融、政务、制造业而言是一条不可逾越的红线。
本文给出一套可直接落地的技术方案:用企业自有服务器(裸金属或信创一体机)搭建本地运行环境,将 Agent 编排、模型推理、企业知识库三层全部部署在局域网内,实现数据零出域。我们用两个命名框架——LOCAL-5 选型评估模型与 STACK-4 技术架构——帮您判断"该不该私有化、怎么搭",并附三种主流架构的对比打分、一套 8 步实施清单,以及一个制造业客户的真实落地数据。
为什么企业要把 AI Agent 部署在自有服务器上
数据出域是不可碰的合规红线
《数据安全法》与《个人信息保护法》要求核心业务数据在境内存储与处理;金融行业的等保 2.0(网络安全等级保护制度)更明确规定,涉及信贷、风控的系统不得对接不可控的外部推理服务。一旦把合同、工单、客户名单传给公有云 API,即便对方承诺"不留存",数据在传输与推理环节已离开企业信任边界,监管审计时无法自证清白。
这正是企业级环曜 Agent(智能体)本地化部署要解决的核心问题:把 AI Agent 私有化部署在企业自有服务器上,数据全程不出域。
公有云 API 的三类隐性成本
很多企业只盯着调用单价,却忽略了三笔隐性账:
- 用量线性增长:Agent 规模化后,每次对话触发的多轮工具调用会让 token 消耗呈倍数上升,月度账单常超预算 2-3 倍。
- 合规风险成本:一次数据外发若触发监管约谈,整改与品牌损失远超省下的算力费。
- 可用性不可控:外部 SLA(服务等级协议)在您业务高峰时未必兜底,断网即停摆。
信创与国产化替代的硬约束
党政机关、国企及关键行业要求采用国产芯片(鲲鹏、海光、飞腾)与国产操作系统。公有云 API 既无法证明运行在信创环境,也无法满足"技术自主可控"的采购条款。
LOCAL-5 私有化部署选型评估模型
要不要私有化、投入多大,不能拍脑袋。我们给出LOCAL-5 私有化部署选型评估模型,从五个维度加权打分,帮决策层用同一把尺子衡量。
| 维度 | 权重 | 评估要点 |
|---|---|---|
| 数据驻留与合规(Data Residency) | 30% | 数据是否全程不出域、是否满足等保/信创要求 |
| 算力适配与弹性(Compute Fit) | 20% | 是否支持国产 GPU、能否按需横向扩容 |
| 部署与运维复杂度(Ops Burden) | 20% | 上线周期、日常运维所需人力 |
| Agent 编排能力(Orchestration) | 15% | 多 Agent 协同、工具调用、流程编排成熟度 |
| 总拥有成本 TCO(Cost) | 15% | 硬件 + 授权 + 三年运维的综合成本 |
打分方法:每个维度 1-5 分,加权求和得综合分(满分 5.0)。综合分 ≥ 4.0 强烈建议私有化;3.0-4.0 可先做单机试点;< 3.0 先用公有云过渡。实际评估时,建议先让 IT 与合规两方各打一次分,差值超过 1.0 分说明预期未对齐,需先达成共识再立项。环曜 CLI 部署工具提供一键部署脚本,能把"部署与运维复杂度"这一项的得分显著拉高——自动化拉起容器、回滚与健康检查,让没有专职运维的团队也能在半天内部署完成。
本地服务器私有化部署 STACK-4 技术架构
确定了私有化方向,下一步是搭架构。我们建议采用STACK-4 四层技术架构,自下而上逐层解耦,便于替换与扩展。
L1 基础设施层:裸金属信创服务器或国产化一体机,运行 Docker / Kubernetes。典型配置为 2×鲲鹏 920、256GB 内存、4×推理加速卡,单机即可支撑中小团队的Agent负载。存储建议用本地 SSD 承载知识库热数据、对象存储做归档;网络层面通过 VLAN 与业务网隔离,从物理上杜绝推理流量外溢。
L2 模型运行时层:推理引擎(如 vLLM、TGI)加载本地权重,上层做模型路由。关于在本地多模型之间做成本与延迟感知的调度策略,可参阅多模型路由 2.0(MATRIX-5 派系选型矩阵升级)——这套思路同样适用于企业内网的模型分发。推理侧建议开启 4-bit / 8-bit 量化(用低精度压缩模型权重以降低显存占用)以在有限算力上跑起 30B 级别模型;权重文件通过内网离线包更新,全程不触外网。
L3 Agent 编排层:环曜 Claw(企业级本地化部署)作为 AI 智能体执行网关,完全本地运行、无云端依赖,负责把用户意图拆成工具调用链并编排多 Agent 协同。关于本地 Agent 执行网关的三层架构设计,可参阅「Claw 模式」走红:企业 CLI 智能体 3 层架构。实测中,环曜 Claw 单节点支持 4×GPU、并发 500+ 会话,部署周期较传统方案缩短约 60%,并已适配鲲鹏、海光等信创芯片。工具调用在本地沙箱中执行,所有外部系统对接都走企业内网 API,配合调用日志审计满足等保要求。
L4 知识与服务层:企业级环曜知识库本地化部署基于 RAG(检索增强生成,先检索企业文档再让模型生成答案)对接内部文档。权限感知是 2026 的生死线——不同部门只能看到自己有权限的知识,相关设计可参考RAG 权限感知=2026 生死线(TRACE 框架)。知识入库前建议做敏感字段脱敏与分库,避免跨部门的权限串扰。
三种主流私有化部署架构对比
不同规模的团队,适合的架构差异很大。下表对三种主流方案做加权打分(满分 5.0,权重同 LOCAL-5)。
| 评估项 | 单机裸金属(docker-compose) | 容器集群(Kubernetes) | 信创一体机(国产栈) |
|---|---|---|---|
| 部署周期 | 1-3 天 | 7-14 天 | 5-10 天(出厂预装) |
| 硬件成本 | 低(¥8万-15万) | 中(¥30万-80万) | 高(¥60万-150万) |
| 可扩展性 | 弱(垂直扩容) | 强(水平扩容) | 中(机型固定) |
| 信创兼容 | 取决于选型 | 取决于选型 | 强(原生适配) |
| 运维复杂度 | 低 | 高 | 中(厂商托管) |
| 适用规模 | 试用 / 中小团队 | 多部门规模化 | 政务 / 国企强合规 |
| 加权总分 | 3.6 | 4.1 | 4.3 |
选型决策建议
- 试用验证或 50 人以内团队:选单机裸金属,用 企业级环曜 CLI 本地化部署 一键拉起,成本最低、上线最快。
- 多部门、高并发企业:选容器集群,水平扩容应对峰值,但需要专职运维或托管服务。
- 政务、国企、强合规行业:直接选信创一体机,原生适配国产芯片与操作系统,等保备案更顺。
本地服务器搭建实施路径(8 步清单)
把方案落成系统,按这 8 步走,可复现、可审计。
环境准备与硬件上架
- 需求与合规评估:用 LOCAL-5 打分,确认私有化阈值与合规边界。
- 硬件选型与上架:按规模选单机/集群/一体机,信创场景锁定国产芯片清单。
- OS 与容器运行时:安装国产或通用 Linux,部署 Docker,集群场景部署 Kubernetes。
容器化部署与编排
- 推理引擎部署:用 vLLM 加载本地模型权重,关闭一切外联地址。
- 模型路由配置:在本地多模型间配置成本/延迟感知的路由策略。
- 环曜 Claw 网关部署:通过 企业级环曜 CLI 本地化部署 拉起执行网关,接入企业统一身份认证。
Agent 与知识库接入
- 知识库 RAG 接入:部署 企业级环曜知识库本地化部署,导入文档并配置 TRACE 权限策略。
- 压测、监控与备案:做并发压测与日志审计,接入 Prometheus + Grafana 做推理延迟与显存可观测,完成等保三级备案后正式上线。
下面是一段本地 Agent 技术栈的 docker-compose 片段示例:
# 本地私有化 Agent 技术栈(节选)
services:
claw-gateway: # 环曜 Claw 执行网关,完全本地运行
image: local-registry/claw-gateway:2.4
ports: ["127.0.0.1:8080:8080"]
environment:
- MODEL_ROUTER=internal://router:9090
- DATA_Egress=deny # 禁止任何外联出域
deploy:
resources:
limits: { memory: 32G }
model-router: # 本地模型路由(成本/延迟感知)
image: local-registry/model-router:1.2
ports: ["127.0.0.1:9090:9090"]
rag-kb: # 企业级环曜知识库 RAG 服务
image: local-registry/rag-kb:3.1
volumes: ["./kb-data:/data:ro"]
本地模型路由的成本感知调度,可用一段轻量 Python 实现:
# 本地多模型成本感知路由(示意)
MODELS = {
"qwen-local-7b": {"cost_per_1k": 0.0, "latency": 0.9, "quality": 3.5},
"qwen-local-32b": {"cost_per_1k": 0.0, "latency": 2.4, "quality": 4.6},
}
def route(prompt: str, budget="quality") -> str:
# 内网推理不计费,这里以"延迟-质量"权衡做路由
if budget == "fast":
return min(MODELS, key=lambda m: MODELS[m]["latency"])
return max(MODELS, key=lambda m: MODELS[m]["quality"])
print(route("生成季度运维报告", budget="quality")) # -> qwen-local-32b
实战案例:某制造业客户本地服务器搭建实录
环境与目标
某大型装备制造企业,12 个部门、约 3,000 名员工,需要将售后知识库与工单 Agent 私有化,明确要求数据不出域、通过等保三级。
落地结果量化
- 硬件:2 台信创一体机(每机 2×鲲鹏 920 + 4×推理加速卡)。
- 部署周期:从硬件上架到可用,共 18 天。
- 并发表现:峰值 240 会话,P95(95% 请求的性能阈值)延迟 1.8 秒。
- 合规:数据零出域,通过等保三级备案。
- 量化收益:年节省公有云 API 调用费约 ¥86 万,日常运维约 1.5 人/月。
该客户用 环曜 Claw 作执行网关、企业级环曜知识库本地化部署 作 RAG 后端,配合 环曜 CLI 部署工具 的自动化脚本,把上线周期压到了三周以内。
落地挑战与经验
首周最大的坑是推理卡驱动在国产 OS 上的兼容性——团队提前用检测脚本锁定已验证的芯片型号,避开了返工。另一个经验是:知识库导入前先做权限梳理,否则 TRACE 策略上线后会出现"有知识但看不见"的工单激增。
常见问题 FAQ
Q:私有化部署是不是意味着要花几百万买服务器?
不一定。如果只是部门级试点,一台 ¥8万-15万 的信创服务器跑单机裸金属架构就能跑起来;只有多部门高并发、强合规的场景才需要上百万的集群或一体机。先用 LOCAL-5 打分,按需投入。
Q:本地服务器搭建的最低硬件配置是多少?
单机试用建议:16 核 CPU、64GB 内存、1 张推理加速卡、1TB SSD,即可承载 50 人以内的 Agent 与知识库负载。生产环境建议 256GB 内存起步,并预留扩容槽位。
Q:环曜 Claw 私有化部署支持哪些国产信创芯片?
已适配鲲鹏、海光、飞腾等主流国产芯片,以及对应的国产操作系统,满足信创采购与等保要求。具体型号清单可在部署前由企业级环曜 CLI 本地化部署的检测脚本输出。
Q:私有化部署后模型还能更新吗?
可以。模型权重通过内网离线包更新,无需外联公有云。您可以在测试环境验证新权重后,再用 CLI 脚本灰度推送到生产节点,全程数据仍不出域。
Q:数据不出域具体是怎么保证的?
三层保障:网络层做物理/逻辑隔离,Agent 网关配置 DATA_Egress=deny 禁止任何外联;存储层文档只读挂载在本地;审计层记录全部调用日志供等保核查。三者叠加,数据在推理、检索、传输环节均不离开企业内网。
Q:中小团队没有专职运维能自己部署吗?
能。借助企业级环曜 CLI 本地化部署的一键脚本,从环境检测、容器拉起到健康检查可自动化完成,半天内即可跑通单机版;后续如需扩到集群,再引入托管运维即可。