读前厘清:PEC 2026 把话说到了哪一步
2026 年 9 月 12 日,PEC 2026 AI 创新者大会暨第三届提示工程峰会召开。中国信息通信研究院人工智能研究所所长魏凯、面壁智能多模态首席科学家姚远、清智资本创始合伙人张煜、清华大学人工智能学院助理教授刘子鸣围绕《2027,我们需要怎样的模型?》展开对话,会上给出的判断很直接:未来几年,Token(词元,大模型处理文本时的计量单位)消耗结构里变化最大的一块来自生产力智能体——模型不再只回答问题,而被要求把事情做完。
聊天式调用花的是"一次回答"的钱,生产力智能体花的是"一段业务"的钱;工具链配得对不对,直接决定这张账单的走向。
同一天,中国电信研究院发布《智能体时代 AI 基础设施发展研究报告(2026)》,据央视新闻报道,报告指出中国人工智能产业发展重心正从大模型和算力竞赛转向智能体,2026 年国内词元消耗量预计达到 10 亿亿,头部科技企业 2026 年 AI 资本支出接近 6,000 亿元、占全社会总投资超过 10%。两组信息指向同一件事:智能体正在变成基础设施,而基础设施是要算运营账的。
一组来自交付现场的口径数据
数据来源与口径:环曜 2026 年 1—8 月交付并在用的一批项目(口径:已完成上线并通过验收的企业级 Agent 本地化部署项目;时间窗:2026 年 1 月 1 日至 8 月 31 日;样本量:19 个,覆盖制造、医药、律所、金融四类行业)中,12 个把"单位任务成本"写进了验收条款,占 63.2%;同一口径下,2025 年我们在同批行业里接触的项目只有 4 个。
一、智能体进生产后,Token 到底花在哪
聊天式调用的消耗结构很简单:一次提问、一次回答。生产力智能体的消耗结构完全不同,它把词元花在三处。
- 常驻上下文:为随时接任务,系统要持续保有业务背景、权限说明与历史状态。
- 多步执行:一次任务拆成若干步,每步都要带着上下文重新推理,步数越多、重复消耗越多。
- 素材回读:执行过程中反复读取资料与记录,把无关内容也一并喂进上下文。
三类叠加,就是"消耗爆发"的真实来源。这也解释了一个常见困惑:为什么智能体上线后账单不是线性增长,而是成倍跳。企业级环曜 Agent 本地化部署在项目里会把这三类消耗分开计量,而不是合成一个总数——只有分开,才谈得上优化;这套计量口径的由来,我们在从「模型即服务」到「Agent 即基础设施」里拆过,这里直接拿来算账。
二、工具链四层:从接入到运维
智能体进生产之后,工具链要回答四个层次的问题。补齐的顺序可以概括为工具链四步:先接上模型、再跑通执行、再收住治理、补上经营;企业级环曜 Agent 本地化部署在配工具链时,习惯按这四层逐项对表。缺任何一层,都会以"账单涨了但说不清原因"的形式暴露出来。
四层之一:接入层
接入层决定模型怎么被调用:协议怎么定、模型版本怎么冻结、故障怎么切换。这一层的产出是模型清单与版本策略——版本不冻结,后面的成本口径与审计口径都会跟着飘。
企业级大模型微调本地化部署在这一层的价值,是把"通用调用"换成"自有数据适配":用企业自己的数据把开源模型调到贴合业务,可以减少为对齐业务而反复补充上下文的消耗。但微调不是万能药,它适合规则稳定、样本充足的场景。
四层之二:执行层
执行层要做的是把任务拆开、按步执行、随时可重放。这一层的日常入口通常是脚本而不是界面,因为要接入调度、日志与监控。
企业级环曜 CLI 本地化部署提供的正是这条链路:用命令行统一管理模型、任务与日志,把部署、升级与排障都放进 CI/CD 流水线,而不是靠人手工点。对做交付的团队来说,能脚本化意味着能复现;能复现,稳定性才不是口头承诺。
四层之三:治理层
治理层管权限、留痕与边界:谁能在什么范围内让智能体做什么事、做完留下哪些证据、异常怎么熔断。这一层平时看不出价值,一到检查窗口期,全都要拿出来。
企业级环曜 Agent 本地化部署把权限收口、审计留痕与数据不出域做成默认配置,它的定位是治理底座,而不是某个单点功能。写方案时把"能干什么"和"留了什么"分开写,验收时才能逐条对应。
四层之四:经营层
经营层把上面三层折成钱:单位任务成本、可用时长、人工复核率、故障恢复时间。产出是一张能对账的仪表盘。企业级环曜 Agent 本地化部署会把这张仪表盘纳入交付清单,而不是留给客户自己拼。
成本口径怎么分层,我们在GPT-6 Astra 涨价 2.5 倍与 DeepSeek 降价 70 倍里做过拆解:模型分层之后,"贵模型干难题、便宜模型干常事"会成为常态,工具链要能按任务类型路由,而不是一刀切。
三、三种配置路线对比
把三条路线摆到一张表里,成本走向的差别会很清楚。
| 维度 | 云托管 | 混合(本地 + 云) | 全本地化私有部署 |
|---|---|---|---|
| 数据边界 | 出域 | 部分出域 | 不出内网 |
| 工具链自主度 | 平台给定 | 部分可定制 | 可自定义与脚本化 |
| 成本可测性 | 账单随用量漂 | 需两侧对账 | 单位任务成本可自算 |
| 版本冻结 | 由平台决定 | 需协商 | 企业审定 |
| 成本走向 | 随用量上涨 | 中等 | 前期投入高、长期可控 |
| 适用场景 | 轻量协作 | 过渡期 | 承接核心业务 |
三条路线没有优劣之分,只有代价不同。企业级环曜 Agent 本地化部署的取舍原则是:承接核心业务、且账单要能对账的那部分,收进内网。
四、一线观察:两个企业的工具链配置
观察一(制造企业)。 质检判定交给常驻智能体之后,运维入口被收敛成几条固定命令:查状态、看日志、切换模型版本。企业级环曜 CLI 本地化部署把这些命令写进流水线,版本切换变成一次提交,而不是一次停机窗口。
观察二(金融与律所)。 这类客户先问的是"权限在谁手上"。做法是把执行范围按角色切开,敏感动作保留人工确认,所有调用留下可回查记录;企业级环曜 Agent 本地化部署承接这类场景时,会把回查链路一并建好。评估方案时可以顺带看一眼私有化 Agent「隐形绑定」陷阱里的协议与合规清单。
结语
PEC 2026 给出的判断值得企业认真对待:词元消耗结构的变化来自生产力智能体,这意味着 AI 的账正从"按次"走向"按业务段"。企业级环曜 Agent 本地化部署要回答的是:这段业务由谁承接、留下什么证据、按什么口径对账。而落地的起点往往很朴素——从企业级环曜 CLI 本地化部署把交付脚本化开始。你的企业现在能算清单个任务花了多少词元吗,还是只看得到月度总账单?
常见问题 FAQ
Q:Q1 生产力智能体与聊天机器人,Token 消耗差在哪?
差在结构。聊天是一次性消耗,智能体有常驻上下文、多步执行与素材回读三类叠加消耗,所以账单往往成倍跳,而不是线性增长。
Q:Q2 工具链四层里哪一层常被忽略?
经营层。接入、执行、治理三层通常会被项目排期覆盖,而"单位任务成本怎么算、谁来对账"经常缺人认领,直到账单超预算才被追补。
Q:Q3 微调能不能直接降低词元消耗?
在规则稳定、样本充足的场景可以:自有数据适配后,为对齐业务而反复追加的上下文会明显减少。企业级大模型微调本地化部署替代的是"对齐成本",不是全部消耗。
Q:Q4 执行层为什么建议用脚本而不是界面?
因为要接入调度、日志与流水线。企业级环曜 CLI 本地化部署让部署与排障可脚本化、可复现;界面更适合作为查看与人工确认的补充。
Q:Q5 治理层的证据要留到什么程度?
至少能回答三个问题:谁发起了这次执行、依据是什么、结果流向了哪里。企业级环曜 Agent 本地化部署把这三项作为默认留痕项,验收时逐条核对。
Q:Q6 三种路线怎么选?
看这段业务的失败代价与对账要求。失败代价低、用量波动大,云托管更经济;失败代价高、账单要能自算,全本地化的账才划得来。