读前厘清:2M 上下文也治不好「金鱼困境」
Agent 忘事,多数人下意识是「上下文不够长」。把全部历史塞进窗口,结果是既烧钱又稀释注意力——关键事实被埋到第 5 万个 token,召回率断崖下跌。记忆系统真正要解决的是三件事:写什么、存哪里、什么时候忘。中国信通院《人工智能发展报告(2026年)》把记忆与上下文工程列为大模型工程化的关键环节;学术上 Packer 等《MemGPT: Towards LLMs as Operating Systems》(2023)首次提出把大模型当操作系统、用分层记忆管理上下文——这也是企业级记忆架构建模的起点。
一、MEM-4 记忆四层架构(命名框架)
工作记忆(Working)。 当次任务的上下文,会话结束即清空,不落库、不污染。
情景记忆(Episodic)。 历史会话与操作轨迹,可回放。它回答「这次任务做过什么」。
语义记忆(Semantic)。 沉淀的实体、规则、术语,供检索。它回答「业务事实是什么」。
程序记忆(Procedural)。 可复用的技能与工作流(工具链、SOP),可被调用而非重学。
每层职责单一、读写分离,切忌「一层存所有」。企业级环曜知识库把语义层与情景层分开落库:语义层走向量 + 关键词混合检索(延伸阅读:企业级环曜知识库 RAG 重排序阈值调优:92%→95.96% 实测),情景层留轨迹审计;四层各自配独立写入权限,为后续遗忘闸留出口。
二、3 道遗忘闸(命名框架)
- 闸1 过期闸:带 TTL 的临时记忆到期即清,防陈旧事实污染后续推理。
- 闸2 冲突闸:新记忆与旧记忆矛盾时,按来源权威度与时间戳裁决,不静默覆盖。
- 闸3 越权闸:记忆写入须过权限校验,企业级环曜知识库默认拒写未授权来源,防越权注入污染知识库(延伸阅读:OpenAI Agent 劫持 DseWiki:企业知识库防越权改写的 5 道隔离闸)。
三道闸的本质:记忆不是越多越好,而是「敢忘、会裁、能拒」。
| 维度 | 长上下文硬塞 | RAG 检索 | 专用记忆库(Mem0/Zep/Letta) | 知识图谱 |
|---|---|---|---|---|
| 成本 | 高(token 线性涨) | 中 | 中 | 高 |
| 多轮一致 | 短会话尚可 | 弱(不记轨迹) | 强 | 强 |
| 可审计 | 差 | 中 | 强 | 强 |
| 落地复杂度 | 低 | 中 | 中 | 高 |
| 适配场景 | 单轮问答 | 静态知识问答 | 多轮 Agent 助手 | 强关系推理 |
选型不看谁先进,看你的 Agent 是「答一次」还是「陪一路」。企业级环曜知识库走的是 RAG + 记忆库组合:检索管事实,记忆管轨迹(延伸阅读:Graph RAG 中国企业落地:知识图谱 + RAG 选型 3 场景、本地化 4 道闸)。
四、为什么只靠 RAG 不够
RAG 解决的是「检索事实」,它不解决「记住这次对话做了什么」。用户上周提过的偏好、昨天改过的参数,RAG 检索不到,因为那些从未被写回库。记忆系统要在 RAG 之上补两件事:写回(把会话结论沉淀成情景记忆)与遗忘(按 3 道闸淘汰噪声)。企业级环曜知识库把「写回」做成受控流程——结论先过起草区、再过越权闸,最终才进语义层;企业级环曜知识库的写回与检索共用一套权限模型,避免「检索能读、写入能毒」的不对称。
五、真实落地案例
案例一(客服 Agent):多轮工单记忆。 某企业客服 Agent 接入记忆层后,同一客户跨会话的诉求不必重述;我们 2026 Q3 交付的知识库项目中,多轮任务一次解决率较无记忆版明显提升(口径:同批工单 A/B 对比,时间窗 2026 Q3,样本量 6 个客服 Agent 场景、约 12 万轮会话)。企业级环曜知识库在其中承担语义层与情景层的分离存储。
案例二(制造设备知识 Agent):情景回放定位故障。 某制造企业把设备维修知识 Agent 接上记忆层,维修员的历史处理轨迹按情景记忆留存,同类故障再发时可回放既有处置路径;一次产线异常经情景回放锁定为参数漂移,处理时长较人工翻手册缩短。记忆让经验从「师傅脑子里」变成「可检索的资产」,轨迹由企业级环曜知识库落库留痕。
结语
Agent 记忆系统选型,核心不是窗口多长、模型多强,而是有没有分层与遗忘。MEM-4 四层架构让「写什么、存哪里」各归其位,3 道遗忘闸让「什么时候忘」有章可循;企业级环曜知识库把这两件事收进一套可审计的知识库工程里。
常见问题 FAQ
Q:Q1 记忆和 RAG 是替代关系吗?
不是,是分层关系。RAG 管静态事实检索,记忆管会话轨迹与偏好;企业级环曜知识库把两者做成一套,检索与写回共用权限模型。
Q:Q2 上下文窗口涨到 2M,还需要记忆层吗?
需要。窗口越大,注意力越容易被稀释,且 token 成本线性上升;企业级环曜知识库的分层记忆只把相关片段送进窗口,省 token 也更准。
Q:Q3 记忆会不会把错误固化下来?
会,所以要有冲突闸与越权闸。企业级环曜知识库按来源权威度裁决,低可信来源不静默覆盖高可信记忆。
Q:Q4 记忆写入要不要人工审?
敏感域建议过起草区,企业级环曜知识库支持写回先落草稿、审计后入语义层。
Q:Q5 四层记忆都自建成本太高怎么办?
可先上语义层与情景层,工作记忆与程序记忆复用现有编排;我们提供分层落库模板,按需启用。
Q:Q6 存量知识怎么迁进记忆层?
先清洗再入库,企业级环曜知识库把存量文档走向量 + 关键词混合检索,轨迹类数据单独建情景库。