AI Agent 进阶 Agent记忆 长期记忆 Mem0 Letta

Agent 长期记忆 2026:Mem0 / Letta / Zep / LangMem 架构对比与选型实践

AIEng Hub
阅读约 16 分钟

引言

“上下文窗口不是记忆系统”——这是 2026 年 Agent 工程最常被引用的一句话。窗口再大,每轮对话结束记忆就清零:Agent 记不住用户偏好、记不住昨天的半成品项目、记不住上个工单的处理结论。当 Agent 从”一次性问答工具”变成”跨会话的协作者”,长期记忆从加分项变成了架构刚需。

2026 年记忆基础设施已经分化为四条清晰的技术路线:Letta(原 MemGPT)、Mem0、Zep、LangMem。选错路线的代价是延迟、复杂度与成本一起失控。本文结合基准数据给出对比与选型建议。

一、记忆的三层模型

成熟的 Agent 记忆系统普遍采用分层设计:

记忆类型类比载体
工作记忆(短期)RAM当前上下文窗口:对话历史 + 工具结果
长期记忆(存储)硬盘跨会话持久化:向量库 / 图数据库 / KV
推理记忆(决策链)日志推理轨迹与决策依据,支撑审计与回溯

大部分框架只实现了前两层,第三层(推理记忆)是被严重低估的能力——它决定了 Agent 的决策是否可解释、可审计。

二、四条技术路线

Letta:OS 式记忆管理(原 MemGPT)

Letta 2026 年重构了 agent loop,吸收了 ReAct 与 Claude Code 的实践,引入 git 版本化记忆块 与跨模型提供商的部署运行时。它的核心哲学是”记忆像操作系统管理内存一样被显式管理”:哪些进上下文、哪些驻留外部存储、何时换入换出,都可控可见。

适合:需要记忆管理透明度的场景(合规审计、企业追溯)、从零构建有状态 Agent 的研究型团队。代价是框架绑定深,需要自己运维。

Mem0:生产优先的托管记忆

Mem0 是 2026 年最成熟的托管记忆服务:你调用 API,它决定记什么、怎么归类、何时浮出。技术架构是三层混合——向量库存语义、图层存实体关系、KV 存结构化偏好;记忆提取在后台自动完成,发送一轮对话即可,无需自己写提取逻辑。

# Mem0 最小用法:记一条 + 查一条
from mem0 import Memory

m = Memory()  # 默认本地 OSS 版;托管版填 api_key
m.add("用户喜欢用中文回复技术问题,讨厌冗长介绍", user_id="u_1001")

results = m.search("用什么语言回复?", user_id="u_1001")
print(results)

基准方面,独立评测中 Mem0 在 LongMemEval(跨时间/多跳/知识更新场景)达到 49.0%;LOCOMO 基准中 Mem0 以 0.71s 延迟实现 66.9% 准确率——显著快于全量上下文方案(9.87s / 72.9%)。结论很直白:全量塞上下文更准但慢 14 倍,检索式记忆在绝大多数生产场景是正确取舍。

Zep:会话记忆 + 时序知识图谱

Zep 的差异化在于底层 Graphiti 引擎:把记忆构建为带时间有效性的知识图谱(详见本站 RAG 板块《从 GraphRAG 到实时时序知识图谱》)。每条事实都有 valid_at/invalid_at,事实变更走”失效旧边 + 新建边”而非覆盖删除。对”用户上周说 A,这周改口 B”这类矛盾处理,是四条路线中最结构化的。

适合:企业客服(同一用户反复交互)、偏好频繁变化的个性化场景。

LangMem:LangChain 生态的模块化记忆

LangMem 把记忆拆成可插拔模块(提取、存储、检索、遗忘策略),与 LangGraph 的状态机深度集成——如果你已经在 LangGraph 上构建工作流,LangMem 是侵入成本最低的补全。代价是”半成品”属性:模块齐全但需要自己组装策略。

三、2026 的生产模式:记忆整合层(Consolidation Layer)

值得注意的趋势是:生产级系统很少只选一个框架,而是搭建记忆整合层,按记忆类型路由到合适的存储:

  • 工作记忆 → 留在上下文窗口(配 compaction 摘要)
  • 语义偏好 → Mem0 / 向量库
  • 实体关系 → Zep Graphiti / 图数据库
  • 程序性知识(技能与流程) → Letta 的 git 记忆块 / Skills 系统

这恰好对应人类记忆的三种系统:情景记忆、语义记忆、程序性记忆——各自服务不同目的,由整合层统一调度。

四、落地清单与常见坑

  1. 写入路径过滤:不是每轮对话都值得记。设定”值得记忆”的判定条件(偏好变更、承诺、事实性结论),否则记忆库会被噪音淹没,检索质量快速劣化。
  2. 矛盾处理策略:新旧事实冲突时,明确走”时间戳失效”(图方案)还是”覆盖 + 摘要”(文本方案),不要混用。
  3. 延迟预算:检索式记忆的延迟优势只在”检索开销 < 长上下文处理开销”时成立;短对话场景直接带上下文可能更优。
  4. 隐私治理:记忆 = 长期留存的用户数据。需要提供查看、删除、导出能力,并明确记忆数据的保留策略。
  5. 基准先行:上线前用 LongMemEval / LOCOMO 类的场景集跑一轮,别凭感觉选型。

结语

记忆是 Agent 的”第二大脑”,不是可选附件。2026 年的选择不再是非此即彼:托管 API(Mem0)适合快速起步,框架派(Letta)适合深度掌控,图谱派(Zep/Graphiti)适合事实频繁演变的场景,模块派(LangMem)适合已绑定 LangGraph 的团队。先想清楚你的 Agent 需要记住”什么类型”的信息,再选存储与框架——这比先选框架再硬塞记忆高效得多。