你有没有这种经历?
你跟一个AI编程助手合作了三个小时。你告诉它项目用TypeScript、部署在AWS、日志走CloudWatch、代码规范要跟团队约定保持一致。中间它帮你查了十几个文件,跑了二十几条命令,调试了三个bug。
然后——上下文窗口满了。
要么对话被截断,Agent忘掉前面做了什么。要么token烧到你怀疑人生,一个长任务跑下来大几百块没了。
更让人崩溃的是跨会话。今天你把所有背景交代清楚了,明天新开一个会话,它又像个刚入职的实习生一样问你:“你好,我能帮你做什么?”
你把同样的项目背景、同样的SOP、同样的技术规范重复了第38遍。不是在用AI,是在给AI当免费培训师。
这不是Agent的问题,是记忆的问题。
人类之所以能协作,是因为我们记得昨天聊过什么、上个月做了什么、今年在推进什么。但今天的AI Agent,每次新会话都是一张白纸。短期任务里上下文堆到爆炸,长期跨会话里经验归零。
腾讯云数据库团队显然也受够了这个痛点。他们花了6个月时间死磕一个问题:怎么让AI Agent拥有人类般的记忆?
6个月后,他们把自己造的那套记忆系统开源了。项目叫 TencentDB Agent Memory,MIT协议,完全本地运行。开源没多久就在GitHub上炸了——两天冲到日榜第二,14天积累了7600多颗星。
它到底做了什么,让开发者这么买账?
一、记忆不是"存得多",而是"记得对"
我们先退一步,想一个根本问题:人类的记忆是怎么工作的?
你不会把今天早上刷牙的每一个动作细节都存进长期记忆。你不会把地铁上听到的每一句闲聊都当作重要信息保留。你会自动筛选:哪些是噪音、哪些是事实、哪些是跟你长期目标相关的经验。
你做项目也一样。你不会每次开工都把整个项目历史通读一遍。你脑子里有一个"这个项目的画像"——技术栈是什么、团队规范是什么、当前推进到哪一步。这就是L3层的记忆。需要具体细节的时候,你才去翻文档、翻聊天记录。这就是向下钻取。
但今天主流的AI记忆系统,基本都做不到这一点。
它们通常走三条路,每条都缺条腿。
第一条路:全塞进上下文窗口。 简单粗暴,把历史对话一股脑堆给模型。但窗口有上限,塞多了token爆掉,塞少了信息不全。而且没有筛选——"我习惯用TypeScript"和"帮我查一下天气"被同等对待。事实和噪音混在一起,模型的注意力也被稀释。
第二条路:向量数据库做记忆。 把对话切成碎片,每个碎片转成向量,存到向量数据库里,需要时用相似度搜索捞回来。比全句上下文好一些,但问题也很明显:碎片之间失去了关系结构。"用户项目用TypeScript"和"用户部署在AWS"这两条事实在向量空间里可能离得十万八千里,召回的时候各召各的,Agent看到一堆孤立碎片,没有宏观的上下文指导。
第三条路:让大模型做摘要压缩。 每次对话结束后让模型自己总结。但这是不可逆的有损压缩——关键细节可能在摘要过程中就丢了。更麻烦的是,你没法验证模型有没有漏掉重要信息,因为原始对话已经不在系统里了。
腾讯团队的解法,用他们README里的话说就是:“拒绝扁平化存储,拥抱分层和符号化。”
翻译成大白话:把记忆拆成不同楼层,每层干不同的事。短期任务里用符号化画布压缩中间产物,长期跨会话里用四层金字塔沉淀经验。
二、四层金字塔:像人类一样记住该记住的
这是整个项目最核心的设计。他们把Agent的长期记忆拆成了四个层级:
L0:原始对话
全量保留每一轮交互,一字不落。这是整个系统的"证据底座"——不管上层怎么提炼、怎么压缩,原始对话永远在,随时可以回查。你不用担心模型在摘要里漏掉了什么,因为有原始记录兜底。
L1:原子事实
从对话中自动提取独立的原子事实。“用户习惯用pnpm而不是npm管理前端依赖”、“项目后端API端口是3001”、“日志系统用的是CloudWatch”——这些是离散的、可检索的、可复用的知识单元。每条事实都带着 source_message_ids,可以追溯到具体是哪段对话产生的。
L2:场景块
把相关的L1事实按场景聚合起来。“某商城项目的开发习惯”、“某线上排障的标准流程”、“某用户的测试偏好”——L1的单条事实适合检索,但不适合人和Agent长期阅读。L2把碎片组织成可理解的故事。
L3:用户画像
持续蒸馏出长期稳定的画像。你在日常对话中流露出的技术偏好、工作方式、沟通风格——这些不需要每次重新交代的信息,沉淀在这一层。它是一份 persona.md,打开就能看到Agent对你的理解。
这四层的设计,最妙的地方不是"分了多少层",而是层与层之间是渐进式揭示的关系。
Agent正常工作时,只需要关注L3——你的基本偏好和工作方式。需要更具体的上下文时,它沿着L3→L2→L1→L0一层层往下钻。就像你工作中先看周报摘要,遇到问题才翻到原始聊天记录,而不是每次都把整个项目的所有文档从头读到尾。
这个设计直接把"记忆"从"拼命记住更多"变成了"只在需要时找到对的"。底层保留证据,顶层保留结构。压缩可以发生,但压缩结果必须可追溯。
三、符号化记忆:用Mermaid画布把token砍掉60%
长任务的记忆问题分两种:一种是跨会话的遗忘,另一种是同一会话里的上下文膨胀。
很多人可能没意识到,在长任务中最大的token消耗者,不是你和Agent的对话内容,而是工具调用的中间日志。搜索结果、代码片段、报错栈、文件内容——这些过程产物动辄几万、几十万token,把上下文窗口死死撑满。
腾讯的方案非常巧妙地用了两个手段:上下文卸载 + Mermaid符号化画布。
具体怎么做?
第一步,当上下文窗口用到50%时,触发温和压缩——把完整工具日志卸载到外部文件系统(refs/*.md)。这些原始数据不在上下文中占用token,但保存在磁盘上,随时可查。
第二步,当用到85%时,触发激进压缩——把当前任务的结构提取出来,用Mermaid语法生成一张状态图。这张图里每个节点带一个 node_id,指向对应的原始日志文件。
第三步,注入上下文的是这张轻量级的Mermaid画布,通常只有几百token。Agent只需要在画布上推理——“当前任务进展到哪一步了”、“上一个工具调用的结果是什么”——而不需要把几十万token的日志全部吞进上下文中。
需要验证细节时,Agent通过 node_id 去磁盘上 grep 对应的原始日志。这比把全部日志塞进上下文高效得多,而且全程可追溯。
实际效果如何?测试数据给了三个场景:
- WideSearch 长搜索任务:Token消耗从221M降到85M,砍了61.38%;任务通过率从33%升到50%,相对提升51.52%。
- SWE-bench 连续编程任务:Token减少33%,通过率从58.4%升到64.2%。
- AA-LCR 长链推理:Token减少31%,成功率提高8%。
长期记忆方面,PersonaMem(用户画像准确度测试)从48%提升到76%——你的Agent终于能记住你是谁了。
这些数字不是孤立的单轮测试。SWE-bench是每会话跑50个连续任务,模拟真实世界中长周期Agent的上下文累积压力。这不是实验室条件下的漂亮数字,而是接近生产环境的实测数据。
四、行业启示:记忆正在成为Agent的分水岭
TencentDB Agent Memory的爆火,不只是因为技术数据好看。它踩中了AI Agent赛道一个正在快速成形的基础设施层——记忆层。
我们来看一下Agent记忆这个领域当前的竞争格局:
Mem0 是这个赛道的先行者。扁平向量存储,轻量级设计,接入简单。目前56k+ stars,生态成熟度最高。但它的核心问题就是刚才说的——扁平化。碎片丢进向量库,召回的时候是一堆孤立的相似片段,没有结构化的上下文关系。
Letta 走的是另一条路。它是完整的Agent运行时,让Agent自己去编辑和管理记忆块。理念很先进,但代价也很明显——你需要把整个Agent迁到Letta的运行时里,不只是一个插件。
TencentDB Agent Memory 的差异化定位很清晰:分层语义金字塔 + 符号化压缩 + 零依赖本地部署。它不是另一个向量数据库,也不是另一个Agent框架。它是一个可以插入现有Agent框架(OpenClaw、Hermes)的记忆插件。
这带来了一个重要的行业启示:
Agent的记忆不应该是一个"附加功能",而应该是一个独立的、可插拔的基础设施组件。
就像数据库之于应用、CDN之于内容分发,记忆应该是一个Agent开发者在搭建系统时就能直接选用的标准化组件。不是每个Agent团队都要从零造一套记忆系统,就像不是每个Web应用都要从零写一个数据库。
为什么这一点很重要?因为记忆质量直接决定了Agent的上限。
一个记不住你是谁、记不住项目背景、记不住昨天结论的Agent,充其量是一个高级的命令行工具。但一个能沉淀经验、能记住偏好、能跨会话保持上下文的Agent,才有资格被称作"协作者"。
这个边界一旦清晰,Agent才有可能从一次性问答工具,变成懂项目、懂团队习惯、还能自己翻工作笔记的真正的AI伙伴。
腾讯选择MIT协议开源这件事也值得注意。MIT是最宽松的开源协议之一——你可以商用,可以修改,可以闭源发布。这显然不是"放个开源项目做PR"的逻辑,而是"把记忆层做成行业基础设施"的打法。当所有Agent框架都能零成本接入这套记忆系统,它就有机会成为事实标准。
总结
TencentDB Agent Memory用一个四层语义金字塔告诉我们:Agent记忆的真正对手,不是"记不住",而是"记错了方式"。
扁平化向量存储记的是碎片。全量上下文记的是负担。不可逆摘要记的是风险。而分层记忆——底层保留证据、中层组织场景、顶层沉淀画像——记的才是真正的经验。
Token砍掉61%,任务成功率提升50%,用户画像准确率从48%到76%——这些数字的背后,不是一个"更快的向量搜索"或"更好的摘要模型",而是一套从根本上重新思考"记忆应该长什么样"的架构设计。
当记忆不再是Agent的短板,而是Agent的底座,AI才真正从工具变成了伙伴。
让Agent记住该记住的,人类才能专注该创造的。

439

被折叠的 条评论
为什么被折叠?



