PowerMem:87.79% 准确率背后的 Agent 记忆系统
2026/7/29 10:23:48 网站建设 项目流程

OceanBase 旗下的 PowerMem 仍在连续更新。这个项目看起来像一个“AI 记忆插件”,但如果只把它理解成向量数据库外面包了一层 SDK,就低估了它的野心。

它想解决的是 Agent 里一个很老、也很烦的问题:模型不是完全没记性,而是记得太粗;系统不是不能存东西,而是越存越乱。聊天记录、用户偏好、工具调用、失败经验、临时任务,全塞进一个向量库里,最后就像把发票、钥匙、充电线都扔进同一个抽屉。

PowerMem 做的事,是给这个抽屉加上分层、检索、衰减和复盘机制。

先看数字:它不是只讲概念

PowerMem 的 README 里给了两组 benchmark,分别来自 LOCOMO 和 AppWorld。前者更接近长对话记忆检索,后者更像 Agent 完成任务时能不能少绕路。

指标PowerMem基线变化
LOCOMO 准确率87.79%52.9%+65.9%
LOCOMO 检索 p95 延迟1.44 s17.12 s-91.6%
LOCOMO Token 开销约 0.9k26k-96.5%
AppWorld 通过率39%24%+62.5%
AppWorld 平均步数6.29.5-34.7%

这组数据该看的,不是单个准确率有多漂亮,而是三个指标一起往好处走:更准、更快、更省 Token。

如果一个记忆系统只能靠把大量历史上下文塞回 prompt 来提升表现,那它本质上是在用钱买记性。PowerMem 试图证明另一条路:先把记忆处理成可检索、可更新、可忘记的结构,再按任务需要取回少量关键内容。

四路检索:别再让向量库一个人背锅

很多 Agent 记忆方案一开始都会走向量检索。它简单、通用,听起来也很 AI。但向量检索有一个老毛病:语义相近不等于任务相关。

用户说“下次别用这个格式”,过几天 Agent 需要写文章时,向量相似度未必会把这条偏好排到前面。某个项目里的“上线失败原因”,可能和另一条“部署环境记录”关系很近,但单纯按 embedding 找,很容易漏掉关系链。

PowerMem 的设计是把向量检索、全文检索、图检索和时间/新近度信号放在同一层里融合。向量负责语义,全文负责关键词和精确匹配,图关系负责实体与事件之间的连接,时间衰减负责判断一条记忆是不是已经过期。

这个思路更接近真实工作台,而不是单一搜索框。找“老大不喜欢什么标题风格”,全文关键词可能很有用;找“上次为什么没有发布”,图关系和事件链更有用;找“类似场景怎么处理”,向量才更有用。

记忆不是硬盘,过期内容也会伤人

PowerMem 另一个核心点,是把记忆生命周期做成系统能力。它用 LLM 做记忆抽取、更新、合并,也引入了艾宾浩斯式的时间衰减。

这件事听起来有点玄,其实很工程。

Agent 的长期记忆如果只增不减,会出现两个问题。第一,检索噪声越来越大,旧偏好和新偏好打架;第二,系统开始把临时事实当长期事实,比如“今天下午三点开会”被永久保存,半年后还冒出来提醒你。

PowerMem 把记忆分成用户画像、私有记忆、短期记忆、长期记忆、共享记忆等不同层次,再根据重要性、访问频率和时间衰减做保留或清理。它不是简单地“记住一切”,而是让系统有机会判断:这条信息是规则、偏好、经验,还是一张已经过期的便签。

对 Agent 来说,忘记不是缺陷。不会忘,才是事故源头。

Experience + Skill:从“记事实”走向“学做事”

PowerMem 最有辨识度的地方,是它把记忆拆成了 Experience 和 Skill 两层。

Experience 更像“发生过什么”:某次对话、一次工具调用、一个失败案例、一个用户反馈。Skill 更像“以后怎么做”:从多次经验里蒸馏出的流程、偏好和操作套路。

这和普通 RAG 的差异很明显。RAG 多数时候是在回答“资料里有什么”;Agent 记忆要回答的,是“遇到类似场景时该怎么行动”。

举个例子,用户多次纠正公众号标题不要写“火了”“爆了”“刷屏了”。如果系统只记事实,它下次可能搜到几条纠正记录;如果系统能沉淀成 Skill,它应该直接形成一条写作规则:标题优先使用“项目名:核心技术判断”的结构,避开廉价热度模板。

这才是 Agent 记忆真正有价值的地方:不是让模型背更多聊天记录,而是让它少犯同一种错。

集成面很宽,但也意味着它还在早期工程期

PowerMem 目前提供 Python SDK、CLI、HTTP Server、MCP Server,也写了 Claude Code、Cursor、VS Code、Windsurf、GitHub Copilot、Qoder、OpenClaw 等集成路径。OpenClaw 可以通过memory-powermem插件接入,默认走 CLI 模式,本地用 SQLite,不一定要单独起服务。

从生态姿态看,它想做的是一层通用记忆后端:不同 Agent、不同 IDE、不同客户端,都连到同一个记忆服务。

但边界也要说清楚。PyPI 当前版本是1.1.7,项目分类仍标为 Alpha;GitHub 上还有配置校验、可观测性、记忆衰减公式、元数据持久化等 open issues。换句话说,它已经不是一个概念 demo,但也还没到“闭眼上生产”的阶段。

如果只是个人 Agent 或本地助手,PowerMem 的 CLI / SQLite / MCP 组合已经足够尝鲜。若要放进团队级生产环境,权限隔离、数据迁移、记忆可观测性、错误处理和评测复现,仍然需要自己认真压一遍。

它真正押注的是 Agent 的下一层基础设施

过去一年,Agent 讨论最多的是模型、工具调用和上下文窗口。记忆常常被当成附属功能:加个向量库,存几条偏好,能搜回来就算完成。

PowerMem 提醒了一件事:如果 Agent 要长期陪用户工作,记忆就不能只是“外置聊天记录”。它需要知道什么该进短期缓存,什么该进长期画像,什么该合并,什么该忘掉,什么能上升成可复用技能。

这也是它和 OpenClaw 这类多通道 Agent 系统天然相关的原因。一个助手如果活在飞书、Telegram、公众号工作流和本地文件里,难点不只是“存”,还要跨场景保持一致,又不把旧信息乱带到新任务里。

PowerMem 的方向是对的:把 Agent 记忆从单点检索,推向一套可演化的工程系统。

至于它能不能成为事实标准,还得看两件事:一是实际接入成本能不能继续降;二是 benchmark 之外,真实多用户、多工具、多权限场景里能不能稳住。

Agent 迟早要有长期记忆。问题只剩下:这套记忆,是一堆越积越乱的便签,还是一个会整理、会遗忘、会复盘的工作伙伴。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询