MemHarness – 上海 AI Lab 等推出的智能体记忆重构框架
MemHarness:革新 LLM Agent 记忆机制的重构框架
由上海 AI Lab 携手浙江大学、复旦大学、上海交通大学等顶尖学府联合打造的 MemHarness,为大型语言模型(LLM)Agent 的记忆增强带来了性的突破。与当前普遍采用的直接将检索到的历史经验注入上下文的模式不同,MemHarness 认识到这种“照搬”做法可能适得其反,当旧经验与当前情境不符时,反而会引发“负迁移”,损害 Agent 的性能。
MemHarness 的核心价值
MemHarness 的设计灵感源于人类记忆的精妙重构过程。它在 Agent 进行信息检索与执行动作之间,巧妙地嵌入了一个至关重要的“批判与重构”环节。通过这个环节,Agent 能够结合当前的上下文信息,对历史经验进行审慎的评估,决定是保留、修改还是彻底舍弃。更令人称道的是,MemHarness 采用了 GRPO(Generalized Proximal Policy Optimization)算法进行端到端训练,整个过程无需额外的人工标注,极大地提升了效率和通用性。
MemHarness 的关键功能
- 智能记忆检索:Agent 能根据当前的观察生成精准的查询,从 Milvus 向量记忆库中高效召回最相关的历史经验及其对应的原始状态。
- 批判性记忆重构:一个统一的策略模型负责比对记忆的来源状态与当前状态,批判性地评估其适用性。它能将经验重写成与当前状态相匹配的指导信息,或者直接判定为不适用并将其丢弃。
- 精准动作生成:基于重构后的指导信息,或者通过 Agent 的自主推理能力,生成切实可行的环境动作。
- 经验回写与动态剪枝:每一次交互结束后,Agent 会将轨迹的精华提炼成经验,并存入记忆库。同时,系统会进行语义去重,并定期根据经验的价值进行剪枝,确保记忆库的效率和相关性。
- 无缝的端到端训练:通过 GRPO 算法,MemHarness 能够联合优化检索、重构以及动作生成等多个环节,完全摆脱了对重构阶段标注数据的依赖。
MemHarness 的技术精髓
- 五阶段决策流程:MemHarness 将记忆驱动的决策过程分解为环境观测、经验检索、记忆批判、上下文记忆重构以及动作生成这五个连续的阶段。这一流程模拟了人类“检索—评估—重构”的认知模式,彻底颠覆了传统 Agent 简单回放记忆的静态范式。
- 上下文感知记忆重构机制:其策略模型能够将任务描述、当前对话历史、检索到的经验及其来源状态拼接在一起,构建一个丰富的重构上下文。通过对比历史来源状态与当前状态的差异,模型能够识别并保留可迁移的知识,修正不匹配的内容,甚至在必要时输出“
<EMPTY>”标记,表示拒绝该记忆并回退到自主推理。 - 统一策略模型架构:MemHarness 的独特之处在于,其用于生成检索查询、批判性记忆重构以及生成可执行动作的三个关键阶段,全部共享同一个策略模型参数。这意味着无需为重构模块单独训练价值网络或准备监督数据,记忆的利用与决策的推理在同一模型内实现了紧密的耦合。
- GRPO驱动的端到端训练:鉴于重构过程产生的指导信息缺乏客观的真值标注,MemHarness 巧妙地运用 GRPO 算法,对从检索到重构再到行动的全链路进行端到端的优化。奖励信号由稀疏的任务结果和格式奖励构成,通过组归一化优势(Group-wise Normalization of Advantages),将轨迹级别的信用有效地分配给每一个 token,从而同步训练 Agent 的思考、重构和动作生成能力。
想要深入了解并参与 MemHarness 的开源项目,请关注我们的微信公众号,并回复“开源”加入AI开源项目交流群。
如何快速上手 MemHarness
- 环境搭建:首先,克隆我们的 GitHub 仓库(https://github.com/KnowledgeXLab/MemHarness.git)。然后,创建一个基于
python==3.12的 Conda 环境,并依次安装 vLLM、Flash Attention 2 以及 MemHarness 本体。 - 部署嵌入服务:启动 BGE-M3 嵌入模型,命令为
vllm serve BAAI/bge-m3 --port 8001。这将为 Milvus 记忆库提供必要的向量编码服务。 - 安装目标交互环境:根据您的具体任务需求,安装 ALFWorld 或 WebShop 交互环境,并下载相应的游戏文件和预训练检测器。
- 冷启动 SFT(可选):如果您需要进行冷启动,可以运行
scripts/build_*_coldstart_data.py来构建初始数据,然后执行scripts/cold_start_sft.sh脚本,使模型能够对齐交互格式和记忆摘要格式。 - GRPO 端到端训练:执行
run_scripts/train_alfworld.sh或run_scripts/train_webshop.sh脚本。框架会自动启动记忆向量数据库,并执行 Agent 的检索、经验回写与剪枝过程,最终完成 GRPO 训练。
MemHarness 的突出优势
- 重构的卓越表现优于简单回放:通过引入显式的批判与重构环节,MemHarness 将静态的记忆片段转化为与上下文高度契合的指导信息,有效规避了负迁移的风险。
- 小模型实现大模型级的性能:在 ALFWorld 和 WebShop 等基准测试中,仅 7B 参数规模的 MemHarness 模型,其表现已分别超越了 Gemini-2.5-Pro 23.1% 和 39.7%。
- 强大的 OOD(分布外)鲁棒性:在处理分布外场景时,MemHarness 的平均成功率高达 85.9%,显著优于仅采用原始记忆回放的 76.3%。
- 隐式推理能力的显著增强:即使在测试阶段关闭记忆功能,经过重构训练的目标机制依然能将基础策略的成功率从 76.4% 提升至 83.0%,从根本上强化了 Agent 的内在推理能力。
- 无需额外的标注工作:MemHarness 的重构能力是通过 GRPO 端到端训练自然涌现的,完全不依赖人工编写的监督数据。
MemHarness 的项目链接
- GitHub 仓库:https://github.com/KnowledgeXLab/MemHarness
- HuggingFace 模型库:https://huggingface.co/KnowledgeXLab/MemHarness
- arXiv 技术论文:https://arxiv.org/pdf/2607.28272
MemHarness 与同类竞品对比
| 维度 | MemHarness | EvolveR |
|---|---|---|
| 记忆范式 | 显式记忆库 + 状态条件重构 | 显式记忆库 + 经验演化 |
| 核心机制 | 检索后批判重构,保留/改写/丢弃 | 检索后直接注入,依赖经验演化迭代 |
| 训练方式 | GRPO 端到端,无需重构标注 | RL 训练,记忆经验需逐步演化积累 |
| OOD 表现 | 85.9%(ALFWorld OOD) | 未重点报告 OOD 鲁棒性 |
| 可解释性 | 重构过程可检查,支持 EMPTY 拒绝 | 记忆注入过程相对黑盒 |
| 模型规模 | 7B 即超越 Gemini-2.5-Pro | 通常需更大规模或更多训练步数 |
MemHarness 的广泛应用场景
- 智能家居助手:在 ALFWorld 等模拟家庭环境中,Agent 能够重构过往的取物、清洁经验,并灵活适配不同的房间布局,高效完成复杂的家务任务。
- 个性化在线购物:在 WebShop 等电商平台,Agent 可以根据过往购物经验重构出当前最适合的商品搜索和筛选策略,显著提高达成购物目标的成功率。
- 高效智能客服:客服 Agent 在检索到历史相似工单后,能够将其内容重构为适用于当前问题的解决方案,避免了直接套用旧答复而导致的答非所问。
- 辅助代码开发:编程 Agent 可以重构过往的代码 bug 修复经验,并结合当前的上下文提供精准的修复建议,而非简单地照搬旧方案。
- 科研实验优化:科研 Agent 能够基于历史实验参数和结果,重构出当前实验条件的最优配置建议,从而大幅降低试错成本,加速科研进程。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...


