文章目录
- 前言
- 零、论文基本信息
- 一、背景:记忆演化为什么需要“规则”和“内容”分开学习
-
- 1. 长期个性化不是静态事实检索
- 2. Workflow-based 方法的问题:规则不会从结果中学习
- 3. RL Memory Agent 的问题:自由文本动作空间太大
- 4. 认知类比提供了什么设计线索
- 二、相关工作与本文位置
-
- 1. Memory construction 与 structured memory
- 2. Personalized memory
- 3. RL for Memory
- 4. Prompt optimization
- 三、任务建模
-
- 1. 对话与 Memory Bank
- 2. How 与 What 的准确含义
-
- How to Memorize
- What to Memorize
- 四、MemCoE 方法总览
- 五、阶段一:Memory Guideline Induction
-
- 1. 把 guideline 当作自然语言参数
- 2. 正负轨迹对比
- 3. 为什么必须做 contrastive feedback
- 4. Batch-level Gradient Aggregation
- 5. 更新 guideline
- 6. 最终 guideline 学到了什么
- 六、阶段二:Guideline-Aligned Memory Policy Optimization
-
- 1. 固定 guideline,训练 policy
- 2. Guideline-aware Reward
- 3. Answer Reward
- 4. 总轨迹奖励
- 5. 多轮 GRPO
- 6. 两阶段之间真正传递的是什么
- 七、实验设置
-
- 1. 三个个性化 benchmark
-
- PersonaMem
- PrefEval
- PersonaBench
- 2. Baselines
- 3. 实现细节
- 八、主实验:三个数据集、八种设置全部第一
-
- 1. Table 1 总结果
- 2. PersonaMem:长历史下优势扩大
- 3. PrefEval:隐式偏好仍明显更难
- 4. PersonaBench:噪声越高,所有方法都下降
- 九、消融:为什么必须先学 guideline,再做 policy optimization
-
- 1. 去掉 MGI:PrefEval 下降最大
- 2. 去掉 GMPO:PersonaMem 下降更明显
- 3. 去掉全部模块
- 4. CF 与 GR 都有独立贡献
- 十、迁移、检索与超参数分析
-
- 1. Guideline 能否跨 LLM 迁移
- 2. Retrieval Top-K
- 3. 每轮 token budget
- 4. Guideline optimization steps
- 5. MGI 与 TextGrad
- 十一、效率、长期保留与错误分析
-
- 1. Performance-Time Frontier
- 2. Preference retention
- 3. 错误来自 evolution 还是 generation
- 4. Scaling
- 十二、案例与反例
-
- 1. 偏好对齐推荐
- 2. 基础事实恢复
- 3. 论文中的明确反例
- 十三、与 Agent Memory 系列方法比较
-
- 1. MemCoE vs A-MEM / MAGMA
- 2. MemCoE vs Nemori
- 3. MemCoE vs Fine-Mem
- 4. MemCoE vs CoM / ReMemR1
- 十四、对 Coding Agent / Tool Agent / Multi-Agent 的启发
-
- 1. Coding Agent:先学习项目级 memory guideline
- 2. Tool Agent:guideline 应定义副作用与权限边界
- 3. Multi-Agent:统一团队共享记忆格式
- 4. Guideline 应成为可审计资产
- 十五、局限性
-
- 1. Guideline reward 依赖 LLM scorer
- 2. 规则既生成又评价,存在自洽偏差
- 3. 每轮 token budget 与轮数敏感
- 4. 固定 guideline 难以处理多目标冲突
- 5. 认知类比没有被独立验证
- 6. 主要是模拟与离线 benchmark
- 7. 隐私风险
- 8. Baseline 公平性仍有边界
- 9. Overall 混合不同指标
- 十六、我的理解与启发
-
- 1. MemCoE 的核心是先学习“动作语法”,再学习“动作内容”
- 2. Prompt 不再只是提示词,而是可迁移的控制平面
- 3. 好 guideline 必须来自“差异”,而不是只来自成功
- 4. Schema 与 Policy 不应永久单向
- 5. “如何记”与“记什么”之外,还有“为什么保留”
- 6. 最值得工程落地的是 guideline versioning
- 十七、总结
- 参考资料
前言
假设一个用户在很长一段时间里与个人 Agent 持续交流。
最开始,他说自己刚加入网球俱乐部;过了一段时间,他开始频繁讨论动作电影;再后来,他把大量精力投入数学课程。几个月后,用户问:“我现在适合参加什么活动?”
Agent 面临的并不只是“能否找到过去某句话”。它还要解决两个更深的问题:
现有 Workflow-based Memory 往往把这两个问题一起写进一个人工 prompt:要求模型抽取事实、合并冲突、更新用户画像。规则固定,无法从任务反馈中进化。
RL Memory Agent 则把更新操作交给策略模型学习,但又遇到另一个问题:模型可以自由生成大段 memory edits,而训练通常只有最终答案是否正确这一种稀疏奖励。动作空间大、监督又弱,长期训练很容易不稳定。
MemCoE 的切入点是:先不要直接训练模型“记什么”,而是先从成功与失败轨迹中学出一份稳定的记忆组织规范,再让 RL policy 在这份规范约束下学习具体更新内容。
作者用前额叶与海马体的功能分工做类比:
- “前额叶”负责配置 schema,对应 Memory Guideline;
- “海马体”负责把具体经历编码进 schema,对应 Agent Policy。
因此,本文的唯一核心增量是:
MemCoE 将自由文本式的记忆演化拆成“先学习如何组织记忆,再学习具体记什么”的两阶段优化:MGI 用对比轨迹产生 textual gradient,归纳全局 Memory Guideline;GMPO 固定该 guideline,以结构化过程奖励和答案奖励训练多轮 memory-evolution policy。
这篇论文的重要性不在于又设计了一种 memory schema,而在于它让 schema 本身成为可从任务轨迹中优化的自然语言参数,并用它收缩后续 RL 的搜索空间。
零、论文基本信息
- 论文名称:Learning How and What to Memorize: Cognition-Inspired Two-Stage Optimization for Evolving Memory
- 发表平台:ACL 2026 Long Papers
- 代码仓库:https://github.com/Applied-Machine-Learning-Lab/ACL2026_MemCoE
- 作者:Derong Xu、Shuochen Liu、Pengfei Luo、Pengyue Jia、Yingyi Zhang、Yi Wen、Yimin Deng、Wenlin Zhang、Enhong Chen、Xiangyu Zhao、Tong Xu
一、背景:记忆演化为什么需要“规则”和“内容”分开学习
1. 长期个性化不是静态事实检索
用户画像会随时间变化。
“喜欢动作电影”可能只是一个阶段偏好;“每周打网球”可能在受伤后失效;“不吃海鲜”与“最近开始尝试某类海鲜”之间可能存在时间性冲突。
如果 Agent 只是不断追加事实,memory bank 会越来越长、越来越矛盾。如果只做摘要,又容易覆盖变化过程,导致模型只记住最新状态却无法解释偏好如何演化。
因此,长期个性化 memory 至少需要:
- 抽取稳定事实与动态偏好;
- 保留时间和证据边界;
- 合并重复信息;
- 处理新旧冲突;
- 删除过时或无关内容;
- 为下游回答生成可用的结构化上下文。
2. Workflow-based 方法的问题:规则不会从结果中学习
Mem0、A-Mem、LightMem 等系统通常由人工设计 pipeline:先抽取、再压缩、再合并、最后检索。
这类方法容易控制,但 memory update rules 通常由开发者一次性写入 prompt。换一个用户域、标注标准或任务目标后,同一套规则未必合适。
例如,健康助手强调时间、剂量和禁忌;音乐推荐更关心风格、情绪与探索倾向。把所有场景压进一套静态模板,会让 schema 既不够稳定,也不够适应任务。
3. RL Memory Agent 的问题:自由文本动作空间太大
MemAgent、Mem-
α
\\alpha
α 等方法将 memory update 视为可学习动作,确实提高了适应性。但策略模型面对的是近乎无限的自由文本空间:
- 写哪些字段?
- 怎样区分事实与偏好?
- 如何表示时间变化?
- 怎样处理冲突?
- 哪些细节属于噪声?
如果训练只有最终答案正确率,模型必须从很远的结果信号反推每一步自由文本更新。论文将其概括为:large action space + sparse delayed reward。
4. 认知类比提供了什么设计线索
作者借用 memory schema theory,将“稳定组织规则”与“具体情境编码”分开。

图源:论文 Figure 1。上半部分展示有限上下文无法持续跟踪用户偏好;下半部分用“前额叶配置 schema、海马体编码具体经历”的功能类比,将系统拆成 Memory Guideline 与 Agent Policy。
这里应把认知解释理解为工程类比,不是神经科学层面的计算模型。论文并未建模真实脑区活动,也没有进行认知实验。真正可验证的方法贡献是两阶段优化,而不是“像人脑”本身。
二、相关工作与本文位置
1. Memory construction 与 structured memory
一类工作通过 segmentation、summarization、compression、forgetting 和 updating 建立外部 memory bank;另一类使用树或图索引改善结构与检索。
这些方法主要回答“memory 以什么形式存在”。MemCoE 声称与具体 backend 正交:它优化的是 memory evolution 行为,可以理论上接到不同存储系统前面。
2. Personalized memory
个性化记忆不仅要回忆用户事实,还要理解显式与隐式偏好,跟踪偏好变化,并将其用于推荐和回答。
MemCoE 选择 PersonaMem、PrefEval、PersonaBench,正是因为这些 benchmark 比普通事实 QA 更强调:
- 多 session;
- 动态偏好;
- 干扰信息;
- 隐式意图;
- 异构个人数据。
3. RL for Memory
RL Memory Agent 把保留、覆盖、压缩和更新变成策略行为。但现有方法多用 final success 或 final answer reward,缺少直接约束“memory 应怎样更新”的过程信号。
MemCoE 的关键不是放弃 outcome reward,而是先学习 guideline,再用 guideline scorer 形成 dense process reward。
4. Prompt optimization
TextGrad、OPRO 等方法把 prompt 当成自然语言参数,通过模型生成的 textual feedback 迭代改写。
MemCoE 的 MGI 属于这一方向,但它增加了两个针对长程 memory evolution 的设计:
- 正确轨迹与错误轨迹的对比诊断;
- mini-batch 层面的 textual gradient 聚合。
它优化的也不是单次回答 prompt,而是一份跨长历史反复使用的全局 memory guideline。
三、任务建模
1. 对话与 Memory Bank
第
t
t
t 段对话记作
h
t
h_t
ht,累计历史为:
H
=
{
h
1
,
h
2
,
…
,
h
t
}
H=\\{h_1,h_2,\\dots,h_t\\}
H={h1,h2,…,ht}
系统维护随对话演化的用户 memory bank
M
t
M_t
Mt。记忆更新由 evolution operator
T
\\mathcal T
T 完成:
M
t
+
1
=
T
(
M
t
,
h
t
;
S
,
ϕ
)
M_{t+1}=\\mathcal T(M_t,h_t;S,\\phi)
Mt+1=T(Mt,ht;S,ϕ)
其中:
-
M
t
M_t
Mt:更新前的用户记忆; -
h
t
h_t
ht:当前对话 chunk; -
S
S
S:控制更新方式的 Memory Guideline; -
ϕ
\\phi
ϕ:执行 memory evolution 的 LLM 参数。
面对任务或查询
x
x
x,Agent 基于当前 memory state 生成个性化回答:
y
t
=
A
(
x
,
M
t
)
y_t=\\mathcal A(x,M_t)
yt=A(x,Mt)
整个问题的核心,就是同时找到合适的 guideline
S
S
S 和策略参数
ϕ
\\phi
ϕ。
2. How 与 What 的准确含义
论文标题中的两问容易混淆。
How to Memorize
指记忆组织与更新应遵守什么规范,例如:
- memory 应有哪些结构区块;
- 如何保留证据与时间;
- 如何识别冲突;
- 哪些信息不应被过度收集;
- 更新输出必须遵循什么格式。
它由全局 guideline
S
S
S 表示。
What to Memorize
指面对一个具体用户和当前对话时,策略应写入、更新、合并或忽略哪些内容。
它由 policy
ϕ
\\phi
ϕ 在每条 trajectory 中决定。
MemCoE 不是把两者完全独立训练,而是先优化
S
S
S,再固定
S
⋆
S^\\star
S⋆ 训练
ϕ
\\phi
ϕ。
四、MemCoE 方法总览

图源:论文 Figure 2。左侧 MGI 从正负 memory trajectories 中提取 textual gradients,经过 batch aggregation 更新 guideline;右侧 GMPO 固定 guideline,用 guideline reward 与 answer reward 训练多轮 memory policy。
整体流程可以写成:
阶段一:Memory Guideline Induction
当前 guideline
→ rollout 多条 memory trajectories
→ 选正确与错误轨迹
→ 对比诊断形成 textual gradient
→ batch 聚合
→ 更新 guideline
阶段二:Guideline-Aligned Memory Policy Optimization
固定最优 guideline
→ rollout 多轮 memory evolution
→ guideline process reward + answer reward
→ GRPO 更新 policy
这是一种先收缩搜索空间、再做策略优化的设计。
如果直接做 RL,policy 既要探索“输出格式与组织原则”,又要探索“具体内容”。MGI 先把前者固化成 guideline,让 GMPO 将能力集中在后者。
五、阶段一:Memory Guideline Induction
1. 把 guideline 当作自然语言参数
在第
k
k
k 次优化时,当前 guideline 记作
S
(
k
)
S^{(k)}
S(k)。
系统用它处理一批训练样本。每个样本包含对话历史
H
H
H 与查询
x
x
x,模型多次前向 rollout,得到 trajectories
{
τ
i
}
\\{\\tau_i\\}
{τi}。
每条 trajectory 不只是最终答案,还包含中间 memory states,因此评价可以看到:某种 memory evolution 最终为什么成功或失败。
2. 正负轨迹对比
根据任务标签或环境反馈,系统至少选择一条正确轨迹
τ
+
\\tau^+
τ+,并把其余看似合理但结果较差的轨迹作为负例
{
τ
j
−
}
\\{\\tau_j^-\\}
{τj−}。
反馈 prompt
P
g
P_g
Pg 比较二者,生成自然语言诊断:
g
(
k
)
=
G
r
a
d
(
τ
+
,
{
τ
j
−
}
;
P
g
)
g^{(k)}=Grad(\\tau^+,\\{\\tau_j^-\\};P_g)
g(k)=Grad(τ+,{τj−};Pg)
g
(
k
)
g^{(k)}
g(k) 被称为 textual gradient。它并不是可反向传播的数值梯度,而是类似:
- 正确轨迹保留了带时间边界的最新偏好;
- 错误轨迹把临时兴趣合并成永久偏好;
- guideline 应明确区分稳定属性与阶段性行为;
- 冲突更新时要保留来源并标记旧状态失效。
3. 为什么必须做 contrastive feedback
只让模型解释失败,容易得到宽泛建议:“应该更准确”“避免遗漏”。
正负轨迹并排后,诊断可以聚焦真正差异:正确轨迹具体保留了什么,错误轨迹在哪一步破坏了信息。
消融中移除 Contrastive Feedback 后,PersonaMem 32K 从 57.06 降至 56.44,PrefEval Explicit 从 81.30 降至 78.30。降幅不如移除整个 MGI 大,但四项评估都下降,说明对比诊断确实比普通改写更稳定。
4. Batch-level Gradient Aggregation
单个样本的 textual gradient 可能非常局部。一个用户暴露的是时间冲突,另一个用户暴露的是隐式偏好,第三个用户暴露的是隐私过度收集。
系统用 aggregation prompt
P
a
P_a
Pa 将一个 mini-batch 中的反馈汇总:
G
(
k
)
=
A
g
g
r
(
{
g
(
k
)
}
(
H
,
x
)
;
P
a
)
G^{(k)}=Aggr(\\{g^{(k)}\\}_{(H,x)};P_a)
G(k)=Aggr({g(k)}(H,x);Pa)
聚合器要抽取跨样本重复出现的 failure patterns,并把它们提升为 guideline-level 修改方向。
这一层很关键。没有它,guideline 容易被最后一个样本牵着走;有了 batch aggregation,实例级批评才可能变成可迁移的全局规则。
5. 更新 guideline
优化器根据聚合后的 textual gradient 改写 guideline:
S
(
k
+
1
)
=
O
p
t
i
m
(
S
(
k
)
,
G
(
k
)
;
P
o
)
S^{(k+1)}=Optim(S^{(k)},G^{(k)};P_o)
S(k+1)=Optim(S(k),G(k);Po)
P
o
P_o
Po 要求模型在保留必要 placeholders 的前提下修改原 prompt。
论文将最终 guideline 写成近似期望奖励最大化:
S
⋆
=
arg
max
S
E
(
H
,
x
)
[
R
(
τ
+
,
{
τ
j
−
}
;
S
)
]
S^\\star=\\arg\\max_S\\mathbb E_{(H,x)} \\left[R(\\tau^+,\\{\\tau_j^-\\};S)\\right]
S⋆=argSmaxE(H,x)[R(τ+,{τj−};S)]
这是对优化过程的概念化表达。由于 textual gradient 与 rewrite operator 都由 LLM 实现,它不具有普通梯度下降的可微性与收敛保证。
6. 最终 guideline 学到了什么

附录 Figure 19 展示的最终 memory-evolution prompt 要求模型:
- 只抽取有证据支持的信息;
- 区分相对稳定的用户信息与具体经历;
- 对偏好和经历保留时间、上下文与演化关系;
- 处理新旧冲突与显式更新;
- 排除隐私敏感或缺乏支持的内容;
- 以指定结构生成更新后的用户画像。
这里值得注意:MGI 的结果仍然是一个 prompt,不是新的神经模块。但它是从任务轨迹中归纳出来的全局控制参数,而不是人工一次性手写。
六、阶段二:Guideline-Aligned Memory Policy Optimization
1. 固定 guideline,训练 policy
第二阶段固定
S
⋆
S^\\star
S⋆,将 evolution operator
T
\\mathcal T
T 和回答 Agent
A
\\mathcal A
A 的参数统一视为 policy
ϕ
\\phi
ϕ。
对每个训练样本
(
H
,
x
)
(H,x)
(H,x),系统生成一条多轮 trajectory:
h1 → 更新 M1
h2 → 更新 M2
…
ht → 更新 Mt
→ 基于最终 memory 回答 x
policy 学习的是:在 guideline 指定的结构内,面对每一段具体对话究竟保留、更新或遗忘什么。
2. Guideline-aware Reward
对 trajectory 中的每个 memory-update segment,LLM scorer 检查输出是否遵守
S
⋆
S^\\star
S⋆:
- 必需字段是否存在;
- 标签与结构是否正确;
- 更新是否符合 guideline 规定的组织方式。
所有 segment 的评分聚合成:
R
S
(
τ
;
S
⋆
)
∈
[
0
,
1
]
R_S(\\tau;S^\\star)\\in[0,1]
RS(τ;S⋆)∈[0,1]
它提供的是 process reward。即使最终答案还没生成,memory evolution 的结构质量也能得到反馈。
需要谨慎的是,正文对该 reward 的描述主要强调“格式、字段、标签与结构是否遵循 guideline”。因此它更接近 guideline compliance,而不是对 memory 内容正确性的完整裁判。
3. Answer Reward
最终答案与参考答案进行 exact match 或 judge match:
R
a
n
s
(
τ
)
∈
{
0
,
1
}
R_{ans}(\\tau)\\in\\{0,1\\}
Rans(τ)∈{0,1}
这个 reward 保留真正的任务目标,避免 policy 只学会写出漂亮结构,却不能提高个性化回答质量。
4. 总轨迹奖励
两种 reward 按权重组合:
R
(
τ
)
=
(
1
−
λ
)
R
S
(
τ
;
S
⋆
)
+
λ
R
a
n
s
(
τ
)
R(\\tau)=(1-\\lambda)R_S(\\tau;S^\\star)+\\lambda R_{ans}(\\tau)
R(τ)=(1−λ)RS(τ;S⋆)+λRans(τ)
λ
\\lambda
λ 控制 guideline fidelity 与答案正确率之间的平衡。
这也是 MemCoE 与单纯结果级 RL 的核心区别:模型既要答对,也要在此前的多轮 memory evolution 中持续遵守已经学出的组织规则。
5. 多轮 GRPO
对同一个
(
H
,
x
)
(H,x)
(H,x),policy 采样
G
G
G 条 trajectories,并按组归一化 reward:
A
^
i
=
R
i
−
m
e
a
n
(
{
R
j
}
j
=
1
G
)
s
t
d
(
{
R
j
}
j
=
1
G
)
\\hat A_i=\\frac{R_i-mean(\\{R_j\\}_{j=1}^{G})} {std(\\{R_j\\}_{j=1}^{G})}
A^i=std({Rj}j=1G)Ri−mean({Rj}j=1G)
一条 trajectory 又由多轮 conversations 组成:
τ
i
=
{
τ
i
,
1
,
τ
i
,
2
,
…
,
τ
i
,
n
i
}
\\tau_i=\\{\\tau_{i,1},\\tau_{i,2},\\dots,\\tau_{i,n_i}\\}
τi={τi,1,τi,2,…,τi,ni}
同一个 group-relative advantage 被分配给该 trajectory 中的 memory-update tokens 与 answer tokens,再通过 clipped policy objective 和 KL regularization 更新。
最终目标简写为:
ϕ
⋆
=
a
r
g
max
ϕ
E
(
H
,
x
)
∼
D
,
τ
∼
π
ϕ
(
⋅
∣
H
,
x
;
S
⋆
)
[
R
(
τ
)
]
\\phi^\\star=arg\\max_\\phi \\mathbb E_{(H,x)\\sim D,\\tau\\sim\\pi_\\phi(\\cdot\\mid H,x;S^\\star)}[R(\\tau)]
ϕ⋆=argϕmaxE(H,x)∼D,τ∼πϕ(⋅∣H,x;S⋆)[R(τ)]
6. 两阶段之间真正传递的是什么
MGI 不直接产生训练样本标签,也不修改模型权重;它产生
S
⋆
S^\\star
S⋆。
S
⋆
S^\\star
S⋆ 在第二阶段同时承担两个角色:
这使“规则”既参与生成,又参与评价。但也带来潜在自洽偏差:同一 guideline 定义什么是正确结构,scorer 又按它评分,未必等价于真实用户认为的好记忆。
七、实验设置
1. 三个个性化 benchmark
PersonaMem
包含 20 个模拟 personas,覆盖静态属性、动态特征和随时间变化的偏好。本文主实验使用约 32K 与 128K 历史:
| 32K | 589 | 10 | 167.1 |
| 128K | 2,727 | 20 | 758.3 |
| 1M | 2,674 | 60 | 3,607.9 |
论文还提供 1M 数据统计,但 Table 1 主结果只报告 32K 和 128K。
PrefEval
使用 1,000 个 Explicit 与 1,000 个 Implicit preference instances,并在偏好出现后插入 50 个干扰 turns。指标是四选一 accuracy。
PersonaBench
使用 6 个用户子集,共 263 个 queries、527 条 corpus records,来源包含人际对话、AI 对话和电商记录。论文在无噪声及 0.3、0.5、0.7 noise levels 下报告 macro F1。
2. Baselines
- Long Context;
- RAG;
- Mem0;
- A-Mem;
- LightMem;
- MemAgent;
- Mem-
α
\\alpha
α。
除此之外,附录还比较 Frozen、SFT、PPO、GRPO 等普通 post-training baselines,以及通用 prompt optimizer TextGrad。
3. 实现细节
- 主 backbone:Qwen2.5-7B-Instruct;
- Mem-
α
\\alpha
α 使用 Qwen3-4B; - Retriever:all-MiniLM-L6-v2;
- 默认 Top-K:10;
- 训练样本:PersonaMem 中 300 条;
- 每轮输入:默认 4K-token chunk;
- Stage 2 batch size:4;
- learning rate:
1
×
10
−
6
1\\times10^{-6}
1×10−6; - rollout batch size:8;
- rollout n:
{
2
,
4
,
8
}
\\{2,4,8\\}
{2,4,8}; - epochs:5;
- 实验硬件:4 张 A6000 GPU。
训练时先检索相关 dialogues 以降低计算量;推理主设置则输入 full dialogue history 做多轮 memory evolution。这个差异需要在理解 transferability 时保留。
八、主实验:三个数据集、八种设置全部第一
1. Table 1 总结果
| Long Context | 34.36 | 25.05 | 31.70 | 30.80 | 29.00 | 19.10 | 17.83 | 13.00 | 26.90 |
| RAG | 48.67 | 38.90 | 47.80 | 32.40 | 29.09 | 28.16 | 24.31 | 23.00 | 36.68 |
| Mem0 | 48.53 | 39.67 | 57.60 | 46.40 | 17.60 | 19.75 | 19.22 | 17.80 | 38.23 |
| A-Mem | 48.26 | 38.22 | 62.30 | 52.80 | 30.32 | 28.56 | 25.19 | 24.45 | 42.64 |
| LightMem | 50.72 | 39.93 | 64.20 | 54.80 | 19.08 | 18.74 | 19.65 | 17.80 | 41.21 |
| MemAgent | 53.58 | 43.59 | 72.30 | 63.60 | 20.05 | 19.36 | 16.51 | 17.92 | 45.00 |
| Mem-
α \\alpha α |
53.37 | 42.86 | 71.90 | 62.50 | 19.92 | 17.02 | 16.43 | 15.59 | 44.19 |
| MemCoE | 57.06 | 47.24 | 81.30 | 69.90 | 32.27 | 29.89 | 25.99 | 25.09 | 52.02 |
表源:论文 Table 1。PersonaMem 与 PrefEval 报 accuracy,PersonaBench 报 F1,因此 Overall 是跨不同指标设置的简单汇总,适合作为整体概览,但不应把 52.02 当成单一任务上的统一准确率。
MemCoE 在八列都取得第一,这是主实验最强的表面结论。
相对 overall 最强 baseline MemAgent:
52.02
−
45.00
=
7.02
52.02-45.00=7.02
52.02−45.00=7.02
绝对提升 7.02 分。提升主要来自 PrefEval 与 PersonaBench,而不是只在训练同分布 PersonaMem 上获益。
2. PersonaMem:长历史下优势扩大
32K 上,MemCoE 比 MemAgent 高 3.48 分;128K 上高 3.65 分。
分类结果显示,优势主要集中在:
- Recall facts;
- Preference evolution;
- Update reasons;
- Preference-aligned recommendations;
- New scenarios。
但 Suggest ideas 不是其优势:32K 只有 8.86,低于 Mem0 的 19.41;128K 为 11.68,仍低于 Long Context 的 23.36 和 Mem0 的 20.49。
这说明 MemCoE 更擅长保存并应用已有用户状态,不一定更擅长开放式创意生成。选择性 memory evolution 可能会收缩信息,反而减少开放式联想素材。
3. PrefEval:隐式偏好仍明显更难
MemCoE Explicit 为 81.30,Implicit 为 69.90,下降 11.40 分。
尽管它仍显著领先 baseline,但这说明 schema 与 policy 无法消除隐式偏好推断的本质难度:用户没有直接说“我喜欢什么”,系统需要从选择、行为与语气中推断。
分域结果也存在反例:Explicit 的 Pet 领域,MemCoE 为 67.44,低于 MemAgent 的 74.42。统一 guideline 并非对所有主题同样有效。
4. PersonaBench:噪声越高,所有方法都下降
MemCoE 从无噪声 32.27 降到 noise 0.7 的 25.09,绝对下降 7.18 分;Long Context 则从 29.00 降到 13.00。
MemCoE 的相对稳定性更好,说明 memory evolution 能过滤部分无关信息。但不能说它“对噪声免疫”:0.5 和 0.7 下仍有明显性能损失。
Basic Info 在无噪声时 Long Context 为 29.23,高于 MemCoE 的 26.74。简单事实查询并不一定需要复杂演化;对原始上下文的直接访问有时更可靠。
九、消融:为什么必须先学 guideline,再做 policy optimization
| MemCoE | 57.06 | 47.24 | 81.30 | 69.90 |
| w/o CF | 56.44 | 46.33 | 78.30 | 68.10 |
| w/o GR | 56.24 | 46.06 | 79.50 | 68.30 |
| w/o MGI | 54.81 | 44.50 | 73.20 | 63.60 |
| w/o GMPO | 53.37 | 43.97 | 77.40 | 66.20 |
| w/o ALL | 48.47 | 39.09 | 71.70 | 60.60 |
表源:论文 Table 2。CF 是 MGI 中的 contrastive feedback;GR 是 Stage 2 的 guideline reward;MGI 和 GMPO 分别是两个完整阶段。
1. 去掉 MGI:PrefEval 下降最大
移除 MGI 后:
- Explicit:81.30 → 73.20;
- Implicit:69.90 → 63.60。
没有全局 guideline,policy 仍可以通过 RL 学习,但对跨分布偏好任务的组织规则不够稳定。这支持 MGI 的 transfer 价值。
2. 去掉 GMPO:PersonaMem 下降更明显
移除 GMPO 后:
- 32K:57.06 → 53.37;
- 128K:47.24 → 43.97。
仅有好 guideline 不能替代 policy learning。静态 prompt 定义了“应该怎样做”,但模型仍需要学会在多轮具体历史中选择正确更新内容。
3. 去掉全部模块
w/o ALL 在 32K 为 48.47,接近普通 RAG 的 48.67;完整 MemCoE 为 57.06。
这说明提升不是来自换一个 memory prompt 的微小工程调整,而是两阶段学习共同作用。
4. CF 与 GR 都有独立贡献
去掉 CF 或 GR 的降幅较小,但四项都下降。CF 提高 guideline 归纳质量,GR 则让 policy 在训练时持续遵循 guideline。
这两个模块分别保证“规则学得对”和“规则执行得稳”。
十、迁移、检索与超参数分析
1. Guideline 能否跨 LLM 迁移
论文只使用 Stage 1 MGI,不做 RL,将由 Qwen2.5-7B 或 GPT-4o-mini 优化的 guideline 交给不同模型。
| RAG | 48.67 | 47.44 | 61.15 | 63.80 |
| A-Mem | 48.26 | 48.47 | 62.37 | 64.42 |
| MGI by Qwen2.5-7B | 53.37 | 52.56 | 64.62 | 66.67 |
| MGI by GPT-4o-mini | 52.56 | 54.19 | 64.83 | 67.28 |
表源:论文 Table 3。这里测的是 guideline 的跨模型迁移,不是完整 GMPO policy 的跨 backbone 零样本迁移。
两种 guideline 在四个 LLM 上都超过 RAG 和 A-Mem,说明学到的规则具有一定 model-agnostic 性。
但应准确描述证据边界:policy 本身没有在这些闭源模型之间迁移;迁移的是自然语言 guideline。
2. Retrieval Top-K

图源:论文 Figure 4 与 Figure 5。左图比较 Top-K 对不同方法的影响;右图比较每轮 token budget、所需最大轮数与准确率。
Figure 4 有两个重要现象:
- 普通 RAG 随
K
K
K 增大持续下降,K
=
40
K=40
K=40 时甚至低于 Empty Memory; - MemCoE 的 RAG 模式在
K
≈
20
K\\approx20
K≈20 达到最高点,并略高于 Full History。
这说明 retrieval 本身不等于 memory。更多片段可能增加干扰;只有后续 evolution 能把证据整合成一致用户状态时,检索过滤才真正有益。
3. 每轮 token budget
Figure 5 中:
| 1K | 52.35 |
| 2K | 54.81 |
| 4K | 57.06 |
| 8K | 55.83 |
| 16K | 54.19 |
| 32K | 53.99 |
预算太小,历史被切成很多轮,局部 update errors 会不断累积;预算太大,每轮上下文过于复杂,单次 evolution 难度上升。
最优点是 4K,说明 long-memory system 的 chunk size 不是纯工程参数,而会改变遗忘与整合行为。
4. Guideline optimization steps

附录 Figure 10 显示:MGI 优化步数从 10 增加后,四种设置都先提升,在中间步数达到峰值,随后下降。
过少时,textual gradients 尚未归纳出稳定规则;过多时,反复自然语言改写可能过拟合后期 batch,或放大不同 feedback 之间的矛盾。
这表明 prompt optimization 同样存在 early stopping 问题,并非迭代越多越好。
5. MGI 与 TextGrad
PersonaMem 32K、三随机种子结果:
| Manual Prompt |
48.25 ± 0.68 48.25\\pm0.68 48.25±0.68 |
| TextGrad |
49.83 ± 0.83 49.83\\pm0.83 49.83±0.83 |
| MemCoE only MGI |
53.28 ± 0.76 53.28\\pm0.76 53.28±0.76 |
表源:论文 Appendix Table 12。MemCoE 相对 TextGrad 的提升通过双侧 t-test,
p
<
0.05
p<0.05
p<0.05。
这支持 trajectory-grounded contrastive feedback 与 batch aggregation 的作用,也弥补了主实验缺少方差的部分不足。不过显著性结果只覆盖这个 prompt optimization 对照,不代表 Table 1 所有差异都已检验。
十一、效率、长期保留与错误分析
1. Performance-Time Frontier

图源:论文 Figure 3。横轴是 20 条 PersonaMem 32K histories 的 memory construction/evolution 时间,纵轴是性能,圆大小表示运行时间标准差。
MemAgent 最快,但分数低于 MemCoE;Mem0 与 A-Mem 明显更慢。MemCoE 位于较好的性能-时间前沿,而不是绝对最快。
作者将优势归因于 policy 已把 extraction、update、forgetting 内化为一次 memory evolution,而 workflow methods 需要反复调用 LLM 完成独立步骤。
图中没有精确列出所有方法的成本数字,也没有报告 GPU 成本与 Stage 1/Stage 2 总训练耗时,因此更准确的结论是“推理阶段的 memory evolution 具有较好时间-效果平衡”。
2. Preference retention

附录 Figure 7 把一个显式偏好放在 round 0,之后每轮输入 4K tokens,并用 Gemini-2.5-Pro 判断 memory 是否仍保留该偏好。
- round 0:两者都是 100%;
- round 10:MemCoE 约 74%,MemAgent 约 51%;
- MemCoE 绝对下降约 26%,MemAgent 约 49%。
这说明 guideline 对“不要被后续噪声轻易覆盖”确实有帮助。但 retention evaluator 仍是 LLM judge,且只测试 PrefEval Explicit。
3. 错误来自 evolution 还是 generation

Appendix Figure 8 将错误拆成:
- SE+SG:memory evolution 成功、generation 成功,77.1%;
- SE+FG:记住了但答错,3.1%;
- FE+SG:没正确记住但答对,4.2%;
- FE+FG:没记住且答错,15.6%。
最大错误来源是 FE+FG,说明主要瓶颈仍在 memory evolution,而不是最后的答案生成。
FE+SG 的存在也说明正确回答不必然证明 memory 正确:模型可能利用残余上下文或先验猜对。因此仅用 answer reward 训练会把一部分偶然正确轨迹误判为好 memory policy。
4. Scaling

附录 Figure 9 在 128K PersonaMem 上显示:随着 dialogue 从 4K 增到 128K,memory bank size 从约 500 增到约 2,000,增长趋势逐渐变缓;evolving time 则近似线性增加。
这支持系统在长历史中做了合并与去重,但横轴只到 128K。虽然数据集有 1M 版本,论文没有提供完整 1M 主结果与运行成本。
十二、案例与反例
1. 偏好对齐推荐
PersonaMem 案例中,用户希望周末进行有创造性的活动。正确选项是用自然声音创作音景,因为历史 memory 暗示用户对 sound engineering 和自然环境的兴趣。
MemCoE 选择正确选项,MemAgent、Mem-
α
\\alpha
α、A-Mem、LightMem、Mem0 均选错。这个案例说明正确回答依赖跨历史整合,而不是简单匹配“creative”关键词。
2. 基础事实恢复
PersonaBench 案例询问用户年龄与工作地点。MemCoE 分别回答 39 和 University,其他 memory baselines 大多回答 Unknown 或 Not specified。
这说明 evolution policy 有时能保留稀疏但长期有用的基本信息。
3. 论文中的明确反例
完整结果也显示一些不适合被成功案例遮蔽的问题:
- PersonaMem Suggest ideas 上显著落后多个 baseline;
- PrefEval Explicit 的 Pet 域低于 MemAgent;
- PersonaBench 无噪声 Basic Info 低于 Long Context;
- 普通 RAG 在高 Top-K 下被噪声拖累,但这也说明整体结果高度依赖 retrieval 设置。
因此,MemCoE 的优势主要是动态偏好追踪、冲突更新和噪声环境下的稳定个性化,不是所有开放式生成与事实查询的统一最优解。
十三、与 Agent Memory 系列方法比较
| A-MEM | memory notes 如何链接与演化 | LLM 驱动链接和更新 | Construction / Management |
| MAGMA | 多类型关系如何共同表示 | typed relation 与 multi-graph | Structure / Retrieval |
| CoM | query 时如何串联分散证据 | query-conditioned memory chain | Retrieval / Reasoning |
| ReMemR1 | 顺序压缩时如何回看历史 | callback retrieval policy | Reading / Update |
| Mem²Evolve | 经验如何变成跨任务能力 | task outcome 与 experience evolution | Cross-task Learning |
| Nemori | 新经历相对旧知识增加了什么 | semantic prediction error | Distillation |
| Fine-Mem | 如何把长期结果对齐到具体操作 | chunk reward + evidence attribution | RL Feedback |
| MemCoE | 如何先定义可学习的组织规则,再训练具体更新行为 | textual gradient guideline + guideline-aligned RL | Schema Induction / Policy Learning |
1. MemCoE vs A-MEM / MAGMA
A-MEM、MAGMA 的结构主要由方法设计者预先定义;MemCoE 让一部分组织规范从正负轨迹中归纳。
但 MemCoE 最终仍输出论文指定的文本用户画像,不等于自动发明任意数据库 schema。若接入 graph memory,MGI 还需要学习 node、edge、time 与 provenance 的约束,scorer 也必须验证图操作而不只是文本格式。
2. MemCoE vs Nemori
Nemori 用 prediction error 决定什么信息具有语义增量;MemCoE 用 guideline 定义组织原则,再用 outcome-driven RL 决定具体内容。
二者可以组合:Nemori 提供“相对旧知识的新内容”,MemCoE 负责把这些新内容按可学习 schema 写入长期用户画像,并根据个性化任务反馈改进 policy。
3. MemCoE vs Fine-Mem
两篇 ACL 2026 论文都认为结果级 reward 不够,但解法不同:
- Fine-Mem 细化信用分配,追踪哪一步产生了最终检索证据;
- MemCoE 细化行为约束,先诱导 guideline,再用 guideline compliance 构造过程奖励。
Fine-Mem 回答“最终成功应该奖励哪一步”,MemCoE 回答“每一步首先应该遵循什么组织规范”。最自然的组合是用 MemCoE 约束动作空间,再用 Fine-Mem 的 evidence attribution 将长期 utility 回传给具体步骤。
4. MemCoE vs CoM / ReMemR1
CoM 和 ReMemR1 主要改善信息使用与回看;MemCoE 改善写入和演化。检索时再聪明,也无法恢复 evolution 阶段已经错误覆盖的偏好。 
反过来,MemCoE 仍依赖 retrieval 提供相关上下文,Figure 4 证明 Top-K 会显著影响结果,因此 write-time policy 与 query-time retrieval 需要共同设计。
十四、对 Coding Agent / Tool Agent / Multi-Agent 的启发
以下是从论文机制推演出的工程应用,不是论文直接实验结论。
1. Coding Agent:先学习项目级 memory guideline
Coding Agent 不应把所有终端输出和源码片段都写入长期记忆。可以先从成功与失败任务轨迹中诱导规则:
- 保存稳定架构约束、测试命令和已验证根因;
- 区分临时调试猜测与确认事实;
- bug 修复后更新旧诊断,而不是保留矛盾结论;
- 不持久化密钥、临时 token 和用户隐私;
- 每条经验保留文件与证据来源。
随后再训练 policy 判断当前任务中具体写什么。
2. Tool Agent:guideline 应定义副作用与权限边界
Tool Agent 的 memory guideline 可以包含:
- 区分只读观察与外部写操作;
- 保存用户授权范围和对象 ID;
- 对失败调用记录 error class,但不长期保存敏感 payload;
- 状态发生变化时更新旧结论;
- 不把一次性 session 状态推广为永久事实。
这比只优化“任务最终成功”更安全,因为很多不合规操作即使最终成功也不应被强化。
3. Multi-Agent:统一团队共享记忆格式
多个 Agent 往往以不同风格写 shared memory,导致重复、冲突和责任不清。
MGI 可以从高质量协作轨迹中归纳团队 guideline;GMPO 再让不同角色在共享规则下学习具体记录。需要额外加入作者、来源、置信度与版本字段,防止多 Agent 合并后失去 provenance。
4. Guideline 应成为可审计资产
由于 guideline 直接决定系统“记住什么、忘掉什么”,生产系统应:
- 保存每一版 guideline;
- 记录修改它的 training batch 与反馈摘要;
- 对隐私、歧视和安全规则设置不可被自动优化删除的硬约束;
- 允许回滚到旧版本;
- 对不同用户域做独立验证。
十五、局限性
1. Guideline reward 依赖 LLM scorer
这是论文明确指出的首要限制。scorer 误判会直接污染过程奖励,policy 可能学会迎合评分器的格式偏好,而不是改善真实 memory quality。
2. 规则既生成又评价,存在自洽偏差
S
⋆
S^\\star
S⋆ 一方面告诉 policy 怎样写,另一方面又定义 scorer 怎样判。系统可能形成内部一致却不符合用户真实需求的闭环。
需要引入外部标准,例如事实支持、时间一致性、隐私规则与人工审核,而不能只依赖 guideline 自评。
3. 每轮 token budget 与轮数敏感
过多轮会积累小错误并造成遗忘,过大 chunk 又增加单轮处理难度。4K 在本文设置最好,但换数据域、模型和上下文长度后未必仍适用。
4. 固定 guideline 难以处理多目标冲突
论文目前把 memory evolution 视为固定 guideline 下的单一 policy。真实系统同时追求:
- stability 与 plasticity;
- informativeness 与 brevity;
- personalization 与 privacy;
- retention 与 deletion compliance。
这些目标不可能总由一份静态文本 guideline 自动平衡。
5. 认知类比没有被独立验证
“前额叶—海马体”帮助解释设计,但实验只验证两阶段计算框架有效,并未证明其提升来自与人类认知机制的一致性。
6. 主要是模拟与离线 benchmark
三个数据集都用于个性化 memory,但仍不能完全代表真实用户跨月交互。用户可能改变表述、主动纠正系统、要求删除记录,或故意给出矛盾信息。
7. 隐私风险
论文 Ethical Considerations 明确指出 persistent memory 可能导致过度收集与 unwanted profiling。作者建议数据最小化、避免敏感标识、提供查看/修正/删除控制,并在系统层实施 retention 与 access control。
但这些仍是部署建议,方法和实验没有实现可验证的级联删除、用户授权或隐私审计机制。
8. Baseline 公平性仍有边界
大多数方法使用 Qwen2.5-7B,而 Mem-
α
\\alpha
α 使用 Qwen3-4B;RL baselines 使用公开 checkpoint 后又在同一 300 samples 上训练。作者尽量统一数据与 retrieval 参数,但模型规模、原始训练和实现结构仍不完全等价。
9. Overall 混合不同指标
Table 1 将 PersonaMem/PrefEval accuracy 与 PersonaBench macro F1 放在同一个 Overall 中。它能提供整体排序,却没有严格统一的统计含义。
十六、我的理解与启发
1. MemCoE 的核心是先学习“动作语法”,再学习“动作内容”
自由文本 memory update 难训练,是因为 policy 同时承担太多决策。MemCoE 先把一部分决策提炼为 guideline,相当于给 RL policy 建立一套动作语法。
它不是减少操作数量,而是减少无意义的表达自由度。
2. Prompt 不再只是提示词,而是可迁移的控制平面
MGI 产生的 guideline 可以跨 Qwen、GPT、Gemini 迁移。这说明自然语言规则可以充当不同模型之间的控制平面。
模型权重负责执行,guideline 负责组织目标。与重新训练每个模型相比,这种中间层更便宜、更可审计,也更容易跨系统迁移。
3. 好 guideline 必须来自“差异”,而不是只来自成功
只看成功轨迹,很难知道哪些规则真正关键。正负轨迹对比把成功与失败之间的差异显式化,batch aggregation 再把偶然差异提升为稳定原则。
这与软件工程中的 regression analysis 很像:规则不是从一个好案例里总结,而是从“为什么这个版本通过、另一个版本失败”中提炼。
4. Schema 与 Policy 不应永久单向
论文采用先 MGI、后 GMPO 的单向两阶段流程。但 policy 部署后会遇到新 failure patterns,固定 guideline 可能逐渐过时。
更完整的系统应形成慢速与快速双循环:
慢循环:跨大量轨迹更新 global guideline
↓
快循环:在固定 guideline 下更新或执行 policy
↓
收集新失败与用户纠正
↓
重新触发慢循环
这比每次都在线改 guideline 更稳定,也比永久冻结更能适应分布变化。
5. “如何记”与“记什么”之外,还有“为什么保留”
MemCoE 提供 schema 与 policy,Fine-Mem 提供 evidence-based credit,Nemori 提供 semantic novelty。三者分别对应:
- How:按什么规则组织;
- What:当前具体写入什么;
- Why:这条记忆为什么值得长期保留。
一个成熟 memory system 应同时保留这三类信息,否则系统只能执行更新,却无法解释更新的依据和后续效用。
6. 最值得工程落地的是 guideline versioning
MemCoE 让记忆规则可被自动修改,也意味着规则本身可能漂移。生产环境中,guideline 应像代码和数据库 schema 一样被版本化、测试、审计和回滚。
这可能是论文没有展开,但实际部署最重要的启发之一。
十七、总结
MemCoE 解决的是 RL Memory Agent 中一个上游问题:自由文本 memory update 的动作空间太大,而最终答案奖励又太稀疏。
它没有直接在这个空间中强行探索,而是先学习一份全局 guideline:
正负 trajectories
→ contrastive textual gradient
→ batch-level aggregation
→ optimized memory guideline
随后固定 guideline,用 process reward 与 answer reward 训练多轮 memory policy:
guideline 约束和评分 memory updates
+ 最终答案正确性
→ GRPO
→ 学习具体保留、更新和遗忘内容
主实验中,MemCoE 在 PersonaMem、PrefEval、PersonaBench 的八种设置上全部取得最高结果,Overall 为 52.02,比最强 baseline MemAgent 高 7.02 分。消融表明 MGI 与 GMPO 缺一不可;跨 LLM 实验则说明自然语言 guideline 具有一定可迁移性。
但其优势主要集中在动态偏好追踪、长程更新与抗噪个性化。Suggest ideas、部分 Pet 域和简单 Basic Info 存在明确反例;guideline scorer、自洽偏差、token budget 敏感性、隐私控制和真实长期交互仍是重要边界。
最后一句话:MemCoE 的真正贡献,是把“记忆规则”从人工写死的 prompt 提升为可从正负轨迹中学习的全局参数,再让 RL policy 在这套规则内学习每一次具体记忆更新。





