欢迎光临
我们一直在努力

【论文阅读】Agent 记忆机制(63):SAMem——把经验记忆细化为带长期价值的状态—Thought

文章目录

  • 前言
  • 零、论文基本信息
  • 一、问题背景:记忆为什么需要与“当前状态”对齐
    • 1. Task-level Memory 的错位
    • 2. Scene-level Memory 仍然不够细
    • 3. 为什么不能只记 Action
    • 4. 三种粒度的直观差别
  • 二、相关工作:SAMem 在经验记忆路线中的位置
    • 1. Reflexion:围绕失败形成任务内反思
    • 2. ExpeL 与 AWM:任务级经验和工作流
    • 3. AutoGuide 与 CDMem:从任务级走向场景级
    • 4. SAMem 的区别
  • 三、理论基础:从 Action-value 到 Thought-value
    • 1. MDP 定义
    • 2. 标准 Q-learning
    • 3. SAMem 的关键抽象:Thought 是高层动作
  • 四、SAMem 方法总览
  • 五、模块一:从 Observation History 构造 State
    • 1. 为什么不能直接使用当前 Observation
    • 2. State 的例子
    • 3. Jericho 的特殊处理
  • 六、模块二:形成 State–Thought–Action 轨迹
    • 1. 生成 Thought
    • 2. Thought 为什么要去指代化
    • 3. Thought 与 Action 的分工
  • 七、模块三:State 与 Thought 的在线聚类
    • 1. 为什么必须聚类
    • 2. State Cluster Matching
    • 3. 双层聚类的作用
    • 4. 默认阈值
  • 八、模块四:用 Q-learning 更新 Thought 价值
    • 1. Bellman Target
    • 2. Temporal-Difference Update
    • 3. Q 值改变了记忆排序逻辑
    • 4. 奖励传播为什么适合多步任务
  • 九、模块五:衰减

    ϵ

    \\epsilon

    ϵ-greedy 平衡探索与利用

    • 1. 训练早期不能完全相信空白记忆
    • 2. 指数衰减
    • 3. 测试阶段
  • 十、模块六:遗忘低价值且逻辑不一致的记忆
    • 1. 为什么不能只按 Q 值删除
    • 2. 触发与软剪枝
    • 3. 遗忘机制的边界
  • 十一、一个案例:同一任务中为什么每一步需要不同记忆
  • 十二、实验设置
    • 1. 三个多步决策环境
    • 2. 模型与实现
    • 3. Baseline
    • 4. 指标
  • 十三、主实验结果
    • 1. GPT-4o
    • 2. GPT-4o-mini
    • 3. Qwen-2.5-72B-Instruct
    • 4. Llama-3.1-70B-Instruct
    • 5. 证据边界
  • 十四、训练迭代:细粒度记忆如何逐步形成
  • 十五、效率:成功之外,是否少走了弯路
    • 1. SPL
    • 2. Token Cost
  • 十六、核心消融:哪一部分真正决定性能
    • 1. Q-learning 是价值化记忆的核心
    • 2. Situation Processing 决定状态能否复用
    • 3.

      ϵ

      \\epsilon

      ϵ-greedy 的增益较小但一致

    • 4. 尚未被拆开的因素
  • 十七、遗忘机制:容量下降是否意味着记忆更好
  • 十八、相似度阈值:粒度、性能与容量的三角关系
  • 十九、Thought-level 为什么优于 Action-level
  • 二十、失败模式与反例
    • 1. State Summary 可能丢失关键细节
    • 2. 状态聚类存在 aliasing
    • 3. Thought 聚类可能把表面近义、实际相反的策略合并
    • 4. 稀疏奖励使 Q 值难以稳定
    • 5. Tabular Q-learning 难以扩展到开放状态空间
    • 6. 低 Q 值不等于错误记忆
    • 7. Jericho 不是 unseen-task 泛化
  • 二十一、与 Agent Memory 系列方法的横向比较
    • 1. 与 A-MEM / MAGMA 的关系
    • 2. 与 CFGM 的关系
    • 3. 与 DCM-Agent 的关系
    • 4. 与 Mem²Evolve 的关系
  • 二十二、对 Coding Agent、Tool Agent 与 Multi-Agent 的启发
    • 1. Coding Agent:从“任务经验”转向“开发状态—策略”
    • 2. Tool Agent:Thought 作为工具策略层
    • 3. Multi-Agent:为协作状态选择协调 Thought
    • 4. 实际工程中应把 Q 值拆成多目标价值
  • 二十三、局限性
    • 1. 作者明确承认的局限
      • 1.1 Q-table 的扩展性
      • 1.2 稀疏或零奖励
    • 2. 进一步的局限
      • 2.1 强 Summarizer 混入 Backbone 比较
      • 2.2 Markov 假设依赖摘要完整性
      • 2.3 Thought 到 Action 的唯一映射假设过强
      • 2.4 Q 值没有不确定性
      • 2.5 遗忘实验只验证容量
      • 2.6 主结果混合不同量纲
      • 2.7 状态摘要带来持续 token 与延迟成本
  • 二十四、我的理解和启发
    • 1. SAMem 将“记忆检索”改写成“语义强化学习”
    • 2. 最有价值的不是 Q-learning,而是把 Thought 定义为记忆动作
    • 3. State Summary 是 SAMem 最关键也最脆弱的隐变量
    • 4. 更合理的下一步是带不确定性的状态—Thought 图
    • 5. Forgetting 应从删除变成“降级与归档”
    • 6. SAMem 与 CFGM 可以组成更完整的在线闭环
  • 二十五、总结
  • 参考资料

前言

前面讨论 CFGM 时,我们看到经验记忆可以从环境级 Focus Points、任务级 Tips 一直细化到异常发生时的 Key Information;讨论 DCM-Agent 时,又看到记忆结构需要尊重任务内部的不同推理空间,把建模逻辑和代码实现分开组织。

SAMem 把问题继续向在线决策推进了一步:即使检索到的是正确任务、正确场景中的经验,它也未必适合 Agent 此刻所处的状态。

例如,在 ALFWorld 的 “cool an object” 任务中,Agent 大致会经历:

  • 搜索目标物品;
  • 拿起目标物品;
  • 前往能够冷却物品的位置;
  • 执行冷却;
  • 把物品送到最终容器。
  • 如果系统只保存一份任务级指南,那么“先搜索物品”“前往冰箱”“完成后去最终容器”等提示会在每一步同时出现。它们都与任务有关,却只有一条适合当前状态。信息越多,模型反而越容易失焦。

    场景级记忆比任务级记忆更细,但仍然存在两个问题:

    • 同一场景可能对应多个不同进度,例如刚到冰箱、已经打开冰箱、已经完成冷却;
    • ScienceWorld、Jericho 等环境未必存在稳定、清晰的场景边界。

    SAMem(State-Aware Memory)因此不再问“当前任务最像哪段经验”,而是问:

    在与当前状态相似的历史状态里,哪一种高层 reasoning thought 带来了最高的长期收益?

    它先把原始 observation 历史总结为 state,再把 LLM 的 Thought 视为一种高层动作。历史交互被写入一张状态—Thought Q 表:行是状态簇,列是 Thought 簇,每个单元格的 Q 值表示“在该状态采用这种思路”的长期价值。训练时使用 Q-learning 更新价值,测试时检索当前状态下最高价值的 Thought 来指导动作。

    因此,这篇论文的唯一核心增量可以概括为:

    SAMem 将经验记忆从任务级或场景级的全局经验,重构为带 Q 值的状态—Thought 细粒度记忆,使 Agent 能在每个决策步骤按当前状态选择长期价值最高的推理方向。

    Situation Summarization、在线聚类、

    ϵ

    \\epsilon

    ϵ-greedy 和遗忘机制,都是为了让这张状态—Thought Q 表能够形成、更新和保持可用,而不是与核心贡献并列的四个独立创新。

    零、论文基本信息

    论文名称: SAMem: State-Aware Memory as a Fine-Grained Memory for LLM Agents in Decision-Making

    发表平台: Findings of the Association for Computational Linguistics: ACL 2026,pp. 14691–14710

    代码仓库: 论文、ACL Anthology 页面及作者公开材料未提供可核验的官方代码仓库

    作者: Tong Wang、Pei Xu、Shiyue Cao、Likun Yang、Daipeng Li、Jianbin Jiao、Kaiqi Huang

    一、问题背景:记忆为什么需要与“当前状态”对齐

    1. Task-level Memory 的错位

    任务级记忆通常把一次完整经验保存为:

    M

    i

    =

    (

    T

    a

    s

    k

    i

    ,

    T

    r

    a

    j

    e

    c

    t

    o

    r

    y

    i

    ,

    I

    n

    s

    i

    g

    h

    t

    i

    )

    .

    M_i=(Task_i,Trajectory_i,Insight_i).

    Mi=(Taski,Trajectoryi,Insighti).

    面对新任务

    T

    a

    s

    k

    n

    e

    w

    Task_{new}

    Tasknew 时,系统根据整体任务相似度检索:

    M

    =

    arg

    max

    M

    i

    s

    i

    m

    (

    T

    a

    s

    k

    n

    e

    w

    ,

    T

    a

    s

    k

    i

    )

    .

    M^*=\\arg\\max_{M_i}sim(Task_{new},Task_i).

    M=argMimaxsim(Tasknew,Taski).

    这类方法适合短任务,因为整个任务只经历少量决策。但在长链任务中,同一条 Insight 会被重复用于所有时间步:

    a

    t

    π

    (

    a

    t

    T

    a

    s

    k

    n

    e

    w

    ,

    o

    0

    :

    t

    ,

    M

    )

    .

    a_t\\sim\\pi(a_t\\mid Task_{new},o_{0:t},M^*).

    atπ(atTasknew,o0:t,M).

    问题是

    M

    M^*

    M 与任务相关,不代表与当前

    t

    t

    t 时刻相关。搜索阶段的建议在执行阶段可能变成干扰,结束阶段的建议在尚未找到目标物品时则完全没有帮助。

    2. Scene-level Memory 仍然不够细

    AutoGuide、CDMem 等方法根据轨迹片段或环境场景检索局部经验,相比整任务记忆已经更具体。但 scene 不是一个稳定的决策单位:

    • Agent 在同一房间里的任务进度可以完全不同;
    • 同一 observation 在不同历史下可能具有不同含义;
    • 有些文本环境不断变化,没有明确的“场景切换”标志。

    SAMem 认为,真正决定下一步动作的是由历史和当前观察共同构成的 situational state。

    3. 为什么不能只记 Action

    如果把记忆写成

    (

    s

    t

    a

    t

    e

    ,

    a

    c

    t

    i

    o

    n

    )

    (state,action)

    (state,action),系统可以学到“在冰箱前执行 cool”。但具体 action 绑定对象编号、环境语法和当前实体,例如:

    cool bread 1 with fridge 1

    它很难直接迁移到 apple 2 或另一个环境。

    SAMem 选择保存高层 Thought:

    你已经到达可进行冷却的位置,应使用当前可用的冷却容器处理目标物品。

    Thought 表达“为什么要做下一步”,具体 Action 再由当前实体和环境决定。因此,它比 action 更抽象,又比整任务 insight 更贴近当前决策。

    4. 三种粒度的直观差别

    在这里插入图片描述

    Figure 1:SAMem 的研究动机。 Task-level 与 Scene-level Memory 因缺少当前状态粒度,可能向 Agent 提供错位信息;State-level Memory 只检索与当前决策情境匹配的细粒度指导。

    Figure 1 的重点并不是“状态级一定包含更少文字”,而是检索条件发生了变化:

    Task Similarity

    Scene Similarity

    State Alignment

    .

    \\text{Task Similarity} \\rightarrow \\text{Scene Similarity} \\rightarrow \\text{State Alignment}.

    Task SimilarityScene SimilarityState Alignment.

    粒度越细,记忆的适用时间范围越窄,但对当前动作的指向性越强。

    二、相关工作:SAMem 在经验记忆路线中的位置

    1. Reflexion:围绕失败形成任务内反思

    Reflexion 将失败轨迹转换为语言反思,帮助下一次尝试避免同样错误。它证明了自然语言经验可以改善 Agent,但反思主要绑定一次任务或一次 retry,并没有显式学习“某个 Thought 在某类状态下的长期价值”。

    2. ExpeL 与 AWM:任务级经验和工作流

    ExpeL 从成功、失败轨迹中提取 insight,并按新任务相似度检索成功经验;AWM 从轨迹中归纳抽象 workflow。这类记忆适合描述整项任务的操作框架,但在每一步都提供同一批全局知识,容易造成状态错位。

    3. AutoGuide 与 CDMem:从任务级走向场景级

    AutoGuide 找到成功与失败轨迹的分叉点,抽取 context-aware guideline;CDMem 编码专家记忆、短期记忆和长期记忆,并结合环境与任务上下文检索。它们比整任务经验更细,但论文认为 scene/context 仍可能覆盖多个决策状态。

    4. SAMem 的区别

    SAMem 不是把轨迹切成更短的 chunk,而是改变经验单元:

    Trajectory / Workflow / Guideline

    (

    S

    t

    a

    t

    e

    ,

    T

    h

    o

    u

    g

    h

    t

    ,

    Q

    )

    .

    \\text{Trajectory / Workflow / Guideline} \\rightarrow (State,Thought,Q).

    Trajectory / Workflow / Guideline(State,Thought,Q).

    检索目标也从“最相似经验”变为“当前状态下预期长期回报最高的 Thought”。相似度只负责把新状态映射到已有状态簇,最终排序依据是 Q-value。

    三、理论基础:从 Action-value 到 Thought-value

    1. MDP 定义

    论文将 LLM Agent 与环境的交互表示为 MDP:

    (

    S

    ,

    A

    ,

    P

    ,

    R

    ,

    γ

    )

    ,

    (\\mathcal{S},\\mathcal{A},P,R,\\gamma),

    (S,A,P,R,γ),

    其中:

    • S

      \\mathcal{S}

      S 为状态空间;

    • A

      \\mathcal{A}

      A 为动作空间;

    • P

      (

      s

      s

      ,

      a

      )

      P(s'\\mid s,a)

      P(ss,a) 为状态转移概率;

    • R

      (

      s

      ,

      a

      )

      R(s,a)

      R(s,a) 为即时奖励;

    • γ

      \\gamma

      γ 为折扣因子。

    目标是找到策略

    π

    (

    a

    s

    )

    \\pi(a\\mid s)

    π(as),最大化折扣累计回报:

    G

    t

    =

    k

    =

    0

    γ

    k

    R

    t

    +

    k

    +

    1

    .

    G_t=\\sum_{k=0}^{\\infty}\\gamma^kR_{t+k+1}.

    Gt=k=0γkRt+k+1.

    2. 标准 Q-learning

    标准 Q-learning 更新为:

    Q

    (

    s

    t

    ,

    a

    t

    )

    Q

    (

    s

    t

    ,

    a

    t

    )

    +

    α

    [

    r

    t

    +

    1

    +

    γ

    max

    a

    Q

    (

    s

    t

    +

    1

    ,

    a

    )

    Q

    (

    s

    t

    ,

    a

    t

    )

    ]

    .

    Q(s_t,a_t)\\leftarrow Q(s_t,a_t)+ \\alpha\\left[ r_{t+1}+\\gamma\\max_{a'}Q(s_{t+1},a')-Q(s_t,a_t) \\right].

    Q(st,at)Q(st,at)+α[rt+1+γamaxQ(st+1,a)Q(st,at)].

    Q

    (

    s

    ,

    a

    )

    Q(s,a)

    Q(s,a) 表示在状态

    s

    s

    s 执行动作

    a

    a

    a,之后遵循最优策略能够获得的最大期望累计回报。

    3. SAMem 的关键抽象:Thought 是高层动作

    SAMem 不直接在低层 Action 空间学习,而是把 LLM 生成的 reasoning thought 记作

    t

    h

    th

    th。论文假设每个 Thought 唯一决定相应 Action,于是将 MDP 抽象为:

    (

    S

    ,

    T

    h

    ,

    P

    ,

    R

    ,

    γ

    )

    ,

    (\\mathcal{S},\\mathcal{Th},P',R',\\gamma),

    (S,Th,P,R,γ),

    并令:

    P

    (

    s

    s

    ,

    t

    h

    )

    =

    P

    (

    s

    s

    ,

    a

    )

    ,

    P'(s'\\mid s,th)=P(s'\\mid s,a),

    P(ss,th)=P(ss,a),

    R

    (

    s

    ,

    t

    h

    )

    =

    R

    (

    s

    ,

    a

    )

    .

    R'(s,th)=R(s,a).

    R(s,th)=R(s,a).

    最优推理方向为:

    t

    h

    =

    arg

    max

    t

    h

    T

    h

    Q

    (

    s

    ,

    t

    h

    )

    .

    th^*=\\arg\\max_{th\\in\\mathcal{Th}}Q(s,th).

    th=argthThmaxQ(s,th).

    这一步是整篇论文最重要的建模选择:它把自然语言 Thought 从不可控的中间文本,变成可聚类、可估值、可检索的经验动作。

    但“Thought 唯一决定 Action”是一个强假设。同一高层想法可能对应不同对象、工具或动作序列;反过来,同一个 Action 也可能来自不同推理。SAMem 在实验环境中通过 LLM 根据 Thought 重新生成具体 Action,近似实现这种映射,而不是严格证明一一对应。

    四、SAMem 方法总览

    框架包含 Construction 与 Utilization 两部分。

    在这里插入图片描述

    Figure 2:SAMem 完整框架。 Construction 阶段依次形成 state–thought 轨迹、在线聚类、更新 Q-table,并通过 Q 值与逻辑检查执行遗忘;Utilization 阶段在训练中使用衰减

    ϵ

    \\epsilon

    ϵ-greedy,在测试中用当前状态对应的最高价值 Thought 指导决策。

    整体数据流可以写成:

    O

    b

    s

    0

    :

    t

    L

    L

    M

    s

    u

    m

    m

    a

    r

    y

    s

    t

    L

    L

    M

    (

    t

    h

    t

    ,

    a

    t

    )

    e

    n

    v

    (

    r

    t

    ,

    s

    t

    +

    1

    )

    c

    l

    u

    s

    t

    e

    r

    +

    Q

     

    u

    p

    d

    a

    t

    e

    S

    A

    M

    e

    m

    .

    Obs_{0:t} \\xrightarrow{LLM_{summary}} s_t \\xrightarrow{LLM} (th_t,a_t) \\xrightarrow{env} (r_t,s_{t+1}) \\xrightarrow{cluster+Q\\ update} SAMem.

    Obs0:tLLMsummary

    stLLM

    (tht,at)env

    (rt,st+1)cluster+Q update

    SAMem.

    最终记忆不是轨迹列表,而是一张稀疏表:

    S

    A

    M

    e

    m

    =

    Q

    :

    S

    c

    l

    u

    s

    t

    e

    r

    ×

    T

    h

    c

    l

    u

    s

    t

    e

    r

    R

    .

    SAMem=Q:\\mathcal{S}_{cluster}\\times\\mathcal{Th}_{cluster}\\rightarrow\\mathbb{R}.

    SAMem=Q:Scluster×ThclusterR.

    每个单元格同时隐含了三层信息:某类状态、某类 Thought,以及这种组合带来的经验价值。

    五、模块一:从 Observation History 构造 State

    1. 为什么不能直接使用当前 Observation

    单条 observation 往往只描述当前画面,不包含已经完成的子目标。例如“你到达 fridge 1”无法告诉 Agent:

    • 是否已经找到并拿起目标物品;
    • 目标是否已经冷却;
    • 哪些位置已经搜索过;
    • 下一步应操作还是前往最终容器。

    SAMem 将截至

    t

    t

    t 的所有原始 observation 输入总结模型:

    O

    b

    s

    0

    :

    t

    =

    (

    o

    b

    s

    0

    ,

    o

    b

    s

    1

    ,

    ,

    o

    b

    s

    t

    )

    ,

    Obs_{0:t}=(obs_0,obs_1,\\ldots,obs_t),

    Obs0:t=(obs0,obs1,,obst),

    s

    u

    m

    t

    L

    L

    M

    s

    u

    m

    m

    a

    r

    y

    (

    O

    b

    s

    0

    :

    t

    )

    ,

    sum_t\\leftarrow LLM_{summary}(Obs_{0:t}),

    sumtLLMsummary(Obs0:t),

    并定义:

    s

    t

    =

    s

    u

    m

    t

    .

    s_t=sum_t.

    st=sumt.

    state 是一段简洁的情境摘要,同时包含历史进度和当前信息。

    2. State 的例子

    附录给出 ALFWorld 示例:

    You have found the target object.
    You have picked up the target object.
    You have arrived at fridge.

    它比原始轨迹短,又保留决定下一步的事实。因此,State Summarization 实际上承担了 working memory 压缩功能。

    3. Jericho 的特殊处理

    Jericho 是叙事型交互游戏,历史 observation 很长,但当前 observation 往往已经足够描述现场。论文因此只总结当前原始 observation,而非完整

    O

    b

    s

    0

    :

    t

    Obs_{0:t}

    Obs0:t

    这说明 “state” 并不是统一模板,而是环境相关的状态估计。SAMem 的核心虽然是 state-aware,state 本身仍依赖 Prompt 和 LLM 摘要质量。

    六、模块二:形成 State–Thought–Action 轨迹

    1. 生成 Thought

    给定

    s

    t

    s_t

    st,LLM 先生成高层 Thought:

    t

    h

    t

    L

    L

    M

    (

    s

    t

    )

    .

    th_t\\leftarrow LLM(s_t).

    thtLLM(st).

    再基于该 Thought 生成具体 Action

    a

    t

    a_t

    at,与环境交互并获得奖励

    r

    t

    r_t

    rt 和下一状态

    s

    t

    +

    1

    s_{t+1}

    st+1

    完整轨迹为:

    τ

    =

    {

    s

    0

    ,

    t

    h

    0

    ,

    a

    0

    ,

    r

    0

    ,

    s

    1

    ,

    ,

    s

    t

    ,

    t

    h

    t

    ,

    a

    t

    ,

    r

    t

    ,

    s

    t

    +

    1

    }

    .

    \\tau=\\{s_0,th_0,a_0,r_0,s_1,\\ldots,s_t,th_t,a_t,r_t,s_{t+1}\\}.

    τ={s0,th0,a0,r0,s1,,st,tht,at,rt,st+1}.

    2. Thought 为什么要去指代化

    为避免 Thought 过度绑定具体实体,论文在 System Prompt 中要求:

    • 表达去指代化;
    • 避免引用具体对象名称或编号;
    • 保留可迁移的推理模式。

    例如不记:

    用 fridge 1 冷却 bread 1。

    而记:

    当前已到达能够执行冷却的位置,应使用可用冷却容器处理目标物品。

    这种 Thought 可以迁移到不同物体和房间布局。

    3. Thought 与 Action 的分工

    Thought 负责表达决策语义,Action 负责满足环境接口:

    s

    t

    t

    h

    t

    a

    t

    .

    s_t\\rightarrow th_t\\rightarrow a_t.

    stthtat.

    SAMem 对

    t

    h

    t

    th_t

    tht 估值,却让 LLM 根据当前上下文生成

    a

    t

    a_t

    at。因此记忆复用的是“推理方向”,而不是机械复现历史命令。

    七、模块三:State 与 Thought 的在线聚类

    1. 为什么必须聚类

    自然语言 State 和 Thought 几乎每次表述都不同。如果直接把每条文本当作独立行列,Q-table 会迅速稀疏膨胀,历史价值也无法迁移到语义相近的新状态。

    SAMem 使用 text-embedding-v3 将 State 和 Thought 编码为 1024 维向量,并分别在线聚类。

    2. State Cluster Matching

    对新状态

    s

    s

    s,计算其与现有状态向量的余弦相似度:

    s

    i

    m

    (

    s

    ,

    s

    i

    )

    =

    e

    s

    e

    s

    i

    e

    s

    e

    s

    i

    .

    sim(s,s_i)=\\frac{e_s\\cdot e_{s_i}} {\\|e_s\\|\\|e_{s_i}\\|}.

    sim(s,si)=es∥∥esiesesi.

    若最大相似度高于阈值

    θ

    s

    i

    m

    \\theta_{sim}

    θsim,则合并到最近状态簇;否则创建新状态行:

    C

    l

    u

    s

    t

    e

    r

    (

    s

    )

    =

    {

    arg

    max

    i

    s

    i

    m

    (

    s

    ,

    s

    i

    )

    ,

    max

    i

    s

    i

    m

    (

    s

    ,

    s

    i

    )

    >

    θ

    s

    i

    m

    ,

    N

    e

    w

    S

    t

    a

    t

    e

    ,

    otherwise

    .

    Cluster(s)= \\begin{cases} \\arg\\max_i sim(s,s_i),&\\max_i sim(s,s_i)>\\theta_{sim},\\\\ NewState,&\\text{otherwise}. \\end{cases}

    Cluster(s)={argmaxisim(s,si),NewState,maxisim(s,si)>θsim,otherwise.

    Thought 使用同样的过程形成 Thought Cluster。

    3. 双层聚类的作用

    状态聚类让相似情境共享经验,Thought 聚类让语义相近的推理表达共享 Q 值。最终一个 transition 被映射到:

    (

    s

    ˉ

    t

    ,

    t

    h

    ˉ

    t

    ,

    a

    t

    ,

    r

    t

    ,

    s

    ˉ

    t

    +

    1

    )

    .

    (\\bar s_t,\\bar{th}_t,a_t,r_t,\\bar s_{t+1}).

    (sˉt,thˉt,at,rt,sˉt+1).

    这里的

    s

    ˉ

    \\bar s

    sˉ

    t

    h

    ˉ

    \\bar{th}

    thˉ 表示簇级条目。

    4. 默认阈值

    论文默认:

    θ

    s

    i

    m

    =

    0.85.

    \\theta_{sim}=0.85.

    θsim=0.85.

    阈值低会把不同状态错误合并,记忆过粗;阈值高会建立大量近似状态,扩大状态空间并降低检索效率。后文 Figure 7、Figure 9 分别分析 State 与 Thought 阈值,均支持选择 0.85 作为折中。

    八、模块四:用 Q-learning 更新 Thought 价值

    1. Bellman Target

    映射到簇后,SAMem 根据即时奖励和下一状态最佳 Thought 的价值计算目标:

    Q

    (

    s

    t

    ,

    t

    h

    t

    )

    =

    r

    t

    +

    g

    a

    m

    m

    a

    max

    t

    h

    Q

    (

    s

    t

    +

    1

    ,

    t

    h

    )

    .

    Q'(s_t,th_t)=r_t+gamma\\max_{th}Q(s_{t+1},th).

    Q(st,tht)=rt+gammathmaxQ(st+1,th).

    论文公式(4)的

    max

    \\max

    max 项排版为

    Q

    (

    s

    t

    +

    1

    ,

    t

    h

    t

    )

    Q(s_{t+1},th_t)

    Q(st+1,tht),但结合标准 Bellman 最优方程、正文描述和 Algorithm 1,应理解为在下一状态的候选 Thought 上取最大值。

    2. Temporal-Difference Update

    随后进行增量更新:

    Q

    (

    s

    t

    ,

    t

    h

    t

    )

    (

    1

    α

    )

    Q

    (

    s

    t

    ,

    t

    h

    t

    )

    +

    α

    Q

    (

    s

    t

    ,

    t

    h

    t

    )

    ,

    Q(s_t,th_t)\\leftarrow (1-\\alpha)Q(s_t,th_t)+\\alpha Q'(s_t,th_t),

    Q(st,tht)(1α)Q(st,tht)+αQ(st,tht),

    其中

    α

    \\alpha

    α 是学习率,

    γ

    \\gamma

    γ 是折扣因子。

    展开后等价于:

    Q

    (

    s

    t

    ,

    t

    h

    t

    )

    Q

    (

    s

    t

    ,

    t

    h

    t

    )

    +

    α

    [

    r

    t

    +

    g

    a

    m

    m

    a

    max

    t

    h

    Q

    (

    s

    t

    +

    1

    ,

    t

    h

    )

    Q

    (

    s

    t

    ,

    t

    h

    t

    )

    ]

    .

    Q(s_t,th_t)\\leftarrow Q(s_t,th_t)+ \\alpha\\left[ r_t+gamma\\max_{th}Q(s_{t+1},th)-Q(s_t,th_t) \\right].

    Q(st,tht)Q(st,tht)+α[rt+gammathmaxQ(st+1,th)Q(st,tht)].

    3. Q 值改变了记忆排序逻辑

    传统经验检索通常按:

    S

    c

    o

    r

    e

    (

    M

    i

    )

    =

    s

    i

    m

    (

    q

    u

    e

    r

    y

    ,

    k

    e

    y

    i

    )

    .

    Score(M_i)=sim(query,key_i).

    Score(Mi)=sim(query,keyi).

    SAMem 分两步:

  • 相似度决定当前输入属于哪个 State Cluster;
  • Q 值决定该 State 下哪个 Thought 最值得使用。
  • 因此,相似度解决“当前在哪”,Q 值解决“在这里应该怎么想”。

    4. 奖励传播为什么适合多步任务

    一个 Thought 的即时动作可能没有奖励,但它可能把 Agent 带到未来成功所需的状态。折扣项将后续价值向前传播:

    Q

    (

    s

    t

    ,

    t

    h

    t

    )

    r

    t

    +

    γ

    r

    t

    +

    1

    +

    γ

    2

    r

    t

    +

    2

    +


    .

    Q(s_t,th_t)\\approx r_t+\\gamma r_{t+1}+\\gamma^2r_{t+2}+\\cdots.

    Q(st,tht)rt+γrt+1+γ2rt+2+.

    这比仅统计某条 Thought 是否紧邻最终成功更合理,因为长链任务中的搜索、准备和移动动作通常没有即时正奖励。

    九、模块五:衰减

    ϵ

    \\epsilon

    ϵ-greedy 平衡探索与利用

    1. 训练早期不能完全相信空白记忆

    Q-table 初始化为 0。训练初期如果总选择当前最高 Q 值,系统会被少量偶然经验锁定,无法探索替代 Thought。

    SAMem 在训练中采用:

    (

    t

    h

    ,

    a

    )

    {

    L

    L

    M

    (

    s

    )

    ,

    概率 

    ϵ

    t

    ,

    L

    L

    M

    (

    s

    ,

    arg

    max

    t

    h

    Q

    (

    s

    ,

    t

    h

    )

    )

    ,

    概率 

    1

    ϵ

    t

    .

    (th,a)\\leftarrow \\begin{cases} LLM(s),&\\text{概率 }\\epsilon_t,\\\\ LLM(s,\\arg\\max_{th}Q(s,th)),&\\text{概率 }1-\\epsilon_t. \\end{cases}

    (th,a){LLM(s),LLM(s,argmaxthQ(s,th)),概率 ϵt,概率 1ϵt.

    第一种是不受记忆指导的探索,第二种利用当前最高价值 Thought。

    2. 指数衰减

    探索率随训练步数下降:

    ϵ

    t

    =

    ϵ

    0

    exp

    (

    β

    t

    T

    )

    ,

    \\epsilon_t=\\epsilon_0\\exp\\left(-\\beta\\frac{t}{T}\\right),

    ϵt=ϵ0exp(βTt),

    论文设置:

    ϵ

    0

    =

    0.95

    ,

    β

    =

    6.

    \\epsilon_0=0.95,\\qquad\\beta=6.

    ϵ0=0.95,β=6.

    训练早期几乎都由 LLM 自主探索,后期逐渐依赖已经学出的 SAMem。高价值 Thought 又会产生更好的新轨迹,继续更新 Q-table,形成正反馈。

    3. 测试阶段

    测试时不再进行

    ϵ

    \\epsilon

    ϵ 探索,而是在当前 State Cluster 中检索最高 Q 值 Thought:

    t

    h

    (

    s

    )

    =

    arg

    max

    t

    h

    Q

    (

    s

    ,

    t

    h

    )

    ,

    th^*(s)=\\arg\\max_{th}Q(s,th),

    th(s)=argthmaxQ(s,th),

    再将

    s

    s

    s

    t

    h

    th^*

    th 一起交给 LLM 生成最终 Thought 和 Action。

    十、模块六:遗忘低价值且逻辑不一致的记忆

    1. 为什么不能只按 Q 值删除

    低 Q 值可能来自 Thought 本身不合理,也可能因为探索次数少、奖励稀疏或后续轨迹偶然失败。如果直接删除所有低值项,会把尚未充分评估的经验误删。

    SAMem 因此使用“双重验证”:

  • Q-value 筛选;
  • LLM logical check。
  • 2. 触发与软剪枝

    当某个 State 下非零 Q 值 Thought 超过 5 个,系统认为该状态探索较充分。随后选出最低价值 Thought,让 LLM 判断它与 State 是否逻辑一致。

    若不一致,不立即物理删除文本,而是将其 Q 值置为 0:

    Q

    (

    s

    ,

    t

    h

    i

    n

    v

    a

    l

    i

    d

    )

    0.

    Q(s,th_{invalid})\\leftarrow0.

    Q(s,thinvalid)0.

    之后删除完全为空的状态行或 Thought 列。

    这种做法称为 soft pruning。它把遗忘限制在“低价值 + 逻辑不合理”的交集里,比纯数值阈值更谨慎。

    3. 遗忘机制的边界

    LLM logical check 仍可能犯错;Q 值为 0 也不等于没有潜在价值。论文只验证了遗忘可缩小 Memory Size,没有报告它对任务性能、误删率或恢复能力的影响。

    十一、一个案例:同一任务中为什么每一步需要不同记忆

    在这里插入图片描述

    Figure 10:ALFWorld 冷却任务中的案例比较。 ExpeL 在各步重复提供整任务指南,CDMem 按场景提供任务和环境 insight,但仍可能在尚未到达冰箱时直接执行冷却;SAMem 根据“已拿到物品”“已到达冰箱”“已完成冷却”三个状态依次选择前往冰箱、执行冷却和前往最终容器的高价值 Thought。

    这个案例清楚地区分了三种记忆:

    • ExpeL: 内容与任务相关,但每一步看到的指南几乎相同;
    • CDMem: 能利用当前环境信息,但 Scene-level Insight 仍无法完整表示任务进度;
    • SAMem: 状态随子目标完成而变化,检索出的 Thought 也随之变化。

    SAMem 的优势不是知道更多环境事实,而是让指导内容与决策阶段对齐。

    但这个案例是作者选取的单个成功示例,不能证明所有失败都来自粒度错位。State Summary 写错、聚类错位或 Q 值估计错误时,SAMem 同样可能选择错误 Thought。

    十二、实验设置

    1. 三个多步决策环境

    环境

    训练设置

    测试设置

    主要指标

    ALFWorld

    6

     类各 

    5

     个任务

    134

     个未见任务

    S

    R

    ,

     

    S

    P

    L

    ScienceWorld

    30

     类各 

    3

     个任务

    90

     个未见任务

    S

    R

    ,

     

    A

    R

    Jericho

    20

     个游戏任务

    同一任务集在线演化

    S

    R

    ,

     

    A

    R

    \\begin{array}{l|l|l|l} \\textbf{环境} & \\textbf{训练设置} & \\textbf{测试设置} & \\textbf{主要指标} \\\\ \\hline \\text{ALFWorld} & 6\\text{ 类各 }5\\text{ 个任务} & 134\\text{ 个未见任务} & SR,\\ SPL \\\\ \\text{ScienceWorld} & 30\\text{ 类各 }3\\text{ 个任务} & 90\\text{ 个未见任务} & SR,\\ AR \\\\ \\text{Jericho} & 20\\text{ 个游戏任务} & \\text{同一任务集在线演化} & SR,\\ AR \\end{array}

    环境ALFWorldScienceWorldJericho训练设置6 类各 5 个任务30 类各 3 个任务20 个游戏任务测试设置134 个未见任务90 个未见任务同一任务集在线演化主要指标SR, SPLSR, ARSR, AR

    实验环境设置。 ALFWorld 与 ScienceWorld 在训练任务上建忆、在 unseen test 上评测;Jericho 按 AgentBoard 的 20 个游戏任务训练和评测,用于观察在线演化能力。

    ScienceWorld 覆盖全部 30 个任务类型,并按标准轨迹长度分成三个难度级别。附录描述中,Level-2 任务需要 20–70 步,却写最大步数为 20,Level-3 最大步数为 40;这一设置可能截断部分标准轨迹,论文没有进一步解释。

    2. 模型与实现

    论文在四个 Backbone 上运行:

    • GPT-4o;
    • GPT-4o-mini;
    • Qwen-2.5-72B-Instruct;
    • Llama-3.1-70B-Instruct。

    Situation Summarization 统一使用 GPT-4o;索引使用 1024 维 text-embedding-v3。所有记忆算法在训练集上执行 9 个 iteration。主结果为 3 次运行平均值。

    这一设置意味着,即便策略 Backbone 是开源 Qwen 或 Llama,SAMem 仍依赖 GPT-4o 构建 State,因此不能将结果解释为完全本地或完全同模型的记忆系统。

    3. Baseline

    对比方法包括:

    • Reflexion;
    • ExpeL;
    • AWM;
    • AutoGuide;
    • CDMem。

    它们大致覆盖失败反思、任务级经验、工作流记忆、轨迹片段指南和场景级上下文记忆。

    4. 指标

    • SR: Success Rate;
    • AR: Average Reward / Score;
    • SPL: Success weighted by Path Length,兼顾成功与路径长度。

    论文给出的 SPL 为:

    R

    S

    P

    L

    =

    1

    N

    i

    =

    1

    N

    S

    u

    c

    c

    e

    s

    s

    i

    L

    i

    max

    (

    P

    i

    ,

    L

    i

    )

    ,

    R_{SPL}=\\frac{1}{N}\\sum_{i=1}^{N} Success_i\\frac{L_i}{\\max(P_i,L_i)},

    RSPL=N1i=1NSuccessimax(Pi,Li)Li,

    其中

    L

    i

    L_i

    Li 是最优路径长度,

    P

    i

    P_i

    Pi 是实际路径长度,

    S

    u

    c

    c

    e

    s

    s

    i

    {

    0

    ,

    1

    }

    Success_i\\in\\{0,1\\}

    Successi{0,1}。论文公式下方对

    P

    i

    P_i

    Pi

    L

    i

    L_i

    Li 的文字说明出现互换:它写

    P

    i

    P_i

    Pi 为实际路径长度,但前句又说需要 oracle step;结合标准 SPL 定义,分子应为最优/oracle 长度,实际路径在分母的

    max

    \\max

    max 中。

    十三、主实验结果

    Table 1 同时报告 ALFWorld 的 SR、ScienceWorld 的 SR/AR 和 Jericho 的 SR/AR。为保证 CSDN 可读性,按 Backbone 拆分复现。

    1. GPT-4o

    方法

    ALF

     

    SR

    Sci

     

    AR

    Sci

     

    SR

    Jericho

     

    AR

    Jericho

     

    SR

    Avg.

    Baseline

    62.7

    35.5

    22.2

    32.9

    10.0

    32.7

    Reflexion

    78.8

    43.7

    25.6

    35.6

    10.0

    38.7

    ExpeL

    81.3

    45.4

    32.2

    43.6

    15.0

    43.5

    AWM

    82.3

    46.0

    28.9

    44.1

    15.0

    43.3

    AutoGuide

    83.3

    49.3

    26.7

    47.8

    15.0

    44.4

    CDMem

    90.5

    52.1

    30.0

    54.0

    20.0

    49.3

    SAMem

    98.5

    65.4

    40.0

    63.8

    35.0

    60.5

    \\begin{array}{l|rr|rr|r|r} \\textbf{方法} & \\textbf{ALF\\ SR} & \\textbf{Sci\\ AR} & \\textbf{Sci\\ SR} & \\textbf{Jericho\\ AR} & \\textbf{Jericho\\ SR} & \\textbf{Avg.} \\\\ \\hline \\text{Baseline} & 62.7 & 35.5 & 22.2 & 32.9 & 10.0 & 32.7 \\\\ \\text{Reflexion} & 78.8 & 43.7 & 25.6 & 35.6 & 10.0 & 38.7 \\\\ \\text{ExpeL} & 81.3 & 45.4 & 32.2 & 43.6 & 15.0 & 43.5 \\\\ \\text{AWM} & 82.3 & 46.0 & 28.9 & 44.1 & 15.0 & 43.3 \\\\ \\text{AutoGuide} & 83.3 & 49.3 & 26.7 & 47.8 & 15.0 & 44.4 \\\\ \\text{CDMem} & \\underline{90.5} & \\underline{52.1} & \\underline{30.0} & \\underline{54.0} & \\underline{20.0} & \\underline{49.3} \\\\ \\textbf{SAMem} & \\mathbf{98.5} & \\mathbf{65.4} & \\mathbf{40.0} & \\mathbf{63.8} & \\mathbf{35.0} & \\mathbf{60.5} \\end{array}

    方法BaselineReflexionExpeLAWMAutoGuideCDMemSAMemALF SR62.778.881.382.383.390.598.5Sci AR35.543.745.446.049.352.165.4Sci SR22.225.632.228.926.730.040.0Jericho AR32.935.643.644.147.854.063.8Jericho SR10.010.015.015.015.020.035.0Avg.32.738.743.543.344.449.360.5

    Table 1:GPT-4o 上的主实验。 SAMem 在三个环境的成功率和平均奖励上均为最高,平均指标为 60.5,相比 CDMem 高 11.2。

    ALFWorld SR 从 CDMem 的 90.5% 提高到 98.5%,接近饱和;ScienceWorld AR 提高 13.3;Jericho SR 从 20% 提高到 35%。收益在长链、状态变化更强的 ScienceWorld 和 Jericho 中尤其明显,符合 state-aware 的动机。

    2. GPT-4o-mini

    方法

    ALF

     

    SR

    Sci

     

    AR

    Sci

     

    SR

    Jericho

     

    AR

    Jericho

     

    SR

    Avg.

    Baseline

    37.3

    29.7

    15.6

    26.2

    10.0

    23.8

    Reflexion

    64.9

    35.4

    13.3

    33.1

    10.0

    31.3

    ExpeL

    70.1

    38.4

    18.9

    37.6

    15.0

    36.0

    AWM

    69.4

    37.3

    18.9

    39.2

    15.0

    36.0

    AutoGuide

    74.1

    40.8

    20.0

    40.6

    15.0

    38.1

    CDMem

    79.6

    46.0

    23.3

    44.8

    20.0

    42.7

    SAMem

    82.6

    59.7

    34.4

    50.4

    30.0

    51.4

    \\begin{array}{l|rr|rr|r|r} \\textbf{方法} & \\textbf{ALF\\ SR} & \\textbf{Sci\\ AR} & \\textbf{Sci\\ SR} & \\textbf{Jericho\\ AR} & \\textbf{Jericho\\ SR} & \\textbf{Avg.} \\\\ \\hline \\text{Baseline} & 37.3 & 29.7 & 15.6 & 26.2 & 10.0 & 23.8 \\\\ \\text{Reflexion} & 64.9 & 35.4 & 13.3 & 33.1 & 10.0 & 31.3 \\\\ \\text{ExpeL} & 70.1 & 38.4 & 18.9 & 37.6 & 15.0 & 36.0 \\\\ \\text{AWM} & 69.4 & 37.3 & 18.9 & 39.2 & 15.0 & 36.0 \\\\ \\text{AutoGuide} & 74.1 & 40.8 & 20.0 & 40.6 & 15.0 & 38.1 \\\\ \\text{CDMem} & \\underline{79.6} & \\underline{46.0} & \\underline{23.3} & \\underline{44.8} & \\underline{20.0} & \\underline{42.7} \\\\ \\textbf{SAMem} & \\mathbf{82.6} & \\mathbf{59.7} & \\mathbf{34.4} & \\mathbf{50.4} & \\mathbf{30.0} & \\mathbf{51.4} \\end{array}

    方法BaselineReflexionExpeLAWMAutoGuideCDMemSAMemALF SR37.364.970.169.474.179.682.6Sci AR29.735.438.437.340.846.059.7Sci SR15.613.318.918.920.023.334.4Jericho AR26.233.137.639.240.644.850.4Jericho SR10.010.015.015.015.020.030.0Avg.23.831.336.036.038.142.751.4

    Table 1(续):GPT-4o-mini 上的主实验。 SAMem 的平均指标为 51.4,相比无记忆 Baseline 的 23.8 提高 116%,相比 CDMem 高 8.7。

    小模型本身更容易被冗余 memory prompt 干扰,因此状态级单 Thought 指导可能带来更大相对收益。但要注意,Summarizer 仍是 GPT-4o,小模型结果包含了强模型状态压缩的帮助。

    3. Qwen-2.5-72B-Instruct

    方法

    ALF

     

    SR

    Sci

     

    AR

    Sci

     

    SR

    Jericho

     

    AR

    Jericho

     

    SR

    Avg.

    Baseline

    51.5

    31.6

    12.2

    29.6

    10.0

    27.0

    Reflexion

    67.2

    40.5

    14.4

    34.3

    10.0

    33.3

    ExpeL

    72.1

    42.8

    17.8

    42.2

    15.0

    38.0

    AWM

    73.1

    44.7

    17.8

    41.1

    15.0

    38.3

    AutoGuide

    76.9

    47.3

    21.1

    42.4

    15.0

    40.5

    CDMem

    80.6

    49.9

    22.2

    46.7

    20.0

    43.9

    SAMem

    85.1

    61.0

    28.9

    52.5

    30.0

    51.5

    \\begin{array}{l|rr|rr|r|r} \\textbf{方法} & \\textbf{ALF\\ SR} & \\textbf{Sci\\ AR} & \\textbf{Sci\\ SR} & \\textbf{Jericho\\ AR} & \\textbf{Jericho\\ SR} & \\textbf{Avg.} \\\\ \\hline \\text{Baseline} & 51.5 & 31.6 & 12.2 & 29.6 & 10.0 & 27.0 \\\\ \\text{Reflexion} & 67.2 & 40.5 & 14.4 & 34.3 & 10.0 & 33.3 \\\\ \\text{ExpeL} & 72.1 & 42.8 & 17.8 & 42.2 & 15.0 & 38.0 \\\\ \\text{AWM} & 73.1 & 44.7 & 17.8 & 41.1 & 15.0 & 38.3 \\\\ \\text{AutoGuide} & 76.9 & 47.3 & 21.1 & 42.4 & 15.0 & 40.5 \\\\ \\text{CDMem} & \\underline{80.6} & \\underline{49.9} & \\underline{22.2} & \\underline{46.7} & \\underline{20.0} & \\underline{43.9} \\\\ \\textbf{SAMem} & \\mathbf{85.1} & \\mathbf{61.0} & \\mathbf{28.9} & \\mathbf{52.5} & \\mathbf{30.0} & \\mathbf{51.5} \\end{array}

    方法BaselineReflexionExpeLAWMAutoGuideCDMemSAMemALF SR51.567.272.173.176.980.685.1Sci AR31.640.542.844.747.349.961.0Sci SR12.214.417.817.821.122.228.9Jericho AR29.634.342.241.142.446.752.5Jericho SR10.010.015.015.015.020.030.0Avg.27.033.338.038.340.543.951.5

    Table 1(续):Qwen-2.5-72B-Instruct 上的主实验。 SAMem 在全部指标上领先,平均指标 51.5,比 CDMem 高 7.6。

    4. Llama-3.1-70B-Instruct

    方法

    ALF

     

    SR

    Sci

     

    AR

    Sci

     

    SR

    Jericho

     

    AR

    Jericho

     

    SR

    Avg.

    Baseline

    52.2

    26.9

    10.0

    27.6

    10.0

    25.3

    Reflexion

    68.7

    35.1

    13.3

    33.3

    10.0

    32.1

    ExpeL

    73.9

    39.8

    17.8

    38.6

    15.0

    37.0

    AWM

    74.6

    40.3

    16.7

    38.5

    15.0

    37.0

    AutoGuide

    78.1

    42.6

    17.8

    39.2

    15.0

    38.5

    CDMem

    81.3

    47.8

    21.1

    41.0

    20.0

    42.2

    SAMem

    88.8

    57.7

    23.3

    48.3

    25.0

    48.6

    \\begin{array}{l|rr|rr|r|r} \\textbf{方法} & \\textbf{ALF\\ SR} & \\textbf{Sci\\ AR} & \\textbf{Sci\\ SR} & \\textbf{Jericho\\ AR} & \\textbf{Jericho\\ SR} & \\textbf{Avg.} \\\\ \\hline \\text{Baseline} & 52.2 & 26.9 & 10.0 & 27.6 & 10.0 & 25.3 \\\\ \\text{Reflexion} & 68.7 & 35.1 & 13.3 & 33.3 & 10.0 & 32.1 \\\\ \\text{ExpeL} & 73.9 & 39.8 & 17.8 & 38.6 & 15.0 & 37.0 \\\\ \\text{AWM} & 74.6 & 40.3 & 16.7 & 38.5 & 15.0 & 37.0 \\\\ \\text{AutoGuide} & 78.1 & 42.6 & 17.8 & 39.2 & 15.0 & 38.5 \\\\ \\text{CDMem} & \\underline{81.3} & \\underline{47.8} & \\underline{21.1} & \\underline{41.0} & \\underline{20.0} & \\underline{42.2} \\\\ \\textbf{SAMem} & \\mathbf{88.8} & \\mathbf{57.7} & \\mathbf{23.3} & \\mathbf{48.3} & \\mathbf{25.0} & \\mathbf{48.6} \\end{array}

    方法BaselineReflexionExpeLAWMAutoGuideCDMemSAMemALF SR52.268.773.974.678.181.388.8Sci AR26.935.139.840.342.647.857.7Sci SR10.013.317.816.717.821.123.3Jericho AR27.633.338.638.539.241.048.3Jericho SR10.010.015.015.015.020.025.0Avg.25.332.137.037.038.542.248.6

    Table 1(续):Llama-3.1-70B-Instruct 上的主实验。 SAMem 平均指标为 48.6,比 CDMem 高 6.4;ScienceWorld SR 只比 CDMem 高 2.2,是主表中相对较小的领先项。

    5. 证据边界

    Table 1 报告三次运行平均值,却没有提供标准差、置信区间或显著性检验。Jericho 只有 20 个任务,SR 每变化 5 个百分点可能只代表多成功 1 个游戏。因此,跨环境一致领先很有说服力,但小差值不宜过度解读。

    此外,Average 列混合了 SR 和 AR,两个指标量纲不同。它适合展示综合趋势,不应当作严格可比较的统一效用函数。

    十四、训练迭代:细粒度记忆如何逐步形成

    在这里插入图片描述

    Figure 3:ALFWorld、ScienceWorld 和 Jericho 上的训练迭代曲线。 SAMem 初期因高探索率并非总是最佳,但随着 Q-table 和高价值 Thought 逐步形成,性能持续增长并明显超过 ExpeL、AWM、AutoGuide 与 CDMem。

    在 ALFWorld 中,其他方法约在第 3–5 轮后进入平台期,而 SAMem 继续提高到接近 98%。ScienceWorld 和 Jericho 的趋势更明显:状态—Thought 价值随着新轨迹不断修正,而任务级或场景级经验逐渐固化。

    不过,这张图不能单独证明“粗粒度记忆必然僵化”。不同方法的更新算法、记忆容量和 Prompt 都不同,平台期可能同时受这些因素影响。

    十五、效率:成功之外,是否少走了弯路

    1. SPL

    在这里插入图片描述

    Figure 4:GPT-4o 与 GPT-4o-mini 在 ALFWorld 上的 SPL。 SAMem 分别达到 0.53 和 0.40,高于 CDMem 的 0.43 和 0.35,以及其他任务级、场景级基线。

    附录给出 GPT-4o 各任务类型的完整结果:

    方法

    Put

    Clean

    Heat

    Cool

    Exa.

    Puttwo

    ALL

    Reflexion

    0.47

    0.36

    0.33

    0.32

    0.27

    0.38

    0.36

    ExpeL

    0.40

    0.37

    0.36

    0.36

    0.40

    0.39

    0.38

    AWM

    0.40

    0.39

    0.37

    0.34

    0.39

    0.40

    0.38

    AutoGuide

    0.36

    0.41

    0.38

    0.38

    0.42

    0.45

    0.40

    CDMem

    0.52

    0.43

    0.38

    0.39

    0.45

    0.42

    0.43

    SAMem

    0.54

    0.50

    0.43

    0.45

    0.69

    0.57

    0.53

    \\begin{array}{l|rrrrrr|r} \\textbf{方法} & \\textbf{Put} & \\textbf{Clean} & \\textbf{Heat} & \\textbf{Cool} & \\textbf{Exa.} & \\textbf{Puttwo} & \\textbf{ALL} \\\\ \\hline \\text{Reflexion} & 0.47 & 0.36 & 0.33 & 0.32 & 0.27 & 0.38 & 0.36 \\\\ \\text{ExpeL} & 0.40 & 0.37 & 0.36 & 0.36 & 0.40 & 0.39 & 0.38 \\\\ \\text{AWM} & 0.40 & 0.39 & 0.37 & 0.34 & 0.39 & 0.40 & 0.38 \\\\ \\text{AutoGuide} & 0.36 & 0.41 & 0.38 & 0.38 & 0.42 & 0.45 & 0.40 \\\\ \\text{CDMem} & 0.52 & 0.43 & 0.38 & 0.39 & 0.45 & 0.42 & 0.43 \\\\ \\textbf{SAMem} & \\mathbf{0.54} & \\mathbf{0.50} & \\mathbf{0.43} & \\mathbf{0.45} & \\mathbf{0.69} & \\mathbf{0.57} & \\mathbf{0.53} \\end{array}

    方法ReflexionExpeLAWMAutoGuideCDMemSAMemPut0.470.400.400.360.520.54Clean0.360.370.390.410.430.50Heat0.330.360.370.380.380.43Cool0.320.360.340.380.390.45Exa.0.270.400.390.420.450.69Puttwo0.380.390.400.450.420.57ALL0.360.380.380.400.430.53

    Table 5:GPT-4o 在 ALFWorld 六类任务上的 SPL。 SAMem 在所有任务类型上最高,Examine 的优势最大,从 CDMem 的 0.45 提高到 0.69。

    SPL 同时受成功率和路径长度影响。SAMem 的高 SPL 一部分来自更高 SR,不完全等价于“在相同成功任务上路径更短”。论文没有额外报告 conditional-on-success path length,因此两种因素无法严格分离。

    2. Token Cost

    在这里插入图片描述

    Figure 8:GPT-4o-mini 在 ALFWorld 上的性能—Token 成本关系。 SAMem 约消耗

    5.1

    ×

    10

    6

    5.1\\times10^6

    5.1×106 tokens,成本略高于 CDMem、ExpeL、AWM 和 Reflexion,略低于 AutoGuide,同时取得明显更高性能;每种方法运行 10 trials。

    SAMem 每一步都调用 GPT-4o 做 Situation Summarization,因此不可能是最低成本方法。它的证据更适合支持“额外成本可控,性能收益较大”,而不是“状态级记忆更便宜”。

    论文也没有把 token 数转换成费用或延迟。不同模型的输入输出单价不同,

    5.1

    ×

    10

    6

    5.1\\times10^6

    5.1×106 tokens 只是计算量近似,不能直接等同于部署成本。

    十六、核心消融:哪一部分真正决定性能

    设置

    ALFWorld

     

    SR

    ScienceWorld

     

    AR

    Jericho

     

    AR

    SAMem

     

    Full

    98.5

    65.4

    63.8

    w/o Q-learning

    84.3

    47.4

    44.6

    w/o Situation Processing

    82.8

    48.5

    50.4

    w/o Decayed 

    ϵ

    -greedy

    94.0

    62.4

    57.8

    \\begin{array}{l|rrr} \\textbf{设置} & \\textbf{ALFWorld SR} & \\textbf{ScienceWorld AR} & \\textbf{Jericho AR} \\\\ \\hline \\textbf{SAMem Full} & \\mathbf{98.5} & \\mathbf{65.4} & \\mathbf{63.8} \\\\ \\text{w/o Q-learning} & 84.3 & 47.4 & 44.6 \\\\ \\text{w/o Situation Processing} & 82.8 & 48.5 & 50.4 \\\\ \\text{w/o Decayed }\\epsilon\\text{-greedy} & 94.0 & 62.4 & 57.8 \\end{array}

    设置SAMem Fullw/o Q-learningw/o Situation Processingw/o Decayed ϵ-greedyALFWorld SR98.584.382.894.0ScienceWorld AR65.447.448.562.4Jericho AR63.844.650.457.8

    Table 2:GPT-4o 上的关键组件消融。 去掉 Q-learning 表示不进行 Q-value 迭代;去掉 Situation Processing 表示直接使用当前原始 observation,不做摘要和聚类;去掉衰减

    ϵ

    \\epsilon

    ϵ-greedy 表示训练期间不使用记忆指导。

    1. Q-learning 是价值化记忆的核心

    去掉 Q-learning 后,ALFWorld 下降 14.2 个百分点,ScienceWorld 和 Jericho AR 分别下降 18.0、19.2。说明只把 State–Thought 存下来不够,必须学习“哪种 Thought 长期有效”。

    2. Situation Processing 决定状态能否复用

    去掉摘要和聚类后,ALFWorld 下降最多,达到 15.7 个百分点。原始 observation 缺少历史进度,而且文本表述分散,无法稳定映射到同一 Q-table 单元。

    ScienceWorld 中 w/o Situation Processing 的 48.5 略高于 w/o Q-learning 的 47.4;Jericho 则高 5.8。这说明不同环境的主要瓶颈不同:有时价值估计更关键,有时状态抽象更关键。

    3.

    ϵ

    \\epsilon

    ϵ-greedy 的增益较小但一致

    去掉衰减探索策略后,三个环境分别下降 4.5、3.0 和 6.0。它不是主要增益来源,但能让后期训练利用高价值记忆产生更好的轨迹。

    4. 尚未被拆开的因素

    Table 2 没有分别消融:

    • State clustering 与 Thought clustering;
    • State summarizer 使用 GPT-4o 的贡献;
    • Thought 去指代化 Prompt;
    • Q 值筛选与 LLM logical check;
    • 测试时只取 Top-1 Thought 或多 Thought。

    因此,论文验证了三个大模块,却还不足以完全定位每个设计选择的边际贡献。

    十七、遗忘机制:容量下降是否意味着记忆更好

    在这里插入图片描述

    Figure 6:有无 Forgetting 时的 Memory Size。 在 ALFWorld、ScienceWorld 和 Jericho 上,启用遗忘机制后的状态—Thought 表都更小;Jericho 的绝对减少量最大。

    这张图证明遗忘能抑制内存膨胀,但不能证明被删除的内容完全无用。论文没有同时展示有无遗忘时的 SR/AR,也没有给出 logical check 的人工准确率。

    因此,最稳妥的结论是:Forgetting 有容量治理效果,其性能安全性仍需进一步验证。

    十八、相似度阈值:粒度、性能与容量的三角关系

    在这里插入图片描述

    Figure 7:State 相似度阈值对性能和平均 State Space 的影响。

    θ

    s

    i

    m

    \\theta_{sim}

    θsim 从 0.80 提高到 0.95 时,三个环境的性能总体提升或趋稳,但平均状态空间持续扩大;论文选择 0.85 作为精度与检索效率的折中。

    阈值控制 SAMem 的实际粒度:

    • 低阈值:不同情境容易合并,Q 值把多个决策状态混在一起;
    • 高阈值:近似状态被拆开,经验难以共享,Q-table 快速变大;
    • 中间阈值:在状态对齐与泛化之间平衡。

    附录 Figure 9 对 Thought Space 得出相同趋势。值得注意的是,0.85 是三个环境的统一经验值,不代表所有领域都适用。真实 Tool Agent 中状态文本更异构,阈值可能需要按工具、任务阶段甚至簇密度自适应。

    十九、Thought-level 为什么优于 Action-level

    方法

    n

    =

    3

    n

    =

    5

    n

    =

    7

    n

    =

    9

    Action-level

    70.1

    72.4

    76.1

    79.9

    Thought-level

    89.6

    95.5

    97.7

    97.7

    \\begin{array}{l|rrrr} \\textbf{方法} & n=3 & n=5 & n=7 & n=9 \\\\ \\hline \\text{Action-level} & 70.1 & 72.4 & 76.1 & 79.9 \\\\ \\textbf{Thought-level} & \\mathbf{89.6} & \\mathbf{95.5} & \\mathbf{97.7} & \\mathbf{97.7} \\end{array}

    方法Action-levelThought-leveln=370.189.6n=572.495.5n=776.197.7n=979.997.7

    Table 3:ALFWorld unseen test 上 Action-level 与 Thought-level 优化。 使用 GPT-4o,每类训练

    n

    n

    n 个任务并迭代 5 次;Thought-level 在所有数据规模下均显著更高,

    n

    =

    3

    n=3

    n=3 时已达到 89.6%。

    n

    =

    3

    n=3

    n=3 时,两者相差 19.5 个百分点;

    n

    =

    9

    n=9

    n=9 时相差 17.8。Thought 表达动作背后的理由,因此能跨对象、位置和命令编号复用。

    但这张表没有提供 “Thought+Action” 与纯 Thought 的对照,也没有控制两种表示的 token 长度和 Prompt 信息量。它支持高层推理单元更可迁移,但还不能证明 Q-learning 的最优抽象粒度一定是 Thought。

    二十、失败模式与反例

    1. State Summary 可能丢失关键细节

    状态摘要压缩了 observation history,也可能漏掉:

    • 已尝试但失败的对象编号;
    • 容器开关状态;
    • 某条一次性环境反馈;
    • 时序顺序;
    • 风险或资源剩余量。

    一旦摘要错误,后续聚类和 Thought 检索都会建立在错误状态上。

    2. 状态聚类存在 aliasing

    两个摘要语义相似,不代表它们具有相同最优 Thought。例如“已拿到目标物品”可能分别对应需要加热、冷却或清洗的任务。如果摘要没有保留目标操作,相似度会把它们合并,Q 值发生冲突。

    3. Thought 聚类可能把表面近义、实际相反的策略合并

    “前往可操作位置”和“确认当前位置是否可操作”在 embedding 中可能很近,但一个要求移动、一个要求先检查。纯余弦阈值缺少逻辑蕴含和前置条件判断。

    4. 稀疏奖励使 Q 值难以稳定

    长任务通常只在最后成功时给奖励。若某类状态很少访问,Q 值更新次数不足;若中间状态摘要或聚类变化,回报传播路径也会被打断。作者在 Limitations 中明确承认 sparse/zero reward 的挑战。

    5. Tabular Q-learning 难以扩展到开放状态空间

    真实浏览器、代码仓库和长期对话状态的组合几乎无限。即使在线聚类,State × Thought 表仍可能快速增长,出现大量只访问一次的单元格。

    6. 低 Q 值不等于错误记忆

    某个 Thought 可能只在罕见条件下正确,因为多数轨迹没有满足该条件而得到低 Q 值。遗忘模块若未保留 condition 和 support count,就可能删除长尾但关键的策略。

    7. Jericho 不是 unseen-task 泛化

    ALFWorld 与 ScienceWorld 在未见测试任务上评估,Jericho 则在同一 20 个游戏任务上训练与评测。Jericho 结果更适合证明 online evolving,而不能与前两者一样解释为跨任务泛化。

    二十一、与 Agent Memory 系列方法的横向比较

    方法

    主要索引/结构

    价值或选择依据

    核心问题

    A-MEM

    记忆条目与动态链接

    语义关联

    扁平记忆缺少组织

    MAGMA

    多视角记忆图

    多类关系检索

    单一相似度遗漏关系

    CoM

    连续压缩历史

    上下文相关推理

    长历史增长

    ReMemR1

    可回看的写入过程

    Callback 检索

    边读边记的信息损失

    Mem

    2

    Evolve

    演化记忆与策略

    持续经验反馈

    静态记忆难适应

    CFGM

    Focus/Tip/Key Info

    粗到细情境支持

    采集、蒸馏、纠错割裂

    DCM-Agent

    建模簇—代码簇图

    路径相关性与边权

    多范式认知干扰

    SAMem

    State–Thought Q-table

    长期回报 

    Q

    (

    s

    ,

    t

    h

    )

    经验与当前状态错位

    \\begin{array}{l|l|l|l} \\textbf{方法} & \\textbf{主要索引/结构} & \\textbf{价值或选择依据} & \\textbf{核心问题} \\\\ \\hline \\text{A-MEM} & \\text{记忆条目与动态链接} & \\text{语义关联} & \\text{扁平记忆缺少组织} \\\\ \\text{MAGMA} & \\text{多视角记忆图} & \\text{多类关系检索} & \\text{单一相似度遗漏关系} \\\\ \\text{CoM} & \\text{连续压缩历史} & \\text{上下文相关推理} & \\text{长历史增长} \\\\ \\text{ReMemR1} & \\text{可回看的写入过程} & \\text{Callback 检索} & \\text{边读边记的信息损失} \\\\ \\text{Mem}^{2}\\text{Evolve} & \\text{演化记忆与策略} & \\text{持续经验反馈} & \\text{静态记忆难适应} \\\\ \\text{CFGM} & \\text{Focus/Tip/Key Info} & \\text{粗到细情境支持} & \\text{采集、蒸馏、纠错割裂} \\\\ \\text{DCM-Agent} & \\text{建模簇—代码簇图} & \\text{路径相关性与边权} & \\text{多范式认知干扰} \\\\ \\textbf{SAMem} & \\text{State–Thought Q-table} & \\text{长期回报 }Q(s,th) & \\text{经验与当前状态错位} \\end{array}

    方法A-MEMMAGMACoMReMemR1Mem2EvolveCFGMDCM-AgentSAMem主要索引/结构记忆条目与动态链接多视角记忆图连续压缩历史可回看的写入过程演化记忆与策略Focus/Tip/Key Info建模簇代码簇图State–Thought Q-table价值或选择依据语义关联多类关系检索上下文相关推理Callback 检索持续经验反馈粗到细情境支持路径相关性与边权长期回报 Q(s,th)核心问题扁平记忆缺少组织单一相似度遗漏关系长历史增长边读边记的信息损失静态记忆难适应采集、蒸馏、纠错割裂多范式认知干扰经验与当前状态错位

    横向比较:SAMem 与代表性 Agent Memory 方法。 SAMem 的独特之处是把 state-conditioned Thought 作为可估值的记忆单元,用强化学习回报而非仅靠语义相似度决定调用优先级。

    1. 与 A-MEM / MAGMA 的关系

    A-MEM 与 MAGMA 解决“记忆之间怎样关联”,SAMem 解决“当前状态下哪条 Thought 值得调用”。两者可以结合:图结构负责找到相关状态、任务与实体,Q 值负责在候选 Thought 中做经验价值排序。

    2. 与 CFGM 的关系

    CFGM 的 KIR 也会读取当前轨迹,但它主要在异常 observation 触发后生成一次纠错反思;SAMem 在每个决策步骤根据 State 检索 Thought,并通过长期奖励持续更新其价值。

    可以把两者理解为:

    • CFGM:异常驱动的在线反思;
    • SAMem:状态驱动的逐步策略记忆。

    3. 与 DCM-Agent 的关系

    DCM-Agent 用结构先验区分多个求解范式,SAMem 用状态价值区分同一任务不同阶段的推理方向。一个管理 path-level ambiguity,一个管理 step-level alignment。

    在复杂 Tool Agent 中,可以先由 DCM 式图选择工具链,再由 SAMem 在每个工具状态选择最高价值的 Thought。

    4. 与 Mem²Evolve 的关系

    SAMem 的 Q 值会随新轨迹更新,已经具备明确的在线演化机制。但它演化的是固定 State/Thought Cluster 上的数值估计;簇语义本身、摘要 Prompt 和奖励定义没有一起演化。

    二十二、对 Coding Agent、Tool Agent 与 Multi-Agent 的启发

    1. Coding Agent:从“任务经验”转向“开发状态—策略”

    代码 Agent 的状态可以由以下信息总结:

    s

    =

    {

    g

    o

    a

    l

    ,

    d

    i

    f

    f

    ,

    t

    e

    s

    t

     

    r

    e

    s

    u

    l

    t

    ,

    e

    r

    r

    o

    r

    ,

    a

    t

    t

    e

    m

    p

    t

    e

    d

     

    f

    i

    x

    e

    s

    ,

    r

    e

    p

    o

     

    c

    o

    n

    s

    t

    r

    a

    i

    n

    t

    s

    }

    .

    s=\\{goal,diff,test\\ result,error,attempted\\ fixes,repo\\ constraints\\}.

    s={goal,diff,test result,error,attempted fixes,repo constraints}.

    Thought 则是高层修复策略:

    • 先复现并缩小错误范围;
    • 检查数据契约而非继续改 UI;
    • 回退并比较最近两次变更;
    • 在实现前补一个失败测试;
    • 当前问题属于依赖版本冲突,应先核对 lockfile。

    Q 值可以来自测试是否通过、修改规模、回归数量和用户验收。这样,Coding Agent 记住的不是某个文件里的具体 patch,而是“在这种开发状态下哪种排查思路更有效”。

    2. Tool Agent:Thought 作为工具策略层

    低层 Action 是具体 API 调用,Thought 是调用策略:

    当前返回分页游标,下一步应继续读取,而不是重新搜索。

    当前错误表示权限不足,应停止重试并请求授权。

    State–Thought 记忆可以防止 Agent 在同类错误状态下反复调用同一工具。

    但 Tool Agent 的奖励不能只用“任务最终成功”。还应加入:

    • 副作用风险;
    • 权限合规;
    • 调用成本;
    • 延迟;
    • 用户纠正;
    • 不必要重试次数。

    3. Multi-Agent:为协作状态选择协调 Thought

    多 Agent 系统的 State 可以包含:谁掌握什么证据、哪些子任务已完成、当前冲突和阻塞点。Thought 可以是:

    • 让某角色补证据;
    • 合并两个一致结论;
    • 保留分歧并并行验证;
    • 停止重复研究;
    • 将结果交给审核 Agent。

    Q 值评估的是协作策略,而不是单个 Agent 的一句回答。

    4. 实际工程中应把 Q 值拆成多目标价值

    单一

    Q

    (

    s

    ,

    t

    h

    )

    Q(s,th)

    Q(s,th) 可能掩盖不同维度。更实用的记忆可以保存:

    Q

    (

    s

    ,

    t

    h

    )

    =

    λ

    1

    Q

    s

    u

    c

    c

    e

    s

    s

    λ

    2

    Q

    c

    o

    s

    t

    λ

    3

    Q

    r

    i

    s

    k

    λ

    4

    Q

    l

    a

    t

    e

    n

    c

    y

    .

    Q(s,th)= \\lambda_1Q_{success} -\\lambda_2Q_{cost} -\\lambda_3Q_{risk} -\\lambda_4Q_{latency}.

    Q(s,th)=λ1Qsuccessλ2Qcostλ3Qriskλ4Qlatency.

    不同任务再按风险偏好组合,而不是把所有反馈压成一个标量。

    二十三、局限性

    1. 作者明确承认的局限

    1.1 Q-table 的扩展性

    虽然摘要和聚类让实验中的 State/Thought Space 可控,但更开放、更复杂的领域会导致表格快速膨胀。作者计划使用神经网络等函数逼近方法替代 tabular Q-learning。

    1.2 稀疏或零奖励

    缺少密集环境反馈时,Thought 的长期价值难以估计,TD 更新可能缓慢且不稳定。

    2. 进一步的局限

    2.1 强 Summarizer 混入 Backbone 比较

    所有设置都使用 GPT-4o 做 Situation Summarization。这提高了 State 质量,但也使 GPT-4o-mini、Qwen 和 Llama 的结果并非完全由自身能力产生。论文缺少同 Backbone Summarizer 或小模型 Summarizer 的消融。

    2.2 Markov 假设依赖摘要完整性

    SAMem 把 summary 当作 MDP state,隐含要求它足以预测后续转移和回报。如果摘要遗漏历史依赖,过程实际是部分可观察的,

    Q

    (

    s

    ,

    t

    h

    )

    Q(s,th)

    Q(s,th) 会混合不同隐藏状态。

    2.3 Thought 到 Action 的唯一映射假设过强

    一个 Thought 可以生成多种 Action,其回报还取决于对象、参数和语言模型采样。把所有差异归到同一个

    Q

    (

    s

    ,

    t

    h

    )

    Q(s,th)

    Q(s,th),可能高估或低估 Thought 本身的价值。

    2.4 Q 值没有不确定性

    一次成功和一百次成功可能拥有相似 Q 值,但证据强度不同。SAMem 没有保存 visit count、方差或置信区间,也没有使用 UCB 等不确定性探索。

    2.5 遗忘实验只验证容量

    论文展示 Memory Size 下降,却没有证明剪枝后的准确率不下降,也没有记录被删 Thought 的恢复机制。

    2.6 主结果混合不同量纲

    Average 列将 ALFWorld SR、ScienceWorld AR/SR、Jericho AR/SR 直接平均,解释性有限。论文也未提供误差条与统计显著性。

    2.7 状态摘要带来持续 token 与延迟成本

    Figure 8 表明 SAMem 成本可控但不是最低;真实高频 Agent 每步调用强 LLM 摘要,累计成本可能很高。

    二十四、我的理解和启发

    1. SAMem 将“记忆检索”改写成“语义强化学习”

    普通记忆系统把 key/value 存进向量库;SAMem 增加了 value-of-value:

    S

    t

    a

    t

    e

    s

    i

    m

    i

    l

    a

    r

    i

    t

    y

    S

    t

    a

    t

    e

    C

    l

    u

    s

    t

    e

    r

    Q

    v

    a

    l

    u

    e

    T

    h

    o

    u

    g

    h

    t

    L

    L

    M

    A

    c

    t

    i

    o

    n

    .

    State\\xrightarrow{similarity}StateCluster \\xrightarrow{Q-value}Thought \\xrightarrow{LLM}Action.

    Statesimilarity

    StateClusterQvalue

    ThoughtLLM

    Action.

    语义相似度负责归类,环境奖励负责排序。两种信号缺一不可:只有相似度,不知道经验是否有效;只有 Q 值,无法把新自然语言状态映射到旧经验。

    2. 最有价值的不是 Q-learning,而是把 Thought 定义为记忆动作

    Tabular Q-learning 本身非常经典。论文真正有启发性的地方,是选择 Thought 作为 RL action abstraction。

    Action 太具体,Task Insight 太粗;Thought 处在两者之间:

    Task Insight

    State-conditioned Thought

    Concrete Action

    .

    \\text{Task Insight} \\supset \\text{State-conditioned Thought} \\supset \\text{Concrete Action}.

    Task InsightState-conditioned ThoughtConcrete Action.

    这提供了一种设计 Agent Memory 粒度的方法:选择既能迁移、又能直接影响下一步决策的中间表示。

    3. State Summary 是 SAMem 最关键也最脆弱的隐变量

    论文把很多注意力放在 Q-table,但

    s

    t

    s_t

    st 并不是环境直接提供的真实状态,而是 LLM 生成的摘要。整个系统实际上是:

    O

    b

    s

    e

    r

    v

    a

    t

    i

    o

    n

    H

    i

    s

    t

    o

    r

    y

    L

    L

    M

    L

    a

    t

    e

    n

    t

    T

    e

    x

    t

    S

    t

    a

    t

    e

    E

    m

    b

    e

    d

    d

    i

    n

    g

    C

    l

    u

    s

    t

    e

    r

    D

    i

    s

    c

    r

    e

    t

    e

    S

    t

    a

    t

    e

    I

    D

    .

    ObservationHistory \\xrightarrow{LLM} LatentTextState \\xrightarrow{EmbeddingCluster} DiscreteStateID.

    ObservationHistoryLLM

    LatentTextStateEmbeddingCluster

    DiscreteStateID.

    连续两次有损压缩——先摘要、再聚类——决定了 Q-learning 学到什么。如果 State 表示不满足决策充分性,再精确的 Bellman 更新也无法修复。

    未来应为 State 增加结构化字段、来源引用和遗漏检测,而不是只生成自由文本。

    4. 更合理的下一步是带不确定性的状态—Thought 图

    纯 Q-table 无法表达状态之间的组成、继承和因果关系。可以将它升级为图:

    • State 节点保存任务进度与实体状态;
    • Thought 节点保存可迁移策略;
    • 边保存 Q 均值、访问次数、成功率和置信度;
    • Transition 边保存 Thought 可能到达的下一状态;
    • 失败反例作为约束挂在边上。

    选择时使用:

    S

    c

    o

    r

    e

    (

    s

    ,

    t

    h

    )

    =

    Q

    (

    s

    ,

    t

    h

    )

    +

    c

    ln

    N

    (

    s

    )

    N

    (

    s

    ,

    t

    h

    )

    ,

    Score(s,th)=Q(s,th)+c\\sqrt{\\frac{\\ln N(s)}{N(s,th)}},

    Score(s,th)=Q(s,th)+cN(s,th)lnN(s)

    ,

    让低访问但有潜力的 Thought 获得探索机会,而不是只相信当前点估计。

    5. Forgetting 应从删除变成“降级与归档”

    低 Q Thought 可能只是样本不足。比置零更稳妥的生命周期是:

    A

    c

    t

    i

    v

    e

    L

    o

    w

    C

    o

    n

    f

    i

    d

    e

    n

    c

    e

    A

    r

    c

    h

    i

    v

    e

    d

    R

    e

    a

    c

    t

    i

    v

    a

    t

    e

    d

    .

    Active \\rightarrow LowConfidence \\rightarrow Archived \\rightarrow Reactivated.

    ActiveLowConfidenceArchivedReactivated.

    当新状态或反例出现时,系统还能恢复历史策略。这与长期 Agent Memory 中“不能让摘要和遗忘造成不可逆损失”的问题是一致的。

    6. SAMem 与 CFGM 可以组成更完整的在线闭环

    SAMem 每一步选择高价值 Thought,CFGM 在异常时做 Key Information Reflection。组合后可以形成:

    S

    t

    a

    t

    e

    T

    h

    o

    u

    g

    h

    t

     

    S

    e

    l

    e

    c

    t

    i

    o

    n

    A

    c

    t

    i

    o

    n

    A

    n

    o

    m

    a

    l

    y

     

    D

    e

    t

    e

    c

    t

    i

    o

    n

    K

    I

    R

     

    C

    o

    r

    r

    e

    c

    t

    i

    o

    n

    Q

     

    U

    p

    d

    a

    t

    e

    .

    State\\text{-}Thought\\ Selection \\rightarrow Action \\rightarrow Anomaly\\ Detection \\rightarrow KIR\\ Correction \\rightarrow Q\\ Update.

    StateThought SelectionActionAnomaly DetectionKIR CorrectionQ Update.

    异常修正本身也可以成为新的 Thought,并根据后续成功与否获得 Q 值。这样,反思不再只是一次性文本,而会进入可复用的策略记忆。

    二十五、总结

    SAMem 关注的不是“Agent 能不能找到一段相关历史”,而是“找到的历史是否与当前决策状态严格对齐”。

    它先将 Observation History 总结成 State,再生成可迁移的高层 Thought 和具体 Action;State 与 Thought 分别在线聚类,并以 State–Thought Q-table 保存长期价值。训练时用衰减

    ϵ

    \\epsilon

    ϵ-greedy 从自由探索过渡到记忆利用,测试时选择当前状态下 Q 值最高的 Thought。遗忘模块再结合低 Q 值和 LLM 逻辑检查压缩记忆。

    在 ALFWorld、ScienceWorld 和 Jericho 上,SAMem 对 GPT-4o、GPT-4o-mini、Qwen-2.5-72B 和 Llama-3.1-70B 均取得主表最佳结果;消融显示 Q-learning 与 Situation Processing 是主要贡献,Thought-level 明显优于 Action-level,SPL 也表明状态级指导减少了无效路径。

    但证据边界同样明确:系统依赖 GPT-4o Summary,State/Thought 聚类存在混叠风险,Thought 唯一决定 Action 的假设较强,Q-table 难以扩展到开放状态空间,稀疏奖励会削弱价值学习,遗忘实验也只验证了容量而非性能安全性。

    最后用一句话概括:

    SAMem 的核心贡献,是把经验记忆从“检索与任务相似的历史”推进为“在当前语义状态下选择长期价值最高的 Thought”,让 Memory 第一次以状态对齐和回报估值共同驱动每一步决策。

    参考资料

  • Tong Wang, Pei Xu, Shiyue Cao, Likun Yang, Daipeng Li, Jianbin Jiao, Kaiqi Huang. SAMem: State-Aware Memory as a Fine-Grained Memory for LLM Agents in Decision-Making. Findings of ACL 2026.
  • Shinn et al. Reflexion: Language Agents with Verbal Reinforcement Learning. NeurIPS 2023.
  • Zhao et al. ExpeL: LLM Agents Are Experiential Learners. AAAI 2024.
  • Fu et al. AutoGuide: Automated Generation and Selection of Context-Aware Guidelines for Large Language Model Agents. NeurIPS 2024.
  • Gao et al. An Efficient Context-Dependent Memory Framework for LLM-Centric Agents. NAACL Industry Track 2025.
  • 赞(0)
    未经允许不得转载:171主机测评 » 【论文阅读】Agent 记忆机制(63):SAMem——把经验记忆细化为带长期价值的状态—Thought
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址