欢迎光临
我们一直在努力

Self-Adapting Language Models论文分享

今天分享的论文是《Self-Adapting Language Models》

原文链接:[2506.10943] Self-Adapting Language Models

开源代码:Self-Adapting Language Models

大型语言模型(LLM)功能强大但具有静态性;它们缺乏根据新任务、新知识或新示例调整自身权重的机制。本文提出自适应语言模型(SEAL) 框架,该框架能让LLM通过生成自身的微调数据和更新指令实现自适应。给定新输入时,模型会生成“自我编辑(self-edit)”——这种生成内容可能以不同方式重组信息、指定优化超参数,或调用工具进行数据增强与基于梯度的更新。通过有监督微调(SFT),这些自我编辑会带来持续性的权重更新,从而实现长效自适应。为训练模型生成有效的自我编辑,我们采用强化学习循环,将更新后模型的下游任务性能作为奖励信号。与依赖独立自适应模块或辅助网络的现有方法不同,SEAL直接利用模型的生成能力来参数化并控制其自身的自适应过程。在知识整合和少样本泛化任务上的实验表明,SEAL是推动语言模型实现“响应新数据自主自适应”的重要探索。

图1:SEAL框架概述]在每个强化学习外循环迭代中,模型生成候选自我编辑(SE)——即关于如何更新权重的指令;应用这些更新后,在下游任务上评估性能;并利用所得奖励改进自我编辑生成策略。

我们在两个应用场景中评估SEAL的性能:首先是“将新事实知识整合到LLM中”的任务。我们并非直接用段落文本进行微调,而是使用SEAL模型生成的合成数据进行微调。结果显示,经过强化学习(RL)训练后,基于自主生成的合成数据进行微调,能将SQuAD数据集[13]“无段落上下文”版本的问答准确率从33.5%提升至47.0%。值得注意的是,SEAL生成的合成数据性能优于GPT-4.1生成的合成数据[82]。

其次,我们在ARC-AGI基准[14]的简化子集上评估SEAL的少样本学习能力:模型利用一组工具自主选择合成数据增强方式和优化超参数(如学习率、训练轮次、基于token类型的选择性损失计算)。实验表明,与标准上下文学习(ICL)以及“未经过RL训练以有效使用工具”的自我编辑相比,使用SEAL自动选择和配置这些工具能显著提升性能。这些结果共同证明,SEAL是一个支持语言模型实现自我自适应的通用框架。

近期有多篇研究属于“自我改进”或“自我训练”范畴。RLAIF[56,57]、自我奖励语言模型[58,59]等方法利用模型自身提供奖励信号,其核心依据是“判断输出质量往往比生成输出更简单”这一观察[60]。另有研究通过将多数投票或模型置信度作为强化学习奖励,在无真值标签的情况下提升数学任务性能[61,62,63,64,65]。然而,这些方法均受限于模型当前的评估能力和自我一致性。相比之下,我们认为“通过与外部数据交互实现自我改进”是更强大且更具可扩展性的方向——SEAL的核心正是学习如何充分利用外部数据实现自我改进。

本文提出自适应语言模型(SEAL)框架,该框架支持语言模型通过响应新数据生成自身的合成数据和优化参数(即“自我编辑”)实现自我改进。模型在训练后,可结合上下文提供的数据,通过token生成直接产出这些自我编辑。自我编辑的生成通过强化学习(RL)实现训练:若生成的自我编辑(SE)应用后能提升模型在目标任务上的性能,则模型会获得奖励。因此,SEAL可理解为一种包含两个嵌套循环的算法:外循环为强化学习,优化自我编辑的生成;内循环为更新循环,利用生成的自我编辑通过梯度下降更新模型。从元学习视角看,我们的方法本质是“元学习如何生成有效的自我编辑”。

算法1 自适应语言模型(SEAL):自我编辑强化学习循环

我们在两个不同领域实例化SEAL框架:知识整合与少样本学习。选择这两个领域是为了凸显模型自适应的两种互补形式:(1)将新信息整合到模型权重中,使其无需依赖上下文即可召回(通过SQuAD的无上下文变体任务评估);(2)在仅见少量示例的情况下泛化到新任务(通过ARC基准评估)。

图2:知识整合设置 给定新段落,模型生成“段落推论”形式的合成数据(即自我编辑),随后利用LoRA对这些输出进行微调。更新后的模型在“无原始文本访问”的情况下,基于段落相关问题进行评估,所得准确率作为强化学习的奖励信号。

知识整合

我们的目标是将段落中的信息高效整合到模型权重中。近期一种有前景的方法是:利用语言模型生成基于该段落的衍生内容,然后结合原始段落和生成内容进行微调[29,30,25,31,32]。生成内容的形式可多样,本文采用我们认为最具代表性的形式——从段落中推导得出的“推论(implications)”。该方法源自演绎闭包训练[30]:通过提示模型“列出从内容中推导的若干推论”,将给定上下文$C$转换为一组推论$SE=\\{s_1, s_2, …, s_n\\}$。输出的推论可包括对原始段落的推断、逻辑结论或重述。在附录B.11中,我们还探索了其他提示方式(如“以不同方式重写段落”“以问答形式重写”),并证明无论采用何种基础提示,我们的方法均能以相近或更大幅度提升性能。

这些自主生成的语句构成有监督微调(SFT)的训练数据:我们对每个序列计算标准因果语言建模损失,并更新模型参数得到。由于每次更新的数据量较小且总更新次数较多,我们采用低秩适配器(LoRA[72])实现高效、轻量级的微调。最终,基于自适应后的模型上的表现进行评估,该过程如图2所示。

在强化学习训练阶段,自适应模型在上的准确率定义为驱动外循环强化学习优化的奖励。通过这种方式,模型被训练为以“最利于通过微调实现信息吸收”的方式重组段落内容。

图3:基于SEAL的少样本学习 左图:ARC任务演示示例;中图:模型生成自我编辑,指定数据增强方式和训练超参数;右图:自适应后的模型在预留测试输入上进行评估。

抽象推理语料库(Abstraction and Reasoning Corpus, ARC)[8]是一个用于测试抽象推理能力和少样本泛化能力的基准。每个任务包含少量输入-输出演示示例,以及一个需预测正确输出的预留测试输入。

我们采用Akyürek等人[36]提出的测试时训练(TTT)协议:利用少样本示例的增强数据进行基于梯度的自适应。与依赖人工调整的启发式方法选择增强方式和优化设置不同,我们训练SEAL自主学习这些决策。该场景用于验证SEAL能否自主配置自适应流程——即确定应用哪些增强方式以及使用哪些优化参数。

为实现这一目标,我们定义了一组工具:每个工具都是Akyürek等人[36]提出的预定义函数,用于数据转换或指定训练参数,具体包括:

– 数据增强工具:旋转、翻转、反射、转置、缩放操作(如改变网格分辨率),以及链式或重复变换;

– 优化参数工具:学习率、训练轮次,以及损失计算范围(基于所有token或仅输出token)。

模型通过任务的少样本演示示例提示,生成自我编辑——在该场景下,自我编辑即“调用哪些工具及如何配置工具”的说明(如图3所示)。随后,利用该自我编辑通过LoRA微调实现模型自适应,并在预留测试输入上评估自适应后的模型性能,评估结果用于确定自我编辑生成的奖励。

我们将SEAL与以下基线方法进行对比:

1. 上下文学习(ICL):按照Akyürek等人[36]的协议,向Llama-3.2-1B-Instruct输入少样本示例提示,直接对测试输入进行查询。

2. 测试时训练+自我编辑(无前期RL训练):Llama-3.2-1B-Instruct利用少样本示例和合成增强数据进行测试时训练(TTT),但未经过任何用于优化“增强方式选择”或“训练配置选择”的前期强化学习。

3. 最优TTT(Oracle TTT):模型采用Akyürek等人[36]提出的人工设计最优配置进行测试时训练,作为我们方法的性能上限。

局限性

灾难性遗忘

我们为语言模型赋予自我编辑能力的核心动机之一,是向“持续学习”这一终极目标迈进——让模型能够通过与环境的智能交互或标准训练,不断整合新信息。尽管前文实验评估了SEAL对单个编辑的自适应效果,但更具挑战性的目标是支持“编辑序列”:模型能否在反复整合新信息的同时,保留已有知识?

这一问题直接关联到“灾难性遗忘”[73,74]的挑战——即新的权重更新会对既往学习成果产生破坏性干扰。当前训练设置中,我们并未明确针对“知识保留”进行优化,但我们建立了一个基线,用于评估SEAL在“无专门抗遗忘机制”情况下处理连续自我编辑的能力。为验证这一点,我们在知识整合领域模拟了持续学习场景:模型接收一系列测试段落,每个段落触发一次新的自我编辑;每次更新后,我们重新评估模型在所有既往任务上的表现,以衡量知识保留能力。

图6:连续自我编辑导致的灾难性遗忘 我们对模型进行多轮新段落更新,并追踪其在既往任务上的性能退化情况。逐元素标准误差详见附录B.6。

如图6所示,随着编辑次数的增加,模型在早期任务上的性能逐渐下降,这表明SEAL仍易受灾难性遗忘的影响。不过,模型能够在多次更新后避免性能完全崩溃,这为后续改进提供了可能。未来工作可通过以下方式增强模型的抗遗忘能力:采用奖励塑形[75,76,77]惩罚早期任务的性能退化;整合持续学习策略(如零空间约束编辑[78]、表征叠加[79]);此外,已有研究表明强化学习的遗忘程度低于有监督微调[80],因此SEAL的内循环也可考虑用强化学习替代有监督微调。

计算开销

与其他用于LLM的强化学习循环相比,TTT奖励循环的计算开销显著更高。例如,基于人类偏好的奖励信号通常仅需一次模型前向传播即可获取,而基于验证解的奖励信号可能仅依赖简单的模式匹配(如正则表达式)。相比之下,我们的方法需要对整个模型进行微调和评估才能计算奖励——每次自我编辑的评估约需30-45秒,这带来了巨大的计算开销(详见附录B.5)。

依赖上下文的评估

当前SEAL的实例化设置假设“每个上下文都与明确的下游任务配对”:少样本演示示例会附带预留查询对,每个段落会附带参考问答对。这种配对关系简化了奖励计算,但限制了SEAL的RL训练向无标签语料的扩展。一种潜在解决方案是让模型不仅生成自我编辑,还能自主生成评估问题——例如,为每个段落实例化问答对或合成测试用例(需确保生成时原始内容仍在上下文中)。这些由模型自主生成的查询可为强化学习提供即时监督信号,从而将SEAL的适用性扩展到“无外部问答集可用”的通用训练领域。

讨论与总结

Villalobos等人[81]预测,到2028年,前沿大型语言模型(LLM)将耗尽所有公开可用的人类生成文本。我们认为,这一即将到来的“数据壁垒”将迫使学界采用合成数据增强技术。一旦网络规模的语料库被耗尽,模型的进步将取决于其生成“高价值训练信号”的能力。一个自然的下一步方向是:元训练一个专门的SEAL合成数据生成模型,使其能够产出全新的预训练语料库——这将使未来的模型在不依赖额外人类文本的情况下实现规模扩展和数据效率提升。

我们可以构想这样一个未来场景:LLM能够接收新数据(如学术论文),并结合自身已有知识与上下文数据中的信息,为自己生成大量解释和推论。这种“自我表达与自我完善”的迭代循环,即使在缺乏额外外部监督的情况下,也能让模型在稀有或代表性不足的主题上持续改进。

此外,尽管现代推理模型常通过强化学习(RL)训练以生成思维链(CoT)轨迹,但SEAL可提供一种互补机制:让模型学习“何时以及如何更新自身权重”。这两种方法有望产生协同效应:模型可能在推理过程中选择更新权重以引导当前推理轨迹,或在推理完成后将关键见解提炼到参数中——通过内在化学习改进未来的推理过程。

这种“持续完善循环”对于构建智能体系统(agentic systems)同样具有潜力。智能体模型需在长期交互过程中运行,并能动态适应不断变化的目标。这类模型在行动过程中必须逐步获取并保留知识,而我们的方法通过支持“结构化自我修改”来实现这一需求:在一次交互后,智能体可生成自我编辑以触发权重更新。这能让智能体随时间推移不断发展,使其行为与既往经验保持一致,同时减少对重复监督的依赖。

SEAL的实验结果表明,大型语言模型在预训练后未必只能保持静态:通过学习生成自身的合成自我编辑数据,并借助轻量级权重更新应用这些数据,模型能够自主整合新知识并适应新任务。展望未来,我们计划将SEAL框架扩展到预训练、持续学习和智能体模型领域,最终让语言模型在数据受限的环境中实现自我学习与规模扩展。

附录

近期研究表明,强化学习的基线性能与结果对提示方式高度敏感。我们在知识整合场景中,额外实验了6种自我编辑提示方式。本文主体部分的所有结果均采用“推论提示(implications)”——我们认为这是最具代表性的提示方式[30,31]。不过,如第2节所述,已有研究发现“重写”或“生成问答对”等提示方式可能更有效。

此外,从图5的定性结果可见,强化学习显著增加了示例中模型响应的长度。因此,我们实验了“长推论提示(implications-long)”和“极长推论提示(implications-very-long)”,以验证是否可通过提示方式本身实现与强化学习类似的性能提升。

赞(0)
未经允许不得转载:171主机测评 » Self-Adapting Language Models论文分享
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址