欢迎光临
我们一直在努力

MetaRSI: A Meta-Recursive Self-Improving System for Recursive Self-Improving Systems Themselves

一、研究背景与核心问题

1.1 递归自我改进(RSI)的现状

递归自我改进(Recursive Self-Improvement, RSI)是指系统能够读取自身失败并改进模型构建机制本身,使后续构建的每个模型都继承这一收益。近期系统已证明这不再是思辨:智能体可以重写自己的脚手架、生成自己的微调数据。

1.2 核心问题:格式约束而非学科约束

作者通过对45个近期RSI系统的调查发现:

  • 69%的系统针对机器可免费检查的目标(测试套件、精确匹配键、数值目标、多项选择标签)闭合其改进循环

  • 报告科学基准的系统也落在这一多数之内,而非之外

  • 这导致RSI只能认证受限的、基准绑定的能力,而非学科本身的通用能力

关键洞察:约束瓶颈不是学科,而是验证格式。在问题开放、正确性由论证、复现或测量来判定的领域,RSI循环难以闭合。

1.3 两个持续存在的空白

  • 跨基底边界的系统硬编码单一顺序,而非从证据中决定顺序,尽管跨基底组合正是非交换性和冗余性出现的地方

  • 改进算子几乎总是固定程序,循环改进系统但没有任何东西改进循环


  • 二、核心贡献:MetaRSI-v1框架

    2.1 总体设计理念

    MetaRSI-v1是一个元递归自我改进系统,核心思想是:

    一个内核、两个轴、三个算子、覆盖所有领域

    改进被定义为在统一范式下、由三个类型化算子按调度组合而成。

    2.2 目标系统的三组件模型

    任何已部署系统被形式化为三元组:

    S=(D,θ,H)

    • D(数据状态):语料库、合成记录、训练课程

    • θ(模型状态):可训练参数、适配器、架构选择、训练配置

    • H(脚手架状态):系统提示、持久记忆、内置工具、技能库、MCP挂载的工具和资源

    三个组件共同决定已部署系统的行为,任何一个的变化都会改变另外两者所描述的内容。

    2.3 三个基础算子

    算子写表面核心功能成本特征
    Data-RSI D 从执行经验合成经验证训练记录,放大已有能力并标记边界 模型调用
    Harness-RSI H 通过五槽上的类型化补丁编辑执行脚手架,零训练成本 模型调用+重放
    Model-RSI θ 通过有界训练配方将能力内化到参数中 GPU小时

    三者的互补关系:

    • Data-RSI是放大器:压出模型已持有的能力,标记能力边界

    • Harness-RSI是脚手架:最便宜每单位收益,但每次推理重新支付上下文成本

    • Model-RSI是内化:一次性训练成本,推理时免费且跨脚手架持久

    2.4 循环内核:一个统一执行范式

    所有算子实例化同一个循环内核 KK,包含七个阶段:

    K=Observe→Diagnose→Propose→Validate→Execute→Select→Export

    核心权威边界:

    • 模型驱动弧(Diagnose, Propose):模型读取学习信号,归因失败,发出候选修改

    • 确定性代码弧(Observe, Validate, Execute, Select, Export):验证、执行、评分、导出

    关键设计:模型承担决定"什么错了"和"要改变什么"的全部语义负担,确定性代码持有决定"变更是否良好"的全部权威。

    2.5 学习信号与失败签名

    2.6 算子组合:五种可采纳转移

    信号新鲜度条件(定义4.3):工件是新鲜的,当且仅当它所源自的信号编译不早于最近的能力改变步骤。

    可采纳转移(公式23):

    Alegal​={D→H,D→M,H→D,M→D,M→H,D→D,H→H}

    Aforbidden={H→M,M→M}

    唯一跨算子排除 H→M 的原因:脚手架步骤改变系统能做什么但不产生数据,最近的数据集必然早于该变更,在其上训练将内化系统已取代的行为。

    2.7 双轴调度

    RSI² Agent-v1 在每个决策点选择两个轴之一:

    水平编排:扩展序列,绘制类型化改进程序

    2.8 元层:改进调度器

    MetaRSI² Agent-v1 在每个改进项完成后修订RSI² Agent-v1的调度策略:

    ϕ←Mψ​(ϕ,Hterm​)

    三个嵌套改进层级:

    层级智能体改进对象节奏
    L1 循环内核 目标系统 每个算子步骤
    L2 RSI² Agent-v1 算子及其组合 每步/每项
    L3 MetaRSI² Agent-v1 调度策略 每项一次

    2.9 框架保护机制

    三种分离保持目标函数有意义:

  • 提议与验证分离:模型诊断和提议,确定性代码验证、评估和提升

  • 候选生成与发布分离:至多一个后继被发布和评分

  • 密封测量在每一层级每个写表面之外:

  • 三、实验验证

    3.1 实验设置

    两个目标线:

    • 自托管开放权重:Qwen3.5-35B-A3B(35B总参数,3B活跃参数),所有权重可写,三个算子都可作用

    • 前沿模型:通过提供者接口触及,权重不可写,只能走Data-RSI+Harness-RSI路线

    闭环自我演化:每个模型驱动角色都由目标模型自己扮演,无外部教师。

    基准:

    • 可执行:Terminal-Bench 2.1(89任务)、SWE-bench Pro(731任务)

    • 闭式:GPQA-D-hard100(100个冻结难题)、AIME(2025+2026,60题)

    3.2 主要结果

    方法Terminal-Bench 2.1SWE-bench ProGPQA-D-hard100AIME平均Δ
    冻结参考 23.6 10.3 71.2 55.0
    Data-RSI 27.4 (+3.8) 12.4 (+2.1) 73.8 (+2.6) 57.7 (+2.7) +2.8
    Harness-RSI 29.4 (+5.8) 14.9 (+4.6) 78.8 (+7.6) 63.3 (+8.3) +6.6
    Model-RSI 27.0 (+3.4) 14.0 (+3.7) 75.4 (+4.2) 59.3 (+4.3) +3.9
    人类固定D→M→H 30.3 (+6.7) 15.3 (+5.0) 79.4 (+8.2) 64.3 (+9.3) +7.3
    静态路由器 30.8 (+7.2) 14.9 (+4.6) 79.6 (+8.4) 64.0 (+9.0) +7.3
    MetaRSI-v1 31.9 (+8.3) 19.5 (+9.2) 83.8 (+12.6) 68.3 (+13.3) +10.9

    核心发现:

  • MetaRSI-v1在所有四个基准上最佳,平均提高10.9分

  • 收益不由单一算子承载,调度组合在最强单一算子(Harness-RSI)之上再增加4.3分

  • 完整系统击败两个组合基线3.6分,尽管三者组合相同算子、相同证据,仅顺序决策者不同

  • 调度组合不是簿记:调度策略本身是承重组件

  • 3.3 前沿模型自我改进

    六个前沿模型在Terminal-Bench 2.1上通过脚手架路线自我改进:

    模型基线改进后增益
    Gemini 3.1 Pro 66.3 75.5 +9.2
    DeepSeek V4 Pro 83.6 91.2 +7.6
    Claude Opus 5 84.5 92.1 +7.6
    Kimi K3 84.0 91.2 +7.2
    GPT-5.6 Sol 83.4 90.1 +6.7
    GLM-5.2 78.4 84.0 +5.6
    均值 +7.3

    关键结论:脚手架路线不是在修复小模型特有的缺陷——前沿模型也留下材料性收益,自导向循环可在无权重更新、无外部教师的情况下恢复。

    3.4 改进改进者(元层效果)

    五个连续项的对比:

    指标无元更新有元更新
    累积收益(项5) +20.7 +26.2
    每项收益(项2→项5) +4.9→+0.7 +7.2→+1.4
    平均每项(项2-5) +2.5 +3.8
    平台期 项4 项5
    算子策略编辑保留率 38% 68%
    调度器遗憾 16.5% 8.2%

    结论:元更新买到更晚的平台期和更高的天花板;发布的后继是更好的改进者,而不仅是更好的系统。


    四、五条递归自我改进定律

    定律核心主张机制反驳条件
    定律1 验证而非能力设定前沿 循环建在闭合廉价处,闭合在验证免费处廉价 控制验证级别后循环数仍跟踪能力
    定律2 自我知识会过期,重新描述是速率限制 关于已不存在状态的证据不支持任何推断 循环在旧描述上持续获得收益
    定律3 胜任力无基底,其成本不是 只有双基底循环才能退役另一个已吸收的东西 单基底循环改进而每推理成本不增长
    定律4 信任由不能写什么来衡量 被允许移动目标的优化器会移动它 可写锚点产生经得起不可写锚点的收益
    定律5 没有循环创造能力,每个收益都是导入的 从未展示能力的记录与正确记录模式上无法区分 边界之外的合成可测量地有帮助

    五条定律的联合意义:

    进步的单位是循环,而非模型。富有成效的问题不是"如何让模型更强",而是"在一个从未闭合过循环的地方,能以多低成本闭合一个新循环"。

    五、跨领域扩展与物理世界

    5.1 验证器阶梯

    级别验证器示例领域Data-RSI的用途
    1 可执行测试、精确匹配 软件、终端、闭式科学 将合成导向诊断
    2 数值收敛、模拟 流体与结构设计、电路 同上,以模拟器成本
    3 报告结果复现 ML复现、计算生物学 分离方法缺口与数据缺口
    4 带仪器的协议执行 湿实验室化学、材料合成 决定运行哪些实验
    5 专家评分,无真实标准 法律、政策、历史编纂 限定专家时间请求

    5.2 科学生产线的分解

    任何科学或工程计划本身就是一条生产线,其阶段可以插入一阶算子:

    • 材料计划:候选生成→性质预测→合成路线规划→表征→解释

    • 计算生物学:假设构建→测定设计→流水线构建→统计分析→写作

    • 硬件计划:规格→架构探索→实现→验证→物理收敛

    关键洞察:领域不必一次闭合整个循环。在单个阶段实例化框架产生一阶循环,已产生有用结果和相邻阶段可用的类型化工件。

    5.3 物理世界的挑战

    延续:学习信号、预算账本、受保护分离对验证器类型无差别。

    失败模式:

  • 可逆性:物理动作没有沙箱,不可回滚

  • 循环延迟:昂贵算子需要数天并消耗材料,调度器工作从排序变为决定是否行动

  • 所需添加:

  • 分级保真度:模拟→台架代理→仪器

  • 不可逆性感知动作空间

  • 人类授权作为受保护表面

  • 六、核心创新点总结

    6.1 理论创新

  • 从单一表面到生产流水线:将自我改进从单一可编辑表面重新定义为贯穿数据、脚手架、模型三个表面的组合

  • 类型化算子代数:三个算子写表面不相交,信号新鲜度条件精确允许五种可采纳转移

  • 双轴调度:水平编排(算子顺序)+ 垂直优化(算子策略),联合优化

  • 元层递归:RSI²改进算子,MetaRSI²改进调度器,三个嵌套层级

  • 五条可证伪定律:关于循环存在、算子组合、监督价值的可反驳主张

  • 6.2 工程创新

  • 循环内核:一个统一执行范式,模型提议+确定性代码裁决

  • 类型化适配器:五种Transition Agent-v1实现可采纳边的工件转换

  • 受保护分离:密封评估器在每一层级每个写表面之外

  • 开源组件RSI-Harness:脚手架算子的运行时和基因组格式

  • 6.3 实证创新

  • 无外部教师的闭环自我改进:3B活跃模型驱动两位数平均自我改进

  • 前沿模型脚手架路线:六个前沿模型平均+7.3分,证明不是小模型技术

  • 元层复合效应:五项运行显示元路径达到+26.2 vs +20.7,平台期延后

  • 组合vs单算子:调度组合在最强单一算子之上再增加4.3分

  • 七、核心结论与立场

    7.1 主要结论

  • 格式约束而非学科约束:RSI的约束瓶颈是验证格式,69%的系统针对机器可检查目标闭合循环

  • 组合优于单算子:三个算子携带互补信号,调度组合在最强单一算子之上再增加4.3分

  • 调度策略是承重组件:完整系统击败两个组合基线3.6分,仅顺序决策者不同

  • 元层买到更好的改进者:元更新使改进者每项增加7.2 vs 4.9分,平台期延后

  • 脚手架路线适用于前沿模型:六个前沿模型平均+7.3分,不是小模型技术

  • 7.2 核心立场

    进步的单位是循环,而非模型。

    对于下一阶段进步,约束瓶颈不是模型多有能力,而是存在多少循环以及它们能在哪里闭合。富有成效的问题不是"这个模型能好多少",而是"在一个从未闭合过循环的地方,能以多低成本闭合一个新循环"。

    7.3 实践意义

    • 对新领域:实例化框架只需三个输入——一个任务族、一个任何保真度的验证器、一个种子脚手架

    • 对部署者:脚手架路线适用于权重不可触及的场景;模型路线适用于大规模长期服务

    • 对研究者:五条定律提供可证伪的假设;验证器构建比模型扩展更可能拓宽自我改进前沿

    • 对社区:RSI-Harness开源,鼓励贡献基因组,构建狭窄、经过良好测试的脚手架公共库

    八、局限与未来方向

    8.1 当前局限

  • 实验仅在可执行编码和闭式科学推理两种状态下实例化

  • 物理世界循环(材料合成、湿实验室、机器人)仅做理论分析,未实证

  • 元层改进者的长期复合效应仅验证五项

  • 跨领域工件迁移的实证研究留待未来

  • 8.2 未来方向

  • 跨领域实证:在更多科学和工程领域实例化框架

  • 物理世界循环:开发不可逆性感知动作空间、分级保真度、人类授权机制

  • 第四算子:写环境模型本身的算子,处理未建模情境

  • 社区基因组库:通过RSI-Harness构建共享脚手架库

  • 长期复合研究:验证元层改进者的多年尺度复合效应

  • MetaRSI-v1是一个将递归自我改进从单一表面编辑重新定义为数据、脚手架、模型三表面调度组合的框架。其核心创新包括:一个循环内核、三个类型化算子、五种可采纳转移、双轴调度、三层嵌套改进。实验证明,在无外部教师条件下,3B活跃模型驱动两位数自我改进;六个前沿模型通过脚手架路线平均+7.3分;元层使改进者本身持续改进。框架产生五条可证伪定律,核心立场是:进步的单位是循环,而非模型。这里是自己的论文阅读记录,感兴趣的话可以参考一下,如果需要阅读原文的话可以看这里,如下所示:

    项目地址在这里,如下所示:

    模型发布地址在这里,如下所示:

    摘要

     递归自我改进(RSI)让系统能够从自身的失败中改进模型构建机制,从而使之后构建的每一个模型都继承这一收益。然而,RSI 几乎仅在编码和形式化基准(如科学问答和数学)上得到验证。这种格式上的局限使 RSI 只能在一个机器可检查的切片内实现改进,而非在问题开放、正确性由论证、复现或测量来判定的通用能力上实现改进。我们认为,RSI 下一步必须跨越真实、多样的科学、工程和元科学领域,而不仅仅是在形式化评估易于处理的地方运作。为此,我们提出 MetaRSI-v1,其中改进是在一个统一范式下、由三个类型化算子按调度组合而成。Data-RSI 放大已有能力并标记其边界;Harness-RSI 在不触碰权重的情况下编辑五槽脚手架;Model-RSI 通过有界训练将能力内化到参数中。三者共享同一个循环内核和工件词汇表,使数据、脚手架和模型的变更可组合而非互斥。一个双轴优化器联合决定算子顺序和每个算子的提议策略,而一个元级策略跨项修订调度。我们在该领域的标准评估下验证 MetaRSI-v1,涵盖代码和闭式科学,且无外部教师:目标模型在其自身循环中扮演所有角色。MetaRSI-v1 将自我改进从单一表面的编辑重新定义为贯穿整个模型生产流水线的组合,开辟了两条路径:一条模型路线,通过训练内化能力;一条脚手架路线,不触碰权重,从而将自我改进扩展到任何可通过接口触及的模型,并将 Data-RSI 重新定义为喂养这两者的共享基底。该框架还产生了关于循环存在于何处、算子如何组合以及监督能买到什么的可证伪定律。

    图 1:MetaRSI-v1 概览。 1:循环在验证可机器检查处闭合。2:一个内核、三个算子,各有一个可写表面。3:六种排序中有五种可采纳。4:三个嵌套的改进层级。5:水平组合,垂直策略重写。色带从可自由验证延伸到不可验证。

    1. 引言

    递归自我改进(RSI)追问的是:一个系统能否读取自身的失败并改进模型构建机制本身,从而使之后构建的每一个模型都继承这一收益。近期系统表明这已不再是思辨:智能体重写自己的脚手架 [1-3] 并生成自己的微调数据 [4, 5]。然而,RSI 迄今几乎仅在编码任务和形式化基准(如多项选择科学问答、数学题集和可执行测试套件)上得到验证。在我们对 45 个近期系统的调查中,69% 的系统针对机器可免费检查的目标闭合其改进循环,而报告科学基准的系统也落在这一多数之内而非之外(图 4)。这是格式约束而非学科约束。此类循环所认证的是受限的、基准绑定的能力,即在一个预先指定的、机器可检查的学科切片内的胜任力,而非该学科本身的通用能力——在那里问题并非给定,正确性由论证、复现或测量来判定。专业化的缺失也不是问题所在:一个已部署系统的行为由其数据、权重和执行脚手架共同决定,三者中任何一个的变化都会改变另外两者所描述的内容(图 3),因此需要一个统一范式,同时覆盖所有三个表面,并由一个元级策略治理下一步该做何种变更。

    我们提出 MetaRSI-v1,一个元递归自我改进系统,建立在三个类型化算子之上,它们共享一个循环内核并消费同一个学习信号。Data-RSI 从执行经验中合成经过验证的训练记录,放大模型已经擅长的能力并标记该能力的边界。Harness-RSI 通过五槽上的类型化补丁编辑执行脚手架:系统提示、记忆、内置工具、技能,以及通过 MCP 挂载的工具和资源,在零训练成本下立即生效。Model-RSI 在有界训练配方下修改模型参数和架构,将能力内化到权重中,使其跨脚手架持续存在且不增加推理成本。这些算子由 Transition Agent-v1 适配器连接,后者在它们之间传递学习信号及其输出。在此之上,RSI² Agent-v1 在两个轴上优化。水平方向上,它决定算子应用的顺序,因为顺序会改变每个后续算子读取的内容,且某些顺序本身就不合法;垂直方向上,它重写每个算子自己的提议策略,改进该算子诊断失败和提议变更的方式。这两个轴在单一反馈流下联合优化,因为组合会继承其最弱算子的质量,而固定算子集会将其缺陷向上传递。再往上,MetaRSI² Agent-v1 在每次改进项完成后修订调度策略本身。三个嵌套层级修改三个不同的对象:算子改变系统,RSI² Agent-v1 改变组合,MetaRSI² Agent-v1 改变组合的规则。这些控制角色由它们可以读取和写入的内容来定义,而非由占据它们的东西来定义。四者中的任何一个都可以由人类专家替代模型来担任,遵循相同的类型化契约和相同的审计:调度器、子智能体、元智能体或过渡适配器。我们在代码执行和闭式科学推理上验证 MetaRSI-v1,这是社区证据标准最高的地方。整个过程中,系统仅使用自身进行改进:循环中每个模型驱动的角色都由目标模型扮演,因此没有更强的外部模型提议、评判或调度,收益归因于机制而非教师。

    该框架开辟了两条互补的前进路线,一条通过 Harness-RSI,一条通过 Model-RSI。我们将 Data-RSI 重新定义为这样的算子:将执行经验转化为经过验证的记录,并标记该经验所支持内容的边界;其输出被 Harness-RSI 和 Model-RSI 共同消费;它们变更的结果作为新证据流回 Data-RSI,重新缩放系统所知并驱动下一轮。三个算子之间的这种反馈使系统自我强化,能力跨轮次复合增长。该框架是为科学和工程实践的实际发生方式而设计的。在任何学科中,工作分解为若干阶段,从假设构建和实验设计到执行和解释,每个阶段都已具备循环所期望的形状:它接受类型化输入,产生可观察结果,并留下下一阶段可使用的记录。这意味着一个领域不必一次性闭合其整个循环。单个阶段的局部循环已经产生相邻阶段可以建立其上的记录,而组合机制将这些局部循环扩展为流水线级循环。至关重要的是,循环留下的记录跨轮次累积并以模型检查点无法做到的方式跨领域迁移。正是这种记录的累积和迁移使改进能够超越其起始的狭窄切片而复合增长。在此基础上,该框架陈述了五条结构性定律,涉及循环存在于何处、算子如何组合,以及外部监督能买到什么,每一条都表述为可证伪的断言(第 6.7 节)。这些定律共同支持一个核心立场:进步的基本单位不是模型,而是循环。因此,富有成效的问题不是“如何让模型更强”,而是“在一个从未闭合过循环的地方,能以多低的成本闭合一个新循环”(第 6.8 节)。

    2. 相关工作

    2.1. 基础模型

    自我改进如今试图扩展的能力本身是由一系列工程范式产生的,而这一序列的形状解释了剩余空间在哪里。规模是第一范式:Transformer [6] 使算力成为约束瓶颈,经验缩放定律将模型规模、数据量和算力转化为可预测的权衡 [7, 8],产生了无需任务特定训练便涌现出少样本能力的模型 [9]。对齐是第二范式:指令微调和基于人类反馈的强化学习将原始的下一个 token 胜任力转化为可遵循的接口 [10, 11],开放权重家族使该接口可广泛复现 [12-14]。

    推理时计算是第三范式:思维链提示表明在固定权重下额外的串行计算能换取准确率 [15],这一权衡后来由测试时缩放分析明确化 [16],并被用可验证奖励训练的推理模型内化 [17, 18]。第四范式,也是当前系统所处的范式,将能力完全移出权重:检索、工具、记忆和长时程智能体循环 [19-21] 现在中介了已部署模型所能完成的大部分工作,而工具和上下文提供的标准化接口已使这一脚手架成为一等工程工件。作为序列来读,这些范式显示了有效能力位点的持续迁移:从参数,到对齐数据,到推理过程,再到周围的执行结构。因此,仅局限于其中任何一个的自我改进框架只处理了决定模型行为的一部分。正是这种迁移使 MetaRSI-v1 将数据、脚手架和模型视为一个系统的三个可写表面,而非三个独立目标。

    2.2. 递归自我改进

    这一思想由来已久,推动了经典智能爆炸论证 [22] 并在哥德尔机 [23] 中形式化,但直到最近才可构建。已构建的工作按其将系统的哪一部分视为可变来分类,而这种分类使该领域的集中性变得可见。最早的工作处理输出:自我精炼和言语反思在一个回合内修订答案 [24, 25],检查成本低但不留下任何东西,且在没有外部信号时几乎无法纠正 [26]。第二类处理脚手架:STOP 改进改进程序的程序 [1];ADAS 和 AFlow 在架构和工作流图上搜索 [2, 27];哥德尔智能体和达尔文哥德尔机在经验选择下重写自己的代码 [3, 28];Self-Harness、DemoEvolve 和 MetaSkill-Evolve 直接针对脚手架演化 [29-31]。

    第三类处理数据:STaR 从正确答案引导推理 [32],自奖励模型产生自己的偏好信号 [33],自适应 LM 发出自编辑并成为微调数据 [4],DataEnvGym、SEAL 和 RSIBench-Data 分别将数据生成器、环境和后训练栈置于控制之下 [5, 34, 35]。第四类小得多,跨越这些边界:SIA 同时更新脚手架和权重,并报告组合优于仅脚手架改进 [36],而 Hyperagents 和 Escher-Loop 同时优化多个组件 [37, 38],AlphaEvolve 针对固定评估器演化程序以改进算法和硬件设计 [39]。综述确认了这种划分及其不平衡 [40, 41],互补工作调查了持续自我修改引入的风险和结构限制 [42, 43]。

    按学科读,分类法看似多样;按闭合每个循环的东西读,它坍缩了。在这些系统的 69% 中,验证对象是键或测试(表 7 给出了逐系统分配),而报告科学基准的系统在这一多数之内而非之外。它们改进的是真实的东西,称之为编码单一栽培是对它的误描述;它们认证的是受限的、基准绑定的能力,受使循环可负担的闭式格式所限。两个空白持续存在。跨越基底边界的系统硬编码单一顺序而非从证据中决定,尽管跨基底的组合正是非交换性和冗余性出现的地方;且改进算子几乎总是固定程序,因此循环改进系统但没有任何东西改进循环。MetaRSI-v1 同时处理这两者,通过使算子集类型化且可组合,并将调度策略和每个算子的提议策略置于共享元优化器之下。

    2.3. 能力边界

    第三条工作线测量模型能力实际止于何处,正是它使上一小节的集中性成为问题而非偏好。广泛的多学科套件确立了胜任力在学科间高度不均 [45-47],专家编写的评估锐化了这一图景:GPQA 隔离了抵抗网络搜索的研究生级科学 [48],FrontierMath 针对研究级数学 [49],Humanity's Last Exam 横跨古典语言、古代历史和哲学以及科学 [50]。图景沿验证格式分裂。编码和终端基准推动了十年的脚手架进展 [51-53],闭式科学已被压缩,GPQA-Diamond 从基准发布时最佳模型的 38.8% 上升到两年内的九十出头,高于 Rein 等人 [48] 报告的博士级专家的 65% 到 74%,而开放式和基于实践的领域仍远未达到专家表现。

    研究生级多项选择项是一个闭式工具:问题给定,答案集枚举,正确性是查找。使其饱和表明知识和推理链在该框架下存在,但对学科实际工作覆盖多少仍开放——在那里问题并非给定,正确性由论证、复现或测量来判定。在开放式一侧,同样的模型仍远未达到专家表现,缺陷集中在缺乏廉价验证器的地方 [50],而围绕实践而非问答构建的基准强化了这种不对称:复现机器学习研究、重现论文和执行实验室协议对饱和多项选择科学的系统仍然困难 [54-58]。图 5 的面板 (e) 在六个配对基准上量化了这一点,其端点和来源在第 A.2 节给出,其中实践端在每一对上都比回忆端低 35 到 83 分,使指示性能力轴成为上界而非度量。只有 MLE-bench 配对是在单一系统内测量的;其他五个比较每一端的最佳已发表前沿分数;人文学科差距最大部分是因为其实践端较旧,5.2 是 HLE 论文自己的 o3-mini (high) 人文学科行 [50],而前沿模型现在在 HLE 整体闭卷上达到约 55,带工具约 65。没有任何报告整体数字的榜单发布按类别的人文学科数字,因此保留较早的端点并标注,而非插补。

    因此必须区分两种状态,图 5 将它们分开,而图 4 显示努力去了哪里:能力大体存在但尚未围绕其闭合循环的领域,以及能力缺失且任何脚手架都无法制造它的领域。我们将每个领域放在验证器阶梯的一级上(表 6;第 6.4.1 节定义):第 1 级为可执行测试和精确匹配,第 2 级为模拟,第 3 级为报告结果的复现,第 4 级为带仪器的协议执行,第 5 级为无真实标准的专家评分。级别由该领域实践基准的验证方法分配,而非其回忆基准,因此它是该基准的属性;表 9 按领域给出,第 A.1 节为每个分配提供依据。在普查的 55 个闭合循环中,53 个位于第 1 至 3 级;两个例外是机器人操作中的一个第 4 级循环和法律中一个狭窄的电荷分类第 5 级循环。该普查在 2026 年 8 月翻倍,从 18 个领域的 22 个循环增加,翻倍使零值有意义:33 个新循环中没有第 4 或 5 级的,而从未有过循环的八个领域仍然没有。持续损失区域的五个领域——经济学、临床决策支持、法律、历史和哲学——都位于第 5 级,能力在 67.8 到 80.8 之间,与 RSI 已起作用的第 1 至 3 级领域相当,但它们的实践不承认自动目标。报告能力阈值为 60,持续损失集对 (59.2, 67.8] 中任何阈值都是同样五个领域,其下界是湿实验室协议的 59.2,上界是法律的 67.8。闭合循环也不要求能力高于该线,因为机器人操作在 12.8、单细胞基因组学在 52.8 都已闭合一个。区别是操作性的:第一种状态可通过放大和外部结构处理,第二种需要新知识进入系统,这正是我们的 Data-RSI 算子被构建来自动提取的。

    3. 预备知识

    本节固定任何自我改进程序所操作的对象、它被允许读取的信号,以及评判其输出的标准。此处引入的所有符号在本文其余部分不变地复用。

    目标系统 被改进的实体不是检查点,而是一个三元组

    即从系统在当前状态下所做尝试中抽取的证据集 E 的确定性编译,其中 yk​ 是第 k 次尝试的结果记录:在此评估的代码和问答轨道中,就是上面的验证器标量 rk​,一般则是该领域能够确立的关于该尝试的任何内容。我们通过它扮演的角色而非采取的形式来定义 σ,因为跨领域形式变化而角色不变。在实现中,σ 是携带原始轨迹和诊断的编译证据包;后文对轨迹或经验的引用均指该包的组件。

    可进入证据集的内容 四类:任何保真度的验证器结果、系统自身的轨迹(读取其展现的胜任力,而不仅是是否成功)、针对已证明缺口而引入的外部知识,以及框架自身的决策记录。来源可采纳的条件是:它源自当前系统,可被每个算子读取,且不携带决定变更是否良好的权威。使某物成为学习信号的是它在循环中的位置,而非其模态。

    编译器输出什么 Σ 是确定且固定的:它聚合、归因并附加来源,输出一个分三层的类型化对象(结果层、归因层和模型归因机制层,其模式为公式 (10)),且不决定要改变什么。固定类型化同时保持来源开放,正是使单一算子集能运行在证据毫无其他共同点的领域上的原因。

    信号的两个属性 它是环境与任何改进程序之间的唯一通道,这使异质程序可比较、交换和组合。且它是易腐的:改变已部署系统行为的步骤会使之前编译的每个信号失效,因为此类信号所总结的尝试是由一个已不存在的系统做出的。

    改进程序与预算 改进程序是一个映射

    3.1. 目标形式化

    令 Π 表示改进程序的内部策略(它们诊断、提议和选择的方式),ϕ 表示在一个项内产生序列 z 的策略。我们优化的量是一个项的实际部署改进生产力,受成本、对先前持有能力的回归,以及工作信号与密封测量之间差距的惩罚:

    4. 方法

    概览。 MetaRSI-v1 从内到外构建。我们首先固定一个统一的执行范式(一个由学习信号闭合、被一个权威边界切割一次的循环),每个自我改进算子都必须实例化它,因此算子在写什么上不同,但在如何运行、验证或审计上相同(第 4.1 节)。在公式 (1) 的目标系统的三个组件上实例化该内核,产生三个基础算子:Data-RSI,从执行经验合成经过验证的记录并发出另两者消费的证据;Harness-RSI,在不触碰模型的情况下编辑五槽执行脚手架;Model-RSI,通过有界训练配方将能力内化到模型中(第 4.2 节)。由于三者共享一个工件词汇表,它们的邻接变得可分析而非任意:学习信号上的单一新鲜度条件恰好允许六种有序算子对中的五种,每条可采纳边由一个类型化 Transition Agent-v1 适配器实现,将生产者的输出转换为消费者的输入(第 4.3 节)。在算子层之上,RSI² Agent-v1 消费当前序列和最新信号,在水平扩展序列和垂直重写算子提议策略之间选择,后者受可变更、动作和受保护表面的显式契约约束(第 4.4 节)。最后,一个元智能体通过在一个改进项完成后修订 RSI² Agent-v1 自己的调度策略来闭合最外层循环(第 4.5 节)。图 6 绘制了整个项,其三个区域从左到右分别对应第 4.1 节、第 4.2-4.3 节和第 4.4-4.5 节。

    4.1. 循环内核:异质算子的一个范式

    写入 S 不同组件的算子在实现层面几乎没有共同点:一个合成训练记录,一个重写系统提示,一个提交训练作业。它们共享的是关于权威的契约;将范式定位于该层面而非阶段列表层面,正是使其可跨实现完全不同的领域移植的原因。

    定义 4.1(自我改进算子)。 自我改进算子是满足三个条件的任何过程:(i) 其唯一输入是公式 (2) 的编译学习信号 σ,从不直接是环境;(ii) 其中决定要改变什么的部分是策略 π,且可变更;(iii) 其中决定变更是否良好的部分是固定的、外在于算子的,且在其写表面之外。形式化地,

    它命名了公式 (3) 的一般过程中可改进的部分。

    在可变更弧上,Diagnose 和 Propose 是模型驱动的:语言模型读取学习信号和当前组件状态,归因观察到的失败,并发出候选修改及预期效果和风险陈述。其余五个阶段是确定性代码:Observe 绑定算子声明其消费的类型化输入;Validate 根据模式检查提议并拒绝任何在算子声明写表面之外的编辑;Execute 在隔离工作区应用存活的提议;Select 用固定评估器和提升规则对候选评分;Export 发出携带内容哈希、其父本、支持证据和实际成本的类型化工件。Select 和 Export 在算子写表面之外的受保护代码上运行(第 4.7 节)。模型承担决定什么错了和要改变什么的全部语义负担,而确定性代码持有决定变更是否良好的全部权威;这种分工使算子可安全置于自动调度器之下。

    内核恰好消费一个环境输入,即公式 (2) 的学习信号 σ,其来源不受约束且其三层类型化是固定的。对每个失败轨迹,该类型化的具体模式是一个失败签名:

    4.2. 三个基础算子

    在 S 的三个组件上实例化公式 (8),产生三个写表面按构造不相交的算子。本小节余下部分依次展开每个算子。一旦写下目标系统,三者就从公式 (1) 得出:已部署系统是数据状态、模型状态和脚手架状态,因此改变系统行为的算子恰好写三者之一。三者还处于固定成本顺序(模型调用,然后模型调用加重放,然后 GPU 小时),正是这种排序使第 4.4 节的调度问题非平凡。

    Data-RSI——放大器: 从系统自身执行中合成经过验证的记录,并标记该经验结束之处,因此监督只花在边界之外;其产品喂养另两者。Harness-RSI——脚手架: 在类型化补丁下编辑五槽执行脚手架,在不触碰权重的情况下增加能力。每单位收益最便宜;每个添加在推理时作为上下文重新支付。Model-RSI——内化: 在有界配方下将重复的上下文成本转化为一次性训练成本。最持久、最昂贵;需要后于上次能力变更的数据集。

    4.2.1. Data-RSI:从执行经验进行验证合成

    Data-RSI 写数据状态 D。它消费内核 Execute 阶段的执行轨迹,并返回经验证训练记录的 DATASET 工件,另两个算子消费它。其核心原则是合成锚定于观察到的执行而非发明:每条记录都源自实际轨迹蒸馏的经验,因此合成保持在观察轨迹所支持的范围内。该算子压出模型已持有的能力并标记该能力结束之处。对每个项 e,算子提取四维学习签名:

    拒绝将项退回修订至固定上限,未在上限内收敛的项被丢弃。因此合成记录由输入隔离下的盲重新推导认证,而非生成器自己的置信度,这使 Data-RSI 能在没有机器可检查键的领域写记录,同时保持认证与生成器解耦。这认证的是盲重新求解下的自洽性;它不认证相对于模型自身所缺知识的正确性(第 6.2 节,定律 5)。

    验证 通过对抗生成的记录经过独立验证器,该验证器结合确定性契约检查和模型驱动语义检查:

    4.2.3. Model-RSI:将能力内化到模型

    Model-RSI 写模型状态 θ。它消费 Data-RSI 产生的 DATASET 工件,并通过有界训练配方将经验证记录内化到参数中。该算子在一个有界提议空间内同时跨越可训练权重和模型架构:权重更新覆盖选定目标模块上的适配器参数,架构决策覆盖适配器放置、层级参与和可训练参数集本身。Harness-RSI 以零训练成本向脚手架添加能力并在每次推理时作为上下文重新支付,而 Model-RSI 支付一次性训练成本,使能力在推理时免费且跨脚手架持续。提议空间是有界配方,

    4.3. 算子组合:五种可采纳转移

    恰好五个可采纳跨算子转移和两个可采纳自转移。唯一的跨算子排除是 H→M:脚手架步骤改变已部署系统能做什么但不产生数据,因此最近的数据集必然早于该变更,在其上训练将内化系统已取代的行为。同一条件排除自转移 M→M,而 D→D 和 H→H 作为各算子的迭代搜索机制仍可采纳。图 8 绘制了结果图。

    一条可采纳边声明组合合法,但尚不可执行:生产算子的输出格式仍需转换为消费者的输入。因此每条可采纳边由 Transition Agent-v1 适配器实现,一个只做此转换的小型类型化程序,

    4.4. 双轴调度

    其中 Ξ 是以下接受检查唯一约束的字段。每条指令路由到其目标算子的专用 RSI² Sub-Agent-v1。RSI² Sub-Agent-v1 读取指令、算子当前策略 πi​ 和可归因于它的近期轨迹部分,并返回修订策略。契约 κ 将算子的每个字段划分为三类。可变更表面开放修订:治理算子如何诊断、提议时优先考虑什么,以及如何陈述自身适用性的指令。动作表面是算子在目标系统上写的内容,与第 4.2 节的写表面相同。受保护表面保持固定:评估器、沙箱、发布门、工件模式、证据链,以及算子的身份和声明输入输出类型。修订策略通过四项检查后安装:

    第三项在实践中是决定性的:要求实际差异等于声明修改使每个变更都显式,因此垂直优化采取对命名策略的受控编辑形式,请求表面约束其范围和审计轨迹。

    两个轴消费相同证据但作用于不同对象,实现公式 (9) 的两级分离:水平编排产生目标增量 ΔS,垂直优化产生算子增量 Δπ。保持它们区分给第 5 节的实证分解三个显式归因对象:序列、算子及其交互。

    4.5. MetaRSI:改进调度器

    第 4.4 节的 RSI² Agent-v1 本身是一个策略,目前没有任何东西改进它。它的选择与算子的提议策略一样可学习:何时从编排切换到优化、在证据证明训练步骤合理前承诺多少预算、何时停止,以及诊断应放置多少置信度。这些也是决定算子是否被良好使用的选择,因此我们闭合再一层循环。一个完整改进项是执行到停止意图、在受保护发布门下评估并发布或拒绝的序列(第 4.6 节陈述其生命周期)。每个项后,MetaRSI² Agent-v1 读取整个项并提议更新,

    三个算子是高容量和机械的,每个分片合成数千条记录并重放候选补丁,因此人类占据者将是约束瓶颈而非判断来源。四个智能体每项做出相对少的决策,而这些决策恰恰是受益于判断的。这使部分手动部署实际可行而不仅是可能,并给出一个谱系:一端全自动,中间人类持有调度器而算子自动运行,另一端每个决策点都由人类。在新领域,框架自身证据薄弱时,我们期望首次部署位于该谱系的中间;该谱系也是轨迹而非固定选择:早期人类提供相对大份额的高质量指导,制定提示并在智能体少数决策点做出判断,而高容量算子自动运行,随着编译证据和提升基因组累积,该份额意在减少,一旦框架自身记录足够强,每个角色回到智能体,直到系统达到全自动端。人在环中是通往自主的路径点,而非人与机器之间的永久分工。表 2 命名三层及每层所属的智能体和改进对象,因为保持它们分开是第 5.2 节组合比较定义良好的原因。

    4.6. 总体运行:改进项的生命周期

    步骤 6(M,然后 M → D 和 M → H)。 Model-RSI 从固定基础训练有界候选配方;独立评估层对其评分,发布门提升一个。然后信号重新编译通过 M→D 适配器在新权重下重新评分,之后冗余调和读取训练报告,发现 κv​ 不再在步骤 3 条目所添加的项上触发,并提议删除这些条目;删除被重放并保持准确率,因此保留。

    垂直交错。 在任何决策点,RSI² Agent-v1 可用垂直优化替代下一个水平步骤。例如,如果 Data-RSI 不断发出后来显示无评估增量的指令,RSI² Agent-v1 针对 data.policy 发出指令而非调度另一个算子,算子的提议策略在其契约内被重写:它优先考虑哪些签名维度,以及如何将诊断转化为指令。

    算法 1:MetaRSI-v1 的一个改进项
    1: σ₀ ← Σ(Evaluate(S₀)) ▷ 固定评估器;密封集未动
    2: for t = 0,1,2,… while B_rem > 0 do
    3: a_t ← Route_φ(z_{1:t}, σ_t) ▷ 水平或垂直
    4: if a_t = HORIZONTAL then
    5: 绘制程序 z_{t+1:t+m} ~ π_φ^h 限于 A(z_{1:t}) ▷ 原则 4.4
    6: 编译:绑定适配器,按公式 (22) 确认新鲜度,预留预算
    7: for 程序中的每一步 u do
    8: (S̃, A, E, c) ← U_u(S_t, σ_t, B_{u_t}, π_{u_t}) ▷ 循环内核,公式 (8)
    9: S_{t+1} ← GATE(S_t, S̃);发布 A,E 到血统存储
    10: end for
    11: else
    12: d_t ← π_φ^v(z_{1:t}, σ_t);π_target ← SUBAGENT(π_target, d_t)
    13: 仅当 accept(π', π, d_t) 公式 (27) 成立时安装 π' ▷ 契约
    14: end if
    15: σ_{t+1} ← Σ(Evaluate(S_{t+1})) ▷ 每步后重新编译信号
    16: end for
    17: φ ← M_ψ(φ, H_term) ▷ 元更新,公式 (28)
    18: return 发布的后继 S_T,更新的 {π_i},更新的 φ

    项关闭。 项在停止意图处结束。MetaRSI² Agent-v1 读取整个轨迹,哪些步骤产生了发布的收益、哪些产生了未选候选以及各自消耗多少预算,并修订 RSI² Agent-v1 的路由和预算指令。下一个项从发布的后继和更新的 ϕ 开始。

    贯穿这一切的不变式是没有任何组件评估自己的输出:算子提议,独立评估层评分,受保护发布门发布,而 RSI² Agent-v1 选择运行什么而不评分它,MetaRSI² Agent-v1 修订这些选择如何做出而不做出它们。这种端到端可审计性是下一小节的主题。

    4.7. 框架保护什么

    一个编辑自身改进机制的系统可以膨胀它同时被允许定义的任何指标,因此三种分离保持公式 (5) 有意义。提议与验证分离,候选生成与发布分离:模型诊断和提议,而确定性代码验证、评估并至多提升一个后继,这是唯一被评分的对象(第 4.1、4.2 和 4.6 节)。在两者之上,密封测量位于每一层级每个写表面之外,包括元层:

    5. 实验

    MetaRSI-v1 定义在任意目标系统上并接纳任何闭合循环的信号源,实验在该 generality 中能力目前被最锐利测量的两种状态下实例化:可执行编码和闭式科学推理,分为可执行轨道(容器化测试套件决定正确性)和闭式轨道(精确匹配或数值键决定)。本节首先固定实验设置,包括两条目标线、密封分割协议,以及每个模型驱动角色都由被测模型扮演的闭环配置(第 5.1 节)。然后我们研究自托管开放权重目标 Qwen3.5-35B-A3B,三个算子都在其上作用,并问在等预算下调度组合是否优于最强单一算子和最佳手工固定流水线(第 5.2 节)。然后我们将领先前沿模型仅通过其提供者接口触及,使其经过 Data-RSI 和 Harness-RSI 的脚手架路线,并测量每个通过改进自身获得多少(第 5.3 节)。

    5.1. 实验设置

    目标系统 评估使用两条对应两种部署状态的目标线。第一是自托管开放权重目标 Qwen3.5-35B-A3B,一个总参数 35B、活跃参数 3B 的专家混合模型,通过固定推理栈服务;其权重可写,因此所有三个算子包括 Model-RSI 都作用于它(第 5.2 节和第 5.4 节)。第二是一系列前沿开放和闭式权重系统,仅通过其提供者接口触及,其权重不可写,改进通过 Data-RSI 和 Harness-RSI 路线运行(第 5.3 节)。自托管目标上的运行使用 64K 上下文窗口。每个条件从相同的干净初始系统 S0​ 开始,具有相同基础检查点、种子基因组和空数据状态,并通过相同的脚手架运行时、工具集和评分路径执行。条件之间重置状态,仅在其接收的基因组和哪些算子可写上不同。Model-RSI 实例化表 1 表面的 LoRA 点,从公式 (18) 的配方空间中按附录 B 契约抽取。

    闭环自我演化 每个模型驱动角色都在目标模型本身上实例化:所有三个算子的 Diagnose 和 Propose 阶段、对抗生成的 Operator 和 Anchor、Harness-RSI 诊断角色,以及 RSI² Agent-v1 和 MetaRSI² Agent-v1 策略。没有更强的外部模型提议、合成、评判或调度,训练数据不含外部模型输出;唯一外部信号是决定尝试是否成功的验证器或执行预言机,即环境自己的判断。保持每个提议者和评判者席位都在目标本身上,是使报告收益归因于框架而非更强教师的原因,尽管放大器并非来源,第 6.2 节将讨论;同样的闭环适用于第 5.3 节的每个前沿目标。

    基准 可执行能力在 Terminal-Bench 2.1 [52](89 任务)和 SWE-bench Pro [60](731 任务公开测试分割)上测量,使用固定数据集提交、容器化沙箱和隐藏验证器。所有基准由我们的参考执行脚手架在固定发布版驱动,一个固定实现被基线、每个后继和第 5.3 节每个前沿目标共享;该实现作为独立组件 RSI-Harness 开源(第 6.6 节)。它在可执行基准上以完整智能体配置运行,在闭式基准上以退化、仅提示配置运行,其中内置工具、技能和 MCP 槽被禁用,编辑限于系统提示槽。验证器、沙箱和密封分割固定并位于写表面之外;执行脚手架是 Harness-RSI 编辑的内容。闭式科学和数学推理在 GPQA-D-hard100 和合并 AIME 集上测量,后者包含 2025 和 2026 AIME I 和 AIME II 论文,四份论文 60 题。GPQA-D-hard100 是从 GPQA-Diamond [48] 抽取的 100 个较难项目的固定集,在任何改进运行前选择并冻结一次,并留出 Data-RSI 合成和 Model-RSI 训练;每个项目的官方 GPQA Record ID 在表 11 中列出。两者在固定解码设置下按精确或数值匹配评分 pass@1。污染通过确定性去重和独立模型验证控制。框架与验证器无关,可与任何闭合循环信号源一起运行;实验用这些领域提供的强验证器实例化它。

    预算、基线和指标 所有条件获得相同的模型 token、GPU 小时、墙钟时间、算子调用、候选和验证器查询总数,改进预算 B 和元预算 BM​ 在分开的账本上计量。基线和后继在一个相同的 pass@1 解码设置下评分,超预算响应计为失败而非截断重新评分,每个报告数字是五个独立外层种子的均值。我们比较冻结初始系统(无改进)、每个单一算子以全预算运行、手工固定 D→M→H 调度(人类固定)、可采纳序列上的均匀采样(随机组合),以及无跨项学习的签名条件路由器(静态路由器)。主要指标是公式 (5) 的已部署改进生产力,在发布的后继上报告而非最佳存档候选,并在密封分割上评分一次。每个结果按改进项报告,第 5.4 节的多项运行在每个项重新计量相同预算,因此第 5 项数字是一个预算的第五次应用而非一次应用五个。

    5.2. 主要结果

    表 3 报告发布后继在每个密封分割上的分数。该表支持的不是与冻结系统的比较(每个条件都击败它),而是在等预算下与最佳单一算子和最佳手工固定组合的比较。MetaRSI-v1 在四个基准上都最佳,将平均分比冻结初始系统提高 10.9 分。收益不是由一个算子承载:Data-RSI、Harness-RSI 和 Model-RSI 单独运行时分别将冻结系统提高 2.8、6.6 和 3.9 平均分,Harness-RSI 是最强单一算子,但调度组合在其上再增加 4.3 分。完整系统也击败两个组合基线,手工固定 D→M→H 流水线和静态路由器,两者在 +7.3 持平,领先 3.6 分,尽管三者都在相同证据上组合相同三个算子,仅在谁决定顺序上不同。因此调度组合不是簿记:调度策略本身是承重组件。收益在闭式套件上最大,AIME +13.3 和 GPQA-D-hard100 +12.6,在可执行基准上仍然可观,Terminal-Bench 2.1 +8.3 和 SWE-bench Pro +9.2,其中解决率从 10.3 几乎翻倍到 19.5。每个收益都由目标模型改进自身产生:没有外部模型提议、合成、评判或调度,唯一外部信号是环境自己的验证器。一个 3B 活跃模型完全无教师运行,足以在可执行和闭式领域驱动两位数平均自我改进。

    图 9(a) 绘制每个条件的平均收益。三个单一算子跨度 3.8 分;两个最强组合基线使用所有三个算子,彼此持平在 +7.3,但完整系统高出 3.6 分。因此组合差距不可归因于循环中有更多算子。它可归因于谁决定顺序。

    图 9(b) 按基准分解收益。算子排名跨领域不稳定:Harness-RSI 在闭式套件上领先,而三者在 Terminal-Bench 2.1 和 SWE-bench Pro 上更接近,没有单一算子处处占优。完整系统在每个基准上超过最佳单一算子 2.5 到 5.0 分,确认算子携带互补信号而非冗余。按基准类型平均,MetaRSI-v1 在可执行套件上增加 +8.8,在闭式套件上 +13.0,因此组合效应跨验证格式泛化。

    5.3. 脚手架路线下的前沿模型

    以上所有改进的是权重可由我们写入的模型。脚手架路线声称主要结果无法显示的东西:因为 Harness-RSI 只编辑执行脚手架,循环运行在只能通过接口触及的模型上,这是每个前沿模型的情况。图 10 将当前最强模型放入循环,并测量它们通过循环改进自身获得什么。

    设置与本文其他地方相同的闭环,值得明确其含义。每个前沿模型是自己的提议者、自己的合成者和自己的评判者;MetaRSI-v1 不是从部署模型携带并重新应用,循环中没有其他模型。Model-RSI 按构造不可用,因此可采纳集坍缩为 {D, H},有两个转移 D→H 和 H→D,RSI² Agent-v1 在其中调度。这也是没有训练基础设施的实践者会运行的状况。

    前沿比较在 Terminal-Bench 2.1 上呈现,这是参考执行脚手架在一种实现下为所有六个模型产生隐藏验证运行的可执行基准。AIME 对前沿模型饱和且无余量;SWE-bench Pro 解决率对脚手架高度敏感,因此那里没有干净的跨模型比较;GPQA-D-hard100 在退化仅提示配置下运行,不锻炼智能体路线,对此比较贡献甚微。

    有趣的问题是收益是否经得起目标强度。帮助中型开放权重模型的脚手架编辑可能在修复前沿模型没有的缺陷,在这种情况下这些条会变平,脚手架路线是小模型技术。图 10 在 Terminal-Bench 2.1 参考执行脚手架下回答:所有六个前沿模型都改进自身,收益从 +5.6(GLM-5.2)到 +9.2(Gemini 3.1 Pro),均值 +7.3 分。基线已经很高,GPT-5.6 Sol 83.4 和 Claude Opus 5 84.5,因此收益是针对强脚手架而非弱脚手架测量的。前沿模型上的平均收益 +7.3 与同一基准上 35B 目标的收益 +8.3 相当,这表明脚手架路线不是在修复小模型特有的缺陷:前沿模型也留下材料性收益,自导向循环可在无权重更新、无外部教师的情况下恢复。

    5.4. 改进改进者

    表 3 和图 10 都测量一个项。使元层值得单独预算的是另一个主张:发布的后继是更好的改进者,而不仅是更好的系统。项 1 在 S0​ 上运行一个改进者并发布 S1​。项 2 分叉该发布。一个分支用原始改进者再次改进 S1​;另一个用元层此后重写的改进者在相同预算和相同密封分割下改进同一 S1​,因此分支间唯一区别是哪个改进者运行。

    图 11(c) 给出答案。元更新改进者增加 7.2 平均分,而原始增加 4.9:在一个系统、一个预算下优势 2.3 分。优势随领域允许的收益缩放,Terminal-Bench 2.1 上 +1.6,SWE-bench Pro 上 +1.7,GPQA-D-hard100 上 +2.6,AIME 上 +3.3,四者的排名在两个改进者下相同。元更新改变的是步长大小,而非改进者看向哪里。

    五个连续项扩展这一点。图 11(a) 绘制两个路径的累积收益:元路径达到 +26.2 平均分,而另一路径 +20.7,差距每个项扩大,到项 5 为 +5.5。图 11(b) 将相同运行绘制为每项收益,这是自我改进形状可见之处。两个路径都衰减。无元更新,每项收益从项 2 的 +4.9 降至项 5 的 +0.7;有它,从 +7.2 降至 +1.4,因此元路径在项 5 仍支付另一路径的两倍。项 2 到 5 平均为每项 +3.8 对 +2.5。平台期,即路径停止回报超过一点五的项,无元更新在项 4 到达,有元更新在项 5 到达。

    表 4 报告五个项显示而单项不能显示的内容。复合是头条,其下两个循环质量测量是机制:元路径将 68% 的算子策略编辑带入下一项,而另一路径 38%;其调度器在桌面上留下 8.2% 的可达收益,而另一路径 16.5%。它还保持先前获得的能力,另一路径在项 5 在 GPQA-D-hard100 上回吐 0.2 分,这是公式 (5) 的回归项在记录。合起来读,元更新买到更晚的平台期和更高的天花板。衰减本身是循环在固定基底上抽取所做的,定律 5 是其归属。

    前沿舰队以同样方式复合。图 12 在图 10 的六个模型上再运行 {D, H} 循环两个项,每个模型一个改进者,每个席位仍在模型本身上。所有六个持续增益:均值项 1 +7.3、项 2 +2.8、项 3 +1.2,累积 +11.3,舰队均值从 80.0 升至 91.3,前四名最终在 93.6 到 94.7 之间相差 1.1 分以内。决定速率的是余量而非模型强度:两个最低基线 Gemini 3.1 Pro 66.3 和 GLM-5.2 78.4,在项 2 保持项 1 收益的 43% 和 63%,而它们之上的四个保持 26% 到 39%,两个量在 Spearman ρ = -0.84 处一起排名。因此脚手架路线也从前沿模型复合,速率由脚手架还有多少值得编辑决定。

    6. 讨论

    第 1 节论证自我改进应作用的对象是将算力转化为已部署模型的人类劳动,而当前系统自动化其中最低廉的切片。本节回到该主张并问框架实际买到什么:首先对一个部署(第 6.1 节),然后对三个算子形成的闭环反馈回路和通过它的两条路线(第 6.3 节),然后跨科学领域(第 6.4 节),最后在循环停止是数字的并开始触及仪器的边界(第 6.5 节)。

    6.1. 组合买到什么

    当改进被表达为类型化算子的调度组合而非围绕一个可编辑表面的循环时,三件事改变,每件对应第 1 节识别的三个机制之一。对抗误归因 单表面算子的诊断受其写访问约束;在循环内核下它受证据约束,因为公式 (10) 的失败签名在任何算子看到它之前已接地,且其词汇被所有三者读取。因此缺失程序习惯路由到脚手架,缺失知识路由到数据和权重,在共享对象上没有算子能为自己利益重写它。公式 (11) 的学习签名在数据侧锐化这一点:只有轨迹从未展示的能力才证明花费外部监督合理。对抗不可组合性 第 1 节工程师的答案(添加规则、收集纠正行为、内化它、删除规则)是图 8 的路径 H→D→M→H,每个箭头是类型化适配器。框架添加的是该路径可被言说:调度器可提议它,类型检查可接受它,其最后一步可重放和回退,如果删除被证明损失准确率。对抗最廉价制度中的测量 框架要求某种保真度的验证器,加上第 4.7 节的三种分离,这些是让循环在验证器弱时被信任的原因:它们防止循环改进自己的成功定义。因此有部分验证器的领域是同一问题的更难实例而非不同问题,Data-RSI 提供此类领域额外需要的东西,即外部监督实际需要何处的有界陈述(第 6.4 节)。

    6.2. 放大器不是来源

    三个算子的组合有固定上界。Data-RSI 使模型轨迹中潜在的能力显式化;Model-RSI 将该能力固定在参数中;Harness-RSI 使其在推理时无需训练即可用。每个都重新分配模型已持有的能力。为模型从未展示的能力合成的记录由同一缺乏它的模型编写(第 4.2.1 节),因此循环不能引导它不包含的知识。仅由这些算子组成的系统是闭环放大器,其天花板是已存在之物的最佳排列。

    每个真实增益都需要源自循环外部的信息。框架通过学习信号接纳此类信息,学习信号由其循环中的位置定义且对其来源不施加限制(第 3 节)。验证器的裁决、检索的文档、策展语料库、仪器读数,以及委托的专家笔记,以同等条件进入。人类监督占据相同地位:据说自我改进所取代的劳动,在此核算中是一种信息源,主要区别在其成本。

    Data-RSI 治理该成本的支出。其学习签名定位模型持有能力与轨迹从未展示能力之间的边界,将该边界转化为对循环无法生成的特定信息的有界请求。外部监督分配给真实缺陷,该分配的量作为测量量报告。具有此类摄入的放大器有开放边界:它纳入它不包含的东西,并说明它必须添加多少。

    6.3. 通过循环的两条路线

    框架在成为一组路线之前是一个循环,而循环是使其复合的原因。Data-RSI 读取已部署系统能力的编译测量:它持有、误用或缺乏的能力。Harness-RSI 和 Model-RSI 消费该测量并改变系统。改变后的系统然后重新进入 Data-RSI:图 8 的 H→D 边在新脚手架下重新评分信号,M→D 边在新权重下重新探测边界,因此下一次测量取自一个已移动的系统。循环的每一轮缩放下一轮能发现并压出的能力,这是框架改进机制而非模型的意义。Data-RSI 作为测量工具的角色在此重要,因为它是循环的再入点,而作用于它所读内容的算子是移动系统的东西。

    在该循环内,测量可以两种结构不同的方式消费,部署者能采取哪一种,与其说由哪种更强决定,不如说由他们被允许触碰什么决定。它可以蒸馏进执行脚手架,或物化进训练数据并内化进权重。这是两条平行路线,本小节余下部分依次讨论每条,然后回到它们的组合添加什么。

    6.3.1. 脚手架路线

    脚手架路线是循环 D↔H,且从不写 θ。这使其成为通过 API 触及的闭式权重模型的唯一可用路线,即当今大多数部署的情况,并且即使对开放权重,当单个训练轮次会消耗改进预算时也更经济。

    其改进单位使其独特。公式 (15) 的基因组小、声明式且可检查,因此专门化于一个狭窄任务族的配置可以以可忽略成本被 diff、审查、版本化、回滚和交给他人。检查点是大而不透明的工件,其来源难以审计,其许可通常限制再分发;基因组是可发布、批评和公开改进的短结构化文档,这是将 RSI-Harness 作为独立组件发布的原因(第 6.6 节)。表 5 列出路线成本;唯一有结构后果的成本是仅存在于脚手架中的能力在脚手架未加载时丢失,这是第三方集成咬合之处。

    6.3.2. 模型路线

    模型路线是路径 D→M,它做相反的事:内化能力在推理时免费,在任何特定脚手架之外持续,并与模型的其他能力组合而非在提示中并列。当领域将大规模长期服务时,这是经济学随使用改善的路线。

    其三个成本塑造了框架设计。训练轮次相对于产生其数据的循环较慢,这是 RSI² Agent-v1 在昂贵算子待定时交错廉价算子而非阻塞它的原因。收益难以归因于特定编辑,这是每个候选都从同一固定基础在累积数据集上训练的原因。且每次更新有风险已拥有的能力,这是累积数据集预留已掌握能力比例、回归在公式 (5) 中是一等惩罚而非事后报告诊断的原因。

    6.3.3. 组合路线

    路线互补;无一支配另一。表 5 陈述每条路线是正确工具的条件,框架的要点是当两者都可用时,部署者不应一次且提前选择。

    生产性交互是 M→H 边。内化后,携带现已内化行为的脚手架条目是冗余的,冗余调和提议在重放下删除它们。

    6.4. 跨领域的循环

    构建框架而非更好编码智能体的原因是框架的单位是流水线阶段,而非任务。希望闭合改进循环的领域不需要复现我们的系统;它需要提供框架视为输入的三个东西。

    一个任务族:其实例可被执行和观察:不必完美评分,只需可观察。一个任何现有保真度的验证器:编译、模拟、数值收敛、协议执行、报告结果复现,或在最弱情况下由留出评估器应用的评分。一个种子脚手架:五槽基因组的初始分配,可以接近空。

    其他一切(公式 (11) 的学习签名、失败签名词汇表、可采纳性规则、两个调度轴、受保护分离)是领域无关的,因为它们都不检查任务内容。这是框架泛化主张的实践内容:在某个新地方实例化它是提供三个输入而非设计新改进循环的问题。

    6.4.1. 变化的是验证器

    第 2.3 节的分析精确说明验证器质量变化意味着什么,值得将其列为阶梯而非二元。表 6 列出我们能识别的级别、每级允许什么,以及在操作重要的列中,在该级 Data-RSI 的用途。在第 1-2 级,完整框架不变适用,领域受模型已有能力限制而非循环能否闭合限制,这正是图 5 中未开发区域的情况。在第 4-5 级,框架最有价值的输出不再是合成数据而是它报告的边界,因为那将无界专家监督请求转化为有界请求:只有轨迹从未展示的残余需要人类、仪器或外部语料库,该残余的大小是测量而非假设的。一个每月能负担五十次实验的实验室,远比一个提议五千次的系统更关心哪五十次。

    表 6:验证器阶梯。 每个级别的机制相同;级别决定哪些算子值得调度,以及 Data-RSI 的边界陈述用于什么。在顶级,Data-RSI 主要指导合成;在底层,其更有价值的输出是关于人类或语料库监督实际需要何处的有界陈述。

    级别验证器示例领域Data-RSI 的用途
    1 可执行测试、精确匹配 软件、终端、闭式科学 将合成导向诊断
    2 数值收敛、模拟 流体与结构设计、电路 同上,以模拟器成本
    3 报告结果复现 ML 复现、计算生物学 分离方法缺口与数据缺口
    4 带仪器的协议执行 湿实验室化学、材料合成 决定运行哪些实验
    5 专家评分,无真实标准 法律、政策、历史编纂 限定专家时间请求

    两条路线合起来归还任一单独会花费的上下文预算:脚手架便宜且立即买到行为,权重吸收它,脚手架归还空间。从这个方向看,同一条边防止脚手架无界增长:内化条目被修剪,因此脚手架路线不会成为单向棘轮。这是组合算子与并排运行它们不同的具体意义:只有组合循环归还内化花费的上下文预算。

    6.4. 跨领域的循环

    构建框架而非更好编码智能体的原因是框架的单位是流水线阶段,而非任务。希望闭合改进循环的领域不需要复现我们的系统;它需要提供框架视为输入的三个东西。

    一个任务族:其实例可被执行和观察:不必完美评分,只需可观察。一个任何现有保真度的验证器:编译、模拟、数值收敛、协议执行、报告结果复现,或在最弱情况下由留出评估器应用的评分。一个种子脚手架:五槽基因组的初始分配,可以接近空。

    其他一切(公式 (11) 的学习签名、失败签名词汇表、可采纳性规则、两个调度轴、受保护分离)是领域无关的,因为它们都不检查任务内容。这是框架泛化主张的实践内容:在某个新地方实例化它是提供三个输入而非设计新改进循环的问题。

    6.4.1. 变化的是验证器

    第 2.3 节的分析精确说明验证器质量变化意味着什么,值得将其列为阶梯而非二元。表 6 列出我们能识别的级别、每级允许什么,以及在操作重要的列中,在该级 Data-RSI 的用途。

    在第 1-2 级,完整框架不变适用,领域受模型已有能力限制而非循环能否闭合限制,这正是图 5 中未开发区域的情况。在第 4-5 级,框架最有价值的输出不再是合成数据而是它报告的边界,因为那将无界专家监督请求转化为有界请求:只有轨迹从未展示的残余需要人类、仪器或外部语料库,该残余的大小是测量而非假设的。一个每月能负担五十次实验的实验室,远比一个提议五千次的系统更关心哪五十次。

    6.4.2. 分解科学生产线

    单位是流水线阶段的主张有具体解读。一个科学或工程计划本身就是一条生产线,其阶段是可以插入一阶算子而无需重新设计上下游任何东西的地方。在材料计划中,这些阶段是候选生成、性质预测、合成路线规划、表征和解释;在计算生物学计划中,是假设构建、测定设计、流水线构建、统计分析和写作;在硬件计划中,是规格、架构探索、实现、验证和物理收敛。这些阶段中的每一个都具有循环内核期望的形状:它消费类型化输入,可被执行和观察,其失败有可识别的终止原因,并产生下一阶段消费的工件。

    随之而来的是,领域不必一次闭合其整个循环。在单个阶段实例化框架产生一阶循环(一个算子、一个验证器、一个诊断工件),这已经有用,并产生第二个阶段以后与其调度所需的确切类型化工件。组合机制是将一组阶段局部循环转化为流水线级循环的东西,而可采纳性条件保持该组合合法:一个阶段不能消费前一阶段已改变的系统的描述。

    6.4.3. 为什么这复合

    算法 1 的一个项产生一个发布的后继和少量类型化工件,工件是累积部分。学习签名报告以领域无关格式陈述一类模型能力结束之处;基因组是使一个狭窄任务族工作的短声明式对象;经验证记录携带其来自的失败签名。三者都是类型化并携带血统,因此在一个领域闭合的循环留下相邻领域循环可读的材料:相同失败词汇、相同工件模式,有时相同脚手架条目。

    第二种效应在单个循环内而非跨循环复合,这是框架自身对为什么任何这一切加速的回答:循环的每个成本都是针对循环自身改进的状态支付的。一旦邻近子领域的学习签名报告存在,探测能力更便宜,因为探测集可被播种而非构建。写一次的适配器被之后调度该边的每个项复用。已持有领域程序习惯的脚手架使下一轮以更有信息的方式失败,剩余失败是先前被掩盖的。因此循环时间不是领域的常数,而是框架也在优化的量,这正是垂直轴和元层的用途,也是为什么随着框架成熟,值得报告的是达到阈值的成本而非仅最终状态准确率。

    许多此类循环在许多学科间交换工件是否聚合成类似广泛专家级能力的东西,是一个开放经验问题。本报告确立的是这种聚合将运行的机制,可由我们已构建的部件构建。

    宏观主张,精确陈述。 对于情境可枚举的设置,我们主张四件事,向开放世界的扩展留给第 6.5 节的投影:构建模型的劳动可分解为三个算子,其组合可分析;所得循环可在弱验证器下被信任,因为定义成功的东西在每一写表面之外;在新流水线阶段实例化循环花费三个声明输入而非新设计;它留下的工件是类型化、可审计且可被下一个循环复用的。如果这四点成立,图 5 中能力已存在且尚无循环闭合的区域是可处理的工作而非研究前沿。

    6.5. 朝向触及物理世界的循环

    本报告中每个循环都在计算机内闭合:轨迹是进程,验证器是测试套件或评分器,被拒绝的候选花费 token。图 5 中标准差距最大的领域(材料合成、湿实验室协议执行、机器人操作)不是这样:其验证器是仪器,轨迹消耗物理资源,坏动作可能不可恢复。以下陈述框架哪些部分延续、哪些断裂,以及需要添加什么。

    延续 学习信号、预算账本和受保护分离不关心验证器是测试运行器还是光谱仪,账本只是为仪器小时、消耗品和样品库存增加行。一个机制获得力量而非仅仅保持。Data-RSI 的边界陈述成为实验分配器:实验室的约束瓶颈是仪器时间,Data-RSI 无法为其合成的残余是关于哪些问题实际需要仪器的测量、有界陈述。

    失败模式 两个,都是结构性的。可逆性:框架依赖候选生成便宜且丢弃自由,而物理动作没有沙箱,因此消耗样品或损坏机械手不能回滚。原则 4.4 的可采纳性条件只问算子输入是否新鲜,因此物理框架需要第二个前提问动作是否可恢复,以及将不可恢复步骤视为承诺而非候选的调度器。循环延迟:经济学假设廉价算子比昂贵算子便宜几个数量级,当昂贵算子需要数天并消耗材料时,比率扩大到 RSI² Agent-v1 的工作从排序变为决定是否行动。

    所需添加 随之三项添加。分级保真度:模拟、然后台架代理、然后仪器,每级算子集相同,级间提升像现在候选提升一样门控,这使不可逆级别最后到达,并让廉价级别在任何材料消耗前缩小残余。不可逆性感知动作空间:算子不仅声明它写什么,还声明写是否可撤销,Validate 拒绝缺乏显式授权的不可恢复提议。人类授权作为受保护表面:一个人签署不可逆行动的点位于每一层级每个写表面之外,与密封评估器相同原因。

    更深问题:环境,而非行动者 公式 (11) 的每个维度都预设一个适定任务:每个将失败归因于行动者相对于已知环境的能力,这是第 5 节每个基准的设置。开放物理设置承认没有这种归因的失败,其中行动者能力无过错,因为情境本身位于签名编译所针对的环境模型之外。这迫使的区别是写表面代数内部的。环境模型可复现的失败保持为三个现有算子的候选;不能复现的失败需要一个第四算子,其写表面是该模型 [61]。该表面是第 4.1 节未固定的验证器,以其最难形式相遇,该算子的产品是修订动力学和固定它们的回归测试。行动者缺陷与环境模型缺陷之间的界线因此从可采纳性中自然得出,而无需新机制。重写环境模型会使针对旧模型编译的每个诊断工件失效,因此该算子在原则 4.4 下是能力改变的并强制下游重新探测。报告量随之改变:不是冻结任务集上的准确率,而是未建模情境被转化为经验证、可复用情境的速率。

    第一个物理循环在哪里闭合 前提是仪器上的可编程表面,现在独立于本工作构建。智能体到仪器协议通过共同传感和致动接口暴露实验室设备:签名卡声明仪器能力及其物理限制,绑定是发现优先的,结果携带单位和校准,不可逆操作在密码绑定操作员确认后门控 [62]。因此异构舰队呈现单一类型化动作表面,最后一条是前段的受保护人类授权,独立到达。部署已展示物理形式的定律 3 基底迁移:一个操作 X 射线纳米探针和材料机器人的智能体将其在线工作出的内容巩固为可复用例程,仪器然后在人类安全确认下自行运行,仪器自己的读数作为验证器 [63]。我们的框架预测成熟顺序。由定律 1,循环存在于验证廉价处;在表 6 阶梯上,自动化实验室占据第 3 至 4 级,其中可编程仪器既是致动器又是验证器,分级保真度将不可逆步骤放在最后。第 5 级的开放世界具身,缺乏闭合验证器,成熟较晚,因此第一个物理后继出现在自动化实验室而非无约束环境。

    6.6. 可复用工件

    公式 (15) 的基因组独立于框架其余部分而有用,我们将其作为独立组件开源。RSI-Harness 是脚手架算子的运行时和基因组格式,打包供直接使用,其中任务特定配置是检测到相应任务族时加载的存储基因组。该组件随我们自己的运行产生的基因组一起发布,因此用户从针对固定评估器选择而非手工编写的配置开始,并保留算子的类型化补丁格式,因此用户自己的改进循环可在自己的任务上运行。因为基因组小、声明式且可隔离评估,配置可以以模型检查点无法做到的方式共享;RSI-Harness 接受贡献的基因组,因此其社区构建狭窄、经过良好测试的脚手架的公共库而非单一通用脚手架。该库也是第 6.4 节跨领域主张的最廉价可用测试:如果为无关任务族贡献的基因组最终共享脚手架条目,共享基底是真实的;如果它们不共享任何东西,则不是。

    6.7. 递归自我改进的五条定律

    第 2.1 节的每个范式在留下系统之前留下了一条定律:规模留下算力-数据-参数权衡作为可预测关系而非一组检查点 [7],是关系而非任何在其下训练的模型告诉领域下一步构建什么。自我改进还没有这样的关系。我们陈述五条,以后续结果可反驳的形式 [64],每条是一个主张、一个机制,以及会反驳它的观察。

    偏相关匹配图 5(c):级别在控制能力后保持效应,而能力在控制级别后不显著。自我改进能进入的领域是能被检查的领域;能力只决定进入是否值得。这些数字背后的普查在 2026 年 8 月翻倍以上,至 55 个循环,关系保持:55 个中 53 个在第 1 至 3 级闭合,从未有循环的八个领域仍然没有。机制:循环建在闭合廉价处,闭合在验证免费处廉价。推论:要拓宽自我改进,构建验证器。反驳条件:控制 R 后 N 仍跟踪 cap。

    定律 2 自我知识会过期,因此重新描述是速率限制。 算子读取系统的描述,从不读取系统。改变系统行为的任何步骤使之前编译的每个描述失效。因此自我改进架构的约束成本是重新描述系统,而非改变它。原则 4.4 是本定律的局部形式:在 {D, H, M} 上它允许六个有序对中的五个,并命名哪些。机制:关于已不存在状态的证据不支持关于取代它的状态的任何推断。推论:更大的算子字母表不需要新代数,只需同一条件再次;写验证器的算子一次性使整个历史失效。反驳条件:循环在其自身能力改变步骤之前编译的描述上持续获得收益。

    定律 3 胜任力无基底,其成本不是。 脚手架上和权重中的相同行为是两个成本函数下的一个胜任力。一个在每次推理重新支付,另一个支付一次。因此胜任力属于系统而非基底,成熟循环将大部分努力花在将胜任力移到廉价处。机制:只有具有两个可写基底的循环才能退役另一个已吸收的东西。单基底循环单调累积成本并因成本而非能力停止。推论:基底多元性是必要而非便利的。唯一归还预算的操作是单表面系统无法表达的。反驳条件:单基底循环改进而每推理成本不增长。

    定律 4 信任由不能写什么来衡量。 从循环内部,更好的能力和更好的成功定义给出相同数字。这比古德哈特更强:分歧不仅难以检测,从内部不可观察。任何数量的内部验证都找不到它,补救不能是统计的。如果 Q∗、其任务集、发布规则和账本位于每一层级每个写表面之外,报告的收益是能力。只要其中任何一个可写,同一数字就是定义。机制:被允许移动目标的优化器会移动它,这是最便宜的行动 [42]。推论:改进工作信号,绝不改进锚点。锚点是许可主张的东西。反驳条件:可写锚点产生经得起不可写锚点的收益。

    定律 5 没有循环创造能力;每个收益都是导入的。 循环重新分配并内化系统已能展示的胜任力。公式 (11) 划出它与轨迹从未展示之间的线。第一侧的监督买不到系统自身输出不会提供的东西。第二侧根本无法合成,因为写记录的模型就是缺乏知识的模型。因此自我改进结果有两个数字而非一个:它放大了什么,它导入了什么。机制:从未展示能力的记录与正确记录在模式上无法区分,因此像其他一切一样训练。推论:导入是可测量的,且随验证器变贵而更有价值,从第 1 级指导合成到第 4 级分配仪器时间。反驳条件:边界之外的合成可测量地有帮助。

    合起来读,五条划分任何自我改进循环必须回答的内容:循环能在哪里存在由验证设定(定律 1);它转多快由重新描述不断变化的系统的成本设定(定律 2);收益成本由哪个基底持有胜任力设定(定律 3);数字是否有意义由什么保持不可写设定(定律 4);必须从外部购买什么由可测量的边界设定(定律 5)。没有定律命名模型、基准或参数数量;它们治理循环而非系统,它们是第 6.8 节在循环而非模型中陈述其立场的基础。

    6.8. 立场:进步的单位是循环,而非模型

    本小节以此类论证通常的方式 [61, 65, 66] 论证一个立场:关于努力应去向何处的命题,由本报告的测量支持并超越它们。

    命题。 对于下一阶段进步,约束瓶颈不是模型多有能力,而是存在多少循环以及它们能在哪里闭合。按此读法,进步的单位是循环而非模型,富有成效的问题不是“这个模型能好多少”,而是“在一个从未闭合过循环的地方,能以多低成本闭合一个新循环”。

    本报告中的两个测量指向同一方向。按闭合它们的东西而非学科计数,超过三分之二的被调查自我改进系统针对闭式、机器可检查目标验证,因此领域的集中是负担能力而非兴趣。且在二十二个领域上,决定一个领域是否获得循环的是它能否被检查而非模型是否擅长它,定律 1 识别的持续损失集中在五个已经有能力且没有机器可检查目标的领域。该区域是存在但未被收获的能力。

    如果命题成立,一些途径远比其他的更可能回报,说出哪些比不偏不倚更有用。可能: 在单个流水线阶段实例化一阶循环,因为一个算子、一个任何保真度的验证器和一个种子脚手架已产生有用东西,并发出邻近阶段以后可据以调度的类型化工件;在权重不可触及处使用脚手架路线,这是大多数部署;将诊断边界用作分配装置而非数据生成器,一旦验证器花费仪器时间而非毫秒,这就是它的用途。不太可能: 为真正缺失的能力合成训练数据,原因见第 4.2.1 节:写记录的模型按构造就是缺乏知识的模型;通过扩展固定验证器闭合新循环,因为固定验证器是固定天花板,策略将恰好在它的盲点累积;将未建模情境视为能力缺口,这混淆了缺失情境与缺失技能。

    三个发现会反驳它。 控制验证器级别后循环数跟踪能力会使持续损失成为我们放置的产物。诊断工件和基因组在实践中未能播种下一个循环会使单位终究是任务,框架是组织良好的流水线。孤立改进的算子组合不比这里组合得更好会使代数成为簿记。表 3 的组合基线是关于第三点的最小实验;第二点是我们下一步要运行的研究。

    命题覆盖情境可提前枚举的设置,这是此处评估的每个设置;其向开放世界的扩展,其中情境空间本身是操作数,是第 6.5 节和第 4.1 节的投影。结束主张关于机制:尝试所需的每个机器部件都可由已构建的部件构建。

    7. 结论

    本报告旨在将递归自我改进从一个可编辑表面移到将算力转化为已部署模型的生产线。领域的集中是格式而非学科的界限:我们调查的系统超过三分之二针对机器可检查目标闭合循环,这认证的是基准绑定能力而非学科中的通用能力。

    针对这一点,我们提出 MetaRSI-v1,其中改进是在一个统一执行范式下类型化算子的调度组合。每个算子实例化一个循环内核,一个由编译学习信号闭合、被切割一次为模型提议的可变更弧和确定性代码裁决的受保护弧的循环。在已部署系统的数据、脚手架和模型上实例化,它产生 Data-RSI,放大已有能力并标记其边界,使外部监督只花在边界之外;Harness-RSI,在不触碰模型的情况下编辑五槽脚手架;Model-RSI,将重复上下文成本转化为一次性训练成本。一个工件词汇表让单一新鲜度条件允许六个有序转移中的五个,其中一条是内化许可删除其所包含的脚手架规则的边。在算子之上,一个 RSI² Agent-v1 在每一步选择扩展序列和重写算子提议策略之间,元层在一个项完成后修订该调度器。在固定预算、密封测量和无外部教师下,MetaRSI-v1 将发布的后继比最强固定流水线提高 3.6 分。

    我们最想留下的不是系统而是第 6.7 节的五个关系:自我改进的可达前沿是验证前沿而非能力前沿;系统对自身的描述在系统变化时过期,因此重新描述是速率限制;胜任力跨基底不变而其成本不变,使改进既是获取也是迁移;信任有度量而非程度,度量是系统不能写的东西;没有循环创造能力,因此每个真实添加都是导入的。每条都陈述得以后续结果可反驳,合起来它们将进步的单位读作循环而非模型:约束下一阶段的是在一个从未有过循环的地方能以多低成本闭合一个循环。脚手架运行时和基因组格式作为开源包 RSI-Harness 发布,连同我们运行产生的基因组,以播种任务特定脚手架的社区库。

    赞(0)
    未经允许不得转载:171主机测评 » MetaRSI: A Meta-Recursive Self-Improving System for Recursive Self-Improving Systems Themselves
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址