欢迎光临
我们一直在努力

字节:揭示LLM代理技能静默过时难题

在这里插入图片描述

📖标题:Repo2Skill-Evo: Repository Skills Go Stale in Silence
🌐来源:arXiv, 2608.21964v1

🛎️文章简介
🔸研究问题:随着软件仓库版本迭代,外部化的代理技能(Skills)是否会因缺乏显式信号而静默过时,且当前最先进的LLM代理能否可靠地维护这些技能以保持其有效性?
🔸主要贡献:论文提出了Repo2Skill-Evo基准,量化了技能维护的难度,揭示了即使是最先进的代理也无法可靠地解决技能静默过时问题,并指出了定位与编辑选择两大瓶颈。

📝重点思路
🔸定义静默过时现象:将仓库特定程序知识外部化为技能后,当仓库发布新版本时,旧技能虽仍可加载但内容已失效,且无明确错误信号,导致代理被误导。
🔸构建Repo2Skill-Evo基准:涵盖57个真实仓库和105个版本过渡。首先通过Repo2Skill流程从V1版本蒸馏出可追溯的固定技能集;然后结合官方V1到V2的补丁,要求代理更新技能,即删除过时内容并保留有效指导。
🔸设计严格评估指标:采用基于补丁的移除度量标准,平衡过时内容的召回率与过度编辑的精确率。同时引入NL Judge对最终技能集的API正确性、文件一致性等五个维度进行综合评分。
🔸诊断失败原因:通过分析执行轨迹,将维护失败归因于两个互补瓶颈:一是受影响技能文件的定位覆盖不全,导致遗漏过时内容;二是编辑选择不完美,要么编辑不足,要么范围过宽导致精度下降。

🔎分析总结
🔸技能具有显著实用价值:实验显示,在基线效用较低的仓库中,使用技能带来的性能提升最大,且相比直接访问源码,技能能以更低成本提供相当的知识支持,证明了维护技能的必要性。
🔸现有代理维护能力不足:在105个过渡任务中,所有评估的过渡均使部分V1技能失效。六个前沿代理的平均宏F1分数仅在29.9%至69.7%之间,表明即使是顶级模型也无法可靠地维护技能。
🔸存在召回与精度的权衡困境:不同模型表现出不同的错误模式。例如GPT-5.4召回率高但精度低,倾向于过度编辑;而其他一些模型精度高但召回率低,倾向于遗漏修改。多次运行结果显示性能不稳定。
🔸定位是关键但非唯一瓶颈:Oracle实验表明,若直接提供受影响的文件路径,性能虽有提升但仍存在大量残余错误,说明仅解决文件级定位不够,代理仍难以在文件内准确追踪证据并选择恰当编辑。

💡个人观点
论文将LLM代理技能视为“版本化知识资产”,并指出了其生命周期中容易被忽视的“静默过时”风险。

在这里插入图片描述

赞(0)
未经允许不得转载:171主机测评 » 字节:揭示LLM代理技能静默过时难题
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址