欢迎光临
我们一直在努力

2025_NIPS_Generalized Linear Mode Connectivity for Transformers

论文核心总结与翻译

一、主要内容总结

该论文围绕神经网络损失景观的几何结构展开研究,聚焦Transformer架构的线性模式连接性(LMC)问题。核心内容包括:

  • 研究背景:线性模式连接性指独立训练的模型可通过低损失或零损失线性路径连接,但Transformer等现代架构的复杂对称性(远超传统神经元排列)导致现有方法难以捕捉这种连接性。
  • 核心框架:提出统一的对称性框架,涵盖四类变换(排列、半排列、正交变换、一般可逆映射),将现有多数对齐方法纳入其中,同时支持同构和异构(不同宽度)架构的对齐。
  • 关键方法:设计三种模型对齐策略——权重匹配(数据无关,直接优化参数相似度)、激活匹配(通过中间激活对齐)、学习匹配(端到端优化对称变换参数),并扩展至多模型融合场景。
  • 实验结果:首次在Vision Transformer和GPT-2模型上验证了低/零损失线性连接,在CIFAR-10/100、Tiny ImageNet等视觉数据集和Tiny Shakespeare、BookCorpus语言数据集上取得显著效果,且支持不同宽度模型的跨尺度对齐。
  • 应用价值:为模型集成、联邦学习、持续学习、对抗鲁棒性优化等领域提供理论支撑,揭示了Transformer损失景观比以往认为的更具连通性。
  • 二、创新点

  • 对称性框架
  • 赞(0)
    未经允许不得转载:171主机测评 » 2025_NIPS_Generalized Linear Mode Connectivity for Transformers
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址