欢迎光临
我们一直在努力

2025_NIPS_Hogwild! Inference: Parallel LLM Generation via Concurrent Attention

在这里插入图片描述

文章核心总结与创新点

主要内容

本文针对大型语言模型(LLMs)推理时存在的长时序列计算效率问题,提出了一种名为Hogwild! Inference的并行推理方案。该方案让多个LLM实例(worker)并行运行,通过共享的键值缓存(KV cache)实现实时同步,无需预定义协作框架,而是让模型自主制定协作策略(如任务拆分、结果验证、动态调整方案等)。文章通过在数学推理(GSM8k、LIMO、AIME’25)、编程(LiveCodeBench)、奥林匹克竞赛题(OlympiadBench)等多个基准测试中验证,证明该方案在不额外微调模型的情况下,能显著提升推理速度和准确率,且支持不同规模、不同类型的LLM模型。

创新点

  • 动态自主协作机制:摒弃固定协作框架(如投票、预定义子任务拆分),让LLM通过共享缓存实时感知彼此进度,自主制定、调整协作策略,适配复杂多变的任务场景。
  • 共享KV缓存与位置编码优化:基于旋转位置编码(RoPE),通过调整查询向量旋转角度而非重编码缓存,实现多worker间的并发注意力计算,降低计算开销并保证实时同步。
  • 灵活缓存结构设计:采用类群聊的缓存布局,将推理步骤划分为段落级单元,确保worker始终能关注彼此最新进度,提升协作
  • 赞(0)
    未经允许不得转载:171主机测评 » 2025_NIPS_Hogwild! Inference: Parallel LLM Generation via Concurrent Attention
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址