
文章核心总结与创新点
主要内容
本文针对大型语言模型(LLMs)推理时存在的长时序列计算效率问题,提出了一种名为Hogwild! Inference的并行推理方案。该方案让多个LLM实例(worker)并行运行,通过共享的键值缓存(KV cache)实现实时同步,无需预定义协作框架,而是让模型自主制定协作策略(如任务拆分、结果验证、动态调整方案等)。文章通过在数学推理(GSM8k、LIMO、AIME’25)、编程(LiveCodeBench)、奥林匹克竞赛题(OlympiadBench)等多个基准测试中验证,证明该方案在不额外微调模型的情况下,能显著提升推理速度和准确率,且支持不同规模、不同类型的LLM模型。



