论文: InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing (arXiv:2508.14033) 代码: https://github.com/MeiGen-AI/InfiniteTalk 团队: 美团 MeGen-AI / 中科院自动化所 / 中山大学 / 港科大 许可证: Apache 2.0
一、项目介绍
1.1 这是什么?
InfiniteTalk 是一个音频驱动的说话视频生成模型,给定一张参考图像(或一段参考视频)和一条音频轨道,它能合成出无限时长的人物说话视频——不仅嘴唇动作与音频同步,头部运动、面部表情、身体姿态都会随语音自然变化。
与传统的视频配音(Video Dubbing)技术只编辑嘴部区域不同,InfiniteTalk 提出了稀疏帧视频配音(Sparse-Frame Video Dubbing) 的全新范式:
| 编辑区域 |






