欢迎光临
我们一直在努力

InfiniteTalk 深度解析:音频驱动的无限时长说话视频生成

论文: InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing (arXiv:2508.14033) 代码: https://github.com/MeiGen-AI/InfiniteTalk 团队: 美团 MeGen-AI / 中科院自动化所 / 中山大学 / 港科大 许可证: Apache 2.0


一、项目介绍

1.1 这是什么?

InfiniteTalk 是一个音频驱动的说话视频生成模型,给定一张参考图像(或一段参考视频)和一条音频轨道,它能合成出无限时长的人物说话视频——不仅嘴唇动作与音频同步,头部运动、面部表情、身体姿态都会随语音自然变化。

与传统的视频配音(Video Dubbing)技术只编辑嘴部区域不同,InfiniteTalk 提出了稀疏帧视频配音(Sparse-Frame Video Dubbing) 的全新范式:

维度
传统配音
InfiniteTalk
编辑区域
赞(0)
未经允许不得转载:171主机测评 » InfiniteTalk 深度解析:音频驱动的无限时长说话视频生成
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址