Documentation
README
InfiniteTalk - 音频驱动视频生成
任务目标
- 本 Skill 用于:将音频(语音)转换为同步的说话人视频,支持从单张图片或现有视频生成音频驱动的说话视频
- 能力包含:
- Image-to-Video:从单张图片生成音频驱动的说话视频
- Video-to-Video:对现有视频进行音频驱动的重配音
- 多维度同步:唇形、头部运动、身体姿态、面部表情与音频精准对齐
- 无限时长:支持无限制时长的视频生成
- 低显存适配:支持量化、模型卸载等显存优化方案
- 触发条件:当需要生成音频驱动的数字人视频、视频配音、虚拟主播内容时使用
前置准备
- 模型下载:在使用本 Skill 前,必须先下载所需的模型权重文件,具体步骤见 references/model_download.md
- 硬件要求:
- GPU:推荐使用 16GB+ 显存的 GPU(可使用量化方案适配低显存设备)
- 内存:建议 32GB+ 系统内存
- 磁盘空间:至少 50GB 可用空间(模型权重约 30GB)
- 环境配置:详细依赖安装见 references/environment_setup.md
操作步骤
模式一:Image-to-Video(图片生成视频)
- 准备输入
- 确保有一张清晰的人脸图片作为输入
- 准备音频文件(支持 mp3、wav 等格式)
- 可选:使用 TTS 功能从文本生成音频
This is the opening of the README. Read the full README on GitHub.