数智技能研修平台
AI 前沿发现
魔搭 ModelScope
LongCat-Video-Avatar-1.5:音频驱动数字人视频生成,口型精准长时稳定
LongCat-Video-Avatar-1.5是音频驱动数字人视频生成框架升级版,基于Whisper-Large实现精准唇形同步,长视频稳定自然,支持真人、动漫多风格,推理仅需8步,适用于虚拟主播、在线教育、短视频创作等场景。
查看原文 →内容为平台聚合整理,原文与最新动态以来源页面为准。
加老师微信 · 进学习群
报名咨询、课程答疑由老师 1 对 1 服务
扫码进学习交流群
加专属老师微信图文介绍
LongCat-Video-Avatar-1.5 是一个开源的音频驱动人物视频生成框架的升级版本。它基于深度学习,能够根据单声道或多声道音频输入,生成逼真的说话人视频,适用于数字人、虚拟主播、远程教学等场景。v1.5 在唇形同步、长视频稳定性、风格泛化与推理速度方面进行了显著改进。
核心功能亮点
- 更精准的唇形同步:用 Whisper-Large 替代 Wav2Vec2 作为音频编码器,大幅提升唇动与语音的匹配精度。
- 生产级物理合理性:通过稳健的长视频生成机制,保证视频中人物运动(尤其是头部、表情)具有自然的时间稳定性与物理逻辑。
- 风格泛化能力强:支持动漫、动物等非真实画风,以及在复杂真实场景(如户外、弱光)下的稳定生成。
- 多音频流支持:既可处理单声道说话音频,也能处理多声源(如对话、旁白+背景音)的混合输入。
- 推理加速:采用步骤蒸馏技术,将推理步数压缩至 8 步,在保持画质的同时显著降低延迟。
适用场景
- 数字人直播、虚拟主播内容制作
- 在线教育与培训课程中的虚拟讲师生成
- 社交媒体视频模板、短视频创作工具
- 游戏角色或动画角色的动态表情生成
上手提示
框架以开源方式提供,推荐在 Python 3.10+ 环境配合 PyTorch 2.0 以上使用。首次运行需下载预训练 Checkpoint 与 Whisper-Large 模型。若需要 ComfyUI 工作流集成,可参考社区提供的自定义节点(待发布)。建议使用 8GB 以上显存的 GPU(如 RTX 3060 或更高)获得流畅体验。多音频流输入时需按规范格式预处理为混合音频文件。
作者/来源:美团-龙猫
常见问题
LongCat-Video-Avatar-1.5是什么?
它是一个开源音频驱动的人物视频生成框架升级版,可根据单声道或多声道音频自动生成逼真的说话人视频,口型同步精准且长时稳定。
它支持哪些画风?
支持真人、动漫、动物等非真实画风,也能在户外、弱光等复杂场景下稳定生成。
运行需要什么硬件配置?
推荐使用8GB以上显存的GPU(如RTX 3060或更高),Python 3.10+,PyTorch 2.0以上环境。
相比v1.0版本有哪些改进?
v1.5采用Whisper-Large音频编码器提升唇形同步精度,改进长视频稳定性,推理步数压缩至8步,并支持多音频流输入。
它可以用于哪些应用场景?
适用于数字人直播、在线教育虚拟讲师、短视频创作、游戏角色动态表情等场景。