数智技能研修平台
AI 前沿发现
魔搭 ModelScope

LongCat-Video-Avatar-1.5:音频驱动数字人视频生成,口型精准长时稳定

LongCat-Video-Avatar-1.5是音频驱动数字人视频生成框架升级版,基于Whisper-Large实现精准唇形同步,长视频稳定自然,支持真人、动漫多风格,推理仅需8步,适用于虚拟主播、在线教育、短视频创作等场景。

查看原文 →

内容为平台聚合整理,原文与最新动态以来源页面为准。

加老师微信 · 进学习群
报名咨询、课程答疑由老师 1 对 1 服务
AI工程师学习考试咨询扫码进学习交流群
开发者入驻 / 商业定制咨询加专属老师微信

图文介绍

LongCat-Video-Avatar-1.5 是一个开源的音频驱动人物视频生成框架的升级版本。它基于深度学习,能够根据单声道或多声道音频输入,生成逼真的说话人视频,适用于数字人、虚拟主播、远程教学等场景。v1.5 在唇形同步、长视频稳定性、风格泛化与推理速度方面进行了显著改进。

核心功能亮点

  • 更精准的唇形同步:用 Whisper-Large 替代 Wav2Vec2 作为音频编码器,大幅提升唇动与语音的匹配精度。
  • 生产级物理合理性:通过稳健的长视频生成机制,保证视频中人物运动(尤其是头部、表情)具有自然的时间稳定性与物理逻辑。
  • 风格泛化能力强:支持动漫、动物等非真实画风,以及在复杂真实场景(如户外、弱光)下的稳定生成。
  • 多音频流支持:既可处理单声道说话音频,也能处理多声源(如对话、旁白+背景音)的混合输入。
  • 推理加速:采用步骤蒸馏技术,将推理步数压缩至 8 步,在保持画质的同时显著降低延迟。

适用场景

  • 数字人直播、虚拟主播内容制作
  • 在线教育与培训课程中的虚拟讲师生成
  • 社交媒体视频模板、短视频创作工具
  • 游戏角色或动画角色的动态表情生成

上手提示

框架以开源方式提供,推荐在 Python 3.10+ 环境配合 PyTorch 2.0 以上使用。首次运行需下载预训练 Checkpoint 与 Whisper-Large 模型。若需要 ComfyUI 工作流集成,可参考社区提供的自定义节点(待发布)。建议使用 8GB 以上显存的 GPU(如 RTX 3060 或更高)获得流畅体验。多音频流输入时需按规范格式预处理为混合音频文件。

作者/来源:美团-龙猫

常见问题

LongCat-Video-Avatar-1.5是什么?

它是一个开源音频驱动的人物视频生成框架升级版,可根据单声道或多声道音频自动生成逼真的说话人视频,口型同步精准且长时稳定。

它支持哪些画风?

支持真人、动漫、动物等非真实画风,也能在户外、弱光等复杂场景下稳定生成。

运行需要什么硬件配置?

推荐使用8GB以上显存的GPU(如RTX 3060或更高),Python 3.10+,PyTorch 2.0以上环境。

相比v1.0版本有哪些改进?

v1.5采用Whisper-Large音频编码器提升唇形同步精度,改进长视频稳定性,推理步数压缩至8步,并支持多音频流输入。

它可以用于哪些应用场景?

适用于数字人直播、在线教育虚拟讲师、短视频创作、游戏角色动态表情等场景。

← 浏览全部 AI 前沿发现访问平台首页
数智技能研修平台 · shuzihub.net
蜀ICP备18034578号