LTX-2.3-Licon-MSR-V2 角色表参考_视频生成工作流
ComfyUI 工作流
图生视频LTX2.3

LTX-2.3-Licon-MSR-V2 角色表参考_视频生成工作流

深入解析基于LTX2.3的MSR V2多主体参考模型工作流,实现高保真角色还原与音画同步视频生成。解决多参考图特征污染问题,适用于图生视频场景,支持15秒长视频及帧级口型对齐。

文件:LTX-2.3_ref2vid_MSRV2_workflow.json(83.1 KB)
已下载 114 次
免费下载工作流 ↓

点击即下载,无需注册。文件为 ComfyUI 可直接导入的 JSON 工作流。

加老师微信 · 进学习群
报名咨询、课程答疑由老师 1 对 1 服务
AI工程师学习考试咨询扫码进学习交流群
刘老师加专属老师微信

图文介绍

工作流核心模型解析:MSR V2
MSR V2 是专为 LTX 2.3 架构深度定制的多主体参考模型。传统 I2V 模型在处理多张参考图时,极易出现身份特征混淆或背景融合崩坏。MSR V2 通过创新的 Token 级视觉记忆机制,将面部特写、服装全身与背景环境解耦为独立的视觉 Token。在潜空间计算中,它利用模型原生的自注意力机制,精准提取并锁定不同主体的属性(如 Ref1 的脸、Ref2 的衣服),彻底解决了多主体融合时的“特征污染”问题,实现了电影级的高保真角色还原。

工作流架构深度剖析
该工作流完美释放了 MSR V2 的潜能。在视觉管线上,
LiconMSR 节点作为中枢,将多张参考图转化为伪视频序列,配合 LTX2_NAG (噪声增强引导) 节点,有效抑制了多主体融合产生的闪烁与伪影。在时序控制上,工作流采用 PromptRelay 引擎进行全局与分段提示词接力,确保 15 秒长视频中动作与镜头的平滑过渡。更惊艳的是其原生音画同步架构,通过 LTXVAudioVAEEncode 与 LTXVConcatAVLatent 将音频潜变量与视频潜变量在时间维度拼接,实现了帧级精准的口型与音效对齐。

常见问题

这款工作流适合什么场景使用?

主要适合图生视频场景,特别是有多张角色参考图(如面部特写、服装全身、背景环境)时需要生成高保真角色视频的场景,例如数字人制作、影视前期预览、角色动画等。

MSR V2模型解决了什么问题?

MSR V2是专为LTX2.3架构定制的多主体参考模型,解决了传统I2V模型处理多张参考图时身份特征混淆、背景融合崩坏的“特征污染”问题,通过Token级视觉记忆机制实现解耦。

工作流需要几张参考图?

工作流支持多张参考图(如Ref1面部、Ref2服装等),具体数量可根据需求调整,LiconMSR节点会将其转化为伪视频序列。

生成的视频最长支持多少秒?

配合PromptRelay引擎的全局与分段提示词接力,工作流支持生成15秒长视频,并保持动作与镜头平滑过渡。

音画同步是如何实现的?

通过LTXVAudioVAEEncode和LTXVConcatAVLatent节点,将音频潜变量与视频潜变量在时间维度拼接,实现帧级精准的口型与音效对齐。

← 浏览全部 ComfyUI 工作流访问平台首页
数智技能研修平台 · shuzihub.net
蜀ICP备18034578号