
LTX-2.3-Licon-MSR-V2 角色表参考_视频生成工作流
深入解析基于LTX2.3的MSR V2多主体参考模型工作流,实现高保真角色还原与音画同步视频生成。解决多参考图特征污染问题,适用于图生视频场景,支持15秒长视频及帧级口型对齐。
点击即下载,无需注册。文件为 ComfyUI 可直接导入的 JSON 工作流。
扫码进学习交流群
加专属老师微信图文介绍
工作流核心模型解析:MSR V2
MSR V2 是专为 LTX 2.3 架构深度定制的多主体参考模型。传统 I2V 模型在处理多张参考图时,极易出现身份特征混淆或背景融合崩坏。MSR V2 通过创新的 Token 级视觉记忆机制,将面部特写、服装全身与背景环境解耦为独立的视觉 Token。在潜空间计算中,它利用模型原生的自注意力机制,精准提取并锁定不同主体的属性(如 Ref1 的脸、Ref2 的衣服),彻底解决了多主体融合时的“特征污染”问题,实现了电影级的高保真角色还原。
工作流架构深度剖析
该工作流完美释放了 MSR V2 的潜能。在视觉管线上,LiconMSR 节点作为中枢,将多张参考图转化为伪视频序列,配合 LTX2_NAG (噪声增强引导) 节点,有效抑制了多主体融合产生的闪烁与伪影。在时序控制上,工作流采用 PromptRelay 引擎进行全局与分段提示词接力,确保 15 秒长视频中动作与镜头的平滑过渡。更惊艳的是其原生音画同步架构,通过 LTXVAudioVAEEncode 与 LTXVConcatAVLatent 将音频潜变量与视频潜变量在时间维度拼接,实现了帧级精准的口型与音效对齐。
常见问题
主要适合图生视频场景,特别是有多张角色参考图(如面部特写、服装全身、背景环境)时需要生成高保真角色视频的场景,例如数字人制作、影视前期预览、角色动画等。
MSR V2是专为LTX2.3架构定制的多主体参考模型,解决了传统I2V模型处理多张参考图时身份特征混淆、背景融合崩坏的“特征污染”问题,通过Token级视觉记忆机制实现解耦。
工作流支持多张参考图(如Ref1面部、Ref2服装等),具体数量可根据需求调整,LiconMSR节点会将其转化为伪视频序列。
配合PromptRelay引擎的全局与分段提示词接力,工作流支持生成15秒长视频,并保持动作与镜头平滑过渡。
通过LTXVAudioVAEEncode和LTXVConcatAVLatent节点,将音频潜变量与视频潜变量在时间维度拼接,实现帧级精准的口型与音效对齐。
![MiniMax H3 终极增强套件[H3 Studio工作流和资产文件]](https://www.shuzihub.net/uploads/cover/3b3306e4c8e14547b0780fcc6bfee7c5.png)


