Skip to main content
WanSCAILToVideo 节点为使用 SCAIL 和 SCAIL-2 视频模型进行视频生成准备条件和空 latent 空间。它处理可选输入,例如参考图像、姿态视频、CLIP 视觉输出、彩色身份掩码和前序帧块,将它们嵌入到正向和负向条件中。该节点输出修改后的条件和指定视频尺寸的空白 latent 张量,准备好进行采样。

输入

注意: pose_videopose_video_mask 输入会一起截断到两者中较短的长度,并且仅处理前 length 帧。如果任一输入短于或等于 video_frame_offset,则完全忽略它。pose_video 在编码前会下采样到主视频分辨率的一半,编码后的姿态 latent 会乘以 pose_strength,并且仅在 pose_startpose_end 时间步之间应用于条件。如果提供了 pose_video_mask,彩色掩码视频会下采样到一半分辨率,并转换为 28 通道驱动掩码,然后添加到正向和负向条件中。 注意: 当提供 reference_image 时,批次中的每张图像都会单独编码为 latent 并嵌入到正向和负向条件中。第一张图像是主参考;额外的图像用作附加视图,每张都需要匹配的 reference_image_maskreference_image_mask 仅在同时提供 reference_image 时使用;当两者都提供时,还会从掩码构建一个 28 通道参考掩码,将参考帧绑定到身份,并添加到条件中。在替换模式(replacement_mode=True)下,参考图像使用参考图像掩码作为 alpha 蒙版合成到黑色背景上。当提供 clip_vision_output 时,它会同时应用于正向和负向条件。 注意: 当提供 previous_frames 时,仅最后 previous_frame_count 帧用作扩展锚点,并且 video_frame_offset 会相应调整(减去锚定帧数,限制在 0)。锚定帧会被编码并写入输出 latent 的开头,并且包含一个噪声掩码,以便这些帧在生成过程中保持不变。

输出

本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑

Source fingerprint (SHA-256): 4a1a2201dfa94bd2f1330db02ec18a5e0a6aae9e9ac5ae97d456b7af1aa84b7b