> ## Documentation Index
> Fetch the complete documentation index at: https://dripart-comfy-docs-comfyapi-search.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# WanSCAILToVideo - ComfyUI Built-in Node Documentation

> WanSCAILToVideo 节点为使用 SCAIL 和 SCAIL-2 视频模型进行视频生成准备条件和空 latent 空间。

WanSCAILToVideo 节点为使用 SCAIL 和 SCAIL-2 视频模型进行视频生成准备条件和空 latent 空间。它处理可选输入，例如参考图像、姿态视频、CLIP 视觉输出、彩色身份掩码和前序帧块，将它们嵌入到正向和负向条件中。该节点输出修改后的条件和指定视频尺寸的空白 latent 张量，准备好进行采样。

## 输入

| 参数                     | 描述                                                                                                          | 数据类型                 | 必需 | 范围                    |
| ---------------------- | ----------------------------------------------------------------------------------------------------------- | -------------------- | -- | --------------------- |
| `正向`                   | 正向条件输入。                                                                                                     | CONDITIONING         | 是  | -                     |
| `负向`                   | 负向条件输入。                                                                                                     | CONDITIONING         | 是  | -                     |
| `vae`                  | 用于编码图像和视频帧的 VAE 模型。                                                                                         | VAE                  | 是  | -                     |
| `宽度`                   | 输出视频的宽度（像素）（默认：512）。值步长为 32。                                                                                | INT                  | 是  | 32 to MAX\_RESOLUTION |
| `高度`                   | 输出视频的高度（像素）（默认：896）。值步长为 32。                                                                                | INT                  | 是  | 32 to MAX\_RESOLUTION |
| `长度`                   | 视频中的帧数（默认：81）。值步长为 4。                                                                                       | INT                  | 是  | 1 to MAX\_RESOLUTION  |
| `批量大小`                 | 一批中要生成的视频数量（默认：1）。                                                                                          | INT                  | 是  | 1 到 4096              |
| `姿态视频`                 | 用于姿态条件的视频。将下采样到主视频分辨率的一半。                                                                                   | IMAGE                | 否  | -                     |
| `pose_video_mask`      | 仅 SCAIL-2。彩色逐身份 SAM3 掩码视频，分辨率与 `pose_video` 相同。                                                             | IMAGE                | 否  | -                     |
| `replacement_mode`     | 仅 SCAIL-2。False = 动画模式（`pose_video_mask` 应具有黑色背景）。True = 替换模式（`pose_video_mask` 应具有白色背景）。（默认：False）         | BOOLEAN              | 否  | -                     |
| `姿态强度`                 | 姿态 latent 的强度。（默认：1.0）                                                                                      | FLOAT                | 是  | 0.0 到 10.0            |
| `姿态起始步`                | 姿态条件的起始步。（默认：0.0）                                                                                           | FLOAT                | 是  | 0.0 到 1.0             |
| `姿态结束步`                | 姿态条件的结束步。（默认：1.0）                                                                                           | FLOAT                | 是  | 0.0 到 1.0             |
| `参考图像`                 | 参考图像。第一张图像是主参考（将所有身份合成到其上）。SCAIL-2：额外的批次图像用作附加视图（背面视图、特写、被遮挡背景），每张都需要一个匹配的 `reference_image_mask`，使用该身份的颜色。 | IMAGE                | 否  | -                     |
| `reference_image_mask` | 仅 SCAIL-2。彩色参考掩码，批次与 `reference_image` 匹配（第一个 = 主参考掩码，其余 = 附加 `reference_image` 的身份掩码）。                     | IMAGE                | 否  | -                     |
| `clip视觉输出`             | 用于条件的 CLIP 视觉特征。模型使用拉伸调整大小到宽高比进行训练。                                                                         | CLIP\_VISION\_OUTPUT | 否  | -                     |
| `video_frame_offset`   | 此块开始的累计输出帧。从前一块的 `video_frame_offset` 输出连接。（默认：0）                                                           | INT                  | 是  | 0 to MAX\_RESOLUTION  |
| `previous_frame_count` | 要锚定的 `previous_frames` 的尾部帧数。SCAIL-2 在 5 下训练（81 帧块，76 帧步长）。（默认：5）。值步长为 4。                                   | INT                  | 是  | 1 to MAX\_RESOLUTION  |
| `previous_frames`      | 仅 SCAIL-2。前一块的完整解码输出。仅最后 `previous_frame_count` 帧用作扩展锚点。                                                    | IMAGE                | 否  | -                     |

**注意：** `pose_video` 和 `pose_video_mask` 输入会一起截断到两者中较短的长度，并且仅处理前 `length` 帧。如果任一输入短于或等于 `video_frame_offset`，则完全忽略它。`pose_video` 在编码前会下采样到主视频分辨率的一半，编码后的姿态 latent 会乘以 `pose_strength`，并且仅在 `pose_start` 和 `pose_end` 时间步之间应用于条件。如果提供了 `pose_video_mask`，彩色掩码视频会下采样到一半分辨率，并转换为 28 通道驱动掩码，然后添加到正向和负向条件中。

**注意：** 当提供 `reference_image` 时，批次中的每张图像都会单独编码为 latent 并嵌入到正向和负向条件中。第一张图像是主参考；额外的图像用作附加视图，每张都需要匹配的 `reference_image_mask`。`reference_image_mask` 仅在同时提供 `reference_image` 时使用；当两者都提供时，还会从掩码构建一个 28 通道参考掩码，将参考帧绑定到身份，并添加到条件中。在替换模式（`replacement_mode=True`）下，参考图像使用参考图像掩码作为 alpha 蒙版合成到黑色背景上。当提供 `clip_vision_output` 时，它会同时应用于正向和负向条件。

**注意：** 当提供 `previous_frames` 时，仅最后 `previous_frame_count` 帧用作扩展锚点，并且 `video_frame_offset` 会相应调整（减去锚定帧数，限制在 0）。锚定帧会被编码并写入输出 latent 的开头，并且包含一个噪声掩码，以便这些帧在生成过程中保持不变。

## 输出

| 输出名称                 | 描述                                                                                                                                         | 数据类型         |
| -------------------- | ------------------------------------------------------------------------------------------------------------------------------------------ | ------------ |
| `positive`           | 修改后的正向条件，可能包含嵌入的参考图像 latent、CLIP 视觉输出、姿态视频 latent、驱动掩码、参考掩码或前序帧 latent。                                                                    | CONDITIONING |
| `negative`           | 修改后的负向条件，可能包含嵌入的参考图像 latent、CLIP 视觉输出、姿态视频 latent、驱动掩码、参考掩码或前序帧 latent。                                                                    | CONDITIONING |
| `latent`             | 形状为 `[batch_size, 16, ((length - 1) // 4) + 1, height // 8, width // 8]` 的空 latent 张量。当提供 `previous_frames` 时，latent 会部分填充编码后的前序帧，并包含噪声掩码。 | LATENT       |
| `video_frame_offset` | 调整后的偏移 + 长度。连接到下一块以进行顺序视频生成。                                                                                                               | INT          |

> 本文档由 AI 生成。如果您发现任何错误或有改进建议，欢迎贡献！ [在 GitHub 上编辑](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/WanSCAILToVideo/zh.md)

***

**Source fingerprint (SHA-256):** `4a1a2201dfa94bd2f1330db02ec18a5e0a6aae9e9ac5ae97d456b7af1aa84b7b`
