> ## Documentation Index
> Fetch the complete documentation index at: https://dripart-comfy-docs-comfyapi-search.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# WanHuMoImageToVideo - ComfyUI Built-in Node Documentation

> WanHuMoImageToVideo 节点为 Wan HuMo 视频生成流程准备条件数据和一个空 latent 视频。

WanHuMoImageToVideo 节点为 Wan HuMo 视频生成流程准备条件数据和一个空 latent 视频。它可以将参考图像和音频嵌入附加到正向和负向条件输入，并根据请求的 `width`、`height`、`length` 和 `batch_size` 创建相应大小的零填充 latent。

## 输入

| 参数        | 描述                                  | 数据类型               | 是否必需 | 范围                             |
| --------- | ----------------------------------- | ------------------ | ---- | ------------------------------ |
| `正面提示词`   | 正向条件输入，引导视频生成朝向期望内容。                | CONDITIONING       | 是    | -                              |
| `负面提示词`   | 负向条件输入，引导视频生成远离不想要的内容。              | CONDITIONING       | 是    | -                              |
| `VAE`     | 用于将参考图像编码到 latent 空间的 VAE 模型。       | VAE                | 是    | -                              |
| `宽度`      | 输出视频帧宽度（像素）。默认：832。                 | INT                | 是    | 16 to MAX\_RESOLUTION, step 16 |
| `高度`      | 输出视频帧高度（像素）。默认：480。                 | INT                | 是    | 16 to MAX\_RESOLUTION, step 16 |
| `长度`      | 生成视频序列中的帧数。默认：97。                   | INT                | 是    | 1 to MAX\_RESOLUTION, step 4   |
| `批次大小`    | 同时生成的视频序列数量。默认：1。                   | INT                | 是    | 1 到 4096                       |
| `音频编码器输出` | 可选音频编码数据，可根据音频内容影响视频生成。             | AUDIOENCODEROUTPUT | 否    | -                              |
| `参考图像`    | 可选参考图像，用于引导视频生成的风格和内容。仅使用批次中的第一张图像。 | IMAGE              | 否    | -                              |

**注意：** 当提供参考图像时，批次中的第一张图像会使用双线性插值上采样到请求的 `width` 和 `height`，并使用 VAE 编码。该参考 latent 会附加到正向条件，而相同形状的零填充 latent 会附加到负向条件。当提供 `audio_encoder_output` 时，音频嵌入会被插值并附加到正向条件，而零填充音频嵌入会附加到负向条件。如果省略任一可选输入，则会使用零填充占位张量：形状为 `[batch_size, 16, 1, height // 8, width // 8]` 的零参考 latent 和/或形状为 `[batch_size, latent_t + 1, 8, 5, 1280]` 的零音频嵌入，其中 `latent_t = ((length - 1) // 4) + 1`。

## 输出

| 输出名称       | 描述                                                                                                                                                                     | 数据类型         |
| ---------- | ---------------------------------------------------------------------------------------------------------------------------------------------------------------------- | ------------ |
| `positive` | 已合并参考图像和/或音频嵌入的修改后正向条件。                                                                                                                                                | CONDITIONING |
| `negative` | 已合并参考图像和/或音频嵌入的修改后负向条件。                                                                                                                                                | CONDITIONING |
| `latent`   | 视频序列的零初始化 latent 表示，大小根据 `width`、`height`、`length` 和 `batch_size` 确定。形状：`[batch_size, 16, latent_t, height // 8, width // 8]`，其中 `latent_t = ((length - 1) // 4) + 1`。 | LATENT       |

> 本文档由 AI 生成。如果您发现任何错误或有改进建议，欢迎贡献！ [在 GitHub 上编辑](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/WanHuMoImageToVideo/zh.md)

***

**Source fingerprint (SHA-256):** `db674a4a00729a8715988030083e2858f958cd21de73bbbe4ed6d76f5f539419`
