> ## Documentation Index
> Fetch the complete documentation index at: https://dripart-comfy-docs-comfyapi-search.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# MiniMaxH3ImageToVideo - ComfyUI Built-in Node Documentation

> 此节点准备使用 MiniMax H3 模型生成视频所需的 conditioning 和空 latent。

此节点准备使用 MiniMax H3 模型生成视频所需的 conditioning 和空 latent。它接收文本提示词，以及可选的视频首帧和/或尾帧图像，并将其转换为模型输入。关键帧图像会被调整尺寸、编码，并分别附加到视频开头和结尾的 conditioning 上。

## 输入

| 参数     | 描述                                                                             | 数据类型   | 必需 | 范围                            |
| ------ | ------------------------------------------------------------------------------ | ------ | -- | ----------------------------- |
| `clip` | 用于对提示词进行分词，并将关键帧图像编码为 conditioning 的 CLIP 模型。                                  | CLIP   | 是  |                               |
| `vae`  | 当提供关键帧图像时，用于将关键帧图像编码到 latent 空间的 VAE 模型。                                       | VAE    | 是  |                               |
| `提示词`  | 描述要生成视频的文本提示词。支持多行和动态提示词。                                                      | STRING | 是  |                               |
| `宽度`   | 视频宽度，单位为像素（默认：1344）。                                                           | INT    | 是  | 32 to MAX\_RESOLUTION （步长：32） |
| `高度`   | 视频高度，单位为像素（默认：768）。                                                            | INT    | 是  | 32 to MAX\_RESOLUTION （步长：32） |
| `长度`   | 以 24 fps 计的帧数，会向上对齐到模型的 17k+5 网格（124 = 约 5 秒；训练范围约为 124-362，更长范围未经验证）（默认：124）。 | INT    | 是  | 5 到 3600 （步长：17）              |
| `首帧`   | 可选图像，用作视频的第一帧。它会被拉伸到整个画布尺寸，因此不会保留其宽高比。仅使用输入批次中的第一张图像。                          | IMAGE  | 否  |                               |
| `末帧`   | 可选图像，用作视频的最后一帧。它会被裁剪以覆盖画布，同时保留其宽高比。仅使用输入批次中的第一张图像。                             | IMAGE  | 否  |                               |

当提供 `first_frame` 和/或 `last_frame` 时，关键帧图像会使用 VAE 编码，并分别附加到第 0 帧和最后一帧的 conditioning 上。当两者都未提供时，此节点仅根据提示词工作。请求的 `length` 会向上对齐到最接近的有效帧数（17k + 5），因此实际帧数可能会略高于请求值。

音频-视频 latent 会创建为一个空对，与请求的 `width`、`height` 以及对齐后的帧数匹配。音频部分根据相同帧数按每秒 40 个音频帧确定尺寸。

## 输出

| 输出名称       | 描述                                                                 | 数据类型         |
| ---------- | ------------------------------------------------------------------ | ------------ |
| `positive` | 包含编码后的提示词的 conditioning；当提供关键帧图像时，还包含编码后的关键帧和帧数，供 MiniMax H3 模型使用。 | CONDITIONING |
| `latent`   | 表示待生成内容的空音频-视频 latent，具有请求的宽度、高度和帧数。                               | LATENT       |

> 本文档由 AI 生成。如果您发现任何错误或有改进建议，欢迎贡献！ [在 GitHub 上编辑](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/MiniMaxH3ImageToVideo/zh.md)

***

**Source fingerprint (SHA-256):** `d1bdf3f8c66ef20ff11c35203d2c266a88dcf8cc00c65dbb0aea2b1dd16befd6`
