<Picture i>、<Video k> 和 <Audio j> 标签引用这些参考。
输入
注意:
- 提示词使用按类型从 1 开始的标签引用参考媒体:图像用
<Picture i>,视频用<Video k>,音频用<Audio j>。参考按固定顺序呈现给模型:图像,然后是视频(每个配乐的<Audio j>标签紧挨在其<Video k>之前),最后是独立音频。 - 连接到
ref_video_audio_N的配乐会与连接到ref_video_N的参考视频一起使用。 - 参考视频必须包含至少 5 帧(24 fps 下约 0.2 秒),否则节点会报错。超出请求
length的帧会被裁剪,剩余帧数会调整为模型支持的值。 - 请求的
length会在创建 latent 之前对齐到受支持的帧数。 - 如果没有
vae,参考图像和视频只会对文本编码器进行条件化(不会生成参考 latent)。如果没有audio_vae,参考音频只会对文本编码器进行条件化。
输出
本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑
Source fingerprint (SHA-256):
47df0d6d13cb02aa4f69b50a7f8d0f6c1639c1fb5e0f69bf8fc57dd4cb752db8