Skip to main content
MiniMax H3 Reference to Video は、MiniMax H3 の reference-to-video 生成に必要なテキストコンディショニングと空の音声・映像潜在表現を作成します。プロンプトと、任意の参照画像、参照動画、参照音声クリップを指定すると、ノードはこれらの参照を、モデルが生成中に使用できるコンディショニングへエンコードします。プロンプトでは、<Picture i><Video k><Audio j> タグを使って参照を指定します。

入力

注意事項:
  • プロンプトでは、種類ごとに1始まりのタグを使って参照メディアを指定します。画像には <Picture i>、動画には <Video k>、音声には <Audio j> を使用します。参照は固定の順序でモデルに提示されます。まず画像、次に動画(各サウンドトラックの <Audio j> ラベルは、対応する <Video k> の直前に置かれます)、最後に独立した音声です。
  • ref_video_audio_N に接続されたサウンドトラックは、ref_video_N に接続された参照動画と組み合わせて使用されます。
  • 参照動画には少なくとも5フレーム(24 fps で約0.2秒)が必要です。そうでない場合、ノードはエラーを発生させます。要求された length を超えるフレームは切り捨てられ、残りのフレーム数はモデルがサポートする値に調整されます。
  • 要求された length は、潜在表現が作成される前に、サポートされるフレーム数に合わせて調整されます。
  • vae がない場合、参照画像と参照動画はテキストエンコーダーにのみ条件付けを与えます(参照潜在表現は生成されません)。audio_vae がない場合、参照音声はテキストエンコーダーにのみ条件付けを与えます。

出力

このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください! GitHub で編集

Source fingerprint (SHA-256): 47df0d6d13cb02aa4f69b50a7f8d0f6c1639c1fb5e0f69bf8fc57dd4cb752db8