Skip to main content
MiniMax H3 Reference to Video는 MiniMax H3 reference-to-video 생성에 필요한 텍스트 컨디셔닝과 빈 오디오-비디오 latent를 생성합니다. 프롬프트와 선택적 참조 이미지, 비디오, 오디오 클립을 제공하면, 노드가 이러한 참조를 모델이 생성 중 사용할 수 있는 컨디셔닝으로 인코딩합니다. 프롬프트는 <Picture i>, <Video k>, <Audio j> 태그로 참조를 가리킵니다.

입력

참고:
  • 프롬프트는 유형별 1부터 시작하는 태그로 참조 미디어를 가리킵니다. 이미지는 <Picture i>, 비디오는 <Video k>, 오디오는 <Audio j>입니다. 참조는 이미지, 그다음 비디오(각 사운드트랙의 <Audio j> 레이블이 해당 <Video k> 바로 앞에 위치), 그다음 독립형 오디오의 고정된 순서로 모델에 제공됩니다.
  • ref_video_audio_N에 연결된 사운드트랙은 ref_video_N에 연결된 참조 비디오와 함께 사용됩니다.
  • 참조 비디오는 최소 5프레임(24 fps에서 약 0.2초)을 포함해야 하며, 그렇지 않으면 노드에서 오류를 발생시킵니다. 요청된 length를 초과하는 프레임은 잘라내며, 남은 프레임 수는 모델에서 지원하는 값으로 조정됩니다.
  • 요청된 length는 latent가 생성되기 전에 지원되는 프레임 수로 정렬됩니다.
  • vae가 없으면 참조 이미지와 비디오는 텍스트 인코더만 조건화합니다(참조 latent가 생성되지 않음). audio_vae가 없으면 참조 오디오는 텍스트 인코더만 조건화합니다.

출력

이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! GitHub에서 편집

Source fingerprint (SHA-256): 47df0d6d13cb02aa4f69b50a7f8d0f6c1639c1fb5e0f69bf8fc57dd4cb752db8