Skip to main content
ByteDance Seed Audio 1.0을 사용하여 하나의 프롬프트에서 음성, 음악, 음향 효과 및 다중 화자 대화를 생성합니다. 프롬프트에서 음성(들), 감정, 템포, 주변음, 배경 음악 및 음향 효과를 설명하고 말할 대사를 포함하십시오. 선택적으로 내장 프리셋 음성을 고르거나, 최대 3개의 참조 클립에서 음성을 복제하거나(프롬프트에서 @Audio1-3로 태그), 캐릭터 이미지에서 음성을 도출할 수 있습니다. 실행당 최대 2분 오디오를 생성합니다. 다국어 모델은 20개 언어와 타임스탬프 기반 타이밍 제어를 지원합니다.

입력

매개변수 제약 조건

  • 참조 모드 종속성: reference_mode 매개변수는 어떤 다른 입력이 필요한지 결정합니다:
    • “text only”: 추가 입력이 필요하지 않습니다. 프롬프트에는 @AudioN 태그가 포함되어서는 안 됩니다.
    • “audio reference”: reference_audio_1, reference_audio_2, reference_audio_3 중 최소 하나가 연결되어야 합니다. 참조 클립은 빈틈없이 순서대로 연결해야 합니다. 각 클립은 최대 30초 길이로 제한됩니다. 프롬프트에서 @AudioN 태그를 사용하는 경우, 가장 높은 태그 번호는 연결된 참조 클립 수를 초과해서는 안 됩니다.
    • “image reference”: reference_image가 연결되어야 합니다. @AudioN 태그는 사용되지 않으며, 프롬프트에는 합성할 텍스트만 포함해야 합니다.
    • “preset voice”: 프리셋 음성을 선택해야 합니다. 전체 프롬프트가 선택한 음성으로 읽힙니다. @AudioN 태그는 참조로 사용되지 않으며, @Audio2 이상의 태그는 거부됩니다.
  • 오디오 참조 순서: "audio reference" 모드에서는 참조 오디오 입력을 reference_audio_1부터 중간에 빈틈 없이 순차적으로 연결해야 합니다. 예를 들어 reference_audio_1reference_audio_2는 연결할 수 있지만, reference_audio_2 없이 reference_audio_1reference_audio_3을 연결할 수는 없습니다.
  • 최대 오디오 태그: "audio reference" 모드에서는 최대 3개의 참조 클립(@Audio1, @Audio2, @Audio3)을 연결할 수 있으며, 프롬프트의 가장 높은 @AudioN 태그는 연결된 참조 오디오 입력 수를 초과할 수 없습니다.
  • 모델 차이점: seed-audio-1.0-multilingual 모델은 20개 언어(영어, 중국어, 일본어, 한국어, 멕시코 스페인어 및 카스티야 스페인어, 인도네시아어, 독일어, 브라질 포르투갈어, 프랑스어, 태국어, 베트남어, 말레이어, 필리핀어, 이탈리아어, 러시아어, 네덜란드어, 폴란드어, 터키어, 스웨덴어)와 [5.5s:8.0s] 형식의 타임스탬프를 사용한 문장별 타이밍 제어를 지원합니다. seed-audio-1.0 모델은 영어와 중국어만 지원하며 타이밍 제어가 없습니다.

출력

이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! GitHub에서 편집

Source fingerprint (SHA-256): e86e4edde424b4427d864350a9d3b082e271fbd2b1e335175637a9cc3ad51163