> ## Documentation Index
> Fetch the complete documentation index at: https://dripart-comfy-docs-comfyapi-search.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# ByteDanceSeedAudio - ComfyUI Built-in Node Documentation

> ByteDance Seed Audio 1.0을 사용하여 하나의 프롬프트에서 음성, 음악, 음향 효과 및 다중 화자 대화를 생성합니다. 프롬프트에서 음성(들), 감정, 템포, 주변음, 배경 음악 및 음향 효과를 설명하고 말할 대사를 포함하십시오. 선택적으로 내장 프리셋 음성을 고르거나, 최대 3개의 참조 클립에서 음성을 복

ByteDance Seed Audio 1.0을 사용하여 하나의 프롬프트에서 음성, 음악, 음향 효과 및 다중 화자 대화를 생성합니다. 프롬프트에서 음성(들), 감정, 템포, 주변음, 배경 음악 및 음향 효과를 설명하고 말할 대사를 포함하십시오. 선택적으로 내장 프리셋 음성을 고르거나, 최대 3개의 참조 클립에서 음성을 복제하거나(프롬프트에서 @Audio1-3로 태그), 캐릭터 이미지에서 음성을 도출할 수 있습니다. 실행당 최대 2분 오디오를 생성합니다. 다국어 모델은 20개 언어와 타임스탬프 기반 타이밍 제어를 지원합니다.

## 입력

| 매개변수                | 설명                                                                                                                                                                                                                                                                                                | 데이터 타입 | 필수  | 범위                                                                                    |
| ------------------- | ------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | ------ | --- | ------------------------------------------------------------------------------------- |
| `text_prompt`       | 음성(들), 감정, 템포, 주변음, 배경 음악 및 음향 효과를 설명하고, 말할 대사를 포함합니다(대화의 경우 화자 이름을 인라인으로 지정). `"audio reference"` 모드에서는 연결된 클립을 순서대로 @Audio1, @Audio2, @Audio3로 참조합니다. 다국어 모델에서는 따옴표로 묶인 대사가 말해지는 시점과 길이를 제어하는 타임스탬프 범위로 시작할 수 있습니다. 예: `[5.5s:8.0s] Wait for me!`. 프롬프트는 말할 대사와 동일한 언어로 작성합니다. 최소 1자, 최대 3000자. | STRING | 예   | 1  \~  3000 characters                                                                |
| `reference_mode`    | 음성을 어떻게 조건화할지 지정합니다: `"text only"`(프롬프트에서 모든 것을 설명), `"audio reference"`(최대 3개 음성을 복제하며, @Audio1-3로 태그), `"image reference"`(하나의 캐릭터 이미지에서 음성을 도출), 또는 `"preset voice"`(프롬프트를 읽어 주는 내장 이름 지정 음성을 선택).                                                                                             | COMBO  | 예   | `"text only"`<br />`"audio reference"`<br />`"image reference"`<br />`"preset voice"` |
| `reference_audio_1` | 음성 복제를 위한 참조 클립으로, 프롬프트에서 @Audio1로 태그됩니다. 최대 30초. `reference_mode`가 `"audio reference"`일 때만 사용할 수 있습니다.                                                                                                                                                                                           | AUDIO  | 아니요 | 최대 30초                                                                                |
| `reference_audio_2` | 프롬프트에서 @Audio2로 태그되는 참조 클립입니다. 최대 30초. `reference_mode`가 `"audio reference"`일 때만 사용할 수 있습니다.                                                                                                                                                                                                      | AUDIO  | 아니요 | 최대 30초                                                                                |
| `reference_audio_3` | 프롬프트에서 @Audio3으로 태그되는 참조 클립입니다. 최대 30초. `reference_mode`가 `"audio reference"`일 때만 사용할 수 있습니다.                                                                                                                                                                                                     | AUDIO  | 아니요 | 최대 30초                                                                                |
| `reference_image`   | 단일 캐릭터 이미지로, 모델이 이로부터 음성을 도출합니다. 참조 오디오와 함께 사용할 수 없습니다. `reference_mode`가 `"image reference"`일 때만 사용할 수 있습니다.                                                                                                                                                                                     | IMAGE  | 아니요 | -                                                                                     |
| `preset_voice`      | 프롬프트를 읽어 주는 내장 TTS 2.0 음성입니다. 참조 클립이 필요하지 않으며, 이 모드에서는 @AudioN 태그가 사용되지 않습니다. `reference_mode`가 `"preset voice"`일 때 필수입니다.                                                                                                                                                                        | COMBO  | 아니요 | Multiple built-in preset voice options (first option selected by default)             |
| `sample_rate`       | 출력 샘플 레이트(Hz)입니다. (기본값: "24000")                                                                                                                                                                                                                                                                  | COMBO  | 예   | `"8000"`<br />`"16000"`<br />`"24000"`<br />`"32000"`<br />`"44100"`<br />`"48000"`   |
| `speech_rate`       | 말하기 속도입니다. 0 = 보통, 100 = 2.0x, -50 = 0.5x. (기본값: 0)                                                                                                                                                                                                                                               | INT    | 예   | -50  \~  100                                                                          |
| `loudness_rate`     | 음량입니다. 0 = 보통, 100 = 2.0x, -50 = 0.5x. (기본값: 0)                                                                                                                                                                                                                                                   | INT    | 예   | -50  \~  100                                                                          |
| `pitch_rate`        | 반음 단위의 피치 이동입니다(-12\~12). (기본값: 0)                                                                                                                                                                                                                                                                | INT    | 예   | -12  \~  12                                                                           |
| `seed`              | 시드는 노드를 다시 실행할지 여부를 제어합니다. 결과는 시드와 관계없이 비결정적입니다. (기본값: 42)                                                                                                                                                                                                                                        | INT    | 예   | 0  \~  2147483647                                                                     |
| `model`             | 모델 버전입니다. `seed-audio-1.0-multilingual`은 20개 언어와 `[5.5s:8.0s]` 타임스탬프를 통한 문장별 타이밍 제어를 지원합니다. `seed-audio-1.0`은 영어와 중국어만 지원하며 타이밍 제어가 없습니다. (기본값: "seed-audio-1.0-multilingual")                                                                                                                    | COMBO  | 아니요 | `"seed-audio-1.0-multilingual"`<br />`"seed-audio-1.0"`                               |

### 매개변수 제약 조건

* **참조 모드 종속성**: `reference_mode` 매개변수는 어떤 다른 입력이 필요한지 결정합니다:
  * **"text only"**: 추가 입력이 필요하지 않습니다. 프롬프트에는 @AudioN 태그가 포함되어서는 안 됩니다.
  * **"audio reference"**: `reference_audio_1`, `reference_audio_2`, `reference_audio_3` 중 최소 하나가 연결되어야 합니다. 참조 클립은 빈틈없이 순서대로 연결해야 합니다. 각 클립은 최대 30초 길이로 제한됩니다. 프롬프트에서 @AudioN 태그를 사용하는 경우, 가장 높은 태그 번호는 연결된 참조 클립 수를 초과해서는 안 됩니다.
  * **"image reference"**: `reference_image`가 연결되어야 합니다. @AudioN 태그는 사용되지 않으며, 프롬프트에는 합성할 텍스트만 포함해야 합니다.
  * **"preset voice"**: 프리셋 음성을 선택해야 합니다. 전체 프롬프트가 선택한 음성으로 읽힙니다. @AudioN 태그는 참조로 사용되지 않으며, @Audio2 이상의 태그는 거부됩니다.

* **오디오 참조 순서**: `"audio reference"` 모드에서는 참조 오디오 입력을 `reference_audio_1`부터 중간에 빈틈 없이 순차적으로 연결해야 합니다. 예를 들어 `reference_audio_1`과 `reference_audio_2`는 연결할 수 있지만, `reference_audio_2` 없이 `reference_audio_1`과 `reference_audio_3`을 연결할 수는 없습니다.

* **최대 오디오 태그**: `"audio reference"` 모드에서는 최대 3개의 참조 클립(@Audio1, @Audio2, @Audio3)을 연결할 수 있으며, 프롬프트의 가장 높은 @AudioN 태그는 연결된 참조 오디오 입력 수를 초과할 수 없습니다.

* **모델 차이점**: `seed-audio-1.0-multilingual` 모델은 20개 언어(영어, 중국어, 일본어, 한국어, 멕시코 스페인어 및 카스티야 스페인어, 인도네시아어, 독일어, 브라질 포르투갈어, 프랑스어, 태국어, 베트남어, 말레이어, 필리핀어, 이탈리아어, 러시아어, 네덜란드어, 폴란드어, 터키어, 스웨덴어)와 `[5.5s:8.0s]` 형식의 타임스탬프를 사용한 문장별 타이밍 제어를 지원합니다. `seed-audio-1.0` 모델은 영어와 중국어만 지원하며 타이밍 제어가 없습니다.

## 출력

| 출력 이름   | 설명                                                                                   | 데이터 타입 |
| ------- | ------------------------------------------------------------------------------------ | ------ |
| `AUDIO` | ByteDance Seed Audio 1.0에서 생성된 오디오 출력으로, 프롬프트에 설명된 음성, 음악, 음향 효과 또는 다중 화자 대화를 포함합니다. | AUDIO  |

> 이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! [GitHub에서 편집](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ByteDanceSeedAudio/ko.md)

***

**Source fingerprint (SHA-256):** `e86e4edde424b4427d864350a9d3b082e271fbd2b1e335175637a9cc3ad51163`
