Skip to main content
使用 ByteDance Seed Audio 1.0,通过单个提示词生成语音、音乐、音效和多说话人对话。在提示词中描述声音、情感、氛围、背景音乐和音效,并包含要朗读的台词。可选择内置预设音色,从最多 3 个参考音频片段克隆音色(在提示词中标记为 @Audio1-3),或从角色图像派生音色。每次运行最多生成 2 分钟音频。多语言模型支持 20 种语言以及基于时间戳的时序控制。

输入

参数约束

  • 参考模式依赖关系reference_mode 参数决定需要哪些其他输入:
    • “text only”:不需要其他输入。提示词中不得包含 @AudioN 标签。
    • “audio reference”:要求至少连接 reference_audio_1reference_audio_2reference_audio_3 中的一个。参考片段必须按顺序连接且不能有间隔。每个片段最长 30 秒。如果提示词中使用了 @AudioN 标签,则最高标签编号不得超过已连接参考片段的数量。
    • “image reference”:要求连接 reference_image。不使用 @AudioN 标签;提示词应仅包含要合成的文本。
    • “preset voice”:要求选择预设音色。整个提示词将使用所选音色朗读;@AudioN 标签不会用作参考,@Audio2 或更高标签会被拒绝。
  • 音频参考顺序:在 “audio reference” 模式下,参考音频输入必须从 reference_audio_1 开始按顺序连接,不能有间隔。例如,可以连接 reference_audio_1reference_audio_2,但不能在没有 reference_audio_2 的情况下连接 reference_audio_1reference_audio_3
  • 最大音频标签数:在 “audio reference” 模式下,最多可连接 3 个参考片段(@Audio1、@Audio2、@Audio3),提示词中最高的 @AudioN 标签不能超过已连接参考音频输入的数量。
  • 模型差异seed-audio-1.0-multilingual 模型支持 20 种语言(英语、中文、日语、韩语、墨西哥西班牙语和卡斯蒂利亚西班牙语、印度尼西亚语、德语、巴西葡萄牙语、法语、泰语、越南语、马来语、菲律宾语、意大利语、俄语、荷兰语、波兰语、土耳其语、瑞典语),并支持使用 [5.5s:8.0s] 格式的时间戳进行逐句时序控制。seed-audio-1.0 模型仅支持英语和中文,不支持时序控制。

输出

本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑

Source fingerprint (SHA-256): e86e4edde424b4427d864350a9d3b082e271fbd2b1e335175637a9cc3ad51163