输入
参数约束
-
参考模式依赖关系:
reference_mode参数决定需要哪些其他输入:- “text only”:不需要其他输入。提示词中不得包含 @AudioN 标签。
- “audio reference”:要求至少连接
reference_audio_1、reference_audio_2或reference_audio_3中的一个。参考片段必须按顺序连接且不能有间隔。每个片段最长 30 秒。如果提示词中使用了 @AudioN 标签,则最高标签编号不得超过已连接参考片段的数量。 - “image reference”:要求连接
reference_image。不使用 @AudioN 标签;提示词应仅包含要合成的文本。 - “preset voice”:要求选择预设音色。整个提示词将使用所选音色朗读;@AudioN 标签不会用作参考,@Audio2 或更高标签会被拒绝。
-
音频参考顺序:在 “audio reference” 模式下,参考音频输入必须从
reference_audio_1开始按顺序连接,不能有间隔。例如,可以连接reference_audio_1和reference_audio_2,但不能在没有reference_audio_2的情况下连接reference_audio_1和reference_audio_3。 - 最大音频标签数:在 “audio reference” 模式下,最多可连接 3 个参考片段(@Audio1、@Audio2、@Audio3),提示词中最高的 @AudioN 标签不能超过已连接参考音频输入的数量。
-
模型差异:
seed-audio-1.0-multilingual模型支持 20 种语言(英语、中文、日语、韩语、墨西哥西班牙语和卡斯蒂利亚西班牙语、印度尼西亚语、德语、巴西葡萄牙语、法语、泰语、越南语、马来语、菲律宾语、意大利语、俄语、荷兰语、波兰语、土耳其语、瑞典语),并支持使用[5.5s:8.0s]格式的时间戳进行逐句时序控制。seed-audio-1.0模型仅支持英语和中文,不支持时序控制。
输出
本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑
Source fingerprint (SHA-256):
e86e4edde424b4427d864350a9d3b082e271fbd2b1e335175637a9cc3ad51163