Seed Audio 1.0 擅长什么
- 多模态音频生成:通过一条提示词生成语音、音乐、音效和环境音频。描述你听到的声音,Seed Audio 即可生成。
- 语音克隆:从最多 3 个参考片段克隆语音(在提示词中标记为
@Audio1、@Audio2、@Audio3),用于多角色对话或一致的旁白。 - 预设语音:无需参考片段,即可从内置 TTS 2.0 语音中选择,获得可靠、高质量的旁白。
- 图像驱动语音:从角色图像中提取语音,使语气和风格与视觉主体相匹配。
- 精细控制:独立调整每次生成的语速、音高、响度和采样率。
- 多说话人对话:在提示词中直接命名角色,Seed Audio 会自动处理声音分配、轮流发言和情感表达。
- 单次最长 2 分钟:生成适合旁白、播客片段、视频配音和声音设计的较长音频片段。
在 ComfyUI 中使用
Seed Audio 1.0 工作流
在 ComfyUI 中运行文生音频、语音克隆和图像驱动音频工作流,可在本地或 Comfy Cloud 上运行。