据 Woofun AI 消息,字节跳动正式发布 Seed Audio 1.0 音频生成模型。该模型支持通过文本或参考音频输入,单次生成约 2 分钟内容,并实现对话、音效及环境音的同步生成,时间控制精度达 100 毫秒。在延长生成时长时,模型能保持角色声音一致性,支持 20 多种语言的语音转换、音调及情绪调整。官方测试显示,多数场景下音频可用性率超过 90%,自然度 MOS 评分普遍高于 4 分。目前该模型已在 Volcano Ark 体验中心上线,并向开发者开放 API 接口。