返回列表 发布新帖
查看: 15|回复: 0

[人工智能] 字节发布Seed Audio 1.0 音频创作模型

发表于 昨天 15:08 | 查看全部 |阅读模式

这里或许是互联网从业者的最后一片净土,随客社区期待您的加入!

您需要 登录 才可以下载或查看,没有账号?立即注册

×
7月20日消息,今日,字节跳动Seed官方今发布了音频创作模型Seed Audio 1.0。

据介绍,该模型面向完整声音场景,在统一框架下联合建模人声、音效和环境声等多种音频要素,端到端完成影视级音频创作。声音不再只是画面的补充,而是可以直接参与叙事,在听者脑海中直接形成画面感,做到“听见”即“看见”。

其核心能力主要体现在以下方面:

多要素统一编排,支持精细的时间控制:一条 prompt 即可统一编排带有特定情绪的对白、关键音效和环境声,并可按时间线精准控制声音进场。

音色风格可控,长时稳定:支持文本与参考音频输入,在长音频和多次延长场景下保持角色一致性,同一音色也能自然呈现不同语气和情绪。

多语种自然生成:支持 20+ 语种的音频生成,同一角色声音可依据不同语种的特点,呈现更自然的发音、节奏与表达方式。

在文本生成音色能力上,Seed Audio 1.0 在 AB 主观评测中表现出显著优势,可用率和优良率也明显提升。

7E42ED8C-A45E-4560-858D-2A0509108143.png

在多场景音频生成能力上,我们进一步评测了影视、电视节目、短剧、动漫、播客对话、直播带货、网络创作、话剧和语音合成等场景。结果显示,多数场景中的音频可用率已达到 90% 以上。

68996C83-C5A4-4f9d-B38B-7E4D1650872.png

在音频自然度上,大部分语言的 MOS 超过 4 分,音质已达到优秀水准;在复杂音频生成的指令遵循上,除越南语外,其余语言的 MOS 均高于 3.5 分,表明 Seed Audio 1.0 已具备较强的多语言指令遵循能力。

5D3AD3D3-E621-4515-A857-1997FE1073.png

目前,Seed Audio 1.0 已在火山方舟体验中心上线,欢迎大家体验,用声音表达创意。
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Copyright © 2001-2026 Suike Tech All Rights Reserved. 随客交流社区 (备案号:津ICP备19010126号) |Processed in 0.127049 second(s), 8 queries , Gzip On, MemCached On.
关灯 在本版发帖返回顶部
快速回复 返回顶部 返回列表