7月20日,阿里巴巴正式发布语音合成大模型Qwen-Audio-3.0-TTS。新模型在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面实现系统性提升,让合成语音从“能说话”走向“会表达”。
Qwen-Audio-3.0-TTS包含双版本:面向实时交互的Flash版本首包延时仅300ms级别,适配智能助手等低延时场景;面向高质量生成的Plus版本则主攻专业创作。在全球第三方权威榜单Artificial Analysis中,Qwen-Audio-3.0-TTS-Plus以Elo 1237分斩获冠军。其预览版Fun-Realtime-TTS也曾在一个月前登顶该榜单。
从“整段情绪”到“单字级”精准控制。 上一代版本已支持freestyle自由风格模式,用户可通过“资深客服”、“足球解说员”等角色设定控制情绪与语速。新模型进一步支持结构化标签,用户可直接在文本中嵌入[gasp](抽气)、[giggles](轻笑)、[angry](愤怒)等标记,将控制精度从整段情绪细化到单字级别。
多语种与方言全面覆盖。 模型覆盖中、英、日、韩、德等16种语言,新增阿拉伯语、越南语、马来语及菲律宾语。根据CV3-Eval多语种基准测试,在16种语言的“词/字错误率”评测中,Qwen-Audio-3.0-TTS家族在10种语言中获得SOTA;在“说话人相似度”评测中,Plus版本包揽全部最优。方言方面,通过专门强化训练,模型覆盖广东、重庆、东北、陕西、上海、四川、云南等20种方言。
音质跃升与强抗噪能力。 音频采样率从24kHz提升至48kHz,达到录音棚及影视配音规格,单次语音合成最长可达3分钟。模型还通过真实声学仿真训练,在克隆流程中嵌入语音增强能力,高噪声、高混响环境下也能精准提取音色。
即日起,两款模型已在阿里云百炼开放调用。配套的开箱即用精品音色库也将陆续上架指令风格音色、20种方言音色及14+小语种音色。

