首包仅300ms!阿里发布Qwen-Audio-3.0-TTS,Plus登顶全球

7月20日,阿里巴巴正式发布语音合成大模型Qwen-Audio-3.0-TTS。新模型在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面实现系统性提升,让合成语音从“能说话”走向“会表达”

Qwen-Audio-3.0-TTS包含双版本:面向实时交互的Flash版本首包延时仅300ms级别,适配智能助手等低延时场景;面向高质量生成的Plus版本则主攻专业创作。在全球第三方权威榜单Artificial Analysis中,Qwen-Audio-3.0-TTS-Plus以Elo 1237分斩获冠军。其预览版Fun-Realtime-TTS也曾在一个月前登顶该榜单

从“整段情绪”到“单字级”精准控制。 上一代版本已支持freestyle自由风格模式,用户可通过“资深客服”、“足球解说员”等角色设定控制情绪与语速。新模型进一步支持结构化标签,用户可直接在文本中嵌入[gasp](抽气)、[giggles](轻笑)、[angry](愤怒)等标记,将控制精度从整段情绪细化到单字级别

首包仅300ms!阿里发布Qwen-Audio-3.0-TTS,Plus登顶全球 - 插图1

多语种与方言全面覆盖。 模型覆盖中、英、日、韩、德等16种语言,新增阿拉伯语、越南语、马来语及菲律宾语。根据CV3-Eval多语种基准测试,在16种语言的“词/字错误率”评测中,Qwen-Audio-3.0-TTS家族在10种语言中获得SOTA;在“说话人相似度”评测中,Plus版本包揽全部最优。方言方面,通过专门强化训练,模型覆盖广东、重庆、东北、陕西、上海、四川、云南等20种方言

音质跃升与强抗噪能力。 音频采样率从24kHz提升至48kHz,达到录音棚及影视配音规格,单次语音合成最长可达3分钟。模型还通过真实声学仿真训练,在克隆流程中嵌入语音增强能力,高噪声、高混响环境下也能精准提取音色

即日起,两款模型已在阿里云百炼开放调用。配套的开箱即用精品音色库也将陆续上架指令风格音色、20种方言音色及14+小语种音色

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧