阿里发布 Qwen-Audio-3.0-TTS:把情绪与声音动作写进合成文本

阿里发布 Qwen-Audio-3.0-TTS,提供面向实时交互的 Flash 和面向高质量生成的 Plus 两个版本。新模型覆盖 16 种语言、20 种中文方言,并把情绪、笑声、呼吸等细节控制下沉到文本标签。

录音棚麦克风前的彩色情绪声波展示 Qwen-Audio-3.0-TTS 语音表达能力
阿里巴巴 Qwen-Audio-3.0-TTS 通义千问 语音合成 AI 配音 语音克隆

阿里巴巴在 2026 年 7 月 20 日公开发布语音合成大模型 Qwen-Audio-3.0-TTS。它提供 Flash 和 Plus 两个版本:Flash 面向语音助手、互动角色等低延迟场景,Plus 面向配音、有声内容等质量优先的生产任务。两款模型已经可以通过阿里云百炼调用。

这次升级最鲜明的变化,是开发者可以在合成文本中直接插入 [gasp][giggles][angry] 等结构化标签,让模型在指定位置表现吸气、轻笑或愤怒。配合自然语言指令,声音的角色、场景、情绪和语速可以先整体设定,再逐句调整细节。

Flash 和 Plus 对应两种生产选择

qwen-audio-3.0-tts-flashqwen-audio-3.0-tts-plus 没有被包装成单纯的大小型号,而是对应两类明确需求。

版本

主要方向

更适合的任务

Flash

低延迟、实时交互

语音助手、数字人对话、游戏 NPC、在线客服

Plus

高质量、表现力优先

有声书、剧情配音、广告旁白、专业内容制作

公开报道将 Flash 的首包延迟概括为 300 毫秒级;阿里云较新的模型上新文档则写为低于 200 毫秒。测试环境、接口模式和统计口径可能影响结果,接入时应以实际区域、网络和调用方式进行端到端测量,而不宜把单个宣传数字直接当成产品延迟。

Plus 的外部评价也提供了一项参考。Artificial Analysis 的 Speech Arena 当前收录了 Qwen-Audio-3.0-TTS-Plus,页面显示其 Elo 约为 1236,并在已获得足够投票、公开展示的模型中处于领先位置。这个榜单来自用户偏好比较,可以帮助团队初筛模型,但无法替代对中文发音、指定音色和业务脚本的定向测试。

从整段提示词走向句内可控

过去一批指令式 TTS 已经能接受“像足球解说员一样激动”或“用温柔、缓慢的语气讲述”这类描述。Qwen-Audio-3.0-TTS 保留这种自由风格控制,又增加了可以直接写入文本的情绪与富语言标签。

两种控制方式解决的问题不同:

  • 自然语言指令负责整段声音的基调,包括角色、情绪、场景、语速和音色特征。
  • 结构化标签负责具体位置的表现,例如从一句平静叙述切换到愤怒,或在某个词后加入轻笑、叹息和吸气。

这会减少配音制作中的反复试生成。内容团队可以保留一份可读、可版本管理的“表演脚本”,把关键声音动作和台词放在同一段文本里。游戏对白、广播剧和短视频旁白尤其容易受益,因为这些内容通常需要同一角色在几句话内连续改变情绪。

阿里云文档同时给出了使用边界:Qwen-Audio-TTS 的情绪与富语言标签目前只支持单向流式模式。团队在设计交互方式前,应先确认所用 API 模式、系统音色和复刻音色分别支持哪些参数,避免把演示能力等同于所有接口组合都可用。

多语言、方言和复杂录音是另外三项升级

新模型覆盖中文、英文、日语、韩语和德语等 16 种语言,并新增阿拉伯语、越南语、马来语和菲律宾语。官方披露的 CV3-Eval 结果显示,该系列在 16 种语言的词错误率或字错误率评测中,有 10 种取得最佳结果;Plus 在 16 种语言的说话人相似度评测中均取得最优结果。

中文方言覆盖达到 20 种,包括广东、重庆、东北、陕西、上海、四川和云南等地区口音。阿里团队为方言加入了强化训练,重点保持声调、韵律和口语表达,降低合成结果向普通话腔滑移的问题。

语音克隆对参考录音的要求也有所放宽。模型通过真实声学环境仿真训练,把语音增强能力加入复刻过程,在噪声和混响较强的参考音频中分离干扰并保留音色。对无法重新录制干净样本的旧节目、采访和个人素材,这项能力有实际价值,不过声音相似度与噪声强度之间仍需逐条测试。

输出规格方面,公开发布材料提到采样率由 24kHz 提升至 48kHz,单次语音合成最长可达 3 分钟。48kHz 对后期混音和视频配音更友好,但部分能力可能按区域或控制台批次开放,生产接入应以当前账号实际返回的格式和限制为准。

小团队可以先测三类真实任务

对独立开发者和内容团队,最有效的评估方法不是比较一组通用试听,而是拿已有脚本做盲测。

  1. 高情绪密度的短内容。 选择一段同时包含平静、停顿、笑声和情绪转折的 30 至 60 秒脚本,观察标签是否稳定落在目标位置,连续生成时节奏是否漂移。
  2. 实时对话。 用 Flash 跑完整链路,记录文本提交到首段音频播放的延迟,并检查长句切分、打断和网络抖动下的听感。模型侧首包延迟只是整条链路的一部分。
  3. 固定角色的批量生产。 用 Plus 或适用的复刻方案生成多段旁白,比较跨段音色一致性、专有名词发音和后期需要人工修正的次数。

如果内容需要多语言分发,还应让母语使用者分别评估发音和语气。平均榜单成绩很难暴露品牌名、人名、地名和中外文混读中的具体问题。方言测试同样要覆盖目标地区的真实听众,不能只由普通话使用者判断“像不像”。

接入前仍要确认的限制

官方文档已经列出两个模型的实时与非实时调用方式、系统音色、指令控制和声音复刻接口,但部分功能并不对所有模型或音色开放。例如,Plus 更侧重内置精品音色,声音复刻的推荐路径主要落在 Flash;字级时间戳、发音热修复等参数对这两个模型也存在不支持的情况。

价格、区域、配额和具体音色列表会直接影响产品设计,却比模型能力更容易变化。正式选型前应在百炼控制台重新确认当前计费和账号权限,并为以下内容留出人工审核:

  • 人名、品牌名、数字和中外文混读的准确性;
  • 复刻音色的授权、告知与使用范围;
  • 情绪标签在长文本切分后的持续效果;
  • 合成音频所需的 AI 标识与发布平台规则。

Qwen-Audio-3.0-TTS 把声音表演的一部分控制权变成了文本接口,这对开发者比单纯提高音质更容易落进产品。下一步最值得观察的是细粒度标签在长内容和实时场景中的稳定性,以及 48kHz、方言音色和更多高级参数在不同区域的实际开放进度。