


智东西
作者 | 杨京丽
编辑 | 李水青
智东西7月20日报道,今天,千问大模型发布语音合成大模型Qwen-Audio-3.0-TTS,包含面向实时交互的Flash版本(首包延时300ms级别)和面向高质量生成的Plus版本。
模型在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面实现系统性提升。目前,Qwen-Audio-3.0-TTS-Plus在第三方评测机构Artificial Analysis的Speech Arena语音合成榜单中居于第一,Elo得分为1237。
▲Qwen-Audio-3.0-TTS-Plus在语音合成榜单中排名第一(图源:Artificial Analysis)
阿里还将陆续上线指令风格音色、20种方言音色、细粒度控制音色及14种以上小语种音色,供开发者直接调用。在输出规格方面,Qwen-Audio-3.0-TTS将音频采样率从24kHz提高至48kHz,单次语音合成最长可达3分钟。
目前,Qwen-Audio-3.0-TTS-Plus和Flash版本均已在阿里云百炼开放。
Qwen-Audio-3.0-TTS-Plus:
https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/qwen-audio-3.0-tts-plus?serviceSite=asia-pacific-china
Qwen-Audio-3.0-TTS-Flash:
https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/qwen-audio-3.0-tts-flash?serviceSite=asia-pacific-china
一、文本里插入标签,模型可调节语气、情绪、呼吸等
细粒度标签控制是Qwen-Audio-3.0-TTS此次升级的重点之一。用户可以在文本中直接插入结构化标签,嵌入[gasp](抽气)、[giggles](轻笑)、[angry](愤怒)等这类标记,可以调节语气、情绪和呼吸等细节。
官方也给出了相关的案例,在一段飞船事故相关台词前加入[angry]标签后,模型会以愤怒语气合成后续内容。
合成文本:[angry]你们竟然私自切断了主控系统的能源!知不知道防护罩一旦失效,整艘飞船的人都会化为灰烬?这就是你们所谓的‘为了大局’吗!简直是不可理喻!
参考音频:
合成音频:
根据文本提示,模型在生成的音频中加入了愤怒的语气,角色的质问感和紧迫感随台词逐步增强。
此外,用户也可以通过输入指令,要求模型在说话过程中笑出声。
指令:说到一半忍不住扑哧笑出声
合成文本:你说的这个事啊,我都听过好几遍了,扑哧——还是觉得好笑。
合成音频:
二、自由指令控制,可直接用自然语言描述
除结构化标签外,Qwen-Audio-3.0-TTS还支持Free-style自然语言指令控制。用户可以直接用自然语言描述角色、情绪、场景和语速,不需要单独调整专业音频参数。
官方给出了下面这几个案例:
指令:你是一位年轻女性小学老师,正在课堂上耐心地给一年级学生复述拼音规则。语速很慢,每一个发音都示范一遍,语调上扬带笑意。
合成文本:我们再来读一次,j、q、x这三个声母后面如果跟着u,那个u上的两点要去掉。你跟老师一起读,j——u——ju。
参考音频:
合成音频:
模型会按照这段指令合成对应的课堂讲解录音。类似方式也可以用于旁白、角色配音、有声内容和语音助手等场景。
指令:你是悬疑剧旁白,屏住呼吸把紧张感一层层叠上去。
合成文本:那天夜里下着大雨,林晚一个人坐在书房里。窗外的雷声一阵接一阵,灯光忽明忽暗。她忽然听见楼下传来了脚步声——缓慢、沉重,像是有人在故意压低声响。她屏住呼吸,手指紧紧抓住椅子的扶手。脚步声越来越近,最终停在了书房门口。门把手轻轻地,转动了一下。
合成音频:
从合成效果来看,旁白语速较为急促,营造出明显的紧张感,让人仿佛置身故事场景之中。如果有声小说采用这种能够随情节调整节奏和情绪的配音,听众的沉浸感和代入感也会更强。
三、覆盖16种语言,10种语言字词错误率最低
Qwen-Audio-3.0-TTS-Plus覆盖中文、英语、日语、韩语、德语等16种语言,新增了阿拉伯语、越南语、马来语和菲律宾语。
根据官方公布的CV3-Eval多语种测试结果,目前,Qwen-Audio-3.0-TTS在16种语言的词或字错误率评测中,Qwen-Audio-3.0-TTS系列在10种语言中排名第一,其中韩语和马来语的领先幅度较大。
在16种语言的说话人相似度评测中,Qwen-Audio-3.0-TTS-Plus取得全部16项最优成绩,Flash版本取得其中15项第二。马来语、西班牙语和阿拉伯语的提升较为明显。
四、支持20种中文方言,强化韵律和声调训练
中文方言方面,Qwen-Audio-3.0-TTS目前支持广东话、重庆话、东北话、陕西话、上海话、四川话和云南话等20种方言。千问称,新模型使用了更多方言数据,并增加了方言强化训练阶段,让模型在韵律、声调与口语表达上接近母语者,减少通用语音强化学习过程中可能出现的方言特征减弱问题。
用户可以通过自然语言指令指定输出方言。例如,输入“输出上海话”,模型即可根据后续文本合成上海话语音。
指令:
输出上海话:屋里向装修真个是烦人,天天敲墙壁,声音响得来!灰尘落得一塌糊涂,真想快点弄清爽。
合成音频:
五、噪声和混响环境下,仍具备较强声音复刻能力
声音复刻通常需要使用较为清晰的参考录音,但实际获得的音频中可能包含背景噪声或混响。
Qwen-Audio-3.0-TTS加入了真实声学环境仿真训练,将语音增强能力用于声音复刻流程。官方称,在参考音频存在较高噪声或混响的情况下,模型可以过滤部分环境干扰,并提取说话人的音色。
合成文本:听到这首歌的时候,突然想起很多年前的夏天。
参考音频:
合成音频:
结语:语音合成增强语气、情绪等控制能力
从此次升级来看,Qwen-Audio-3.0-TTS提高了对于语气、情绪、呼吸和角色风格的控制能力。结构化标签适合调节具体位置的表达效果,自然语言指令则能对角色、场景和语速进行整体描述,多语种、方言及复杂声学环境下的声音复刻能力也得到扩展。
随着Plus和Flash版本在阿里云百炼开放,这些能力将进入更多实际应用场景,为旁白、角色配音、有声内容和语音助手提供更多配音方案。
“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”