首页
学习
活动
专区
圈层
工具
发布

千问发布语音合成大模型Qwen-Audio-3.0-TTS Flash版首包延时300ms

观点网讯:7月20日,千问正式发布语音合成大模型Qwen-Audio-3.0-TTS。

该模型包含面向实时交互的Flash版本和面向高质量生成的Plus版本,并支持Free-style自然语言指令控制。

其中,Flash版本首包延时达到300ms级别,以满足实时交互场景的低延迟需求。

新模型在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面实现系统性提升。

免责声明:本文内容与数据由观点根据公开信息整理,不构成投资建议,使用前请核实。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OSS6Le33eiRIIY8D37eqnGnQ0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。
领券