(资料图片)
7月20日消息,阿里千问正式发布语音合成大模型Qwen-Audio-3.0-TTS。新模型包含面向实时交互的Flash版本(首包延时300ms级别)和面向高质量生成的Plus版本。
据了解,新模型在细粒度标签控制、freestyle 指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面实现系统性提升,让合成语音从“能说话”走向“会表达”。
此外,该模型支持在文本中嵌入结构化标签,可对语气、情绪进行精准调控。并配备精品音色库,单次语音合成可达3分钟,覆盖16种语言以及20种方言。
内容搜集整理于网络,不代表本站同意文章中的说法或者描述。文中陈述文字和内容未经本站证实,其全部或者部分内容、文字的真实性、完整性、及时性本站不做任何保证或者承诺,并且本站对内容资料不承担任何法律责任,请读者自行甄别。如因文章内容、版权和其他问题侵犯了您的合法权益请联系邮箱:5 146 761 13 @qq.com 进行删除处理,谢谢合作!