近期,阿里正式推出国内首个AI语音平台CosyVoice Studio,这套全新的语音技术平台跳出了传统语音产品“只能做语音转文字、文字转语音”的单一功能局限,把深度语义理解能力直接和语音生成、语音交互能力做了全链路融合,给各类语音相关的应用场景带来了更自然、更智能的全新交互体验,也为国内大量有语音开发需求的企业提供了一个能力更强、使用更便捷的一站式AI语音开发载体。
很多日常使用智能语音设备的用户都有过类似的糟心体验:对着智能音箱说一句带点口语化的指令,设备要么完全听不懂你在说什么,要么只能生硬地把语音转成文字,根本理解不了你话里的真实意图;很多AI生成的语音听起来特别机械,字和字之间的衔接很生硬,哪怕调整了语速语调,也完全没有真人说话的自然感,听久了很容易产生违和感。过去很多企业想要做定制化的语音交互产品,要分别对接语音识别、语义理解、语音合成好几个不同的技术平台,不同平台之间的适配调试要花大量时间,最后做出来的产品体验也很难做到流畅统一。
阿里这次推出的CosyVoice Studio,就是针对性解决这些长期存在的语音交互痛点打造的全新平台。它最核心的特点,就是把深度语义理解能力直接融入到了语音能力的全流程里,不再把“听声音、转文字、理解意思、生成语音”拆成几个独立的环节。过去传统的语音交互流程,是先把用户说的话转成文字,再把文字传给语义模型做理解,最后再把处理好的结果转成语音,整个链路长,很容易在转换过程中丢失掉用户语气里的情绪、口语化的隐含意图,而CosyVoice Studio可以直接在语音层面就完成语义理解,连用户说话里的停顿、语气、情绪都能精准捕捉到,真正听懂用户口语化表达里的真实需求。
依托这套全新的技术架构,平台生成的AI语音效果也实现了质的升级。它生成的语音不再是过去那种生硬的机械合成音,而是能精准还原真人说话的自然语气、情绪起伏,甚至可以根据对话的场景自动调整说话的节奏和语气,比如给用户做科普讲解的时候语气平缓清晰,和用户闲聊的时候语气轻松活泼,听上去和真人说话几乎没有明显区别。同时平台还支持快速定制专属的语音音色,企业只用提供少量的真人语音素材,就能快速生成和真人音色几乎一模一样的定制语音,不用像过去那样采集十几个小时的语音数据,大幅降低了定制专属语音的门槛。
对于有语音开发需求的企业来说,CosyVoice Studio还提供了非常完整的一站式开发工具链。企业不用再分别对接多个不同的语音技术服务商,只用在这一个平台上,就能完成语音识别、语义交互、定制语音生成、场景化语音应用部署的全流程开发工作。平台还开放了大量现成的场景化语音能力模板,面向智能客服、有声读物制作、语音直播、智能硬件语音交互这些常见场景,都已经提前做好了适配优化,企业开发者只用做少量的参数调整,就能快速上线自己的语音应用,不用从零开始搭建整套语音技术体系,大幅缩短了产品的开发周期。
作为国内首个把语义理解深度融入语音全链路的AI语音平台,CosyVoice Studio的落地,打破了过去国内AI语音产品长期停留在“转文字、转语音”基础功能的行业现状。它把语音交互的体验从“能听懂文字”升级到了“能听懂人”,让智能语音不再是一个冷冰冰的工具,而是能像真人一样和用户自然流畅地对话。目前这套平台已经正式对外开放使用,后续会快速落地到智能家居、智能汽车、消费电子、内容生产等海量场景里,让更多普通用户都能体验到更自然、更智能的AI语音交互体验,推动整个国内AI语音行业的体验升级。
关注
92文章
44652浏览量
305226免责声明:本文为转载,非本网原创内容,不代表本网观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。
如有疑问请发送邮件至:bangqikeconnect@gmail.com