产品简介
语音合成系列产品致力于将文本转化为超拟人化的语音,从而打通人机交互的闭环。该系统基于业界领先技术构建,具备合成速度快、语音自然流畅等特点。通过提供丰富的平台音色选择以及支持用户自定义音色,产品能够满足多样化的声音需求。新一代合成产品在拟人度和情感力上均有显著提升,能够模拟多种情感和语气,为用户带来更具吸引力和沉浸感的交互体验。
核心功能
语音合成提供多场景、多语言的优质音色选择,广泛适用于智能客服、人机交互、有声阅读、新闻播报等业务场景。除了基础合成功能外,产品还包含声音复刻和音色变换两大特色能力。声音复刻提供快速、批量、自动化的定制音色服务;音色变换则提供超低延时、高自然度的实时音色变换服务,可应用于智能客服、虚拟人及直播等场景。
特色能力与技术优势
产品具备高拟真度,合成语音能够符合多样的应用场景,让设备和应用轻松发声。在灵活性方面,支持中文、英文、粤语、四川话等多种语言,并支持中英混读语音合成。用户可根据业务需求选择合适的音量、语速等属性,并支持离线音频文件和实时音频流两种合成格式。此外,新上线的超自然大模型音色明显提升了拟人度和情感力,而一句话版声音复刻仅需5-15秒的训练音频即可快速完成超拟人的音色复刻。
适用场景
- 机器人发声:在客服机器人、服务机器人等场景中,与语音识别、自然语言处理等模块联动,实现高品质的机器人发声,使人机交互更流畅自然。
- 有声读物制作:适用于小说朗读等场景,提供多种男声、女声选择,覆盖多样化的应用场景。
- 语音播报:适用于消息播报、新闻播报等场景,确保信息传达清晰、专业。
- 其他场景:包括数智人、语音社交、咨询播报、短视频制作等。
使用建议
为了获得最佳的合成效果,建议用户根据具体业务场景选择合适的音色和语言类型。对于需要高度个性化声音的场景,可以使用声音复刻功能,仅需少量训练音频即可定制专属音色。在开发过程中,可利用SSML标记语言自定义合成音频的效果,例如新增支持的audio标签,以增强语音的表现力。同时,注意区分基础语音合成和实时语音合成的适用场景,以确保系统性能与用户体验的平衡。
计费模式
语音合成提供预付费和后付费两种计费模式。预付费支持购买付费资源包,调用量的扣费顺序遵循“免费资源包>付费资源包>后付费”的原则。用户可根据实际调用量选择合适的计费方式,以优化成本结构。具体定价详情可参考官方购买指南。
常见问题
语音合成如何收费?
语音合成有预付费和后付费两种计费模式。预付费支持购买付费资源包,调用量的扣费顺序为:免费资源包优先扣除,其次是付费资源包,最后才是后付费。更多详细计费规则请查阅购买指南。
语音合成支持哪些语言?
语音合成支持中文、英文、粤语、四川话等多种语言,并且支持合成中英混读语音,能够满足不同地区和不同业务场景的语言需求。
基础语音合成和实时语音合成有什么区别?
基础语音合成通常用于生成离线音频文件,适合对实时性要求不高的场景,如有声书制作;而实时语音合成则提供低延时的音频流输出,适合需要即时反馈的场景,如智能客服对话或实时导航播报。
