面向语音API场景的AI工具,业界也用声音克隆、人声分离来描述同类能力,检索时常混着出现,围绕语音API,模型能直接完成配音、人声分离、文本朗读,省去大量手工操作,日常使用集中在视频创作者、开发者这类人群,新手也能照模板跑通,在有声书、直播等任务里用得最多,把零散流程串成一条线。
Azure 云端的 AI 语音服务,提供语音识别、语音合成、翻译与自定义声音模型能力。