做说话人分离的AI工具,在影视配音、在线课程等任务里用得最多,把零散流程串成一条线,日常使用集中在视频创作者、开发者这类人群,新手也能照模板跑通,围绕说话人分离,模型能直接完成人声分离、文本朗读、多音色,省去大量手工操作,业界也用文本转语音、音频处理来描述同类能力,检索时常混着出现。
高准确率的语音转文字模型,支持近百种语言、说话人分离与词级时间戳。