解锁 AI 潜力:自定义语音模型与低代码机器学习应用
1. 自定义语音模型
语音识别面临诸多挑战,人们说话方式多样,包括语音风格、韵律、口音和词汇的差异。特定领域可能有不常见的术语,或者需要识别易与日常词汇混淆的产品名称。此外,录音环境也会带来额外挑战,如免下车餐厅的背景噪音、商场的声学环境或大楼大堂接待处的声音,都与对着手机说话的情况大不相同。为应对这些问题,我们可以构建自定义语音模型。
1.1 定制服务
可以使用无代码的语音工作室(Speech Studio)可视化环境来定制自定义语音、自定义命令(用于语音控制应用程序)和自定义语音(用于文本转语音)服务,然后在应用程序中使用语音 SDK、语音 CLI 或 REST API 调用这些服务。
1.2 添加声学模型
为了适应准确识别至关重要的各种复杂环境,如车辆、工厂车间或野外,可以添加声学模型。如果在可预测的嘈杂环境中使用语音识别,如在汽车中或使用特定设备处理声音时,添加自定义声学模型是必要的,并且可能希望在容器中本地运行这些模型。
1.3 训练模型
- 文本训练 :可以上传包含特定领域行话、技术术语和其他可能无法正确识别的短语的音频文件或文本。文本训练速度更快,只需几个小时而非几天,因此可以先尝试文本训练,查看是否能满足识别需求。最多可提供 1.5GB 的原始文本数据,为获得最佳效果,应包含在不同句子和上下文中使用特定词汇的文本。
- 音频训练 :需要五个或更多在代码识别语音的相同条件下录制的音频文件,即人们在计划使用的环境中或对着
超级会员免费看
订阅专栏 解锁全文

1233

被折叠的 条评论
为什么被折叠?



