Guiding an Automatic Speech Recognition Decoder Using Large Language Models

文章主要内容和创新点

主要内容

本文聚焦于将大型语言模型(LLMs)集成到自动语音识别(ASR)系统中,解决传统ASR中语言模型(LM)与声学模型(AM)集成的挑战。传统ASR由声学模型(将音频转换为语言单位概率)、语言模型(评估词序列合理性)和解码机制(整合两者输出)组成,而LLMs虽在语言理解上表现优异,但难以直接融入ASR。

作者通过分解“给定音频信号的词序列最大后验概率(MAP)估计器”,提出了一种迭代解码方法:在每一步中,基于已预测的token序列作为提示,从LLM中采样候选token;通过声学模型将候选token与音频信号对齐并打分;结合LLM和声学模型的分数筛选最优候选,更新beam并用于下一步迭代,直至完成解码。

该方法为零样本方式(无需额外训练),允许AM和LLM独立训练与改进。实验在ALLSSTAR(短简单句)、WSJ0(新闻朗读语料)、TEDLIUM 3(专业演讲语料)三个数据集上验证,使用wav2vec 2.0、HuBERT作为声学模型,GPT-2、LLaMA 2、Falcon作为LLM,结果显示其在复杂句子、缩写和领域特定词汇的识别上表现突出。

创新点
  1. 新型集成框架:通过分解MAP估计器,提出迭代解码过程,实现LLM与声学模型的分离式集成,两者可独立训练,无需联合优化。
  2. 零样本解码:无需对LLM或声学模型进行额外微调,直接利用预训练模型,降低部署成本。
  3. 针对性优化:在处理复杂语音(如长句)、缩
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

UnknownBody

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值