文章主要内容和创新点
主要内容
本文聚焦于将大型语言模型(LLMs)集成到自动语音识别(ASR)系统中,解决传统ASR中语言模型(LM)与声学模型(AM)集成的挑战。传统ASR由声学模型(将音频转换为语言单位概率)、语言模型(评估词序列合理性)和解码机制(整合两者输出)组成,而LLMs虽在语言理解上表现优异,但难以直接融入ASR。
作者通过分解“给定音频信号的词序列最大后验概率(MAP)估计器”,提出了一种迭代解码方法:在每一步中,基于已预测的token序列作为提示,从LLM中采样候选token;通过声学模型将候选token与音频信号对齐并打分;结合LLM和声学模型的分数筛选最优候选,更新beam并用于下一步迭代,直至完成解码。
该方法为零样本方式(无需额外训练),允许AM和LLM独立训练与改进。实验在ALLSSTAR(短简单句)、WSJ0(新闻朗读语料)、TEDLIUM 3(专业演讲语料)三个数据集上验证,使用wav2vec 2.0、HuBERT作为声学模型,GPT-2、LLaMA 2、Falcon作为LLM,结果显示其在复杂句子、缩写和领域特定词汇的识别上表现突出。
创新点
- 新型集成框架:通过分解MAP估计器,提出迭代解码过程,实现LLM与声学模型的分离式集成,两者可独立训练,无需联合优化。
- 零样本解码:无需对LLM或声学模型进行额外微调,直接利用预训练模型,降低部署成本。
- 针对性优化:在处理复杂语音(如长句)、缩
订阅专栏 解锁全文

433

被折叠的 条评论
为什么被折叠?



