基于二进制表示和特异性模型的说话人识别及语音信号多重分形特性分析
1. 引言
在说话人识别领域,传统方法存在一定局限性。为了提高识别性能,本文提出了基于二进制表示和特异性模型的新方法,同时对语音信号的多重分形特性进行了研究,旨在为说话人识别提供更有效的技术手段。
2. 二进制表示的获取算法
- 激活高斯分量模型(AGCM)的构建 :该方法通过选择经典通用背景模型(UBM)中在训练特征上至少有一次达到最高似然的分量,构建AGCM。对AGCM中的每个分量,根据训练特征文件的使用次数进行自适应调整,得到一组自适应分量。最后,通过类似的选择过程,从对应集合中获取AGCM各分量内的特异性。
- 生成模型的定义 :将整个AGCM及其特异性称为生成模型,其目标是为每个语音发声获取一个二进制矩阵,该矩阵表示每个声学向量与其特异性组之间的最佳关系。
- 二进制矩阵的获取 :对于每一帧,提取似然得分最高的前“3”个AGCM分量,在这些分量中,获取似然大于给定阈值的特异性。每个发声由一个KxN维的二进制矩阵Bk表示,其中K是特异性的数量,N是信号的声学向量数量。矩阵的每一列对应一个声学向量,反映该向量相对于每个特异性的标记概率,最高似然得分的前百分比标记为“1”(激活分量),其余标记为“0”(未激活)。
graph LR
A[训练UBM] --> B[选择AGCM分量]
B --> C[自适应调整AGCM分量]
超级会员免费看
订阅专栏 解锁全文

130

被折叠的 条评论
为什么被折叠?



