36、语音与歌曲分类:基于多分辨率音高分析的研究

语音与歌曲分类:基于多分辨率音高分析的研究

1. 语音与歌曲的子类别硬分类

在语音和歌曲之间创建一组类别,并要求将每个新的音频片段分配到其中一个类别。这种硬分类方法避免了连续分类所需的额外计算,同时承认了语音和歌曲之间可能存在的各种发声范围。通过使用被明确归类为说话或唱歌(不涉及另一类别的成员)的音频文件来开发特征,然后在类似的文件上评估这些特征,以确定它们是否能够进行硬分类。之后,将这些特征应用于具有部分双重类别的音频片段,如诗歌朗诵或吟唱,并将结果与人类对类别成员的评估进行比较。

2. 音频数据语料库

在特定领域的音频研究中,理想的做法是找到先前收集且其他研究人员正在使用的数据集,这为研究提供了起点和可比较结果的同行群体。然而,对于语音和歌曲之间的中间发声这种数据领域,目前可能不存在这样的语料库。现有的语料库大多仅包含说话音频,或有一些包含歌曲片段,但尚未发现包含说话和唱歌之间中间片段,或同一人说话和唱歌同一短语的语料库,而这些对于语音/歌曲研究具有重要价值。

本语料库主要是单语种的,也包含少量其他语言的音频。未来可能会收集更大的多语种语料库,以将当前的研究和结果扩展到其他语言。语料库中 90.3%(756 个文件)是英语发声,其余 82 个文件包含法语、意大利语、瑞典语、盖尔语、日语、普通话、罗马尼亚语、匈牙利语、德语、拉丁语、易洛魁语、孟高棉语和祖尼语等。有些片段没有语言,如吹口哨或哼唱。这些片段从现有媒体中提取,也通过向 50 名受试者提供一组旨在产生语音、歌曲和中间发声的提示来收集。

下面是语料库的语言分布表格:
|语言|文件数量|
| ---- | ---- |
|英语|756|
|

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值