马来语情感词典的构建与评估
1. 相关工作
在情感分析领域,早期存在一些人工编译的情感词典,但由于其在时间和精力上成本较高,近年来大量研究集中在自动生成情感词典上。主要有两种方法:
- 基于词典的方法 :利用数字词典和词汇资源(如WordNet)自动为术语分配相应的语义倾向,通常生成通用的、与领域无关的词典。
- 基于语料库的方法 :使用预定义的种子词,利用文本语料库中的共现统计或句法模式。如果使用所需领域的语料库,该方法可以生成特定领域的词典。
然而,目前大多数情感分析研究主要针对英语。将为英语构建的现成词典生成算法应用于马来语等外语较为困难,因为外语可用资源匮乏。此外,自动翻译现有的英语情感词典也存在问题,例如多义词在翻译后可能会改变情感极性。
在马来语情感分析方面,近年来在工业和学术界都取得了快速进展,包括使用知识库方法结合监督分类器进行情感分类、构建特定方言的词典等。但专门针对马来语自动生成情感词典的研究仍然较少。
2. 提出的情感词典归纳模型
为了在资源有限的情况下,以最少的人工干预提取主观的、带有情感的术语,提出了一种最小监督的情感词典归纳模型,该模型主要包括以下三个步骤:
graph LR
A[输入初始正负术语] --> B[生成同义词链]
B --> C[挖掘词典注释信息]
C --> D[合并结果]
- 步骤1:使用预定义的种子词从词图
超级会员免费看
订阅专栏 解锁全文


被折叠的 条评论
为什么被折叠?



