文章核心总结与创新点
一、主要内容
本文聚焦多语言大型语言模型(LLMs)中的标注偏差问题,系统分析了偏差的来源、影响、检测方法及缓解策略,核心内容如下:
- 问题背景:多语言LLMs的性能依赖人工标注数据集,但标注过程中存在的偏差(如任务框架、标注者主观性、文化差异)会导致模型输出失真,加剧社会危害(如对少数群体语言的误分类)。
- 偏差分类:提出三类标注偏差类型——
- 指令偏差:源于标注任务设计(如提示词措辞、标注指南、界面设计)中的隐含假设;
- 标注者偏差:来自标注者的个人倾向、认知启发式、人口统计学特征等;
- 语境与文化偏差:因语言规范、文化世界观差异及多模态线索解读不同导致。
- 影响分析:标注偏差会通过“输入有偏,输出有偏”(Bias in, Bias out)效应传递给模型,造成不同群体间的性能差异(如深色皮肤女性的性别分类错误率更高)和表征伤害(如强化性别职业刻板印象)。
- 检测方法:综述了标注偏差的检测技术,包括标注者间一致性(Cohen’s κ、Fleiss’ κ等)、模型分歧分析、元数据分析(如人口统计学差距计算)、多语言分歧分析等。
- 缓解策略:提出主动缓解(如招募多样化标注者、迭代优化标注指南)和被动缓解(如事后模型调整、语境去偏、多目标加权集成学习)两类策略,并扩展弱集成学习(WEL)
订阅专栏 解锁全文

258

被折叠的 条评论
为什么被折叠?



