From Facts to Folklore: Evaluating Large Language Models on Bengali Cultural Knowledge

文章核心总结与创新点

一、主要内容

  1. 研究背景:孟加拉语是全球第七大语言(超2.5亿使用者),但属于低资源语言,在计算资源和语言工具方面代表性不足,现有大型语言模型(LLMs)在孟加拉语文化相关任务中的表现尚不明确,且存在西方文化偏向。
  2. 数据集构建:提出BLanCK(Bengali Language Cultural Knowledge)数据集,包含5265个源自维基百科的术语,涵盖16个语义类别,分为文化类(44.39%,如事件、宗教、美食等)、非文化类(42.6%,如政治、地点、健康等)和杂项类(13.01%),每个术语附带上下文信息和月度页面浏览量( popularity 指标),并扩展为9114条掩码预测任务数据。
  3. 实验设计:选取6个主流多语言模型(Gemini 2.0 Flash、Llama3 70B等),开展问答(QA)和掩码预测任务,分别在有无上下文的条件下评估,采用准确率(QA任务)和平均倒数排名(MRR,掩码预测任务)作为指标。
  4. 核心发现
    • 术语流行度越高,模型表现越好,但无论流行度如何,提供上下文均能显著提升孟加拉语任务性能,说明“自适应检索”不适合孟加拉语。
    • 所有模型在非文化类任务上表现优于文化类,尤其在“娱乐”等文化类别中表现薄弱,存在明显的孟加拉语文化知识缺口。
    • 闭源模型(如GPT-4o、Gemini)在孟加拉语理解上显著优于开源模型,开源模型存在语义对齐和深度推
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

UnknownBody

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值