From Phonemes to Meaning: Evaluating Large Language Models on Tamil

文章主要内容与创新点总结

一、主要内容

  1. 研究背景:大型语言模型(LLMs)在高资源语言任务中表现出强大的泛化能力,但在泰米尔语等低资源、形态丰富的语言中的语言能力尚未得到充分探索。现有多语言基准大多是英语数据集的翻译版本,无法捕捉目标语言的语言和文化细微差异。
  2. 数据集构建:构建了首个泰米尔语专属语言评估基准ILAKKANAM,包含820道来自斯里兰卡1-13年级泰米尔语学科考试的题目,由专业语言学家标注为5个语言类别(语音学、音系学、形态学、句法学、语义学)和1个事实知识类别,涵盖不同难度层级。
  3. 模型评估:采用标准化评估框架,对闭源模型(如GPT-5、Claude Sonnet 4.5、Gemini 2.5等)和开源模型(如LLaMA 4、DeepSeek-V3、Qwen 2.5等)进行评估,同时开展类别级、年级级分析及语言类别分类任务测试。
  4. 核心发现
    • Gemini 2.5总体表现最佳(正确率79.55%),闭源模型整体优于开源模型,凸显语言基础的差距;
    • 所有模型在低年级题目上表现较好,随语言复杂度提升(尤其是5年级及13年级)性能显著下降;
    • 模型在事实知识类别(如文化、历史、文学常识)表现较弱,语音学类别表现相对最优;
    • 模型的整体性能与其语言类别识别能力无强相关性,表明性能可能源于数据暴露而非真正的语言理解。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

UnknownBody

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值