2025_NIPS_Can LLMs Learn by Teaching for Better Reasoning? A Preliminary Study

文章核心总结与创新点

核心内容

文章围绕“大语言模型能否通过教学(LbT)提升推理能力”展开初步探索,借鉴人类教育中“教学相长”的理念,将LbT思想融入LLM的训练与提示流程,设计了三种对应不同LbT层级的方法(M1、M2、M3),并在数学推理、竞赛级代码生成、文本分类等任务中验证效果。最终证实,通过合理的师生设置与流程设计,LbT能有效提升LLM的答案质量和内在推理能力。

创新点

  1. 提出LLM“教学相长”范式:首次系统探索将人类LbT(费曼学习法)理念应用于LLM推理能力提升,突破传统“教师教学生”(LfT)的单向知识传递模式。
  2. 设计三级LbT实现方法:M1(观察学生反馈)通过学生表现评分教学材料以优化答案;M2(从反馈中学习)结合LbT评分与DPO微调模型;M3(迭代学习反馈)通过反思学生错误迭代优化提示示例。
  3. 揭示关键发现:验证“易让学生学习的教学材料逻辑更清晰”的假设;证实强模型可通过教弱模型实现“弱到强泛化”;多学生的多样性反馈比单一学生或自我教学效果更优。
  4. 跨任务有效性验证:在数学推理(MATH数据集)、代码生成(LeetCode竞赛题)、文本分类(逻辑谬误检测等)任务中均实现性能提升,证明LbT的通用性。

译文(Markdown格式)

Abstract

教学以提升学生模型(例如知识蒸馏)是大语言模型(LLMs)领域中一项被广泛研究的方法。然而在人

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

UnknownBody

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值