STaR: Towards Cognitive Table Reasoning via Slow-Thinking Large Language Models

STaR 论文总结与核心内容翻译

一、文章主要内容

本文针对大型语言模型(LLMs)在表格推理任务中存在的推理深度不足、过程不稳定两大核心问题,提出了名为STaR(Slow-Thinking for Table Reasoning)的认知型表格推理框架。该框架通过模拟人类"慢思考"过程,让LLMs具备逐步推理能力和轨迹级不确定性感知,从而提升表格推理的准确性、稳定性和泛化性。

核心技术架构

  1. 慢思考数据集构建:基于WikiTableQuestions、HiTab、FinQA等数据集,通过答案感知生成和自我验证机制,构建高质量训练数据,确保推理轨迹与最终答案一致,过滤模糊或错误样本。
  2. 两阶段难度感知强化学习(DRL)
    • 阶段1(基础训练):使用简单样本快速建立基础推理模式,采用高学习率实现快速收敛;
    • 阶段2(进阶训练):针对复杂样本,通过动态样本过滤和改进的GRPO(增强型群体相对策略优化)算法,聚焦模型当前能力范围内的困难任务,避免资源浪费。
  3. 轨迹级不确定性量化(UQ):融合令牌级置信度(对数概率、熵)和答案一致性,通过加权融合策略从多个推理轨迹中选择最可信路径,将潜在的pass@k性能转化为可靠的pass@1性能。

实验与效果

在WTQ、HiTab、FinQA等域内基准数据集和Ta

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

UnknownBody

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值