From Proof to Program: Characterizing Tool-Induced Reasoning Hallucinations in Large Language Models

一、文章主要内容总结

该研究聚焦工具增强语言模型(TaLMs)的推理可靠性,核心围绕“工具诱导短视(TIM)”这一新型幻觉展开,具体内容如下:

  1. 问题提出:工具增强语言模型(如集成代码解释器的LLMs)虽能提升任务准确率,但即使工具选择和执行正确,模型仍可能将工具输出替代自身推理,导致解决方案看似正确却缺乏连贯论证,这种现象被定义为“工具诱导短视(TIM)”。
  2. 研究设计
    • 构建基准数据集PYMATH,包含1679道竞赛级数学题,这类题目需代码辅助但无法仅靠代码完全解决,专门用于诱发和测量TIM;
    • 设计四维评估套件:最终答案准确率、胜率(与无工具模型的推理质量对比)、遗漏率(与标准答案推理步骤的差异)、过程奖励模型(PRM)准确率,全面量化工具使用对推理质量的影响;
    • 评估7个主流LLM(涵盖OpenAI、Google Gemini、Anthropic系列),对比有/无工具使用场景下的模型表现。
  3. 核心发现
    • 工具增强模型的最终答案准确率最高提升19.3个百分点,但推理质量持续下降(无工具模型在推理过程 pairwise 对比中胜率最高超41.5%);
    • TIM随工具调用频率增加而加剧,且使模型错误类型从算术错误转向逻辑、假设、创造性等全局推理错误,约55%的高风险案例中存在TIM;
    • “思考型模型”(如Claude-opus-4、GPT-5)的工具调用频率显著高于“非思考型模型”
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

UnknownBody

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值