一、文章主要内容总结
该研究聚焦工具增强语言模型(TaLMs)的推理可靠性,核心围绕“工具诱导短视(TIM)”这一新型幻觉展开,具体内容如下:
- 问题提出:工具增强语言模型(如集成代码解释器的LLMs)虽能提升任务准确率,但即使工具选择和执行正确,模型仍可能将工具输出替代自身推理,导致解决方案看似正确却缺乏连贯论证,这种现象被定义为“工具诱导短视(TIM)”。
- 研究设计:
- 构建基准数据集PYMATH,包含1679道竞赛级数学题,这类题目需代码辅助但无法仅靠代码完全解决,专门用于诱发和测量TIM;
- 设计四维评估套件:最终答案准确率、胜率(与无工具模型的推理质量对比)、遗漏率(与标准答案推理步骤的差异)、过程奖励模型(PRM)准确率,全面量化工具使用对推理质量的影响;
- 评估7个主流LLM(涵盖OpenAI、Google Gemini、Anthropic系列),对比有/无工具使用场景下的模型表现。
- 核心发现:
- 工具增强模型的最终答案准确率最高提升19.3个百分点,但推理质量持续下降(无工具模型在推理过程 pairwise 对比中胜率最高超41.5%);
- TIM随工具调用频率增加而加剧,且使模型错误类型从算术错误转向逻辑、假设、创造性等全局推理错误,约55%的高风险案例中存在TIM;
- “思考型模型”(如Claude-opus-4、GPT-5)的工具调用频率显著高于“非思考型模型”
订阅专栏 解锁全文

810

被折叠的 条评论
为什么被折叠?



