Agentic large language models improve retrieval-based radiology question answering

文章主要内容总结

本文聚焦于放射学问答(QA)任务,提出了一种基于智能体(agentic)的检索增强生成(RAG)框架,以解决传统RAG系统单步检索的局限性。该框架让大语言模型(LLMs)能够自主分解放射学问题、迭代从Radiopaedia.org检索目标临床证据,并动态合成基于证据的回答。

研究评估了24个不同架构、参数规模(0.5B至>670B)和训练范式(通用、推理优化、临床微调)的LLM,使用104个来自RSNA-RadioQA和ExtendedQA数据集的专家精选问题。结果显示:

  • 智能体检索的平均诊断准确率(73%)显著高于零样本提示(64%)和传统在线RAG(68%);
  • 中小型模型(如Mistral Large、Qwen 2.5-7B)受益最显著,准确率提升可达9%-16%,而超大型模型(>200B参数)提升不足2%;
  • 智能体检索减少了幻觉(平均9.4%),46%的案例中检索到临床相关内容,增强了事实依据;
  • 即使是临床微调模型(如MedGemma-27B)也能通过该框架提升性能,表明检索与微调具有互补作用。

创新点

  1. 提出智能体RAG框架:突破传统单步检索限制,实现问题自主分解、迭代检索和动态合成,提升复杂临床推理能力。
  2. 系统评估多维度LLM:覆盖24种不同参数规模、架构和训练范式的模型,揭示模型规模与智能体检索效果的关联(中小型模型受益显著,超大型模型提升有限)。
  3. 验证检索与
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

UnknownBody

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值