文章主要内容总结
本文聚焦于放射学问答(QA)任务,提出了一种基于智能体(agentic)的检索增强生成(RAG)框架,以解决传统RAG系统单步检索的局限性。该框架让大语言模型(LLMs)能够自主分解放射学问题、迭代从Radiopaedia.org检索目标临床证据,并动态合成基于证据的回答。
研究评估了24个不同架构、参数规模(0.5B至>670B)和训练范式(通用、推理优化、临床微调)的LLM,使用104个来自RSNA-RadioQA和ExtendedQA数据集的专家精选问题。结果显示:
- 智能体检索的平均诊断准确率(73%)显著高于零样本提示(64%)和传统在线RAG(68%);
- 中小型模型(如Mistral Large、Qwen 2.5-7B)受益最显著,准确率提升可达9%-16%,而超大型模型(>200B参数)提升不足2%;
- 智能体检索减少了幻觉(平均9.4%),46%的案例中检索到临床相关内容,增强了事实依据;
- 即使是临床微调模型(如MedGemma-27B)也能通过该框架提升性能,表明检索与微调具有互补作用。
创新点
- 提出智能体RAG框架:突破传统单步检索限制,实现问题自主分解、迭代检索和动态合成,提升复杂临床推理能力。
- 系统评估多维度LLM:覆盖24种不同参数规模、架构和训练范式的模型,揭示模型规模与智能体检索效果的关联(中小型模型受益显著,超大型模型提升有限)。
- 验证检索与
订阅专栏 解锁全文

278

被折叠的 条评论
为什么被折叠?



