PAS : Prelim Attention Score for Detecting Object Hallucinations in Large Vision--Language Models

文章总结与翻译

一、主要内容

该研究聚焦于大型视觉语言模型(LVLMs)中的物体幻觉问题(即模型提及图像中不存在的物体),提出了一种轻量级、无需训练的检测方法——初步注意力分数(Prelim Attention Score, PAS)。

核心发现:当LVLMs产生物体幻觉时,模型会忽视图像信息,转而依赖先前生成的“初步输出 tokens”(prelim tokens)推断新物体。这种对初步输出 tokens 的过度依赖与物体幻觉高度相关,可通过注意力权重量化。

研究过程:

  1. 理论层面:通过互信息(mutual information)构建信息论框架,验证了“图像依赖弱、初步输出依赖强”与物体幻觉的关联性;
  2. 方法设计:PAS 直接利用模型推理过程中已计算的注意力权重,求和初步输出 tokens 对目标物体 token 的注意力贡献,无需额外前向传播,可实时计算;
  3. 实验验证:在 LLaVA-1.5-7B、MiniGPT-4、Shikra 三种模型及 MSCOCO、Pascal VOC 两个数据集上,PAS 取得了最先进的检测性能(平均 AUROC 达 85.0%),且在不同解码策略下表现稳定,内存开销低。

二、创新点

  1. 挖掘新信息源:首次指出“初步输出 tokens”是物体幻觉检测的关键信号,弥补了现有方法仅关注图像 tokens 或输出 logits 的局限;
  2. 信息论验证:通过互信息形式化验证“过度依赖初步输出、忽视图像”与幻觉的因果关系,为方法提供理论支撑;<
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

UnknownBody

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值