文章核心总结与翻译
一、主要内容
本文聚焦于基于多模态大型语言模型(MLLM)的指代表达生成(REG)任务,该任务旨在为图像中指定的单个对象或区域生成明确且唯一的文本描述。研究发现,REG任务中存在描述的细节丰富度与准确性之间的潜在权衡——增加细节虽能提升描述辨识度,但易导致模型产生幻觉(如将其他对象的属性错误归因于目标区域)。
为解决这一问题,作者提出了一种无需训练的“释放-消除”(unleash-then-eliminate)框架:
- 释放中间层信息:通过对比解码(contrastive decoding)挖掘MLLM中间层中潜藏的区域描述信息,这些中间层往往比最终层包含更丰富的语义细节;
- 消除幻觉候选:利用指代表达分割(RES)任务与REG任务的循环一致性,对中间层生成的候选描述进行质量排序,筛选出准确且低幻觉的输出;
- 降低计算开销:设计基于探测的重要性估计(Probing-based Importance Estimation)方法,统计估算中间层的重要性权重,结合詹森-香农散度(Jensen-Shannon divergence)构建混合层重要性度量,在不依赖RES模型的情况下仍能保持性能。
实验在RefCOCOg和PHD基准数据集上展开,结果表明该框架在语义质量(METEOR指标)和幻觉抑制(nCHAIR指标)上均优于现有方法,且层重要性权重具有跨数据集的可迁移性。
订阅专栏 解锁全文

2772

被折叠的 条评论
为什么被折叠?



