一、文章主要内容总结
该研究聚焦于推理型文本到视频检索(reasoning text-to-video retrieval) 这一新兴任务,核心解决传统文本到视频检索无法处理隐含查询(需推理才能理解)和缺乏目标对象级定位的问题。
- 任务定义:区别于传统显式查询(直接描述视觉内容),推理型文本到视频检索需处理隐含查询(涉及抽象语义、空间/时间关系等推理),同时返回满足查询条件的视频及对应目标对象的分割掩码(object-level grounding masks)。
- 核心挑战:传统方法(如CLIP4Clip)依赖整体嵌入匹配,无法分解查询的推理步骤;视频LLM(如LLaMA-VID)通过压缩视觉令牌损失细粒度空间/对象信息,均无法满足推理和定位需求。
- 技术框架:提出两阶段检索方法,核心是将视频转化为数字孪生表示(digital twin representations):
- 预处理阶段:通过专业视觉模型(SAM-2、DepthAnything、OWLv2等)将视频分解为结构化对象级组件(含类别、属性、深度、分割掩码等),以文本格式序列化,供LLM直接处理。
- 第一阶段(粗粒度检索):用LLM将隐含查询分解为原子子查询,通过组合对比学习对齐子查询与数字孪生组件的嵌入,高效筛选候选视频。
- 第二阶段(细粒度推理与重排):LLM基于数字孪生表示验证候选视频是否满足所有查询条件,若存在信息缺口,通过“即时优化(just-in
订阅专栏 解锁全文


被折叠的 条评论
为什么被折叠?



