Reasoning Text-to-Video Retrieval via Digital Twin Video Representations and Large Language Models

一、文章主要内容总结

该研究聚焦于推理型文本到视频检索(reasoning text-to-video retrieval) 这一新兴任务,核心解决传统文本到视频检索无法处理隐含查询(需推理才能理解)和缺乏目标对象级定位的问题。

  1. 任务定义:区别于传统显式查询(直接描述视觉内容),推理型文本到视频检索需处理隐含查询(涉及抽象语义、空间/时间关系等推理),同时返回满足查询条件的视频及对应目标对象的分割掩码(object-level grounding masks)。
  2. 核心挑战:传统方法(如CLIP4Clip)依赖整体嵌入匹配,无法分解查询的推理步骤;视频LLM(如LLaMA-VID)通过压缩视觉令牌损失细粒度空间/对象信息,均无法满足推理和定位需求。
  3. 技术框架:提出两阶段检索方法,核心是将视频转化为数字孪生表示(digital twin representations)
    • 预处理阶段:通过专业视觉模型(SAM-2、DepthAnything、OWLv2等)将视频分解为结构化对象级组件(含类别、属性、深度、分割掩码等),以文本格式序列化,供LLM直接处理。
    • 第一阶段(粗粒度检索):用LLM将隐含查询分解为原子子查询,通过组合对比学习对齐子查询与数字孪生组件的嵌入,高效筛选候选视频。
    • 第二阶段(细粒度推理与重排):LLM基于数字孪生表示验证候选视频是否满足所有查询条件,若存在信息缺口,通过“即时优化(just-in
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

UnknownBody

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值