Error-Driven Scene Editing for 3D Grounding in Large Language Models

一、文章主要内容总结

该研究针对当前3D-LLM在3D环境中语言接地(将语言描述与视觉、空间元素精准关联)的局限性,提出了DEER-3D框架,核心是通过“误差驱动的3D场景编辑”生成目标性反事实样本,迭代优化模型的空间接地能力。

1. 核心问题

现有3D-LLM因训练数据依赖语言推理而非空间理解(3D资源稀缺),存在固有接地偏差:

  • 过度依赖数据集统计关联(如“白色枕头常靠近台灯”),而非真实几何关系;
  • 难以区分细粒度视觉属性(如颜色)和空间关系(如“远离”vs“靠近”);
  • 传统文本增强方法无法修正视觉/空间偏差,甚至会强化统计先验。
2. DEER-3D框架流程

遵循“分解(Decompose)-诊断评估(Diagnostic Evaluation)-编辑(Edit)-再训练(Re-train)”的闭环流程:

  1. 分解:将自然语言指令拆解为原子谓词(如“棕色沙发”“靠墙”等视觉属性/空间关系);
  2. 诊断:定位模型在特定谓词上的错误(分为外观接地错误和空间接地错误);
  3. 编辑:通过“克隆-替换-修改”生成反事实场景(如重着色、旋转、重新定位物体),保持其他因素不变,仅针对错误谓词干预;
  4. 再训练:为编辑后的场景生成多难度QA对(事实型、判别型、
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

UnknownBody

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值