大家读完觉得有帮助记得关注和点赞!!!
摘要
除感知外,推理在遥感中对于高级解译、推断和决策至关重要。大语言模型的最新进展催生了工具增强型智能体,它们能够利用外部工具执行复杂的分析任务。然而,现有遥感研究主要集中在感知导向的任务上,认知层面的地理空间推理在很大程度上仍未得到充分探索。为填补这一空白,我们推出TerraLogic,一个面向地理空间推理的基准。TerraLogic包含545个场景驱动、具备层次感知的任务——如灾害脆弱性评估、城市热岛分析和森林破碎化动态——涵盖光学、合成孔径雷达和红外影像。它将评估范畴从识别与监测推向认知层面的地理空间分析。为促进在TerraLogic上的评估,我们进一步提出HieraPlan,一种工具增强型智能体,它将工具集组织为功能层次结构,并执行具备容错能力的推理。HieraPlan支持结构化抽象、从工具故障中稳健恢复以及稳定的长程规划。大量实验表明,当前方法在处理分层地理空间推理时表现不佳,而HieraPlan提供了一个强大的基线,在推理能力、跨模态泛化能力和错误处理方面均有提升。数据集与智能体代码已公开于:https://github.com/Ireliya/TerraLogic。
关键词
基准数据集;地理空间推理;智能体;遥感;多模态推理;工具增强型智能体。
1. 引言
大语言模型凭借生成式预训练和指令微调,在各种应用中显著提升了零样本任务完成能力。基于此进展,LLM驱动的智能体能够将高层目标分解为子任务,并协调外部工具进行多步问题解决。然而,将此类智能体扩展到遥感领域仍然充满挑战。遥感影像在光学、合成孔径雷达和红外等不同模态间具有高度异质性,同时目标在尺度、方向和空间构型上差异巨大。这些特性常常挑战通用视觉-语言推理的假设,导致智能体在遥感特定数据分布以及更严格的地理单元和工具参数约束下性能下降。

图1:层次化场景上下文通过从意图到实体、关系和依赖感知的子目标来组织场景信息,架起感知与决策之间的桥梁,从而实现认知层面的地理空间推理。
更重要的是,现实世界的地球观测应用需要的不仅仅是感知。除了分类、定位、计数和遥感视觉问答等感知导向任务外,许多EO应用还需要用于决策的认知层面地理空间推理。这些任务本质上是场景驱动的:它们要求识别任务相关实体,组合中间空间分析,并得出在应用场景背景下可操作的结论。例如,洪水风险评估会筛查水体附近的建筑物,灌溉分析会量化农田与水体的邻接关系,生态稳定性评估则会识别完全被森林包围的荒芜斑块。在此类情况下,感知仅是入口;最终目标是面向决策的地理空间推理。EO推理区别于通用多步感知的关键在于,它必须满足领域指南中指定的标准化地理空间准则,如缓冲区距离、邻接规则、比率阈值或拓扑谓词。这些准则无法仅凭感知输出可靠应用。其解读取决于为何观测该场景、哪些实体相关,以及如何生成和复用中间空间产品。因此,EO推理不仅仅是感知输出和工具调用的序列。相反,它需要一种显式的任务结构,连接场景意图、依赖感知的子目标和基于标准的空间约束,如图1所示。
近期研究已将LLM适配为遥感智能体,包括RS-ChatGPT、RS-Agent、GeoLLM-Engine、Change-Agent和Tree-GPT。这些系统在分类、定位、计数和遥感VQA等感知导向任务上显示出潜力。最近的基准测试开始通过支持基于执行的工具使用来扩展评估范畴。ThinkGeo研究了面向遥感任务、基于执行的多步工具使用轨迹,而Earth-Agent则强调广泛的EO资源整合和大规模工具编排。然而,这些进展主要仍在改进任务执行和工具协调,而非显式建模认知地理空间推理的三个核心要素:(i) 场景级意图,(ii) 依赖感知的子目标,以及(iii) 基于标准的空间约束。因此,工具执行的推理轨迹可能看似合理,却难以复现、验证和跨方法比较。综上所述,这些局限性表明,一个面向认知地理空间推理的基准应满足三个要求。首先,它应提供连接场景意图与依赖感知子目标的层次化任务规范,而非将推理简化为扁平的工具调用序列。其次,它应支持基于标准且可验证的空间推理,其中的谓词、阈值和拓扑约束可通过可执行工具进行检查。第三,它应确保跨模态的遥感覆盖,以便在对光学、SAR和红外等异构EO数据进行稳健评估。现有基准仅部分满足这些特性,且常常是孤立地满足。如表1总结,先前的基准通常支持可验证的工具执行和步骤级评估,但很少围绕场景级意图、依赖感知的子目标或基于标准的空间准则来构建推理。此外,跨模态推理的评估仍不充分。
为填补此空白,我们推出TerraLogic,一个面向多遥感模态认知层面地理空间推理的基准。TerraLogic包含545个场景驱动任务,涵盖光学、SAR和红外影像。每个任务均以结构化形式指定,将基于标准的空间触发器(如定量阈值或拓扑谓词)与专家解译和可验证的工具链耦合,同时在场景意图和依赖感知的子目标下组织推理。基于TerraLogic,我们进一步提出HieraPlan,一种LLM驱动的智能体,它能分层组织分析工具,执行具备约束感知、容错能力的推理流水线,并能从中间故障中恢复。我们的主要贡献总结如下:
-
我们提出TerraLogic,首个面向分层地理空间推理的基准,包含545个跨越光学、SAR和红外模态的任务。
-
我们提出HieraPlan,一个智能体框架,支持具备分层规划、鲁棒错误处理和多模态遥感场景适配的认知推理。
-
我们在TerraLogic上对最先进的LLM进行了全面评估,建立了新的基线,揭示了它们在认知要求高的地理空间推理中的优势与局限。
表1:代表性基于执行的遥感/EO推理基准对比。(✓:完全支持;✗:不支持;–:未强调或不适用。)
|
基准 |
多传感器 |
可验证执行 |
步骤级评估 |
层次化场景上下文 |
光学 |
SAR |
红外 |
|---|---|---|---|---|---|---|---|
|
UnivEARTH |
✓ |
✗ |
✓ |
✓ |
– |
– |
– |
|
GeoLLM-Engine |
✓ |
✓ |
✗ |
✓ |
✓ |
– |
– |
|
ThinkGeo |
✓ |
✓ |
✗ |
✓ |
✓ |
– |
– |
|
Earth-Bench |
✓ |
✗ |
✗ |
✓ |
✓ |
– |
– |
|
TerraLogic (Ours) |
✓ |
✓ |
✓ |
✓ |
✓ |
✓ |
✓ |
2. TerraLogic基准构建
我们提出TerraLogic,一个旨在评估由LLM驱动的工具增强型智能体之地理空间推理能力的基准。TerraLogic整合了来自光学、SAR和红外模态的多样化影像,以及专家策划的知识和工具增强的查询流水线,产生了545个高质量实例。
每个实例将真实世界影像与结构化的多步推理挑战相耦合,这些挑战既需要底层感知(如分割、检测),也需要高层决策(如城市规划、灾害评估)。与先前专注于感知(如分类或检测)的遥感基准不同,TerraLogic强调端到端推理,从感知到空间分析再到可操作的结论,从而为智能体提供了严格的测试平台。图2展示了TerraLogic基准中的六个代表性样本。
2.1. 地理空间推理场景
遥感的一个核心挑战是弥合底层感知输出与现实世界决策所需高层智能之间的鸿沟。为此,我们采用了一个结构化的地理空间推理任务分类法,系统地将其组织为七个主要领域:城市规划、灾害评估、环境监测、交通分析、活动监测、海事监测和工业场地。
2.2. 源数据构建流程
我们以两阶段流程构建TerraLogic(见图3),该流程结合了多样化的源影像、知识增强的场景生成以及多轮专家评审,最终产生545个经过验证的实例。本流程使用的源数据集总结于表2。

图2:TerraLogic代表性任务及在我们错误分类体系下的HieraPlan执行轨迹。从左到右:(i) 输入图像与查询,(ii) HieraPlan生成的高层计划,(iii) 执行的工具序列,(iv) 最终地理空间答案。红色叉号标记错误的计划或工具调用,绿色对勾表示经验证的工具链与答案。

图3:TerraLogic基准构建流程。
2.2.1. 阶段1:知识增强的场景生成。
我们获取源影像的分层样本(按模态和场景类型),并应用显式的难度控制来选择需要多工具推理和组合空间关系(如邻近性、包含性、拓扑性)的案例。通过上下文学习,利用ChatGPT-5生成候选查询和工具链:提示是模态特定的,并以专家撰写的范例为种子。
为使生成过程立足于领域知识,我们将一个精简的知识语料库注入提示中。该语料库涵盖四类指导方针:(i) 城市绿化和缓解热岛框架;(ii) 国际土地覆盖标准;(iii) 针对红外小目标任务的航空和海事搜救条令;以及(iv) 危险资产隔离与邻近性的工业安全规则。这些锚点迫使ChatGPT-5生成与既定框架一致的定量阈值(距离、面积、类别构成)。我们还强制执行算子合法性检查(包括感知地面距离采样单位),以防止无效的工具序列。
2.2.2. 阶段2:专家评审与质量门控。
我们执行由专家主导、以执行为门的发布标准。具体而言,每个阶段1的候选实例都要经过八位遥感专家的三轮审查程序,旨在产生意图明确且可通过工具执行验证的实例。
-
基于清单的评估。 对于每个候选,评审员检查三个方面:(i) 语义合理性(查询陈述了一个定义良好、领域相关且无欠规范的任务);(ii) 工作流有效性(算子选择、排序和参数符合模态约束,并在GSD感知单位下保持一致);(iii) 地理空间正确性(无几何/拓扑陷阱,且中间空间对象对下游算子有意义)。我们迭代修订每个候选实例,直至所有标准满足;否则,如果预期问题无法由可执行的工具证据支持(无效单位、定义不清的空间谓词,或查询与预期工具输出不一致),则予以丢弃。
-
基于执行的验证。 为避免发布依赖自由形式生成的实例,我们要求最终确定的工具序列能在算子合法性约束(类型化输入输出、单位有效性、地理空间约束)下运行至完成。仅当满足以下条件时才接受一个实例:(a) 工具链执行无违规;(b) 中间输出通过基本有效性检查(在需要时非空,适用时拓扑有效);(c) 最终答案中报告的任何数量均直接由工具输出计算得出,而非无证据推断。此门控标准确保每个发布的实例都配有一个支持可追溯、证据驱动评估的可执行工具链。
-
轮次与可追溯性。 三轮包括初步筛选、边缘案例的分歧解决,以及对查询文本、工具参数和生成输出的最终一致性检查。对查询、算子选择、参数和最终答案的所有修改均记录在策展界面中,保留了实例级别的可追溯性,以供验证和后续分析。
表2:TerraLogic基准中用作图像源的数据集。
|
名称 |
标注类型 |
分辨率 |
模态 |
地理覆盖范围 |
|---|---|---|---|---|
|
LoveDA |
掩膜 |
0.3米/像素 |
光学 |
中国南京/常州/武汉 |
|
ISPRS波茨坦 |
掩膜 |
0.05米/像素 |
光学 |
德国波茨坦 |
|
ISPRS韦欣根 |
掩膜 |
0.09米/像素 |
光学 |
德国韦欣根 |
|
DeepGlobe土地覆盖 |
掩膜 |
0.50米/像素 |
光学 |
印度/印尼/泰国城市 |
|
HRSCD |
变化掩膜 |
0.45米/像素 |
光学 |
法国雷恩/卡昂 |
|
OGSOD |
边界框 |
3米/像素 |
SAR |
中国城市 |
|
DMIST |
边界框 |
– |
红外 |
中国成都 |
2.3. 基准统计
TerraLogic包含545个跨越光学、SAR和红外模态的查询。总计调用13种工具1649次,大多数查询需要多工具组合。查询长度从简短的事实性问题到复杂的组合性问题不等,体现了多样性和推理深度。详细统计数据见表3。TerraLogic中的每个推理任务都被实例化为一种独特的场景上下文类型,其特征由三个组件构成:(i) 空间触发器(定量阈值或拓扑关系),(ii) 专家解译(领域依据语义),以及(iii) 可验证工具链。这种分层设计桥接了感知与认知,提供了结构化先验和显式的多步路径,同时确保了可解释性和可验证性。通过覆盖典型和高复杂度的推理场景,TerraLogic为评估多样化的智能体能力提供了严格的测试平台,包括细粒度空间理解、多步工具组合、定量分析和情境感知的风险评估。
表3:不同模态下问题复杂度和工具使用模式的统计。
|
指标 |
全部 |
光学 |
SAR |
红外 |
|---|---|---|---|---|
|
总查询数 |
545 |
386 |
116 |
43 |
|
总工具调用次数 |
1649 |
1217 |
346 |
86 |
|
使用2/3/4种工具 |
72/387/86 |
27/273/86 |
2/114/0 |
43/0/0 |
|
最大问题长度 |
N/A |
406 |
207 |
288 |
|
最小问题长度 |
N/A |
109 |
111 |
135 |
|
平均问题长度 |
158.24 |
160.13 |
143.49 |
181.05 |
3. HieraPlan智能体
为支持在TerraLogic上的评估,我们提供HieraPlan,一种面向遥感地理空间推理的、具备层次感知和容错能力的智能体。给定一个任务,HieraPlan从一个涵盖感知、空间关系、空间统计、SAR和红外的分层库中检索任务相关的工具子集,然后生成模态感知的计划,执行具体的算子,并根据验证过的工具输出综合最终答案。HieraPlan支持层次化抽象:工具按功能和模态组织,具有类型化的输入输出和基本合法性约束,减少了在异构遥感数据上的无效组合。其可执行算子基于遥感专家模型,包括RemoteSAM、SARATR-X、DMIST/LASNet和Change3D。它进一步支持容错执行:当某一步骤失败时,智能体首先尝试在工具包内进行替换,若需要,则仅重新规划剩余的后续部分,同时保留已验证的前缀。最后,它强制执行可验证的基础:定量输出由工具计算,而LLM仅限于根据经验证的中间结果进行自然语言综合。总体而言,HieraPlan作为TerraLogic的合适参考基线,其任务需要场景感知的分解、跨模态工具协调和长推理链下的可靠执行。
4. 实验与结果
为评估HieraPlan在真实遥感场景下的推理和工具使用能力,我们在TerraLogic基准上进行了全面的实验。由于HieraPlan由LLM控制,我们评估了一系列多样化的基础模型,包括基于API的系统——GPT-3.5、GPT-4o和Gemini-2.5-Flash——以及广泛的开源LLM。开源模型包括大容量系统,如DeepSeek-V3、Qwen2.5-32B-Instruct和LLaMA-3-70B-Instruct,以及中等规模模型,包括Qwen2.5-7B、InternLM3-8B、LLaMA-3-8B、Mistral-7B、Yi-1.5-6B和Phi-3-Mini。所有实验均在配备NVIDIA A5000 GPU的OpenCompass评估平台上进行。
4.1. 总体性能
我们在ReAct风格的协议下,分别在逐步和端到端设置中评估HieraPlan。逐步指标——InstAcc、ToolAcc、ArgAcc和SummAcc——分别衡量指令遵循、工具选择、参数正确性和摘要生成能力。端到端分数——P、O和L——评估在感知、空间统计和空间关系工具包上的工具增强预测。在此设置中,HieraPlan是对ReAct协议的补充而非改变,它在保持相同评估标准的同时提供了分层编排。对于最终答案准确率,我们避免了确定性的字符串匹配,这种方法对微小的词汇变化敏感,并可能惩罚语义正确的输出。这在TerraLogic中尤为重要,因为最终答案是从查询语义、工具输入/输出和场景知识综合而来,而非匹配单一的标准字符串。遵循先前关于LLM-as-a-judge的工作,我们使用GPT-4o-mini和基于评分标准的提示来计算AnsAcc,以评估预测答案及其关键参数是否与真实值在语义上一致。表4报告了TerraLogic上的总体结果,其多模态、场景驱动的任务要求智能体协调跨越感知、空间分析、SAR和红外的多个工具包,从而实现对认知层面地理空间推理的系统性评估。如表4所示,GPT-4o在两个评估设置下均取得最强的整体性能,在InstAcc、ArgAcc、SummAcc以及P、O和Ans指标上领先。在开源大模型中,Llama-3-70B-Instruct总体表现最佳,拥有竞争力的ToolAcc和强劲的端到端结果。在中等规模开源模型中,Qwen2.5-7B-Instruct值得注意,尽管InstAcc和SummAcc较弱,但其L分数(空间关系)在所有评估模型中最高。跨模型家族来看,ArgAcc仍是主要瓶颈,而较低的ToolAcc始终与端到端性能下降相关,凸显了在长程地理空间工作流中实现可靠工具选择和忠实参数传递的难度。
表4:HieraPlan在TerraLogic基准上的主要结果。Inst.、Tool.、Arg.和Summ.表示逐步准确率。P、O和L表示感知、空间统计和空间关系工具包的端到端分数。Ans.表示最终答案准确率。粗体表示最佳总分,下划线表示同规模模型内最佳。
|
模型 |
逐步指标 (%) |
|
|
|
端到端指标 (%) |
|
|
|
|---|---|---|---|---|---|---|---|---|
|
|
Inst. |
Tool. |
Arg. |
Summ. |
P |
O |
L |
Ans. |
|
API-based |
|
|
|
|
|
|
|
|
|
GPT-4o |
79.40 |
72.01 |
23.57 |
82.83 |
72.73 |
88.38 |
77.95 |
25.70 |
|
Gemini-2.5-Flash |
59.09 |
43.31 |
15.75 |
47.22 |
41.47 |
40.89 |
41.51 |
12.04 |
|
GPT-3.5 |
59.05 |
57.12 |
21.88 |
59.08 |
61.22 |
61.04 |
53.30 |
24.40 |
|
Open-source (Large) |
|
|
|
|
|
|
|
|
|
DeepSeek-V3 |
65.84 |
66.33 |
23.32 |
60.92 |
65.44 |
66.04 |
57.93 |
21.28 |
|
Qwen2.5-32B-Instruct |
62.83 |
58.00 |
17.41 |
58.90 |
44.28 |
67.40 |
61.47 |
19.08 |
|
Llama-3-70B-Instruct |
67.89 |
67.47 |
22.66 |
69.91 |
62.72 |
71.62 |
62.54 |
22.75 |
|
Open-source (Medium/Small) |
|
|
|
|
|
|
|
|
|
Qwen2.5-7B-Instruct |
77.19 |
74.71 |
23.11 |
65.32 |
68.56 |
73.03 |
82.42 |
22.57 |
|
InternLM3-8B-Instruct |
61.26 |
57.72 |
22.59 |
50.28 |
61.44 |
53.70 |
60.70 |
18.90 |
|
LLaMA3-1-8B |
69.46 |
65.99 |
22.27 |
55.60 |
68.42 |
60.34 |
70.82 |
16.70 |
|
Phi-3-Mini-4K-Instruct |
55.45 |
41.14 |
17.17 |
10.09 |
43.63 |
7.52 |
51.74 |
3.67 |
|
Mistral-7B-Instruct-v0.2 |
60.03 |
47.05 |
16.73 |
46.06 |
49.75 |
44.05 |
45.23 |
13.21 |
|
Yi-1.5-6B-Chat |
63.38 |
42.08 |
16.00 |
37.98 |
47.44 |
38.73 |
36.02 |
10.83 |
4.2. 任务错误分析
为解释上述性能差距,我们使用涵盖格式、推理、感知和工具使用的错误分类体系来分析故障。如表5所示,格式错误是跨模型家族的主导故障模式。这对于开源模型尤其严重,包括DeepSeek-V3、Llama-3-70B和Phi-3-Mini,但对于GPT-4o也仍然显著。这表明生成有效的结构化工具调用,特别是格式良好的JSON参数,仍然是一个主要瓶颈。工具使用错误进一步区分了模型类别。GPT-4o最为可靠,而Gemini-2.5-Flash和GPT-3.5则更频繁地选择不合适的算子或产生无效参数。一些开源模型显示出较低的工具使用错误率,但这可能反映了更保守的行为,而非更强的执行能力。另一个主要的故障来源是感知基础。例如,GPT-4o的感知错误率为41.26%,表明解读土地覆盖掩膜、变化图和空间布局仍然具有挑战性。相比之下,推理错误在各模型中相对温和,似乎并非主要瓶颈。总体而言,这些结果表明,当前的地理空间智能体更多地受限于结构化输出生成和多模态基础,而非单纯的抽象推理。
表5:不同LLM的四类错误百分比分布。(粗体表示每模型中最常见的错误类型。)
|
模型 |
格式 |
推理 |
感知 |
工具使用 |
|---|---|---|---|---|
|
GPT-4o |
41.65 |
13.49 |
41.26 |
3.60 |
|
Gemini-2.5-Flash |
29.47 |
21.18 |
12.09 |
37.26 |
|
GPT-3.5 |
31.20 |
18.60 |
10.70 |
39.50 |
|
DeepSeek-V3 |
66.40 |
23.00 |
8.70 |
1.90 |
|
Qwen2.5-32B |
31.27 |
19.78 |
13.99 |
34.96 |
|
Llama-3-70B |
55.20 |
25.70 |
18.20 |
0.90 |
|
Qwen2.5-7B |
42.65 |
23.48 |
29.37 |
4.50 |
|
InternLM3-8B |
32.70 |
23.90 |
11.40 |
32.00 |
|
LLaMA3.1-8B |
38.36 |
24.58 |
20.28 |
16.78 |
|
Phi-3-Mini-4K |
45.60 |
34.70 |
1.80 |
17.90 |
|
Mistral-7B-v0.2 |
45.40 |
21.20 |
5.40 |
28.00 |
|
Yi-1.5-6B |
37.90 |
28.60 |
8.60 |
24.90 |
4.3. 与遥感多模态LLM的比较
为定位TerraLogic的难度,我们在光学子集上将HieraPlan与现有的遥感多模态LLM进行比较,这是这些模型预期表现最佳的领域。表6报告了结果。现有的RS-MLLM在TerraLogic的光学地理空间推理任务上表现不佳:EarthDial、GeoChat和GeoPix的准确率分别仅为9.38%、6.70%和6.17%,尽管它们是为遥感理解而设计的。相比之下,HieraPlan(GPT-4o)达到了29.29%的准确率,大幅优于这些专门的RS-MLLM。然而,整体性能仍然较低,表明TerraLogic的光学任务仍然极具挑战性,需要超越标准VQA风格解译的细粒度空间推理。
表6:代表性遥感多模态LLM与我们的HieraPlan在TerraLogic光学VQA任务上的光学准确率对比。
|
模型 |
光学准确率 (%) |
|---|---|
|
RS-MLLMs |
|
|
EarthDial |
9.38 |
|
GeoChat |
6.70 |
|
GeoPix |
6.17 |
|
LLM-based Agent (Ours) |
|
|
HieraPlan (GPT-4o) |
29.29 |
4.4. 细粒度能力子集
为精确定位故障发生的环节,表7将TerraLogic按能力组合和规划跨度递增划分为四个子集。语义+几何包含需要语义感知后进行几何推理的任务(如带缓冲或重叠的分割),不涉及定量统计。语义+定量将语义感知与数值测量相结合(如带距离估计或计数的检测),不涉及几何谓词。语义+几何+定量代表了整合所有三种能力的全流程工作流。长程包含需要K≥4次连续工具操作的实例,我们进一步报告H∩(S+G+Q),以分离最具挑战性的长程全流程案例。呈现出两种趋势。首先,能力组合远比任何单一能力更难:对于大多数模型,性能从S+G或S+Q下降到S+G+Q,表明当参数必须在异构工具包间传递时,错误会累积。其次,规划跨度仍是主要挑战:在H∩(S+G+Q)上,即使是强大的系统也保留了中等的步骤级准确率,但在最终答案准确率上急剧下降,这表明在长推理链中,微小的局部工具或参数错误就可能破坏端到端的正确性。
表7:跨模型和能力子集的细粒度结果。(所有指标单位为%。)
|
模型 |
任务 |
Inst |
Tool |
Arg |
Summ |
Ans |
|---|---|---|---|---|---|---|
|
API-based |
|
|
|
|
|
|
|
GPT-4o |
S+G |
77.78 |
92.11 |
32.89 |
75.00 |
45.29 |
|
|
S+Q |
78.33 |
89.20 |
22.80 |
94.00 |
36.00 |
|
|
S+G+Q |
85.20 |
84.40 |
27.37 |
91.08 |
35.43 |
|
|
H∩(S+G+Q) |
60.70 |
46.77 |
18.09 |
60.47 |
9.81 |
|
Gemini-2.5-Flash |
S+G |
49.44 |
48.03 |
18.42 |
53.57 |
21.43 |
|
|
S+Q |
30.67 |
25.60 |
12.00 |
30.00 |
8.00 |
|
|
S+G+Q |
34.51 |
23.40 |
9.00 |
24.93 |
9.97 |
|
|
H∩(S+G+Q) |
50.81 |
34.24 |
12.40 |
41.86 |
0.00 |
|
GPT-3.5 |
S+G |
67.20 |
73.00 |
27.00 |
64.30 |
42.90 |
|
|
S+Q |
83.30 |
94.40 |
40.80 |
98.00 |
48.00 |
|
|
S+G+Q |
53.90 |
53.50 |
20.80 |
51.20 |
24.70 |
|
|
H∩(S+G+Q) |
67.10 |
54.40 |
18.30 |
69.80 |
10.50 |
|
Open-source (Large) |
|
|
|
|
|
|
|
DeepSeek-V3 |
S+G |
80.00 |
86.80 |
28.30 |
92.90 |
32.10 |
|
|
S+Q |
83.30 |
96.80 |
30.00 |
98.00 |
40.00 |
|
|
S+G+Q |
61.90 |
65.70 |
24.00 |
53.80 |
21.30 |
|
|
H∩(S+G+Q) |
70.70 |
54.80 |
17.70 |
60.50 |
5.80 |
|
Qwen2.5-32B-Instruct |
S+G |
59.40 |
65.10 |
23.70 |
60.70 |
10.70 |
|
|
S+Q |
83.30 |
94.40 |
41.20 |
98.00 |
32.00 |
|
|
S+G+Q |
60.10 |
57.50 |
15.40 |
52.00 |
21.30 |
|
|
H∩(S+G+Q) |
66.00 |
46.50 |
15.20 |
66.30 |
5.80 |
|
Llama-3-70B-Instruct |
S+G |
80.00 |
80.26 |
24.34 |
89.29 |
25.00 |
|
|
S+Q |
83.33 |
92.80 |
38.80 |
94.00 |
34.00 |
|
|
S+G+Q |
64.44 |
70.12 |
23.17 |
62.99 |
23.10 |
|
|
H∩(S+G+Q) |
72.21 |
47.67 |
15.37 |
80.23 |
11.63 |
|
Open-source (Medium/Small) |
|
|
|
|
|
|
|
Qwen2.5-7B-Instruct |
S+G |
80.00 |
94.70 |
32.20 |
85.70 |
42.90 |
|
|
S+Q |
83.30 |
96.00 |
32.40 |
100.00 |
34.00 |
|
|
S+G+Q |
78.70 |
77.70 |
23.50 |
57.50 |
22.00 |
|
|
H∩(S+G+Q) |
69.00 |
53.60 |
17.10 |
73.30 |
12.80 |
|
InternLM3-8B-Instruct |
S+G |
74.40 |
82.90 |
28.90 |
78.60 |
25.00 |
|
|
S+Q |
83.30 |
94.40 |
41.20 |
100.00 |
32.00 |
|
|
S+G+Q |
55.80 |
55.20 |
22.20 |
38.60 |
19.70 |
|
|
H∩(S+G+Q) |
70.20 |
49.60 |
16.80 |
64.00 |
5.80 |
|
LLaMA3-1-8B |
S+G |
80.00 |
89.50 |
28.30 |
85.70 |
21.40 |
|
|
S+Q |
51.70 |
51.60 |
28.40 |
40.00 |
6.00 |
|
|
S+G+Q |
71.20 |
71.00 |
23.20 |
50.70 |
19.20 |
|
|
H∩(S+G+Q) |
67.30 |
48.70 |
16.00 |
76.70 |
10.50 |
|
Phi-3-Mini-4K-Instruct |
S+G |
51.11 |
42.11 |
14.47 |
32.14 |
7.14 |
|
|
S+Q |
77.67 |
82.00 |
32.40 |
72.00 |
16.00 |
|
|
S+G+Q |
57.35 |
40.98 |
18.34 |
2.62 |
2.62 |
|
|
H∩(S+G+Q) |
41.86 |
28.29 |
8.79 |
0.00 |
0.00 |
|
Mistral-7B-Instruct-v0.2 |
S+G |
73.90 |
74.30 |
24.30 |
78.60 |
25.00 |
|
|
S+Q |
77.70 |
86.00 |
36.40 |
92.00 |
16.00 |
|
|
S+G+Q |
56.00 |
43.60 |
15.10 |
37.30 |
13.60 |
|
|
H∩(S+G+Q) |
65.30 |
40.80 |
14.30 |
47.70 |
5.80 |
|
Yi-1.5-6B-Chat |
S+G |
81.67 |
63.82 |
23.68 |
85.71 |
14.29 |
|
|
S+Q |
54.33 |
56.40 |
21.20 |
38.00 |
14.00 |
|
|
S+G+Q |
60.37 |
41.02 |
15.49 |
30.97 |
11.02 |
|
|
H∩(S+G+Q) |
73.37 |
36.82 |
14.60 |
53.49 |
6.98 |
5. 结论
在这项工作中,我们推出了TerraLogic,这是首个面向光学、SAR和红外模态认知层面地理空间推理的基准。TerraLogic包含545个具备层次感知、场景驱动的任务,将评估范畴从感知扩展到结构化的多步分析。为支持基准评估,我们进一步提供了HieraPlan,一个面向多模态工具增强推理的、具备层次感知和容错能力的基线智能体。在TerraLogic上的实验表明,即使是前沿模型仍然存在局限,在参数预测、摘要生成和多模态工具集成方面存在明显弱点,这为未来在地理空间推理、规划和执行方面的研究留下了巨大的提升空间。

253

被折叠的 条评论
为什么被折叠?



