论文解读 | 图分类基准真的能评出更好的 GNN 吗?
论文: Rethinking the Effectiveness of Graph Classification Datasets in Benchmarks for Assessing GNNs
会议: IJCAI 2024 Main Track
团队: 香港中文大学(深圳)团队
研究者: zhengdao li
图神经网络(Graph Neural Networks,GNNs)的新模型不断刷新公开数据集上的成绩。但一个容易被忽略的问题是:如果用于测试模型的数据集本身缺乏区分力,那么排行榜上的提升,真的能够说明新模型更强吗?
这篇论文没有继续设计一个更复杂的 GNN,而是回到评测体系的起点,系统研究图分类数据集能否有效区分 GNN、图核方法和简单基线。论文进一步提出量化数据集评测价值的 Effectiveness 指标,并通过可控合成数据实验分析低有效性产生的原因。
1. 为什么需要重新审视图分类基准?
在理想情况下,一个高质量的图分类基准应该能够体现 GNN 利用图结构和节点属性的优势。如果 GNN 与简单模型表现接近,通常存在两种可能:
- 当前 GNN 没有充分利用数据中的有效信息;
- 数据集过于简单,或者标签能够被某些浅层统计特征直接预测。
以往研究大多关注模型表达能力、训练策略和最终精度,却较少直接回答“数据集是否适合用来评价 GNN”这一问题。为此,论文提出两个核心研究问题:
- RQ1: 常用图分类数据集能否有效区分 GNN 与其他简单方法?
- RQ2: 如何用统一指标量化一个数据集的评测有效性?
2. 将结构信息和属性信息分开评测
为了公平比较不同方法,论文构建了一套统一评测流程,并将性能差距拆分为两类:
- 结构性能差距(Structural Gap,δS): 比较结构主导的简单基线与能够利用图结构的方法,判断数据集是否需要更强的结构建模能力。
- 属性性能差距(Attributed Gap,δA): 比较属性主导的简单基线与使用真实节点或边属性的 GNN,判断模型能否从属性与结构的联合建模中获益。
实验涵盖生物化学、社会科学和计算机视觉等领域的 16 个真实图分类数据集,并统一比较多层感知机、分子指纹、图核方法以及 GIN、GCN 等代表性模型。

图 1:16 个图分类数据集上的属性性能差距与结构性能差距。论文采用 10% 的经验阈值,将灰色数据集标记为低区分度,将红色数据集标记为高区分度。
图 1 展示了论文最直接的发现:虽然 GNN 在多数数据集上取得了较好的最终结果,但约有一半的数据集无法明显拉开简单基线与 GNN 的差距。 这说明部分常用基准并不能充分证明 GNN 的结构学习优势。
不同类型的数据集也呈现出明显差异:
- MNIST 和 CIFAR10 的属性性能差距较大,说明位置与颜色等节点属性对任务十分关键;
- PPA 和 Tox21 的结构性能差距较明显,简单的平均度信息不足以完成预测;
- ENZYMES、BACE 和 NCI1 在结构与属性两方面都表现出较强区分力;
- 在社会网络数据集中,REDDIT-B 的结构性能差距最突出,而其他数据集更容易被简单统计特征解释。
3. Effectiveness:不只看精度差,还要考虑任务难度
直接使用性能差距仍然存在局限。例如,两个任务上的模型精度都相差 10%,但“50% 对 60%”和“80% 对 90%”并不具有相同含义:前者可能说明任务更难、仍有较大改进空间;后者则可能已经接近任务上限。此外,二分类和十分类任务的随机猜测水平不同,也不能直接用同一把尺子衡量。
为解决这些问题,论文提出数据集有效性指标 Effectiveness:
E ( D ) = ∑ t y p e ∈ { S , A } ∣ δ t y p e ( D ) ∣ R ∗ ( ∣ Y ∣ − 1 ) ⋅ 1 − R ∗ 1 − ∣ Y ∣ − 1 E(D)=\sum_{type\in\{S,A\}} \frac{|\delta_{type}(D)|}{R^*(|Y|-1)} \cdot \frac{1-R^*}{1-|Y|^{-1}} E(D)=type∈{S,A}∑R∗(∣Y∣−1)∣δtype(D)∣⋅1−∣Y∣−11−R∗
其中, δ t y p e \delta_{type} δtype 表示结构或属性性能差距, R ∗ R^* R∗ 是两种方法中较低的性能, ∣ Y ∣ |Y| ∣Y∣ 是类别数量。该指标同时考虑:
- 模型之间的绝对性能差距;
- 数据集距离“完美预测”还有多远;
- 不同类别数量对应的随机猜测水平。
直观地说,模型差距越大、任务越难,数据集越有能力检验方法之间的真实差异;如果简单方法已经接近满分,即使存在一定差距,数据集的评测价值也会受到限制。

图 2:Effectiveness 指标的变化规律,以及使用 Accuracy 和 AUC-ROC 计算得到的数据集有效性。
实验表明,Effectiveness 给出的数据集排序与性能差距的总体趋势一致,同时能够对任务难度和类别数量进行归一化。值得注意的是,在 HIV 数据集上,使用 Accuracy 时得到的有效性接近 0,而改用更适合类别不均衡问题的 AUC-ROC 后,有效性上升到约 0.4。这也说明,评价数据集是否有效,不能脱离具体的任务指标。
4. 为什么有些基准区分不了 GNN?
论文进一步提出一个假设:如果类别标签与节点数、边数、平均度等简单图属性高度相关,那么浅层模型也能够取得较高精度,数据集自然难以体现 GNN 的优势。
为验证这一点,研究分析了边数、节点数、平均聚类系数、平均度,以及长度为 3 至 6 的环结构等 8 类图属性,并计算它们与类别标签之间的相关性。

图 3:9 个真实数据集上的图属性与类别标签相关性。
结果显示,边数和节点数与类别标签的相关系数在多数数据集上超过 0.2,部分数据集超过 0.4;在 MUTAG 等分子数据集中,环结构数量与标签也表现出明显相关性。这意味着,某些基准中的标签可能被简单图属性部分解释,模型无需学习复杂结构就能取得不错的成绩。
5. 用可控合成数据验证因果机制
真实数据集的属性与标签关系无法自由调整,因此很难单独观察某一种图属性对模型性能的影响。论文为此提出一种相关性可控的合成图数据集生成方法:研究者可以指定某个图属性与类别标签之间的相关系数,再生成满足该相关关系的数据。
论文构建了两组基于 Erdős-Rényi 图的二分类数据:
- Syn-CC: 控制平均聚类系数与标签的相关性,同时让平均度与标签不相关;
- Syn-Degree: 让平均度和平均聚类系数与标签保持相同的相关变化。
每组包含 9 个数据集,每个数据集包含 4096 个图,相关系数从 0.1 逐步提高到 0.9。

图 4:Syn-CC 与 Syn-Degree 数据集上的模型精度和性能差距。
在 Syn-CC 上,随着聚类系数与标签的相关性增强,GIN 的准确率持续提高,而简单基线保持在随机猜测附近,二者差距随之扩大。相反,在 Syn-Degree 上,GIN 和简单基线的准确率几乎同步上升,性能差距始终很小。
这一结果清楚说明:如果与标签相关的图属性能够被简单模型直接捕获,那么更复杂的 GNN 即使获得高准确率,也未必能体现出独特优势;只有当任务要求模型学习基线无法利用的结构信息时,基准才真正具有区分力。
6. 能否不跑完整基准,就预判数据集是否有效?
完整评测多个 GNN 和基线模型需要大量计算。论文最后尝试使用图属性和统计特征直接预测数据集的 Effectiveness。
研究从每个数据集中提取 26 项特征,并使用 Ridge、支持向量回归和随机森林进行预测。在 16 个真实数据集和 9 个合成数据集上的实验中,预测值与真实有效性的相关系数达到 0.80-0.89,且统计检验结果均达到显著水平。这表明,利用低成本的图统计特征,可以对一个数据集是否适合作为基准进行初步判断。
7. 总结
这篇论文的核心贡献可以概括为三个层次:
- 发现问题: 通过公平评测揭示部分常用图分类数据集缺乏区分简单基线与 GNN 的能力;
- 量化问题: 提出 Effectiveness 指标,将性能差距、任务难度和类别数量纳入统一衡量;
- 解释并解决问题: 分析图属性与标签的相关性,提出可控合成数据生成方法,并探索低成本的数据集有效性预测。
这项工作提醒我们:模型排行榜上的更高分,并不自动等于更强的图学习能力。要准确评价 GNN 的进步,除了设计更好的模型,还需要检查用于评分的“考卷”是否真正有效。
论文全文: IJCAI 2024 Proceedings
开源代码: GNNBenchEffectiveness
引用:
@inproceedings{10.24963/ijcai.2024/237,
author = {Li, Zhengdao and Cao, Yong and Shuai, Kefan and Miao, Yiming and Hwang, Kai},
title = {Rethinking the effectiveness of graph classification datasets in benchmarks for assessing GNNs},
year = {2024},
isbn = {978-1-956792-04-1},
url = {https://doi.org/10.24963/ijcai.2024/237},
doi = {10.24963/ijcai.2024/237},
abstract = {Graph classification benchmarks, vital for assessing and developing graph neural networks (GNNs), have recently been scrutinized, as simple methods like MLPs have demonstrated comparable performance. This leads to an important question: Do these benchmarks effectively distinguish the advancements of GNNs over other methodologies? If so, how do we quantitatively measure this effectiveness? In response, we first propose an empirical protocol based on a fair benchmarking framework to investigate the performance discrepancy between simple methods and GNNs. We further propose a novel metric to quantify the dataset effectiveness by considering both dataset complexity and model performance. To the best of our knowledge, our work is the first to thoroughly study and provide an explicit definition for dataset effectiveness in the graph learning area. Through testing across 16 real-world datasets, we found our metric to align with existing studies and intuitive assumptions. Finally, we explore the causes behind the low effectiveness of certain datasets by investigating the correlation between intrinsic graph properties and class labels, and we developed a novel technique supporting the correlation-controllable synthetic dataset generation. Our findings shed light on the current understanding of benchmark datasets, and our new platform could fuel the future evolution of graph classification benchmarks.},
booktitle = {Proceedings of the Thirty-Third International Joint Conference on Artificial Intelligence},
articleno = {237},
numpages = {9},
location = {Jeju, Korea},
series = {IJCAI '24}
}

499

被折叠的 条评论
为什么被折叠?



