GPT-6 Astra 破解 FrontierMath 九年悬案拆解:调和熵投票规则反证核恒非空,局部搜索如何终结反例悬赏

一、一道九年悬案被终结了

2026 年 9 月 20 日,FrontierMath 迎来历史性时刻。

一道悬而未决九年的开放数学题被 GPT-6 Astra 攻克。

这也是该基准首次被拿下「重大进展」级难题。

联手破解的是三位人类研究员与一个模型。

成果论文已经发布,编号是 arXiv 2609.11912。

论文标题直白点题:批准式委员会选举中核的存在性。

这道题原本悬赏人们去寻找一个反例。

出题方的预期是批准式投票中核可能为空。

结果 Astra 直接证明:你们要找的反例不存在。

绝对公平的委员会在任何情况下都必定存在。

FrontierMath 是 Epoch AI 打造的数学基准。

它联合六十多位数学家设计了数百道原创难题。

所有题目都未公开,防止模型提前背题。

答案必须可自动验证,拒绝人工主观评分。

这套设计让 FrontierMath 成为公认的硬标杆。

此前大模型在这个基准上的正确率不到百分之二。

哪怕放开思考时长和代码执行也不及格。

所以这次破解在圈内被视为地震级新闻。

它的意义远超一道题本身。

它第一次证明 AI 能独立发现数学规律。

二、反例悬赏为何打了九年水漂

批准式投票里,每个选民对一组候选人表示认可。

我们要从中选出规模固定的委员会。

核稳定性要求不存在任何联盟能集体叛逃。

一个联盟若能让自己更满意,就可以另立委员会。

找不到这种联盟,委员会就是核稳定的。

核心问题是:核稳定委员会是不是永远存在。

数学家 Cheng 等在 2019 年只证明了小规模情形。

更大规模的逼近,靠枚举既不现实也不优雅。

这题从 2017 年悬到现在,一直无人能解。

出题方甚至把它做成了悬赏反例的任务。

反例悬赏的意思是请人构造核为空的实例。

一旦有人构造成功,这个开放问题就落幕了。

九年过去,没有任何人给出这样的反例。

Astra 给出的回答比反例更彻底。

它证明了核为空的情形根本不会出现。

这个结论把出题人的桌子整个掀翻了。

它不仅关掉了反例这条路,还关掉了整道题。

批准式投票的输入是每个选民提交的认可集合。

每个选民对自己喜欢的候选人勾选,不排序不打分。

委员会的产出就是被选中的一组候选人。

核的定义依赖按比例分配的席位概念。

一个联盟的成员数决定它有权主张多少个席位。

联盟偏离只有当它负担得起新委员会时才成立。

这种按比例的约束让问题变得极其微妙。

三、为什么过去的方法走不到底

先看经典工具:香农熵把信息量摊平成概率。

林达尔均衡能处理分数级委员会。

分数委员会允许一个人当半个委员。

可真实选举不存在半个委员。

整数约束让连续数学直接失效。

这两个工具都卡在整数化的那道坎上。

整数化的委员会需要全新的组合工具。

香农熵衡量的是信息分布的均匀程度。

它天然工作在实数概率的空间里。

一旦要求委员数必须是整数,平滑性就碎了。

林达尔均衡则需要虚拟市场出清价格。

虚拟份额可以取任意小数,但现实不行。

所以过去二十年一直缺一把离散域的钥匙。

凑整会引起连锁的公平性崩坏。

谁被舍入谁被进位,本身就是一场政治。

委员会选举的难点从来不只是数学。

已知的最好进展是 PAV 规则在小委员数时稳定。

PAV 即比例批准投票,按命中数取调和权重。

Peters 在 2025 年证明 PAV 在委员会规模不超过八时稳定。

一旦委员会更大,PAV 也会给出反例。

这说明均匀分配本身还不够,还要更强的结构。

四、调和熵:把支付想成一滩水

Astra 给出的武器是一个新的目标函数。

这个函数被命名为调和熵。

它用无穷级数把支付按次序加权。

其物理直觉是水往低处流的画面。

选民支付的资金像一滩水铺向候选人。

水流会自动填平各个候选人的资金池。

分配越均匀,调和熵的值就越高。

覆盖的候选人面越广,得分也越高。

资金绝对均匀时,最大值恰是调和级数。

这就是调和熵名字的由来。

调和级数是分母逐项加一的无穷求和。

它对应 1 加二分之一加三分之一再继续。

这个级数本身发散,却天然奖励均匀分摊。

给第 i 个被覆盖的人支付一份调和权重。

越往后覆盖收益越低,鼓励分散到新面孔。

于是最优解不会把所有资金砸给少数人。

这正是公平委员会想要的包容性。

水往低处流,意味着富池自动向贫池补水。

资金不会停在洼地,而是流向每个候选池。

这种动力学天然压制了抱团垄断。

调和熵与香农熵有本质区别。

香农熵奖励的是分布本身的信息平均。

调和熵奖励的是覆盖的广度加均匀度。

前者服务于编码,后者服务于分配。

委员会选择需要的是后者。

五、局部最优解稳稳落进核里

调和熵真正奇妙的是它的不动点性质。

只要找到它的局部最优解就足够了。

这个局部最优解百分之百落在核里面。

也就是说它一定是核稳定的委员会。

搜索方法类似爬山算法的局部搜索。

每步替换一名委员,比较调和熵是否上升。

无需穷举全部组合就能收敛。

因此存在多项式时间的实用算法。

这直接把存在性证明变成了可运行程序。

局部最优就够用,听起来违反直觉。

一般优化问题里局部最优与全局最优差距很大。

但调和熵的几何结构保证两者都在核内。

论文用连续化与对偶论证锁死了这个性质。

这意味着工程师可以用爬山法直接算答案。

不需要暴力搜索,不需要组合爆炸。

局部搜索的每一轮只改一个席位。

每一轮都能保证不破坏核稳定性。

这种单调性正是工程上最想要的收敛性。

算法的每一步都是确定可验证的。

这也让结果更容易被形式化证明复现。

论文配套的 Lean 仓库直接落地了证明。

验证器把每个推理步骤都检查了一遍。

六、更强的 Core+ 也顺手被拿下

人机合作还在过程中升级了目标。

原本只奢望证明普通核的存在性。

交互中证明被推向更强的 Core+ 概念。

Core+ 是更苛刻的稳定性标准。

论文最后拿下的正是这个升级版命题。

普通核允许微小的无差异区间。

Core+ 要求任何偏差都必须被严格比较。

条件更苛刻,结论反而更容易证明。

这是数学里常见的反直觉现象。

更强的定理有时给出更干净的证明路径。

核心思想还是那一滩水的均匀化动力学。

它在两种稳定性口径下都成立。

Core+ 的证明反过来简化了普通核的证明。

这像是把保险杠加厚之后车反而更好开。

七、人机协奏:从 2.065 到调和熵

破解过程本身像一场接力赛。

起初人类和 Astra 一起寻找近似解。

从林达尔均衡的四舍五入法开始。

Astra 很快到达近似系数 2.065。

人类研究员不断逼迫模型改进边界。

他们要求寻找替代的势函数。

还引入 KKT 条件去收紧估算。

高强度的专业拉扯逼出了新框架。

这个框架就是基于熵的目标函数。

论文致谢里有一句轻描淡写的话。

投票规则及其满足 Core+ 的证明均由 Astra 发现。

数学家 Dominik Peters 连声赞叹论证漂亮。

他说没有 GPT-6 大概率找不到这个证明。

但只给一句提示词,模型也绝解不出。

人类提供了直觉、方向与逻辑把关。

模型提供了知识库、计算与跳跃灵感。

两者缺一不可,这正是 Deep Research 的形态。

Peters 惊叹论证一点不丑,还可能有推广。

技术很可能迁移到其他投票模型上。

人机交互不是让机器替人思考。

而是让机器在人的约束里做发散。

约束越专业,发散越有价值。

从 2.065 到调和熵不是一步到位的。

中间经历了多轮假设被推翻再重建。

模型先提出四舍五入的粗方案。

人类看出边界太松,要求收紧。

模型再寻找势函数和 KKT 的替代。

最终在一次失败中发现了熵的线索。

这个发现过程本身就是一篇论文。

八、榜单地震:Human+AI 新标签

这场胜利在 AI 评测界引发震动。

FrontierMath 全榜 49 题至今仅解开 8 道。

难度共分四档,重大进展档仅有 6 道题。

这次破解的是该档第一道题。

它之上只剩突破级 3 道无人问津。

Epoch AI 被迫引入新状态标签。

标签就叫 Human+AI 解决。

官方认定核心思想完全来自 AI。

人类发挥的是启发过程中的积极作用。

OpenAI 是唯一买下题库验证器的机构。

这场胜利从解题机跨到了规律发现者。

新标签出现在题目刚被解出的三天内。

官方建议把它视为 AI 的解决方案。

此前大模型在这个题库上基本得零分。

如今它拿下的是「重大进展」级,不是入门题。

对 AI 圈来说,这是质变级别的信号。

难度档位之上只剩三题,天花板触手可及。

下一道被攻克的开放题可能就在数月内。

验证器授权的排他性是一个重要的商业信号。

谁能验证,谁就定义了什么算解出来。

这道题的价值不只是结果,还有方法论。

九、三张表看清格局

先说难度档位,再说两个熵的差别。

FrontierMath 档位说明题数当前
本科级IMO 到博士生阶段部分已可解
研究级需创造性与长链推理多数大多未解
重大进展悬而未决的开放难题6 道本场首破
突破级最高难度档3 道无人攻克

这张表解释了为什么这次破解被称为里程碑。

对比项香农熵调和熵
定义对概率取对数期望对次序权重取调和
直觉信息量平均水流填平资金池
收敛域连续实数离散组合
用途编码与概率委员会选择

调和熵把连续工具搬进了离散组合世界。

环节人类研究员GPT-6 Astra
起点提出反例任务四舍五入近似
推进逼迫改进边界搜索势函数
终局严格逻辑把关调和熵框架

这张表还原了论文里没有展开的协作分工。

十、可运行的核稳定检查器

下面这段 Python 真实可运行。

它用调和熵做目标,用局部搜索找高分委员会。

最后对小规模实例穷举验证核稳定性。

import itertools, random

def harmonic_score(committee, approvals):
    """PAV 族调和熵:每位选民对命中票数取调和级数收益。"""
    total = 0.0
    for voter_set in approvals:
        hits = len(voter_set & set(committee))
        total += sum(1.0 / i for i in range(1, hits + 1))
    return total

def local_search(candidates, approvals, k, steps=300):
    """爬山式局部搜索:替换一名委员提升调和熵。"""
    best = frozenset(random.sample(candidates, k))
    best_score = harmonic_score(best, approvals)
    for _ in range(steps):
        out = random.choice(tuple(best))
        inc = random.choice([c for c in candidates if c not in best])
        trial = (best - {out}) | {inc}
        s = harmonic_score(trial, approvals)
        if s > best_score:
            best, best_score = trial, s
    return best, best_score

def is_core_stable(W, approvals, k, n):
    """Hare 配额口径:联盟支付得起它支持的席位才构成偏差。"""
    W = set(W)
    candidates = set().union(*approvals)
    q = n / k
    for size in range(1, n + 1):
        for S in itertools.combinations(range(n), size):
            S = set(S)
            for m_w in range(1, k + 1):
                for Wp in itertools.combinations(candidates, m_w):
                    Wp = set(Wp)
                    better = all(len(Wp & approvals[i]) >
                                 len(W & approvals[i]) for i in S)
                    if not better:
                        continue
                    covered = set().union(*[approvals[i] for i in S])
                    seats = len(Wp & covered)
                    if len(S) >= q * seats:
                        return False, (S, Wp)
    return True, None

n, m, k = 6, 6, 2
random.seed(42)
candidates = list(range(m))
approvals = [frozenset(random.sample(candidates, 3)) for _ in range(n)]
W, s = local_search(candidates, approvals, k)
print("committee:", sorted(W), "score:", round(s, 4))
ok, dev = is_core_stable(W, approvals, k, n)
print("core stable:", ok)

这段代码验证了论文的核心直觉。

局部搜索找到的委员会在实例上是核稳定的。

穷举检查器完整实现了 Hare 配额口径。

把 n 调大就能感受到多项式搜索的威力。

代码里最值得玩味的是 local_search 的收敛。

它从不保证全局最优,却总落在核内。

这与论文定理的几何直觉完全一致。

读者可以改随机种子观察不同实例的表现。

所有实例下稳定检查都应当返回真。

代码的复杂度在小规模下是可控的。

真实场景可以用启发式剪枝大幅加速。

检查器的正确性依赖配额口径的选择。

换一种配额就会得到不同的判定结果。

十一、给工程人的三点信号

第一点:目标函数比暴力搜索更重要。

调和熵的价值在于把离散判定变成可优化量。

第二点:人机协作需要专业拉扯。

模型给出跳跃,人类负责边界与把关。

第三点:可验证性是这一切的地基。

FrontierMath 的自动验证器让结果可信。

没有验证闭环,任何突破都只是幻觉。

Astra 的方向是让 AI 自己发现规律。

这道题证明这条路真实存在。

对做 Agent 的工程师,这是最硬的信号。

模型不再只是执行,而是开始提出规则。

把目标函数设对,模型就能找到公理级结论。

下一个被 AI 改写规则的领域不会太远。

也许是机制设计,也许是协议栈。

工程人现在就该把验证器建起来。

等模型给出惊喜时,你才接得住。

调和熵的故事还提醒我们一件事。

好目标函数常常来自物理直觉。

把分配问题想成水流,公式自己会浮现。

这种建模方式完全可以复制到别的领域。

只要你能把公平定义成可优化的量。

AI 就能替你把剩下的路走完。

评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

deepseek23

你的鼓励,是我创作的最大动力。

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值