
AI科研新前沿:自进化与方法发现之问
过去一年,Auto - Research、自进化AI和递归自我改进成为AI领域焦点。模型能进入代码仓库、迭代更新,甚至参与工程流程。随着代码能力提升,AI for Research被视为新前沿,但也引出关键问题:AI是高效执行既定工作,还是能像人类研究者一样发现新方法?
“自进化”能力拆解与现有评测困境
当前“自进化”叙事包含执行能力、工程优化和方法发现三种能力。真正推动机器学习发展的是方法发现能力,如卷积、残差连接等。然而,现有评测无法有效测试这种能力,数据挖掘型、Circle packing等任务分别测试了工程执行、廉价搜索或研究表达,但未严格回答AI能否发现可推广、可持续有效的方法。
MLS - Bench:革新AI科研能力评测
为填补评测缺口,多所高校研究团队联合提出MLS - Bench。它包含12个机器学习领域的140个真实研究任务,要求模型提交可运行方法并跨多条件检验,还重新实现至少3种强人类方法用于对比。其意义在于改变AI科研能力测量对象,追问提升是否源于算法本身、能否迁移和持续有效等。研究团队还发布30题精简版,已被前沿模型纳入官方评测。
研究方法:构建真实任务与严格控制变量
1. 从12个领域构建140道真实研究题:任务定义为围绕明确问题改进方法组件并与强人类方法比较,覆盖语言模型、视觉生成等12个方向,具体问题多样。每个任务有5项核心要素,多测试条件可避免竞赛式优化。完整140题运行成本高,30题精简版降低了成本。
2. 隔离目标研究问题,排除工程取巧:为解决归因问题,研究团队标注可修改和保护的代码范围,防止智能体通过非算法因素提高分数。同时根据强人类方法复现结果校准可修改边界,确保既能表达最强方法又不影响创新。对于高成本任务,使用代理实验并保证方法相对优劣不变。
3. 用复现结果建立跨领域统一评分:不同领域指标不同,研究团队采用“原始指标、测试条件、任务”三级聚合评分,以复现结果为锚点,聚合后表示候选方案相对强方法的位置。
研究结果:模型能力现状与局限
1. 前沿模型整体未超人类最强方法:评测5个前沿模型,设置两种工作方式,结果显示模型提出的方法整体未超人类最强方法,多轮实验也未改变总体结论,当前头部成绩水平不高,评测未饱和。
2. 模型更擅长调优和重组:改变提示发现,模型在专注优化和调试已有方法时表现更好,专家分析发现模型常重组已有组件,缺少新方法机制,移除参数规模检查会出现通过增加容量提升成绩的情况。
3. 更多迭代和大规模采样有帮助但无法突破上限:在部分任务中增加计算能改善局部结果,但收益饱和,在复杂任务上未突破上限,且会出现过拟合问题。
4. 更深瓶颈在于建立和验证证据:在真实预训练环境测试模型分配算力和修正计划的能力,结果显示模型表现不佳,额外信息帮助有限,说明模型缺少科学判断力。
5. 从廉价搜索走向完整的科学发现:常见自动发现范式依赖快速验证,而真实机器学习研究验证昂贵,下一阶段核心问题是在难规模化验证条件下实现可规模化科学发现,要求AI完成完整研究闭环。
不足与未来方向
研究存在不足,如真实研究评测计算成本高,静态榜单有局限性,MLS - Bench未覆盖科学能力全环节。未来需持续更新评测,进一步评测更多能力,摆脱对廉价验证器和大规模采样的依赖。从“会运行研究流程”到“能像优秀人类科学家一样发现并验证新方法”,AI仍有关键距离,这也是Auto - Research等下一阶段要解决的问题。

1381

被折叠的 条评论
为什么被折叠?



