新智元报道


AI已经能写代码、跑实验,甚至靠海量试错刷新部分人类纪录。

但当目标从「把一个分数继续刷高」,变成「提出一种真正更好的机器学习方法」,最强模型还能走多远?

一项覆盖12个领域、140个真实研究任务的新工作MLS-Bench给出了并不乐观的答案。

即使拿到人类最强方法的完整实现,并被允许反复实验,当前前沿模型仍没有展示出可靠的方法创新能力。它们交出的所谓新方案,基本仍是对已知方法的调优与重新组合。

更值得注意的是,MLS-Bench的评测已经进入Kimi K3和Qwen3.8-Max的官方发版表。

代码评测逐渐饱和后,头部模型厂商正在把下一个能力前沿指向同一个问题:

AI能否真正开展研究?


论文链接:https://arxiv.org/abs/2605.08678

项目主页:https://mls-bench.com/

代码链接:https://github.com/Imbernoulli/MLS-Bench

在Kimi K3与Qwen3.8-Max的官方评测表中,MLS-Bench-Lite与软件工程、终端操作和通用智能体评测并列出现。


图片分别来自Kimi K3 Tech Blog与Qwen3.8-Max官方Blog。

这不是又一套代码题。MLS-Bench-Lite从完整评测中选出30个任务,覆盖全部12个机器学习领域,专门考查模型能否围绕真实研究问题提出并实现更好的方法。

2026年6月,Kimi K2.7-Code首次将它纳入官方发布评测;一个月后,Kimi K3再次采用;随后Qwen3.8-Max也把它写进官方发版结果。对于一个刚刚提出的研究评测,这种采用速度说明,行业关心的不再只是Agent能不能完成更多编码任务,而是它能不能推动AI本身继续前进。

拿到强方法之后

模型仍在重组答案

论文主实验评测了五个前沿模型。模型既可以直接提交首次方案,也可以进入真实代码库,多轮修改代码、运行实验,再提交最终实现。

研究团队还把强人类基线的代码直接交给模型,其中包括每个问题上公认的SOTA方法。换句话说,模型不是在信息不足的情况下从零猜答案,而是已经站在当前最好方法之上,任务只剩下继续向前一步。

论文主实验的结论很明确:在当时评测的五个模型中,所有模型提出的方法在整体表现上都无法超过Human SOTA。即使模型已经拿到Human SOTA的实现,并被允许进行多轮实验,这一步也没有发生。

随着更强模型进入榜单,汇总分数还会继续上涨,但领先成绩本身仍然不高,评测远未饱和。与此同时,一次总分超过某条基线,并不自动意味着模型发现了新的机制。更关键的问题是,增益究竟来自方法创新,还是来自更充分的调优、搜索与已有组件重组。


网页柱状图按领域展示首次方案、多轮Agent与Human SOTA;论文主实验中,模型方法的整体表现均未超过Human SOTA。

论文进一步检查了模型到底在做什么。结果发现,当提示词从「发现一种新方法」改为「优化现有方案」时,模型反而做得更好。专家逐项分析提交后也看到,模型经常把已经出现过的模块重新排列组合,再把组合包装成新方法;真正新的机制极少,即使偶尔出现,也往往缺少能够解释其有效性的有洞见假设。


专家案例分析显示,模型提交往往紧贴已经看到的基线组件。

这里出现了一个颇具反差的现象。模型能够读懂代码库,识别多个基线的组成部分,也能把不同组件拼接成一个可以运行的系统。

从工程执行角度看,这已经是一种很强的能力;但从科学发现角度看,它仍然没有回答最关键的问题:为什么需要一个新的机制,它要修正现有方法中的哪项根本缺陷,又凭什么在新的数据和规模上继续有效?

当模型缺少这样的判断时,多轮实验很容易退化成局部爬山。它根据刚看到的结果微调权重、组合模块、修改训练细节,偶尔可以获得增益,却很难形成一个有解释力、可迁移的研究主张。

这不是简单的「分数还不够高」。当前模型离真正的方法发现仍然很远:它们会调参、会改工程、会拼装已知组件,却还不会像优秀的人类研究者那样提出真正有用的算法创新。

外推到科学发现

过去一年,Auto-Research与递归自我改进迅速升温。AlphaEvolve在circle packing等问题上找到更优构造,nanoGPT speedrun也让Agent围绕固定目标不断试错。

与此同时,「自进化」正在变成一个不断扩张的标签。让Agent编写更多项目代码、自动生成技能、更新记忆、清理数据、合成训练样本,甚至优化训练基础设施,都可能被放进AI改进AI的叙事中。

Anthropic在《When AI builds itself》中梳理了一条非常直观的演化路线:模型先是提供代码片段的聊天机器人,随后成为能自己运行代码的编程Agent,再发展到能够分派长程任务的多Agent系统。其内部数据显示,Claude编写的代码已经占到合并代码的80%以上,工程师人均合并代码量也出现显著增长。Anthropic同时把真正「闭环」仍放在未来:由Agent自己构建和训练下一代模型。


图片来自Anthropic的When AI builds itself。

国内也出现了相似叙事。MiniMax M2.7的官方发布把模型创建强化学习技能、更新记忆并优化自身学习流程称为「开启模型的自我进化」。这些进展确实在提高AI研发的自动化程度,但它们主要回答的是模型能否更深地参与已有流程。

更关键的问题还没有因此消失:AI能不能发现人类尚未发现的方法?

这些工作证明了大模型可以成为强大的搜索器,但它们通常拥有一个共同条件:验证便宜、反馈快速、结果能被单一分数清楚判断。系统可以一次生成大量候选,再从中选择最优答案。

真正改变机器学习的方法不是这样诞生的。Attention、残差连接、归一化和Adam的价值,不在于它们只在某一次实验里多赢了几个点,而在于它们换到不同数据、模型和规模后依然成立。支撑科学进步的,是这种能够迁移、能够扩展的方法发现。

这也呼应了Richard Sutton在《苦涩的教训》中提出的标准。长期真正有效的,往往是通用、并能随计算资源继续发挥作用的方法;我们需要的是能够完成发现过程的AI,而不是只装载人类既有发现的系统。

从GAN、Seq2seq、VAE、BatchNorm,到ResNet、Transformer、扩散模型、LoRA、RMSNorm与PPO,机器学习社区的繁荣来自一批经得起时间、领域与规模检验的方法。让AI更快实现这些方法当然重要,但递归自我改进真正有野心的目标,是让AI独立发现下一批这样的方法。

此前没有一套评测真正测量这种能力。很多工程类任务把方法设计、超参数、数据处理和实现技巧混在一起;一些开放式研究任务又只看最终分数,无法判断提升究竟来自算法创新,还是扩大模型、修改评测器等捷径。

现有基准的覆盖方式也存在断层。一类任务本质上是数据挖掘竞赛:给定训练集和测试集,让模型清洗数据、组合现有算法,最后提交预测结果。另一类任务要求Agent生成研究方案或论文,再由语言模型从新颖性、完整性和可行性等维度打分,却不直接运行并比较它提出的方法。前者更接近工程,后者更接近文本评价,都没有正面回答方法到底有没有变好。

MLS-Bench要锁定的,正是这条最难测的能力轴。

140道题

把「方法创新」单独拿出来考

MLS-Bench覆盖语言模型预训练与后训练、视觉生成、强化学习、机器人、机器学习系统、AI for Science、优化与理论、因果推断、时间序列和可信学习等12个主要方向,包含140个来自真实代码库的研究任务。

这个覆盖范围决定了它不是围绕某一种模型能力制作的专门题库。语言模型任务会追问训练目标、优化器和路由机制能否改进;视觉生成任务会涉及采样与生成过程;强化学习与机器人任务需要方法在不同环境中维持收益;系统方向则把算法放回真实吞吐、资源和执行约束中。理论、因果、时间序列与AI for Science又引入了完全不同的归纳偏置与验证方式。

具体任务可以从KV缓存压缩一路延伸到时空交通预测、黑洞图像重建、抗体与抗原结合、机器人世界模型以及训练量化。它们来自不同研究社区,也使用完全不同的指标。这个广度本身就是工作的重要部分:它把「AI还能在哪些问题上推动机器学习」从少数热门案例扩展成了一张跨领域研究地图。

换言之,MLS-Bench不是在寻找一个特别适合Agent的领域,然后据此宣布AI已经会研究。它把今天机器学习研究中一批重要问题放进同一套可执行评测,希望观察一种能力能否跨越领域边界:模型是否能识别现有方法的实质局限,并提出在多个条件下仍然成立的改进。

每道题都不是复述论文,也不是复现已有结果。模型需要围绕一个明确问题,设计新的优化器、训练目标、注意力变体、采样策略或路由规则,并提交真正可以运行的代码。

每个任务至少包含3个检验迁移能力的测试环境,以及至少3个强人类基线,其中包括领域公认的SOTA。所有基线都由研究团队在同一套代码与评测流程中重新实现和校准。

这里的「强基线」不是论文中抄来的一行数字。研究团队需要把至少三种具有代表性的人类方法重新接入任务,确认它们能够在统一代码库中恢复应有表现。只有这样,模型最终超过或落后于基线时,差异才不会来自不同训练代码、数据版本或实现质量。

这个过程同时校准了任务边界。如果最强的人类方法无法在允许修改的范围内表达,限制就过严;如果模型可以随意改动数据、训练预算或评分流程,限制又过松。每个任务都要在这两者之间找到可验证的边界:它既容纳真正的方法创新,又排除与研究问题无关的取巧空间。


模型与人类基线在相同代码库、相同训练协议和多个测试环境中接受比较。

为了确保测到的是目标研究问题,团队冻结数据管线、评测器和共享训练协议,只开放需要研究的组件。如果任务涉及模型结构,系统还会检查参数规模,防止模型靠增加容量换分。只在可见环境中提高分数、换到其他数据或规模便失效的方案,也不会被视为真正进步。

不同任务会用不同方式检验这种迁移。有的更换数据集,有的更换模型尺度,有的更换环境或训练条件。模型不能只针对眼前反馈写一个特例,也不能靠记住某个公开测试集的规律拿分。一个候选方法必须在至少三个条件下继续带来收益,才有资格被称为方法层面的进步。

团队还做了一项直接的防作弊消融:移除模型规模检查。结果,被测模型会通过增加参数量获取更高分,部分结果甚至能轻易超过强人类方法。重新打开检查后,这条捷径消失。这个实验说明,如果不锁住容量等变量,一张看似亮眼的自动研究成绩表,很可能测到的只是模型发现了一个更大的网络。

这套严格控制非常关键。它让最终结果能够回答一个过去一直含混的问题:分数上涨,到底是方法变好了,还是工程空间变大了?

更多采样有用

但跨不过方法发现的门槛

把推理预算继续拉高,能否解决问题?


更多迭代和大规模测试时采样可以带来收益,但提升很快触顶。

实验显示,增加迭代次数和测试时采样确实能够提高成绩,但主要作用是继续搜索和打磨已有方向。简单任务上的收益很快饱和;当模型只能看到部分环境的反馈时,继续搜索还可能过度适应可见结果,反而损害未开放环境中的表现。

这对当前流行的「推理时算力能够解决一切」提出了一个具体边界。测试时扩展擅长在已经定义好的候选空间中增加尝试,但方法发现要求模型先创造一个值得搜索的新空间。前者可以通过更多样本提高命中率,后者则需要对问题结构形成新的判断。只增加尝试次数,并不会自动补上这一步。

研究团队随后把模型放进一个更接近真实预训练研究的场景。原本可用于三次完整345M参数训练的算力,被改成可自由支配的实验预算。模型可以自行决定代理模型大小、训练token数、实验次序,以及何时进行昂贵的完整验证。

自由更多,结果却通常更差。有的模型积极消耗预算,最终性能下降;唯一取得提升的模型反而只使用了很少算力。


算力机会更多,并不意味着模型会自动选择更有信息量的实验。

这揭示了比「想不出新点子」更深的瓶颈。科学研究还需要判断什么假设值得验证、哪个小实验最有信息、什么时候证据足够,以及何时应该停止一条错误路线。当前模型不仅缺乏方法创新,也缺乏建立和验证证据所需的更广泛科学判断力。

研究团队还测试了一个看似直接的补救方向:给模型更多外部知识。模型可以使用网页搜索,也可以拿到基线论文的详细推导和相关理论背景。然而这些额外信息带来的整体增益仍然有限,许多情况下甚至没有明显超过普通的多轮实验。


增加网页搜索、推导和理论背景,只带来有限改善。

这意味着瓶颈并不只是「模型没读过这篇论文」。知道更多术语、公式和相关方法,不等于能够提出一个有洞见的假设;提出一个听起来合理的假设,也不等于能够设计出足以区分多种解释的实验。知识检索解决的是信息可得性,科学判断解决的却是下一步该相信什么、验证什么。

自进化AI

下一步不能只靠堆搜索

MLS-Bench最终提出了一个更根本的范式问题。

今天这条路线并非凭空出现。从AlphaGo、AlphaZero的博弈树搜索,到AlphaTensor把数学结构转化为可搜索对象,再到FunSearch和AlphaEvolve让语言模型生成代码候选,核心循环逐渐稳定为:提出大量方案、自动执行、按分数筛选,再用优胜者生成下一轮候选。


从AlphaGo到AlphaEvolve,搜索对象从棋局逐渐扩展到程序与算法。图源:作者报告。

这条路线之所以强大,是因为它把模型的生成能力接到了一个明确验证器上。只要每个候选都能快速、可靠地得到分数,增加采样就能系统性地扩大搜索范围。AlphaEvolve不只解决数学构造,也优化了数据中心调度、芯片设计和Gemini训练流程,说明这种范式并非没有现实价值。

当验证器廉价而明确时,扩大采样规模是一条有效路线。但真实科学发现中的验证往往昂贵、延迟、多阶段,而且只能观察到部分结果。模型无法无限调用一个便宜评分器,只能提出有洞见的假设,用有限实验取得信息,再决定哪条路线值得投入更多算力。

论文将这项挑战概括为:在验证难以规模化的条件下,实现可规模化的科学发现。

传统代码评测正在逐渐饱和,AI for Research很可能成为下一个真正拉开模型差距的前沿。Kimi K3和Qwen3.8-Max已经将MLS-Bench-Lite纳入官方发布,只是这场长期测量的开始。

真正的递归自我改进,不是让AI更快地搜索人类已经定义好的空间,而是让它有一天能够独立提出、验证并建立那些真正推动AI继续前进的方法。

参考资料:

Kimi K3 官方博客:https://www.kimi.com/blog/kimi-k3

Qwen3.8-Max 官方博客:https://qwen.ai/blog?id=qwen3.8

Anthropic《When AI builds itself》:https://www.anthropic.com/institute/recursive-self-improvement

MiniMax M2.7 官方发布:https://minimaxi.com/news/minimax-m27-zh - Richard Sutton《The Bitter Lesson》:https://bitterlesson.ai/

Google DeepMind AlphaEvolve:https://deepmind.google/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/

编辑:LRST