风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

MLS-Bench:首次系统评测AI能否真正发现新机器学习方法

摘要

自进化AI的临门一脚:不是会跑实验,而是能提出新方法 过去一年,“Auto-Research”“自进化AI”“递归自我改进”成为AI前沿最常被提及的方向。模型已能进入代码仓库、调用工具、修改训练脚本,并根据实验反馈迭代优化;...

MLS-Bench:首次系统评测AI能否真正发现新机器学习方法

自进化AI的临门一脚:不是会跑实验,而是能提出新方法

过去一年,“Auto-Research”“自进化AI”“递归自我改进”成为AI前沿最常被提及的方向。模型已能进入代码仓库、调用工具、修改训练脚本,并根据实验反馈迭代优化;部分系统还能更新记忆、积累技能、清洗数据,甚至参与下一代模型的工程构建。 但能力越强,问题越本质:当AI越来越熟练地执行研究动作,它究竟是在更高效地复刻人类已知路径,还是已经具备像顶尖人类研究者那样——识别现有范式的根本缺陷、提出前所未有的机制、并证明其跨任务、跨规模、跨数据的普适价值?

三种能力,一种被长期混淆

当前关于“AI自进化”的讨论,常将三类能力混为一谈: 第一类是执行能力——把人类定义好的需求翻译成可运行代码与实验流程; 第二类是工程优化——在固定目标下反复调参、替换模块、从候选池中筛选高分方案; 第三类才是方法发现——洞察已有方法的本质局限,提出此前不存在的新结构、新目标或新机制,并通过多条件验证确认其泛化生命力。 真正推动机器学习演进的,从来都是第三类突破:卷积、残差连接、Attention、LayerNorm、扩散模型、PPO……它们的价值不在于某次评测涨了几个点,而在于能迁移到新任务、随数据与算力增长持续有效、最终沉淀为整个社区的基础语言。 遗憾的是,现有评测几乎从未严肃测试这一能力。

旧评测的三大盲区

数据挖掘型任务聚焦单一数据集上的清洗、选模与调参,测的是ML工程,而非方法迁移性; Circle packing、kernel优化等依赖秒级评分器的任务,靠大规模采样筛选最优解,却与一次训练动辄数小时的真实研究节奏完全脱节; 另一些工作让模型读论文、写报告、提想法,但最终由语言模型评判“新颖性”,并未真实运行、验证候选方法。 这些任务分别检验了代码实现力、廉价搜索力、表达组织力——却都绕开了那个核心问题:AI提出的改动,是否真的构成一个可推广、可扩展、可证伪的新方法?

MLS-Bench:把“科研闭环”变成可测量的标准

为填补这一空白,来自加州大学伯克利分校、普林斯顿大学、清华大学、华盛顿大学、普渡大学、哈佛大学、宾夕法尼亚大学、上海交通大学、加州大学圣地亚哥分校和卡内基梅隆大学的联合团队,推出首个面向方法发现能力的系统性评测基准——MLS-Bench。 它包含12个主流机器学习子领域的140个真实研究任务,覆盖语言模型预训练与后训练、视觉生成、强化学习、机器人、AI for Science、因果推断、时间序列、主动学习、可信学习等方向。每个任务均要求模型围绕一个明确的研究问题(如KV缓存压缩、抗体-抗原结合建模、低比特训练稳定性提升),提交一个**可运行、可复现、可验证**的新方法,并在多个数据集、模型规模、环境配置或任务设定下接受检验。 更重要的是:所有任务均内置至少三种强人类基线方法(含领域公认最优解),且全部在**同一代码库、相同训练流程、一致评分逻辑**下完成复现——模型是否超越人类,不再依赖模糊对比,而是一次次硬碰硬的跨条件验证。

关键设计:让“进步”无可取巧

为确保分数真实反映方法创新,MLS-Bench采用三项硬约束: 第一,**代码边界隔离**:每项任务逐行标注“允许修改”与“必须保护”的代码范围。研究优化器时,不得擅自改动模型结构;研究训练目标时,不得绕过问题去替换数据或评分逻辑。涉及模型结构的任务,系统还会自动校验参数量,防止靠堆参数“作弊”。 第二,**代理实验保序**:对原始成本过高的任务(如千亿模型预训练),采用缩小规模的代理实验,但严格要求——所有强人类方法在代理环境下仍保持原有性能排序。若缩放导致优劣反转,则该任务不予采用。 第三,**统一跨域评分**:不同领域指标各异(FID、困惑度、回报率……),MLS-Bench不直接平均原始数值,而是以复现基线为锚点:最弱基线=0分,最强基线=50分,理论上限=100分。所有候选方案得分均表示其相对于人类已知方法的位置,真正实现“横向可比、纵向可溯”。

实测结果:AI仍是卓越的工程师,尚非真正的发现者

主实验评测了当时5个最前沿大模型,设置两种模式:一是直接提交首次生成的方案;二是作为智能体,在代码库中多轮运行、读取反馈、修改再提交——且所有模型均可完整查看人类最强方法的源码。 结果清晰而一致:**没有任何一个模型的整体表现超过人类最强基线。** 多轮迭代虽能改善局部结果,但无法突破人类已设下的方法天花板。 进一步提示消融与专家人工分析揭示出稳定模式:模型最擅长的是“调优+重组”——从不同强基线中抽取损失函数、网络模块、正则技巧,再做参数调整与组合拼接。这些方案大多能运行、有时有收益,但极少出现具备原理洞见的新机制。 当提示明确要求“发现新方法”时,模型表现反而下降;而当提示聚焦“优化已有方法”时,效果显著提升。这说明:当前模型的底层能力,仍牢牢锚定在工程优化层,尚未生长出科学发现所需的假设构建、证据判断与跨条件推理能力。

更深瓶颈:不是不会写代码,而是不会设计科学闭环

研究团队还设计了一组更具挑战性的实验:在一个真实预训练环境中,将原本三次固定规模训练,改为等价的灵活算力预算,由模型自主决定——用多大模型、训多少token、先试哪个假设、何时做最终验证。 理论上,这种自由应极大提升探索效率。实际结果却相反:除个别案例外,赋予模型更多决策权后,整体表现反而下降。模型无法稳定识别高信息量实验,难以根据中间结果修正后续计划,更无法在有限预算下建立可信证据链。 即使额外提供相关论文与理论推导,模型也难以将其转化为有洞见的假设或严谨的验证路径。这说明,瓶颈早已不在知识获取或代码生成,而在于更底层的**科学判断力**:如何界定问题本质、如何区分竞争性解释、如何分配稀缺计算资源、如何从不完整证据中逼近真相。

下一阶段:从“廉价搜索”走向“昂贵发现”

AlphaGo、AlphaTensor、FunSearch、AlphaEvolve的成功,依赖一个共同前提:验证足够快、足够稳、足够明确。失败可即时淘汰,海量采样可弥补单次误判。 但真实科学研究恰恰相反:一次预训练、一次机器人部署、一次分子模拟,耗时数小时至数天,结果常具噪声、仅反映局部、需多次交叉验证才能形成判断。系统无法靠暴力搜索取胜,必须学会用小实验探路、用代理推断全局、用预算约束驱动推理。 因此,Auto-Research的下一程核心命题已清晰浮现:**在验证难以规模化的情况下,实现可规模化的科学发现。** 这要求AI真正走完一个闭环——提出有原理支撑的假设,设计能证伪的竞争性实验,动态分配有限算力,基于不完整证据迭代修正,并最终在多样化条件下验证方法的生命力。

这不是终点,而是标尺的起点

MLS-Bench的意义,远不止新增一张榜单。它第一次将“机器学习方法发现”从模糊叙事,转化为可定义、可隔离、可复现、可追踪的工程目标。30题精简版已被多家头部模型团队纳入官方评测体系,标志着“真实科研能力”正成为新一代AI能力的核心标尺。 当然,它也有局限:140题完整评测仍需数百H100小时;静态榜单难以捕捉模型能力的快速跃迁;当前覆盖仍集中于方法实现环节,尚未延伸至问题提出、假设质量评估、跨阶段决策等更上游能力。 但正是这些局限,指明了未来方向:如何降低高质量验证的成本?如何构建支持长周期推理与证据累积的智能体架构?如何让AI不仅读懂论文,更能像人类一样——在混沌中识别缝隙,在沉默中听见信号,在有限中看见无限? 从“会跑研究流程”,到“能发起真正研究”,这段距离,就是Auto-Research必须跨越的鸿沟,也是AI迈向自主科学演进的唯一入口。

评论 (5)

登录 后即可发表评论
一念轻安
一念轻安 1小时前

MLS - Bench是好尝试,不过后续有很多问题要解决。内容长度:20字左右

0 回复
多乐
多乐 1小时前

AI还处于工程优化阶段,发现新方法能力不足。内容长度:20字左右

0 回复
鱼
1小时前

当前评测有问题,新基准有利于衡量AI发现新方法能力。内容长度:25字左右

0 回复
世红(余世红)

AI科学判断力不够,要跨越到自主发现新方法还有距离。内容长度:25字左右

0 回复
不靠谱先生

核心观点:现在的评测没真正测AI发现新方法的能力,MLS - Bench能填补空白,但AI目前还没达到发现新方法的水平。内容长度:50字左右

0 回复
更多