风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

大模型在原子操作任务中遭遇瓶颈:从Language Scaling到Action Scaling的范式转变

摘要

大模型在原子操作任务中遭遇瓶颈 尽管大模型在材料知识理解方面表现突出,却普遍难以精准执行原子级结构操控。最新研究表明,传统被奉为圭臬的Scaling Law——即通过扩大模型规模与数据量来持续提升能力——在受物理规律...

大模型在原子操作任务中遭遇瓶颈:从Language Scaling到Action Scaling的范式转变
大模型在原子操作任务中遭遇瓶颈

尽管大模型在材料知识理解方面表现突出,却普遍难以精准执行原子级结构操控。最新研究表明,传统被奉为圭臬的Scaling Law——即通过扩大模型规模与数据量来持续提升能力——在受物理规律严格约束的空间逻辑任务中效果有限。这提示AI for Science的发展路径亟需转向Action Scaling,即聚焦可验证、可反馈、符合物理约束的真实科研行动能力。

理解不等于操作

当前大模型已在科学理解层面展现出强大能力:解析文献、预测材料性质、识别晶体结构,甚至辅助科学发现。例如,Claude Science将科研流程模块化,显著提升综述写作与基因分析效率;GNoME通过图神经网络与DFT验证闭环,产出超220万个稳定晶体结构。

然而,真实材料研究远不止于知识推理。它要求模型完成高度具象化的三维空间操作:构建特定晶面、定点掺杂、间隙嵌入、超胞扩展等。这类任务本质是受物理定律约束的几何规划问题,对模型的空间建模、坐标推理与结构因果判断能力提出全新要求。

AtomWorld:首个面向原子操作的可量化评测框架

为客观评估大模型的原子级行动能力,研究团队构建AtomWorld基准。该框架完全脱离文本问答或理论辨析,仅考核模型能否根据自然语言指令,生成符合物理规则的原子坐标变更结果。其测评流程全自动:从随机结构采样、参数初始化、结构算子运算,到生成对应指令文本;再由模型输出结构,经pymatgen StructureMatcher比对目标结构,量化成功率与几何误差。

Scaling Law遭遇能力边界

测试覆盖Claude Opus 4.6、GPT-5.4、Gemini 3.1 Pro、Qwen3-32B、Llama3-70B等主流模型。结果显示:模型规模扩大确能提升原子替换、删除、移动等规则明确任务的表现;但在旋转、区域判定、超胞扩展等依赖三维空间理解的任务上,性能提升微弱且不稳定。

典型例证是“绕原子旋转”任务:Qwen系列各尺寸模型成功率均低于15%,Claude Opus 4.6也仅约12%。这并非个别模型缺陷,而是通用大模型普遍缺乏稳定的三维空间行动能力。几何误差亦未随参数增长而系统性下降,印证了单纯扩参无法填补物理空间建模的能力鸿沟。

Action Scaling:科研智能体的新基建

AtomWorld并未否定Scaling Law的价值,而是划清其适用边界:Language Scaling解决的是“知道什么”,而材料建模需要的是“怎么做”。当前公开语料中极度缺乏“操作指令—坐标变化”的高质量动作对数据,导致模型无法仅靠语言训练自发习得空间行动逻辑。

外挂工具如pymatgen虽能提升坐标计算精度,却无法替代模型完成关键决策——例如“哪些原子属于目标区域”“新原子应置于何处”。若模型本身缺乏空间感知,工具只会将错误意图执行得更精确,最终产出逻辑错误的结构。

因此,真正有效的升级路径是Action Scaling:规模化建设动作基元库、构建带物理约束的模拟反馈机制、设计可纠错的工具调用链路,并将“行动—验证—修正”闭环作为核心学习对象。AtomWorld正是为此提供标准化底座:自动生成任务、统一结构表示、自动匹配评估,推动AI从知识容器走向可执行的科研助手。

结语:从百科全书到实验助手

AtomWorld是一面观测镜,清晰映照出当前AI for Science的核心断层:能解释材料结构,不等于能修改材料结构;能背诵周期表,不等于能在三维空间中稳定完成一次原子操作。

这一挑战贯穿整个科研链条——分子设计、自动化实验、反应路径优化皆依赖真实动作能力。未来AI for Science的关键跃迁,不在于建造更大的通用模型,而在于构建更扎实的行动基础设施。唯有当模型同时具备深度知识理解力与可靠空间执行力,科学智能体才能真正从“会回答问题”,进化为“能完成任务”的实验伙伴。

评论 (6)

登录 后即可发表评论
几许风雨_1

Scaling Law有边界,扩规模对复杂任务效果不好,不能光靠扩参来提升模型

0 回复
五指山
五指山 2周前

AtomWorld这评测框架不错,能客观测模型原子级行动能力,有它能更好找问题

0 回复
ᝰꫛꪮꪮ

大模型在原子操作有瓶颈,得从Language Scaling转到Action Scaling,不然难有进展

0 回复
_y风中的云

Action Scaling是新方向,建动作库、模拟反馈机制很重要,能让模型更实用

0 回复
theo
theo 2周前

理解和操作是两码事,现在模型理解行,操作差太远,得想办法提升操作能力

0 回复
更多