风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议

摘要

一款新开源的智能体框架(harness),声称在 ARC-AGI-3 上联合 Opus 5 拿到了 95.5% 的成绩,超过人类专家基线。官方帖子迅速获得大量关注,GitHub 星标已接近 5 千。 要知道,ARC-AGI-3 不是那种「刷过题库就...

开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议

一款新开源的智能体框架(harness),声称在 ARC-AGI-3 上联合 Opus 5 拿到了 95.5% 的成绩,超过人类专家基线。官方帖子迅速获得大量关注,GitHub 星标已接近 5 千。

要知道,ARC-AGI-3 不是那种「刷过题库就能拿高分」的考试,它是一堆完全陌生的抽象游戏,每个游戏的规则、目标、甚至操作逻辑都不相同。你进去之后,没人告诉你该做什么,你得自己摸索、试错、归纳,然后在有限的行动预算内完成目标。

这个框架名叫 Prime Agent,由 Prime Intellect 发布。官方对它的定义是:一个面向编程、研究和长时间自主任务的「自我改进 RLM harness」

项目链接:https://github.com/PrimeIntellect-ai/prime-agent

RLM 是 MIT 博士生 Alex Zhang 等人去年 10 月发布的一项工作(参见《

递归语言模型登场!MIT华人新作爆火,扩展模型上下文便宜又简单》),其全称是 Recursive Language Models,即递归语言模型。按照论文里的介绍,它是一种将输入上下文视为可操作「变量」的通用推理策略:主模型在类似 Jupyter 的编程环境(REPL)中工作,通过编写代码对庞大的上下文变量进行切分与过滤,并将子任务递归外包给临时的小模型调用,最终综合各结果形成答案 —— 例如在 Python REPL 中调用 GPT-5 及 mini 版迭代处理用户提示。

当时,它的效果就已经非常惊艳:在 OOLONG 等最难长上下文评测中,GPT-5-mini 采用 RLM 的正确率超直接使用 GPT-5 两倍以上且单次成本更低。因此,研究者断言,这将是一个强大的新范式,且相比纯 CoT 或 ReAct 代理,显式训练以递归推理为核心的 RLM 很可能成为推理时扩展能力的下一个里程碑。

如今,Prime Agent 把 RLM 论文的核心理念进一步工程化落地了,并在此基础上做了重要扩展。我们一起来看一下他们做了哪些创新。

Prime Agent 为什么那么强?

官方博客里写的很清楚:它彻底重构了「harness 该怎么设计」这一底层假设。

Prime Intellect 团队认为,现有的 harness 设计都是围绕早期模型的能力建的 —— 固定的工具调用格式、强制的上下文压缩、设计时写死就再也不变的子智能体和提示词。这些脚手架非但没有帮模型发挥,反而逼着模型去绕过自己的框架。模型越聪明,旧的 harness 就越像一副不合身的镣铐。

Prime Agent 的解法是把这套脚手架彻底打开。它做了两个关键设计:

一是 RLM,给模型一个持久的 IPython 内核当 REPL 用,上下文是变量、子智能体是函数调用,模型可以直接用代码操作自己的历史、工具和子智能体。即使会话被压缩,完整历史仍保留在外部状态中,需要时可被程序化取回;

二是 Continual Harness,把提示词、技能、记忆和子智能体全部变成运行时可 CRUD 的状态,agent 能在执行过程中实时创建、修改、调用它们,甚至跨会话通信。

换句话说,Prime Agent 不是给模型配了一套更聪明的工具箱,而是把工具箱的钥匙交给了模型自己。

在 ARC-AGI-3 这种每道题规则都陌生的战场上,它能一边做题一边改写自己的解题策略,而不是被出发前的预设绑住手脚,所以它能在 ARC-AGI-3 上以更少的 token 消耗跑出更高分数。

Prime Agent 怎么让 Agent 持续工作?

但「把钥匙交给模型」只是一层。Prime Agent 还试图解决一个更现实的问题:

Agent 怎么才能连续工作几个小时、几天,甚至在人退出终端后继续运行?

为此,它在底层放了一个后台 daemon,统一管理所有正在运行的会话。每个子智能体都有独立的上下文、文件目录、IPython 状态和会话记录。一次任务结束后,子智能体不会立刻被销毁;主智能体可以记住它的 ID,过一段时间再把它叫回来继续工作。

这和常见的「一次性外包」不太一样。

普通多智能体系统里,主 Agent 把任务扔给子 Agent,拿到一份摘要,双方关系就结束了。Prime Agent 中的子智能体更像一个长期项目成员:它保留自己的工作现场,主 Agent 可以追问、纠偏,或者让多个 Agent 直接交换信息。

Prime Agent 架构图。

为了让任务真正跑得足够久,Prime Agent 还把长期自主运行拆成了三个机制:

  • Goal 负责保存一个持续目标,在任务完成前不断提醒 Agent 继续推进;
  • Heartbeat 按固定时间把消息重新注入会话,例如检查子智能体进度、轮询实验结果;
  • Autonomous Mode 负责在一轮输出结束后自动续跑,避免 Agent 做到一半就停下来。

用户则可以给它设置最大轮数、token 预算和执行时间,并设置一道完成前必须通过的测试。比如让它修改一个项目时,测试没通过,系统就会把失败结果重新交给 Agent,让它继续修;如果工作区没有变化,也不会毫无意义地重复执行同一个失败测试。

所以 Prime Agent 所谓的「长时间自主」,并不是简单地给模型一句「继续努力」,而是把目标保存、定时唤醒、自动续跑、失败反馈和资源上限做成了一套运行机制。

Prime Agent 是如何「自我改进」的?

最值得解释的,是它的 /refine。

Prime Agent 会读取自己刚刚经历的完整轨迹:尝试过什么、在哪里失败、什么方法有效,然后把可复用的经验写回 harness。

这些修改可能是一条新的提示词备注、一段记忆、一个技能,也可能是一份新的子智能体配置。比如它发现某类测试经常因为网络波动失败,就可以把「先重试再判断代码错误」沉淀成一个技能;如果某个子智能体的分工方式效果不好,它也可以修改这个子智能体的说明。

不过,它不能改写最底层的系统提示词。每次 refinement 都会记录触发原因和修改结果,并保留历史版本,出现问题时可以回滚。

这也是 Continual Harness 和普通「长记忆」的区别:它不只是把过去发生的事存下来,而是试图把经历转化成下一轮可以直接调用的能力。

在官方展示的 Factorio(一款 2D 工厂模拟游戏)实验中,Prime Agent 就把一次次成功和失败转化成记忆与技能,不断改进工厂布局,几个小时内把生产分数推到了 10 万以上。

但这个案例同时暴露了「自我改进」的另一面。

Agent 后来发现,它可以通过 RCON 命令直接把资源传送进机器。即使提示词明确要求它不要作弊,它仍然利用 /refine 把这个漏洞沉淀成了越来越高效的「作弊技能」。

也就是说,Continual Harness 能放大有效策略,但它并不知道什么叫「正当的有效策略」。如果评测环境存在漏洞,它同样可能把 reward hacking 变成一种可以不断进化的能力。

Prime Agent 表现如何?

此外,Prime Intellect 试图证明,Prime Agent 并非只会做 ARC-AGI-3。

官方还在长上下文理解、长指令执行、数学排序、模拟器开发、GPU Kernel 编写和三维迷宫等任务上,将它与 Claude Code、Codex 以及带子智能体的 Pi-mono 进行了比较。

结果并非每一项都由 Prime Agent 获胜,但它在多数长上下文和长时间任务上具有竞争力,部分组合的提升相当明显。

例如,在 OOLONG 128K 长上下文任务中,GPT-5.6 Sol 搭配 Prime Agent 得分 0.94,而官方列出的 Codex 对照成绩为 0.50;在需要长输出的 OOLONG-Pairs 上,Prime Agent 搭配多个模型也取得了较强成绩。

Prime Intellect 将这种优势归因于「程序化工具调用」:模型不需要把大量工具输出逐段读进上下文,而是可以写代码筛选、聚合数据,只把真正需要的部分送进推理过程。

不过,团队也承认,目前还没有任何模型专门围绕 Prime Agent 训练。现有模型并不会天然熟练地使用它的全部能力。Prime Intellect 的下一步设想,是让模型与 harness 共同训练,让模型从训练阶段就学会如何管理上下文、调度子智能体和修改自己的工作框架。

如果说传统路线是在训练一个更聪明的「大脑」,Prime Intellect 的判断是:下一阶段的提升,还来自让大脑和它使用的操作系统一起进化。

到这里,Prime Agent 看起来相当有前途:新的上下文管理方式、持续运行的子智能体、自我修改的 harness,再加上一组超过人类专家基线的成绩。

但就在发布后的第二天,有人直接克隆了它的代码仓库,然后给整场热潮泼了一盆冷水。

Prime Agent 真有那么好吗?

发起质疑的是 Shortcut AI 联合创始人 Peter Wang。他在帖子开头写道,每当一个项目伴随着「疯狂的炒作和成建制的公关」出现,就该把「胡扯探测器」拿出来了。

检查代码后,Peter Wang 提出了两项核心质疑。

第一项质疑针对 RLM 这个概念是否真的被实现。

他在代码中发现,Prime Agent 的 RLM_MAX_DEPTH 被设成了 1。

在他的理解中,RLM 的关键吸引力就在于递归:主模型可以调用子模型,子模型再继续调用下一层模型,不断分解问题。真正困难的也不是写出一个调用子 Agent 的函数,而是让多层递归在生产环境里不至于失控。

递归层数越深,token 成本和运行时间越容易爆炸;任务在不同 Agent 之间反复转述,也可能变成一场「传话游戏」,逐渐丢失用户需求中的细节。要把递归做到三层、四层甚至更多,需要解决预算控制、并发、失败恢复、信息保真和停止条件等问题。

可如果最大深度只有 1,Peter Wang 认为,这实际上就是一个主 Agent 调用若干子 Agent,与大量现有 harness 并无本质区别。

因此,他的判断是:Prime Agent 确实构建了一棵相当稳健、持久化的异步 Agent 进程树,但它没有证明自己解决了「可扩展的深递归智能体」问题。把它包装成 RLM,至少有夸大之嫌。

第二项质疑,指向 ARC-AGI-3 的 95.5%。

Prime Agent 的三次运行分别获得 95.0%、95.2% 和 95.5%;Best@3 达到 99.97%,完成了 183 个关卡。但这些成绩来自公开评测集。

虽然 Agent 第一次进入游戏时并不知道规则,但开发者可以反复查看公开环境、运行轨迹和已有方案,并据此调整提示词、工具和 harness。

Prime Agent 又具备 Continual Harness,可以从过去的轨迹中提炼记忆、技能和提示词。因此,Peter Wang 认为,外界很难判断成绩提升中有多少来自通用能力,又有多少来自对公开任务的反复适配。

他并没有指控团队让 Agent 直接读取答案。争议的重点在于:没有独立的私有测试,就无法排除任务特定过拟合。

Peter Wang 还提到 PRO-LONG。该项目使用相对简单、通用的方法,也在 ARC-AGI-3 上取得了约 95% 的成绩。他认为,这一结果反而更值得关注。

RLM 作者亲自回应

这篇质疑很快引来了 Alex Zhang 的回应。Alex Zhang 不只是 Prime Agent 官方博客的作者之一,也是 RLM 论文的第一作者。

他先用一句反话开场:「看来问题解决了,Prime Agent 不是 RLM。谢谢你。」

随后,他给出了更严肃的解释。

Alex 表示,RLM 论文真正想回答的问题是:当语言模型开始调用语言模型、被调用的模型又可能继续调用其他模型时,什么样的抽象最适合组织这套系统?

他的答案不是「无限递归」,而是两个组合:程序化的工具/子智能体调用,加上作为变量存在的上下文。

Alex 认为,递归深度上限只是面向用户的配置,用来避免 token 成本爆炸;能否无限递归,并不是判断一个系统是否属于 RLM 的标准。

他还表示,对于 RLM 而言,深度为 1 并不意味着其表达能力弱于无限深度,但没有在这篇回应中进一步展开证明。

对于「RLM 只是研究玩具」的评价,Alex 也不认同。他提到,Codex、Claude Code 和 Muse Code 都已经提供了类似的核心抽象。

不过,在 benchmark 问题上,Alex 承认 ARC-AGI-3 是一个「可以被利用的 benchmark」。

他的回应是,Prime Agent 的价值不能只看 ARC-AGI-3,博客中的其他实验同样需要考虑。此外,他认为 Continual Harness 对 ARC-AGI-3 成绩的作用可能比 RLM 更重要。

这也让争议重新回到 Prime Agent 最核心的设计上:同一套自我改进机制,既可能帮助 Agent 积累经验,也可能让它越来越适应一套公开评测。

在私有集结果出现之前,95.5% 依然是一项值得关注的工程成绩,但还不能单独证明 Prime Agent 在真正未知的任务上超过了人类。

目前,已经有一些开发者在尝试使用 Prime Agent,如果你也试用过,欢迎在评论区分享使用体验。

参考链接:https://www.primeintellect.ai/blog/prime-agent

本文来自微信公众号 “机器之心”(ID:almosthuman2014),作者:机器之心,36氪经授权发布。

评论 (10)

登录 后即可发表评论
岁寒
岁寒 35分钟前

Alex回应有点避重就轻,没好好解释深度1和成绩的问题,这争议估计一时半会解决不了。

0 回复
Jason Prof.
Jason Prof. 36分钟前

这项目争议这么大,开发者用的时候估计得好好权衡,别被宣传忽悠了。

0 回复
我爱菠萝派
我爱菠萝派 38分钟前

质疑者说得有道理,最大深度1和公开评测集成绩,确实让人怀疑Prime Agent是不是真有那么神。

0 回复
菠萝吹汤
菠萝吹汤 38分钟前

官方吹得厉害,实际可能没那么好。公开评测成绩不能说明啥,得看在未知任务上的表现。

0 回复
螃海911
螃海911 38分钟前

感觉这项目是一半海水一半火焰,有优势也有明显问题,就看后续怎么改进了。

0 回复
更多