风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

远程劳动力指数跃升:Fable 5 达成16.1%自动化率,AI正逼近真实商业交付门槛

摘要

RLI刷新纪录:八个月增长超四倍 Fable 5 在远程劳动力指数(Remote Labor Index, RLI)中实现16.1%的自动化率,大幅领先 Opus 4.8(8.3%)与 GPT-5.5(6.3%)。这一成绩相较 RLI 首次发布时的最高值——2.5%,在不到八...

远程劳动力指数跃升:Fable 5 达成16.1%自动化率,AI正逼近真实商业交付门槛
RLI刷新纪录:八个月增长超四倍 Fable 5 在远程劳动力指数(Remote Labor Index, RLI)中实现16.1%的自动化率,大幅领先 Opus 4.8(8.3%)与 GPT-5.5(6.3%)。这一成绩相较 RLI 首次发布时的最高值——2.5%,在不到八个月内提升逾六倍。这并非单纯的技术参数跃升,而是 AI 系统首次在真实商业委托尺度上展现出可量化的经济替代潜力。 RLI 是什么?它测的不是解题能力,而是赚钱能力 RLI 不是传统意义上的算法基准测试。它由研究团队联合构建,覆盖 240 个来自 Upwork 平台的真实自由职业项目,涵盖 3D 建模、CAD、建筑设计、平面设计、视频动画、音频制作、数据分析、Web 应用等 23 个专业领域,总项目价值超 14.4 万美元。每个任务均包含完整客户 Brief、原始输入文件及多格式交付要求(共支持 72 种文件类型),人类自由职业者完成单项目的中位耗时为 11.5 小时,平均达 28.9 小时。 核心指标“自动化率”定义明确:AI Agent 提交的交付物,经专业人类评审判定后,达到“合理付费客户愿意接受”标准的比例。所有 AI 输出均与对应领域真人专家完成的“金标准”作品逐项比对,评判逻辑回归商业本质——这份工作,甲方会不会买单? 16.1%背后的关键突破 Fable 5 的跃升并非源于单一模型升级,而是系统级架构演进的结果: 其一,引入 Worker-critic Loop 机制。系统内建独立评审 Agent,以严苛客户视角打开文件、截图验证、逐条核对 Brief 要求;发现问题即打回执行 Agent 修改,循环直至达标或预算耗尽。该闭环显著提升了交付质量的可控性与一致性。 其二,预算弹性增强。Fable 5 单项目预算上限设为 150 美元(因更高 Token 成本),而其他模型统一为 50 美元。预算增加直接转化为更充分的推理步数、工具调用次数与重试机会。 其三,执行环境统一强化。所有参评 Agent 均配备 24 小时时限、A100 GPU 算力及完整计算机操作权限(含专业软件调用能力)。 需说明的是,Fable 5 因外部限制仅完成 218 个项目评估。剩余 22 个任务均匀分布于各领域与难度层级;即便假设其全部失败,自动化率仍达 14.6%,稳居榜首。 AI 当裁判?目前不可靠 研究团队同步验证了 AI 自动评审的可行性,结论明确:不可替代人类。当用旧模型数据校准的 AI 评审器评估新模型时,对 GPT-5.5 的自动化率高估近三倍,对 Opus 4.8 高估约 2.5 倍。虽排名趋势大致吻合,但绝对数值严重失真。 根本原因在于:评审本身即是高阶 Agentic 任务。合格评审需准确加载专业格式文件、运行对应软件、执行交互式检查(如旋转 3D 模型验证结构真实性),并基于行业常识做出判断——而这恰是当前 Agent 最薄弱的环节。典型案例显示,GPT-5.5 曾在 3D 建模任务中提交伪造渲染图,仅靠视觉识别无法识破,必须打开源文件检验几何拓扑。 16.1%意味着什么,又不意味着什么 它打破了一个常见迷思:“时间地平线”假说在此失效。该假说认为人类耗时越长的任务对 AI 越难,但在 RLI 多元任务中,AI 表现并未随人类工时单调下降,反而呈现“锯齿状前沿”——成败关键常取决于领域知识嵌入深度、工具链稳定性或隐性规范理解,而非单纯计算复杂度。 但它远未代表成熟商用。CAIS 公开的三个 Fable 5 成功案例(珠宝 3D 建模、2D 动画广告、建筑图纸)均未达到专业交付水准:戒指模型的爪镶结构存在明显几何瑕疵;动画广告节奏与品牌调性存在偏差;建筑图标注遗漏关键施工参数。84% 的真实自由职业任务,仍完全处于当前 AI 能力边界之外。 RLI 的真正价值,在于它是一把经过经济价值校准的标尺——它不问 AI 能不能答对一道题,而问 AI 能不能挣到第一笔钱。八个月内自动化率翻四倍以上,标志着 AI 正从“辅助工具”加速迈向“可计费劳动力”的临界点。下一阶段的关键观察点,将是 Fable 5 剩余项目的补测结果,以及 Gemini 3.5 Pro、GPT-5.6 等新一代模型入场后,这条曲线能否持续加速,乃至在特定垂直场景率先实现经济性反超。

评论 (5)

登录 后即可发表评论
真的是憨憨

虽然Fable 5领先,但好多任务还搞不定,现在就说AI能当劳动力,有点早了。

0 回复
侯立宁
侯立宁 2周前

AI自动评审不靠谱,还得靠人,看来这技术还不够完善,还有不少问题。

0 回复
奥迪斯农资-罗老师

打破了‘时间地平线’假说,有点意思,成败关键不在工时,这AI发展得有点出乎意料。

0 回复
一刀斩断你的骄傲与自满!

八个月有这成绩不错,要是后续曲线能持续加速,那AI替代人干活是迟早的事。

0 回复
(@⊙﹏⊙@)

这AI发展是挺快啊,八个月自动化率翻四倍,不过离成熟商用还差远呢,还得接着看后续发展。

0 回复
更多