单 rollout 异步优化:提升长程 Agent 强化学习效率的新范式

1 次阅读 2026年07月15日

长程 Agent 与 coding 任务中的 RL 效率瓶颈

当前,面向复杂推理与自主执行的长程 Agent(如代码生成、数学推演)普遍依赖强化学习进行策略优化。但主流 LLM-RL 流水线仍受限于同步批量训练范式:必须等待整批 rollout 完成后统一计算梯度并更新模型,导致 GPU 利用率低、训练延迟高。异步方案虽能提升吞吐,却常以牺牲训练稳定性为代价——策略与价值模型更新不同步易引发离策略偏差放大,而 GRPO 等组式采样方法又难以适配单任务流式 rollout 场景。

SAO:一种轻量、稳定、可部署的异步优化框架

清华大学 KEG 实验室提出单 rollout 异步优化(Single-rollout Asynchronous Optimization,SAO),核心思想是:每个输入任务仅生成一条 rollout,并在生成完成后立即参与训练。该设计天然契合 Agent 的在线交互特性,避免组式采样带来的策略漂移与数据冗余,同时显著降低离策略影响,增强跨任务泛化能力。

四大关键技术支撑异步稳定性

SAO 不是简单缩短 rollout 长度,而是通过四层协同机制保障单样本训练的可靠性:

1. 直接双边重要性采样(DIS)

摒弃传统历史模型缓存,直接利用 rollout 过程中记录的 token 级对数概率实时计算重要性权重。对超出预设阈值的 token 梯度予以裁剪或屏蔽,从源头抑制策略偏移带来的方差爆炸,无需维护多版本策略快照。

2. 价值模型高频更新

解耦策略与价值模型更新节奏:每轮策略更新对应两次价值模型更新。此举显著降低单 rollout 下优势估计的方差,使优势信号更贴近真实回报分布,尤其在稀疏奖励场景中效果突出。

3. 注意力模块参数冻结

实证发现价值模型波动主要源于全注意力层参数震荡,而 MoE 投影层更鲁棒。SAO 在训练中固定注意力模块权重,仅优化 MoE 分支的投影矩阵,大幅压缩价值模型训练自由度,提升收敛一致性。

4. 观察 token 跳过的 GAE 计算

针对多轮 Agent 轨迹中动作与环境反馈交替出现的特点,SAO 在广义优势估计(GAE)中主动跳过所有环境观察 token 对应的位置,仅在模型自主生成的动作 token 间传播优势信号,有效过滤环境反馈噪声,增强策略梯度方向的可信度。

实证表现:更优、更稳、更适应动态环境

SAO 已在多个高难度 Agent 基准上验证有效性:

数学推理与代码修复

在 AIME2025 上达到 97.3% 准确率,显著超越 GRPO(84.2%);在 SWE-Bench Verified 代码修复任务中准确率达 29.8%,高于基线模型(23.0%)与 GRPO+DIS(27.0%)。

训练过程稳定性

GRPO 通常在训练中期出现性能塌陷,引入 DIS 后可延缓崩溃但无法持续提升;SAO 不仅全程保持领先,且中后期评估分数持续爬升,体现其内在优化路径的鲁棒性。

动态偏好适应能力

在模拟在线写作任务中,当奖励偏好在可爱风、中二风、古典风之间切换时,SAO 能在 1–2 个训练周期内完成风格对齐,而滑动平均基线存在明显滞后与收敛下限偏低问题。

消融验证:每一项设计都不可或缺

移除任一核心组件均导致性能下降:取消高频价值更新使 BeyondAIME 准确率从 74.8% 降至 69.8%;启用全参数价值模型训练引发训练抖动;未使用 DIS 的 VAPO 方法在约第 90 步即发生不可逆崩溃。这表明 SAO 的四重机制构成有机整体,缺一不可。

现实落地的挑战与延伸方向

SAO 已集成至 GLM-5.2(750B-A40B)Agent RL 训练流水线,但迈向通用部署仍需突破三方面限制:

适用范围扩展

当前验证集中于 Qwen3-30B-A3B 级别模型及 Agent 类任务。后续需检验其在中小规模模型、非 Agent 场景(如对话 RLHF)、短 rollout 密集奖励任务中的迁移能力。

基础设施适配

异步 rollout 生成需配套支持 token 级对数概率的实时捕获与持久化,这对训练系统的日志管道、存储带宽与容错机制提出新要求。

安全与治理机制

模拟环境下的在线适应尚未覆盖真实用户反馈的复杂性。未来需嵌入实时内容安全过滤、用户意图校验、策略行为审计等模块,确保动态优化不偏离伦理与合规边界。

结语

SAO 并非追求理论最优的“黑箱”改进,而是立足工程现实的系统性重构:它用单 rollout 降低延迟,用 DIS 控制偏差,用高频价值更新压低方差,用结构约束提升鲁棒性。这一路径证明——高效 RL 不必依赖更大 batch 或更强算力,而可源于更精细的训练动力学设计。

(5)

你吃饭了吗

这设计四重机制缺一不可,取消组件性能就下降,挺严谨。

0
随便.
随便. 2周前

新范式解决了效率瓶颈,就是落地还有不少挑战得克服。

0
叫我杨仔

SAO 能提升效率还稳定,关键技术挺牛,不过安全治理机制得好好弄。

0
相知相惜CC

这方法听起来挺厉害,解决了不少问题,但适用范围还得再扩展,基础设施也得跟上,不然落地难。

0
乱星海厉飞雨

实证表现不错,就是不知道在中小规模模型里咋样。

0

花旗将迪士尼目标价从145美元下调至135美元。

花旗将迪士尼目标价从145美元下调至135美元。

花旗将Visa目标价从400美元上调至440美元。

花旗将Visa目标价从400美元上调至440美元。

花旗将康宁目标价从240美元下调至220美元。

花旗将康宁目标价从240美元下调至220美元。

国家网信办就《中华人民共和国反网络暴力法(征求意见稿)》公开征求意见

为了预防、制止和惩治网络暴力,加强反网络暴力工作,保护个人、组织的合法权益,维护国家安全和社会公共利益,按照有关立法规划计划安排,国家互联网信息办公室会同有关部门起草了《中华人民共和国反网络暴力法(征求意见稿)》,现向社会公开征求意见。

渤健公司股价在公布第二季度业绩后盘前下跌2.2%。

渤健公司股价在公布第二季度业绩后盘前下跌2.2%。

中国-东盟区域医药交易(集采)平台推动国产手术机器人在越南进入临床使用

国家医保局消息,近期,中国-东盟区域医药交易(集采)平台助力国产手术机器人完成越南产品注册并取得上市许可,在越南部分头部医疗机构完成安装并投入临床应用,实现了国产大型医用设备在越南从产品注册到临床应用的重要突破。同时,还将推动中越双方就机器人手术技术培训、临床应用推广、学术交流、人才培养等方面开展深度合作。

花旗将希捷科技目标价从1240美元上调至1300美元。

花旗将希捷科技目标价从1240美元上调至1300美元。

为了预防、制止和惩治网络暴力,加强反网络暴力工作,保护个人、组织的合法权益,维护国家安全和社会公共利益,按照有关立法规划计划安排,国家互联网信息办公室就《中华人民共和国反网络暴力法(征求意见稿)》公开征求意见。

为了预防、制止和惩治网络暴力,加强反网络暴力工作,保护个人、组织的合法权益,维护国家安全和社会公共利益,按照有关立法规划计划安排,国家互联网信息办公室就《中华人民共和国反网络暴力法(征求意见稿)》公开征求意见。

韩国金融监管负责人就杠杆型ETF争议致歉 称将恢复市场信任

据报道,韩国主要金融监管机构负责人7月29日就单只股票杠杆型交易所交易基金(ETF)引发的市场争议公开致歉。

维谛技术美股盘前跌超6%。

维谛技术美股盘前跌超6%。