风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

让AI学会‘事后复盘’:SEED框架实现交互式Agent的自进化能力

摘要

人类为何擅长长程任务?关键在于‘复盘’能力 人类在完成复杂任务时,不仅关注最终成败,更会回溯过程:哪一步观察精准、哪个动作及时、哪次工具调用恰到好处——哪怕任务失败,也能提炼出局部有效策略;哪怕任务成功,...

让AI学会‘事后复盘’:SEED框架实现交互式Agent的自进化能力
人类为何擅长长程任务?关键在于‘复盘’能力 人类在完成复杂任务时,不仅关注最终成败,更会回溯过程:哪一步观察精准、哪个动作及时、哪次工具调用恰到好处——哪怕任务失败,也能提炼出局部有效策略;哪怕任务成功,也会反思是否存在冗余或风险。这种基于过程的‘事后复盘’(hindsight reasoning),是经验沉淀与策略迭代的核心机制。而当前主流的交互式Agent训练方式,却普遍缺失这一能力。 传统强化学习的监督盲区 当前长程Agentic任务多依赖结果导向的强化学习(如GRPO)。它仅以任务终点的成功/失败作为唯一奖励信号,无法区分轨迹中哪些中间状态值得保留、哪些动作应被强化、哪些工具调用具有可迁移性。一条失败轨迹里可能包含三次精准的环境感知和一次关键误判;一条成功轨迹中或许混杂了两次低效操作和一次灵光一现的跳步——但RL对此一视同仁,只给出一个标量反馈。这导致策略学习粗粒度、样本效率低、泛化脆弱。 SEED:让Agent自己总结自己的经验 清华大学自动化系陶建华教授团队提出SEED(Self-Evolving On-Policy Distillation)框架,首次将‘事后复盘’能力内化为Agent的自主训练机制。它不依赖外部标注、不引入额外记忆模块,也不需要推理时加载技能提示——所有复盘能力,都从Agent自身已生成的同策略轨迹中生长出来。 SEED的核心思想是:把每一次执行完的任务轨迹,即时转化为一条‘后见技能’(hindsight skill),再将这条技能所蕴含的行为指导,以token级精度蒸馏回策略模型本身。这个过程不是静态的,而是动态进化的——随着策略提升,它总结的经验也在同步升级。 两阶段自进化训练机制 SEED由两个紧密耦合的阶段构成: 第一阶段是后见技能监督微调(hindsight skill SFT)。先用基础策略采集一批原始轨迹,再通过轻量分析器对每条轨迹进行过程级归因:成功轨迹中提取可复用的工作流模式,失败轨迹中识别需规避的关键错误节点。这些‘轨迹-技能’对用于微调,使模型初步具备自我分析能力,并初始化后续的actor与分析器。 第二阶段是自进化同策略蒸馏(self-evolving on-policy distillation)。进入RL训练后,策略模型身兼二职:既是执行者,也是分析师。它在采样新轨迹的同时,实时从中提炼后见技能;再对比‘有技能指导’与‘无技能指导’下,对同一动作序列的判断差异,将这种差异量化为细粒度训练信号,联合GRPO进行优化。整个流程形成闭环:收集→分析→重评→蒸馏→更新→再收集……策略在每一次迭代中,都把最新经验‘刻入’自身参数。 不止更好,而且更省、更稳、更泛化 在ALFWorld、WebShop、Search-based QA三类典型长程任务上,SEED全面超越基线: • 性能更强:在ALFWorld上相对GRPO提升45.9个百分点;密集的token级后见监督,显著弥补了终端奖励稀疏带来的学习偏差; • 效率更高:仅用60%训练数据即超越全量GRPO;训练早期成功率即快速领先,回合长度下降更快,体现真实执行效率提升; • 泛化更稳:在ALFWorld未见任务集上,宏平均成功率从70.9%跃升至86.2%,尤其在‘加热’‘查看’‘拾取’等具身操作任务中优势突出; • 多模态兼容:迁移到视觉Agent基准Sokoban与EZPoints后,Qwen2.5-VL-3B-Instruct版本成功率从77.0%提升至91.0%,证明后见技能可自然扩展至跨模态轨迹建模。 为什么SEED真正‘内化’了经验? 消融实验揭示关键:若移除hindsight skill SFT阶段,模型缺乏初始分析能力,后续蒸馏失效;若停用自进化OPD,策略停滞不前;而若用静态技能库替代策略自产技能,性能退化最严重——说明‘由己所生、随己而变’的技能,才是可信赖的复盘结果。 走向更可靠的自主进化 SEED并非终点,而是新范式的起点。当前局限在于:面对DeepPlanning等超长工作流任务,后见技能的抽象粒度与状态验证机制仍需加强;策略与分析器同源,存在错误经验被循环放大的风险;训练阶段的轨迹分析与成对评分也带来一定开销。未来方向包括——以可验证的状态跃迁替代主观动作归因、引入不确定性感知过滤低置信技能、设计关键轨迹采样策略降低计算负担。 SEED的意义,不在于又一个SOTA指标,而在于它让Agent第一次拥有了类似人类的‘经验消化’能力:不靠记忆外挂,不靠人工提示,不靠离线知识库,只靠一次次亲身经历后的静默复盘,把走过的路,变成自己的一部分。

评论 (5)

登录 后即可发表评论
抓住彩虹

SEED让AI像人一样复盘,是新范式起点,不过面对超长任务还得加强。

0 回复
多多jiushi个喵

这SEED框架挺牛啊,让AI有了复盘能力,性能、效率啥的都提升不少,就是还有些局限得改进。

0 回复
ღ᭄᭄暖宝的宝࿐༻

SEED有创新,让AI自主进化,就是开销和风险得处理好,值得关注。

0 回复
小黄同学

SEED能让AI自己总结经验,比传统方法强多了,未来改进后肯定更厉害。

0 回复
@金子粟
@金子粟 1周前

这文章介绍的SEED框架把事后复盘加到AI训练里,实验效果不错,但也有问题得解决。

0 回复
更多