风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

PolicyTrim:让VLA机器人“少走弯路”,无需重训即可提速

摘要

VLA模型会做任务,但机器人还是慢 Vision-Language-Action(VLA)模型将视觉、语言与动作统一建模,使机器人能理解自然语言指令并执行复杂操作。从OpenVLA、π0.5到GR00T,这类模型已成为具身智能的核心技术路径。然...

PolicyTrim:让VLA机器人“少走弯路”,无需重训即可提速

VLA模型会做任务,但机器人还是慢

Vision-Language-Action(VLA)模型将视觉、语言与动作统一建模,使机器人能理解自然语言指令并执行复杂操作。从OpenVLA、π0.5到GR00T,这类模型已成为具身智能的核心技术路径。然而,当它们真正部署到物理机器人上时,一个被长期忽视的问题浮出水面:任务完成时间不仅取决于单次推理快不快,更取决于策略需要多少次推理、多少个真实物理动作。

策略效率,才是真实瓶颈

实验发现,同一任务在多次运行中,VLA策略的执行步数波动剧烈——说明更短、更直接的成功路径本就存在,只是当前策略难以稳定复现。问题根源在于两点:

一是动作chunk尾部不可靠:模型一次预测多个动作,但越靠后的动作误差累积越严重,导致系统频繁中断、重新规划,反而拉长整体流程;

二是物理动作冗余严重:即便最终成功,轨迹中常包含大量回退、抖动、重复调整等无效操作。

因此,“策略效率”必须成为独立优化维度:一次预测中,有多少动作能真正放心执行?完成任务最少需要几步物理动作?

不是算得更快,而是做得更快

现有加速方法多聚焦计算侧——如token剪枝、KV缓存复用、模型量化等,虽能降低单步延迟,却无法解决“策略本身绕远路”的问题。强行延长动作chunk长度也不可行:实验证明,盲目拉长预测窗口会导致成功率下降、纠错动作激增,物理步数不减反增。

关键突破点在于:能否在不改变模型结构、不重收集数据、不牺牲成功率的前提下,让已有VLA策略自动学会“少走弯路”?

PolicyTrim:两阶段后训练,专治策略冗余

四川大学雷印杰教授团队提出PolicyTrim——一种面向策略效率的强化学习后训练框架。它不修改VLA架构,也不依赖额外专家示范,仅基于已有预训练策略,在真实执行行为层面进行定向优化。

整个框架分为两个协同演进的阶段:

第一阶段:可靠动作chunk扩展

针对动作预测尾部不可靠问题,PolicyTrim引入动态执行窗口探索机制:在同一批rollout中,为不同轨迹分配差异化的动作接受比率(即允许执行的预测步数),让模型在短、中、长多种horizon下并行试错。

只有当任务成功且执行窗口更长时,才给予正向奖励。这种组内成功激励机制,避免模型在失败场景下盲目追求长度,促使它逐步提升chunk尾部动作的可信度与可用性。

第二阶段:冗余感知的步数压缩

在可靠执行窗口扩大基础上,PolicyTrim进一步以“物理步数最小化”为目标进行精调。它设计step-saving reward:成功轨迹所用物理步数越少,奖励越高;同时引入group-anchored正则化,抑制那些仅在特定随机种子下偶然成立的投机捷径,确保策略改进具备可复现性与鲁棒性。

两阶段顺序优化,既避免目标冲突,又实现“先扩可靠范围、再压执行长度”的渐进式提效。

实测效果:端到端显著加速

PolicyTrim在LIBERO、ManiSkill、Meta-World及真实机器人平台全面验证,覆盖π0.5、OpenVLA-OFT、GR00T等多种主流VLA架构:

• 在LIBERO Object基准上,π0.5实现最高5.83倍端到端加速,成功率稳定在98%以上;

• ManiSkill与Meta-World分别达成2.36倍与2.52倍加速;

• OpenVLA-OFT经完整两阶段优化后达2.97倍加速;仅启用第二阶段的OpenVLA也获得1.41倍提升。

真实世界同样有效

在搭载双RealSense D435i相机的Agilex Piper机械臂上,PolicyTrim完成FlipMug、HangMug、TapeBox三类真实操作任务。无论目标位置固定,还是抓取中遭遇随机扰动,其成功率均持平或提升,平均端到端执行时间缩短至基线的约54%(即1.86倍加速)。

定性观察显示:Baseline轨迹常出现目标附近犹豫、反复微调、无效回退;而PolicyTrim输出的动作序列更平滑、更果断,物理步数普遍压缩至原来一半左右。

为什么它真正有用?

• 直击本质:优化的是策略行为本身,而非仅加速单次计算;

• 零成本适配:作为后训练方法,可直接加载已有VLA模型,无需新数据、无需重训;

• 稳健可靠:通过成功导向奖励与组内正则化,兼顾提速与成功率;

• 兼容叠加:与推理引擎优化、模型压缩等技术正交,可协同释放更大加速潜力。

PolicyTrim传递了一个清晰信号:对VLA机器人而言,“做得更快”,和“算得更快”同等重要。让策略学会直奔目标,本身就是最高效的部署优化。

评论 (5)

登录 后即可发表评论
z果子
z果子 1周前

直击策略冗余本质,零成本适配已有模型,还能和其他技术叠加,不错。

0 回复
随意又随性

实测加速效果明显,成功率也稳定,这方法靠谱,能让VLA机器人少走弯路。

0 回复
小小姜先生

两阶段优化顺序合理,既扩大可靠范围又压缩执行长度,思路清晰,值得推广。

0 回复
拾光
拾光 1周前

这东西挺厉害,抓住策略效率这个关键,用两阶段后训练让机器人提速,还不用重训模型,实用性很强。

0 回复
下陆区新典电脑店

PolicyTrim能适配多种架构,真实场景也有效,解决了机器人执行慢的问题,有搞头。

0 回复
更多