复旦邱锡鹏团队提出「上下文世界建模」:无需微调,VLA即可适应新环境
摘要
视觉-语言-动作(VLA)模型,在部署时往往会遇到一个问题:一旦相机视角、安装位置或机器人形态稍有变化,性能就可能会下降。 以往的“上下文学习”(In-Context Learning ),通常把上下文当作示范,靠人工演示任务...
USDT
$1.00
0.01%
XRP
$1.43310000
0.19%
BNB
$637.54000000
0.02%
USDC
$0.99963000
0.01%
SOL
$86.49000000
0.99%
TRX
$0.32360000
1.25%
BTC
$67,234.00
2.34%
ETH
$3,456.00
1.23%
让 AI 更快获取有效、准确、可行动的币圈全景信息
视觉-语言-动作(VLA)模型,在部署时往往会遇到一个问题:一旦相机视角、安装位置或机器人形态稍有变化,性能就可能会下降。 以往的“上下文学习”(In-Context Learning ),通常把上下文当作示范,靠人工演示任务...
3分钟前
知名登山家尼马尔·普尔亚遭遇雪崩身亡23分钟前
美财长称正在全球范围内追查伊朗资产53分钟前
美国驻中东多国使馆发布警报 称地区局势可能升级58分钟前
国家防总、应急管理部针对重庆启动防汛四级应急响应1小时前
阿维塔7月交付7626辆
评论 (5)
这方法挺牛啊,不用重新调模型就能适应新环境,省了不少事。不过极端视角和语义扰动的问题还得解决。
这方法在新环境适应上有进步,可极端视角和语义扰动的问题还挺突出,得想办法解决。
实验结果看着不错,跨视角和真实机器人实验都比基线强。但还得继续优化,提升极端情况下的性能。
这团队厉害,提出的方法简化了结构,还提升了泛化能力。就是训练数据还得丰富些。
ICWM性能提升明显,不依赖特定探测方式。但极端视角和语义扰动的不足得改进。