风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

T-Rex:灵巧手的触觉革命——为什么手感不是锦上添花,而是生存必需

摘要

全明星集结,却只为一只灵巧手 李飞飞、Trevor Darrell、Jitendra Malik、Pieter Abbeel、Ken Goldberg、Jim Fan……六位具身智能与机器人领域的顶尖学者罕见同框。他们没有讨论通用机器人大脑,也没有聚焦大模型如何...

T-Rex:灵巧手的触觉革命——为什么手感不是锦上添花,而是生存必需
全明星集结,却只为一只灵巧手 李飞飞、Trevor Darrell、Jitendra Malik、Pieter Abbeel、Ken Goldberg、Jim Fan……六位具身智能与机器人领域的顶尖学者罕见同框。他们没有讨论通用机器人大脑,也没有聚焦大模型如何调度全身执行器,而是把全部注意力投向一个被长期低估的部件:灵巧手。 视觉不够用,是事实,不是假设 自动驾驶可以靠纯视觉跑通,但灵巧操作不行。手指翻页、拧钥匙、搓捏软物——这些动作发生在毫秒级接触界面,摄像头既无法无死角布设,也难以捕捉力、滑动、形变等关键物理信号。更根本的是:缺乏标准化数据集。不同任务的手部姿态、接触方式千差万别,视觉数据泛化能力天然受限。 加触觉,为何反而失败? T-Rex团队做过一个反直觉实验:将触觉信号粗暴拼接到预训练VLA模型中,任务成功率从17%骤降至6%。问题不在触觉本身,而在“怎么加”。论文拆解出三层瓶颈: 第一,数据太贵。灵巧手22自由度遥操作需专业手套+多模态严格对齐,成本是平行夹爪的5–10倍; 第二,频率错配。视觉处理常低于10Hz,而触觉响应需20Hz以上才能分辨“即将打滑”与“已经打滑”; 第三,表征太浅。把力简化为单个数值(如“5N”),等于抹杀了滑动、插入、按压等时序动态特征。 65%成功率背后,是一套系统性解法 在12项真实灵巧操作任务中,T-Rex平均成功率达65%,远超纯视觉基线(35%)。翻书页96% vs 68%,开锁70% vs 0%——后者甚至完全失效。消融实验证明:移除触觉输入后成功率跌至42%,意味着近1/3的有效操作完全依赖手感。 更重要的是数据效率:仅用10条演示微调,中期训练后的T-Rex即可达到约40%成功率;未经中期训练的模型则直接归零。这说明模型学到的不是样本记忆,而是对“搓”“捏”“拧”等动作本质手感的理解。 核心架构:三条通路,各司其职 T-Rex采用Mixture-of-Transformer-Experts架构,三个专家模块分工明确: Latent Expert负责视觉与语言联合建模,预测未来视觉状态,提供宏观任务理解; Action Expert(1.41B参数)承担低频动作规划,生成整体运动轨迹; Tactile Expert(0.62B参数)专注高频触觉精修,轻量、快速、可高频触发。 关键创新在于Cascaded Flow Matching:扩散去噪过程在第4步切分——前6步由Action Expert生成“方向正确但缺手感”的粗轨迹;后4步由Tactile Expert注入实时触觉信号完成细节修正。第4步被实验证明是“形状初具、细节可塑”的黄金分割点。 触觉不是电压值,而是可解释的离散语言 原始触觉信号存在零点漂移与高频噪声。T-Rex用VQ-VAE将过去16帧(约0.5秒)力序列压缩为64个离散码字,自动聚类出按压、滑动、插入等典型接触模式。传感器噪声被过滤,触觉变得可解释、可追溯。 工程上还有两项关键设计:一是动态激活码本——定期检测闲置码字并注入代表性数据,防止“码本坍塌”;二是接触感知加权——对高力帧赋予更高学习权重,迫使模型聚焦真正有价值的接触瞬间,而非沉溺于90%的“零接触”静默状态。 三阶段训练:从看人动,到会动手,再到能做事 第一阶段:22,889小时人类视频预训练,建立对肢体运动语义的底层理解; 第二阶段:100小时遥操作数据中期训练,覆盖207种物体+22种动作基元,打通“人类视频知识”到“机械手执行策略”的映射鸿沟; 第三阶段:约100条任务演示后训练,实现快速适配。 中期训练是真正枢纽——它不教模型“如何开某一扇锁”,而是让模型理解“拧”在金属、塑料、橡胶表面分别需要怎样的力与节奏。就像游泳者先练熟所有泳姿,再下水比赛。 灵巧手的第一性原理,不是硬件参数,而是触觉可用性 当前行业争论集中在腱绳vs连杆、11自由度vs27自由度——这些关乎成本与上限,却不解决根本问题:算法能否真正用好触觉?T-Rex证明,触觉不是辅助模态,而是灵巧操作的感知基石。当视觉无法定义“正在滑动”,触觉就是唯一可靠的判断依据。 触觉将成为具身智能的新价值锚点 随着T-Rex与Sharpa Wave硬件协同推进,灵巧手正从整机子系统演变为独立技术赛道。它占整机成本15–20%,技术门槛高、数据壁垒深。一旦触觉数据采集与建模能力成为核心竞争力,灵巧手就不再只是执行器,而是整个感知-决策-执行链中数据价值最高的一环。 更深远的影响在于范式迁移:通用大模型在接触密集型任务上已显疲态,而T-Rex所代表的“专用场景+专用模态+专用架构”路径,可能催生一批垂直领域具身应用——从精密装配、微创手术到柔性物流,每个场景都值得一套以触觉为中枢的闭环系统。 这不是新数学,而是一套可复用的工程共识 T-Rex没有发明新损失函数,也没有提出全新网络结构。它的价值在于把现有工具——扩散模型、VQ-VAE、专家混合、多阶段训练——整合成一套逻辑自洽、工程鲁棒、效果显著的触觉利用范式。它回答了一个朴素却关键的问题:灵巧操作到底需要什么数据?以及,如何让算法真正消化它。 这条路走通之后,灵巧手将不再被问“能不能动”,而是被问:“你有没有手感?”

评论 (7)

登录 后即可发表评论
快快牛
快快牛 1周前

三阶段训练很科学,中期训练是枢纽,让模型理解动作本质手感。

0 回复
以砼之名

这研究厉害啊,把触觉利用整出一套范式,以后灵巧手就看手感了。

0 回复
飞行哥
飞行哥 1周前

通用大模型在接触任务不行,T - Rex这专用路径有搞头,能催生不少应用。

0 回复
love the way you lie

这研究成本高啊,数据贵频率还错配,不过能有这效果也算值了。

0 回复
没有灵魂旳瞳孔

T - Rex架构分工明确,关键创新也实用,触觉成感知基石是有道理的。

0 回复
更多