【科技资讯】李飞飞第一篇「触觉」论文:机器人会盲摸麻将了 - 科普头条

【科技资讯】李飞飞第一篇「触觉」论文:机器人会盲摸麻将了

📌 信息分类:具身智能

📰 信息来源:www.36kr.com

📅 原文发布时间:2026-07-20 20:44

🕒 本站采集时间:2026-07-21 06:05:12


📝 核心摘要

李飞飞团队联合Trevor Darrell、Jitendra Malik等具身智能领域全明星学者,于2026年7月发布首篇触觉研究论文,聚焦灵巧手的触觉感知与操作问题。纯视觉方案在灵巧手精密操作中存在数据采集难、泛化性差等局限,而直接将触觉信号拼接至视觉模型会导致成功率骤降(从17%跌至6%),团队分析出三大核心障碍:灵巧手遥操作数据成本是平行夹爪的5-10倍;视觉与触觉信号频率不匹配(视觉5-10Hz vs 触觉需20Hz以上);触觉被误作静态数字而非时序信号。

针对这些问题,团队提出T-Rex模型,采用Mixture-of-Transformer-Experts异步架构:Latent Expert处理视觉与语言,提供全局预测;Action Expert负责低频动作规划(1.41B参数量);Tactile Expert进行高频触觉精修(0.62B参数量)。核心机制为Cascaded Flow Matching,将扩散去噪分为两步:前6步由Action Expert生成方向正确的动作框架,第4步后由Tactile Expert注入实时触觉数据完成细节修正。触觉编码方面,通过VQ-VAE将16帧力历史压缩为64个离散码字,过滤漂移与噪声,并通过激活闲置码本、加权高力帧优化训练效果。

实验结果显示,T-Rex在12项真实世界灵巧操作任务中平均成功率达65%,较纯视觉基线(35%)提升30个百分点;翻书页任务成功率96% vs 68%,开锁任务70% vs 0%(纯视觉完全失败)。消融实验表明,移除触觉输入后成功率降至42%,三分之一有效操作依赖触觉。训练采用三阶段策略:先在22889小时人类视频预训练,再用100小时遥操作数据(覆盖207种物体、22种动作基元)完成中期训练以迁移知识,最后用100条任务演示快速适配,解决了人机动作策略差异的鸿沟。

该研究的价值在于跳出硬件参数争论,提供了触觉数据利用的可复用系统方案。Sharpa Wave的22自由度灵巧手(180Hz高频触觉)为算法落地提供硬件基础,而T-Rex的探索推动灵巧手从具身智能本体分化为独立赛道(占整机成本15%-20%),并启发接触密集型专用场景的具身应用,为灵巧手规模化奠定基础。


🔗 阅读原文


👉 李飞飞第一篇「触觉」论文:机器人会盲摸麻将了


🏷️ 标签:具身智能, 灵巧手, 触觉感知, T-Rex模型, 多模态融合

© 2026 科普头条   |   京ICP备2026012639号   |   京公网安备11010102007649号