【科技资讯】10亿级预算、百万小时数据狂欢:具身离「开箱即用」还有多远 - 科普头条

【科技资讯】10亿级预算、百万小时数据狂欢:具身离「开箱即用」还有多远

📌 信息分类:数据要素

📰 信息来源:www.36kr.com

📅 原文发布时间:2026-09-04 07:45

🕒 本站采集时间:2026-09-05 06:04:13


📝 核心摘要

2026年,具身智能行业将“百万小时数据”作为核心发展目标,鹿明机器人、灵初智能、北京人形机器人创新中心、星海图等多家机构相继布局该规模数据采集,参考GPT3时期OpenAI的语料规模,行业押注Scaling Law(缩放定律),认为百万小时数据有望让具身智能涌现类似GPT3/GPT3.5的通用能力。具身智能数据采集方式正持续演进:早期真机数据虽能直接对齐硬件,但成本高(约每小时1000元)、泛化性差,谷歌RT-1曾用13台机器人采集17个月仅获13万条演示;后续UMI通用采集接口将成本降至每小时400-650元,采集效率提升2倍以上;2024年推出的EgoMimic第一视角数据进一步将成本压至每小时300元,采集门槛大幅降低。不同数据来源的特性决定了其在训练中的分工:低成本数据(UMI、Ego)用于预训练扩大场景覆盖,真机数据用于后训练对齐硬件与控制逻辑,小米、Physical Intelligence等案例显示,合理的数据组合可提升效率,如小米用10万小时UMI数据预训练,再以7200多小时真机数据后训练,新任务平均每项补充不到40小时真机示范,整体成功率达85%。尽管机器人领域的Scaling Law已被验证(数据规模与模型表现呈对数线性关系),但百万小时并非具身智能“开箱即用”的临界点:数据小时数非标准化单位,相同时长数据的场景多样性、控制信息差异巨大;缺乏受控实验证明百万小时会触发能力跃迁;且真实环境中的意外情况(如物品滑落、设备故障)需依赖部署后的数据回流优化。百万小时是具身智能数据生产工业化的里程碑,但真正实现“开箱即用”的通用机器人,仍需等待首批百万小时级模型在复杂环境中的实际表现,行业也将借此验证数据价值的真实转化效率。


🔗 阅读原文


👉 10亿级预算、百万小时数据狂欢:具身离「开箱即用」还有多远


🏷️ 标签:具身智能, 百万小时数据, 数据要素, 开箱即用

© 2026 科普头条   |   京ICP备2026012639号   |   京公网安备11010102007649号