【科技资讯】世界模型与世界的距离:数据、技术路线和落地预期 - 科普头条

【科技资讯】世界模型与世界的距离:数据、技术路线和落地预期

📌 信息分类:数据要素

📰 信息来源:www.36kr.com

📅 原文发布时间:2026-06-15 20:26

🕒 本站采集时间:2026-06-16 06:25:39


📝 核心摘要

世界模型作为AI领域的热点方向,在具身智能赛道被寄予厚望,但目前仍处于早期阶段,距离生产落地尚有较长距离。2026年6月13日,在北京智源大会的世界模型圆桌讨论中,来自机器人、大模型等领域的研究者(包括腾讯混元3D及世界模型负责人郭春超、极佳视界首席科学家朱政等)达成共识:世界模型当前多处于原型阶段,暂未进入严肃生产系统。智源研究院院长王仲远将现有技术路线分为四类:以语言为中心(如VLM、VLA)、以像素为中心(如视频生成模型)、以三维结构为中心(如3D重建)、以视觉表征为中心(如JEPA系列)。

关于世界模型与VLA的关系,嘉宾普遍认为二者并非替代,而是相互融合。VLA正吸收预测未来状态的能力,世界模型也在整合动作预测与语言能力,未来或形成统一架构。世界模型落地面临两大障碍:一是依赖参数量达5B、10B的视频生成模型,端侧部署压力大;二是适合的开放环境(如家庭)商业化不成熟。短期内,世界模型更可能作为数据引擎、训练工具发挥作用,而非大规模真机部署。

在长尾问题与安全方面,世界模型有解决长尾场景的潜力——其可利用成功与失败数据学习环境动态,如自动驾驶中作为长尾数据生成器。但具身智能场景缺乏海量数据积累,需通过持续学习、低成本示教等方式应对开放环境的不可穷尽性。泛化能力是世界模型的核心瓶颈,当前基于短视频片段的学习效率低,需结合语言抽象能力;强化学习、持续学习是突破方向,而非单纯依赖数据量扩张。

已走出Demo的能力集中在高容错、短链条场景:如游戏原型验证可快速生成场景,交互式娱乐、营销等场景已有部分可用性。未来五年,部分当前观点或被证伪:如基于视频生成底座的范式瓶颈明显,动作条件模型更具潜力;纯观察数据难以训练具身世界模型,需理解物理交互;“数据大跃进”式想法经济上不可持续,高质量数据更关键。


🔗 阅读原文


👉 世界模型与世界的距离:数据、技术路线和落地预期


🏷️ 标签:世界模型, 具身智能, VLA, 泛化能力, 技术路线

本文由科普头条 AI 自动采集发布,内容仅代表作者观点

© 2026 科普头条   |   京ICP备2026012639号   |   京公网安备11010102007649号