【科技资讯】前字节、腾讯AI核心研发孙鹏加入星尘智能,负责机器人强化学习后训练|最前线 - 科普头条

【科技资讯】前字节、腾讯AI核心研发孙鹏加入星尘智能,负责机器人强化学习后训练|最前线

📌 信息分类:具身智能

📰 信息来源:www.36kr.com

📅 原文发布时间:2026-09-02 18:25

🕒 本站采集时间:2026-09-03 06:03:28


📝 核心摘要

2026年9月2日,36氪获悉前字节跳动强化学习专家、前腾讯Robotics X智能体中心负责人孙鹏博士正式加入仿生机器人研发商星尘智能,重点负责机器人强化学习方向的技术研发与应用探索,完善星尘智能Physical AI全栈技术布局。孙鹏博士拥有清华大学教育背景,先后在康奈尔大学、罗格斯大学完成博士后研究,长期深耕强化学习、智能体及多智能体强化学习领域,兼具算法研究与系统工程的技术积累。孙鹏的技术履历横跨数字与物理世界,此前在腾讯AI Lab及Robotics X机器人实验室期间,担任智能体中心负责人,开展深度强化学习与机器人控制研究,曾利用深度强化学习和对抗博弈训练轮式机器人实现端到端主动目标跟随,研发的《星际争霸》AI智能体TStarBots、TStarBotX在多智能体强化学习复杂博弈环境研究中取得重要成果;加入字节跳动后,主导开发核心强化学习基础设施ByteRL,支撑多款自研游戏AI高效训练,其团队夺得IEEE CoG 2023策略卡牌AI竞赛冠军,研发的《炉石传说》AI具备击败行业顶尖选手的竞技水平,还主导研发落地强化微调方法ReFT、数学推理智能体DeltaProver,深度参与大模型预训练及RLHF对齐工作,在模型对齐、推理能力增强等前沿方向积累了扎实经验。当前AI能力向物理世界延伸,具身智能领域的评判标准正从实验室“能不能做任务”切换为真实部署下“能不能稳定反复做好”,真实环境的长尾干扰、长时间自主决策鲁棒性、故障异常恢复能力成为决定商业价值的关键,强化学习后训练是突破这一瓶颈的核心环节——模仿学习解决“怎么做”,强化学习解决“做错了怎么改”,当任务成功率推进到60%后,优化动作复现的边际贡献递减,开放环境下的自适应与纠偏能力成为核心瓶颈,强化学习后训练因此成为具身智能不可绕开的关键。星尘智能坚持Design for AI思路,构建了基座模型、前端Agent与强化学习后训练协同运转的完整技术闭环,其中Lumo系列基座模型负责环境与动作的理解、预测和生成,Philia前端Agent承担长期记忆、任务管理等智能化能力,基于“AI模型+具身OS+绳驱本体”全栈技术体系,孙鹏加入后将强化星尘智能在机器人强化学习方向的布局,推动强化学习融入真实机器人训练与部署,让机器人不只是“学会一个任务”,而是能在真实执行反馈中持续优化,实现进化。


🔗 阅读原文


👉 前字节、腾讯AI核心研发孙鹏加入星尘智能,负责机器人强化学习后训练|最前线


🏷️ 标签:机器人强化学习后训练, 具身智能, 星尘智能, 孙鹏

© 2026 科普头条   |   京ICP备2026012639号   |   京公网安备11010102007649号