【科技资讯】535B大模型“直播”训练三个月:代码、数据、Loss全公开,吴恩达公开力挺 - 科普头条

【科技资讯】535B大模型“直播”训练三个月:代码、数据、Loss全公开,吴恩达公开力挺

📌 信息分类:数据要素

📰 信息来源:www.36kr.com

📅 原文发布时间:2026-08-25 16:03

🕒 本站采集时间:2026-08-26 06:03:21


📝 核心摘要

2026年8月,斯坦福大学基础模型研究中心(CRFM)主任Percy Liang团队发起的Marin项目,正式启动总参数达5350亿的MoE大模型Marin 535B-A23B的训练,这场为期3个月的训练采用11套英伟达GB200 NVL72系统,计划处理18.75万亿Token,总计算量约2.7×10²⁴ FLOPs,核心亮点在于将大模型训练过程“直播化”,公开代码、数据配方、训练曲线及所有实验痕迹,打破行业此前仅在模型发布后开放权重的惯例。Marin项目最早于2025年5月对外公布,其初衷是探索算力集中、训练配方封闭的行业背景下,基础模型能否像开源软件一样实现公开协作,提出“开放实验室”机制:从GitHub Issue提前声明实验目标,到代码提交、训练指标公开,再到成功、失败及修改痕迹的全记录,均向外部研究者开放。该项目获得吴恩达公开力挺,被其称为“捍卫AI开放性的珍贵示范”,强调其不仅开放模型代码,更公开数据、训练配方与实验过程。技术层面,Marin 535B-A23B为混合专家模型,“535B”为总参数,“A23B”为单Token激活参数,采用共享专家与路由专家并存设计以降低Token丢弃风险;针对MoE训练中通信复杂、专家负载不均等痛点,团队因缺乏适配JAX/XLA GPU环境的现成方案,自研专家并行(EP)实现,同时搭建四级“缩放梯”,通过训练规模递增的小型模型预测535B模型的训练曲线、暴露稳定性问题,降低大规模训练的不确定性。尽管Marin并非首个公开训练过程的大模型项目,但它将开放从模型发布行为扩展为实验室默认工作方式,是当前规模与研发透明度结合最激进的开放训练实验之一,其公开的专家路由、Token丢弃控制、JAX GPU专家并行等经验,可为中小团队复用,也为行业追问“谁有权知道模型训练过程”提供了新样本。


🔗 阅读原文


👉 535B大模型“直播”训练三个月:代码、数据、Loss全公开,吴恩达公开力挺


🏷️ 标签:Marin 535B大模型, MoE大模型, AI开放训练, 吴恩达, 大模型训练技术

© 2026 科普头条   |   京ICP备2026012639号   |   京公网安备11010102007649号