斯坦福教授直播训练535B大模型,模型训练背后的「黑箱」正在被打开?

最近两天,X 上网友 Max For AI@MaxForAI 的一篇帖子引发了网友热议:「太疯狂了 —— 现在你甚至可以直播围观一个 535B 大模型是如何被训练出来的。」

斯坦福大学

原来是斯坦福大学教授、Simile AI 创始人 Percy Liang@percyliang 宣布由 Marin 开放实验室启动训练 Marin 535B-A23B 模型,并且整个训练过程将全程公开进行。

Marin 拥有 5350 亿总参数、230 亿激活参数,为此,Percy Liang 和团队准备了总计 18.75 万亿 token 的训练数据,部署了 11 套 GB200 NVL72 系统,约合 792 颗 GB200 GPU。

预计模型将连续训练约 3 个月,总训练计算量约为 2.7e24 FLOPs。训练完成后,团队还将继续进行后训练(post-training)阶段。

斯坦福大学

换句话说:未来几个月,所有人都可以围观一个前沿大模型如何从零开始成长。

另外值得注意的是,Percy Liang 表示,在正式启动这次训练任务之前,团队已经先训练了一套包含 4 个阶段的 Scaling Ladder(规模扩展阶梯),从 1.6B-A61M(48B tokens) 一直到 27.7B-A1.2B(926B tokens)。

「这样做有两个目的,一是用这些小规模实验提前发现并调试潜在问题;二是根据不同规模模型的训练表现,对我们的「主模型训练」(hero run)进行预测。」

当然,Percy Liang 也表示,「这是迄今为止我们进行过规模最大的一次训练,因此,我们也确实在期待过程中出现一些意料之外的情况。」

目前,该主模型已经正式开始运行,所有人都可以直接查看实时训练曲线。后续,训练数据、实验日志以及工程问题也会持续公开。

比如数据层面,包括训练数据混合比例、数据处理方式,以及不同领域数据如何进入模型;工程层面,包括训练配置、代码以及实验设计;训练过程,包括实时 loss 变化、模型状态以及不同阶段预测结果等。

同步,Percy Liang还公开了的具体的观看渠道。

斯坦福大学

查看数据构成:https://storage.googleapis.com/marin-public/held/harrier-k40-cluster-overview/2026.08.18/index.html?revision=uniform-sampling

在 Weights & Biases(wandb)上实时观看训练过程:https://wandb.ai/marin-community/marin_moe/reports/535B-A23B-18T-Token-Hero-Run-Scaling-Ladder–VmlldzoxNzc2MDM5Ng

在 GitHub 上查看所有详细信息:https://github.com/marin-community/marin/issues/8435

详细了解之后不难看出,为什么 Percy Liang 的这一操作能够引起大家的围观。因为过去,对于 GPT-4、Claude、Gemini 这类模型来说,根本不知道背后具体是怎么训练的,像个「黑箱」一样。

大家只能看到最终模型能力、benchmark 分数、少量论文描述等。而对于数据配比、训练失败过什么、哪些超参数有效、loss 如何变化、Scaling law 是否预测准确等,都是未知的。

Marin 正试图改变这一点。或许,模型训练也可以像论文、开源软件一样:可观察、可讨论、可协作。

而自从这个消息公布以来,网友们的热情还在持续高涨。

有网友认为,这才是真正的开源精神,「即使训练过程出现问题、偏离预期,也毫不隐藏。」

斯坦福大学

有网友则表示,即便训练模型本身已经很庞大,但真正令人震撼的是,大家现在居然可以通过 WandB 平台,实时观看一个价值数十亿美元规模的大模型训练过程如何一步步成长?

「这就像顶级 AI 实验室内部原本紧闭的 “暗室” 突然被打开,所有人都能看到里面正在发生什么。」

而在接下来的三个月里,最令人期待的或许不是最终模型能力如何,而是观察这个模型在训练过程中究竟会经历多少次「爆炸」、崩溃和意外情况……

斯坦福大学

此外,有网友还认为,这一举动不仅是提供了一个观看模型训练全过程的视角,甚至给了大家一个学习、交流的平台。

网友 James Thewlis@jdthewlis 一直在实时跟进训练过程,过程中他不理解「为什么在大约第 500 step 附近,norms(参数范数)会出现一个峰值?」

之后自己搞明白之后,又在评论区自问自答:「这个峰值完全是由 router_bias(路由偏置) 导致的。它并不是通过梯度训练得到的参数,而是 MoE(混合专家模型)中用于 token 平衡机制(token balancing heuristic) 的一部分,因此它具有不同于普通模型参数的动态变化规律。」

斯坦福大学

像这样的情况还有很多。

斯坦福大学

此外,值得一提的是,Percy Liang 作为斯坦福大学教授,除了这次真刀真枪的实践,还有一门理论课程:《CS336: Language Models From Scratch》(从零构建语言模型),目标是让学生完整理解一个大型语言模型如何被构建的。

看样子,Percy Liang 是真的想教会所有人「造」大模型。感兴趣的网友可以了解一下。

斯坦福大学

课程链接:https://www.youtube.com/playlist?list=PLoROMvodv4rMqXOcazWaTUHhq-yembLCV

那么你呢?如何看待这场真正将大模型训练搬上台前的直播?欢迎在评论区留言交流!

参考链接:

https://x.com/MaxForAI/status/2091270116067750089

https://x.com/percyliang/status/2090918065634684997

https://x.com/CopyRebeldia/status/2091231950774112412?s=20

https://www.youtube.com/playlist?list=PLoROMvodv4rMqXOcazWaTUHhq-yembLCV

本文来自微信公众号 “机器之心”(ID:almosthuman2014),作者:关注AI的

免责声明:本文提供的信息不是交易建议。BlockWeeks.com不对根据本文提供的信息所做的任何投资承担责任。我们强烈建议在做出任何投资决策之前进行独立研究或咨询合格的专业人士。

(0)
MarsBit的头像MarsBit作者
上一篇 1小时前
下一篇 2025 年 6 月 17 日

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部