Meta FAIR 发布新缩放定律 Skaling:挑战 Chinchilla,计算成本可降 10 倍

Meta FAIR 发布新缩放定律 Skaling,直指 DeepMind Chinchilla 忽略了模型规模与数据量之间的耦合关系。新定律在 76% 测试场景中预测更准,中位精度提升 2.2 倍,并可将训练规划计算成本削减约 10 倍。

过去几年,DeepMind 的 Chinchilla 缩放定律一直是大语言模型训练的“非官方圣经”,指导研究者如何在模型规模与训练数据量之间取得平衡,以在单位算力下获得最佳性能。Meta FAIR 实验室最新发表的一篇论文指出,Chinchilla 从根本上误解了这一关系,而修正它可以将模型训练规划所需的计算量削减约 10 倍。

这篇题为“Skaling: Chinchilla’s Exponents Meet Kaplan’s Coupling”的论文于 2026 年 8 月 7 日发布,作者为 Mathurin Videau、Badr Youbi-Idrissi、David Lopez-Paz 和 Kartik Ahuja。论文提出了一种修正的缩放定律,纳入了 Chinchilla 一直忽视的关键因素:模型规模与训练数据量之间的相互作用。

DeepMind 的 Chinchilla 缩放定律确立于 2022 年 3 月,它将模型参数(N)和训练 token 数(D)视为两个独立变量,各自对模型最终损失作出独立贡献。Skaling 论文则证明,这种独立性假设在实际中并不成立。研究者通过计算损失表面对 N 和 D 的混合偏导数,发现其不为零。简言之,增加参数的效果取决于你正在使用的训练数据量,反之亦然。

Skaling 通过一个耦合指数 k 来捕捉这种相互作用,并将其嵌入标准 Chinchilla 公式。完整模型形式为:L(N, D) = (A / N^α + B / D^β)^k + E,其中 k 大于 1 表示模型规模与数据量之间的耦合。当 k 等于 1 时,该公式退化为原始的 Chinchilla 形式。

从数据上看,Skaling 在 76% 的测试配置中优于 Chinchilla,预测准确率的中位提升幅度为 2.2 倍;在三分之一的测试点上,提升达到 4 倍或更高。总体来看,在各种测试场景下,新定律将平均绝对百分比误差(MAPE)较 Chinchilla 降低了 1.5 至 3 倍。

Skaling 还能使用稀疏的“L 形” profiling 网格实现几乎相同的精度——即先固定一个维度改变另一个维度,再换方向重复。这种方法消耗的计算量比 Chinchilla 所需的全网格方法少约 10 倍。在前沿算力水平下,最优 token 与参数之比可能与 Chinchilla 的建议相差数个数量级。

这对模型训练策略具有重要意义。Chinchilla 论文在 2022 年问世时颇具颠覆性,指出许多已有模型存在明显训练不足的问题——即研究人员构建了过多参数,却没有喂入足够的数据。如今,许多生产模型会刻意“过度训练”,让模型看到的 token 数远高于 Chinchilla 最优比例,因为推理成本更倾向于打造小而强的模型。Skaling 定律的耦合指数能够捕捉在过度训练区间内最优平衡如何偏移。实际结果是,当数据可用性受限,或者你为了部署效率故意训练较小的模型时,Skaling 能更准确地告诉你该如何调整模型参数。

免责声明:本文提供的信息不是交易建议。BlockWeeks.com不对根据本文提供的信息所做的任何投资承担责任。我们强烈建议在做出任何投资决策之前进行独立研究或咨询合格的专业人士。

(0)
区块链小猫的头像区块链小猫作者
上一篇 11小时前
下一篇 11小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部