Scaling Laws还有多少余量?2026年大模型算力效率全拆解

Scaling Laws 还有多少余量?
2020年,OpenAI发布了那篇著名的 Scaling Laws 论文。结论很清晰:模型参数量、数据量、算力三要素按幂律关系缩放,损失就会可预测地降低。当时整个行业都在赌:堆参数就能变强。
四年过去,这个赌注还成立吗?
幂律曲线正在弯曲
先看一组真实数据。从 GPT-3(175B)到 GPT-4(据估计1.8T MoE),参数量翻了约10倍。MMLU基准分从约70%涨到了约87%。但从 GPT-4 到现在的主流模型,同样量级的算力投入,MMLU 提升越来越小——满分是100%,提升空间本来就在收窄。
这不是Scaling失效,而是我们在选错了度量标准。
MMLU、HumanEval这些基准测的是「知识召回+推理」的混合能力,本质上是填空题。大模型在填空题上的天花板比我们想象的低。你不能用填空题成绩来判断是否撞上了智能的上限。
Emergent Abilities:突现还是幻觉
2022年那篇突现能力论文在学界引发了很大争议。论文说:模型在跨过某个参数规模阈值后,能力会突然涌现——比如算术推理、Chain-of-Thought。
但2023年的反驳论文(Schaeffer et al.)指出:这种「突现」很可能是测量方法的假象。用连续的评估指标(而不是Pass/Fail)来看,能力提升其实是平滑的。「突现」只是因为我们用了不连续的评分方式,看起来像跳跃。
这个争论还没有定论,但有一个实践层面的结论:不要等着下一个「突现时刻」,现在的模型能力已经足够,问题是怎么用好。
Compute Efficiency:真正的战场
我们自己在跑本地推理集群,680GB统一内存,跑 Qwen3.5-122B。这件事给了我们一些直观感受:
同样是 1T tokens 的训练,不同的数据配比、不同的训练流程,效果差距可以高达10-15%。Llama 3 70B 在某些任务上能打 GPT-4-turbo,不是因为参数多,而是因为数据质量控制做得好。
这就是 Scaling Laws 2.0 的核心转变:从「堆规模」到「堆效率」。
Google 的 Gemma 系列、Meta 的 Llama 3、Mistral 这些小模型都在证明这一点:用更少的算力,通过更好的数据处理、更精细的训练流程,可以逼近甚至超越比自己大3-5倍的模型。
推理时间计算:新维度的 Scaling
OpenAI o1、DeepSeek R1、Claude 3.7 的 Extended Thinking 模式——这些都在探索一个新方向:把算力从训练时转移到推理时。
传统 Scaling 的逻辑是训练时堆参数。新逻辑是:同样的模型,让它在推理时多想几步,效果可以大幅提升。
这背后有一个深刻的观察:很多任务的难点不在于知识,而在于推理链的长度和质量。让模型「多思考」,等于给它更多的计算图来解决同一个问题。
我们实测的数据:Qwen3.5-122B 开启 thinking 模式 vs 关闭,在复杂代码任务上正确率从 62% 提升到 81%。代价是推理时间从 3s 变成 25s。这个 tradeoff 在很多场景下完全值得。
「Scaling Ceiling」的真相
有种论调说 Scaling 已经到了天花板。这话半对半错。
对的地方:用2020年定义的 Scaling(堆参数、堆数据、堆算力)来看,边际收益确实在降低。训练成本的可持续性是真实问题,GPT-5 传说中的训练成本高达 10 亿美元,这个数字不可能无限增长。
错的地方:推理时间 Scaling、数据效率 Scaling、架构创新带来的 Scaling 空间还远没有被充分探索。
2026年我们看到的格局是:
- 大模型厂商在用 Mixture of Experts 压缩推理成本
- 开源社区在用更好的数据做出更小的强模型
- 推理时 Scaling 正在成为主流技术路线
SFD编者注
我们自己在本地跑 Qwen3.5-122B,日常测试下来有几个感受:单纯的模型大小已经不是决定性因素,Prompt 工程、thinking 模式切换、任务分解方式,这些「使用层面」的优化对实际效果的影响已经超过了模型本身的参数量。
Scaling Laws 没死,只是战场换了地方。
留言区
欢迎分享你的想法!
加载留言中…