Scaling Laws 還有多少餘量?2026年大模型算力效率全拆解
2026年大模型Scaling Laws全拆解:算力效率、突現能力、推理時Scaling。
專屬插圖

Scaling Laws 還有多少餘量?
2020年,OpenAI發布了那篇著名的 Scaling Laws 論文。結論很清晰:模型參數量、資料量、算力三要素按冪律關係縮放,損失就會可預測地降低。四年過去,這個賭注還成立嗎?
冪律曲線正在彎曲
從 GPT-3 到 GPT-4,參數量翹了約10倍,MMLU從70%漲到87%。但從 GPT-4 到現在的主流模型,同樣算力投入,MMLU 提升越來越小。這不是Scaling失效,而是我們選錯了度量標準。MMLU本質上是填空題,大模型在填空題上的天花板比我們想像的低。
Emergent Abilities:突現還是幻覺
2023年反駁論文指出:用連續評估指標來看,能力提升其實是平滑的。實踐結論:現在的模型能力已夠足夠,問題是怎麼用好。
Compute Efficiency:真正的戰場
我們自己在跑本地推理叢集(680GB統一記憶體,Qwen3.5-122B)。同樣是 1T tokens 的訓練,不同資料配比效果差距可體達10-15%。這就是 Scaling Laws 2.0 的核心轉變:從「堆規模」到「堆效率」。
推理時間計算:新維度的 Scaling
OpenAI o1、DeepSeek R1、Claude 3.7 Extended Thinking 都在把算力從訓練時轉移到推理時。我們實測:Qwen3.5-122B開啟thinking模式在複雜程式碼任務正確率從62%提升到81%,代價是推理時間從3s變25s。
SFD編者注
本地跑Qwen3.5-122B的日常:模型大小已非決定性因素。Prompt工程、thinking模式切換、任務分解,這些使用層面的優化對實際效果的影響已超過參數量本身。Scaling Laws沒死,只是戰場換了地方。
留言區
歡迎分享你的想法!
發表留言
0/500
載入留言中…