擴展定律(Scaling Laws)是什麼?
擴展定律是指語言模型的誤差會隨模型大小、資料量與訓練運算量呈冪律下降的經驗規律。OpenAI 2020 年的研究首先系統性提出;DeepMind 2022 年的 Chinchilla 研究則發現,在固定運算預算下,模型參數與訓練詞元數應等比例增加,700 億參數、使用 4 倍資料的 Chinchilla 全面勝過 2,800 億參數的 Gopher。
基礎概念Scaling Law縮放定律規模定律Chinchilla算力最佳化
一句話說明
描述模型表現如何隨參數量、訓練資料量與運算量增加而規律提升的經驗法則,影響 AI 公司如何分配訓練資源。
擴展定律怎麼運作?
- 訓練一系列不同大小、不同資料量的模型。
- 記錄每個模型的測試誤差,畫出與規模的關係。
- 發現誤差大致沿著冪律曲線穩定下降。
- 用這條曲線預測更大模型的表現,並決定參數與資料該如何分配。
實際例子
- 研究團隊先用小模型實驗,推估大模型需要多少資料。
- Chinchilla 研究促使業界用更多資料訓練較小的模型。
- 規劃資料中心與晶片採購時,參考擴展趨勢估算需求。
常見誤解
誤解:擴展定律保證模型越大就越聰明,沒有上限。
事實:它是觀察到的經驗趨勢,不是物理定律;資料品質、方法改進與成本都會影響實際效果。
事實:它是觀察到的經驗趨勢,不是物理定律;資料品質、方法改進與成本都會影響實際效果。
誤解:只要增加參數就好。
事實:Chinchilla 研究指出當時許多大模型「訓練不足」,資料量要跟著模型一起增加才划算。
事實:Chinchilla 研究指出當時許多大模型「訓練不足」,資料量要跟著模型一起增加才划算。
常見問題
冪律是什麼意思?
指兩個量之間呈「一個是另一個的某次方」的關係;畫在對數座標上會接近一條直線,因此能用來外推預測。
擴展定律和推理模型有關嗎?
近年研究也觀察到,讓模型在回答時花更多運算思考,表現也會提升,常被稱為推論時的擴展。
相關名詞
大型語言模型、混合專家模型、AI 晶片:GPU、TPU、NPU、Transformer 架構
參考來源
- Kaplan et al., Scaling Laws for Neural Language Models(arXiv 2001.08361)
- Hoffmann et al., Training Compute-Optimal Large Language Models(Chinchilla,arXiv 2203.15556)
查核日期:2026-09-28。API:/api/term?id=scaling-laws