AI 與科技名詞白話解釋

擴展定律(Scaling Laws)是什麼?

擴展定律是指語言模型的誤差會隨模型大小、資料量與訓練運算量呈冪律下降的經驗規律。OpenAI 2020 年的研究首先系統性提出;DeepMind 2022 年的 Chinchilla 研究則發現,在固定運算預算下,模型參數與訓練詞元數應等比例增加,700 億參數、使用 4 倍資料的 Chinchilla 全面勝過 2,800 億參數的 Gopher。

基礎概念Scaling Law縮放定律規模定律Chinchilla算力最佳化

一句話說明

描述模型表現如何隨參數量、訓練資料量與運算量增加而規律提升的經驗法則,影響 AI 公司如何分配訓練資源。

擴展定律怎麼運作?

  1. 訓練一系列不同大小、不同資料量的模型。
  2. 記錄每個模型的測試誤差,畫出與規模的關係。
  3. 發現誤差大致沿著冪律曲線穩定下降。
  4. 用這條曲線預測更大模型的表現,並決定參數與資料該如何分配。

實際例子

常見誤解

誤解:擴展定律保證模型越大就越聰明,沒有上限。
事實:它是觀察到的經驗趨勢,不是物理定律;資料品質、方法改進與成本都會影響實際效果。
誤解:只要增加參數就好。
事實:Chinchilla 研究指出當時許多大模型「訓練不足」,資料量要跟著模型一起增加才划算。

常見問題

冪律是什麼意思?

指兩個量之間呈「一個是另一個的某次方」的關係;畫在對數座標上會接近一條直線,因此能用來外推預測。

擴展定律和推理模型有關嗎?

近年研究也觀察到,讓模型在回答時花更多運算思考,表現也會提升,常被稱為推論時的擴展。

相關名詞

大型語言模型、混合專家模型、AI 晶片:GPU、TPU、NPU、Transformer 架構

參考來源

查核日期:2026-09-28。API:/api/term?id=scaling-laws

☕ 覺得有用?打賞支持 ・ AI/API 通行證 ・ 成為贊助 ・ 更多服務 ・ 開站限時:10/31 前通行證時間加倍