AI 與科技名詞白話解釋

模型量化(Quantization)是什麼?

模型量化是把模型權重等數值從 32 位元浮點數改用 int8、int4 等低精度格式表示,以減少記憶體與運算量的技術。依 Hugging Face 文件,int8 相較 float32 約可讓模型縮小 4 倍,代價是可能略微降低準確度。

模型技術Quantization量化int8 量化4-bit 量化

一句話說明

把模型裡的數字改用較少位元儲存,讓模型變小、跑得更快的壓縮技術。

模型量化怎麼運作?

  1. 找出模型權重數值的分布範圍
  2. 用比例與零點把浮點數對應到整數範圍(例如 -128 到 127)
  3. 以低精度格式儲存並進行推論運算
  4. 必要時用量化感知訓練減少準確度損失

實際例子

常見誤解

誤解:量化一定會讓模型變很笨
事實:適度量化通常只帶來小幅準確度下降,但位元數壓得越低,風險越高

常見問題

模型量化後為什麼能在筆電上執行?

量化降低了每個參數佔用的位元數,模型需要的記憶體大幅減少,例如 int8 約為 float32 的四分之一,讓記憶體有限的設備也能載入。

訓練後量化和量化感知訓練差在哪裡?

訓練後量化(PTQ)是模型訓練完才轉換,簡單快速;量化感知訓練(QAT)在訓練時就模擬量化效果,通常能保留較好的準確度。

相關名詞

模型蒸餾、小型語言模型、AI PC 與邊緣 AI

參考來源

查核日期:2026-09-26。API:/api/term?id=quantization