AI 基準測驗(AI Benchmark)是什麼?
AI 基準測驗是以固定題庫與評分方式比較模型能力的標準化測試。常見的 MMLU 由 Hendrycks 等人 2020 年提出,涵蓋小學數學、美國歷史、電腦科學、法律等 57 個科目的選擇題;當時多數模型接近隨機猜測,最大的 GPT-3 平均只比亂猜高近 20 個百分點。
基礎概念Benchmark基準測試跑分MMLU評測
一句話說明
用一套固定題目衡量並比較 AI 模型能力的標準測驗,例如常見的 MMLU、GSM8K。
AI 基準測驗怎麼運作?
- 研究者設計一組有標準答案的題目與評分規則。
- 讓不同模型在相同條件下作答。
- 計算正確率或分數,列成排行榜比較。
- 隨著模型進步,舊測驗被「考滿分」後,會再推出更難的新測驗。
實際例子
- MMLU 測多學科知識,GSM8K 測小學數學應用題。
- 新模型發表時常附上一張各項基準測驗分數表。
- 企業選模型時,先看公開分數,再用自家資料實測。
常見誤解
誤解:基準分數越高,實際用起來一定越好。
事實:測驗只涵蓋特定題型,且題目可能已出現在訓練資料中;實際效果仍要用自己的任務測試。
事實:測驗只涵蓋特定題型,且題目可能已出現在訓練資料中;實際效果仍要用自己的任務測試。
誤解:不同公司公布的分數可以直接比較。
事實:提示方式、範例數量、評分細節不同,分數就可能差很多,比較時要確認測試條件一致。
事實:提示方式、範例數量、評分細節不同,分數就可能差很多,比較時要確認測試條件一致。
常見問題
什麼是測驗「污染」?
指測驗題目或答案出現在模型的訓練資料裡,模型可能是背答案而非真的會解,分數因此偏高。
為什麼常看到新的基準測驗?
頂尖模型在舊測驗上接近滿分後就難以分出高下,研究者會推出更難或更貼近實際工作的新測驗。
相關名詞
參考來源
- Hendrycks et al., Measuring Massive Multitask Language Understanding(MMLU,arXiv 2009.03300)
- Wei et al., Chain-of-Thought Prompting(GSM8K 實驗,arXiv 2201.11903)
查核日期:2026-09-28。API:/api/term?id=benchmark