AI 與科技名詞白話解釋

AI 基準測驗(AI Benchmark)是什麼?

AI 基準測驗是以固定題庫與評分方式比較模型能力的標準化測試。常見的 MMLU 由 Hendrycks 等人 2020 年提出,涵蓋小學數學、美國歷史、電腦科學、法律等 57 個科目的選擇題;當時多數模型接近隨機猜測,最大的 GPT-3 平均只比亂猜高近 20 個百分點。

基礎概念Benchmark基準測試跑分MMLU評測

一句話說明

用一套固定題目衡量並比較 AI 模型能力的標準測驗,例如常見的 MMLU、GSM8K。

AI 基準測驗怎麼運作?

  1. 研究者設計一組有標準答案的題目與評分規則。
  2. 讓不同模型在相同條件下作答。
  3. 計算正確率或分數,列成排行榜比較。
  4. 隨著模型進步,舊測驗被「考滿分」後,會再推出更難的新測驗。

實際例子

常見誤解

誤解:基準分數越高,實際用起來一定越好。
事實:測驗只涵蓋特定題型,且題目可能已出現在訓練資料中;實際效果仍要用自己的任務測試。
誤解:不同公司公布的分數可以直接比較。
事實:提示方式、範例數量、評分細節不同,分數就可能差很多,比較時要確認測試條件一致。

常見問題

什麼是測驗「污染」?

指測驗題目或答案出現在模型的訓練資料裡,模型可能是背答案而非真的會解,分數因此偏高。

為什麼常看到新的基準測驗?

頂尖模型在舊測驗上接近滿分後就難以分出高下,研究者會推出更難或更貼近實際工作的新測驗。

相關名詞

大型語言模型、推理模型、AI 幻覺

參考來源

查核日期:2026-09-28。API:/api/term?id=benchmark

☕ 覺得有用?打賞支持 ・ AI/API 通行證 ・ 成為贊助 ・ 更多服務 ・ 開站限時:10/31 前通行證時間加倍