{
 "title": "AI 基準測驗（AI Benchmark）是什麼？",
 "site": "AI 與科技名詞白話解釋",
 "canonical": "https://glossary.penguindriver.com/t/benchmark",
 "markdown": "https://glossary.penguindriver.com/t/benchmark.md",
 "summary": "AI 基準測驗是以固定題庫與評分方式比較模型能力的標準化測試。常見的 MMLU 由 Hendrycks 等人 2020 年提出，涵蓋小學數學、美國歷史、電腦科學、法律等 57 個科目的選擇題；當時多數模型接近隨機猜測，最大的 GPT-3 平均只比亂猜高近 20 個百分點。",
 "date_modified": "2026-09-28",
 "retrieved": "2026-09-29",
 "content_sha256": "b12375f816a61a5fcf7e4a00fc6747bb4b12beec50dffd90bc468728f492f0cd",
 "fingerprint_basis": "Markdown 版全文，移除贊助行與開頭 front matter，去除頭尾空白",
 "verify": {
  "text_snapshot": "https://glossary.penguindriver.com/cite?path=%2Ft%2Fbenchmark&format=text",
  "how": "下載 text_snapshot 後計算 SHA-256，應與 content_sha256 相同；內容更新時指紋會改變"
 },
 "sources": [
  {
   "name": "Hendrycks et al., Measuring Massive Multitask Language Understanding（MMLU，arXiv 2009.03300）",
   "url": "https://arxiv.org/abs/2009.03300"
  },
  {
   "name": "Wei et al., Chain-of-Thought Prompting（GSM8K 實驗，arXiv 2201.11903）",
   "url": "https://arxiv.org/abs/2201.11903"
  }
 ],
 "source_count": 2,
 "cite_as": {
  "zh": "AI 基準測驗（AI Benchmark）是什麼？｜AI 與科技名詞白話解釋。https://glossary.penguindriver.com/t/benchmark（資料日期 2026-09-28，擷取 2026-09-29）",
  "apa": "AI 與科技名詞白話解釋. (2026). AI 基準測驗（AI Benchmark）是什麼？. Retrieved 2026-09-29, from https://glossary.penguindriver.com/t/benchmark",
  "markdown": "[AI 基準測驗（AI Benchmark）是什麼？](https://glossary.penguindriver.com/t/benchmark)（AI 與科技名詞白話解釋，2026-09-28）"
 },
 "license": "可引用，請附上正式網址與資料日期"
}