AI 與科技名詞白話解釋

注意力機制(Attention Mechanism)是什麼?

注意力機制是讓神經網路在處理某個位置時,依相關程度加權參考其他位置資訊的方法。2014 年 Bahdanau 等人把它用在機器翻譯;2017 年 Google 團隊的論文〈Attention Is All You Need〉提出完全以自注意力為基礎的 Transformer 架構,成為現今大型語言模型的基礎。

模型技術Attention注意力自注意力Self-AttentionAttention Is All You Need

一句話說明

讓模型處理每個詞時,自動判斷該參考輸入中哪些其他部分、參考多少的計算方法,是 Transformer 的核心。

注意力機制怎麼運作?

  1. 把每個詞元轉成查詢(Query)、鍵(Key)、值(Value)三組向量。
  2. 用查詢和每個鍵比對,算出彼此的相關分數。
  3. 把分數換成權重,對所有值做加權平均。
  4. 多組注意力(多頭注意力)同時運作,分別捕捉不同類型的關係。

實際例子

常見誤解

誤解:注意力機制代表模型真的像人一樣在「專心」。
事實:這只是數學上的加權計算,名稱是比喻,不代表模型有意識。
誤解:注意力是 Transformer 才發明的。
事實:注意力在 2014 年就用在循環神經網路的翻譯模型;Transformer 的突破是拿掉循環結構、只靠注意力。

常見問題

為什麼上下文越長,模型越耗資源?

標準自注意力要讓每個詞元和所有其他詞元比對,計算量大約隨長度的平方增加,因此長上下文需要更多運算與記憶體。

自注意力和注意力有什麼不同?

自注意力是輸入序列內部彼此互相參考;早期翻譯模型的注意力則是輸出端去參考輸入端。

相關名詞

Transformer 架構、大型語言模型、上下文視窗、詞元

參考來源

查核日期:2026-09-28。API:/api/term?id=attention

☕ 覺得有用?打賞支持 ・ AI/API 通行證 ・ 成為贊助 ・ 更多服務 ・ 開站限時:10/31 前通行證時間加倍