注意力機制(Attention Mechanism)是什麼?
注意力機制是讓神經網路在處理某個位置時,依相關程度加權參考其他位置資訊的方法。2014 年 Bahdanau 等人把它用在機器翻譯;2017 年 Google 團隊的論文〈Attention Is All You Need〉提出完全以自注意力為基礎的 Transformer 架構,成為現今大型語言模型的基礎。
模型技術Attention注意力自注意力Self-AttentionAttention Is All You Need
一句話說明
讓模型處理每個詞時,自動判斷該參考輸入中哪些其他部分、參考多少的計算方法,是 Transformer 的核心。
注意力機制怎麼運作?
- 把每個詞元轉成查詢(Query)、鍵(Key)、值(Value)三組向量。
- 用查詢和每個鍵比對,算出彼此的相關分數。
- 把分數換成權重,對所有值做加權平均。
- 多組注意力(多頭注意力)同時運作,分別捕捉不同類型的關係。
實際例子
- 翻譯時,模型產生某個字會特別參考原文中對應的詞。
- 讀到「它」這個字時,模型把注意力放在前文所指的名詞上。
- 長文件摘要時,找出與主題最相關的句子。
常見誤解
誤解:注意力機制代表模型真的像人一樣在「專心」。
事實:這只是數學上的加權計算,名稱是比喻,不代表模型有意識。
事實:這只是數學上的加權計算,名稱是比喻,不代表模型有意識。
誤解:注意力是 Transformer 才發明的。
事實:注意力在 2014 年就用在循環神經網路的翻譯模型;Transformer 的突破是拿掉循環結構、只靠注意力。
事實:注意力在 2014 年就用在循環神經網路的翻譯模型;Transformer 的突破是拿掉循環結構、只靠注意力。
常見問題
為什麼上下文越長,模型越耗資源?
標準自注意力要讓每個詞元和所有其他詞元比對,計算量大約隨長度的平方增加,因此長上下文需要更多運算與記憶體。
自注意力和注意力有什麼不同?
自注意力是輸入序列內部彼此互相參考;早期翻譯模型的注意力則是輸出端去參考輸入端。
相關名詞
Transformer 架構、大型語言模型、上下文視窗、詞元
參考來源
- Vaswani et al., Attention Is All You Need(arXiv 1706.03762)
- Bahdanau et al., Neural Machine Translation by Jointly Learning to Align and Translate(arXiv 1409.0473)
查核日期:2026-09-28。API:/api/term?id=attention