Transformer 架構(Transformer)是什麼?
Transformer 是一種完全以注意力機制處理序列資料的神經網路架構,由 Google 的 Vaswani 等人於 2017 年在論文〈Attention Is All You Need〉提出。它不需逐字依序處理,可大量平行運算,成為現今多數大型語言模型的基礎。
模型技術TransformerTransformer 模型變換器轉換器架構注意力機制Self-Attention
一句話說明
以「注意力機制」為核心的神經網路架構,是 GPT 等大型語言模型的基礎。
Transformer 架構怎麼運作?
- 把輸入文字切成 token,並轉成向量,同時加入位置資訊。
- 透過「自注意力」計算每個 token 和其他 token 的關聯程度。
- 多層注意力與神經網路層疊加,逐步形成對整段文字的理解。
- 輸出層依此預測下一個 token 或產生翻譯等結果。
實際例子
- GPT 系列等聊天用大型語言模型。
- 機器翻譯系統(原論文即以英德、英法翻譯測試)。
- Google 的 BERT 等用於搜尋與文字理解的模型。
常見誤解
誤解:Transformer 是某一個 AI 產品的名字。
事實:它是一種模型架構設計,許多不同公司的模型都以它為基礎。
事實:它是一種模型架構設計,許多不同公司的模型都以它為基礎。
誤解:Transformer 只能處理文字。
事實:它也被用在圖片、聲音等資料,是許多多模態模型的基礎。
事實:它也被用在圖片、聲音等資料,是許多多模態模型的基礎。
常見問題
注意力機制用白話怎麼解釋?
就像閱讀時會特別留意和目前這個詞最相關的其他詞。例如「他把手機放進包包,因為它沒電了」,注意力機制幫模型判斷「它」指的是手機。
為什麼 Transformer 對 AI 發展這麼重要?
它能平行處理整段文字,比過去逐字處理的循環神經網路訓練快很多,讓研究者能用更大資料訓練更大模型,才有後來的大型語言模型。
相關名詞
參考來源
查核日期:2026-09-26。API:/api/term?id=transformer