AI 與科技名詞白話解釋

Transformer 架構(Transformer)是什麼?

Transformer 是一種完全以注意力機制處理序列資料的神經網路架構,由 Google 的 Vaswani 等人於 2017 年在論文〈Attention Is All You Need〉提出。它不需逐字依序處理,可大量平行運算,成為現今多數大型語言模型的基礎。

模型技術TransformerTransformer 模型變換器轉換器架構注意力機制Self-Attention

一句話說明

以「注意力機制」為核心的神經網路架構,是 GPT 等大型語言模型的基礎。

Transformer 架構怎麼運作?

  1. 把輸入文字切成 token,並轉成向量,同時加入位置資訊。
  2. 透過「自注意力」計算每個 token 和其他 token 的關聯程度。
  3. 多層注意力與神經網路層疊加,逐步形成對整段文字的理解。
  4. 輸出層依此預測下一個 token 或產生翻譯等結果。

實際例子

常見誤解

誤解:Transformer 是某一個 AI 產品的名字。
事實:它是一種模型架構設計,許多不同公司的模型都以它為基礎。
誤解:Transformer 只能處理文字。
事實:它也被用在圖片、聲音等資料,是許多多模態模型的基礎。

常見問題

注意力機制用白話怎麼解釋?

就像閱讀時會特別留意和目前這個詞最相關的其他詞。例如「他把手機放進包包,因為它沒電了」,注意力機制幫模型判斷「它」指的是手機。

為什麼 Transformer 對 AI 發展這麼重要?

它能平行處理整段文字,比過去逐字處理的循環神經網路訓練快很多,讓研究者能用更大資料訓練更大模型,才有後來的大型語言模型。

相關名詞

大型語言模型、詞元、多模態、嵌入向量與向量資料庫

參考來源

查核日期:2026-09-26。API:/api/term?id=transformer