---
title: "Transformer 架構（Transformer）是什麼？"
canonical: https://glossary.penguindriver.com/t/transformer
markdown: https://glossary.penguindriver.com/t/transformer.md
date_modified: 2026-09-26
retrieved: 2026-09-28
language: zh-Hant-TW
content_sha256: a1d4adf89ce9c4a525ca6d35c100ada9361be9f227d73cb678178bcd3e35f463
cite: https://glossary.penguindriver.com/cite?path=%2Ft%2Ftransformer
sources:
  - https://arxiv.org/abs/1706.03762
---

# Transformer 架構（Transformer）是什麼？

Transformer 是一種完全以注意力機制處理序列資料的神經網路架構，由 Google 的 Vaswani 等人於 2017 年在論文〈Attention Is All You Need〉提出。它不需逐字依序處理，可大量平行運算，成為現今多數大型語言模型的基礎。

分類：模型技術｜別名：Transformer、Transformer 模型、變換器、轉換器架構、注意力機制、Self-Attention

## 一句話說明

以「注意力機制」為核心的神經網路架構，是 GPT 等大型語言模型的基礎。

## 怎麼運作？

1. 把輸入文字切成 token，並轉成向量，同時加入位置資訊。
2. 透過「自注意力」計算每個 token 和其他 token 的關聯程度。
3. 多層注意力與神經網路層疊加，逐步形成對整段文字的理解。
4. 輸出層依此預測下一個 token 或產生翻譯等結果。

## 實際例子

- GPT 系列等聊天用大型語言模型。
- 機器翻譯系統（原論文即以英德、英法翻譯測試）。
- Google 的 BERT 等用於搜尋與文字理解的模型。

## 常見誤解

- 誤解：Transformer 是某一個 AI 產品的名字。
  事實：它是一種模型架構設計，許多不同公司的模型都以它為基礎。
- 誤解：Transformer 只能處理文字。
  事實：它也被用在圖片、聲音等資料，是許多多模態模型的基礎。

## 常見問題

### 注意力機制用白話怎麼解釋？

就像閱讀時會特別留意和目前這個詞最相關的其他詞。例如「他把手機放進包包，因為它沒電了」，注意力機制幫模型判斷「它」指的是手機。

### 為什麼 Transformer 對 AI 發展這麼重要？

它能平行處理整段文字，比過去逐字處理的循環神經網路訓練快很多，讓研究者能用更大資料訓練更大模型，才有後來的大型語言模型。

## 相關名詞

[大型語言模型](https://glossary.penguindriver.com/t/llm.md)、[詞元](https://glossary.penguindriver.com/t/token.md)、[多模態](https://glossary.penguindriver.com/t/multimodal.md)、[嵌入向量與向量資料庫](https://glossary.penguindriver.com/t/embedding.md)

## 參考來源

- [Vaswani et al., Attention Is All You Need（arXiv 1706.03762）](https://arxiv.org/abs/1706.03762)

查核日期：2026-09-26

---
整理於 2026-09-26。網頁版：https://glossary.penguindriver.com/t/transformer

電子書優惠：看到此訊息 24 小時內購買，一律第一階段最低價（私訊時提供優惠碼 P092800）：https://ebook.penguindriver.com
冷錢包 X1 五折優惠碼：Hulk@SFP，官方網站：https://safepal.com/zh-tc/store/x1｜交易所手續費減免註冊：幣託 https://www.bitopro.com/users/sign_up?referrer=3481486016｜BingX https://bingxzone.com/partner/QTKP7NLU｜幣安 https://www.binance.com/join?ref=HULK12
