大型語言模型(Large Language Model (LLM))是什麼?
大型語言模型(LLM)是用海量文字訓練、透過預測下一個詞元來理解與產生文字的大型神經網路。2020 年 OpenAI 發表的 GPT-3 有 1,750 億個參數,展示了只給幾個範例就能完成新任務的能力。目前主流 LLM 多採用 Transformer 架構。
基礎概念LLMLarge Language Model大語言模型語言模型大模型
一句話說明
用大量文字資料訓練、能理解與產生自然語言的超大型 AI 模型,是 ChatGPT 等聊天 AI 的核心。
大型語言模型怎麼運作?
- 收集大量公開文字、書籍、程式碼等資料,切成詞元(Token)。
- 預訓練:讓模型反覆練習「猜下一個詞元」,學會語言規律與知識。
- 再用人工示範與回饋調整,讓模型更會遵循指令、回答更有幫助。
- 使用時,模型根據輸入逐一產生詞元,組成完整回答。
實際例子
- 聊天助理回答問題、寫信、翻譯。
- 程式助理根據說明產生或修改程式碼。
- 把長篇報告摘要成重點。
常見誤解
誤解:LLM 像資料庫一樣把資料存起來再查詢。
事實:LLM 是從資料中學到統計規律,回答是「生成」出來的,不是查表,所以可能出錯。
事實:LLM 是從資料中學到統計規律,回答是「生成」出來的,不是查表,所以可能出錯。
誤解:參數越多的模型一定越好用。
事實:訓練方法也很關鍵;OpenAI 2022 年研究顯示,經人類回饋調整的 13 億參數模型,回答比 1,750 億參數的 GPT-3 更受人偏好。
事實:訓練方法也很關鍵;OpenAI 2022 年研究顯示,經人類回饋調整的 13 億參數模型,回答比 1,750 億參數的 GPT-3 更受人偏好。
常見問題
大型語言模型的「大」是指什麼?
主要指參數數量與訓練資料量都非常大。參數是模型內部可調整的數值,數量可達數十億到上兆;訓練資料則常是數千億個詞元以上的文字。
大型語言模型會不會自己上網查資料?
模型本身只根據訓練時學到的內容回答,有知識截止日期。要取得最新資訊,需要由應用程式提供搜尋工具或用 RAG 把資料放進上下文。
大型語言模型和生成式 AI 是同一件事嗎?
不完全相同。生成式 AI 泛指能產生文字、圖片、聲音、影片的 AI;大型語言模型是其中專門處理語言的一類,也是目前最常見的生成式 AI。
延伸閱讀
相關名詞
Transformer 架構、詞元、生成式 AI、微調、上下文視窗
參考來源
- Brown et al., Language Models are Few-Shot Learners(GPT-3,arXiv 2005.14165)
- Ouyang et al., Training language models to follow instructions with human feedback(arXiv 2203.02155)
查核日期:2026-09-26。API:/api/term?id=llm