擴散模型(Diffusion Model)是什麼?
擴散模型是學習「逐步去除雜訊」來生成資料的模型。2020 年 Ho 等人發表的 DDPM 論文讓這類方法在圖片品質上受到重視;2021 年 Rombach 等人提出在壓縮後的潛在空間中進行擴散,大幅降低運算成本,也就是 Stable Diffusion 採用的方法。
模型技術Diffusion擴散DDPM潛在擴散Stable Diffusion
一句話說明
從一張雜訊圖開始,一步步去除雜訊而產生圖片的生成式 AI 技術,是多數 AI 繪圖工具的核心。
擴散模型怎麼運作?
- 訓練時,把真實圖片一點一點加上雜訊,直到變成純雜訊。
- 讓模型學習每一步該去除多少雜訊。
- 生成時從隨機雜訊出發,反覆執行去雜訊步驟。
- 可加入文字描述當條件,引導模型畫出符合描述的圖。
實際例子
- 輸入一句描述,產生插畫或照片風格的圖片。
- 把照片的一部分遮住,讓模型補畫缺少的內容。
- 文字轉影片工具也常以擴散模型為基礎。
常見誤解
誤解:擴散模型是把網路上的圖片剪貼拼湊。
事實:模型學的是從雜訊還原圖片的規律,生成時是從隨機雜訊逐步計算出新圖片。
事實:模型學的是從雜訊還原圖片的規律,生成時是從隨機雜訊逐步計算出新圖片。
誤解:擴散模型只能做圖片。
事實:同樣的方法也被用在影片、聲音與其他資料的生成。
事實:同樣的方法也被用在影片、聲音與其他資料的生成。
常見問題
潛在擴散(Latent Diffusion)有什麼好處?
先把圖片壓縮成較小的潛在表示,再在這個空間做擴散,運算量比直接處理每個像素少很多,一般顯示卡也能執行。
擴散模型和大型語言模型有什麼不同?
大型語言模型通常一個一個預測下一個詞元;擴散模型則是對整張圖反覆去除雜訊。兩者都屬於生成式 AI。
相關名詞
生成式 AI、多模態、深度偽造、Transformer 架構
參考來源
- Ho et al., Denoising Diffusion Probabilistic Models(arXiv 2006.11239)
- Rombach et al., High-Resolution Image Synthesis with Latent Diffusion Models(arXiv 2112.10752)
查核日期:2026-09-28。API:/api/term?id=diffusion-model