AI 與科技名詞白話解釋

多模態(Multimodal)是什麼?

多模態是指 AI 模型能處理不只一種資料形式,例如同時看懂圖片和文字,或聽懂語音。OpenAI 在 2023 年 3 月的 GPT-4 技術報告中,將 GPT-4 描述為可接受圖片與文字輸入、輸出文字的大型多模態模型。

模型技術Multimodal多模態 AI多模態模型Multimodal AI多模式

一句話說明

能同時理解或產生文字、圖片、聲音、影片等多種資料形式的 AI 能力。

多模態怎麼運作?

  1. 不同形式的資料(文字、圖片、聲音)各自被轉換成模型能處理的 token 或向量。
  2. 模型在訓練時學習不同形式資料之間的對應關係。
  3. 使用時可混合輸入,例如一張照片加一句問題。
  4. 模型綜合各種資訊後輸出文字、圖片或語音。

實際例子

常見誤解

誤解:多模態就是把幾個不同的 AI 工具串起來。
事實:有些系統是串接,但多模態模型通常是在同一個模型中一起理解多種資料。
誤解:多模態模型一定什麼格式都能輸入和輸出。
事實:每個模型支援的輸入與輸出形式不同,例如有的能看圖但只能輸出文字。

常見問題

多模態模型是怎麼處理圖片的?

圖片會被切成小區塊並轉成 token,和文字一起送進模型。例如 Gemini 文件說明,大圖片會切成 768×768 像素的區塊,每塊計為 258 個 token。

多模態 AI 和一般聊天 AI 有什麼不同?

一般聊天 AI 只處理文字;多模態 AI 還能理解圖片、聲音或影片,因此能做看圖回答、語音對話、分析截圖等任務。

相關名詞

大型語言模型、生成式 AI、詞元、Transformer 架構

參考來源

查核日期:2026-09-26。API:/api/term?id=multimodal