AI 與科技名詞白話解釋

混合專家模型(Mixture of Experts (MoE))是什麼?

混合專家模型(MoE)是在神經網路中放入多個專家子網路,由路由器為每個詞元挑選少數專家處理的架構。以 Mistral AI 2024 年發表的 Mixtral 8x7B 為例,每層有 8 個專家、每個詞元只用 2 個,總參數 470 億,但推論時每個詞元只啟用 130 億參數。

模型技術MoEMixture of Experts專家混合稀疏模型SMoE

一句話說明

把模型拆成許多「專家」子網路,每次只啟用其中幾個來處理輸入,讓大模型用較少運算就能運作。

混合專家模型怎麼運作?

  1. 把模型中的前饋網路層複製成多個「專家」。
  2. 加入一個路由器(gating network),根據輸入決定要交給哪幾個專家。
  3. 只有被選中的專家參與計算,其他專家這次不運算。
  4. 把被選中專家的輸出加權合併,繼續傳到下一層。

實際例子

常見誤解

誤解:MoE 的每個專家都是一個完整的小模型。
事實:專家通常只是模型某些層裡的子網路,注意力等其他部分仍由所有詞元共用。
誤解:只啟用部分參數,所以記憶體需求也跟著變小。
事實:運算量變少,但所有專家的參數通常仍要載入記憶體,硬體需求不一定比同等總參數的模型低很多。

常見問題

MoE 是最近才出現的技術嗎?

不是。概念在 1990 年代就有,2017 年 Google 研究者把稀疏閘控的 MoE 層用到超大型神經網路上,展示可在運算量增加有限的情況下大幅擴大模型容量。

MoE 模型的「8x7B」是什麼意思?

指每層有 8 個專家、架構以 70 億參數模型為基礎;因為部分參數共用,實際總參數約 470 億,而不是 8 × 70 億。

相關名詞

大型語言模型、Transformer 架構、開放權重模型、擴展定律

參考來源

查核日期:2026-09-28。API:/api/term?id=moe

☕ 覺得有用?打賞支持 ・ AI/API 通行證 ・ 成為贊助 ・ 更多服務 ・ 開站限時:10/31 前通行證時間加倍