混合專家模型(Mixture of Experts (MoE))是什麼?
混合專家模型(MoE)是在神經網路中放入多個專家子網路,由路由器為每個詞元挑選少數專家處理的架構。以 Mistral AI 2024 年發表的 Mixtral 8x7B 為例,每層有 8 個專家、每個詞元只用 2 個,總參數 470 億,但推論時每個詞元只啟用 130 億參數。
模型技術MoEMixture of Experts專家混合稀疏模型SMoE
一句話說明
把模型拆成許多「專家」子網路,每次只啟用其中幾個來處理輸入,讓大模型用較少運算就能運作。
混合專家模型怎麼運作?
- 把模型中的前饋網路層複製成多個「專家」。
- 加入一個路由器(gating network),根據輸入決定要交給哪幾個專家。
- 只有被選中的專家參與計算,其他專家這次不運算。
- 把被選中專家的輸出加權合併,繼續傳到下一層。
實際例子
- 開放權重模型 Mixtral 8x7B 使用 8 選 2 的專家架構。
- 大型模型用 MoE 在總參數很大的情況下控制推論成本。
- 不同專家可能各自擅長處理不同類型的內容。
常見誤解
誤解:MoE 的每個專家都是一個完整的小模型。
事實:專家通常只是模型某些層裡的子網路,注意力等其他部分仍由所有詞元共用。
事實:專家通常只是模型某些層裡的子網路,注意力等其他部分仍由所有詞元共用。
誤解:只啟用部分參數,所以記憶體需求也跟著變小。
事實:運算量變少,但所有專家的參數通常仍要載入記憶體,硬體需求不一定比同等總參數的模型低很多。
事實:運算量變少,但所有專家的參數通常仍要載入記憶體,硬體需求不一定比同等總參數的模型低很多。
常見問題
MoE 是最近才出現的技術嗎?
不是。概念在 1990 年代就有,2017 年 Google 研究者把稀疏閘控的 MoE 層用到超大型神經網路上,展示可在運算量增加有限的情況下大幅擴大模型容量。
MoE 模型的「8x7B」是什麼意思?
指每層有 8 個專家、架構以 70 億參數模型為基礎;因為部分參數共用,實際總參數約 470 億,而不是 8 × 70 億。
相關名詞
大型語言模型、Transformer 架構、開放權重模型、擴展定律
參考來源
- Jiang et al., Mixtral of Experts(arXiv 2401.04088)
- Shazeer et al., Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer(arXiv 1701.06538)
查核日期:2026-09-28。API:/api/term?id=moe