PLAY AI 筆記回 PLAY AI
AI 知識科普發布 · 5 分鐘 · 約 2,165 字

Llama 4 深度解析:從 MoE 架構到原生多模態,Meta 如何重塑開源模型天花板?

Meta 推出 Llama 4 系列,透過 MoE 架構與原生多模態技術,讓開源模型在推理、視覺與長文本能力上全面挑戰 GPT-4 與 Gemini 2.0。

PLAY
PLAY AI 編輯部把複雜概念拆成一般人也讀得懂的版本,聚焦名詞解釋、比較、來源與實作脈絡。
本篇內容
Llama 4 深度解析:從 MoE 架構到原生多模態,Meta 如何重塑開源模型天花板?
Llama 4 深度解析:從 MoE 架構到原生多模態,Meta 如何重塑開源模型天花板?
  • Llama 4 系列於 2025 年 4 月正式發布,標誌著 Meta 從純文字模型轉向原生多模態時代的重大轉折。
  • 採用混合專家 (MoE) 架構,大幅提升計算效率。
  • 原生支援文字、圖像、影像與聲音輸入。

從 Llama 2 的密集架構到 Llama 4 的 MoE 架構,Meta 正在重新定義開源模型的性能邊界。

Llama 4 系列的核心變化在於全面導入混合專家(MoE)架構。與以往 Llama 3 使用的傳統密集(Dense)Transformer 架構不同,Llama 4 透過將部分 FFN 層替換為多個較小的專家模組,並搭配路由機制(Router),讓模型在推理時僅需激活部分參數,從而實現更高的計算效率。[1][2][7]

此外,Llama 4 實現了「原生多模態」的跨越。不同於許多競品採用將視覺編碼器「外掛」到語言模型上的做法,Llama 4 採用早期融合(Early Fusion)技術,讓視覺 Token 與文字 Token 在同一個 Transformer 主幹網路中進行聯合處理,這使得模型在理解圖像與影像時更具深度。[1][3][7]

在數據規模上,Llama 4 的訓練規模也顯著擴張,其使用的多語言 Token 數量比 Llama 3 多出了 10 倍。[3]

三大模型定位:從高效能 Scout 到超級教師 Behemoth

Llama 4 並非單一模型,而是根據不同的應用場景與計算資源需求,拆解為三個層次的系列:[1][3]

Llama 4 Scout:主打效率與極長上下文。它擁有 109 億總參數,但透過 MoE 架構僅需激活 17 億參數。最令人驚豔的是它支援高達 1,000 萬 token 的上下文窗口,非常適合處理超長文檔或大規模程式碼分析。對於開發者而言,經過 int4 量化後的 Scout 甚至可以在單張 NVIDIA H100 GPU 上順暢運行。[1][3]

Llama 4 Maverick:強化視覺與推理的強大主力。雖然活躍參數同樣為 17 億,但其總參數規模達 4,000 億,包含 128 個專家模組。Maverick 的設計重點在於視覺基礎能力,能精確對齊文本提示與圖像區域。在多項基準測試中,它的表現甚至超越了 GPT-4 與 Gemini 2.0,其推理與編程能力可與 DeepSeek-v3 媲美,且推理成本極具競爭力。[1][3][7]

Llama 4 Behemoth(預覽版):定位為「模型中的教師」。這是一個規模接近 2 兆參數的超級模型,目前仍處於訓練階段。Meta 利用 Behemoth 進行共蒸餾(Co-distillation)技術,將其深厚的知識轉化為 Scout 與 Maverick 等較小模型的效能。[1][3][7]

性能對比:挑戰閉源模型的領先地位

Llama 4 Maverick 在多模態與推理任務上展現了極強的競爭力。在 MMMU 基準測試中,Maverick 的分數(73.4)優於 GPT-4o(69.1)與 Gemini 2.0 Flash(71.7)。在程式設計能力方面,其 LiveCodeBench 分數(43.4)也大幅領先於 GPT-4o(32.3)與 Gemini 2.0 Flash(34.5)。[1][7]

值得注意的是,Maverick 在達到與 DeepSeek-v3 同等級別的推理與編程能力時,所使用的活躍參數遠低於對手,這證明了 MoE 架構在效能與成本平衡上的優勢。[7]

在 LMArena 對話評測中,Maverick 的 Elo 分數達到 1417,位居全球第二。[1]

部署與使用限制

在硬體需求方面,Scout 適合邊緣或單卡環境,而 Maverick 則需要多卡 H100 系統(如 NVIDIA H100 DGX)才能支撐其龐大的總參數規模。[1]

授權方面,Llama 4 採用 Llama 4 Community License,雖然允許商業使用,但對於特定規模的企業仍設有使用限制。[1]

此外,目前存在地域與語言的限制:多模態功能目前僅限於美國英語用戶使用,且該系列模型禁止在歐盟境內的使用者或公司使用或再發布。[3]

雖然 Scout 提供了驚人的 1,000 萬 token 上下文,但讀者需區分「大海撈針」(檢索能力)與「長文本分析」(跨片段推理能力)的差異。擁有超長窗口並不代表模型能完美整合並理解數百萬字之間的複雜邏輯關係,這是所有長文本模型共同面臨的技術邊界。[7]

資料來源與延伸閱讀

以下來源用於核對本文的技術背景與關鍵事實;正文中的編號可直接跳到對應來源。產品規格與時效性資訊仍以原始官方頁面最新版本為準。

查看 9 個來源
  1. 一文解读最新大模型Llama 4,非常详细看我这一篇就够了!
  2. 陈巍:Llama 4最新架构的深入分析(与deepseek正面对决)
  3. Meta 釋出 Llama 4,史上最大 AI 模型功能、架構、生態一次看 - iKala
  4. LLAMA 2 Paper and Model Deep Dive — The GenAI Guidebook
  5. Llama 3.2 — A Deep Dive
  6. Introducing Llama 3.1: Our most capable models to date
  7. Llama 4 Deep Dive: Why Meta’s Latest Models Change Everything [Breakdowns]
  8. meta-llama (Meta Llama)
  9. Llama (language model) - Wikipedia