PLAY AI 筆記回 PLAY AI
AI 知識科普發布 · 8 分鐘 · 約 3,496 字

GPT-5 到 GPT-6:架構演進與能力分層解析

GPT-5 於 2025 年 8 月發布,採用統一架構整合標準 GPT 與 o 系列推理,支援自適應思考模式與原生多模態(文字/影像/音訊/影片),提供 Base/Mini/Nano 三種規模。GPT-5.6 於 2026 年 7 月推出 Sol/Terra/Luna 三階層及 ultra multi-agent 模式,在程式碼、電腦操作與網路安全基準上領先。GPT-6 Astra 於 2026 年 9 月達到 Critical 資安門檻,上下文 105 萬 tokens,價格為 Sol 的 2.5 倍。本文整理公開資訊,比較版本差異與競品定位。

PLAY
PLAY AI 編輯部把複雜概念拆成一般人也讀得懂的版本,聚焦名詞解釋、比較、來源與實作脈絡。
本篇內容
GPT-5 到 GPT-6:架構演進與能力分層解析
GPT-5 到 GPT-6:架構演進與能力分層解析

GPT-5:統一架構與多模態基礎

GPT-5 於 2025 年 8 月正式發布,採用統一系統架構將標準 GPT 系列能力與 o 系列推理整合至單一平台,可依查詢自動導向適當處理模式。此設計引入自適應思考模式,能依照任務複雜度動態調整推理深度,無需手動切換。模型支援文字、影像、音訊與影片的原生多模態輸入,實現端到端的跨模態理解與生成。[1]

GPT-5 提供三個版本:旗艦版 GPT-5、均衡效率的 GPT-5 Mini 及超高效率的 GPT-5 Nano,透過架構最佳化使回應時間比 GPT-4 快 25-30%。訓練資料截止至 2025 年 1 月,模型可透過 ChatGPT、Microsoft Copilot 及 OpenAI API 使用。此階段標誌著 OpenAI 將推理能力深度內嵌於基礎模型,而非依賴外掛或切換。[1]

GPT-5.6:耐用階層與多代理模式

GPT-5.6 於 2026 年 7 月 9 日發布為通用可用模型家族,包含三個耐用階層:Sol(旗艦)、Terra(均衡)與 Luna(最快、最便宜),並引入全新的 'ultra' multi-agent 模式,預設協調 4 個代理平行運行,部署評估中可擴充至 16 個。模型 ID 分別為 gpt-5.6-sol、gpt-5.6-terra 和 gpt-5.6-luna。OpenAI 表示這些階層名稱將持續用於未來編號世代(如 GPT-5.7 仍將以 Sol/Terra/Luna 發布),確保 API 穩定性與遷移簡潔性。[4]

在基準測試中,GPT-5.6 Sol 在 Artificial Analysis Coding Agent Index v1.1 上達 80 分,為目前最高發布分數;在 SWE-Bench Pro 上得分 64.6%,顯著優於 GPT-5.5 的 59.4%。在終端基準(Terminal-Bench 2.1)於最大推理努力下達 91.9%,而在 OSWorld 2.0 電腦操作任務中達 62.6%,超越 Claude Opus 4.8 同時僅使用其 15% 的輸出 tokens。在網路安全領域,Sol 在 Capture-the-Flag 評分中達 96.7%,SEC-Bench Pro 為 71.2%,皆大幅領先於前代。[4]

GPT-5.6 Sol 在專業知識與推理任務中表現強勢:在 GPQA Diamond 上得分 94.6%,在 Agents' Last Exam 中達 52.7%,在 ARC-AGI-3 抽象推理基準上達 7.78%,皆顯著優於 GPT-5.5。然而,在長任務知識基準上稍遜一籌:Claude Fable 5 在 GDPval-AA v2 上以 1,759.6 Elo 領先 Sol 的 1,747.8,在 HealthBench Professional 上以 60.9% 領先 Sol 的 60.5%;Claude Mythos 5 則在長圖遍歷(GraphWalks)上於 256K 與 1M tokens 長度下皆領先 Sol。這顯示 Sol 在編碼、代理與安全方面領先,但在極長上下文與特定知識深度上仍有提升空間。[4]

Luna 階層在長文理解上顯著弱於 Sol 與 Terra:在 MRCR v2 8-needle 256K-512K 測試中僅得 41.3%,遠低於 Terra 的 89.6% 與 Sol 的 91.5%,顯示其為成本敏感型設計,不適合大型文件或長上下文工作負載。此階層分化反映了 OpenAI 在效能與成本之間的明確階梯策略,讓開發者可依任務選擇適當的模型規模。[4]

安全與風險分類

根據 OpenAI Preparedness Framework,GPT-5.6 全系列(Sol、Terra、Luna)在網路安全與生物/化學風險領域均被評為 High 能力,但均未達到 Critical 門檻。此分類表示模型可能放大既有重大風險,但尚未具備造成前所未有嚴重危害的能力。OpenAI 已對該模型進行 70 萬+ 小時的自動紅隊演練,涵蓋駭客入侵、生物風險與提示注入等場景,以驗證其安全邊界。[4]

GPT-6 Astra:達到 Critical 資安門檻的端到端工作模型

GPT-6 Astra 於 2026 年 9 月 3 日正式發布,是 OpenAI 首款達到 Critical 資安門檻且廣泛部署的模型。其 API 模型代號為 gpt-6-astra,知識截止日為 2026 年 4 月 30 日。模型支援文字與圖片輸入、文字輸出,但不支援音訊或影片輸入,亦不開放 fine-tuning。上下文視窗為 1,050,000 tokens,單次最多可輸出 128,000 tokens,與 GPT-5.6 Sol 的上限相同。[5]

在定價上,GPT-6 Astra 的費用顯著升高:輸入 $10/M tokens、快取輸入 $1/M tokens、快取寫入 $12.5/M tokens、輸出 $50/M tokens。當輸入超過 272,000 tokens 時,輸入與快取費率變為 2 倍,輸出費率變為 1.5 倍。Batch 與 Flex 模式為標準費率的 50%,Fast mode 為適用費率的 2 倍。經計算,其輸入與輸出單價皆為 GPT-5.6 Sol 的 2.5 倍(Sol:輸入 $4/M、輸出 $20/M),定位為高難度研究、複雜編碼與跨工具自動化任務。[5]

GPT-6 Astra 引入三項核心代理能力:async tool calling 讓模型在工具執行期間仍可推理或呼叫其他工具;mid-turn steering 允許使用者在工作途中追加指令,系統保留已完成進度並接續同一流程;透過 configuration_update 動態調整 reasoning effort,支援 low、medium、high、xhigh 與 max 五個等級(不支援 none),且於同一段對話中保留 Prompt cache。模型延續 computer use、網頁搜尋、檔案搜尋、程式執行、MCP 與 Structured Outputs 等功能,強化其作為端到端工作模型的定位。[5]

版本比較與競品定位

相較於 GPT-4,GPT-5 透過統一架構將推理能力內嵌,回應速度提升 25-30%,訓練資料更新至 2025 年 1 月,並顯著擴充上下文窗口(最高 400k tokens),使其能處理超過 600 頁單次輸入。在編碼(SWE-Bench Verified)與數學推理(AIME 2025)上,GPT-5-thinking 分別達 74.9% 及 94.6%,皆優於 GPT-4。此版本標誌著從模組化切換向原生推理整合的轉變。[1]

與主要競品相比,Claude 4 強調 200K tokens 上下文與憲法式 AI 安全性,Google Gemini 提供 1M tokens 上下文與 Workspace 整合,但對話能力被評為落後於 GPT-5 與 Claude;LLaMA 為開放原始碼模型,適合自行託管與客製化,但缺乏完善多模態功能。GPT-5 在程式設計、數學與科學任務上展現頂尖效能,並透過進階訓練與對齊技術減少幻覺,同時具備擴充上下文視窗以處理完整文件或程式碼庫。[1]

GPT 模型版本演進
從 GPT-5 到 GPT-6 Astra 的關鍵發布與能力節點

資料來源與延伸閱讀

以下來源用於核對本文的技術背景與關鍵事實;正文中的編號可直接跳到對應來源。產品規格與時效性資訊仍以原始官方頁面最新版本為準。

查看 9 個來源
  1. GPT-5 於 2025 年 8 月發布:功能、定價與 API 整合
  2. [閒聊] Kimi K3正式發布 已經有GPT同等能力了 - 看板 AI_Art - 批踢踢實業坊
  3. 不到兩個月 OpenAI發布最新AI模型GPT-5.5 強化程式與研究能力
  4. GPT-5.6 Deep Dive: Sol, Terra, Luna & System Card (2026)
  5. GPT-6 Astra 正式發布:價格、功能與市場影響
  6. Qwen3.8-Max 是什麼?正式 API、Preview 與權重狀態
  7. GPT-5: A Technical Analysis of Its Evolution & Features | Cirra
  8. Introducing deep research - OpenAI
  9. Qwen3.7-Max是什麼?1M Context、Agent能力、API與驗證方法