There is no item in your cart
一、GPT-5.6 三款模型同步上線
六月二十六日,OpenAI 正式開啟 GPT-5.6 限量預覽,今次一口氣推出三款分層模型,採用全新命名方式區分效能等級,與 Claude 的 Opus / Sonnet / Haiku 分層概念相近,三款型號日後可各自獨立迭代更新。
以 Anthropic 同檔位 Claude Fable 5(輸入 10 美元、輸出 50 美元)作為比較,Sol 的整體定價僅為對手的一半。
二、三大專業測試全面刷新行業紀錄
1. 代碼測試:Terminal-Bench 2.1
此測試專門考核 AI 智能代理完成命令列全流程工作的能力,涵蓋任務規劃、工具調度、循環調試等完整鏈路,實測成績如下:
- GPT-5.6 Sol Ultra:91.9%(行業第一)
- GPT-5.6 Sol Max:88.8%
- Claude Mythos 5:88.0%
- GPT-5.6 Terra、Claude Fable 5:84.3%
- GPT-5.5:83.4%
2. 生物科研:GeneBench v1
Sol 在處理長片段基因組數據、定量生物學分析方面,相比 GPT-5.5 有大幅提升,同時生成同等結果所消耗的 tokens 更少。OpenAI 特別說明,該模型僅能輔助科研分析,不能直接作為醫療或實驗室權威結論使用,並配套增設了生物場景專屬安全限制。
3. 網絡安全:ExploitBench + ExploitGym
在漏洞挖掘、攻擊鏈路分析等安全任務中,Sol 能夠兼顧效能與 tokens 消耗效率,輸出同等分析內容僅需 Claude Mythos 約五分之一的 tokens。由伯克利聯合打造的 ExploitGym 測試中,Sol、Terra、Luna 三款模型的安全分析能力均有明顯提升。
安全風險分級判定
OpenAI 內部 AI 風險評估體系(Preparedness)將 GPT-5.6 全系列劃分為「High」級,Sol 雖在安全領域能力最強,但未達到最高「Critical」風險等級。在 Chrome、Firefox 相關漏洞測試中,Sol 能夠識別漏洞成因、解析利用原理,但無法獨立生成完整可執行攻擊鏈路。官方同時坦言,現有測試基準無法覆蓋所有組合使用場景,這亦是模型分階段開放、配套多層安全限制的核心原因。
三、Sol 專屬兩種高級推理模式
GPT-5.6 為旗艦 Sol 新增兩套推理檔位,Terra、Luna 不支援:
- Max 模式:延長單任務思考時間,深度拆解複雜邏輯,Terminal-Bench 得分 88.8%;
- Ultra 模式:支援並行調度多個子智能代理協同工作,拆分多環節任務同步處理,最終以 91.9% 的成績奪冠。
這種模式已非簡單的一問一答對話,更像是一站式工作會話:AI 自主讀取完整代碼倉庫、執行命令、調試報錯、並行處理多項子任務並匯總結果。後續 Codex 產品將優先搭載這套能力。
四、政府管控:限量預覽,分階段放開
本次發布最受業界關注的,便是前置政府審核的開放規則。據 Axios、Fortune 等媒體證實,這套限制源於美國總統特朗普於六月二日簽署的第 14409 號《促進先進人工智能創新與安全》行政命令。
文件要求聯邦機構在六十天內搭建前沿 AI 自願評估體系,劃定高風險模型判定標準,企業在發布頂尖模型前,需向政府開放三十天預訪問通道。規定僅為自願框架,並無強制審批許可,但 OpenAI 選擇配合執行。
OpenAI 官方公開態度
- 明確表示這種前置管控不適合長期常態化運行,將限制企業開發者、網絡安全從業人員正常使用頂尖 AI 工具;
- 現階段限量預覽僅屬短期過渡方案,目的是完成政府安全評估,數週後將全面放開;
- Altman 在內部會議透露,已向商務部門明確企業立場,不希望這套審核流程長期延續。
當前開放範圍
預覽階段僅開放 API 與 Codex 接口,僅約二十家通過政府核驗的機構可申請使用。Altman 已於六月二十五日與商務部長 Lutnick 會面,完成全部前置審核流程。此時間點相當微妙:競爭對手 Anthropic 的 Mythos 5、Fable 5 早在六月十二日便因出口管制而下線,OpenAI 正好在對手停服窗口期,以合規路徑推出主打安全與編碼能力的 Sol。
五、GPT-5.6 配套史上最強安全防護體系
OpenAI 表示本次全系搭載目前最完善之分層安全護欄,三款模型按能力強弱匹配對應防護策略,核心設計思路為:優先協助安全人員查找、修補漏洞,而非降低攻擊製作門檻。
四層疊加防護機制
- 模型原生層:訓練階段已限制網絡攻擊、生化危害相關請求,攔截各類越獄、偽裝誘導指令;
- 實時動態檢測:生成內容時同步評估風險,涉及網絡、生化高危需求會暫停輸出,交由更強推理模型二次覆核;
- 帳戶行為監測:跨多輪對話追蹤用戶風險行為,區分安全研究合法需求與持續惡意濫用;
- 分級權限管控:根據客戶行業、使用場景調整功能開放範圍,高危能力默認關閉。
大規模自動化紅隊測試
OpenAI 投入超過七十萬 A100 等效 GPU 小時開展自動化安全測試,專門挖掘通用越獄手段(即能跨多輪對話、多種輸入繞過限制的攻擊方式),同時搭配外部安全專家進行人工紅藍對抗。只要發現新繞過漏洞,便會快速重現、修復並納入常態化檢測庫。
六、定價、緩存與推理速度優化
配套功能更新
- 提示詞緩存升級:支援自訂緩存節點,緩存最短留存三十分鐘;寫入緩存按原單價 1.25 倍收費,讀取緩存可享九折優惠;
- 硬件加速落地:七月 Sol 將接入 Cerebras 專用推理硬件,最高可達每秒 750 tokens,初期僅對受邀客戶開放,大幅縮短複雜任務等待時間。
七、使用時間線:當前預覽 vs 全面開放
現階段(限量預覽)
僅約二十餘家政府審核通過之合作機構,可通過 API、Codex 調用三款模型;普通 ChatGPT 用戶及中小開發者暫時無法體驗 Sol / Terra / Luna。
數週後(計劃全量開放)
面向所有 ChatGPT、Codex、API 使用者放開權限,同步完整發布全套行業基準測試報告。在醫療專項 HealthBench 測試中,Sol 得分相比 GPT-5.5 提升 8.7 至 60.5 分,醫療輔助分析亦為產品重點發力方向。
不同人群使用建議
- 開發團隊:重點關注 Codex 接入與 AI 智能代理自動化工作流;
- 成本敏感企業:Terra 效能對標舊版 GPT-5.5,價格直接減半,日常業務可優先選用;
- 高併發輕量化場景:Luna 性價比最高,七月 Cerebras 加速版 Sol 則適合重度複雜任務。
八、客觀行業理性分析
測試分數不能完全等同於真實業務能力:Sol Ultra 在編碼測試中僅領先 Mythos 不到 4 個百分點,且高分依賴多子智能代理並行模式,實際生產環境的穩定性、延遲、使用成本仍需大量真實項目驗證。
政府前置審核開創行業先例,長期規則有待觀察:OpenAI 雖配合短期管控,但明確不認可該模式常態化。七月二日為行政命令三十天評估節點,八月初六十天行業框架落地後,全球前沿 AI 的發布規則或將迎來重大變化。
雙重用途工具的防護平衡是最大難點:漏洞挖掘這類功能既能用於防護系統,亦可被用於製作攻擊,二者需求高度相似,預覽期容易出現正常研究被誤攔截;同時一旦權限管控出現漏洞,會直接降低網絡攻擊製作門檻,分層護欄是整套產品的核心關鍵。
本次發布的行業核心意義
GPT-5.6 Sol 不只是單純提升各項測試分數,更是 OpenAI 對下一代 AI 智能代理工作模式的完整落地方案:三層分層產品、雙檔位深度推理、多子智能代理協同、全鏈路安全防護、政府合規分階段發布。
Sol 暫時在代碼、網絡安全智能代理領域拿下效能優勢;但真正的考驗在於數週後能否如期全面放開,以及安全護欄能否做到不阻礙防禦研究、同時遏制惡意濫用。
📖 參考資料:OpenAI 官方公告、GPT-5.6 系統安全白皮書、Axios、Fortune、VentureBeat 行業報道
