OpenAI 預覽 Ultrafast 模式,GPT-5.6 Sol 速度最高快 14 倍

OpenAI 預覽 Ultrafast 模式,GPT-5.6 Sol 速度最高快 14 倍

2026/08/17

OpenAI 預覽新的 API 服務層級 Ultrafast,採用 Cerebras 的運算基礎架構,最高可以每秒 750 token 輸出,執行 GPT-5.6 Sol 可比標準模式快最高 14 倍,鎖定高時效應用與工作流任務。

OpenAI 預覽一項新的 API 服務層級 Ultrafast,號稱執行 GPT-5.6 Sol 模型時可比標準模式快最高 14 倍。這項服務採用 Cerebras 提供的運算基礎架構,最高可以每秒 750 token 的速度輸出生成結果。

14 倍的速度提升,本質上改變了模型可以應用的場景類別。在標準推論速度下,前沿模型的輸出速度大約與人類閱讀速度相當,這對聊天式互動是可接受的;但對於需要即時反應的系統——運算基礎架構的事件回應、金融交易的決策輔助、客服中心的即時支援——數秒的延遲就足以讓應用失去價值。當速度提升一個數量級,這些場景才真正可行。

更關鍵的影響在代理式工作流上。AI 代理執行任務時,需要經過多輪的「思考—執行工具—檢視結果—再思考」迴圈,每一輪都要等待模型輸出。當單輪延遲從數十秒壓縮到數秒,整個任務的完成時間會呈倍數改善。這也解釋了為何 OpenAI 把工作流任務列為主要應用場景之一。

技術上的關鍵在於 Cerebras 的架構選擇。傳統 GPU 推論的瓶頸不在運算能力,而在記憶體頻寬——每產生一個 token,都必須把模型權重從高頻寬記憶體讀入運算單元,這個搬運過程決定了速度上限。Cerebras 採用晶圓級整合的設計,把大量記憶體直接放在同一片晶圓上與運算單元相鄰,大幅縮短資料移動距離,因而在單一請求的延遲上具備結構性優勢。

這也反映了 AI 推論硬體的分化趨勢。過去市場的關注焦點是訓練——追求極致的浮點吞吐量與跨節點通訊頻寬;而推論階段的需求更為多元:批次處理追求吞吐量與成本效率,即時應用追求最低延遲,兩者的最佳硬體架構並不相同。專用架構在特定指標上超越通用 GPU 的空間,正是新進晶片業者的機會所在。

對開發者與企業使用者而言,這項服務帶來的是新的取捨維度。可以預期 Ultrafast 的單位成本會高於標準層級,因此選擇的依據不再只是「模型能力夠不夠」,而是「這個應用場景的延遲敏感度值不值得支付溢價」。這使得應用架構的設計需要更細緻的分層——關鍵路徑走快速通道,非即時任務走標準層級。

從產業競爭看,這也顯示模型業者正在把差異化從模型本身延伸到交付方式。當前沿模型之間的能力差距收斂,速度、成本結構與部署彈性便成為新的競爭維度。

後續觀察重點包括:Ultrafast 的正式定價與可用區域、實際延遲表現的第三方驗證,以及其他模型業者是否推出對應的服務層級。