阿里千問 Qwen3.8-Max 上線,2.4 兆參數宣稱性能媲美 Anthropic
2026/08/03
阿里巴巴旗艦語言模型通義千問 Qwen3.8-Max 正式上線,具備 2.4 兆參數的規模,官方宣稱其性能足以媲美 Anthropic 的模型。這款模型的發布,延續了中國業者近年在大型模型參數規模與能力宣稱上的持續推進。
參數規模在模型評估中的意義需要謹慎解讀。2.4 兆參數屬於當前公開模型的頂端量級,但現代大型模型多採用混合專家(MoE)架構——總參數量龐大,實際每次推論只啟用其中一部分。這種設計讓模型在維持巨大知識容量的同時,把推論成本控制在可商用的範圍。因此總參數量與實際運算成本、以及與效能表現之間,並非線性關係。
「媲美 Anthropic」這類對標宣稱同樣需要脈絡。模型能力在不同任務類型上的表現差異相當大:程式碼生成、長文脈理解、多輪推理、工具呼叫與多語言處理,各自對應不同的訓練重點。單一基準測試的分數難以概括整體能力,而業界普遍認為,真正的差距往往顯現在複雜代理任務與長時間工作流的穩定性上,而非單次問答的品質。
從市場格局看,這款模型的發布時機值得注意。中國業者近期在亞洲市場憑藉開放權重與低價策略快速擴大採用,而美國方面則出現以扶植本土開源生態對抗的討論。當旗艦閉源模型也宣稱達到國際頂尖水準時,競爭的維度就從「價格與可取得性」擴展到「能力本身」——這對整體格局的影響更為根本。
對企業使用者而言,實際的評估重點仍在落地表現。模型能力之外,API 穩定性、資料處理條款、跨境合規要求與長期供應保證,都是選型時無法迴避的維度。特別是在資料主權要求較嚴格的產業,模型的部署方式往往比效能排名更具決定性。
後續值得觀察的,包括獨立第三方的基準測試結果、實際商用案例的表現,以及定價策略如何影響其在國際市場的採用速度。