
阿里巴巴於週一發布了 Qwen3.8-Max,稱其為公司迄今為止最强大的模型。其模型權重將於下週在 Hugging Face 和 ModelScope 上發布——這是該公司首次發布 Max 規模的模型作為開源權重。
規格龐大: 總計 2.4 兆個參數,任何時刻都有 950 億個參數被啟用。 參數是 模型能夠處理的「撥盤」數量。
這對於效率來說極其重要,因為這意味著運行它不需要太多的資源。可以將其想像成一個巨大的圖書館,每當有問題時,只有相關的書架會亮起來。擁有足夠硬體的SME(中小企業)和實驗室現在能夠運行最先進的模型,而無需像大型資料中心那樣花費巨資。
阿里巴巴的 發布文章 跳過了傳統的基準測試追逐敘述,轉而強調其持久性。該模型花了 16 天自行建構一個編碼工具——完成了 265 次提交、127 個拉取請求、151 個問題,沒有人類觸摸鍵盤。它花了五天時間重現一篇從未見過程式碼的研究論文,然後將論文自身的結果提高了 2.7 分。在一場 24 小時的機器學習競賽中,它超越了 526 支人類團隊中的 458 支。
Qwen3.8-Max 附帶了 Anthropic 的 Claude Code 和 OpenAI 的 Codex(由兩家公司開發的編碼工具)的說明。阿里巴巴的 API 支援 這兩家公司的協定。其大部分編碼基準測試都是在 Claude Code 內部運行的。
然而,這些基準測試並未使其表現出色。在 31 項文本測試中, Anthropic 的 Fable 5 贏得 15 項第一, OpenAI 的 GPT-5.6 Sol 贏得 9 項, 通義(Qwen)贏得 7 項。在 12 項編碼測試中,通義(Qwen) 只贏得 一項。然而,就智慧成本而言,這個模型極其便宜且高效,這意味著即使它需要更多的迭代或推理,完成任務的成本也會大大降低, 約為 Claude Fable 5 收費的 30%。
儘管如此,如果轉向多模態工作——文件、影片、空間推理——排名則會反轉。通義(Qwen)在大多數這些方面領先。
在商業策略上也有所逆轉。四月,阿里巴巴 取消了通義編碼(Qwen Code)的免費層級,在領導層離職後,團隊傾向於封閉、付費的模型。我們對 Qwen 3.7 Max 的 評測 指出,Plus 版本將是開放的,而 Max 版本仍鎖定在 API 背後。
這扇門現在敞開了,而這個時機並非偶然。中國的開放權重模型在 2024 年底佔 OpenRouter 上 token 的比例不到 2%,到 2026 年中已達到約 61%。通義(Qwen)超越了 Meta 的 Llama,成為全球最常被自行託管的模型。
與此同時,華盛頓於六月對 Fable 5 和 Mythos 5 實施了出口管制,據報導,北京也正在 權衡對中國模型出海的限制。
因此,阿里巴巴表面上似乎處於劣勢,但在分發上卻取得了勝利。如果你可以免費下載一個接近頂級的產品,那麼第二名也是一個不錯的位置。