中美 AI 技術競賽|阿里巴巴推出 Qwen 3.8-Max 旗艦模型:2.4萬億參數硬撼美國 AI 霸主

阿里巴巴(Alibaba)正式推出規模最大嘅 AI 旗艦模型 Qwen 3.8-Max,總參數高達2.4萬億。新模型採用稀疏混合專家(Sparse MoE)架構,大幅降低計算成本,並原生支援視覺智能及百萬 Token 上下文。測試顯示其效能足以挑戰 Anthropic 及 OpenAI 等美國頂尖對手,適合應用於長週期自主編程、數據分析及 3D 建模等複雜工作場景。

中美 AI 技術競賽|阿里巴巴推出 Qwen 3.8-Max 旗艦模型:2.4萬億參數硬撼美國 AI 霸主
中美 AI 技術競賽|阿里巴巴推出 Qwen 3.8-Max 旗艦模型:2.4萬億參數硬撼美國 AI 霸主

阿里最新開源 AI 模型 Qwen 3.8-Max 登場,與 GPT-5.6 及 Claude Fable 5 規格比較

喺全球人工智能技術競爭越演越烈嘅背景下,中國科技巨頭阿里巴巴(Alibaba)(股票代號:9988.HK / BABA)喺8月3日正式宣佈推出旗下千問(Qwen)系列到目前為止規模最大、能力最強嘅旗艦模型——Qwen 3.8-Max。呢次發佈唔單止標誌住中國本土 AI 技術嘅一次重大突破,亦為美國矽谷及華盛頓帶來新一輪嘅技術壓力。

根據阿里巴巴嘅官方公佈,Qwen 3.8-Max 嘅效能已經可以同美國頂尖前沿實驗室 Anthropic(Anthropic)以及 OpenAI(OpenAI)嘅旗艦系統平起平坐,同時亦正面迎戰國內競爭對手月之暗面(Moonshot AI)最近推出嘅 Kimi K3 模型。目前,全球開發者已經可以透過阿里雲國際百煉平台(Alibaba Cloud Model Studio)嘅 API 嚟調用呢個模型,而模型嘅開源權重預計會喺下星期公開,讓更多企業同開發者可以自行部署。

根據阿里巴巴嘅官方公佈,Qwen 3.8-Max 嘅效能已經可以同美國頂尖前沿實驗室 Anthropic(Anthropic)以及 OpenAI(OpenAI)嘅旗艦系統平起平坐,同時亦正面迎戰國內競爭對手月之暗面(Moonshot AI)最近推出嘅 Kimi K3 模型。
根據阿里巴巴嘅官方公佈,Qwen 3.8-Max 嘅效能已經可以同美國頂尖前沿實驗室 Anthropic(Anthropic)以及 OpenAI(OpenAI)嘅旗艦系統平起平坐,同時亦正面迎戰國內競爭對手月之暗面(Moonshot AI)最近推出嘅 Kimi K3 模型。

Qwen 3.8-Max 核心技術與規格解析:兼顧規模與效率

喺人工智能領域,模型嘅參數數量往往被視為衡量其能力嘅一個重要指標。Qwen 3.8-Max 嘅總參數數量達到驚人嘅 2.4 萬億(2.4 Trillion,簡稱 2.4T)。參數可以理解為 AI 模型喺訓練過程中所學習到嘅設定值,用嚟處理數據、識別模式以及執行各種類型嘅任務。

不過,單純追求龐大嘅參數數量會導致極高嘅運算成本同延遲。為咗解決呢個痛點,Qwen 3.8-Max 基於上一代 Qwen 3.5 嘅基礎,採用咗目前最前沿嘅稀疏混合專家(Sparse Mixture of Experts, Sparse MoE)架構,並結合咗混合注意力機制。

呢種設計嘅巧妙之處在於,雖然模型底層擁有 2.4 萬億個參數,但係喺實際進行推理(即係解答用戶問題或執行指令)嘅時候,系統只會因應任務需求,啟動大約 950 億(95B)嘅參數。呢個做法就好似一間擁有各科專科醫生嘅大型醫院,當病人求診時,只需要相關專科嘅醫生提供意見,而唔需要全院醫生一齊出動。咁樣唔單止能夠喺處理複雜任務時維持頂級嘅智能表現,仲可以大幅降低計算資源嘅消耗同反應時間,令企業喺實際應用時嘅成本大大減少。

此外,模型支援高達 100 萬 Token 嘅上下文窗口(Context Window)。對一般用家嚟講,100 萬 Token 大約等同於幾本厚厚嘅長篇小說,或者係一個極度龐大嘅程式碼庫。意味著用戶可以一次過將海量嘅文件、數據庫交畀 AI 分析,而 AI 能夠喺成個對話過程中保持連貫嘅記憶,唔會出現「失憶」嘅情況。

效能評測與排行榜表現:硬撼 Claude Fable 5

為咗客觀評估 Qwen 3.8-Max 嘅實力,我哋可以參考大型語言模型界別中最具權威性嘅第三方盲測平台 Arena.AI 嘅排行榜數據。喺呢個平台上面,模型嘅表現係由全球用戶透過盲測投票產生,具備高度嘅參考價值。

根據最新嘅排行榜數據,Qwen 3.8-Max 展現出非常亮眼嘅成績:

  • 純文字處理(Text Arena): 排名第 5(約 1,496 分)。目前排喺佢前面嘅,只有 Anthropic 嘅超級旗艦模型 Claude Fable 5 以及三款 Claude Opus 系列模型。
  • 視覺能力(Vision Arena): 排名第 2(約 1,305 分)。喺呢個領域,Qwen 3.8-Max 緊隨 Claude Fable 5 之後,顯示出其強大嘅圖像理解同分析能力。
  • 前端編程(Frontend Code Arena): 排名第 4(1,668 分)。僅次於兩款 Claude Opus 模型以及主打編程能力嘅國產對手 Kimi K3。
純文字處理(Text Arena): 排名第 5(約 1,496 分)。目前排喺佢前面嘅,只有 Anthropic 嘅超級旗艦模型 Claude Fable 5 以及三款 Claude Opus 系列模型。
純文字處理(Text Arena): 排名第 5(約 1,496 分)。目前排喺佢前面嘅,只有 Anthropic 嘅超級旗艦模型 Claude Fable 5 以及三款 Claude Opus 系列模型。
視覺能力(Vision Arena): 排名第 2(約 1,305 分)。喺呢個領域,Qwen 3.8-Max 緊隨 Claude Fable 5 之後,顯示出其強大嘅圖像理解同分析能力。
視覺能力(Vision Arena): 排名第 2(約 1,305 分)。喺呢個領域,Qwen 3.8-Max 緊隨 Claude Fable 5 之後,顯示出其強大嘅圖像理解同分析能力。
前端編程(Frontend Code Arena): 排名第 4(1,668 分)。僅次於兩款 Claude Opus 模型以及主打編程能力嘅國產對手 Kimi K3。
前端編程(Frontend Code Arena): 排名第 4(1,668 分)。僅次於兩款 Claude Opus 模型以及主打編程能力嘅國產對手 Kimi K3。

由客觀數據可見,Qwen 3.8-Max 已經穩佔全球第一梯隊嘅位置,部分能力更加超越咗市場上大量主流付費模型。

由自主編程到長週期任務

對企業同專業人士嚟講,AI 最重要嘅價值在於能否解決實際工作問題。Qwen 3.8-Max 喺設計上特別強調「自主編程」同埋「長週期執行能力」,即係可以喺極少人類干預嘅情況下,獨立完成複雜且耗時嘅任務。

16日全自動軟件工程測試

喺阿里巴巴內部嘅一項極限測試中,Qwen 3.8-Max 被指派要從零開始建立一個名為「oh-my-cli」嘅自進化智能體框架。喺長達 16 日嘅開發週期入面,模型展現出驚人嘅工程閉環能力。佢唔單止識得自己寫 Code,仲識得整合模擬用戶嘅反饋、參考開發者社區嘅最佳實踐守則,甚至自己進行測試、預覽同埋分析系統日誌。最終,模型成功完成咗成個軟件工程項目,而呢個框架目前亦已經喺代碼託管平台 GitHub(GitHub)上面完全開源。

0:00
/0:59

喺阿里巴巴內部嘅一項極限測試中,Qwen 3.8-Max 被指派要從零開始建立一個名為「oh-my-cli」嘅自進化智能體框架。喺長達 16 日嘅開發週期入面,模型展現出驚人嘅工程閉環能力。

跨專業領域應用

除咗寫 Program 之外,模型喺其他高度專業嘅領域亦有突破性表現:

  • 科學研究: 模型能夠閱讀並理解已發表嘅學術論文,復現當中嘅實驗步驟,甚至設計出比原論文更加優秀嘅新研究方法。
  • 商業與數據分析: 專為真實工作情境設計,能夠處理法律文件審查、體育數據深度分析、金融市場研究,甚至係餐飲概念開發。
  • 自然語言處理挑戰: 喺即將舉行嘅 WWW2025 多模態對話意圖識別挑戰賽中,Qwen 3.8-Max 嘅表現甚至超越咗人類參賽者,證明佢喺理解複雜客戶服務對話同用戶隱藏需求方面,具備極高嘅準確度。

強大嘅視覺與多模態處理能力

作為一個「多模態基座模型」(Multimodal Foundation Model),Qwen 3.8-Max 唔再局限於處理文字,佢原生支援強大嘅視覺智能,可以將靜態嘅圖片或者文件,轉化為動態而且可以互動嘅知識結構。

處理海量多媒體資訊

現代人要處理嘅資訊往往包含大量影片同圖像。Qwen 3.8-Max 能夠無縫處理超過一百頁嘅複雜 PDF 文件、分析成套長篇電視劇集,甚至係長達 100 小時嘅網上直播內容。系統可以將呢啲龐大嘅非結構化數據,轉化為一個可以畀用戶隨時搜尋同互動嘅知識庫。

視覺反饋與持續創作

模型擅長根據即時嘅視覺反饋進行創作同執行任務,具體應用場景包括:

  • 影片製作: 將用戶提供嘅原始個人影片素材,自動剪輯成專業級別嘅 Vlog。
  • 教育內容: 根據簡單嘅文字提示,生成具備沉浸感嘅教育動畫。
  • 前端開發: 開發者只需上載一張用戶介面(UI)嘅截圖,模型就可以從零開始重建出完整嘅前端網頁項目。
  • 3D 建模: 將普通嘅 2D 建築平面圖,精準轉換為包含細節嘅 3D 室內效果圖。
  • 遊戲開發: 用戶只需用自然語言講出需求,模型就能夠直接編寫並打造出一款可以互動嘅小遊戲。

為咗驗證呢種混合型智能體(Agent)嘅能力,研發團隊特別推出咗一個名為 RecreationBench 嘅基準測試。喺完全黑箱作業(即係無得連線上網、無法查看原始程式碼)嘅極端情況下,Qwen 3.8-Max 單靠與實際應用程式嘅互動同埋畫面截圖反饋,就能夠自主從零開始重構一個應用程式。呢項技術對於未來自動化軟件測試同逆向工程領域,有著深遠嘅影響。

0:00
/1:30

Qwen 3.8-Max 能夠無縫處理超過一百頁嘅複雜 PDF 文件、分析成套長篇電視劇集,甚至係長達 100 小時嘅網上直播內容。系統可以將呢啲龐大嘅非結構化數據,轉化為一個可以畀用戶隨時搜尋同互動嘅知識庫。

各大旗艦 AI 模型規格比較整合

為咗令讀者更清晰了解目前頂級 AI 模型嘅市場格局,我哋整理咗以下嘅對比資料。近期市場競爭非常激烈,OpenAI 喺今年7月初開始廣泛推出 GPT-5.6 系列(包括 Sol、Terra 同 Luna 版本),Anthropic 喺 7月24日 推出咗 Claude Opus 5,而中國嘅 Moonshot AI 亦喺 7月16日 推出咗 Kimi K3。

模型名稱 開發機構 推出日期 總參數規模 激活參數 (推理時) 核心優勢與特點 預估使用成本 (每百萬 Token)
Qwen 3.8-Max 阿里巴巴 2026年8月3日 2.4T (稀疏 MoE) 約 95B 長週期任務自動化、視覺與多模態處理、開源權重 輸入: 約 US$2
輸出: 約 US$6
GPT-5.6 (Sol版本) OpenAI 2026年7月 未公開 未公開 行業標準、強大嘅通用推理及生態系統整合 未公開 (按級別定價)
Claude Fable 5 Anthropic 2026年中 未公開 未公開 Text 及 Vision Arena 排行榜前列、強大邏輯分析 企業級定價
Kimi K3 Moonshot AI 2026年7月16日 約 2.8T 約 104B 超長上下文處理、前端編碼表現突出、已開源 具競爭力定價

註:以上數據基於各廠商公佈資料及第三方測試平台數據,實際效能及收費可能因應用場景及 API 調用方式而有所不同。

總結:開源策略與市場影響

綜合以上各項數據同技術特點,Qwen 3.8-Max 嘅推出進一步鞏固咗阿里巴巴喺超大規模多模態以及自主智能體領域嘅佈局。佢最吸引企業用戶嘅地方,在於稀疏 MoE 架構帶嚟嘅高成本效益,以及能夠應付長週期自主執行嘅穩定性。

值得留意嘅係,阿里巴巴選擇喺下星期公開 Qwen 3.8-Max 同埋輕量版 Qwen 3.8-27B 嘅模型權重。呢種擁抱開源社區嘅策略(與 Kimi K3 相似),唔單止有助於降低企業引入頂級 AI 技術嘅門檻,亦預期會吸引全球大量開發者下載進行微調(Fine-tuning),進一步豐富其應用生態。喺中美 AI 技術競賽嘅大環境下,高質素開源模型嘅普及,將會為各行各業帶嚟更多具實用價值嘅智能化解決方案。對於香港、台灣以及新加坡等地區嘅企業嚟講,市場上出現更多性價比高且具備強大中文及多模態處理能力嘅模型,絕對有助於推動本地嘅數碼轉型步伐。