SpaceXAI 推出 Grok 4.6:AI 智能追平 GPT-5.6 Sol,主打長效代理功能

SpaceXAI 喺8月12日正式推出全新人工智能模型 Grok 4.6,主打處理長效代理任務、編碼同知識型工作。最新評測顯示,Grok 4.6 嘅綜合智能指數成功追平 OpenAI 嘅 GPT-5.6 Sol。而最吸引嘅係,佢嘅 API 輸出成本只係對手嘅五分之一,以極高性價比為 AI 開發市場帶嚟新選擇。

SpaceXAI 推出 Grok 4.6:AI 智能追平 GPT-5.6 Sol,主打長效代理功能
SpaceXAI 推出 Grok 4.6:AI 智能追平 GPT-5.6 Sol,主打長效代理功能

Grok 4.6 正式發布:API 成本僅為 GPT-5.6 Sol 五分之一,性價比大比拼

SpaceXAI 喺8月12日正式宣佈推出全新 AI 模型 Grok 4.6。今次更新主要針對需要長時間運行嘅代理(Agents)、程式編碼、複雜嘅知識型工作同埋進階視覺項目。官方聲稱,Grok 4.6 嘅智能水平已經追平 OpenAI 嘅 GPT-5.6 Sol 同埋 Anthropic 嘅 Claude Fable 5,正式躋身頂級 AI 模型行列。

Grok 4.6 效能評測與比較

根據 SpaceXAI 嘅公佈,Grok 4.6 喺處理多步驟任務方面有明顯進步。佢可以喺一個唔熟悉嘅程式碼庫入面進行探索,甚至喺執行下一步之前,識得自我測試同驗證輸出結果。

0:00
/0:46

根據 SpaceXAI 嘅公佈,Grok 4.6 喺處理多步驟任務方面有明顯進步。佢可以喺一個唔熟悉嘅程式碼庫入面進行探索,甚至喺執行下一步之前,識得自我測試同驗證輸出結果。

綜合智能與代理任務表現

喺評測機構 Artificial Analysis 嘅綜合智能指數(Intelligence Index)入面,Grok 4.6 攞到 61 分,同 GPT-5.6 Sol 最高推理級別打成平手,只係輸畀 Claude Fable 5 最高級別一分。比起上代 Grok 4.5,今次喺多個評測入面都有所提升。SpaceXAI 解釋,呢啲進步主要歸功於更長嘅補充訓練期、更優質嘅工程數據,以及喺編程同知識工作上擴大咗強化學習(Reinforcement Learning)嘅應用。

喺評測機構 Artificial Analysis 嘅綜合智能指數(Intelligence Index)入面,Grok 4.6 攞到 61 分,同 GPT-5.6 Sol 最高推理級別打成平手,只係輸畀 Claude Fable 5 最高級別一分。
喺評測機構 Artificial Analysis 嘅綜合智能指數(Intelligence Index)入面,Grok 4.6 攞到 61 分,同 GPT-5.6 Sol 最高推理級別打成平手,只係輸畀 Claude Fable 5 最高級別一分。

純編程能力仍有距離

不過,第三方數據顯示,雖然 Grok 4.6 喺綜合分數同代理任務表現出色,但喺純編碼能力上仍然落後對手。例如喺 Terminal-Bench 測試入面,Grok 4.6 只得 26%,對比 GPT-5.6 Sol 嘅 34.6% 同 Claude Fable 5 嘅 34.1%,依然有一段距離。對於高度依賴 AI 生成複雜程式碼嘅工程師嚟講,呢點值得留意。

API 定價與成本效益

定價方面,Grok 4.6 嘅 API 收費維持喺每百萬輸入代幣(Tokens)2 美元,每百萬輸出代幣 6 美元。作為比較,GPT-5.6 Sol 嘅收費大約係輸入 5 美元、輸出 30 美元。換言之,Grok 4.6 喺輸出成本上只係 GPT-5.6 Sol 嘅五分之一。對於需要處理大量生成內容,或者要長時間運行代理任務嘅開發者嚟講,成本效益相當明顯。

總結

整體嚟講,SpaceXAI 今次推出 Grok 4.6,成功喺智能分數上拉近同 OpenAI 甚至 Anthropic 等前沿對手嘅距離,尤其係以較低嘅 API 定價作招徠,對企業同開發者具有一定吸引力。雖然喺部分純編程測試上仲有進步空間,但主打嘅長效代理能力,已經為市場提供多一個實用嘅選擇。目前用家已經可以透過 Cursor、Grok Build、SpaceXAI API 等平台試用,官方更為 Cursor 同 Grok Build 嘅用戶提供首星期雙倍使用額度。