中國全新純 CPU 超級電腦 LineShine 登場:無 GPU 支援下嘅 1.54 Exaflops 運算突破

喺全球 AI 競賽同顯示卡供應受限嘅背景下,中國最新研發出名為「LineShine」嘅超級電腦。呢部機器打破傳統依賴 GPU 嘅設計,單靠超過 245 萬個 CPU 核心,配合 Armv9 架構以及高速網絡傳輸,成功達到 1.54 exaflops 嘅算力。本文將會全面拆解 LineShine 嘅運作原理,並將佢同目前全球最快嘅超級電腦 El Capitan 進行客觀比較,幫助讀者了解呢項純 CPU 架構技術嘅優缺點同埋未來發展潛力。

中國全新純 CPU 超級電腦 LineShine 登場:無 GPU 支援下嘅 1.54 Exaflops 運算突破
中國全新純 CPU 超級電腦 LineShine 登場:無 GPU 支援下嘅 1.54 Exaflops 運算突破

中國全新超級電腦「LineShine」登場:完全撇除 GPU 嘅技術大解構

喺全球人工智能 (AI) 競賽越演越烈嘅今日,頂級運算能力已經成為各國科技發展嘅核心命脈。近年來,由於美國針對先進晶片實施出口管制,中國喺獲取 Nvidia 等高性能圖像處理器 (GPU) 方面面臨巨大挑戰。面對呢個客觀環境,中國積極尋求技術自主,近期更喺超級電腦領域取得一項引人注目嘅突破——成功研發出一部完全不需要 GPU 協助,單靠中央處理器 (CPU) 運作嘅超級電腦「LineShine」。本文將會為大家詳細剖析呢部超級電腦嘅內部架構,以及佢喺實際應用層面上嘅表現。

突破顯示卡制裁嘅自主研發之路

目前主流嘅超級電腦,絕大部份都係採用「CPU + GPU」嘅混合運算架構。CPU 負責處理複雜嘅邏輯同指令排程,而 GPU 就負責大規模嘅平行運算,特別係針對 AI 模型訓練同大數據分析。然而,要對 Nvidia 等外國顯示卡廠商「說不」,並專注於自給自足,絕對唔係一件容易嘅事。

為咗提升國內科技實力,中國喺多個領域都取得顯著進展。雖然早前研發出能夠喺三分鐘內充電並擁有雙倍能量密度嘅鋰金屬電池確實令人印象深刻,但同中國最新發布嘅超級電腦 LineShine 相比,就顯得小巫見大巫。LineShine 嘅出現,證明咗即使喺缺乏頂級 GPU 嘅情況下,透過重新設計系統架構同依賴龐大嘅 CPU 核心數量,依然可以建構出具備極高算力嘅超級運算平台。

LineShine 運作原理:無 GPU 點樣推動龐大運算?

LineShine 能夠提供高達 1.54 exaflops(百億億次浮點運算)嘅運算效能。既然無 GPU 提供平行運算支援,到底 LineShine 係點樣運作嘅呢?答案就係依賴一個極其龐大嘅「核心軍團」,以及巧妙嘅硬體指令集配合。

核心戰術:以數量彌補 GPU 嘅不足

LineShine 內部搭載咗多粒名為「LX2」嘅處理器,呢啲處理器係建基於 Armv9 架構設計。每粒 LX2 處理器包含 304 個 CPU 核心。成部超級電腦總共配備咗 20,480 個運算節點 (Compute Nodes),而每一個節點入面都裝有兩粒 LX2 處理器。經過簡單嘅數學計算,即係話 LineShine 總共擁有高達 2,451,840 個 CPU 核心。系統就係透過調動呢二百四十幾萬個核心,去處理原本應該交由 GPU 負責嘅協調同通用運算操作。

SME 同 SVE 技術加持:強化矩陣與向量運算

GPU 之所以喺 AI 運算中咁重要,係因為佢哋天生擅長處理矩陣 (Matrix) 同向量 (Vector) 運算。為咗彌補 CPU 喺呢方面嘅弱項,LineShine 嘅每一個核心都支援「可擴展矩陣延伸」(Scalable Matrix Extension, SME) 以及「Arm 可擴展向量延伸」(Scalable Vector Extension, SVE)。呢兩種技術可以大幅度增強 CPU 處理 AI 訓練同複雜科學計算時所需嘅矩陣與向量運算能力,提供咗關鍵嘅額外推動力。

數據傳輸嘅關鍵:高速網絡與快取設計

運算能力再高,如果數據傳輸速度跟唔上都會造成系統樽頸。LineShine 喺快取 (Cache) 設計上做咗精密嘅安排:每一個核心都具備獨立嘅 32 KB L1 指令及數據快取;同時,系統內嘅叢集 (Clusters) 亦會共享 28.5 MB 嘅 L2 快取,確保數據能夠順暢無阻咁傳送到處理器進行運算。最後,配合每個節點運行速度高達 1.6 Tb/s 嘅 LQLink 高速網絡,將所有核心緊密連接起嚟,令 LineShine 能夠喺完全無 GPU 嘅情況下,高效完成所有運算操作。

中國全新超級電腦「LineShine」登場:完全撇除 GPU 嘅技術大解構
中國全新超級電腦「LineShine」登場:完全撇除 GPU 嘅技術大解構

深度比較:純 CPU 架構對決傳統混合架構

雖然 LineShine 嘅設計堪稱技術奇蹟,但從客觀分析嘅角度嚟睇,呢種純 CPU 架構依然有佢嘅優點同先天限制。

優點:擺脫 GPU 記憶體容量限制

喺傳統嘅混合架構中,AI 模型嘅大小往往會受到 GPU 內置記憶體 (VRAM) 嘅限制。一旦模型過大,就需要將數據喺 CPU 記憶體同 GPU 記憶體之間不斷來回搬移,造成延遲。LineShine 採用全 CPU 設計,可以直接調用龐大嘅系統主記憶體,從根本上消除咗 GPU 記憶體容量帶來嘅限制,對於處理特定類型嘅超大型數據集會有一定優勢。

缺點:高密度 AI 吞吐量稍顯不足

不過,作為一個純 CPU 系統,LineShine 喺運作效率上始終難以同「CPU + GPU」嘅異質 (Heterogeneous) 超級電腦匹敵。雖然整體運算能力強大,但面對需要極高密度吞吐量 (Throughput) 嘅現代 AI 訓練任務時,純 CPU 嘅架構喺能源消耗同運算密度上,依然未如專為此設計嘅頂級 GPU 咁有效率。

決戰世界第一:LineShine 對比 El Capitan

如果將 LineShine 同西方頂級超級電腦比較,差距依然存在。以目前全球最快嘅超級電腦 El Capitan 為例,LineShine 雖然能夠維持 1.54 exaflops 嘅效能,但 El Capitan 就以 1.809 exaflops 嘅成績大幅領先。單獨嚟睇,LineShine 擁有 245 萬個核心確實非常驚人,但當你將佢同 El Capitan 擁有嘅 1,130 萬個核心放喺埋一齊比較時,就會明白兩者喺規模同最終算力上嘅客觀差距。

新聞資料與實用資訊整理:超級電腦名詞解釋

為咗令讀者更易理解上述新聞內容,我哋整理咗以下實用嘅科技背景知識:

1. 乜嘢係 Exaflops?

Exaflops (百億億次浮點運算) 係衡量超級電腦運算速度嘅單位。「1 Exaflops」代表電腦每秒鐘可以進行 1,000,000,000,000,000,000 (10 嘅 18 次方) 次嘅浮點運算。能夠達到呢個級別嘅超級電腦被稱為「百億億次級 (Exascale) 電腦」,代表住當今人類最高嘅科技運算水平。

2. 純 CPU 與混合架構嘅分別

  • 純 CPU 架構 (同質運算):就好似一間工廠入面全部都係由全能型嘅高級工程師組成。每個人咩都會做,但如果面對大量重複性極高嘅流水線工作,整體效率未必最高。
  • 混合架構 (異質運算):好似工廠入面有幾個全能高級工程師 (CPU) 負責指揮同解決複雜問題,另外配備幾萬個流水線工人 (GPU) 專門極速處理重複性工作。目前多數 AI 開發都依賴呢種模式。

3. 對華人地區科技市場嘅啟示

LineShine 嘅誕生對於香港、中國、台灣以至新加坡嘅科技產業都有唔同程度嘅影響:

  • 中國:證明咗喺受限環境下,依然有能力利用現有資源(如 Arm 架構)整合出頂級算力,填補國內科研同軍工對超算的急切需求。
  • 台灣:作為全球晶片代工(如 TSMC)及伺服器硬件製造嘅核心樞紐,超級電腦架構嘅改變(由依賴 Nvidia GPU 轉向大量訂製 CPU)可能會為台灣相關硬件供應鏈帶來新嘅訂單或技術調整需求。
  • 香港與新加坡:兩地作為亞洲重要嘅數據中心及金融科技樞紐,對 AI 算力需求極大。若未來純 CPU 架構的超算技術成熟並下放到商用數據中心,將可能為兩地企業提供另一種撇除 GPU 採購限制嘅算力基建方案。

客觀總結:特殊環境下嘅技術妥協與未來展望

喺 Nvidia 等廠商不斷推出更強大嘅個人 AI 電腦晶片、西方國家繼續主導頂尖混合架構超級電腦嘅時代,LineShine 嘅出現可以話係中國喺特殊國際環境下,一個必要嘅「技術妥協」與創新結合。佢未必擁有西方超級電腦最極致嘅能源效率同絕對算力,但就喺系統靈活性同適應性上展現出強大嘅實力。

透過超過 245 萬個 CPU 核心以及 Armv9 架構嘅 SME / SVE 技術,LineShine 成功證明咗「無 GPU」一樣可以踏入 Exascale (百億億次級) 嘅運算門檻。呢個發展亦不禁令人期待,當未來中國國家超級計算中心能夠累積到足夠數量嘅國產自主研發 GPU 時,結合現時喺大型系統整合上取得嘅經驗,到底能夠組裝出一部點樣嘅超級機器。對於讀者而言,持續關注呢場全球算力競賽,將有助我哋更好咁理解未來科技同 AI 發展嘅大趨勢。