隨著AI模型規模越來越龐大,真正限制人工智慧發展的問題,已不只是晶片效能,而是「GPU之間如何高速傳輸資料」。

OpenAI近日正式宣布,攜手AMD、Broadcom(博通)、Intel、Microsoft與NVIDIA等科技巨頭,共同推出全新網路協定「MRC(Multipath Reliable Connection,多路徑可靠連線)」 ,希望解決大型AI超級電腦在訓練時的網路壅塞問題。

AI時代的新瓶頸:GPU彼此「溝通太慢」

OpenAI指出,當AI訓練規模擴大到超過10萬顆GPU時,即使只有少量資料傳輸延遲,也可能導致大量GPU閒置等待。

這種問題被稱為:

  • 網路壅塞(Congestion)
  • 延遲(Latency)
  • 抖動(Jitter)
  • 鏈路故障(Link Failure)

而這些狀況,會讓價值數十億美元的AI超算效率大幅下降。

OpenAI坦言,未來AI競爭已從「模型競賽」,逐漸變成「運算基礎建設競賽」。

MRC是什麼?

MRC全名為「Multipath Reliable Connection(多路徑可靠連線)」。

簡單來說,它是一種專門為AI超級電腦設計的新型網路協定。

過去資料傳輸通常只會走少數固定路徑,一旦塞車或故障,就可能拖慢整個AI訓練。

而MRC的核心概念是:

「把資料同時分散到數百條路徑傳輸」

這樣即使某些路線故障,也能立即切換其他路徑,幾乎不影響整體運算。

三大技術亮點

OpenAI表示,MRC有三大關鍵突破:

1/資料同時走數百條路徑

MRC能將單次資料傳輸拆散,分配到大量不同網路路徑中,大幅降低壅塞。


2/微秒級繞過故障

傳統大型資料中心若網路設備故障,可能需要數秒甚至數十秒重新路由。

但MRC能在「微秒級」完成切換。

這對同步式AI訓練極為重要。


3/降低超算耗電與設備數量

OpenAI表示,MRC可讓超大型AI叢集只需兩層交換器架構,就能維持高可靠度。

相較傳統三層或四層架構:

  • 用電更低
  • 成本更低
  • 維護更簡單

已實際部署在OpenAI超級電腦

目前MRC已正式部署在:

  • OpenAI最大規模NVIDIA GB200超算
  • Oracle Cloud Infrastructure(OCI)
  • Microsoft Fairwater超算系統

並已實際用於訓練OpenAI新一代模型。

OpenAI甚至透露,在某次模型訓練期間,他們曾直接重啟核心交換器,但AI訓練作業仍能持續進行。

OpenAI選擇「開源」

值得注意的是,OpenAI這次並未將技術封閉,而是透過OCP(Open Compute Project)向業界公開。

OpenAI表示:

「AI未來的基礎建設,需要產業共同合作。」

因此AMD、NVIDIA、Intel、Microsoft等公司都參與其中。

AI競爭正進入「系統戰爭」

外界分析,這代表AI產業競爭已開始從:

  • 模型能力
  • 參數規模

逐漸轉向:

  • 網路架構
  • 超算效率
  • 資料傳輸
  • 電力成本
  • 散熱與基礎設施

因為未來真正的關鍵,可能不是誰有最多GPU,而是誰能讓GPU「不浪費時間等待」。

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *