RDMA 的英文全稱為 Remote Direct Memory Access。允許電腦以極少 CPU 參與直接存取另一台電腦記憶體的技術。在實務上,應把這項定義放進 AI 訓練、HPC 與儲存網路 等具體場景中理解。
RDMA 的互通與驗收應從適用規範開始。設計時需要結合 Ethernet、RoCEv2、InfiniBand、壅塞控制,以及運算系統採用的 Scale-up 或 Scale-out 拓撲。專案文件還應寫明版本、主機前提及廠商限制。
RDMA 不能當作 DCI 的另一種稱呼。RDMA 的定義是「允許電腦以極少 CPU 參與直接存取另一台電腦記憶體的技術」,而 DCI 是「連接不同資料中心、承載流量交換、複製、備份及工作負載遷移的網路鏈路」。兩者可能出現在同一設計中,但解決的是不同問題。
選擇或記錄 RDMA 時,應核對拓撲、超售比、流量模型、壅塞控制、延遲目標、故障域和規模。常見錯誤是看到支援 Leaf-Spine Network 就推定一定支援 RDMA;兩者關係必須由資料表、主機設定與測試條件證明。
常見問題
RDMA 與 DCI 有什麼不同?
RDMA 指「允許電腦以極少 CPU 參與直接存取另一台電腦記憶體的技術」,DCI 則指「連接不同資料中心、承載流量交換、複製、備份及工作負載遷移的網路鏈路」。兩者可以同時使用,但其中一項並不能證明另一項已符合要求。
RDMA 通常用在哪裡?
典型場景包括 AI 訓練、HPC 與儲存網路。具體實作仍取決於主機設備、鏈路設計、環境及適用規範。
RDMA 規格需要包含哪些資料?
應寫明拓撲、超售比、流量模型、壅塞控制、延遲目標、故障域和規模,讓供應商或工程師能夠核實要求,而不是只依賴 RDMA 這個術語。
需要協助選擇相容光模組?
請告訴我們目標設備平台、資料速率、光纖類型及傳輸距離。