- NVLink は GPU あたり数百 GB/秒の速度と非常に低いレイテンシを実現し、マルチ GPU では PCIe よりも優れたパフォーマンスを発揮します。
- NVSwitch はメッシュを拡張し、数十 TB/秒の合計速度を持つ NVLink (DGX/SuperPOD) ネットワークを実現します。
- H100 の NVLink 4.0 は GPU あたり最大 900 GB/秒に達し、A100 では 600 GB/秒に達します。
- 正しい展開: 互換性、ジャンパー、4G BIOS、ドライバー、nvidia-smi、および NCCL/NVSHMEM。

マルチ GPU リグの活用や AI インフラストラクチャの構築に興味があるなら、おそらく NVLink について聞いたことがあるでしょう。 NVIDIAのこの高速インターコネクト これは、グラフィック プロセッサ間、場合によっては CPU と GPU 間のボトルネックを解消し、PCI Express が許容する範囲をはるかに超えるマルチ GPU パフォーマンスを実現するために誕生しました。
NVLink はマーケティング以外にも、具体的なメリットをもたらします。 NVSwitch による圧倒的な帯域幅、超低レイテンシ、真のスケーラビリティ AI、HPC、データ分析を加速する共有メモリオプション。以下では、それが何であるか、どのように機能するか、どのように進化してきたか、どのハードウェア(A100/H100、DGX、SuperPOD)と統合できるか、PCIe/SLIとの違い、そしてサーバー上で適切に設定する方法を説明します。
NVIDIA NVLink とは何ですか? なぜ重要なのですか?
NVLinkは 独自の高速シリアル相互接続 NVIDIAがGPU同士、そして特定のプラットフォームでは互換性のあるCPUと通信するために開発したプロトコルです。PCIeバス経由ですべてが転送される従来の方式と比較して、NVLinkはポイントツーポイントのリンクを提供します。 帯域幅が大幅に増加し、レイテンシが低減その結果、複数の GPU が連携して、膨大な量のデータを必要とするワークロード (ディープラーニング、科学的シミュレーション、高度な分析) を処理するチームとして動作できるようになり、計算時間が短縮され、効率が向上します。
プロフェッショナル分野では、NVLinkは次のようなシステムのバックボーンとなっています。 NVIDIA DGX、HGX、SuperPOD クラスター過去には、特定の構成においてSLIの代替としてGeForce環境にも導入されました。NVLinkは最初のバージョンから速度、効率、メモリ容量の面で進化を続け、現在4.0世代に到達しています。 GPUあたり数百GB/秒の数値 NVSwitch によりスケーラブルなトポロジを実現。
NVLink vs. PCIeおよびSLI: 帯域幅、レイテンシ、メモリ
PCI Express と比較して、NVLink は、一般的なバスのボトルネックを回避する専用リンクを提供します。 PCIe 4.0 x16の理論上の最大速度は64 GB/秒です。一方、最新のGPUごとのNVLink実装では、これらの数値をはるかに上回っています(例えば、H100はNVLink 4.0でGPUあたり最大900GB/秒の双方向通信を実現しています)。レイテンシも大幅に短縮されており、これは複数のGPU間で頻繁に同期を行う際に特に顕著です。
SLI( ゲームにおけるマルチGPUレンダリング)NVLinkは、より堅牢で専門的なデータ共有アプローチを導入します。GeForceとの提携期間中、NVLinkは次のような利点を提供しました。 共有フレームバッファとVRAMの追加の可能性 特定のシナリオでは2枚のカード間でのNVLinkはSLIでは一般的に提供されないものでした。しかし、ゲームでのサポートは限定的であり、NVIDIAはNVLinkを 「プレミアム」機能 Turing では、たとえば、RTX 2070 にはコネクタがありませんでしたが、RTX 2080/2080 Ti にはコネクタが含まれています。
これらのカードでこれを有効にするには、物理的なブリッジが必要でした。 NVLinkブリッジは数百ドルから GeForce に登場した際には、プロフェッショナル ステージの価格は NVIDIA ストアで約 80 ~ 90 ユーロにまで下がり、帯域幅を最大限に活用する上級ユーザーと環境を対象としたソリューションとして残りました。
NVLink の進化: 1.0 から 4.0 へ
NVLink は 4 世代にわたってリンク速度、サブリンク数、メモリ サポートの面で成長してきました。 NVLink1.0 テスラP100(2016年)でデビューし、 160 GB/秒(合計) 4つのサブリンク(それぞれ8+8回線、20GT/s)を介して、GPUあたり(往復合計)のスループットを実現します。IBM POWER8+などのCPUプラットフォームにも実装されており、CPU-GPU間およびGPU-GPU間の高速接続を実現します。
とともに NVLink2.0 (Volta V100とPOWER9)では、リンク速度が25 GT/sまで向上し、GPUあたりのサブリンク数も増加しました(V100では最大6)。 300 GB/秒(合計) (1方向あたり150GB/秒)のGPUあたり。さらに、 キャッシュコヒーレンス 互換性のあるアーキテクチャ上で実行することで、不要なコピーと CPU オーバーヘッドを削減します。
En NVLink3.0 (Ampere A100)は、第2世代のNVSwitchと改善されたプロトコル効率を備えた統合マルチGPUメッシュです。各A100は、 600 GB/秒(合計) 12 個のリンクで GPU あたり 300 GB/秒 (方向ごとに 300 GB/秒) を実現し、8 個の GPU と 6 個の NVSwitch チップを搭載した DGX A100 ノードのスケーラビリティを強化します。
実際の NVLink4.0 (ホッパーH100)は、物理的な飛躍を遂げています。 SerDesから112G PAM4へ各NVLink 4.0リンクは2つの112Gレーンで構成され、 リンクあたり25 GB/秒(片方向) (双方向50GB/秒)。 H100あたり18リンク、合計は GPUあたり900 GB/秒の双方向内部マシン通信の限界を劇的に引き上げた。ブラックウェルにおけるNVLink 5への進化については、 ブラックウェルのNVLink 5.
NVLink の仕組み: リンク、サブリンク、一貫性
NVLinkは確立する シリアルポイントツーポイント接続 これらはグループ(リンク/サブリンク)に集約され、従来のPCIeをはるかに凌駕する実効帯域幅を提供します。初期の世代では、各サブリンクは8+8ライン(往復)を20/25 GT/sで結合していましたが、最近の世代では設計が改良され、 最新のラインコーディング(NRZ/PAM4) 信頼性とエネルギー効率を維持しながら、回線あたりの速度を向上させます。
このプロトコルは、 GPU間の直接通信 CUDA/NCCLエコシステムとの統合が可能。共有メモリと コヒーレンスモデル NVSHMEM や他のライブラリと組み合わせることで、複数の GPU がメモリ アドレスを統一的に表示できるようになり、コピーが削減され、大規模な並列処理が容易になります。
マルチGPUトポロジーでは、NVLinkはメッシュに編成するか、 NVスイッチ非常に高帯域幅のファブリックとして機能する。これらすべてが 低遅延 デバイス間の同期を実現し、シャーシ内の GPU の数が増えても高い転送速度を維持します。
NVSwitch: NVLinkを拡張するファブリック
NVSwitchは、ポイントツーポイントリンクを超えたNVLink通信を可能にするコンポーネントです。NVSwitchチップ 数十のNVLinkリンクを相互接続 完全に接続された高帯域幅、低レイテンシのメッシュにより、どの GPU も CPU を経由せずに他の GPU と通信できます。
第三世代、 NVSwitch3 (H100用)はTSMC 4Nプロセスで製造され、約 25,1億個のトランジスタ 約294 mm²のマトリックスに収められています。 64個のNVLink 4.0ポートそれぞれ2車線で約 ポートあたり200 Gbps(単方向)チップあたり12,8 Tbps(双方向3,2 TB/s)の速度を実現。エンジン搭載 シャープ (スケーラブルな階層的削減と集約)ハードウェアアクセラレーション、ALUは約 400 GFLOPS FP32 スイッチ内削減操作、テレメトリ、論理ネットワークパーティショニング、 FEC 堅牢性のため。
NVSwitch3は 外部ネットワークに接続する 専用PHYを介して400GbEまたはInfiniBand NDRなどの高速データレート(400GbEまたはInfiniBand NDR)をサポートし、DGX/HGXシステムにGPUバックプレーンとして統合されます。NVLink OSFP光モジュールおよびNVLink外部スイッチと組み合わせることで、ラックスケールおよびクラスタースケールのNVLinkファブリックを構築できます。
NVIDIA A100およびH100への統合
En Nvidia A100 (Ampere)では、各GPUには12個のNVLink 3.0リンクがあり、合計で 600 GB / sの 追加された機能は、NVSwitch2を介して8つのGPUを使用したAIトレーニングとシミュレーションの鍵となります。この世代では、DGX A100の構成が普及しました。 6個のNVSwitchチップ 効率的な全対全接続を実現する内部。
とともに エヌビディア H100 (ホッパー)NVLink 4.0ではさらにレベルが上がり、GPUあたり18リンク、最大 900 GB/秒双方向さらに、ホッパーは ミグ より柔軟(GPUインスタンス)であり、NVSwitch3を利用して高速GPU間トラフィックを維持します。外部ネットワークレベルでは、 NVLinkスイッチ 1Uフォーマットでは2つのNVSwitch3を統合し、最大32個のOSFPポートを公開します。128個の論理NVLink 4.0インターフェースにより、 数十Tbpsが追加された大容量の光リンクを使用して複数の GPU サーバーを相互接続するためのバックボーンとして機能します。
これらの改善は、 キャッシュコヒーレンス、ECC、フォールトトレランスメカニズム整合性と可用性がパフォーマンスと同じくらい重要な重要な環境 (AI、科学研究、金融、医療) では不可欠です。
NVLink ネットワーク (ファブリック) と DGX H100 SuperPOD
外部NVLinkスイッチを使用すると、 専用NVLinkネットワーク GPU向け、IP/イーサネットに依存しない設計で、アクセラレータ間の帯域幅を最大化し、レイテンシを最小化する。各サーバーは独自のアドレス空間を維持し、ネットワークが管理する。 接続性、分離性、セキュリティ 異なるノード上の GPU 間で、NVIDIA API を通じてルートを自動的に確立します。
1で DGX H100 スーパーポッド 標準(32台のサーバー、256台のH100 GPU)では、NVLinkネットワークは約 57,6 TB/秒の双方向帯域幅 256個のGPUのうち、各DGX H100は内部に8個のGPUを統合しており、 4 NVSwitch3 GPUあたり18個のNVLink 4.0リンクが内部スイッチにグループ(5/4/4/5)で編成されており、ローカルトラフィックを優先する設計となっている。 2:1の収束を実現 複雑さとコストのバランスをとるために、外部スイッチに移行します。
サーバーのネットワーク出力には、DGX H100がマウントされます。 8つのConnectX-7ポート とXNUMX ブルーフィールド3 DPU PCIe Gen5をサポートし、ネットワーク/セキュリティ/ストレージ機能を提供します。これにより、NVLinkファブリックをイーサネット/InfiniBandネットワークに接続し、複数のPODに拡張し、次のようなトポロジで大規模なAIジョブをオーケストレーションすることが可能になります。 太い木 InfiniBand を使用する場合。
ベンチマークテストでは 全体対全体の二等分NVLink 4.0/NVSwitch3機能により、従来のIBベースの構成に比べて有効帯域幅が倍増し、 NCCL NVLink パスが最適化されている場合、サーバー内およびノード間の両方で安定した帯域幅を示します。
ユースケースと実用的なメリット
AIと機械学習:NVLinkは分散トレーニングを加速し、 同期とall-reduce GPU間の高速化により、エポックあたりの時間が短縮され、スケーラビリティが向上します。NVSwitchを搭載したDGX/HGXシステムでは、GPUはデータを共有します。 サブマイクロ秒の遅延数百万のパラメータと大きなバッチを持つモデルにとって重要です。
HPCと科学シミュレーション:物理学、ゲノミクス、気候の分野では、ボトルネックとなるのは GPU間でデータを移動するNVLink と NVSwitch は GPU 間帯域幅を向上し (例: A100 では方向ごとに 300 GB/秒、H100 では合計最大 900 GB/秒)、高パフォーマンス環境における効率を向上します。 素晴らしいコミュニケーション ノード内。
高速データベースとデータ分析:共有メモリアクセスと一貫性により、 コピーと中間ステップGPU 常駐データベースとリアルタイム分析エンジンでのクエリと変換を高速化します。
実際の例: NCAR 気象予測モデルの速度と精度を向上させた企業もある。ゲノミクス分野では、 無錫NextCODE NVLinkアクセラレーションパイプラインで分析時間を短縮し、AIラボでは OpenAI 最適化された GPU-GPU 通信を備えた大規模ネットワークをトレーニングするために、マルチ GPU インフラストラクチャを採用しています。
クイックスタートガイド: サーバーへの NVLink の導入
始める前に、要件を確認してください。 互換性を確認する NVIDIA およびサーバー製造元のマトリックスに従って、シャーシ、マザーボード、CPU、そして何よりも GPU を NVLink/NVSwitch で制御します。
- NVLinkブリッジ- サポートされているデュアルGPU構成(例:一部のプロフェッショナル向けまたはハイエンドのTuring世代)では、適切な物理ジャンパーを取り付け、カチッとはめ込んでください。間隔とGPUシリーズが一致するモデルを選択してください。
- BIOS / UEFI: 次のようなオプションを有効にします 4G以上のデコード 必要に応じてPCIeリソースを調整します。最新のGPU搭載サーバーでは、通常は事前に設定されていますが、確認することをお勧めします。
- 運転手: 最新のNVIDIAドライバをインストールし、該当する場合は、 CUDA/NCCL 更新されました。適切なドライバーがないと、NVLink が有効にならないか、優先パスが使用されません。
- 検証Linuxでは、 nvidia-smi nvlink -s リンクの状態、トポロジ、速度を確認します。すべてのリンクがアクティブであり、ECC/FEC訂正エラーがないことを確認します。
- ソフトウェア: フレームワーク(PyTorch、TensorFlow)を調整して、NCCLと高速パスを使用します。独自のアプリケーションでは、 NCCL/NVSHMEM 同期を最小限に抑え、NVLink 経由の転送を最大化するアルゴリズムを設計します。
NVLink 4.0、NVLink-C2C、NVLink Fusion:最新情報
第4世代のNVLinkは リンクあたりの帯域幅の増加、GPUあたりのリンク数の増加、整合性の向上 信号。DGX H100環境では、これにより、前世代と比較して、輻輳が低減し、拡張性が向上し、転送GBあたりのエネルギー効率が向上します。
梱包面では、 NVLink-C2C (チップからチップまで)最大 エネルギー効率が25倍向上 そしてアップ 面積効率が90倍向上 NVIDIAチップのPCIe Gen5 PHYと比較すると、PCBからMCM、インターポーザー/ウエハーレベルまで拡張可能。 CPUとGPU 狭義(グレースやプロセッサの場合) ルビン CPX) およびセミカスタムのパートナー デザイン向けです。
NVIDIAはまた、 NVLinkフュージョン、への扉を開くプログラム サードパーティ製プロセッサ(CPUおよびASIC) NVLinkエコシステムに統合し、データセンターにおける技術の範囲を拡大し、AIアーキテクチャを可能にします。 より異質な.
NVLinkと従来の技術:主な事実
PCIeと比較して、NVLinkは はるかに高い総帯域幅、低レイテンシ、NVSwitchで拡張可能なアーキテクチャ。PCIeは依然として汎用性が高く、多くのユースケースで十分ですが、モデルやデータセットが大きくなるにつれて、 64 GB/秒(PCIe 4.0 x16)の違い NVLink を使用した GPU あたり数百 GB/秒が、システムの最終的なパフォーマンスを示します。
さらに、NVLinkとNVSwitchには エラー修正、テレメトリ、セキュリティオプション(NVLinkネットワークパーティショニングなど)を備え、エンタープライズHPC/AI環境の要求を満たします。 信頼性と可用性 は重要です。
