大規模AIサービスのためのデータセンター構築技術
1. 概要
A. 定義
超巨大AI(LLM)の学習・推論のために数千〜数万個のGPU/アクセラレータを超低遅延・広帯域ネットワークで接続し、高密度電力・冷却を備えたAI特化データセンターであり、しばしばAI Factoryとも呼ばれる。
従来のデータセンター(IDC)がウェブ・DB・仮想マシンのような多数の独立したワークロードを収容するよう設計されているとすれば、AIデータセンターは数千個のアクセラレータが一つの巨大な作業(モデル学習)を協力して遂行するよう設計される点で根本的に異なる。この違いがネットワーク・電力・冷却のすべての設計判断を支配する。すなわちAIデータセンターは「多くのサーバを集めた場所」ではなく「数万個のアクセラレータをあたかも一台の超大型コンピュータのように動作させる場所」であり、このためスーパーコンピュータやAI Factoryに近いシステムとして理解すべきである。
B. 登場背景および必要性
LLMのパラメータと学習データが急増するにつれ、単一GPUはもちろん単一サーバでもモデルを収めきれなくなった。数百億〜数兆個のパラメータのモデルは数百GB〜数TBのメモリを要求するが、最新GPU一枚のメモリは数十〜数百GBに過ぎない。したがって数千個のGPUが一つのモデルを分けて学習(分散学習)しなければならず、このときGPUは毎学習ステップごとにグラディエント(数GB〜数十GB)をやり取りするため、GPU間の通信速度が全体の学習速度を左右する。
すなわちAIデータセンターの核心的難題は単純な演算能力(FLOPS)ではなく「通信ボトルネックと電力・発熱」である。いくらGPUが速くても通信が遅ければGPUはデータを待って遊び、このとき実効利用率(MFU、Model FLOPs Utilization)が急落する。実際の大規模学習でMFUを30〜50%水準に引き上げること自体がエンジニアリング目標になるほど通信・同期の損失は大きい。また最新GPU一枚が700W以上を消費し、ラックあたり消費電力が数十〜100kWを超えるため、一般IDC(ラックあたり5〜10kW)では電力・発熱を賄えない。こうした理由から、演算・ネットワーク・ストレージ・電力/冷却を初めからAI学習に合わせて設計する専用インフラが別途要求された。
2. 全体構造と核心要求事項
AIデータセンターは演算・ネットワーク・ストレージ・電力/冷却の四要素が均衡を成さなければならず、どれか一つでもボトルネックになれば高価なGPUが遊ぶことになる。全体構造を俯瞰すると次のとおりである。
flowchart TB
subgraph FABRIC["コンピュートファブリック"]
G1["GPUノード #1 (8-GPU/NVLink)"]
G2["GPUノード #2"]
G3["GPUノード #N"]
SW["リーフスパインスイッチ (InfiniBand/RoCE)"]
G1 --- SW
G2 --- SW
G3 --- SW
end
subgraph STORE["ストレージ"]
PFS["並列ファイルシステム (Lustre/GPFS)"]
end
subgraph FAC["設備"]
PWR["高密度電力 (ラックあたり数十kW)"]
COOL["液浸/水冷冷却"]
end
SW --- PFS
FABRIC --- PWR
FABRIC --- COOL
特にネットワークが決定的であるが、分散学習でGPUが通信を待つ時間が長ければ演算ユニットの利用率が急落するためである。ネットワークはさらにノード内部(NVLink)とノード間(InfiniBand/RoCE)の二層に分かれ、両層とも無損失・超低遅延でこそクラスタ全体が一台のように動作する。
| 要求 | 内容 |
|---|---|
| 演算 | GPU・NPU・TPUクラスタ、高密度集積 |
| ネットワーク | 超低遅延・無損失 — 通信が学習性能を左右 |
| ストレージ | 大容量・高速並列ファイルシステム(チェックポイント) |
| 電力・冷却 | ラックあたり数十kW、液浸・水冷冷却 |
ストレージがなぜ重要かも押さえる必要がある。大規模学習では障害復旧と再現のためモデル全体状態を周期的に保存(チェックポイント)するが、超巨大モデルのチェックポイント一つが数百GB〜数TBに達する。数千GPUが同時にこれを保存・復旧するには毎秒数百GB〜数TBの集計帯域が必要であるため、Lustre・GPFS(IBM Storage Scale)のような並列ファイルシステムが必須である。ここでボトルネックが生じれば学習が保存区間ごとに止まり、GPU利用率が落ちる。
従来IDCとAIデータセンターの比較
二つのタイプのデータセンターがどう異なるかを整理すると、AIデータセンターの設計要求がなぜ特殊かが浮かび上がる。差の根源はワークロードの結合度(coupling)にある。従来IDCのワークロードは互いに独立しており一つのサーバが遅くても他の作業への影響が小さいが、AI学習は数千GPUが同期して協力するため最も遅い一つが全体を遅延させる。この結合度の差がネットワーク・電力・運用戦略全般を分かつ。
| 区分 | 従来IDC | AIデータセンター |
|---|---|---|
| ワークロード | 独立した多数(ウェブ・DB・VM) | 単一の巨大作業(分散学習) |
| 結合度 | 緩い | 非常に強い(同期通信) |
| ラック電力密度 | 5〜10kW | 数十〜100kW+ |
| ネットワーク | 一般イーサネット(損失許容) | 無損失・超低遅延(IB/RoCE) |
| 冷却 | 空冷中心 | 液浸・水冷(DLC) |
| 性能指標 | 可用性・スループット | GPU利用率(MFU)・学習時間 |
この表が示唆する実務的含意は、AIデータセンターを既存IDCの「GPU増設版」として捉えると必ず失敗するという点である。電力・冷却・ネットワーク・ストレージを初めから学習ワークロードに整合させて再設計すべきであり、これはスーパーコンピュータ設計方法論に近い。
3. 低遅延・スケーリング技術(A)
通信階層の最適化
GPU間通信は二階層で最適化される。ノード内部では8個前後のGPUをPCIe(数十GB/s)よりはるかに速い専用リンク(数百GB/s級のNVLink)で直結し、ノード間ではCPUを迂回する超低遅延ネットワークを使う。データがCPUメモリを経れば複写・コンテキストスイッチで遅延が大きくなるため、RDMA(Remote Direct Memory Access)でCPU介入なしに遠隔ノードのメモリに直接アクセスするのが核心原理である。RDMAをイーサネット上に実装したものがRoCE(RDMA over Converged Ethernet)であり、専用ファブリックで実装したものがInfiniBandである。
| 技術 | 原理・説明 |
|---|---|
| RDMA(RoCE) | CPU介入なしにメモリ直接転送で低遅延 |
| InfiniBand | 無損失・超低遅延インターコネクト(HPC標準) |
| NVLink/NVSwitch | ノード内GPU間の超広帯域直接接続 |
| GPUDirect | GPUがネットワーク・ストレージと直接通信 |
| 集団通信(NCCL) | All-Reduceなど分散学習通信パターンの最適化 |
ここで「無損失(lossless)」がなぜ重要か理解する必要がある。一般イーサネットは輻輳時にパケットを捨て再送に依存するが、分散学習の集団通信(collective)では一つのGPUだけ遅れても全体の同期が遅延する(落伍者問題、straggler)。したがって流量制御(PFC)・輻輳制御でパケット損失そのものを防ぐ無損失ファブリックが必要である。InfiniBandがHPCで標準として定着した理由がまさにこの無損失・超低遅延の特性であり、最近はRoCEv2に精緻な輻輳制御を載せてイーサネットベースでも類似の性能を出そうとする流れが強い。
InfiniBandとRoCEの選択は実務でしばしばぶつかるトレードオフである。InfiniBandは専用スイッチ・アダプタで無損失・超低遅延をハードウェア水準で保証するがベンダ依存性とコストが高い。一方RoCEは汎用イーサネット装備を活用しコスト・運用の馴染みで有利だが、無損失のためにPFC・ECNなど輻輳制御を細心にチューニングしなければ大規模で性能が揺らぐ。すなわち「最高性能・検証された安定性」が優先ならInfiniBand、「コスト・既存イーサネット運用資産の活用」が優先ならRoCEが合理的であり、最近の超大型クラスタではイーサネット陣営が専用輻輳制御を強化して両陣営の格差を縮めている。
また集団通信ライブラリのNCCLはAll-Reduce・All-Gatherのような通信パターンをトポロジ(リング・ツリー)に合わせて最適化し、GPUDirect RDMAはネットワークカードがGPUメモリに直接アクセスするようにしてCPU・システムメモリ経由をなくす。このソフトウェア階層がハードウェア帯域を実際の学習性能へ転換する最後の連結環である。
分散学習の並列化戦略
分散学習はモデル・データをどう分割するかにより三つの並列化を組み合わせる(3D並列)。各々は解決する問題が異なり、通信パターンと通信量も異なる。以下は3D並列化が物理トポロジにどうマッピングされるかを示す詳細アーキテクチャ図である。
flowchart TB
subgraph DP["データ並列(ノード間、周期的All-Reduce)"]
subgraph PP1["パイプライングループA"]
direction LR
N1["ノード1(テンソル並列:GPU 8個/NVLink)"] -->|"活性値伝達"| N2["ノード2(テンソル並列)"]
end
subgraph PP2["パイプライングループB(複製本)"]
direction LR
N3["ノード3(テンソル並列)"] -->|"活性値伝達"| N4["ノード4(テンソル並列)"]
end
end
PP1 <-->|"グラディエントAll-Reduce(InfiniBand)"| PP2
| 並列化 | 原理 | 解決する問題 |
|---|---|---|
| データ並列 | バッチを分けて各GPUが処理後グラディエントAll-Reduce | 学習速度の向上 |
| モデル/テンソル並列 | レイヤ・行列演算をGPUに分割 | モデルがGPUメモリを超過 |
| パイプライン並列 | レイヤを段階別にパイプライン処理 | 深いモデルのメモリ・効率 |
この図でテンソル並列はNVLinkで束ねられたノード内部に、パイプライン並列はノード間(活性値伝達)に、データ並列は複製本グループ間(グラディエントAll-Reduce)に配置される。通信強度が高い順により速いリンクに配置するのがスケーリングの核心原理である。
三並列化の通信特性の差が配置決定を左右する。テンソル並列は一つのレイヤの行列演算を分けるため毎演算ごとにGPU間通信が急増する。したがって必ずNVLinkで直結された同じノード内に配置する。パイプライン並列はステージ境界でのみ活性値を伝達するため通信量が少なくノード間に配置しても差し支えない。データ並列はステップの終わりにグラディエントをAll-Reduceするため通信が大きいが周期的であり、その上に載せて全体規模を拡張する。
例えばGPT級モデルはテンソル並列で一つのレイヤをノード内8個のGPUに分け、パイプライン並列でレイヤの束を複数ノードに配置し、その上にデータ並列を載せて数千GPUを同時に回す。このときノード間の通信量が莫大であり、InfiniBand・NVLinkがなければ拡張効率(スケーリング)が急激に崩れる。ここにオプティマイザ状態を分散保存するZeROのようなメモリ最適化を結合し、メモリ限界を追加で緩和する。
4. DCI(Data Center Interconnect)技術(B)
地理的に分散したデータセンターを超高速・低遅延の光伝送で接続し、容量拡張・災害復旧・負荷分散を実現する技術。
単一データセンターの電力・空間・冷却には物理的限界があり、一つの地域が数百MW級の電力を賄えない場合が生じる。このとき複数のDCを一つの資源プールのように束ねるDCIが必要である。一本の光ファイバで可能な限り多くのデータを送らなければならないため、異なる波長(色)にデータを載せて同時に伝送するDWDM(高密度波長分割多重)が基盤技術である。
| 技術 | 原理・説明 |
|---|---|
| DWDM | 波長分割多重で単一光ファイバに大容量伝送 |
| OTN | 光伝送網標準、大容量・低遅延バックボーン |
| コヒーレント光伝送 | 位相・振幅変調で400G/800G長距離高速伝送 |
| 活用 | DC間データ複製、災害復旧(DR)、ワークロード分散、クラスタ拡張 |
コヒーレント光伝送が重要な理由は、単純な光の強さ(on/off)だけで信号を載せていた方式と異なり、光の位相・振幅・偏光を併せて変調し一つの波長に載せられる情報量を大きく増やすためである。これを通じて長距離でも波長あたり400G・800G級の伝送が可能になり、地理的に離れたDC間でも大容量データ複製・バックアップが現実化する。ただし物理的距離から来る伝播遅延は光速の限界で完全になくすことはできないため、同期学習のように極低遅延が必須な区間は依然として単一DC内部で処理し、DCIは主に災害復旧・データ複製・緩結合(loosely-coupled)ワークロード分散に活用するのが現実的である。
5. 深化 — 最新動向とグリーンデータセンター
AIデータセンター分野の最近の動向は三軸に整理される。第一に、電力・冷却の限界突破である。GPU消費電力が世代ごとに上昇するにつれ空冷では冷却が不可能な密度(ラックあたり100kW以上)に到達し、これに伴いサーバを冷却液に浸す液浸冷却(immersion cooling)とチップに直接冷却板を付けるDLC(Direct Liquid Cooling)が標準として定着しつつある。これはPUE(電力使用効率、総電力÷IT電力)改善と直結する。
第二に、メモリボトルネックの緩和である。モデル・データが大きくなるにつれ演算よりメモリ帯域・容量がボトルネックになる場合が多く、異種装置がメモリを一貫して共有するCXL(Compute Express Link)、メモリ内部で演算するPIM(Processing-in-Memory)が注目される。これらはデータ移動にかかるエネルギー・遅延を減らそうとする試みで、まだ成熟段階に入りつつあるため、実際の導入効果はワークロードにより偏差が大きい。
第三に、国家・企業次元の大規模集積である。AIデータセンターが国家競争力の核心と認識されるにつれ、自国データ・モデルを自国インフラで処理しようとするソブリンAI(主権型AI)の流れが強まり、電力調達のため再生エネルギー・原発隣接立地が戦略的に検討されている。具体的な投資規模・電力量は事業者・時点ごとに大きく異なるため、断定するより方向性として理解するのが適切である。
実際の規模感覚と適用事例
具体的な感覚のため例を挙げると、数千GPU規模のクラスタは一つの超巨大モデルを数週〜数か月にわたって学習する。このときGPU間には毎ステップ数GBのグラディエントが行き交い、学習全体では数ペタバイト(PB)のデータが反復巡回する。NVIDIAのDGX SuperPODのような参照アーキテクチャは数十〜数百個の8-GPUノードをInfiniBandリーフスパインで束ね、並列ファイルシステムと高密度電力・冷却を標準化してこの規模を一つのシステムに統合する。超巨大言語モデル学習で実効利用率(MFU)を40%前後に維持したという公開報告は、通信・同期の損失を抑えるインフラ設計がすなわち学習コスト削減(=GPU時間削減)であることを示す。
6. 考慮事項および示唆点
- ネットワークボトルネックがすなわち性能:GPU利用率(MFU)と学習速度はネットワークが左右するため、どの二ノードでも均等な帯域を持つようFat-Tree(リーフスパイン)のようなノンブロッキングトポロジを設計し、テンソル並列はノード内部、データ・パイプライン並列はノード間に配置するなど、並列化と物理トポロジを整合させるべきである。
- 電力・炭素の制約が立地を決定:ラック密度が高いためPUE改善とともに再生電力(RE100)・液浸冷却でグリーンデータセンターを志向すべきであり、大規模電力調達の可能性自体が立地選定の最優先制約として作用する。
- 可用性・障害復旧の設計:数千GPU規模では特定ノードの障害が統計的にしばしば発生するため、頻繁なチェックポインティングと速い再起動、落伍者(straggler)の緩和が学習完走の核心である。ストレージの並列性がここで決定的である。
- 次世代技術への備え:メモリボトルネックを緩和するCXL・PIM、複数DCにまたがる分散学習、光ベーススイッチングなど拡張を念頭に、拡張性あるアーキテクチャを選択すべきである。
- 国家戦略・ガバナンス:AIデータセンターはソブリンAIの核心インフラであり、データ主権・セキュリティ・電力政策と絡んだ国家戦略次元の投資・規制イシューを併せて考慮すべきである。技術士の観点では、純粋なIT設計を超え電力・冷却・立地・規制を貫く融合設計能力が要求される。
参考資料
- NVIDIA, DGX SuperPOD Reference Architecture — https://docs.nvidia.com/dgx-superpod/
- NVIDIA, NCCL (NVIDIA Collective Communications Library) — https://developer.nvidia.com/nccl
- The Uptime Institute, Data Center PUE — https://uptimeinstitute.com/
一言まとめ: 大規模AIデータセンターはGPUクラスタをRDMA・InfiniBand・NVLinkで超低遅延接続し、データ・テンソル・パイプライン並列で分散学習し、DWDM・OTNベースのDCIと高密度電力・液浸冷却で超巨大AIを支えるソブリンAIインフラである。