← 목록으로
인프라·클라우드
#AI데이터센터#저지연#InfiniBand#RDMA#DCI#분산학습#134회
최종 업데이트 · 2026-09-29

대규모 AI 서비스를 위한 데이터센터 구축 기술

1. 개요

가. 정의

초거대 AI(LLM)의 학습·추론을 위해 수천~수만 개의 GPU/가속기를 초저지연·고대역 네트워크로 연결하고, 고밀도 전력·냉각을 갖춘 AI 특화 데이터센터로, 흔히 AI Factory로도 불린다.

전통적 데이터센터(IDC)가 웹·DB·가상머신 같은 다수의 독립적 워크로드를 수용하도록 설계되었다면, AI 데이터센터는 수천 개 가속기가 하나의 거대한 작업(모델 학습) 을 협력해 수행하도록 설계된다는 점에서 근본적으로 다르다. 이 차이가 네트워크·전력·냉각의 모든 설계 결정을 지배한다. 즉 AI 데이터센터는 "많은 서버를 모아 둔 곳"이 아니라 "수만 개 가속기를 마치 한 대의 초대형 컴퓨터처럼 동작하게 만드는 곳"이며, 이 때문에 AI Factory 또는 슈퍼컴퓨터에 가까운 시스템으로 이해해야 한다.

나. 등장 배경 및 필요성

LLM의 파라미터와 학습 데이터가 폭증하면서, 단일 GPU는 물론 단일 서버로도 모델을 담을 수 없게 됐다. 수백억수조 개 파라미터 모델은 수백 GB수 TB의 메모리를 요구하는데, 최신 GPU 한 장의 메모리는 수십수백 GB에 불과하다. 따라서 수천 개 GPU가 하나의 모델을 나눠 학습(분산학습) 해야 하는데, 이때 GPU들은 매 학습 스텝마다 그래디언트(수 GB수십 GB)를 주고받으므로 GPU 간 통신 속도가 전체 학습 속도를 좌우한다.

즉 AI 데이터센터의 핵심 난제는 단순 연산 능력(FLOPS)이 아니라 "통신 병목과 전력·발열"이다. 아무리 GPU가 빨라도 통신이 느리면 GPU는 데이터를 기다리며 놀게 되고, 이때 실효 활용률(MFU, Model FLOPs Utilization)이 급락한다. 실제 대규모 학습에서 MFU를 3050% 수준으로 끌어올리는 것 자체가 엔지니어링 목표가 될 만큼 통신·동기화 손실이 크다. 또한 최신 GPU 한 장이 700W 이상을 소비하면서 랙당 소비전력이 수십100kW를 넘어, 일반 IDC(랙당 5~10kW)로는 전력·발열을 감당할 수 없다. 이런 이유로 컴퓨팅·네트워크·스토리지·전력/냉각을 처음부터 AI 학습에 맞춰 설계하는 전용 인프라가 별도로 요구됐다.

2. 전체 구조와 핵심 요구사항

AI 데이터센터는 컴퓨팅·네트워크·스토리지·전력/냉각의 네 요소가 균형을 이뤄야 하며, 어느 하나라도 병목이면 값비싼 GPU가 놀게 된다. 전체 구조를 조망하면 다음과 같다.

flowchart TB
  subgraph FABRIC["컴퓨트 패브릭"]
    G1["GPU 노드 #1(8-GPU/NVLink)"]
    G2["GPU 노드 #2"]
    G3["GPU 노드 #N"]
    SW["리프-스파인 스위치(InfiniBand/RoCE)"]
    G1 --- SW
    G2 --- SW
    G3 --- SW
  end
  subgraph STORE["스토리지"]
    PFS["병렬 파일시스템(Lustre/GPFS)"]
  end
  subgraph FAC["설비"]
    PWR["고밀도 전력(랙당 수십 kW)"]
    COOL["액침/수랭 냉각"]
  end
  SW --- PFS
  FABRIC --- PWR
  FABRIC --- COOL

특히 네트워크가 결정적인데, 분산학습에서 GPU가 통신을 기다리는 시간이 길면 연산 유닛의 활용률이 급락하기 때문이다. 네트워크는 다시 노드 내부(NVLink)와 노드 간(InfiniBand/RoCE)의 두 계층으로 나뉘며, 두 계층 모두 무손실·초저지연이어야 전체 클러스터가 한 대처럼 동작한다.

요구 내용
컴퓨팅 GPU·NPU·TPU 클러스터, 고밀도 집적
네트워크 초저지연·무손실 — 통신이 학습 성능 좌우
스토리지 대용량·고속 병렬 파일시스템(체크포인트)
전력·냉각 랙당 수십 kW, 액침·수랭 냉각

스토리지가 왜 중요한지도 짚어야 한다. 대규모 학습에서는 장애 복구와 재현을 위해 모델 전체 상태를 주기적으로 저장(체크포인트)하는데, 초거대 모델의 체크포인트 하나가 수백 GB수 TB에 달한다. 수천 GPU가 동시에 이를 저장·복구하려면 초당 수백 GB수 TB의 집계 대역폭이 필요하므로, Lustre·GPFS(IBM Storage Scale) 같은 병렬 파일시스템이 필수다. 여기서 병목이 생기면 학습이 저장 구간마다 멈춰 GPU 활용률이 떨어진다.

전통 IDC와 AI 데이터센터 비교

두 유형의 데이터센터가 어떻게 다른지 정리하면 AI 데이터센터의 설계 요구가 왜 특수한지 드러난다. 차이의 근원은 워크로드의 결합도(coupling)에 있다. 전통 IDC의 워크로드는 서로 독립적이어서 한 서버가 느려도 다른 작업에 영향이 적지만, AI 학습은 수천 GPU가 동기화되어 협력하므로 가장 느린 하나가 전체를 지연시킨다. 이 결합도 차이가 네트워크·전력·운영 전략 전반을 갈라놓는다.

구분 전통 IDC AI 데이터센터
워크로드 독립적 다수(웹·DB·VM) 단일 거대 작업(분산학습)
결합도 느슨함 매우 강함(동기 통신)
랙 전력밀도 5~10kW 수십~100kW+
네트워크 일반 이더넷(손실 허용) 무손실·초저지연(IB/RoCE)
냉각 공랭 위주 액침·수랭(DLC)
성능 지표 가용성·처리량 GPU 활용률(MFU)·학습 시간

이 표가 시사하는 실무적 함의는, AI 데이터센터를 기존 IDC의 "GPU 증설판"으로 접근하면 반드시 실패한다는 점이다. 전력·냉각·네트워크·스토리지를 처음부터 학습 워크로드에 정합시켜 재설계해야 하며, 이는 슈퍼컴퓨터 설계 방법론에 가깝다.

3. 저지연·스케일링 기술 (가)

통신 계층 최적화

GPU 간 통신은 두 계층으로 최적화된다. 노드 내부에서는 8개 안팎의 GPU를 PCIe(수십 GB/s)보다 훨씬 빠른 전용 링크(수백 GB/s급 NVLink)로 직결하고, 노드 간에서는 CPU를 우회하는 초저지연 네트워크를 쓴다. 데이터가 CPU 메모리를 거치면 복사·컨텍스트 스위칭으로 지연이 커지므로, RDMA(Remote Direct Memory Access) 로 CPU 개입 없이 원격 노드의 메모리에 직접 접근하는 것이 핵심 원리다. RDMA를 이더넷 위에서 구현한 것이 RoCE(RDMA over Converged Ethernet)이며, 전용 패브릭으로 구현한 것이 InfiniBand다.

기술 원리·설명
RDMA(RoCE) CPU 개입 없이 메모리 직접 전송으로 저지연
InfiniBand 무손실·초저지연 인터커넥트(HPC 표준)
NVLink/NVSwitch 노드 내 GPU 간 초고대역 직접 연결
GPUDirect GPU가 네트워크·스토리지와 직접 통신
집단통신(NCCL) All-Reduce 등 분산학습 통신 패턴 최적화

여기서 "무손실(lossless)"이 왜 중요한지 이해할 필요가 있다. 일반 이더넷은 혼잡 시 패킷을 버리고 재전송에 의존하는데, 분산학습의 집단통신(collective)에서는 단 하나의 GPU만 늦어도 전체 동기화가 지연된다(낙오자 문제, straggler). 따라서 흐름제어(PFC)·혼잡제어로 패킷 손실 자체를 막는 무손실 패브릭이 필요하다. InfiniBand가 HPC에서 표준으로 자리 잡은 이유가 바로 이 무손실·초저지연 특성이며, 최근에는 RoCEv2에 정교한 혼잡제어를 얹어 이더넷 기반으로도 유사한 성능을 내려는 흐름이 강하다.

InfiniBand와 RoCE의 선택은 실무에서 자주 부딪히는 트레이드오프다. InfiniBand는 전용 스위치·어댑터로 무손실·초저지연을 하드웨어 수준에서 보장하지만 벤더 종속성과 비용이 높다. 반면 RoCE는 범용 이더넷 장비를 활용해 비용·운영 친숙도에서 유리하나, 무손실을 위해 PFC·ECN 등 혼잡제어를 세심하게 튜닝하지 않으면 대규모에서 성능이 흔들린다. 즉 "최고 성능·검증된 안정성"이 우선이면 InfiniBand, "비용·기존 이더넷 운영 자산 활용"이 우선이면 RoCE가 합리적이며, 최근 초대형 클러스터에서는 이더넷 진영이 전용 혼잡제어를 강화해 두 진영의 격차를 좁히고 있다.

또한 집단통신 라이브러리인 NCCL은 All-Reduce·All-Gather 같은 통신 패턴을 토폴로지(링·트리)에 맞춰 최적화하고, GPUDirect RDMA는 네트워크 카드가 GPU 메모리에 직접 접근하도록 해 CPU·시스템 메모리 경유를 없앤다. 이 소프트웨어 계층이 하드웨어 대역폭을 실제 학습 성능으로 전환하는 마지막 연결고리다.

분산학습 병렬화 전략

분산학습은 모델·데이터를 어떻게 쪼개느냐에 따라 세 가지 병렬화를 조합(3D 병렬)한다. 각각은 해결하는 문제가 다르며, 통신 패턴과 통신량도 다르다. 아래는 3D 병렬화가 물리 토폴로지에 어떻게 매핑되는지를 보여 주는 세부 아키텍처도다.

flowchart TB
  subgraph DP["데이터 병렬(노드 간, 주기적 All-Reduce)"]
    subgraph PP1["파이프라인 그룹 A"]
      direction LR
      N1["노드1(텐서병렬:GPU 8개/NVLink)"] -->|"활성값 전달"| N2["노드2(텐서병렬)"]
    end
    subgraph PP2["파이프라인 그룹 B(복제본)"]
      direction LR
      N3["노드3(텐서병렬)"] -->|"활성값 전달"| N4["노드4(텐서병렬)"]
    end
  end
  PP1 <-->|"그래디언트 All-Reduce(InfiniBand)"| PP2

이 그림에서 텐서 병렬은 NVLink로 묶인 노드 내부에, 파이프라인 병렬은 노드 사이(활성값 전달)에, 데이터 병렬은 복제본 그룹 사이(그래디언트 All-Reduce)에 배치된다. 통신 강도가 높은 순서대로 더 빠른 링크에 배치하는 것이 스케일링의 핵심 원리다.

병렬화 원리 해결 문제
데이터 병렬 배치를 나눠 각 GPU가 처리 후 그래디언트 All-Reduce 학습 속도 향상
모델/텐서 병렬 레이어·행렬 연산을 GPU에 분할 모델이 GPU 메모리 초과
파이프라인 병렬 레이어를 단계별로 파이프라인 처리 깊은 모델의 메모리·효율

세 병렬화의 통신 특성 차이가 배치 결정을 좌우한다. 텐서 병렬은 한 레이어의 행렬 연산을 나누므로 매 연산마다 GPU 간 통신이 폭증한다. 따라서 반드시 NVLink로 직결된 같은 노드 안에 배치한다. 파이프라인 병렬은 스테이지 경계에서만 활성값을 전달하므로 통신량이 적어 노드 간에 배치해도 무방하다. 데이터 병렬은 스텝 끝에 그래디언트를 All-Reduce하므로 통신이 크지만 주기적이라, 그 위에 얹어 전체 규모를 확장한다.

예컨대 GPT급 모델은 텐서 병렬로 한 레이어를 노드 내 8개 GPU에 나누고, 파이프라인 병렬로 레이어 묶음을 여러 노드에 배치하며, 그 위에 데이터 병렬을 얹어 수천 GPU를 동시에 돌린다. 이때 노드 간 통신량이 막대해 InfiniBand·NVLink가 없으면 확장 효율(스케일링)이 급격히 무너진다. 여기에 옵티마이저 상태를 분산 저장하는 ZeRO 같은 메모리 최적화를 결합해 메모리 한계를 추가로 완화한다.

4. DCI(Data Center Interconnect) 기술 (나)

지리적으로 분산된 데이터센터를 초고속·저지연 광전송으로 연결해 용량 확장·재해복구·부하분산을 실현하는 기술.

단일 데이터센터의 전력·공간·냉각에는 물리적 한계가 있어, 한 지역이 수백 MW급 전력을 감당하지 못하는 경우가 생긴다. 이때 여러 DC를 하나의 자원 풀처럼 묶는 DCI가 필요하다. 한 가닥의 광섬유로 최대한 많은 데이터를 보내야 하므로, 서로 다른 파장(색)에 데이터를 실어 동시에 전송하는 DWDM(고밀도 파장분할다중화) 이 기반 기술이다.

기술 원리·설명
DWDM 파장분할다중화로 단일 광섬유에 대용량 전송
OTN 광전송망 표준, 대용량·저지연 백본
코히어런트 광전송 위상·진폭 변조로 400G/800G 장거리 고속 전송
활용 DC 간 데이터 복제, 재해복구(DR), 워크로드 분산, 클러스터 확장

코히어런트 광전송이 중요한 이유는, 단순 광 세기(on/off)만으로 신호를 싣던 방식과 달리 빛의 위상·진폭·편광을 함께 변조해 한 파장에 실을 수 있는 정보량을 크게 늘리기 때문이다. 이를 통해 장거리에서도 파장당 400G·800G급 전송이 가능해지고, 지리적으로 떨어진 DC 사이에서도 대용량 데이터 복제·백업이 현실화된다. 다만 물리적 거리에서 오는 전파 지연은 광속의 한계로 완전히 없앨 수 없으므로, 동기 학습처럼 극저지연이 필수인 구간은 여전히 단일 DC 내부에서 처리하고, DCI는 주로 재해복구·데이터 복제·완화 결합(loosely-coupled) 워크로드 분산에 활용하는 것이 현실적이다.

실제 규모 감각과 적용 사례

구체적 감각을 위해 예를 들면, 수천 GPU 규모의 클러스터는 하나의 초거대 모델을 수 주수 개월에 걸쳐 학습한다. 이때 GPU 간에는 매 스텝 수 GB의 그래디언트가 오가고, 학습 전체로는 수 페타바이트(PB)의 데이터가 반복 순회한다. NVIDIA의 DGX SuperPOD 같은 참조 아키텍처는 수십수백 개의 8-GPU 노드를 InfiniBand 리프-스파인으로 묶고, 병렬 파일시스템과 고밀도 전력·냉각을 표준화해 이러한 규모를 하나의 시스템으로 통합한다. 초거대 언어모델 학습에서 실효 활용률(MFU)을 40% 안팎으로 유지했다는 공개 보고들은, 통신·동기화 손실을 억제하는 인프라 설계가 곧 학습 비용 절감(=GPU 시간 절감)임을 보여 준다.

5. 심화 — 최신 동향과 그린 데이터센터

AI 데이터센터 분야의 최근 동향은 세 축으로 정리된다. 첫째, 전력·냉각의 한계 돌파다. GPU 소비전력이 세대마다 상승하면서 공랭으로는 냉각이 불가능한 밀도(랙당 100kW 이상)에 도달했고, 이에 따라 서버를 냉각액에 담그는 액침냉각(immersion cooling) 과 칩에 직접 냉각판을 붙이는 DLC(Direct Liquid Cooling) 가 표준으로 자리 잡고 있다. 이는 PUE(전력사용효율, 총전력÷IT전력) 개선과 직결된다.

둘째, 메모리 병목 완화다. 모델·데이터가 커지면서 연산보다 메모리 대역·용량이 병목이 되는 경우가 많아, 이기종 장치가 메모리를 일관되게 공유하는 CXL(Compute Express Link), 메모리 내부에서 연산하는 PIM(Processing-in-Memory) 이 주목받는다. 이들은 데이터 이동에 드는 에너지·지연을 줄이려는 시도로, 아직 성숙 단계에 진입하고 있어 실제 도입 효과는 워크로드에 따라 편차가 크다.

셋째, 국가·기업 차원의 대규모 집적이다. AI 데이터센터가 국가 경쟁력의 핵심으로 인식되면서, 자국 데이터·모델을 자국 인프라에서 처리하려는 소버린 AI(주권형 AI) 흐름이 강해지고, 전력 조달을 위해 재생에너지·원전 인접 입지가 전략적으로 검토되고 있다. 구체적 투자 규모·전력량은 사업자·시점마다 크게 달라지므로 단정하기보다 방향성으로 이해하는 것이 적절하다.

6. 고려사항 및 시사점

  • 네트워크 병목이 곧 성능: GPU 활용률(MFU)과 학습 속도는 네트워크가 좌우하므로, 어느 두 노드든 균등한 대역을 갖도록 Fat-Tree(리프-스파인) 같은 논블로킹 토폴로지를 설계하고, 텐서 병렬은 노드 내부, 데이터·파이프라인 병렬은 노드 간에 배치하는 등 병렬화와 물리 토폴로지를 정합시켜야 한다.
  • 전력·탄소 제약이 입지를 결정: 랙 밀도가 높아 PUE 개선과 함께 신재생 전력(RE100)·액침냉각으로 그린 데이터센터를 지향해야 하며, 대규모 전력 조달 가능성 자체가 입지 선정의 최우선 제약으로 작용한다.
  • 가용성·장애 복구 설계: 수천 GPU 규모에서는 특정 노드 장애가 통계적으로 자주 발생하므로, 빈번한 체크포인팅과 빠른 재시작, 낙오자(straggler) 완화가 학습 완주의 핵심이다. 스토리지 병렬성이 여기서 결정적이다.
  • 차세대 기술 대비: 메모리 병목을 완화하는 CXL·PIM, 여러 DC에 걸친 분산학습, 광 기반 스위칭 등 확장을 염두에 두고 확장성 있는 아키텍처를 선택해야 한다.
  • 국가 전략·거버넌스: AI 데이터센터는 소버린 AI의 핵심 인프라로, 데이터 주권·보안·전력 정책과 맞물린 국가 전략 차원의 투자·규제 이슈를 함께 고려해야 한다. 기술사 관점에서는 순수 IT 설계를 넘어 전력·냉각·입지·규제를 아우르는 융합 설계 역량이 요구된다.

참고자료


한 줄 요약: 대규모 AI 데이터센터는 GPU 클러스터를 RDMA·InfiniBand·NVLink로 초저지연 연결 하고 데이터·텐서·파이프라인 병렬로 분산학습하며, DWDM·OTN 기반 DCI와 고밀도 전력·액침냉각으로 초거대 AI를 뒷받침하는 소버린 AI 인프라다.