← 목록으로
하드웨어·반도체
#UALink#AI 가속기#스케일업 패브릭#인터커넥트#AI 데이터센터#인-네트워크 컴퓨팅#칩렛
최종 업데이트 · 2026-10-01

UALink 기반 AI 가속기 스케일업 패브릭

1. 개요

정의: UALink(Ultra Accelerator Link)는 AI·HPC 시스템에서 다수의 가속기 간 메모리 기반 통신을 낮은 지연과 높은 대역폭으로 제공하기 위해 UALink Consortium이 제정한 개방형 스케일업 인터커넥트 표준이다.

대규모 생성형 AI 학습과 추론에서는 GPU·AI 가속기의 연산 성능뿐 아니라 가속기 사이의 데이터 이동 능력이 전체 처리량을 좌우한다. 모델을 여러 장치에 분할하면 활성화 값, 그래디언트, 파라미터와 KV 캐시가 반복적으로 오가므로, 통신이 늦어질수록 고가의 연산 장치가 유휴 상태에 놓인다.

기존 서버 내부의 전용 GPU 링크는 높은 성능을 제공하지만 공급자 종속성 및 시스템 확장 방식의 제약이 있고, 범용 이더넷은 유연하지만 낮은 지연과 메모리 시맨틱을 가진 밀결합 통신을 위해 추가 설계가 필요하다. UALink는 AI 가속기 간 통신을 위한 스케일업 영역을 표준화해, 단일 서버를 넘어 랙 단위 AI 컴퓨팅 팟으로 확장하는 선택지를 제공한다.

여기서 스케일업은 한 노드 또는 인접한 컴퓨팅 팟 안에서 가속기 간 통신 대역폭과 공유 메모리 접근성을 높이는 방식이다. 스케일아웃은 서버·랙을 연결하는 데이터센터 네트워크를 통해 시스템 규모를 넓히는 방식이며, 실제 AI 클러스터는 두 방식을 계층적으로 조합한다.

2025년 4월 공개된 UALink 200G 1.0은 레인당 200Gbit/s 데이터 속도를 기반으로 하며, 4개 레인으로 구성한 포트는 방향별 최대 800Gbit/s를 지원하도록 정의되었다. 규격의 설계 목표는 팟 내 최대 1,024개 가속기 연결이지만, 이는 표준이 정한 확장 목표이지 모든 상용 장비가 동일 규모로 동작한다는 보장은 아니다.

2. 전체 구조와 계층

UALink는 가속기와 스위치를 연결하는 고성능 데이터 패브릭이며, 호스트 CPU는 장치 초기화와 자원 할당, 운영체제 제어, 장치별 드라이버 및 라이브러리 실행을 담당한다. 응용과 집합통신 라이브러리가 통신 작업을 생성하면 가속기 내부의 프로토콜 계층이 메모리 읽기·쓰기·원자 연산 요청을 구성하고, 스위치는 목적지 장치로 전달한다.

flowchart LR
    APP["AI 학습·추론 앱"] --> LIB["통신 라이브러리·런타임"]
    LIB --> HOST["호스트 CPU·OS·드라이버"]
    HOST --> GPU1["가속기 A"]
    HOST --> GPU2["가속기 B"]
    GPU1 --> SW["UALink 스위치 패브릭"]
    GPU2 --> SW
    SW --> GPU3["가속기 C"]
    SW --> GPU4["가속기 D"]
    FM["패브릭 관리·제어"] --> SW
    FM --> GPU1
    FM --> GPU2
    FM --> GPU3
    FM --> GPU4

위 구조에서 데이터 경로는 가속기 사이의 짧고 예측 가능한 전송을 제공하고, 제어 경로는 토폴로지 탐색·자원 배정·오류 관리를 수행한다. 운영 설계에서 두 경로를 논리적으로 구분하면, 관리 작업의 지연이나 장애가 학습 데이터 흐름으로 전파되는 범위를 줄일 수 있다.

UALink 프로토콜 스택은 상위의 UALink Protocol Level Interface(UPLI), Transaction Layer(TL), Data Link Layer(DL), Physical Layer(PL)로 나뉜다. 이 계층 분리는 상위의 메모리 트랜잭션 의미와 하위 전송 매체·신호 방식을 느슨하게 결합해 규격의 진화와 구현 선택을 지원한다.

flowchart TB
    UPLI["프로토콜 계층 UPLI<br/>읽기·쓰기·원자 연산"]
    TL["트랜잭션 계층 TL<br/>요청·응답·크레딧·플릿"]
    DL["데이터 링크 계층 DL<br/>링크 신뢰성·흐름 제어"]
    PL["물리 계층 PL<br/>SerDes·FEC·전기 신호"]
    SWITCH["UALink 스위치<br/>주소 기반 전달"]
    PEER["대상 가속기 메모리"]
    UPLI --> TL --> DL --> PL --> SWITCH --> PL --> DL --> TL --> UPLI --> PEER

UPLI는 가속기와 스위치가 상호 운용할 수 있도록 요청, 읽기 데이터, 쓰기 데이터, 응답을 전달하는 상위 인터페이스이다. 메모리 읽기·쓰기와 원자 연산을 단순한 시맨틱으로 다루므로, GPU 커널과 런타임은 응용의 데이터 교환을 네트워크 메시지 조립만으로 처리하지 않고 직접 메모리 작업으로 표현할 수 있다.

트랜잭션 계층은 요청과 응답의 상관관계, 태그, 크레딧을 처리하고 다수의 미완료 요청을 효율적으로 유지한다. 요청을 적절히 묶고 흐름 제어를 적용함으로써, 송신 장치가 수신 버퍼 여유를 넘겨 혼잡이나 데이터 손실을 일으키는 상황을 방지한다.

데이터 링크 계층은 트랜잭션 플릿을 링크 전송 형식에 맞추고, 링크 수준 오류 검출·복구와 가상 채널 및 신뢰성 제어를 수행한다. 물리 계층은 SerDes와 FEC, 매체 특성에 따른 신호 송수신을 맡으며, 실제 도달거리와 케이블·커넥터·리타이머 설계가 가능한 토폴로지를 제한한다.

3. 통신 모델과 데이터 흐름

UALink의 중심은 가속기 간 메모리 시맨틱이다. 소스 가속기는 목적지 메모리 범위를 등록·매핑한 뒤 주소 변환을 거쳐 읽기 또는 쓰기 요청을 발행하고, 완료 응답을 받아 커널 실행이나 집합 연산의 다음 단계로 진행한다.

sequenceDiagram
    participant A as 송신 가속기
    participant H as 호스트·런타임
    participant S as UALink 스위치
    participant B as 수신 가속기
    H->>A: 메모리 범위 등록·권한 설정
    A->>A: 가상 주소를 원격 주소로 변환
    A->>S: 읽기·쓰기·원자 연산 요청
    S->>B: 목적지 장치로 요청 전달
    B->>B: 주소 검증 및 메모리 작업 수행
    B-->>S: 데이터 또는 완료 응답
    S-->>A: 응답 전달
    A->>H: 런타임에 완료 상태 통지

주소 변환과 권한 관리는 성능 기능만큼 중요한 보안 경계이다. 가속기 메모리의 어떤 영역을 어느 피어에 노출하는지 통제하지 않으면, 잘못된 주소 매핑이 데이터 유출이나 다른 작업의 손상으로 이어질 수 있다.

UALink 1.0은 서로 다른 가속기 간의 일관성을 하드웨어 캐시 일관성만으로 자동 제공하지 않고, 소프트웨어가 동기화와 가시성을 관리하는 구조를 설명한다. 따라서 프로그래밍 모델은 원자 연산·장벽·완료 처리 규칙을 명확히 하고, 애플리케이션이나 프레임워크가 동시 접근 시 데이터 경합을 방지하도록 해야 한다.

가속기 통신에는 작은 제어 메시지와 대용량 텐서 데이터가 함께 존재한다. 작은 메시지는 왕복 지연에 민감하고 대용량 전송은 링크 이용률에 민감하므로, 전송 크기·우선순위·동시 요청 수의 균형이 실제 성능을 좌우한다.

레인당 200Gbit/s는 데이터 속도 기준이며 신호 전송률은 FEC와 계층 인코딩 오버헤드를 감안해 더 높게 설정될 수 있다. UALink 컨소시엄의 1.0 개요 자료는 유효 대역폭 93%를 설계 특성으로 설명하지만, 구현과 트래픽 패턴에 따른 실측 성능이 이 수치와 항상 일치한다고 간주해서는 안 된다.

스위치 패브릭은 가속기 수와 포트 수, 상향 링크 구성에 따라 비차단 또는 오버서브스크립션 구조를 선택한다. 모든 가속기 쌍의 동시 통신을 지원하는 높은 비차단성은 비용·전력·배선 부담을 키우므로, 실제 집합통신 패턴과 장애 대응 요구를 바탕으로 적정 수준을 산정한다.

4. 시스템 설계와 활용 절차

도입은 AI 작업의 병렬화 특성을 분석하는 일에서 출발한다. 텐서 병렬은 레이어 내부에서 잦은 집합 연산을 수행하므로 낮은 지연이 중요하고, 데이터 병렬은 그래디언트 교환량과 동기화 지점이 핵심이며, MoE 모델은 전문가 간 토큰 라우팅으로 불규칙한 통신을 유발할 수 있다.

그 다음 가속기 수, 장치당 링크 포트 수, 스위치 계층, 호스트 연결 방식, 케이블 길이, 랙 전력·냉각 용량을 종합해 토폴로지를 구성한다. 특히 규격의 최대 연결 수를 그대로 운영 목표로 삼지 말고, 장애 격리 범위·운영 복잡도·워크로드 배치와 예비 용량을 함께 고려한다.

호스트와 패브릭 관리 소프트웨어는 장치 발견, 토폴로지 구성, 메모리 영역의 접근 제어, 가속기 배정과 회수를 순서대로 수행한다. 프로비저닝 과정은 고장난 링크나 불일치하는 펌웨어를 조기에 탐지해야 하며, 상태가 불완전한 장치는 워크로드에 할당하지 않는 안전한 기본 정책을 가져야 한다.

운영 중에는 링크 오류, 재전송, 크레딧 고갈, 큐 지연, 포트별 송수신량, 장치 온도와 전력 상태를 지속적으로 수집한다. 처리량 저하를 스위치 혼잡, 케이블 열화, GPU 커널 동기화, 잘못된 배치 중 어느 원인으로 설명할지 구분하려면 패브릭 지표와 AI 프레임워크 지표의 시간축을 맞춰야 한다.

이력 데이터로 통신량과 오류율을 기준선화하면, 학습 작업의 성능 변동과 하드웨어 열화를 조기에 연결할 수 있다. 링크 장애 시에는 우회·재구성·작업 체크포인트 복구 정책을 마련하고, 장애가 복구된 이후에도 데이터 정합성과 보안 권한이 재검증되도록 한다.

5. 유사 기술 비교

구분 주된 역할 강점 설계상 유의점
UALink 가속기 간 스케일업 메모리 패브릭 공개 표준 기반, 고대역폭·저지연 메모리 시맨틱 생태계 성숙도·상호운용 검증 필요
NVLink/NVSwitch NVIDIA 가속기 중심의 전용 연결 해당 플랫폼에서 높은 통합도와 성능 특정 공급자 플랫폼 종속성
CXL CPU·장치의 캐시 일관 메모리 확장·풀링 메모리 확장·공유를 위한 표준화 가속기 집합통신 전용 패브릭과 목적이 다름
Ethernet/RoCE 서버 간 스케일아웃 데이터센터 네트워크 범용 장비·운영 도구·장거리 연결 생태계 혼잡 제어와 메모리 시맨틱 구현을 별도로 설계

이 비교는 기술 간 우열을 단정하는 표가 아니라 적용 범위가 다름을 보여준다. 예를 들어 UALink와 CXL은 모두 메모리 접근과 관련되지만, UALink는 AI 가속기 간 고속 스케일업 통신에 초점을 두고 CXL은 CPU와 장치 메모리 확장 및 풀링에 더 넓은 목적을 둔다.

NVLink는 이미 공급자 통합 플랫폼을 구축한 조직에서 성능과 운영 단순성을 제공할 수 있다. 반면 멀티벤더 구성과 장기적인 조달 선택권을 중시하는 조직은 개방형 표준의 장점과 함께, 실제 호환 제품과 소프트웨어 지원 수준을 엄격히 검증해야 한다.

Ethernet/RoCE는 더 큰 지리적 범위와 기존 네트워크 운영 모델에 적합하지만, 스케일업 패브릭과 동일한 지연 특성·주소 모델·신뢰성 보장을 자동으로 제공하지 않는다. 따라서 계층형 AI 인프라에서는 랙 내부 집합통신에 UALink류 패브릭을, 랙 간 작업 분산에는 Ethernet 또는 InfiniBand를 쓰는 식으로 역할을 분리할 수 있다.

6. 적용 사례: 대규모 언어모델 학습 팟

가상의 사업자가 256개 가속기로 대규모 언어모델을 학습한다고 가정한다. 텐서 병렬 그룹을 동일한 저지연 스케일업 영역에 배치하고, 데이터 병렬 그룹은 랙 간 네트워크로 연결하면 통신 집약 작업을 짧은 경로에 두면서 전체 학습 규모를 확장할 수 있다.

시스템 설계자는 학습 프레임워크의 all-reduce·all-gather·reduce-scatter 패턴을 재현해 링크별 부하를 측정한다. 이때 최고 대역폭뿐 아니라 집합통신 지연, GPU 이용률, 미완료 요청 수, 장애 발생 시 재시작 시간을 함께 측정해야 병목의 원인을 찾을 수 있다.

예를 들어 한 스위치 하위의 특정 포트가 상향 대역폭을 공유해 포화되면, 평균 링크 이용률이 낮더라도 특정 토폴로지에서 핫스폿이 생길 수 있다. 집합통신 그룹을 스위치 경계에 맞게 배치하거나 병렬 그룹 크기를 조정하고, 필요한 경우 상향 링크를 확장해 성능과 비용의 균형을 찾는다.

추론 단계에서는 여러 GPU가 하나의 모델을 분할해 처리할 수 있고, 사용자 요청이 섞이면 통신 부하도 불균일해진다. 운영자는 지연시간 목표와 처리량 목표를 구분하고, 프리필·디코드 단계의 트래픽과 KV 캐시 전송이 간섭하는지 관측해야 한다.

이 사례는 256개 장치를 연결할 수 있다는 특정 제품의 보증이 아니라, UALink 스펙을 활용한 설계 사고를 설명하는 가상 예시이다. 실제 구축 전에는 호환 가능한 장치·스위치·관리 소프트웨어, 시스템 인증 범위와 워크로드별 벤치마크를 공급자와 함께 확인해야 한다.

7. 심화: UALink 2.0 및 표준 진화

UALink Consortium은 2026년 4월 Common Specification 2.0, 200G Data Link and Physical Layers 2.0, Manageability 1.0, Chiplet Specification 1.0을 발표했다. 이 릴리스는 AI 팟의 통신 성능뿐 아니라 인-네트워크 컴퓨팅, 관리 체계, 반도체 칩렛 통합까지 스펙트럼을 확장한다.

Common 2.0은 가속기 사이 통신과 결합되는 인-네트워크 컴퓨팅을 도입해, 통신과 함께 수행할 수 있는 계산을 패브릭에 가까운 곳으로 이동하는 방향을 제시한다. 이는 이동 데이터량과 왕복 시간을 줄일 가능성이 있지만, 연산 의미·지원 연산·오류 처리·프로그래밍 모델이 실제 제품과 툴체인에서 검증되어야 효과를 얻는다.

200G DL/PL 2.0을 공통 규격과 분리한 것은 물리 인터페이스 발전을 상위 프로토콜 변경과 독립적으로 추진하려는 구조다. 규격 분리는 진화 속도를 높일 수 있지만, 상·하위 규격 버전 조합과 상호운용 프로파일을 관리하지 않으면 구현 간 호환성 복잡도가 오히려 커질 수 있다.

Chiplet 규격은 UCIe 3.0과 호환되도록 UALink 기술을 칩렛 기반 SoC에 통합하는 인터페이스·폼팩터·흐름 제어·칩렛 관리 정보를 다룬다. Manageability 1.0은 중앙 제어·관리 평면을 제공하며, gNMI·YANG·SAI·Redfish 같은 표준 인터페이스를 활용하는 방향을 제시한다.

컨소시엄이 공개한 규격 웹페이지에는 128G DL/PL 1.0, 200G DL/PL 2.0, Chiplet 1.01 등 추가 문서가 함께 제시되어 있으므로, 실무 설계자는 릴리스 기사뿐 아니라 최신 규격 페이지에서 정확한 판본을 확인해야 한다. 2026년 9월 컨소시엄은 UALink 3.0 범위 협의가 진행 중이라고 밝히고 400G 데이터 속도, 광 인터커넥트, 종단 간 복원력, 강화된 관리 기능을 검토 항목으로 제시했다.

위 항목은 차기 규격의 확정 요구사항이 아니라 작업 방향과 검토 주제이다. 시험 답안이나 도입 제안서에서는 이미 발표된 2.0 계열 기능과 향후 연구·로드맵을 구분해 기술해야 한다.

8. 고려사항 및 시사점

첫째, 개방형 규격은 자동적인 멀티벤더 호환을 의미하지 않는다. 가속기, 스위치, 리타이머, 펌웨어, 드라이버와 통신 라이브러리의 버전 조합을 시험하고, 상호운용성·적합성 프로그램 및 장애 시 책임 분담을 구매 계약에 반영한다.

둘째, 메모리 시맨틱은 강력하지만 주소 매핑과 원격 접근 권한을 잘못 설정할 경우 영향 범위가 크다. 최소 권한, 작업별 메모리 영역 격리, 장치 인증, 감사 가능한 프로비저닝, 키·펌웨어 수명주기 관리와 안전한 초기화 절차를 설계한다.

셋째, 대역폭 수치만으로 TCO를 판단해서는 안 된다. 스위치·케이블·광 또는 전기 인터페이스·전력·냉각·운영 인력 비용을 더하고, 유휴 메모리 감소와 학습 시간 단축, 장애 복구 비용 절감의 편익을 같은 기간과 기준으로 비교한다.

넷째, 확장성 목표와 실운영 안정성 사이의 균형이 필요하다. 대규모 단일 팟은 자원 공유를 높일 수 있지만 장애 도메인을 키울 수 있으므로, 팟 분할·예비 장치·우회 경로·체크포인트 복구를 포함한 가용성 목표를 세운다.

다섯째, 성능 검증은 마이크로벤치마크에서 실제 모델까지 단계화한다. 대역폭과 지연시간 측정 후 집합통신·MoE 라우팅·혼합 워크로드를 시험하고, p95/p99 지연, GPU 유휴율, 재전송률, 링크별 핫스폿을 함께 분석한다.

여섯째, 운영 가시성과 자동화는 패브릭 규모가 커질수록 핵심 역량이 된다. 관리 평면에서 토폴로지·장치 인벤토리·구성 변경·오류 이벤트를 표준 모델로 수집하고, 관측·알림·롤백을 IaC와 변경 승인 절차에 결합한다.

일곱째, 기술사는 표준 선택만이 아니라 공급망·인력·전환 전략까지 책임져야 한다. 기존 GPU 전용 패브릭을 한 번에 교체하기보다 파일럿에서 워크로드 적합성과 멀티벤더 생태계 성숙도를 검증하고, 상호운용이 입증된 구간부터 점진적으로 확장하는 것이 현실적이다.

UALink는 AI 가속기 스케일업의 개방형 연결 계층을 지향하지만, 성공 여부는 규격의 성능 수치보다 표준 적합 구현, 소프트웨어 생태계, 운영 자동화와 실측 TCO에 달려 있다. 따라서 기술사는 데이터 이동 병목을 먼저 계량화한 뒤 UALink와 스케일아웃 네트워크, CXL, 공급자 전용 링크를 계층적으로 조합해야 한다.

참고자료


한 줄 요약: UALink는 AI 가속기 간 메모리 시맨틱 기반의 개방형 스케일업 패브릭으로, 도입 성과는 표준 기능과 실제 멀티벤더 구현·소프트웨어·운영 역량을 함께 검증할 때 실현된다.