← Về danh sách
Hạ tầng & Đám mây
#AI데이터센터#저지연#InfiniBand#RDMA#DCI#분산학습#134회
Cập nhật lần cuối · 2026-09-29

Công nghệ xây dựng trung tâm dữ liệu cho dịch vụ AI quy mô lớn

1. Tổng quan

A. Định nghĩa

Trung tâm dữ liệu chuyên biệt cho AI, phục vụ huấn luyện và suy luận của AI siêu lớn (LLM), kết nối hàng nghìn đến hàng chục nghìn GPU/bộ tăng tốc bằng mạng độ trễ siêu thấp, băng thông cao và được trang bị nguồn điện, làm mát mật độ cao — thường còn được gọi là AI Factory.

Nếu trung tâm dữ liệu truyền thống (IDC) được thiết kế để chứa nhiều tải công việc độc lập như web, DB và máy ảo, thì trung tâm dữ liệu AI được thiết kế để hàng nghìn bộ tăng tốc phối hợp thực hiện một công việc khổng lồ duy nhất (huấn luyện mô hình) — một khác biệt căn bản. Khác biệt này chi phối mọi quyết định thiết kế về mạng, điện và làm mát. Nói cách khác, trung tâm dữ liệu AI không phải "nơi tập hợp nhiều máy chủ" mà là "nơi khiến hàng chục nghìn bộ tăng tốc hoạt động như một máy tính siêu lớn duy nhất", và vì vậy nên hiểu nó như một hệ thống gần với siêu máy tính hay AI Factory.

B. Bối cảnh ra đời và tính cần thiết

Khi tham số và dữ liệu huấn luyện của LLM bùng nổ, không chỉ một GPU đơn lẻ mà cả một máy chủ đơn lẻ cũng không còn chứa nổi một mô hình. Một mô hình với hàng chục tỷ đến hàng nghìn tỷ tham số đòi hỏi hàng trăm GB đến vài TB bộ nhớ, trong khi một GPU mới nhất chỉ có vài chục đến vài trăm GB. Do đó hàng nghìn GPU phải chia nhau huấn luyện (huấn luyện phân tán) một mô hình, và vì các GPU trao đổi gradient (vài GB đến vài chục GB) ở mỗi bước huấn luyện, nên tốc độ giao tiếp giữa các GPU quyết định tốc độ huấn luyện tổng thể.

Nghĩa là bài toán cốt lõi của trung tâm dữ liệu AI không phải năng lực tính toán thuần (FLOPS) mà là "nút thắt giao tiếp và điện/nhiệt". GPU dù nhanh đến đâu, nếu giao tiếp chậm thì GPU ngồi không chờ dữ liệu, và khi đó hiệu suất sử dụng thực tế (MFU, Model FLOPs Utilization) tụt mạnh. Trong huấn luyện quy mô lớn thực tế, việc nâng MFU lên mức 30–50% tự thân đã là mục tiêu kỹ thuật — tổn thất giao tiếp/đồng bộ lớn đến vậy. Hơn nữa, khi một GPU mới nhất tiêu thụ trên 700W, công suất điện mỗi rack vượt vài chục đến hơn 100kW, nên IDC thông thường (5–10kW mỗi rack) không thể kham nổi điện và nhiệt. Vì những lý do đó, một hạ tầng chuyên dụng thiết kế tính toán, mạng, lưu trữ và điện/làm mát cho huấn luyện AI ngay từ đầu đã trở thành yêu cầu riêng.

2. Cấu trúc tổng thể và các yêu cầu cốt lõi

Trung tâm dữ liệu AI phải cân bằng bốn yếu tố tính toán, mạng, lưu trữ và điện/làm mát; nếu bất kỳ yếu tố nào là nút thắt thì các GPU đắt đỏ sẽ ngồi không. Tổng quan cấu trúc tổng thể như sau.

flowchart TB
  subgraph FABRIC["Fabric tính toán"]
    G1["Nút GPU #1 (8-GPU/NVLink)"]
    G2["Nút GPU #2"]
    G3["Nút GPU #N"]
    SW["Switch leaf-spine (InfiniBand/RoCE)"]
    G1 --- SW
    G2 --- SW
    G3 --- SW
  end
  subgraph STORE["Lưu trữ"]
    PFS["Hệ thống tệp song song (Lustre/GPFS)"]
  end
  subgraph FAC["Cơ sở hạ tầng"]
    PWR["Điện mật độ cao (vài chục kW mỗi rack)"]
    COOL["Làm mát ngâm/chất lỏng"]
  end
  SW --- PFS
  FABRIC --- PWR
  FABRIC --- COOL

Đặc biệt mạng mang tính quyết định, vì trong huấn luyện phân tán, thời gian GPU chờ giao tiếp càng dài thì hiệu suất sử dụng các đơn vị tính toán càng tụt mạnh. Mạng lại chia thành hai lớp — trong nút (NVLink) và giữa các nút (InfiniBand/RoCE) — và cả hai lớp đều phải không mất gói và độ trễ siêu thấp thì cả cụm mới hoạt động như một máy.

Yêu cầu Nội dung
Tính toán Cụm GPU/NPU/TPU, tích hợp mật độ cao
Mạng Độ trễ siêu thấp, không mất gói — giao tiếp quyết định hiệu năng huấn luyện
Lưu trữ Hệ thống tệp song song dung lượng lớn, tốc độ cao (checkpoint)
Điện/làm mát Vài chục kW mỗi rack, làm mát ngâm/chất lỏng

Cũng cần chỉ ra vì sao lưu trữ quan trọng. Trong huấn luyện quy mô lớn, để hỗ trợ khôi phục sự cố và tái lập, toàn bộ trạng thái mô hình được lưu định kỳ (checkpoint), và một checkpoint của mô hình siêu lớn đạt hàng trăm GB đến vài TB. Để hàng nghìn GPU đồng thời lưu và khôi phục điều này cần băng thông tổng hợp hàng trăm GB đến vài TB mỗi giây, nên một hệ thống tệp song song như Lustre hay GPFS (IBM Storage Scale) là thiết yếu. Nếu nút thắt phát sinh ở đây, huấn luyện dừng ở mỗi khoảng lưu và hiệu suất sử dụng GPU giảm.

So sánh IDC truyền thống và trung tâm dữ liệu AI

Tóm tắt hai loại trung tâm dữ liệu khác nhau ra sao làm lộ rõ vì sao yêu cầu thiết kế của trung tâm dữ liệu AI là đặc biệt. Gốc rễ của khác biệt nằm ở mức độ kết dính (coupling) của tải công việc. Tải công việc của IDC truyền thống độc lập với nhau nên dù một máy chủ chậm thì tác động tới các công việc khác vẫn nhỏ; nhưng huấn luyện AI đồng bộ hàng nghìn GPU phối hợp, nên cái chậm nhất làm trễ toàn bộ. Khác biệt về kết dính này chia tách toàn bộ chiến lược mạng, điện và vận hành.

Phân loại IDC truyền thống Trung tâm dữ liệu AI
Tải công việc Nhiều tải độc lập(web/DB/VM) Một công việc khổng lồ(huấn luyện phân tán)
Mức kết dính Lỏng Rất chặt(giao tiếp đồng bộ)
Mật độ điện mỗi rack 5–10kW Vài chục đến 100kW+
Mạng Ethernet thường(chấp nhận mất gói) Không mất gói, độ trễ siêu thấp(IB/RoCE)
Làm mát Chủ yếu bằng không khí Ngâm/chất lỏng(DLC)
Chỉ số hiệu năng Tính sẵn sàng/thông lượng Hiệu suất GPU(MFU)/thời gian huấn luyện

Hàm ý thực tiễn mà bảng này gợi ra là: tiếp cận trung tâm dữ liệu AI như "phiên bản gắn thêm GPU" của IDC hiện có chắc chắn sẽ thất bại. Điện, làm mát, mạng và lưu trữ phải được thiết kế lại từ đầu để khớp với tải công việc huấn luyện, và điều này gần với phương pháp luận thiết kế siêu máy tính.

3. Công nghệ độ trễ thấp và mở rộng quy mô (A)

Tối ưu hóa lớp giao tiếp

Giao tiếp giữa các GPU được tối ưu ở hai lớp. Trong một nút, khoảng tám GPU được kết nối trực tiếp bằng một liên kết chuyên dụng nhanh hơn nhiều so với PCIe (vài chục GB/s) — NVLink cỡ hàng trăm GB/s — và giữa các nút dùng một mạng độ trễ siêu thấp đi vòng qua CPU. Khi dữ liệu đi qua bộ nhớ CPU, độ trễ tăng do sao chép và chuyển ngữ cảnh, nên nguyên lý cốt lõi là RDMA (Remote Direct Memory Access) truy cập trực tiếp bộ nhớ của nút từ xa mà không cần CPU can thiệp. Triển khai RDMA trên Ethernet là RoCE (RDMA over Converged Ethernet), còn triển khai bằng fabric chuyên dụng là InfiniBand.

Công nghệ Nguyên lý/mô tả
RDMA (RoCE) Độ trễ thấp nhờ truyền bộ nhớ trực tiếp không cần CPU can thiệp
InfiniBand Kết nối không mất gói, độ trễ siêu thấp (chuẩn HPC)
NVLink/NVSwitch Kết nối trực tiếp băng thông siêu cao giữa các GPU trong một nút
GPUDirect GPU giao tiếp trực tiếp với mạng/lưu trữ
Giao tiếp tập thể (NCCL) Tối ưu các mẫu giao tiếp huấn luyện phân tán như All-Reduce

Ở đây cần hiểu vì sao "không mất gói (lossless)" quan trọng. Ethernet thông thường bỏ gói khi tắc nghẽn và dựa vào truyền lại, nhưng trong giao tiếp tập thể (collective) của huấn luyện phân tán, chỉ cần một GPU chậm thì toàn bộ quá trình đồng bộ bị trễ (bài toán kẻ tụt hậu, straggler). Do đó cần một fabric không mất gói ngăn chính việc mất gói bằng kiểm soát luồng (PFC) và kiểm soát tắc nghẽn. Chính đặc tính không mất gói, độ trễ siêu thấp này là lý do InfiniBand trở thành chuẩn trong HPC, và gần đây có xu hướng mạnh nhằm đạt hiệu năng tương tự trên nền Ethernet bằng cách xếp chồng kiểm soát tắc nghẽn tinh vi lên RoCEv2.

Lựa chọn giữa InfiniBand và RoCE là một đánh đổi thường gặp trong thực tế. InfiniBand bảo đảm không mất gói, độ trễ siêu thấp ở mức phần cứng bằng switch và adapter chuyên dụng, nhưng phụ thuộc nhà cung cấp và chi phí cao. Ngược lại, RoCE tận dụng thiết bị Ethernet phổ dụng, có lợi về chi phí và sự quen thuộc trong vận hành, nhưng nếu không tinh chỉnh cẩn thận kiểm soát tắc nghẽn như PFC, ECN cho tính không mất gói thì hiệu năng chao đảo ở quy mô lớn. Nghĩa là nếu ưu tiên "hiệu năng cao nhất và độ ổn định đã kiểm chứng" thì InfiniBand hợp lý; nếu ưu tiên "chi phí và tận dụng tài sản vận hành Ethernet sẵn có" thì RoCE hợp lý — và gần đây trong các cụm rất lớn, phe Ethernet đã tăng cường kiểm soát tắc nghẽn chuyên dụng để thu hẹp khoảng cách giữa hai phe.

Ngoài ra, thư viện giao tiếp tập thể NCCL tối ưu các mẫu giao tiếp như All-Reduce, All-Gather theo tô-pô (vòng/cây), và GPUDirect RDMA cho phép card mạng truy cập trực tiếp bộ nhớ GPU, loại bỏ đường vòng qua CPU và bộ nhớ hệ thống. Lớp phần mềm này là mắt xích cuối cùng chuyển băng thông phần cứng thành hiệu năng huấn luyện thực tế.

Chiến lược song song hóa huấn luyện phân tán

Huấn luyện phân tán kết hợp ba kiểu song song hóa (song song 3D) tùy theo cách chia mô hình và dữ liệu. Mỗi kiểu giải một bài toán khác nhau và có mẫu giao tiếp, khối lượng giao tiếp khác nhau. Dưới đây là sơ đồ kiến trúc chi tiết cho thấy song song 3D ánh xạ lên tô-pô vật lý ra sao.

flowchart TB
  subgraph DP["Song song dữ liệu (giữa các nút, All-Reduce định kỳ)"]
    subgraph PP1["Nhóm pipeline A"]
      direction LR
      N1["Nút1 (song song tensor: 8 GPU/NVLink)"] -->|"truyền activation"| N2["Nút2 (song song tensor)"]
    end
    subgraph PP2["Nhóm pipeline B (bản sao)"]
      direction LR
      N3["Nút3 (song song tensor)"] -->|"truyền activation"| N4["Nút4 (song song tensor)"]
    end
  end
  PP1 <-->|"All-Reduce gradient (InfiniBand)"| PP2
Song song hóa Nguyên lý Bài toán giải quyết
Song song dữ liệu Chia lô, mỗi GPU xử lý rồi All-Reduce gradient Tăng tốc độ huấn luyện
Song song mô hình/tensor Chia lớp/phép nhân ma trận cho các GPU Mô hình vượt bộ nhớ GPU
Song song pipeline Xử lý các lớp theo từng chặng dạng pipeline Bộ nhớ/hiệu quả của mô hình sâu

Trong sơ đồ này, song song tensor được đặt trong một nút gắn bằng NVLink, song song pipeline giữa các nút (truyền activation), và song song dữ liệu giữa các nhóm bản sao (All-Reduce gradient). Đặt lên liên kết nhanh hơn theo thứ tự cường độ giao tiếp cao hơn là nguyên lý cốt lõi của việc mở rộng quy mô.

Khác biệt về đặc tính giao tiếp của ba kiểu song song hóa chi phối quyết định bố trí. Song song tensor chia phép nhân ma trận của một lớp, nên giao tiếp giữa các GPU tăng vọt ở mỗi phép toán. Do đó nó luôn được đặt trong cùng một nút kết nối trực tiếp bằng NVLink. Song song pipeline chỉ truyền activation tại ranh giới chặng, nên khối lượng giao tiếp nhỏ và có thể đặt giữa các nút. Song song dữ liệu All-Reduce gradient ở cuối một bước, nên giao tiếp lớn nhưng định kỳ, và được xếp lên trên để mở rộng quy mô tổng thể.

Ví dụ, một mô hình cỡ GPT chia một lớp cho 8 GPU trong một nút bằng song song tensor, đặt các bó lớp lên nhiều nút bằng song song pipeline, và xếp song song dữ liệu lên trên để chạy hàng nghìn GPU đồng thời. Khi đó khối lượng giao tiếp giữa các nút là khổng lồ, nên không có InfiniBand và NVLink thì hiệu quả mở rộng (scaling) sụp đổ nhanh chóng. Kết hợp điều này với các tối ưu bộ nhớ như ZeRO, vốn phân tán lưu trạng thái optimizer, càng làm dịu giới hạn bộ nhớ.

4. Công nghệ DCI (Data Center Interconnect) (B)

Công nghệ kết nối các trung tâm dữ liệu phân tán về mặt địa lý bằng truyền quang tốc độ siêu cao, độ trễ thấp để hiện thực hóa mở rộng dung lượng, khôi phục sau thảm họa và phân tán tải.

Một trung tâm dữ liệu đơn lẻ có giới hạn vật lý về điện, không gian và làm mát, nên nảy sinh trường hợp một khu vực không kham nổi công suất điện cỡ hàng trăm MW. Khi đó cần DCI, vốn gộp nhiều DC thành một bể tài nguyên duy nhất. Vì phải gửi càng nhiều dữ liệu càng tốt trên một sợi cáp quang, nên DWDM (ghép kênh phân chia theo bước sóng mật độ cao), vốn tải dữ liệu lên các bước sóng (màu) khác nhau và truyền đồng thời, là công nghệ nền tảng.

Công nghệ Nguyên lý/mô tả
DWDM Truyền dung lượng lớn trên một sợi quang bằng ghép kênh phân chia theo bước sóng
OTN Chuẩn mạng truyền tải quang, xương sống dung lượng lớn, độ trễ thấp
Truyền quang coherent Truyền tốc độ cao đường dài 400G/800G bằng điều chế pha/biên độ
Ứng dụng Sao chép dữ liệu giữa các DC, khôi phục thảm họa (DR), phân tán tải, mở rộng cụm

Truyền quang coherent quan trọng vì, khác với cách cũ tải tín hiệu chỉ bằng cường độ ánh sáng (bật/tắt), nó điều chế đồng thời pha, biên độ và phân cực của ánh sáng để tăng mạnh lượng thông tin có thể mang trên một bước sóng. Nhờ đó, truyền cỡ 400G/800G mỗi bước sóng khả thi ngay cả trên khoảng cách dài, và việc sao chép/sao lưu dữ liệu dung lượng lớn giữa các DC cách xa về địa lý trở nên hiện thực. Tuy nhiên, độ trễ lan truyền đến từ khoảng cách vật lý không thể loại bỏ hoàn toàn do giới hạn tốc độ ánh sáng, nên các phân đoạn đòi hỏi độ trễ cực thấp như huấn luyện đồng bộ vẫn được xử lý bên trong một DC duy nhất, và thực tế nên dùng DCI chủ yếu cho khôi phục thảm họa, sao chép dữ liệu và phân tán tải kết dính lỏng (loosely-coupled).

5. Chuyên sâu — Xu hướng mới nhất và trung tâm dữ liệu xanh

Xu hướng gần đây trong lĩnh vực trung tâm dữ liệu AI có thể tổ chức theo ba trục. Thứ nhất, phá vỡ giới hạn điện/làm mát. Khi mức tiêu thụ điện của GPU tăng theo mỗi thế hệ, đã đạt tới mật độ mà làm mát bằng không khí không kham nổi (trên 100kW mỗi rack), và theo đó làm mát ngâm (immersion cooling) nhúng máy chủ vào chất làm mát cùng DLC (Direct Liquid Cooling) gắn tấm làm mát trực tiếp lên chip đang trở thành chuẩn. Điều này gắn trực tiếp với việc cải thiện PUE (hiệu quả sử dụng điện, tổng điện ÷ điện IT).

Thứ hai, làm dịu nút thắt bộ nhớ. Khi mô hình và dữ liệu lớn lên, băng thông/dung lượng bộ nhớ thay vì tính toán thường trở thành nút thắt, nên CXL (Compute Express Link), cho phép các thiết bị dị chủng chia sẻ bộ nhớ một cách nhất quán, và PIM (Processing-in-Memory), tính toán bên trong bộ nhớ, được chú ý. Đây là các nỗ lực giảm năng lượng và độ trễ dành cho di chuyển dữ liệu, và vì mới đang bước vào giai đoạn trưởng thành, hiệu quả áp dụng thực tế khác nhau nhiều theo tải công việc.

Thứ ba, tích hợp quy mô lớn ở cấp quốc gia/doanh nghiệp. Khi trung tâm dữ liệu AI được nhìn nhận là cốt lõi của năng lực cạnh tranh quốc gia, xu hướng AI chủ quyền (sovereign AI) xử lý dữ liệu và mô hình của mình trên hạ tầng của mình ngày càng mạnh, và để bảo đảm nguồn điện, việc chọn địa điểm gần năng lượng tái tạo hay điện hạt nhân đang được xem xét mang tính chiến lược. Vì quy mô đầu tư và lượng điện cụ thể khác nhau nhiều theo nhà vận hành và thời điểm, nên hiểu chúng như các định hướng hơn là khẳng định.

Cảm nhận về quy mô thực tế và ví dụ áp dụng

Để có cảm nhận cụ thể, một cụm cỡ hàng nghìn GPU huấn luyện một mô hình siêu lớn trong vài tuần đến vài tháng. Trong đó, vài GB gradient qua lại giữa các GPU ở mỗi bước, và toàn bộ quá trình huấn luyện luân chuyển lặp lại nhiều petabyte (PB) dữ liệu. Một kiến trúc tham chiếu như DGX SuperPOD của NVIDIA gộp hàng chục đến hàng trăm nút 8-GPU bằng leaf-spine InfiniBand, và chuẩn hóa hệ thống tệp song song cùng điện/làm mát mật độ cao để tích hợp quy mô này thành một hệ thống duy nhất. Các báo cáo công khai rằng MFU được duy trì quanh mức 40% trong huấn luyện mô hình ngôn ngữ siêu lớn cho thấy thiết kế hạ tầng kìm hãm tổn thất giao tiếp/đồng bộ chính là việc giảm chi phí huấn luyện (tức giảm giờ GPU).

6. Điểm cần cân nhắc và hàm ý

  • Nút thắt mạng chính là hiệu năng: Vì hiệu suất GPU (MFU) và tốc độ huấn luyện do mạng chi phối, hãy thiết kế một tô-pô phi tắc nghẽn như Fat-Tree (leaf-spine) để bất kỳ hai nút nào cũng có băng thông ngang nhau, và khớp song song hóa với tô-pô vật lý — đặt song song tensor trong một nút, song song dữ liệu/pipeline giữa các nút.
  • Ràng buộc điện/carbon quyết định địa điểm: Vì mật độ rack cao, cần hướng tới trung tâm dữ liệu xanh với cải thiện PUE cùng điện tái tạo (RE100) và làm mát ngâm, và chính khả năng bảo đảm nguồn điện quy mô lớn đóng vai trò ràng buộc hàng đầu trong việc chọn địa điểm.
  • Thiết kế tính sẵn sàng/khôi phục sự cố: Ở quy mô hàng nghìn GPU, sự cố của một nút cụ thể xảy ra thường xuyên về mặt thống kê, nên checkpointing thường xuyên, khởi động lại nhanh và giảm thiểu kẻ tụt hậu (straggler) là mấu chốt để hoàn thành huấn luyện. Tính song song của lưu trữ có tính quyết định ở đây.
  • Chuẩn bị cho công nghệ thế hệ mới: Hãy chọn một kiến trúc có khả năng mở rộng với tầm nhìn mở rộng, bao gồm CXL/PIM làm dịu nút thắt bộ nhớ, huấn luyện phân tán qua nhiều DC, và chuyển mạch dựa trên quang.
  • Chiến lược quốc gia/quản trị: Trung tâm dữ liệu AI là hạ tầng cốt lõi cho AI chủ quyền, nên phải xét cùng lúc các vấn đề đầu tư và quy định ở cấp chiến lược quốc gia đan xen với chủ quyền dữ liệu, an ninh và chính sách năng lượng. Dưới góc nhìn Kỹ sư chuyên nghiệp, cần năng lực thiết kế hội tụ xuyên suốt điện, làm mát, địa điểm và quy định, vượt ra ngoài thiết kế IT thuần túy.

Tài liệu tham khảo


Tóm tắt một câu: Trung tâm dữ liệu AI quy mô lớn kết nối cụm GPU với độ trễ siêu thấp qua RDMA, InfiniBand và NVLink, huấn luyện phân tán bằng song song dữ liệu/tensor/pipeline, và nâng đỡ AI siêu lớn bằng DCI dựa trên DWDM/OTN cùng điện mật độ cao/làm mát ngâm như một hạ tầng AI chủ quyền.