← Về danh sách
AI & Dữ liệu
#멀티GPU#분산학습#데이터병렬#모델병렬#NCCL#딥러닝#134회
Cập nhật lần cuối · 2026-07-05

Công nghệ đa GPU (huấn luyện mạng nơ-ron quy mô lớn)

1. Tổng quan

A. Định nghĩa

Công nghệ phân tán tính toán và dữ liệu lên nhiều GPU để huấn luyện song song mạng nơ-ron quy mô lớn, là kỹ thuật cốt lõi của huấn luyện phân tán (Distributed Training) nhằm vượt qua giới hạn bộ nhớ·tính toán của một GPU đơn lẻ.

Có hai lý do căn bản cần đa GPU. Một là mô hình không vừa bộ nhớ của một GPU (ví dụ: LLM với hàng chục tỷ~hàng trăm tỷ tham số), hai là một mình thì huấn luyện mất quá nhiều thời gian. Vấn đề thứ nhất được tiếp cận bằng cách chia nhỏ mô hình (song song mô hình·tensor), vấn đề thứ hai bằng cách chia nhỏ dữ liệu để nhiều GPU cùng xử lý (song song dữ liệu), và huấn luyện quy mô lớn thực tế giải quyết bằng cách kết hợp chúng.

B. Ưu điểm và bối cảnh

Khi các mô hình siêu lớn như GPT·LLaMA xuất hiện, việc huấn luyện bằng một GPU đơn lẻ trở nên bất khả thi, và đó là bối cảnh đa GPU trở thành bắt buộc. Lợi ích của song song hóa không chỉ là nhanh hơn. Có thể gộp bộ nhớ của nhiều GPU để chứa mô hình lớn vượt quá một GPU, mở rộng ngang (scale-out) thông lượng bằng cách thêm GPU, và huấn luyện với batch lớn để ổn định hội tụ. Tuy nhiên gắn N GPU không làm tốc độ tăng N lần, vì chi phí truyền thông (communication overhead) sẽ thấy ở phần sau. Giảm được tổn thất này bao nhiêu chính là hiệu suất mở rộng (scaling efficiency).

Ưu điểm Nội dung
Tốc độ huấn luyện Rút ngắn thời gian huấn luyện nhờ tính toán song song
Mô hình quy mô lớn Gộp bộ nhớ nhiều GPU để huấn luyện mô hình vượt quá một GPU
Khả năng mở rộng Mở rộng ngang thông lượng bằng cách thêm GPU
Batch dung lượng lớn Ổn định hội tụ với batch lớn

2. Phương thức song song hóa

flowchart TB
  P[Song song hóa đa GPU] --> D[Song song dữ liệu]
  P --> M[Song song mô hình]
  P --> PP[Song song pipeline]
  P --> T[Song song tensor]

Các phương thức song song hóa được phân biệt theo "chia nhỏ cái gì". Song song dữ liệu (Data Parallelism) sao chép mô hình lên mọi GPU, chỉ chia batch (dữ liệu) để xử lý, rồi lấy trung bình gradient mỗi GPU tính được bằng AllReduce để đồng bộ. Dễ hiện thực nên được dùng rộng rãi nhất, nhưng có tiền đề là mô hình phải vừa một GPU. Khi tiền đề này bị phá vỡ, dùng song song mô hình (Model Parallelism) chia nhỏ chính mô hình đặt lên nhiều GPU. Song song mô hình lại được chia thành hai: song song pipeline chia các lớp thành giai đoạn (stage) và cho chảy qua như băng chuyền (tuy nhiên phát sinh 'bong bóng' - khoảng nhàn rỗi do giai đoạn sau chỉ bắt đầu khi giai đoạn trước xong), còn song song tensor để nhiều GPU chia nhỏ và tính đồng thời chính một phép toán ma trận lớn. Song song tensor truyền thông thường xuyên ở giữa mỗi phép tính nên băng thông giữa các GPU phải rất lớn, do đó thường dùng trong một node (NVLink).

Phương thức Chia nhỏ cái gì Giải thích
Song song dữ liệu Batch (dữ liệu) Sao chép mô hình, chia batch rồi đồng bộ gradient bằng AllReduce
Song song mô hình Mô hình (tham số) Chia mô hình lớn lên nhiều GPU
Song song pipeline Lớp (chiều sâu) Chia lớp thành giai đoạn để xử lý pipeline (có bong bóng)
Song song tensor Phép toán riêng lẻ (ma trận) Chia một phép toán ma trận giữa các GPU, truyền thông thường xuyên

3. Các điểm cần xem xét khi xây dựng môi trường

Điều quyết định thành bại của môi trường đa GPU rốt cuộc là giảm truyền thông được bao nhiêu và tiết kiệm bộ nhớ được bao nhiêu. Số GPU càng tăng thì lượng truyền thông đồng bộ gradient càng lớn và trở thành nút thắt, nên giữa các GPU dùng NVLink, giữa các node dùng kết nối siêu tốc như InfiniBand·RoCE cùng thư viện truyền thông NCCL để giảm độ trễ. Ngoài ra, song song dữ liệu lãng phí bộ nhớ vì sao chép mô hình lên mỗi GPU; giải pháp lưu phân tán trạng thái optimizer·gradient·tham số trên các GPU là ZeRO. Thêm vào đó, độ chính xác hỗn hợp (AMP) dùng 16 bit thay cho 32 bit, gradient checkpointing bỏ giá trị trung gian của lan truyền xuôi rồi tính lại giúp tiết kiệm thêm bộ nhớ. Batch lớn làm huấn luyện kém ổn định, nên tăng learning rate theo kích thước batch (scaling) và áp dụng warm-up tăng dần ở giai đoạn đầu, đồng thời cân nhắc lựa chọn giữa SGD đồng bộ (chính xác nhưng bị GPU chậm kéo lùi) và SGD bất đồng bộ (nhanh nhưng kém chính xác).

Điểm cần xem xét Nội dung
Chi phí truyền thông Nút thắt đồng bộ gradient → giảm nhẹ bằng NVLink·NCCL·InfiniBand
Cân bằng tải Cân bằng tính toán·bộ nhớ giữa các GPU (giảm thiểu bong bóng pipeline)
Batch·learning rate Scaling learning rate·warm-up khi batch lớn
Quản lý bộ nhớ ZeRO·độ chính xác hỗn hợp (AMP)·gradient checkpointing
Cách đồng bộ SGD đồng bộ (chính xác·chậm) vs bất đồng bộ (nhanh·kém chính xác)
Điện năng·làm mát·chi phí Quản lý nhiệt·điện của GPU mật độ cao, chi phí hạ tầng

4. Công nghệ·framework liên quan

Phần lớn các song song hóa·tối ưu hóa này đã được trừu tượng hóa bằng các framework trưởng thành nên ít cần tự hiện thực. DDP của PyTorch cung cấp song song dữ liệu, FSDP và DeepSpeed (ZeRO) của Microsoft cung cấp đến cả phân tán bộ nhớ, Megatron-LM của NVIDIA cung cấp song song tensor·pipeline. Bên dưới, truyền thông tập thể giữa các GPU do NCCL đảm nhận, còn tầng phần cứng do NVLink/NVSwitch và InfiniBand·RoCE đảm nhận.

Phân loại Ví dụ
Thư viện truyền thông NCCL, MPI
Framework phân tán PyTorch DDP/FSDP, DeepSpeed (ZeRO), Megatron-LM
Kết nối (interconnect) NVLink/NVSwitch, InfiniBand, RoCE

5. Các điểm cần xem xét và hàm ý (góc độ Kỹ sư chuyên nghiệp)

  • Tối ưu truyền thông là then chốt của hiệu suất mở rộng: dù tăng GPU, nếu nút thắt truyền thông lớn thì mở rộng tuyến tính sụp đổ. Kết nối·chồng lấp truyền thông (overlap tính toán với truyền thông) quyết định hiệu suất scaling.
  • Kết hợp song song 3D: mô hình siêu lớn được huấn luyện bằng song song 3D dùng đồng thời song song dữ liệu+pipeline+tensor, và tối ưu bố trí trong node/giữa các node theo đặc tính truyền thông của từng loại song song. Ví dụ, song song tensor truyền thông thường xuyên được đặt trong node gắn kết bằng NVLink, còn song song dữ liệu ít truyền thông được đặt giữa các node.
  • Đánh đổi chi phí·điện năng: cụm GPU mật độ cao có chi phí điện·làm mát lớn, nên thiết kế giảm chi phí trên mỗi đơn vị hiệu năng mục tiêu bằng độ chính xác hỗn hợp·kết hợp song song hiệu quả là quan trọng.
  • Mở rộng sang trung tâm dữ liệu AI: cụm GPU quy mô lớn kết hợp HBM·mạng siêu tốc đang trở thành hạ tầng cốt lõi của thời đại mô hình nền tảng (foundation model), và tối ưu hóa đồng thời phần mềm (framework) với phần cứng (kết nối) quyết định năng lực cạnh tranh.

Tóm tắt một câu: Đa GPU huấn luyện phân tán mạng nơ-ron quy mô lớn tùy theo chia nhỏ cái gì bằng song song dữ liệu·mô hình·pipeline·tensor, và để tổn thất ít khi tăng GPU thì tối ưu chi phí truyền thông·bộ nhớ (ZeRO/AMP)·đồng bộ cùng hạ tầng như NCCL·DDP·InfiniBand quyết định hiệu năng.