← Về danh sách
Phần cứng & Bán dẫn
#UALink#AI 가속기#스케일업 패브릭#인터커넥트#AI 데이터센터#인-네트워크 컴퓨팅#칩렛
Cập nhật lần cuối · 2026-10-01

Fabric scale-up bộ tăng tốc AI dựa trên UALink

1. Tổng quan

Định nghĩa: UALink (Ultra Accelerator Link) là tiêu chuẩn liên kết scale-up mở do UALink Consortium phát triển, nhằm cung cấp giao tiếp dựa trên bộ nhớ có độ trễ thấp và băng thông cao giữa các bộ tăng tốc trong hệ thống AI và HPC.

Trong huấn luyện và suy luận AI tạo sinh quy mô lớn, khả năng di chuyển dữ liệu giữa GPU và bộ tăng tốc AI có thể quyết định thông lượng tổng thể ngang với năng lực tính toán. Khi một mô hình được phân vùng trên nhiều thiết bị, activation, gradient, tham số và KV cache phải di chuyển liên tục; giao tiếp chậm khiến các tài nguyên tính toán đắt tiền ở trạng thái nhàn rỗi.

Liên kết GPU chuyên dụng bên trong máy chủ có thể đem lại hiệu năng cao, nhưng có thể gây phụ thuộc nhà cung cấp và hạn chế lựa chọn mở rộng hệ thống. Ethernet đa dụng linh hoạt, nhưng cần thiết kế bổ sung cho giao tiếp gắn kết chặt chẽ, độ trễ thấp và có ngữ nghĩa bộ nhớ.

UALink chuẩn hóa miền scale-up dành cho giao tiếp giữa các bộ tăng tốc AI, cung cấp lựa chọn mở rộng vượt ra ngoài một máy chủ để hình thành các pod điện toán AI ở quy mô rack. Ở đây, scale-up có nghĩa là tăng băng thông giữa các bộ tăng tốc và khả năng truy cập bộ nhớ dùng chung trong một node hoặc pod điện toán lân cận.

Scale-out mở rộng quy mô hệ thống bằng mạng trung tâm dữ liệu kết nối máy chủ và rack; các cụm AI thực tế kết hợp phân cấp hai phương thức này. UALink 200G 1.0 được công bố vào tháng 4 năm 2025, quy định tốc độ dữ liệu 200 Gbit/s mỗi lane và tối đa 800 Gbit/s theo từng hướng đối với một cổng bốn lane.

Mục tiêu thiết kế của đặc tả là kết nối tối đa 1.024 bộ tăng tốc trong một pod, nhưng đây là mục tiêu mở rộng do tiêu chuẩn xác định chứ không phải cam kết rằng mọi thiết bị thương mại đều vận hành ở quy mô đó.

2. Kiến trúc tổng thể và các lớp

UALink là fabric dữ liệu hiệu năng cao nối bộ tăng tốc với switch, trong khi CPU máy chủ phụ trách khởi tạo thiết bị, phân bổ tài nguyên, điều khiển hệ điều hành, trình điều khiển và thư viện thiết bị. Khi ứng dụng hoặc thư viện truyền thông tập thể tạo thao tác truyền, lớp giao thức trong bộ tăng tốc tạo yêu cầu đọc, ghi hoặc nguyên tử trên bộ nhớ, còn switch chuyển tiếp đến thiết bị đích.

flowchart LR
    APP["Ứng dụng huấn luyện và suy luận AI"] --> LIB["Thư viện truyền thông và runtime"]
    LIB --> HOST["CPU máy chủ, OS và driver"]
    HOST --> GPU1["Bộ tăng tốc A"]
    HOST --> GPU2["Bộ tăng tốc B"]
    GPU1 --> SW["Fabric switch UALink"]
    GPU2 --> SW
    SW --> GPU3["Bộ tăng tốc C"]
    SW --> GPU4["Bộ tăng tốc D"]
    FM["Quản lý và điều khiển fabric"] --> SW
    FM --> GPU1
    FM --> GPU2
    FM --> GPU3
    FM --> GPU4

Trong cấu trúc này, đường dữ liệu hỗ trợ truyền ngắn và có thể dự đoán giữa các bộ tăng tốc; đường điều khiển thực hiện khám phá topology, phân bổ tài nguyên và quản lý lỗi. Tách biệt logic hai đường trong vận hành giúp hạn chế phạm vi mà độ trễ hoặc lỗi của tác vụ quản lý lan sang luồng dữ liệu huấn luyện.

Ngăn xếp giao thức UALink gồm giao diện UALink Protocol Level Interface (UPLI), Transaction Layer (TL), Data Link Layer (DL) và Physical Layer (PL). Việc tách lớp làm lỏng liên kết giữa ngữ nghĩa giao dịch bộ nhớ ở lớp trên với môi trường truyền dẫn và tín hiệu ở lớp dưới, hỗ trợ tiến hóa đặc tả và lựa chọn triển khai.

flowchart TB
    UPLI["Lớp giao thức UPLI<br/>Đọc, ghi và thao tác nguyên tử"]
    TL["Lớp giao dịch TL<br/>Yêu cầu, phản hồi, credit, flit"]
    DL["Lớp liên kết dữ liệu DL<br/>Độ tin cậy liên kết và điều khiển luồng"]
    PL["Lớp vật lý PL<br/>SerDes, FEC và tín hiệu điện"]
    SWITCH["Switch UALink<br/>Chuyển tiếp theo địa chỉ"]
    PEER["Bộ nhớ của bộ tăng tốc đích"]
    UPLI --> TL --> DL --> PL --> SWITCH --> PL --> DL --> TL --> UPLI --> PEER

UPLI là giao diện cấp cao để bộ tăng tốc và switch trao đổi yêu cầu, dữ liệu đọc, dữ liệu ghi và phản hồi. Nó biểu diễn thao tác đọc, ghi và nguyên tử bộ nhớ bằng ngữ nghĩa đơn giản, giúp kernel GPU và runtime mô tả trao đổi dữ liệu ứng dụng dưới dạng thao tác bộ nhớ trực tiếp thay vì chỉ ghép thông điệp mạng.

Lớp giao dịch xử lý tương quan yêu cầu-phản hồi, tag và credit, đồng thời duy trì hiệu quả nhiều yêu cầu đang chờ. Ghép yêu cầu phù hợp và áp dụng điều khiển luồng ngăn bộ gửi vượt quá bộ đệm nhận khả dụng, gây tắc nghẽn hoặc mất dữ liệu.

Lớp liên kết dữ liệu ánh xạ flit giao dịch sang định dạng truyền dẫn của liên kết, đồng thời phát hiện và phục hồi lỗi ở cấp liên kết, vận hành kênh ảo và kiểm soát độ tin cậy. Lớp vật lý xử lý SerDes, FEC và truyền nhận tín hiệu theo đặc tính môi trường; tầm với thực tế cùng thiết kế cáp, đầu nối và retimer giới hạn các topology khả thi.

3. Mô hình truyền thông và luồng dữ liệu

Ngữ nghĩa bộ nhớ giữa các bộ tăng tốc là trọng tâm của UALink. Sau khi đăng ký và ánh xạ vùng bộ nhớ đích, bộ tăng tốc nguồn phát yêu cầu đọc hoặc ghi sau khi chuyển đổi địa chỉ, nhận phản hồi hoàn tất rồi tiếp tục bước tiếp theo của kernel hoặc phép toán tập thể.

sequenceDiagram
    participant A as Bộ tăng tốc nguồn
    participant H as Máy chủ và runtime
    participant S as Switch UALink
    participant B as Bộ tăng tốc đích
    H->>A: Đăng ký vùng nhớ và đặt quyền
    A->>A: Chuyển địa chỉ ảo sang địa chỉ từ xa
    A->>S: Yêu cầu đọc, ghi hoặc nguyên tử
    S->>B: Chuyển yêu cầu tới thiết bị đích
    B->>B: Kiểm tra địa chỉ và thực hiện thao tác bộ nhớ
    B-->>S: Dữ liệu hoặc phản hồi hoàn tất
    S-->>A: Chuyển tiếp phản hồi
    A->>H: Báo trạng thái hoàn tất cho runtime

Chuyển đổi địa chỉ và kiểm soát quyền truy cập là ranh giới bảo mật quan trọng ngang với các tính năng hiệu năng. Nếu không kiểm soát vùng bộ nhớ nào được mở cho từng peer, ánh xạ địa chỉ sai có thể làm rò rỉ dữ liệu hoặc phá hỏng công việc khác.

UALink 1.0 mô tả tính nhất quán giữa các bộ tăng tốc theo mô hình phần mềm quản lý đồng bộ hóa và khả năng nhìn thấy dữ liệu, thay vì tự động cung cấp tính nhất quán cache bằng phần cứng. Do đó, mô hình lập trình phải quy định rõ thao tác nguyên tử, barrier và quy tắc hoàn tất; ứng dụng hoặc framework phải ngăn tranh chấp dữ liệu khi truy cập đồng thời.

Giao tiếp giữa các bộ tăng tốc gồm thông điệp điều khiển nhỏ và truyền tensor dung lượng lớn. Thông điệp nhỏ nhạy với độ trễ khứ hồi, trong khi truyền dung lượng lớn nhạy với mức sử dụng liên kết; cân bằng kích thước truyền, mức ưu tiên và số yêu cầu đồng thời quyết định hiệu năng thực tế.

Con số 200 Gbit/s mỗi lane là tốc độ dữ liệu; tốc độ tín hiệu có thể cao hơn để tính đến FEC và overhead mã hóa. Tài liệu tổng quan UALink 1.0 của Consortium mô tả băng thông hiệu dụng 93% là đặc tính thiết kế, nhưng không nên giả định hiệu năng đo được luôn đạt con số đó ở mọi cách triển khai và mẫu lưu lượng.

Fabric switch chọn cấu trúc non-blocking hoặc oversubscription dựa trên số bộ tăng tốc, số cổng và cấu hình uplink. Năng lực non-blocking cao để hỗ trợ giao tiếp đồng thời giữa mọi cặp bộ tăng tốc làm tăng chi phí, điện năng và yêu cầu đi cáp, vì vậy mức phù hợp cần dựa trên mẫu truyền thông tập thể và yêu cầu chịu lỗi thực tế.

4. Thiết kế hệ thống và quy trình vận hành

Triển khai bắt đầu từ phân tích đặc tính song song hóa của workload AI. Tensor parallelism thực hiện phép toán tập thể thường xuyên bên trong các layer nên cần độ trễ thấp; data parallelism phụ thuộc lượng trao đổi gradient và điểm đồng bộ; mô hình MoE có thể tạo lưu lượng bất quy tắc khi định tuyến token giữa các chuyên gia.

Bước tiếp theo là thiết kế topology dựa trên số bộ tăng tốc, số cổng liên kết mỗi thiết bị, tầng switch, cách kết nối máy chủ, chiều dài cáp và công suất điện/làm mát của rack. Không nên biến số endpoint tối đa của đặc tả thành mục tiêu vận hành mà không xem xét phạm vi cô lập lỗi, độ phức tạp vận hành, bố trí workload và dung lượng dự phòng.

Phần mềm quản lý máy chủ và fabric lần lượt thực hiện khám phá thiết bị, cấu hình topology, kiểm soát truy cập vùng bộ nhớ, phân bổ và thu hồi bộ tăng tốc. Quy trình cấp phát phải phát hiện sớm liên kết hỏng hoặc firmware không đồng nhất, và có chính sách mặc định an toàn không gán thiết bị chưa hoàn chỉnh cho workload.

Trong vận hành, liên tục thu thập lỗi liên kết, truyền lại, cạn credit, độ trễ hàng đợi, lưu lượng từng cổng, nhiệt độ thiết bị và trạng thái điện năng. Để phân biệt thông lượng thấp do nghẽn switch, suy giảm cáp, đồng bộ kernel GPU hay bố trí không phù hợp, cần căn chỉnh trục thời gian của chỉ số fabric với chỉ số framework AI.

Tạo đường cơ sở từ dữ liệu lịch sử về lưu lượng và tỷ lệ lỗi giúp liên hệ sớm biến động hiệu năng huấn luyện với suy giảm phần cứng. Chuẩn bị chính sách chuyển hướng, cấu hình lại và phục hồi checkpoint khi liên kết lỗi; sau phục hồi vẫn phải xác minh lại tính toàn vẹn dữ liệu và quyền bảo mật.

5. So sánh với công nghệ liên quan

Công nghệ Vai trò chính Thế mạnh Điểm cần lưu ý
UALink Fabric bộ nhớ scale-up giữa các bộ tăng tốc Nền tảng tiêu chuẩn mở, ngữ nghĩa bộ nhớ băng thông cao và độ trễ thấp Cần xác minh độ trưởng thành hệ sinh thái và khả năng tương tác
NVLink/NVSwitch Liên kết chuyên dụng tập trung vào bộ tăng tốc NVIDIA Tích hợp và hiệu năng cao trong nền tảng đó Phụ thuộc nền tảng của nhà cung cấp cụ thể
CXL Mở rộng và pooling bộ nhớ nhất quán cache cho CPU và thiết bị Chuẩn hóa mở rộng và chia sẻ bộ nhớ Mục đích khác fabric chuyên cho truyền thông tập thể của bộ tăng tốc
Ethernet/RoCE Mạng trung tâm dữ liệu scale-out giữa máy chủ Thiết bị đa dụng, công cụ vận hành và hệ sinh thái kết nối xa Phải thiết kế riêng kiểm soát tắc nghẽn và ngữ nghĩa bộ nhớ

Bảng này không khẳng định công nghệ nào vượt trội trong mọi trường hợp, mà thể hiện sự khác biệt về phạm vi áp dụng. Ví dụ, UALink và CXL đều liên quan đến truy cập bộ nhớ, nhưng UALink tập trung giao tiếp scale-up tốc độ cao giữa các bộ tăng tốc AI, còn CXL có mục tiêu rộng hơn về mở rộng và pooling bộ nhớ giữa CPU và thiết bị.

NVLink có thể đem lại hiệu năng và vận hành đơn giản cho tổ chức đã xây dựng nền tảng tích hợp của nhà cung cấp. Tổ chức coi trọng cấu hình đa nhà cung cấp và lựa chọn mua sắm dài hạn có thể hưởng lợi từ tiêu chuẩn mở, nhưng cần xác minh nghiêm ngặt sản phẩm tương thích và mức hỗ trợ phần mềm thực tế.

Ethernet/RoCE phù hợp phạm vi địa lý rộng hơn và mô hình vận hành mạng hiện hữu, nhưng không tự động có cùng đặc tính độ trễ, mô hình địa chỉ hay bảo đảm độ tin cậy của fabric scale-up. Vì vậy, hạ tầng AI phân cấp có thể dùng fabric kiểu UALink cho truyền thông tập thể trong rack và Ethernet hoặc InfiniBand để phân phối workload giữa các rack.

6. Trường hợp áp dụng: Pod huấn luyện mô hình ngôn ngữ lớn

Giả sử một đơn vị vận hành huấn luyện mô hình ngôn ngữ lớn bằng 256 bộ tăng tốc. Đặt nhóm tensor parallel trong cùng miền scale-up độ trễ thấp, còn nhóm data parallel kết nối qua mạng liên rack, giúp giữ tác vụ nặng giao tiếp trên đường truyền ngắn trong khi mở rộng quy mô huấn luyện tổng thể.

Kiến trúc sư hệ thống tái tạo các mẫu all-reduce, all-gather và reduce-scatter của framework huấn luyện để đo tải trên từng liên kết. Ngoài băng thông cực đại, cần đo độ trễ truyền thông tập thể, mức sử dụng GPU, số yêu cầu chưa hoàn thành và thời gian phục hồi khi lỗi để xác định nguyên nhân nghẽn.

Ví dụ, nếu nhiều cổng phía sau một switch dùng chung băng thông uplink và gây bão hòa, một topology cụ thể có thể hình thành điểm nóng ngay cả khi mức sử dụng liên kết trung bình thấp. Sắp xếp nhóm truyền thông tập thể theo ranh giới switch, điều chỉnh quy mô nhóm song song và mở rộng uplink khi cần để cân bằng hiệu năng với chi phí.

Trong giai đoạn suy luận, nhiều GPU có thể chia một mô hình; các yêu cầu người dùng hỗn hợp cũng làm lưu lượng không đồng đều. Người vận hành cần tách mục tiêu độ trễ khỏi mục tiêu thông lượng và quan sát lưu lượng ở giai đoạn prefill, decode có xung đột với truyền KV cache hay không.

Đây là ví dụ giả định để giải thích tư duy thiết kế bằng đặc tả UALink, không phải cam kết rằng một sản phẩm cụ thể hỗ trợ kết nối 256 thiết bị. Trước khi triển khai, cần cùng nhà cung cấp xác nhận thiết bị, switch và phần mềm quản lý tương thích, phạm vi chứng nhận và benchmark theo workload.

7. Chuyên sâu: UALink 2.0 và sự phát triển của tiêu chuẩn

Tháng 4 năm 2026, UALink Consortium công bố Common Specification 2.0, 200G Data Link and Physical Layers 2.0, Manageability 1.0 và Chiplet Specification 1.0. Bản phát hành mở rộng phạm vi từ hiệu năng giao tiếp pod AI sang tính toán trong mạng, quản lý và tích hợp chiplet bán dẫn.

Common 2.0 đưa vào tính toán trong mạng gắn với giao tiếp giữa các bộ tăng tốc, định hướng đưa một số phép tính có thể thực hiện đồng thời với truyền thông đến gần fabric hơn. Điều này có thể giảm lượng dữ liệu di chuyển và số vòng khứ hồi, nhưng chỉ đem lại lợi ích khi ngữ nghĩa tính toán, phép toán hỗ trợ, xử lý lỗi và mô hình lập trình được kiểm chứng trong sản phẩm và chuỗi công cụ thực tế.

Tách 200G DL/PL 2.0 khỏi đặc tả chung cho phép giao diện vật lý phát triển độc lập với thay đổi của giao thức lớp trên. Việc tách có thể tăng tốc tiến hóa, nhưng cũng có thể làm phức tạp khả năng tương thích giữa các triển khai nếu không quản lý tổ hợp phiên bản lớp trên/dưới và hồ sơ tương tác.

Đặc tả Chiplet đề cập giao diện, dạng thức, điều khiển luồng và quản lý chiplet để tích hợp công nghệ UALink vào SoC dựa trên chiplet, tương thích với UCIe 3.0. Manageability 1.0 đưa vào mặt phẳng điều khiển và quản lý tập trung, đồng thời hướng đến các giao diện chuẩn như gNMI, YANG, SAI và Redfish.

Trang đặc tả công khai của Consortium cũng liệt kê tài liệu bổ sung, gồm 128G DL/PL 1.0, 200G DL/PL 2.0 và Chiplet 1.01; kiến trúc sư thực tế cần kiểm tra phiên bản chính xác trên trang hiện hành thay vì chỉ dựa vào thông cáo phát hành. Tháng 9 năm 2026, Consortium cho biết đang xác định phạm vi UALink 3.0 và nêu tốc độ dữ liệu 400G, liên kết quang, khả năng phục hồi đầu cuối và quản lý phong phú hơn là các nội dung đang xem xét.

Đây là hướng công việc và chủ đề đang cân nhắc, không phải yêu cầu đã được chốt cho đặc tả kế tiếp. Đáp án thi và đề xuất triển khai phải phân biệt tính năng thuộc họ 2.0 đã công bố với nghiên cứu và lộ trình trong tương lai.

8. Lưu ý và hàm ý

Thứ nhất, tiêu chuẩn mở không tự động bảo đảm khả năng tương tác đa nhà cung cấp. Thử nghiệm các tổ hợp phiên bản giữa bộ tăng tốc, switch, retimer, firmware, driver và thư viện truyền thông; đưa chương trình tương tác, tuân thủ và trách nhiệm khi lỗi vào hợp đồng mua sắm.

Thứ hai, ngữ nghĩa bộ nhớ rất mạnh nhưng cấu hình sai ánh xạ địa chỉ và quyền truy cập từ xa có thể gây ảnh hưởng rộng. Thiết kế quyền tối thiểu, cách ly vùng nhớ theo workload, xác thực thiết bị, cấp phát có thể kiểm toán, quản lý vòng đời khóa/firmware và quy trình khởi tạo an toàn.

Thứ ba, không đánh giá tổng chi phí sở hữu chỉ từ số liệu băng thông. Tính cả switch, cáp, giao diện quang hoặc điện, điện năng, làm mát và nhân sự vận hành; so sánh lợi ích giảm bộ nhớ nhàn rỗi, rút ngắn thời gian huấn luyện và giảm chi phí phục hồi trên cùng kỳ hạn và cơ sở đo.

Thứ tư, cần cân bằng mục tiêu mở rộng với ổn định sản xuất. Một pod đơn quy mô lớn có thể tăng chia sẻ tài nguyên nhưng cũng làm rộng miền lỗi; vì vậy cần đặt mục tiêu sẵn sàng gồm phân chia pod, thiết bị dự phòng, đường chuyển hướng và phục hồi checkpoint.

Thứ năm, xác minh hiệu năng theo từng giai đoạn từ microbenchmark đến mô hình thực. Sau khi đo băng thông và độ trễ, thử nghiệm truyền thông tập thể, định tuyến MoE và workload hỗn hợp; cùng phân tích độ trễ p95/p99, thời gian GPU nhàn rỗi, tỷ lệ truyền lại và điểm nóng từng liên kết.

Thứ sáu, khả năng quan sát và tự động hóa vận hành trở thành năng lực cốt lõi khi quy mô fabric tăng. Thu thập topology, kiểm kê thiết bị, thay đổi cấu hình và sự kiện lỗi bằng mô hình chuẩn trong mặt phẳng quản lý; kết hợp quan sát, cảnh báo và rollback với IaC và quy trình phê duyệt thay đổi.

Thứ bảy, Kỹ sư chuyên nghiệp chịu trách nhiệm không chỉ về lựa chọn tiêu chuẩn mà còn về chuỗi cung ứng, nhân lực và chiến lược chuyển đổi. Thay vì thay thế ngay fabric GPU độc quyền hiện có, hãy kiểm chứng mức phù hợp workload và độ trưởng thành của hệ sinh thái đa nhà cung cấp qua pilot, rồi mở rộng từng bước từ khu vực đã chứng minh khả năng tương tác.

UALink hướng tới lớp kết nối mở cho scale-up bộ tăng tốc AI, nhưng thành công phụ thuộc vào triển khai đúng chuẩn, hệ sinh thái phần mềm, tự động hóa vận hành và TCO đo được hơn là con số hiệu năng của đặc tả. Do đó, Kỹ sư chuyên nghiệp cần định lượng điểm nghẽn di chuyển dữ liệu trước, sau đó kết hợp UALink theo phân cấp với mạng scale-out, CXL và liên kết riêng của nhà cung cấp.

Tài liệu tham khảo


Tóm tắt một câu: UALink là fabric scale-up mở cung cấp ngữ nghĩa bộ nhớ giữa các bộ tăng tốc AI; lợi ích chỉ hiện thực khi cùng xác minh tính năng tiêu chuẩn, triển khai đa nhà cung cấp thực tế, phần mềm và năng lực vận hành.