DPU (Data Processing Unit) và SmartNIC
1. Tổng quan
A. Định nghĩa
DPU (Data Processing Unit) là một bộ xử lý khả lập trình lấy việc di chuyển dữ liệu làm trung tâm, tiếp nhận và xử lý trên phần cứng chuyên dụng phần xử lý hạ tầng (Infrastructure Processing) như mạng, lưu trữ, bảo mật, ảo hóa mà trước đây CPU của máy chủ đảm nhiệm. Đây là hình thái phát triển của SmartNIC, vốn bổ sung năng lực tính toán khả lập trình cho NIC (Network Interface Card) truyền thống, và thường được gọi là "trụ cột thứ ba của điện toán trung tâm dữ liệu sau CPU và GPU."
Định nghĩa DPU trong một câu, đó là "con chip chịu trách nhiệm không phải cho kết quả tính toán mà cho việc di chuyển dữ liệu và phần xử lý phụ trợ gắn với việc di chuyển đó." Trong khi CPU đảm nhiệm điều khiển đa dụng và logic tuần tự, còn GPU/NPU đảm nhiệm tính toán song song quy mô lớn, thì DPU trực tiếp thực thi toàn bộ đường dữ liệu (Data Path) — mã hóa/giải mã, áp dụng luật tường lửa, chuyển mạch ảo, chuyển đổi giao thức lưu trữ — từ lúc gói tin đi vào NIC cho đến khi tới bộ nhớ ứng dụng, mà không đi qua CPU. Nói cách khác, DPU là bộ xử lý chuyên biệt theo miền, đặc hóa không phải cho "tính cái gì" mà cho "di chuyển dữ liệu an toàn và nhanh chóng như thế nào."
Về mặt thuật ngữ, tùy nhà cung cấp mà DPU (NVIDIA), IPU (Infrastructure Processing Unit, Intel), và rộng hơn là SmartNIC được dùng lẫn lộn, nhưng bản chất mà chúng chỉ đến là như nhau. Đó là khái niệm "chuyển gánh nặng hạ tầng mà CPU máy chủ từng gánh sang một bộ xử lý chuyên dụng đặt tại điểm nút mà dữ liệu đi qua," và bài viết này gọi chung chúng là DPU. Khác biệt về tên gọi chỉ là khác biệt về marketing và trọng tâm kiến trúc; định hướng offload, tăng tốc và cô lập là chung cho tất cả.
SmartNIC và DPU nằm trên đường liên tục về mặt phả hệ nhưng khác nhau về độ trưởng thành. Nếu SmartNIC thời kỳ đầu chỉ dừng ở việc tăng tốc các offload cụ thể (ví dụ: TCP checksum, đóng gói VXLAN) bằng mạch cố định, thì DPU có nhân CPU đa dụng (chủ yếu là Arm), bộ tăng tốc chuyên dụng, bộ nhớ và hệ điều hành riêng, gần như một máy chủ nhỏ chạy độc lập với máy chủ chính (host). Chính tính độc lập này biến DPU từ một linh kiện tăng tốc đơn thuần thành một điểm kiểm soát mới cho bảo mật và vận hành.
B. Bối cảnh xuất hiện và sự cần thiết
Bối cảnh căn bản khiến DPU nổi lên là sự gia tăng đột biến của chi phí hạ tầng được gọi là "Thuế trung tâm dữ liệu (Datacenter Tax)." Trong môi trường đám mây và vi dịch vụ, một phần đáng kể nhân CPU bị tiêu tốn cho việc xử lý hạ tầng như chuyển mạch ảo, mạng phủ (VXLAN/Geneve), mã hóa, ảo hóa lưu trữ vốn hỗ trợ lưu lượng ứng dụng chứ không phải bản thân lưu lượng đó. Nhiều nghiên cứu và tài liệu của nhà cung cấp báo cáo rằng hơn 20–30% chu kỳ CPU của trung tâm dữ liệu được dùng cho xử lý hạ tầng như vậy, điều này có nghĩa là tài nguyên tính toán có thể bán cho khách hàng bị giảm đi bấy nhiêu. Từ góc nhìn của nhà cung cấp đám mây, việc thu khoản "thuế" này bằng chip chuyên dụng cho phép bán nhiều vCPU hơn trên cùng phần cứng, dẫn thẳng đến cải thiện lợi nhuận.
Thứ hai là sự bùng nổ băng thông mạng. Khi giao diện máy chủ tăng từ 25GbE lên 100/200/400GbE, việc CPU đa dụng xử lý bằng phần mềm hàng chục triệu gói tin mỗi giây đã chạm giới hạn vật lý. Để xử lý ở tốc độ đường truyền (line rate) các gói nhỏ 64 byte trên đường 400GbE, phải xử lý khoảng 600 triệu gói mỗi giây, điều khó kham nổi với ngân sách xử lý CPU vài chục đến vài trăm nano giây cho mỗi gói. Không có mạch chuyên dụng cho di chuyển dữ liệu, phần mềm không còn theo kịp mức tăng băng thông.
Thứ ba là yêu cầu về Zero Trust và cô lập bảo mật. Trong môi trường đa người thuê (multi-tenant) dày đặc máy ảo và container, để kiểm soát tinh vi lưu lượng Đông-Tây (East-West) và phân tách vật lý ranh giới tin cậy giữa các người thuê, cần một điểm kiểm soát độc lập với CPU máy chủ. DPU có thể cưỡng chế tường lửa, mã hóa, chính sách từ bên ngoài host ngay cả khi hệ điều hành host bị xâm phạm, trở thành nền tảng của kiến trúc bảo mật tách mặt phẳng điều khiển hạ tầng khỏi môi trường thực thi ứng dụng. Khi ba áp lực này chồng lên nhau, xu hướng "tách hạ tầng khỏi CPU sang chip chuyên dụng" đã trở thành thiết kế chuẩn của trung tâm dữ liệu.
C. Đặc trưng
Bản chất của DPU được tóm gọn trong nguyên tắc gọi là "3A (hay O-A-I)": ① Offload (chuyển tải) xử lý hạ tầng, ② Accelerate (tăng tốc) đường dữ liệu, ③ Isolate (cô lập) điều khiển hạ tầng. Giải phóng CPU nhờ offload, xử lý đường dữ liệu ở tốc độ đường truyền bằng bộ tăng tốc chuyên dụng, và cưỡng chế bảo mật cùng chính sách trong miền thực thi tách khỏi host — ba trục này khớp vào nhau để hoàn thiện giá trị của DPU.
Ba đặc trưng này không độc lập. Để offload (①) thành lập, tăng tốc đường dữ liệu (②) phải bảo đảm tốc độ đường truyền, và vì việc xử lý đó diễn ra trong miền độc lập ngoài host nên cô lập (③) tự nhiên đi kèm. Ngược lại, nếu tải công việc có tỷ trọng xử lý hạ tầng thấp và thuần túy tập trung vào tính toán, thì ba lợi ích này đồng thời mờ nhạt đi. Do đó, tính hợp lý của việc áp dụng DPU tỷ lệ thuận với "thuế hạ tầng trong môi trường đó lớn đến đâu."
Một đặc trưng bản chất khác là DPU có tính "khả lập trình (Programmable)." Khác với các NIC offload trong quá khứ chỉ cung cấp chức năng cố định, DPU có thể tái định nghĩa chức năng như phần mềm, nên có thể triển khai các giao thức phủ mới, chính sách bảo mật, logic thu thập telemetry mà không cần thay phần cứng. Nhờ tính khả lập trình này, nhà cung cấp đám mây hấp thụ các yêu cầu biến đổi nhanh mà không cần thu hồi card, và DPU trở thành điểm thực thi của hạ tầng định nghĩa bằng phần mềm liên tục tiến hóa, chứ không phải một linh kiện.
2. Cấu trúc kiến trúc và nguyên lý hoạt động
Hiệu năng và sự cô lập của DPU đến từ cấu trúc kết hợp nhân đa dụng, bộ tăng tốc chuyên dụng và liên kết tốc độ cao trên một tấm card. Sơ đồ cấu trúc dưới đây thể hiện cấu hình hệ thống điển hình trong đó máy chủ host và DPU phối hợp.
flowchart LR
subgraph HOST["Máy chủ host"]
HCPU["CPU host (ứng dụng/VM)"]
HMEM["Bộ nhớ host"]
HCPU --- HMEM
end
subgraph DPU["DPU / SmartNIC"]
ARM["Nhân đa dụng (Arm đa nhân)"]
ACC["Bộ tăng tốc chuyên dụng (mã hóa/nén/regex)"]
ESW["Chuyển mạch nhúng (eSwitch)"]
MEM["Bộ nhớ trên card (DDR)"]
ARM --- MEM
ACC --- MEM
ESW --- ARM
end
HCPU -->|"Bus tốc độ cao PCIe"| ESW
ESW -->|"Ethernet 400G"| NET["Fabric mạng"]
Cốt lõi của cấu trúc là sự phân công lao động ba tầng. Thứ nhất, nhân đa dụng (chủ yếu Arm Neoverse đa nhân) đảm nhiệm mặt phẳng điều khiển (Control Plane), xử lý logic phức tạp nhưng tần suất thấp như quản lý bảng định tuyến, cập nhật chính sách, chạy tác nhân quản lý. Thứ hai, bộ tăng tốc chuyên dụng (Accelerator) xử lý ở mặt phẳng dữ liệu (Data Plane) các phép toán tần suất cao, có quy luật như mã hóa/giải mã (IPsec/TLS), nén, so khớp regex, băm ở tốc độ đường truyền bằng mạch cố định hoặc bán cố định. Thứ ba, chuyển mạch nhúng (eSwitch) phân loại và chuyển tiếp gói tin giữa cổng vật lý và hàm ảo (VF) của host, đưa (offload) luật chuyển mạch ảo xuống phần cứng để thay thế chuyển mạch phần mềm.
Xét nguyên lý hoạt động từ góc độ đường dữ liệu, gói tin đến từ bên ngoài chảy bên trong DPU theo thứ tự phân loại → áp dụng chính sách → xử lý tăng tốc → truyền DMA mà không đi qua CPU host, và được đặt trực tiếp vào bộ nhớ ứng dụng. Lúc này, kết nối trực tiếp hàm ảo tới từng VM qua SR-IOV (Single Root I/O Virtualization) và kết hợp RDMA (truy cập bộ nhớ trực tiếp từ xa) với kernel bypass (DPDK, v.v.) sẽ tối thiểu hóa can thiệp của CPU và sao chép bộ nhớ, hạ độ trễ xuống mức micro giây. Nói cách khác, DPU triển khai bằng phần cứng "một lối tắt để gói tin tới bộ nhớ đích trong khi chạm vào CPU ít nhất có thể."
Đào sâu thêm một chút vào nguyên lý vì sao lối tắt này góp phần vào hiệu năng, cần hiểu rằng thủ phạm chính bào mòn hiệu năng trong ngăn xếp mạng truyền thống là ngắt (interrupt), chuyển ngữ cảnh và sao chép bộ nhớ. Trong đường xử lý phần mềm, mỗi gói tin phát sinh một ngắt kernel, dữ liệu được sao chép vào không gian người dùng, và trong quá trình đó cache CPU bị ô nhiễm. DPU ánh xạ hàng đợi phần cứng trực tiếp vào bộ nhớ ứng dụng (zero-copy) và loại bỏ ngắt bằng xử lý dựa trên polling, xóa bỏ tận gốc ba chi phí này. Khi băng thông tăng lên 400GbE, thời gian xử lý cho phép trên mỗi gói co lại xuống đơn vị nano giây, và dưới ràng buộc vật lý này, chỉ tối ưu phần mềm thôi thì giới hạn là rõ ràng, nên đường dữ liệu bằng phần cứng trở thành lời giải duy nhất.
Điểm đặc biệt đáng chú ý là DPU khởi động hệ điều hành riêng (chủ yếu là Linux nhẹ) và chạy độc lập với host. Nhờ đó, ngay cả khi hypervisor của host bị xâm phạm, DPU vẫn duy trì chính sách bảo mật trong một miền tin cậy riêng, hiện thực hóa việc "đưa mặt phẳng điều khiển hạ tầng ra ngoài host (off-host)" vốn tách vật lý mặt phẳng quản lý. AWS Nitro, vốn tách ảo hóa, mạng, lưu trữ, bảo mật ra card và chip chuyên dụng để biến host thành tài nguyên tính toán thuần túy, là hiện thực thương mại tiêu biểu của triết lý thiết kế này.
Hiểu hai chế độ triển khai sẽ làm rõ thiết kế vận hành DPU. Thứ nhất là chế độ Tách rời (Separated), trong đó host và DPU duy trì miền quản lý riêng và chỉ phối hợp về offload. Có thể áp dụng dần mà không thay đổi lớn hệ thống vận hành máy chủ hiện có, phù hợp cho giai đoạn áp dụng ban đầu. Thứ hai là chế độ DPU quản lý (DPU-managed), trong đó DPU nắm hoàn toàn quyền kiểm soát cấp phát hạ tầng và chính sách bảo mật, coi host là tài nguyên tính toán thuần túy không đáng tin (untrusted). Đây là hình thái đẩy Zero Trust đến cực hạn, phù hợp với yêu cầu của nhà cung cấp đám mây muốn bảo đảm cô lập trong khi không tin cậy host của người thuê. Tùy chọn chế độ nào mà ranh giới trách nhiệm của tổ chức vận hành và thiết kế pipeline tự động hóa sẽ khác nhau, nên đây không phải lựa chọn kỹ thuật đơn thuần mà là quyết định quản trị vận hành.
3. Các loại offload chính và luồng xử lý
Việc xử lý hạ tầng mà DPU thu về được chia lớn thành ba lĩnh vực: mạng, lưu trữ và bảo mật. Sơ đồ chi tiết quy trình dưới đây biểu diễn luồng điển hình trong đó diễn ra offload chuyển mạch ảo.
flowchart TD
A["Gói tin đến (cổng vật lý)"] --> B{"Tra cứu bộ nhớ đệm luồng"}
B -->|"Trúng cache Fast Path"| C["Áp dụng luật phần cứng (chuyển tiếp/NAT)"]
B -->|"Trượt cache Slow Path"| D["Quyết định chính sách trên nhân DPU (điều khiển OVS)"]
D --> E["Cài luật vào bảng phần cứng"]
E --> C
C --> F["Xử lý bộ tăng tốc (mã hóa/đóng gói)"]
F --> G["Chuyển tới bộ nhớ VM đích qua DMA"]
Cốt lõi của offload mạng là hạ đường dữ liệu của chuyển mạch ảo như OVS (Open vSwitch) xuống phần cứng. Như trong sơ đồ trên, đối với gói đầu tiên (Slow Path), nhân DPU quyết định chính sách và cài luật, sau đó các gói kế tiếp của cùng luồng (Fast Path) được xử lý ngay trong bảng luồng phần cứng. Làm vậy thì chuyển mạch phần mềm vốn chạy trên CPU host biến mất, cho phép thu hồi nhiều nhân. Đóng gói phủ VXLAN/Geneve, NAT, luật cân bằng tải (L4) cũng được offload xuống phần cứng theo cách tương tự.
Trong offload lưu trữ, lưu trữ từ xa được cung cấp cho host như thể là đĩa cục bộ thông qua NVMe-oF (NVMe over Fabrics). Vì DPU thay mặt xử lý chuyển đổi giao thức lưu trữ, mã hóa, nén, nên đối với host chỉ thấy thiết bị NVMe chuẩn, còn độ phức tạp của lưu trữ phân tán phía sau được ẩn hoàn toàn. Nhờ đó có thể duy trì hiệu năng ở mức cục bộ trong khi tách vật lý điện toán và lưu trữ (Disaggregation).
Ý nghĩa thực tiễn của offload lưu trữ nằm ở cải thiện tỷ lệ sử dụng tài nguyên (Utilization). Theo truyền thống, vì máy chủ tích hợp đĩa cục bộ nên đơn vị mở rộng của điện toán và lưu trữ bị ràng buộc với nhau, gây lãng phí phải tăng cả máy chủ dù chỉ một bên thiếu. Khi DPU chiếu NVMe từ xa như thể cục bộ, hạ tầng có thể tổ hợp (Composable Infrastructure) vốn mở rộng độc lập điện toán và lưu trữ theo nhu cầu trở nên khả thi, giảm việc mắc kẹt tài nguyên (stranding) và nâng tỷ lệ vận hành toàn trung tâm dữ liệu. Thêm vào đó, vì DPU thực hiện trong suốt cả việc mã hóa ở tầng lưu trữ (at-rest/in-transit), nên còn có lợi ích phụ là đáp ứng quy định bảo vệ dữ liệu mà không thay đổi ứng dụng.
Offload bảo mật là đỉnh cao giá trị của DPU. Bằng cách thực hiện mã hóa IPsec/TLS ở tốc độ đường truyền, tường lửa có trạng thái, vi phân đoạn (microsegmentation), giảm thiểu DDoS, kiểm tra gói sâu (DPI) ở ngoài host, nó cưỡng chế chính sách bảo mật tại ranh giới tin cậy mà tải công việc của người thuê không nhìn thấy. Đây là nền tảng để triển khai ở mức phần cứng Zero Trust và vi phân đoạn đã bàn ở trên, và khiến ngay cả host bị xâm phạm cũng không thể lách qua kiểm soát bảo mật.
Nguyên lý chung xuyên suốt ba lĩnh vực offload là "tách mặt phẳng điều khiển và dữ liệu (Control/Data Plane Separation)." Các quyết định phức tạp nhưng hiếm khi xảy ra (quyết định chính sách, xử lý ngoại lệ, quản lý) được nhân đa dụng của DPU xử lý mềm dẻo bằng phần mềm, còn việc xử lý dữ liệu thực tế đơn giản nhưng lặp lại với tần suất cực cao được bảng phần cứng và bộ tăng tốc đảm nhiệm ở tốc độ đường truyền. Nhờ cấu trúc tách này, DPU đồng thời có được "sự mềm dẻo (phần mềm) và hiệu năng (phần cứng)," điều có thể xem là hạ tư tưởng tách mặt phẳng điều khiển/dữ liệu đã được thiết lập trong SDN xuống mức giao diện máy chủ. Gần đây, mặt phẳng dữ liệu khả lập trình vốn mô tả mặt phẳng dữ liệu này bằng ngôn ngữ chuyên biệt theo miền như P4 (Programming Protocol-independent Packet Processors) và tái định nghĩa các giao thức, chính sách mới như phần mềm mà không thay mạch đang lan rộng.
4. So sánh các loại SmartNIC và thành phần cấu tạo
SmartNIC/DPU được chia thành ba dòng theo cách hiện thực tính khả lập trình. Mỗi cách có sự đánh đổi rõ rệt về hiệu năng, tính mềm dẻo và độ khó phát triển, và lý do khác biệt này phát sinh nằm ở lựa chọn thiết kế "cố định hóa thành mạch cứng đến đâu và để lại cho phần mềm từ đâu."
| Phân loại | Dựa trên ASIC | Dựa trên FPGA | Dựa trên SoC (nhân Arm) |
|---|---|---|---|
| Hiệu năng | Cao nhất (mạch cố định) | Cao (mạch tái cấu hình) | Cao (nhân + bộ tăng tốc) |
| Tính mềm dẻo | Thấp | Rất cao | Cao (lập trình SW) |
| Độ khó phát triển | Thấp (chức năng cố định) | Cao (thiết kế HDL) | Trung bình (C/Linux) |
| Ví dụ tiêu biểu | NIC offload thời kỳ đầu | Xilinx/Intel FPGA SmartNIC | NVIDIA BlueField, Intel IPU, AMD Pensando |
Cách ASIC hiện thực các offload cụ thể bằng mạch cố định cho hiệu suất điện năng/hiệu năng cao nhất, nhưng không thể ứng phó khi xuất hiện giao thức hoặc chính sách mới. Cách FPGA có thể tái cấu hình mạch nên tối đa hóa tính mềm dẻo, nhưng đòi hỏi phát triển dựa trên HDL (Verilog/VHDL), nâng rào cản gia nhập và tạo gánh nặng về đơn giá, điện năng. Cách SoC, dòng chủ đạo của DPU ngày nay, kết hợp Arm đa nhân với bộ tăng tốc chuyên dụng để mặt phẳng dữ liệu được bộ tăng tốc xử lý ở tốc độ đường truyền còn mặt phẳng điều khiển được lập trình trong môi trường C/Linux quen thuộc, cân bằng hiệu năng và năng suất phát triển. NVIDIA BlueField, Intel IPU (Mount Evans/E2000), AMD Pensando là các sản phẩm tiêu biểu của dòng này.
Lý do ưu thế giữa ba cách đã dịch chuyển theo thời gian nằm ở "tốc độ thay đổi của tính mềm dẻo được đòi hỏi." Trong thời kỳ đối tượng offload ổn định như TCP checksum, mạch cố định của ASIC là hợp lý, nhưng khi đám mây liên tục thay đổi chính sách phủ và bảo mật, không còn có thể cố định hóa mạch. FPGA cung cấp sự mềm dẻo đó nhưng va vào bức tường năng suất phát triển và hiệu suất điện năng, và cuối cùng cách SoC vốn phân chia "chính sách hay thay đổi thì đưa vào phần mềm của nhân, phép toán tần suất cao ổn định thì đưa vào bộ tăng tốc tích hợp" đã hội tụ thành điểm dung hòa. Lộ trình tiến hóa này cho thấy nguyên lý tách mặt phẳng điều khiển/dữ liệu đã thấy ở trên được quán triệt nguyên vẹn ngay cả trong lựa chọn hình thái phần cứng.
Điểm phân biệt DPU với CPU/GPU/NPU nằm ở "đặc hóa cho cái gì." Bảng dưới đây sắp xếp sự phân công vai trò của bốn bộ xử lý, và phần văn xuôi tiếp theo giải thích khác biệt đó có hàm ý gì trong thực tiễn.
| Bộ xử lý | Lĩnh vực đặc hóa | Dạng song song | Vai trò trong trung tâm dữ liệu |
|---|---|---|---|
| CPU | Điều khiển đa dụng/logic tuần tự | Song song thấp-trung (vài chục nhân) | Ứng dụng/điều phối |
| GPU | Tính toán dấu phẩy động song song quy mô lớn | Cực lớn (hàng nghìn nhân) | Huấn luyện AI/đồ họa/HPC |
| NPU | Nhân-cộng dồn của mạng nơ-ron (MAC) | Song song mảng có quy luật | Tăng tốc suy luận AI |
| DPU | Di chuyển dữ liệu/xử lý hạ tầng | Song song theo gói/luồng | Offload mạng/lưu trữ/bảo mật |
Nếu CPU đặc hóa cho điều khiển đa dụng/logic tuần tự, GPU cho đồ họa/tính toán dấu phẩy động song song quy mô lớn, NPU cho nhân-cộng dồn của mạng nơ-ron, thì DPU đặc hóa cho di chuyển dữ liệu và xử lý hạ tầng. Chúng ở quan hệ bổ trợ chứ không cạnh tranh, và trong trung tâm dữ liệu, GPU đảm nhiệm tính toán AI còn DPU đảm nhiệm vai trò cung cấp dữ liệu an toàn, tốc độ cao cho GPU đó. Thực tế, trong các cụm huấn luyện AI quy mô lớn, DPU đảm nhiệm truyền thông độ trễ cực thấp giữa các GPU (RDMA/RoCE), nâng tỷ lệ sử dụng GPU.
Điểm mà khác biệt dẫn tới hàm ý thực tiễn là "vị trí của nút thắt cổ chai." Trong huấn luyện AI, mô hình và dữ liệu càng lớn thì cái chi phối tổng thông lượng không phải bản thân tính toán mà là cung cấp dữ liệu cho GPU liên tục đến đâu, và nếu giao đường cung cấp này cho phần mềm CPU thì CPU trở thành nút thắt. DPU thay CPU xử lý đường cung cấp này bằng phần cứng, giảm thời gian nhàn rỗi của GPU, qua đó cải thiện trực tiếp tỷ suất hoàn vốn (ROI) của các GPU đắt tiền. Nói cách khác, quan điểm rằng DPU không phải đối thủ của GPU mà là thiết bị phụ trợ bảo vệ khoản đầu tư GPU phải là điểm khởi đầu của thiết kế thực tiễn.
5. Chuyên sâu: Xu hướng mới nhất và trường hợp áp dụng thực tế
Công nghệ DPU đang tiến hóa nhanh theo ba nhánh. Thứ nhất, kết hợp với hạ tầng AI. Khi kết nối hàng nghìn GPU trong huấn luyện LLM quy mô lớn, nút thắt truyền thông chi phối tổng thời gian huấn luyện, và DPU tăng tốc trao đổi dữ liệu giữa các GPU bằng offload GPUDirect, RDMA, truyền thông tập thể (Collective), đồng thời giảm gánh nặng truyền thông bằng cách xử lý một phần các phép toán tập thể như All-Reduce ngay tại switch/NIC qua tính toán trong mạng (In-Network Computing, ví dụ: SHARP). Trong trung tâm dữ liệu AI, DPU giờ đây đang định hình thành thành phần cơ bản chứ không phải tùy chọn.
Thứ hai, các hyperscaler tự nội hóa silicon của mình. AWS, với Nitro System, đã offload ảo hóa, mạng, lưu trữ, bảo mật sang card chuyên dụng, chuyển host EC2 thành tài nguyên tính toán thuần túy trên thực tế, và trên cấu trúc này cung cấp đồng thời hiệu năng mức bare-metal và sự cô lập mạnh. Microsoft Azure phát triển SmartNIC dựa trên FPGA (dòng Catapult trước đây) và DPU riêng, Google cũng đưa vào IPU (E2000) phát triển hợp tác với Intel; như vậy các đám mây lớn đang tích hợp dọc offload hạ tầng vào phần cứng của chính mình. Đây là lựa chọn chiến lược không chỉ về hiệu năng mà còn về chủ quyền chuỗi cung ứng và bảo mật.
Thứ ba, hội tụ với điện toán bảo mật và Zero Trust. Khi DPU cung cấp gốc tin cậy (Root of Trust) tách khỏi host, nó đang mở rộng thành nền tảng bảo mật tích hợp hỗ trợ bằng phần cứng cho điện toán bảo mật, vi phân đoạn, và Zero Trust Network Access đã bàn ở trên. Ví dụ, đang hiện thực hóa kiến trúc trong đó ngay cả trong môi trường hypervisor bị xâm phạm, DPU vẫn xác thực và mã hóa lưu lượng người thuê, và bằng cách đặt mặt phẳng quản lý ra ngoài host, chặn cả việc lạm dụng quyền quản trị. Về mặt chuẩn hóa, dự án OPI (Open Programmable Infrastructure) thuộc Linux Foundation tiếp tục nỗ lực chuẩn hóa API và cấp phát của DPU/IPU nhằm giảm phụ thuộc nhà cung cấp.
Lĩnh vực viễn thông cũng là nơi áp dụng đầy tiềm năng của DPU. Chức năng mặt phẳng người dùng (UPF, User Plane Function) của mạng lõi 5G phải đóng gói và định tuyến lượng gói tin khổng lồ mỗi giây qua đường hầm GTP-U, và xử lý điều này bằng CPU đa dụng thì tiêu tốn nhiều nhân và độ trễ dao động. Offload mặt phẳng dữ liệu UPF sang DPU/SmartNIC bảo đảm xử lý ở tốc độ đường truyền và độ trễ thấp có tính tất định (deterministic), ổn định chất lượng dịch vụ URLLC/biên (edge) vốn đòi hỏi độ trễ cực thấp. Đây là hiện thực hóa tăng tốc phần cứng cho SDN/NFV đã bàn ở trên, và đang nổi lên như yếu tố cốt lõi hỗ trợ chuyển đổi điện toán đám mây gốc (cloud-native) của hạ tầng viễn thông.
Xét bằng con số cụ thể, số nhân CPU host thu hồi được nhờ offload hạ tầng dao động từ vài đến vài chục tùy tải công việc, quy đổi thành sự gia tăng vCPU có thể bán trên mỗi máy chủ và tiết kiệm điện năng cùng diện tích lắp đặt. Ngoài ra, trong môi trường 400GbE, IPsec tốc độ đường truyền bằng phần cứng hạ đáng kể độ trễ và mức sử dụng CPU so với mã hóa phần mềm, nên băng thông càng cao thì lợi thế tương đối của DPU càng lớn. Tuy nhiên, vì các con số này chênh lệch lớn theo nhà cung cấp và cấu hình, nguyên tắc khi áp dụng là kiểm chứng bằng đo thực tế (PoC) với tải công việc của chính mình.
Hình dung áp dụng thực tế, chẳng hạn giả sử trong một cụm ảo hóa đa người thuê quy mô khoảng 100 máy chủ, mỗi máy chủ tiêu tốn trung bình 6 nhân vật lý cho chuyển mạch phần mềm OVS, đóng gói phủ và mã hóa người thuê. Offload việc này sang DPU thu hồi tài nguyên tính toán tương đương 6 nhân mỗi máy chủ, khoảng 600 nhân trên toàn cụm, và bấy nhiêu có thể chuyển thành vCPU bán được. Thêm vào đó, độ trễ/jitter được hạ nhờ loại bỏ chuyển mạch phần mềm cải thiện chất lượng của các tải nhạy cảm với độ trễ (giao dịch thời gian thực, mạng lõi viễn thông), và còn có lợi ích phụ là đáp ứng yêu cầu kiểm toán cô lập người thuê nhờ tách mặt phẳng quản lý. Dĩ nhiên, lợi ích này phải được cấn trừ với chi phí bổ sung là giá thành card DPU, điện năng và nhân sự vận hành, và vì có thể không vượt điểm hòa vốn ở các cụm có tỷ trọng xử lý hạ tầng thấp, nên phải cân nhắc đồng thời quy mô và tính chất lưu lượng.
6. Điểm cần cân nhắc và hàm ý
DPU là công nghệ thay đổi cục diện của kiến trúc trung tâm dữ liệu, nhưng không phải vạn năng. Cốt lõi là sự cân bằng giữa "lợi ích hiệu quả/bảo mật thu được nhờ tách xử lý hạ tầng khỏi CPU" và "gánh nặng chi phí/vận hành/phụ thuộc mà phần cứng mới bổ sung," và từ góc nhìn Kỹ sư chuyên nghiệp, chiến lược áp dụng phải được thiết kế thận trọng theo bốn trục sau.
Chiến lược áp dụng (điểm hòa vốn theo góc nhìn TCO): Vì DPU bổ sung đơn giá card và điện năng, tính kinh tế chỉ thành lập khi "nhân CPU thu hồi, tiết kiệm điện năng và tăng bán vCPU" vượt qua một ngưỡng quy mô vượt trên chi phí đó. Do đó, đám mây đa người thuê, cụm AI, môi trường lưu trữ băng thông cao với thuế hạ tầng lớn là đối tượng ưu tiên, còn lợi ích bị hạn chế ở các tải đơn lẻ, quy mô nhỏ có tỷ trọng xử lý hạ tầng thấp. Luôn phải tính điểm hòa vốn sau khi PoC với hồ sơ lưu lượng của chính mình.
Đánh đổi (hiệu năng so với độ phức tạp vận hành): Áp dụng DPU thêm một máy tính cần quản lý (OS, firmware, tác nhân riêng) ngoài host. Điều này kéo theo gánh nặng vận hành mới: cập nhật firmware, quản lý lỗ hổng, bảo đảm khả năng quan sát, chẩn đoán sự cố. Phải đánh giá đồng thời lợi ích hiệu năng và sự gia tăng độ phức tạp vận hành, và chuẩn bị trước hệ thống quản lý vòng đời.
Ứng phó chuẩn hóa và phụ thuộc nhà cung cấp (Lock-in): Hiện nay DPU có tính di động thấp vì SDK theo nhà cung cấp (NVIDIA DOCA, Intel IPDK, v.v.) và mô hình lập trình khác nhau. Nên áp dụng các chuẩn mở như OPI, DASH và lập trình dựa trên P4, đồng thời thiết kế sao cho logic offload được bọc trong một tầng trừu tượng và không gắn trực tiếp vào API của một nhà cung cấp cụ thể, hạ thấp rủi ro phụ thuộc.
Thiết kế lại ranh giới bảo mật/tin cậy và triển vọng: DPU là một gốc tin cậy mới, đồng thời cũng là một bề mặt tấn công mới. Nếu không quản lý nghiêm ngặt secure boot, tính toàn vẹn firmware và phân tách quyền của chính DPU, thì điểm kiểm soát đặc quyền ngược lại có thể trở thành điểm rủi ro. Sắp tới, DPU được kỳ vọng định hình thành chuẩn của mặt phẳng điều khiển hạ tầng của trung tâm dữ liệu, kết hợp với gộp bộ nhớ dựa trên CXL/hạ tầng có thể tổ hợp, tính toán trong mạng, và điện toán bảo mật, nên phải vẽ đồng thời lộ trình tích hợp với các công nghệ liên quan (CXL, SR-IOV, RDMA, Zero Trust).
Tổng hợp lại, DPU/SmartNIC không phải "một NIC hiệu năng cao" mà là sự chuyển đổi kiến trúc tái định nghĩa từ gốc rễ cách trung tâm dữ liệu xử lý hạ tầng, bảo mật nó và bố trí tài nguyên. Hơn cả thông số của từng sản phẩm, Kỹ sư chuyên nghiệp phải đọc một cách tích hợp các nguyên lý thiết kế offload, tăng tốc, cô lập và những thay đổi về tổ chức, vận hành, kinh tế do chúng gây ra, và có nhãn quan phán đoán thời điểm và phạm vi áp dụng dựa trên quy mô thuế hạ tầng trong các tải công việc của chính mình.
Tài liệu tham khảo
- NVIDIA, "What Is a DPU?" (Tổng quan kỹ thuật BlueField DPU) — https://blogs.nvidia.com/blog/whats-a-dpu-data-processing-unit/
- AWS, "AWS Nitro System" — https://aws.amazon.com/ec2/nitro/
- Open Programmable Infrastructure (OPI) Project, Linux Foundation — https://opiproject.org/
- Intel, "Infrastructure Processing Unit (IPU)" — https://www.intel.com/content/www/us/en/products/details/network-io/ipu.html
Tóm tắt một câu: DPU/SmartNIC offload, tăng tốc và cô lập các xử lý hạ tầng như mạng, lưu trữ, bảo mật từ CPU sang một con chip khả lập trình chuyên dụng, đồng thời nâng cao hiệu quả tài nguyên tính toán và bảo mật Zero Trust của trung tâm dữ liệu như trụ cột thứ ba của điện toán.