← Về danh sách
Phần cứng & Bán dẫn
#NPU#AI 반도체#시스톨릭 어레이#도메인 특화 가속기#전력효율
Cập nhật lần cuối · 2026-09-12

NPU (Neural Processing Unit, bộ xử lý mạng nơ-ron)

1. Tổng quan

A. Định nghĩa

NPU (Neural Processing Unit) là bộ tăng tốc chuyên dụng cho AI (Domain-Specific Accelerator) được chuyên biệt hóa để xử lý song song quy mô lớn phép nhân ma trận·vector và nhân-cộng dồn (MAC, Multiply-Accumulate) — phép toán cốt lõi của mạng nơ-ron sâu. Khác với CPU hướng tới tính toán đa dụng hay GPU khởi nguồn từ xử lý đồ họa, NPU là ví dụ tiêu biểu của kiến trúc chuyên biệt theo miền (DSA), thiết kế lại đường dữ liệu, phân cấp bộ nhớ và độ chính xác số chỉ dành cho "một workload cụ thể là suy luận·huấn luyện mạng nơ-ron".

CPU truyền thống xử lý linh hoạt nhiều loại công việc nhờ các tối ưu hướng điều khiển như dự đoán rẽ nhánh, thực thi không theo thứ tự, nhưng kém hiệu quả với các phép toán có quy luật như mạng nơ-ron, nơi cùng một phép nhân-cộng dồn lặp lại hàng trăm triệu đến hàng nghìn tỷ lần. GPU đã hấp thụ phần lớn tính song song này bằng hàng nghìn lõi, nhưng vẫn còn mang tính đa dụng vốn dành cho pipeline đồ họa, nên về hiệu quả điện năng·diện tích vẫn còn dư địa cải thiện. NPU tối thiểu hóa logic điều khiển và dồn diện tích die vào mảng phần tử tính toán (PE) và bộ nhớ trên chip, nhờ đó đạt thông lượng tính toán (TOPS) và hiệu quả điện năng (TOPS/W) cao hơn nhiều ở cùng mức công suất. Tiêu biểu là Google TPU, Apple Neural Engine, khối NPU trong SoC di động của Samsung·Qualcomm.

B. Bối cảnh ra đời và sự cần thiết

Sự nổi lên của NPU là kết quả của ba áp lực chồng lên nhau. Thứ nhất là sự bùng nổ khối lượng tính toán của học sâu. Từ nhận dạng hình ảnh sang mô hình ngôn ngữ lớn (LLM) dựa trên transformer, số tham số và khối lượng tính toán tăng theo cấp số nhân, khiến bộ xử lý đa dụng khó đáp ứng trong thời gian·chi phí hợp lý. Thứ hai là giới hạn về hiệu quả điện năng (Energy Efficiency). Khi định luật Moore chậm lại và Dennard scaling kết thúc, thêm transistor đồng nghĩa mật độ công suất cũng tăng; để nâng hiệu năng, tăng tốc chuyên biệt theo miền — từ bỏ tính đa dụng và chuyên biệt hóa mạch cho một phép toán cụ thể — gần như trở thành lối thoát duy nhất. Thứ ba là tính phổ biến của suy luận (Ubiquitous Inference): nhu cầu on-device phải chạy AI thường trực trong môi trường bị ràng buộc về pin và nhiệt như điện thoại thông minh, ô tô, thiết bị IoT tăng lên, khiến phần cứng chuyên dụng chạy mạng nơ-ron với điện năng nhỏ trở nên bắt buộc. Ba áp lực này đan xen khiến NPU — "con chip chỉ giỏi mạng nơ-ron" — trở thành trục thứ ba của điện toán sau CPU và GPU.

Về lịch sử, ban đầu GPU dẫn dắt làn sóng học sâu, nhưng khi quy mô huấn luyện·suy luận lớn dần đã chạm tới điểm tới hạn mà chỉ "song song đa dụng" thì khó gánh nổi chi phí·điện năng, và lúc đó bộ tăng tốc chuyên dụng phù hợp mạch với workload cụ thể xuất hiện như một giải pháp tất yếu. Việc Google phát triển TPU khoảng năm 2015 để giảm gánh nặng suy luận trong trung tâm dữ liệu của mình là bước ngoặt mang tính biểu tượng; sau đó, việc tích hợp NPU trở thành tiêu chuẩn trên mọi lĩnh vực từ đám mây, di động đến xe hơi.

Đi sâu thêm một bước, sự nổi lên của NPU phản ánh sự chuyển đổi triết lý thiết kế điện toán. Khi cải thiện hiệu năng bán dẫn chỉ bằng tăng xung nhịp·mở rộng tính đa dụng gặp giới hạn, kiến trúc chuyên biệt theo miền (DSA) — phù hợp mạch với mẫu tính toán của một ứng dụng cụ thể — nổi lên như đột phá mới về hiệu năng·điện năng, và mạng nơ-ron trở thành trường hợp thành công quy mô lớn đầu tiên. Nói cách khác, NPU không chỉ là một sản phẩm mới mà là sản phẩm của xu hướng thời đại "từ tính đa dụng von Neumann sang chuyên biệt theo ứng dụng", và phải hiểu góc nhìn này thì các lựa chọn cấu trúc về sau mới được đọc một cách nhất quán.

C. Đặc điểm

Bản chất của NPU được tóm tắt là ① chuyên biệt cho phép toán cụ thể (lấy MAC làm trung tâm), ② tận dụng tính song song dữ liệu quy mô lớn, ③ ưu tiên phép toán số nguyên độ chính xác thấp (INT8 v.v.), ④ ưu tiên hiệu quả điện năng thông qua tối đa hóa tái sử dụng dữ liệu. Đây là triết lý thiết kế hy sinh một phần "tính linh hoạt" để đổi lấy "hiệu quả", và cấu trúc, độ chính xác, ngăn xếp trình biên dịch được xem xét sau đây đều bắt nguồn từ nguyên tắc này.

Bốn đặc điểm ăn khớp với nhau. Nhờ chuyên biệt hướng MAC (①) mà có thể tối đa hóa tính song song (②) bằng mảng có quy luật, nhờ tính quy luật đó mà tích hợp dày đặc phép toán số nguyên độ chính xác thấp (③), và tái sử dụng dữ liệu (④) giảm năng lượng di chuyển để hoàn thiện hiệu quả điện năng. Ngược lại, với workload lệch khỏi tính quy luật này, bốn lợi thế đồng thời suy yếu — điều này đồng thời định nghĩa cả điểm mạnh lẫn giới hạn của NPU. Vì vậy, hiểu NPU cũng chính là biết bốn trục này được thỏa mãn trong điều kiện nào và sụp đổ trong điều kiện nào.

2. Cấu trúc kiến trúc và nguyên lý hoạt động

Cốt lõi hiệu năng của NPU nằm ở cách bố trí các phần tử tính toán để giảm di chuyển dữ liệu. Sơ đồ cấu trúc dưới đây cho thấy cấu hình hệ thống điển hình trong đó host (CPU) và NPU phối hợp.

flowchart LR
  subgraph HOST["Hệ thống host"]
    CPU["CPU (điều khiển·tiền xử lý)"]
    DDR["Bộ nhớ hệ thống (DRAM)"]
    CPU --- DDR
  end
  subgraph NPU["Bộ tăng tốc NPU"]
    DMA["DMA / Engine di chuyển dữ liệu"]
    SRAM["SRAM trên chip (bộ đệm)"]
    PE["Mảng PE (Systolic MAC)"]
    ACT["Khối kích hoạt·pooling·chuẩn hóa"]
    DMA --- SRAM
    SRAM --- PE
    PE --- ACT
    ACT --- SRAM
  end
  DDR -- "Nạp trọng số·đầu vào" --> DMA
  CPU -- "Lệnh kernel" --> DMA

CPU host phân rã đồ thị mô hình và ủy thác phép toán cho NPU; trọng số·đầu vào khổng lồ được DMA chuyển vào bộ đệm SRAM trên chip, sau đó phép nhân ma trận được thực hiện trên mảng PE. Điểm then chốt ở đây là tối đa hóa tái sử dụng dữ liệu so với lượng tính toán để giảm thiểu truy cập DRAM bên ngoài vốn chậm và tốn điện. Dữ liệu đọc một lần được tái sử dụng càng nhiều lần (Operational Intensity cao) thì lợi thế của NPU càng lớn.

Nguyên lý cấu trúc này dẫn tới hiệu quả điện năng được tóm tắt là "tiết kiệm tài nguyên đắt đỏ và tận dụng tài nguyên rẻ". Trong tính toán mạng nơ-ron, chi phí thực sự lớn không phải bản thân phép nhân mà là việc vận chuyển toán hạng từ bộ nhớ ở xa. NPU nhắm đúng vào sự di chuyển dữ liệu này, loại bỏ logic điều khiển và đầu tư diện tích die thu được vào phần tử tính toán và bộ đệm trên chip. Dưới đây sẽ lần lượt xem xét các yếu tố thiết kế cụ thể đó.

A. Mảng systolic và song song hóa nhân-cộng dồn

Trái tim của NPU là mảng phần tử tính toán dạng lưới hai chiều gọi là mảng systolic (Systolic Array). Đây là cấu trúc trong đó nhiều phần tử xử lý (PE) được nối thành lưới, dữ liệu chảy sang PE kề bên mỗi chu kỳ xung nhịp như nhịp đập tim, và mỗi PE thực hiện nhân-cộng dồn. Khi tính tích của ma trận A và B, đầu vào chảy vào từ một cạnh của mảng, trọng số thường trú tại mỗi PE, còn tổng riêng phần được cộng dồn dọc theo mảng rồi đi ra ở phía đối diện. Ưu điểm quyết định của cách làm này là dữ liệu đọc một lần đi xuyên qua bên trong mảng và được tái sử dụng tại nhiều PE, giảm đột phá số lần truy cập bộ nhớ ngoài. Việc Google TPU xử lý hàng chục nghìn phép MAC mỗi chu kỳ bằng mảng systolic cỡ lớn 256×256 là ví dụ tiêu biểu, đẩy mật độ tính toán lên cực hạn gần như không có chi phí điều khiển.

Sơ đồ chi tiết dưới đây là ví dụ thu nhỏ 2×2, cho thấy luồng dữ liệu của mảng systolic trong đó đầu vào chảy vào từ bên trái, trọng số thường trú tại mỗi PE và tổng riêng phần được cộng dồn xuống dưới.

flowchart LR
  IN1["Hàng đầu vào 1"] --> PE11["PE(MAC)"]
  IN2["Hàng đầu vào 2"] --> PE21["PE(MAC)"]
  PE11 --> PE12["PE(MAC)"]
  PE21 --> PE22["PE(MAC)"]
  W1["Trọng số thường trú"] -.-> PE11
  W2["Trọng số thường trú"] -.-> PE12
  PE11 --> PE21
  PE12 --> PE22
  PE21 --> OUT1["Đầu ra tổng riêng phần cộng dồn"]
  PE22 --> OUT2["Đầu ra tổng riêng phần cộng dồn"]

Điểm cốt lõi là đầu vào·trọng số được nạp một lần sẽ đi qua mảng và được dùng lặp lại tại nhiều PE; sự tái sử dụng này là nguồn gốc của việc giảm truy cập bộ nhớ ngoài. Lý do mảng systolic hiệu quả không đơn giản là "vì có nhiều lõi" mà vì mẫu di chuyển dữ liệu có quy luật và mang tính cục bộ. Nếu GPU chia sẻ dữ liệu linh hoạt qua lượng lớn thanh ghi·cache, thì mảng systolic truyền dữ liệu chỉ bằng dây nối giữa các PE kề nhau, giảm chiều dài dây và điện năng. Tuy nhiên, tính quy luật này chỉ hiệu quả khi phép nhân-cộng dồn được lấp đầy dày đặc, nên cũng mang giới hạn là tỷ lệ sử dụng PE có thể giảm ở các phép toán thưa (Sparse) hoặc bất quy tắc.

B. Luồng dữ liệu (Dataflow) và chiến lược tái sử dụng

Một trục khác quyết định hiệu năng·điện năng trong thiết kế NPU là dataflow — quyết định dữ liệu nào được cố định và dữ liệu nào được cho chảy. Có ba loại chính. Cố định trọng số (Weight Stationary) cho trọng số thường trú tại PE để tối đa hóa tái sử dụng, có lợi cho lớp tích chập·lớp kết nối đầy đủ vốn áp dụng lặp lại cùng trọng số cho nhiều đầu vào. Cố định đầu ra (Output Stationary) để mỗi PE chịu trách nhiệm cộng dồn một giá trị đầu ra tới cùng, loại bỏ việc di chuyển tổng riêng phần; còn cố định hàng (Row Stationary) là cách cân bằng tổng hợp việc tái sử dụng đầu vào·trọng số·tổng riêng phần (ví dụ: MIT Eyeriss). Loại nào tối ưu tùy thuộc hình dạng lớp (số kênh·kích thước kernel·kích thước batch), nên NPU thực tế hỗ trợ nhiều dataflow hoặc chọn theo workload cụ thể. Như vậy, thiết kế "tái sử dụng cái gì" chính là yếu tố quyết định hiệu quả điện năng.

Mặt khác, lựa chọn dataflow gắn liền với thiết kế phân cấp bộ nhớ trên chip. NPU có phân cấp bộ nhớ nhiều tầng gồm DRAM ngoài, bộ đệm toàn cục (Global Buffer, SRAM) lớn trên chip, và tệp thanh ghi nhỏ bên trong mỗi PE; càng lên tầng trên (gần PE) năng lượng truy cập càng giảm mạnh. Do đó, then chốt của hiệu quả điện năng là giữ dữ liệu càng lâu càng tốt gần PE (thanh ghi·bộ đệm cục bộ) để tái sử dụng, và dataflow rốt cuộc chẳng khác gì chính sách quyết định "giữ cái gì, bao nhiêu, ở đâu trong phân cấp này". Vì thế, trong thiết kế NPU, cân bằng dung lượng và băng thông bộ đệm quan trọng không kém việc tăng số phần tử tính toán.

C. Tính toán độ chính xác thấp và lượng tử hóa

Một bí quyết khác giúp NPU đạt hiệu quả điện năng vượt trội so với GPU là độ chính xác số thấp (Reduced Precision). Huấn luyện thường dùng số dấu phẩy động như FP32/FP16, nhưng thực nghiệm cho thấy ở giai đoạn suy luận, áp dụng lượng tử hóa (Quantization) hạ số dấu phẩy động 32 bit xuống số nguyên 8 bit (INT8) hoặc thấp hơn không gây mất độ chính xác đáng kể. Bộ nhân số nguyên nhỏ hơn nhiều lần về diện tích mạch·điện năng so với dấu phẩy động, nên có thể đặt nhiều phần tử tính toán hơn trên cùng die và chạy với điện năng thấp hơn. Ví dụ, phép toán INT8 thực hiện cùng phép tính với khoảng một phần tư bộ nhớ và năng lượng ít hơn nhiều so với FP32. NPU mới nhất còn tiến xa hơn, hỗ trợ độ chính xác siêu thấp như INT4·FP8, độ chính xác hỗn hợp (Mixed Precision) thay đổi độ chính xác theo từng lớp, và tăng tốc thưa (Sparsity) bỏ qua các kết nối có trọng số bằng 0 để nâng hiệu quả. Tuy nhiên, càng hạ độ chính xác thì rủi ro giảm độ chính xác mô hình càng lớn, nên then chốt thực tiễn là bù đắp bằng huấn luyện nhận biết lượng tử hóa (QAT) v.v.

D. Ngăn xếp phần mềm và trình biên dịch

NPU không hoạt động chỉ bằng phần cứng; ngăn xếp trình biên dịch·runtime chuyển mô hình thành lệnh phần cứng quyết định hơn một nửa hiệu năng. Mô hình mà nhà phát triển viết bằng PyTorch·TensorFlow được chuyển sang biểu diễn trung gian như ONNX, sau đó trình biên dịch chuyên dụng cho NPU (ví dụ: SDK của nhà cung cấp, Apache TVM, Google XLA) tiếp nhận và thực hiện hợp nhất toán tử (Operator Fusion), phân mảnh (Tiling), cấp phát bộ nhớ, ánh xạ dataflow để tạo mã thực thi tối ưu. Trong quá trình này, nhiều phép toán được gộp làm một để loại bỏ việc đi lại bộ nhớ của kết quả trung gian, và ma trận lớn được cắt (tiling) cho vừa kích thước bộ đệm trên chip để tối đa hóa tái sử dụng. Dù phần cứng xuất sắc đến đâu, nếu trình biên dịch không ánh xạ tốt phép toán thì tỷ lệ sử dụng PE sẽ giảm mạnh, vì vậy năng lực cạnh tranh của NPU phụ thuộc lớn vào đồng thiết kế phần cứng - phần mềm (HW-SW Co-design). Thực tế, khó khăn lớn nhất mà các startup NPU mới gặp phải thường là mức độ trưởng thành của hệ sinh thái phần mềm này hơn là bản thân con chip.

E. Chỉ số hiệu năng và góc nhìn Roofline

Khi đánh giá·so sánh NPU, cần xem xét nhiều chỉ số cùng lúc chứ không phải một con số duy nhất. Được dùng rộng rãi nhất là số phép toán mỗi giây TOPS (Tera Operations Per Second) và hiệu quả điện năng TOPS/W — TOPS chia cho công suất tiêu thụ. Tuy nhiên, TOPS chỉ là giá trị cực đại lý thuyết (Peak), nên cần xem kèm tỷ lệ sử dụng thực tế (Utilization) — mức độ phần tử tính toán được lấp đầy trong workload thực — và tỷ lệ sử dụng FLOP của mô hình (MFU, Model FLOPs Utilization) để tránh bị sai lệch. Ví dụ, dù một chip quảng cáo 100 TOPS nhưng nếu tỷ lệ sử dụng trong suy luận thực tế chỉ 30% thì chip đối thủ 60 TOPS với tỷ lệ sử dụng 70% có thể nhanh hơn. Đọc ra được khoảng cách giữa "thông số catalog" và "hiệu năng đo thực" như vậy chính là con mắt của Kỹ sư chuyên nghiệp (Professional Engineer).

Công cụ chẩn đoán có cấu trúc xem nút thắt hiệu năng nằm ở tính toán hay bộ nhớ là mô hình Roofline (Roofline Model). Đặt cường độ tính toán (Operational Intensity, số phép toán trên mỗi byte) ở trục ngang và hiệu năng đạt được ở trục dọc, thì hiệu năng bị giới hạn bởi cái thấp hơn giữa mái dốc do băng thông bộ nhớ vạch ra và mái ngang do hiệu năng tính toán vạch ra. Các tác vụ có cường độ tính toán thấp như đọc trọng số LLM bị chặn ở mái băng thông (Memory-bound), dù tăng bao nhiêu phần tử tính toán cũng không nhanh hơn; ngược lại, phép tích chập dày đặc bị chặn ở mái tính toán (Compute-bound). Vì vậy, thiết kế·tinh chỉnh NPU bắt đầu từ việc xác định trước workload mục tiêu nằm ở vùng nào của roofline, rồi cân bằng phần tử tính toán·băng thông·bộ đệm trên chip cho phù hợp.

F. Giới hạn và thách thức

NPU không phải vạn năng; cái giá của sự chuyên biệt là một số giới hạn mang tính cấu trúc. Thứ nhất là thiếu tính linh hoạt. Vì phần cứng được tối ưu cho các toán tử·dataflow cụ thể, khi xuất hiện mẫu tính toán không lường trước như biến thể của attention hay hàm kích hoạt mới, việc hỗ trợ sẽ chậm hoặc phải quay về CPU (Fallback) khiến hiệu năng giảm mạnh. Trong thực tế cấu trúc mô hình học sâu thay đổi nhanh, sự lệch tốc độ — phần cứng mất nhiều năm từ thiết kế, kiểm chứng đến sản xuất hàng loạt khó theo kịp tốc độ thay đổi của phần mềm — là thế lưỡng nan căn bản.

Thứ hai là kém hiệu quả với tính thưa và phép toán phi cấu trúc. Mảng systolic tối ưu cho phép nhân ma trận dày đặc, nhưng với mô hình thưa có phần lớn trọng số bằng 0 hoặc workload truy cập bất quy tắc như đồ thị·embedding khuyến nghị, PE bị nhàn rỗi và không đạt hiệu năng lý thuyết. Thứ ba là mức độ trưởng thành của phần mềm và phụ thuộc nhà cung cấp: như đã nhấn mạnh, nếu hệ sinh thái trình biên dịch·framework yếu thì chip tốt cũng không phát huy được hiệu năng, và rủi ro Lock-in bị trói vào toolchain của một nhà cung cấp cụ thể là lớn. Những giới hạn này là căn cứ để NPU được định vị không phải là thứ thay thế CPU·GPU mà là thứ bổ trợ chia sẻ vai trò.

3. Phân loại và so sánh với CPU·GPU

NPU có tính chất khác nhau tùy vị trí triển khai và mục đích. Dưới đây là bảng tổng hợp phân loại tiêu biểu và đặc tính.

Phân loại Triển khai·Hình thái Mục tiêu Ví dụ tiêu biểu
NPU trung tâm dữ liệu Card·module tăng tốc máy chủ Thông lượng huấn luyện·suy luận quy mô lớn Google TPU, chip AI tại Hàn Quốc và quốc tế
NPU di động/biên Khối IP tích hợp trong SoC Suy luận on-device công suất thấp Apple Neural Engine, NPU điện thoại thông minh
NPU ô tô/nhúng SoC·chip chuyên dụng cho xe Suy luận thời gian thực·an toàn chức năng SoC ADAS·xe tự hành

Bảng chỉ hỗ trợ phân loại; điểm cốt lõi là cùng một triết lý 'chuyên biệt cho mạng nơ-ron' được hiện thực khác nhau tùy ngân sách điện năng và yêu cầu độ trễ. NPU trung tâm dữ liệu dùng hàng trăm watt để tối đa hóa thông lượng, trong khi NPU di động phải duy trì suy luận thường trực ở mức vài watt trở xuống nên chú trọng hơn vào các kỹ thuật công suất thấp như phép toán số nguyên, clock gating.

Sơ đồ quy trình dưới đây biểu diễn pipeline triển khai·thực thi mà mô hình đã huấn luyện đi qua cho đến khi thực sự chạy trên NPU. Đường đi phần mềm này quyết định hiệu năng thực tế không kém gì phần cứng.

flowchart TB
  M1["Mô hình đã huấn luyện (PyTorch/TensorFlow)"]
  M2["Chuyển sang biểu diễn trung gian (ONNX/MLIR)"]
  M3["Lượng tử hóa·Tối ưu đồ thị (hợp nhất toán tử·tiling)"]
  M4["Trình biên dịch NPU: ánh xạ dataflow·sinh lệnh"]
  M5["Runtime: lập lịch DMA·thực thi mảng PE"]
  M6["Trả kết quả suy luận (host)"]
  M1 --> M2 --> M3 --> M4 --> M5 --> M6

Trong luồng này, chất lượng của bước 3~4 (lượng tử hóa·ánh xạ) quyết định tỷ lệ sử dụng thực tế. Cùng một phần cứng, nếu trình biên dịch chia nhỏ phép toán cho vừa bộ đệm trên chip và loại bỏ việc đi lại bộ nhớ không cần thiết thì hiệu năng tăng gấp đôi, còn nếu ánh xạ vụng về thì mảng PE đắt đỏ sẽ nhàn rỗi. Đây là lý do phải xem NPU không phải "một linh kiện phần cứng đơn lẻ" mà là "một hệ thống phần cứng - phần mềm".

So sánh với CPU·GPU cần được hiểu theo vì sao khác biệt phát sinh chứ không phải liệt kê hạng mục. CPU mạnh về logic rẽ nhánh·tuần tự nhờ số ít lõi mạnh và điều khiển tinh vi, nhưng kém hiệu quả với phép nhân song song quy mô lớn. GPU với cấu trúc SIMT hàng nghìn lõi xuất sắc trong tính toán song song đa dụng nên được dùng rộng rãi cho huấn luyện, nhưng do tính đa dụng có nguồn gốc đồ họa nên hiệu quả điện năng thấp hơn so với thiết bị chuyên cho suy luận. NPU giảm bớt điều khiển·tính đa dụng và tập trung tài nguyên vào mảng MAC và bộ nhớ trên chip, nhờ đó đạt TOPS/W gấp nhiều lần GPU trên các workload mạng nơ-ron cụ thể. Đổi lại, nó phải trả giá về tính linh hoạt: toán tử được hỗ trợ bị hạn chế, và khi xuất hiện cấu trúc mô hình mới thì phần cứng·trình biên dịch phải chạy theo. Tóm lại, đây là sự phân chia vai trò bổ trợ CPU = linh hoạt, GPU = song song đa dụng, NPU = chuyên biệt hiệu quả, và hệ thống thực tế kết hợp cả ba theo kiểu dị thể (Heterogeneous).

Khác biệt hiệu quả qua các ví dụ cụ thể

Hiểu khác biệt hiệu quả qua cảm nhận con số sẽ làm rõ lý do tồn tại của NPU. Thứ nhất, hiệu quả của việc giảm độ chính xác. Hạ bộ nhân FP32 xuống INT8 thì diện tích mạch·điện năng của bộ nhân giảm khoảng một bậc độ lớn, cho phép tích hợp nhiều MAC hơn trên cùng die và vận hành với điện năng thấp hơn. Dung lượng lưu trọng số và mức tiêu thụ băng thông bộ nhớ cũng giảm xuống khoảng một phần tư, mang lại lợi ích kép cho suy luận có nút thắt bộ nhớ lớn. Thứ hai, năng lượng di chuyển dữ liệu. Thông thường, người ta biết rằng việc đọc toán hạng từ DRAM ngoài tốn năng lượng gấp hàng chục lần so với bản thân một phép nhân-cộng dồn, cho thấy then chốt của hiệu quả điện năng là tăng tái sử dụng bằng mảng systolic·bộ đệm trên chip để giảm truy cập ngoài. Thứ ba, thực tế của tỷ lệ sử dụng. Bài báo về Google TPU báo cáo rằng trong suy luận trung tâm dữ liệu ban đầu, tỷ lệ sử dụng phần tử tính toán dao động mạnh tùy workload, qua đó chứng thực nhận định trước đó rằng "dù TOPS lý thuyết cao, hiệu năng thực tế vẫn phụ thuộc vào ánh xạ·kích thước batch". Ba ví dụ này cho thấy quyết định áp dụng NPU phải dựa trên đo đạc thực tế trên workload mục tiêu chứ không phải con số thông số kỹ thuật.

4. Nâng cao: Xu hướng mới nhất và ứng dụng thực tiễn

Lĩnh vực NPU đang tiến hóa nhanh chóng trong một số xu hướng rõ rệt. Thứ nhất, chuyên biệt cho suy luận AI tạo sinh·LLM. Để xử lý hiệu quả phép toán attention của transformer và trọng số khổng lồ, thiết kế đang được tái cấu trúc theo hướng kết hợp HBM băng thông lớn, hỗ trợ quản lý KV cache và các tối ưu kiểu FlashAttention ở cấp phần cứng·trình biên dịch. Suy luận LLM có đặc tính nhạy cảm mạnh với băng thông bộ nhớ (Memory-bound), nên không chỉ phần tử tính toán mà thiết kế hệ thống con bộ nhớ cũng quyết định hiệu năng.

Trong xu hướng này, trọng tâm thiết kế NPU đang dịch chuyển từ hiệu năng tính toán thuần túy sang phân cấp bộ nhớ·kết nối liên thông (interconnect). Vì phần đáng kể thời gian suy luận LLM dành cho việc đọc trọng số khổng lồ và KV cache, mở rộng băng thông HBM, interconnect tốc độ cao nối nhiều chip (giao tiếp giữa các chip), và song song hóa tensor·pipeline chia mô hình lên nhiều NPU đã trở thành các biến thiết kế cốt lõi. Nói cách khác, "băng thông thực tế và khả năng mở rộng của hệ thống gồm nhiều chip" quyết định năng lực cạnh tranh hơn là "TOPS của một chip".

Thứ hai, AI on-device đi vào giai đoạn phổ cập. Khi NPU mạnh được trang bị mặc định trên điện thoại thông minh·PC (cái gọi là AI PC), các trường hợp chạy trực tiếp mô hình ngôn ngữ·sinh ảnh trên thiết bị mà không gửi lên đám mây ngày càng tăng. Điều này mang lại lợi ích thực chất: rút ngắn độ trễ phản hồi, tiết kiệm chi phí truyền thông, xử lý dữ liệu cá nhân cục bộ (quyền riêng tư). Ví dụ, sản phẩm đang tiến hóa theo hướng các chức năng như dịch cuộc gọi thời gian thực, chỉnh sửa ảnh, tóm tắt tài liệu được xử lý chỉ bằng NPU trên thiết bị mà không cần mạng. Suy luận on-device không để dữ liệu rời khỏi thiết bị nên cũng phù hợp với yêu cầu của luật bảo vệ dữ liệu cá nhân·chủ quyền dữ liệu, đặc biệt được chú ý trong các lĩnh vực y tế·tài chính có quy định chặt chẽ. Tuy nhiên, để vừa với điện năng·bộ nhớ hạn chế của thiết bị, tiền đề là phải có tinh gọn hóa (lượng tử hóa·chưng cất·cắt tỉa) và thiết kế mô hình nhỏ (sLM), và ở đây một lần nữa chức năng tăng tốc độ chính xác thấp·thưa của NPU phát huy tác dụng.

Thứ ba, mở rộng sang các lĩnh vực an toàn trọng yếu (Safety-critical) như xe hơi·robot. ADAS xe tự hành phải suy luận thời gian thực đầu vào camera·LiDAR, nên cần NPU cho xe thỏa mãn độ trễ tất định (Deterministic Latency) và tuân thủ an toàn chức năng (ISO 26262). Trong lĩnh vực này, đảm bảo độ trễ trường hợp xấu nhất (WCET) và phát hiện·khôi phục lỗi quan trọng hơn hiệu năng tối đa, nên thứ tự ưu tiên thiết kế khác với loại dùng cho trung tâm dữ liệu. Chỉ cần suy luận chậm một khung hình cũng liên quan trực tiếp đến an toàn, nên ở đây tính dự đoán được chính là chất lượng hơn là thông lượng.

Thứ tư, cạnh tranh hệ sinh thái bán dẫn AI và chiến lược quốc gia. Đối đầu với cục diện lấy GPU Nvidia làm trung tâm, các hyperscaler như Google·Amazon·Microsoft đang tự thiết kế NPU riêng (TPU, Trainium/Inferentia, Maia v.v.) để nội bộ hóa chi phí·chuỗi cung ứng, và tại Hàn Quốc cũng đang thúc đẩy phát triển bán dẫn AI cho trung tâm dữ liệu như một nhiệm vụ cấp quốc gia. Điều này cho thấy NPU đã được nâng tầm vượt khỏi một linh kiện đơn thuần thành hạ tầng cốt lõi của chủ quyền AI·năng lực cạnh tranh công nghiệp. Tuy nhiên, người ta liên tục xác nhận rằng yếu tố phân định thắng thua của cuộc cạnh tranh này không chỉ là hiệu năng chip mà còn là sự trưởng thành của hệ sinh thái trình biên dịch·framework·nhà phát triển như đã đề cập. Thực tế, lý do chính khiến những người đến sau dù vượt trội về thông số phần cứng vẫn chật vật trên thị trường thường là khoảng cách hệ sinh thái phần mềm, nên "năng lực làm ra chip" và "năng lực khiến người ta dùng chip" được xem là hai bài toán riêng biệt.

Thứ năm, sự hội tụ của các mô hình tính toán. NPU không loại trừ PIM (tính toán trong bộ nhớ)·neuromorphic·tính toán analog trong bộ nhớ đã đề cập trước đó, mà ngược lại đang hội tụ theo hướng cùng tấn công nút thắt bộ nhớ. Ví dụ, việc kết hợp dị thể — chia lớp phụ thuộc băng thông cho PIM/HBM và phép nhân ma trận dày đặc cho mảng systolic — đang được nghiên cứu, nên trong tương lai NPU nhiều khả năng sẽ tiến hóa thành trục trung tâm của bộ tăng tốc dị thể chứa nhiều phương thức tính toán trong một gói, thay vì một kiến trúc đơn nhất.

5. Các điểm cần lưu ý và hàm ý

Từ góc nhìn Kỹ sư chuyên nghiệp (Professional Engineer), việc áp dụng·thiết kế·chiến lược NPU có thể được tổng hợp như sau.

  • Ưu tiên lựa chọn theo mức độ phù hợp workload: NPU không vạn năng mà là bộ tăng tốc chuyên biệt cho phép toán ma trận có quy luật·dày đặc. Trước khi áp dụng, cần kiểm chứng bằng benchmark xem workload mục tiêu có thực sự hưởng lợi thế NPU theo đặc tính bộ nhớ·tính toán hay không (tích chập·transformer v.v.), và lấy phân chia dị thể — giữ logic bất quy tắc·hướng điều khiển lại trên CPU — làm nguyên tắc thiết kế.

  • Quản lý đánh đổi giữa hiệu quả và độ chính xác: Lượng tử hóa·thưa hóa·độ chính xác thấp nâng hiệu quả điện năng đáng kể nhưng kéo theo rủi ro giảm độ chính xác mô hình. Cần thiết lập tiêu chí chấp nhận định lượng (SLA) quản lý đồng thời huấn luyện nhận biết lượng tử hóa (QAT), phân tích độ nhạy theo độ chính xác, và mục tiêu ba bên độ chính xác - độ trễ - điện năng.

  • Bảo đảm hệ sinh thái phần mềm·tính khả chuyển (Portability): Hiệu năng NPU phụ thuộc lớn vào trình biên dịch·runtime, và rủi ro phụ thuộc nhà cung cấp (Lock-in) lớn. Cần tận dụng biểu diễn trung gian chuẩn như ONNX·MLIR và ngăn xếp trình biên dịch mở để bảo đảm tính khả chuyển, đồng thời xem xét ngay từ giai đoạn thiết kế một tầng trừu tượng không phụ thuộc nhà cung cấp cụ thể.

  • Tính kinh tế theo tổng chi phí sở hữu (TCO) và góc nhìn điện năng·làm mát: Khi áp dụng cho trung tâm dữ liệu, cần đánh giá tính kinh tế so với GPU theo TCO bao gồm không chỉ đơn giá chip mà cả điện năng·làm mát·mật độ rack·tỷ lệ nhàn rỗi. Hiệu quả điện năng (TOPS/W) liên quan trực tiếp đến chi phí vận hành và phát thải carbon, nên từ góc nhìn ESG·IT xanh, lợi thế hiệu quả của NPU cũng mang giá trị chiến lược.

  • Lộ trình tích hợp với công nghệ liên quan: NPU phát huy hiệu quả tối đa khi kết hợp với đổi mới bộ nhớ như HBM·PIM, tích hợp dị thể·interconnect như chiplet·CXL, và MLOps·framework on-device. Nên tiếp cận từ góc nhìn lộ trình đồng thiết kế cấp hệ thống bao trùm bộ nhớ·đóng gói·phần mềm, chứ không phải áp dụng đơn lẻ.

  • Quản trị·quản lý vòng đời: Chuyên biệt hóa phần cứng càng sâu thì quản lý tính nhất quán giữa các phiên bản mô hình - trình biên dịch - phần cứng càng quan trọng. Cần tích hợp pipeline lượng tử hóa lại·biên dịch lại khi cập nhật mô hình vào MLOps, và trang bị hệ thống trừu tượng hóa·kiểm chứng hồi quy để chuẩn bị cho thay thế thế hệ phần cứng, nhằm giảm rủi ro vận hành dài hạn.

  • Triển vọng: Chừng nào định luật Moore còn chậm lại, tăng tốc chuyên biệt theo miền sẽ còn lan rộng, và NPU được dự báo sẽ trở thành trục điện toán thường trực song hành với CPU·GPU. Hội tụ với tính toán analog·trong bộ nhớ, tính toán quang học v.v., cùng việc chuyên biệt sâu hơn cho suy luận AI tạo sinh sẽ là các hướng phát triển chính.

Tài liệu tham khảo


Tóm tắt một câu: NPU là bộ tăng tốc chuyên dụng cho AI, tăng tốc chuyên biệt phép nhân-cộng dồn của mạng nơ-ron bằng mảng systolic·tính toán độ chính xác thấp·tái sử dụng dữ liệu, kết hợp bổ trợ với CPU·GPU để trở thành trục thứ ba của điện toán đảm nhận hiệu quả điện năng của kỷ nguyên AI từ on-device đến trung tâm dữ liệu.