← Về danh sách
Phần cứng & Bán dẫn
#뉴로모픽#SNN#신경모방#저전력AI#In-memory#128회
Cập nhật lần cuối · 2026-09-07

Chip mô phỏng thần kinh (Neuromorphic Chip)

1. Tổng quan

A. Định nghĩa

Chip mô phỏng thần kinh (Neuromorphic Chip) là bán dẫn mô phỏng thần kinh bắt chước bằng phần cứng cấu trúc và cách hoạt động của nơ-ron (neuron) và khớp thần kinh (synapse) trong não người, tích hợp tính toán với ghi nhớ và tính toán song song dựa trên sự kiện, qua đó hiện thực hóa xử lý AI tiêu thụ điện năng cực thấp.

Ý tưởng cốt lõi của chip mô phỏng thần kinh là 'làm máy tính giống bộ não để nó hoạt động hiệu quả như bộ não'. Ngày nay phần lớn máy tính tuân theo kiến trúc von Neumann (von Neumann architecture). Đơn vị tính toán (CPU) và bộ nhớ tách rời về mặt vật lý, lệnh và dữ liệu liên tục được chuyển qua bus giữa hai bên. Tốc độ tính toán đã nhanh hơn, nhưng băng thông của đường truyền dữ liệu này giới hạn hiệu năng và quá trình di chuyển tiêu tốn lượng điện năng khổng lồ. Hiện tượng này được gọi là nút thắt von Neumann (von Neumann bottleneck) hay 'bức tường bộ nhớ (memory wall)'. Các tác vụ trao đổi dữ liệu khối lượng lớn như học sâu quy mô lớn càng chịu tác động chí mạng của nút thắt này.

Ngược lại, bộ não người hoạt động theo cách hoàn toàn khác. Khoảng 86 tỷ nơ-ron, mỗi nơ-ron đồng thời thực hiện tính toán và ghi nhớ (In-memory), chỉ gửi tín hiệu điện ngắn gọi là xung (spike) tới nơ-ron lân cận khi có kích thích (event-driven), và vô số nơ-ron hoạt động song song quy mô lớn. Kết quả là bộ não xử lý các tác vụ nhận thức mà siêu máy tính tốn vài megawatt chỉ với khoảng 20W — mức điện năng của một bóng đèn sợi đốt. Chip mô phỏng thần kinh hiện thực ba nguyên lý này của não (tích hợp tính toán–ghi nhớ, xung dựa trên sự kiện, song song quy mô lớn) bằng bán dẫn, vòng qua nút thắt von Neumann và nâng căn bản hiệu suất điện năng của tính toán AI. Việc biểu diễn và truyền thông tin được thực hiện bằng mạng nơ-ron xung (SNN, Spiking Neural Network) mô phỏng sự phát xung của nơ-ron sinh học.

B. Bối cảnh ra đời

Khi học sâu lan rộng, quy mô mô hình và khối lượng tính toán huấn luyện, suy luận tăng theo cấp số nhân, và việc xử lý bằng các cụm GPU quy mô lớn khiến tiêu thụ điện và tỏa nhiệt của trung tâm dữ liệu trở thành ràng buộc nghiêm trọng. Đồng thời, ở môi trường biên phải hoạt động thường trực bằng pin như điện thoại thông minh, thiết bị đeo, IoT, thiết bị tự hành, nhu cầu chạy AI ngay trong thiết bị với điện năng thấp mà không gửi dữ liệu lên đám mây ngày càng lớn.

Khi nhận thức lan rộng rằng với sự chậm lại của định luật Moore và 'bức tường bộ nhớ' ngày càng nghiêm trọng, chỉ cải tiến kiến trúc hiện có khó đáp ứng yêu cầu này, các cách tiếp cận thay đổi chính phương thức tính toán đã được chú ý. Yêu cầu về một mô thức tính toán mới vượt qua giới hạn điện năng và nút thắt của kiến trúc von Neumann là bối cảnh ra đời của điện toán mô phỏng thần kinh.

2. So sánh với kiến trúc von Neumann

Xét theo cấu trúc tổng thể, khác biệt căn bản giữa hai phương thức là 'tính toán và ghi nhớ có tách rời hay không'. Kiến trúc von Neumann bắt buộc phải di chuyển qua lại giữa CPU và bộ nhớ, còn mô phỏng thần kinh thì tính toán và ghi nhớ diễn ra như một thể thống nhất bên trong phần tử nơ-ron, khớp thần kinh.

flowchart LR
  subgraph V["Kiến trúc von Neumann"]
    C["Đơn vị tính toán (CPU)"] <-->|"Di chuyển dữ liệu (nút thắt)"| M["Bộ nhớ"]
  end
  subgraph N["Kiến trúc mô phỏng thần kinh"]
    NN["Phần tử nơ-ron<br/>(tích hợp tính toán+ghi nhớ)"] <-->|"Khớp thần kinh (trọng số)"| NN2["Phần tử nơ-ron"]
  end
  V -.->|"Vượt qua giới hạn nút thắt·điện năng"| N
  style N fill:#e8f0fe,stroke:#2f6fed,stroke-width:2px

Tổng hợp thành bảng các kết quả thực tiễn mà khác biệt cấu trúc này tạo ra, nhưng 'lý do' của từng mục mới là điều quan trọng. Về cách xử lý, von Neumann tối ưu cho thực thi tuần tự từng lệnh một, còn mô phỏng thần kinh dựa trên sự kiện — chỉ nơ-ron liên quan phản ứng khi có kích thích — nên không phải mọi phần tử luôn hoạt động. Vì thế có khác biệt lớn về điện năng — vì khi không có dữ liệu thì gần như không phát sinh tính toán lẫn tiêu thụ điện (sparse activity). Đây là lý do căn bản khiến mô phỏng thần kinh được gọi là 'AI điện năng thấp'.

Phân loại Kiến trúc von Neumann Chip mô phỏng thần kinh
Cấu trúc Tách tính toán và bộ nhớ Tích hợp tính toán và bộ nhớ (nơ-ron, khớp thần kinh)
Xử lý Tuần tự (thực thi lệnh) Song song, dựa trên sự kiện (xung)
Biểu diễn thông tin Giá trị nhị phân (bit) Thời điểm và tần suất phát xung
Điện năng Cao (di chuyển dữ liệu, hoạt động thường trực) Rất thấp (chỉ hoạt động khi có kích thích)
Thế mạnh Tính toán đa dụng, chính xác Nhận dạng mẫu điện năng thấp, suy luận thường trực

3. Các yếu tố công nghệ cốt lõi và nguyên lý hoạt động

A. Mạng nơ-ron xung (SNN)

Thứ tương ứng với bộ não phần mềm của chip mô phỏng thần kinh là SNN. Khác với mạng nơ-ron nhân tạo (ANN) truyền thống, nơi mỗi nơ-ron nhân và cộng các giá trị thực liên tục rồi chuyển sang lớp kế tiếp, SNN giống nơ-ron sinh học, chỉ phát xung vào khoảnh khắc đầu vào tích lũy vượt ngưỡng (threshold). Mô hình tiêu biểu là nơ-ron LIF (Leaky Integrate-and-Fire): tích phân (integrate) dòng điện đầu vào vào điện thế màng, phát xung khi đạt ngưỡng, và nếu không phát xung thì điện thế rò rỉ dần (leaky). Thông tin nằm ở chỗ xung phát sinh 'khi nào, thường xuyên đến mức nào' (mã hóa thời gian, temporal coding) hơn là bản thân giá trị. Tính thưa (sparsity) — không có kích thích thì không có tính toán — là cốt lõi của điện năng thấp. Tuy nhiên, việc phát xung gián đoạn này khó lấy đạo hàm nên không dùng nguyên được lan truyền ngược (back-propagation) truyền thống, cần các kỹ thuật học riêng như gradient thay thế (surrogate gradient) hoặc chuyển đổi ANN-SNN.

B. In-memory Computing và phần tử khớp thần kinh

Phương pháp vật lý để loại bỏ nút thắt von Neumann là In-memory Computing (tính toán trong bộ nhớ). Thay vì đưa dữ liệu về CPU tính toán rồi ghi trả lại, phép tính được thực hiện ngay tại vị trí phần tử bộ nhớ lưu dữ liệu. Để làm được điều này, người ta nghiên cứu các phần tử mới có thể vừa lưu 'cường độ kết nối (trọng số)' của khớp thần kinh vừa thực hiện tính toán tương tự (analog). Tiêu biểu là memristor (Memristor) — phần tử có điện trở thay đổi theo lịch sử dòng điện chạy qua — biểu diễn trọng số khớp thần kinh bằng trạng thái điện trở và thực hiện vật lý phép nhân–tích lũy (MAC) bằng định luật Ohm và định luật Kirchhoff. Các phần tử như PCM (bộ nhớ thay đổi pha), ReRAM cũng được dùng cho cùng mục đích. Vì tính toán và lưu trữ diễn ra trong cùng một phần tử, việc di chuyển dữ liệu biến mất, và điều này trực tiếp dẫn tới giảm điện năng và độ trễ.

C. Xử lý bất đồng bộ, dựa trên sự kiện

Chip mô phỏng thần kinh không đồng bộ toàn bộ bằng một xung nhịp để điều khiển mọi phần tử ở mỗi chu kỳ, mà mỗi lõi hoạt động bất đồng bộ chỉ khi có xung (sự kiện) tới. Với cách này, đầu vào càng thưa thì điện năng nhàn rỗi càng thấp đến cực độ, và tự nhiên có được tính song song quy mô lớn khi nhiều lõi đồng thời xử lý các sự kiện khác nhau. Dưới đây là sơ đồ khái niệm luồng dữ liệu từ cảm nhận → mã hóa xung → xử lý SNN → kết quả suy luận.

flowchart TD
  S["Đầu vào cảm biến<br/>(hình ảnh·âm thanh·sự kiện)"] --> E["Mã hóa xung<br/>(kích thích→phát xung)"]
  E --> Q["Lõi mô phỏng thần kinh<br/>tính toán song song SNN"]
  Q --> W["Khớp thần kinh in-memory<br/>nhân·tích lũy trọng số"]
  W --> F{"Vượt ngưỡng?"}
  F -->|"Có"| O["Phát xung<br/>→ kết quả suy luận"]
  F -->|"Không"| Q
  style Q fill:#e8f0fe,stroke:#2f6fed,stroke-width:2px

D. Khác biệt giữa ANN và SNN

Mạng nơ-ron nhân tạo (ANN) của học sâu truyền thống và SNN của mô phỏng thần kinh khác nhau ngay từ cách biểu diễn thông tin. Trong ANN, mỗi nơ-ron xuất ra một giá trị kích hoạt thực ở mỗi thời điểm và mọi nơ-ron cập nhật đồng bộ, nên dù có đầu vào hay không, toàn bộ mạng vẫn thực hiện tính toán dày đặc (dense). Ngược lại, SNN có trục thời gian tường minh, và nơ-ron chỉ truyền xung nhị phân (0/1) tới lân cận khi phát xung. Tức là thông tin được mang bởi 'thời điểm, tần suất phát xung' chứ không phải 'độ lớn của giá trị'. Vì khác biệt này, SNN có lợi thế khối lượng tính toán và điện năng giảm mạnh khi đầu vào càng thưa, nhưng phải trả giá là thêm chiều thời gian và phát xung gián đoạn nên khó huấn luyện.

Hàm ý về mặt huấn luyện cũng lớn. ANN có lan truyền ngược đã được xác lập — lấy đạo hàm sai số theo hướng từ đầu ra về đầu vào để cập nhật trọng số — nhưng xung của SNN không khả vi nên không áp dụng nguyên được. Vì vậy, người ta nghiên cứu gradient thay thế (surrogate gradient) xấp xỉ hàm phát xung bằng hàm trơn, cách chuyển ANN đã học tốt sang SNN, và các quy tắc cục bộ về mặt sinh học như STDP (tính dẻo phụ thuộc thời điểm xung). Về độ chính xác, ANN trưởng thành vẫn thường dẫn trước, nhưng lợi thế của SNN về hiệu suất điện năng và độ trễ bù lại điều này trong các ứng dụng biên.

E. Các chip tiêu biểu và phương thức học

Các chip mô phỏng thần kinh thương mại và nghiên cứu gồm Loihi/Loihi 2 của Intel, TrueNorth, NorthPole của IBM, SpiNNaker của Đại học Manchester (Anh), v.v. Loihi 2 hỗ trợ 128 lõi mô phỏng thần kinh bất đồng bộ và học trên chip (on-chip learning), có thể thích ứng bằng cách cập nhật trọng số khớp thần kinh ngay bên trong chip. Học trên chip như vậy có lợi cho AI biên tự học trên thiết bị mà không gửi dữ liệu lên đám mây. Dưới đây so sánh định hướng của các chip tiêu biểu; cùng là 'mô phỏng thần kinh' nhưng triết lý thiết kế rẽ nhánh, như SNN hoàn toàn dựa trên sự kiện (Loihi) và tăng tốc suy luận độ chính xác thấp (NorthPole).

Chip Chủ thể Đặc điểm
Loihi 2 Intel 128 lõi, học trên chip, SNN hoàn toàn dựa trên sự kiện
TrueNorth IBM Cỡ 1 triệu nơ-ron, chuyên suy luận điện năng siêu thấp (nghiên cứu)
NorthPole IBM Tăng tốc suy luận độ chính xác thấp (2~8bit), tính toán gần bộ nhớ
SpiNNaker Univ. of Manchester Mô phỏng SNN quy mô lớn bằng nhiều lõi ARM

Ở đây, hệ thống quy mô lớn ghép nhiều Loihi 2 lại chính là Hala Point sẽ được đề cập phía sau, cho thấy mô phỏng thần kinh có thể mở rộng vượt khỏi một chip đơn lẻ lên cấp hệ thống.

4. So sánh các trường hợp áp dụng và xu hướng ngành

Thế mạnh của mô phỏng thần kinh nổi bật ở 'nhận dạng mẫu, phát hiện bất thường hoạt động thường trực với điện năng thấp'. Trường hợp tiêu biểu là kết hợp với camera sự kiện (DVS, Dynamic Vision Sensor). Khác với camera thông thường chụp toàn bộ khung hình theo từng khung định sẵn, camera sự kiện chỉ xuất bất đồng bộ dưới dạng xung những điểm ảnh có độ sáng thay đổi. Luồng sự kiện thưa này khớp định dạng với đầu vào của SNN, nên chip mô phỏng thần kinh có thể theo dõi chuyển động với độ trễ cỡ micro giây mà không cần chuyển đổi riêng. Với cảnh nền đứng yên, hầu như không có sự kiện để truyền và tính toán nên điện năng thấp đến cực độ. Đặc tính này đặc biệt có lợi cho nhận thức thời gian thực của xe tự hành, drone, robot vốn đòi hỏi đồng thời phản ứng nhanh và điện năng thấp.

Thứ hai, trong thiết bị đeo và chăm sóc sức khỏe phải hoạt động thường trực bằng pin, việc giám sát liên tục với điện năng thấp các mẫu bất thường của tín hiệu sinh học như điện tâm đồ, điện cơ đang được nghiên cứu. Thứ ba, trong nhà máy thông minh có bảo trì dự đoán (predictive maintenance), liên tục học và giám sát tín hiệu rung, âm thanh của thiết bị để dự báo sớm hỏng hóc. Điểm chung của ba trường hợp là tính thưa 'dữ liệu phần lớn thời gian bình thường thì yên lặng, chỉ biến đổi đột ngột khi bất thường', và đây chính là điều kiện để hiệu suất điện năng của mô phỏng thần kinh dựa trên sự kiện được tối đa hóa.

Trường hợp tiêu biểu cho thấy tiến bộ về quy mô là Hala Point, hệ thống mô phỏng thần kinh quy mô lớn do Intel xây dựng tại Phòng thí nghiệm Quốc gia Sandia (Mỹ). Theo tài liệu công bố, hệ thống này dùng 1.152 bộ xử lý Loihi 2 để hiện thực khoảng 1,15 tỷ nơ-ron và hàng chục tỷ khớp thần kinh, nhưng vẫn nằm gọn trong khung 6U cỡ lò vi sóng với công suất tiêu thụ tối đa khoảng 2.600W, hiệu suất điện năng so với quy mô nơ-ron rất cao. Điều này gợi ý rằng mô phỏng thần kinh có thể mở rộng không chỉ ở biên cỡ nhỏ mà cả thành cách tiếp cận cấp trung tâm dữ liệu cho 'AI bền vững'. Tuy nhiên, các con số này là giá trị công bố ở giai đoạn nghiên cứu, thử nghiệm, và hiệu năng thực tế trên khối lượng công việc AI đa dụng có thể khác nhau tùy ứng dụng.

Mặt khác, so sánh công bằng hiệu năng mô phỏng thần kinh không dễ. GPU có thước đo quen thuộc là số phép tính dấu phẩy động mỗi giây (FLOPS), nhưng với SNN dựa trên sự kiện, bản thân khối lượng tính toán thay đổi theo độ thưa của đầu vào nên khó đo bằng cùng thước. Vì vậy phải xem đồng thời 'năng lượng mỗi xung (pJ/spike)', 'năng lượng mỗi lần suy luận (mJ/inference)', độ trễ (latency), và nhất thiết phải xét hiệu suất điện năng gấp bao nhiêu lần GPU trên cùng một nhiệm vụ (iso-accuracy). Những con số kiểu 'điện năng thấp hơn hàng trăm đến hàng nghìn lần' được công bố cũng có thể chỉ giới hạn ở khối lượng công việc thưa cụ thể, nên cần tránh khái quát hóa khi chưa xác nhận điều kiện ứng dụng.

Theo xu hướng ngành, mô phỏng thần kinh đang định vị theo hướng phân chia vai trò với GPU hơn là thay thế. Cục diện thực tế là huấn luyện quy mô lớn và suy luận đa dụng vẫn do GPU/NPU đảm nhận, còn mô phỏng thần kinh được dùng làm bộ tăng tốc bổ trợ trong lĩnh vực nhận thức biên nơi thường trực, điện năng thấp, độ trễ thấp là yếu tố quyết định.

5. Chuyên sâu — Hệ sinh thái phần mềm và thách thức tiêu chuẩn hóa

Mô phỏng thần kinh là một trong nhiều cách tiếp cận vòng qua nút thắt von Neumann, và hữu ích khi hiểu trong quan hệ với các công nghệ lân cận. Nó chia sẻ khái niệm với In-memory Computing (PIM) thực hiện nhân–tích lũy trong bộ nhớ, trùng với AI trên thiết bị và NPU gọn nhẹ ở mục tiêu AI biên điện năng thấp, và trong bức tranh lớn 'hậu von Neumann' được xếp chung với điện toán lượng tử thành một nhánh của điện toán phi von Neumann. Tuy nhiên, tính chất mỗi công nghệ khác nhau — nếu PIM, NPU nhấn mạnh 'tăng tốc' hiệu quả hơn các phép tính học sâu hiện có, thì mô phỏng thần kinh hướng tới chuyển đổi căn bản hơn: thay đổi chính cách biểu diễn thông tin (xung, mã hóa thời gian) cho gần với não. Khác biệt này cũng chính là độ lớn của rào cản gia nhập hệ sinh thái.

Lý do lớn nhất khiến mô phỏng thần kinh dù có tiềm năng phần cứng vẫn chưa được thương mại hóa rộng rãi là hệ sinh thái phần mềm và thuật toán chưa trưởng thành. Học sâu dựa trên GPU có ngăn xếp phát triển trưởng thành nối tiếp CUDA, PyTorch, TensorFlow, lượng mô hình tiền huấn luyện đồ sộ và nguồn nhân lực, trong khi SNN còn đang xác lập phương pháp huấn luyện và các framework (ví dụ Intel Lava, snnTorch, Norse, v.v.) còn ở giai đoạn tương đối sơ khai. Chồng chất thêm là khó khăn căn bản không dùng được lan truyền ngược chuẩn do phát xung gián đoạn của SNN, thách thức về độ chính xác vẫn thua ANN trưởng thành, và tính di động thấp do mỗi chip có kiến trúc, API khác nhau. Vì thế giới học thuật và công nghiệp coi các thách thức cốt lõi là nâng độ chính xác của thuật toán huấn luyện SNN (gradient thay thế, chuyển đổi ANN), chuẩn hóa công cụ phát triển và benchmark trung lập với nhà cung cấp, và bảo đảm pipeline tích hợp cảm biến sự kiện–chip. Chìa khóa để biến ưu thế điện năng của phần cứng thành thành quả ứng dụng thực tế rốt cuộc nằm ở hệ sinh thái phần mềm này.

Tóm lại, mức trưởng thành của mô phỏng thần kinh được phân định không phải bằng 'số nơ-ron của chip' mà bằng 'công cụ, mô hình, tiêu chuẩn mà lập trình viên dễ sử dụng được trang bị đến đâu'. Xét việc hệ sinh thái GPU đã tích lũy hơn 10 năm xoay quanh trục CUDA, nhiều khả năng hệ sinh thái mô phỏng thần kinh cũng sẽ hình thành dần xoay quanh các ứng dụng sát thủ (trường hợp sử dụng chỉ thành lập khi nhất thiết phải điện năng thấp). Từ góc nhìn Kỹ sư chuyên nghiệp (Professional Engineer), nên lấy đường cong trưởng thành của hệ sinh thái và tiêu chuẩn này làm chỉ số cốt lõi cho quyết định áp dụng hơn là thông số phần cứng.

6. Những điều cần cân nhắc và hàm ý (góc nhìn Kỹ sư chuyên nghiệp)

  1. Là phương án thay thế triển vọng cho AI biên và AI trên thiết bị điện năng thấp. Có thể thực hiện suy luận AI với điện năng cực thấp trên IoT, thiết bị đeo, thiết bị tự hành hoạt động thường trực bằng pin, trở thành bước đột phá cho AI trên thiết bị — giảm phụ thuộc đám mây, cải thiện quyền riêng tư và độ trễ. Tuy nhiên, việc áp dụng nên được chọn lọc cho các khối lượng công việc mà thường trực, điện năng thấp, nhận dạng mẫu là cốt lõi.

  2. Bảo đảm hệ sinh thái phần mềm và thuật toán là mấu chốt thương mại hóa. Tốc độ trang bị công cụ phát triển, kỹ thuật huấn luyện, tiêu chuẩn SNN — vốn chưa trưởng thành so với GPU — sẽ quyết định tốc độ lan rộng. Tổ chức nên quan sát mức trưởng thành của framework (Lava, v.v.) và diễn biến chuẩn hóa benchmark để chuẩn bị thí điểm.

  3. Góc nhìn phân chia vai trò (lai) với GPU/NPU là thực tế. Cần tiếp cận bằng cấu trúc tăng tốc dị thể — GPU đảm nhận huấn luyện quy mô lớn, mô phỏng thần kinh đảm nhận nhận thức biên thường trực, độ trễ thấp — và việc áp dụng bổ trợ thay vì thay thế toàn diện là hợp lý.

  4. Cần công nghệ phần tử và quy trình trưởng thành cùng kiểm chứng độ tin cậy. Các phần tử analog mới như memristor, PCM vẫn còn vấn đề về độ biến thiên (variability), độ bền, độ chính xác, nên kiểm chứng khả năng tái hiện và độ tin cậy là tiền đề để áp dụng quy mô lớn. Cần cách tiếp cận tối ưu hóa đồng thời phần tử–mạch–thuật toán.

  5. Giá trị chiến lược lớn từ góc nhìn AI bền vững. Trong bối cảnh điện năng và carbon của trung tâm dữ liệu trở thành ràng buộc xã hội, hiệu suất điện năng của mô phỏng thần kinh có thể trở thành tài sản chiến lược về ESG và chi phí năng lượng. Cùng với điện toán lượng tử, đây là một trụ cột của điện toán tương lai vượt giới hạn von Neumann, đáng được xem xét làm đối tượng đầu tư và bảo đảm nhân lực trung và dài hạn.

Tài liệu tham khảo


Tóm tắt một câu: Chip mô phỏng thần kinh là bán dẫn mô phỏng thần kinh bắt chước nơ-ron, khớp thần kinh của não để tích hợp tính toán với bộ nhớ và tính toán song song dựa trên sự kiện bằng xung (SNN), là công nghệ triển vọng vượt qua nút thắt von Neumann và vấn đề điện năng của AI để hiện thực AI biên điện năng siêu thấp, nhưng sự trưởng thành của hệ sinh thái phần mềm SNN là mấu chốt thương mại hóa.