Mạng nơ-ron nhân tạo (Artificial Neural Network)
1. Tổng quan
A. Định nghĩa
Mô hình mô phỏng cấu trúc nơ-ron của não người, kết nối theo tầng các nút áp dụng hàm kích hoạt lên tổng có trọng số của đầu vào, và học trọng số để nhận dạng·dự đoán mẫu. Đây là nền tảng của học sâu (deep learning).
Nhận thức cốt lõi của mạng nơ-ron nhân tạo là "xấp xỉ một hàm phức tạp bằng cách chồng các đơn vị tính toán đơn giản (nơ-ron) thành nhiều tầng". Một nơ-ron chỉ thực hiện phép toán đơn giản: nhân đầu vào với trọng số, cộng lại rồi cho qua hàm kích hoạt, nhưng khi chồng nhiều tầng nơ-ron như vậy thì có thể xấp xỉ bất kỳ hàm liên tục nào với độ chính xác mong muốn (định lý xấp xỉ phổ quát). Thay vì con người viết từng quy tắc, để mô hình tự tìm ra quy tắc bằng cách điều chỉnh trọng số từ dữ liệu — đó là khác biệt căn bản so với lập trình truyền thống.
B. Các thành phần và vai trò
flowchart LR
I[Tầng đầu vào] --> H1[Tầng ẩn 1]
H1 --> H2[Tầng ẩn 2]
H2 --> O[Tầng đầu ra]
Mạng nơ-ron gồm tầng đầu vào·tầng ẩn·tầng đầu ra, mỗi tầng đảm nhận vai trò khác nhau. Tầng đầu vào là cửa ngõ tiếp nhận đặc trưng (feature), tầng ẩn biến đổi phi tuyến đầu vào và tạo ra các biểu diễn ngày càng trừu tượng. Đây là lý do tầng càng sâu (= càng nhiều tầng ẩn) thì khả năng biểu diễn càng lớn, và là căn cứ của tên gọi học "sâu (deep)". Tầng đầu ra đưa ra giá trị dự đoán cuối cùng. Mỗi nơ-ron tính tổng có trọng số z = Σwᵢxᵢ + b rồi áp dụng hàm kích hoạt f(z); khi đó nếu hàm kích hoạt không phi tuyến thì dù chồng bao nhiêu tầng cũng sụp đổ thành một phép biến đổi tuyến tính duy nhất. Tức là hàm kích hoạt phi tuyến là chìa khóa thực sự làm sống dậy khả năng biểu diễn của cấu trúc sâu.
| Thành phần | Vai trò |
|---|---|
| Nơ-ron (nút) | Tính tổng có trọng số z=Σwᵢxᵢ+b rồi kích hoạt |
| Trọng số (w)·độ lệch (b) | Tham số được điều chỉnh qua học |
| Tầng đầu vào | Nhập đặc trưng (feature) |
| Tầng ẩn | Trích xuất·biến đổi đặc trưng phi tuyến (độ sâu = khả năng biểu diễn) |
| Tầng đầu ra | Xuất giá trị dự đoán (phân loại·hồi quy) |
| Hàm kích hoạt | Đưa vào tính phi tuyến (không có thì tương đương mô hình tuyến tính) |
2. Mạng nơ-ron truyền thẳng (FFNN)
Mạng nơ-ron cơ bản (MLP) trong đó tín hiệu chỉ lan truyền theo một hướng đầu vào→ẩn→đầu ra và không có vòng lặp.
FFNN là dạng cơ bản của suy luận (lan truyền thuận) thực hiện dự đoán. Vì không có vòng lặp, phép tính chảy một lần theo thứ tự các tầng, mỗi tầng nhận đầu ra của tầng trước làm đầu vào và lặp lại tổng có trọng số và kích hoạt. Thủ tục là ① tính tổng có trọng số z = Wx + b ở mỗi tầng, ② áp dụng hàm kích hoạt a = f(z), ③ chuyển kết quả làm đầu vào tầng tiếp theo, ④ đưa ra giá trị dự đoán cuối cùng ở tầng đầu ra. Ví dụ, khi đưa vào ảnh chữ số viết tay, các tầng ẩn dần dần tổ hợp các đặc trưng như nét·đường cong, và tầng đầu ra trả về xác suất của từng chữ số 0~9. Ở đây chưa diễn ra việc học; lan truyền thuận là bước "thử đưa ra đáp án bằng trọng số hiện tại".
3. Lan truyền ngược (Backpropagation)
Thuật toán học lan truyền ngược sai số (Loss) của đầu ra theo hướng đầu ra→đầu vào, dùng quy tắc chuỗi (Chain Rule) để tính gradient của từng trọng số và cập nhật bằng hạ gradient (gradient descent).
flowchart RL
L[Tính hàm mất mát] --> G[Lan truyền ngược gradient<br/>∂L/∂w]
G --> U[Cập nhật trọng số<br/>w := w - η·∂L/∂w]
Bản chất của việc học là "dịch chuyển trọng số từng chút theo hướng giảm sai số", và để làm vậy phải biết mỗi trọng số đóng góp bao nhiêu vào sai số (∂L/∂w). Vấn đề là tính riêng lẻ gradient của hàng triệu trọng số thì chi phí bùng nổ. Lan truyền ngược dùng quy tắc chuỗi để đưa tín hiệu sai số tính ở tầng đầu ra ngược về phía đầu vào, tái sử dụng·lan truyền gradient theo từng tầng, nhờ đó tính hiệu quả chỉ bằng một lượt duyệt ngược. Thủ tục là dự đoán bằng lan truyền thuận→tính hàm mất mát (MSE·cross-entropy)→lan truyền ngược sai số để tính gradient theo tầng→cập nhật bằng hạ gradient w := w - η·∂L/∂w, lặp lại theo đơn vị epoch. Tốc độ học η quá lớn thì phân kỳ, quá nhỏ thì học chậm, nên thiết lập phù hợp là quan trọng.
| Thủ tục | Nội dung |
|---|---|
| 1. Lan truyền thuận | Tính giá trị dự đoán bằng trọng số hiện tại |
| 2. Tính mất mát | Loss(dự đoán, đáp án) — MSE·Cross-Entropy |
| 3. Lan truyền ngược sai số | Tính gradient (Gradient) theo tầng bằng quy tắc chuỗi |
| 4. Cập nhật trọng số | Điều chỉnh bằng hạ gradient (η: tốc độ học), lặp theo Epoch |
Trong mạng sâu, gradient liên tục bị nhân qua các tầng nên phát sinh vấn đề biến mất về 0 (triệt tiêu) hoặc bùng nổ. Triệt tiêu là nguyên nhân khiến việc học dừng lại, và ReLU — cho gradient chảy nguyên vẹn, chuẩn hóa theo lô (batch normalization) — ổn định phân phối đầu vào của tầng, kết nối phần dư (ResNet) — cho tín hiệu nhảy qua tầng — đã giảm nhẹ đáng kể vấn đề này. Khi các kỹ thuật này ra đời, việc huấn luyện mạng nơ-ron rất sâu mới trở nên thực tiễn.
4. Các loại hàm kích hoạt
Hàm kích hoạt không chỉ đơn thuần đưa vào tính phi tuyến mà còn ảnh hưởng trực tiếp tới triệt tiêu gradient·khối lượng tính toán·cách diễn giải đầu ra. Sigmoid nén đầu ra về 0~1 nên dễ diễn giải thành xác suất, nhưng ở hai đầu gradient gần 0 nên gây triệt tiêu trong mạng sâu. Vì thế hàm chủ lực cho tầng ẩn trở thành ReLU — tính toán đơn giản và gradient giữ bằng 1 ở miền dương. Tuy nhiên ReLU có nhược điểm nơ-ron chết khi đầu vào âm (Dying ReLU), nên Leaky ReLU·ELU bổ sung cho điều này, và họ Transformer ưa dùng GELU mềm mại hơn. Ở tầng đầu ra, phân loại đa lớp dùng Softmax biến nhiều giá trị thành phân phối xác suất có tổng bằng 1. Tức là "tầng ẩn = họ ReLU, tầng đầu ra phân loại đa lớp = Softmax" là tổ hợp điển hình.
| Hàm | Miền đầu ra | Đặc điểm·công dụng |
|---|---|---|
| Sigmoid | 0~1 | Diễn giải xác suất, triệt tiêu gradient |
| Tanh | -1~1 | Tâm 0, vẫn còn triệt tiêu |
| ReLU | 0~∞ | Tính toán đơn giản·nhanh, chủ lực tầng ẩn |
| Leaky ReLU/ELU | Cho phép số âm | Giảm nhẹ Dying ReLU |
| GELU | ≈ReLU (mềm mại) | Dùng trong Transformer |
| Softmax | Tổng=1 | Xuất xác suất phân loại đa lớp (tầng đầu ra) |
5. Các lưu ý và hàm ý
- Quản lý quá khớp (overfitting): vì nhiều tham số nên dễ học thuộc lòng dữ liệu huấn luyện, cần bảo đảm khả năng tổng quát hóa bằng dropout tắt ngẫu nhiên nơ-ron, chính quy hóa ràng buộc độ lớn trọng số, và tăng cường dữ liệu.
- Chuyên biệt hóa cấu trúc: đã phát triển thành CNN cho mẫu không gian (hình ảnh), RNN/LSTM cho thứ tự·chuỗi thời gian, và Transformer dựa trên attention cho ngữ cảnh tầm xa. Chọn kiến trúc phù hợp với cấu trúc bài toán quyết định hiệu năng.
- Nền tảng của AI: AI tạo sinh·LLM ngày nay rốt cuộc cũng đứng trên mạng nơ-ron quy mô lớn và học bằng lan truyền ngược, nên nguyên lý cơ bản của mạng nơ-ron là điểm xuất phát để hiểu AI hiện đại.
Tóm tắt một câu: Mạng nơ-ron nhân tạo là mô hình xấp xỉ hàm phức tạp bằng cách chồng các nơ-ron tổng có trọng số + kích hoạt phi tuyến thành tầng, trong đó FFNN dự đoán theo chiều thuận, lan truyền ngược dùng quy tắc chuỗi để tính hiệu quả gradient sai số và cập nhật trọng số, và việc chọn hàm kích hoạt như ReLU·Softmax quyết định độ ổn định của việc học và hiệu năng.