← Về danh sách
AI & Dữ liệu
#SOM#자기조직화지도#군집분석#비지도학습#Kohonen#134회
Cập nhật lần cuối · 2026-09-27

SOM (Self Organizing Map, Bản đồ tự tổ chức)

1. Tổng quan

A. Định nghĩa

SOM (Self Organizing Map) là mạng nơ-ron học không giám sát do Teuvo Kohonen (Phần Lan, 1982) đề xuất, là kỹ thuật ánh xạ dữ liệu đầu vào nhiều chiều lên lưới ít chiều (chủ yếu 2 chiều) trong khi bảo toàn cấu trúc liên kết (topology) để phân cụm, giảm chiều và trực quan hóa. Nó còn được gọi là Kohonen Map hay mạng Kohonen.

Ý tưởng cốt lõi của SOM xuất phát từ cách vận hành của vỏ đại não người. Trong não, người ta quan sát hiện tượng bản đồ theo cấu trúc liên kết (topographic map), trong đó các kích thích cảm giác tương tự (ví dụ: xúc giác của các ngón tay liền kề) được xử lý ở các vùng nơ-ron liền kề của vỏ đại não, và SOM mô phỏng nguyên lý này một cách nhân tạo. Nghĩa là mạng tự tổ chức (self-organizing) sao cho các đầu vào tương tự ứng với các nơ-ron gần nhau trên lưới đầu ra. Kết quả là quan hệ lân cận phức tạp của dữ liệu nhiều chiều được trải ra trên bản đồ hai chiều dưới dạng con người có thể nhìn bằng mắt. Chính "bảo toàn cấu trúc liên kết (topology preservation)" này là đặc trưng quyết định phân biệt SOM với các kỹ thuật phân cụm đơn thuần.

B. Bối cảnh ra đời và sự cần thiết

Khi số chiều của dữ liệu càng cao, "lời nguyền số chiều (curse of dimensionality)" phát sinh, khiến con người khó nắm bắt cấu trúc một cách trực giác. Nhìn trực tiếp vào dữ liệu khách hàng, gen, tài liệu được biểu diễn bằng hàng chục đến hàng trăm biến, ta không thể biết cái gì tương tự cái gì và có những cụm nào tồn tại. Phân cụm truyền thống (ví dụ: K-means) chia dữ liệu thành vài nhóm, nhưng không cho biết quan hệ tương hỗ giữa các cụm (cụm nào liền kề cụm nào). SOM thực hiện đồng thời phân cụm và trực quan hóa, đồng thời còn thể hiện cả quan hệ cấu trúc liên kết giữa các cụm trên bản đồ hai chiều, nên đáp ứng đồng thời hai yêu cầu là phân tích dữ liệu khám phá và giao tiếp trực quan về kết quả.

Ngoài ra, giảm chiều tuyến tính như PCA chiếu dữ liệu lên các trục trực giao có phương sai lớn, nên có hạn chế là không trải phẳng đúng cách các cấu trúc phi tuyến cong theo dạng mặt cong. SOM, theo phương thức các nơ-ron lưới tự sắp xếp dọc theo phân bố dữ liệu, làm tăng thêm sự cần thiết ở chỗ nó có thể nắm bắt cả cấu trúc đa tạp (manifold) phi tuyến. Đặc biệt, vì kết quả không ra dưới dạng "một dãy các điểm" mà là "một lưới có các vector nguyên mẫu diễn giải được", nó phát huy sức mạnh trong tình huống thực tế cần giải thích và thuyết phục các bên liên quan không chuyên về kết quả phân tích.

C. Đặc điểm

SOM là phương thức không giám sát học cấu trúc bên trong của dữ liệu mà không cần nhãn đáp án, và hoạt động bằng học cạnh tranh (competitive learning), trong đó các nơ-ron cạnh tranh nhau trước một đầu vào để chọn ra kẻ thắng. Đặc biệt, khác với học cạnh tranh thông thường chỉ cập nhật kẻ thắng, điểm cốt lõi của SOM là nó cập nhật cả các nơ-ron lân cận của kẻ thắng, điều này khiến các nơ-ron kề nhau có giá trị tương tự và hiện thực hóa việc bảo toàn cấu trúc liên kết. Nếu không có cập nhật lân cận, SOM chỉ dừng ở lượng tử hóa vector đơn thuần (học cạnh tranh), trong đó các nơ-ron rải rác riêng lẻ để xấp xỉ dữ liệu, và vị trí trên lưới không mang ý nghĩa gì. Nói cách khác, chỉ một cơ chế "cập nhật lân cận cùng nhau" đã nâng lượng tử hóa vector thành một bản đồ bảo toàn cấu trúc liên kết. Ngoài ra, vì là cấu trúc nông (2 lớp) không có lớp ẩn, nên không cần lan truyền ngược và việc diễn giải tương đối dễ.

Đặc điểm Nội dung
Học không giám sát Học cấu trúc dữ liệu mà không cần nhãn đáp án
Bảo toàn cấu trúc liên kết Duy trì quan hệ lân cận của không gian đầu vào trên lưới đầu ra
Học cạnh tranh Chọn kẻ thắng (BMU) qua cạnh tranh giữa các nơ-ron
Cập nhật lân cận Cập nhật kẻ thắng và các lân cận cùng nhau (điểm khác biệt cốt lõi)
Giảm chiều & trực quan hóa Phân cụm, trực quan hóa chiều cao trên lưới 2D (phi tuyến)

2. Cấu trúc và thành phần của SOM

flowchart LR
  subgraph IN["Lớp đầu vào (Input Layer)"]
    X["vector đầu vào nhiều chiều x = (x1..xn)"]
  end
  subgraph OUT["Lớp cạnh tranh/đầu ra (lưới 2D)"]
    N1(("nơ-ron"))
    N2(("nơ-ron"))
    N3(("BMU kẻ thắng"))
    N4(("nơ-ron"))
  end
  X -->|"vector trọng số w (kết nối đầy đủ)"| N1
  X --> N2
  X --> N3
  X --> N4
  N3 -.->|"cập nhật cùng nhau qua hàm lân cận"| N2
  N3 -.-> N4
  style N3 fill:#e8f0fe,stroke:#2f6fed

Khác với mạng nơ-ron sâu thông thường có nhiều lớp ẩn, SOM có cấu trúc đơn giản chỉ gồm hai lớp: lớp đầu vào và lớp cạnh tranh (lớp đầu ra). Lớp đầu vào chỉ là lối đi nhận vector đầu vào nhiều chiều mà không thực hiện tính toán, còn việc học thực chất diễn ra ở lớp cạnh tranh. Lớp cạnh tranh thường gồm các nơ-ron sắp xếp theo lưới hình vuông hoặc hình lục giác, và mỗi nơ-ron giữ một vector trọng số (tham chiếu) cùng số chiều với đầu vào. Nghĩa là nếu đầu vào là 20 chiều thì mọi nơ-ron cũng có vector trọng số 20 chiều, và vector này chính là mẫu hình "nguyên mẫu (prototype)" mà nơ-ron đó đại diện.

Về mặt cấu trúc, lớp đầu vào và lớp cạnh tranh được kết nối đầy đủ (fully connected), nên một vector đầu vào được truyền đồng thời tới tất cả nơ-ron của lớp cạnh tranh. Tuy nhiên, khác biệt là thay vì lan truyền tổng có trọng số sang lớp tiếp theo như mạng nơ-ron thông thường, kết nối chỉ được dùng để mỗi nơ-ron tính "độ tương tự (khoảng cách)" giữa vector trọng số của nó và đầu vào. Nghĩa là trong SOM, trọng số kết nối không phải kênh truyền tín hiệu mà chính là mẫu hình đại diện mà nơ-ron ghi nhớ. Hiểu được sự khác biệt về góc nhìn này thì tự nhiên hiểu được vì sao SOM học được ngay cả khi không có lan truyền ngược.

Khi một đầu vào đến, SOM tính khoảng cách (chủ yếu khoảng cách Euclid) giữa vector đầu vào và vector trọng số của mọi nơ-ron, rồi chọn nơ-ron gần nhất làm kẻ thắng, tức BMU (Best Matching Unit). Việc chọn kẻ thắng này tương ứng với "cạnh tranh". Sau đó, không chỉ BMU mà cả trọng số của các nơ-ron lân cận xung quanh BMU trên lưới cũng được kéo về phía đầu vào. Lúc này, mức độ kéo mạnh của mỗi lân cận được quyết định bởi hàm lân cận (neighborhood function, chủ yếu Gauss) giảm dần theo khoảng cách lưới tính từ BMU. Lân cận gần được cập nhật mạnh, lân cận xa được cập nhật yếu, nên khi việc học lặp lại, các nơ-ron kề nhau trên lưới có trọng số tương tự nhau và cấu trúc liên kết được bảo toàn. Điểm cần lưu ý ở đây là "lân cận" được định nghĩa theo vị trí trên lưới đầu ra chứ không phải trong không gian đầu vào, và đây chính là cơ chế chiếu quan hệ lân cận nhiều chiều xuống hai chiều.

Thành phần Nội dung
Lớp đầu vào Lối đi nhận vector đầu vào nhiều chiều (không tính toán)
Lớp cạnh tranh (lớp đầu ra) Nơ-ron lưới 2D, mỗi nơ-ron giữ một vector trọng số
Vector trọng số Vector tham chiếu được so với đầu vào (mẫu hình nguyên mẫu của nơ-ron)
BMU (Best Matching Unit) Nơ-ron kẻ thắng tương tự đầu vào nhất
Hàm lân cận Cập nhật các nơ-ron quanh BMU cùng nhau (Gauss), bán kính giảm
Tốc độ học Biên độ dịch chuyển trọng số, giảm khi việc học tiến triển

Việc chọn thước đo khoảng cách cũng là yếu tố làm thay đổi kết quả. SOM chuẩn dùng khoảng cách Euclid, nhưng có thể dùng khoảng cách cosine cho vector văn bản/thưa, khoảng cách Mahalanobis cho các biến kiểu hỗn hợp có tỉ lệ khác nhau, và khi thước đo thay đổi thì định nghĩa "tương tự" thay đổi, kéo theo ranh giới cụm của bản đồ cũng thay đổi. Do đó, thiết kế đồng thời thước đo khoảng cách và cách co giãn biến phù hợp với đặc tính miền là điều kiện tiên quyết để có được bản đồ tốt.

Hình dạng và kích thước của lưới cũng là yếu tố thiết kế. Nếu sắp xếp nơ-ron theo lưới hình vuông thì lân cận của mỗi nơ-ron được định nghĩa là 4 (trên/dưới/trái/phải, hoặc 8 nếu tính cả chéo); nếu sắp xếp theo lưới hình lục giác thì có 6 lân cận, giảm thiên lệch hướng và làm việc thể hiện cấu trúc liên kết tự nhiên hơn, nên được ưa chuộng khi coi trọng chất lượng trực quan hóa. Kích thước lưới, tức tổng số nơ-ron, quyết định luôn độ phân giải của bản đồ: quá nhỏ thì các cụm khác nhau dồn vào một nơ-ron và không phân biệt được, quá lớn thì có nhiều nơ-ron rỗng không có dữ liệu và chi phí học tăng. Theo kinh nghiệm, có thông lệ bắt đầu từ mức tỉ lệ với căn bậc hai của số điểm dữ liệu (ví dụ khoảng 5√N của cỡ mẫu) rồi điều chỉnh, nhưng nên xem đây không phải quy tắc tuyệt đối mà là điểm khởi đầu để tinh chỉnh theo mục tiêu và dữ liệu.

3. Quy trình học

flowchart TB
  A["khởi tạo trọng số<br/>(ngẫu nhiên hoặc dựa trên PCA)"] --> B["trình bày vector đầu vào x"]
  B --> C["tính khoảng cách tới mọi nơ-ron"]
  C --> D["chọn nơ-ron khoảng cách nhỏ nhất làm BMU"]
  D --> E["cập nhật trọng số BMU và lân cận<br/>về phía đầu vào"]
  E --> F["thu nhỏ tốc độ học và bán kính lân cận"]
  F --> G{"hội tụ hoặc<br/>đạt số lần lặp tối đa?"}
  G -->|"không"| B
  G -->|"có"| H["kết thúc học<br/>(hoàn thành bản đồ bảo toàn cấu trúc liên kết)"]

Cốt lõi của việc học SOM là "lặp lại việc chọn kẻ thắng và di chuyển kẻ thắng cùng các lân cận của nó một chút về phía đầu vào". Quy tắc cập nhật trọng số về mặt khái niệm có dạng trọng số mới = trọng số cũ + tốc độ học × cường độ lân cận × (đầu vào − trọng số cũ), kéo vector nguyên mẫu của nơ-ron từng chút một về phía đầu vào quan sát được. Cường độ lân cận thường được cho theo dạng Gauss exp(−d²/2σ²) đối với khoảng cách lưới d tính từ BMU và bán kính lân cận hiện tại σ, gần 1 tại chính BMU và hội tụ về 0 khi khoảng cách tăng. Quy tắc này là một biến thể cạnh tranh của học Hebb (Hebbian learning), hiện thực hóa bằng công thức nguyên lý tự tổ chức rằng "một nơ-ron thắng thường xuyên và các lân cận của nó chuyên biệt hóa để đại diện cho mẫu hình đầu vào đó". Điểm cực kỳ quan trọng ở đây là khi việc học tiến triển, tốc độ học (learning rate) và bán kính lân cận (neighborhood radius) được thu nhỏ dần.

Sự thu nhỏ dần này có thể hiểu qua hai giai đoạn. Ở giai đoạn sắp xếp ban đầu (ordering), bán kính lân cận rộng và tốc độ học lớn định hình khung tổng thể của cả bản đồ, nên các trọng số được khởi tạo ngẫu nhiên được căn chỉnh toàn cục theo hình dạng đại thể của phân bố dữ liệu. Ở giai đoạn tinh chỉnh (convergence) tiếp theo, bán kính lân cận được thu hẹp gần như tới chính BMU và tốc độ học cũng hạ xuống, nên mỗi nơ-ron tinh chỉnh chính xác cấu trúc chi tiết của vùng nó phụ trách. Nếu giữ bán kính lân cận hẹp ngay từ đầu, bản đồ bị xoắn (topological defect) và cấu trúc liên kết vỡ; ngược lại, nếu giữ rộng đến cuối, bản đồ bị nhòe và không phân biệt được các cụm chi tiết. Do đó lịch trình giảm bán kính và tốc độ học là siêu tham số cốt lõi chi phối chất lượng SOM.

Sơ đồ hai giai đoạn này tương thông với chiến lược "khám phá (exploration) rồi khai thác (exploitation)" thường nói trong tối ưu hóa nói chung. Tốc độ học lớn và bán kính rộng ở giai đoạn đầu khuyến khích khám phá rộng để không sớm rơi vào cực trị cục bộ, còn các giá trị nhỏ ở giai đoạn sau hội tụ ổn định cấu trúc đã tìm được. Chất lượng học theo thông lệ được kiểm tra bằng hai chỉ số định lượng. Một là sai số lượng tử hóa (quantization error), khoảng cách trung bình giữa mỗi đầu vào và BMU của nó, cho biết bản đồ xấp xỉ dữ liệu tốt đến đâu; hai là sai số cấu trúc liên kết (topographic error), tỉ lệ đầu vào có BMU hạng 1 và hạng 2 kề nhau trên lưới, cho biết cấu trúc liên kết được bảo toàn tốt đến đâu. Hai chỉ số thường mâu thuẫn nhau (nâng độ phân giải có thể làm lung lay cấu trúc liên kết), nên tìm điểm cân bằng là mục tiêu của việc tinh chỉnh.

Thứ tự Nội dung
1 Khởi tạo vector trọng số (ngẫu nhiên hoặc dựa trên dữ liệu)
2 Trình bày vector đầu vào
3 So khoảng cách tới mọi nơ-ron → chọn nơ-ron khoảng cách nhỏ nhất làm BMU
4 Cập nhật trọng số BMU và lân cận về phía đầu vào
5 Thu nhỏ tốc độ học và bán kính lân cận, lặp lại 2~4
6 Kết thúc khi hội tụ, trực quan hóa bằng U-Matrix v.v.

Cách khởi tạo cũng ảnh hưởng đến tốc độ hội tụ và chất lượng. Nếu bắt đầu trọng số hoàn toàn ngẫu nhiên, bản đồ dao động mạnh ở giai đoạn sắp xếp ban đầu và hội tụ chậm; nhưng nếu bắt đầu bằng cách đặt lưới một cách tuyến tính trên mặt phẳng do hai trục thành phần chính (PCA) của dữ liệu trải ra, thì nó khởi đầu ở trạng thái đã căn chỉnh đại thể theo phân bố dữ liệu, nên hội tụ nhanh và ổn định hơn nhiều. Đây là lý do các thư viện thực tế cung cấp khởi tạo dựa trên PCA như một tùy chọn.

Có hai chế độ học: học trực tuyến (tuần tự), trình bày đầu vào từng cái một và cập nhật ngay, và học theo lô (batch), xét toàn bộ dữ liệu một lần và cập nhật trọng số mỗi nơ-ron thành trung bình (có trọng số lân cận) của các đầu vào nó phụ trách. Chế độ trực tuyến hơi nhạy với thứ tự trình bày đầu vào nhưng tốt cho việc áp dụng với dữ liệu luồng, còn chế độ theo lô có ưu điểm thực tiễn là không phụ thuộc thứ tự, dễ song song hóa và hội tụ nhanh trên dữ liệu lớn. Ở cả hai chế độ, mục tiêu bảo toàn cấu trúc liên kết và nguyên lý giảm bán kính, tốc độ học đều giống nhau.

Một SOM đã học xong tạo ra không phải kết quả phân cụm đơn thuần mà là một "bản đồ", và công cụ tiêu biểu để diễn giải nó là U-Matrix (Unified Distance Matrix). U-Matrix biểu diễn khoảng cách trọng số giữa các nơ-ron kề nhau bằng màu (độ đậm nhạt): các ranh giới có khoảng cách lớn hiện ra đậm, làm lộ "thung lũng" giữa các cụm, còn các vùng có khoảng cách nhỏ hiện ra nhạt, làm lộ "lòng chảo" của một cụm một cách trực quan. Ngoài ra, nếu dùng kèm bản đồ nhiệt (hit map) cho biết số đầu vào ánh xạ vào mỗi nơ-ron, và mặt thành phần (component plane) tô màu mỗi nơ-ron theo phân bố giá trị của một biến cụ thể, ta có thể diễn giải cả biến nào đặc trưng cho cụm nào. Qua những trực quan hóa như vậy, nhà phân tích nắm bắt trong một cái nhìn là dữ liệu có bao nhiêu cụm tự nhiên và các cụm kề nhau ra sao.

4. Sự khác biệt giữa SOM và các kỹ thuật khác — So sánh và trường hợp

SOM và các mạng nơ-ron học có giám sát thông thường như MLP (multilayer perceptron) khác nhau ngay ở mục đích. Trong khi MLP được cho biết đáp án và học phân loại/hồi quy bằng cách lan truyền ngược (backpropagation) sai số dự đoán, SOM nắm bắt cấu trúc dữ liệu bằng học cạnh tranh (kẻ thắng lấy tất) mà không có đáp án để phân cụm và trực quan hóa. Việc không có lan truyền ngược sai số và việc xuất ra bản đồ 2D bảo toàn cấu trúc liên kết là những khác biệt căn bản. Cách hợp tác trong học cũng tương phản. Học có giám sát để tất cả nơ-ron chia sẻ sai số và điều chỉnh cùng nhau, còn SOM áp dụng hợp tác cục bộ, trong đó chỉ kẻ thắng và lân cận của nó được cập nhật còn các nơ-ron xa vẫn giữ nguyên. Tính cục bộ này là động lực khiến các vùng khác nhau trên bản đồ đại diện cho các mẫu hình khác nhau theo phân công. Mặt khác, so với K-means, cũng là phân cụm không giám sát, K-means ấn định trước số cụm K và chỉ gán mỗi điểm vào tâm gần nhất mà không thể hiện quan hệ giữa các cụm, trong khi SOM đặt nhiều nơ-ron (tương ứng tâm của K-means) lên lưới và, qua sự kề nhau của chúng, thể hiện cả cấu trúc liên kết giữa các cụm. Thực tế SOM còn được diễn giải là "một sự tổng quát hóa của K-means có ràng buộc cấu trúc liên kết".

Nhìn vào các trường hợp cụ thể thì giá trị thực tiễn của SOM trở nên rõ ràng. Thứ nhất, trong phân khúc khách hàng, cho SOM học hàng chục biến mua sắm/hành vi sẽ gom các nhóm khách hàng tương tự vào các vùng kề nhau trên bản đồ, cho phép nắm bắt trực quan các nhóm mục tiêu marketing và quan hệ chuyển dịch giữa chúng. Ví dụ, ánh xạ 100.000 khách hàng biểu diễn bằng 30 biến lên lưới 20×20 (400 nơ-ron) cho phép xác nhận bằng mắt trên bản đồ được tóm tắt xuống 400 chiều trở xuống rằng "tầng mua tần suất cao, giá trị cao" và "tầng nguy cơ rời bỏ" kề nhau ở đâu, và thiết kế chiến lược marketing chuyển dịch. Thứ hai, trong phân tích rủi ro tín dụng/khó khăn tài chính, hàng chục tỉ số tài chính doanh nghiệp được trải ra trên bản đồ hai chiều để dùng cho cảnh báo sớm các doanh nghiệp có dấu hiệu khó khăn phân bố ở vùng nào (một trường hợp nghiên cứu áp dụng SOM cho phân tích phá sản doanh nghiệp thực tế ở Phần Lan rất nổi tiếng). Thứ ba, trong phát hiện bất thường của quy trình/thiết bị sản xuất, nếu dựng bản đồ từ dữ liệu vận hành bình thường, khi một quan sát mới ánh xạ tới vị trí xa (khoảng cách tới BMU lớn) khỏi vùng bình thường trên bản đồ, ta có thể bắt được đó là tín hiệu bất thường. Cả ba trường hợp này đều khai thác đặc tính của SOM là cung cấp "phân cụm + trực quan hóa quan hệ" cùng một lúc.

Ở đây đáng chỉ ra lại vì sao sự khác biệt giữa SOM và K-means lại quan trọng về mặt thực tiễn. Áp dụng K-means cho cùng dữ liệu khách hàng thu được nhãn kiểu "cụm 1~5", nhưng không thể biết cụm 2 kề cụm 3 hay ngược lại, nên người làm marketing khó thiết kế lộ trình chuyển dịch giữa các cụm. Ngược lại, SOM đặt các cụm kề nhau vào các vùng kề nhau trên bản đồ, nên nó chống đỡ trực quan cho câu chuyện "khách hàng di chuyển từ trạng thái này sang trạng thái kia". Chính "khả năng nhìn thấy quan hệ" này là điểm khiến SOM trở thành công cụ giao tiếp thuyết phục hơn so với phân cụm đơn thuần.

Phân loại SOM K-means Học có giám sát như MLP
Phương thức học Không giám sát Không giám sát Chủ yếu có giám sát
Quy tắc học Học cạnh tranh (kẻ thắng + lân cận) Lặp tính lại tâm Lan truyền ngược sai số
Mục đích Phân cụm/giảm chiều/trực quan hóa Phân chia cụm Phân loại/dự đoán
Quan hệ giữa cụm Thể hiện bằng cấu trúc liên kết Không thể hiện được Không áp dụng
Đầu ra Bản đồ 2D bảo toàn cấu trúc liên kết Nhãn cụm/tâm Lớp/giá trị liên tục

Mặt khác, SOM không chỉ dừng ở thuần không giám sát. Ứng dụng bán giám sát (semi-supervised) là khả thi, trong đó sau khi học, gán một lượng nhỏ nhãn cho mỗi nơ-ron (cụm) để phân loại đầu vào mới theo nhãn của nơ-ron đó, và Kohonen cũng đề xuất kèm một biến thể có giám sát (LVQ, Learning Vector Quantization) phản ánh một phần thông tin nhãn vào việc học. Nghĩa là họ SOM tạo thành một phổ từ trực quan hóa không giám sát đến phân loại bán giám sát, và được ứng dụng linh hoạt theo tính chất của bài toán.

5. Chuyên sâu: Kỹ thuật biến thể và xu hướng mới nhất

SOM là kỹ thuật cổ điển được xác lập vào thập niên 1980-90, nhưng vẫn tiếp nối qua nhiều biến thể và diễn giải lại hiện đại. SOM cơ bản phải cố định trước kích thước lưới (số nơ-ron), nhưng Growing SOM/GHSOM (Growing Hierarchical SOM), trong đó lưới lớn lên theo dữ liệu, làm giảm nhẹ ràng buộc này bằng cách thêm và phân tầng nơ-ron ở nơi cần. GHSOM đặc biệt, khi dữ liệu có cấu trúc phân cấp phức tạp, tự động làm lộ phân loại lớn-phân loại nhỏ bằng cách để một nơ-ron của bản đồ cấp trên trải ra thành bản đồ cấp dưới, và được dùng trong phân loại tài liệu, phân tích log web v.v. Ngoài ra, GTM (Generative Topographic Mapping, Bishop và cộng sự), tái định dạng tính chất heuristic của SOM thành mô hình xác suất, cung cấp hàm mục tiêu tường minh và diễn giải xác suất, cải thiện tính hội tụ và khả năng so sánh. Bên cạnh đó, tồn tại nhiều mở rộng đa dạng như SOM đệ quy cho dữ liệu có cấu trúc như chuỗi thời gian/chuỗi ký tự, và các biến thể điều chỉnh thước đo khoảng cách qua việc học.

Cũng đáng chỉ ra rằng việc học của SOM không có một hàm mất mát đơn lẻ nào được tối thiểu hóa một cách tường minh. SOM cơ bản gần với một heuristic, trong đó sự tổ chức nổi lên từ việc lặp lại các quy tắc cục bộ là cạnh tranh và hợp tác, nên việc so sánh định lượng giữa các khởi tạo/tham số khác nhau là khó. Đây là lý do GTM tái định dạng SOM này thành một mô hình xác suất sinh, một hỗn hợp Gauss trên các biến tiềm ẩn, nhờ đó có thể so sánh mô hình bằng thước đo rõ ràng là hợp lý (likelihood) và xử lý giá trị thiếu, độ bất định một cách có nguyên tắc. Trong thực tế, người ta chọn kỹ thuật có cân nhắc đánh đổi giữa sự chặt chẽ lý thuyết và sự đơn giản trong cài đặt/dễ diễn giải này.

Gần đây, khi các kỹ thuật giảm chiều/trực quan hóa phi tuyến như t-SNE và UMAP được dùng rộng rãi, vai trò trực quan hóa của SOM đã bị thay thế một phần, nhưng SOM vẫn có những thế mạnh riêng. Trong khi t-SNE/UMAP chỉ dừng ở việc rải mỗi điểm dữ liệu vào hai chiều, SOM học một hệ tọa độ ổn định (codebook) gồm các nơ-ron lưới, nên có thể ánh xạ ngay dữ liệu mới lên bản đồ hiện có (phân loại trực tuyến), và mỗi nơ-ron giữ một vector nguyên mẫu đại diện, làm kết quả dễ diễn giải. Ví dụ, về nguyên tắc t-SNE phải tính lại toàn bộ khi có dữ liệu mới, nhưng một SOM đã học chỉ cần tìm BMU của quan sát mới, nên phù hợp với môi trường luồng thời gian thực. Vì vậy nó tiếp tục được dùng thực tiễn trong giám sát trạng thái thiết bị, quản lý chất lượng và nén tín hiệu/hình ảnh dựa trên lượng tử hóa vector (VQ) tại hiện trường công nghiệp. Ngoài ra, nghiên cứu theo hướng kết hợp với học sâu cũng đang được tiến hành, chẳng hạn như các nỗ lực trực quan hóa lại các biểu diễn tiềm ẩn (embedding) của học sâu bằng SOM để con người có thể diễn giải cấu trúc của không gian đặc trưng mà mô hình sâu đã học.

6. Điểm cần cân nhắc và hàm ý

  1. Làm rõ vai trò — đó là công cụ khám phá/giải thích, không phải mô hình dự đoán. Từ góc nhìn của Kỹ sư chuyên nghiệp, SOM được định vị phù hợp không phải như một mô hình cuối cùng cho ra dự đoán chính xác mà như một công cụ phân tích khám phá (EDA)/giải thích, hiểu cấu trúc dữ liệu và giao tiếp trực quan với các bên liên quan trước khi mô hình hóa chính thức. Nó nên được kết hợp bổ trợ với K-means, PCA, t-SNE v.v.

  2. Quản lý độ nhạy với siêu tham số là bắt buộc. Vì kết quả phụ thuộc lớn vào kích thước lưới, tốc độ học ban đầu, bán kính lân cận và lịch trình giảm của nó, số lần lặp học, nên phải đánh giá chất lượng bản đồ bằng các chỉ số định lượng như sai số cấu trúc liên kết, sai số lượng tử hóa và tinh chỉnh lặp lại. Để tái lập được, cần một hệ thống ghi lại và quản lý cách khởi tạo và các tham số.

  3. Tiền xử lý dữ liệu chi phối kết quả. Vì SOM dựa trên khoảng cách, chênh lệch tỉ lệ lớn giữa các biến khiến một biến cụ thể chi phối việc tính khoảng cách. Chuẩn hóa (chuẩn tắc hóa) và xử lý giá trị thiếu/ngoại lai phải đi trước, và biến phân loại cần mã hóa phù hợp.

  4. Xem xét khả năng mở rộng và kỹ thuật thay thế. Khi quy mô dữ liệu rất lớn hoặc siêu nhiều chiều, có giới hạn về chi phí học và diễn giải, nên cần so sánh, xem xét với cài đặt mini-batch/song song hoặc các lựa chọn thay thế như GTM/UMAP. Hãy chọn theo mục tiêu: UMAP có lợi nếu mục đích là trực quan hóa thuần túy, SOM có lợi nếu ánh xạ trực tuyến/diễn giải nguyên mẫu là quan trọng.

  5. Trách nhiệm diễn giải và kiểm chứng kết quả. Vì các ranh giới cụm mà bản đồ SOM thể hiện là sản phẩm của dữ liệu và tham số, phải kiểm chứng cùng chuyên gia miền xem các cụm rút ra có thực sự có ý nghĩa với nghiệp vụ hay không, và cảnh giác với việc diễn giải quá mức.

  6. Góc nhìn quản trị mô hình/tái lập. Khi đưa SOM vào một hệ thống vận hành như phát hiện bất thường, cần một hệ thống quản lý ghi lại dữ liệu/tham số/phiên bản dùng trong học và định kỳ học lại bản đồ theo thay đổi phân bố dữ liệu (drift). Để phát huy thế mạnh là công cụ giải thích, cần tài liệu hóa kèm cơ sở diễn giải của bản đồ (mặt thành phần, U-Matrix) để bảo đảm khả năng truy vết của quyết định.

Tổng hợp lại, SOM không phải kỹ thuật cạnh tranh bằng hiệu năng dự đoán hào nhoáng, nhưng nó vẫn chiếm một vị trí khó thay thế cho mục đích "làm cho dữ liệu nhiều chiều trở nên hiểu được với con người". Là một Kỹ sư chuyên nghiệp, cần có năng lực phán đoán đặt SOM ở giai đoạn nào với mục đích gì trong một pipeline phân tích nơi học sâu, thống kê truyền thống và các kỹ thuật trực quan hóa mới nhất cùng tồn tại, và giao tiếp rõ ràng về độ tin cậy cùng giới hạn của kết quả của nó.

Tài liệu tham khảo


Tóm tắt một câu: SOM là mạng nơ-ron không giám sát dựa trên học cạnh tranh, ánh xạ dữ liệu nhiều chiều lên lưới 2D trong khi bảo toàn cấu trúc liên kết (phân cụm/trực quan hóa); bằng việc cập nhật kẻ thắng (BMU) và các lân cận cùng nhau và hội tụ bằng cách thu nhỏ tốc độ học và bán kính, nó khác về mục đích và quy tắc học so với học có giám sát dùng lan truyền ngược và so với K-means vốn không nhìn thấy quan hệ, và được dùng trong thực tế như một công cụ phân tích khám phá/giải thích.