← Về danh sách
AI & Dữ liệu
#연합학습#분산학습#프라이버시#FedAvg#차분프라이버시#128회
Cập nhật lần cuối · 2026-09-15

Học liên kết (Federated Learning)

1. Tổng quan

A. Định nghĩa

Học liên kết (Federated Learning) là kỹ thuật học AI phân tán không tập trung dữ liệu huấn luyện về một nơi, mà giữ nguyên dữ liệu gốc tại từng thiết bị·tổ chức, chỉ thu thập về trung tâm các mô hình (tham số·gradient) đã được huấn luyện cục bộ rồi hợp nhất thành một mô hình toàn cục. Vì dữ liệu gốc không di chuyển về mặt vật lý, nó vừa bảo vệ quyền riêng tư vừa đạt hiệu năng tương tự như huấn luyện bằng dữ liệu của nhiều chủ thể.

Ý tưởng cốt lõi của học liên kết được tóm gọn là 'đừng gửi dữ liệu tới mô hình, hãy gửi mô hình tới dữ liệu (bring the model to the data)'. Học AI tập trung truyền thống sao chép·thu thập dữ liệu phân tán ở nhiều nơi về server trung tâm rồi mới huấn luyện. Cách này mang rủi ro rò rỉ·lạm dụng quy mô lớn ngay khi dữ liệu dồn về một chỗ, và các dữ liệu nhạy cảm như hồ sơ y tế·giao dịch tài chính·hội thoại cá nhân ngay từ đầu đã không thể mang ra ngoài tổ chức vì vấn đề pháp lý·quyền riêng tư. Kết quả là nảy sinh nghịch lý dữ liệu bị nhốt trong từng tổ chức (ốc đảo dữ liệu, silo) nên không được tận dụng cho học AI.

Học liên kết giải quyết bằng cách đảo ngược hoàn toàn cục diện này. Thay vì di chuyển dữ liệu, nó gửi chính mô hình cần huấn luyện xuống từng thiết bị·tổ chức để huấn luyện ngay tại chỗ bằng dữ liệu cục bộ, và chỉ thu hồi về trung tâm kết quả huấn luyện là trọng số·gradient để gộp thành một mô hình toàn cục. Dữ liệu gốc tuyệt đối không vượt ra khỏi ranh giới của bên tham gia, nên vừa tuân thủ quy định vừa hưởng được hiệu quả huấn luyện hợp tác đa tổ chức. Năm 2017, Google phổ biến khái niệm này khi huấn luyện mô hình dự đoán từ tiếp theo của bàn phím điện thoại (Gboard) trên thiết bị người dùng, và sau đó nó nhanh chóng lan sang lĩnh vực y tế, nơi nhiều bệnh viện cùng huấn luyện AI chẩn đoán mà không chia sẻ dữ liệu bệnh nhân.

B. Bối cảnh ra đời và sự cần thiết

Sự nổi lên của học liên kết có ba dòng chảy đan xen. Thứ nhất là quy định ngày càng chặt chẽ. GDPR của EU, Luật Bảo vệ thông tin cá nhân của Hàn Quốc (bộ 3 luật dữ liệu), các luật về y tế·tài chính hạn chế nghiêm ngặt việc chuyển dữ liệu định danh cá nhân ra nước ngoài hoặc ra ngoài tổ chức. Học liên kết không di chuyển dữ liệu nên cung cấp giải pháp dung hòa thực tế 'tận dụng dữ liệu nhưng không mang ra ngoài' trong môi trường quy định như vậy.

Thứ hai là sự lan rộng của điện toán biên·di động. Khi năng lực tính toán của điện thoại thông minh·IoT·thiết bị đeo được nâng cao, hạ tầng để thực hiện huấn luyện trực tiếp trên thiết bị đầu cuối nơi dữ liệu được tạo ra đã sẵn sàng. Nhờ đó có thể tạo mô hình cá nhân hóa trong khi giảm chi phí truyền thông và độ trễ khi đẩy dữ liệu lên đám mây.

Thứ ba là sự kém hiệu quả kinh tế của ốc đảo dữ liệu. Chỉ với dữ liệu của một bệnh viện hay một ngân hàng thì khó học đủ các bài toán có ít trường hợp như bệnh hiếm·giao dịch bất thường. Nếu nhiều tổ chức có thể gộp 'tri thức' mà không cần gộp dữ liệu về mặt vật lý, vấn đề thiếu dữ liệu của mỗi bên có thể được giải quyết bằng hợp tác. Chính ở điểm này, học liên kết được chú ý như công nghệ đồng thời thỏa mãn hai mục tiêu mâu thuẫn là bảo vệ quyền riêng tư và tận dụng dữ liệu.

2. Cấu trúc tổng thể và nguyên lý hoạt động

Học liên kết gồm server tổng hợp (aggregator) ở trung tâm và nhiều bên tham gia (client), lặp lại các chu kỳ huấn luyện gọi là vòng (round) để cải thiện dần mô hình toàn cục. Sơ đồ cấu trúc dưới đây cho thấy toàn bộ quan hệ, trong đó dữ liệu không di chuyển mà chỉ tham số đi lại.

flowchart TB
  S["Server tổng hợp trung tâm<br/>(lưu giữ·gộp mô hình toàn cục)"] -->|① Phân phối mô hình toàn cục| C1["Thiết bị/tổ chức 1<br/>(dữ liệu cục bộ D1)"]
  S -->|① Phân phối mô hình toàn cục| C2["Thiết bị/tổ chức 2<br/>(dữ liệu cục bộ D2)"]
  S -->|① Phân phối mô hình toàn cục| C3["Thiết bị/tổ chức N<br/>(dữ liệu cục bộ DN)"]
  C1 -->|"③ Kết quả huấn luyện cục bộ (tham số)"| S
  C2 -->|"③ Kết quả huấn luyện cục bộ (tham số)"| S
  C3 -->|"③ Kết quả huấn luyện cục bộ (tham số)"| S
  S --> A["④ Tổng hợp (Aggregation)<br/>Cập nhật mô hình toàn cục bằng trung bình có trọng số"]
  A -.->|Lặp lại| S
  style A fill:#e8f0fe,stroke:#2f6fed,stroke-width:2px

Nguyên tắc quan trọng nhất trong cấu trúc này là dữ liệu gốc (D1, D2 … DN) không bao giờ được truyền tới server. Thứ duy nhất đi lại giữa server và bên tham gia là tham số mô hình, còn dữ liệu chỉ được sử dụng trong kho lưu trữ cục bộ của từng bên. Nhờ vậy, ngay cả người vận hành server cũng không thể xem dữ liệu gốc của bên tham gia.

Thủ tục chi tiết của một vòng diễn ra như chuỗi dưới đây. Quá trình lặp này tiếp diễn cho tới khi hội tụ, và mô hình toàn cục được nâng cao hiệu năng như thể đã nhìn thấy mọi dữ liệu tại một nơi.

sequenceDiagram
  participant S as Server tổng hợp
  participant C as Bên tham gia(client)
  S->>C: ① Phân phối tham số mô hình toàn cục hiện tại
  Note over C: ② Huấn luyện vài epoch bằng dữ liệu cục bộ<br/>(cập nhật tham số bằng SGD, v.v.)
  C->>S: ③ Chỉ gửi tham số/gradient cục bộ đã cập nhật
  Note over S: ④ Gộp bằng trung bình có trọng số theo lượng dữ liệu<br/>Cập nhật mô hình toàn cục
  S->>C: (Vòng tiếp theo) Phân phối lại mô hình toàn cục đã cập nhật

Ở ① bước phân phối, server gửi mô hình toàn cục hiện tại xuống các client sẽ tham gia vòng này. Trong môi trường di động, chỉ một phần trong hàng triệu thiết bị (ví dụ: thiết bị đang sạc và kết nối Wi-Fi) được chọn làm mẫu. Ở ② bước huấn luyện cục bộ, mỗi client huấn luyện mô hình nhiều epoch bằng dữ liệu của mình để cập nhật tham số. Bước này là cốt lõi của quyền riêng tư: dữ liệu không rời khỏi thiết bị. Ở ③ bước truyền, chỉ gửi lên server tham số đã thay đổi nhờ huấn luyện (hoặc lượng biến thiên của nó) chứ không phải dữ liệu gốc. Ở ④ bước tổng hợp, server gộp kết quả của nhiều client để tạo mô hình toàn cục mới. Mô hình hoàn thành như vậy lại được phân phối ở ① và vòng lặp tiếp diễn.

3. Các loại và thuật toán chủ yếu

A. Các loại theo cách phân chia dữ liệu

Học liên kết được chia lớn thành ba loại tùy theo dữ liệu giữa các bên tham gia được phân chia như thế nào. Sự phân biệt này không chỉ là phân loại đơn thuần mà quyết định 'hợp tác nào là khả thi', nên là điểm xuất phát của thiết kế thực tiễn.

Học liên kết ngang (Horizontal FL) là trường hợp các bên tham gia có cùng đặc trưng (feature) nhưng sở hữu các mẫu khác nhau. Ví dụ, nhiều bệnh viện khu vực có cùng hạng mục xét nghiệm (huyết áp·đường huyết, v.v.) cho các nhóm bệnh nhân khác nhau. Dự đoán bàn phím điện thoại là ví dụ tiêu biểu: mọi người dùng đều sở hữu dữ liệu cùng dạng là 'lịch sử nhập liệu' với nội dung khác nhau.

Học liên kết dọc (Vertical FL) là trường hợp các bên tham gia sở hữu các đặc trưng khác nhau về cùng một mẫu (khách hàng). Khi ngân hàng có thông tin giao dịch tài chính của khách hàng, còn nhà mạng có mẫu hình sử dụng viễn thông của cùng khách hàng đó, hai tổ chức tạo ra mô hình phong phú hơn về cùng khách hàng mà không gộp dữ liệu. Khi đó, công nghệ giao tập hợp bảo toàn quyền riêng tư (PSI) được dùng kèm để tìm ra khách hàng chung mà không làm lộ thông tin cá nhân.

Học chuyển giao liên kết (Federated Transfer Learning) là cách kết hợp học chuyển giao để chuyển tri thức khi cả mẫu lẫn đặc trưng đều ít trùng lặp.

B. Thuật toán tổng hợp

Thuật toán tổng hợp là 'quy tắc gộp' hợp nhất các kết quả huấn luyện cục bộ phân tán thành một. Bảng dưới đây tóm tắt các thuật toán tiêu biểu; mỗi thuật toán chọn một điểm cân bằng khác nhau giữa hai mục tiêu mâu thuẫn là giảm lượng truyền thông và ứng phó tính không đồng nhất của dữ liệu.

Thuật toán Ý tưởng cốt lõi Ưu điểm Hạn chế
FedSGD Server tổng hợp gradient ở mỗi bước Đơn giản·chính xác về lý thuyết Vòng truyền thông rất dày nên chi phí lớn
FedAvg Mỗi client huấn luyện nhiều epoch rồi lấy trung bình có trọng số theo lượng dữ liệu của tham số Giảm mạnh số vòng truyền thông (thuật toán tiêu biểu) Hội tụ không ổn định với dữ liệu non-IID
FedProx Thêm số hạng lân cận (proximal term) vào FedAvg để ràng buộc mô hình cục bộ không lệch quá xa mô hình toàn cục Bù đắp tính không đồng nhất của dữ liệu·hệ thống Cần điều chỉnh siêu tham số
FedOpt (FedAdam, v.v.) Áp dụng tối ưu thích nghi (momentum·Adam) cho tổng hợp phía server Cải thiện tốc độ hội tụ·độ ổn định Quản lý trạng thái server phức tạp

Cốt lõi của FedAvg — được dùng rộng rãi nhất — là cho mỗi client huấn luyện nhiều epoch một lần, giảm đột phá số lần truyền thông với server so với FedSGD. Tuy nhiên, nếu phân phối dữ liệu của từng bên khác nhau nhiều (non-IID), các mô hình cục bộ lệch về các hướng khác nhau khiến giá trị trung bình dao động. FedProx giảm nhẹ vấn đề này bằng cách áp dụng mức phạt để huấn luyện cục bộ không đi quá xa mô hình toàn cục, đồng thời xử lý cả sự khác biệt năng lực tính toán giữa các bên (tình huống thiết bị chậm huấn luyện ít hơn).

4. Công nghệ tăng cường bảo mật·quyền riêng tư

Chỉ riêng việc học liên kết không di chuyển dữ liệu gốc không có nghĩa quyền riêng tư được bảo đảm hoàn toàn. Tham số·gradient được truyền đi vẫn còn dấu vết của dữ liệu huấn luyện, và nếu server hoặc bên tham gia độc hại khai thác ngược thì có thể khôi phục dữ liệu gốc hoặc suy luận việc một cá nhân cụ thể có tham gia hay không. Những tấn công này được gọi là tấn công đảo ngược gradient (gradient inversion) và tấn công suy luận thành viên (membership inference). Do đó, học liên kết thực chiến bắt buộc phải kết hợp các công nghệ tăng cường quyền riêng tư (PET) dưới đây.

Công nghệ Cách hoạt động Mối đe dọa được bảo vệ Chi phí/đánh đổi
Quyền riêng tư vi phân (DP) Thêm nhiễu thống kê vào tham số·gradient để che giấu đóng góp riêng lẻ Suy luận thành viên·thuộc tính Nhiễu càng lớn độ chính xác càng giảm
Mã hóa đồng cấu (HE) Cộng·gộp tham số ngay khi đang ở trạng thái mã hóa Server xem tham số Lượng tính toán·truyền thông tăng vọt
Tính toán đa bên an toàn (MPC) Nhiều server·bên tham gia cùng tổng hợp bằng bí mật phân tán Một chủ thể độc chiếm việc xem tham số Độ phức tạp truyền thông·giao thức
Tổng hợp an toàn (Secure Aggregation) Tham số riêng lẻ triệt tiêu nhau, server chỉ khôi phục tổng Server xem tham số riêng lẻ Cần điều chỉnh lại khi bên tham gia rời bỏ

Quyền riêng tư vi phân hạ ảnh hưởng của việc một bản ghi dữ liệu riêng lẻ có tham gia hay không tới kết quả xuống dưới mức giới hạn toán học, khiến khó biết được thậm chí dữ liệu của một người cụ thể có được dùng để huấn luyện hay không. Nhiễu càng lớn thì quyền riêng tư càng mạnh nhưng độ chính xác mô hình giảm, nên điểm cân bằng được điều chỉnh qua ngân sách quyền riêng tư (ε). Mã hóa đồng cấu và tổng hợp an toàn tập trung vào việc không cho server nhìn vào tham số riêng lẻ. Đặc biệt, tổng hợp an toàn là kỹ thuật thực dụng, trong đó các bên tham gia gửi tham số đã phủ mặt nạ triệt tiêu lẫn nhau, nên server chỉ khôi phục được tổng toàn bộ mà không biết giá trị riêng lẻ. Trong thực tế, các kỹ thuật này được kết hợp để tạo 'phòng thủ theo chiều sâu'.

5. Chuyên sâu — ví dụ ứng dụng công nghiệp và tiêu chuẩn·xu hướng

Học liên kết đã bước vào giai đoạn thương mại ở nhiều ngành. Trong lĩnh vực di động, Google Gboard được xem là ví dụ tiêu biểu liên tục cải thiện mô hình dự đoán từ tiếp theo·emoji mà không gửi dữ liệu gõ phím thực của người dùng lên server. Apple cũng được biết là đã áp dụng cách tiếp cận kết hợp học trên thiết bị và tổng hợp bảo vệ quyền riêng tư trong trợ lý giọng nói·QuickType, v.v.

Ví dụ tiêu biểu trong lĩnh vực y tế là các dự án hợp tác quy mô lớn đã được báo cáo, trong đó nhiều bệnh viện·viện nghiên cứu tham gia cùng huấn luyện mô hình chẩn đoán hình ảnh như u não. Mỗi bệnh viện không mang ảnh bệnh nhân ra ngoài mà chỉ huấn luyện cục bộ và chia sẻ mô hình, nhờ đó đạt được hiệu năng tổng quát hóa khó có được chỉ với dữ liệu của một tổ chức. Trong lĩnh vực tài chính, các nỗ lực để nhiều ngân hàng·công ty thẻ cùng huấn luyện mô hình phát hiện giao dịch bất thường (FDS)·chấm điểm tín dụng mà không gộp dữ liệu đang tiếp diễn; điều này đặc biệt hiệu quả với các bài toán như mẫu gian lận mà dữ liệu của một tổ chức không đủ trường hợp.

Trong lĩnh vực sản xuất·viễn thông, việc ứng dụng cũng đang lan rộng. Đó là cách nhiều nhà máy cùng huấn luyện mô hình bảo trì dự đoán (dự báo hỏng hóc) mà không mang dữ liệu cảm biến thiết bị ra ngoài, hoặc nhà mạng học cục bộ mẫu hình lưu lượng của trạm gốc·thiết bị đầu cuối để cải thiện mô hình tối ưu hóa mạng. Điểm chung của các ví dụ này là dữ liệu nhạy cảm hoặc quá lớn khiến thu thập tập trung là phi thực tế, và học liên kết vượt qua ràng buộc này bằng nguyên tắc 'dữ liệu ở hiện trường, tri thức được chia sẻ'.

Về công nghệ·tiêu chuẩn, các framework mã nguồn mở (TensorFlow Federated, PySyft, Flower, NVIDIA FLARE, v.v.) hỗ trợ thử nghiệm·triển khai, và tại ITU-T·ISO/IEC, v.v. đã có các thảo luận tiêu chuẩn hóa về khả năng tương tác và yêu cầu bảo mật của học liên kết. Tuy nhiên, phiên bản tiêu chuẩn chi tiết·tình hình áp dụng liên tục thay đổi, nên số liệu cụ thể cần kiểm tra tài liệu mới nhất. Gần đây, gắn với nhu cầu tinh chỉnh mô hình ngôn ngữ lớn (LLM) mà không xâm phạm quyền riêng tư, xu hướng nghiên cứu kết hợp học liên kết với tinh chỉnh hiệu quả tham số (PEFT)·quyền riêng tư vi phân đang sôi động.

6. Lưu ý và hàm ý

  1. Phải lấy nhận thức rằng chính tham số là bề mặt tấn công (attack surface) làm tiền đề. Không thể yên tâm chỉ vì không di chuyển dữ liệu gốc; để phòng bị đảo ngược gradient·suy luận thành viên, bắt buộc kết hợp PET như quyền riêng tư vi phân·tổng hợp an toàn·mã hóa đồng cấu nhằm đạt đồng thời 'không di chuyển dữ liệu' và 'không rò rỉ thông tin'.

  2. Tính không đồng nhất của dữ liệu (non-IID) và của hệ thống là biến số quyết định hiệu năng. Phân phối·lượng dữ liệu·hiệu năng thiết bị của từng bên khác nhau nên sự hội tụ và tính công bằng của mô hình toàn cục có thể dao động. Cần thiết kế hấp thụ tính không đồng nhất bằng FedProx·học liên kết cá nhân hóa, đồng thời quản lý chỉ số công bằng để không bên tham gia nào bị bỏ rơi.

  3. Phải thiết kế định lượng sự đánh đổi giữa chi phí truyền thông với độ chính xác·quyền riêng tư. Giảm số vòng thì tiết kiệm truyền thông nhưng hội tụ chậm, tăng nhiễu thì quyền riêng tư mạnh hơn nhưng độ chính xác giảm. Điều chỉnh cân bằng ngân sách quyền riêng tư (ε), tỷ lệ mẫu bên tham gia, số epoch cục bộ, v.v. theo mức yêu cầu dịch vụ là quyết định cốt lõi từ góc độ Kỹ sư chuyên nghiệp (Professional Engineer).

  4. Liên kết với quản trị·cơ chế khuyến khích·luật pháp quyết định tính bền vững. Hợp tác đa tổ chức không thể hình thành chỉ nhờ không di chuyển dữ liệu; phải thỏa thuận trước cách đền bù đóng góp của tổ chức tham gia (khuyến khích), cách phân bổ quyền sở hữu·trách nhiệm đối với mô hình, cách phù hợp với quy định (Luật Bảo vệ thông tin cá nhân·GDPR) thì hợp tác mới được duy trì. Học liên kết không chỉ là công nghệ thuần túy mà còn là vấn đề quản trị của hệ sinh thái AI bảo vệ quyền riêng tư.

  5. Phòng thủ trước tấn công vào tính toàn vẹn mô hình·đầu độc (poisoning) là bắt buộc. Cấu trúc server không thấy được dữ liệu gốc, ngược lại, cũng là môi trường dễ để bên tham gia độc hại đưa tham số bị thao túng vào làm ô nhiễm mô hình toàn cục. Tổng hợp vững chắc (robust aggregation)·phát hiện bất thường để lọc cập nhật bất thường và quản lý độ tin cậy bên tham gia phải được thiết kế cùng với bảo vệ quyền riêng tư.

  6. Đang định vị như công nghệ nền tảng của AI bảo vệ quyền riêng tư thế hệ mới. Đây là phương tiện cốt lõi cho phép hợp tác đa tổ chức trong các lĩnh vực không thể thu thập dữ liệu như y tế·tài chính·công, và được dự báo phạm vi ứng dụng sẽ tiếp tục mở rộng khi kết hợp với AI biên·học trên thiết bị·tinh chỉnh bảo toàn quyền riêng tư của mô hình ngôn ngữ lớn.

Tài liệu tham khảo


Tóm tắt một câu: Học liên kết là phương pháp học AI phân tán không tập trung dữ liệu mà chỉ tổng hợp tham số mô hình được huấn luyện cục bộ tại từng thiết bị·tổ chức, hợp nhất dữ liệu không đồng nhất bằng FedAvg·FedProx và kết hợp quyền riêng tư vi phân·tổng hợp an toàn·mã hóa đồng cấu để đồng thời hiện thực bảo vệ quyền riêng tư và tận dụng dữ liệu.