← Về danh sách
AI & Dữ liệu
#베이지안최적화#하이퍼파라미터#가우시안프로세스#획득함수#AutoML#132회
Cập nhật lần cuối · 2026-07-07

Tối ưu hóa Bayes (Bayesian Optimization)

1. Tổng quan

A. Định nghĩa

Kỹ thuật tối ưu hóa tuần tự nhằm tìm điểm tối ưu chỉ với số ít lần thử đối với hàm mục tiêu hộp đen $f(x)$ có chi phí đánh giá lớn và không khả vi, bằng cách cập nhật lặp lại mô hình thay thế (Surrogate) — tóm tắt xác suất các quan sát cho đến nay — và hàm thu nhận (Acquisition Function) — quyết định sẽ đánh giá ở đâu tiếp theo.

Ý tưởng cốt lõi của tối ưu hóa Bayes là "thay vì xử lý trực tiếp bản thân hàm mục tiêu, hãy mô hình hóa niềm tin (phân phối hậu nghiệm) về hình dạng của hàm mục tiêu, và mỗi khi quan sát tích lũy thì cập nhật niềm tin đó bằng định lý Bayes". Tức là nó biến bài toán tối ưu hóa thành bài toán ra quyết định "đánh giá điểm tiếp theo ở đâu thì có lợi nhất". Vì mỗi lần lấy giá trị hàm rất tốn kém, mục tiêu là dùng mỗi lần thử vào điểm có giá trị thông tin cao nhất có thể.

B. Bối cảnh ra đời và sự cần thiết

Khi ngày càng nhiều bài toán như tinh chỉnh siêu tham số học sâu, thí nghiệm thuốc mới và vật liệu, tối ưu hóa quy trình đòi hỏi mỗi lần đánh giá là vài giờ huấn luyện GPU hoặc thí nghiệm thực tế, thì tìm kiếm lưới, tìm kiếm ngẫu nhiên hay tối ưu hóa dựa trên gradient — vốn giả định hàng nghìn đến hàng chục nghìn lần đánh giá — mất đi tính thực tế. Tìm kiếm lưới có số tổ hợp bùng nổ theo cấp số nhân khi số chiều tăng, còn tìm kiếm ngẫu nhiên không tận dụng quan sát quá khứ để học nên lặp lại cùng thất bại. Tối ưu hóa Bayes tích lũy học các quan sát quá khứ bằng mô hình thay thế để tập trung lần thử vào vùng triển vọng, nên thường đạt được lời giải cạnh tranh chỉ với vài chục lần đánh giá. Thêm vào đó, ưu điểm quyết định là định lượng được cả độ bất định của mỗi dự đoán, nhờ đó có thể cân nhắc một cách có nguyên tắc giữa "nơi chưa từng đến" và "nơi trông có vẻ tốt".

2. Nguyên lý hoạt động

flowchart LR
  S[Huấn luyện mô hình thay thế<br/>Gaussian Process] --> A[Chọn điểm tiếp theo bằng hàm thu nhận]
  A --> E[Đánh giá thực tế hàm mục tiêu]
  E --> U[Cập nhật dữ liệu quan sát]
  U --> S

Một chu trình diễn ra như sau. Trước hết, huấn luyện mô hình thay thế bằng các quan sát cho đến nay ${(x_i, y_i)}$ để có trung bình dự đoán $\mu(x)$ và độ bất định $\sigma(x)$ tại mỗi điểm chưa đánh giá $x$. Tiếp theo, hàm thu nhận kết hợp hai giá trị này để chọn điểm $x_{next}$ "đáng đánh giá nhất". Đánh giá hàm mục tiêu thực tế đúng một lần tại điểm đó, thêm kết quả vào quan sát rồi cập nhật lại mô hình thay thế. Lặp lại quá trình này cho đến khi ngân sách (số lần đánh giá) cạn kiệt hoặc sự cải thiện đình trệ.

Thứ tự Nội dung Sản phẩm
1 Huấn luyện mô hình thay thế (chủ yếu GP) bằng dữ liệu quan sát $\mu(x),\ \sigma(x)$ tại mỗi điểm
2 Quyết định điểm đánh giá tiếp theo bằng hàm thu nhận (cân bằng khám phá·khai thác) $x_{next}$
3 Đánh giá thực tế hàm mục tiêu (phép tính đắt đỏ) $y_{next}=f(x_{next})$
4 Thêm quan sát rồi lặp lại từ 1 → hội tụ Phân phối hậu nghiệm đã cập nhật

Lý do cấu trúc này hiệu quả là "mô hình thay thế đóng vai trò hàm xấp xỉ rẻ tiền". Hàm thật đắt đỏ chỉ được gọi số lần tối thiểu, còn việc tìm kiếm và so sánh thực tế được thực hiện trên mô hình thay thế rẻ tiền, nên tổng chi phí giảm đáng kể.

3. Các thành phần cốt lõi

A. Mô hình thay thế (Surrogate Model)

Mô hình thay thế ước lượng phân phối hậu nghiệm của hàm mục tiêu dựa trên quan sát. Được dùng rộng rãi nhất là quá trình Gauss (GP), giả định rằng giá trị hàm tại tập điểm bất kỳ tuân theo phân phối chuẩn nhiều chiều. Điểm mạnh của GP là cho dự đoán không phải ước lượng điểm mà là trung bình và phương sai (khoảng tin cậy), nên biểu đạt tự nhiên tính chất "vùng càng ít quan sát thì phương sai càng lớn". Phương sai này trở thành căn cứ thúc đẩy khám phá ở phần sau. Tuy nhiên, GP trở nên đắt đỏ với $O(n^3)$ theo số quan sát $n$ do phép nghịch đảo ma trận kernel, nên trong trường hợp số chiều cao và lượng quan sát lớn đôi khi được thay bằng TPE (Tree-structured Parzen Estimator) hoặc mô hình thay thế dựa trên rừng ngẫu nhiên (SMAC).

B. Hàm thu nhận (Acquisition Function)

Hàm thu nhận gộp $\mu,\ \sigma$ của mô hình thay thế thành một điểm số để quyết định điểm đánh giá tiếp theo. Tiêu biểu là EI (Expected Improvement, lượng cải thiện kỳ vọng) tối đa hóa kỳ vọng của mức cải thiện so với giá trị tối ưu hiện tại, và UCB (Upper Confidence Bound) chọn một cách lạc quan bằng cách cộng trọng số bất định vào trung bình như $\mu(x)+\kappa,\sigma(x)$. PI (xác suất cải thiện) chỉ xét xác suất xảy ra cải thiện. Tất cả chúng chỉ khác nhau ở tỷ lệ trộn giữa "$\mu$ trông có vẻ tốt" và "$\sigma$ chưa từng đến", về bản chất là các thiết lập khác nhau của cán cân khám phá–khai thác.

Yếu tố Mô tả Tiêu biểu
Mô hình thay thế (Surrogate) Xấp xỉ xác suất phân phối hàm, cung cấp độ bất định GP·TPE·rừng ngẫu nhiên
Hàm thu nhận Kết hợp $\mu,\sigma$ để chọn điểm tiếp theo EI·PI·UCB
Khám phá vs khai thác Tìm kiếm vùng bất định ↔ tập trung vùng triển vọng Điều chỉnh bằng $\kappa,\ \xi$

C. Cân bằng giữa khám phá (Exploration) và khai thác (Exploitation)

Thành bại của tối ưu hóa Bayes phụ thuộc vào sự cân bằng này. Nếu chỉ khai thác (= chỉ nơi $\mu$ lớn) thì bị mắc kẹt ở cực trị cục bộ tình cờ tốt ở giai đoạn đầu, còn nếu chỉ khám phá (= chỉ nơi $\sigma$ lớn) thì chẳng khác gì tìm kiếm ngẫu nhiên. Ví dụ, tăng $\kappa$ của UCB thì khám phá mạnh lên, giảm thì khai thác mạnh lên. Hàm thu nhận tốt sẽ tự động nghiêng cán cân này sao cho ban đầu khám phá rộng, rồi khi quan sát tích lũy và độ bất định giảm thì chuyển tự nhiên sang khai thác.

4. Ưu điểm và nhược điểm

Ưu điểm Lý do Nhược điểm Lý do
Tìm điểm tối ưu với ít lần đánh giá Tích lũy tận dụng quan sát quá khứ bằng mô hình thay thế Hiệu năng giảm ở số chiều cao Không gian lớn làm độ khó xấp xỉ GP·tìm kiếm↑
Không cần đạo hàm (ứng phó hộp đen) Chỉ cần giá trị hàm Khối lượng tính toán GP $O(n^3)$ Chi phí nghịch đảo ma trận kernel
Định lượng độ bất định GP cung cấp phương sai Song song hóa tương đối khó Về bản chất là ra quyết định tuần tự

Ví dụ, trong không gian siêu tham số 20 chiều, quan sát khó phủ dày không gian hiệu dụng nên hiệu năng giảm, khi đó bổ sung bằng giảm chiều, tìm kiếm không gian con (REMBO) hoặc TPE, BOHB. Vấn đề tính tuần tự được giảm nhẹ bằng tối ưu hóa Bayes theo lô (batch) chọn nhiều ứng viên cùng lúc.

5. Lưu ý và hàm ý

  • Chuẩn trên thực tế của AutoML và tối ưu hóa siêu tham số: Optuna, Hyperopt, Ray Tune v.v. tích hợp sẵn TPE, BOHB. So với tìm kiếm ngẫu nhiên, nó giảm rõ rệt số lần thử để đạt cùng hiệu năng, tiết kiệm ngân sách GPU đắt đỏ.
  • Chiến lược ứng phó số chiều cao: dùng BOHB (Hyperband+BO) kết hợp giảm chiều, TPE, dừng sớm để dung hòa theo cách "loại nhanh ứng viên bằng đánh giá độ phân giải thấp rẻ tiền, chỉ đánh giá chính xác ứng viên triển vọng".
  • Mở rộng sang thiết kế thí nghiệm (DOE): hiệu quả giảm số lần thử rất lớn trong các miền mà một lần thí nghiệm thực tế cực kỳ đắt đỏ như A/B testing, tìm kiếm vật liệu mới, chất xúc tác, tối ưu công thức quy trình bán dẫn.
  • Đánh đổi: có chi phí phụ trội cho việc tính toán và tinh chỉnh chính mô hình thay thế và hàm thu nhận, nên lợi ích rõ ràng khi đánh giá hàm mục tiêu đủ đắt đỏ (vài phút trở lên), còn với hàm rẻ tiền thì tìm kiếm ngẫu nhiên hay lưới có thể tốt hơn.

Tóm tắt một câu: Tối ưu hóa Bayes là kỹ thuật xác định phân phối hậu nghiệm của hàm mục tiêu bằng mô hình thay thế (GP) và điểm đánh giá tiếp theo bằng hàm thu nhận (EI·UCB), điều chỉnh cân bằng khám phá–khai thác để tìm điểm tối ưu của hàm hộp đen đắt đỏ với số ít lần thử; được dùng rộng rãi trong tinh chỉnh siêu tham số, AutoML, thiết kế thí nghiệm, nhưng ở số chiều cao được bổ sung bằng TPE, BOHB v.v.