Foundation Model (Mô hình nền tảng)
1. Tổng quan
A. Định nghĩa
Foundation Model là mô hình AI đa dụng quy mô lớn được tiền huấn luyện (Pre-training) trên khối lượng dữ liệu khổng lồ để có thể thích ứng và ứng dụng vào nhiều tác vụ hạ nguồn (downstream task) khác nhau. GPT, BERT, CLIP, Llama là những đại diện tiêu biểu, và chúng được tái sử dụng cho nhiều ứng dụng chỉ bằng tinh chỉnh (Fine-tuning) hoặc prompt. Năm 2021, nhóm nghiên cứu Stanford HAI đã đặt ra thuật ngữ này với ý nghĩa "mô hình trở thành nền tảng (foundation) cho nhiều tác vụ".
Điều mà Foundation Model mang lại là một sự chuyển dịch mô thức (paradigm shift) trong phương thức phát triển AI. Cốt lõi là sự chuyển đổi "từ cách xây dựng lại mô hình mới cho mỗi tác vụ, sang cách thích ứng một mô hình đa dụng duy nhất cho nhiều tác vụ". Trước đây, máy dịch, bộ phân tích cảm xúc và chatbot đều phải được huấn luyện từ đầu bằng những tập dữ liệu riêng biệt. Mỗi mô hình chỉ biết đúng tác vụ hẹp của mình, và khi có tác vụ mới thì phải lặp lại việc gán nhãn quy mô lớn và huấn luyện.
Foundation Model thông qua tiền huấn luyện quy mô lớn trước tiên học được các biểu diễn tổng quát của ngôn ngữ và hình ảnh (tri thức rộng và các mẫu thống kê về thế giới), sau đó chỉ với một lượng nhỏ dữ liệu hoặc prompt là thực hiện được nhiều tác vụ đa dạng như dịch, tóm tắt, phân loại, sinh nội dung. Đó là việc đặt nhiều ứng dụng lên trên cùng một "nền tảng (Foundation)". Điều này hạ thấp một cách mang tính đột phá rào cản gia nhập của phát triển AI và tối đa hóa khả năng tái sử dụng, qua đó tái cấu trúc chính cấu trúc của ngành AI từ "lấy phát triển mô hình làm trung tâm" sang "lấy sử dụng và thích ứng mô hình làm trung tâm".
B. Bối cảnh ra đời và sự cần thiết
Sự trỗi dậy của Foundation Model gắn kết ba bối cảnh kỹ thuật. Thứ nhất, việc phát hiện Quy luật tỷ lệ (Scaling Law). Nghiên cứu của OpenAI (Kaplan et al., 2020) cho thấy rằng khi cùng lúc mở rộng dữ liệu, khối lượng tính toán và số tham số mô hình thì hiệu năng của mô hình (mất mát) được cải thiện theo dạng hàm lũy thừa (power-law) một cách có thể dự đoán. Điều này cung cấp căn cứ đầu tư rằng "làm lớn hơn thì tốt hơn".
Thứ hai, sự xuất hiện của kiến trúc Transformer (2017, Attention Is All You Need). Self-Attention có khả năng huấn luyện song song mà không cần cấu trúc hồi quy, ăn khớp với xử lý song song quy mô lớn trên GPU và hiện thực hóa được việc huấn luyện siêu quy mô. Thứ ba, học tự giám sát (Self-Supervised Learning). Bằng cách huấn luyện khối lượng lớn văn bản và hình ảnh thô không có nhãn theo hướng "đoán từ tiếp theo" hoặc "phục hồi phần bị che", ta có thể tận dụng dữ liệu quy mô lớn mà không cần gán nhãn thủ công đắt đỏ. Khi ba yếu tố này kết hợp, các mô hình tiền huấn luyện siêu quy mô đã chính thức bùng nổ, lấy GPT-3 (175 tỷ tham số, 2020) làm điểm khởi đầu.
2. Cấu trúc khái niệm của Foundation Model
Nguyên lý hoạt động của Foundation Model được tóm gọn thành một pipeline duy nhất "tiền huấn luyện → thích ứng → đa dạng tác vụ". Sơ đồ cấu trúc tổng thể dưới đây cho thấy dòng chảy từ dữ liệu đến ứng dụng.
flowchart LR
D["Dữ liệu quy mô lớn<br/>văn bản·hình ảnh·âm thanh"] --> P["Tiền huấn luyện<br/>Foundation Model"]
P --> A["Thích ứng<br/>tinh chỉnh·prompt·RAG"]
A --> T1["Dịch"]
A --> T2["Tóm tắt"]
A --> T3["Phân loại·sinh"]
A --> T4["Mã·suy luận"]
style P fill:#e8f0fe,stroke:#2f6fed,stroke-width:2px
style A fill:#fef3e8,stroke:#ed8a2f,stroke-width:2px
Điểm cốt lõi của hình trên là một mô hình đơn nhất ở giữa (P) phân nhánh ra vô số tác vụ ở bên phải. Trước đây, từ trái sang phải cần nhiều pipeline độc lập theo từng tác vụ, nhưng Foundation Model chỉ thực hiện một lần công đoạn nặng nề là tiền huấn luyện, và sau đó chỉ lặp lại việc thích ứng nhẹ nhàng. Cấu trúc "học một lần, dùng nhiều lần" này chính là nguồn gốc của hiệu quả chi phí và tốc độ lan tỏa.
Các đặc trưng của Foundation Model liên kết với nhau theo quan hệ nhân quả. Tham số và dữ liệu quy mô lớn sinh ra tính đa dụng (dùng một mô hình cho nhiều tác vụ), và khi quy mô vượt một ngưỡng nhất định thì quan sát thấy khả năng đột hiện (Emergent Ability) — các năng lực chưa từng được huấn luyện tường minh như suy luận số học, tư duy đa bước — đột ngột xuất hiện. Biểu diễn đa dụng có được như vậy sẽ được thích ứng vào một lĩnh vực cụ thể bằng tinh chỉnh, prompt, RAG, và gần đây đang được mở rộng sang đa phương thức (Multimodal) xử lý cùng lúc văn bản, hình ảnh và âm thanh.
| Đặc trưng | Nội dung | Hàm ý thực tiễn |
|---|---|---|
| Tính đa dụng | Dùng một mô hình cho nhiều tác vụ | Giảm chi phí phát triển theo tác vụ |
| Quy mô lớn | Tiền huấn luyện với tham số·dữ liệu khổng lồ | Cần tính toán·điện năng lớn |
| Khả năng đột hiện | Xuất hiện năng lực bất ngờ khi mở rộng quy mô | Bước nhảy hiệu năng phi tuyến |
| Khả năng thích ứng | Chuyên biệt hóa lĩnh vực bằng tinh chỉnh·prompt·RAG | Chuyên biệt hóa với ít dữ liệu |
| Đa phương thức | Xử lý tích hợp văn bản·hình ảnh·âm thanh | Mở rộng phạm vi ứng dụng |
Sự khác biệt giữa mô hình AI truyền thống và Foundation Model đặc biệt nổi bật dưới góc nhìn kinh tế học phát triển. Ở phương thức truyền thống, đối với mỗi tác vụ phải lặp lại toàn bộ quá trình thu thập dữ liệu, gán nhãn, thiết kế mô hình, huấn luyện và triển khai, nên nếu có N tác vụ thì chi phí cũng tăng khoảng N lần. Ở phương thức Foundation Model, sau khi trả một lần chi phí cố định (fixed cost) là tiền huấn luyện, thì chi phí biên (marginal cost) phát sinh cho mỗi tác vụ giảm mạnh xuống mức viết prompt hoặc tinh chỉnh quy mô nhỏ. Sự chuyển đổi cấu trúc chi phí này là động lực kinh tế khiến AI tạo sinh lan tỏa bùng nổ, đồng thời cũng là bối cảnh của xu hướng độc quyền hóa khi năng lực tập trung vào một số ít doanh nghiệp đủ sức gánh chịu chi phí tiền huấn luyện.
3. Công nghệ nền và kiến trúc huấn luyện
Foundation Model là kết tinh của nhiều công nghệ. Sơ đồ chi tiết dưới đây cho thấy các tầng của ngăn xếp công nghệ từ tiền huấn luyện đến căn chỉnh và sử dụng.
flowchart TB
subgraph PRE["Giai đoạn tiền huấn luyện"]
T["Transformer·Self-Attention"]
SSL["Học tự giám sát"]
HW["Học phân tán·đa GPU(HBM·InfiniBand)"]
end
subgraph ADAPT["Giai đoạn thích ứng·căn chỉnh"]
FT["Tinh chỉnh·PEFT(LoRA)"]
AL["Căn chỉnh(RLHF·DPO)"]
RAG["RAG(sinh tăng cường truy xuất)"]
end
PRE --> ADAPT --> APP["Dịch vụ ứng dụng thực tế"]
style PRE fill:#e8f0fe,stroke:#2f6fed,stroke-width:2px
style ADAPT fill:#fef3e8,stroke:#ed8a2f,stroke-width:2px
Thứ nhất, Self-Attention của Transformer là cấu trúc cốt lõi trong đó mọi token trong câu tham chiếu lẫn nhau để học sự phụ thuộc tầm xa của ngữ cảnh. Khác với RNN xử lý tuần tự, nó có thể tính toán song song nên đã giải quyết nút thắt tốc độ của huấn luyện quy mô lớn. Thứ hai, học tự giám sát che một phần dữ liệu thô và bắt mô hình dự đoán mà không cần nhãn, giúp cho tiền huấn luyện trở nên khả thi. Dòng GPT dùng phương thức dự đoán token tiếp theo (Autoregressive), còn dòng BERT dùng phương thức phục hồi token bị che (Masked LM).
Thứ ba, hạ tầng học phân tán·đa GPU (bộ nhớ băng thông cao HBM, mạng siêu tốc InfiniBand, song song hóa dữ liệu·tensor·pipeline) gom hàng nghìn GPU thành một cụm huấn luyện duy nhất, hỗ trợ về mặt vật lý cho việc huấn luyện mô hình siêu quy mô. Khi số tham số lên đến hàng trăm tỷ thì mô hình không nạp được vào bộ nhớ của một GPU đơn lẻ, nên song song hóa ba chiều — kết hợp song song hóa tensor·pipeline chia mô hình ra nhiều thiết bị và song song hóa dữ liệu chia dữ liệu ra để xử lý — trở thành bắt buộc.
Thứ tư, căn chỉnh (Alignment) lấp đầy những phần mà chỉ tiền huấn luyện là không đủ. Mô hình đã tiền huấn luyện tuy có tri thức khổng lồ nhưng chưa được điều chỉnh để phản hồi theo cách con người mong muốn, nên sau khi khiến nó tuân theo mệnh lệnh bằng tinh chỉnh theo chỉ dẫn (Instruction Tuning), người ta tăng cường tính hữu ích, vô hại và trung thực bằng học tăng cường dựa trên phản hồi con người (RLHF) hoặc tối ưu hóa sở thích trực tiếp (DPO) đơn giản hơn. Phải có giai đoạn căn chỉnh này thì mới cho ra chất lượng đủ để dùng cho dịch vụ hội thoại thực tế.
Thứ năm, RAG (sinh tăng cường truy xuất) và PEFT (tinh chỉnh nhẹ như LoRA) tiêm tri thức mới nhất và tri thức lĩnh vực một cách hiệu quả. RAG tại thời điểm truy vấn sẽ tìm kiếm cơ sở tri thức bên ngoài và đưa các tài liệu căn cứ vào cùng prompt, qua đó phản ánh thông tin mới nhất và giảm ảo giác mà không cần huấn luyện lại mô hình. LoRA giữ nguyên các tham số gốc khổng lồ và chỉ huấn luyện một số ít ma trận hạng thấp (low-rank), hạ chi phí chuyên biệt hóa và dung lượng lưu trữ xuống hàng chục lần.
| Công nghệ | Vai trò | Ví dụ tiêu biểu |
|---|---|---|
| Transformer·Self-Attention | Học song song ngữ cảnh tầm xa | GPT, BERT |
| Học tự giám sát | Tiền huấn luyện quy mô lớn không cần nhãn | Dự đoán token tiếp theo, MLM |
| Học phân tán·đa GPU | Huấn luyện mô hình siêu quy mô | Song song hóa dữ liệu·tensor |
| Căn chỉnh(RLHF·DPO) | Tinh chỉnh phản ánh sở thích con người | ChatGPT, Claude |
| RAG·PEFT(LoRA) | Tiêm hiệu quả tri thức mới·lĩnh vực | Chatbot tri thức doanh nghiệp |
4. Trường hợp ứng dụng và cân nhắc khi triển khai
Foundation Model đang lan tỏa ra toàn ngành. Cụ thể, GitHub Copilot của Microsoft tận dụng foundation model về mã và đã có kết quả nghiên cứu báo cáo rằng nó nâng cao đáng kể năng suất phát triển; trong tài chính và y tế, nó được dùng để phân tích tài liệu chuyên môn qua tinh chỉnh chuyên biệt theo lĩnh vực (như BloombergGPT). Dòng CLIP và DALL·E học cùng lúc hình ảnh và văn bản được ứng dụng vào tìm kiếm, sinh nội dung và sản xuất nội dung. Việc các ứng dụng theo từng ngành chồng lớp lên trên cùng một nền tảng như vậy là dòng chảy hiện tại.
Cách thức doanh nghiệp áp dụng Foundation Model đại thể chia thành ba hướng. Thứ nhất là gọi API thương mại, hầu như không có chi phí ban đầu và dùng được ngay, nhưng có sự phụ thuộc là dữ liệu ra ngoài và bị tính phí tỷ lệ với lượng sử dụng. Thứ hai là phương thức đặt mô hình open-weight (ví dụ dòng Llama) lên hạ tầng riêng để tinh chỉnh, có lợi cho chủ quyền dữ liệu và ứng phó quy định nhưng đòi hỏi hạ tầng GPU và năng lực MLOps. Thứ ba là phương thức đặt mô hình chuyên biệt quy mô nhỏ (sLLM) tại chỗ (on-premises) để chỉ xử lý dữ liệu nhạy cảm trong nội bộ. Kỹ sư chuyên nghiệp phải tổng hợp độ nhạy cảm dữ liệu, quy định, chi phí và yêu cầu hiệu năng để đánh giá sự đánh đổi giữa ba phương thức này, và khi cần thì phải thiết kế được cấu hình lai kết hợp tri thức nội bộ bằng RAG.
Foundation Model có thể chia thành ba dòng lớn, và tùy mục đích ứng dụng mà lựa chọn khác nhau. BERT thuộc dòng bộ mã hóa (Encoder) mạnh về việc hiểu toàn bộ câu theo hai chiều nên phù hợp với các tác vụ hiểu như phân loại, tìm kiếm, nhận diện thực thể có tên. GPT thuộc dòng bộ giải mã (Decoder) chuyên biệt cho việc sinh token tiếp theo một cách tuần tự nên mạnh về sinh nội dung, hội thoại, tóm tắt. Dòng bộ mã hóa-giải mã (ví dụ T5) cân bằng tốt cho các tác vụ kiểu dịch, tóm tắt vốn phải hiểu đầu vào và sinh ra đầu ra mới. Trong thực tế, khi dịch vụ hội thoại gia tăng thì dòng decoder đã trở thành dòng chủ đạo, nhưng cho mục đích tìm kiếm, nhúng thì dòng encoder vẫn được dùng rộng rãi.
Tuy nhiên mạnh mẽ đến đâu thì đi kèm ba tầng trách nhiệm. Về mặt pháp lý, các vấn đề là bản quyền·giấy phép của dữ liệu huấn luyện (thực tế đang có các vụ kiện đang diễn ra như New York Times kiện OpenAI), thông tin cá nhân, chủ thể chịu trách nhiệm cho kết quả, và tuân thủ quy định như EU AI Act, Luật cơ bản về AI của Hàn Quốc. Về mặt môi trường, vì việc huấn luyện mô hình siêu quy mô tiêu tốn điện năng và carbon khổng lồ nên đòi hỏi Green AI và nhẹ hóa. Về mặt xã hội, đặt ra các vấn đề phân biệt đối xử do thiên kiến của dữ liệu huấn luyện bị khuếch đại, thông tin sai lệch·deepfake, biến đổi việc làm, lạm dụng, độc quyền mô hình của số ít big tech và vấn đề tiếp cận công bằng.
| Khía cạnh | Cân nhắc | Hướng ứng phó |
|---|---|---|
| Pháp lý | Bản quyền·giấy phép dữ liệu huấn luyện, thông tin cá nhân, trách nhiệm, quy định | Quản lý nguồn gốc dữ liệu, hệ thống tuân thủ quy định |
| Môi trường | Điện năng·phát thải carbon của huấn luyện | Green AI·nhẹ hóa·học hiệu quả |
| Xã hội | Thiên kiến·phân biệt, thông tin sai·deepfake, việc làm·độc quyền | Căn chỉnh·rào chắn, mô hình mở |
5. Chuyên sâu: Xu hướng mới nhất và tiến hóa công nghệ
Hệ sinh thái Foundation Model đang tiến hóa nhanh chóng. Thứ nhất, dòng chảy hiệu quả hóa·nhẹ hóa (sLLM). Không chỉ các mô hình khổng lồ hàng trăm tỷ tham số, mà cả các mô hình nhỏ hàng tỷ tham số (sLLM) đang được tối ưu bằng lượng tử hóa (Quantization), chưng cất (Distillation), MoE (Mixture of Experts, hỗn hợp chuyên gia) để tăng các ứng dụng trên thiết bị và tiết kiệm chi phí. MoE là phương thức chỉ kích hoạt một phần các mạng con chuyên gia cho mỗi đầu vào để giảm khối lượng tính toán trong khi vẫn duy trì dung lượng lớn, đã trở thành công nghệ cốt lõi của các mô hình mới nhất.
Thứ hai, mở rộng sang tác nhân (Agent). Khi Foundation Model vượt qua việc phản hồi đơn thuần để tự sử dụng công cụ (tìm kiếm·thực thi mã·gọi API) và lập kế hoạch·thực hiện các tác vụ đa bước, đóng vai trò bộ não của tác nhân, thì tính tự chủ của ứng dụng đang được nâng cao đáng kể. Thứ ba, tích hợp đa phương thức đang tăng tốc, tiến theo hướng xử lý văn bản·hình ảnh·âm thanh·video trong một mô hình duy nhất.
Thứ tư, tinh vi hóa đánh giá·quản trị. Khi mô hình lớn lên và việc sử dụng mở rộng, vượt qua chỉ số độ chính xác đơn thuần, các benchmark (như MMLU) và đánh giá về an toàn·thiên kiến·độc hại đang được chuẩn hóa, và quy trình kiểm tra trước khả năng lạm dụng bằng đội đỏ (Red-teaming) đang được đưa vào pipeline phát triển. Thông lệ minh bạch tài liệu hóa dữ liệu huấn luyện và các giới hạn bằng thẻ mô hình (Model Card)·bảng dữ liệu cũng đang lan rộng.
Dưới góc nhìn xu hướng đề thi, kỳ thi Kỹ sư chuyên nghiệp về quản lý thông tin đã ra đề theo hình thức hỏi về khái niệm·công nghệ nền·rủi ro của Foundation Model gắn với LLM·AI tạo sinh·Transformer·RAG. Nếu cấu trúc bài làm theo dòng chảy "ý nghĩa của chuyển dịch mô thức → quy luật tỷ lệ và công nghệ nền → cơ chế thích ứng·căn chỉnh → rủi ro pháp lý·môi trường·xã hội → xu hướng mới nhất như nhẹ hóa·tác nhân" thì có thể đảm bảo cả chiều sâu lẫn tính cập nhật.
6. Cân nhắc và hàm ý
Sự lan tỏa của hệ sinh thái ứng dụng là dòng chảy cốt lõi. Vô số ứng dụng được tạo ra trên nền Foundation Model bằng tinh chỉnh·prompt·tác nhân, và năng lực cạnh tranh của doanh nghiệp đang chuyển từ "năng lực tạo ra mô hình" sang "năng lực thích ứng·kết hợp mô hình một cách khéo léo". Kỹ sư chuyên nghiệp phải tư vấn được lựa chọn chiến lược giữa tự phát triển, sử dụng API và tinh chỉnh mô hình mã nguồn mở.
Độ tin cậy·an toàn·chi phí là mấu chốt của thực tiễn hóa. Độ tin cậy giảm ảo giác (Hallucination)·thiên kiến, an toàn qua căn chỉnh và rào chắn, và hiệu quả hóa hạ chi phí suy luận bằng sLLM·lượng tử hóa·MoE quyết định thành bại của việc đưa dịch vụ thực tế vào vận hành. Đặc biệt RAG đã trở thành chuẩn thực tiễn giảm ảo giác bằng tính cập nhật và trình bày căn cứ.
Cần nội tại hóa rủi ro pháp lý·môi trường·xã hội ngay từ giai đoạn thiết kế (Responsible AI by Design). Công nghệ đa dụng càng mạnh thì tác dụng phụ càng lớn, nên phải tích hợp quản trị dữ liệu·quản lý bản quyền·giảm thiểu thiên kiến·đo lường carbon ngay từ đầu quá trình phát triển. Ứng phó hậu kỳ có chi phí và tổn thất niềm tin lớn.
Rủi ro chủ quyền·độc quyền và hệ sinh thái mở. Việc độc quyền mô hình của số ít big tech sinh ra sự phụ thuộc và bất bình đẳng tiếp cận, nên việc đảm bảo mô hình mở (open-weight) và hạ tầng AI cấp quốc gia (sovereign AI) đang nổi lên như một nhiệm vụ chiến lược. Điều này cũng quan trọng dưới góc nhìn chủ quyền dữ liệu và an ninh.
Đảm bảo phù hợp quy định. Môi trường quy định như quy định dựa trên rủi ro của EU AI Act và Luật cơ bản về AI của Hàn Quốc đang hình thành nhanh chóng, nên lĩnh vực ứng dụng càng có rủi ro cao thì càng phải phản ánh trước vào thiết kế các nghĩa vụ về minh bạch·khả năng giải thích·ghi chép.
Tài liệu tham khảo
- Bommasani et al., "On the Opportunities and Risks of Foundation Models", Stanford HAI, https://arxiv.org/abs/2108.07258
- Vaswani et al., "Attention Is All You Need", https://arxiv.org/abs/1706.03762
- Kaplan et al., "Scaling Laws for Neural Language Models", https://arxiv.org/abs/2001.08361
- Stanford, "Artificial Intelligence Index Report", https://aiindex.stanford.edu/report/
Tóm tắt một câu: Foundation Model là AI đa dụng được tiền huấn luyện quy mô lớn dựa trên quy luật tỷ lệ·Transformer·học tự giám sát, thích ứng vào nhiều tác vụ bằng tinh chỉnh·prompt·căn chỉnh (RLHF)·RAG, gần đây tiến hóa sang sLLM·MoE·tác nhân·đa phương thức, nhưng phải quản lý tích hợp ngay từ giai đoạn thiết kế các rủi ro pháp lý·môi trường·xã hội như bản quyền dữ liệu huấn luyện·điện năng·thiên kiến.