← Về danh sách
AI & Dữ liệu
#PLM#LLM#사전학습#SFT#RLHF#133회
Cập nhật lần cuối · 2026-09-29

Quá trình phát triển từ PLM (mô hình ngôn ngữ tiền huấn luyện) đến LLM

1. Tổng quan

A. Định nghĩa

PLM (Pre-trained Language Model) là mô hình ngôn ngữ dựa trên học chuyển giao (họ BERT và GPT thời kỳ đầu), tiền huấn luyện (Pre-training) các mẫu chung của ngôn ngữ trên một kho ngữ liệu lớn rồi tinh chỉnh (Fine-tuning) cho từng tác vụ hạ nguồn để sử dụng. LLM (Large Language Model) là mô hình ngôn ngữ siêu lớn, mở rộng PLM đó lên hàng chục đến hàng trăm lần về tham số, dữ liệu và tính toán, đồng thời chồng thêm học theo chỉ dẫn và căn chỉnh theo sở thích con người để thực thi chỉ dẫn một cách tổng quát.

Ý tưởng cốt lõi của PLM là học chuyển giao: "học kiến thức chung của ngôn ngữ một lần ở quy mô lớn, rồi chỉ điều chỉnh một chút cho mỗi tác vụ." Khác với cách trước kia là xây mô hình từ đầu cho mỗi tác vụ, nó tái sử dụng ngữ cảnh, ngữ pháp và tri thức phổ thông thu được từ lượng văn bản khổng lồ, nên đạt hiệu năng cao ngay cả với ít dữ liệu gắn nhãn. Đây là sự dịch chuyển sang xử lý ngôn ngữ tự nhiên của chiến lược trong thị giác máy tính, nơi các CNN tiền huấn luyện trên ImageNet được tái sử dụng cho nhiều tác vụ; kể từ khi BERT và GPT xuất hiện năm 2018, nó đã trở thành mô thức tiêu chuẩn trên thực tế của NLP.

Có hai ràng buộc thực tiễn đã thúc đẩy nhu cầu về mô thức này. Thứ nhất, việc bảo đảm lượng lớn dữ liệu gắn nhãn cho mỗi tác vụ tốn kém khổng lồ và là sự lãng phí phải lặp lại cho mỗi miền. Thứ hai, các embedding tĩnh như Word2Vec và GloVe gán một vector cố định cho mỗi từ, mắc giới hạn đa nghĩa là không phân biệt được "đá (hòn đá)" với "đá (động tác chân)." Tiền huấn luyện đã giải quyết vấn đề thứ nhất bằng cách tích lũy tri thức ngôn ngữ chỉ từ văn bản không nhãn, và vấn đề thứ hai bằng embedding động dựa trên ngữ cảnh.

B. Đặc tính của PLM

Hai trụ cột đã làm cho PLM khả thi là học tự giám sát (Self-supervised Learning) và Transformer. Học tự giám sát tạo tín hiệu huấn luyện từ chính văn bản mà không cần con người gắn nhãn. BERT dùng MLM (Masked LM), che một phần câu rồi dự đoán, để nhìn đồng thời ngữ cảnh trái và phải, nên mạnh về hiểu câu (phân loại, nhận dạng thực thể có tên, v.v.); GPT có được năng lực sinh qua phương thức tự hồi quy (Autoregressive) chỉ nhìn ngữ cảnh phía trước để dự đoán token kế tiếp. Chính sự khác biệt về hàm mục tiêu này tạo ra khác biệt về tính chất giữa họ BERT (lấy hiểu làm trung tâm) và họ GPT (lấy sinh làm trung tâm), và khi LLM tiến tới hội thoại và sinh, phương thức tự hồi quy đã trở thành chủ đạo.

Self-Attention của Transformer tính song song quan hệ của mọi cặp token trong câu, biểu diễn một từ không phải bằng nghĩa từ điển cố định mà thành embedding động thay đổi theo ngữ cảnh. Khác với RNN và LSTM chỉ xử lý token tuần tự — quên thông tin phần đầu trong câu dài và khó song song hóa — Self-Attention kết nối trực tiếp quan hệ bất kể khoảng cách và cho phép huấn luyện song song quy mô lớn trên GPU. Chính tính song song này là tiền đề phần cứng làm cho quy luật quy mô mô tả dưới đây thành hiện thực.

Đặc tính Nội dung
Học chuyển giao Cấu trúc hai giai đoạn tiền huấn luyện → tinh chỉnh tái sử dụng tri thức
Học tự giám sát Học không nhãn qua MLM (BERT) / dự đoán token kế tiếp (GPT)
Embedding ngữ cảnh Biểu diễn từ một cách động theo ngữ cảnh (xử lý đa nghĩa)
Transformer Học song song dựa trên Self-Attention cho phép mở rộng quy mô

2. Cấu trúc tổng thể của quá trình phát triển PLM → LLM

Sự tiến hóa từ PLM đến LLM không phải một bước nhảy đơn lẻ mà là hai dòng chảy chồng lên nhau: mở rộng quy mô và bổ sung giai đoạn căn chỉnh. Sơ đồ khái niệm dưới đây trình bày toàn bộ phả hệ từ embedding tĩnh qua PLM đến LLM đã căn chỉnh, và sơ đồ chi tiết kiến trúc tiếp theo trình bày luồng xử lý token bên trong Transformer.

flowchart LR
  W["Embedding tĩnh (Word2Vec/GloVe)"] --> B["PLM: tiền huấn luyện + tinh chỉnh"]
  B --> G["Họ GPT (sinh tự hồi quy)"]
  B --> E["Họ BERT (hiểu hai chiều)"]
  G --> SC["Mở rộng quy mô (tham số/dữ liệu/tính toán)"]
  SC --> AL["Căn chỉnh (SFT + RLHF/DPO)"]
  AL --> L["LLM (thực thi chỉ dẫn tổng quát)"]
flowchart TB
  T["Token đầu vào"] --> EM["Embedding token + vị trí"]
  EM --> SA["Multi-Head Self-Attention"]
  SA --> AN["Kết nối phần dư + chuẩn hóa"]
  AN --> FF["Feed-Forward Network"]
  FF --> AN2["Kết nối phần dư + chuẩn hóa"]
  AN2 --> NX["Lặp cho lớp kế tiếp (N lớp)"]
  NX --> OUT["Phân phối xác suất token kế tiếp"]

Điểm cốt lõi mà sơ đồ phả hệ thứ nhất nói lên là LLM vừa là "phiên bản mở rộng" của PLM vừa đồng thời chứa một giai đoạn mới về chất (căn chỉnh). Một mô hình khổng lồ chỉ mới hoàn tất tiền huấn luyện thì chỉ nối token kế tiếp một cách trơn tru chứ không "tuân theo chỉ dẫn theo cách con người mong muốn." Chẳng hạn với đầu vào "hãy tóm tắt biên bản họp," thay vì đưa ra bản tóm tắt, nó cứ tiếp tục sinh các câu yêu cầu tương tự. Lấp khoảng cách này là công việc của các giai đoạn tiếp theo.

Như sơ đồ kiến trúc thứ hai cho thấy, khối Transformer lặp lại, qua N lớp, quá trình thu thập thông tin ngữ cảnh bằng Self-Attention và biến đổi nó bằng Feed-Forward Network, và mỗi lớp ổn định việc học sâu bằng kết nối phần dư và chuẩn hóa. LLM chồng hàng chục đến hàng trăm khối này và mở rộng bề rộng (hidden dimension) của mỗi lớp để đưa tham số lên quy mô hàng trăm tỷ.

Khác biệt giữa PLM và LLM

PLM và LLM nằm trên một chuỗi liên tục, nhưng thể hiện khác biệt rõ về chất trong cách sử dụng. PLM gần với "chuyên gia theo từng tác vụ" đòi hỏi tinh chỉnh riêng và dữ liệu gắn nhãn cho mỗi tác vụ, còn LLM gần với "trợ lý đa năng" nơi một mô hình duy nhất xử lý dịch, tóm tắt, lập trình, tư vấn chỉ bằng cách đổi prompt. Khác biệt này nảy sinh khi quy mô và căn chỉnh kết hợp và In-context Learning đột sinh.

Phân loại PLM LLM
Quy mô Hàng trăm triệu đến hàng tỷ tham số Hàng chục tỷ đến hàng trăm tỷ tham số
Thích nghi tác vụ Cần tinh chỉnh theo từng tác vụ Đáp ứng tức thời qua prompt (In-context)
Giai đoạn huấn luyện Tiền huấn luyện + tinh chỉnh Tiền huấn luyện + SFT + căn chỉnh (RLHF/DPO)
Năng lực tiêu biểu Hiểu câu/phân loại Sinh, suy luận, thực thi chỉ dẫn, hội thoại
Hình thức sử dụng Mô hình chuyên biệt theo tác vụ Mô hình nền tảng đa năng

Hàm ý thực tiễn là sự chuyển đổi phương thức phát triển và vận hành. Ở thời PLM, một mô hình riêng được xây, triển khai và bảo trì cho mỗi tác vụ như phân tích cảm xúc, phân loại tài liệu; ở thời LLM, nhiều tác vụ có thể được xử lý bằng cách gửi các prompt khác nhau đến một API duy nhất, giảm gánh nặng quản lý mô hình và làm cho các năng lực mới như kỹ thuật prompt và RAG trở nên quan trọng.

3. Quá trình huấn luyện PLM → LLM

flowchart LR
  D["Kho ngữ liệu lớn"] --> P["Tiền huấn luyện<br/>Pre-training"]
  P --> S["Tinh chỉnh có giám sát<br/>SFT"]
  S --> R["RLHF / DPO<br/>căn chỉnh theo sở thích con người"]
  R --> L["LLM"]

LLM không đơn thuần là PLM được mở rộng; nó được hoàn thiện bằng cách chồng một giai đoạn mới gọi là căn chỉnh (Alignment) lên trên tiền huấn luyện. Mỗi giai đoạn có mục đích khác biệt rõ ràng, và tạo thành cấu trúc "kim tự tháp ngược" trong đó càng về giai đoạn sau, quy mô dữ liệu càng nhỏ nhưng trọng số của chất lượng dữ liệu và sự can dự của con người càng lớn.

Giai đoạn Đặc tính huấn luyện Mục đích
Tiền huấn luyện (Pre-training) Thu nhận tri thức ngôn ngữ/thế giới qua tự giám sát (dự đoán token kế tiếp); tham số, dữ liệu, tính toán khổng lồ Hình thành nền tảng tri thức và năng lực ngôn ngữ
Tinh chỉnh có giám sát (SFT) Học từ dữ liệu chỉ dẫn-phản hồi (Instruction) do con người tạo Trao năng lực hiểu và thực thi chỉ dẫn
Căn chỉnh (RLHF/DPO) Mô hình phần thưởng theo sở thích con người (RLHF) hoặc tối ưu trực tiếp trên cặp sở thích (DPO) Căn chỉnh hành vi thành hữu ích, trung thực, vô hại (HHH)

A. Tiền huấn luyện

Mô hình dự đoán token kế tiếp trên hàng chục tỷ đến hàng nghìn tỷ token văn bản, và trong quá trình này ngữ pháp, sự kiện, mẫu suy luận được nén vào tham số. Dữ liệu huấn luyện được cấu thành bằng cách tinh lọc, khử trùng lặp và lọc từ dữ liệu thu thập web (CommonCrawl), Wikipedia, sách, kho mã nguồn, v.v., và chất lượng cùng sự đa dạng của dữ liệu quyết định lớn đến hiệu năng cuối cùng. Vì phần lớn chi phí (hàng nghìn GPU trong nhiều tuần đến nhiều tháng) phát sinh ở giai đoạn này, một hệ sinh thái mô hình nền tảng (Foundation Model) đã hình thành, trong đó chỉ một số ít tổ chức thực hiện tiền huấn luyện còn số còn lại tải về và sử dụng kết quả.

Hàm mục tiêu của tiền huấn luyện đơn giản nhưng sản phẩm phụ của nó thật đáng kinh ngạc. Chỉ bằng cách lặp lại một nhiệm vụ duy nhất là "đoán từ kế tiếp" ở quy mô nghìn tỷ, mô hình tự thu nhận được các biểu diễn cần thiết cho dịch, tóm tắt và suy luận thông thường. Điều này được giải thích bằng nhận định "dự đoán chính là hiểu," ở chỗ để dự đoán ngôn ngữ chính xác cần có tri thức nén về thế giới. Tuy vậy, sản phẩm của giai đoạn này gần với "quặng thô" chưa được kiểm soát — giàu tri thức nhưng chưa được định hướng.

Việc quản lý chất lượng dữ liệu ở giai đoạn tiền huấn luyện, vốn quyết định hiệu năng cuối cùng, cũng rất quan trọng về mặt thực tiễn. Đường ống tinh lọc loại bỏ văn bản chất lượng thấp, trùng lặp và có hại; việc loại trừ dữ liệu có vấn đề về quyền riêng tư và bản quyền; và việc cân bằng ngôn ngữ/miền đều diễn ra ở giai đoạn này. Vì nguyên tắc "rác vào thì rác ra (garbage in, garbage out)" được khuếch đại còn lớn hơn ở quy mô nghìn tỷ token, nghiên cứu gần đây đang dịch chuyển theo hướng chọn lọc dữ liệu chất lượng cao thay vì tăng khối lượng một cách mù quáng.

B. Tinh chỉnh có giám sát (SFT)

Bằng cách học từ các ví dụ chỉ dẫn-phản hồi chất lượng cao dạng "với câu hỏi thì trả lời, với yêu cầu tóm tắt thì tóm tắt," mô hình tiền huấn luyện được biến thành trợ lý tuân theo chỉ dẫn. Đây là quá trình huấn luyện lại bằng học có giám sát trên hàng nghìn đến hàng chục nghìn cặp (chỉ dẫn, phản hồi lý tưởng) được viết công phu; tuy khối lượng dữ liệu tuyệt đối chỉ là một phần rất nhỏ của tiền huấn luyện nhưng nó thay đổi dứt khoát cách hành xử của mô hình. Như bài báo InstructGPT đã cho thấy, một mô hình 1,3 tỷ tham số được căn chỉnh tốt có thể được con người ưa chuộng hơn một mô hình 175 tỷ tham số chưa căn chỉnh, điều này minh chứng hùng hồn giá trị của giai đoạn căn chỉnh.

Điểm rằng sự đa dạng và chất lượng của dữ liệu SFT quyết định phạm vi thực thi chỉ dẫn của mô hình cũng quan trọng. Chỉ khi bao gồm đồng đều một phạm vi rộng các loại chỉ dẫn — tóm tắt, dịch, lập trình, nhập vai, v.v. — thì mô hình mới trở thành trợ lý đa năng không thiên lệch về một tác vụ cụ thể; gần đây cũng xuất hiện xu hướng hạ chi phí xây dựng dữ liệu bằng cách sinh hàng loạt cặp chỉ dẫn-phản hồi bằng một mô hình mạnh rồi để con người kiểm duyệt, thay vì viết từng cặp bằng tay.

C. Căn chỉnh (RLHF/DPO)

RLHF (Reinforcement Learning from Human Feedback) xây một mô hình phần thưởng (Reward Model) từ dữ liệu trong đó con người xếp hạng nhiều câu trả lời cho cùng một câu hỏi theo sở thích, rồi tối ưu chính sách bằng học tăng cường (PPO, v.v.) để tối đa hóa phần thưởng này. Ngược lại, DPO (Direct Preference Optimization) tối ưu chính sách trực tiếp từ cặp sở thích (phản hồi được ưa chuộng, phản hồi không được ưa chuộng) mà không cần mô hình phần thưởng riêng hay vòng lặp học tăng cường, và gần đây được áp dụng rộng rãi vì đơn giản để triển khai và ổn định để huấn luyện. Giai đoạn này ức chế các phản hồi có hại và sai sự thật, đồng thời quyết định chất lượng sử dụng thực tế như giọng điệu, định dạng và tiêu chí từ chối. Tóm lại, tiền huấn luyện đảm nhận "biết gì," SFT "tuân theo chỉ dẫn ra sao," và căn chỉnh "trả lời bằng giá trị nào."

Ở giai đoạn căn chỉnh, cũng phải cân nhắc một sự đánh đổi gọi là thuế căn chỉnh (Alignment Tax). Nếu căn chỉnh an toàn và tính hữu ích quá mạnh, mô hình trở nên quá thận trọng (từ chối cả những yêu cầu vô hại) và một phần hiệu năng có thể bị hy sinh, nên việc điều chỉnh tỉ mỉ sự cân bằng giữa "hữu ích, trung thực, vô hại (HHH)" trong thiết kế mô hình phần thưởng và cấu thành dữ liệu sở thích là mấu chốt của thực tiễn. Một lý do DPO được ưa chuộng hơn RLHF cũng là vì nó giảm sự bất ổn của vòng lặp học tăng cường và rủi ro thao túng phần thưởng (reward hacking), qua đó đạt sự cân bằng này một cách ổn định hơn.

4. Quy luật quy mô (Scaling Law) và đột sinh

Chìa khóa giải thích bước nhảy về chất tới LLM là quy luật quy mô và đột sinh (Emergence). Tăng tham số, dữ liệu và tính toán làm giảm tổn thất kiểm định một cách dự đoán được theo dạng hàm lũy thừa (power-law) (Scaling Law), và điều thú vị là khi vượt qua một quy mô tới hạn nhất định, các năng lực vắng mặt ở mô hình nhỏ được biểu hiện một cách gián đoạn (đột sinh). Suy luận nhiều bước (Chain-of-Thought), và In-context Learning — giải tác vụ mới chỉ bằng ví dụ trong prompt mà không đổi tham số — là tiêu biểu.

Khái niệm Nội dung
Scaling Law Tăng tham số/dữ liệu/tính toán → tổn thất giảm dự đoán được theo hàm lũy thừa
Năng lực đột sinh (Emergent) Suy luận, In-context Learning, v.v. biểu hiện trên một quy mô tới hạn
In-context Learning Thực thi tác vụ qua ví dụ prompt (Few-shot) mà không cập nhật trọng số

Bài học mà quy luật quy mô mang lại cho thực tiễn là phân bổ tối ưu ngân sách tính toán. Ban đầu người ta cho rằng chỉ cần mở rộng tham số là đủ, nhưng nghiên cứu Chinchilla của DeepMind (2022) đã cho thấy với một lượng tính toán cho trước, phải tăng cân đối kích thước mô hình và số token huấn luyện, và các mô hình lớn thời đó lớn quá mức so với dữ liệu của chúng. Chẳng hạn việc Chinchilla — 70 tỷ tham số huấn luyện trên 1,4 nghìn tỷ token — vượt qua một mô hình 175 tỷ tham số trên nhiều benchmark là một trường hợp cụ thể cho thấy đáp án không phải "lớn vì lớn" mà "lớn cân đối với dữ liệu."

Đột sinh cũng có các trường hợp đo được rõ ràng. Năng lực số học ba chữ số và suy luận nhiều bước, vốn không đáng kể ở quy mô GPT-2, bỗng trở nên có ý nghĩa với Few-shot ở quy mô GPT-3 (175 tỷ tham số); tương tự, hiện tượng chỉ một dòng prompt "Hãy suy nghĩ từng bước (Let's think step by step)" làm tăng đáng kể độ chính xác suy luận cũng chỉ được quan sát trên một quy mô nhất định. Tuy nhiên, nghiên cứu gần đây chỉ ra rằng phần lớn "đột sinh gián đoạn" này có thể trông bị phóng đại do lựa chọn chỉ số đánh giá (phép nhị phân đúng/sai), nên cần một thái độ diễn giải đột sinh một cách thận trọng — không như phép màu tuyệt đối mà như một khía cạnh của sự cải thiện năng lực theo quy mô.

Ý nghĩa của In-context Learning đối với thực tiễn đặc biệt lớn. Việc có thể xử lý một tác vụ mới chỉ bằng cách đưa vài ví dụ (Few-shot) hoặc một chỉ dẫn vào prompt mà hoàn toàn không đổi trọng số nghĩa là có thể thay đổi ứng dụng tức thì mà không cần huấn luyện lại mô hình. Năng lực này đã khai sinh lĩnh vực thực tiễn mới là kỹ thuật prompt và trở thành nền tảng của phương thức vận hành LLM tái sử dụng một mô hình duy nhất cho nhiều tác vụ mà bỏ qua việc tinh chỉnh tốn kém.

5. Chuyên sâu: áp dụng theo miền và xu hướng mới nhất

Khi áp dụng một LLM khổng lồ vào công việc thực tế, việc tránh huấn luyện lại toàn bộ (chi phí và thời gian khổng lồ) và kết hợp các kỹ thuật thích nghi cục bộ đã trở thành tiêu chuẩn. Cốt lõi là chiến lược nhị nguyên tiêm năng lực/định dạng qua PEFT (Parameter-Efficient Fine-Tuning) và tri thức mới nhất/chuyên dụng qua RAG (Retrieval-Augmented Generation).

LoRA (Low-Rank Adaptation), đại diện của PEFT, đóng băng trọng số gốc và chỉ huấn luyện thêm một cặp ma trận hạng thấp (low-rank) ở mỗi lớp, đạt hiệu năng gần với tinh chỉnh toàn phần trong khi chỉ cập nhật dưới 1% tổng số tham số. Kết hợp điều này với lượng tử hóa 4-bit, QLoRA cho phép ngay cả các mô hình hàng chục tỷ tham số cũng được tinh chỉnh trên một GPU hiệu năng cao duy nhất, hạ đáng kể rào cản để từng doanh nghiệp và phòng thí nghiệm xây mô hình chuyên biệt theo miền. Điều này dẫn từ cấu trúc mà một số ít tổ chức độc quyền tiền huấn luyện đến sự dân chủ hóa của giai đoạn ứng dụng.

RAG, thay vì khắc tri thức vào tham số, tìm một cơ sở tri thức bên ngoài (tài liệu nội bộ, tin tức mới nhất, v.v.) bằng tìm kiếm vector tại thời điểm truy vấn rồi chèn vào prompt. Nó giảm ảo giác, bảo đảm tính cập nhật và có thể trình bày nguồn, nên đã tự khẳng định như một kiến trúc thiết yếu trên thực tế trong các lĩnh vực nơi độ chính xác về sự kiện quan trọng, như chatbot tri thức nội bộ và tư vấn khách hàng. Khi chi phí, độ trễ hoặc rò rỉ dữ liệu là mối lo, chiến lược đặt một sLLM (LLM nhỏ) được làm nhẹ qua lượng tử hóa và chưng cất tri thức tại chỗ (on-premises) cũng đang gia tăng. Gần đây, sự mở rộng theo hướng Tác tử (Agent) tự lập kế hoạch và thực hiện gọi công cụ, tìm kiếm và thực thi mã đang sôi động.

Nhìn vào các trường hợp áp dụng công nghiệp, tính hiệu quả của sự kết hợp này rất rõ. Các công cụ tự động hoàn thành mã ở hiện trường phát triển phần mềm kết nối một LLM tiền huấn luyện trên lượng mã công khai khổng lồ với cơ sở mã nội bộ qua RAG để đưa ra gợi ý khớp với quy ước riêng của đội, còn trong lĩnh vực tài chính và pháp lý, chúng được thiết kế để trả lời kèm căn cứ bằng cách tìm kiếm tài liệu quy định và án lệ, hạ thấp rủi ro trả lời sai do ảo giác. Trong tư vấn khách hàng, việc kết hợp RAG tìm kiếm lịch sử tư vấn và cẩm nang với SFT được điều chỉnh theo giọng điệu công ty bảo đảm chất lượng phản hồi nhất quán. Theo cách này, cấu thành ba tầng "LLM đa năng + tri thức miền (RAG) + điều chỉnh định dạng (PEFT/SFT)" đang định hình thành công thức tiêu chuẩn trên toàn ngành.

6. Điểm cân nhắc và hàm ý

  • Thiết kế phân chia vai trò: Phân chia trách nhiệm thành "năng lực qua tinh chỉnh (PEFT), tri thức qua RAG, an toàn qua căn chỉnh/quản trị" để thiết kế độ tin cậy, chi phí và bảo mật một cách cân đối là cốt lõi dưới góc nhìn của Kỹ sư chuyên nghiệp. Việc đặt ranh giới giữa cái gì khắc vào tham số và cái gì truy xuất từ bên ngoài chi phối chất lượng kiến trúc.
  • Quản lý rủi ro (ảo giác, thiên lệch, sai căn chỉnh): Khi quy mô lớn lên, rủi ro lớn lên cùng với năng lực. Ảo giác, bịa ra câu trả lời sai một cách hợp lý, phải được phòng thủ theo lớp qua RAG/trích dẫn nguồn/biểu đạt sự bất định; thiên lệch bắt nguồn từ dữ liệu huấn luyện qua tinh lọc dữ liệu và đánh giá đội đỏ; và sai căn chỉnh lệch khỏi ý định qua RLHF/DPO và lan can bảo vệ.
  • Sự đánh đổi giữa chi phí, độ trễ và chủ quyền: Giữa hiệu năng của các mô hình API siêu lớn và bảo mật/chi phí/chủ quyền dữ liệu của sLLM tại chỗ, một thiết kế phân tầng (định tuyến) mô hình theo độ khó tác vụ và yêu cầu quy định là thực tế.
  • Quản trị và ứng phó quy định: Phù hợp với các quy định như EU AI Act và chính sách nội bộ doanh nghiệp, phải bảo đảm nguồn gốc dữ liệu, bản quyền, thông tin cá nhân và dấu vết kiểm toán mô hình, đồng thời cũng phải xây hệ thống phòng thủ trước các mối đe dọa bảo mật kiểu mới như tiêm prompt và rò rỉ dữ liệu.
  • Hệ thống đánh giá và kiểm chứng: Như các trường hợp đột sinh cho thấy, khó kết luận năng lực từ một chỉ số benchmark duy nhất, nên phải trang bị một hệ thống kiểm chứng đa diện kết hợp các chỉ số định lượng theo tác vụ với đánh giá của con người, đội đỏ và phân tích nhật ký sử dụng thực tế để phát hiện sớm sự suy giảm chất lượng hay vấn đề an toàn sau triển khai.
  • Triển vọng: Sự mở rộng tiếp diễn theo hướng đa phương thức (tích hợp văn bản, hình ảnh và giọng nói), ngữ cảnh dài, tác tử tự chủ và sLLM trên thiết bị, nên năng lực thiết kế một hệ thống AI phức hợp kết hợp nhiều mô hình, công cụ và tìm kiếm — thay vì một mô hình khổng lồ duy nhất — ngày càng trở nên quan trọng.

Tài liệu tham khảo


Tóm tắt một câu: PLM là mô hình học chuyển giao gồm tiền huấn luyện + tinh chỉnh; thêm căn chỉnh SFT và RLHF/DPO rồi mở rộng quy mô sẽ phát triển nó, theo quy luật quy mô, thành LLM với năng lực đột sinh như In-context Learning, và trong thực tiễn PEFT, RAG và căn chỉnh phân chia lao động về năng lực, tri thức và an toàn.