← Về danh sách
AI & Dữ liệu
#Data-Centric AI#데이터 품질#라벨링#MLOps#데이터 거버넌스#AI 신뢰성
Cập nhật lần cuối · 2026-09-20

Trí tuệ nhân tạo lấy dữ liệu làm trung tâm (Data-Centric AI) và kỹ thuật chất lượng dữ liệu huấn luyện

1. Tổng quan

Định nghĩa: Trí tuệ nhân tạo lấy dữ liệu làm trung tâm (Data-Centric AI, DCAI) là cách tiếp cận nâng cao hiệu năng và độ tin cậy của hệ thống AI bằng cách thiết kế có hệ thống dữ liệu huấn luyện và kiểm định phù hợp với bài toán và liên tục cải thiện chất lượng của chúng, thay vì chỉ nâng cấp cấu trúc mô hình và mã nguồn.

Các dự án học máy truyền thống thường áp dụng cách tiếp cận lấy mô hình làm trung tâm (Model-Centric): giữ nguyên tập dữ liệu và thay đổi số lớp, siêu tham số, hàm mất mát, phương pháp ensemble của mô hình. Cách này hiệu quả cho nghiên cứu thuật toán, nhưng trong thực tế, khi nguyên nhân suy giảm hiệu năng là lỗi nhãn, thiếu sót, trùng lặp, thiên lệch hoặc không phản ánh phân phối tại hiện trường thì chỉ thay đổi mô hình mang lại mức cải thiện nhỏ. Cách tiếp cận lấy dữ liệu làm trung tâm không có nghĩa là luôn cố định mô hình, mà là coi dữ liệu cũng là tài sản hệ thống ngang hàng với mô hình và vận hành các mục tiêu chất lượng tường minh cùng vòng lặp cải tiến.

Từ góc nhìn Kỹ sư chuyên nghiệp Quản lý Thông tin, DCAI không phải là một kỹ thuật tiền xử lý đơn thuần. Đó là bài toán kết hợp quản trị dữ liệu và MLOps, liên kết thu thập, định nghĩa, gán nhãn, kiểm duyệt, quản lý phiên bản, huấn luyện, đánh giá và giám sát sau triển khai. Vì vậy, Kỹ sư chuyên nghiệp (Professional Engineer) không nên chỉ đưa ra một con số độ chính xác, mà cần đưa vào bài làm đồng thời tính phù hợp của dữ liệu với mục đích nghiệp vụ, tính đại diện, khả năng truy vết, bảo vệ thông tin cá nhân và tính bền vững vận hành.

Bối cảnh xuất hiện có thể tóm lược thành ba điểm. Thứ nhất, khi hiệu năng của các mô hình công khai và mô hình tiền huấn luyện được nâng lên đồng đều, sự khác biệt về dữ liệu trên cùng một mô hình quyết định kết quả. Thứ hai, dữ liệu nghiệp vụ thực tế có phân phối khác nhau giữa thời điểm huấn luyện và thời điểm vận hành do tính mùa vụ, thay đổi thiết bị, thay đổi hành vi người dùng. Thứ ba, với AI tạo sinh và AI đa phương thức, nếu không truy vết nguồn gốc, bản quyền, thông tin cá nhân, trùng lặp và tình trạng ô nhiễm của dữ liệu gốc thì không chỉ hiệu năng mô hình mà cả rủi ro pháp lý và đạo đức đều gia tăng.

Mục đích của DCAI không phải là thu thập thật nhiều dữ liệu mà là có được dữ liệu phù hợp với mục đích. 1,000 mẫu đại diện thể hiện các loại sự cố hiếm có thể hữu ích hơn 100,000 mẫu chỉ lặp lại trạng thái bình thường. Ngược lại, nếu chỉ khuếch đại một số ít trường hợp khi số mẫu còn thiếu thì sẽ xảy ra quá khớp (overfitting) và phán đoán sai trong môi trường thực tế, nên cần kiểm chứng sự cân bằng giữa chất lượng và số lượng bằng thực nghiệm.

2. Khái niệm và cấu trúc triển khai của AI lấy dữ liệu làm trung tâm

2.1 Khác biệt với cách tiếp cận lấy mô hình làm trung tâm

Cách tiếp cận lấy mô hình làm trung tâm coi tập dữ liệu là đầu vào tương đối cố định và cải thiện năng lực biểu diễn cùng phương pháp tối ưu của mô hình. Ngược lại, DCAI cải thiện hiệu năng bằng cách thay đổi phiên bản tập dữ liệu, chính sách gán nhãn, cơ cấu mẫu và loại lỗi dù phiên bản mô hình vẫn giữ nguyên. Điểm quan trọng là hai cách tiếp cận không loại trừ lẫn nhau. Cách làm thực tiễn là cố định mô hình cơ sở để đo hiệu quả của thay đổi dữ liệu, và sau khi đạt mức chất lượng dữ liệu nhất định thì song hành cải tiến mô hình.

Trong DCAI, chất lượng dữ liệu bao hàm cả chất lượng chung theo nghĩa cơ sở dữ liệu lẫn tính phù hợp để huấn luyện AI. Dù giá trị được điền đầy đủ về hình thức, nếu không giải thích được ranh giới phân loại thực tế thì theo góc nhìn AI đó là chất lượng thấp. Ví dụ, dù mọi pixel của ảnh sản xuất đều có độ phân giải cao, nếu vùng lỗi bị che khuất hoặc chỉ chứa mẫu không lỗi thì không phù hợp cho việc phán định tại hiện trường.

Bảng sau tóm lược sự khác biệt giữa hai cách tiếp cận. Các mục trong bảng không phải là kết luận để học thuộc, mà được dùng làm tiêu chí quyết định hướng đi của các hoạt động cải tiến sẽ được giải thích ở phần sau.

Hạng mục AI lấy mô hình làm trung tâm AI lấy dữ liệu làm trung tâm
Đối tượng cải tiến chính Cấu trúc, tham số, hàm mất mát, mã suy luận Thu thập, nhãn, tính đại diện, lỗi·trùng lặp, phân phối dữ liệu
Giả định cơ bản Tập dữ liệu tương đối cố định Tập dữ liệu cũng được thiết kế·cải tiến lặp lại
Đo lường hiệu năng Tập trung vào chỉ số mô hình Liên kết chỉ số mô hình và chỉ số chất lượng dữ liệu
Vai trò cốt lõi Kỹ sư ML·nhà nghiên cứu Chuyên gia miền·kỹ sư dữ liệu·người gán nhãn·phụ trách quản trị
Rủi ro chính Quá khớp, khối lượng tính toán, thất bại tổng quát hóa Thiên lệch nhãn, trôi dạt, nguồn gốc không rõ, thông tin cá nhân·bản quyền
Phương thức vận hành Tập trung vào pipeline huấn luyện Cùng quản lý phiên bản·kiểm chứng·giám sát dữ liệu và mô hình

Ưu điểm của cách tiếp cận lấy mô hình làm trung tâm là mang lại đột phá nhanh khi cấu trúc mô hình mới nâng cao đáng kể năng lực biểu diễn của bài toán. Tuy nhiên, nếu nguyên nhân lỗi là sự bất nhất về ý nghĩa của dữ liệu thì mô hình lớn hơn có thể học lỗi một cách phức tạp hơn. DCAI không chủ trương đơn giản hóa mô hình, mà chủ trương quản lý nguyên nhân và ngữ cảnh của dữ liệu đưa vào mô hình.

2.2 Luồng triển khai tổng thể

DCAI không phải là công việc làm sạch một lần mà là vòng lặp khép kín: phát hiện lỗi dữ liệu, cải tiến rồi đánh giá lại. Trong cấu trúc sau, cổng chất lượng (quality gate) vừa là cơ chế dừng pipeline, vừa là điểm kiểm toán lưu lại bằng chứng đã vượt qua tiêu chí nào.

flowchart LR
    A[Mục tiêu nghiệp vụ·định nghĩa rủi ro] --> B[Thu thập dữ liệu gốc]
    B --> C[Lập hồ sơ dữ liệu]
    C --> D[Chính sách nhãn·hợp đồng dữ liệu]
    D --> E[Làm sạch·loại trùng·bổ sung tính đại diện]
    E --> F[Chia huấn luyện/kiểm định/kiểm thử]
    F --> G[Huấn luyện mô hình cơ sở]
    G --> H[Đánh giá theo lát cắt·phân tích lỗi]
    H --> I{Vượt cổng chất lượng?}
    I -- Không --> E
    I -- Có --> J[Triển khai·giám sát vận hành]
    J --> K[Thu thập trôi dạt·lỗi mới]
    K --> C

Ở bước đầu tiên, cần định nghĩa cấu trúc tổn thất của quyết định nghiệp vụ trước mục tiêu độ chính xác. Nếu chi phí bỏ sót sản phẩm lỗi khác với chi phí phân loại sản phẩm bình thường thành lỗi thì phải dùng recall, precision, hàm mất mát có trọng số chi phí thay vì độ chính xác đơn thuần. Không có mục tiêu này, nhóm dữ liệu sẽ chỉ tạo ra dữ liệu cân bằng đẹp mắt và bỏ sót các loại thất bại quan trọng của nghiệp vụ.

Lập hồ sơ dữ liệu (data profiling) là hoạt động nắm bắt schema, tỷ lệ thiếu, miền giá trị, trùng lặp, phân phối, khoảng thời gian và nguồn gốc. Với hình ảnh thì kiểm tra độ phân giải, ánh sáng, thiết bị chụp, tệp bị hỏng; với văn bản thì kiểm tra ngôn ngữ, mã hóa ký tự, độ dài, có chứa thông tin nhạy cảm hay không. Kết quả lập hồ sơ là căn cứ để xác định đường cơ sở chất lượng dữ liệu và thứ tự ưu tiên cải tiến sau đó.

Chính sách nhãn không phải là tài liệu chỉ quy định tên nhãn. Nó bao gồm cả cách phán định các trường hợp biên, có cho phép đa nhãn không, có tạm hoãn các mẫu không chắc chắn không, và ai quyết định khi người gán nhãn bất đồng ý kiến. Khi chính sách thay đổi, ý nghĩa của dữ liệu cũ và dữ liệu mới có thể khác nhau, nên cần quản lý đồng thời phiên bản schema nhãn.

Ở bước làm sạch, không xóa một cách vô điều kiện. Trước tiên cần xác định giá trị ngoại lai là lỗi đo lường hay trường hợp hiếm có thật. Xóa trường hợp hiếm có thể làm chỉ số trung bình tốt lên nhưng mô hình không học được rủi ro đuôi (tail risk) của môi trường vận hành. Vì vậy cần ghi lại trong dòng dõi dữ liệu (lineage) đã áp dụng biện pháp nào trong số xóa, sửa, tạm hoãn, điều chỉnh trọng số, thu thập bổ sung.

2.3 Tài sản kết hợp giữa dữ liệu và mô hình

Khả năng tái lập của AI không thể đảm bảo chỉ bằng mã nguồn và tệp mô hình. Phải lưu giữ đồng thời snapshot dữ liệu dùng để huấn luyện, quy tắc tiền xử lý, chính sách nhãn, bộ trích xuất đặc trưng, tập đánh giá và môi trường thực thi thì mới tái tạo được cùng kết quả. Khi phiên bản dữ liệu thay đổi, phiên bản mô hình cũng phải được xử lý như một ứng viên phát hành riêng.

Hợp đồng dữ liệu (Data Contract) là cơ chế để bên sản xuất và bên tiêu thụ thống nhất về schema, ý nghĩa, ngưỡng chất lượng và cách thông báo thay đổi. Ví dụ, có thể tuyên bố event_time của sự kiện khách hàng tính theo UTC và phải đến trong vòng 5 phút, còn định danh phải là token chứ không phải thông tin cá nhân gốc. Vi phạm hợp đồng có thể dẫn đến thất bại huấn luyện hoặc phán đoán sai khi vận hành, nên được kiểm tra tự động ở bước CI.

3. Kỹ thuật chất lượng dữ liệu

3.1 Các chiều chất lượng và đo lường

Các chiều chất lượng cần cho AI khác nhau tùy mục đích và loại dữ liệu. Bảng sau tổng hợp các chiều tiêu biểu, nhưng trong dự án thực tế cần liên kết rủi ro nghiệp vụ với phân tích lỗi mô hình để lựa chọn các hạng mục đo lường.

Chiều chất lượng Ý nghĩa Ví dụ đo lường tiêu biểu
Tính chính xác Mức độ giá trị khớp với đối tượng thực tế·quy tắc nghiệp vụ Tỷ lệ khớp dữ liệu tham chiếu, tỷ lệ kiểm duyệt nhãn
Tính đầy đủ Mức độ các giá trị bắt buộc và trường hợp cần thiết hiện diện đầy đủ Tỷ lệ thiếu, tỷ lệ đáp ứng trường bắt buộc
Tính nhất quán Mức độ ý nghĩa không mâu thuẫn giữa các bản ghi·nguồn·thời điểm Số vi phạm quy tắc, tỷ lệ không khớp đơn vị
Tính duy nhất Mức độ kiểm soát trùng lặp của cùng sự kiện·thực thể Tỷ lệ trùng lặp, tỷ lệ phát hiện gần trùng
Tính kịp thời Mức độ dữ liệu đến đúng thời điểm cần cho quyết định nghiệp vụ Độ trễ, độ mới
Tính đại diện Mức độ phản ánh đủ các nhóm·điều kiện·ranh giới của đối tượng vận hành Chênh lệch phân phối, độ bao phủ theo nhóm
Độ tin cậy của nhãn Mức độ phù hợp tiêu chuẩn và đồng thuận cao giữa người gán nhãn Tỷ lệ kiểm duyệt lại, hệ số Kappa của Cohen
Dòng dõi·khả năng truy vết Mức độ có thể tái lập nguồn gốc và quá trình biến đổi Tỷ lệ thiếu lineage, độ bao phủ provenance

Tỷ lệ thiếu có thể được định nghĩa là số bản ghi thiếu của một trường chia cho tổng số bản ghi. Tuy nhiên, điều quan trọng hơn là việc thiếu có ngẫu nhiên hay tập trung vào một nhóm khách hàng, thiết bị, khung giờ nhất định. Nếu điền giá trị trung bình cho các giá trị thiếu mang tính chọn lọc, mô hình có thể không học được nguyên nhân gây thiếu hoặc thiên lệch đối với một nhóm cụ thể có thể tăng lên.

Tỷ lệ trùng lặp đo lường vấn đề đếm lặp cùng một sự kiện. Với văn bản và hình ảnh, cần phát hiện không chỉ trùng khớp hoàn toàn mà cả gần trùng (near-duplicate) có ý nghĩa tương tự. Nếu dữ liệu trùng lặp bị chia vào cả tập huấn luyện và tập kiểm thử, chỉ số có thể bị thổi phồng do rò rỉ dữ liệu chứ không phải do tổng quát hóa thực sự.

Tính đại diện không chỉ có nghĩa là toàn bộ dữ liệu có tỷ lệ giống thực tế. Cần kiểm tra cả việc đã chủ động đưa vào đủ các điều kiện hiếm gây chi phí lớn khi vận hành hay chưa. Ví dụ, điều kiện ban đêm, trời mưa, ánh sáng yếu dù chỉ chiếm 5% tổng thể nhưng nếu liên quan đến tai nạn an toàn thì phải được quản lý như một lát cắt đánh giá riêng.

3.2 Chất lượng nhãn và vai trò của con người

Nhãn trong học có giám sát không phải là bản thân sự thật mà là kết quả phán đoán khi áp dụng quy tắc nghiệp vụ. Cùng một ảnh y tế hay câu hỏi của khách hàng, nhãn có thể khác nhau tùy cách diễn giải chính sách, nên chất lượng nhãn phụ thuộc vào tay nghề người gán nhãn và độ rõ ràng của hướng dẫn. Khi chuyên gia miền khó trực tiếp gán nhãn toàn bộ dữ liệu, chi phí được phân bổ bằng kiểm duyệt lại theo mẫu và kiểm duyệt tập trung vào các trường hợp khó.

Hướng dẫn gán nhãn bao gồm ví dụ dương tính và âm tính, trường hợp biên, tiêu chí tạm hoãn, thứ tự ưu tiên khi đa nhãn, quy tắc che thông tin cá nhân. Một danh sách tên nhãn đơn thuần không giảm được sai lệch giữa người gán nhãn. Khi hướng dẫn thay đổi, ghi lại lý do thay đổi, thời điểm áp dụng, phiên bản dữ liệu bị ảnh hưởng, và nếu cần thì ánh xạ lại các nhãn cũ.

Mức đồng thuận giữa người gán nhãn không phải là một con số duy nhất thay thế cho đáp án đúng. Các trường hợp đồng thuận thấp có thể là tín hiệu cho thấy bản thân bài toán mơ hồ hoặc hướng dẫn chưa đầy đủ. Thay vì loại bỏ các trường hợp này, có thể bảo toàn ý nghĩa của chúng bằng nhãn không chắc chắn, phân biệt giữa đa số phiếu và phán định của chuyên gia, hay trọng số thấp khi huấn luyện mô hình.

3.3 Tính đại diện, thiên lệch và phân chia dữ liệu

Phân chia dữ liệu bằng cách trộn ngẫu nhiên không phải lúc nào cũng an toàn. Dự báo nhu cầu có thứ tự thời gian phải được chia theo thời gian để thông tin tương lai không lẫn vào việc học quá khứ. Nếu các bản phái sinh của cùng người dùng, cùng thiết bị, cùng tài liệu nằm ở nhiều tập thì phải áp dụng phân chia theo nhóm.

Sau khi phân chia, cần xem không chỉ trung bình tổng thể mà cả chỉ số theo từng lát cắt như khu vực, giới tính, độ tuổi, thiết bị, ngôn ngữ, khung giờ, loại nghiệp vụ. Dù điểm F1 tổng thể cao, nếu recall của nhóm thiểu số thấp thì sẽ phát sinh vấn đề về chất lượng dịch vụ và tính công bằng. Lát cắt không có nghĩa là mở rộng thu thập thông tin cá nhân một cách không cần thiết, mà là thiết kế các tiêu chí tổng hợp có thể chẩn đoán rủi ro trong phạm vi hợp pháp và cần thiết.

Tăng cường dữ liệu (data augmentation) có thể bổ sung các điều kiện còn thiếu nhưng có thể làm tổn hại ý nghĩa của phân phối gốc. Cần kiểm chứng việc xoay ảnh có thực sự không liên quan đến hướng vật thể, việc thay thế văn bản có bảo toàn ý định câu hay không, dữ liệu sinh ra có phản ánh mẫu lỗi thực tế hay không. Dữ liệu tăng cường được phân biệt với dữ liệu gốc và ghi lại quy tắc sinh cùng kết quả kiểm duyệt chất lượng.

3.4 Phân tích lỗi và thu thập dữ liệu chủ động

Phân tích lỗi sau huấn luyện không dừng lại ở việc liệt kê các mẫu sai, mà phân loại lỗi theo nguồn gốc, nhãn, biểu diễn, phân phối và ranh giới mô hình. Nếu cùng một lỗi lặp lại, trước khi mở rộng mô hình, hãy bổ sung các mẫu thể hiện rõ lỗi đó hoặc sửa đổi chính sách nhãn. Khi đó, hệ thống phân loại lỗi trở thành đơn vị của backlog cải tiến dữ liệu.

Học chủ động (Active Learning) là chiến lược ưu tiên gán nhãn các mẫu mà mô hình đánh giá là không chắc chắn hoặc có tính đại diện thấp. Trong các miền có chi phí gán nhãn cao, nó có thể hiệu quả hơn gán nhãn ngẫu nhiên, nhưng có thể liên tục bỏ qua các vùng mà mô hình ban đầu bỏ sót. Vì vậy cần chọn đồng thời mẫu dựa trên độ không chắc chắn và mẫu ngẫu nhiên·điều kiện hiếm để giảm thiên lệch khám phá.

Hard negative là các trường hợp mô hình thường nhận nhầm nhưng thực tế thuộc lớp khác. Khi bổ sung hard negative, phải giải thích được lý do nhận nhầm. Nếu chỉ lặp lại các ảnh khó, tập dữ liệu có thể bị khớp quá mức với một điều kiện chụp cụ thể, nên cần kiểm tra đồng thời độ bao phủ theo lớp, môi trường và khung giờ.

4. Vòng đời, kiến trúc và quản trị

4.1 Kiến trúc cải tiến chất lượng

Dưới đây là kiến trúc logic kết nối kho dữ liệu, kiểm chứng chất lượng, gán nhãn, huấn luyện và phản hồi vận hành. Cốt lõi không nằm ở tên data lake hay công nghệ lưu trữ, mà là cấu trúc trong đó mọi biến đổi và phán định đều được liên kết với người chịu trách nhiệm, phiên bản và kết quả chất lượng.

flowchart TB
    S[Hệ thống gốc·Cảm biến·Tài liệu] --> I[Thu thập·Đồng ý·Phi định danh hóa]
    I --> L[Kho dữ liệu gốc]
    L --> P[Lập hồ sơ·Quy tắc chất lượng]
    P --> V[Registry tập dữ liệu đã kiểm chứng]
    V --> A[Bàn làm việc gán nhãn·kiểm duyệt lại]
    A --> T[Pipeline huấn luyện·đặc trưng·embedding]
    T --> M[Registry mô hình·kết quả đánh giá]
    M --> D[Triển khai·Phục vụ]
    D --> O[Log vận hành·Phản hồi·Trôi dạt]
    O --> P
    G[Chính sách·Quyền truy cập·Lưu giữ·Kiểm toán] -.-> I
    G -.-> L
    G -.-> A
    G -.-> M

Ở lớp thu thập, giảm thu thập ngoài mục đích và xác nhận sự đồng ý, căn cứ pháp lý và thời hạn lưu giữ. Dù đã áp dụng phi định danh hóa, dữ liệu vẫn có thể bị tái định danh khi kết hợp với thông tin khác, nên cần thiết kế đồng thời quyền truy cập, kiểm soát xuất dữ liệu và log. AI lấy dữ liệu làm trung tâm không phải là cách tiếp cận thu thập thêm dữ liệu để nâng cao chất lượng, và không mâu thuẫn với nguyên tắc dữ liệu tối thiểu phù hợp với mục đích cần thiết.

Registry tập dữ liệu đã kiểm chứng quản lý phiên bản, schema, thống kê, chính sách nhãn, kết quả chất lượng, người phê duyệt và giới hạn sử dụng của tập dữ liệu. Khi liên kết với registry mô hình, có thể tra cứu mô hình nào được huấn luyện với phiên bản dữ liệu nào. Sự liên kết này quan trọng để nhanh chóng thu hẹp phạm vi ảnh hưởng khi có sự cố hoặc yêu cầu từ cơ quan quản lý.

Phản hồi vận hành có thể bao gồm việc người dùng sửa đáp án, bộ phận nghiệp vụ từ chối, cảnh báo giám sát và mẫu từ môi trường mới. Nếu đưa nguyên phản hồi vào huấn luyện sẽ phát sinh vấn đề kẻ tấn công tiêm dữ liệu bị ô nhiễm hoặc tin cậy đầu vào của người dùng sai. Vì vậy cần tách các ứng viên tái huấn luyện theo tiêu chí độ tin cậy, trạng thái kiểm duyệt và nguồn gốc.

4.2 Tích hợp DataOps và MLOps

DataOps quản lý chất lượng, khả năng tái lập và triển khai của luồng dữ liệu, còn MLOps quản lý huấn luyện, triển khai và quan sát mô hình. Trong DCAI, nếu hai pipeline vận hành tách rời thì sẽ bỏ sót ảnh hưởng của thay đổi dữ liệu đến hiệu năng mô hình. Cần liên kết thay đổi snapshot dữ liệu làm trigger đánh giá lại mô hình, và liên kết suy giảm hiệu năng mô hình làm trigger phân tích lỗi dữ liệu.

Ở bước CI, kiểm tra schema, trường bắt buộc, miền giá trị, trùng lặp·rò rỉ, phát hiện thông tin cá nhân và phân phối nhãn. Ở bước CD hoặc triển khai huấn luyện, xác nhận hiệu năng so với mô hình cơ sở, hiệu năng theo lát cắt, tiêu chí công bằng, khả năng giải thích và chi phí suy luận. Cổng tự động không thay thế phán đoán của con người mà chặn sớm các vi phạm lặp lại và chuẩn hóa quy trình phê duyệt ngoại lệ.

Trôi dạt dữ liệu (data drift) là sự thay đổi phân phối đầu vào, còn trôi dạt khái niệm (concept drift) là hiện tượng quan hệ giữa đầu vào và đáp án thay đổi. Dù phân phối đầu vào không đổi, trôi dạt khái niệm vẫn có thể xảy ra khi chính sách nghiệp vụ thay đổi. Vì vậy chỉ kiểm tra phân phối thống kê là không đủ; khi có thể, cần giám sát đồng thời tỷ lệ lỗi thực tế có tính đến độ trễ của nhãn và KPI nghiệp vụ.

4.3 Thông tin cá nhân, bảo mật và trách nhiệm giải trình

AI lấy dữ liệu làm trung tâm có nguy cơ làm tăng việc thu thập và tái sử dụng dữ liệu gốc. Cần đưa vào thiết kế mục đích thu thập, thu thập tối thiểu, thời hạn lưu giữ, quyền truy cập, ghi nhận xử lý và ứng phó yêu cầu xóa. Với dữ liệu huấn luyện chứa thông tin nhạy cảm, không coi phi định danh hóa là giải pháp vạn năng mà kết hợp bút danh hóa (pseudonymization), kiểm soát truy cập, mã hóa, môi trường phân tích an toàn và kiểm tra đầu ra.

Tấn công đầu độc dữ liệu (data poisoning) là tấn công trong đó kẻ tấn công đưa mẫu độc hại hoặc nhãn sai vào dữ liệu huấn luyện để thay đổi hiệu năng chung hoặc hành vi trong điều kiện cụ thể của mô hình. Để phòng thủ, kiểm tra độ tin cậy nguồn gốc, lịch sử thay đổi, kênh thu thập đã được phê duyệt, mẫu nhãn bất thường và thay đổi hiệu năng so với dữ liệu chuẩn. Hash hoặc chữ ký của tập dữ liệu cung cấp bằng chứng toàn vẹn nhưng không đảm bảo tính chính xác về ngữ nghĩa của dữ liệu.

Cần xác nhận giấy phép, mục đích sử dụng và điều kiện phân phối lại của dữ liệu sinh ra và dữ liệu bên ngoài. Nếu không truy vết được nguồn gốc dữ liệu, việc giải thích đầu ra của mô hình và ứng phó về quyền sẽ khó khăn. Nêu rõ cơ cấu dữ liệu, giới hạn, thiên lệch đã biết và phạm vi đánh giá trong datasheet hoặc model card sẽ giúp người dùng và kiểm toán viên sử dụng hệ thống trong phạm vi đúng đắn.

5. So sánh và trường hợp thực tế

5.1 So sánh cải tiến chất lượng dữ liệu và tinh chỉnh mô hình

Tinh chỉnh mô hình điều chỉnh learning rate, chính quy hóa, cấu trúc, ensemble để nâng cao năng lực biểu diễn và tổng quát hóa trên cùng dữ liệu. Cải tiến chất lượng dữ liệu sửa lỗi và thiếu sót nhãn, lấp các khoảng trống trong phân phối, loại bỏ trùng lặp và rò rỉ, qua đó thay đổi chính tín hiệu mà mô hình học. Có thể giải thích rằng cách thứ nhất thay đổi không gian hàm của mô hình, còn cách thứ hai thay đổi độ tin cậy và độ bao phủ của tín hiệu đầu vào.

Nếu nguyên nhân hiệu năng đình trệ là nhãn bị thiên lệch, thì kiểm duyệt lại nhãn có thể có lợi tức đầu tư cao hơn thực nghiệm thay đổi mô hình. Ngược lại, khi dữ liệu đã được làm sạch đầy đủ và cần ranh giới phi tuyến phức tạp thì tinh chỉnh mô hình hiệu quả hơn. Kỹ sư chuyên nghiệp không nên khẳng định một bên là đáp án đúng, mà nên trình bày việc chọn hướng cải tiến thông qua phân rã lỗi và thiết kế thực nghiệm.

Tình huống Biện pháp ưu tiên Chỉ số xác nhận
Hiệu năng huấn luyện·kiểm thử đều thấp Kiểm tra nhãn·đặc trưng·định nghĩa bài toán Đồng thuận nhãn, recall theo lớp
Chỉ hiệu năng huấn luyện cao, kiểm thử thấp Kiểm tra rò rỉ·trùng lặp·tính đại diện·quá khớp Trùng lặp giữa các tập, hiệu năng theo lát cắt
Tổng thể cao nhưng điều kiện cụ thể thấp Bổ sung dữ liệu theo điều kiện·chia lại Chỉ số theo nhóm, độ bao phủ
Chỉ sụt giảm mạnh khi vận hành Phân tích trôi dạt·cảm biến·thay đổi chính sách PSI/thay đổi phân phối, tỷ lệ lỗi nghiệp vụ
Chi phí nhãn cao và nhiều ứng viên Học chủ động·gán nhãn theo ưu tiên Mức tăng hiệu năng trên mỗi mẫu, chi phí

5.2 Trường hợp giả định: kiểm tra lỗi sản xuất

Sau đây là trường hợp giả định để giải thích nguyên lý. Giả sử một dây chuyền sản xuất phán định lỗi bề mặt bằng hình ảnh camera. Dữ liệu ban đầu có 120 nghìn ảnh nhưng phần lớn là ca ngày, ánh sáng ban ngày và sản phẩm bình thường, hầu như không có mẫu từ camera mới và lỗi vi mô. Độ chính xác tổng thể của mô hình cơ sở cao nhưng bỏ sót nhiều lỗi ở dây chuyền mới.

Thứ nhất, dùng lập hồ sơ dữ liệu để phân chia phân phối theo thiết bị chụp, dây chuyền, khung giờ, loại lỗi. Thứ hai, loại bỏ rò rỉ do ảnh chụp liên tiếp của cùng sản phẩm nằm ở cả tập huấn luyện và kiểm thử. Thứ ba, chuyên gia miền kiểm duyệt lại 5,000 ảnh thuộc trường hợp biên của lỗi để tạo hướng dẫn nhãn và nhãn tạm hoãn. Thứ tư, chủ động thu thập bổ sung dữ liệu từ camera mới và điều kiện ánh sáng yếu, đồng thời quản lý riêng tỷ lệ giữa bình thường và lỗi.

Thứ năm, so sánh cùng với điểm tổng thể các chỉ số recall lỗi, recall theo dây chuyền, recall của lát cắt ánh sáng yếu. Thứ sáu, ưu tiên kiểm duyệt các hard negative mà mô hình thường sai, và chỉ đưa các trường hợp có độ tin cậy cao từ phản hồi vận hành vào phiên bản tập dữ liệu kế tiếp. Quá trình này là vòng lặp DCAI điển hình, có thể giảm bỏ sót lỗi bằng cách cải thiện tính đại diện và tính nhất quán nhãn của dữ liệu mà không cần thay đổi cấu trúc mô hình.

Khi báo cáo kết quả, không chỉ viết “độ chính xác đã tốt hơn”. Cần ghi lại đồng thời phiên bản dữ liệu, các điều kiện được bổ sung, mức đồng thuận nhãn, việc tập kiểm thử có được cố định hay không, mức cải thiện theo lát cắt và chi phí. Có như vậy mới phân biệt được cải tiến là tối ưu hóa ngẫu nhiên trên một tập kiểm thử cụ thể hay là nâng cao chất lượng vận hành thực sự.

6. Chuyên sâu: Xu hướng mới và liên hệ đề thi

DCAI không có nghĩa là công việc của các công ty gán nhãn dữ liệu. Gần đây, nó đang phát triển theo hướng tự động hóa chuẩn bị dữ liệu, gán nhãn, tăng cường, phân tích lỗi, kiểm chứng dữ liệu và kết nối kết quả vào pipeline MLOps. Tuy nhiên, nhãn do mô hình tự động tạo ra cũng có khả năng sai, nên vận hành dựa trên rủi ro với kiểm duyệt của con người và kiểm toán mẫu là phù hợp.

Trong xu hướng chuẩn hóa đánh giá chất lượng dữ liệu, có khuynh hướng xem xét không chỉ tính chính xác, đầy đủ, nhất quán mà cả các khía cạnh đặc thù của AI như tính đại diện, khả năng truy vết, chất lượng nhãn, thông tin cá nhân. Có thể tham chiếu mô hình chất lượng dữ liệu như ISO/IEC 25012 làm tiêu chuẩn chất lượng của tổ chức, nhưng áp dụng mọi đặc tính với cùng một ngưỡng thì chi phí sẽ lớn. Cần chọn các chiều chất lượng cốt lõi và chu kỳ đo lường phù hợp với rủi ro dịch vụ và mục đích sử dụng dữ liệu.

Trong AI tạo sinh, việc làm sạch tài liệu và loại bỏ trùng lặp, chất lượng chunk, metadata, tính phù hợp cho tìm kiếm, kiểm chứng thông tin cá nhân và bản quyền là quan trọng. Để nâng cao chất lượng câu trả lời của RAG, thay vì chỉ tinh chỉnh mô hình, cần cải thiện độ mới của kho văn bản tìm kiếm, quyền truy cập tài liệu, ranh giới chunk và liên kết bằng chứng. Tức là đối tượng của DCAI đang mở rộng từ dữ liệu nhãn truyền thống sang dữ liệu tìm kiếm, dữ liệu đánh giá và cả dữ liệu prompt.

Trong bài làm liên hệ với đề thi đã ra, triển khai theo trình tự “định nghĩa - sự cần thiết - cấu trúc - chỉ số chất lượng - vòng đời - quản trị - trường hợp - điểm cần lưu ý” sẽ mạch lạc. Liên kết với quản trị dữ liệu, DataOps·MLOps, độ tin cậy AI, bảo vệ thông tin cá nhân, hợp đồng dữ liệu, giám sát mô hình để giải thích quan hệ giữa các công nghệ sẽ tạo thành bài làm mang tính thiết kế thay vì học thuộc thuật ngữ đơn lẻ.

7. Các điểm cần lưu ý và hàm ý

7.1 Xác định chỉ số mục tiêu trước

Chỉ số chất lượng dữ liệu không phải càng nhiều càng tốt. Cần phân tích chi phí thất bại nghiệp vụ và loại lỗi của mô hình để xác định thứ tự ưu tiên giữa tính chính xác, tính đại diện, mức đồng thuận nhãn và độ mới. Phải văn bản hóa định nghĩa, tử số, mẫu số, chu kỳ đo lường và người chịu trách nhiệm của chỉ số thì mới giảm được tình trạng mỗi nhóm so sánh những con số khác nhau.

7.2 Bảo vệ tập kiểm thử và giao thức đánh giá

Nếu trong quá trình cải tiến dữ liệu lặp lại mà nhìn vào cả tập kiểm thử thì sẽ xảy ra quá khớp. Cố định tập kiểm thử ở mức có thể, và tách riêng tập kiểm định dùng cho cải tiến với tập giám sát vận hành. Khi phân phối thay đổi lớn, bổ sung tập kiểm thử mới nhưng vẫn duy trì tính liên tục với tập chuẩn hiện có.

7.3 Bố trí chuyên gia miền vào vòng lặp chất lượng

Chính sách nhãn và nguyên nhân lỗi khó được quyết định chỉ bởi nhóm dữ liệu. Chuyên gia miền diễn giải ý nghĩa của các trường hợp khó và định nghĩa các thất bại quan trọng về mặt nghiệp vụ. Cách hiệu quả là chuyên gia tập trung vào soạn hướng dẫn, kiểm toán mẫu, giải quyết tranh chấp và định nghĩa loại lỗi thay vì trực tiếp xử lý mọi mẫu.

7.4 Quản lý giới hạn của tự động hóa

Quy tắc kiểm chứng dữ liệu và gán nhãn tự động giảm công việc lặp lại nhưng có thể bỏ sót lỗi ngữ nghĩa không được biểu đạt trong quy tắc. Đặt độ tin cậy và đường ngoại lệ cho phán định tự động, và kiểm soát các thay đổi rủi ro cao bằng phê duyệt của con người và kiểm duyệt lại theo mẫu. Thay vì lấy tỷ lệ tự động hóa làm thành tích, hãy đánh giá sự cân bằng giữa chất lượng, chi phí và thời gian xử lý.

7.5 Đưa phạm vi thông tin cá nhân và quyền vào thiết kế

Chiến lược thu thập thêm dữ liệu có thể mở rộng xâm phạm thông tin cá nhân và sử dụng ngoài mục đích. Xem xét mục đích và thời hạn lưu giữ trước khi thu thập, và không sao chép dữ liệu gốc không cần thiết vào kho huấn luyện. Ghi lại giấy phép và nguồn gốc của dữ liệu bên ngoài và dữ liệu sinh ra, và truy vết ảnh hưởng của yêu cầu xóa hay giới hạn sử dụng đến pipeline mô hình và dữ liệu.

7.6 Đặt tiêu chí tái huấn luyện ứng phó với thay đổi vận hành

Nếu tái huấn luyện ngay khi có cảnh báo trôi dạt, mô hình có thể học dữ liệu bị ô nhiễm hoặc sự kiện tạm thời. Quyết định có tái huấn luyện hay không sau khi xác nhận thời gian kéo dài của cảnh báo, nhãn thực tế, tác động nghiệp vụ và độ tin cậy nguồn dữ liệu. Chuẩn bị so sánh với mô hình cơ sở trước và sau tái huấn luyện cùng phiên bản rollback.

7.7 Tính hiệu quả đầu tư theo đơn vị dữ liệu

Liên kết chi phí kiểm duyệt lại nhãn, thu thập bổ sung, đưa công cụ chất lượng vào với mức tăng hiệu năng. Tính đồng thời chi phí nhãn trên mỗi mẫu, thời gian chuẩn bị dữ liệu, mức tiết kiệm chi phí nghiệp vụ nhờ giảm lỗi và chi phí tái huấn luyện. Phải chỉ ra việc cải thiện 1%p độ chính xác giảm được bao nhiêu tổn thất nghiệp vụ thực tế thì mới dẫn đến quyết định của ban lãnh đạo.

7.8 Kỹ sư chuyên nghiệp trình bày bằng chứng và cấu trúc trách nhiệm

Thiết kế DCAI tốt không phải là tuyên bố “sử dụng dữ liệu sạch”, mà là hệ thống có thể tái lập ai đã phê duyệt theo tiêu chí nào và đã dùng phiên bản nào vào lúc nào. Lưu lại dataset card, hướng dẫn nhãn, báo cáo chất lượng, dòng dõi, model card, log truy cập và hồ sơ phê duyệt ngoại lệ. Các bằng chứng này nâng cao khả năng giải thích của hệ thống không chỉ khi ứng phó sự cố mà cả trong kiểm toán, quản lý và tranh chấp.

Tài liệu tham khảo

  1. Data-Centric Artificial Intelligence, arXiv — Định nghĩa AI lấy dữ liệu làm trung tâm, so sánh với cách tiếp cận lấy mô hình làm trung tâm, góc nhìn làm sạch·mở rộng dữ liệu.
  2. ETSI TR 104 180: Data Quality Metrics — Tham khảo các chiều đo lường chất lượng dữ liệu và việc xây dựng chỉ số.
  3. NIST AI Risk Management Framework — Tham khảo góc nhìn độ tin cậy AI·quản lý rủi ro và vòng đời.
  4. The Principles of Data-Centric AI, Communications of the ACM — Tham khảo vòng lặp cải tiến lấy dữ liệu làm trung tâm và góc nhìn phân tích lỗi.

Tóm tắt một câu: AI lấy dữ liệu làm trung tâm là phương pháp luận xây dựng AI đáng tin cậy bằng cách liên tục cải thiện chất lượng, tính đại diện và dòng dõi của dữ liệu phù hợp với mục đích thay vì dùng mô hình lớn hơn, đồng thời liên kết chúng với MLOps và quản trị.