Gán nhãn dữ liệu hình ảnh (Image Data Annotation)
1. Tổng quan
A. Định nghĩa
Công việc gắn nhãn đáp án đúng cho đối tượng, vùng, thuộc tính, v.v. (Ground Truth) vào hình ảnh để phục vụ học có giám sát của các mô hình thị giác máy tính.
Gán nhãn là quá trình tạo ra sách giáo khoa để mô hình học "đâu là đáp án đúng". Mô hình học có giám sát giảm sai số dự đoán dựa trên đáp án con người gán, nên nhãn chính là điểm mốc của việc học. Do đó, độ chính xác và tính nhất quán của gán nhãn chi phối hiệu năng mô hình không kém gì bản thân thuật toán. Bởi vì dù cấu trúc mạng nơ-ron có tinh vi đến đâu, nếu học từ đáp án sai thì sẽ học ra quy tắc sai.
Gán nhãn dễ bị xem là lao động giản đơn, nhưng thực chất là hoạt động kỹ nghệ kết hợp tri thức miền, phán đoán và quản lý chất lượng. Ví dụ, xác định ranh giới tổn thương trong ảnh y tế đến đâu cần phán đoán của bác sĩ chuyên khoa, và gán nhãn "người đi bộ bị che khuất một phần" trong xe tự lái sẽ khác nhau theo từng người làm nếu không có quy tắc rõ ràng. Như vậy, chất lượng gán nhãn rốt cuộc phụ thuộc vào thiết kế quy tắc và kiểm soát chất lượng về "gán nhãn cái gì và như thế nào".
Ngoài ra, gán nhãn không chỉ tạo dữ liệu huấn luyện mà còn là hoạt động tạo đáp án cho dữ liệu kiểm chứng và kiểm thử dùng để đánh giá mô hình. Nếu đáp án dùng để đánh giá không chính xác, hiệu năng thực tế của mô hình bị đo sai, dẫn đến đánh giá nhầm mô hình tồi thành tốt hoặc phạm lỗi ngược lại. Do đó, chất lượng gán nhãn có thể coi là nền tảng của hệ thống AI, đồng thời tác động đến cả hiệu năng huấn luyện lẫn độ tin cậy của việc đánh giá.
B. Bối cảnh ra đời và sự cần thiết
Như câu "rác vào thì rác ra (Garbage In, Garbage Out)", hiệu năng mô hình bị chi phối trực tiếp bởi chất lượng nhãn. Cùng một thuật toán, nếu đáp án không chính xác hoặc tiêu chí khác nhau giữa các người làm khiến kết quả lồi lõm, mô hình sẽ học các mẫu sai. Đây cũng là lý do trọng tâm của phát triển AI gần đây chuyển từ cải thiện cấu trúc mô hình sang cải thiện chất lượng dữ liệu (Data-centric AI). Cung cấp cho cùng một mô hình những nhãn sạch hơn, nhất quán hơn thường đóng góp vào cải thiện hiệu năng nhiều hơn so với tinh chỉnh cấu trúc mô hình.
Đặc biệt, khi các lĩnh vực đòi hỏi nhận dạng chính xác — như xe tự lái (nhận nhầm người đi bộ dẫn thẳng đến tai nạn), ảnh y tế (bỏ sót tổn thương dẫn thẳng đến chẩn đoán sai), kiểm tra lỗi — mở rộng, việc bảo đảm khối lượng lớn nhãn chất lượng cao một cách hệ thống đã trở thành nút thắt cốt lõi của phát triển AI. Trên thực tế, có nhiều báo cáo rằng thu thập, làm sạch và gán nhãn dữ liệu chiếm một phần đáng kể toàn bộ thời gian phát triển trong các dự án AI thương mại, cho thấy gán nhãn không phải công việc một lần mà là quá trình xây dựng tài sản phải quản lý liên tục. Hơn nữa, ngay cả sau khi mô hình được triển khai, vẫn phải liên tục bổ sung dữ liệu theo các tình huống mới (đường tuyết, ban đêm, biển báo mới), nên gán nhãn không phải việc kết thúc một lần mà trở thành một pipeline tuần hoàn.
2. Phân loại các kiểu gán nhãn
Hiểu các kiểu gán nhãn tức là hiểu "sẽ biểu diễn đáp án dưới hình thức nào". Cùng một đối tượng, hình thức biểu diễn cũng đa dạng — hình chữ nhật, đa giác, điểm, đường, hộp 3 chiều, v.v. — và mỗi hình thức khác nhau về loại thông tin và độ chính xác có thể chứa. Vì hình thức biểu diễn quyết định giới hạn trên của thông tin mà mô hình có thể học, việc phân loại kiểu không phải chỉ là sắp xếp thuật ngữ mà tương đương với thiết kế năng lực có thể học được.
Gán nhãn hình ảnh được phân loại theo chiều biểu diễn (2D/3D) và phương thức biểu diễn (hộp, đa giác, điểm, đường, v.v.). Sơ đồ khái niệm dưới đây thể hiện toàn bộ hệ thống phân loại trong một cái nhìn.
flowchart TB
A["Gán nhãn hình ảnh"] --> B["2D"]
A --> C["3D"]
B --> B1["Bounding Box"]
B --> B2["Polygon / Segmentation"]
B --> B3["Keypoint / Landmark"]
B --> B4["Polyline"]
C --> C1["3D Cuboid"]
C --> C2["Point Cloud"]
style A fill:#e8f0fe,stroke:#2f6fed,stroke-width:2px
Cốt lõi là hiểu các kiểu gán nhãn như một sự đánh đổi giữa độ chính xác biểu diễn và chi phí. Càng lên trên (bounding box) công việc càng nhanh và rẻ nhưng biểu diễn hình dạng càng thô, càng xuống dưới (segmentation, 3D) càng chính xác ở mức pixel/không gian nhưng thời gian và chi phí làm việc tăng vọt. Ví dụ, vẽ một bounding box trên một hình chỉ mất vài giây, nhưng cắt chính xác cùng đối tượng đó bằng segmentation mức pixel tốn thời gian gấp hàng chục lần. Do đó nguyên tắc là chọn kiểu theo độ chính xác mà tác vụ mục tiêu yêu cầu.
Nguyên tắc quan trọng ở đây không phải "chính xác nhất có thể" mà "chỉ chính xác vừa đủ mức cần thiết". Bởi gán nhãn đến độ chính xác mà tác vụ không yêu cầu chỉ làm tăng chi phí chứ không dẫn đến cải thiện hiệu năng. Ngược lại, nếu độ chính xác thiếu, mô hình không học được thông tin cần thiết. Rốt cuộc, việc chọn kiểu phải xuất phát từ phân tích yêu cầu tác vụ, điều này cho thấy gán nhãn là hoạt động đòi hỏi phán đoán thiết kế chứ không phải công việc máy móc.
Toàn bộ dòng chảy mà gán nhãn dẫn đến huấn luyện mô hình thực tế có thể được tổ chức thành pipeline như dưới đây. Dòng chảy này không kết thúc theo một hướng mà có cấu trúc tuần hoàn, trong đó các lỗi bị lọc ra ở khâu kiểm tra và kiểm chứng quay trở lại gán nhãn. Giai đoạn đặc biệt quan trọng trong vòng tuần hoàn này là định nghĩa hướng dẫn gán nhãn ở đầu tiên. Bởi nếu quy tắc về việc lấy đối tượng nào làm mục tiêu gán nhãn, xử lý đối tượng bị che và trường hợp biên ra sao không rõ ràng, thì mọi công việc về sau đều lung lay. Nghĩa là chất lượng của pipeline đã được quyết định phần lớn ở thiết kế quy tắc thượng nguồn.
flowchart LR
R["Thu thập ảnh thô"] --> G["Định nghĩa hướng dẫn gán nhãn"]
G --> L["Gán nhãn(thủ công/bán tự động)"]
L --> Q["Kiểm tra chất lượng(IAA/lấy mẫu)"]
Q -->|trả lại do lỗi| L
Q -->|đạt| D["Tập dữ liệu huấn luyện"]
D --> T["Huấn luyện/đánh giá mô hình"]
T -.chọn mẫu khó.-> L
3. Đặc điểm theo từng kiểu
Mỗi kiểu tương ứng với một tác vụ thị giác máy tính khác nhau. Vì việc chọn kiểu được quyết định không phải bởi sở thích thẩm mỹ mà bởi loại thông tin mà tác vụ yêu cầu, nên điều quan trọng là hiểu mỗi kiểu chứa thông tin gì và hợp với tác vụ nào. Dưới đây, ta cùng xem xét theo từng kiểu tiêu biểu thông tin nó chứa, tác vụ tương ứng, và những điểm cần lưu ý trong thực tế.
Bounding Box được dùng cho phát hiện đối tượng, nơi chỉ cần biết "cái gì ở đại khái chỗ nào". Vì biểu diễn vị trí chỉ bằng bốn tọa độ hình chữ nhật nên công việc nhanh và rẻ, nhưng với vật nằm chéo hay có hình dạng bất quy tắc thì cả nền cũng bị đưa vào hộp, làm giảm độ chính xác. Dù vậy, nó vẫn là kiểu cơ bản được dùng rộng rãi nhất trong phần lớn ứng dụng nơi tốc độ và chi phí quan trọng, như phát hiện thời gian thực. Tuy nhiên cần các quy tắc chi tiết — như làm sao đóng hộp từng đối tượng chồng lấn, đưa vào đến đâu đối tượng bị cắt ra ngoài màn hình — và không có các quy tắc này thì cùng một cảnh cũng được gán nhãn khác nhau theo từng người làm.
Polygon và semantic segmentation được dùng cho nhận dạng hình dạng và ảnh y tế cần đường viền chính xác và ranh giới pixel của đối tượng. Polygon lần theo đường viền bằng các đỉnh đa giác, còn semantic segmentation gán lớp cho mọi pixel. Ví dụ, để đo định lượng diện tích và hình dạng khối u trong ảnh y tế thì ranh giới mức pixel là bắt buộc, nên hộp không thể thay thế. Bù lại, gánh nặng công việc lớn, đòi hỏi thời gian và tay nghề đáng kể để hoàn thành một tấm.
Mặt khác, việc phân biệt semantic segmentation với instance segmentation cũng quan trọng. Semantic segmentation chỉ phân loại "pixel này là ô tô" và không phân biệt nhiều đối tượng cùng lớp, trong khi instance segmentation phân biệt đến từng đối tượng riêng lẻ như "ô tô 1, ô tô 2". Ở các tác vụ như phân tích đám đông, nơi phải đếm riêng từng người chồng lấn, cần nhãn ở mức instance, nên dù cùng là segmentation vẫn phải định nghĩa chính xác mức phù hợp với tác vụ.
Keypoint được dùng cho ước lượng tư thế và nhận diện khuôn mặt, nơi quan hệ vị trí của khớp và landmark là quan trọng. Chấm vị trí khớp của người bằng các điểm để biểu diễn bộ xương thì có thể nhận dạng động tác. Ví dụ, tính năng chỉnh tư thế tập luyện của app thể hình hay hệ thống phát hiện té ngã phân định tư thế dựa trên góc và quan hệ liên kết của các keypoint khớp. Vì thứ tự và ý nghĩa của điểm keypoint (vai trái, khuỷu phải, v.v.) phải được định nghĩa nhất quán, việc quy định nghiêm ngặt định nghĩa điểm trong hướng dẫn là mấu chốt của chất lượng.
Polyline được dùng cho các đối tượng tuyến tính mảnh và dài như làn đường, và vì hộp hay đa giác khó biểu diễn tính liên tục của đường nên cần một kiểu riêng. Khi làn đường là nét đứt hoặc bị che một phần, nếu không có quy tắc về việc vẽ nối đường đến đâu thì kết quả khác nhau lớn theo từng người làm. 3D cuboid và point cloud được dùng cho LiDAR xe tự lái cần khoảng cách và độ sâu, và vì phải chứa thông tin độ sâu (z) vốn không có ở ảnh 2D nên thuộc nhóm có độ khó và chi phí công việc cao nhất.
| Kiểu | Mô tả | Ứng dụng tiêu biểu |
|---|---|---|
| Bounding Box | Đánh dấu đối tượng bằng hình chữ nhật | Phát hiện đối tượng |
| Polygon | Đánh dấu chính xác đường viền bằng đa giác | Nhận dạng hình dạng·phân đoạn instance |
| Semantic segmentation | Phân loại lớp ở mức pixel | Phân đoạn đường/nền, ảnh y tế |
| Keypoint | Đánh dấu điểm khớp/landmark | Ước lượng tư thế·nhận diện khuôn mặt |
| Polyline | Đánh dấu đối tượng tuyến tính | Làn đường·ranh giới đường |
| 3D cuboid | Đánh dấu bằng khối hộp ba chiều | LiDAR xe tự lái·nhận dạng độ sâu |
Ví dụ, để tránh va chạm với xe phía trước trong xe tự lái, cần không chỉ đối tượng nằm ở đâu trên màn hình (hộp) mà còn nó ở phía trước bao nhiêu mét, nên cần 3D cuboid từ LiDAR. Ngược lại, khi chỉ cần phán đoán "có người trong khu vực không" như phát hiện xâm nhập CCTV thì bounding box là đủ. Như vậy việc chọn kiểu được quyết định bởi yêu cầu vật lý của tác vụ, và chọn kiểu chính xác hơn mức cần thiết chỉ lãng phí chi phí.
4. Các kỹ thuật gán nhãn
Lịch sử phát triển kỹ thuật gán nhãn chính là lịch sử của "làm sao giảm lao động của con người". Vì giới hạn của làm thủ công thuần túy trở nên rõ rệt khi quy mô dữ liệu lớn lên, các kỹ thuật đã tiến hóa theo hướng đẩy dần điểm can thiệp của con người về sau. Dưới đây ta xem xét phổ từ thủ công đến học chủ động cùng với nguyên lý của chúng.
Gán nhãn thủ công tuy chính xác nhưng có giới hạn căn bản là chậm và đắt, nên các kỹ thuật đã tiến hóa theo hướng giảm sự can thiệp của con người. Ban đầu con người gán nhãn từng ảnh một, nhưng khi quy mô dữ liệu lớn lên hàng trăm nghìn, hàng triệu tấm, cách này trở nên không bền vững về chi phí và thời gian. Tuy nhiên, vì tự động hóa hoàn toàn có nguy cơ lỗi, hiện nay chủ đạo là hình thức con người tham gia (Human-in-the-loop), trong đó AI tạo bản nháp và con người kiểm tra.
Thủ công (Manual) là cách con người gán nhãn trực tiếp, độ chính xác cao và có thể phán đoán phức tạp nhưng chi phí cao và chậm. Nó phù hợp để xây dựng tập dữ liệu ban đầu quy mô nhỏ hoặc cần phán đoán độ khó cao. Đặc biệt, dữ liệu hạt giống (seed) ban đầu để huấn luyện mô hình tự động phải là nhãn thủ công chất lượng cao được con người làm kỹ lưỡng thì bán tự động và tự động về sau mới hoạt động đáng tin cậy. Bán tự động (Semi-auto) là cách (HITL) con người kiểm tra và hiệu chỉnh kết quả AI dự đoán trước; vì thay vì vẽ từ đầu, con người "sửa bản nháp của AI", nên nâng cao đáng kể tốc độ làm việc.
Tự động (Auto-labeling) là cách dùng mô hình đã huấn luyện trước để tự sinh nhãn rồi chỉ kiểm chứng một phần bằng mẫu. Có thể áp dụng nhanh cho khối lượng lớn dữ liệu, nhưng có nguy cơ đóng cứng phần mô hình làm sai thành đáp án đúng, nên giám sát chất lượng là bắt buộc. Phải cẩn trọng để không rơi vào vòng luẩn quẩn khi mô hình học từ nhãn tự động sai lại sinh ra nhãn sai.
Lý do HITL trở thành chủ đạo là vì kết hợp tốc độ của tự động hóa với năng lực phán đoán của con người là thực tế nhất. Thủ công hoàn toàn tuy chính xác nhưng không mở rộng được, còn tự động hoàn toàn tuy nhanh nhưng không đáng tin. HITL lấy ưu điểm của cả hai, để AI đảm nhận công việc nháp lặp lại, máy móc và con người đảm nhận phán đoán cuối, xử lý ngoại lệ và kiểm chứng chất lượng. Lợi ích cốt lõi ở đây là nếu đưa kết quả kiểm tra của con người phản hồi lại để cải thiện mô hình thì chất lượng bản nháp tự động dần được nâng lên, và theo thời gian có thể giảm tỷ lệ can thiệp của con người.
| Kỹ thuật | Mô tả |
|---|---|
| Thủ công(Manual) | Con người gán nhãn trực tiếp — chính xác nhưng chi phí cao·chậm |
| Bán tự động(Semi-auto) | AI dự đoán trước rồi con người kiểm tra·hiệu chỉnh (HITL) |
| Tự động(Auto-labeling) | Mô hình huấn luyện trước tự sinh rồi kiểm chứng mẫu |
| Học chủ động(Active Learning) | Ưu tiên gán nhãn các mẫu mô hình không chắc chắn |
Đặc biệt, học chủ động (Active Learning) là chiến lược cốt lõi của hiệu quả. Thay vì gán nhãn mọi dữ liệu như nhau, nó chọn các mẫu mô hình bối rối nhất (độ tự tin dự đoán thấp) và ưu tiên giao cho con người gán nhãn. Gán nhãn thêm các mẫu dễ mà mô hình vốn đã đoán đúng thì cải thiện hiệu năng không đáng kể, trong khi gán nhãn các trường hợp biên mà mô hình thấy khó, vốn giàu thông tin, đem lại cải thiện hiệu năng lớn hơn với cùng ngân sách. Đây là chiến lược tập trung ngân sách gán nhãn có hạn vào dữ liệu có giá trị thông tin lớn, và hiệu quả càng lớn khi dữ liệu càng đồ sộ.
Học chủ động trong thực tế được hiện thực thành vòng lặp "gán nhãn→huấn luyện→chọn mẫu không chắc chắn→gán nhãn bổ sung". Sau khi tạo mô hình bằng lượng nhỏ dữ liệu ban đầu, ta ưu tiên rút ra dữ liệu mà mô hình đó không tự tin để gán nhãn rồi huấn luyện lại, lặp lại quá trình đó. Cách này được biết là giảm đáng kể tổng chi phí, đặc biệt ở các miền chuyên môn có đơn giá gán nhãn cao (ảnh y tế, pháp lý, v.v.), và thể hiện rõ triết lý AI lấy dữ liệu làm trung tâm rằng chọn "gán nhãn dữ liệu nào" một cách chiến lược còn quan trọng hơn tăng dữ liệu một cách mù quáng.
5. So sánh và các trường hợp ứng dụng trong công nghiệp
Khi lập chiến lược gán nhãn, phải phán đoán bằng cách đặt cùng ba trục độ chính xác, chi phí và tốc độ. Bảng dưới đây so sánh các kiểu tiêu biểu theo các tiêu chí này. Các con số trong bảng nên được hiểu là xu hướng tương đối chứ không phải giá trị tuyệt đối, và chúng thay đổi theo miền, công cụ và tay nghề.
| Kiểu | Độ chính xác | Chi phí tương đối | Tốc độ làm việc | Tác vụ phù hợp tiêu biểu |
|---|---|---|---|---|
| Bounding box | Thấp | Thấp | Nhanh | Phát hiện đối tượng thời gian thực |
| Polygon | Cao | Trung bình | Trung bình | Phân đoạn instance |
| Semantic segmentation | Rất cao | Cao | Chậm | Ảnh y tế·phân đoạn chính xác |
| 3D cuboid | Cao(không gian) | Rất cao | Chậm | LiDAR xe tự lái |
Lý do khác biệt này nảy sinh là vì mỗi kiểu khác nhau về bậc tự do của thông tin mà nó biểu diễn. Hộp kết thúc biểu diễn với 4 tọa độ, nhưng segmentation phải ra phán đoán cho mọi pixel của hình, nên bản thân lượng thông tin phải biểu diễn nhiều gấp hàng vạn lần. Do đó, việc chi phí, thời gian tăng vọt khi độ chính xác lên cao không phải vấn đề của công cụ mà là đặc tính bản chất của phương thức biểu diễn. Trong thực tế, xét đến sự đánh đổi này, đôi khi người ta dùng chiến lược hỗn hợp là xử lý phần lớn dữ liệu bằng hộp chi phí thấp và chỉ áp dụng segmentation cho số ít dữ liệu nơi độ chính xác mang tính quyết định.
Nhìn ba trường hợp về cách yêu cầu phân hóa theo từng ngành sẽ thấy rõ hàm ý. Thứ nhất, trong xe tự lái, chỉ với hộp 2D từ camera thì không thể phán đoán khoảng cách, nên gắn 3D cuboid vào point cloud của LiDAR, và ở đây kết hợp cả đa cảm biến·đa kiểu, thêm cả làn đường (polyline)·đèn tín hiệu (keypoint). Vì an toàn là ưu tiên hàng đầu, đây là miền tiêu biểu chấp nhận chi phí để chọn độ chính xác cao nhất.
Thứ hai, trong ảnh y tế, vì phải đo định lượng diện tích, thể tích tổn thương nên segmentation mức pixel là bắt buộc, và việc đọc ảnh cần tri thức miền ở mức bác sĩ chuyên khoa. Do đó kiểm tra bởi chuyên gia có đơn giá cao là không thể tránh, và độ chính xác cùng khả năng tái lập được coi trọng hơn quy mô dữ liệu. Vì ý kiến của nhiều bác sĩ đọc ảnh có thể khác nhau, đôi khi cũng cần thêm quy trình tổng hợp nhãn của nhiều chuyên gia để tạo đáp án đồng thuận.
Thứ ba, trong kiểm tra lỗi sản xuất, vì vị trí và hình dạng của khuyết tật li ti là quan trọng nên dùng polygon·segmentation, nhưng tỷ lệ bình thường/lỗi thường mất cân bằng cực độ (lỗi hiếm), nên việc chủ động bảo đảm dữ liệu lớp hiếm trở thành mấu chốt. Như vậy, dù cùng là gán nhãn, chiến lược tối ưu thay đổi hoàn toàn tùy theo ràng buộc vật lý và kinh tế của ngành. Rốt cuộc, ba trường hợp cùng cho thấy chiến lược gán nhãn không phải một đáp án cố định duy nhất mà là bài toán thiết kế bằng cách tổng hợp mức độ rủi ro, cấu trúc chi phí và đặc tính dữ liệu của miền.
6. Chuyên sâu: Mô hình nền tảng và sự tiến hóa của gán nhãn tự động
Thay đổi lớn nhất gần đây trong lĩnh vực gán nhãn là sự xuất hiện của mô hình nền tảng. Tiêu biểu, SAM (Segment Anything Model) của Meta, với năng lực phân đoạn đa dụng đã huấn luyện trước, tức thì sinh ra ranh giới pixel của đối tượng khi người dùng chỉ định một điểm hoặc một hộp. Segmentation vốn trước đây phải chấm polygon từng điểm qua hàng chục điểm, nay có bản nháp được tạo chỉ trong vài cú nhấp, nên năng suất làm việc cải thiện lớn.
Kiểu phân đoạn dựa trên prompt như vậy đang thay đổi chính trải nghiệm người dùng của công cụ gán nhãn. Người làm chỉ cần "chỉ vào" đối tượng thay vì vẽ trực tiếp đường viền chi tiết, và làm việc theo cách xác nhận, hiệu chỉnh ranh giới mà mô hình đề xuất. Điều này nâng gán nhãn từ công việc lặp lại tay nghề thấp lên công việc lấy phán đoán làm trung tâm, giúp cùng số nhân lực xử lý được nhiều dữ liệu hơn hẳn.
Thay đổi này đang biến đổi vai trò con người một cách căn bản. Con người chuyển từ chủ thể sinh nhãn từ đầu sang người giám sát kiểm tra, chỉnh sửa, quản lý chất lượng bản nháp AI tạo ra. Nghĩa là không phải tổng lượng lao động giảm đi mà tính chất lao động chuyển từ "sản xuất" sang "kiểm chứng". Theo đó, tổ chức gán nhãn cũng có xu hướng được tái cấu trúc từ lấy đội ngũ labeler quy mô lớn làm trung tâm sang lấy số ít người kiểm tra lành nghề và pipeline tự động làm trung tâm.
Tuy nhiên, cũng cần nhấn mạnh rằng tự động hóa không phải vạn năng. Mô hình nền tảng mạnh với các đối tượng thông thường, nhưng với dữ liệu miền đặc thù như khuyết tật y tế, công nghiệp vẫn còn nhiều lỗi nên kiểm tra bởi chuyên gia là bắt buộc. Ngoài ra, nếu không có hệ thống kiểm chứng liệu chất lượng nhãn tự sinh có đáng tin không (kiểm toán mẫu, lọc dựa trên độ tin cậy) thì trái lại có nguy cơ sản xuất hàng loạt nhãn sai. Do đó, việc đưa tự động hóa vào phải tiếp cận không theo hướng "loại bỏ con người" mà là bài toán thiết kế lại "tập trung phán đoán của con người vào đâu".
Một xu hướng khác nhằm giảm căn bản gánh nặng gán nhãn là dữ liệu tổng hợp (synthetic data) và học giám sát yếu (weak supervision). Nếu tạo hình ảnh bằng bộ mô phỏng hoặc mô hình sinh thì có thể tự động thu được nhãn đáp án ngay tại thời điểm sinh, nên có thể bảo đảm với chi phí thấp dữ liệu cho các tình huống hiếm hoặc nguy hiểm (cảnh tai nạn, khuyết tật hiếm). Tuy nhiên, nếu không quản lý được chênh lệch phân bố (domain gap) giữa dữ liệu tổng hợp và dữ liệu thực thì hiệu năng có thể giảm trong môi trường thực, nên cần thêm việc pha trộn, hiệu chỉnh với dữ liệu thực. Các kỹ thuật này cho thấy tương lai của gán nhãn đang đi theo hướng "bảo đảm đáp án một cách khôn ngoan hơn" chứ không phải "con người chấm nhiều hơn".
7. Cân nhắc và hàm ý
Cốt lõi từ góc nhìn Kỹ sư chuyên nghiệp là thiết kế sự cân bằng giữa chất lượng và hiệu quả như thế nào, và đây là bài toán thiết kế toàn bộ pipeline chứ không phải chọn một kỹ thuật đơn lẻ.
- Xây dựng hệ thống quản lý chất lượng: Phải bảo đảm tính nhất quán bằng hướng dẫn gán nhãn rõ ràng, kiểm chứng chéo và đo mức đồng thuận giữa người gán nhãn (IAA, Inter-Annotator Agreement). Đặc biệt, IAA định lượng mức độ kết quả trùng khớp khi nhiều người làm gán nhãn cùng một hình, là chỉ số cốt lõi phơi bày sớm sự mơ hồ của hướng dẫn hoặc việc thiếu đào tạo người làm. Khi IAA ra thấp, thứ tự đúng là kiểm tra xem hướng dẫn có mơ hồ không trước khi trách người làm.
- Đưa vào chiến lược tối ưu theo giai đoạn: Thực tế là ban đầu bảo đảm dữ liệu hạt giống chất lượng cao bằng thủ công, rồi trên cơ sở đó lần lượt đưa vào bán tự động, tự động, học chủ động để hạ chi phí. Vì thử tự động hóa hoàn toàn ngay từ đầu sẽ làm sụp chất lượng, cách tiếp cận nâng dần tỷ lệ tự động hóa là an toàn.
- Quản lý thiên lệch dữ liệu: Nếu một nhóm hay tình huống nhất định bị biểu diễn thiếu hoặc quá mức trong dữ liệu, mô hình sẽ học thiên lệch. Ví dụ, mô hình xe tự lái chỉ học từ ảnh ban ngày sẽ yếu ở nhận dạng ban đêm, nên phải chủ ý thiết kế tính đại diện của tập dữ liệu (bao gồm điều kiện, nhóm đa dạng).
- Tuân thủ quyền riêng tư và quy định: Khi có thông tin cá nhân như khuôn mặt, biển số xe thì xử lý ẩn danh hóa (che, làm mờ) là bắt buộc, và phải tuân thủ các quy định như Luật Bảo vệ thông tin cá nhân. Khi thuê ngoài gán nhãn, cũng phải cân nhắc kiểm soát an ninh để ngăn rò rỉ dữ liệu.
- Vận hành dữ liệu liên tục (MLOps): Gán nhãn không phải việc một lần mà là hoạt động tuần hoàn liên tục gán nhãn, bổ sung dữ liệu mới để đáp ứng sự suy giảm hiệu năng (data drift) sau khi triển khai mô hình. Do đó cần góc nhìn thiết kế gán nhãn như một thành phần thường trực của pipeline MLOps chứ không phải một công việc riêng.
- Thiết kế chi phí, tổ chức và quản trị: Vì gán nhãn quy mô lớn thường tận dụng thuê ngoài, crowdsourcing, nên quản trị bao gồm hệ thống đào tạo, đánh giá, khen thưởng người làm và kiểm soát truy cập dữ liệu chi phối đồng thời cả chất lượng và an ninh. Tối ưu phân bổ chi phí giữa đầu tư công cụ tự động và vận hành nhân lực theo quy mô dữ liệu và yêu cầu độ chính xác cũng là bài toán chiến lược mà Kỹ sư chuyên nghiệp phải phán đoán.
Tài liệu tham khảo
- Kirillov et al., "Segment Anything" (Meta AI), 2023: https://ai.meta.com/research/publications/segment-anything/
- Andrew Ng, Data-centric AI: https://landing.ai/data-centric-ai
- Google Cloud, Tài liệu khái niệm Data labeling: https://cloud.google.com/vertex-ai/docs/datasets/label-using-console
Tóm tắt một câu: Gán nhãn hình ảnh là công việc gán đáp án khớp với độ chính xác tác vụ như bounding box, polygon, segmentation, keypoint, 3D; chất lượng nhãn chi phối hiệu năng mô hình, và trong lúc tiến hóa thủ công→bán tự động→học chủ động·mô hình nền tảng, phải kiểm soát đồng thời quản lý chất lượng dựa trên IAA, thiên lệch và quyền riêng tư.