AI trên thiết bị (On-Device AI)
1. Tổng quan
A. Định nghĩa
AI trên thiết bị (On-Device AI) là công nghệ thực hiện suy luận (inference) AI trực tiếp ngay trên thiết bị đầu cuối (edge device) như điện thoại thông minh, thiết bị IoT chứ không phải trên máy chủ đám mây. Mô hình được chạy bên trong thiết bị để tạo ra kết quả mà không truyền dữ liệu ra bên ngoài.
Ý tưởng cốt lõi của AI trên thiết bị là "đưa AI đến nơi có dữ liệu". Cho đến nay, phần lớn dịch vụ AI có cấu trúc tập trung (cloud-centric): thiết bị gửi dữ liệu lên đám mây, mô hình lớn mạnh mẽ trên máy chủ xử lý rồi trả kết quả về. Cấu trúc này có ưu điểm là tận dụng thoải mái tài nguyên GPU của trung tâm dữ liệu, nhưng mang những giới hạn căn bản: bắt buộc phải có mạng, phát sinh độ trễ khứ hồi (round-trip latency), và dữ liệu cá nhân nhạy cảm như ảnh, giọng nói, vị trí phải đi ra ngoài. AI trên thiết bị giải quyết trực diện các giới hạn này bằng cách nhúng (embedding) bản thân mô hình AI vào thiết bị.
Kết quả là có ba lợi thế về cấu trúc. Thứ nhất, dữ liệu không rời khỏi thiết bị nên quyền riêng tư được bảo vệ tận gốc. Thứ hai, không có vòng khứ hồi đến máy chủ nên phản hồi tức thì ngay cả khi không có mạng (độ trễ thấp, ngoại tuyến). Thứ ba, suy luận diễn ra trên thiết bị nên tiết kiệm chi phí hạ tầng máy chủ và chi phí băng thông. Mở khóa bằng nhận diện khuôn mặt trên điện thoại, dịch cuộc gọi thời gian thực, nhận diện cảnh và chủ thể của camera, phát hiện từ đánh thức (wake word) của trợ lý giọng nói là các ví dụ tiêu biểu. Tuy nhiên, thiết bị bị giới hạn cực độ về năng lực tính toán, điện năng và bộ nhớ so với trung tâm dữ liệu, nên không thể đưa nguyên mô hình lớn nặng nề lên. Vì vậy, tinh gọn mô hình (model compression) để nén mô hình nhỏ và hiệu quả, cùng chip chuyên dụng (NPU) để tăng tốc với điện năng thấp, trở thành các nhiệm vụ cốt lõi quyết định thành bại của AI trên thiết bị.
B. Đặc điểm chính
AI trên thiết bị có các đặc điểm: xử lý cục bộ (không truyền dữ liệu), hoạt động độ trễ thấp và ngoại tuyến, cá nhân hóa (tận dụng ngữ cảnh cá nhân tích lũy trên thiết bị), và tối đa hóa hiệu quả dưới ràng buộc tài nguyên. Các đặc điểm này đan xen nhau, ví dụ đặc tính xử lý cục bộ đồng thời cho phép cả quyền riêng tư lẫn hoạt động ngoại tuyến.
C. Bối cảnh ra đời và sự cần thiết
Sự nổi lên nhanh chóng gần đây của AI trên thiết bị có bốn động lực đan xen. Trước hết là tăng cường quy định về quyền riêng tư. Khi GDPR của EU và Luật Bảo vệ thông tin cá nhân của Hàn Quốc điều chỉnh nghiêm ngặt việc chuyển dữ liệu cá nhân ra nước ngoài/bên ngoài, phương thức xử lý cục bộ không đưa dữ liệu ra khỏi thiết bị trở thành phương án hấp dẫn về mặt tuân thủ quy định. Thứ hai là yêu cầu phản hồi thời gian thực. Trong các ứng dụng mà ngay cả độ trễ vài chục ms cũng chí mạng như xe tự lái, an toàn công nghiệp, AR/VR, không thể chịu được độ trễ khứ hồi đám mây nên xử lý trên thiết bị gần như là bắt buộc.
Thứ ba là vấn đề chi phí đám mây và sự phụ thuộc mạng. Khi AI tạo sinh lan rộng khiến lượng yêu cầu suy luận bùng nổ, chi phí vận hành máy chủ GPU tăng theo cấp số nhân, và động cơ kinh tế để phân tán (offloading) các suy luận đơn giản, lặp lại xuống thiết bị tăng lên. Thứ tư, và quan trọng nhất, là sự cải thiện hiệu năng của chip AI di động (NPU). Apple Neural Engine, Qualcomm Hexagon, Samsung Exynos NPU... qua từng thế hệ đã cho phép suy luận điện năng thấp ở quy mô hàng chục TOPS (nghìn tỷ phép tính mỗi giây), và đây là bước ngoặt quyết định đưa AI trên thiết bị từ "thử nghiệm" lên "thương mại". Bốn động lực này không độc lập mà củng cố lẫn nhau; việc quy định, ứng dụng, kinh tế và phần cứng cùng lúc chỉ về hướng trên thiết bị là điều nâng đỡ tính bền vững của công nghệ này.
2. Cấu trúc tổng thể và nguyên lý hoạt động
Hệ thống AI trên thiết bị về cơ bản được chia hai: huấn luyện (training) trên đám mây và suy luận (inference) trên thiết bị. Kiến trúc thông thường là việc huấn luyện nặng vẫn được thực hiện ở trung tâm dữ liệu với dữ liệu quy mô lớn, còn mô hình thành phẩm được tinh gọn, biên dịch rồi phân phối xuống thiết bị, và chỉ phần suy luận thực tế được xử lý trên thiết bị. Sơ đồ cấu trúc dưới đây cho thấy toàn bộ luồng nối tiếp huấn luyện – tinh gọn – phân phối – suy luận.
flowchart LR
subgraph Cloud["Đám mây (huấn luyện, phân phối)"]
T["Huấn luyện mô hình quy mô lớn (training)"] --> Z["Tinh gọn (lượng tử hóa, cắt tỉa, chưng cất)"]
Z --> CP["Biên dịch theo HW (chuyển đổi runtime)"]
end
subgraph Device["Thiết bị (suy luận)"]
RT["Edge runtime (LiteRT, Core ML)"] --> N["NPU, bộ tăng tốc AI"]
N --> R["Kết quả suy luận trên thiết bị"]
end
CP -->|"Phân phối mô hình (OTA)"| RT
R -.->|"Khi cần chỉ tải lên dữ liệu tóm tắt, ẩn danh"| T
style R fill:#e8f0fe,stroke:#2f6fed,stroke-width:2px
Điểm đáng chú ý trong cấu trúc này là luồng dữ liệu được giảm thiểu. Dữ liệu gốc ở lại thiết bị, còn giữa thiết bị và đám mây chỉ có mô hình (tải xuống) và thống kê tóm tắt đã ẩn danh (tải lên tùy chọn). Đặc biệt, khi kết hợp với kỹ thuật học liên kết (Federated Learning), trong đó nhiều thiết bị không chia sẻ dữ liệu gốc mà chỉ gửi kết quả huấn luyện cục bộ (gradient) để máy chủ hợp nhất, có thể liên tục cải thiện mô hình mà vẫn giữ quyền riêng tư. Nói cách khác, AI trên thiết bị cần được hiểu không chỉ là "chuyển suy luận xuống thiết bị" mà là triết lý kiến trúc cục bộ hóa dữ liệu trong toàn bộ chu trình huấn luyện, phân phối và huấn luyện lại.
3. Các công nghệ cốt lõi về phần cứng và phần mềm
A. Phần cứng — NPU và điện toán không đồng nhất
Nền tảng vật lý của AI trên thiết bị là NPU (Neural Processing Unit, bộ xử lý mạng nơ-ron). CPU mạnh về xử lý tuần tự đa dụng, GPU mạnh về tính toán dấu phẩy động song song quy mô lớn, nhưng cả hai đều gây gánh nặng lớn cho suy luận thường trực trên di động xét về hiệu suất trên điện năng (hiệu năng/W). NPU là bộ tăng tốc chuyên biệt để thực hiện hàng loạt phép nhân–tích lũy ma trận (MAC), phép tính cốt lõi của mạng nơ-ron, với độ chính xác thấp và điện năng thấp, xử lý cùng một suy luận với điện năng thấp hơn GPU nhiều lần. Apple Neural Engine, Hexagon NPU của Qualcomm Snapdragon và Samsung Exynos NPU là tiêu biểu, và các AP flagship mới nhất cung cấp hiệu năng cỡ hàng chục TOPS.
Trên thiết bị thực tế, thông thường không chỉ dùng một bộ xử lý mà áp dụng điện toán không đồng nhất (heterogeneous computing), phân chia CPU, GPU, NPU theo đặc tính công việc. Ví dụ, tiền xử lý do CPU đảm nhận, bộ lọc ảnh do GPU, còn suy luận mạng nơ-ron do NPU. Runtime thực hiện ủy quyền phần cứng (delegation), quyết định đặt từng phép toán (operator) của mô hình lên phần cứng nào, và việc tối ưu bố trí này chi phối lớn hiệu năng cảm nhận thực tế và mức tiêu hao pin.
B. Tinh gọn mô hình — lượng tử hóa, cắt tỉa, chưng cất tri thức
Công nghệ phần mềm quan trọng nhất để chạy AI trên tài nguyên thiết bị hạn chế là tinh gọn mô hình. Có ba kỹ thuật tiêu biểu. Thứ nhất, lượng tử hóa (Quantization) là kỹ thuật hạ độ chính xác biểu diễn của trọng số và giá trị kích hoạt. Ví dụ, chuyển dấu phẩy động 32 bit (FP32) thành số nguyên 8 bit (INT8) thì kích thước mô hình giảm còn khoảng một phần tư, và chạy nhanh hơn nhiều trên NPU tối ưu cho phép tính số nguyên. Tuy nhiên, độ chính xác biểu diễn giảm có thể gây mất độ chính xác dự đoán, nên dùng QAT (Quantization-Aware Training) — phản ánh lượng tử hóa vào quá trình huấn luyện — để giảm thiểu mất mát.
Thứ hai, cắt tỉa (Pruning) là kỹ thuật loại bỏ các trọng số, nơ-ron, kênh có mức đóng góp thấp để làm mô hình thưa (sparse). Giống như não người dọn bớt các khớp thần kinh ít dùng, nó cắt các kết nối có tầm quan trọng thấp để giảm khối lượng tính toán và bộ nhớ. Thứ ba, chưng cất tri thức (Knowledge Distillation) là kỹ thuật huấn luyện mô hình học trò (student) nhỏ bắt chước phân phối đầu ra của mô hình thầy (teacher) lớn và chính xác, giúp mô hình nhỏ đạt hiệu năng gần với mô hình lớn. Trong thực tế, thay vì dùng riêng lẻ, ba kỹ thuật này được kết hợp theo cách chưng cất để thu nhỏ cấu trúc, cắt tỉa để làm thưa, lượng tử hóa để hạ độ chính xác biểu diễn, qua đó giữ độ chính xác mục tiêu trong khi đồng thời tối ưu kích thước, độ trễ và điện năng.
C. Framework phần mềm và runtime
Để chạy mô hình đã tinh gọn trên thiết bị thực tế, cần edge runtime phù hợp với OS và chipset của thiết bị. Google từ lâu cung cấp TensorFlow Lite (TFLite), và vào tháng 9 năm 2024 đã đổi tên thành LiteRT. Bối cảnh đổi tên là runtime này nay đã phát triển thành runtime trên thiết bị đa dụng, bao quát cả các mô hình tạo bằng PyTorch, JAX, Keras chứ không chỉ TensorFlow, và sau đó đang phát triển theo hướng tăng cường tăng tốc GPU/NPU và hỗ trợ LLM, mô hình khuếch tán. Phía Apple có Core ML, chuẩn tương tác có ONNX Runtime, và có SDK riêng của từng nhà cung cấp chipset như QNN của Qualcomm. Các framework này chuyển mô hình đã huấn luyện sang định dạng chuyên dụng cho thiết bị và đẩy phép tính xuống NPU, GPU thông qua ủy quyền (delegate).
| Phân loại | Công nghệ tiêu biểu | Vai trò, điểm chính |
|---|---|---|
| Phần cứng | NPU (Neural Engine, Hexagon, Exynos NPU), bộ tăng tốc AI | Suy luận mạng nơ-ron điện năng thấp, hiệu suất cao, điện toán không đồng nhất |
| Tinh gọn mô hình | Lượng tử hóa (FP32→INT8), cắt tỉa, chưng cất tri thức | Giảm kích thước, độ trễ, điện năng; giảm thiểu mất độ chính xác |
| Runtime/framework | LiteRT (trước là TFLite), Core ML, ONNX Runtime, QNN | Chuyển đổi mô hình, ủy quyền HW, thực thi suy luận |
| Liên kết huấn luyện | Học liên kết (Federated Learning) | Huấn luyện cộng tác mà không chia sẻ dữ liệu gốc |
4. So sánh với AI đám mây — lý do khác biệt và hàm ý
AI trên thiết bị và AI đám mây không phải vấn đề hơn kém mà cần được hiểu như sự đánh đổi phát sinh từ khác biệt về vị trí tài nguyên. Vị trí xử lý là máy chủ hay thiết bị quyết định mọi đặc tính còn lại. Đám mây có thể dùng tài nguyên GPU gần như vô hạn nên chạy được mô hình siêu lớn, nhưng dữ liệu đi ra ngoài và kèm theo độ trễ, chi phí mạng. Ngược lại, thiết bị có tài nguyên hạn chế nên chỉ chạy được mô hình nhẹ, nhưng dữ liệu không đi ra ngoài nên có lợi thế vượt trội về quyền riêng tư, độ trễ và ngoại tuyến.
| Phân loại | AI đám mây | AI trên thiết bị |
|---|---|---|
| Vị trí xử lý | Máy chủ trung tâm dữ liệu | Thiết bị đầu cuối (edge) |
| Quyền riêng tư | Truyền dữ liệu ra ngoài → rủi ro rò rỉ, quy định | Xử lý cục bộ → bảo vệ tận gốc |
| Độ trễ/kết nối | Độ trễ khứ hồi mạng, bắt buộc kết nối | Độ trễ thấp, hoạt động ngoại tuyến |
| Năng lực tính toán | Mạnh (mô hình siêu lớn, lớn) | Hạn chế (mô hình nhẹ, nhỏ) |
| Cơ cấu chi phí | Chi phí vận hành máy chủ, băng thông (biến phí) | Tiêu hao tài nguyên thiết bị (định phí) |
| Cập nhật mô hình | Phản ánh ngay trên máy chủ | Cần phân phối OTA, cập nhật chậm |
Hàm ý thực tiễn của khác biệt này rất rõ ràng. Tác vụ tạo sinh hội thoại ưu tiên độ chính xác hàng đầu và dữ liệu ít nhạy cảm thì đám mây có lợi, còn tác vụ cảm nhận thường trực và cá nhân hóa ưu tiên quyền riêng tư và tính thời gian thực thì trên thiết bị có lợi. Vì vậy, các dịch vụ thương mại thực tế không chọn một trong hai mà hội tụ về lai (hybrid). Ví dụ, trợ lý giọng nói trên điện thoại xử lý ngay trên thiết bị việc phát hiện từ đánh thức và các lệnh đơn giản, còn chuyển câu hỏi–đáp phức tạp lên đám mây, phân chia vai trò như vậy. Khi đó, chính sách điều phối (định tuyến) quyết định "tác vụ nào xử lý ở đâu" trở thành biến thiết kế cốt lõi chi phối chất lượng dịch vụ và chi phí.
Sơ đồ quy trình chi tiết dưới đây cho thấy một yêu cầu được xử lý theo đường nào trong môi trường lai. Quyết định định tuyến thường được đưa ra dựa trên tổng hợp độ phức tạp, độ nhạy cảm dữ liệu và trạng thái mạng của yêu cầu, và dữ liệu càng nhạy cảm hoặc tình huống ngoại tuyến thì càng chọn đường trên thiết bị.
flowchart TB
IN["Yêu cầu người dùng (giọng nói, hình ảnh, văn bản)"] --> J{"Quyết định định tuyến (độ phức tạp, độ nhạy cảm, mạng)"}
J -->|"Đơn giản, nhạy cảm, ngoại tuyến"| ON["Suy luận trên thiết bị (NPU, mô hình nhẹ)"]
J -->|"Phức tạp, không nhạy cảm, trực tuyến"| CL["Suy luận đám mây (mô hình lớn)"]
ON --> OUT["Trả kết quả"]
CL --> OUT
ON -.->|"Gradient ẩn danh"| FL["Tổng hợp học liên kết (máy chủ)"]
FL -.->|"Mô hình cải tiến qua OTA"| ON
style OUT fill:#e8f0fe,stroke:#2f6fed,stroke-width:2px
Cốt lõi của luồng này là thiết bị không chỉ là "người tiêu thụ kết quả" mà trở thành người tham gia chủ động gửi lại tín hiệu huấn luyện đã ẩn danh để cùng cải thiện mô hình. Tức là suy luận trên thiết bị với học liên kết và cập nhật OTA tạo thành một vòng tuần hoàn, và vòng này càng được thiết kế tốt thì mô hình càng liên tục tinh vi hơn trong khi vẫn giữ quyền riêng tư.
5. Chuyên sâu — AI tạo sinh trên thiết bị (sLLM) và xu hướng mới nhất
Chủ đề lớn nhất gần đây của AI trên thiết bị là nội tại hóa AI tạo sinh vào thiết bị. Mô hình ngôn ngữ lớn (LLM) với hàng tỷ đến hàng chục tỷ tham số không thể đưa nguyên lên thiết bị, nên các nỗ lực chạy sLLM (small LLM) — giảm mạnh số tham số và tinh gọn — trên thiết bị đã bắt đầu một cách nghiêm túc. Google đưa ra hướng xử lý ngoại tuyến tóm tắt tin nhắn, trả lời thông minh... bằng Gemini Nano tích hợp trong Android; Apple theo chiến lược lai kết hợp xử lý trên thiết bị và đám mây riêng tư bằng Apple Intelligence; Samsung đã thương mại hóa phiên dịch và tóm tắt trên thiết bị bằng Galaxy AI. Xu hướng này là điểm giao giữa thế mạnh của AI trên thiết bị — cá nhân hóa, quyền riêng tư, ngoại tuyến — và nhu cầu bùng nổ của AI tạo sinh.
Về mặt kỹ thuật, ba tiến bộ nổi bật. Thứ nhất, nhờ nâng cao lượng tử hóa bit thấp, các kỹ thuật duy trì độ chính xác thực dụng ngay cả ở 4 bit (INT4) trở xuống đang lan rộng. Thứ hai, ở cấp runtime, tăng tốc hợp nhất (unified NPU acceleration) xử lý NPU của nhiều chipset bằng một API nhất quán đã được đưa vào, cho phép nhà phát triển tận dụng NPU mà không bị phân mảnh theo nhà cung cấp. Thứ ba, nhờ tinh vi hóa điều phối lai, phương thức phán đoán theo thời gian thực độ phức tạp, độ nhạy cảm của truy vấn và trạng thái mạng để phân bổ động giữa thiết bị và đám mây đang phát triển. Tuy nhiên, sLLM có giới hạn rõ rệt về ảo giác (hallucination) và độ chính xác so với mô hình lớn, nên việc thiết lập ranh giới thận trọng về việc giao tác vụ nào cho thiết bị vẫn còn là thách thức.
Ví dụ ứng dụng cụ thể là phiên dịch và phụ đề thời gian thực. Cách khứ hồi đám mây cộng thời gian xử lý máy chủ vào độ trễ truyền thông nên dễ làm đứt mạch tự nhiên của cuộc hội thoại, còn mô hình nhận dạng giọng nói và dịch trên thiết bị loại bỏ vòng khứ hồi mạng, giảm mạnh độ trễ cảm nhận và có lợi thế hoạt động được cả trong môi trường ngoại tuyến như trên máy bay hay chuyển vùng quốc tế. Một ví dụ khác là phân tích cảnh thời gian thực của camera điện thoại: việc nhận diện chủ thể và ánh sáng tại khoảnh khắc chụp để hiệu chỉnh chất lượng ảnh bắt buộc phải thực hiện trên thiết bị để loại bỏ độ trễ màn trập. Như vậy, ứng dụng càng thuộc loại "độ trễ chính là khả năng sử dụng" thì giá trị của AI trên thiết bị càng thừa sức bù đắp cho mất mát độ chính xác.
6. Những điểm cần lưu ý và hàm ý
Quản lý cân bằng (trade-off) giữa tinh gọn và độ chính xác là then chốt. Mô hình càng nhỏ thì càng dễ chạy trên thiết bị nhưng độ chính xác càng giảm. Cần tối ưu có hệ thống: kết hợp lượng tử hóa, cắt tỉa, chưng cất, đồng thời đặt độ chính xác, độ trễ, điện năng mục tiêu thành chỉ số định lượng (KPI) và giảm thiểu mất mát bằng QAT... Không được quên rằng mục đích không phải là "nhỏ" mà là "đủ chính xác và đủ nhỏ".
Cần tận dụng như tài sản chiến lược cho đáp ứng quyền riêng tư và quy định. Đặc tính dữ liệu không rời thiết bị là vũ khí mạnh trong đáp ứng GDPR và Luật Bảo vệ thông tin cá nhân. Khi kết hợp với học liên kết và quyền riêng tư vi sai (differential privacy), có thể hiện thực AI bảo toàn quyền riêng tư "cải thiện mô hình mà không cần thu thập dữ liệu", nên cần tiếp cận theo góc độ privacy-by-design, chặn tận gốc rủi ro quy định ngay từ giai đoạn thiết kế.
Thiết kế kiến trúc lai và điều phối quyết định thành bại. Cộng tác thiết bị–đám mây là giải pháp thực tế hơn thuần trên thiết bị, nên cần thiết kế đồng thời chính sách định tuyến động vị trí xử lý theo độ nhạy cảm, độ phức tạp và yêu cầu độ trễ của tác vụ, cùng hệ thống phân phối OTA và quản lý phiên bản để cập nhật mô hình an toàn.
Cần tính đến sự phân mảnh phần cứng và gánh nặng triển khai, vận hành. Mỗi thiết bị có hiệu năng NPU và mức hỗ trợ runtime khác nhau, nên để một mô hình hoạt động nhất quán trên nhiều thiết bị cần chi phí kiểm chứng và tối ưu đáng kể. Cần quản lý chi phí phân mảnh này bằng cách áp dụng API tăng tốc hợp nhất, định dạng chuẩn (ONNX) và chiến lược phân nhánh mô hình theo phân khúc thiết bị, đồng thời xây dựng hệ thống MLOps (edge MLOps) liên tục giám sát hiệu năng, điện năng, độ chính xác cả sau khi triển khai.
Cần coi hiệu suất năng lượng, nhiệt và giới hạn pin là ràng buộc thiết kế. Thiết bị bị giới hạn về pin và khả năng tản nhiệt, nên nếu suy luận thường trực dẫn đến hao pin và phát nhiệt thì khả năng sử dụng xấu đi nhanh chóng. Cần thiết kế tần suất suy luận, kích thước mô hình và mức tận dụng NPU trong ngân sách điện năng (power budget), và quản lý điện năng bằng cách chỉ kích hoạt suy luận khi cần. Cần nhận thức rằng chỉ số hàng đầu của thiết kế trên thiết bị không chỉ là hiệu năng mà là hiệu năng/watt.
Triển vọng — tiến hóa thành dải liên tục (continuum) biên–đám mây. AI trên thiết bị không phải công nghệ độc lập mà là một phần của xu hướng hợp nhất thiết bị, máy chủ biên và đám mây thành một tài nguyên tính toán liên tục. Cùng với sự cải thiện hiệu năng sLLM và phát triển NPU, tỷ trọng trí tuệ do thiết bị đảm nhận sẽ tiếp tục tăng, và đây cũng là hướng quan trọng từ góc độ AI bền vững (sustainable AI), đạt đồng thời cá nhân hóa, quyền riêng tư và hiệu suất năng lượng.
Tài liệu tham khảo
- Google Developers Blog, "TensorFlow Lite is now LiteRT" — https://developers.googleblog.com/tensorflow-lite-is-now-litert/
- Google Developers Blog, "LiteRT: The Universal Framework for On-Device AI" — https://developers.googleblog.com/litert-the-universal-framework-for-on-device-ai/
- 9to5Google, "Google renames TensorFlow Lite to LiteRT" — https://9to5google.com/2024/09/04/tensorflow-lite-litert/
Tóm tắt một câu: AI trên thiết bị thực hiện suy luận AI ngay trên thiết bị đầu cuối, mang lại thế mạnh về quyền riêng tư (xử lý cục bộ), độ trễ thấp và ngoại tuyến; cốt lõi là điện toán không đồng nhất dựa trên NPU và tinh gọn mô hình (lượng tử hóa, cắt tỉa, chưng cất), và đang tiến hóa thành dải liên tục biên–đám mây thông qua học liên kết, sLLM (Gemini Nano, Apple Intelligence, Galaxy AI) và điều phối lai.