← Về danh sách
AI & Dữ liệu
#지식그래프#온톨로지#RDF#GraphRAG#시맨틱검색
Cập nhật lần cuối · 2026-08-30

Đồ thị tri thức (Knowledge Graph)

1. Tổng quan

Đồ thị tri thức là hệ thống biểu diễn và lưu trữ tri thức, tổ chức tri thức thành cấu trúc đồ thị bằng cách biểu diễn các thực thể (Entity) của thế giới thực là nút và các quan hệ ngữ nghĩa (Relationship) giữa chúng là cạnh. Thông thường, các sự kiện được mô tả theo đơn vị bộ ba (Triple) Chủ ngữ (Subject)–Vị ngữ (Predicate)–Tân ngữ (Object), và được liên kết ở quy mô lớn thành dạng mà máy có thể suy luận và truy vấn.

Cơ sở dữ liệu quan hệ chứa dữ liệu trong các bảng có cấu trúc nên mạnh về tra cứu giá trị chính xác, nhưng với các truy vấn lấy kết nối làm trung tâm (Connection-centric) như "A và B được nối với nhau qua quan hệ gì, cách nhau bao nhiêu bước" thì cần nhiều phép join nên kém hiệu quả, và lược đồ cứng nhắc khiến khó chứa linh hoạt các loại quan hệ mới. Ngược lại, tri thức trong thực tế có dạng mạng lưới nơi con người–tổ chức–địa điểm–sự kiện đan xen phức tạp, và các bài toán mà "bản thân quan hệ chính là giá trị" như tìm kiếm, gợi ý, hỏi đáp, phát hiện gian lận ngày càng nhiều. Đồ thị tri thức ra đời từ khoảng trống này, tức là nhu cầu về cơ sở tri thức coi ngữ nghĩa (Semantics) và kết nối (Connectivity) là đối tượng hạng nhất.

Động lực trực tiếp khiến đồ thị tri thức được chú ý là "Knowledge Graph" mà Google đưa vào tìm kiếm năm 2012, tượng trưng cho bước chuyển sang tìm kiếm "hiểu sự vật (Things)" vượt ra ngoài so khớp chuỗi. Gần đây, khi được nhìn nhận lại như nguồn tri thức nền tảng của GraphRAG — giúp kiềm chế ảo giác (Hallucination) của mô hình ngôn ngữ lớn (LLM) và cung cấp căn cứ sự thật — đồ thị tri thức đang trở thành hạ tầng cốt lõi nối liền tích hợp dữ liệu, tìm kiếm ngữ nghĩa và AI có thể giải thích.

2. Cấu trúc tổng thể và các thành phần

Đồ thị tri thức gồm các thành phần chính: thực thể (nút), quan hệ (cạnh), thuộc tính (Property), và ontology/lược đồ (Ontology) mà chúng tuân theo. Thực thể là đối tượng tồn tại trong thế giới như 'Yi Sun-sin', 'Thuyền rùa'; quan hệ là kết nối ngữ nghĩa nối các thực thể như 'đóng', 'chỉ huy'. Thuộc tính là thông tin bổ sung gắn vào thực thể hoặc quan hệ (năm sinh-mất, vị trí…), còn ontology là lược đồ cấp trên định nghĩa loại khái niệm và quy tắc quan hệ như "Tướng là người", "Người có thể thuộc về tổ chức", làm căn cứ cho suy luận.

flowchart LR
  P["Yi Sun-sin (tướng)"] -->|Chỉ huy| B["Thuyền rùa (chiến hạm)"]
  P -->|Thuộc về| N["Thủy quân Joseon (tổ chức)"]
  B -->|Nơi đóng| S["Yeosu (địa điểm)"]
  P -->|Tham chiến| W["Trận Myeongnyang (sự kiện)"]
  W -->|Thời điểm xảy ra| Y["Năm 1597 (thời điểm)"]
  W -->|Nơi xảy ra| S

Như hình trên, một sự kiện được biểu diễn bằng bộ ba (ví dụ: Yi Sun-sin–chỉ huy–Thuyền rùa), và khi các bộ ba tích lũy, giữa các thực thể hình thành đường đi nhiều bước (Multi-hop Path). Năng lực duyệt đường đi này là thế mạnh bản chất của đồ thị tri thức, cho phép trả lời truy vấn như "Nơi diễn ra sự kiện mà Yi Sun-sin tham chiến là đâu?" bằng duyệt đồ thị mà không bị bùng nổ join.

A. Thực thể, quan hệ và định danh

Để xử lý thực thể một cách tin cậy, điều quan trọng là chỉ định duy nhất thực thể bằng định danh duy nhất toàn cục (URI/IRI). Nếu giải quyết thực thể (Entity Resolution) — gộp người trùng tên hoặc khác biệt cách viết ('IBM' và 'International Business Machines') thành một thực thể — làm không tốt, cùng một đối tượng bị tách thành nhiều nút và tính xác thực của đồ thị sụp đổ. Vì vậy trong xây dựng đồ thị tri thức, định danh và chuẩn hóa thực thể là điểm xuất phát của chất lượng dữ liệu, và liên kết (Linking) với hệ định danh chuẩn như định danh Q của Wikidata sẽ nâng cao đáng kể khả năng tương tác với tri thức bên ngoài.

B. Ontology và suy luận

Ontology trao cho đồ thị tri thức "quy tắc của ngữ nghĩa". Ví dụ, nếu có quy tắc "cha mẹ của cha mẹ là ông bà" (hợp thành quan hệ) hay định nghĩa phân cấp (subClassOf) "mọi tướng đều là người", thì cả những sự kiện không được lưu tường minh cũng có thể được dẫn ra bằng suy luận logic (Reasoning). Đây là phương tiện tiết kiệm không gian lưu trữ và kiểm chứng tính nhất quán dữ liệu, là cơ chế cốt lõi nâng việc lưu trữ dữ liệu đơn thuần lên thành "tri thức". Biểu diễn ontology có một phổ rộng, từ RDFS nhẹ nhưng sức biểu đạt thấp đến OWL (Web Ontology Language) hỗ trợ ràng buộc và suy luận phức tạp.

3. Mô hình biểu diễn: RDF và đồ thị thuộc tính (LPG)

Mô hình dữ liệu để hiện thực đồ thị tri thức chia thành hai dòng chính. Một là dòng RDF (Resource Description Framework) theo chuẩn web ngữ nghĩa của W3C, hai là dòng đồ thị thuộc tính (LPG, Labeled Property Graph) được dùng rộng rãi trong công nghiệp. Hai mô hình biểu diễn cùng tri thức nhưng khác triết lý và thế mạnh, nên việc lựa chọn phù hợp tình huống rất quan trọng.

RDF quy mọi sự kiện về bộ ba và định danh thực thể bằng URI toàn cục nên mạnh về tích hợp dữ liệu và khả năng tương tác dựa trên chuẩn. Ngôn ngữ truy vấn là SPARQL, và có thể suy luận hình thức qua OWL nên phù hợp các lĩnh vực coi trọng chuẩn và tính nhất quán như học thuật, công quyền, y tế. Ngược lại, khó gắn thuộc tính cho chính quan hệ (ví dụ: thuộc tính 'thời gian' cho quan hệ 'làm việc tại') nên biểu diễn hơi rườm rà.

Đồ thị thuộc tính (LPG) cho phép gán tự do thuộc tính khóa-giá trị cho cả nút và cạnh nên mô hình hóa trực quan và linh hoạt. Với ngôn ngữ truy vấn như Cypher của Neo4j có thể diễn đạt duyệt đường đi ngắn gọn, nên được ưa chuộng trong các hệ thống thực tế áp dụng tích cực thuật toán đồ thị như gợi ý, phát hiện gian lận, phân tích mạng. Tuy nhiên định danh toàn cục và chuẩn ontology hình thức yếu, nên trong tích hợp giữa các tổ chức khác nhau khó có khả năng tương tác ngang RDF.

Phân loại RDF (bộ ba) Đồ thị thuộc tính (LPG)
Đơn vị cơ bản Bộ ba chủ ngữ–vị ngữ–tân ngữ Nút·cạnh có thuộc tính
Cách định danh URI/IRI toàn cục ID nút/cạnh nội bộ
Ngôn ngữ truy vấn SPARQL Cypher, Gremlin, GQL
Suy luận/chuẩn Suy luận hình thức mạnh với OWL·RDFS Suy luận chuẩn yếu, thuật toán mạnh
Thế mạnh Tích hợp dữ liệu·khả năng tương tác Mô hình hóa linh hoạt·duyệt đường đi
Ví dụ tiêu biểu Wikidata, DBpedia Neo4j, TigerGraph

Khác biệt giữa hai mô hình bắt nguồn từ khác biệt về mục đích: "ưu tiên tích hợp mở thông qua tuân thủ chuẩn, hay ưu tiên hiệu năng ứng dụng và năng suất phát triển". Gần đây, với sự xuất hiện của GQL (được ban hành thành chuẩn quốc tế năm 2024) — chuẩn truy vấn đồ thị của ISO — và RDF-star cho phép thuộc tính quan hệ trong RDF, khoảng cách giữa hai phe đang có xu hướng thu hẹp.

4. Quy trình xây dựng và công nghệ cốt lõi

Xây dựng đồ thị tri thức không phải công việc một lần mà được vận hành như pipeline liên tục thu thập, tinh lọc, mở rộng tri thức. Quy trình điển hình là vòng tuần hoàn: xác định nguồn dữ liệu → thiết kế ontology → trích xuất tri thức → giải quyết và đối chiếu thực thể → lưu trữ và lập chỉ mục → kiểm chứng chất lượng và mở rộng.

flowchart TB
  SRC["Nguồn dữ liệu đa dạng (có cấu trúc/phi cấu trúc)"] --> ONT["Thiết kế ontology·lược đồ"]
  ONT --> EXT["Trích xuất tri thức (nhận dạng thực thể·quan hệ)"]
  EXT --> RES["Giải quyết thực thể·loại bỏ trùng lặp"]
  RES --> STORE["Lưu trữ·lập chỉ mục đồ thị (graph DB)"]
  STORE --> QC["Kiểm chứng chất lượng·kiểm tra nhất quán"]
  QC --> COMP["Hoàn thiện·bổ sung đồ thị (Completion)"]
  COMP -->|Vòng phản hồi| SRC

Trong pipeline này, các bước khó nhất về kỹ thuật là trích xuất tri thức và giải quyết thực thể. Cần trích xuất bộ ba từ văn bản phi cấu trúc qua nhận dạng thực thể có tên (NER) và trích xuất quan hệ (RE), nhưng do tính đa nghĩa của câu và sự đa dạng cách diễn đạt nên dễ phát sinh lỗi. Gần đây, phương thức dùng LLM tự động trích xuất thực thể và quan hệ từ tài liệu đang lan rộng, giảm mạnh chi phí xây dựng, nhưng để lại thách thức mới là kiểm chứng tính xác thực của các bộ ba do LLM tạo ra.

Ngoài ra, đồ thị tri thức thực tế tất yếu không hoàn chỉnh (có quan hệ bị thiếu), nên các kỹ thuật nhúng đồ thị tri thức (TransE, RotatE…) và dự đoán liên kết, hoàn thiện đồ thị (Completion) dựa trên mạng nơ-ron đồ thị (GNN) — học cấu trúc hiện có để dự đoán liên kết bị thiếu — được dùng cùng nhau. Ví dụ, học mẫu 'khách hàng–mua–sản phẩm' trong đồ thị thương mại điện tử có thể suy ra sở thích giữa khách hàng–sản phẩm chưa được kết nối để dùng cho gợi ý.

5. Tình huống ứng dụng và GraphRAG (chuyên sâu)

Đồ thị tri thức đã được ứng dụng trong khắp các ngành. Công cụ tìm kiếm dùng đồ thị tri thức để dựng bảng thông tin bên cạnh kết quả tìm kiếm, thương mại điện tử thực hiện gợi ý cá nhân hóa bằng đồ thị sản phẩm–khách hàng–hành vi, ngành tài chính truy vết dòng tiền nhiều tầng trong đồ thị quan hệ tài khoản–giao dịch–sở hữu để phát hiện giao dịch bất thường và rửa tiền. Trong y tế, dược phẩm, đồ thị quan hệ gen–bệnh–thuốc được dùng để tìm ứng viên thuốc mới. Điểm chung của chúng là "làm lộ ra các kết nối ẩn" chính là giá trị kinh doanh.

Ứng dụng chuyên sâu được chú ý nhất là GraphRAG. RAG truyền thống nhúng tài liệu thành vector để tìm các đoạn tương tự, nhưng yếu trong suy luận nhiều bước cần tổng hợp các sự kiện nằm rải rác ở nhiều tài liệu. GraphRAG xây dựng đồ thị tri thức từ tài liệu nguồn, rồi tìm kiếm đồng thời láng giềng, đường đi, tóm tắt cộng đồng của các thực thể liên quan đến truy vấn để cung cấp cho LLM. Như vậy nguồn gốc căn cứ được thể hiện rõ trên đồ thị, nâng cao khả năng giải thích (Explainability) và tính xác thực, đồng thời có thể đáp ứng cả các truy vấn toàn cục (Global) khó xử lý chỉ bằng tìm kiếm vector như "Nhân vật nào xuất hiện chung trong nhiều sự kiện?".

flowchart LR
  Q["Truy vấn người dùng"] --> R1["Tìm kiếm vector (đoạn tương tự)"]
  Q --> R2["Duyệt đồ thị (thực thể·đường đi·cộng đồng)"]
  R1 --> CTX["Ngữ cảnh tích hợp"]
  R2 --> CTX
  CTX --> LLM["LLM sinh câu trả lời"]
  LLM --> ANS["Câu trả lời có căn cứ rõ ràng"]

Như vậy, tìm kiếm tri thức lai (hybrid) — cơ sở dữ liệu vector đảm nhận "độ tương tự ngữ nghĩa", đồ thị tri thức đảm nhận "quan hệ và sự kiện tường minh" — là xu hướng mới nhất. Tuy nhiên chi phí xây dựng, duy trì đồ thị và chất lượng đồ thị quyết định chất lượng câu trả lời, nên khi triển khai cần phán đoán trước xem miền đối tượng có thực sự đòi hỏi truy vấn lấy quan hệ làm trung tâm hay không.

6. Lưu ý và hàm ý

Thứ nhất, quản trị chất lượng là cốt lõi. Giá trị của đồ thị tri thức tỷ lệ với tính xác thực và tính đầy đủ, nên phải thiết kế đồng thời hệ thống quản trị dữ liệu bao gồm giải quyết thực thể, loại bỏ trùng lặp, quản lý nguồn gốc, kiểm chứng định kỳ. Khi áp dụng trích xuất tự động bằng LLM, cần quy trình cộng tác người-máy (Human-in-the-loop) kết hợp kiểm duyệt của con người và chấm điểm độ tin cậy.

Thứ hai, cần làm rõ sự đánh đổi trong lựa chọn mô hình và nền tảng. Nếu tích hợp mở dựa trên chuẩn và suy luận hình thức quan trọng thì chọn RDF/OWL, nếu hiệu năng ứng dụng, năng suất phát triển và thuật toán đồ thị quan trọng thì chọn đồ thị thuộc tính, nhưng cần theo dõi các chuẩn hội tụ như GQL, RDF-star và cảnh giác với sự phụ thuộc (lock-in). Ở quy mô siêu lớn, phân vùng đồ thị và hiệu năng xử lý phân tán cũng nằm trong tiêu chí lựa chọn.

Thứ ba, chiến lược kết hợp bổ trợ với LLM là hiệu quả. LLM cung cấp khả năng hiểu và sinh ngôn ngữ tự nhiên linh hoạt, đồ thị tri thức cung cấp sự kiện và quan hệ có thể kiểm chứng; nếu thiết kế vòng tuần hoàn tích cực — dùng đồ thị tri thức kìm ảo giác của LLM và ngược lại dùng LLM mở rộng đồ thị tri thức — thì có thể đồng thời đạt độ tin cậy và khả năng mở rộng.

Thứ tư, cần triển khai từng bước và góc nhìn ROI. Nỗ lực xây dựng đồ thị tri thức toàn doanh nghiệp một lần có rủi ro thất bại lớn về chi phí và thời gian. Nên bắt đầu hẹp ở một miền cụ thể có truy vấn lấy quan hệ làm trung tâm rõ ràng (phát hiện gian lận, gợi ý…), kiểm chứng giá trị rồi mới mở rộng; quản trị vận hành làm rõ tổ chức bảo trì và trách nhiệm quản lý ontology là then chốt của thành công.

Tài liệu tham khảo


Tóm tắt một câu: Đồ thị tri thức là cơ sở tri thức biểu diễn thực thể và quan hệ bằng bộ ba và đồ thị, coi ngữ nghĩa và kết nối là đối tượng hạng nhất; xoay quanh mô hình RDF và đồ thị thuộc tính, suy luận ontology, nhúng đồ thị, nó được dùng cho tìm kiếm, gợi ý, phát hiện gian lận, và gần đây đang trỗi dậy trở lại như nguồn tri thức có thể giải thích giúp kiềm chế ảo giác của LLM thông qua GraphRAG.