Chủ đề Cơ sở dữ liệu
45 chủ đề
- Cơ sở dữ liệu
Ảo hóa dữ liệu (Data Virtualization)
Công nghệ tích hợp hợp nhất dữ liệu không đồng nhất phân tán theo thời gian thực vào một tầng ảo tại thời điểm truy vấn mà không sao chép hay di chuyển, cung cấp một khung nhìn duy nhất — các tầng kết nối·khung nhìn ảo·tối ưu truy vấn (pushdown)·quản trị, so sánh với ETL/DW và thiết kế lai, liên kết với kho dữ liệu logic và data fabric.
- Cơ sở dữ liệu
Quản lý tiêu chuẩn hóa cơ sở dữ liệu công (2023.04)
Các hoạt động quản lý chất lượng phòng ngừa theo từng giai đoạn xây dựng trong Sổ tay quản lý tiêu chuẩn hóa CSDL công của Hàn Quốc, cùng 4 lĩnh vực chẩn đoán và 9 hạng mục chẩn đoán.
- Cơ sở dữ liệu
Cấu trúc chỉ mục đa chiều (Multidimensional Index Structure)
Khái niệm, loại hình và ứng dụng của các cấu trúc chỉ mục (R-Tree·KD-Tree·Quad-Tree·Grid File) phục vụ truy vấn dữ liệu đa chiều·không gian.
- Cơ sở dữ liệu
Lưu trữ theo cột (Columnar Storage)
Mô hình lưu trữ tối ưu cho phân tích (OLAP) bố trí vật lý bảng theo cột để hiện thực đọc cột chọn lọc, nén cao và thực thi vector hóa — bàn theo lối luận văn về so sánh cấu trúc với lưu trữ định hướng hàng (NSM), mã hóa từ điển/RLE/delta cùng bỏ qua dữ liệu và tái dựng trễ, định dạng lai Parquet/ORC và lakehouse, cùng các cân nhắc của Kỹ sư chuyên nghiệp như HTAP, đánh đổi nén và tránh khóa cứng định dạng mở.
- Cơ sở dữ liệu
So sánh SQL tĩnh và SQL động
So sánh SQL tĩnh (được xác định tại thời điểm biên dịch) và SQL động (được tạo lúc chạy) về hiệu năng, tính linh hoạt và bảo mật (Injection).
- Cơ sở dữ liệu
Ma trận CRUD (CRUD Matrix)
Công cụ phân tích biểu diễn quan hệ tạo, đọc, cập nhật, xóa giữa tiến trình và thực thể dưới dạng ma trận để kiểm chứng tính nhất quán giữa dữ liệu và chức năng.
- Cơ sở dữ liệu
Quản lý chất lượng dữ liệu (Data Quality Management)
Kiến trúc và mức độ trưởng thành của quản lý chất lượng dữ liệu, tiêu chí chất lượng cho dữ liệu có cấu trúc và phi cấu trúc, cùng các chiến lược chuẩn hóa, phòng ngừa, đo lường và trách nhiệm.
- Cơ sở dữ liệu
Nhất quán cuối cùng (Eventual Consistency) và các mô hình nhất quán trong hệ phân tán
Trình bày dạng tự luận nguyên lý nhất quán cuối cùng — các bản sao hội tụ khi cập nhật dừng và việc lan truyền sao chép hoàn tất; so sánh với nhất quán mạnh·nhân quả·phiên; phiên bản·đồng hồ logic·giải quyết xung đột·thử lại lũy đẳng; các tình huống CQRS·CRDT·dịch vụ toàn cầu và thiết kế mức bảo đảm·quan sát·phục hồi từ góc nhìn Kỹ sư chuyên nghiệp.
- Cơ sở dữ liệu
Điều khiển đồng thời trong cơ sở dữ liệu (Concurrency Control)
Các kỹ thuật điều khiển đồng thời ngăn hiện tượng bất thường của giao dịch đồng thời (khóa 2PL·nhãn thời gian·lạc quan·MVCC) cùng mức cô lập và quản lý bế tắc.
- Cơ sở dữ liệu
Cơ sở dữ liệu đồ thị (Graph Database) và mô hình đồ thị thuộc tính (Property Graph) · RDF
Trình bày cấu trúc và quy trình mô hình hóa của cơ sở dữ liệu đồ thị — loại CSDL lấy nút, quan hệ và thuộc tính làm cốt lõi của cấu trúc lưu trữ để truy vấn đường đi, mẫu và tính kết nối; đồng thời tổng hợp tiêu chí lựa chọn giữa đồ thị thuộc tính và RDF, ứng dụng trong truy vấn, phân tích, phát hiện gian lận, gợi ý cũng như ranh giới về chất lượng, bảo mật và sổ cái.
- Cơ sở dữ liệu
Chuẩn hóa cơ sở dữ liệu (Normalization)
Chuẩn hóa nhằm loại bỏ dư thừa và ngăn ngừa các dị thường (chèn, xóa, cập nhật) — nguyên lý phát sinh dị thường, phân rã không mất mát dựa trên phụ thuộc hàm, các bậc 1NF~BCNF và sự đánh đổi với phi chuẩn hóa.
- Cơ sở dữ liệu
Giới hạn của định lý CAP và PACELC
CAP có giới hạn là chỉ mô tả việc chọn C hoặc A khi xảy ra phân vùng. PACELC bổ sung đánh đổi độ trễ (L) và tính nhất quán (C) trong điều kiện bình thường để định hướng lựa chọn CSDL phân tán.
- Cơ sở dữ liệu
Định dạng bảng mở (Apache Iceberg)
Phân tích chuyên sâu Apache Iceberg — định dạng bảng mở trung lập với engine, bổ sung ACID dựa trên snapshot, phân vùng ẩn (hidden partitioning), tiến hóa lược đồ/phân vùng và time travel cho tập hợp tệp trên object storage: cấu trúc phân tầng metadata, nguyên lý hoạt động, CoW/MoR và compaction, so sánh với Delta, Hudi, Hive và xu hướng chuẩn hóa.
- Cơ sở dữ liệu
Quản trị dữ liệu (Data Governance)
Hệ thống kiểm soát quản lý tích hợp tiêu chuẩn, chất lượng, siêu dữ liệu, bảo mật và vòng đời dữ liệu thông qua chính sách, tổ chức, quy trình và công nghệ. Quản lý dữ liệu (data stewardship) và tiêu chuẩn hóa là cốt lõi, đang tiến hóa sang data mesh, DataOps và quản trị AI.
- Cơ sở dữ liệu
Thiết kế và tinh chỉnh nhóm kết nối cơ sở dữ liệu (Connection Pool)
Tổng hợp nguyên lý của connection pool - tái sử dụng kết nối cơ sở dữ liệu để kiểm soát chi phí thiết lập kết nối và sự bùng nổ đồng thời; mượn·trả·kiểm tra·timeout, cách ước tính kích thước pool, so sánh pool phía ứng dụng với pooler bên ngoài, cùng thiết kế chuyển đổi dự phòng, khả năng quan sát và bảo mật.
- Cơ sở dữ liệu
Ghi nhật ký trước (WAL) và kỹ thuật phục hồi cơ sở dữ liệu (ARIES)
Giải thích nguyên lý giao thức WAL "ghi log trước dữ liệu" nhằm bảo đảm tính nguyên tử và bền vững, cấu trúc log (LSN, ghi log vật lý-logic), checkpoint, ba giai đoạn Phân tích - Làm lại - Hoàn tác của ARIES cùng DPT, CLR và lặp lại lịch sử qua kịch bản dựa trên LSN; tổng hợp đánh đổi của chính sách steal/no-force và sự mở rộng sang sao chép, CDC và CSDL đám mây.
- Cơ sở dữ liệu
Chỉ mục bitmap (Bitmap Index) và tối ưu hóa cơ sở dữ liệu phân tích
Cấu trúc chỉ mục biểu diễn tập hàng theo từng giá trị dưới dạng chuỗi bit và tăng tốc truy vấn phân tích đa điều kiện bằng phép AND·OR trong môi trường cardinality thấp, thiên về đọc; so sánh với B-Tree·hash, bitmap join, đánh đổi khi DML và chiến lược áp dụng cho data warehouse.
- Cơ sở dữ liệu
Sự cần thiết và hiệu quả kỳ vọng của chuẩn hóa dữ liệu
Nền tảng quản trị dữ liệu thống nhất thuật ngữ, miền giá trị và mã theo tiêu chuẩn chung nhằm bảo đảm tính nhất quán, khả năng tương tác và hiệu quả.
- Cơ sở dữ liệu
Tích hợp·di chuyển dữ liệu — tính toàn vẹn·tính nhất quán
Khác biệt giữa tính toàn vẹn và tính nhất quán trong di chuyển dữ liệu, góc nhìn phân tích profiling, phương pháp kiểm chứng đa tầng và chiến lược chạy thử·rollback·chuyển đổi bằng CDC.
- Cơ sở dữ liệu
Khóa phân tán (Distributed Lock)
Cấu trúc và giao thức của khóa phân tán, hiện thực loại trừ tương hỗ bằng thao tác giành khóa nguyên tử, thuê (lease), token chủ sở hữu và fencing token để nhiều máy chủ không đồng thời thay đổi tài nguyên dùng chung. So sánh cơ sở dữ liệu, Redis và bộ điều phối dựa trên đồng thuận, cách xử lý TTL hết hạn và client zombie, cập nhật có điều kiện, tính lũy đẳng (idempotency) và chiến lược vận hành.
- Cơ sở dữ liệu
Lưu trữ dữ liệu: so sánh tệp, DB và blockchain
So sánh chủ thể tin cậy, tính toàn vẹn và hiệu năng giữa tệp (do ứng dụng quản lý), DBMS (ACID tập trung) và blockchain (tính bất biến của sổ cái phân tán).
- Cơ sở dữ liệu
Cây LSM (Log-Structured Merge-Tree)
Cấu trúc lưu trữ tối ưu cho ghi, gom các thao tác ghi ngẫu nhiên vào MemTable rồi flush tuần tự và dọn dẹp các SSTable bất biến bằng compaction chạy nền — trình bày cơ chế WAL, Bloom filter, tombstone, MVCC; compaction phân tầng (leveled) và theo kích thước (size-tiered) cùng sự đánh đổi khuếch đại đọc/ghi/không gian (RUM); so sánh với cây B+ và các trường hợp áp dụng RocksDB, Cassandra.
- Cơ sở dữ liệu
Giao thức cam kết hai pha (2PC) và cam kết ba pha (3PC)
2PC (chuẩn bị - hoàn tất) đảm bảo tính nguyên tử của giao dịch phân tán và 3PC (tiền cam kết) giảm hiện tượng chặn của nó — cấu trúc bộ điều phối và bên tham gia, phục hồi dựa trên log, điểm yếu về chặn và phân vùng mạng, so sánh với các phương án thay thế XA, Saga, Paxos Commit.
- Cơ sở dữ liệu
Danh mục dữ liệu (Data Catalog) và quản lý siêu dữ liệu
Trình bày khái niệm và cấu trúc của danh mục dữ liệu — liên kết siêu dữ liệu kỹ thuật, nghiệp vụ, vận hành và quản trị với tài sản dữ liệu, bảng thuật ngữ, chất lượng, dòng dõi (lineage) và chính sách; quy trình thu thập, tuyển chọn, tìm kiếm, phân tích tác động; liên kết với ISO/IEC 11179 và W3C DCAT; ứng dụng cho sản phẩm dữ liệu, AI và chiến lược triển khai.
- Cơ sở dữ liệu
Mô hình hóa kho dữ liệu dựa trên Data Vault 2.0
Phương pháp luận mô hình hóa kho dữ liệu tách khóa nghiệp vụ, quan hệ và lịch sử thuộc tính thành Hub, Link, Satellite, phân tầng Raw Vault và Business Vault để đạt được khả năng thích ứng với thay đổi, khả năng kiểm toán và nạp dữ liệu song song. Đồng thời tổng hợp sự khác biệt với star schema, 3NF, lakehouse và thiết kế khóa, thời điểm, tính lũy đẳng, chất lượng và dữ liệu cá nhân.
- Cơ sở dữ liệu
Hướng dẫn chuẩn hóa CSDL của cơ quan công quyền Hàn Quốc — Bản đặc tả bảng
Sản phẩm đầu ra ghi lại cấu trúc, ý nghĩa và ràng buộc của bảng theo biểu mẫu chuẩn dựa trên hướng dẫn chuẩn hóa. Đi sâu vào các mục ghi chép, hướng dẫn soạn thảo, chẩn đoán chất lượng và liên kết với quản trị dữ liệu.
- Cơ sở dữ liệu
MVCC (Kiểm soát đồng thời đa phiên bản) và giao dịch dựa trên snapshot
Tổng hợp MVCC — cơ chế dùng snapshot theo từng giao dịch và nhiều phiên bản dòng để giảm tranh chấp đọc-ghi: xác định khả năng hiển thị, mức cô lập, cách triển khai trên PostgreSQL và InnoDB, dọn dẹp phiên bản, khóa, thử lại khi lỗi tuần tự hóa và thiết kế vận hành.
- Cơ sở dữ liệu
Cấu trúc chỉ mục cơ sở dữ liệu (B-Tree · B+Tree)
Tổng hợp B-Tree — cây tìm kiếm nhiều nhánh cân bằng với nút = trang đĩa để tăng fan-out, và B+Tree — chỉ đặt dữ liệu ở lá và nối các lá bằng danh sách liên kết để tăng cường truy vấn khoảng·sắp xếp: cấu trúc, hoạt động (tìm kiếm·tách·gộp), so sánh, chỉ mục clustered/covering và các anti-pattern, đến những thay đổi trong thời đại LSM-Tree·SSD.
- Cơ sở dữ liệu
Sao chép cơ sở dữ liệu (Replication) và thiết kế tính sẵn sàng cao
Tổng hợp chiến lược thiết kế và vận hành tính sẵn sàng cao cho cơ sở dữ liệu, tập trung vào sao chép đồng bộ/bất đồng bộ, topology một leader/nhiều leader, độ trễ sao chép và tính nhất quán khi đọc, chuyển đổi dự phòng (failover), fencing, RPO và RTO.
- Cơ sở dữ liệu
Bộ tối ưu hóa cơ sở dữ liệu (RBO·CBO)
Khái niệm bộ tối ưu hóa chọn kế hoạch thực thi tối ưu cho SQL, so sánh RBO dựa trên quy tắc (đã bị loại bỏ) và CBO dựa trên chi phí (tiêu chuẩn), các yếu tố tinh chỉnh như thống kê·histogram·hint cho đến tối ưu hóa thích ứng.
- Cơ sở dữ liệu
Phân mảnh cơ sở dữ liệu (Sharding)
Kỹ thuật phân chia ngang dữ liệu khối lượng lớn sang nhiều máy chủ DB nhằm phân tán tải và bảo đảm khả năng mở rộng. So sánh với partitioning, khóa shard (shard key).
- Cơ sở dữ liệu
Đặc tính của giao dịch cơ sở dữ liệu (ACID)
Tính nguyên tử, nhất quán, cô lập và bền vững (ACID) của giao dịch cùng các kỹ thuật hiện thực (khóa, MVCC, WAL), mức cô lập, và mở rộng trong môi trường phân tán với CAP, BASE, 2PC, Saga.
- Cơ sở dữ liệu
Quản lý dữ liệu chủ (MDM)
Khái niệm và sự cần thiết của MDM — quản lý thống nhất các dữ liệu tham chiếu cốt lõi như khách hàng, sản phẩm — cùng các thành phần và những điểm cần cân nhắc khi xây dựng.
- Cơ sở dữ liệu
Cơ sở dữ liệu chuỗi thời gian (Time Series Database)
Tổng hợp chuyên sâu về cơ sở dữ liệu chuỗi thời gian — lấy thời gian làm trục hạng nhất, tối ưu cho thu thập khối lượng lớn dạng append-only, nén theo trục thời gian (delta/Gorilla), tổng hợp theo khoảng, downsampling và chính sách lưu giữ; mô hình dữ liệu, storage engine dựa trên LSM, so sánh các loại sản phẩm và ứng dụng thực tiễn trong observability·IoT.
- Cơ sở dữ liệu
Tinh chỉnh cơ sở dữ liệu (DB Tuning)
Khái niệm và mục tiêu của tinh chỉnh — chẩn đoán và tối ưu suy giảm hiệu năng CSDL dựa trên kế hoạch thực thi — cùng các kỹ thuật theo từng tầng: thiết kế (phi chuẩn hóa, chỉ mục, phân vùng), DBMS và SQL (optimizer, hint).
- Cơ sở dữ liệu
HTAP (Hybrid Transactional/Analytical Processing)
Kiến trúc xử lý OLTP và OLAP trên cùng một engine mà không cần ETL nhờ lưu trữ lai hàng/cột trong bộ nhớ (in-memory) và cô lập khối lượng công việc, cung cấp phân tích thời gian thực trên dữ liệu vận hành — các loại hình triển khai, công nghệ cốt lõi và các đánh đổi.
- Cơ sở dữ liệu
MongoDB
Mô hình dữ liệu, replica set, sharding, chỉ mục, tổng hợp (aggregation) của MongoDB — NoSQL hướng tài liệu lưu dữ liệu dưới dạng tài liệu tương tự JSON (BSON) — so sánh với CSDL quan hệ và các xu hướng mới như giao dịch, tìm kiếm vector.
- Cơ sở dữ liệu
Kho dữ liệu (Data Warehouse) và OLAP
Tổng hợp theo dạng bài luận Kỹ sư chuyên nghiệp (Professional Engineer) về kho dữ liệu — kho lưu trữ chuyên dụng cho phân tích, tách khỏi hệ thống vận hành (OLTP) và tích lũy lịch sử theo các nguyên tắc hướng chủ đề·tích hợp·biến thiên theo thời gian·không biến động: cấu trúc và pipeline ETL/ELT, mô hình hóa chiều (star·snowflake·SCD), các phép toán OLAP và so sánh MOLAP/ROLAP/HOLAP, cùng sự tiến hóa sang DW trên đám mây·lakehouse.
- Cơ sở dữ liệu
Data Fabric (Kết cấu dữ liệu)
Kiến trúc quản lý dữ liệu lấy công nghệ làm trung tâm, kết nối việc khám phá·tích hợp·quản trị·phân phối dữ liệu trong môi trường phân tán, không đồng nhất thành một lớp logic duy nhất mà không cần gom dữ liệu về vật lý, nhờ siêu dữ liệu chủ động (active metadata), đồ thị tri thức và tự động hóa bằng AI — giảm thiểu di chuyển dữ liệu bằng ảo hóa dữ liệu, tự động thực thi quản trị dựa trên dòng dõi dữ liệu, và phát huy hiệu quả khi kết hợp bổ trợ với Data Mesh lấy tổ chức làm trung tâm.
- Cơ sở dữ liệu
Thu thập dữ liệu thay đổi (CDC, Change Data Capture)
Kỹ thuật tích hợp dữ liệu trích xuất theo thời gian thực chỉ phần thay đổi (INSERT, UPDATE, DELETE) từ nhật ký giao dịch của CSDL nguồn và lan truyền xuống hạ nguồn — các phương thức dựa trên log, trigger, truy vấn cùng offset, thứ tự, tính lũy đẳng và mẫu outbox.
- Cơ sở dữ liệu
Cơ sở dữ liệu vector (Vector Database)
Cơ sở dữ liệu tìm kiếm tương đồng tốc độ cao trên các vector nhiều chiều nhúng (embedding) từ dữ liệu phi cấu trúc bằng chỉ mục ANN — với các chỉ mục HNSW, IVF, PQ cùng tìm kiếm lai và xếp hạng lại, nó đóng vai trò kho tri thức theo ngữ nghĩa cho RAG, gợi ý và phát hiện bất thường; cốt lõi là cân bằng đánh đổi giữa độ chính xác, hiệu năng và chi phí.
- Cơ sở dữ liệu
Mô hình hóa dữ liệu RDBMS (quan hệ định danh·không định danh)
Mô hình hóa theo các giai đoạn khái niệm → logic → vật lý, so sánh quan hệ định danh (PK của cha nằm trong PK của con) và quan hệ không định danh (FK thông thường), các lưu ý về chuẩn hóa·toàn vẹn.
- Cơ sở dữ liệu
Năm loại tính trong suốt của cơ sở dữ liệu phân tán
Tính trong suốt về vị trí, phân mảnh, nhân bản, đồng thời và sự cố của CSDL phân tán — khái niệm che giấu sự phân tán, sao chép, xử lý đồng thời và sự cố để hệ thống trông như một CSDL duy nhất.
- Cơ sở dữ liệu
Các loại NoSQL và quy trình mô hình hóa dữ liệu
Công nghệ lưu trữ tối ưu cho dữ liệu phi cấu trúc, khối lượng lớn và phân tán — các loại Key-Value·Document·Column·Graph và quy trình mô hình hóa phi chuẩn hóa ưu tiên truy vấn.
- Cơ sở dữ liệu
Mức cô lập giao dịch (Transaction Isolation Level)
Tổng hợp 4 mức cô lập (Read Uncommitted~Serializable) và các hiện tượng bất thường Dirty Read, Non-repeatable Read, Phantom Read thông qua các ví dụ cụ thể.