← Về danh sách
Phần cứng & Bán dẫn
#HBM#TSV#3D적층#AI반도체#메모리#GPU#134회
Cập nhật lần cuối · 2026-07-05

Bộ nhớ băng thông cao (HBM, High Bandwidth Memory)

1. Tổng quan

A. Định nghĩa

Bộ nhớ xếp chồng theo chiều dọc (3D Stacking) các die DRAM và kết nối bằng TSV (Through-Silicon Via, điện cực xuyên silicon), hiện thực băng thông cực cao·tiêu thụ điện thấp nhờ độ rộng I/O rất lớn (từ 1024bit trở lên). Nó được đóng gói cùng bộ xử lý để giải quyết nút thắt bộ nhớ của AI·HPC·GPU.

Ý tưởng của HBM là "thay vì cho bộ nhớ chạy nhanh hơn (tần số↑), hãy chở rộng hơn trong một lần (độ rộng bus↑)". Nếu tiếp tục nâng tần số tín hiệu thì điện năng·nhiệt tăng vọt, nhưng mở rộng độ rộng bus thì ngay cả với xung nhịp thấp cũng có thể tăng mạnh tổng băng thông. Xếp chồng và TSV chính là phương tiện giúp bus rộng này khả thi về mặt vật lý.

B. Bối cảnh ra đời và sự cần thiết

Khi mô hình AI và tính toán HPC lớn lên, tốc độ xử lý của đơn vị tính toán (GPU) cải thiện nhanh chóng, nhưng tốc độ chở dữ liệu từ bộ nhớ tới bộ tính toán không theo kịp — cái gọi là bức tường bộ nhớ (Memory Wall) — nổi lên thành nút thắt. GPU nhanh đến đâu mà dữ liệu cần thiết không đến kịp thì bộ tính toán vẫn phải ngồi chờ. GDDR hiện có có giới hạn về độ rộng bus và điện năng, nên cần bộ nhớ xếp chồng 3D có thể bảo đảm I/O rộng với đường dây ngắn, và kết quả là HBM.

2. Cấu trúc

flowchart TB
  subgraph Package["Gói (trên interposer)"]
    G[GPU / bộ tăng tốc AI] ---|Bus rộng| I[Interposer silicon]
    subgraph HBM["Ngăn xếp HBM"]
      D4[DRAM Die] --- D3[DRAM Die] --- D2[DRAM Die] --- D1[DRAM Die] --- LB[Base Logic Die]
    end
    I --- LB
  end
  style HBM fill:#e8f0fe,stroke:#2f6fed,stroke-width:2px

Cốt lõi của cấu trúc có ba điểm. Thứ nhất, TSV xuyên thẳng đứng và nối các die DRAM xếp chồng, nên truyền tín hiệu bằng đường dọc ngắn thay vì đường dây vòng dài sang ngang. Đường dây ngắn lại làm giảm điện trở·thành phần ký sinh nên tín hiệu ổn định ngay cả với điện áp thấp hơn, đây là căn cứ của tiêu thụ điện thấp. Thứ hai, ngăn xếp được nối dọc như vậy bảo đảm hàng nghìn chân I/O, tạo ra bus siêu rộng từ 1024bit trở lên. Thứ ba, ngăn xếp HBM và GPU được đặt cạnh nhau trên interposer silicon (đóng gói 2.5D) và nối bằng bus siêu rộng. PCB thông thường không gánh nổi lượng đường dây lớn như vậy, nên interposer cho phép đi dây vi mô là bắt buộc.

  • TSV nối xuyên dọc các die xếp chồng → đường dây ngắn·I/O rộng
  • Interposer (2.5D) bố trí sát GPU → hiện thực vật lý bus rộng

3. Đặc điểm

Hạng mục Nội dung Nguyên lý (vì sao)
Băng thông cực cao Băng thông gấp nhiều lần so với GDDR Độ rộng bus lớn (1024bit+) nên tổng lượng↑ dù xung nhịp thấp
Tiêu thụ điện thấp Năng lượng trên mỗi bit↓ Đường dây TSV ngắn·vận hành ở điện áp thấp
Kích thước nhỏ gọn Tiết kiệm diện tích, bố trí sát bộ xử lý Xếp chồng dọc để tối thiểu diện tích mặt phẳng
Chi phí cao·tỏa nhiệt Gánh nặng đơn giá·hiệu suất (yield)·tản nhiệt Đóng gói 2.5D phức tạp·mật độ nhiệt của die xếp chồng↑

Đặc biệt, vì sao tỏa nhiệt là bài toán khó nhất của HBM: khi xếp chồng nhiều die theo chiều dọc, nhiệt của die tầng dưới phải đi xuyên qua tầng trên để thoát ra, và cấu trúc xếp chồng dễ giữ nhiệt lại. Mật độ nhiệt tăng thì hiệu năng·tuổi thọ giảm, nên đóng gói tiên tiến và thiết kế tản nhiệt trở thành then chốt của sản xuất hàng loạt.

4. Xu hướng băng thông theo thế hệ (mỗi ngăn xếp, giá trị xấp xỉ)

{
  "type": "bar",
  "data": {
    "labels": ["HBM2", "HBM2E", "HBM3", "HBM3E"],
    "datasets": [{
      "label": "Băng thông (GB/s, mỗi ngăn xếp)",
      "data": [307, 460, 819, 1230],
      "backgroundColor": ["#a9c5f5", "#7aa5f3", "#4d86ef", "#2f6fed"]
    }]
  },
  "options": {
    "plugins": { "legend": { "display": false }, "title": { "display": true, "text": "Băng thông HBM theo thế hệ (xấp xỉ)" } },
    "scales": { "y": { "title": { "display": true, "text": "GB/s" }, "beginAtZero": true } }
  }
}

Băng thông nhảy theo bậc thang khi thế hệ tăng lên là do số tầng xếp chồng tăng (ví dụ: 8 tầng→12 tầng) và tốc độ trên mỗi chân được cải thiện cùng tác động. Từ HBM2 tới HBM3E, băng thông mỗi ngăn xếp tăng khoảng 4 lần, nâng tương ứng thông lượng trao đổi các tham số siêu lớn với bộ nhớ trong huấn luyện·suy luận AI. Tuy nhiên, ràng buộc của việc chuyển thế hệ là càng tăng số tầng thì gánh nặng tỏa nhiệt·hiệu suất đã nêu cũng tăng theo.

5. Các điểm cần cân nhắc và hàm ý

  • Linh kiện nút thắt cốt lõi của bán dẫn AI: HBM thực chất quyết định hiệu năng của GPU·NPU, và năng lực cung ứng gắn trực tiếp với năng lực cạnh tranh hạ tầng AI. Thực tế nó đã trở thành linh kiện chiến lược đến mức nguồn cung HBM bị chỉ ra là nút thắt của việc xuất xưởng bộ tăng tốc AI.
  • Tiến hóa sang điện toán lấy bộ nhớ làm trung tâm: Bản thân việc di chuyển dữ liệu là thủ phạm chính của tiêu thụ điện·độ trễ, nên kiến trúc đang tiến hóa theo hướng ít di chuyển dữ liệu hơn bằng cách kết hợp với PIM (Processing-in-Memory) tính toán trực tiếp trong bộ nhớ hoặc CXL hỗ trợ gộp bộ nhớ (memory pooling).
  • Then chốt sản xuất hàng loạt là đóng gói·hiệu suất: Độ khó của việc xếp chồng die·TSV·ghép interposer cao nên khó bảo đảm hiệu suất (yield), và năng lực đóng gói tiên tiến trở thành nguồn gốc của lợi thế cạnh tranh.
  • Đánh đổi: Cái giá để có băng thông cực cao·tiêu thụ điện thấp là đơn giá và tỏa nhiệt·độ phức tạp thiết kế tăng mạnh, nên HBM được áp dụng tập trung ở lĩnh vực AI·HPC nơi băng thông quyết định hiệu năng, còn sản phẩm tiêu dùng thông thường vẫn dùng GDDR.

Tóm tắt một câu: HBM là bộ nhớ xếp chồng 3D DRAM bằng TSV và bố trí sát bộ xử lý qua interposer để hiện thực băng thông cực cao·tiêu thụ điện thấp bằng bus siêu rộng, là linh kiện cốt lõi giải quyết bức tường bộ nhớ (Memory Wall) của AI·HPC; tỏa nhiệt·hiệu suất·đóng gói là then chốt của sản xuất hàng loạt và nó đang mở rộng sang PIM·CXL.