Bộ nhớ không bay hơi thế hệ mới (Emerging NVM) và Bộ nhớ lớp lưu trữ (SCM)
1. Tổng quan
A. Định nghĩa
Bộ nhớ không bay hơi thế hệ mới (Emerging Non-Volatile Memory) là nhóm bộ nhớ dùng phần tử mới, giữ được dữ liệu ngay cả khi mất điện trong khi hướng tới tốc độ truy cập gần với DRAM và khả năng truy cập theo byte (byte-addressability), với các đại diện là STT-MRAM, PCM (PRAM), ReRAM và FeRAM. Lớp mới mà chúng tạo ra trong phân cấp bộ nhớ — lấp đầy khoảng cách hiệu năng giữa DRAM (dễ bay hơi, nhanh) và NAND (không bay hơi, chậm) — được gọi là Bộ nhớ lớp lưu trữ (SCM, Storage Class Memory).
Điểm khởi đầu để hiểu NVM thế hệ mới là sự thật rằng "phân cấp bộ nhớ hiện nay có một vách hiệu năng lớn." DRAM, gần CPU, nhanh với độ trễ hàng chục ns nhưng mất nội dung khi ngắt điện và đắt; ngược lại SSD dựa trên NAND không bay hơi, dung lượng lớn, giá rẻ nhưng độ trễ hàng chục μs, gấp hàng trăm đến hàng nghìn lần DRAM. Ở giữa chúng từng là một lớp trống "không bay hơi mà vẫn nhanh gần DRAM và truy cập trực tiếp theo byte." NVM thế hệ mới hướng tới lấp đầy đúng khoảng trống này và qua đó đạt sự hội tụ bộ nhớ-lưu trữ (memory-storage convergence). Điểm quan trọng là chúng không thay thế hoàn toàn DRAM hay NAND, mà tìm một vị trí riêng khớp với đặc tính vật lý của mỗi phần tử (tốc độ, độ bền, mật độ, điện năng) và do đó phân nhỏ phân cấp.
B. Bối cảnh ra đời và sự cần thiết
NVM thế hệ mới được chú ý không phải từ mong muốn hiệu năng tốt hơn đơn thuần, mà từ bối cảnh cấu trúc rằng các công nghệ bộ nhớ hiện có đồng thời chạm giới hạn vật lý và kinh tế. Có thể xem xét áp lực đó theo ba trục.
Trục thứ nhất là giới hạn thu nhỏ của DRAM. DRAM lưu điện tích trong một tụ điện, và khi ô nhỏ đi, rò rỉ điện tích và gánh nặng làm tươi (refresh) tăng, nên việc thu nhỏ chậm lại rõ rệt dưới nút 10nm. Đồng thời DRAM phải làm tươi không ngừng theo chu kỳ dưới 1μs, tiêu thụ điện ngay cả khi rảnh. Trục thứ hai là sự bùng nổ dữ liệu và tải công việc AI. Huấn luyện và suy luận mô hình ngôn ngữ lớn, cơ sở dữ liệu trong bộ nhớ (in-memory), và phân tích thời gian thực đòi hỏi giữ dữ liệu cỡ terabyte trong bộ nhớ, và các bức tường dung lượng, chi phí, điện năng quá cao để chỉ dùng DRAM đảm đương. Trục thứ ba là giới hạn của eFlash trong lĩnh vực nhúng. eNOR flash từng được nhúng trong vi điều khiển (MCU) khó tích hợp dưới nút 28nm và ghi chậm, chạm giới hạn như bộ nhớ nhúng độ tin cậy cao cho ô tô và IoT.
Trên bối cảnh này, sự cần thiết của NVM thế hệ mới tăng lên theo hai hướng. Một là mở rộng bộ nhớ dung lượng lớn cho trung tâm dữ liệu (SCM), con đường dùng tính không bay hơi để giữ dữ liệu qua các lần khởi động lại và mở rộng dung lượng rẻ hơn DRAM. Hai là thay thế bộ nhớ nhúng trên chip (eMRAM, eReRAM), con đường đẩy eNOR flash ra khỏi các tiến trình nhỏ và cung cấp ghi nhanh hơn, rò rỉ thấp hơn, độ tin cậy cao hơn. Thực tế, theo lộ trình bộ nhớ nhúng và bộ nhớ mới nổi của TechInsights, TSMC, GlobalFoundries, Samsung, UMC, Fujitsu, Sony, Renesas và các hãng khác đã và đang sản xuất hàng loạt các sản phẩm STT-MRAM và ReRAM thương mại trên nền tảng CMOS lớp 20nm, và TSMC cùng NXP đã giới thiệu eMRAM dùng cho ô tô dựa trên FinFET 16nm. Tóm lại NVM thế hệ mới không phải "phần tử phòng thí nghiệm" mà là công nghệ đã và đang được thương mại hóa trong các ngách cụ thể.
C. Đặc điểm chung
NVM thế hệ mới khác nhau về nguyên lý theo từng phần tử nhưng chia sẻ một số đặc điểm chung. Thứ nhất, chúng lưu thông tin trong một trạng thái vật lý (điện trở, từ hóa, phân cực) thay vì trong điện tích, nên thoát khỏi rò rỉ điện tích và tự nhiên có được tính không bay hơi. Thứ hai, chúng cho phép truy cập theo byte, nên khác với NAND vốn chỉ xử lý theo đơn vị khối, có thể đọc và ghi chi tiết như bộ nhớ. Thứ ba, hầu hết được tích hợp theo cấu trúc 1T1R hoặc crosspoint, để lại dư địa nâng mật độ trên DRAM. Thứ tư, chúng cùng có điểm yếu là độ bền ghi và độ đồng đều giữa các ô, nên cần một bộ điều khiển, ECC và cân bằng hao mòn để che giấu điều này — đòi hỏi đồng thiết kế phần cứng-phần mềm giống như một SSD.
2. Phân cấp bộ nhớ và vị trí của SCM
Một câu châm ngôn lâu đời của thiết kế bộ nhớ là "nhanh, lớn, hoặc rẻ — chọn hai trong ba." Vì sao cần NVM thế hệ mới trở nên rõ nhất khi quan sát toàn bộ phân cấp bộ nhớ. Phân cấp truyền thống chạy từ thanh ghi → cache (SRAM) → bộ nhớ chính (DRAM) → bộ nhớ phụ (NAND SSD/HDD), và khoảng cách hiệu năng-chi phí giữa DRAM và SSD đạt tới hàng trăm lần, nên khoảng này đóng vai trò điểm nghẽn của toàn hệ thống. SCM chen vào đúng khoảng cách này và biến phân cấp thành một cái thang liên tục.
flowchart TB
subgraph FAST["Nhanh · đắt · dung lượng nhỏ"]
REG["Thanh ghi (sub-ns)"]
CACHE["Cache SRAM (~1-10ns)"]
DRAM["DRAM chính (~10-100ns, dễ bay hơi)"]
end
SCM["Bộ nhớ lớp lưu trữ<br/>(NVM thế hệ mới, ~100-500ns, không bay hơi)"]
subgraph SLOW["Chậm · rẻ · dung lượng lớn"]
NAND["NAND SSD (~10-100us)"]
HDD["HDD/băng từ (~ms trở lên)"]
end
REG --> CACHE --> DRAM --> SCM --> NAND --> HDD
style SCM fill:#e8f0fe,stroke:#2f6fed,stroke-width:2px
style DRAM fill:#fef7e8,stroke:#e0a500,stroke-width:1px
Trong sơ đồ phân cấp này, vị trí của SCM là ngay dưới DRAM và ngay trên NAND. Nó chậm hơn DRAM (cỡ hàng trăm ns) nhưng nhanh hơn NAND khoảng 100 lần, và điểm khác biệt quyết định là nội dung của nó vẫn còn ngay cả khi ngắt điện. Ví dụ, bộ nhớ bền vững Intel Optane có độ trễ đọc đo được khoảng 100–300ns, nằm đúng giữa DRAM (hàng chục ns) và NAND SSD (hàng chục μs). Sự kết hợp "tốc độ trung bình + không bay hơi + truy cập theo byte" này cho phép những ứng dụng mới mà không lớp nào hiện có cung cấp.
Ở đây cần lưu ý vì sao truy cập theo byte lại quan trọng. NAND SSD là một thiết bị khối, nên dù sửa dữ liệu nhỏ đến đâu cũng đọc và ghi theo đơn vị trang/khối và phải đi qua các lớp hệ thống tập tin và khối. Ngược lại, SCM được truy cập trực tiếp tại địa chỉ bộ nhớ bằng lệnh load/store của CPU như DRAM, nên chi phí phụ của ngăn xếp phần mềm (lời gọi hệ thống, DMA, ngắt) biến mất. Khác biệt này xuất hiện đặc biệt lớn với metadata, chỉ mục và nhật ký vốn có nhiều cập nhật nhỏ và thường xuyên, nên mức cải thiện hiệu năng cảm nhận được khác nhau ngay cả với cùng độ trễ phương tiện.
SCM được dùng trong hệ thống theo hai chế độ vận hành. Thứ nhất là chế độ bộ nhớ (memory mode), làm cho nó xuất hiện với OS như một bộ nhớ dễ bay hơi khổng lồ và dùng DRAM làm cache để mở rộng dung lượng bộ nhớ một cách rẻ. Dễ áp dụng vì có thể có bộ nhớ lớn mà không cần sửa ứng dụng, nhưng không dùng được lợi ích của tính không bay hơi (tính bền vững) và phơi bày độ trễ SCM trực tiếp khi trượt cache DRAM. Thứ hai là chế độ App-Direct, trong đó ứng dụng nhận biết tính không bay hơi một cách tường minh và đọc ghi dữ liệu bền vững trực tiếp theo đơn vị byte. Chế độ sau có thể bỏ qua bước cơ sở dữ liệu flush nhật ký xuống đĩa và đảm bảo tính bền vững chỉ bằng một lần ghi bộ nhớ, giảm đáng kể độ trễ giao dịch.
Tuy nhiên chế độ App-Direct không miễn phí. Nếu mất điện khi một lần ghi vẫn còn trong cache CPU và chưa đến SCM, dữ liệu bị mất, nên ứng dụng phải làm bền vững các lần ghi một cách tường minh và đảm bảo thứ tự cập nhật bằng các lệnh như CLWB và SFENCE. Nó cũng phải tự thiết kế tính nguyên tử khi sự cố (failure atomicity) ngăn một cập nhật "ghi dở (torn)", cùng với logic phục hồi. Thứ che giấu sự phức tạp này là các thư viện như PMDK và chế độ DAX của hệ thống tập tin, và sự có hay không của tài sản phần mềm này quyết định thành bại của việc dùng SCM.
3. Các công nghệ phần tử NVM thế hệ mới
Hiểu nguyên lý hoạt động của mỗi phần tử sẽ lộ ra vì sao mỗi công nghệ nhắm một ngách khác nhau. Kiến trúc chung là một cấu trúc crosspoint hoặc 1T1R đặt một phần tử biến đổi điện trở (hoặc một phần tử từ tính) tại giao điểm của một wordline và bitline và phân biệt 0 và 1 bằng mức điện trở. 1T1R đặt một transistor chọn và một phần tử điện trở cho mỗi ô để chặn nhiễu sneak-path giữa các ô lân cận, cho độ tin cậy cao, trong khi crosspoint đặt một phần tử chỉ tại giao điểm mà không có transistor để tối đa hóa mật độ nhưng phải chặn các đường rò bằng một selector. Chọn cấu trúc nào sẽ quyết định sự đánh đổi mật độ-độ tin cậy.
flowchart LR
subgraph CELL["Cấu trúc ô biến đổi điện trở (1T1R)"]
WL["Wordline (transistor chọn)"] --> R["Phần tử điện trở biến đổi"]
R --> BL["Bitline (cảm nhận)"]
end
R -.->|"MRAM"| M["Hướng từ hóa (MTJ song song/phản song song)"]
R -.->|"PCM"| P["Chuyển pha tinh thể/vô định hình (GST)"]
R -.->|"ReRAM"| F["Tạo/phá filament lỗ trống oxy"]
R -.->|"FeRAM"| D["Hướng phân cực sắt điện"]
style CELL fill:#e8f0fe,stroke:#2f6fed,stroke-width:2px
A. STT-MRAM (Spin-Transfer Torque MRAM). Nó dùng tính chất rằng, giữa hai lớp từ tính của một tiếp giáp xuyên hầm từ (MTJ, Magnetic Tunnel Junction), điện trở thấp khi các hướng từ hóa song song và cao khi phản song song. MTJ gồm một lớp tham chiếu (reference layer), một rào xuyên hầm cách điện và một lớp tự do (free layer), và ghi 0 và 1 bằng cách chỉ thay đổi từ hóa của lớp tự do. Trong khi MRAM kiểu toggle cũ lật từ hóa bằng từ trường ngoài, vốn bất lợi cho điện năng và mật độ tích hợp, STT-MRAM lật từ hóa bằng mô-men xoắn, cho một dòng phân cực spin chạy trực tiếp qua phần tử, nên đường dòng bị giới hạn trong ô, trở nên thuận lợi cho thu nhỏ và điện năng thấp.
Các thế mạnh lớn nhất của nó là ghi rất nhanh (lớp ns) và độ bền gần như vô hạn trên thực tế (10^12–10^15 chu kỳ), cùng với đọc không phá hủy. Điều này là vì, khác với PCM cần nung nóng vật lý mỗi lần ghi, hay ReRAM tạo một filament mới, việc chuyển hướng từ hóa không làm hao mòn phần tử. Tuy nhiên tỷ số điện trở của MTJ (chênh lệch điện trở giữa song song và phản song song) không lớn, nên biên cảm nhận hẹp; diện tích ô tương đối lớn; và khi thu nhỏ, việc bảo đảm ổn định nhiệt và giảm dòng ghi xung đột với nhau trong nỗ lực ngăn lật bit do dao động nhiệt.
Vì những đặc tính này, STT-MRAM trước hết an vị như bộ nhớ nhúng (eMRAM) thay thế cache SRAM hoặc eNOR flash hơn là lưu trữ dung lượng lớn, và Samsung, TSMC, GF, UMC và các hãng khác đang sản xuất hàng loạt nó cho MCU ô tô và IoT. Ví dụ, MCU điện tử ô tô đòi hỏi giữ dữ liệu hàng chục năm và ghi nhanh trong môi trường nhiệt khắc nghiệt, và eMRAM cho thấy ưu thế so với eNOR flash về tốc độ ghi và độ bền, nên việc áp dụng tiến trình tiên tiến đang tăng, như eMRAM ô tô FinFET 16nm của TSMC/NXP.
Một đích khác mà STT-MRAM nhắm tới là làm không bay hơi cache cấp cuối (LLC) và bộ nhớ làm việc. Nếu cache thường do SRAM đảm nhận được thay bằng MRAM không bay hơi, tính toán normally-off giữ được trạng thái ngay cả khi ngắt điện hoàn toàn lúc rảnh trở nên khả thi, nâng cao đáng kể hiệu quả năng lượng của các thiết bị điện năng thấp hoạt động ngắt quãng như thiết bị đeo và nút cảm biến. Điều này cũng trở thành nền tảng phần cứng cho tính toán ngắt quãng (intermittent computing) đã bàn trước đó.
B. PCM/PRAM (Phase-Change Memory). Nó dùng nguyên lý rằng một vật liệu chalcogenide (điển hình là GST, Ge-Sb-Te) chuyển giữa trạng thái tinh thể (điện trở thấp) và vô định hình (điện trở cao) bằng nhiệt. Nung chảy bằng một xung ngắn mạnh rồi tôi nhanh để các nguyên tử đông cứng mất trật tự thành trạng thái vô định hình (reset, điện trở cao), trong khi đi chậm qua gần nhiệt độ tới hạn bằng một xung yếu sắp xếp lại chúng đều đặn thành trạng thái tinh thể (set, điện trở thấp). Chênh lệch điện trở lớn, hàng chục đến hàng trăm lần, làm việc cảm nhận dễ, và lưu trữ đa mức (multi-level cell) chia điện trở trung gian thành nhiều bước là khả thi, nâng mật độ trên mỗi bit.
Về mặt cấu trúc nó xếp chồng tốt dạng crosspoint, vốn thuận lợi cho dung lượng lớn, và 3D XPoint (Optane) của Intel/Micron là trường hợp thương mại hóa tiêu biểu của họ này. Tuy nhiên mỗi lần ghi cần nung nóng hàng trăm °C cho chuyển pha, nên điện năng ghi lớn và độ bền (khoảng 10^6–10^9 chu kỳ) kém DRAM/MRAM; việc quản lý nhiễu nhiệt (thermal crosstalk) do nhiệt lan sang ô lân cận và trôi điện trở (resistance drift) mà điện trở của trạng thái vô định hình thay đổi theo thời gian là khó khăn.
Intel chính thức hóa việc rút lui mảng Optane trong Q2 2022 và ghi nhận khoản giảm giá hàng tồn kho, và gấp lại dòng sản phẩm theo từng giai đoạn — dòng 100 trong 2023, dòng 200 với đơn hàng cuối vào cuối 2024 và giao hàng kết thúc trong 2025. Điều này được đánh giá là thất bại của hệ sinh thái hơn là của công nghệ — một công ty đơn lẻ thấy khó tự mình duy trì một hệ sinh thái gồm bộ điều khiển bộ nhớ chuyên dụng, hỗ trợ nền tảng, phần mềm (PMDK) và nhu cầu đủ lớn, và một khi Micron rời đi trước vào 2021, tính kinh tế nguồn cung sụp đổ.
Họ PCM dù vậy vẫn giữ giá trị như một nguyên mẫu thiết kế cho bộ nhớ không bay hơi dung lượng lớn, nhờ thế mạnh vốn có là mật độ cao crosspoint và lưu trữ đa mức. Việc chấm dứt kinh doanh Optane không có nghĩa là loại bỏ nguyên lý PCM, và trong khuôn khổ mở rộng bộ nhớ dựa trên CXL bàn sau, nhu cầu về phần tử không bay hơi mật độ cao có dư địa tái xuất hiện.
C. ReRAM/RRAM (Resistive RAM). Khi đặt điện áp bên trong một màng oxit kim loại (ví dụ HfOx, TaOx), một filament dẫn điện tạo bởi lỗ trống oxy (oxygen vacancy) hình thành (set) và đứt (reset), làm thay đổi điện trở. Để dùng phần tử lần đầu, nó trải qua một quá trình forming tạo mầm của filament bằng một điện áp mạnh, sau đó filament bị cắt và nối lại ở điện áp thấp. Cấu trúc phần tử đơn giản, thuận lợi cho thu nhỏ và xếp chồng 3D, với điện năng ghi thấp và tốc độ nhanh là các ưu điểm.
Thương mại hóa cũng đã tiến triển: TSMC sản phẩm hóa một ReRAM nhúng 22nm (dựa trên HfOx), Fujitsu một ReRAM dựa trên TaOx, và các trường hợp ReRAM nhúng cho STMicroelectronics và các hãng khác được báo cáo. Tuy nhiên, vì hình thành và tan rã filament là hiện tượng xác suất ở quy mô nguyên tử, phân bố điện trở phân tán theo từng ô, và đặc tính thay đổi dưới các lần ghi lặp lại, nên bảo đảm độ đồng đều và độ tin cậy vẫn là thách thức cốt lõi.
Thú vị là đặc tính điện trở liên tục, tương tự (analog) này vừa là nhược điểm vừa là cơ hội. Việc có thể điều khiển tinh giá trị điện trở theo nhiều bước là bất lợi cho bộ nhớ số, nhưng trong tính toán neuromorphic và trong bộ nhớ, nó được diễn giải lại như một phần tử trọng số khớp thần kinh (synapse), mở một con đường thực hiện nhân-cộng dồn trong miền tương tự trên một mảng điện trở. Dòng chảy bộ nhớ mở rộng thành phần tử tính toán này làm cho ReRAM thành một công nghệ vượt khỏi một thiết bị lưu trữ đơn thuần.
D. FeRAM (Ferroelectric RAM). Nó lưu dữ liệu bằng cách lật hướng phân cực của một chất sắt điện bằng điện trường. Một điện áp ngoài thay đổi hướng phân cực, và khi đọc nó cảm nhận chênh lệch điện tích tùy thuộc phân cực có đảo hay không. Điện năng ghi cực thấp, tốc độ nhanh, và độ bền cao (10^12 chu kỳ trở lên), nên nó được dùng đều đặn trong IoT điện năng thấp, thẻ thông minh, thiết bị đo công nghiệp, RFID và tương tự.
FeRAM truyền thống dựa trên các tụ họ PZT, nên khả năng tương thích với các tiến trình CMOS nhỏ thấp và diện tích ô lớn, khiến dung lượng lớn khó đạt. Tuy nhiên gần đây, việc phát hiện chất sắt điện họ HfO2 (FeFET, Ferroelectric FET) giúp có thể chia sẻ vật liệu và tiến trình với các tiến trình cổng high-k hiện có, nên ái lực của nó với các tiến trình logic tăng mạnh và nó đang được xem xét lại. Dù vậy, dung lượng vẫn ở mức vài Mb, nên chủ lực của nó là một ngách chuyên biệt về điện năng cực thấp và độ bền cao hơn là bộ nhớ chính dung lượng lớn. Trường hợp FeRAM cho thấy nguyên mẫu của đổi mới bộ nhớ bán dẫn trong đó "một công nghệ cũ được hồi sinh khi gặp vật liệu và tiến trình mới."
Ở đây, nhóm bốn phần tử theo một trục lộ ra bức tranh lớn rằng chúng tách thành "MRAM/FeRAM mạnh về tốc độ và độ bền" và "PCM/ReRAM mạnh về mật độ và tích hợp." Nhóm trước dùng một trạng thái vật lý thuận nghịch của từ hóa hoặc phân cực, nên hao mòn ít và nhắm cache cùng bộ nhớ nhúng, trong khi nhóm sau liên quan đến biến dạng cấu trúc của chuyển pha hoặc filament, nên có hao mòn nhưng nhắm dung lượng lớn qua đa mức và xếp chồng 3D. Sự phân đôi này ánh xạ trực tiếp vào hai nhánh ứng dụng "thay thế bộ nhớ nhúng vs bộ nhớ lớp lưu trữ."
Các đặc tính phần tử được tóm tắt như sau. Bảng chỉ là một trợ giúp cho so sánh, và vì các con số dao động rộng theo tiến trình và thế hệ, nên đọc chúng như xu hướng tương đối.
| Phân loại | STT-MRAM | PCM/PRAM | ReRAM | FeRAM | (tham khảo) DRAM | (tham khảo) NAND |
|---|---|---|---|---|---|---|
| Nguyên lý lưu | Hướng từ hóa | Chuyển pha | Filament lỗ trống oxy | Phân cực sắt điện | Điện tích (tụ) | Điện tích (cổng nổi) |
| Tốc độ ghi | Rất nhanh (ns) | Trung bình | Nhanh | Rất nhanh | Rất nhanh | Chậm (μs) |
| Độ bền (ghi) | ~10^12 trở lên | ~10^6-10^9 | ~10^6-10^12 | ~10^12 trở lên | Vô hạn | ~10^3-10^5 |
| Mật độ/khả xếp chồng | Trung bình | Cao (đa mức, 3D) | Cao (3D) | Thấp | Trung bình | Rất cao |
| Không bay hơi | O | O | O | O | X | O |
| Ứng dụng chính | Nhúng (eMRAM) | SCM | Nhúng, tính toán trong bộ nhớ | IoT điện năng cực thấp | Bộ nhớ chính | Lưu trữ dung lượng lớn |
Điều cốt lõi cần đọc từ bảng là "không một cái nào vượt trội toàn diện." STT-MRAM trội về tốc độ và độ bền nhưng bất lợi cho dung lượng lớn do mật độ thấp; PCM cao về mật độ nhưng tụt về độ bền và điện năng; ReRAM có tích hợp tốt nhưng độ đồng đều là thách thức; và FeRAM điện năng cực thấp nhưng nhỏ về dung lượng. Nghĩa là mỗi phần tử chỉ tối ưu trên một trục cụ thể, và trục đó trùng khớp chính xác với ngách mà phần tử đã an vị. Vì lý do này, thay vì kỳ vọng "một kẻ thắng duy nhất (universal memory)", một cấu trúc cùng tồn tại đa lớp dùng các phần tử khác nhau theo mục đích là triển vọng thực tế.
4. So sánh và các trường hợp ứng dụng
Lý do cơ bản khiến các khác biệt nảy sinh giữa các phần tử nằm ở "thông tin được lưu trong cái gì." DRAM và NAND, lưu nó trong điện tích, chịu các vấn đề rò rỉ và độ tin cậy tệ hơn khi thu nhỏ làm giảm điện tích, trong khi NVM thế hệ mới, lưu nó trong một trạng thái vật lý như điện trở, từ hóa hoặc phân cực, thoát khỏi rò rỉ điện tích. Vì lý do này NVM thế hệ mới tự nhiên có được tính không bay hơi về nguyên lý. Ngược lại, thay đổi trạng thái vật lý mỗi lần ghi tốn năng lượng (đặc biệt là việc nung nóng của PCM), và vì chuyển trạng thái mang tính xác suất (filament của ReRAM), bảo đảm độ đồng đều và độ bền trở thành một khó khăn chung. Nghĩa là, sự đánh đổi rằng "tính không bay hơi có được miễn phí, nhưng độ tin cậy ghi phải trả giá đắt" là bản chất của nhóm phần tử này.
Ngã rẽ trong chiến lược ứng dụng cũng nảy sinh ở đây. SCM trung tâm dữ liệu coi trọng dung lượng lớn và mật độ cao, nên họ PCM từng thuận lợi, nhưng do các vấn đề hệ sinh thái Optane rút lui, và vai trò đó nay đang chuyển sang mở rộng bộ nhớ dựa trên CXL (Compute Express Link). Ngay cả Intel cũng chỉ CXL như người kế nhiệm của Optane, vì CXL cho phép bộ nhớ được chia sẻ và gộp (pooling) theo đơn vị byte trên lớp vật lý PCIe, nên DRAM và NVM có thể được phân lớp linh hoạt mà không bị trói vào một phần tử mới cụ thể. Ngược lại, bộ nhớ nhúng trên chip coi trọng độ tin cậy, tốc độ ghi và tích hợp tiến trình nhỏ hơn dung lượng, nên MRAM và ReRAM đang nhanh chóng thay thế eNOR flash. Sự bất đối xứng này — cùng một "NVM thế hệ mới" vật lộn ở trung tâm dữ liệu nhưng bứt phá ở nhúng — cho thấy thành bại của một công nghệ không chỉ phụ thuộc hiệu năng phần tử mà vào bối cảnh ứng dụng và hệ sinh thái.
Có thể dẫn ba trường hợp cụ thể. Thứ nhất, Intel Optane (PCM/3D XPoint), ra mắt năm 2017, được dùng để mở rộng quy mô và khởi động lại nhanh các DB trong bộ nhớ (SAP HANA và tương tự), nhưng với việc Micron rời đi năm 2021 và Intel chấm dứt kinh doanh năm 2022, nó lùi vào lịch sử — một trường hợp tiêu biểu cho thấy tính khả thi kỹ thuật và tính bền vững kinh doanh là tách biệt. Thứ hai, eMRAM ô tô 16nm của TSMC/NXP đáp ứng độ bền nhiệt độ cao và ghi nhanh mà các MCU lái tự động và điện tử yêu cầu, cho phép tích hợp tiến trình tiên tiến vốn khó với eNOR flash. Thứ ba, ứng dụng tính toán trong bộ nhớ của ReRAM thực hiện nhân-cộng dồn (MAC) tương tự trên một mảng phần tử điện trở để giảm điểm nghẽn di chuyển dữ liệu của suy luận AI, dẫn đến nghiên cứu và nguyên mẫu và cho thấy hướng xóa nhòa ranh giới giữa bộ nhớ và tính toán.
Phải cảnh giác một ngộ nhận phổ biến khi phán đoán ứng dụng: kỳ vọng rằng "NVM thế hệ mới = một bộ nhớ trong mơ rẻ hơn và nhanh hơn DRAM." Trên thực tế không phần tử nào đồng thời vượt DRAM và NAND trên mọi trục của tốc độ, mật độ, độ bền, điện năng và chi phí. Ví dụ, MRAM nhanh và bền cao nhưng mật độ thấp nên đắt, trong khi PCM mật độ cao nhưng bất lợi về độ bền và điện năng. Do đó quyết định áp dụng nên bắt đầu không phải từ "cái nào tốt nhất" mà từ "tải công việc của tôi nhạy với trục nào", và cách tiếp cận đúng là định lượng tần suất ghi, dung lượng, ngân sách điện năng và yêu cầu độ tin cậy để chọn phần tử và chế độ vận hành (chế độ bộ nhớ vs App-Direct).
Một trục so sánh khác là việc định vị thay thế DRAM hay thay thế NAND. Nếu SCM được dùng để bổ sung và mở rộng DRAM, "dung lượng lớn và tính bền vững dù chậm hơn một chút" trở thành giá trị, trong khi nếu nó được dùng để bổ sung NAND, "độ trễ thấp hơn nhiều dù đắt hơn một chút" trở thành giá trị. Các tải công việc tiêu biểu của nhóm trước là DB trong bộ nhớ, cache lớn và KV store; của nhóm sau là lưu metadata, ghi nhật ký (journaling) và nhật ký độ trễ thấp. Vì đường cơ sở của đánh giá kinh tế thay đổi tùy lớp lân cận mà ngay cùng một phần tử nhắm tới, so sánh phải được làm không phải bằng hiệu năng tuyệt đối mà bằng "giá trị tương đối so với đối tượng thay thế."
5. Chuyên sâu — Xu hướng mới nhất và hướng ra đề dự kiến
Thay đổi cục diện gần đây quanh NVM thế hệ mới có thể tóm tắt ở điểm rằng sự thay đổi của khung hệ thống chứa phần tử đã trở nên quan trọng hơn sự tiến bộ của chính phần tử.
Cốt lõi của dòng chảy gần đây là một sự chuyển dịch từ "cạnh tranh phần tử mới đơn lẻ" sang "lấy lớp và liên kết làm trung tâm." Bài học việc Optane rút lui để lại là dù một phần tử xuất sắc đến đâu, cũng khó tự mình duy trì một hệ sinh thái gồm bộ điều khiển chuyên dụng, phần mềm và nhu cầu đủ lớn. Kết quả là sự chú ý của ngành chuyển từ ép một phần tử cụ thể vào DRAM/NAND sang phân lớp và gộp bộ nhớ dị thể một cách linh hoạt trên liên kết mở gọi là CXL. CXL 3.x chuẩn hóa gộp và chia sẻ bộ nhớ, cho phép tách rời bộ nhớ (memory disaggregation) trong đó bộ nhớ từng cố định theo máy chủ được nhiều nút chia sẻ. Trong khung này, NVM thế hệ mới có dư địa an vị lại như một "thiết bị bộ nhớ CXL không bay hơi." JEDEC cũng đã định nghĩa khả năng tương tác của các mô-đun bộ nhớ không bay hơi qua các chuẩn họ NVDIMM.
Dòng chảy thứ hai là sự lan rộng đều đặn trong nhúng và biên (edge). Khác với trung tâm dữ liệu, trong lĩnh vực nhúng eMRAM và eReRAM đang lặng lẽ lớn lên trong khi thực sự đẩy eNOR flash ra, và nhu cầu AI và dữ liệu lớn đang nâng nhu cầu về bộ nhớ rò rỉ thấp, tích hợp cao để thay cache SRAM và eDRAM. Đặc biệt, dưới nút tiên tiến 10nm, tích hợp eNOR flash gần như bất khả thi, nên eMRAM thu được một lợi ích cấu trúc như một lựa chọn thay thế cho bộ nhớ lưu mã nhúng và tham số trong MCU và SoC. Dòng chảy thứ ba là sự hội tụ với tính toán trong bộ nhớ (CIM), một nỗ lực dùng các đặc tính điện trở tương tự của ReRAM và PCM như các phần tử khớp thần kinh của tính toán neuromorphic và trong bộ nhớ để làm dịu một cách căn bản điểm nghẽn von Neumann.
Dòng chảy thứ tư là sự trưởng thành của chuẩn hóa và hệ sinh thái phần mềm. Để ứng dụng dùng bộ nhớ không bay hơi an toàn, cần một mô hình lập trình đảm bảo tính nguyên tử và phục hồi khi mất điện, và các tài sản tích lũy trong thời Optane, như PMDK (Persistent Memory Development Kit) và chế độ DAX (Direct Access) của hệ thống tập tin, có thể được kế thừa bởi bộ nhớ không bay hơi dựa trên CXL ngay cả khi một phần tử của nhà cung cấp cụ thể biến mất. Cuối cùng, điểm rằng "lớp trừu tượng xử lý tính không bay hơi sống lâu hơn" phần cứng là một bài học khác mà trường hợp Optane để lại.
Thông điệp xuyên suốt các dòng chảy này là giá trị của NVM thế hệ mới nằm không ở "một phần tử đơn lẻ thay thế DRAM/NAND" mà ở "một thành phần tái tổ chức phân cấp bộ nhớ." Trong quá khứ từng có một giấc mơ về bộ nhớ vạn năng (universal memory) trong đó một phần tử thống nhất mọi bộ nhớ, nhưng thực tế hội tụ về chuyên biệt hóa trong các ngách cụ thể khi thế mạnh của mỗi phần tử là rõ nét. Kết quả là phân cấp bộ nhớ đang bị phân nhỏ thay vì đơn giản hóa, và cái ràng buộc sự phân nhỏ này về một mức vận hành được là một liên kết mở như CXL và sự trừu tượng hóa phần mềm.
Từ góc nhìn của kỹ sư chuyên nghiệp, các hướng ra đề dự kiến có thể được tổ chức như sau. ① Giải thích vị trí của SCM trong sơ đồ phân cấp bộ nhớ và sự cần thiết của việc nó ra đời, kèm một hình; ② so sánh nguyên lý hoạt động và đặc tính của STT-MRAM, PCM và ReRAM và bàn về các ngách ứng dụng của chúng; ③ phân tích nguyên nhân Optane rút lui từ góc nhìn kỹ thuật và hệ sinh thái và giải thích vì sao CXL trở thành lựa chọn thay thế của nó; ④ trình bày các cân nhắc về kiến trúc, phần mềm và vận hành khi áp dụng NVM thế hệ mới — thay vì câu hỏi trả lời ngắn, nhiều khả năng nó được ra như một bài luận đan xen nguyên lý + so sánh + chiến lược như vậy.
6. Cân nhắc và hàm ý
NVM thế hệ mới không phải chủ đề để kết thúc như một "giới thiệu công nghệ mới" trong kỳ thi kỹ sư chuyên nghiệp, mà là chủ đề đòi hỏi phán đoán tích hợp trải rộng phân cấp bộ nhớ, kiến trúc, phần mềm, an ninh, vận hành và tính khả thi kinh doanh. Các hàm ý được tổ chức từ năm góc nhìn sau.
Thứ nhất, việc chọn phần tử nên được quyết định bởi "bối cảnh ứng dụng," không phải "hiệu năng." NVM thế hệ mới không phải một vật thay thế đa dụng mà có một ngách rõ ràng cho mỗi loại. Với mở rộng dung lượng trung tâm dữ liệu, thay vì đặt cược vào một phần tử mới cụ thể, an toàn hơn là chọn chuẩn mở của gộp bộ nhớ dựa trên CXL để phân tán khóa chặt nhà cung cấp (lock-in) và rủi ro hệ sinh thái. Ngược lại, với bộ nhớ nhúng độ tin cậy cao cho nhúng và ô tô, eMRAM và eReRAM, vốn đã trưởng thành trong sản xuất hàng loạt, là lựa chọn thực tế.
Thứ hai, tính không bay hơi là con dao hai lưỡi đòi hỏi một sự thay đổi trong mô hình phần mềm. Để dùng đúng bộ nhớ bền vững truy cập theo byte, ứng dụng phải quản lý tính nhất quán khi mất điện một cách tường minh (flush cache, tính nguyên tử khi sự cố, logic phục hồi). Vì tính không bay hơi thay vào đó tạo ra rủi ro an ninh rằng dữ liệu nhạy cảm vẫn còn về mặt vật lý ngay cả sau khi tắt nguồn, thiết kế mã hóa bộ nhớ và xóa an toàn (secure erase) là thiết yếu. Để có được lợi ích của việc áp dụng, chỉ thay phần cứng là không đủ; đồng thiết kế phần cứng-phần mềm thiết kế đồng thời DB, OS và runtime là tiền đề.
Thứ ba, cần thiết kế vận hành đặt trên tiền đề các giới hạn độ bền và độ tin cậy. Vì PCM và ReRAM không thể bị ghi đè vô hạn như DRAM, phân phối ghi (cân bằng hao mòn), giám sát hao mòn và ECC phải được cung cấp ở cấp bộ điều khiển, và một chiến lược phân biệt tải công việc nặng ghi với nặng đọc để bố trí các phần tử sẽ quyết định TCO. Vì các con số độ tin cậy dao động rộng theo thế hệ và tiến trình, nên khuyến nghị kiểm chứng đo đạc qua một PoC.
Thứ tư, việc áp dụng nên được phán đoán bằng cách quy "rủi ro chuẩn và hệ sinh thái" thành giá. Như trường hợp Optane cho thấy, trói một kiến trúc trọng yếu vào một phần tử độc quyền của một nhà cung cấp làm chi phí thay thế trở nên khổng lồ khi gián đoạn nguồn cung. Do đó không chỉ lợi ích hiệu năng mà còn tính liên tục nguồn cung, nguồn cung thứ hai, tuân thủ chuẩn (JEDEC, CXL) và lộ trình di trú phải được đánh giá cùng nhau, và thiết kế phụ thuộc vào trừu tượng hóa phần mềm (PMDK, DAX, CXL.mem) để các lớp trên có thể được tái dùng ngay cả khi một phần tử cụ thể biến mất là cốt lõi của giảm thiểu rủi ro.
Thứ năm, phải nhìn triển vọng trung-dài hạn và các công nghệ liên quan cùng nhau. Trong ngắn hạn eMRAM nhúng là trục tăng trưởng chắc chắn nhất; trong trung hạn, với sự trưởng thành của hệ sinh thái CXL, bộ nhớ CXL không bay hơi nhiều khả năng lấp lại vị trí của SCM. Trong dài hạn, tính toán trong bộ nhớ dựa trên ReRAM/PCM có thể nổi lên như một công nghệ đột phá làm dịu điểm nghẽn di chuyển dữ liệu của tăng tốc AI. Do đó kỹ sư chuyên nghiệp phải quan sát NVM thế hệ mới một cách tích hợp trong bức tranh lớn về một sự hội tụ bộ nhớ-lưu trữ-tính toán cùng với DRAM, NAND, CXL, PIM và neuromorphic.
Tài liệu tham khảo
- 3D XPoint, Wikipedia — https://en.wikipedia.org/wiki/3D_XPoint
- Intel to Wind Down Optane Memory Business, AnandTech — https://www.anandtech.com/show/17515/intel-to-wind-down-optane-memory-business
- Embedded & Emerging Memory Technology Roadmap, TechInsights — https://www.techinsights.com/blog/t1-2024-emerging-and-embedded-memory-briefing
Tóm tắt một câu: Các bộ nhớ không bay hơi thế hệ mới (STT-MRAM, PCM, ReRAM, FeRAM) hướng tới một lớp không bay hơi, truy cập theo byte (SCM) lấp đầy vách hiệu năng giữa DRAM và NAND, và bằng cách lưu thông tin trong một trạng thái vật lý thay vì điện tích, chúng có được tính không bay hơi một cách tự nhiên nhưng trả giá đắt cho độ tin cậy ghi — ở trung tâm dữ liệu chúng lan rộng qua gộp bộ nhớ dựa trên CXL sau khi Optane rút lui, ở nhúng qua eMRAM và eReRAM, mỗi loại trong ngách riêng, và lựa chọn phải được quyết định bởi bối cảnh ứng dụng và hệ sinh thái, không phải hiệu năng phần tử.