High Bandwidth Flash (高頻寬快閃記憶體)
定義
- 高頻寬快閃記憶體:為面向 AI 加速器的高頻寬 NAND Flash,透過 高平行度、先進封裝 提高傳輸效能。
- HBF 不取代 HBM:HBM 負責 最高頻寬、最低延遲 的熱資料,HBF 承接 大量、讀取密集 且不需要 DRAM 級延遲的資料。
- AI 推論是主要場景:大型 LLM,尤其 MoE (Mixture of Experts),模型權重快速膨脹,使單靠 HBM 提供容量的 成本、封裝壓力 愈來愈高。
HBM 容量成為 AI 瓶頸
- 模型成長快於 HBM 容量:大型模型權重可能遠超過 GPU 周邊 HBM 可容納的範圍。
- HBM 擴容成本高昂:增加 HBM 不只提高記憶體成本,也受限於 封裝面積、供應、功耗。
- HBF 以容量換取成本效率:將不需要 HBM 級延遲的大量資料移至 NAND,使昂貴 HBM 集中服務即時計算。
技術定位
- 容量瞄準 HBM 10 倍級:SK hynix 簡報提出 10× HBM Capacity 的設計目標,強調以大容量補足 HBM 的限制。
- 頻寬進入 TB/s 等級:透過 大量 NAND Die 平行存取、3D 堆疊、高速互連,將 Flash 頻寬提升至接近記憶體,而非傳統儲存裝置的層級。
- 延遲瞄準 5 μs 以下:效能仍慢於 DRAM、HBM,但大幅縮短傳統 SSD 經由 儲存協定、I/O 路徑 產生的延遲。
- 標準規格最高 3 TB/s:2026 年公布的初期 HBF 規格涵蓋不同效能等級,最高頻寬 3 TB/s。
- 10×、TB/s、< 5 μs 屬設計目標:簡報中的數字應視為 SK hynix 對 HBF 的 技術目標、產品定位,不代表所有量產 HBF 都固定具有相同規格。
- 單顆容量最高 512 GB:初期規格涵蓋 8-High、16-High NAND 堆疊,容量最高可達 512 GB。
- UCIe 強化 xPU 互連:HBF 可透過 UCIe (Universal Chiplet Interconnect Express) 等高速介面靠近 GPU、NPU、ASIC 等 xPU。
- xPU:泛指各類處理器,xPU 不是特定晶片架構,而是 CPU、GPU、NPU、TPU、DPU 等 Processing Unit 的統稱,常用於描述異質運算 (Heterogeneous Computing)。
AI 推論特別適合 HBF
- 模型權重容量巨大:LLM、MoE 需要大量讀取模型參數,但推論期間權重本身通常不頻繁修改。
- KV Cache 可移往容量層:部分 Pre-computed KV Cache 可存放於 HBF,降低全部常駐 HBM 的容量需求。
- RAG 需要大量近端資料:RAG (Retrieval-Augmented Generation) 涉及大量讀取型資料,也符合 HBF 大容量、高讀取頻寬 的定位。
- NAND 寫入劣勢被弱化:AI 推論多數相關資料屬於 Read-intensive Workload,因此 NAND 寫入速度、耐久度限制 相對不重要。
記憶體階層
- HBM 留給最熱資料:正在參與即時計算、需要最低延遲、最高頻寬 的資料優先常駐 HBM。
- HBF 承接大容量資料:模型權重、部分 KV Cache、讀取密集資料 放在靠近 xPU 的 HBF。
- SSD 留給更冷的資料:資料集、Checkpoint、不需要即時高速存取的內容 仍由 SSD 儲存。
xPU (GPU / NPU / ASIC)
│
├─ HBM
│ 最高頻寬
│ 最低延遲
│ 容量較小、成本最高
│
├─ HBF
│ TB/s 級頻寬
│ μs 級延遲
│ 大容量、成本較低
│
└─ SSD
容量最大
延遲最高
單位容量成本最低
HBM、HBF、SSD 分工
| 項目 |
HBM |
HBF |
SSD |
| 儲存媒介 |
DRAM |
NAND Flash |
NAND Flash |
| 頻寬 |
最高 |
高 |
較低 |
| 延遲 |
最低 |
μs 級 |
最高 |
| 容量 |
較小 |
大 |
最大 |
| 單位容量成本 |
最高 |
中間 |
最低 |
| 主要定位 |
即時計算、熱資料 |
模型權重、讀取密集資料 |
資料集、Checkpoint、冷資料 |
產業意義
- Memory Tiering 重新分工:AI 記憶體架構可能由「HBM → SSD」演變為「HBM → HBF → SSD」的三層架構。
- HBM 不再負責純容量:系統不必為了容納大量模型權重而無限制堆疊昂貴 HBM。
- NAND 進入 AI 運算層:HBF 讓 NAND 從傳統儲存裝置進一步靠近 GPU、ASIC 等運算晶片,提升 NAND 在 AI 系統中的價值。
- 系統最佳化取代單一記憶體最佳化:HBF 的核心不是追上 HBM,而在 容量、頻寬、延遲、成本 之間重新取得平衡。