会期:2026-08-23~25(Stanford + Online)· 分析日期:2026-08-25


这届 Hot Chips 是"HBM 撞墙年":三家 DRAM 原厂在同一场会上分别用 Z 高度(775μm)、pJ/bit(2.4)、带宽增速(<2× / 2 年)三个不同口径承认 HBM 的物理天花板已经可见,并各自给出绕道方案(SK hynix 混合键合延后、三星 ZHBM 去 interposer、Micron 工作负载定制化);同时两家挑战者(d-Matrix 3D-DRAM、HBF 阵营)把"decode 阶段的 HBM 不可行性"第一次量化。HBM 的定价权在 2027 之前更强(撞墙 = 供给更难放)、在 2029 之后更弱(三条替代路线同时瞄准 decode/attention)。


1. Jim Handy(Objective Analysis)— 周期不是周期,是产能物理

2. Micron(Ragu,HBM 设计架构)— HBM 是可靠性负债

3. Samsung(Sanghan)— 三阶段把 base die 变成 AI 平台

三星是本届在 custom HBM 上最激进的一家,路线图给了可量化的三段:

阶段内容关键数字
1memory controller 从 XPU 搬进 custom base die释放 XPU 5-10% 面积 → 性能 +10-20%;base die 用三星 4nm
2用 base die 边缘未用区域接第二层内存(LPDDR 甚至 HBF),专用控制器+PHY比 PCIe 扩展延迟更低、带宽更高
3ZHBM:去掉 2.5D interposer,HBM 直接垂直堆在 XPU 上,<6μm 混合铜键合0.5 pJ/bit、DRAM 功耗 -70%、带宽 +2.3×、绝对功耗省 >100W(可回拨给 GPU 计算);热限制约 4 层(非 12/16 层)

工程解读三点:

4. SK hynix(Jasik Lee)— 775μm 天花板

5. d-Matrix Raptor(Meta 合著)— 用 6.5× 能效差挑战 HBM 的 decode 场景

指标RaptorHBM4 对照
数据搬运能效0.37 pJ/bit(实测)2.4 pJ/bit(仅搬进 base die)
带宽100 TB/s(单层堆叠)—
全带宽 I/O 功耗~300W按 HBM 现值做到 100 TB/s 仅搬运需 ~2 kW
容量密度约 HBM4 的 1/2(大部分归因于用了较落后 DRAM 工艺)—
单卡容量(X 补充)32GBRubin 288GB / MI455X 432GB
结构TSMC 4nm compute die 与定制 DRAM 面对面堆叠,36μm 间距,bank 与计算引擎物理对齐2.5D interposer 侧向
热DRAM 设计工作温度 105°C、刷新频率 8× 标准 DRAM、刷新只损 1.37% 带宽;备用 bank 8-9%;4 层堆在 >1.3 W/mm² GPU 上会超 140°C—
系统约 72 卡机架可装 Kimi K3 级(近 3T 参数 ≈ 3TB 权重 + 长上下文额外 1TB KV);GLM 5.2 3000 tok/s/user,更大模型 988 tok/s—

工程含义:

6. HBF 的第三方否证(Oxmiq Labs + Praxmudi)— 本届最重要的反共识

在成本对等的 72 加速器机架上建模:

X 侧官方补充:HBF 首代 512GB/stack(8/16-Hi)、读带宽 约 1.6 TB/s、HBM-like 封装 + UCIe 接口、OCP 标准化(Google、Tenstorrent 参与)、memory sample 2H2026 / product sample 2027 / 商用普遍指向 2028+。

7-9. RISC-V 三连(RISC-V Intl+SiFive / Canonical / NVIDIA)+ Infineon


#Hot Chips / X 数字Substrate 已有数字差值 / 新增信息定价状态Conviction
1HBM 封装厚度 720μm(HBM3E) → 775μm(HBM4),SK hynix 称接近实际极限供需底稿 H.5 只有带宽/容量/层数,无 Z 高度约束首次出现"容量增长的物理硬上限"未定价8/10
2混合键合不会用于 HBM4E,推迟到 HBM5;约 20 层才划算供需底稿 H.4 [R]:Hybrid Bonding 设备交期 10-12 个月(隐含 2027 上机)HB 上量时点后移约一代(1-1.5 年)未定价7/10
316-Hi 需 die 再薄 10% + gap 缩 50%(cube 720→775μm)无新增 16-Hi 良率与翘曲约束未定价7/10
420 层混合键合:die 可厚 +20~24%、导热 +35%(另处 >30%)无量化 HB 的真实收益门槛部分定价6/10
5HBM 每 wafer GB ≈ DDR 的 1/3;HBM3E 同 bit 硅面积 3× DDR5,且比例未改善、可能恶化供需底稿 H.5 [B]:单 bit 约 3× wafer;HBM 占 DRAM wafer 产出 23%→2028 34%3× 被官方确认(已定价),但"恶化"方向未定价已定价 + 未定价(恶化)8/10
64×12-Hi 封装内存储硅面积 = GPU die 8×,约 90% 封装硅片为存储无量化新增 SiP 内价值量分配尺子未定价6/10
7Llama 3 约 17% 非计划训练中断归因 HBM无RAS 升级为一等架构约束未定价7/10
8HBM4:每 die 256 banks(vs 128)、I/O 1000→2000、>2.8 TB/s·>24GB/stack;SK hynix 量产 48GB 12-Hi @ >2 TB/s、>20K TSV、16,148 micro-bump供需底稿 H.5:HBM4 2048-bit / 2 TB/s per stack带宽口径 2.0 → >2.8 TB/s(+40%)需仲裁;48GB 12-Hi 是新的容量锚部分定价8/10
9ZHBM:0.5 pJ/bit、DRAM 功耗 -70%、带宽 +2.3×、省 >100W、热限约 4 层、<6μm 混合铜键合、去掉 2.5D interposer供需底稿 H.4 CoWoS 主表假设 interposer 路线延续;无 ZHBM 条目新增 CoWoS 长期叙事的远期证伪路径未定价6/10
10memory controller 移入 base die → 释放 XPU 5-10% 面积、性能 +10-20%;base die 用三星 4nm;"多数客户在积极探索"供需底稿 H.5 [R]:"main die 控制逻辑移到 base die,base die 上 3nm/5nm"[R] → [O] 升级 + 首次量化面积/性能部分定价8/10
11HBF 首代 512GB/stack、约 1.6 TB/s、UCIe 接口、OCP 标准化;memory sample 2H26 / product sample 2027 / 商用 2028+供需底稿 H.13 [R]:NBM 初始覆盖约 1/3 NAND 产能规划、目标 50%、长期 70%首次有官方 spec 与时间表;与"1/3 产能给 NBM"存在明显时间错配未定价(负面)8/10
12等成本 72 卡机架:全 HBF 容量 14×、带宽 0.6×;$/1M decode token HBM 优 6-8×;同价 HBF 容量 8-16× 但每 GB 带宽 -25×无第三方否证;市场把 HBF 当"NAND 的 HBM 时刻"首个独立量化否证未定价8/10
131M 上下文存储需求 约 600GB → 约 2.6TB内部底稿 §5.1:MoE 把 KV/token 压到 0.14× → offload TAM 缩 30-50%方向相反的硬证据:架构压缩单 token,但 context 与 agentic 多轮把绝对量拉回来未定价(需修正 v1 措辞)7/10
14Raptor:0.37 pJ/bit vs HBM4 2.4 pJ/bit(6-7×)、100 TB/s、32GB/卡、I/O 300W、密度 = HBM4 1/2、105°C / 8× refresh / 仅损 1.37% 带宽、备用 bank 8-9%、72 卡装 3T 参数、GLM 5.2 3000 / 988 tok/s无全新路线,全部数字新增未定价6/10
15按当前 HBM pJ/bit,做到 100 TB/s 仅数据搬运需约 2 kW无HBM 在 decode 场景的物理不可行边界未定价7/10
16Micron memory wall:compute 每 2 年 3×,HBM 带宽 <2×,差距每 2 年扩 1.5×无HBM 定价权的物理基础,也是三条替代路线的共同 TAM 来源部分定价7/10
17Rubin:336B 晶体管、288GB HBM4 @ 22 TB/s、50 PF NVFP4 推理 / 35 PF 训练、NVLink6 3.6 TB/s;100MW AI factory 2 ZFLOPS 推理 / 1.4 ZFLOPS 训练、11 PB HBM4、800 PB/s;散热参考设计把冷却功耗占比 40%→10%供需底稿 H.2/H.5 有出货与 HBM Gb 需求,无单卡/机架 spec;H.9 有 Rubin D-Day补齐单卡/机架级口径;冷却占比 40%→10% 是液冷链新数字已定价(主体)8/10
18AMD MI455X 首现 block diagram(I/O die 分离);单卡 432GB HBM4 @ 19.6-23.3 TB/s;Helios 72 GPU:2.9 EF FP4、31TB HBM4、260 TB/s UALink + 43 TB/s Ultra Ethernet;H2 2026 样片供需底稿 H.5:MI400 单卡 432GB / 19.6 TB/s、830mn Gb HBM4;H.9:2027H1 MI400 ramp、CoWoS +308%完全对齐,带宽上限上修至 23.3 TB/s已定价9/10
19Maia 200:3nm、216GB HBM3e @ 7 TB/s、>10 PF FP4、750W供需底稿 H.9:Maia 300(MRVL、CoWoS-L 50k、2nm、2027);H.5:Maia 300 用 HBM4补上前代 Maia 200 = HBM3e,与 Maia 300 = HBM4 不冲突部分定价7/10
20SK hynix 首次公开评估 Intel EMIB vs CoWoS供需底稿 H.9:TPU v9 HumuFish 用 Intel EMIB-T,Intel foundry 分食 400k 颗「Intel 先进封装成为 CoWoS 第二供应」从单点变双独立证据未定价6/10
21NVIDIA 实验室 ≥3 款 RVA23;SiFive BigSky SF-2U870 现场跑通 CUDA(首次公开演示);C2C 约 5× PCIe;CUDA 额外要求仅约 2 页(PCIe 一致性 + P2P)内部底稿 §CPU:ARM 进入商用服务器、"ARM AGI CPU 正面冲击 x86"CUDA 主机侧从"ARM 独占"变ARM + RISC-V 双轨未定价6/10
22Ubuntu 25.10 重建 约 30,000 包,26.04 LTS 以 RVA23 为官方基线;Debian 可用度 约 95%;矩阵扩展 12-18 个月内批准无RISC-V 生态成熟度的可验证时间锚未定价7/10
23Arm AGI:dual chiplet 共 约 136 Neoverse V3 核、TSMC N3P、>50B 晶体管/chiplet、12ch DDR5-8800 = 845 GB/s内部底稿 §CPU 有叙事无 spec补齐 spec部分定价8/10
24Intel Diamond Rapids:256 核、1.28GB LLC、16ch DDR5-12800、128 lanes Gen6 + CXL3.0、18A-P + Foveros Direct + UCIe-S,2027无新增 x86 反击时间锚部分定价7/10

结论 1 · 2027 之前 HBM 定价权比共识更强(撞墙 = 供给更难放)

775μm 硬上限 + 16-Hi 需再薄 10% / gap 缩 50% + 混合键合推迟到 HBM5,三件事叠加的含义是:2027-2028 的 HBM 容量增长几乎只能靠 DRAM 制程节点(1C/1γ)而非堆更多层。这与 供需底稿 里 [R] "1B→1C 理论 +30% bit、1C 良率当前 60%、年底目标 80%" 是同一条链的两端。

结论 2 · Custom HBM 是 memory ASP 上移的真机制,三星是最激进的一家

controller 搬进 base die 释放 XPU 5-10% 面积、换来 10-20% 性能,且"多数客户在积极探索" + base die 必须迁到先进逻辑工艺 → HBM 从 commodity 变成 ASIC-like 协同设计件。

结论 3 · HBF 叙事被第三方工程级否证,是本届最干净的做空/规避论据

6-8× 每 token 成本劣势 + 每 GB 带宽 -25× + MoE 缓存策略在中等 batch 失效 + vLLM 需要新 allocator + 耐久性/保持/功耗均未定义 + 结果来自分析模拟而非实测硅 + 商用 2028+。

结论 4 · decode/attention 是新的开放战场,HBM 护城河集中在训练与 prefill

"按当前 HBM pJ/bit,100 TB/s 仅搬运需约 2kW" + Raptor 实测 0.37 vs 2.4 pJ/bit(6.5×)+ 三星要把 attention 搬进 base die + SK hynix 明说训练/推理内存架构可能分岔 —— 四个独立信源指向同一件事。

结论 5 · CUDA 主机侧从 ARM 独占变双轨,是 ARM 叙事里未定价的远期折价项

NVIDIA 实验室 ≥3 款 RVA23、CUDA on RISC-V 现场首演、CUDA 额外要求仅约两页、NVLink Fusion 开放给 RISC-V 主机、Ubuntu 26.04 LTS 把 RVA23 定为官方基线、矩阵扩展 12-18 个月批准。

交易日历(会后 T+N)

检查点要看什么
T+1~T+5存储三家、SNDK、AMD、ARM、INTC 的会后反应方式(是否对 HBF 否证钝化 = 二阶信号)
2026-09-28 SNIA SDCKV cache / DiskANN / 多层池化内存标准化进度;HBF 在 SDC 是否有更新 spec
2026-10-12 OCP Global SummitHBF 的 OCP 标准化实质进展(Google / Tenstorrent 参与度);1MW 机架 / 800V DC / CPO
2026Q4 财报季任一原厂给出 16-Hi HBM4 良率或 20-Hi 时间表;三星 custom base die 客户名
2027 GTCRubin Ultra HBM 配置(供需底稿 里 [R] 有 8-Hi 192GB 与多 SKU 分层两个冲突口径,需仲裁)

一手会议内容:用户上传 Hot Chips 2026 长图 PDF 全文 OCR(`HotChips2026_OCR_full.md`)

X / 公开来源([O] 官方一手):