会期:2026-08-23~25(Stanford + Online)· 分析日期:2026-08-25
一句话定位
这届 Hot Chips 是"HBM 撞墙年":三家 DRAM 原厂在同一场会上分别用 Z 高度(775μm)、pJ/bit(2.4)、带宽增速(<2× / 2 年)三个不同口径承认 HBM 的物理天花板已经可见,并各自给出绕道方案(SK hynix 混合键合延后、三星 ZHBM 去 interposer、Micron 工作负载定制化);同时两家挑战者(d-Matrix 3D-DRAM、HBF 阵营)把"decode 阶段的 HBM 不可行性"第一次量化。HBM 的定价权在 2027 之前更强(撞墙 = 供给更难放)、在 2029 之后更弱(三条替代路线同时瞄准 decode/attention)。
工程级深读(9 场演讲的投资翻译)
1. Jim Handy(Objective Analysis)— 周期不是周期,是产能物理
- HBM 每晶圆 GB ≈ 标准 DDR 的 1/3,且 DRAM 厂十年未做大规模产能扩充(靠制程微缩满足 bit 增长),新厂即使激进也要约 2 年 → 这不是"周期性缺货",是产能弹性结构性缺失。与 供需底稿 的「2026 DRAM 供给仅 +16%、低于历史 20-30%」互为因果。
- Jevons 反驳(最被低估的一段):算法效率提升 6× 的结果是产出 6×,不是 capex 降 6×。「效率改变的是 AI 基础设施的生产力,而不一定减少其上的资金投入」。→ 每一次"新模型效率突破"引发的算力/存储链 risk-off,都应被当作结构性 mispricing 窗口处理,而不是叙事翻转。这一条可以直接进 asymmetry-radar 的规则库。
- META 的 QLC SSD 夹层 → HDD 短缺 → QLC 以高得多的成本顶替拿不到的 HDD:证实我们 内部底稿 §存储「eSSD 替代 HDD 加速、价格弹性极端压缩」,并给出机制链条(不是需求驱动替代,是供给不可得驱动替代)。点名受益:铠侠、闪迪。
- 第二道内存墙 = 成本墙(不只是带宽墙),因为内存本身变得极贵 → 这是 PIM / near-memory processing 从"技术玩具"变成"经济必需"的转折论证,也是后面三星 attention offload 与 d-Matrix Raptor 的共同市场基础。
- 软件是替代架构的最大障碍,以 Intel Optane 为反例 → 直接构成对 HBF 的看空论据(见第 6 节)。
2. Micron(Ragu,HBM 设计架构)— HBM 是可靠性负债
- HBM3E 同 bit 数硅面积 ≈ DDR5 的 3×,且"这一比例并未改善、随带宽增加可能进一步恶化"。这是官方口径首次给出方向性恶化,而 供需底稿 现有模型用的是固定 3×。若 HBM4/4E 的 wafer 倍数上行到 3.5-4×,同样 bit 需求下通用 DRAM 的挤出比现有模型更严重。
- 一个 4×12-Hi 的 GPU 封装里,存储硅面积 ≈ GPU die 的 8 倍,约 90% 的封装内硅片与存储相关;单颗 DRAM die 失效即可能废掉整个封装。
- Meta Llama 3 论文:约 17% 的非计划训练中断归因于 HBM。→ RAS 从"规格附注"变成"架构一等约束"。read-through:晶圆级/KGSD 测试与老化(AEHR、Advantest、Teradyne)、base die 上的 ECC/CRC 逻辑面积(吃先进逻辑 wafer)。
- 16-Hi 可行,20-Hi 之后不明朗;限制不是信号距离(整堆仍 <1mm),而是 TSV 密度 / 功率密度 / 热 / 机械完整性 / 良率五重叠加。
- 带宽机制:HBM4 每 die 256 banks(HBM3E 128)、外部 I/O 约 1000 → 2000 条,在几乎相同的封装边界内。HBM1 128 GB/s·1GB → HBM4 >2.8 TB/s·>24GB/stack。注意这个 >2.8 TB/s 高于我们 供需底稿 H.5 记的 2 TB/s(SK hynix 现场官方口径也是 >2 TB/s,48GB 12-Hi)→ 口径需仲裁(2 TB/s 是 JEDEC 基线,2.8 TB/s 是 pin speed 上限外推)。
- HBM 将走向工作负载定制化(不同 bank 结构/通道数/访问粒度/带宽-容量配比)→ HBM 从 commodity 向 ASIC-like 迁移的第一条官方表述。
- 封装从微凸块+热压键合 → 单微米级熔融/混合键合。
3. Samsung(Sanghan)— 三阶段把 base die 变成 AI 平台
三星是本届在 custom HBM 上最激进的一家,路线图给了可量化的三段:
| 阶段 | 内容 | 关键数字 |
|---|---|---|
| 1 | memory controller 从 XPU 搬进 custom base die | 释放 XPU 5-10% 面积 → 性能 +10-20%;base die 用三星 4nm |
| 2 | 用 base die 边缘未用区域接第二层内存(LPDDR 甚至 HBF),专用控制器+PHY | 比 PCIe 扩展延迟更低、带宽更高 |
| 3 | ZHBM:去掉 2.5D interposer,HBM 直接垂直堆在 XPU 上,<6μm 混合铜键合 | 0.5 pJ/bit、DRAM 功耗 -70%、带宽 +2.3×、绝对功耗省 >100W(可回拨给 GPU 计算);热限制约 4 层(非 12/16 层) |
工程解读三点:
- "大多数客户正在积极探索"把 controller 搬进 HBM → 这是 HBM ASP/毛利结构上移的真正机制(不是简单涨价),也把 memory 厂与 XPU 厂的绑定从"供货"升级为"协同设计"。供需底稿 里这条原本只是 [R]("main die 控制逻辑移到 base die"),现在升级为 [O] 并首次量化。
- 注意力机制是三星要搬进 HBM 的第一个计算块,prefill 与 FFN 留在 XPU。这是 PIM 商业化路径第一次被收窄到具体算子,而且正好和 d-Matrix、HBF 抢同一块地(decode/attention)。
- 三星明确不选 UCIe(体积大、功耗高),偏好专有 HBM 供应商接口;其热路径模块可把峰值温度降 >35%。→ 对 UCIe 生态(含 HBF 用 UCIe 的选择)是一个负面 datapoint。
- base die 必须迁到先进逻辑工艺,否则 HBM4 翻倍 I/O 后 base die 功耗会超过 DRAM core stack 本身。→ HBM 增长会新增先进逻辑 wafer 需求(TSMC / 三星 foundry),这条几乎没被卖方模型计入。
4. SK hynix(Jasik Lee)— 775μm 天花板
- 标准 HBM 厚度 HBM3E ≈ 720μm → HBM4 ≈ 775μm,SK hynix 称已接近当前封装方案的实际极限。16-Hi HBM3E 测试载体:cube 720→775μm 的同时,单 die 仍要比 12-Hi 薄约 10%、die 间 gap 缩小约 50%。
- 混合键合要到约 20 层才更划算(die 可厚 20-24%、导热 +35%),而且 Lee 预期 HBM4E 不会采用混合键合(X 侧多个信源与 Tom's Hardware 同日确认,HB 推至 HBM5)。
- 现行 MR-MUF/模塑工艺:整堆一次回流 + 模塑填隙,生产率高但更怕翘曲(单 die 可薄至约 50μm)。热点问题混合键合解决不了 → 开发 IHBM(热点上方加硅散热块),必须从设计初期协同。
- 训练与推理内存架构可能分岔:训练要带宽+容量双升(支持继续堆高),推理可能用较小容量的超高带宽池 + LPDDR/低成本层承接带宽不敏感数据。
- interposer 布线层数本身也可能成为下一个扩展限制(金属层更厚,加层显著改变晶圆厚度与机械行为)。
- X 侧补充 [O]:SK hynix 首次公开评估 Intel EMIB vs CoWoS 的机械/热应力差异。
5. d-Matrix Raptor(Meta 合著)— 用 6.5× 能效差挑战 HBM 的 decode 场景
| 指标 | Raptor | HBM4 对照 |
|---|---|---|
| 数据搬运能效 | 0.37 pJ/bit(实测) | 2.4 pJ/bit(仅搬进 base die) |
| 带宽 | 100 TB/s(单层堆叠) | — |
| 全带宽 I/O 功耗 | ~300W | 按 HBM 现值做到 100 TB/s 仅搬运需 ~2 kW |
| 容量密度 | 约 HBM4 的 1/2(大部分归因于用了较落后 DRAM 工艺) | — |
| 单卡容量(X 补充) | 32GB | Rubin 288GB / MI455X 432GB |
| 结构 | TSMC 4nm compute die 与定制 DRAM 面对面堆叠,36μm 间距,bank 与计算引擎物理对齐 | 2.5D interposer 侧向 |
| 热 | DRAM 设计工作温度 105°C、刷新频率 8× 标准 DRAM、刷新只损 1.37% 带宽;备用 bank 8-9%;4 层堆在 >1.3 W/mm² GPU 上会超 140°C | — |
| 系统 | 约 72 卡机架可装 Kimi K3 级(近 3T 参数 ≈ 3TB 权重 + 长上下文额外 1TB KV);GLM 5.2 3000 tok/s/user,更大模型 988 tok/s | — |
工程含义:
- "按当前 HBM 每比特能耗,100 TB/s 仅内存搬运就要约 2kW" —— 这一句是本届最有杀伤力的数字。它意味着 HBM 在 decode 阶段存在物理不可行区间,HBM 的护城河集中在训练与 prefill。
- Raptor 单卡 32GB vs Rubin 288GB 差一个数量级 → 这条路线用 scale-up 网络换内存容量。若这类架构放量,边际受益方是 scale-up 互联(NVLink/UALink/以太网 scale-up、retimer/switch:ALAB、MRVL、AVGO),而不是 HBM。
- 它用的是定制 DRAM 而非 HBM,仍吃 DRAM 晶圆 → 对 wafer 紧张没有缓解作用,只是把价值从 HBM 封装转移到 DRAM 裸片 + 先进逻辑。
6. HBF 的第三方否证(Oxmiq Labs + Praxmudi)— 本届最重要的反共识
在成本对等的 72 加速器机架上建模:
- 全 HBF 方案:容量 约 14×,带宽 约 0.6×;按 $/百万 decode token,HBM 在整条机架级曲线上优 6-8×。
- HBF 是容量层不是带宽层:同价约 8-16× 容量,但每 GB 带宽约降 25×(二级 HBF)→ 简单的 $/GB 对比在推理场景具有误导性。
- 1M 上下文的存储需求从约 600GB 涨到约 2.6TB;HBF 容量够,带宽在目标 batch 与交互性下不够。
- 混合 HBM/HBF 缓存热冷专家的策略在中等 batch 下失效:每次查询激活不同专家,系统可能迅速读掉一半以上模型,HBM 缓存价值大打折扣。
- 软件障碍大于硬件:峰值读要跨通道 ≥64KB 访问、写 1MB 粒度;不是 DRAM 的 drop-in,vLLM 类框架需要新的 allocator 与传输调度;保留/生命周期要软件自己管。
- 耐久性、数据保持维护窗口、能效均未在规范中定义;结果来自分析模拟,不是实测硅片。
- HBF 真正胜出的窄区间:万亿参数 + 短上下文 + 低 batch,单个 HBF 加速器就能装下(HBM 方案需多卡);以及稀疏注意力(大 KV、每 token 只读 top-K 子集)——但 top-K 是分散读,闪存偏好大块顺序,需要重排数据布局。
X 侧官方补充:HBF 首代 512GB/stack(8/16-Hi)、读带宽 约 1.6 TB/s、HBM-like 封装 + UCIe 接口、OCP 标准化(Google、Tenstorrent 参与)、memory sample 2H2026 / product sample 2027 / 商用普遍指向 2028+。
7-9. RISC-V 三连(RISC-V Intl+SiFive / Canonical / NVIDIA)+ Infineon
- RVA23 成为可编译的统一基线:向量与虚拟化强制;服务器平台规范覆盖 UEFI/ACPI/IOMMU/中断,目标是"下载标准 Linux 发行版直接启动"。多家厂商今年出 RVA23 服务器级芯片。四种 AI 矩阵扩展方案预计 12-18 个月内完成批准。安全侧 RISC-V Worlds 支持多个互不信任域(强于 TrustZone 二分)。
- Canonical:Ubuntu 25.10 针对 RVA23 重建约 30,000 个包,26.04 LTS 正式把 RVA23 定为官方 RISC-V 基线;Debian 归档可用度约 95%,剩余差距主要是模拟构建导致的测试超时(正在自建原生 RISC-V 构建集群);下一层是 Kubernetes / MicroCloud / OpenStack。
- NVIDIA(最关键):实验室已有至少 3 款 RVA23 处理器;SiFive 在会场做了 CUDA on RISC-V 的首次公开演示(X 侧确认平台为 BigSky SF-2U870:32× P870-D @2.0GHz、256GB DDR5-5600、4× PCIe Gen5 x16,可作 NVIDIA GPU 的 LLM head node,未来接 NVLink Fusion)。CUDA 在 RVA23 之外的额外硬件要求仅约两页(核心是 PCIe 缓存一致性 + PCIe peer-to-peer)。NVLink Fusion 的 C2C 提供约 5× PCIe 带宽与一致性。NVIDIA 明说 RISC-V 的吸引力是定制化,不是 x86/ARM 不行。
- Infineon:RVA23 适合中央车载计算机,但区域控制器需要的 RVM(MCU 配置文件)尚未定案;瓶颈在合格编译器 / WCET 时序分析 / 安全认证工具链。→ 汽车 RISC-V 是 2029+ 故事,不构成当期交易。
数字级预期差对比(24 条,其中 14 条"未定价")
| # | Hot Chips / X 数字 | Substrate 已有数字 | 差值 / 新增信息 | 定价状态 | Conviction |
|---|---|---|---|---|---|
| 1 | HBM 封装厚度 720μm(HBM3E) → 775μm(HBM4),SK hynix 称接近实际极限 | 供需底稿 H.5 只有带宽/容量/层数,无 Z 高度约束 | 首次出现"容量增长的物理硬上限" | 未定价 | 8/10 |
| 2 | 混合键合不会用于 HBM4E,推迟到 HBM5;约 20 层才划算 | 供需底稿 H.4 [R]:Hybrid Bonding 设备交期 10-12 个月(隐含 2027 上机) | HB 上量时点后移约一代(1-1.5 年) | 未定价 | 7/10 |
| 3 | 16-Hi 需 die 再薄 10% + gap 缩 50%(cube 720→775μm) | 无 | 新增 16-Hi 良率与翘曲约束 | 未定价 | 7/10 |
| 4 | 20 层混合键合:die 可厚 +20~24%、导热 +35%(另处 >30%) | 无 | 量化 HB 的真实收益门槛 | 部分定价 | 6/10 |
| 5 | HBM 每 wafer GB ≈ DDR 的 1/3;HBM3E 同 bit 硅面积 3× DDR5,且比例未改善、可能恶化 | 供需底稿 H.5 [B]:单 bit 约 3× wafer;HBM 占 DRAM wafer 产出 23%→2028 34% | 3× 被官方确认(已定价),但"恶化"方向未定价 | 已定价 + 未定价(恶化) | 8/10 |
| 6 | 4×12-Hi 封装内存储硅面积 = GPU die 8×,约 90% 封装硅片为存储 | 无量化 | 新增 SiP 内价值量分配尺子 | 未定价 | 6/10 |
| 7 | Llama 3 约 17% 非计划训练中断归因 HBM | 无 | RAS 升级为一等架构约束 | 未定价 | 7/10 |
| 8 | HBM4:每 die 256 banks(vs 128)、I/O 1000→2000、>2.8 TB/s·>24GB/stack;SK hynix 量产 48GB 12-Hi @ >2 TB/s、>20K TSV、16,148 micro-bump | 供需底稿 H.5:HBM4 2048-bit / 2 TB/s per stack | 带宽口径 2.0 → >2.8 TB/s(+40%)需仲裁;48GB 12-Hi 是新的容量锚 | 部分定价 | 8/10 |
| 9 | ZHBM:0.5 pJ/bit、DRAM 功耗 -70%、带宽 +2.3×、省 >100W、热限约 4 层、<6μm 混合铜键合、去掉 2.5D interposer | 供需底稿 H.4 CoWoS 主表假设 interposer 路线延续;无 ZHBM 条目 | 新增 CoWoS 长期叙事的远期证伪路径 | 未定价 | 6/10 |
| 10 | memory controller 移入 base die → 释放 XPU 5-10% 面积、性能 +10-20%;base die 用三星 4nm;"多数客户在积极探索" | 供需底稿 H.5 [R]:"main die 控制逻辑移到 base die,base die 上 3nm/5nm" | [R] → [O] 升级 + 首次量化面积/性能 | 部分定价 | 8/10 |
| 11 | HBF 首代 512GB/stack、约 1.6 TB/s、UCIe 接口、OCP 标准化;memory sample 2H26 / product sample 2027 / 商用 2028+ | 供需底稿 H.13 [R]:NBM 初始覆盖约 1/3 NAND 产能规划、目标 50%、长期 70% | 首次有官方 spec 与时间表;与"1/3 产能给 NBM"存在明显时间错配 | 未定价(负面) | 8/10 |
| 12 | 等成本 72 卡机架:全 HBF 容量 14×、带宽 0.6×;$/1M decode token HBM 优 6-8×;同价 HBF 容量 8-16× 但每 GB 带宽 -25× | 无第三方否证;市场把 HBF 当"NAND 的 HBM 时刻" | 首个独立量化否证 | 未定价 | 8/10 |
| 13 | 1M 上下文存储需求 约 600GB → 约 2.6TB | 内部底稿 §5.1:MoE 把 KV/token 压到 0.14× → offload TAM 缩 30-50% | 方向相反的硬证据:架构压缩单 token,但 context 与 agentic 多轮把绝对量拉回来 | 未定价(需修正 v1 措辞) | 7/10 |
| 14 | Raptor:0.37 pJ/bit vs HBM4 2.4 pJ/bit(6-7×)、100 TB/s、32GB/卡、I/O 300W、密度 = HBM4 1/2、105°C / 8× refresh / 仅损 1.37% 带宽、备用 bank 8-9%、72 卡装 3T 参数、GLM 5.2 3000 / 988 tok/s | 无 | 全新路线,全部数字新增 | 未定价 | 6/10 |
| 15 | 按当前 HBM pJ/bit,做到 100 TB/s 仅数据搬运需约 2 kW | 无 | HBM 在 decode 场景的物理不可行边界 | 未定价 | 7/10 |
| 16 | Micron memory wall:compute 每 2 年 3×,HBM 带宽 <2×,差距每 2 年扩 1.5× | 无 | HBM 定价权的物理基础,也是三条替代路线的共同 TAM 来源 | 部分定价 | 7/10 |
| 17 | Rubin:336B 晶体管、288GB HBM4 @ 22 TB/s、50 PF NVFP4 推理 / 35 PF 训练、NVLink6 3.6 TB/s;100MW AI factory 2 ZFLOPS 推理 / 1.4 ZFLOPS 训练、11 PB HBM4、800 PB/s;散热参考设计把冷却功耗占比 40%→10% | 供需底稿 H.2/H.5 有出货与 HBM Gb 需求,无单卡/机架 spec;H.9 有 Rubin D-Day | 补齐单卡/机架级口径;冷却占比 40%→10% 是液冷链新数字 | 已定价(主体) | 8/10 |
| 18 | AMD MI455X 首现 block diagram(I/O die 分离);单卡 432GB HBM4 @ 19.6-23.3 TB/s;Helios 72 GPU:2.9 EF FP4、31TB HBM4、260 TB/s UALink + 43 TB/s Ultra Ethernet;H2 2026 样片 | 供需底稿 H.5:MI400 单卡 432GB / 19.6 TB/s、830mn Gb HBM4;H.9:2027H1 MI400 ramp、CoWoS +308% | 完全对齐,带宽上限上修至 23.3 TB/s | 已定价 | 9/10 |
| 19 | Maia 200:3nm、216GB HBM3e @ 7 TB/s、>10 PF FP4、750W | 供需底稿 H.9:Maia 300(MRVL、CoWoS-L 50k、2nm、2027);H.5:Maia 300 用 HBM4 | 补上前代 Maia 200 = HBM3e,与 Maia 300 = HBM4 不冲突 | 部分定价 | 7/10 |
| 20 | SK hynix 首次公开评估 Intel EMIB vs CoWoS | 供需底稿 H.9:TPU v9 HumuFish 用 Intel EMIB-T,Intel foundry 分食 400k 颗 | 「Intel 先进封装成为 CoWoS 第二供应」从单点变双独立证据 | 未定价 | 6/10 |
| 21 | NVIDIA 实验室 ≥3 款 RVA23;SiFive BigSky SF-2U870 现场跑通 CUDA(首次公开演示);C2C 约 5× PCIe;CUDA 额外要求仅约 2 页(PCIe 一致性 + P2P) | 内部底稿 §CPU:ARM 进入商用服务器、"ARM AGI CPU 正面冲击 x86" | CUDA 主机侧从"ARM 独占"变ARM + RISC-V 双轨 | 未定价 | 6/10 |
| 22 | Ubuntu 25.10 重建 约 30,000 包,26.04 LTS 以 RVA23 为官方基线;Debian 可用度 约 95%;矩阵扩展 12-18 个月内批准 | 无 | RISC-V 生态成熟度的可验证时间锚 | 未定价 | 7/10 |
| 23 | Arm AGI:dual chiplet 共 约 136 Neoverse V3 核、TSMC N3P、>50B 晶体管/chiplet、12ch DDR5-8800 = 845 GB/s | 内部底稿 §CPU 有叙事无 spec | 补齐 spec | 部分定价 | 8/10 |
| 24 | Intel Diamond Rapids:256 核、1.28GB LLC、16ch DDR5-12800、128 lanes Gen6 + CXL3.0、18A-P + Foveros Direct + UCIe-S,2027 | 无 | 新增 x86 反击时间锚 | 部分定价 | 7/10 |
投资影响:五条可执行结论
结论 1 · 2027 之前 HBM 定价权比共识更强(撞墙 = 供给更难放)
775μm 硬上限 + 16-Hi 需再薄 10% / gap 缩 50% + 混合键合推迟到 HBM5,三件事叠加的含义是:2027-2028 的 HBM 容量增长几乎只能靠 DRAM 制程节点(1C/1γ)而非堆更多层。这与 供需底稿 里 [R] "1B→1C 理论 +30% bit、1C 良率当前 60%、年底目标 80%" 是同一条链的两端。
- 受益:制程节点领先且良率先跑通的一家吃掉份额边际(SK hynix、Micron 的 1γ 进度是唯一有效跟踪指标)
- 与共识差异:市场把"HBM4 → 16-Hi → 20-Hi"当线性路线图外推容量供给;现场官方口径是16 层之后路径不明
- 可证伪 KPI:任一原厂公布 16-Hi HBM4 量产良率 / 20-Hi 时间表;HBM4E 是否出现混合键合版本
结论 2 · Custom HBM 是 memory ASP 上移的真机制,三星是最激进的一家
controller 搬进 base die 释放 XPU 5-10% 面积、换来 10-20% 性能,且"多数客户在积极探索" + base die 必须迁到先进逻辑工艺 → HBM 从 commodity 变成 ASIC-like 协同设计件。
- 对三星:这是份额从 17% → mid-20% 之外的第二条修复路径(技术路线领先而非仅认证通过)。三星同时给了 ZHBM、controller 集成、attention offload、自家 4nm base die 四张牌,是本届内存三家中路线图最完整的。
- 对 Micron:现场只讲通用 HBM 架构、可靠性与堆叠极限,没有 custom base die 路线图与量化数字 → 登记为 unchecked dimension(custom HBM 时代的相对落后风险),不改 MU 现有 Tier 2。
- 隐含新需求:HBM base die 会新增先进逻辑 wafer 消耗(TSMC / 三星 foundry),这条几乎没进卖方 HBM 模型。
结论 3 · HBF 叙事被第三方工程级否证,是本届最干净的做空/规避论据
6-8× 每 token 成本劣势 + 每 GB 带宽 -25× + MoE 缓存策略在中等 batch 失效 + vLLM 需要新 allocator + 耐久性/保持/功耗均未定义 + 结果来自分析模拟而非实测硅 + 商用 2028+。
- 我们 内部底稿 里 SNDK/WDC NAND 部门本就是 Tier 3("High Cap QLC,Super High IOPS 弱"),本届把它从"判断"升级为"工程级证实"。
- 关键区分:HBF 对 NAND bit 需求是 2028+ 的远期期权,不是 2027 现金流。而 供需底稿 [R] 记的"NBM 初始覆盖约 1/3 NAND 产能规划"隐含的时间表明显早于官方 sample 2H26 / product 2027 / 商用 2028+ → 若有标的靠 HBF/NBM 叙事完成重估,这是过度定价窗口。
- 反向留意:HBF 真实 sweet spot 是"万亿参数 + 短上下文 + 低 batch + 单机箱"与稀疏注意力 → 边缘/私有/主权 AI 部署,不是 hyperscaler 机架。若行业出现"稀疏注意力成为主流架构"的信号,需要重估这条否证。
结论 4 · decode/attention 是新的开放战场,HBM 护城河集中在训练与 prefill
"按当前 HBM pJ/bit,100 TB/s 仅搬运需约 2kW" + Raptor 实测 0.37 vs 2.4 pJ/bit(6.5×)+ 三星要把 attention 搬进 base die + SK hynix 明说训练/推理内存架构可能分岔 —— 四个独立信源指向同一件事。
- 边际受益:scale-up 互联(这条路线用网络容量换内存容量:NVLink / UALink / 以太网 scale-up、retimer 与 switch → ALAB、MRVL、AVGO 边际正向)
- 边际受益:HBM 测试与老化(90% 封装硅片为存储 + 17% 训练中断归因 HBM → KGSD / 晶圆级老化需求强化,AEHR 逻辑与我们既有 thesis 一致)
- 远期风险登记(不改 base case):ZHBM 去 2.5D interposer 与 SK hynix 评估 Intel EMIB 是 CoWoS 长期独占叙事的两条独立证伪路径。ZHBM 热限只有 4 层(容量仅 HBM4 12/16-Hi 的 1/4-1/3),2029 之前不可能吃训练卡,只可能进推理 SKU → 写入远期 tripwire,不改 2027 CoWoS 模型。
结论 5 · CUDA 主机侧从 ARM 独占变双轨,是 ARM 叙事里未定价的远期折价项
NVIDIA 实验室 ≥3 款 RVA23、CUDA on RISC-V 现场首演、CUDA 额外要求仅约两页、NVLink Fusion 开放给 RISC-V 主机、Ubuntu 26.04 LTS 把 RVA23 定为官方基线、矩阵扩展 12-18 个月批准。
- 对 NVDA:这是防守型开放。自己用 Vera CPU 吃 agentic AI 高端主机(供需底稿 H.9:2027 Vera 5.75mn 颗、CoWoS-R 250k),同时把长尾主机让给免版税的 RISC-V,防止 x86/ARM 阵营整机架替换。对 NVDA 是正向(扩大 NVLink Fusion 生态),不改 Tier。
- 对 ARM:不是 2027 事件,是 2028-2030 的 attach rate / 版税基数风险,应作为远期折价项写入而非当期减配依据。内部底稿 §CPU 现有的"ARM AGI CPU 正面冲击 x86"叙事需要加一句"同时被 RISC-V 从下方夹击"。
- 上市侧干净表达有限(SiFive / Ventana 未上市);间接层是 EDA/IP 工具链(SNPS/CDNS,中性偏好)与 Infineon 侧的汽车 RVM(2029+,不构成交易)。
交易日历(会后 T+N)
| 检查点 | 要看什么 |
|---|---|
| T+1~T+5 | 存储三家、SNDK、AMD、ARM、INTC 的会后反应方式(是否对 HBF 否证钝化 = 二阶信号) |
| 2026-09-28 SNIA SDC | KV cache / DiskANN / 多层池化内存标准化进度;HBF 在 SDC 是否有更新 spec |
| 2026-10-12 OCP Global Summit | HBF 的 OCP 标准化实质进展(Google / Tenstorrent 参与度);1MW 机架 / 800V DC / CPO |
| 2026Q4 财报季 | 任一原厂给出 16-Hi HBM4 良率或 20-Hi 时间表;三星 custom base die 客户名 |
| 2027 GTC | Rubin Ultra HBM 配置(供需底稿 里 [R] 有 8-Hi 192GB 与多 SKU 分层两个冲突口径,需仲裁) |
数据来源
一手会议内容:用户上传 Hot Chips 2026 长图 PDF 全文 OCR(`HotChips2026_OCR_full.md`)
X / 公开来源([O] 官方一手):
- SK hynix HBM4 规格与 775μm 上限:@ricci_nov、Tom's Hardware、@Omercheema
- Samsung zHBM 与 custom base die:TrendForce、@SemiconductorsX、@jasonschips
- Micron memory wall:@canelbi17
- HBF 规格与时间表:@HotAisle
- Rubin / AI factory:@DrNHJ、@bookwormengr
- AMD MI455X:@TekStrategist
- SiFive BigSky + CUDA on RISC-V:HotHardware
- Intel Diamond Rapids:Intel Newsroom
- Arm AGI chiplet:@Arm