英伟达 Rubin 减配背后:摩根士丹利揭秘 AI 内存荒下的产业重构
核心要点
摩根士丹利研报指出,受HBM/DRAM供应短缺制约,英伟达Rubin平台或降低内存配置。行业正转向解耦推理与CXL技术以提升效率,美光、Cerebras等厂商迎来新机遇,存储短缺或贯穿整个AI周期。
据 Woofun AI 消息,人工智能基础设施正遭遇严峻的内存瓶颈, 平台面临内存减配压力,指出这并非需求衰退,而是 AI 内存荒迫使产业重构技术路线。
摩根士丹利半导体分析师 及其团队在 10 月 5 日发布的研报《How Can the AI Ecosystem Work Around Memory Bottlenecks?》中深入剖析了这一困境。报告核心观点认为,存储短缺可能持续贯穿当前 AI 周期,但 AI 建设不会等待 DRAM 晶圆厂完成扩产。行业需要通过降低部分产品配置、拆分推理任务,以及提高内存共享效率等方式,绕过现有供应限制。
这意味着,AI 硬件的竞争可能从单纯增加 GPU 和内存容量,进一步转向整个计算系统的资源利用效率。存储短缺并不必然削弱存储厂商的长期需求,却可能改变产业链的价值分配。除了、等存储企业,、 和 等拥有特殊计算架构及互连技术的厂商,也可能从中获得新的增长机会。
英伟达 CEO 此前已谈及通过计算、网络和存储系统的协同设计缓解供应限制的必要性。摩根士丹利预计,英伟达可能为 Rubin 平台提供多种较低内存配置。在机架级内存方面,Rubin 原先规划的 LPDDR5 容量约为 54TB,而部分新配置可能降至 28TB,对应 SOCAMM2 内存模块容量从 192GB 降至 96GB。在 HBM 方面,Rubin 单 GPU 原先预计配备 288GB HBM4,采用 8 组 12 层堆叠设计;摩根士丹利预计,英伟达可能增加配备 192GB HBM4 的产品版本,将堆叠层数降至 8 层。对于 ,研报认为,在调整为双计算芯粒方案后,512GB 是更合适的比较基准,未来可能出现约 192GB 至 384GB 的不同容量选择。
从技术逻辑看,降低 HBM 堆叠层数可以减少容量,而在接口数量和引脚速率等条件不变时,理论带宽不一定同步下降。但容量和带宽解决的是两个不同问题。对于模型较小、上下文较短的应用,降低容量可能影响有限;但当模型越来越大、推理任务越来越复杂时,内存容量不足仍可能导致更多数据需要在不同存储层级之间转移,增加延迟或 GPU 使用量。更重要的是,减少 HBM 并不会让 AI 原本需要处理的数据消失,只会让这些数据寻找新的存放位置。
例如,当 GPU 的 HBM 容量不足时,部分数据可能需要保存在主内存中;当机架级 LPDDR5 容量降低时,部分 KV Cache(键值缓存)需求又可能转向 NAND 闪存。KV Cache 是大模型推理过程中用于保存历史计算信息的缓存。随着上下文变长、同时运行的请求增加,其容量需求也随之上升。摩根士丹利指出,英伟达降低部分 LPDDR5 配置的同时,产业链已经观察到来自 NAND 的新增需求。HBM 容量减少还可能增加 GPU 间的数据传输,使高速互连网络承担更大压力。
这意味着,英伟达的减配策略可能暂时缓解 DRAM 供应约束,却同时增加对 NAND、互连芯片以及更大规模 GPU 集群的需求。
这种压力转移有其长期背景。大语言模型时代的前沿模型参数规模曾呈现约每六个月翻倍的增长趋势。上下文窗口也经历了快速扩张。同时,更多 AI 应用从简单问答转向编程、复杂推理和长时间运行的 Agent 任务,进一步推高内存使用量。摩根士丹利认为,模型规模、上下文长度和推理并发量将继续推动存储需求增长。因此,降低部分产品配置更可能是供应紧张时期的过渡方案,而不是 AI 内存需求长期下降的信号。

评论
暂无评论