利好
AI 伺服器记忆体成本占比超 75% 推软硬双轨策略
10:17
Google指出记忆体成AI算力瓶颈,推出TPU分流硬件与无损量化算法,实现6倍压缩与8倍加速。
据 Woofun AI 消息,在 SEMICON Taiwan 2026 记忆体高峰论坛上,Google Cloud 供应链基础架构资深总监 Nikhil Cherian 表示,随着多模态与混合专家架构普及,AI 运算已从算力受限转向记忆体受限,高效能记忆体占 AI 伺服器硬体物料清单成本 75% 以上。
为突破容量、频宽与功耗瓶颈,Google 采取软硬体双轨策略。硬体方面,推出针对低延迟推论的 TPU 8i 与专攻超大规模训练的 TPU 8t。TPU 8i 配备 288 GB 高频宽记忆体,晶片上 SRAM 容量扩增 3 倍至 384 MiB,将动态对话状态与键值快取置于晶片内部,实现零晶片外延迟。TPU 8t 透过 9600 颗晶片组成超大型运算丛集,HBM 共享池化达到 2 PB 规模,消除晶片外数据传输瓶颈,并搭配 TPU Direct Storage 技术。
软体方面,Google 开发出免训练的 TurboQuant 无损量化演算法,将大模型的键值快取从 32 位元压缩至 3 位元,在精确度零损失前提下缩小 6 倍记忆体占用,带来 8 倍注意力运算加速,并导入旧世代 DRAM 整合技术以延长零组件生命周期。
WOOFUN AI
影响力评估 · 一键速读
记忆体成本占比突破75%标志着AI基础设施瓶颈的实质性转移,未来硬件选型将更侧重记忆体带宽与容量效率。Google通过TPU 8i/8t的差异化设计及TurboQuant算法,试图在降低单卡成本的同时提升集群整体吞吐量。若该无损量化方案能在业界推广,或显著降低对最新一代HBM的依赖,缓解供应链压力并延长现有设备使用寿命。
WOOFUN AI 生成 · 仅供参考,非投资建议
评论
暂无评论