利好

AI 伺服器记忆体成本占比超 75% 推软硬双轨策略

10:17

Google指出记忆体成AI算力瓶颈,推出TPU分流硬件与无损量化算法,实现6倍压缩与8倍加速。

据 Woofun AI 消息,在 SEMICON Taiwan 2026 记忆体高峰论坛上,Google Cloud 供应链基础架构资深总监 Nikhil Cherian 表示,随着多模态与混合专家架构普及,AI 运算已从算力受限转向记忆体受限,高效能记忆体占 AI 伺服器硬体物料清单成本 75% 以上。

为突破容量、频宽与功耗瓶颈,Google 采取软硬体双轨策略。硬体方面,推出针对低延迟推论的 TPU 8i 与专攻超大规模训练的 TPU 8t。TPU 8i 配备 288 GB 高频宽记忆体,晶片上 SRAM 容量扩增 3 倍至 384 MiB,将动态对话状态与键值快取置于晶片内部,实现零晶片外延迟。TPU 8t 透过 9600 颗晶片组成超大型运算丛集,HBM 共享池化达到 2 PB 规模,消除晶片外数据传输瓶颈,并搭配 TPU Direct Storage 技术。

软体方面,Google 开发出免训练的 TurboQuant 无损量化演算法,将大模型的键值快取从 32 位元压缩至 3 位元,在精确度零损失前提下缩小 6 倍记忆体占用,带来 8 倍注意力运算加速,并导入旧世代 DRAM 整合技术以延长零组件生命周期。

WOOFUN AI

影响力评估 · 一键速读

记忆体成本占比突破75%标志着AI基础设施瓶颈的实质性转移,未来硬件选型将更侧重记忆体带宽与容量效率。Google通过TPU 8i/8t的差异化设计及TurboQuant算法,试图在降低单卡成本的同时提升集群整体吞吐量。若该无损量化方案能在业界推广,或显著降低对最新一代HBM的依赖,缓解供应链压力并延长现有设备使用寿命。
WOOFUN AI 生成 · 仅供参考,非投资建议

评论

回复 @用户
0/800

暂无评论

消息提醒

登录后查看消息
查看全部消息管理订阅