利好

腾讯 Hy4 量化版体积降至 214GB

14:30

腾讯发布Hy4 preview极限量化版,模型体积由1.5TB缩减至214GB,平均精度2.38 bpw,显著降低770B MoE模型本地部署门槛。

据 Woofun AI 消息,腾讯混元在 Hy4 preview 开源后推出极限量化版,将原始接近 1.5TB 的模型权重压缩至约 214GB 的 GGUF 格式。该版本采用分层混合精度策略,对低敏感层量化至约 1.31-bit,高敏感层保留 2-bit 及以上精度,整体平均精度约为 2.38 bpw。在四项评测中,其性能相比 BF16 原版仅下降 0.2 到 1.6 分。

此外,腾讯结合 prima.cpp 测试了异构设备联合推理方案。使用一台 RTX 4090 笔记本与一台四卡 A4000 服务器(总计 80GB 显存和 64GB 内存),模型推理速度达到 1.02 token/s,较笔记本单机 offload 模式提升约 6 倍,支持多配置设备共同分担推理负载。

WOOFUN AI

影响力评估 · 一键速读

通过分层混合量化技术,腾讯在保持模型性能几乎无损的前提下,将显存需求降低近九成,极大提升了 770B 规模 MoE 模型在消费级硬件上的可用性。异构推理方案的验证表明,利用多设备协同可有效突破单卡显存瓶颈,为本地部署超大参数模型提供了低成本路径,或加速大模型在边缘侧及中小企业场景的落地应用。
WOOFUN AI 生成 · 仅供参考,非投资建议

评论

回复 @用户
0/800

暂无评论

消息提醒

登录后查看消息
查看全部消息管理订阅