利好

腾讯混元 Hy4 底层架构重构采用门控稀疏注意力

17:00

混元Hy4弃用全注意力改用Gated DSA,引入IndexCache与iHC残差结构,MoE专家增至257个。

据 Woofun AI 消息,腾讯混元 Hy4 preview 在扩大模型规模的同时对底层架构进行了全面重构。该版本摒弃了上一代 Hy3 使用的传统全注意力机制,转而采用受 DeepSeek 启发的 Gated DSA(门控稀疏注意力),使模型在处理超长文本时能聚焦关键内容而非重复计算。

同时,Hy4 引入了受智谱 GLM 启发的 IndexCache 技术,允许部分网络层复用前序层的注意力结果以减少冗余计算。

在结构优化方面,混元 Hy4 将传统 Transformer 的单主干残差结构升级为 iHC 四路并行结构,以增强深层网络的信息保留能力。此外,其混合专家(MoE)架构中的路由专家数量从 192 个增加至 256 个,并新增 1 个共享专家,每个 Token 在推理时将选择 8 个路由专家并同时经过共享专家处理。

WOOFUN AI

影响力评估 · 一键速读

混元 Hy4 的架构升级标志着国内大模型在长上下文处理效率上的进一步内卷,直接对标 DeepSeek 与智谱的技术路径。通过引入稀疏注意力与缓存机制,模型在降低推理成本的同时提升了长文本理解能力,这可能加速行业对高效架构的采纳。MoE 专家数量的增加则旨在提升模型的专业化分工与整体性能上限,为后续商业落地提供算力效率支撑。
WOOFUN AI 生成 · 仅供参考,非投资建议

评论

回复 @用户
0/800

暂无评论

消息提醒

登录后查看消息
查看全部消息管理订阅