利好
腾讯混元 Hy4 底层架构重构采用门控稀疏注意力
17:00
混元Hy4弃用全注意力改用Gated DSA,引入IndexCache与iHC残差结构,MoE专家增至257个。
据 Woofun AI 消息,腾讯混元 Hy4 preview 在扩大模型规模的同时对底层架构进行了全面重构。该版本摒弃了上一代 Hy3 使用的传统全注意力机制,转而采用受 DeepSeek 启发的 Gated DSA(门控稀疏注意力),使模型在处理超长文本时能聚焦关键内容而非重复计算。
同时,Hy4 引入了受智谱 GLM 启发的 IndexCache 技术,允许部分网络层复用前序层的注意力结果以减少冗余计算。
在结构优化方面,混元 Hy4 将传统 Transformer 的单主干残差结构升级为 iHC 四路并行结构,以增强深层网络的信息保留能力。此外,其混合专家(MoE)架构中的路由专家数量从 192 个增加至 256 个,并新增 1 个共享专家,每个 Token 在推理时将选择 8 个路由专家并同时经过共享专家处理。
WOOFUN AI
影响力评估 · 一键速读
混元 Hy4 的架构升级标志着国内大模型在长上下文处理效率上的进一步内卷,直接对标 DeepSeek 与智谱的技术路径。通过引入稀疏注意力与缓存机制,模型在降低推理成本的同时提升了长文本理解能力,这可能加速行业对高效架构的采纳。MoE 专家数量的增加则旨在提升模型的专业化分工与整体性能上限,为后续商业落地提供算力效率支撑。
WOOFUN AI 生成 · 仅供参考,非投资建议
评论
暂无评论