Tag: #MoE
All the articles with the tag "#MoE" (2 posts).
-
DeepSeek-V4 技术架构与高效百万上下文推理工程评估报告
Posted on: · 10 min read深入剖析 DeepSeek-V4 (1.6T MoE / 49B 激活) 的底层系统架构:CSA/HCA/SWA 三阶混合注意力、流形约束超连接 (mHC)、Birkhoff 多面体双随机残差与 Muon 优化器在 1M 上下文下的工程实现。
-
Kimi K3 技术报告深度拆解:2.8T 开源基座的 KDA 线性注意力、Stable LatentMoE 与 AgentENV 基础设施
Posted on: · 7 min read全面剖析月之暗面 Kimi K3(2.8T MoE / 104B 激活)的核心架构突破:Kimi Delta Attention (KDA) 3:1 混合注意力、Attention Residuals (AttnRes)、Stable LatentMoE 拓扑与微虚拟机 AgentENV 强化学习基础设施。