2026年7月27日,Moonshot AI发布了新一代Kimi K3模型开源权重。该模型为目前已知参数量最大的开源模型,参数规模达2.8万亿,进一步提升了大模型复杂任务的处理能力。昇腾CANN对模型 MXFP4 量化实现Day0原生支持,并提供在昇腾950PR/DT系列和Atlas A3系列集群部署实践,现已面向开发者开源推理代码和算子实现。

Kimi K3采用2.8T参数的混合注意力MoE 架构,模型交错使用Kimi Delta Attention(KDA)与 Gated MLA,并引入Attention Residuals(AttnRes)和Stable LatentMoE。线性注意力 KDA 维护固定大小的序列状态,支持模型处理超长序列,缓解标准注意力机制存在的计算 / 存储成本。AttnRes 替代残差连接,沿网络深度聚合历史表示,带来稳定的扩展增益。

为实现超大参数规模Kimi K3模型部署及上述新特性,CANN社区随模型权重开源同步提供昇腾 NPU 部署方案与开源实现。

  • 提供950PR/DT4机32卡部署方案,采用Embedding TP、Attention DP/TP、Dense TP、Routed Expert EP、Prefill SP 与 Decode DP的混合部署策略,满足超大参数模型的内存切分需求,并充分发挥集群并行计算能力。

  • 针对2.8T超大参数规模,支持Kimi K3原生MXFP4量化模式,路由专家直接使用模型原生的MXFP4权重与动态MXFP8激活进行推理,无需额外量化转换,有效降低大规模专家权重的存储与访存开销。       

  • Kimi K3 896 专家的大 EP 部署场景,能够充分发挥昇腾超节点架构优势。相较前代模型,Kimi K3专家规模显著提升,通信交互复杂度同步增长,超节点互联能力充分匹配其海量专家并行的通信负载特征,由 AIV 直接下发 UB Memory 通信任务,有效抬升 MoE 推理吞吐上限。

  • 模型集成多个融合算子,包括Recurrent KDA 与 Conv1D fn / update,Stable LatentMoE 采用 Combine 与 MXFP8 Dispatch 大EP算子,以及Gated MLA的KV Cache更新融合算子 与 FIA 算子,助力进一步性能优化。

同时,趋境科技基于开源推理引擎 SGLang 完成了Kimi K3在昇腾 Atlas A3 上的Day0推理适配。项目实现 KDA 的昇腾CANN适配,并针对 MoE、混合注意力机制、多卡通信等关键模块进行了优化,实现模型在昇腾平台上的高效、稳定运行。相关适配成果即将开源,为开源大模型在昇腾平台上的快速部署和Agent应用落地提供有力支撑。

昇腾950全系列、Atlas A3产品支持Kimi K3部署。昇腾始终致力于为世界提供新选择,以极致算力、开放生态赋能AI创新,期待联合客户与开发者,依托 Kimi K3 探索 AI 无限可能。

后续还将进一步支持优化特性:

  • KDA 算子优化:提供 KDA Prefill 融合算子,进一步降低 TTFT(首 Token 响应时延);优化KDA Decode融合算子,持续改善吞吐与时延指标; 

  • 基于Two-Phase计算策略,提供AttnRes融合算子,减少中间张量读写与任务调度开销;

  • MegaMoE融合算子:面向 896 专家MoE大EP多专家部署场景,落地 MegaKernel 融合方案,全面提升推理吞吐与运行稳定性。

Kimi K3昇腾 NPU 推理优化实践:
https://gitcode.com/cann/cann-recipes-infer/tree/master/docs/models/kimi_k3/kimi_k3_inference_guide.md

趋境科技SGLang:https://github.com/sgl-project/sglang/pull/32604

Logo

作为“人工智能6S店”的官方数字引擎,为AI开发者与企业提供一个覆盖软硬件全栈、一站式门户。

更多推荐