Kimi K3权重上线魔乐社区!基于昇腾的推理部署指南来了
Kimi K3全球首个开源的 3 万亿级别 MoE 模型,昇腾 Day0 适配,原生视觉理解 + 百万 token 上下文 + 关键Infra技术全面开放。
2026 年 7 月 27 日,月之暗面正式开源 Kimi K3的模型权重以及支撑 Kimi K3 模型训练的关键 Infra 技术:MoonEP、FlashKDA 和 AgentEnv。Kimi K3是一个拥有2.8 万亿参数的混合专家(MoE)模型,具备原生视觉理解能力,并支持 100 万 token 的上下文窗口。它是全球首个开源的 3 万亿级别模型,面向长程编程、知识工作和推理等前沿智能场景而设计。
Kimi K3 的开源模型权重和NPU适配的量化权重均已上线魔乐社区,欢迎广大开发者下载!
下载地址:
模型原始权重:
https://modelers.cn/models/moonshotai/Kimi-K3
量化权重(NPU适配):
https://modelers.cn/models/Eco-Tech/Kimi-K3-w4a8
1. 技术报告与关键 Infra 技术同步公开
Kimi K3 参数规模是 Kimi K2.5 的3 倍左右,但规模化并不仅仅是参数的堆叠。在并不宽裕的算力条件下,Kimi K3 凭借Kimi Delta Attention、Attention Residuals 以及 MoonEP等一系列技术创新,规模化效率提升了2.5 倍(即在算力最优意义下,单位算力产出智能约等于原来 2.5 倍)。
与 Kimi K3 模型权重一起公开的,还有 Kimi K3 的技术报告以及支撑训练的三项 Infra 技术:MoonEP、FlashKDA 和 AgentEnv,覆盖从高性能通信、高性能算子到分布式 RL 环境的关键链路。其中 FlashKDA 此前已开源,MoonEP 和 AgentEnv 则随本次发布正式开源。
- MoonEP
MoonEP 是 Kimi 团队为超大的细粒度 MoE 打造的高性能通信库,让专家并行(expert-parallel)的通信在不均衡的情况下仍然实现极致效率。
- FlashKDA
FlashKDA 是 Kimi 团队实现的 Kimi Delta Attention 高性能算子。在英伟达 H20 上,相比 flash-linear-attention 基线,它的prefill 速度提升 1.72–2.22 倍,可以直接作为 flash-linear-attention 的替换后端。
- AgentEnv
AgentEnv 是 Kimi 团队与 KVCache.ai 合作开发的沙箱系统,用于大规模运行 Agent 环境。它为 Kimi K3 的后训练提供高保真、强隔离沙箱,灵活支持快速快照、恢复和分叉(fork)等,可应对大规模并行的 Agent 工作流与训练任务。
2. 昇腾实现 Day0 适配
此次 Kimi K3 一经开源发布,昇腾即实现 Day0 适配:
在训练侧,基于 MindSpeed MM 在 Atlas 800 A3、Atlas 900 A3 SuperPoD 上完成减层训练基础功能适配,在算子、并行加速、显存优化等方面进行专项优化;
在推理侧,通过 vLLM Ascend 与 SGLang 开源推理引擎实现快速部署,同时,昇腾 950 超节点支持 FP8、MXFP8、MXFP4 等全系列数值精度格式,原生支持 Kimi K3 的 mxFP4 量化权重。
Kimi K3 接入 vLLM Ascend / SGLang 后,用户仍可沿用 vLLM / SGLang 的服务接口、调度方式和参数体系。vLLM Ascend 支持 Prefix Cache、Chunked Prefill、异步调度、PD 分离和内存池化等能力,在适配 KDA、Gated MLA 和 LatentMoE 新结构的同时保持这些框架能力与使用方式不变,使 K3 能够无缝进入现有 vLLM 推理服务体系。
- 融合算子加速: KDA Prefill 与 Decode 双路径
KDA 状态具有严格的时序依赖,vLLM Ascend 针对 Prefill 和 Decode 为 Kimi K3 设计了两条执行路径:Prefill 以 64 Token 为 Chunk,将 Q/K 归一化、Gate 累积和 Chunk KDA 组织为批量计算;Decode / MTP 则直接在状态池上执行短序列递归更新。
Decode 路径使用Ascend C 融合 Kernel,在单次执行中完成 Q/K L2Norm、Gate 与 Beta 处理、状态衰减、Delta Rule、外积更新、输出计算和 Final State 原地回写。V×K 工作状态驻留 Unified Buffer,并按“逻辑序列 × Value Head”并行分配任务,从而减少多算子启动、临时 Workspace、全局内存往返和阶段间同步开销。
- MoE 通算: MC2 支撑 896 专家与大规模 EP
Kimi K3 在部署时,EP64 下每张卡只有 14 个路由专家,而每个 Token 要访问 16 个专家,跨 Rank 交换是必然动作。vLLM Ascend 通过 MC2 将路由后的 Token 重排、跨 Rank 分发、局部专家计算和结果回收组织为一条设备侧流水线,避免 CPU 参与热路径调度。
MC2 路径在 Dispatch 前、GMM2 前与 Combine 前记录 Stream Event,使 Shared Expert 可以在独立 Stream 中与路由专家、通信阶段重叠。Token 分发、专家 GMM 与结果回收因此可以在设备侧连续推进,减少 CPU 介入和阶段间等待。
- 原生量化: MXFP4 权重与逐 Token 动态 MXFP8 激活
Kimi K3 以 MXFP4 承载专家权重、以 MXFP8 承载专家计算激活。vLLM Ascend 通过 ModelSlim 量化配置直接加载原生量化权重,并在设备侧执行逐 Token 动态 MX 量化、生成 Per-Token Scale;量化结果与 Scale 随 Token 一同进入专家分发和 Grouped MatMul,减少权重与激活的存储、访存及中间搬运开销。
量化范围按模块控制:Router 保持高精度,发布版权重中的 LatentMoE 降维、升维投影保持 BF16,ModelSlim 原生权重则可对其独立量化。第一层专家计算后的激活与 MXFP8 量化融合,再直接进入第二层矩阵计算,在兼顾关键模块精度的同时减少独立量化 Kernel 和阶段间同步。
- 并行布局优化: FlashComm1 降低冗余计算
vLLM Ascend 针对 K3 多模态输入从全局 Embedding 切换到 TP 分片布局的特点,对 FlashComm1 执行路径进行了模型级适配。vLLM Ascend 将布局转换前移到第一层解码器边界,一次完成Token 分片和通信编排;后续 KDA / MLA 仅在确实需要完整序列的位置集中执行 All-Gather,避免多次数据收集及其带来的冗余处理。同时,vLLM Ascend 进一步打通 FlashComm1 与 Shared Expert DP、TP Shard 的布局语义,使视觉、注意力和专家计算沿用一致的分片方式,减少中间张量搬运和多种并行策略组合下的同步开销。
- 投机推理: SGLang 支持 DSpark 投机推理能力
SGLang 在继承原有特性外,与 SGL 社区同步发布 Kimi K3 DSpark 投机推理能力。DSpark 算法在一个月前正式公开亮相,通过分层草稿生成,降低自回归推理单次生成开销。本次 SGLang 在 Kimi K3 Day0 支持中创新性引入该算法,解决模型没有原生投机权重的问题,全面提升昇腾上 decode 阶段的推理性能至 TPOT < 50ms。
3. Kimi K3 推理部署指导
用户及开发者可访问以下链接获取 Kimi K3 基于昇腾的部署指导:
vLLM Ascend:
https://docs.vllm.ai/projects/ascend/en/v0.23.0/tutorials/models/Kimi-K3.html
SGLang:
https://github.com/sgl-project/sglang/issues/32519
欢迎体验!
无论你是高校科研人员、AI 算法工程师,还是开源大模型爱好者,都可以前往魔乐社区,一键获取 Kimi K3 完整开源权重。
除了下载与体验,我们也欢迎你在社区分享部署实践、性能测试、量化方案和调优经验,交流 Kimi K3 的微调方法、国产算力适配心得及行业落地案例,与更多开发者共同推动国产大模型与国产算力生态繁荣发展。
立即前往魔乐社区,获取 Kimi K3 完整开源权重:
https://modelers.cn/models/moonshotai/Kimi-K3
https://modelers.cn/models/Eco-Tech/Kimi-K3-w4a8
更多推荐


所有评论(0)