图片

2026年7月27日,月之暗面发布新一代旗舰模型Kimi K3。模型拥有2.8万亿参数,支持百万token超长上下文,重点面向长代码开发、知识处理、复杂推理场景,并且原生支持图文多模态理解。Kimi K3依托高密度专家架构,擅长超长文本与复杂推理任务。但模型参数量庞大、层级深、专家模块密集,若使用传统量化方案需要完整加载整个模型,单机显存资源无法完成模型加载并量化。

昇腾MindStudio量化工具msModelSlim已完成Kimi K3适配。模型原生权重为MXFP4类型,经过权重量化转换后,模型可在昇腾A2/A3系列产品部署。工具核心优势如下:

单机就能完成量化:msModelSlim采用逐层调度方案,不再一次性加载完整模型,实现分层加载、逐层校准量化、处理完成后及时释放资源,大幅降低量化所需显存门槛;

成熟可行的量化方案:默认采用INT 混合量化方案,针对不同专家模块配置差异化量化精度,后续还将持续拓展MXFP等更多量化方式;

有效保障模型精度:工具适配了主流的离群值抑制算法,在拓展量化范围、使用更低比特量化时,更好地稳住模型效果。

超大模型,为何单机也能量化?

针对Kimi K3这款2.8万亿参数的超大MoE多模态模型,传统量化方式需要一次性加载整网权重、校准数据与运算临时资源,内存开销会数倍放大,极易直接打满显存,致使传统量化方式无法在单机上实施。

昇腾msModelSlim创新性采用逐层调度量化机制:按层依次完成加载、校准、离群值抑制与量化、保存、显存卸载的全流程,循环迭代完成全部网络层量化。这一设计将显存占用从全网级体量压缩至单层体量,实现单机即可完成Kimi K3全量量化,无需大规模算力集群,大幅降低超大模型的量化落地门槛。

在此基础上,工具支持多卡并行加速,进一步提升量化效率、降低资源压力:

**DP(数据并行):**多卡分摊不同校准数据分片,并行完成前向与统计;共享模块在合适时机做跨卡聚合,确保量化结果与全量校准语义一致,显著提升校准与算法的吞吐效率。

**EP(专家并行):**针对MoE层将896专家按卡切分,各Rank只驻留并量化本地专家子集,再汇总保存。这样既降低单卡专家驻留压力,也与逐层调度形成互补——层间靠offload把占用压到当前层,层内再靠EP把单层专家拆到多卡,进一步压低单卡峰值显存。

图片图1 msModelSlim逐层调度与DP/EP协同

一句话总结:逐层调度解决“能否在单机跑完”的问题;DP+EP解决“多卡时能否更快、更省地跑完”的问题。

Kimi K3具体量化方案

首发方案选用INT混合量化策略。依托成熟完善的INT算子生态,方案能够适配多款硬件与推理链路,降低落地门槛;后续我们将在这套基础方案之上,陆续支持MXFP格式,并拓展更多模型模块的量化能力。

本次量化聚焦模型语言侧MoE模块。Kimi K3原生路由专家已是4比特存储,难以进一步缩小体积。因此我们保持4比特规格不变,仅将数据格式从MXFP4转换为INT4,适配昇腾INT推理路径。针对对精度更为敏感的共享专家与投影层,则启用更高精度的INT8,最终形成混合量化策略:路由专家W4A8,共享专家与投影层W8A8。依靠4比特控制整体模型大小,借助8比特守住关键链路的量化精度。

具体量化策略

路由专家(W4A8)

**全部路由专家权重采用INT4量化,激活采用INT8量化。**权重借助昇腾自研低比特量化算法SSZ优化,减少精度损耗;激活使用逐Token动态量化,适配超长文本的数据特征,避免静态校准带来的精度损失。由于路由专家占据模型绝大部分体积,该组合可以控制整体模型大小。

共享专家与 Latent 投影(W8A8)

**共享专家、路由专家投影等关键结构权重和激活都采用INT8量化。**这部分参数量占比不大,但直接影响路由专家选择与输出质量,对精度变化十分敏感,所以选用8比特高精度方案。

图片

离群值抑制算法

Kimi K3量化方案后续还会持续迭代:进一步扩大量化覆盖范围,纳入注意力层等模块,持续探索更低比特的实现路线。

模型推理过程中存在数值尖峰,仅依靠比特压缩容易引发精度损失,需要借助离群值抑制手段控制量化误差。我们会持续推进量化方案升级,拓宽量化覆盖、探索更低比特方案,并同步更新开源仓库的实践范例与社区量化权重。

msModelSlim 已经完成两类主流优化算法适配,可用于缓解数值尖峰带来的精度损失:

QuaRot:通过数值变换打散极端异常数值,让数据分布更加平稳;

Smooth Quant:转移激活侧的数值尖峰至权重端,降低量化处理难度。

两种优化手段的处理结果会写入到模型量化权重内,能够作用于注意力模块、混合专家网络等核心结构。

一键量化实践

目前,Kimi K3已在msModelSlim中已支持一键量化,用户无需编写复杂量化脚本或手动配置,只需指定模型路径、输出路径等必要参数,执行一条命令即可完成量化。工具会根据量化命令参数选择是否启用多卡模式,大幅降低使用门槛,助力开发者快速上手部署。

多卡效率更高,建议优先使用多卡:

msmodelslim quant \
  --model_path {模型路径} \
  --save_path {量化输出路径} \
  --device npu:0,1,2,3,4,5,6,7 \
  --model_type Kimi-K3 \
  --quant_type w4a8 \
  --trust_remote_code True

单卡亦可:

msmodelslim quant \
  --model_path {模型路径} \
  --save_path {量化输出路径} \
  --device npu \
  --model_type Kimi-K3 \
  --quant_type w4a8 \
  --trust_remote_code True

总结

面对Kimi K3这类层次深、专家结构密集的超大模型,msModelSlim并非仅提供基础量化能力,而是一套能够直接落地的完整方案:

通过逐层调度突破硬件限制,单机即可完成量化;多卡部署场景可借助并行方案进一步提升处理效率;

混合量化配置,用INT方案打造稳定可用的部署版本,同时支持后续拓展MXFP数据格式;

离群值抑制已适配,为后续扩大量化范围、尝试更低比特压缩守住模型精度。

欢迎开发者基于昇腾AI基础软硬件平台体验Kimi K3的量化与部署。

msModelSlim 代码仓:

https://gitcode.com/Ascend/msmodelslim

Kimi K3量化权重:

https://www.modelscope.cn/models/Eco-Tech/Kimi-K3-w4a8

Logo

作为“人工智能6S店”的官方数字引擎,为AI开发者与企业提供一个覆盖软硬件全栈、一站式门户。

更多推荐