openPangu-2.0_技术报告_全文中文翻译
openPangu-2.0_技术报告_全文中文翻译
- 写在最前面
- openPangu-2.0:迈向可靠、高效的智能体推理
- 1 引言
- 2 模型架构
- 3 预训练
- 4 后训练
- 5 评测
- 6 推理
- \[ \frac{\alpha^{Hybrid}_{P,2}}{\alpha^{Full}_{P,2}} \approx \frac13\cdot \frac{N^{Indexer}_{head}}{N_{head}}\cdot \frac{D^{Indexer}}{D^{MHA}_{QK}+D^{MHA}_{V}}
- \frac13\cdot\frac12\cdot\frac{128}{320}
- \[ \frac{\alpha^{Hybrid}_M}{\alpha^{Full}_M} \approx \frac13\left(1+\frac{D^{Indexer}}{D_{KV}}\right)
- \[ \frac{\alpha^{Hybrid}_T}{\alpha^{Full}_T} \approx \frac13\cdot\frac{D^{Indexer}}{D_{KV}}
- 7 结论与未来工作
- 参考文献
- A 附录 / 补充材料

写在最前面
版权声明:本文为原创,遵循 CC 4.0 BY-SA 协议。转载请注明出处。
openPangu-2.0:迈向可靠、高效的智能体推理
openPangu 团队
本文为《openPangu-2.0: Towards Reliable and Efficient Agentic Reasoning》技术报告的中文全文翻译。为便于阅读,保留原论文的章节结构、公式、表格编号和技术缩写;参考文献按原文格式保留。
摘要
我们推出 openPangu-2.0,包括两个主要架构版本:拥有 505B 参数、激活参数 18B 的 openPangu-2.0-Pro,以及拥有 92B 参数、激活参数 6B 的 openPangu-2.0-Flash。此外,我们还推出了一个面向资源受限场景执行的优化端侧模型,总参数量为 30B,激活参数量为 2B。
为了最大化智能体能力与系统级效率,我们建立了一套严格的软硬件协同设计方法,将算法创新与昇腾原生基础设施紧密耦合。在模型架构层面,我们通过交错使用滑动窗口注意力(Sliding-Window Attention,SWA)与 DeepSeek 稀疏注意力(DeepSeek Sparse Attention,DSA),提出逐层混合注意力架构,以提升长上下文推理效率。通过将流形约束超连接(Manifold-Constrained Hyper-Connections,mHC)与 Muon 优化器以及一系列针对性的稳定化技术结合,模型能够在预训练过程中实现更快的收敛速度,同时避免出现 loss spike。
在系统层面,我们通过定制融合算子以及面向拓扑结构的协同优化,消除关键的显存、计算和网络瓶颈,从而保证超大规模 MoE 架构在最长 512K 上下文窗口下的稳定预训练。对于后训练,我们将并行专家强化学习与严格的训推一致性方法结合。最后,我们构建了专用推理引擎,通过定制算子优化、并行策略、缓存管理和异步调度,在昇腾硬件上实现高吞吐与超低时延。
我们开源了完整的训练与推理框架,以及在昇腾平台原生训练得到的模型权重,地址为:https://gitcode.com/ascend-tribe。
1 引言
近年来,大语言模型(LLM)的发展推动了一个根本性的范式转变:这些系统正在从被动的对话助手,逐步演化为能够主动、自主地在复杂环境中行动的智能体。这样的演化要求模型能够可靠地执行长上下文规划、精确调用外部工具,并在长时间执行轨迹中保持认知一致性。
然而,现代部署仍面临关键瓶颈:通用模型架构在上下文窗口扩大时会带来高昂推理成本,并出现显著性能退化;与此同时,标准的对齐技术也难以阻止模型在长程执行过程中出现时间和结构推理错误。
openPangu-2.0 从设计之初就是为了解决这些问题。通过协同定制硬件算子、系统架构、训推一致的智能体强化学习以及专用推理加速,我们建立了一套严格的软硬件协同设计方法,为长上下文智能体任务提供高效、可靠且具成本优势的基础模型底座。
模型架构
为了以高效率获得原生长序列能力,我们围绕两个架构版本——openPangu-2.0-Pro 与 openPangu-2.0-Flash——设计了核心架构创新。我们通过逐层混合注意力机制解耦上下文处理:以滑动窗口注意力(SWA)处理稠密局部上下文,以 DeepSeek 稀疏注意力(DSA)处理稀疏全局检索。
为了加速推理,我们额外引入了一个三头多 Token 预测(Multi-Token Prediction,MTP)模块。进一步地,将流形约束超连接(mHC)与 Muon 优化器结合后,在相同预训练数据预算下可以显著提升收敛速度。最后,我们针对 MoE 负载均衡、mHC 稳定性、MTP 训练策略与 Muon 参数分组等方面进行专门设计,从端到端保证预训练过程平稳,不出现 loss spike。
训练基础设施
当上下文窗口扩展到 512K,并同时引入 mHC、Muon 与 MTP 等复杂架构组件时,通信和内存都会遇到严重瓶颈。为保证长上下文训练稳定性,我们构建了系统化的协同优化框架,包括:无冗余混合上下文并行(Context Parallelism,CP)、面向 MTP 的轻量 P2P 传输、Muon 的分布式计算通信重叠,以及混合重计算机制。
这些优化大量依赖 AscendC 定制融合算子,对 mHC、参数化注意力汇(Parametric Attention Sinks,PAS)以及 ModAttn 进行硬件原生加速。为了充分利用 CloudMatrix 384 超节点的整体算力,我们部署了简化且面向拓扑的亲和性策略,将大流量通信限制在超节点内部,同时尽量减少外部数据传输,从而消除瓶颈并最大化硬件利用率。
后训练
我们的后训练框架采用三阶段流水线:监督微调(SFT)、并行强化学习专家训练,以及多专家 On-Policy 蒸馏(OPD)。
在统一 SFT 之后,我们并行训练不同 RL 专家,分别在彼此隔离的数据和奖励函数上优化领域策略,包括推理(Reasoning)、通用(General)、智能体(Agent)和代码(Coding),以消除 RL 阶段的跨领域干扰。最后,再通过 OPD 阶段融合不同 RL 专家。
除了目前用于缓解训推不一致问题的机制外,本报告还预览了一套将在后续模型迭代中采用的、基于昇腾架构的完整对齐方案。
推理加速
我们构建了昇腾原生推理框架,使硬件执行逻辑与模型运行时动态紧密结合。架构中引入多种定制融合算子,包括面向推理优化的 mHC 算子与专用集合通信原语;同时引入 Felix CP、逐核多流执行等新的并行策略。
为了最大化吞吐,我们进一步加入了定制量化策略与算子感知、精度保持方案,并集成混合 KV Cache 管理、无损并行分词(Lossless Parallel Tokenization,LoPT),以及面向 ModAttn 的自动前缀缓存(Automatic Prefix Caching,APC)和 MTP 支持。
在 128K 上下文长度下,该框架在昇腾 NPU 上实现了优秀的长上下文推理性能:
- openPangu-2.0-Flash:TPOT 最低可达 5.63 ms,在 TPOT=15 ms 时单 NPU 生成吞吐达到 1846 tokens/s;
- openPangu-2.0-Pro:超低时延可达 9.55 ms,在 TPOT=20 ms 时单 NPU 吞吐达到 1326 tokens/s。
性能与应用价值
评测结果表明,openPangu-2.0 系列在通用、推理和智能体等多类基准上具有竞争力,同时也揭示了一个关键的协同反馈循环:强大的基础推理能力能够直接增强复杂智能体行为,而复杂智能体训练反过来也会强化多步规划和长轨迹上下文处理能力。
在公开基准之外,我们进一步关注实际系统级价值。以智能设备为例,我们将模型与推动 HarmonyOS 迈向真正 AI 原生操作系统(AIOS)所需的核心能力进行对齐。为此,我们重点培养了两类原生能力:由意图驱动的生成式用户界面(Generative UI),以及基于真实执行的软件合成。
在实际场景展示中,openPangu-2.0 可以稳定地把高层级人类意图转换为可投入生产的全栈小应用,也可以把深度研究流程转化为动态、可交互的知识制品。
2 模型架构
openPangu-2.0 系列包含两个 MoE 语言模型:openPangu-2.0-Pro(505B 总参数、18B 激活参数)与 openPangu-2.0-Flash(92B 总参数、6B 激活参数)。两者原生支持 512K Token 上下文窗口,整体架构如图 1 所示。
为了应对长上下文智能体工作负载中的计算、内存容量和带宽瓶颈,我们提出逐层混合注意力机制,将 DSA 与 SWA 交错堆叠。该设计将上下文建模自然解耦:SWA 层专注捕获局部依赖,DSA 层高效检索稀疏全局信息。
为了实现高效推理,我们在主干网络后附加三个 MTP 层,通过自投机解码显著提升生成速度。此外,通过整合 mHC 并使用 Muon 优化,openPangu-2.0 在相同预训练数据预算下实现了显著更高的学习效率。完整架构超参数见附录 A.1。
图 1:openPangu-2.0 架构概览。 openPangu-2.0-Flash 的前两层和 openPangu-2.0-Pro 的前三层为稠密层。第一层以及之后每隔五层都会对残差流应用 RMSNorm。
2.1 注意力架构
我们的注意力模块以多头潜在注意力(Multi-Head Latent Attention,MLA)为基础,通过交错堆叠 DSA 和 SWA 层,大幅降低长上下文场景下的推理开销。为了进一步优化注意力表示,我们在标准 MLA 模块中加入参数化注意力汇(PAS)与局部上下文调制注意力(Local-Context Modulated Attention,ModAttn):前者用于系统性吸收 attention sink token,后者用于增强细粒度局部语义建模。
SWA
我们采用重复的 DSA–SWA–SWA 模式,即 SWA 与 DSA 的层数比例为 2:1。在初步实验中,我们发现更大的比例,例如 3:1 和 5:1,虽然在短序列(4K)上仍能保持性能,但当上下文长度扩大到 32K 和 128K 时,训练 loss 会出现退化。
SWA 的窗口大小固定为 512 Token;SWA 层的 RoPE 基频会随上下文长度扩大而增加,从 4K 上下文时的 1.0×10^4,逐步增加到 512K 上下文时的 6.4×10^6。我们也探索了其他窗口大小和 RoPE 基频缩放策略,但它们对最终性能的影响都较为有限。
DSA
DSA 引入了一个轻量级 Lightning Indexer(LI)。LI 会动态选择与当前 Token 相关的历史键值(KV)条目,再对这些条目计算注意力,从而消除大量冗余且无关的注意力开销。
被选中的历史 Token 数量被限制为固定的 K,例如 2048,因此全局注意力成本的缩放因子由“完整上下文长度”转变为“被选中的 Token 数量”。
在 512K 上下文预训练的后期阶段,我们通过重放 512K 训练数据,将模型从全注意力(FULL)架构迁移为 DSA 架构。在这一迁移过程中,我们为 LI 加入一个辅助学习目标,使其拟合由全注意力计算得到的原始注意力分数。该辅助目标系数设置为 0.1,因为过大的系数会带来过强梯度,损害训练稳定性。
经过短暂的稠密 warm-up,以及 100B Token 的稀疏适配后,模型能够基本恢复下游性能。
与 DeepSeek-V3.2 不同,我们的基础模型本身就是 FULL-SWA 混合架构。因此,我们只把全注意力层转换为 DSA,而保留 SWA 层不变。这样就在结构上完成上下文建模的解耦:DSA 负责提取全局依赖,SWA 负责处理局部交互。
PAS
为了缓解 attention sink 现象——即语义意义很弱的 Token 却吸收了不成比例的大量注意力——我们在每一层中加入参数化注意力汇(PAS)。
如图 1 所示,每一层 PAS 都引入 128 个可学习的键值对;对于 MLA 而言,这些是潜在 KV。它们用于吸收冗余注意力。在推理阶段,这些 PAS 相当于固定数量的虚拟 KV 条目,即使在长上下文场景下,计算和缓存开销也几乎可以忽略。
实验还表明,PAS 能够加快混合 SWA 架构的训练收敛。与 gpt-oss 中 sink 机制的详细比较见附录 A.2。
ModAttn
ModAttn 用于解决局部语义歧义问题。它在全局注意力计算之前和之后,通过轻量级因果一维卷积与残差结构注入局部上下文。
形式化地,给定序列表示:
[
Z \in \mathbb{R}^{T\times d},
]
局部调制算子定义为:
[
\operatorname{Mod}{\theta}(Z)=Z+\operatorname{CausalConv1D}{\theta}(Z), \tag{1}
]
其中,(\theta) 表示卷积分支参数。
ModAttn 会把这种调制施加到 MLA 的压缩潜在分支上,包括 Q 分支和 KV 分支。随后,在 FlashAttention 完成全局聚合之后、输出投影之前,再进行一次类似的调制操作。
因此,ModAttn 是一种低侵入式增强方式:它不改变全局注意力接口,却可以把局部语义条件提前注入全局注意力计算。
效率分析
我们提出的 DSA-SWA 架构处于两类代表性方案之间:一类是同构 DSA 堆叠,例如 DeepSeek-V3.2;另一类是交替 FULL-SWA 堆叠,例如 Gemma 2。
与其重复完整复杂度表达式,表 1 对比了长上下文服务中几项主导成本随序列长度变化的首项系数,包括 Prefill FLOPs、Decode 阶段缓存读取量,以及 Decode 阶段缓存内存。
表 1:代表性长上下文注意力架构对比。FULL-SWA 与本文 DSA-SWA 均采用 1:2 的全局层与局部层比例。
| 成本 | 同构 DSA | FULL-SWA | DSA-SWA |
|---|---|---|---|
| Prefill FLOPs((S^2)) | (N{Indexer}_{head}D{Indexer}) | (\frac13N_{head}(D{MHA}_{QK}+D{MHA}_{V})) | (\frac13N{Indexer}_{head}D{Indexer}) |
| Decode 缓存读取((S)) | (D^{Indexer}) | (\frac13D_{KV}) | (\frac13D^{Indexer}) |
| Decode 缓存内存((S)) | (D_{KV}+D^{Indexer}) | (\frac13D_{KV}) | (\frac13(D_{KV}+D^{Indexer})) |
与同构 DSA 堆叠相比,我们的架构只在三分之一的层中使用 DSA,因此 Prefill 和 Decode 阶段的全局 Token 选择成本也按比例下降。
与交替 FULL-SWA 架构相比,DSA-SWA 用轻量索引加稀疏检索取代稠密全局注意力,把主导的二次复杂度计算从完整注意力表示转移到尺寸小得多的索引表示上,同时降低 Decode 阶段的缓存读取量。
因此,DSA-SWA 在 Prefill FLOPs、Decode 缓存读取与 Decode 缓存占用之间取得了更有利的平衡,非常适合长上下文在线服务。
其中,(N_{head}) 与 (N^{Indexer}{head}) 分别表示注意力头数量与索引器头数量;(D{MHA}_{QK})、(D{MHA}{V})、(D_{KV}) 和 (D^{Indexer}) 分别表示每个头的 Query/Key 维度、Value 维度、每 Token 缓存宽度和索引器维度。
2.2 混合专家(Mixture of Experts)
openPangu-2.0 进一步扩大了专家数量:Pro 版本包含 384 个专家,同时采用很高的稀疏度,即每次只激活 384 个路由专家中的 8 个。这对负载均衡提出了更严格要求。
为了让训练过程中的专家负载保持均衡,我们采用两个互补机制:
- 自适应无辅助损失负载均衡策略,负责整个全局 batch 范围内的均衡;
- 专家并行组(EP-group)辅助损失,负责控制每个 EP-group 内部的局部均衡。
自适应无辅助损失偏置
无辅助损失负载均衡会根据观测负载 (F_i) 与目标负载 (Q_i=1/N_r) 的差值调整每个专家的选择偏置 (b_i)。其中,(F_i) 表示整个全局 batch 中被路由到专家 (i) 的 Token 比例。
原始方法使用符号函数更新偏置,因此无论超载程度多大,修正幅度都相同。我们改用 RMS 归一化更新:
[
b_i \leftarrow b_i-\gamma\cdot \frac{F_i-Q_i}{\operatorname{RMS}(F-Q)},
]
其中:
[
\operatorname{RMS}(F-Q)=\sqrt{\frac{1}{N_r}\sum_{j=1}{N_r}(F_j-Q_j)2}. \tag{2}
]
这种更新方式保留了不同专家负载误差的相对大小,因此负载过高的专家会得到更强修正,而接近平衡的专家只会得到较小修正;与此同时,整体更新尺度仍由学习率 (\gamma) 控制。
我们的初步结果表明,相比非自适应基线,该方法能够实现更强的负载控制,同时保持相同收敛速度。详细实验对比见附录 A.3。
专家并行组辅助损失
如果在每个序列层面施加辅助损失,会对专家路由形成过强约束。因此,我们改为在一个 EP-group 内的所有 Token 上聚合负载统计量。
记 (f_i) 为被路由至专家 (i) 的 Token 比例,(p_i) 为路由器对专家 (i) 的平均概率,则损失定义为:
[
L_{ep}=\alpha_{ep}\cdot N_r\sum_{i=1}^{N_r}f_ip_i. \tag{3}
]
由于 EP-group 内的专家负载会直接决定其计算和通信成本,因此,该损失通过超参数 (\alpha_{ep}) 进行缩放,可以在维持专家并行效率的同时,施加比序列级辅助损失更宽松的局部约束。
2.3 流形约束超连接(mHC)
形式化定义
标准残差连接 (x+f(x)) 能有效缓解深层网络中的梯度消失问题,但这种简单的加法组合会降低主干网络中的信息流多样性,使深层之间的表示变得高度相似。
在 Hyper-Connections 的基础上,mHC 用 (n) 条并行残差流替换单一残差流,以解决这一问题。
对于每个子层,mHC 根据当前多流状态 (\bar h) 生成三组连接权重:
[
\bar{x}=\operatorname{RMSNorm}(\bar h),\quad [r_{pre},r_{post},r_{res}]=\bar{x}W_{mHC}, \tag{4}
]
[
H_{pre}=\sigma(r_{pre}),\quad H_{post}=2\sigma(r_{post}),\quad H_{res}=\operatorname{Sinkhorn\text{-}Knopp}(\operatorname{reshape}(r_{res},n,n)). \tag{5}
]
其中,(\sigma) 表示 Sigmoid 函数。(H_{pre}) 决定从哪些残差流读取信息作为子层输入;(H_{post}) 决定如何把子层输出写回残差流;(H_{res}) 控制残差路径上的跨流混合。
mHC 会对 (H_{res}) 进行流形投影,使其被约束为近似双随机矩阵。
稳定训练的归一化设计
在原始 mHC 位置设计下,(H_{pre}) 在 Pre-Norm 之前应用,而 (H_{post}) 在子层输出之后应用。我们观察到一种**门控坍塌(gate collapse)**现象:在训练过程中,网络早期层中的全部 (H_{pre}) 和 (H_{post}) 门值都会逐渐接近 0。
这会导致这些层从残差流中脱离,进而削弱训练信号。我们推测,该问题来自写回之前子层输出尺度不稳定。
openPangu-2.0 通过两级尺度控制机制稳定 mHC。
第一,在 (H_{post}) 写回之前,对子层输出应用 sandwich normalization,使 (H_{post}) 不再需要通过强烈压缩来抑制过大或不稳定的输出尺度。
第二,在第一层之后以及此后每隔五层,对残差流应用块级 Post-Normalization,显式限制多流主干随深度累积的尺度。
这些修改成功缓解了门控坍塌问题,并复现出原论文所报告的性能收益。如表 2 所示,稳定化后的 mHC 在下游任务上持续优于基线。
表 2:MoE15B-A2B 在训练 1T Token 后,mHC 与基线的下游评测。基线使用标准 openPangu-2.0 架构,但不包含 mHC。EN 和 ZH 是用于评估英文与中文基础能力的多任务 few-shot 测试集,覆盖阅读理解、知识问答等通用 NLP 任务。
| 模型 | EN | ZH | MMLU | CEval | BigBench | MATH | MBPP+ | 平均 |
|---|---|---|---|---|---|---|---|---|
| Baseline | 0.500 | 0.605 | 0.765 | 0.708 | 0.591 | 0.459 | 0.532 | 0.594 |
| mHC | 0.511 | 0.608 | 0.799 | 0.743 | 0.622 | 0.472 | 0.553 | 0.615 |
2.4 多 Token 预测(MTP)
openPangu-2.0 采用 MTP 进行投机解码。主模型携带额外辅助层,根据当前隐藏状态预测多个未来 Token。在推理过程中,这些辅助层可以为投机解码提出草稿 Token;当解码过程受内存带宽限制时,可以提升硬件利用率。
除了主干模型输出外,MTP 还引入 (D) 个预测层,分别用于预测未来的第 1 到第 (D) 个 Token。总训练损失定义为:
[
L=L_{main}+\sum_{k=1}{D}\lambda_kL_{MTP}{(k)}, \tag{6}
]
其中,(L_{main}) 为主干模型的交叉熵损失;(D) 为 MTP 层数量;(L_{MTP}^{(k)}) 表示第 (k) 个 MTP 层预测第 (k) 个未来 Token 的交叉熵损失;(\lambda_k) 为对应层的损失系数,用于平衡各预测头对总损失的贡献。
最终部署架构设置 (D=3)。这样既能给自投机解码器提供多 Token 草稿路径,又不会改变主自回归模型本身。
为了让辅助模块适用于长上下文,MTP 模块中的全部注意力都采用固定窗口大小为 2048 的 SWA。这样既能限制计算量与缓存增长,又能保留足够的局部上下文以生成高质量草稿预测。
训练策略
openPangu-2.0 使用阶段自适应的 MTP 调度策略。
- 在早期预训练阶段,只使用 1 个 MTP 层,损失系数较大,为 0.3,使模型在表示尚未完全形成时获得更密集的未来 Token 监督;
- 在推理阶段,损失系数降至 0.1,避免主推理目标被过度正则化;
- 在长上下文扩展阶段,MTP 扩展为 3 层,每层损失系数保持 0.1,总系数为 0.3,由此形成最终用于推理的自投机草稿层。
表 3:不同训练阶段的 MTP 层数与损失权重。
| 阶段 | 序列长度 | MTP 层数 D | 损失权重 λ |
|---|---|---|---|
| General Phase | 4K | 1 | 0.3 |
| Reasoning Phase | 8K | 1 | 0.1 |
| Annealing Phase | 32K、128K、512K | 3 | 0.3 |
2.5 Muon 优化器
openPangu-2.0 对所有矩阵形状参数使用 Muon 优化器。Muon 通过 Newton-Schulz 迭代对更新矩阵进行正交化,使更新步长的谱范数保持近似均匀。
这种方式能够避免稀有梯度方向被抑制,从而有利于学习长尾知识。此外,因为 Muon 只维护一阶动量,相比 AdamW,它可以把优化器状态内存减少一半。
实际训练中,所有二维及更高维度的权重张量都由 Muon 优化,而词嵌入、预测头、PAS 参数和一维参数,例如 RMSNorm 权重和 mHC 门控系数,则由 AdamW 优化。
对于 MLA 的 Query 和 Key-Value 上投影,我们会先把注意力头划分为四组,再应用 Muon。这种分组既符合注意力头在结构上的独立性,又能确保用于正交化的更新矩阵足够大,从而保持稳定。
Newton-Schulz 迭代采用固定迭代次数,同时针对每轮迭代定制系数,以更准确地逼近正交因子,具体见附录 A.4。
此前工作报告称,Muon 可能导致注意力 logits(即 (QK^\top))爆炸,从而引起训练不稳定。但 openPangu-2.0 的注意力 logits 在整个预训练过程中保持稳定。我们认为,这主要得益于 sandwich normalization 和 block post-normalization 等架构设计,它们显式约束了输出尺度。更多实验见附录 A.5。
2.6 Tokenizer
openPangu-1.0 的 tokenizer 采用传统 BPE 词表设计,根据 Token 共现频率构建。虽然这种方式对通用文本有效,但对于数字切分的一致性较差,同时在多语言和行业语料上的压缩率偏低。
对于多模态和智能体任务,这一问题尤其重要,因为数字经常用于表示坐标、边界框、索引以及工具参数。
openPangu-2.0 使用重新平衡后的中文、英文、代码、行业文档以及 188 种低资源语言混合语料重新训练 tokenizer。我们还重新设计了数字预分词方式,并评估两种方案:
- 3-digit 方案:保留适度数字压缩;
- single-digit 方案:把连续阿拉伯数字拆成单个数字,以形成统一的数字表示。
我们使用“每个 Token 平均覆盖的字符数”评估 tokenizer 效率,数值越高,表示压缩效果越好。
表 4:词表压缩率对比。
| 词表 | 词表大小 | 中文 | 英文 | 多语言 | 代码 | 行业 | 平均 |
|---|---|---|---|---|---|---|---|
| openPangu-1.0 | 153,376 | 3.82 | 4.30 | 2.80 | 2.80 | 4.18 | 2.56 |
| openPangu-2.0-3digit | 150,400 | 4.04 | 4.27 | 3.37 | 2.77 | 4.51 | 2.71 |
| openPangu-2.0-single-digit | 149,600 | 3.82 | 4.15 | 3.32 | 2.56 | 4.27 | 2.59 |
3-digit 方案取得了最佳总体压缩率,尤其是在中文、多语言和行业语料上表现突出。
尽管如此,openPangu-2.0 最终仍采用 single-digit 方案。虽然这种设计会带来小幅压缩损失,但它避免了多位数字因为频率差异而被不一致地合并,并能为数值推理、多模态定位以及工具调用场景提供更规则的数字级表示。
2.7 端侧模型
端侧模型采用总参数量 30B、激活参数量仅 2B 的 MoE 架构,从而能够在设备侧高效部署。
模型使用面向麒麟平台的量化和剪枝技术降低计算与内存开销,实现 50% 的推理速度提升和 20% 的内存占用下降。
针对稀疏 MoE 路由在资源受限设备上频繁切换专家的问题,我们设计了专家复用损失,鼓励相邻 Token 激活相似的专家集合,使专家切换频率降低 50%。
此外,专家激活预测会提前预测后续 Token 可能选择的专家,并主动预取这些专家,从而减少专家加载停顿,最高可把模型吞吐提升至原来的 5 倍。
这些优化共同让模型的计算、内存访问和专家调度方式与麒麟硬件特征匹配,从而获得高效的端侧推理能力。
3 预训练
3.1 数据构建
openPangu-2.0 的预训练语料约包含 34 万亿个高质量、多样化 Token,相比 openPangu-1.0 有显著升级。我们全面重构了数据构建流水线,大幅扩展语料规模并延长上下文长度。
为了优化学习过程,预训练被组织为三个阶段的课程式训练(curriculum)。每一阶段都采用专门的数据配方和选择策略,逐步塑造模型能力:
- 阶段 1:General,25T Token。 重点建立稳健的通用知识基础与广泛的语言能力。
- 阶段 2:Reasoning,8T Token。 重点强化深层推理、逻辑以及高级代码能力。
- 阶段 3:Annealing,1.4T Token。 进一步细化模型行为与智能体能力。我们刻意把长文档和复杂轨迹数据保留到最后阶段,以最大化模型完成自主任务的能力。
预训练语料汇集了大量不同来源,包括网页、书籍、PDF、多语言文本、代码仓库、STEM(科学、技术、工程和数学)文献、工业领域数据、智能体任务以及合成数据。
在 openPangu-1.0 基础上,我们尤其重视 ARC(Agent、Reasoning、Code)数据的规模、多样性与质量。为此,我们全面改造了基于规则的启发式方法,并引入稳健的模型评估流水线。
此外,我们利用多种评测环境生成并优化高保真的合成智能体轨迹,专门用于提升 openPangu-2.0 的智能体能力。
为了保留那些清洁度或流畅度评分较低、但包含有价值长尾知识的数据,我们训练了若干专用微调模型。这些模型在严格保持原始语义不变的前提下,对文本进行重写和格式标准化。
同时,语料中的每一篇文档都会被赋予丰富元数据,包括:
- 质量与难度评分;
- 主题类别;
- 教育价值。
这些细粒度标签会驱动高度策划的课程式采样策略,从而确保模型在每个训练阶段都接触到更合适的数据分布。
3.2 训练细节
openPangu-2.0-Flash 与 openPangu-2.0-Pro 采用相同的训练课程、辅助损失设计与优化器配置,两者主要区别仅在 batch size 与学习率调度。
训练课程
我们采用三阶段课程进行预训练。
第一阶段是 General 阶段:在 4K 序列长度下训练 25T Token。
对于 Flash 模型,前 500B Token 逐步把 batch size warm up 到 36M,同时把学习率提升到峰值 3.0×10^-4。之后 17T Token 保持该峰值学习率,最后 8T Token 使用余弦退火,把学习率降到 1.0×10^-4。
对于 Pro 模型,Token 调度保持一致,但 batch size warm up 到 64M,峰值学习率改为 2.0×10^-4。
第二阶段是 Reasoning 阶段:提高高质量 STEM 与代码数据占比,在 8K 序列长度下继续训练 8T Token,同时把学习率从 1.0×10^-4 通过余弦退火降到 3.0×10^-5。
第三阶段是 Annealing 阶段:依次把上下文长度扩展至 32K、128K 和 512K,分别使用 800B、400B 和 200B Token 训练,并把学习率从 3.0×10^-5 余弦退火至 8.0×10^-6。
主训练课程结束后,我们通过 DSA 引入稀疏注意力。首先在 8B 重放 Token 上进行短暂稠密 warm-up,学习率为 1.0×10^-3;随后使用 100B 重放 Token 做稀疏训练,学习率为 8.0×10^-6。
辅助配置
对于 MoE 负载均衡,我们同时使用:
- 自适应无辅助损失均衡,更新学习率为
1.0×10^-3; - EP-group 辅助损失,权重为
2.0×10^-4; - router z-loss,权重为
1.0×10^-6。
这些均衡约束只在 General 阶段启用,之后关闭。
对于 MTP:
- General 阶段使用 1 层,损失权重 0.3;
- Reasoning 阶段仍使用 1 层,但损失权重降为 0.1;
- Annealing 阶段扩展到 3 层。
随着上下文长度扩大,我们逐步增大 RoPE base:
- 4K 序列:10K;
- 8K:100K;
- 32K:400K;
- 128K:1.6M;
- 512K:6.4M。
对于 mHC,我们配置 4 条并行残差流,并使用 20 次 Sinkhorn-Knopp 迭代完成流形投影。
优化器配置
针对不同参数组,我们同时使用 Muon 与 AdamW。
AdamW 参数为:
- (\beta_1=0.9);
- (\beta_2=0.95);
- (\epsilon=1.0\times10^{-8})。
Muon 采用动量 (\mu=0.95),并使用 Nesterov 加速。为了让 Muon 的更新 RMS 尺度与 AdamW 接近,我们把其更新乘以 (\gamma=0.2),这样两种优化器就可以共享同一套学习率调度。
除词嵌入和 RMSNorm 权重外,对所有参数应用全局权重衰减 (\lambda=0.1)。
3.3 训练基础设施
openPangu-2.0 延续了 openPangu-1.0 的训练基础设施,但升级后的模型架构引入了一类全新的系统挑战。
当上下文窗口扩大到 512K,同时叠加 mHC、Muon、MTP 与 ModAttn 等新组件后,系统会面临:
- 极其复杂的分布式通信;
- 严重的激活内存压力;
- 新算子缺乏高效的昇腾原生实现。
为了突破这些瓶颈,我们围绕三个方向构建了一套综合优化框架。
通信重叠与通信效率
系统消除混合 CP 中的冗余通信,为 MTP 使用轻量级 P2P 协议,并为 Muon 引入分布式计算—通信重叠。
面向超节点的并行
并行配置策略利用 CloudMatrix 384 的超节点亲和分组。核心原则是把 TP、CP 与 EP 等大流量通信严格限制在超节点内部,以利用高带宽 super-plane。
算法与硬件协同设计
我们为 mHC、PAS 和 ModAttn 开发定制 AscendC 融合算子,提供硬件原生加速。为了缓解内存压力,还针对 mHC 实现了层内与层间混合重计算。
通过隔离超节点内部的大流量通信与外部链路,并把参数网络通信与计算重叠,这套协同设计可以消除节点间瓶颈,最大化硬件吞吐。
3.3.1 面向昇腾优化的 mHC 训练
mHC 会带来真实的系统开销,包括更高的内存占用、更重的流水线级间通信,以及稠密张量计算时 Vector 处理器的吞吐瓶颈。我们针对这些问题进行了专门优化。
mHC 层内 / 层间重计算
mHC 激活内存会随模型规模线性增长,限制 batch size 和长序列训练。为此,我们提出两种细粒度选择性重计算机制。
层内重计算仅缓存三类张量:
- Attention 的主干输入;
- Attention 输出;
- MLP/MoE 输出。
它通过与层内通信重叠来隐藏重计算开销,主要面向不使用流水线并行(PP)的配置。
对于使用 PP 与虚拟流水线并行(VPP)的情况,我们采用跨层重计算:每个 chunk 只缓存第一层的 Attention 输入,其余内容在通信空闲时隙中递归恢复,因此不会增加额外 FLOPs,也不会影响迭代时间。
两种方案的核心机制一致,只是跨层方案针对 PP 改变了重计算时机,可以根据资源和训练目标灵活选择。
mHC 下的 PP 通信优化
在 PP 场景中,mHC 与多头 MTP 都会放大隐藏状态:mHC 的放大量来自残差流数量,MTP 的放大量来自预测头数量。
为解决这一问题,我们只在 PP 边界上传输主分支状态,并在目标 stage 本地展开 MTP 输入。具体做法将在 3.3.4 节“多 Token 预测训练的负载均衡”中进一步介绍。
昇腾亲和的 mHC 融合算子
我们使用 AscendC 实现 (H_{pre})、(H_{post}) 和 (H_{res}),重点优化 Vector 计算。
为了避免不同执行阶段串行造成硬件空闲,我们采用预取策略,消除 Vector 流水线等待 CUBE 结果造成的 stall,实现 Vector 与 CUBE 流水线的深度重叠。
再结合多级层次化细粒度并行、减少 workspace 数据搬运以提高 L2 cache 命中率,以及让预取与计算重叠,我们可以有效隐藏内存延迟,使单算子性能逼近峰值。
基于对内存受限与计算受限特征的联合分析,我们以矩阵维度 (n) 为阈值,在 Vector Core 与 CUBE Core 之间动态切换计算。这种卸载方式可以平衡两类计算单元的瓶颈并提高硬件利用率。
在底层指令调优方面,我们在 Vector Core 上采用标准的 Muls + Axpy 指令序列实现高精度 FP32 矩阵乘法,在不牺牲精度的情况下充分利用 Vector Core 吞吐。
3.3.2 512K 上下文训练
上下文并行(CP)是把 Transformer 扩展到超长序列训练的关键。
Ulysses CP 虽然高效,但它按照注意力头进行切分,因此要求注意力头数量能被 CP degree 整除。更关键的是,它与昇腾 NPU 上的 sparse flash attention(SFA)算子结合效果不佳,因此不适合 DSA 训练。
为此,我们在稀疏注意力训练阶段默认使用 KV Context Parallelism(KV CP)。KV CP 按序列维度而不是注意力头进行切分,因此可以完整兼容底层稀疏注意力算子。
对于全注意力训练,我们提出 Hybrid CP,把 Ulysses 与 KV CP 结合起来,既绕开头数整除约束,又相比纯 KV CP 大幅降低通信量和 KV buffer 峰值占用。
这套框架能够支持 512K 上下文稳定训练,但上下文扩展到这一规模后仍暴露出两个关键瓶颈:
- 序列并行带来的冗余 KV 通信;
- 如何在 DSA 训练中高效加入 PAS。
KV CP 冗余通信优化
标准 KV CP 会沿序列维度从所有 rank 收集全局 KV Token,但每个 rank 的 Query 实际只需要其中一部分数据。对于长上下文训练,尤其是一个全局训练样本中打包了多个短文档时,会产生大量冗余通信。
我们分别针对 SWA、全注意力(FA)和 DSA 层做专门优化。
在 SWA 层中,某个 rank 的 Query 只需要关注前一个 rank 的最后一个窗口大小的 KV 张量。因此,我们用定向 P2P 替代全局 AllGather:每个 rank 只接收前一 rank 必需的窗口张量,并把自己的对应数据传给下一 rank。
通信量由:
[
S\cdot B\cdot H
]
降低为:
[
W\cdot B\cdot H,
]
其中 (S) 为完整序列长度,(W) 为滑动窗口大小,(B) 为 batch size,(H) 为 hidden dimension。
在 FA 和 DSA 层中,Query 只需要来自此前 rank、且与当前子序列属于同一子序列的 KV,而不需要所有 rank 的 KV。因此,我们以 AllToAllV 替代 AllGather,消除冗余通信,如图 2 所示。
这样,每个 rank 都只精确发送和接收当前子序列真正需要的 KV 片段。
图 2:CP=4 时的 AllToAllV 通信。
FA Rescale
PAS 本质上是一组可训练的 Key-Value 参数,可以理解为永久添加在每条序列前部的注意力锚点。
如果底层算子原生支持,融合 PAS 算子效率最高,但这种实现缺乏适应不同训练环境所需的通用性。为此,我们提出 FA Rescale 作为灵活 fallback。
该方法调用两次标准 Attention,然后重建“主序列 + sink Token”一次性共同计算注意力时的结果。
设 (A) 与 (B) 分别表示主序列和 PAS 的 logit 分区,(O(X)) 表示分区 (X) 的 Attention 输出。FA Rescale 分别处理两个分支,再按照下式合并:
[
O(A+B)=O(A)\alpha_A+O(B)\alpha_B. \tag{7}
]
对于 (X\in{A,B}),缩放系数为:
[
\alpha_X=\frac{l_X\exp(m_X-m*)}{l_A\exp(m_A-m)+l_B\exp(m_B-m^)}, \tag{8}
]
其中 ((m_X,l_X)) 分别是每次 FA 调用返回的 softmax 最大值与 softmax 求和统计量,且:
[
m^*=\max(m_A,m_B)
]
用于提高数值稳定性。
该方法在数学上等价于对 (A+B) 做一次全局 softmax,因此完全绕过 FA kernel 对 sink 的原生支持需求。只要缩放因子以 FP32 保存,在 FP32 范围内该变换完全无损,只有可以忽略的 BF16 舍入误差。
FA Rescale 的部署灵活性很高,因为它完全建立在标准 FA 调用之上,不增加额外内存,也没有可测量的计算开销。
对于 DSA 训练,这一点尤其重要。DSA 需要不含 sink 污染的稀疏注意力统计量来计算 KL 散度损失。FA Rescale 可以让 SFA 只处理主序列,同时用一次轻量 FA 调用处理 sink 分支,再通过公式(7)和(8)合并输出。
这样既可以完整加入 PAS,又不会污染 KL loss,也不需要额外执行一次不含 sink 的 SFA。
3.3.3 分布式 Muon 优化器
Muon 通过对动量矩阵进行 Newton-Schulz(NS)正交化,实现对称性和曲率适应。与逐元素优化器相比,它面临三个主要挑战:
- NS 计算依赖完整权重矩阵,因此需要较大的 NS 输入聚合通信;
- NS 迭代受到 Host 侧调度限制,调度开销明显;
- 不同 rank 之间存在严重的权重冗余计算。
为解决这些问题,我们基于 DDP bucket 实现提出一个通信—计算联合优化方案,称为 HyperParallel Muon+。
NS 输入聚合通信优化
为了降低聚合开销,我们提出两种聚合策略:AllGather 和 AllToAll,并在 DDP bucket 的 ZeRO 场景中实现。
在 DDP bucket ZeRO 场景下,权重分布在不同 bucket 中,ZeRO 会把每个 bucket 均匀切分。只有位于分区边界的权重数据需要通信。
AllGather 作为基线方案,会聚合整个 bucket,使每个 rank 都持有完整 bucket 权重,从而可以提取 NS 迭代所需参数。每个 rank 只处理自己本地分区内的权重,但边界权重会被多个 rank 冗余计算。
当 bucket 很大、其中包含多个完整参数,仅边界参数不完整时,AllGather 会产生明显通信冗余。此时我们使用 AllToAll:先提取边界参数,并排除本地已经完整的参数,然后只在相邻 rank 间交换边界参数,即使用 AllToAllV 语义。
不过,AllToAllV 属于 P2P 通信原语,在跨超节点的大规模集群上会消耗大量队列缓冲资源,因此不能无限制使用。
为解决 AllToAllV 的跨 plane 队列溢出问题,我们借鉴 DeepEP 的两层通信设计,把数据并行(DP)域拆分为二维拓扑:
[
DP_{outer}\times DP_{inner}.
]
外层维度使用对称 AllGather,支持跨 hyperplane 扩展;内层维度使用细粒度 AllToAllV,并把交换范围限制在可控域内。
Bucket 级通信—计算掩蔽优化
为了隐藏 Host 侧调度开销,我们实现 bucket 级通信—计算 overlap。
当前 bucket 的异步通信在后台执行,同时对前一个 bucket 进行动量/更新矩阵正交化和参数更新,两者在时间轴上重叠。
如图 3 所示,Bucket (i) 的通信与 Bucket (i-1) 的计算重叠。第一个 bucket 的通信和最后一个 bucket 的计算无法被掩蔽,是不可避免的暴露开销。
当通信延迟小于或等于计算延迟时,通信开销可以被完全隐藏,此时端到端运行时间仅由纯计算决定。
这种 overlap 的收益取决于 bucket 粒度、网络带宽与计算密度之间的关系:小规模集群通常能够充分隐藏通信,而在大规模集群中,通信更容易成为瓶颈。
图 3:Muon 通信与计算重叠。
3.3.4 多 Token 预测训练的负载均衡
MTP 会增加额外的计算、内存与 PP 通信成本。当 MTP 与 mHC 同时使用时,这些问题会进一步放大,因为 mHC 把单条残差流扩展为多条并行残差流。
朴素实现会在 PP 边界传输与 (n\times D) 成比例的 MTP 状态,其中 (n) 表示残差流数量,(D) 表示预测头数量。同时,如果把全部 MTP 层、输出投影和 loss 计算都集中在流水线末端,还会造成严重尾部 stage 瓶颈。
openPangu-2.0 通过三项互补优化解决这些问题。
第一,普通 PP 边界只传输经过 mHC 扩展后的主干 hidden state 及其梯度。MTP 辅助状态在包含第一个 MTP 层的 stage 本地生成,其梯度也只保留在实际消费它们的 stage 内。
对于三头 MTP,这会把有效 PP payload 从四条流——一条主干流加三条预测流——减少到一条主干流,因此 MTP 相关 P2P 通信降低 75%。
当使用两条 mHC 残差流和三个 MTP 头时,也可以避免朴素设计约 6 倍的通信放大。
第二,MTP 层直接参与 PP/VPP 布局,而不是全部堆到最后一个 stage,从而把 MTP 计算分散到多个流水线 stage。
第三,把最后一个 stage 的输出投影和 loss 计算拆成多个序列 chunk。每个 chunk 完成前向后立即执行反向,然后释放 logits。
如果拆为 (C) 个 chunk,理论上峰值 logits 驻留内存可以接近完整序列方案的 (1/C),实际值取决于缓冲与调度开销。
这三种优化分别从通信、计算和内存三个角度缓解 MTP 训练瓶颈。在 openPangu-2.0 的训练配置下,相比未均衡的 MTP 布局,优化布局可以让训练吞吐提升约 20%。
3.3.5 ModAttn 的系统级优化
ModAttn 通过滑动窗口卷积和 masking 增强 openPangu-2.0 的 MLA。为了处理超长序列部署中的三类问题——跨节点边界精度损失、激活内存爆炸以及数据搬运瓶颈——我们从三个方面重构系统。
无冗余邻域通信
序列并行会截断 ModAttn depthwise convolution 的边界信息。为了高效获得跨设备上下文,我们不用复杂 P2P 或冗余 AllGather,而改用 All-to-All 通信。
每个计算节点提取自己的右边界激活,并路由给相邻的下游节点。接收节点在前向过程中拼接这些数据,恢复完整感受野,如图 4 所示。
这种方案可以保证与单卡计算完全等价,不引入精度损失。
图 4:ModAttn 无冗余邻域通信。
无冗余激活重计算
为了降低内存压力,我们在前向结束后立即丢弃经过 padding 的 FlashAttention 输出 pad_attention,不再缓存。反向传播时,系统使用保留的 attention_out 动态重新执行 zero-padding。
在 BF16 精度下,该策略每层可以节省:
[
\frac{B\times S\times H}{TP\times CP}\times 2\ \text{bytes}
]
的激活内存,其中 (B)、(S)、(H) 分别表示 batch size、序列长度和 hidden dimension,TP 与 CP 分别表示张量并行度与上下文并行度。
这可以显著降低 OOM 风险,而新增计算开销可以忽略。
定制算子融合
一维因果卷积本质上受内存带宽限制。如果使用传统 NPU Cube 单元执行,会产生大量数据转置,有效计算时间只占约 5%。
因此,我们直接使用 Vector 单元执行逐元素乘加运算,保持原始数据布局不变。
同时引入 Rolling State Machine(RSM),利用片上寄存器 y0、y1、y2 形成流水线式 Token 处理,其中这三个变量对应常驻寄存器的滚动状态。
这种方式从根本上消除数据搬运开销,大幅提高缓存利用率,使该模块计算时间减少 79%。
4 后训练
4.1 监督微调(SFT)
在监督微调阶段,我们使用 512K Token 上下文长度,以保留长上下文能力。
openPangu-2.0 的 SFT 数据集采用双模式融合策略,同时整合 thinking mode 与 non-thinking mode 数据。
为了保证监督数据质量,我们围绕四个核心领域采用专门的数据构建策略。
| 数据领域 | 构建策略与特点 |
|---|---|
| 推理 | 优先保证完整思维链和可解释性。每个样本包含显式中间步骤、逻辑依据和严格结果验证。 |
| 通用对话 | 使用多维评估量表进行筛选,确保回答逻辑清晰、简洁,并与人类偏好高度一致。 |
| 代码 | 数据来自真实 Issue / Pull Request 对,并经过严格过滤。使用多语言大规模可验证执行环境,尤其强调面向 HarmonyOS 开发的 AscendC 与 ArkTS。 |
| 长轨迹智能体 | 使用多阶段流水线生成。模型在真实 HarmonyOS 环境和模拟沙箱环境中,通过不同 Agent Harness 执行复杂任务,覆盖工具使用、技能使用、文件操作和编码等能力。 |
质量控制
对于轨迹中的错误步骤,我们通过环境反馈与奖励模型进行识别,并在训练时 mask 掉这些错误 transition,使模型只从高质量、正确动作中学习。
4.2 并行强化学习专家训练
由于任务结构异构、反馈信号冲突,把强化学习直接应用于通用大语言模型是一件困难的事。
例如,代码任务通常有二元且可验证的结果,而通用对话往往是开放式和主观的。如果在同一个 RL 阶段同时优化这些目标,很容易出现领域干扰与信号不平衡。
为此,我们采用并行专家训练策略,分别训练领域专用策略。这样可以把不同领域的策略优化分离开,让各专家独立更新,同时减少跨领域干扰。
所有专家策略都使用 Group Relative Policy Optimization(GRPO)优化,并且不使用 KL 正则项。
4.2.1 推理 RL
推理 RL 最适合使用可验证、难度适中且多样化的任务。我们覆盖四类任务:
- 数学;
- 科学;
- 逻辑游戏;
- 工具集成推理。
候选数据池通过以下步骤筛选:
- 质量过滤:使用 LLM 评估器评价问题表述,丢弃质量较差的 Prompt、多部分子问题以及答案含糊的样本;
- 多样性平衡:给剩余问题打上多层级学科标签和细粒度知识点标签,保证数据分布均衡。
对于工具集成推理,例如异步 Jupyter 环境,我们还会针对交错思考过程中的 Python 解析错误施加惩罚,并 mask 掉此前已经正确的轮次,使惩罚只作用于最后一个错误。
4.2.2 通用 RL
General RL 面向各种用户侧开放任务,其中通常存在多个有效回答。我们重点优化四类核心能力:
- 指令对齐:严格遵循系统 Prompt 与上下文中的显式和隐式约束;
- 事实可靠性:减少幻觉,拒绝无依据断言,同时抑制过度拒答;
- 长上下文理解:在不丢失长程依赖的前提下,定位、整合并推理分散信息;
- 交互质量:保证多轮对话连贯、简洁、自然。
为覆盖这些异构目标,我们构建了在任务类别、语言、交互格式和难度上都具有多样性的 Prompt 混合数据。
奖励系统同样采用混合形式:
- 对确定性约束使用规则奖励;
- 对细粒度语义质量使用生成式奖励模型。
4.2.3 智能体 RL
Agentic RL 专家负责学习在不同沙箱环境中的长程规划与工具使用。
为了保证对真实世界环境的适应性,训练环境被视为黑盒系统。在 Agentic RL 中,我们采用多项成熟或定制技术,提高训练稳定性和样本效率:
- Token-in-Token-out(TITO):消除轨迹生成与策略更新之间的分词不一致,稳定梯度;
- 在线动态过滤:持续跟踪每个样本的 pass rate。长期稳定被解决的样本会动态移出训练循环,使模型始终处于自身学习前沿;
- 语法惩罚:格式错误的工具调用,例如缺失参数或非法 JSON,会立即触发明确格式错误惩罚;
- 可验证评测:奖励由训练循环之外的客观执行结果决定,显著降低 reward hacking 风险;
- Warm-Start 初始化:Agentic RL 从 General RL checkpoint 初始化,利用其更强的指令遵循与格式正确性基础。
4.2.4 代码 RL
为了构建稳健的软件工程与终端交互能力,我们让 RL 数据经过一个专用黑盒框架。
Gateway Server 位于 Agent Harness 与推理引擎之间,把 Agent 逻辑与 RL 数据流解耦。它负责捕获 Token 级数据,包括 Prompt、Completion 和 Logprob,并重建完整训练轨迹;训练同样使用 TITO 保持稳定。
随着代码能力增强,reward hacking 的风险也会增大。为此,我们额外引入自动化辅助监控 Agent,实时跟踪奖励分布与轨迹模式。
该监控 Agent 会标记异常、输出可解释告警,并提供可操作诊断信息,以便快速优化奖励设计,从而提升训练稳定性。
4.3 多专家 On-Policy 蒸馏
在分别优化多个 RL 专家模型之后,我们使用 On-Policy Distillation(OPD)把它们互补的能力重新融合到一个统一模型中。
蒸馏 Prompt 从各 RL 专家训练阶段使用的数据集混合中采样。对于每一个 Prompt,我们首先使用当前策略生成一条轨迹,然后调用对应领域专家,对轨迹中的每个 Token 提供监督。
OPD 复用 RL 的训练目标,但把 advantage 替换为所选专家与当前策略之间逐 Token 的 log probability 差值:
[
A_{i,t}=\operatorname{sg}\left[
\log\frac{\pi^{train}{\theta{expert}}(y_{i,t}\mid x_i,y_{i,<t})}
{\pi^{train}{\theta}(y{i,t}\mid x_i,y_{i,<t})}
\right],
]
其中,(\operatorname{sg}[\cdot]) 表示 stop-gradient;(\pi^{train}{\theta}) 与 (\pi^{train}{\theta_{expert}}) 分别表示由训练引擎前向计算得到的当前策略和样本 (i) 对应专家。
这与 GLM-5 的做法不同。GLM-5 报告的是从推理后端读取专家概率,并提到未来会从 (\pi^{infer}{\theta{expert}}) 迁移到 (\pi^{train}{\theta{expert}})。
我们还对 advantage 加入轻量正则,以把学习集中在信息量更大的 Token 上,并提高优化稳定性:
- mask 掉 advantage 接近 0 的 Token;
- 对异常大的 log-ratio 进行裁剪。
计算优化
为了减少 advantage 计算所需的 NPU 资源,我们不为每个专家单独分配一组 NPU,而是让多个专家依次加载到共享 NPU 池中。
Rollout 完成后,样本按照对应专家分组。然后依次加载每个专家的权重,并对该组全部样本通过训练引擎前向计算专家 log-probability。
这样既不需要让所有专家同时常驻设备,又能保持相同的逐 Token 评分过程。
4.4 解决训推不一致问题
4.4.1 当前实践
下面介绍我们当前用于缓解训练—推理不一致的具体机制。事实上,没有任何一种方法能够覆盖所有场景,因此实际使用时会根据模型架构、硬件配置与观测到的不一致程度组合使用。
FP16
实践中,我们发现从 BF16 切换到 FP16 是有效的。
为解决 FP16 动态范围较小可能造成梯度下溢的问题,我们集成成熟的动态 loss scaling:
- 每次反向传播前,用缩放因子 (S) 乘以 loss,提高梯度幅度;
- 反向传播后、梯度裁剪前,通过 unscale 恢复梯度真实大小;
- 如果任意梯度中出现 Inf 或 NaN,即发生溢出,则跳过当前优化器 step,并把 (S) 减半。
KPop
在主线 RL 训练中,我们基本使用 KPop 取代 IcePop 与传统 Rejection Sampling,把它作为主要校正机制。原因是 KPop 较为轻量,并能覆盖较广范围的训练—推理不一致。
实践中,我们设计了 shadow hyperparameter 机制。在不同训练场景的最初几步中,同时评估多个候选 (\phi) 值,以预估不同设置的 masking 行为,再确定最终配置。
当训练与 rollout 的 Pearson Correlation Coefficient(PCC)低于 0.99 时,我们采用更严格的 KPop mask;当原始 train-rollout PCC 已经高于 0.99 时,则选择更宽松的 (\phi),避免不必要过滤,并保留模型的探索能力。
最佳 (\phi) 取决于具体训练任务,最终应结合奖励轨迹、训练稳定性以及其他能够反映 KPop 对稳健性与最终性能收益的指标综合决定。上述规则主要作为 RL 早期阶段的 cold-start 启发式方法。
Rollout Routing Replay
我们的 Rollout Routing Replay(R3)基于 VeRL + vLLM 社区方案实现,并做了以下增强。
- 从推理引擎流式传输路由专家信息。 推理引擎通过现有 OpenAI 兼容 streaming API 增量发送路由记录,把带宽压力分摊到整个生成时间线上,而不是集中在生成结束时。
- 可扩展数据传输。 社区方案会把路由记录直接嵌入 DataProto,并依赖 Ray 传输数据,在大规模场景中容易成为瓶颈。我们只把元数据写入 DataProto,并使用 HCCL 高效传输路由记录,同时避免不必要的序列长度 padding。
- Masked R3。 在大规模训练中,我们观察到随着 MoE 层加深以及序列逐 Token 向后推进,hidden state 会产生累积差异和严重漂移。在这种情况下强制完整专家 replay 会严重扭曲输出 logits,使 PCC 大幅下降,甚至触发梯度爆炸或训练发散。为缓解这一问题,我们设计自适应阈值机制来量化路由漂移并动态生成 routing replay mask。只有当训练时提出的专家选择与推理时记录的专家选择之间的重合程度超过可调阈值时,才对该 Token 进行 replay。该方法尤其适用于深层 MoE 和长序列输入,可提高训练与 rollout 的一致性。
- Cached R3。 智能体 RL 通常需要多轮推理。当前轮生成的 Token 会在下一轮重新经历 Prefill,但新的 Prefill 可能给同一个已生成 Token 产生不同专家路由。Cached R3 会保存每个 Token 首次生成时的专家路由选择,并在训练时 replay 这些缓存路由。
4.4.2 训推不一致的根因分析
在异步 RL 实验中,我们发现上述机制并不总能充分解决 mismatch,因此进一步进行了全面根因分析。以下分类为后续严格一致方案提供诊断基础。
RL 中的训推不一致来自系统栈不同层级的异构因素。经过系统分析,我们按失效模式把它们分为三类:
- 显式定义不一致:数学上本身不等价;
- 计算图重排不一致:数学表达式等价,但由于浮点运算顺序变化产生数值差异;
- 硬件调度非确定性:由于昇腾 NPU 微架构执行产生 run-to-run 差异。
类别 A:显式定义不一致
高性能 RL 训练框架,例如 VeRL,通常采用“双引擎”架构:训练侧建立在 Megatron-LM 等大模型训练框架上,推理侧则集成 vLLM 等高度优化的推理引擎。
这意味着系统必须分别维护训练侧和推理侧两套独立模型定义脚本。在双重定义下,底层模型细节和配置参数出现细微差异几乎不可避免,由此直接造成数学上不等价的计算。
类别 B:计算图重排不一致
训练强调吞吐和反向传播效率,推理强调低时延,因此即使数学表达式相同,两侧也会采用不同加速策略,并改变浮点运算顺序,引起数值偏差。
我们把这一类问题进一步归因于三个来源:
- 部署策略:同一模块选择不同算法变体。例如 MLA 在 Decode 时使用 Absorptive(MQA)模式,而训练 / Prefill 使用 Non-Absorptive(MHA)模式;又例如 MoE 专家在训练中按 Expert-ID 升序累加,而推理时按 Top-k score 降序累加。
- 并行策略:训练和推理倾向使用不同并行方式,从而同时改变浮点累加精度和累加顺序,引起数值差异。
- 融合算子:Kernel fusion 会隐式改写底层计算图和数值精度。如果训练与推理对同一模块使用不同 kernel,就会直接引入数值不一致,例如不同 FlashAttention 家族、MoE dispatch/combine kernel,以及 sampling 算子差异。
类别 C:硬件调度非确定性
Kernel 的动态执行策略,即 Tiling,是最深层也最隐蔽的不一致来源。
为了加速 Decode,推理通常会启用 dynamic batching、KV Cache、ChunkedPrefill、APC 等机制。这意味着对于完全相同的 Token 位置,训练侧处理的是完整 2D / 3D 张量,而推理侧处理的是分块或单步 1D 张量,因此无法在 Batch 与 Sequence 维度保持一致。
NPU 会根据输入 shape 自动选择 Tiling 策略,从而通过以下机制引入 run-to-run 的非确定累加:
- SplitK:把 K 轴累加拆分到多个 AI Core,例如 MatMul、FlashDecoding;
- K 轴 swizzling:交错内存访问以提升 HBM 带宽,例如 MatMul;
- AtomicAdd:多个 Core 异步汇总,Core 到达顺序具有随机性,例如 AllReduce;Ring / Tree 等面向拓扑的算法还会进一步产生差异。
更细粒度的算子级与输入 shape 级实现差异见附录 A.6。
4.4.3 昇腾架构下完整训推对齐方案预览
为了在昇腾 NPU 上消除上述差异,并实现端到端训练—推理一致,我们设计了一套逐层渐进式白盒对齐方法。
前提是:关闭随机采样,启用确定性通信以冻结生成行为,并让训练侧和推理侧的并行策略完全一致。
整个对齐方法分为两个难度逐步增加的阶段。
- 阶段 I:Prefill 对齐。 Prefill 的全序列计算在数学上与训练前向更接近,因此主要解决类别 A 与 B。
- 阶段 II:Decode 对齐。 Decode 的单步、shape 不一致计算会触发更深层的类别 C 问题,因此需要直接干预 kernel。
阶段 I:训练前向与推理 Prefill 的严格对齐(类别 A 与 B)
Prefill 与训练前向具有相同输入序列,因此最适合作为建立一致性基线的起点。
如附录图 13 所示,我们首先开发一个面向昇腾的 tensor hook,分别捕获训练前向与推理 Prefill 各层输出张量,并导出为原始 binary 文件。
随后使用高精度二进制差异比较,逆向定位数值分叉点,从而修正类别 A 中的显式代码错误和参数错误。
对于类别 B 的算子行为差异,我们进一步把训练和推理双方的 FlashAttention 重新实现到同一个算子中,该算子已在 omni-ops 中开源,从而让两侧行为完全一致。
阶段 II:推理 Decode 与训练前向的深层算子对齐(类别 C)
Decode 的“单步迭代”和训练的“完整序列并行”之间存在严重 shape 差异,会触发类别 C 的非确定性。仅靠配置无法解决,需要直接修改算子实现。
如附录图 14 所示,我们首先在训练侧构造“原始 Prompt + 第一个 Token”的输入,把长序列拆成单步结构,对齐训练和推理的语义边界。
随后利用开源 CANN 算子直接修改 kernel 的 Tiling 策略,例如约束 SplitK,并统一多核并行时的累加轴和累加顺序。完成后重新编译并部署定制安装包,从而消除输入 shape 突变造成的底层数值漂移。
这两个阶段覆盖了完整的训推不一致来源,并按由浅入深的顺序推进:
- 从表层代码定义差异;
- 到算子行为差异;
- 再到底层 kernel 数值漂移。
系统栈每一层都与其对应侧进行严格钉合,最终可以在固定并行配置下,使训练和推理达到足够高的一致性,并为后续昇腾 NPU 部署提供一套完整白盒、可复现的一致性基线。
5 评测
我们在多类公开基准上评测 openPangu-2.0,覆盖通用、推理、智能体和代码能力。
openPangu-2.0 在广泛通用能力和 STEM 推理任务上表现具有竞争力。在智能体基准上,openPangu-2.0-Pro 在技能使用、Agent 搜索以及多类 Claw 任务上表现出较强能力。
对于代码任务,模型在基础代码问答和功能实现方面表现良好,但处理复杂、真实世界软件工程流程时,与顶级模型仍存在明显差距。
除了公开 benchmark,我们还利用内部评测 harness 展示 openPangu-2.0 的实际应用价值,包括端到端深度研究与交互式可视化,以及自主生成全栈应用。
5.1 公开基准评测
5.1.1 通用与推理
对于通用能力:
- Instruction Following:使用 IFEval、IFBench、AgentIF 和 SysBench,覆盖可验证约束与复杂系统级指令;
- Factual Reliability:使用 SimpleQA Verified 与 Chinese-SimpleQA,测试短答案事实准确率与幻觉;
- Long-Context Understanding:使用 CL-Bench,重点评估模型从任务特定上下文中学习和推理的能力;
- Multi-turn Interaction:使用 MultiChallenge,测试多轮对话中的指令保持与一致性。
推理能力使用以下 benchmark:
- Humanity’s Last Exam(HLE)文本子集;
- AIME 2026;
- HMMT 2026;
- IMO-AnswerBench;
- Apex;
- GPQA-Diamond;
- BBEH。
从表 5 可以看到,openPangu-2.0-Flash 和 openPangu-2.0-Pro 在广泛通用基准上都取得了较强表现,涵盖上下文学习、指令遵循和多轮理解。
在世界知识与事实可靠性任务 SimpleQA Verified 和 Chinese-SimpleQA 上,openPangu-2.0-Pro 表现更强,整体优于 openPangu-2.0-Flash。
在 STEM 推理任务中,openPangu-2.0-Pro 也取得了有竞争力的成绩,并且在 Apex、HLE、IMO-AnswerBench 和 HMMT 2026 等复杂任务上明显优于 Flash。
5.1.2 通用智能体与代码
智能体 benchmark 包括:
- Agentic Tool / Skill Use:Tau2-Bench、MCP-Atlas、SkillsBench;
- Claw-oriented 与真实世界任务:PinchBench、WildClawBench、Claw-Eval、GDPVal;
- Agentic Search:BrowseComp。
SkillsBench 使用 OpenCode 作为 harness。Claw-Eval 只评估非多模态 split。
对于 GDPVal,我们使用公开 GDPVal 数据集和评分 rubric,在 GDPVal-AA v2 scaffolding 上进行内部评测,并使用逐任务 point-wise 评分。
对于 BrowseComp,我们采用文献 [15] 中的 discardall 上下文管理策略,最大迭代次数为 300。
代码任务包括:
- LiveCodeBench V6:代码函数生成;
- FeatBench:功能实现;
- DeepCodeBench:代码问答;
- SWE-bench Verified:软件工程。
DeepCodeBench 与 FeatBench 使用 OpenCode scaffolding,SWE-bench Verified 使用 OpenHands scaffolding。
表 5 显示,openPangu-2.0 在技能使用、Agent 搜索和多类 Claw 任务上具备较好能力;在基础代码问答 DeepCodeBench 和功能实现 FeatBench 上也表现不错。
不过,在复杂智能体任务和复杂软件工程任务上,与第一梯队模型相比仍存在一定差距。
内部实验还表明,较强的通用知识和推理基础,有助于模型学习更复杂的智能体与代码行为。反过来,在多样化智能体环境中训练,也会强化指令遵循、长轨迹上下文处理、多步推理与程序化规划等基础能力。
我们最终发现,在 mid-training 和 post-training 两个阶段同时扩大高质量、多样化的长轨迹智能体数据和交互环境非常有利,因此这也将成为未来模型版本重点扩展的核心策略之一。
表 5:openPangu-2.0-Flash 与 openPangu-2.0-Pro 在通用、推理、Agent 和代码 benchmark 上的评测结果。表中同时报告 Non-Thinking 与 Thinking 推理模式。粗体为 openPangu-2.0 各版本中的最佳结果。全部评测统一使用 top-p=0.8、temperature=1.0。
| Benchmark | Flash Non-Thinking | Flash Thinking | Pro Non-Thinking | Pro Thinking |
|---|---|---|---|---|
| General | ||||
| CL-Bench (Acc) | 15.5 | 20.4 | 17.8 | 19.7 |
| IFEval (PromptStrict) | 89.3 | 95.9 | 90.4 | 94.5 |
| IFBench (PromptStrict) | 54.4 | 79.6 | 59.5 | 79.9 |
| AgentIF ((CSR+ISR)/2) | 43.9 | 44.9 | 42.2 | 44.4 |
| SysBench (ISR) | 87.9 | 91.1 | 82.6 | 90.8 |
| MultiChallenge (Acc) | 51.9 | 68.4 | 52.2 | 62.9 |
| SimpleQA Verified (Acc) | 21.6 | 24.5 | 27.1 | 34.9 |
| Chinese-SimpleQA (Acc) | 66.0 | 66.7 | 75.7 | 74.2 |
| Reasoning | ||||
| HMMT Feb 2026 (Avg@16) | 63.2 | 76.5 | 63.3 | 86.2 |
| — w/ Python | — | 90.7 | — | 93.2 |
| AIME 2026 (Avg@16) | 86.5 | 93.3 | 87.3 | 95.4 |
| — w/ Python | — | 98.1 | — | 97.9 |
| Apex (Avg@16) | — | 1.0 | 2.1 | 17.7 |
| IMO-AnswerBench (Acc) | 62.3 | 76.5 | 60.8 | 84.3 |
| BBEH (HarmonicMean) | 51.5 | 62.5 | 55.0 | 69.7 |
| GPQA-Diamond (Avg@4) | 79.8 | 83.7 | 81.1 | 87.9 |
| HLE (Acc) | 8.5 | 20.3 | 9.0 | 27.1 |
| Agent | ||||
| TAU2-Bench (Avg@3) | 74.0 | 88.0 | 71.6 | 81.1 |
| MCP-Atlas (Acc) | 47.9 | 58.9 | 48.8 | 61.3 |
| SkillsBench (Avg@5) | 40.0 | 42.6 | 47.5 | 48.9 |
| PinchBench (Avg@3) | 82.5 | 85.6 | 88.9 | 84.0 |
| WildClawBench (Avg@3) | 35.0 | 41.5 | 43.1 | 46.5 |
| Claw-Eval (Pass^3) | 58.2 | 57.7 | 49.4 | 61.7 |
| GDPVal (Acc) | — | 51.4 | 51.2 | 74.9 |
| BrowseComp (Acc) | — | 57.0 | — | 65.7 |
| Coding | ||||
| LiveCodeBench V6 (Avg@3) | 50.9 | 85.1 | 74.5 | 85.7 |
| FeatBench (Avg@3) | 45.8 | 45.9 | 48.4 | 47.1 |
| DeepCodeBench (Avg@3) | 70.9 | 76.5 | 72.6 | 74.2 |
| SWE-bench Verified (Avg@3) | 57.6 | 63.1 | 66.8 | 68.5 |
5.2 内部评测 Harness
5.2.1 深度研究与交互式可视化
Deep Research 已经成为现代 LLM Agent 最重要的应用方向之一。
现有公开基准主要强调信息检索的深度或广度,但真正的实际价值不仅取决于 Agent 找到了什么,也取决于它能否把原始发现有效转化成易访问、可操作的知识。
尤其随着 LLM 的智能体推理与代码生成能力增强,一种根本性的模态变化正在发生:知识综合正在从静态文本转向动态、可视化和交互式制品。
通过基于执行的代码能力,模型可以即时分析、渲染和展示信息,使人类以前所未有的效率获取、追问和传播复杂洞见。
为了研究这种端到端能力,我们把 openPangu-2.0-Flash 部署到内部 Research-and-Delivery Harness 中。
该 Harness 允许模型使用:
- 搜索工具;
- 编程工具;
- 可视化前端开发环境。
模型不再只返回一组文本段落,而是直接生成一个可运行的网站,用协调一致的文本、可视化和交互方式呈现研究结果。
展示案例可以在 https://op-agent.atomgit.com/ 查看,覆盖多种真实场景,包括综合行业调研、学术文献综述和教程生成。
openPangu-2.0 不仅能生成简单文字总结,还能够生成高保真统计图表、复杂 SVG,以及清晰的概念示意图。更重要的是,它能够创建动态内容,包括流畅的信息动画和完整响应式交互组件,把静态信息转化为沉浸式知识探索体验。
5.2.2 全栈 Mini-App 生成
与只生成前端页面相比,全栈 App 生成是更困难的智能体任务:Agent 必须同时连接前端、后端、数据库、实时服务和部署系统,并在视觉与交互质量、端到端功能正确性之间取得平衡。
除了传统桌面应用之外,移动平台上的生成式 Mini-App,尤其是建立在 HarmonyOS 等原生工具链上的应用,也预示着人机交互范式的根本变化。
为了严格评估 openPangu-2.0 在这类任务上的能力,我们建立了一个 programmatic-first 的评估流水线,重点检查端到端功能正确性与交互质量。
Benchmark Query 会被拆解成原子级功能声明,每一项都标记验证类型与关键程度。
对于每一个生成应用,Computer-Use Agent 都会主动操作应用界面,并收集多模态证据,包括:
- UI Tree;
- 实际渲染截图;
- Runtime Trace。
随后,多阶段验证流水线会检查这些信号。对于感知性或主观属性,则调用视觉语言模型作为 Judge,最后按照功能关键程度加权汇总为功能得分。
通过这套完整评估框架,openPangu-2.0 在多种真实领域中展示出较强的端到端生成能力,在保持较高功能正确性的同时,也能维持良好的交互响应质量。
具体案例同样可在 https://op-agent.atomgit.com/ 查看,包括:
- 集成路线地图和交互式日程的个性化旅行规划应用;
- 带实时数据流水线和动态图表的股票跟踪助手。
这些应用表明,openPangu-2.0 可以较稳定地把高层级用户意图转换为可投入生产的交互式原生 Mini-App,为未来按需、移动优先的软件合成打下基础。
6 推理
openPangu-2.0 系列采用大规模稀疏 MoE 架构,并结合 SWA:DSA=2:1 的混合注意力机制,在长序列任务中具有明显优势。
为了最大化昇腾硬件上的在线服务效率,我们引入一整套综合优化技术,主要分为五类:
- 算子创新:实现新的融合算子,包括面向推理的专用 mHC Kernel,以及适配盘古模型的 Attention Sink 算子;
- 并行与执行范式:引入 Felix CP、逐核多流执行等新的并行模型;
- 缓存管理:构建混合 KV Cache 系统,包括 Omni Cache,以及面向 ModAttn 的 APC 和 Multi-MTP 支持;
- 框架增强:加入 Full-Graph Multi-MTP 和无损并行分词 LoPT 等系统级优化;
- 量化:使用整体量化方案,在精度、算子效率和并行执行之间取得平衡。
这些设计组合后,在昇腾 910C 上实现了如下性能:
- openPangu-2.0-Flash:128K 上下文下 TPOT 最低 5.63 ms;在 TPOT=15 ms 时,单 NPU 吞吐达到 1846 tokens/s;
- openPangu-2.0-Pro:128K 上下文下 TPOT 最低 9.55 ms;在 TPOT=20 ms 时,单 NPU 吞吐达到 1326 tokens/s。
6.1 部署
我们针对不同运行需求设计了两种推理配置:
- 超低时延版本:优先追求单请求的极致响应速度;
- 低时延版本:在通用工作负载下平衡吞吐和 Decode 时延。
超低时延配置采用 Prefill 与 Decode 共置的 PD-mix 部署,并针对不同层采用不同并行方式:
- SWA 层使用 TP;
- MoE 层使用 EP;
- DSA 层动态切换:Prefill 阶段使用 CP,Decode 阶段则依靠冗余权重切换到 TP。
低时延配置使用 PD 解耦部署。其 Prefill 节点与超低时延方案使用完全相同的并行拓扑;Decode 节点则将 Attention DP 与 MoE Expert Parallelism 结合,以提高大规模吞吐。
6.1.1 量化格式
我们对 openPangu-2.0 应用 W8A8 整数量化:权重使用静态对称 output-channel 量化,激活使用动态 per-token 量化。
以 Pro 版本为例,权重占用可以从约 1009 GB 压缩到 517 GB,约缩小 1.95 倍。
Calibration 使用 channel-wise smoothing:把激活除以系数 (s),同时把权重乘以 (s),从而保持层输出不变。
与 SmoothQuant 中固定要求 (a+b=1) 不同,我们通过二维搜索独立的指数 ((a,b)),放宽这一约束。对于关键的 up projection,输入侧和输出侧 smoothing 系数会交替迭代优化直到收敛。
是否对某个模块进行量化,不只看压缩率,而是综合考虑:
- 内存收益;
- 算子支持能力;
- 精度敏感性;
- 性能;
- 多流调度。
大矩阵通常最适合量化,但有些组件仍然保留 BF16,原因包括:
- 某些融合算子只支持 BF16 输入;
- TopK 路由、索引等离散选择之前的层对量化噪声非常敏感;
- 残差路径容易累积误差;
- 小矩阵量化收益不足以覆盖量化算子开销;
- 某些算子的执行时间已经被 side-stream 隐藏。
完整的逐模块量化决策见附录 A.8 表 11。
6.2 昇腾算子性能优化
一个算子的总执行时间通常由三部分组成:
- 设备侧计算或访存时间;
- Kernel Launch 开销;
- Host 调度开销。
在低时延与超低时延场景中,Kernel Launch 与 Host 调度已经占据越来越高比例。因此,我们设计多种融合与定制算子,并与 Graph Mode 下的多流并行协同运行。
6.2.1 计算算子优化
推理 mHC 算子优化
mHC 会替代传统残差流,并贯穿每一层 Attention 与 MoE 模块。
DeepSeek 的方案使用三个融合算子分别计算 (H_{pre})、(H_{post}) 和 (H_{res}),但在低时延推理中存在两个问题:
- 在 (n=4) 时,FP32 矩阵乘 (\bar{x}W_{mHC}) 有 24 列,其中只有 4 列会立即用于关键路径,其余 20 列要等最终四路 mHC merge 时才使用,因此关键路径上存在冗余;
- (H_{pre}) 以及其前后的 RMSNorm 和上一层 mHC merge 涉及过多独立算子,导致 Kernel Launch 次数多,且中间变量反复搬运。
我们把 mHC 重新拆成三部分:
mhc_sandwich_norm_post_preonly:只提取与 (H_{pre}) 有关的计算,并与周围算子融合成一个大算子;mhc_pre_split_post_res:把剩余 mHC 计算合并为单个融合算子,并设置较低调度优先级,使其可以通过多流并行与其他计算重叠;- 单独的 Sinkhorn 算子,同样允许被多流隐藏。
第一个算子覆盖 (H_{pre}) 路径,包括附近 RMSNorm 和上一层 mHC merge;第二个算子处理 (H_{post}) 和 (H_{res})。这显著提升了低时延推理下的 mHC 性能。
SWA 算子优化
SWA 中的 PAS 用于缓解注意力分数集中在第一个 Token 后造成的表示退化。
我们提出一种核内动态 micro-tile 级 mask-skip 算法:把 L1 上的粗粒度 basic block 进一步切分成与计算阵列物理尺寸对齐的 micro-tile,并在数据从 L1 搬入 L0 之前直接跳过“全部无效”的 tile,从而消除冗余计算和访存。
PAS 会常驻 L1,Tiling 调度卸载到 AI CPU,并动态调整 basic-block 粒度以改善多核负载均衡。
最终,SWA 算子性能提升约 30%~40%。
除上述算子外,我们还针对盘古模型特点,对 DSA、LI 与 MoeInitRouting 算子进行了细致性能优化。相关源代码将随本工作一同开源。
6.2.2 通信算子优化
通信效率会直接影响端到端性能。我们从两个层次进行优化:
- 选择合适的并行策略和集合通信算法;
- 在通信模式确定后,进一步降低 Kernel Launch、同步、量化以及数据搬运开销。
本节重点介绍单节点低时延场景中的三项技术:
- 用 TP AllReduce 替代 EP AlltoAllV;
- 基于原子排序的 Non-BSP 异步流水线;
- 降低通信算子内部计算与访存开销。
超低时延下用 TP AllReduce 替代 EP AlltoAllV
在超低时延场景中,我们用冗余本地 gating 加 Attention TP 后的一次 AllReduce,替代传统 EP 中的两次 AlltoAllV,也就是 dispatch 与 combine。
只要新增通信和计算成本小于一个 RTT,这种方式就是有利的。
在 openPangu-2.0-Flash 的超低时延部署中,这一优化让端到端时延下降约 20%。
基于原子排序的 Non-BSP Dispatch
在 Dispatch 中,每个 Token 的写入位置取决于此前 Token 的目标专家信息,因此一个慢 rank 就会拖慢整个重排过程。
我们使用 Non-BSP 异步流水线去掉全核同步:每个专家对应一个计数器,通过硬件 AtomicAdd 获取写入 offset,不再进行 Core 间协商;同时把 AtomicAdd 与 Store 融合,使用 push 语义在接收端计算目标地址。
这种 Atomic Ordering 可以让 Dispatch 时延下降 15%~20%。在 16P / HiddenSize=4096 的配置上,约节省 5 μs。
降低通信算子内部计算与内存开销
传统 MoE Dispatch 会针对每个被路由专家反复读取并量化同一个 Token。
我们改用以 Token 为中心的执行模型:每个 Token 只读取和量化一次,再分发给所有目标专家。
这消除了与 Top-K 数量相关的冗余计算,使 Dispatch 时延降低 25%~30%,端到端时延最高改善 5%。
6.2.3 图优化
在低时延推理中,CANN 提供 ACL Graph 加速方案,可以理解为昇腾侧对应 CUDA Graph 的机制;同时还提供 Npugraph_ex,这是基于 CANN 的 PyTorch FX 图优化组件,通过 torch.compile 接入 ACL Graph。
Npugraph_ex 提供两类互补能力:
- 静态 Kernel 编译:提前完成标量计算、内存地址推导和循环边界确定,使运行时不再反复解析参数和插入同步点;
- Superkernel:通过子函数调用把多个连续或逻辑相关的 Kernel 融合到一个统一 Superkernel 中,降低 Launch 次数。
在 openPangu-2.0 超低时延场景中,两项功能同时开启可让 TPOT 改善 3.2 ms,其中静态 Kernel 编译贡献约 1.2 ms,Superkernel 贡献约 2 ms。
6.3 并行策略
如 6.1 节所述,openPangu-2.0 的 MoE 部分在 Atlas A3 上采用经典 EP 部署。
Attention 部分则使用:
- Prefill 侧:DSA CP + SWA TP;
- Decode 侧:Attention DP。
其中,Prefill 侧的 Attention 部署最复杂,但也带来显著性能收益,使模型在长序列上的架构优势充分发挥。
整个模型执行过程中,我们广泛采用多流并行,包括:
- 通信与计算并行;
- Cube 与 Vector 并行;
- 跨 AI Core 多流并行。
目标是最大程度利用昇腾硬件资源。
6.3.1 Felix CP:Attention 模块并行策略
openPangu-2.0 的 Attention 采用 DSA + SWA + ModAttn 混合形式。
DSA 与 SWA 的特征完全不同:
- DSA 受内存带宽限制、访问不规则,Indexer 为计算密集型,复杂度为 (O(S^2))。CP-zigzag 可以线性摊薄 (O(S^2)) 工作量,不增加额外通信;
- SWA 是计算密集型,访问规则且连续,固定窗口复杂度为 (O(S\cdot W)),TP 可以高效利用 Cube 单元。
由于 Attention 模块输入和输出均为 SP 格式,我们还把 SP 应用于部分 Attention Prolog / Epilog,包括 ModAttn,从而消除每张卡上的冗余计算,并减少格式转换造成的通信,例如靠近 Out-Proj 时的 CP→SP 或 TP→SP。
基于上述分析,我们提出图 5 所示的 Felix CP。
图 5:Felix CP 方案完整前向流程。
DSA CP
DSA 层使用 absorbed-weight 模式:接收 SP 状态输入,并在 Indexer 内部的 Q 和 (w_i) 分支把数据转换为 CP 状态。
这样,Qdown、KVdown 和 Indexer 都只计算当前 rank 分配到的序列部分,SFA 也只传输与该 rank Query 对应的 kv_cache,相比 TP 显著减少冗余。
SWA TP
SWA 层将 TP 与 non-absorbed-weight 模式结合。
AllGather 被放在 Q/KV-ModAttn 之后,因为此处数据维度更小,可以降低通信量;Qdown、KVdown、Q-ModAttn 与 KV-ModAttn 使用 SP;Qup / KVup 使用 TP,把 Full 状态转换为 TP 状态参与 Attention。
Attention 输出再通过 All2All 从 TP 转为 SP,最后由 O-ModAttn 和完整加载的 Oproj 在 SP 中完成模块计算。
ModAttn-SP
ModAttn 的 SP 实现包含两个主要部分:本地元数据构建与并行计算。
在元数据阶段,每个 rank 独立处理 Prefix Cache 的 Block 信息,并把本地 KV Block 映射到全局状态。
在计算阶段,再从全局 KV Pool 中取出当前 rank 的运行缓存,执行融合卷积 Kernel,然后全局同步更新后的缓存。
这也是首个为 Mamba-like 架构提供 APC 支持的开源 SP 实现,并且可以推广到其他 Mamba-like 网络。
6.3.2 Multi Stream
openPangu-2.0 实现了带显式 Core Budget 控制的双流架构,以最大化 NPU 利用率。
每个 Ascend 910C Die 包含 24 个 Cube Core(AIC)与 48 个 Vector Core(AIV)。在单流调度下,不同算子串行执行,即使资源需求并不冲突,也会导致专用计算 Core 空闲。
我们通过三种机制重新利用这些空闲资源。
Core Budget 控制
在 Decode 路径上,把全部 Core 分给一个算子并不高效:小 shape Vector Kernel 的单 Core Launch 开销较大,而且并发 Stream 会争抢物理 Core。
因此,我们限制每个算子的 AIC/AIV 占用,使两个 Stream 都能同时容纳在一个 Die 的资源边界内。
Cube / Vector 并行
MLA Prologue 中天然存在互补工作负载:Q 路径主要由 Cube 密集型 GEMM 构成,而 KV/mHC 路径主要是 Vector 运算。
把它们放到不同 Stream,可以让 AIC 与 AIV 流水线同时保持活跃。
此外,我们还把大的 Q Projection 拆成两个负载均衡的子投影,分别运行在两个 Stream 上,缩短关键路径。
通信 / 计算重叠
在 MoE Block 中,我们把 Shared Expert 计算卸载到侧流,使其与 Routed Pipeline 及其通信尾部重叠执行。
6.4 KV Cache 管理
6.4.1 Omni Cache
现代推理引擎通常把 KV Block Pool 放在 HBM 中,但这会带来两个根本限制。
HBM 资源竞争。 Block Pool 与模型权重争夺有限 HBM。openPangu 权重加载后,单个 A3 设备剩余 HBM 无法容纳 512K Token 序列所需 KV。
长上下文 KV 容量不足。 剩余 HBM 只能容纳少量长上下文请求,因此历史 KV 很快被淘汰,APC 命中率趋近于 0,同时 Decode 并发也受到限制。
我们的关键观察是:KV Buffer 和 KV Cache 并不是同一类数据。
- KV Buffer:当前前向计算中会真正被 Attention 读取的 KV 子集;
- KV Cache:其余历史 KV 与尚未占用的缓存槽位。
只有 KV Buffer 真正需要 HBM 带宽,而 KV Cache 主要消耗容量。
因此,我们设计了以 DRAM 为中心的架构:
- KV Cache 放在 TB 级 Host Memory 中;
- 只有计算中真正需要的 KV Buffer 暂时放在 HBM;
- Prefill 阶段使用一个所有层共享的 HBM Buffer,并按层复用;
- 每一层计算时,通过 D2H Scatter / H2D Gather 与计算重叠,隐藏传输时延。
图 6:内存布局对比。左侧为传统 HBM Block Pool;右侧为 Omni Cache,KV 存储迁移至共享 Host Memory,HBM 仅保留计算中的 KV Buffer。
在 openPangu 上,Omni Cache 可以:
- 把原生 KV 空间扩大 10 倍以上;
- 把 APC 命中率提升 3 倍;
- 释放的 HBM 使 Prefill 节点可以只部署在单个 A3 上;
max-batch-tokens提高 4 倍,同时仍支持 512K 长序列。
6.4.2 混合注意力与 KV Cache 管理
openPangu-2.0 的 Attention 结构是异构的:
- DSA 保存压缩 Attention Cache 与 Indexer State;
- MLA/SWA 保存共享压缩 KV 和 RoPE;
- ModAttn 是 Mamba-like 边界状态,包含 Q、压缩 KV 和输出路径三个因果卷积模块的状态。
设计目标是继续保留 vLLM 的 Single BlockPool 抽象:所有包含缓存的层统一从同一个 Block Pool 分配,并参与共同的 Prefix Cache 协商,但每个 Backend 可以按自己的 Kernel Layout 解释 Block Payload。
Page Size 对齐
核心机制是把三类缓存的物理 Page Size 对齐,同时区分真实 Payload 与 Padding Page。
对于 MLA/SWA:
[
B_{MLA}=block_size\cdot(512+64),
]
对应共享压缩 KV 与 RoPE。
对于 DSA,还要加入 Indexer State:
[
B_{DSA}=block_size\cdot(512+64+128).
]
对于 ModAttn:
[
B_{ModAttn}=(K-1+N_{spec})\cdot(q_{lora}+kv_{lora}+H\cdot d_v),
]
其中 (K) 为卷积宽度,(N_{spec}) 为为投机 Token 预留的容量,后三项分别表示 Q、压缩 KV 和输出侧状态。
实现同时支持量化:DSAAttentionSpec 会根据 cache_dtype_str 计算真实 Page Size,因此 FP8、INT8、HiF8、LI-only 等布局可以附加 Scale Tensor,而不需要改变 Scheduler 接口。
Runtime 会选取足以容纳所有当前类型的统一 Padding Page Size。
Padding 会浪费少量 Page 内空间,但好处是 Scheduler、Block Pool 与 Prefix Cache Coordinator 都不需要针对具体模型携带额外分配逻辑。
Strided Cache View 与 KV Spec
对齐后的 Page 会被分配为一块原始内存 Tensor,各 Backend 再用 torch.as_strided 视图重新解释。第一维 Stride 会跳过完整 Padding Page,因此自动略过无效 Padding。
我们通过三种盘古专用 KV Cache Spec 扩展 vLLM 接口:
DSAAttentionSpec:理解 DSA Payload 和量化格式;ShareKVSlidingWindowSpec:把 MLA/SWA 建模为共享 KV 存储的 Sliding Window;MomeSpec:扩展 vLLM 的MambaSpec,记录三个状态的 Shape / DType、卷积 Kernel Size 和投机 Token 预留量。
对应 Manager 尽量保持 vLLM 其余部分不变:
- DSA 使用普通 Full-Attention Manager;
- MLA/SWA 使用共享 KV 的 Sliding-Window Manager;
- ModAttn 使用
MomeManager,把缓存视为 Boundary-State Cache。与 Mamba 类似,只需要最新有效卷积边界状态,而不是所有历史状态。
异构 Cache Group 间的 Prefix Caching
混合 Prefix Caching 需要所有 Cache Group 通过 vLLM 的固定点协商,共同同意一个可复用 Prefix 长度:候选命中长度会逐步缩短,直到所有组都同意。
对 DSA 这样的 Full-Attention Group,Cache Lookup 是向下闭合的,因此 Manager 从左向右扫描并返回连续缓存 Block。
对于启用 APC 的 ModAttn,Cache Block 会延伸到:
[
\lceil L/block_size\rceil.
]
我们把 Token 按 block_size 分块,并把每个 Block 最后 (K-1) 个 Token 的状态缓存为 Prefix Cache。
由于一个 ModAttn Block 保存的是恢复计算所需的边界状态,MomeManager 从右向左搜索,找到最近可用 Block 后停止;更早位置填充 Null Block,使逻辑命中长度仍然保持 num_blocks * block_size,即使物理上真正存活的状态可能只有最后一个 ModAttn Boundary Block。
对于 MTP 或 EAGLE 风格投机解码,Full-Attention Group 可能需要丢弃最后一个命中 Block,以重新计算 Hidden State 用于投机验证。
但不能把同样规则应用到 ModAttn,因为 ModAttn 的复用依赖最新有效状态,而不是连续 Hidden State 序列。因此,盘古 Coordinator 只向 Full-Attention Group 传递 EAGLE Flag;ModAttn 仍参与统一固定点协商,但命中逻辑继续保持 Mamba-like 形式。
同时支持 MTP 与 APC 的 ModAttn
当 MTP 与 APC 同时启用时,ModAttn Cache 管理最复杂,因为未经验证的投机 Token 可能暂时写入 Prefix Cache Block,之后又被验证或覆盖。
为此,我们在不同调度 Step 之间跟踪已接受投机 Token 数量,并动态校正 Cache Read Position,保证读取位置准确。
这是首个同时支持 MTP 与细粒度 APC 的 Mamba-style 开源框架,也可以推广到 Gated DeltaNet 和 DeepSeek Compressed Sparse Attention 等架构。
6.5 推理框架优化
除了混合 KV Cache 管理外,我们还在 openPangu NPU 推理引擎中引入三类互补优化,以降低端到端时延:
- 细粒度异步调度,消除设备侧 Bubble;
- Multi-MTP Full-Graph,使每个 Decode Step 都能在静态图中执行;
- LoPT 无损并行 Tokenizer,显著降低 TTFT。
面向昇腾 NPU 推理的异步调度优化
我们把 vLLM V1 的异步调度框架适配到 Hybrid Attention 模型,并启用 MTP-3,用于大规模 EP 与 DP 部署。
这里存在三个关键同步瓶颈:
- MTP 验证带来的可变接受长度依赖;
- 多个 KVCache Group 频繁触发 CPU 侧 Tiling;
- DP 级 Batch Coordination 通信阻塞。
对于第一个问题,我们通过独立异步 Copy Stream 返回采样结果与 Draft Token,从而消除投机解码中的 D2H 阻塞点。
再通过 Event Pipelining,把当前 Copy 完成通知与下一次计算 Kernel 启动链接起来,使 CPU 等待时间完全与 NPU 计算重叠。
对于第二个问题,我们把 CPU 侧 Tiling 卸载到片上 AICPU,也就是 ARM Core。AICPU 可以直接读取 NPU HBM 中的 Sequence State Tensor,并异步把 Tiling Metadata 写入 Buffer。
这样彻底消除 D2H/H2D 往返,而且 Tiling 可以与 AICore 计算并行。
对于 DP 同步,我们用运行在 AICPU 模式下的专用 HCCL ProcessGroup 替换阻塞 CPU Gloo AllReduce。完整的 H2D→AllReduce→D2H 链路都在 ARM Core 上异步执行,不占用 AICore Cycle,也不会阻塞 EngineCore 线程。
Multi-MTP 与 Full Graph
在 NPU Graph Mode 中支持投机解码会叠加三个工程挑战,我们分别解决。
- Multi-MTP 集成:补全框架侧调用逻辑,确保执行流能正确进入指定 MTP Layer;
- Full-Graph 支持:除了传统 Decode-Only 模式,
omni-npuRuntime 新增 Full-Graph 模式。即使请求只有 1~3 个 Token,也强制进入静态图,避免昂贵的图捕获 / 重新编译,并保证 PD 解耦部署下每个 Decode Step 都在 Graph Mode 内运行。算子原生接受 TND(Token × Num_heads × Dim)输入,并通过query_start_loc表示动态边界;Drafter 使用 Padding 模式,并调整 Graph Control 逻辑; - 通信优化:Multi-MTP Padding 模式下 Draft Model 输入 Shape 与 Target Model 完全一致,因此可以安全跳过 Draft 前的 DP AllReduce。于是每个 Decode Step 都少一次 AllReduce,收益随 DP Size 线性增加。
LoPT:无损并行分词加速框架
当上下文长度增长到 1M Token,BPE、WordPiece 等主流 Tokenizer 的串行特性会逐渐成为明显瓶颈。
一种自然思路是把文本分块后并行分词,再拼接结果。但朴素分块会出现边界伪影(Boundary Artifact):同一子字符串出现在不同位置时,Token 化结果可能不同,因此相邻 Chunk 的独立 Tokenization 无法与整段文本完全对齐。
LoPT 保留重叠切分,但把“Token ID Matching”替换为“字符位置 Matching”:记录每个 Token 对应原文的字符起止位置,并按位置而不是 Token ID 匹配,从根本上消除上下文引起的歧义。
LoPT 可以保证输出与串行 Tokenization 严格一致。我们在代码、自然语言和多语言文本上验证达到 100% 准确率;在 16 核 CPU 上速度提升 3~5 倍,Overlap 开销低于 5%。
LoPT 还与 Token-level APC 深度集成,避免单 Token 错位导致 APC Hash Matching 完全失效。具体见附录 A.9。
6.6 性能结果
6.6.1 模型架构理论分析
我们分析 openPangu-2.0 混合 DSA:SWA 架构在长上下文 Prefill 与 Decode 工作负载下的 Attention 效率。
Attention 效率
长上下文服务开销主要由以下因素决定:
- Prefill 计算;
- 常驻 KV Cache 内存;
- Decode Cache Traffic。
我们采用 DSA:SWA=1:2。SWA 把注意力限制在固定窗口 (W),DSA 则通过轻量 Lightning Indexer 扫描全局上下文,只对 Top-K Token 执行核心 Attention。
Prefill
长上下文 Prefill 时延可近似表示为:
[
t^P_{attn}(S)\approx \alpha_{P,2}S^2+\alpha_{P,1}S+b_P.
]
在混合架构中,SWA 和 DSA 核心 Attention 分别按 (O(SW)) 和 (O(SK)) 线性增长,只有 Lightning Indexer 保留二次复杂度。
按维度计算:
[
\frac{\alpha{Hybrid}_{P,2}}{\alpha{Full}{P,2}}
\approx
\frac13\cdot
\frac{N^{Indexer}{head}}{N_{head}}\cdot
\frac{D{Indexer}}{D{MHA}{QK}+D^{MHA}{V}}
\frac13\cdot\frac12\cdot\frac{128}{320}
\frac1{15}.
]
这个 1/15 只表示主导二次 Attention FLOP 系数,并不等于端到端 Prefill 时延加速倍数。
KV Cache 内存
常驻 KV Cache 内存增长近似为:
[
M_{cache}(S)\approx \alpha_MS+b_M.
]
SWA 层只保留 (W) 个 Token,而 DSA 层保存完整 MLA KV Cache 加紧凑 Index Key。
相同精度下:
[
\frac{\alpha{Hybrid}_M}{\alpha{Full}M}
\approx
\frac13\left(1+\frac{D^{Indexer}}{D{KV}}\right)
\frac13\left(1+\frac{128}{576}\right)
\approx 40.7%.
]
如果理想化地把 8-bit Hybrid Cache 与 16-bit Baseline 比较,这个比例还会减半到约 20.4%。真实收益还取决于量化元数据和 Runtime Layout。
Decode
长上下文 Decode 主要受缓存流量限制:
[
t^D_{attn}(S)\approx
\frac{TD_{cache}(S)}{BW_{HBM}}+tD_{select}(S)+b_D.
]
全注意力在每一层都扫描完整 KV Cache;SWA 只读取最近 (W) 个 Token,DSA 则扫描紧凑 Index Key,再 Gather (K) 个 KV 条目。
由于 (W) 和 (K) 都与 (S) 无关,主导 Cache Scan 系数变为:
[
\frac{\alpha{Hybrid}_T}{\alpha{Full}T}
\approx
\frac13\cdot\frac{D^{Indexer}}{D{KV}}
\frac13\cdot\frac{128}{576}
\approx 7.4%.
]
即缓存读取量理论上减少约 13.5 倍。如果进一步用 8-bit Hybrid Cache 对比 16-bit Baseline,则约为 3.7%,相当于约 27 倍减少。
具体来说,在 128K 序列长度下,openPangu-2.0-Pro 每个 Batch 的 KV Cache 读取流量只有 0.33 GB,总 Cache Size 为 2.68 GB。
以上估算只隔离随序列长度增长的 Attention 项;真实端到端加速仍取决于 Token 选择开销、稀疏 Gather、投影、Batching、通信与硬件利用率。
6.6.2 时延与吞吐
超低时延
超低时延配置采用 A3 单节点共置部署。
测试序列为:
- 128K 输入 + 1K 输出;
- 8K 输入 + 1K 输出。
全局并发为 1。
真实数据下,Flash 的 TPOT 控制在 6 ms 内,Pro 控制在 10 ms 内。
表 6:openPangu-2.0 超低时延结果。
| 模型 | ISL + OSL | TPOT(ms) |
|---|---|---|
| openPangu-2.0-Flash | 8K + 1K | 5.27 |
| openPangu-2.0-Flash | 128K + 1K | 5.63 |
| openPangu-2.0-Pro | 8K + 1K | 9.53 |
| openPangu-2.0-Pro | 128K + 1K | 9.55 |
低时延吞吐
为了提高吞吐,低时延配置使用 PD 解耦部署:
- Flash:1P1D,两节点;
- Pro:2P1D,八节点,其中每个 P 实例使用 2 个节点,每个 D 实例使用 4 个节点。
测试序列为:
- 128K 输入 + 8K 输出;
- 8K 输入 + 1K 输出。
真实数据和真实工作负载下,在指定单 NPU Batch Size 时,结果如下。
表 7:openPangu-2.0 低时延吞吐。
| 模型 | ISL + OSL | TPOT(ms) | Batch Size | TPS(tokens/s/NPU) |
|---|---|---|---|---|
| openPangu-2.0-Flash | 8K + 1K | 16.2 | 48 | 2963 |
| openPangu-2.0-Flash | 128K + 8K | 13.0 | 24 | 1846 |
| openPangu-2.0-Pro | 8K + 1K | 23.2 | 40 | 1727 |
| openPangu-2.0-Pro | 128K + 8K | 18.1 | 24 | 1326 |
Prefill 时延
Prefill 重点优化长序列性能。
使用低时延部署:Flash 单个 A3 节点,Pro 两个 A3 节点;单 Batch 输入序列长度为 128K。
真实数据与真实负载下:
- Flash TTFT:2.6 s;
- Pro TTFT:3.0 s。
图 7:输入长度与单 NPU TPS 的关系,对应约 15 ms(Flash)/ 20 ms(Pro)时延。
图 8:输入长度与 TTFT 的关系。
7 结论与未来工作
我们推出 openPangu-2.0,这是一次面向稳定长上下文推理智能体的全栈升级。
通过以昇腾平台为中心的严格软硬件协同设计,我们解决了超大 MoE 训练、长程对齐以及推理效率中的关键瓶颈。
通过把模型架构创新与专用推理引擎结合,并使用定制算子优化、高级并行策略和异步调度,openPangu-2.0 系列实现了优秀的推理时延和吞吐。
综合评测表明,模型在标准通用能力、STEM 推理和智能体 benchmark 上都具有很强竞争力。
更重要的是,我们的目标不只是在静态 benchmark 上取得高分,而是优先服务真实系统价值。openPangu 被定位为推动智能设备、汽车系统、ICT 基础设施和华为云中智能体应用竞争力的核心基础能力。
与此同时,我们也在继续扩展端侧原生能力,利用麒麟芯片架构推动设备侧智能的边界。
虽然基础 Scaling Law 仍然持续推动模型性能增长,但 Scaling 的重点正在从静态知识吸收转向长轨迹、交互式数据,也就是从“只会知道”的被动模型,转向“能够行动”的智能体系统。
为了推动这一演化,我们的研究路线仍以昇腾硬件生态为核心,并将继续扩大基于沙箱的合成数据流水线,在复杂、开放式场景中生成大规模、高保真的执行数据。
在未来几个月的连续模型迭代中,我们希望系统性增强 openPangu 在代码智能与复杂智能体工作流两个方向上的核心能力。
最终,这种以真实执行为驱动的方法将进一步优化模型底层认知架构,构建能够在动态真实环境中推理并解决多步骤工作流的自主智能体。
参考文献
参考文献属于文献著录信息,按原报告原文保留。
[1] Rishabh Agarwal, Nino Vieillard, Yongchao Zhou, Piotr Stanczyk, Sabela Ramos, Matthieu
Geist, and Olivier Bachem. On-policy distillation of language models: Learning from self-
generated mistakes. In The Twelfth International Conference on Learning Representations,
2024. URL https://openreview.net/forum?id=3zKtaqxLhW.
[2] Kilo AI. Pinchbench: The openclaw llm agent benchmarking leaderboard. https://pinchb
ench.com/, 2026. Accessed: 2026-07-23.
[3] Long and Phan, Alice Gatti, Nathaniel Li, Adam Khoja, Ryan Kim, Richard Ren, Jason
Hausenloy, Oliver Zhang, Mantas Mazeika, Dan Hendrycks, Ziwen Han, Josephina Hu, Hugh
Zhang, Chen Bo Calvin Zhang, Mohamed Shaaban, John Ling, Sean Shi, Michael Choi, An-
ish Agrawal, Arnav Chopra, Aakaash Nattanmai, Gordon McKellips, Anish Cheraku, Asim
Suhail, Ethan Luo, Marvin Deng, Jason Luo, Ashley Zhang, Kavin Jindel, Jay Paek, Kasper
Halevy, Allen Baranov, Michael Liu, Advaith Avadhanam, David Zhang, Vincent Cheng, Brad
Ma, Evan Fu, Liam Do, Joshua Lass, Hubert Yang, Surya Sunkari, Vishruth Bharath, Violet
Ai, James Leung, Rishit Agrawal, Alan Zhou, Kevin Chen, Tejas Kalpathi, Ziqi Xu, Gavin
Wang, Tyler Xiao, Erik Maung, Sam Lee, Ryan Yang, Roy Yue, Ben Zhao, Julia Yoon, Xi-
angwan Sun, Aryan Singh, Clark Peng, Tyler Osbey, Taozhi Wang, Daryl Echeazu, Timothy
Wu, Spandan Patel, Vidhi Kulkarni, Vijaykaarti Sundarapandiyan, Andrew Le, Zafir Nasim,
Srikar Yalam, Ritesh Kasamsetty, Soham Samal, David Sun, Nihar Shah, Abhijeet Saha, Alex
Zhang, Leon Nguyen, Laasya Nagumalli, Kaixin Wang, Aidan Wu, Anwith Telluri, Summer
Yue, Alexandr Wang, Dmitry Dodonov, Tung Nguyen, Jaeho Lee, Daron Anderson, Mikhail
Doroshenko, Alun Cennyth Stokes, Mobeen Mahmood, Oleksandr Pokutnyi, Oleg Iskra, Jes-
sica P. Wang, John-Clark Levin, Mstyslav Kazakov, Fiona Feng, Steven Y. Feng, Haoran Zhao,
Michael Yu, Varun Gangal, Chelsea Zou, Zihan Wang, Serguei Popov, Robert Gerbicz, Geoff
Galgon, Johannes Schmitt, Will Yeadon, Yongki Lee, Scott Sauers, Alvaro Sanchez, Fabian
Giska, Marc Roth, Søren Riis, Saiteja Utpala, Noah Burns, Gashaw M. Goshu, Mohinder Ma-
heshbhai Naiya, Chidozie Agu, Zachary Giboney, Antrell Cheatom, Francesco Fournier-Facio,
Sarah-Jane Crowson, Lennart Finke, Zerui Cheng, Jennifer Zampese, Ryan G. Hoerr, Mark
Nandor, Hyunwoo Park, Tim Gehrunger, Jiaqi Cai, Ben McCarty, Alexis C. Garretson, Ed-
win Taylor, Damien Sileo, Qiuyu Ren, Usman Qazi, Lianghui Li, Jungbae Nam, John B.
Wydallis, Pavel Arkhipov, Jack Wei Lun Shi, Aras Bacho, Chris G. Willcocks, Hangrui Cao,
Sumeet Motwani, Emily de Oliveira Santos, Johannes Veith, Edward Vendrow, Doru Cojoc,
Kengo Zenitani, Joshua Robinson, Longke Tang, Yuqi Li, Joshua Vendrow, Natanael Wild-
ner Fraga, Vladyslav Kuchkin, Andrey Pupasov Maksimov, Pierre Marion, Denis Efremov,
Jayson Lynch, Kaiqu Liang, Aleksandar Mikov, Andrew Gritsevskiy, Julien Guillod, Göz-
denur Demir, Dakotah Martinez, Ben Pageler, Kevin Zhou, Saeed Soori, Ori Press, Henry
Tang, Paolo Rissone, Sean R. Green, Lina Brüssel, Moon Twayana, Aymeric Dieuleveut,
Joseph Marvin Imperial, Ameya Prabhu, Jinzhou Yang, Nick Crispino, Arun Rao, Dimitri
Zvonkine, Gabriel Loiseau, Mikhail Kalinin, Marco Lukas, Ciprian Manolescu, Nate Stam-
baugh, Subrata Mishra, Tad Hogg, Carlo Bosio, Brian P. Coppola, Julian Salazar, Jaehyeok
Jin, Rafael Sayous, Stefan Ivanov, Philippe Schwaller, Shaipranesh Senthilkumar, Andres M.
Bran, Andres Algaba, Kelsey Van den Houte, Lynn Van Der Sypt, Brecht Verbeken, David
Noever, Alexei Kopylov, Benjamin Myklebust, Bikun Li, Lisa Schut, Evgenii Zheltonozh-
skii, Qiaochu Yuan, Derek Lim, Richard Stanley, Tong Yang, John Maar, Julian Wykowski,
Mart Oller, Anmol Sahu, Cesare Giulio Ardito, Yuzheng Hu, Ariel Ghislain Kemogne Kam-
doum, Alvin Jin, Tobias Garcia Vilchis, Yuexuan Zu, Martin Lackner, James Koppel, Gongbo
Sun, Daniil S. Antonenko, SteffiChern, Bingchen Zhao, Pierrot Arsene, Joseph M. Cavanagh,
Daofeng Li, Jiawei Shen, Donato Crisostomi, Wenjin Zhang, Ali Dehghan, Sergey Ivanov,
David Perrella, Nurdin Kaparov, Allen Zang, Ilia Sucholutsky, Arina Kharlamova, Daniil
Orel, Vladislav Poritski, Shalev Ben-David, Zachary Berger, Parker Whitfill, Michael Fos-
ter, Daniel Munro, Linh Ho, Shankar Sivarajan, Dan Bar Hava, Aleksey Kuchkin, David
Holmes, Alexandra Rodriguez-Romero, Frank Sommerhage, Anji Zhang, Richard Moat, Keith
Schneider, Zakayo Kazibwe, Don Clarke, Dae Hyun Kim, Felipe Meneguitti Dias, Sara Fish,
Veit Elser, Tobias Kreiman, Victor Efren Guadarrama Vilchis, Immo Klose, Ujjwala Anan-
theswaran, Adam Zweiger, Kaivalya Rawal, Jeffery Li, Jeremy Nguyen, Nicolas Daans, Ha-
line Heidinger, Maksim Radionov, Václav Rozho, Vincent Ginis, Christian Stump, Niv Co-
hen, Rafa Powiata, Josef Tkadlec, Alan Goldfarb, Chenguang Wang, Piotr Padlewski, Stanis-
law Barzowski, Kyle Montgomery, Ryan Stendall, Jamie Tucker-Foltz, Jack Stade, T. Ryan
Rogers, Tom Goertzen, Declan Grabb, Abhishek Shukla, Alan Givré, John Arnold Ambay,
Archan Sen, Muhammad Fayez Aziz, Mark H. Inlow, Hao He, Ling Zhang, Younesse Kad-
dar, Ivar Ängquist, Yanxu Chen, Harrison K. Wang, Kalyan Ramakrishnan, Elliott Thorn-
ley, Antonio Terpin, Hailey Schoelkopf, Eric Zheng, Avishy Carmi, Ethan D. L. Brown, Ke-
lin Zhu, Max Bartolo, Richard Wheeler, Martin Stehberger, Peter Bradshaw, JP Heimonen,
Kaustubh Sridhar, Ido Akov, Jennifer Sandlin, Yury Makarychev, Joanna Tam, Hieu Hoang,
David M. Cunningham, Vladimir Goryachev, Demosthenes Patramanis, Michael Krause, An-
drew Redenti, David Aldous, Jesyin Lai, Shannon Coleman, Jiangnan Xu, Sangwon Lee, Ilias
Magoulas, Sandy Zhao, Ning Tang, Michael K. Cohen, Orr Paradise, Jan Hendrik Kirchner,
Maksym Ovchynnikov, Jason O. Matos, Adithya Shenoy, Michael Wang, Yuzhou Nie, Anna
Sztyber-Betley, Paolo Faraboschi, Robin Riblet, Jonathan Crozier, Shiv Halasyamani, Shreyas
Verma, Prashant Joshi, Eli Meril, Ziqiao Ma, Jérémy Andréoletti, Raghav Singhal, Jacob Plat-
nick, Volodymyr Nevirkovets, Luke Basler, Alexander Ivanov, Seri Khoury, Nils Gustafsson,
Marco Piccardo, Hamid Mostaghimi, Qijia Chen, Virendra Singh, Tran Quoc Khánh, Paul
Rosu, Hannah Szlyk, Zachary Brown, Himanshu Narayan, Aline Menezes, Jonathan Roberts,
William Alley, Kunyang Sun, Arkil Patel, Max Lamparth, Anka Reuel, Linwei Xin, Hanmeng
Xu, Jacob Loader, Freddie Martin, Zixuan Wang, Andrea Achilleos, Thomas Preu, Tomek
Korbak, Ida Bosio, Fereshteh Kazemi, Ziye Chen, Biró Bálint, Eve J. Y. Lo, Jiaqi Wang,
Maria Inês S. Nunes, Jeremiah Milbauer, M. Saiful Bari, Zihao Wang, Behzad Ansarinejad,
Yewen Sun, Stephane Durand, Hossam Elgnainy, Guillaume Douville, Daniel Tordera, George
Balabanian, Hew Wolff, Lynna Kvistad, Hsiaoyun Milliron, Ahmad Sakor, Murat Eron, An-
drew Favre, Shailesh Shah, Xiaoxiang Zhou, Firuz Kamalov, Sherwin Abdoli, Tim Santens,
Shaul Barkan, Allison Tee, Robin Zhang, Alessandro Tomasiello, G. Bruno De Luca, Shi-
Zhuo Looi, Vinh-Kha Le, Noam Kolt, Jiayi Pan, Emma Rodman, Jacob Drori, Carl J. Fossum,
Niklas Muennighoff, Milind Jagota, Ronak Pradeep, Honglu Fan, Jonathan Eicher, Michael
Chen, Kushal Thaman, William Merrill, Moritz Firsching, Carter Harris, Stefan Ciobâc, Ja-
son Gross, Rohan Pandey, Ilya Gusev, Adam Jones, Shashank Agnihotri, Pavel Zhelnov,
Mohammadreza Mofayezi, Alexander Piperski, David K. Zhang, Kostiantyn Dobarskyi, Ro-
man Leventov, Ignat Soroko, Joshua Duersch, Vage Taamazyan, Andrew Ho, Wenjie Ma,
William Held, Ruicheng Xian, Armel Randy Zebaze, Mohanad Mohamed, Julian Noah Leser,
Michelle X. Yuan, Laila Yacar, Johannes Lengler, Katarzyna Olszewska, Claudio Di Fratta,
Edson Oliveira, Joseph W. Jackson, Andy Zou, Muthu Chidambaram, Timothy Manik, Hec-
tor Haffenden, Dashiell Stander, Ali Dasouqi, Alexander Shen, Bita Golshani, David Stap,
Egor Kretov, Mikalai Uzhou, Alina Borisovna Zhidkovskaya, Nick Winter, Miguel Orbegozo
Rodriguez, Robert Lauff, Dustin Wehr, Colin Tang, Zaki Hossain, Shaun Phillips, Fortuna
Samuele, Fredrik Ekström, Angela Hammon, Oam Patel, Faraz Farhidi, George Medley, For-
ough Mohammadzadeh, Madellene Peñaflor, Haile Kassahun, Alena Friedrich, Rayner Hernan-
dez Perez, Daniel Pyda, Taom Sakal, Omkar Dhamane, Ali Khajegili Mirabadi, Eric Hallman,
Kenchi Okutsu, Mike Battaglia, Mohammad Maghsoudimehrabani, Alon Amit, Dave Hulbert,
Roberto Pereira, Simon Weber, Handoko, Anton Peristyy, Stephen Malina, Mustafa Mehkary,
Rami Aly, Frank Reidegeld, Anna-Katharina Dick, Cary Friday, Mukhwinder Singh, Hassan
Shapourian, Wanyoung Kim, Mariana Costa, Hubeyb Gurdogan, Harsh Kumar, Chiara Ce-
conello, Chao Zhuang, Haon Park, Micah Carroll, Andrew R. Tawfeek, Stefan Steinerberger,
Daattavya Aggarwal, Michael Kirchhof, Linjie Dai, Evan Kim, Johan Ferret, Jainam Shah,
Yuzhou Wang, Minghao Yan, Krzysztof Burdzy, Lixin Zhang, Antonio Franca, Diana T. Pham,
Kang Yong Loh, Joshua Robinson, Abram Jackson, Paolo Giordano, Philipp Petersen, Adrian
Cosma, Jesus Colino, Colin White, Jacob Votava, Vladimir Vinnikov, Ethan Delaney, Petr
Spelda, Vit Stritecky, Syed M. Shahid, Jean-Christophe Mourrat, Lavr Vetoshkin, Koen Spon-
selee, Renas Bacho, Zheng-Xin Yong, Florencia de la Rosa, Nathan Cho, Xiuyu Li, Guillaume
Malod, Orion Weller, Guglielmo Albani, Leon Lang, Julien Laurendeau, Dmitry Kazakov, Fa-
timah Adesanya, Julien Portier, Lawrence Hollom, Victor Souza, Yuchen Anna Zhou, Julien
Degorre, Yiit Yaln, Gbenga Daniel Obikoya, Rai Michael Pokorny, Filippo Bigi, M. C. Boscá,
Oleg Shumar, Kaniuar Bacho, Gabriel Recchia, Mara Popescu, Nikita Shulga, Ngefor Mildred
Tanwie, Thomas C. H. Lux, Ben Rank, Colin Ni, Matthew Brooks, Alesia Yakimchyk, Huanxu
Quinn Liu, Stefano Cavalleri, Olle Häggström, Emil Verkama, Joshua Newbould, Hans Gund-
lach, Leonor Brito-Santana, Brian Amaro, Vivek Vajipey, Rynaa Grover, Ting Wang, Yosi
Kratish, Wen-Ding Li, Sivakanth Gopi, Andrea Caciolai, Christian Schroeder de Witt, Pablo
Hernández-Cámara, Emanuele Rodolà, Jules Robins, Dominic Williamson, Brad Raynor, Hao
Qi, Ben Segev, Jingxuan Fan, Sarah Martinson, Erik Y. Wang, Kaylie Hausknecht, Michael P.
Brenner, Mao Mao, Christoph Demian, Peyman Kassani, Xinyu Zhang, David Avagian, Es-
hawn Jessica Scipio, Alon Ragoler, Justin Tan, Blake Sims, Rebeka Plecnik, Aaron Kirtland,
Omer Faruk Bodur, D. P. Shinde, Yan Carlos Leyva Labrador, Zahra Adoul, Mohamed Zekry,
Ali Karakoc, Tania C. B. Santos, Samir Shamseldeen, Loukmane Karim, Anna Liakhovit-
skaia, Nate Resman, Nicholas Farina, Juan Carlos Gonzalez, Gabe Maayan, Earth Anderson,
Rodrigo De Oliveira Pena, Elizabeth Kelley, Hodjat Mariji, Rasoul Pouriamanesh, Wentao
Wu, Ross Finocchio, Ismail Alarab, Joshua Cole, Danyelle Ferreira, Bryan Johnson, Moham-
mad Safdari, Liangti Dai, Siriphan Arthornthurasuk, Isaac C. McAlister, Alejandro José Moy-
ano, Alexey Pronin, Jing Fan, Angel Ramirez-Trinidad, Yana Malysheva, Daphiny Pottmaier,
Omid Taheri, Stanley Stepanic, Samuel Perry, Luke Askew, Raúl Adrián Huerta Rodrguez, Ali
M. R. Minissi, Ricardo Lorena, Krishnamurthy Iyer, Arshad Anil Fasiludeen, Ronald Clark,
Josh Ducey, Matheus Piza, Maja Somrak, Eric Vergo, Juehang Qin, Benjámin Borbás, Eric
Chu, Jack Lindsey, Antoine Jallon, I. M. J. McInnis, Evan Chen, Avi Semler, Luk Gloor, Tej
Shah, Marc Carauleanu, Pascal Lauer, Tran Duc Huy, Hossein Shahrtash, Emilien Duc, Lukas
Lewark, Assaf Brown, Samuel Albanie, Brian Weber, Warren S. Vaz, Pierre Clavier, Yiyang
Fan, Gabriel Poesia Reis e Silva, Long Tony Lian, Marcus Abramovitch, Xi Jiang, Sandra
Mendoza, Murat Islam, Juan Gonzalez, Vasilios Mavroudis, Justin Xu, Pawan Kumar, Lax-
man Prasad Goswami, Daniel Bugas, Nasser Heydari, Ferenc Jeanplong, Thorben Jansen, An-
tonella Pinto, Archimedes Apronti, Abdallah Galal, Ng Ze-An, Ankit Singh, Tong Jiang, Joan
of Arc Xavier, Kanu Priya Agarwal, Mohammed Berkani, Gang Zhang, Zhehang Du, Bened-
ito Alves de Oliveira Junior, Dmitry Malishev, Nicolas Remy, Taylor D. Hartman, Tim Tarver,
Stephen Mensah, Gautier Abou Loume, Wiktor Morak, Farzad Habibi, Sarah Hoback, Will
Cai, Javier Gimenez, Roselynn Grace Montecillo, Jakub ucki, Russell Campbell, Asankhaya
Sharma, Khalida Meer, Shreen Gul, Daniel Espinosa Gonzalez, Xavier Alapont, Alex Hoover,
Gunjan Chhablani, Freddie Vargus, Arunim Agarwal, Yibo Jiang, Deepakkumar Patil, David
Outevsky, Kevin Joseph Scaria, Rajat Maheshwari, Abdelkader Dendane, Priti Shukla, Ash-
ley Cartwright, Sergei Bogdanov, Niels Mündler, Sören Möller, Luca Arnaboldi, Kunvar
Thaman, Muhammad Rehan Siddiqi, Prajvi Saxena, Himanshu Gupta, Tony Fruhauff, Glen
Sherman, Mátyás Vincze, Siranut Usawasutsakorn, Dylan Ler, Anil Radhakrishnan, Innocent
Enyekwe, Sk Md Salauddin, Jiang Muzhen, Aleksandr Maksapetyan, Vivien Rossbach, Chris
Harjadi, Mohsen Bahaloohoreh, Claire Sparrow, Jasdeep Sidhu, Sam Ali, Song Bian, John Lai,
Eric Singer, Justine Leon Uro, Greg Bateman, Mohamed Sayed, Ahmed Menshawy, Darling
Duclosel, Dario Bezzi, Yashaswini Jain, Ashley Aaron, Murat Tiryakioglu, Sheeshram Siddh,
Keith Krenek, Imad Ali Shah, Jun Jin, Scott Creighton, Denis Peskoff, Zienab EL-Wasif, Ra-
gavendran P, Michael Richmond, Joseph McGowan, Tejal Patwardhan, Hao-Yu Sun, Ting Sun,
Nikola Zubi, Samuele Sala, Stephen Ebert, Jean Kaddour, Manuel Schottdorf, Dianzhuo Wang,
Gerol Petruzella, Alex Meiburg, Tilen Medved, Ali ElSheikh, S. Ashwin Hebbar, Lorenzo Va-
quero, Xianjun Yang, Jason Poulos, Vilém Zouhar, Sergey Bogdanik, Mingfang Zhang, Jorge
Sanz-Ros, David Anugraha, Yinwei Dai, Anh N. Nhu, Xue Wang, Ali Anil Demircali, Zhibai
Jia, Yuyin Zhou, Juncheng Wu, Mike He, Nitin Chandok, Aarush Sinha, Gaoxiang Luo, Long
Le, Mickaël Noyé, Micha Perekiewicz, Ioannis Pantidis, Tianbo Qi, Soham Sachin Purohit,
Letitia Parcalabescu, Thai-Hoa Nguyen, Genta Indra Winata, Edoardo M. Ponti, Hanchen Li,
Kaustubh Dhole, Jongee Park, Dario Abbondanza, Yuanli Wang, Anupam Nayak, Diogo M.
Caetano, Antonio A. W. L. Wong, Maria del Rio-Chanona, Dániel Kondor, Pieter Francois,
Ed Chalstrey, Jakob Zsambok, Dan Hoyer, Jenny Reddish, Jakob Hauser, Francisco-Javier
Rodrigo-Ginés, Suchandra Datta, Maxwell Shepherd, Thom Kamphuis, Qizheng Zhang, Hyun-
jun Kim, Ruiji Sun, Jianzhu Yao, Franck Dernoncourt, Satyapriya Krishna, Sina Rismanchian,
Bonan Pu, Francesco Pinto, Yingheng Wang, Kumar Shridhar, Kalon J. Overholt, Glib Briia,
Hieu Nguyen, David Quod Soler Bartomeu, Tony CY Pang, Adam Wecker, Yifan Xiong, Fan-
fei Li, Lukas S. Huber, Joshua Jaeger, Romano De Maddalena, Xing Han Lù, Yuhui Zhang,
Claas Beger, Patrick Tser Jern Kon, Sean Li, Vivek Sanker, Ming Yin, Yihao Liang, Xinlu
Zhang, Ankit Agrawal, Li S. Yifei, Zechen Zhang, Mu Cai, Yasin Sonmez, Costin Cozianu,
Changhao Li, Alex Slen, Shoubin Yu, Hyun Kyu Park, Gabriele Sarti, Marcin Briaski, Alessan-
dro Stolfo, Truong An Nguyen, Mike Zhang, Yotam Perlitz, Jose Hernandez-Orallo, Runjia Li,
Amin Shabani, Felix Juefei-Xu, Shikhar Dhingra, Orr Zohar, My Chiffon Nguyen, Alexan-
der Pondaven, Abdurrahim Yilmaz, Xuandong Zhao, Chuanyang Jin, Muyan Jiang, Stefan
Todoran, Xinyao Han, Jules Kreuer, Brian Rabern, Anna Plassart, Martino Maggetti, Luther
Yap, Robert Geirhos, Jonathon Kean, Dingsu Wang, Sina Mollaei, Chenkai Sun, Yifan Yin,
Shiqi Wang, Rui Li, Yaowen Chang, Anjiang Wei, Alice Bizeul, Xiaohan Wang, Alexan-
dre Oliveira Arrais, Kushin Mukherjee, Jorge Chamorro-Padial, Jiachen Liu, Xingyu Qu, Junyi
Guan, Adam Bouyamourn, Shuyu Wu, Martyna Plomecka, Junda Chen, Mengze Tang, Ji-
aqi Deng, Shreyas Subramanian, Haocheng Xi, Haoxuan Chen, Weizhi Zhang, Yinuo Ren,
Haoqin Tu, Sejong Kim, Yushun Chen, Sara Vera Marjanovi, Junwoo Ha, Grzegorz Luczyna,
Jeff J. Ma, Zewen Shen, Dawn Song, Cedegao E. Zhang, Zhun Wang, Gaël Gendron, Yunze
Xiao, Leo Smucker, Erica Weng, Kwok Hao Lee, Zhe Ye, Stefano Ermon, Ignacio D. Lopez-
Miguel, Theo Knights, Anthony Gitter, Namkyu Park, Boyi Wei, Hongzheng Chen, Kunal
Pai, Ahmed Elkhanany, Han Lin, Philipp D. Siedler, Jichao Fang, Ritwik Mishra, Károly
Zsolnai-Fehér, Xilin Jiang, Shadab Khan, Jun Yuan, Rishab Kumar Jain, Xi Lin, Mike Pe-
terson, Zhe Wang, Aditya Malusare, Maosen Tang, Isha Gupta, Ivan Fosin, Timothy Kang,
Barbara Dworakowska, Kazuki Matsumoto, Guangyao Zheng, Gerben Sewuster, Jorge Pretel
Villanueva, Ivan Rannev, Igor Chernyavsky, Jiale Chen, Deepayan Banik, Ben Racz, Wen-
chao Dong, Jianxin Wang, Laila Bashmal, Duarte V. Gonçalves, Wei Hu, Kaushik Bar, On-
drej Bohdal, Atharv Singh Patlan, Shehzaad Dhuliawala, Caroline Geirhos, Julien Wist, Yuval
Kansal, Bingsen Chen, Kutay Tire, Atak Talay Yücel, Brandon Christof, Veerupaksh Singla,
Zijian Song, Sanxing Chen, Jiaxin Ge, Kaustubh Ponkshe, Isaac Park, Tianneng Shi, Mar-
tin Q. Ma, Joshua Mak, Sherwin Lai, Antoine Moulin, Zhuo Cheng, Zhanda Zhu, Ziyi Zhang,
Vaidehi Patil, Ketan Jha, Qiutong Men, Jiaxuan Wu, Tianchi Zhang, Bruno Hebling Vieira,
Alham Fikri Aji, Jae-Won Chung, Mohammed Mahfoud, Ha Thi Hoang, Marc Sperzel, Wei
Hao, Kristof Meding, Sihan Xu, Vassilis Kostakos, Davide Manini, Yueying Liu, Christopher
Toukmaji, Eunmi Yu, Arif Engin Demircali, Zhiyi Sun, Ivan Dewerpe, Hongsen Qin, Roman
Pflugfelder, James Bailey, Johnathan Morris, Ville Heilala, Sybille Rosset, Zishun Yu, Peter E.
Chen, Woongyeong Yeo, Eeshaan Jain, Sreekar Chigurupati, Julia Chernyavsky, Sai Prajwal
Reddy, Subhashini Venugopalan, Hunar Batra, Core Francisco Park, Hieu Tran, Guilherme
Maximiano, Genghan Zhang, Yizhuo Liang, Hu Shiyu, Rongwu Xu, Rui Pan, Siddharth
Suresh, Ziqi Liu, Samaksh Gulati, Songyang Zhang, Peter Turchin, Christopher W. Bartlett,
Christopher R. Scotese, Phuong M. Cao, Ben Wu, Jacek Karwowski, and Davide Scaramuzza.
A benchmark of expert-level academic questions to assess ai capabilities. Nature, 649(8099):
1139–1146, January 2026. ISSN 1476-4687. doi: 10.1038/s41586-025-09962-4. URL
http://dx.doi.org/10.1038/s41586-025-09962-4.
[4] Mislav Balunovi, Jasper Dekoninck, Ivo Petrov, Nikola Jovanovi, and Martin Vechev. Math-
arena: Evaluating llms on uncontaminated math competitions, 2026. URL https://arxiv.
org/abs/2505.23281.
[5] Chaithanya Bandi, Razvan-Gabriel Dumitru, Ben Hertzberg, Divyansh Agarwal, Geobio Boo,
Tejas Polakam, Sami Hassaan, Jeff Da, HiJae Kim, Vipul Gupta, Manasi Sharma, Andrew Park,
Martin Dimakis, Ernesto Gabriel Hernandez Montoya, Dan Rambado, Ivan Salazar, Rafael
Cruz, MohammadHossein Rezaei, Chetan Rane, Ben Levin, Daniel Yue Zhang, Brad Kenstler,
and Bing Liu. Mcp-atlas: A large-scale benchmark for tool-use competency with real mcp
servers, 2026. URL https://arxiv.org/abs/2602.00933.
[6] Victor Barres, Honghua Dong, Soham Ray, Xujie Si, and Karthik Narasimhan. τ 2-bench:
Evaluating conversational agents in a dual-control environment, 2025. URL https://arxiv.
org/abs/2506.07982.
[7] Iz Beltagy, Matthew E. Peters, and Arman Cohan. Longformer: The long-document trans-
former, 2020. URL https://arxiv.org/abs/2004.05150.
[8] Haorui Chen, Chengze Li, and Jia Li. Featbench: Towards more realistic evaluation of feature-
level code generation, 2026. URL https://arxiv.org/abs/2509.22237.
[9] Alireza Daghighfarsoodeh, Chung-Yu Wang, Hamed Taherkhani, Melika Sepidband, Moham-
mad Abdollahi, Hadi Hemmati, and Hung Viet Pham. Deep-bench: Deep learning benchmark
dataset for code generation, 2025. URL https://arxiv.org/abs/2502.18726.
[10] Tri Dao. FlashAttention-2: Faster attention with better parallelism and work partitioning. In
International Conference on Learning Representations (ICLR), 2024.
[11] Tri Dao, Daniel Y. Fu, Stefano Ermon, Atri Rudra, and Christopher Ré. Flashattention: Fast
and memory-efficient exact attention with io-awareness, 2022. URL https://arxiv.org/
abs/2205.14135.
[12] DeepSeek-AI. Deepseek-v3 technical report, 2024. URL https://arxiv.org/abs/2412
.19437.
[13] DeepSeek-AI. Deepseek-v2: A strong, economical, and efficient mixture-of-experts language
model, 2024. URL https://arxiv.org/abs/2405.04434.
[14] DeepSeek-AI. Deepseek-v3.2: Pushing the frontier of open large language models, 2025. URL
https://arxiv.org/abs/2512.02556.
[15] DeepSeek-AI, Anyi Xu, Bangcai Lin, Bing Xue, Bingxuan Wang, Bingzheng Xu, Bochao
Wu, Bowei Zhang, Chaofan Lin, Chen Dong, Chenchen Ling, Chengda Lu, Chenggang Zhao,
Chengqi Deng, Chengyu Hou, Chenhao Xu, Chenze Shao, Chong Ruan, Conner Sun, Damai
Dai, Daya Guo, Dejian Yang, Deli Chen, Donghao Li, Dongjie Ji, Erhang Li, Fang Wei,
Fangyun Lin, Fangzhou Yuan, Feiyu Xia, Fucong Dai, Guangbo Hao, Guanting Chen, Guoai
Cao, Guolai Meng, Guowei Li, Han Yu, Han Zhang, Hanwei Xu, Hao Li, Haofen Liang, Haol-
ing Zhang, Haoming Luo, Haoran Wei, Haotian Yuan, Haowei Zhang, Haowen Luo, Haoyu
Chen, Haozhe Ji, Hengqing Zhang, Honghui Ding, Hongxuan Tang, Huanqi Cao, Huazuo
Gao, Hui Qu, Hui Zeng, J Yang, JQ Zhu, Jia Luo, Jia Song, Jia Yu, Jialiang Huang, Jialu
Cai, Jian Liang, Jiangting Zhou, Jiasheng Ye, Jiashi Li, Jiaxin Xu, Jiewen Hu, Jieyu Yang, Jin
Chen, Jin Yan, Jingchang Chen, Jingli Zhou, Jingting Xiang, Jingyang Yuan, Jingyuan Cheng,
Jingzi Zhou, Jinhua Zhu, Jiping Yu, Joseph Sun, Jun Ran, Junguang Jiang, Junjie Qiu, Junlong
Li, Junmin Zheng, Junxiao Song, Kai Dong, Kaige Gao, Kang Guan, Kexing Zhou, Kezhao
Huang, Kuai Yu, Lean Wang, Lecong Zhang, Lei Wang, Leyi Xia, Li Zhang, Liang Zhao,
Lihua Guo, Lingxiao Luo, Linwang Ma, Linyan Zhu, Litong Wang, Liyu Cai, Liyue Zhang,
Longhao Chen, MS Di, MY Xu, Max Mei, Miaojun Wang, Mingchuan Zhang, Minghua Zhang,
Minghui Tang, Mingming Li, Mingxu Zhou, Minmin Han, Ning Wang, Panpan Huang, Pan-
pan Wang, Peixin Cong, Peiyi Wang, Peng Zhang, Qiancheng Wang, Qihao Zhu, Qingyang Li,
Qinyu Chen, Qiushi Du, Qiwei Jiang, Rui Tian, Ruifan Xu, Ruijie Lu, Ruiling Xu, Ruiqi Ge,
Ruisong Zhang, Ruizhe Pan, Runji Wang, Runqian Chen, Runqiu Yin, Runxin Xu, Ruomeng
Shen, Ruoyu Zhang, Ruyi Chen, SH Liu, Shanghao Lu, Shangmian Sun, Shangyan Zhou,
Shanhuang Chen, Shaofei Cai, Shaoheng Nie, Shaoqing Wu, Shaoyuan Chen, Shengding Hu,
Shengyu Liu, Shiqiang Hu, Shirong Ma, Shiyu Wang, Shuiping Yu, Shunfeng Zhou, Shuting
Pan, Shuying Yu, Songyang Zhou, Tao Ni, Tao Yun, Tian Jin, Tian Pei, Tian Ye, Tianle Lin,
Tianran Ji, Tianyi Cui, Tianyuan Yue, Tingting Yu, Tun Wang, W Zhang, WL Xiao, Wangding
Zeng, Wei An, Weilin Zhao, Wen Liu, Wenfeng Liang, Wenjie Pang, Wenjing Luo, Wenjing
Yao, Wenjun Gao, Wenkai Yang, Wenlve Huang, Wenqing Hou, Wentao Zhang, Wenting Ma,
Xi Gao, Xiang He, Xiangwen Wang, Xianzu Wang, Xiao Bi, Xiaodong Liu, Xiaohan Wang,
Xiaokang Chen, Xiaokang Zhang, Xiaotao Nie, Xiaowen Sun, Xiaoxiang Wang, Xin Cheng,
Xin Liu, Xin Xie, Xingchao Liu, Xingchen Liu, Xingkai Yu, Xingyou Li, Xinyu Yang, Xinyu
Zhang, Xu Chen, Xuanyu Wang, Xuecheng Su, Xueyin Chen, Xuheng Lin, Xuwei Fu, YC Yan,
YQ Wang, YW Ma, Yanfeng Luo, Yang Zhang, Yanhong Xu, Yanru Ma, Yanwen Huang, Yao
Li, Yao Li, Yao Xu, Yao Zhao, Yaofeng Sun, Yaohui Wang, Yi Qian, Yi Shao, Yi Yu, Yichao
Zhang, Yifan Ding, Yifan Shi, Yijia Wu, Yiliang Xiong, Yiling Ma, Ying He, Ying Tang, Ying
Zhou, Yingjia Luo, Yinmin Zhong, Yishi Piao, Yisong Wang, Yixiang Zhang, Yixiao Chen,
Yixuan Tan, Yixuan Wei, Yiyang Ma, Yiyuan Liu, Yonglun Yang, Yongqiang Guo, Yongtong
Wu, Yu Wu, YuKun Li, Yuan Cheng, Yuan Ou, Yuanfan Xu, Yuanhao Li, Yuduan Wang, Yue-
han Yang, Yuer Xu, Yuhan Wu, Yuhao Meng, Yuheng Zou, Yukun Zha, Yunfan Xiong, Yupeng
Chen, Yuping Lin, Yuqian Cao, Yuqian Wang, Yushun Zhang, Yuting Yan, Yutong Lin, Yuxian
Gu, Yuxiang Luo, Yuxiang You, Yuxuan Liu, Yuxuan Zhou, Yuyang Zhou, Yuzhen Huang,
ZF Wu, Zehao Wang, Zehua Zhao, Zehui Ren, Zekai Zhang, Zhangli Sha, Zhe Fu, Zhe Ju,
Zhean Xu, Zhenda Xie, Zhengyan Zhang, Zheren Gao, Zhewen Hao, Zhibin Gou, Zhicheng
Ma, Zhigang Yan, Zhihong Shao, Zhixian Huang, Zhixuan Chen, Zhiyu Wu, Zhizhou Ren,
Zhongyu Wu, Zhuoshu Li, Zhuping Zhang, Zian Xu, Zihao Wang, Zihua Qu, Zihui Gu, Zijia
Zhu, Zilin Li, Zipeng Zhang, Ziwei Xie, Ziyi Gao, Ziyi Wan, Zizheng Pan, and Zongqing
Yao. Deepseek-v4: Towards highly efficient million-token context intelligence, 2026. URL
https://arxiv.org/abs/2606.19348.
[16] Jasper Dekoninck, Nikola Jovanovi, Tim Gehrunger, Kári Rögnvaldsson, Ivo Petrov, Chen-
hao Sun, and Martin Vechev. Beyond benchmarks: Matharena as an evaluation platform for
mathematics with llms. 2026. URL https://arxiv.org/abs/2605.00674.
[17] Kaustubh Deshpande, Ved Sirdeshmukh, Johannes Baptist Mols, Lifeng Jin, Ed-Yeremai
Hernandez-Cardona, Dean Lee, Jeremy Kritz, Willow E Primack, Summer Yue, and Chen
Xing. Multichallenge: A realistic multi-turn conversation evaluation benchmark challenging
to frontier llms. In Findings of the Association for Computational Linguistics: ACL 2025,
pages 18632–18702, 2025.
[18] Ming Ding, Zhuoyi Yang, Wenyi Hong, Wendi Zheng, Chang Pei, Bo Peng, Yinchu Ding, Jie
Tang, and Yuxiao Dong. Cogview: Mastering text-to-image generation via transformers. In
Advances in Neural Information Processing Systems, volume 34, pages 19822–19835, 2021.
[19] Shuangrui Ding, Xuanlang Dai, Long Xing, Shengyuan Ding, Ziyu Liu, Yang JingYi, Penghui
Yang, Zhixiong Zhang, Xilin Wei, Xinyu Fang, et al. Wildclawbench: A benchmark for real-
world, long-horizon agent evaluation. arXiv preprint arXiv:2605.10912, 2026.
[20] Shihan Dou, Ming Zhang, Zhangyue Yin, Chenhao Huang, Yujiong Shen, Junzhe Wang, Jiayi
Chen, Yuchen Ni, Junjie Ye, Cheng Zhang, et al. Cl-bench: A benchmark for context learning.
arXiv preprint arXiv:2602.03587, 2026.
[21] GLM-5 Team et al.
Glm-5: from vibe coding to agentic engineering.
arXiv preprint
arXiv:2602.15763, 2026.
[22] Fabian Gloeckle, Badr Youbi Idrissi, Baptiste Rozière, David Lopez-Paz, and Gabriel Syn-
naeve.
Better & faster large language models via multi-token prediction, 2024.
URL
https://arxiv.org/abs/2404.19737.
[23] Xiangming Gu, Tianyu Pang, Chao Du, Qian Liu, Fengzhuo Zhang, Cunxiao Du, Ye Wang,
and Min Lin. When attention sink emerges in language models: An empirical view, 2025. URL
https://arxiv.org/abs/2410.10781.
[24] Yuxian Gu, Li Dong, Furu Wei, and Minlie Huang. Minillm: Knowledge distillation of large
language models. In The Twelfth International Conference on Learning Representations, 2024.
URL https://openreview.net/forum?id=5h0qf7IBZZ.
[25] X Guo, Zhenyu Huang, Zujie Wang, Wen, and et al. Zhang. Kpop: Taming training–inference
mismatch in reinforcement learning with adaptive masking regions. 2026. URL https://ri
ngtech.notion.site/Taming-Training-Inference-Mismatch-in-Reinforcement
-Learning-with-Adaptive-Masking-Regions-364c8705a032801b84dcc4c5f768254
9.
[26] Lukas Haas, Gal Yona, Giovanni D’Antonio, Sasha Goldshtein, and Dipanjan Das. Simpleqa
verified: A reliable factuality benchmark to measure parametric knowledge. arXiv preprint
arXiv:2509.07968, 2025.
[27] Yancheng He, Shilong Li, Jiaheng Liu, Yingshui Tan, Weixun Wang, Hui Huang, Xingyuan
Bu, Hangyu Guo, Chengwei Hu, Boren Zheng, Zhuoran Lin, Xuepeng Liu, Dekai Sun, Shirong
Lin, Zhicheng Zheng, Xiaoyong Zhu, Wenbo Su, and Bo Zheng. Chinese simpleqa: A chinese
factuality evaluation for large language models, 2024. URL https://arxiv.org/abs/24
11.07140.
[28] Sam Ade Jacobs, Masahiro Tanaka, Chengming Zhang, Minjia Zhang, Shuaiwen Leon Song,
Samyam Rajbhandari, and Yuxiong He. Deepspeed ulysses: System optimizations for enabling
training of extreme long sequence transformer models, 2023.
[29] Naman Jain, King Han, Alex Gu, Wen-Ding Li, Fanjia Yan, Tianjun Zhang, Sida Wang, Ar-
mando Solar-Lezama, Koushik Sen, and Ion Stoica. Livecodebench: Holistic and contamina-
tion free evaluation of large language models for code, 2024. URL https://arxiv.org/ab
s/2403.07974.
[30] Carlos E Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and
Karthik R Narasimhan. SWE-bench: Can language models resolve real-world github issues?
In The Twelfth International Conference on Learning Representations, 2024. URL https:
//openreview.net/forum?id=VTF8yNQM66.
[31] Mehran Kazemi, Bahare Fatemi, Hritik Bansal, John Palowitch, Chrysovalantis Anastasiou,
Sanket Vaibhav Mehta, Lalit K. Jain, Virginia Aglietti, Disha Jindal, Peter Chen, Nishanth
Dikkala, Gladys Tyen, Xin Liu, Uri Shalit, Silvia Chiappa, Kate Olszewska, Yi Tay, Vinh Q.
Tran, Quoc V. Le, and Orhan Firat. Big-bench extra hard, 2025. URL https://arxiv.org/
abs/2502.19187.
[32] Woosuk Kwon, Zhuohan Li, Siyuan Zhuang, Ying Sheng, Lianmin Zheng, Cody Hao Yu,
Joseph E. Gonzalez, Hao Zhang, and Ion Stoica. Efficient memory management for large
language model serving with pagedattention. In Proceedings of the ACM SIGOPS 29th Sym-
posium on Operating Systems Principles, 2023.
[33] Xiangyi Li, Wenbo Chen, Yimin Liu, Shenghan Zheng, Xiaokun Chen, Yifeng He, Yubo Li,
Bingran You, Haotian Shen, and Han chung Lee. Skillsbench: Benchmarking how well agent
skills work across diverse tasks, 2026. URL https://arxiv.org/abs/2602.12670.
[34] Jingyuan Liu, Jianlin Su, Xingcheng Yao, Zhejun Jiang, Guokun Lai, Yulun Du, Yidao Qin,
Weixin Xu, Enzhe Lu, Junjie Yan, et al. Muon is scalable for llm training, 2025. URL https:
//arxiv.org/abs/2502.16982.
[35] Thang Luong, Dawsen Hwang, Hoang H. Nguyen, Golnaz Ghiasi, Yuri Chervonyi, Insuk Seo,
Junsu Kim, Garrett Bingham, Jonathan Lee, Swaroop Mishra, Alex Zhai, Clara Huiyi Hu,
Henryk Michalewski, Jimin Kim, Jeonghyun Ahn, Junhwi Bae, Xingyou Song, Trieu H. Trinh,
Quoc V. Le, and Junehyuk Jung. Towards robust mathematical reasoning, 2025. URL https:
//arxiv.org/abs/2511.01846.
[36] Wenhan Ma, Hailin Zhang, Liang Zhao, Yifan Song, Yudong Wang, Zhifang Sui, and Fuli
Luo. Stabilizing moe reinforcement learning by aligning training and inference routers. arXiv
preprint arXiv:2510.11370, 2025.
[37] Philipp Moritz, Robert Nishihara, Stephanie Wang, Alexey Tumanov, Richard Liaw, Eric
Liang, Melih Elibol, Zongheng Yang, William Paul, Michael I. Jordan, and Ion Stoica. Ray:
A distributed framework for emerging AI applications. In 13th USENIX Symposium on Oper-
ating Systems Design and Implementation (OSDI 18), pages 561–577, Carlsbad, CA, October
2018. USENIX Association. ISBN 978-1-939133-08-3. URL https://www.usenix.org/c
onference/osdi18/presentation/moritz.
[38] OpenAI. gpt-oss-120b & gpt-oss-20b model card, 2025. URL https://arxiv.org/abs/25
08.10925.
[39] Tejal Patwardhan, Rachel Dias, Elizabeth Proehl, Grace Kim, Michele Wang, Olivia Watkins,
Simón Posada Fishman, Marwan Aljubeh, Phoebe Thacker, Laurance Fauconnet, Natalie S.
Kim, Patrick Chao, Samuel Miserendino, Gildas Chabot, David Li, Michael Sharman, Alexan-
dra Barr, Amelia Glaese, and Jerry Tworek. Gdpval: Evaluating ai model performance on real-
world economically valuable tasks, 2025. URL https://arxiv.org/abs/2510.04374.
[40] Valentina Pyatkin, Saumya Malik, Victoria Graf, Hamish Ivison, Shengyi Huang, Pradeep
Dasigi, Nathan Lambert, and Hanna Hajishirzi. Generalizing verifiable instruction following.
Advances in Neural Information Processing Systems, 38, 2026.
[41] Yunjia Qi, Hao Peng, Xiaozhi Wang, Amy Xin, Youfeng Liu, Bin Xu, Lei Hou, and Juanzi Li.
Agentif: Benchmarking instruction following of large language models in agentic scenarios.
arXiv preprint arXiv:2505.16944, 2025.
[42] Yanzhao Qin, Tao Zhang, Yanjun Shen, Wenjing Luo, Haoze Sun, Yan Zhang, Yujing Qiao,
Weipeng Chen, Zenan Zhou, Wentao Zhang, et al. Sysbench: Can large language models
follow system messages? arXiv preprint arXiv:2408.10943, 2024.
[43] Samyam Rajbhandari, Jeff Rasley, Olatunji Ruwase, and Yuxiong He. ZeRO: Memory op-
timizations toward training trillion parameter models.
In Proceedings of the International
Conference for High Performance Computing, Networking, Storage and Analysis, 2020. doi:
10.1109/SC41405.2020.00024.
[44] David Rein, Betty Li Hou, Asa Cooper Stickland, Jackson Petty, Richard Yuanzhe Pang, Julien
Dirani, Julian Michael, and Samuel R. Bowman. GPQA: A graduate-level google-proof q&a
benchmark. In First Conference on Language Modeling, 2024. URL https://openreview
.net/forum?id=Ti67584b98.
[45] Wei Shao, Zheng Lingchao, Pengyu Wang, Peizhen Zheng, Li Jun, and Yuwei Fan. Lopt:
Lossless parallel tokenization acceleration for long context inference of large language model.
In Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics
(Volume 1: Long Papers), pages 33107–33122, 2026.
[46] Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang,
Mingchuan Zhang, YK Li, Yang Wu, et al. Deepseekmath: Pushing the limits of mathematical
reasoning in open language models. arXiv preprint arXiv:2402.03300, 2024.
[47] Guangming Sheng, Chi Zhang, Zilingfeng Ye, Xibin Wu, Wang Zhang, Ru Zhang, Yanghua
Peng, Haibin Lin, and Chuan Wu. Hybridflow: A flexible and efficient rlhf framework. arXiv
preprint arXiv: 2409.19256, 2024.
[48] Mohammad Shoeybi, Mostofa Patwary, Raul Puri, Patrick LeGresley, Jared Casper, and Bryan
Catanzaro. Megatron-lm: Training multi-billion parameter language models using model par-
allelism. arXiv preprint arXiv:1909.08053, 2019.
[49] Jianlin Su, Yu Lu, Shengfeng Pan, Ahmed Murtadha, Bo Wen, and Yunfeng Liu. Roformer:
Enhanced transformer with rotary position embedding, 2021. URL https://arxiv.org/ab
s/2104.09864.
[50] Mingjie Sun, Xinlei Chen, J. Zico Kolter, and Zhuang Liu. Massive activations in large lan-
guage models, 2024. URL https://arxiv.org/abs/2402.17762.
[51] Gemma Team. Gemma 2: Improving open language models at a practical size. arXiv preprint
arXiv:2408.00118, 2024.
[52] Ling Team et al. Every step evolves: Scaling reinforcement learning for trillion-scale thinking
model. arXiv preprint arXiv:2510.18855, 2025.
[53] Lean Wang, Huazuo Gao, Chenggang Zhao, Xu Sun, and Damai Dai. Auxiliary-loss-free load
balancing strategy for mixture-of-experts, 2024. URL https://arxiv.org/abs/2408.156
64.
[54] Jason Wei, Zhiqing Sun, Spencer Papay, Scott McKinney, Jeffrey Han, Isa Fulford, Hyung Won
Chung, Alex Tachard Passos, William Fedus, and Amelia Glaese. Browsecomp: A simple yet
challenging benchmark for browsing agents, 2025. URL https://arxiv.org/abs/2504.1
2516.
[55] Guangxuan Xiao, Ji Lin, Mickael Seznec, Hao Wu, Julien Demouth, and Song Han.
Smoothquant: Accurate and efficient post-training quantization for large language models. In
International conference on machine learning, pages 38087–38099. PMLR, 2023.
[56] Guangxuan Xiao, Yuandong Tian, Beidi Chen, Song Han, and Mike Lewis. Efficient streaming
language models with attention sinks, 2023. URL https://arxiv.org/abs/2309.17453.
[57] Zhenda Xie, Yixuan Wei, Huanqi Cao, Chenggang Zhao, Chengqi Deng, Jiashi Li, Damai
Dai, Huazuo Gao, Jiang Chang, Kuai Yu, et al. mhc: Manifold-constrained hyper-connections.
arXiv preprint arXiv:2512.24880, 2025.
[58] Zhenda Xie, Yixuan Wei, Huanqi Cao, Chenggang Zhao, Chengqi Deng, Jiashi Li, Damai
Dai, Huazuo Gao, et al. mhc: Manifold-constrained hyper-connections, 2025. URL https:
//arxiv.org/abs/2512.24880.
[59] An Yang, Anfeng Li, Baosong Yang, Beichen Zhang, Binyuan Hui, Bo Zheng, Bowen Yu,
Chang Gao, Chengen Huang, Chenxu Lv, et al.
Qwen3 technical report.
arXiv preprint
arXiv:2505.09388, 2025.
[60] Songlin Yang, Jan Kautz, and Ali Hatamizadeh. Gated delta networks: Improving mamba2
with delta rule, 2025. URL https://arxiv.org/abs/2412.06464.
[61] Bowen Ye, Rang Li, Qibin Yang, Yuanxin Liu, Linli Yao, Hanglong Lv, Zhihui Xie, Chenxin
An, Lei Li, Lingpeng Kong, Qi Liu, Zhifang Sui, and Tong Yang. Claw-eval: Towards trustwor-
thy evaluation of autonomous agents, 2026. URL https://arxiv.org/abs/2604.06132.
[62] Yichun Yin, Wenyong Huang, Kaikai Song, Yehui Tang, Xueyu Wu, Wei Guo, Peng Guo,
Yaoyuan Wang, Xiaojun Meng, Yasheng Wang, Dong Li, Can Chen, Dandan Tu, Yin Li, Fisher
Yu, Ruiming Tang, Yunhe Wang, Baojun Wang, Bin Wang, Bo Wang, Boxiao Liu, Changzheng
Zhang, Duyu Tang, Fei Mi, Hui Jin, Jiansheng Wei, Jiarui Qin, Jinpeng Li, Jun Zhao, Liqun
Deng, Lin Li, Minghui Xu, Naifu Zhang, Nianzu Zheng, Qiang Li, Rongju Ruan, Shengjun
Cheng, Tianyu Guo, Wei He, Wei Li, Weiwen Liu, Wulong Liu, Xinyi Dai, Yonghan Dong,
Yu Pan, Yue Li, Yufei Wang, Yujun Li, Yunsheng Ni, Zhe Liu, Zhenhe Zhang, and Zhicheng
Liu. Pangu ultra: Pushing the limits of dense large language models on ascend npus, 2025.
URL https://arxiv.org/abs/2504.07866.
[63] Yifan Zhang and Team Math-AI. American invitational mathematics examination (aime) 2026,
2026.
[64] Jeffrey Zhou, Tianjian Lu, Swaroop Mishra, Siddhartha Brahma, Sujoy Basu, Yi Luan, Denny
Zhou, and Le Hou. Instruction-following evaluation for large language models. arXiv preprint
arXiv:2311.07911, 2023.
[65] Defa Zhu, Hongzhi Huang, Zihao Huang, Yutao Zeng, Yunyao Mao, Banggu Wu, Qiyang Min,
and Xun Zhou. Hyper-connections, 2024. URL https://arxiv.org/abs/2409.19606.
[66] 苏剑林. Moe 环游记:3、换个思路来分配. 科学空间(kexue.fm), 2025. URL https:
//spaces.ac.cn/archives/10757.
A 附录 / 补充材料
A.1 架构超参数
openPangu-2.0-Flash 与 openPangu-2.0-Pro 的详细架构超参数见表 8。我们同时给出 MoE15B-A2B 模型的超参数,该模型主要用于前期消融实验和快速概念验证。
表 8:openPangu-2.0 系列架构超参数。
| 超参数 | MoE15B-A2B | openPangu-2.0-Flash | openPangu-2.0-Pro |
|---|---|---|---|
| 总参数量 | 15B | 92B | 505B |
| 激活参数量 | 2B | 6B | 18B |
| 总层数 | 32 | 46 | 50 |
| 稠密层数 | 2 | 2 | 3 |
| MoE 层数 | 30 | 44 | 47 |
| Hidden Size | 1536 | 2560 | 5120 |
| Vocabulary Size | 151552 | 151552 | 151552 |
| Attention Heads | 48 | 48 | 64 |
| Query Projection Rank | 384 | 1024 | 1536 |
| Key-Value Projection Rank | 512 | 512 | 512 |
| Non-Positional QK Dimensions | 128 | 128 | 128 |
| RoPE Dimensions | 64 | 64 | 64 |
| Value Head Dimensions | 128 | 128 | 128 |
| Dense FFN Intermediate Size | 7680 | 9216 | 16128 |
| Routed Experts | 128 | 256 | 384 |
| Shared Experts | 1 | 1 | 1 |
| Activated Routed Experts | 8 | 8 | 8 |
| Expert Intermediate Size | 768 | 1024 | 1792 |
| MTP Layers | 1 | 3 | 3 |
| DSA:SWA 比例 | 1:2 | 1:2 | 1:2 |
| SWA Window Size | 512 | 512 | 512 |
A.2 参数化 Attention Sink 与 gpt-oss Sink 对比
我们通过前期实验评估 PAS。所有实验都使用 MoE15B-A2B 基线模型,并训练 250B Token。
首先,如图 9 所示,PAS 可以让训练过程中的梯度范数更加平滑。加入参数化 Sink 后,Gradient Norm Spike 明显减少。
图 9:有无 PAS 时的训练 Gradient Norm。加入参数化 Sink 后,梯度范数更平滑,Spike 更少。
我们进一步在 FULL:SWA=1:2 的混合 SWA 模型上比较训练 Loss,如图 10 所示。
对于纯 Full Attention 基线,加入参数化 Sink 并没有带来明显 Loss 收益;但对于 Hybrid SWA 模型,PAS 可以稳定降低训练 Loss,并且明显优于 gpt-oss 使用的 Sink 机制。
我们认为原因在于 SWA 的局部特性:如果没有显式 Sink,即使当前窗口中没有任何值得关注的真实 Token,Attention Mass 仍必须分配给窗口中的真实 Token,于是某些 Token 会被迫承担局部 Sink 的角色,使 Attention Distribution 变得不稳定。
PAS 为 SWA 层提供一个固定的吸收通道,同时也为 FULL/DSA 层提供稳定的全局 Sink;当局部窗口缺少有用信息时,它还能作为 SWA 的 fallback attention target。
图 10:FULL:SWA=1:2 混合 SWA 模型的训练 Loss 差异。对比无参数化 Sink、gpt-oss Sink 和 PAS。曲线表示相对无 PAS 基线的 Loss 差,越低越好。
A.3 自适应无辅助损失负载均衡
为了评估 2.2 节中的自适应无辅助损失负载均衡,我们把它与原始无辅助损失 Bias,也就是使用 sign-based update 的方案进行训练动态对比。
如图 11 所示,两种方法的收敛速度基本相同,在相同配置下 LM Loss 几乎一致。
不过,自适应 RMS-normalized update 的负载控制能力更强:它始终能取得更低的 Batch 级负载均衡违规指标 MaxVio,而且随着训练继续,这一优势还会进一步扩大。
图 11:自适应无辅助损失 Bias(RMS-normalized update)与原始无辅助损失 Bias(sign update)的训练对比。左图为相对原始基线的 LM Loss 差异;右图为 Batch 级 Load-Balance Violation(MaxVio,越低越好)。
A.4 Newton-Schulz 迭代系数
Muon 优化器对更新矩阵执行 Newton-Schulz 正交化时,我们运行 5 次迭代,各轮使用表 9 中的 ((a,b,c)) 系数。
表 9:Muon 优化器每轮 Newton-Schulz 迭代系数。
| 迭代 | a | b | c |
|---|---|---|---|
| 1 | 4.0848 | -6.8946 | 2.9270 |
| 2 | 3.9505 | -6.3029 | 2.6377 |
| 3 | 3.7418 | -5.5913 | 2.3037 |
| 4 | 2.8769 | -3.1427 | 1.2046 |
| 5 | 2.8366 | -3.0525 | 1.2012 |
这些系数来自 modded-nanogpt 项目中的对应实现。
A.5 使用 Muon 时的 Attention Logits 稳定性
此前工作报告称,大模型训练中使用 Muon 可能导致 Attention Logits,也就是 (QK^\top),出现爆炸,进而损害训练稳定性,并提出 QK-clip 进行缓解。
但在 openPangu-2.0 的完整训练过程中,Attention Logits 始终保持稳定。
如图 12 所示,该图跟踪了 openPangu-2.0-Pro 的完整训练过程,其最大 Attention Logits 始终维持在一个有界区间,约为 20,没有出现爆炸式增长。
我们推测,这种稳定性自然来自 sandwich normalization 和 block post-normalization 等架构组件,它们能够有效控制 Hidden State 与输出尺度。对这一现象更系统的消融分析留待未来工作。
图 12:openPangu-2.0-Pro 完整训练过程中的最大 Attention Logits。整个训练期间都保持在有限范围内。
A.6 算子级训推不一致总结
表 10 总结训练侧与推理侧各模块的实现差异,同时包含两类一致性:
- B/S Cons.:Batch / Sequence 输入 Shape 是否一致;
- Train-Infer Cons.:训练与推理算子实现是否一致。
表 10:各模块的训练—推理算子一致性。
| 模块 | 训练算子 | 推理算子 | B/S Cons. | Train-Infer Cons. |
|---|---|---|---|---|
| MatMul | torch.Linear |
torch.Linear |
No | Yes |
| MatMul | torch.matmul |
torch.matmul |
No | Yes |
| MatMul | torch.matmul |
TransposeBatchMatMul |
No | No |
| MatMul | torch_npu.npu_grouped_matmul |
torch_npu.npu_grouped_matmul |
Yes | Yes |
| RMSNorm | torch_npu.npu_rms_norm |
torch_npu.npu_rms_norm |
Yes | Yes |
| RMSNorm | torch_npu.npu_rms_norm |
npu_ai_infra_kv_rmsnorm_rope_cache_v2 |
No | No |
| RMSNorm | vanilla torch ops | torch_npu.npu_add_rms_norm |
Yes | No |
| RoPE | torch_npu.npu_rotary_mul |
torch_npu.npu_rotary_mul |
Yes | Yes |
| RoPE | torch_npu.npu_rotary_mul |
npu_ai_infra_kv_rmsnorm_rope_cache_v2 |
Yes | Yes |
| RoPE | vanilla torch ops | torch_npu.npu_apply_rotary_pos_emb |
Yes | Yes |
| RoPE | vanilla torch ops | torch_npu.npu_interleave_rope |
Yes | Yes |
| RoPE | vanilla torch ops | torch_npu.npu_mrope |
Yes | Yes |
| Attention | npu_sparse_flash_attention_enhance (sfa) + torch_npu.npu_fusion_attention (sink) |
npu_ai_infra_sparse_flash_attention_pioneer |
No | No |
| Attention | torch_npu.npu_fusion_attention (mla) |
npu_fused_infer_attention_sink |
No | No |
| mHC | npu_manifold_constrained_hyper_connection_pre |
同名算子 | No | Yes |
| mHC | npu_sinkhorn |
npu_sinkhorn |
No | Yes |
| Comm | torch.distributed.all_reduce |
torch.distributed.all_reduce |
No | Yes |
| Comm | torch.distributed.reduce_scatter |
torch.distributed.reduce_scatter |
No | Yes |
| MoE | vanilla torch ops | torch_npu.npu_moe_init_routing / v2 |
Yes | Yes |
| MoE | vanilla torch ops | torch_npu.npu_moe_re_routing |
Yes | Yes |
| MoE | vanilla torch ops,专家按 ID 排序,FP32 | torch_npu.npu_moe_distribute_combine |
Yes | No |
| MoE | vanilla torch ops,专家按 ID 排序,FP32 | torch_npu.npu_moe_finalize_routing |
Yes | No |
| MoE | vanilla torch ops | torch_npu.npu_moe_gating_top_k |
Yes | Yes |
A.7 训练与推理完整对齐方法
图 13:训练前向与推理 Prefill 的严格对齐
训练侧与推理侧使用相同输入序列,并分别通过 Tensor Hook 工具抓取各层输出,导出训练和推理的二进制 Tensor 数据。
随后进入高精度二进制比较与调试闭环:
- 比较 Binary Difference;
- 反向定位数值分叉点;
- 逐步排查并修复代码错误与参数错误;
- 收敛训练和推理两侧算子行为,例如替换推理 FlashAttention,并统一调用参数;
- 重新运行并验证。
最终,Prefill 阶段可以实现 bit-level alignment。
图 13:训练前向与推理 Prefill 的严格一致性对齐流程。
图 14:训练前向与推理 Decode 的算子对齐
训练侧使用 Full Sequence Parallel,而推理 Decode 使用 Single-Step Iteration。同一任务在两侧会出现 Shape Difference,进而触发 Operator Tiling Mismatch,最终导致 Numerical Drift。
解决方案包括三步:
- 输入构造:使用“原始问题 + 第一个 Token”构造单步训练数据,使训练与推理语义边界一致;
- 算子级 Tiling 策略重构:直接修改 Ascend CANN 算子源码,人工约束 SplitK 与 Aggregation Order;
- 重新编译与定制打包:重新编译修改后的 CANN 算子,并通过定制安装包部署。
最终,训练前向与推理 Decode 可以同时做到 Shape Aligned 与 Tiling Aligned,从而得到一致结果。
图 14:训练前向与推理 Decode 的算子对齐。通过一致输入构造与手工修改 SplitK、累加顺序等 Tiling 策略,定制 CANN 算子实现完整对齐。
A.8 逐模块量化决策
表 11:Pro 配置下逐模块量化决策。Linear Layer 参数量为单层数值;MoE Expert 参数量为单 Expert 数值,共 384 个 Expert;Embedding / Output Head 为全局约 0.78B 权重;MHC 为逐层模块,参数量可忽略。
| 模块 | 子模块 | 参数量 | W/A | 原因 |
|---|---|---|---|---|
| MLA | o_proj |
41.9M | INT8/INT8 | Attention 路径上最大的 Linear Layer,约占 52% |
| MLA | q_b_proj |
18.9M | INT8/INT8 | 大矩阵;下游 Softmax 对量化噪声有一定容忍度 |
| MLA | kv_b_proj |
8.39M | BF16/BF16 | 存储 WUK/WUV;同一权重同时参与 W 与 W^T 方向 MatMul,per-token / per-channel 量化无法同时满足 |
| MLA | q_a_proj |
7.86M | BF16/BF16 | 小矩阵;位于 Attention 入口,误差会沿残差流传播 |
| MLA | kv_a_proj |
2.95M | BF16/BF16 | 小矩阵;位于 Attention 入口 |
| LI | wq_b |
6.29M | BF16/BF16 | 位于 TopK 离散选择前,量化噪声可能改变边界路由 |
| LI | wk |
0.66M | BF16/BF16 | 很小,且位于 TopK 前 |
| LI | weights_proj |
0.16M | BF16/BF16 | 矩阵过小,量化收益不足以覆盖量化算子开销 |
| Dense MLP | gate_proj |
82.6M | INT8/INT8 | 前三层 Dense MLP,大矩阵 |
| Dense MLP | up_proj |
82.6M | INT8/INT8 | 同上 |
| Dense MLP | down_proj |
82.6M | INT8/INT8 | 同上 |
| MoE | gate_proj |
9.2M/专家 | INT8/INT8 | 每个 Expert 独立 Calibration;Gate/Up 共享 Smooth Scale;Routed Expert 是 INT8 压缩主体,每层约 10.6B 参数 |
| MoE | up_proj |
9.2M/专家 | INT8/INT8 | 同上 |
| MoE | down_proj |
9.2M/专家 | INT8/INT8 | Down 的 Smooth Scale 可按 Expert 独立设置 |
| MoE | Shared Expert | 27.5M | BF16/BF16 | 所有 Token 都经过,误差会全局累积;其时延已被 Side Stream 隐藏 |
| MoE | mlp.gate |
1.97M | BF16/BF16 | TopK(top-8/384) 离散选择对扰动敏感,且参数只约占 0.02%,量化收益很小 |
| Other | embed_tokens |
0.78B | BF16/BF16 | Embedding Lookup,量化收益有限 |
| Other | lm_head / shared_head |
0.78B | BF16/BF16 | 直接决定 Logits,对精度敏感 |
| MHC | — | — | BF16/BF16 | Sinkhorn 归一化后动态范围很大 |
A.9 LoPT:无损并行 Tokenization
当上下文长度扩展到 1M Token 时,Tokenization 会逐渐成为不可忽略的瓶颈。
BPE、WordPiece 等主流算法本质上是串行的:一个 Token 如何切分取决于周围上下文。
一种自然的加速方法是把文本切成多个 Chunk,分别并行 Tokenize,再把结果拼接起来。但这种方法会遇到 Boundary Artifact:同一个子字符串在不同位置可能得到不同 Tokenization 结果,因此相邻 Chunk 独立分词后的结果无法保证与整段文本一致。
现有方案主要有两类:
- 按分隔符切分:准确率不足;
- 重叠切分并用 Token ID Matching:即使 Token ID 相同,也不能保证它们对应原文中的同一个字符位置。
因此都无法达到 100% 一致性。
在我们的系统中,这种不一致不仅会影响模型质量,也会影响推理性能,因为系统深度集成了 Token-level APC,需要通过输入 Token ID 序列进行精确 KV Cache 复用。
如果并行 Tokenization 在边界产生哪怕一个 Token 的错位,APC Hash Matching 都可能完全失败,迫使系统重新计算 KV,抵消所有 Tokenization 加速收益,甚至导致端到端性能下降。
为了实现无损并行 Tokenization,我们提出 LoPT。
其核心创新是:保留重叠切分,但把“Token ID Matching”替换为“Character Position Matching”。
LoPT 会记录每一个 Token 在原始文本中的字符起止位置,并按位置而不是 ID 进行匹配,也就是匹配“身份(位置)”,而不是“类别(ID)”,从根本上解决上下文造成的歧义。
再结合动态 Chunk Length 调整机制,LoPT 可以保证输出与串行 Tokenization 严格一致,同时获得接近并行方案的速度收益。
图 15 展示三个核心模块:
- Text Split Module:使用重叠切分,并动态调整 Chunk 长度;
- Parallel Tokenization Module:使用多进程池并行 Tokenize,输出 Token ID 与字符位置;
- Position-Aware Token Merge Module:根据字符位置匹配和拼接;若匹配失败,则把 Chunk 长度加倍后重试。
我们验证了三项结果:
- 无损性:在代码、自然语言和多语言文本上,输出与串行 Tokenization 严格一致,准确率 100%;
- 加速比:在 16 核 CPU 上相比串行实现提升 3~5 倍;
- 可扩展性:文本越长仍能保持稳定加速,Overlap 开销低于 5%。
LoPT 已集成到推理框架中,可以在不影响模型精度和 APC 命中率的情况下改善长上下文 Tokenization 性能。
图 15:LoPT 架构概览。三个核心模块分别是 Text Split Module、Parallel Tokenization Module 与 Position-Aware Token Merge Module。
hello,这里是 晓雨的笔记本 。如果你喜欢我的文章,欢迎三连给我鼓励和支持:👍点赞 📁 关注 💬评论,我会给大家带来更多有用有趣的文章。
原文链接 👉 ,⚡️更新更及时。
欢迎大家点开下面名片,添加好友交流。
更多推荐


所有评论(0)