请添加图片描述

🌌你好!这里是 晓雨的笔记本
在所有感兴趣的领域扩展知识,感谢你的陪伴与支持~
👋 欢迎添加好友 is_yu_ei,不定期掉落福利资讯

写在最前面

版权声明:本文为原创,遵循 CC 4.0 BY-SA 协议。转载请注明出处。

本文为《openPangu-2.0: Towards Reliable and Efficient Agentic Reasoning》技术报告中文全文翻译的第 1/9 篇。保留原论文术语、章节编号、公式、表格与图注;参考文献编号沿用原技术报告。

摘要

我们推出 openPangu-2.0,包括两个主要架构版本:拥有 505B 参数、激活参数 18B 的 openPangu-2.0-Pro,以及拥有 92B 参数、激活参数 6B 的 openPangu-2.0-Flash。此外,我们还推出了一个面向资源受限场景执行的优化端侧模型,总参数量为 30B,激活参数量为 2B。

为了最大化智能体能力与系统级效率,我们建立了一套严格的软硬件协同设计方法,将算法创新与昇腾原生基础设施紧密耦合。在模型架构层面,我们通过交错使用滑动窗口注意力(Sliding-Window Attention,SWA)与 DeepSeek 稀疏注意力(DeepSeek Sparse Attention,DSA),提出逐层混合注意力架构,以提升长上下文推理效率。通过将流形约束超连接(Manifold-Constrained Hyper-Connections,mHC)与 Muon 优化器以及一系列针对性的稳定化技术结合,模型能够在预训练过程中实现更快的收敛速度,同时避免出现 loss spike。

在系统层面,我们通过定制融合算子以及面向拓扑结构的协同优化,消除关键的显存、计算和网络瓶颈,从而保证超大规模 MoE 架构在最长 512K 上下文窗口下的稳定预训练。对于后训练,我们将并行专家强化学习与严格的训推一致性方法结合。最后,我们构建了专用推理引擎,通过定制算子优化、并行策略、缓存管理和异步调度,在昇腾硬件上实现高吞吐与超低时延。

我们开源了完整的训练与推理框架,以及在昇腾平台原生训练得到的模型权重,地址为:https://gitcode.com/ascend-tribe

1 引言

近年来,大语言模型(LLM)的发展推动了一个根本性的范式转变:这些系统正在从被动的对话助手,逐步演化为能够主动、自主地在复杂环境中行动的智能体。这样的演化要求模型能够可靠地执行长上下文规划、精确调用外部工具,并在长时间执行轨迹中保持认知一致性。

然而,现代部署仍面临关键瓶颈:通用模型架构在上下文窗口扩大时会带来高昂推理成本,并出现显著性能退化;与此同时,标准的对齐技术也难以阻止模型在长程执行过程中出现时间和结构推理错误。

openPangu-2.0 从设计之初就是为了解决这些问题。通过协同定制硬件算子、系统架构、训推一致的智能体强化学习以及专用推理加速,我们建立了一套严格的软硬件协同设计方法,为长上下文智能体任务提供高效、可靠且具成本优势的基础模型底座。

模型架构

为了以高效率获得原生长序列能力,我们围绕两个架构版本——openPangu-2.0-Pro 与 openPangu-2.0-Flash——设计了核心架构创新。我们通过逐层混合注意力机制解耦上下文处理:以滑动窗口注意力(SWA)处理稠密局部上下文,以 DeepSeek 稀疏注意力(DSA)处理稀疏全局检索。

为了加速推理,我们额外引入了一个三头多 Token 预测(Multi-Token Prediction,MTP)模块。进一步地,将流形约束超连接(mHC)与 Muon 优化器结合后,在相同预训练数据预算下可以显著提升收敛速度。最后,我们针对 MoE 负载均衡、mHC 稳定性、MTP 训练策略与 Muon 参数分组等方面进行专门设计,从端到端保证预训练过程平稳,不出现 loss spike。

训练基础设施

当上下文窗口扩展到 512K,并同时引入 mHC、Muon 与 MTP 等复杂架构组件时,通信和内存都会遇到严重瓶颈。为保证长上下文训练稳定性,我们构建了系统化的协同优化框架,包括:无冗余混合上下文并行(Context Parallelism,CP)、面向 MTP 的轻量 P2P 传输、Muon 的分布式计算通信重叠,以及混合重计算机制。

这些优化大量依赖 AscendC 定制融合算子,对 mHC、参数化注意力汇(Parametric Attention Sinks,PAS)以及 ModAttn 进行硬件原生加速。为了充分利用 CloudMatrix 384 超节点的整体算力,我们部署了简化且面向拓扑的亲和性策略,将大流量通信限制在超节点内部,同时尽量减少外部数据传输,从而消除瓶颈并最大化硬件利用率。

后训练

我们的后训练框架采用三阶段流水线:监督微调(SFT)、并行强化学习专家训练,以及多专家 On-Policy 蒸馏(OPD)。

在统一 SFT 之后,我们并行训练不同 RL 专家,分别在彼此隔离的数据和奖励函数上优化领域策略,包括推理(Reasoning)、通用(General)、智能体(Agent)和代码(Coding),以消除 RL 阶段的跨领域干扰。最后,再通过 OPD 阶段融合不同 RL 专家。

除了目前用于缓解训推不一致问题的机制外,本报告还预览了一套将在后续模型迭代中采用的、基于昇腾架构的完整对齐方案。

推理加速

我们构建了昇腾原生推理框架,使硬件执行逻辑与模型运行时动态紧密结合。架构中引入多种定制融合算子,包括面向推理优化的 mHC 算子与专用集合通信原语;同时引入 Felix CP、逐核多流执行等新的并行策略。

为了最大化吞吐,我们进一步加入了定制量化策略与算子感知、精度保持方案,并集成混合 KV Cache 管理、无损并行分词(Lossless Parallel Tokenization,LoPT),以及面向 ModAttn 的自动前缀缓存(Automatic Prefix Caching,APC)和 MTP 支持。

在 128K 上下文长度下,该框架在昇腾 NPU 上实现了优秀的长上下文推理性能:

  • openPangu-2.0-Flash:TPOT 最低可达 5.63 ms,在 TPOT=15 ms 时单 NPU 生成吞吐达到 1846 tokens/s
  • openPangu-2.0-Pro:超低时延可达 9.55 ms,在 TPOT=20 ms 时单 NPU 吞吐达到 1326 tokens/s
性能与应用价值

评测结果表明,openPangu-2.0 系列在通用、推理和智能体等多类基准上具有竞争力,同时也揭示了一个关键的协同反馈循环:强大的基础推理能力能够直接增强复杂智能体行为,而复杂智能体训练反过来也会强化多步规划和长轨迹上下文处理能力。

在公开基准之外,我们进一步关注实际系统级价值。以智能设备为例,我们将模型与推动 HarmonyOS 迈向真正 AI 原生操作系统(AIOS)所需的核心能力进行对齐。为此,我们重点培养了两类原生能力:由意图驱动的生成式用户界面(Generative UI),以及基于真实执行的软件合成。

在实际场景展示中,openPangu-2.0 可以稳定地把高层级人类意图转换为可投入生产的全栈小应用,也可以把深度研究流程转化为动态、可交互的知识制品。

2 模型架构

openPangu-2.0 系列包含两个 MoE 语言模型:openPangu-2.0-Pro(505B 总参数、18B 激活参数)与 openPangu-2.0-Flash(92B 总参数、6B 激活参数)。两者原生支持 512K Token 上下文窗口,整体架构如图 1 所示。

在这里插入图片描述
图1:openPangu-2.0架构的概述。openPangu-2.0-Flash的前两层和openPangu-2.0-Pro的前三层是密集层。RMSNorm层应用于第一层和之后每五层的残余流。

为了应对长上下文智能体工作负载中的计算、内存容量和带宽瓶颈,我们提出逐层混合注意力机制,将 DSA 与 SWA 交错堆叠。该设计将上下文建模自然解耦:SWA 层专注捕获局部依赖,DSA 层高效检索稀疏全局信息。

为了实现高效推理,我们在主干网络后附加三个 MTP 层,通过自投机解码显著提升生成速度。此外,通过整合 mHC 并使用 Muon 优化,openPangu-2.0 在相同预训练数据预算下实现了显著更高的学习效率。完整架构超参数见附录 A.1。

图 1:openPangu-2.0 架构概览。 openPangu-2.0-Flash 的前两层和 openPangu-2.0-Pro 的前三层为稠密层。第一层以及之后每隔五层都会对残差流应用 RMSNorm。

2.1 注意力架构

我们的注意力模块以多头潜在注意力(Multi-Head Latent Attention,MLA)为基础,通过交错堆叠 DSA 和 SWA 层,大幅降低长上下文场景下的推理开销。为了进一步优化注意力表示,我们在标准 MLA 模块中加入参数化注意力汇(PAS)与局部上下文调制注意力(Local-Context Modulated Attention,ModAttn):前者用于系统性吸收 attention sink token,后者用于增强细粒度局部语义建模。

SWA

我们采用重复的 DSA–SWA–SWA 模式,即 SWA 与 DSA 的层数比例为 2:1。在初步实验中,我们发现更大的比例,例如 3:1 和 5:1,虽然在短序列(4K)上仍能保持性能,但当上下文长度扩大到 32K 和 128K 时,训练 loss 会出现退化。

SWA 的窗口大小固定为 512 Token;SWA 层的 RoPE 基频会随上下文长度扩大而增加,从 4K 上下文时的 1.0×10⁴,逐步增加到 512K 上下文时的 6.4×10⁶。我们也探索了其他窗口大小和 RoPE 基频缩放策略,但它们对最终性能的影响都较为有限。

DSA

DSA 引入了一个轻量级 Lightning Indexer(LI)。LI 会动态选择与当前 Token 相关的历史键值(KV)条目,再对这些条目计算注意力,从而消除大量冗余且无关的注意力开销。

被选中的历史 Token 数量被限制为固定的 K,例如 2048,因此全局注意力成本的缩放因子由“完整上下文长度”转变为“被选中的 Token 数量”。

在 512K 上下文预训练的后期阶段,我们通过重放 512K 训练数据,将模型从全注意力(FULL)架构迁移为 DSA 架构。在这一迁移过程中,我们为 LI 加入一个辅助学习目标,使其拟合由全注意力计算得到的原始注意力分数。该辅助目标系数设置为 0.1,因为过大的系数会带来过强梯度,损害训练稳定性。

经过短暂的稠密 warm-up,以及 100B Token 的稀疏适配后,模型能够基本恢复下游性能。

与 DeepSeek-V3.2 不同,我们的基础模型本身就是 FULL-SWA 混合架构。因此,我们只把全注意力层转换为 DSA,而保留 SWA 层不变。这样就在结构上完成上下文建模的解耦:DSA 负责提取全局依赖,SWA 负责处理局部交互。

PAS

为了缓解 attention sink 现象——即语义意义很弱的 Token 却吸收了不成比例的大量注意力——我们在每一层中加入参数化注意力汇(PAS)。

如图 1 所示,每一层 PAS 都引入 128 个可学习的键值对;对于 MLA 而言,这些是潜在 KV。它们用于吸收冗余注意力。在推理阶段,这些 PAS 相当于固定数量的虚拟 KV 条目,即使在长上下文场景下,计算和缓存开销也几乎可以忽略。

实验还表明,PAS 能够加快混合 SWA 架构的训练收敛。与 gpt-oss 中 sink 机制的详细比较见附录 A.2。

ModAttn

ModAttn 用于解决局部语义歧义问题。它在全局注意力计算之前和之后,通过轻量级因果一维卷积与残差结构注入局部上下文。

形式化地,给定序列表示:

Z ∈ R T × d , Z \in \mathbb{R}^{T\times d}, ZRT×d,

局部调制算子定义为:

Mod ⁡ θ ( Z ) = Z + CausalConv1D ⁡ θ ( Z ) , (1) \operatorname{Mod}_{\theta}(Z)=Z+\operatorname{CausalConv1D}_{\theta}(Z), \tag{1} Modθ(Z)=Z+CausalConv1Dθ(Z),(1)

其中,θ 表示卷积分支参数。

ModAttn 会把这种调制施加到 MLA 的压缩潜在分支上,包括 Q 分支和 KV 分支。随后,在 FlashAttention 完成全局聚合之后、输出投影之前,再进行一次类似的调制操作。

因此,ModAttn 是一种低侵入式增强方式:它不改变全局注意力接口,却可以把局部语义条件提前注入全局注意力计算。

效率分析

我们提出的 DSA-SWA 架构处于两类代表性方案之间:一类是同构 DSA 堆叠,例如 DeepSeek-V3.2;另一类是交替 FULL-SWA 堆叠,例如 Gemma 2。

与其重复完整复杂度表达式,表 1 对比了长上下文服务中几项主导成本随序列长度变化的首项系数,包括 Prefill FLOPs、Decode 阶段缓存读取量,以及 Decode 阶段缓存内存。

表 1:代表性长上下文注意力架构对比。FULL-SWA 与本文 DSA-SWA 均采用 1:2 的全局层与局部层比例。

成本 同构 DSA FULL-SWA DSA-SWA
Prefill FLOPs( S 2 S^2 S2 N h e a d I n d e x e r D I n d e x e r N^{Indexer}_{head}D^{Indexer} NheadIndexerDIndexer 1 3 N h e a d ( D Q K M H A + D V M H A ) \frac13N_{head}(D^{MHA}_{QK}+D^{MHA}_{V}) 31Nhead(DQKMHA+DVMHA) 1 3 N h e a d I n d e x e r D I n d e x e r \frac13N^{Indexer}_{head}D^{Indexer} 31NheadIndexerDIndexer
Decode 缓存读取( S S S D I n d e x e r D^{Indexer} DIndexer 1 3 D K V \frac13D_{KV} 31DKV 1 3 D I n d e x e r \frac13D^{Indexer} 31DIndexer
Decode 缓存内存( S S S D K V + D I n d e x e r D_{KV}+D^{Indexer} DKV+DIndexer 1 3 D K V \frac13D_{KV} 31DKV 1 3 ( D K V + D I n d e x e r ) \frac13(D_{KV}+D^{Indexer}) 31(DKV+DIndexer)

与同构 DSA 堆叠相比,我们的架构只在三分之一的层中使用 DSA,因此 Prefill 和 Decode 阶段的全局 Token 选择成本也按比例下降。

与交替 FULL-SWA 架构相比,DSA-SWA 用轻量索引加稀疏检索取代稠密全局注意力,把主导的二次复杂度计算从完整注意力表示转移到尺寸小得多的索引表示上,同时降低 Decode 阶段的缓存读取量。

因此,DSA-SWA 在 Prefill FLOPs、Decode 缓存读取与 Decode 缓存占用之间取得了更有利的平衡,非常适合长上下文在线服务。

其中, N h e a d N_{head} Nhead N h e a d I n d e x e r N^{Indexer}_{head} NheadIndexer 分别表示注意力头数量与索引器头数量; D Q K M H A D^{MHA}_{QK} DQKMHA D V M H A D^{MHA}_{V} DVMHA D K V D_{KV} DKV D I n d e x e r D^{Indexer} DIndexer 分别表示每个头的 Query/Key 维度、Value 维度、每 Token 缓存宽度和索引器维度。


hello,这里是 晓雨的笔记本 。如果你喜欢我的文章,欢迎三连给我鼓励和支持:👍点赞 📁 关注 💬评论,我会给大家带来更多有用有趣的文章。
原文链接 👉 ,⚡️更新更及时。

欢迎大家点开下面名片,添加好友交流。

Logo

作为“人工智能6S店”的官方数字引擎,为AI开发者与企业提供一个覆盖软硬件全栈、一站式门户。

更多推荐