昇腾开源仓Issue分析解答-Ascend精选(十九)·2026-09增量补采(四)

一句话让Agent变成昇腾专家,昇腾任务轻松搞定。评测入口:请按这个开源仓接入昇腾图谱 https://gitcode.com/agent0/kg-tools

总览

仓库板块定位收录条数
hccl弱尾收官通信库,AlltoAll 校验顺序越界 1 案1
metadef弱尾收官图引擎元定义,OP_ADD 宏 ABI 断裂 1 案1
memfabric_hybrid弱尾收官混合内存,SGLang 集成指南 1 案1
MindIE-Motor弱尾收官推理引擎,整改定稿与 A5 异构调度 3 案3
MindSpeed-LLM弱尾收官大模型训练,下载口径澄清 1 案1
msmodeling弱尾收官性能仿真,OptiX 指南纠偏 3 案3
mind-cluster弱尾收官集群管理,FD 诊断验收标准 1 案1
mindcluster-deploy弱尾收官集群部署,ICRC 定界采集 1 案1
AgentSDK弱尾收官智能体 SDK,容器中文编码 1 案1
mindformers增量开窗大模型套件,DSA/MoE 特性链 7 案7
hyper-parallel增量开窗高性能并行,RFC 与真 bug 7 案7
mindspore增量开窗框架主仓,任务落地与日落 5 案5
dvm增量开窗图虚拟机,SoC 与流水同步 3 案3
mindspore-lite增量开窗端侧推理,三真 bug 3 案3
community增量开窗社区,开源实习双交付 2 案2

hccl(通信库·AlltoAll 校验顺序倒置越界)

创新大赛报告真 bug:保留枚举索引长度表先于类型合法性检查

编号Issue 问题内容解答总结
#674HcclAlltoAll参数校验先用sendType索引长度表再查合法性,保留枚举致越界根因:溢出检查先于类型校验,sendType=recvType=HCCL_DATA_TYPE_RESERVED时相等性检查放行,下标=数组长度成one-past-end越界。修复PR#3136(09-18 09:25合并):先校验sendType,非法返HCCL_E_PARA;评论后40秒关单。KG佐证datatype契约0.93。创新大赛东北赛区队(hlw246)报告。

metadef(图引擎元定义·OP_ADD 宏 ABI 断裂修复)

对外头文件宏内新增符号致跨版本不兼容,弱符号+先探测再调用

编号Issue 问题内容解答总结
#102新toolkit编译的算子包在旧toolkit加载报GenSimplifiedKey符号找不到根因:PR#455的bd2bb7f在对外头op_def_registry.h的OP_ADD宏新增GetGenSimplifiedKey调用,新符号仅存新运行库→跨版本ABI断裂。修复PR#462(09-08 master)+#472(09-09移植9.2.0):Get设弱符号+宏内先探测再调用,旧包可回旧toolkit加载。KG佐证OP_ADD即OpDef注册宏0.923。

memfabric_hybrid(混合内存·SGLang 集成指南补齐)

trans 多实例 PD 分离部署:协议选型与多实例三铁律落 wiki

编号Issue 问题内容解答总结
#259trans多实例场景缺SGLang对接文档,PD分离部署无从下手官方补《SGLang集成指南》wiki(09-03已补充):Prefill/Decode/Router启动命令、ASCEND_MF_STORE_URL、A2/A3协议选型sdma/device_rdma/host_rdma、多实例铁律:session_id端口唯一/同组协议一致/VISIBLE_DEVICES+base-gpu-id隔离。关单晚修复评论14天。

MindIE-Motor(推理引擎·整改文档定稿与 A5 异构调度)

MemCache/KV 池化文档收敛,A5 PR+DT 异构配置破坏性变更

编号Issue 问题内容解答总结
#604MemCache后端整改文档残留人工校验备注,特性互斥未定稿根因:features_optimization/整改中间稿占位外泄。PR949补齐约束:禁backend:ucm;AscendStoreConnector与kv_cache_store_config两处backend须同为memcache;P/D传输Connector与池化后端分层;KvEvent以memcache PR#334为界,基础能力已预装。合并与关单同秒(09-18 11:12:41)
#615KV池化整改中间稿残留占位提示,且会被MkDocs发布收录PR967修正部署产物目录为output_yamls/、Pod检查与motor-config排查命令、inprocess/standalone配置说明;补相同长前缀请求的缓存写入/命中验证(不能仅凭HTTP 200判定池化生效);mkdocs exclude_docs排除features_optimization/**防中间稿发布进搜索索引。合并与关单同秒(09-18 14:56:14)
#628A5 PR/DT组网PD异构调度靠独立样例表达,原理文档缺失PR978:A5分PR(白鹭)/DT(HBM),HBM带宽大宜Decode,P调PR、D调DT;废总开关enable_pd_heterogeneous,按引擎段填npu_chip_name匹配npu.chip.name标签,删hetero样例;A5 hardware_type收敛Ascend950,旧值启动报Unknown hardware_type。合并与关单同秒(09-17 21:53:25)

MindSpeed-LLM(大模型训练·模型下载口径澄清)

modelscope CLI 建议未采纳:wget 直链多网络环境更稳

编号Issue 问题内容解答总结
#1872建议快速开始文档改用modelscope CLI替代wget下载权重官方核查后不改:wget直链在多网络环境兼容性与稳定性更好,ModelScope易受代理配置与网络访问影响、部分环境无法正常下载,保留wget为默认(现行文档HF与ModelScope两路均用wget直链)。建议未采纳但口径明确。官方回复后44秒关单(09-20 11:00:10)

msmodeling(性能仿真·OptiX 指南三处纠偏)

结果示例标注场景、容器内 uv sync 辨析、benchmark 早停配置

编号Issue 问题内容解答总结
#439性能仿真指南「结果说明」唯一输出示例未标注所属场景,读者误当作PD配比场景输出指南PD混部/分离/配比三场景共用一份结果示例且未标来源,该示例实为2.1 PD混部输入的输出。PR !872(master)在结果说明补「输出对应用例2.1」,!875同步26.2.0分支;!872合并09-18T15:26:43,关单23:55:01晚8小时28分。KG佐证吞吐优化指南节点(0.946)确认多场景结构
#440OptiX指南称工具「推荐装在虚拟环境里」,易误读为Python venv,实测须装在服务容器内用户实测发现uv sync须在拉起服务的容器内执行,装宿主机无法对服务实测寻优,原文表述误导。PR !872为环境隔离描述添加容器用例(已与提出人凌巧对齐),!875同步26.2.0;关单23:54:32晚!872合并8小时28分,早于#439关单29秒。KG佐证optix用户指南节点(0.928)
#442OptiX vLLM benchmark早停功能落地后,中英文用户指南未说明配置启用与结果语义ai-native工作流补文档。!849补齐[benchmark_early_exit]配置(enabled/action/metrics_url)、report→terminate灰度流程、受保护阶段说明、would_early_exit等字段与未触发排障(仅vLLM);合并与关单同秒09-18T15:02:37,!876 backport 26.2.0。KG节点(0.916)

mind-cluster(集群管理·FD 诊断验收标准落地)

诊断任务耗时标准 + VL 优先级与交换侧 QoS Credit 诊断项

编号Issue 问题内容解答总结
#1177FD工具链路故障定位需求缺诊断任务耗时验证标准,采集/诊断效率无从评估PR#4705落地耗时验收标准:A3系列单机清洗/诊断≤3分钟、950PR&950DT≤5分钟(含单板BMC/UBM),集群≤系数规模/cpu核数0.8分钟;并新增VL优先级Credit与交换侧QoS Credit两个诊断项(hccn_tool -g -credit,分配=使用且非0判异常)。合并与关单同秒(14:15:03)。KG佐证ascend-fd-tk诊断文档树(0.9429)

mindcluster-deploy(集群部署·ICRC 比对定界采集)

cqe error 时任务前后 hccn_tool stat 比对判网络静默改包

编号Issue 问题内容解答总结
#35A5场景plog现cqe error status[5]时缺采集手段,无法判定是否网络静默改包PR#560在npu_info_collect_compatible.sh加三重循环(卡×die0-1×port0-8)批量采hccn_tool -g -stat:任务前后各一次,任一rxdma_icrc_err_cnt_queue_id0~3计数增长即判静默改包,处置hccl-test校验+链路二分。合并与关单同秒(09-20T14:26:38)。KG同域佐证HCCL故障定界文档(0.931)

AgentSDK(智能体 SDK·容器中文编码修复)

四份 Dockerfile 补 LANG/LC_ALL 与 vimrc utf-8

编号Issue 问题内容解答总结
#170快速启动配置描述不清且容器vim未设中文编码,中文注释显示乱码PR#1041四份Dockerfile双修:ENV加LANG/LC_ALL(openEuler=en_US.UTF-8,Ubuntu缺该locale用C.UTF-8),构建期写vimrc set encoding=utf-8。PR#1042补必改配置路径与拉新代码提示。09-17T19:08合并,次日09:28关单(+14.3h)。KG佐证昇腾Dockerfile构建说明(0.913)

mindformers(大模型套件·DSA/MoE 七连)

IndexShare 三部曲、MoE 共享专家流同步、续训 0 步静默退出

编号Issue 问题内容解答总结
#2499加载仅含safetensors的权重文件夹报错找不到common.json自提单自修复。根因:Trainer加载检查点时无条件读优化器元数据common.json,纯safetensors权重目录无此文件。修复:CommonInfo.load_common移入no_load_optim判空分支,仅加载优化器状态时读取。时序:issue 08-06→PR!8653(beta1)08-07合入,09-20关单;master侧!8654仍open。KG无命中
#2536PyNative Trainer缺统一前向推理入口,评估预测需自拼分布式逻辑RFC已落地。方案:推理=训练前向+解码循环,复用训练的模型调用与并行切分,仅新增输入归一/token挑选/落盘;yaml inference段开关,自动继承TP/CP/DP/EP/PP,ReshardLoader跨策略加载;POC贪心解码不做KV cache。落地:!8749(master)09-09合入=关单时刻,!8808(beta1)与UT!8804跟进
#2580DSA每层独立跑top-k选择,相邻层选中token高度重叠致O(S²)开销大RFC已落地。方案:每share_size连续层共享组长Top-K,Shared层不建indexer参数,组长对服务层逐层蒸馏;组不跨pipeline stage;share_size=1须逐位不变。落地:!8785(master)+!8797(beta1)09-09合入=关单时刻。KG:cann-recipes-infer GLM-5.2条目载明IndexShare跨层top-k复用已用于推理侧
#2586DSA一阶段显存随层数线性增长,1M序列128卡第4层即OOM根因:dsa_warmup整层豁免activation recompute(!8692引入),一阶段唯一在训练的indexer同层被一并豁免,中间量免重算按层驻留——1M序列4层滞留50.78GiB;!8692仅单卡12GiB验证未暴露。修复:PR!8796改一阶段逐层反向,峰值显存不再随层数增长并适配pp/IndexShare,09-14合入
#2588MoE Shared Expert overlap开启后首步loss与grad_norm全NaN根因:预启动AllToAll的CommHandle.wait()建在shared stream,输出却由main stream消费,HCCL未写完即可被读;反向shared-expert还提前与routed计算竞争。修复:PR!8799(beta1)补流同步,09-11合入=关单时刻;修复后loss与关overlap基线逐项一致,reverse AllToAll掩盖率37.9%→99.8%
#2590续训改global_batch_size后训练0步静默退出,无任何提示根因:续训按ckpt_gbs/current_gbs缩放global_step(500×64/32=1000)但training.steps不缩放,while step<max_steps一次不执行即静默退出。官方判与org-issues#43350重复关单;修复走补告警日志:PR!8802(master)09-11、!8807(beta1)09-14合入,0步时明确告警及原因。实质解决口径收录
#2591IndexShare下is_index_leader静默兜底用clamped层号查布局,层0读错根因:MultiLatentAttention传clamped层号查布局,全局层0读错一格,FSSS下层0被判Shared,无层拥有indexer,首Shared层拿None Top-K。生产路径显式传值暂不可达,新增子类即命中。修复:共享开启且is_index_leader为None抛ValueError;!8803/!8805 09-14合入=关单时刻

hyper-parallel(高性能并行·RFC 落地与真 bug)

HyperMegaMoE/断点续训 RFC、shard api 回归、mmap 泄漏五连修

编号Issue 问题内容解答总结
#312MoE专家并行链路按独立kernel串行,通信暴露、AIC/AIV交替空闲RFC定义HyperMegaMoE/Grad融合算子:Dispatch→GMM1→SwiGLU→GMM2→Combine及反向单算子完成,AIC/AIV按事件计数放行任务、无全局屏障,DFunction封装求导。落地PR1315 managed experts API(09-08,Fixes#370)、PR1448显存同步优化(09-16),09-18关单。KG佐证MoE GMM融合(0.93)。
#328HyperParallel缺全流程断点续训能力,多卡恢复语义未定义RFC交付断点续训:策略层CheckpointerCallback+存储层DistributedCheckpointer、六状态桶、global_step换算、fail-closed报错。PR1140(08-19合并,Fixes#328)落地,后续1322/1413优化,09-16关单。KG佐证torchtitan-npu checkpoint(0.919)。
#372盘古2BV2-LLM报错:缺hyper_parallel.core.shard.api模块主线重构删除MindFormers依赖的shard API致DeepSeek3/4训练无法启动。PR1358恢复core/shard/api.py与sharding_plan.py并保留shard_module顶层导出(09-08 21:08合并,关联org-issues#43340),09-14回归通过后35秒关单。KG佐证MindSpeed同型shard API(0.906)。
#376IndexedDataset reader五类mmap泄漏与边界读取缺陷__del__强关mmap遇BufferError、类级lru_cache强引用reader、零拷贝view悬挂、短读返未初始化内存、int32溢出。PR1373(同人,09-10合并,Fixes#376)逐项修复:元数据copy出mmap、幂等close、去lru_cache、短读抛ValueError、int64累加;09-15关单。KG:同型indexed_dataset(0.903)。
#385DSA稀疏注意力反向在无RoPE时head维度被裁成0dsa_sparse_attention_rescale零维RoPE前后向不对称:RoPE维=0时backward裁剪[:-0]即[:0],梯度末维清零后传入sparse_flash_attention_grad_enhance。PR1395仅RoPE维>0时裁剪,NoPE保留head dim并加mock UT(09-17合并);标重2秒关。KG:rope分支(0.937)。
#414hyper_parallel/compile图模式终版设计文档(GitHub#152镜像)forward+backward捕获为joint FX graph,PassConfig/PassPlan声明式标记分片,FSDP pass对live参数原地物理分片使optimizer无FSDP感知,wait_tensor下沉实现通信计算重叠。compile落地链PR1320/1333/1325/1427(09-03~09-14合并);镜像单创建1秒bot关。KG:图捕获(0.914)。
#416MS后端FSDP CPUOffload报参数切片不在CPU上根因:MindSpore对CPU Tensor过计算算子隐式搬运到NPU,sharded_param被搬回Device。属框架机制依赖,本单无修复落地,转需求跟踪待机制澄清;PR942/954(06-26合并)曾显式禁用ms-backend FSDP CPUOffload。KG佐证VeRL优化器状态CPU卸载(0.928)。

mindspore(框架主仓·任务落地与日落公告)

STFT 统一、MindIR 缓冲保护、AiCPU FFT 泄漏、单边通信日落

编号Issue 问题内容解答总结
#29324DVM eager fusion算子覆盖窄,非连续输入被前端拦截提前回退长线任务单(04-27→09-18)。方案:扩展unary/binary、tensor-scalar、grad类算子接入DVM;基于ViewLoad统一准入,支持shape+stride+storage_offset可表达的非连续输入;排除最后一维非连续、负stride稳定fallback;目标RoPE更长融合链。gitcode无关联落地PR[未核实]
#29630STFT与STFTExt两套算子并存,接口推导重复且模式间行为不一致任务单已落地。方案:STFT/STFTExt合并为统一STFT,统一STFTFuncImpl推导;新增CPU/Ascend Customize补PyBoost调度;保留GE图模式与AiCPU路径;GE Adapter改INPUT_ATTR_MAP。落地:bellatan PR#9307593081四连09-0109-09合入,09-16关单。KG:CANN仓stft有acl_stft.cpp
#29666MindIR加载压缩张量用DataNBytes()作拷贝目的容量,缓冲保护失效根因:压缩张量真实分配量是compression_data_size(Int8缓冲),DataNBytes()=逻辑shape元素数,两者不同源;huge_memcpy只信调用方destMaxLen,保护失效。当前length与分配量同源暂不越界,任意分叉即堆溢出;分配量更大时合法权重被误拒。修复:PR#93138改用真实分配量校验,09-07合入;issue后108秒提PR,官方评论后21秒关单
#29675mindspore仓单边通信功能日落下线,无外部用户日落公告:单边通信两套实现,演进看护均基于hyper-parallel仓;mindspore仓用例自看护、无外部用户,当前版本日落。替代指引:需求走hyper-parallel仓(mindformers PyNative训练栈已依赖)。无代码PR,决策口径即交付
#29676AiCPU FFT算子memset_s初始化失败分支泄漏calculate_input缓冲自提单自修复。根因:fftbase.cc/fftnbase.cc六处R2C/C2R/C2C函数malloc后memset_s失败分支直接return,跳过尾部free(calculate_input)。验证:6函数×2精度×3场景36例,基线12个失败场景全检出泄漏。修复:PR#93159失败分支先释放再返回,36例全过+ASan无错,09-18合入=关单时刻

dvm(动静态图虚拟机·SoC 配置与流水同步)

SelectOp 推导、9362/9363 配置、C220 int64 Pack S→V 同步

编号Issue 问题内容解答总结
#25Select算子缺符号式切分的输出shape推导Select三输入condition/lhs/rhs各自可广播,输出shape逐维取max、rank对齐补1、静态不定时建符号维度。PR809在ops.cc注册并实现SelectOp::ShapeProp(09-14 09:24:46合并,Fixes#25),关单=合并秒,已加用例看护。KG佐证GE autofuse符号化shape推导(0.929)。
#27缺Ascend910_9362/9363配置,识别报Unrecognized SoC Versionmaster缺9363、r2.10缺9362/9363。补SocType枚举与静态配置(C220、20 AI Core、168MiB L2、带宽比5.0f),核心数/L2核对CANN 9.2.0.beta.2平台配置。PR810(r2.10双型号,11:00:41)+PR811(master,11:01:11)均Fixes#27,关单=PR811合并秒。
#28C220 int64 Pack偏移表缺S→V同步,间歇错值或异常507035int64路径依赖Pack合并高低32位。根因:vm_aiv.cce InitPackOffset标量流水写offset[0:2]后矢量流水直接读,构建关自动同步、仅有V→S。PR814补set_flag/wait_flag(PIPE_S,PIPE_V),38用例×10轮380/380通过(09-16合并,Fixes#28),关单=合并秒。KG:asc_sync_vec(0.897)。

mindspore-lite(端侧推理·三真 bug)

int8 池化饱和窄化顺序、converter SEGV 判空、BEVDet 教程脚本化

编号Issue 问题内容解答总结
#448int8池化requant结果窄化回绕,负值窗口输出由-128翻转为+112真bug:pooling_int8.c将requant的round结果先赋int8_t再clamp,负值越界(典型-144)窄化回绕+112恰落饱和区间,双限失效;WS63单算子稳定复现。修复PR#1182(提单同日08-29合入,+6/-5):中间值改int、先饱和后窄化并加UT看护;#1233(09-16)续修并回移r2.11。KG无命中[未核实]。
#456BEVDet推理部署教程手动步骤多、目录与数据集路径处理易错教程可用性修复:PR#1201(09-03合入,作者qll1998)将手动修改4处import、手动拷贝文件目录改为脚本自动执行,补目录存在性判断,数据集改参数传入不拷固定路径;按README可跑通全流程。09-15维护者liuchengji3回单附PR链接,HidyLi确认回归通过。属示例资料质量修复,非引擎缺陷。
#475converter_lite转MINDIR做fp64→fp32时遍历attrs空指针解引用SEGVfuzz发现:恶意MINDIR解析后部分Value未初始化,CvtFp64ModelToFp32()遍历attrs时pair.second->type()空this解引用,崩于anf.cc:787(附完整栈与PoC)。修复PR#1245(09-18合入):attrs遍历加pair.second判空、为空跳过;分支fix/ms003对应PoC编号MS-003。KG无命中[未核实]。

community(社区·开源实习双交付)

多模态 Encoder CP/DP 解耦、MindQuantum 昇腾全振幅后端

编号Issue 问题内容解答总结
#2093多模态训练中视觉Encoder与文本Decoder并行策略需解耦,独立配置CP/DP交付hyper-parallel PR#1036:qwen3_vl_moe新增vision_parallel(dp_shard/cp/ulysses/async_cp),视觉attention拆sdpa_core挂CP,1=Colossal/2=Ulysses;视觉参数保复制态;Conv3d改等价F.linear避A2不稳;补精度对齐与2卡smoke测试。08-24合入,09-07过审得20分。
#2114MindQuantum缺昇腾NPU后端,需基于CANN实现全振幅量子模拟器交付mindquantum PR#3167:mqvector_npu全振幅后端,CANN/Ascend C+ACL runtime,交错complex64向量,14类门(X/Y/Z/H/RX-RZ/PS/CNOT/CZ/SWAP/Rxx-Rzz),含门融合与tile cache;与CPU后端对齐精度,附benchmark/技术报告。09-04合入,09-09过审50分。KG无命中[未核实]。

组合解读:弱尾见底与新窗开播

1. cann 底座弱尾三案:真 bug 不因池子弱而缺席。
弱尾里最硬的两条都在 cann 底座:一条是校验顺序倒置的内存越界,一条是对外宏的 ABI 断裂;配上 memfabric 的 SGLang 对接指南,弱尾收官收出了干货。

  • hccl#674 HcclAlltoAll 参数校验先用 sendType 索引长度表再查合法性:保留枚举下标=数组长度成 one-past-end 越界,PR3136 改先校验后索引(评论后 40 秒关单,创新大赛东北赛区队报告)
  • metadef#102 OP_ADD 宏在对外头文件新增符号引用致跨版本 ABI 断裂:Get 设弱符号+宏内先探测再调用恢复旧 toolkit 兼容(PR462 master+PR472 移植 9.2.0)
  • mf#259 trans 多实例缺 SGLang 对接文档:官方补集成指南 wiki——P/D/Router 启动命令、协议选型、session_id 端口唯一等三铁律(关单晚修复评论 14 天)

2. MindIE-Motor 整改线与容器配置四案:文档定稿也在交付价值。
Motor 三连把 MemCache/KV 池化整改的配置约束与验证方法写实了,其中 A5 异构调度是破坏性配置变更;AgentSDK 补的是容器里最磨人的中文乱码。

  • mtr#604 MemCache 整改文档残留编辑备注:PR949 定稿约束(禁 backend:ucm、两处 backend 须同 memcache),合并与关单同秒
  • mtr#615 KV 池化中间稿会被 MkDocs 收录:PR967 修部署产物与排查命令、补「不能仅凭 HTTP 200 判池化生效」的验证法、exclude 中间稿
  • mtr#628 A5 PR/DT 异构调度靠独立样例表达:PR978 废总开关改按引擎段填 npu_chip_name,hardware_type 收敛 Ascend950——旧值启动即报错,升级必踩
  • agt#170 容器 vim 中文注释乱码:PR1041 四份 Dockerfile 补 LANG/LC_ALL(Ubuntu 缺 locale 用 C.UTF-8)+构建期写 vimrc utf-8

3. 观测仿真与工具口径六案:一句话能省半天排查。
msmodeling 三案治 OptiX 指南误导,mind-cluster 两案把故障诊断的「多快算好」和「怎么判网络改包」落成标准,MSL 一案澄清下载工具选型。

  • msmd#439 仿真指南结果示例未标所属场景:PR872 补「输出对应用例 2.1」,26.2.0 分支同步
  • msmd#440 OptiX「推荐装在虚拟环境里」易误读为 venv:实测须 uv sync 进服务容器内,PR872 补容器用例
  • msmd#442 vLLM benchmark 早停无文档:PR849 补 [benchmark_early_exit] 配置与 terminate 灰度流程(合并与关单同秒)
  • mcl#1177 FD 诊断缺耗时验收标准:PR4705 落地单机≤3/5 分钟标准+VL 优先级与 QoS Credit 两个诊断项(同秒关单)
  • mcd#35 plog 见 cqe error 无从定界:PR560 采集脚本三重循环比对任务前后 rxdma_icrc_err_cnt——增长即网络静默改包(同秒关单)
  • msl#1872 建议改 modelscope CLI 下载权重:官方不采纳——wget 直链多网络环境更稳,口径明确(回复后 44 秒关单)

4. mindformers 七连:DSA IndexShare 的完整特性演进链。
wei_zhuoyi 九天内 RFC 合入→显存 bug 修复→防御性加固三步走完,加上 MoE 流同步与续训静默退出,这批是全篇质量最密的一表。

  • mf#2580 DSA 每层独立 top-k 开销 O(S²):IndexShare 按组共享组长 Top-K,!8785/!8797 合入即关单;KG 证实 cann-recipes-infer GLM-5.2 推理已用同款跨层复用
  • mf#2586 DSA 一阶段显存随层数线性增长 1M 序列即 OOM:dsa_warmup 整层豁免重算致中间量按层驻留,!8796 改逐层反向峰值不再涨
  • mf#2591 IndexShare 下 is_index_leader 静默兜底读错全局层 0:clamped 层号查布局,改显式抛 ValueError(新增子类即命中)
  • mf#2588 MoE 共享专家 overlap 首步 NaN:CommHandle.wait() 建错流致未写完即读,补流同步后掩盖率 37.9%→99.8%
  • mf#2590 续训改 global_batch_size 后 0 步静默退出:global_step 缩放而 max_steps 不缩放,while 一次不执行;修复走 0 步明确告警(判重关单、双 PR 后置)
  • mf#2536 PyNative 缺统一推理入口:RFC 落地——推理=训练前向+解码循环,yaml inference 段自动继承五种并行(!8749 合入即关单)
  • mf#2499 加载纯 safetensors 权重目录报错找不到 common.json:common.json 读取移入 no_load_optim 判空分支(自提自修)

5. hyper-parallel 七连:RFC 落地与真 bug 各半。
两条 RFC 都带着 PR 链落地,五条真 bug 里 mmap 泄漏五连修和 DSA 反向 NoPE 裁剪最有嚼头;FSDP CPUOffload 一案如实收录「无修复、根因已明」。

  • hp#312 MoE 专家链路串行通信暴露:HyperMegaMoE 融合算子 RFC——Dispatch→GMM→Combine 单算子、事件计数放行无全局屏障,PR1315/1448 落地
  • hp#328 缺全流程断点续训:CheckpointerCallback+六状态桶+fail-closed 报错,PR1140 Fixes#328 硬链接落地
  • hp#372 盘古 2BV2-LLM 报缺 shard.api:主线重构删了 MindFormers 依赖的 API,PR1358 恢复(回归通过后 35 秒关单)
  • hp#376 IndexedDataset 五类 mmap 泄漏与边界缺陷:del 强关遇 BufferError、lru_cache 强引用、短读返未初始化内存等逐项修(PR 链接走 atomgit 镜像形态)
  • hp#385 DSA 反向在无 RoPE 时 head 维度被裁成 0:[:-0] 即 [:0] 清零梯度,PR1395 仅 RoPE 维>0 时裁剪(2 秒标重关单、修复晚 6 天)
  • hp#414 compile 图模式设计文档:joint FX graph+声明式分片+原地物理分片,落地链 PR1320/1333/1325/1427(GitHub 镜像单 1 秒 bot 关)
  • hp#416 FSDP CPUOffload 报参数切片不在 CPU:MS 对 CPU Tensor 隐式搬运回 NPU 所致,框架机制依赖无修复、转需求跟踪(PR942/954 曾显式禁用)

6. dvm 与主仓算子线五案:编译器底座的细活。
dvm 三案从 shape 推导、SoC 配置到流水同步各补一角,其中 C220 的 S→V 同步缺失是时序依赖型疑难 bug;主仓两条任务单一条落地一条如实标未核实。

  • dvm#28 C220 int64 Pack 偏移表间歇错值 507035:标量流水写矢量流水读、构建关自动同步且仅 V→S,PR814 补一对 set_flag/wait_flag(380/380 通过,合并即关单)
  • dvm#25 Select 算子缺符号式 shape 推导:三输入逐维取 max+rank 对齐补 1,PR809 注册 ShapeProp(合并即关单)
  • dvm#27 缺 9362/9363 SoC 配置报 Unrecognized:PR810/811 双分支补 SocType 枚举与静态配置(相隔 30 秒连合)
  • ms#29630 STFT 与 STFTExt 两套并存接口不一致:统一 STFTFuncImpl+PyBoost 调度,PR93075~81 四连合入
  • ms#29324 DVM eager fusion 覆盖窄非连续输入被拦:任务单含 ViewLoad 统一准入与 fallback 边界方案,gitcode 无落地 PR [未核实] 如实收录

7. lite 三真 bug、实习双交付与主仓收尾八案:新窗口的成色。
端侧三条真 bug 里 int8 池化的「先窄化后饱和」顺序翻转是教科书级案例;两条开源实习单有真交付;主仓的缓冲保护修复和日落公告各占其位。

  • lit#448 int8 池化 requant 结果窄化回绕负值翻正:先赋 int8_t 再 clamp,-144 回绕 +112 恰落饱和区间双限失效,改先饱和后窄化+UT(提单当日合入,#1233 续修回移 r2.11)
  • lit#475 converter_lite 转 MINDIR 空指针 SEGV:attrs 遍历 pair.second 未判空,PR1245 补判空跳过(fuzz PoC 附完整栈)
  • lit#456 BEVDet 教程手动步骤多易错:PR1201 改脚本自动执行+目录判空+数据集参数传入,回归通过
  • com#2093 多模态 Encoder 与 Decoder 并行策略需解耦:交付 hyper-parallel PR1036——vision_parallel 独立 dp/cp,Conv3d 改等价 F.linear 避 A2 不稳,得过审 20 分
  • com#2114 MindQuantum 缺昇腾后端:交付 PR3167 全振幅 NPU 模拟器——Ascend C+ACL、14 类门、门融合与 tile cache,与 CPU 对齐精度
  • ms#29666 MindIR 压缩张量用 DataNBytes() 作拷贝容量:逻辑元素数≠真实分配量,huge_memcpy 保护失效,PR93138 改真实分配量(issue 后 108 秒提 PR、评论后 21 秒关单)
  • ms#29676 AiCPU FFT 初始化失败分支泄漏:六处 return 跳过 free,PR93159 失败分支先释放(36 例+ASan 全过,合并即关单)
  • ms#29675 主仓单边通信日落下线:两套实现演进看护均在 hyper-parallel,需求走该仓(mindformers PyNative 栈已依赖)

排错指引(从这批 issue 提炼)

症状第一优先动作本篇相关案例
HcclAllToAll 传保留枚举可疑越界类型合法性先于长度表索引已修hccl#674
新 toolkit 算子包旧环境加载报符号找不到OP_ADD 宏弱符号+先探测已修metadef#102
trans 多实例 SGLang 部署无从下手wiki 集成指南:协议选型+三铁律mf#259
MemCache 池化 backend 配置混乱禁 ucm、两处 backend 同为 memcachemtr#604
池化生效与否只看 HTTP 200同长前缀请求验缓存写入/命中mtr#615
A5 异构调度旧配置启动报 Unknown hardware_type改按引擎段填 npu_chip_namemtr#628
容器中文注释乱码Dockerfile 补 LANG/LC_ALL+vimrc utf-8agt#170
仿真结果示例对不上输入认准「输出对应用例 2.1」标注msmd#439
OptiX 装宿主机无法实测寻优uv sync 须进服务容器内执行msmd#440
vLLM benchmark 想开早停[benchmark_early_exit] 配置已文档化msmd#442
FD 诊断任务多慢算异常单机≤3/5 分钟标准+Credit 诊断项mcl#1177
plog 出现 cqe error status[5]任务前后比对 rxdma_icrc_err_cntmcd#35
下载权重纠结 modelscope 还是 wgetwget 直链多网络环境更稳msl#1872
DSA 长序列显存随层数涨一阶段逐层反向已修mf#2586
IndexShare 新增子类层 0 布局错is_index_leader 为 None 显式报错mf#2591
MoE 共享专家 overlap 首步 NaN补 shared stream 同步已修mf#2588
续训改 batch size 后 0 步退出global_step 缩放与 max_steps 不联动,已加告警mf#2590
PyNative 想要统一推理入口yaml inference 段自动继承并行mf#2536
纯 safetensors 权重加载报错common.json 读取已判空mf#2499
盘古 2BV2 报缺 shard.apiPR1358 已恢复导出hp#372
IndexedDataset mmap 泄漏/短读脏数据幂等 close+短读抛错已修hp#376
DSA 反向无 RoPE 梯度全零[: -0] 陷阱,仅 RoPE 维>0 裁剪hp#385
C220 int64 间歇错值 507035补 S→V 流水同步 set/wait_flagdvm#28
Select 输出 shape 推导缺失ShapeProp 已注册看护dvm#25
9362/9363 报 Unrecognized SoCSocType 枚举双分支已补dvm#27
STFT 两套接口行为不一致统一 STFT+PyBoost 调度ms#29630
int8 池化负值窗口输出翻转先饱和后窄化已修+UTlit#448
converter_lite 解析 MINDIR 崩溃attrs 判空已修(fuzz 系列)lit#475
BEVDet 教程跑不通脚本自动化+参数传入已修lit#456
多模态视觉/文本并行想解耦vision_parallel(dp/cp) 已交付com#2093
MindQuantum 想用 NPU全振幅 mqvector_npu 后端已交付com#2114
MindIR 压缩张量加载异常拷贝容量改真实分配量校验ms#29666
AiCPU FFT 内存涨失败分支先释放已修ms#29676
主仓单边通信还能用吗已日落,走 hyper-parallelms#29675

考据与口径披露

  • 增量口径(四)·双轨收官与开窗:本篇为 2026-09 增量补采第四棒,同时兑现上篇预告的两支——①Ascend 弱尾收官:余量池 84 条中 pytorch 34 条经逐条核验全为「API一致性/重复-请忽略」刷屏残留不可用,有效弱尾 50 条预排 6 条 test/CI 垃圾后取 44 候选四批 worker 深析存活 13(弃收率 70%:纯英文翻译 4、产品命名统一 7、内部任务单 11、流程措辞 churn 4、资料搬运 1、附件 401 不可核验 2、工程卫生/勘误 2),增量池至此见底;②mindspore 增量开窗:19 仓 finished_at≥2026-09-07 未采 39 条(排除前四篇已采 198 条)预排 2 条(CVE 机器人单、纯代码风格)后取 37 候选三批深析存活 27(弃收率 27%:开源实习四轮认领放弃关单 4、docs 三连纯指路拒绝 3、纯格式/零内容/证据链不落各 1)。两轨弃收率 70% vs 27% 的对照即「池子新鲜度与条目质量正相关」的实证。
  • KG 核实:机制/口径核对走昇腾知识图谱(ascend.wiki)——hccl#674 命中 HcclAllToAll datatype 契约(0.930)、metadef#102 命中 OP_ADD 注册宏文档(0.923)、mf#2580/#2591 命中 cann-recipes-infer GLM-5.2 的 IndexShare 条目(0.941,训练仓特性与推理生态闭环)、hp#385 命中 sparse_flash_attention_grad_enhance(0.937)、dvm#28 命中 asc_sync_vec 流水同步(0.897)、lit 无命中如实留空;40 行中 28 行挂 kg_refs,12 行无有效命中留空未硬凑。
  • PR 合并判定:一律以 pulls API state=merged+merged_at 判定(merged 字段恒为 null)。本篇特殊载体六例——memfabric#259 修复落 wiki 页(JS 渲染,经浏览器渲染取全文核验);ms#29324 长线任务单 gitcode 无落地 PR [未核实] 如实收录;ms#29675 日落公告无 PR(决策口径即交付);hp#416 框架机制依赖无修复(PR942/954 为此前显式禁用动作);hp#414 GitHub 镜像单(bot 1 秒同步关,落地锚 compile 链 PR1320/1333/1325/1427);hp#376 修复 PR 正文 Fixes 链接指向 atomgit 镜像同编号单(跨平台同号追踪)。
  • 关联依据分层:合入-关单 0 秒链 11 条(MindIE-Motor #604/#615/#628、mindformers #2536/#2580/#2588/#2591、dvm #25/#27/#28、ms#29676);评论→关单秒级 4 条(hccl#674 40 秒、hp#372 35 秒、ms#29666 21 秒、msl#1872 44 秒);小时级(msmd#439/#440 8.5 小时、agt#170 14.3 小时、dvm#28 提单后 2h17m 合并);天数级(hp#376 4.7 天、hp#385 修复晚关单 6 天、mf#259 14 天、meta#102 9 天);Fixes 硬链接(hp#328 PR1140、hp#376 PR1373、dvm #25/#27/#28、lit#475 分支 fix/ms003 对应 PoC);双分支成组(metadef master+9.2.0、mindformers master+beta1 六组、dvm#27 r2.10+master)。
  • 时序与状态陷阱实录:①community#2103 标 issue_state=DONE 实为四轮认领全部放弃的关闭单——DONE 仅是终态标志,真交付须看 /intern-done 与积分授予回执(#2093/#2114 均有);②hp#414/#416 为 GitHub→gitcode bot 镜像单,创建 1 秒即关属同步行为,修复证据须另锚落地链;③hp#385 2 秒标重快关但 PR1395 晚 6 天才合——快关≠已修复;④mindformers#2590 判重先关单、修复双 PR 后置合入;⑤docs#3714/3715/3716 三连 REJECT 均为「请去 MindSpeed LLM 仓提单」的纯指路,镜像/参数正确口径未在单内澄清。
  • 诚实弃收:Ascend 侧 worker 弃 31 条(明细:Bridge #57/#60/#91/#93、Motor#642、MM#356/#554、msmodeling#428、msserviceprofiler#114/#115、slim#523/#524/#571、msopprof#155、msboost#11、mind-cluster#1176、mskpp#17、AgentSDK#169、RAGSDK#116/#117、VisionSDK#57/#59、MultimodalSDK#62、memfabric#480、driver#151、ATK#40、ModelZoo#2739、HKV#33、ops-rec#30、msagent#197、tei#133)+主编预排 6 条 test/CI(msmodeling#451/#452/#453、Motor#636、MM#722、MSRL#169)+pytorch 34 条刷屏;mindspore 侧 worker 弃 10 条(community#2076/#2088/#2103/#2105、docs#3714/#3715/#3716、lite#471、dvm#26、ms#29677)+预排 2 条(ms#29642 CVE 机器人、hp#409 纯风格)。
  • 候选统计与余量:双轨池均已处置完毕——Ascend 增量池正式清零(84 余量 = 34 pytorch 刷屏 + 50 弱尾,弱尾 50 = 6 预排 + 44 候选 = 13 收 + 31 弃);mindspore 增量窗 ≥09-07 的 39 条同样全部处置(2 预排 + 27 收 + 10 弃),早于 09-07 的关闭单已落入前四篇 mindspore 合集的扫描窗不再重扫。系列下一步:新一轮全量 sweep(建议两周后窗口刷新)或按用户点向开专刊。

接入昇腾知识图谱 https://gitcode.com/agent0/kg-tools

系列下一篇:新一轮全量 sweep(建议两周后窗口刷新),或留言点向指定仓专刊。

Logo

作为“人工智能6S店”的官方数字引擎,为AI开发者与企业提供一个覆盖软硬件全栈、一站式门户。

更多推荐