昇腾开源仓Issue分析解答-Ascend精选(十六)·2026-09增量补采

一句话让Agent变成昇腾专家,昇腾任务轻松搞定。评测入口:请按这个开源仓接入昇腾图谱 https://gitcode.com/agent0/kg-tools

总览

仓库定位收录条数
msmodelingPyTorch 图建模与仿真工具(TensorCast/OptiX),增量回归与配置语义 11 案11
MindSpeed-MM多模态大模型训练套件,FSDP2 管线与配套口径 12 案12
mind-cluster集群调度与 NPU 观测组件,挂载约定与采集诊断 13 案13
msmodelslim模型量化压缩工具,数值正确性与 CLI 工程 7 案7
MindSpeed-BridgeMindSpeed↔Megatron 桥接,thd 精度毁灭案 1 案1
MindIE-Motor推理引擎调度与容错,KV 对齐与跨 Pod 心跳 2 案2
memfabric_hybrid内存池中间件,高可用与 A3 跨机 4 案4

msmodeling(PyTorch 图建模仿真·TensorCast 回归与 OptiX 配置)

增量主力仓:nightly 回归三连、MoE 路由高估与 adaptor 精简,配置注入语义统一与压测卫生

编号Issue 问题内容解答总结
#279optx 配置繁琐:望直读 vLLM 启动脚本并加 DP/TP 组合寻优官方维持 config.toml 单一入口(脚本优先级/变量展开规则推高维护成本),改由 Agent 辅助把启动命令+寻优需求生成校验 config.toml。组合寻优已有解:DP 用 enum、TP 用 factories 按 8/DP 派生,只产生 (1,8)(2,4)(4,2) 三组。
#315profiling_database 缺 A2 实机与新版 vllm 数据,何时更新官方排期 26Q3 分三批补实测:GLM 5.1/vllm-ascend 0.18.0/A3 800T、GLM 5.2/0.23.0rc1-a3、Kimi k3/0.23.0rc1-a3/A3 800I。社区随后提 !837 为数据库加质量门禁与 PR 报告流水线(WIP 未合并)。
#390开 shared-expert-tp 时 MoE topk 未随 TP 切分,分发量高估 tp 倍route() 在 _dp_transform_enter 前按全量 token 计算,hidden 已切 N/tp 而 topk 仍 N×k,init_routing_v2 按 numel 驱动 all_to_all 全链膨胀(实测约 2×),末尾截断掩盖。!795 对齐路由与 token 切片,09-08 合并;影响标准门控系模型,raw-logits 分支不受影响。
#403model adaptor 依赖实测锚定,verify 裸抛异常、MoE 误报卡流水线!791 精简为跑通级:删 insight/evidence 五模块与 doctor 实测输入;verify 改结构推导对账(attention/MoE gating 次数 vs 公开结构);崩溃输出 SIMULATION_ERROR 结构化报告+AI 修复任务;MoE 路径算子作已适配证据消除误报,09-09 合并。
#405nightly 回归:SP Replay 残留 all_reduce;MXFP4 GMM 断言过期!754 的 _internal_copy_region_v2 使 SP P3 matcher 把 bookkeeping 用户误判为数据路径用户,all_reduce 未被替换;!699 已把 GMM+SwiGLU+MXFP4 融合成 _quant 算子而断言过期。!797 让 matcher 忽略 bookkeeping 边、兼容两代 copy 并更新断言,09-09 合并。
#410stop_vllm_process.sh 按 pkill -f 匹配,清理链自杀误杀进程生产调用 bash -c ‘bash /tmp/vllm/stop_vllm_process.sh vllm’ 自身命令行即含模式,首轮 pkill -9 命中脚本与会话 shell(实测退出码 137,5 次重试成死代码)。!850 加自排除逻辑 protected_pids+self_script,合并 2 分钟后关单。
#411压测期 scheduler 每秒调 health() 发真实推理探针污染测量MultiHostSimulator.health() 在 /health 200 后无条件发 completion 请求,scheduler 压测期对非内置模拟器每秒轮询;8×910B2 真机 tcpdump+访问日志证实每秒 1 条贯穿压测窗口。!850 改判日志 start up 完成替代发请求,合并 55 秒后关单。
#412DeepSeek PD ratio 编译失败:FX 在 pow_2 定义前使用AOT Autograd 的 FX 图里符号 shape 节点可排在其消费的 view 之后,rewrite 前未归一化。!802 在编译 rewrite 前对 AOT 图做 stable_topo_sort+lint,LiftCombineQuantPass 重建 view 后再恢复拓扑,加 operator.pow 依赖单测,09-10 合并。
#430OptiX vLLM 参数注入语义混用,env/MindIE 配置可能误成命令行参数!778 引入 VllmCommand 后 update_data_field 未区分注入位置。!825 统一语义:run=命令行、env=子进程环境变量(新增 [vllm.env] 块)、BackendConfig.*=MindIE 配置路径;MAX_NUM_BATCHED_TOKENS 等迁回 run,补混合注入回归,09-16 合并。
#438FLUX.1-dev/Qwen-Image-Edit 已可仿真,但支持矩阵与英文指南缺章节!855 在中英支持矩阵补 FLUX.1-dev、Qwen-Image-Edit 与 Image Generation DiT 仿真能力,英文指南补 image_generate 快速入门/参数/已知限制,并明确 CLI 已支持而 Web UI 未接通不声明;!856 同步 backport 26.2.0,均合并。
#4434fdcdefb 后 Qwen3-Next 三条回归失败:访问路径/MTP 断言/TP2runtime 用例沿用 Qwen3.5 的 language_model.layers 而 Qwen3NextModel 直接暴露 layers(AttributeError);MTP 诊断仍断言已拆分的 linear_attention 单 stage;TP=2 融合投影与本地 K/V head 分片未对齐。!870 修三条路径,合并当秒自动关单;!873 backport 26.2.0。

MindSpeed-MM(多模态大模型套件·FSDP2 训练管线与配套口径)

存取对称性/packing 边界/LoRA 存盘/数据管线,README 配套矛盾澄清与 mxfp8、MagiHuman 落地

编号Issue 问题内容解答总结
#357社区任务:MagiHuman 15B 音视频 DiT 迁移至 MindSpeed-MM FSDP2社区认领交付 PR !2813(09-17 合入):新增 fsdp/models/magihuman/ 插件经 @model_register 注册,video/audio/text 单流打包 flow-matching 联训,HF 分片 safetensors 增量加载,适配 CP/EP/chunkloss/recompute/异步激活卸载;验收 MFU≥24;实践文档 issue #498。
#520qwen3_6 README 两处 triton-ascend 版本不一致(3.2.0/3.2.1)两处版本号均过时,正确值是第三个:PR !3157(09-18 合入,与关单同秒)将 README 与已整改的 qwen3_5 README(!3037) 对齐,triton-ascend 统一为 3.2.2,并补齐 EP、MoE aux loss、mtp、性能优化、LoRA 章节及 fla-npu 的 cmake 依赖。装错版本的用户按 3.2.2 重装即可。
#536FSDP2 预训练 packing 按 cutoff_len 硬切,跨文档注意力与位置状态泄漏官方确认 master 现状:文档拼接后按 cutoff_len 切分,无边界隔离。方案在 PR !3054(09-20 核验仍 open,issue 已先关):按完整文档 packing,生成 cu_seqlens 隔离跨文档 attention/线性注意力状态、文档内重计 position_ids、首 token 置 ignore label。陷阱:关单≠能力已落地。
#543chunkmbs.md 中 chunk_mbs 与 MBS/GBS 关系表述前后冲突,取值无解官方澄清:chunk_mbs 是实际执行的 mbs,原入参 MBS 会被按 chunk_mbs 切块,GBS/MBS 斜线意为除。典型用法:micro_batch_size=GBS/DP(DP=1 即 GBS)、梯度累积 1、chunk_mbs=原 MBS。文档随 PR !3022(09-09 合入 docs fix)整改,issue 于 11 天后批量关单时关闭。
#550GRPO 微调 qwen2.5-7b-vl 时 Actor 权重迁移 vLLM 分桶报错官方答复:RL 系列模型及特性已整体迁移至 verl 仓(github.com/verl-project/verl)维护,GRPO 训练建议直接改用 verl;MindSpeed-MM 不再跟进 RL 特性,issue 给出指引后即关闭。KG 中另有 Qwen2.5-VL-7B GRPO 训练实践指南与 verl 架构解析可供迁移参考。
#574动态分辨率多模态 FSDP2 扩展退化:token 失衡+cu_seqlens 高频 H2D 同步官方逐点回应:①rank 间 token 负载失衡可用 datapacking 缓解;②triton 关键算子已上 tensor cache,消除大多数同步,残余同步影响轻微,性能强诉求建议改 AscendC 实现(该分支已完全消除同步);③qwen2-vl 已日落不再投入。因 issue 无单点指向,以建议+欢迎贡献 PR 关闭,无修复落地。
#577LoRA adapter-only 存盘仍走全量 DCP 写,每次多复制冻结基模型约 36G报告者自提 PR !2948(跳过全量写)未采纳;官方 PR !3109(09-16 合入)新增 lora_save_only:开启仅存 lora 权重+adapter.json;关闭且 save_format=dcp 存全量供断点续训,=hf 融合后直接导出推理;save_ckpt_dtype 生效点移至 LoRA 合并后提升融合精度,保存路径按 iter 隔离。
#589反馈称视觉长序列超 2048 即 OOM、官方无长序列方案,与实际能力不符官方反驳澄清:flash_attention_2 显存 O(N),无 2048 硬上限;GDN/KDA 线性注意力、DSA 稀疏注意力均有 AscendC 融合算子;GDN/KDA 已适配 Ulysses 等 CP(context_parallel_size/algo 可配),叠加 recompute/TP/PP 进一步降显存。要求补模型/commit/yaml/日志复现,未获回应后关单。
#621FSDP2 resume 时 optimizer 存/取标志不对称,DCP 局部加载静默跳过致发散no_save_optim=true 存盘不写 optimizer,resume 时 no_load_optim=false 因 DCP allow_partial_load 静默跳过缺失分片,AdamW 冷启动无告警。修复 PR !2983(09-18 合入):save 端 extra_state 记录 saved_optim,load 端缺失即 warning,补齐与 RNG 守卫的对称性。
#64326.0.0 分支 qwen3_5 README 的 CANN 推荐版本前后矛盾且与镜像不符矛盾链:README 正文荐 CANN 8.5.2,MoE 加速链接却指向 CANN 9.0.0+torch_npu 2.7.1.post2,26.0.0 镜像实置 CANN 9.0.0+2.7.1.post4(与 pytorch COMPATIBILITY.md 一致)。官方:Qwen3.5 优先参考最新分支 README;配套以 torch_npu 发布说明为准。
#716qwen3-vl-30B/qwen3.5-27B 请求 mxfp8 训练支持PR !3158(09-18 合入)落地 fsdp_turbo mxfp8:qwen3.5-27B 误差 0.25%、性能 1.3×bf16;qwen3-vl-30B 误差 0.33%、1.1×bf16。手段:cutoff_len/mbs 扩 16K/4、chunk_loss+activation_offload、swap_plan 与注意力重放缓存;A5 需 triton-ascend。
#720utils.py 扩展名 .parquat 拼错,parquet 读取全失效两处拼写错误:受支持扩展名 .parquat→.parquet、pandas.read_parquat→pandas.read_parquet。修复 PR !3171(09-18 合入,与关单同秒)补 Parquet 记录加载回归测试,pandas 2.3.3 实测读写通过;get_datasamples 恢复正常加载。

mind-cluster(集群调度与 NPU 观测·设备插件挂载与采集诊断)

调度与容器挂载五案+观测指标与采集诊断八案,六条秒级自动关单铁证

编号Issue 问题内容解答总结
#1143device-plugin 仅共享设备场景缺 volcanoType 校验与资料PR !4656:补充该场景 volcanoType 参数校验逻辑与配套资料(main.go 修改,自检备注无 UT/ST 需求)。2026-09-15 合并、09-18 关单。KG:Volcano 参数文档 06_api/01_volcano-part0004(0.897)。
#1146node_base_info 指标缺驱动版本标签,无法按 HDK 区分PR !4649:新增 dcmi_get_driver_version 接口,node_base_info 指标增加 dcmiVersion 标签。KG:仓内 RFC 26.1.0《NPUExporter新增node_base_info指标》设计文档(0.932)与 npu_exporter 部署文档(0.930)。09-14 合并、09-17 关单。
#1153server 节点 unexpectedAdmissionError 后 pending 无法调度提问者自查:报错 pod group is not ready 与 plugin NodeAffinity predicates failed——node(s) didn’t match Pod’s node affinity/selector,为节点标签不匹配所致;MindCluster 默认标签用中横线、不可用下划线,标签名在 Init 配置文件改正后恢复。KG 同类排查 FAQ 0.924。
#1155sample yaml 下发 a3 单机任务报 replicaSpec is not valid官方(shepherd-cheung):报错 when scheduler not found, the req num must be 1 即 standalone 示例仅支持请求 1 张 NPU;卡数非 1 应换用 mindspore_multinodes_acjob_super_pod.yaml,worker replicas 设1、request NPU 设实际值。示例选型问题,无代码修复
#1162hccl 建链日志关键字改 DetectRankTableImpl,解析失效PR !4683(A5):建链信息提取适配新 hccl 日志关键字,并同步调整 checker 检查逻辑。KG 佐证关键字源头:hcomm rank_info_detect 模块承载 RootInfo 建链检测(rank_info_detect.cc 0.928 / root_info_detect_provider.cc 0.921)。merged 与关单秒级一致。
#1165docker runtime 起容器后 hccl_rootinfo.json 被只读挂载无法修改官方(hujianrong):ascend-docker-runtime 出于安全默认以只读方式挂载默认项,修改应在宿主机改文件后同步进容器;单文件挂载受 inode 限制,vim 需在 ~/.vimrc 配置 set backupcopy=yes 确保原地修改。同主题任务单 #1167 后续在 26.2.0 删除默认挂载(PR !4691,同日晚间合并)。KG:默认挂载内容附录 0.931。
#1166npu-exporter network 指标组混装带宽与链路指标难区分PR !4685:network 拆为 network_bandwidth(带宽类指标,默认 60s)与 network_link(链路状态/速率/UP 数,默认 600s);optical 指标组默认周期 60s→600s;旧 network 采集器暂留兼容(指标相同,不建议同时开启避免重复采集)。
#116726.1.0 前默认挂载 hccl_rootinfo.json,UB 场景训练拉起失败根因:rootinfo 配置 RoCE 网络层级但未挂载 UB 网卡字符文件时,不用 DPU 的训练也拉起失败。PR !4691:26.2.0 删除默认挂载逻辑,改由 CANN 自协商机制创建通信域;UB 网卡设备建议 MindCluster ≥26.2.0 且 CANN ≥9.2.0。merged 与关单秒级一致。
#1172ascend-fd-tk 扫描时部分交换机 ssh 登录超时,本地可正常连PR !4694:交换机等嵌入式设备认证响应慢,协议/认证阶段超时放宽至 30s(TCP 建连仍走 10s 快阶段);密码/密钥登录默认关闭 paramiko 额外尝试(不再试探本机 ~/.ssh 密钥与 SSH agent),认证只走工具配置方式。merged 与关单秒级一致。
#1174clusterops-agent CM 上限 1M,与内存 relcache/pathmap 不一致PR !4698:CM 大小限制 1M 改为 100M(即 100 个 CM 分片);缓存方案改为执行即缓存,不再需要任务 get 权限;同时修正文档不正确描述并新增 NFS 挂载案例。merged 2026-09-18 17:37:03 与关单秒级一致。
#1175npu-exporter 利用率指标跨 HDK 版本含义不一,对比易误判官方说明:利用率指标定义由 HDK 决定——24.1.RC2.7 前仅 dcmi_get_device_utilization_rate 单指标查询;25.3.RC1 起 NPU 整体利用率改按 RTS 调度任务时间占比;26.0.RC1 新增 multi_utilization_rate 四指标同查(仅 A5);1s 平均与 host 缓存受 A2/A3/A5 形态限制。
#1184ClusterOps 采集 plog 时把多个 taskid 目录的 plog 数据一并采集PR !4719:node-collector 采集时对 taskid 严格限制——无 taskid 则不采集;目录名无 taskid(uuid 类字段)时按 ip 匹配;ip 与 taskid 均无则退化为按关键字匹配目录采集,避免误采多任务数据。merged 2026-09-20 10:59:56 与关单秒级一致。
#1185ascend-fd-tk 用了 Python 3.10 才有的语法,3.9 下运行报错PR !4718 python 版本兼容性修改:类型注解由 3.10 的 X | Y 写法改回 typing.Union 形式(如 Union[SwitchFetcher, PoDManagerFetcher]),支持 Python 3.8 及以上;2026-09-20 11:30:28 合并,与关单时刻秒级一致(平台自动关单)。

msmodelslim(模型量化压缩·数值正确性与 CLI 工程化)

Per Token 维度/伪量化前向/多卡分片/传参类型四类根因,CLI 整改六 PR 两轮回归收口

编号Issue 问题内容解答总结
#446Per Token激活量化min/max按整Tensor计算,scale失真提单人定位minmax.py L47-66:minmax_config初始化dim=[],min/max按整Tensor而非每token计算;官方确认影响静态量化与敏感层分析(动态量化不受影响),应先reshape(-1,shape[-1])再按dim=[1]、keepdim=True计算。修复PR#826已关闭、后续#883至今open,stale关单时修复未落地。
#447Qwen3.5-397B量化时内存溢出提单人自修:PR#810修复Qwen3.5量化内存溢出,08-27合入;官方08-10确认"bug已由提出人修复"。此后走resolve→stale流程,09-18才关单,比真实修复时点晚22天。
#536CLI版本时间与服务器不符;帮助参数未对齐,文档残留旧参数多PR分批修复:#922/#925(帮助列宽自适应终端、短选项对齐、文档旧参数,09-14)、#975(版本时间改用服务器本地时区、按真实终端宽度换行,09-16)、#974/#980/#983(旧参数残留、analyze别名与top_k标题,09-16~17)。首轮回归不通过(时间未对齐、旧参数残留),二轮补修后09-17测试通过,确认资料无旧参数用法。
#540量化精度自动调优报Code 203 SchemaValidateError退出根因:自动调优调用量化服务时误传PracticeConfig对象,服务端schema校验要求BaseQuantConfig,Code 203拒绝致流程中断。PR#919修复传参,09-15合入;09-17回归通过:调优流程正常执行,首轮浮点精度不达标会按预期报错提示。
#558权重量化转换报BaseModelAdapter无get_model_type属性根因:check_model_type_transformers校验逻辑与权重转换流程冲突,致权重量化转换入口不可用。PR#958(分支bugfix/issue558)09-14合入,09-17回归确认执行权重转换功能正常。
#564Qwen3-32B W8A8C8伪量化推理对话重复回答官方定位:异常由IR图W8A8DynamicPerChannelFakeQuantLinear前向错误引起。PR#964修复该Linear前向,09-16合入;09-17回归确认W8A8C8伪量化推理对话正常。
#567DeepSeek-V3.1-Terminus 4卡伪量化推理list越界根因:多卡场景样本分片在特定情况下数组越界(IndexError: list index out of range)。PR#976(分支bugfix/issue567)09-16合入;09-17回归确认4卡伪量化推理与对话正常。

MindSpeed-Bridge(MindSpeed↔Megatron 桥接·thd 精度毁灭案)

int32 attention_mask 被当行号索引,一次毁掉 embedding 与 position_ids

编号Issue 问题内容解答总结
#41Qwen3.5-9B/35B用thd格式训练loss飙至21、grad_norm 570+定位:Qwen3VLModel.forward以dtype=int32创建attention_mask,preprocess_packed_seqs中input_ids[i,mask[i]]把int当行号索引而非掩码,embedding与position_ids全毁。PR#54当天被关,实际修复PR#55改mask为bool,08-14合入(bshd格式正常);09-17关单距合入34天。

MindIE-Motor(推理引擎·KV offload 对齐与跨 Pod 心跳)

两条均为 merged_at==关单时刻的秒级自动关单铁证

编号Issue 问题内容解答总结
#631kv-conductor HBM→CPU续查未按instance/dp对齐,cpu_blocks虚高PR#986修复:HBM续查按instance/dp对齐、YuanRong CPU/Disk按节点注册、亲和调度支持阈值配置;09-18 20:10:39合入与关单同秒。后继PR#1008(修#647)正文将其列为"已合入"前序佐证;注意页面linked_merge_requests现挂的是open的#1008,勿混淆。
#643跨Pod下Controller心跳Endpoint集合校验失败,误判致超时根因:Instance.endpoints[pod_ip]的key是Pod内存储key(各Pod可从0重编),而NodeManager心跳status key用全局Endpoint.id;原实现用字典key构造期望集合,第二个及后续Pod合法心跳被判不一致致超时误判。PR#1000统一用endpoint.id构造期望集合并补跨Pod回归测试;09-18 18:18:17合入与关单同秒。

memfabric_hybrid(内存池中间件·高可用与 A3 跨机)

etcd 双主/监听 bind/配置叠加三修与 A3 超节点跨机能力补齐

编号Issue 问题内容解答总结
#472主节点etcd断链恢复后双主,旧主不降级PR#1309根因:抢锁(30s)与健康检查共用backendMutex_互相阻塞、旧主降级被reElectionInProgress_短路、BecomeFollower失败不上报,新主5~10s上位时旧主仍对外服务;etcd瞬时读超时还会致旧主自我降级变无主。修复:抢锁超时30s→2s与健康检查解耦、降级改无条件幂等并通知上层;09-17 11:31:55合入与关单同秒。
#478循环执行禁用etcd用例,leader起监听时bind地址失败PR#1315根因:SocketAddressParserMgr按端口缓存parser,同端口不同IP时端口表被覆盖,AccTcpListener::Start按端口取到其它节点IP,从节点bind报EADDRNOTAVAIL无法接管。修复:Start按自身ip:port用CreateParser解析、BuildListenUrl处理IPv6;09-17 11:07:16合入与关单同秒。
#479800I A2 host_shm部署DeepSeek推理报Failed to put key官方定位:1.2分支host_shm协议下不应设置ock.mmc.local_service.max.dram.size=50GB(与local_service.dram.size=20GB叠加超限);提出者去掉该配置后推理不再报错,确认解决并自行关单。配置级规避,无代码修复。
#485offload shared模式不支持A3跨机能力补齐:PR#1322为offload shared模式新增A3超节点跨机支持(PR附自验证截图);09-20 14:17:23合入与关单同秒。

组合解读:这 50 条增量里的共性规律

1. TensorCast 回归链与 MoE 路由五案:上一个修复埋的雷由下一个修复收。
SP Replay 残留、FX 拓扑错序、Qwen3-Next 适配滞后全部由 nightly 回归抓出,MoE 路由高估则把性能口径问题摆上台面。

  • msm#405 SP Replay 残留 all_reduce+MXFP4 断言过期:!754 引入 matcher 误判,!797 让 matcher 忽略 bookkeeping 边并更新断言
  • msm#412 DeepSeek PD ratio 编译失败(FX 在 pow_2 定义前使用):!802 编译 rewrite 前先 stable_topo_sort+lint
  • msm#443 Qwen3-Next 三条回归(访问路径/MTP 断言/TP2):!870 一次修三条、合并当秒自动关单,!873 backport 26.2.0
  • msm#390 开 shared-expert-tp 时 MoE topk 未随 TP 切分(分发量高估约 2×):!795 对齐路由与 token 切片
  • msm#403 model adaptor 依赖实测锚定拖垮流水线:!791 精简为跑通级,verify 改结构推导对账

2. OptiX 配置语义、压测卫生与数据资产六案:坑多在语义边界而非算法。
注入位置三义、健康探针污染测量、pkill 自匹配,外加性能数据库与支持矩阵两案数据资产补全。

  • msm#430 env/MindIE 配置可能误成命令行参数:!825 统一 run=命令行、env=[vllm.env]、BackendConfig 三语义
  • msm#279 望直读 vLLM 启动脚本被婉拒:官方维持 config.toml 单一入口,DP enum×TP factories 三组寻优已有解
  • msm#410 停流脚本 pkill -f 匹配自身致自杀:!850 加 protected_pids 自排除(合并 2 分钟后关单)
  • msm#411 压测期 scheduler 每秒发真实推理探针污染测量:!850 改判日志 start up 完成(55 秒后关单,一 PR 修两单)
  • msm#315 profiling_database 缺 A2 实机与新版 vllm 数据:官方 26Q3 三批实测排期答复
  • msm#438 FLUX.1-dev/Qwen-Image-Edit 支持矩阵缺章节:!855 补中英矩阵与英文指南+!856 backport

3. MindSpeed-MM FSDP2 存取与数据管线四案:该隔离的没隔离。
存盘标志不对称静默发散、packing 硬切泄漏、LoRA 冗余全量写、扩展名拼错——四案同一主线,其中一案的修复 PR 至今未合入。

  • mm#621 resume 时 optimizer 静默跳过致训练发散:!2983 存端 extra_state 记录 saved_optim、载端缺失即告警
  • mm#536 预训练 packing 按 cutoff_len 硬切跨文档泄漏:方案 !3054 按 cu_seqlens 隔离——至今 open,关单≠能力落地
  • mm#577 LoRA adapter-only 存盘仍走全量 DCP 写(每次多约 36G):自提 !2948 弃用,官方 !3109 落地 lora_save_only
  • mm#720 .parquat 拼写致 parquet 读取全失效:!3171 修两处拼写+补回归测试,同秒自动关单

4. README 配套与文档口径三案:版本号以镜像实际置入为准。
README 内部自相矛盾、双版本号并存、参数口径冲突,都是文档滞后于发版的表现。

  • mm#643 qwen3_5 README 的 CANN 推荐版本自相矛盾(8.5.2 vs 链接 9.0.0,镜像实置 9.0.0):以最新分支+torch_npu 发布说明为准
  • mm#520 qwen3_6 README 两处 triton-ascend 不一致:!3157 统一为 3.2.2 并补五章节,同秒关单(连带目录勘误单 #542)
  • mm#543 chunk_mbs 与 MBS/GBS 关系表述冲突:官方澄清 chunk_mbs 即实际执行 mbs,!3022 整改文档

5. 能力边界澄清与特性落地五案:迁移、日落与反驳。
RL 整体迁 verl、qwen2-vl 日落、长序列质疑被官方数据反驳——边界澄清与 mxfp8、MagiHuman 两项新落地同框。

  • mm#550 GRPO 微调权重迁移 vLLM 分桶报错:RL 系列已整体迁 verl 仓维护,MindSpeed-MM 不再跟进
  • mm#574 动态分辨率 FSDP2 扩展退化:官方给 datapacking/tensor cache 缓解路径,qwen2-vl 已日落
  • mm#589 「视觉长序列超 2048 即 OOM」被官方反驳:FA 显存 O(N) 无硬上限,GDN/KDA/DSA+Ulysses CP 均有 AscendC 方案
  • mm#716 qwen3-vl-30B/qwen3.5-27B 请求 mxfp8:!3158 落地,误差 0.25-0.33%、性能 1.1-1.3×bf16
  • mm#357 MagiHuman 15B 音视频 DiT 迁移社区认领交付:!2813 插件注册+flow-matching 联训,验收 MFU≥24

6. mind-cluster 调度与容器挂载五案:设备插件与运行时的约定。
标签写法、只读挂载、rootinfo 默认挂载与 UB 训练的冲突——调度侧的坑集中在「约定没写进文档的地方」。

  • mc#1153 unexpectedAdmissionError 后 pending 无法调度:节点标签用中横线而非下划线,改标签即恢复
  • mc#1165 hccl_rootinfo.json 被只读挂载改不动:宿主机改+vim set backupcopy=yes;26.2.0 起删默认挂载
  • mc#1167 默认挂载 rootinfo 致 UB 场景训练拉起失败:!4691 删默认挂载改 CANN 自协商(秒级关单;UB 需 MindCluster≥26.2.0+CANN≥9.2.0)
  • mc#1155 a3 单机任务报 replicaSpec is not valid:standalone 示例仅支持 1 NPU,多卡换 super_pod yaml
  • mc#1143 共享设备场景缺 volcanoType 校验与资料:!4656 补参数校验与配套文档

7. mind-cluster 观测与采集诊断八案:对齐口径+防御性解析。
指标定义跨 HDK 漂移要出对照表,日志关键字变了要跟版本适配解析器,采集要严格限定任务归属。

  • mc#1175 利用率指标跨 HDK 版本含义不一:官方给 24.1/25.3/26.0 三代口径对照
  • mc#1166 network 指标组混装带宽与链路:!4685 拆 network_bandwidth/network_link 两组
  • mc#1146 node_base_info 缺驱动版本标签:!4649 新增 dcmi_get_driver_version 接口+dcmiVersion 标签(KG 命中仓内 RFC 设计文档)
  • mc#1184 plog 采集夹带多 taskid 数据:!4719 按 taskid/ip/关键字三级匹配(秒级关单)
  • mc#1162 hccl 建链日志关键字改 DetectRankTableImpl:!4683 适配新关键字(秒级关单;KG 溯源 hcomm rank_info_detect)
  • mc#1185 诊断工具用了 Python 3.10 语法:!4718 改回 typing.Union 兼容 3.8+(秒级关单)
  • mc#1172 交换机 ssh 扫描登录超时:!4694 认证阶段放宽至 30s(秒级关单)
  • mc#1174 clusterops-agent CM 上限 1M:!4698 放宽 100M+执行即缓存(秒级关单)

8. msmodelslim 量化工具链七案:数值正确性与工程健壮性并存。
Per Token 维度、伪量化前向、多卡分片、传参类型四类根因横跨数值与工程,CLI 整改两轮回归才收口,另有一案修复至今未落地。

  • slim#446 Per Token 激活量化 min/max 按整 Tensor 计算:官方确认根因与 reshape(-1,dim) 改法;修复 PR 826 closed/883 open——resolved 未落地
  • slim#447 Qwen3.5-397B 量化内存溢出:提单人自修 PR 810(08-27 合入,stale 关单晚 22 天)
  • slim#564 W8A8C8 伪量化推理重复回答:PR 964 修 IR 图 FakeQuantLinear 前向
  • slim#567 DeepSeek-V3.1 4 卡伪量化 list 越界:PR 976 修多卡样本分片
  • slim#558 权重转换报 BaseModelAdapter 无 get_model_type:PR 958 解校验逻辑与流程冲突
  • slim#540 量化调优报 Code 203 SchemaValidateError:PR 919 修 PracticeConfig 误传为 BaseQuantConfig
  • slim#536 CLI 版本时间与帮助排版残留旧参数:六个 PR 分批整改,首轮回归不通过、二轮补修后收口

9. Bridge、Motor 与 memfabric 小仓七案:小仓的案例反而最锋利。
一个 int32 mask 毁掉整个 embedding、心跳 key 语义不一致误判超时、抢锁与健康检查互锁致双主——根因都很「低级」,杀伤都很大。

  • bridge#41 thd 格式训练 loss 飙至 21:int32 attention_mask 被当行号索引,PR 55 改 bool(官方评论所指 PR 54 实为 closed 未合)
  • motor#631 kv-conductor HBM→CPU 续查未按 instance/dp 对齐:PR 986 对齐+亲和调度阈值(秒级关单;页面挂的 PR 1008 是修 #647 的后继)
  • motor#643 跨 Pod 心跳校验失败误判超时:PR 1000 统一用全局 endpoint.id 构造期望集合(秒级关单)
  • mem#472 etcd 断链恢复后双主不降级:PR 1309 抢锁 30s→2s 与健康检查解耦、降级改无条件幂等(秒级关单)
  • mem#478 循环禁用 etcd 用例 leader bind 失败:PR 1315 监听按自身 ip:port 解析(秒级关单)
  • mem#479 800I A2 host_shm 部署 DeepSeek 报 Failed to put key:去掉 max dram 50GB 叠加配置即解(提出者验证自关)
  • mem#485 offload shared 模式不支持 A3 跨机:PR 1322 补 A3 超节点跨机能力(秒级关单)

排错指引(从这批 issue 提炼)

症状第一优先动作本篇相关案例
FSDP2 resume 后 loss 发散查 no_save_optim/no_load_optim 对称性,载入缺失应有告警mm#621
packing 后跨文档注意力串味确认是否 cutoff_len 硬切,等边界隔离方案合入mm#536
LoRA 存盘体积≈全量用 lora_save_only 只存 adaptermm#577
parquet 数据集读不出先查扩展名拼写 .parquatmm#720
README 版本与镜像不符以镜像内置配套+torch_npu 发布说明为准mm#643、#520
chunk_mbs 配置取值无解chunk_mbs=实际执行 mbs,GBS/MBS 斜线为除mm#543
RL/GRPO 训练报错RL 特性已整体迁 verl 仓mm#550
动态分辨率 FSDP2 性能差datapacking+关键算子 tensor cachemm#574
质疑长序列 2048 OOMFA 显存 O(N) 无硬上限,查 CP/recompute 配置mm#589
夜间回归 SP all_reduce 残留matcher 忽略 bookkeeping 边msm#405
FX 编译 pow 定义前使用rewrite 前先 stable_topo_sortmsm#412
Qwen3-Next 用例 AttributeErrorlayers 访问路径按模型类区分msm#443
shared-expert-tp 通信量翻倍路由 topk 随 TP 切片对齐msm#390
OptiX env 变量没生效run=命令行、env=[vllm.env]、BackendConfig 三语义msm#430
停流脚本误杀自身进程pkill -f 加自排除msm#410
压测吞吐异常波动确认健康探针是否发真实推理请求msm#411
pod pending NodeAffinity failed节点标签用中横线非下划线mc#1153
容器内 rootinfo 改不动宿主机改+set backupcopy=yes;26.2.0 起删默认挂载mc#1165、#1167
UB 场景训练拉起失败MindCluster≥26.2.0+CANN≥9.2.0,rootinfo 自协商mc#1167
standalone yaml 多卡报错换 super_pod 示例,worker replicas=1mc#1155
利用率跨版本对比误判指标定义随 HDK 演进,按对照表解读mc#1175
网络带宽/链路指标混淆拆 network_bandwidth/network_link 两组mc#1166
需按驱动版本筛节点node_base_info 已带 dcmiVersion 标签mc#1146
plog 采集夹带他人任务taskid/ip/关键字三级匹配mc#1184
hccl 建链解析失效适配 DetectRankTableImpl 新关键字mc#1162
工具在 Python 3.9 报语法错X|Y 注解改 typing.Unionmc#1185
交换机 ssh 扫描超时认证阶段放宽 30smc#1172
CM 超过 1M 报错上限已放宽 100M 分片mc#1174
Per Token 量化 scale 失真reshape(-1,dim) 后按 dim=1 计算slim#446
超大模型量化 OOM提单人修复已合入slim#447
W8A8 伪量化对话重复IR 图 FakeQuantLinear 前向修复slim#564
多卡伪量化 list 越界样本分片修复slim#567
权重转换缺 get_model_type校验逻辑冲突已修slim#558
调优报 Code 203 Schema传参改 BaseQuantConfigslim#540
thd 训练 loss 飙高attention_mask 须 bool 非 int32bridge#41
cpu_blocks 虚高HBM 续查按 instance/dp 对齐motor#631
跨 Pod 心跳校验失败期望集合用全局 endpoint.idmotor#643
etcd 抖动后双主抢锁与健康检查解耦、降级幂等mem#472
leader 接管 bind 失败监听按自身 ip:port 解析mem#478
host_shm 报 Failed to put key去掉 max dram 叠加配置mem#479
offload shared 要跨机A3 超节点已支持mem#485

考据与口径披露

  • 增量口径:本篇为 cann/Ascend 两组织 2026-09 增量补采——187 仓按 updated_at 前翻、以 finished_at≥2026-09-17 过滤(updated 近但关单早的老单被评论激活者不计),得 1,019 条新关单;筛已解决×用户侧并排 CVE/空标题得 281 条,再排 38 条「API一致性任务/重复-请忽略」刷屏后有效池 243 条;按价值取头部 63 条四批 worker 深析,恰留 50 入选、worker 层弃 13。mindspore 组织增量本轮未采(专列四篇已收官)。
  • KG 核实:涉及机制/口径的核对用了昇腾知识图谱(ascend.wiki)——mc#1162 建链关键字溯源至 hcomm rank_info_detect.cc、mc#1146 命中仓内 RFC《NPUExporter 新增 node_base_info 指标》设计文档、motor#631 二轮改写后命中 vllm-ascend KV Cache CPU Offload 特性指南、mc#1165/#1167 命中 ascend-docker-runtime 默认挂载附录、msm#430/#279 命中 OptiX 参数寻优设计文档、mm#716 命中 mxfp8 量化训练食谱、msm#443 命中 Qwen3-Next 线性注意力说明等;50 行中 37 行挂 kg_refs,13 行无有效命中留空未硬凑。
  • PR 合并判定:一律以 pulls API state=merged+merged_at 判定(merged 字段恒为 null 不可用)。本篇特殊载体五例——mm#536 方案 PR 3054 至今 open(关单≠能力落地)、slim#446 修复 PR 826 closed/PR 883 open(resolved 未落地)、mm#577 自提 PR 2948 closed 由官方 PR 3109 落地、bridge#41 官方评论所指 PR 54 实为 closed 未合(真修复 PR 55)、motor#631 页面 linked PR 1008 为 open 的后继单修复(真修复 PR 986,PR 1008 正文反证);mc#1165 关单早于同主题 PR 4691 合并约 10 小时,不倒填、fix_ref 留空。抽 21 条硬时序断言对 API 复核通过(19 条自动关单链 + 2 条 stale 对照)。
  • 关联依据分层:合入-关单差最长 3 分 03 秒的自动关单链路 19 条(msm #410/#411/#443,mm #520/#720/#621/#716/#357,mc #1185/#1184/#1174/#1167/#1172/#1162,motor #631/#643,mem #472/#478/#485——同秒 14 条,其余 5 条差 55 秒~3 分 03 秒);分钟级(msm#438 距 backport 合入 16 分钟);一 PR 多单(msm !850 同修 #410/#411、mm !3157 同秒连带关目录勘误单 #542);master+26.2.0 backport 双 PR(msm#443/#438);分支名实锤(slim PR 958/976 分支 bugfix/issue558、bugfix/issue567,mem PR 1309/1315 分支 fix/ha-、fix/acclink-);PR body Closes/Fixes 显式(msm#390/#403/#430、mm#621、slim 系列回归评论、motor#643);页面 linked PR 反查纠偏(motor#631);评论解答/官方口径(msm#315/#279、mm#643/#550/#574/#589、mc#1153/#1155/#1165/#1175、mem#479)。
  • 时序陷阱实录:①stale 关单是本批最大元特征——resolve 后 4 天无更新由机器人自动关闭,finished_at 普遍晚于真实修复时点(msm 批修复集中在 09-08~16 而关单在 09-17~18、slim#447 晚 22 天、bridge#41 晚 34 天),判据一律回 PR merged_at;②关单风暴簇按 PR/操作者聚合归因——09-18 13:39:56~13:40:00 机器人 4 秒连关 3+ 单、09-18 16:09~16:14 人工批量关单簇、mm 仓 09-20 上午 4 分钟连关两单;③「页面挂 merged PR」≠修复本单(msm 弃收例 #441:PR Related Issues 列了它但 Changes 与诉求无关;motor#631 页面挂的是修 #647 的后继 PR);④「官方评论说关联 PR 已合入」也可能失真(bridge#41:所指 PR 54 实为 closed);⑤resolved≠修复落地两例如实收录(mm#536、slim#446——修复 PR 未合但根因/方案已明确,具备排错价值)。
  • 诚实弃收:worker 层弃 13 条——msm #363(官方与创建人对齐「构造场景实际不存在」不采纳)、#441(改名诉求被否决,页面 PR 与诉求无关);mm #542(纯目录勘误并入 #520 行叙述)、#568(RFC 正文中断无落地);mc #1183(对 PR 4716 的代码检视意见单,内部流程单);slim #478(官方核验非问题)、#480(零修复证据);bridge #42(咨询无修复)、#55(官方明确不受理)、#76(环境类 workaround)、#84(修复 PR 136 至今 open,关单先于落地留观)、#85(评论无 PR 无解);motor #635(TTOT→TPOT 纯命名勘误,自带答案)。
  • 候选统计与余量:有效池 243 条本轮深析 63 条,余约 180 条已标记待后续增量篇——pytorch 精选(TypedStorage deepcopy dtype、inductor trace 耗时、310P set_device 0 卡占用等)、torchair 七连、memcache 七连、msinsight 六条、DrivingSDK 与 MindSpeed-LLM 日落通知系列。

接入昇腾知识图谱 https://gitcode.com/agent0/kg-tools

系列下一篇:增量池余量续采——pytorch 精选、torchair/memcache 小仓连档或指定仓专刊,欢迎留言点向。

Logo

作为“人工智能6S店”的官方数字引擎,为AI开发者与企业提供一个覆盖软硬件全栈、一站式门户。

更多推荐