登录社区云,与社区用户共同成长
邀请您加入社区
摘要 昇腾 CANN 推出的 ATB(Ascend Transformer Boost)加速库专为 Transformer 算子优化设计,通过算子融合、内存调度等底层优化提升计算效率。ATB 位于 CANN 软件栈中间层,提供高性能算子实现,覆盖 Multi-Head Attention、LayerNorm、RoPE 等核心模块,相比传统 PyTorch 实现减少 40%-70% 执行时间。其特点
在技术层面,M-Robots社区正在解决机器人产业长期存在的底层依赖问题。6月26日,M-Robots开源社区在2026开放原子开源生态大会上正式启动运营,并同期发布了技术架构、治理体系与年度运营计划,标志着国内首个基于开源鸿蒙的机器人全栈操作系统开源社区从“宣告成立”进入“启动运营”阶段。论坛期间,德壹医疗、DORA社区、地瓜机器人、幻尔科技、进迭时空等生态伙伴展示了AI理疗机器人、双臂具身智能
ascend-transformer-boost(ATB)是昇腾CANN生态中面向大模型推理场景的核心加速库,运行在昇腾NPU之上,为Transformer架构的推理流程提供了动态批处理、投机解码和KV缓存复用三项关键能力。大模型推理的瓶颈并不单一:请求的输入长度参差不齐会导致GPU/NPU计算资源的闲置,自回归解码的逐token生成特性限制了单请求吞吐,而重复计算的KV缓存则浪费了宝贵的显存带宽
FlashAttention 在昇腾 NPU 上的工程实践 摘要:本文详细介绍了在华为昇腾 NPU 上部署和优化 FlashAttention 算子的全流程实践。通过分析 ops-transformer 仓库的实现架构,阐述了 FlashAttention 三个版本(v1/v2/v3)的核心差异及适用场景,并针对不同昇腾硬件(910/910B/910C)的特性给出了优化建议。文章重点讲解了编译环境
本文以 Ankh3-large 模型为例,介绍了在模型迁移到昇腾平台后训练过程中遇到的 Loss 未能严格对齐的问题分析及解决方法。通过系统性的排查与优化,最终将 Loss 误差控制在合理范围内,并为类似场景下的精度对齐工作提供参考。硬件:Atlas 800T A2组件版本信息本次精度问题排查表明,由于硬件架构差异,NPU 与 GPU 在训练中存在合理范围内的计算误差。通过严格对齐数据预处理、模型
摘要:电力调度中心需要高效预测全网1000+变电站未来24小时负荷数据。传统LSTM方法存在2分钟延迟问题,无法满足实时调度需求。本项目使用NPU加速的时序Transformer模型(Informer)实现并行预测,关键创新包括:1)ProbSparse注意力机制将复杂度从O(L²)降至O(L logL),通过采样top-u重要query;2)利用NPU的Cube矩阵乘并行计算自注意力;3)100
昇腾应用开发“万能钥匙”——AscendCL快速上手与实战指南
某团队在昇腾NPU上跑Mistral-7B,发现FlashAttention跑起来比Llama-2-7B慢很多。他们用的代码是一样的,都是,但速度就是不一样。后来发现,原因出在注意力机制的类型不同。Llama-2-7B用的是MHA(Multi-Head Attention),Mistral-7B用的是GQA(Group-Query Attention)。GQA的KV头颅数比Q头颅数少很多,Flas
SwiGLU融合算子通过将矩阵乘、SiLU激活和逐元素乘法合并为单一算子,大幅减少HBM内存读写次数。昇腾CANN的ops-transformer实现表明,融合后SwiGLU的延迟降低2.1倍,端到端推理吞吐提升1.7倍。关键优化在于中间结果保留在SRAM而非HBM,避免了3次显存访问,尤其对大batch场景显存占用减少显著。实测LLaMA-2-7B在Atlas A2上,融合+SwiGLU使吞吐达
摘要 本文深入解析了Transformer架构中的旋转位置编码(RoPE)技术及其在昇腾NPU上的优化实现。文章首先揭示了Transformer的"排列不变性"问题,指出传统位置编码方法的局限性。随后详细介绍了RoPE的核心原理——通过旋转矩阵将位置信息融入查询和键向量,使其具备远程衰减、线性偏置和可外推三大优势。最后,文章探讨了昇腾CANN框架中ops-transformer仓库对RoPE的优化
这篇文章探讨了昇腾NPU在多机训练中的通信效率优化问题。主要内容包括: 多机训练瓶颈分析:指出通信(特别是AllReduce)在8卡训练中可能占用10-30%的时间,成为主要瓶颈。 HCCL通信原语详解:介绍了AllReduce、AllGather和Broadcast三种核心通信操作及其在PyTorch中的实现方式。 网络拓扑影响:比较了Ring、Tree、DragonFly等不同拓扑结构的性能特
昇腾Transformer加速库ATB深度解析——从算子拼接到图编排的架构跃迁
:昇腾NPU算子层性能突围——DeepSeek推理优化实战与ops-transformer深度解析
摘要 昇腾CANN的MC2技术通过存储-计算-通信融合优化大规模Transformer训练性能。传统Ring AllReduce存在通信与计算串行执行的瓶颈,导致NPU利用率不足。MC2采用算子内融合、流水并行和内存复用三种方式,将通信与计算边界模糊化。具体实现包括AllGather+MatMul等融合算子,通过异步通信与计算重叠,显著提升硬件利用率。实验表明,MC2技术可有效解决分布式训练中的通
信号处理核心算法:FIR滤波的NPU优化实现 摘要: 本文介绍了NPU上FIR滤波的两种高效实现方法。直接卷积法适用于短滤波器(M≤128),利用256个并行lane实现O(N×M)的滑动窗口计算,通过warp reduce快速归约。FFT卷积法则针对长滤波器(M>128),将时域卷积转为频域乘法,复杂度降为O(N log N)。系统采用自适应路由策略,根据滤波器阶数M和信号长度N自动选择最优算法
文章摘要: RMSNorm相比LayerNorm实现了显著优化,通过省略均值减法步骤,节省30%计算量且保持同等训练效果。其核心公式仅保留除RMS操作,简化了计算流程。技术实现上采用256 lanes协作完成向量化计算和Warp Reduce优化,通过butterfly reduction在16 cycles内完成归约。性能测试显示RMSNorm前向和反向计算分别比LayerNorm快1.6倍,显
矩阵乘法优化策略选择对Transformer性能至关重要 摘要:矩阵乘法占据Transformer训练95%的算力消耗。针对不同尺寸的GEMM运算,ops-blas采用三种优化路径:Micro-Tiling(小矩阵)、Warp-Tiling(中等矩阵)和Block-Tiling(大矩阵)。选择错误的策略会导致显著性能损失,如在大矩阵上使用Micro-Tiling会造成47%的L1 miss率和60