登录社区云,与社区用户共同成长
邀请您加入社区
你有没有遇到过这种情况:做信号处理,用NumPy的FFT算个1024点变换,要算半天。后来发现昇腾CANN有个ops-fft库,专门加速FFT计算,同样的计算在NPU上只要几毫秒。这篇文章就来讲讲FFT是啥、为啥要优化、怎么用ops-fft库。
本文介绍了如何在昇腾NPU上使用hcomm库进行分布式训练/推理中的集合通信操作。hcomm是基于HCCL集合通信库的原语级优化接口,位于CANN架构的第四层。文章详细说明了环境准备步骤,包括安装昇腾NPU驱动、CANN Toolkit和hcomm Python包。通过示例代码演示了如何初始化hcomm上下文,以及执行AllReduce、AllGather和ReduceScatter三种基本集合通
摘要:metadef是CANN生态中定义算子元数据的核心机制,为每个算子提供"身份证",包含算子名称、输入输出类型、属性等描述信息。文章通过类比餐厅菜单解释metadef的作用,详细介绍了其三大组成部分:算子原型(OpProto)定义算子接口、算子注册(REGISTER_OP)实现全局注册、推导函数(InferShape/InferDataType)完成输出推导。最后以MatMulRelu算子为例
之前有个项目用的是TensorFlow 1.x的代码,想迁到昇腾NPU上跑。发现CANN有TensorFlow的适配层,改几行代码就能用上NPU。这篇文章就来讲讲这个适配层的实现原理和使用方法。
去年做一个科学计算项目,需要大量三角函数和指数运算。用PyTorch原生算子在昇腾NPU上跑得特别慢。后来发现ops-math这个库,专门为数学类算子做了优化,性能直接提升了3倍。这篇文章就来讲讲这个库的使用方法。
本文介绍了TensorFlow框架适配昇腾NPU的技术实现方案。适配层主要由三个核心模块组成: op_kernel注册模块:通过为每个CANN支持的算子编写OpKernel实现,将TF算子映射到CANN算子库。与PyTorch的dispatcher机制不同,TensorFlow需要显式注册每个算子。 graph_rewrite模块:通过自定义图优化Pass实现算子融合,将连续算子组合成CANN融合
在人工智能加速器的开发实践中,算子(Operator)是连接高层框架与底层硬件的关键纽带。华为昇腾AI处理器通过CANN(Compute Architecture for Neural Networks)提供了高性能算子开发框架,使开发者能够将主流深度学习框架如TensorFlow的算子映射到硬件上执行,从而充分发挥昇腾AI算力。本篇文章将从算子开发流程、框架适配、插件开发到测试验证,系统解析CA
昇腾硬件支持多 Device(AI 加速卡)协同计算,通过 PCIe 或 RDMA 高速互联,实现 Device 间数据通信与任务调度。以 Batch 拆分策略为例,实现多 Device 协同的动态 Shape Add 算子,输入 Batch 维度支持动态调整,多 Device 并行处理不同 Batch 分片。确保各 Device 的任务量尽可能均衡,避免部分 Device 过载而部分 Devic