登录社区云,与社区用户共同成长
邀请您加入社区
你可能会想:CPU 里也有乘法单元,为什么训练芯片要专门排一个二维阵列?答案在并行度和数据复用。同一个数据可以被反复使用。算 A×B 时,A 的每一行要和 B 的每一列相乘,一个数据会被用到几十次、几百次。二维阵列的妙处,就是让数据"横向流、纵向流":权重从一侧流入,激活值从另一侧流入,每个交叉点上的计算单元同时做乘加。这样,几千个单元可以同时工作,而不是像 CPU 那样一个接一个地算。这里的关键
上图展示有点问题,实际一个Node的Level1里是一个交换芯片的7个虚拟平面,不是7个交换芯片。UB交换芯片Level1使用量0.392*2/2*8*2=6.272 Tb/s, Level2 交换芯片使用量0.056/2*8*48=10.752Tb/s,芯片性能对标博通TH3.B300出1.8TB双向带宽,Nvswitch单芯片容量28.8Tb,整机57.6Tb(性能对标博通TH5),交换芯片容
本文记录了从Arduino转向ESP-IDF开发ESP32-S3 N16R8的全过程,重点解决硬件适配问题。通过浏览器烧录小智AI固件后,因TFT屏幕引脚不兼容转向VS Code+ESP-IDF开发环境搭建。
# HG9680 4U AI服务器:8卡昇腾910架构拆解与选型分析 8颗昇腾910 NPU、2.2 PFLOPS FP16算力、256GB HBM片上内存、8×200GE RoCE网络——这些参数
昇腾NPU精度调优指南:基于达芬奇架构的FP32/FP16/BF16/INT8多精度计算优化 摘要:本文针对昇腾NPU(910/310系列)在深度学习训练和推理中的精度问题,系统解析了达芬奇架构下的多精度计算特性(FP32/FP16/BF16/INT8)及误差来源,包括硬件浮点特性差异、算子实现偏差和混合精度策略缺陷。提出了五大调优方法:1)O2级自动混合精度+动态Loss Scale训练策略;2
摘要:本文探讨了AscendC与Triton的集成如何通过通用编程模型降低AI专用硬件开发门槛。文章详细解析了昇腾硬件架构特性,包括3DCube计算单元和5级缓存体系,并阐述了Triton编译器将Python代码转换为高效AscendC算子的优化流程。通过Matmul实现案例展示了优化后性能可达理论峰值的78%,较基础版本提升2.6倍。文章还介绍了动态形状自适应、混合精度计算等高级优化技巧,以及故
本文深入探讨昇腾AI处理器达芬奇架构与Triton编程模型的高效融合机制。重点解析Cube/Vector/Scalar三级计算单元的特性和内存层次结构优化策略,通过完整的矩阵乘法和卷积算子实战,展示如何充分发挥硬件潜力。文章包含大量性能对比数据和优化案例,为开发者提供从理论到实践的完整指南。基于大量实战经验,总结出昇腾硬件优化的黄金法则🎯 计算单元匹配:根据计算类型选择最优的计算单元🚀 内存层