登录社区云,与社区用户共同成长
邀请您加入社区
状态建模核心主页面实现数据库持久化模块清单文件路径说明数据模型SupplyItem/InventoryRecord/PurchaseRequest主页面完整UI数据库关系型存储详情弹窗物资详情出入库弹窗扫码/拍照/登记采购弹窗多级审批预警面板预警列表鸿蒙特性使用特性用途APIArkTS声明式UI界面构建状态管理数据响应关系型数据库本地加密存储
文章摘要: 《龍魂蚁群架构视觉·专项技术解析》提出"镜像视界"概念,通过物理视界(传感器实时采集)与数字孪生(零断点复制、全时空同步)的无缝切换,实现动态目标的跨镜追踪与智能调度。其核心技术包括:1)零断点跨镜接力,利用镜像预测填补传统3-5秒的断点丢失;2)蚁群分布式协同,通过侦察蚁(边缘检测)、通信蚁(数据同步)、预测蚁(轨迹填补)等节点分工,结合鲲鹏/昇腾算力实现实时预测与调度。技术架构采用
2024年双11,京东“京小智”智能客服系统累计服务超过42亿人次。在每一次复杂的用户咨询背后,并非一个巨型呼叫中心,而是一支由客服、导购、跟单、分析、质检五个专业智能体组成的虚拟团队。当用户说出“手机还没收到又降价了”,物流专家、政策专家、情绪安抚三个智能体同时被唤醒,各自查询、计算、准备话术,最终由协调员合成一条完整回复。
昇腾NPU矩阵乘白盒化组装实践 昇腾CANN通过catlass模板库实现矩阵乘算子的白盒化组装,开发者可精细控制计算流程。关键点包括: Tile配置:需平衡寄存器压力与并行度,K维度必须16字节对齐(如128x128x32) Epilogue融合:支持激活函数与Bias加法等后处理,以计算换带宽 性能调优:从基准Tile(128x128x32)起步,大矩阵可尝试256x128x64 注意事项:Ep
你有没有遇到过这种情况:做信号处理,用NumPy的FFT算个1024点变换,要算半天。后来发现昇腾CANN有个ops-fft库,专门加速FFT计算,同样的计算在NPU上只要几毫秒。这篇文章就来讲讲FFT是啥、为啥要优化、怎么用ops-fft库。
之前做科学计算,最头疼的就是大矩阵乘法。用NumPy在CPU上跑,一个1024×1024的矩阵乘就要200ms。后来发现ops-blas这个库,专门优化线性代数计算,同样的计算在昇腾NPU上只要15ms。这篇文章就来讲讲这个库的使用方法。
ops-blas是昇腾CANN社区的高性能线性代数算子库,核心价值是把GEMM在昇腾NPU上的性能推向理论峰值——算力利用率从38%提升到85%,带宽利用率从45%提升到92%,比PyTorch默认实现快3倍。核心优化技术合理分块:针对Cube Core特性选择最优分块大小(256×128×16),算力利用率提升2.2倍:数据搬运和计算重叠,带宽利用率提升2.0倍算子融合:GEMM和ReLU/Ba
本文介绍了专为昇腾NPU设计的矩阵乘算子模板库catlass,其核心定位是为昇腾CANN提供高性能矩阵乘算子模板,支持TLA/MLA/FlashAttention等优化方案。catlass采用分层抽象设计,将算子拆分为Epilogue、Kernel、Tensor Operator和Device四层,支持白盒化组装和硬件特化。重点介绍了三种核心模板:TLA模板优化张量分块策略,MLA模板实现多头并行
本文探讨了GEMM(通用矩阵乘法)在深度学习中的核心地位及其优化策略。通过将cuBLAS迁移至ops-blas+Ascend 910平台,实现了10^12次矩阵乘法计算从超过24小时缩短到18小时完成,硬件成本降低30%。文章重点分析了ops-blas实现92%理论峰值利用率的三项关键技术:Tiling策略将大矩阵分块计算、双缓冲机制实现计算与数据搬运并行、L0 Cache优化提升数据复用率。性能
ops-nn 的 MatMul 融合算子通过三项核心技术实现。
摘要:矩阵乘法在昇腾NPU上需要精细优化才能发挥Cube单元性能,传统手写方式需200-300行AscendC代码。catlass模板库通过三层抽象设计(TLA逻辑层、MLA映射层、PLA物理层)实现高性能矩阵乘的快速开发,代码量减少80%且性能接近手写。与CUTLASS不同,catlass专为昇腾达芬奇架构定制,利用硬件流水特性实现计算与搬运重叠。该模板库适用于99%的矩阵乘场景,显著提升开发效
想象一下,你是一个乐高积木工厂的设计师。你的任务不是为每个孩子造一个成品城堡,而是设计一套"基础砖块+连接件+装饰件"的组合系统——孩子们可以用这套系统拼出他们想要的任何东西。catlass 就是昇腾矩阵乘算子的"乐高工厂"
写给前端的 CANN-ops-blas:昇腾线性代数算子库到底是啥?
在深度学习领域,矩阵乘法(MatMul)是最基础、也是最关键的操作之一。无论是 Transformer 的注意力机制、传统的全连接网络,还是卷积操作的底层实现,都绕不开高性能的矩阵运算。在昇腾 NPU 上开发一个高效 MatMul 算子并不是简单地把数学公式翻译成代码,而是要充分理解计算密度、内存带宽、硬件单元以及数据流调度等多维因素。