登录社区云,与社区用户共同成长
邀请您加入社区
谷歌浏览器下载安装教程chrome浏览器官方下载离线安装包鸿蒙安卓mac苹果win电脑纯净版
某团队在昇腾NPU上跑Mistral-7B,发现FlashAttention跑起来比Llama-2-7B慢很多。他们用的代码是一样的,都是,但速度就是不一样。后来发现,原因出在注意力机制的类型不同。Llama-2-7B用的是MHA(Multi-Head Attention),Mistral-7B用的是GQA(Group-Query Attention)。GQA的KV头颅数比Q头颅数少很多,Flas
本文分析了昇腾NPU的三级存储架构及其内存管理策略。NPU采用HBM、L2 Cache和L1 Cache三级存储体系,各级在容量、带宽和延迟上差异显著。数据搬运开销往往超过计算开销,因此需要优化内存管理。文章比较了静态分配和动态分配的优缺点,并详细介绍了内存池化技术,包括预分配策略、分配/释放机制以及碎片合并方法。内存池通过预分配大块内存、复用空闲块和合并相邻块来提升内存利用率,适用于需要确定性延
本文介绍了如何利用昇腾NPU的算子模板库catlass快速实现自定义稀疏矩阵乘法算子。作者通过实际案例展示了从环境准备到算子开发的完整流程,重点解析了catlass的核心组件:计算核(ComputeUnit)、分块策略(Tile)和流水线编排(Pipeline)。文章详细说明了如何扩展标准GEMM算子,加入mask处理逻辑实现稀疏计算,并提供了关键的性能优化建议,如mask数据的预取策略。相比传统
欢迎加入开源鸿蒙跨平台社区:https://openharmonycrossplatform.csdn.net在适配 OpenHarmony 之前,先看看 Android 端是怎么做的。Android 用打开认证页面,用接收回调。这套方案是 OpenHarmony 适配的主要参照物——很多设计决策都是从 Android 映射过来的。:共享 Cookie、安全沙箱、用户信任度高:通过 Intent