logo 人工智能6S服务平台

人工智能6S服务平台
首页Token服务
展示(Show)
销售(Sale)
培训(School)
社群(Social)
解决方案(Solution)
创业孵化(Startup)
去全站搜索看看?

登录社区云

登录社区云,与社区用户共同成长

人工智能6S服务平台

邀请您加入社区

欢迎加入社区

欢迎加入社区

batch
  • NumPy 的 np.dot 为什么跑不快?ops-blas 高性能矩阵乘深度解读

    摘要:NumPy和PyTorch的矩阵乘法在CPU上运行缓慢,而昇腾NPU的ops-blas库通过优化矩阵乘法的分块策略和硬件适配,性能可提升50-100倍。ops-blas专注于BLAS规范的L3层矩阵乘法(GEMM),利用NPU的Cube单元和片上缓存实现高效计算。相比通用模板库catlass,ops-blas提供开箱即用的高性能GEMM实现,接近手写优化代码的性能,但使用更简单。实测显示,在

    emo_dou
    2026-05-23 10:05:36
     399 
     9 
    #transformer#android#深度学习 +1
  • 30 分钟跑通你的第一个昇腾算子:cann-learning-hub NoteBook 在线实战

    摘要:昇腾CANN社区的cann-learning-hub提供在线NoteBook功能,无需本地配置即可在真实昇腾NPU上运行代码。用户通过浏览器即可体验AscendC算子开发,包括矢量加法、性能测试和算子修改等实操环节。该平台预置最新CANN环境,避免了驱动版本、编译器版本等配置问题,特别适合初学者快速入门。教程涵盖从基础算子到矩阵运算的开发路径,并提供cann-samples示例库参考。在线环

    emo_dou
    2026-05-22 19:07:18
     455 
     7 
    #transformer#android#深度学习 +1
没有更多了
回到
顶部
logo 提供社区服务与技术支持
logo 提供社区服务与技术支持
©1999-2023北京创新乐知网络技术有限公司 京ICP备19004658号