登录社区云,与社区用户共同成长
邀请您加入社区
开源贡献的门槛,从来都不在技术深度,而在 流程经验。看文档、逛论坛、加群潜水,这些动作对开发者来说都不难。难的是真正动手那一刻。而流程经验,恰恰是最没法靠“看”学会的——你必须 跑一遍。能不能把“贡献 CANN”这件事,从一句口号,变成一次当场上手的实操?
目录 信创 AI 算力替换怎么落地?昇腾部署大模型的适配成本与整机选型 先说结论 一、为什么信创 AI 算力绕不开昇腾 二、昇腾适配的「真实账」 三、信创选型,看三件事 四、按需求给两档选型参考 五、写在最后 信创 AI 算力替换怎么落地?昇腾部署大模型的适配成本与整机选型 面向政务、金融、央企等有
B站预约链接:点击预约
昇腾算力适配不是装个驱动就完事。本文按真实项目节奏拆解完整流程:环境准备、模型迁移、算子适配、性能调优、验收交付,每阶段给关键动作与常见坑。
是面向生命科学领域、负责建设昇腾原生算子库的开源兴趣小组,算子仓为bio-ops-molecule。SIG聚焦多组学数据处理、生物分子模拟和生物基础模型训练等场景,通过高性能行业算子解决计算效率、显存占用和数据访存等底层性能瓶颈。面向高校学生同时启动5大赛区:京津冀东北赛区、上合赛区、西北赛区、西南赛区、杭厦赛区,荣誉证书 +秋招机考面试绿卡+丰厚奖金 欢迎广大学生报名参加!CANN社区新开发者首
本文档详细介绍了在鲲鹏920服务器(aarch64)上安装昇腾310P NPU驱动的完整流程。环境配置包括UOS V2500操作系统和CANN 8.3.RC2版本。主要内容包括:1)创建专用运行用户HwHiAiUser;2)通过yum更新源并安装Python依赖;3)校验并安装NPU驱动和固件包;4)系统重启后使用npu-smi验证驱动加载。文档还提供了三个常见错误的解决方案:内核开发包缺失、DK
GLM-5.2 KV Offload 系统优化实践Agent 赋能模型部署优化:Hy3 昇腾推理实践PyPTO 编程框架与 Agent 算子生成能力面向昇腾 950DT 的 DSpark 推理实现与性能优化Longcat 2.0:推理低时延优化SanaVideo 模型 NPU 单卡部署与性能优化实践。
当大模型落地进入性能攻坚阶段,昇腾 NPU 推理、KV 缓存调度、MoE 异构部署、视频生成模型适配、自定义算子优化成为所有 AI 开发者绕不开的核心难题。为打通模型从论文到昇腾硬件落地全链路,落地杭州线下专场 Meetup,聚焦主流大模型、视频生成模型、Agent 智能体、DSA 架构的 CANN 深度优化实战,集结一线昇腾技术专家面对面拆解调优踩坑经验,专为杭州及周边 AI 算法、算子、部署工
全员可参与,体验昇腾950系列产品算力。9大任务上线,16W+奖金池开放!扫码参与活动报名,抢先了解任务详情。
模型集成多个融合算子,包括Recurrent KDA 与 Conv1D fn / update,Stable LatentMoE 采用 Combine 与 MXFP8 Dispatch 大EP算子,以及Gated MLA的KV Cache更新融合算子 与 FIA 算子,助力进一步性能优化。针对2.8T超大参数规模,支持Kimi K3原生MXFP4量化模式,路由专家直接使用模型原生的MXFP4权重与
昇腾算子编程专场
用社区贡献换昇腾算力的新玩法——提Issue、交PR、Star项目、参加赛事、学习课程……CANN社区新开发者基于使用CANN、体验代码仓或学习CANN课程,首次通过issue、pr、答题、社区互动或文章等方式反馈有价值意见、建议、需求、报错、成果等。密码学特别兴趣小组,旨在构建CANN生态的密码计算公共能力层,为昇腾NPU提供丰富的高性能密码算子与算法实现。让密码计算在昇腾上像AI计算一样高效、
昇腾算力环境专场
昇腾软件说 系列直播,带你先睹为快。最新版本、最新特性!这波优化,有你提的那条建议吗?这是你的主场,来验收,也来拍砖。
优化模型训推算子性能:昇腾 AutoFuse 算子自动融合技术直播来袭当下生成式大模型、推荐模型和多模态模型等各类AI模型迭代速度持续加快,在线下训练、线上推理全场景中,普遍存在共通的性能短板,主要分为三点:1.:计算图中分布着大量算子,单次开销不一定很大,累积起来却不容忽视;2.:同一模型不同版本的数据流链路、算子排布持续变化,依靠固化规则的传统融合方案难以全覆盖;3.:各类网络结构、动态张量尺
【CANN新手村任务】CANN社区新开发者基于使用CANN、体验代码仓或学习CANN课程,首次通过issue、pr、答题、社区互动或文章等方式反馈有价值意见、建议、需求、报错、成果等。SIG 面向机器人操作、运动控制与导航开发者,VLA、世界模型及 3D 视觉研究者,CANN 模型训练与部署开发者,以及高校实验室和机器人企业,围绕昇腾平台建设开放易用、可复现、可迁移的具身智能应用生态。成员单位:南
摘要:2026年AI芯片竞争格局与技术维度分析 2026年AI芯片战场围绕四个关键维度展开激烈竞争:计算单元、显存带宽、芯片互联和软件生态。NVIDIA的Blackwell架构采用空间阵列设计,专注AI计算而弱化科学计算;AMD的MI350X减少计算单元但大幅提升显存容量,反映大模型推理向显存倾斜的趋势;华为的Da Vinci Cube采用独特立方体设计,但封装互联损耗较高。显存带宽成为大模型推理
本文介绍了如何利用昇腾CANN提供的CANNBot工具和Claude Code AI助手简化Ascend C算子开发。CANNBot通过Skills机制注入领域知识,使AI能提供专业指导;Claude Code则通过自然语言交互理解开发者需求。两者配合可自动完成项目搭建、代码生成和测试验证。文章以开发Add算子为例,展示了从环境准备、需求提出到核函数实现的完整流程,特别说明了在没有NPU硬件时使用
大模型在昇腾AI平台上训练部署时面临Host-Device协同效率低、算子性能下滑、通信延迟大、模型下发慢等问题。传统调优工具(如MindStudio的msProf、msprof-analyze等)虽强大,但使用门槛高,涉及多维度综合分析。MindStudio团队自研msAgent,提供一站式性能分析解决方案。一、背景随着人工智能模型规模的不断扩大及应用场景的日益复杂,在昇腾AI计算平台上进行训练
授课团队课程兼顾大模型基础原理、轻量化微调前沿技术与昇腾算力工程落地实践,以 Qwen3 系列模型为实操载体讲解核心技术,同步指导学员完成训练调参、Loss 与超参监控、多组实验对比等标准化科研流程,并依托昇腾 NPU 硬件、CANN 一站式开发平台开展 Ascend C 开发与 CANNBot 智能体实践,让全体学员完整完成算子开发、NPU 编译加速、大模型微调三大工程案例,亲手实践自主算力软硬
本课程将介绍在DeepSeek-V4网络上如何基于TorchTitan-NPU框架攻克超长文本训练瓶颈、实现512K级别长序列的大规模续训练,怎样结合大EP+FSDP以及torch.compile+AutoFuse编译入图方案达成极致训练吞吐性能的实践经验,分享如何帮助昇腾大模型开发者在超长上下文场景下快速开展 CPT/SFT算法验证并实现开箱即优。
本课程将介绍在DeepSeek V4网络上如何实现网络精度无损的低bit量化,怎样结合昇腾软硬件特性达成网络极致部署性能的实践经验,分享如何在实际量化模型部署中平衡精度损失与推理加速。
AI 大模型的浪潮已经从“技术探索”全面迈入“场景落地”的新阶段。作为连接大模型与现实世界的关键桥梁,正在重塑千行百业的生产力。面对广阔的行业应用前景,开发者们也面临着真实的痛点:底层算力如何高效调用?模型适配如何更加平滑?从代码开发到行业落地的“最后一公里”究竟该怎么走?,由联合主办的将在上海重磅开启!无论你是深耕算法的极客,还是苦苦寻找解决方案的行业专家,这场干货满满的线下聚会都不容错过!
昇腾体验信箱——资料“捉虫”活动启动了!
📚 HCCL入门系列课程一览第一课:HCCL通信库软件架构介绍 - 6月15号16:00第二课:HCCL通信库算子开发介绍 - 6月16号16:00第三课:HCCL北极星平台使用介绍 - 6月17号16:00三期课程将陆续更新~📖前置学习推荐入门开发者建议优先学习【技术文章】中的《HCCL—昇腾高性能集合通信库简介》《深度学习的分布式训练与集合通信(一)》《深度学习的分布式训练与集合通信(二)
【昇腾CANN】视频号、B站、昇腾社区多平台直播,扫码观看直播,参与直播答题互动赢定制T恤、毛毯!
摘要:神经网络依赖激活函数引入非线性,使多层网络能逼近任意函数。Transformer时代GELU/SiLU取代ReLU成为主流激活函数,其核心优势在于保留负值信息避免神经元死亡。昇腾NPU通过Vector Unit执行激活函数,但性能瓶颈在于数据搬运而非计算。ops-nn采用算子融合技术将激活函数与前后算子合并,减少中间数据搬运次数,实测可降低31%延迟。研究表明,激活函数对推理速度的影响主要来