登录社区云,与社区用户共同成长
邀请您加入社区
鲲鹏920 + 昇腾910B×6 本地部署 Qwen3.8-Flash-Next 完整实录:从显存账目一步步推演出为什么只能选 W8A8 + TP4,到 msmodelslim 量化转换的逐参数讲解、vllm-ascend 启动脚本每个 flag 的人话翻译,再到 MTP 加速开关验证、大海捞针针测和并发上限实测定律。附常见故障速查表与扩展路线(第5-6卡副实例 / 内存 prefix 池)。零基
B站预约链接:点击预约
8 月 23 日,北京中关村创业大街 12 号,二十支参赛队伍、六位专业评审、五个小时赛程 —— 金融行业应用 Agent 黑客松总决赛路演在此落下帷幕。金融或许是 AI 最难啃、也最值得啃的行业之一。这是昇腾(Ascend)携手 AtomGit AI 社区创办本次赛事的初衷,也是贯穿整个赛季的“考纲”。
昇腾算力适配不是装个驱动就完事。本文按真实项目节奏拆解完整流程:环境准备、模型迁移、算子适配、性能调优、验收交付,每阶段给关键动作与常见坑。
昇腾、鲲鹏、海光、沐曦这些国产芯片,纸面算力已经相当能打,但业务软件跑上去时问题才暴露:算法库不兼容、框架版本对不上、算子缺失、性能调优没人做。- 软件栈适配:操作系统、编译器、运行时、算法库(BLAS、FFT、OpenCV)在国产架构上重新构建或替换。- 团队有遥感影像处理在鲲鹏+昇腾架构上的实战适配经验(遥感影像超分算法适配实践,CSDN 可查)- 提供遥感算力、昇腾遥感算力、遥感智能解译平台
是面向生命科学领域、负责建设昇腾原生算子库的开源兴趣小组,算子仓为bio-ops-molecule。SIG聚焦多组学数据处理、生物分子模拟和生物基础模型训练等场景,通过高性能行业算子解决计算效率、显存占用和数据访存等底层性能瓶颈。面向高校学生同时启动5大赛区:京津冀东北赛区、上合赛区、西北赛区、西南赛区、杭厦赛区,荣誉证书 +秋招机考面试绿卡+丰厚奖金 欢迎广大学生报名参加!CANN社区新开发者首
AI Studio则为同算力级别的算力盒,通过Type-C(USB4)接口连接台式机或笔记本使用,深度适配DeepSeek-R1蒸馏模型,支持本地离线部署,适合已有主机的用户扩展AI推理能力。对于依赖特定CUDA生态的项目,迁移成本需要纳入考量。总体而言,香橙派这一系列产品的价值在于提供了覆盖多场景的国产化AI算力硬件选择,特别是在边缘部署需求上升和AI应用多样化的背景下,为开发者提供了从原型到部
摘要: CubeStudio是一款国产开源AI平台,支持传统机器学习、深度学习与大模型全流程,适配昇腾、寒武纪等国产算力及x86/ARM架构,提供多租户管理、分布式训练、大模型微调、推理服务等功能。平台标准化国产算力接入流程,覆盖驱动安装、容器运行时、K8s插件等八步操作,并支持ARM64部署。针对信创需求,提供昇腾、海光等七家国产卡的落地文档,支持异构算力统一调度。开源免费商用,已服务数千家企业
2026年8月3日,MiniMax新一代多模态生成模型MiniMax H3正式开源,在Artificial Analysis视频模型榜单中,视频编辑能力排名全球第一。作为MiniMax从“特化任务模型”迈向“通用多模态智能”的重要探索,H3不再以图片、视频、声音的生成、编辑和参考等单一任务为边界,而是在多模态上下文中统一理解创作意图,完成更加自然、连贯的生成与表达。
本文介绍了在鲲鹏920服务器(aarch64架构)和昇腾310P3 NPU卡上部署DeepSeek-R1-Distill-Qwen-1.5B大模型的两种方案。物理机部署需安装PyTorch 2.7.1、torch_npu插件、vLLM及vllm-ascend组件,通过指定参数启动服务。容器化部署推荐使用预置Docker镜像,需挂载NPU驱动和模型目录,并配置特权模式与设备映射。两种方案均提供了服务
本文档详细介绍了在鲲鹏920服务器(aarch64)上安装昇腾310P NPU驱动的完整流程。环境配置包括UOS V2500操作系统和CANN 8.3.RC2版本。主要内容包括:1)创建专用运行用户HwHiAiUser;2)通过yum更新源并安装Python依赖;3)校验并安装NPU驱动和固件包;4)系统重启后使用npu-smi验证驱动加载。文档还提供了三个常见错误的解决方案:内核开发包缺失、DK
GLM-5.2 KV Offload 系统优化实践Agent 赋能模型部署优化:Hy3 昇腾推理实践PyPTO 编程框架与 Agent 算子生成能力面向昇腾 950DT 的 DSpark 推理实现与性能优化Longcat 2.0:推理低时延优化SanaVideo 模型 NPU 单卡部署与性能优化实践。
从2019年昇腾910首次亮相到2026年WAIC上Atlas 950 SuperPoD真机登场,华为用七年时间走完了一条从追赶到重构的道路。达芬奇架构、Chiplet双Die方案、950系列PR/DT分型设计,每一步都不是简单的参数堆砌,而是对AI计算范式的重新定义。这不是一个关于追平的故事,而是一个关于系统重构的故事。
视频号、B站、昇腾社区多平台直播。
当大模型落地进入性能攻坚阶段,昇腾 NPU 推理、KV 缓存调度、MoE 异构部署、视频生成模型适配、自定义算子优化成为所有 AI 开发者绕不开的核心难题。为打通模型从论文到昇腾硬件落地全链路,落地杭州线下专场 Meetup,聚焦主流大模型、视频生成模型、Agent 智能体、DSA 架构的 CANN 深度优化实战,集结一线昇腾技术专家面对面拆解调优踩坑经验,专为杭州及周边 AI 算法、算子、部署工
全员可参与,体验昇腾950系列产品算力。9大任务上线,16W+奖金池开放!扫码参与活动报名,抢先了解任务详情。
GELU(Gaussian Error Linear Unit)激活函数因其平滑的梯度特性,在Transformer、BERT等现代深度学习模型中得到了广泛应用。在昇腾AI处理器的算子开发中,选择合适的编程模式对于平衡开发效率和运行性能至关重要。
本文介绍了针对昇腾NPU内存优化问题的系统化解决方案。文章首先分析了常见内存问题类型,随后从通用技巧、PyTorch环境变量配置、ATB算子优化等维度提供调优方法。重点介绍了msMemScope工具的内存拆解和低效内存识别功能,通过vLLM推理场景案例演示了如何标记关键模块(权重、KV Cache等)并分析内存占用。该工具支持全量内存事件采集,结合MindStudio Insight可视化分析,可
本文介绍了昇腾NPU算子开发中常见的同步指令问题及解决方案。同步指令未配对或冗余会导致精度异常、死锁等问题,传统排查方法耗时费力。MindStudio Sanitizer(msSanitizer)提供同步检测功能,通过真实运行环境采集指令信息并分析,快速定位异常代码位置。文章详细解析了同步指令原理及异常后果,并通过实际案例演示了配对检测和冗余检测两大功能的使用方法,展示如何通过三步操作(修改编译选
昇腾推出msModelSlim量化工具,适配月之暗面最新发布的2.8万亿参数Kimi K3模型。该工具采用逐层调度机制,支持单机完成超大模型量化,通过分层加载和资源释放显著降低显存需求。同时支持多卡并行加速,提供INT混合量化方案(路由专家W4A8、共享模块W8A8),并整合离群值抑制算法保障精度。工具实现一键量化,支持命令行操作,大幅降低部署门槛。目前已完成Kimi K3适配,未来将拓展更多量化
议题一:vLLM Ascend重塑资料易用性重塑资料易用性,打造极致“开箱即用”体验议题二:SGLang社区体验优化深度适配昇腾生态,上线从部署到调优的完整开发指南与实操案例,助力开发者快速上手、高效开发议题三:MindIE Motor简化模型部署简化大EP部署,对接多种推理引擎,提升推理服务性能和可靠性议题四:msModelslim大幅提升量化效率构筑4bit低精量化能力,支持量化自动调优
摘要: 华为昇腾技术专家团队推出Quantizer工具,解决模型量化精度调优的行业难题。该工具基于MindStudio Agent架构,采用Orchestrator-SubAgent协同模式,将复杂量化任务分解为模型适配、精度测评、方案优化三个自动化流程,通过自然语言交互实现"一句话启动调优"。以MiniMax-M2.7模型W8A8量化为例,Quantizer在5轮迭代中自动完成反量化、敏感层分析
Kimi K3模型作为大参数稀疏MoE模型,隐藏层高,专家数多,语言模块的计算量高、耗时大,即使对于短序列数据,训练时间也较长,成为大规模MoE模型训练性能瓶颈。模型基于KDA混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,原生支持视觉理解,并拥有100万token上下文窗口,在保持顶尖能力的同时,将KV Cache压缩
【昇腾CANN】视频号、B站、昇腾社区多平台直播。
模型集成多个融合算子,包括Recurrent KDA 与 Conv1D fn / update,Stable LatentMoE 采用 Combine 与 MXFP8 Dispatch 大EP算子,以及Gated MLA的KV Cache更新融合算子 与 FIA 算子,助力进一步性能优化。针对2.8T超大参数规模,支持Kimi K3原生MXFP4量化模式,路由专家直接使用模型原生的MXFP4权重与
昇腾算子编程专场
昇腾开源软件极客营,聚焦训练、推理、工具链、算子编译核心领域。特邀行业先锋与优秀开发者,分享昇腾开源软件创新成果,拆解一线落地实践案例,共探前沿技术趋势。7月9-12日,杭州西湖湖畔,诚邀您莅临现场深度交流,全天技术研讨+实操任务实战,沉浸式共建昇腾开源软件技术生态。
信创过渡期,纯GPU过不了考核、纯NPU迁移成本太高。数聚红芯HG8380G把英伟达GPU和昇腾NPU塞进同一台整机,提供第三条路。本文从混插技术挑战、信创采购逻辑、同类方案对比和选型确认清单四个维度做选型分析。
用社区贡献换昇腾算力的新玩法——提Issue、交PR、Star项目、参加赛事、学习课程……CANN社区新开发者基于使用CANN、体验代码仓或学习CANN课程,首次通过issue、pr、答题、社区互动或文章等方式反馈有价值意见、建议、需求、报错、成果等。密码学特别兴趣小组,旨在构建CANN生态的密码计算公共能力层,为昇腾NPU提供丰富的高性能密码算子与算法实现。让密码计算在昇腾上像AI计算一样高效、
昇腾算力环境专场
# HG9680 4U AI服务器:8卡昇腾910架构拆解与选型分析 8颗昇腾910 NPU、2.2 PFLOPS FP16算力、256GB HBM片上内存、8×200GE RoCE网络——这些参数
昇腾软件说 系列直播,带你先睹为快。最新版本、最新特性!这波优化,有你提的那条建议吗?这是你的主场,来验收,也来拍砖。
任务覆盖训练、推理、推荐、工具链、Triton 算子五大场景,未来,昇腾开源软件生态将持续展开极客营系列活动,通过多元化的社区交流与实战互动,构建“共建、共享、共成长”的开发者共同体。MindStudio是华为面向昇腾AI开发者提供的全流程工具链,致力于提供端到端的昇腾AI开发工具,覆盖从模型训练、调优到推理部署的完整链路,提供统一的调试工具、性能分析工具及算子开发工具,降低AI模型、算子开发门槛
昇腾(Ascend)是华为推出的人工智能处理器品牌,其系列产品包括昇腾910和昇腾310芯片等。
2026 年 Q2,RTX 5090 渠道价高出官方建议价 40%–80%,交期 3–6 个月起。本文从一家深圳 SaaS 公司的真实经历出发,拆解"先抢卡再装机"为什么在 2026 年行不通,提出翻转决策顺序——先定交付路线再定硬件配置,并给出 RTX 整机与昇腾信创两条路线的并行评估方法。附四条启动准备和常见决策问题。
优化模型训推算子性能:昇腾 AutoFuse 算子自动融合技术直播来袭当下生成式大模型、推荐模型和多模态模型等各类AI模型迭代速度持续加快,在线下训练、线上推理全场景中,普遍存在共通的性能短板,主要分为三点:1.:计算图中分布着大量算子,单次开销不一定很大,累积起来却不容忽视;2.:同一模型不同版本的数据流链路、算子排布持续变化,依靠固化规则的传统融合方案难以全覆盖;3.:各类网络结构、动态张量尺
数聚红芯是一家专注AI智算的企业级硬件厂商,提供覆盖GPU服务器、信创一体机等全链路算力方案。其产品矩阵针对企业AI部署三大矛盾:大模型需求与机房限制、信创合规与CUDA生态熟悉度、预算有限与过度设计。重点推荐HG8480TS多卡GPU服务器(支持8-10张GPU,适配大模型推理/RAG等场景)和HI5228昇腾AI一体机(全栈国产化方案)。数聚红芯的核心价值在于:1)覆盖主流算力路线;2)整机交
信创合规:鲲鹏920S+昇腾/国产OS全链路国产化,满足政企信创要求性能强劲:8卡5090方案吞吐量达374 tokens/s,TTFT低至0.437秒液冷静音:55dB噪音,PUE<1.2,设备寿命延长20%极致TCO:五年总成本降低44%,相比传统云方案性价比显著开箱即用:预装系统与模型,支持本地化部署,数据安全有保障全场景覆盖:从政务办公到科研计算,从AI推理到智能交通在国产算力崛起的浪潮中
【CANN新手村任务】CANN社区新开发者基于使用CANN、体验代码仓或学习CANN课程,首次通过issue、pr、答题、社区互动或文章等方式反馈有价值意见、建议、需求、报错、成果等。SIG 面向机器人操作、运动控制与导航开发者,VLA、世界模型及 3D 视觉研究者,CANN 模型训练与部署开发者,以及高校实验室和机器人企业,围绕昇腾平台建设开放易用、可复现、可迁移的具身智能应用生态。成员单位:南
一直对昇腾矩阵乘法的A,B和C矩阵的各类数据格式很好奇,到底这样设置为什么会对性能有较大的提升?
7月17日,昇腾950超节点真机首次公开亮相,成为2026世界人工智能大会(WAIC)备受瞩目的焦点。业界最大规模超节点 Atlas 950 SuperPoD ,面向大规模数据中心建设、万亿级大模型训练与中心高并发推理场景算力需求,凭借“超大带宽、超低时延、统一内存编址”三大核心优势,筑牢Agentic AI时代新一代标杆算力底座。
昇腾C++代码是显式管理数据搬运和流水线的,而CUDA代码更像是为每个线程独立编写逻辑,硬件自动完成并行。
摘要:本文分析了昇腾AI处理器两种通信路径——SDMA(卡间HCCS总线)和RDMA(跨机RoCE网络)的数据传输机制。SDMA路径通过HcclD2DMemcpyAsync实现HBM间直接异步传输,不经过AICore;RDMA路径则通过RoCE网卡DMA引擎直接读写注册的HBM物理地址,全程规避CPU参与。对比OpBase和Zcopy两种模式,前者需userIn到cclIn的拷贝但内存要求宽松,后
看到这里,估计大家都明白了:GitCode Notebook 本质上是华为版的 Google Colab,是华为为了推广昇腾 NPU 生态而投入的免费算力资源。写本文的时候,个人额度还有 1000 核时/月。如果选 4 核 CPU 配置,相当于每月 250 小时——考虑到一天只有 24 小时——这个额度对个人开发者来说绝对是够够的了。当然,免费资源也有它的局限:单次 2 小时、单卡、阉割版显存、临
四张Ascend 910B4上部署Qwopus3.6-27B-Coder模型并通过vLLM-Ascend框架接入Claude Code的实践过程
只是存在合并冲突的状态,但自己部署使用是没有问题的。目标:910B4 × 2 上把 Gemma 4 31B 跑起来,多模态可用。所有代码、镜像、补丁都已开源,跟着下面的步骤走就能复现。