登录社区云,与社区用户共同成长
邀请您加入社区
昇思 MindSpore 对 ONNX 提供双向迁移能力:既支持将 MindSpore 模型导出为 ONNX 格式用于跨框架部署,也支持将第三方 ONNX 模型(如 PyTorch/TensorFlow)迁移至 MindSpore,依托MindConverter、export 接口、ONNX Runtime 校验构建全链路工具链,保障转换精度与性能,是大模型跨框架迁移、昇腾部署的核心流程。
Flux 作为高性能文生图模型,结合 GRPO(Group Relative Policy Optimization)强化学习可显著提升生成质量与美学一致性。昇腾平台迁移需解决算子不兼容、数据类型限制、显存瓶颈、通信适配、精度漂移五大核心问题,基于 DanceGRPO 框架实现 Flux 的 NPU 全链路训练,最终性能达 GPU 的 90%+,奖励值误差 < 0.02%,为多模态生成强化学习提供
MindSpore 加速库层兼容核心是通过统一适配接口、分层桥接架构、算子自动映射,实现与 MindSpeed、CANN、vLLM 等昇腾及开源加速库的无缝对接,解决框架与加速库的异构适配问题,让大模型训推在昇腾 NPU 上兼顾兼容性与极致性能,迁移成本降低 90% 以上,性能原生对齐。
MindSpore Transformers 通过标准化流程、开箱即用模型、分布式自动化、混合精度加速四大核心设计,让大模型训练从 “复杂工程” 变为 “配置 + 脚本” 的快速任务。新手仅需完成环境安装、数据预处理、配置文件编写、训练脚本执行四步,即可在昇腾 NPU 上完成 Qwen、LLaMA 等模型的微调,快速适配对话、问答、文本生成等下游场景。
昇腾平台迁移 Megatron-LM 的核心是MindSpeed 适配层 + NPU 算子替换 + HCCL 通信适配,通过少量代码修改即可实现高效迁移。迁移过程需重点解决 CUDA 依赖替换、算子适配、并行策略兼容三大问题。
昇腾平台 GPGPU 以达芬奇架构为核心,是面向 AI 与通用计算的国产算力标杆,通过软硬件协同优化,实现性能与能效平衡。CANN+ACL + 昇腾编译器提供易用开发接口,支持 C/C++/Python 多语言开发,兼顾底层高性能与上层易用性。
昇思推理系统以标准化工作流程、软硬件深度协同、轻量化高性能为核心,构建了国产化 AI 模型部署的完整体系。其六大流程环环相扣,实现从模型到业务的无缝衔接,在大模型对话、长文本理解、计算机视觉等场景表现优异。依托昇腾 NPU 硬件算力与 CANN 异构架构,昇思推理大幅提升推理吞吐、降低延迟,是国产化大模型落地、AI 服务上线的首选框架。通过本文流程与代码实践,可快速完成模型部署,充分释放昇腾硬件潜
昇腾大模型模型并行是国产超大模型训练的核心技术,依托昇思 MindSpore 自动化并行框架与昇腾 AI 芯片硬件加速,实现张量并行、流水线并行、混合并行三大能力,高效解决单卡显存不足问题,支持 7B 至千亿级大模型规模化训练。
昇腾大模型训练的核心在于合理选取模型与科学调试流程。根据昇腾芯片算力选择合适规模模型,优先使用 MindFormers 内置适配基座,采用 LoRA 进行轻量化调试,可快速实现稳定训练。配合昇思框架的静态图优化、NPU 调度、内存管控、日志调试能力,开发者能够高效解决训练过程中的各类问题。模型选取与调试是昇腾大模型落地的基础技能,掌握后可快速开展对话、写作、行业知识库等各类大模型任务,实现国产化
昇思MindSpore构建的大模型业务全流程,实现了从数据处理、模型微调、推理优化到业务部署的全链路闭环。凭借参数高效微调、硬件深度适配、动静统一加速、全场景部署的核心能力,解决了传统大模型开发算力消耗大、适配难度高、部署繁琐等痛点。整套流程深度适配鲲鹏、昇腾国产化硬件,适配openEuler系统生态,能够快速支撑智能问答、文本生成、行业知识库等各类AI业务落地,是国产大模型产业落地的核心技术底座
昇腾高性能GEMM算子开发的核心并非简单实现矩阵乘法逻辑,而是硬件架构适配的系统性优化。通过矩阵分块、缓存复用、流水线并行、硬件指令加速四大核心手段,解决通用GEMM访存延迟高、算力利用率低的痛点。熟练掌握高性能GEMM算子开发,是优化深度学习网络推理速度、提升昇腾芯片算力释放率的关键,同时为自定义算子开发、模型性能极致调优奠定核心基础,广泛应用于国产AI大模型训推、计算机视觉、智能语音等各类AI
Ascend C算子开发(入门)笔记,包含 算子基本概念;Tensor、Shape、Format 与 Axis;算子运行演示;算子开发的问题与挑战;CANN 与 Ascend C;昇腾 AI 处理器架构;Ascend C 的特点;Host 与 Device;核函数;Hello World 算子实现;完整核函数实现;算子开发环境部署概述;CPU 上部署开发环境;香橙派上部署开发及运行环境;华为云 M
`at most 2 image reference frames` / `at most first and last` / `keyframe count check` | 计数检查未放开 → 改 pipeline_minimax_h3.py 3 处(6.1) |模型/工作区/大日志放 /tmp = 直接吃 RAM。> ⚠️ 必须 `--privileged`(NPU 设备访问)+ `--sh
下方是 Cube 核 L1 内存。她系统介绍了昇腾毕昇编译器组件 AscendNPU IR 的整体技术架构与设计理念,并围绕 AscendNPU IR 面向昇腾 950 扩展的新特性、技术迭代优势、生态社区建设等内容展开细致解读,拆解开源底座的核心能力和技术优势,展示其对多类前端语言的适配能力,向开发者呈现出 AscendNPU IR 易用友好、开放共建的开发体验。包括 Cube 核、Vector
算力增长的速度,远远超过了内存带宽增长的速度。过去十几年,芯片的峰值算力每两年翻一倍(甚至更快),但内存带宽的增长慢得多。计算单元经常"吃不饱"——数据从内存搬进来的速度,赶不上它消耗的速度。算力(FLOPs/s)增长曲线: ╱╱╱╱╱╱╱ (陡峭上升)内存带宽(GB/s)增长曲线: ╱╱╱ (平缓上升)两条曲线之间的缺口 = 内存墙计算单元越多,等待数据的时间比例越高这个缺口是"复利式"扩大的:
香港中文大学发布研究报告探讨了在华为昇腾(Huawei Ascend) 平台上部署大型混合专家模型(MoE) 和多模态模型 推理任务的实际挑战。尽管该平台可作为传统GPU的替代方案,但研究指出其软件栈成熟度不足,在运行复杂工作负载时存在算子覆盖缺失、并行机制脆弱以及低层内核故障等显著局限。作者记录了为了维持系统正常运行而必须进行的源码级修补与功能限制,并详细分析了硬件在大规模推理中的性能瓶颈。报告
你是否也曾疑惑:为什么自己那台顶配电脑,跑个本地大模型却卡得像 PPT?网上搜到的"AI 硬件"解释要么堆满名词,要么只讲显卡,看完更懵。本文用一张全景图和五大赛道,把 AI 硬件的分类逻辑给你讲透,初学者也能秒懂。在动笔前,我先交代一下这篇文章适合谁、读完能带走什么。如果你是对 AI 硬件好奇的开发者、学生、产品经理,或者单纯想知道"AI 芯片到底和 CPU 有啥区别"的普通读者,这篇都适合你。
混合精度训练(Mixed Precision Training)是过去十年大语言模型(LLM)训练效率提升的第一驱动力。从 2017 年 NVIDIA Volta 架构引入 FP16 Tensor Core,到 2024 年底 DeepSeek-V3 以 FP8 完成 671B 参数 MoE 模型的工业化训练(成本仅 $5.6M),再到 2026 年 AMD 联合论文攻克 FP4 从头预训练瓶颈、
华为昇腾910C“完成训练”热搜背后,实则是算力底座的静默跃迁。本文为你拆解三个关键转变:训练范式去中心化、软硬协同深度耦合、国产AI基建从“可用”到“可信”。深入架构逻辑,附上可复用的工程实践路径,助你避开营销话术,直击技术本质。🔧🚀
在Atlas 800I A3设备上部署DeepSeek-V3.1模型时,发现模型推理生成内容语义连贯但与用户请求完全无关,即出现“答非所问”现象。本文基于实际排查过程,系统分析问题根因,并提出可用的优化方案。在 vLLM PD 分离部署场景下,若出现回答内容与请求无关或精度异常问题,需检查日志中是否存在 mooncake transfer failed 报错。若存在上述报错,通常对应 HCCL 建
在鸿蒙(HarmonyOS)生态中调用 NPU 硬件加速推理,核心在于利用系统提供的和等统一调度框架。这些框架能够屏蔽底层硬件差异,自动将计算任务调度至达芬奇架构的 NPU 上,实现高吞吐、低延迟与超低功耗的 AI 推理。
面对人工智能快速发展带来的新需求,华为持续推进昇腾计算生态建设,希望通过本次训练营,以“课、训、赛”相结合的培养模式,帮助学生提升工程实践能力,为国产AI生态培养更多高水平计算人才。在专题分享环节,华为海思CANN高校生态运营经理王杰作《昇腾CANN生态技术解读》专题分享,系统介绍了昇腾CANN技术体系和开发者生态,围绕算力资源、开发工具及在线实践平台等内容进行分享,并现场演示CANN算子开发入门
自己采购昇腾卡,装在通用服务器上,自己装驱动、CANN、PyTorch适配层。解决方案是:部署前先在昇腾上跑一遍模型加载测试,看看有哪些算子不兼容,提前做替换或绕过。A:单卡昇腾910B推理7B模型(INT4量化),吞吐量约为A100(40GB)的70-85%。同样一个7B模型,在NVIDIA A100上部署可能半天搞定,在昇腾上可能需要2-3天——多出来的时间是处理环境配置、算子兼容性、依赖版本
MLIR/TVM/XLA深度学习编译器深度对比与实战一、引言AI 芯片百花齐放:NVIDIA GPU、Apple M系列、Google TPU、华为昇腾、高通 Hexagon...每种芯片都有独特的指令集和内存模型。"写一次,到处优化"成为奢
通过以上步骤,你已成功在华为昇腾310 Atlas 200DK上完成深度学习模型的移植与推理。这一流程可复用到目标检测、语义分割等其他任务,快去尝试将自己的AI模型部署到昇腾设备上,打造属于你的边缘智能应用吧!上部署深度学习模型,这篇教程将带你走完从模型转换到推理运行的完整流程。无需担心技术壁垒,我们以通俗易懂的方式拆解每一步,让你轻松在昇腾嵌入式设备上实现AI应用。是专为边缘AI设计的高性能处理
# HG9680 4U AI服务器:8卡昇腾910架构拆解与选型分析 8颗昇腾910 NPU、2.2 PFLOPS FP16算力、256GB HBM片上内存、8×200GE RoCE网络——这些参数
B站预约链接:点击预约
标量操作数直接从立即数或 aux scalar 寄存器取,省去一次 LoadAlign 加载 scalar 向量,减少 UB 占用和 Load 带宽。:在 SIMD VF 函数内,连续两次写入同一 UB 地址,且第二次读前一次写的结果(RAW 依赖)。的 condition 数组转换为 mask(非零→1,零→0),常用于 cond mask 的下采样。融合后单拍完成,对量化场景(int8↔fp3
优化模型训推算子性能:昇腾 AutoFuse 算子自动融合技术直播来袭当下生成式大模型、推荐模型和多模态模型等各类AI模型迭代速度持续加快,在线下训练、线上推理全场景中,普遍存在共通的性能短板,主要分为三点:1.:计算图中分布着大量算子,单次开销不一定很大,累积起来却不容忽视;2.:同一模型不同版本的数据流链路、算子排布持续变化,依靠固化规则的传统融合方案难以全覆盖;3.:各类网络结构、动态张量尺
本文介绍了基于鸿蒙HarmonyOS NEXT的多设备形态适配方案,核心采用ArkTS语言实现跨终端UI设计。系统通过设备形态感知引擎动态识别设备类型(手机/手表/车机等)、屏幕尺寸、交互模式等特征,结合断点响应系统(XS-XL五级)、栅格布局(2-24列)和原子化组件库,实现一次开发多端部署。架构包含应用层的自适应页面和系统能力层,支持国密算法数据签名与本地化存储,确保安全性。该方案覆盖六类终端
本文介绍了"龍魂 · 鸿蒙 Native 并发与高性能计算"框架的核心技术架构。该框架基于纯血鸿蒙HarmonyOS NEXT平台,采用C/C++ Native与ArkTS混合编程,重点优化了线程池、任务队列、内存管理等核心组件。系统架构分为应用层(ArkTS)、NAPI桥接层和Native引擎层(含线程池、SIMD加速、声纹计算等模块)。特别展示了线程池的C++实现细节,包括任务优先级调度、DN
本文介绍了基于鸿蒙HarmonyOS NEXT的团队生日提醒应用"龍魂·鸿蒙ArkTS实战"的核心设计与实现。该应用采用纯血鸿蒙架构,使用ArkTS声明式UI开发,主要特点包括: 架构设计: 分为鸿蒙适配层、应用层和系统能力层 应用层包含状态管理、数据操作、日期计算、提醒通知等功能模块 深度集成鸿蒙系统能力(日历、联系人、通知等) 数据模型: 定义TeamMember类管理成员信息 支持公历/农历
摘要: 本文详细介绍了鸿蒙原生开发(Native)的必要性、配置方法及NAPI模块开发核心。ArkTS在音视频处理、图形渲染、高性能算法等场景存在性能瓶颈,需借助C/C++通过NAPI桥接实现优化。文章从NDK工程配置(CMakeLists.txt、build-profile.json5、oh-package.json5协同)入手,逐步解析NAPI模块开发的关键步骤,包括数据类型转换、参数解析与返
龍魂·鸿蒙网络请求工程化摘要 本文档详细阐述了鸿蒙应用中Axios网络请求的工程化封装方案,核心内容包括: 理论价值:通过统一入口管理、底层屏蔽和性能优化,提升网络请求的可维护性和效率。 龍魂语法体系:将通用网络概念转化为具有五行属性的龍魂术语,如"龍魂信使"(Axios实例)、"守门员"(请求拦截器)等。 实战方案: 单例模式构建NetworkService 拦截器实现Token注入和自动刷新
这篇文章详细讲解了如何在鸿蒙应用中构建完整的数据流,从HTTP请求到本地存储的完整解决方案。主要内容包括: HTTP请求封装 分析直接使用fetch API的问题(重复代码、缺乏统一管理) 提供完整的Request封装类实现: 统一配置请求头、超时设置 自动注入token 分层错误处理(HTTP错误和业务错误) 资源自动释放 高级功能扩展 实现拦截器机制 支持错误重试逻辑(特别是token过期自动
龍芯⚡️丙午·丙申·乙卯·丙戌·䷷旅-HARMONYOS-AUTH-FUSE-v1.0-730cd2b8君子协议:本文件受龍魂DNA追溯保护。
本文深入解析了HarmonyOS Stage模型的生命周期设计,对比了FA模型的差异,强调Stage模型将窗口管理与业务逻辑分离的优势。通过一张完整的生命周期图,详细介绍了六个核心回调函数的触发时机和使用场景:onCreate(应用初始化)、onWindowStageCreate(加载页面)、onForeground(恢复数据)、onBackground(保存状态)、onWindowStageDe
本文介绍了首页架构的三个优化点:1)移除底部导航的tab状态变量,改为固定高亮样式,避免路由跳转导致的状态错乱;2)为搜索图标添加空值校验,防止无意义跳转;3)修正消息Tab的错误图标,确保语义一致性。这些改动虽小,但都针对实际用户体验问题,通过简化状态管理、增加校验逻辑和优化视觉呈现,有效降低了用户的认知负担。文章还分享了鸿蒙开发中的一些技术细节和踩坑经验,如SymbolGlyph的字体颜色设置
创新溯源/谁先自研的 → P05(上帝之眼)+P01(诸葛亮)+P13(姜子牙)
摘要: “上帝之眼·创新溯源推演器”是一款基于公开网络证据的争议性技术/创新溯源工具,通过五维推演体系(时间优先度、技术深度、证据链完整度、独立度、社区认可度)分析技术本源,输出结构化报告。核心功能包括证据搜索、时间线构建和加权推演,严格遵循“只推演不审判”原则,避免法律风险。报告包含时间线、参与方画像和综合推演结论,并附带8条法律声明以规避责任。适用于技术自研争议(如鸿蒙vs安卓)等场景,通过A
本文介绍了在HarmonyOS NEXT中使用ArkTS和ArkUI框架实现拖拽排序功能的技术方案。重点讲解了PanGesture手势组件的使用方法,包括基本配置、事件回调以及GestureEvent对象属性。通过示例代码展示了如何利用响应式状态管理实现元素拖拽效果,并详细说明了PanGestureOptions的配置项和PanDirection方向控制。文章为开发者提供了在ArkUI中实现流畅拖
鸿蒙Stage模型多设备适配方案 摘要 本文介绍了鸿蒙Stage模型如何解决FA模型在多设备适配中的局限性。Stage模型通过分离窗口管理与业务逻辑,使Ability层专注于页面渲染而不受窗口变化影响。关键实现包括:1)建立基于窗口宽度的三级断点体系(sm/md/lg);2)在Ability入口根据窗口宽度动态加载不同页面;3)利用响应式布局结构,通过@State保存断点状态,结合条件渲染实现多设
本文梳理 2026 年 7 月上旬全球 AI 领域最新重磅资讯,从国内 AI 智能体合规新政、海内外大模型迭代、雷达视觉多模态融合技术突破、国产算力生态升级四大维度展开深度解读。结合雷达、嵌入式、机载视觉开发者工程落地视角,分析 C 端拟人智能体监管限制、轻量化开源模型替代趋势、CVPR26 最新 4D 雷达检测框架、昇腾国产算力适配方案等核心内容,并针对军工雷达、无人机感知项目给出合规、算力选型
本文介绍了基于HarmonyOS NEXT和ArkTS的仪表盘布局开发实践。主要内容包括:1)HarmonyOS NEXT架构和ArkTS声明式UI特性;2)仪表盘布局的设计理念与Grid+卡片组合模式;3)Grid布局的核心API与配置方法;4)卡片组件的两种实现方式(@Builder和@Component)及样式规范;5)实战演示管理后台Dashboard的实现。文章详细讲解了如何利用ArkT
摘要 本项目基于HarmonyOS ArkTS开发了一个短视频信息流应用,采用组件化设计实现了"视频+描述+评论"的经典布局。核心功能包括: 三层垂直布局:视频播放区采用Video组件实现自动播放,信息区展示标题、作者和互动按钮,评论区显示最新3条评论 组件化架构:拆分为VideoSection、InfoSection等可复用组件,通过数据驱动UI更新 数据模型:定义了VideoItem和Comm
本文介绍了基于鸿蒙HarmonyOS和ArkTS开发的音乐播放器项目。文章首先概述了HarmonyOS的分布式架构特性和ArkTS语言基础,重点讲解了音乐播放器的界面设计理念与实现方案。播放器采用经典的垂直布局结构,分为封面、信息、进度条、控制条和列表五个功能区域。技术实现方面详细解析了ArkUI的核心布局组件(Column、Row、Stack、List)、唱片效果的动画实现、播放控制交互以及状态
本文主要介绍目前小模型领域的服务化情况和Triton Inference Server方案,这也是目前昇腾在小模型服务化的主打方案,并详细介绍三条路径,Python backend、GE custom backend和ONNX-RUNTIME backend子方案。
龙虾开发者社区(xclaw)摘要 龙虾开发者社区(27,742成员)是CSDN旗下OpenClaw生态的官方阵地,专注于Skill开发、插件实践和AI Agent等方向。社区核心内容包括: 鸿蒙×OpenClaw×小艺集成:提供七步接入流程和三层架构(组件/控制/交互层),实现语音唤醒、多设备协同等功能 三层记忆模型: Context工作记忆(32k-200k tokens) Compaction