登录社区云,与社区用户共同成长
邀请您加入社区
昇腾训练框架与真实硬件部署的 GAP,本质是软件抽象与硬件底层的不匹配,集中体现在精度、性能、稳定性、兼容性四大维度。训练环境的 “宽松约束” 与硬件环境的 “严格限制” 形成强烈反差,导致部署后效果不及预期。缩小 GAP 需从训练阶段提前适配硬件入手:统一精度语义、启用静态编译、模拟真实资源配置、优化算子与通信逻辑。通过 “训练即部署” 的理念,将硬件约束左移至开发阶段,可有效降低部署风险,提升
昇腾大模型训练的核心在于合理选取模型与科学调试流程。根据昇腾芯片算力选择合适规模模型,优先使用 MindFormers 内置适配基座,采用 LoRA 进行轻量化调试,可快速实现稳定训练。配合昇思框架的静态图优化、NPU 调度、内存管控、日志调试能力,开发者能够高效解决训练过程中的各类问题。模型选取与调试是昇腾大模型落地的基础技能,掌握后可快速开展对话、写作、行业知识库等各类大模型任务,实现国产化
一旦该平台被资本收购,新的运营方大概率会调整商业策略,原本免费、开放的AI资源可能会受限或收费,对普通AI学习者、个人开发者、小型团队的使用体验会产生较大影响。AI模型对齐是AI安全的核心工作,简单说就是约束AI,让AI输出真实、合规、无害的内容,杜绝胡说八道、生成危险信息。:EAP是企业小范围内测的专属版本,不对普通用户开放。:全球核心AI芯片厂商博通,计划通过次级债、优先担保债等方式,筹措60
混合精度训练(Mixed Precision Training)是过去十年大语言模型(LLM)训练效率提升的第一驱动力。从 2017 年 NVIDIA Volta 架构引入 FP16 Tensor Core,到 2024 年底 DeepSeek-V3 以 FP8 完成 671B 参数 MoE 模型的工业化训练(成本仅 $5.6M),再到 2026 年 AMD 联合论文攻克 FP4 从头预训练瓶颈、
华为昇腾910C“完成训练”热搜背后,实则是算力底座的静默跃迁。本文为你拆解三个关键转变:训练范式去中心化、软硬协同深度耦合、国产AI基建从“可用”到“可信”。深入架构逻辑,附上可复用的工程实践路径,助你避开营销话术,直击技术本质。🔧🚀
文章摘要: 崩溃治理是企业应用稳定性的核心指标,需构建"捕获→聚类→定位→修复→验证"的完整闭环。通过errorManager全局兜底JS异常,结合FaultLogger记录Native崩溃,实现全链路监控。崩溃栈需符号化还原并智能聚类(按堆栈指纹、异常类型、页面等维度),优先修复高频/高影响面问题。实战中需设计崩溃上报协议,搭建监控平台,并根据影响面分级处理(P0热修/P1周级/P2排期)。最终
VeRL原生支持GPU,昇腾作为VeRL开源社区贡献方,对VeRL进行适配,使其能在NPU上运行。因此,需要对社区原生特性在NPU上的支持情况以及一些NPU上的新增特性进行测试。简单说,强化学习包含训练和推理两部分,是一种边推边训的框架。区别于预训练和微调,强化学习是后训练,基于推理的结果对训练进行指导。
面对人工智能快速发展带来的新需求,华为持续推进昇腾计算生态建设,希望通过本次训练营,以“课、训、赛”相结合的培养模式,帮助学生提升工程实践能力,为国产AI生态培养更多高水平计算人才。在专题分享环节,华为海思CANN高校生态运营经理王杰作《昇腾CANN生态技术解读》专题分享,系统介绍了昇腾CANN技术体系和开发者生态,围绕算力资源、开发工具及在线实践平台等内容进行分享,并现场演示CANN算子开发入门
AI技术正迅速改变我们的生活和工作方式。前vivo产品经理宋紫薇跨界投身AI硬件创业,反映了该领域的火热。AI大模型应用开发工程师成为高薪香饽饽,月薪可达60k。该岗位更看重实际应用能力,而非纯理论,适合各背景人士转行。AI行业发展迅速,人才紧缺,是转行学习AI的最佳时机。打开手机刷短视频,AI自动剪辑的片段越来越丝滑;上班写方案,AI助手分分钟列出框架;就连楼下奶茶店,都用AI系统优化点单流程。
在鸿蒙(HarmonyOS)生态中,模型压缩是让大模型走出云端、在移动端“掌心绽放”的核心技术。通过量化与剪枝,开发者可以在保持模型精度损失可控的前提下,大幅降低显存占用和计算量,从而在算力与内存受限的手机上流畅运行 AI 模型。
摘要:本文探讨了嵌入式AI硬件的真实加速能力,指出传感器和普通MCU不等于AI加速器,需区分通用MCU、带DSP/ML指令的CPU(如Cortex-M55)和专用NPU(如Ethos-U55)。TinyML任务按计算需求分为Vibration、Voice、Vision三类,性能提升需结合计算架构、内存优化和编译器(如Vela)。强调硬件选型应基于任务复杂度(如EEG/EMG多模态需NPU,GSR/
因为特别想搞一个AI小智那样的语音聊天嵌入式设备,一直想搞一个AI+嵌入式开发的项目,想学习一些相关的知识,在此之前,我一直以为AI+嵌入式只是我想的那样,把AI载入各种开发板,然后就可以了,最近开始了解到Edge AI这个概念,我才明白,原来其中大有区别。
本文梳理 2026 年 7 月上旬全球 AI 领域最新重磅资讯,从国内 AI 智能体合规新政、海内外大模型迭代、雷达视觉多模态融合技术突破、国产算力生态升级四大维度展开深度解读。结合雷达、嵌入式、机载视觉开发者工程落地视角,分析 C 端拟人智能体监管限制、轻量化开源模型替代趋势、CVPR26 最新 4D 雷达检测框架、昇腾国产算力适配方案等核心内容,并针对军工雷达、无人机感知项目给出合规、算力选型
本文主要介绍目前小模型领域的服务化情况和Triton Inference Server方案,这也是目前昇腾在小模型服务化的主打方案,并详细介绍三条路径,Python backend、GE custom backend和ONNX-RUNTIME backend子方案。
实测在 prompt 2k → response 16k 长序列场景下,在昇腾Atlas 900 A3 SuperPoD液冷超节点、Atlas 800 A3风冷超节点等全系列产品训练吞吐从同步方案的 59.3 提升至 226.8,相对提升 3.81 倍,同时保持收敛精度对齐,目前已支持verl框架。相关信息并未经过本网站证实,不对您构成任何投资建议,据此操作,风险自担,以上网页呈现的图片均为自发上
CodeGenie是华为为鸿蒙开发者打造的AI辅助开发工具,集成在DevEco Studio中,基于盘古和DeepSeek大模型,支持ArkTS/C++代码生成、智能问答、万能卡片生成、编译报错分析等功能。通过RAG技术精准匹配鸿蒙技术栈,提升开发效率和质量。安装需DevEco Studio 5.0.3.403+版本,支持代码续写、意图框架集成等进阶功能。实测显示,服务卡片开发效率提升96%,UI
摘要: 在HarmonyOS NEXT的ArkTS开发中,接口(Interface)用于定义类型契约,由类(class)或结构体(struct)通过implements实现。关键点包括: 基础语法:类必须实现接口所有属性和方法,否则编译报错; 灵活属性:接口属性可通过简单字段或getter/setter实现; 接口继承:子接口继承父接口的所有成员,实现类需满足完整继承链; UI应用:接口常用于约束
在将多模态OCR业务从GPU迁移至昇腾NPU的过程中,由于硬件架构的差异,原有推理链路在性能和资源管理方面出现了新的瓶颈。本文基于一套五层架构的文档解析系统,详细记录了在昇腾NPU环境下的性能调优过程,涵盖推理调用结构重组、并发模型重构以及底层内存分配策略调整。通过一系列优化,最终在单卡单进程场景下实现了显著的性能提升和资源优化。该文档解析系统采用流水线架构,核心功能是对PDF或图片进行版面分析,
Query Rewrite 效果原始问题:贾宝玉最后结局是什么?改写结果:《红楼梦》中贾宝玉的最终结局是什么?Hybrid Search 效果向量命中: 20 条, BM25命中: 20 条最终答案在尘缘了结后,跟随一僧一道离开了凡间,返回其本源所在。宝玉生病,魂魄恍惚间见到送玉的和尚,跟随其前往一处荒野在毘陵驿,贾政于雪夜见到了打扮成僧人样的宝玉,宝玉拜别父亲一僧一道夹住宝玉说道:"俗缘已毕,还
鸿蒙这一路走来,最让我佩服的其实不是代码写得有多好——当然技术上确实硬核,微内核+分布式架构这套东西安卓到现在也没真正做出来。但更让人叹服的是华为的战略耐心。被制裁的时候,所有人都说鸿蒙要凉。结果呢?人家用了六年时间,执拗地一代一代迭代,每一代都推进一点“去安卓化”,直到今天彻底完成。这种搞法,就像愚公移山——每一铲子下去,土确实少了一点,但外人站着看,觉得山一点没变。等你再一回头,整座山都搬走了
本博客旨在对已发表在社区的强化学习相关的博客进行整理归类,方便用户导航使用。一下文章所用的机器均为昇腾相关设备。强化学习系列将划分为【强化学习算法】、【强化学习框架】、【模型部署实践】、【模型适配调优】、【训推引擎】五大类。
本文介绍了使用 @CustomDialog 装饰器实现三种常见的自定义弹窗交互模式:确认弹窗(支持自定义按钮样式)、输入弹窗(带字数统计和输入校验)、列表选择弹窗(单选回传)。通过 CustomDialogController 实现弹窗生命周期控制,重点讲解了循环引用问题的解决方案(利用懒求值特性)以及控制器的初始化时机选择(推荐在 aboutToAppear 中创建)。每种弹窗都演示了数据回传机
ArkUI动画实践:五种核心动效详解 本文通过五个独立Demo全面讲解ArkUI中animateTo动画的实现方法,涵盖四种核心变换和组合动画: 缩放动画:使用分步animateTo实现放大回弹效果,适用于点赞等交互反馈 旋转动画:通过角度切换实现360°平滑旋转,适合刷新按钮等场景 平移动画:采用FastOutSlowIn曲线实现自然滑动效果,可用于卡片切换 透明度动画:保持最低可见度避免用户困
本文介绍了如何使用 ArkUI 构建一个功能完整的注册表单,包含昵称输入计数、密码强度检测、性别选择和协议勾选等交互功能。重点探讨了表单状态管理的两种方案(扁平 @State vs 嵌套对象),以及错误信息的独立管理策略。文章详细讲解了各表单组件的实现细节:实时字符计数与校验、多维度密码强度算法、三色强度条展示和自定义单选按钮组。最后强调了表单校验应采用递进式错误提示,为用户提供清晰的操作反馈。通
本文介绍了昇腾NPU上的算子自动融合框架graph-autofusion,它通过自动发现融合机会和SuperKernel技术,解决了手动融合算子时工作量大的问题。该框架包含Autofuse和SuperKernel两个核心组件,能够自动分析算子间的数据依赖和硬件亲和性,将多个算子编译成单一Kernel执行,避免了中间结果的频繁读写。其JIT编译流程分为五个阶段:输入算子序列、自动融合分析、代码生成、
想象一下,你是一个乐高积木工厂的设计师。你的任务不是为每个孩子造一个成品城堡,而是设计一套"基础砖块+连接件+装饰件"的组合系统——孩子们可以用这套系统拼出他们想要的任何东西。catlass 就是昇腾矩阵乘算子的"乐高工厂"
CANN 算子调优:榨干昇腾硬件性能
昇腾实战派。
是一种面向高性能计算的领域特定语言,基于 TVM 编译器基础设施,结合类 Python 的简洁语法,旨在降低 GPU/CPU 及 NPU 上高性能算子开发的复杂度。其 Ascend 变体——,专为昇腾 NPU 架构优化,支持 GEMM、向量运算与注意力机制等核心算子的高效实现。编译器后端支持两种技术路线:和。本文档针对开发者在实际部署过程中遇到的环境配置难题,提供可复现、稳定运行的完整搭建方案,涵
摘要:昇腾NPU上fp16和bf16互转性能关键点在于数据连续性。DMA引擎转换连续tensor时带宽利用率可达95%,而非连续tensor需Vector单元处理,带宽利用率仅30-40%。fp16适合推理(精度更高),bf16适合训练(范围更大)。FlashAttention等融合算子可消除独立Cast开销(约0.02ms/次)。混合精度训练中LayerNorm等操作的Cast最频繁,但可通过融