登录社区云,与社区用户共同成长
邀请您加入社区
(显示芯片型号、实时温度、当前功耗、12GB NPU 内存占用等),那么恭喜您,您的整套系统和硬件联调已经完美成功,随时可以展开您的昇腾边缘端 AI 算法开发之旅了!切换,非常麻烦 [1.1.2]。(注:在 Linux 终端中输入密码时,屏幕上不会显示任何星号或波动,直接输完敲回车即可!执行完毕后,您下次在 MobaXterm 新建 SSH Session 时,(注:请务必看清容量,千万不要勾选电
摘要:Type-C一线通已成为工业、车载、信创等设备的标准接口,但传统多芯片视频转换方案存在兼容性差、布局复杂等问题。GSV6155单芯片方案集成了Type-C信号接收、DP转换、多路视频分发、DSC编解码和PD控制功能,支持4K@60Hz输出,适配国产操作系统与算力平台。其低功耗、小型化设计满足消费级和工业级设备需求,显著简化硬件开发流程,缩短量产周期。该方案与国产PCIe交换、存储芯片协同,完
深度学习模型的性能高度依赖高效算子实现,但面向专用加速器开发高性能算子仍耗时耗力,且对开发者专业能力要求极高。现有研究证明大语言模型(LLM)可生成正确、高性能的GPU算子;但针对神经网络处理器(NPU)的算子生成领域仍缺乏充分探索——根源在于NPU具备领域专属编程模型、公开开发案例稀缺、配套文档匮乏。若直接使用大模型生成昇腾C(AscendC)算子,代码正确率极低,充分凸显了GPU与NPU算子自
高度重合风险:AscendKernelGen已完整覆盖本方案全部诉求(32B基座、CoT数据集、SFT+RL训练、昇腾内核生成),若跳过基线评测直接从零自研,存在严重重复造轮子问题,技术评审、对外成果输出均存在短板;方法论统一:全赛道SOTA项目均采用两阶段训练,原方案仅SFT单阶段存在明显技术缺陷,必须补充RL执行反馈环节;数据集对标:Ascend-CoT v3样本量级、场景覆盖度远超本方案初始
国产CPU(龙芯、飞腾)、国产操作系统(鸿蒙PC版、统信UOS)、数据库内核,这些底层全是用C/C++堆起来的。:智能汽车的车载OS(AUTOSAR)、小家电的RT-Thread、甚至你手里的蓝牙耳机芯片,跑的还是C。既然你还在纠结这个问题,说明你对技术有敬畏心,这本身就比那些跟风转码的人强多了。如果你是科班,把《计算机组成原理》和《汇编》捡起来,C语言只是你的“刀”,而计算机体系结构才是你的“武
情绪热力图(Mood Heatmap)借鉴了 GitHub 贡献热力图的设计:横轴是星期一到星期日(7 列),纵轴是当月的周次(4-6 行),每个格子代表一天,格子的颜色深浅由当天情绪强度决定。与 GitHub 热力图的一个关键区别:GitHub 用绿色深浅表示代码提交量(越多越绿),我们的情绪热力图用颜色梯度表示情绪状态——越开心越绿,越难过越红。这是一个语义对用户的直接映射,不需要额外的图例学
FFI(Foreign Function Interface)顾名思义,是让一种编程语言调用另一种"外国"语言编写的函数接口。Dart FFI 从 Dart 2.5 开始作为dart:ffi包引入(Dart 2.12 稳定),允许 Dart 代码直接调用 C 语言的函数,无需通过 Platform Channel、无需序列化、无需异步等待。核心优势在于零拷贝的直接调用│ FFI 调用 vs Pla
2026年高端电视市场三大技术阵营对比分析:画质派(如索尼X85L)专注色彩与对比度,适合夜间观影;音效派(如东芝Z700MF)强化声场沉浸感,提升观赛体验;智慧派(华为智慧屏MateTV)以鸿蒙生态为核心,实现画质、音效、交互全面升级,成为2万元以上高端市场占比超35%的标杆产品。选购建议:画质党选OLED旗舰,氛围党重音响配置,家庭用户推荐华为智慧屏,预算有限优先保证基础画质。未来电视竞争正从
在 AI 计算场景中,算子的执行效率直接影响模型训练与推理的整体性能。Ascend C 作为面向昇腾 AI 处理器的算子开发语言,提供了丰富的编程接口与硬件抽象能力。然而,要充分发挥硬件潜力,开发者需要系统性地识别并消除性能瓶颈。本文从搬运、内存、API 使用、流水、Tiling 及头开销等六大方向出发,结合实际案例,总结了一套可复用的性能优化方法论,帮助开发者快速定位问题并实施有效优化。
Android 手机 APP 通过 WiFi TCP 协议远程控制搭载麦克纳姆轮的 STM32 小车,将药盒自动运送至指定房间(客厅/卧室/厨房),配合分级语音提醒,确保老人或患者按时准确服药。通过 HC-SR04 超声波传感器非接触式实时监测宠物水碗水位,当水位连续检测低于阈值时自动启动水泵补水,同时通过 I2C LCD1602 显示屏实时展示水位状态和系统提示。的全场景宠物服务智能应用,个人独
CNSH 不是把英文关键字翻译成中文,而是为中国技术主权场景重新设计的一门脚本语言。本文从龙芯、鸿蒙、欧拉等底座出发,解释为什么中国人需要自己的脚本语言,并给出 Hello CNSH 与批量归档日志的实战代码。
本人有长时间可以学习,家里并没有很大的压力,很想步入计算机这个行业,却不知道如何开始。或者说在出了学校才开智,之前的不努力到现在全都反会来了。现在又可以吃学习的苦了,真是撞了南墙才知疼。我是一名大专2026年应届毕业生,我过c语言, HTML, Linux, MySQL ,鸿蒙应用开发,全都都是一直半解。现在对于AI发展,计算机的工业革命,对于我来说更是重量级,无法入门。实习经历干了,弱电(半力工
工业机器人操作系统分类指南 工业机器人操作系统分为三大类: 底层实时RTOS:负责运动控制与安全,如VxWorks(ABB/KUKA等采用)、QNX(协作机器人常用)、实时Linux(国产主流)及国产系统(SylixOS、鸿蒙等),需微秒级硬实时能力。 整机厂商专用系统:如FANUC的ROBOTGUIDE、ABB的RobotWare,基于VxWorks/Linux封装,含专属编程语言与工艺包,用于
AscendC = 昇腾 AI Core 专用算子开发语言, 不是 CUDA for 昇腾. 它用 CopyIn → Compute → CopyOut 三段式 + 显式 TBuf/TQue 内存管理 + 用户写 Tiling 函数实现多核并行, 是 2026 年新算子项目的推荐方案.三个关键事实范式 = 三段式 + 显式数据搬运: 与 CUDA 完全不同, 数据从 Global 到 Local
场景推荐模式适配算法库(PyTorch/vLLM)算子框架研究原型 / 性能验证直调需要图模式 / 算子融合算子框架需要 MIX 并行算子框架(直调不支持)
本文详细解释了Ascend C编程中CopyIn、CopyOut和DataCopy的区别与联系。CopyIn和CopyOut是Vector编程范式的两个核心流水线阶段,分别负责数据搬入和搬出;而DataCopy是实现这两个阶段数据搬运的具体API接口。CopyIn阶段通过DataCopy将数据从全局内存(GM)搬入本地缓存(UB)的VECIN队列,Compute阶段执行矢量计算后将结果存入VECO
本文系统介绍NAPI(Node-API)在HarmonyOS中的使用方法,帮助开发者实现ArkTS与C/C++代码的互操作。主要内容包括: NAPI核心概念:介绍napi_env、napi_value等关键概念及模块注册机制 开发环境配置:详细说明工程配置、CMake设置和类型声明 开发全流程:从函数编写、参数获取到类型转换和模块注册的完整步骤 数据类型转换:覆盖数值、字符串、布尔值、数组等类型的
本文介绍了在鸿蒙应用开发中集成C/C++三方库的完整流程,以libmediainfo为例,重点讲解了如何通过NAPI机制实现ArkTS与C/C++的交互。文章对比了直接链接和dlopen动态加载两种集成方式,推荐使用直接链接方法,并详细说明了项目结构设计、SO文件放置、头文件管理和NAPI桥接层的实现。通过编写C++包装代码,将三方库的C接口转换为ArkTS可调用的NAPI接口,最终实现在鸿蒙应用
以下是基于技术文档的摘要(150字): GR3-Fourier V13.0鸿蒙级工业系统底层代码库提供10项核心算法源码,包括自适应模糊PID控制、三相SPWM调制、电池SOC估算等关键工业控制技术,均采用C语言实现高效嵌入式开发。配套1201-1600号超规格工业参数集,涵盖伺服系统(320Hz响应带宽)、精密机床(0.0015mm径向跳动)、液压控制(NAS6级油液过滤)等高端制造领域性能指标
atvoss(Ascend Template Vector Operator Subroutine Set)是一个高性能向量算子子程序库,旨在通过复用高频计算片段提升开发效率。它将常见计算模式(如归约、分块加载、softmax等)抽象为模板化的子程序,避免重复实现和修改不一致问题。atvoss与完整算子模板atvc形成互补关系,前者提供细粒度的基础组件,后者调用这些组件构建完整算子。子程序分为内存
电力系统暂态稳定性NPU加速仿真 该技术方案提出了利用NPU加速电力系统暂态稳定性分析的方法。核心是并行求解上百台发电机的摇摆方程——描述转子运动的二阶非线性微分方程组。传统CPU串行计算需15分钟处理一个故障场景,而该方案通过以下创新实现毫秒级响应: NPU并行计算架构: 所有发电机状态同步推进 雅可比矩阵分块LU分解使用Cube单元加速 网络拓扑切换采用批量代数运算 关键技术实现: 四阶Run
摘要 本文提供了昇腾CANN算子双版本模板代码的详细解析,包含CCE仿真测试和ACL设备运行两种模式的实现。代码通过宏分支区分编译环境,并兼容两种运行方式:CCE_KT_TEST模式用于本地CPU模拟调试,标准ACL模式用于真实昇腾硬件部署。模板演示了完整的ACL标准执行流程,包括资源初始化、内存分配、核函数调用和资源释放等关键步骤,并解释了aicore、Gm全局内存、blockDim等核心概念。
本文介绍了在CANN框架下开发自定义算子FusedSiLU(SiLU激活与残差加法融合)的完整跨仓库协作链路,涵盖5个关键环节: pyasc仓库:使用Ascend C DSL编写算子原型,实现融合计算(MatMul+SiLU+Add)以减少HBM读写; opbase仓库:提供基础组件(AscendCContext、TensorDesc等)支持; ops-nn仓库:完成kernel实现与注册(Inf
在昇腾CANN生态体系中,算子开发面临着效率与性能的双重挑战。catlass项目作为CANN生态中的模板库,承担着连接上层框架与底层算子实现的重要职责。该项目通过模板化设计,实现了与ops-math、ops-blas等算子库的高效协作,为开发者提供了一套可复用的算子开发范式。
昇腾算子开发“从入门到精通”——Ascend C开发者贡献指南
本文介绍了昇腾 CANN 的 Vector 算子开发模板库 atvoss,它能显著提升算子开发效率。该库封装了常见算子模式(逐元素运算、Reduce、Broadcast等),通过模板化处理数据搬运、地址对齐等重复代码,使开发代码量减少50%。文章以 Swish 激活函数为例,展示了如何使用 VecElementwise 模板快速实现算子,同时对比了手写代码与模板性能差异(约5-8%)。atvoss
本文介绍了pyasc(Python Ascend C Binding),这是一个用于昇腾NPU的快速算子原型验证工具。它允许开发者用Python语法编写算子,自动转换为Ascend C代码并在NPU上执行,性能可达手写Ascend C的80-88%。文章展示了如何使用pyasc实现Softmax等算子,对比了与手写Ascend C的性能差异(约10-15%差距),并列举了支持的核心操作(数学运算、
摘要: 本文探讨了华为AR Engine的ARSession与空间建模系统的协同工作方式。ARSession作为AR Engine的核心组件,负责实时追踪相机姿态和环境信息,而空间建模系统则利用PushARFrame接口接收这些数据完成3D重建。文章对比了手动PushFrame与PushARFrame的优劣,强调后者在实时扫描场景中的优势,并详细说明了两个系统的生命周期管理顺序(ARSession
本文介绍了在昇腾NPU上使用Ascend C语言开发自定义算子的完整流程。主要内容包括:1)算子开发背景,说明深度学习框架需要自定义算子来支持新功能或优化性能;2)详细开发流程,涵盖算子设计、实现、编译、部署和测试五个步骤;3)代码示例,展示了AddOne和MatMul算子的核心实现;4)性能优化技巧,如内存对齐、流水线设计等;5)实测数据表明,使用Ascend C开发的算子性能接近理论峰值。文章
昇腾CANN技术栈包含多个层次的设计抽象,其中PTO指令集(pto-isa仓库)和Ascend C编程语言是两个容易混淆但定位完全不同的技术组件。本文从指令集架构设计的角度,剖析PTO指令集的设计原则,以及它与Ascend C之间的协同与边界。
本文介绍了如何使用Ascend C语言在昇腾平台上开发自定义矩阵乘法算子。主要内容包括: 开发环境准备:安装CANN工具包并创建算子工程框架 算子原型定义:通过头文件和实现文件定义算子的输入输出及属性 核心算子实现: 使用GlobalTensor和LocalTensor管理内存 实现基本的矩阵乘法计算流程(GM->UB->计算->GM) 提供优化版本建议(使用Cube Unit加速) 文章详细展示
昇腾NPU强化学习训练实战——从PPO到GRPO的完整落地
摘要:自定义算子主要用于昇腾NPU标准算子库无法满足的三种场景:新激活函数/损失函数、算子融合优化和特殊数据排布。AscendC是专为达芬奇架构设计的类C编程语言,通过分块处理、UB内存管理和向量化指令实现高效计算。开发流程包括编写算子、编译注册和在PyTorch中调用,性能调优需关注分块大小、双缓冲、向量化加载和数学简化。建议优先使用标准算子,仅在必要时开发自定义算子。(149字)
写给新手的 pyasc:昇腾 Python Ascend C 绑定到底是啥?
本文介绍了从零开始开发昇腾NPU自定义算子的完整流程。首先需要搭建开发环境,包括安装CANN toolkit和配置环境变量。然后通过工程模板创建算子项目,包含算子原型定义、Tiling策略和Kernel实现三部分。重点讲解了Tiling策略的设计原理,即根据L1 Buffer大小将大张量切分为小块,以及如何在Kernel中实现element-wise加法运算。整个过程采用实战方式,帮助开发者快速掌
本文介绍了昇腾NPU的PTO-ISA中间指令集规范及其在算子开发中的关键作用。PTO指令分为计算、数据搬运和控制三类,通过指令融合优化性能。文章重点分析了三个常见开发陷阱:指针别名导致的LOAD不融合、隐式同步打断流水线、以及硬件退化路径引发的L1容量问题。理解PTO的工作原理有助于解释不同NPU代际间的性能差异,指导开发者编写更高效的Ascend C kernel。通过合理使用__restric
摘要:Ascend C是面向昇腾NPU的C++编程框架,pyasc在其基础上提供了Python接口,简化算子开发流程。开发者只需用C++编写核心计算逻辑,而算子注册、输入输出定义和测试用例均通过Python完成。pyasc自动处理编译配置和算子注册,显著提升开发效率——测试算子无需手动编译C++项目或配置CMake。典型开发流程包括:1) C++侧实现计算核;2) Python侧定义算子接口;3)
摘要:hcomm是基于hccl构建的高层通信原语库,将分布式训练中的复杂通信模式(如张量并行、流水线并行、MoE路由)封装为简单API。它自动管理通信域、数据切分和同步点,底层仍调用hccl的AllReduce等基础算法。hcomm针对不同场景优化:TP通信自动选择拓扑感知算法,PP通信实现低延迟层间传输,MoE通信封装token路由逻辑。通过init_context统一管理多级并行通信组,显著降
这篇文章会带你从零开始,理解FlashAttention的数学原理,然后看它在昇腾CANN异构计算架构里是怎么用Ascend C实现的。我会把关键代码拆开讲,让你知道每一行在干什么。
Flutter在OpenHarmony平台开发中自定义底部导航栏的实践指南。文章分享了健康管理APP开发过程中遇到的鸿蒙适配问题与解决方案,重点介绍了三个典型鸿蒙专属bug:渲染层级异常、点击事件失效和内存泄漏问题。针对这些问题,作者提供了详细的解决思路和优化代码,包括使用Stack组件适配安全区域、重写触控事件监听、自定义状态管理类等。文中还给出了完整的可运行代码示例,特别标注了鸿蒙平台需要注意