登录社区云,与社区用户共同成长
邀请您加入社区
昇思 MindSpore 对 ONNX 提供双向迁移能力:既支持将 MindSpore 模型导出为 ONNX 格式用于跨框架部署,也支持将第三方 ONNX 模型(如 PyTorch/TensorFlow)迁移至 MindSpore,依托MindConverter、export 接口、ONNX Runtime 校验构建全链路工具链,保障转换精度与性能,是大模型跨框架迁移、昇腾部署的核心流程。
MindSpore Transformers 通过标准化流程、开箱即用模型、分布式自动化、混合精度加速四大核心设计,让大模型训练从 “复杂工程” 变为 “配置 + 脚本” 的快速任务。新手仅需完成环境安装、数据预处理、配置文件编写、训练脚本执行四步,即可在昇腾 NPU 上完成 Qwen、LLaMA 等模型的微调,快速适配对话、问答、文本生成等下游场景。
昇腾平台迁移 Megatron-LM 的核心是MindSpeed 适配层 + NPU 算子替换 + HCCL 通信适配,通过少量代码修改即可实现高效迁移。迁移过程需重点解决 CUDA 依赖替换、算子适配、并行策略兼容三大问题。
计算单元利用率:AI Core/Vector Core 是否满负荷,是否存在空转、等待。内存搬运效率:片上内存(UB/L1/L2)与 DDR/HBM 之间搬运是否冗余,是否使用异步拷贝。算子调度开销:单算子调度延迟、多算子并行 / 串行策略是否合理。数据精度与指令:FP16/BF16/INT8 是否正确使用,是否采用昇腾专用加速指令。并行策略:多核并行、向量化、流水线是否开启。提升算力利用率(≥8
昇腾训练框架与真实硬件部署环境具备高可用、高性能、高兼容、易部署、稳运行的核心优势,通过 CANN 软件栈深度绑定昇腾 NPU 硬件,配合 MindSpore 与 PyTorch 双框架适配。
昇腾平台 GPGPU 以达芬奇架构为核心,是面向 AI 与通用计算的国产算力标杆,通过软硬件协同优化,实现性能与能效平衡。CANN+ACL + 昇腾编译器提供易用开发接口,支持 C/C++/Python 多语言开发,兼顾底层高性能与上层易用性。
昇腾 CBLAS 算子是昇腾平台线性代数运算的核心加速能力,其加载与执行流程标准化、轻量化,完全兼容开源 CBLAS 接口,可快速实现现有 HPC、AI 业务的昇腾平台迁移。通过 ACL 底层环境管理、硬件内存优化、NPU 算子调度,CBLAS 可实现极致的计算性能,是昇腾在科学计算、深度学习、工业仿真等场景的核心基础组件。
定义融合算子网络(MatMul+Silu融合)# 使用mint算子(高性能接口)# 自动融合fc与silu算子return x# 启用优化器并行(大词表场景)"model_config": {"parallel_optimizer": True} # Embedding层优化器并行在昇腾 910 集群上的测试数据显示,优化后的 Llama-7B 模型训练吞吐达 240 tokens/s,较原生框架
v2.10.0 是一个围绕“调度灵活性、加速器广度、生态深度”的版本:Flexible MIG 让 MIG 真正按需伸缩,可组合策略链和成组调度补齐了真实集群的调度诉求,AMD 与壁仞扩大了加速器版图,昇腾的异构管理与可观测性走向成熟,KAI Scheduler 集成则让 HAMi-core 的隔离能力进入更广的调度生态。后续 Flexible MIG 的多设备验证、KAI 隔离器的 fracti
昇腾训练框架与真实硬件部署的 GAP,本质是软件抽象与硬件底层的不匹配,集中体现在精度、性能、稳定性、兼容性四大维度。训练环境的 “宽松约束” 与硬件环境的 “严格限制” 形成强烈反差,导致部署后效果不及预期。缩小 GAP 需从训练阶段提前适配硬件入手:统一精度语义、启用静态编译、模拟真实资源配置、优化算子与通信逻辑。通过 “训练即部署” 的理念,将硬件约束左移至开发阶段,可有效降低部署风险,提升
昇思MindSpore构建的大模型业务全流程,实现了从数据处理、模型微调、推理优化到业务部署的全链路闭环。凭借参数高效微调、硬件深度适配、动静统一加速、全场景部署的核心能力,解决了传统大模型开发算力消耗大、适配难度高、部署繁琐等痛点。整套流程深度适配鲲鹏、昇腾国产化硬件,适配openEuler系统生态,能够快速支撑智能问答、文本生成、行业知识库等各类AI业务落地,是国产大模型产业落地的核心技术底座
昇腾高性能GEMM算子开发的核心并非简单实现矩阵乘法逻辑,而是硬件架构适配的系统性优化。通过矩阵分块、缓存复用、流水线并行、硬件指令加速四大核心手段,解决通用GEMM访存延迟高、算力利用率低的痛点。熟练掌握高性能GEMM算子开发,是优化深度学习网络推理速度、提升昇腾芯片算力释放率的关键,同时为自定义算子开发、模型性能极致调优奠定核心基础,广泛应用于国产AI大模型训推、计算机视觉、智能语音等各类AI
摘要: 芯动科技IX8012国产PCIe Gen4交换芯片支持端口灵活拆分(如x4拆分为x2+x1+x1),适配多类型外设混合扩展需求,特别适用于工控、边缘服务器等场景。其评估板提供完整验证环境,支持热插拔及国产信创平台(海光、昇腾),对比海外竞品具备供应链可控、端口配置灵活等优势。典型应用包括边缘AI整机、工控机及信创小型服务器,能有效解决PCIe通道资源紧张与设备带宽不匹配问题,是国产化硬件设
本文介绍了基于ArkUI的社区活动编排板实现方案,重点解析了标签云布局的核心算法。通过CustomLayoutAlgorithm的onMeasure和onLayout方法,实现了子组件超宽自动换行与垂直坐标累计的关键逻辑。文章展示了完整的动态布局实现代码,包括: 标签云布局算法类,处理测量与定位逻辑 页面入口组件,支持动态调整标签间距 代表性标签卡组件示例 技术要点在于通过maxWidth判断换行
文章摘要 2048小游戏是一款经典的算法与交互结合的数字合并游戏,基于4×4棋盘和滑动合并机制。其核心算法包括二维数组棋盘建模、滑动合并算法(去零→合并→补零)、四方向统一处理技巧、随机生成方块(90%概率2,10%概率4)以及胜负判定逻辑(出现2048胜利或无路可走失败)。该游戏完美融合了Canvas绘制、触摸交互和状态管理,展示了结构化数据与算法的巧妙结合。
编号010构建了一个以规则引擎为核心、AI模型为感知、法律法规知识图谱为底座的双轮合规治理体系。可司法采信:规则引擎的输出直接引用法条原文,符合证据链要求可审计追溯:每条规则触发均有完整日志,支持回放可热更新:规则版本Git管理,灰度发布,秒级回滚高性能:Rete算法增量匹配,100亿+主体高并发信创适配:全面支持鲲鹏、飞腾、昇腾、达梦等国产软硬件此体系可以独立部署,也可作为中央企业、地方政府公共
本文汇总了2026年计算机技术领域六大技术栈(Java、Python、鸿蒙、SSM、JSP、Spring Boot)共计140余个毕业设计及课程实践选题,涵盖校园管理、电子商务、医疗服务、旅游推荐、宠物领养等常见业务场景。选题分布显示Spring Boot已成为企业级Web开发的主流选择,鸿蒙生态相关选题作为新兴方向开始涌现,Python方向则侧重数据分析与推荐算法应用,整体上贴近学生实际生活且具
摘要: 在信创与国产化背景下,国产NPU芯片(如瑞芯微、算能、昇腾)成为AI视频分析项目的主流选择。本文针对硬件选型中的算力估算偏差、解码瓶颈等常见问题,提出科学选型方法:小规模边缘场景优先NPU盒子(如RK3588),集中式分析选用NPU服务器或GPU方案。重点解析算力估算的7大核心变量(路数、分辨率、算法复杂度等),并提供“模型转换-配置-验证”全流程指南,涵盖ONNX导出、INT8量化及板端
A6:进入「设置」>「隐私和安全」>「应用锁」,在验证方式列表中选择需要的验证方式并开启,按照提示完成绑定和设置即可。应用锁只影响您主动打开微博APP时的身份验证,不影响微博的正常消息推送和通知功能。A1:如果忘记了应用锁密码,可以进入「设置」>「隐私和安全」>「应用锁」,点击「忘记密码」,通过绑定的华为账号进行密码重置。设置应用锁后,每次打开微博APP都需要进行身份验证,包括重新登录账号时也需要
摘要: 《龍魂系统优化全流程》提出了一套融合东方数理与现代计算技术的AI系统优化框架。其核心创新包括:1)基于河图洛书的九宫算力矩阵与五行动态调度算法,重构算力资源分配逻辑,目标提升集群利用率至81%;2)双轨隔离部署与鸿蒙首帧渲染优化,保障数据安全与性能;3)引入易经状态机与KFPP知识纯净协议,实现系统决策可解释性及知识防污染;4)分层许可治理(思想层CC协议/工程层Mulan协议)与三维贡献
在国产算力领域,2026年6月,依托昇腾910C国产AI算力集群,深圳河套学院AI训练平台项目团队联合哈尔滨工业大学(深圳)、深圳市大数据研究院、华为及深智城AI算力平台,成功完成1.6万亿参数DeepSeek-V4-Pro大模型的全参数后训练。在这一背景下,国内算力平台已分化为三条主要路线:大模型API调用平台(按Token计费,适合应用开发)、GPU算力租用平台(按小时租用裸GPU,适合模型训
本文介绍了一种面向AI系统的记忆压缩与恢复引擎"龙魂·鸿蒙记忆压缩与恢复引擎v1.0"。该引擎通过分层存储(L0-L3)和智能压缩技术实现AI的长期记忆管理,而非简单存储聊天记录。系统包含记忆引擎、压缩器、恢复器、存储适配等核心模块,采用鸿蒙原生zlib实现数据压缩,支持多级记忆管理(L0瞬时层到L3归档层)和自动压缩调度。关键特性包括基于内容重要性的分层存储策略、智能压缩算法、以及干支时间戳等特
摘要: 融合算子是通过整合多个基础算子形成的单一计算单元,可消除冗余数据搬移,提升深度学习模型效率。昇腾架构下的融合算子分为VV融合(Vector单元间)和CV融合(Cube与Vector单元间)。VV融合通过减少中间数据读写降低耗时,CV融合则实现跨单元流水线并行计算。实验仿真显示,VV融合可显著减少执行时间,CV融合通过分块流水线并行大幅提升矩阵运算效率。文中以平方差融合算子为例,详细介绍了H
VisionResult是IVGuard视觉识别系统的核心数据结构,承载了单次检测的完整结果。其定义位于markerId: string // 贴纸标记IDlevel: number // 识别到的液位百分比confidence: number // 置信度0-1corners: number[] // 角点坐标[x1,y1,x2,y2,x3,y3,x4,y4]OpenCV的ArUco模块提供了多
BF16的指数范围跟FP32对齐,虽然尾数少,但数值稳定性极强,几乎不会溢出,也不需要额外缩放。FP8分E4M3和E5M2两种标准,速度是FP16的2到4倍,显存占用只有FP16的四分之一。FP16的速度是FP32的4到8倍,显存也减半,但容易出现数值溢出。在V100那个年代,它是模型训练的主力,但训练大模型时必须配合Loss Scaling来防止梯度爆炸,用起来比较折腾。精度后缀才是关键,同样的
本文介绍了构建居家智能净化系统的核心方案,重点围绕三大模块展开:1. 系统集成方案:提供一站式(如华为鸿蒙智家)和自定义(如HomeKit、米家)两种集成方式,涵盖新风、净化、温湿度设备的协同控制,适配不同住宅需求(新房/老房、大户型等)。2. 物联网传感器网络:通过PM2.5、CO₂、VOC多传感器联动实现精准监测,结合智能决策逻辑(如睡眠模式优先静音、污染冲突时混风处理)和稳定通信架构(Zig
在深度学习推理场景中,模型量化与激活函数的组合操作频繁出现,通常需要依次执行反量化(Dequant)、激活函数(如 SwiGLU)和量化(Quant)三个步骤。传统分步执行方式会产生大量中间张量的显存读写,导致推理延迟增加。为解决这一问题,本文设计并实现了一个融合算子,将上述三个操作合并为一次 kernel 调用,显著减少显存访问开销,提升推理性能。该算子基于 Triton-Ascend DSL
在深度学习模型训练中,均方误差损失(MSELoss,又称 L2 Loss)是回归任务中最常用的损失函数之一。随着模型规模的不断扩大,对算子的计算效率和精度要求也越来越高。Triton 作为一种高效的 GPU 编程语言,能够帮助开发者编写高性能的自定义算子。本文基于 Triton-Ascend 框架,设计并实现了一个支持多种归约模式、具备动态优化策略的 MSELoss 算子,旨在解决现有实现中精度不
香橙派非Docker部署算法模型指南 本文详细介绍了在香橙派(OrangePi)开发板上非Docker化部署算法模型的全流程,涵盖硬件准备、系统配置、传统算法与深度学习模型的部署实战,以及昇腾NPU的优化方法。 核心步骤: 系统准备:针对Rockchip/昇腾芯片选择对应Ubuntu镜像,配置静态IP及ARM架构软件源。 基础环境:安装编译工具和依赖库,创建Python虚拟环境隔离项目依赖。 传统
《龍魂·鸿蒙兼容性白皮书 v1.1》摘要(150字): 本白皮书阐述了龍魂系统与鸿蒙OS的兼容战略,提出"三步走"实施方案:1周实现"龍魂·指尖"基础通信(语音输入/结果展示),1个月完成服务原子化(端侧3种子人格常驻),长期构建分布式共生体。核心原则包括数据主权不变(原始数据永不离开本地)、算力网格化(闲置设备组成家庭计算集群)、民用安全边界(P0-P5分级防护)。技术路径涵盖ArkTS重写关键
《龍魂·鸿蒙兼容性白皮书 v1.0》摘要 本文档由龍芯北辰(UID9622)于2026年7月24日发布,提出龍魂系统与鸿蒙OS深度整合的三阶段战略: 短期(1周):开发轻量应用"龍魂·指尖",通过HTTPS连接现有鲲鹏后端,实现鸿蒙设备基础交互; 中期(1月):将核心功能原子化移植至鸿蒙,包括端侧推理、本地DNA审计及人格碎片化; 长期:利用鸿蒙分布式能力构建"数字共和国",实现跨设备算力调度与数
【摘要】本文针对AI落地岗(解决方案、实施交付、售前等)人员解析如何高效利用证书实现职业增值。核心观点:1)证书价值排序:软考人工智能(职称绑定)>华为HCIP-AI(政企刚需)>阿里云ACP(互联网大模型落地);2)简历包装公式:证书+岗位能力+项目价值,如"持有HCIP-AI认证,具备昇腾私有化部署及政企AI方案设计能力";3)避坑指南:避免仅罗列证书名称,需结合RAG搭建
昇腾是华为公司推出的全栈全场景人工智能(AI)计算平台,其核心是昇腾系列AI处理器(基于达芬奇架构)。它旨在为从数据中心到边缘设备的各类场景提供高效、统一的AI计算能力,目标是“让AI无所不及”。
身份锚: #ZHUGEXIN⚡️2025-🇨🇳🐉⚖️♠️🧚🏼♀️❤️♾️-DEVICE-BIND-SOUL。鸿蒙版(ArkWeb+小艺)DNA追溯码: #龍芯⚡️2026-07-21-GUANLAN-BROWSER-V1.0-P0。DNA追溯码: #龍芯⚡️2026-07-21-GUANLAN-BROWSER-V1.0-P0。│ L1 观澜外壳:标签/书签/阅读模式/AI侧栏/看板│←
井字棋(Tic Tac Toe)是一款经典的零和博弈游戏,两名玩家在3×3棋盘上轮流落子,先将三个棋子连成一条线者获胜。该应用支持双人模式(两名玩家轮流操作)和AI对战模式(玩家与电脑对战),AI使用经典的Minimax算法实现完美博弈。该应用以HarmonyOS NEXT的ArkTS框架为基础,深入展示了Minimax AI博弈算法、棋盘状态管理、胜负判定、游戏状态机、走棋历史记录和交互反馈等技
优化模型训推算子性能:昇腾 AutoFuse 算子自动融合技术直播来袭当下生成式大模型、推荐模型和多模态模型等各类AI模型迭代速度持续加快,在线下训练、线上推理全场景中,普遍存在共通的性能短板,主要分为三点:1.:计算图中分布着大量算子,单次开销不一定很大,累积起来却不容忽视;2.:同一模型不同版本的数据流链路、算子排布持续变化,依靠固化规则的传统融合方案难以全覆盖;3.:各类网络结构、动态张量尺
适用场景:Embedding 查表、稀疏 attention、ROI Align 等不规则访问。寄存器之间的数据拷贝,配合 mask 可做 lane 选择。(950PR 都是 8 个 Block 拼成 256B)。按寄存器中的 index 从 UB 取散列数据,用于输出长度非对齐或需要紧凑存储的场景,必须配。
年龄计算器(Age Calculator)是一款精确的生命时间计算工具,能够根据用户输入的出生日期,精确计算到秒的年龄信息,同时提供星座查询、生肖查询、人生进度展示和纪念日提醒等增值功能。该应用以HarmonyOS NEXT的ArkTS框架为基础,深入展示了日期时间计算算法、星座算法、生肖算法、人生进度可视化和本地化日期处理等关键技术。逐层借位年龄计算:精确到秒的年龄计算,正确处理闰年、月份天数差
密码生成器(Password Generator)是一款安全密码生成工具。支持自定义密码长度、字符类型(大写/小写/数字/符号)、排除相似字符,并提供密码强度评估。该应用深入展示了ArkTS框架中的字符集处理、随机算法、密码强度计算和用户体验设计技术。随机密码生成算法字符集管理密码强度评估批量生成历史记录管理。
在鸿蒙(HarmonyOS)生态中,模型压缩是让大模型走出云端、在移动端“掌心绽放”的核心技术。通过量化与剪枝,开发者可以在保持模型精度损失可控的前提下,大幅降低显存占用和计算量,从而在算力与内存受限的手机上流畅运行 AI 模型。
在鸿蒙(HarmonyOS)生态中,智能推荐能力依托于系统级的与,结合端云协同 AI 架构,实现了从“用户找服务”到“服务找人”的范式转变。开发者可通过接入系统标准体系或构建应用内推荐引擎,实现精准的个性化推荐。
本文详细介绍了在HarmonyOS NEXT中使用ArkTS实现毛玻璃效果的完整方案。通过Column容器结合blur()模糊属性和半透明背景色,开发者可以轻松创建具有层次感的UI界面。文章从项目结构、ArkTS基础、blur()API原理到具体实现公式进行了系统讲解,重点分析了模糊半径的视觉效果差异,并提供了"半透明背景+高斯模糊"的核心实现公式。该方案采用GPU加速渲染,性能优异且代码简洁,适
本文深入介绍了Flutter中的文本组件与样式系统。主要内容包括: Text组件基础:详细解析Text组件的构造参数,包括文本内容、对齐方式、自动换行、最大行数、溢出处理等核心功能。 TextStyle样式系统:全面介绍文本样式的各种属性,如颜色、字体大小、字重、斜体、行高、字间距、装饰线等,并提供了丰富的代码示例。 实践应用:通过实际代码演示了如何组合使用Text组件参数和TextStyle属性
骰子模拟器(Dice Roller)是一款模拟投掷骰子的应用。支持多种骰子类型(D6/D8/D10/D12/D20)、多骰子同时投掷、投掷动画和统计数据分析。该应用深入展示了ArkTS框架中的随机数生成算法、滚动动画、统计分析和历史记录技术。随机数生成算法滚动动画统计分析历史记录多骰子管理。
应用流转(Continuation)是指:将当前应用在前台的任务(包括页面栈、内存状态)从一台设备"传送"到另一台设备上继续使用。这个过程对用户来说应该是无感的——用户点击一个"流转"按钮,应用在目标设备上自动打开并恢复到离开时的状态。层次能力开发者介入程度适用场景系统级流转免安装流转整页零介入浏览器、视频播放等通用场景应用级流转指定页面 + 状态迁移需实现 Continuation 回调E-Br
本文探讨了如何利用鸿蒙系统的分布式能力实现手机与平板间的数据无缝流转,重点以健康应用E-Brufen的情绪数据同步为例。文章首先分析了跨设备数据同步的必要性,指出数据可达性、一致性和安全性是三大核心挑战。随后详细介绍了鸿蒙分布式数据服务框架,包括底层通信基础(分布式软总线)和三种数据存储方案:轻量级键值存储SingleKVStore、带设备维度的DeviceKVStore以及支持SQL的关系型数据
回顾整篇文章,我们从一个真实项目(E-Brufen)的呼吸练习功能出发,经历了"数据驱动方案不够用"的痛点,引入策略模式作为解决方案,完整实现了抽象接口、四种具体策略、工厂映射、组件重构和单元测试。这篇文章不是一篇纯粹的设计模式教科书文章——教科书会告诉你"策略模式有 Context、Strategy 和 ConcreteStrategy 三个角色",而我们会告诉你"当产品经理要求每个呼吸模式弹出
本文介绍了鸿蒙应用开发中短信智能解析算法(SmsParser)的实现方案。该算法可从包含多条短信的文本中提取平台名称和手机号,主要技术点包括:1)ParseResult数据结构设计;2)长词优先的关键词匹配策略(PLATFORM_KEYWORDS);3)子串包含消除算法避免重复匹配;4)正则表达式提取手机号;5)组合候选生成策略(笛卡尔积组合平台和号码)。文章还提供了完整的解析示例和应用场景说明,
系统讲解一套生产级评估体系是怎么运转的。文章覆盖七大主题:EvalEnvironment 生命周期(prepare/dispose SPI、每个 trial 独立 workspace/clock/controller/lease)、Record/Replay 机制(录制真实 LLM 交互、回放时 HTTP 请求严格为 0)、SHA-256 请求哈希(canonical JSON + trial s