登录社区云,与社区用户共同成长
邀请您加入社区
Flux 作为高性能文生图模型,结合 GRPO(Group Relative Policy Optimization)强化学习可显著提升生成质量与美学一致性。昇腾平台迁移需解决算子不兼容、数据类型限制、显存瓶颈、通信适配、精度漂移五大核心问题,基于 DanceGRPO 框架实现 Flux 的 NPU 全链路训练,最终性能达 GPU 的 90%+,奖励值误差 < 0.02%,为多模态生成强化学习提供
文件夹作用说明accelerateHugging Face Accelerate 分布式训练配置示例,用于多卡 / 多机、FSDP 训练,存放 accelerate 的 config 文件ascend华为昇腾 NPU 芯片适配的训练 / 推理样例,国产昇腾硬件跑大模型用deepspeedDeepSpeed ZeRO 优化器的配置样例,大模型多卡显存优化,做大模型全量微调必备extras高级进阶功能
工具:WSL + Ubuntu24 + DevEco Studio。
本文主要介绍目前小模型领域的服务化情况和Triton Inference Server方案,这也是目前昇腾在小模型服务化的主打方案,并详细介绍三条路径,Python backend、GE custom backend和ONNX-RUNTIME backend子方案。
本文详细记录了利用AI Agent辅助打通Qwen3-ForcedAligner和Qwen3-ASR双模型构建实时语音转写与逐词对齐系统的全过程。目标是在一台Atlas 800T A2服务器上实现高并发服务化系统,最大化系统吞吐量。文章分为七个阶段,从单模型打通到双模型联立,再到多卡调度与多进程集群的实现,最终形成了一套完整的生产级服务化系统。项目中,AI Agent在环境配置、性能优化、瓶颈定位
YOLO26的边缘部署,本质是在约束条件下寻找最优解。没有万能配置,只有适合当前硬件和业务需求的权衡。建议新手先从NUC或普通PC+iGPU起步,跑通全流程后再迁移到专用AI芯片。每一步都保留中间产物和日志,出问题才能快速回溯。如果你正在适配其他硬件(如昇腾、寒武纪),或在量化过程中遇到精度崩塌,欢迎评论区留言。下期可以聊聊如何用OpenVINO的Model Optimizer自定义层替换,解决Y
《AI时代工业视觉检测创新路线图》摘要:本白皮书系统规划了工业视觉检测的智能化转型路径。针对当前行业痛点(环境适应性差、样本依赖性强、部署成本高),提出三大技术突破方向:1)自适应检测(AI光照补偿、多模态融合);2)智能优化(参数自动调优、预测性维护);3)移动化转型(鸿蒙端侧AI方案)。重点部署9大创新工具,分三个阶段实施:短期(1-2月)聚焦基础增强工具,中期(3-6月)开发多模态检测系统,
自动驾驶感知中的激光雷达点云高效处理方案 该方案针对自动驾驶系统中激光雷达每秒产生150万个点云数据的实时处理挑战,提出了一种基于NPU加速的二维BEV投影方法: 问题背景:传统CPU逐点处理(O(N log N))无法满足30ms规划周期的实时性要求,单帧处理时间超过200ms。 核心思路: 将三维点云投影到二维BEV俯视图 通过2D卷积网络进行目标检测 计算复杂度从O(N²)降低到O(H×W)
摘要 Catlass Conv模板提供了一种高效实现非标准卷积的方法,通过Img2Col+GEMM转换将卷积运算转化为矩阵乘法。该模板支持多种卷积变体(如空洞、分组卷积),并允许手动调优分块参数优化性能。实现步骤包括:1)定义卷积参数结构体,自动计算输出尺寸;2)实现Img2Col将输入图像转换为列矩阵;3)执行GEMM矩阵乘法;4)通过Col2Img还原输出格式。关键特性包括灵活配置卷积参数、分
这篇文章介绍了基于昇腾CANN的空间智能处理方案,重点针对点云数据处理中的实时性挑战。文章首先分析了无人机避障和机器人SLAM等场景对点云处理的严苛要求,包括百万级点云数据的处理需要在30-100毫秒内完成。随后详细介绍了cann-recipes-spatial-intelligence配方库的结构和功能模块,涵盖点云分割、3D目标检测、SLAM等核心算法。文章通过具体代码示例展示了点云数据的读取
摘要: CANN ops-cv是昇腾NPU专用的计算机视觉算子仓库,包含Resize、NMS、ROIAlign等核心算子,用于图像缩放、目标检测等任务。该仓库解决了视觉推理中的两大痛点:图像前处理的高计算量(如4K图像缩放)和目标检测后处理的高延迟(如NMS的O(n²)复杂度)。通过Ascend C原生实现,算子直接在NPU上运行,避免CPU-NPU数据传输开销。ops-cv算子分为image类(
之前做数值计算,一直用NumPy在CPU上跑。数据量一大,CPU就扛不住了。后来发现asnumpy这个库,让NumPy的API直接在昇腾NPU上跑,速度快了10倍不止。这篇文章就来讲讲这个库的使用方法。
去年做一个科学计算项目,需要大量三角函数和指数运算。用PyTorch原生算子在昇腾NPU上跑得特别慢。后来发现ops-math这个库,专门为数学类算子做了优化,性能直接提升了3倍。这篇文章就来讲讲这个库的使用方法。
本文对比了5款跨境电商图片翻译工具:妙言小智、马力翻译、易可图、象寄翻译和阿里云图片翻译。测试基于5种电商图片类型,从OCR识别、翻译质量、背景修复、排版还原和综合体验5个维度评分。结果显示,妙言小智以44分总分表现最优,尤其在背景修复和电商术语翻译方面突出;马力翻译适合轻度用户;易可图适合需要设计+翻译一站式服务的用户;象寄翻译支持多引擎切换;阿里云则更适合企业级集成。文章还指出Google的N
本文介绍了使用asc-devkit工具集优化Ascend C算子性能的实用技巧。通过三个核心工具:asc-profile(性能分析)、asc-debug(调试)和asc-bench(基准测试),开发者可以快速定位和解决算子性能问题。文章重点展示了如何利用asc-profile找出tiling参数过大导致的HBM读写瓶颈,并通过自动调优将MatMul算子性能提升43.6%;asc-debug帮助检测
【昇腾CANN】ops-cv算子库深度解析:让计算机视觉跑得更快
写给前端的 CANN-ops-cv:昇腾计算机视觉算子库到底是啥?
本文介绍了2025年计算机毕业设计项目的选题推荐与技术指导服务。主要内容包括:1)提供500+精品毕业设计案例,涵盖人工智能、鸿蒙系统、微信小程序等多个热门领域;2)推荐100+新颖选题,如基于深度学习的智能制造设备监控、基于强化学习的智能公交调度等;3)提供全流程技术指导,包括开题报告、代码实现、论文降重、远程答辩辅导等;4)技术支持范围广泛,包含SpringBoot、Vue、Python等主流
本文介绍了2025年计算机专业毕业设计项目资源,涵盖SpringBoot、Vue、Python等主流技术方向。提供500+精品选题案例,包括基于深度学习的智能物流系统、图神经网络的工业优化系统等前沿课题。内容包含开题报告、代码实现、论文辅导等全流程服务,特别推荐人工智能、鸿蒙系统等热门方向选题。适合计算机专业学生获取毕设灵感与技术指导,包含源码数据库等完整资源支持。
摘要:本文通过升级版代码示例,深入讲解鸿蒙ArkTS UI开发的进阶技巧。重点剖析了嵌套布局中Column容器的分组管理能力,详细解析了border属性的高级配置(虚线、圆角、颜色),并巩固了margin在不同布局层级中的作用。通过构建包含边距、边框和嵌套布局的综合页面,展示了声明式UI的组合应用与精细化控制方法,为开发者提供了从基础到进阶的实战指导。
这使得在实际应用中难以将基于昇腾后端的小模型推理能力与业务场景无缝结合,例如在视频流处理等实时性要求较高的场景中,无法实现高效的在线推理服务,依赖定制脚本脚本完善Triton Server对接pytorch backend推理。尽管该框架原生不支持NPU后端,但其服务化功能与推理后端实现了良好的解耦设计,这使得可以通过扩展推理后端实现逻辑,基于已支持的CPU后端轻松实现对NPU后端的支持。通过本次
文生图、图生图类的模型使用越来越广泛,在金融领域中可以用于营销素材、广告生成等场景。当前Qwen-Image-Edit、Stable Diffusion、Wan等系列模型大多数是通过ComfyUI等方式进行本地部署体验,然而,在实际生产环境中,这类模型通常需要以服务化的方式对外提供API接口,而非仅支持本地体验。本文基于昇腾NPU硬件产品,探索Qwen-Image-Edit模型的服务化部署方案,通
在昇腾NPU上进行模型推理部署时,通常需要将训练框架导出的ONNX模型转换为昇腾专用的OM模型格式。然而,在实际的模型转换过程中,开发者经常会遇到ATC(Ascend Tensor Compiler)工具报错导致转换失败的情况。本文基于实际项目经验,系统总结了ONNX转OM失败的常见问题及定位思路,为开发者提供实用的排查指南。基础排查:首先检查错误码,排除工具使用问题深度调试:生成DEBUG日志和