登录社区云,与社区用户共同成长
邀请您加入社区
特别是它家的C3-HDMI0808S,属于专为会议室/报告厅场景做的一款无缝矩阵,支持HDMI 1.4b、HDCP 1.4标准,主打信号无缝快速切换(无黑屏、无闪屏),还带RS-232/TCP/IP/Web控制,甚至支持鸿蒙、麒麟、统信这种国产操作系统,适配方面确实很懂行业需求。但坦白说,淳中的产品在功能性上偏向于传统稳定,如果你既想要性价比、又想要相对合理的配置服务,这两年的新锐厂商里,青象信息
摘要 本文探讨了鸿蒙PC版Markdown编辑器OhMarkdown中防误操作设计的关键机制,重点分析了未保存内容标签关闭时的状态管理。主要设计要点包括: 区分关闭意图与关闭提交,确保脏标签必须经过用户确认 提供取消/放弃/保存三个明确选项,避免简单布尔确认框导致的数据丢失风险 实现后台标签激活再保存的机制,保证保存内容准确性 采用pendingCloseSessionId标记等待关闭的会话,确保
本文介绍了HarmonyOS NEXT中的HTTP客户端模块@ohos.net.http,它提供了完整的网络请求功能。核心流程分为创建实例、发起请求和销毁实例三步,通过Promise实现异步操作。文章详细解析了HttpRequest、HttpRequestOptions、RequestMethod等核心API的使用,包括请求配置、响应处理和错误处理策略。该模块支持GET、POST、PUT、DELE
HarmonyOS NEXT剪贴板API使用指南 本文介绍了HarmonyOS NEXT中的@ohos.pasteboard剪贴板API模块,该系统服务提供了完整的剪贴板管理能力。文章从API架构、核心操作到权限模型进行了详细解析: API架构:剪贴板采用单例模式,通过getSystemPasteboard()获取全局实例,支持异步和同步操作。 核心功能: 写入剪贴板:使用setData()方法,
一直对昇腾矩阵乘法的A,B和C矩阵的各类数据格式很好奇,到底这样设置为什么会对性能有较大的提升?
本文介绍了HarmonyOS中指针样式管理模块(@ohos.multimodalInput.pointer)的核心功能与应用场景。该模块主要用于2in1设备、平板桌面模式等支持外接鼠标的场景,提供30+种系统预定义指针样式(如方向箭头、操作手势、调整大小等)、指针显隐控制及自定义光标功能。文章通过一个可视化"指针样式实验室"Demo,展示了如何分类调用各种指针样式,并提供了完整代码实现,帮助开发者
本文介绍了鸿蒙HarmonyOS ArkTS首帧布局优化的核心技术方案。该方案基于龍魂系统性能优化层,针对鸿蒙原生应用的首帧渲染进行深度优化,通过布局计算优化、懒加载策略、预加载机制、缓存复用、异步渲染等8大技术模块,构建完整的性能优化流水线。系统采用国密SM2/SM3签名验证确保数据安全,不上传云端。性能模型通过量化指标(首帧时间、布局耗时、FPS等)评估优化效果,设定了优秀(<100ms)、良
文章摘要:龍魂协议与鸿蒙智能体开发实战 本文介绍"龍魂协议"在鸿蒙HarmonyOS NEXT系统中的应用开发框架,重点阐述其智能体通信协议和系统架构设计。该协议包含智能体注册、意图识别、任务分发等核心功能模块,采用国密SM2/SM3算法保障数据安全,支持端到端加密和跨设备流转。系统采用分层架构设计,从龍魂协议层到鸿蒙系统能力层实现完整闭环。文章详细展示了协议常量定义、智能体档案模型等核心代码实现
状态建模核心主页面实现数据库持久化模块清单文件路径说明数据模型SupplyItem/InventoryRecord/PurchaseRequest主页面完整UI数据库关系型存储详情弹窗物资详情出入库弹窗扫码/拍照/登记采购弹窗多级审批预警面板预警列表鸿蒙特性使用特性用途APIArkTS声明式UI界面构建状态管理数据响应关系型数据库本地加密存储
文章摘要: 《龍魂蚁群架构视觉·专项技术解析》提出"镜像视界"概念,通过物理视界(传感器实时采集)与数字孪生(零断点复制、全时空同步)的无缝切换,实现动态目标的跨镜追踪与智能调度。其核心技术包括:1)零断点跨镜接力,利用镜像预测填补传统3-5秒的断点丢失;2)蚁群分布式协同,通过侦察蚁(边缘检测)、通信蚁(数据同步)、预测蚁(轨迹填补)等节点分工,结合鲲鹏/昇腾算力实现实时预测与调度。技术架构采用
HarmonyOS NEXT 空间变换进阶指南:matrix4 深度解析 本文深入探讨 HarmonyOS NEXT 声明式 UI 中的 matrix4 变换功能,通过构建"3D变换实验室"展示如何突破单一变换属性的局限。主要内容包括: matrix4 的必要性 分析单一变换属性叠加的三大局限:顺序耦合、运算效率低、无法反向计算 介绍4×4齐次变换矩阵的数学原理 核心API详解 创建矩阵的三种方式
本文档是华为鸿蒙系统API开发与交付的标准模板(v1.0),主要包含以下核心内容: 7项必检清单:包括权限声明、动态服务器地址配置、错误处理、设备能力检查、构建配置、多设备资源适配和UI动态适配等关键要求。 标准配置文件模板: module.json5:包含模块定义、设备类型支持和详细权限声明规范 build-profile.json5:提供签名配置、SDK版本和严格模式等构建参数 运行时权限请求
本文介绍了如何在HarmonyOS NEXT中使用ArkTS实现Sepia棕褐色滤镜效果。通过鸿蒙的ArkGraphics2D套件和ColorFilter API,开发者可以高效地应用颜色矩阵变换来模拟复古照片效果。文章详细解析了颜色矩阵的数学原理,包括单位矩阵、标准Sepia变换矩阵及其线性插值实现,指导读者从项目搭建到代码实现的全过程。此外,还涵盖了性能优化建议和常见问题解决方案,帮助开发者掌
CANN(Compute Architecture for Neural Networks)是华为昇腾AI处理器的统一计算框架,负责将深度学习模型中的算子调度到昇腾NPU硬件上高效执行。在神经网络推理与训练场景中,矩阵乘法和激活函数是出现频率最高的两类算子,它们在昇腾NPU上的执行效率直接决定了整个网络的吞吐与延迟表现。
颈椎健康打卡需要严密的物理模型校验。本文将深入解析前置 AR 相机位姿三维旋转矩阵,从四元数到欧拉角(Yaw/Pitch/Roll)的完整运动学公式推导,并实战重塑高精度的头部上下左右倾斜角度解算算法。
本文摘要: 蛋白质折叠分子动力学模拟通过Verlet邻接列表算法优化原子间作用力计算。传统方法需计算50亿对原子相互作用,而该算法利用空间哈希技术将计算量缩减至2000万对。算法核心是将三维空间划分为边长14Å的立方体网格(12Å截断半径+2Å缓冲),通过哈希桶排序和27邻域搜索快速定位邻近原子。具体实现包括:1) 三维空间哈希映射原子坐标到网格单元;2) 并行排序优化桶内原子索引;3) 周期性边
文章摘要: LLM分布式训练的瓶颈在于显存而非算力。以Llama-7B模型为例,Adam优化器状态(28GB)比模型权重(14GB)占用更多显存。cann-recipes-train实现了ZeRO(Zero Redundancy Optimizer)的三个阶段:ZeRO-1仅切分优化器状态,通过AllGather/ReduceScatter通信将单卡显存从42GB降至38.5GB;ZeRO-2进一
鸿蒙数学第九阶(九宫・系统矩阵篇),外在是向量、矩阵、线性代数等现代线性系统工具,内在是河洛九宫、阴阳五行、天人合一的华夏传统系统哲学。从内核来看,它补齐了鸿蒙数理 “系统联动” 的短板,完成从静态形体、单变量动态到多维集群系统的完整升维,所有规则溯源大道、自洽闭环;从应用来看,它横跨传统国学、人工智能、工程制造、经济管理、日常生活,是古今通用的复杂问题解析框架;从传承来看,它打通华夏象数与现代数
2024年双11,京东“京小智”智能客服系统累计服务超过42亿人次。在每一次复杂的用户咨询背后,并非一个巨型呼叫中心,而是一支由客服、导购、跟单、分析、质检五个专业智能体组成的虚拟团队。当用户说出“手机还没收到又降价了”,物流专家、政策专家、情绪安抚三个智能体同时被唤醒,各自查询、计算、准备话术,最终由协调员合成一条完整回复。
昇腾NPU矩阵乘白盒化组装实践 昇腾CANN通过catlass模板库实现矩阵乘算子的白盒化组装,开发者可精细控制计算流程。关键点包括: Tile配置:需平衡寄存器压力与并行度,K维度必须16字节对齐(如128x128x32) Epilogue融合:支持激活函数与Bias加法等后处理,以计算换带宽 性能调优:从基准Tile(128x128x32)起步,大矩阵可尝试256x128x64 注意事项:Ep
你有没有遇到过这种情况:做信号处理,用NumPy的FFT算个1024点变换,要算半天。后来发现昇腾CANN有个ops-fft库,专门加速FFT计算,同样的计算在NPU上只要几毫秒。这篇文章就来讲讲FFT是啥、为啥要优化、怎么用ops-fft库。
之前做科学计算,最头疼的就是大矩阵乘法。用NumPy在CPU上跑,一个1024×1024的矩阵乘就要200ms。后来发现ops-blas这个库,专门优化线性代数计算,同样的计算在昇腾NPU上只要15ms。这篇文章就来讲讲这个库的使用方法。
ops-blas是昇腾CANN社区的高性能线性代数算子库,核心价值是把GEMM在昇腾NPU上的性能推向理论峰值——算力利用率从38%提升到85%,带宽利用率从45%提升到92%,比PyTorch默认实现快3倍。核心优化技术合理分块:针对Cube Core特性选择最优分块大小(256×128×16),算力利用率提升2.2倍:数据搬运和计算重叠,带宽利用率提升2.0倍算子融合:GEMM和ReLU/Ba
本文介绍了如何使用Ascend C语言在昇腾平台上开发自定义矩阵乘法算子。主要内容包括: 开发环境准备:安装CANN工具包并创建算子工程框架 算子原型定义:通过头文件和实现文件定义算子的输入输出及属性 核心算子实现: 使用GlobalTensor和LocalTensor管理内存 实现基本的矩阵乘法计算流程(GM->UB->计算->GM) 提供优化版本建议(使用Cube Unit加速) 文章详细展示
本文介绍了专为昇腾NPU设计的矩阵乘算子模板库catlass,其核心定位是为昇腾CANN提供高性能矩阵乘算子模板,支持TLA/MLA/FlashAttention等优化方案。catlass采用分层抽象设计,将算子拆分为Epilogue、Kernel、Tensor Operator和Device四层,支持白盒化组装和硬件特化。重点介绍了三种核心模板:TLA模板优化张量分块策略,MLA模板实现多头并行
昇腾NPU强化学习训练实战——从PPO到GRPO的完整落地
某团队在昇腾NPU上实现了FlashAttention,测试时发现大多数case都正确,但有几个边界case输出了错误结果——Loss只差一点点,但长序列场景下输出差异明显。他们怀疑是数值精度问题,也怀疑是算法实现有bug。问题是:没有系统性地验证FlashAttention的正确性。测试几个case不能证明算法是对的,需要形式化验证和边界条件覆盖。今天把FlashAttention的正确性验证方
ops-nn 的 MatMul 融合算子通过三项核心技术实现。
摘要:矩阵乘法在昇腾NPU上需要精细优化才能发挥Cube单元性能,传统手写方式需200-300行AscendC代码。catlass模板库通过三层抽象设计(TLA逻辑层、MLA映射层、PLA物理层)实现高性能矩阵乘的快速开发,代码量减少80%且性能接近手写。与CUTLASS不同,catlass专为昇腾达芬奇架构定制,利用硬件流水特性实现计算与搬运重叠。该模板库适用于99%的矩阵乘场景,显著提升开发效
想象一下,你是一个乐高积木工厂的设计师。你的任务不是为每个孩子造一个成品城堡,而是设计一套"基础砖块+连接件+装饰件"的组合系统——孩子们可以用这套系统拼出他们想要的任何东西。catlass 就是昇腾矩阵乘算子的"乐高工厂"
FlashAttention的核心不是"算得快",而是"少访存"。通过分块计算和在线softmax,把注意力矩阵从HBM搬到L1 Buffer,访存量从O(S²)降到O(S)。Ascend C语言直接调用达芬奇架构分块大小根据L1 Buffer容量自动选择支持因果mask、多head、FP16/FP32一句话说清楚:传统attention是"先算完再存",FlashAttention是"边算边累加
摘要:本文介绍了如何将Flutter三方库matrices适配到开源鸿蒙平台,实现高性能矩阵运算功能。文章从原理、优势、适配方法和应用场景四个方面展开,重点讲解了该库在线性代数运算中的核心价值,包括矩阵转置、相乘、求逆等高级操作。通过示例代码展示了如何在鸿蒙项目中集成该库,并针对大数据运算可能导致的性能问题提出了使用Isolate的解决方案。最后提供了一个实战演示界面,展示矩阵运算在图形渲染等场景
本文系统解析了昇腾CANN性能剖析工具链的原理与应用。工具链采用三级数据采集架构,实现低开销高精度的性能分析,可显著提升硬件利用率至85%以上。文章详细介绍了性能数据采集策略、流水线效率分析方法,以及针对计算/内存瓶颈的优化技术,包括数据分块、双缓冲等。通过企业级案例展示了如何将NPU利用率从35%提升至78%。最后提出了建立自动化测试框架、持续优化文化等最佳实践,为开发者提供了完整的性能优化体系
给定稀疏权重矩阵 W∈RM×K(稀疏),激活矩阵 X∈RK×N(稠密),输出 Y=W⋅X∈RM×N。values:非零元素值(FP16):对应列号(INT32)row_ptr:每行起始偏移(INT32)[3, 0, 4]]在昇腾 NPU 上,稀疏计算不仅是可行的,更是高效的。通过 Ascend C 手写 SpMM 算子,我们成功将大模型推理推向更高能效比的新阶段。支持结构化稀疏(如 2:4 Spa
在深度学习领域,矩阵乘法(MatMul)是最基础、也是最关键的操作之一。无论是 Transformer 的注意力机制、传统的全连接网络,还是卷积操作的底层实现,都绕不开高性能的矩阵运算。在昇腾 NPU 上开发一个高效 MatMul 算子并不是简单地把数学公式翻译成代码,而是要充分理解计算密度、内存带宽、硬件单元以及数据流调度等多维因素。
本文深入剖析AscendC算子开发中的边界条件处理与计算精度保障两大核心挑战。通过系统分析内存对齐、越界访问等边界问题,以及FP16精度损失、累加误差等数值稳定性问题,提供从原理到实践的完整解决方案。文章包含企业级案例研究,如动态分块矩阵乘法优化和高精度Softmax实现,并展望自动化边界检查、自适应精度选择等前沿方向。开发者可获得边界处理清单和精度优化检查表等实用工具,提升算子健壮性。作为昇腾训
本文系统阐述了AscendC算子开发中Tiling策略的调试与优化方法论。基于昇腾AI处理器架构特性,详细解析了Tiling参数调优、性能分析工具使用、瓶颈定位技巧等关键技术,并通过矩阵乘法和推荐系统等实战案例,展示了从算子级优化到硬件级性能极限的全流程。文章构建了包含理论分析、工具集成、自动化调优框架的完整性能优化体系,为开发者提供了从功能实现到性能极致的系统化解决方案。