CANN 端云协同:节约开发、运行成本,支撑Mate90发布会鸿蒙独占应用创新
CANN端云协同将云侧研发积累延伸至终端开发。依托昇腾与麒麟NPU同源的达芬奇(DaVinci)架构,以及CANN软件开发能力,开发者在昇腾上完成的部分模型适配与算子实现,可以继续沿用于麒麟端侧,在降低开发投入的同时,也有助于降低云侧推理成本。
摸小宠将基于昇腾训练的自研模型能力带入了鸿蒙终端。这款由魔芯科技开发的宠物3D重建应用,在本次手机发布会上作为鸿蒙独占应用亮相。其MoWorld-2.0模型在昇腾上完成训练,经量化与裁剪形成端侧版本,再通过算子代码的沿用与针对性适配,完成麒麟端侧部署。
算子资产与经验的端云协同,为模型迁移减少了重复开发工作,让云侧研发投入进一步服务于手机产品。
01 从昇腾到麒麟:延续硬件亲和设计与算子协同,减少落端工作量
昇腾与麒麟NPU均基于DaVinci架构,底层统一采用CANN软件栈,这意味着昇腾云侧训练的模型可便捷迁移至麒麟端侧芯片,实现“云端一致”的算子开发体验。
MoWorld-2.0模型在研发时,已将DaVinci硬件的亲和设计纳入其中。这种硬件亲和性的延续,使模型研发与终端适配顺畅衔接,端侧适配时无需再考虑模型架构是否适合端侧硬件设计。
端侧模型虽规格小于云侧,但保留了云侧模型的核心计算结构。通过量化与裁剪,形成约0.6B的端侧版本模型,其核心计算模块及相关算子结构与云侧保持一致,面向昇腾的计算设计仍然适用,也为底层代码的端云共用创造了条件。
算子作为模型执行计算的基本单元,其实现的跨设备复用程度,直接影响模型端侧部署的复杂度。摸小宠的端侧算子适配直接沿用了云侧训练阶段积累的代码,端侧仅需少量适配工作。此次迁移涉及的Vector类算子中,约85%的代码可原样保留,仅Tile等硬件强相关部分需要面向端侧调整。
基于统一的CANN软件栈,训练完成的模型只需四步即可部署到麒麟手机:

Step1 模型量化
使用量化工具对模型进行量化压缩,降低端侧推理开销。
Step2 模型导出
基于PyTorch框架配合torchAir插件,导出量化后的AIR模型(Ascend IR),自定义算子随之一并封装其中。
Step3 模型转换
使用ATC工具对AIR模型进行优化与编译,生成可直接部署的离线模型。ATC在转换过程中逐算子编译,因此需要提供自定义算子在麒麟侧的实现。得益于麒麟与昇腾统一的Ascend C编程API,训练阶段在昇腾上实现的自定义算子可快速迁移至端侧,大幅降低适配成本。

Step4 推理部署
将离线模型打包进鸿蒙HAP包,通过调用鸿蒙系统的CANN Kit库,即可在端侧完成模型推理。
基于此端云协同架构,单个算子从云侧迁移到手机从“以月计”变成“以天计”。摸小宠仅用数周时间即完成了自研模型的端侧适配。
02 摸小宠端云协同三维重建体验,节省计算成本
摸小宠致力于把用户相册中的静态宠物照片转化为真实感强、可交互的4D空间资产,提供“宠物就在身边”的沉浸式体验。市场上的同类产品缺乏还原真实宠物的能力,摸小宠基于自研新一代MoWorld-2.0技术,实现了通过用户的1-4张照片就能在云端还原出拟真的用户宠物的4D数字分身。
摸小宠基于用户输入的宠物图片,在麒麟端侧运行约6亿参数规模的MoWorld-2.0-flash模型;云侧昇腾平台上的扩散模型进一步参与生成,构建出更高质量的3D高斯模型,再回到手机端完成渲染与呈现。
端侧模型推理有助于节约运行成本。将MoWorld-2.0-flash部署在麒麟后,相应计算环节对云侧资源的需求随之减少,具体收益因业务流程、设备与使用场景而异。
03 进一步探索研发成果的端云共用
开发投入与运行成本,共同影响AI应用的持续供给。对拥有模型研发能力的团队而言,拓展终端产品既要承担新增的适配投入,也要考虑应用上线后的计算成本。
CANN端云协同从产品开发与服务运行两个阶段入手改善成本结构:云侧研发投入能够服务于后续终端产品,有助于降低拓展新场景时的额外工作量负担;应用上线后,结合业务需要灵活安排端侧与云侧计算,则可进一步控制运行成本。
端云生态协同的价值不止于此。欢迎昇腾与鸿蒙生态的开发者,面向更多创新场景,与CANN开源社区深入交流,共同探索端云协同的更多可能。
更多推荐




所有评论(0)