登录社区云,与社区用户共同成长
邀请您加入社区
CubeStudio开源AI平台成功接入壁仞国产GPU的完整方案发布。该方案包含六个关键步骤:获取安装资料、部署主机驱动与容器运行时、安装Kubernetes组件(device plugin/agent/exporter)、验证节点卡数、Pod占卡测试及平台资源配置。通过标准化流程,壁仞GPU可像NVIDIA一样被统一调度,支持Notebook、训练和推理服务。方案同时解决了常见问题排查指南,体现
HugePages 是宿主机 CPU 大页内存,是昇腾 CANN 驱动、NPU 通信、显存辅助缓存的底层依赖资源;推理服务异常退出会造成巨页共享内存内核残留无法释放,HugePages 耗尽会造成昇腾 Runtime 运行异常、显存管理错乱、假性显存不足;清理ipcs -m里的 ascend 共享内存,是清理驱动遗留的巨页内存垃圾,让 CANN Runtime 初始化恢复正常,NPU 显存分配逻辑
问题出在DCMI 24.1.rc1 对 310B1 芯片返回的 AI Core 数量是浮点数1.000000(310B1 只有 1 个物理 AI Core)。函数将其转为int64(1),然后检查[8, 36]的合法范围——1 < 8,直接被拒绝。device-plugin 的 AI Core 数量范围默认假设芯片至少有 8 个 AI Core,而 310B1 只有 1 个。这是一个代码层面没有考
改完环境变量后,后续所有 modelscope/huggingface 操作都自动走大分区,无需每次手动指定路径。恢复方法:停止 Docker,将旧目录内容 mv 到新路径,再启动 Docker。对应 CANN 9.0,可在页面右上角切换版本,选与驱动版本匹配的(本机驱动 25.5.2)。(内核 6.6.0-159.x),SP4 内核与驱动预置的闭源二进制模块不兼容,会导致。Root Dir 被改
备份目录需确保ClickHouse进程(UID=101)有写入权限,否则无法生成shadow数据。非MergeTree系列引擎的表无法执行FREEZE冻结分区,不会生成shadow数据目录。全端覆盖:H5 / 小程序 / APP / 鸿蒙全覆盖,统一导出口径。宿主机执行备份恢复会因路径不一致失败,所有操作必须在容器内执行。需准确判断备份、上传的真实失败情况,而非仅依赖命令返回值。一体化架构:监控
昇腾NPU强化学习训练实战——从PPO到GRPO的完整落地
昇腾 NPU 在 Kubernetes 上的落地实战指南
问题解决方案原理昇腾驱动初始化失败启用提供完整内核访问权限容器使用了错误的 NPU 卡设置在驱动层逻辑隔离设备多服务共享 NPU 集群每个服务指定不同实现资源隔离,避免冲突通过合理组合这两个机制,你可以在保证服务稳定运行的同时,精确控制 NPU 资源分配,为生产环境提供可靠支持。记住→ 解决“能不能用”→ 解决“用哪张”二者缺一不可,共同构成昇腾容器化部署的基石。
在昇腾服务器启容器时,可能会遇到识别不到npu,或者npu-smi info不能正常使用的情况
Auto:自动布局StartCenterEndBaselineStretch:交叉轴方向拉伸填充,在未设置尺寸时,拉伸到容器尺寸。Start(默认值):设置子组件在纵轴方向首部对齐。Center:设置子组件在纵轴方向居中对齐。End:设置子组件在纵轴方向尾部对齐。:设置子组件在纵轴方向等间距布局。:设置子组件在纵轴方向间距布局,并且首尾子组件到 Flex 的间距是子组件间距的一半。:设置子组件在纵
本文分享了在昇腾NPU环境部署PaddleOCR v5的经验总结。作者详细记录了从环境准备到最终部署的完整流程,重点剖析了三个关键问题:libmsprofiler.so缺失、libmki.so未引入及libatb.so目录覆盖问题。通过逐步修正Docker挂载路径和环境变量配置,最终实现了服务的稳定运行。文章提供了可直接复用的Docker Compose部署方案,帮助开发者避免类似问题。整个过程体
摘要:本文介绍了在昇腾NPU上部署Qwen3大模型并打包为可移植镜像的完整流程。通过docker commit固化运行环境,利用docker-compose.yml管理启动参数,配合.env文件配置可变路径,实现模型服务一键部署。重点解决了环境一致性、路径适配和跨机器迁移问题,并提供了常见错误排查方法,为昇腾NPU用户提供了一套高效可靠的模型部署方案。(149字)