登录社区云,与社区用户共同成长
邀请您加入社区
摘要: CubeStudio作为国产开源AI平台,全面支持寒武纪MLU370芯片的Kubernetes调度与AI任务全流程。本文详细介绍了从驱动安装、K8s组件部署到平台集成的五步操作方案,实现MLU卡在Notebook开发、分布式训练及vLLM大模型推理中的应用。平台通过资源映射机制(如1(mlu370)格式申请)统一管理异构算力,并支持vMLU虚拟化切分。该方案已适配昇腾、海光等国产芯片,助力
CubeStudio开源AI平台成功接入壁仞国产GPU的完整方案发布。该方案包含六个关键步骤:获取安装资料、部署主机驱动与容器运行时、安装Kubernetes组件(device plugin/agent/exporter)、验证节点卡数、Pod占卡测试及平台资源配置。通过标准化流程,壁仞GPU可像NVIDIA一样被统一调度,支持Notebook、训练和推理服务。方案同时解决了常见问题排查指南,体现
问题出在DCMI 24.1.rc1 对 310B1 芯片返回的 AI Core 数量是浮点数1.000000(310B1 只有 1 个物理 AI Core)。函数将其转为int64(1),然后检查[8, 36]的合法范围——1 < 8,直接被拒绝。device-plugin 的 AI Core 数量范围默认假设芯片至少有 8 个 AI Core,而 310B1 只有 1 个。这是一个代码层面没有考
昇腾 NPU 在 Kubernetes 上的落地实战指南
本文将围绕 Ascend NPU 在 Kubernetes 中是如何被感知、注册和调度的 这一核心问题,结合真实运维场景,给大家依次介绍:ascend-device-plugin-daemonset 是什么它在 Kubernetes 中扮演什么角色它是如何工作的与 NVIDIA GPU device-plugin 的异同实际运维中必须掌握的检查与排障方法