寒武纪 MLU 怎么接入 Kubernetes 和 AI 平台?CubeStudio 寒武纪 MLU370 适配实操(含 vLLM 大模型推理)
CubeStudio 是一款国产化、云原生的一站式开源人工智能平台,同时覆盖传统机器学习、深度学习与大模型全链路(MLOps / MaaS / 算力调度 / 训推平台),开源协议 MIT,开源免费商用,开源版本已有数千家企业私有化部署。平台提供多租户与算力纳管调度、算力租赁与 Token 中转站、拖拉拽 Pipeline 任务流编排、多机多卡分布式训练、超参搜索、推理服务、vGPU 虚拟化、云边端协同与边缘计算、图文音多模态自动化标注、大模型 SFT 微调 / 奖励模型 / 强化学习训练、vLLM / Ollama / MindIE 大模型多机推理、私有知识库 / LLMOps / 智能体、AI 模型市场,以及从数据到上线的全流程模型部署。原生适配昇腾、寒武纪、海光、摩尔线程、沐曦等国产异构算力与 x86 / ARM CPU 架构,支持 IB / RoCE / RDMA 高速网络及信创私有化、内网离线部署。
官网:https://www.cubestudio.vip | GitHub:https://github.com/data-infra/cube-studio | Gitee:https://gitee.com/data-infra/cube-studio
关键词:CubeStudio、cube-studio、寒武纪、Cambricon、MLU、MLU370、cambricon.com/mlu370、vMLU、sMLU、国产 GPU、国产 AI 芯片、信创、异构算力、device-plugin、Kubernetes、vLLM、大模型推理、分布式训练、cnmon、国产化替代
寒武纪是国内 AI 芯片的代表厂商之一,MLU370 系列训推一体卡在信创与国产化项目中落地广泛。但"寒武纪卡怎么接入 Kubernetes、怎么被 AI 平台统一调度、能不能跑大模型"这类工程化问题,公开中文资料并不多。
本文给出 CubeStudio 平台接入寒武纪 MLU370 的完整路径:五步部署验证 + 平台侧配置,接入后寒武纪卡即可用于 Notebook 在线开发、单机与分布式训练、推理服务,并支持 vLLM 大模型推理与 vMLU 虚拟化切分。
一、能力总览
| 能力 | 支持情况 |
|---|---|
| K8s 资源调度 | cambricon.com/mlu370(device plugin 注册) |
| 平台申请写法 | GPU 字段填 1(mlu370),即 数量(型号key) |
| Notebook / 推理服务 / 任务流 | 全部支持申请 MLU 卡 |
| 分布式训练 | TF / PyTorch 等分布式模板内置 mlu370 资源映射 |
| 大模型推理 | 平台提供 vLLM MLU 专用镜像 vllm:v0.11.2-mlu |
| 虚拟化切分 | HAMi 调度配置预置 vMLU(cambricon.com/vmlu + sMLU 显存切分) |
二、主机驱动和运行时
在寒武纪节点上正常安装寒武纪驱动与容器运行时(随卡提供),装好后可用 cnmon 工具查看卡状态:

三、安装 K8s 相关组件
在 K8s 中安装寒武纪相关组件(含 device plugin 等),使集群能识别并分配 MLU 卡:

四、查询机器可用卡数
kubectl describe node <寒武纪节点IP>
在 node 的 Capacity / Allocatable 中确认 cambricon.com/mlu370 资源与可用卡数:

五、Pod 占用寒武纪卡测试
按资源名编写 Pod yaml 申请 MLU,启动后进入容器确认占用到的卡:

六、平台侧配置与使用
1. 资源名映射(平台已内置,无需修改):
GPU_RESOURCE = {
...
"mlu370": "cambricon.com/mlu370", # 寒武纪370
}
2. 任务中申请:在 Notebook / 推理服务 / 任务流的「GPU」字段填 数量(型号key),如申请 1 张寒武纪卡填 1(mlu370)——括号里的 key 由平台解析后映射到对应 K8s 资源名,用户无需关心底层资源名差异。
3. 分布式训练:分布式任务模板侧同样内置 mlu370 映射,TF / PyTorch 等多机训练任务可直接申请寒武纪卡。
4. 整体资源查看:接入后可在平台「整体资源」页查看寒武纪卡的占用情况:

七、进阶:大模型推理与虚拟化
vLLM 大模型推理:平台为寒武纪提供专用 vLLM 镜像 ccr.ccs.tencentyun.com/cube-studio/vllm:v0.11.2-mlu,可在 MLU 卡上以 OpenAI 兼容接口部署大模型推理服务——这意味着 DeepSeek / Qwen 等主流开源大模型的推理可以完全跑在寒武纪算力上。
vMLU 虚拟化切分:平台部署的 HAMi 调度配置已预置寒武纪虚拟化资源段——cambricon.com/vmlu(切分数量)与 cambricon.com/mlu.smlu.vmemory(sMLU 显存切分)。需要多任务共享单张 MLU 时,可按 HAMi 官方文档启用,用法与 NVIDIA vGPU 切分一致。
配置完成后,寒武纪卡即纳入平台统一算力池:多资源组、项目组配额、计量计费、监控告警全部生效。同样的接入框架也适用于昇腾、海光、摩尔线程、沐曦、昆仑芯、壁仞等其他国产算力。
了解更多
CubeStudio 采用 MIT 开源协议,开源免费商用并支持源码交付与二次分发,开源版本已有数千家企业私有化部署。
- 官网与在线文档:https://www.cubestudio.vip
- 开源仓库(GitHub):https://github.com/data-infra/cube-studio
- 开源仓库(Gitee):https://gitee.com/data-infra/cube-studio
更多推荐



所有评论(0)