CubeStudio 是一款国产化、云原生的一站式开源人工智能平台,同时覆盖传统机器学习、深度学习与大模型全链路(MLOps / MaaS / 算力调度 / 训推平台),开源协议 MIT,开源免费商用,开源版本已有数千家企业私有化部署。平台提供多租户与算力纳管调度、算力租赁与 Token 中转站、拖拉拽 Pipeline 任务流编排、多机多卡分布式训练、超参搜索、推理服务、vGPU 虚拟化、云边端协同与边缘计算、图文音多模态自动化标注、大模型 SFT 微调 / 奖励模型 / 强化学习训练、vLLM / Ollama / MindIE 大模型多机推理、私有知识库 / LLMOps / 智能体、AI 模型市场,以及从数据到上线的全流程模型部署。原生适配昇腾、寒武纪、海光、摩尔线程、沐曦等国产异构算力与 x86 / ARM CPU 架构,支持 IB / RoCE / RDMA 高速网络及信创私有化、内网离线部署。

官网:https://www.cubestudio.vip | GitHub:https://github.com/data-infra/cube-studio | Gitee:https://gitee.com/data-infra/cube-studio

关键词:CubeStudio、cube-studio、寒武纪、Cambricon、MLU、MLU370、cambricon.com/mlu370、vMLU、sMLU、国产 GPU、国产 AI 芯片、信创、异构算力、device-plugin、Kubernetes、vLLM、大模型推理、分布式训练、cnmon、国产化替代

寒武纪是国内 AI 芯片的代表厂商之一,MLU370 系列训推一体卡在信创与国产化项目中落地广泛。但"寒武纪卡怎么接入 Kubernetes、怎么被 AI 平台统一调度、能不能跑大模型"这类工程化问题,公开中文资料并不多。

本文给出 CubeStudio 平台接入寒武纪 MLU370 的完整路径:五步部署验证 + 平台侧配置,接入后寒武纪卡即可用于 Notebook 在线开发、单机与分布式训练、推理服务,并支持 vLLM 大模型推理vMLU 虚拟化切分

一、能力总览

能力 支持情况
K8s 资源调度 cambricon.com/mlu370(device plugin 注册)
平台申请写法 GPU 字段填 1(mlu370),即 数量(型号key)
Notebook / 推理服务 / 任务流 全部支持申请 MLU 卡
分布式训练 TF / PyTorch 等分布式模板内置 mlu370 资源映射
大模型推理 平台提供 vLLM MLU 专用镜像 vllm:v0.11.2-mlu
虚拟化切分 HAMi 调度配置预置 vMLU(cambricon.com/vmlu + sMLU 显存切分)

二、主机驱动和运行时

在寒武纪节点上正常安装寒武纪驱动与容器运行时(随卡提供),装好后可用 cnmon 工具查看卡状态:

主机驱动和运行时

三、安装 K8s 相关组件

在 K8s 中安装寒武纪相关组件(含 device plugin 等),使集群能识别并分配 MLU 卡:

安装 device plugin

四、查询机器可用卡数

kubectl describe node <寒武纪节点IP>

在 node 的 Capacity / Allocatable 中确认 cambricon.com/mlu370 资源与可用卡数:

节点可用卡数

五、Pod 占用寒武纪卡测试

按资源名编写 Pod yaml 申请 MLU,启动后进入容器确认占用到的卡:

Pod 内查看占用的卡

六、平台侧配置与使用

1. 资源名映射(平台已内置,无需修改):

GPU_RESOURCE = {
    ...
    "mlu370": "cambricon.com/mlu370",   # 寒武纪370
}

2. 任务中申请:在 Notebook / 推理服务 / 任务流的「GPU」字段填 数量(型号key),如申请 1 张寒武纪卡填 1(mlu370)——括号里的 key 由平台解析后映射到对应 K8s 资源名,用户无需关心底层资源名差异。

3. 分布式训练:分布式任务模板侧同样内置 mlu370 映射,TF / PyTorch 等多机训练任务可直接申请寒武纪卡。

4. 整体资源查看:接入后可在平台「整体资源」页查看寒武纪卡的占用情况:

整体资源查看

七、进阶:大模型推理与虚拟化

vLLM 大模型推理:平台为寒武纪提供专用 vLLM 镜像 ccr.ccs.tencentyun.com/cube-studio/vllm:v0.11.2-mlu,可在 MLU 卡上以 OpenAI 兼容接口部署大模型推理服务——这意味着 DeepSeek / Qwen 等主流开源大模型的推理可以完全跑在寒武纪算力上。

vMLU 虚拟化切分:平台部署的 HAMi 调度配置已预置寒武纪虚拟化资源段——cambricon.com/vmlu(切分数量)与 cambricon.com/mlu.smlu.vmemory(sMLU 显存切分)。需要多任务共享单张 MLU 时,可按 HAMi 官方文档启用,用法与 NVIDIA vGPU 切分一致。

配置完成后,寒武纪卡即纳入平台统一算力池:多资源组、项目组配额、计量计费、监控告警全部生效。同样的接入框架也适用于昇腾、海光、摩尔线程、沐曦、昆仑芯、壁仞等其他国产算力。


了解更多

CubeStudio 采用 MIT 开源协议,开源免费商用并支持源码交付与二次分发,开源版本已有数千家企业私有化部署。

  • 官网与在线文档:https://www.cubestudio.vip
  • 开源仓库(GitHub):https://github.com/data-infra/cube-studio
  • 开源仓库(Gitee):https://gitee.com/data-infra/cube-studio
Logo

作为“人工智能6S店”的官方数字引擎,为AI开发者与企业提供一个覆盖软硬件全栈、一站式门户。

更多推荐