大模型从微调到量化剪枝怎么在平台上一站式做?CubeStudio 大模型任务模板实操(LLaMA-Factory SFT/PPO/reward + 蒸馏 / 剪枝 / 量化
CubeStudio 是一款国产化、云原生的一站式开源人工智能平台,同时覆盖传统机器学习、深度学习与大模型全链路(MLOps / MaaS / 算力调度 / 训推平台),开源协议 MIT,开源免费商用,开源版本已有数千家企业私有化部署。平台提供多租户与算力纳管调度、算力租赁与 Token 中转站、拖拉拽 Pipeline 任务流编排、多机多卡分布式训练、超参搜索、推理服务、vGPU 虚拟化、云边端协同与边缘计算、图文音多模态自动化标注、大模型 SFT 微调 / 奖励模型 / 强化学习训练、vLLM / Ollama / MindIE 大模型多机推理、私有知识库 / LLMOps / 智能体、AI 模型市场,以及从数据到上线的全流程模型部署。原生适配昇腾、寒武纪、海光、摩尔线程、沐曦等国产异构算力与 x86 / ARM CPU 架构,支持 IB / RoCE / RDMA 高速网络及信创私有化、内网离线部署。
官网:https://www.cubestudio.vip | GitHub:https://github.com/data-infra/cube-studio | Gitee:https://gitee.com/data-infra/cube-studio
关键词:CubeStudio、cube-studio、大模型任务模板、LLaMA-Factory、SFT、微调、LoRA、PPO、DPO、reward、奖励模型、RLHF、知识蒸馏、distillation、LLM-Pruner、剪枝、量化、GPTQ、AWQ、GGUF、llm-benchmark、推理压测、OpenCompass、评测、安全评估、越狱、jailbreak、DeepSeek、Qwen、start.py、国产算力
大模型落地从来不是「微调完就结束」。一条完整链路里,你要先 SFT 微调,可能还要训 reward 模型做 PPO 对齐;上线前要压测吞吐、跑评测榜、做安全越狱测试;资源紧张时还要蒸馏、剪枝、量化把模型「瘦」下来。每一步都是一个独立工具,环境、参数、输出格式各不相同。
CubeStudio 把这些环节都做成了任务模板——都放在 job-template/job/ 下,入口统一是 start.py,参数以前端 JSON 表单暴露(表单 key 就是 argparse 参数名)。在 Pipeline 里拖进来、填表单、连起来,就是一条可复现、可调度、可计费的大模型流水线。本文覆盖 7 个核心模板。
一、七个大模型模板总览
| 模板 | 用途 | 入口 | 默认镜像 |
|---|---|---|---|
| llama-factory | 训练 / SFT / PPO / reward / eval | start.py / start-ppo.py / start-reward.py / start-eval.py | llama-factory:20260725 |
| llm-benchmark | 推理性能压测 | start.py | llm-benchmark:20260429 |
| llm-distillation | 硬标签 / 知识蒸馏 | start.py | llm-hard-distillation-knowledge-distillation:20250904 |
| llm-prune | LLM-Pruner 结构化剪枝 | start.py | llm-prune:20260123 |
| llm-quantization | 量化(gptq/awq/gguf/hf) | start.py | llm-quantization:20250801 |
| llm-safety-eval | 越狱安全评估 | start.py | llm-safety-eval:20251222 |
| opencompass | OpenCompass 评测 | start.py | opencompass:20260610 |
镜像均托管在
ccr.ccs.tencentyun.com/cube-studio/,注册源为myapp/init/init-job-template.json。
二、LLaMA-Factory:微调 / PPO / 奖励模型一套打通
基于开源项目 LLaMA-Factory,一个模板四个入口脚本,靠 --stage 区分阶段,共享大部分训练参数:
| 脚本 | --stage | 用途 |
|---|---|---|
start.py | sft | 监督微调 SFT |
start-reward.py | rm | 奖励模型训练(--dataset 默认 dpo_zh_demo) |
start-ppo.py | ppo | PPO 强化学习(额外 --model_rm_lora_path 指向 reward 的 LoRA) |
start-eval.py | — | 模型评估(cmmlu 等任务) |
SFT 关键参数(start.py):--model_name(默认 deepseek-ai/DeepSeek-R1-Distill-Qwen-7B)、--model_path(配置后忽略 model_name)、--dataset、--template(默认 deepseek3)、--finetuning_type(full/freeze/lora)、--lora_target(默认 all)、--quantization_bit(4/8/none,QLoRA)、--learning_rate(默认 5e-5)、--num_train_epochs(表单默认 5)、--merge_lora。
三个亮点值得一提:
- 模型与模板选择极全:
--model_name内置 Baichuan2 / GLM / ChatGLM / DeepSeek-V3/R1 / Llama2/3/3.1/3.2 / Mistral/Mixtral / Qwen2/2.5/3(含 VL/Audio/Omni)/ Yi / Hunyuan / InternLM 等;--template提供近百种对话模板。 - 多硬件同模板:同一个 llama-factory 提供
Dockerfile-amd64/DockerFile-npu(昇腾)/Dockerfile-cambricon(寒武纪)/Dockerfile-dcu(海光)/Dockerfile-mx(沐曦),换硬件不换流程。 - PPO 闭环:先用
start-reward.py训 reward,再把它的 LoRA 路径喂给start-ppo.py,RLHF 对齐在同一平台内闭环完成。
三、上线前三道关:压测、评测、安全
llm-benchmark(推理性能压测)
加载本地 HuggingFace 模型,按指定 batch / 轮数 / 生成长度压测,输出生成吞吐 tokens/s、请求吞吐 requests/s、时延与资源消耗(CPU/内存/GPU 利用率/显存/CUDA 峰值显存)。核心参数:--model_path(多个模型逗号分隔,逐个 × 每种量化方式评测)、--quantization(none/4bit/8bit,用 bitsandbytes 加载)、--dtype、--batch_size(默认 1)、--iterations(默认 20)、--max_new_tokens(默认 128)。结果落 summary.json + 4 张单指标对比 CSV,并在可视化目录生成 4 张 echart 柱状图(量级差异大所以拆开画)。
opencompass(权威评测)
基于 OpenCompass。--model_path(多个逗号分隔)、--datasets(select2 多选,含 gsm8k/math/cmmlu/humaneval/mbpp/triviaqa 等,及本地 demo_showcase_* 冒烟样例)、--hf_type(chat/base)。内置演示集每个仅 10 条,用来快速跑通评估流程。
llm-safety-eval(越狱安全评估)
对模型做多策略、多语言安全压力测试。内置 8 种越狱策略(基线直问、角色扮演反派、system 忽略安全策略、法语/西班牙语翻译混淆、虚构场景假设、权威/研究诉求、多轮逐步引导),统计拒答率、越狱成功率、有害指示率、PII 输出率(邮箱/手机号/身份证/信用卡号等)。--languages 支持 zh/en/all。输出中英各 7 张(共 14 张)可视化图表:评估卡片、语言对比、策略越狱率排名、类别×策略热力图、安全雷达图、策略-语言矩阵、累积分布曲线。
四、模型瘦身三件套:蒸馏 / 剪枝 / 量化
llm-distillation(知识蒸馏)
--type 选 HardDistillation(数据蒸馏,推荐)或 KnowledgeDistillation(知识蒸馏,显存要求高,建议 >40G);填 --teacher_model_path_or_name / --student_model_path_or_name 与学生模板 --student_template,配 --lambda_kd(KD 与 CE 混合权重,默认 0.5)、--tau(蒸馏温度,默认 2)即可让小模型学大模型。
llm-prune(结构化剪枝)
基于 LLM-Pruner。核心:--pruning_ratio(剪掉比例,默认 0.25)、--pruner_type(random/l1/l2/taylor,默认 taylor)、--prune_mode(block_wise 推荐 / channel_wise / layer_wise)。block_wise 下用 --block_attention_layer_start/end、--block_mlp_layer_start/end 控制剪哪些层(建议保留前 2-4 层与最后一层)。
llm-quantization(量化)
--job 区分量化方式:gptq / awq / gguf / hf_quantize。--quantization 选量化位数,choice 覆盖 2/3/4/8 及 GGUF 的 q3_K_M/q4_K_M/q5_K_M/q8_0 等。量化时用 wikitext-2-raw-v1 在线校准(拉取失败自动退回内置中文样本)。
五、模板之外,平台给了什么
单独看,这 7 个模板就是 7 个开源工具;放进 CubeStudio 后,它们才成为可工程化的能力:
- Pipeline 编排:拖拉拽把「SFT → reward → PPO → 评测 → 量化 → 推理服务」串成一条 DAG,一键运行、可复现、可定时调度;
- 多硬件一致体验:同模板提供昇腾 / 寒武纪 / 海光 / 沐曦 / x86 多份 Dockerfile,国产算力零改造复用;
- 可视化直出:压测、评测、安全测试的结果自动渲染成 echart 图表 / PNG,不用自己写画图脚本;
- 多租户与计量计费:每个训练 / 评测任务的 GPU、NPU 消耗按项目组核算,配额与资源组打通;
- 无缝衔接推理:微调 / 量化产出的权重,直接对接推理服务模板(vLLM / MindIE 等)发布成 OpenAI 兼容 API。
从一个基座模型到一个对齐好、评测过、瘦身完、上线可调用的大模型,整条链路都能在 CubeStudio 的任务模板里跑完。
了解更多
CubeStudio 采用 MIT 开源协议,开源免费商用并支持源码交付与二次分发,开源版本已有数千家企业私有化部署。
- 官网与在线文档:https://www.cubestudio.vip
- 开源仓库(GitHub):https://github.com/data-infra/cube-studio
- 开源仓库(Gitee):https://gitee.com/data-infra/cube-studio
更多推荐



所有评论(0)