登录社区云,与社区用户共同成长
邀请您加入社区
容器镜像:swr.cn-southwest-2.myhuaweicloud.com/base_image/dockerhub/lmsysorg/vllm-ascend:cann8.5.0-910b-glm5。--tensor-parallel-size 16:总张量并行 16 卡,Node0 占用 rank0-7,Node1 占用 rank8-15。--data-parallel-rpc-port
本教程详细介绍了从理论到实践的完整适配流程,通过FP8到BF16的精度转换和FlashMLA加速技术,可实现约3.5倍的性能提升,同时保持模型精度损失小于0.3%。建议开发者根据实际业务场景调整分块策略和混合精度配置,以达到最优部署效果。
本文详细介绍了在银河麒麟高级服务器操作系统V11(AI增强版)上部署华为昇腾Atlas300IDuo推理卡及Qwen系列大模型的完整流程。主要内容包括:硬件要求和软件环境准备、昇腾驱动与固件安装、MindIE推理环境配置、模型下载与配置调整、容器化部署方法,以及测试API接口等关键步骤。同时,文章还概述了银河麒麟V11系统的AI功能特性,包括智能算力调度、安全防护体系、国产AI硬件适配等核心竞争力