登录社区云,与社区用户共同成长
邀请您加入社区
调优的本质不是"把参数拉满",而是理解每个参数背后的物理约束,在相互冲突的目标间找平衡点:容量 vs 稳定性 → 选 0.85:吞吐 vs 激活显存/延迟 → 选 32768 甜点:长 prompt 吞吐 vs 短请求延迟 → 让短的插队CPU Offload:HBM 容量 vs PCIe 带宽 → 用 200GB 换"不重算"最重要的那条建议:别信任何估算(包括本文的数字),用你自己机器的启动日
摘要:本文介绍了昇腾NPU在多卡推理场景下的通信优化方案。重点分析了三种并行策略(TP、PP、EP)的通信模式及对应的HCCL接口实现,包括AllReduce、AllGather和ReduceScatter等核心通信原语。详细展示了HCCL环境初始化的关键步骤和注意事项,并通过代码示例演示了张量并行中的AllReduce操作和专家并行中的AllGather+ReduceScatter通信对实现。文