logo 人工智能6S服务平台

人工智能6S服务平台
首页Token服务
展示(Show)
销售(Sale)
培训(School)
社群(Social)
解决方案(Solution)
创业孵化(Startup)
去全站搜索看看?

登录社区云

登录社区云,与社区用户共同成长

人工智能6S服务平台

邀请您加入社区

欢迎加入社区

欢迎加入社区

asp.net
  • 昇腾 910B 上 DeepSeek-V4-Flash PD 分离:KV Cache 原理、容量估算与参数调优实战

    调优的本质不是"把参数拉满",而是理解每个参数背后的物理约束,在相互冲突的目标间找平衡点:容量 vs 稳定性 → 选 0.85:吞吐 vs 激活显存/延迟 → 选 32768 甜点:长 prompt 吞吐 vs 短请求延迟 → 让短的插队CPU Offload:HBM 容量 vs PCIe 带宽 → 用 200GB 换"不重算"最重要的那条建议:别信任何估算(包括本文的数字),用你自己机器的启动日

    骄阳如火
    3小时前
     20 
     1 
    #服务器#asp.net#运维
  • 多卡推理的通信瓶颈:HCCL实战指南

    摘要:本文介绍了昇腾NPU在多卡推理场景下的通信优化方案。重点分析了三种并行策略(TP、PP、EP)的通信模式及对应的HCCL接口实现,包括AllReduce、AllGather和ReduceScatter等核心通信原语。详细展示了HCCL环境初始化的关键步骤和注意事项,并通过代码示例演示了张量并行中的AllReduce操作和专家并行中的AllGather+ReduceScatter通信对实现。文

    jj071025
    2026-05-23 20:42:32
     445 
     7 
    #asp.net#后端#人工智能
没有更多了
回到
顶部
logo 提供社区服务与技术支持
logo 提供社区服务与技术支持
©1999-2023北京创新乐知网络技术有限公司 京ICP备19004658号