登录社区云,与社区用户共同成长
邀请您加入社区
chunked prefill 把超长 prompt 切成 8k 一块喂进去,避免一次性把所有注意力矩阵算出来导致 OOM。vLLM-Ascend 这两年的发展速度,超出了很多人的预期。它本质上是开源社区力量和国产硬件生态两股浪潮汇合的产物:一边是 vLLM 在 CUDA 上把推理调度这件事做到了极致,另一边是昇腾在政策和供应链双重驱动下快速规模化。对一线工程师来说,这意味着一件事——熟悉一套 v