登录社区云,与社区用户共同成长
邀请您加入社区
如果这个定位成立,那么 FlashMLA 与 FlashAttention 这类通用注意力实现的关系就不是替代关系:前者是面向特定模型结构的深度优化 kernel,后者覆盖更广的注意力变体集合。对迁移者的实际含义是:如果模型不用 MLA 结构,FlashMLA 的价值有限;如果用 MLA 结构,那么它是推理/训练路径上的关键 kernel,其正确性与数值行为需要单独验证,包括 softmax 缩放