← AI 情报

FlashKDA 开源:基于 CUTLASS 的高性能注意力内核,预填充速度提升1.72-2.22倍

产品发布来源: x作者: Kimi_Moonshot热度: 2128发布于 2026年7月27日

FlashKDA是基于CUTLASS的Kimi Delta Attention实现,在H20上比flash-linear-attention基线预填充速度快1.72-2.22倍,可作为即插即用后端。

  • open-source
  • FlashKDA
  • attention kernel
  • Kimi Delta Attention
查看原文 →

评论

登录后即可评论

还没有评论,来发第一条吧。