FlashKDA 开源:基于 CUTLASS 的高性能注意力内核,预填充速度提升1.72-2.22倍
产品发布来源: x作者: Kimi_Moonshot热度: 2128发布于 2026年7月27日
FlashKDA是基于CUTLASS的Kimi Delta Attention实现,在H20上比flash-linear-attention基线预填充速度快1.72-2.22倍,可作为即插即用后端。
- open-source
- FlashKDA
- attention kernel
- Kimi Delta Attention
评论
登录后即可评论
还没有评论,来发第一条吧。