← AI ニュース

FlashKDAをオープンソース化:CUTLASSベースの高性能アテンションカーネル、プリフィル速度1.72~2.22倍

Launchソース: x投稿者: Kimi_Moonshot人気度: 2128公開日 2026年7月27日

FlashKDAはCUTLASSベースのKimi Delta Attention実装で、H20でflash-linear-attentionベースラインに対して1.72~2.22倍のプリフィル高速化を実現し、プラグイン可能なバックエンドとして動作。

  • open-source
  • FlashKDA
  • attention kernel
  • Kimi Delta Attention
ソースを見る →

コメント

コメントするにはログイン

まだコメントはありません。最初の 1 件を投稿しましょう。