AI ニュース
AI コミュニティの投稿・ニュース・リリース情報
最新の更新
BasetenのModel APIはKimi K3への高速で信頼性の高いアクセスを提供します。
- API
- Baseten
- Kimi K3
Kimi K3はvLLM推論フレームワークで毎秒370トークンの生成速度を達成し、高い効率性を示している。
- vLLM
- Performance
- Kimi K3
ModalはKimi K3向けにカスタムDFlash投機デコーダを訓練し、品質を維持しながら推論速度を向上。
- inference acceleration
- Kimi K3
- Modal
- speculator
Anthropicの元従業員が、パフォーマンス優先のためにAI安全対策を緩めたと内部告発。安全性とビジネスのバランスを巡る議論を呼んでいる。
- Anthropic
- AI safety
- safeguards
- whistleblower
Kimi K3の技術レポートが公開され、モデルアーキテクチャ、トレーニング方法、性能評価が詳述されている。
- Kimi K3
- technical report
Kimi K3チームは、ディープラーニングモデルの効率的なコンパイルのための軽量なTriton風コンパイラMiniTritonを開発した。
- compiler
- Kimi K3
- miniTriton
MoonEPは大規模MoEのトレーニングと推論におけるエキスパート並列通信を効率化し、通信オーバーヘッドを削減します。
- open-source
- MoE
- MoonEP
- communication library
AgentENVはKimi K3のエージェントRL訓練を支え、高速スナップショット、再開、フォーク機能で大規模並列エージェントワークフローを実現。
- open-source
- RL
- agent environment
- AgentENV
FlashKDAはCUTLASSベースのKimi Delta Attention実装で、H20でflash-linear-attentionベースラインに対して1.72~2.22倍のプリフィル高速化を実現し、プラグイン可能なバックエンドとして動作。
- open-source
- FlashKDA
- attention kernel
- Kimi Delta Attention
このチームはKimi K3のリリース当日にAPIを公開し、開発者がすぐに統合して使えるようにした。
- API
- Kimi K3
- day-0