Kimi K3がAttention ResidualsでTransformerの残差接続を革新——ResNet 2015以来の革新
Newsソース: x投稿者: _avichawla人気度: 126公開日 2026年7月22日
従来の固定重み残差を層間のソフトマックス注意に置き換え、入力に応じて各層の寄与を動的に学習。Kimiの48Bモデルでの検証では、1.25倍の計算リソースでベースライン同等の性能を達成し、推論オーバーヘッドは2%未満。K3は2.8Tパラメータ、Kimi Delta Attentionと組み合わせて100万トークンコンテキストで最大6.3倍の復号高速化。API公開済み、重みは7月27日公開予定。
- 开源模型
- Transformer
- Moonshot AI
- 深度学习
- Kimi K3
- 2.8T参数
- Attention Residuals
- 残差连接
コメント
コメントするにはログイン
まだコメントはありません。最初の 1 件を投稿しましょう。