← AI 情报

Kimi K3架构深度解析:从Kimi Linear到2.8T参数,LatentMoE、NoPE与注意力残差

教程来源: x作者: rasbt热度: 1892发布于 2026年7月28日

详解Kimi K3架构:基于去年Kimi Linear的规模化生产版本(48B→2.8T),新增LatentMoE(类似于Nemotron 3 Ultra),全面采用NoPE(无位置嵌入),引入注意力残差(注意力残差连接改进残差路径)。这是首个前沿级别全面使用NoPE的模型,还支持原生多模态。

  • Moonshot
  • Kimi K3
  • LatentMoE
  • LLM架构
  • NoPE
  • 注意力残差
查看原文 →

评论

登录后即可评论

还没有评论,来发第一条吧。