AI 情报
AI 圈帖子、新闻与发布动态
最新动态
Moonshot 在 Kimi K3 技术报告中详细介绍了多种方法,将预训练缩放效率提升2.5倍,展示出与美国模型不同的缩放规律。
- Moonshot
- scaling laws
- Kimi K3
- pre-training efficiency
作者用 ChatGPT 语音模式指挥 Codex 处理邮件、查日程、搜餐厅,甚至生成 Kimi K3 的展示 PPT,全程不用键盘,2分钟出初稿,体验震撼。
- ChatGPT
- codex
- 工作流
- 语音模式
作者简要梳理了 Kimi K3 事后学习(post-training)中值得注意的几个点,供同行参考。
- post-training
- Kimi K3
- 事后学习
有人找到了精确配置,通过 Claude Code 内安装 OpenAI Codex 插件,合理分配任务给不同模型(Fable 5 做规划和审查,Codex 5.6 执行),可以节省一半的每周限额。
- Claude Code
- OpenAI Codex
- 节省成本
- 工作流优化
作者评论Anthropic关于开源模型的声明,指出蒸馏(distillation)使得DeepSeek和Kimi-K3等中国模型通过复制OpenAI和Anthropic的模型,用更少芯片成功。但训练不是问题,推理时的硬件需求才是持续的,因此基础设施需求只会增加,利好。
- Anthropic
- 蒸馏
- 中国AI
- 硬件需求
据传OpenAI的GPT-6将于本周发布,具备自主科学发现、解决长期未解数学难题、无需人类监督长时间运行等强大能力,可能标志着AI进入全新阶段。
- OpenAI
- GPT-6
- AIモデル
- サム・アルトマン
一位 Baseten 工程师花48小时剖析 Kimi K3 开源代码,发现其内部包含22580个2019年的GPT-2模型,并追溯从GPT-2到线性注意力、DeltaNet、门控DeltaNet直到Kimi自研KDA的完整技术脉络,指出这种开源透明度是闭源无法比拟的。
- Kimi K3
- GPT-2
- DeltaNet
- 开源分析
- 模型架构演进
用户喜欢 Kimi K3 的编程表现,认为它没有无谓的限制,能高效完成任务且不烦人。
- coding
- Performance
- Kimi K3
据404 Media报道,Anthropic秘密进行一个项目,购买并拆毁数百万本书籍(包括稀有古籍)以扫描作为训练数据。欧洲二手书商发出警告,认为这些书被破坏后难以复得。
- Anthropic
- ethics
- copyright
- training data
- book scanning
有传言称智谱AI即将推出GLM-5.5模型,引发与Kimi K3性能对比的讨论。
- rumor
- Kimi K3
- GLM-5.5