AI ニュース
AI コミュニティの投稿・ニュース・リリース情報
最新の更新
Grok 4.5がMicrosoft Outlookで利用可能に。機能:長いメールスレッドや添付ファイルの要約、決定事項や担当者、未完了タスクの特定、自分の口調での返信作成、Webと𝕏の検索、メールの整理、アーカイブ、削除、フラグ付け。
- 集成
- Grok 4.5
- Microsoft Outlook
- 邮件助手
3Dゲームシナリオを通じて大規模言語モデルが一貫した世界理解を維持できるかを検証するオープンソースのベンチマーク。
- LLM
- benchmark
- evaluation
- world coherence
- 3D games
新たな日、CodexとChatGPT Workの有料ユーザーに利用枠リセットが実施され、1時間以内に反映。お楽しみに!
- codex
- Usage Reset
- ChatGPT Work
Kimi K3が3DデザインでElo 1450を獲得し、前世代から108ポイント上昇、AnthropicのClaude Fable 5に82ポイント差をつけてトップになった。
- 3D design
- Claude Fable 5
- GLM 5.2
- model ranking
- Kimi K3
Googleが次世代大規模モデルGemini 4の事前学習を開始。AIの最前線を押し進める。
- pre-training
- Gemini 4
Bloombergの報道によると、Moonshot AIは香港上場前の最終ラウンドで最大500億ドルの評価額を目指している。同社は6月にARR 3億ドルを達成し、Kimi K3リリース以降の日次売上は少なくとも6倍に増加した。
- Kimi
- 估值
- Moonshot AI
- AI融资
- ARR
オープンソースのフレームワークOpenBench v1が登場。実際のコードベースやユースケースにおけるAIのパフォーマンスと効率を評価するために設計。codex、Claude、Cursor、Devinなどのハーネスを統合し、カスタムタスクに対応。正解率、トークン使用量、レイテンシを測定する。
- 开源
- 模型路由
- AI评估
- 性能测试
- OpenBench
OPDとOPSDの4つの失敗モード(早期誤りの構造的修正不能、強い教師がむしろ悪い教師になる、特権情報条件付きOPSDの転移失敗、思考崩壊)を分析。TRDや分布近接性に基づく教師選択などの改善策を提案。
- 后训练
- 模型蒸馏
- On-Policy Distillation
- 失败模式
比較テストでは、Claude Fable 5とKimi K3の結果品質は同等だが、Fable 5のコストはK3の3分の1で、速度は4倍遅く、一長一短です。
- cost
- comparison
- Claude Fable 5
- speed
- Kimi K3
MoonshotのKimi K3がECI(Epoch Capabilities Index)で156点を獲得し、オープンウェイトモデルの新記録を樹立。Opus 4.6とGPT 5.4の間に位置し、GPT 5.6 Lunaをわずかに上回る。
- 开源模型
- Epoch Capabilities Index
- AI基准
- Kimi K3