AI ニュース
AI コミュニティの投稿・ニュース・リリース情報
最新の更新
Claude Opus 5がARC-AGI-3で30%の新SOTAを達成。このベンチマークは事前知識なしでの問題解決を測定しており、スケーリングが最も効果を発揮しにくい設定であるため、この飛躍は特に印象的である。
- SOTA
- Claude Opus 5
- ARC-AGI-3
OpenAIがChatGPT Workエージェントを更新。ログインが必要なWebサイトに対応し、ユーザーはクラウドブラウザを操作してログイン、ログイン状態はセッション間で維持される。
- ChatGPT
- 自动化
- Work agent
- 浏览器登录
会話の途中でシステムメッセージを挿入・変更する技術的な詳細、効果、リスクを議論。複雑な対話アプリケーション構築に参考になる。
- system messages
- conversation design
CursorBenchの最新結果によると、Opus 5 Maxは70.0%のスコアで、Fable 5 Maxの70.5%にわずか0.5ポイント差だが、タスクあたりのコストは8.23ドルと、Fable 5の17.32ドルの半分未満。さらにOpus 5 Extra HighはFable 5 Extra Highを完全に上回り、タスクあたり4ドル安い。Anthropicは自社の最優秀モデルをコストパフォーマンスで陳腐化させた。
- Cost Efficiency
- Fable 5
- CursorBench
- Claude Opus 5
ジェンセン・フアンと@JennyQTa7がオープンモデルと主权AI能力の重要性で一致。Jennyの論文は、Kimiを含むあらゆるモデルに適用可能なテスト枠組み(能力、制御、インセンティブ、リスク)を提案している。
- Kimi
- Jensen Huang
- AI policy
- open models
著者はOpus 5を過小評価していたことを認め、ほぼすべてのベンチマークでFable 5を上回り、コストは半分であると述べ、Claude Codeのデフォルトとして推奨している。
- Claude Code
- 对比
- Fable 5
- Opus 5
- 成本效率
Claude Opus 5がAgent Arenaに参戦。数百万件の実世界エージェントタスク(Web検索、ファイルシステム、端末ツール)で評価される。スコアは近日公開。
- Agent Arena
- 性能测试
- Claude Opus 5
Anthropicは新しいClaude Opus 5 AIモデルのリリースを発表した。
- 发布
- Claude Opus 5
Anthropic が Claude Opus 5 の主なアップデートを発表。長いコンテキストウィンドウ、推論能力の向上、新しい安全機構など。
- New Features
- Claude Opus 5
Opus 5があらゆるベンチマークでFable 5を上回っているのに、Fable 5に必要だった面倒な規制承認を回避していると不満を述べている。
- 吐槽
- Fable 5
- Opus 5