AI ニュース
AI コミュニティの投稿・ニュース・リリース情報
最新の更新
AnthropicがClaude Opus 5を発表、ほぼすべての評価ベンチマークで従来のフラッグシップモデルFable 5を上回り、コミュニティに興奮を巻き起こしている。
- benchmark
- Fable 5
- Claude Opus 5
開発者が同じプロンプトでKimi K3とClaude Opus 5.0を使ってFall Guysを再現。Kimi K3は約9分、$4.4で物理エンジンと操作感が良好。Opus 5.0は17分、$13+かかり、UIは派手だが動作が壊れていてラグがひどい。Kimiの方が圧倒的に遊べる結果に。
- comparison
- game development
- Kimi K3
- Claude Opus 5.0
AnthropicがClaude Opus 5を正式発表、Fable 5に迫る知能を半額で提供すると主張、開発者にとってコストパフォーマンスに優れた選択肢となる。
- price
- Fable 5
- Claude Opus 5
オープンソースモデル(Kimiなど)とクローズドラボの進歩を両方支持しつつ、筆者にとってはClaude Opusが依然として日常使いの第一選択。その思慮深さ、能力、スタイルと個性は他に類を見ないが、Anthropicにはフロントエンド体験への投資を望む。
- open-source
- Claude Opus
- Kimi K3
- frontier progress
Artificial Analysis が Claude Opus 5 のパフォーマンス、価格、利用可能性など多角的に評価。
- analysis
- Claude Opus 5
Claude Opus 5がARC-AGI-3で30%の新SOTAを達成。このベンチマークは事前知識なしでの問題解決を測定しており、スケーリングが最も効果を発揮しにくい設定であるため、この飛躍は特に印象的である。
- SOTA
- Claude Opus 5
- ARC-AGI-3
OpenAIがChatGPT Workエージェントを更新。ログインが必要なWebサイトに対応し、ユーザーはクラウドブラウザを操作してログイン、ログイン状態はセッション間で維持される。
- ChatGPT
- 自动化
- Work agent
- 浏览器登录
会話の途中でシステムメッセージを挿入・変更する技術的な詳細、効果、リスクを議論。複雑な対話アプリケーション構築に参考になる。
- system messages
- conversation design
CursorBenchの最新結果によると、Opus 5 Maxは70.0%のスコアで、Fable 5 Maxの70.5%にわずか0.5ポイント差だが、タスクあたりのコストは8.23ドルと、Fable 5の17.32ドルの半分未満。さらにOpus 5 Extra HighはFable 5 Extra Highを完全に上回り、タスクあたり4ドル安い。Anthropicは自社の最優秀モデルをコストパフォーマンスで陳腐化させた。
- Cost Efficiency
- Fable 5
- CursorBench
- Claude Opus 5
ジェンセン・フアンと@JennyQTa7がオープンモデルと主权AI能力の重要性で一致。Jennyの論文は、Kimiを含むあらゆるモデルに適用可能なテスト枠組み(能力、制御、インセンティブ、リスク)を提案している。
- Kimi
- Jensen Huang
- AI policy
- open models