AI 情报
AI 圈帖子、新闻与发布动态
最新动态
作者认为开源模型(如Kimi)和闭源前沿模型都在快速进步,两者都应支持。但作为长期用户,Claude Opus依然是日常首选,因其细心、能干、风格和个性难以替代,只是希望Anthropic在用户体验上多投入。
- open-source
- Claude Opus
- Kimi K3
- frontier progress
Artificial Analysis 从性能、价格、可用性等多个维度对 Claude Opus 5 进行了全面评测。
- analysis
- Claude Opus 5
Claude Opus 5在ARC-AGI-3基准测试中达到30%的新SOTA,该基准测试衡量模型在无先验知识情况下的问题解决能力,而传统扩展方法在此场景下收益最低,因此这一跃升尤为引人注目。
- SOTA
- Claude Opus 5
- ARC-AGI-3
OpenAI更新ChatGPT Work agent,使其能够处理需要登录的网站,用户可接管云端浏览器完成登录,登录信息跨会话保留。
- ChatGPT
- 自动化
- Work agent
- 浏览器登录
讨论了在对话中间插入或修改系统消息的技术细节、效果评估和潜在风险,对构建复杂对话应用很有参考价值。
- system messages
- conversation design
CursorBench最新结果显示,Opus 5 Max得分70.0%,仅比Fable 5 Max低0.5个百分点,但每任务成本仅8.23美元,不到后者17.32美元的一半。且Opus 5 Extra High版本直接超越Fable 5 Extra High,每任务还便宜4美元。Anthropic用新模型让自己的旧旗舰在性价比上过时。
- Cost Efficiency
- Fable 5
- CursorBench
- Claude Opus 5
黄仁勋与@JennyQTa7共同强调开源模型和主权AI能力的重要性。Jenny的论文提出了对任何模型(包括Kimi)的统一测试框架:能力、控制、激励和风险。
- Kimi
- Jensen Huang
- AI policy
- open models
作者承认之前低估了Opus 5,它在几乎每个基准上都优于Fable 5,成本仅为一半,并建议在Claude Code中将其设为默认模型。
- Claude Code
- 对比
- Fable 5
- Opus 5
- 成本效率
Claude Opus 5已加入Agent Arena,将在数百万真实代理任务中进行评估,涵盖网页搜索、文件系统和终端工具。即将公布得分。
- Agent Arena
- 性能测试
- Claude Opus 5
Anthropic 刚刚宣布推出新的 Claude Opus 5 AI 模型。
- 发布
- Claude Opus 5