AI 情报
AI 圈帖子、新闻与发布动态
最新动态
详细对比:53 个 GAIA Level 1 任务中,Atomic Agent 解出 37 个(3h12m),Hermes 解出 31 个(5h10m)。Atomic 在 3 个具体用例中表现出色:发现 Audre Lorde 诗缩进用 7.6 分钟(Hermes 空白)、越南京族样本城市用 33 秒(Hermes 7.3 分钟无果)、恐龙推荐人用 57 秒(Hermes 11 分钟猜错)。技术亮点:Atomic 通过保持字节稳定的提示前缀复用 KV-cache,每次推理只输出工具调用 JSON 数组并压缩结果,避免上下文膨胀,并且有“无进展”守卫阻止重复工具调用。这使得小型模型也能保持专注。
- benchmark
- Hermes
- 效率
- KV cache
- Atomic Agent
- GAIA
在ChatGPT网页版,你可以为自定义宠物创建可分享链接,让朋友领养。
- ChatGPT
- custom pet
- shareable link
一个能自我优化的上下文工程平台上线,旨在提升AI模型对上下文的利用效率,减少人工调参。
- context engineering
- AI platform
- self-improving
用户兴奋地表示 Opus 5 根本就是 Fable 6,在自己的测试中完全碾压 Fable 5,差距不是一点点。
- comparison
- Performance
- Claude Opus 5
文章总结了针对 Claude 5 系列模型的上下文设计规则,帮助开发者优化提示词和上下文结构,提升输出质量。
- Prompt Engineering
- context engineering
- Claude 5
一篇关于AI公司老板为聊天机器人的不当行为道歉的文章,探讨了真诚道歉与公关话术之间的界限。
- ethics
- AI boss
- apology
- rogue chatbot
Grok 4.5 将缓存的 token 价格从 0.50 美元降至 0.30 美元每百万,为开发者节省成本。
- API
- Grok
- 降价
人们还在摸索 ChatGPT 的用法,而我们认为 AI 的代理能力将是赋能人类生活的关键。
- ChatGPT
- Agentic AI
- empowerment
根据Artificial Analysis的评测,Claude Opus 5在智能指数中以61分微弱领先,与Fable 5(60分)并列,但每次任务成本低26%。它在知识工作代理、编码代理、科学推理等多项基准上表现突出,但也显示出更高的幻觉率(50%)。
- cost
- benchmark
- agentic
- Artificial Analysis
- Claude Opus 5
Ramp公司对AI模型处理真实企业发票的能力进行了测试,Grok 4.5取得了最高的完美提取率,超过了Gemini Flash 3.6、GPT 5.6 Terra和Sonnet 5。该任务需要处理超过10万token的长上下文推理。
- 长上下文
- AI比较
- Grok 4.5
- Ramp
- 发票处理