跳到正文
10月10日周六
  1. TechCrunch · AI62

    OpenAI 的数学解答尚未达到学界标准

    TechCrunch 报道称,OpenAI 本周发布数百份高难数学问题解答,但未完全符合高等研究院 AGMAI 在 9 月底提出的准则。719 份手稿中仅 10 份公开了模型的思维链,42% 的证明未经过形式化;剑桥与伦敦国王学院的新论文还记录了 OpenAI 针对 Navier-Stokes 方程解答中自然语言证明与 Lean 代码之间的至少两处不一致。

10月9日周五
10月8日周四
  1. Latent Space80

    Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna

    Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 相同,官方称其平均运行成本比 Haiku 4.5 低约 75%。

    推荐理由:汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗数据,可据此判断低价小模型在智能体工作流中的实际成本。

10月7日周三
  1. Microsoft Research22

    Microsoft 研究播客:AI 评测的意外失败能教会我们什么

    Microsoft 研究合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中与首席应用科学家 Chad Atalla 对谈,探讨评测如何推动当前 AI 系统突破性能边界,以及模型在传统 benchmark 之外测试时出现的"意外失败"。她同时分享了使用当前 AI 系统的实用建议,并强调当结果偏离预期时深入审视数据的重要性。

10月5日周一
  1. GitHub Blog · AI & ML62

    GitHub 发布 AI 代码审查开放基准 ReviewBench

    GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 219 个 pull request、覆盖 19 种语言。

    推荐理由:GitHub 公开了 AI 代码审查基准的构建方法与评分口径,读者可据此理解离线评测如何对应线上实验。