跳到正文

内容形态

论文研究 最新动态

值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。

6 条精选近 30 天 5 条共收录 15 条

更新

论文研究的精选

10月10日周六第 1–6 条
  1. The Decoder88

    数学家对 OpenAI 一次性发布 700 余篇数学论文感到震惊与厌恶

    OpenAI 于 2026 年 10 月 6 日一次性发布 700 余篇手稿,声称解决了数百个未解数学问题,数学博客 Proofs and Prompts 随后收集了 100 多位研究者的回应。

    推荐理由:汇集百余位数学家对 OpenAI 一次性放出 700 余篇论文的现场反应,呈现学术共同体对研究方式被改变的复杂情绪。

  2. The Verge · AI88

    OpenAI 一次性放出近 400 项 AI 数学成果,数学家称需数年才能消化

    OpenAI 本周突然发布近 400 项 AI 生成的数学结果,分布在 700 多份手稿中,涵盖组合数学、几何、数论、理论计算机科学、代数、拓扑、概率与统计力学及数学物理等领域。

    推荐理由:通过数十位数学家的第一手反应,呈现近400项AI数学成果在验证、署名与学术生态上引发的具体争议。

10月7日周三
  1. Latent Space84

    OpenAI 内部模型发布 722 篇数学手稿,称解决 500 个公开数学难题中的 90 个

    OpenAI 在公开 GitHub 仓库发布了一批来自内部前沿模型的数学成果,称其来自约 4000 道研究问题的评测,包含 722 篇手稿、归入 372 个相关结果族,平均每个结果消耗约 3 小时 ChatGPT Pro 推理算力,模型本身未发布。

    推荐理由:OpenAI 用内部未发布模型产出 722 篇数学手稿,读者可据此了解 AI 做数学研究的规模与算力成本。

10月5日周一
  1. GitHub Blog · AI & ML62

    GitHub 发布 AI 代码审查开放基准 ReviewBench

    GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 219 个 pull request、覆盖 19 种语言。

    推荐理由:GitHub 公开了 AI 代码审查基准的构建方法与评分口径,读者可据此理解离线评测如何对应线上实验。

9月24日周四
  1. Microsoft Research62

    微软研究院:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动机器人操作负载做了系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU 可提升任务表现。

    推荐理由:微软研究院系统测量了机器人端侧 GPU 推理的瓶颈,并给出可复用的 Kubernetes 卸载工具链,读者可据此判断物理 AI 的部署取舍。

7月29日周三
  1. Berkeley AI Research62

    从 CUDA 到 MLX:K-Search 如何把内核优化经验迁移到 Apple Silicon

    Berkeley AI Research 与 IBM Research 基于 K-Search 演化式内核搜索框架,为 Apple Silicon 的 MLX 构建后端和结构化 CUDA-to-MLX 翻译层,让现有 CUDA 内核作为知识库被改写为 MLX 内核。

    推荐理由:原文给出 CUDA 到 MLX 的翻译层设计与两组内核实测数据,可看跨平台内核知识迁移的具体做法。