跳到正文
10月9日周五
  1. NVIDIA Blog30

    NVIDIA Omniverse 如何用前沿 AI 智能体把创意变成仿真应用

    NVIDIA 开发者正用 GPT-6 Astra、Claude Fable 5 等前沿模型驱动 Omniverse 库,通过自然语言指令搭建仿真应用。案例包括仓库人形机器人模拟器、基于旧金山 Market Street 的自动驾驶测试环境 Zero to Alpamayo、数字孪生传感器校验,以及 Unitree G1 人形机器人跨栏实验——100 次仿真中成功 64 次。

10月8日周四
  1. AWS Machine Learning Blog62

    AWS 上线 Claude Haiku 5.5

    AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,据 Anthropic 称它是 Claude 5.5 系列中速度最快、效率最高的模型,面向子智能体和高并发成本敏感场景,多数任务成本比 Claude Haiku 4.5 低约 75%。

    推荐理由:AWS 官方给出 Haiku 5.5 的定位、成本变化与 Bedrock 接入方式,可据此判断它在多智能体分层中的位置。

  2. Microsoft Research71

    微软研究院开源 Agent Lightning v1.0:约 3500 行的轻量智能体 RL 框架

    微软研究院亚洲团队开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 训练范式,让部署时使用的同一 agent harness 直接参与 RL,无需在训练框架内重新实现智能体。

    推荐理由:微软研究院开源 Agent Lightning v1.0,给出约 3500 行代码的智能体 RL 框架与真实 harness 训练路径,可据此判断训练与部署一致性的实现方式。

10月7日周三
  1. AWS Machine Learning Blog28

    如何为 agentic automation 构建商业论证:AWS 提出 Agentic Value Model

    AWS 提出 Agentic Value Model,用于替代以"节省工时×人力成本"为核心的 RPA 时代 ROI 模型,从时间节省、异常处理、决策质量、变更韧性与维护经济性四个维度衡量 agentic automation 的价值。该框架强调释放的工时只有转化为实际支出削减或可衡量的再部署产出才算价值,并以理赔分流流程为例给出测算。

  2. Microsoft Research22

    Microsoft 研究播客:AI 评测的意外失败能教会我们什么

    Microsoft 研究合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中与首席应用科学家 Chad Atalla 对谈,探讨评测如何推动当前 AI 系统突破性能边界,以及模型在传统 benchmark 之外测试时出现的"意外失败"。她同时分享了使用当前 AI 系统的实用建议,并强调当结果偏离预期时深入审视数据的重要性。

10月5日周一
  1. GitHub Blog · AI & ML62

    GitHub 发布 AI 代码审查开放基准 ReviewBench

    GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 219 个 pull request、覆盖 19 种语言。

    推荐理由:GitHub 公开了 AI 代码审查基准的构建方法与评分口径,读者可据此理解离线评测如何对应线上实验。

10月2日周五
  1. GitHub Blog · AI & ML22

    AI 正在改变开发者工作方式,GitHub 给出三项值得强化的技能

    GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 节省的时间去解决更大的问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,从而发现首个模型遗漏的问题。

10月1日周四
  1. Google DeepMind85

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。

    推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准与内部落地案例,可据此判断前沿模型的能力边界与分阶段开放节奏。

9月26日周六
9月25日周五
  1. GitHub Blog · AI & ML66

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体流水线

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告、改进 harness、分诊崩溃并为每个独立缺陷生成漏洞报告。

    推荐理由:GitHub 安全实验室把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM 智能体,读者可据此判断自动化安全测试的边界。

9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub Podcast 拆解五大 AI 热梗:该不该读 AI 代码、RAG 已死、Skills 杀死 MCP?

    GitHub Podcast 最新一期拆解了五个 AI 开发热梗:AI 生成的代码仍需阅读和负责,但审查力度应随风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是智能体连接工具与数据的标准,二者可组合使用;RAG 并未消亡,检索能为模型提供训练数据外的上下文,减少 token 浪费并降低答案不完整的概率。

7月26日周日
  1. Berkeley AI Research34

    伯克利提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互

    伯克利 AI 研究提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,用受自编码器启发的重建式信念评分(belief grading)作为辅助 RL 任务。在 CollabBench 协作编程任务上,ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值上下文 token 数也明显低于全上下文设置。

7月7日周二
  1. Berkeley AI Research32

    智能免费之后怎么办?面向智能体、由智能体构建的数据系统

    UC Berkeley 的 Aditya G. Parameswaran 等人提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不到 $1、部分低于 $0.10,数据系统需应对三大新挑战:为智能体服务、由智能体运行、由智能体合成。其中智能体查询会产生大量重复子计划,文本到 SQL 基准中仅 10-20% 子计划不同,80-90% 属重复工作。