AWS 9 月 AI 更新盘点:Amazon Bedrock、AgentCore 与 Strands 新进展
Amazon Bedrock 上线 OpenAI 的 GPT-6 Astra、Sol、Luna 系列模型,其中 GPT-6 Astra 支持最高 100 万 input tokens,Ultrafast 版本 API 推理速度最高提升 6 倍、达 300 tokens/秒。
Amazon Bedrock 上线 OpenAI 的 GPT-6 Astra、Sol、Luna 系列模型,其中 GPT-6 Astra 支持最高 100 万 input tokens,Ultrafast 版本 API 推理速度最高提升 6 倍、达 300 tokens/秒。
Postman 在 Amazon Bedrock 上构建 Agent Mode,以 AI 原生方式覆盖 API 测试、文档、发现与实现,服务 4000 万开发者。
NVIDIA 开发者正用 GPT-6 Astra、Claude Fable 5 等前沿模型驱动 Omniverse 库,通过自然语言指令搭建仿真应用。案例包括仓库人形机器人模拟器、基于旧金山 Market Street 的自动驾驶测试环境 Zero to Alpamayo、数字孪生传感器校验,以及 Unitree G1 人形机器人跨栏实验——100 次仿真中成功 64 次。
Incarna 借助 Amazon Bedrock AgentCore payments,让智能体通过 x402 按次向 BlockRun 支付模型推理费用,将接入 x402 支付支持的工作量从数月缩短到数天,并已上线端到端按次付费推理流程。
Amazon SageMaker HyperPod 发布多租户参考架构,让多个团队共享同一 EKS GPU 集群并保持隔离与公平。
《Gears of War: E-Day》已于 10 月 6 日全球发售后上线 GeForce NOW,Ultimate 会员可以 GeForce RTX 5080 级性能云端游玩,并支持 NVIDIA DLSS 和 NVIDIA Reflex。
LegalOn 将 Codex 每日预估成本降低 65%,同时保持开发速度。其做法是把 Astra、Sol 和 Luna 匹配到不同任务,并对预算进行策略性管理。
AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,据 Anthropic 称它是 Claude 5.5 系列中速度最快、效率最高的模型,面向子智能体和高并发成本敏感场景,多数任务成本比 Claude Haiku 4.5 低约 75%。
推荐理由:AWS 官方给出 Haiku 5.5 的定位、成本变化与 Bedrock 接入方式,可据此判断它在多智能体分层中的位置。
在旧金山 Microsoft 活动上,NVIDIA 与 Microsoft 宣布为 Windows PC 上的 AI 智能体共同设计软硬件,Microsoft 宣布 OS 级基础设施 Microsoft Execution Containers(MXC)正式可用,让智能体在系统控制下安全持久地在后台运行。
推荐理由:NVIDIA 与 Microsoft 把智能体运行所需的系统级容器和本地算力硬件一并给出,读者可据此判断本地智能体工作流的落地条件。
Amazon Quick 与 Amazon Bedrock Knowledge Bases 在预检索 ACL 过滤之外新增实时 ACL 校验,在查询时直接向权威数据源核实权限,避免依赖可能过期或映射错误的 ACL 数据。
GitHub 发布与 Microsoft Applied Sciences 联合微调的 ModernBERT 分类器,用代码上下文识别无固定格式的密钥,可在 2 毫秒内评估一批候选密钥,据称能把可拦截的密钥数量提升一倍以上。
推荐理由:GitHub 用九个季度数据说明密钥泄露与人工修复的失衡,并给出把检测前移到 push 环节的模型方案。
微软研究院亚洲团队开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 训练范式,让部署时使用的同一 agent harness 直接参与 RL,无需在训练框架内重新实现智能体。
推荐理由:微软研究院开源 Agent Lightning v1.0,给出约 3500 行代码的智能体 RL 框架与真实 harness 训练路径,可据此判断训练与部署一致性的实现方式。
AWS 提出 Agentic Value Model,用于替代以"节省工时×人力成本"为核心的 RPA 时代 ROI 模型,从时间节省、异常处理、决策质量、变更韧性与维护经济性四个维度衡量 agentic automation 的价值。该框架强调释放的工时只有转化为实际支出削减或可衡量的再部署产出才算价值,并以理赔分流流程为例给出测算。
Qlik 基于 Amazon Bedrock 打造 Qlik Answers,让员工用自然语言提问并获得带来源的可信回答,自 2026 年 2 月正式可用以来,其 Discovery Agent 已为客户发现超过 10 万条洞察。
NVIDIA《State of AI in Telecommunications》报告显示,89% 受访者认为开源模型与软件对公司 AI 战略重要。NVIDIA 发布 300 亿参数的 Nemotron 3 Large Telco Model(LTM),由 AdaptKey 基于开源电信数据集微调,并公开端到端微调配方。
NVIDIA Inception 计划中的三家初创公司正用 AI 覆盖乳腺癌筛查到治疗规划的全流程。iSono Health 的 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房扫描,比传统手持超声的 45 分钟大幅提速,并称敏感度高出 28%。
NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,10 月 23 日开售,起售价 4,999 美元,单机支持最高 1000 亿参数模型。
推荐理由:原文给出 64GB 新配置的定价、上市时间与双机集群实测数据,可据此判断本地跑大模型的成本与扩展方式。
GPT-6 Astra Ultrafast 已在 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户中开放,运行在 NVIDIA Blackwell GPU 上,token 生成速度最高可达 Astra Standard 模式的 8 倍。
推荐理由:原文给出 Astra Ultrafast 相对标准模式的加速幅度与开放入口,读者可据此判断它对编码智能体循环的实际影响。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测与 AE、Dst 指数预报,结合纬度、地质电导率等本地数据,为美国本土 66,935 座变电站生成 30-60 分钟前的空间天气风险估计。
GitHub Copilot 提出用 canvas 替代 chat 作为 AI 交互界面,canvas 是运行在 GitHub Copilot 应用内的全栈小应用,可与 agent 双向通信并调用第三方 API、在本地执行代码。
GitHub Copilot 应用重建了 pull request 视图,以流畅渲染含 2,200 个文件、超百万行改动和 400 多条行内评论的超大 PR。其做法是把文档高度拆成确定性的代码几何与动态评论块两套几何:代码行高提前精确计算,评论高度则按块懒测量、锚定到文件与行,避免滚动跳变。
微软研究院对移动机器人操作负载做了系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU 可提升任务表现。
推荐理由:微软研究院系统测量了机器人端侧 GPU 推理的瓶颈,并给出可复用的 Kubernetes 卸载工具链,读者可据此判断物理 AI 的部署取舍。
Google Private AI Compute 团队公布为 Private AI Compute 平台引入私有服务端记忆的技术方案,让 AI 助手在跨设备场景下持久保留上下文,同时维持端侧级别的隐私标准。
推荐理由:Google 公布 Private AI Compute 的持久化服务端记忆方案,读者可了解云端 AI 如何在保留上下文的同时维持端侧级隐私。
Berkeley AI Research 与 IBM Research 基于 K-Search 演化式内核搜索框架,为 Apple Silicon 的 MLX 构建后端和结构化 CUDA-to-MLX 翻译层,让现有 CUDA 内核作为知识库被改写为 MLX 内核。
推荐理由:原文给出 CUDA 到 MLX 的翻译层设计与两组内核实测数据,可看跨平台内核知识迁移的具体做法。
UC Berkeley 的 Aditya G. Parameswaran 等人提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不到 $1、部分低于 $0.10,数据系统需应对三大新挑战:为智能体服务、由智能体运行、由智能体合成。其中智能体查询会产生大量重复子计划,文本到 SQL 基准中仅 10-20% 子计划不同,80-90% 属重复工作。
伯克利 AI 研究团队梳理了并行推理领域进展,重点分析自适应并行推理——让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。现有方法如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS、ParaThinker、GroupThink、Hogwild! Inference 的并行结构多由外部设定,未教会模型自适应行为。