Ai2 用 GPU 时间预算改造集群调度器的实践
Ai2 AI Infrastructure 团队用 GPU 时间预算、层级公平份额分配和时间片合约取代了原有的优先级调度器,把 GPU 时间分配从逐案谈判变成透明的预算流程。
推荐理由:原文完整拆解了从优先级调度到预算制调度的迁移过程与量化结果,可迁移性强。
Ai2 AI Infrastructure 团队用 GPU 时间预算、层级公平份额分配和时间片合约取代了原有的优先级调度器,把 GPU 时间分配从逐案谈判变成透明的预算流程。
推荐理由:原文完整拆解了从优先级调度到预算制调度的迁移过程与量化结果,可迁移性强。
AWS 提出一套基于 Amazon SageMaker HyperPod 与 EKS 的多租户参考架构,让多个团队共享同一 GPU 集群并保持隔离与资源公平。
Amazon Quick 和 Amazon Bedrock Knowledge Bases 通过两阶段实时 ACL 校验解决 RAG 权限难题:先用索引内缓存 ACL 做预检索过滤,再在查询时调用 Google Drive 等权威源 API 实时核验候选文档,仅将已授权内容传给 LLM。
AWS 官方博客介绍如何用 AWS Lambda Durable Functions、Amazon EventBridge 和 Amazon Bedrock 搭建自动修复工作流,衔接 AWS DevOps Agent 的调查结果完成修复步骤。
Qlik 基于 Amazon Bedrock 构建的 Qlik Answers 自 2026 年 2 月 GA 以来已服务其 40,000 多家客户,其 Discovery Agent 累计为用户发现超过 100,000 项异常与洞察。
AWS Machine Learning Blog 发布文章,提出 Agentic Value Model,指出传统 RPA 时代按省时数乘人工成本的 ROI 模型无法覆盖智能体自动化创造的价值。
Cornerstone OnDemand 基于 Amazon Bedrock 和开源框架 Strands Agents 构建多智能体系统 Orion AI,将数据库诊断时间从 45 分钟降至 10 分钟,缩短 78%,数据库生命周期操作从 10 多步降为 1 次交互,SRE 与数据团队的 15 分钟汇报延迟变为实时,冗余告警中位数减少 65%。
AWS 官方博客介绍如何用 OpenClaw 开源智能体系统在 AgentCore runtime 上构建具备持久记忆的个人助手 Sprout,整套系统由单个 CloudFormation 模板一键部署。
AWS 展示了如何用 Amazon Bedrock AgentCore、Amazon Bedrock Knowledge Bases 和 Amazon Nova Sonic 为航司应用构建语音旅行礼宾服务,支持用户通过语音查询行程、改选座位、更新餐食偏好与回答政策问题。
Amazon SageMaker 现已支持在 SageMaker Studio UI 中直接创建和管理 Amazon SageMaker HyperPod EKS 集群上的 Spaces,无需命令行工具即可启动 JupyterLab 和 Code Editor 环境。
AWS 介绍了通过 SageMaker Unified Studio 管理 SageMaker HyperPod 集群并保留治理控制的最佳实践,覆盖组织、项目、集群、工作负载四层控制。
NVIDIA 最新《State of AI in Telecommunications》报告显示,89% 的电信运营商受访者认为开源模型和软件对其公司 AI 战略很重要。
Amazon SageMaker AI 优化生成式 AI 推理推出 aws-ai-ml skill,通过 Agent Toolkit for AWS 提供给 Kiro、Claude Code、Codex 等编码智能体,也可用于任何支持 MCP 的智能体。
AWS 介绍如何用 Amazon Bedrock AgentCore Evaluations 评估多智能体系统的可解释性与有用性,该能力同时支持内置评估器(helpfulness、task success、instruction following)和自定义评估器,可校验约束满足、路线可行性、SQL 正确性、库存 grounding 与解释质量。
Amazon Quick 控制台不支持从 Admin 或 Author 直接降级到 Reader,update-user API 同样会拒绝并报错,文章给出手动删除重建与 AWS CLI 两种解决方案。
AWS 推出 Quick Resource Migrator,一个托管在 Amazon Bedrock AgentCore 上的 MCP server,可在单次工具调用中将 Amazon Quick 的 chat agents、action connectors、knowledge bases、flows 和 spaces 自动迁移到生产 AWS 账号。
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 做监督微调,并叠加提示词级输出优化,使其适配自身零售审核策略。
面向 Claude Platform on AWS(CPonAWS),文章给出在专用 AI Services 账户中部署订阅、并用三种方式接入推理的完整步骤:AWS 工作负载账户通过跨账户 SigV4 免密钥调用,开发者笔记本使用绑定开发工作区的 API key,外部环境通过 OIDC 联合获取短期凭证。
OpenAI 发布 GPT-6 系列模型指南,面向初创公司讲解如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备工作流。
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言翻译成固定类型操作并叙述结果。
通过 Amazon Bedrock AgentCore Gateway,可将 Claude Desktop 接入由 Amazon 网页索引支持的 Web Search,覆盖数百亿文档,查询流量全程留在 AWS 内,无需外部 API key。
在 Amazon SageMaker AI 上可用多轮强化学习(MTRL)微调搜索智能体,官方示例以 Qwen3.6-27B 为基础模型,在 us-west-2 区域训练,智能体配备 BM25 词法搜索与向量搜索两个工具。
NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,10 月 23 日开售,起售价 4999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备本地运行。
推荐理由:原文给出 64GB 新配置的价格、可跑模型规模与双机集群方式,便于判断本地跑智能体的硬件门槛。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败与更强教师的成功来定位能力缺口,并生成、验证新的可执行训练任务,课程随模型进步向仍难的任务迁移。该方法以 EnterpriseOps Gym 数据集演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度要求。
OpenAI 的 GPT-6 Astra Ultrafast 已在 NVIDIA Blackwell GPU 上运行,并面向 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:OpenAI 在 NVIDIA Blackwell 上推出 Astra Ultrafast 模式,读者可了解其相对标准模式的提速幅度与开放入口。
AWS Professional Services 用 Strands Agents SDK 在 Amazon Bedrock AgentCore 上构建四智能体模式,将每应用 IaC 开发时间从 3 到 4 周缩短至分钟级。
Amazon Quick 为 AI 构建的应用推出 Live Data in Apps,可在用户每次打开应用时实时查询受治理的 Quick Sight 数据集,取代发布时固化的静态快照。该功能支持 SPICE 与 Direct Query 两种数据集模式,查询以查看者身份执行,自动沿用既有行级与列级安全规则,查看者需为已认证的 Quick 用户并首次按数据集授权。
NVIDIA NeMo Agent Toolkit(NAT)可通过自定义 memory provider 将 Amazon S3 Vectors 用作持久记忆层,并部署在 Amazon EKS 上。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(LinUCB)为产品获客漏斗做个性化内容选择,七周线上 A/B 测试中,一个人群的最终漏斗转化率相对提升达高个位数百分比,另一个人群则未见改善,问题出在内容而非模型。
AWS 介绍如何在 Amazon Bedrock AgentCore 上构建环境智能体(ambient agent):S3 或定时事件触发后,AgentCore Runtime 上的智能体自动分析文件并生成任务,需要时通过单个 ask_human 工具暂停等待人工审批,再从中断处恢复。
NVIDIA 提出 AI 工厂的回报取决于盈利、耐用、通用三大特性,其平台通过全栈协同设计实现最高每兆瓦吞吐与最低 token 成本。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐较 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 模型上每百万 token 成本最高降低 45 倍。
微软研究院实习生开发了一套端到端机器学习流水线,为美国本土 66,935 座变电站生成空间天气风险预测,可提前 30 至 60 分钟预警。系统结合 AE 与 Dst 指数预测、地质电导率和电网数据,在 2020-2026 评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。
Amazon Bedrock Knowledge Bases 可通过 AgenticRetrieveStream API 用自然语言查询理赔文档并返回带引用的答案。
AWS 为 Amazon Bedrock AgentCore 推出 Runtime Instances,用托管 EC2 承载长时间运行的多智能体工作流,会话最长 14 天、支持 GPU 和持久卷,单实例可托管多个智能体。
CoreWeave 宣布在 CoreWeave Cloud 上线 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网,Cognition 成为首个在生产环境运行该平台、支撑 Devin 的客户,早期测试中 SWE-2 推理总 token 吞吐量较 GB200 NVL72 最高提升 4.8 倍。
Amazon Bedrock 在印度上线 Anthropic 的 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5,通过印度地理跨区域推理让数据仅在 ap-south-1 与 ap-south-2 之间流转。
Amazon Bedrock 现支持在首尔区域使用 Claude Opus 5 和 Claude Sonnet 5、在新加坡区域使用 Claude Sonnet 5 进行区域内推理,请求与数据全程不离开所调用的 Region。
基于 Amazon Quick 与 Amazon Bedrock AgentCore 的合同智能平台,用 AI 智能体从合同 PDF 中提取八个关键字段,并由独立的验证智能体复核,签名识别分歧时由 Amazon Textract 作为确定性裁决。
Condé Nast 联合 AWS 生成式 AI 创新中心,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,将单次内容检索耗时从 250 分钟降至 2 分钟以内。该方案采用 TwelveLabs Marengo 嵌入模型,对视频转录文本、画面和音频联合编码,支持自然语言意图搜索、以图搜视频和时间戳定位,覆盖超 14 万条视频库。
Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队,并计划到 2030 年建成 1 吉瓦欧洲算力。该中心将直接服务企业客户,已与 BMW 合作碰撞仿真与工程 AI、与 Siemens Energy 合作工业 AI 应用,并与慕尼黑工业大学(TUM)建立研究合作,利用其风洞设施开发汽车空气动力学数字孪生。