用 Amazon Bedrock AgentCore 为 Claude Desktop 添加安全 Web Search
通过 Amazon Bedrock AgentCore Gateway,可将 Claude Desktop 接入由 Amazon 网页索引支持的 Web Search,覆盖数百亿文档,查询流量全程留在 AWS 内,无需外部 API key。
通过 Amazon Bedrock AgentCore Gateway,可将 Claude Desktop 接入由 Amazon 网页索引支持的 Web Search,覆盖数百亿文档,查询流量全程留在 AWS 内,无需外部 API key。
在 Amazon SageMaker AI 上可用多轮强化学习(MTRL)微调搜索智能体,官方示例以 Qwen3.6-27B 为基础模型,在 us-west-2 区域训练,智能体配备 BM25 词法搜索与向量搜索两个工具。
Airbnb CTO Ahmad Al-Dahle 向 Latent Space 介绍了公司的 AI 原生改造:目前 60% 的代码由 AI 编写,功能交付量同比增长近 80%,工程师人均 PR 吞吐量提升约 1.6 倍。
NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,10 月 23 日开售,起售价 4999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备本地运行。
推荐理由:原文给出 64GB 新配置的价格、可跑模型规模与双机集群方式,便于判断本地跑智能体的硬件门槛。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败与更强教师的成功来定位能力缺口,并生成、验证新的可执行训练任务,课程随模型进步向仍难的任务迁移。该方法以 EnterpriseOps Gym 数据集演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度要求。
OpenAI 的 GPT-6 Astra Ultrafast 已在 NVIDIA Blackwell GPU 上运行,并面向 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:OpenAI 在 NVIDIA Blackwell 上推出 Astra Ultrafast 模式,读者可了解其相对标准模式的提速幅度与开放入口。
AWS Professional Services 用 Strands Agents SDK 在 Amazon Bedrock AgentCore 上构建四智能体模式,将每应用 IaC 开发时间从 3 到 4 周缩短至分钟级。
Amazon Quick 为 AI 构建的应用推出 Live Data in Apps,可在用户每次打开应用时实时查询受治理的 Quick Sight 数据集,取代发布时固化的静态快照。该功能支持 SPICE 与 Direct Query 两种数据集模式,查询以查看者身份执行,自动沿用既有行级与列级安全规则,查看者需为已认证的 Quick 用户并首次按数据集授权。
NVIDIA NeMo Agent Toolkit(NAT)可通过自定义 memory provider 将 Amazon S3 Vectors 用作持久记忆层,并部署在 Amazon EKS 上。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(LinUCB)为产品获客漏斗做个性化内容选择,七周线上 A/B 测试中,一个人群的最终漏斗转化率相对提升达高个位数百分比,另一个人群则未见改善,问题出在内容而非模型。
AWS 介绍如何在 Amazon Bedrock AgentCore 上构建环境智能体(ambient agent):S3 或定时事件触发后,AgentCore Runtime 上的智能体自动分析文件并生成任务,需要时通过单个 ask_human 工具暂停等待人工审批,再从中断处恢复。
NVIDIA 提出 AI 工厂的回报取决于盈利、耐用、通用三大特性,其平台通过全栈协同设计实现最高每兆瓦吞吐与最低 token 成本。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐较 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 模型上每百万 token 成本最高降低 45 倍。
SemiAnalysis 在 TensorWave 评测中记录了一个真实案例:节点 MIA1-P01-G57 于下午 3:56 进入 draining,4:39 由 MIA1-P01-G61 替换,全程 43 分钟。其认为这种可见的 draining → approve → replace 链路正是买家需要的,SLA 应验证备件健康且任务确实在其上运行。
SemiAnalysis 基于 ClusterMAX 评估提出 GPU 集群 Bronze / Silver / Gold 三级 SLA 条款,涵盖明确的宕机定义、赔付、验收测试、月度审查和买方终止权,主张以恢复的可用容量而非关闭工单数来衡量可靠性。
SemiAnalysis 的 ClusterMAX 评估通过注入故障、追踪从检测到容量恢复的全过程来衡量 GPU 集群可靠性,发现各供应商处理能力差异显著。其 TensorWave 评估中,节点 MIA1-P01-G57 于下午 3:56 开始排空,4:39 被 MIA1-P01-G61 替换,耗时 43 分钟。
微软研究院实习生开发了一套端到端机器学习流水线,为美国本土 66,935 座变电站生成空间天气风险预测,可提前 30 至 60 分钟预警。系统结合 AE 与 Dst 指数预测、地质电导率和电网数据,在 2020-2026 评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。
Amazon Bedrock Knowledge Bases 可通过 AgenticRetrieveStream API 用自然语言查询理赔文档并返回带引用的答案。
AWS 为 Amazon Bedrock AgentCore 推出 Runtime Instances,用托管 EC2 承载长时间运行的多智能体工作流,会话最长 14 天、支持 GPU 和持久卷,单实例可托管多个智能体。
CoreWeave 宣布在 CoreWeave Cloud 上线 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网,Cognition 成为首个在生产环境运行该平台、支撑 Devin 的客户,早期测试中 SWE-2 推理总 token 吞吐量较 GB200 NVL72 最高提升 4.8 倍。
Amazon Bedrock 在印度上线 Anthropic 的 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5,通过印度地理跨区域推理让数据仅在 ap-south-1 与 ap-south-2 之间流转。
Amazon Bedrock 现支持在首尔区域使用 Claude Opus 5 和 Claude Sonnet 5、在新加坡区域使用 Claude Sonnet 5 进行区域内推理,请求与数据全程不离开所调用的 Region。
基于 Amazon Quick 与 Amazon Bedrock AgentCore 的合同智能平台,用 AI 智能体从合同 PDF 中提取八个关键字段,并由独立的验证智能体复核,签名识别分歧时由 Amazon Textract 作为确定性裁决。
Condé Nast 联合 AWS 生成式 AI 创新中心,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,将单次内容检索耗时从 250 分钟降至 2 分钟以内。该方案采用 TwelveLabs Marengo 嵌入模型,对视频转录文本、画面和音频联合编码,支持自然语言意图搜索、以图搜视频和时间戳定位,覆盖超 14 万条视频库。
一家公司宣布与 Cerebras 合作部署其称为全球最快的推理服务,主打 20x 更快的 AI 体验,以解决算力供给不足的问题。方案使用 GPU 做 prefill,并称成本比以往更低,首批 token 将于 Q127 上线。
SeatGeek 用 Serval 在 60 天内自动化了 50% 的 IT 请求,8 周内构建 132 个自动化流程,并实现零裁员。其 CEO Jack Gretz 在 CNBC Squawk Box 上表示,公司今年招聘进度已超过去年全年,IT 人员被重新部署去解决更难的问题。
HPE 提出,当 AI 从试验走向生产、需求变得稳定且关键业务化后,按 token 逐次消费的模式会让 AI 支出变成难以预测的月度变动项,企业需评估自有算力的盈亏平衡点。
DeepSeek 弹性计算团队(DSec)发布技术分享《面向大规模 Agent 训练的沙盒基础设施》,并放出大量 HC 招聘,尤其需要资深工程师。
MiniCPM-o 4.5 现已登陆 SGLang Omni v0.1.7。 开发者在运行和构建该模型时将拥有更多灵活性。
Cognition 宣布 Devin 成本效率最高提升 40%,Fusion 和 Normal 模式便宜 30-40%,Ultra 模式便宜 15-20%,Devin Review 最高便宜 70%,原因是采用了最新模型和更高效的 harness。
Cognition 宣布 Devin 更新后大幅降价:Fusion 和 Normal 便宜 30–40%,Ultra 便宜 15–20%,Devin Review 最高便宜 70%,同时能力有所提升,Devin Fusion 在 FrontierCode 1.1 Extended 上排名第一。
Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队,并计划到 2030 年建成 1 吉瓦欧洲算力。该中心将直接服务企业客户,已与 BMW 合作碰撞仿真与工程 AI、与 Siemens Energy 合作工业 AI 应用,并与慕尼黑工业大学(TUM)建立研究合作,利用其风洞设施开发汽车空气动力学数字孪生。