用 Amazon Quick 与 Adjudicated Query 模式批量审查数千份租约合规性
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言翻译成固定类型操作并叙述结果。
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言翻译成固定类型操作并叙述结果。
在 Amazon SageMaker AI 上可用多轮强化学习(MTRL)微调搜索智能体,官方示例以 Qwen3.6-27B 为基础模型,在 us-west-2 区域训练,智能体配备 BM25 词法搜索与向量搜索两个工具。
GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次回答、用 AI 节省的时间去解决更大的问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,以发现首个模型遗漏的问题。
NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,10 月 23 日开售,起售价 4999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备本地运行。
推荐理由:原文给出 64GB 新配置的价格、可跑模型规模与双机集群方式,便于判断本地跑智能体的硬件门槛。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败与更强教师的成功来定位能力缺口,并生成、验证新的可执行训练任务,课程随模型进步向仍难的任务迁移。该方法以 EnterpriseOps Gym 数据集演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度要求。
AWS Professional Services 用 Strands Agents SDK 在 Amazon Bedrock AgentCore 上构建四智能体模式,将每应用 IaC 开发时间从 3 到 4 周缩短至分钟级。
Amazon Quick 为 AI 构建的应用推出 Live Data in Apps,可在用户每次打开应用时实时查询受治理的 Quick Sight 数据集,取代发布时固化的静态快照。该功能支持 SPICE 与 Direct Query 两种数据集模式,查询以查看者身份执行,自动沿用既有行级与列级安全规则,查看者需为已认证的 Quick 用户并首次按数据集授权。
NVIDIA NeMo Agent Toolkit(NAT)可通过自定义 memory provider 将 Amazon S3 Vectors 用作持久记忆层,并部署在 Amazon EKS 上。
AWS 介绍如何在 Amazon Bedrock AgentCore 上构建环境智能体(ambient agent):S3 或定时事件触发后,AgentCore Runtime 上的智能体自动分析文件并生成任务,需要时通过单个 ask_human 工具暂停等待人工审批,再从中断处恢复。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后将逐步面向开发者、企业和消费者推出,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元。
推荐理由:Gemini 4 Argon 的 1M 输出 token 与多项基准成绩,展示了长程复杂任务上的能力边界变化。
Amazon Bedrock Knowledge Bases 可通过 AgenticRetrieveStream API 用自然语言查询理赔文档并返回带引用的答案。
AWS 为 Amazon Bedrock AgentCore 推出 Runtime Instances,用托管 EC2 承载长时间运行的多智能体工作流,会话最长 14 天、支持 GPU 和持久卷,单实例可托管多个智能体。
CoreWeave 宣布在 CoreWeave Cloud 上线 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网,Cognition 成为首个在生产环境运行该平台、支撑 Devin 的客户,早期测试中 SWE-2 推理总 token 吞吐量较 GB200 NVL72 最高提升 4.8 倍。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,面向智能体编码、计算机使用和专业工作负载提供更强的推理能力。据 OpenAI 称,它在 DeepSWE v1.1 上达到 GPT-6 Astra 的水平,每任务成本约为其五分之一,并比 GPT-6 Sol 的最佳成绩高出 6.4 个百分点。
推荐理由:原文给出 GPT-6.1 Sol 在 Bedrock 上的可用范围与成本对比,读者可据此判断智能体编码任务的性价比。
Amazon Quick 的提示词工程基础指南(系列第一部分)给出跨组件通用的提示词原则与框架,包括以具体性实现清晰、用业务上下文提升相关性、以示例代替描述,以及 CRISPE 结构化提示词模板。
Amazon Quick 各组件对提示词的解析方式不同,需按组件分别设计。Quick Research 要求明确目标、受众与关注范围,并可从 Quick Index。
基于 Amazon Quick 与 Amazon Bedrock AgentCore 的合同智能平台,用 AI 智能体从合同 PDF 中提取八个关键字段,并由独立的验证智能体复核,签名识别分歧时由 Amazon Textract 作为确定性裁决。
Hugging Face 博客介绍论文 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,专门检测"跨来源混淆"——即事实在证据池中为真、却被归给错误来源。在 281 条医疗智能体真实 trace 上,专家判定 361 条 claim 中 139 条不应通过,ProvenanceGuard 拦下 138 条,并在可识别来源的 claim 上约 86% 选对来源。
OpenAI 发布 DevDay 2026 回顾,汇总 20 多项发布,涉及 GPT-6 Astra、ChatGPT、Codex、API、安全以及面向开发者的新工具。
OpenAI 发布 GPT-6.1 Sol,官方称其具备接近 Astra 的智能水平,面向编码、电脑操作和专业工作场景。该模型标准 API 输入与输出 token 价格均为 Astra 的五分之一。
推荐理由:OpenAI 公布 GPT-6.1 Sol 的定位与定价,读者可据此比较它与 Astra 在编码和电脑操作上的取舍。
OpenAI 发布 dots,将其定义为可跨复杂项目和日常任务持续推进的主动式助手。官方说明 dots 让用户在任务推进过程中保持控制权,具体能力与开放方式尚未在摘要中给出。
推荐理由:OpenAI 官方给出 dots 的定位与可控性说明,读者可据此判断这类主动式助手与现有工具的分工。
H公司发布 Holo4 系列智能体模型,包含 27B dense 与 35B-A3B Mixture of Experts 两个版本,均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 形式开源在 Hugging Face,同时发布 Holotron4 Nano。
推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,可据此判断通用计算机操作智能体的路线取舍。
GitHub Copilot 应用中的 canvas(画布扩展)是一种可自定义界面,用户只需在 agent 会话中输入 /create-canvas 并用自然语言描述需求,即可生成看板、发布清单或仪表盘等界面,无需编写代码或手动设计。
GitHub Copilot 应用中的 canvas 是一种运行在应用内、无浏览器外壳的全栈小应用,可与 Copilot 智能体双向通信,并能在本地执行代码、调用第三方 API。
Google Research 发布 AI video co-director 等多智能体框架,用于生成连贯的长篇多镜头视频,相关论文将出现在 COLM 2026 和 EMNLP 2026。
推荐理由:Google 把长视频生成拆成规划、分镜、自回归生成与闭环修正四套框架,并给出多组基准上的连续性提升结果。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指定 GitHub 仓库,它就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做定级并生成漏洞报告。
推荐理由:原文完整披露了 Fuzzing Taskflow 的流水线分层、覆盖反馈循环与崩溃定级机制,可据此判断 LLM 智能体在安全测试中的可迁移边界。
Ringg 基于 GPT-5.6 构建的多语言 AI 智能体可解决最多 65% 的客户来电,覆盖语音、聊天、WhatsApp 和网页渠道。相比 GPT-4.1,其成本降低 90%。
NVIDIA 在新加坡 AI Day 上联合合作伙伴展示东南亚区域的 AI 落地进展,新加坡 HTX 正研究使用 NVIDIA Nemotron 3 Super 与 Nemotron 3 Nano Omni 模型推进公共安全 AI。
Airbnb 正在扩大工程团队对 GPT-6 Astra 及 OpenAI 前沿模型的访问权限,用于排查 bug、设计系统和加快交付。
NVIDIA 在加拿大多伦多 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速软件包集合,新增智能体工作流与平台支持,支持 ROS Lyrical 和 Ubuntu 24.04。
推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,并给出可复用的技能与生态伙伴落地案例。
Parallel 的智能体借助 GPT-6 Astra 完成劳动力市场数据的研究与综合,耗时和成本均降至此前模型的一半。
NVIDIA 提出 AI 安全应作为工程问题处理,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。其开源安全运行时 NVIDIA OpenShell 在智能体之外强制执行策略并提供沙箱化执行,Cisco DefenseClaw 在其上增加治理层,JFrog 则集成 OpenShell 扫描和验证智能体技能。
V7 使用 GPT-5.6 将分散的公司文件转化为智能体可用的上下文,以完成复杂且带来源链接的工作,同时成本降低 78%、准确率提升。
GitHub Podcast 最新一期逐条拆解了五个 AI 热梗:AI 生成的代码仍需人来负责,只是审查力度应按风险分级;Skills 与 MCP 解决的是不同问题,前者是打包好的经验,后者是连接工具与数据的标准;RAG 并未消亡,它让模型从训练数据之外获取文档、内部知识和代码库上下文,检索不佳会浪费 token、拖慢速度并增加答案不完整的概率。
Google Research 发布一项研究实验,让教师借助生成式 UI(GenUI)创建贴合自身课程目标的互动教学模拟,并同步开放 30 多个面向中学 STEM 的英文学习互动样例库,均由 AI 生成、教师审核。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体编写了大部分代码,跨 128 个 PR 增量落地,性能提升数个数量级。
推荐理由:GitHub 工程师复盘用 Copilot 把运行时从 TypeScript 迁到 Rust 的全过程,含提示缓存、子智能体分工等可迁移的工程经验。
OpenAI 推出 AI 驱动的广告新体验,包括 Sponsored Agents 以及面向营销人员的工具,并接入 HubSpot 和 Shopify。
Mistral 与 Mozilla 达成合作,Firefox 的 AI 浏览助手 Smart Window(beta)现由 Mistral 模型驱动,率先面向法国和北美用户,英国和德国预计今年晚些时候跟进。双方称对话默认不保存在 Mozilla 服务器上,Mistral 同意零数据保留,并按地区语言、方言和文化语境微调模型。
Hex 的数据智能体借助 GPT-6 Astra,把分析答案转化为可交互的可视化报告,供员工直接分享。
Google DeepMind 发布两款实时对话模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:官方给出两款语音模型的基准成绩与开放渠道,可据此判断实时语音智能体的能力水位与成本取舍。