Postman 分享 Agent Mode 在 Amazon Bedrock 上服务 4000 万开发者的架构实践
Postman 与 AWS 撰文介绍 Postman Agent Mode 如何在 Amazon Bedrock 上为 4000 万开发者提供服务的生产架构。
推荐理由:原文用 Postman 的真实生产数据给出工具数量、上下文预算和缓存分层的具体取舍,可直接迁移到自己的 Agent 架构设计中。
Postman 与 AWS 撰文介绍 Postman Agent Mode 如何在 Amazon Bedrock 上为 4000 万开发者提供服务的生产架构。
推荐理由:原文用 Postman 的真实生产数据给出工具数量、上下文预算和缓存分层的具体取舍,可直接迁移到自己的 Agent 架构设计中。
Ai2 AI Infrastructure 团队用 GPU 时间预算、层级公平份额分配和时间片合约取代了原有的优先级调度器,把 GPU 时间分配从逐案谈判变成透明的预算流程。
推荐理由:原文完整拆解了从优先级调度到预算制调度的迁移过程与量化结果,可迁移性强。
作者在 HuggingChat 中开启 ML-intern 模式,几天内用约 USD 103 的总算力成本训练并发布了 6 个模型,包括 0.8B 的 Qwen-Image 2.1 提示词重写器(CPU 可跑。
推荐理由:作者公开了七条完整提示词和预算、基线、冒烟测试三条可复用的提示词写法,读者可直接照搬到自己的微调项目。
NVIDIA 官方博客展示了开发者如何用自然语言指令驱动 GPT-6 Astra 等前沿 AI 智能体,结合 Omniverse 库搭建仿真应用。
AWS 提出一套基于 Amazon SageMaker HyperPod 与 EKS 的多租户参考架构,让多个团队共享同一 GPU 集群并保持隔离与资源公平。
AWS 推出为期六周、每周约四小时的结构化计划,帮助非工程背景的业务人员动手构建 AI 智能体,90% 受访者表示希望获得动手构建 AI agent 的经验。
AWS 官方博客介绍如何用 AWS Lambda Durable Functions、Amazon EventBridge 和 Amazon Bedrock 搭建自动修复工作流,衔接 AWS DevOps Agent 的调查结果完成修复步骤。
AWS Machine Learning Blog 发布文章,提出 Agentic Value Model,指出传统 RPA 时代按省时数乘人工成本的 ROI 模型无法覆盖智能体自动化创造的价值。
Cornerstone OnDemand 基于 Amazon Bedrock 和开源框架 Strands Agents 构建多智能体系统 Orion AI,将数据库诊断时间从 45 分钟降至 10 分钟,缩短 78%,数据库生命周期操作从 10 多步降为 1 次交互,SRE 与数据团队的 15 分钟汇报延迟变为实时,冗余告警中位数减少 65%。
AWS 官方博客介绍如何用 OpenClaw 开源智能体系统在 AgentCore runtime 上构建具备持久记忆的个人助手 Sprout,整套系统由单个 CloudFormation 模板一键部署。
AWS 展示了如何用 Amazon Bedrock AgentCore、Amazon Bedrock Knowledge Bases 和 Amazon Nova Sonic 为航司应用构建语音旅行礼宾服务,支持用户通过语音查询行程、改选座位、更新餐食偏好与回答政策问题。
AWS 介绍了通过 SageMaker Unified Studio 管理 SageMaker HyperPod 集群并保留治理控制的最佳实践,覆盖组织、项目、集群、工作负载四层控制。
AWS 通过解读国际标准 ISO/IEC 42005:2025,帮助客户将 AI 系统影响评估整合进企业治理体系。该标准提供评估全生命周期指导,其 Annex D 支持与既有风险、隐私等评估流程整合以避免重复,Annex E 提供独立评估模板。
AWS 发布教程,介绍如何在 AWS GovCloud (US) 的 Amazon Bedrock 上使用 Claude Code 支撑带合规要求的工作负载。
AWS 介绍如何用 Amazon Bedrock AgentCore Evaluations 评估多智能体系统的可解释性与有用性,该能力同时支持内置评估器(helpfulness、task success、instruction following)和自定义评估器,可校验约束满足、路线可行性、SQL 正确性、库存 grounding 与解释质量。
Amazon Quick 控制台不支持从 Admin 或 Author 直接降级到 Reader,update-user API 同样会拒绝并报错,文章给出手动删除重建与 AWS CLI 两种解决方案。
AWS 官方教程演示在 Amazon Bedrock Managed Knowledge Bases 上用 LangChain 构建 RAG 应用,对比标准 Retrieve API 与 AgenticRetrieveStream API 处理多段问题的差异。
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 做监督微调,并叠加提示词级输出优化,使其适配自身零售审核策略。
面向 Claude Platform on AWS(CPonAWS),文章给出在专用 AI Services 账户中部署订阅、并用三种方式接入推理的完整步骤:AWS 工作负载账户通过跨账户 SigV4 免密钥调用,开发者笔记本使用绑定开发工作区的 API key,外部环境通过 OIDC 联合获取短期凭证。
OpenAI 发布 GPT-6 系列模型指南,面向初创公司讲解如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备工作流。
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言翻译成固定类型操作并叙述结果。
通过 Amazon Bedrock AgentCore Gateway,可将 Claude Desktop 接入由 Amazon 网页索引支持的 Web Search,覆盖数百亿文档,查询流量全程留在 AWS 内,无需外部 API key。
在 Amazon SageMaker AI 上可用多轮强化学习(MTRL)微调搜索智能体,官方示例以 Qwen3.6-27B 为基础模型,在 us-west-2 区域训练,智能体配备 BM25 词法搜索与向量搜索两个工具。
GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次回答、用 AI 节省的时间去解决更大的问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,以发现首个模型遗漏的问题。
AWS Professional Services 用 Strands Agents SDK 在 Amazon Bedrock AgentCore 上构建四智能体模式,将每应用 IaC 开发时间从 3 到 4 周缩短至分钟级。
NVIDIA NeMo Agent Toolkit(NAT)可通过自定义 memory provider 将 Amazon S3 Vectors 用作持久记忆层,并部署在 Amazon EKS 上。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(LinUCB)为产品获客漏斗做个性化内容选择,七周线上 A/B 测试中,一个人群的最终漏斗转化率相对提升达高个位数百分比,另一个人群则未见改善,问题出在内容而非模型。
AWS 介绍如何在 Amazon Bedrock AgentCore 上构建环境智能体(ambient agent):S3 或定时事件触发后,AgentCore Runtime 上的智能体自动分析文件并生成任务,需要时通过单个 ask_human 工具暂停等待人工审批,再从中断处恢复。
Amazon Bedrock Knowledge Bases 可通过 AgenticRetrieveStream API 用自然语言查询理赔文档并返回带引用的答案。
AWS 为 Amazon Bedrock AgentCore 推出 Runtime Instances,用托管 EC2 承载长时间运行的多智能体工作流,会话最长 14 天、支持 GPU 和持久卷,单实例可托管多个智能体。
Amazon Quick 的提示词工程基础指南(系列第一部分)给出跨组件通用的提示词原则与框架,包括以具体性实现清晰、用业务上下文提升相关性、以示例代替描述,以及 CRISPE 结构化提示词模板。
Amazon Quick 各组件对提示词的解析方式不同,需按组件分别设计。Quick Research 要求明确目标、受众与关注范围,并可从 Quick Index。
基于 Amazon Quick 与 Amazon Bedrock AgentCore 的合同智能平台,用 AI 智能体从合同 PDF 中提取八个关键字段,并由独立的验证智能体复核,签名识别分歧时由 Amazon Textract 作为确定性裁决。
Condé Nast 联合 AWS 生成式 AI 创新中心,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,将单次内容检索耗时从 250 分钟降至 2 分钟以内。该方案采用 TwelveLabs Marengo 嵌入模型,对视频转录文本、画面和音频联合编码,支持自然语言意图搜索、以图搜视频和时间戳定位,覆盖超 14 万条视频库。
GitHub Copilot 应用中的 canvas(画布扩展)是一种可自定义界面,用户只需在 agent 会话中输入 /create-canvas 并用自然语言描述需求,即可生成看板、发布清单或仪表盘等界面,无需编写代码或手动设计。
GitHub Copilot 应用重建了 pull request 视图,以应对包含 2,200 个文件、超百万行改动和 400 多条行内评论的超大 diff。其做法是把文档高度拆成确定性的代码几何与动态评论块两套几何:代码行高提前精确计算,评论高度则延迟测量、按文件与行锚定,避免滚动跳变。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体编写了大部分代码,跨 128 个 PR 增量落地,性能提升数个数量级。
推荐理由:GitHub 工程师复盘用 Copilot 把运行时从 TypeScript 迁到 Rust 的全过程,含提示缓存、子智能体分工等可迁移的工程经验。
GitHub 日本和韩国营销负责人用 GitHub Copilot 把活动运营自动化:以 GitHub Issue 为工作单元,Issue forms 收集活动字段、Labels 触发 GitHub Actions 工作流,活动从单个 Issue 自动搭建、每日自动筛选报名者并在结束后自动清理。
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让开发者无需在编辑器、终端窗口和浏览器之间来回切换,即可完成审查、运行和预览 AI 生成代码的完整闭环。
TRL v1.14 的 AsyncGRPOTrainer 现已支持只训练并同步 LoRA adapter 到 vLLM,rank-1 adapter 仅几 MB,可通过挂载在三个 HF Jobs 上的 Storage Bucket 传输,无需 NCCL。