OpenRouter Security Center 上线:按风险分组 API 密钥并给出修复建议
OpenRouter 的 Security Center 设有 Overview、key safety 和 IP allowlist 三个标签页。其中 Overview 会按风险对 API 密钥分组,包括无消费限额、无过期时间、90+ 天未使用或可安全移除,并针对每组给出建议,让用户直接在 Security Center 中定位并修复风险密钥。
OpenRouter 的 Security Center 设有 Overview、key safety 和 IP allowlist 三个标签页。其中 Overview 会按风险对 API 密钥分组,包括无消费限额、无过期时间、90+ 天未使用或可安全移除,并针对每组给出建议,让用户直接在 Security Center 中定位并修复风险密钥。
OpenRouter 发布 Model Router Benchmarks,在 6 个基准上从质量、速度、成本三个维度对比 7 个模型路由,包括 Jev Router、Unbiased Pareto、NVIDIA Switchyard 等。
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 做监督微调,并叠加提示词级输出优化,使其适配自身零售审核策略。
面向 Claude Platform on AWS(CPonAWS),文章给出在专用 AI Services 账户中部署订阅、并用三种方式接入推理的完整步骤:AWS 工作负载账户通过跨账户 SigV4 免密钥调用,开发者笔记本使用绑定开发工作区的 API key,外部环境通过 OIDC 联合获取短期凭证。
Replit 演示了用对话方式分析漏斗数据:先问“Where can we increase activation?”,再追问“Make it a dashboard”,无需预先知道最终产出即可从一句提问得到洞察和可用结果。该流程面向用户注册后的激活环节,帮助更多人完成首次关键体验。
Volantis 宣布完成 8800 万美元 A 轮融资,用光学技术解决 AI 内存瓶颈,将单芯片内存带宽与容量提升数个数量级,实现大模型(>10T)最高 10,000 tps/user 的超快推理和低 $/tok。该方案初期面向编程智能体,把原本数小时的任务压缩到几分钟甚至几秒,其下一代产品已完成流片,目标刷新相关距离上的带宽密度世界纪录。
DeepSeek Harness v0.2 是一款由 DeepSeek 模型驱动的桌面应用,现已登陆 macOS、Windows 和 Linux,可执行工作与编码任务,并开箱支持 Plugins 和 Workspaces。
AWS 发布开源决策模型 Strands Decider 2B,基于 Qwen3.5-2B 构建,可在本地运行,用于在预设选项中快速做出选择并给出置信度评分。该模型由 AWS 杰出工程师 Marc Brooker 受 TypeSafe 的 Jev 启发开发,曾在同尺寸模型的 Jevbench 排名中登顶。
OpenRouter 上线 IP allowlist 功能,管理员可将 API 访问限制在已批准的 IP 地址范围内,来自其他地址的请求会被拦截。该功能面向需要收紧 API 调用来源管控的管理员。
OpenRouter 上线 Security Center,可跨工作区查看全部 API 密钥并按风险标记,支持批量禁用、归档或限额最多 500 个密钥。该功能含 Overview、key safety 和 IP allowlist 三个标签页,风险分组包括无消费限额、无过期时间、90 天以上未使用等,IP allowlist 可限制仅获批 IP 地址访问 API。
OpenRouter 上线 Security Center,可展示各工作区全部 API 密钥并标记风险及原因,支持一次性禁用、归档或限额最多 500 个密钥。该功能源于其自查发现 85 名员工持有 1000 多个活跃 API 密钥,许多已数月未用。
SemiAnalysis 分析称,定制 HBM 可将内存控制器从 XPU 移到 HBM base die,并用 Nvidia 的 NV-HBI die-to-die 链路替代标准 PHY。
SemiAnalysis Weekly 新一期由 Jordan Nanos 主持,Cam Quilici、Bryan Shan 和 Alec Ibarra 参与,InferenceX 团队解析了 Engram 内存卸载、AgentX 利润计算器、TPU v7、Vera Rubin 与 Blackwell 的对比,以及更快的 token 是否值得溢价。
OpenAI DevDay 笔记指出,构建智能体应用优化成本与性能的 4 个关键杠杆是 prompt caching、reasoning effort、programmatic tool calling 和 batch request。这些是 OpenAI 开发文档之外值得优先尝试的起点,建议熟悉后用 evals 进行测量。
OpenRouter 推出 Model Router Benchmarks,在 6 项基准上从质量、速度、成本三个维度横向对比 7 款模型路由器,涵盖 Unbiased Pareto、Sakana Fugu、Auto Router、Jev Router、NVIDIA Switchyard 等,并纳入领先单体模型作为对照。
OpenRouter 推出 Model Router Benchmarks,在 6 项基准上从质量、速度、成本三个维度对比 7 个模型路由,涵盖 Jev Router、Unbiased Pareto、NVIDIA Switchyard 等。
OpenRouter 上线 Model Router Benchmarks,可并排对比 7 款模型路由器在 6 项基准上的质量、速度和成本表现。参与对比的路由器包括 Jev Router、Unbiased Pareto、NVIDIA Switchyard 等,现已开放使用。
Cohere 与 vLLM 将在多伦多举办一场 meetup,面向 AI 工程师、研究人员和基础设施构建者,报名链接为 luma.com/vllm-y009。活动为晚间聚会,供参与者与 vLLM 社区交流连接。
vLLM 与 Cohere 将在多伦多联合举办 meetup,讨论双方对开源生态的贡献与未来方向。vLLM 的一位核心维护者将分享 vLLM 的下一步规划,NVIDIA AI 工程师则将讲解智能体调试。活动面向开发者开放,可与双方团队现场交流。
Cohere 与 vLLM 将在多伦多举办一场 meetup,面向 AI 工程师、研究人员和基础设施构建者,报名链接为 luma.com/vllm-y009。活动为晚间聚会,供参与者与 vLLM 社区交流连接。
Perplexity 表示期待在 SPACE 上使用 NVIDIA 新款 Vera CPU,NVIDIA 团队已到访并交付该芯片。Perplexity 称其正在构建的许多能力依赖智能体安全可靠地运行更强的代码环境,因此对在 Vera 上测试这项工作感到兴奋。
Cloudflare 发布 Clef 和 Clef-flash 两款面向 AI 智能体的决策模型,返回带概率的简短分类而非长文本,用于路由工单、触发升级或转交人工。
Cursor 推出 Rollouts,可编写监控计划并在部署过程中持续观察变更,在用户感知前捕获回归问题。一旦发现回归,它会定位肇事的 PR 并自动开启 issue,一键即可启动云智能体进行修复。Rollouts 使用额度免费包含至 10 月 3 日。
OpenAI 发布 GPT-6 系列模型指南,面向初创公司讲解如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备工作流。
MIT Technology Review 报告指出,企业 AI 的规模化瓶颈是结构性的,全球 AI 投资 2026 年将达 2.5 万亿美元、同比增长 44%,但多数企业仍未靠 AI 增长收入。报告称领先企业把流程重设计置于模型选型之前,并强调数据就绪而非数据规模,主张以主权、可组合的架构在数据原地查询与准备数据,供 AI 智能体直接行动。
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言翻译成固定类型操作并叙述结果。
通过 Amazon Bedrock AgentCore Gateway,可将 Claude Desktop 接入由 Amazon 网页索引支持的 Web Search,覆盖数百亿文档,查询流量全程留在 AWS 内,无需外部 API key。
在 Amazon SageMaker AI 上可用多轮强化学习(MTRL)微调搜索智能体,官方示例以 Qwen3.6-27B 为基础模型,在 us-west-2 区域训练,智能体配备 BM25 词法搜索与向量搜索两个工具。
Airbnb CTO Ahmad Al-Dahle 向 Latent Space 介绍了公司的 AI 原生改造:目前 60% 的代码由 AI 编写,功能交付量同比增长近 80%,工程师人均 PR 吞吐量提升约 1.6 倍。
NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,10 月 23 日开售,起售价 4999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备本地运行。
推荐理由:原文给出 64GB 新配置的价格、可跑模型规模与双机集群方式,便于判断本地跑智能体的硬件门槛。
DeepSeek 发布 DeepSeek Harness 的打包桌面版,现已支持 macOS 和 Windows。Linux 用户可通过 npm 上的 @deepseek-ai/dsh 包获取,详情见 deepseek.com/harness。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败与更强教师的成功来定位能力缺口,并生成、验证新的可执行训练任务,课程随模型进步向仍难的任务迁移。该方法以 EnterpriseOps Gym 数据集演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度要求。
MiniMax 美国业务发展负责人 Morgan Suo 将于 10 月 14 日在 AI Engineer NYC 发表演讲“The Hidden Costs of a Faster Model”,讨论量化、投机解码与推理控制如何改变模型的成本、速度和质量,以及切换模型前需要检查什么。演讲时间为美东时间 10:40–10:58,地点在纽约时代广场喜来登酒店 McCarthy Room。
LangChain 在 Open SWE 智能体 Harness 内构建模型路由器,按任务分类选择最低成本合适模型,将编码线程中位数成本降低 64% 且质量变化可忽略。Olmo-core 3 面向大规模 MoE 训练,在八块 B300 配置下吞吐量较前代提升 2.7 倍。Cohere 发布 Embed 5 嵌入模型系列,含 Pro 和 Fast 版本,面向搜索与智能体工作流。
OpenAI 的 GPT-6 Astra Ultrafast 已在 NVIDIA Blackwell GPU 上运行,并面向 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:OpenAI 在 NVIDIA Blackwell 上推出 Astra Ultrafast 模式,读者可了解其相对标准模式的提速幅度与开放入口。
AWS Professional Services 用 Strands Agents SDK 在 Amazon Bedrock AgentCore 上构建四智能体模式,将每应用 IaC 开发时间从 3 到 4 周缩短至分钟级。
Amazon Quick 为 AI 构建的应用推出 Live Data in Apps,可在用户每次打开应用时实时查询受治理的 Quick Sight 数据集,取代发布时固化的静态快照。该功能支持 SPICE 与 Direct Query 两种数据集模式,查询以查看者身份执行,自动沿用既有行级与列级安全规则,查看者需为已认证的 Quick 用户并首次按数据集授权。
NVIDIA NeMo Agent Toolkit(NAT)可通过自定义 memory provider 将 Amazon S3 Vectors 用作持久记忆层,并部署在 Amazon EKS 上。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(LinUCB)为产品获客漏斗做个性化内容选择,七周线上 A/B 测试中,一个人群的最终漏斗转化率相对提升达高个位数百分比,另一个人群则未见改善,问题出在内容而非模型。
AWS 介绍如何在 Amazon Bedrock AgentCore 上构建环境智能体(ambient agent):S3 或定时事件触发后,AgentCore Runtime 上的智能体自动分析文件并生成任务,需要时通过单个 ask_human 工具暂停等待人工审批,再从中断处恢复。