用 Amazon Quick 与 Adjudicated Query 模式批量审查数千份租约合规性
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言翻译成固定类型操作并叙述结果。
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言翻译成固定类型操作并叙述结果。
有开发者基于 opencode v2 构建了一个浏览器侧边栏,能够运行脚本、修改并控制用户当前所在的页面。该开发者称在 opencode v2 之上构建客户端"极其强大",并表示在进一步测试后会将其作为 Chrome 插件发布。
NVIDIA 发布关于长时程智能体的论文,提出 Long-Transduction 测试方法,要求模型在数千次输出中持续读取、更新并输出依赖状态的结果,并分别改变三个因素。
在 Amazon SageMaker AI 上可用多轮强化学习(MTRL)微调搜索智能体,官方示例以 Qwen3.6-27B 为基础模型,在 us-west-2 区域训练,智能体配备 BM25 词法搜索与向量搜索两个工具。
Canva AI 研究负责人 Stefano Corazza、ElevenLabs CRO Ashley Kramer 与 Nebius CMO Lindsey Irvine 共同讨论了为创意者构建 AI 工具的话题。他们指出,控制与一致性最为关键,而智能体正在改变营销团队的工作方式。
GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次回答、用 AI 节省的时间去解决更大的问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,以发现首个模型遗漏的问题。
CAMEL-AI 的 SETA(Scaling Environments for Terminal Agents)被 NeurIPS 2026 Evaluations & Datasets Track 接收,并开源了 SETA-Env 数据集,包含 4500+ 可验证终端 RL 环境及配套的可扩展合成与质量控制流水线。
Airbnb CTO Ahmad Al-Dahle 向 Latent Space 介绍了公司的 AI 原生改造:目前 60% 的代码由 AI 编写,功能交付量同比增长近 80%,工程师人均 PR 吞吐量提升约 1.6 倍。
NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,10 月 23 日开售,起售价 4999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备本地运行。
推荐理由:原文给出 64GB 新配置的价格、可跑模型规模与双机集群方式,便于判断本地跑智能体的硬件门槛。
thesystms 团队在 48 小时内构建了一个创意智能体,@ingi_erlingsson 记录了其解读情绪板的流程:先捕捉感受,再依次处理色彩、色调与镜头,随后由 @armandgw 将其封装为 Krea Agent 技能。
SETA(Scaling Environments for Terminal Agents)被 NeurIPS 2026 Evaluations & Datasets Track 接收,并发布 SETA-Env 数据集,包含 4500+ 个开源可验证终端 RL 环境及完整的合成与训练管线。
餐厅、零售等一线服务人员反映,越来越多顾客拿 ChatGPT 的说法反驳专业建议,甚至无视过敏原警告。纽约服务员 Madison 称有客人坚持点含贝类的高汤鱼菜,理由是 ChatGPT 说没有贝类;酒侍也常被顾客用 ChatGPT 取代。Meta 新 AI 智能体 Muse 的推出可能加剧这一问题。
微软 AI 发布实时转录模型 MAI-Transcribe-2-Streaming,支持 60 种语言,首个部分结果延迟约 100 毫秒,微软称其在 Artificial Analysis 准确率排名第一,年底前音频价格为每小时 0.54 美元。
Earendil 旗下 Pi 发布 Pi 1.0 与 Pi Durable,两者同时登上 Hacker News 首页。Pi 1.0 带来 Codemode 原生支持 MCP、Jev 与图像模型,新增虚拟模型扩展、延迟工具加载、Anthropic 模型缓存预热、对话中途系统消息、新 TUI 主题和默认全屏模式。
小米 MiMo V2.6 Pro 进入 Arena 智能体排行榜第 19 名,输出价格为每百万 token 0.87 美元,低于排在其前面的全部 18 个模型。其单任务中位成本为 0.10 美元,与榜单前 19 名中的最低值持平,排名第 15 的 DeepSeek V4.1 Flash (Max) 与之相同。
Cloudflare 推出开源决策模型 Clef 和 Clef-flash,托管在 Workers AI 上,用于高速分类和智能体工作流,模型以 Apache 2.0 开源,自行部署免费,Workers AI 也提供免费额度。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败与更强教师的成功来定位能力缺口,并生成、验证新的可执行训练任务,课程随模型进步向仍难的任务迁移。该方法以 EnterpriseOps Gym 数据集演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度要求。
一位开发者用 Claude 辅助学习动画并生成参考,让 Claude 做出一个可迭代跳跃动画的动画编辑器,并晒出对比视频。他表示效果令人满意,但自知仍有不少问题,受限于自身技能水平,需要提升判断力。这是他的个人游戏原型副业项目,他主张不要用 AI 外包游戏创作,而是让 AI 配合实现自己的构想。
一位开发者借助 Claude 学习动画制作并查找参考资料,让 Claude 构建了一个动画编辑器,用于反复迭代游戏原型中的跳跃动画。他发布了前后对比视频,并表示对结果很满意,但坦言自己已到技能上限,仍需提升判断力。他强调这是个人副业项目,主张用 AI 辅助实现创意而非外包。
LangChain 在 Open SWE 智能体 Harness 内构建模型路由器,按任务分类选择最低成本合适模型,将编码线程中位数成本降低 64% 且质量变化可忽略。Olmo-core 3 面向大规模 MoE 训练,在八块 B300 配置下吞吐量较前代提升 2.7 倍。Cohere 发布 Embed 5 嵌入模型系列,含 Pro 和 Fast 版本,面向搜索与智能体工作流。
MIT 的 Alex Zhang 在 Latent Space 播客中介绍了其递归语言模型(RLM)研究,基于 RLM 的 harness 是首个接近解决 ARC-AGI-3 的方案,早于 OpenAI 的 Astra。
Claude Code 团队上线 Mods,把 mods 做成插件,让用户通过提示词定制 Claude 的工作方式和外观,并可把 mods 作为插件分享给他人。
a16z 分析了一种可能发生的变化:用户不再打开外卖平台挑餐厅,而是直接告诉 AI 预算、送达时间和忌口,由 AI 选餐厅下单,Toast 处理订单和支付,DoorDash 负责配送。
Grok Build 上线 Agent Dashboard,可将所有智能体集中在一个自上而下的视图中管理,并用 /dashboard 或 grok dashboard 命令调用。用户能从该视图派发新智能体、并行启动任务,或用 Ctrl+W 让智能体在各自的 git worktree 中运行。
AWS Professional Services 用 Strands Agents SDK 在 Amazon Bedrock AgentCore 上构建四智能体模式,将每应用 IaC 开发时间从 3 到 4 周缩短至分钟级。
Earendil 发布 Pi 1.0,一个精简、可扩展且加固的智能体框架(agent harness),同时推出 Pi Durable,一个面向长时运行智能体应用的新实验性底层。相关说明发布在 earendil.com/posts/pi-1-0/。
Claude Code 上线 Mods,用户可以通过提示词定制 Claude 的工作方式和外观,改变其行为、自定义 UI,或替换成自己的功能。Mods 用几行 TypeScript 编写,也可以让 Claude 代写,并以插件形式分发,在 CLI 或桌面应用中用 /plugin 安装,还能作为插件分享给他人使用。
AREX-2 是一个 27B 智能体,通过长时程反思任务实现自我改进,在可验证的 ML 与算法任务上训练,测试时轮次越多解越好。它在 MLE-bench Lite 上取得 81.8,在 Frontier-CS 上取得 70.7,并可迁移到深度研究任务。
ARC Prize 公布 Qwen3.8-27B 在 ARC-AGI(Verified)上的测试结果:ARC-AGI v2 得分 42.4%、每任务 0.45 美元,ARC-AGI v1 得分 87.5%、每任务 0.22 美元。
Amazon Quick 为 AI 构建的应用推出 Live Data in Apps,可在用户每次打开应用时实时查询受治理的 Quick Sight 数据集,取代发布时固化的静态快照。该功能支持 SPICE 与 Direct Query 两种数据集模式,查询以查看者身份执行,自动沿用既有行级与列级安全规则,查看者需为已认证的 Quick 用户并首次按数据集授权。
Grok 4.7 已在 Gemini Enterprise Agent Platform 上线。该平台用户现可直接调用 Grok 4.7 模型。
小米 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 登陆 Agent Arena,Pro 在 8.1K+ 真实智能体会话中净提升 +3.17%,位列开源模型第 5,较 MiMo-V2.5-Pro 的第 13 名提升 9 位、净提升提高 10.4 个百分点。
推荐理由:榜单给出了 MiMo-V2.6 两款模型在真实智能体会话中的排名与成本对比,可据此判断开源模型在 Agent 场景的位置。
Grok Bot 官方宣布,主 Bot 现在能主动发现可以接手的工作并提出代劳,无需用户先开口,该功能将在未来几小时内陆续推送。官方称这类主动建议不计入使用额度,并给出了下载入口 x.ai/bot。评论区用户反馈了额度限制、主 Bot 与其他 Bot 职责重叠、地区未上线等疑问。
Grok Bot 新增主动建议能力,无需用户开口,主 Bot 会识别可以接手的工作并主动提出代办。该功能将在接下来几小时内逐步推送,建议不计入用户用量,可通过 x.ai/bot 下载 Grok Bot。
NVIDIA NeMo Agent Toolkit(NAT)可通过自定义 memory provider 将 Amazon S3 Vectors 用作持久记忆层,并部署在 Amazon EKS 上。
OpenAI 发布 dots 功能的新演示视频,称此次 WiFi 连接更好。评论区大量用户质疑该功能本质只是带拨号音的语音模式,并反映 dots 通话仍无法正常接通、Pro 订阅用户看不到该功能。
AI Worth Using × OpenClaw 2.0 黑客松公布五强名单:Rundown、Milo、Sitemaxxing、RELAY 和 Meetly 今日接受 Tom Preston-Werner 与 AI Worth Using 团队评审,获胜者将于当天结束前公布。
AWS 介绍如何在 Amazon Bedrock AgentCore 上构建环境智能体(ambient agent):S3 或定时事件触发后,AgentCore Runtime 上的智能体自动分析文件并生成任务,需要时通过单个 ask_human 工具暂停等待人工审批,再从中断处恢复。
Tencent WorkBuddy(@WorkBuddy_AI)发布了一条回复推文,仅带 #WorkBuddy、#AIagent、#WorkBuddyPro 三个话题标签,未披露任何产品功能、版本或参数信息。
Manus 2.0 线上研讨会结束,来自 70+ 国家和地区的用户参与,由 CPO @hidecloud 主讲,活动回放片段将陆续在官方社交渠道发布。