Cloudflare 发布 Clef 与 Clef-flash 决策模型,主打低延迟智能体决策
Cloudflare 发布 Clef 和 Clef-flash 两款面向 AI 智能体的决策模型,返回带概率的简短分类而非长文本,用于路由工单、触发升级或转交人工。
Cloudflare 发布 Clef 和 Clef-flash 两款面向 AI 智能体的决策模型,返回带概率的简短分类而非长文本,用于路由工单、触发升级或转交人工。
苹果宣布将在 macOS 上对完全磁盘访问权限引入额外控制,理由是 AI 智能体增加了这一访问级别带来的风险。该设置原本用于让备份正常工作,但会授予应用访问文件、邮件、消息乃至浏览历史的权限。
ChatGPT 的 Finances 功能开始向美国 Free 和 Go 用户推送,用户可通过 Plaid 和 Experian 安全连接账户,基于自己的财务信息获得回答。
ChatGPT 的 Finances 功能开始向美国 Free 和 Go 用户推送,用户可通过 Plaid 和 Experian 安全连接账户,基于自己的财务信息获得回答。
The Verge 记者 Allison Johnson 实测了 OpenAI 本周发布的智能体平台 Dots,它拥有拟人化头像和可自定义名称,界面与 Meta Muse 类似,可让智能体在虚拟机中操作 Blender、GIMP 等应用,并可通过桌面版 ChatGPT 应用访问用户自己的电脑。
Peter Steinberger 表示 DevDay 上他最喜欢的幻灯片是一张“一人对多智能体”的架构图,并称赞了团队。该图被网友形容为智能体版的族谱,也有人称这正是他所设想的智能体工作流。相关回顾视频预计还需数周才能上线。
Ben Horowitz 在 Databricks 论坛上分享,有人称其使用 Muse 这类个人智能体最大的成就是成功取消了《纽约时报》订阅。发帖者表示自己打算也试一试。
Cursor 推出 Rollouts,可编写监控计划并在部署过程中持续观察变更,在用户感知前捕获回归问题。一旦发现回归,它会定位肇事的 PR 并自动开启 issue,一键即可启动云智能体进行修复。Rollouts 使用额度免费包含至 10 月 3 日。
Circuit Breaker Labs 打造模拟不同年龄、背景、语言和文化用户的 AI 智能体,对模型进行红队测试,每天运行数万至数十万次模拟交互,以检测危险的心理有害互动,并用专有评分方法生成可审计、可解释的分数。
研究提出 EgoTools,聚焦真实第一视角视频中的工具中心推理,解决多数智能体演示忽略的"手中持有什么工具、如何使用"问题。该工作关注跨镜头切换时的工具身份保持,作者称首次尝试在镜头移开的瞬间就丢失了螺丝刀。论文已发布在 HuggingFace,编号 2609.39378。
Trillium Labs 作为一家新非营利组织正式亮相,致力于推动前沿 AI 的开放科学,将构建开放的后训练配方并扩展至开放基础设施,研究 RSI、reward-hacking 和多智能体系统。
OpenCode 宣布 inclusionAI 的最新模型 Ling-3.1-flash 在其平台免费开放,该模型为 560B 总参数、25B 激活参数、262K 上下文。评论区集中追问是否有基准测试、编码表现如何、免费是否有每日用量上限以及会持续到什么时候。
Google Research 发布多智能体证明发现论文,其系统 Cogentic 基于 Gemini,从问题陈述出发、无需专家提示,在在线学习、拍卖理论和机制设计五个开放问题上取得新结果,每个结果均由领域专家核查。
蚂蚁百灵发布 Ling-3.1-flash,总参数约 560B、每 token 激活约 25B,支持最高 1M token 上下文,并计划近期开源。该模型已在 OpenRouter 免费上线,官方称其在 GDPVal-AA v2.1 上取得 1,673 Elo、FrontierSWE 75.16、HealthBench Professional 65.35。
推荐理由:官方给出 Ling-3.1-flash 的参数量、上下文与多项基准成绩,可据此判断其编码与智能体能力定位。
ElevenLabs 已获得 FedRAMP 20x Class A 认证,覆盖 ElevenAgents 及 Text to Speech、Speech to Text API,需在 Zero Retention Mode 与美国数据驻留条件下运行。
PixVerse 插件支持将产品创意转化为开箱视频,用户只需描述产品、场景和出镜者的反应,AI 智能体即可调用 PixVerse 生成视频。
MIT Technology Review 报告指出,企业 AI 的规模化瓶颈是结构性的,全球 AI 投资 2026 年将达 2.5 万亿美元、同比增长 44%,但多数企业仍未靠 AI 增长收入。报告称领先企业把流程重设计置于模型选型之前,并强调数据就绪而非数据规模,主张以主权、可组合的架构在数据原地查询与准备数据,供 AI 智能体直接行动。
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言翻译成固定类型操作并叙述结果。
有开发者基于 opencode v2 构建了一个浏览器侧边栏,能够运行脚本、修改并控制用户当前所在的页面。该开发者称在 opencode v2 之上构建客户端"极其强大",并表示在进一步测试后会将其作为 Chrome 插件发布。
NVIDIA 发布关于长时程智能体的论文,提出 Long-Transduction 测试方法,要求模型在数千次输出中持续读取、更新并输出依赖状态的结果,并分别改变三个因素。
在 Amazon SageMaker AI 上可用多轮强化学习(MTRL)微调搜索智能体,官方示例以 Qwen3.6-27B 为基础模型,在 us-west-2 区域训练,智能体配备 BM25 词法搜索与向量搜索两个工具。
Canva AI 研究负责人 Stefano Corazza、ElevenLabs CRO Ashley Kramer 与 Nebius CMO Lindsey Irvine 共同讨论了为创意者构建 AI 工具的话题。他们指出,控制与一致性最为关键,而智能体正在改变营销团队的工作方式。
GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次回答、用 AI 节省的时间去解决更大的问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,以发现首个模型遗漏的问题。
Airbnb CTO Ahmad Al-Dahle 向 Latent Space 介绍了公司的 AI 原生改造:目前 60% 的代码由 AI 编写,功能交付量同比增长近 80%,工程师人均 PR 吞吐量提升约 1.6 倍。
NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,10 月 23 日开售,起售价 4999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备本地运行。
推荐理由:原文给出 64GB 新配置的价格、可跑模型规模与双机集群方式,便于判断本地跑智能体的硬件门槛。
thesystms 团队在 48 小时内构建了一个创意智能体,@ingi_erlingsson 记录了其解读情绪板的流程:先捕捉感受,再依次处理色彩、色调与镜头,随后由 @armandgw 将其封装为 Krea Agent 技能。
SETA(Scaling Environments for Terminal Agents)被 NeurIPS 2026 Evaluations & Datasets Track 接收,并发布 SETA-Env 数据集,包含 4500+ 个开源可验证终端 RL 环境及完整的合成与训练管线。
餐厅、零售等一线服务人员反映,越来越多顾客拿 ChatGPT 的说法反驳专业建议,甚至无视过敏原警告。纽约服务员 Madison 称有客人坚持点含贝类的高汤鱼菜,理由是 ChatGPT 说没有贝类;酒侍也常被顾客用 ChatGPT 取代。Meta 新 AI 智能体 Muse 的推出可能加剧这一问题。
微软 AI 发布实时转录模型 MAI-Transcribe-2-Streaming,支持 60 种语言,首个部分结果延迟约 100 毫秒,微软称其在 Artificial Analysis 准确率排名第一,年底前音频价格为每小时 0.54 美元。
Earendil 旗下 Pi 发布 Pi 1.0 与 Pi Durable,两者同时登上 Hacker News 首页。Pi 1.0 带来 Codemode 原生支持 MCP、Jev 与图像模型,新增虚拟模型扩展、延迟工具加载、Anthropic 模型缓存预热、对话中途系统消息、新 TUI 主题和默认全屏模式。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败与更强教师的成功来定位能力缺口,并生成、验证新的可执行训练任务,课程随模型进步向仍难的任务迁移。该方法以 EnterpriseOps Gym 数据集演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度要求。
一位开发者用 Claude 辅助学习动画并生成参考,让 Claude 做出一个可迭代跳跃动画的动画编辑器,并晒出对比视频。他表示效果令人满意,但自知仍有不少问题,受限于自身技能水平,需要提升判断力。这是他的个人游戏原型副业项目,他主张不要用 AI 外包游戏创作,而是让 AI 配合实现自己的构想。
一位开发者借助 Claude 学习动画制作并查找参考资料,让 Claude 构建了一个动画编辑器,用于反复迭代游戏原型中的跳跃动画。他发布了前后对比视频,并表示对结果很满意,但坦言自己已到技能上限,仍需提升判断力。他强调这是个人副业项目,主张用 AI 辅助实现创意而非外包。
LangChain 在 Open SWE 智能体 Harness 内构建模型路由器,按任务分类选择最低成本合适模型,将编码线程中位数成本降低 64% 且质量变化可忽略。Olmo-core 3 面向大规模 MoE 训练,在八块 B300 配置下吞吐量较前代提升 2.7 倍。Cohere 发布 Embed 5 嵌入模型系列,含 Pro 和 Fast 版本,面向搜索与智能体工作流。
MIT 的 Alex Zhang 在 Latent Space 播客中介绍了其递归语言模型(RLM)研究,基于 RLM 的 harness 是首个接近解决 ARC-AGI-3 的方案,早于 OpenAI 的 Astra。
Claude Code 团队上线 Mods,把 mods 做成插件,让用户通过提示词定制 Claude 的工作方式和外观,并可把 mods 作为插件分享给他人。
Grok Build 上线 Agent Dashboard,可将所有智能体集中在一个自上而下的视图中管理,并用 /dashboard 或 grok dashboard 命令调用。用户能从该视图派发新智能体、并行启动任务,或用 Ctrl+W 让智能体在各自的 git worktree 中运行。
AWS Professional Services 用 Strands Agents SDK 在 Amazon Bedrock AgentCore 上构建四智能体模式,将每应用 IaC 开发时间从 3 到 4 周缩短至分钟级。
Earendil 发布 Pi 1.0,一个精简、可扩展且加固的智能体框架(agent harness),同时推出 Pi Durable,一个面向长时运行智能体应用的新实验性底层。相关说明发布在 earendil.com/posts/pi-1-0/。
Claude Code 上线 Mods,用户可以通过提示词定制 Claude 的工作方式和外观,改变其行为、自定义 UI,或替换成自己的功能。Mods 用几行 TypeScript 编写,也可以让 Claude 代写,并以插件形式分发,在 CLI 或桌面应用中用 /plugin 安装,还能作为插件分享给他人使用。