OpenAI 发布 GPT-6.1 Sol,主打编码与电脑操作
OpenAI 发布 GPT-6.1 Sol,官方称其具备接近 Astra 的智能水平,面向编码、电脑操作和专业工作场景。该模型标准 API 输入与输出 token 价格均为 Astra 的五分之一。
推荐理由:OpenAI 公布 GPT-6.1 Sol 的定位与定价,读者可据此比较它与 Astra 在编码和电脑操作上的取舍。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
OpenAI 发布 GPT-6.1 Sol,官方称其具备接近 Astra 的智能水平,面向编码、电脑操作和专业工作场景。该模型标准 API 输入与输出 token 价格均为 Astra 的五分之一。
推荐理由:OpenAI 公布 GPT-6.1 Sol 的定位与定价,读者可据此比较它与 Astra 在编码和电脑操作上的取舍。
OpenAI 发布 dots,将其定义为可跨复杂项目和日常任务持续推进的主动式助手。官方说明 dots 让用户在任务推进过程中保持控制权,具体能力与开放方式尚未在摘要中给出。
推荐理由:OpenAI 官方给出 dots 的定位与可控性说明,读者可据此判断这类主动式助手与现有工具的分工。
Claude Sonnet 5.5 现已在 Devin Desktop 和 Devin CLI 中可用,在 FrontierCode 1.1 Main 上得分 64.4%,高于 Sonnet 5 的 56.2%,并超过 Fable 5.1 的 extra high reasoning effort 表现。
推荐理由:Devin 上线 Claude Sonnet 5.5,并给出 FrontierCode 1.1 分数与成本变化,可据此判断编码智能体的性价比。
Cognition 宣布 Claude Sonnet 5.5 已在 Devin Desktop 和 Devin CLI 中可用,在 FrontierCode 1.1 Main 上得分 64.4%,高于 Sonnet 5 的 56.2%,并在 extra high reasoning effort 下超过 Fable 5.1。
推荐理由:Devin 上线 Claude Sonnet 5.5 并给出 FrontierCode 1.1 分数与 Sonnet 5 的对比,可据此判断编码智能体的模型选择。
H公司发布 Holo4 系列智能体模型,包含 27B dense 与 35B-A3B Mixture of Experts 两个版本,均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 形式开源在 Hugging Face,同时发布 Holotron4 Nano。
推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,可据此判断通用计算机操作智能体的路线取舍。
美团 LongCat 宣布 LongCat-2.5-Preview 上线,总参数量 1.6T、激活约 48B,支持 1M token 上下文窗口,原生多模态。官方称该模型面向长周期任务,覆盖终端、浏览器、GUI、表格和设计工具等场景,现已开放 API(longcat.ai/platform/)和 Chat(longcat.ai/chat/)入口。
推荐理由:官方给出参数量、激活规模与 1M 上下文等关键规格,可据此判断它在长任务场景的定位。
Google Research 发布 AI video co-director 等多智能体框架,用于生成连贯的长篇多镜头视频,相关论文将出现在 COLM 2026 和 EMNLP 2026。
推荐理由:Google 把长视频生成拆成规划、分镜、自回归生成与闭环修正四套框架,并给出多组基准上的连续性提升结果。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指定 GitHub 仓库,它就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做定级并生成漏洞报告。
推荐理由:原文完整披露了 Fuzzing Taskflow 的流水线分层、覆盖反馈循环与崩溃定级机制,可据此判断 LLM 智能体在安全测试中的可迁移边界。
通义千问发布 Qwen Intelligence,首批包含三个 SOTA 智能体。Mobile Planner Agent 负责任务规划、拆解与编排,在 MobilePA-Bench。
推荐理由:官方给出三个移动端智能体的分工、基准成绩与开源评测套件入口,可据此判断手机端 Agent 的能力边界。
NVIDIA 在加拿大多伦多 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速软件包集合,新增智能体工作流与平台支持,支持 ROS Lyrical 和 Ubuntu 24.04。
推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,并给出可复用的技能与生态伙伴落地案例。
xAI 发布 Grok 4.7,已在 Cursor、Grok Build 和 Grok API 上线,官方称这是其面向编码与知识工作的最强模型。官方还称其速度是同类模型的两倍、价格为同类模型的一半,详情见 x.ai/news/grok-4-7。
推荐理由:官方给出 Grok 4.7 在 Cursor、Grok Build 与 API 的上线入口,并称其速度翻倍、价格减半,可据此判断编码场景的选型。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体编写了大部分代码,跨 128 个 PR 增量落地,性能提升数个数量级。
推荐理由:GitHub 工程师复盘用 Copilot 把运行时从 TypeScript 迁到 Rust 的全过程,含提示缓存、子智能体分工等可迁移的工程经验。
Google DeepMind 发布两款实时对话模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:官方给出两款语音模型的基准成绩与开放渠道,可据此判断实时语音智能体的能力水位与成本取舍。
Google DeepMind 推出 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款对话模型,可在后台处理任务而不打断对话。
推荐理由:官方给出两款对话模型的能力清单和接入入口,可据此判断实时语音与后台工具调用能覆盖哪些场景。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款对话模型,可在对话中说话、思考并在后台处理任务而不打断对话流。
推荐理由:官方给出两款实时对话模型的能力清单与开放入口,可据此判断实时语音加后台工具调用的可用边界。
IBM 研究团队在 ALTK-Evolve 中新增一致性指南(consistency guidelines),基于 Consistency Analyzer 诊断智能体轨迹中易翻转的决策点。
推荐理由:原文用 Pass^k 与 Mean@k 的差距量化智能体不确定性,并给出可复用的诊断与改进流程。
OpenAI 推出面向金融服务的 ChatGPT,内置金融数据并接入 GPT-6 Astra,用于研究、建模和可直接交付客户的材料。
推荐理由:原文给出面向金融服务的能力组合与用途,读者可据此判断它在研究与建模场景中的定位。
Hugging Face 发布 Workflow1111,用 Gradio Workflow 把 AUTOMATIC1111 的大部分功能重建为一张包含 11 条媒体管线和 73 个节点的画布,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测生成 inpaint 掩码、ControlNet 风格标注器、背景移除、PNG Info 与图生视频。
推荐理由:原文完整拆解了 73 节点画布如何复刻 A1111 的十一类图像管线,可据此迁移到自建多模型工作流。
OpenAI 发布 Agents API,这是一个由 Codex harness 驱动的托管服务,用于构建和上线云端智能体。该服务支持编排、长时间运行的会话以及工具调用。
推荐理由:官方给出 Agents API 的托管定位与 Codex harness 编排能力,可据此判断云端智能体的搭建方式。
OpenAI 发布 GPT-6 Astra,称其为面向企业场景能力最强的模型,具备高级推理、computer use 以及更强的写作与设计判断力。
推荐理由:官方给出 GPT-6 Astra 的定位与三项能力方向,可据此了解 OpenAI 面向企业场景的模型迭代重点。