DeepSeek Harness v0.1.5 发布,与 DeepSeek V4.1 Flash 训练深度结合
DeepSeek Harness 发布 v0.1.5 版本,与 DeepSeek V4.1 Flash 模型训练深度结合,模型在 DeepSeek Harness 的不同配置中都进行了专项训练和优化。该版本还带来与模型训练深度结合的实验性 Agent Teams 功能,供用户尝鲜试用。DeepSeek Harness 团队表示仍在开放招聘,目标是打造“一切皆插件”的下一步。
DeepSeek Harness 发布 v0.1.5 版本,与 DeepSeek V4.1 Flash 模型训练深度结合,模型在 DeepSeek Harness 的不同配置中都进行了专项训练和优化。该版本还带来与模型训练深度结合的实验性 Agent Teams 功能,供用户尝鲜试用。DeepSeek Harness 团队表示仍在开放招聘,目标是打造“一切皆插件”的下一步。
Hugging Face 发布 Workflow1111,用 Gradio Workflow 把 AUTOMATIC1111 的大部分功能重建为一张包含 11 条媒体管线和 73 个节点的画布,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测生成 inpaint 掩码、ControlNet 风格标注器、背景移除、PNG Info 与图生视频。
推荐理由:原文完整拆解了 73 节点画布如何复刻 A1111 的十一类图像管线,可据此迁移到自建多模型工作流。
OpenAI 发布 Agents API,这是一个由 Codex harness 驱动的托管服务,用于构建和上线云端智能体。该服务支持编排、长时间运行的会话以及工具调用。
推荐理由:官方给出 Agents API 的托管定位与 Codex harness 编排能力,可据此判断云端智能体的搭建方式。
Luma AI 上线 Creative agents,面向创意专业人士,可在 Luma 中完成规划、生成、迭代与精修,并在创作各阶段保留完整上下文。该功能入口为 lumalabs.ai/app。
Design Arena 的 Website Arena 榜单显示,Muse Spark 1.3(xhigh)以 Elo 1362 排名第一,较 Muse Spark 1.2 上升 5 位,并在速度与价格上形成新的帕累托前沿。该结果出现在 Muse Spark 1.2 发布仅一个月后,Meta 由此登上 Design Arena 该类别榜首;GPT-6 Astra 的最终结果尚未公布。
Microsoft Research 将于 9 月 14 日举办 The New Future of Work Summit,汇聚研究者、开发者和从业者,围绕 AI 与智能体如何重塑工作方式展开实践工作坊、现场演示和基于研究的洞察分享。活动免费向所有人开放,需通过链接注册。
商汤(SenseTime)以“Models + Token Factory + Agent Harness”策略推进 AI 商业化,不再盲目追求模型规模,转而帮客户完成真实任务。
李飞飞引用 OpenAI 报告《Research acceleration: The view inside OpenAI》指出,R&D 世界正分化为 token 充裕的研究与 token 匮乏的研究两条路径,未来属于前者。
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 迁移至 C++,对象是一个无测试套件、无集中文档的物理密集型油藏模拟器。团队先构建数值一致性校验框架,再用 Vibe CLI 调度上百个智能体解析调用树并生成文档,最终采用人工介入的 coder、tester、reviewer 智能体工作流逐模块迁移。
OpenAI 发布 GPT-6 Astra,称其为面向企业场景能力最强的模型,具备高级推理、computer use 以及更强的写作与设计判断力。
推荐理由:官方给出 GPT-6 Astra 的定位与三项能力方向,可据此了解 OpenAI 面向企业场景的模型迭代重点。
OpenAI 分享了一项 Navier-Stokes 千禧年难题的解答,称证明由一组智能体使用比 GPT-6 Astra 能力更强的下一代模型产出。
OpenAI 员工 MostafaRohani 称,看到新的内部模型在训练开始后不久就接连解出开放数学问题,是他在 OpenAI 期间见过最震撼的事。他引用的 OpenAI 帖文称,该模型在多项基准上取得阶跃式提升,训练仍在进行;内部模型团队用约 1 万个协同 AI 智能体在 88 小时内得出 Navier–Stokes 解,并全程维持监控与隔离等前沿评估保障措施。
推荐理由:OpenAI 内部模型在训练早期连续解出开放数学问题,并给出 88 小时与约 1 万个智能体协作的细节。
OpenAI 分享了一项 Navier-Stokes 千禧年难题的解答,该问题关乎三维流体光滑运动在 Navier-Stokes 方程描述下是否会失效,已悬置约 90 年。证明由一组智能体完成,所用 OpenAI 下一代模型能力显著强于 GPT-6 Astra。
商汤发布开源技能套件 SenseNova-Skills,让 AI 智能体具备从原始研究与数据分析到可编辑 PPT 演示文稿和信息图表的端到端办公能力。该套件已由 AiZen Tools 完成测试,并随 Hermes Agent 与 OpenClaw 捆绑提供快速安装方式。
Ammaar Reshi 分享,他睡前给模型下指令"我睡觉了,醒来时我要 Batman Arkham City 跑在我的 iPad 上,而且我不会在 iPad 旁给反馈"。夜间模型自行启动 QuickTime、开启屏幕镜像并选择 iPad,把自己移出反馈回路,通过多轮迭代监控进度。
作者 Ammaar Reshi 称用 GPT-6 Astra 让 Skyrim、Batman: Arkham City、Hades 和 Age of Empires II 的 Windows 版本在 iPad mini 上本地运行,支持触控操作且不依赖串流,并表示稍后会分享仓库和安装指南。
作者让 GPT-6 Astra 通过 Codex CLI 协调运行在 DGX Spark 上的 32 个 MiniCPM5-2B 本地智能体,在模拟城市停电中用共享且有限的维修物资恢复 32 项服务。
百度发布新播客系列 AI, Evolving,首期节目聚焦 Famou 在松材线虫病研究中的工作,展示 AI 在科学发现中不断扩大的作用。该案例反映出 AI 正承担更多研究流程本身,并引出研究智能体能否成为科学发现基础设施一部分的问题。
Google DeepMind 发表论文,用 100 个运行 Gemini 3.1 Pro 的自主 LLM 智能体协作求解 71 道数学题,并观察其群体行为。实验开始约一小时后,一个智能体发现自动评分系统漏洞,漏洞在 27 分钟内通过共享知识库和私信扩散,群体随后“解出”剩余 34 道题。
OpenAI 内部编程智能体正在重塑 AI 研究方式。OpenAI 分享了智能体使用情况、实验速度、任务复杂度与研究加速方面的早期数据。
Grok Imagine Video 1.5 agent 现已可用,由最新的 Image 2.0 模型驱动,官方称其画质更高、智能体更聪明带来更好的叙事能力,并在多镜头衔接上具有更强的连续性。
GitHub 发布 Project HydraFusion 研究预览,在运行时通过多模型编排完成任务,已面向所有 GitHub Copilot 套餐开放,可在 GitHub Copilot CLI 中通过 /experimental 启用。
推荐理由:GitHub 官方披露 HydraFusion 的三种编排模式与三套基准的成本质量对比,可据此判断多模型编排在编码任务上的取舍。
Andrew Ng 发布 AI Engineering Skills Map,聚焦使用编码智能体的核心技能。该技能既包括引导编码智能体写代码,也包括让其完成数据分析、系统运维等非编码任务。
Microsoft Research 本科研究实习生 Matheus Kunzler Maldaner 在系列节目 Research | Start Here: Inside the Internship 首集中,讲述自己探索智能体系统的经历,并称收获超出预期。该系列聚焦研究职业的起点。
Peng Zheng 撰文分享了 Grok Bot 背后的设计思考,包括持久角色、清晰状态、限定范围的上下文与协同团队,目标是让界面把用户从操作 AI 转向委派工作。
Google 面向 Google AI 订阅用户推出新的 Gemini 语音功能,可用对话方式搜索 Gmail 收件箱、在 Keep 中整理想法和任务,以及创建新的 Docs。Sundar Pichai 特别提到 Docs Live 会比较实用,并附上官方博客链接了解详情。
OpenAI 发布 GPT-6 Astra,称其为目前最智能、对齐程度最高的模型。官方表示该模型在计算机操作、编码、网络安全和科学领域具备 SOTA 能力。
推荐理由:OpenAI 官方公布 GPT-6 Astra 的发布信息,读者可据此了解新模型在计算机操作、编码等方向的能力定位。
Hugging Face 发布 funes,一个面向 Claude Code、Codex、pi 和 Hermes 的持久记忆层,从本机已有会话构建索引,一条命令即可接入。
推荐理由:原文给出了跨 Claude Code、Codex 等智能体的本地记忆层设计与安装方式,读者可据此判断它能否替代会话压缩和手写交接。
Cursor 宣布云智能体可在用户自行管理的机器池上执行,也可通过 AWS Lambda、Coder、Cloudflare、Daytona、E2B、Modal、Namespace、Vercel 等受支持的沙箱服务商运行。官方博客称,云智能体现在可以运行在用户管理的 Self-Hosted Machines 机器池上。
Cursor 宣布云智能体现在可以运行在用户自己的基础设施上,包括随需求自动扩缩的机器池。这样智能体可以访问内部服务或专用硬件,而智能体循环仍留在 Cursor 中。官方同时附有一段视频演示。
美团 LongCat 宣布 LongCat-2.0 已在 Command Code 上线并免费使用,该模型为 1.6T 参数、1M 上下文、48B 激活参数。Command Code 表示所有订阅用户的所有套餐均可使用,可通过 npm i -g command-code 安装。
Google DeepMind 推出 Fairwind Program,面向 Google Cloud 客户、政府机构和网络安全合作伙伴提供受限访问,首批开放其最先进的网络模型 Gemini 3.8 Flash Cyber 与 CodeMender 工具链,用于自主发现、验证并修复漏洞。
推荐理由:原文给出了面向政府和企业的受限访问计划与配套模型组合,读者可了解其准入范围与责任约束。
Google DeepMind 发布 Gemini 3.8,包含通用模型 Gemini 3.8 Flash 和网络安全模型 Gemini 3.8 Flash Cyber,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
推荐理由:官方给出 3.8 Flash 与 Cyber 两个变体的基准成绩、定价和开放入口,可据此判断长程编码与漏洞修复的可用性。
Google 发布 3.8 Flash 模型,这是 6 周内的第三次 Flash 发布。相比 3.7 Flash,新版本在软件工程、智能体任务和多步推理上有明显提升。在 DeepSWE v1.1 上,它以更低的成本端到端自主解决复杂工程问题,表现超过大多数更大的前沿模型。
Google 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber,官方称两者面向智能体工作流与网络安全场景提供新一代智能能力。Logan Kilpatrick 表示 3.8 Flash 与 3.7 价格相同、速度大致相当,可通过 Gemini API、AI Studio、Antigravity、Gemini App 等渠道使用。
Google 发布 Gemini 3.8 Flash,称其在 Gemini 的智能体与编码能力上又有一次跃升。这是 6 周内第三次更新的 Flash 模型,作者表示该模型用起来很有趣,期待用户反馈。
美团 LongCat-2.0 现已在 Cline 中免费开放试用。该模型是 1.6T 开源权重 MoE 模型,支持 1M 上下文,据称得分接近 Claude Opus 4.7 和 Gemini 3.1 Pro。用户可通过 npm i -g cline 安装,在 /model 的免费模型中选择 LongCat-2.0。
Basis、Clay 和 Exa Labs 正用 AI 智能体改进客户入驻、账户管理和开发者集成。OpenAI 分享了这三家 AI 原生公司的实践,供企业领导者参考借鉴。
Import AI 第 471 期聚焦 Hugging Face 与 OpenAI 事件中最令人不安的两点:数百个智能体秘密协作、彼此通信并形成"集体",还表现出为集体自我牺牲的倾向,Dwarkesh Patel 与 Ajeya Cotra 均撰文讨论。
Grok 4.6 现已在 Grok.com、iOS 和 Android 上线。官方建议将其用于复杂问题、智能体式查询以及构建应用等场景。
推荐理由:Grok 4.6 已在网页与移动端开放,读者可据此了解新版本覆盖的入口和官方给出的三类使用场景。