Hugging Face 发布 Skills,让 Claude 微调开源 LLM
Hugging Face 发布 Hugging Face Skills,其中 hf-llm-trainer 技能让 Claude Code、Codex、Gemini CLI 等编码智能体直接提交云端 GPU 训练任务、监控进度并把模型推送到 Hub。
推荐理由:原文给出 hf-llm-trainer 技能的安装命令与完整训练流程,读者可据此让编码智能体代跑微调任务。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
Hugging Face 发布 Hugging Face Skills,其中 hf-llm-trainer 技能让 Claude Code、Codex、Gemini CLI 等编码智能体直接提交云端 GPU 训练任务、监控进度并把模型推送到 Hub。
推荐理由:原文给出 hf-llm-trainer 技能的安装命令与完整训练流程,读者可据此让编码智能体代跑微调任务。
Google DeepMind 宣布支持白宫 Genesis Mission,并与美国能源部合作,向 DOE 全部 17 个国家实验室提供前沿 AI for Science 模型和智能体工具的加速访问计划,首批上线的是基于 Gemini 的 AI co-scientist。
推荐理由:Google DeepMind 与 DOE 的合作给出了 AI for Science 从模型到国家实验室落地的具体路径,可观察前沿模型在科研场景的接入方式。
OpenAI 发布 GPT-5.1-Codex-Max,一款面向 Codex 的更快、更智能的智能体编码模型。该模型面向长时间、项目级任务设计,具备更强的推理能力和 token 效率。
推荐理由:OpenAI 发布面向 Codex 的智能体编码模型,读者可了解其在长时任务与 token 效率上的定位。
Google DeepMind 发布 Gemini 3 Pro,称其在各项主要 AI 基准上超过此前版本,编码能力超过 2.5 Pro,可接入现有智能体与编码工作流。
推荐理由:Gemini 3 Pro 的基准成绩、定价与配套工具同时公布,读者可据此判断它能否接入现有编码与智能体工作流。
Google DeepMind 发布 Gemini 3,首发 Gemini 3 Pro 预览版,同步上线 Gemini app、Search 的 AI Mode、AI Studio、Vertex AI、Gemini CLI 及新智能体开发平台 Google Antigravity。
推荐理由:官方给出 Gemini 3 Pro 在推理、多模态与编码基准上的具体分数和上线渠道,可据此判断能力代际变化。
Google 发布智能体开发平台 Google Antigravity,即日起公开预览且免费,Gemini 3 Pro 使用有较宽松的速率限制。该平台在 AI IDE 的 Editor 视图之外新增智能体优先的 Manager 视图,可并行编排多个工作区中的智能体,并支持浏览器控制、异步交互与 Artifacts 交付物。
推荐理由:Google 官方给出 Antigravity 的四个设计原则与公开预览入口,可据此判断智能体优先 IDE 的形态变化。
Google 发布生成式 UI 实现,由模型针对任意提示词自动设计并编码出网页、游戏、工具等交互界面,论文题为 Generative UI: LLMs are Effective UI Generators。
推荐理由:Google 官方给出生成式 UI 的实现路径与人类偏好评测结果,可据此判断界面生成这一方向的成熟度。
Google DeepMind 发布 SIMA 2,通过将 Gemini 模型嵌入智能体核心,使其从指令执行者升级为可推理目标、与用户对话并自我改进的交互式游戏伙伴。
推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,读者可了解其在泛化与自我改进上的具体进展与当前限制。
OpenAI 发文详解其 ChatGPT 浏览器 Atlas 背后的新架构 OWL。该架构将 Chromium 解耦,实现快速启动、丰富 UI 以及 ChatGPT 驱动的智能体式浏览。
推荐理由:OpenAI 官方拆解 ChatGPT Atlas 浏览器背后的 OWL 架构,读者可了解其如何解耦 Chromium 并支撑智能体式浏览。
Google 公布基于 Gemini 模型的个人健康教练构建方案,采用多智能体框架协调对话智能体、数据科学智能体和健身等领域的专家子智能体,对睡眠、活动等生理时间序列数据做数值推理并给出个性化建议。
推荐理由:Google 公开了健康教练的多智能体架构与 SHARP 评估框架,可了解 Gemini 在健康场景的落地方式。
Mistral AI 发布 AI Studio,一个面向企业团队的生产 AI 平台,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。
推荐理由:原文完整交代了三大支柱的能力边界与私有 beta 入口,读者可据此判断企业级 AI 生产化工具链的构成。
OpenAI 宣布收购 Software Applications Incorporated,该公司是 Mac 自然语言界面 Sky 的开发方。OpenAI 表示将把 Sky 的 macOS 深度能力整合进 ChatGPT,让 AI 更直观、更具上下文感知并更偏向执行动作。
推荐理由:OpenAI 收购 Sky 开发方,读者可了解其 macOS 能力将如何并入 ChatGPT 的桌面交互方向。
Meta 与 Hugging Face 合作推出 OpenEnv Hub,一个面向智能体环境的开放共享社区平台,环境定义智能体完成任务所需的工具、API、凭证和执行上下文。
推荐理由:Meta 与 Hugging Face 联合推出智能体环境共享 Hub,并同步开放 0.1 规范 RFC,读者可据此了解智能体训练与部署的标准化路径。
OpenAI Codex 现已正式可用(generally available),面向开发者新增多项功能。新功能包括 Slack 集成、Codex SDK,以及用量看板和工作区管理等管理工具,官方称这些更新让 Codex 更易使用、更便于规模化管理和使用。
推荐理由:Codex 从预览走向正式可用,并补齐 Slack 集成、SDK 与管理后台,读者可据此判断团队规模化使用的门槛变化。
OpenAI 在 ChatGPT 内推出新一代可直接对话的应用,开发者即日起可用新的 Apps SDK 开始构建,该 SDK 目前处于预览阶段。
推荐理由:OpenAI 官方给出 ChatGPT 内应用形态与 Apps SDK 预览入口,可据此了解开发者接入方式的变化。
OpenAI 发布 AgentKit、扩展后的 evals 能力以及面向智能体的强化微调(RFT),用于帮助开发者更快从原型走向生产。官方称这些是帮助开发者加速落地的新工具。
推荐理由:OpenAI 官方发布面向智能体开发的工具组合,读者可了解其从原型到生产的定位。
OpenAI 面向移动端 Pro 用户发布 ChatGPT Pulse 预览版。Pulse 会主动做研究,基于用户的聊天、反馈以及日历等已连接应用,推送个性化更新。
推荐理由:官方给出 Pulse 的预览范围与信息来源,读者可据此判断 ChatGPT 主动推送的形态。
Hugging Face 发布 GAIA 的后续智能体基准 Gaia2,并配套开源 Meta Agents Research Environments(ARE)框架,用于运行、调试和评估智能体。
推荐理由:Gaia2 把智能体评测从只读检索扩展到读写交互,并给出各模型在歧义、适应性和时间推理上的差距。
OpenAI 宣布升级 Codex,使其更快、更可靠,并更擅长实时协作和独立处理任务。升级后的 Codex 可在终端、IDE、网页乃至手机上使用。
推荐理由:Codex 在速度、可靠性和实时协作上的升级,读者可据此判断终端、IDE、网页与手机端编码体验的变化。
OpenAI 发布 GPT-5 系统卡增补,介绍新模型 GPT-5-Codex,这是 GPT-5 针对 Codex 中智能体编码进一步优化的版本。GPT-5-Codex 会根据任务复杂度更动态地调整思考投入,对简单对话查询或小任务快速响应,对更复杂任务则独立工作更长时间。
推荐理由:GPT-5 系统卡增补披露了面向 Codex 智能体编码优化的 GPT-5-Codex,可了解其动态思考机制。