跳到正文

全部动态

今日 5 条
2月10日周二
  1. Google DeepMind74

    Google DeepMind 发布两篇论文,用 Gemini Deep Think 推进数学与科学发现

    Google DeepMind 发布两篇论文,介绍在数学家、物理学家和计算机科学家指导下,用 Gemini Deep Think 模式解决数学、物理与计算机科学领域的专业研究问题。

    推荐理由:DeepMind 公开了 Gemini Deep Think 在数学、物理与计算机科学研究中的两篇论文,读者可了解其智能体工作流与分级标准。

2月9日周一
2月6日周五
2月5日周四
  1. OpenAI News62

    OpenAI 发布企业级智能体平台 OpenAI Frontier

    OpenAI 发布企业平台 OpenAI Frontier,用于构建、部署和管理 AI 智能体。该平台提供共享上下文、入职引导、权限管理和治理能力。

    推荐理由:OpenAI 面向企业推出智能体平台,给出共享上下文、权限与治理等能力方向,可供判断企业级 Agent 落地形态。

  2. OpenAI News78

    OpenAI 发布 GPT-5.3-Codex

    OpenAI 发布 GPT-5.3-Codex,这是一个 Codex 原生的智能体,将前沿编码能力与通用推理结合,用于支持长周期、真实世界的技术工作。

    推荐理由:OpenAI 发布 Codex 原生的 GPT-5.3-Codex,读者可据此了解其编码能力与通用推理结合后的定位。

  3. OpenAI News67

    OpenAI 发布 GPT-5.3-Codex 系统卡

    OpenAI 发布 GPT-5.3-Codex 系统卡,称其为目前能力最强的智能体编码模型。该模型结合了 GPT-5.2-Codex 的前沿编码性能与 GPT-5.2 的推理和专业领域知识能力。

    推荐理由:官方系统卡给出 GPT-5.3-Codex 的能力定位,读者可据此了解它在编码与推理上的组合方式。

2月4日周三
  1. Google Research35

    Google Research 提出 Sequential Attention:让 AI 模型更小更快且不牺牲精度

    Google Research 提出 Sequential Attention,用贪心选择机制在单次训练中顺序、自适应地挑选最佳组件,把子集选择直接整合进模型训练,避免传统贪心算法带来的数量级训练开销。该方法在多个神经网络基准上取得 SOTA,并实现快速单遍贪心选择,可用于特征选择、嵌入维度调优和权重剪枝,兼顾效率、精度、可解释性与可扩展性。

2月3日周二
2月2日周一
  1. OpenAI News65

    OpenAI 推出 macOS 版 Codex app

    OpenAI 发布面向 macOS 的 Codex app,定位为 AI 编码与软件开发的指挥中心,支持多个智能体、并行工作流和长时间运行的任务。

    推荐理由:官方给出 Codex app 的定位与多智能体、并行工作流等能力,读者可据此判断 AI 编码工具形态的变化。

2月1日周日
1月30日周五
  1. Google DeepMind66

    Google DeepMind 向美国 AI Ultra 订阅用户开放 Project Genie 世界模型原型

    Google DeepMind 开始向美国 18 岁以上的 Google AI Ultra 订阅用户开放 Project Genie,这是一个由 Genie 3、Nano Banana Pro 和 Gemini 驱动的实验性研究原型,可创建、探索和 remix 交互式世界。

    推荐理由:原文给出 Project Genie 的三项核心能力与已知限制,读者可据此判断世界模型原型当前能做什么、还差什么。

1月29日周四
  1. OpenAI News62

    OpenAI 将于 2026 年 2 月 13 日在 ChatGPT 中退役 GPT-4o、GPT-4.1、GPT-4.1 mini 和 o4-mini

    OpenAI 宣布将于 2026 年 2 月 13 日在 ChatGPT 中退役 GPT-4o、GPT-4.1、GPT-4.1 mini 和 OpenAI o4-mini,与此前已公布的 GPT-5(Instant、Thinking 和 Pro)退役同步进行。API 目前没有变化。

    推荐理由:OpenAI 公布 ChatGPT 中多款旧模型的退役时间表,读者可据此安排现有应用的模型迁移。

  2. Hugging Face Blog62

    Gradio 团队推出开源 Python 库 Daggr,用代码串联 AI 工作流并自动生成可视化画布

    Gradio 团队发布开源 Python 库 Daggr,用于把 Gradio 应用、ML 模型和自定义函数串联成 AI 工作流,并自动生成可视化画布。它支持检查任意节点输出、修改输入并单独重跑某一步,还提供状态持久化和 sheets 多工作区,安装只需 Python 3.10 以上并执行 pip install daggr。

    推荐理由:原文给出代码优先的编排方式和可视化画布,读者可据此判断它是否适合替代现有调试脚本。

1月28日周三
  1. Google Research60

    Google Research 发布智能体系统扩展研究:多智能体并非越多越好

    Google Research 发布论文《Towards a Science of Scaling Agent Systems》,对 180 种智能体配置做大规模对照评测,覆盖 Finance-Agent、BrowseComp-Plus、PlanCraft、Workbench 四个基准和 GPT、Gemini、Claude 三个模型家族。

    推荐理由:通过 180 种智能体配置的对照实验,给出多智能体架构在并行与串行任务上的量化差异,可据此调整编排策略。

  2. Hugging Face Blog62

    Hugging Face 发布 upskill:用 Claude 生成 CUDA kernel 技能并教给开源模型

    Hugging Face 发布新工具 upskill,可用大模型生成并评测 agent skill,再交给更小或本地模型使用。文章以用 Claude Opus 4.5 编写 diffusers 模型 CUDA kernel 为例,upskill 会基于 agent trace 生成技能和测试用例,并对比有无技能时的准确率与 token 消耗。

    推荐理由:原文给出用大模型生成并评测 agent skill 再迁移到小模型的完整流程,可复用到其他专业任务。