跳到正文

全部动态

今日 11 条
3月17日周二
  1. Mistral AI64

    Mistral 发布 Leanstral:面向 Lean 4 的开源代码智能体

    Mistral 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并接入 Mistral vibe 的 agent 模式与免费 API 端点 labs-leanstral-2603。

    推荐理由:官方给出 Leanstral 的开放权重、免费 API 与 FLTEval 基准,读者可据此判断形式化验证编码智能体的成本与可用性。

3月5日周四
  1. OpenAI News85

    OpenAI 发布 GPT-5.4,主打编码、计算机操作与 1M token 上下文

    OpenAI 发布 GPT-5.4,称其为面向专业工作场景的前沿模型,具备编码、计算机操作、工具搜索能力和 1M token 上下文。OpenAI 表示这是其能力最强、效率最高的前沿模型。

    推荐理由:OpenAI 公布 GPT-5.4 的编码、计算机操作与 1M token 上下文等能力定位,可据此判断前沿模型的迭代方向。

3月4日周三
  1. Google DeepMind66

    Google DeepMind 发布 Gemini 3.1 Flash-Lite

    Google DeepMind 推出 Gemini 3.1 Flash-Lite,定位 Gemini 3 系列中速度最快、成本最低的模型,即日起通过 Gemini API 在 Google AI Studio 和 Vertex AI 面向开发者预览。

    推荐理由:官方给出定价、速度与基准数据,读者可据此判断高并发场景下是否值得替换现有模型。

3月3日周二
2月27日周五
2月20日周五
2月13日周五
  1. OpenAI News62

    GPT-5.2 在理论物理中推导出新结果

    OpenAI 发布新预印本,显示 GPT-5.2 为一个胶子振幅提出了新公式,随后由 OpenAI 与学术合作者正式证明并验证。该结果以预印本形式公开。

    推荐理由:OpenAI 与学术合作者披露 GPT-5.2 提出胶子振幅新公式并被形式化证明,可观察大模型参与理论物理推导的路径。

2月12日周四
  1. OpenAI News60

    OpenAI 发布 GPT-5.3-Codex-Spark 实时编码模型

    OpenAI 发布 GPT-5.3-Codex-Spark,称其为首个实时编码模型,生成速度提升 15x,上下文窗口为 128k。该模型目前面向 ChatGPT Pro 用户开放研究预览。

    推荐理由:OpenAI 公布首个实时编码模型的生成速度与上下文规格,可据此了解编码模型在低延迟方向上的进展。

2月5日周四
  1. OpenAI News78

    OpenAI 发布 GPT-5.3-Codex

    OpenAI 发布 GPT-5.3-Codex,这是一个 Codex 原生的智能体,将前沿编码能力与通用推理结合,用于支持长周期、真实世界的技术工作。

    推荐理由:OpenAI 发布 Codex 原生的 GPT-5.3-Codex,读者可据此了解其编码能力与通用推理结合后的定位。

  2. OpenAI News67

    OpenAI 发布 GPT-5.3-Codex 系统卡

    OpenAI 发布 GPT-5.3-Codex 系统卡,称其为目前能力最强的智能体编码模型。该模型结合了 GPT-5.2-Codex 的前沿编码性能与 GPT-5.2 的推理和专业领域知识能力。

    推荐理由:官方系统卡给出 GPT-5.3-Codex 的能力定位,读者可据此了解它在编码与推理上的组合方式。

2月4日周三
1月29日周四
  1. OpenAI News62

    OpenAI 将于 2026 年 2 月 13 日在 ChatGPT 中退役 GPT-4o、GPT-4.1、GPT-4.1 mini 和 o4-mini

    OpenAI 宣布将于 2026 年 2 月 13 日在 ChatGPT 中退役 GPT-4o、GPT-4.1、GPT-4.1 mini 和 OpenAI o4-mini,与此前已公布的 GPT-5(Instant、Thinking 和 Pro)退役同步进行。API 目前没有变化。

    推荐理由:OpenAI 公布 ChatGPT 中多款旧模型的退役时间表,读者可据此安排现有应用的模型迁移。

1月20日周二
  1. Hugging Face Blog66

    Overworld 发布实时交互视频扩散模型 Waypoint-1

    Overworld 发布实时交互式视频扩散模型 Waypoint-1,可通过文本、鼠标和键盘控制,权重已上传 Hugging Face Hub,先开放 Waypoint-1-Small,Medium 版本即将推出。

    推荐理由:Waypoint-1 把实时交互式视频扩散模型和推理库一并开源,读者可据此了解世界模型从控制输入到消费级硬件落地的路径。

1月16日周五
  1. Google DeepMind62

    Google DeepMind 发布 D4RT 模型,统一 4D 场景重建与追踪

    Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),一个统一 4D 场景重建与追踪的 AI 模型,采用编码器-解码器 Transformer 架构和查询机制,可同时完成点追踪、点云重建和相机位姿估计。

    推荐理由:D4RT 把动态场景重建统一进单一查询式框架,读者可了解其速度提升与机器人、AR 等落地方向。

1月14日周三
1月6日周二
  1. Hugging Face Blog62

    NVIDIA 发布 Cosmos Reason 2 推理视觉语言模型

    NVIDIA 发布面向物理 AI 的开源推理视觉语言模型 Cosmos Reason 2,提供 2B 和 8B 两种参数规模,并在 Physical AI Bench 与 Physical Reasoning 榜单上成为排名第一的开源模型。

    推荐理由:Cosmos Reason 2 把上下文从 16K 扩到 256K 并新增轨迹与 2D/3D 定位能力,可据此判断物理 AI 智能体的视频理解边界。

1月5日周一
12月23日周二
  1. Hugging Face Blog50

    Hugging Face 推出 AprielGuard:面向现代 LLM 系统的 8B 安全护栏模型

    Hugging Face 发布 8B 参数安全护栏模型 AprielGuard,可检测 16 类安全风险及提示注入、越狱、思维链污染、记忆投毒、多智能体攻击等对抗攻击,并覆盖工具调用与推理轨迹等智能体工作流。模型提供推理与非推理两种模式,兼顾可解释分类与低延迟生产部署。训练数据由 Mixtral-8x7B 等合成生成,并借助 NVIDIA NeMo Curator 构建多轮对话攻击数据集。

12月18日周四
  1. OpenAI News68

    OpenAI 发布 GPT-5.2-Codex 编码模型

    OpenAI 发布 GPT-5.2-Codex,称其为自家最先进的编码模型。该模型主打长程推理、大规模代码转换和增强的网络安全能力。

    推荐理由:OpenAI 官方给出 GPT-5.2-Codex 的定位与三项能力方向,可据此了解其编码模型的最新迭代重点。

12月17日周三
12月16日周二
  1. Google DeepMind60

    Google DeepMind 发布 Gemma Scope 2,为 Gemma 3 全系列提供开源可解释性工具

    Google DeepMind 发布 Gemma Scope 2,一套覆盖 Gemma 3 全系列(270M 到 27B 参数)的开源可解释性工具,结合稀疏自编码器(SAEs)和 transcoders 查看模型内部计算。

    推荐理由:Gemma Scope 2 覆盖 Gemma 3 全尺寸并新增跨层工具,读者可了解开源可解释性工具当前能审计哪些模型行为。

12月13日周六
  1. Google DeepMind71

    Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio,并推出实时语音翻译

    Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio,面向实时语音智能体,在函数调用、指令遵循和多轮对话三方面做了改进。

    推荐理由:官方给出 Gemini 2.5 Flash Native Audio 在函数调用、指令遵循和多轮对话上的具体提升数据,可据此判断语音智能体的可用性变化。

12月11日周四
  1. OpenAI News70

    OpenAI 发布 GPT-5.2,在数学与科学基准上刷新成绩

    OpenAI 发布 GPT-5.2,称其为目前数学与科学能力最强的模型,在 GPQA Diamond 和 FrontierMath 等基准上取得新的 SOTA 结果。官方表示这些提升已转化为实际研究进展,包括解决一个开放理论问题并生成可靠的数学证明。

    推荐理由:原文给出 GPT-5.2 在 GPQA Diamond 与 FrontierMath 上的新结果,读者可据此了解其在数学与科研任务上的能力边界。

  2. OpenAI News66

    OpenAI 更新 GPT-5 系统卡,纳入 GPT-5.2

    OpenAI 发布 GPT-5 系统卡更新,将 GPT-5.2 纳入 GPT-5 系列,成为该系列最新模型家族。GPT-5.2 的综合安全缓解方案与 GPT-5 系统卡、GPT-5.1 系统卡中描述的基本一致。与 OpenAI 其他模型一样,GPT-5.2 的训练数据包括互联网公开信息、通过第三方合作获取的信息,以及用户或人类训练师与研究人员提供或生成的信息。

    推荐理由:GPT-5.2 系统卡更新说明其安全缓解方案延续 GPT-5 与 GPT-5.1 的框架,可对照前代了解安全策略的连续性。

  3. OpenAI News82

    OpenAI 发布 GPT-5.2 前沿模型

    OpenAI 发布 GPT-5.2,称其为面向日常专业工作最先进的前沿模型,具备最先进的推理、长上下文理解、编码和视觉能力。该模型可在 ChatGPT 和 OpenAI API 中使用,用于支撑更快、更可靠的智能体工作流。

    推荐理由:OpenAI 公布 GPT-5.2 在推理、长上下文、编码与视觉上的定位,读者可据此判断日常专业工作与智能体流程的升级方向。

12月9日周二
  1. Mistral AI78

    Mistral 发布 Devstral 2 编码模型与 Mistral Vibe CLI

    Mistral AI 发布新一代编码模型家族 Devstral 2,包含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,两者均为开源模型,分别采用修改版 MIT 和 Apache 2.0 许可。

    推荐理由:官方给出两款开源编码模型的参数、许可与 SWE-bench 成绩,并附与闭源模型的对比,便于判断开源编码模型的当前水位。

12月3日周三
11月24日周一
11月20日周四
  1. Google DeepMind74

    Google DeepMind 发布 Gemini 3 Pro Image(Nano Banana Pro)图像模型

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),这是基于 Gemini 3 Pro 构建的高保真图像生成与编辑模型,已在 Google AI Studio 和 Vertex AI 面向企业以付费预览形式逐步开放。

    推荐理由:Google DeepMind 发布 Gemini 3 Pro Image,开发者可据此了解其分辨率、文本渲染与 Google 搜索接地等能力边界。

  2. Google DeepMind84

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image)图像生成与编辑模型

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,主打更强推理与世界知识、图像内多语言文字渲染,以及最多融合 14 张图像、保持 5 人一致性的编辑能力,支持 2K 和 4K 分辨率与多种画幅。

    推荐理由:官方给出 Nano Banana Pro 的能力边界与各产品上线节奏,读者可据此判断图像生成在自身工作流中的可用性。

11月19日周三
  1. OpenAI News74

    OpenAI 发布 GPT-5.1-Codex-Max 智能体编码模型

    OpenAI 发布 GPT-5.1-Codex-Max,一款面向 Codex 的更快、更智能的智能体编码模型。该模型面向长时间、项目级任务设计,具备更强的推理能力和 token 效率。

    推荐理由:OpenAI 发布面向 Codex 的智能体编码模型,读者可了解其在长时任务与 token 效率上的定位。