Google 研究:用鸟类数据训练的 Perch 2.0 如何揭示水下鲸类之谜
Google Research 与 Google DeepMind 发现,主要用鸟类等陆生动物音频训练的 Perch 2.0 生物声学基础模型,在未接触任何水下音频的情况下,仍能作为嵌入模型有效迁移到海洋任务,用于区分须鲸物种和虎鲸生态型。
Google Research 与 Google DeepMind 发现,主要用鸟类等陆生动物音频训练的 Perch 2.0 生物声学基础模型,在未接触任何水下音频的情况下,仍能作为嵌入模型有效迁移到海洋任务,用于区分须鲸物种和虎鲸生态型。
Google DeepMind 发布两篇论文,介绍在数学家、物理学家和计算机科学家指导下,用 Gemini Deep Think 模式解决数学、物理与计算机科学领域的专业研究问题。
推荐理由:DeepMind 公开了 Gemini Deep Think 在数学、物理与计算机科学研究中的两篇论文,读者可了解其智能体工作流与分级标准。
OpenAI for Government 宣布在 GenAI.mil 上部署定制版 ChatGPT,为美国国防团队提供安全、注重安全的 AI 能力。
Hugging Face 发布 Transformers.js v4,已上线 NPM,可通过 npm i @huggingface/transformers 安装。
推荐理由:官方披露了 WebGPU 运行时重写、构建提速与包体积变化,可据此判断浏览器端本地推理的工程成熟度。
OpenAI 公布其 AI 本地化思路,让全球共享的前沿模型适配本地语言、法律与文化,同时不牺牲安全性。该方案强调在保持安全的前提下完成本地化适配。
Hugging Face 发布 SyGra 2.0.0 的 Studio,把合成数据生成搬到画布上,可视化编排流程并自动生成 SyGra 兼容的图配置与任务执行脚本。
OpenAI 的 GPT-5 与 Ginkgo Bioworks 的云端自动化结合组成自主实验室,通过闭环实验将无细胞蛋白质合成成本降低 40%。
OpenAI 推出 Trusted Access for Cyber,一个基于信任的框架,在扩大前沿网络安全能力访问权限的同时加强对滥用的防护。
Google 提出 Natively Adaptive Interfaces(NAI)框架,用多模态 AI 工具打造更具适应性的无障碍应用,以 agent 驱动的动态模块取代静态导航。原型包括面向盲人与低视力用户的 StreetReaderAI,以及基于 Gemini 模型、可实时语音调整描述细节的 Multimodal Agent Video Player(MAVP)。
OpenAI 发布企业平台 OpenAI Frontier,用于构建、部署和管理 AI 智能体。该平台提供共享上下文、入职引导、权限管理和治理能力。
推荐理由:OpenAI 面向企业推出智能体平台,给出共享上下文、权限与治理等能力方向,可供判断企业级 Agent 落地形态。
OpenAI 发布 GPT-5.3-Codex,这是一个 Codex 原生的智能体,将前沿编码能力与通用推理结合,用于支持长周期、真实世界的技术工作。
推荐理由:OpenAI 发布 Codex 原生的 GPT-5.3-Codex,读者可据此了解其编码能力与通用推理结合后的定位。
OpenAI 发布 GPT-5.3-Codex 系统卡,称其为目前能力最强的智能体编码模型。该模型结合了 GPT-5.2-Codex 的前沿编码性能与 GPT-5.2 的推理和专业领域知识能力。
推荐理由:官方系统卡给出 GPT-5.3-Codex 的能力定位,读者可据此了解它在编码与推理上的组合方式。
Mistral AI 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime 两款语音转文字模型。
推荐理由:原文给出两款语音转写模型的延迟、价格与开源许可,读者可据此判断实时语音应用的选型空间。
Google Research 提出 Sequential Attention,用贪心选择机制在单次训练中顺序、自适应地挑选最佳组件,把子集选择直接整合进模型训练,避免传统贪心算法带来的数量级训练开销。该方法在多个神经网络基准上取得 SOTA,并实现快速单遍贪心选择,可用于特征选择、嵌入维度调优和权重剪枝,兼顾效率、精度、可解释性与可扩展性。
OpenAI 介绍 Codex App Server,这是一个双向 JSON-RPC API,用于把 Codex 智能体嵌入到应用中。该接口支持流式进度、工具调用、审批和 diff 等能力。
Hugging Face 推出 Community Evals,基准数据集仓库现在可以注册为 benchmark 并在数据集卡片上展示排行榜,模型仓库通过 .eval_results/*.yaml 存放自己的评测分数。
推荐理由:Hugging Face 把评测分数从黑箱榜单搬到 Hub 仓库,读者可了解社区提交与复现机制如何运作。
Google 宣布与 Included Health 合作,待 IRB 批准后启动一项全国性前瞻性随机对照研究,评估对话式 AI 在真实虚拟诊疗工作流中的表现。
推荐理由:Google 与 Included Health 将开展全国性随机对照研究,读者可了解对话式 AI 进入真实虚拟诊疗的评估路径。
H Company 发布迄今最大的 UI 定位模型 Holo2-235B-A22B Preview,在 ScreenSpot-Pro 上以 78.5% 刷新 SOTA,OSWorld G 达 79.0%,已在 Hugging Face 开放。
Hugging Face 博客第三篇中国开源 AI 系列文章指出,开源已成为中国 AI 机构未来一段时间的主流路线。Qwen 在 Hugging Face 上的衍生模型超过 113k、相关仓库超 200k,远超 Llama 的 27k 和 DeepSeek 的 6k;DeepSeek 与 Qwen 分别是 Hugging Face 关注度第一和第四的组织。
Hugging Face 公布 PRX 文本到图像模型训练消融实验,以 1.2B 参数 PRX-1.2B 为基线,在 Flux VAE latent 空间、256×256 分辨率、全局 batch size 256 下训练 100k 步。
OpenAI 公布 Sora 信息流的设计理念,通过个性化推荐激发创意、促进连接,并借助家长控制和强力护栏保障体验安全。
Snowflake 与 OpenAI 达成 2 亿美元合作协议,把前沿智能引入企业数据,让 AI 智能体和洞察直接在 Snowflake 中运行。
OpenAI 发布面向 macOS 的 Codex app,定位为 AI 编码与软件开发的指挥中心,支持多个智能体、并行工作流和长时间运行的任务。
推荐理由:官方给出 Codex app 的定位与多智能体、并行工作流等能力,读者可据此判断 AI 编码工具形态的变化。
OpenAI 封禁了一批疑似中国来源的账号,这些账号利用 AI 研究美国人员、地点及社会工程学手法。
OpenAI 封禁了一批与此前未披露、疑似俄罗斯来源的“No Bell”行动相关的账号,该行动利用 AI 面向非洲受众生成批评美国及其盟友的内容。
OpenAI 封禁了与一项此前未报告的行动相关的账号,该行动被其命名为“Trolling Stone”。该行动利用 AI 生成关于一名据称俄罗斯邪教领袖在阿根廷被捕的评论。
OpenAI 封禁了一批利用 AI 支撑恋爱诈骗流程的账号,涉及触达、翻译、与受害者互动以及投资诈骗诱饵等环节。
OpenAI 封禁了一批与 Rybar 网络关联的账号,其中部分账号可能源自俄罗斯,它们利用 AI 在网站和社交平台上开展多语言影响活动。
OpenAI 封禁了一个与中国执法部门相关人员关联的账号,该账号利用 AI 策划影响力活动、骚扰和网络行动。
OpenAI 封禁了一批很可能来自柬埔寨的账号,这些账号用 AI 冒充追损服务、律所和执法机构,目标是被诈骗过的人。该行动被命名为 Operation “False Witness”。
OpenAI 封禁了一批很可能源自柬埔寨的账号,这些账号利用 AI 对印尼交友用户实施诈骗,包括翻译和互动。该行动代号 "Date Bait",相关账号借助 AI 完成诈骗触达。
Google DeepMind 开始向美国 18 岁以上的 Google AI Ultra 订阅用户开放 Project Genie,这是一个由 Genie 3、Nano Banana Pro 和 Gemini 驱动的实验性研究原型,可创建、探索和 remix 交互式世界。
推荐理由:原文给出 Project Genie 的三项核心能力与已知限制,读者可据此判断世界模型原型当前能做什么、还差什么。
OpenAI 构建了一个内部 AI 数据智能体,结合 GPT-5、Codex 和记忆能力对海量数据集进行推理,可在数分钟内给出可靠洞察。
OpenAI 宣布将于 2026 年 2 月 13 日在 ChatGPT 中退役 GPT-4o、GPT-4.1、GPT-4.1 mini 和 OpenAI o4-mini,与此前已公布的 GPT-5(Instant、Thinking 和 Pro)退役同步进行。API 目前没有变化。
推荐理由:OpenAI 公布 ChatGPT 中多款旧模型的退役时间表,读者可据此安排现有应用的模型迁移。
大成建设人力资源团队正主导在全公司范围内部署 ChatGPT Enterprise,用于推动 AI 驱动的人才培养。
Gradio 团队发布开源 Python 库 Daggr,用于把 Gradio 应用、ML 模型和自定义函数串联成 AI 工作流,并自动生成可视化画布。它支持检查任意节点输出、修改输入并单独重跑某一步,还提供状态持久化和 sheets 多工作区,安装只需 Python 3.10 以上并执行 pip install daggr。
推荐理由:原文给出代码优先的编排方式和可视化画布,读者可据此判断它是否适合替代现有调试脚本。
Google Research 发布论文《Towards a Science of Scaling Agent Systems》,对 180 种智能体配置做大规模对照评测,覆盖 Finance-Agent、BrowseComp-Plus、PlanCraft、Workbench 四个基准和 GPT、Gemini、Claude 三个模型家族。
推荐理由:通过 180 种智能体配置的对照实验,给出多智能体架构在并行与串行任务上的量化差异,可据此调整编排策略。
OpenAI 开放 EMEA Youth & Wellbeing Grant 申请,该项目总额 50 万欧元,用于资助非政府组织和研究人员,推进 AI 时代的青年安全与福祉。
OpenAI 发布欧盟经济蓝图 2.0,以新数据、合作伙伴关系和多项举措推动欧洲 AI 应用、技能与增长。
Hugging Face 发布新工具 upskill,可用大模型生成并评测 agent skill,再交给更小或本地模型使用。文章以用 Claude Opus 4.5 编写 diffusers 模型 CUDA kernel 为例,upskill 会基于 agent trace 生成技能和测试用例,并对比有无技能时的准确率与 token 消耗。
推荐理由:原文给出用大模型生成并评测 agent skill 再迁移到小模型的完整流程,可复用到其他专业任务。