Google DeepMind 发布 AI co-clinician 医疗 AI 研究计划
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。
推荐理由:Google DeepMind 公开了 AI co-clinician 的研究设计与评测结果,读者可了解医疗智能体在证据检索和实时多模态问诊上的能力边界。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。
推荐理由:Google DeepMind 公开了 AI co-clinician 的研究设计与评测结果,读者可了解医疗智能体在证据检索和实时多模态问诊上的能力边界。
Google Research 介绍了科学家使用 Empirical Research Assistance(ERA)开展科研的四个方向:公共卫生、宇宙学、气候与神经科学。
推荐理由:Google Research 用四个真实科研项目展示 ERA 在流行病预测、宇宙学、卫星 CO2 监测和神经回路发现中的具体产出。
OpenAI 梳理了 GPT-5 中"哥布林"式输出的扩散时间线、根因与修复方案,将其归因于人格驱动的行为怪癖。
IBM Granite 团队发布技术文章,详解 Granite 4.1 系列稠密 LLM(3B、8B、30B)的训练流程:约 15T tokens 五阶段预训练,上下文窗口经长上下文扩展至 512K tokens,随后用约 4.1M 条高质量样本做 SFT,并采用 on-policy GRPO 配合 DAPO loss 的多阶段强化学习。
推荐理由:Granite 4.1 团队公开了从数据配比到多阶段 RL 的完整训练细节,可对照其 8B 稠密模型追平 32B MoE 的结论。
OpenAI 正扩建 Stargate,为支撑 AGI 构建算力基础设施,并新增数据中心容量以应对不断增长的 AI 需求。
OpenAI 提出一项五部分行动计划,旨在加强智能时代的网络安全,重点是普及 AI 驱动的网络防御并保护关键系统。
DeepInfra 现已作为 Inference Provider 接入 Hugging Face Hub,首批支持对话与文本生成任务,可调用 DeepSeek V4、Kimi-K2.6、GLM-5.1 等开放权重 LLM,后续将扩展至文生图、文生视频和嵌入向量等任务。
NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解与智能体电脑操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等基准上取得领先成绩。
推荐理由:原文给出架构、训练配方与多模态基准对比,可据此判断开源全模态模型在文档、音视频与GUI任务上的位置。
OpenAI 的 GPT 模型、Codex 和 Managed Agents 现已在 AWS 上可用,企业可在自己的 AWS 环境中构建安全的 AI。原文未披露具体模型版本、上线区域或计费方式。
推荐理由:OpenAI 把 GPT 模型、Codex 和 Managed Agents 放进 AWS 环境,读者可了解企业侧部署路径的变化。
OpenAI 发文说明其在 ChatGPT 中保障社区安全的方式,涵盖模型防护、滥用检测、政策执行以及与安全专家的合作。
OpenAI 宣布 ChatGPT Enterprise 和 OpenAI API 已获得 FedRAMP Moderate 授权,可用于美国联邦机构的安全 AI 部署。
Mistral AI 发布企业 AI 编排层 Workflows 公开预览版,提供持久化执行、可观测性和容错能力,ASML、ABANCA、CMA-CGM、France Travail、La Banque Postale、Moeve 等客户已用它自动化关键流程。
推荐理由:原文给出 Workflows 的编排能力、部署模型与已落地客户案例,读者可据此判断企业级 AI 流程如何从概念验证走向生产。
Google DeepMind 与韩国科学技术信息通信部(MSIT)建立合作,将在首尔办公室设立 AI Campus,向韩国学术界开放 AlphaEvolve、AlphaGenome、AlphaFold、AI co-scientist 和 WeatherNext 等前沿模型。合作覆盖生命科学、能源、天气与气候领域,并探索韩国学生实习机会,同时与韩国 AI 安全研究所(AISI)就安全研究展开协作。
OpenAI 与 Microsoft 宣布达成修订后的协议,简化双方合作关系并增加长期确定性,以支持持续的大规模 AI 创新。
OpenAI 发布开源规范 Symphony,用于 Codex 编排,可把 issue tracker 变成常驻的智能体系统。该规范旨在提升工程产出并减少上下文切换。
Choco 利用 OpenAI API 构建 AI 智能体,实现食品分销流程自动化,以提升生产力并推动业务增长。这是 OpenAI 发布的一则客户案例,聚焦 AI 在真实业务场景中的落地效果。
OpenAI 本周在 Hugging Face Hub 开源 Privacy Filter,一个 1.5B 参数、50M 激活参数的 PII 检测模型,Apache 2.0 许可,单次前向即可在 128k 上下文内标注八类个人信息,并在 PII-Masking-300k 基准上达到 SOTA。
OpenAI 发布由 Sam Altman 分享的五项原则,用于指导其确保 AGI 惠及全人类的工作。该使命与原则共同构成 OpenAI 推进 AGI 的方向框架。
OpenAI 提出一套新框架,分析 921 种职业和 1.48 亿个美国岗位,识别哪些角色面临自动化风险、重组、增长或受 AI 影响较小。
DeepSeek 发布 V4,两个 MoE 检查点上线 Hub:DeepSeek-V4-Pro 为 1.6T 总参数、49B 激活,DeepSeek-V4-Flash 为 284B 总参数、13B 激活,均支持 1M token 上下文窗口。
推荐理由:DeepSeek-V4 把长上下文推理成本压到 V3.2 的一成量级,读者可据此判断智能体长任务工作流的可行性。
OpenAI 发布 GPT-5.5 系统卡,用于说明该模型的安全评估与部署情况。原文正文未能获取,具体内容暂不可知。
OpenAI 发布 GPT-5.5,该模型面向编码、研究和数据分析等复杂任务,并支持跨工具使用。
推荐理由:OpenAI 官方发布 GPT-5.5,读者可据此了解新模型面向编码、研究与数据分析的定位。
OpenAI 分享 ChatGPT Work 在重复性任务、更新、研究、规划和团队运营中的实用工作流。内容面向日常办公场景,帮助用户把这些流程落地到实际工作中。
Hugging Face 发布 Transformers.js 浏览器扩展教程,演示如何在 Manifest V3 约束下用 Gemma 4 E2B 构建本地 AI 功能。
Google Research 宣布在 Google Photos 的 Auto frame 功能中上线一种新的照片视角重构方法,把照片理解为 3D 场景并在其中自动移动虚拟相机位置。
推荐理由:Google Photos 的 Auto frame 新增 3D 感知重构图能力,读者可了解生成式补全如何改变拍摄后的取景空间。
OpenAI 推出 ChatGPT for Clinicians,对美国认证的医生、执业护士和药剂师免费开放,用于支持临床诊疗、文书记录和研究工作。
Google DeepMind 发布论文提出 Decoupled DiLoCo 分布式训练架构,将训练拆分为解耦的计算“岛屿”,岛屿间异步传输数据,从而隔离局部硬件故障。
推荐理由:原文给出分布式训练新架构的带宽、容错与跨代硬件实测数据,可据此判断大规模预训练基础设施的演进方向。
OpenAI 详解 Codex 智能体循环,通过 WebSockets 与连接级缓存降低 API 开销并改善模型延迟。该方案针对 Responses API 的智能体工作流,减少重复请求带来的额外负担。
OpenAI 在 ChatGPT 中推出工作区智能体(workspace agents),由 Codex 驱动,可自动执行复杂工作流并在云端运行。官方称其帮助团队跨工具安全地扩展工作。
推荐理由:OpenAI 官方给出 ChatGPT 工作区智能体的定位与云端运行方式,读者可据此了解团队自动化的新入口。
OpenAI 介绍如何在 ChatGPT 中构建和使用工作区智能体(workspace agents),用于自动化重复性工作流、连接工具并简化团队运营。
OpenAI 发布 Privacy Filter,这是一款开放权重模型,用于检测和脱敏文本中的个人身份信息(PII),官方称其准确率达到 state-of-the-art 水平。
推荐理由:OpenAI 开源了一款用于识别和脱敏文本中个人身份信息的模型,可了解其在 PII 检测上的定位。
Google Research 在 ICLR 论文中提出智能体记忆框架 ReasoningBank,从成功与失败经验中蒸馏高层推理模式,实现测试时自我进化。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 合作,推动前沿 AI 在企业的大规模落地。合作包含三大支柱:共建行业专属 AI 能力、让合作伙伴提前使用 Gemini 系列等前沿模型、以及对接 DeepMind 领导层与客户 CEO 和董事会。目前仅 25% 的组织成功将 AI 规模化投入生产。
OpenAI 发布 ChatGPT Images 2.0,改进了文字渲染、多语言支持和视觉推理能力。官方同时提到 Images 2.5 的新变化。
推荐理由:官方给出 ChatGPT Images 2.0 在文字渲染、多语言和视觉推理上的改进方向,可据此判断图像生成能力的迭代重点。
Hugging Face 发布 QIMMA(阿拉伯语"顶峰")阿拉伯语 LLM 排行榜,在评测模型前先对基准做质量验证,整合 14 个来源基准的 109 个子集、超 52,000 条样本,覆盖 7 个领域,其中 99% 为原生阿拉伯语内容,也是首个含代码评测的阿拉伯语排行榜。验证发现 ArabicMMLU 丢弃率 3.1%、MizanQA 2.3%,问题涵盖答案错误、文本损坏与文化偏见。
OpenAI 推出 Codex Labs,并与 Accenture、PwC、Infosys 等合作,帮助企业在软件开发生命周期中部署和扩展 Codex。OpenAI 同时公布 Codex 周活跃用户达到 4M。
推荐理由:OpenAI 公布 Codex 的企业落地路径与 4M 周活数据,可观察编码智能体在大型组织中的采用方式。
Hugging Face 发文讨论 Mythos 与 Project Glasswing 发布后 AI 网络安全格局,指出 Mythos 的漏洞发现与修补能力来自模型、算力、安全脚手架与自主性组成的系统配方,而非单一模型。文章认为开源代码与工具能分散检测、验证、协调、补丁传播四个环节,避免闭源单点故障,并主张采用半自主 AI 智能体在人类可控前提下进行防御。
伯克利 AI 研究提出 GRASP,一种面向学习动力学(世界模型)的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代中直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度,使长时程规划更实用、更鲁棒。该工作由 Mike Rabbat、Aditi Krishnapriyan、Yann LeCun 与 Amir Bar 合作完成。
凯悦面向全球员工部署 ChatGPT Enterprise,使用 GPT-5.4 和 Codex 提升生产力、运营效率与宾客体验。
Google 提出推理优先的合成数据生成框架 Simula,无需种子数据,将数据集构建拆解为全局多样化、局部多样化、复杂化和质量检查四个可控维度,并以 Gemini 2.5 Flash 为教师模型、Gemma-3 4B 为学生模型在网络安全、法律推理、GSM8k 和 Global MMLU 等五个领域生成最多 512K 数据点。