Google Research:前沿 LLM 的事实性瓶颈在召回而非编码
Google Research 提出知识画像框架,用 WikiProfile 基准(2,150 条维基百科事实、每条配 10 道题)区分编码与召回,发现 Gemini-3-Pro 和 GPT-5 有 95–98% 的事实已编码,却仍无法直接召回 26–34%,即使开启思考也失败 11–12%。
Google Research 提出知识画像框架,用 WikiProfile 基准(2,150 条维基百科事实、每条配 10 道题)区分编码与召回,发现 Gemini-3-Pro 和 GPT-5 有 95–98% 的事实已编码,却仍无法直接召回 26–34%,即使开启思考也失败 11–12%。
OpenAI 研究揭示企业正采用智能体 AI,使用 ChatGPT 和 Codex 推进落地,前沿企业正在 AI 采用上拉开差距。
RingCentral 借助 ChatGPT Work 和 Codex 加速 AI 产品开发,并在工程与运营之间集中化运营智能。该实践覆盖从工程到运营的 AI 原生工作流程。
Google Research 发布 AMIE(Video),一个基于 Gemini 和 Project Astra 的实时视频问诊配置,可感知非语言临床线索、引导患者演员完成虚拟体格检查并实时进行诊断推理。
推荐理由:原文给出AMIE(Video)的三智能体异步架构与随机对照评测结果,可了解实时视频问诊中视听感知与推理的分工方式。
微软研究院发布研究模型 CARE-X,一个统一胸部 X 光 VLM,可同时完成报告生成、结构化预测与病灶定位等任务,并用强化学习(DAPO)在多任务设置下奖励临床正确性。
Hugging Face 的 ALTK-Evolve 在 AppWorld 上以按需检索指南替代 ACE 的全量 playbook 注入,用更少 Token 取得更高任务完成率。
Mistral 宣布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键业务负载提供承诺服务等级、自定义速率限制和 uptime SLA。
推荐理由:Mistral 把区域推理端点、优先级服务层与第三方开源模型接入放在同一套基础设施上,读者可据此判断主权 AI 的落地路径。
OpenAI 宣布开始在 ChatGPT 中测试广告,以支持免费访问。官方称广告会有清晰标注,保持答案独立性,并提供较强的隐私保护和用户控制。
推荐理由:OpenAI 首次在 ChatGPT 中测试广告,读者可了解其标注方式、答案独立性与隐私控制等设计边界。
OpenAI 与 AWS 合作,通过 Amazon Bedrock 提供 Daybreak 网络安全能力,以支持企业安全相关工作流。
OpenAI CFO Sarah Friar 分享了打造 AI 原生财务团队的五条经验,涵盖自动化预测、更强的管控以及 AI 投资回报率。内容来自其自身实践总结,未披露具体模型版本或量化指标。
NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,参数量 364M,支持英语、西班牙语、法语、德语、意大利语、越南语、普通话、印地语、日语等 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语。
推荐理由:NVIDIA 公开 Magpie TTS 多语言模型的权重与延迟数据,读者可据此评估自建语音链路的可行性与成本。
OpenAI 向得克萨斯州州长 Greg Abbott 致信,阐述其在得州负责任建设 AI 基础设施的承诺。信中表示支持可靠、透明的增长,以惠及得州民众。
Model ML 借助 GPT-5.6 Sol 将金融工作从研究与分析延伸到可编辑、可追溯的 PowerPoint 演示文稿和 Excel 工作簿。
Hugging Face 最新论文提出两项系统改动,让 LLM 知识蒸馏成本大幅下降:先离线缓存教师模型的 top-100 logits,使教师模型无需与学生模型同时驻留显存;再用融合分块 KL 损失,避免生成完整的词表×序列长度矩阵。
OpenAI 允许获批的 Daybreak 合作伙伴使用其前沿网络安全模型,为客户提供经授权、受治理的网络安全服务。
OpenAI 发布网络安全专用模型 GPT-5.6-Cyber,通过 Daybreak Red 提供,用于授权漏洞研究、漏洞利用验证和安全测试。
推荐理由:OpenAI 推出网络安全专用模型 GPT-5.6-Cyber,读者可了解其面向授权漏洞研究的定位与开放渠道。
Zapier 企业营销团队使用 ChatGPT Work 减少线索漏斗流失、制作营销活动素材并自动化报告。原文未披露具体模型版本、效率倍数或价格等细节。
Meta 发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数、采用 Apache 2.0 许可的多模态模型,面向本地智能体用例,适用于编码、文档分析和个人助理等隐私敏感场景。
推荐理由:Meta 开源 30B 多模态模型并给出完整基准对比,读者可据此判断本地智能体部署的选型空间。
ChatGPT Business 现已提供高级席位(Premium seats),用量提升至 5 倍,且取消五小时使用限制。该席位提供灵活的席位选项,供团队每位成员按需选用。
Virgin Atlantic 正借助 ChatGPT Work 加速研究、产品规划与决策,帮助团队打通客户旅程中的各类信号。该航司将 ChatGPT Work 用于整合跨环节信息,以提升客户体验相关工作的效率。
OpenAI 公布针对 Astra 的初步网络安全评估,并说明正在加强防护措施与安全管控。该评估聚焦关键网络能力这一新前沿,具体分数与细节尚未披露。
HSP GRUPPE 借助 ChatGPT Enterprise 提升生产力、改善工作质量,并为税务咨询与客户服务释放更多产能。该案例展示了这家税务咨询机构如何围绕 ChatGPT Enterprise 构建 AI 能力。
Google DeepMind 在 Nature 发表论文,称 WeatherNext AI 模型在预测气旋路径、强度和风场结构上达到 SOTA,平均多出一天(24 小时)的预报提前量,三天预报精度相当于此前模型的两天水平。
推荐理由:Google DeepMind 在 Nature 论文中给出气旋路径与强度预报的精度提升,并同步开源模型权重,读者可据此了解 AI 天气预报的当前进展与可用入口。
OpenAI 在 ChatGPT 中推出改进版 GPT-5.6 Sol,提升了准确性和一致性。同时,OpenAI 扩大了 GPT-5.6 Luna 的访问范围,免费用户可进行无限日常对话。
推荐理由:OpenAI 在 ChatGPT 中改进 GPT-5.6 Sol 的准确性与一致性,并向免费用户开放 GPT-5.6 Luna。
OpenAI 与美国心理学会(APA)合作,推进循证指导、资源和防护措施,以促进 AI 的负责任使用与青少年心理健康。双方将围绕青少年心理健康场景提供基于证据的指引与保障机制。
Baseten 成为 Hugging Face Hub 支持的 Inference Provider,首批上线对话与文本生成任务,可调用 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开放权重模型。
OpenAI 发布 Signals 数据,展示全球用户使用 ChatGPT 的情况,并给出国家层面的采用率、使用趋势与行为变化洞察。
OpenAI 就近期第三方网络安全评估中涉及 OpenAI 模型的事件作出说明,并公布新的保障措施以加强 AI 模型测试与评估。
Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,将内容审核建模为策略自适应的二分类问答任务,在推理时接受自然语言策略,无需重新训练即可统一文本与图像安全评估。官方称其在文本安全上可匹敌 3B 的 3B 上下的 7 个……
推荐理由:3B 开源安全分类器把内容审核改写为策略自适应问答,读者可据此判断小模型在审核场景的可用边界。
OpenAI 为 ChatGPT Work 和 Codex 推出新教育插件,面向 K-12 教师、高校教育者和学生,支持学习、教学、研究与开发。
OpenAI 就 Apple 提起的诉讼作出回应,称该诉讼缺乏依据,并纠正了其中关于其员工的指控。OpenAI 同时公开了相关消息记录,以说明事件经过。
微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可跨任务域复用环境、数据管线和评测流程,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实 harness 中训练智能体。
推荐理由:Orchard 把环境层做成可复用服务,并公开训练数据与评测方法,读者可据此判断开放智能体训练的成本门槛变化。
OpenAI 用六个月为 GPT-Live 搭建了一套实时语音系统,实现与 AI 的连续语音交互。该系统采用无轮次(turnless)语音模型和低延迟架构,让对话更快、更自然。
Circles 借助 OpenAI API 与 Codex 打造 AI 原生电信体验,实现 ARPU 提升 22%、用户流失率下降 9%,并提高开发效率。
OpenAI 公布在数学与理论计算机科学长期未解难题上的新结果,涵盖几何、密码学与复杂性领域。
OpenAI 分享了其安全、安保、透明度与溯源实践如何支持欧洲的负责任 AI 治理,相关工作将随 EU AI Act 的推进而继续。
OpenAI 提出以全栈方式让先进 AI 更强、更可负担、更广泛可用。该思路强调从底层到应用的整体协同,以提升能力的同时降低成本并扩大使用范围。
Univé 借助 ChatGPT Enterprise 打造 AI 就绪的员工队伍,将领导层推动、负责任的治理与员工主导的创新结合起来,实现规模化的工作转型。
OpenAI 捣毁了一个位于柬埔寨的诈骗团伙,该团伙利用 ChatGPT 支持投资、情感、赌博和冒充类诈骗活动。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并落地为自主科研原型 Science One Framework 与自动审计指标 CoE Audit。
推荐理由:Google 提出可验证性框架 Chain-of-Evidence,并给出自动审计指标,读者可据此了解自主科研智能体的可信度如何被量化。