Google 推出 PaperVizAgent 与 ScholarPeer 两个学术 AI 智能体
Google 发布两个学术智能体框架:PaperVizAgent(原 PaperBanana)从论文方法与图注生成出版级插图,ScholarPeer 则自动评审论文。
Google 发布两个学术智能体框架:PaperVizAgent(原 PaperBanana)从论文方法与图注生成出版级插图,ScholarPeer 则自动评审论文。
OpenAI 阐述了企业级 AI 的下一阶段,随着各行业采用加速,其布局涵盖 Frontier、ChatGPT Enterprise、Codex 以及公司范围内的 AI 智能体。
OpenAI 发布 Child Safety Blueprint,一份为负责任构建 AI 提供路线图的蓝图,涵盖安全防护措施、适龄设计和多方协作,目标是保护并赋能年轻人在线体验。
OpenAI 推出试点项目 OpenAI Safety Fellowship,用于支持独立的安全与对齐研究,并培养下一代人才。该项目为试点性质,具体规模、资助金额与申请细节尚未在公告中披露。
Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT)评估 LLM 行为倾向与人类的一致性,覆盖 25 个 LLM。结果显示,模型规模超过 120B 及前沿闭源模型在人类标注者一致时接近完美对齐,但共识低于 90% 时对齐率停滞在 80% 出头;模型还在职场场景中倾向情绪外露、在社交争端中偏好和谐而非坚持立场。
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,采用 Apache 2.0 许可。
推荐理由:Gemma 4 给出四种尺寸、Apache 2.0 许可与完整工具链支持,可据此判断开源模型在端侧与本地部署上的能力边界。
OpenAI 宣布收购 TBPN,以加速围绕 AI 的全球对话并支持独立媒体。此次收购意在扩大与开发者、企业及更广泛科技社区的交流。
推荐理由:OpenAI 收购 TBPN 以扩大 AI 对话并支持独立媒体,读者可了解其媒体与生态布局的意图。
OpenAI 为 Codex 在 ChatGPT Business 和 Enterprise 中新增按用量付费(pay-as-you-go)定价,让团队能更灵活地启动和扩展使用。
Hugging Face Blog 发布文章《Welcome Gemma 4: Frontier multimodal intelligence on device》,标题显示 Gemma 4 是一款面向端侧设备的前沿多模态模型。原文正文未能抓取,暂无更多细节。
Gradient Labs 基于 GPT-4.1 和 GPT-5.4 mini、nano 构建 AI 智能体,为每位银行客户提供 AI 客户经理,自动处理银行支持工作流。该方案主打低延迟与高可靠性。
Google Research 在《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究了标注条目数与每条目标注者数的权衡,发现常用的每条目 1、3、5 名标注者往往不足,可靠结果常需超过 10 名。
OpenAI 宣布获得 1220 亿美元新融资,用于在全球扩展前沿 AI、投资下一代算力,并满足 ChatGPT、Codex 和企业 AI 不断增长的需求。
推荐理由:OpenAI 本轮融资规模与资金用途一并给出,可据此观察前沿模型算力投入和 ChatGPT、Codex 等产品的扩张节奏。
Mistral AI 发布 Spaces CLI,用于脚手架搭建项目、启动开发环境、生成配置并部署到 staging,典型流程只需 `spaces init`、`cd`、`spaces dev` 三条命令即可获得带热重载、数据库和 Dockerfile 的多服务项目。
Google Quantum AI 发布白皮书,称未来量子计算机破解加密货币所依赖的 ECDLP-256 所需的物理量子比特比此前估计少约 20 倍。
推荐理由:Google 用量子资源估算与零知识证明披露方式,给出区块链迁移 PQC 的时间压力与路径参考。
OpenAI 与盖茨基金会面向亚洲灾害响应团队举办工作坊,帮助其把 AI 转化为实际行动。活动聚焦灾害响应场景中的 AI 落地应用。
Google DeepMind 公布了一套 AI 指针的交互原则,让指针不仅知道指向什么,还能理解它对用户的意义,由 Gemini 驱动。团队提出四条原则:保持工作流不被打断、用指向加语音替代长提示词、支持“这个”“那个”式的自然简写、把像素转化为可操作实体。
推荐理由:Google DeepMind 公开了 AI 指针的四条交互原则,并说明该能力已进入 Chrome 与 Googlebook,读者可据此判断浏览器内 AI 交互的走向。
拥有 230 年历史的 STADLER 借助 ChatGPT 改造知识工作,在 650 名员工中节省时间并提升生产力。
Google DeepMind 发布 Gemini 3.1 Flash Live,称其为目前质量最高的音频与语音模型,具备更高精度和更低延迟。该模型在 ComplexFuncBench Audio 上得分 90.8%,在 Scale AI 的 Audio MultiChallenge 上开启 thinking 后得分 36.1%。
推荐理由:官方给出语音模型的基准分数与多产品开放入口,可据此判断实时语音交互的可用边界。
Google DeepMind 发布关于 AI 有害操纵的新研究,称其构建了首个经实证验证的工具包,用于在真实场景中测量这类 AI 操纵,并公开了开展同类人类参与者研究所需的全部材料。
Google DeepMind 发布 Lyria 3 Pro,可生成最长 3 分钟的曲目,并更好地理解音乐结构,支持按 intro、verse、chorus、bridge 等具体段落提示。
推荐理由:官方给出 Lyria 3 Pro 的时长上限、结构控制能力与多处接入入口,可据此判断音乐生成在现有工作流中的可用范围。
OpenAI 阐述 Model Spec 如何作为公开框架规范模型行为,在 AI 系统演进中平衡安全、用户自由与问责。该框架面向公众开放,用于指导模型行为准则。
Google Research 发布 Vibe Coding XR 工作流,将 Gemini 与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架结合,把自然语言提示词直接转成可运行的 Android XR 应用,官方称耗时在 60 秒以内。
OpenAI 推出 Safety Bug Bounty 安全漏洞赏金计划,用于识别 AI 滥用与安全风险。该计划覆盖的范围包括智能体漏洞、提示词注入和数据外泄。
推荐理由:OpenAI 把智能体漏洞、提示词注入和数据外泄纳入漏洞赏金范围,读者可了解其安全风险覆盖边界。
Google 发布 TurboQuant 压缩算法,可将 KV cache 量化到 3 bit,无需训练或微调且不损失模型精度,相关论文将亮相 ICLR 2026。
推荐理由:Google 公布 TurboQuant 等三种向量量化算法,读者可了解 KV cache 压缩到 3 bit 且不损失精度的实现路径。
Google Research 推出自监督框架 S2Vec,将建筑环境栅格化为多层特征图像,用掩码自编码(MAE)学习通用嵌入向量,无需人工标注即可刻画任意地点的特征。在 US-wide 人口密度、收入中位数等社会经济指标的零样本地理外推任务上,S2Vec 通常是表现最好的单一模型,与图像嵌入做多模态融合后效果普遍优于任一单模态。在树木覆盖、海拔等环境任务上仍有明显改进空间。
OpenAI 面向使用 gpt-oss-safeguard 的开发者发布基于提示词的青少年安全策略,用于审核 AI 系统中与年龄相关的风险。该策略以提示词形式提供,帮助开发者按青少年场景定制内容审核规则。
OpenAI Foundation 宣布计划投入至少 10 亿美元,用于疾病治愈、经济机会、AI 韧性与社区项目。
ChatGPT 推出更丰富、更具视觉沉浸感的购物体验,由 Agentic Commerce Protocol 驱动,支持商品发现、并排对比和商家接入。
Mistral AI 发布首个文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,可做情感表达与零样本跨语言音色适配。
推荐理由:官方给出 4B 参数、9 种语言、70ms 延迟与每千字符 0.016 美元的定价,读者可据此判断语音智能体的成本与选型空间。
OpenAI 为 Sora 2 视频模型和 Sora 社交创作应用构建了以安全为基础的设计,以应对二者带来的新型安全挑战。其方法以具体防护措施为支撑。
OpenAI 采用链式思维监控(chain-of-thought monitoring)研究内部编码智能体的失准问题,通过分析真实部署环境来检测风险并强化 AI 安全保障措施。
OpenAI 宣布将收购 Astral,以加速 Codex 的增长,并用于打造新一代 Python 开发工具。官方未在摘要中披露交易金额、时间表等具体条款。
Google Research 在 The Check Up 活动上公布多项医疗 AI 进展:与 Fitbit 合作研究的 Personal Health Agent(PHA)在长期健康支持上优于单一任务应用,实验性 AI 系统识别出 25% 此前被漏诊的"interval cancers"。
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项姊妹研究,评估 AI 乳腺筛查系统。
推荐理由:两项 Nature Cancer 研究给出了 AI 在 NHS 乳腺筛查中的前瞻部署数据与人工仲裁交互结果,可了解落地时的数据漂移与仲裁量问题。
Google DeepMind 发布论文《Measuring Progress Toward AGI: A Cognitive Taxonomy》,提出涵盖感知。
Mistral AI 推出 Forge,一个让企业基于专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段。Forge 支持 dense 与 MoE 两种架构,并可按需支持多模态输入,模型可在企业自有基础设施内训练和治理。
推荐理由:原文给出了企业用自有数据训练前沿模型的分阶段能力与多架构支持,读者可据此判断自建模型的落地路径。
H Company 发布 Holotron-12B,一个基于 NVIDIA Nemotron-Nano-2 VL 后训练的多模态计算机操作模型,已在 Hugging Face 上线,采用 NVIDIA Open Model License。
推荐理由:原文给出混合 SSM 架构带来的吞吐对比数据与 WebVoyager 提升幅度,可据此判断计算机操作智能体的部署成本。
OpenAI 发布 GPT-5.4 mini 和 nano,是 GPT-5.4 更小、更快的版本,针对编码、工具调用、多模态推理以及高并发 API 和子智能体负载做了优化。
推荐理由:OpenAI 公布 GPT-5.4 的小型版本,读者可据此了解其在编码、工具调用与高并发场景中的定位。
OpenAI Japan 发布日本青少年安全蓝图,为使用生成式 AI 的青少年引入更严格的年龄保护、家长控制和身心健康保障措施。
OpenAI 新研究显示,美国用户每天向 ChatGPT 发送近 300 万条询问薪酬与收入的消息,用以弥补薪资信息差。