OpenAI Python SDK 3.24.0 新增 Voices API,ChatGPT 上线虚拟试穿
OpenAI 的 Python SDK 3.24.0 静默新增 Voices API,可用文本提示词或音频样本创建自定义语音;ChatGPT 面向全球上线虚拟试穿,可在自己的照片上查看购物结果中的服装。
OpenAI 的 Python SDK 3.24.0 静默新增 Voices API,可用文本提示词或音频样本创建自定义语音;ChatGPT 面向全球上线虚拟试穿,可在自己的照片上查看购物结果中的服装。
OpenAI Python SDK 3.24.0 新增 Voices API,可从文本提示词或音频样本创建自定义语音;ChatGPT 全球上线虚拟试穿,可在自己的照片上查看购物结果中的服装。
Gemini 桌面端一项设置显示,其 Computer Use 能力将扩展到选定文件夹之外,并支持联网访问和跨应用操作,且无需每一步都获得批准。该功能目前仍处于测试阶段。
Gemini Desktop 将提供用于 computer use 的 Full Access 权限,可访问桌面任意文件并运行任意应用。
Graphite 研究发现 Claude Opus 5.5 的写作痕迹是“dependable”一词出现频率比人类样本高 23 倍,“this matters”高 116 倍;OpenAI Astra 则偏爱“another dimension”和“not simply X”式纠正性框架,后者出现频率超人类 100 倍。
Google 的轨道计算卫星搭乘 SpaceX 火箭从加州升空,首次将其 TPU 送入太空,用于验证芯片在轨供电、散热与运行模型的能力。
美国联邦法官 Amit Mehta 驳回 Chegg 与 Rolling Stone 母公司 Penske Media Corporation 针对 Google AI 搜索功能的反垄断诉讼,两方此前指控 Google 以 AI Overviews 免费获取出版商内容并分流其网站流量。
Google 在 Gemini Live 中上线 Guided Vision,可在兼容 Android 设备上通过共享摄像头,对镜头所指向的内容提供实时语音描述,帮助读取小字、描述周围环境、寻找或识别物体。
Google DeepMind 发布 SynthID Bio,这是一组面向 AI 生成生物设计的水印方法,可将不可感知的签名直接嵌入蛋白质序列而不影响其生物功能。该水印类似数字身份证,帮助 DNA 实验室验证合成蛋白质并保持序列数据库准确。这些工具以开放方式发布,供研究使用,以加强生物安全防护。
Google DeepMind 发布 SynthID Bio,这是一组面向 AI 生成生物设计的水印方法,可在不影响生物功能的前提下把不可感知的签名直接嵌入蛋白质序列。该水印类似数字身份证,可帮助 DNA 实验室验证合成蛋白质并保持序列数据库准确,相关工具以开放形式供研究使用。
推荐理由:原文给出 SynthID Bio 的嵌入方式与开放研究入口,读者可据此了解 AI 生物设计溯源的具体做法。
哈佛的 Julian Simcock 与 Google DeepMind 的 Rick Ingram 出席 Runway AI Summit,讨论物理 AI 的监管、政策制定以及与中国的竞赛。相关内容以视频形式发布。
Arena 发布本周榜单更新,四款新模型改变了 Text、Code 和 Agent Arena 的帕累托前沿。
SemiAnalysis Weekly 新一期由 Jordan Nanos 主持,Cam Quilici、Bryan Shan 和 Alec Ibarra 参与,InferenceX 团队解析了 Engram 内存卸载、AgentX 利润计算器、TPU v7、Vera Rubin 与 Blackwell 的对比,以及更快的 token 是否值得溢价。
Gemini 9 月发布回顾涵盖多项更新:Gemini 4 Argon 作为最新前沿模型,具备高级推理能力和 100 万 token 输出上限,主打网络安全防御等复杂任务。
Google Research 发布多智能体证明发现论文,其系统 Cogentic 基于 Gemini,从问题陈述出发、无需专家提示,在在线学习、拍卖理论和机制设计五个开放问题上取得新结果,每个结果均由领域专家核查。
Google 宣布推出基于可信执行环境(TEE)的新一代联邦学习系统,为数据匿名化提供可远程验证和审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的落地情况,可了解隐私可验证训练的一种工程路径。
前 Google DeepMind 研究员指出,LLM 靠逐个预测 token 生成答案,其思维链仍由同一套下一 token 预测产生,并非 AlphaGo 那种独立搜索机制,因此不构成真正的推理。他列举三大缺陷:模型没有显式可检查的认知状态、知识与推理在权重中纠缠不清、思维链常是事后编造。为此他离开 Google DeepMind,主张借鉴 AlphaGo 架构,让系统维护可更新的认知状态。
Google DeepMind 推出 SynthID Bio,这是一套面向 AI 生成生物设计的水印方法,可在蛋白质序列中嵌入不易察觉的签名,且不影响其生物功能。Sundar Pichai 称其是科学诚信与生物安全方面的一大进步。
Gemini 在兼容的 Android 设备上为 Gemini Live 推出 Guided Vision,提供对话式实时视觉辅助。用户在 Gemini Live 会话中共享摄像头,即可听到对周围环境的清晰描述,例如读取细小文字或寻找附近物品,还能追问细节并获得主动语音提示来对准想探索的目标。该功能与盲人及低视力群体共同打造。
美国联邦法官 Amit Mehta 驳回 Chegg 和 Penske Media 对 Google 提起的反垄断诉讼,认定 Google 在 AI overviews 等产品中的行为不违反反垄断法。
Grok 4.7 已在 Gemini Enterprise Agent Platform 上线。该平台用户现可直接调用 Grok 4.7 模型。
Google DeepMind 发布一期播客,探讨在 AI 生成内容高度逼真的情况下如何验证内容来自人类、机器还是自然,并介绍隐形水印在保护数字媒体与生物设计中的作用。节目内容涵盖水印概念、SynthID、图像与视频,以及 SynthID Bio 和未来韧性等话题,可在 Spotify、Apple Podcasts 等平台收听。
Google DeepMind 在播客中探讨 AI 生成内容日益逼真时如何验证内容出自人类、机器还是自然,并介绍隐形水印在溯源中的作用。节目覆盖 SynthID 及其在图像与视频中的应用,以及面向生物设计的 SynthID Bio,并展望韧性未来。
Google 推出 @google/stitch CLI,可在终端连接本地编程智能体、生成界面与设计系统,并把本地 dev server 快照发送到 Stitch。此前 Stitch 已有 MCP 和 SDK,但一直没有 CLI,此次补齐了这一入口。
Google DeepMind 发布 SynthID Bio,这是一套面向 AI 生成生物设计的水印方法。该团队称可在蛋白质序列中直接嵌入不易察觉的签名,且不影响其生物功能。
Google DeepMind 推出 Gemini 4 Argon,面向编码、企业知识工作与网络防御,首批开放给 Fairwind 计划的政府用户与可信网络安全人员,后续再向开发者、企业和消费者开放。
推荐理由:汇总了 Gemini 4 Argon 的基准、定价与可用范围,并列出同期多家模型与工具的动态,便于横向比较。
Arena 分享 Google DeepMind 的 Gemini 4 Argon 与多款前沿模型在生成任务上的对比,单任务成本比 GPT-6.1 Sol 低 33%,比 Claude Opus 5.5 低 70%,并附上 @petergostev 的第一印象视频。评论区对评测方式提出质疑,认为用图形设计任务评估文本生成模型意义有限,也有人追问单任务成本是否包含思考 token。
推荐理由:原文给出 Gemini 4 Argon 与前沿模型的成本对比和实测片段,读者可据此判断其性价比定位。
Google 放出 Gemini 4 Argon 的早期预览,称其在复杂工作流、网络防御和软件工程上展现前沿性能,Google 内部团队已从编码到量子计算广泛使用。在 PostTrainBench 上,Gemini 4 达到 45.3%,高于 Gemini 3.1 Pro 的 21.99%。作者表示这是朝构建能负责任自我改进的 AI 迈出的一步,并附上了基准测试结果。
Arena 公布 Google DeepMind 的 Gemini 4 Argon (High) 在 Text Arena 以 1525 分排名第 1,在 Code Arena: WebDev 以 1679 分排名第 8,在 Agent Arena 以 +7.92% 净提升排名第 8,每任务成本 0.62 美元。
推荐理由:Arena 公布了 Gemini 4 Argon (High) 在 Agent Arena 与 Text Arena 的排名和成本数据,可据此比较其与 Gemini 3.8 Flash、Claude Opus 4.6 的差距。
Google DeepMind 的 Gemini 4 Argon (High) 以 1525 分登上 Text Arena 第 1,并在 Code Arena: WebDev 以 1679 分位列第 8。
推荐理由:读者可据此了解 Gemini 4 Argon 在 Text Arena 与 Code Arena 的排名变化,以及其混合价格下的性价比位置。
Google 发布 Gemini 4 Argon 模型,宣称在编码、知识工作和网络安全方面具备行业领先性能,但目前仅限公司内部有限测试,外部用户尚不能使用。
Google 发布 Gemini 4 Argon,官方称其为面向真实世界编码、企业知识工作和网络防御的前沿模型,即将逐步开放。Google 员工 Logan Kilpatrick 表示该模型由 Google 内部多方协作完成,目前只是开始,期待更多人使用。
Gemini 4 Argon 的基准测试预览已公布,今日率先面向网络安全防御者开放,随后将尽快向所有人推出。发布者表示期待看到各项进展,并希望用户尽快用上该模型。
Google DeepMind 介绍 Argon,其输出上限为 1M token,并加入更深层的推理能力,用于一次性处理长链条、多步骤问题。官方表示将参考早期测试者的反馈完善系统,之后再面向开发者、企业和消费者更广泛地推出。更多信息见 goo.gle/4rZBiSd。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,面向编码、企业知识工作和网络安全防御等复杂工作流。该模型今天起通过 Fairwind Program 向一批受信任测试者开放。
Google 发布新前沿模型 Gemini 4 Argon,今天起率先向网络安全防御者推送,之后将尽快扩大开放范围。该模型在介绍期定价为输入 $2、输出 $10。
推荐理由:Google 员工公布 Gemini 4 Argon 的发布节奏与定价,可据此了解新前沿模型的开放路径和成本。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后将逐步面向开发者、企业和消费者推出,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元。
推荐理由:Gemini 4 Argon 的 1M 输出 token 与多项基准成绩,展示了长程复杂任务上的能力边界变化。
特朗普与二十余家AI企业达成自愿协议,企业承诺实施白宫建议的管控措施,包括接受独立安全审计,审查网络安全、生物安全、化学威胁及AI模型意外行为等风险,并定期会面制定共同安全标准与基准。
Google 已允许约 100 家出版商加入 AI 内容贡献试点,当网站内容对 Gemini 驱动的 AI Overview 等搜索结果有实质贡献时可获得付费。据 The Information 报道,参与试点的一些中小出版商表示这笔 AI 付费极少,约相当于其广告收入的千分之一,部分大型出版商已拒绝参与,希望以此迫使 Google 给出更慷慨的方案。
Google DeepMind 团队发表论文,提出基于 SynthID 的蛋白质水印方案 SynthIDBio,可在不损害蛋白质功能的前提下,在 ProteinMPNN 设计的蛋白质序列中嵌入可检测的水印,用于生物安全筛查。