Photoroom 用 32 张 H200 在 24 小时内训练出文生图模型 PRX
Photoroom 发布 PRX 系列第三篇,用 32 张 H200、约 1500 美元算力预算在 24 小时内完成一次文生图模型训练,并开源训练代码与实验框架。
推荐理由:Photoroom 公开了 24 小时训练文生图模型的完整配方与代码,读者可据此复现并调整各组件。
Photoroom 发布 PRX 系列第三篇,用 32 张 H200、约 1500 美元算力预算在 24 小时内完成一次文生图模型训练,并开源训练代码与实验框架。
推荐理由:Photoroom 公开了 24 小时训练文生图模型的完整配方与代码,读者可据此复现并调整各组件。
Google DeepMind 推出 Gemini 3.1 Flash-Lite,定位 Gemini 3 系列中速度最快、成本最低的模型,即日起通过 Gemini API 在 Google AI Studio 和 Vertex AI 面向开发者预览。
推荐理由:官方给出定价、速度与基准数据,读者可据此判断高并发场景下是否值得替换现有模型。
OpenAI 发布 GPT-5.3 Instant 系统卡,目前仅有标题信息,正文内容尚未获取。
OpenAI 发布 GPT-5.3 Instant,官方称其让日常对话更顺畅、更实用。
OpenAI 公布其与美国国防部(Department of War)的合同细节,说明安全红线、法律保障以及 AI 系统在涉密环境中的部署方式。
推荐理由:OpenAI 官方披露与国防部门的合同要点,可了解其安全红线与涉密环境部署安排。
OpenAI 与 Amazon 宣布战略合作,将 OpenAI 的 Frontier 平台引入 AWS,并扩展 AI 基础设施、定制模型和企业级 AI 智能体。
OpenAI 与 Microsoft 发布联合声明,表示双方将继续在科研、工程和产品开发领域紧密合作,这一协作建立在多年深度合作与共同成果的基础之上。
OpenAI 在 Amazon Bedrock 推出面向智能体的有状态运行时(Stateful Runtime for Agents),为多步 AI 工作流提供持久编排、记忆和安全执行能力。
OpenAI 宣布获得 1100 亿美元新投资,投前估值 7300 亿美元。其中软银出资 300 亿美元,NVIDIA 出资 300 亿美元,Amazon 出资 500 亿美元。
推荐理由:OpenAI 公布 1100 亿美元新融资与投前估值 7300 亿美元,读者可据此了解其最新资本结构。
OpenAI 公布其心理健康安全工作的多项更新,包括家长控制、可信联系人、改进的痛苦识别能力,以及近期诉讼方面的进展。
Google DeepMind 发布 Nano Banana 2(Gemini 3.1 Flash Image),把 Nano Banana Pro 的世界知识、推理与画质带到 Flash 级速度。
推荐理由:原文列出 Nano Banana 2 在主体一致性、文字渲染和分辨率上的具体规格,可对照 Pro 版判断速度与质量的取舍。
OpenAI 与太平洋西北国家实验室联合推出 DraftNEPABench,用于评估 AI 编程智能体加速联邦许可审批的能力,显示有望将 NEPA 起草时间最多缩短 15%。该基准旨在推动基础设施审查流程的现代化。
OpenAI 与 Figma 推出 Codex 集成,打通代码与设计,让团队在实现与 Figma 画布之间来回切换,加快迭代与交付。
Hugging Face 发文介绍 transformers 库如何为 MoE 模型重构支持,涵盖权重加载、专家后端、专家并行与训练四部分。权重加载引入 WeightConverter 与惰性物化,将 256 个独立专家张量打包为单个连续张量;在 Qwen1.5-110B-Chat 上,v5 异步加载耗时 20.71s,v4 为 66.24s,张量并行下为 10.1s。
OpenAI 最新威胁报告分析了恶意行为者如何将 AI 模型与网站、社交平台结合使用,以及这对检测与防御意味着什么。报告聚焦于这类组合式滥用手法的识别与应对。
OpenAI 任命 Arvind KC 为首席人力官,负责帮助公司规模化扩张、强化企业文化,并主导 AI 时代工作方式的演进。
OpenAI 宣布不再使用 SWE-bench Verified 评测前沿编码能力,原因是该基准日益受到污染,存在测试缺陷与训练数据泄漏问题。其分析指出,这些问题导致 SWE-bench Verified 无法准确衡量编码进展,因此建议改用 SWE-bench Pro。
OpenAI 宣布推出 Frontier Alliance Partners,帮助企业从 AI 试点走向生产环境,实现安全、可扩展的智能体部署。
OpenAI 分享了其 AI 模型针对 First Proof 数学挑战的证明尝试,用于测试模型在专家级问题上的研究级推理能力。
Hugging Face 宣布 GGML(llama.cpp 的创建者)加入 HF,Georgi Gerganov 及团队一同加入,目标是持续支持 ggml 与 llama.cpp 社区,让未来 AI 保持开放。
推荐理由:GGML 与 llama.cpp 团队加入 Hugging Face,读者可了解本地推理项目在资源与维护模式上的变化。
Hugging Face 发布教程,介绍如何通过 Claude Code、Codex 等编码智能体,用 Unsloth 和 Hugging Face Jobs 微调 LiquidAI/LFM2.5-1.2B-Instruct。
推荐理由:原文给出用编码智能体提交微调任务的完整命令与技能安装步骤,读者可据此复现小模型训练流程。
Google DeepMind 发布 Gemini 3.1 Pro,定位为面向复杂任务的更强核心推理模型,在 ARC-AGI-2 上取得 77.1% 的验证分数,超过 3 Pro 推理性能的两倍。
推荐理由:官方给出 Gemini 3.1 Pro 在 ARC-AGI-2 上的验证分数与多端上线范围,可据此判断其推理能力提升幅度。
OpenAI 承诺向 The Alignment Project 投入 750 万美元,用于资助独立的 AI 对齐研究。该资金旨在加强全球应对 AGI 安全与安保风险的努力。
OpenAI 推出 OpenAI for India,在印度扩建本地基础设施、赋能企业并提升劳动力技能。该计划旨在扩大印度全国的 AI 可及性。
IBM Research 与 UC Berkeley 用 MAST 失败分类法分析 ITBench 中 310 条 SRE 执行轨迹,覆盖 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 三类模型。
Google DeepMind 在 Gemini 应用中以 beta 形式上线最新音乐生成模型 Lyria 3,用户用文本或上传图片、视频即可生成带歌词的 30 秒曲目,并配有 Nano Banana 生成的封面图。
推荐理由:官方披露 Lyria 3 在 Gemini 应用中的生成方式与 SynthID 音频验证能力,可了解音乐生成的产品化路径。
Hugging Face 博客介绍 Gradio 6 中 gr.HTML 的新能力,支持自定义模板、作用域 CSS 和 JavaScript 交互,可在单个 Python 文件中完成前端、后端与状态管理,无需构建步骤即可部署到 Hugging Face Spaces。
推荐理由:原文给出 gr.HTML 的模板、状态同步与子类化写法,读者可据此把自定义组件直接接入现有 Gradio 流程。
OpenAI 与 Paradigm 联合推出 EVMbench,用于评估 AI 智能体检测、修补和利用高危智能合约漏洞的能力。该基准聚焦高严重性漏洞的发现、修复与攻击三类任务。
Google Research 提出 MapTrace,用 Gemini 2.5 Pro 与 Imagen-4 构建全自动合成数据管线,生成 200 万条带路径标注的地图问答对并已开源。该管线经地图生成、Mask Critic 筛选可通行区域、构建像素图、Dijkstra 求最短路加 Path Critic 校验四步,在 23,000 条路径上微调多个 MLLM 以提升细粒度空间推理能力。
Google DeepMind 宣布与印度政府机构及本地机构建立 National Partnerships for AI 合作,向印度研究人员开放 AlphaGenome、AI Co-scientist 和 Earth AI 等前沿科学模型。
OpenAI 发布新预印本,显示 GPT-5.2 为一个胶子振幅提出了新公式,随后由 OpenAI 与学术合作者正式证明并验证。该结果以预印本形式公开。
推荐理由:OpenAI 与学术合作者披露 GPT-5.2 提出胶子振幅新公式并被形式化证明,可观察大模型参与理论物理推导的路径。
OpenAI 在 ChatGPT 中推出 Lockdown Mode 和 Elevated Risk 标签,帮助组织防御提示词注入和 AI 驱动的数据外泄。
推荐理由:OpenAI 为 ChatGPT 新增 Lockdown Mode 与 Elevated Risk 标签,面向企业防御提示词注入和数据外泄。
OpenAI 发布开源工具包 GABRIEL,借助 GPT 把定性文本和图像转化为定量数据,帮助社会科学家大规模分析研究。该工具面向社会科学研究场景,可扩展处理规模。
OpenAI 构建了一套实时访问系统,将速率限制、用量追踪与 credits 结合,为 Codex 和 Sora 提供持续访问能力。该系统旨在突破单纯速率限制的局限,支撑这两个产品的规模化访问。
Hugging Face 发布 cuda-kernels Agent Skill,让 Claude、Codex 等编码智能体为 diffusers 和 transformers 项目编写生产级 CUDA 内核,并生成 PyTorch 绑定与基准脚本。
推荐理由:原文给出可安装的 CUDA 内核技能与完整基准数据,读者可据此判断智能体写内核的可行边界。
Google DeepMind 发布 Gemini 3 Deep Think 重大升级,这一专用推理模式面向科学、研究与工程难题。
推荐理由:官方给出 Deep Think 在数学、编程与科学基准上的具体成绩和 API 开放路径,可据此判断专业推理模式的当前水位。
OpenAI 发布 GPT-5.3-Codex-Spark,称其为首个实时编码模型,生成速度提升 15x,上下文窗口为 128k。该模型目前面向 ChatGPT Pro 用户开放研究预览。
推荐理由:OpenAI 公布首个实时编码模型的生成速度与上下文规格,可据此了解编码模型在低延迟方向上的进展。
Hugging Face 博客介绍 Meta 与 Hugging Face 合作的开源框架 OpenEnv,它用 gym 风格 API(reset、step、action、observations)和标准 MCP 工具调用接口,把智能体接到浏览器、代码仓库、日历等真实系统而非模拟环境中评测。
推荐理由:Meta 与 Hugging Face 的 OpenEnv 框架及 Turing 的 Calendar Gym 给出了智能体在真实权限与多步环境下的失败模式数据。
OpenAI 技术人员 Ryan Lopopolo 提出 Harness engineering,探讨在智能体优先的世界中如何利用 Codex。文章聚焦于围绕 Codex 构建工程化支撑体系,以适应以 AI 智能体为核心的开发范式。
Google Research 在 ACM UIST 2025 发布开源原型框架 DialogLab,用于编写、模拟和测试动态的人-AI 群组对话,将对话的社交设定与时间推进解耦,支持拖拽式场景搭建、实时预览与验证仪表盘。14 名游戏设计、教育和社会科学领域参与者的评测显示,human control 模式在参与度、有效性和真实感上显著优于 autonomous 与 reactive 模式。