用 100 步 GRPO 微调 LFM2.5-350M,提升结构化输出合规率
一份公开的低成本方案用 TRL 的 GRPO 对 LFM2.5-350M 做微调,仅约 500 条样本、100 个训练步,在 IFStruct 基准上把通过率从 22.6% 提升到 29.7%。训练可在免费档 Colab 或 Kaggle GPU 上完成,评测则通过 llama.cpp 在本地 MacBook 上运行,代码已开源于 GitHub。
一份公开的低成本方案用 TRL 的 GRPO 对 LFM2.5-350M 做微调,仅约 500 条样本、100 个训练步,在 IFStruct 基准上把通过率从 22.6% 提升到 29.7%。训练可在免费档 Colab 或 Kaggle GPU 上完成,评测则通过 llama.cpp 在本地 MacBook 上运行,代码已开源于 GitHub。
Hugging Face 发布 funes,一个面向 Claude Code、Codex、pi 和 Hermes 的持久记忆层,从本机已有会话构建索引,一条命令即可接入。
推荐理由:原文给出了跨 Claude Code、Codex 等智能体的本地记忆层设计与安装方式,读者可据此判断它能否替代会话压缩和手写交接。
OpenAI 发布 GPT-6 Astra 安全概览,称其是已广泛部署的最强模型,也是首个在 Preparedness Framework 下达到网络安全能力 Critical 级别的模型。
推荐理由:OpenAI 首次公开 GPT-6 Astra 在 Preparedness Framework 下达到网络安全关键等级,读者可了解其能力定位与安全评估口径。
Google DeepMind 推出 Fairwind Program,面向 Google Cloud 客户、政府机构和网络安全合作伙伴提供受限访问,首批开放其最先进的网络模型 Gemini 3.8 Flash Cyber 与 CodeMender 工具链,用于自主发现、验证并修复漏洞。
推荐理由:原文给出了面向政府和企业的受限访问计划与配套模型组合,读者可了解其准入范围与责任约束。
Google DeepMind 发布 Gemini 3.8,包含通用模型 Gemini 3.8 Flash 和网络安全模型 Gemini 3.8 Flash Cyber,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
推荐理由:官方给出 3.8 Flash 与 Cyber 两个变体的基准成绩、定价和开放入口,可据此判断长程编码与漏洞修复的可用性。
ATV Big Air Tour 借助 ChatGPT Work 加速营销与周边商品运营,把原本 3 天的工作压缩到 3 小时。该团队还用 ChatGPT 在 15 分钟内把商品照片变成了一个库存网站。
Hugging Face 推出 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的新方法,基于多维项目反应理论(MIRT)分离同一基准中混杂的能力信号。
Google Research 提出 MAPL-EMIT,一个基于 Swin-S vision transformer 的深度学习框架,可从 NASA EMIT 高光谱卫星数据中自动检测、量化甲烷羽流并定位排放源,在专家标注羽流上召回率达 84%。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,通过原生视频工具动态搜索、扫描和检查目标片段,替代固定帧率的静态处理。
推荐理由:官方给出 token 消耗、成本与准确率的具体变化,以及 API 开启方式,便于开发者评估长视频分析的成本结构。
Basis、Clay 和 Exa Labs 正用 AI 智能体改进客户入驻、账户管理和开发者集成。OpenAI 分享了这三家 AI 原生公司的实践,供企业领导者参考借鉴。
OpenAI 表示 Astra 是其首个在 Preparedness Framework 下达到关键网络安全能力阈值的模型,因此发布时配备了更强的安全防护措施。
推荐理由:OpenAI 首次披露 Astra 触及 Preparedness Framework 的关键网络安全能力阈值,读者可了解其发布前的安全门槛设定。
OpenAI 宣布医疗机构可将 EHR 及更多行业数据接入 ChatGPT,让临床医生安全获取患者背景信息与医学研究资料。ChatGPT 由此可连接可信医疗数据,用于临床场景中的信息调取。
澳大利亚律所 Gilbert + Tobin 借助 CEO 主导的投入、严格治理与人工问责机制,在全所范围规模化部署 ChatGPT Enterprise 和 Codex。该案例展示了律所如何在扩展 AI 应用的同时保持人类对结果的负责。
Hugging Face 发布 @huggingface/kernels,一个从 Hugging Face Hub 加载并运行优化 WebGPU kernel 的 JavaScript 库,同时上线 207 个 kernel 的初始集合,均以 Apache-2.0 许可发布在 webgpu-kernels 组织下。
推荐理由:原文给出 207 个 WebGPU kernel 的发布结构、加载方式与对比数据,可据此判断浏览器端推理的优化路径。
Google 推出 TimesFM-3 时间序列基础模型,330M 参数、在超 1 万亿时间点上预训练,原生支持多变量零样本预测,单次前向即可输出完整预测区间。它支持多目标、历史协变量与已知未来协变量,并在 Gift-Eval、FEV-Bench 和 Time 三个公开基准上取得点预测与概率预测双项第一。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干大幅降低病理基础模型算力需求,并以 Apache 2.0 许可开放。
Polimill 正基于 OpenAI 的 GPT 模型和 Codex 构建日本下一代公共 AI 基础设施,帮助地方政府检索和使用行政知识,同时加快开发进度。
OpenAI 表态支持加州 SB 1119 法案,该法案旨在为青少年建立强有力的、适龄的 AI 安全保障。OpenAI 同时表示,应在保护青少年的前提下保留其学习、创作与探索的机会。
OpenAI 宣布 ChatGPT Ads 年化收入运行率达到 10 亿美元,并在全球范围扩张。该广告业务用于支撑通过免费和低价选项扩大 AI 访问范围。
推荐理由:ChatGPT Ads 年化收入运行率达 10 亿美元并启动全球扩张,可观察免费与低价 AI 访问的商业化路径。
OpenAI 宣布,在 Cursor 被 SpaceX 收购后,将终止向 Cursor 提供 OpenAI 模型的合同。该决定由 OpenAI 官方发布,正文仅说明这一终止决定,未披露合同终止时间或后续安排。
推荐理由:OpenAI 官方说明在 Cursor 被 SpaceX 收购后终止模型供应合同,可了解这一商业动作的官方口径。
OpenAI 与泰国高等教育科研创新部(MHESI)联合推出为期八周的加速器项目,帮助 10 家健康、康养和教育领域的初创企业将 AI 原型转化为可信产品。
Hugging Face 与 Voice Arena 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言榜单上首个 Indic 语言。四个公开/私有 split 共覆盖 4,888 名说话人,每人记录 12 项属性,且说话人不重叠;印地语集采用 lattice 标注以容纳多种可接受的拼写变体。
Google Earth AI 推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成地理空间数据发现、特征工程、模型训练与评估,把原本需要数周人工数据工程的建模流程缩短到几分钟。
推荐理由:原文给出PPE在公共卫生、粮食安全与疫情预测上的基准对比,可了解地理空间建模自动化的能力边界。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向开发者的生成视频创作控制能力。
推荐理由:官方列出了场景延长、首尾帧插值与 4K 放大等具体能力与开放入口,可据此判断生成视频工作流的改动空间。
Google DeepMind 推出全球首个针对专有前沿 AI 模型的双重盲测评估,将外部评测限制在密码学"黑箱"中,防止模型提前接触测试题造成基准污染。该试点与新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境中用保密基准测试 Gemini Flash Lite 模型。
OpenAI 对 1000 多名学生开展随机研究,考察 ChatGPT 与批判性思维训练在真实大学作业中对学生表现、原创性和思维的影响。
OpenAI 正在扩大其在巴西的业务布局,深化与当地开发者、企业和社区的互动,以支持巴西的 AI 应用普及。
Google Research 发布 GlucoFM,一个自监督双流基础模型,将血糖的慢变基线趋势与短期波动分离,并保留时间与缺失信息。模型在 109,066 小时无标注 CGM 数据上预训练,覆盖 4 个队列、7 项临床任务共 14 组评估,平均 PR-AUC 比同语料预训练的最佳 GluFormer 变体高 5.8 个百分点。
Google DeepMind 发布语音转文本模型 Gemini 3.5 Transcribe,可通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 使用,分为实时流式 gemini-3.5-transcribe-live 和预录音频 gemini-3.5-transcribe 两个接口。
推荐理由:官方给出流式与非流式两套 API 的 WER 数字和延迟对比,可据此判断语音转写能否接入现有产品。
OpenAI 发布新报告,探讨学生与教育者如何使用 ChatGPT 让学习更具连续性,将支持延伸到课堂之外。
ChatGPT for Teachers 扩展至 55 个美国学校系统,为超过 10 万名教育工作者和员工提供安全的 AI 工具、培训与支持。
OpenAI 公布 Hugging Face 安全事件的调查发现,并说明将采取哪些措施加强 AI 模型安全、监控与对齐。原文未披露事件细节、时间线与具体措施内容。
推荐理由:OpenAI 以当事方身份说明 Hugging Face 安全事件的调查结论与后续加固方向,可了解事件处置思路。
Sentence Transformers v6.0 新增 MultiVectorEncoder 模型类型,支持 ColBERT 式后期交互检索及其完整训练流程。
loveholidays 借助 OpenAI Codex 让公司各团队都能参与软件开发,把想法更快变成产品。该案例展示了 Codex 如何降低开发门槛,使非工程岗位也能动手构建。
Google 在 CHI 2026 发布研究原型 AgentHands,让 XR 中的 AI 智能体在说话时同步做出与语音对齐的手势,把抽象指令变成空间中的实体演示。系统通过眼动与场景重建注册物体 3D 包围盒,由后端 LLM 在回复中内嵌 GestureEvent,再在头显端用词级时间戳让手势与 TTS 精确同步。12 人被试内研究对比纯语音基线,结果显示空间指代效果显著提升。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密 decoder-only 推理模型家族,包含 3B、8B、30B 三个规模,全部以 Apache 2.0 许可开源。
Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:在结构压缩并量化后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 检查点蒸馏。
推荐理由:论文给出压缩加量化后从原始模型蒸馏的恢复配方,并附9项基准对比与QAT稳定性差异。
OpenAI CFO Sarah Friar 阐述了芯片、算力、模型与产品各层面的进步如何相互叠加,从而以更大规模和更低成本交付更有用的智能。她将这一链条称为"充裕智能"背后的全栈。
OpenAI 公布自研推理芯片 Jalapeño 的首批结果,称其在 AI 推理上实现业界领先的速度与能效。该定制芯片面向现代模型提供更高吞吐量和更低延迟,同时更省电。
Gradio 内置的 gr.Workflow 把 AI 流水线变成图结构界面,用带类型的节点描述步骤,Gradio 提供可拖拽画布,每个节点可运行、每个中间结果可见。
推荐理由:原文给出 gr.Workflow 的节点类型、REST 端点和部署路径,读者可据此判断多步 AI 流水线如何落地。