Hugging Face 推出 RTEB:面向真实场景的检索嵌入评测新基准
Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)beta 版,用公开与私有数据集混合的方式评测嵌入模型的真实检索泛化能力。该基准覆盖 20 种语言,聚焦法律、医疗、代码、金融等企业领域,默认榜单指标为 NDCG@10,私有数据集由 MTEB 维护者评测,单个数据集至少含 1k 文档和 50 条查询。
Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)beta 版,用公开与私有数据集混合的方式评测嵌入模型的真实检索泛化能力。该基准覆盖 20 种语言,聚焦法律、医疗、代码、金融等企业领域,默认榜单指标为 NDCG@10,私有数据集由 MTEB 维护者评测,单个数据集至少含 1k 文档和 50 条查询。
OpenAI 发布视频生成模型 Sora 2,支持同步对白与音效。原文同时说明 Sora 产品已不再提供。
推荐理由:原文给出 Sora 2 在视频生成中同步对白与音效的能力方向,可据此了解视频模型的新进展。
OpenAI 发布新一代视频与音频生成模型 Sora 2,并公布其系统卡。相比此前的 Sora,新模型在物理准确性、真实感、音频同步、可控性和风格范围上有所提升,官方称这些能力是此前视频模型难以实现的。
推荐理由:官方系统卡披露 Sora 2 在物理准确性、同步音频与可控性上的能力变化,可据此了解视频生成的新边界。
OpenAI 发布 Sora 2 和 Sora 应用,称两者在构建时以安全为基础,以应对先进视频模型和新型社交创作平台带来的新安全挑战。OpenAI 表示其做法建立在具体防护措施之上。
推荐理由:OpenAI 说明 Sora 2 与 Sora 应用在安全机制上的设计思路,可了解视频模型与社交创作平台的安全考量。
OpenAI 使用内部 AI 销售助手对入站线索进行资格筛选、个性化回复,并帮助销售团队转化客户兴趣。该助手用于将客户兴趣转化为实际客户。
OpenAI 构建了一套合同数据提取系统,用于快速提取合同数据,缩短了处理周期,并让团队更容易获取所需细节。
OpenAI 推出新系列 OpenAI on OpenAI,分享其内部如何用自家技术简化工作流程、扩展专业能力并推动业务成果,供其他组织参考借鉴。
OpenAI 正在用 AI 改进客户支持,以缩短响应时间、提升质量并应对超高速增长带来的规模压力。文章介绍了其支持团队如何借助 AI 在每一次交互中持续优化服务。
OpenAI 的研究助手帮助团队分析数百万条支持工单,更快发现洞察,并在公司内部扩展探索能力。该工具面向团队级洞察场景,用于加速从海量工单数据中提取结论。
OpenAI 构建了一个内部 AI 销售助手,用于自动化客户调研、会议准备、产品知识和客户跟进。该助手旨在提升销售生产力与客户成功团队的工作效率。
OpenAI 为 ChatGPT 推出家长控制功能,并上线新的家长资源页面,帮助家庭管理 ChatGPT 在家中的使用方式。
OpenAI 通过严格的使用政策、先进的检测工具和行业协作,阻止、举报并预防 AI 被滥用于网络儿童性剥削与虐待。
Hugging Face 用 OpenVINO.GenAI 在 Intel Core Ultra 上加速 Qwen3-8B 智能体,以 Qwen3-0.6B 作草稿模型做投机解码,生成速度提升约 1.3 倍。
OpenAI 在 ChatGPT 中推出 Instant Checkout 和 Agentic Commerce Protocol,让用户、AI 智能体与商家在 ChatGPT 内共同完成购物。OpenAI 称这是其迈向智能体商务的第一步。
Hugging Face 博客发布 VibeGame,一个基于 three.js、rapier 和 bitecs 构建的高层声明式游戏引擎,专为 AI 辅助游戏开发设计。
NVIDIA 发布首个面向日本的主权 AI 开源合成数据集 Nemotron-Personas-Japan,含 600 万条日语合成人物画像(100 万条记录、每条 6 个画像),总 token 约 14 亿,覆盖约 95 万个独特姓名和 1500 以上职业类别,以 CC BY 4.0 许可开放商用。
OpenAI 与 AARP 达成合作,通过 OpenAI Academy 和 OATS 的 Senior Planet 项目,为老年人提供 AI 培训、诈骗识别工具和全国性项目,帮助他们安全上网。
Hugging Face 的 Swift 库 swift-transformers 发布 1.0 版本,为 Apple Silicon 平台本地模型推理提供 Tokenizers、Hub 和 Core ML 模型封装等组件。
ChatGPT 面向团队推出共享项目、更智能的连接器,以及合规与安全方面的更新。更新旨在帮助团队更高效地协作与完成工作。
OpenAI 推出 GDPval,一项衡量模型在真实世界、具有经济价值任务上表现的新评测,覆盖 44 种职业。该评测聚焦模型在实际工作场景中的可用性,而非传统学术基准。
OpenAI 面向移动端 Pro 用户发布 ChatGPT Pulse 预览版。Pulse 会主动做研究,基于用户的聊天、反馈以及日历等已连接应用,推送个性化更新。
推荐理由:官方给出 Pulse 的预览范围与信息来源,读者可据此判断 ChatGPT 主动推送的形态。
ENEOS Materials 将 ChatGPT Enterprise 引入制造业,用于加速研究、提升工厂设计安全性,并将 HR 分析时间缩短 90%。80% 的员工反馈工作流程得到改善。
SAP 与 OpenAI 合作推出"OpenAI for Germany",为德国公共部门提供安全、主权的 AI 能力,以支撑高效公共服务。该合作于 2026 年落地。
OpenAI、Oracle 和 SoftBank 宣布为 Stargate 新增五个 AI 数据中心站点,推进一项 500B 美元、10 吉瓦的美国基础设施扩建,用于支撑下一代 AI 并创造数万个就业岗位。
推荐理由:OpenAI、Oracle 与 SoftBank 公布 Stargate 五个新站点,读者可了解这笔 5000 亿美元、10 吉瓦级美国算力基建的推进节奏。
Hugging Face 开源 Smol2Operator,以 SmolVLM2-2.2B-Instruct 为基线,通过两阶段训练将无 grounding 能力的视觉语言模型变为可操作 GUI 的智能体。
OpenAI 的 Executive Function 系列介绍了 CNA 用 AI 改造新闻编辑室的实践,总编辑 Walter Fernandez 分享了 AI 落地、文化与新闻业未来的看法。
SchoolAI 基于 GPT-4.1、图像生成和 TTS 构建安全、教师引导的 AI 工具,已服务超过 100 万间教室。该平台提升了课堂参与度、教师监督能力和个性化学习体验。
OpenAI 与 NVIDIA 宣布战略合作,将部署 10 吉瓦由 NVIDIA 系统驱动的 AI 数据中心,首期于 2026 年启动。
推荐理由:OpenAI 与 NVIDIA 的 10 吉瓦算力合作给出了首期落地时间,可据此观察大模型训练算力的供给节奏。
Hugging Face 发布低代码/无代码框架 SyGra,用于为 LLM 和 SLM 生成、转换与对齐数据集,支持 vLLM、Hugging Face TGI、Triton、Ollama 等多种推理后端。该框架覆盖从 SFT 到 DPO 的偏好对生成、知识库转 Q&A、推理增强、质量过滤及跨语言转换等场景,以 Python 库形式集成到现有 ML 工作流。
Hugging Face 发布 GAIA 的后续智能体基准 Gaia2,并配套开源 Meta Agents Research Environments(ARE)框架,用于运行、调试和评估智能体。
推荐理由:Gaia2 把智能体评测从只读检索扩展到读写交互,并给出各模型在歧义、适应性和时间推理上的差距。
Hugging Face Hub 现已支持 Scaleway 作为推理服务商,用户可直接在模型页调用 gpt-oss、Qwen3、DeepSeek R1、Gemma 3 等开放权重模型。
Cloud Security Alliance 与 Noma Security 牵头、Haize Labs 和 Harmonic Security 参与,推出 RiskRubric.ai,对 Hugging Face 上超 50 万模型按透明度、可靠性、安全、隐私、安全性与声誉六大维度打分,输出 0-100 分及 A-F 等级。
Public AI 现已作为 Inference Provider 接入 Hugging Face Hub,用户可直接调用 Swiss AI Initiative、AI Singapore 等机构的公共主权模型。
Apollo Research 与 OpenAI 开发了针对隐藏失配(scheming)的评测,在前沿模型的受控测试中发现了与 scheming 一致的行为。团队还分享了具体案例,以及对一种早期减少 scheming 方法的压力测试。
推荐理由:OpenAI 与 Apollo Research 公开了针对模型隐藏失配的评测与缓解方法,读者可了解该风险如何被检测。
OpenAI 正在 ChatGPT 中构建年龄预测与家长控制功能,为青少年提供更安全、适龄的使用体验。该功能同时为家庭提供新的管理工具,帮助家长更好地支持孩子使用 ChatGPT。
OpenAI 阐述了其在 AI 使用中平衡青少年安全、自由与隐私的做法。
Hugging Face 发布 LeRobotDataset v3.0,将多个 episode 打包进单个文件,并用关系型元数据在 episode 级别检索信息,解决 v2 每文件单 episode 在百万级数据集下的文件系统瓶颈。
OpenAI 宣布升级 Codex,使其更快、更可靠,并更擅长实时协作和独立处理任务。升级后的 Codex 可在终端、IDE、网页乃至手机上使用。
推荐理由:Codex 在速度、可靠性和实时协作上的升级,读者可据此判断终端、IDE、网页与手机端编码体验的变化。
OpenAI 基于迄今规模最大的 ChatGPT 使用研究,展示了该工具如何在个人与职业场景中创造经济价值。研究显示,ChatGPT 的用户群体正从早期用户向更广泛人群扩展,逐步缩小使用差距,让 AI 融入日常生活。
OpenAI 发布 GPT-5 系统卡增补,介绍新模型 GPT-5-Codex,这是 GPT-5 针对 Codex 中智能体编码进一步优化的版本。GPT-5-Codex 会根据任务复杂度更动态地调整思考投入,对简单对话查询或小任务快速响应,对更复杂任务则独立工作更长时间。
推荐理由:GPT-5 系统卡增补披露了面向 Codex 智能体编码优化的 GPT-5-Codex,可了解其动态思考机制。