OpenAI 为 GPT-6 改进提示词缓存
OpenAI 为 GPT-6 改进提示词缓存,带来更高的缓存命中率、新的诊断能力、显式断点以及可降低延迟和成本的控制项。原文未给出具体命中率数字或价格变化。
OpenAI 为 GPT-6 改进提示词缓存,带来更高的缓存命中率、新的诊断能力、显式断点以及可降低延迟和成本的控制项。原文未给出具体命中率数字或价格变化。
OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,将前沿智能带入日常工作,并在能力与成本之间提供不同的平衡组合。
NVIDIA 在加拿大多伦多 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速软件包集合,新增智能体工作流与平台支持,支持 ROS Lyrical 和 Ubuntu 24.04。
推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,并给出可复用的技能与生态伙伴落地案例。
Parallel 的智能体借助 GPT-6 Astra 完成劳动力市场数据的研究与综合,耗时和成本均降至此前模型的一半。
英国 AI Security Institute(AISI)正通过 EvalEval 的 Evaluation Cards 公开分享评测方法与结果,覆盖 HealthBench。
Hugging Face 为 transformers 加入 GGUF 支持,可直接用 from_pretrained 加载 Hub 上的量化 checkpoint 并在本地生成,目前聚焦 Apple Silicon 与 Qwen3.5 架构。
推荐理由:原文给出在 transformers 中直接加载 GGUF 的用法与 Apple Silicon 上的实测对比,可据此判断本地推理工作流是否值得迁移。
OpenAI 阐述了针对前沿模型与防护措施的第三方 AI 安全评估的优先事项与原则,强调评估需严谨、安全且独立。
oMLX 创作者兼维护者 Jun Kim 加入 Hugging Face,全职投入 MLX 社区建设。oMLX 将保持 Apache 2.0 开源协议并由 Jun 继续领导,从副业项目转为有资金支持的长期项目,以获得更好的稳定性和更快的开发速度。Hugging Face 希望 oMLX 成为新想法的试验场,并推动 transformers 模型定义快速转化为可供不同引擎使用的 MLX 参考实现。
NVIDIA 推出 DSX Ready 认证计划,用于评估合作伙伴产品是否符合 NVIDIA DSX AI 工厂参考设计要求,首批覆盖电池储能系统(BESS)和冷却分配单元(CDU)两类。
NVIDIA 推出 Halos,称其为首个也是唯一面向物理 AI 的全栈安全系统,覆盖设计、验证与部署各层。
NVIDIA 在埃及大埃及博物馆举办 AI 生态活动,埃及的 NVIDIA Deep Learning Institute 学员规模一年内增长超十倍。Hassan Allam Utilities 与 A15 将开发新数据中心,投资约 4 亿美元;Cassava 与 Vodafone Egypt 宣布 AI factory 计划,通过 GPU-as-a-service 提供本地托管 AI 基础设施。
微软研究院在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型用学习式重排序整合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc,在盲测中化学家更偏好其单步反应预测;十个挑战性目标的多步路线中 RetroChimera 成功九个,优于 de novo 模型的五个、编辑模型的四个和 NeuralSym 的两个。
NVIDIA 提出 AI 安全应作为工程问题处理,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。其开源安全运行时 NVIDIA OpenShell 在智能体之外强制执行策略并提供沙箱化执行,Cisco DefenseClaw 在其上增加治理层,JFrog 则集成 OpenShell 扫描和验证智能体技能。
Higgsfield AI 借助 GPT-6 Astra,在一天内上线了新的视频功能,让小型企业更轻松地制作视频广告,并更快将新创意工具推向市场。
OpenAI 正与一个独立的数学与人工智能咨询小组合作,用于指导新兴 AI 成果的评审与传播。该小组为独立性质,具体成员与运作细节未披露。
NVIDIA 在纽约气候周重点介绍了 5 家用 AI 推进清洁能源的公司:ThinkLabs AI 用数字孪生和智能体把南加州爱迪生评估电网并网申请的时间从 30-45 天缩短到 2 分钟。
OpenAI 提出为下一阶段 AI 建立共享全球标准的路径,呼吁通过协调一致的评估、报告与治理来提升安全性。
OpenAI Academy 新增面向员工、开发者、领导者、教育工作者和学生的新学习路径,用于培养和展示实用 AI 技能。
Hugging Face 发布 tokenizers v1 候选版,输出与 v0.23 完全一致的 token ID,但速度常快数十倍。v1 将单个 crate 拆为 workspace,用 bitcannon 以 SIMD 位流替代正则做预分词,并引入无分配 merge 循环、线程本地 word cache 和原生多线程并行。
V7 使用 GPT-5.6 将分散的公司文件转化为智能体可用的上下文,以完成复杂且带来源链接的工作,同时成本降低 78%、准确率提升。
GitHub Podcast 最新一期逐条拆解了五个 AI 热梗:AI 生成的代码仍需人来负责,只是审查力度应按风险分级;Skills 与 MCP 解决的是不同问题,前者是打包好的经验,后者是连接工具与数据的标准;RAG 并未消亡,它让模型从训练数据之外获取文档、内部知识和代码库上下文,检索不佳会浪费 token、拖慢速度并增加答案不完整的概率。
OpenAI 发布澳大利亚青少年安全蓝图,这是一份包含六大支柱的路线图,旨在打造更安全的 AI 体验,以保护和赋能年轻人。
Google Research 发布一项研究实验,让教师借助生成式 UI(GenUI)创建贴合自身课程目标的互动教学模拟,并同步开放 30 多个面向中学 STEM 的英文学习互动样例库,均由 AI 生成、教师审核。
Pawprint Studio 的 Aniimo 本周随发售同步登陆 GeForce NOW,玩家可在云端免去 45GB 下载直接游玩这款开放世界捉宠 RPG。
Cooley 基于 ChatGPT Work 打造了 GO Public,把智能能力引入 IPO 流程,帮助律师更早发现问题并将判断力集中在最关键之处。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体编写了大部分代码,跨 128 个 PR 增量落地,性能提升数个数量级。
推荐理由:GitHub 工程师复盘用 Copilot 把运行时从 TypeScript 迁到 Rust 的全过程,含提示缓存、子智能体分工等可迁移的工程经验。
OpenAI 发布 Astra for Law,将前沿智能引入法律领域,支持律所自定义工作流、连接法律数据源,并提供面向保密客户工作的法律级管控。
OpenAI 发布一套用于追踪、调查和披露模型失准(model misalignment)的框架,并同时公布六份关于模型意外或令人担忧行为的报告。
推荐理由:OpenAI 公开模型失准的追踪与披露框架,并附六份异常行为报告,可了解其安全披露机制。
OpenAI 与 AARP 合作,将在 10 座美国城市为 1,000 名老年人提供免费的 ChatGPT 实操工作坊,帮助他们安全地掌握实用 AI 技能。
NVIDIA 在 MLPerf Inference v6.1 中首次提交 Vera Rubin NVL72 预览结果,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。
推荐理由:MLPerf Inference v6.1 首次提交数据给出了 Vera Rubin NVL72 相对 GB300 NVL72 的吞吐提升与 99% 扩展效率,可作为推理基础设施选型的参考。
OpenAI 推出 AI 驱动的广告新体验,包括 Sponsored Agents 以及面向营销人员的工具,并接入 HubSpot 和 Shopify。
Mistral 与 Mozilla 达成合作,Firefox 的 AI 浏览助手 Smart Window(beta)现由 Mistral 模型驱动,率先面向法国和北美用户,英国和德国预计今年晚些时候跟进。双方称对话默认不保存在 Mozilla 服务器上,Mistral 同意零数据保留,并按地区语言、方言和文化语境微调模型。
Hex 的数据智能体借助 GPT-6 Astra,把分析答案转化为可交互的可视化报告,供员工直接分享。
OpenAI 介绍如何用 ChatGPT Work 和 Codex 的分析功能,帮助团队了解 AI 使用量与支出、识别培训需求,并把采用情况与业务成果关联起来。
OpenAI 新经济研究显示,员工使用 AI 的方式已超出传统岗位职责,部分新活动正成为其工作中的常规环节。该研究聚焦员工实际使用行为,而非预设的岗位分工。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出。
Google DeepMind 发布两款实时对话模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:官方给出两款语音模型的基准成绩与开放渠道,可据此判断实时语音智能体的能力水位与成本取舍。
IBM 研究团队在 ALTK-Evolve 中新增一致性指南(consistency guidelines),基于 Consistency Analyzer 诊断智能体轨迹中易翻转的决策点。
推荐理由:原文用 Pass^k 与 Mean@k 的差距量化智能体不确定性,并给出可复用的诊断与改进流程。
Fyxer 基于 OpenAI 模型、微调与记忆能力,并结合真实用户反馈,打造出能整理收件箱、以用户本人语气起草邮件的 AI 行政助理。
Perplexity 使用 GPT-6 Astra 撰写沟通内容、修改软件并监控生产系统,且相比早期模型,人工检查频率大幅降低。