Liquid AI 发布 LFM2.5-VL-DSpark 草稿模型,加速视觉语言模型推理
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,解码速度在设备端最高提升 3.13x、H100 上最高 2.66x,端到端最高提升 2.62x 和 2.27x。该草稿模型约 280M 参数,仅增加 8.9% 参数量,首日支持 llama.cpp、MLX-VLM 和 SGLang,输出质量不变。
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,解码速度在设备端最高提升 3.13x、H100 上最高 2.66x,端到端最高提升 2.62x 和 2.27x。该草稿模型约 280M 参数,仅增加 8.9% 参数量,首日支持 llama.cpp、MLX-VLM 和 SGLang,输出质量不变。
Remedy Entertainment 的 CONTROL Resonant 已在发售当日上线 GeForce NOW,Ultimate 会员可以 GeForce RTX 5080 级性能串流,支持 DLSS 4、光线追踪、NVIDIA Reflex 和最高 5K HDR,无需 100GB 本地安装。
GitHub Copilot 应用重建了 pull request 视图,以应对包含 2,200 个文件、超百万行改动和 400 多条行内评论的超大 diff。其做法是把文档高度拆成确定性的代码几何与动态评论块两套几何:代码行高提前精确计算,评论高度则延迟测量、按文件与行锚定,避免滚动跳变。
微软研究院对移动机器人操作负载做系统性测量,发现把物理AI推理从机器人端侧GPU卸载到边缘或云端GPU,可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软对移动操作机器人推理负载的系统性测量,给出端侧、边缘与云端算力取舍的量化依据。
Google Private AI Compute 团队公布为 Private AI Compute 平台引入私有服务端记忆,让 AI 助手在跨设备场景下保留上下文,同时维持设备端级别的隐私标准。
推荐理由:原文说明了云端持久记忆如何用设备侧密钥与安全隔区实现跨设备连续性,读者可据此理解隐私架构的取舍。
OpenAI 为 GPT-6 改进提示词缓存,带来更高的缓存命中率、新的诊断能力、显式断点以及可降低延迟和成本的控制项。原文未给出具体命中率数字或价格变化。
NVIDIA 在加拿大多伦多 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速软件包集合,新增智能体工作流与平台支持,支持 ROS Lyrical 和 Ubuntu 24.04。
推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,并给出可复用的技能与生态伙伴落地案例。
Hugging Face 为 transformers 加入 GGUF 支持,可直接用 from_pretrained 加载 Hub 上的量化 checkpoint 并在本地生成,目前聚焦 Apple Silicon 与 Qwen3.5 架构。
推荐理由:原文给出在 transformers 中直接加载 GGUF 的用法与 Apple Silicon 上的实测对比,可据此判断本地推理工作流是否值得迁移。
NVIDIA 推出 DSX Ready 认证计划,用于评估合作伙伴产品是否符合 NVIDIA DSX AI 工厂参考设计要求,首批覆盖电池储能系统(BESS)和冷却分配单元(CDU)两类。
NVIDIA 推出 Halos,称其为首个也是唯一面向物理 AI 的全栈安全系统,覆盖设计、验证与部署各层。
NVIDIA 在埃及大埃及博物馆举办 AI 生态活动,埃及的 NVIDIA Deep Learning Institute 学员规模一年内增长超十倍。Hassan Allam Utilities 与 A15 将开发新数据中心,投资约 4 亿美元;Cassava 与 Vodafone Egypt 宣布 AI factory 计划,通过 GPU-as-a-service 提供本地托管 AI 基础设施。
NVIDIA 提出 AI 安全应作为工程问题处理,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。其开源安全运行时 NVIDIA OpenShell 在智能体之外强制执行策略并提供沙箱化执行,Cisco DefenseClaw 在其上增加治理层,JFrog 则集成 OpenShell 扫描和验证智能体技能。
NVIDIA 在纽约气候周重点介绍了 5 家用 AI 推进清洁能源的公司:ThinkLabs AI 用数字孪生和智能体把南加州爱迪生评估电网并网申请的时间从 30-45 天缩短到 2 分钟。
Hugging Face 发布 tokenizers v1 候选版,输出与 v0.23 完全一致的 token ID,但速度常快数十倍。v1 将单个 crate 拆为 workspace,用 bitcannon 以 SIMD 位流替代正则做预分词,并引入无分配 merge 循环、线程本地 word cache 和原生多线程并行。
Pawprint Studio 的 Aniimo 本周随发售同步登陆 GeForce NOW,玩家可在云端免去 45GB 下载直接游玩这款开放世界捉宠 RPG。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体编写了大部分代码,跨 128 个 PR 增量落地,性能提升数个数量级。
推荐理由:GitHub 工程师复盘用 Copilot 把运行时从 TypeScript 迁到 Rust 的全过程,含提示缓存、子智能体分工等可迁移的工程经验。
NVIDIA 在 MLPerf Inference v6.1 中首次提交 Vera Rubin NVL72 预览结果,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。
推荐理由:MLPerf Inference v6.1 首次提交数据给出了 Vera Rubin NVL72 相对 GB300 NVL72 的吞吐提升与 99% 扩展效率,可作为推理基础设施选型的参考。
Mistral 与 Mozilla 达成合作,Firefox 的 AI 浏览助手 Smart Window(beta)现由 Mistral 模型驱动,率先面向法国和北美用户,英国和德国预计今年晚些时候跟进。双方称对话默认不保存在 Mozilla 服务器上,Mistral 同意零数据保留,并按地区语言、方言和文化语境微调模型。
OpenAI 介绍如何用 ChatGPT Work 和 Codex 的分析功能,帮助团队了解 AI 使用量与支出、识别培训需求,并把采用情况与业务成果关联起来。
GitHub 日本和韩国营销负责人用 GitHub Copilot 把活动运营自动化:以 GitHub Issue 为工作单元,Issue forms 收集活动字段、Labels 触发 GitHub Actions 工作流,活动从单个 Issue 自动搭建、每日自动筛选报名者并在结束后自动清理。
OpenAI 将内部存储系统 Habitat 从 Python 库演进为全球分布式存储平台,支撑超 10 亿 ChatGPT 用户、每秒 2200 万次请求。该平台用于应对 ChatGPT 规模增长带来的在线存储需求。
Mistral 与 Cloudera 达成合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持控制权。企业还能在受控环境中用专有数据训练自有模型,基于开放权重拥有数据和由此产生的智能。Cloudera 平台上客户管理的数据规模达 30 exabytes。
TRL v1.14 的 AsyncGRPOTrainer 现已支持只训练并同步 LoRA adapter 到 vLLM,rank-1 adapter 仅几 MB,可通过挂载在三个 HF Jobs 上的 Storage Bucket 传输,无需 NCCL。
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 迁移至 C++,对象是一个无测试套件、无集中文档的物理密集型油藏模拟器。团队先构建数值一致性校验框架,再用 Vibe CLI 调度上百个智能体解析调用树并生成文档,最终采用人工介入的 coder、tester、reviewer 智能体工作流逐模块迁移。
GitHub 发布 Project HydraFusion 研究预览,在运行时通过多模型编排完成任务,已面向所有 GitHub Copilot 套餐开放,可在 GitHub Copilot CLI 中通过 /experimental 启用。
推荐理由:GitHub 官方披露 HydraFusion 的三种编排模式与三套基准的成本质量对比,可据此判断多模型编排在编码任务上的取舍。
OpenAI 宣布医疗机构可将 EHR 及更多行业数据接入 ChatGPT,让临床医生安全获取患者背景信息与医学研究资料。ChatGPT 由此可连接可信医疗数据,用于临床场景中的信息调取。
澳大利亚律所 Gilbert + Tobin 借助 CEO 主导的投入、严格治理与人工问责机制,在全所范围规模化部署 ChatGPT Enterprise 和 Codex。该案例展示了律所如何在扩展 AI 应用的同时保持人类对结果的负责。
Hugging Face 发布 @huggingface/kernels,一个从 Hugging Face Hub 加载并运行优化 WebGPU kernel 的 JavaScript 库,同时上线 207 个 kernel 的初始集合,均以 Apache-2.0 许可发布在 webgpu-kernels 组织下。
推荐理由:原文给出 207 个 WebGPU kernel 的发布结构、加载方式与对比数据,可据此判断浏览器端推理的优化路径。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密 decoder-only 推理模型家族,包含 3B、8B、30B 三个规模,全部以 Apache 2.0 许可开源。
OpenAI 公布自研推理芯片 Jalapeño 的首批结果,称其在 AI 推理上实现业界领先的速度与能效。该定制芯片面向现代模型提供更高吞吐量和更低延迟,同时更省电。
OpenAI 为 ChatGPT Work 和 Codex 推出 Admin 插件,用于分析工作区用量、管理成员与权限、调整限额并处理管理请求。
Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与 AI 解决方案部署,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型,合作规模达数亿欧元。Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还计划在沙特面向受监管行业制定联合市场策略,以满足对主权 AI 的需求。
Papers with Code 的混合搜索系统用 Hugging Face Jobs 做全量论文嵌入、Storage Buckets 做持久化中转、Inference Endpoints 提供在线查询的低延迟嵌入,目前维护超过 11 万篇来自 arXiv 和 Daily Papers 的论文嵌入。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在 GPU 上最高提升 3.18 倍吞吐、端侧最高 2.87 倍,且不改变输出质量。
推荐理由:Liquid AI 给出三款 LFM2.5 草稿模型的实测吞吐与函数调用延迟数据,可据此判断端侧推理的可用性。
Hugging Face 构建了约束感知的 GPU 分配器,在相同硬件和负载下对比 FIFO 调度器,七个基准场景中 GPU 利用率最高提升 33 个百分点,优先级加权产出最高提升 105%。在五个真实争用场景中,利用率从 52–85% 提升至 72–88%,优先级加权价值平均提升 52%。核心变化不在硬件,而在于分配决策的顺序:实时推理按需求曲线逐时间步分配,批式任务按优先级跨整个调度周期排布。
AWS 开源 SDK Strands Robots(Apache 2.0)演示了机器人数据闭环:用 Robot("so100") 录制 LeRobotDataset 并同步到 Hugging Face Storage Buckets。
OpenAI 预览新的 API 服务层级 Ultrafast,运行 GPT-5.6 Sol 时最高可提速 14 倍。该服务由 Cerebras 提供支持,输出速度最高可达每秒 750 个 token。
RingCentral 借助 ChatGPT Work 和 Codex 加速 AI 产品开发,并在工程与运营之间集中化运营智能。该实践覆盖从工程到运营的 AI 原生工作流程。
Mistral 宣布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键业务负载提供承诺服务等级、自定义速率限制和 uptime SLA。
推荐理由:Mistral 把区域推理端点、优先级服务层与第三方开源模型接入放在同一套基础设施上,读者可据此判断主权 AI 的落地路径。
OpenAI 与 AWS 合作,通过 Amazon Bedrock 提供 Daybreak 网络安全能力,以支持企业安全相关工作流。