Devin Mobile 开启 beta 测试,可加入等待名单
Cognition 的 Devin Mobile 已开启 beta 测试,用户可通过链接加入等待名单。该版本让 Devin 智能体在手机上运行,评论区大量用户追问是否支持 Android,目前信息显示仅限 iOS。
Cognition 的 Devin Mobile 已开启 beta 测试,用户可通过链接加入等待名单。该版本让 Devin 智能体在手机上运行,评论区大量用户追问是否支持 Android,目前信息显示仅限 iOS。
Cognition 上线 Devin Mobile 并开放等待名单,用户可通过 devin.ai/ios 加入。该页面为 Devin 移动端入口,目前尚未公布具体功能与发布时间。
有人用 Tavily 抓取 arXiv 最近 7 天论文,再由部署在 Nebius Token Factory 上的 NVIDIA Nemotron 3 Ultra 阅读排序,约 10 秒就在终端拿到本周智能体记忆方向 Top 5 论文。
前 Twitter CEO、Parallel 创始人 Parag Agrawal 判断智能体频繁使用网络会重塑搜索成本,主张搜索先筛掉无关信息以节省模型推理开销,并按智能体获益向内容所有者付费。
Runway 本月早些时候推出 GWM Worlds 2 研究预览,把高保真视频与音频生成变成实时交互式模拟,并新增 WorldPrompt 输入格式,可固定环境部分要素(含首帧)并生成带时间戳的事件。
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,解码速度在设备端最高提升 3.13x、H100 上最高 2.66x,端到端最高提升 2.62x 和 2.27x。该草稿模型约 280M 参数,仅增加 8.9% 参数量,首日支持 llama.cpp、MLX-VLM 和 SGLang,输出质量不变。
Remedy Entertainment 的 CONTROL Resonant 已在发售当日上线 GeForce NOW,Ultimate 会员可以 GeForce RTX 5080 级性能串流,支持 DLSS 4、光线追踪、NVIDIA Reflex 和最高 5K HDR,无需 100GB 本地安装。
用 MiniMax-H3 构建的更多方式。🐮 很高兴看到模型优化与 AMD 推理工程相结合,为创作者带来更快的反馈循环。⚡️
推出 Rollouts。 Rollouts 先编写监控计划,然后在部署时监控变更。 部署经过验证,回归问题会在用户看到之前被捕捉到。
GitHub Copilot 应用重建了 pull request 视图,以应对包含 2,200 个文件、超百万行改动和 400 多条行内评论的超大 diff。其做法是把文档高度拆成确定性的代码几何与动态评论块两套几何:代码行高提前精确计算,评论高度则延迟测量、按文件与行锚定,避免滚动跳变。
Agent喜欢在工作前后大量阅读以收集上下文,因此优化读取能带来很大差异! 如果你在构建Agent,我强烈推荐阅读这篇(或者把它交给你的Agent,让它实现其中的发现)
微软研究院对移动机器人操作负载做系统性测量,发现把物理AI推理从机器人端侧GPU卸载到边缘或云端GPU,可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软对移动操作机器人推理负载的系统性测量,给出端侧、边缘与云端算力取舍的量化依据。
Google Private AI Compute 团队公布为 Private AI Compute 平台引入私有服务端记忆,让 AI 助手在跨设备场景下保留上下文,同时维持设备端级别的隐私标准。
推荐理由:原文说明了云端持久记忆如何用设备侧密钥与安全隔区实现跨设备连续性,读者可据此理解隐私架构的取舍。
OpenAI 为 GPT-6 改进提示词缓存,带来更高的缓存命中率、新的诊断能力、显式断点以及可降低延迟和成本的控制项。原文未给出具体命中率数字或价格变化。
Simon Willison 发布 llm 0.36。该版本属于其 llm 命令行工具与 Python 库的更新,具体改动原文未列出。
NVIDIA 在加拿大多伦多 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速软件包集合,新增智能体工作流与平台支持,支持 ROS Lyrical 和 Ubuntu 24.04。
推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,并给出可复用的技能与生态伙伴落地案例。
Hugging Face 为 transformers 加入 GGUF 支持,可直接用 from_pretrained 加载 Hub 上的量化 checkpoint 并在本地生成,目前聚焦 Apple Silicon 与 Qwen3.5 架构。
推荐理由:原文给出在 transformers 中直接加载 GGUF 的用法与 Apple Silicon 上的实测对比,可据此判断本地推理工作流是否值得迁移。
TypeSafe AI 发布 Jev,这是其称为 System One 的新类别模型,输入文本后不输出文本,而是返回类别、是/否判断、评分及对应置信度的浮点数。
NVIDIA 推出 DSX Ready 认证计划,用于评估合作伙伴产品是否符合 NVIDIA DSX AI 工厂参考设计要求,首批覆盖电池储能系统(BESS)和冷却分配单元(CDU)两类。
NVIDIA 推出 Halos,称其为首个也是唯一面向物理 AI 的全栈安全系统,覆盖设计、验证与部署各层。
NVIDIA 在埃及大埃及博物馆举办 AI 生态活动,埃及的 NVIDIA Deep Learning Institute 学员规模一年内增长超十倍。Hassan Allam Utilities 与 A15 将开发新数据中心,投资约 4 亿美元;Cassava 与 Vodafone Egypt 宣布 AI factory 计划,通过 GPU-as-a-service 提供本地托管 AI 基础设施。
NVIDIA 提出 AI 安全应作为工程问题处理,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。其开源安全运行时 NVIDIA OpenShell 在智能体之外强制执行策略并提供沙箱化执行,Cisco DefenseClaw 在其上增加治理层,JFrog 则集成 OpenShell 扫描和验证智能体技能。
NVIDIA 在纽约气候周重点介绍了 5 家用 AI 推进清洁能源的公司:ThinkLabs AI 用数字孪生和智能体把南加州爱迪生评估电网并网申请的时间从 30-45 天缩短到 2 分钟。
Hugging Face 发布 tokenizers v1 候选版,输出与 v0.23 完全一致的 token ID,但速度常快数十倍。v1 将单个 crate 拆为 workspace,用 bitcannon 以 SIMD 位流替代正则做预分词,并引入无分配 merge 循环、线程本地 word cache 和原生多线程并行。
我们希望构建一个推理框架,其优化在生效时和因条件变化而失效时都能得到解释。这也是我希望我们更多人在 SGLang Omni 中共同承担的工程实践。
Pawprint Studio 的 Aniimo 本周随发售同步登陆 GeForce NOW,玩家可在云端免去 45GB 下载直接游玩这款开放世界捉宠 RPG。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体编写了大部分代码,跨 128 个 PR 增量落地,性能提升数个数量级。
推荐理由:GitHub 工程师复盘用 Copilot 把运行时从 TypeScript 迁到 Rust 的全过程,含提示缓存、子智能体分工等可迁移的工程经验。
NVIDIA 在 MLPerf Inference v6.1 中首次提交 Vera Rubin NVL72 预览结果,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。
推荐理由:MLPerf Inference v6.1 首次提交数据给出了 Vera Rubin NVL72 相对 GB300 NVL72 的吞吐提升与 99% 扩展效率,可作为推理基础设施选型的参考。
Mistral 与 Mozilla 达成合作,Firefox 的 AI 浏览助手 Smart Window(beta)现由 Mistral 模型驱动,率先面向法国和北美用户,英国和德国预计今年晚些时候跟进。双方称对话默认不保存在 Mozilla 服务器上,Mistral 同意零数据保留,并按地区语言、方言和文化语境微调模型。
OpenAI 介绍如何用 ChatGPT Work 和 Codex 的分析功能,帮助团队了解 AI 使用量与支出、识别培训需求,并把采用情况与业务成果关联起来。
GitHub 日本和韩国营销负责人用 GitHub Copilot 把活动运营自动化:以 GitHub Issue 为工作单元,Issue forms 收集活动字段、Labels 触发 GitHub Actions 工作流,活动从单个 Issue 自动搭建、每日自动筛选报名者并在结束后自动清理。