NVIDIA 用 DGX Spark 与 Reachy Mini 搭建桌面智能体教程
NVIDIA 在 CES 2026 发布博客,给出用 DGX Spark 与 Reachy Mini 搭建桌面个人智能体的分步教程,演示代码已开源。
NVIDIA 在 CES 2026 发布博客,给出用 DGX Spark 与 Reachy Mini 搭建桌面个人智能体的分步教程,演示代码已开源。
Transformers v5 重新设计了 tokenizer 的工作方式,将 tokenizer 架构与训练好的词表分离,类似 PyTorch 把网络结构与学习到的权重分开。新设计带来更清晰的内部结构、干净的类层级和单一快速后端,让 tokenizer 可检查、可定制、可从零训练。
Hugging Face 发布教程,展示如何让 OpenAI Codex 借助 Hugging Face Skills 仓库完成端到端模型微调实验。
推荐理由:原文给出可复用的 HF-skills 配置与端到端微调流程,读者可据此把训练实验交给编码智能体执行。
Hugging Face 发布 Hugging Face Skills,其中 hf-llm-trainer 技能让 Claude Code、Codex、Gemini CLI 等编码智能体直接提交云端 GPU 训练任务、监控进度并把模型推送到 Hub。
推荐理由:原文给出 hf-llm-trainer 技能的安装命令与完整训练流程,读者可据此让编码智能体代跑微调任务。
Hugging Face 发布博客,从注意力机制与 KV 缓存出发,推导出 continuous batching 这一推理优化技术。该方法通过并行处理多个对话、完成即换出,来最大化高负载场景下的吞吐量。文中指出注意力是 token 间唯一交互之处,其计算量随序列长度呈平方增长。
Tavily 分享了构建 SOTA 深度研究智能体的经验:七个月前其第一版架构因假设过于复杂,在下一代模型到来时成为瓶颈,团队被迫推倒重建。新方案简化编排逻辑、强调自主性,并借助 Tavily Advanced Search 在工具侧完成上下文工程,只返回最相关内容块以降低模型幻觉与延迟。团队还提出将工具输出蒸馏为反思、仅在生成最终交付物时注入原始信息,以模拟人类研究方式管理上下文窗口。
OpenAI 发布了一场关于 Codex 在软件开发生命周期各阶段应用的网络研讨会。研讨会聚焦于如何将 Codex 融入从规划到交付的完整开发流程,帮助团队在实际工程环节中使用 Codex。
Hugging Face 的 kernels 库支持用 kernel-builder 构建并分享 ROCm 内核,可运行在 AMD GPU 上并集成进 PyTorch。指南以 RadeonFlow 的 FP8 GEMM 内核为例,该内核针对 AMD Instinct MI300X 优化,采用 e4m3fnuz 格式与分块缩放,曾获 AMD Developer Challenge 2025 大奖。
MiniMax 披露 M2 后训练中的智能体对齐经验:智能体需要交错思考(Interleaved Thinking),在任务全程而非开头一次性推理,以应对长上下文和工具输出带来的扰动。
OpenAI 发文详解其 ChatGPT 浏览器 Atlas 背后的新架构 OWL。该架构将 Chromium 解耦,实现快速启动、丰富 UI 以及 ChatGPT 驱动的智能体式浏览。
推荐理由:OpenAI 官方拆解 ChatGPT Atlas 浏览器背后的 OWL 架构,读者可了解其如何解耦 Chromium 并支撑智能体式浏览。
NVIDIA 发布 Isaac for Healthcare v0.4,提供基于 SO-ARM 的端到端入门工作流,覆盖数据采集、训练与真机部署,可构建自主手术辅助机器人。
NVIDIA Isaac for Healthcare v0.4 发布基于 SO-ARM 的端到端入门工作流,覆盖数据采集、GR00T N1.5 后训练与真机部署,可构建自主手术助手机器人。
Hugging Face 提出“语音同意门”机制,让语音克隆模型只有在说话人明确说出同意语句后才会启动。该方案由语言模型生成约 20 词的同意句与中性语音多样性句,经 ASR 识别同意内容后,再由 TTS 完成克隆,并建议同意音频直接来自麦克风而非上传文件。团队已提供示例 Space 和配套代码。
Hugging Face 发布指南,梳理 Chandra、OlmOCR-2、PaddleOCR-VL、DeepSeek-OCR、dots.ocr、Granite-Docling-258M。
推荐理由:梳理了当前开源 OCR 模型的输出格式、基准与本地部署方式,可据此为具体文档场景选型。
Intel 与 Hugging Face 联合测试显示,在搭载 Intel Xeon 6 处理器(Granite Rapids)的 Google Cloud C4 虚拟机上运行 OpenAI GPT OSS 大模型,总拥有成本(TCO)较上一代 C3 实例提升 1.7 倍,即 70%。
Hugging Face 博客给出用 Optimum Intel 和 OpenVINO 在 Intel CPU 上本地运行 SmolVLM2-256M-Video-Instruct 的三步流程:导出 OpenVINO IR、量化、推理。
Hugging Face 发布三部分系列文章,讲述如何将 RedNote 的 3B 参数 OCR 模型 dots.ocr 转换到端侧运行,该模型在 OmniDocBench 上超过 Gemini 2.5 Pro。
Hugging Face 用 OpenVINO.GenAI 在 Intel Core Ultra 上加速 Qwen3-8B 智能体,以 Qwen3-0.6B 作草稿模型做投机解码,生成速度提升约 1.3 倍。
Hugging Face 博客发布 VibeGame,一个基于 three.js、rapier 和 bitecs 构建的高层声明式游戏引擎,专为 AI 辅助游戏开发设计。
Hugging Face 发布低代码/无代码框架 SyGra,用于为 LLM 和 SLM 生成、转换与对齐数据集,支持 vLLM、Hugging Face TGI、Triton、Ollama 等多种推理后端。该框架覆盖从 SFT 到 DPO 的偏好对生成、知识库转 Q&A、推理增强、质量过滤及跨语言转换等场景,以 Python 库形式集成到现有 ML 工作流。
Hugging Face 官方博客介绍了为支持 OpenAI gpt-oss 系列而在 transformers 中做的一系列升级,包括可从 Hub 下载的零构建内核、MXFP4 量化、张量并行、专家并行、动态滑动窗口缓存、连续批处理与分页注意力,以及更快的模型加载。
Hugging Face 介绍如何在 ZeroGPU Spaces 中接入 PyTorch 提前(AoT)编译,让模型只编译一次即可即时重载,在 Flux、Wan、LTX 等模型上获得 1.3×–1.8× 加速。
Hugging Face 介绍如何通过 MCP Server 将 Claude 接入 Hugging Face Spaces 生成图像,可调用 ZeroGPU 驱动的 AI 应用,免费账号即提供使用额度。
Hugging Face 发布 kernel-builder 库,让开发者可在本地开发自定义 CUDA kernel,再针对多种架构构建并发布到 Hugging Face Hub 供他人通过 get_kernel 直接调用。
OpenAI 发布内容介绍如何用 GPT-5 进行编码与设计,称其在编码和设计上带来新的可能性。原文仅提供摘要,未给出具体功能、示例或数据。
Mistral 用 LoRA 微调 Pixtral-12B 处理卫星图像分类,在 Aerial Image Dataset(8000 训练样本、2000 测试样本)上显著优于未微调基线,并减少了模型幻觉出的无效类别名。
Hugging Face 博客发布《Tiny Agents in Python: a MCP-powered agent in ~70 lines of code》,介绍用约 70 行 Python 代码构建一个由 MCP 驱动的智能体。原文正文未能抓取,仅标题可用。
ChatGPT Projects 帮助用户组织文件、保存上下文,并在不同工作流之间保持对话的一致性。该功能让用户在 ChatGPT 中按项目归类管理对话与资料,减少重复交代背景的负担,适合多任务并行的使用场景。
ChatGPT 的 canvas 功能支持从产品需求文档直接生成可运行的 HTML/React 原型。文章演示了利用 canvas 完成这一流程的具体步骤,帮助用户快速将需求转化为可交互的原型代码。
ChatGPT 可以规划调研步骤、搜索并阅读资料来源,最终整理出一份详细的市场分析研究报告。该能力展示了 ChatGPT 在市场调研场景中从规划、检索到成稿的完整工作流,可用于支持市场分析。
Mistral 提出用 LLM as a Judge 配合结构化输出评估 RAG 系统,让"裁判 LLM"按数值、二元或定性量表为"生成 LLM"的答案打分,再对评测数据集取平均得到加权总分。
ChatGPT 可以通过分析背景、生成备选方案并把决策转化为后续步骤来支持战略规划。
Mistral AI 推出 TranscriptToPRDTicket 智能体工作流,由 Mistral Large 2 驱动 PRDAgent 和 TicketCreationAgent,可将会议转录自动生成 PRD 并转化为结构化开发工单,自动在 Linear、Jira 等项目管理工具中创建。
OpenAI 发布指南,介绍如何基于 ChatGPT 构建自定义数学辅导工具。内容围绕 ChatGPT 与个性化辅导展开,展示将其用于数学学习场景的思路。
OpenAI 发布面向产品团队的 AI 应用指南,帮助产品团队把 AI 投入实际工作。内容围绕产品团队的使用场景展开,未披露具体模型版本、功能参数或可用性细节。
OpenAI 发布了从数百个成功部署中总结的 AI 落地经验,为企业提供将 AI 投入实际工作的实践参考。内容聚焦于真实部署案例中的经验教训,帮助企业更顺利地推进 AI 项目落地。
Hugging Face 博客盘点了 Hub 上 5 个常被忽视的工具:ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas。
Hugging Face Transformers 新增 DataCollatorWithFlattening,使无 padding 的 packing 训练与 Flash Attention 2 兼容,避免跨样本注意力。
Hugging Face 发布教程,介绍如何用 TGI 和专用深度学习容器(DLC)在 Google Cloud Vertex AI 的 A3 节点(8 张 H100 GPU)上部署 FP8 量化的 Meta Llama 3.1 405B Instruct。
Hugging Face 博客分享了复现 Google Infini-Attention 的失败实验:随着记忆压缩次数增加,模型性能持续下降,团队 90% 时间都在调试收敛问题。