跳到正文

#部署/工程

今日 0 条
8月6日周四
8月4日周二
  1. Microsoft Research71

    微软研究院开源 Orchard 框架,支持在真实 harness 中训练智能体

    微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可跨任务域复用环境、数据管线和评测流程,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实 harness 中训练智能体。

    推荐理由:Orchard 把环境层做成可复用服务,并公开训练数据与评测方法,读者可据此判断开放智能体训练的成本门槛变化。

8月3日周一
7月30日周四
7月29日周三
7月23日周四
  1. Hugging Face Blog60

    Diffusers 原生支持 Nunchaku 4-bit 扩散推理

    Diffusers 现已原生支持 Nunchaku 的 SVDQuant 4-bit 量化推理,加载 Nunchaku checkpoint 只需调用 from_pretrained(),无需本地编译 CUDA,内核通过 kernels 包从 Hub 下载。

    推荐理由:原文给出 Nunchaku Lite 在 Diffusers 中的加载方式、显存与延迟数据,读者可据此判断消费级 GPU 跑扩散模型的实际收益。

7月22日周三
7月17日周五
7月16日周四
7月10日周五
7月8日周三
7月7日周二
  1. Berkeley AI Research36

    智能免费之后:面向智能体、由智能体构建的数据系统

    伯克利 EPIC Data Lab 提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不足 $1、部分厂商低于 $0.10,数据系统需应对三大新挑战:为智能体设计的数据系统、运行智能体集群的数据系统、以及由智能体合成的数据系统。在 text-to-SQL 基准上,多智能体尝试同一任务时仅 10-20% 子计划不同,80-90% 子查询存在重复计算。

  2. Hugging Face Blog62

    Hugging Face 与 SkyPilot 联合推出零出网费存储集成

    Hugging Face 与 SkyPilot 联合推出集成,用户可用一个 hf:// URL 和现有 HF_TOKEN 把 Hugging Face Bucket 或任意模型、数据集、Space 仓库挂载进 SkyPilot 任务,并在 20+ 云、Kubernetes、Slurm 和本地集群上运行。

    推荐理由:原文给出 hf:// 挂载方式、免出网费与 Xet 去重的具体机制,读者可据此判断跨云训练存储成本的变化。

7月6日周一
6月30日周二
6月26日周五
6月25日周四
  1. Google Research27

    Google 用线性弹性缓存优化云成本,Spanner 内存用量降 15.5%

    Google Research 提出线性弹性缓存,将页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小,在 Spanner 生产环境实测内存用量降低 15.5%、缓存未命中仅增加 5.5%、TCO 降低约 5%。该方案用浅层决策树为每个页面预测 TTL,缓存写满时仍由 LRU 兜底,并在多个公开缓存 trace 上与 GDSF 基线对比验证。

6月24日周三
6月23日周二
  1. Mistral AI62

    Mistral 发布 OCR 4,支持边界框、块分类与置信度分数

    Mistral 发布 OCR 4,在提取文本之外新增边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言,可单容器自托管部署。该模型在 OlmOCRBench 上取得 85.20 分,OmniDocBench 上为 93.07 分,官方称独立标注者在 600 多份文档的盲评中平均偏好率约 72%。

    推荐理由:OCR 4 把文档解析从纯文本扩展到带边界框和块分类的结构化输出,读者可据此判断它是否适合接入现有 RAG 或智能体流程。

  2. Hugging Face Blog62

    Hugging Face 如何用 AI 与开源工具每周发布 huggingface_hub

    Hugging Face 把 huggingface_hub 的发布周期从每 4 到 6 周一次改为每周一次,整套流程跑在单个 GitHub Actions workflow 上,由 OpenCode 驱动开源权重模型(当前为 Z.ai 的 GLM-5.2)起草 release notes 和 Slack 公告。

    推荐理由:原文公开了每周发版的完整工作流与 trust-but-verify 校验循环,可迁移到其他 Python 库的发布流程。

6月22日周一
6月15日周一
6月13日周六
6月11日周四
6月9日周二
6月2日周二
  1. Hugging Face Blog71

    H Company 发布 Holo3.1 系列 Computer Use Agent 模型

    H Company 发布 Holo3.1 系列 Computer Use Agent 模型,基于 Qwen 家族,覆盖 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重。

    推荐理由:原文给出跨环境、跨框架与本地量化部署的具体数据,可据此判断端侧 Computer Use Agent 的落地条件。

6月1日周一
  1. Hugging Face Blog60

    JetBrains 发布 12B MoE 模型 Mellum2,Apache 2.0 开源

    JetBrains 发布 Mellum2,一个从零训练、覆盖自然语言与代码的 12B 参数 MoE 模型,每个 token 仅激活 2.5B 参数,以 Apache 2.0 许可开源。官方称其在相近规模模型中基准表现有竞争力,推理速度超过 2 倍,可用于路由、RAG、摘要、子智能体和高吞吐编码场景。模型已在 Hugging Face 提供下载,技术报告发布在 arXiv(2605.31268)。

    推荐理由:JetBrains 开源 12B MoE 模型,每 token 仅激活 2.5B 参数,读者可据此判断它在多模型系统中的定位。