跳到正文

#部署/工程

今日 6 条
9月28日周一
  1. colintjarvis28

    OpenAI FDE 成员 Luis Velasco 在 HumanX Amsterdam 活动上分享,前沿 AI 转化为可衡量业务影响的关键在于"先让它存在,再规模化",这一原则经 18 个月客户合作验证有效。他指出企业级软件构建原则未变,但治理、编排和评估的基础组件已演进。企业可通过向智能体一致地暴露数据与专用系统,并为高价值工作流收集内部评估数据来直接释放价值。

9月27日周日
9月25日周五
  1. 0xBakeer45

    这周大家都在晒 3、4 台 Spark 集群。这是一台 DGX Spark 为单个用户跑出的成绩,全部在我的机器上实测: 开启 OpenBMB 的 drafter MiniCPM5-2B:100.8 tok/s Qwen3.6-35B-A3B:89.7 Ling-3.0-flash:69.5 Qwen3.8-Flash-Next:55.5 DeepSeek-V4-Flash:47.9(EXL3) Gemma-4-E2B:39.2 Qwen3.8-27B:33.4(EXL3 + DFlash2) Tinfield-1 2-bit:30.7 一次跑一个模型,256 tokens 输入,256 输出

9月24日周四
  1. GitHub Blog · AI & ML22

    GitHub Copilot 应用如何渲染超大 pull request

    GitHub Copilot 应用重建了 pull request 视图,以应对包含 2,200 个文件、超百万行改动和 400 多条行内评论的超大 diff。其做法是把文档高度拆成确定性的代码几何与动态评论块两套几何:代码行高提前精确计算,评论高度则延迟测量、按文件与行锚定,避免滚动跳变。

  2. Microsoft Research60

    微软研究:将物理AI推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动机器人操作负载做系统性测量,发现把物理AI推理从机器人端侧GPU卸载到边缘或云端GPU,可提升任务成功率、支持更大模型并延长续航。

    推荐理由:微软对移动操作机器人推理负载的系统性测量,给出端侧、边缘与云端算力取舍的量化依据。

9月23日周三
9月22日周二
9月21日周一
9月18日周五
9月17日周四
  1. GitHub Blog · AI & ML62

    GitHub 用 Copilot 将 Copilot 运行时迁移到 Rust

    GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体编写了大部分代码,跨 128 个 PR 增量落地,性能提升数个数量级。

    推荐理由:GitHub 工程师复盘用 Copilot 把运行时从 TypeScript 迁到 Rust 的全过程,含提示缓存、子智能体分工等可迁移的工程经验。

9月16日周三
  1. NVIDIA Blog62

    NVIDIA Vera Rubin NVL72 首次亮相 MLPerf Inference v6.1,吞吐最高达 GB300 NVL72 的 3.7 倍

    NVIDIA 在 MLPerf Inference v6.1 中首次提交 Vera Rubin NVL72 预览结果,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。

    推荐理由:MLPerf Inference v6.1 首次提交数据给出了 Vera Rubin NVL72 相对 GB300 NVL72 的吞吐提升与 99% 扩展效率,可作为推理基础设施选型的参考。

9月12日周六