跳到正文

#部署/工程

今日 24 条
今天10月3日周六
  1. X:AK (@_akhaliq)40

    Volantis 完成 8800 万美元 A 轮融资,用光学方案破解 AI 内存瓶颈

    Volantis 宣布完成 8800 万美元 A 轮融资,用光学技术解决 AI 内存瓶颈,将单芯片内存带宽与容量提升数个数量级,实现大模型(>10T)最高 10,000 tps/user 的超快推理和低 $/tok。该方案初期面向编程智能体,把原本数小时的任务压缩到几分钟甚至几秒,其下一代产品已完成流片,目标刷新相关距离上的带宽密度世界纪录。

  2. X:OpenRouter (@OpenRouter)38

    OpenRouter 推出 Security Center,集中管理 API 密钥风险

    OpenRouter 上线 Security Center,可跨工作区查看全部 API 密钥并按风险标记,支持批量禁用、归档或限额最多 500 个密钥。该功能含 Overview、key safety 和 IP allowlist 三个标签页,风险分组包括无消费限额、无过期时间、90 天以上未使用等,IP allowlist 可限制仅获批 IP 地址访问 API。

  3. X:SemiAnalysis (@SemiAnalysis_)26

    SemiAnalysis Weekly:GPU 是不是印钞机?InferenceX 团队解析 Engram 内存卸载、AgentX 利润计算器、TPU v7 与 Vera Rubin vs. Blackwell

    SemiAnalysis Weekly 新一期由 Jordan Nanos 主持,Cam Quilici、Bryan Shan 和 Alec Ibarra 参与,InferenceX 团队解析了 Engram 内存卸载、AgentX 利润计算器、TPU v7、Vera Rubin 与 Blackwell 的对比,以及更快的 token 是否值得溢价。

10月2日周五
  1. MIT Technology Review · AI12

    以自主 AI 重新定义企业智能

    MIT Technology Review 报告指出,企业 AI 的规模化瓶颈是结构性的,全球 AI 投资 2026 年将达 2.5 万亿美元、同比增长 44%,但多数企业仍未靠 AI 增长收入。报告称领先企业把流程重设计置于模型选型之前,并强调数据就绪而非数据规模,主张以主权、可组合的架构在数据原地查询与准备数据,供 AI 智能体直接行动。

  2. NVIDIA Blog62

    NVIDIA DGX Spark 推出 64GB 版本,10 月 23 日开售 4999 美元起

    NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,10 月 23 日开售,起售价 4999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备本地运行。

    推荐理由:原文给出 64GB 新配置的价格、可跑模型规模与双机集群方式,便于判断本地跑智能体的硬件门槛。

  3. Hugging Face Blog38

    ServiceNow CoreAI 的 AutoSynthData 如何为企业智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败与更强教师的成功来定位能力缺口,并生成、验证新的可执行训练任务,课程随模型进步向仍难的任务迁移。该方法以 EnterpriseOps Gym 数据集演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度要求。

  4. X:MiniMax (@MiniMax_AI)10

    MiniMax 将在 AI Engineer NYC 分享“更快模型的隐藏成本”

    MiniMax 美国业务发展负责人 Morgan Suo 将于 10 月 14 日在 AI Engineer NYC 发表演讲“The Hidden Costs of a Faster Model”,讨论量化、投机解码与推理控制如何改变模型的成本、速度和质量,以及切换模型前需要检查什么。演讲时间为美东时间 10:40–10:58,地点在纽约时代广场喜来登酒店 McCarthy Room。

  5. X:洪明 (@hongming731)22

    BestBlogs 早报 · 10-02:Claude 科研协作、DHH 手写代码、600 美元 PR、LangChain 模型路由、Olmo-core 3、Cohere Embed 5

    LangChain 在 Open SWE 智能体 Harness 内构建模型路由器,按任务分类选择最低成本合适模型,将编码线程中位数成本降低 64% 且质量变化可忽略。Olmo-core 3 面向大规模 MoE 训练,在八块 B300 配置下吞吐量较前代提升 2.7 倍。Cohere 发布 Embed 5 嵌入模型系列,含 Pro 和 Fast 版本,面向搜索与智能体工作流。

  6. AWS Machine Learning Blog34

    Amazon Quick 为 AI 构建应用引入 Live Data in Apps,实时查询受治理数据集

    Amazon Quick 为 AI 构建的应用推出 Live Data in Apps,可在用户每次打开应用时实时查询受治理的 Quick Sight 数据集,取代发布时固化的静态快照。该功能支持 SPICE 与 Direct Query 两种数据集模式,查询以查看者身份执行,自动沿用既有行级与列级安全规则,查看者需为已认证的 Quick 用户并首次按数据集授权。