跳到正文

#数据/训练

今日 7 条
10月7日周三
  1. fchollet47

    Francois Chollet 提出假设:AI 的"锯齿状前沿"可能主要集中在数学与代码,可通过 RLVR 无限推进,而其他领域因受限于人类生成数据将趋于平台期。他指出非可验证领域的模型性能虽仍在稳步提升,但远慢于数学与代码,其提升究竟源于 RLVR 带来的更高 G,还是仅取决于持续注入的新人类数据,尚无定论。这一问题的答案将影响 AI 发展的诸多判断。

10月6日周二
  1. Google Research61

    Google Earth AI 开放地球人口动力学基础模型用于全球公共卫生研究

    Google Research 介绍以 Earth AI 的 Population Dynamics Foundation Model(PDFM)作为公共卫生领域的行星地理基础模型概念验证,将隐私保护的搜索趋势、人类流动、建成环境密度与环境因素压缩为月度刷新的位置嵌入,无需任务特定微调即可直接接入流行病学现有工作流。

    推荐理由:原文用五个独立合作评估展示了同一组位置嵌入在不同疾病与资源环境下的可迁移性,读者可据此判断地理基础模型在公共卫生工作流中的实际适用边界。

10月5日周一
  1. rohanpaul_ai55

    Rohan Paul 转发微软 AI CEO Mustafa Suleyman 在《The Rest Is Politics: Leading》播客中的观点:千亿美元级训练即将到来,正在汇集的算力达数吉瓦,而参与竞争的实验室只有 5 到 6 家。他判断算力与测试时扩展(test time scaling)将构成显著优势,大型实验室的大规模投入会出现极端加速。完整视频发布在该播客的 YouTube 频道。

  2. socialcapital45

    Satya Nadella 称租用 AI 模型"本质上为智能付两次费":一次是 token 费用,另一次是为让模型有用而必须透露的专有知识。他指出这构成"学习循环"——每次提示词和纠正都在捕获企业 know-how,闭源模型提供商会将这些信息蒸馏留存。OpenAI 已有先例:推出选择加入计划,某些模型每天最多给账号 100 万免费 token,换取该流量的训练权。

  3. rohanpaul_ai61

    作者指出个人智能体的记忆并非越多越好,相关笔记超过一定长度后反而会让智能体漏掉规则,建议凡是需要计数或追踪的事项改用代码实现,记忆保持简短。文中给出数据:对于持续累加的消费总额,仅用文字规则时失败率达 44%,改用代码维护则失败 0%;在 Claude Haiku 4.5 上,无记忆时违规率 77%,10 行记忆降到 20%,记忆更长后又升至约 25%。

    推荐理由:编辑精选:对个人智能体设计有直接参考价值,区分适合用记忆表达的偏好与应由代码维护的状态,并给出记忆长度的实验对比。结论限于文中测试条件。

10月4日周日
  1. TechCrunch · AI38

    AWS CEO 回应数据中心抵制:Amazon 称已不再使用 NDA

    AWS CEO Matt Garman 在博客中表示,Amazon 在与政府机构就数据中心项目合作时已不再使用保密协议(NDA)。他同时反驳数据中心耗水过多、推高电价、污染严重、无益社区四大说法,称数据中心直接用水仅占美国工业用水 0.5%,发电机 99.9% 时间闲置,并称过去三年 Amazon 已向有数据中心布局的美国社区投入超 10 亿美元。

10月3日周六
  1. X:SemiAnalysis (@SemiAnalysis_)39

    SemiAnalysis:定制 HBM 可将 Nvidia Rubin 计算芯片的 HBM4 控制器与 PHY 占用面积减少约 60%

    SemiAnalysis 估算 HBM4 控制器和 PHY 约占 Nvidia Rubin 计算芯片 16% 面积。定制 HBM 用紧凑 D2D 链路替代标准 PHY,Samsung 数据显示其标准 HBM4 PHY 占 8mm x 4mm,定制 D2D 接口仅需 8.5mm x 1.5mm,面积减少约 60%,同时内存控制器从计算芯片移至 HBM base die。

  2. X:SemiAnalysis (@SemiAnalysis_)22

    Johnson Matthey 预测 2026 年钌需求 119.3 万盎司,超过 97.7 万盎司的一次供应

    Johnson Matthey 预计 2026 年钌需求达 119.3 万盎司,而一次供应仅 97.7 万盎司,需求已超过供应。化学品需求预计下降 16%,主因中国尼龙产能过剩,这也解释了价格为何未进一步上涨。电子需求从 2023 年的 30 万盎司增至 2025 年的 41.3 万盎司,2026 年预计达 43.5 万盎司,数据中心扩张将推动硬盘用钌需求创五年新高。

  3. X:Elvis Saravia (@omarsar0, DAIR.AI)38

    Volantis 用光学技术破解 AI 内存瓶颈,目标单用户 10000 tokens/秒推理速度

    Volantis 完成 8800 万美元 A 轮融资,通过光学技术为每颗芯片提供更大容量和更高带宽的内存,目标在超过 10T 参数的模型上实现每用户最高 10000 tokens/秒的推理速度。该方案旨在解决 AI 内存瓶颈,初期可让原本耗时数小时的编程智能体在几分钟甚至几秒内完成。团队曾参与首款 CoWoS 产品、早期 HBM 及首款硅光 CPO 系统等半导体技术研发,下一代产品已完成流片。

  4. X:Elvis Saravia (@omarsar0, DAIR.AI)29

    ProVer:用 LLM 裁判定位关键步骤,改进智能体 RL 的信用分配

    ProVer 提出一种智能体强化学习信用分配方法:由 LLM 裁判对比成功与失败的 rollout,指出造成差异的关键片段,再通过该片段前后采样续写、以成功率变化作为该片段的优势值。在 ALFWorld、WebShop 和 SearchQA 上,相对 GRPO 分别带来 Qwen3.5-2B 9.91%、Qwen3.5-4B 7.12% 的相对提升,裁判换成更小模型时仍有效。

  5. X:Elvis Saravia (@omarsar0, DAIR.AI)30

    Kled V3 发布:72 小时内向 50 万+ 贡献者网络派发数据采集任务

    Kled V3 允许实验室指定所需数据,并在 72 小时内将采集任务部署到其 50 万+ 自愿贡献者网络,覆盖图像、视频、音频、文本和标注的 108 个可配置模板。贡献者用手机按说明和合格示例完成采集,形成"定位模型失败点—转为采集任务—获取真实世界新样本—再训练评估"的更紧反馈闭环。