跳到正文

#数据/训练

今日 3 条
今天10月11日周日
  1. natolambert42

    Nathan Lambert 表示正为 Mercor 提供建议,推动构建可扩展的 RL 高效样本数据生成方法,并强调需推进评测科学、针对高经济价值领域打造专用 benchmark。他预测前沿实验室周边将出现围绕开放推理、开放后训练与数据的重大投资,聚焦真实世界代表性评测与合成数据方法。他认为这将让更广泛经济领域首次"感受到 AGI",且开源模型是重要机会。

10月10日周六
10月9日周五
10月8日周四
10月7日周三
  1. fchollet47

    Francois Chollet 提出假设:AI 的"锯齿状前沿"可能主要集中在数学与代码,可通过 RLVR 无限推进,而其他领域因受限于人类生成数据将趋于平台期。他指出非可验证领域的模型性能虽仍在稳步提升,但远慢于数学与代码,其提升究竟源于 RLVR 带来的更高 G,还是仅取决于持续注入的新人类数据,尚无定论。这一问题的答案将影响 AI 发展的诸多判断。

10月5日周一
  1. rohanpaul_ai55

    Rohan Paul 转发微软 AI CEO Mustafa Suleyman 在《The Rest Is Politics: Leading》播客中的观点:千亿美元级训练即将到来,正在汇集的算力达数吉瓦,而参与竞争的实验室只有 5 到 6 家。他判断算力与测试时扩展(test time scaling)将构成显著优势,大型实验室的大规模投入会出现极端加速。完整视频发布在该播客的 YouTube 频道。

  2. socialcapital45

    Satya Nadella 称租用 AI 模型"本质上为智能付两次费":一次是 token 费用,另一次是为让模型有用而必须透露的专有知识。他指出这构成"学习循环"——每次提示词和纠正都在捕获企业 know-how,闭源模型提供商会将这些信息蒸馏留存。OpenAI 已有先例:推出选择加入计划,某些模型每天最多给账号 100 万免费 token,换取该流量的训练权。

  3. rohanpaul_ai61

    作者指出个人智能体的记忆并非越多越好,相关笔记超过一定长度后反而会让智能体漏掉规则,建议凡是需要计数或追踪的事项改用代码实现,记忆保持简短。文中给出数据:对于持续累加的消费总额,仅用文字规则时失败率达 44%,改用代码维护则失败 0%;在 Claude Haiku 4.5 上,无记忆时违规率 77%,10 行记忆降到 20%,记忆更长后又升至约 25%。

    推荐理由:编辑精选:对个人智能体设计有直接参考价值,区分适合用记忆表达的偏好与应由代码维护的状态,并给出记忆长度的实验对比。结论限于文中测试条件。

10月4日周日
10月3日周六
10月2日周五
9月29日周二
9月24日周四
  1. Latent Space36

    Foundries 与 Navigators:AI 如何降低科学研究的成本

    在 AI x Science 领域,Foundries 通过新一代测序、多重检测和物理自动化将实验数据生成速度提升一个数量级,而 Navigators 则把 AI 嵌入公司日常流程以加速决策。Endura Therapeutics 的实践显示,实验分析从一周缩短到一小时,原本需六位数授权的软件变成一天即可自建,疾病项目候选评估从 5 个扩展到 500 个。

9月23日周三
9月22日周二
8月25日周二
8月14日周五
8月10日周一
  1. Import AI32

    Import AI 468:23 条 RSI 政策建议、PostTrainBench+,以及信任与透明度如何影响 AI 竞赛

    Import AI 第 468 期汇总了智库 IFP 提出的 23 条"低后悔"政策建议,分属 7 个类别,用于应对 AI 研发自动化带来的风险。MIT 与 Columbia 的论文《Racing to Ruin》分析称,竞争对手间实现协调减速取决于技术开发的透明度与对彼此可信度的判断:低信任下所有均衡都奔向灾难,高信任下两家理性企业永远竞赛的概率随理性先验比值平方衰减。

7月30日周四
7月7日周二
  1. Berkeley AI Research36

    智能免费之后:面向智能体、由智能体构建的数据系统

    伯克利 EPIC Data Lab 提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不足 $1、部分厂商低于 $0.10,数据系统需应对三大新挑战:为智能体设计的数据系统、运行智能体集群的数据系统、以及由智能体合成的数据系统。在 text-to-SQL 基准上,多智能体尝试同一任务时仅 10-20% 子计划不同,80-90% 子查询存在重复计算。

6月30日周二
5月4日周一
1月27日周二
10月29日周三
  1. Hugging Face Blog62

    Hugging Face 分析全球算力格局变迁:中国国产芯片与开源模型的双向推动

    Hugging Face 发布分析文章,指出中国开源权重模型的推理已开始由华为昇腾、寒武纪等国产芯片承载,部分模型开始用国产芯片训练。文章认为美国出口管制与中国芯片产能提速高度相关,芯片稀缺也促使 DeepSeek 的 MLA、GRPO 等算力效率创新走向开源。

    推荐理由:梳理中国算力从被限制到自建全栈的路径,帮助读者理解开源模型与国产芯片如何互相推动。

6月24日周一
  1. Hugging Face Blog20

    Hugging Face 伦理与社会通讯 #6:构建更好的 AI,数据质量为何至关重要

    Hugging Face 发布《伦理与社会通讯 #6》,聚焦高质量数据对 AI 模型的决定性作用,指出好数据不只是准确或量大,而是契合具体用途。文章以 Reddit 与 Google 的 RAG 搜索合作为例,说明低质数据曾导致“在披萨里加胶水”这类荒谬推荐。文中列出相关性、全面性、时效性与偏见缓解等数据质量维度,并强调数据治理、去重、内容过滤与人工反馈等流程。

5月17日周二