跳到正文

全部动态

今日 7 条
10月23日周三
10月15日周二
10月10日周四
8月13日周二
7月25日周四
7月24日周三
7月18日周四
7月17日周三
7月11日周四
  1. Hugging Face Blog62

    NuminaMath 如何赢得首届 AIMO 进步奖

    Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AIMO 进步奖,在私有测试集 50 题中解出 29 题。方案基于 DeepSeekMath-Base 7B 做两阶段微调,先学自然语言链式推理,再用 GPT-4 生成的工具集成推理数据训练模型调用 Python REPL。

    推荐理由:NuminaMath 团队复盘了夺冠方案的两阶段微调、SC-TIR 解码与内部验证集设计,可供做数学推理微调的人参考。

7月1日周一
  1. Hugging Face Blog60

    Hugging Face 的 Transformers Code Agent 登顶 GAIA 基准

    Hugging Face 用 Transformers Agents 构建的 Code Agent 在 GAIA 基准验证集上取得 44.2%,排名第一,比第二名高 4 分;测试集得分 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。

    推荐理由:原文公开了 Code Agent 在 GAIA 上的完整实现细节与得分,可据此了解代码动作相对 动作的取舍。

6月27日周四
6月20日周四
6月18日周二
6月6日周四
5月24日周五
  1. Hugging Face Blog43

    Meta 发布 CyberSecEval 2:大语言模型网络安全风险与能力评估框架

    Meta 推出 CyberSecEval 2,从代码解释器滥用、攻击性网络安全能力和提示注入攻击三方面评估 LLM 的网络安全风险。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率已从 52% 降至 28%。测试显示提示注入仍是未解难题,LLM 目前也难以可靠完成端到端漏洞利用挑战。

5月14日周二
5月5日周日
4月23日周二
4月22日周一
4月20日周六
4月19日周五
4月16日周二
3月20日周三
  1. Hugging Face Blog62

    Hugging Face 发布 Cosmopedia:用 Mixtral 生成 250 亿 token 合成预训练数据

    Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成预训练数据集,包含超 3000 万个文件、250 亿 token,并开源了端到端流水线代码、数据集和基于它训练的 1B 模型 cosmo-1b。

    推荐理由:原文完整公开了从提示词构建到去污染的合成数据流水线,可据此复现或迁移到自有预训练数据生产。

3月15日周五
  1. Hugging Face Blog41

    Hugging Face 发布 WebSight 数据集,用截图生成 HTML 代码

    Hugging Face 推出 WebSight 数据集,用于训练 AI 将网页截图转换为 HTML 代码。该数据集从 v0.1 的 82.3 万对 HTML 与截图样本扩展至 v0.2 的 200 万例,改用真实图像截图并切换至 Tailwind CSS。基于该数据集微调的视觉语言模型 Sightseer 可将网页截图转为可用的 HTML 代码,并能在生成结果中嵌入与原截图相近的图像。

3月5日周二
2月15日周四
  1. OpenAI News88

    OpenAI 研究:视频生成模型可作为世界模拟器

    OpenAI 探索在视频数据上大规模训练生成模型,将文本条件扩散模型联合训练于不同时长、分辨率和宽高比的视频与图像,并采用在视频和图像潜码时空 patch 上运行的 Transformer 架构。其最大模型 Sora 能生成一分钟高保真视频,结果提示扩展视频生成模型是构建通用物理世界模拟器的一条可行路径。

    推荐理由:OpenAI 公开了视频生成模型的训练思路,读者可了解扩散模型与 Transformer 如何被用于构建物理世界模拟器。

1月31日周三
12月14日周四
5月31日周三
  1. OpenAI News62

    OpenAI 用过程监督提升数学模型推理能力

    OpenAI 训练了一个模型,通过奖励推理的每个正确步骤(过程监督)而非只奖励最终正确答案(结果监督),在数学问题求解上取得新的 SOTA。相比结果监督,过程监督除了提升性能,还带来对齐上的好处,即直接训练模型产出被人类认可的链式推理。

    推荐理由:OpenAI 用过程监督替代结果监督训练数学模型,并说明这一方式在链式推理对齐上的作用。

5月9日周二
3月17日周五
1月11日周三
  1. OpenAI News38

    OpenAI 与乔治城大学、斯坦福互联网天文台联合研究:语言模型如何被用于虚假信息宣传及如何降低风险

    OpenAI 研究人员与乔治城大学安全与新兴技术中心及斯坦福互联网天文台合作,调查大语言模型可能被滥用于虚假信息宣传的方式。该合作包括 2021 年 10 月汇聚 30 位虚假信息研究者、机器学习专家与政策分析师的工作坊,并最终形成一份基于一年多研究的联合报告。报告梳理了语言模型若被用于增强虚假信息宣传对信息环境构成的威胁,并提出了分析潜在缓解措施的框架。

10月19日周三
9月26日周一
6月23日周四
  1. OpenAI News70

    OpenAI 用视频预训练让神经网络学会玩 Minecraft

    OpenAI 提出 Video PreTraining(VPT)方法,在大量无标注的人类玩 Minecraft 视频数据上训练神经网络,仅使用少量承包商标注数据。经微调后,模型能学会制作钻石工具,这一任务通常需要熟练人类花费 20 多分钟、约 24000 次操作。模型使用键盘按键和鼠标移动这类原生人类交互接口,通用性较强,是迈向通用计算机使用智能体的一步。

    推荐理由:OpenAI 用少量标注数据加海量无标注视频训练出能玩 Minecraft 的模型,可了解视频预训练这条路径的早期做法。

6月13日周一
5月23日周一
4月13日周三