跳到正文

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

最新精选

第 61–80 条 · 共 95 条
7月24日周三
  1. Mistral AI78

    Mistral AI 发布 Mistral Large 2,123B 参数、128k 上下文

    Mistral AI 发布 Mistral Large 2,参数规模 123B,支持 128k 上下文窗口和数十种语言,可在单节点上以较大吞吐运行。官方称其在 MMLU 上准确率达 84.0%,代码与推理表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当,并针对减少幻觉和遵循精确指令做了训练。

    推荐理由:原文给出 123B 参数、128k 上下文与多项基准对比,可据此判断单节点部署的成本与能力边界。

7月23日周二
  1. Hugging Face Blog87

    Llama 3.1 发布:8B、70B、405B 三尺寸,支持 128K 上下文与多语言

    Meta 发布 Llama 3.1 系列,包含 8B、70B、405B 三个尺寸的 base 与 instruct 版本共六个开放权重模型,均支持 128K token 上下文和英语、德语、法语、意大利语、葡萄牙语、印地语、西班牙语、泰语 8 种语言,并新增工具调用能力。

    推荐理由:Hugging Face 官方梳理了 Llama 3.1 三个尺寸的显存需求、量化方案与微调路径,可据此估算部署成本。

7月16日周二
7月11日周四
  1. Hugging Face Blog62

    NuminaMath 如何赢得首届 AIMO 进步奖

    Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AIMO 进步奖,在私有测试集 50 题中解出 29 题。方案基于 DeepSeekMath-Base 7B 做两阶段微调,先学自然语言链式推理,再用 GPT-4 生成的工具集成推理数据训练模型调用 Python REPL。

    推荐理由:NuminaMath 团队复盘了夺冠方案的两阶段微调、SC-TIR 解码与内部验证集设计,可供做数学推理微调的人参考。

6月27日周四
6月5日周三
4月18日周四
  1. Hugging Face Blog80

    Meta 发布 Llama 3 开源大模型,Hugging Face 同步集成

    Meta 发布 Llama 3 系列开源大模型,包含 8B 和 70B 两个尺寸,各有 base 与 instruct 版本,并推出基于 Llama 3 8B 微调的安全模型 Llama Guard 2,全部 5 个模型已上线 Hugging Face Hub。

    推荐理由:Meta 发布 Llama 3 并同步接入 Hugging Face 生态,读者可了解新分词器、GQA 与 15T token 训练带来的变化。

3月22日周五
  1. Hugging Face Blog62

    Hugging Face 详解嵌入向量二值与标量量化:检索更快更省

    Hugging Face 博客介绍嵌入向量的二值(binary)与标量(int8)量化,用于降低检索的内存、磁盘占用与成本。二值量化把 float32 值转为 1-bit,内存和存储减少 32 倍,配合 rescoring 可保留约 96% 的检索性能;int8 量化缩小 4 倍,平均带来 3.66 倍检索加速,二值量化平均加速 24.76 倍。

    推荐理由:原文给出二值与标量量化的实测数据与可复用脚本,读者可据此评估检索成本与性能的取舍。

3月20日周三
  1. Hugging Face Blog60

    Hugging Face 解读 GaLore:在消费级硬件上训练大模型

    Hugging Face 博客介绍 GaLore 方法,通过将梯度投影到低秩子空间,可在 NVIDIA RTX 4090 等消费级 GPU 上训练最高 7B 参数的 Llama 架构模型,作者报告优化器状态存储内存减少超过 82.5%。

    推荐理由:原文给出 GaLore 在消费级 GPU 上训练 7B 模型的内存节省数据与 transformers 接入方式,便于评估落地成本。

  2. Hugging Face Blog62

    Hugging Face 发布 Cosmopedia:用 Mixtral 生成 250 亿 token 合成预训练数据

    Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成预训练数据集,包含超 3000 万个文件、250 亿 token,并开源了端到端流水线代码、数据集和基于它训练的 1B 模型 cosmo-1b。

    推荐理由:原文完整公开了从提示词构建到去污染的合成数据流水线,可据此复现或迁移到自有预训练数据生产。

3月18日周一
2月28日周三
2月15日周四
  1. OpenAI News88

    OpenAI 研究:视频生成模型可作为世界模拟器

    OpenAI 探索在视频数据上大规模训练生成模型,将文本条件扩散模型联合训练于不同时长、分辨率和宽高比的视频与图像,并采用在视频和图像潜码时空 patch 上运行的 Transformer 架构。其最大模型 Sora 能生成一分钟高保真视频,结果提示扩展视频生成模型是构建通用物理世界模拟器的一条可行路径。

    推荐理由:OpenAI 公开了视频生成模型的训练思路,读者可了解扩散模型与 Transformer 如何被用于构建物理世界模拟器。

9月27日周三
8月22日周二
4月25日周二
3月9日周四
11月7日周一
  1. Hugging Face Blog62

    用 Diffusers 和 Dreambooth 训练 Stable Diffusion 的实验与调参建议

    Hugging Face 发布用 Diffusers 的 Dreambooth 脚本微调 Stable Diffusion 的实验总结,指出 Dreambooth 容易过拟合,需要在训练步数和学习率之间找平衡,建议先用低学习率再逐步增加步数。

    推荐理由:Hugging Face 基于多组对照实验给出 Dreambooth 微调 Stable Diffusion 的学习率、步数与先验保留建议,可直接迁移到自己的训练配置。

9月26日周一
8月17日周三