OpenAI 如何让团队更快从数百万支持工单中挖掘洞察
OpenAI 的研究助手帮助团队分析数百万条支持工单,更快发现洞察,并在公司内部扩展探索能力。该工具面向团队级洞察场景,用于加速从海量工单数据中提取结论。
OpenAI 的研究助手帮助团队分析数百万条支持工单,更快发现洞察,并在公司内部扩展探索能力。该工具面向团队级洞察场景,用于加速从海量工单数据中提取结论。
NVIDIA 发布首个面向日本的主权 AI 开源合成数据集 Nemotron-Personas-Japan,含 600 万条日语合成人物画像(100 万条记录、每条 6 个画像),总 token 约 14 亿,覆盖约 95 万个独特姓名和 1500 以上职业类别,以 CC BY 4.0 许可开放商用。
OpenAI 推出 GDPval,一项衡量模型在真实世界、具有经济价值任务上表现的新评测,覆盖 44 种职业。该评测聚焦模型在实际工作场景中的可用性,而非传统学术基准。
Hugging Face 发布低代码/无代码框架 SyGra,用于为 LLM 和 SLM 生成、转换与对齐数据集,支持 vLLM、Hugging Face TGI、Triton、Ollama 等多种推理后端。该框架覆盖从 SFT 到 DPO 的偏好对生成、知识库转 Q&A、推理增强、质量过滤及跨语言转换等场景,以 Python 库形式集成到现有 ML 工作流。
Hugging Face 发布 LeRobotDataset v3.0,将多个 episode 打包进单个文件,并用关系型元数据在 episode 级别检索信息,解决 v2 每文件单 episode 在百万级数据集下的文件系统瓶颈。
Hugging Face 官方博客介绍了为支持 OpenAI gpt-oss 系列而在 transformers 中做的一系列升级,包括可从 Hub 下载的零构建内核、MXFP4 量化、张量并行、专家并行、动态滑动窗口缓存、连续批处理与分页注意力,以及更快的模型加载。
Hugging Face 发布 Jupyter Agent 项目,通过生成高质量训练数据并微调 Qwen3-4B,让模型能在 Jupyter Notebook 中执行代码完成数据分析任务。
Hugging Face 发布 mmBERT,一个基于 ModernBERT 架构的多语言编码器模型,在 1800 多种语言、超 3T token 数据上训练,成为首个在性能上超越 XLM-R 的多语言模型。
SandboxAQ 发布 Structurally Augmented IC50 Repository(SAIR),这是目前最大的共折叠 3D 蛋白质-配体结构数据集,包含超 500 万个 AI 生成的高精度结构,每个结构均配有 ChEMBL 或 BindingDB 的实验测定 IC₅₀ 标签。
伯克利 AI 研究团队提出首个可定量预测 word2vec 学习过程的理论,证明在现实训练条件下其学习问题可化简为无权重最小二乘矩阵分解,梯度流动力学有闭式解,最终学到的表示就是 PCA。该理论给出特征向量的显式公式,仅由语料共现统计和超参数决定;从小初始化训练时,word2vec 按离散步骤逐个学习正交线性子空间,每步提升嵌入矩阵的秩并降低损失,理论预测与数值实验高度吻合。
OpenAI 与 Retro Bio 借助专用 AI 模型 GPT-4b micro,设计出用于干细胞疗法和长寿研究的更有效蛋白质。该模型专为生命科学场景打造,双方合作将其应用于蛋白质工程。
NVIDIA 发布 Nemotron Post-Training Dataset V2,将英文推理数据翻译为法语、德语、意大利语、日语和西班牙语五种语言,共 600 万条多语言推理样本。
Mistral 用 LoRA 微调 Pixtral-12B 处理卫星图像分类,在 Aerial Image Dataset(8000 训练样本、2000 测试样本)上显著优于未微调基线,并减少了模型幻觉出的无效类别名。
Mistral AI 与 Carbone 4、法国生态转型署(ADEME)合作完成首个 AI 模型全生命周期分析,并披露 Mistral Large 2 截至 2025 年 1 月的环境影响:训练加 18 个月使用共产生 20.4 ktCO₂e、消耗 281 000 m³ 水和 660 kg Sb eq。
OpenAI 研究了对错误回答的训练如何导致语言模型出现更广泛的失准,并识别出一个驱动该行为的内部特征,该特征可通过极少量微调逆转。材料仅提供摘要,未给出具体方法、模型或实验数据。
Mistral AI 发布 Mistral Compute,提供从裸金属服务器到全托管 PaaS 的私有集成 AI 基础设施栈,涵盖 GPU、编排、API 与产品服务。
推荐理由:Mistral 把自建训练平台对外产品化,读者可了解欧洲主权 AI 基础设施的一种落地路径。
OpenAI 在 API 中上线模型蒸馏功能,开发者可用大型前沿模型的输出微调出高性价比的小模型,全程在 OpenAI 平台完成。
Hugging Face Transformers 新增 DataCollatorWithFlattening,使无 padding 的 packing 训练与 Flash Attention 2 兼容,避免跨样本注意力。
Hugging Face 博客分享了复现 Google Infini-Attention 的失败实验:随着记忆压缩次数增加,模型性能持续下降,团队 90% 时间都在调试收敛问题。
阿布扎比技术创新研究院(TII)发布 Falcon Mamba 7B,采用纯 Mamba 架构并加入额外 RMS 归一化层以保证大规模训练稳定,以 TII Falcon Mamba 7B License 1.0 开放,可在 Hugging Face 生态中使用。
推荐理由:原文给出 Falcon Mamba 的架构取舍、训练数据与两组基准对比,可据此判断无注意力架构在长序列上的位置。
Hugging Face 宣布收购西雅图公司 XetHub,其 12 人团队将加入并帮助 Hub 从 Git LFS 切换到自研的存储与版本管理后端。XetHub 的分块存储与去重技术可让 10GB Parquet 文件只重传新增行所在的少量分块,GGUF 模型文件改一个元数据值也只需重传几 KB。
推荐理由:Hugging Face 收购 XetHub 并计划替换 Git LFS 存储后端,读者可了解 Hub 大文件版本管理将如何变化。
Hugging Face 与 Albumentations AI 合作推出面向文档图像的 TextImage 数据增强管线,可同时修改图像内容与文本标注。该管线支持随机插入、删除、交换及停用词替换等文本增强,并通过黑化与 inpaint 保持文字质量,用于 VLM 微调。代码已开源,可通过 pip install albumentations 使用。
Hugging Face 提出 LAVE(LLM-Assisted VQA Evaluation)指标,用 Llama-2-Chat-7b 以 1-3 分制对候选答案打分,在 Docmatix 的 200 张图像子集上评估 MPLUGDocOwl1.5 的零样本表现。
Mistral AI 发布 Mistral Large 2,参数规模 123B,支持 128k 上下文窗口和数十种语言,可在单节点上以较大吞吐运行。官方称其在 MMLU 上准确率达 84.0%,代码与推理表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当,并针对减少幻觉和遵循精确指令做了训练。
推荐理由:原文给出 123B 参数、128k 上下文与多项基准对比,可据此判断单节点部署的成本与能力边界。
Meta 发布 Llama 3.1 系列,包含 8B、70B、405B 三个尺寸的 base 与 instruct 版本共六个开放权重模型,均支持 128K token 上下文和英语、德语、法语、意大利语、葡萄牙语、印地语、西班牙语、泰语 8 种语言,并新增工具调用能力。
推荐理由:Hugging Face 官方梳理了 Llama 3.1 三个尺寸的显存需求、量化方案与微调路径,可据此估算部署成本。
Hugging Face 发布 Docmatix,一个包含 240 万张图像、950 万问答对(源自 130 万份 PDF)的文档视觉问答数据集,规模是此前数据集的 240 倍。
这篇教程展示了如何用 distilabel 为 Argilla 2.0 构建能理解技术文档的聊天机器人:先从 GitHub 文档生成合成数据集并微调领域专用嵌入模型,再搭建向量数据库存储和检索文档。最终聊天机器人部署在 Hugging Face Space 上,交互记录存入 Argilla 用于持续评估与改进。
Hugging Face 发布 SmolLM 系列小语言模型,包含 135M、360M 和 1.7B 三个参数尺寸,并同步开源训练语料 SmolLM-Corpus。
推荐理由:原文公开了 SmolLM 三个尺寸的训练数据配方与评测对比,可据此判断小模型在端侧的表现边界。
Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AIMO 进步奖,在私有测试集 50 题中解出 29 题。方案基于 DeepSeekMath-Base 7B 做两阶段微调,先学自然语言链式推理,再用 GPT-4 生成的工具集成推理数据训练模型调用 Python REPL。
推荐理由:NuminaMath 团队复盘了夺冠方案的两阶段微调、SC-TIR 解码与内部验证集设计,可供做数学推理微调的人参考。
Hugging Face 的 TRL 库现已支持视觉语言模型(VLM)的直接偏好优化(DPO),并提供了完整训练教程。示例使用 Idefics2-8b 模型和包含超 83,000 条标注的 openbmb/RLAIF-V-Dataset 数据集,该 DPO 实现同时支持 Llava 1.5 和 PaliGemma。
Hugging Face 正在 Dataset Hub 上试验一项基于开源 PII 检测工具 Presidio 的新功能,可为数据集生成 PII 存在情况的估算报告。Presidio 依靠检测模式和机器学习模型识别 PII,报告可帮助开发者在训练前决定是否进一步过滤数据,也便于数据集所有者在上线前验证自己的 PII 过滤流程。
Hugging Face 为 Dataset Hub 的数据集搜索新增按模态、大小、格式和库四项筛选功能,可按文本、图像、音频等模态及最小/最大行数过滤,超过 10B 行的数据集也能被检索到。
Intel 与 MILA 将多模态蛋白质语言模型 ProtST 重新架构并发布在 Hugging Face Hub,借助 Optimum for Intel Gaudi 库可在 Gaudi 2 上以极少代码改动运行。
Google 发布 Gemma 2 系列开源大模型,包含 9B 和 27B 两个尺寸的基座版与指令微调版共 4 个开放权重模型,上下文长度 8K tokens,采用允许商用和再分发的宽松许可。
推荐理由:梳理 Gemma 2 的滑窗注意力、软截断与蒸馏等训练细节,并给出与 Llama 3、Qwen 1.5 的基准对比。
XLSCOUT 发布专有嵌入模型 ParaEmbed 2.0,基于高质量多领域专利数据微调,准确率较 2023 年 10 月发布的 ParaEmbed 1.0 提升 23%。
Hugging Face 发布《伦理与社会通讯 #6》,聚焦高质量数据对 AI 模型的决定性作用,指出好数据不只是准确或量大,而是契合具体用途。文章以 Reddit 与 Google 的 RAG 搜索合作为例,说明低质数据曾导致“在披萨里加胶水”这类荒谬推荐。文中列出相关性、全面性、时效性与偏见缓解等数据质量维度,并强调数据治理、去重、内容过滤与人工反馈等流程。
微软 6 月发布的 Florence-2 视觉语言模型仅有 0.2B 和 0.7B 两种小尺寸,却支持 captioning、目标检测、OCR 等任务,但官方发布的模型不含 VQA 能力。在 DocVQA 上微调 7 个 epoch 后,验证集 Levenshtein 相似度从 0 提升至 57.0,作者同时开源了 Colab notebook、GitHub 代码与演示 Space。
OpenAI 提出改进的一致性模型训练技术。一致性模型是一类新兴生成模型,无需对抗训练即可一步采样出高质量数据。
Hugging Face 与 Argilla 合作的 Data Is Better Together 计划已产出 DIBT/10k_prompts_ranked 数据集,由 385 人参与完成 1 万条合成与人工提示词的质量排序,并被用于训练 SPIN 等新模型。
Hugging Face Accelerate 在 0.30.0 版本中为 FSDP 加入自动 upcasting,使其在混合精度下与 DeepSpeed 行为对齐。