OpenAI 简化并稳定连续时间一致性模型,两步采样媲美扩散模型
OpenAI 简化、稳定并扩展了连续时间一致性模型,仅用两步采样即可达到与领先扩散模型相当的样本质量。
OpenAI 简化、稳定并扩展了连续时间一致性模型,仅用两步采样即可达到与领先扩散模型相当的样本质量。
OpenAI 分析了 ChatGPT 如何根据用户姓名做出不同回应,并借助 AI 研究助手来保护隐私。
OpenAI 推出 MLE-bench,用于衡量 AI 智能体在机器学习工程任务上的表现。该基准聚焦智能体完成机器学习工程的能力评估。
OpenAI 发布 SWE-bench 的人工校验子集 SWE-bench Verified,用于更可靠地评估 AI 模型解决真实软件问题的能力。
推荐理由:OpenAI 发布经人工校验的 SWE-bench 子集,可用于比较模型解决真实软件问题的能力。
Hugging Face 提出 LAVE(LLM-Assisted VQA Evaluation)指标,用 Llama-2-Chat-7b 以 1-3 分制对候选答案打分,在 Docmatix 的 200 张图像子集上评估 MPLUGDocOwl1.5 的零样本表现。
OpenAI 开发并应用了一种基于规则的奖励(RBRs)新方法,让模型在无需大量人工数据采集的情况下学会安全行为并对齐。该方法旨在改善模型的安全行为表现。
Hugging Face 发布 Docmatix,一个包含 240 万张图像、950 万问答对(源自 130 万份 PDF)的文档视觉问答数据集,规模是此前数据集的 240 倍。
OpenAI 提出用证明者-验证者博弈(Prover-Verifier Games)提升语言模型输出的可读性,让 AI 给出的解答更清晰、更易被验证。该方法旨在使模型输出对人类和机器都更可信。
Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AIMO 进步奖,在私有测试集 50 题中解出 29 题。方案基于 DeepSeekMath-Base 7B 做两阶段微调,先学自然语言链式推理,再用 GPT-4 生成的工具集成推理数据训练模型调用 Python REPL。
推荐理由:NuminaMath 团队复盘了夺冠方案的两阶段微调、SC-TIR 解码与内部验证集设计,可供做数学推理微调的人参考。
Hugging Face 用 Transformers Agents 构建的 Code Agent 在 GAIA 基准验证集上取得 44.2%,排名第一,比第二名高 4 分;测试集得分 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。
推荐理由:原文公开了 Code Agent 在 GAIA 上的完整实现细节与得分,可据此了解代码动作相对 动作的取舍。
OpenAI 发布基于 GPT-4 的模型 CriticGPT,用于对 ChatGPT 的回答撰写批评意见,帮助人类训练员在 RLHF 过程中发现错误。
OpenAI 提出改进的一致性模型训练技术。一致性模型是一类新兴生成模型,无需对抗训练即可一步采样出高质量数据。
OpenAI 提出一套构建稳健自然语言分类系统的整体方法,用于真实场景的内容审核。该系统针对不良内容检测,强调在真实世界中兼顾鲁棒性与实用性。
OpenAI 提出 Consistency Models,可在不依赖迭代采样的情况下实现图像、音频和视频生成,从而解决扩散模型生成速度慢的问题。扩散模型虽推动了这些领域的发展,但其迭代采样过程导致生成缓慢。
Hugging Face 发布 BigCodeBench,一个面向大语言模型代码生成的新基准,包含 1,140 个函数级任务,需调用来自 139 个库的多个函数,每项任务平均含 5.6 个测试用例、分支覆盖率平均 99%。
OpenAI 用可扩展稀疏自编码器的新技术,自动识别出 GPT-4 计算过程中的 1600 万个模式。
Meta 推出 CyberSecEval 2,从代码解释器滥用、攻击性网络安全能力和提示注入攻击三方面评估 LLM 的网络安全风险。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率已从 52% 降至 28%。测试显示提示注入仍是未解难题,LLM 目前也难以可靠完成端到端漏洞利用挑战。
Hugging Face 发布 Open Arabic LLM Leaderboard(OALL),专门评估和比较阿拉伯语 LLM 性能,服务全球超 3.8 亿阿拉伯语使用者。
Hugging Face 发布专为希伯来语设计的开放 LLM 排行榜,填补低资源语言评测空白。榜单包含希伯来语问答、情感准确率、Winograd Schema Challenge 和英希翻译四项基准,采用 few-shot 提示格式评测。
Hugging Face 发布 Open CoT Leaderboard,不评模型绝对准确率,而是对比有无链式推理提示下的准确率差值 Δ。该榜单覆盖 LogiQA、LSAT 等 AGIEval 任务,目前实现 Classic 与 Reflect 两种提示策略,Mixtral-8x7B-Instruct-v0.1 已参与评测。
Hugging Face 发布 JAT(Jack of All Trades),一个基于 GPT-Neo 架构的多模态 Transformer 智能体,用单一网络在 157 项训练任务上达到专家平均性能的 65.8%。
OpenAI 提出"指令层级"方法,训练 LLM 优先执行特权指令,以抵御提示词注入、越狱等攻击。当前 LLM 易被对抗者用恶意提示词覆盖原始指令,该方法旨在让模型区分指令优先级。
Hugging Face 推出 Open Medical-LLM Leaderboard,用统一平台评测大语言模型在医疗任务上的表现,以准确率为主要指标,覆盖 MedQA、MedMCQA、PubMedQA 及 MMLU 医学与生物学子集。
Hugging Face 上线 LiveCodeBench 排行榜,基于 UC Berkeley、MIT 和 Cornell 研究者开发的基准,按题目发布时间窗口评估代码 LLM,以检测和防止数据污染。
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成预训练数据集,包含超 3000 万个文件、250 亿 token,并开源了端到端流水线代码、数据集和基于它训练的 1B 模型 cosmo-1b。
推荐理由:原文完整公开了从提示词构建到去污染的合成数据流水线,可据此复现或迁移到自有预训练数据生产。
Hugging Face 推出 WebSight 数据集,用于训练 AI 将网页截图转换为 HTML 代码。该数据集从 v0.1 的 82.3 万对 HTML 与截图样本扩展至 v0.2 的 200 万例,改用真实图像截图并切换至 Tailwind CSS。基于该数据集微调的视觉语言模型 Sightseer 可将网页截图转为可用的 HTML 代码,并能在生成结果中嵌入与原截图相近的图像。
UCLA 研究者推出 ConTextual,一个面向 LMM 的上下文敏感富文本视觉推理数据集,含 506 条指令,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。
OpenAI 探索在视频数据上大规模训练生成模型,将文本条件扩散模型联合训练于不同时长、分辨率和宽高比的视频与图像,并采用在视频和图像潜码时空 patch 上运行的 Transformer 架构。其最大模型 Sora 能生成一分钟高保真视频,结果提示扩展视频生成模型是构建通用物理世界模拟器的一条可行路径。
推荐理由:OpenAI 公开了视频生成模型的训练思路,读者可了解扩散模型与 Transformer 如何被用于构建物理世界模拟器。
OpenAI 正在构建一套评估框架,用于衡量大语言模型可能协助制造生物威胁的风险。在一项有生物学专家和学生参与的评测中,OpenAI 发现 GPT-4 对生物威胁制造准确率的提升最多只是轻微的。这一提升幅度尚不足以得出确定结论,但该发现是后续研究和社区讨论的起点。
OpenAI 提出"弱到强泛化"这一超级对齐新研究方向,探索能否利用深度学习的泛化特性,用弱监督者控制强模型。该方向已给出初步结果。
OpenAI 训练了一个模型,通过奖励推理的每个正确步骤(过程监督)而非只奖励最终正确答案(结果监督),在数学问题求解上取得新的 SOTA。相比结果监督,过程监督除了提升性能,还带来对齐上的好处,即直接训练模型产出被人类认可的链式推理。
推荐理由:OpenAI 用过程监督替代结果监督训练数学模型,并说明这一方式在链式推理对齐上的作用。
OpenAI 使用 GPT-4 自动为大型语言模型中的神经元行为撰写解释,并对这些解释进行评分。团队公开了覆盖 GPT-2 每个神经元的解释与评分数据集,并说明这些解释并不完美。
OpenAI 发布研究《GPTs are GPTs: An early look at the labor market impact potential of large language models》,探讨大语言模型对劳动力市场的潜在影响。原文正文未能抓取,仅标题可用。
OpenAI 研究人员与乔治城大学安全与新兴技术中心及斯坦福互联网天文台合作,调查大语言模型可能被滥用于虚假信息宣传的方式。该合作包括 2021 年 10 月汇聚 30 位虚假信息研究者、机器学习专家与政策分析师的工作坊,并最终形成一份基于一年多研究的联合报告。报告梳理了语言模型若被用于增强虚假信息宣传对信息环境构成的威胁,并提出了分析潜在缓解措施的框架。
Hugging Face 推出 MTEB(Massive Text Embedding Benchmark),一个覆盖 8 类任务、56 个数据集、最多 112 种语言的文本嵌入模型评测基准,排行榜已汇总超 2000 条结果。用户可通过 `pip install mteb` 对任意嵌入模型进行评测,并将结果提交至公开排行榜。
Hugging Face 与 Intel Labs、UKP Lab 合作推出 SetFit,一个面向 Sentence Transformers 的高效少样本微调框架,无需提示词或 verbaliser。
推荐理由:原文给出 SetFit 的两阶段训练流程与 RAFT 基准对比,读者可了解无提示词少样本分类的实现方式与成本。
OpenAI 提出 Video PreTraining(VPT)方法,在大量无标注的人类玩 Minecraft 视频数据上训练神经网络,仅使用少量承包商标注数据。经微调后,模型能学会制作钻石工具,这一任务通常需要熟练人类花费 20 多分钟、约 24000 次操作。模型使用键盘按键和鼠标移动这类原生人类交互接口,通用性较强,是迈向通用计算机使用智能体的一步。
推荐理由:OpenAI 用少量标注数据加海量无标注视频训练出能玩 Minecraft 的模型,可了解视频预训练这条路径的早期做法。
OpenAI 训练了“批评写作”模型,用于描述摘要中的缺陷。人类评估者在看到模型给出的批评后,发现摘要缺陷的频率明显提高。研究还发现,更大的模型自我批评能力更强,规模对批评写作的提升大于对摘要写作的提升,这为用 AI 系统辅助人类监督 AI 系统提供了可能。
微软提出 TAPEX,通过让 BART 学习执行合成 SQL 查询来实现表格预训练,无需真实标注数据。该方法在 WikiSQL、TabFact、SQA 和 WikiTableQuestions 四个基准上均取得 SOTA,其中 WikiSQL 准确率达 89.6%,WikiTableQuestions 达 57.5%。
OpenAI 发布研究《Hierarchical text-conditional image generation with CLIP latents》,提出一种基于 CLIP latents 的分层文本条件图像生成方法。