Mistral 为 le Chat 加入联网搜索、Canvas 与图像生成
Mistral AI 为免费生成式 AI 工作助手 le Chat 推出多项 beta 新功能,包括带引用的联网搜索、用于构思与就地编辑和导出的 Canvas、文档与图像理解、图像生成以及可共享的智能体。
推荐理由:官方列出 le Chat 新增能力与免费 beta 范围,读者可据此判断它和现有聊天助手的差异。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
Mistral AI 为免费生成式 AI 工作助手 le Chat 推出多项 beta 新功能,包括带引用的联网搜索、用于构思与就地编辑和导出的 Canvas、文档与图像理解、图像生成以及可共享的智能体。
推荐理由:官方列出 le Chat 新增能力与免费 beta 范围,读者可据此判断它和现有聊天助手的差异。
OpenAI 发布 Realtime API,开发者可将其接入应用,构建快速的语音到语音体验。
推荐理由:OpenAI 开放 Realtime API,开发者可据此判断语音到语音交互的接入方式与适用场景。
OpenAI 在 API 中推出结构化输出(Structured Outputs),模型输出现在可以可靠地遵循开发者提供的 JSON Schema。
推荐理由:OpenAI 在 API 中引入结构化输出,模型输出可稳定遵循开发者提供的 JSON Schema,便于构建可靠的下游流程。
Meta 发布 Llama 3.1 系列,包含 8B、70B、405B 三个尺寸的 base 与 instruct 版本共六个开放权重模型,均支持 128K token 上下文和英语、德语、法语、意大利语、葡萄牙语、印地语、西班牙语、泰语 8 种语言,并新增工具调用能力。
推荐理由:Hugging Face 官方梳理了 Llama 3.1 三个尺寸的显存需求、量化方案与微调路径,可据此估算部署成本。
Hugging Face 用 Transformers Agents 构建的 Code Agent 在 GAIA 基准验证集上取得 44.2%,排名第一,比第二名高 4 分;测试集得分 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。
推荐理由:原文公开了 Code Agent 在 GAIA 上的完整实现细节与得分,可据此了解代码动作相对 动作的取舍。
Hugging Face 发布 Transformers Agents 2.0,在原有 agent 类型之上新增两种可基于历史观察迭代的 agent,并加入社区 agent 分享功能。
推荐理由:官方披露了 Agents 2.0 的模块化设计与 GAIA 榜单成绩,读者可据此判断开源智能体框架的可用边界。
Mistral AI 发布对话助手 le Chat Mistral,作为与 Mistral 各模型交互的对话入口,底层可调用 Mistral Large、Mistral Small 或原型模型 Mistral Next。同时推出面向企业的 le Chat Enterprise,支持自部署和细粒度审核机制,le Chat 目前以 beta 形式开放注册,暂不能联网,可能给出不准确或过时信息。
推荐理由:Mistral 官方给出对话助手的模型选择、企业自部署与审核机制,可据此判断其产品定位。
Mistral AI 开放首个平台服务 La Plateforme 的 beta 访问,提供三个生成文本的 chat 端点和 Mistral-embed 嵌入端点,各端点性能与价格取舍不同。
推荐理由:Mistral AI 开放首个平台服务测试,给出三个生成端点和嵌入端点的模型、价格与基准表现,可据此判断其 API 能力边界。
OpenAI 推出 GPTs,用户现在可以创建自定义版本的 ChatGPT,把指令、额外知识和任意技能组合在一起。
推荐理由:OpenAI 开放自定义 ChatGPT 的入口,读者可据此了解提示词、知识与技能组合的搭建方式。
OpenAI 为 ChatGPT 推出自定义指令功能,用户可设置自己的偏好,ChatGPT 会在之后的所有对话中记住这些偏好。该功能让用户对 ChatGPT 的回复方式拥有更多控制权。
推荐理由:原文给出自定义指令的开放范围与生效方式,读者可据此判断 ChatGPT 个性化设置会如何影响日常对话。
OpenAI 宣布在 ChatGPT 中实现插件的初步支持。插件是专为语言模型设计的工具,以安全为核心原则,可帮助 ChatGPT 获取最新信息、执行计算或使用第三方服务。
推荐理由:OpenAI 为 ChatGPT 引入插件机制,读者可了解语言模型接入实时信息与第三方服务的最初形态。
OpenAI 提出 Video PreTraining(VPT)方法,在大量无标注的人类玩 Minecraft 视频数据上训练神经网络,仅使用少量承包商标注数据。经微调后,模型能学会制作钻石工具,这一任务通常需要熟练人类花费 20 多分钟、约 24000 次操作。模型使用键盘按键和鼠标移动这类原生人类交互接口,通用性较强,是迈向通用计算机使用智能体的一步。
推荐理由:OpenAI 用少量标注数据加海量无标注视频训练出能玩 Minecraft 的模型,可了解视频预训练这条路径的早期做法。
OpenAI 在自建的模拟捉迷藏环境中训练智能体,观察到它们逐步学会使用越来越复杂的工具,并形成六种不同的策略与反策略,其中一些策略是该环境原本未被设计支持的。OpenAI 认为,这种简单环境中自监督涌现出的复杂性,说明多智能体协同适应未来可能产生极其复杂且智能的行为。
推荐理由:OpenAI 在自建捉迷藏模拟环境中观察到智能体自发形成六种策略与反策略,可了解多智能体协同演化的一种研究路径。
OpenAI Five 在与 Blitz、Cap、Fogged、Merlini、MoonMeander 组成的 99.95 百分位 Dota 玩家队伍的三局两胜比赛中获胜,其中四人曾打过职业 Dota。比赛在直播观众面前进行,同时在线观看人数达 10 万。
OpenAI 训练出一个智能体,仅凭单次人类演示就在 Montezuma's Revenge 上取得 74,500 分的高分,优于此前已发表的任何结果。其算法思路是让智能体从演示中精心挑选的状态出发连续进行游戏,并用 PPO 优化游戏得分,PPO 也是支撑 OpenAI Five 的同一强化学习算法。
推荐理由:OpenAI 用单次人类演示让智能体在 Montezuma's Revenge 上取得 74,500 分,可了解其基于 PPO 的简洁训练思路。
OpenAI 宣布其由五个神经网络组成的团队 OpenAI Five 已开始在与 Dota 2 业余人类队伍的对战中取胜。
推荐理由:OpenAI 披露由五个神经网络组成的 OpenAI Five 已能击败业余人类队伍,可了解早期多智能体协作的进展。
OpenAI 创建了一个在标准锦标赛规则下、于 Dota 2 1v1 对战中击败世界顶级职业选手的机器人。该机器人通过自我对弈从零学习游戏,不使用模仿学习或树搜索。OpenAI 称这是朝着构建能在涉及真实人类的混乱复杂情境中完成明确目标的人工智能系统迈出的一步。
推荐理由:OpenAI 用自我对弈从零训练出击败 Dota 2 顶级选手的机器人,读者可了解其不依赖模仿学习与树搜索的训练路径。
OpenAI 发布 Universe,一个用于衡量和训练 AI 通用智能的软件平台,覆盖全球范围内的游戏、网站及其他应用。
推荐理由:OpenAI 官方给出 Universe 的定位与覆盖范围,读者可据此了解这一通用智能训练平台的用途。