跳到正文

全部动态

今日 0 条
7月16日周四
7月15日周三
  1. Hugging Face Blog82

    Thinking Machines 发布 1T 参数多模态开源模型 Inkling 及 Inkling-Small

    Thinking Machines Lab 在 Hugging Face 发布多模态开源模型 Inkling,采用 decoder-only MoE 架构,975B 总参数、41B 激活参数,支持图像、音频、文本输入和 1M 上下文,训练数据为 45 万亿 token。

    推荐理由:Inkling 以约 1T 参数、1M 上下文原生接收图像音频文本,并给出各推理引擎的部署配置与基准对比。

7月14日周二
7月13日周一
7月10日周五
7月9日周四
  1. OpenAI News60

    GPT-5.6 成为 Microsoft 365 Copilot 首选模型

    OpenAI 宣布 GPT-5.6 成为 Microsoft 365 Copilot 的首选模型,为 Word、Excel、PowerPoint、Chat 和 Cowork 提供更强的 AI 能力,以实现更快、更高质量的工作。

    推荐理由:OpenAI 官方说明 GPT-5.6 成为 Microsoft 365 Copilot 首选模型,读者可了解其在 Word、Excel 等应用中的能力变化。

  2. Mistral AI60

    Mistral Studio 为 Prompts 和 Skills 提供版本化管理系统

    Mistral 宣布 Studio 即日起为 Prompts 和 Skills 提供集中管理系统,每个资产可版本化、指定归属并追溯。Studio 将提示词和技能视为生产资产,提供不可变版本、回滚、分类标签和审计日志,并可通过 SDK 接入 GitHub Actions 触发 CI/CD。技能可作为 MCP 服务器直接从 Studio 调用,生产执行的与版本化的资产保持一致。

    推荐理由:原文给出提示词与技能版本化、归属和审计的具体机制,读者可据此判断企业如何治理 AI 行为。

  3. OpenAI News62

    OpenAI 推出 ChatGPT Work 智能体

    OpenAI 发布 ChatGPT Work,这是一个可在多个应用和文件间执行操作的智能体。它能在需要时为同一项目持续工作数小时,并把一个目标转化为完成的工作成果。

    推荐理由:官方给出 ChatGPT Work 的定位,读者可据此判断智能体跨应用执行任务的能力边界。

7月8日周三
  1. Mistral AI65

    Mistral 发布 Robostral Navigate 具身导航模型

    Mistral AI 发布首个具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、无需 LiDAR 或深度传感器,在 R2R-CE validation unseen 上达到 76.6% 成功率,比最佳单相机方案高 9.7 个百分点,比使用深度或多相机的最佳系统高 4.5 个百分点。

    推荐理由:官方给出单目 RGB 相机在 R2R-CE 上的成绩与训练方法,可对比多传感器方案的成本与效果。

7月7日周二
  1. Berkeley AI Research36

    智能免费之后:面向智能体、由智能体构建的数据系统

    伯克利 EPIC Data Lab 提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不足 $1、部分厂商低于 $0.10,数据系统需应对三大新挑战:为智能体设计的数据系统、运行智能体集群的数据系统、以及由智能体合成的数据系统。在 text-to-SQL 基准上,多智能体尝试同一任务时仅 10-20% 子计划不同,80-90% 子查询存在重复计算。

  2. Hugging Face Blog60

    LeRobot v0.6.0 发布:世界模型策略、奖励模型 API 与六个仿真基准

    LeRobot v0.6.0 发布,围绕机器人学习闭环引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新一批 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT)以及统一奖励模型 API(Robometer、TOPReward)。

    推荐理由:LeRobot v0.6.0 把世界模型策略、奖励模型 API 与六个仿真基准整合进同一套开源工作流,读者可据此判断机器人学习闭环的落地路径。

  3. Hugging Face Blog62

    Hugging Face 与 SkyPilot 联合推出零出网费存储集成

    Hugging Face 与 SkyPilot 联合推出集成,用户可用一个 hf:// URL 和现有 HF_TOKEN 把 Hugging Face Bucket 或任意模型、数据集、Space 仓库挂载进 SkyPilot 任务,并在 20+ 云、Kubernetes、Slurm 和本地集群上运行。

    推荐理由:原文给出 hf:// 挂载方式、免出网费与 Xet 去重的具体机制,读者可据此判断跨云训练存储成本的变化。

7月6日周一
  1. Hugging Face Blog22

    PRX Part 4:Hugging Face 的数据策略

    Hugging Face 在 PRX 系列第四篇中披露其数据策略:预训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像长描述,再转为可流式训练的语料。团队将文本编码器从 T5Gemma 换成 Qwen3-VL 并改为训练时实时计算文本 latent,实测吞吐损失约 3–4%(30 天训练约多 1 天)。图像统一以 JPEG quality 92 编码,实测首次重编码几乎不可察觉。

7月3日周五
  1. Google DeepMind32

    Google DeepMind 与 A24 宣布首个研究型合作伙伴关系

    Google DeepMind 与 A24 宣布达成首个聚焦研究的合作伙伴关系,双方将围绕多个项目展开长期研发协作,让 A24 及其电影人参与塑造新技术。Google 同时已对 A24 进行投资。该合作初期聚焦弥合前沿技术与下一代娱乐之间的差距,具体目标与技术产出将随时间演进。

7月1日周三
  1. Berkeley AI Research12

    2026 届 BAIR 博士毕业展示:从机器人到 LLM 推理的 AI 研究全景

    伯克利人工智能研究实验室(BAIR)公布 2026 届博士毕业生名单,研究方向覆盖机器人、具身智能、大语言模型与推理、计算机视觉、生成模型、AI 安全、人机交互及 AI for Science 与医疗。毕业生去向包括 Physical Intelligence、OpenAI、Mistral AI、Amazon 等机构,以及 UCLA、芝加哥大学教职和自主创业。

  2. Google DeepMind78

    Google DeepMind 发布 Nano Banana 2 Lite 与 Gemini Omni Flash

    Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款模型,前者是 Nano Banana 家族中速度最快、成本最低的图像模型,后者支持高质量视频生成与对话式编辑。

    推荐理由:Google DeepMind 同时放出图像与视频两款新模型,并给出延迟、单价和可用入口,便于开发者评估替换与串联方案。