跳到正文

全部动态

今日 5 条
3月4日周三
  1. Google DeepMind66

    Google DeepMind 发布 Gemini 3.1 Flash-Lite

    Google DeepMind 推出 Gemini 3.1 Flash-Lite,定位 Gemini 3 系列中速度最快、成本最低的模型,即日起通过 Gemini API 在 Google AI Studio 和 Vertex AI 面向开发者预览。

    推荐理由:官方给出定价、速度与基准数据,读者可据此判断高并发场景下是否值得替换现有模型。

3月3日周二
2月28日周六
2月27日周五
2月26日周四
  1. Hugging Face Blog52

    Hugging Face 详解 transformers 中的 MoE 支持

    Hugging Face 发文介绍 transformers 库如何为 MoE 模型重构支持,涵盖权重加载、专家后端、专家并行与训练四部分。权重加载引入 WeightConverter 与惰性物化,将 256 个独立专家张量打包为单个连续张量;在 Qwen1.5-110B-Chat 上,v5 异步加载耗时 20.71s,v4 为 66.24s,张量并行下为 10.1s。

2月25日周三
2月24日周二
2月23日周一
2月20日周五
2月19日周四
  1. Google DeepMind69

    Gemini 应用上线 Lyria 3 音乐生成,支持文本和图片生成 30 秒曲目

    Google DeepMind 在 Gemini 应用中以 beta 形式上线最新音乐生成模型 Lyria 3,用户用文本或上传图片、视频即可生成带歌词的 30 秒曲目,并配有 Nano Banana 生成的封面图。

    推荐理由:官方披露 Lyria 3 在 Gemini 应用中的生成方式与 SynthID 音频验证能力,可了解音乐生成的产品化路径。

2月18日周三
  1. Hugging Face Blog63

    Hugging Face 介绍 Gradio gr.HTML 单文件构建任意 Web 应用

    Hugging Face 博客介绍 Gradio 6 中 gr.HTML 的新能力,支持自定义模板、作用域 CSS 和 JavaScript 交互,可在单个 Python 文件中完成前端、后端与状态管理,无需构建步骤即可部署到 Hugging Face Spaces。

    推荐理由:原文给出 gr.HTML 的模板、状态同步与子类化写法,读者可据此把自定义组件直接接入现有 Gradio 流程。

  2. Google Research37

    Google 用 MapTrace 合成数据教多模态大模型在地图上寻路

    Google Research 提出 MapTrace,用 Gemini 2.5 Pro 与 Imagen-4 构建全自动合成数据管线,生成 200 万条带路径标注的地图问答对并已开源。该管线经地图生成、Mask Critic 筛选可通行区域、构建像素图、Dijkstra 求最短路加 Path Critic 校验四步,在 23,000 条路径上微调多个 MLLM 以提升细粒度空间推理能力。

2月17日周二
2月13日周五
  1. OpenAI News62

    GPT-5.2 在理论物理中推导出新结果

    OpenAI 发布新预印本,显示 GPT-5.2 为一个胶子振幅提出了新公式,随后由 OpenAI 与学术合作者正式证明并验证。该结果以预印本形式公开。

    推荐理由:OpenAI 与学术合作者披露 GPT-5.2 提出胶子振幅新公式并被形式化证明,可观察大模型参与理论物理推导的路径。

  2. Hugging Face Blog62

    Hugging Face 发布 CUDA 内核 Agent Skill,Claude 与 Codex 为 LTX-Video 和 Qwen3-8B 生成内核

    Hugging Face 发布 cuda-kernels Agent Skill,让 Claude、Codex 等编码智能体为 diffusers 和 transformers 项目编写生产级 CUDA 内核,并生成 PyTorch 绑定与基准脚本。

    推荐理由:原文给出可安装的 CUDA 内核技能与完整基准数据,读者可据此判断智能体写内核的可行边界。

2月12日周四
  1. OpenAI News60

    OpenAI 发布 GPT-5.3-Codex-Spark 实时编码模型

    OpenAI 发布 GPT-5.3-Codex-Spark,称其为首个实时编码模型,生成速度提升 15x,上下文窗口为 128k。该模型目前面向 ChatGPT Pro 用户开放研究预览。

    推荐理由:OpenAI 公布首个实时编码模型的生成速度与上下文规格,可据此了解编码模型在低延迟方向上的进展。

  2. Hugging Face Blog60

    Hugging Face 与 Meta 的 OpenEnv 实践:在真实环境中评测工具调用智能体

    Hugging Face 博客介绍 Meta 与 Hugging Face 合作的开源框架 OpenEnv,它用 gym 风格 API(reset、step、action、observations)和标准 MCP 工具调用接口,把智能体接到浏览器、代码仓库、日历等真实系统而非模拟环境中评测。

    推荐理由:Meta 与 Hugging Face 的 OpenEnv 框架及 Turing 的 Calendar Gym 给出了智能体在真实权限与多步环境下的失败模式数据。

2月11日周三
  1. Google Research31

    Google 开源 DialogLab:编写、模拟与测试动态人-AI 群组对话

    Google Research 在 ACM UIST 2025 发布开源原型框架 DialogLab,用于编写、模拟和测试动态的人-AI 群组对话,将对话的社交设定与时间推进解耦,支持拖拽式场景搭建、实时预览与验证仪表盘。14 名游戏设计、教育和社会科学领域参与者的评测显示,human control 模式在参与度、有效性和真实感上显著优于 autonomous 与 reactive 模式。