跳到正文

全部动态

今日 2 条
6月17日周三
  1. Hugging Face Blog82

    智谱发布 GLM-5.2:面向长程任务,支持 1M token 上下文与 MIT 开源

    智谱发布旗舰模型 GLM-5.2,面向长程任务,首次提供稳定的 1M token 上下文,并以 MIT 许可开源。新架构 IndexShare 让每 4 层稀疏注意力共享同一 indexer,在 1M 上下文下将每 token FLOPs 降低 2.9×,改进后的 MTP 层使投机解码接受长度最高提升 20%。

    推荐理由:GLM-5.2 把 1M 上下文与多档思考强度放进开源许可,读者可据此判断长程编码智能体的选型空间。

  2. Hugging Face Blog62

    Hugging Face 发布 Agentic Resource Discovery 参考实现 Discover Tool

    Hugging Face 发布 Agentic Resource Discovery(ARD)规范的参考实现 Discover Tool,让智能体在运行时按自然语言搜索能力,而不再依赖预先安装。

    推荐理由:Hugging Face 给出 ARD 规范的参考实现与 CLI、REST、MCP 三种调用入口,可据此判断智能体能力发现如何从预装目录转向运行时检索。

6月16日周二
6月15日周一
6月13日周六
6月12日周五
6月11日周四
6月10日周三
6月9日周二
  1. Google DeepMind80

    Google DeepMind 发布 Gemini 3.5 Live Translate 实时语音翻译模型

    Google DeepMind 发布 Gemini 3.5 Live Translate,这是一款音频模型,可自动检测 70+ 语言并生成保留说话人语调、节奏和音高的近实时语音到语音翻译,且持续输出而非等说话人说完再翻译,全程仅落后几秒。

    推荐理由:Gemini 3.5 Live Translate 支持 70+ 语言连续语音翻译,并同步开放 API 与 Google 产品入口,可据此判断实时翻译的落地方式。

  2. Hugging Face Blog60

    智能体如何串联两个 Hugging Face Space 搭建 3D 巴黎画廊

    作者让编码智能体通过调用两个 Hugging Face Space 搭建了一个展示巴黎地标的 3D 高斯泼溅网站,全程未手动使用图像生成或 3D 重建工具。每个 Gradio Space 都暴露一份 agents.md,列出 schema URL、调用与轮询模板、文件上传方式和 HF_TOKEN 鉴权提示,智能体据此即可端到端驱动 Space。

    推荐理由:作者用两个 Space 串起图像生成到 3D 高斯泼溅的完整流程,展示了 agents.md 如何让智能体直接调用模型。

6月8日周一
  1. Google DeepMind62

    Google DeepMind 在塞拉利昂开展 AI 学习试验,数学成绩提升 0.258 个标准差

    Google DeepMind 公布在塞拉利昂开展的预注册试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于八周内取得 1.2 至 1.7 年的常规学习进度。

    推荐理由:原文给出塞拉利昂预注册试验的量化结果与交互数据,读者可据此了解AI辅助教学的实际效果与局限。

  2. Hugging Face Blog62

    Hugging Face 宣布 OpenEnv 转为委员会共管,定位智能体 RL 环境协议层

    Hugging Face 宣布 OpenEnv 改由委员会协调,成员包括 Meta-PyTorch、Reflection、Unsloth、Modal、Prime Intellect、Nvidia、Mercor、Fleet AI、Microsoft、Hugging Face 和 RadixArk,项目迁至 huggingface/OpenEnv。

    推荐理由:OpenEnv 从单一项目转为多方共管的协议层,读者可据此了解开源智能体 RL 环境的协作方式与接入路径。

6月5日周五
  1. Google Research60

    Google 在 Gemini Enterprise Agent Platform 上线 Agentic RAG 版跨语料检索

    Google 在 Gemini Enterprise Agent Platform 上推出由 Agentic RAG 驱动的跨语料检索公开预览版,通过规划、改写、路由与充分上下文智能体迭代检索多源数据。官方称相比标准 RAG,该框架在事实性数据集上准确率最高提升 34%;在跨语料设置下从 4 个候选语料中正确路由并答对 90.1% 的问题,单语料与跨语料版本延迟差异平均在 3% 以内。

    推荐理由:原文给出多智能体 RAG 的完整流程与跨语料评测数据,读者可据此判断它在多源检索场景下的可用性。

  2. Google Research67

    Google 研究用手机前置摄像头实现被动心率监测

    Google Research 在 Nature 发表 PHRM 研究系统,利用手机前置摄像头在面部解锁后拍摄 8 秒面部视频,通过深度学习估算心率,与心电图相比 MAPE 低于 10%,覆盖所有肤色。

    推荐理由:Google 用 35 万段手机视频训练 rPPG 模型,并公开迄今最大规模数据集,读者可了解被动心率监测的可行边界。