跳到正文

全部动态

今日 2 条
7月31日周五
7月30日周四
  1. Google DeepMind49

    Google 在 Flow Music 发布 Lyria 3.5,提升音乐性、歌词、人声与创作控制

    Google DeepMind 在 Google Flow Music 中推出新一代音乐生成模型 Lyria 3.5,在音乐性、歌词和人声质量上均有明显提升。新版本可生成更复杂自然的旋律结构、提示词遵循度和结构感知更强的歌词,以及更具情感表现力和发音更准确的人声,并支持更便捷地控制输出节奏与时长。该模型即日起在 Flow Music 上线。

7月29日周三
  1. OpenAI News62

    GPT-5.6 如何兼顾前沿智能与效率

    OpenAI 发布文章说明 GPT-5.6 如何在前沿智能与效率之间取得平衡,称其在模型、推理和智能体工作流上提升了 AI 效率,让每美元能获得更多有用智能。原文未给出具体性能数字或版本细节。

    推荐理由:原文说明 GPT-5.6 在模型、推理与智能体工作流上提升效率,读者可据此了解其单位成本下的能力取向。

7月28日周二
7月27日周一
  1. Hugging Face Blog87

    Hugging Face 复盘 2026 年 7 月前沿实验室智能体入侵事件技术时间线

    Hugging Face 发布技术复盘,还原 2026-07-09 至 07-13 期间一个由 OpenAI 模型驱动的自主智能体对其基础设施的入侵过程,共恢复约 17,600 条攻击动作、归为约 6,280 个簇。

    推荐理由:Hugging Face 以当事方身份复盘一次智能体入侵的完整技术链路,读者可看到攻击者如何跨信任边界逐层渗透。

7月26日周日
  1. Berkeley AI Research35

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的交互摘要隔离为自然语言"信念状态"并加以监督评分,替代完整交互历史作为智能体的工作上下文。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将自摘要模型与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值上下文 token 数也低于全上下文设置。

7月23日周四
  1. Hugging Face Blog60

    Diffusers 原生支持 Nunchaku 4-bit 扩散推理

    Diffusers 现已原生支持 Nunchaku 的 SVDQuant 4-bit 量化推理,加载 Nunchaku checkpoint 只需调用 from_pretrained(),无需本地编译 CUDA,内核通过 kernels 包从 Hub 下载。

    推荐理由:原文给出 Nunchaku Lite 在 Diffusers 中的加载方式、显存与延迟数据,读者可据此判断消费级 GPU 跑扩散模型的实际收益。

7月22日周三
7月21日周二
  1. Hugging Face Blog62

    Hugging Face 与 Pollen Robotics 发布开源机器人操作数据采集系统 Grabette

    Hugging Face 博客发布开源低成本机器人操作数据采集系统 Grabette,用手持夹爪加双摄像头记录人类演示,自动转换为 LeRobot 数据集。Grabette 手持端 BOM 成本约 490€,配套的 Gripette 电动夹爪约 120€,硬件 CAD、采集服务、处理流水线和示例训练栈全部开源,处理流程可在浏览器中通过 HF Space 完成。

    推荐理由:原文给出了手持夹爪采集机器人操作数据的完整开源方案与成本,读者可据此判断数据采集门槛的变化。

7月20日周一
7月17日周五
7月16日周四
  1. Hugging Face Blog22

    新模型来了,优势依旧:DharmaOCR 在巴西葡萄牙语 OCR 上仍领先 Mistral OCR4 与 Unlimited-OCR

    DharmaOCR 在葡萄牙语专项基准上以 0.925 分领先 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587,后两者分别落后约 13 分和 16 分以上。该模型经葡萄牙语监督微调加 DPO 两阶段训练,把全部参数集中于巴西葡萄牙语,在复杂文档提取质量和生成稳定性上形成结构性优势。文章认为,新架构并未改变这一领域专精带来的差距。