Microsoft AI 发布流式语音转写模型 MAI-Transcribe-2-Streaming
Microsoft AI 发布流式语音转写模型 MAI-Transcribe-2-Streaming,在 AA-WER Streaming 上以 2.5% WER、语音结束后 0.13s 返回结果,拿下 Final Transcript 与 First Partial Transcript 两项准确率第一。
Microsoft AI 发布流式语音转写模型 MAI-Transcribe-2-Streaming,在 AA-WER Streaming 上以 2.5% WER、语音结束后 0.13s 返回结果,拿下 Final Transcript 与 First Partial Transcript 两项准确率第一。
Microsoft AI 发布流式语音转文字模型 MAI-Transcribe-2-Streaming,在 AA-WER Streaming 的 Final Transcript 与 First Partial Transcript 两项上均排名第一,最终转写 WER 为 2.5%、语音结束后 0.13s 返回。
Artificial Analysis 编程智能体指数新增安全拒绝报告,可查看拒绝发生在任务提示词阶段还是智能体已开始工作之后,以及拒绝后切换到了哪个回退模型。
Artificial Analysis Coding Agent Index 新增安全拒答报告,可查看拒答发生在任务提示词阶段还是智能体已开始工作之后,以及拒答后切换到了哪个模型。
Artificial Analysis 评测显示,阿里 Qwen-Image-2.1 在 AA-Image-T2I v2.0 和 AA-Image-Editing v2.0 两个开源权重榜上均排名第一,总榜排名第 18。
阿里巴巴 9 月 20 日以开源权重发布 Qwen-Image-2.1,Artificial Analysis 评测显示它在 AA-Image-T2I v2.0 和 AA-Image-Editing v2.0 均排名第 18,是两张榜上排名最高的开源权重模型,超过 Ideogram 4.0 (Quality) 和 HunyuanImage 3.0 Instruct。
Artificial Analysis 评测显示,阿里 Qwen-Image-2.1 在 AA-Image-T2I v2.0 和 AA-Image-Editing v2.0 两个榜单上均排名第 18,是两项榜单中排名最高的开源权重模型,分别领先 Ideogram 4.0(Quality)和 HunyuanImage 3.0 Instruct。
Artificial Analysis 上线 AI 编程智能体基准与排行榜,在软件工程任务上测量编程智能体的真实表现,涵盖成本、token 用量和执行时间。该榜单对比不同智能体与模型之间的性能差异,完整结果可在 artificialanalysis.ai/agents/coding-agents 查看。
Artificial Analysis 的 Coding Agent Index 显示,本周发布的 Claude Sonnet 5.5、GPT-6.1 Sol 和 Gemini 4 Argon 均接近榜单前列,但性能与成本平衡各不相同。
推荐理由:榜单把三款新模型的编码智能体得分与单任务成本并列,读者可据此比较性能与开销的取舍。
Artificial Analysis 上线模型对比工具,支持任选模型并排比较 Intelligence Index 与单项 benchmark 分数。该工具还提供 Capability Index 分数,覆盖金融会计、战略运营、法律、医疗、工程和经济学领域,并可按输入、输出和缓存 token 拆分成本,同时展示输出速度与延迟。
哈佛大学物理学家 Matthew Schwartz 在 Anthropic 客座文章中介绍开源工具 BootLoops,它让 Claude 完成精确科学计算,源码已在 GitHub 发布。
MiniMax H3 的视频编辑能力因 Character-Swap LoRA 而变得更有趣,该 LoRA 已在 ComfyUI 上完成测试。用户 toyxyz 展示了这一测试效果,H3 在视频角色替换编辑场景中展现出可玩性。
Grok Bot 现在可以在用户未主动提问时主动提供帮助建议,包括实用提醒和提示。该功能由 Grok Bot 官方账号(@bot)发布,并附有演示视频。
Grok Bot 现在可以主动建议如何提供帮助,无需用户先开口提问。该功能由 Grok Bot(@bot)账号发布,并附有演示视频。
Grok 4.7 现已在 Gemini Enterprise Agent Platform 上线,使用该平台的企业用户可直接调用。该消息由 SpaceXAI 发布,并附有演示视频。
XChat 群聊现已支持直接向 Grok 提问并获得回答。用户可在 XChat 聊天中与 @grok 对话,群聊因此变得更智能。
Grok Build 新增 Agent Dashboard,可在同一屏幕查看所有智能体,并通过 /dashboard 命令调用。该功能同时支持在一个视图中管理多个智能体与 worktree。
WorkOS 主办的 init() 开发者大会将于一周后开幕,演讲嘉宾包括 @levie、@howietl、@swyx、@clairevo 等,活动免费且仍有少量名额,可通过 workos.com/init 报名。大会由 @Stripe、@Cloudflare 和 @Databricks 赞助。
MIT 研究者 @a1zhang 在 Latent Space 播客中提出递归语言模型(RLM),认为 Claude Code、Codex 和 Pi 本质上是同一类东西,通过代码、上下文卸载和递归子智能体实现跨任务泛化。他援引 OpenAI 一项 10,000 个智能体、130B 输出 token 的实验,讨论语言模型的未来,并指出有时一个专家就能替代万亿 token 的暴力搜索。
Anthropic 的 Thariq 介绍了 Claude Mods 解锁的能力,包括对话上下文、subagent、结构化输出和对 UI 的控制。他表示 Mods 的作用域内包含对话有多少轮、已用多少 token 等信息;因为都在进程内运行,可以派生 subagent、解析其结果并用结构化输出返回;还可以修改 UI,这是 hooks 做不到的。
swyx 以创始合作伙伴身份回归第二届 AI Security Summit,活动将于 2026 年 10 月 15 日在旧金山举行,2025 年的所有合作伙伴均已回归。他表示自一年前启动以来,恶意智能体数量激增、数据泄露和 AI 驱动的攻击增多,安全问题已不再是理论问题,必须成为 AI 讨论的核心。
MIT 博士生 a1zhang 认为学术界适合下大研究赌注:PhD 研究者虽没有无限算力,但能自由探索主流之外的想法、权衡不同取舍,从而催生新范式。昨日 Latent Space 播客与 swyx 的对谈还覆盖了 kernel、harness 设计、多智能体系统,以及从 GPU kernel、KernelBench 到 Recursive Language Models 的路径。
Google 公布 Project Suncatcher,一项把 AI 计算放到太空的登月计划。该项目正在测试硬件在太空环境中的存活能力,并为 AI 芯片设计散热系统。
Suno Studio 2.0 支持在聊天栏中完成从一首歌开始、分离音轨、添加新乐器、效果与自动化的全流程操作。该功能将分轨与编曲编辑整合进对话式输入,用户无需离开聊天栏即可完成多步音乐制作。
Suno 推出 Speech 功能 Beta 版,用户可在 Suno 上生成语音内容。官方提示 Beta 阶段仍有不足,例如英式口音有时会听起来更像澳式口音,戏剧性停顿也可能过于夸张,这些问题将随时间改进。
Suno 分享了一段用维多利亚时代英语劝说室友洗碗的音频演示,并附上 suno.com 的分享链接。该内容以回复 @suno 的形式发布,展示 Suno 在特定风格化人声与台词生成上的效果。
Suno 宣布 Speech 功能进入 Beta 阶段,称其为首个能生成与背景音乐相匹配的语音音频的模型,用户更新应用即可使用。官方博客链接为 suno.com/blog/introducing-speech-beta。
Suno 分享了一段演示,展示语音与背景音乐在一次生成中同步产出。评论者 Gavin Guo 指出,两个生成器争夺同一时间线通常会互相干扰,而这段音乐能随人声自动避让、起伏和强调,而非事后贴附,对实时音频而言是实质性进展。
用户 𝐌𝐫. 𝐖𝐢𝐜𝐤 在 X 上批评 Suno 生成的音乐带有明显的合成感,称若不改善音质、达到打磨与母带处理的水准,Suno 将难以持续发展。他形容当前效果听起来像在用 Circuit City 倒闭前最便宜的扬声器播放。
Suno 就新语音功能的命名向用户征求意见,认为 Speech 这个名字"感觉不太对",并提出 Vocal Booth 作为替代方案。该讨论由用户 @OmnipotentCEO 在 X 上发起,目前尚未公布最终命名或功能细节。
Anthropic 的 Claude Devs 宣布 Claude Code 支持 mods,即用 TypeScript 函数改变 Claude Code 的工作方式,可改写提示词、拦截高风险命令、添加自定义 UI 或替换内置功能。官方称已用 mods 构建了 /diff 和 AGENTS.md 支持等功能,用户可自行编写或让 Claude Code 代写。
Claude Code 在 Playground 仓库中新增了预制示例 mods,供开发者参考借鉴。mods 是随插件分发、在 Claude Code 会话内运行的 hooks,官方入门指南演示了如何从空文件夹构建一个 mod,并展示了两个更完整的 mod 案例。
Claude Code 现在支持 Mod,可以改变其行为、自定义 UI,或替换成自己的功能。用几行 TypeScript 即可编写,也可以让 Claude 代写;Mod 随插件分发,在 CLI 或桌面应用里用 /plugin 安装。
Meta 与合著者提出 Context Language Models(CLM),把上下文作为模型可用 Bash 编辑的文件,由模型决定保留、改写或删除哪些内容。
Meta 提出一种分支化的智能体 harness 优化方法,将 Meta-Harness 式单一搜索路径拆成多个分支,每个分支保留自身 harness 更擅长的开发用例、丢弃所有分支已解决的用例,并依据历史重写自己的提议策略,再由 router 在运行前为每个新输入选择某个分支的 harness。
微软提出 FOCUS,一种在测试时压缩智能体上下文的方法,通过判断智能体下一步决策真正依赖哪些历史交互,保留这些单元并丢弃其余部分。该方法无需训练数据或微调,可作为独立层部署在闭源 API 模型之前。在工具调用、QA、网页和多轮对话基准上,FOCUS 将峰值上下文最多减少 48%,任务成功率最多提升 8.9 个百分点。
Francois Chollet 指出,base LLM(2024 及更早)与现代 LRM 的关键区别不是符号工具使用,而是从转导范式(直觉给出查询答案)转向归纳范式(直觉给出产生答案的程序/指令),LRM 经训练具备归纳能力并在测试时进行归纳,即预测自然语言程序/推理链。
NCA(神经细胞自动机)的局部通信能产生视觉化的"思维链"。在迷宫任务中,NCA 会并行探索路径并从死胡同回溯,行为类似黏菌;在 ARC-AGI-1 中,它通过逐步在网格上移动颜色和形状来完成任务。
Keras 社区会议将在 30 分钟后开始,任何人都可通过 meet.google.com/gva-bbpr-twe 加入。会议由 Samaneh Saadat 主持,于 10 月 2 日 10 AM PST 举行,介绍 Keras 生态的最新进展。
Higgsfield 现已上线 FLUX 3 Image,用户可通过 higgsfield.ai/ai/image?model=flux-3-image 直接试用。该平台定位为面向创作者的 AI 相机控制工具。