Ethan Mollick:AI 实验室的前沿模型为何能撑起"半成品"应用
Ethan Mollick 指出,拥有前沿模型的 AI 实验室即便发布半成品应用也能出奇好用,因为 LLM 能自行摸索和临场应变,相当于产品里内置了一名前线部署工程师和客服。这些应用边界怪异、文档不足、时常出错,还会无通知更新、随时改 UI,但背后的模型足够强,用户和公司都选择照用不误。
Ethan Mollick 指出,拥有前沿模型的 AI 实验室即便发布半成品应用也能出奇好用,因为 LLM 能自行摸索和临场应变,相当于产品里内置了一名前线部署工程师和客服。这些应用边界怪异、文档不足、时常出错,还会无通知更新、随时改 UI,但背后的模型足够强,用户和公司都选择照用不误。
Gemini 的 Skills 功能今日起在全球上线,并将在未来几周扩展到 Google Workspace 的商业、企业、非营利和教育客户。Skills 通过可复用的自定义指令帮助用户自动化重复性任务,并将取代原有的 gems。官方博客给出了具体用法说明。
Gemini 面向个人账号全球上线 Skills,它是针对重复任务保存的指令集合,可重复调用、由聊天自动生成、支持叠加使用,并能包含纯文本、PDF 或图片等参考文件。
微软研究团队开发出一套机器学习系统,可在极端空间天气风暴抵达前 30-60 分钟预测地球哪些区域可能受损。该系统针对的是会破坏地面电力系统、降低 GPS 精度并干扰卫星运行的极端空间天气事件。
Gemini 推出 Skills 功能,把重复使用的提示词保存为针对特定任务的指令集,用户无需每次重新输入提示词即可直接得到结果。官方将其比作随时可用的快捷方式,并提供了创建自定义技能的入口。
Google 已允许约 100 家出版商加入 AI 内容贡献试点,当网站内容对 Gemini 驱动的 AI Overview 等搜索结果有实质贡献时可获得付费。据 The Information 报道,参与试点的一些中小出版商表示这笔 AI 付费极少,约相当于其广告收入的千分之一,部分大型出版商已拒绝参与,希望以此迫使 Google 给出更慷慨的方案。
Ethan Mollick 指出,拥有前沿模型的 AI 实验室即使发布半成品产品也能出奇好用,因为模型本身能自行摸索和临场应变,相当于产品内置了一名前向部署工程师和客服。他认为 LLM 在完成大量任务上强得不合理,用户和企业正学着接受这种粗糙体验。这些 AI 实验室的应用普遍存在边界怪异、文档不足、偶尔崩溃、无更新日志就改 UI 等问题,但底层模型足够好,大家耸耸肩继续用。
Ethan Mollick 指出,拥有前沿模型的 AI 实验室可以发布"半成品"产品,且效果出奇地好,因为 AI 能自行摸索和临场发挥。他把这比作在产品中内置了一名前置部署工程师和客服人员。
微软研究院实习生开发了一套端到端机器学习流水线,为美国本土 66,935 座变电站生成空间天气风险预测,可提前 30 至 60 分钟预警。系统结合 AE 与 Dst 指数预测、地质电导率和电网数据,在 2020-2026 评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。
月之暗面的 Kimi K3 和智谱的 GLM-5.3 现已在 OpenAI 的 Codex 内销售,费用从现有的 OpenAI 承诺额度中扣除。提供服务的美国公司 Baseten 表示,这些模型运行在美国服务器上,不保留提示词。中国媒体称这是首次有中国开源权重模型出现在 OpenAI 的账单上。
Google DeepMind 团队发表论文,提出基于 SynthID 的蛋白质水印方案 SynthIDBio,可在不损害蛋白质功能的前提下,在 ProteinMPNN 设计的蛋白质序列中嵌入可检测的水印,用于生物安全筛查。
Nathan Lambert 针对 David Sacks 所称"超级智能的布雷顿森林体系"提出质疑,认为只有 1 个国家参与的情况下很难构成布雷顿森林体系式的类比。
Amazon Bedrock Knowledge Bases 可通过 AgenticRetrieveStream API 用自然语言查询理赔文档并返回带引用的答案。
Replit 宣布其应用现已可在 Meta VR 中运行,用户能在 VR 环境里使用 Replit 构建的应用。有评论认为,这让从未开发过 VR 应用的人也能接触空间开发。
AWS 为 Amazon Bedrock AgentCore 推出 Runtime Instances,用托管 EC2 承载长时间运行的多智能体工作流,会话最长 14 天、支持 GPU 和持久卷,单实例可托管多个智能体。
ElevenLabs 完成一轮员工要约收购,估值达 220 亿美元,较今年 2 月 D 轮融资时翻倍。该轮要约由 Wellington 和 T. Rowe Price 领投。
Google DeepMind 宣布推出 SynthID Bio,一种为 AI 设计的蛋白质加水印并进行检测的方法。该推文称这可能是人类首次成功合成带水印的 AI 设计蛋白质,目标是保障 AI 时代的生物学安全。
fal 上线 VEED Clean Audio(Audio to Audio)API,可从语音中去除背景噪声,同时保留安静和远处的人声。该模型即 VEED 编辑器内 Clean Audio 功能的同款模型,每天处理数千条录音,现已可在 fal 上直接调用。
VEED Clean Audio 现已在 fal 平台上线,可从语音中去除背景噪声,同时保留安静和远处的人声。该功能支持最长 30 分钟的任意音频或视频文件输入,输出 48 kHz 响度归一化音频。
Google DeepMind 推出 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使其在数字模型和合成出的实体蛋白质上均可验证,同时保持生物功能。
推荐理由:原文给出了水印嵌入方式与湿实验验证结果,读者可据此判断AI生成生物设计的溯源路径。
CoreWeave 宣布在 CoreWeave Cloud 上线 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网,Cognition 成为首个在生产环境运行该平台、支撑 Devin 的客户,早期测试中 SWE-2 推理总 token 吞吐量较 GB200 NVL72 最高提升 4.8 倍。
Cohere Embeddings 团队推出 embed5 模型,通过新的训练与评估技术,不仅能检索相关结果,还能找出最符合人类偏好的文档。该模型重点强化多语言能力,并带来大幅吞吐量提升,可扩展至任意数据规模,同时强调用户数据始终私密。
Perplexity CEO Aravind Srinivas 展示计算机生成可交互 3D 图示的能力,可用于家具组装等场景的可视化。他表示唯一剩下的步骤是把这一画面投射到一副眼镜上佩戴使用。
Latent Space 播客邀请 Claude Code 的 Thariq,讨论 Agent 编码中的几个话题。Thariq 认为 prompting 是元技能,取决于对具体模型能力边界的心智模型和对问题领域词汇的掌握。
Unsloth 与 HuggingFace 联合举办开源派对,现场将发放 Unsloth 周边并展示其即将推出的新功能。活动包含 demo、DJ 和餐饮,报名地址为 luma.com/OpenTogether,使用优惠码 NOSLOTHSHERE 可入场。
洪明在 X 上推荐了 HN 上一篇文章《How our vibe coded website looks like a designer made it》,作者是没有设计经验的纯程序员,通过一步步优化把网站做得像设计师设计的一样。文章步骤详细、真人感强,可总结成方法论,网站亮点是过山车大亨风格的像素风游乐公园动画。作者认为这种真诚干货的文章也是一种另类 SEO,作品最近因此火了。
Perplexity 的 Computer 能生成交互式 3D 示意图,帮助用户直观理解家具组装等流程,把说明书变成可探索的内容。有用户指出类似工具两年前就已存在,只是并非由模型厂商实现;也有人追问 token 用量优化和 Grok 4.7 等最新模型的支持情况。
MiniMax 的 H3-Character-Swap-LoRA 在 ComfyUI 中完成运镜测试,展示该 LoRA 在镜头运动下的角色替换效果。相关演示以视频形式发布,标注 #comfyui。
OpenAI 已将 IPO 推迟至明年,并正与投资者洽谈新一轮私募融资,目标募资 300 亿美元或更多,估值约 1.4 万亿美元。公司希望借推出名为 Dots 的新 AI 助手延续商业增长势头,其年化收入自 7 月发布 GPT-5.6 以来增长逾 70%,目前约 700 亿美元。周一 OpenAI 表示因安全担忧取消最新模型的发布计划。
PixVerse 上线 ChatGPT 插件,用户可在 ChatGPT 内浏览营销提示词并直接创建内容。安装插件后选择提示词即可开始创作,插件入口为 app.pixverse.ai/cli/marketing。
PixVerse 推出插件,能把音乐转化为 MV 或音乐可视化视频。用户只需向 AI 智能体描述想要的氛围、风格和画面,即可让智能体调用 PixVerse 将创意呈现在屏幕上。
百度在 9 月 1 日完成香港与纳斯达克双重主要上市,其 AI Pulse 9 月刊以“Full Stack AI Unpacked”为主题回顾当月进展。原文未披露具体模型版本、参数规模或 benchmark 数据。
Luma 上线 Ad Variants 功能,可在同一广告活动下生成不同尺寸、面向不同市场的多个版本。该功能面向视频广告场景,用户无需为每个尺寸或市场单独重做广告。
腾讯混元联合复旦大学、清华大学发布 ExplorationBench,用于衡量 AI 系统的探索能力,并构建可验证的 Alien Worlds 环境。其中 AlienCode 含 31 项隐藏规则改动、70 个任务,AlienLogic 含 24 条修改的推理规则、70 个定理,答案由解释器或证明检查器评分,不使用 LLM 评判。
一个名为「AI 倾向测试」的问卷上线,仅含六道二选一题目,地址为 pages.yqiao.me/six-questions-of-ai/。该问卷被分享者评价为「好有意思」,正文未披露题目内容、评分方式或开发方信息。
Cohere 推出 Embed 5 系列嵌入模型,含 Embed 5 Pro 与 Embed 5 Fast 两款。Embed 5 Pro 在 ViDoRe V3 上取得所测模型最高平均分,超过 Voyage 4 Large、Gemini Embedding 2 和 Jina Embeddings v5,训练覆盖 100 多种语言。
Cohere Embed 5 现已通过 Cohere API、Model Vault、Microsoft Foundry 和 Amazon SageMaker 提供,也可直接在 North 中使用。Embed 5 的 Pro 与 Fast 两个版本共享同一嵌入空间,可用其中一个建索引、另一个检索,同时保持性能。
Cohere 发布 Embed 5 系列嵌入模型,分为 Embed 5 Pro 和 Embed 5 Fast 两档。Embed 5 Pro 在 ViDoRe V3 上取得所测模型的最高平均分,超过 Voyage 4 Large、Gemini Embedding 2 和 Jina Embeddings v5,并支持图像检索、解析后的 PDF 以及 100 多种语言训练。
Nathan Lambert 引用 Rulin Shao 的研究介绍 Context Language Models(CLMs),主张让语言模型不受限制地直接编辑自身上下文,而非依赖现有 harness 的固定上下文管理方式。该研究称这种方式可带来更好的长程记忆与 FLOP 高效的适配,并把上下文当作文件、将策略学习进 CLM 权重中,无需 harness。
面壁智能 OpenBMB 发布 Diffusion Reward Models(DRM),不再把人类偏好压缩成单一分数,而是学习完整奖励分布,保留分歧、不确定性与多种可能判断。