Ethan Mollick:AI 实验室的前沿模型为何能撑起"半成品"应用
Ethan Mollick 指出,拥有前沿模型的 AI 实验室即便发布半成品应用也能出奇好用,因为 LLM 能自行摸索和临场应变,相当于产品里内置了一名前线部署工程师和客服。这些应用边界怪异、文档不足、时常出错,还会无通知更新、随时改 UI,但背后的模型足够强,用户和公司都选择照用不误。
Ethan Mollick 指出,拥有前沿模型的 AI 实验室即便发布半成品应用也能出奇好用,因为 LLM 能自行摸索和临场应变,相当于产品里内置了一名前线部署工程师和客服。这些应用边界怪异、文档不足、时常出错,还会无通知更新、随时改 UI,但背后的模型足够强,用户和公司都选择照用不误。
Ethan Mollick 指出,拥有前沿模型的 AI 实验室即使发布半成品产品也能出奇好用,因为模型本身能自行摸索和临场应变,相当于产品内置了一名前向部署工程师和客服。他认为 LLM 在完成大量任务上强得不合理,用户和企业正学着接受这种粗糙体验。这些 AI 实验室的应用普遍存在边界怪异、文档不足、偶尔崩溃、无更新日志就改 UI 等问题,但底层模型足够好,大家耸耸肩继续用。
Ethan Mollick 指出,拥有前沿模型的 AI 实验室可以发布"半成品"产品,且效果出奇地好,因为 AI 能自行摸索和临场发挥。他把这比作在产品中内置了一名前置部署工程师和客服人员。
如果 X 允许用户将自己的回复标记为人类撰写,或者你可以将回复限制为已验证为人类的人,整个体验将好 10 倍。 我不想把回复限制在我的关注网络内的账号。所有机器人也都是已验证的。
Ethan Mollick 指出 OpenAI 在 Dot、Spaces、Pages、本地/云端 ChatGPT Work 及定时任务等多条产品线并行后,工具权限与设备归属变得混乱且功能重叠。他举例说 Dot 可在 Codex/ChatGPT 应用中创建线程和任务,语音模式也会创建线程,但这些线程有时延续、有时被弃用,目前并不清晰。
Ethan Mollick 指出,OpenAI 在短暂围绕 ChatGPT app 统一工作流后,Dot、Spaces、Pages、本地/云端 ChatGPT Work、云端 Scheduled Tasks 与电脑端 Scheduled Tasks 再度变得混乱且重叠。
post your dots! spent an embarrassingly long time creating this guy
OpenAI 被指每年推出同一第三方生态的变体后便半途而废:2023 年的 Plugins、2023-2024 年的 GPTs 与 GPT Store、2025 年的 Apps,以及 2026 年再度出现的 Plugins(同名但已非此前之物)。
Ethan Mollick 称 Dots 属于与 Muse、Grokbot 并列且快速扩张的 Clawlike 类别,用有能力、可访问你数据的模型充当助手和第二意见非常有用。他认为这类工具在团队中有天然对应形态:一个常驻实体,可通过 Slack 等现有团队沟通工具委派任务。他预计很快会出现更多 Clawlike,但不认为它们是这类 AI 的最终形态。
中国编程助手的一次悄然数据收集,竟成了一场无人愿率先发难的争斗的预演。 几周前,一位名叫 Ferstar 的开发者注意到他笔记本上的一个文件夹已悄然
3周前我试了 Grok Bot。 2周前装了 Instint。 上周装了 Muse。 现在看来我得试试 Dots。 让个人 AI 助手之战开始吧。
对这类人来说,问题不在于他们笨,Timnit 拥有顶尖科学家的所有技能,而在于他们所处的信息生态和同侪群体不鼓励对思想进行审视。回音室是清晰思维的慢性死亡。
Nathan Lambert 表示,在 AI 领域如果不接受自己有时会判断错误,就很难做出真正有价值的观点和预测。他认为当下对想要推动议题、适时批评、更新认知并公开思考的 AI 从业者来说是一段非常艰难的时期,并赞赏那些没有陷入稻草人论证、陈词滥调和标题党式妄想的少数独立声音,呼吁他们继续坚持。
顺便说一句,亏钱换市场并不是坏事。 Tesla 每辆车都亏钱亏了好几年,连 Bill Gates 都做空过它。看看它现在。 Uber 上市后还补贴打车、烧了好几年现金,现在超级赚钱。
对于那些想在AI领域推动议题、适时批评、更新信念、公开思考的人来说,现在是非常艰难的时期。我很感激少数没有屈服于稻草人论点、陈词滥调或点击诱饵幻觉的独立声音。请继续坚持。
Mozilla 随 Firefox 157 在桌面和移动端推出界面重新设计,Firefox 负责人 Ajit Varma 称目标是让更广泛用户因体验而非价值观选择 Firefox,并借 AI 工具提升开发速度。他承认最大障碍是"他们不是 Chrome",多数用户并不了解 Chromium、Blink、Gecko 之间的区别。此次更新还恢复了紧凑模式并增加更多自定义选项。
HPE 提出,当 AI 从试验走向生产、需求变得稳定且关键业务化后,按 token 逐次消费的模式会让 AI 支出变成难以预测的月度变动项,企业需评估自有算力的盈亏平衡点。
Latent Space 的 AINews 汇总 9/24-9/25 动态,指出 Opus 5.5 本周发布后在讲解视频生成上表现突出,SimpleBench 达 88.4%,被 @skalskip92 评为 Anthropic 迄今最强视觉模型。
朋友们, 中国科技圈当下最有趣的事情之一,就是一家公司撞墙之后会发生什么。 华为撞了一堵很大的墙。美国的限制切断了其关键的智能手机和芯片
MIT Technology Review 调查记录了超过一千人在美国南部边境“虚拟墙”监控塔覆盖区域内未被发现或拦截、最终死亡,其中部分区域由新部署的 AI 监控塔自动识别人员。该调查称这暴露了一场比此前已知更严重的人道危机,以及虚拟墙基本安全承诺的反复失效。
GPT Researcher 已将 RAG 流程中的嵌入向量替换为 Jev,并在 SimpleQA 的 28 个研究任务上测试,相关上下文提升 59%(73% vs 46%),盲测中报告以 15 比 3 更受偏好,单篇报告成本持平,现已默认运行在 Jev 上且不再需要嵌入向量。有开发者表示自己在论文探索中测试 JevRAG,用 Jev 做重排序效果更好,并尝试将语义搜索与 Jev 结合来检索论文。
Nathan Lambert 指出 ModelScope 在中国以外几乎无法正常使用,且缺少人们真正想用的模型,但这一说法已开始影响人们对政策的看法。该评论针对 SemiAnalysis 所称 NVIDIA 收购 HuggingFace 后正研究将部分工作迁移至 ModelScope 等替代方案。