跳到正文

全部动态

今日 34 条
今天10月3日周六
  1. X:Replit (@Replit)18

    Replit 的 Amjad Masad 与 David Sacks 谈 AI 创业地图:开源与闭源模型、安全与智能体落地

    Replit 的 Amjad Masad 与 David Sacks 在 #unprompted2026 上梳理了 AI 创业地图,讨论开源与闭源模型、各层级安全,以及企业为何正快速把智能体投入实际工作。他们强调并非所有旧规则都已失效,B2B 依然不等于 B2C。所谓“就业末日”的叙事声量也超过了证据本身,因为构建者仍会继续构建。

  2. X:Rohan Paul (@rohanpaul_ai)78

    研究显示 Claude Opus 5 在会计任务上 20 题全对,12 名注册会计师正确率 0% 至约 90%

    一项针对中等长度、定义明确的会计任务的研究发现,前沿 AI 模型比初级会计师更快更准确,甚至优于研究中表现最好的会计师。Claude Opus 5 在 20 道题中取得 20 题全对、正确率 100%,每题几分钟内完成;12 名持证注册会计师的正确率从 0% 到约 90% 不等,其中数人用完了 3 小时时限。研究还提到,18 个月前这些模型在同类任务上的得分远低于人类会计师。

  3. X:Rohan Paul (@rohanpaul_ai)38

    Blackstone 总裁 Jon Gray:会计、法律、金融等规则型业务将被 AI 彻底颠覆

    Blackstone 总裁兼 COO Jon Gray 此前已提出,会计、法律、金融等规则型业务将被 AI 彻底颠覆,JPMorgan 已用 AI 取代代理顾问处理股东投票。一则对比显示,Claude Opus 5 在 20 项任务中全部以 100% 正确率完成且每项仅需数分钟,而 12 名持证 CPA 的正确率从 0% 到约 90% 不等,多人耗尽 3 小时时限。

  4. X:Rohan Paul (@rohanpaul_ai)38

    纽约大学 Aswath Damodaran:AI 的 10-15 万亿美元市场是"可怕"的故事,前提是它取代人而非作为工具

    纽约大学 Stern 商学院教授 Aswath Damodaran 称,AI 若成功,其 10-15 万亿美元的可触达市场"很可怕",因为这一规模只有在 AI 取代人类工作、而非仅作为工具时才会出现。他指出,若该故事成真,半数白领将失业,随之而来的是收入与人生意义的双重丧失。

  5. X:Rohan Paul (@rohanpaul_ai)42

    Cathie Wood 谈 AI 领域的杰文斯悖论:单次回答成本年降 99.99%,OpenAI 年化收入一年内从 $20B 涨至 $70B

    Cathie Wood 在 ARK Invest 视频中解释 AI 领域的杰文斯悖论:同样的回答每年成本下降 99.99%,但调用量爆炸式增长。即便价格暴跌,OpenAI 的年化收入仍在约一年内从 $20B 升至 $70B,超过 Anthropic 报告的 $65B。她认为更便宜的调用没有压缩业务,反而成为 GDP 爆发式增长的引擎。

  6. X:Rohan Paul (@rohanpaul_ai)30

    Eric Schmidt 解释为何 AI 竞赛无法实现相互暂停

    Eric Schmidt 认为 AI 竞赛的相互暂停不可能实现:美国缺乏停止动力,本地实验室或中国可能作弊,而联合国核查无法读懂由计算机编写的代码。他指出核查需要检查人员进入包括军事实验室在内的秘密实验室并审查全部代码库,但这些代码由计算机编写,没有人类团队能逐行阅读。

  7. X:Rohan Paul (@rohanpaul_ai)47

    Eric Schmidt 解释为何 AI 竞赛无法实现相互暂停

    Eric Schmidt 认为 AI 竞赛无法相互暂停,因为美国缺乏停止动力,本地实验室或中国可能作弊,而联合国核查既无法读懂由计算机编写的代码,也追不上美中实验室的进度。他指出这种暂停无法被验证:核查人员需进入包括军事实验室在内的秘密实验室审查全部代码库,而这些代码由计算机编写,没有人类团队能逐行读完。相关观点来自《The Economist》YouTube 频道。

  8. X:SemiAnalysis (@SemiAnalysis_)26

    SemiAnalysis Weekly:GPU 是不是印钞机?InferenceX 团队解析 Engram 内存卸载、AgentX 利润计算器、TPU v7 与 Vera Rubin vs. Blackwell

    SemiAnalysis Weekly 新一期由 Jordan Nanos 主持,Cam Quilici、Bryan Shan 和 Alec Ibarra 参与,InferenceX 团队解析了 Engram 内存卸载、AgentX 利润计算器、TPU v7、Vera Rubin 与 Blackwell 的对比,以及更快的 token 是否值得溢价。

  9. X:Ethan Mollick (@emollick)22

    Ethan Mollick:企业高管已在用 AI,但改变公司是更长的过程

    Ethan Mollick 认为"我们还处在早期"的自我庆幸太多了:许多企业高管聪明、有动力、懂业务,不少人技术上也过硬,他们确实在用 AI。但他强调,改变一家公司是更长的过程。此番回应针对 Rohit 的观点——高管们已在 vibecoding 应用、采用 Claude、寻找自动化工作流,AI 已相当主流。

  10. TechCrunch · AI28

    TechCrunch Equity 播客:只有 2% 消费者在为 AI 买单

    TechCrunch Equity 播客本期讨论白宫 AI 安全承诺与"超级智能"行政令,以及消费级 AI 的经济账:只有 2% 消费者真正买单,AI 最大的钱仍来自企业市场。节目还谈及 Oura 撤回 IPO、Anthropic 泄露的 S-1、OpenAI 回归私募融资,以及 Quartermaster 1.4 亿美元融资、Atomic 已承接 DoorDash 90% 采购等交易。

10月2日周五
  1. MIT Technology Review · AI12

    以自主 AI 重新定义企业智能

    MIT Technology Review 报告指出,企业 AI 的规模化瓶颈是结构性的,全球 AI 投资 2026 年将达 2.5 万亿美元、同比增长 44%,但多数企业仍未靠 AI 增长收入。报告称领先企业把流程重设计置于模型选型之前,并强调数据就绪而非数据规模,主张以主权、可组合的架构在数据原地查询与准备数据,供 AI 智能体直接行动。

  2. The Verge · AI30

    ChatGPT 模型幻觉正让顾客变得更难缠

    餐厅、零售等一线服务人员反映,越来越多顾客拿 ChatGPT 的说法反驳专业建议,甚至无视过敏原警告。纽约服务员 Madison 称有客人坚持点含贝类的高汤鱼菜,理由是 ChatGPT 说没有贝类;酒侍也常被顾客用 ChatGPT 取代。Meta 新 AI 智能体 Muse 的推出可能加剧这一问题。

  3. MIT Technology Review · AI38

    别被迷惑——LLM 并不会推理

    前 Google DeepMind 研究员指出,LLM 靠逐个预测 token 生成答案,其思维链仍由同一套下一 token 预测产生,并非 AlphaGo 那种独立搜索机制,因此不构成真正的推理。他列举三大缺陷:模型没有显式可检查的认知状态、知识与推理在权重中纠缠不清、思维链常是事后编造。为此他离开 Google DeepMind,主张借鉴 AlphaGo 架构,让系统维护可更新的认知状态。

  4. X:马东锡 NLP (@dongxi_nlp)30

    用 LLM 生成图表、网页与讲解视频来理解模型输出

    随着 LLM 能力提升,工作重心正转向对模型输出的监督与理解,而 LLM 本身也能承担这部分工作。可用 ASD-STE100 受控语言规范让 LLM 改写内容以提升可读性,或直接要求输出图表、HTML 交互网页,乃至定制讲解视频,例如用 ElevenLabs API key 生成 3b1b 风格视频。由于智能与代码日益充裕,可以按需生成过去不划算的大型一次性软件产物。

  5. X:洪明 (@hongming731)22

    BestBlogs 早报 · 10-02:Claude 科研协作、DHH 手写代码、600 美元 PR、LangChain 模型路由、Olmo-core 3、Cohere Embed 5

    LangChain 在 Open SWE 智能体 Harness 内构建模型路由器,按任务分类选择最低成本合适模型,将编码线程中位数成本降低 64% 且质量变化可忽略。Olmo-core 3 面向大规模 MoE 训练,在八块 B300 配置下吞吐量较前代提升 2.7 倍。Cohere 发布 Embed 5 嵌入模型系列,含 Pro 和 Fast 版本,面向搜索与智能体工作流。