跳到正文

全部动态

今日 0 条
10月1日周四
  1. X:Ethan Mollick (@emollick)28

    Ethan Mollick:AI 实验室的前沿模型为何能撑起"半成品"应用

    Ethan Mollick 指出,拥有前沿模型的 AI 实验室即便发布半成品应用也能出奇好用,因为 LLM 能自行摸索和临场应变,相当于产品里内置了一名前线部署工程师和客服。这些应用边界怪异、文档不足、时常出错,还会无通知更新、随时改 UI,但背后的模型足够强,用户和公司都选择照用不误。

  2. X:Gemini (@GeminiApp)62

    Gemini 上线 Skills 功能,将逐步替代 gems

    Gemini 的 Skills 功能今日起在全球上线,并将在未来几周扩展到 Google Workspace 的商业、企业、非营利和教育客户。Skills 通过可复用的自定义指令帮助用户自动化重复性任务,并将取代原有的 gems。官方博客给出了具体用法说明。

  3. Ars Technica · AI58

    Google 向约 100 家出版商支付 AI 内容费用,金额仅占广告收入约千分之一

    Google 已允许约 100 家出版商加入 AI 内容贡献试点,当网站内容对 Gemini 驱动的 AI Overview 等搜索结果有实质贡献时可获得付费。据 The Information 报道,参与试点的一些中小出版商表示这笔 AI 付费极少,约相当于其广告收入的千分之一,部分大型出版商已拒绝参与,希望以此迫使 Google 给出更慷慨的方案。

  4. X:Ethan Mollick (@emollick)28

    Ethan Mollick:前沿模型实验室为何能靠"半成品"产品取胜

    Ethan Mollick 指出,拥有前沿模型的 AI 实验室即使发布半成品产品也能出奇好用,因为模型本身能自行摸索和临场应变,相当于产品内置了一名前向部署工程师和客服。他认为 LLM 在完成大量任务上强得不合理,用户和企业正学着接受这种粗糙体验。这些 AI 实验室的应用普遍存在边界怪异、文档不足、偶尔崩溃、无更新日志就改 UI 等问题,但底层模型足够好,大家耸耸肩继续用。

  5. Microsoft Research34

    微软研究院用机器学习预测电网空间天气风险

    微软研究院实习生开发了一套端到端机器学习流水线,为美国本土 66,935 座变电站生成空间天气风险预测,可提前 30 至 60 分钟预警。系统结合 AE 与 Dst 指数预测、地质电导率和电网数据,在 2020-2026 评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。

9月30日周三
  1. Google DeepMind71

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质嵌入可验证水印

    Google DeepMind 推出 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使其在数字模型和合成出的实体蛋白质上均可验证,同时保持生物功能。

    推荐理由:原文给出了水印嵌入方式与湿实验验证结果,读者可据此判断AI生成生物设计的溯源路径。

  2. X:洪明 (@hongming731)40

    程序员用 vibe coding 把网站做得像设计师出品:一篇 HN 设计文章推荐

    洪明在 X 上推荐了 HN 上一篇文章《How our vibe coded website looks like a designer made it》,作者是没有设计经验的纯程序员,通过一步步优化把网站做得像设计师设计的一样。文章步骤详细、真人感强,可总结成方法论,网站亮点是过山车大亨风格的像素风游乐公园动画。作者认为这种真诚干货的文章也是一种另类 SEO,作品最近因此火了。

  3. Ars Technica · AI71

    OpenAI 因 AI 安全担忧推迟 IPO

    OpenAI 已将 IPO 推迟至明年,并正与投资者洽谈新一轮私募融资,目标募资 300 亿美元或更多,估值约 1.4 万亿美元。公司希望借推出名为 Dots 的新 AI 助手延续商业增长势头,其年化收入自 7 月发布 GPT-5.6 以来增长逾 70%,目前约 700 亿美元。周一 OpenAI 表示因安全担忧取消最新模型的发布计划。

  4. X:百度 Baidu (@Baidu_Inc)15

    百度 AI Pulse 9 月盘点:全栈 AI 拆解

    百度在 9 月 1 日完成香港与纳斯达克双重主要上市,其 AI Pulse 9 月刊以“Full Stack AI Unpacked”为主题回顾当月进展。原文未披露具体模型版本、参数规模或 benchmark 数据。

  5. X:腾讯混元 (@TencentHunyuan)44

    腾讯混元联合复旦、清华发布 ExplorationBench:衡量 AI 系统探索能力的基准

    腾讯混元联合复旦大学、清华大学发布 ExplorationBench,用于衡量 AI 系统的探索能力,并构建可验证的 Alien Worlds 环境。其中 AlienCode 含 31 项隐藏规则改动、70 个任务,AlienLogic 含 24 条修改的推理规则、70 个定理,答案由解释器或证明检查器评分,不使用 LLM 评判。

  6. X:Tianyi Cui(@tianyi)22

    【AI 倾向测试】六道二选一题目问卷

    一个名为「AI 倾向测试」的问卷上线,仅含六道二选一题目,地址为 pages.yqiao.me/six-questions-of-ai/。该问卷被分享者评价为「好有意思」,正文未披露题目内容、评分方式或开发方信息。

  7. X:Nathan Lambert (@natolambert)52

    Context Language Models 提出让 LLM 直接编辑自身上下文

    Nathan Lambert 引用 Rulin Shao 的研究介绍 Context Language Models(CLMs),主张让语言模型不受限制地直接编辑自身上下文,而非依赖现有 harness 的固定上下文管理方式。该研究称这种方式可带来更好的长程记忆与 FLOP 高效的适配,并把上下文当作文件、将策略学习进 CLM 权重中,无需 harness。