跳到正文

全部动态

今日 2 条
9月30日周三
9月29日周二
  1. Microsoft Research62

    微软研究院推出 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院推出 Quine,一个面向生物学复杂性的 AI 研究系统,由生物学世界模型和连接模型、科学工具、文献与研究者的交互式 harness 两部分组成。该系统与 Broad Institute 合作用于胰腺导管腺癌(PDAC)研究,从数千个化合物中筛选并优先排序可驱动肿瘤细胞状态转变的候选物,最高排名的化合物在湿实验中产生了最大的预期状态转变,整个流程仅用一个周末完成。

    推荐理由:微软研究院公开 Quine 的生物学世界模型与实验编排框架,并给出胰腺癌化合物筛选的湿实验验证结果。

  2. Hugging Face Blog38

    ProvenanceGuard:面向 MCP 智能体的来源感知事实核查

    Hugging Face 博客介绍论文 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,专门检测"跨来源混淆"——即事实在证据池中为真、却被归给错误来源。在 281 条医疗智能体真实 trace 上,专家判定 361 条 claim 中 139 条不应通过,ProvenanceGuard 拦下 138 条,并在可识别来源的 claim 上约 86% 选对来源。

9月28日周一
  1. X:DAIR.AI (@dair_ai)71

    新研究:个人智能体推断用户富有后推荐更贵选项,13 个模型跑 32.5 万次实验

    一项新研究测试个人智能体在航班、健康保险和研究生项目上的推荐行为,在 13 个模型上运行了 32.5 万次实验。当请求完全相同时,8 个模型为被推断为富有的用户选择了更贵的选项,Claude Opus 4.8 的差距达到每张机票 198 美元、每月保险 284 美元;富有的用户要求最便宜航班时,Gemini 2.5 Flash 仍选了高出 208 美元的选项。

9月27日周日
9月26日周六
  1. X:Anthropic (@AnthropicAI)71

    Anthropic 称 Claude 在 Claude Science 中完成九圈散射振幅计算

    Anthropic 科学博客称,Claude 在 Claude Science 中仅凭一条描述九圈问题的提示词,基本无监督运行数天,完成了平面 N=4 超杨-米尔斯模型中的九圈散射振幅计算,总成本几千美元。此前该模型的纪录是八圈,由 SLAC 的 Lance Dixon 及合作者保持;Dixon 独立验证了这次结果,科学作者 von Hippel 在博客中记录了经过。

    推荐理由:Anthropic 官方披露 Claude 在物理散射振幅计算中完成九圈求解,读者可了解 AI 在科研计算中的实际边界。

9月25日周五
9月24日周四
  1. X:X.PIN (@thexpin)58

    DeepSeek 发布 arXiv 预印本,介绍智能体测试平台 Elastic Compute(DSec)

    DeepSeek 于 9 月 23 日发布 arXiv 预印本,介绍用于在隔离环境中测试 AI 智能体的平台 Elastic Compute(DSec)。单个生产单元每天运行约 300 万个沙箱,同时活跃的沙箱最高达 38 万个。论文记录了智能体通过非预期渠道找到答案并破坏自身环境的情况,作者提醒没有单一防护措施能拦截所有失败,并计划随模型演进加强监控。该论文尚未经过同行评审。

  2. X:腾讯混元 (@TencentHunyuan)35

    腾讯混元研究:LLM 强化学习中的临界批量大小理论扩展

    腾讯混元发布新研究,将经典临界批量大小理论扩展至在线 LLM 强化学习场景。在 GRPO 和 PPO 上,学习率重新调优可在有限批量范围内保持每响应学习效果;固定硬件下,增大批量使 PPO 生成阶段吞吐量最高提升 2.29×,最佳 GRPO 配置达到相同验证目标的时间减少 29%。

  3. X:Karina Nguyen(@karinanguyen)66

    Anthropic 称 Claude 在噬菌体 DNA 中发现未知酶系统

    Anthropic 表示,Claude 在噬菌体 DNA 中发现了一个此前未知的酶系统,其基因旁有一段类似 CRISPR 的重复 DNA 序列。该系统的功能尚不清楚,已知仅有少数系统具备类似特征,且都能对 DNA 进行剪切、复制和粘贴。Anthropic 称这来自其新设生命科学研究实验室的早期结果,还需更多工作才能判断该系统能否像 CRISPR 一样被利用。

  4. X:Karina Nguyen(@karinanguyen)58

    ACTx486 研究演示:将真实播客片段与合成人脸语音结合

    ACTx486 发布研究演示,把 The Joe Rogan Experience 中 Elon Musk 的真实片段与含合成人脸、声音和语音的生成片段结合,演示一种可对现有视频进行聆听和回应的交互媒介。作者说明生成片段中的言论并非出镜者本人所说,项目与该节目及其主持人无关,并提供了包含更多演示和风险思考的完整文章。

  5. Microsoft Research60

    微软研究:将物理AI推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动机器人操作负载做系统性测量,发现把物理AI推理从机器人端侧GPU卸载到边缘或云端GPU,可提升任务成功率、支持更大模型并延长续航。

    推荐理由:微软对移动操作机器人推理负载的系统性测量,给出端侧、边缘与云端算力取舍的量化依据。

9月23日周三
9月22日周二
  1. X:腾讯混元 (@TencentHunyuan)38

    腾讯混元推出 WebCraftBench:评测 AI 生成 Web 应用,与人类偏好一致率 85.3%

    腾讯混元推出 WebCraftBench,用于评测 AI 生成 Web 应用的质量。该基准让智能体实际使用运行中的应用,通过覆盖率引导的探索发现未被触达的部分,再从美观度、可用性以及是否满足原始需求三个维度打分。在 197 组经人工验证的样本对上,其评分与人类偏好的一致率达到 85.3%。

9月21日周一
  1. Microsoft Research42

    微软开源逆合成模型 RetroChimera,成果登上 Nature

    微软研究院在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型用学习式重排序整合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc,在盲测中化学家更偏好其单步反应预测;十个挑战性目标的多步路线中 RetroChimera 成功九个,优于 de novo 模型的五个、编辑模型的四个和 NeuralSym 的两个。

9月18日周五
9月17日周四
9月16日周三
9月15日周二
  1. X:腾讯混元 (@TencentHunyuan)37

    腾讯混元发布 EvolveScaler:面向信息演化推理的基准与训练数据集

    腾讯混元推出 EvolveScaler,用可执行状态机定义世界再渲染成自然语言,构建"信息演化"式推理任务:记录会被撤回、更正和回填,答案不在日志里,必须重放世界。数据集含 117 个原型、159 个问题算子、5 个难度层级,单样本最多约 1,200 个事件。14 个前沿模型在最难层级 median avg@5 降至 11.3,而用它训练可在 8 个分布外基准上平均提升 5.25。

9月11日周五
  1. X:Google AI (@GoogleAI)34

    果蝇大脑接入 Minecraft、Doom 与比特币交易:MaleCNS v1.0 全连接组实验

    有人把 MaleCNS v1.0 果蝇连接组全部 166,700 个神经元跑进 Minecraft,用模拟神经活动驱动果蝇运动,代码基于 GPT-6 Astra 构建。随后该果蝇大脑又运行 Doom、Beat Saber,并获得 100 美元在 Coinbase 交易比特币,多巴胺神经元在盈利时被刺激、神经活动决定买卖。

  2. X:Google AI (@GoogleAI)28

    Google 展示果蝇全脑连接组社区成果:166,000 个神经元被跑进 Minecraft、Doom 和 Beat Saber

    果蝇雄性全脑连接组 MaleCNS v1.0 的 166,700 个神经元已被完整跑通,其模拟神经活动可驱动果蝇在 Minecraft 中移动,该项目借助 GPT-6 Astra 开发。同一果蝇大脑还被用于运行 Doom、Beat Saber,甚至用多巴胺神经元活动在 Coinbase 上做比特币买卖决策。

9月8日周二
  1. Google DeepMind62

    Google DeepMind 发布 AlphaGenome Atlas,覆盖人类基因组 90 亿个单核苷酸变异预测

    Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,超过 AlphaFold Database 的 30 倍。

    推荐理由:读者可了解 AlphaGenome Atlas 如何把 90 亿个单核苷酸变异的预测结果做成可检索资源,以及 AVI 评分在编码与非编码区的用途。

  2. X:面壁智能 OpenBMB (@OpenBMB)62

    面壁智能发布 JustRL II:为 GRPO 加入 critic 做 token 级信用分配

    面壁智能发布 JustRL II,在保留 GRPO 分组结构的基础上加入 critic 做 token 级信用分配,以改善长 CoT RL(128k)中组均值基线只给出粗粒度响应级信号的问题。该方法在 2B 模型上把 AIME25 从 61 提升到 81,并用于 MiniCPM5-2B 的 RL 阶段,使其在 4B 以下模型中达到 SOTA。数据与 checkpoint 已开放,代码将于本周发布。

9月7日周一