跳到正文

#Microsoft

今日 2 条
今天10月6日周二
10月5日周一
  1. rohanpaul_ai57

    微软一篇新论文提出,编码智能体无需中心管理者:在 ProgramBench 的 200 项任务中,让智能体自行认领任务的无管理者团队规模从 1 扩展到 128 个智能体时,平均得分在每一步都有提升,即使在最难的 5 项任务上也是如此。

    推荐理由:编辑精选:介绍通过共享工具协调的无中心编码智能体团队,具有明确的工程实现与评测场景。论文转述尚未提供大团队成本,不能仅凭得分判断性价比。

10月4日周日
  1. Hugging Face Blog71

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态而非生成文本给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,按终端后端状态和副作用而非生成文本打分,覆盖 507 个有状态业务流程、每个任务重复运行 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用 507 个有状态工作流和 20 次重复运行,把工具调用成功率与数据库终态正确率区分开来。

10月3日周六
  1. dair_ai57

    微软一篇新论文提出 FOCUS 方法,在测试时压缩智能体上下文:它判断智能体的下一次决策实际依赖哪些历史交互,保留这些单元并丢弃其余部分。该方法无需训练数据或微调,可作为独立层置于闭源 API 模型之前;在工具调用、QA、网页和多轮对话基准上,相比使用完整历史,峰值上下文最多减少 48%,任务成功率最多提升 8.9 分。论文地址:academy.dair.ai/papers/focus…

10月1日周四
  1. Microsoft Research34

    微软研究院用机器学习预测电网空间天气风险

    微软研究院实习生开发了一套端到端机器学习流水线,为美国本土 66,935 座变电站生成空间天气风险预测,可提前 30 至 60 分钟预警。系统结合 AE 与 Dst 指数预测、地质电导率和电网数据,在 2020-2026 评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。

9月29日周二
  1. Microsoft Research62

    微软研究院推出 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院推出 Quine,一个面向生物学复杂性的 AI 研究系统,由生物学世界模型和连接模型、科学工具、文献与研究者的交互式 harness 两部分组成。该系统与 Broad Institute 合作用于胰腺导管腺癌(PDAC)研究,从数千个化合物中筛选并优先排序可驱动肿瘤细胞状态转变的候选物,最高排名的化合物在湿实验中产生了最大的预期状态转变,整个流程仅用一个周末完成。

    推荐理由:微软研究院公开 Quine 的生物学世界模型与实验编排框架,并给出胰腺癌化合物筛选的湿实验验证结果。

9月24日周四
  1. Microsoft Research60

    微软研究:将物理AI推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动机器人操作负载做系统性测量,发现把物理AI推理从机器人端侧GPU卸载到边缘或云端GPU,可提升任务成功率、支持更大模型并延长续航。

    推荐理由:微软对移动操作机器人推理负载的系统性测量,给出端侧、边缘与云端算力取舍的量化依据。

9月21日周一
  1. Microsoft Research42

    微软开源逆合成模型 RetroChimera,成果登上 Nature

    微软研究院在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型用学习式重排序整合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc,在盲测中化学家更偏好其单步反应预测;十个挑战性目标的多步路线中 RetroChimera 成功九个,优于 de novo 模型的五个、编辑模型的四个和 NeuralSym 的两个。

9月2日周三
8月21日周五
  1. Hugging Face Blog62

    Hugging Face 研究:语音识别模型存在基准优化问题

    Hugging Face 发布研究,用共识分歧、掩蔽实体检索和拼写切换三项探针量化语音识别中的基准优化现象,评测 11 个开源 ASR 模型。结果显示,部分高分模型会在音频与参考文本矛盾时复现基准的错误转写,VoxPopuli 分析样本中约 40% 的片段被标记出参考错误,涉及约 3% 的参考词,这类模型复现错误参考的比例为 18–30%。

    推荐理由:通过三项探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。

  2. Microsoft Research34

    微软 Skala 1.1 发布:训练数据增 2.5 倍,已接入 CP2K 并推进 Psi4、FHI-aims、ORCA、VASP 集成

    微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前首个公开版本的 2.5 倍,在 GMTKN55 的 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正被集成进 Psi4、FHI-aims、ORCA 和 VASP,同时微软研究院推出持续追踪各版本计算性能的 living benchmark。

8月13日周四
  1. Microsoft Research41

    MindTopo 揭示多模态大模型的空间推理能力短板

    微软研究院推出 MindTopo 基准,用于评测多模态大模型在连通性、封闭、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,模型在静态图像识别上表现明显优于交互式规划任务,且两者均远低于人类水平;失败多发生在规划阶段而非感知阶段,模型在场景变化中会丢失结构关系或提出违反物理约束的动作。图像与视频生成仅在单帧关系可见时偶有帮助,序列任务中仍不可靠。

8月12日周三
1月20日周二
11月21日周五
5月23日周一