跳到正文

全部动态

今日 38 条
今天10月3日周六
  1. X:Cohere(@cohere)22

    Cohere 用 RCP-nDCG@10 评估 Embed 5,改进真实检索质量评测

    Cohere 的 Embed 5 成为首个采用 RCP-nDCG@10 评估的模型家族,该新方法不再只认可基准答案键中已有的结果,而是对每条结果按实际相关性打分。Cohere 称 RCP-nDCG@10 的结果由人工评审和 MTEB 背书,并将于 10 月 8 日(周四)在 X Live 举办网络研讨会,讨论 RCP-nDCG@10、Embed 5 以及搜索与检索的未来。

  2. X:Google DeepMind (@GoogleDeepMind)62

    Google DeepMind 发布 SynthID Bio,为 AI 生成的蛋白质序列嵌入水印

    Google DeepMind 发布 SynthID Bio,这是一组面向 AI 生成生物设计的水印方法,可将不可感知的签名直接嵌入蛋白质序列而不影响其生物功能。该水印类似数字身份证,帮助 DNA 实验室验证合成蛋白质并保持序列数据库准确。这些工具以开放方式发布,供研究使用,以加强生物安全防护。

  3. X:Google DeepMind (@GoogleDeepMind)66

    Google DeepMind 发布 SynthID Bio,可在蛋白质序列中嵌入水印

    Google DeepMind 发布 SynthID Bio,这是一组面向 AI 生成生物设计的水印方法,可在不影响生物功能的前提下把不可感知的签名直接嵌入蛋白质序列。该水印类似数字身份证,可帮助 DNA 实验室验证合成蛋白质并保持序列数据库准确,相关工具以开放形式供研究使用。

    推荐理由:原文给出 SynthID Bio 的嵌入方式与开放研究入口,读者可据此了解 AI 生物设计溯源的具体做法。

  4. X:Arena (@arena)69

    小米 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash 进入 Agent Arena 榜单

    小米 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 进入 Agent Arena,Pro 在开源模型中排名第 5,在 8.1K+ 真实智能体会话中净提升 +3.17%,较 MiMo-V2.5-Pro 的第 13 名提升 9 位、提高 10.4 个百分点。

    推荐理由:Agent Arena 的实测排名与成本数据,可用来对比 MiMo-V2.6 两个版本在真实智能体会话中的表现差异。

  5. X:OpenRouter (@OpenRouter)56

    微软 MAI-Voice-2.1 语音模型上线 OpenRouter

    微软 AI 的 MAI-Voice-2.1 已在 OpenRouter 上线,官方称其为 MAI 迄今保真度和表现力最高的文本转语音模型。该模型支持同一音色以 23 种语言说话并保持母语口音,定价为每 100 万字符 22 美元,面向有声书、播客、旁白和品牌音频场景。

  6. X:Arena (@arena)66

    GPT-6.1 Sol 进入 Agent Arena 第 5 名,重塑帕累托前沿

    Arena 宣布 OpenAI 的 GPT-6.1 Sol (Max) 进入 Agent Arena 第 5 名,提升 11.23%,并重塑帕累托前沿。其单任务中位成本为 $0.56,比 GPT-6 Sol 低 39% 且得分高 1.52 分,比 GPT-6 Astra 低 81% 且得分差距 1.04 分。

    推荐理由:Agent Arena 榜单显示 GPT-6.1 Sol 以更低单任务成本进入前五,读者可据此比较它与 GPT-6 Sol、Claude 系列的性价比差距。

10月2日周五