Hugging Face 开源 DNA 基因定位模型 Carbon-A,并发布 5.66 亿候选基因数据库
Hugging Face 联创 Thomas Wolf 宣布开源模型 Carbon-A,可直接在 DNA 中定位基因,并同步发布覆盖 22,617 个物种(从真菌到哺乳动物)的 5.66 亿候选基因数据库。
科学家们已经对成千上万个物种进行了基因组测序。但对其中大多数物种来说,没人知道*基因位于何处*。
今天,我们发布了 Carbon-A,一个能直接在 DNA 中识别基因的开源模型。我们用它构建了一个涵盖 22,617 个物种、包含 5.66 亿个候选基因的数据库,范围从真菌到哺乳动物(该数据库我们也会一并公开)。
为什么要这么做?原因有几个。
1. 大象很少患癌症。部分原因在它们的基因中找到了:它们拥有一个人类只有一份的抑癌基因的额外拷贝。在有人或某个工具找到某个物种的基因之前,你无法提出这类问题。
2. 第一款 GLP-1 药物基于一种来自希拉毒蜥(Gila monster)毒液的肽。没人会把希拉毒蜥列入优先研究清单。作物的野生近缘种也是如此,它们携带抗旱和抗病基因。这些物种中有许多从未被注释过。
3. 我们对基因的大部分认知来自大约十几个模式物种,比如小鼠、果蝇和酵母。这种聚焦策略效果显著,但注释流程仍然严重依赖与这些模式物种的比较,这使得其他物种特有的基因很容易被遗漏,而这些基因往往最有趣。
Carbon-A 属于新一代直接读取 DNA 的工具。它从已知基因组中学习,但解读一个新基因组时不需要依赖近缘物种。
4. 即使是熟悉的基因组也仍有空白。我们与 Active Site 和 UCSD 的合作方一起,为猫、鸡、仓鼠以及一种实验室植物等常见物种中参考注释缺失的 239 个基因找到了 RNA 证据。
5. AlphaFold 可以预测蛋白质的形状,但前提是有人先找到编码它的基因。在一个没有注释基因的物种中,它无从下手。
关于安全性的几点说明:
Carbon-A 不设计 DNA,也不预测基因的功能。它只标注基因在 DNA 中的位置。这也是我们认为开源发布是正确决定的原因之一。
更多注释也有助于健康研究:许多携带或引发疾病的物种都在覆盖范围内,而针对它们所传播疾病的研究往往从其基因入手。
模型、数据库及更多细节见 Georgia 的推文串 👇
来源:Thom_Wolf · x.com