DeepMind通过AI解析人类基因组中的90亿种变异数据发布
二十多年前,随着人类基因组计划的完成,科学家首次获得了由30亿个DNA碱基组成的“生命之书”。如今,真正的挑战不仅在于识别这些碱基,还在于理解它们各自的功能,以及突变对生物的影响。最近,Google旗下的DeepMind利用人工智能技术,对这些变异进行了系统计算,形成了一个规模约为1PB的数据集,数据量是AlphaFold数据库的30倍。该数据集已通过一个免费平台向科研人员开放,供非商业性使用。9月8日,DeepMind推出了AlphaGenome Atlas,这一成果基于今年早些时候在《自然》杂志上发布的基因组AI模型AlphaGenome。研究团队对人类参考基因组中超过90亿种可能的单碱基突变进行了预计算,并预测这些变异可能对基因表达、RNA剪接及染色质状态等方面造成的影响。90亿这个数字并不复杂。人类单倍体基因组拥有约30亿个碱基对,每个位点的碱基可为A、T、C或G中的任意一种。如果在某个位点的碱基发生变化,每个位置还可以替换为其他三种碱基。因此,30亿个位置对应大约90亿种单碱基的变异。
人类基因组中,只有大约2%的部分直接编码蛋白质,其余的98%大多为非编码区域。这些区域在基因调控中扮演着重要角色,决定基因在何时、何地以及以何种程度被表达。很多与疾病和性状相关的遗传变异就在这些非编码区域中,相较于编码区域,这些变异的解读更加复杂。现有的分析方法各有千秋。一些方法能够结合染色质开放、转录因子结合等实验数据,识别可能的调控DNA区域,但难以进一步确定具体哪个碱基的变化产生了影响;另一些方法依赖于跨物种的进化保守性,可能对一些人类特有或迅速进化的功能位点不够敏感。此外,一些综合算法虽能整合大量基因组数据给出总体评分,但却无法明确指出变异影响了哪些具体的分子过程;而由于整个人类基因组的变化可能性高达数十亿,逐个实验验证的成本则变得不可行。
AlphaGenome正是针对这一需求而发展。该模型最初于2025年推出,今年1月正式在《自然》杂志上发表。其目标是解决基因组研究中的基本问题:给定一段DNA序列,可以预测该序列相对应的多种分子特征。AlphaGenome能够一次性读取约100万个碱基,并预测染色质开放、转录因子结合、组蛋白修饰、RNA剪接、基因表达和染色质的三维接触等多重指标。通过对变异前后的预测结果进行比较,研究人员能够评估特定变异可能对生物过程造成的影响。然而,要想将这一能力扩展到整个人类基因组,面临着庞大的计算挑战。因此,研究团队进一步建立了AlphaGenome Atlas,利用AlphaGenome对人类参考基因组中的90亿种可能单碱基变异进行了预先计算,并将结果汇总成可供查询的资源。
为了实现如此大规模的计算,DeepMind的基因组学负责人Žiga Avsec在接受采访时表示,团队最初预估需要将计算效率提高约80倍。最终,研究人员通过模型蒸馏、GPU计算优化和减少重复计算等方式成功完成了这项任务。对于科研人员来说,最大的改变是,他们不再需要亲自运行AlphaGenome来获得部分预测结果,而是可以直接从Atlas中进行查询。
然而,单凭保存90亿种变异的预测结果仍旧不足。对于遗传学研究而言,面对如此庞大的候选变异,如何选择优先研究的对象也是一个重要课题。因此,研究团队推出了AVI(AlphaGenome Variant Impact)变异影响评分。AVI结合了AlphaGenome对基因调控影响的预测与DeepMind早前开发的AlphaMissense对蛋白质影响的分析,将不同层面的信息整合成一个评分,以帮助研究人员进行变异筛选与排序。该评分适用于蛋白编码领域和非编码区域。同时,Atlas还提供AVI特征归因,研究人员在得到分数后,能够进一步了解该分数主要来源于哪些预测特征,例如RNA剪接、基因表达和染色质开放等,从而探索变异影响的潜在分子机制。因此,AVI不仅仅是一个简单的“致病分数”,更是帮助研究人员识别出哪些变异可能具有更显著的分子影响,并为后续实验提供优先级和机制提示。此外,AlphaGenome Atlas还整理了2500多种反复出现的DNA短序列。