2026年9月3日
Joey Poomarin Phloyphisut,软件工程师;Cory McLean,高级主任软件工程师,Google Research
我们评估了改进跨群体遗传风险预测的方法,发现虽然从欧洲队列进行迁移学习能改善对小型代表性不足群体的预测,但一旦目标队列样本量增大,其准确性反而会下降,尤其是对于具有群体特异性遗传架构的性状。
多基因风险评分(PRS)用于根据遗传变异预测疾病风险。它们通常纳入数百到数百万个遗传变异的影响。然而,目前其在临床决策中的应用率较低,部分原因是历史上的全基因组关联研究(GWAS)绝大多数评估的是欧洲队列,导致应用于非欧洲人群时准确性严重下降。这些准确性差异源于遗传架构、群体结构和变异等位基因频率的跨群体差异。
此外,对数十万个体进行从头 GWAS 对大多数医疗系统而言成本过高。从现有的以欧洲为中心的 GWAS 进行迁移学习,并用目标群体特异性 GWAS 增强这些大规模结果,提供了一种潜在的解决方案。
为此,在这篇博客文章中,我们描述了一项研究,该研究在八个临床性状上,通过改变用于创建预测模型的目标群体和欧洲群体的样本量,评估了 PRS 在目标非欧洲群体中的性能。具体而言,我们评估了在英国生物银行(UKB)中数十万欧洲个体中确定的 PRS 向日本生物银行(BBJ)样本的可迁移性,后者是一个对近 20 万日本个体进行了深度表型分析的队列。我们的主要目标是提供系统性的、实证性的指南,说明应如何进行跨群体 GWAS 和 PRS 模型训练,以优化目标群体的预测性能。
两个大规模、深度基因分型和表型分析数据集(UKB 和 BBJ)的存在,使得数据集消融实验能够系统地评估 PRS 性能随样本量的变化。我们选择了在两个群体中均测量的八个临床相关性状进行评估:体重指数(BMI)、收缩压、舒张压、红细胞计数、白细胞计数、高密度脂蛋白胆固醇(HDL)、低密度脂蛋白胆固醇(LDL)和血糖。在 UKB 中,由所测量遗传变异解释的性状方差估计比例(单核苷酸多态性遗传力)范围为 0.07–0.28。
使用了三种方法评估 PRS 性能的可迁移性:
在所有实验中,PRS 模型均在相同的 BBJ 样本留出集上进行评估。
跨祖先基因组预测的实验设计。a)* 主要实验探讨了不同数量的欧洲和日本样本对弹性网络性能的影响,该网络应用于通过大规模欧洲GWAS发现的变异。* b)* 荟萃分析实验将特定人群的GWAS结果整合到用于弹性网络模型开发的变异生成中。** c)** PRS-CSx实验在各种特定人群样本量上拟合PRS-CSx模型。*
本研究中探索的八个性状在UKB和BBJ中的样本量。
对于每个实验,我们使用皮尔逊相关量化模型性能。正如预期,当目标人群数据有限或不存在时,欧洲发现数据提供了一个有用的基线。然而,在样本量达到15k或更多时,目标人群特定模型表现更优,因为与外部欧洲数据共同训练似乎限制了通过更高采样获得的目标人群准确性增益。
BBJ样本中HDL胆固醇的PRS性能作为BBJ和UKB样本量的函数:该滴定曲线展示了纳入样本外数据实际上可能降低目标人群的预测性能。超过15,000个BBJ样本的交叉点后,与仅使用目标人群数据训练相比,纳入超过5k个UKB样本会降低预测性能。
这一令人惊讶的观察结果在我们检查的所有表型中都成立。当目标样本量极小时(例如5,000个样本),在训练期间合并欧洲UKB数据提供了有价值的统计提升。随着用于训练PRS模型的目标样本量增加,群体外合并的益处减少。
虽然这一趋势在各表型中保持一致,但使用欧洲数据成功性减弱的交叉点很大程度上取决于所研究的特定性状。我们可以使用同一性状在不同人群中的遗传相关性来量化“共享遗传”的程度。我们观察到,“保守”性状,即两个人群之间遗传相关性较高的性状,在目标人群特定训练数据达到同等水平之前,保留合并UKB欧洲训练数据的益处可维持到更大的目标样本量(25-40k+样本)。
PRS在BBJ样本中的性能作为BBJ和UKB样本量的函数,针对跨人群共享遗传结构的性状:随着BBJ样本量增长超过40k,最佳UKB样本量从最大值下降。
与此形成鲜明对比的是,脂质水平(HDL、LDL)和血糖表现出更小的BBJ样本量,超过该样本量后最佳UKB样本量小于最大值,且该最佳样本量也更小。这些高度人群特异性的性状从UKB数据中获益较少,因为该数据更偏离分布。
PRS在BBJ样本中的性能作为BBJ和UKB样本量的函数,针对跨人群具有独特遗传结构的性状:与保守性状不同,这些更人群特异性的表型表现出较早的交叉点。
上述实验将PRS模型输入变异限制为在英国生物银行欧洲人群中发现的变异,排除了BBJ样本中独有的任何性状相关变异。为了扩展分析以捕获这些变异,我们创建了两种额外的预测方法。
首先,我们在每个BBJ样本量上运行了GWAS。第一种新方法使用完整的UKB GWAS和特定样本量的BBJ GWAS进行跨群体荟萃分析,以识别候选变异,然后对这些变异拟合弹性网络。第二种方法使用PRS-CSx来合并两组GWAS汇总统计量。
通过追踪荟萃分析和PRS-CSx在不同发现样本量下的净性能增益,我们观察到不同BBJ样本量下的性能差异。
对于保守性状,荟萃分析的影响较低,这主要是由于小得多的BBJ GWAS样本量导致统计功效降低。然而,对于HDL和LDL等群体特异性性状,以及程度较轻的血糖,荟萃分析显著优于单群体发现。这些增益主要归因于修改弹性网络变异输入:在使用10,000个或更少BBJ样本时,训练期间纳入UKB欧洲样本略微改善了预测。在更大的BBJ样本中未观察到这种改善。
由于PRS-CSx动态加权群体特异性模型,其性能理论上对保守性状与群体特异性性状的敏感性较低。然而,我们观察到该模型需要比弹性网络模型更多的数据才能表现良好。对于低于25k的目标样本量,除BMI外,PRS-CSx在所有表型中的表现均差于最强的相应弹性网络模型。当样本量接近100k时,除血糖外,PRS-CSx在所有表型中匹配或超过了表现最佳的模型。
UKB发现、荟萃分析和PRS-CSx模型相对于BBJ样本量的性能:荟萃分析和PRS-CSx使用的BBJ特异性GWAS结果在子采样BBJ数据集中识别。所有模型使用的UKB GWAS结果基于整个UKB欧洲数据集。
跨群体基因组预测的系统评估表明,在将多基因风险评分(PRS)应用于代表性不足的祖先群体时,更大的群体外数据集并不总是有益的。具体而言,虽然从大型欧洲队列UK Biobank进行迁移学习在低目标群体样本量(Biobank Japan中少于15,000个样本)时提供了统计提升,但随着BBJ样本量的增长,它实际上降低了预测准确性。这种性能交叉是性状依赖的:遗传保守性状(如BMI)在较大样本量下仍保留外部数据合并的益处,而群体特异性性状(如脂质和血糖)在较少样本时显示出减弱的益处。重要的是,像PRS-CSx这样的先进多祖先方法需要大量的目标群体样本才能优于更简单的方法,而跨群体荟萃分析在较小规模下为群体特异性性状提供了稳健的益处。最终,这些发现强调,优化多样化人群中的预测性能既需要扩展本地多样化生物样本库,也需要仔细选择适合性状遗传力和样本量的建模策略。
我们衷心感谢 日本生物样本库**以及我们在 理化学研究所**和 东京大学医学科学研究所**的合作者使这项研究得以开展,同时感谢谷歌的其他合作者:Babak Behsaz、Andrew Carroll、Farhad Hormozdiari 和 Taedong Yun。我们还要感谢 Hiroki Kayama 和 Joe Ledsam 提供的机构支持,以及 Michael Brenner 和 Katherine Chou 提供的领导支持。
