多基因風險分數(PRS)用於從基因變異預測疾病風險,通常包含數百萬個基因變異的影響。然而,其在臨床決策中的應用目前不高,部分原因是歷史上的全基因組關聯研究(GWAS)絕大多數評估的是歐洲族群,導致應用於非歐洲族群時準確性嚴重下降。這些準確性差異源於跨族群的基因結構、族群結構和變異等位基因頻率的差異。
此外,對數十萬人進行從頭開始的 GWAS 對大多數醫療系統來說成本過高。從現有的以歐洲為中心的 GWAS 進行轉移學習,並將這些大規模結果與目標族群特定的 GWAS 相結合,提供了一個潛在的解決方案。為此,在這篇部落格文章中,我們描述了一項研究,該研究評估了在非歐洲目標族群中 PRS 的表現,同時改變了用於建立八種臨床性狀預測模型的目標族群和歐洲族群的大小。
具體來說,我們評估了在英國生物樣本庫(UKB)中數十萬歐洲個體中確定的 PRS,轉移到日本生物樣本庫(BBJ)樣本中的能力。BBJ 是一個擁有近 20 萬日本個體的深度表型隊列。我們的主要目標是提供系統性的實證指導,說明應如何進行跨族群 GWAS 和 PRS 模型訓練,以優化目標族群中的預測表現。
兩個大規模、深度基因型和表型數據集(UKB 和 BBJ)的存在,使得能夠進行數據消融實驗,系統地評估 PRS 表現作為樣本量的函數。我們選擇了在兩個族群中測量的八個臨床相關性狀進行評估:身體質量指數(BMI)、收縮壓、舒張壓、紅血球計數、白血球計數、高密度脂蛋白膽固醇(HDL)、低密度脂蛋白膽固醇(LDL)和血糖。
在 UKB 中,測量的基因變異(單核苷酸多態性遺傳力)解釋的性狀變異估計比例範圍為 0.07–0.28。
使用了三種方法來評估 PRS 表現的可轉移性:UKB - 發現 GWAS + 彈性網路(elastic net):這探索了歐洲和日本族群之間變異的直接可轉移性。對於每個性狀,我們首先透過對完整的 UKB 歐洲族群運行 GWAS 來識別歐洲特有的基因關聯,並篩選出也存在於 BBJ 日本數據集中的獨立變異。
使用這些變異作為輸入,我們透過在 BBJ 和 UKB 樣本的各種組合上訓練彈性網路模型來計算目標族群的 PRS。具體來說,我們將 12-13 種 BBJ 樣本量與七種 UKB 樣本量配對,為每個性狀產生了 96-104 個 PRS 模型。
統合分析(Meta-analysis)+ 彈性網路:這探索了在變異發現過程中混合日本族群數據的影響。首先,我們對完整的 UKB 歐洲族群和抽樣的 BBJ 日本數據集運行 GWAS。然後,我們使用統合分析結合這些基因關聯,生成最終的變異集。使用這些變異,我們在混合的 UKB / BBJ 數據集上訓練彈性網路模型,以確定目標族群的 PRS。
PRS-CSx:這探索了一個旨在處理族群間連鎖不平衡多樣性的 PRS-CSx 模型。我們將 PRS-CSx 應用於完整的 UKB 歐洲樣本和抽樣的 BBJ 日本樣本,針對每個性狀。由於 PRS-CSx 模型從一個樣本中為每個族群提供兩個不同的分數,我們還分割了驗證集以找到兩個分數之間的最優線性組合。在所有實驗中,PRS 模型都在相同的保留 BBJ 樣本集上進行評估。
對於每個實驗,我們使用皮爾遜相關係數來量化模型表現。正如預期,當目標族群數據有限或不存在時,歐洲發現數據提供了一個有用的基準。然而,當樣本量達到 15,000 或更多時,目標族群特定模型表現更優,因為與外部歐洲數據共同訓練似乎限制了透過更高採樣實現的目標族群準確性提升。
這一令人驚訝的觀察結果在我們檢查的所有表型中都成立。當目標樣本量極小(例如 5,000 個樣本)時,在訓練期間匯集歐洲 UKB 數據提供了寶貴的統計助益。隨著用於訓練 PRS 模型的目標樣本量增加,外部族群匯集的益處會減弱。
雖然這種趨勢在所有表型中都成立,但使用歐洲數據的成功程度減弱的交叉點,很大程度上取決於所研究的特定性狀。我們可以透過跨族群相同性狀的基因相關性來量化「共享基因」的程度。我們觀察到「保守性」性狀,或那些在兩個族群之間具有較高基因相關性的性狀,在目標族群特定訓練數據達到同等水平之前,能從匯集 UKB 歐洲訓練數據中受益,直到更大的目標樣本量(25,000-40,000+ 個樣本)。
相比之下,血脂水平(HDL、LDL)和血糖表現出更小的 BBJ 樣本量,超過該樣本量後,最佳 UKB 樣本量會小於最大值,且最佳樣本量也更小。這些高度族群特異性的性狀從 UKB 數據中受益較少,因為該數據與目標族群分佈差異較大。
上述實驗將 PRS 模型輸入變異限制在 UKB 歐洲族群中發現的那些,排除了 BBJ 樣本獨有的任何與性狀相關的變異。為了擴展分析以捕捉這些變異,我們創建了兩種額外的預測方法。首先,我們對每個 BBJ 樣本量運行 GWAS。
第一種新方法使用完整的 UKB GWAS 和特定樣本量的 BBJ GWAS 進行跨族群統合分析,以識別候選變異,然後在這些變異上擬合彈性網路。第二種方法使用 PRS-CSx 結合兩組 GWAS 摘要統計數據。透過追蹤統合分析和 PRS-CSx 在不同發現樣本量下的淨表現增益,我們觀察到 BBJ 樣本量下的表現差異。
統合分析對保守性性狀的影響較低,這主要歸因於較小的 BBJ GWAS 樣本量導致統計功效降低。然而,對於 HDL 和 LDL 等族群特異性性狀,以及程度較輕的血糖,統合分析顯著優於單一族群發現。這些增益主要歸因於修改了彈性網路變異輸入:在訓練期間包含 UKB 歐洲樣本,當使用 10,000 個或更少的 BBJ 樣本時,預測略有改善。當 BBJ 樣本量較大時,則未見此改善。
由於 PRS-CSx 動態加權族群特定模型,其表現理論上對保守性與族群特異性性狀的敏感度較低。然而,我們觀察到該模型需要比彈性網路模型更多的數據才能表現良好。對於小於 25,000 的目標樣本量,PRS-CSx 在除 BMI 之外的所有表型中都比最強的相應彈性網路模型表現更差。當樣本量接近 100,000 時,PRS-CSx 在除血糖之外的所有表型中都與表現最佳的模型匹配或超越。
系統性評估跨族群基因預測顯示,在將多基因風險分數(PRS)應用於代表性不足的族群時,較大的外部族群數據集並不總是有益的。具體來說,雖然從英國生物樣本庫(UKB)的大型歐洲隊列進行轉移學習在目標族群樣本量較低時(日本生物樣本庫中少於 15,000 個樣本)提供了統計上的助益,但隨著 BBJ 樣本量的增加,它實際上降低了預測準確性。
這種表現交叉點取決於性狀:遺傳保守性性狀(如 BMI)從外部數據匯集中受益,直到更大的樣本量,而族群特異性性狀(如血脂和血糖)則在較少樣本時顯示出益處減弱。重要的是,像 PRS-CSx 這樣先進的多族群方法需要大量的目標族群樣本才能超越更簡單的方法,而跨族群統合分析則在較小樣本量下為族群特異性性狀提供穩健的益處。
最終,這些發現強調,在不同族群中優化預測表現將需要擴大本地、多樣化的生物樣本庫,並仔細選擇針對性狀遺傳力和樣本量量身定制的建模策略。
