在能夠選擇性靶向 DNA 的系統被發現數十年後,我們正逐漸看到基於基因編輯的首批療法。這些發展面臨的一大挑戰是安全性。儘管我們可以讓它們對目標基因具有高度特異性,但人類基因組非常龐大,即使是罕見的 DNA 序列也可能偶然出現數次。

因此,所有原始的基因編輯系統都存在所謂的「脫靶效應」,即它們會編輯到錯誤的序列。這可能是一個低機率事件,但如果編輯足夠多的細胞(療法通常需要編輯大量細胞),錯誤就變得不可避免。

許多努力都投入在尋找最小化或消除脫靶編輯的方法。在最新一期的《Nature》期刊中,研究人員描述了如何修改 AI 蛋白質摺疊軟體 AlphaFold,以幫助識別基因編輯蛋白中導致脫靶效應的關鍵區域。隨後,這些區域被修改以減少問題。

基因編輯系統有三個關鍵組成部分。第一個是引導 RNA,它可以與目標基因組序列進行鹼基配對。可以設計許多引導 RNA,它們都針對同一個基因;因此,使系統更安全的一種方法是選擇與其他基因組位置沒有太多相似性的序列。這現在已廣泛用於基因編輯系統的基本設計過程。

第二個組成部分是 Cas 蛋白,其名稱源自 CRISPR 系統的 Cas9 蛋白。它與引導 RNA 和基因組 RNA 相互作用,並有助於增強這些相互作用的特異性。如果 RNA 和 DNA 之間的鹼基配對存在太多不匹配,Cas9(或其他 Cas 家族成員)就不會黏附在那裡。各種方法已促使 Cas 家族成員得到改進,從而降低了脫靶編輯的傾向。

該系統的最後一個關鍵組成部分是當 Cas9 與 DNA 結合時,與其相互作用並修改 DNA 的蛋白質。在原始的 CRISPR 系統中,這會切斷雙螺旋的兩條鏈,造成難以控制的損傷。研究人員此後修改了其他蛋白質,使其與 Cas9 相互作用,但能催化對 DNA 更為精細的改變,例如切除單一鹼基或進行化學修飾以改變其鹼基配對方式。

總體而言,引導 RNA 與基因組之間的鹼基配對長度約為 18 個鹼基。這在隨機 DNA 序列中大約每 700 億個鹼基才會出現一次,而我們的基因組只有約 30 億個鹼基。按此衡量,我們應該是安全的。但事實證明,Cas9 即使在少量鹼基錯配的情況下,仍能黏附在 DNA 上。

可容忍變異的確切鹼基數量和位置可能有所不同,這使得難以提前識別哪些引導 RNA 可能構成危險。改善安全性的一種途徑是更好地理解這些脫靶相互作用是如何發生的。

這項新研究的團隊來自中國多個機構,他們預先推導出了他們的方法。一個完美匹配的 DNA-RNA 雜合體會呈現一種結構,而帶有一個或多個錯配鹼基的雜合體則會呈現略微不同的結構。演化已將 Cas9 的結構最佳化,使其黏附於前者。但顯然,它並未阻止 Cas9 採取略微不同的構象,從而與錯配結構相互作用。如果我們能識別 Cas9 中介導這些問題相互作用的部分,我們就可以修改並潛在地阻斷它們。

該團隊的第一步是建立一個龐大的脫靶編輯位點資料庫。他們透過使用一種改良的 CRISPR 系統來實現,該系統將 DNA 鹼基腺嘌呤轉化為相關化學物質肌苷,然後分離出任何含有它的 DNA 片段。他們用 10 種不同的引導 RNA 重複了這個過程,並分析了每種引導 RNA 的大量修改過的 DNA 片段,以獲得脫靶序列類型的廣泛圖像。

下一步是使用基於 AlphaFold AI 的蛋白質摺疊軟體,檢查 CRISPR 複合體如何與這些脫靶位點相互作用。更新版本被設計用於處理蛋白質與核酸之間的相互作用,以及多個蛋白質的複合體。因此,該團隊將目標 DNA 序列、引導 RNA、Cas9 序列以及一種能化學修飾鹼基並能黏附於 Cas9 的酶的版本輸入 AlphaFold。不幸的是,它卡住了,將其中一個蛋白質放置在明顯錯誤的位置。

該團隊沒有氣餒,簡化了輸入,只將 DNA、RNA 和 Cas9 蛋白輸入 AlphaFold,因為 Cas9 是決定其序列特異性的主要因素。這樣效果好得多,產生了一個與實際核酸和蛋白質實驗確定的結構相符的結構。透過比較 AlphaFold 在輸入不同靶上和脫靶位點時生成的結構,研究人員發現了一個普遍模式。

許多(約三分之二)的脫靶位點導致 Cas9 蛋白採取略微不同的結構。但幾乎所有(超過 95%)的脫靶位點都改變了哪些胺基酸與 RNA 接觸。因此,顯然有些情況下 Cas9 保持其正常結構,但其內部的胺基酸會以適應脫靶位點錯配鹼基的方式彎曲。

方便的是,AlphaFold 已經設定好識別所謂的「接觸機率」,即任何兩個項目(例如胺基酸或核苷酸)在非常小的距離(八埃)內的機率。研究人員可以將靶上和脫靶位點的接觸機率分析結果進行比較,精確識別當引導 RNA 和 DNA 之間存在不匹配時,Cas9 中哪些胺基酸的接觸發生了改變。他們將這種電腦化分析設定稱為「ContactSeek」。

ContactSeek 本身傾向於產生一份龐大的胺基酸列表,這些胺基酸在與脫靶位點結合時會發生位移。因此,研究人員將重點放在 Cas9 蛋白中這些胺基酸聚集的區域,認為這是一個跡象,表明這些區域正在適應錯配鹼基引起的差異。隨後,他們開始測試在這些位點具有不同胺基酸的 Cas9 版本。

總共,研究人員進行了 23 種不同的替換,將不同的胺基酸置於他們透過 AlphaFold 工作識別出的 10 個關鍵位置之一。這使他們找到了一個在匹配目標序列的位點上活性與正常 Cas9 相似的變體,而其脫靶活性從 28% 下降到 5%。當研究人員使用不同的引導 RNA 時,也獲得了類似的結果。他們還表明,該方法適用於使用不同 Cas 蛋白(Cas12)識別 DNA/引導 RNA 組合的類似系統。

如上所述,其他研究團隊已使用不同方法,例如定向演化,來開發較不易發生脫靶編輯的 Cas9 變體。與這些變體進行測試時,新設計的版本傾向於產生相似甚至略好的活性和特異性。這裡最大的不同是,這種方法識別出的改變可能對特定的引導 RNA/錯配組合更具特異性,而非更普遍有效。

當然,這裡識別出的一些單獨改變有可能與先前開發的 Cas9 版本中的改變結合,以實現更大的改進,儘管這項研究並未進行測試。無論如何,這項工作潛在有用,因為它描述了一種通用方法,可以生產專門用於預防已知脫靶事件的基因編輯系統。如果這最終成為開發療法的瓶頸,這項工作可能是一個重大突破。但研究人員也指出,這種方法更普遍地適用於微調蛋白質-DNA 相互作用,這可能在基因編輯之外有更廣泛的應用。