Flash 系列模型大幅提升了 GigaPath 和 GigaTIME 的效率,使大規模病理學研究變得更易於執行且實用。

經過精煉的病理學基礎模型骨幹,在不犧牲效能的前提下降低了運算需求,得以對更龐大的病患群體進行重複分析。

這些開源模型支援人口規模的疾病探索,協助研究人員在多樣化的癌症數據集中,深入探討疾病生物學、生物標記和臨床結果。

GigaPath 和 GigaTIME 證明了基礎模型如何支援從常規收集的病理數據中進行全玻片分析和腫瘤微環境建模。

GigaPath-Flash 和 GigaTIME-Flash 大幅提升了這些功能的效率,讓研究人員能夠分析更大規模的群體、執行更多實驗,並邁向人口規模的疾病探索。

GigaPath-Flash 和 GigaTIME-Flash 均為研究模型,不適用於或未經臨床驗證,包括診斷、預後、治療選擇或其他病患照護決策。其效能可能因數據集、掃描儀、機構、人群和使用案例而異。

組織病理學是癌症研究中最豐富且最廣泛可用的資訊來源之一。每一次組織切片活檢都會產生一張全玻片影像,以亞細胞解析度捕捉細胞形態,而醫院每年都會產生數百萬張這類玻片。這些數據包含與診斷、預後、治療選擇以及腫瘤微環境生物學相關的資訊。

基礎模型已開始大規模地解鎖這些資訊。然而,全玻片影像通常非常龐大,甚至超過十億像素,即使將基礎模型應用於單一玻片,也需要處理數千個影像圖塊。

當研究問題涉及數萬名病患時,運算成本會迅速增加。此外,人口規模的疾病探索並非單次模型運行就能完成,它需要對病患亞群、生物標記和臨床終點進行重複的特徵提取、統計分析、假設檢定和驗證。

高昂的運算成本限制了研究人員能夠研究的病患數量、數據集、任務和假設。為了充分發揮病理學基礎模型的潛力,我們需要能夠在大規模病患群體中重複且經濟地應用的模型。

GigaPath(發表於 Nature, 2024)是一個全玻片基礎模型,它在來自 Providence 的大規模真實世界組織病理學數據上進行了預訓練。

與僅在圖塊層級運作的模型不同,GigaPath 學習整個玻片的上下文表示,捕捉局部細胞模式和整體組織結構。

GigaTIME(發表於 Cell, 2026)將這項工作擴展到腫瘤微環境。它在 4,000 萬個細胞上進行訓練,結合了 H&E 染色和多重免疫螢光 (mIF) 數據。

GigaTIME 能將常規的 H&E 影像轉換為涵蓋 21 個蛋白質通道的虛擬空間蛋白質體學圖譜。應用於超過 14,000 名癌症病患後,它建立了一個虛擬群體,發現了免疫細胞狀態與臨床生物標記之間超過 1,200 個具統計學意義的關聯。

GigaPath 和 GigaTIME 解決了病理數據和生物學發現的規模問題。而現在,Flash 系列模型則著重於解決實驗規模的挑戰。

Flash 系列模型共享一個核心設計目標:在大幅減少生成和使用所需運算資源的同時,保留有用的病理學表示。

這兩個模型都建立在一個共同的高效骨幹上,即一個緊湊的 ViT-S 圖塊編碼器,該編碼器是從原始十億參數的 GigaPath 編碼器中精煉而來,並且兩者都以 Apache 2.0 許可證發布。

GigaPath-Flash 是一個用於全玻片表示學習的高效基礎模型。它結合了一個 2,200 萬參數的 ViT-S 圖塊編碼器和一個 2,100 萬參數的 LongNet 玻片編碼器。

這個圖塊編碼器是從原始的 GigaPath ViT-g 教師模型中精煉而來,將十億參數模型的表示能力轉移到一個規模小一個數量級的骨幹中。玻片編碼器透過擴張注意力(dilated attention)對所有圖塊嵌入進行上下文化,其規模與圖塊數量呈線性關係。

在玻片級分類基準測試(PANDA 攝護腺癌分級和 EBRAINS 腦腫瘤亞型分類)中,GigaPath-Flash 在所有全玻片預訓練模型中實現了最低的推論成本。

同時,它保持了具競爭力的效能,其分數與原始 GigaPath 相差不到 3%,但運算量約減少了 50 倍。

GigaTIME-Flash 將原始 GigaTIME 的 CNN 骨幹替換為 GigaPath-Flash ViT-S 編碼器,並搭配一個輕量級的卷積解碼器,用於 H&E 到 mIF 的轉換。

該模型使用 LoRA 轉接器進行微調,同時保持預訓練編碼器的權重大致凍結。

在涵蓋腦癌、乳癌、結腸癌和肺癌的同分佈(in-distribution)和異分佈(out-of-distribution)群體中,GigaTIME-Flash 在空間蛋白質預測品質方面與原始 GigaTIME 相當或有所提升。

在異分佈數據上的表現尤為顯著,這表明基礎模型骨幹改善了對先前未見組織類型的泛化能力。

Flash 模型的效率提升是顯著的:GigaPath-Flash 作為全玻片基礎模型,相較於 GigaPath,運算量減少約 50 倍,預測效能達到 97%。

GigaTIME-Flash 在空間蛋白質體學方面,相較於 GigaTIME,速度快約 6 倍,記憶體使用量減少約 8 倍,且預測效能更佳。

對於單一玻片而言,這些差異能減少運行時間和硬體需求。而對於數萬張玻片,它們甚至能決定一項實驗是否可行。

為了說明這一點,我們估計在單一 A100 GPU 上,針對不同規模群體生成虛擬 mIF 的實際運行時間,假設每張玻片約有 10,000 個圖塊:GigaTIME-Flash 在 1,000 張玻片約需 2 GPU 小時,10 萬張玻片約需 7 GPU 天,100 萬張玻片約需 70 GPU 天。

相較之下,GigaTIME 在 1,000 張玻片約需 7 GPU 小時,10 萬張玻片約需 30 GPU 天,100 萬張玻片約需 300 GPU 天。這些估計假設每張玻片約有 10,000 個圖塊,批次大小為 128,並使用單一 NVIDIA A100 GPU。實際運行時間取決於玻片大小、圖塊解析度和硬體。

GigaPath-Flash 和 GigaTIME-Flash 都以開源權重模型(open-weight models)的形式,在 Apache 2.0 許可證下發布。

模型權重和程式碼可在 HuggingFace 上取得。

這是一個早期的研究版本。我們目前的評估僅涵蓋有限的基準測試和群體,仍需要針對不同任務、掃描儀和病患群體進行更廣泛的驗證。

我們預期這些模型最有價值的應用將包括超出我們初步實驗範圍的科學問題、群體和使用案例。我們歡迎社群進行評估,並同樣樂於接收關於這些模型表現優異和不足之處的報告。

未來的臨床應用將需要額外的多機構和前瞻性驗證。

GigaPath 和 GigaTIME 展示了病理學基礎模型能從全玻片和腫瘤組織中學習到什麼。

GigaPath-Flash 和 GigaTIME-Flash 則是朝著讓這些能力能應用於更廣泛人群、更多實驗和更廣泛研究社群邁出的一步。

透過提高病理學基礎模型的效率,我們希望能夠擴展研究人員可以提出的科學問題的規模。

GigaPath-Flash 和 GigaTIME-Flash 是 Microsoft Research、華盛頓大學和 Providence 共同合作的成果。如需技術細節,請參閱論文。

論文共同作者:Naoto Usuyama, Jeya Maria Jose Valanarasu, Sicong Yao, Hanwen Xu, Jaspreet Bagga, Guanghui Qin, Robert E. Kramer, Cliff Wong, Soohee Lee, Hao Qiu, Theodore Zhengde Zhao, Racheli Ben Shimol, Angela Crabtree, Kevin Matlock, Eduardo Alejandro Lozano Garcia, Naiteek Sangani, Alberto Santamaria-Pang, Maximilian Rokuss, Yashna Hasija, Naisargi Manishkumar Patel, Jason Entenmann, Alexandra Q. Bartlett, Bill J. Wright, Bernard A. Fox, Brian Piening, Sheng Zhang, Sheng Wang, Tristan Naumann, Carlo Bifulco, Hoifung Poon。