軌道資料中心是否能承載最大、最強大的大型語言模型(LLM),其可行性仍備受爭議。然而,LLM 在太空中的應用不限於需要數千個 GPU 的龐大部署。美國太空總署(NASA)噴射推進實驗室近期成功將 Google 的 Gemma 3 送上太空,首次在軌道上展示了視覺語言模型分析衛星自身感測器影像的能力。

這套名為 NAVI-Orbital 的系統,利用 Gemma 3 分析由 Loft Orbital 製造的 YAM-9 衛星所拍攝的影像。NASA 技術組組長 Juan M. Delfa 表示,儘管此次目標是影像分析,但該專案的成功意味著地面研究人員與太空船互動方式將產生根本性的轉變。

Delfa 說:「這是一個重大轉變。」他補充道:「現在,科學家可以撰寫提示詞,將其上傳至太空船,系統就會將其納入考量。這與以往研究人員必須撰寫非常結構化的指令,並需要操作團隊和流程的模式截然不同。」

NAVI-Orbital 的核心是由 Delfa 及其共同作者——NASA JPL 的 AI 研究員 Taran Cyriac John 和 Loft Orbital 的技術主管 Andrew W. Herson——開發的代理軟體框架。它透過基於 LangGraph 的協調器來協調操作,並部署了 Google Gemma 3 4B 的壓縮 4 位元格式(一個開放權重 LLM),以生成純文字的影像描述。

NAVI-Orbital 在包含 7,960 張影像的基準資料集上進行分類時,準確率達到 88%。值得注意的是,Gemma 3 在未經此特定資料集或其類別訓練或微調的情況下,便能對影像進行分類;它與您可以從 Hugging Face 下載並在筆記型電腦上使用的基礎模型完全相同。這項基準測試是在發射前於地面進行,以驗證系統的有效性。

系統進入軌道後,NASA 研究人員利用 Loft YAM-9 衛星上的攝影機進行了兩次即時拍攝測試:一次在法國土魯斯上空,另一次在阿根廷海岸上空。Gemma 3 為每張影像生成了文字描述,NASA 也向 LLM 提出了一系列預設問題,例如影像是否包含商業或住宅區,或是否顯示自然景觀。

影像分析同樣在 YAM-9 衛星上進行,該衛星搭載了一個由多個抗輻射處理器(FPGA、CPU 和 GPU)組成的運算叢集,可同時為多個客戶酬載提供服務。衛星由太陽能板供電,根據衛星位置,為機載系統提供 150 至 500 瓦的電力。

在即時拍攝實驗中,Gemma 3 運行在 Nvidia Jetson Orin AGX 上,這是一個常用於機器人技術和 AI 任務的小型運算模組。這個 4 位元、40 億參數的模型僅需 8 GB 記憶體,使其能夠在像 Orin AGX 這樣的低功耗設備上運行。Delfa 表示:「這傳達了它有多麼輕量化的訊息。你可以在一個非常非常小的電腦上運行它。」

Loft Orbital 總經理 Paul Lasserre 表示,具備視覺能力的 LLM 可以為軌道操作帶來「典範轉移」。與間諜電影所呈現的不同,大多數衛星無法向地面觀察員提供快速、高傳真的影像和視訊饋送。頻寬通常有限,而且在大多數情況下,衛星只能根據其軌道在設定的時間間隔內將資料傳輸到地面站。Lasserre 相信 AI 模型可以透過「語義壓縮」來解決這個問題。

衛星不再傳送大量的原始影像資料,而是可以回報值得注意資訊的文字摘要。Lasserre 說:「連結速度慢也沒關係,因為你下載的是數十 KB,而不是數十或數百 MB。」他補充道:「這讓你可以用戰術性的方式使用衛星,這在以前只有好萊塢電影中才看得到。」

Delfa 以真實世界的野火偵測為例進行了闡述。目前衛星能夠偵測野火,但下行頻寬和資料處理的限制可能導致結果延遲長達 90 分鐘。如果衛星能夠在太空中分析影像並回報純文字警告,便可能消除這種延遲。

更快速的洞察力只是 NAVI-Orbital 所指向的一半。另一半則與 Delfa 所強調的「重大轉變」有關,NAVI-Orbital 為與太空船互動的替代方式提供了概念驗證。

這並不是說 Google Gemma 3 目前正在控制太空船。NAVI-Orbital 被刻意與飛行軟體隔離。它讀取影像並生成描述。該系統有能力決定如何分析影像,但除此之外沒有其他存取權限。

儘管如此,這個介面仍是新穎的。要重新調整系統以搜尋不同類型的目標(例如野火),只需編輯文字提示詞即可。這不需要重寫和重新驗證機載軟體,也不需要訓練和部署不同的 AI 模型(這在以前的影像分類模型中通常是必需的)。

這項能力部署的長期願景超越了無人衛星和影像處理。Delfa 表示,NAVI 的根源在於思考 AI 如何能成為太空人的伴侶。他說:「我們認為,太空人在太空衣中在靈巧度方面有很多限制,因此我們構思了讓 NAVI 作為太空人伴侶的想法,以允許透過自然語言進行互動……這絕對是我們希望推進的概念。」

要將這項技術推進到如此程度,還需要大量的額外研究,但 NAVI-Orbital 的演示已經表明,在太空中部署大型語言模型並透過提示詞控制這兩個要素是可行的。