如果你還沒聽過 AI 實驗室 PrismML,那現在是時候關注了。這並非因為它已募得巨額資金(目前僅完成 2225 萬美元的種子輪融資),而是因為其背後的技術人才,以及正在開發的潛在顛覆性技術。

PrismML 堅信,具備強大性能和推理能力的大型語言模型,實際上不一定需要龐大的體積。

他們正在打造的推理模型體積極小,足以在個人電腦和智慧型手機上運行。儘管有傳聞指出 PrismML 正與 Apple 洽談,但執行長 Babak Hassibi 拒絕向 TechCrunch 證實此消息。

週四,PrismML 發布了其模型系列中的最新成員 Bonsai 2 27B。這款模型將阿里巴巴廣泛使用的開源模型 Qwen3.8 27B 壓縮至 5.9 GB,體積小到足以在個人電腦甚至高階智慧型手機上運行。相較於原始模型,記憶體用量減少了 9 到 10 倍。

PrismML 由一群加州理工學院(Caltech)的研究人員創立,並由該校教授、壓縮技術專家 Hassibi 領導。這家新創公司也邀請了 Ion Stoica 擔任顧問。Stoica 是 Databricks(及其他公司)的共同創辦人,也是柏克萊大學著名 Sky Computing Lab 的主任,該實驗室孕育了許多技術和新創公司,包括 Letta 和 SGLang。

PrismML 的投資者包括 Khosla Ventures、Cerberus Capital 和加州理工學院。

當然,PrismML 並非唯一一家致力於 LLM 壓縮技術的公司。另一家是 Multiverse Computing,由西班牙 Donostia 國際物理中心的一位知名教授創立。(Multiverse Computing 已募得大量資金。)

然而,Hassibi 表示 PrismML 的壓縮技術獨特之處在於,其 LLM 相較於原始模型幾乎沒有性能損失。Bonsai 2 在 Qwen 的綜合基準測試中達到了 98% 的分數,高於數月前三月發布的第一代 Bonsai 的 95%。該公司表示,第一代模型已被下載超過 1100 萬次,而 PrismML 更小的模型也已累積 260 萬次下載。

這表明 PrismML 的壓縮成果在每次發布後都有所進步。至於能否達到 100% 的基準性能一致性,仍有待觀察。Hassibi 認為,壓縮技術很可能總是會帶來一些影響。

不過,完美的基準性能一致性在某種程度上仍是學術性的。未壓縮的 LLM 本身就不完全精確,且基準測試也無法完美反映實際任務,因此 2% 的性能下降不太可能顯著影響模型在實際使用中的表現。(此外,模型運行的周邊軟體環境對準確性也有很大影響。)

PrismML 表示,他們透過縮小構成模型的「權重」來實現這一目標。權重本質上是模型在訓練期間學習和儲存的資訊。通常,每個權重需要 16 位元。PrismML 的方法稱為「三元」權重,將其簡化為三個值:+1、−1 或 0。由於每個權重需要儲存的值大幅減少,模型佔用的空間也顯著縮小。(如需深入了解壓縮技術,可參考該專案的 Hugging Face 頁面。)

這家新創公司的下一個目標是將此壓縮技術應用於更大的模型。Hassibi 告訴 TechCrunch:「我們希望在未來幾個月內發布的模型,將會是數千億參數級別,我預計在這些模型上更容易保留其智慧。」

他補充說,隨著模型規模的增長,「有更大的空間可以在不損失智慧的情況下進行壓縮。因此,我會說,總體趨勢是對於更大的模型,更容易達到 100% 的效果。」

Stoica 告訴我們,他對這項技術感到興奮,因為它讓先進模型能夠在用戶的裝置上運行。「你將擁有觸手可及的智慧,而且它是免費的,因為它會在你已經購買的裝置上運行。它也將是私密的,因為你不需要將資料傳送到雲端。」