我最近遇到一些傑出的俄羅斯數學家,他們向我展示了一種讓人工智慧模型透過類似「機器心電感應」的方式進行溝通的方法。

這些數學家為一家名為 Mostik 的新創公司工作,Mostik 在俄語中意為「橋樑」。這個名字呼應了他們的方法,該方法允許不同的模型利用其權重中的數學值進行互動,這些權重決定了提示詞如何轉換為輸出。實際上,這意味著大型模型的能力可以更有效地傳遞給小型模型,從而大幅提升其智慧。

這家新創公司利用這種方法建立了一個模型,該模型在 ARC-AGI 3 這項以難度著稱的 AI 模型競賽中名列前茅。(他們不願透露更多細節,因為他們想贏得比賽。)然而,為了展示這個概念,他們也在兩個中國開源權重模型之間建立了一座橋樑:一個是擁有 7,530 億參數的最大版本 GLM-5.2,另一個是可在行動裝置上運行的 40 億參數版本 Qwen-3.5。

由此產生的混合系統成本僅為完整 GLM 模型的二十分之一,而其性能恰好介於兩者之間。「在機器學習領域,眾所周知,模型集成(ensembles of models)的表現優於單一模型,」Mostik 的執行長 Sasha Malysheva 在喝咖啡時告訴我。

Malysheva 開發了這種方法,並分享了公司內部的一個笑話:AI 的未來類似於猜測豬的體重。在數學界眾所周知,當少數隨機人員的猜測被組合和平均時,他們估計豬的體重會比專家更準確。

就像集體估測豬隻體重一樣,結合多個 AI 模型的輸出通常能獲得更好的結果。通常,這涉及將一個模型的輸出輸入到另一個模型,這會耗費大量的時間和金錢。然而,Mostik 團隊找到了一種讓 AI 模型無需產生文字輸出即可相互溝通的方法。如果這種方法普及,它可能會增加開源權重模型的價值,使其能更好地與 Anthropic 和 OpenAI 等頂尖實驗室提供的閉源專有模型競爭。

Malysheva 表示,結合許多不同的模型可能是一種更好的推進 AI 的方式。「我個人不認為我們(未來)會有一個單一巨型模型,也不認為模型的能力會來自於擴展規模,」她告訴我,她指的是讓模型更大並餵給它們更多資料的策略。

「如果 Mostik 能讓頂尖模型與領域專屬模型(例如生物學、物理學等)配對,那麼將會有更多專業模型被訓練出來,」AI 軟體公司 Lovable 的技術主管 Vladimir Arustamian 說道,他認識 Mostik 團隊。「這個團隊才成立幾個月,就已經有了一些我原以為需要數年才能實現的成果。」

Mostik 的技術意味著「你可以在不讓大型模型處理整個運作迴圈的情況下,達到大型模型的品質,只需一個小型模型在旁運行,就能帶來實質性的改進,」Google DeepMind 前電腦科學家 Karl Tuyls 說道,他熟悉該公司的技術。Tuyls 表示,對於任何需要盡可能高效運行模型的人來說,這種方法都是不二之選。

日內瓦大學教授、2010 年費爾茲獎得主 Stanislav Smirnov 是 Mostik 的首席科學家。他表示,在兩個 AI 模型之間找到共同點出奇地困難。「似乎還沒有合適的數學語言,」他說。在此過渡期間,Mostik 的方法確實是一種彌補差距的方式。