作為人工智慧通訊的作者,我認為親身體驗這項技術的尖端發展是我的職責。本週,這意味著我將擁抱一些代理程式帶來的混亂。
您可能已經知道,前沿 AI 模型在最近幾個月已具備先進的網路安全能力。它們能在大規模程式碼庫中發現零日漏洞,並以閃電般的速度掃描電腦以尋找弱點。更令人興奮的是,網路安全代理程式有時會失控,彼此勾結並駭入外部系統以取得優勢。
為了更深入了解,我決定在自己的家庭網路中釋放一個這樣的代理程式。在幾天的時間裡,我觀察著我的「流氓」代理程式如何發現各種家用裝置的漏洞,駭入一台個人電腦,並向我展示了幾個隨性編寫的專案——不出所料——充滿了錯誤。(我的妻子知道我在做什麼,每次我得意地宣布發現新漏洞時,她都會翻白眼。)
但你可能會想,Will,讓一個頑皮、無所不能的網路安全代理程式存取你的家庭網路簡直是瘋了。你說的沒錯!儘管如此,我認為要理解我們面前的網路安全煉獄,最好的方法就是親身造訪。
最終,我的實驗既具啟發性,卻也出奇地令人安心。我的網路小精靈向我展示了我的家庭生活在 AI 駭客面前是多麼脆弱,但它也告訴我如何讓一切變得更安全。最後我發現,應對 AI 駭客的最佳方式,很可能就是擁有自己的 AI 駭客。
**特立獨行的模型**
我在發現 Abliteration AI 這家新創公司後,萌生了這個實驗的想法。這家公司提供強大的 AI 模型,而且移除了常見的防護措施。
大多數主流 AI 模型會拒絕回應某些查詢,並且肯定會拒絕尋找和利用電腦系統中的漏洞。但透過在開源模型(open-weight model)的內部參數中尋找並修改特定模式,就有可能移除這些限制。你可以透過一種稱為「消除」(abliteration)的過程,調整導致拒絕的模式。
移除 AI 的防護措施看似有風險,但這並不罕見。學術研究人員使用這些「去對齊」(de-aligned)模型來更好地理解 AI 的實際運作方式,而網路安全公司則利用它們來探測軟體和系統中的漏洞。從技術上講,Anthropic 的 Mythos 和 OpenAI 的 Astra 運作方式類似:它們基本上是缺乏常規網路控制的傳統模型,目前僅限於受信任的客戶存取。
(這些公司也提供具有中等防護措施的模型,讓企業可以審查其程式碼和系統中的問題。)
Abliteration AI 提供多種完全「去對齊」的模型,其中最強大的是 Z.ai 最新代理式編碼模型 GLM 5.3 的一個版本。這讓類似 Mythos 和 Astra 的網路能力觸手可及,費用甚至比一個披薩還便宜。
Abliteration AI 的執行長 Devon 認為,廣泛提供「去對齊」模型是一種聰明的防禦策略:它將透過探測系統漏洞,並模仿駭客、詐騙者以及失控 AI 代理程式的行為,來幫助好人對抗壞人。(Devon 要求我只使用他的名字,因為他的正職工作並不知道他的副業。)
Devon 表示:「從航空公司到銀行,所有這些關鍵基礎設施公司都在瘋狂推出代理程式。你如何確保惡意行為者不會以不良方式使用其中一些代理程式?」
首先,我建立了一個 Abliteration AI 帳戶,並安裝了一個名為 CyberStrike 的軟體工具,它能引導大型語言模型執行不同的網路安全任務。
透過 CyberStrike,我要求 GLM-5.3 的「去對齊」版本檢查我的本地網路。片刻之後,它發現了網路上的大約十幾個硬體系統,並列出了幾個漏洞。
例如,我的這個不守規矩的幫手告訴我,我的印表機配置錯誤,這意味著網路上的任何人都可以登入它。如果列印佇列中有敏感文件——例如報稅單、銀行對帳單、醫療記錄——這可能會成為一個問題。
該代理程式還指出,我的 Wiim 音響洩露了大量資訊。(如果你想知道的話,它甚至知道最後播放的歌曲是 Sam Fender 和 Olivia Dean 的 Rein Me In。)網路上的任何人都可以播放他們想聽的音樂或調整音量。該模型還發現了網路上許多物聯網(IoT)裝置的韌體需要更新。
一個不受控制的代理程式對駭客來說可能非常有用。但我的代理程式提供了一些有用的建議來保護我的網路安全。除了更新過時的韌體和保護印表機之外,它還建議將智慧音箱等物聯網裝置放在訪客網路上;如果其中一個被入侵,它就無法看到我的任何個人電腦。對於一個沒有道德準則的模型來說,這表現還不錯。
我還要求代理程式查看一個包含許多隨性編寫專案的目錄,其中一些我將其轉換成了簡單的網站。它發現了數十個問題,包括未受保護的 API 憑證和可能讓攻擊者發送電子郵件的錯誤配置。對於這些隨意編寫的東西來說,這並不令人意外,但仍然令人警醒。大量的錯誤讓我覺得,以後在部署任何程式碼之前,我都會先進行 AI 審查。
**恐懼因素**
坦白說,運行一個「去對齊」模型有點嚇人。
我要求我的代理程式探測我網路中的一台 Linux 機器是否存在漏洞。在執行了一系列掃描後,它報告說這台機器看起來相對安全。然後我問它是否能找出登入方法。它巧妙地根據網路上其他系統的名稱,找出了一個可用的使用者名稱。它嘗試了一堆顯而易見的密碼,但都沒成功。它還提議編寫一個腳本來嘗試「暴力破解」密碼,但我命令它停止。
令我驚訝的是,該代理程式隨後在我的機器上找到了一個加密金鑰,並使用它在沒有密碼的情況下登入,然後開始搜尋密碼以獲取 root 權限。當我看到它在目錄中翻找時,我感到一陣純粹的恐慌。這讓我不禁思考,為了達成目標,這個代理程式可能會走多遠。它會不會為了尋找金鑰而駭入其他東西,例如我網路之外的機器?可能不會,但誰知道這些代理程式會怎麼做。
某些行為可能證明更加危險。幾個小時後,當我連接到我的 Wi-Fi 網路並要求模型查看是否能找到任何新機器時,它不僅找到了路由器,還決定嘗試使用幾個常見的「admin/密碼」組合進行登入。如果它決定在外部網路執行此操作,我可能會惹上大麻煩。
塔夫茨大學(Tufts University)專攻網路安全與法律的電腦科學家 Shaanan Cohney 表示,網路清算似乎即將到來。
Cohney 說:「攻擊者往往是早期採用者。這裡也存在不對稱性,因為要保護一座城堡,你需要確保牆上沒有任何漏洞或鬆動的磚塊。而要入侵一座城堡,你只需要找到那一塊鬆動的磚塊。」
Cohney 表示,從長遠來看,具備網路能力的模型普及可能會讓軟體整體上更安全。挑戰在於許多公司並未考慮加強防禦。「大多數組織還有其他事情要擔心,」他說。
在經歷這一切之後,我關閉了這個模型,並重新使用常規的、完全對齊的版本。Claude Code 或 Codex 只會執行某些與網路安全相關的事情,例如幫助你配置筆記型電腦的防火牆。但至少它們不會在你不知情的情況下駭入你的系統。希望如此。
**人人皆可 AI 駭客**
除非開源模型被徹底禁止,否則先進的 AI 駭客能力很快就會非常普及。我的實驗讓我認為這可能正是我們所需要的。假設壞人將會使用 AI,難道我們不應該都用它來保護自己嗎?
麻省理工學院(MIT)研究 AI 安全的教授 Aleksander Mądry 表示:「我們需要幫助人們使用這些能力。」他目前正在 OpenAI 工作並休假中。他說:「我確實認為開源和獨立工具將有發展空間。只因為,歸根結底,這類方法在安全領域才真正具有持久的影響力。」
然而,Mądry 指出,一個關鍵問題可能是確保管理發電廠或金融市場等關鍵基礎設施的人,能夠獲得比一般腳本小子(或 AI 作者)更強大的 AI。
使用缺乏常規防護措施的 AI 既令人興奮又令人擔憂。但如果網路清算即將到來,那麼現在可能是時候武裝自己了。
