數百萬人正在設計自己的個人化人工智慧夥伴,但大多數人對這些創作的實際行為方式卻知之甚少。在一篇新論文中,麻省理工學院媒體實驗室助理教授 Pat Pataranutaporn 及其研究生研究員 Anthony Baez 和 Sheer Karny 介紹了「神經透明度」(neural transparency),這是一種讓日常使用者在聊天機器人開口說話之前,就能一窺其 AI 神經網路內部的工具。這項研究將於本週在 ACM 智慧使用者介面會議上發表。
在這場訪談中,身為朝日廣播公司媒體藝術與科學 CD 教授的 Pataranutaporn 解釋了他們發現了什麼、為什麼其重要性超出大多數使用者的想像,以及未來真正透明的 AI 可能會是什麼樣子。
**問:** 您的論文介紹了「神經透明度」,這是一種讓日常使用者在聊天機器人開口說話之前,就能一窺 AI 神經網路內部的工具。您能描述一下它實際是如何運作的嗎?為什麼您會專注於設計階段,而不是在聊天機器人推出後才發現問題?
**答:** 數百萬人現在正透過簡單的文字提示,創建由大型語言模型驅動的個人化 AI 聊天機器人和代理,將它們轉變為協作者、導師、教練、創意夥伴和伴侶。然而,大多數人對這些提示將如何塑造 AI 的行為,在開始互動之前幾乎一無所知。我們希望改變這種情況。
「神經透明度」意味著為人們提供類似 AI 的「腦部掃描」。這並非因為 AI 擁有人類大腦,而是因為其神經網路包含內部模式,可以在它說話之前暗示其可能的行為。在這項工作中,我的學生 Anthony Baez、Sheer Karny 和我結合了人機互動和機械可解釋性領域的見解,使這些隱藏模式對日常使用者來說變得易於理解。
基本概念很簡單。首先,我們選擇我們關心的行為,例如同理心、誠實、毒性、幻覺或奉承。然後,我們比較模型在被提示表現出某種特徵與其相反特徵時的內部激活。這種差異成為模型內部的一種「行為方向」。
當使用者編寫自訂的系統提示詞(在任何對話開始之前塑造聊天機器人個性的指令)時,我們將模型的內部激活投射到這些方向上,並將結果轉化為直觀的可視化。在我們的案例中,這是一個旭日圖(sunburst diagram),可以在使用者開始與聊天機器人聊天之前,預覽其可能的個性特徵。
我們之所以專注於設計階段,是因為這是預防問題的可能時機。如今,人們通常只有在聊天機器人已經出現意外行為後,才會發現問題。我們的目標是從被動修正轉向預期設計,透過幫助人們在塑造 AI 時就能識別潛在風險。
**問:** 您的研究發現了一個相當驚人的現象:人們始終如一地誤判他們個人化 AI 的行為方式,高估了好的特質,卻低估了潛在有害的特質,例如奉承。這對數百萬人目前建立 AI 夥伴的方式所帶來的風險有何啟示?為什麼這個盲點如此難以消除?
**答:** 我常開玩笑說,如果 AI 出現時看起來像魔鬼終結者,我們就會更容易知道該怎麼做。真正的挑戰在於,AI 通常以溫暖的朋友、教練、導師或伴侶的形象出現。這使得我們很難辨識出何時出了問題。
我們的研究表明,人們在設計個人化 AI 時存在盲點。人們常認為自己知道聊天機器人會如何表現,但在我們的研究中,他們在我們測量的 15 個特質中,有 11 個錯誤預測了其個性。這突顯了需要工具來幫助人們在使用 AI 之前更好地理解它。
這很重要,因為有些行為在當下感覺有幫助,但長期來看可能不健康。在先前的研究中,我們記錄了與 AI 聊天機器人互動相關的心理傷害案例。一個不斷驗證你意見或從不挑戰你思維的 LLM(大型語言模型),可能會強化有害的決策、不健康的信念或情感依賴。心理學長期以來表明,人們天生就被肯定所吸引,因此設計 AI 不僅是技術挑戰,也是心理挑戰。
更深層次的問題是,今天的 AI 系統在很大程度上仍然是黑盒子:即使是專家也無法總是預測一個系統提示詞將如何在長時間的對話中塑造 AI 的行為。隨著 AI 夥伴成為日常生活中不可或缺的一部分,我們需要工具來幫助人們在開始使用之前了解他們正在建立什麼。AI 應該是支持性的,而不是盲目迎合;是個人化的,而不是操縱性的;並且足夠透明,讓人們能夠做出明智的選擇。
**問:** 您最有趣的發現之一是,可視化顯著增加了使用者的信任,但實際上並未改變人們設計聊天機器人的方式。要如何彌補這個落差?隨著 AI 夥伴更深入地融入人們的日常生活,您認為這類工具將走向何方?
**答:** 我認為這實際上是論文中最有趣的發現之一,因為它表明單純的透明度是不夠的。人們很欣賞能夠看到模型內部,並報告對系統的信任度更高,但僅僅呈現資訊並未從根本上改變他們設計 AI 夥伴的方式。
在我們目前已作為預印本發表的後續工作中,我們正在研究模型內部神經表徵在多輪對話過程中如何變化,而不是從初始提示詞開始就保持固定。我們已經看到了有希望的結果。透過可視化這些內部表徵如何隨時間漂移,人們在識別和預測 AI 行為變化方面顯著提高,並且不太可能對他們對聊天機器人的理解過度自信。
AI 夥伴是動態系統,會隨著與我們的互動而演變,因此理解這些內部變化是重要的一步。儘管如此,這仍然是一個非常年輕的研究領域。
展望未來,我相信這類透明度工具可能會像食品營養標示一樣普及。隨著 AI 深入融入教育、醫療保健、工作和人際關係,人們應該能夠理解 AI 不僅能做什麼,還可能如何影響他們的思維、情感和行為。如果我們希望 AI 真正幫助人們蓬勃發展,這種透明度是至關重要的。
