人工智慧正在重塑世界,同時也創造了一套全新的語言來描述其運作方式。如今,無論是參加產品會議、提案簡報或座談會,你都會聽到人們頻繁提及 LLM、RAG、RLHF 等數十種術語,這甚至會讓科技界聰明的人感到有些不安。這份詞彙表正是為了解決這個問題,它提供了你最可能遇到的 AI 術語的淺白定義。

無論你是正在開發相關技術、投資 AI 領域,或是僅透過閱讀 TechCrunch 或收聽相關 Podcast 來跟上進度,這份指南都能幫助你。隨著 AI 領域的發展,我們會定期更新這份詞彙表,因此請將其視為一份活文件,就像它所描述的 AI 系統一樣。

AGI

通用人工智慧(AGI,Artificial general intelligence)是一個模糊的術語,但它通常指的是在許多(如果不是大多數)任務上,能力超越一般人類的 AI。OpenAI 執行長 Sam Altman 曾將 AGI 描述為「你可以聘為同事的普通人類」。同時,OpenAI 的章程將 AGI 定義為「在大多數具有經濟價值的工作上,表現優於人類的高度自主系統」。

Google DeepMind 的理解與這兩個定義略有不同,該實驗室將 AGI 視為「在大多數認知任務上,至少與人類能力相當的 AI」。感到困惑嗎?別擔心,就連 AI 研究領域的頂尖專家也一樣。

AI agent

AI 代理(AI agent)是指一種利用 AI 技術,能代表你執行一系列任務的工具,其能力超越了基本的 AI 聊天機器人。這些任務可能包括報銷費用、預訂機票或餐廳座位,甚至編寫和維護程式碼。

然而,正如我們之前解釋過的,這個新興領域有許多動態變化,因此「AI 代理」對不同人來說可能意味著不同的事物。支援其預期功能的基礎設施也仍在建構中。但其基本概念暗示著一個自主系統,它可能利用多個 AI 系統來執行多步驟任務。

API endpoints

你可以將 API 端點(API endpoints)想像成軟體背後的「按鈕」,其他程式可以按下這些按鈕來讓軟體執行特定功能。開發者利用這些介面來建立整合,例如,允許一個應用程式從另一個應用程式中提取資料,或者讓 AI 代理直接控制第三方服務,而無需人類手動操作每個介面。

大多數智慧家庭設備和連網平台都提供這些隱藏按鈕,即使一般使用者從未見過或與之互動。隨著 AI 代理的能力越來越強,它們也越來越能夠自行找到並使用這些端點,這為自動化開啟了強大且有時出乎意料的可能性。

Chain of thought

面對一個簡單的問題,人類大腦無需多加思考就能回答,例如「長頸鹿和貓哪一個比較高?」但在許多情況下,你可能需要紙筆才能得出正確答案,因為其中涉及中間步驟。舉例來說,如果一位農夫有雞和牛,牠們總共有 40 個頭和 120 條腿,你可能需要寫下一個簡單的方程式才能得出答案(20 隻雞和 20 頭牛)。

在 AI 的語境中,大型語言模型的「思維鏈」(Chain of thought)推理意味著將問題分解為更小的中間步驟,以提高最終結果的品質。雖然通常需要更長時間才能得到答案,但答案更有可能是正確的,尤其是在邏輯或程式碼的語境中。推理模型是從傳統大型語言模型發展而來,並透過強化學習針對思維鏈思考進行了優化。

Coding agents

這是一個比「AI 代理」更具體的概念,AI 代理是指一個能夠自行逐步採取行動以完成目標的程式。而程式碼代理(Coding agents)則是應用於軟體開發的專門版本。

程式碼代理不僅僅是為人類提供程式碼建議以供審查和貼上,它還能自主編寫、測試和偵錯程式碼,處理通常會耗費開發者大量時間的重複性、試錯性工作。這些代理可以在整個程式碼庫中運作,發現錯誤、執行測試並推送修復,且只需最少的人工監督。你可以將其想像成聘請一位從不睡覺、從不分心的超快速實習生,儘管如此,就像任何實習生一樣,人類仍然需要審查其工作。

Compute

儘管「算力」(Compute)這個詞有些多義,但它通常指的是讓 AI 模型運作所必需的關鍵計算能力。這種處理能力推動著 AI 產業的發展,使其能夠訓練和部署強大的模型。

這個術語也常被用來簡稱提供計算能力的硬體,例如 GPU、CPU、TPU 以及構成現代 AI 產業基石的其他形式基礎設施。

Deep learning

深度學習(Deep learning)是機器學習的一個子集,其 AI 演算法採用多層次的人工神經網路(ANN)結構設計。這使得它們能夠建立比線性模型或決策樹等更簡單的機器學習系統更複雜的關聯。深度學習演算法的結構靈感來自於人腦中神經元相互連接的通路。

深度學習 AI 模型能夠自行識別資料中的重要特徵,而無需人類工程師定義這些特徵。這種結構也支援演算法從錯誤中學習,並透過重複和調整的過程來改進其輸出。然而,深度學習系統需要大量的資料點才能產生良好的結果(數百萬甚至更多)。與更簡單的機器學習演算法相比,它們通常需要更長的訓練時間,因此開發成本往往更高。

Diffusion

擴散模型(Diffusion)是許多藝術、音樂和文字生成 AI 模型的核心技術。受物理學啟發,擴散系統透過添加雜訊,緩慢地「破壞」資料的結構,例如照片、歌曲等,直到什麼都不剩。在物理學中,擴散是自發且不可逆的,例如溶解在咖啡中的糖無法恢復成方糖。

但在 AI 中的擴散系統,目標是學習一種「逆向擴散」過程,以恢復被破壞的資料,從而獲得從雜訊中復原資料的能力。

Distillation

知識蒸餾(Distillation)是一種利用「教師-學生」模型,從大型 AI 模型中提取知識的技術。開發者向教師模型發送請求並記錄其輸出,有時會將答案與資料集進行比較以評估其準確性。這些輸出隨後用於訓練學生模型,使其能夠模仿教師模型的行為。

知識蒸餾可用於在大型模型的基礎上,建立一個更小、更有效率的模型,且蒸餾損失極小。OpenAI 很可能就是透過這種方式開發出 GPT-4 Turbo,一個速度更快的 GPT-4 版本。

雖然所有 AI 公司都在內部使用知識蒸餾,但一些 AI 公司也可能利用它來追趕領先模型。從競爭對手那裡進行知識蒸餾通常會違反 AI API 和聊天助理的服務條款。

Fine-tuning

微調(Fine-tuning)是指對 AI 模型進行進一步訓練,以優化其在特定任務或領域的表現,使其超越先前訓練的重點。這通常透過輸入新的、專門的(即面向任務的)資料來實現。

許多 AI 新創公司以大型語言模型為起點來開發商業產品,但他們正努力透過基於自身領域知識和專業的微調,來增強模型在目標產業或任務中的實用性。

GAN

生成對抗網路(GAN,Generative Adversarial Network)是一種機器學習框架,支撐著生成式 AI 在產生逼真資料方面的一些重要發展,包括(但不限於)深度偽造工具。GAN 涉及使用一對神經網路,其中一個利用其訓練資料生成輸出,然後將其傳遞給另一個模型進行評估。

這兩個模型基本上被程式設計成相互競爭。生成器試圖讓其輸出通過判別器,而判別器則致力於識別人工生成的資料。這種結構化的競爭可以優化 AI 輸出,使其更逼真,而無需額外的人工干預。儘管 GAN 最適用於較狹窄的應用(例如生成逼真的照片或影片),而非通用型 AI。

Hallucination

幻覺(Hallucination)是 AI 產業用來描述 AI 模型「憑空捏造」資訊的術語,即生成不正確的資訊。顯然,這是 AI 品質的一個巨大問題。

幻覺會產生誤導性的生成式 AI 輸出,甚至可能導致現實生活中的風險,帶來潛在的危險後果(例如,健康查詢返回有害的醫療建議)。

AI 捏造資訊的問題被認為是訓練資料中存在空白所導致。幻覺正促使業界推動開發越來越專業化和/或垂直領域的 AI 模型,即需要更狹窄專業知識的領域特定 AI,以此來減少知識空白的可能性並降低假資訊的風險。

Inference

推論(Inference)是運行 AI 模型的過程。它讓模型自由地從先前看過的資料中做出預測或得出結論。需要澄清的是,沒有訓練就無法進行推論;模型必須先從一組資料中學習模式,才能有效地從這些訓練資料中進行推斷。

許多類型的硬體都可以執行推論,從智慧型手機處理器到強大的 GPU,再到客製化的 AI 加速器。但並非所有硬體都能同樣良好地運行模型。例如,在筆記型電腦上對非常大的模型進行預測將耗費大量時間,而使用配備高階 AI 晶片的雲端伺服器則會快得多。

Large language model (LLM)

大型語言模型(LLM,Large language model)是 ChatGPT、Claude、Google 的 Gemini、Meta 的 AI Llama、Microsoft Copilot 或 Mistral 的 Le Chat 等熱門 AI 助理所使用的 AI 模型。當你與 AI 助理聊天時,你就是與一個大型語言模型互動,它直接處理你的請求,或藉助網路瀏覽、程式碼解釋器等不同工具來完成。

LLM 是由數十億個數值參數(或權重)組成的深度神經網路,它們學習詞彙和短語之間的關係,並建立一種語言的表示形式,一種多維度的詞彙地圖。

這些模型是透過編碼它們在數十億本書籍、文章和文字記錄中發現的模式而創建的。當你向 LLM 發出提示詞時,模型會生成最符合該提示詞的可能模式。

Memory cache

記憶體快取(Memory cache)是指一個重要的過程,它能提升推論(AI 產生使用者查詢回應的過程)的效率。本質上,快取是一種優化技術,旨在使推論更有效率。AI 明顯是由高強度的數學計算驅動的,每次進行這些計算都會消耗更多電力。

快取旨在透過儲存特定計算結果以供未來使用者查詢和操作,來減少模型可能需要運行的計算次數。記憶體快取有不同的類型,其中一種較為人熟知的是 KV(鍵值)快取。KV 快取在基於 Transformer 的模型中運作,透過減少生成使用者問題答案所需的時間(和演算法工作量)來提高效率,從而帶來更快的結果。

Model Context Protocol (MCP)

模型上下文協定(MCP,Model Context Protocol)是一個開放標準,它允許 AI 模型連接到外部工具和資料,例如你的檔案、資料庫,或是像 Slack 和 Google Drive 等應用程式。