今天的模型雖然能處理複雜任務,但它們無法自動理解這些任務背後的業務情境。例如,哪份基金報告是最新版本?同一個實體在三個系統中名稱為何?這些情境資訊分散在文件、資料室、試算表、電子郵件和內部工具中,對 AI 代理人來說是零散、未解析且不可見的。對於金融、保險和房地產等領域的團隊而言,工作流程中的資訊檢索準確性是不可妥協的。

在共同開發了一款廣受使用的電腦視覺輔助應用程式後,Rizzoli 和 Edwardsson 於 2018 年創立了 V7,旨在幫助企業教導 AI 系統理解其業務運作方式。V7 Go 是一個代理人平台,用於建立關鍵任務工作流程,並將隱藏的業務情境組織成可供代理人查詢和執行的記憶。

V7 Go 利用 GPT-5.6 Luna 從數百萬份文件中提取資訊,並將其組織到「情境圖」(Context Graph)中。該情境圖連結了實體、關係和引用的證據,為 MCP 搜尋和可重複的工作流程提供支援,這些流程可能包含數百個步驟。對於複雜的多步驟工作流程,V7 Go 則使用 GPT-5.6 Terra 和 Sol 進行推理和工具使用,這些任務若由人類完成可能需要數十小時。

V7 也開始在最嚴苛的情境圖查詢上使用 GPT-6 Astra,例如對數千份文件進行財務分析。

V7 表示,透過情境、模型和工具的協同運作,AI 代理人能在數分鐘內完成 50 到 100 個步驟的工作流程,準確度高達 99.9%,同時保留每個決策的可稽核軌跡。V7 共同創辦人兼執行長 Alberto Rizzoli 指出:「要解決金融和保險等領域的艱鉅企業用例,AI 需要像學習網路資訊一樣,深入了解您的業務運作方式。」

賦予代理人理解整個業務的情境。「情境圖」解決了一個特定問題。過去,代理人每次請求都必須重新發現情境,導致數十次搜尋耗費時間和 token,而且經常遺漏隱藏在關係中的關鍵資訊。

當資料到達時,V7 Go 會連接到 SharePoint 和 Google Drive 等儲存庫,掃描其中的實體、關係、事實、屬性和指標,並建立一個圖形。這種圖形比長情境(long-context)方法在遍歷上成本更低、速度更快。

「情境圖」為代理人提供了一個結構化且即時更新的記錄,供其直接查詢。當新文件到達時,V7 Go 會識別本體論中的公司、基金、人物或任何實體,然後將每個事實連接到新的或現有記錄,並保留引用的證據至原始來源。如果圖形中資訊不足,V7 Go 仍可透過 RAG(檢索增強生成)搜尋底層文件。

V7 也測試了情境結構的重要性。在 HERB 這個用於查找和連接企業系統中分散資訊的基準測試中,V7 的純檢索系統比官方基準線高出 69%,並將無法回答查詢的幻覺(hallucinations)減少了 38%。V7 Go 利用這種與來源連結的情境,使複雜的工作流程能紮根於各公司自身的資訊。

V7 Go 將這些組織好的情境應用於私募股權交易篩選和保險核保等工作流程。在下面的示範中,一個工作流程從一份名為「機密資訊備忘錄」(CIM)的交易文件中提取資訊,提供關鍵財務數據、交易條款、管理細節,並引用風險領域,然後由 V7 Go 生成一份篩選備註。

「情境圖」使得模型能夠處理公司的歷史資料,而無需每次都重新學習。對於長期運行的代理人,V7 Go 會將最近的交流保留在模型的活躍情境中,並將較舊的資料儲存在圖形中,以便在需要時檢索。

這種共享情境已經加速了 V7 客戶的繁重文件工作:資產經理篩選交易的速度比以前快了 21 倍,將一整天的流程縮短到僅 15 分鐘。一個金融服務團隊將審查時間從 100 多小時縮短到 10 小時以下,每項任務節省了 12,000 美元的專家成本。保險團隊在授予其代理人所有先前索賠和現有保單的歷史知識後,將索賠處理中的錯誤率比手動基準降低了 13.5%。

V7 共同創辦人兼技術長 Simon Edwardsson 表示:「透過 GPT-5.6 Terra,我們得以移除許多過去僅為簡化模型任務而存在的中間工作流程階段。這為我們節省了數天的交付工作,並且由於更強大的模型和更多情境的存取,通常在首次建立工作流程時就能正確執行。」

選擇 OpenAI 以確保複雜工作流程順利進行。複雜的多步驟工作流程依賴於模型可靠地遵循冗長指令、執行工具、解釋結果並導航一系列漫長步驟。單一的上游錯誤可能導致昂貴的後果,並破壞對 AI 系統的信任。V7 Go 引導模型執行跨越確定性程式碼、移交給較小型模型、文件生成步驟和整合的長週期任務,並提供每次運行的可稽核追蹤。

在 AI 生成的工作流程中,V7 Go 將每個步驟映射到快速、中等和智慧層級。GPT-5.6 Luna 處理結構化提取和其他高吞吐量工作,而 GPT-5.6 Terra 或 Sol 則支援聊天、Go Agent 路徑以及需要更多推理或工具使用的步驟。

V7 針對持續維護的基準測試套件來測試新模型,該套件涵蓋引用準確性、數百種文件類型的提取品質、答案正確性、指令遵循、延遲、成本以及實際企業工作流程。OpenAI 在 V7 最關心的行為上超越了大多數模型。此外,OpenAI 在數小時內批准並實施了 V7 的容量增加需求,而 V7 使用的其他供應商則需要數週。

V7 共同創辦人兼技術長 Simon Edwardsson 表示:「我們選擇 OpenAI 作為預設供應商,因為它在 V7 Go 所依賴的多步驟工具工作流程中表現最佳。在我們的情境圖基準測試中,GPT-5.6 Sol 將工具呼叫錯誤率從 GPT-5.5 的 2.7% 降低到 0.2%。」

在 V7 最新的測試中,包含多個外部呼叫的關鍵工作流程現在完成速度提高了 50%。V7 還測量到 GPT-5.6 Luna 的另一項效率提升:每份文件的成本比 GPT-5.4 mini 低 78%。V7 也將其文件密集型的 V7 Go 工作負載從 Chat Completions API 轉移到 Responses API。

在測試中,這項改變使某些 PDF 密集型工作流程的 token 使用量減少了約 5%,並提高了快取可靠性。

V7 還在最困難的查詢上測試了 GPT-6 Astra。由於 GPT-5.6 Sol 已經在 V7 許多現有基準測試中達到飽和,該公司創建了一組更具挑戰性的圖形查詢問題,使用了數千份文件中更混亂的真實世界數據。該測試的資料集涵蓋了四個難度級別。

在「非常困難」級別上,V7 報告 GPT-5.6 Sol 的準確度為 78%,而 GPT-6 Astra 則達到 89%。這兩個模型在「簡單」、「中等」和「困難」級別上都接近 100%。

將業務知識引入 ChatGPT 和 Codex。V7 Go 已經透過其 MCP 伺服器公開了情境圖的查詢和攝取功能,因此客戶可以從 ChatGPT 和其他相容客戶端使用它。他們還可以透過 Codex 中的 MCP 建立 V7 Go 工作流程。結合更簡單的工作流程設計,這將建立中等長度工作流程所需的時間從大約一小時縮短到約 20 分鐘。

V7 的長期目標是讓這種共享記憶更具主動性。該團隊正在開發一種工作流程,當情境圖中的事實發生變化時啟動,標記不一致之處,並向人們顯示哪些分析需要重新審視。例如,一份重新聲明的基金報告可以促使 V7 Go 標記仍依賴舊數據的工作。

Rizzoli 表示:「我們的目標是幫助企業為 AI 時代重新裝備,提供解決關鍵任務的工作流程,以及超越人類的記憶能力。」他補充說:「從 AI 中獲得真正價值的金融公司,不會是擁有最多代理人的公司,而是擁有最佳情境的公司。」