工程師常利用視覺語言模型來設計新的飛機或汽車零件。為了模擬這些零件在實際情況下的表現,他們會使用成熟的電腦輔助設計(CAD)軟體來生成 3D 模型,並進行虛擬碰撞或耐用性測試。
麻省理工學院及其他機構的研究人員現已開發出一套系統,能教導視覺語言模型自動將 2D 設計轉換為 CAD 程式,相較於其他方法,其精確度和功能性大幅提升,且僅需極少運算資源。
這項技術透過提升 AI 驅動 CAD 生成的效能與效率,有望簡化快速原型製作流程並降低成本,同時也能幫助工程師發現可能被忽略的優良設計方案。
這套系統會根據模型嘗試將 2D 圖像轉換為 CAD 程式的能力,生成新的資料。該框架會修正模型的失敗案例,並將其與成功的解決方案一同納入資料集。
系統利用這些資料來教導模型如何修正特定錯誤,並解決其原本難以應付的棘手問題。
「我們希望工程師能夠將我們的框架指向表現不佳的 CAD 模型,設定運算預算,然後讓系統接手——將模型自身的錯誤轉化為更好的訓練資料。」主要作者 Giorgio Giannone 表示。他是麻省理工學院設計運算與數位工程(DeCoDE)實驗室的研究員,同時也是 Red Hat AI 創新團隊的首席研究科學家。
共同參與這項研究的還有麻省理工學院機械工程研究生 Anna Claire Doris、麻省理工學院博士後研究員 Amin Heyrani Nobari、Red Hat 的 Kai Xu,以及共同資深作者 Akash Srivastava(IBM 核心 AI 主管暨 MIT-IBM 運算研究實驗室首席研究員)和 Faez Ahmed(麻省理工學院機械工程副教授、DeCoDE 實驗室負責人暨 MIT-IBM 運算研究實驗室首席研究員)。這項研究近期已在國際機器學習會議上發表。
Ahmed 表示:「我們周圍幾乎所有實體產品,從飛機到家電,都始於 CAD 模型。業界團隊渴望能加速這些設計創建的 AI 工具,但現今的模型常產生過於簡單、不敷實用的形狀。」
「這項工作令我興奮的是,它為許多圖像轉 CAD 程式的模型提供了一種自我改進的方式,讓它們從自身錯誤中學習,而非等待更多人工製作的資料——這使得值得信賴的 AI 設計工具更貼近日常工程應用。」
模型感知資料:研究人員致力於開發用於 CAD 生成的視覺語言模型(VLM)。這些 VLM 接收 2D 圖像和一些描述性文字,然後輸出可在 CAD 軟體中執行的 Python 程式碼,以生成實體物件的 3D 模型。
他們研究了部署現有 VLM 於此任務的挑戰,並確定限制其能力的主要瓶頸是缺乏多樣化、高品質的 CAD 資料集來訓練模型。為了解決這個問題,他們尋求利用資料擴增(data augmentation)的過程,創建新資料來教導模型如何執行 CAD 生成。
在資料擴增中,科學家通常透過隨機調整現有資料(例如圖像中物件的顏色、大小和形狀)來生成更多樣本。然而,麻省理工學院的研究人員建立了一套名為 GIFT(Geometric Inference Feedback Tuning 的縮寫,意為幾何推論回饋調校)的資料擴增系統。
GIFT 旨在生成專門用於改進特定任務中 VLM 效能的資料。它透過測試模型來了解其優勢和劣勢,然後利用這些知識生成資料,以提升模型在難以解決的 CAD 生成問題上的表現。
Giannone 表示:「我們希望獲得由模型本身所啟發的資料擴增。」
從錯誤中學習:為此,GIFT 會要求模型平行地多次生成解決 CAD 生成問題的程式碼。它會檢查這些猜測的正確性,以了解模型解決問題的能力。
Giannone 指出:「對模型而言,生成『幾乎正確』的 CAD 查詢程式碼並不難,但要生成『完全正確且可執行』的程式碼,對標準 VLM 來說則更具挑戰性。」
對於那些接近正確的猜測,GIFT 會將其調整為成功的解決方案。它將這些「差點成功」的案例和成功的解決方案儲存在新的資料集中,用以教導模型如何克服通常會讓它出錯的問題。
他表示:「如果我們對模型進行 10 次取樣,它對同一個問題都產生了 10 個正確答案,那麼它就沒有太多可學習的。我們關心的是那些『中間案例』,也就是模型可能只有 50% 的時間能解決問題的情況。」
利用這些中間案例,GIFT 能夠生成既「模型感知」又「任務感知」的資料擴增。此外,透過將同一問題的多個正確解決方案納入其中,新資料擴展了模型對 CAD 程式碼生成的普遍知識。這套自動化系統無需人工干預來修正模型的錯誤。
GIFT 透過一種稱為「推論時縮放」(inference-time scaling)的過程,從預訓練的 VLM 中創建資料擴增。這個過程允許一個已經訓練好的靜態模型,在不產生重新訓練整個模型的高昂運算成本下,生成更好的輸出。
透過推論時縮放,使用者可以決定要為 GIFT 使用多少運算資源,以符合他們的時間和預算限制。GIFT 的表現優於多種競爭技術,它生成的 CAD 程式更為精確,同時運算量僅約為其他方法的 20%。使用 GIFT 的 VLM 所生成的 CAD 模型,與真實模型的形狀吻合度更高。
Giannone 表示:「透過 GIFT,我們從幾何學開始,因為在工程問題中,如果 3D 形狀的幾何結構不正確,其他一切也都會不正確,但還有許多其他方面需要考量。」
未來,研究人員希望擴展 GIFT,使該框架能夠教導模型生成可提升 3D 模型性能和可製造性的 CAD 程式。他們也希望將此系統應用於更大的模型和更多樣化的 CAD 生成任務。這項研究部分由 MIT-IBM 運算研究實驗室資助。
