Qwen-Drive 1.0 將環境空間感知、交通問題回答和路線規劃這三項任務整合到一個AI模型中。研究人員證實,一個文字影像模型並不會因為能描述圖片就自動理解三維空間。

現有的駕駛模型通常採用通用的文字影像模型,然後再利用駕駛數據(主要是關於交通情境的問答對)進行微調。根據該論文,這種方法有兩個弱點:主要針對交通問答訓練的模型,仍無法可靠地偵測距離、位置和開放空間;而且,如果模型過度專注於駕駛數據,它會因為研究人員所稱的「災難性遺忘」而失去其原始訓練中的廣泛通用知識,而這種知識在罕見、意想不到的交通情境中至關重要。阿里巴巴研究部門建立的這個模型旨在解決這兩個問題。

一個獨立模組檢查模型是否真正理解空間。

Qwen-Drive-1.0 建基於二月發布的Qwen3.5-4B,並增加了兩個額外組件。第一個組件透過在三維空間中識別物體、判斷佔用區域並描繪道路佈局,生成周圍環境的鳥瞰圖。研究人員表示,它同時也是一個測量工具,能揭示模型從影像中實際提取了多少空間資訊。

所有駕駛功能都透過一個共享的語言模型運行。兩個新增模組利用其中間結果:一個建立環境的三維模型,另一個則規劃汽車未來幾秒的路線。

第二個組件「規劃專家」(Planning Expert)利用模型內部數據來規劃汽車未來的移動。當研究人員僅訓練新增組件而未觸及視覺語言模型時,空間準確度仍然很低,這證實了能夠詳細描述影像的模型並不會自動掌握三維空間。只有當團隊也針對空間任務訓練視覺語言模型本身時,性能才顯著提升,這意味著空間理解交通場景的能力必須被刻意建構。

該模型從攝影機影像重建每個場景的俯視圖,顯示車輛、行人及道路標線。右側顯示預測結果與實際情況的對比。

訓練始於感知模組,然後結合感知與問答,接著是路線規劃。最後一步透過強化學習來精煉模型的行為。對於視覺語言組件,團隊結合了24個公開可用的交通場景數據集。這些數據集結構各異,有時還包含錯誤。一個AI模型標準化了問答內容,並將其與原始數據對齊。團隊還建立了自己的範例,解釋汽車為何應做出特定駕駛決策,例如是哪個物體觸發了煞車。

一個模型同時用於駕駛艙和駕駛系統。

在現代車輛中,資訊娛樂系統和駕駛系統正朝著單一計算單元整合,而非運行在兩個獨立控制器上。作者認為,一個為了純粹駕駛性能而犧牲通用能力的模型在此處沒有幫助,因為駕駛艙仍需要自己的模型和額外的計算資源來處理對話或開放式問題等任務。

在Qwen自己的基準測試中,Qwen-Drive 1.0在大多數駕駛和感知類別中都超越了專用模型。

根據論文,Qwen-Drive 1.0在關於交通場景的問題上,得分遠高於未修改的基礎模型Qwen3.5-4B。最大的差距出現在模型必須解釋因果關係時,例如汽車為何應該煞車或轉彎。通用知識也得到了保持:模型在駕駛以外的測試中幾乎沒有下降,甚至在某些空間任務上得分略高。

從模擬到實際道路。

對於駕駛規劃,團隊在多個難度級別上測試了該模型,從簡單的預測到錯誤會隨時間累積的模擬器。在模擬器中,經過獎勵重新訓練的版本將汽車偏離道路的機率從24%降低到12%。它也開得更謹慎,總行駛距離更短。

在每個情境中,模型都會解釋其駕駛決策,例如為了路上的動物煞車或在紅燈前停車。藍線顯示規劃的路線。

然而,模型的解釋並不總是能精確指出情況的實際原因。遠處的紅燈和一個孩子踏入道路需要非常不同的反應時間,而模型可能會將兩者混淆。規劃的動作也並不總是與模型事前給出的理由相符。一些結果依賴於作者自行設計或重建的測試程序,因此單一指標對於系統如何處理混亂的真實世界駕駛情境說明甚少。

當處理來自不同攝影機設置的其他車輛的影像時,模型偵測到的資訊會少得多。目前仍缺少適用於這些配置的訓練數據。

Qwen團隊使用其HopChain基準測試本身測量了這種空間理解的差距。在此測試中,視覺語言模型即使在影像文字基準測試中得分很高,也會錯誤分類物體並混淆空間關係。災難性遺忘也是一個常見問題。當Google Deepmind在2023年建立PaLM-E(一個用於語言、影像和機器人控制的模型)時,較小的變體在機器人訓練後失去了大部分語言能力。而參數達5620億的最大版本幾乎沒有損失。

將語言模型與駕駛功能配對會產生新的攻擊面。加州大學聖克魯斯分校的研究人員在攝影機視野中放置了一個帶有標籤的標誌,並成功欺騙DriveLM駕駛系統轉向穿越行人,儘管它已正確偵測到行人。同時,研究正轉向世界行動模型(World Action Models),這些模型也能預測環境如何響應代理自身的行動而變化。

Qwen團隊正在Hugging Face、ModelScope和GitHub上免費向研究社群發布該模型。