共同創辦人 Grace Li 提到,她的公司在 2025 年畢業前幾週成立,當時她和幾位大學朋友正努力讓他們的 AI 遊戲引擎運作。這些模型可以製作出功能正常的遊戲,但沒有一款遊戲是好玩的,這引出了一個有趣的問題:你如何判斷一款遊戲是否好玩?
他們決定,人類的判斷是無可取代的,很快他們便開始集思廣益,尋找大規模獲取誠實人類回饋的方法。
成果就是 DesignArena,一個目前全球有 530 萬人使用的 AI 工具。事實證明,許多 AI 公司都在尋找可擴展的用戶回饋,而且其中許多公司都願意為此付費。
Li 表示:「這對許多模型來說,是設計領域改進的關鍵瓶頸。大約一週後,我們與一家前沿實驗室簽下了第一筆大訂單,其餘的就成了歷史。」
週一,DesignArena 背後的公司 Intelligence 宣布完成 790 萬美元的種子輪募資,由 Index Ventures 領投,Conviction(Sarah Guo 和 Mike Vernal)、A*、Valkyrie 等公司也參與其中。
對於非企業用戶而言,使用 DesignArena 就像使用一個複雜的模型路由器。它有一個類似 Chat-GPT 的提示詞輸入視窗,並有獨立的下拉選單,可用於網站、圖片以及十多種其他視覺格式。一旦您輸入請求、格式和風格,系統將會呈現一系列「A vs. B」的選擇,直到您將少數幾個輸出從最好到最差進行排名。
這是一項有用的服務,但該平台的真正價值來自於企業端,參與的模型可以將其視為媒體生成模型源源不絕的即時回饋來源。用戶通常不在乎他們正在評分的模型是哪一個,正如 Li 所說,他們只想要最好的輸出,因此他們的排名可以為用戶真正想要的東西提供關鍵輸入。
Li 表示,對於前沿實驗室來說,這項服務值得付費,並補充說該網站目前的年經常性收入(ARR)已達 6000 萬美元,鞏固了其作為 AI 產業人類主導評估數據關鍵來源的地位。
至關重要的是,用戶必須登入才能獲取輸出,因此 Intelligence 也能追蹤這些品味在不同大陸和時間上的變化。(Li 指出,亞洲的網頁儀表板傾向於更極繁主義的設計風格。)這些衡量標準是對自動化基準測試的重要補充,自動化測試雖然規模更大,但往往容易被操縱或利用,正如上週 Hugging Face 洩露事件所戲劇性地證明。
這並不是說眾包人類回饋將自動成為一個成功的市場。Yupp 在募資 3300 萬美元後,不到一年便於今年初關閉。它也曾吸引了一些前沿模型作為客戶,並聲稱擁有超過 130 萬用戶,但仍未能建立可持續的長期業務。
即便如此,其他基於人類評估的新創公司似乎蓬勃發展。LM Arena 採用類似的方法處理基於文本的回應,在正式推出付費產品僅四個月後,便於一月完成了 1.5 億美元的 A 輪募資。
