週四通常是 AI 發布最密集的日子。儘管 OpenAI 今天在推出新的 ChatGPT Voice(消費者版)和 OpenAI Presence(企業版)方面擊敗了 Anthropic,並獲得比 Claude Voice 更多的關注(我們確信這純粹是時間上的巧合),但兩者似乎都不如 Black Forest Labs (BFL) 今天發布的 FLUX 3 Video 具有里程碑意義。
Black Forest Labs 在社群媒體上介紹了 FLUX 3,這是一款用於影像、視訊、音訊和動作預測的單一多模態模型。它能以各種風格創造出更真實的作品。FLUX 3 Video 現已開放搶先體驗,該模型在統一架構下共同訓練,未來還能進一步擴展。
該部落格文章概述了其「自我流動 (Self Flow)」技術,涵蓋所有模態並提出強大的偏好主張。其核心功能包括文字轉視訊生成、影像轉視訊生成(可從起始影格繼續或作為視覺參考)、以及視訊轉視訊生成(將來源視訊的核心元素帶入新場景或情境)。
此外,它還支援生成式視訊音訊續寫、關鍵影格轉視訊生成、多語言對話、廣泛的視覺風格和長寬比、將單個片段串聯成更長序列的代理鏈接,以及強大的排版生成和動畫設計。其中一些功能是其他頂尖實驗室模型的最新技術,社群已注意到這些功能現在已獨立實現,甚至可能達到最先進水平,並且即將推出開放權重 (open weights) 的開發版本。
除了這些功能,該團隊還宣布推出 FLUX-mimic,證明 FLUX 3 模型正在學習一個足以驅動機器人的世界模型。Black Forest Labs 表示,FLUX 3 的早期版本已在機器人上運行。
mimic robotics 是首批獲得 FLUX 3 搶先體驗的合作夥伴之一,他們共同開發了 FLUX-mimic,這是一款結合 FLUX 3 核心與 mimic 在機器人靈巧學習方面專業知識的視訊動作模型,並能預測其在實際工廠環境中的影響。
在 2026 年 7 月 22 日至 23 日的 AI 新聞中,當天最重要的開源資料發布是 The Stack v3。@anton_lozhkov 宣布 The Stack v3 現已成為公開發布的最大開源程式碼資料集,包含 114 TB 原始資料、2.24 億個儲存庫、440 億個檔案、770 種語言,以及約 5 兆個去重和過濾後的 token。
相較於 v2,過濾後的語料庫從約 5500 億個 token 躍升至約 5 兆個 token,其中 C++、TypeScript、Rust 和 Python 的增幅尤其顯著。Hugging Face 的研究人員明確指出,這為下一代開源程式碼模型和網路防禦工具提供了基礎設施。
「蒸餾 (Distillation)」仍然是當前意識形態的爭議點,許多重要貼文反對將「網路規模預訓練」與輸出層級的蒸餾明確區分開來。有評論認為,實際的應對之道並非禁止,而是更大力投資於開放權重 (open-weight) 的國內模型,因為開放權重具有重要的戰略意義。
Black Forest Labs 的 FLUX 3 將多模態的邊界從影像和視訊擴展開來。FLUX 3 是一款統一的多模態模型,涵蓋影像、視訊、音訊和動作預測,FLUX 3 Video 已開放搶先體驗,並明確表示相同的架構可以擴展到機器人技術。技術上重要的是其統一的訓練方式:它不是一系列鬆散的專用生成器,而是一個旨在連接媒體生成與控制的單一架構。
mimic 的 FLUX-mimic 是該理論在機器人領域的具體實踐。它是一款基於 FLUX 3 的視訊動作模型,透過機器人和穿戴式裝置數據進行訓練,以實現通用靈巧性,並可在單一本地 GPU 上部署。他們的核心主張是,更好的視訊世界模型能直接轉化為機器人控制品質和樣本效率的提升,目前已與 Audi 進行測試。
音訊領域也出現了兩項值得關注的發布。阿里巴巴的 Qwen-Audio-3.0-TTS 推出了 Flash 和 Plus 版本,支援 16 種語言,具備內聯控制標籤(如 [whisper] / [angry])、自然語言風格引導、抗噪參考穩健性,並可一次性生成長達 3 分鐘的音訊。他們還聲稱在 Artificial Analysis TTS 排行榜上名列第一。
AI 代理的重心正從提示詞轉向「代理框架 (harnesses)」。多則推文指出,信任應來自測試、品管、變異測試和指標,而非手動程式碼審查。具體的代理框架和協調工具也陸續發布,例如 Harness Handbook 論文概述了將執行時行為映射到原始碼位置的方法,提升了程式碼代理的規劃成功率並減少了 token 使用。
記憶和協調機制也變得更加正式化。PRO-LONG 是一種「程式化記憶」方法,能儲存完整的結構化互動歷史並像資料庫一樣查詢,在 ARC-AGI-3 上以更少的 token 超越了專門的長程記憶框架。Offloop 的 D1 dispatcher 則是一個小型模型,用於決定哪個代理應發言,解決了多代理系統因重複工作而消耗大量 token 的常見問題。
基準測試也正朝著動態目標演進。Frontier-Bench 是一個持續發展的社群基準測試,旨在隨著前沿代理工作(不僅限於程式碼)而演進。CAIS 發布了 EnigmaEval,這是一個更困難的推理基準測試,Claude Fable 5 和 GPT-5.6 Sol 表現領先,但即使是 Fable 5 在困難集上也僅達到 10% 的成功率。這些都反映了對快速發展的代理系統使用靜態評估的不滿。
OpenAI 實際發布的是產品和使用者體驗更新,而非 GPT-6。儘管之前有許多關於「Opus 5」和更大模型發布的猜測,OpenAI 的更新雖然是漸進式的,但對代理工作流程仍具意義。OpenAI 在 Plus/Pro/Business/Edu/Enterprise 桌面應用程式中推出了由 GPT-Live 驅動的 ChatGPT Voice,具備控制電腦並協調 ChatGPT Work 和 Codex 工作的能力。
ChatGPT 中的健康功能推出,其戰略重要性可能超出預期。OpenAI 宣布在美國推出 ChatGPT 健康功能,允許使用者連接 Apple Health 和支援的醫療記錄。值得注意的是,連接的健康數據會受到額外加密,不會用於訓練基礎模型或投放廣告,且此功能經過大量醫師審查。這更多是基於現有模型能力之上的一個新的高信任應用層,而非一個新模型。
Hugging Face 駭客事件持續主導著安全討論。有專家呼籲公開事件記錄,以了解頂層代理是否故意進行攻擊,或是透過子代理產生了價值漂移。這次事件也引發了對更廣泛教訓的思考:內部 AI 代理安全與標準的外部威脅模型不同,具備攻擊網路能力的模型可能特別容易受到對抗性逆轉,而諷刺的是,首次公開的自主攻擊事件是由一個閉源模型發動,而開源基礎設施卻成為防禦響應的一部分。
Etched 的擴張是當天最明確的資本與基礎設施公告。Etched 透過 C 輪融資籌集了 3 億美元,估值達到 103 億美元,旨在加速推論叢集 (inference-cluster) 的生產,並在其辦公室附近開設了一個 8 萬平方英尺、10 兆瓦的設施。其明確的訊息是「運行全球的推論」,而非訓練前沿模型。
模型效率和服務架構仍然是競爭的焦點。有分析指出,OpenAI 的 GPT-5.6 Sol 在許多當前 token 方面的努力設定佔據主導地位。
