
Induction Labs 發表了一項研究成果,挑戰了人工智慧領域一個長久以來的假設:教會機器行動需要精心標註的每一個動作範例。該公司推出了 Photon-1,這是其所謂的「想像模型」的首個產品。 「想像模型」是一種新型的基礎架構,旨在從網路規模的影片中學習,而無需在預訓練期間看到任何動作標籤。
Photon-1 是一個稀疏的混合專家模型,擁有 1060 億個參數,其中 50 億個為有效參數。該模型使用約 575 億幀電腦螢幕錄影進行訓練,相當於以每秒一幀的速度採樣 18 年的影片。資料集最初來自一個包含 20 億個公開影片的索引,經過篩選後保留了約 200 萬個螢幕錄影,並透過內部關鍵影格偵測模型去除了冗餘畫面。模型從零開始預先訓練了一個 epoch,耗時約 3 萬 NVIDIA H200 GPU 小時和 4.4 × 10²² FLOPs。
其核心論點令人矚目。據 Induction Labs 稱,Photon-1 在內部電腦使用基準測試中表現優於 Google 的 Gemini 3.1 Flash-Lite,儘管其訓練所使用的運算資源至少只有 Gemini 的三分之一,而且每百萬代幣的服務成本也大約只有 Gemini 的三分之一。該公司報告稱,Photon-30 的加權推理成本為每百萬代幣 0.11 美元,而 Gemini 的成本為 0.36 美元。然而,這些數據存在一些重要的限制:該基準測試是內部測試且未公開,這意味著結果無法獨立復現;此外,Gemini 的計算資源估算值是 Induction Labs 本身的保守預測,而非經過驗證的數據。
想像模型的工作原理
Photon-1 與傳統方法的差別不僅在於規模,更在於架構。它並非預測下一個字或產生原始像素,而是利用「下一個潛在標記」目標函數,在學習到的表徵空間中自回歸地預測未來的幀。每個視訊畫面透過有限標量量化壓縮成 960 個離散標記,僅佔用 2.2 KB 的空間——比現有的 OCR 和多模態表示方法小約 100 倍——同時保留了文字、佈局和狀態變化。差分潛在編碼器將幀作為幀對進行處理,編碼的是連續狀態之間的差異,而非幀的絕對內容。
這種壓縮使得自迴歸預測未來狀態在大規模計算上切實可行。在預訓練期間,模型學習了該公司所謂的「隱式策略」:透過預測螢幕的下一個顯示狀態,它無需任何人告知其哪些滑鼠點擊或按鍵操作導致了狀態轉換,就能內化電腦介面的因果結構。

將這些觀察所得的知識轉化為一個可運作的智能體需要第二階段。 Induction Labs 使用不到 35,000 條標籤的電腦使用軌跡對 Photon-1 進行微調,以教導它正確的動作格式,並添加了特殊的標記,使模型能夠發出鍵盤和滑鼠命令。在推理階段,系統分兩步驟運作:首先,它設想能夠推進任務的下一個狀態;然後,它產生旨在達到該狀態的動作。隨後是線上強化學習,在五個桌面環境下的 Linux 虛擬機器上進行了即時部署,程式驗證了結果,並透過獎勵訊號推動進一步改進。
更令人驚訝的是,該模型的能力似乎超越了其觀察的領域。在20,000局錦標賽跳棋比賽中進行微調後,Photon-1在世界模擬和走法品質方面均優於視覺編碼器基線模型和規模相近的語言模型基線模型。在10,000局合成生成的撞球比賽中,其球位預測的平均絕對誤差為0.47,而語言模型基線模型和視覺基線模型的平均絕對誤差分別為1.15和1.44。此模型還能從預訓練資料中辨識人類行為模式,並學會引導虛擬機器內的機器。 ChatGPT 克隆人工智慧系統,檢查其輸出結果,並引導對話直至任務完成——模仿人們實際使用人工智慧工具的方式。
世界模式的不斷擴展
Photon-1 的出現正值整個人工智慧產業轉向研究人員普遍稱之為「世界模型」的時刻——這些系統建構了環境如何因應行為而演變的內部表徵,而不僅僅是預測文字或產生孤立的影片片段。
2026年,該領域的發展速度顯著加快。 5月,GoogleDeepMind發布了Genie 3,這是一款即時互動世界模型,能夠以每秒24幀的速度,利用文字或圖像產生持久的3D環境,其物理特性是自學習的,而非硬編碼的規則。 NVIDIA的Cosmos平台提供基於2000萬小時真實世界資料訓練的開放權重世界基礎模型,下載量已超過200萬次,並被包括1X、Figure AI和Agility在內的多家機器人公司採用,用於產生合成訓練資料。李飛飛的World Labs推出了Marble,這是一款可用於從文字、圖像或影片創建可編輯3D世界的商業系統。同時,據報道在產品發布前估值就已達30億歐元的Yann LeCun的AMI Labs籌集了5億歐元,用於研發JEPA風格的架構,該架構通過在潛在空間而非像素上進行預測來學習抽象表示。
其他值得注意的發展包括 Runway 的 Gen-4.5,該公司明確將其定位為具有真實物理特性的「世界模型」;以及 DreamZero,這是一個擁有 14 億個參數的世界動作模型,它僅使用視覺訊息(無需動作標籤)就實現了從人類視頻到機器人控制的強大跨具身轉移。
這些努力的匯聚預示著更廣泛的架構轉變。大型語言模型已經掌握了文本中的模式匹配,而下一代人工智慧的目標是透過直接觀察世界來理解因果關係、物理規律和運作過程。 Induction Labs 的方法——透過狀態預測從無標籤影片中學習——與這一發展方向相符,同時消除了一個關鍵瓶頸:無需人類先將每個觀察轉化為標籤的動作。想像模型能否超越螢幕錄製,擴展到體力勞動、社交互動和複雜的現實世界動態,仍然是一個懸而未決的問題。就目前而言,Photon-1 已經有力地證明了機器可以透過觀察來學習行動。
免责声明:本文提供的信息不是交易建议。BlockWeeks.com不对根据本文提供的信息所做的任何投资承担责任。我们强烈建议在做出任何投资决策之前进行独立研究或咨询合格的专业人士。