top of page

Next-State-Prediction

  • 2天前
  • 讀畢需時 11 分鐘

過去三年,多模態模型的主流做法可以歸納成三條分支:語言模型預測下一個 token,影片模型預測下一幀,機械人模型預測下一個動作。三者各自都做得相當好,但彼此的表示互不相通,換一個下游任務就要重訓一套。

Orca 團隊在論文中提出另一條路線:先學一個統一的 world latent space,再用輕量的 readout 模組把這個 latent 讀成文字、影像或動作。他們把建模目標稱為 Next-State-Prediction。它不預測某一種輸出形式,而是預測世界狀態本身的轉移。


本文重點

Orca 把「證明」放在架構層面。預訓練完成之後,backbone 全程凍結,只有各模態的 decoder 可以訓練。作者明言,這樣做不是為了追某個 benchmark 的 SOTA,而是要回答兩條問題:這套學習範式能否隨模型與資料規模持續改善,以及更強的 latent 會不會直接帶來更強的下游讀出。

論文的實驗圍繞這兩條問題展開。結論之一相當反直覺:預訓練階段完全沒有用過任何帶動作標註的資料,但真機動作生成的表現仍然隨著影片資料量上升而改善。


一、狀態轉移的形式化

Orca 把世界學習寫成潛在狀態的建模。給定多模態世界訊號 X,映射到潛在世界狀態 S = f(X),然後假設狀態依下式演化:

S_{t+Δ} ~ p_Θ(S_{t+Δ} | S_t, z_t, c_t),  Δ ∈ Z, Δ ≠ 0

這條式子有兩個關鍵項。z_t 代表 implicit dynamics,包含物理定律、物體屬性、場景動態與環境力這些不可直接觀測的因素。c_t 代表 explicit conditions,即人類指令一類的外顯條件。Δ 可正可負,正數是預測未來,負數是回溯過去。

這個寫法同時容納了「無條件的自然演化」與「受指令驅動的介入」。前者對應 c_t = ∅ 的情況,後者對應 c_t 為一段語言描述。Orca 的兩種學習範式,正是這兩種情況的具體化。


二、無意識學習與有意識學習

無意識學習(unconscious learning) 只從觀察本身學狀態轉移。給定影片中某一幀 v_t,模型預測下一相鄰幀的 latent。真值由凍結的 vision encoder 抽取,再對預測值做 teacher forcing。這一路徑不需要任何標註,連續影片本身提供密集監督,讓模型吸收運動、遮擋、物體互動與場景變化這些自然規律。

有意識學習(conscious learning) 則在語言條件下學狀態轉移。作者先把影片按有意義的事件切成多段,每段配一句指令描述。給定 v_t 與相鄰事件(前一個或後一個)的描述 e_{t+Δ},模型預測該事件內隨機一幀的 latent。這一路徑的轉移是稀疏的,但每一次轉移都對應一件有語義的事。

兩者的分工可以這樣理解:無意識學習負責「世界自己會怎樣變」,有意識學習負責「被指定要變成怎樣」。前者密集而中性,後者稀疏而有向。

有意識學習還有第三條路徑:給定影片 V 與問題 l_q,用標準 next-token loss 生成答案 l_a。這條路徑保住語言介面,同時為 latent 空間注入常識約束。


三、Query 的實作方式

三個目標都經由同一個 VLM backbone,靠可學習的 query 向量區分。輸入序列的排列是:

<visual token>, <Query 1>, <Instruction>, <Query 2>

Query 1 的最後一層 hidden state 經兩層 MLP,輸出下一幀的預測 latent,對應 observation-only state transition。Query 2 則在讀入 instruction 之後,輸出事件條件下的目標 latent,對應 event-conditioned state transition。全部 query 都由零開始訓練,數量為 256。

Latent 之間的匹配用一個混合損失:

ℓ_lat = 0.1 · ||v̂ − v||² + 0.9 · (1 − cos(v̂, v))

以 cosine 為主、MSE 為輔,反映作者的意圖是對齊方向而非數值。三個目標的加權為 L = 0.1·L_obs + 0.5·L_evt + 0.4·L_vqa,狀態轉移樣本與 VQA 樣本的採樣比例約 5:1。

前兩個目標的監督全部發生在 vision encoder 的 latent 空間,不做像素級重建。這個選擇讓預訓練專注於狀態建模,但也埋下一個限制,後文會提到。


四、資料與訓練規模

預訓練資料分三類。影片資料涵蓋四種真實世界觀察:第一人稱互動、第三人稱操作、無動作標註的機械人執行,以及自然動態場景。事件資料由影片經多層次切分與語言標註而來,粗事件描述流程主要步驟,細事件捕捉每一步之內的短時轉移。VQA 資料則教模型描述與詮釋觀察到的世界狀態。

清單總量為 125K 小時影片、160M 條事件標註與 11.5M 條通用 VQA。但這一版只用了影片資料的十分之一,約 12.5K 小時,其餘留待後續迭代。

設定

Orca-4B

Orca-0.8B

Base VLM

Qwen3.5-4B

Qwen3.5-0.8B

Backbone hidden size

2560

1024

訓練資源

32 節點 / 256 GPU

32 節點 / 256 GPU

訓練步數

10,844

10,844

影片時數

約 12.5K 小時

約 12.5K 小時

Visual head

2560→20480→2560

1024→8192→1024

Backbone LR

3.5e-5

3.5e-5

ViT

凍結

凍結

五、三個讀出介面

語言讀出不加任何新模組,直接沿用 backbone 的 LM head 自迴歸生成。

影像讀出接一個預訓練的 Stable Diffusion 3.5。Orca 的 latent 經 MLP adaptor 投影,作為 MMDiT 的一路輸入;加噪的目標影像經凍結 VAE 進入另一路,最後多步去噪得到預測影像。SD3.5 的 VAE 與 MMDiT 權重全部凍結,只有 adaptor(556.9M 參數)與 LoRA(rank 32)可訓練,目標解析度 768×768,訓練 200,000 步。

動作讀出是一個由零訓練的 DiT-based Action Expert,用 flow-matching loss。它接收三種條件:Orca 的 latent、加噪動作加時間嵌入,以及機械人的 proprioception。8 個 DiT block,自注意與交叉注意交錯,action horizon 為 30,推論只用 4 個 timestep。每個任務只見過 200 條軌跡。


六、規模化行為

作者先確認兩件事。第一,總損失隨影片資料量上升而持續下降,而且 4B 的損失一直低於 0.8B。曲線沒有早早收斂,而是保持明顯下降趨勢,說明這套範式仍有規模化空間。

第二條問題更關鍵:更強的 latent 會否帶來更強的讀出?作者從預訓練過程中抽取多個 checkpoint,分別接上三個讀出模組測試。文字、影像、動作三條曲線都隨預訓練資料量上升。

動作那條曲線更直接。預訓練完全沒有用過帶動作標註的資料,純靠影片就把真機動作表現推上去。作者認為這種湧現性質,或可紓緩機械人資料稀缺造成的泛化困難。


七、文字生成

四個 benchmark 分別探測不同面向:MVBench 測通用影片理解,TemporalBench 測細粒度時間動態,3DSRBench 測三維空間推理,SWITCH 測真實世界的因果預測與驗證。

Model

Size (B)

MVBench

TemporalBench

3DSRBench

SWITCH

Avg.

V-JEPA 2.1 (+LLaMA3-8B)

10

75.4

28.5

/

/

/

Emu3

8

35.2

9.5

39.1

38.0

30.4

Emu3.5

34

39.5

9.5

31.3

38.9

29.8

Qwen3.5

0.8

52.7

19.1

21.8

38.8

33.1

Gemma 4

2

32.5

17.1

29.5

39.9

29.8

SmolVLM2

2

48.7

18.4

35.5

32.0

33.7

MiniCPM-V-4.6

2

41.4

21.2

47.7

41.2

37.9

DeepSeek-VL2

3

40.5

21.0

32.1

35.5

32.3

Gemma 4

4

45.6

20.2

44.8

52.4

40.8

Qwen3.5

4

67.1

25.2

48.1

42.8

46.7

Orca

0.8

53.6

22.6

43.4

43.7

40.8

Orca

4

65.3

34.2

52.1

55.6

51.8

Orca-4B 平均 51.8,勝過同尺寸的 Qwen3.5-4B(46.7),也勝過 34B 的 Emu3.5(29.8)。有一項例外要如實記錄:MVBench 上 Orca-4B 的 65.3 低於 Qwen3.5-4B 的 67.1。改善集中在 TemporalBench(+9.0)與 SWITCH(+12.8),即與時間動態、因果預測相關的部分。

作者另外把四個 benchmark 的樣本按能力維度重新聚合,得到一個跨 benchmark 的比較:

能力維度

Qwen3.5-4B

Orca-4B

差距

State Transition(644 樣本)

51.86

64.13

+12.27

Commonsense Reasoning(1,676 樣本)

57.76

62.95

+5.19

Spatial Relations(11,686 樣本)

54.68

55.25

+0.57

Dynamic Motion(1,736 樣本)

57.03

65.55

+8.52

改善幅度的分布本身就是一份診斷書。狀態轉移與動態運動兩項升幅最大,正正對應預訓練所優化的目標;空間關係只升 0.57 個百分點,而且這一維的樣本量最大(11,686),說明純靠狀態轉移監督並不會自動改善靜態幾何理解。


八、影像預測:PRICE-V0.1

作者強調,做影像讀出的動機不是要造一個 painter,而是要看 latent 有沒有預測未來狀態的能力。為此他們建了 PRICE-V0.1(Prediction of Real-world Interactions with Constraints Evaluation),一個指令條件下的 image-to-image 任務:給定初始狀態影像與一句指令,生成動作執行之後的目標狀態影像。

資料來自四個真實互動來源:AgiBot-World、HomeInteract(自採的雙臂輪式機械人家居資料)、PE-Video 與 PSI-Ego。評分由四個 judge 模型(Gemini 3.1 Pro、GPT 5.4、Doubao-Seed-2.0-Pro、開源的 Gemma 4-31B)按指令遵從、場景一致性與物理合理性給 1 至 5 分,再折算成百分比。

Model

Size (B)

Gemini 3.1 Pro

GPT 5.4

Doubao-Seed-2.0

Gemma 4-31B

Avg.

OmniGen2

3+4

24.6

46.8

41.4

45.5

39.6±10.2

FLUX.1-Kontext

12

21.6

46.9

42.7

52.5

40.9±13.5

FLUX.2 [klein]

4+4

29.7

64.6

60.0

70.2

56.1±18.1

Orca

0.8+2

17.0

48.5

46.0

26.5

34.5±15.3

Orca

4+2

44.0

67.9

61.0

66.3

59.8±10.9

Orca-4B 的平均分 59.8 高於 FLUX.2 [klein] 的 56.1,標準差也較細(10.9 對 18.1),即四個 judge 的評分較為一致。差距最大的是 Gemini 3.1 Pro 這位最嚴格的評判:44.0 對 29.7。

質性比較方面,作者指出通用生成模型常見的失誤包括憑空冒出無關物體、幻覺人手、指令遵從不足,以及被先驗知識帶偏。Orca 在機械人形態、場景與物體一致性、接觸關係上保持得較好。

不過 0.8B 版本的 34.5 分明顯落後,說明這條路徑對模型容量有下限要求。


九、真機動作生成

評測用一台雙臂輪式人形機械人,五個操作任務:Take Book、Stacked Bowls、Pull Out Tissue、Stamp、Scoop Sugar。兩種 OOD 設定:environment OOD 換三種未見過的桌布與背景,object OOD 換成語義相關但未見過的物件,例如把「把書放上書架」換成「把砧板放上廚具架」。

比較對象中,V-JEPA 2.1 與 Qwen3.5 都接上與 Orca 完全相同的 Action Expert,以確保比的是 latent 品質;π0.5 則是在大規模機械人資料上預訓練過的強 VLA 基線。全部 backbone 凍結。

Overall

Rule-based

M25

M50

SR

MaxP-F

FNS

RBS

SQS

V-JEPA 2.1

17.0

27

7

0

17.4

10.1

20.5

0.0

Qwen3.5

10.5

18

5

0

13.1

7.6

11.9

0.0

π0.5

29.4

54

14

5

26.5

15.3

26.7

3.0

Orca

32.4

55

14

6

27.9

15.1

30.3

2.9

分開兩種 OOD 看,結果並不一致。Environment OOD 上 Orca 的 rule-based 36.6 大幅拋離 π0.5 的 27.6;Object OOD 上則反過來,Orca 28.2 低於 π0.5 的 31.2。Orca 對場景外觀變化的穩健性較好,對物件替換的泛化則未及在大規模機械人資料上預訓練過的基線。

另一個數字:Qwen3.5 接同一個 Action Expert 的成功率是 0%,Orca 做到 6%。兩者的 backbone 同源,差別只在 Orca 多了那套狀態轉移預訓練。

DRR(Drawdown Recovery Ratio)這項指標的差距也有意思。論文舉了一個 Scoop Sugar 的案例:π0.5 反覆抓取失敗、原地抖動,DRR 為 53.7;Orca 早期同樣抓失敗,但之後恢復並成功抓起,DRR 為 100.0。作者的總結是,Orca 的軌跡走得較遠、卡住的次數較少,而且在進度回落之後較能修正方向。


十、Ablation:三個損失各自負責甚麼

λ_obs

λ_evt

λ_vqa

Text

Image

Action

Average



48.4

/

10.2

29.3


/

58.2

30.9

44.6


50.5

/

32.6

41.6


50.1

54.7

23.0

42.6

51.8

59.8

32.4

48.0

三行的對比說明分工相當清晰。缺 λ_evt 的配置,影像讀出直接不能運作。影像預測需要在語義條件下推斷目標狀態,而事件條件轉移正是把語言描述與視覺狀態對齊的那一環。缺 λ_vqa 的配置,文字讀出不能運作,LM head 失去語言介面。

λ_obs 的作用則集中在動作:由 λ_evt + λ_vqa 的 23.0 加到三者齊備的 32.4。連續影片提供的密集自然動態,包括時間變化、物體運動與局部物理互動,正是真機控制最需要的資訊。

三者齊備的平均分 48.0,高於任何兩兩組合。


十一、工程側

Orca 的訓練同時包含視覺嵌入、語言建模、未來視覺 latent 預測與動作分支,記憶體壓力比一般 VLM 訓練大。團隊在自研的 FlagScale 上做了四項改動:由 DeepSpeed 遷移到 FSDP2、activation recompute、chunked cross-entropy loss,以及 forward/backward pre-fetching。

配置

Samples/Sec/GPU

StarVLA

0.66

FSDP2 baseline

0.97

+ Chunked Cross-Entropy Loss

1.35

+ Activation Recompute

2.86

+ Forward/Backward Pre-fetching

2.91

在 H100 上最終達到 2.91 samples/sec/GPU,相對 FSDP2 baseline 提升 3.0 倍,相對具身社群常用的 StarVLA 提升 4.4 倍。單看增幅,activation recompute 那一步貢獻最大,由 1.35 跳到 2.86。


十二、作者自陳的限制

論文用了整整兩頁討論邊界,下面按原文整理。

模態太窄。 目前只有視覺與語言。作者舉例:水是否煮沸,聲音往往比畫面更早給出線索;觸覺與力回饋能反映接觸、滑動、剛度或抓穩與否。這些訊號現時全部缺席。

ViT 空間的監督。 用凍結的 vision encoder 作監督目標簡化了訓練,但也把學到的狀態空間對齊到既有的語義空間。作者認為通用的世界基礎模型應該直接從多源訊號學統一狀態空間,而非依賴任何單一預訓練模態空間。

模型規模不足。 實驗只做到 4B 與 0.8B。作者觀察到 4B 在語言、影像、動作三種讀出之間出現此消彼長,0.8B 上更明顯。這也是明明備好 125K 小時影片卻只用十分之一的原因:世界學習不只受制於資料量,也受制於模型容量。

短時距監督。 現有事件標註大多是分鐘級的短時距轉移,適合學局部轉移,但不足以建模跨小時、跨日的長期狀態演化。

損失函數不夠統一。 用三個損失才能把 Orca 訓起來,對於 Next-State-Prediction 這個宣稱而言不夠一致。作者認為需要更簡潔的損失與監督形式。

其餘幾點包括 PRICE-V0.1 的規模與多樣性仍然有限、讀出模態只驗證了語言影像動作三種,以及具身任務本身仍屬短程易解。


總結:證明方式比分數重要

Orca 的分數在同尺寸模型裏面算好看,但論證結構比分數更有用。凍結 backbone、只訓輕量 decoder,這個約束讓「latent 本身有多好」變成可以獨立度量的東西。三條讀出曲線隨預訓練資料量同步上升,是這套範式最直接的證據。

幾項數據也劃出了清楚的邊界。空間關係只升 0.57 個百分點,Object OOD 輸給 π0.5,0.8B 的影像讀出崩到 34.5,三者都指向同一件事:統一 latent 的好處有選擇性,並非所有能力都能從狀態轉移監督中免費獲得。

論文自己也把姿態放得很低,稱 Orca 為「early exploratory milestone」。以一份宣稱要通往通用世界基礎模型的技術報告而言,這種對限制的交代密度並不常見。

技術概念

實務作用

章節位置

Next-State-Prediction

建模目標由輸出形式轉為世界狀態轉移

第一節

無意識學習 λ_obs

從連續影片學密集自然動態,對動作讀出最關鍵

第二、十節

有意識學習 λ_evt

語言條件下的稀疏轉移,影像讀出的必要條件

第二、十節

VQA 目標 λ_vqa

保住語言介面,提供常識約束

第二、十節

雙 query 設計

同一 backbone 內區分無條件與條件轉移

第三節

Latent matching loss

0.1 MSE + 0.9 cosine,以方向對齊為主

第三節

凍結 backbone

令 latent 品質成為可獨立度量的變數

第五、六節

PRICE-V0.1

真實互動的狀態預測評測,非影像編輯

第八節

Action Expert

DiT + flow matching,每任務僅 200 條軌跡

第五、九節

FlagScale 優化

H100 上 2.91 samples/sec/GPU,4.4 倍加速

第十一節

Reference

  1. Orca Team, Beijing Academy of Artificial Intelligence. Orca: The World is in Your Mind. arXiv:2606.30534v1 [cs.CV], 29 Jun 2026.

  2. Qwen Team. Qwen3.5. 2026.(Orca 的 base VLM)

  3. M. Assran et al. V-JEPA 2: Self-supervised Video Models Enable Understanding, Prediction and Planning. arXiv, 2025.

  4. Y. Cui et al. Emu3.5: Native Multimodal Models are World Learners. arXiv, 2025.

  5. Physical Intelligence et al. π0.5: A Vision-Language-Action Model with Open-World Generalization. 2025.

  6. Stability AI. Stable Diffusion 3.5. 2024.(影像讀出的 decoder)

  7. Black Forest Labs. FLUX.2 [klein]: Towards Interactive Visual Intelligence. 2026.

  8. K. Li et al. MVBench: A Comprehensive Multi-modal Video Understanding Benchmark. CVPR, 2024.

  9. M. Cai et al. TemporalBench: Towards Fine-grained Temporal Understanding for Multimodal Video Models. arXiv, 2024.

  10. W. Ma et al. 3DSRBench: A Comprehensive 3D Spatial Reasoning Benchmark. 2025.

  11. Orca 專案網站:https://orca-wm.github.io


原文 Paper



bottom of page