D2E:用桌面資料訓練 Embodied AI
這陣子在看一篇叫 D2E: Scaling Vision-Action Pretraining on Desktop Data for Transfer to Embodied AI 的工作,老實說一開始我有點懷疑。 他們用桌面操作資料訓練,然後拿去控制機器人? 聽起來就很像以前那種 conceptually elegant but practically dubious 的想法。 但整篇看完之後,我覺得這個方向其實比我原本想的還要務實,而且它點到了一個我們現在做 agent、做 embodied AI 都會遇到的資料到底從哪來的問題。 D2E 的核心想法是既然「人在電腦上操作」本來就是一種 vision → action 的過程,那為什麼不先用這種資料,訓練模型「看畫面 → 做決策 → 執行動作」的能力 而且桌面環境的好處太多了,解析度高、狀態清楚,Action 是離散又可記錄的,像是滑鼠、鍵盤等,資料量可以 scale 到很大幾乎不缺。 這篇工作基本上就是把 desktop usage 當成一種低成本、可擴展的 embodied pretraining proxy,推薦有興趣可以去看看,不過說真的,我當初是被遊戲畫面吸引過去的😂