機器人無疑是最熱門的 AI 賽道。今年第一季,全球實體 AI 新創吸引約 160 億美元投資,創歷史新高。然而,資金快速湧入,並沒有讓機器人真正走進現實世界,因為最難跨越的瓶頸一直沒有改變:如何讓機器人在一個充滿變數的世界裡,完成它從來沒有做過的事。
原因在於,機器人需要的內容和生成式 AI 完全不同。大語言模型可以透過網路上的文字、圖片和影片理解世界,但機器人要學的是操作。同樣是一段人把杯子放到桌上的影片,生成式 AI 可以辨識出「有人把杯子放到托盤上」,機器人則需要知道:手該從哪個方向靠近、施多少力才不會滑掉、如何判斷已經抓穩。這些資訊不會出現在網路上的資料裡,更無法透過爬蟲大量取得。
很多人會直覺認為,既然缺資料,那就去蒐集更多。但近期機器人學習領域的一項研究卻發現,真正限制機器人能力的,未必是資料量,而是資料是否來自足夠多不同的環境。研究發現,在同一個場景裡,即使學習次數持續增加,模型表現也很快會遇到瓶頸;相反地,只要增加物體、環境和操作情境的多樣性,即使資料量沒有大幅增加,泛化能力反而提升得更快。
這個結果其實不難理解:同樣是一個拿杯子的動作,今天可能是玻璃杯,明天可能是不鏽鋼杯;今天桌面平整,明天可能有人剛好撞了一下桌子。人類每天都活在這些細微變化,因此不會意識到這對機器人來說有多麽困難。
也因為如此,許多新創團隊正在想辦法讓機器人遇見更多不同的情境。最直接的方法,是把人類的操作完整記錄下來。不少公司大量使用遠端操作(Teleoperation),由人類操控機器人,並把每一次關節角度、施力方式和操作過程保存下來,希望讓機器人看過越多不同的操作方式,就越能適應真實世界。
另一條路則是讓機器人自己累積經驗。輝達近期發表的 ASPIRE 學習系統,會在每次任務失敗後分析原因、修改控制程式,再把成功的方法存進「技能庫」。下一次遇到類似情境時,機器人就可以自己修正自己。
第三種做法則更具想像力,直接在高擬真的虛擬世界中進行極限訓練。心元資本投資的美國新創 Sudo AI 採用純模擬路線,讓機器人在虛擬環境中反覆面對無數種材質、光影、背景與擺放方式的組合,再直接部署到現實。
今年六月的美國 CVPR 大會上,這款機器人現場接受觀眾的隨機考驗,面對透明物體、金屬、軟質材料甚至細小的藥丸,它幾乎都能好整以暇地抓起來,台下看似即興的出題,其實早已在模擬世界中演練過無數次。今年 SUDO AI 以超過二十億美元的估值完成新一輪融資,押注的正是這條路。
過去幾年,大語言模型的成功讓大家相信只要資料足夠多,AI 就能持續進步;但是機器人的發展卻相反,真實世界最棘手的特徵,就是其不可預測的變動。對於機器人而言,在完美的實驗室裡重複一萬次完美的動作,並不能帶來真正的應用;只有在充滿隨機性的環境中經歷一萬種不同的挑戰,在混亂中尋找秩序,才會是真正的解方。