機器人學會預測混亂場景,卻仍無法解讀人類社交訊號
美國康乃爾大學研究團隊測試視覺語言模型(VLM)的社交智慧能力,發現AI雖能預測緊張場景的結果,但在解讀人類面部表情與社交暗示方面仍有明顯不足,對未來機器人融入人類社會帶來重要啟示。

文章重點
- 康乃爾大學研究團隊測試視覺語言模型(VLM)預測短影片緊張場景結果的能力
- VLM 能預測物理混亂場景,但無法有效解讀人類面部表情與社交訊號
- 研究目標是賦予機器人社交智慧,使其能在人類社會中安全運作
- 該發現對無人機配送、搜救機器人等自主系統融入人群具有重要技術啟示
康乃爾大學探索AI賦予機器人社交智慧的可能性
美國康乃爾大學(Cornell University)研究人員正在探索利用人工智慧賦予機器人「社交智慧」的潛力——也就是讓機器人具備解讀面部表情、預判周遭人員需求,並在人類社會中正常運作的能力。
視覺語言模型的預測能力測試
這項最新研究針對「視覺語言模型」(Vision Language Models,簡稱 VLMs)進行測試。VLM 是一種能夠同時解讀與生成視覺資訊及語言的 AI 系統。研究團隊透過短影片,測試 VLM 能否預測一個緊張場景最終會順利收場還是以失敗告終。
舉例而言,研究人員讓 AI 觀看一段幼兒端著裝得過滿杯子的影片,藉此評估模型是否能預判接下來會發生什麼事——杯中液體是否會灑出來。
AI 能預測混亂,卻讀不懂人心
研究結果顯示,現有的視覺語言模型在預測物理世界中可能發生的混亂場景方面表現尚可,但在解讀人類特有的社交訊號——例如面部表情、肢體語言和情緒暗示——方面仍有顯著差距。
這項發現對於無人機、服務型機器人以及各類自主系統的發展具有重要意義。隨著無人機和機器人越來越多地在人群中執行任務,包括物流配送、搜索救援和公共安全巡邏等應用場景,它們是否能「讀懂」人類的意圖與情緒,將直接影響互動的安全性與效率。
對自主系統發展的啟示
研究團隊指出,要讓機器人與自主系統真正融入人類社會,僅具備物理環境的感知與預測能力是不夠的,還需要大幅提升對人類社交訊號的理解能力。這為 AI 領域的電腦視覺與自然語言處理技術指出了一個重要的研究方向。
對於無人機產業而言,這項研究凸顯了一個關鍵議題:未來在城市低空飛行的配送無人機或空中計程車,若能更精準地辨識地面行人的行為意圖,將有助於提升飛行安全與公眾接受度。
原文來源: 查看原文
常見問題
Newsletter
訂閱低空產業電子報
每日精選低空經濟與無人機產業新聞,直送您的信箱。
本文由 LAETimes 編輯部審核發佈 ·


