7月28日,通用具身基礎模型廠商智在無界正式發布了新一代隱式觸覺世界動作模型Being-H0.8。
據了解,該模型首次將觸覺模態系統性引入大規模預訓練環節,實現了視覺、觸覺、動作與物理世界未來狀態的統一表征,標志著具身大模型從“視覺觀察”跨入“多模態交互理解”的新階段。
在過往的具身智能方案中,視覺幾乎是最核心的感知輸入,但僅靠視覺很難覆蓋真實操作的全部信息,特別是物體是否接觸、有沒有滑動、施力是否到位,這些直接決定操作成敗的細節,往往無法通過畫面可靠獲取。
這也導致傳統方案在插拔、旋擰、精密裝配等接觸密集型任務中,穩定性始終難以達標。
Being-H0.8的核心突破,正是首次在預訓練階段就將觸覺信息完整納入隱式世界模型架構,讓視覺、觸覺、動作與未來狀態變化映射到同一套特征空間中,使模型同時理解“看到了什么、做了什么、接觸到了什么,以及世界會因此發生什么變化”,形成對物理交互過程的完整認知與預測能力。
為了適配高頻觸覺反饋的特點,Being-H0.8還設計了慢快動作專家機制:系統首先在每個動作時域開始時計算一次“世界—動作上下文”并進行緩存;隨后,在時域內少數幾個錨點處,注入最新觀測到的本體狀態與觸覺反饋,動態生成或修正當前正在執行的動作片段。
而針對現有觸覺傳感器和數據采集系統普遍成本高昂,采集流程也高度依賴專用硬件、觸覺手套和受控實驗環境,始終無法達到大模型預訓練所需的數據規模,智在無界還自主研發了面向大規模無標注人類視頻的密集觸覺偽標簽系統TactoHand。
該系統無需為數據采集者配備觸覺手套或額外傳感器,即可從普通人類視頻中推斷手部與物體交互過程中密集空間點的接觸概率和連續接近度,以接近零邊際成本的方式為海量視頻補充觸覺監督。
據了解,基于TactoHand,智在無界首次將觸覺信息擴展至超過50萬小時的人類視頻,并將其用于具身基礎模型預訓練。
另外,在Being-H0.8中,智在無界還進一步提出了第二代統一動作空間TopoHand,為人類手部、靈巧手和平行夾爪提供統一的運動學接口。TopoHand采用了固定拓撲的“螺旋手”表征,由20個語義關鍵點和20個規范關節變量組成,并以手腕為中心建立統一坐標系:x軸指向中指指尖在手掌平面上的投影方向,z軸與手掌法線方向一致,y軸則用于構成右手坐標系。
在這一表示下,不同本體特有的關節命名、機械結構和網格拓撲均被隔離在策略接口之外,實現了模型不再直接依賴某一具體機器人或人手模型的原始關節定義,而是在統一的語義拓撲和運動學空間中學習操作規律,真正實現大規模人類視頻中的操作先驗能夠更加高效地遷移到多種機器人本體,并顯著提升跨本體預訓練的效率與可擴展性。
從規模到質量:具身基礎模型的三級跳
過去一年,智在無界圍繞大規模人類視頻預訓練,已經完成了多輪迭代,其演進路徑也折射出具身智能行業在數據層面的共性發展邏輯。
第一階段從Being-H0到Being-H0.5,核心是驗證“人類視頻能不能用來訓練具身基礎模型”,完成了從0到1的可行性驗證;
第二階段從Being-H0.5到Being-H0.7,目標是解決“怎么規模化使用人類視頻”,數據規模從數萬小時攀升至20萬小時;
到本次發布的Being-H0.8,正式進入第三階段,重點是如何用高質量、多模態的數據持續驅動模型進化。觸覺模態的加入與全棧數據-模型管線的完善,正是對這一問題的回應。
智在無界成立于2025年5月,目前已構建起從數據管線、模型預訓練、后訓練、評測到端側部署的全棧基礎設施。
從Being-H0到Being-H0.8,歷經多輪迭代,智在無界已經匯聚了超過500,000小時的第一人稱視頻數據,并與數十家數據合作伙伴建立了合作。