家庭场景被视为人形机器人最具潜力的应用领域,却也是技术突破难度最大的试验场。与工厂流水线中结构化、可预判的操作环境不同,家庭空间充满动态变量:堆满杂物的桌面、散落一地的玩具、需要侧身避让的家具,甚至擦窗时需同步调整身体重心以维持平衡。这些对人类而言稀松平常的家务,却对机器人提出极高要求——既要精准感知环境变化,又要实现全身动作的动态协调。
近日,由南洋理工大学、北京大学、香港科技大学(广州)及智源研究院联合研发的ω-0模型,为破解这一难题提供了新思路。该模型通过构建隐空间预测框架,将语言指令、环境感知与动作生成整合为统一流程。输入指令后,系统可同步解析空间布局、物体位置及机器人自身状态,直接输出底层控制器可执行的精简动作指令,支持“移动中操作”的全身协同任务。
研发团队选取11项高难度居家任务进行真机测试,涵盖跨区域物品收纳、高低位杂物清理、动态避障等复合场景。结果显示,ω-0在第一视角任务中成功率达79.1%,全场景模式下更突破81.8%,显著优于π-0.5、EgoVLA等主流模型。这一突破标志着机器人从“分步执行”向“连续协同”的模式跃迁——例如擦大尺寸桌面时,机械臂可随移动持续调整擦拭轨迹,无需停顿重新定位;拖地时双腿能根据手臂用力方向动态平衡重心,避免打滑或倾倒。
技术层面,ω-0摒弃了传统“视频-动作”逆向转换路径,转而采用查询表征架构。该架构通过未来视觉特征预测任务进度与场景演变,同时由动作分支直接生成全身潜在指令。为适应真实家庭环境的复杂性,团队设计了三阶段递进训练体系:第一阶段通过全身动作VLM预训练构建基础能力;第二阶段融合视觉、语言及本体数据,利用视频查询预判环境动态变化;第三阶段引入40.3小时真实居家数据,涵盖4827条任务轨迹及24类场景,使模型具备自主适配能力。
为降低行业训练成本,研究团队同步开源了ω-HOME数据集。该数据集包含多视角语言指令、本体状态及运动轨迹等同步采集信息,每条轨迹均标注第一视角与第三视角画面,为下游任务提供高密度训练样本。这一资源开放或将加速全身协同技术在机器人领域的普及。
尽管81.8%的成功率已属行业领先,但距离真正融入家庭仍存在挑战。当前模型在极端复杂场景中的稳定性、长期运行的自主维护能力等方面仍有提升空间。不过,其核心价值在于验证了“全身整体决策”的技术路径——当机器人的四肢与躯干不再各自为政,而是形成动态协调的有机整体,实验室中的技术演示才有望转化为真实生活中的服务能力。












