大晓机器人携手南洋理工开源Puffin-World 赋能机器人三维环境感知与具身智能训练

   时间:2026-09-11 07:19 来源:快讯

大晓机器人与南洋理工大学S-Lab等机构近日联合发布并开源了一款名为Puffin-World的统一多模态世界模型框架,旨在为机器人训练与具身智能应用提供更全面的技术支撑。该框架首次将物理、几何和外观定义为三维世界的三种原生状态,通过整合重力场感知、自由视点空间仿真、三维世界生成与重建以及闭环探索等功能,实现了对机器人行动后世界状态的精准预测。

与传统模型不同,Puffin-World从三维世界状态的本质出发,构建了物理方向、空间几何和视觉外观相互关联的原生状态体系。这种设计使模型在生成新视角时,不仅能呈现逼真的画面,还能确保画面在物理方向和三维结构上的合理性。该框架在单次生成过程中同步输出RGB外观和深度几何信息,使生成结果可直接用于三维重建,无需依赖额外的深度估计模块,从而将世界生成与重建整合为统一的状态预测过程。

Puffin-World的核心优势在于其统一性。通过同一套视觉、语言、相机和世界状态表征,该框架能够在一个模型中完成四类关键任务:单图理解相机物理信息、自由视点空间仿真、三维世界生成与重建以及闭环自校准探索。任务切换由输入内容、相机条件和视图角色决定,而非依赖不同系统的组合,使其更贴近机器人从感知、推理到行动的完整工作链路。

为支撑这一复杂框架的训练需求,研究团队构建了包含1600万核心数据的Puffin-16M数据集。该数据集分为两部分:Puffin-Cam-15M提供1500万组视觉、语言、相机三元组,覆盖室内外、真实与合成场景,并包含不同分辨率、相机姿态和视场角的数据;Puffin-Traj-1M则提供100万条具有挑战性的旋转轨迹,涵盖连续俯仰、横滚、偏航及360度环视等复杂运动,重点弥补传统数据集在大幅旋转和长轨迹探索方面的不足。研究团队还开放了覆盖28个公开数据集、约4450万张图像的绝对相机位姿标注,为机器人仿真、合成数据生产与具身智能训练提供了可复现、可扩展的技术基础。

在性能验证方面,Puffin-World在四项基准测试中均取得领先成绩。在相机到真实世界理解任务中,该框架在Stanford2D3D、MegaDepth、TartanAir和LaMAR四个公开基准上取得最佳或并列最佳的中位误差,并在多数AUC指标上表现优异。这些结果证明,Puffin-World不仅提升了图像质量,更在相机物理理解、空间控制灵活性、几何一致性生成和三维重建之间建立了相互支撑的统一能力。

此次开源的Puffin-World不仅包含算法实现,还提供了从数据、标注、训练到评测的完整技术链路。这一举措为研究机构和产业开发者围绕机器人仿真、合成数据、虚拟现实、三维内容生产与具身智能等领域开展后续开发提供了重要支持,推动了世界模型从视觉内容生成向可感知、可校准、可探索和可重建的三维环境迈进。

 
 
更多>同类天脉资讯
全站最新
热门内容
媒体信息
新传播周刊
新传播,传播新经济之声!
网站首页  |  关于我们  |  联系方式  |  版权隐私  |  RSS订阅  |  违规举报 鲁公网安备37010202700497号