宇树科技宣布开源面向通用人形机器人操作的视觉-语言-动作(VLA)大模型 UnifoLM-VLA-0,旨在通过强化空间推理与物理交互能力,推动机器人从“图文理解”向“具身大脑”升级。
据介绍,该模型通过在机器人操作数据上的继续预训练,实现了从通用“图文理解”向具备物理常识的“具身大脑”的进化,旨在突破传统 VLM 在物理交互中的局限。
针对操作类任务中对指令理解与空间感知的高要求,模型通过继续预训练深度融合了文本指令与 2D/3D 空间细节,增强了模型的空间感知能力。构建了全链路动力学预测数据,模型具备更好的任务泛化性。在真机验证中,仅需单一策略即可高质量完成 12 类复杂的操作任务。
基于 Qwen2.5-VL-7B 开源模型,宇树构建了覆盖机器人与通用场景的多任务数据集,并开展持续预训练。该数据集涵盖 2D 检测与分割、任务层级分解、3D 目标检测、空间位置推理及轨迹预测等多维数据,有效提升了模型对几何空间与语义逻辑的对齐能力。
针对操作类任务,宇树对开源数据集进行了系统化清洗,最终仅利用约 340 小时的真机数据,进行离散动作的预测训练。在此基础上,模型集成了动作分块预测,以及前向与逆向动力学约束,实现对动作序列的统一建模,从而使 VLM 具备对机器人与物体物理交互规律的深度理解能力,并支持长时序动作规划与决策。
项目主页:https://unigen-x.github.io/unifolm-vla.github.io/ 开源代码网址:https://github.com/unitreerobotics/unifolm-vla
评论删除后,数据将无法恢复
宇树开源 UnifoLM-VLA-0,面向通用人形机器人操作的 VLA 大模型
宇树科技宣布开源面向通用人形机器人操作的视觉-语言-动作(VLA)大模型 UnifoLM-VLA-0,旨在通过强化空间推理与物理交互能力,推动机器人从“图文理解”向“具身大脑”升级。
据介绍,该模型通过在机器人操作数据上的继续预训练,实现了从通用“图文理解”向具备物理常识的“具身大脑”的进化,旨在突破传统 VLM 在物理交互中的局限。
针对操作类任务中对指令理解与空间感知的高要求,模型通过继续预训练深度融合了文本指令与 2D/3D 空间细节,增强了模型的空间感知能力。构建了全链路动力学预测数据,模型具备更好的任务泛化性。在真机验证中,仅需单一策略即可高质量完成 12 类复杂的操作任务。
基于 Qwen2.5-VL-7B 开源模型,宇树构建了覆盖机器人与通用场景的多任务数据集,并开展持续预训练。该数据集涵盖 2D 检测与分割、任务层级分解、3D 目标检测、空间位置推理及轨迹预测等多维数据,有效提升了模型对几何空间与语义逻辑的对齐能力。
针对操作类任务,宇树对开源数据集进行了系统化清洗,最终仅利用约 340 小时的真机数据,进行离散动作的预测训练。在此基础上,模型集成了动作分块预测,以及前向与逆向动力学约束,实现对动作序列的统一建模,从而使 VLM 具备对机器人与物体物理交互规律的深度理解能力,并支持长时序动作规划与决策。
项目主页:https://unigen-x.github.io/unifolm-vla.github.io/
开源代码网址:https://github.com/unitreerobotics/unifolm-vla