模型介绍
了解 Wall-OSS-0.5 的模型定位、联合训练框架、动作表示、预训练数据和真实机器人评估结果。
Wall-OSS-0.5 是自变量推出的开源视觉-语言-动作模型(Vision-Language-Action Model,VLA),面向真实机器人场景中的通用操作能力构建。
模型开发路径
开发者可以从三种路径开始:
-
直接验证预训练模型: 不重新训练,直接完成输入输出配置、推理服务和真机验证。
-
微调 Wall-OSS: 使用自有 LeRobot 格式数据微调模型,再完成评估和真机运行。
-
适配第三方模型: 完成 observation、action、数据、训练和 SDK 运行链路适配;当前目录提供 π0.5 适配说明。
从预训练到直接部署
Wall-OSS-0.5 基于 3B 视觉语言模型骨干扩展,整体规模约 4B 参数。模型根据视觉输入和语言指令,直接生成真实机器人可以执行的连续动作。
传统机器人模型的能力通常需要经过任务特定微调后才能充分体现。Wall-OSS-0.5 更强调预训练阶段形成的可执行能力:即使没有针对特定任务微调,预训练 Checkpoint 也可以在真实机器人任务中展现可衡量的操作表现。
Wall-OSS-0.5 的核心目标,是推动机器人基础模型从“更好的初始化”走向“可直接验证的预训练能力”。在语言和视觉领域,预训练模型通常能够直接回答问题、理解图像或遵循指令;Wall-OSS-0.5 围绕机器人领域的这一差距重新设计 VLA 预训练流程,使预训练 Checkpoint 本身可以作为真实机器人策略进行评估。

Wall-OSS-0.5 预训练能力与具身理解表现
梯度桥接式联合训练
Wall-OSS-0.5 采用 gradient-bridged co-training(梯度桥接式联合训练)框架,同时结合三类互补目标:
-
多模态交叉熵: 保持视觉语言模型原有的指令理解与视觉 grounding 能力;
-
离散动作 token 预测: 作为“梯度桥”,将控制相关信号注入视觉语言骨干;
-
连续动作 flow matching: 作为部署时的动作生成接口,输出真实机器人可执行的连续动作。
通过这一设计,模型能够在统一训练体系中同时学习“看懂场景”“理解指令”和“生成动作”。

Wall-OSS-0.5 梯度桥接式联合训练架构
视觉对齐动作表示
Wall-OSS-0.5 引入 Vision-Aligned RVQ Action Tokenizer。它不只是将动作轨迹压缩成离散 token,还通过视觉-动作对齐、未来观测预测和动作重建等目标,使离散动作 token 更好地承载可被视觉语言骨干学习的操作语义。
训练阶段主要由离散动作路径提供强监督信号,部署阶段则由连续动作路径输出真实机器人动作。

Vision-Aligned RVQ Action Tokenizer 结构
预训练数据
Wall-OSS-0.5 的预训练数据融合:
-
高质量自采机器人操作数据;
-
经过筛选的开源多机器人形态数据;
-
大规模多模态语料;
-
由机器人动作轨迹构建的 embodied bridge data,用于连接视觉理解、空间推理和可执行动作。
模型预训练覆盖超过 20 种机器人形态,每轮处理超过 100 万条机器人轨迹,并结合约 9000 万多模态样本。

Wall-OSS-0.5 预训练数据组成与机器人形态
真实机器人能力
Wall-OSS-0.5 在 17 个真实机器人任务上进行了预训练 Checkpoint 直接评估,任务覆盖语义理解、刚体操作、柔性物体操作、精细操作和长程多步操作。
在 400k Checkpoint 上:
-
整体平均任务进度达到 51.1;
-
已见任务平均为 50.0,未见任务平均为 53.6;
-
Block Sorting 达到 100%;
-
Fruit Sorting 达到 96%;
-
Ring Stacking 达到 86%;
-
未见柔性物体任务 Rope Tightening 达到 82%。
在 15 个真实机器人下游任务微调中,Wall-OSS-0.5 的平均任务进度达到 60.5,高于原文材料中对比的 π0.5(43.0)和 DreamZero(33.4)。这些结果说明,面向部署的预训练既能形成直接可执行能力,也能为后续微调提供更强的能力先验。

Wall-OSS-0.5 真实机器人任务评估结果
具身理解能力
动作数据和具身多模态数据不仅帮助模型学习控制,也增强了模型对“哪里可以操作”“目标在哪里”“物体应放置到哪里”等关键问题的理解。
相比原始视觉语言骨干,原文材料给出的提升包括:
-
Embodied Grounding:提升 21.8;
-
Where2Place 放置推理:提升 11.0;
-
EO-Bench:提升 3.9。

Wall-OSS-0.5 具身理解基准结果
上述结果用于说明模型能力,不等于对特定用户任务的效果承诺。实际结果取决于机器人配置、数据质量、任务分布、训练配置和真机环境。
开源与版本范围
Wall-OSS-0.5 希望为具身智能社区提供可研究、可复现、可扩展的基础平台,推动机器人基础模型从实验室评估走向真实世界部署。
本文档仅适配 Wall-OSS-0.5。使用 Wall-OSS-FLOW 或 Wall-OSS-FAST 时,需要切换到对应历史代码:
git checkout 97406f2ab5de414c79b091873f946c112d105c72