2026年世界人形机器人运动会上,来自16个国家的666支队伍带来2056台机器人,在田径、武术以及家庭、酒店、工业等真实场景中竞技。赛场上的翻车现场令人发笑,但机器人一旦进入家庭,可能打翻水杯、撞倒家具,真实世界的不可预测性让训练好的动作频频失效。如何让机器人在动手前先预演后果?世界模型应运而生,但传统模型往往无法可靠模拟——动作指令不敏感、长时推演漂移、虚拟成绩与真机表现脱节。
事件概览:虚拟训练场的突破
自变量机器人近日发布自回归世界模型WALL-SS,为机器人构建了一座完整的“虚拟训练场”。该模型能够推演持续60秒的倒水、物品整理等长程任务,并根据不同动作指令生成不同未来画面。研究团队将多套机器人策略分别放入WALL-SS和真实世界测试,结果显示,虚拟世界中执行效果更好的策略,在物理世界往往也表现更优。这意味着,机器人做的“梦”开始能够用于练习和筛选真实动作。
核心信息:技术架构与验证
动作敏感:不同动作导向不同未来
传统世界模型常犯“磁铁式抓取”错误:即使夹爪与物体间有明显空隙,生成画面也会让物体主动贴进夹爪。WALL-SS采用“尺度自回归”架构,先搭出低清预览确定大方向,再逐层调清细节。动作与画面置于同一条时间线,夹爪移动、开合必须与视觉变化严格对应。在固定初始画面、仅改变动作轨迹的评测中,WALL-SS对动作变化的敏感度得分0.290,而Cosmos3仅为0.044,其他模型得分为0。
轨迹精度:虚拟机械臂严格遵循指令
衡量“轨迹精度”的指标上,WALL-SS得到0.539,在所有对比模型中最高。其视觉骨干InfinityStar得分为0.251。这意味着虚拟机械臂不仅“听见”了动作指令,更能沿着指令指定的路线精确移动。
长时记忆:60秒持续推演不“断片”
家庭任务往往包含多个连续步骤,持续数十秒。WALL-SS引入“尺度压缩的长时间跨度记忆”:刚刚发生的动作保留更多细节,更早的历史自动压缩为摘要,模型无需记住每个像素。同时,研究团队通过“逐尺度梦境强迫”训练,在历史信息中加入扰动,让模型学会在有小错误的情况下继续预测正确未来。在60秒倒水任务推演中,机械臂逐帧轨迹误差保持在画面对角线的0.5%以下,而只保留最近片段的版本在20至30秒后开始明显恶化。
虚拟成绩与真机高度一致
研究团队选取5个不同训练阶段的策略,在6项任务、20组匹配初始状态下,分别进入WALL-SS和真实机器人执行,共得到600对闭环结果。其中527对最终成败一致,虚拟策略排名有89%的优劣关系与真机测试相同。将30个“任务与策略版本”组合的成功率放在一起比较,虚拟结果与真机结果的相关系数为0.926,平均绝对误差为0.062。这一数值表明,WALL-SS能够有效预测真机策略的相对优劣,成为研发系统中可靠的策略筛选工具。
影响与观察:世界模型角色的转变
WALL-SS的突破改变了世界模型在机器人公司中的位置。过去,世界模型更像内容生成工具,视频流畅但缺乏物理因果。现在,它开始成为研发测试的基础设施。失败和纠正数据帮助模型认识现实的边界,虚拟环境批量筛选策略,少量真机结果再回来检查和修正虚拟世界。这类似于汽车碰撞仿真:它不会取消最后的实车测试,却能大幅减少为筛选设计而撞掉的真车。对于按吞吐量和停机时间计算成本的仓库、家庭等场景,虚拟筛选有机会减少设备占用和现场复位,避免用户成为最早一轮试错的“小白鼠”。
当前WALL-SS的真机实验主要集中在桌面双臂任务,连续推演时长60秒。但该技术路线为具身智能的“ChatGPT时刻”提供了更现实的方向。宇树科技创始人王兴兴曾判断,机器人能够在约80%的陌生场景中,只靠语言或文字指令完成约80%的任务,这个时刻快则2至3年,慢则5年甚至10年。WALL-SS让机器人在走向真实工位之前准备更充分,先在虚拟世界里检查抓空、碰撞或连续作业中的跑偏,从而降低研发成本,加速落地进程。
结语
当机器人从竞技表演走向真实服务,行业评判技术的方式也在改变。一个成功的Demo只是入场券,能否重复完成任务、更换环境是否还能工作、模型每次更新要花多少真机成本,这些将变得更加重要。WALL-SS提供了一种具体解法:动作必须真正改变预测结果,长任务中不能轻易失忆,虚拟策略排名要接受真机验证。虽然距离机器人完全走进家门还有距离,但这座虚拟训练场至少让“少摔一次”成为可能。
信息来源:爱范儿,查看原始信息。本文由 AI ONLINE 基于公开资料整理,信息可能随时间变化,请以官方发布为准。
