具身智能赛道迎来一个标志性时刻:来自清华大学的具身模型在全球评测中登顶,力压GPT-6、英伟达等国际一线玩家。更值得注意的是,这一成绩并非依靠堆砌外部数据或“外挂”工具,而是源于一套截然不同的训练哲学——将视频预测与动作学习分阶段进行,先解耦,再排序。
事件概览
根据公开信息,清华团队研发的具身模型在全球范围内取得排名第一的成绩,超越包括GPT-6与英伟达在内的多个强劲对手。在具身智能领域,全球评测往往涉及复杂环境下的感知、决策与操作能力,能够登顶意味着模型在通用性、鲁棒性和任务完成质量上均已达到领先水平。
更令业界关注的是,这一成就的取得并不依赖“外挂”模块或额外数据的注入。所谓“外挂”,通常指借助外部数据库、人工标注或辅助模型来增强性能的手法。清华团队明确表示,该模型是在现有数据条件下,通过优化训练流程本身实现了性能跃升。
核心信息:解耦与排序
星动纪元作为该模型的研发团队,选择了一条与主流思路不同的技术路线。当前具身智能训练中,许多方案试图将视频预测与动作学习融合在一个统一的模型中,希望模型能从视频中同时理解世界和掌握控制。这种“一锅炖”的方式看似简洁,却容易让两个任务互相干扰:动作学习的误差可能污染视频预测,而视频预测的冗余信息也可能拖慢动作策略收敛。
星动纪元的做法则是将两者“解耦”。首先把视频预测作为独立阶段,让模型专注于学习物理世界的动态规律、物体的运动趋势以及环境变化的因果逻辑。随后再将动作学习作为另一阶段,在已有视频预测的基础上,专注于策略优化和动作生成。两个任务不再共享同一套梯度和内部表征,而是各自获得更清晰的优化目标。
更重要的是“重新排序”。传统流程往往“视频-动作”平行推进或视频先行、动作滞后,但星动纪元通过实验发现,训练阶段的前后顺序对最终效果影响显著。他们选择先充分训练视频预测能力,待模型形成稳定的世界模型雏形后,再接入动作学习。这样动作学习不再从零开始,而是建立在模型对环境的准确预判之上,动作策略能更快逼近最优解。
影响与观察
这种分阶段、解耦式的训练策略,在业界引发了深层次的讨论。在GPT-6和英伟达等巨头普遍采用大规模多模态预训练的背景下,清华团队的登顶证明:单一模型并非唯一答案。
- 效率优势:不依赖额外数据,意味着在同等数据规模下,分阶段训练能够挖掘更多有效信息,降低对算力和数据量的依赖。
- 可解释性:视频预测与动作学习分离后,研究者可以分别定位模型失误的根源,更清楚是感知世界模型出问题,还是策略执行出问题,这对后续迭代有直接价值。
- 通用性潜力:视频预测阶段学到的物理规律具有较强的跨任务迁移能力,重新排序后的动作学习则可以适配不同机器人形态,为多平台部署奠定基础。
当然,分阶段训练并非没有代价。它需要更精细的阶段切换策略和更严谨的评估标准,否则可能造成前序阶段过拟合或后续阶段遗忘。星动纪元的成果说明,只要阶段衔接得当,“解耦”可以比“合体”更强。
从行业趋势看,这一成果可能促使更多团队重新审视训练流程设计。过去几年,具身智能领域极度推崇端到端统一模型,而此次登顶给出了一个反例:在复杂物理交互场景中,将认知任务与控制任务适度分离,反而能取得更好的全局效果。对于正在追赶GPT-6和英伟达的国内团队而言,这也提供了一条可复制的技术路径。
结语
清华具身模型登顶全球第一,不是因为使用了更神秘的算法或更大的数据集,而是因为想清楚了“先学什么、后学什么”这一最基本的问题。星动纪元用“解耦”和“排序”两个简洁的词,回应了具身智能训练中的一个核心争议。当全世界都在把视频和动作一锅炖时,清华团队选择分阶段、讲次序,最终突围成功。这提醒我们:在人工智能的竞赛中,训练哲学的深度同样可以成为决定性因素。
信息来源:量子位,查看原始信息。本文由 AI ONLINE 基于公开资料整理,信息可能随时间变化,请以官方发布为准。
