?从“翻译眼前”到“推演未来”,一场“大脑”的认知范式革命

引言
2026年7月,WAIC 2026具身智能展区释放了一个清晰的信号:行业的技术焦点正在迁移。
三年前,展台上的核心议题是双足运动的稳定性与动态姿态平衡;两年前,VLA模型的参数规模成为衡量企业技术实力的标尺;而今年,争论的焦点已上升为“大脑”的架构范式——VLA是否仍是具身智能的最优解?世界模型是补充还是替代?

这场争论的本质,是具身智能从“感知-语言-动作对齐”向“物理因果推演”的范式切换。VLA的核心能力在于将视觉感知与语言指令映射为动作参数,其本质是“翻译”;世界模型的核心能力在于推演动作执行后世界状态的演化,其本质是“预测”。从“翻译”到“预测”,是从“反应”到“认知”的升维。
一、VLA时代(2023-2025):从“标准答案”到“天花板”

OpenVLA(斯坦福,2024)基于Llama 2骨干与DINOv2+SigLIP视觉编码器,在Open X-Embodiment数据集上训练,提供了一个可复现、可微调的开源基线。 Octo(UC Berkeley,2024)采用Transformer架构,强调模块化设计与高效微调能力。 π0(Physical Intelligence,2024)引入了基于流匹配(扩散)的动作头,生成的动作比Token预测更平滑、更灵巧,代表了当时VLA模型在动作质量上的最高水平。 GR-1(北京通用人工智能研究院,2024)基于GPT风格的骨干,在视频预测和机器人示教数据上联合训练,在少量微调数据下即展现出对运动和控制任务的强迁移能力。

第一,物理理解缺失。 VLA的训练目标是“输入图像+语言→输出动作”,它学习的本质是统计相关性,而非因果规律。一个VLA模型可能“学会”了把杯子拿起来,但它不理解重力、摩擦力、碰撞这些物理量——一旦场景微调(杯子材质变了、桌面角度变了),模型就可能失效。 第二,长时序规划能力不足。 VLA是“反应式”的——看到什么、输出什么。对于需要多步推理的任务(“先把桌子收拾干净,再把碗放进洗碗机”),VLA缺乏在行动前推演后果的能力。 第三,数据效率极低。 端到端VLA模型严重依赖海量的“指令-视觉-动作”成对数据,获取成本极高。行业共识是,能实现通用自主能力的具身大模型至少需要千万小时级高质量真实交互数据,而截至2026年初,全球合规可用的机器人数据仅50万小时,缺口超过99%。
二、世界模型元年(2025-2026):从“生成视频”到“理解因果”| 世界模型:定义与本质世界模型(World Model)的概念并不新——它在强化学习领域已有多年积淀。但在具身智能语境下,它获得了全新的定义:世界模型是环境的内部模拟器,能够进行前向推演和反事实推演,将感知、预测和控制统一在同一个框架中。

更通俗地说:VLA让机器人“看到”世界,世界模型让机器人“推演”世界将如何演化。它石智航创始人陈亦伦在WAIC主论坛上给出了精炼的定义:一个真正的世界模型不仅需要预测机器人下一步动作(Action),更需要预测动作执行后世界状态(State)将如何演化。| 三条技术路线的演进过去几年,具身世界模型沿着三条路线持续迭代:

表征路线能精准识别物体、解析空间关系,却没法直接转化为控制指令。
生成路线把虚拟场景做得越来越写实,却和真机的物理控制始终隔着一层。
交互式路线搭建起三维模拟环境,却很难对齐真实世界的力触反馈与突发状况。
三条路线看似各有所长,实际落地却都困难重重。行业一度陷入“无效内卷”——模型参数量越做越大,生成画面越来越精细,但真机落地的进度始终缓慢。真正的转折发生在2025年底至2026年初:行业将核心注意力从“生成逼真视频”转移到了理解物理世界的因果规律上。此前走过的弯路,就是将“生成逼真视频”等同于“真正理解世界”。| 标志性突破:从论文到产品2026年,世界模型从学术概念走向工程落地,出现了多个标志性成果:
Goal-VLA(新加坡国立大学邵林团队,ICRA 2026):该研究创新性地将图像生成式VLM作为“以物体为中心的世界模型”,在无需任何任务特定微调和成对动作数据的情况下,实现了强大的零样本机器人操作能力。与受限于特定机器人运动学的传统智能体中心世界模型不同,Goal-VLA的世界模型聚焦于图像空间中的语义目标。
WALL-WM(自变量机器人):发布了全球首个具备“事件级预测能力”的世界模型。传统世界模型按固定时间间隔均匀采样,WALL-WM则以“事件”为边界拆分数据——事件基于语言表达,边界清晰;视觉也由事件分割,同一事件内的动作更容易预测。这让具身智能第一次跳出沿用数十年的“按时间均匀采样”范式。
AWE 3.5(它石智航):首次实现具身原生模型的“预训练+后训练”完整范式,依托超百万小时human-centric真实数据及丰富的视触觉信息。它石坚持“用物理的方式去理解世界”,从零构建原生模型。在WAIC现场,观众戴上数据采集夹爪就能与AWE 3.5生成的平行世界互动——捏起积木,松手,积木像受重力一样落向桌面——所有重力、柔性、碰撞反馈全部由模型从真实数据中学到,没有一行牛顿定律代码。
GE 2.0(智元机器人):自研世界模型Genie Envisioner-Sim 2.0在WorldArena Track1中斩获总分冠军。GE 2.0已演进为一个功能全面、高可用的世界模拟器,首次完整覆盖了长时序生成、多视角生成、本体状态感知、近实时推理与奖励判别五大核心功能。
| WorldArena:世界模型的“硬核考场”世界模型领域之所以能在短时间内实现快速收敛,一个关键因素是评测体系的建立。WorldArena作为目前世界模型领域最权威的评测榜单,构建了统一、公开、全维度的评价体系。Track-1(视频质量赛道)围绕视觉质量、运动质量、内容一致性、物理遵循性、三维空间准确性和可控性六大维度展开,进一步细分为16项核心指标。榜单汇聚了李飞飞领衔的WorldLab、谷歌、斯坦福大学、智元机器人等全球头部团队。2026年5月榜单显示:智元机器人GE 2.0以68.26分位列榜首;同济大学“无界”世界模型开源版本BLM得分64.54(全球开源第1),闭源版本BWM-Fast得分67.87(全球总榜第2);中科院物理智能团队PAIWorld随后以72.31总分登顶,在运动平滑性指标上达到95.41分,轨迹准确性单项大幅领先第二名7.4分。评测体系的成熟,标志着世界模型从“各说各话”进入了可比较、可复现的工程阶段。三、融合趋势(2026-):VLA不会死,只会进化| “VLA还是世界模型”是一个伪命题

第一阶段(2024-2025):对立。“VLA已死,世界模型当立”的说法甚嚣尘上。
第二阶段(2025年底-2026年上半年):反思。越来越多从业者意识到,两者并非替代关系。
第三阶段(2026年下半年至今):融合。行业共识正在形成——VLA解决“感知-语言-动作对齐”,世界模型解决“物理因果推演”,两者天然互补。
智平方创始人郭彦东在2026北京智源大会上给出了最清晰的判断:世界模型不是VLA的竞争路线,而是VLA体系中的核心组成部分。从生命演化角度看,生命首先需要感知环境、理解环境,然后才会产生行动——世界模型负责理解世界,VLA负责作用于世界,两者并非对立,而是天然统一的整体。基于这一判断,智平方早在2025年11月就联合北京大学推出了融合世界模型的Video2Act架构,首次实现“先预测、后执行”的机器人模型范式。随后又发布了全球首个类脑式具身智能系统NeuroVLA,仿生人类大脑“皮层—小脑—脊髓”三层体系。千寻智能的Spirit v1.6同样采用了VLA与世界模型深度融合的架构,打通环境感知、任务理解、动作规划与状态预判。自变量机器人则以“世界统一模型”WALL-B为旗舰,同时布局开源VLA模型WALL-OSS-0.5和事件级世界模型WALL-WM。| 分层与统一的再平衡在“VLA+世界模型”融合的大框架下,“大脑应该分几层”的争论也在演变:
分层派(逐际动力COSA 0.5的三层架构:System 0运控层/System 1技能层/System 2认知层)认为,“模型只是技能,系统才是真大脑” 。
统一派(它石智航AWE、自变量WALL-B)认为,分层链路里微小错误会被级联放大,端到端统一模型才能消除模块间的边界和数据搬运损耗。
但一个有意思的现象是:两派正在相互靠近。逐际动力的System 1本身就包含VLA能力;它石智航的AWE 3.5虽然坚持端到端,但也引入了世界模型驱动的后训练。“分层架构+统一模型内核”正在成为一种新的实用主义选择。腾讯在WAIC 2026期间发布的三大具身基座模型——Hy-Embodied-VLM-1.0(“右脑”,理解图像空间场景)、Hy-Embodied-RxBrain-1.0(具身“大脑”,统一认知规划与未来状态想象)、Hy-Embodied-VLA-0.5(连接“小脑”和身体)——提供了一个“三者各司其职”的融合范本。| 技术融合的深层逻辑VLA与世界模型的融合,本质上是从“数据驱动”走向“因果驱动” 。

纯VLA依赖的是“相关性”——看到A就做B。纯世界模型依赖的是“生成力”——预测未来画面。而融合架构追求的是“因果力”——在行动前推演“如果我做A,世界会变成什么样” 。这一融合的工程价值正在被验证。自变量CTO王昊预测,未来的世界模型路线很可能像大语言模型一样——隐空间路线适合视觉推理,VLA模型与物理相关的能力需要保留,显式建模对空间的记忆同样有益,未来可能扮演类似RAG的角色。四、企业技术矩阵:五维能力雷达为直观对比主要企业在“大脑”技术路线上的差异化布局,以下从感知精度、预测能力、推理速度、泛化能力、落地进度五个维度进行梳理:
图表:主要企业技术路线与五维能力对比
企业 | 核心模型/系统 | 技术路线 | 感知精度 | 预测能力 | 推理速度 | 泛化能力 | 落地进度 |
逐际动力 | COSA 0.5 | 三层分层架构(Sys0/1/2) | ★★★★ | ★★★ | ★★★★ | ★★★★ | ★★★★ |
腾讯 | RxBrain+VLM+VLA | 三模型协同(裂脑架构) | ★★★★★ | ★★★★ | ★★★ | ★★★★ | ★★★ |
自变量 | WALL-B/WALL-WM | 世界统一模型(端到端) | ★★★★ | ★★★★★ | ★★★ | ★★★★★ | ★★★★ |
它石智航 | AWE 3.5 | 具身原生端到端 | ★★★★ | ★★★★★ | ★★★★ | ★★★★★ | ★★★★ |
智平方 | NeuroVLA | 类脑架构(皮层/小脑/脊髓) | ★★★★★ | ★★★★ | ★★★★ | ★★★★ | ★★★★ |
智元 | GO-2 / GE 2.0 | VLA+世界模型双线 | ★★★★ | ★★★★★ | ★★★ | ★★★★ | ★★★★★ |
千寻智能 | Spirit v1.6 | VLA+世界模型深度融合 | ★★★★ | ★★★★ | ★★★★ | ★★★★ | ★★★★ |
Figure AI | Helix | 双系统VLA | ★★★★ | ★★★ | ★★★★★ | ★★★★ | ★★★ |
英伟达 | GR00T N1 | 双系统VLA(开源) | ★★★★★ | ★★★ | ★★★★★ | ★★★★ | ★★★ |
注:★评级基于公开技术资料和行业评测结果综合评估,仅供参考
解读:
预测能力维度,自变量(事件级世界模型)、它石智航(AWE世界模型驱动后训练)、智元(GE 2.0登顶WorldArena)处于第一梯队
泛化能力维度,自变量WALL-OSS-0.5在17个真机任务中4个无需后训练即达八成以上自主完成率,它石AWE 3.5实现“任务之间不重新加载模型、不切换参数”
落地进度维度,智元(1.5万台量产下线)、逐际动力(数千台订单,过半来自海外)领先
结语从RT-2奠定VLA范式(2023),到π0、OpenVLA百花齐放(2024),再到世界模型集中爆发(2025-2026),具身智能“大脑”的技术路线在短短三年内经历了从统一到分化、再从分化走向融合的完整周期。

2026年正处于技术收敛的前夜。VLA不会死,世界模型也不会一蹴而就。真正的大机会在于两者的深度融合——让机器人既拥有VLA的实时反应能力,又具备世界模型的前向推演能力。谁能在“VLA+世界模型”的融合架构上率先跑通数据闭环、完成规模化验证,谁就能在这场万亿级的认知革命中占据制高点。(免责声明:本文内容基于公开技术论文、行业报告及企业披露信息整理,个人研究观点,仅供参考,不构成任何投资建议。)