作者|华卫
2026 年的具身智能赛道,正在经历一场悄无声息的“技术路线大分流”。主角正是机器人模型,机器人能做什么、不能做什么,就取决于这一“大脑”。
英伟达 GTC 大会上,火药味第一次被摆到了台面上,吉利、Momenta、华为等重量级玩家公开质疑 VLA 的局限性。而大火的“世界模型”,以及越来越多被提及的 VA 路线从不同方向给出了各自的答案。最具戏剧性的一幕是,作为 VLA 概念的共同开创者,Generalist AI 团队公开表示要“抛弃”VLA 乃至世界模型的标签,认为“过于在意工具的标签,反而会限制通往物理 AGI 的想象力”。
这场“口头站队”持续了几个月,到现在,具身智能已进入了“落地祛魅”的新阶段。争论的声量变小,模型发布变多,核心的较量从“谁是对的”变成了:机器人到底动起来没有。刚结束的 WAIC 上,机器人展品不再是“能动的演示”,而是围绕 3C 电子、汽车制造、仓储物流等真实场景展开的应用展示。
更值得注意的变化是,大家开始心照不宣地开始做“路线混搭”。
吵了半年,头部玩家却在悄悄“混搭”
刚刚落幕的 WAIC 已经释放出了一个清晰的信号:具身厂商们展示的模型已经从去年的以 VLA 为主,变成了今年的“世界模型+VLA”占绝大多数。不过,各个厂商对世界模型的定位不尽相同,有些内置在模型中,用于学习物理规律和决策前预演,有些则把世界模型和 VLA 作为独立模型共同开发。
智平方创始人兼 CEO 郭彦东在今年的智源大会上给出了一个明确的判断:世界模型不是 VLA 的竞争路线,而是 VLA 体系中的核心组成部分。“世界模型负责理解世界,而 VLA 负责作用于世界,两者并非对立关系,而是天然统一的整体”。
星海图同样在走融合路线。其 CEO 高继扬明确表示:“我们一直不认为 VLA、世界模型是对立的,两者底层逻辑相通,都基于 Transformer 对交互数据做处理,区别主要在监督方式与架构细节,未来越来越会走向融合。 ”据了解,星海图坚持“VLA+WAM”双技术路线,VLA 保障实时操作,WAM 提供前瞻推演,两者协同实现从“感知-决策-执行”到“预判-优化-闭环”的能力提升。
小鹏汽车通用智能中心负责人刘先明也表示,世界模型与第二代 VLA“不是互相替代或互相竞争的关係,而是透过不同训练讯号共同提升模型对物理世界的理解能力”。在 CVPR 2026 上,小鹏首次完整呈现了物理世界基座模型的技术图谱。刘先明进一步强调,只有能做基座模型的公司,才有可能真的做到 L4,自动驾驶只是第一步,未来还将应用到机器人、飞行汽车等更多具身载体。
从“二选一”到“都要用”,这是半年争吵后行业给出的第一个实际答案。
Gartner 研究副总裁高挺指出,“未来一两年,VLA 大概率仍然会是机器人动作模型的主体,但世界模型会逐步融入 VLA 系统,为机器人提供更强的物理理解、规划和预演能力。长期来看,更有可能出现的是 VLA 与世界模型的融合,而不是世界模型简单取代 VLA。”
VLA 的“自救”与升级
尽管泛化能力被质疑,但过去几个月,VLA 模型的更新反而进入了一个小高潮,只是方向变了。
蚂蚁灵波 7 月开源的 LingBot-VLA 2.0,在预训练阶段融入 6 万小时真实物理数据,含 5 万小时覆盖单/双臂、双足/轮式等多形态的真机轨迹,覆盖乐聚、智元、宇树、松灵等 17 个厂商的 20 种机器人构型,以及 1 万小时第一视角人类操作精炼数据。在 GM-100 双臂操作通用任务评测中,其总体平均任务进度分和成功率均领先于π0.5 与 GR00T N1.7。推理延迟在 RTX 4090 上控制在 130 毫秒以内。
这指向一个明确的产品化方向:一个“通用大脑”适配多种机器人。
灵波还表示,从产业落地角度看,VLA 现在还不是一个“拿来即用、解决所有问题”的成熟形态。它更像是具身智能的基础底座,能够提供通用能力,再通过少量场景数据、后训练工具链和本体适配,把能力迁移到具体机器人和具体任务上。未来两到三年内,VLA 会与其他技术路线走向深度融合,并最终催生出专属于物理世界的具身原生模型。
另外,VLA 要活下去,还得解决一个很现实的问题,那就是如何在机器人本地跑起来,而不是完全依赖云端。面壁智能在 WAIC 期间发布的 MiniCPM-Robot 系列,参数量仅 1.5B,却在 LIBERO、Calvin 等主流 VLA 评测中进入第一梯队。更关键的是,其单次决策延迟仅 120 毫秒,接近π0.5(234 毫秒)的一半。对真实机器人而言,这意味着动作更流畅、任务完成更快。
此外,传统 VLA 的一大痛点是“记不住”,只能根据当前一帧画面做判断。MiniCPM-RobotManip 通过纳入历史观测和此前执行的动作,在上下文记忆评测 RMBench 中拿到约 53 分,而π0.5 仅约 10 分,这让机器人能完成叠衣服、做三明治这类包含一连串动作的长任务。
另一家国内企业擎仓机器人同样走轻量化路线。此前其推出了 Evo-1 率先验证轻量化路线可行性,在不损失成功率的前提下,参数量更小,可面向具身智能真实应用场景,在降低单机算力配置成本的同时,实现完全端侧部署和机器人实时控制。其联合上海交大发布的 Evo-Depth,把空间感写进 VLA 策略里,但参数量仅 0.9B,仿真端 Meta-World 达 84.4%、LIBERO 达 95.4%,真机平均成功率约 90%,部署侧仅需约 3.2GB 显存、约 12.3Hz 推理频率。
VLA 没有“死”,并且它正在变得更小、更快、更能干。
加速进化的世界模型
世界模型同样在加速进化。如果说去年的世界模型还停留在“视频生成”和“轨迹预测”的学术竞赛中,那么时至今日的新成果已经指向了“行动一体化” 。
大晓机器人在 WAIC 上发布的开悟世界模型 Kairos 3.1,是这一趋势的代表之一。它依托混合 Transformer 架构与共享混合注意力机制,用一套架构打通理解、生成、预测,将视觉观测、语言指令、力触状态、策略轨迹等多维具身数据压缩进统一隐空间,形成高密度表征向量,从底层实现三大能力的原生融合。这不再是单纯的世界预测模型,而是一个能直接驱动行动的“行动一体化世界模型”。
大晓机器人董事长王晓刚点出了行业核心难题:“纯数字 AI 生成出错只会影响图文内容,但机器人在真实物理环境里预判失误,会造成实实在在、无法挽回的损失”。为此,Kairos 3.1 搭载了自主反思闭环机制,执行失败时可自主定位问题、迭代优化动作策略。在硬件适配方面,Kairos 3.1 的 8B 版本在英伟达 Jetson Thor 平台上单次推理仅 125 毫秒。它已在家务场景中展现出实用价值,比如洗衣服流程,机器人能自主拆分十余步操作,取衣、投放、开机、整理全程独立完成,出错后还能自动重试。
灵生科技合伙人蒋玉骅则提供了一个更冷静的视角:目前工业界与学术界的世界模型,规模普遍都在 10B 以下,甚至没有人画出从几十兆到几百亿参数的 Scaling Law 曲线。“对比大语言模型,具身智能大概相当于 GPT-3 之前的阶段”。当外界被各种机器人跳舞、翻跟头的 Demo 包围时,底层模型的成熟度其实远低于预期,数据和模型的双向驱动将是下半场的硬核主线。
高挺也表示,“今天,通用机器人和人形机器人的前沿路线仍然以 VLA 为主。世界模型虽然发展很快,但目前更多用于合成数据生成、仿真、评估和辅助规划,真正直接用于实体机器人控制的案例仍然比较早期。”
“都是过渡”,具身智能下一站通向哪?
如果说 VLA 和世界模型都在快速迭代,那行业对“终极答案”的态度反而变得更加谦逊了。
“VLA 与世界模型解决的是不同的问题。VLA 擅长人机交互和模态融合,而世界模型更擅长对未来状态的预测。机器人既需要融合各种感官信息,也需要在行动前对结果有预判。因此,随着机器人数据量的不断积累,VLA 和世界模型路线将加速融合,形成优势互补的闭环智能能力,而我们也在加速这一方向的探索。”灵波表示。
这种探索已经落实到灵波的模型布局中。今年 1 月他们发布了 LingBot-VLA 和全球首个自回归视频-动作世界模型 LingBot-VA,并在 7 月升级至 2.0 版本,其中 LingBot-VA 2.0 是行业首个具身原生的世界动作模型。VA 2.0 根据机器人在物理世界中的感知、预测与行动需求,重新设计训练目标和模型架构,并从头开始预训练。他们判断,当前的 VLA 和世界模型都不是终局。随着物理世界数据采集成本的降低和数据规模的扩大,触觉、力觉、动作反馈以及对未来状态的预测等能力可能进一步汇合,形成新的机器人大脑架构。
智平方则提出,类脑架构将成为下一代机器人大脑的重要演进方向。 智平方的类脑式具身智能系统 NeuroVLA,仿生人类大脑的“皮层—小脑—脊髓”三层体系,皮层负责深度推理规划,小脑保障动作灵巧稳定,脊髓实现本能极速反应。本质上说,这种分层架构是在 VLA 和世界模型之上再做一层系统级整合。
而在另一边,Generalist AI 选择了一条“离经叛道”的路。这家由 VLA 开创者创办的公司,正在试图跳过所有中间标签,不依赖任何已有路线,不走微调 VLM 加动作头的捷径,也不宣称自己是世界模型。
他们从第一性原理出发得出的结论是:想要实现物理 AGI,最好的方式或许就是“从零训练”这条看似不好走的路。其新发布的 GEN-1 模型大约 99%的参数都是从零开始训练,不基于任何现有的基础模型,但已在三个维度实现跨越:成功率超过 99%,速度提升 2-3 倍,仅需上代模型 1/10 的数据和微调。
2026 年上半年,国内具身智能赛道融资总额达 934.74 亿元,较 2025 年同期暴涨约 5 倍;融资事件 322 笔,同比增长 137%。工信部在 2026 世界人工智能大会新闻发布会上表示,今年我国人形机器人全年整机产量有望突破 10 万台。
但对比大语言模型的清晰演进路径,具身智能至今仍没有一张被完整验证过的技术路线图。VLA 和世界模型的路线之争,只是具身这个故事的第一章。接下来的分水岭是,让机器人真正动起来。而这一章的主角不会是某个技术标签,是否足够可靠、是否能够规模化,是否真的让机器人本体走进产线与家庭并完成任务,才决定了这条路线的生死。
正如 Generalist AI 团队所说,目标永远比工具的标签更重要。
声明:本文为 AI 前线原创,不代表平台观点,也不构成投资建议,未经许可禁止转载。
会议推荐
2026 年 AICon 人工智能开发与应用大会 · 深圳站将于 8 月 21 日—22 日举办,聚焦 AI 基础设施、大模型系统、智能体工程、数据智能、多模态技术与行业落地等关键方向,邀请来自腾讯、阿里、华为、百度、蚂蚁集团等 50 + 头部科技企业技术负责人、科研机构一线专家,系统性分享前沿洞察与实战干货,共同探讨 AI 技术从能力到系统、从实验到生产的真实路径。限时 9 折专属优惠,现在报名立减 580,更多详情可扫码或联系票务经理 13269078023 进行咨询。
今日荐文
你也「在看」吗?

