智东西7月23日报道,在世界人工智能大会WAIC 2026期间,北京大模型独角兽面壁智能开源了其首个具身智能技术成果MiniCPM-Robot系列模型,包括通用VLA模型MiniCPM-RobotManip与面向移动机器人跟踪导航的MiniCPM-RobotTrack,正式进军机器人领域。
面壁智能成立于2022年8月,今年上半年累计融资超过50亿元,估值超过200亿元,是当前我国端侧智能领域公开估值最大的独角兽企业。
MiniCPM-RobotManip基于面壁智能最新多模态端侧模型MiniCPM-V 4.6训练完成,延续了MiniCPM-V 4.6“小尺寸、高性能”与视觉Token极致压缩的技术优势,以仅1.5B的参数规模实现比肩体量更大的3-4B模型的性能、但流式实时推理计算成本减半,模型支持1分钟的具身原生记忆,从而能够高效完成考验上下文记忆的操作任务。
MiniCPM-RobotTrack由面壁智能和南京大学合作研发,是业内首个支持真实本地断网部署的跟踪模型,首次实现纯视觉的本地自主指令追踪。
该模型原生适配宇树Go2 Edu ,仅依靠原装摄像头和本地算力即可完成单目标、动态多目标及模糊目标跟踪,稳定达到5+ Hz,端到端响应时延约180毫秒,并构建了自进化数据管线、能够持续提升复杂动态环境下的跟踪能力。
GitHub地址:https://github.com/OpenBMB/MiniCPM-Robot
Hugging Face地址:
https://huggingface.co/openbmb/MiniCPM-RobotManip
https://huggingface.co/openbmb/MiniCPM-RobotTrack
截至2026年6月30日,面壁智能MiniCPM开源模型系列累计下载量突破3800万次,覆盖文本、视觉、语音全模态。
在具身智能领域,面壁智能与吉利汽车、乐聚机器人开展深度合作,形成面向工业制造与商业服务的双线布局。
在工业制造方向,面壁智能的VLM多模态大模型与吉利机器人的本体、VLA模型及导航系统深度集成,成功实现吉利机器人在生产仓储场景的落地应用。
在商业服务方向,面壁智能与乐聚机器人联合推出展厅导览Agent解决方案,可在无网络环境下纯端侧运行导览系统,支持基于本地知识库的离线讲解和自由问答。
在巡检场景中,依托面壁智能的多模态能力,搭载乐聚机器人本体和巡检系统,可高效识别园区内车辆违规停放、路面异常、公共设施异常等情况,所有敏感数据均在本地处理。该方案覆盖6大类商用导览场景,可识别30余种巡检异常,检测成功率超过95% 。
WAIC期间,面壁智能创始人兼首席科学家刘知远、面壁智能多模态智能首席科学家姚远与智东西等媒体进行交流,进一步分享了面壁智能做具身智能的动力、优势、打法与目标。
一、为什么要做具身智能?目标与技术积累双重驱动
刘知远认为,具身智能是AI走向物理世界的必由之路,面壁智能内部团队的共同目标是端侧智能,机器人是下一代智能终端非常重要的形态。
从技术角度而言,具身智能属于多模态的直接下游,面壁智能在高效多模态路线上有很多技术积累,这也是为什么面壁智能做具身智能时间不长,但基础工程链路认知建立得较快。
语言模型具备思考、决策、规划能力;过去三年,姚远在面壁智能补齐了感知能力,有了更多的模态,如语音、视觉,未来可能还有雷达、遥感等各种来自自然界的信号;具身智能则补齐了动作、行动能力。人类智能包括感知、思考和行动,未来要形成一个严格闭环,这就是面壁智能团队在努力完成的工作。
据姚远透露,面壁智能的语言模型、多模态模型、具身智能模型团队相互支撑,底层数据、工程链都是共享的,具身智能团队训的VLA模型是直接基于多模态团队的工作,很多通用能力能快速拉到一起做,因此能在较短时间内达到相对第一梯队的效果。
“具身智能模型连ChatGPT时刻还没有找到。”刘知远说。在他看来,大语言模型、感知、行动成熟度不同,语言模型聚焦在让密度持续变高,多模态要补足最后几个拼图,让它达到完全态,然后再进一步的追求密度,让它反应更快;行动成熟度还没有那么高,更多还是在做探索性的工作,技术成熟后才有可能商业化。
数据是当前具身智能行业面临的共同瓶颈。姚远说,没有一种数据是完美的,要么是量不够,要么是精度不够。真实世界的一大难点来自多样性、随机性,无法通过少数几条过拟合去解决的。面壁智能将具身智能模型和多模态模型底层数据打通,同时也会有各种类型的具身智能数据。
在刘知远看来,具身智能的数据不是能从互联网获取的,要有意识地从自然界的交互反馈中去收集,把感知、思考和行动形成一个闭环。现在越来越多的具身智能企业将主要精力放在数据集的构建上,这会极大加速具身智能的进展。
二、具身智能发挥大脑角色,要走先通后专模式
面壁智能的具身智能模型以通用智能为起点,旨在让机器人能够直接处理普适、长程、流水线式任务。
据刘知远分享,面壁智能的具身智能模型发挥“大脑”角色,会与很多不同类型的本体厂商合作,包括做人形机器人、机器狗、灵巧手、机械臂的,通过大小脑协同等方式工作。
相比之下,一些本体厂商更适合做本体上的“小脑”,偏具体行动,可能会涉及感知,不太涉及思考。感知与行动要形成一个快速闭环,不需要经过大脑。
面壁智能做的是通用具身智能。它在语言模型和多模态模型上看到的一个重要趋势,是基础能力上来后,很多场景就会迎刃而解。
刘知远解释说,大语言模型是“先通后专”,先具备通用能力,也就是关于这个世界的常识,再把它培养为相关领域的专家,这样专家水平的上限才会更高。
他预测,未来3到5年,具身智能同样要走“先通后专”的模式。
“通用”意味着能在广阔场景里广泛应用,比如Anthropic Claude擅长的编程专业能力,是基于大语言模型做的。
好比它首先是一个非常聪明的大学生,再让它变成一个很聪明的程序员。如果只是用代码训这个模型,达不到现在的效果。
就像一位学者曾说过的,你的目标是登月,但如果你以爬树的形式来尝试着离月亮更近,你是永远不可能到月亮上去的。
姚远谈道,很多模型为了展示出好的效果,会针对专门任务、专门场景去训练一个专家模型,提前可能会采集该任务的很多数据,这样做出一段demo还是相对简单的。但这不代表该领域发展的进度,目前具身智能基础模型的基础性、泛化性、通用性仍存在很大问题。
面壁智能并没有对某一个场景做特别深度的优化,希望先把基础的数据、 Infra工程链路打磨好,实现较好的泛化基础。
三、兼顾上下文记忆与响应效率,单决策步推理时延远低于π0.5
面壁智能的通用VLA具身模型MiniCPM-RobotManip融合多模态技术沉淀与视觉Token极致压缩能力,保留完整历史观测记忆的同时,计算量与不保留记忆时持平,在考验VLA模型上下文记忆的基准测试RMBench上取得显著优势。
根据测试,在包含60帧历史观测的机器人操作任务中,传统重新计算方式每个决策步需要125TFLOPS,采用流式推理后仅需3.3TFLOPS,低于π0.5在无历史帧输入下的5.0TFLOPS。在H100、BF16精度下,MiniCPM-RobotManip单决策步推理时延为120ms,相比π0.5的234ms降低近一半,实现了上下文记忆与响应效率的兼顾。
当前上下文记忆难在哪儿?姚远谈道,现在的视觉是三路甚至四路的,每秒保持一帧,要支持一分钟的原生,大概是几百帧图片、几万个Token甚至高达十万个Token的长度,要求模型有极致的视觉Token压缩,这是基于面壁智能的技术直接做的。
在这方面,面壁智能的核心技术壁垒主要源自高效多模态技术。视觉Token爆炸是多模态领域的一大瓶颈,面壁智能从2024年开始与实验室一起,做了一系列高效视觉编码的先进技术探索,除了发表的论文外,技术也演进到第四代,能够支撑模型更加高效。
相比市面上绝大多数的模型都是4倍的视觉压缩率,面壁智能在无损的情况下做到16倍的压缩率,甚至能通过视觉编码器内部的融合,实现计算量再进一步的发展。
端侧VLA注重高效,因为云侧和端侧计算门槛不同,姚远说:“我们一些原生的上下游记忆、世界模型都是值得期待的东西。”
他补充道,面壁智能首先想看模型智能密度是不是相对紧凑,因此选择1B左右的先发模型基座。数据上的Scaling Law一定是成立的,越大量的数据会带来更好的提升;参数的Scaling Law还没有达成非常好的共识,可能是受限于实时推理速度的要求。
四、端侧智能需要软硬协同,达到GPT-5.6级水平还需两三年
姚远说,端侧智能大脑是两个趋势共同叠加的效果:一是模型密度越来越高,相同的水平可以做的越来越小;另一方面就是终端计算能力越来越强。
刘知远认为,将模型密度做得更高非常有挑战性,并不是模型越大,技术含量就越高。
以芯片为例,制程最高的芯片是放在终端上的芯片,因为终端对空间、功耗要求更高,所以要求有一个电路密度更密的芯片。
云侧和端侧模型的能力区别很大:云侧模型要求高并发,MoE架构会是它的默认选择;端侧模型用MoE架构不划算,因为MoE架构需要一个大显存,而显存很贵。
端侧是一个复杂的技术生态,需要软硬协同、端云协同。端侧智能的模型应与硬件密切结合。一些智能分别发生在云上和端上。同时,端侧能起到数据采集作用。
刘知远认为要让端侧模型达到像今年Claude或GPT-5.6模型这样的水平,还需要1-2年、2-3年的时间。
受限于算力水平与模型尺寸,当前端侧模型相对比较专用,可处理的任务类型有限。但面壁智能团队相信,只要能够在这个方向上再坚持1-2年的时间,就会迎来端侧智能的大爆发。
他预测,未来智能会走向分化,每个行业都是充分竞争的,不会出现一家独大。
五、开源是“AI留在血液里的信仰,面壁智能只做模型、不碰本体
“开源这个事情,应该是人工智能流在血液里面的信仰。”刘知远说,AI行业能实现这么快的发展,有赖于开源,让全球从业者都能第一时间站在最前沿的方向上接着往前走。
未来的具身智能发展一定有赖于开源的支持,因为有那么多本体,要做各种各样的适配。
姚远补充道,面壁智能希望先通过开源提供一个基础设施,在端侧设备上实现加速,同时在云端,比如高并发的产品上,也有较好的拓展性。
其意义在于,有时可以通过云端部署非常高效,由于模型本质上是高效的,因此能通过云端多并发的很多场景来提供服务。
这也能对训练起到好的加速作用,比如强化学习,需要快速推理出结果去评判,用了面壁智能的框架之后能显著降低训练成本。
面壁智能只做模型,不碰本体,判断“两者都做”不如“只把模型做好”的胜算更大,希望通过技术的创新,嵌入到整个智能终端生态中,与上下游伙伴共建下一代智能终端。
“我们要去寻找好的合作伙伴,大家都能明确自己的边界在哪儿,比如本体厂商目标就是要做质量最好、最便宜的、最有竞争力的本体,他能把这个事情做好,就已经是一个巨大的市场了。”刘知远说。
他预测,未来具身智能发展路线会演化成不同的生态打法:一种是苹果模式,什么都自己做;一种是安卓模式,有各种硬件厂商,共选统一的操作系统。
“我觉得完全就看这个企业有没有乔布斯,有乔布斯了就可以苹果,没有乔布斯我建议就做兼容的模式。”刘知远认为,更健康的生态应该是这样的,任何一个企业的禀赋、基因、特点,决定了不可能每个东西都能做的对,只能聚焦把自己能做好的事情做到最好。
“我们还没有找到我们的乔布斯。”刘知远说,面壁智能希望未来是一个生态打法,就像“Wintel联盟”互相协同,生态需要珠联璧合、双向奔赴,与广泛本体厂商充分合作来推动快速发展。
面壁智能坚持做商业化,即便不认为当前是商业化的好阶段,也要做,要跟上下游跟生态成为朋友。刘知远相信,未来商业化不止是讲技术,还关乎信任问题,面壁智能从不承诺自己做不到的事情。
结语:端侧智能迎来规模化落地元年
北京智源人工智能研究院联合端侧实验室发布的《端侧智能2026——规模化落地元年》报告显示,2026年端侧智能正从概念验证迈向规模落地,产业化拐点已然到来。
“跑得早、跑得快都不重要,重要的是你跑得准,你的未来发展方向是对的。”刘知远谈道,关键是能够准确研判未来的发展趋势,在当前这个时代,大家都在同一个起跑线上,谁能够真正的做创新,谁才有可能在这一轮科技革命里取得先机。

