文章ID:2528

云图

1.5B开源通用VLA模型,冲进具身智能第一梯队_我的网站

看不见的客人

一 |     金磊 发自 上海          量子位 | 公众号 QbitAI          一个新的国产VLA模型诞生了,而且只有1.5B。    7月20日,在WAIC 2026世界人工智能大会上,华为首次完整展示全系列计算模组产品,包括网卡、SSD、DPU、RAID卡四大系列产品,如国内首发的800GE AI网卡,支持10万级节点超大规模组网,以及KVU方案等。         显然,华为在AI时代试图构建底层能力。

二 | 其实在具身智能赛道,华为的打法同样如此,近期,华为云CloudRobo全流程具身智能开发平台正式开启公测,这也预示着具身智能产业的分工格局更加显化。而华为再一次站在热门赛道的边界上,它其实不直接下场造机器人本体,不做终端品牌,把目标对准所有机器人的智能核心,试图整个行业的开发底座。                   熟悉华为的人可能已经意识到,此类策略打法与多年前华为切入智能汽车的路径如出一辙:不亲自下场造车,却靠技术赋能捧红问界,推动赛力斯完成逆袭。         Size这么小,能好用吗?          来,话不多说,我们直接看效果:          视频地址:     https://mp.weixin.qq.com/s/TWDuh4NmsamJ52E2A6ZpTw          在上面这个真机演示里,两只机械臂围着桌面开始做三明治。         其实不只是华为,纵观整个行业,今年以来,华为、腾讯、百度、阿里相继发布了各自的具身智能平台产品,而且无一例外都选择了“不做本体、做大脑”的路线,不亲自下场造机器人,而是为机器人厂商提供智能系统、开发工具和云服务底座。

三 |          只是在硬件形态更分散、场景更碎片化的机器人赛道,科技巨头们还能复制此前在其他赛道的神话吗?也许很难了。它们分工合作,先取面包,再夹起生菜、火腿和鸡蛋,一层层叠到一起。         再来看下另一段演示:          视频地址:     https://mp.weixin.qq.com/s/TWDuh4NmsamJ52E2A6ZpTw          一只宇树机器狗收到“跟随前面的人”这条指令后,开始一路跟在目标身后。

四 |          从室外走进办公楼,再进入电梯、地下停车场,机器狗始终没有跟丢。就算周围不断有人经过,环境和光线也在变化,它还是能认准一开始指定的那个人。         01.          云厂商下场抢做机器人大脑供应商          绕过身体,直奔大脑,是近年来某些科技公司押注具身智能的玩法。         更关键的是,这套能力直接跑在机器狗本地!          电梯和地下停车场往往是网络信号比较差的地方。

五 | 即使进入弱网甚至无网环境,机器狗依然能继续识别目标、规划动作,保持跟随。         而在这两段Demo背后,则是面壁智能在WAIC期间正式发布并开源的MiniCPM-Robot系列模型。

六 |          其中,华为在具身智能赛道的角色定位其实也很明确,它目前没有推出自造自产的机器人领域的终端品牌,它更像是打算做机器人大脑的核心供应商,用云端平台把全行业的开发效率抬升到新的层级。         目前包含两个模型:          MiniCPM-RobotManip:也就是开头控制机械臂做三明治的通用VLA模型,参数量只有1.5B。         再例如腾讯,腾讯Robotics X实验室首次以完整技术矩阵参展,发布了Tairos具身智能开放平台,开源了混元具身大模型HY-Embodied系列,还展示了机器人本体互连技术RoboFusion。         MiniCPM-RobotTrack:主要负责机器人的跟踪与导航,让机器人能够根据自然语言指令,在动态环境里持续跟住指定目标。

七 |          大厂们鲜有直接做硬件产品,这是为什么?          站在行业视角,过去几年人形机器人、工业机械臂、四足机器人等产品密集亮相,可多数团队的开发模式仍停留在手工作坊阶段。         不少具身智能企业都要从零搭建数据体系、训练专属模型、反复调试仿真、适配不同硬件本体,大量重复劳动消耗了核心研发资源,真正能投入到场景创新的精力被严重挤压。行业走到从样机演示向规模化落地跨越的关键节点,本质上依然卡在底层开发效率的瓶颈上。

八 |                    此前人形机器人普遍定位几十万元级。价格下探的核心推手,是供应链成熟与规模化生产落地,关节模组、电机、减速器等核心硬件成本持续走低,可一旦硬件“身体”不再是行业稀缺资源,智能“大脑”的价值便愈发凸显。以仙工智能的招股书为例,其控制器业务毛利率高达79.8%,软件业务更是达到89.3%,而机器人整机的毛利率只有38.4%,配件业务仅15.7%。所以这也是一些资本追捧大脑公司的核心原因,涉及控制的大脑业务是个香饽饽。              和它们一起出现的,还有开源具身智能推理框架PhyAI,负责让这些模型更快地适配硬件、跑到真实机器人上。         按照这个逻辑来理解,华为云推出的CloudRobo,理论上也在瞄准这个方向,根据华为云官方在INSPIRE创想者大会上发布的信息,这是全球首个覆盖数据生产、模型开发、仿真评测、本体接入、部署运维全链路的具身智能开发平台,核心目标就是把具身智能开发从手工作坊带进工业化时代。         简单来说,一个负责让机器人“动手干活”,一个负责让机器人“认准人、跟着走”,再配上一套负责高效推理的底座。

九 |          面壁这次端出来的,已经是一套逐渐成形的具身智能组合。

十 |                    优艾智合、华沿机器人等20多家企业已经宣布首批入驻CloudRobo平台,华为还同步启动了“百模千态,云聚共赢”的生态合作计划。         具身智能发展到今天,的确需要通用开发底座来降低行业门槛,让更多团队不用在底层技术上反复消耗,华为云试图成为机器人开发者的公共工具集,体现的是其一以贯之的战略逻辑。         02.          华为当年不造汽车,现在也没直接造机器人          坚持不碰硬件本体,不是华为对机器人赛道缺乏野心,恰恰是它把汽车赛道验证过的成功逻辑,平移到了全新的产业领域。         跻身第一梯队,延迟接近一半          先来看MiniCPM-RobotManip。         具身智能赛道看似火热,实际落地的障碍远比外界感知的更多。

十一 | 通常情况下,产业链内外都认为数据稀缺是第一道关卡,真实物理世界的交互数据采集成本高、周期长,多数团队都在小体量数据中反复训练,直接导致模型泛化能力不足,更换场景就容易失灵。         虽然参数量只有1.5B,但在LIBERO、Calvin、RoboTwin2等主流VLA评测里,它的整体表现已经进入第一梯队,与π0.5等模型处在相近水平。         真正把差距拉开的,是对机器人记忆力的考验。         很多VLA模型在执行动作时,主要根据当前这一帧画面做判断。         仿真与现实的偏差是另外的难题。         比如让机器人点击画面里的第二个按钮5次。虚拟环境中运行顺畅的策略,放到真实环境里往往频繁出错,真机调试又要消耗大量时间与硬件成本。         如果它看不到前面的画面,也记不住自己已经按过几次,就很容易按一下便停,或者一直按下去。         MiniCPM-RobotManip会把历史观测和此前执行过的动作一起纳入判断。

十二 | 再加上本体形态千差万别、接入标准不统一、端侧算力跟不上模型需求,这些问题叠加在一起,让全栈自研的投入产出比变得极低。         面对上述几个行业症结,CloudRobo平台底层依托昇腾AI芯片与盘古具身大模型,搭建起PB级数据底座、云原生模型生产引擎、全国产Real-Sim仿真评测体系三大核心能力,开发者接入后无需从零搭建基础系统,可以直接调用百万级开箱即用的数据资产与二十余个昇腾亲和模型,把精力集中在场景应用与功能创新上。其效率目标是机器人小时级上云、模型分钟级部署。                   所以结论非常明显,CloudRobo平台可以借助自身价值为别人赋能。它知道任务已经进行到哪一步,也知道什么时候应该停下来。

十三 |          在专门考察上下文记忆的RMBench中,π0.5的成绩约为10分,接近随机水平,MiniCPM-RobotManip则达到约53分。

十四 |          这项能力对真实机器人很重要。这种定位的价值不难理解。         叠衣服、收拾桌面、做三明治,看起来都是日常小事,拆开后却包含一连串动作。移动互联网时代,开发者不需要自主研发操作系统与芯片,基于成熟的系统生态就能快速开发应用。         对华为而言,下场制造本体不仅要直面这些行业共性难题,还会偏离自己深耕数十年的主赛道。机器人只看眼前,很容易做到一半便“失忆”;能记住此前的状态,才有机会把长任务完整做完。

十五 | 华为的核心优势始终集中在ICT领域,从芯片算力到大模型,从云服务到操作系统,这些能力才是它的立身之本。

十六 |          除了记得住,机器人还得反应快。         就像当年在汽车行业,华为没有自建工厂造车,而是把智能座舱、高阶智驾、电驱系统这些能力打包输出给车企,靠技术赋能拿到产业话语权。

十七 |          面壁给出的单帧推理对比中,在H100显卡、bf16精度下,MiniCPM-RobotManip单次决策延迟约为120毫秒,π0.5约为234毫秒,前者接近后者的一半。         这里的“成本减半”,主要是体现在推理延迟和计算量上。         类似模式的商业价值已经被充分验证。         聊天模型多想一秒,用户通常还能等。此前华为与赛力斯联手打造的问界系列,持续站稳高端新能源市场的头部位置,问界M9累计销量仍在50万级豪车市场榜首。赛力斯负责制造与品控,华为负责智能化定义与技术输出,双方各守能力边界,完成了单靠任何一方都难以实现的市场突破。

十八 | 机械臂每做一步都停顿一秒,动作马上就会变得僵硬,整个任务的完成时间也会被拉长。         对VLA来说,能不能在有限算力下快速输出下一步动作,和榜单分数一样重要。         MiniCPM-RobotTrack也走了类似的小尺寸模型路线。         它以MiniCPM4-0.5B为基础,整体参数规模为0.9B,主要测试三种真实场景。放到机器人赛道,这套分工逻辑也许同样成立。         不过,机器人赛道终究和汽车不同,汽车可以靠一套方案打出统一品牌,机器人的生态版图,注定更分散,也更难用单一模式收拢。

十九 | 但即便如此,我们依然观察到,华为的具身智能朋友圈仍要扩大。         03.          华为的具身智能圈正在扩大          华为具身智能朋友圈最显然的可能是人。

|          第一种是单目标跟踪。         根据外界一些媒体的不完全统计,目前已经有至少15位华为前高管离职加入或创办具身智能创企,这些企业中最高估值400亿至500亿港元(折合人民币约347亿至433亿元)、单笔融资最高达4.55亿美元(约合人民币约31亿元)。给它一句明确指令,机器狗持续跟着指定的人。         第二种是多人干扰。         这批人带着华为的工程化能力、大模型技术积累和量产落地经验,成为具身智能创业的主力军。

| 他们的技术路径、研发思路甚至供应链资源,都带着鲜明的华为印记,相当于把华为的技术基因,扩散到了整个赛道之中。         落地到技术布局来看,这批华为系创业团队几乎覆盖了具身智能全产业链,业务横跨机器人本体、运动小脑、决策大脑,同时布局机器人操作系统、专用大模型与数据采集系统。其中,智元机器人的量产机器人已突破15000台,再比如,它石智航、智澄AI等企业搭建起完整软硬件产品矩阵;还有的目前已对外推出实体产品。         这就很有意思了,华为试图越来越像国内具身智能领域的人才黄埔军校,其华为昇腾、车BU、诺亚方舟实验室以及华为云具身智能团队中的核心人才,在批量外溢到机器人赛道,形成一波具身智能圈的创业潮。周围几个人同时移动、交叉甚至交换位置,模型依然要认准最初的目标。

|          可即便如此,对于华为自身而言,也很难在机器人赛道复制鸿蒙智行那样的品牌体系。汽车是标准化程度极高的产品,乘用车的形态和使用场景高度统一,华为可以用一套智能方案,联合不同车企打出统一的鸿蒙智行品牌。

|          机器人却完全不同,工业机械臂、家用服务机器人、商用配送机器人、人形机器人,形态天差地别,场景需求各有侧重,没有任何一套方案能覆盖所有品类。华为能做的是底层技术助力,给不同厂商提供工具和底座,却很难像主导汽车品牌那样,去定义每一款机器人的产品形态。

|          不构建统一品牌不意味没有合作机会,有意思的是,华为鸿蒙偏偏却已经深入行业场景中来了,早在2025年4月,华为已经发布M-Robots OS 1.0版本,所谓M-Robots OS是以开源鸿蒙为核心底座的分布式异构多机协同机器人统一操作系统,这也是全国首个基于开源鸿蒙打造的机器人操作系统。

|                    今年华为更新了M-Robots OS 2.0开源新版本,完成双足人形机器人、四足仿生机器人、机械臂等20余种机器人形态适配,还与创想未来、德壹医疗等多家企业实现了相应产品落地。

|          第三种更难,指令本身可能比较模糊。         通过这些玩法,一方面证明了鸿蒙系统能给机器人带来生态联动的差异化优势,另外也给更多机器人厂商提供了参考,接入鸿蒙生态,就能直接复用十几亿设备的生态资源,不用从零搭建自身的智能体系。比如只说“跟着穿黑衣服的人”,现场又恰好有多个穿着相近的人,模型需要结合画面理解人类到底指的是谁。         在没有进行下游强化学习优化的情况下,MiniCPM-RobotTrack在三类任务上的追踪率分别达到89.8%、73.4%和80.4%,均取得开源方案中的最优结果。         相比OpenTrackVLA,三项追踪率分别提高7.0、14.6和6.5个百分点。

|          回过头来看,从此前智能汽车到机器人,对于整个产业来说,有华为这样的玩家下场铺设底座,也许不是一件坏事。

|          在相同的单视角、纯SFT设定下,与闭源模型TrackVLA++相比,它在单目标跟踪和模糊目标跟踪上的追踪率分别高出8.8和17.0个百分点,模糊目标跟踪的成功率达到58.0%。         参数小,表现却没有明显掉队。         机器人模型的竞争,也开始从单纯拼规模,转向拼单位算力到底能换来多少能力。         把机器人看到的世界压缩一下          MiniCPM-RobotManip能把尺寸压到1.5B,背后离不开面壁过去在多模态模型上的积累。

|          它基于MiniCPM-V 4.6训练而来(开源不到2个月,下载量已突破200万)。         面壁的MiniCPM-V/O系列已经持续迭代两年多,开源总下载量超过2500万。

| 过去积累的图像理解、视频理解和多模态信息处理能力,如今被进一步搬到了机器人身上。         机器人执行一次动作,需要处理的信息其实很多。         一台双臂机器人通常会同时接收三个摄像头的画面,包括两个腕部相机和一个主视角相机,再加上一段文字指令,最后输出一个可以执行的动作。         而且,这个过程一秒要重复好几次。         如果每一张图片都被转换成大量视觉Token,机器人运行得越久,需要处理的历史信息就越多,计算量很快就会堆起来。         MiniCPM-RobotManip采用的办法,是尽量压缩视觉Token。         桌面纹理、墙面图案等和当前任务关系不大的信息,不必占用太多Token。模型用更短的数据表示保留关键内容,单次推理需要处理的信息量也随之下降。         信息少了,推理自然更快。

| 对应到机械臂上,就是等待时间更短,动作衔接更顺。         视觉Token压缩还有一个更大的用处,可以帮助机器人以更低成本保留历史记忆。         常规方法每获得一张新画面,都要把此前的历史重新计算一遍。

| 任务越长,计算量增长得越快。         MiniCPM-RobotManip采用流式计算,前面已经处理过的信息可以继续复用,新画面进来后,只需要接着往下计算。         这就有点像看连续剧的感觉了。         普通做法每更新一集,都要从第一集重新看起;流式计算则会记住之前的剧情,直接从最新一集接着看。         机器人因此可以带着更长的历史继续执行任务,同时避免计算量一路暴涨。         1.5B的尺寸,也和机器人的实际运行需求有关。         面壁在将约200毫秒视为机器人操作体验的一道临界线。再慢下去,机械臂和机器狗的卡顿感就会明显增加。         当前多数VLA基础模型都控制在4B以内。模型继续做大能带来多少真实操作收益,行业仍在验证。

|           作者声明:该图片由AI生成          到了MiniCPM-RobotTrack这里,轻量化的思路又换了一种实现方式。         它把视觉画面、自然语言指令和机器人的控制决策放进同一个模型里统一处理。         用户说一句“跟着前面穿黑衣服的人”,模型会直接结合摄像头画面理解指令,再把判断转换成机器狗的运动控制。         整个过程不需要额外安装一套目标检测模块、一套识别模块,再接一套跟踪系统。也不用外接开发板,只靠宇树Go2 Edu原装摄像头和本地算力,就能完成单目标跟踪、多人干扰跟踪和模糊目标跟踪。         不过,真实世界总会出现训练集里很少见的情况。         目标可能突然从镜头前横穿过去,也可能快速转弯,被其他人短暂挡住。

| 几个人同时交叉走动时,机器狗还要避免跟错人。         这类场景数量少,却最容易让模型翻车。所以,面壁为此搭建了一套自进化数据管线。         团队先对原始数据进行检查和清洗,把异常轨迹、错误动作和无效交互剔除掉。随后让模型进入仿真和真实机器人环境,在持续运行中主动暴露自己的薄弱环节。

|          系统再把这些容易出错的场景集中收集起来,通过专家策略进行纠偏,放回下一轮训练。         说得通俗一点,这就像给机器狗准备了一本会自动更新的错题本。         经过一轮轮闭环训练,目标横穿、快速转向、短时遮挡、多人交叉这些长尾问题,也能不断得到加强。         模型训好了,装到真机上仍然有一道关。         摄像头采集、画面编码、模型推理、动作生成、指令传输,任何一个环节慢下来,最终都会反映在机器狗的动作上。

|          面壁围绕宇树Go2的完整运行链路做了系统级优化。

| 目前MiniCPM-RobotTrack在机器狗原生本地算力上可以稳定达到5Hz以上,端到端响应延迟约180毫秒。         这次开源的内容也不只有模型权重,还包括环境安装、模型加载、摄像头接入、文本指令输入、控制接口和一键启动脚本。         准备一台Go2 Edu,就能按照开源流程把模型部署起来。         本地部署的好处,在电梯和停车场的演示里体现得很直接。         机器人不用等待画面上传云端,也不用等远程服务器返回结果。摄像头数据和用户指令留在本地,网络信号变差后,完整功能依然可以继续运行。         直接拔掉网卡,机器狗照样能根据摄像头画面和文字指令,完成目标识别、持续跟踪和运动控制。         除了MiniCPM-Robot系列之外,这次还有一项容易被忽略的发布——PhyAI。

|          它是一款面向Physical AI的开源推理框架,由明体科技联合北京邮电大学、北京大学研发。         具身模型想从实验室跑到真实机器人上,中间还要经过硬件适配、量化、算子优化和部署。         不同VLA、世界模型的结构差异很大。每发布一个新模型,再从头适配一次,时间和工程成本都不低。         PhyAI想做的,就是把这段路缩短。         在RTX 5090上运行π0、π0.5和GR00T时,PhyAI相较模型官方仓库分别实现约2.85倍、1.82倍和2.28倍加速。         适配MiniCPMRobot系列模型时,PhyAI先通过CUDA Graph把推理帧率从10.12Hz提高到33.28Hz,再加入为模型定制的融合算子,在NVIDIA H20上进一步提高到36.77Hz。         前面是模型效果,这里解决的是工程效率。         模型能干活,还得尽快跑上硬件,跑得足够快,才能真正进入更多机器人。

|          机器人需要又好又便宜的大脑          具身智能行业从来不缺精彩Demo。真正难的是离开展台之后,机器人还能不能稳定工作。         清华大学人工智能学院助理教授、面壁智能多模态首席科学家姚远在访谈中也提到:          现阶段不少机器人Demo会围绕单一任务采集大量数据,再进行针对性优化,展示效果并不能完全代表基础模型的真实进度。

| 面壁更看重模型的基础性、泛化性和通用性,希望先把数据、Infra和工程链路打磨好,让基础能力提升后自然覆盖更多场景。沿着大语言模型的发展经验,具身智能最终也要走向“先通后专”,先理解物理世界的基本常识,再成为做饭、叠衣服或仓储作业等具体领域的专家。         展馆、园区和工厂里,网络信号不会一直满格。机器人还要面对隐私、数据合规、任务失败和异常恢复等一连串现实问题。         榜单分数再高,走到地下停车场便停摆,落地空间依然有限。

|          这也是面壁把端侧能力放在重要位置的原因。         在与乐聚机器人的合作中,面壁把端侧多模态大模型、夸父机器人本体和导航系统组合到了一起,推出展厅导览Agent和园区巡检Agent。         展厅导览机器人在无网环境下,也能基于本地知识库完成离线讲解和自由问答。它可以理解展厅环境和人的指令,规划导览路线,同时完成避障。         园区巡检机器人则可以识别车辆违停、路面异常和公共设施问题。敏感画面直接在本地处理,数据留在客户侧。         与吉利汽车的合作,则进一步走进了生产仓储场景。         面壁和吉利共同训练VLA模型,再通过RoboHarness把VLM、VLA、机器人本体和导航系统接到一起,让机器人执行仓储中的长程任务。         RoboHarness可以理解成物理世界里的Agent执行框架。         上层VLM负责规划任务,VLA和导航系统作为可以调用的工具。框架还会管理长任务的上下文和记忆,遇到失败时进行重试和恢复。

|          机器人每完成一次任务,运行数据还会进入可治理的数据闭环,继续帮助模型进化。

|           作者声明:该图片由AI生成          到这里,面壁此次在WAIC带来的具身智能路线已经比较清楚了。         MiniCPM-RobotManip负责操作,让机械臂理解任务、记住过程,再把事情做完。

|          MiniCPM-RobotTrack负责跟踪导航,让机器狗在复杂环境里认准目标,断网也能继续走。         PhyAI负责把模型更快地部署到真实硬件上。              再往外,乐聚和吉利的合作开始把模型、本体、导航和具体业务流程接起来。         大语言模型时代,人们习惯用参数量判断能力。

| 但机器人真正走进物理世界后,参数只是其中一个数字。         它还得反应够快、记得住、断网能跑,数据留得下来,遇到意外能够恢复,成本也要控制在企业愿意长期使用的范围内。

|          从这个角度看,1.5B和0.9B的意义,也就不止是“小”。它们更像是在回答一个很现实的问题:          当AI真正长出手脚,除了聪明,还得跑得动、用得起,最后把活干完。         GitHub链接:          https://github.com/OpenBMB/MiniCPM-Robot          HuggingFace链接:          https://huggingface.co/openbmb/MiniCPM-RobotManip          https://huggingface.co/openbmb/MiniCPM-RobotTrack。

Current article:http://www.bianhajieleigoukusunmen.pics/bj6zw53/915du2.xlsx

Published on:18:15:44


用户评论
用户名:
E-mail:
评价等级:               
评价内容: