关于报告的所有内容,请于公众『市场分析报告』阅读原文
从肢体层面看,电机、减速器和灵巧手等硬件技术在2026年已经达到较高的成熟度。主流厂商的机器人能够完成行走、抓取和基础操作任务。但同一台机器人如果被要求在不熟悉的场景中自主完成一个多步骤任务,比如从杂乱的桌面上找出特定工具并递给操作员,目前的成功率仍然很低。宇树科技创始人王兴兴曾公开表示,硬件能力已足以支撑应用落地,真正制约大规模部署的是大模型的能力。
兴业证券最新发布的研报将人形机器人拆分为大脑、小脑和肢体三个功能层。肢体层承担物理动作的执行,小脑层负责运动控制与实时响应,大脑层则处理环境感知、任务规划与决策推理。从产业进程的时间轴来看,2025年肢体层技术已进入成熟期,小脑层和大脑层技术仍普遍处于导入阶段,距离成熟应用尚有明显差距。这种软件与硬件的进度错位,是人形机器人至今未能进入工厂产线和家庭服务场景的核心原因。
这个“大脑”在业内的正式名称叫做“具身大模型”。它与人们熟知的ChatGPT这类大语言模型有本质区别。传统大语言模型处理的是文本,输入一句话,输出一段文字。具身大模型则需要处理多种信息——摄像头拍到的画面、麦克风录到的语音、触觉传感器感知的力度,然后输出一串能让机器人关节动起来的指令。它强调的是与物理世界的实时交互。比如机器人看到桌上有一个苹果,听到“把苹果拿给我”的指令,它需要理解“苹果”对应画面中的哪个物体,“拿”意味着什么动作,“给我”又指向哪个方向。这个过程要求模型同时具备视觉识别、语言理解和动作生成三种能力,并且要在极短的时间内完成。
一、两种架构思路
目前业内对于如何构建这个“大脑”并没有统一的方案。主流的技术路线分为两种,分层式架构和端到端式架构,两者的设计哲学差异很大。
分层式架构的思路相对直观。它把机器人的决策过程拆成上下两层。上层是一个参数量较大、运行速度较慢的视觉语言模型,负责看懂场景、听懂指令、制定计划。下层是一个参数量较小、运行速度极快的动作模型,负责把上层下达的计划拆解成每一个关节的具体角度和力度。打个比方,上层像是总指挥,说出“走到桌子前,拿起左边的杯子”;下层像是一线操作员,精确控制每一步迈多大、手抬多高、手指用多大力。
这种架构的优势在于落地速度快。因为现成的视觉语言模型已经在大规模互联网数据上训练过,具备较强的常识和推理能力,机器人厂商不需要从头训练一个全能模型,只需要解决好上下层之间的对接问题。Figure AI在2025年2月发布的Helix模型就是分层架构的代表。Helix采用了一套“系统1加系统2”的双系统设计。系统2是一个70亿参数的视觉语言模型,以7到9赫兹的频率运行,负责场景理解和任务规划。系统1是一个8000万参数的视觉运动变换器,以200赫兹的高频率运行,负责将系统2的语义意图实时转化为35个自由度的全身动作。两者通过潜空间向量进行异步通信,协同完成复杂操作。
分层架构的缺点同样明显。上层模型在做规划时并不完全理解底层执行的物理约束,可能下达一个机器人根本做不到的指令。而且信息在上下层之间传递时会出现误差累积,前一环节的微小偏差在后续环节会被放大。此外,面对训练时没见过的多样化任务,分层系统的泛化表现往往不够理想。
端到端架构则走了另一条路。它不再区分“大脑”和“小脑”,而是用一个统一的神经网络,直接将摄像头画面和语言指令映射为电机的动作指令。整个过程没有中间拆解环节,输入感知信息,输出动作序列。这种架构的集成度更高,理论上能更好地处理复杂物理世界的不确定性,动作也更连贯自然。
视觉语言动作模型(VLA模型)是端到端决策的核心载体。它将感知、语言理解、规划、动作执行和反馈优化全部融合在一个框架里,利用大模型在海量数据中习得的先验知识,在动态环境中实现更灵活的任务执行。谷歌DeepMind在2023年7月发布的RT-2模型是这一方向的标杆。RT-2的创新在于它把动作视为一种特殊的“语言”。传统做法是先让视觉语言模型理解场景,再通过一个单独的解码器输出动作指令。RT-2则直接把语言符号、图像区块和动作指令放进同一个输出空间里训练。这意味着模型在预训练阶段学到的一切——物体名称、空间关系、因果关系——都能直接服务于动作生成,而不需要二次翻译。实验数据显示,在训练时从未见过的新任务上,RT-2的成功率比此前的RT-1模型提高了大约两倍。
特斯拉的Optimus机器人同样沿用端到端路线。它与特斯拉汽车FSD系统共享技术栈,两者本质上都是多模态输入(视觉、触觉、语音)加实时动作输出(转向、步态、手臂运动),区别只在于执行载体是车轮还是关节。特斯拉目前的FSD系统已经接入视觉语言动作框架,通过多层认知的统一,如视觉捕捉事实、语言推理因果、动作生成结果,让车辆具备了“解释”和“思考”的能力。这套能力正在被迁移到Optimus上。
但端到端架构远非完美。它要求海量的高质量训练数据,因为模型必须从零开始学习从感知到动作的全部映射关系,没有分层架构中上层模型带来的“常识捷径”。VLA模型还面临对输入扰动敏感、3D空间关系理解不足、动作生成精度有限等挑战。更大的问题是实时性。机器人控制需要毫秒级的响应速度,而大参数量VLA模型的推理延迟天然偏高。RT-2就因为参数量过大,无法实现真正的实时推理。
二、国内模型的追赶路径
国内企业在具身大模型领域的跟进速度很快,多家公司已在架构设计上做出差异化尝试。
星动纪元于2024年12月发布的ERA-42模型,是国内首个真正意义上的端到端原生机器人大模型。它与Physical Intelligence的0模型方向一致,采用大规模视频数据作为预训练素材,涵盖无标注视频、公开机器人数据、人类活动数据以及遥操作数据。ERA-42的特别之处在于已将世界模型融入架构中。所谓世界模型,是指让模型不仅知道当前应该做什么动作,还能预测做完这个动作后环境会发生什么变化。这种预测能力让机器人在执行任务时更具前瞻性,比如抓取一个叠放在上层的物体时,能预判下层物体会不会倾倒。星动纪元还初步验证了规模效应的存在。研究数据显示,随着模型层数和隐藏层维度的增加,任务成功率明显提升,这和大语言模型训练中观察到的规律类似。
银河通用在2025年1月推出的GraspVLA模型则走出了一条以合成数据为主的技术路线。GraspVLA是全球首个由合成大数据驱动的基础抓取大模型。它先用十亿帧仿真环境生成的合成数据对模型进行预训练,让模型掌握光照变化、背景干扰、物体类别差异等七种泛化能力,然后再用少量真实数据针对特定任务做微调。这种方法大幅降低了对昂贵真机数据的依赖。在抓取接线座、三角板等工业零件这类特定需求上,仅需少量真实演示就能完成能力迁移。
智元机器人与上海人工智能实验室在2025年3月联合推出的GO-1模型,开创性地提出了ViLLA架构。ViLLA在传统VLA的基础上增加了一个“隐式规划器”模块。整个架构由三部分组成。视觉语言模型提供场景感知和语言理解。隐式规划器利用大量跨本体和人类操作视频数据,学习通用的动作逻辑。动作专家则借助百万级真机数据习得精细的执行能力。三者协同的好处在于,模型既能利用互联网图文数据中的通用知识,又能吸收人类视频中的操作经验,还能保证末端动作的精度。测试结果显示,GO-1在处理复杂任务时的成功率比此前最优模型提高了32%。
字节跳动Seed团队在2025年7月发布的GR-3模型,则展示了规模化的另一种可能。GR-3采用40亿参数的混合变换器架构,同时在机器人轨迹数据上使用流匹配目标、在视觉语言数据上使用下一个标记预测目标进行联合训练。它可以融合三种来源的数据——视觉语言数据、机器人轨迹数据和人类轨迹数据——在精细操作任务中的成功率提升了高达250%。
灵初智能的Psi R1模型同样采用分层端到端的快慢脑架构,与Figure AI和英伟达的技术路线一致。其S1快脑负责运动控制和快速响应,S2慢脑负责推理和深度规划。在数据策略上,Psi R1构建了“仿真-真机-互联网”一体的采集范式,先用遥操作和互联网数据做冷启动的模仿学习训练,再用强化学习训练灵巧操作技能,最后通过对场景要素的随机化处理提升模型泛化能力。这种反复迭代的方式显著提高了数据利用效率。
三、数据从哪里来,很重要
无论分层架构还是端到端架构,决定模型表现的根本因素是训练数据的质量和规模。具身大模型与语言模型不同,它无法直接从互联网海量图文中习得动作能力。互联网上有近乎无限的文字和图片,但没有现成的“机器人关节角度序列”可供下载。模型需要的是包含精确动作标签和多模态环境反馈的交互数据,采集这类数据需要昂贵的硬件系统、大量人力和漫长的周期。
兴业证券将具身智能训练数据划分为金字塔结构。顶层是真机数据,由真实机器人在真实环境中执行任务时采集而来,价值最高但数量最稀缺。中间层是仿真合成数据,在虚拟环境中生成,可以大规模自动化生产,但存在从模拟到现实的迁移误差。底层是互联网视频数据,数量庞大但缺乏动作标签,需要经过复杂处理才能使用。
真机数据的采集方式目前主要有四种。VR遥操作方案让操作员佩戴VR眼镜和感应设备,手部动作实时映射到机器人上。这种方案采集精度高,但设备昂贵、人员培训周期长。主从臂遥操作通过人工操作从臂带动主臂运动,精度较高但体积庞大,难以适应复杂操作场景。数据手套方案直接采集人手的关节角度映射到灵巧手,实时性好但校准复杂且仅能捕捉手部。通用操作接口方案让人类手持夹爪在真实环境中执行任务并记录轨迹,硬件门槛低但精度受限。
特斯拉的数据采集方案经历了明显迭代。2023年5月首次披露的采集系统是动捕手套加动捕服,操作员背负沉重背包,头盔上装有五个摄像头。2024年5月,设备轻量化为VR眼镜,采集效率明显提升。到2025年5月,特斯拉的数据策略再次转向,开始大幅提高视频数据的比例而降低真机数据的依赖。Optimus通过学习第一视角视频掌握了炒菜、倒垃圾、拉窗帘等新技能,未来的目标是仅靠第三视角视频就能学会新任务。这种转变的意义在于,如果视频学习路径跑通,数据采集成本将呈数量级下降。
银河通用则走了一条以合成数据为主的路径。它通过计算机图形学手段将真实世界的物理规律搬进仿真环境,构建了一个大规模的物体资产库。机器人在虚拟空间里可以与各种物体交互,抓取、放置、开门、使用遥控器,这些动作数据通过强化学习让机器人自主摸索生成,再经过仿真器验证和渲染器转化成视觉数据,最终直接部署到真实世界。这种方法绕开了真机数据采集的成本瓶颈,但对仿真环境与真实物理的吻合度提出了极高要求。
数据飞轮的概念在兴业证券的报告中也被重点提及。理想情况下,部署在真实场景中的机器人会源源不断地收集新的交互数据,这些数据反哺模型训练,模型升级后又让机器人适应更多场景,从而收集到更丰富的数据。这个正向循环一旦建立,机器人的进化速度将大幅加快。但当前现实是,模型能力不足限制了机器人大规模部署,而部署规模不够又导致数据收集缓慢。打破这个僵局的关键,可能在于仿真数据质量的提升和视频学习技术的成熟。
四、感知与采集
具身大模型的决策链条始于感知。机器人必须通过传感器获取外部环境和自身状态的信息,模型才能做出判断。从这个逻辑出发,传感器是具身智能不可或缺的基础设施。
兴业证券认为,力传感器和触觉传感器是当前人形机器人感知体系中的关键缺口。六维力传感器能让机器人感知施加在手腕或脚踝上的力矩大小和方向,这对于精细装配和稳定行走至关重要。柔性触觉传感器则模仿人类皮肤的感知能力,让灵巧手知道是否已经接触到物体以及用了多大的力。3D视觉传感器提供深度信息,帮助机器人判断物体的空间位置和形状。这一部分可以关注安培龙、汉威科技、福莱新材和奥比中光。
另一条线索来自数据采集环节。高质量运动数据的获取需要专业的动捕解决方案。凌云光旗下的元客视界推出了名为Fzmotion的AI动捕产品,已服务于宇树科技、优必选等客户的机器人研发与训练。动捕技术通过对人体运动轨迹的精确捕捉,生成可供机器人模仿的动作序列,是当前高质量运动数据的关键来源。
从更宏观的视角看,具身大模型的发展阶段可以参照自动驾驶的演进轨迹。第一阶段,模型主要作为数据生成器,扩充训练集的多样性。第二阶段,升级为仿真2.0模拟器,替代传统仿真环境用于强化学习训练。第三阶段,进化为世界动作模型,同时具备预测未来和生成动作的能力,部署在机器人端侧。当前行业整体仍处于第一到第二阶段的过渡期。
2026年的具身大模型距离让机器人像人类一样自如应对开放世界的目标还有很长距离。泛化能力不足、长时程任务中的误差累积、高质量数据的稀缺以及实时响应速度的瓶颈,都是必须跨越的障碍。但架构路径的多元探索、训练数据采集方式的快速迭代以及国内企业的积极跟进,正在共同推动“大脑”能力以可见的速度提升。人形机器人从专用设备走向通用设备的拐点,大概率将取决于具身大模型何时完成从量变到质变的跨越。
五、重点公司
1. 传感器:安培龙、汉威科技、福莱新材、奥比中光。
2. 动捕解决方案:凌云光。
以上,仅供参考。




















本文作者可以追加内容哦 !