1.基本信息:
人形机器人通常由“大脑”“小脑”和“肢体”三大部分构成,分别承担认知决策、运动控制与物理执行功能,共同实现机器人在复杂环境中的自主作业与人机交互;
“大脑”:认知与决策的中心
人形机器人的“大脑”主要负责高层级的认知功能,如环境感知、任务理解、规划决策和交互沟通,其核心技术依托于人工智能大模型,特别是多模态大模型(VLA,视觉-语言-动作模型),这为机器人注入了“灵魂”;
核心功能:“大脑”让机器人知道“为什么要做”以及“做什么”,例如,当接收到“我渴了”的指令时,“大脑”会理解意图,并规划出“寻找水、打开冰箱、取水、递送”等一系列步骤;
技术实现:它整合来自摄像头、激光雷达、触觉传感器等多源信息,进行感知和理解,为了实现高效决策,对底层AI芯片提出了高算力与高内存带宽的双重要求,三维堆叠等先进封装技术被用来提升性能;
进化方向:未来的“大脑”将向多模态信息深度融合与群体协同进化。例如,家庭服务机器人在执行“清理洒漏咖啡”任务时,能同时解析语音指令、识别液体范围并通过触觉感知地面材质来调整动作;
具身智能大模型为机器人“大脑”的核心,具身智能需要本体、智能体、数据、学习和进化架构四大核心要素,通用机器人本体又可以分为“大脑”、“小脑”和“肢体”三部分,其中,人形机器人“大脑”的核心为人工智能大模型技术;,
通过多模态模型建模、强化学习、地图创建和数据训练,能够管理和协调机器人的各种功能。大模型目前较为擅长需求理解、任务分解等高层级控制任务,规划级以下的控制规划属于传统机器人控制规划的范畴,更适合传统机器人更成熟的高频控制方法。多模态大模型为机器人高层级控制带来技术突破。多模态大模型具有理解图像、场景文本、图表、文档以及多语言、多模态理解的强大能力, 可以直接用于具身智能对环境的理解, 并通过提示词使之输出结构化内容如控制代码、任务分解等指令语言、图片、视频等。
云计算与边缘计算作为“大脑”的外延,保障机器人“大脑”高效运转。云计算是为机器人等终端设备提供算力的核心方式,云计算能够为 AI、大模型与机器人的结合提供强大的计算能力和数据存储空间,以及能够随时随地获得所需资源和算法支持的灵活性、可拓展性;此外,边缘计算为云计算的数据传输成本、时延、安全性等方面的局限性提供了补充,为具身智能人形机器人落地保驾护航。“云计算”是分布式计算的一种,指的是通过网络“云”将巨大的数据计算处理程序分解成无数个小程序,然后,通过多部服务器组成的系统进行处理和分析这些小程序得到结果并返回给用户。它通过网络以按需、易扩展的方式获得所需资源。云计算根据服务类型划分主要可以分为三层:(1)Laas,基础设施即服务:为企业提供 IT 基础设施,如服务器、存储设备等(2)PaaS,平台即服务:提供计算、网络、开发工具等资源,用于工具和应用程序的创建(3)SaaS,软件即服务:指通过互联网按需提供软件应用程序;
谷歌SayCan:定位 High-Level,Do As I Can, Not As I Say
2022 年 4 月发布,SayCan 模型的核心出发点是为机器人提供既有用又可行的行动指引。PaLM-E 虽然可以将任务拆分为符合语义逻辑的子任务,但是无法判断其所设定的子任务是否能在现实世界中执行。究其原因在于,大语言模型缺少对真实物理世界的客观原理的深刻理解与经验参考,其生成的子任务虽合逻辑,但是机器人在执行过程中可能会遇到无法顺利操作的困难。以“我把饮料洒了,你能帮忙吗?”为例,现有的大语言模型可能会回答 “你可以试试用吸尘器”、“对不起, 我不是故意洒的”, 虽然这些回应听起来很合理,但当前环境中的机器人并不具备 使用吸尘器的能力,亦或者当前环境中根本没有吸尘器;
特斯拉将车端 FSD 迁移至人形机器人。端到端算法从汽车自动驾驶迁移至人形机器人几乎不需要做太多额外工作,车本身就是一种机器人。早期的特斯拉Optimus 机器人使用了与汽车完全相同的计算机和摄像头,通过让汽车的神经网络在机器人上运行,它在办公室里走动时仍试图识别“可驾驶空间”,而实际上它应该识别的是“可行走空间”。这种通用化能力表明了很多技术是可以迁移的,虽然需要一些微调,但大部分系统和工具都是通用的。
“小脑”:运动控制与协调的枢纽
“小脑”则专注于底层的运动控制,确保机器人能“准确地做”。它负责处理平衡维持、轨迹规划、力控调节等任务,让动作流畅、精准;
核心要求:“小脑”的核心挑战在于高精度、低延迟和高可靠性。它需要融合力觉、惯性等多种传感器数据,对全身多个自由度进行协调控制,要求控制指令时延压缩至毫秒级,周期性抖动控制在微秒级;
技术瓶颈与突破:当前机器人动作生硬,根源常在于“小脑”指令频率不足。当指令频率从每秒1次提升至每秒1000次,实时反馈位置、速度与力度参数时,机器人的动作才能达到类人的流畅效果。此外,“小脑”的发展严重依赖高质量的运动数据,这些数据往往需要通过运动捕捉、仿真训练等方式获取;
实现路径:“小脑”模型的训练通常结合控制理论、模仿学习和强化学习等多种技术路径。例如,通过捕捉人类运动数据作为模仿基准,再在虚拟环境中利用强化学习进行大量训练,最后将成果部署到实体机器人上;
人形机器人的“小脑”主要为了实现轨迹规划和运动控制(肢体驱动、姿态平衡等),主 要由控制器+伺服驱动器+电机+传感器构成。控制原理与工业机器人、工业母机等高端装备类似,但需要处理多维度的输入信号和更高自由度的运动控制,同时控制策略更难,需要基于强化学习的控制技术、基于动力学的模型预测控制技术等技术支撑和融合创新,我们认为在人形机器人产业化成熟的历程中会涌现较多投资机会,有望成为重要的主赛道;
人形机器人“大脑”快速迭代,“小脑”重要性日渐提升:Figure 的 VLA 模型是人形机器人“大脑”的一个重大技术突破,通过部署两个模型解决了 VLM 模型基础架构通用性强但响应速度较慢的问题,“大脑”的成熟有迹可循,且在新技术、新架构的推动下正在快速迭代。而“小脑”由于主要是负责运动控制的落地,由于其技术路线上的高壁垒和复杂性,很难通过弯道超车实现突破,或成为人形机器人产业化的“卡脖子”环节,后续的重要性有望日渐提升。
2.主要上市公司信息:
a. “大脑”(AI大模型与决策系统)
“大脑”主要基于AI大模型,负责环境感知、任务规划、自主决策和高级人机交互,该领域的参与者多为大型科技公司或专注于具身智能算法的企业,其中部分已上市或与上市公司有深度关联;
b.“小脑”(运动控制系统)
“小脑”基于人工智能、自动控制、机器人操作系统(ROS)等技术,负责将“大脑”的决策转化为稳定、高动态、高精度的全身运动控制, 这主要涉及伺服系统、控制器和核心算法;

3、 投资参考
把握“大脑”与“小脑”的技术演进节奏:有专业投资团队指出,目前人形机器人的“小脑”(运动控制)得分约在50-60分,而“大脑”(智能决策)可能只有10-20分,后者发展空间更大但道路更长;
这意味着:
短期:“小脑”及核心硬件供应链的成熟度相对更高,随着2026年被多家机构预测为量产元年,小脑相关厂商的业绩弹性可能更早显现(如伟创电气、固高科技等);
中长期:“大脑”是具身智能实现智能的核心,也是技术难度最高、最关键的环节, 目前国内外在大模型领域投入巨大的互联网公司比如谷歌、阿里、腾讯等有望在智能化突破后获得更高壁垒和估值,感兴趣的可以关注中概互联指数,追求高弹性与短期交易:若强烈看好腾讯、阿里等互联网巨头,并希望在高波动中博取高收益,易方达中概互联50ETF 因其高度集中、流动性最佳的特点成为首选。追求均衡配置与较低成本:若看好中国互联网行业整体但希望权重相对均衡,同时注重费率,广发中概互联30ETF 是合适的选择,其费率在三者中最低。追求稳健与分散配置:若希望投资组合更加分散以降低单一市场或个股风险,并有意覆盖A股互联网龙头,招商全球中国互联网ETF 更为适合,其波动最小,配置最全面。
以上信息仅供参考,不构成投资建议;


