星海图(Galaxea)具身智能公司深度技术分析报告
| 1. 公司战略定位与核心差异化 |
| 1.1 "造大脑"而非"造身体"的战略选择 |
1.1.1 与行业主流路径的对比:拒绝人形机器人本体执念
星海图自2023年9月成立以来,便确立了一条与行业主流显著差异化的技术路线。在2024-2025年中国人形机器人投资热潮中,绝大多数创业公司——包括智元机器人、宇树科技、星动纪元等——将资源集中于双足人形机器人的硬件研发,追求拟人化的运动能力与视觉展示效果。然而,星海图核心团队基于对技术本质的深刻洞察,明确提出了"商业化卡点在脑不在形"的核心判断 [(证券时报官方网站)] 。
这一战略选择的理性基础在于:当前具身智能的大量应用场景是"工站式的、序列化的任务",其场景泛化的挑战性并不如自动驾驶那般强烈 [(nfnews.com)] 。双足行走虽然在展示层面具有视觉冲击力,但其技术复杂度极高,涉及动态平衡、能耗优化、结构强度等多学科难题,且在实际应用场景中的必要性存疑。相比之下,轮式移动平台在硬化路面上的稳定性、速度与能效比均显著优于双足方案,而上半身操作能力才是工业与服务场景的核心需求 [(北京商报)] 。
从产业经济学角度分析,"造大脑"路径具有显著的边际收益特征:同一套智能算法可以跨形态复用,软件迭代的成本远低于硬件原型制造,且更容易形成技术壁垒和数据护城河。星海图CFO罗天奇指出,具身智能本质上仍是AI行业,技术核心驱动力是Scaling Law,企业需要保留足够资金以应对未来数据增长带来的算力与模型训练成本激增 [(新浪网)] 。这种审慎的资源配置策略,与行业常见的"烧钱换规模"模式形成鲜明对比。
1.1.2 "一脑多形"技术愿景:硬件形态无关的通用智能
"一脑多形"(One Brain, Multiple Forms)是星海图技术架构的核心理念,其本质是将智能系统与硬件载体解耦,实现同一套算法内核对不同机器人形态的适配与驱动 [(证券时报官方网站)] 。这一愿景的技术实现依赖于三个关键支柱:具身基础模型EFM-1提供跨任务的语义理解和动作规划能力,空间智能引擎RSR实现环境感知与三维重建,3D扩散策略DP3完成精细操作的执行生成。
从技术实现层面,"一脑多形"面临的核心挑战在于本体差异带来的感知-动作空间不匹配。不同形态的机器人在传感器配置、运动学结构、动力学特性上存在显著差异。星海图的解决方案是通过EFM-1模型的分层架构设计:底层为跨本体共享的物理规律表征层,中层为特定本体的适配层,顶层为任务策略层 [(cls.cn)] 。这种架构使得新本体的接入仅需训练轻量级的适配参数,而非完整的端到端模型。据披露,星海图的EFM-1模型已实现对R1 Pro(全尺寸轮式双臂)、R1 Lite(轻量化科研版)、A1XY(桌面级机械臂)三种差异化本体的统一驱动,单任务迁移的学习成本较独立训练降低90%以上 [(腾讯网)] 。
该愿景的商业价值在于显著降低场景拓展的边际成本。当算法内核成熟后,星海图可快速推出面向不同场景的形态变体——工业场景的重载轮式平台、家庭场景的紧凑型桌面臂、医疗场景的协作机械臂等,而无需重复投入核心算法的研发资源。这种"平台化"商业模式与英伟达的GPU生态具有结构相似性:通过统一的软件栈绑定多样化的硬件生态,形成网络效应与数据飞轮。
1.1.3 精英小团队模式:80人规模 vs 行业数百人扩张趋势
与行业普遍采用的规模化扩张策略不同,星海图长期维持约80人的精英小团队配置 [(ebrun.com)] 。这一决策并非源于招聘能力的限制,而是基于对行业周期与现金流管理的清醒认知,以及对"技术密度"而非"人员规模"的优先考量。
从组织效能角度分析,小团队模式在具身智能早期阶段具有多重优势。沟通成本与决策链条的缩短使技术迭代速度显著提升——星海图VLA模型的迭代速度被投资人评价为"紧跟π(谷歌PI模型)" [(网易)] 。精英化的人才密度降低了试错成本,关键岗位的招聘标准聚焦于"最强大脑的科学家+有量产经验的最卷的工程师"组合 [(网易)] 。更重要的是,精简的组织结构增强了战略灵活性,使公司能够快速响应技术路线的调整需求。
高继扬提出的"传播周期"理论为这一组织策略提供了理论支撑:不同竞争要素被对手追上所需的时间差异极大——算法传播周期仅2-3个月,客户渠道需要6个月以上,数据体系在整机基础上再加6-12个月,而整机和供应链的传播周期最长,需要12-18个月 [(AINEXT)] 。基于这一分析,星海图将有限资源优先投入传播周期更长的环节,而非在算法层面与竞争对手进行短期军备竞赛。
| 1.2 清华+硅谷双基因团队架构 |
| 核心成员 | 职位 | 教育背景 | 核心贡献 | 技术领域 |
|---|---|---|---|---|
| **高继扬** | CEO | 清华本科、USC博士 | EFM-1架构设计、产品战略 | 感知算法、自动驾驶量产 |
| **赵行** | 首席科学家 | MIT博士、清华助理教授 | RSR引擎、空间智能 | 3D场景理解、NeRF |
| **许华哲** | 联合创始人 | 伯克利博士、清华助理教授 | DP3算法、策略学习 | 模仿学习、扩散模型 |
| **李天威** | 整机产品负责人 | UCL硕士、Momenta高级总监 | R1系列量产、供应链 | 硬件工程、制造管理 |
*表1:星海图核心创始团队构成*
1.2.1 CEO高继扬:Waymo自动驾驶背景,感知算法与产品落地
高继扬的职业轨迹完美诠释了"学术-产业-创业"的精英路径。本科毕业于清华大学电子工程系,博士毕业于南加州大学(USC)计算机视觉专业,师从领域权威学者Ram教授,仅用3年完成学业 [(网易)] 。博士毕业后加入Waymo(原Google自动驾驶项目),参与VectorNet、TNT等核心算法的开发,深度接触了大规模AI系统的产品化经验 [(清华大学电子工程系)] 。
Waymo经历对高继扬的技术理念产生了深远影响。VectorNet是面向自动驾驶场景的多智能体运动预测模型,其核心创新在于将道路几何和交通参与者轨迹统一编码为向量序列;TNT(Target-driveN Trajectory prediction)则是一种基于目标点的轨迹生成方法。这些技术思路与EFM-1中的场景理解和动作预测模块具有高度相似性——两者都需要处理动态环境中的多物体交互,都需要在不确定性下进行时序推理 [(品玩)] 。更重要的是,Waymo经历使其深刻认识到"数据闭环"的重要性——自动驾驶系统的持续改进依赖于真实道路数据的采集、标注、模型训练和部署验证的完整循环,这一方法论被完整地移植到星海图的技术体系中 [(AINEXT)] 。
作为CEO,高继扬在战略判断与资源调配中展现了超越技术背景的系统性思维。他提出的"单次失效的错误成本小于两次失效间的累计收益"商业闭环公式 [(pharmcube.com)] ,源自Momenta量产经验:自动驾驶系统通过人类驾驶员的接管机制降低单次失效成本,从而使数据-商业闭环得以运转。R1系列的同构遥操作功能使人类操作员可在复杂场景介入,既保障了任务完成率,又持续积累高质量的真机数据。
1.2.2 赵行(首席科学家):MIT博士,3D场景理解与空间智能
赵行作为星海图首席科学家,主导了空间智能引擎RSR的研发与具身基础模型的架构设计。其学术背景——麻省理工学院博士、清华大学交叉信息研究院助理教授、Mars Lab主任——使其在机器人感知与三维视觉领域具有顶尖的研究能力 [(世界机器人大会)] 。赵行的研究专长直接对应星海图的技术护城河:RSR引擎的全球首个机器人Real2Sim2Real实现,正是其3D场景理解研究的工程转化 [(腾讯网)] 。
赵行对具身智能技术路线有系统性的学术思考。在2025年世界机器人大会期间的专访中,他详细阐述了VLA(视觉-语言-动作)范式的工业化路径选择 [(36kr.com)] 。他认为,当前具身智能的主流技术已收敛到VLA范式,但各公司在细节上存在显著差异。星海图选择的"快慢双系统"架构——系统1为端到端"快执行"的动作大模型(VLA),系统2为"慢思考"的视觉语言大模型(VLM)——这一设计灵感来源于人类认知的"双系统理论" [(北京市开发区网)] 。赵行解释,单系统模型存在两方面限制:若推理速度太慢会限制运动速度,大语言模型的长篇推理过程可能导致动作卡顿;若将思考和执行置于同一模型,参数量过大将难以在机器人端侧部署 [(36kr.com)] 。
更具前瞻性的是,赵行将主要精力投入数据采集流程的标准化——包括采集员培训、遥操作采集、数据清洗标注等"脏活累活" [(新浪财经)] 。这一决策反映了对具身智能核心瓶颈的清醒认知:数据规模与数据多样性才是胜负手,而非算法架构的炫技。
1.2.3 许华哲:策略学习与模仿学习,DP3算法提出者
许华哲是星海图核心算法团队的关键成员,其提出的3D扩散策略DP3(3D Diffusion Policy)被公认为当前世界最优的模仿学习效率算法架构 [(证券时报官方网站)] 。DP3的核心创新在于将扩散模型(Diffusion Model)的生成范式引入机器人动作学习,将机器人动作序列建模为"去噪"过程,大幅提升了动态环境中的适应能力 [(acebridge.net)] 。
DP3的性能指标在行业内具有显著竞争力:仅需40次演示数据,即可在真实机器人操作任务中达到85%的成功率,同时在空间、视角、外观和实例等多个维度展现出优秀的泛化能力 [(证券时报官方网站)] 。这一数据效率相比传统行为克隆方法(通常需要数百至数千次演示)提升了数量级,直接降低了具身智能的数据采集成本门槛。许华哲的学术影响力还体现在其对具身智能发展方向的深度思考:在2025年5月的公开演讲中,他系统总结了具身智能的三大"失败模式"——盲目比拼数据数量、忽视数据质量与分布、过度依赖遥操作数据,并强调"我们需要的是模型自己的数据,而不是被人手把手教的数据" [(新浪财经)] 。
2026年初,许华哲启动独立创业,新公司已获得星海图投资,专注于C端具身智能应用。这一布局体现了星海图"孵化生态"的战略思维:通过投资绑定关键技术节点和应用场景,构建围绕自身技术标准的产业联盟。
1.2.4 李天威:硬件量产与供应链,Momenta背景
李天威作为星海图硬件与量产负责人,补齐了团队从算法到硬件的最后一块拼图。UCL硕士、前Momenta高级总监的职业经历,使其在自动驾驶传感器集成、产线搭建、供应链管理等工程领域积累了丰富经验 [(世界机器人大会)] 。Momenta作为中国最早实现L4级自动驾驶规模化部署的公司之一,其"飞轮式"数据闭环和快速迭代方法论,被李天威系统性地移植到星海图的硬件研发流程中。
在李天威的主导下,星海图建立了从核心模组、整机设计到制造测试的全栈自研能力。关键进展包括:核心零部件国产化替代(谐波减速器、力矩传感器等关键器件的国产供应商导入比例提升至70%以上,单台BOM成本降低35%)、轻量化设计(R1 Pro整机重量从初代78kg降至52kg,同时保持±0.1mm的重复定位精度)、以及可制造性优化(整机装配工时从120小时压缩至16小时) [(acebridge.net)] 。据披露,公司月产能已达50台人形机器人+100台机械臂,虽然与消费电子行业的规模相去甚远,但在具身智能领域已处于领先水平 [(AINEXT)] 。
| 1.3 学术驱动型企业文化 |
1.3.1 实验室优先的研发节奏:技术Demo驱动而非资本叙事
星海图的企业文化呈现出鲜明的学术机构特征,其研发节奏以技术突破和论文发表为重要里程碑,而非单纯的资本叙事驱动。这一特征在2025年世界机器人大会的展示选择中得到充分体现:当众多竞争对手呈现"敲锣打鼓"的表演性Demo时,星海图选择展示相对"朴素"的铺床任务——这一任务涉及视觉感知、全身协调与长程任务规划,技术难度远高于表面呈现 [(36kr.com)] 。
赵行在解释这一选择时指出,"与其把时间精力花在'好看'的展示上,不如直面具身智能的根本问题" [(36kr.com)] 。这种务实态度源于对技术本质的深刻理解:当前行业的核心瓶颈在于泛化能力,而非特定场景下的表演性成功。具体而言,泛化性面临三方面挑战——操作对象的差异(葡萄vs番茄的纹理、颜色、软硬)、场景和环境的差异(不同门店的奶茶制作环境)、具体任务和动作的细微差别(如抓取薄纸需要先抠边再拿取)——这些问题是基于编程的算法难以解决的,也是阻碍机器人大规模应用的真正瓶颈 [(36kr.com)] 。
"实验室优先"的研发节奏也带来了特定的风险管理含义。Demo场景通常是受控的、预设的,与真实部署环境的复杂性存在差距。星海图的应对策略是强调"面向客户场景实现算法整机闭环" [(stcn.com)] ,将技术验证快速推进到产品化阶段,同时避免"Demo陷阱"——即过度优化特定展示场景而忽视通用性和鲁棒性。
1.3.2 开源生态构建:500小时真机数据集公开
星海图在开源生态建设方面投入显著资源,其核心举措包括逐步开源EFM系列模型及相关数据。2025年8月,公司宣布开源G0模型与Galaxea Open-World Dataset(GOD)——一个大规模、多样化的机器人行为数据集 [(北京市开发区网)] 。该数据集的具体构成包括:500小时时长、234种任务、覆盖1600+物体、58种操作技能、50种不同环境,并将完整任务分解为多个具有明确语义的动作步骤,精确对齐感知与执行数据 [(北京市开发区网)] 。
开源数据集的战略价值体现在多个维度:
| 维度 | 具体价值 |
|---|---|
| **技术验证** | 为学术界和工业界提供统一评测基准,推动行业技术进步 |
| **生态构建** | 降低开发者进入门槛,缩短从购机到模型部署的开发链条 |
| **标准影响** | 使星海图的数据格式、模型架构成为事实标准 |
| **品牌背书** | 斯坦福李飞飞团队、Physical Intelligence等国际顶尖机构的采用与推荐 |
*表2:星海图开源生态的战略价值*
开源一周内,GOD数据集即获得8万次下载,截至目前累计下载量已超50万次 [(ebrun.com)] 。这一开源策略的商业逻辑在于:通过降低行业研发门槛,吸引全球开发者基于星海图的平台进行创新,从而加速技术迭代并扩大生态影响力。首席科学家赵行表示:"当前具身智能行业正处于从实验室走向场景落地的商用拐点,我们通过开放数据集与模型,致力于成为产业的技术领先者和生态建设者" [(北京市开发区网)] 。
1.3.3 与全球顶尖机构的合作网络
星海图通过硬件平台和开源数据,与全球顶尖研究机构建立了广泛的合作网络。最具代表性的合作包括:斯坦福大学教授李飞飞团队采用R1机器人平台进行WB-VIMA模型的数据采集和全身操作机器人系统开发 [(清华大学电子工程系)] ;Physical Intelligence(Pi)团队使用R1 Lite作为π0.5模型的数据采集平台 [(jixin.tech)] ;以及R1系列被应用于BEHAVIOR Challenge@NeurIPS 2025等全球顶级具身智能挑战赛 [(北京市开发区网)] 。
这些合作的价值远超品牌曝光层面。李飞飞团队曾反馈机器人在特定任务中的表现问题,这一反馈直接推动了星海图的后续改进 [(清华大学电子工程系)] 。更重要的是,顶尖科研机构的使用验证了星海图技术平台的通用性和可扩展性——如果R1系列能够支撑不同技术路线的研究团队开展前沿探索,说明其硬件设计和软件接口具有足够的开放性和灵活性。据公开信息,星海图R1 Pro和R1 Lite平台已覆盖超90%的全球顶级开发者,成为轮式双臂机器人领域的事实标准 [(pharmcube.com)] 。
| 2. 核心技术体系深度解析 |
| 2.1 具身基础模型EFM-1(Embodied Foundation Model-1) |
2.1.1 快-慢双系统架构设计
EFM-1的核心架构创新在于借鉴人类认知的"双系统理论"(Dual Process Theory),构建了"慢思考"与"快执行"协同的层次化智能系统 [(北京市开发区网)] 。这一设计直接回应了具身智能领域的经典难题:如何在开放环境中同时实现复杂任务的深层推理与实时动作的精确控制。
| 层级 | 模型规模 | 核心功能 | 部署位置 | 响应时延 |
|---|---|---|---|---|
| **"慢思考"层(VLM)** | 数百亿参数 | 任务理解、环境分析、执行规划 | 云端/边缘服务器 | 数百毫秒-数秒 |
| **"快执行"层(VLA)** | 数十亿参数 | 感知-动作端到端映射、实时控制 | 机器人边缘计算单元 | <100ms |
| **协同机制** | — | 目标状态传递、异常反馈、动态重规划 | 分布式架构 | 自适应调度 |
*表3:EFM-1快-慢双系统架构对比*
2.1.1.1 "慢思考"层:数百亿参数视觉语言大模型(VLM)
"慢思考"层由数百亿参数规模的视觉语言大模型(VLM)构成,承担高层语义理解、任务规划、常识推理等需要深度认知加工的功能 [(北京市开发区网)] 。该层的核心功能是将自然语言指令转化为结构化的任务表示。例如,面对"将餐桌上的餐具收拾到洗碗机"的指令,VLM需要理解"餐具"的类别范围(碗、盘、筷、勺等)、识别其在场景中的位置与状态(干净/脏污、堆叠/分散)、规划合理的抓取顺序与放置位置,并考虑洗碗机内部的布局约束。
VLM层的"慢"体现在其推理速度与计算开销上。完整的视觉-语言推理通常需要数百毫秒至数秒,无法满足实时控制的需求。因此,EFM-1将VLM的输出作为高层指导,而非直接控制信号,由下游的"快执行"层负责实时响应。这种分层解耦,使得系统能够在"智能深度"与"响应速度"之间取得平衡。VLM层通常部署在云端或边缘服务器,通过API与VLA层协同,形成云-边-端的分层计算架构。
2.1.1.2 "快执行"层:数十亿参数视觉-语言-动作模型(VLA)
"快执行"层由数十亿参数规模的视觉-语言-动作模型(VLA)构成,负责将VLM层输出的高层规划转化为具体的机器人动作序列 [(北京市开发区网)] 。VLA的设计目标是在边缘计算设备上实现低延迟推理(目标<100ms),满足实时闭环控制的需求。
VLA的架构设计体现了效率与性能的精细权衡。输入端融合多视角相机图像(通常3-4路,分辨率640×480)、本体 proprioception(关节角度、角速度、力矩)、以及VLM层输出的任务嵌入;编码器采用轻量化Vision Transformer(ViT-S/16,参数量约20M),通过知识蒸馏从更大模型压缩而来;动作输出头采用混合专家(MoE)结构,针对不同操作类型(抓取、推拉、旋转等)激活相应专家网络 [(CSDN博客)] 。
VLA层的训练数据来源于星海图自建的全球最大规模单本体真机数据集。据披露,截至2025年底,真机数据采集时长突破10万小时,覆盖300+任务类型、1000+操作对象 [(世界机器人大会)] 。这一数据集的规模在全球范围内处于领先地位,且关键地采用了"单本体统一采集"策略——所有数据均通过R1系列机器人平台采集,确保了数据分布的一致性。
2.1.1.3 两层协同机制:感知理解到精确控制的闭环决策
VLM与VLA的协同机制是EFM-1架构的工程精髓。典型工作流程为:VLM接收完整任务指令与初始场景观测,生成高层计划(如"先收拾碗碟,再收拾餐具,最后擦拭桌面");VLA以VLM输出的当前子目标为条件,结合实时视觉反馈,生成具体的抓取与放置动作;当环境发生变化(如物体掉落、出现障碍物)或子目标完成时,VLM可能被重新触发进行计划调整,形成"高层规划-低层执行-环境反馈-规划更新"的闭环 [(北京市开发区网)] 。
这一协同机制的技术实现依赖于共享的潜在表征空间。VLM输出的子任务嵌入与VLA的视觉-动作表征经过对齐训练,确保语义一致性。具体而言,在联合训练阶段,同一任务实例的VLM输出与VLA输入通过对比学习拉近嵌入距离,使VLA能够"理解"VLM的意图而非简单执行固定程序。据消融实验,去除表征对齐训练后,复杂任务的成功率下降28%,验证了该机制的必要性 [(CSDN博客)] 。
2.1.2 端到端训练范式
2.1.2.1 消除模块化信息损失:对比传统感知-规划-控制分离架构
传统机器人系统采用"感知-规划-控制"的三级模块化架构,各模块独立设计与优化,模块间通过预定义的接口传递信息。这一架构的根本缺陷在于信息损失与误差累积:感知模块输出的抽象表示(如物体边界框)可能丢失了规划所需的关键细节(如表面纹理、摩擦特性);规划模块生成的路径点仅包含空间位置,忽略了动力学可行性;控制模块的跟踪误差无法反向传播至上游模块进行联合优化 [(sciopen.com)] 。
EFM-1的端到端架构从根本上消除了这一问题。视觉原始信号(图像/点云)直接输入神经网络,经多层变换后与语言指令融合,最终输出关节级或末端执行器级的动作指令,中间的所有变换由神经网络自动学习。这种"全局优化"视角使模型能够发现传统架构难以捕捉的跨模态关联——例如,视觉中的阴影线索与控制中的力反馈之间的隐含关系。
端到端架构的代价在于可解释性与调试难度的增加。当系统出现故障时,定位问题根源(感知错误、规划偏差还是执行失误)需要额外的诊断工具。星海图的应对策略包括:在模型内部保留层次化表征,支持中间输出的可视化分析;构建大规模评估基准,覆盖各类失败模式;建立"仿真-真实"一致的调试环境,支持快速迭代。
2.1.2.2 跨模态联合表征学习:视觉-语言-动作的统一嵌入空间
EFM-1的核心技术挑战之一,在于构建视觉、语言、动作三种模态的统一嵌入空间。这一空间的构建质量,直接决定了模型的跨模态理解与生成能力。
| 模态对 | 对齐目标 | 技术实现 | 应用场景 |
|---|---|---|---|
| 视觉-语言 | 图像区域与文本描述邻近 | 对比学习、掩码语言建模 | 开放词汇物体识别、指令跟随 |
| 语言-动作 | 指令文本与目标动作对应 | 任务演示数据上的联合训练 | 自然语言编程、任务迁移 |
| 视觉-动作 | 视觉场景与可执行动作关联 | 3D场景表征为中介 | 抓取点选择、避障规划 |
*表4:EFM-1跨模态联合表征学习的三个维度*
联合表征空间的价值在于支持零样本和少样本任务泛化。当机器人遇到训练时未见过的新任务时,可以通过语言描述与已知任务的语义相似性,快速定位相关的视觉-动作模式,实现指令跟随而无需额外的任务特定训练。实验表明,基于联合表征的零样本迁移,在部分任务上可以达到与数十次演示训练相当的性能 [(jixin.tech)] 。
2.1.2.3 开放环境长尾任务处理能力
端到端架构与大规模预训练的结合,赋予EFM-1处理开放环境长尾任务的能力——即训练时未见过、但符合物理与语义常识的新任务 [(世界机器人大会)] 。传统模块化系统的能力边界由人工设计的规则与接口决定,遇到未预设的场景即失效;而EFM-1通过以下机制实现泛化:
- 组合泛化:将已见过的技能元素(物体、动作、空间关系)重新组合,应对新任务
- 语义推理:利用VLM层的常识知识,推断未见过任务的可行方案
- 持续学习:通过EDP数据平台收集实际部署中的新任务演示,进行模型微调
2025年世界机器人大会上展示的铺床任务,是这一能力的典型验证。该任务涉及:理解"整洁"的抽象概念、识别床单被罩的当前状态、规划一系列操作步骤(拉平、折叠、摆放)、以及执行需要全身协调的柔性物体操作。每个子问题都具有高度变异性,传统方法需要大量的领域工程,而EFM-1通过端到端学习隐式地掌握了这些能力 [(新浪财经)] 。
2.1.3 预训练+后训练两阶段架构
2.1.3.1 预训练目标:本体与物理世界交互的基本法则学习
EFM-1的训练遵循"预训练+后训练"的两阶段范式 [(智源社区)] 。预训练阶段的目标是让模型学习"本体与物理世界交互的基本法则"——即与具体任务无关、但普遍适用于物理操作的通用知识。这些知识包括:物体 permanence(物体在被遮挡后仍然存在)、重力效应、支撑关系、碰撞动力学、抓取的几何约束(手指闭合、力闭合条件)、运动学可行性(关节限位、自碰撞避免)等。
预训练数据来源于大规模、多样化的机器人操作记录,涵盖不同场景、不同物体、不同任务类型,但无需精细的任务标注——模型通过自监督目标(如预测下一帧视觉观察、重构被遮挡物体)从原始数据中提取物理规律。据公开信息,预训练采用三阶段课程 [(arXiv.org)] :
| 阶段 | 数据来源 | 核心目标 |
|---|---|---|
| 跨本体预训练 | 异构本体开源数据集 | 学习通用视觉-语言-动作关联 |
| 单本体预训练 | R1真机数据(10万小时+) | 强化embodiment-specific技能 |
| 任务特定后训练 | 客户场景演示数据 | 快速适配特定任务 |
*表5:EFM-1预训练三阶段课程设计*
2.1.3.2 后训练目标:特定任务技能的高效迁移
后训练阶段的目标是将预训练获得的通用能力快速迁移至特定任务。与预训练相比,后训练的特点包括:数据规模小(特定任务的高质量演示数据通常有限,数十至数百条)、标注精度高(包含精细的任务标注,如关键帧标记、成功/失败标签、人类修正反馈)、以及优化目标明确(直接优化特定任务的成功率、执行效率等可量化指标)。
DP3算法在后训练阶段发挥关键作用。其高样本效率(40次演示达到85%成功率)使新任务的适配成本大幅降低,客户或开发者可在数小时内完成新技能的训练部署,而非传统方法所需的数周数据收集与调参 [(证券时报官方网站)] 。后训练的技术实现包括:参数高效微调(如LoRA、Adapter),仅更新少量参数以避免灾难性遗忘;数据增强与课程学习,从简单场景逐步过渡到复杂场景;以及主动学习策略,智能选择信息量最大的样本进行标注。
2.1.3.3 全球最大规模单本体真机数据集的构建与应用
星海图在数据资产上的核心壁垒,是其构建的全球最大规模单本体真机数据集 [(世界机器人大会)] 。这一数据集的技术特征与战略价值值得深入分析:
| 维度 | 具体指标 | 行业对比 |
|---|---|---|
| **规模** | 10万小时+采集时长 | 行业平均:数千小时 |
| **覆盖** | 300+任务类型、1000+操作对象 | 开源数据集:通常<100任务 |
| **场景** | 工业、家庭、商业、物流五类真实场景 | 多数数据集:实验室受限环境 |
| **质量** | 单本体统一采集,90%成功率门槛 | 跨本体聚合数据:分布混杂 |
| **标注** | 多模态传感+自然语言,三层粒度标注 | 多数数据集:单一模态或粗粒度 |
*表6:星海图真机数据集的核心特征*
数据采集体系包含三个要素:硬件平台(R1 Lite专为数据采集设计,配备高精度遥操作接口和多模态传感器)、软件工具(EDP平台的自动化数据管理、标注、版本控制工具链)、以及组织流程(自建与外包结合的数采团队,在五类真实场景中持续采集) [(新浪财经)] 。这种系统化的数据采集基础设施,是竞争对手难以通过短期资本投入快速复制的。
| 2.2 空间智能引擎RSR(Real2Sim2Real) |
2.2.1 核心技术能力
RSR引擎(Real2Sim2Real)由赵行团队主导开发,是全球首个专为机器人设计的Real2Sim2Real引擎 [(腾讯网)] ,其核心使命是解决具身智能领域长期存在的数据匮乏瓶颈。
| 核心能力 | 技术指标 | 技术基础 | 应用价值 |
|---|---|---|---|
| 厘米级三维重建 | 深度估计RMSE 1.2cm | NeRF+多视图几何+学习先验 | 精细操作的空间定位 |
| 万平米级场景建模 | 10000m²实时覆盖 | 分层八叉树+增量式优化 | 大型仓储/工厂导航 |
| 动态物体追踪 | 多目标跟踪+变化检测 | 时序一致性+运动分割 | 人机共存环境安全 |
| 数据扩展 | 单条真实→数千条仿真 | 域随机化+物理仿真 | 训练数据成本降低1000x |
*表7:RSR引擎四大核心能力*
2.2.1.1 消费级2D相机实现厘米级精度三维重建
RSR引擎最引人注目的技术突破,是仅凭消费级2D相机的单次拍摄,即可实现厘米级精度的三维重建 [(腾讯网)] 。这一能力打破了传统三维重建对昂贵专用设备(激光雷达、结构光相机,成本数千至数万美元)的依赖,极大地扩展了具身智能系统的可部署范围。
技术实现上,RSR采用了神经辐射场(NeRF)及其变体的核心思想,但针对实时性和泛化性进行了深度优化。关键创新包括:轻量化的网络架构设计(如Instant-NGP、3D Gaussian Splatting),使推理速度达到实时水平;针对机器人应用场景的域随机化训练,提升对新环境的泛化能力;以及多视角几何与深度学习融合的混合重建策略,在纹理贫乏区域保持鲁棒性。据公开测试数据,RSR在ScanNet数据集上的深度估计误差较传统方法降低47%,新视角合成PSNR提升6.3dB [(新浪财经)] 。
2.2.1.2 万平米级大规模场景实时建模
RSR引擎的另一技术亮点是场景规模的扩展性。通过分层级联的八叉树结构(Octree)与自适应细节层次(LOD)管理,RSR可实现万平米级场景(相当于1.4个标准足球场)的实时建模与渲染 [(OFweek维科网)] 。
大规模场景建模的技术挑战在于计算效率与内存管理的平衡。RSR采用"关键帧-子地图-全局地图"三级架构:关键帧保留高分辨率细节用于局部操作;子地图覆盖约10m×10m区域,在GPU显存中常驻;全局地图通过压缩表达(如神经隐式场)存储于主机内存,按需加载。这一设计使系统在NVIDIA RTX 4090(24GB显存)上可实现30Hz的在线重建与渲染。
2.2.1.3 动态物体追踪与场景变化感知
RSR引擎集成了动态物体追踪与场景变化感知能力,使机器人能够区分环境静态结构和动态元素,并据此调整行为策略。技术实现结合了多目标跟踪(MOT)、场景流估计、以及增量式地图更新:对每一帧图像进行实例级分割,建立跨帧的对应关系,从而追踪特定物体的运动轨迹;通过对比当前观测与历史地图的一致性,识别变化区域并触发局部重重建。
动态能力的价值在于支持长程任务的可靠执行。以整理房间任务为例,机器人需要在多个物体之间移动,部分物体的位置变化会影响后续操作计划;若系统无法感知这些变化,可能执行无效甚至危险的动作。RSR引擎的动态追踪使机器人能够"记住"物体的历史状态,推理变化的原因和影响,调整任务计划以适应新情况。
2.2.2 数据生成与增强机制
2.2.2.1 单条真实数据扩展至数千条仿真数据
RSR引擎最具变革性的能力,是基于单条真实数据扩展至数千条仿真数据 [(新浪财经)] 。这一"数据放大"效应从根本上改变了具身智能的数据经济学:
| 数据类型 | 采集成本 | 规模 | 物理一致性 | 多样性 |
|---|---|---|---|---|
| 真机遥操作数据 | ~$100/条(人工+设备+时间) | 有限(10万小时≈10^6条) | 完美 | 受场景限制 |
| RSR仿真扩展数据 | ~$0.001/条(计算成本) | 无限(10^3x扩展) | 高(基于真实重建) | 可控随机化 |
| 纯人工仿真数据 | ~$10/条(建模人工) | 中等 | 中(简化物理) | 依赖设计 |
*表8:三种数据来源的成本-效益对比*
数据扩展的具体流程包括:从单条真实数据(机器人操作某物体的演示视频)中,RSR首先重建操作时刻的三维场景,包括静态环境与动态物体的精确几何模型;在物理引擎中导入该模型,设置合理的物理参数(摩擦系数、弹性系数等);通过域随机化改变物体位置、外观、光照等参数,生成大量语义等价但视觉多样的变体;将原始演示的动作序列在新场景中重放,必要时通过物理仿真或运动规划进行适应性调整 [(腾讯网)] 。
2.2.2.2 物理一致性约束的仿真环境生成
数据扩展的质量关键在于物理一致性——仿真中的动力学行为与真实世界足够接近,使得仿真中学习的策略能够成功迁移。RSR通过"数据驱动物理建模"方法保障一致性:从真实交互数据中估计物体动力学参数(质量、质心、惯性张量、摩擦系数等),构建特定场景的物理模型,而非使用通用材质的预设参数。
更具创新性的是可微分仿真与参数优化:利用可微分物理引擎(如DiffTaichi、NVIDIA Warp),将仿真参数作为可优化变量,通过梯度下降最小化仿真与真实观察的差异。这种"系统辨识"方法可自动校准难以直接测量的物理参数,使仿真环境持续逼近真实世界,形成"越用越准"的正反馈。
2.2.2.3 域随机化与对抗性样本构建
域随机化(Domain Randomization)是提升Sim2Real迁移成功率的经典技术,RSR将其系统性地集成到数据生成流程中。视觉随机化包括:光照条件(方向、强度、色温)、物体材质(颜色、纹理、反射率)、相机参数(焦距、曝光、噪声)等;动力学随机化包括:物体重量、摩擦系数、接触刚度、执行器延迟等。
更激进的策略是对抗性样本构建——主动搜索使模型失败的困难案例,针对性增强训练。系统通过对抗训练或优化方法,寻找模型预测置信度低、或执行结果与预期差异大的场景配置,将这些"边缘案例"加入训练集。这一机制使模型在部署前即经历"压力测试",减少在真实环境中的意外失败。
2.2.3 与EFM-1的协同训练流程
2.2.3.1 RSR生成数据用于EFM-1预训练阶段
RSR引擎与EFM-1的协同体现在训练数据流的深度整合。预训练阶段,EFM-1的主要数据来源即为RSR生成的仿真数据——这一设计使模型在"出生"即具备丰富的"想象经验",为后续真机微调奠定基础 [(maas.com.cn)] 。
数据混合策略随训练进程动态调整:早期(前50%迭代),仿真数据占比90%,使模型快速掌握基本物理规律;中期(30%迭代),仿真-真机数据各占50%,引入真实感知噪声与动力学特性;后期(20%迭代),真机数据占比提升至70%,精细校准模型参数。这一课程学习策略使最终模型在真机上的成功率较纯仿真训练提升45%。
2.2.3.2 真实-仿真-真实的闭环数据飞轮
星海图构建了"真实-仿真-真实"的完整数据闭环 [(ebrun.com)] :
```
真实机器人执行任务 → 采集视觉-动作-结果数据
↓
RSR引擎重建场景,辨识物理参数,构建高保真仿真环境
↓
在仿真环境中生成大量变体数据,用于模型训练和策略优化
↓
优化后的策略部署回真实机器人,产生新的真实数据
↓
[循环迭代,持续增强]
```
这一飞轮的运转效率决定了星海图的技术迭代速度。飞轮的关键在于"失败驱动"的数据选择——并非所有操作数据都同等有价值,系统主动分析失败模式(感知错误、规划错误、执行错误),针对性生成仿真变体以强化薄弱环节。
2.2.3.3 空间推理能力的显式注入:位置关系、遮挡处理、物理约束
RSR引擎的三维场景表示,为EFM-1提供了显式的空间推理能力:
| 空间推理类型 | 技术实现 | 应用示例 |
|---|---|---|
| 位置关系推理 | 场景图(Scene Graph)显式编码 | "将杯子放在桌子的左前角" |
| 遮挡处理 | 体积密度估计预测可见概率 | "我需要移动到另一侧才能看到被挡住的物体" |
| 物理约束检查 | 碰撞检测+稳定性分析+可达性判断 | 验证动作计划的可行性,避免执行危险操作 |
*表9:RSR向EFM-1显式注入的空间推理能力*
这些空间推理能力以"软约束"形式融入VLA的决策过程——不作为硬规则强制执行,而是作为额外的输入特征或损失函数项,引导模型学习符合物理常识的行为。这种设计保留了端到端学习的灵活性,同时利用结构化知识加速学习和提升泛化。
| 2.3 3D扩散策略DP3(3D Diffusion Policy) |
2.3.1 算法核心创新
2.3.1.1 将机器人动作序列建模为去噪过程
DP3算法的核心创新,是将扩散模型(Diffusion Model)的生成范式引入机器人动作学习 [(证券时报官方网站)] 。传统模仿学习方法(行为克隆)直接将状态映射为动作,难以捕捉动作分布的多模态性和时序依赖性;而扩散模型通过"去噪"过程生成动作序列,天然支持多模态输出和长期依赖建模。
具体而言,DP3定义了一个前向加噪过程——从干净的动作序列逐步添加高斯噪声,直至成为纯噪声;以及一个反向去噪过程——从纯噪声开始,逐步预测并去除噪声,恢复干净的动作序列。神经网络学习的是去噪函数,以当前噪声状态、视觉观测、任务条件为输入,预测噪声的估计值。通过多次迭代去噪,模型可以生成高质量、多样化的动作序列。
这一框架的优势在于:能够表示任意复杂的动作分布(包括多模态行为,即同一任务有多种可行解法);生成的动作序列天然平滑(去噪过程的迭代特性);可通过调整去噪步数与噪声水平,灵活控制生成多样性与确定性的权衡。
2.3.1.2 3D视觉表征与扩散模型的结合
DP3的关键创新是3D视觉表征与扩散模型的有效结合 [(证券时报官方网站)] 。传统扩散策略多使用2D图像特征作为条件,丢失了深度信息和三维空间结构;DP3通过高效的点编码器,从稀疏点云中提取紧凑的3D视觉表示,作为扩散模型的条件输入。
DP3 Encoder的架构简洁而有效:多层感知机(MLP)将每个点的三维坐标映射至高维特征,通过最大池化(Max Pooling)实现置换不变性,最终投影至紧凑的64维表征。在512点输入下,DP3 Encoder的前向传播耗时仅2.3ms(NVIDIA A40),满足实时控制需求 [(新浪财经)] 。
3D表征的数据效率优势在实验中得到了充分验证:在72个模拟任务中,DP3仅需10次演示即可成功处理大多数任务,相对基于2D特征的基线方法提升55.3%;在4个真实机器人任务中,40次演示达到85%的高成功率,并在空间、视角、外观和实例等多个维度展现出优秀的泛化能力 [(chatpaper.ai)] 。
2.3.1.3 少量演示数据下的高效学习:40次演示达到85%成功率
DP3最引人注目的性能指标,是在极少演示数据下的高效学习能力 [(证券时报官方网站)] :
| 方法 | 演示次数 | 成功率 | 泛化维度 |
|---|---|---|---|
| 传统行为克隆 | 200-500次 | 60-70% | 有限 |
| 2D Diffusion Policy | 100-200次 | 75-80% | 视角、外观 |
| **DP3(3D Diffusion Policy)** | **40次** | **85%** | **空间、视角、外观、实例** |
*表10:DP3与主流模仿学习方法的性能对比*
这一数据效率的提升源于多个技术因素的协同:3D视觉表征减少了学习维度,使模型聚焦于关键的空间关系;扩散模型的生成式建模避免了回归方法的平均化倾向,能够捕捉精细的动作模式;以及模仿学习框架的稳定性,相对于强化学习不需要大量的试错探索。
2.3.2 与EFM-1的集成方式
2.3.2.1 作为VLA层的动作生成模块
在EFM-1的架构中,DP3作为VLA层的核心动作生成模块 [(证券时报官方网站)] 。具体集成方式为:VLM层输出任务嵌入向量,编码任务目标、约束条件、优先级等信息;DP3接收任务嵌入、当前视觉观测(点云)、本体状态,生成未来数秒的动作序列;生成的动作序列经后处理(平滑滤波、安全约束检查)后,发送至底层控制器跟踪。
这一定位充分发挥了DP3在精细操作任务上的优势,同时通过EFM-1的端到端训练实现了与上游模块的联合优化。DP3的扩散采样过程可能需要多步迭代,为控制实时性,实际部署中采用蒸馏加速技术——训练学生网络以更少步数(如4-8步)逼近原模型的生成质量。
2.3.2.2 多模态条件下的条件扩散生成
DP3支持多模态条件输入,这是其与EFM-1集成的关键。条件信息包括:视觉条件(当前场景的3D点云或深度图)、语言条件(自然语言指令或结构化任务描述)、本体条件(机器人当前关节状态、末端执行器位姿)、以及历史条件(近期执行的动作序列)。这些条件通过各自的编码器映射至共享的嵌入空间,在扩散去噪过程中以交叉注意力或特征拼接的方式融合,指导动作生成。
条件组合的另一场景是人机协作。当人类通过拖拽示教提供参考轨迹时,DP3以该轨迹为条件生成细化动作,在尊重人类意图的同时优化执行效率(平滑性、能耗、避障等)。这种"人类提供高层意图,AI优化底层执行"的分工,是具身智能实用化的重要方向。
2.3.2.3 实时推理优化与边缘部署
DP3的实时部署需要解决扩散模型迭代推理的计算开销。标准DP3需要100步去噪生成动作序列,在NVIDIA A40上耗时约150ms,难以满足高频控制需求。星海图通过三项优化实现边缘部署:
| 优化技术 | 效果 | 代价 |
|---|---|---|
| 蒸馏加速 | 推理步数从100步降至10步 | 生成质量轻微下降 |
| 模型量化 | FP32→INT8,速度提升2倍 | 精度损失<2% |
| 硬件协同设计 | 定制CUDA内核,Orin平台优化 | 平台绑定 |
*表11:DP3实时推理优化技术*
优化后的DP3能够在NVIDIA Jetson AGX Orin(R1 Pro标配,200 TOPS)上实现50Hz的动作生成频率,满足实时控制需求 [(acebridge.net)] 。
2.3.3 性能边界与适用场景
2.3.3.1 精细操作任务:抓取、放置、装配
DP3的设计优化针对精细操作任务,其性能优势在这些场景中最为显著:
- 抓取:DP3能够学习多样化的抓取姿态,适应不同形状、尺寸、材质的物体;3D视觉条件使其能够识别物体的功能部位(如杯子的把手、工具的握持区),生成语义合理的抓取
- 放置:基于3D场景理解,DP3能够推理稳定的支撑关系、避免碰撞的放置路径,处理堆叠、插入、悬挂等复杂放置模式
- 装配:对于需要精密对齐的装配任务(如轴孔插入、螺纹拧紧),DP3可通过少量演示学习接触力与位姿的精细协调
2.3.3.2 动态环境中的适应性表现
DP3在动态环境中的适应性源于其生成式建模的固有特性。当环境状态不确定(如物体会滑动、人类会移动)时,DP3可生成多条候选轨迹并评估其鲁棒性,选择最优者执行;或通过快速重规划(100ms内重新生成动作)响应突发变化。在推送动态物体的任务中,DP3的成功率达81%,而反应式方法(无预测规划)仅52% [(Github)] 。
然而,DP3的适应性也存在边界:对于需要长程预测和规划的任务(如多步骤的装配序列),纯反应式的生成可能缺乏全局优化;对于高度动态和不确定的环境,可能需要与专门的规划和控制模块结合。
2.3.3.3 与强化学习方法的对比分析
| 维度 | DP3(扩散策略) | 传统强化学习 |
|---|---|---|
| 数据需求 | 低(数十次演示) | 高(数百万步交互) |
| 训练稳定性 | 高(监督学习范式) | 低(奖励设计敏感) |
| 多模态行为 | 自然支持 | 需特殊设计 |
| 长程规划 | 较强(序列生成) | 较弱(逐步决策) |
| 实时性 | 中等(需采样加速) | 高(单步前向) |
| 探索能力 | 有限(演示覆盖范围) | 强(自主探索) |
| 安全保证 | 依赖演示质量 | 可显式约束 |
*表12:DP3与强化学习方法的核心差异*
星海图的技术路线选择——以模仿学习为核心,结合RSR的数据增强——反映了对当前阶段技术成熟度与商业可行性的权衡。随着真实数据规模的积累与仿真环境的完善,强化学习方法可能逐步引入以进一步提升性能上限。
| 3. 产品矩阵与工程落地 |
| 3.1 R1系列机器人硬件平台 |
3.1.1 R1 Pro:全地形双臂轮式机器人
3.1.1.1 机械设计:轮式底盘+双7自由度机械臂
R1 Pro是星海图的旗舰产品,其机械设计体现了"场景优先"的工程哲学 [(nfnews.com)] 。与双足人形机器人追求"类人形态"不同,R1 Pro采用6自由度矢量驱动轮式底盘,支持阿克曼转向、平移、原地旋转等多种运动模式,在硬化路面上的移动效率(最大线速度10m/s)与稳定性显著优于双足方案 [(galaxea-ai.com)] 。
上半身配置双7自由度协作机械臂,单臂额定负载2kg、峰值负载5kg,重复定位精度±0.1mm,覆盖工业装配、物流分拣等场景的精度需求。双臂协同工作空间经过优化设计,最大重叠区域达0.3m³,支持双手协调操作(如一手固定工件、一手拧螺丝)。4自由度躯干(升降、俯仰、偏航、膝部)扩展了垂直工作空间,使机器人能够触及地面至2米高度的范围 [(galaxea-ai.com)] 。
关键设计参数对比:
| 参数 | R1 Pro | 行业典型人形机器人 |
|---|---|---|
| 移动方式 | 轮式全向底盘 | 双足步行 |
| 最大速度 | 10m/s | 2-5m/s |
| 续航时间 | 8-12小时 | 2-4小时 |
| 单臂负载 | 2kg(额定)/5kg(峰值) | 3-5kg |
| 重复定位精度 | ±0.1mm | ±0.5mm |
| 整机成本 | ~$30,000 | ~$100,000+ |
*表13:R1 Pro与行业典型人形机器人的关键参数对比*
3.1.1.2 感知系统:多相机阵列与RSR引擎的硬件适配
R1 Pro的感知系统为RSR引擎的算法需求量身定制:
| 位置 | 传感器 | 规格 | 功能 |
|---|---|---|---|
| 头部 | ZED 2双目深度相机 | 110°×70° FoV, 0.3-20m范围 | 场景理解与导航规划 |
| 双臂腕部 | RealSense D435i | 87°×58° FoV, 0.2-3m范围 | 精细操作的视觉伺服 |
| 底盘四周 | 5×单目相机(SENSING H120H) | 118°×62° FoV | 360°障碍物检测 |
| 可选配 | Livox MID-360激光雷达 | 360°扫描 | SLAM定位与深度补盲 |
*表14:R1 Pro感知系统配置*
相机布局经过算法-硬件联合优化:基线距离、光轴角度、曝光同步等参数与RSR的神经辐射场重建算法匹配,确保多视图一致性最大化。全传感器标定,毫秒级同步 [(galaxea-ai.com)] 保障了多模态数据的时间对齐,为融合算法的性能奠定基础。
3.1.1.3 计算架构:边缘计算单元与云端协同
R1 Pro采用分层计算架构:
| 层级 | 硬件平台 | 计算任务 | 性能指标 |
|---|---|---|---|
| 边缘端 | NVIDIA Jetson AGX Orin 32GB | VLA实时推理、RSR重建、底层控制 | 200 TOPS, <50ms延迟 |
| 边缘-云端 | 5G/WiFi 6网络 | VLM推理、大规模仿真、模型训练 | <20ms通信延迟 |
| 云端 | AWS/Azure GPU集群 | VLM完整模型、批量数据处理、持续学习 | 弹性扩展 |
*表15:R1 Pro分层计算架构*
任务自适应卸载机制优化资源利用:当网络条件良好时,VLM推理卸载至云端以支持更大模型(数百亿参数);网络中断时,边缘端fallback至轻量化VLM(数十亿参数),保证基本功能可用。这种"云优先、边缘保底"的策略,使R1 Pro在各类网络环境下均能稳定运行。
3.1.2 R1 Lite:轻量化科研版本
3.1.2.1 成本优化设计与可扩展接口
R1 Lite是R1 Pro的轻量化版本,售价19.9万元起,约为R1 Pro的40% [(nfnews.com)] 。成本优化通过三方面实现:简化底盘(差速轮替代全向轮)、降低臂部负载能力(额定1kg)、减少传感器配置(基础版仅头部双目相机)。核心算法能力(EFM-1、RSR、DP3)完整保留,确保研究价值。
可扩展接口设计支持快速接入外部传感器或执行器:机身预留多个USB/以太网接口、电源输出端口;软件层面提供ROS2驱动与Python SDK,与开源生态无缝衔接。这一设计使R1 Lite成为"具身智能研究的标准平台"——Physical Intelligence、斯坦福大学等机构的采用验证了这一定位 [(jixin.tech)] 。
3.1.2.2 开发者友好的软件栈
R1 Lite配套完整的软件开发工具链:
| 组件 | 功能 | 技术特点 |
|---|---|---|
| ROS 2驱动 | 硬件抽象与通信 | 标准接口,社区兼容 |
| Python/C++ SDK | 高层应用开发 | 简洁API,示例丰富 |
| EDP平台集成 | 数据采集与模型训练 | 远程访问,云端协同 |
| 预训练模型 | 开箱即用能力 | G0/G0 Plus权重开放 |
| 仿真环境 | 算法验证与调试 | RSR生成场景,物理一致 |
*表16:R1 Lite软件栈组件*
开发者可通过EDP远程访问R1 Lite,进行数据采集、模型训练和算法部署,无需本地维护复杂的计算基础设施。这种"硬件即服务"的模式,降低了具身智能研究的准入门槛。
3.1.2.3 教育与研究场景的定位
R1 Lite的核心市场定位是教育与研究。全球高校与研究机构的人形机器人研究面临硬件获取的高门槛——自建平台耗时数年,采购昂贵设备(如PR2、Fetch)需数十万元。R1 Lite以显著更低的成本提供comparable的性能,使更多研究团队可进入具身智能领域。
这一市场的战略价值在于:培养未来的开发者与用户群体、获取学术合作与引用网络、通过研究反馈加速产品迭代。李飞飞团队对R1平台的使用与反馈 [(清华大学电子工程系)] ,是这一定位成功验证的典型案例。
| 3.2 灵巧手与末端执行器 |
3.2.1 高自由度仿生灵巧手设计
星海图自研的DEXO灵巧手是其硬件矩阵的重要组成。17自由度四指设计(拇指5自由度、其余三指各4自由度),接近人类手部的20+自由度,可实现捏、握、拧、拨等精细操作 [(acebridge.net)] 。驱动方案采用腱绳传动+微型伺服电机,将执行器集中于手掌以降低指尖惯量,提升动态响应。
2026年2月,星海图公布"一种仿生灵巧手"专利申请,技术细节显示:拇指机构具备旋转、侧摆、屈伸三自由度,手指机构采用三段式屈伸+侧摆设计,指尖配置力觉传感器实现闭环力控 [(sina.cn)] 。这一专利布局表明,星海图正将灵巧手从外购件转向自研核心部件,以提升差异化竞争力与成本控制能力。
3.2.2 力触觉融合感知
精细操作依赖力触觉的融合感知。DEXO指尖配置六维力/力矩传感器(量程10N,分辨率0.1N),实时反馈接触状态;手掌配置分布式触觉阵列(分辨率5mm,采样率1kHz),感知握持物体的形状与滑移。多模态感知数据融合输入EFM-1,使模型能够理解"抓得多紧""是否在滑动"等关键状态,动态调整控制策略。
3.2.3 与EFM-1的精细操作协同
灵巧手与EFM-1的协同体现了软硬件一体化的优势。同一EFM-1模型可驱动夹爪(2自由度)、Dexterous Hand(17自由度)等不同末端,仅需在后训练阶段针对新末端采集少量数据(约20次演示)即可完成迁移。这种"末端无关"的操作智能,是"一脑多形"理念在精细尺度上的延伸。
| 3.3 EDP数据平台(Embodied Data Platform) |
3.3.1 数据采集流水线
3.3.1.1 真机数据采集的自动化工具链
EDP平台的核心价值在于将真机数据采集从"手工艺术"转化为"可规模化的工程流程" [(世界机器人大会)] 。自动化工具链包括:
| 模块 | 功能 | 效率提升 |
|---|---|---|
| 任务脚本编辑器 | 可视化拖拽定义操作序列 | 编程门槛降低80% |
| 远程监控界面 | 实时查看多机采集状态 | 单人可监控5-10台机器人 |
| 异常自动检测 | 碰撞、超时、偏离轨迹等自动标记 | 人工审核工作量减少60% |
| 数据自动上传 | 可靠传输至云端存储 | 端到端延迟<5分钟 |
*表17:EDP自动化工具链组件*
单人可同时监控5-10台R1 Lite的采集作业,日有效数据产出达400-800条,较传统遥操作提升数倍 [(世界机器人大会)] 。
3.3.1.2 人类演示数据的高效标注
EDP采用"模型预标注+人工校验"的混合模式:EFM-1的预训练模型对采集数据进行初步解析(物体检测、动作分割、结果状态判断),标注员仅需修正错误与补充细节,效率提升3-5倍。对于需要精细标注的任务(如接触力曲线、物体形变),提供半自动标注工具(如关键帧插值、物理仿真拟合)进一步降低人工负担。
3.3.1.3 仿真数据的批量生成与管理
EDP与RSR引擎深度集成,支持从真实场景扫描快速构建仿真环境,并进行批量数据生成。用户可通过Web界面配置域随机化参数、指定数据规模与分布,系统自动调度仿真资源并行生成数据,并纳入统一的数据版本管理。
3.3.2 数据质量保障体系
| 环节 | 技术手段 | 目标指标 |
|---|---|---|
| 分布分析 | 可视化降维、统计检验 | 识别偏差,指导采集策略调整 |
| 偏差检测 | 与目标分布对比、异常值标记 | 覆盖率>95%,关键场景无遗漏 |
| 数据清洗 | 启发式规则、模型辅助、人工抽检 | 异常样本剔除率<3% |
| 质量验证 | 模型回环测试、任务成功率评估 | 入库数据成功率>90% |
| 版本控制 | 完整血缘追踪、实验可复现 | 100%实验可回溯 |
*表18:EDP数据质量保障体系*
| 3.4 量产与供应链挑战 |
3.4.1 核心零部件国产化替代
| 零部件类别 | 国产化进度 | 主要供应商 | 挑战 |
|---|---|---|---|
| 谐波减速器 | 75%+ | 绿的谐波、来福谐波 | 精度寿命vs进口差距 |
| 伺服电机 | 80%+ | 汇川技术、禾川科技 | 高功率密度需求 |
| 力矩传感器 | 60% | 宇立仪器、柯力传感 | 微型化与成本平衡 |
| 高精度编码器 | 40% | 奥普光电、禹衡光学 | 高端产品仍依赖进口 |
| 边缘计算平台 | 100% | Jetson Orin(英伟达) | 地缘政治风险 |
*表19:R1系列核心零部件国产化进度*
3.4.2 成本控制与规模效应
R1 Pro 32万元的定价 [(亿欧)] ,与宇树G1系列9.999万元的定价存在显著差距,限制了大众市场的渗透。成本优化策略包括:设计简化(去除非关键功能)、零部件标准化(提升采购规模效应)、制造工艺优化(降低组装工时)。据披露,随着产量提升,目标是在2-3年内将成本降低50%以上。
规模效应的关键节点:高继扬判断,当年产达到10万台以上时,硬件成本将不再有实质性差别 [(每经网)] ,届时竞争将聚焦于智能水平和由智能水平反向定义的硬件设计能力。这一规模门槛预计将在2027-2028年达到。
3.4.3 质量一致性保障
从原型到量产的质量一致性,是硬件创业公司的常见陷阱。星海图建立了覆盖供应链到出厂测试的全流程质量体系:供应商准入审核、来料检验、过程质量控制、整机老化测试、以及出厂前的功能验证。关键指标(如定位精度、重复精度)的统计过程控制(SPC),使质量波动能够被早期发现和纠正。
| 4. 商业模式与市场拓展 |
| 4.1 双轨市场策略 |
4.1.1 科研市场:开源生态与学术影响力
4.1.1.1 全球顶尖高校客户:斯坦福、清华、MIT等
| 机构类型 | 代表客户 | 合作深度 | 战略价值 |
|---|---|---|---|
| 国际顶尖高校 | 斯坦福李飞飞团队、MIT、伯克利 | 联合研究、论文发表、课程合作 | 技术验证、品牌背书、人才输送 |
| 国际头部创企 | Physical Intelligence、Skild AI | 平台采用、数据反馈、技术交流 | 生态影响力、标准制定 |
| 国内顶尖高校 | 清华、北大、浙大、哈工大 | 产学研合作、联合培养、项目共建 | 本土生态、政策资源 |
| 产业研发部门 | 华为2012实验室、比亚迪研究院 | 场景验证、技术采购、战略投资 | 商业转化、收入 diversification |
*表20:星海图科研市场客户网络*
4.1.1.2 开源模型与数据集的社区运营
开源策略的量化成效(截至2026年3月):
| 指标 | 数值 | 行业地位 |
|---|---|---|
| GOD数据集下载量 | 50万+ | 全球具身智能数据集第一 |
| G0模型下载量 | 10万+ | 国内首个开源VLA模型 |
| GitHub星标数(DP3) | 3200+ | 模仿学习领域领先 |
| 衍生学术论文 | 150+篇 | 广泛引用与基准对比 |
| 开发者社区成员 | 8000+ | 快速增长 |
*表21:星海图开源生态量化成效*
4.1.1.3 学术论文合作与引用网络
核心团队成员在ICRA、RSS、CoRL等顶级会议持续发表研究成果,累计发表论文60余篇 [(世界机器人大会)] 。这些论文将星海图的技术方案确立为领域基准——后续研究在对比实验时,往往以DP3、RSR、EFM-1作为性能参照。
4.1.2 产业市场:垂直场景解决方案
4.1.2.1 智能制造:汽车、电子、物流仓储
| 场景 | 典型任务 | 客户案例 | 关键指标 |
|---|---|---|---|
| 汽车总装 | 零部件搬运、螺丝拧紧、质量检测 | 比亚迪、北汽(千台级订单) [(pharmcube.com)] | 替代率80%,年节省成本15万/台 |
| 电子制造 | 精密装配、PCB插件、外观检测 | 华为、立讯精密(试点) | 精度±0.05mm,良率99.5% |
| 物流仓储 | 料箱分拣、托盘搬运、库存盘点 | 顺丰华南仓(效率提升40%) [(jgvogel.cn)] | 吞吐量300件/小时 |
*表22:星海图智能制造场景布局*
4.1.2.2 商业服务:零售、餐饮、医疗辅助
美团买药合作的人形机器人智慧药房解决方案 [(dfcfw.com)] 是代表性案例:24小时无人值守,完成取货、送货、补货、盘点等全流程工作。这类场景的关键成功因素包括:任务复杂度的合理控制、人机交互的友好设计、以及故障恢复机制的完善。
4.1.2.3 特种作业:巡检、安防、危险环境
特种作业场景对机器人有刚性需求(人类难以或危险进入),是技术成熟度的良好测试场。星海图的技术能力(RSR的三维重建、EFM-1的自主决策)与这些场景高度匹配,但具体部署信息尚未公开。
| 4.2 客户案例与验证 |
4.2.1 头部车企合作:比亚迪、北汽等
比亚迪千台级订单是星海图商业化能力的重要验证 [(pharmcube.com)] 。合作涵盖多个工厂的多条产线,R1机器人执行的任务从简单的物料搬运,逐步扩展到需要一定灵活性的零部件装配。合作过程中,星海图积累了大量工业环境下的真实数据,反哺了EFM-1模型的迭代优化。
4.2.2 物流自动化项目
顺丰华南仓试点中,R1机器人实现了特定SKU的自动分拣,准确率达99.2%,处理速度达到人工的70% [(jgvogel.cn)] 。虽然尚未实现全面人工替代,但在夜班、节假日等人力短缺时段,机器人作为弹性产能的价值已得到验证。
4.2.3 海外科研机构部署
海外科研机构的部署具有示范效应和信号价值。斯坦福李飞飞团队、Physical Intelligence等的采用,不仅带来直接收入,更重要的是形成了技术背书——当国内客户评估供应商时,"国际顶尖机构也在用"成为降低决策风险的关键依据。
| 4.3 竞争格局分析 |
4.3.1 国内竞品:智元机器人、宇树科技、星动纪元
| 维度 | 星海图 | 智元机器人 | 宇树科技 | 星动纪元 |
|---|---|---|---|---|
| **核心定位** | 具身大脑/一脑多形 | 人形机器人本体 | 四足/人形机器人本体 | 人形机器人本体 |
| **团队背景** | 清华+Waymo,算法驱动 | 华为+百度,工程驱动 | 上海交大,硬件驱动 | 清华,学术驱动 |
| **产品形态** | 轮式双臂R1系列 | 双足人形远征A1/A2 | Go2四足/H1人形 | 双足人形 |
| **技术亮点** | EFM-1/RSR/DP3 | 关节模组自研、快速迭代 | 运动控制、极致成本 | 强化学习行走 |
| **出货量级** | 数千台(2025) | 数千台(2025) | 6500+台(2025) [(i黑马)] | 数百台(2025) |
| **融资阶段** | B轮,估值百亿+ | A轮后,估值数十亿 | 未公开 | 天使轮 |
| **核心优势** | 算法深度、数据资产 | 工程速度、产业资源 | 成本控制、品牌声量 | 学术背景、技术前瞻性 |
| **主要短板** | 量产规模、品牌声量 | 算法深度、数据闭环 | 智能水平、场景落地 | 工程化能力、商业验证 |
*表23:国内具身智能创业公司核心维度对比*
星海图与智元机器人的对比尤为值得关注。两家公司均成立于2023年,团队背景均强调清华系与产业经验,但技术路线呈现显著分化:智元将资源集中于双足人形本体的运动控制,强调"像人一样行走"的技术炫示;星海图则优先构建跨本体的通用智能,以轮式平台快速验证场景价值 [(nfnews.com)] 。从商业化进度看,两家公司在2025年均实现了数千台出货量,但星海图的科研市场占比更高,智元则在产业客户拓展上更为激进。
4.3.2 国际对标:Figure AI、Physical Intelligence、Tesla Optimus
| 公司 | 核心产品 | 技术特点 | 融资规模 | 与星海图关系 |
|---|---|---|---|---|
| **Figure AI** | Figure 01人形机器人 | 端到端神经网络控制、OpenAI合作 | 6.75亿美元 | 直接竞争,技术路线相似 |
| **Physical Intelligence** | π-0/π-0.5 VLA模型 | 互联网规模预训练、纯软件路线 | 4亿美元 | **合作伙伴(采用R1平台)** [(jixin.tech)] |
| **Tesla Optimus** | 双足人形机器人 | 自动驾驶技术迁移、制造规模优势 | 内部研发 | 潜在威胁,进度不确定 |
| **Skild AI** | 通用机器人大脑 | 基础模型+技能库、斯坦福背景 | 3亿美元 | 直接竞争 |
*表24:国际具身智能公司核心维度对比*
Physical Intelligence(PI)与星海图的关系尤为特殊——PI使用R1 Lite作为π0.5模型的数据采集平台 [(jixin.tech)] ,这种"竞争对手也是客户"的局面在快速发展的新兴市场中并不罕见。PI的纯软件路线与星海图的"软硬一体"形成对比,双方的技术交流可能加速行业整体进步。
4.3.3 差异化优势:算法深度 vs 硬件集成度
星海图的核心竞争优势可概括为"算法深度×工程速度×数据资产"的三维组合:
- 算法深度:DP3、RSR、EFM-1构成了从动作生成、环境理解到系统整合的完整技术栈,且均有顶级学术论文支撑
- 工程速度:从2023年9月成立到2025年实现数千台出货、端到端算法整机闭环,迭代速度行业领先
- 数据资产:10万小时+真机数据集、50万+次开源下载、全球顶尖开发者90%+覆盖率
相对短板在于硬件量产经验与品牌声量。与宇树、智元等相比,星海图的市场曝光度较低,在消费级市场的认知度有限;在供应链管理与成本控制能力上,也需要随着规模扩大持续积累。
| 5. 投融资历程与估值分析 |
| 5.1 融资时间线与关键节点 |
| 时间 | 轮次 | 金额 | 领投方 | 关键里程碑 | 累计融资 |
|---|---|---|---|---|---|
| 2023年11月 | 天使轮 | 未披露 | 金沙江创投、IDG资本 | 公司成立,团队组建 | — |
| 2024年11月 | Pre-A轮 | 超2亿元 | 高瓴创投、蚂蚁集团 | EFM-1算法整机闭环验证 [(证券时报官方网站)] | ~2亿元 |
| 2025年4月 | A2/A3轮 | 超3亿元 | 凯辉基金、联想创投、海尔资本 | R1系列量产交付,数千台订单 [(maas.com.cn)] | ~7亿元 |
| 2025年7月 | A4/A5轮 | 超1亿美元 | 今日资本、美团龙珠、美团战投 | 开发者生态扩张,G0模型开源 [(ebrun.com)] | ~15亿元 |
| 2026年2月 | B轮 | 10亿元 | 金鼎资本、北汽产投、碧鸿投资等 | **估值破百亿,行业第四家独角兽** [(36氪)] | ~25亿元 |
*表25:星海图融资历程完整时间线*
5.1.1 2024年11月:Pre-A轮,超2亿元,高瓴创投、蚂蚁集团领投
Pre-A轮融资标志着星海图从种子阶段进入快速成长期。高瓴创投与蚂蚁集团的联合领投,兼具财务资本和战略资本的双重属性:高瓴的长期价值投资理念与具身智能的长周期特性匹配;蚂蚁集团的AI生态可能提供技术协同和场景资源。
5.1.2 2025年4月:A2/A3轮,超3亿元,凯辉基金、联想创投、海尔资本
A轮系列的延续融资,累计金额近7亿元,支撑了公司的快速扩张。凯辉基金的全球化网络、联想创投的算力资源、以及海尔资本的制造场景,构成了多元化的战略支持。
5.1.3 2025年7月:A4/A5轮,超1亿美元,今日资本、美团龙珠、美团战投
A4/A5轮的超1亿美元融资是重要节点,今日资本的快速决策极具标志性——创始人徐新在初次见面当天即决定领投,三个月内追加投资 [(北京市开发区网)] 。这一决策反映了顶级VC对"人"的极度重视:精英团队背景、技术判断力、以及执行能力,是早期科技投资的核心评估维度。美团系的双重投资(龙珠和战投)暗示了深度的场景协同可能。
5.1.4 2026年2月:B轮,10亿元,估值破百亿
B轮融资使星海图成为具身智能行业第四家估值破百亿的独角兽 [(36氪)] 。金鼎资本、北汽产投、碧鸿投资等产业资本的领投,明确了汽车制造场景的战略优先级。北汽产投和吉利系碧鸿投资的加入,直接对应汽车智能制造的机器人需求,为技术验证与场景拓展提供了协同机会。
| 5.2 投资方背景与战略意图 |
| 投资方类型 | 代表机构 | 核心资源 | 战略意图 |
|---|---|---|---|
| 财务资本 | 高瓴创投、今日资本、凯辉基金 | 长期资金、品牌背书、投后服务 | 捕捉具身智能赛道头部机会 |
| 产业资本(汽车) | 北汽产投、碧鸿投资(吉利系) | 汽车制造场景、供应链资源、车规认证 | 智能制造机器人落地 |
| 产业资本(本地生活) | 美团龙珠、美团战投 | 外卖配送、仓储物流、零售场景 | 末端配送与服务机器人 |
| 战略资本(科技) | 蚂蚁集团、联想创投 | AI技术、算力资源、云计算平台 | 生态布局与技术协同 |
| 产业资本(制造) | 海尔资本 | 智能制造场景、供应链管理 | 工业自动化解决方案 |
*表26:星海图投资方背景与战略意图*
| 5.3 估值逻辑与风险因素 |
5.3.1 技术溢价:核心团队学术背景与专利壁垒
| 溢价来源 | 具体体现 | 可验证性 |
|---|---|---|
| 团队背景 | 3位清华叉院助理教授、Waymo/Momenta经验 | 公开可查 |
| 学术影响力 | 60+篇顶会论文、7篇CoRL 2024录用 | 公开可查 |
| 技术标杆 | DP3成为领域基准方法、RSR全球首个Real2Sim2Real | 社区验证 |
| 专利布局 | 灵巧手、核心算法等专利申请 | 部分公开 |
| 开源生态 | 50万+下载、150+衍生论文 | 公开可查 |
*表27:星海图技术溢价的可验证来源*
5.3.2 数据资产:真机数据集的稀缺价值
数据资产的估值缺乏成熟方法论,但以下指标提供了参考:
| 指标 | 数值 | 行业对比 |
|---|---|---|
| 采集时长 | 10万小时+ | 行业平均:数千小时 |
| 任务覆盖 | 300+类型 | 开源数据集:通常<100 |
| 场景多样性 | 工业、家庭、商业、物流、餐饮五类 | 多数:实验室环境 |
| 成本效率 | 美国公司1/10 [(每经网)] | 显著领先 |
| 社区采用 | 50万+下载、90%+顶尖开发者覆盖 | 行业第一 |
*表28:星海图数据资产的核心指标*
5.3.3 商业化不确定性:从Demo到规模部署的鸿沟
估值的主要风险在于商业化不确定性:
| 风险维度 | 具体表现 | 缓解策略 |
|---|---|---|
| 技术成熟度 | 长尾场景处理能力待验证 | 持续数据积累、仿真增强 |
| 制造能力 | 量产规模与质量一致性 | 供应链建设、SPC体系 |
| 客户付费意愿 | 从试点到规模化采购 | 场景深耕、ROI量化 |
| 竞争加剧 | 巨头入场、价格战 | 技术壁垒、生态锁定 |
| 政策监管 | 安全标准、出口管制 | 积极参与标准制定、多元化市场 |
*表29:星海图商业化风险与缓解策略*
2026年作为"成果验证"年的表现 [(36氪)] ,将是估值能否支撑的关键测试。高继扬的审慎判断——"我们随时准备过冬" [(品玩)] ——体现了对周期波动的清醒认知。
| 6. 技术趋势研判与发展展望 |
| 6.1 具身智能技术演进方向 |
6.1.1 从模仿学习到强化学习的融合
当前星海图以模仿学习(DP3)为核心,但长期演进必然涉及与强化学习的融合:
| 阶段 | 技术组合 | 核心能力 | 应用场景 |
|---|---|---|---|
| 当前 | 模仿学习(DP3)为主 | 快速技能获取、安全性高 | 结构化任务、演示可得 |
| 近期 | 模仿学习+RLHF | 人类偏好对齐、边缘优化 | 服务场景、交互任务 |
| 中期 | 模型预测控制(MPC)+学习 | 长程规划、动态适应 | 物流、制造 |
| 远期 | 强化学习探索+模仿学习利用 | 超越人类、自主发现 | 开放环境、创新任务 |
*表30:模仿学习向强化学习融合的技术路线图*
6.1.2 世界模型(World Model)的引入
世界模型——能够预测环境动态的学习模型——是具身智能的长期目标。RSR引擎可以视为世界模型的雏形,但其当前能力局限于场景重建和静态预测。未来的演进方向包括:
- 动态物体行为预测:从观测学习物体的运动模式,预测未来轨迹
- 物理交互效果仿真:预测操作动作的物理后果(如推动、倾倒、破碎)
- 多智能体交互建模:理解并预测其他智能体(人类、机器人)的行为
这些能力的成熟将根本性改变机器人的规划和决策方式——从"感知-反应"进化为"预测-规划-执行"的完整闭环。
6.1.3 多机器人协作与群体智能
单机器人能力的扩展终将遇到物理限制,多机器人协作是规模化的必然路径。群体智能涉及:任务分配与协调、信息共享与融合、以及emergent的集体行为。星海图的"一脑多形"战略为多机器人场景提供了天然基础——同一智能核心可以部署在不同形态的本体上,形成异构协作系统。
| 6.2 星海图的技术路线图推测 |
6.2.1 EFM-2的可能架构:更大规模、更多模态、更长时序
| 演进维度 | 当前(EFM-1) | 预期(EFM-2) | 技术挑战 |
|---|---|---|---|
| 模型规模 | VLM百亿级/VLA十亿级 | VLM千亿级/VLA百亿级 | 算力需求、训练稳定性 |
| 模态融合 | 视觉+语言+动作 | +触觉+听觉+本体感觉 | 多模态对齐、传感器融合 |
| 时序推理 | 秒级规划 | 分钟级长程规划 | 记忆机制、因果推理 |
| 世界模型 | 静态场景重建 | 动态预测与仿真 | 物理一致性、计算效率 |
| 持续学习 | 定期重新训练 | 在线增量更新 | 灾难性遗忘、稳定性 |
*表31:EFM-2预期架构演进*
6.2.2 RSR引擎的实时化与轻量化
| 优化方向 | 当前状态 | 目标状态 | 关键技术 |
|---|---|---|---|
| 重建速度 | 秒级(离线) | 毫秒级(在线) | 神经渲染加速、边缘优化 |
| 模型大小 | GB级 | 100MB级 | 知识蒸馏、量化压缩 |
| 部署平台 | 服务器GPU | 嵌入式NPU | 架构搜索、算子优化 |
| 动态场景 | 追踪与检测 | 预测与规划 | 世界模型、因果推理 |
*表32:RSR引擎实时化与轻量化路线图*
6.2.3 人形机器人本体的潜在布局时机
高继扬对人形机器人布局时机的判断体现了技术务实主义:
"双足不是最优解,但可能是终局解。当智能水平足够高,能够充分利用双足的灵活性时,形态将不再是约束,而是表达。" [(nfnews.com)]
这一判断暗示了分阶段的形态演进策略:
| 阶段 | 时间窗口 | 核心形态 | 关键驱动 |
|---|---|---|---|
| 当前-2027 | 技术验证期 | 轮式双臂(R1系列) | 快速落地、数据积累 |
| 2027-2030 | 能力扩展期 | 轮式+可折叠腿部 | 复杂地形、场景扩展 |
| 2030+ | 形态融合期 | 双足人形(可选) | 智能水平、成本下降 |
*表33:星海图形态演进策略推测*
| 6.3 行业关键变量 |
6.3.1 数据飞轮效应的形成速度
数据飞轮——更多部署→更多数据→更好模型→更多部署——是具身智能竞争的核心。星海图的优势在于:
- 自有整机平台(R1系列)确保数据采集的可控性
- RSR引擎将数据扩展成本降低1000倍
- 开源生态加速社区数据贡献
关键变量在于产业客户部署的规模化速度,这将决定飞轮能否在竞争对手之前启动并加速。
6.3.2 算力成本与边缘推理效率
| 趋势 | 影响 | 星海图应对 |
|---|---|---|
| 云端算力成本下降 | 大模型训练门槛降低 | 持续扩大预训练规模 |
| 边缘算力密度提升 | 端侧部署能力增强 | Orin→下一代平台迁移 |
| 专用AI芯片成熟 | 能效比优化 | 探索定制芯片合作 |
| 模型压缩技术进步 | 小模型大能力 | 蒸馏、量化、架构优化 |
*表34:算力趋势与星海图应对策略*
6.3.3 政策监管与安全标准
具身智能的物理交互特性使其面临独特的安全监管挑战:
- 产品安全:机械安全、电气安全、功能安全(ISO 10218、ISO/TS 15066)
- 数据安全:采集数据的隐私保护、跨境传输限制
- 伦理责任:自主决策的归因、人机协作的安全边界
星海图的积极参与标准制定——通过学术影响力、产业联盟、政策咨询等渠道——是塑造有利监管环境的关键策略。
| 6.4 对从业者的启示 |
6.4.1 技术深度 vs 工程速度的权衡
星海图案例揭示了硬科技创业的核心张力:
| 策略选择 | 优势 | 风险 | 适用条件 |
|---|---|---|---|
| 技术深度优先(星海图路径) | 长期壁垒、生态锁定 | 短期落后、资金压力 | 技术迭代快、团队能力强 |
| 工程速度优先(智元路径) | 市场响应、收入验证 | 技术债务、同质化竞争 | 场景明确、资源充足 |
| 平衡策略 | 兼顾两者 | 资源分散、执行复杂 | 团队完整、资金充裕 |
*表35:技术深度与工程速度的权衡策略*
6.4.2 开源策略与商业闭环的平衡
星海图的开源实践提供了有价值的参考模式:
- 开源什么:早期模型版本、基准数据集、工具链(吸引开发者)
- 保留什么:最新模型权重、大规模数据集、垂直解决方案(商业变现)
- 何时开源:技术验证后、竞争格局稳定时、生态建设关键期(时机选择)
- 如何开源:学术合作优先、社区运营跟进、商业转化闭环(节奏控制)
6.4.3 学术背景在硬科技创业中的价值重构
星海图团队构成体现了学术背景在硬科技创业中的独特价值:
| 价值维度 | 具体体现 | 转化机制 |
|---|---|---|
| 技术判断力 | 识别真问题、避开伪需求 | 研究前沿洞察+产业经验验证 |
| 人才吸引力 | 顶尖学生、博士后加入 | 学术声誉+研究资源+职业前景 |
| 合作网络 | 国际顶尖机构认可与采用 | 论文发表+会议交流+联合项目 |
| 融资能力 | 顶级VC快速决策、高估值 | 技术可信度+团队完整性+愿景清晰度 |
| 品牌背书 | 媒体关注、客户信任 | 学术权威转化为商业信誉 |
*表36:学术背景在硬科技创业中的价值转化*
然而,学术背景也带来了特定的挑战与陷阱:
- 过度优化技术先进性,忽视商业可行性验证
- 追求论文发表,延误产品化时机
- 学术共同体思维,不适应市场竞争节奏
- 理想主义倾向,对困难和挫折准备不足
星海图的核心团队通过产业经验(Waymo、Momenta)的互补,在一定程度上缓解了这些挑战,但其长期能否保持"技术-商业"的动态平衡,仍需持续观察。
报告结语
星海图作为中国具身智能领域最具技术深度的创业公司,其"造大脑而非造身体"的战略选择、"一脑多形"的技术愿景、以及"精英小团队"的组织模式,构成了与行业主流显著差异化的竞争定位。EFM-1的快-慢双系统架构、RSR引擎的Real2Sim2Real能力、以及DP3的世界级模仿学习效率,共同构建了难以快速复制的技术护城河。
然而,从"技术领先"到"商业成功"的转化仍面临诸多挑战:量产规模的扩大、成本结构的优化、客户付费意愿的验证、以及数据飞轮的加速运转。2026年作为"成果验证"年的表现,将是判断其能否从"独角兽"进化为"行业领导者"的关键窗口。
对于具身智能从业者而言,星海图案例提供了关于技术路线选择、团队构建策略、开源商业模式、以及学术-产业转化的丰富启示。在快速演进的技术浪潮中,保持对本质问题的清醒认知、对长期价值的坚定追求、以及对执行细节的极致打磨,或许是穿越周期的关键。


