摘要:世界模型(World Model)是让AI理解、模拟并预测物理世界运行规律的基础模型,被视为继大语言模型(LLM)之后人工智能的下一个主战场,也是通往物理通用智能(Physical AGI)的核心引擎。2026年,世界模型成为资本与产业最瞩目的赛道:李飞飞创立的World Labs完成10亿美元融资、估值达50亿美元,图灵奖得主杨立昆创办的AMI Labs估值传闻达35亿美元,中国的极佳视界三个月融资35亿元成为国内首个世界模型百亿独角兽。世界模型通过为具身智能与自动驾驶提供”无限虚拟训练场”,正在破解物理AI最大的数据瓶颈。本报告从产业发展趋势、发展历程、企业成长、产业链聚集趋势与城市空间诉求五个维度展开系统研究,并对北京、上海、杭州及硅谷等产业聚集区的形成逻辑进行深度解读,为理解这一”教AI认识物理世界”的新兴产业提供决策参考。
一、产业界定与研究框架
1.1 产业界定:教AI认识物理世界
世界模型(World Model)是指能够学习环境动态规律、并在内部对”世界如何随行动演化”进行预测的AI模型。与大语言模型在文本符号空间中预测”下一个词”不同,世界模型在物理空间中预测”下一个状态”——它要求AI理解物体如何在三维空间中存在、移动并相互作用,从而支撑导航、决策与规划。李飞飞将这一能力称为”空间智能”(Spatial Intelligence):智能的本质不仅是预测下一个字,而是理解物理世界。从功能定位看,世界模型同时扮演三重角色:它是”可观看、可编辑的世界界面”(如World Labs的Marble),是”可反复试错的模拟器”(如谷歌DeepMind的Genie 3),也是”以状态与预测为核心的认知内核”(如杨立昆的JEPA路线)。
从产业边界看,世界模型产业涵盖:上游算力与数据基座(GPU/AI芯片、视频与3D语料、真实世界采集数据)、中游世界模型研发与平台(世界生成模型、世界行动模型、仿真合成数据引擎、3D重建与渲染工具链)、下游场景应用(具身智能训练、自动驾驶仿真、游戏与影视内容创作、VR/AR、工业数字孪生、建筑设计)。世界模型与传统视频生成模型的本质区别在于:Sora类视频模型预测的是”像素流动”,而世界模型构建的是”一致且持久、可交互、可行动”的物理世界表征——你可以绕到物体背后,它依然在那里。
1.2 研究框架
本报告沿”趋势—历程—企业—链条—空间”的逻辑主线展开:第二章研判产业发展趋势,回答”世界模型向何处去”;第三章梳理产业发展历程,回答”产业从何处来”;第四章分析产业企业成长情况,回答”谁在定义世界模型”;第五章解析产业链结构与聚集趋势,回答”产业如何组织”;第六章聚焦城市空间,描述主要产业聚集区并深度解读产业选址逻辑,回答”世界模型企业落在哪里、为什么落在那里”。报告数据主要来源于毕马威《2026跨越奇点:世界模型如何重塑具身智能产业与商业新范式》、彭博社、36氪、量子位等权威机构与媒体公开发布的信息,数据截至2026年7月。
二、产业发展趋势
2.1 赛道热度:从学术概念到资本最密集的新赛道
世界模型在2025—2026年完成了从学术概念到产业主赛道的跃升。毕马威研究显示,2025年全球具身智能融资额达111.7亿美元、同比增长152%,融资数量670笔;2026年一季度融资额达50.3亿美元、同比增长182.9%。其中,世界模型赛道融资狂飙:2026年上半年融资事件已达42笔,接近2025年全年水平;85%的已披露融资事件规模超千万美元,1亿美元以上事件达17笔,其中13笔发生在2026年上半年。资本”投早投小”特征显著——2026年一季度种子天使轮至C轮合计占当季总融资额的89.2%,部分企业早期轮次即获独角兽级定价。
头部公司的估值曲线直观反映了赛道热度:World Labs成立16个月估值冲至50亿美元,李飞飞最新一轮融资达10亿美元,英伟达、AMD、欧特克(单独出资2亿美元)等产业资本悉数入场;杨立昆创办的AMI Labs融资估值传闻达35亿美元;中国的极佳视界2026年3—6月连续完成Pre-B、B1、B2三轮融资、累计约35亿元,成为国内首个世界模型百亿独角兽,新一轮融资目标估值30亿美元;银河通用、星海图等具身”大脑派”企业B轮估值均达30亿美元。产业资本的深度介入——英伟达同时投资World Labs并自研Cosmos,欧特克以顾问身份深度绑定World Labs——标志着世界模型已从风险投资主题升级为产业战略布局。

具身智能融资与世界模型赛道融资
图1 全球具身智能融资额与世界模型赛道融资事件。数据来源:毕马威《2026跨越奇点》报告

世界模型赛道头部企业估值
图2 世界模型赛道头部企业估值/市值(2026年)。数据来源:彭博社、36氪及公开市场信息;群核科技为港股市值(约600亿港元),极佳视界为新一轮目标估值
2.2 技术趋势:从”生成像素”到”生成世界”,从训练工具到运行基础设施
世界模型的技术演进呈现五条清晰主线,毕马威将其概括为:从训练辅助工具走向运行基础设施、从内容生成走向状态演化与行动后果预测、从单模态生成走向全模态世界表征、从单一视频语料走向多源世界数据、从闭源模型竞争走向开源工具链与标准化接口。在生成能力维度,三大标杆产品定义了当前技术水位:谷歌DeepMind的Genie 3是首个支持实时交互的世界模型,用户输入文本即可以每秒24帧、720p分辨率实时生成可自由探索的动态世界,并保持数分钟的画面一致性;World Labs的Marble基于神经辐射场(NeRF)与3D高斯溅射(3DGS)技术,可从文本、图像、视频或粗略3D布局生成持久化、可编辑的3D世界,并直接导出至Unity、Unreal Engine等工业流程;英伟达Cosmos 3采用混合Transformer架构,集视觉推理、策略模型与世界模拟于一体,可生成描述机器人关节角度、夹爪位置与轨迹点的动作数据。
在架构路线维度,全球形成三大技术流派的竞争:显式生成路线(李飞飞/World Labs)追求可观看、可编辑的三维世界重建;交互模拟路线(谷歌Genie、英伟达Cosmos)追求可实时交互、可物理推演的虚拟环境;隐式认知路线(杨立昆AMI Labs/JEPA)在抽象潜在空间中预测世界演化,不还原每一个像素。三条路线分别对应世界模型的”界面层、模拟器层、认知层”,资本对不同路径的下注,本质上是对”AI究竟需要什么样的世界表征”这一根本问题的不同回答。同时,开源正在重塑竞争格局:群核科技SpatialLM、极佳视界GigaBrain-0、商汤开悟世界模型3.0相继开源,开源生态加速技术扩散并催生”空间大模型的DeepSeek时刻”。

谷歌Genie 3生成的可交互世界
图3 谷歌DeepMind Genie 3生成的多风格可交互动态世界(图片来源:凤凰网/爱范儿)
2.3 场景趋势:具身智能与自动驾驶双轮驱动,内容创作率先变现
世界模型的需求端呈现”具身智能与自动驾驶双轮驱动、内容创作率先变现”的格局。具身智能是世界模型最大的叙事市场:毕马威指出,世界模型是破解具身智能四大瓶颈(数据瓶颈、任务瓶颈、控制瓶颈、部署瓶颈)的关键——真实机器人数据采集成本高、场景覆盖窄,世界模型通过物理直觉构建为四大瓶颈提供系统性支撑,其六大工业化价值包括样本效率提升、长程规划推演、反事实安全验证、策略评估筛选、部署效率提升与跨场景泛化迁移。极佳视界的实践验证了这一逻辑:其具身基础模型GigaBrain-0的训练数据中90%以上来自自研世界模型平台生成,真机实采不足10%,在全球首次实现柔性长程复杂操作的开放世界”零样本”泛化。
自动驾驶是世界模型最早实现量产应用的场景:商汤”绝影开悟”世界模型基于一张A100 GPU每天生成的数据相当于500台量产车的采集能力,商汤绝影20%的训练数据已由世界模型生产,并发布业内最大生成式驾驶数据集WorldSim-Drive(超100万clips);蔚来世界模型NWM已实现全量推送,依托生成式仿真模型NSim构建闭环仿真测试体系;华为则以云端”世界引擎WE”+车端”世界行为模型WA”的WEWA架构推进。内容创作是当前商业化最成熟的方向:Marble以免费增值模式(付费套餐最高95美元/月)服务游戏开发、影视特效与VR/AR客户,极佳视界亦与多家影视、游戏头部客户签约5。此外,工业数字孪生(群核SpatialTwin)、建筑设计(欧特克与World Labs合作)等场景正在打开第二增长曲线。
2.4 全球格局:中美双极竞速,“美国定义范式、中国场景落地”
全球世界模型产业呈现中美双极引领的格局。美国以源头创新与范式定义见长:李飞飞(空间智能)、杨立昆(JEPA认知路线)两位AI教父级人物亲自下场创业,谷歌DeepMind以Genie系列持续迭代,英伟达以Cosmos构建”物理AI操作系统”并将世界模型纳入其芯片—仿真—机器人的全栈生态。美国的优势在于顶尖研究人才、充裕的早期资本与完整的AI基础设施。中国以场景落地与工程化能力见长:极佳视界GigaWorld-1在权威评测WorldArena中击败谷歌、英伟达登顶全球第一;商汤”绝影开悟”成为业内首个量产应用的世界模型;群核科技以全球最大空间设计平台的数据飞轮切入空间智能并在港股上市,市值一度突破600亿港元.
值得关注的是,世界模型正在成为中美AI竞争的新前沿,其竞争逻辑与大语言模型一脉相承却又有所不同:LLM竞争的主战场在”文本语料与算力”,世界模型竞争的主战场在”物理数据与场景”——谁拥有更丰富的真实世界交互数据(自动驾驶车队、机器人集群、3D场景库),谁就拥有训练更好世界模型的原料。这恰恰是中国企业的结构性优势所在:中国拥有全球最大规模的智能汽车队、最活跃的具身智能产业与最丰富的3D空间数据(群核科技即拥有超4.41亿个3D模型与5亿个结构化3D空间场景)。毕马威判断,行业正从技术突破转向大规模Scaling,冲刺具身智能的”GPT-3时刻”;极佳视界创始人黄冠则预测,“世界模型+VLA+强化学习”范式正在完备,2—3年内将迎来物理世界的”ChatGPT时刻”。
三、产业发展历程
3.1 演进阶段:从强化学习组件到物理AI基础设施
世界模型的概念源头可追溯至1990年代Schmidhuber关于”AI内部世界表征”的理论构想,其现代产业化历程大致经历四个阶段。第一阶段(2018—2021年):学术奠基期。2018年,David Ha与Schmidhuber发表《World Models》论文,首次系统展示智能体可在自学习的”梦境”环境中训练策略;此后DeepMind的Dreamer系列将基于模型的强化学习推向新高度,DreamerV3在Atari 100K基准上超越人类水平,验证了学习型环境模型的样本效率价值。这一阶段世界模型只是强化学习的一个组件,尚未进入主流视野。
第二阶段(2022—2023年):生成式AI点燃”可生成世界”的想象。扩散模型与视频生成技术的突破(Stable Diffusion、Sora前身工作)使”用神经网络生成逼真视觉世界”成为可能;DeepMind先后发布Genie 1与Genie 2,能为智能体生成全新环境。特斯拉在自动驾驶中提出”世界大模型”做法——将真实世界数据重建为虚拟环境,用于自动驾驶能力的学习与验证,成为世界模型产业化的先声20。第三阶段(2024—2025年):巨头入场与产品化元年。2024年李飞飞创立World Labs投身空间智能;2025年1月英伟达发布Cosmos世界基础模型平台,8月谷歌发布Genie 3实现实时交互,11月World Labs发布首款商用产品Marble;中国侧,2024年蔚来发布NWM成为国内首个车企世界模型,2025年商汤”绝影开悟”、群核SpatialLM、极佳GigaWorld相继亮相4。第四阶段(2026年至今):资本爆发与产业化竞速。世界模型赛道融资42笔接近2025全年,极佳视界、World Labs等头部公司估值指数级跃升,世界模型从训练辅助工具加速走向物理AI的运行基础设施。
3.2 技术范式:与具身智能政策共振的中国路径
世界模型在中国的发展与具身智能国家战略深度共振。2025年”具身智能”写入《政府工作报告》后,作为其数据引擎的世界模型获得政策间接加持;工信部与国资委联合印发的《人形机器人与具身智能实景实训专项行动》推动产业重心从”技术攻关”向”万台级规模化验证”转变,直接放大了对仿真训练与合成数据的需求3。地方层面,上海建设自动驾驶实训场(商汤绝影深度参与数据生成与仿真测试),北京、湖北等地建设具身智能数据训练场——2025年10月,湖北人形机器人创新中心与极佳视界签约,联合共建”世界模型为中心的虚实结合具身智能数据工厂”,成为世界模型进入公共产业基础设施的标志性事件。
表1 世界模型产业发展里程碑(2018—2026)
时间 | 里程碑事件 | 产业意义 |
2018 | Ha & Schmidhuber《World Models》论文 | 概念奠基:智能体可在”梦境”中训练 |
2022—2023 | 特斯拉提出自动驾驶”世界大模型”做法 | 产业化先声:重建+生成的仿真闭环 |
2024.4 | 李飞飞创立World Labs | 空间智能赛道确立 |
2024.7 | 蔚来发布NWM世界模型 | 中国首个车企世界模型 |
2025.1 | 英伟达发布Cosmos世界基础模型 | 物理AI全栈生态入场 |
2025.3 | 群核科技开源SpatialLM | 中国空间智能开源先锋 |
2025.7 | 商汤发布”绝影开悟”量产世界模型 | 业内首个量产应用 |
2025.8 | 谷歌发布Genie 3 | 首个实时交互世界模型 |
2025.11 | World Labs发布Marble | 首款商用空间智能产品 |
2026.2 | World Labs完成10亿美元融资 | 赛道进入资本爆发期 |
2026.3-6 | 极佳视界三个月融资35亿元 | 中国首个世界模型百亿独角兽 |
四、产业企业成长情况
4.1 国际阵营:教父下场与巨头全栈布局
国际世界模型阵营呈”两位教父+两家巨头”的格局。World Labs是赛道估值标杆:2024年由李飞飞联合NeRF开创者Ben Mildenhall等视觉领域顶级科学家创立,成立当月即获a16z、Radical Ventures投资、估值2亿美元,数月后NEA领投1亿美元跻身独角兽;2025年11月发布首款商用产品Marble——业内首款原生集成AI编辑器(Chisel)的世界模型,用户可先手动构建空间框架再由AI填充细节;2026年2月完成10亿美元新一轮融资,估值约50亿美元,资金将重点投向机器人与科学发现,公司正急招SLAM研究工程师与3D重建专家,向机器人应用深度倾斜5。AMI Labs由图灵奖得主杨立昆离开Meta后创立,坚持JEPA联合嵌入预测架构的隐式世界模型路线,融资估值传闻达35亿美元——两位教父分别押注”显式生成”与”隐式认知”,构成世界模型最引人注目的路线对赌。
巨头侧,英伟达以Cosmos构建物理AI的全栈闭环:Cosmos 3作为开放的全模态基础模型,支持视觉推理、世界行动模型(WAM)后训练与可控世界模拟,Agile Robots等企业已用其为策略开发生成动作条件机器人数据;英伟达GEAR团队正基于Cosmos 3开发视频动作模型,将世界模型深度嵌入其”芯片—Omniverse仿真—GR00T机器人”生态。谷歌DeepMind则沿”Genie(环境生成)+Veo(物理理解)+强化学习智能体”的路线推进,Genie 3的特殊记忆能力与实时交互使其成为训练通用智能体的理想虚拟操场。两条巨头路径的分野在于:英伟达把世界模型做成”卖给整个产业的工具链”,谷歌把世界模型做成”通向AGI的内部训练场”。

英伟达创始人黄仁勋发布物理AI战略
图4 黄仁勋在演讲中阐述物理AI与世界模型战略(图片来源:财联社)
4.2 中国阵营:四种成长范式的竞速
中国世界模型企业在两年内形成四种差异化成长范式。范式一:清华系技术原教旨主义——极佳视界。2023年6月由90后清华自动化系博士黄冠创立,依托清华大学自动化系智能视觉实验室,是国内首家系统布局世界模型的公司,成立之初即锚定”世界模型是语言模型之后下一个最重要的事情”。公司构建”世界生成—行动”双模型体系与数据—算法”双金字塔”,GigaWorld-1在WorldArena评测中登顶全球第一,GigaBrain-0.1获全球最大真机评测RoboChallenge总榜第一;商业化上,新一代驾驶模拟器服务超30家海内外主机厂,通用机器人Maker H01落地汽车、3C、仓储场景并冲刺千台交付,2026年4月携手一汽模具、阿里云落地国内首个汽车工业全流程具身智能解决方案;2026年3—6月连续完成约35亿元融资,新一轮目标估值30亿美元,并传出筹划港股IPO、冲击”世界模型第一股”。
范式二:数据飞轮驱动——群核科技。作为”杭州六小龙”之一,群核以酷家乐这一全球最大空间设计平台为基础,构建”空间编辑工具—空间数据—空间大模型”的飞轮:截至2025年6月拥有超4.41亿个3D模型与5亿个结构化3D空间场景,据此训练出空间语言模型SpatialLM(开源后登上HuggingFace趋势榜前三,与DeepSeek、通义千问同榜)与空间生成模型SpatialGen,并通过SpatialVerse合成数据引擎为机器人搭建”数字道场”;2026年在港交所上市,市值一度突破600亿港元,成为”全球空间智能第一股”。范式三:场景量产驱动——商汤绝影。”绝影开悟”是业内首个量产应用的世界模型,已打通与智己汽车的Cut-in、碰撞场景数据生成链路,深度参与上海自动驾驶实训场建设,并以”悟能”具身智能平台将世界模型能力延伸至机器人领域;2025年12月商汤旗下大晓机器人进一步开源开悟世界模型3.0,推出覆盖115个垂类具身场景的产品平台。范式四:车企垂直整合——蔚来、华为。蔚来NWM以”云端训练+车端推理”双架构实现全量推送,与自研神玑NX9031芯片、SkyOS操作系统构成技术闭环;华为WEWA以云端世界引擎+车端世界行为模型实现”AI驾校”模式,车端算力消耗降低75%。
表2 世界模型赛道代表企业成长对比(2026)
企业 | 总部 | 技术路线 | 2026年关键进展 | 资本化 |
World Labs | 旧金山 | 显式3D世界生成(NeRF+3DGS) | Marble商用;10亿美元新融资,重心转向机器人 | 估值约50亿美元 |
AMI Labs | 巴黎/纽约 | 隐式认知(JEPA) | 杨立昆创立,潜在投资方含凯辉创新 | 估值传闻约35亿美元 |
英伟达Cosmos | 圣克拉拉 | 全模态世界基础模型 | Cosmos 3发布,原生动作生成 | 内嵌于物理AI生态 |
极佳视界 | 北京 | 世界模型驱动物理AGI | 3个月融资35亿元;目标估值30亿美元,传筹划港股IPO | 国内首个世界模型百亿独角兽 |
群核科技 | 杭州 | 空间智能飞轮(SpatialLM/Gen) | 港股上市,市值一度破600亿港元 | “全球空间智能第一股” |
商汤(绝影/大晓) | 上海 | 量产世界模型+开源 | 开悟3.0开源;20%训练数据由世界模型生产 | 上市公司体内孵化 |
蔚来 | 上海 | 车端平行世界引擎NWM | NWM全量推送,“溶洞智驾”演示 | 车企垂直整合 |
4.3 竞争焦点:数据资产成为分水岭
世界模型企业的竞争正在收敛于一个核心变量:可控的物理数据资产。World Labs的底气来自创始团队在NeRF/3DGS领域的原创性积累;群核科技的护城河是14年设计软件沉淀的4.41亿3D模型;商汤的优势在自动驾驶真实车队与临港智算中心的算力储备;极佳视界的”双金字塔”数据体系(互联网视频、真人数据、世界模型模拟器、仿真合成数据、真机数据五层)则是对数据问题的系统化回答。与大语言模型时代”爬取互联网文本即可起步”不同,世界模型所需的物理交互数据天然稀缺且昂贵——这正是世界模型赛道呈现”高门槛、重资本、头部集中”特征的根源,也解释了为何产业资本(英伟达、欧特克、上汽、伊利)愿意以战略投资换取卡位。
五、产业链结构与聚集趋势
5.1 产业链全景:“数据—模型—仿真—场景”的价值闭环
世界模型产业链呈”上游数据与算力基座—中游模型与平台—下游场景应用”的三层结构,并以内生的数据闭环区别于其他AI产业。上游包括三类要素:算力(英伟达GPU及国产AI芯片,2025年上半年中国加速芯片市场本土品牌份额已达约35%)、数据(互联网视频、3D场景库、自动驾驶车队数据、机器人真机数据)、工具链(NeRF/3DGS重建、仿真引擎、标注与评测体系)。中游是产业价值中枢,包括世界生成模型(Marble、Genie、GigaWorld)、世界行动模型(Cosmos WAM、华为WA)、仿真合成数据引擎(SpatialVerse、NSim)与产品化平台(开悟具身智能平台、Marble API)。
下游场景应用呈梯度变现格局:内容创作(游戏、影视、VR/AR)率先付费,自动驾驶仿真次之(商汤一张A100日产量相当于500台量产车采集能力的成本优势已被验证),具身智能训练是最大远期市场,工业数字孪生与建筑设计提供稳定B端收入。产业链最具特色的环节是“数据飞轮”:模型生成合成数据—合成数据训练更好的策略模型—策略模型在真实场景部署产生新数据—新数据反哺世界模型,形成”现实—虚拟—现实”的闭环。群核科技将其表述为”现实世界成为数字道场的原料来源”,这一闭环能力正在成为中游平台的标配。从价值分配看,当前利润集中于上游算力(英伟达)与拥有稀缺数据资产的平台方,随着世界模型从”训练辅助工具”走向”运行基础设施”,中游模型的订阅、调用与数据服务收入占比将持续提升——毕马威判断,商业模式正从硬件交付走向能力运营,企业收入从一次性销售延伸到订阅、调用、运维和数据服务。

具身智能仿真训练
图5 仿真环境中的机器人集群训练——世界模型为具身智能提供”无限训练场”(图片来源:知乎)
5.2 聚集趋势:向”AI人才+场景数据+资本”三重高地集聚
世界模型产业的聚集逻辑介于软件与硬科技之间:不依赖土地与能源,但高度依赖复合型人才(计算机视觉+图形学+机器人学)、场景数据资产与耐心资本,因此呈现向少数创新高地高度集中的特征。全球版图形成”一超三强”:旧金山湾区(World Labs、英伟达、谷歌)是全球世界模型的创新策源地,斯坦福、伯克利的视觉与图形学人才构成源头供给;北京(极佳视界、智源研究院、银河通用、蔚来/理想/小米汽车的智驾团队)依托清华、中科院与自动驾驶产业基础,成为中国世界模型的技术高地;上海(商汤、蔚来NWM团队、上海自动驾驶实训场)以”AI龙头+汽车产业+实训基础设施”形成场景高地;杭州(群核科技、之江实验室)则以空间数据资产与数字经济生态形成特色一极。
微观层面呈现三个聚集新特征。其一是”高校实验室直连创业”:极佳视界依托清华自动化系智能视觉实验室,World Labs脱胎于斯坦福视觉实验室,智源、之江等新型研发机构成为人才蓄水池——世界模型是”论文密度最高”的产业之一,与学术前沿的距离直接决定技术水位。其二是”产业资本深度绑定”:英伟达投资World Labs并开放Cosmos生态,上汽金控、伊利健瓴资本参与极佳视界B轮,欧特克以2亿美元投资兼顾问身份绑定World Labs——场景方以资本换数据与模型能力的优先接入权。其三是”虚实结合的公共基础设施兴起”:湖北人形机器人创新中心与极佳视界共建”世界模型为中心的虚实结合具身智能数据工厂”,上海自动驾驶实训场引入商汤世界模型——世界模型正从企业私有能力变为区域共享的产业公地,这与具身智能训练场、词元经济的算力枢纽一脉相承。

极佳视界与湖北人形机器人创新中心共建虚实结合数据工厂
图6 极佳视界与湖北人形机器人创新中心签约共建”世界模型为中心的虚实结合具身智能数据工厂”(图片来源:湖北日报)
六、城市空间:产业聚集区与选址逻辑深度解读
6.1 北京:科研策源与自动驾驶产业共振的技术高地
北京是中国世界模型产业的技术策源地,其聚集逻辑是”科研密度×自动驾驶产业×资本密度”的三重共振。科研端,清华自动化系智能视觉实验室直接孵化了极佳视界,智源研究院在具身智能与世界模型方向持续布局,中科院自动化所提供人才溢出——世界模型所需的”视觉+图形学+机器人”复合人才在北京的密度全国最高。产业端,北京聚集了全国最密集的自动驾驶研发力量(百度Apollo、蔚来/理想/小米汽车智驾团队、地平线、毫末智行),为世界模型提供了最早也最真实的规模化应用场景;极佳视界的驾驶模拟器能服务超30家主机厂,与其身处车企决策半径之内密不可分。资本端,中金资本、国中资本、中芯聚源、上海半导体产投基金等国家队与产业资本在极佳视界三轮35亿元融资中集体入场,北京国管基金体系对硬科技的耐心资本供给全国领先。
空间载体上,北京世界模型企业主要聚集于海淀中关村科学城——极佳视界注册于北京,是中关村U30年度优胜者创业项目,其成长轨迹(奇绩创坛孵化→多轮融资→冲刺IPO)是中关村硬科技创业范式的典型样本。北京对世界模型产业的吸引力,本质上是”离论文最近、离车企客户最近、离国家队资本最近”的三重proximity,这使其成为中国世界模型的技术定价中心。
6.2 上海:汽车产业与实训基础设施定义的场景高地
上海的世界模型产业聚集遵循”AI龙头×汽车产业×公共实训设施”的场景逻辑。企业端,商汤科技总部与商汤绝影位于上海,“绝影开悟”世界模型的量产落地直接依托上海的汽车产业生态——与上汽智己合作打通数据生成链路,上海聚集了全国最完整的智能电动车产业链(特斯拉超级工厂、上汽、蔚来),为驾驶世界模型提供了不可复制的客户密度。基础设施端,2025年7月上海自动驾驶实训场建设成果发布,商汤绝影以行业领先的数据生成和仿真测试能力深度参与——这类由政府主导、企业共建的实训场,本质上是把”世界模型能力”沉淀为城市级产业公共品。
人才与算力端,上海拥有全国三分之一的人工智能人才,商汤临港智算中心(AIDC)提供世界模型训练所需的大规模算力储备;徐汇模速空间的大模型生态则为世界模型创业提供了”上下楼即上下游”的协作环境。上海模式的独特性在于”以场景定义技术”:世界模型在这里不是实验室里的Demo,而是直接嵌入汽车数据工厂、实训场与具身智能平台的生产工具——商汤绝影20%训练数据由世界模型生产,这一数字背后是”场景先行”的上海路径。
6.3 杭州:数据资产与数字经济生态孕育的空间智能一极
杭州以群核科技为链主,形成世界模型产业的特色一极,其逻辑是”数据资产×设计软件生态×数字经济外溢”。群核科技扎根杭州14年,从酷家乐设计软件起步,沉淀了全球最大的3D空间数据资产(4.41亿3D模型、5亿结构化场景),这一数据飞轮是任何纯技术团队无法速成的护城河;公司CTO坦言”是杭州成就了我们”——杭州的数字经济生态、阿里系技术外溢与低成本高素质的工程人才供给,支撑了其从设计软件到空间智能的转型。杭州同时是”杭州六小龙”现象的发生地:DeepSeek的大模型能力、宇树科技的具身本体与群核的空间智能在同一城市形成”大脑—身体—世界”的奇妙互补,SpatialLM与DeepSeek、通义千问共同登上HuggingFace趋势榜前三,“来自杭州的三个大模型”成为中国AI开源力量的标志性图景。

群核科技创始团队
图7 群核科技创始团队——从酷家乐到空间智能的14年数据飞轮(图片来源:潮新闻)
6.4 旧金山湾区:范式定义与顶级资本的全球策源地
全球视野下,旧金山湾区是世界模型无可争议的策源地。World Labs诞生于斯坦福视觉实验室的人才网络——创始团队汇聚NeRF开创者Ben Mildenhall、李飞飞学生Justin Johnson等图形学与视觉领域最强大脑,华人面孔约占创始团队三分之一;a16z、NEA、Radical Ventures等顶级风投在公司尚无产品、无收入时即给出2亿美元估值,展现了硅谷对”范式级技术”的定价能力;英伟达、AMD、欧特克的产业资本与富达、Emerson Collective等长线资金的组合,则为重投入、长周期的世界模型研发提供了完整的资本光谱。湾区的优势不仅是人才与资本,更是”AI叙事的定义权”——从李飞飞”空间智能”到黄仁勋”物理AI”,全球世界模型的概念框架均在此提出,再向全球扩散。
6.5 产业为什么选择这些区域:世界模型选址的五维解构
综合各聚集区的比较,世界模型产业的区位选择遵循五个维度的逻辑。维度一:学术前沿距离。世界模型是”论文密度最高”的AI产业,NeRF、3DGS、扩散模型、JEPA等底层技术均出自顶级实验室,企业必须扎根学术网络才能保持技术水位——斯坦福之于World Labs、清华之于极佳视界是最直接的证明2722。维度二:场景数据资产。世界模型的竞争收敛于可控物理数据,拥有车队(上海车企)、3D场景库(杭州群核)、机器人集群(具身智能城市)的地方天然吸引模型企业。维度三:复合人才密度。”视觉+图形学+机器人”的复合人才全球稀缺,仅在北京、湾区、上海等少数节点形成临界规模。维度四:耐心资本供给。世界模型研发投入大、商业化周期长,需要能接受”16个月无收入估值涨25倍”的资本文化——湾区风投与北上国家队基金分别提供了两种版本。维度五:公共实训基础设施。自动驾驶实训场、具身智能数据工厂等”虚实结合”的公共平台正在成为城市吸引世界模型企业的新筹码——谁能把城市变成”可计算的世界”,谁就能赢得这个教AI认识世界的产业。
表3 世界模型产业主要聚集区比较
维度 | 旧金山湾区 | 北京 | 上海 | 杭州 |
集群定位 | 全球范式策源地 | 技术高地、定价中心 | 场景高地、量产中心 | 数据资产特色一极 |
代表主体 | World Labs、英伟达、谷歌 | 极佳视界、智源、银河通用 | 商汤绝影、蔚来NWM、自动驾驶实训场 | 群核科技、之江实验室 |
核心优势 | 顶尖学术+顶级资本+叙事定义权 | 科研密度+车企客户+国家队资本 | 汽车产业链+实训设施+AI人才 | 3D数据飞轮+数字经济生态 |
标志性事件 | World Labs 10亿美元融资 | 极佳视界3个月融资35亿元 | 上海自动驾驶实训场发布 | 群核港股上市 |
空间形态 | 斯坦福周边研发社区 | 中关村科学城 | 临港智算中心+徐汇模速空间 | 未来科技城/之江板块 |
6.6 产业对城市空间的诉求:“算力园区+实训场地+创新社区”的三层结构
世界模型产业对城市空间的需求呈现三层结构。算力层需要大规模智算园区:世界模型训练的视频与3D数据吞吐远超文本,对GPU集群规模与显存带宽要求极高,企业倾向在智算中心周边布局研发(商汤之于临港AIDC)。实训层需要”虚实结合”的特色空间:自动驾驶世界模型需要封闭测试场与开放道路路权,具身智能世界模型需要数据采集工厂与真实场景试验场——上海自动驾驶实训场、光谷虚实结合数据工厂代表了这类新型空间供给,城市的路权开放度与场景丰富度直接转化为产业吸引力。社区层需要高密度学术交流的创新社区:世界模型迭代依赖与学术前沿的高频互动,靠近高校、拥有活跃技术社群的城区(中关村、五道口、徐汇滨江)更受研发团队青睐。对城市规划者而言,吸引世界模型产业的空间策略可归纳为:“算力做底座”——配套智算中心与绿色算力指标;“场景做筹码”——开放道路、工厂、实训场等真实世界数据场景;“社区做生态”——在高校周边培育学术—创业转化社区。世界模型产业竞争到最后,比的是哪座城市能为AI提供最丰富、最可计算的”世界”。
七、挑战与展望
7.1 核心挑战
世界模型产业在爆发式发展的同时,面临四重挑战。一是物理一致性与长时序可靠性瓶颈:当前世界模型在分钟级以上的长时序推演中仍存在误差累积——一次不准确的动作预测后,真实环境状态已经偏离,后续预测持续放大误差,“虚实迁移可靠性”成为工程化落地的最大障碍3。二是数据与算力的双重高门槛:物理交互数据天然稀缺昂贵,世界模型训练的视频数据吞吐对算力需求巨大,行业呈”高门槛、重资产”特征,79%的企业已开展具身智能探索但仅11%实现规模化部署。三是商业化节奏的不确定性:除内容创作与自动驾驶仿真外,多数世界模型公司的收入仍处早期,World Labs仅41名员工、群核科技2024年前三季度经调整净亏损9361万元,50亿美元估值与百亿人民币估值能否被真实收入承接,需要时间检验。四是技术路线的未收敛风险:显式生成、交互模拟与隐式认知三条路线并行,若杨立昆的隐式路线最终胜出,重注显式3D生成的公司与资本将面临路线切换的沉没成本。
7.2 展望:物理AI的”GPT-3时刻”
综合各方判断,未来五年世界模型产业将沿三条主线演进。技术主线:世界模型将从”训练辅助工具”进化为”物理AI的运行基础设施”——从内容生成走向状态演化与行动后果预测,从单模态走向全模态世界表征;极佳视界预测”世界模型+VLA+强化学习”范式将在2—3年内迎来物理世界的”ChatGPT时刻”——在100种常见任务中、90%场景下达到95%成功率,并带来超出语言模型10—100倍的应用爆发。产业主线:商业模式从一次性交付走向”能力运营”(订阅、调用、运维、数据服务),世界模型平台有望成为机器人时代的”操作系统层”;毕马威预测2030年具身智能全球市场规模将超1.2万亿美元,作为其数据引擎的世界模型将分享这一增量3。空间主线:北京、上海、杭州与湾区的多极格局将持续深化,“虚实结合”的公共数据工厂与实训场成为城市竞争的标配基础设施,世界模型产业将从企业私有技术演变为区域共享的产业公地。
对城市而言,世界模型提供了一次把”真实世界”本身变成产业资产的机遇:道路、工厂、楼宇、家庭,这些物理空间经过世界模型的重建与生成,就能成为训练下一代AI的”数字道场”。对产业而言,当AI真正理解了我们身处的三维世界——它的物理规律、它的因果链条、它的无限可能——人工智能才算从”读万卷书”走向”行万里路”。世界模型,正是这段旅程的起点。

World Labs空间智能愿景
图8 World Labs空间智能(Spatial Intelligence)产品愿景(图片来源:CB科技站)