英伟达 NVIDIA
NASDAQ: NVDA
深度专题研究报告
半导体· 人工智能 · 算力基础设施 · 具身智能
2026年8月12日

核心摘要
英伟达的本质早已不是“卖芯片”,而是一台围绕 GPU 算力构建的“纵向一体化收费机器”:从 CUDA 软件底座、推理/训练工具链,到开源模型引流,再到物理 AI 与对外投资生态卡位,每一层都在为同一件事服务——把“免费模型”转化为“付费算力”,再转化为贯穿云、边、端与实体世界的全栈税。
本报告跳出单点产品视角,将英伟达的软件体系、模型矩阵、物理 AI 布局与对外投资动作放进同一个战略框架里解读,揭示其“软硬一体”背后的商业逻辑、生态控制力与潜在风险,并给出 A 股产业链映射。
数据来源:NVIDIA 官网、The Information、财联社、36氪、PitchBook/Dealroom | 报告日期:2026年8月12日
一、战略总览:软硬一体的纵向收费闭环
1.1 黄仁勋的“AI 三阶段”路线
黄仁勋将 AI 的演进划分为三个递进阶段:生成式 AI(Generative AI)、智能体 AI(Agentic AI)、物理 AI(Physical AI)。这一分类不仅是技术叙事,更对应着英伟达算力需求的三个增量来源:生成式 AI 拉动训练算力,智能体 AI 拉动推理算力,物理 AI 则把算力从“数字世界”推向“实体世界”,打开一个远大于云端的 TAM(可服务市场)。
1.2 商业本质:模型免费,算力收费
开源 Nemotron 是“算力需求发生器”:模型可以免费下载,但训练、微调、部署模型所需的 GPU、NVLink 网络、DGX 整机、CUDA 与企业软件逐层收费。
英伟达近年密集开源 Nemotron 系列,并非要做模型公司,而是用免费的开源模型降低 AI 开发门槛,吸引更多企业、政府和创业公司进入训练与部署环节,从而反哺其硬件与软件销售。这种“以软带硬、以模型带算力”的打法,本质上是把护城河从单点芯片延伸为一条全栈价值链。
层级 | 核心载体 | 商业模式 |
硬件底座 | GPU / CPU / NVLink / DGX / Jetson | 一次性硬件销售 + 系统溢价 |
软件工具链 | CUDA / TensorRT / NeMo / NIM | 生态锁定 + 企业软件订阅 |
开源模型 | Nemotron 系列 / Llama-Nemotron | 免费引流,零直接收入 |
云与整机服务 | DGX Cloud / 回租算力 | 经常性算力租赁收入 |
生态投资 | NVentures / 战略投资 | 绑定下游客户与需求 |
数据来源:NVIDIA 官网、财联社、36氪 | 报告日期:2026年8月12日
二、软件体系:CUDA 生态的纵深护城河
市场普遍关注英伟达的芯片,但真正难以被复制的,是其运行在每一颗 GPU 之上的软件栈。这套软件体系从底层并行计算一路延伸到上层智能体治理,构成了英伟达“软”的一面,也是其毛利率与客户粘性的核心来源。
2.1 底座:CUDA / CUDA-X
CUDA 自 2006 年推出以来持续迭代,2025 年 12 月发布的 CUDA Tile 编程模型被业界视为该平台二十年来最重大的更新,允许开发者以更高抽象层级(甚至 Python)编写 GPU 内核,显著降低了 GPU 编程门槛。CUDA-X 则是覆盖科学计算、深度学习、数据分析等领域的加速库集合,与 CUDA 共同构成生态的“地基”。
2.2 推理链:TensorRT / NIM / Triton / Dynamo
在推理侧,英伟达拥有从单卡优化到集群调度的完整工具链:TensorRT / TensorRT-LLM 负责模型推理优化,在 MLPerf 推理基准中横扫全部子项;NIM(推理微服务)提供开箱即用的容器化部署;Triton Inference Server 支持多框架、多模型的服务化推理;Dynamo 则定位为“AI 工厂的推理操作系统”,与 TensorRT-LLM 协同做分布式推理调度,显著压缩单位推理成本。
2.3 训练与数据:NeMo 全家桶
NVIDIA NeMo 是一套智能体优先的开放框架,覆盖数据准备(NeMo Curator)、合成数据生成(NeMo Data Designer / Safe Synthesizer)、数据匿名化(NeMo Anonymizer)到模型训练、定制与评估的端到端流程。2026 年 8 月新发的 NeMo Switchyard 则是开源模型路由库,可按任务自动将请求分配给最优模型,进一步强化了“多模型智能体”的编排能力。
2.4 安全与治理:NemoClaw
针对自主 AI 智能体(agent)的安全与隐私,英伟达推出 NemoClaw,通过隔离沙盒运行 AI 代理,提供策略化安全、网络与隐私护栏,补齐了自主智能体下方的“基础设施层”空白,标志着软件栈向智能体治理方向延伸。
软件栈层级 | 代表组件 | 核心作用 |
底层并行计算 | CUDA / CUDA-X | GPU 编程底座,生态地基 |
推理优化 | TensorRT / TensorRT-LLM | 模型推理加速,降本增效 |
推理服务 | NIM / Triton | 容器化部署与多模型服务 |
推理调度 | Dynamo | 分布式推理,AI 工厂操作系统 |
训练/数据 | NeMo 全家桶 | 端到端训练、数据、评估 |
模型路由 | NeMo Switchyard | 多模型智能体自动编排 |
智能体治理 | NemoClaw | 隔离沙盒,安全隐私护栏 |
数据来源:NVIDIA 官网(CUDA Tile,2025-12)、MLPerf 推理榜单、GTC 2026 发布会 | 报告日期:2026年8月12日
三、模型层:Nemotron 开源矩阵的引流逻辑
英伟达对开源模型的态度从“支持者”转向“构建者”。其 Nemotron 家族正从“合成数据工具”进化为“对标全球最强开源模型”的通用模型系列,战略意图明确:用免费模型把更多开发者锁进英伟达的软硬件生态。
3.1 在研旗舰:Nemotron 4(万亿参数)
据财联社 2026 年 8 月报道(源引自 The Information),英伟达正在研发新一代开源 AI 模型系列 Nemotron 4,最大版本参数规模预计至少 1 万亿,约为现役旗舰 Nemotron 3 Ultra 的两倍,目标是跻身全球最强开放模型之列。项目最终训练尚未完成,最早可能于当年秋末就绪。为支撑研发,英伟达组建了包括 Mistral、Cursor 等在内的“Nemotron 联盟”,并通过回租云服务器将多年期算力承诺增至 280 亿美元(约为一年前的三倍)。
3.2 现役矩阵:跨越三代的开源模型
英伟达的开源模型矩阵目前横跨三代,命名上需注意区分代际:2024 年 6 月发布的 Nemotron-4 340B 构成第一代合成数据流水线;2025 年 4 月发布的 Llama-Nemotron-Ultra-253B 与 2026 年 6 月发布的 Nemotron 3 Ultra 构成现役主力;2026 年 8 月新发的 Nemotron 3.5 Lightning 则专攻 AI 智能体长期运行场景。
具体而言,Nemotron 3.5 Lightning 采用混合专家(MoE)架构,总参约 300 亿、活跃参约 30 亿,专攻 AI 智能体长期运行场景,最高可实现约 4 倍 Token 吞吐提升。Nemotron-4 340B 由 Base、Instruct、Reward 三个模型构成合成数据生成流水线,以 98% 合成数据训练,面向医疗、金融、制造、零售等行业。Llama-Nemotron-Ultra-253B 则以约一半参数规模在多项基准上超越 DeepSeek-R1,主打高效推理。
模型 | 发布时间 | 参数量 | 定位 |
Nemotron 4(在研) | 预计2026年秋末 | ≥1万亿 | 对标全球最强开源模型 |
Nemotron 3.5 Lightning | 2026年8月 | 总300亿/活跃30亿(MoE) | AI智能体长期运行,约4倍吞吐 |
Nemotron 3 Ultra | 2026年6月 | 现役旗舰 | 美国最强开源权重模型 |
Llama-Nemotron-Ultra-253B | 2025年4月 | 2530亿 | 以约半参规模超越DeepSeek-R1 |
Nemotron-4 340B | 2024年6月 | 3400亿 | 合成数据生成流水线 |
数据来源:The Information(2026-08-11)、财联社、IT之家、钛媒体、NVIDIA 官网 | 报告日期:2026年8月12日
四、物理 AI 布局:具身智能的“具身 CUDA”
黄仁勋将物理 AI 定义为“下一波增长浪潮”,认为机器人、汽车和智能工厂将成为现实世界中的智能体。英伟达的策略并非亲自造机器人,而是复制 CUDA 的经典打法——搭建一套“具身 CUDA”生态,让所有机器人公司都依赖其底层软硬件。
4.1 四大基础工具栈
国泰海通研报将英伟达的物理 AI 体系归纳为四大工具栈,形成“模型—仿真—训练—端侧”的完整闭环:Cosmos 3 世界模型与 GR00T VLA 模型负责全局环境预测与人形动作规划;Omniverse 仿真引擎搭建高精度数字孪生;Isaac Sim/Lab 训练平台让机器人在虚拟空间海量试错;Jetson Thor 端侧芯片提供本地高算力低延迟推理。
4.2 关键产品里程碑
2026 年 5 月 31 日(台北 Computex 期间),英伟达发布全球首款完全开放的全模态物理 AI 模型 Cosmos 3(混合 Transformer 架构,打通视觉推理、世界生成、动作预测),并牵头成立全球开发者协作联盟;同日发布首款开放式人形机器人参考设计 Isaac GR00T(基于宇树科技 H2 Plus 底盘 + Jetson AGX Thor 计算平台)。此外,英伟达与 LG 集团共建“AI 工厂”,与阿里云在物理 AI 领域达成合作,将 Isaac Sim/Lab、Cosmos 等全套软件栈集成进阿里云 PAI。
工具栈 | 组件 | 角色 |
世界模型 / 动作规划 | Cosmos 3、GR00T VLA | 环境预测、空间物理因果理解 |
仿真引擎 | Omniverse | 高精度数字孪生,复刻真实场景 |
训练平台 | Isaac Sim / Isaac Lab | 虚拟空间海量试错,降低真机损耗 |
端侧芯片 | Jetson Thor | 本地实时推理,驱动运动控制 |
数据来源:国泰海通研报、NVIDIA 官网、财联社、阿里云 | 报告日期:2026年8月12日
五、对外投资:NVentures 的生态卡位
投资是英伟达软硬一体战略的“体外延伸”。通过企业风投基金 NVentures 与战略投资,英伟达一边绑定下游算力需求方,一边提前卡位具身智能、世界模型、合成数据等前沿方向,形成“投资—订单—生态”的正循环。
5.1 投资规模持续放大
据 PitchBook / Dealroom 数据,英伟达 2024 年参与了约 49 轮 AI 企业融资、累计投入约 10 亿美元(2023 年为 34 轮、约 8.72 亿美元);其 NVentures 基金交易数从 2022 年的 2 笔激增至 2024 年的 24 笔,投资节奏已与美国大型风投相当。
5.2 物理 AI 与前沿方向的重点落子
在物理 AI 方向,英伟达重仓具身智能与机器人:连续多轮投资 Figure AI(人形机器人,最新一轮融资估值约 400 亿美元)、领投 Dyna Robotics(具身操作机器人)、参投瑞士具身大脑公司 Flexion、投资数字孪生公司 MetAI。在模型与算力侧,则投资 OpenAI、xAI、SSI(Safe Superintelligence,2026 年 7 月获英伟达约 50 亿美元投资)、Mistral AI、CoreWeave、Inflection 等,并以 5000 万美元 PIPE 投资 AI 制药公司 Recursion,延伸至生命科学。
被投公司 | 方向 | 英伟达角色/金额 |
Figure AI | 人形机器人 | 多轮跟投,最新估值约400亿美元 |
Dyna Robotics | 具身操作机器人 | 参投1.2亿美元A轮 |
Flexion | 瑞士具身大脑 | NVentures参投5000万美元 |
MetAI | 数字孪生/物理AI | 台湾首投,400万美元种子轮 |
OpenAI / xAI | 大模型 | 各参投十亿美元级融资轮 |
SSI | 安全超智能 | 约50亿美元投资(2026年7月) |
CoreWeave | GPU云 | 战略投资,绑定算力需求 |
Recursion | AI制药 | 5000万美元PIPE |
数据来源:PitchBook、Dealroom、新浪财经、36氪、公司公告 | 报告日期:2026年8月12日
六、AMI / 具身智能实验室:从 GEAR 到全球科研布局
英伟达在“自主机器智能”(Autonomous Machine Intelligence)与具身智能研究上的实验室布局,是其物理 AI 战略的“源头活水”。实验室承担着基础模型、仿真技术与通用智能体的前沿攻关,并将成果沉淀为可商业化的平台产品。
6.1 GEAR 实验室:通用具身智能体研究
2024 年 2 月,英伟达成立通用具身智能体研究实验室 GEAR(Generalist Embodied Agent Research),由高级研究科学家 Jim Fan 与 Yuke Zhu 领衔,目标是构建能在虚拟与现实世界中学习行动的通用智能体,研究方向覆盖机器人基础模型、游戏基础模型与生成式模拟。此前团队已产出 Eureka、Voyager、MineDojo、VIMA 等具身智能项目,Jim Fan 称其为“全球最有钱的具身智能实验室之一”。
6.2 全球科研网络扩张
英伟达持续扩充具身智能的全球研发布局:据媒体报道,2026 年 5 月英伟达宣布在新加坡设立具身智能研发中心,聚焦 AI 与物理系统的融合,并致力于提升模型训练效率、降低基础设施成本,与上海、台北的既有研究团队形成协同。2025 年 3 月,英伟达在波士顿设立加速量子研究中心 NVAQC,联合哈佛、MIT 及 Quantinuum 等,探索量子计算与 AI 的融合。2026 年 6 月底,其机器人团队进一步围绕具身智能、仿真、部署、解决方案四大方向在北京、上海、深圳三地开放招聘。
6.3 实验室与商业的“研发—产品”闭环
实验室成果并非停留在论文层面,而是直接反哺平台:GEAR 团队的仿真 2.0 理念(超高速仿真 + 域随机化 + RoboCasa 场景生成)支撑了 Isaac Lab 的强化学习训练;世界模型研究沉淀为 Cosmos;基础模型攻关沉淀为 GR00T 系列。这种“研究实验室—平台产品—生态伙伴”的闭环,是英伟达物理 AI 壁垒可持续的关键。
实验室/中心 | 时间 | 定位与方向 |
GEAR 实验室 | 2024年2月 | 通用具身智能体、机器人/游戏基础模型 |
NVAQC(波士顿) | 2025年3月 | 加速量子计算,AI+量子融合 |
新加坡具身智能研发中心 | 2026年5月 | AI与物理系统融合、降本增效 |
中国三地机器人团队 | 2026年6月 | 具身智能、仿真、部署、解决方案 |
数据来源:量子位、36氪、中信证券研报、NVIDIA 官网、公开媒体报道 | 报告日期:2026年8月12日
七、战略本质与商业逻辑
7.1 从“卖产品”到“收全栈税”
英伟达软硬一体的最终形态,是在 AI 价值链的每一个环节都建立收费点:硬件销售(GPU/整机)、互联溢价(NVLink/CPO 硅光交换机)、软件订阅(CUDA-X/NIM 企业版)、算力租赁(DGX Cloud/回租)、以及通过投资锁定下游需求。开源模型与开放平台负责“做大蛋糕”,全栈软硬件负责“切蛋糕”。
7.2 生态锁定 vs 供应商锁定
值得关注的是,英伟达在机器人领域刻意强调“平台参与者”定位,声称保持“避免供应商锁定”的合作理念——这与它在 CUDA 上形成的强锁定形成微妙对比。其逻辑在于:CUDA 已足够强势,无需再强调锁定;而在新兴的机器人赛道,更需要以开放姿态快速做大生态,避免重蹈 GE Predix(通用电气工业互联网平台)因封闭而失败的覆辙。
7.3 财务与资本支撑
英伟达的宏大布局有真金白银支撑:为推进 Nemotron 4 与算力扩张,多年期算力承诺增至 280 亿美元;2026 年 6 月,英伟达发行 7 档、期限 2-30 年的公司债券,实际募资约 250 亿美元(原计划至少 200 亿美元),成为又一家“为自身催生的 AI 繁荣融资”的企业。充沛现金流与资本市场融资能力,是其持续加码物理 AI 与生态投资的底气。
战略本质:英伟达正把自己从“AI 时代的卖水人”升级为“AI 时代的基础设施运营商”,用开放模型与开放平台换取全栈算力与软件的长期需求。
数据来源:财联社、环球市场播报、美银分析师观点、36氪 | 报告日期:2026年8月12日
八、风险与 A 股产业链映射
8.1 风险因素
其一,地缘政治与出口管制风险。英伟达对华高端芯片出口持续受限,美国出口管制政策的变化直接冲击其数据中心业务的区域收入结构;2026 年 6 月债券发行期间,“中国出口前景”的疑问一度影响其融资定价,是其最具不确定性的现实风险。
其二,物理 AI 商业化节奏存在不确定性。美国银行分析师直言,英伟达需让产品“足够可靠、足够便宜、足够普及”才能形成可信商业模式,具身智能的规模化落地时点仍是变量。
其三,全球对生成式 AI 垄断行为的监管趋严,可能约束其通过投资绑定生态的激进程度。
其四,谷歌 TPU、Groq 专用推理芯片及 AMD 等在特定场景的突破,正逐步侵蚀其推理市场的绝对依赖。
其五,开源模型若被国产算力生态快速适配,可能削弱其“模型引流—GPU 付费”的转化效率。
8.2 A 股产业链映射
英伟达软硬一体与物理 AI 的持续加码,将沿算力硬件、网络互联、机器人零部件三条主线向 A 股传导:万亿参数模型与 AI 工厂拉动算力基础设施,利好光模块、PCB、液冷、服务器代工;CPO 硅光交换机趋势利好光通信;具身智能与 Isaac GR00T 生态利好机器人核心零部件与减速器/灵巧手产业链。
主线 | 受益方向 | 关注逻辑 |
算力硬件 | 光模块、PCB、液冷、服务器 | 万亿参数训练与推理算力扩张 |
网络互联 | 光通信、CPO/硅光 | CPO 交换机渗透率提升 |
机器人 | 减速器、灵巧手、域控、传感器 | 具身智能与 Isaac GR00T 生态 |
数据来源:路透(2026-06)、国泰海通、中信证券研报、东方财富 | 报告日期:2026年8月12日
九、结论
英伟达的软硬一体战略,本质是一场围绕“算力”的纵向一体化布局:以 CUDA 为底座、以推理/训练软件链为护城河、以开源 Nemotron 为引流入口、以物理 AI 与具身智能为下一增长极、以 NVentures 投资与全球实验室为生态触角。这条价值链的终点,是把 AI 时代的所有参与者都纳入同一张“算力税”网络。
对投资者而言,判断英伟达长期价值的核心,不在于单季 GPU 出货的波动,而在于两点:其一,CUDA 生态与物理 AI 平台能否持续形成“开放引流—全栈变现”的正循环;其二,物理 AI 的规模化落地能否如期兑现,成为继训练、推理之后第三条增长曲线。把握这两点,就把握了这轮 AI 基础设施长周期的真正主线。
本报告基于 NVIDIA 官网及公开媒体报道整理,仅供研究参考,不构成投资建议 | 报告日期:2026年8月12日


