推广 热搜: 采购方式  滤芯  带式称重给煤机  甲带  气动隔膜泵  减速机型号  无级变速机  链式给煤机  履带  减速机 

汽车行业深度报告:AI系列深度01期,从数字AI通用底座到物理AI真实世界闭环

   日期:2026-08-10 00:13:39     来源:网络整理    作者:本站编辑    评论:0    
汽车行业深度报告:AI系列深度01期,从数字AI通用底座到物理AI真实世界闭环
本文为节选内容,如需报告请联系客服或扫码获取更多报告1000份+报告)

1. 主线三问:怎么看 AI、数字 AI 如何崛起、物理 AI 如何落地 

AI 系列深度报告围绕三个递进的问题展开:怎么看 AI——理解 AI 需要哪些概念 工具?数字 AI 如何崛起——Transformer 为何成为通用底座模型?物理 AI 如何落地— —能力如何迁移到物理世界并形成真实闭环,增量将在哪里落地?对应三问,系列分为 开篇、数字 AI、物理 AI 三大部分。

开篇部分以十二篇概念科普铺设底座,从研究目标、表征机制、骨干架构到训练范 式,为全系列提供统一的概念坐标系。数字 AI 部分复盘两次爆发的驱动差异:第一次 爆发中 CNN、RNN 等专用架构分别攻克单点任务,第二次爆发中规模化学习使 Transformer 收敛为通用底座,语言、视觉、生成、多模态四大智能由分立走向统一。数 字 AI 与物理 AI 在表征、数据与学习范式上存在系统差异,能力迁移的边界由物理闭环 决定,构成两部分之间的衔接。物理 AI 部分以智能驾驶为主线,沿架构、表征、数据、 训练、部署五问研究真实世界闭环:VLA 完成从端到端到动作生成的范式升级,世界模 型承担表征训练与数据制造,强化学习从可选增强走向闭环关键,时延约束决定部署工 程。我们认为,物理 AI 有望由能力展示走向大规模落地,成为 AI 发展当前阶段最具成长弹性的方向。

2. 数字 AI:Transformer 为何成为通用底层模型 

AI 1.0 主要提升了单点任务的识别精度;Transformer 开启的 AI 2.0 则同时提升了 任务的广度、复杂度和链条长度。Transformer 已演进为能够统一学习知识、迁移任务和 执行复杂指令的通用基础模型,是目前通向 AGI 最重要、且得到最大规模工程验证的一 次跨越。

Transformer 是一种通用模型架构,是数字 AI 迈向大模型的核心技术底座之一; 物理 AI 则是在这一底座上,叠加对物理世界感知、预测和行动能力形成的系统。因此, 在当前发展阶段,数字 AI 与物理 AI 具有一定的技术同源性,Transformer 是其共同的 核心技术底座。

在 AI2.0 时代,Transformer 于数字 AI 场景首先落地,发展速度也快于物理 AI 场 景,考虑二者的技术同源性,我们认为通过对数字 AI 发展的复盘可以更好的理解和预 测物理 AI 的发展。

2.1. AI 第一次爆发:CNN 与 RNN 以专用架构分别攻克任务 

AI 第一次爆发是传统机器学习到深度学习的跨越。传统机器学习通常先由工程师 设计边缘、纹理、形状等特征再交由分类器识别;深度学习则直接从原始数据逐层学习 表示,底层捕捉边缘、中层学习部件、高层形成对完整物体的抽象刻画,即表示学习。

深度学习的成功并非单一变量驱动,而是大数据、强计算能力与可训练深层网络算 法三项条件同步成熟的结果。从技术演进看,反向传播(1974)、梯度消失与爆炸的系统 论证(1991)、LSTM 门控(1997)、无监督预训练(2006)、ReLU(2010)、Dropout(2014)、 注意力机制(2015)、ResNet 残差连接(2016)等成果具有较强跨架构适配性,共同构 成深度学习技术体系的公共底座;其中重要成果在 2010 年后密集出现。

2012 年,AlexNet 在 ImageNet 上将 ILSVRC 口径的 top-5 错误率由约 26%降至约 15%,成为深度学习在视觉任务上实现代际跃迁的标志性拐点,此后 CNN 快速确立其在图像识别、目标检测、图像分割与人脸识别等任务中的核心地位。该突破来自 GPU 并 行训练、ReLU 激活、Dropout 正则化与数据增强的协同,也是算法、算力与数据长期积 累后在 2012 年形成技术共振的结果。

以论文为锚,我们认为深度学习架构演进可划分为七个阶段,并归并为范式确立、 成长与扩展、成熟与高峰三大阶段。其分析价值在于给出一条判据:当某一架构的高引 用论文向成熟与高峰阶段(轻量化与部署、复兴性改进)集中、且新增高引用基础架构 论文减少时,通常意味着该架构进入短期学术瓶颈,一方面产品落地窗口开启,另一方 面需关注下一代架构。

CNN 高引用的基础架构与训练类论文集中在 2012—2016 年,2017 年后论文重心明 显向轻量化/部署与复兴/后继迁移、引用量整体回落,意味着 CNN 在 2016—2017 年前 后进入短期学术瓶颈:一方面走向成熟并推动人脸支付、安防、手机影像等应用密集落 地,另一方面 2017 年 Transformer 出现,提示下一代架构成为新的关注重点。

虽然 AI1.0 时代的技术出现了一定突破,但在产品落地方面仍有局限。我们认为, AI1.0 使其模型能力主要停留在“单点感知能力提升”,尚未形成通用智能系统所需的理 解、推理、交互和行动能力。因此,其输出通常需嵌入既有业务流程才能产生价值,难 以独立成为用户反复使用的交互入口,天然限制 0→1 新品类的创造。具体则表现为落 地场景过于垂直或附属于已有产品,例如安防中的识别场景或人脸识别支付场景。

2.2. AI 第二次爆发:从人工设计到规模化学习,Transformer 成为通用底座 

AI 第二次爆发的标志,是 Transformer 成为通用的数字任务底座;语言、视觉、生 成与多模态四个典型任务领域的技术路径革新各不相同,但在发展过程中均把 Transformer 作为其技术底座之一。

AI2.0 的本质,是能力来源由人工设计的强任务先验转向规模化学习。AI1.0 时代的 主流架构具有较强的归纳偏置,如 CNN、RNN;CNN 绑定局部性与平移等变的强空间 先验,RNN 绑定递归与时序依赖的强序列先验,二者样本效率较高但通用性与可扩展性 受限;Transformer 以“注意力+位置编码”承载较弱先验,更多依赖数据、算力与训练目 标形成能力,因而可并行、可充分利用大算力与大数据。

Transformer 成为数字 AI 通用底座,可归纳为三重机制。其一是表示与接口趋同: 文本天然可表示为 token 序列,代码、工具调用与软件状态能够被序列化,ViT 将图像 划分为 patch token,音频与视频经编码进入统一上下文,token 化与多模态表示使不同 模态具备共享模型接口的前提。其二是规模化训练与后训练叠加:自注意力允许序列位 置直接交互、缓解递归结构的串行计算与长距离依赖问题,自监督预训练与 Scaling Law 建立规模扩展框架,SFT、RLHF、DPO 提升可用性,RAG、工具调用与测试时计算将 能力增量延伸至运行时系统。其三是交互与任务收敛:自然语言逐步成为调用文本生成、 代码、知识问答、工具与多模态能力的统一入口。

结合核心论文,我们认为大模型演进框架可以总结为:一条核心发展主线搭配两条 并行优化支线。主线为模型能力升级重心持续向外转移,分为三个递进阶段;两条支线分别对应能力拓展广度、训练推理使用效率。该划分标准区分能力优化所处层级,分为 架构设计、预训练、规模扩张、对齐调优、推理增强、智能体系统等各类技术进展。

扩展规律(scaling law)回答的是“规模如何转化为能力”。这一规律伴随大模型发 展不断被修正与拓展,逐步形成覆盖训练、数据、对齐、推理与多模态的全链条框架。

大模型 Scaling 规律经历了从“规模扩展有效”到“资源配置优化”再到“推理阶段扩展” 的演进过程:早期研究验证模型性能随数据、参数和计算量增加呈幂律提升;GPT-3 时 期 Scaling Law 正式确立,证明大规模预训练可持续提升模型能力;随后研究由训练 Loss 转向下游能力表现,并探索模型涌现现象;Chinchilla 进一步提出计算最优 Scaling,强 调参数与 Token 的协同增长;随着数据资源约束增强,数据质量与训练流程成为新的优 化方向;近年来,Scaling 边界进一步拓展至推理时计算,通过强化学习和额外推理算力 提升复杂任务能力。

 
打赏
 
更多>同类资讯
0相关评论

推荐图文
推荐资讯
点击排行
网站首页  |  关于我们  |  联系方式  |  使用协议  |  版权隐私  |  网站地图  |  排名推广  |  广告服务  |  积分换礼  |  网站留言  |  RSS订阅  |  违规举报  |  皖ICP备20008329号-18
Powered By DESTOON