推广 热搜: 采购方式  滤芯  带式称重给煤机  甲带  气动隔膜泵  减速机型号  无级变速机  链式给煤机  履带  减速机 

国内首份数据工厂白皮书来了

   日期:2026-07-21 07:43:46     来源:网络整理    作者:本站编辑    评论:0    
国内首份数据工厂白皮书来了
7月16日,“数据工厂研讨暨《数据工厂白皮书》发布会”在北京交通大学举行,会上,北京交通大学、华为与部分编制单位代表共同发布了《数据工厂白皮书》,这也是国内首份数据工厂白皮书。
7月16日,“数据工厂研讨暨《数据工厂白皮书》发布会”在北京交通大学举行,来自全国各地数据集团、中央企业、科技企业、高等院校、其他机构的100多位代表参加了会议。
会上,北京交通大学、华为与部分编制单位代表共同发布了《数据工厂白皮书》,国家数据专家咨询委员会委员、全国数据标准化技术委员会数据基础设施工作组组长、北京交通大学教授张向宏对白皮书进行了解读,华为、北京数交所、贵州大数据集团、崖州国家实验室、呼和浩特互联网协会等代表进行了实践分享。
主编解读

《数据工厂白皮书》主编张向宏近期接受了专访,分别从为什么、是什么、做什么、怎么做等进行了交流。

问题一:为什么要发展数据工厂这种新业态?

我想从以下五方面阐述一下发展数据工厂新业态的必要性和紧迫性:

一是人工智能普及应用遇到了“数据墙”。

据《全国数据资源调查报告(2025年)》,2025年全国人工智能应用量接近200EB,而推理数据量达到101EB,超过了训练数据量的99EB,表明人工智能正发生从训练学习到推理应用的转变“拐点”,词元调用量的迅猛增长、人工智能数据生产方式、智能体成为HTML网页的主要操作者、以及全行业数据开发率和人工智能应用率大幅提升等更多数据都指向了一个共同的事实——人工智能发展已到了奇点时刻。然而,人工智能大模型的应用现在还处于非常初级的发展阶段,通用大模型除在文书和编程两个领域开始规模应用外,多数大模型的应用还停留在作诗、作画、跳舞、跑步等浅层面的“娱乐”阶段,距离个人工作学习、企业生产经营、政府管理服务等日常活动还差之甚远。其中,一个根本问题是——人工智能普及应用遇到了“数据墙”。

二是面向人工智能的数智产业链已经形成。

面向人工智能的数智产业链由四阶段组成。上游包括通识高质量数据集和通用大模型。中上游包括行业通识高质量数据集和行业大模型。中下游包括行业专识高质量数据集和智能体。下游则是智能体在各行各业的应用。

三是智能体正成为人工智能落地的应用载体。

如果将人工智能的发展与人的成长相比较的话,上游通识高质量数据集相当于中小学的通识教材,通用大模型相当于通识教育阶段的中学生,还不能胜任各行各业的专业工作。中上游的行业高质量通识数据集相当于大学的专业教材,由此训练出的行业大模型类似于本科生,已具备一定专业技能,但还不能胜任具体的专业工作。中下游的行业高质量专识数据集相当于研究生的专业教材,由此训练出的智能体相当于硕士或博士,可以承担各种专业工作。

四是行业高质量数据集供给匮乏制约了AI应用。

当前,人工智能发展还处在上游通用大模型阶段,而人工智能的生命力在于其在千行百业的广泛应用,中间还需要走过构建行业高质量通识数据集并建设行业大模型的中上游阶段,以及构建行业高质量专识数据集并建设智能体的中下游阶段。不同于通识高质量数据集由互联网上可流通的公域数据加工处理而来,行业高质量数据集是由行业企业私域数据加工处理形成的,私域数据的高安全和低流通特性,决定了大模型企业难以获得数据,数据源机构缺乏数据加工能力,造成行业高质量通识数据集和行业高质量专识数据集的供给严重不足,直接影响了行业大模型和智能体的形成和智商水平,制约了人工智能在千行百业的落地应用。

五是高质量数据集的作坊式生产方式效率低下。

行业高质量数据集匮乏的另一个核心原因在于生产方式效率低下。当前,高质量数据集生产还处于作坊式生产阶段,类似于农业社会谁要喝水谁家打井,谁要做饭自己劈柴一样,现在谁要训练大模型,谁就自己去构建高质量数据集,一方面不易获取各行业的私域数据,另一方面各家反复重复造轮子,生产效率低下,标准不统一,高质量数据集供给规模受到极大限制。急需创新一种生产新业态,规模化、体系化、设施化地生产高质量数据集。

问题二:数据工厂到底是什么?由哪些部分组成?

数据工厂是面向人工智能应用的高质量数据集规模化生产设施,是国家数据基础设施的基本单元。用一句话来描述数据工厂,那就是“批量原始数据进—规模化高质量数据出”,即数据工厂最根本的功能,就是将海量的原始数据加工成供人工智能使用的高质量数据集。

数据工厂有广义和狭义两层含义。

广义来看,应将数据资源采集汇聚、高质量数据集加工生产、人工智能训练应用等,置于国家层面统筹部署国家数据基座、国家数据工厂和国家人工智能训练场。

狭义来看,一个区域、一个行业和一个企业的数据工厂包括储备车间、生产车间和中试车间三部分。其中,储备车间定位于数据原料“供应基地”,包括“三中心、五模块、多方法”体系;生产车间定位于高质量数据集“流水线”,包括“两中心、六模块、多工具”体系;中试车间定位于高质量数据集“靶场”,构建“模型评估、数据集维护和更新”体系。

当前,崖州湾国家实验室“繁|未来农业智能枢纽”超级数据工厂、贵州主枢纽存力中心暨数据要素保障基地、库帕思“语料超级工厂”、京津冀数据要素产业园人工智能数据工厂、广东省先进存力中心等已经开始探索实践,并形成了有效的成果和经验。

问题三:数据工厂应该如何建设?如何运营?如何部署?

数据工厂是数智社会的一种新型生产业态,在理论、政策、实践等各方面都处于初级探索阶段,其建设模式、运营机身和部署策略已初步形成并处于快速迭代变化中。

在建设模式方面,数据工厂有数据标注企业迭代、数据存储基地升级、人工智能企业延伸和技术企业创新创立等四种建设模式。在运营机制方面,数据工厂已形成保障模式、定制模式、结对子模式、电商模式等四种运营机制。在部署策略方面,数据工厂应与国家数据基础设施协同部署,在国家基础设施底座应部署通识数据集的数据工厂,在重要功能设施应部署行业通识数据集数据工厂,在各业务节点应部署行业专识数据集数据工厂等三种部署策略。

问题四:从国家、地方和企业的角度,数据工厂应该分别怎么做?

数据工厂新业态的不断发展壮大和成熟完善,需要国家、地方、行业、企业等各方协同发力,共同推动。

从国家层面来看,应从政策、标准、技术、平台四方面提供鼓励发展的宽松环境,要加快出台《关于促进数据工厂新业态创新发展的指导意见》,尽快启动数据工厂相关标准研制,抓紧突破数据工厂关键技术瓶颈,持续加强数据工厂支撑平台建设。

从地方和行业层面来看,应从场景选择、模型、数据等三方面,打造行业(区域)应用场景,建设行业(区域)模型工厂,建设行业(区域)数据工厂,形成“数据提升模型、模型驱动场景、场景产生数据”的“数据—模型—场景”的行业(区域)飞轮效应。

从企业层面来看,应从场景选择、智能体、数据等三方面,打造企业人财物产供销各类应用场景,构建企业、业务、流程等各环节的智能体,建设企业数据工厂,形成“数据提升智能体、智能体驱动场景、场景产生数据”的“数据—智能体—场景”的企业飞轮效应。

《数据工厂白皮书》
01
核心观点
2025年是人工智能从“训练”走向“应用”的起点。2025年国内AI推理数据量达101.34EB,首次超越98.14EB的训练数据量,标志着人工智能已正式跨过学习阶段、步入规模化应用阶段。AI越强大,数据要素化就越紧迫、越根本。数据已超过算力和算法成为人工智能发展的第一关键要素,数据驱动成为人工智能四大特征的第一显著特征。
高质量数据集的规模和质量不仅直接影响人工智能大模型的“智商”水平,更是人工智能在千行百业广泛应用的关键“瓶颈”,已成为企业的核心竞争力和真正的“护城河”。高质量数据集匮乏的深层原因在于生产方式滞后。当前,大部分高质量数据集的生产仍处于“作坊式”阶段。如何实现高质量数据集的规模化、标准化、设施化生产,已成为制约人工智能技术水平进一步提升和深度落地产业场景的关键瓶颈,已成为决定人工智能应用普及程度的核心。
正如工业社会的水有水厂、电有电厂一样,数智社会也必须有数据工厂。数据工厂是面向人工智能大模型应用,开展高质量数据集规模化、体系化、设施化生产的一种基本业态,是国家数据基础设施的基本构成单元,是高质量数据集规模化生产设施,是突破人工智能发展瓶颈的有效手段,是数据全生命周期的综合产业形态。各地各行业建设的存力中心、模数空间、语料超级工厂等模式正加速向数据工厂演进,并在供给、生产、应用等环节形成了可资借鉴的成熟经验。
数据工厂可以用“335443”框架来表示,具体内容详见下表。
数字
含义
具体内容
第一个3

三项组成

数据工厂由储备车间、生产车间和中试车间等三部分构成。
第二个3
三种类型
数据工厂有集中式数据工厂、半集中式数据工厂和分布式数据工厂三种形态。
5
五大特征
数据工厂呈现出多样化、规模化、标准化、体系化、AI化等五大特征。
第一个4
四种建设模式
数据工厂有数据标注企业迭代、数据存储基地升级、人工智能企业延伸和技术企业创新创立等四种主要建设模式。
第二个4
四种运营机制
数据工厂应应探索采用保障模式、定制模式、结对子模式、电商模式等四种运营机制。
第三个3
三种部署策略
数据工厂应与国家数据基础设施协同部署,在国家基础设施底座应部署通识数据集的数据工厂,在重要功能设施应部署行业通识数据集数据工厂,在各业务节点应部署行业专识数据集数据工厂。

作为数智社会的一种新兴业态,数据工厂的建设、运营、发展和完善,需要政策、标准、技术、平台等四方面体系性保障。应加快出台促进数据工厂创新发展的政策文件,启动数据资源汇聚整合、数据集生产、质量评估、流通应用等全链条标准研制,突破非结构化数据采集、海量数据存储、智能化数据加工、数据集质量评估等关键技术瓶颈,建设数据资源汇聚、数据集生产、数据流通、人工智能训练等支撑平台。

02
章节内容

《数据工厂白皮书》由数据工厂新业态发展方兴未艾,国内外数据工厂探索实践概况,数据工厂的涵义、类型和特点,数据工厂的构成、定位和功能,数据工厂的建设、运营和部署,发展数据工厂新业态政策建议等六个章节组成。

第一部分“数据工厂新业态发展方兴未艾”,从人工智能已发展到奇点时刻、面向人工智能的数智产业链已经形成、数智产业链还存在三个薄弱环节、数据工厂是高质量数据集规模化生产的关键设施等四方面,阐述了发展数据工厂的必要性和紧迫性。

第二部分“国内外数据工厂探索实践概况”,分别对Scale AI、美国星际之门项目、欧洲数据中心、欧洲数据实验室、Parse Biosciences、Bioptimus、笛卡尔实验室等国外典型数据工厂,崖州湾国家实验室“繁|未来农业智能枢纽”超级数据工厂、贵州主枢纽存力中心暨数据要素保障基地、库帕思“语料超级工厂”、京津冀数据要素产业园人工智能数据工厂、广东省先进存力中心、帕西尼具身智能超级数据工厂、上海徐汇区“模速空间”、北京经开区“模数世界”、珠海市“模数空间”、北京石景山区“大模型超级工厂”等国内典型数据工厂实践,以及国内数据工厂的共性特征进行了论述。

第三部分“数据工厂的涵义、类型和特点”,提出数据工厂是高质量数据集规模化生产设施和新型业态,是国家数据基础设施的重要组成部分的基本涵义。数据工厂有集中式、半集中式和分布式三种类型。数据工厂有多样化、规模化、体系化、标准化、AI化等五大特点。

第四部分“数据工厂的构成、定位和功能”,分别从广义数据工厂和狭义数据工厂的角度,提出广义数据工厂包括国家数据基座、国家数据工厂、国家人工智能训练场等三部分。狭义数据工厂包括储备车间、生产车间和中试车间三部分。其中,储备车间定位于数据原料“供应基地”,包括“三中心、五模块、多方法”体系;生产车间定位于高质量数据集“流水线”,包括“两中心、六模块、多工具”体系;中试车间定位于高质量数据集“靶场”,构建“模型评估、数据集维护和更新”体系。

第五部分“数据工厂的建设、运营和部署”,论述了数据标注企业迭代、数据存储基地升级、人工智能企业延伸和技术企业创新创立等四种数据工厂建设模式,保障模式、定制模式、结对子模式、电商模式等四种数据工厂运营机制,以及与国家数据基础设施协同部署,在国家基础设施底座应部署通识数据集的数据工厂,在重要功能设施应部署行业通识数据集数据工厂,在各业务节点应部署行业专识数据集数据工厂等三种数据工厂部署策略。

第六部分“发展数据工厂新业态政策建议”,从政策、标准、技术、平台四方面,提出加快出台《关于促进数据工厂新业态创新发展的指导意见》、启动数据工厂相关标准研制、突破数据工厂关键技术瓶颈、突破数据工厂关键技术瓶颈等发展数据工厂的四项建议。

资料下载

《数据工厂白皮书》.pdf

来源 数据要素,转载请注明来源

 
打赏
 
更多>同类资讯
0相关评论

推荐图文
推荐资讯
点击排行
网站首页  |  关于我们  |  联系方式  |  使用协议  |  版权隐私  |  网站地图  |  排名推广  |  广告服务  |  积分换礼  |  网站留言  |  RSS订阅  |  违规举报  |  皖ICP备20008326号-18
Powered By DESTOON