点击上方智能工厂前线 关注我们
e-works鼓励原创,如需投稿请参看首页“原创投稿”说明。
《数据工厂白皮书》由北京交通大学、北京化工大学牵头,联合30余家机构共同编制,是我国首部关于数据工厂政策、理论、实践的研究成果。报告的核心观点是:随着人工智能进入规模化应用阶段,高质量数据集的匮乏已成为制约其发展的关键瓶颈,而解决这一问题的根本途径在于建设“数据工厂”——一种能够实现高质量数据集规模化、标准化、设施化生产的新型业态。
来源:北京交通大学、北京化工大学等《数据工厂白皮书》、制造前沿
报告指出,人工智能已发展到“奇点时刻”,具体表现为:
词元调用量爆发式增长:全国词元日调用量从2024年初的1000亿跃升至2025年底的100万亿,两年增长超千倍,表明大模型应用正快速普及。
推理数据量首次超过训练数据量:2025年,全国AI推理数据量(101.34EB)首次超过训练数据量(98.14EB),标志着AI已从“学习训练”阶段全面转向“应用推理”阶段。
计算驱动成为数据生产主要方式:系统软件、AI产生的数据量(26.92ZB)首次超过物联感知数据量(25.34ZB),数据生产正从“感知驱动”向“计算驱动”转变。
智能体成为互联网主要操作者:全球网络流量中,机器人(Bot)流量已超过人类流量,互联网正进入机器可读、智能体可读的新时代。
高质量数据集成为人工智能瓶颈:在“算力平权”和“算法平权”实现后,“数据平权”成为人工智能普及应用的最后一个堡垒。当前数据生产多处于“作坊式”阶段,效率低下,无法满足规模化需求。
核心结论:数智产业链存在数据资源“供不出”、行业数据“存不好”、高质量数据集“作坊式”生产效率低下三个薄弱环节。借鉴水、电、燃料等资源型基础设施的发展规律,必须建设“数据工厂”作为高质量数据集的规模化生产设施,为智能化应用持续提供“数据燃料”。
报告梳理了国内外数据工厂的典型实践,总结出共性经验:
(一)国外典型数据工厂
美国 Scale AI:典型的半集中式数据工厂,通过专业化的数据引擎矩阵、测试评估平台和AI应用平台,构建了覆盖“数据标注—模型评估—AI应用”的全链条闭环服务。
美国星际之门项目:国家级战略项目,投资5000亿美元,将高质量数据定位为“国家战略资产”,同步建设高性能计算中心和独立数据中心,注重算力与数据的协同布局。
欧洲数据中心:政企合作、产学研联合的标杆,强调数据主权和GDPR合规,旨在减少对海外数据提供商的依赖。
欧洲数据实验室:与欧洲共同数据空间深度融合,注重多语言数据资源建设和数据治理合规性。
其他:如Parse Biosciences(生物医学)、Bioptimus(病理AI)、笛卡尔实验室(遥感数据)等,均聚焦于垂直领域的专业化数据生产。
(二)国内典型数据工厂
崖州湾国家实验室“繁|未来农业智能枢纽”:面向农业育种领域的超级数据工厂,建立了“数据—知识—工程”阶梯递进能力,实现五级数据集的自动化生产。
贵州主枢纽存力中心暨数据要素保障基地:依托国家枢纽节点,作为“东数西算”的重要载体,面向多行业提供高质量数据集服务。
上海库帕思“语料超级工厂”:平台型企业,构建了“1125”业务架构和“采、洗、标、测、用”五位一体的工具体系,专注于语料数据的规模化生产。
京津冀数据要素产业园人工智能数据工厂:位于霸州,定位为“跨区域流通试验田”,构建了“数据+研发+制造”融合生态。
广东省先进存力中心:依托韶关集群,采用“前店后厂”模式,联动数据交易所,构建数据交易闭环生态。
帕西尼具身智能超级数据工厂:全球最大的具身智能数据采集基地,通过“15+N”全场景矩阵和“无本体依赖”采集技术,每年可生产近2亿条高质量训练数据。
其他:如上海“模速空间”、北京“模数世界”、珠海“模数空间”、北京石景山“大模型超级工厂”等,多为AI产业集聚区或服务平台,为数据工厂和模型训练提供生态支持。
(三)发展现状总结
供给环节:建立了政企合作、行业龙头汇聚等多元稳定的数据来源渠道。
生产环节:形成了设施化(如专业化的数据引擎矩阵)、规模化(如年产亿级数据)、智能化(如AI辅助标注)的“三位一体”生产能力。
应用环节:普遍以AI模型训练为目标,形成了“数据生产—模型训练—应用反馈”的良性循环。
(一)数据工厂的涵义
数据工厂是人类社会进入数智化发展新阶段,面向人工智能大模型应用,开展高质量数据集设施化、规模化、标准化生产的数据基础设施。它具有四个核心定位:
国家数据基础设施的基本构成单元:每个数据工厂都是一个小型的数据安全高效流通环境。
突破人工智能发展瓶颈的有效手段:通过专业化、社会化大生产,解决数据供给瓶颈。
高质量数据集的规模化生产设施:具备设施化、规模化、标准化三大特点。
数据全生命周期的综合产业形态:覆盖数据产业全部六种业态。
(二)数据工厂的类型
根据物理分布、组织方式和技术水平,分为三种类型:
集中式数据工厂:数据“供应-生产-交付”全流程集中在一个物理区域。如帕西尼超级工厂、贵州存力中心。
半集中式数据工厂:技术平台统一,但加工场所分散在不同区域。如Scale AI,将数据标注业务分布到全球。
分布式数据工厂:数据“逻辑统一,物理解耦”,通过数据编织等技术在数据原地处理,不集中搬迁。如Palantir,适用于国防、金融等高安全行业。
(三)数据工厂的特点
数据工厂具有五大显著特征:
多样化:存在集中式、半集中式、分布式等多种形态。
设施化:本身是设施集合,构成要素是设施,服务以平台方式提供。
规模化:在数据采集、自动加工、场景应用三个维度实现规模化。
标准化:数据资源、加工处理、数据产品和服务均实现标准化。
AI化:人工智能技术广泛应用于数据“采存算管用”各环节。
报告将数据工厂分为广义和狭义两个范畴:
(一)广义数据工厂
站在国家宏观角度,由三部分组成:
国家数据基座:负责原始数据的规模化储备。在重点行业实行集中存储和分级存储(热数据、温数据、冷数据)。
国家数据工厂:由“10+16+N”三层体系构成,分别生产通识数据集(10个国家级)、行业通识数据集(16个行业级)和行业专识数据集(N个区域级)。
国家人工智能训练场:由通用基础大模型训练场、行业垂直大模型训练场和企业智能体训练场组成,负责将数据集应用于模型训练。
(二)狭义数据工厂
站在企业、行业微观角度,由三个核心车间构成:
储备车间:定位为数据原料的“供应基地”。负责数据需求规划、采集汇聚、预处理和存储管理。建设内容包括数据采集中心、数据存储中心、数据管理中心,并配备相应的采集、汇聚、预处理、存储、管理技术。
生产车间:定位为高质量数据集的“流水线”。负责数据的深度加工,包括数据清洗、合成、增强、标注、质检和数据集管理。建设内容包括数据加工中心和数据标注中心,并配备相应的清洗、合成、增强、标注、质检、管理技术。
中试车间:定位为数据集投产前的“靶场”。负责在模型训练前对数据集进行效果适配性评估和优化。包括模型评估中心(训练评估、微调评估、推理评估)和数据集维护更新中心(版本管理、问题溯源),并配备相应的评估和迭代技术。
(一)建设模式
根据建设主体不同,有四种模式:
数据标注企业升级:推动传统数据标注企业向规模化、智能化、高端化的数据工厂转型。
数据存储基地转型:推动存储基地/数据中心从“存数据”向“加工数据”转型,生产高质量数据集。
人工智能企业延伸:鼓励AI头部企业将内部数据业务独立,建设面向全行业的半集中式数据工厂。
技术企业创新设立:鼓励技术创新型企业突破数据编织等前沿技术,建设分布式数据工厂。
(二)运营模式
根据数据供给方式和市场化程度,有四种运营模式:
保障模式:服务于国家重大战略需求,数据资源无条件供给,数据集有条件无偿开放。
定制模式:服务于社会公益和技术创新,数据资源按需供给,数据集定向开放。
电商模式:面向市场化程度高的行业,数据资源通过授权运营,数据集按市场规则开放。
结对子模式:面向需长期开发的领域,数据资源优先供给,数据集定向有偿供给。
(三)部署策略
数据工厂应与国家数据基础设施协同部署:
在底座:部署生产通识数据集的数据工厂。
在区域重要功能设施:部署生产区域通识数据集的数据工厂。
在行业重要功能设施:部署生产行业通识数据集的数据工厂。
在各业务节点:部署生产行业专识数据集的数据工厂。
为推动数据工厂新业态发展,报告提出四点系统性建议:
加快制定促进数据工厂发展政策:建议出台《关于促进数据工厂新业态创新发展的指导意见》,重点从加大数据资源供给、启动数据工厂建设、启动AI训练场建设三方面入手,形成“数据生产—模型训练—应用反馈—数据迭代”的良性循环。
启动数据工厂相关标准研制:构建覆盖全链条的标准体系,包括数据资源汇聚类标准(如目录规范、分级存储规范)、数据集生产类标准(如参考架构、生产规范、标注规范)和数据集质量评估类标准(如评估指标体系、分类分级规范、模型适配性评估规范)。
突破数据工厂关键技术瓶颈:重点突破非结构化数据采集技术、海量数据存储管理技术、智能化数据加工技术和数据集质量评估技术四大核心技术瓶颈。
加强数据工厂支撑平台建设:围绕全链条,建设数据资源汇聚平台、数据集生产平台、统一数据流通基础设施(需推动技术路线统一)和人工智能训练平台,为数据工厂高效运转提供平台保障。









































































