推广 热搜: 采购方式  滤芯  带式称重给煤机  甲带  气动隔膜泵  减速机型号  无级变速机  链式给煤机  履带  减速机 

《数据工厂白皮书》重磅发布

   日期:2026-08-18 22:43:48     来源:网络整理    作者:本站编辑    评论:0    
《数据工厂白皮书》重磅发布

点击上方智能工厂前线 关注我们

e-works鼓励原创,如需投稿请参看首页“原创投稿”说明。

✎导 读 

《数据工厂白皮书》由北京交通大学、北京化工大学牵头,联合30余家机构共同编制,是我国首部关于数据工厂政策、理论、实践的研究成果。报告的核心观点是:随着人工智能进入规模化应用阶段,高质量数据集的匮乏已成为制约其发展的关键瓶颈,而解决这一问题的根本途径在于建设“数据工厂”——一种能够实现高质量数据集规模化、标准化、设施化生产的新型业态。

来源:北京交通大学、北京化工大学等《数据工厂白皮书》、制造前沿

01
背景与动因:数据工厂新业态发展方兴未艾

报告指出,人工智能已发展到“奇点时刻”,具体表现为:

  1. 词元调用量爆发式增长:全国词元日调用量从2024年初的1000亿跃升至2025年底的100万亿,两年增长超千倍,表明大模型应用正快速普及。

  2. 推理数据量首次超过训练数据量:2025年,全国AI推理数据量(101.34EB)首次超过训练数据量(98.14EB),标志着AI已从“学习训练”阶段全面转向“应用推理”阶段。

  3. 计算驱动成为数据生产主要方式:系统软件、AI产生的数据量(26.92ZB)首次超过物联感知数据量(25.34ZB),数据生产正从“感知驱动”向“计算驱动”转变。

  4. 智能体成为互联网主要操作者:全球网络流量中,机器人(Bot)流量已超过人类流量,互联网正进入机器可读、智能体可读的新时代。

  5. 高质量数据集成为人工智能瓶颈:在“算力平权”和“算法平权”实现后,“数据平权”成为人工智能普及应用的最后一个堡垒。当前数据生产多处于“作坊式”阶段,效率低下,无法满足规模化需求。

核心结论:数智产业链存在数据资源“供不出”、行业数据“存不好”、高质量数据集“作坊式”生产效率低下三个薄弱环节。借鉴水、电、燃料等资源型基础设施的发展规律,必须建设“数据工厂”作为高质量数据集的规模化生产设施,为智能化应用持续提供“数据燃料”。

02
现状与探索:国内外数据工厂实践概况

报告梳理了国内外数据工厂的典型实践,总结出共性经验:

(一)国外典型数据工厂

  • 美国 Scale AI:典型的半集中式数据工厂,通过专业化的数据引擎矩阵、测试评估平台和AI应用平台,构建了覆盖“数据标注—模型评估—AI应用”的全链条闭环服务。

  • 美国星际之门项目:国家级战略项目,投资5000亿美元,将高质量数据定位为“国家战略资产”,同步建设高性能计算中心和独立数据中心,注重算力与数据的协同布局。

  • 欧洲数据中心:政企合作、产学研联合的标杆,强调数据主权和GDPR合规,旨在减少对海外数据提供商的依赖。

  • 欧洲数据实验室:与欧洲共同数据空间深度融合,注重多语言数据资源建设和数据治理合规性。

  • 其他:如Parse Biosciences(生物医学)、Bioptimus(病理AI)、笛卡尔实验室(遥感数据)等,均聚焦于垂直领域的专业化数据生产。

(二)国内典型数据工厂

  • 崖州湾国家实验室“繁|未来农业智能枢纽”:面向农业育种领域的超级数据工厂,建立了“数据—知识—工程”阶梯递进能力,实现五级数据集的自动化生产。

  • 贵州主枢纽存力中心暨数据要素保障基地:依托国家枢纽节点,作为“东数西算”的重要载体,面向多行业提供高质量数据集服务。

  • 上海库帕思“语料超级工厂”:平台型企业,构建了“1125”业务架构和“采、洗、标、测、用”五位一体的工具体系,专注于语料数据的规模化生产。

  • 京津冀数据要素产业园人工智能数据工厂:位于霸州,定位为“跨区域流通试验田”,构建了“数据+研发+制造”融合生态。

  • 广东省先进存力中心:依托韶关集群,采用“前店后厂”模式,联动数据交易所,构建数据交易闭环生态。

  • 帕西尼具身智能超级数据工厂:全球最大的具身智能数据采集基地,通过“15+N”全场景矩阵和“无本体依赖”采集技术,每年可生产近2亿条高质量训练数据。

  • 其他:如上海“模速空间”、北京“模数世界”、珠海“模数空间”、北京石景山“大模型超级工厂”等,多为AI产业集聚区或服务平台,为数据工厂和模型训练提供生态支持。

(三)发展现状总结

  • 供给环节:建立了政企合作、行业龙头汇聚等多元稳定的数据来源渠道。

  • 生产环节:形成了设施化(如专业化的数据引擎矩阵)、规模化(如年产亿级数据)、智能化(如AI辅助标注)的“三位一体”生产能力。

  • 应用环节:普遍以AI模型训练为目标,形成了“数据生产—模型训练—应用反馈”的良性循环。

03
内涵与特性:数据工厂的涵义、类型和特点

(一)数据工厂的涵义

数据工厂是人类社会进入数智化发展新阶段,面向人工智能大模型应用,开展高质量数据集设施化、规模化、标准化生产的数据基础设施。它具有四个核心定位:

  1. 国家数据基础设施的基本构成单元:每个数据工厂都是一个小型的数据安全高效流通环境。

  2. 突破人工智能发展瓶颈的有效手段:通过专业化、社会化大生产,解决数据供给瓶颈。

  3. 高质量数据集的规模化生产设施:具备设施化、规模化、标准化三大特点。

  4. 数据全生命周期的综合产业形态:覆盖数据产业全部六种业态。

(二)数据工厂的类型

根据物理分布、组织方式和技术水平,分为三种类型:

  1. 集中式数据工厂:数据“供应-生产-交付”全流程集中在一个物理区域。如帕西尼超级工厂、贵州存力中心。

  2. 半集中式数据工厂:技术平台统一,但加工场所分散在不同区域。如Scale AI,将数据标注业务分布到全球。

  3. 分布式数据工厂:数据“逻辑统一,物理解耦”,通过数据编织等技术在数据原地处理,不集中搬迁。如Palantir,适用于国防、金融等高安全行业。

(三)数据工厂的特点

数据工厂具有五大显著特征:

  1. 多样化:存在集中式、半集中式、分布式等多种形态。

  2. 设施化:本身是设施集合,构成要素是设施,服务以平台方式提供。

  3. 规模化:在数据采集、自动加工、场景应用三个维度实现规模化。

  4. 标准化:数据资源、加工处理、数据产品和服务均实现标准化。

  5. AI化:人工智能技术广泛应用于数据“采存算管用”各环节。

04
构成与功能:数据工厂的构成、定位和功能

报告将数据工厂分为广义和狭义两个范畴:

(一)广义数据工厂

站在国家宏观角度,由三部分组成:

  1. 国家数据基座:负责原始数据的规模化储备。在重点行业实行集中存储和分级存储(热数据、温数据、冷数据)。

  2. 国家数据工厂:由“10+16+N”三层体系构成,分别生产通识数据集(10个国家级)、行业通识数据集(16个行业级)和行业专识数据集(N个区域级)。

  3. 国家人工智能训练场:由通用基础大模型训练场、行业垂直大模型训练场和企业智能体训练场组成,负责将数据集应用于模型训练。

(二)狭义数据工厂

站在企业、行业微观角度,由三个核心车间构成:

  1. 储备车间:定位为数据原料的“供应基地”。负责数据需求规划、采集汇聚、预处理和存储管理。建设内容包括数据采集中心、数据存储中心、数据管理中心,并配备相应的采集、汇聚、预处理、存储、管理技术。

  2. 生产车间:定位为高质量数据集的“流水线”。负责数据的深度加工,包括数据清洗、合成、增强、标注、质检和数据集管理。建设内容包括数据加工中心和数据标注中心,并配备相应的清洗、合成、增强、标注、质检、管理技术。

  3. 中试车间:定位为数据集投产前的“靶场”。负责在模型训练前对数据集进行效果适配性评估和优化。包括模型评估中心(训练评估、微调评估、推理评估)和数据集维护更新中心(版本管理、问题溯源),并配备相应的评估和迭代技术。

05
建设、运营与部署:数据工厂的建设、运营和部署策略

(一)建设模式

根据建设主体不同,有四种模式:

  1. 数据标注企业升级:推动传统数据标注企业向规模化、智能化、高端化的数据工厂转型。

  2. 数据存储基地转型:推动存储基地/数据中心从“存数据”向“加工数据”转型,生产高质量数据集。

  3. 人工智能企业延伸:鼓励AI头部企业将内部数据业务独立,建设面向全行业的半集中式数据工厂。

  4. 技术企业创新设立:鼓励技术创新型企业突破数据编织等前沿技术,建设分布式数据工厂。

(二)运营模式

根据数据供给方式和市场化程度,有四种运营模式:

  1. 保障模式:服务于国家重大战略需求,数据资源无条件供给,数据集有条件无偿开放。

  2. 定制模式:服务于社会公益和技术创新,数据资源按需供给,数据集定向开放。

  3. 电商模式:面向市场化程度高的行业,数据资源通过授权运营,数据集按市场规则开放。

  4. 结对子模式:面向需长期开发的领域,数据资源优先供给,数据集定向有偿供给。

(三)部署策略

数据工厂应与国家数据基础设施协同部署:

  • 在底座:部署生产通识数据集的数据工厂。

  • 在区域重要功能设施:部署生产区域通识数据集的数据工厂。

  • 在行业重要功能设施:部署生产行业通识数据集的数据工厂。

  • 在各业务节点:部署生产行业专识数据集的数据工厂。

06
政策建议:发展数据工厂新业态政策建议

为推动数据工厂新业态发展,报告提出四点系统性建议:

  1. 加快制定促进数据工厂发展政策:建议出台《关于促进数据工厂新业态创新发展的指导意见》,重点从加大数据资源供给、启动数据工厂建设、启动AI训练场建设三方面入手,形成“数据生产—模型训练—应用反馈—数据迭代”的良性循环。

  2. 启动数据工厂相关标准研制:构建覆盖全链条的标准体系,包括数据资源汇聚类标准(如目录规范、分级存储规范)、数据集生产类标准(如参考架构、生产规范、标注规范)和数据集质量评估类标准(如评估指标体系、分类分级规范、模型适配性评估规范)。

  3. 突破数据工厂关键技术瓶颈:重点突破非结构化数据采集技术、海量数据存储管理技术、智能化数据加工技术和数据集质量评估技术四大核心技术瓶颈。

  4. 加强数据工厂支撑平台建设:围绕全链条,建设数据资源汇聚平台、数据集生产平台、统一数据流通基础设施(需推动技术路线统一)和人工智能训练平台,为数据工厂高效运转提供平台保障。

白皮书部分内容如下
近期活动预告

 
打赏
 
更多>同类资讯
0相关评论

推荐图文
推荐资讯
点击排行
网站首页  |  关于我们  |  联系方式  |  使用协议  |  版权隐私  |  网站地图  |  排名推广  |  广告服务  |  积分换礼  |  网站留言  |  RSS订阅  |  违规举报  |  皖ICP备20008326号-18
Powered By DESTOON