
ESG 研究中,评级分数可以快速描述企业表现,但当研究进一步追问“企业具体承诺了什么”“是否披露了量化目标”“某项治理机制是否真正出现”时,最终还是需要回到报告原文。
问题在于,A 股公司的相关披露并没有统一名称。它们可能叫 ESG 报告、社会责任报告,也可能叫可持续发展报告;早期公告中还有不少图片版和扫描版 PDF。如果从零开始整理,通常要先筛选公告、核对报告年度、下载原文,再完成文本提取和扫描件识别。
为减少这些重复工作,我们整理了 A股上市公司ESG报告全文数据库。它既保留可供查阅和复核的原始 PDF,也提供按报告整理的全文数据,让研究可以从“寻找材料”更快进入“定义变量和验证问题”。
数据覆盖与筛选口径
数据库以巨潮资讯网公告为基础,覆盖 2006-2024 报告年度,公告披露信息追溯至 2025 年底,共整理 17,261 份 A 股上市公司 ESG/社会责任相关报告。其中,上交所公司报告 9,660 份,深交所公司报告 7,601 份。
纳入范围包括上市公司正式披露的:
• ESG 报告 • 社会责任报告 • 可持续发展报告
筛选过程中剔除了摘要类公告、ESG 管理制度或章程、单独鉴证说明、英文版本及其他不能作为中文报告正文分析的材料,保证一条记录对应一份正式报告。

从年度分布可以看到,A 股 ESG/社会责任报告在 2010 年后逐步增加,2021 年以后增长明显加快。较长的时间跨度既适合观察企业披露行为的演进,也便于构建公司年度面板数据。
一套数据,两种查看方式
1. 原始PDF报告
原始 PDF 保留公告的封面、目录、图表、签章、附注和上下文信息,适合原文查阅、案例分析、证据截图与人工复核。报告按年度归档,便于定位不同公司在不同年份的正式披露文件。
2. 报告全文数据
每份报告的全文已经与公司、年度、公告信息及原始 PDF 文件名对应,可以直接用于主题识别、信息抽取、语义评分和结构化变量构建。
对于文字版 PDF,我们直接提取原始文本;对于图片版和扫描版 PDF,则使用 AI 视觉大模型识别。后者对低清扫描、多栏排版、复杂表格和图文混排的适应性更强,相比传统 OCR 能够显著改善文本提取质量。
这意味着,大家既可以批量处理报告全文,也可以根据文件名回到原始 PDF 核验模型判断,形成“全文分析—结果筛选—原文复核”的完整路径。
数据字段
每条记录对应一份报告,主要字段如下:
secCode | |
secName | |
exchange | |
announcementDate | |
announcementYear | |
reportYear | |
reportType | |
announcementTitle | |
announcementId | |
cninfoUrl | |
filename | |
text |
其中,text 是文本研究的核心字段,filename、announcementId 和 cninfoUrl 则用于连接全文、原始文件与公告来源。研究变量出现异常时,可以迅速回到原文检查,而不必在大量公告中重新寻找文件。

从全文中构造可复核的ESG变量
在数据库页面选择这套 ESG 报告全文数据并点击使用后,每份报告会作为独立文本进入模型处理。在 Prompt 中,可以通过列引用调用公司名称、报告年度和报告全文:
公司名称:{$secName$}报告年度:{$reportYear$}ESG报告全文:{$text$}如果研究的是披露主题,可以判断报告是否涉及碳中和目标、气候风险、供应链责任、员工安全、数据安全或乡村振兴。如果需要构建公司年度变量,还可以使用结构化输出,让每份报告按照统一字段返回结果。例如:
quantified_carbon_target | |
climate_risk_measure | |
green_innovation_evidence | |
supplier_esg_requirement | |
employee_safety_action | |
board_esg_oversight | |
external_assurance |
这些字段既可以设为“是/否”,也可以进一步提取目标年份、指标数值、责任部门和原文依据。保留判断依据后,模型输出不再只是一个难以解释的标签,而是可以抽查、修订并与原始报告相互验证的研究数据。
可以研究哪些问题?
这套数据库适合 ESG 信息披露质量、绿色金融、企业社会责任、碳风险、绿色创新、供应链治理、员工权益和公司治理等主题,也可以用于研究 ESG 文本特征与机构投资者、分析师关注、媒体报道、融资约束、市场反应及企业价值之间的关系。
全文数据的价值并不在于替代所有既有 ESG 指标,而在于为大家保留重新定义变量的空间。相同的报告文本,可以根据不同问题设计词典、训练分类器或进行语义识别;原始 PDF 的保留,又使这些变量始终能够回到披露材料本身进行核验。
当数据收集、文本提取和扫描件识别已经完成,研究工作的重点就可以真正回到问题本身:企业说了什么,怎样说,以及这些披露是否对应后续行动和经济后果。
关于文易平台
AI 文易平台的核心价值,是帮助大家把非结构化文本转化为可分析、可复核、可合并的数据。
在这套 ESG 报告数据中,我们已经完成了最基础但最耗时的工作:公告筛选、PDF 整理、文字版报告文本抽取、图片版/扫描版报告 AI 视觉识别、年度归档和字段整理。进入数据库页面后,可以直接在 AI 文易平台上继续做更贴近研究问题的分析,例如主题分类、信息抽取、语义评分、句子识别和结构化变量生成。
对经管研究来说,大语言模型的价值不只是生成文本,更重要的是把年报、公告、ESG 报告、研报、新闻、政策文本、专利、招股说明书等材料转化为可以进入实证研究流程的数据。只要研究问题能够转化为分类、抽取、评分或匹配任务,就有机会通过 AI 文易平台批量完成。
如果你正在研究 ESG、绿色金融、企业社会责任或可持续发展披露,这套 A股上市公司ESG报告全文数据 可以作为原始文本库,也可以作为 AI 文本分析的起点。
除了这套数据,我们也可以提供各类文本数据定制服务。比如,按照你的研究主题设计 Prompt,批量处理原始文本,抽取事件、识别语义标签、构造公司-年份指标,或者将句子级结果整理成可以直接用于回归分析的面板数据。
如果你对大语言模型应用于经管研究感兴趣,或者有自己的文本数据处理需求,可以直接联系我们。
回顾过去的时间,AI文易已经推出三款结合大语言模型与上市公司年报做指标测度的数据集,同时也收获了很多支持我们的学界同仁,本周为了回馈各位,AI文易限时对所有历史发布数据进行折扣活动,详情请扫描下方二维码咨询客服。

点击左下角「阅读原文」,即刻开始文易!
声明:如需在论文中引用数据,请注明数据来自于AI文易平台。


