今天给大家分享一份 2000~2025 年上市公司年报中董事会(局)报告部分文本提取结果。该数据是基于从巨潮资讯网爬取的上市公司年报 PDF 文件,使用 Python 程序智能提取得到的。
数据来源与处理方法
数据来源
原始数据来源于巨潮资讯网(www.cninfo.com.cn)披露的上市公司年度报告。我们从 PDF 格式的年报文件中提取了”董事会报告”、”董事局报告”等相关章节的内容。
处理方法
数据处理主要分为两个阶段:
第一阶段:PDF 章节拆分
使用 Python 程序(基于 PyMuPDF 库)对 PDF 年报进行智能章节拆分。该程序采用多策略识别方法:
- 目录页提取策略:从 PDF 文本中识别目录页,提取一级标题,然后在正文中精确定位
- PDF 内嵌书签策略:利用 PDF 内嵌的 TOC 书签信息
- 连续文本扫描策略:扫描标准”第X节/章”格式的标题
- 关键词匹配策略:识别旧式年报章节名(如”董事会报告”、”监事会报告”等)
在文本处理过程中,程序会自动清理页眉、页脚和页码信息,并处理中文字符间的异常空格。
第二阶段:董事会报告提取
从拆分后的 JSON 文件中提取董事会(局)报告内容:
# 董事会报告关键词匹配 |
程序支持从董事会报告中进一步提取嵌入的”管理层讨论与分析”内容,采用多种策略识别经营讨论相关段落。
数据概览
该数据集包含 2000~2024 年上市公司年报中的董事会(局)报告文本,时间跨度 25 年,共计 24,277 个 txt 文件。
各年文件数量分布如下:
| 年份 | 文件数量 | 年份 | 文件数量 |
|---|---|---|---|
| 2000 | 5 | 2013 | 2,511 |
| 2001 | 1,012 | 2014 | 2,630 |
| 2002 | 1,115 | 2015 | 44 |
| 2003 | 1,197 | 2016 | 33 |
| 2004 | 1,258 | 2017 | 32 |
| 2005 | 1,241 | 2018 | 35 |
| 2006 | 1,370 | 2019 | 38 |
| 2007 | 1,514 | 2020 | 41 |
| 2008 | 1,573 | 2021 | 44 |
| 2009 | 1,731 | 2022 | 41 |
| 2010 | 2,011 | 2023 | 42 |
| 2011 | 2,245 | 2024 | 49 |
| 2012 | 2,465 | 2025 | 38 |
注:2015 年后数据量显著减少,这是因为 2015 年之后通常不再单独列示这部分内容了,而是列示“管理层讨论与分析”。
![]()
图表展示
下图展示了 2000~2025 年上市公司年报董事会报告文件数量的时间趋势:
![]()
各年文件数量排名:
![]()
各年同比增长率:
![]()
处理代码
附件中提供了该数据的处理代码,主要包括以下两个 Python 脚本:
1. 年报章节拆分(annual_report_splitter.py)
该脚本实现了上市公司年报的智能章节拆分功能:
# 核心类:年报章节拆分器 |
2. 报告提取流程(extract_annual_reports_pipeline.py)
该脚本从拆分后的 JSON 文件中提取董事会报告、管理层讨论与分析和监事会报告:
# 章节标题匹配关键词 |
![]()
数据引用格式
由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:
RStata 数据中心: 2000~2025年上市公司年报中董事会(局)报告部分文本提取结果(txt 文件). 2026. https://tidyfriday.cn/rsdb2/
英文文献可以使用下面的格式引用:
RStata Data Center: Text Extraction Results of Board of Directors Reports from Listed Company Annual Reports, 2000–2025 (txt files). 2026. https://tidyfriday.cn/rsdb2/
关联课程/数据推荐
名师讲堂|Stata 中文文本分析:https://rstata.duanshu.com/#/course/b6a9efd94e5a48c2bba52dc9fdfd4291
R 语言文本分析:https://rstata.duanshu.com/#/course/bf37cf50eef04d38b43541cc52114c96
使用 R 语言爬取全部上市公司的年报数据:https://rstata.duanshu.com/#/course/6e8f8a1c6b2e4784974b1087fcbfc52c
2000~2025 年上市公司年报 PDF & TXT 文件合集:https://rstata.duanshu.com/#/brief/course/022bd6704a75410c934a17ddd25c69d5
2001~2024 年各上市公司数字转型关键词总词频及TF-IDF指标计算结果(吴非2021版本,基于管理层讨论分析文本):https://rstata.duanshu.com/#/brief/course/91b932a04b774f2785e4159ed56a3cd4
使用 Stata 爬取上市公司年报合集:https://rstata.duanshu.com/#/course/701bc76a7bca4be193c81ac9aeaee60b
使用 R 语言处理港股年报计算数字赋能指数(繁体文本的文本分析):https://rstata.duanshu.com/#/course/0c6f289941e141199752ca04ba895f62
使用 Stata 提取一大堆文本文件中的词频并绘图展示:https://rstata.duanshu.com/#/course/efd05edf653e4eccaf9fc8228948767e
点击这里跳转到 RStata 短书平台获取附件:2000~2025 年上市公司年报中董事会(局)报告部分文本提取结果(txt 文件)
评论