2000~2024 年上市公司年报中董事会(局)报告部分文本提取结果(txt 文件)

今天给大家分享一份2000~2024年上市公司年报中董事会(局)报告部分文本提取结果。该数据是基于从巨潮资讯网爬取的上市公司年报 PDF 文件,使用 Python 程序智能提取得到的。

数据来源与处理方法

数据来源

原始数据来源于巨潮资讯网(www.cninfo.com.cn)披露的上市公司年度报告。我们从 PDF 格式的年报文件中提取了”董事会报告”、”董事局报告”等相关章节的内容。

处理方法

数据处理主要分为两个阶段:

第一阶段:PDF 章节拆分

使用 Python 程序(基于 PyMuPDF 库)对 PDF 年报进行智能章节拆分。该程序采用多策略识别方法:

  1. 目录页提取策略:从 PDF 文本中识别目录页,提取一级标题,然后在正文中精确定位
  2. PDF 内嵌书签策略:利用 PDF 内嵌的 TOC 书签信息
  3. 连续文本扫描策略:扫描标准”第X节/章”格式的标题
  4. 关键词匹配策略:识别旧式年报章节名(如”董事会报告”、”监事会报告”等)

在文本处理过程中,程序会自动清理页眉、页脚和页码信息,并处理中文字符间的异常空格。

第二阶段:董事会报告提取

从拆分后的 JSON 文件中提取董事会(局)报告内容:

# 董事会报告关键词匹配
BOARD_KEYWORDS = [
"董事会报告", "董事局报告", "董事会工作报告", "董事局工作报告",
"董事会(局)报告", "董事报告", "董事会年度报告",
"董事會報告", "董事局報告", "董事會工作報告", "董事局工作報告",
"董事報告",
]

程序支持从董事会报告中进一步提取嵌入的”管理层讨论与分析”内容,采用多种策略识别经营讨论相关段落。

数据概览

该数据集包含 2000~2024 年上市公司年报中的董事会(局)报告文本,时间跨度 25 年,共计 24,277 个 txt 文件。

各年文件数量分布如下:

年份 文件数量 年份 文件数量
2000 5 2013 2,511
2001 1,012 2014 2,630
2002 1,115 2015 44
2003 1,197 2016 33
2004 1,258 2017 32
2005 1,241 2018 35
2006 1,370 2019 38
2007 1,514 2020 41
2008 1,573 2021 44
2009 1,731 2022 41
2010 2,011 2023 42
2011 2,245 2024 49
2012 2,465

注:2015 年后数据量显著减少,这是因为 2015 年之后通常不再单独列示这部分内容了,而是列示“管理层讨论与分析”。

图表展示

下图展示了 2000~2024 年上市公司年报董事会报告文件数量的时间趋势:

各年文件数量排名:

各年同比增长率:

处理代码

附件中提供了该数据的处理代码,主要包括以下两个 Python 脚本:

1. 年报章节拆分(annual_report_splitter.py)

该脚本实现了上市公司年报的智能章节拆分功能:

# 核心类:年报章节拆分器
class AnnualReportSplitter:
"""上市公司年报章节拆分器

核心思路:
1. 打开PDF后,逐页提取原始文本并记录每页的字符偏移量
2. 逐页清理页眉页脚,然后拼接成一段连续的"干净文本"
3. 在干净文本上识别章节标题行的位置(字符偏移)
4. 按字符偏移切割出每个章节的精确内容
"""

2. 报告提取流程(extract_annual_reports_pipeline.py)

该脚本从拆分后的 JSON 文件中提取董事会报告、管理层讨论与分析和监事会报告:

# 章节标题匹配关键词
BOARD_KEYWORDS = [
"董事会报告", "董事局报告", "董事会工作报告", "董事局工作报告",
"董事会(局)报告", "董事报告", "董事会年度报告",
# 繁体
"董事會報告", "董事局報告", "董事會工作報告", "董事局工作報告",
"董事報告",
]

数据引用格式

由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:

RStata 数据中心: 2000~2024年上市公司年报中董事会(局)报告部分文本提取结果(txt 文件). 2026. https://tidyfriday.cn/rsdb2/

英文文献可以使用下面的格式引用:

RStata Data Center: Text Extraction Results of Board of Directors Reports from Listed Company Annual Reports, 2000–2024 (txt files). 2026. https://tidyfriday.cn/rsdb2/

关联课程/数据推荐

名师讲堂|Stata 中文文本分析:https://rstata.duanshu.com/#/course/b6a9efd94e5a48c2bba52dc9fdfd4291

R 语言文本分析:https://rstata.duanshu.com/#/course/bf37cf50eef04d38b43541cc52114c96

使用 R 语言爬取全部上市公司的年报数据:https://rstata.duanshu.com/#/course/6e8f8a1c6b2e4784974b1087fcbfc52c

2000~2024 年上市公司年报 PDF & TXT 文件合集:https://rstata.duanshu.com/#/course/05b850225f8344aa9d3b1a4127314f88

2001~2022 年各上市公司数字赋能指数计算结果(吴非(2021),基于管理层讨论与分析文本):https://rstata.duanshu.com/#/course/a58f34448d2a489aa06d646e54908563

使用 Stata 爬取上市公司年报合集:https://rstata.duanshu.com/#/course/701bc76a7bca4be193c81ac9aeaee60b

使用 R 语言处理港股年报计算数字赋能指数(繁体文本的文本分析):https://rstata.duanshu.com/#/course/0c6f289941e141199752ca04ba895f62

使用 Stata 提取一大堆文本文件中的词频并绘图展示:https://rstata.duanshu.com/#/course/efd05edf653e4eccaf9fc8228948767e

readfiles:批量读取指定文件夹中特定扩展名的所有文本文件:https://rstata.duanshu.com/#/course/586d17e4ada14aeda4433ccc8fbd8c02

点击这里跳转到 RStata 短书平台获取附件:旧版本|2000~2024 年上市公司年报中董事会(局)报告部分文本提取结果(txt 文件)

评论