2000~2025 年上市公司年报中管理层讨论与分析部分文本提取结果(txt 文件)

之前给大家分享过不少上市公司年报文本的处理结果,还给大家分享了上市公司年报的处理方法。Stata 处理年报文本的方法可以参考平台上的课程:

名师讲堂|Stata 中文文本分析:https://rstata.duanshu.com/#/brief/course/b6a9efd94e5a48c2bba52dc9fdfd4291

R 语言处理年报文本的方法可以参考平台上的课程:

R 语言文本分析:https://rstata.duanshu.com/#/brief/course/bf37cf50eef04d38b43541cc52114c96

今天再跟大家分享下 2000~2025 年上市公司年报中管理层讨论与分析部分的文本提取结果。该数据是基于从巨潮资讯网爬取的上市公司年报 PDF 文件,使用 Python 程序从 PDF 中提取董事会报告、管理层讨论与分析、监事会报告三部分内容,并按年份分别存放。

数据概览

为了方便大家使用,我把各年包含管理层讨论与分析的上市公司年报文本文件数量进行了统计:

年份 文件数量 年份 文件数量
2000 4 2013 2,492
2001 937 2014 2,606
2002 1,039 2015 2,828
2003 1,129 2016 3,118
2004 1,226 2017 3,475
2005 1,224 2018 3,576
2006 1,342 2019 3,787
2007 1,485 2020 4,217
2008 1,540 2021 4,733
2009 1,699 2022 5,075
2010 1,981 2023 5,313
2011 2,221 2024 5,391
2012 2,421 2025 5,665

上市公司年报中管理层讨论与分析(Management Discussion and Analysis,简称 MD&A)是公司管理层对过去一年经营情况的回顾与分析,是公司年度报告的核心组成部分之一。该数据可以用于:

  • 文本情感分析
  • 关键词提取与词频分析
  • 管理层语调研究
  • 企业信息披露质量研究
  • 数字转型、创新投资等特定主题的文本分析

各年的文本文件按年份分文件夹存放,文件名为 股票代码_年份.txt 格式(如 000006_2024.txt)。

图表展示

下图展示了 2000~2025 年包含管理层讨论与分析的上市公司数量时间趋势:

下图展示了各年度上市公司数量的同比增长率:

下图展示了各时期年均上市公司数量对比:

处理代码

数据处理的完整流程包含两个主要步骤:首先是使用 Python 程序将 PDF 拆分为 JSON 格式,然后从 JSON 中提取各部分报告内容。以下是核心的文本提取代码示例:

#!/usr/bin/env python3
# -*- coding: utf-8 -*-
"""
年报报告提取完整流程脚本
从PDF年报中提取董事会报告和管理层讨论与分析,并按年份整理
"""

import json
import os
import re
from pathlib import Path

# 章节标题匹配关键词
MANAGEMENT_KEYWORDS = [
# 简体
"管理层讨论与分析", "管理层讨论与分析报告", "经营情况讨论与分析",
"管理层分析与讨论", "经营情况分析", "管理层讨论分析",
"讨论与分析", "管理层讨论", "经营讨论与分析",
"经营状况讨论与分析", "业务回顾与分析", "业务回顾及展望",
# 繁体
"管理層討論與分析", "管理層討論及分析", "管理層分析與討論",
"業務概覽", "業務回顧", "經營討論與分析",
]

def match_title(title, keywords):
*- 检查标题是否匹配关键词列表
if not title:
return False
norm_title = title.lower().replace(" ", "")
for kw in keywords:
norm_kw = kw.lower().replace(" ", "")
if norm_kw in norm_title:
return True
return False

def classify_section(title):
*- 分类章节类型
if match_title(title, MANAGEMENT_KEYWORDS):
return "management"
return None

附件中也提供了该数据的处理代码供参考:

数据引用格式

由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:

RStata 数据中心: 2000~2025年上市公司年报中管理层讨论与分析部分文本提取结果(txt 文件). 2026. https://tidyfriday.cn/rsdb2/

英文文献可以使用下面的格式引用:

RStata Data Center: Text Extraction of Management Discussion and Analysis Section from Annual Reports of Listed Companies in China, 2000–2025. 2026. https://tidyfriday.cn/rsdb2/

关联课程/数据推荐

名师讲堂|Stata 中文文本分析:https://rstata.duanshu.com/#/brief/course/b6a9efd94e5a48c2bba52dc9fdfd4291

R 语言文本分析:https://rstata.duanshu.com/#/brief/course/bf37cf50eef04d38b43541cc52114c96

使用 R 语言爬取全部上市公司的年报数据:https://rstata.duanshu.com/#/brief/course/6e8f8a1c6b2e4784974b1087fcbfc52c

名师讲堂|上市公司数字赋能指数计算(数字技术应用程度指标):https://rstata.duanshu.com/#/brief/course/cc1ce9aa0d12492e8bffe65feac54c63

2001~2024 年上市公司年报中包含研发的句子情感分析:https://rstata.duanshu.com/#/course/c885c20951954e6b8fef42f16db2f69b

如果有相关需要可以联系李老师付费定制。

点击这里跳转到 RStata 短书平台获取附件:2000~2025 年上市公司年报中管理层讨论与分析部分文本提取结果(txt 文件)

评论