2001~2022 年上市公司年报 PDF 文件合集

前不久给大家分享过不少上市公司年报文本的处理结果,还给大家分享了上市公司年报的爬取方法:

今天再跟大家分享下全部上市公司年报的爬取结果。一共 55475 份 pdf 文件,172 GB。各年 pdf 文件数量如下:

为了方便大家使用,各年的文件我进行了分开存放:

由于 Stata 文本分析的能力较差,所以这里就不再提供 Stata 读取的方法了。R 语言中可以使用 pdftools 包提取 pdf 文本:

# pdf 文本提取
library(tidyverse)
library(pdftools)

# 单个文本的提取
pdftools::pdf_text("pdf/000006_2022_2022年年度报告.pdf") -> text
text %>%
paste0(collapse = "") %>%
str_remove_all("[\\s\\n\\t\\d[a-z].]") -> text

多个 pdf 文本可以使用类似下面的代码:

# 从文件名中提取股票代码和年份
fs::dir_ls("pdf") %>%
as.character() %>%
as_tibble() %>%
tidyr::extract(col = value, into = c("code", "year"),
regex = "/(.*)_(\\d{4})_", remove = F) %>%
mutate(year = as.numeric(year)) -> fl

fl %>%
filter(year == 2001) %>%
mutate(text = map_chr(value, function(x){
pdftools::pdf_text(x) %>%
paste0(collapse = "") %>%
str_remove_all("[\\s\\n\\t\\d[a-z].]")
})) -> textdf2001

由于 pdf 文件名称都是使用类似 000006_2022_2022年年度报告.pdf 的格式,所以可以很容易提取股票代码和年份。

更多关于上市公司年报文本处理的内容可以学习下面的课程:

  1. 使用 R 语言爬取全部上市公司的年报数据:https://rstata.duanshu.com/#/brief/course/6e8f8a1c6b2e4784974b1087fcbfc52c
  2. 名师讲堂|上市公司数字赋能指数计算(数字技术应用程度指标):https://rstata.duanshu.com/#/brief/course/cc1ce9aa0d12492e8bffe65feac54c63
  3. R 语言文本分析:https://rstata.duanshu.com/#/brief/course/bf37cf50eef04d38b43541cc52114c96

文本分词、TF-IDF 分析

尽管在之前的文本分析课程中讲解过中文文本分析和 TD-IDF 分析等内容,处理这份数据对大家还是很困难的,因此我这边面向会员提供关于这份数据免费的词频统计和 TF-IDF 分析服务(不过处理结果会公开分享)。

点击这里跳转到 RStata 短书平台获取附件:2001~2022 年上市公司年报 PDF 文件合集

评论