2001~2024 年上市公司数字赋能指数面板数据计算结果(包群2023版本,基于全部年报文本)

今天给大家分享一份 2001~2024 年上市公司数字赋能指数面板数据计算结果(包群2023版本,基于全部年报文本)。

「经济研究」2023 年 6 月刊里面有篇论文《国内贸易网络、地理距离和供应商本地化》中使用了上市公司数字赋能指数的数据来反映上市公司数字技术的应用程度。该指标的计算方法如下:

其中 D 表示数字赋能指标词典集合,包括如下词语:AI技术、人工智能、计算机技术、信息技术、智能化、自动化、神经网络、虚拟现实、数据科学、数据挖掘、数字化、信息化战略、信息化、生物识别、人脸识别、机器学习、深度学习、自然语言处理、图像识别、语音识别、云计算、云平台、云安全、物联网、大数据。

在之前的课程「名师讲堂|上市公司数字赋能指数计算(数字技术应用程度指标)」中,我们分享了该方法的 R 语言实现方法。考虑到处理上市公司的年报是个很困难的事情,于是我就直接帮大家处理好了。

名师讲堂|上市公司数字赋能指数计算(数字技术应用程度指标): https://rstata.duanshu.com/#/brief/course/cc1ce9aa0d12492e8bffe65feac54c63

上市公司年报可以从巨潮资讯网爬取,爬取方法可以参考平台上的系列课程「R 语言文本分析」:

R 语言文本分析:https://rstata.duanshu.com/#/brief/course/bf37cf50eef04d38b43541cc52114c96

由于巨潮资讯网只提供了 2000 年之后的年报文件,所以我只爬取了 2000 年之后的。

数据概览

为了方便大家使用,我把数据汇总成了上市公司层面的面板数据。

数据包含以下变量:

  • 股票代码:上市公司的股票代码
  • 年份:2001~2024 年
  • 数字赋能指数:基于 TF-IDF 方法计算的上市公司数字技术应用程度指标
  • 类别:上市公司所属类别(如主板、创业板等)
  • 股票名称:上市公司简称

数据预览如下:

图表展示

下图展示了 2001~2024 年 5 家上市公司数字技术应用程度指标计算结果:

数字赋能指数时间趋势:

数字赋能指数分布:

各时间段数字赋能指数箱线图:

重点上市公司数字赋能指数趋势对比:

各年样本数量面积图:

处理代码

本数据使用 R 语言进行处理,主要步骤包括:

  1. 从巨潮资讯网获取上市公司年报文本数据
  2. 使用 jiebaR 包进行中文分词
  3. 基于 TF-IDF 方法计算数字赋能指数

核心处理代码如下:

library(tidyverse)
library(jiebaR)

#- 分词引擎:需要停用词字典和用户字典
engine_s <- worker(stop_word = "stopwords.txt", user = "dictionary.txt")
read_csv("dictionary.txt", col_names = F) -> word

dir.create("txt2")

library(parallel)
makeCluster(36) -> cl
clusterExport(cl, "%>%")

fs::dir_ls("/Volumes/C16T/大数据/2000~2024年上市公司年报(TXT版本)",
recurse = T, regexp = "txt$") -> fl

#- 并行分词处理
parLapply(cl, fl, function(x){
require(jiebaR)
engine_s <- jiebaR::worker(stop_word = "stopwords.txt", user = "dictionary.txt")
jiebaR::segment(paste0(readLines(x), collapse = ""), jiebar = engine_s) %>%
dplyr::as_tibble() %>%
dplyr::count(value, sort = T) %>%
readr::write_rds(paste0("txt2/", basename(x)))
}) -> res

fs::dir_ls("txt2") -> fl2

#- 合并分词结果
parLapply(cl, fl2, function(x){
readr::read_rds(x) %>%
dplyr::mutate(file = x)
}) %>%
bind_rows() -> textdf2

library(tidytext)

#- 计算 TF-IDF
textdf2 %>%
mutate(file = basename(file)) %>%
bind_tf_idf(term = value, document = file, n = n) %>%
mutate(file = basename(file)) %>%
tidyr::extract(col = file, into = c("code", "year"),
regex = "(.*)_(\\d{4})_") %>%
filter(value %in% word$X1) %>%
group_by(code, year) %>%
summarise(tf_idf = sum(tf_idf, na.rm = T)) %>%
ungroup() -> textdf4

#- 添加股票名称和类别信息
library(jsonlite)
fromJSON("http://www.cninfo.com.cn/new/data/szse_stock.json") -> lst
lst$stockList %>%
as_tibble() %>%
select(code, category, zwjc) -> codelist

textdf4 %>%
left_join(codelist) %>%
rename(股票代码 = code, 年份 = year, 类别 = category,
股票名称 = zwjc, 数字赋能指数 = tf_idf) -> df

#- 保存结果
df %>%
writexl::write_xlsx("2001~2024年上市公司数字赋能指数.xlsx")

df %>%
haven::write_dta("2001~2024年上市公司数字赋能指数.dta",
label = "数据计算:微信公众号 RStata")

附件中也提供了该数据的处理代码供参考:

数据引用格式

由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:

RStata 数据中心: 2001~2024 年上市公司数字赋能指数面板数据计算结果(包群2023版本,基于全部年报文本). 2026. https://tidyfriday.cn/rsdb2/

英文文献可以使用下面的格式引用:

RStata Data Center: Panel Data on Digital Empowerment Index of Listed Companies, 2001–2024 (Bao Group 2023 Version, Based on Full Annual Report Texts). 2026. https://tidyfriday.cn/rsdb2/

关联课程/数据推荐

2000~2024 年上市公司年报 PDF & TXT 文件合集:https://rstata.duanshu.com/#/course/05b850225f8344aa9d3b1a4127314f88

使用 R 语言爬取全部上市公司的年报数据:https://rstata.duanshu.com/#/course/6e8f8a1c6b2e4784974b1087fcbfc52c

R 语言文本分析:https://rstata.duanshu.com/#/course/bf37cf50eef04d38b43541cc52114c96

使用 R 语言处理港股年报计算数字赋能指数(繁体文本的文本分析):https://rstata.duanshu.com/#/course/0c6f289941e141199752ca04ba895f62

名师讲堂|Stata 中文文本分析:https://rstata.duanshu.com/#/course/b6a9efd94e5a48c2bba52dc9fdfd4291

如果您有相关的数据定制需求,也可以联系李老师付费定制。

点击这里跳转到 RStata 短书平台获取附件:2001~2024 年上市公司数字赋能指数面板数据计算结果(包群2023版本,基于全部年报文本)

评论