2001~2022 年上市公司数字赋能指数面板数据计算结果(包群(2023)版本)

「经济研究」2023 年 6 月刊里面有篇论文 <国内贸易网络、地理距离和供应商本地化>中使用了上市公司数字赋能指数的数据来反映上市公司数字技术的应用程度。该指标的计算方法如下:

其中 D 表示数字赋能指标词典集合,包括如下词语:AI技术、人工智能、计算机技术、信息技术、智能化、自动化、神经网络、虚拟现实、数据科学、数据挖掘、数字化、信息化战略、信息化、生物识别、人脸识别、机器学习、深度学习、自然语言处理、图像识别、语音识别、云计算、云平台、云安全、物联网、大数据(最后一个大数据是我自己加的,感觉不能少了这个)。

在之前的课程「名师讲堂|上市公司数字赋能指数计算(数字技术应用程度指标)」中,我们分享了该方法的 R 语言实现方法。考虑到处理上市公司的年报是个很困难的事情,于是我就直接帮大家处理好了。

上市公司年报可以从巨潮资讯网爬取,爬取方法可以参考平台上的系列课程「R 语言文本分析」:

R 语言文本分析:https://rstata.duanshu.com/#/brief/course/bf37cf50eef04d38b43541cc52114c96

由于巨潮资讯网只提供了 2000 年之后的年报文件,所以我只爬取了 2000 年之后的。合计 55475 份 pdf 文件,172GB,基于此即可计算上市公司数字赋能指数。

计算方法不难,不过计算量非常巨大。计算过程包含文本提取、中文文本分词和 TF-IDF 计算三步。

计算结果我提供两种格式的:

  1. 供 Stata 读取的 dta 格式;
  2. 供 Excel 读取的 xlsx 格式。

下图展示了数据中 5 家上市公司数字赋能指数的变化:

绘图代码如下:

library(tidyverse)
library(ggforce)
haven::read_dta("2001~2022年上市公司数字赋能指数.dta") -> df
df %>%
filter(股票代码 %in% c("000001", "000002", "000004", "000005", "000006")) %>%
ggplot(aes(年份, 数字赋能指数, color = 股票代码)) +
geom_point() +
geom_bspline(linewidth = 1.2) +
labs(x = "", y = "数字赋能指数(TF-IDF)", color = "",
title = "2001~2022 年 5 家上市公司数字技术应用程度指标计算结果(数字赋能指数)",
subtitle = "数据处理&绘图:微信公众号 RStata",
caption = "数据来源:巨潮资讯网<http://www.cninfo.com.cn/>") +
scale_color_manual(values = c("#e64b35", "#4dbbd5", "#00a087", "#3c5488", "#f39b7f")) +
theme(legend.position = "top",
plot.background = element_rect(fill = "white", color = "white")) +
scale_x_continuous(breaks = seq(2001, 2022, by = 2))

下图展示 2022 年所有上市公司数字赋能指数词云图(R 语言绘制,绘图代码见附件中):

点击这里跳转到 RStata 短书平台获取附件:旧版本|2001~2022 年上市公司数字赋能指数面板数据计算结果(包群(2023)版本)

评论