2001~2024 年各上市公司数字转型关键词总词频及TF-IDF指标计算结果(吴非2021版本,基于全部年报文本)

今天给大家介绍一份 2001~2024 年各上市公司数字转型关键词总词频及TF-IDF指标计算结果。该数据由 RStata 基于吴非(2021)论文提出的关键词词典,从巨潮资讯网爬取的上市公司年报文本中提取并计算得到。

数据来源与处理方法

数据来源

原始数据为 2000~2024年上市公司年报 PDF 及 TXT 文件,从巨潮资讯网(http://www.cninfo.com.cn/)爬取,共计 5.5 万余份 PDF 文件(172GB)。本次分享的数据在此基础上筛选了 2001~2024 年的年报。

关键词体系(吴非 2021)

吴非等(2021)在《管理世界》发表的论文《企业数字化转型与资本市场表现——来自股票流动性的经验证据》中,构建了一套系统性的企业数字化转型词库,将关键词分为五大类别:

类别 关键词示例
人工智能技术 人工智能、机器学习、深度学习、自然语言处理、人脸识别、语音识别等
大数据技术 大数据、数据挖掘、文本挖掘、数据可视化、异构数据等
云计算技术 云计算、内存计算、分布式计算、流计算、图计算等
区块链技术 区块链、数字货币、智能金融合约、分布式计算等
数字技术运用 移动互联网、工业互联网、物联网、电子商务、移动支付等

该词库共计 76 个关键词,覆盖了企业数字化转型的主要技术方向和应用场景。

数据处理流程

数据处理采用 R 语言完成,主要流程如下:

Step 1:文本预处理与中文分词

library(tidyverse)
library(jiebaR)

# 初始化 jiebaR 分词引擎,加载停用词和自定义词典
engine_s <- worker(stop_word = "stopwords.txt", user = "dictionary.txt")

# 读取关键词词典
read_csv("dictionary.txt", col_names = F) -> word

Step 2:批量分词

library(parallel)

# 使用 36 核并行处理,加速大规模文本分词
makeCluster(36) -> cl
clusterExport(cl, "%>%")

fs::dir_ls("...", regexp = "txt$", type = "file") -> fls

fls %>%
parLapply(cl, ., function(x){
# 读取年报文本并进行中文分词
jiebaR::segment(paste0(readLines(x), collapse = ""), jiebar = engine_s) %>%
dplyr::as_tibble() %>%
dplyr::count(value, sort = T) %>%
readr::write_rds(paste0("txt2/", basename(x)))
}) -> res

Step 3:计算词频与 TF-IDF

library(tidytext)

textdf2 %>%
mutate(file = basename(file)) %>%
# 计算 TF-IDF:TF × IDF
bind_tf_idf(term = value, document = file, n = n) %>%
# 从文件名中提取股票代码和年份
tidyr::extract(col = file, into = c("code", "year"),
regex = "(.*)_(\\d{4})_") %>%
# 仅保留数字化转型关键词
filter(value %in% word$X1) %>%
# 按公司-年份汇总
group_by(code, year) %>%
summarise(tf_idf = sum(tf_idf, na.rm = T)) %>%
ungroup() -> textdf4

Step 4:与股票基本信息匹配

library(jsonlite)

# 从巨潮资讯网获取 A 股公司基本信息(股票代码、名称、类别)
fromJSON("http://www.cninfo.com.cn/new/data/szse_stock.json") -> lst
lst$stockList %>%
select(code, category, zwjc) -> codelist

textdf4 %>%
left_join(codelist) %>%
rename(股票代码 = code, 年份 = year, 类别 = category,
股票名称 = zwjc, 数字赋能指数 = tf_idf) -> df

df %>%
haven::write_dta("2001~2024年上市公司数字赋能指数(吴非2021TF-IDF).dta",
label = "数据计算:微信公众号 RStata")

附件中也提供了该数据的处理代码供参考:

数据概览

该数据汇总成了公司-年份面板的上市公司数字转型关键词词频及数字赋能指数,包含以下两个文件:

文件名 说明
2001~2024年各上市公司数字转型关键词总词频(吴非2021).dta 各公司各年数字化转型关键词总词频
2001~2024年上市公司数字赋能指数(吴非2021TF-IDF).dta 各公司各年数字赋能指数(TF-IDF 指标)

词频指标(Word Frequency)

将年报文本中所有数字化转型相关关键词的出现次数按类别归集并加总,反映企业年报中对数字化转型内容的绝对提及程度。

TF-IDF 指标(Term Frequency - Inverse Document Frequency)

其中 D 表示数字化转型关键词词典集合,TF 表示术语在单份年报中的出现频率,IDF 为逆文档频率(反映该词在全部年报中的罕见程度)。TF-IDF 越高,说明该企业在年报中越频繁地讨论数字化转型相关内容。

两个指标均可作为企业数字化转型程度的代理变量,可用于研究数字化转型对企业绩效、资本市场表现、创新产出等的影响。

数据预览如下:

图表展示

下图展示了过去 20 余年间 5 家典型上市公司数字化转型程度的变化趋势(词频指标):

下图同样展示 5 家典型公司的趋势,但使用 TF-IDF 指标(更能反映相对重要性):

下图是 2024 年部分上市公司数字赋能指数的词云图,直观展示哪些公司在年报中最频繁地讨论数字化转型:

下图展示了数字化转型关键词体系的结构化词图谱:

数据引用格式

由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:

RStata 数据中心: 2001~2024年各上市公司数字转型关键词总词频及TF-IDF指标计算结果(吴非2021版本,基于全部年报文本). 2026. https://tidyfriday.cn/rsdb2/

英文文献可以使用下面的格式引用:

RStata Data Center: Total Keyword Frequency and TF-IDF Index of Digital Transformation for Listed Companies, 2001–2024 (Wu Fei 2021 Version, Based on Full Annual Report Text). 2026. https://tidyfriday.cn/rsdb2/

关联课程/数据推荐

2001~2024 年各上市公司年报中包含数字转型的句子情感分析(吴非2021版本):https://rstata.duanshu.com/#/course/d8705fa45c234ab39f30278976f0ce31

R 语言文本分析:https://rstata.duanshu.com/#/course/bf37cf50eef04d38b43541cc52114c96

2000~2024 年上市公司年报 PDF & TXT 文件合集:https://rstata.duanshu.com/#/course/05b850225f8344aa9d3b1a4127314f88

R 语言:上市公司的省市分布和绘图展示(中国省市级填充地图和描点地图的绘制):https://rstata.duanshu.com/#/course/eeae4902aee94ab9b74138b13d560f88

R 语言:如何绘制上市公司投资网络图:https://rstata.duanshu.com/#/course/445a71cb9a82454fbc2b28ee398acd4c

点击这里跳转到 RStata 短书平台获取附件:2001~2024 年各上市公司数字转型关键词总词频及TF-IDF指标计算结果(吴非2021版本,基于全部年报文本)

评论