2001~2024 年上市公司年报中包含研发的句子情感分析

最近有培训班的小伙伴提出了这样一个问题:

老师,我需要对上市公司年报中包含“研发”的句子进行情感分析,从而找出积极和消极词频的数量,该怎么处理呢?

考虑到上市公司年报爬取和情感分析是个很困难的事情,于是我就直接帮大家计算好了 2001~2024 年上市公司年报中包含“研发”的句子情感分析结果。

数据概览

我用了三种情感词典进行分析,分别是:知网 Hownet 情感词典、清华大学李军中文褒贬义词典、台湾大学 NTUSD 简体中文情感词典。最终得到了如下数据集:

  • 根据清华大学李军中文褒贬义词典情感分析结果.xlsx

  • 根据台湾大学NTUSD简体中文情感词典情感分析结果.xlsx

  • 根据知网Hownet情感词典情感分析结果.xlsx

处理方法

具体处理方法可以学习平台上的课程:

R 语言文本分析:https://rstata.duanshu.com/#/course/bf37cf50eef04d38b43541cc52114c96

我还绘制了一幅图来展示 2001~2024 年上市公司年报中包含“研发”的句子情感分析:

绘图代码如下:

library(tidyverse)
readxl::read_xlsx("根据清华大学李军中文褒贬义词典情感分析结果.xlsx") -> df1
readxl::read_xlsx("根据台湾大学NTUSD简体中文情感词典情感分析结果.xlsx") -> df2
readxl::read_xlsx("根据知网Hownet情感词典情感分析结果.xlsx") -> df3

bind_rows(
df1 %>% mutate(class = "清华大学李军中文褒贬义词典"),
df2 %>% mutate(class = "台湾大学NTUSD简体中文情感词典情感"),
df3 %>% mutate(class = "知网Hownet情感词典情感")
) -> df

df %>%
group_by(year, class) %>%
summarise(中性 = mean(中性), 消极 = mean(消极), 积极 = mean(积极)) %>%
select(-中性) %>%
ungroup() %>%
gather(消极, 积极, key = "key", value = "value") %>%
type_convert() %>%
ggplot(aes(x = year, y = value, color = key,
linetype = class, shape = class), linewidth = 2, size = 4) +
geom_point() +
geom_line() +
scale_color_manual(values = c("#c40003", "#00c19b")) +
labs(x = "年份", y = "积极/消极词频平均数量", color = "情感分类",
linetype = "使用的情感词典", shape = "使用的情感词典",
title = "2001~2024 年上市公司年报中包含“研发”的句子情感分析",
caption = "数据来源:巨潮资讯网上市公司历年年报",
subtitle = "数据计算 & 绘图:微信公众号 RStata") +
theme(legend.position = c(0.3, 0.7),
plot.background = element_rect(fill = "white")) +
scale_x_continuous(breaks = seq(2000, 2024, by = 2))

上市公司年报爬取

在对上市公司年报中包含“研发”的句子进行情感分析之前,需要先爬取上市公司年报。上市公司年报可以从巨潮资讯网爬取,爬取方法可以参考平台上的课程:

  1. 使用 R 语言爬取全部上市公司的年报数据:https://rstata.duanshu.com/#/course/6e8f8a1c6b2e4784974b1087fcbfc52c
  2. 使用 Stata 爬取上市公司年报合集:https://rstata.duanshu.com/#/course/701bc76a7bca4be193c81ac9aeaee60b

由于巨潮资讯网只提供了 2000 年之后的年报文件,所以我只爬取了 2000 年之后的。全部上市公司年报的爬取结果可以查看平台上的资料:

2000~2024 年上市公司年报 PDF & TXT 文件合集:https://rstata.duanshu.com/#/course/05b850225f8344aa9d3b1a4127314f88

数据引用格式

由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:

RStata 数据中心: 2001~2024 年上市公司年报中包含研发的句子情感分析. 2025. https://tidyfriday.cn/rsdb2/

英文文献可以使用下面的格式引用:

RStata Data Center: Sentiment Analysis of R&D-Related Sentences in Annual Reports of Listed Companies, 2001–2024. 2025. https://tidyfriday.cn/rsdb2/

点击这里跳转到 RStata 短书平台获取附件:2001~2024 年上市公司年报中包含研发的句子情感分析

评论