1985~2024 年全部专利 CD 指数计算结果

今天给大家分享一份 1985~2024 年全部专利 CD 指数计算结果。由 RStata 数据中心基于全部专利引用数据处理计算得到。

CD 指数(Consolidation-Destabilization Index)最早由 Funk 与 Owen-Smith 在 2017 年发表于《Management Science》的论文中系统提出,用于衡量一项专利对已有知识体系的”颠覆程度”。CD 指数的理论取值范围在 -1 至 1 之间:值越接近 1,说明该专利具有更强的创新突破性,能够取代已有技术路径;值越接近 -1,说明该专利更多地是对已有技术的巩固与整合;值为 0 则介于两者之间。CD 指数近年来被广泛应用于创新质量、技术轨迹演化等领域的实证研究,也被认为是衡量专利创新突破度的重要指标之一。

数据处理方法

本数据基于 RStata 整理的全部专利引用信息,具体处理流程如下:

第一步:准备引用数据

首先读取全部专利引用信息,筛选出申请日相差不超过 5 年的专利引用对:

# 读取专利引用数据
read_rds("patent_citations.rds") -> patent_citations

# 保留 5 年内的相互引用
patent_citations %>%
filter(date - date2 <= dyears(5) & date - date2 >= 0) -> patent_citations2

第二步:并行计算 CD 指数

对于每件专利 i,找出在 i 申请日之后申请、且引用了 i 的专利集合,以及引用了 i 的后向引用集合,然后按三种情形赋分:

  • 引用了 i,且同时引用 i 的后向引用专利 → cd = -1(巩固型)
  • 引用了 i,但未引用 i 的后向引用专利 → cd = 1(颠覆型)
  • 未引用 i,但引用了 i 的后向引用专利 → cd = 0(中间型)

对三种情形取均值,即为该专利的 CD 指数:

# 使用 16 核并行计算
library(parallel)
makeCluster(16) -> cl
parLapply(cl, testmat$newipzlid, function(x){
# 获取专利 i 的后向引用
patent_citations2 %>%
filter(newipzlid == x) %>%
pull(newipzlid2) -> backrefs

# 申请日期晚于 i 的引用关系
patent_citations2 %>%
filter(date >= testpat$date[1]) -> part0

# 三种分类并计算均值
suppressMessages({
part1 %>% inner_join(part2) %>% mutate(cd = -1) -> parta # 巩固型
part1 %>% anti_join(part2) %>% mutate(cd = 1) -> partb # 颠覆型
part2 %>% anti_join(part1) %>% mutate(cd = 0) -> partc # 中间型
})

tibble(newipzlid = x,
cd_index = mean(c(parta$cd, partb$cd, partc$cd), na.rm = T))
})

第三步:合并数据

将计算结果与专利基本信息(年份)合并,对无后向引用的专利赋 CD 指数为 1,最终输出 dta 格式文件:

# 合并年份信息并赋值
df0 %>%
select(newipzlid, 年份) %>%
left_join(dfall) %>%
mutate(cd_index = if_else(is.na(cd_index), 0, cd_index)) -> df1

# 保存为 dta 格式
df1 %>%
haven::write_dta("1985~2024年全部专利 CD 指数计算结果.dta",
label = "数据处理:微信公众号 RStata")

数据概览

为了方便大家使用,我把数据整理成了专利层面的 CD 指数面板数据,包含以下三个变量:

变量名 变量描述
newipzlid 专利唯一标识符(可与其他专利数据匹配)
年份 专利申请年份(1985~2024)
cd_index 专利 CD 指数,取值范围 -1 至 1

数据共覆盖 1985 年至 2024 年,包含约 4300 万条专利记录。数据预览如下:

图表展示

下图展示了 1985-2024 年各年专利数量及 CD 指数均值的时间趋势。可以看到,专利数量从 1985 年的不足 1 万件快速增长至 2020 年前后的近 500 万件;与此同时,CD 指数均值整体呈下降趋势,从 1985 年前后的较高水平逐步回落,反映出近年来专利创新更多集中于对已有技术的巩固与改进:

下图展示了 CD 指数的整体分布。大部分专利的 CD 指数集中在 0 附近,具有典型的右偏分布特征,而 CD 指数为 1(完全颠覆型)的专利构成了第二个峰值:

下图从历史时期的视角,对比了四个十年间的 CD 指数分布差异。通过箱线图可以看出,2015 年之后的专利在 CD 指数分布上与早期专利存在明显差异:

处理代码

以下是计算单个专利 CD 指数的核心 R 代码(以专利 20190809613 为例):

# 设定目标专利 ID
id <- 20190809613

# 获取所有引用了该专利的后继专利
patent_citations2 %>%
filter(newipzlid2 == id) -> testpat

# 准备该专利的后向引用集合
patent_citations2 %>%
filter(newipzlid == id) %>%
select(newipzlid2) %>%
pull(newipzlid2) -> backrefs

# 筛选申请日晚于该专利的引用关系
patent_citations2 %>%
filter(date >= testpat$date2[1]) -> part0

# 情形一:引用 i 且引用 backrefs → cd = -1
part1 %>% inner_join(part2) %>% mutate(cd = -1) -> parta
# 情形二:引用 i 未引用 backrefs → cd = 1
part1 %>% anti_join(part2) %>% mutate(cd = 1) -> partb
# 情形三:未引用 i 但引用 backrefs → cd = 0
part2 %>% anti_join(part1) %>% mutate(cd = 0) -> partc

# 计算 CD 指数均值
mean(c(parta$cd, partb$cd, partc$cd), na.rm = T)

附件中也提供了该数据的处理代码供参考:

数据引用格式

由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:

RStata 数据中心: 1985~2024年全部专利 CD 指数计算结果. 2026. https://tidyfriday.cn/rsdb2/

英文文献可以使用下面的格式引用:

RStata Data Center: CD Index Calculation Results for All Patents in China, 1985–2024. 2026. https://tidyfriday.cn/rsdb2/

关联课程/数据推荐

使用 R 语言测算专利的创新突破度:CD指数(更新):https://rstata.duanshu.com/#/course/3b00a43418ee43f194df7fa664ef0c7d

使用 Stata 测算专利的创新突破度 CD 指数:以上市公司专利数据为例(更新):https://rstata.duanshu.com/#/course/ca92eb2b71854c1b8a6cd74c66bd6c5e

1985~2024 年上市公司专利创新突破度 CD 指数计算结果(已更正):https://rstata.duanshu.com/#/course/c2efde2002ab407aa8dafbf7e2231397

1985~2024 年全部专利引用与被引用详细信息:https://rstata.duanshu.com/#/course/225ad0b59a9945e1831d2e8b96ca1001

1985~2024 年全部专利互引网络的中心度和 pagerank 指标计算结果:https://rstata.duanshu.com/#/course/ff4493bd341148e9bae565aef8cb3070

点击这里跳转到 RStata 短书平台获取附件:1985~2024 年全部专利 CD 指数计算结果

评论