在《Nature》论文:「Papers and patents are becoming less disruptive over time」 中使用了 CD 指数数据,该指标的计算公式如下:
![]()
其中当专利 j 引用了专利 i 时 fit 取1,否则取 0;若专利 j 引用了专利 i 的后向引用专利时 bit 取 1,否则取 0;
附件中也提供了该论文的 pdf 文件。
论文中也提供了一个示意图帮助我们理解这个指数:
![]()
看起来很复杂,其实只需要关注两个:
- 若后面的专利既引用专利 i 又引用专利 i 的后向引用专利,那么专利 i 的该项引用的 CD1 指数 -1;
- 若后面的专利只引用专利 i 但未引用专利 i 的后向引用专利,那么专利i的该项引用的 CDI 指数为 1;
- 其他的情况都是 0 ;
这样直接计算得到的是每个专利引用关系的 CD 指数,平均之后就得到了某个专利的 CD 指数。
今天的课程中我们将以上市公司专利为例进行讲解。
在计算之前我们需要准备两组数据:
- 一个是专利的引用关系,也就是每个专利引用了其他的哪些专利;
- 第二个是专利的属性信息,也就是每个公司每年申请了哪些专利。
这两个数据我们都分享过。全部专利的引用与被引用关系数据在这里:
1985~2024 年全部专利引用与被引用详细信息:https://rstata.duanshu.com/#/brief/course/225ad0b59a9945e1831d2e8b96ca1001;
由于全部的数据非常大,所以附件中仅仅提供了 2010 年前的数据作为样本,通过类似如下代码即可处理得到:
这部分代码就不用运行了,“全部专利引用与被引用信息分年.rds” 是一个超过 40 GB 的大数据,代码需要电脑性能足够好才能运行。
library(tidyverse) |
专利的属性信息就是上市公司专利匹配结果:
1985~2024 年上市公司与专利数据匹配结果(版本3, 含申请、授权信息):https://rstata.duanshu.com/#/brief/course/04100321f88b411f90429be934934bff
同样这个数据也是非常巨大,附件中提供了 “2010年上市公司与专利数据匹配结果.csv” 样本。
需要注意,如果想要计算 2010 年的专利 CD 指数,需要使用全部的 2010 年及之前的专利引用信息。因为这里需要专利引用的引用信息,2010 年的专利会引用 2010 年之前的专利,然后这些专利还会引用更早期的专利。
下面我们开始使用 Stata 处理,首先准备数据:
cd "~/Desktop/使用 Stata 测算专利的创新突破度:CD指数/" |
准备后向引用关系,也就是每个专利引用了哪些专利:
use patent_citations.dta, clear |
计算每次引用的 CD1 值:
*- 当专利 j 引用了专利 i 时 fit 取1,否则取 0; |
cd1_values 是专利引用对的结果,分组汇总就得到了专利层面的结果:
use cd1_values.dta, clear |
再分企业平均就可以计算企业年度的 CD 指数:
use cd2_values.dta, clear |
点击这里跳转到 RStata 短书平台获取附件:名师讲堂|使用 Stata 测算专利的创新突破度:CD指数(废弃)
评论