旧版本|1985~2022 年上市公司与专利数据匹配结果(版本2)

新版本在这里:https://rstata.duanshu.com/#/course/04100321f88b411f90429be934934bff

前不久给大家分享了一份专利全库数据:

最近有培训班的小伙伴提出可以考虑使用上市公司和专利数据进行匹配,上市公司的数据我之前也分享过:

所以今天给大家分享的就是这份上市公司数据和专利数据匹配的结果。

匹配结果

上市公司和专利数据匹配结果的时间范围 1985~2022 年(这里没有考虑上市公司上市和退市的问题,大家如果需要考虑的话,可以再处理),不过由于使用的专利数据库中的 2021 和 2022 年数据不全,所以匹配结果的 2021 和 2022 年数据也是不全的。建议使用 1985~2020 年部分的,各年匹配到的专利数量如下:

作为对比,上图还展示了国泰安提供的上市公司和专利数据匹配结果,可以看出,我们匹配的结果中包含了更多的专利,比国泰安的数据更全一些。

提供的数据包含两份:

  1. 1985~2022 年上市公司与专利数据匹配结果.dta
  2. 1985~2022 年上市公司专利申请数量.dta

1985~2022 年上市公司与专利数据匹配结果数据是直接使用上市公司数据和专利数据匹配得到的,包含上市公司的变量和专利的变量,每条观测值是一条专利,数据预览如下:

1985~2022 年上市公司专利申请数量数据预览如下:

匹配方法

匹配方法是使用上市公司的公司全名/曾用名和专利数据库中的申请人变量进行匹配,由于每个专利对应的申请人有多个,所以同一个专利可能会匹配到多个公司。

在计算上市公司专利申请数量时需要注意,专利数据里面有很多申请和授权同时存在的专利,在统计专利数量的时候应该先去除这种重复情况:

统计的时候可以先去除公开公告号里面的 A、B、U、S。其中 A 代表发明专利的申请公开,B 代表发明专利的授权公告,U 代表实用新型专利的授权公告,S 代表外观设计专利的授权公告。

replace 公开公告号 = subinstr(公开公告号, "A", "", .)
replace 公开公告号 = subinstr(公开公告号, "B", "", .)
replace 公开公告号 = subinstr(公开公告号, "U", "", .)
replace 公开公告号 = subinstr(公开公告号, "S", "", .)
replace 专利类型 = "发明" if index(专利类型, "发明")
*- 使用 duplicates drop 去除重复的
duplicates drop 公开公告号, force

点击这里跳转到 RStata 短书平台获取附件:旧版本|1985~2022 年上市公司与专利数据匹配结果(版本2)

评论