旧版本|上市公司与专利数据匹配结果(1985~2019年)

新版本在这里:https://rstata.duanshu.com/#/course/04100321f88b411f90429be934934bff

之前给大家分享过上市公司与专利数据库匹配结果。最近更新了上市公司的数据:

×

然后前不久还新处理了一份上市公司工商企业注册信息数据:

×

所以今天再把这份上市公司和专利数据的匹配结果更新下。

匹配方法是使用上市公司的公司全名/曾用名和专利数据库中的申请人变量进行匹配,由于每个专利对应的申请人有多个,所以同一个专利可能会匹配到多个公司。

上市公司和专利数据匹配结果的时间范围 1985~2019 年(这里没有考虑上市公司上市和退市的问题,大家如果需要考虑的话,可以再处理),不过由于使用的专利数据库中的 2017~2019 年数据不全,所以匹配结果的 2017~2019 年数据也是不全的。建议使用 1985~2016 年部分的,各年匹配到的专利数量如下:

年份 本数据匹配结果 国泰安数据匹配结果
1985 25 无数据
1986 36 无数据
1987 72 无数据
1988 42 无数据
1989 33 无数据
1990 60 2
1991 106 1
1992 163 16
1993 149 24
1994 282 61
1995 282 72
1996 394 178
1997 585 287
1998 774 411
1999 1590 1102
2000 2709 1518
2001 4244 2709
2002 6149 3707
2003 8980 4626
2004 11557 5928
2005 18267 8163
2006 26457 11848
2007 37845 17433
2008 47861 20608
2009 62608 27331
2010 80720 36666
2011 102345 51925
2012 125860 61677
2013 139323 67499
2014 153071 80716
2015 172128 95497
2016 176639 105312
2017 165029 86973
2018 131402 无数据
2019 12038 无数据

下图更为直观:

作为对比,上表和图中还展示了国泰安提供的上市公司和专利数据匹配结果,可以看出,我们匹配的结果中包含了更多的专利,比国泰安的数据更全一些。

提供的数据包含两份:

  1. 上市公司与专利数据匹配结果.dta
  2. 上市公司专利申请数量面板数据(1985~2019).dta

第一份数据是直接使用上市公司数据和专利数据匹配得到的,包含上市公司的变量和专利的变量,每条观测值是一条专利,包含如下变量:

年份, 股票代码, 股票名称, 公司名称, 企业名称, 成立日期, 标签, 法人代表, 注册资本, 实缴资本, 经营状态, 统一社会信用代码, 工商注册号, 纳税人识别号, 组织机构代码, 企业类型, 行业, 核准日期, 登记机关, 营业期限, 纳税人资质, 人员规模, 参保人数, 曾用名, 英文名, 注册地址, 经营范围, 成立年份, zlid, 地址, 国别, 申请日, 分类号, 主分类号, 公开公告日, 申请人, 参考文献, 代理人, 代码, 分案原申请号, 发布路径, 范畴分类, 发明设计人, 公开公告号, 名称, 申请国代码, 申请号, 申请来源, 邮编, 页数, 优先权, 专利代理机构, 专利号, 专利类型, 主权项, 摘要, 颁证日, 审查员, 国际公布, 国际申请, 进入国家日期, 摘要附图存储路径

预览如下:

第二份数据是对第一份数据进行了汇总,生成了如下变量:

  1. 设计型专利
  2. 发明型专利
  3. 实用型专利
  4. 总专利数量

另外进行了平衡化的处理(是个完全平衡面板)。

处理数据

由于专利数据暂时不便分享,所以仅提供一份 do 文件(Stata 脚本)方便对处理过程感兴趣的小伙伴学习。

特别需要掌握的代码可能是下面这段专利计数和平衡面板生成的:

*- 生成平衡面板交叉数据集
clear
set obs 35
gen 年份 = _n + 1984
cross using 上市公司工商注册信息.dta
save "平衡面板数据", replace

*- 统计每个上市公司的各种类型专利数量
use 上市公司与专利数据匹配结果.dta, clear
collapse (count) zlid, by(股票代码 年份 专利类型)
replace 专利类型 = "i" if 专利类型 == "发明型专利"
replace 专利类型 = "u" if 专利类型 == "实用型专利"
replace 专利类型 = "d" if 专利类型 == "设计型专利"
spread 专利类型 zlid
merge m:1 股票代码 年份 using 平衡面板数据
drop _m

replace i = 0 if missing(i)
replace d = 0 if missing(d)
replace u = 0 if missing(u)
gen 总专利数量 = i + d + u
ren i 发明型专利
ren u 实用型专利
ren d 设计型专利
order 年份 股票代码 设计型专利 发明型专利 实用型专利 总专利数量
destring 股票代码, replace
xtset 股票代码 年份
save "上市公司专利申请数量面板数据(1985~2019)", replace

点击这里跳转到 RStata 短书平台获取附件:旧版本|上市公司与专利数据匹配结果(1985~2019年)

评论