注意看结尾介绍,统计数量的时候记得去除重复的专利。
之前给大家分享过 1998~2014 年工企数据与专利数据匹配结果:
×

最近有小伙伴提出,当年的申请量可能不足以反映企业的创新能力变化,使用每一年的工企数据与本年及未来三年的专利数据进行匹配得到的结果会更全面。
因此这一次我匹配了工企本年及未来三年的专利申请结果。例如 1998 年的工企会和 1998~2001 四年的专利数据进行匹配。
最终得到了 1595 万条专利匹配结果:

如果需要统计专利数量的话,可以使用下面的代码汇总:
use "1998~2014年工企与本年及未来三年专利数据匹配结果.dta", clear collapse (count) zlid, by(年份 企业名称 组织机构代码 企业匹配唯一标识码 专利年份) gen class = "当年" if 年份 == 专利年份 replace class = "第二年" if 年份 == 专利年份 - 1 replace class = "第三年" if 年份 == 专利年份 - 2 replace class = "第四年" if 年份 == 专利年份 - 3 drop 专利年份 spread class zlid foreach i in 当年 第三年 第二年 第四年 { replace `i' = 0 if `i' == . } save "1998~2014年工企本年及未来三年专利申请数量.dta", replace
|
下图展示了历年工企当年、第二年、第三年和第四年的专利申请量:

由于数据非常大,所以我还提供了一份分拆版的:

无法直接读取完整版的小伙伴可以逐年处理再合并处理结果。
另外也可以使用一点点读取的方法,例如读取前 100 行:use in 1/100 using 文件, clear,通常一次读取 100 万行问题不大(总共是 15950783 行)。
如果想分专利类型统计申请量可以这样:
use 1998~2014年工企与本年及未来三年专利数据匹配结果.dta, clear collapse (count) zlid, by(年份 企业名称 组织机构代码 企业匹配唯一标识码 专利年份 专利类型) gen class = "当年" if 年份 == 专利年份 replace class = "第二年" if 年份 == 专利年份 - 1 replace class = "第三年" if 年份 == 专利年份 - 2 replace class = "第四年" if 年份 == 专利年份 - 3 drop 专利年份 spread class zlid foreach i in 当年 第三年 第二年 第四年 { replace `i' = 0 if `i' == . } save "各种类型专利的本年及未来三年的申请量", replace
|
注意事项
之前分享的工企专利匹配结果中的 1998~2009 年部分使用的是 Chinese Patent Data Project 网站提供的结果,匹配数量更多。而这一次分享的数据里面的结果是完全直接匹配的,所以数量会少一些。

注意事项
在计算工企专利申请数量时需要注意,专利数据里面有很多申请和授权同时存在的专利,在统计专利数量的时候应该先去除这种重复情况:

统计的时候可以先去除公开公告号里面的 A、B、U、S。其中 A 代表发明专利的申请公开,B 代表发明专利的授权公告,U 代表实用新型专利的授权公告,S 代表外观设计专利的授权公告。
replace 公开公告号 = subinstr(公开公告号, "A", "", .) replace 公开公告号 = subinstr(公开公告号, "B", "", .) replace 公开公告号 = subinstr(公开公告号, "U", "", .) replace 公开公告号 = subinstr(公开公告号, "S", "", .) replace 专利类型 = "发明" if index(专利类型, "发明")
duplicates drop 公开公告号, force
|
点击这里跳转到 RStata 短书平台获取附件:1998~2017 年工企与本年及未来三年专利匹配结果
评论