旧版本|1985~2022 年专利申请数据(版本2,含申请人地址的经纬度及其所处的省市区县信息)

新版本在这里:https://rstata.duanshu.com/#/brief/course/2397451274c546d3a36e156ffc865988

⚠️最近发现这个数据的一些年份(除了 21 和 22)观测值有点偏少,所以赶紧用之前那个版本的专利数据进行了补充,由于版本的专利数据里面没有授权信息,所以补充的专利还需要从谷歌专利上爬取授权信息,因此我先把去除授权信息的数据放到平台上,后面会再把授权信息补上。

之前给大家分享过一份1985~2019 年专利申请数据,最近有培训班的小伙伴分享了一份更全的专利数据,让我帮忙处理下。该数据的时间范围为 1985~2022 年,为了方便大家使用,我根据数据中的专利申请人地址解析了经纬度,并且根据经纬度和 2021 年行政区划判断了每个地址所在的省市区县。

1985~2019 年专利申请数据(含申请人地址的经纬度及其所处的省市区县信息):https://rstata.duanshu.com/#/course/b31ee35a9b2e4adb86c0717b86ac619e

数据中一共包含了超过 3729 万条专利申请数据,为了方便大家读取,我把数据拆分成了逐年的,例如 2020 年:

包含如下基本信息:

newzlid、年份、公开公告号、专利名称、专利类型、摘要、申请人、申请号、申请日、授权公布号、地址、主权项、发明设计人、分类号、主分类号、专利代理机构、分案原申请号、优先权、国际申请、国际公布、代理人、省份或国家代码、专利领域、专利学科、多次公布、城市、所属国省、公开公告日、省、省代码、市、市代码、县、县代码、纬度、经度、参考文献、代码、发布路径、范畴分类、国别、名称、申请国代码、申请来源、邮编、页数、专利号、颁证日、审查员、进入国家日期、摘要附图存储路径

其中 newzlid 是我给每条专利的编号。包含 newzlid 变量的数据可以直接和这个数据使用该变量匹配。

这次更新的数据中 newzlid 变量也是重新生成的,之前的旧版本数据建议大家不要再用了。

newzlid 的生成方法如下:

forval y = 1985/2022 {
di "`y'"
qui {
use "newpatentdata_coord2/`y'patent_v2_coord.dta", clear
cap drop newzlid
gen newzlid = string(`y' * 10^strlen("`=_N'") + _n, "%12.0f")
order newzlid
compress
foreach i of varlist _all {
cap format `i' %10s
}
save "newpatentdata_coord2/`y'patent_v2_coord.dta", replace
}
}

考虑到数据非常大,所以我帮大家汇总好了各年各种类型专利申请数量结果、各年各省市区县各类型专利数量结果(附件中有提供),例如下图展示了 1985~2022 年各种类型专利申请数量分布:

各年各省市区县各类型专利数量如下图所示:

这里需要注意的是,专利数据里面有很多申请和授权同时存在的专利,在统计专利数量的时候应该先去除这种重复情况:

统计的时候可以先去除公开公告号里面的 A、B、U、S。其中 A 代表发明专利的申请公开,B 代表发明专利的授权公告,U 代表实用新型专利的授权公告,S 代表外观设计专利的授权公告。

*- 统计每年观测值的数量
cap mkdir "汇总结果"
forval y = 1985/2022 {
use newpatentdata_coord2/`y'patent_v2_coord.dta, clear
keep 专利类型 公开公告号
replace 公开公告号 = subinstr(公开公告号, "A", "", .)
replace 公开公告号 = subinstr(公开公告号, "B", "", .)
replace 公开公告号 = subinstr(公开公告号, "U", "", .)
replace 公开公告号 = subinstr(公开公告号, "S", "", .)
replace 专利类型 = "发明" if index(专利类型, "发明")
*- 使用 duplicates drop 去除重复的
duplicates drop 公开公告号, force

*- 统计不同类型专利的数量
contract 专利类型
gen 年份 = `y'
save 汇总结果/`y', replace
}

还可以绘图展示各年专利申请人的地址,例如下图展示了 2020 年专利申请人的地址分布(使用 Stata 绘制):

注意事项

  1. 之前分享的 1985~2019 年专利申请数据中,2017 及之后年份的不太全,请谨慎使用。
  2. 本次分享的 1985~2022 年专利申请数据中,2021 和 2022 年的不太全,使用时也需要注意。
  3. 两份专利数据各有优势。这是因为两份专利数据包含的字段有所差异,例如之前分享的数据中包含主权项等信息,而本次分享的数据中包含授权等信息,因此大家可以根据自己的需要选择使用的数据。之后我们还会将该数据与工企、上市公司等数据进行匹配,感兴趣的小伙伴敬请期待。

地址解析及判断省市区县

经度、纬度是根据申请人地址和申请人名称(如果是企业的话)使用高德地图地理编码和百度地图地理编码接口解析得到的(高德解析不成功的再使用百度解析)。直接解析得到的结果是 GCJ02 坐标,这里我已经转换成了 WGS84 坐标系,可以放心使用。

省、省代码、市、市代码、县、县代码是根据经纬度和 2021 年行政区划数据判断得到。关于如何使用 R 语言或者 Stata 进行地理编码以及根据经纬度判断所处的省市区县,感兴趣的小伙伴可以学习下面两个课程:

点击这里跳转到 RStata 短书平台获取附件:旧版本|1985~2022 年专利申请数据(版本2,含申请人地址的经纬度及其所处的省市区县信息)

评论