之前给大家更新了一份绿色专利数据:
1985~2022 年绿色专利申请数据(版本2,含申请人地址的经纬度及其所处的省市区县信息):https://rstata.duanshu.com/#/course/2934fd92b7624613a44048837a751900
最近有培训班的小伙伴需要将污染数据库和更新版的绿色专利数据进行匹配,但是数据量比较大,希望我能帮忙处理一下。污染数据库我之前也分享过:
1998~2014 年中国制造业排污整合数据库(dta 格式+原始数据):https://rstata.duanshu.com/#/course/db26ad2971af481596a2a24e648375d2
今天给大家分享的就是这份污染数据和绿色专利数据匹配的结果。
数据概览
数据的时间范围为 1998~2014 年,绿色专利数据里面有分类号和主分类号两个变量,所以匹配的结果也分为两种:
- 根据分类号筛选;
- 根据主分类号筛选。
为方便大家使用,我还对各污染库企业各种类型的专利申请数量进行了汇总,最终得到了 dta 格式的如下数据:
- 1998~2014年污染与绿色专利数据匹配结果(基于分类号筛选).dta
- 1998~2014年污染与绿色专利数据匹配结果(基于主分类号筛选).dta
- 1998~2014各污染库企业各种类型的绿色专利申请数量(基于分类号筛选).dta
- 1998~2014各污染库企业各种类型的绿色专利申请数量(基于主分类号筛选).dta
例如根据分类号筛选的 1998~2014 年各污染库企业各种类型的绿色专利申请数量:
![]()
匹配方法
结合绿色专利数据与污染数据库的变量,根据企业名称进行匹配。数据匹配的方法都差不多,感兴趣的小伙伴也可以学习下面两个课程:
- 如何匹配中国工业企业数据库和海关数据库?以 2013 年为例:https://rstata.duanshu.com/#/course/5463b8d7afcb438ca1e537fa76c1a45d
- 工企和污染数据是如何匹配的?使用 Stata 完成整个过程:https://rstata.duanshu.com/#/course/7325758d0ad9457790215455dbcbcb1a
注意事项
在计算绿色专利申请数量时需要注意,专利数据里面有很多申请和授权同时存在的专利,在统计专利数量的时候应该先去除这种重复情况:
![]()
统计的时候可以先去除公开公告号里面的 A、B、U、S。其中 A 代表发明专利的申请公开,B 代表发明专利的授权公告,U 代表实用新型专利的授权公告,S 代表外观设计专利的授权公告。
replace 公开公告号 = subinstr(公开公告号, "A", "", .) |
点击这里跳转到 RStata 短书平台获取附件:1998~2014 年污染与绿色专利数据匹配结果
评论