1998~2014 年污染与专利数据匹配结果

之前给大家分享过专利数据库:

1985~2022 年专利申请数据(版本2,含申请人地址的经纬度及其所处的省市区县信息):https://rstata.duanshu.com/#/course/edef981592a64257aa41e2b6d6d21746

也给大家分享过企业污染数据库:

1998~2014 年中国制造业排污整合数据库(dta 格式+原始数据):https://rstata.duanshu.com/#/course/db26ad2971af481596a2a24e648375d2

最近有小伙伴想把这两份数据匹配起来,由于两份数据都非常巨大,所以我就直接帮大家匹配好了。

匹配结果

污染与专利数据匹配结果的时间范围为 1998~2014 年,经过匹配之后一共得到了 120.9 万条匹配结果:

包含的变量如下:

wrid、newzlid、年份、公开公告号、专利名称、专利类型、摘要、申请人、申请号、申请日、授权公布号、地址、主权项、发明设计人、分类号、主分类号、专利代理机构、分案原申请号、优先权、国际申请、国际公布、代理人、省份或国家代码、专利领域、专利学科、多次公布、城市、所属国省、公开公告日、省、省代码、市、市代码、县、县代码、纬度、经度、参考文献、代码、发布路径、范畴分类、国别、名称、申请国代码、申请来源、邮编、页数、专利号、颁证日、审查员、进入国家日期、摘要附图存储路径

其中 newzlid 是我给每条专利的编号。包含 newzlid 变量的数据可以直接和这个数据使用该变量匹配。wrid 是我给污染库每条观测值的编号,可以和平台上的污染库进行匹配。

为方便大家使用,我还对各污染库企业各种类型的专利申请数量进行了汇总,一共得到了 165.2 万条结果:

下图展示了历年各污染库企业各种类型的专利申请数量:

匹配方法

结合专利数据与污染数据库的变量,根据企业名称进行匹配。在之前的课程「Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例」中,我分享过使用 Stata 进行模糊匹配的方法,不过模糊匹配耗时耗力,并且错误率很高。不同于英文,中文企业名称只要有一个字不同都可能不是同一家企业(英文企业名称有一两个字母不同可能是因为笔误)。所以中文企业名称的模糊匹配没有意义。因此这里我还是使用了精确匹配,考虑到企业名称中经常会把“有限公司”和“有限责任公司”混用,以及有限公司改股份有限公司之类的。所以这里在匹配前删除了下面词汇:股份有限、集团有限、有限责任、有限、责任、股份、公司、厂、 、(集团)、(集团)、(、)、(、)、省、市、区、县、回族自治区、壮族自治区、维吾尔自治区、自治区。这样可以大大提高匹配成功率。

Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例:https://rstata.duanshu.com/#/course/d4fb816566244662ab6359fa848f1f1e

数据匹配的方法都差不多,感兴趣的小伙伴也可以学习下面两个课程:

注意事项

在计算专利申请数量时需要注意,专利数据里面有很多申请和授权同时存在的专利,在统计专利数量的时候应该先去除这种重复情况:

统计的时候可以先去除公开公告号里面的 A、B、U、S。其中 A 代表发明专利的申请公开,B 代表发明专利的授权公告,U 代表实用新型专利的授权公告,S 代表外观设计专利的授权公告。

replace 公开公告号 = subinstr(公开公告号, "A", "", .)
replace 公开公告号 = subinstr(公开公告号, "B", "", .)
replace 公开公告号 = subinstr(公开公告号, "U", "", .)
replace 公开公告号 = subinstr(公开公告号, "S", "", .)
replace 专利类型 = "发明" if index(专利类型, "发明")
*- 使用 duplicates drop 去除重复的
duplicates drop wrid 公开公告号, force

点击这里跳转到 RStata 短书平台获取附件:1998~2014 年污染与专利数据匹配结果

评论