新版本在这里:https://rstata.duanshu.com/#/course/445615ebbb8f424d87445bb2b4a292b5
之前给大家分享过一份带经纬度的工商企业注册信息:
1949~2020 年工商企业注册信息(含经纬度及其所处的省市区县):https://rstata.duanshu.com/#/course/ab51711bd3034f6c8b004b4be3a0114b
也给大家分享过企业污染数据库:
1998~2014 年中国制造业排污整合数据库(dta 格式+原始数据):https://rstata.duanshu.com/#/course/db26ad2971af481596a2a24e648375d2
最近有小伙伴想把这两份数据匹配起来,由于两份数据都非常巨大,所以我就直接帮大家匹配好了。
为了避免数据过大,所以这个数据只是公司名称(或组织机构代码)和工商注册信息的匹配 ,使用的话,可以用公司名称再和污染数据匹配下就好了。数据的时间范围为 1998~2014 年,企业污染库与工商注册数据匹配结果概览如下:
![]()
包含的变量如下:
wrid、公司名称、组织机构代码、ID、公司ID、公司名称、法人代表、注册资本、实缴资本、成立日期、经营状态、统一社会信用代码、工商注册号、纳税人识别号、组织机构代码、企业类型、行业、核准日期、登记机关、营业期限、纳税人资质、人员规模、参保人数、曾用名、英文名、注册地址、经营范围、邮箱、标签、成立年份、省份、经度、纬度、省、省代码、市、市代码、县、县代码、frdm
匹配结果
为了让大家更直观地感受这份数据,我还绘制了一幅图进行展示。下图展示了企业污染库与工商注册数据每年匹配成功的数量:
![]()
匹配方法
结合企业污染库与工商企业注册信息的变量,我选择了两种匹配方式。
首先根据企业名称进行匹配。在之前的课程「Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例」中,我分享过使用 Stata 进行模糊匹配的方法,不过模糊匹配耗时耗力,并且错误率很高。不同于英文,中文企业名称只要有一个字不同都可能不是同一家企业(英文企业名称有一两个字母不同可能是因为笔误)。所以中文企业名称的模糊匹配没有意义。因此这里我还是使用了精确匹配,考虑到企业名称中经常会把“有限公司”和“有限责任公司”混用,以及有限公司改股份有限公司之类的。所以这里在匹配前删除了下面词汇:股份有限、集团有限、有限责任、有限、责任、股份、公司、厂、 、(集团)、(集团)、(、)、(、)、省、市、区、县、回族自治区、壮族自治区、维吾尔自治区、自治区。这样可以大大提高匹配成功率。
Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例:https://rstata.duanshu.com/#/course/d4fb816566244662ab6359fa848f1f1e
之后再对没有匹配成功的使用组织机构代码进行匹配,最后合并两部分的匹配结果,就得到了我们需要的数据,附件中也提供了匹配使用的代码供大家参考。
数据匹配的方法都差不多,感兴趣的小伙伴也可以学习下面两个课程:
- 如何匹配中国工业企业数据库和海关数据库?以 2013 年为例:https://rstata.duanshu.com/#/course/5463b8d7afcb438ca1e537fa76c1a45d
- 工企和污染数据是如何匹配的?使用 Stata 完成整个过程:https://rstata.duanshu.com/#/course/7325758d0ad9457790215455dbcbcb1a
点击这里跳转到 RStata 短书平台获取附件:旧版本|1998~2014 年企业污染库与工商注册信息匹配结果
评论