新版本在这里:https://rstata.duanshu.com/#/course/3a535b05d3f840d3afe573f40883ec21
前不久给大家分享了一份截止 2023 年 8 月 31 日的土地出让结果公告数据:
2000~2023 年 8 月 31 日土地出让结果公告数据:https://rstata.duanshu.com/#/brief/course/51e3d0e4b14d4e138813bdc3522c11ba
以及一份带经纬度的工商注册信息:
1949~2020年工商企业注册信息(含经纬度及其所处的省市区县):https://rstata.duanshu.com/#/brief/course/ab51711bd3034f6c8b004b4be3a0114b
最近有小伙伴想把这两份数据匹配起来,由于两份数据都非常巨大(13GB 和 300GB),所以我就直接帮大家匹配好了。
在之前的课程「Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例」中我分享过使用 Stata 进行模糊匹配的方法,不过模糊匹配耗时耗力,并且错误率很高。不同于英文,中文企业名称只要有一个字不同都可能不是同一家企业(英文企业名称有一两个字母不同可能是因为笔误)。所以中文企业名称的模糊匹配没有意义。因此这里我还是使用了精确匹配,考虑到企业名称中经常会把“有限公司”和“有限责任公司”混用,以及有限公司改股份有限公司之类的。所以这里在匹配前删除了下面词汇:股份有限、集团有限、有限责任、有限、责任、股份、公司、厂、 、(集团)、(集团)、(、)、(、)、省、市、区、县、回族自治区、壮族自治区、维吾尔自治区、自治区。这样可以大大提高匹配成功率。
Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例:https://rstata.duanshu.com/#/brief/course/d4fb816566244662ab6359fa848f1f1e
附件中也提供了匹配使用的代码供大家参考。
数据匹配的方法都差不多,感兴趣的小伙伴也可以学习下面两个课程:
- 如何匹配中国工业企业数据库和海关数据库?以 2013 年为例:https://rstata.duanshu.com/#/brief/course/5463b8d7afcb438ca1e537fa76c1a45d
- 工企和污染数据是如何匹配的?使用 Stata 完成整个过程:https://rstata.duanshu.com/#/brief/course/7325758d0ad9457790215455dbcbcb1a
经过漫长的匹配过程,一共得到了将近 150 万条匹配结果:
![]()
各年数量分布如下:
![]()
不过需要注意的是,有差不多 20 万条匹配结果是个人购地的,这些实际上难以确认是匹配成功的结果。毕竟同名的人很多(不同的公司是不允许同名的),所以大家可以考虑使用下面的代码删去这些个人购地的记录:
*- 人名通常是三个字或者两个字的(Stata 中每个汉字的长度为 3) |
另外也有些四、五个字的可能也是人名,不过这些要谨慎删除,避免删除到不该删除的观测值。这些我并没有删除,是因为考虑到有些小伙伴会使用一些“宽松”的准则删除,例如同一个区县(购地人所处的区县和地块所在的区县相同)的同名人可以被视为同一个人,这些就不用删除了。
点击这里跳转到 RStata 短书平台获取附件:旧版本|土地出让数据与工商注册信息匹配结果(截止 2023 年 8 月 31 日)
评论