如何匹配中国工业企业数据库和海关数据库?以 2013 年为例

一直以来有很多小伙伴问我是否有工企和海关数据的匹配教程,这不,来了!本次课程中我们将以 2013 年的工企和海关数据匹配为例进行讲解。

按照田巍、余森杰(2013)中的方法,匹配大致分为两步:

  1. 按照企业名称匹配,企业名称相同的认定为同一家企业;
  2. 在上一步匹配失败的样本中,再按照邮政编码和最后 7 位电话号码进行匹配。

步骤很简单,但是实际操作起来却不容易,例如可能会遇到如下几个问题:

  1. 企业名称缺失的直接删除么?
  2. 电话号码和邮政编码缺失的直接删除么?
  3. 工企和海关数据都非常大,如果解决内存不足的问题?
  4. 企业名称里面存在很多错乱的字符,如何发现和更正?
  5. ……

这次课程中我们将一步步解决这些问题。

本次课程的主要内容包括:

  1. 如何清洗工企数据库和海关数据库里面的企业名称、组织机构代码等变量?
  2. 如何查找和解决企业名称重复和缺失的问题?
  3. 如何按照企业名称匹配数据?
  4. 如何按照邮政编码和固定电话匹配数据?
  5. 如何合并多次的匹配结果并去除重复值?
  6. 如何提高匹配的成功率?

课程中将会以 2013 年的数据为例进行讲解,按照课程中的匹配方法,2013 年的数据中我们可以匹配得到 83697 家公司的数据:

匹配结果

这个结果优于 田巍、余森杰(2013)论文中描述的结果(86379)。

点击这里跳转到 RStata 短书平台获取附件:如何匹配中国工业企业数据库和海关数据库?以 2013 年为例

评论