2000~2014 年工企海关匹配结果数据(更新版,含 gqid 和 hgid 变量)

对这份数据感兴趣的小伙伴建议认真阅读下面的介绍~ 这样才能更好的使用这份数据。

之前给大家分享过一份工企数据库和海关数据库的匹配结果数据:2000~2014 年工企和海关匹配数据 这份数据的匹配包含下面 5 个步骤:

  1. 清洗工企数据库里面的企业名称、邮政编码和固定电话变量(等下要用这三个变量进行匹配);
  2. 清洗海关数据库里面的企业名称、邮编和电话变量;
  3. 在工企数据库里面生成一个 ID 变量用以在匹配过程中识别每个观测值,然后只保留企业名称、邮政编码和固定电话、年份、ID 几个变量(这样可以避免因为数据过大导致匹配过程过慢);
  4. 对海关数据库进行汇总(例如只需要每个公司每年的进出口额的话);
  5. 匹配海关和工企数据然后再根据 ID 变量把工企数据库的其它变量也合并进来。

关于这五个步骤的代码实现,可以学习我们之前推出的 Stata 课程:「如何匹配海关和工企数据?」:

×

上次分享的数据包含下面两个版本:

  1. 先把海关数据汇总成每个公司的进出口额数据,然后和工企数据匹配的结果数据(下面称为汇总版本,其观测值是一个个的公司);
  2. 直接把海关数据和工企数据进行匹配(下面称为完整版本,其观测值是一条条的商品)。

后来又有小伙伴提出能不能把工企、海关、专利、污染这些数据库都匹配到一起?而我们之前已经推出了 工企+专利、工企+海关、工企+污染,以及工企+地理位置的,那么如何建立一套标准,让这些匹配结果数据再进行匹配呢?于是我们想到可以给每个数据生成一个 ID 变量用以标志观测值:

  1. 工企数据里面我们生成了一个 gqid 变量;
  2. 海关数据里面我们生成了一个 hgid 变量;
  3. 污染数据里面我们生成了一个 wrid 变量;
  4. 专利数据里面也可以生成一个 zlid 变量(暂不提供)。

那么工企和海关匹配的结果里面就会有 gqid 和 hgid 变量;工企和污染匹配的结果里面就会有 gqid 和 wrid 变量。于是我们直接使用 gqid 变量就可以把这两份匹配结果合并起来。是不是特方便!

基于这种想法,我们已经给工企、污染、海关三份数据都生成好了 ID 变量(从 RStata 平台上可以找到:https://rstata.duanshu.com/)

上次分享的 工企+污染 的匹配结果数据,大家可以发现里面就有 gqid 变量和 wrid 变量。毫无疑问此次更新的工企和海关的匹配数据里面会有 gqid 变量和 hgid 变量(当然是完整版本的才有,汇总版本的只有 gqid 变量)。

感兴趣的小伙伴可以自行尝试把 工企+污染 和 本文所介绍的 工企+海关 数据直接使用 gqid 变量进行匹配得到 工企 + 海关 + 污染的匹配数据。

另外此次分享的数据还多了一份:ID 对照表。提供这份数据的原因在于很多小伙伴的电脑内存不大,没法读取完整版本的结果(很多年份的完整版本有 20多 GB),另外也提供了一份分拆的海关数据(很多年份的完整版本有 20多 GB,这样把每个年份的也都拆分成小文件更方便大家操作)。

ID 对照表的内容大致如下:

ID 对照表

这份数据仅仅包含了 gqid 和 hgid 变量,这就意味着你可以先分别从工企、海关数据库里面提取你需要的变量(这个结果数据是不大的),然后再把工企、海关数据的子样本分别和这份 ID 对照表进行匹配就可以得到工企海关的匹配结果了,由于都是使用 id 变量匹配,所以几乎不存在“该匹配上却没匹配上”的问题。

另外汇总版本的数据形式如下(包含出口总额和进口总额变量,单位均为美元):

汇总版本的数据形式

完整版本的数据形式如下(包含工企和海关的所有变量以及 gqid 和 hgid 变量):

完整版本的数据形式

大家从平台上还可以找到工企数据和海关数据,分别是下面这样的:

2006 年海关数据
2006 年工企数据

最后我们再来看一下这个数据的匹配结果:

三个版本(汇总版,完整版,ID对照表)的结果数据使用的匹配方法是一样的,但是由于细微的差异,结果也有细微的差异,下表展示的是汇总版的匹配效果:工企数据库中的工企数量 列展示的是匹配使用的工企数据库的每年样本数;汇总版本涉及的工企数量 列展示的是汇总版本匹配结果中涉及的工企数量,最后一列是匹配率(汇总版本涉及的工企数量 / 工企数据库中的工企数量):

ID 对照表实际上是完整版仅仅保留 gqid 变量、hgid 变量和年份。

年份 工企数据库中的工企数量 汇总版本涉及的工企数量 匹配率
2000 162872 22747 13.97%
2001 171254 26446 15.44%
2002 181542 29939 16.49%
2003 196206 34093 17.38%
2004 279011 52969 18.98%
2005 270023 53167 19.69%
2006 301930 61461 20.36%
2007 336732 89007 26.43%
2008 412212 73368 17.8%
2009 366130 64445 17.6%
2010 442539 77424 17.5%
2011 302593 59657 19.72%
2012 324604 79688 24.55%
2013 344875 83723 24.28%
2014 309138 60055 19.43%

下图更直观些:

匹配效果

另外由于汇总版本的数据量较小,所以我们已经帮大家整理成了面板数据(除了匹配操作,没有对工企数据库的其它变量进行处理,大家需要根据自己的需要处理)。由于 2014 年的工企数据和 1998~2013 年的来源不同(变量命名也不是很相同),所以就没有合并到一起,大家可以根据需要自行选择是否使用以及如何使用 2014 年的。

其中 2000~2013 年的面板数据直接使用 xtset group 年份 即可设置面板数据。

这份数据的合并代码如下:

use "2000年工企海关匹配结果数据(汇总版).dta", clear
forval i = 2001/2013 {
append using "`i'年工企海关匹配结果数据(汇总版).dta", force
}
replace 组织机构代码 = strlower(组织机构代码)
egen group = group(企业匹配唯一标识码)
order group
xtset group 年份
save "2000~2013年工企海关匹配结果面板数据(汇总版)", replace

为了更好的确认匹配数据的可靠性,我们计算了每年平均各个公司的进口额和出口额,如下图所示:

每年平均各个公司的进口额和出口额

感觉连续性很不错!

最后为了方便大家自行匹配,我们也提供了一份 Stata 匹配代码:

匹配代码

代码较乱,仅供感兴趣的小伙伴参考(使用的工企和海关数据都可以从平台上找到)。

最后本次提供的数据和代码包含下面这些:

  1. 2000~2014 年工企海关匹配结果(完整版);
  2. 2000~2014 年工企海关匹配结果(汇总版);
  3. 2000~2014 年工企海关匹配 ID 对照表;
  4. 2000~2013年工企海关匹配结果面板数据(汇总版).dta;
  5. 各年匹配 do 文档;
  6. 海关编码国别(地区)代码表.xlsx
  7. 工企、海关数据(含 id 变量);
  8. 海关数据分拆版(把每个数据文件拆分成 不到 2GB 的小文件)。

点击这里跳转到 RStata 短书平台获取附件:2000~2014 年工企海关匹配结果数据(更新版,含 gqid 和 hgid 变量)

评论