对这份数据感兴趣的小伙伴建议认真阅读下面的介绍~ 这样才能更好的使用这份数据。
之前给大家分享过一份工企数据库和海关数据库的匹配结果数据:2000~2014 年工企和海关匹配数据 这份数据的匹配包含下面 5 个步骤:
- 清洗工企数据库里面的企业名称、邮政编码和固定电话变量(等下要用这三个变量进行匹配);
- 清洗海关数据库里面的企业名称、邮编和电话变量;
- 在工企数据库里面生成一个 ID 变量用以在匹配过程中识别每个观测值,然后只保留企业名称、邮政编码和固定电话、年份、ID 几个变量(这样可以避免因为数据过大导致匹配过程过慢);
- 对海关数据库进行汇总(例如只需要每个公司每年的进出口额的话);
- 匹配海关和工企数据然后再根据 ID 变量把工企数据库的其它变量也合并进来。
关于这五个步骤的代码实现,可以学习我们之前推出的 Stata 课程:「如何匹配海关和工企数据?」:
×
上次分享的数据包含下面两个版本:
- 先把海关数据汇总成每个公司的进出口额数据,然后和工企数据匹配的结果数据(下面称为汇总版本,其观测值是一个个的公司);
- 直接把海关数据和工企数据进行匹配(下面称为完整版本,其观测值是一条条的商品)。
后来又有小伙伴提出能不能把工企、海关、专利、污染这些数据库都匹配到一起?而我们之前已经推出了 工企+专利、工企+海关、工企+污染,以及工企+地理位置的,那么如何建立一套标准,让这些匹配结果数据再进行匹配呢?于是我们想到可以给每个数据生成一个 ID 变量用以标志观测值:
- 工企数据里面我们生成了一个 gqid 变量;
- 海关数据里面我们生成了一个 hgid 变量;
- 污染数据里面我们生成了一个 wrid 变量;
- 专利数据里面也可以生成一个 zlid 变量(暂不提供)。
那么工企和海关匹配的结果里面就会有 gqid 和 hgid 变量;工企和污染匹配的结果里面就会有 gqid 和 wrid 变量。于是我们直接使用 gqid 变量就可以把这两份匹配结果合并起来。是不是特方便!
基于这种想法,我们已经给工企、污染、海关三份数据都生成好了 ID 变量(从 RStata 平台上可以找到:https://rstata.duanshu.com/)
上次分享的 工企+污染 的匹配结果数据,大家可以发现里面就有 gqid 变量和 wrid 变量。毫无疑问此次更新的工企和海关的匹配数据里面会有 gqid 变量和 hgid 变量(当然是完整版本的才有,汇总版本的只有 gqid 变量)。
感兴趣的小伙伴可以自行尝试把 工企+污染 和 本文所介绍的 工企+海关 数据直接使用 gqid 变量进行匹配得到 工企 + 海关 + 污染的匹配数据。
另外此次分享的数据还多了一份:ID 对照表。提供这份数据的原因在于很多小伙伴的电脑内存不大,没法读取完整版本的结果(很多年份的完整版本有 20多 GB),另外也提供了一份分拆的海关数据(很多年份的完整版本有 20多 GB,这样把每个年份的也都拆分成小文件更方便大家操作)。
ID 对照表的内容大致如下:
| ID 对照表 |
|---|
![]() |
这份数据仅仅包含了 gqid 和 hgid 变量,这就意味着你可以先分别从工企、海关数据库里面提取你需要的变量(这个结果数据是不大的),然后再把工企、海关数据的子样本分别和这份 ID 对照表进行匹配就可以得到工企海关的匹配结果了,由于都是使用 id 变量匹配,所以几乎不存在“该匹配上却没匹配上”的问题。
另外汇总版本的数据形式如下(包含出口总额和进口总额变量,单位均为美元):
| 汇总版本的数据形式 |
|---|
![]() |
完整版本的数据形式如下(包含工企和海关的所有变量以及 gqid 和 hgid 变量):
| 完整版本的数据形式 |
|---|
![]() |
大家从平台上还可以找到工企数据和海关数据,分别是下面这样的:
| 2006 年海关数据 |
|---|
![]() |
| 2006 年工企数据 |
|---|
![]() |
最后我们再来看一下这个数据的匹配结果:
三个版本(汇总版,完整版,ID对照表)的结果数据使用的匹配方法是一样的,但是由于细微的差异,结果也有细微的差异,下表展示的是汇总版的匹配效果:工企数据库中的工企数量 列展示的是匹配使用的工企数据库的每年样本数;汇总版本涉及的工企数量 列展示的是汇总版本匹配结果中涉及的工企数量,最后一列是匹配率(汇总版本涉及的工企数量 / 工企数据库中的工企数量):
ID 对照表实际上是完整版仅仅保留 gqid 变量、hgid 变量和年份。
| 年份 | 工企数据库中的工企数量 | 汇总版本涉及的工企数量 | 匹配率 |
|---|---|---|---|
| 2000 | 162872 | 22747 | 13.97% |
| 2001 | 171254 | 26446 | 15.44% |
| 2002 | 181542 | 29939 | 16.49% |
| 2003 | 196206 | 34093 | 17.38% |
| 2004 | 279011 | 52969 | 18.98% |
| 2005 | 270023 | 53167 | 19.69% |
| 2006 | 301930 | 61461 | 20.36% |
| 2007 | 336732 | 89007 | 26.43% |
| 2008 | 412212 | 73368 | 17.8% |
| 2009 | 366130 | 64445 | 17.6% |
| 2010 | 442539 | 77424 | 17.5% |
| 2011 | 302593 | 59657 | 19.72% |
| 2012 | 324604 | 79688 | 24.55% |
| 2013 | 344875 | 83723 | 24.28% |
| 2014 | 309138 | 60055 | 19.43% |
下图更直观些:
| 匹配效果 |
|---|
![]() |
另外由于汇总版本的数据量较小,所以我们已经帮大家整理成了面板数据(除了匹配操作,没有对工企数据库的其它变量进行处理,大家需要根据自己的需要处理)。由于 2014 年的工企数据和 1998~2013 年的来源不同(变量命名也不是很相同),所以就没有合并到一起,大家可以根据需要自行选择是否使用以及如何使用 2014 年的。
其中 2000~2013 年的面板数据直接使用 xtset group 年份 即可设置面板数据。
这份数据的合并代码如下:
use "2000年工企海关匹配结果数据(汇总版).dta", clear |
为了更好的确认匹配数据的可靠性,我们计算了每年平均各个公司的进口额和出口额,如下图所示:
| 每年平均各个公司的进口额和出口额 |
|---|
![]() |
感觉连续性很不错!
最后为了方便大家自行匹配,我们也提供了一份 Stata 匹配代码:
| 匹配代码 |
|---|
![]() |
代码较乱,仅供感兴趣的小伙伴参考(使用的工企和海关数据都可以从平台上找到)。
最后本次提供的数据和代码包含下面这些:
- 2000~2014 年工企海关匹配结果(完整版);
- 2000~2014 年工企海关匹配结果(汇总版);
- 2000~2014 年工企海关匹配 ID 对照表;
- 2000~2013年工企海关匹配结果面板数据(汇总版).dta;
- 各年匹配 do 文档;
- 海关编码国别(地区)代码表.xlsx
- 工企、海关数据(含 id 变量);
- 海关数据分拆版(把每个数据文件拆分成 不到 2GB 的小文件)。
点击这里跳转到 RStata 短书平台获取附件:2000~2014 年工企海关匹配结果数据(更新版,含 gqid 和 hgid 变量)








评论