旧版本|2007~2016 年税调与海关数据匹配结果

新版本在这里:https://rstata.duanshu.com/#/course/d6d872f05ee746a18f29cd84cab9c028

前不久给大家分享了一份全国税收调查数据:

之前也给大家分享过海关数据:

最近有培训班的小伙伴想要将税调数据与海关数据进行匹配,考虑到工作量较大,于是我就直接帮忙处理好了。

因为数据较大,所以我提供了 dta 格式的税收调查数据与海关数据匹配结果的分年版本,时间范围为 2007~2016 年。以 2010 年为例,数据预览如下:

匹配结果

为了让大家更直观地感受这份数据,我还绘制了一幅图进行展示。下图展示了 2007~2016 年涉及进出口的税调企业每年平均进出口额:

匹配方法

结合税收调查数据与海关数据的变量,根据企业名称进行数据集的匹配。

在之前的课程「Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例」中,我分享过使用 Stata 进行模糊匹配的方法,不过模糊匹配耗时耗力,并且错误率很高。不同于英文,中文企业名称只要有一个字不同都可能不是同一家企业(英文企业名称有一两个字母不同可能是因为笔误)。所以中文企业名称的模糊匹配没有意义。因此这里我还是使用了精确匹配,考虑到企业名称中经常会把“有限公司”和“有限责任公司”混用,以及有限公司改股份有限公司之类的。所以这里在匹配前删除了下面词汇:股份有限、集团有限、有限责任、有限、责任、股份、公司、厂、 、(集团)、(集团)、(、)、(、)、省、市、区、县、回族自治区、壮族自治区、维吾尔自治区、自治区。这样可以大大提高匹配成功率。

数据匹配的方法都差不多,感兴趣的小伙伴也可以学习下面两个课程:

×

点击这里跳转到 RStata 短书平台获取附件:旧版本|2007~2016 年税调与海关数据匹配结果

评论