2007~2020 年税调数据与工商注册数据匹配结果

新增 2017~2020 年的,2007~2016 年的数据和之前的一样,sdid 变量也是一样的。下载的时候注意含全部变量的税调数据是一个单独的下载链接,使用的时候可以先逐年选择自己需要的变量、统计变量名,然后合并起来再使用 sdid 与平台上提供的匹配结果连接使用。

前不久给大家分享了一份新的工商注册信息数据:

最近又尝试了使用这份数据和税调数据进行匹配。结果得到了令人惊喜的匹配率(见后文图)。

数据概览

因为数据较大,所以我提供了 dta 格式的税收调查数据与工商注册数据匹配结果的分年版本,时间范围为 2007~2020 年,最终得到如下数据集:

  • 2007sd_info.dta
  • 2008sd_info.dta
  • 2009sd_info.dta
  • 2010sd_info.dta
  • 2011sd_info.dta
  • 2012sd_info.dta
  • 2013sd_info.dta
  • 2014sd_info.dta
  • 2015sd_info.dta
  • 2016sd_info.dta
  • 2017sd_info.dta
  • 2018sd_info.dta
  • 2019sd_info.dta
  • 2020sd_info.dta

例如,2016sd_info.dta 即 2016 年税收调查数据与工商注册数据匹配结果,数据概览如下:

附件中还提供了税调基本信息:

匹配结果

为了让大家更直观地感受这份数据,我还绘制了一幅图进行展示。下图展示了税收调查与工商注册数据每年匹配成功的数量:

匹配方法

结合税收调查数据与工商企业注册信息的变量,我选择了两种匹配方式。

首先根据企业名称进行匹配。为便于两个数据集的连接,我在税调数据中生成了sdid 变量以在匹配过程中识别每个观测值。在之前的课程「Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例」中,我分享过使用 Stata 进行模糊匹配的方法,不过模糊匹配耗时耗力,并且错误率很高。不同于英文,中文企业名称只要有一个字不同都可能不是同一家企业(英文企业名称有一两个字母不同可能是因为笔误)。所以中文企业名称的模糊匹配没有意义。因此这里我还是使用了精确匹配,考虑到企业名称中经常会把“有限公司”和“有限责任公司”混用,以及有限公司改股份有限公司之类的。所以这里在匹配前删除了下面词汇:股份有限、集团有限、有限责任、有限、责任、股份、公司、厂、 、(集团)、(集团)、(、)、(、)、省、市、区、县、回族自治区、壮族自治区、维吾尔自治区、自治区。这样可以大大提高匹配成功率。

  1. Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例:https://rstata.duanshu.com/#/course/d4fb816566244662ab6359fa848f1f1e
  2. R 语言中的中文模糊匹配——以工企数据和境外投资名录数据匹配为例:https://rstata.duanshu.com/#/brief/course/2a44e6b5be8740a895e1daad087e2a63

之后再对没有匹配成功的使用组织机构代码进行匹配,最后合并两部分的匹配结果,就得到了我们需要的数据。

数据匹配的方法都差不多,感兴趣的小伙伴也可以学习下面两个课程:

数据引用格式

由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:

RStata 数据中心: 2007~2020 年税调数据与工商注册数据匹配结果. 2025. https://tidyfriday.cn/rsdb2/

英文文献可以使用下面的格式引用:

RStata Data Center: Matching Results of Tax Survey Data and Business Registration Data, 2007–2020. 2025. https://tidyfriday.cn/rsdb2/

点击这里跳转到 RStata 短书平台获取附件:2007~2020 年税调数据与工商注册数据匹配结果

评论