最近给大家更新了税调数据:
2007~2020 年税调数据与工商注册数据匹配结果:https://rstata.duanshu.com/#/course/339d61648ae94aac8f1863474da2199e
以及上市公司的数据:
上市公司与工商企业注册数据匹配结果(版本2):https://rstata.duanshu.com/#/course/27d78e9e3bbe4e0cacc7c02b79fb526e
最近有小伙伴提议可以把两个数据匹配起来,结合税收调查数据与上市公司数据的变量,有两种匹配方式:
首先根据企业名称进行匹配。为便于两个数据集的连接,我在税调数据中生成了 sdid 变量以在匹配过程中识别每个观测值。在之前的课程「Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例」中,我分享过使用 Stata 进行模糊匹配的方法,不过模糊匹配耗时耗力,并且错误率很高。不同于英文,中文企业名称只要有一个字不同都可能不是同一家企业(英文企业名称有一两个字母不同可能是因为笔误)。所以中文企业名称的模糊匹配没有意义。因此这里我还是使用了精确匹配,考虑到企业名称中经常会把“有限公司”和“有限责任公司”混用,以及有限公司改股份有限公司之类的。所以这里在匹配前删除了下面词汇:股份有限、集团有限、有限责任、有限、责任、股份、公司、厂、 、(集团)、(集团)、(、)、(、)、省、市、区、县、回族自治区、壮族自治区、维吾尔自治区、自治区。这样可以大大提高匹配成功率。
Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例:https://rstata.duanshu.com/#/course/d4fb816566244662ab6359fa848f1f1e
之后再对没有匹配成功的使用组织机构代码进行匹配,最后合并两部分的匹配结果,就得到了我们需要的数据,附件中也提供了匹配使用的代码供大家参考。
数据匹配的方法都差不多,感兴趣的小伙伴也可以学习下面两个课程:
- 如何匹配中国工业企业数据库和海关数据库?以 2013 年为例:https://rstata.duanshu.com/#/course/5463b8d7afcb438ca1e537fa76c1a45d
- 工企和污染数据是如何匹配的?使用 Stata 完成整个过程:https://rstata.duanshu.com/#/course/7325758d0ad9457790215455dbcbcb1a
数据概览
匹配结果如下:
![]()
这份结果仅包含几个关键变量。由于原始税调数据包含数百个变量,因此不便于直接合并成面板,所以我的建议是先筛选自己需要的变量,合并之后再和这份匹配结果合并。
这份数据是根据税调与工商注册信息的匹配结果处理得到的。首先使用工商注册信息识别不同年份的相同企业,然后没有匹配到工商注册信息的企业再依次使用公司名称和法人代码进行识别。
如果需要把税调数据处理成面板,可以学习下面的课程:
Stata 中如何借助工商注册信息匹配结果把税调数据设定成面板:https://rstata.duanshu.com/#/brief/course/e57fa8a95f69496dafefd612f270fb20
为了便于大家使用,我还在附件中提供了一份 税调基本信息 数据,该数据仅包含关键变量:sdid、法人代码、企业名称、行政区划代码、注册地址,其中 sdid 用于和原始数据匹配。
![]()
匹配效果
各年匹配的数量如下:
![]()
下图展示了税调中上市公司的地理分布:
![]()
代码
为方便大家学习,附件中还提供了数据处理和绘图代码以供参考:
![]()
数据引用格式
由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:
RStata 数据中心: 2007~2020年税调与上市公司匹配结果. 2025. https://tidyfriday.cn/rsdb2/
英文文献可以使用下面的格式引用:
RStata Data Center: Integration Results of Tax Investigation Data and Listed Companies, 2007–2020. 2025. https://tidyfriday.cn/rsdb2/
点击这里跳转到 RStata 短书平台获取附件:2007~2020 年税调与上市公司匹配结果
评论