今天给大家分享一份 2007~2020 年税调与上市公司参控股公司数据匹配结果。
之前已经给大家分享过税调企业的地理信息数据和上市公司参控股公司的工商注册信息数据,不少小伙伴希望将二者进行匹配,以研究上市公司实际控制企业的税务相关问题。经过处理,现在将这份匹配结果完整提供给大家。
匹配方法
匹配的核心思路是:利用企业名称和注册代码两条路径进行精确匹配。
路径一:企业名称匹配
由于中文企业名称中”有限公司””有限责任公司””股份有限公司”等词汇常被混用,直接精确匹配会漏掉大量真实匹配结果。因此在匹配前先对企业名称进行标准化处理,删除以下常见词汇后再进行精确匹配:
*- 删除影响匹配的常见词汇 |
在之前的课程「Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例」中,我分享过使用 Stata 进行模糊匹配的方法,不过模糊匹配耗时耗力,并且错误率很高。不同于英文,中文企业名称只要有一个字不同都可能不是同一家企业(英文企业名称有一两个字母不同可能是因为笔误)。所以中文企业名称的模糊匹配没有意义。因此这里我还是使用了精确匹配,考虑到企业名称中经常会把“有限公司”和“有限责任公司”混用,以及有限公司改股份有限公司之类的。所以这里在匹配前删除了下面词汇:股份有限、集团有限、有限责任、有限、责任、股份、公司、厂、 、(集团)、(集团)、(、)、(、)、省、市、区、县、回族自治区、壮族自治区、维吾尔自治区、自治区。这样可以大大提高匹配成功率。
Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例:https://rstata.duanshu.com/#/course/d4fb816566244662ab6359fa848f1f1e
R 语言中的中文模糊匹配——以工企数据和境外投资名录数据匹配为例:https://rstata.duanshu.com/#/brief/course/2a44e6b5be8740a895e1daad087e2a63
数据匹配的方法都差不多,感兴趣的小伙伴也可以学习下面三个课程:
如何匹配中国工业企业数据库和海关数据库?以 2013 年为例:https://rstata.duanshu.com/#/course/5463b8d7afcb438ca1e537fa76c1a45d
工企和污染数据是如何匹配的?使用 Stata 完成整个过程:https://rstata.duanshu.com/#/course/7325758d0ad9457790215455dbcbcb1a
使用 Stata 进行税调专利匹配:超高效的匹配流程:https://rstata.duanshu.com/#/brief/course/43fd5249e06c462a95c499b2c646046d
路径二:工商注册代码等匹配
从上市公司参控股公司数据中提取统一社会信用代码、工商注册号、纳税人识别号、组织机构代码,进行标准化(转大写、删除连字符)后与税调的注册代码数据进行匹配:
*- 提取四类注册代码并堆叠 |
两条路径的匹配结果合并去重,并进行企业名称一致性校验(过滤分公司、支公司等误匹配),最终得到匹配结果。
数据概览
匹配结果的时间范围为 2007~2020 年,共包含 17.2 万条匹配记录,覆盖全部 A 股上市公司的参控股公司(包括子公司、孙公司、联营公司、合营公司等类型)。
数据文件:
- 2007~2020年税调与上市公司参控股公司数据匹配结果.dta
数据预览如下:
![]()
数据包含的主要变量:
| 变量 | 说明 |
|---|---|
| sdid | 税调数据观测值 ID |
| ckggsid | 参控股公司观测值 ID |
| 股票代码 | 母公司(上市公司)股票代码 |
| 会计年度 | 对应年份 |
| 参控股公司名称 | 被参控股公司名称(来自上市公司年报) |
| 参控关系 | 子公司/孙公司/联营公司/合营公司/其他 |
| 参控比例_百分比 | 上市公司持股比例(%) |
| 企业名称 | 税调数据中的企业名称 |
| 行业门类/大类/中类/小类 | 国民经济行业分类(四层级) |
| 省/市/县 | 企业所在地(省市区县三层级) |
| 经度/纬度 | 企业地理坐标 |
| 经营状态 | 企业当前经营状态 |
| 注册资本 | 企业注册资本(万元) |
图表展示
下图展示了 2007~2020 年历年匹配样本数量的变化趋势:
![]()
不同参控关系的样本分布:
![]()
上市公司持股比例的分布情况(直方图):
![]()
匹配到的参控股公司按行业门类分布(Top 10):
![]()
不同参控关系历年匹配数量趋势:
![]()
各省份匹配样本数量的地理分布:
![]()
各区县匹配样本数量的地理分布:
![]()
处理代码
为方便大家学习,附件中提供了该数据的处理代码供参考:
![]()
数据引用格式
由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:
RStata 数据中心: 2007~2020年税调与上市公司参控股公司数据匹配结果. 2026. https://tidyfriday.cn/rsdb2/
英文文献可以使用下面的格式引用:
RStata Data Center: Matched Panel Data of Tax Survey Records and Shareholding/Investment Subsidiaries of Listed Companies, 2007–2020. 2026. https://tidyfriday.cn/rsdb2/
关联课程/数据推荐
1990~2023 年上市公司参控股公司工商注册信息匹配结果:https://rstata.duanshu.com/#/course/d6b36b925b09444da2febfb7bf3a83bf
1990~2023 年上市公司参控股公司经纬度及其所处的省市区县:https://rstata.duanshu.com/#/course/12642c96d0f242cb85b8ee12099d3e2f
2007~2020 年税调企业地理信息数据(含经纬度及其所处的省市区县):https://rstata.duanshu.com/#/course/39f5d95ad58841628fa4d935371bf3fd
2007~2020 年税调数据与上市公司子公司数据匹配结果:https://rstata.duanshu.com/#/course/ce5b9892434f40bcb2e4062143d1b76f
2007~2020 年税调与上市公司匹配结果:https://rstata.duanshu.com/#/course/e653ffbc045a46c098409df647415f9a
Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例:https://rstata.duanshu.com/#/course/d4fb816566244662ab6359fa848f1f1e
点击这里跳转到 RStata 短书平台获取附件:2007~2020 年税调与上市公司参控股公司数据匹配结果
评论