新版本在这里:https://rstata.duanshu.com/#/brief/course/ce5b9892434f40bcb2e4062143d1b76f
前不久给大家分享了上市公司子公司数据:
1999~2022 年上市公司子公司数据(含经纬度及其所属的省市区县):https://rstata.duanshu.com/#/course/f3f0788f626749c0a79fa2f74d0740ff
最近有小伙伴想将这份数据与税调数据进行匹配,由于工作量比较大,所以我就直接帮大家处理好了。税调数据我之前也分享过:
2007~2016 年税调企业地理信息数据(含经纬度及其所处的省市区县):https://rstata.duanshu.com/#/course/76d38022cd004b09b2aa09647936beb0
匹配结果
税调与上市公司子公司数据匹配结果的时间范围为 2007~2016 年,经过匹配之后一共得到了 9.3 万条匹配结果:
![]()
包含的变量如下:
年份、sdid、法人代码、企业名称、行政区划代码、注册地址、子公司名称、母公司证券代码、统计截止日期、注册成立时间、注册资本、经营范围、注册地、国家区域名称、区域标识、设立方式、直接持股、间接持股、总资产、营业收入、净利润、归属于母公司所有者的净利润、期末总投资额、币种、是否退出、经度、纬度、省、省代码、市、市代码、县、县代码
下图更直观地展示了税调与上市公司子公司数据每年匹配成功的数量:
![]()
匹配方法
结合税调数据与上市公司子公司数据库的变量,根据企业名称进行匹配。在之前的课程「Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例」中,我分享过使用 Stata 进行模糊匹配的方法,不过模糊匹配耗时耗力,并且错误率很高。不同于英文,中文企业名称只要有一个字不同都可能不是同一家企业(英文企业名称有一两个字母不同可能是因为笔误)。所以中文企业名称的模糊匹配没有意义。因此这里我还是使用了精确匹配,考虑到企业名称中经常会把“有限公司”和“有限责任公司”混用,以及有限公司改股份有限公司之类的。所以这里在匹配前删除了下面词汇:股份有限、集团有限、有限责任、有限、责任、股份、公司、厂、 、(集团)、(集团)、(、)、(、)、省、市、区、县、回族自治区、壮族自治区、维吾尔自治区、自治区。这样可以大大提高匹配成功率。
Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例:https://rstata.duanshu.com/#/course/d4fb816566244662ab6359fa848f1f1e
数据匹配的方法都差不多,感兴趣的小伙伴也可以学习下面两个课程:
- 如何匹配中国工业企业数据库和海关数据库?以 2013 年为例:https://rstata.duanshu.com/#/course/5463b8d7afcb438ca1e537fa76c1a45d
- 工企和污染数据是如何匹配的?使用 Stata 完成整个过程:https://rstata.duanshu.com/#/course/7325758d0ad9457790215455dbcbcb1a
点击这里跳转到 RStata 短书平台获取附件:旧版本|2007~2016 年税调数据与上市公司子公司数据匹配结果
评论