旧版本|1999~2014 年上市公司子公司与污染数据匹配结果

新版本在这里:https://rstata.duanshu.com/#/brief/course/3cf104364f964587b9251e9810c4390b

之前给大家分享过上市公司子公司数据:

1999~2022 年上市公司子公司数据(含经纬度及其所属的省市区县):https://rstata.duanshu.com/#/course/f3f0788f626749c0a79fa2f74d0740ff

最近有培训班的小伙伴需要研究上市公司子公司的污染指标变化情况,今天给大家分享的就是这份数据。

企业污染数据库我用的是之前分享的:

1998~2014 年中国制造业排污整合数据库(dta 格式+原始数据):https://rstata.duanshu.com/#/course/db26ad2971af481596a2a24e648375d2

数据概览

上市公司子公司与污染数据匹配结果的时间范围为 1999~2014 年,经过匹配之后一共得到了 2.5 万条匹配结果:

包含的变量如下:

子公司名称、证券代码、统计截止日期、zgsid、wrid、年份、组织机构代码、企业名称、行政区划代码、开业时间年、工业总产值现价万元、年正常生产时间小时、工业用水总量吨、煤炭消费总量吨、其中新鲜用水量吨、重复用水量吨、其中燃料煤消费量吨、原料煤消费量吨、燃料煤平均硫份、燃料油消费量不含车船用吨、其中重油吨、柴油吨、重油平均硫份、洁净燃气消费量万立方米、废水治理设施数套、废水治理设施处理能力吨日、工业废水处理量吨、工业废水排放量吨、氨氮去除量千克、化学需氧量去除量千克、其中当年新增设施去除的千克、化学需氧量排放量千克、氨氮排放量千克、工业废气排放总量万标立方米、废气治理设施数套、其中脱硫设施数套、废气治理设施处理能力标立方米时、其中脱硫设施脱硫能力千克时、二氧化硫去除量千克、二氧化硫排放量千克、氮氧化物去除量千克、氮氧化物排放量千克、烟尘去除量千克、烟尘排放量千克、工业粉尘去除量千克、工业粉尘排放量千克、行政区划名称、行业类别代码、行业类别名称、废水治理设施运行费用万元、化学需氧量产生量千克、氨氮产生量千克、二氧化硫产生量千克、氮氧化物产生量千克、烟尘产生量千克、化学需氧量产生量吨、化学需氧量排放量吨、氨氮产生量吨、氨氮排放量

匹配数量

为了让大家更直观地感受这份数据,我还绘制了两幅图进行展示。下图展示了上市公司子公司与污染数据每年匹配成功的数量:

下图展示了 1999~2014 年上市公司子公司五种污染指标的变化趋势:

匹配方法

结合税调数据与污染数据库的变量,根据企业名称进行匹配。

在之前的课程「Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例」中,我分享过使用 Stata 进行模糊匹配的方法,不过模糊匹配耗时耗力,并且错误率很高。不同于英文,中文企业名称只要有一个字不同都可能不是同一家企业(英文企业名称有一两个字母不同可能是因为笔误)。所以中文企业名称的模糊匹配没有意义。因此这里我还是使用了精确匹配,考虑到企业名称中经常会把“有限公司”和“有限责任公司”混用,以及有限公司改股份有限公司之类的。所以这里在匹配前删除了下面词汇:股份有限、集团有限、有限责任、有限、责任、股份、公司、厂、 、(集团)、(集团)、(、)、(、)、省、市、区、县、回族自治区、壮族自治区、维吾尔自治区、自治区。这样可以大大提高匹配成功率。

Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例:https://rstata.duanshu.com/#/course/d4fb816566244662ab6359fa848f1f1e

附件中也提供了匹配代码供大家参考~

数据匹配的方法都差不多,感兴趣的小伙伴也可以学习下面两个课程:

点击这里跳转到 RStata 短书平台获取附件:旧版本|1999~2014 年上市公司子公司与污染数据匹配结果

评论