1998~2014 年上市公司参控股公司与污染数据匹配结果

今天给大家分享一份 1998~2014 年上市公司参控股公司与污染数据匹配结果。数据来源于国泰安数据库与中国制造业排污整合数据库,由 RStata 数据中心处理整合得到。

上市公司参控股公司数据我之前已经给大家分享过:

1990~2023 年上市公司参控股公司工商注册信息匹配结果:https://rstata.duanshu.com/#/course/d6b36b925b09444da2febfb7bf3a83bf

企业污染数据库使用的是:

1998~2014 年中国制造业排污整合数据库(dta 格式+原始数据):https://rstata.duanshu.com/#/course/db26ad2971af481596a2a24e648375d2

数据概览

上市公司参控股公司与污染数据匹配结果的时间范围为 1998~2014 年,经过匹配之后一共得到了约 3.2 万条匹配结果:

配套的参控股公司工商注册信息数据:

数据包含的主要变量如下:

ckggsid、wrid、年份、组织机构代码、企业名称、行政区划代码、开业时间年、工业总产值现价万元、年正常生产时间小时、工业用水总量吨、煤炭消费总量吨、其中新鲜用水量吨、重复用水量吨、燃料煤消费量吨、原料煤消费量吨、燃料煤平均硫份、燃料油消费量吨、废水治理设施数套、工业废水处理量吨、工业废水排放量吨、氨氮去除量千克、化学需氧量去除量千克、化学需氧量排放量千克、氨氮排放量千克、工业废气排放总量万标立方米、废气治理设施数套、二氧化硫去除量千克、二氧化硫排放量千克、氮氧化物去除量千克、氮氧化物排放量千克、烟尘去除量千克、烟尘排放量千克、工业粉尘去除量千克、工业粉尘排放量千克、行政区划名称、行业类别代码、行业类别名称等

匹配方法

结合上市公司参控股公司数据与污染数据库的变量,根据企业名称进行精确匹配。

考虑到企业名称中经常会把”有限公司”和”有限责任公司”混用,以及有限公司改股份有限公司之类的情况,匹配前删除了下面词汇:股份有限、集团有限、有限责任、有限、责任、股份、公司、厂、(集团)、(集团)、(、)、(、)、省、市、区、县、回族自治区、壮族自治区、维吾尔自治区、自治区。这样可以大大提高匹配成功率。

在之前的课程「Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例」中,我分享过使用 Stata 进行模糊匹配的方法,不过模糊匹配耗时耗力,并且错误率很高。不同于英文,中文企业名称只要有一个字不同都可能不是同一家企业(英文企业名称有一两个字母不同可能是因为笔误)。所以中文企业名称的模糊匹配没有意义。因此这里我还是使用了精确匹配,考虑到企业名称中经常会把“有限公司”和“有限责任公司”混用,以及有限公司改股份有限公司之类的。所以这里在匹配前删除了下面词汇:股份有限、集团有限、有限责任、有限、责任、股份、公司、厂、 、(集团)、(集团)、(、)、(、)、省、市、区、县、回族自治区、壮族自治区、维吾尔自治区、自治区。这样可以大大提高匹配成功率。

Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例:https://rstata.duanshu.com/#/course/d4fb816566244662ab6359fa848f1f1e

R 语言中的中文模糊匹配——以工企数据和境外投资名录数据匹配为例:https://rstata.duanshu.com/#/brief/course/2a44e6b5be8740a895e1daad087e2a63

数据匹配的方法都差不多,感兴趣的小伙伴也可以学习下面三个课程:

如何匹配中国工业企业数据库和海关数据库?以 2013 年为例:https://rstata.duanshu.com/#/course/5463b8d7afcb438ca1e537fa76c1a45d

工企和污染数据是如何匹配的?使用 Stata 完成整个过程:https://rstata.duanshu.com/#/course/7325758d0ad9457790215455dbcbcb1a

使用 Stata 进行税调专利匹配:超高效的匹配流程:https://rstata.duanshu.com/#/brief/course/43fd5249e06c462a95c499b2c646046d

图表展示

下图展示了历年的匹配数量变化:

下图展示了前20大行业的匹配结果分布:

下图展示了工业废水排放量的分组箱线图:

下图展示了各年工业废水排放量的趋势变化:

下图展示了五大污染指标的归一化趋势:

下图展示了工业废水排放量的分布情况:

下图展示了各省份观测数量分布:

下图展示了各省份平均 SO₂ 排放量分布:

处理代码

匹配的核心思路是先对企业名称进行标准化处理,再通过简化后的名称(变量 z)按年份进行 joinby 匹配:

*- 从上市公司参控股公司工商注册信息中提取企业名称(含曾用名)
use "1990~2023年上市公司参控股公司工商注册信息匹配结果.dta", clear
keep ckggsid 参控股公司名称 企业名称 曾用名
split 曾用名, parse(公司 厂)
gather 曾用名* 企业名称 参控股公司名称
drop if mi(value)
duplicates drop
ren value 企业名称

*- 对企业名称进行标准化处理(去除无效词汇)
do 企业名称处理.do
do 企业名称处理2.do

*- 按简化名称和年份进行匹配
joinby z 年份 using 待匹配污染公司信息1

*- 比对原始名称,过滤分公司、支公司等噪音
drop if !index(参控股公司名称, "分公司") & index(污染公司名称, "分公司")
drop if !index(参控股公司名称, "支公司") & index(污染公司名称, "支公司")

附件中也提供了该数据的处理代码供参考:

需要注意的是,每年每个上市公司可能对应多条污染库数据,原因大致有两种:一是污染库中存在重复公司条目;二是上市公司的参控股公司可能包含多家分公司。数据中保留了这些匹配结果,大家可根据需要自行处理。

数据引用格式

由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:

RStata 数据中心: 1998~2014年上市公司参控股公司与污染数据匹配结果. 2026. https://tidyfriday.cn/rsdb2/

英文文献可以使用下面的格式引用:

RStata Data Center: Matched Data of Listed Companies’ Shareholding Affiliates and Pollution Records, 1998-2014. 2026. https://tidyfriday.cn/rsdb2/

关联课程/数据推荐

1990~2023 年上市公司参控股公司工商注册信息匹配结果:https://rstata.duanshu.com/#/course/d6b36b925b09444da2febfb7bf3a83bf

1998~2014 年上市公司与污染库匹配结果:https://rstata.duanshu.com/#/course/bf80a2be715b43ed8ebd3b9de4c20e89

1999~2014 年上市公司子公司与污染数据匹配结果:https://rstata.duanshu.com/#/course/22bc8d77bfc243c4b5c1c9979cf50586

1990~2015 年中国各省市区县、各部门多种污染物排放面板数据:https://rstata.duanshu.com/#/course/e2415fe187d74195afb6e685cdf1c349

工企和污染数据是如何匹配的?使用 Stata 完成整个过程:https://rstata.duanshu.com/#/course/7325758d0ad9457790215455dbcbcb1a

如何匹配中国工业企业数据库和海关数据库?以 2013 年为例:https://rstata.duanshu.com/#/course/5463b8d7afcb438ca1e537fa76c1a45d

1998~2014年企业污染库地理位置(含经纬度及其所处的省市区县):https://rstata.duanshu.com/#/course/cd23e364a86c44518ed9fa3f3fb382b8

如果有相关数据处理定制需求,可以联系李老师付费定制。

点击这里跳转到 RStata 短书平台获取附件:1998~2014 年上市公司参控股公司与污染数据匹配结果

评论