之前给大家分享过上市公司子公司与污染数据匹配结果(旧版本),使用旧年份的子公司数据匹配:
旧版本|1999~2014 年上市公司子公司与污染数据匹配结果:https://rstata.duanshu.com/#/course/bf80a2be715b43ed8ebd3b9de4c20e89
今天给大家分享的是使用新的上市公司子公司数据重新匹配的,相比版本 1 在企业名称处理和匹配方法上做了更系统的优化。
企业污染数据来源于:
1998~2014 年中国制造业排污整合数据库(dta 格式+原始数据):https://rstata.duanshu.com/#/course/db26ad2971af481596a2a24e648375d2
数据概览
数据时间范围为 1999~2014 年,涵盖上市公司子公司与污染企业的匹配结果。本数据包含两个文件:
- 1999~2014年上市公司子公司与污染数据匹配结果(版本2):核心匹配结果,包含子公司基本信息、行政区划、行业类别以及完整的污染排放指标;
- 1999~2023年上市公司子公司经纬度及所处省市区县信息:子公司地理位置信息,包含经纬度坐标及省市区县归属。
主要变量包括:
zgsid(子公司唯一标识)、wrid(污染数据观测值ID)、年份、企业名称、行政区划代码、行政区划名称、行业类别代码、行业类别名称、工业总产值现价万元、工业废水排放量吨、二氧化硫排放量千克、氮氧化物排放量千克、烟尘排放量千克、工业粉尘排放量千克、化学需氧量排放量千克、氨氮排放量千克、工业废气排放总量万标立方米等污染排放及治理指标。
数据预览如下:
![]()
![]()
图表展示
下图展示了 1999~2014 年各年匹配成功的样本数量变化趋势:
![]()
下图展示了工业总产值(现价万元)的分布情况:
![]()
下图展示了不同行业的工业废水排放量箱线图:
![]()
下图展示了各行业大类的样本数量分布:
![]()
下图展示了废水、废气、SO₂、烟尘等主要污染物排放的历年趋势(面积图):
![]()
下图展示了各省匹配样本数量的空间分布:
![]()
下图展示了城市层面子公司数量分布:
![]()
下图展示了各省 SO₂ 平均排放量的空间分布:
![]()
匹配方法
本数据通过将上市公司子公司工商注册信息与中国制造业排污整合数据库进行精确匹配得到。具体处理流程如下:
- 整理子公司信息:从上市公司子公司工商注册信息中提取企业名称与曾用名,对曾用名按”公司””厂”等关键词拆分展开,得到待匹配子公司信息;
- 整理污染库信息:对污染库中的企业名称与曾用名进行类似处理,并过滤长度过短(≤9字符)的名称以减少误匹配;
- 企业名称标准化处理:对企业名称中的常见错误(全角字符、”有限责任公司”各种变体写法等)进行系统替换,统一规范为”有限公司”或”股份有限公司”等标准形式。共处理了数百种名称变体,大幅提升匹配准确率;
- 精确匹配:基于标准化后的企业简称(
z变量)与年份进行精确匹配(joinby),并通过比较分公司/子公司/支公司标识进行去重清洗; - 关联污染数据:将匹配结果与污染库合并,保留完整污染指标。
附件中也提供了该数据的处理代码供参考:
![]()
在之前的课程「Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例」中,我分享过使用 Stata 进行模糊匹配的方法,不过模糊匹配耗时耗力,并且错误率很高。不同于英文,中文企业名称只要有一个字不同都可能不是同一家企业(英文企业名称有一两个字母不同可能是因为笔误)。所以中文企业名称的模糊匹配没有意义。因此这里我还是使用了精确匹配,考虑到企业名称中经常会把“有限公司”和“有限责任公司”混用,以及有限公司改股份有限公司之类的。所以这里在匹配前删除了下面词汇:股份有限、集团有限、有限责任、有限、责任、股份、公司、厂、 、(集团)、(集团)、(、)、(、)、省、市、区、县、回族自治区、壮族自治区、维吾尔自治区、自治区。这样可以大大提高匹配成功率。
Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例:https://rstata.duanshu.com/#/course/d4fb816566244662ab6359fa848f1f1e
R 语言中的中文模糊匹配——以工企数据和境外投资名录数据匹配为例:https://rstata.duanshu.com/#/brief/course/2a44e6b5be8740a895e1daad087e2a63
数据匹配的方法都差不多,感兴趣的小伙伴也可以学习下面三个课程:
如何匹配中国工业企业数据库和海关数据库?以 2013 年为例:https://rstata.duanshu.com/#/course/5463b8d7afcb438ca1e537fa76c1a45d
工企和污染数据是如何匹配的?使用 Stata 完成整个过程:https://rstata.duanshu.com/#/course/7325758d0ad9457790215455dbcbcb1a
使用 Stata 进行税调专利匹配:超高效的匹配流程:https://rstata.duanshu.com/#/brief/course/43fd5249e06c462a95c499b2c646046d
处理代码
以下为核心匹配代码(节选):
*- 读取子公司工商注册信息,展开曾用名 |
数据引用格式
由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:
RStata 数据中心: 1999~2014年上市公司子公司与污染数据匹配结果(版本2). 2026. https://tidyfriday.cn/rsdb2/
英文文献可以使用下面的格式引用:
RStata Data Center: Matched Results of Listed Company Subsidiaries and Pollution Data, 1999–2014 (Version 2). 2026. https://tidyfriday.cn/rsdb2/
关联课程/数据推荐
1998~2014 年中国制造业排污整合数据库(dta 格式+原始数据):https://rstata.duanshu.com/#/course/db26ad2971af481596a2a24e648375d2
1999~2014 年工企数据与上市公司子公司数据匹配结果:https://rstata.duanshu.com/#/course/bb9b96fa8a0e40c2b2bf7b2eb040f673
1998~2014 年工企与企业污染数据库匹配结果:https://rstata.duanshu.com/#/course/bb9b96fa8a0e40c2b2bf7b2eb040f673
1990~2015 年中国各省市区县、各部门多种污染物排放面板数据:https://rstata.duanshu.com/#/course/e2415fe187d74195afb6e685cdf1c349
1998~2014年企业污染库地理位置(含经纬度及其所处的省市区县):https://rstata.duanshu.com/#/course/cd23e364a86c44518ed9fa3f3fb382b8
工企和污染数据是如何匹配的?使用 Stata 完成整个过程:https://rstata.duanshu.com/#/course/7325758d0ad9457790215455dbcbcb1a
如果有相关数据定制需要,可以联系李老师付费定制。
点击这里跳转到 RStata 短书平台获取附件:1999~2014 年上市公司子公司与污染数据匹配结果(版本2)
评论