上市公司与工商企业注册数据匹配结果(版本2)

之前给大家分享过一份工商注册信息数据:

1949~2023 年工商企业注册信息数据(含经纬度及其所属的省市区县)(版本2):https://rstata.duanshu.com/#/brief/course/6d38a3f10cdb467492f3204d1ebdd313

通过匹配工商注册信息可以获得企业的更多指标,今天我们分享一份上市公司数据与该数据的匹配结果:

  • 上市公司与工商注册信息匹配结果(版本2).dta

数据概览

数据概览如下:

我还绘制了一幅上市公司经营范围词云图:

下图展示了上市公司成立日期分布:

处理方法

结合上市公司和工商注册信息的指标,我选择了企业名称和组织机构代码作为匹配变量。

首先根据企业名称进行匹配。为便于两个数据集的连接,我在上市公司数据中生成了 newgcid 变量以在匹配过程中识别每个观测值。在之前的课程「Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例」中,我分享过使用 Stata 进行模糊匹配的方法,不过模糊匹配耗时耗力,并且错误率很高。不同于英文,中文企业名称只要有一个字不同都可能不是同一家企业(英文企业名称有一两个字母不同可能是因为笔误)。所以中文企业名称的模糊匹配没有意义。因此这里我还是使用了精确匹配,考虑到企业名称中经常会把“有限公司”和“有限责任公司”混用,以及有限公司改股份有限公司之类的。所以这里在匹配前删除了下面词汇:股份有限、集团有限、有限责任、有限、责任、股份、公司、厂、 、(集团)、(集团)、(、)、(、)、省、市、区、县、回族自治区、壮族自治区、维吾尔自治区、自治区。这样可以大大提高匹配成功率。

Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例:https://rstata.duanshu.com/#/course/d4fb816566244662ab6359fa848f1f1e

R 语言中的中文模糊匹配——以工企数据和境外投资名录数据匹配为例:https://rstata.duanshu.com/#/brief/course/2a44e6b5be8740a895e1daad087e2a63

之后再对没有匹配成功的使用组织机构代码进行匹配,最后合并两部分的匹配结果,就得到了我们需要的数据。

数据匹配的方法都差不多,感兴趣的小伙伴也可以学习下面两个课程:

如何匹配中国工业企业数据库和海关数据库?以 2013 年为例:https://rstata.duanshu.com/#/course/5463b8d7afcb438ca1e537fa76c1a45d

工企和污染数据是如何匹配的?使用 Stata 完成整个过程:https://rstata.duanshu.com/#/course/7325758d0ad9457790215455dbcbcb1a

不过这俩课程都有点老了,等有空我再准备个新课程讲解!

数据引用格式

在论文中使用该数据请声明数据来源于RStata 数据中心,或者 RStata Data Center,并使用下述的格式引用:

RStata 数据中心: 上市公司与工商企业注册数据匹配结果(版本2). 2025. https://tidyfriday.cn/rsdb2/

RStata Data Center: Matching Results of Listed Companies and Industrial and Commercial Enterprise Registration Data (Version 2). 2025. https://tidyfriday.cn/rsdb2/

另外也建议在说明数据来源的同时,根据本文的介绍在论文中描述数据的详细处理方法。

点击这里跳转到 RStata 短书平台获取附件:上市公司与工商企业注册数据匹配结果(版本2)

评论