之前给大家分享过很多工企相关的匹配结果数据,例如 工企 + 专利、工企 + 海关、工企 + 污染 …… 很多小伙伴问能否把工企和上市公司的数据匹配下。
参考工企和海关数据的匹配流程,工企和上市公司数据可以采用如下流程匹配:
- 清洗上市公司数据库里面的企业名称、邮政编码、传真和电子邮箱变量(等下要用这三个变量进行匹配);
- 清洗工企数据库里面的企业名称、邮编、传真和电子邮箱变量;
- 在上市公司数据库里面生成一个 gsid 变量用以在匹配过程中识别每个观测值,然后只保留企业名称、邮政编码、传真、电子邮箱、年份、gsid 几个变量(这样可以避免因为数据过大导致匹配过程过慢);
- 在工企数据库里面生成一个 gqid 变量用以在匹配过程中识别每个观测值,然后只保留企业名称、邮政编码、传真、电子邮箱、年份、gqid 几个变量(这样可以避免因为数据过大导致匹配过程过慢);
- 匹配工企和上市公司数据。
关于这五个步骤的代码实现,可以学习我们之前推出的 Stata 课程:「如何匹配海关和工企数据?」:https://rstata.duanshu.com/#/brief/course/5463b8d7afcb438ca1e537fa76c1a45d 另外附件中也提供了本次匹配的代码。
×
具体匹配过程分为三个过程:
- 使用处理后的企业名称进行匹配(去除对匹配没有帮助的词汇,例如“有限公司”、“股份有限公司”等);
- 使用公司传真后七位 + 邮编匹配;
- 使用电子邮箱匹配。
通过对匹配结果的处理得到了 1998~2014年工企与上市公司匹配结果.dta。
匹配效果如下:
| 年份 | 匹配成功的公司数量 |
|---|---|
| 1998 | 193 |
| 1999 | 251 |
| 2000 | 313 |
| 2001 | 397 |
| 2002 | 461 |
| 2003 | 531 |
| 2004 | 749 |
| 2005 | 721 |
| 2006 | 780 |
| 2007 | 839 |
| 2008 | 1,007 |
| 2009 | 927 |
| 2010 | 1,156 |
| 2011 | 1,386 |
| 2012 | 1,414 |
| 2013 | 1,461 |
| 2014 | 1,899 |
画成图更直观些:
![]()
匹配结果数据预览:
![]()
注意事项
- 由于上市公司有多处上市的情况,所以上市公司数据中同一家公司可能有多个观测值(证券代码不同),对于这样的公司,匹配的时候是分别和工企数据匹配,因此匹配结果也是相同,但是使用匹配结果的时候要注意不要把同一家公司重复加总了。
- 上市公司的年份是通过比较成立日期和退市日期得到的,因此需要注意有些上市公司可能并没有上市(只需要通过比较年份和首次上市日期就可以判断该公司该年是否上市了)。
- 一条工企数据对应多个上市公司或者一条上市公司对应多个工企数据可能是因为在不同的匹配手段中匹配到了不同的结果,可以手动检查解决。
点击这里跳转到 RStata 短书平台获取附件:1998~2014 年工企与上市公司匹配结果
评论