之前给大家分享给政府采购供应商数据:
2000~2024 年 12 月政府采购合同数据(含采购人和供应商经纬度及其所属省市区县):https://rstata.duanshu.com/#/course/159d29113a1c46a59c9b85c4308ef5fe
也给大家分享过工商注册信息:
1949~2023 年工商企业注册信息数据(含经纬度及其所属的省市区县)(版本2):https://rstata.duanshu.com/#/course/6d38a3f10cdb467492f3204d1ebdd313
最近有小伙伴提议把政府采购供应商数据与工商注册信息匹配,以连接政府行为与企业特征,于是我就直接处理好了。
数据概览
因为数据较大,所以我提供了 dta 格式的政府采购供应商与工商注册信息匹配结果的分年版本,时间范围为 2000~2024 年,以 2016 年为例,数据预览如下:
![]()
为了让大家更直观地感受这份数据,我还绘制了一幅图进行展示。下图展示了政府采购供应商与工商注册数据每年匹配成功的数量:
![]()
匹配方法
结合政府采购供应商数据与工商企业注册信息的变量,使用政府采购供应商数据中的供应商与工商企业注册数据中的企业名称进行匹配。
在之前的课程「Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例」中,我分享过使用 Stata 进行模糊匹配的方法,不过模糊匹配耗时耗力,并且错误率很高。不同于英文,中文企业名称只要有一个字不同都可能不是同一家企业(英文企业名称有一两个字母不同可能是因为笔误)。所以中文企业名称的模糊匹配没有意义。因此这里我还是使用了精确匹配,考虑到企业名称中经常会把“有限公司”和“有限责任公司”混用,以及有限公司改股份有限公司之类的。所以这里在匹配前删除了下面词汇:股份有限、集团有限、有限责任、有限、责任、股份、公司、厂、 、(集团)、(集团)、(、)、(、)、省、市、区、县、回族自治区、壮族自治区、维吾尔自治区、自治区。这样可以大大提高匹配成功率。
- Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例:https://rstata.duanshu.com/#/course/d4fb816566244662ab6359fa848f1f1e
- R 语言中的中文模糊匹配——以工企数据和境外投资名录数据匹配为例:https://rstata.duanshu.com/#/brief/course/2a44e6b5be8740a895e1daad087e2a63
数据匹配的方法都差不多,感兴趣的小伙伴也可以学习下面两个课程:
- 如何匹配中国工业企业数据库和海关数据库?以 2013 年为例:https://rstata.duanshu.com/#/course/5463b8d7afcb438ca1e537fa76c1a45d
- 工企和污染数据是如何匹配的?使用 Stata 完成整个过程:https://rstata.duanshu.com/#/course/7325758d0ad9457790215455dbcbcb1a
代码
为方便大家学习,附件中还提供了数据处理和绘图代码以供参考:
![]()
数据引用格式
由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:
RStata 数据中心: 2000~2024年政府采购供应商与工商注册信息匹配结果. https://tidyfriday.cn/rsdb2/
英文文献可以使用下面的格式引用:
RStata Data Center: Linkage Results between Government Procurement Suppliers and Business Registration Information, 2000–2024. 2025. https://tidyfriday.cn/rsdb2/
点击这里跳转到 RStata 短书平台获取附件:2000~2024 年政府采购供应商与工商注册信息匹配结果
评论