最近有小伙伴需要研究上市公司主要供应商及客户的购地行为,但是计算量太大,想让我帮忙处理下,这不就来了!
上市公司前 5 大供应商及客户的信息前不久刚分享过:
2001~2023 年上市公司前5大供应商、客户与工商注册信息匹配结果(含经纬度及所处的省市区县):https://rstata.duanshu.com/#/course/c0b17ab7ab2945ffaea746dec9380a8e
![]()
最近也更新过土地出让结果公告数据:
2000~2024 年土地出让结果公告数据(含经纬度及其所属的省市区县):https://rstata.duanshu.com/#/course/4127c2c9925a47f89216f0080cb3d413
今天分享的就是上面两份数据匹配后的结果。
匹配结果
上市公司前 5 大供应商及客户信息与土地出让数据匹配结果的时间范围为 2001~2023 年。计算结果包含了两份 dta 格式的文件,数据概览如下:
- 2001~2023年上市公司前5大供应商与土地出让数据匹配结果.dta
![]()
- 2001~2023年上市公司前5大客户与土地出让数据匹配结果.dta
![]()
为了让大家更直观地感受这份数据,我还绘制了两幅图进行展示。上市公司前 5 大供应商和前 5 大客户每年匹配成功的地块数量如下图所示:
![]()
![]()
匹配方法
结合上市公司前 5 大供应商及客户信息与土地出让数据的变量,我们分别使用上市公司前 5 大供应商中的供应商名称和前 5 大客户中的客户名称,与土地出让数据中的土地使用权人进行匹配。具体匹配方法分为三步:
- 首先土地使用权人可能是多个公司或个人,因此我们首先需要把这些土地使用权人拆分开,例如下面两个地块:
![]()
- 再对上市公司前 5 大供应商中的供应商名称、前 5 大客户中的客户名称、土地出让数据里的土地使用权人变量进行处理。在之前的课程「Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例」中我分享过使用 Stata 进行模糊匹配的方法,不过模糊匹配耗时耗力,并且错误率很高。不同于英文,中文企业名称只要有一个字不同都可能不是同一家企业(英文企业名称有一两个字母不同可能是因为笔误)。所以中文企业名称的模糊匹配没有意义。因此这里我还是使用了精确匹配,考虑到企业名称中经常会把“有限公司”和“有限责任公司”混用,以及有限公司改股份有限公司之类的。所以这里在匹配前删除了下面词汇:股份有限、集团有限、有限责任、有限、责任、股份、公司、厂、 、(集团)、(集团)、(、)、(、)、省、市、区、县、回族自治区、壮族自治区、维吾尔自治区、自治区。这样可以大大提高匹配成功率。
![]()
Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例:https://rstata.duanshu.com/#/brief/course/d4fb816566244662ab6359fa848f1f1e
- 最后分别使用处理后的供应商名称和客户名称,与土地使用权人匹配即可得到匹配结果。
数据匹配的方法都差不多,感兴趣的小伙伴也可以学习下面两个课程:
- 如何匹配中国工业企业数据库和海关数据库?以 2013 年为例:https://rstata.duanshu.com/#/brief/course/5463b8d7afcb438ca1e537fa76c1a45d
- 工企和污染数据是如何匹配的?使用 Stata 完成整个过程:https://rstata.duanshu.com/#/brief/course/7325758d0ad9457790215455dbcbcb1a
数据引用格式
在论文中使用该数据请声明数据来源于RStata 数据中心,或者 RStata Data Center,并使用下述的格式引用:
RStata 数据中心: 2001~2023 年上市公司前 5 大供应商及客户与土地出让数据匹配结果. 2025. https://tidyfriday.cn/rsdb2/
RStata Data Center: Matching Results of Top 5 Suppliers and Customers of Listed Companies and Land Transfer Data from 2001 to 2023. 2025. https://tidyfriday.cn/rsdb2/
另外也建议在说明数据来源的同时,根据本文的介绍在论文中描述数据的详细处理方法。
点击这里跳转到 RStata 短书平台获取附件:2001~2023 年上市公司前 5 大供应商及客户与土地出让数据匹配结果
评论