2001~2016 年上市公司前五大供应商、客户与海关数据匹配结果

上市公司前五大供应商、客户与海关数据的匹配结果在供应链透明度验证、公司治理与信息披露、贸易模式与全球价值链等研究方面具有重要作用,通过匹配上市公司披露的供应链信息与海关实际贸易数据,可以为实证研究提供独特的微观证据。今天分享给大家的就是 2001~2016 年上市公司前五大供应商、客户与海关数据匹配结果。这里的上市公司前五大供应商、客户与海关数据用的是之前分享的:

2001~2024 年上市公司前5大供应商、客户与工商注册信息匹配结果(含经纬度及所处的省市区县):https://rstata.duanshu.com/#/course/00f3b1459590486db9e6c13acf2fbc30

2000~2016 年海关数据(版本2):https://rstata.duanshu.com/#/course/530c467967104ffe9aeb2c6cfabf9fa1

数据概览

计算后得到了如下文件:

  • 2001~2016年上市公司前五大供应商与海关数据匹配结果.dta
  • 2001~2016年上市公司前五大客户与海关数据匹配结果.dta

预览如下:

因为数据较大(20G 和 26G),所以我还提供了 dta 格式的税收调查数据与海关数据匹配结果的分年版本,时间范围为 2001~2016 年。

为了让大家更直观地感受这份数据,我还绘制了两幅图进行展示。下图展示了历年上市公司前五大供应商进出口总额:

历年上市公司前五大客户进出口总额:

匹配方法

结合上市公司前五大供应商、客户数据与海关数据的变量,根据企业名称进行数据集的匹配。

在之前的课程「Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例」中,我分享过使用 Stata 进行模糊匹配的方法,不过模糊匹配耗时耗力,并且错误率很高。不同于英文,中文企业名称只要有一个字不同都可能不是同一家企业(英文企业名称有一两个字母不同可能是因为笔误)。所以中文企业名称的模糊匹配没有意义。因此这里我还是使用了精确匹配,考虑到企业名称中经常会把“有限公司”和“有限责任公司”混用,以及有限公司改股份有限公司之类的。所以这里在匹配前删除了下面词汇:股份有限、集团有限、有限责任、有限、责任、股份、公司、厂、 、(集团)、(集团)、(、)、(、)、省、市、区、县、回族自治区、壮族自治区、维吾尔自治区、自治区。这样可以大大提高匹配成功率。

Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例:https://rstata.duanshu.com/#/course/d4fb816566244662ab6359fa848f1f1e

数据匹配的方法都差不多,感兴趣的小伙伴也可以学习下面两个课程:

代码

为方便大家学习,附件中还提供了数据处理和绘图代码以供参考:

数据引用格式

由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:

RStata 数据中心: 2001~2016年上市公司前五大供应商、客户与海关数据匹配结果. https://tidyfriday.cn/rsdb2/

英文文献可以使用下面的格式引用:

RStata Data Center: Matching Results of Top 5 Suppliers, Customers of Listed Companies and Customs Data, 2001–2016. 2025. https://tidyfriday.cn/rsdb2/

点击这里跳转到 RStata 短书平台获取附件:2001~2016 年上市公司前五大供应商、客户与海关数据匹配结果

评论