2011~2024 年瞪羚、独角兽、科技型初创企业与政府采购数据匹配结果(截止2024年12月)

之前给大家分享过一份爬取自中国政府采购网的政府采购数据:

2000~2024 年 12 月政府采购合同数据(含采购人和供应商经纬度及其所属省市区县):https://rstata.duanshu.com/#/course/159d29113a1c46a59c9b85c4308ef5fe

之前也给大家分享过瞪羚、独角兽、科技型初创企业数据:

瞪羚、独角兽、创新型企业名录、工商注册信息匹配结果及经纬度数据(2025年6月爬取):https://rstata.duanshu.com/#/course/cd0c453f83f44b2e91e436cafb89027d

最近有小伙伴想把这两份数据匹配起来,由于两份数据都非常巨大,所以我就直接帮大家匹配好了。

匹配结果

瞪羚、独角兽、科技型初创企业数据与政府采购数据匹配结果的时间范围为 2011~2024 年,经过匹配之后一共得到了 141197 条匹配结果:

包含的变量如下:

ID、年份、合同名称、详情链接、签订时间、发布时间、采购人、供应商、合同编号、项目编号、采购人地址、采购人联系方式、供应商地址、供应商联系方式、主要标的名称、规格型号或服务要求、主要标的数量、主要标的单价、合同金额、履约期限和地点等简要信息、采购方式、所属地域、所属行业、代理机构、合同签订日期、合同公告日期、合同金额num_万元、采购人_纬度、采购人_经度、采购人_省、采购人_省代码、采购人_市、采购人_市代码、采购人_县、采购人_县代码、供应商_纬度、供应商_经度、供应商_省、供应商_省代码、供应商_市、供应商_市代码、供应商_县、供应商_县代码、项目名称

下图展示了历年瞪羚、独角兽、科技型初创企业与政府采购数据匹配情况:

匹配方法

结合瞪羚、独角兽、科技型初创企业数据与政府采购数据库的变量,使用瞪羚、独角兽、科技型初创企业的企业名称和采购合同数据中的供应商名称进行匹配。

首先需要分别处理瞪羚、独角兽、科技型初创企业数据的企业名称和采购合同数据中的供应商名称。具体处理方法是剔除公司名称中干扰匹配的一些字符(股份有限、集团有限、有限责任、有限公司、有限、责任、股份、公司、厂、” “、(集团)、(集团)、(、)、(、)、回族自治区、壮族自治区、维吾尔自治区、自治区、省、市、区、县)。很多文献会说自己采用了模糊匹配,实际上在模糊匹配课程中,我讲过模糊匹配的缺点(匹配之后需要人工逐一检查,个人研究中难以实现,如果不检查又会有大量匹配错误的结果)。所以这里我采用的是去除干扰词汇匹配(插图来自工企专利匹配的推文,这里实际上是和瞪羚、独角兽、科技型初创企业数据企业名称匹配。):

Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例:https://rstata.duanshu.com/#/course/d4fb816566244662ab6359fa848f1f1e

代码

为方便大家学习,附件中还提供了数据处理和绘图代码以供参考:

数据引用格式

由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:

RStata 数据中心: 2011~2024年瞪羚、独角兽、科技型初创企业与政府采购数据匹配结果(截止2024年12月). 2025. https://tidyfriday.cn/rsdb2/

英文文献可以使用下面的格式引用:

RStata Data Center: Matching Results of Gazelle Enterprises, Unicorns, Technology Startups and Government Procurement Data, 2011–2024 (through December 2024). 2025. https://tidyfriday.cn/rsdb2/

点击这里跳转到 RStata 短书平台获取附件:2011~2024 年瞪羚、独角兽、科技型初创企业与政府采购数据匹配结果(截止2024年12月)

评论