2007~2020 年瞪羚、独角兽与科技型初创企业与税调数据匹配结果

最近帮一位做实证研究的小伙伴处理了瞪羚、独角兽与科技型初创企业的税调数据匹配,分享给大家!

该数据使用瞪羚企业数据和税调数据匹配得到:

瞪羚、独角兽、创新型企业名录、工商注册信息匹配结果及经纬度数据(2025年6月爬取): https://rstata.duanshu.com/#/brief/course/cd0c453f83f44b2e91e436cafb89027d

数据概览

最终得到 17,944 条匹配记录:

数据包含的变量有:省份、行业、认证时间(瞪羚/独角兽认证时间)、企业名称等核心字段,以及税调数据中的 sdid(税调观测值编号)、ID(瞪羚企业唯一标识)等匹配关联变量。

对该数据处理感兴趣的小伙伴可以学习如下课程:

使用 Stata 进行税调专利匹配:超高效的匹配流程:https://rstata.duanshu.com/#/course/43fd5249e06c462a95c499b2c646046d

Stata 中如何借助工商注册信息匹配结果把税调数据设定成面板?:https://rstata.duanshu.com/#/course/e57fa8a95f69496dafefd612f270fb20

如何匹配中国工业企业数据库和海关数据库?以 2013 年为例:https://rstata.duanshu.com/#/course/5463b8d7afcb438ca1e537fa76c1a45d

匹配方法

这份数据的匹配过程较为复杂,分为两个主要阶段:

第一阶段:多维度初步匹配

  1. 以瞪羚、独角兽与科技型初创企业的 ID 作为主键,与工商注册信息进行关联,获取企业名称、统一社会信用代码等关键变量;
  2. 对企业名称进行处理:提取曾用名、英文名、统一社会信用代码等多种形式用于匹配;
  3. 通过两种路径进行 joinby 匹配:
  4. 合并两个路径的匹配结果,保留同时存在于瞪羚企业库和税调库中的记录。

第二阶段:12 步精细去重

初步匹配结果中,同一个瞪羚企业可能对应多条税调记录,需要进行精细去重。去重遵循以下优先级规则:

  1. 名称完全一致优先保留
  2. 去掉”股份”后比较
  3. 去掉”责任”后比较
  4. 集团对集团匹配优先
  5. 双方均非集团时优先
  6. 排除银行支行/分行
  7. 排除子公司/分公司层级
  8. 排除嵌套公司结构
  9. 清理不对称嵌套结构
  10. 同 ID + 同企业名称强制去重
  11. 字符串相似度兜底(使用 strdist 命令)
  12. 最终强制去重

图表展示

下图展示了各省份瞪羚、独角兽与科技型初创企业分布情况:

下图展示了历年认证企业数量变化趋势:

下图展示了各行业企业数量分布(Top 15):

处理代码说明

以下是该数据去重处理的核心代码逻辑(Stata):

*- Step 1: 优先保留名称完全一致的匹配
gen temp1 = (公司全名 == 企业名称)
bysort ID: egen maxtemp1 = max(temp1)
drop if temp1 == 0 & maxtemp1 > 0
*- Step 2-3: 去掉"股份"/"责任"后比较
gen temp_name = subinstr(企业名称, "股份", "", .)
gen temp1 = (公司全名 == temp_name)
bysort ID: egen maxtemp1 = max(temp1)
drop if temp1 == 0 & maxtemp1 > 0
*- Step 6-7: 排除银行、子公司/分公司
foreach keyword in "支行" "分行" "子公司" "分公司" "支公司" {
gen temp1 = (!strmatch(公司全名, "*`keyword'*") & !strmatch(企业名称, "*`keyword'*"))
bysort ID: egen maxtemp1 = max(temp1)
drop if temp1 == 0 & maxtemp1 > 0
cap drop temp1 maxtemp1
}

附件中也提供了该数据的处理代码供参考:

数据引用格式

由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:

RStata 数据中心: 2007~2020 年瞪羚、独角兽与科技型初创企业与税调数据匹配结果. 2026. https://tidyfriday.cn/rsdb2/

英文文献可以使用下面的格式引用:

RStata Data Center: Matched Dataset of Gazelle, Unicorn, and Technology-based Start-up Enterprises with Tax Survey Data, 2007–2020. 2026. https://tidyfriday.cn/rsdb2/

关联课程/数据推荐

瞪羚、独角兽、创新型企业名录、工商注册信息匹配结果及经纬度数据(2025年6月爬取):https://rstata.duanshu.com/#/course/cd0c453f83f44b2e91e436cafb89027d

2007~2020 年税调企业地理信息数据(含经纬度及其所处的省市区县):https://rstata.duanshu.com/#/course/39f5d95ad58841628fa4d935371bf3fd

2007~2020 年税调与上市公司匹配结果:https://rstata.duanshu.com/#/course/e653ffbc045a46c098409df647415f9a

2007~2020 年税调数据与工商注册数据匹配结果:https://rstata.duanshu.com/#/course/339d61648ae94aac8f1863474da2199e

使用 Stata 进行税调专利匹配:超高效的匹配流程:https://rstata.duanshu.com/#/course/43fd5249e06c462a95c499b2c646046d

Stata 中如何借助工商注册信息匹配结果把税调数据设定成面板?:https://rstata.duanshu.com/#/course/e57fa8a95f69496dafefd612f270fb20

点击这里跳转到 RStata 短书平台获取附件:2007~2020 年瞪羚、独角兽与科技型初创企业与税调数据匹配结果

评论