最近帮一位做实证研究的小伙伴处理了瞪羚、独角兽与科技型初创企业的税调数据匹配,分享给大家!
该数据使用瞪羚企业数据和税调数据匹配得到:
瞪羚、独角兽、创新型企业名录、工商注册信息匹配结果及经纬度数据(2025年6月爬取): https://rstata.duanshu.com/#/brief/course/cd0c453f83f44b2e91e436cafb89027d
数据概览
最终得到 17,944 条匹配记录:
![]()
数据包含的变量有:省份、行业、认证时间(瞪羚/独角兽认证时间)、企业名称等核心字段,以及税调数据中的 sdid(税调观测值编号)、ID(瞪羚企业唯一标识)等匹配关联变量。
对该数据处理感兴趣的小伙伴可以学习如下课程:
使用 Stata 进行税调专利匹配:超高效的匹配流程:https://rstata.duanshu.com/#/course/43fd5249e06c462a95c499b2c646046d
Stata 中如何借助工商注册信息匹配结果把税调数据设定成面板?:https://rstata.duanshu.com/#/course/e57fa8a95f69496dafefd612f270fb20
如何匹配中国工业企业数据库和海关数据库?以 2013 年为例:https://rstata.duanshu.com/#/course/5463b8d7afcb438ca1e537fa76c1a45d
匹配方法
这份数据的匹配过程较为复杂,分为两个主要阶段:
第一阶段:多维度初步匹配
- 以瞪羚、独角兽与科技型初创企业的 ID 作为主键,与工商注册信息进行关联,获取企业名称、统一社会信用代码等关键变量;
- 对企业名称进行处理:提取曾用名、英文名、统一社会信用代码等多种形式用于匹配;
- 通过两种路径进行 joinby 匹配:
- 合并两个路径的匹配结果,保留同时存在于瞪羚企业库和税调库中的记录。
第二阶段:12 步精细去重
初步匹配结果中,同一个瞪羚企业可能对应多条税调记录,需要进行精细去重。去重遵循以下优先级规则:
- 名称完全一致优先保留
- 去掉”股份”后比较
- 去掉”责任”后比较
- 集团对集团匹配优先
- 双方均非集团时优先
- 排除银行支行/分行
- 排除子公司/分公司层级
- 排除嵌套公司结构
- 清理不对称嵌套结构
- 同 ID + 同企业名称强制去重
- 字符串相似度兜底(使用 strdist 命令)
- 最终强制去重
图表展示
下图展示了各省份瞪羚、独角兽与科技型初创企业分布情况:
![]()
下图展示了历年认证企业数量变化趋势:
![]()
下图展示了各行业企业数量分布(Top 15):
![]()
处理代码说明
以下是该数据去重处理的核心代码逻辑(Stata):
*- Step 1: 优先保留名称完全一致的匹配 |
*- Step 2-3: 去掉"股份"/"责任"后比较 |
*- Step 6-7: 排除银行、子公司/分公司 |
附件中也提供了该数据的处理代码供参考:
![]()
数据引用格式
由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:
RStata 数据中心: 2007~2020 年瞪羚、独角兽与科技型初创企业与税调数据匹配结果. 2026. https://tidyfriday.cn/rsdb2/
英文文献可以使用下面的格式引用:
RStata Data Center: Matched Dataset of Gazelle, Unicorn, and Technology-based Start-up Enterprises with Tax Survey Data, 2007–2020. 2026. https://tidyfriday.cn/rsdb2/
关联课程/数据推荐
瞪羚、独角兽、创新型企业名录、工商注册信息匹配结果及经纬度数据(2025年6月爬取):https://rstata.duanshu.com/#/course/cd0c453f83f44b2e91e436cafb89027d
2007~2020 年税调企业地理信息数据(含经纬度及其所处的省市区县):https://rstata.duanshu.com/#/course/39f5d95ad58841628fa4d935371bf3fd
2007~2020 年税调与上市公司匹配结果:https://rstata.duanshu.com/#/course/e653ffbc045a46c098409df647415f9a
2007~2020 年税调数据与工商注册数据匹配结果:https://rstata.duanshu.com/#/course/339d61648ae94aac8f1863474da2199e
使用 Stata 进行税调专利匹配:超高效的匹配流程:https://rstata.duanshu.com/#/course/43fd5249e06c462a95c499b2c646046d
Stata 中如何借助工商注册信息匹配结果把税调数据设定成面板?:https://rstata.duanshu.com/#/course/e57fa8a95f69496dafefd612f270fb20
点击这里跳转到 RStata 短书平台获取附件:2007~2020 年瞪羚、独角兽与科技型初创企业与税调数据匹配结果
评论