1985~2024 年工商注册信息与专利数据匹配结果

今天给大家分享一份 1985~2024 年工商注册信息与专利数据匹配结果。

注意:受专利公开时滞影响,2021 年及之后的专利数据不够全,使用时需注意年份截断问题;工商注册数据获取时间截止 2023 年 8 月。

数据包含专利申请人(从专利数据中拆分出的每一个申请人)与工商企业注册信息的匹配结果,按年份拆分为 40 个 dta 文件(data_1985.dta … data_2024.dta),存放在 专利申请人匹配工商注册信息(分年) 子文件夹中。

数据来源与处理方法

本数据由两项基础数据匹配得到:

  • 专利数据:1985~2024 年专利申请与授权数据(版本 3,含申请人所处的省市区县);
  • 工商注册数据:1949~2023 年工商企业注册信息数据(含经纬度及其所属的省市区县)(版本 2),数据获取时间截止 2023 年 8 月。

处理方法参考:

1985~2024 年专利申请与授权数据(版本 3,含申请人所处的省市区县):https://rstata.duanshu.com/#/brief/course/2397451274c546d3a36e156ffc865988

1949~2023 年工商企业注册信息数据(含经纬度及其所属的省市区县)(版本 2):https://rstata.duanshu.com/#/brief/course/6d38a3f10cdb467492f3204d1ebdd313

具体的匹配流程如下(对应 code/ 文件夹中的代码):

  1. 抽取申请人:从逐年专利 CSV 中读取 newipzlid 与 申请人 两列,按 ; 拆分同一专利的多个申请人,得到逐条待匹配的申请人清单;
  2. 清洗企业名称:对申请人名称做规范化清洗(去除「有限」「责任」「公司」等可能影响匹配的措辞),生成用于匹配的清洗名;
  3. 按名匹配:将清洗后的申请人名称与历年工商注册信息(已预计算清洗名)按清洗名做多对多 inner_join,循环匹配 1948~2023 年各年工商数据;
  4. 合并去重:合并所有年份的匹配结果,按(newipzlid、newgcid)去重,仅保留工商侧核心字段;
  5. 二次优先级去重(Stata):同一专利同一申请人可能匹配到多家工商企业,按「名称完全一致 → 集团对集团 → 双方均非集团 → 排除支行/分行/站/部/子公司等末端机构 → 标准公司结构 → 去除股份/责任后一致 → 字符串相似度兜底」的优先级,为每个申请人保留唯一最佳匹配;
  6. 拆分年份:从 newipzlid 的前 4 位提取申请年份,按年份拆分为 40 个 dta 文件,方便分年读取。

数据概览

数据为「专利申请人 ↔ 工商注册企业」的匹配结果,企业(专利申请人)层面,附省份/城市/区县地理位置以及工商注册的企业类型、行业小类、成立日期、注册资本、实缴资本、统一社会信用代码等标识。以 2020 年为例,单年约 466.7 万条匹配记录。

变量说明(以 data_2020.dta 为例,共 16 个变量):

变量名 变量标签 简要说明
年份 申请年份 由 newipzlid 前缀生成
newipzlid 专利数据观测值编号 每条专利的唯一编号
申请人 专利申请人名称 拆分后的单个申请人
newgcid 工商注册数据观测值编号 匹配到的工商企业编号
企业名称 工商注册企业名称 匹配到的企业全称
成立日期 企业成立日期
注册资本 注册资本
实缴资本 实缴资本
行业小类代码 国标行业小类代码
省份 企业所在省份
城市 企业所在城市
区县 企业所在区县
统一社会信用代码 统一社会信用代码
纳税人识别号 纳税人识别号
组织机构代码 组织机构代码
企业类型 企业类型

该数据可用于把专利申请人与其背后的工商注册主体对应起来,从而在企业层面分析专利申请者的注册资本、行业门类、成立年限、所属省市区县等特征,支撑企业创新行为、产学研合作、高新技术企业与创新主体识别等研究。

变量范围说明:本匹配结果仅包含 newipzlid(专利数据观测值编号)、申请人 以及工商注册数据中的部分变量(即上表中的 newgcid 起各列)。若研究还需要其他变量(例如更详细的工商字段或专利侧的其他信息),需要再从上述两项基础数据中单独提取,再与本匹配结果关联。

数据预览如下:

图表展示

下面三张图分别展示了匹配记录的时间趋势、省份空间分布与注册资本分布。

下图展示了 1985~2024 年各年匹配记录数的变化趋势(面积 + 折线):

下图展示了各省份累计匹配记录数的空间分布(基于 grmap 着色地图):

下图展示了匹配记录注册资本(万元)的对数分布(基于 1% 抽样):

处理代码

下面展示匹配流程中的关键代码片段。

第一步:按清洗后的企业名称与历年工商数据匹配(R 语言,节选 main.R)

# 循环匹配历年工商注册信息(工商 RDS 已预计算清洗名 z 列)
library(parallel)
cl <- makeCluster(5)
clusterEvalQ(cl, library(tidyverse))
clusterExport(cl, "patent_clean")

parLapply(cl, 1948:2023, function(x) {
out_path <- paste0("res/", x, ".rds")
if (!file.exists(out_path)) {
dftemp <- read_rds(
paste0("/Volumes/ADT/常用大数据/工商注册信息2025-待匹配-rds/", x, ".rds")
)
patent_clean %>%
select(-企业名称) %>%
# 按清洗名 z 做多对多连接
inner_join(dftemp, by = "z", relationship = "many-to-many") %>%
select(-z) %>%
write_rds(out_path)
}
}) -> tempres

# 合并所有年份,按 (newipzlid, newgcid) 去重并保留工商侧核心字段
keep_vars <- c(
"newipzlid", "申请人", "newgcid",
"企业名称", "成立日期", "注册资本", "实缴资本", "行业小类代码",
"省份", "城市", "区县",
"统一社会信用代码", "纳税人识别号", "组织机构代码", "企业类型"
)
dfres <- dfres %>%
distinct(newipzlid, newgcid, .keep_all = TRUE) %>%
select(any_of(keep_vars))

第五步:同一申请人多匹配的优先级去重(Stata,节选 dedup_patent_match.do)

*- 第1步:优先保留名称完全一致的匹配(最高优先级)
gen temp1 = (申请人 == 企业名称)
bysort newipzlid 申请人: egen maxtemp1 = max(temp1)
drop if temp1 == 0 & maxtemp1 > 0
cap drop temp1 maxtemp1

*- 第13步:字符串相似度兜底(需先 ssc install strdist)
cap drop tags
duplicates tag newipzlid 申请人, gen(tags)
count if tags > 0
if r(N) > 0 {
strdist 申请人 企业名称 if tags > 0, gen(dist)
bysort newipzlid 申请人: egen maxdist = max(dist)
keep if dist == maxdist | mi(dist)
}

*- 最终去重
duplicates drop newipzlid 申请人, force

第六步:按年份拆分为逐年 dta(Stata,main.do)

use "专利申请人匹配工商注册信息_去重.dta", clear
drop tags dist maxdist
*- 从 newipzlid 前 4 位提取申请年份
gen 年份 = substr(newipzlid, 1, 4)
order 年份
destring 年份, replace
*- 按年份拆分为逐年文件
split_by_var 年份, folderpath("专利申请人匹配工商注册信息(分年)/") prefix("data")

附件中也提供了该数据的处理代码供参考:

数据引用格式

由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:

RStata 数据中心: 1985~2024 年工商注册信息与专利数据匹配结果. 2026. https://tidyfriday.cn/rsdb2/

英文文献可以使用下面的格式引用:

RStata Data Center: Matched Dataset of Industrial and Commercial Registration Information & Patent Data, 1985–2024. 2026. https://tidyfriday.cn/rsdb2/

关联课程/数据推荐

1985~2024 年专利申请与授权数据(版本 3,含申请人所处的省市区县):https://rstata.duanshu.com/#/course/2397451274c546d3a36e156ffc865988

1985~2024 年上市公司与专利数据匹配结果(版本3,含申请、授权信息):https://rstata.duanshu.com/#/course/04100321f88b411f90429be934934bff

2001~2024 年上市公司前5大供应商、客户与工商注册信息匹配结果(含经纬度及所处的省市区县):https://rstata.duanshu.com/#/course/00f3b1459590486db9e6c13acf2fbc30

RStata 定制|专利数据匹配服务:https://rstata.duanshu.com/#/course/fd3bb2ac5b86425894a9814a02b36ac7

RStata 定制|地址转经纬度与根据经纬度判断所处的省市区县:https://rstata.duanshu.com/#/course/6b44ce2712af47b6ba7b2a2fd74a4e68

如果有相关的数据匹配或再加工需要,可以联系李老师付费定制。

点击这里跳转到 RStata 短书平台获取附件:1985~2024 年工商注册信息与专利数据匹配结果

评论