今天给大家分享一份 1985~2024 年工商注册信息与专利数据匹配结果。
注意:受专利公开时滞影响,2021 年及之后的专利数据不够全,使用时需注意年份截断问题;工商注册数据获取时间截止 2023 年 8 月。
数据包含专利申请人(从专利数据中拆分出的每一个申请人)与工商企业注册信息的匹配结果,按年份拆分为 40 个 dta 文件(data_1985.dta … data_2024.dta),存放在 专利申请人匹配工商注册信息(分年) 子文件夹中。
数据来源与处理方法
本数据由两项基础数据匹配得到:
- 专利数据:1985~2024 年专利申请与授权数据(版本 3,含申请人所处的省市区县);
- 工商注册数据:1949~2023 年工商企业注册信息数据(含经纬度及其所属的省市区县)(版本 2),数据获取时间截止 2023 年 8 月。
处理方法参考:
1985~2024 年专利申请与授权数据(版本 3,含申请人所处的省市区县):https://rstata.duanshu.com/#/brief/course/2397451274c546d3a36e156ffc865988
1949~2023 年工商企业注册信息数据(含经纬度及其所属的省市区县)(版本 2):https://rstata.duanshu.com/#/brief/course/6d38a3f10cdb467492f3204d1ebdd313
具体的匹配流程如下(对应 code/ 文件夹中的代码):
- 抽取申请人:从逐年专利 CSV 中读取 newipzlid 与 申请人 两列,按 ; 拆分同一专利的多个申请人,得到逐条待匹配的申请人清单;
- 清洗企业名称:对申请人名称做规范化清洗(去除「有限」「责任」「公司」等可能影响匹配的措辞),生成用于匹配的清洗名;
- 按名匹配:将清洗后的申请人名称与历年工商注册信息(已预计算清洗名)按清洗名做多对多 inner_join,循环匹配 1948~2023 年各年工商数据;
- 合并去重:合并所有年份的匹配结果,按(newipzlid、newgcid)去重,仅保留工商侧核心字段;
- 二次优先级去重(Stata):同一专利同一申请人可能匹配到多家工商企业,按「名称完全一致 → 集团对集团 → 双方均非集团 → 排除支行/分行/站/部/子公司等末端机构 → 标准公司结构 → 去除股份/责任后一致 → 字符串相似度兜底」的优先级,为每个申请人保留唯一最佳匹配;
- 拆分年份:从 newipzlid 的前 4 位提取申请年份,按年份拆分为 40 个 dta 文件,方便分年读取。
数据概览
数据为「专利申请人 ↔ 工商注册企业」的匹配结果,企业(专利申请人)层面,附省份/城市/区县地理位置以及工商注册的企业类型、行业小类、成立日期、注册资本、实缴资本、统一社会信用代码等标识。以 2020 年为例,单年约 466.7 万条匹配记录。
变量说明(以 data_2020.dta 为例,共 16 个变量):
| 变量名 | 变量标签 | 简要说明 |
|---|---|---|
| 年份 | 申请年份 | 由 newipzlid 前缀生成 |
| newipzlid | 专利数据观测值编号 | 每条专利的唯一编号 |
| 申请人 | 专利申请人名称 | 拆分后的单个申请人 |
| newgcid | 工商注册数据观测值编号 | 匹配到的工商企业编号 |
| 企业名称 | 工商注册企业名称 | 匹配到的企业全称 |
| 成立日期 | 企业成立日期 | |
| 注册资本 | 注册资本 | |
| 实缴资本 | 实缴资本 | |
| 行业小类代码 | 国标行业小类代码 | |
| 省份 | 企业所在省份 | |
| 城市 | 企业所在城市 | |
| 区县 | 企业所在区县 | |
| 统一社会信用代码 | 统一社会信用代码 | |
| 纳税人识别号 | 纳税人识别号 | |
| 组织机构代码 | 组织机构代码 | |
| 企业类型 | 企业类型 |
该数据可用于把专利申请人与其背后的工商注册主体对应起来,从而在企业层面分析专利申请者的注册资本、行业门类、成立年限、所属省市区县等特征,支撑企业创新行为、产学研合作、高新技术企业与创新主体识别等研究。
变量范围说明:本匹配结果仅包含
newipzlid(专利数据观测值编号)、申请人以及工商注册数据中的部分变量(即上表中的newgcid起各列)。若研究还需要其他变量(例如更详细的工商字段或专利侧的其他信息),需要再从上述两项基础数据中单独提取,再与本匹配结果关联。
数据预览如下:
![]()
图表展示
下面三张图分别展示了匹配记录的时间趋势、省份空间分布与注册资本分布。
下图展示了 1985~2024 年各年匹配记录数的变化趋势(面积 + 折线):
![]()
下图展示了各省份累计匹配记录数的空间分布(基于 grmap 着色地图):
![]()
下图展示了匹配记录注册资本(万元)的对数分布(基于 1% 抽样):
![]()
处理代码
下面展示匹配流程中的关键代码片段。
第一步:按清洗后的企业名称与历年工商数据匹配(R 语言,节选 main.R)
# 循环匹配历年工商注册信息(工商 RDS 已预计算清洗名 z 列) |
第五步:同一申请人多匹配的优先级去重(Stata,节选 dedup_patent_match.do)
*- 第1步:优先保留名称完全一致的匹配(最高优先级) |
第六步:按年份拆分为逐年 dta(Stata,main.do)
use "专利申请人匹配工商注册信息_去重.dta", clear |
附件中也提供了该数据的处理代码供参考:
![]()
数据引用格式
由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:
RStata 数据中心: 1985~2024 年工商注册信息与专利数据匹配结果. 2026. https://tidyfriday.cn/rsdb2/
英文文献可以使用下面的格式引用:
RStata Data Center: Matched Dataset of Industrial and Commercial Registration Information & Patent Data, 1985–2024. 2026. https://tidyfriday.cn/rsdb2/
关联课程/数据推荐
1985~2024 年专利申请与授权数据(版本 3,含申请人所处的省市区县):https://rstata.duanshu.com/#/course/2397451274c546d3a36e156ffc865988
1985~2024 年上市公司与专利数据匹配结果(版本3,含申请、授权信息):https://rstata.duanshu.com/#/course/04100321f88b411f90429be934934bff
2001~2024 年上市公司前5大供应商、客户与工商注册信息匹配结果(含经纬度及所处的省市区县):https://rstata.duanshu.com/#/course/00f3b1459590486db9e6c13acf2fbc30
RStata 定制|专利数据匹配服务:https://rstata.duanshu.com/#/course/fd3bb2ac5b86425894a9814a02b36ac7
RStata 定制|地址转经纬度与根据经纬度判断所处的省市区县:https://rstata.duanshu.com/#/course/6b44ce2712af47b6ba7b2a2fd74a4e68
如果有相关的数据匹配或再加工需要,可以联系李老师付费定制。
点击这里跳转到 RStata 短书平台获取附件:1985~2024 年工商注册信息与专利数据匹配结果
评论