旧版本|1999~2022 年上市公司子公司与专利数据匹配结果

最近有培训班的小伙伴需要研究上市公司子公司的专利申请情况,由于工作量比较大,所以问我能不能帮忙处理一下,这不就来了!

上市公司子公司数据和专利数据库我之前都分享过:

  1. 1999~2022 年上市公司子公司数据(含经纬度及其所属的省市区县):https://rstata.duanshu.com/#/course/f3f0788f626749c0a79fa2f74d0740ff
  2. 1985~2022 年专利申请数据(版本2,含申请人地址的经纬度及其所处的省市区县信息):https://rstata.duanshu.com/#/course/edef981592a64257aa41e2b6d6d21746

今天分享给大家的就是上市公司子公司与专利数据的匹配结果,以及上市公司子公司专利申请数量的汇总统计。

数据概览

上市公司子公司与专利数据匹配结果的时间范围为 1999~2022 年,经过匹配之后一共得到了 156.3 万条结果:

  • 1999~2022年上市公司子公司与专利数据匹配结果.dta

包含的变量如下:

zgsid、newzlid、子公司名称、证券代码、年份、公开公告号、专利名称、专利类型、摘要、申请人、申请号、申请日、授权公布号、地址、主权项、发明设计人、分类号、主分类号、专利代理机构、分案原申请号、优先权、国际申请、国际公布、代理人、省份或国家代码、专利领域、专利学科、多次公布、城市、所属国省、公开公告日、省、省代码、市、市代码、县、县代码、纬度、经度、参考文献、代码、发布路径、范畴分类、国别、名称、申请国代码、申请来源、邮编、页数、专利号、颁证日、审查员、进入国家日期、摘要附图存储路径

我还汇总统计了历年上市公司子公司各种类型的专利数量:

  • 1999~2022年上市公司子公司与专利申请数量.dta

下图更直观地展示了上市公司子公司数据与专利数据每年匹配成功的数量:

匹配方法

结合上市公司子公司数据与专利数据的变量,我们使用上市公司子公司数据中的企业名称与专利数据中的申请人进行匹配。具体匹配方法分为三步:

  1. 专利数据中有个申请人变量,每个专利可能有多个申请人,申请人之间使用冒号分隔。因此需要首先处理申请人变量,处理思路如下:

  1. 其次,对上市公司子公司的企业名称和专利数据里的申请人变量进行处理,主要是改正错字和去除对匹配没有帮助的词汇(例如“有限公司”、“有限责任公司”)。在之前的课程「Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例」中,我分享过使用 Stata 进行模糊匹配的方法,不过模糊匹配耗时耗力,并且错误率很高。不同于英文,中文企业名称只要有一个字不同都可能不是同一家企业(英文企业名称有一两个字母不同可能是因为笔误)。所以中文企业名称的模糊匹配没有意义。因此这里我还是使用了精确匹配,考虑到企业名称中经常会把“有限公司”和“有限责任公司”混用,以及有限公司改股份有限公司之类的。所以这里在匹配前删除了下面词汇:股份有限、集团有限、有限责任、有限、责任、股份、公司、厂、 、(集团)、(集团)、(、)、(、)、省、市、区、县、回族自治区、壮族自治区、维吾尔自治区、自治区。这样可以大大提高匹配成功率。

Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例:https://rstata.duanshu.com/#/brief/course/d4fb816566244662ab6359fa848f1f1e

  1. 直接使用申请人和企业名称匹配即可得到匹配结果。

点击这里跳转到 RStata 短书平台获取附件:旧版本|1999~2022 年上市公司子公司与专利数据匹配结果

评论