新版本在这里:https://rstata.duanshu.com/#/brief/course/fac1b81a8287457bbd6b914d37462a26
前不久给大家更新了一份专利全库数据:

之前也给大家分享过瞪羚、独角兽、创新型企业的数据:

最近培训班的小伙伴想把两份数据进行匹配,由于工作量比较大,于是我就直接处理好了。
瞪羚企业、独角兽和科技型初创企业与专利数据匹配结果的时间范围 1985~2022 年,不过由于使用的专利数据库中的 2021 和 2022 年数据不全,所以匹配结果的 2021 和 2022 年数据也是不全的,建议使用 1985~2020 年部分的,匹配结果预览如下:
![]()
匹配结果
为了让大家更直观地感受这份数据,我还绘制了一幅图进行展示。下图展示了 2000~2022 年瞪羚、独角兽、创新型企业匹配到的专利数量:
![]()
匹配方法
专利数据中有个申请人变量,每个专利可能有多个申请人,申请人之间使用冒号分隔,因此需要首先处理申请人变量,处理思路如下:

再对瞪羚、独角兽、创新型企业数据库里的公司名称和专利数据里的申请人变量进行处理,主要是改正错字和去除对匹配没有帮助的词汇(例如“有限公司”、“有限责任公司”)。很多文献会说自己采用了模糊匹配,实际上在模糊匹配课程「Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例」中,我指出了模糊匹配的缺点(匹配之后需要人工逐一检查,个人研究中难以实现,如果不检查又会有大量匹配错误的结果)。因此这里我还是使用了精确匹配,考虑到企业名称中经常会把“有限公司”和“有限责任公司”混用,以及有限公司改股份有限公司之类的。所以这里在匹配前删除了下面词汇:股份有限、集团有限、有限责任、有限、责任、股份、公司、厂、 、(集团)、(集团)、(、)、(、)、省、市、区、县、回族自治区、壮族自治区、维吾尔自治区、自治区。这样可以大大提高匹配成功率。


直接使用公司名称和申请人匹配即可得到匹配结果。
注意事项
在计算专利申请数量时需要注意,专利数据里面有很多申请和授权同时存在的专利,在统计专利数量的时候应该先去除这种重复情况:
![]()
统计的时候可以先去除公开公告号里面的 A、B、U、S。其中 A 代表发明专利的申请公开,B 代表发明专利的授权公告,U 代表实用新型专利的授权公告,S 代表外观设计专利的授权公告。
replace 公开公告号 = subinstr(公开公告号, "A", "", .) |
点击这里跳转到 RStata 短书平台获取附件:旧版本|1985~2022 年瞪羚、独角兽、创新型企业与专利数据匹配结果(版本2)
评论