最近有不少小伙伴反馈希望推出海关和专利匹配的结果数据,这不就来啦!
实际之前给大家分享了不少关于专利的匹配结果,例如(后面的链接为该数据在短书平台上的链接):
×
×
×
×
×
×
还有不少关于海关数据的匹配结果,例如:
×
×
×
×
×
×
关于工企和海关数据市如何匹配的,还有一个课程讲解:
×
今天给大家分享的这份海关 + 专利匹配数据是这样操作的:
- 首先把海关数据里面出现的所有企业提取出来,组成海关数据公司列表;
- 专利数据中有个申请人变量,每个专利可能有多个申请人,申请人之间使用冒号分隔,因此需要首先处理申请人变量,处理思路如下:
![]()
- 然后分别处理海关数据公司列表和专利数据的申请人,具体处理方法是剔除公司名称中干扰匹配的一些字符(例如“有限公司”、“有限责任公司”、“(”、“)”、“(”、“)”)。很多文献会说自己采用了模糊匹配,实际上在模糊匹配课程(这里可以看到:https://rstata.duanshu.com/#/course/d4fb816566244662ab6359fa848f1f1e)我讲过模糊匹配的缺点(匹配之后需要人工逐一检查,个人研究中难以实现,如果不检查又会有大量匹配错误的结果)。所以这里我采用的是去除干扰词汇匹配(插图来自工企专利匹配的推文,这里实际上是和海关数据企业名称匹配。):
![]()
- 直接使用申请人和企业名称匹配即可得到匹配结果。
按照上述匹配方法,一共匹配到了 367.6 万条专利:
![]()
由于这样得到的结果本身就已经非常大了(6.09GB),所以我没有再又把这个数据和海关数据匹配,大家需要的话可以从海关数据中筛选自己需要的部分再使用企业匹配和这个数据进行匹配即可。
下图展示各年的匹配量以及各种专利的数量:
![]()
由于多年合并后的数据很大,所以我还提供了一份分年拆分的版本:
![]()
如果大家对匹配的详细过程感兴趣,附件中还提供了匹配和绘制上图使用的代码(do 文档,海关数据可以从平台上找到,专利原数据暂不提供)。
点击这里跳转到 RStata 短书平台获取附件:旧版本|2000~2016 年海关与专利数据匹配结果
评论