1998~2024 的专利引用与被引用信息及次数统计

上次给大家分享了 1998~2024 的专利引用和授权信息:

1985~2024 年专利申请与授权数据(版本 3,含申请人所处的省市区县):https://rstata.duanshu.com/#/brief/course/2397451274c546d3a36e156ffc865988

今天再给大家分享一份专利引用与被引用信息:

该数据包含如下变量:

ipzlid、年份、公开公告号、公开公告日、引证专利、被引证专利、自引信息、他引信息、被自引信息、被他引信息、家族引证、家族被引证、引证申请人、被引证申请人、家族引证申请人、家族被引证申请人、引证次数、被引证次数、自引次数、他引次数、被自引次数、被他引次数、家族引证次数、家族被引证次数、引证科技文献、引证类别、被引证类别、引证来源、被引证来源、被引证国别_forward

该数据和上面提到的数据里面都包含 ipzlid 变量,也就是观测值编号,两个数据可以使用该变量匹配起来使用。

后续和专利匹配相关的结果也都可以使用 ipzlid 和这份数据匹配~

数据格式方面,提供的是供 Stata 读取的 dta 的格式。部分文件大小超过了 10GB,对于内存较小的电脑读取起来会很困难,不过 Stata 提供了一次读取部分观测值的方法,例如读取 2020 年文件(55.54GB)的前 10 万行:

use in 1/100000 using "2020.dta", clear

使用 Stata 处理这种超大文件就可以一部分一部分的处理(读取之后删除不需要的变量)。

不过读取最后一部分的时候需要知道该文件总共的行数,这时候可以借助 describe 命令:

describe using "2020.dta"

*> Contains data 数据处理:微信公众号
*> RStata
*> Observations: 5,380,580 8 Dec 2024 21:42
*> Variables: 30
*> ---------------------------------------------------------------------
*> Variable Storage Display Value
*> name type format label Variable label
*> ---------------------------------------------------------------------
*> ipzlid str11 %11s
*> 年份 int %10.0g
*> 公开公告号 str13 %-9s
*> 公开公告日 str10 %-9s
*> 引证专利 strL %-9s
*> 被引证专利 strL %-9s
*> 自引信息 str614 %-9s
*> 他引信息 strL %-9s
*> 被自引信息 str873 %-9s
*> 被他引信息 strL %-9s
*> 家族引证 strL %-9s
*> 家族被引证 strL %-9s
*> 引证申请人 strL %-9s
*> 被引证申请人 strL %-9s
*> 家族引证申请人 strL %-9s
*> 家族被引证申请人 strL %-9s
*> 引证次数 int %10.0g
*> 被引证次数 int %10.0g
*> 自引次数 byte %10.0g
*> 他引次数 int %10.0g
*> 被自引次数 byte %10.0g
*> 被他引次数 int %10.0g
*> 家族引证次数 int %10.0g
*> 家族被引证次数 int %10.0g
*> 引证科技文献 strL %-9s
*> 引证类别 str187 %-9s
*> 被引证类别 str233 %-9s
*> 引证来源 str889 %-9s
*> 被引证来源 str79 %-9s
*> 被引证国别_forward
*> str90 %-9s
*> ---------------------------------------------------------------------
*> Sorted by:

除了引用次数,该数据还包含专利引用和和被引用的详细信息。

专利数据匹配与提取服务

由于专利数据非常巨大,难以匹配和使用,因此特推出专利数据匹配服务,费用大致如下:

该服务仅面向 RStata 会员;

  • 每 10 万个公司名称匹配收费 300 元,低于 10 万个公司名称也是 300 元(300 元起步);
  • 专利知识宽度计算:每 10 万个公司名称收费 100 元,低于 10 万个公司名称也是 100 元(100 元起步);
  • 绿色专利筛选:每 10 万个公司名称收费 100 元,低于 10 万个公司名称也是 100 元(100 元起步);
  • 注意这里的数量是指匹配使用的数量,而非匹配成功的数量;
  • 其他类似的操作 ……

另外该份专利数据实际上还包含很多变量,完整的数据大小超过 2TB,所以这里我仅仅选择了部分变量进行分享,如果需要其他变量的,可以联系李老师获取完整变量列表及帮忙提取所需变量,费用也是 300 元/次。

虽然不限制数量,不过变量数量过多也会导致数据变得非常大而难以处理,所以还是仅仅选择自己需要的变量就好。

点击这里跳转到 RStata 短书平台获取附件:1985~2024 的专利引用与被引用信息及次数统计

评论