上次给大家分享了 1985~2024 的专利引用和授权信息:
1985~2024 年专利申请与授权数据(版本 3,含申请人所处的省市区县):https://rstata.duanshu.com/#/brief/course/2397451274c546d3a36e156ffc865988
今天再给大家分享一份专利引用与被引用信息:
![]()
该数据包含如下变量:
ipzlid、年份、公开公告号、公开公告日、引证专利、被引证专利、自引信息、他引信息、被自引信息、被他引信息、家族引证、家族被引证、引证申请人、被引证申请人、家族引证申请人、家族被引证申请人、引证次数、被引证次数、自引次数、他引次数、被自引次数、被他引次数、家族引证次数、家族被引证次数、引证科技文献、引证类别、被引证类别、引证来源、被引证来源、被引证国别_forward
该数据和上面提到的数据里面都包含 ipzlid 变量,也就是观测值编号,两个数据可以使用该变量匹配起来使用。
后续和专利匹配相关的结果也都可以使用 ipzlid 和这份数据匹配~
数据格式方面,提供的是供 Stata 读取的 dta 的格式。部分文件大小超过了 10GB,对于内存较小的电脑读取起来会很困难,不过 Stata 提供了一次读取部分观测值的方法,例如读取 2020 年文件(55.54GB)的前 10 万行:
use in 1/100000 using "2020.dta", clear |
使用 Stata 处理这种超大文件就可以一部分一部分的处理(读取之后删除不需要的变量)。
不过读取最后一部分的时候需要知道该文件总共的行数,这时候可以借助 describe 命令:
describe using "2020.dta" |
除了引用次数,该数据还包含专利引用和和被引用的详细信息。
专利数据匹配与提取服务
由于专利数据非常巨大,难以匹配和使用,因此特推出专利数据匹配服务,费用大致如下:
该服务仅面向 RStata 会员;
- 每 10 万个公司名称匹配收费 300 元,低于 10 万个公司名称也是 300 元(300 元起步);
- 专利知识宽度计算:每 10 万个公司名称收费 100 元,低于 10 万个公司名称也是 100 元(100 元起步);
- 绿色专利筛选:每 10 万个公司名称收费 100 元,低于 10 万个公司名称也是 100 元(100 元起步);
- 注意这里的数量是指匹配使用的数量,而非匹配成功的数量;
- 其他类似的操作 ……
另外该份专利数据实际上还包含很多变量,完整的数据大小超过 2TB,所以这里我仅仅选择了部分变量进行分享,如果需要其他变量的,可以联系李老师获取完整变量列表及帮忙提取所需变量,费用也是 300 元/次。
虽然不限制数量,不过变量数量过多也会导致数据变得非常大而难以处理,所以还是仅仅选择自己需要的变量就好。
点击这里跳转到 RStata 短书平台获取附件:1985~2024 的专利引用与被引用信息及次数统计
评论