1985~2024 年绿色专利申请与授权数据(WIPO标准)

前不久给大家分享了根据国家知识产权局提供的筛选标准筛选的绿色技术专利数据:

1985~2024 年绿色专利申请与授权数据(国家知识产权局标准): https://rstata.duanshu.com/#/brief/course/9cfa513db3a54891bef466caac9e6a62

也给大家分享了如何使用 Stata 根据该标准筛选绿色技术专利:

名师讲堂|使用 Stata 筛选绿色技术专利(国家知识产权局标准): https://rstata.duanshu.com/#/brief/course/66607ec05c3748699883f5e834682125

实际上,除了国家知识产权局提供的绿色技术标准,WIPO 也提供了类似的筛选标准:https://www.wipo.int/classifications/ipc/green-inventory/home

在之前的课程中我们也讲解过如何爬取该网页的绿色 IPC 分类以及如何在 Stata 中进行筛选:

使用 R 语言爬取处理 WIPO 绿色专利分类数据: https://rstata.duanshu.com/#/brief/course/6edd7ed2f3284915b2c916ead3fbfd10

使用 Stata 进行绿色专利的筛选: https://rstata.duanshu.com/#/brief/course/2fd6838527754c94a3f5ccb0e3ba7be1

今年我们再使用这个方法筛选一份绿色专利数据。

数据概览

提供的数据包含如下三个数据文件(夹):

  • WIPO绿色专利筛选结果分年(文件夹)
  • 1985~2024年WIPO绿色专利申请与授权数量统计.dta
  • 1985~2024年各省市区县各类型WIPO绿色专利申请与授权数量统计.dta

由于数据非常巨大,所以提供的是按年拆分的结果。

数据格式方面,提供的是供 Stata 读取的 dta 的格式。部分文件大小超过了 10GB,对于内存较小的电脑读取起来会很困难,不过 Stata 提供了一次读取部分观测值的方法,例如读取 2020 年文件的前 10 万行:

use in 1/100000 using "2020.dta", clear

使用 Stata 处理这种超大文件就可以一部分一部分的处理(读取之后删除不需要的变量)。

不过读取最后一部分的时候需要知道该文件总共的行数,这时候可以借助 describe 命令:

describe using "2020.dta"

后面两个文件是申请和授权数量的统计。注意在统计数量的时候需要前去除重复的,详情可以阅读这个介绍的结尾:https://rstata.duanshu.com/#/brief/course/9cfa513db3a54891bef466caac9e6a62

例如 2020 年的数据概览如下:

分年汇总数量概览如下:

分年、省市区县数据概览如下:

绘图展示

下图展示了 2022 年各区县绿色专利申请量:

2022 年各城市绿色专利申请量:

2023 年各省份绿色专利申请量:

历年各省份绿色发明专利申请量的变化:

由于专利从申请到公开需要时间,所以今年的专利数据不全是正常的(到我处理又得时间)。

点击这里跳转到 RStata 短书平台获取附件:1985~2024 年绿色专利申请与授权数据(WIPO标准)

评论