1985~2024 年各省市区县、各IPC部、大类、小类、各类型绿色专利申请与授权量(国家知识产权局标准)

今天给大家分享一份 1985~2024 年各省市区县、各 IPC 部、大类、小类、各类型绿色专利申请与授权量数据。

这份数据是基于国家知识产权局发布的《绿色专利分类号筛选标准》进行筛选汇总的。绿色专利是指与环保、节能、清洁能源等绿色技术相关的专利,是衡量地区绿色创新能力的重要指标。

数据概览

为了方便大家使用,我将数据按照 IPC 分类的不同层级进行了汇总,最终得到了三个数据文件:

  • 1985~2024年各省市区县、各 IPC 部、各类型绿色专利申请与授权量:按照 IPC 部(Section)汇总,IPC 部用字母 A-H 表示
  • 1985~2024年各省市区县、各 IPC 大类、各类型绿色专利申请与授权量:按照 IPC 大类(Class)汇总,IPC 大类用字母+两位数字表示(如 A01)
  • 1985~2024年各省市区县、各 IPC 小类、各类型绿色专利申请与授权量:按照 IPC 小类(Subclass)汇总,IPC 小类用字母+两位数字+字母表示(如 A01B)

每份数据均包含以下变量:

变量名 说明
年份 专利申请或授权年份(1985~2024)
省/省代码 省份名称及行政区划代码
市/市代码 城市名称及行政区划代码
县/县代码 区县名称及行政区划代码
部/大类/小类 IPC 分类号
发明申请量 发明专利申请数量
实用新型申请量 实用新型专利申请数量
总专利数量申请量 发明+实用新型申请总量
发明授权量 发明专利授权数量
实用新型授权量 实用新型专利授权数量
总专利数量授权量 发明+实用新型授权总量

以 IPC 部级别数据为例,dta 格式的数据预览如下:

处理方法

这份数据的处理主要分为以下几个步骤:

1. 数据准备

首先从 Incopat 专利数据库提取 1985~2024 年的专利数据,包含专利的基本信息(申请号、公开公告号、专利类型、IPC 分类号、申请人地址等)。

2. 绿色专利筛选

根据国家知识产权局发布的《绿色专利分类号筛选标准》,筛选出绿色技术相关的专利。筛选标准包含多个绿色技术分支,如:

  • 替代能源生产
  • 交通运输
  • 节能
  • 废弃物管理
  • 农业/林业
  • 行政监管与设计
  • 核能发电

3. 去重处理

在统计专利数量时,需要先去除重复记录。专利数据中可能存在同一专利既有申请记录又有授权记录的情况,统计时需要先去除这种重复:

*- 去除公开公告号末尾的 A、B、U、S 等标识
replace 公开公告号 = ustrregexs(1) if ustrregexm(公开公告号, "(.*)[A-Z]$")
*- 根据公开公告号去重
duplicates drop 年份 省 省代码 市 市代码 县 县代码 公开公告号, force
*- 根据申请号去重
duplicates drop 年份 省 省代码 市 市代码 县 县代码 申请号, force

4. IPC 分类拆分与汇总

使用 R 语言对 IPC 分类号进行拆分和汇总统计:

# 读取绿色专利筛选对照表
library(tidyverse)
haven::read_dta("绿色专利newipzlid.dta") %>%
mutate(newipzlid = as.numeric(newipzlid)) -> ipzlid

# 读取专利数据并筛选绿色专利
read_csv("专利数据sim.csv") %>%
mutate(newipzlid = as.numeric(newipzlid)) %>%
inner_join(ipzlid) -> df

# 拆分 IPC 分类号
df %>%
tidytext::unnest_tokens(output = "IPC", input = "IPC",
token = stringr::str_split, pattern = "; ", to_lower = F) -> df1

# 按 IPC 部分类统计申请量
df1 %>%
mutate(部 = str_sub(IPC, 1, 1)) %>%
distinct(年份, 省, 省代码, 市, 市代码, 县, 县代码, 部, 专利类型, newipzlid) %>%
filter(!is.na(省)) %>%
count(年份, 省, 省代码, 市, 市代码, 县, 县代码, 部, 专利类型) %>%
spread(专利类型, n, fill = 0) %>%
mutate(总专利数量 = 发明 + 实用新型) %>%
rename_at(c("发明", "实用新型", "总专利数量"), ~paste0(.x, "_申请量"))

5. 申请量与授权量合并

分别统计申请量和授权量后,将两者合并为最终的数据文件:

# 合并申请量和授权量
df1a %>%
full_join(df1b) %>%
mutate_at(vars(contains("量")), ~if_else(is.na(.x), 0, .x))

附件中也提供了该数据的处理代码供参考:

图表展示

为了便于大家更直观地感受这份数据,我绘制了一些图表。

下图展示了 1985~2024 年全国绿色专利申请量的时间趋势:

下图展示了 2024 年各省绿色专利申请量的空间分布:

下图展示了重点省份绿色专利申请量的趋势对比:

数据引用格式

由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:

RStata 数据中心: 1985~2024年各省市区县、各IPC部、大类、小类、各类型绿色专利申请与授权量(国家知识产权局标准). 2026. https://tidyfriday.cn/rsdb2/

英文文献可以使用下面的格式引用:

RStata Data Center: Green Patent Applications and Grants by Province, City, District/County, IPC Section, Main Class, and Subclass (National Intellectual Property Administration Standard), 1985–2024. 2026. https://tidyfriday.cn/rsdb2/

关联课程/数据推荐

1985~2024 年绿色专利申请与授权数据(国家知识产权局标准):https://rstata.duanshu.com/#/course/9cfa513db3a54891bef466caac9e6a62

使用 Stata 进行绿色专利的筛选:https://rstata.duanshu.com/#/course/2fd6838527754c94a3f5ccb0e3ba7be1

1985~2024 年各省市区县专利申请与授权数量统计(Incopat 数据库来源):https://rstata.duanshu.com/#/course/7300c81235b74b8bb911f04997ab7295

1985~2024 年瞪羚、独角兽与科技型初创企业绿色专利申请与授权信息(国家知识产权局筛选标准):https://rstata.duanshu.com/#/course/b89b0e6befab46faa81e27f4c9bc340e

1985~2024 年上市公司与绿色专利数据匹配结果(国家知识产权局标准):https://rstata.duanshu.com/#/course/dbab3251f6fa4aeb90ae020f5c35563e

点击这里跳转到 RStata 短书平台获取附件:1985~2024 年各省市区县、各IPC部、大类、小类、各类型绿色专利申请与授权量(国家知识产权局标准)

评论