1985~2024 年各省市区县、各行业、各类型绿色专利申请与授权量(WIPO标准)

前不久给大家分享了根据 WIPO 提供的绿色专利分类标准筛选的绿色专利申请与授权数据:

1985~2024 年绿色专利申请与授权数据(WIPO标准):https://rstata.duanshu.com/#/course/e2fbfb44b58b4d48a1cf7ba202587bac

在之前的课程中我们也讲解过如何爬取 WIPO 网页的绿色 IPC 分类以及如何在 Stata 中进行筛选:

使用 R 语言爬取处理 WIPO 绿色专利分类数据:https://rstata.duanshu.com/#/course/6edd7ed2f3284915b2c916ead3fbfd10

使用 Stata 进行绿色专利的筛选:https://rstata.duanshu.com/#/course/2fd6838527754c94a3f5ccb0e3ba7be1

今天再给大家分享一份分行业门类、大类、中类、小类统计的各省市区县各类型绿色专利申请与授权量数据。

具体的处理步骤如下:首先读取全部专利类型、授权公告日、省市区县信息的专利数据,使用 WIPO 绿色专利分类对照表(newipzlid)进行内连接筛选得到绿色专利数据;然后读取专利的国民经济行业分类信息,使用 unnest_tokens 将分号分隔的多行业分类拆分为单独的行业分类标签,并去除空白字符;接着读取国民经济行业分类对照表将不同版本的行业分类统一到 2017 年国家标准(GB/T 4754-2017),同时将专利类型统一为”发明”和”实用新型”两类;最后按照省市区县、年份、行业门类/大类/中类/小类代码分别统计各类专利的申请量和授权量(授权量通过筛选非缺失的授权公告日得到),并汇总为面板数据。

数据概览

为了方便大家使用,我把数据汇总成了各省市区县、各行业门类/大类/中类/小类、各类型绿色专利申请与授权量的面板数据。

提供的数据包含如下 5 个数据文件:

  • 1985~2024年各省市区县、各行业大类、各类型绿色专利申请与授权量(WIPO标准).dta
  • 1985~2024年各省市区县、各行业门类、各类型绿色专利申请与授权量(WIPO标准).dta
  • 1985~2024年各省市区县、各行业小类、各类型绿色专利申请与授权量(WIPO标准).dta
  • 1985~2024年各省市区县、各行业中类、各类型绿色专利申请与授权量(WIPO标准).dta
  • 国民经济行业分类和代码(GB_T4754_2017).dta

各行业分类层级的数据包含的变量有:省、省代码、市、市代码、县、县代码、年份、行业门类/大类/中类/小类代码、行业门类/大类/中类/小类名称、发明专利申请量、实用新型专利申请量、总专利申请量、发明专利申请并最终被授权量、实用新型专利申请并最终被授权量、总专利申请并最终被授权量。

行业门类数据预览如下:

行业大类数据预览如下:

行业中类数据预览如下:

行业小类数据预览如下:

国民经济行业分类和代码数据预览如下:

图表展示

下图展示了各行业门类绿色发明专利申请量的历年变化趋势对比:

下图展示了 2024 年各省制造业绿色发明专利申请量的地理分布:

下图展示了各行业门类发明专利与实用新型专利申请量的对比:

处理代码

下面展示使用 R 语言处理该数据的核心代码:

# 读取 WIPO 绿色专利分类对照表
library(tidyverse)
read_csv("绿色专利_WIPO/newipzlid.csv") %>%
mutate(newipzlid = as.numeric(newipzlid)) -> ipzlid

# 读取全部专利数据并筛选绿色专利
read_rds("全部专利类型、授权公告日、省市区县信息.rds") %>%
mutate(newipzlid = as.numeric(newipzlid)) %>%
inner_join(ipzlid) -> df1

# 读取专利的国民经济行业分类
read_csv("专利国民经济分类.csv") -> class

# 拆分多行业分类标签
class %>%
select(newipzlid, 国民经济分类) %>%
tidytext::unnest_tokens(input = "国民经济分类", output = "国民经济分类",
to_lower = F,
token = stringr::str_split, pattern = ";") -> class2

# 统一行业分类到 2017 标准
haven::read_dta("对照表.dta") -> industrytab
class2 %>%
left_join(df1) %>%
inner_join(industrytab) -> df3

# 统一专利类型
df3 %>%
mutate(专利类型 = if_else(str_detect(专利类型, "发明"), "发明", 专利类型)) -> df3

# 去重:同一专利在同一行业层级下只保留一条
df3 %>%
distinct(省, 省代码, 市, 市代码, 县, 县代码, newipzlid,
行业小类代码, .keep_all = T) -> df4

# 分行业小类统计申请量
df4 %>%
count(省, 省代码, 市, 市代码, 县, 县代码, 年份,
行业小类代码, 专利类型) -> countdf1

# 分行业小类统计授权量(筛选非缺失授权公告日)
df4 %>%
filter(!is.na(授权公告日)) %>%
count(省, 省代码, 市, 市代码, 县, 县代码, 年份,
行业小类代码, 专利类型) -> countdf2

附件中也提供了该数据的处理代码供参考:

数据引用格式

由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:

RStata 数据中心: 1985~2024年各省市区县、各行业、各类型绿色专利申请与授权量(WIPO标准). 2026. https://tidyfriday.cn/rsdb2/

英文文献可以使用下面的格式引用:

RStata Data Center: Green Patent Applications and Grants by Province, City, District/County, Industry, and Type (WIPO Standard), 1985–2024. 2026. https://tidyfriday.cn/rsdb2/

关联课程/数据推荐

1985~2024 年绿色专利申请与授权数据(WIPO标准):https://rstata.duanshu.com/#/course/e2fbfb44b58b4d48a1cf7ba202587bac

使用 R 语言爬取处理 WIPO 绿色专利分类数据:https://rstata.duanshu.com/#/course/6edd7ed2f3284915b2c916ead3fbfd10

使用 Stata 进行绿色专利的筛选:https://rstata.duanshu.com/#/course/2fd6838527754c94a3f5ccb0e3ba7be1

1985~2024 年各省市区县间各类型绿色技术专利合作数量统计(WIPO 筛选标准):https://rstata.duanshu.com/#/course/ed1aaff95daf49ba9674a86f98e46dd0

RStata 定制|专利数据匹配服务:https://rstata.duanshu.com/#/course/fd3bb2ac5b86425894a9814a02b36ac7

如果有相关需要可以联系李老师付费定制。

点击这里跳转到 RStata 短书平台获取附件:1985~2024 年各省市区县、各行业、各类型绿色专利申请与授权量(WIPO标准)

评论