1985~2024 年各省市区县、各IPC部、大类、小类、各类型绿色专利申请与授权量(WIPO标准)

今天给大家分享一份 1985~2024年各省市区县、各IPC部、大类、小类、各类型绿色专利申请与授权量(WIPO标准) 数据。

这份数据是基于分年份专利原始数据进一步整理得到的绿色专利汇总结果。结合文件夹中的 code/main.do、code/main1.R、code/main2.R 和 code/main3.R 来看,处理流程大致是:先从分年份专利数据中提取申请与授权记录,统一公开公告号尾部字母并按“年份—省市区县—专利标识”去重;再与 WIPO 绿色专利对应的 newipzlid 名单匹配,保留绿色专利;之后把 IPC 分类拆分为“部—大类—小类”三个层级,分别统计各地区发明专利、实用新型及总专利的申请量和授权量,最终输出为 3 份 Stata 数据文件。

数据概览

为了方便大家使用,我把这份数据整理成了 3 份不同 IPC 层级的面板数据:

  • 1985~2024年各省市区县、各IPC部、各类型绿色专利申请与授权量(WIPO标准).dta
  • 1985~2024年各省市区县、各IPC大类、各类型绿色专利申请与授权量(WIPO标准).dta
  • 1985~2024年各省市区县、各IPC小类、各类型绿色专利申请与授权量(WIPO标准).dta

这 3 份数据的覆盖范围和规模如下:

数据文件 行数 主要分类层级
各IPC部版本 254,445 9 个 IPC 部
各IPC大类版本 815,516 136 个 IPC 大类
各IPC小类版本 1,474,667 678 个 IPC 小类

从数据本身来看,这组数据具有几个比较清晰的特点:

  • 时间范围为 1985~2024 年,共 40 年;
  • 空间上覆盖 34 个省级地区、371 个地级市、2760 个区县;
  • 每份数据都保留了 年份、省/市/县 及其代码、对应的 IPC 分类变量;
  • 指标部分包含 发明_申请量、实用新型_申请量、总专利数量_申请量、发明_授权量、实用新型_授权量、总专利数量_授权量;
  • 因而既可以直接观察不同地区绿色专利申请与授权的长期变化,也可以进一步构造某一 IPC 部/大类/小类的绿色技术布局、绿色发明占比、授权转化情况等更细的指标。

如果您关心的是“地区绿色创新活跃度”,可以直接按省、市、县比较总专利申请量与授权量;如果您关心的是“绿色技术结构变化”,则可以利用部、大类、小类三个层级观察不同技术方向的时序演变和空间差异。

3 份数据的预览如下:

部层级数据预览:

大类层级数据预览:

小类层级数据预览:

图表展示

为了更直观地感受这份数据,文件夹中还基于 Stata 生成了 3 幅图。

第一幅图展示了 1985~2024 年全国绿色专利申请量与授权量的长期趋势:

第二幅图展示了 2024 年各地级市绿色专利申请量与授权量之间的关系,并加入了 OLS 拟合线,便于观察城市层面的相关性:

第三幅图展示了 2024 年各地级市绿色专利申请量的空间分布,更适合快速识别高值地区和区域差异:

处理代码说明

这个文件夹里同时保留了 R 和 Stata 代码。前者主要负责绿色专利筛选、IPC 拆分和汇总统计,后者负责绘图展示。

从 code/main.do 来看,原始专利数据的处理首先是按年份读取,并对公开公告号和申请号进行去重。核心思路如下:

*- 提取申请数据并按地区和专利标识去重
forval y = 2013/2024 {
use "/Volumes/rstata2t/newIP专利数据分年/`y'.dta", clear
replace 公开公告号 = ustrregexs(1) if ustrregexm(公开公告号, "(.*)[A-Z]$")
duplicates drop 年份 省 省代码 市 市代码 县 县代码 公开公告号, force
duplicates drop 年份 省 省代码 市 市代码 县 县代码 申请号, force
replace 专利类型 = "发明" if index(专利类型, "发明")
keep newipzlid 年份 公开公告号 专利类型 授权公告日 省 省代码 市 市代码 县 县代码 IPC
save res/`y', replace
}

接着,code/main1.R 和 code/main2.R 会把 IPC 字段拆开,并分别在“部”“大类”“小类”层级统计申请量与授权量。下面这段代码就是典型的处理逻辑:

# 拆分 IPC 并在“部”层级统计申请量
df %>%
tidytext::unnest_tokens(output = "IPC", input = "IPC",
token = stringr::str_split, pattern = "; ", to_lower = FALSE) -> df1

df1 %>%
mutate(部 = str_sub(IPC, 1, 1)) %>%
distinct(年份, 省, 省代码, 市, 市代码, 县, 县代码, 部, 专利类型, newipzlid) %>%
filter(!is.na(省)) %>%
count(年份, 省, 省代码, 市, 市代码, 县, 县代码, 部, 专利类型) %>%
spread(专利类型, n, fill = 0) %>%
mutate(总专利数量 = 发明 + 实用新型)

最后,code/main3.R 将申请量与授权量合并,并导出为最终的 dta 文件:

# 合并申请量与授权量并导出 dta
df1a %>%
full_join(df1b) %>%
mutate_at(vars(contains("量")), ~if_else(is.na(.x), 0, .x)) -> df1

df1 %>%
haven::write_dta(
"1985~2024年各省市区县、各IPC部、各类型绿色专利申请与授权量(WIPO标准).dta",
label = "数据处理:微信公众号 RStata"
)

此外,code/green_patent_3charts.do 里还给出了这份数据的可视化脚本,包括全国趋势图、城市散点图和城市地图,方便直接复现图表或继续改图。

附件中也提供了该数据的处理代码供参考:

对应文件为 Encrypted_Code_Report.pdf。

数据引用格式

由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:

RStata 数据中心: 1985~2024年各省市区县、各IPC部、大类、小类、各类型绿色专利申请与授权量(WIPO标准). 2026. https://tidyfriday.cn/rsdb2/

英文文献可以使用下面的格式引用:

RStata Data Center: Green Patent Applications and Grants by Province, City, District/County, IPC Sections, Classes, Subclasses, and Type (WIPO Standard), 1985–2024. 2026. https://tidyfriday.cn/rsdb2/

关联课程/数据推荐

如果您还想继续扩展到专利筛选方法、WIPO 绿色分类处理,或者进一步做相近主题的数据分析,可以继续参考下面这些课程和数据:

1985~2024 年各省市区县、各IPC部、大类、小类、各类型专利申请与授权量:https://rstata.duanshu.com/#/course/f99176184db141e087ccd4e023517e89

1985~2024 年绿色专利申请与授权数据(WIPO标准):https://rstata.duanshu.com/#/course/e2fbfb44b58b4d48a1cf7ba202587bac

使用 R 语言爬取处理 WIPO 绿色专利分类数据:https://rstata.duanshu.com/#/course/6edd7ed2f3284915b2c916ead3fbfd10

使用 Stata 进行绿色专利的筛选:https://rstata.duanshu.com/#/course/2fd6838527754c94a3f5ccb0e3ba7be1

1985~2024 年各省市区县间各类型绿色技术专利合作数量统计(WIPO 筛选标准):https://rstata.duanshu.com/#/course/ed1aaff95daf49ba9674a86f98e46dd0

点击这里跳转到 RStata 短书平台获取附件:1985~2024 年各省市区县、各IPC部、大类、小类、各类型绿色专利申请与授权量(WIPO标准)

评论