1985~2024 年各省市区县、各行业、各类型关键数字技术专利申请与授权量

今天给大家分享一份1985~2024年各省市区县、各行业、各类型关键数字技术专利申请与授权量面板数据。由 RStata 数据中心基于国家知识产权局专利数据和《国民经济行业分类与代码(GB/T 4754-2017)》处理得到。

数据来源与处理方法

该数据基于国家知识产权局专利申请与授权信息,通过以下步骤处理得到:

  1. 关键数字技术专利筛选:使用国家知识产权局定义的关键数字技术专利筛选对照表(IPC 分类号),从全部专利中筛选出关键数字技术专利。
  2. 行业分类匹配:将专利的国民经济分类代码匹配至《国民经济行业分类与代码(GB/T 4754-2017)》的分类体系,统一行业分类标准。
  3. 地理信息匹配:将专利申请地址解析为省、市、县三级行政区划信息。
  4. 汇总统计:按年份、省、市、县、行业小类/中类/大类/门类四个层级分别汇总专利申请量(发明专利、实用新型专利)和授权量。

附件中提供了 4 个行业分类层级的数据文件和 1 个行业分类对照表文件。

数据概览

为了方便大家使用,我把数据汇总成了省份/城市/区县三级空间单元的行业小类/中类/大类/门类面板数据,共包含以下 5 个数据文件:

  • 1985~2024年各省市区县、各行业小类、各类型关键数字技术专利申请与授权量.dta
  • 1985~2024年各省市区县、各行业中类、各类型关键数字技术专利申请与授权量.dta
  • 1985~2024年各省市区县、各行业大类、各类型关键数字技术专利申请与授权量.dta
  • 1985~2024年各省市区县、各行业门类、各类型关键数字技术专利申请与授权量.dta
  • 国民经济行业分类和代码(GB_T4754_2017).dta

每个数据文件包含以下变量:

变量名 说明
省/省代码 省份名称及代码
市/市代码 城市名称及代码
县/县代码 区县名称及代码
年份 年份
行业小类/中类/大类/门类代码 对应层级的行业分类代码
发明专利申请量 发明专利申请数量
实用新型专利申请量 实用新型专利申请数量
总专利申请量 发明+实用新型专利申请总量
发明专利申请并最终被授权量 发明专利申请后最终获得授权的数量
实用新型专利申请并最终被授权量 实用新型专利申请后最终获得授权的数量
总专利申请并最终被授权量 发明+实用新型专利申请并最终授权总量

行业门类分布(以行业门类数据为例):

行业门类 代码 专利申请量 占比
制造业 C 11,602,175件 ~58%
居民服务业 O 5,029,956件 ~25%
信息传输/软件和信息技术服务业 I 3,337,014件 ~17%
电力、热力、燃气及水生产和供应业 D 494,777件 ~2%
农林牧渔业 A 162,092件 ~1%
建筑业 E 149,880件 ~1%
采矿业 B 50,755件 ~0.3%

数据用途:该数据可用于研究不同行业的数字技术创新水平、行业间创新差异、区域创新格局等话题。

数据预览如下:

图表展示

为了更直观地展示这份数据,我基于行业门类数据绘制了以下三幅图表:

各行业门类专利申请量对比

下图展示了 1985~2024 年各行业门类的关键数字技术专利申请量对比:

三大行业专利申请量趋势对比

下图展示了制造业(C)、信息传输与软件服务业(I)、居民服务业(O)三大行业 1985~2024 年的专利申请量时间趋势对比:

制造业专利申请量省份分布地图

下图展示了制造业(C)在各省的专利申请量分布地图:

处理代码说明

该数据使用 R 语言处理得到,附件中提供了处理代码供大家参考。核心处理流程如下:

# 读取关键数字技术专利筛选对照表
read_csv("关键数字技术专利筛选对照表/newipzlid.csv") %>%
mutate(newipzlid = as.numeric(newipzlid)) -> ipzlid

# 读取原始专利数据并筛选关键数字技术专利
read_rds("分行业省市区县统计专利申请与授权数量/全部专利类型、授权公告日、省市区县信息.rds") %>%
mutate(newipzlid = as.numeric(newipzlid)) %>%
inner_join(ipzlid) -> df1

# 读取国民经济分类信息
read_csv("分行业省市区县统计专利申请与授权数量/专利国民经济分类.csv") -> class

# 展开国民经济分类(多对多关系)
class %>%
select(newipzlid, 国民经济分类) %>%
tidytext::unnest_tokens(input = "国民经济分类", output = "国民经济分类",
to_lower = F, token = str_split, pattern = ";") -> class2

# 匹配行业分类(统一至 2017 标准)
haven::read_dta("对照表.dta") -> industrytab
df2 %>% inner_join(industrytab) -> df3

# 按行业层级汇总统计
df4 %>%
count(省, 省代码, 市, 市代码, 县, 县代码, 年份, 行业门类代码, 专利类型) -> countdf1

# 计算授权数量
df4 %>%
filter(!is.na(授权公告日)) %>%
count(省, 省代码, 市, 市代码, 县, 县代码, 年份, 行业门类代码, 专利类型) -> countdf2

# 整理为宽格式数据
countdf1 %>%
mutate(专利类型 = paste0(专利类型, "专利申请量")) %>%
spread(专利类型, n, fill = 0) -> countdf1b

countdf2 %>%
mutate(专利类型 = paste0(专利类型, "专利申请并最终被授权量")) %>%
spread(专利类型, n, fill = 0) -> countdf2b

# 合并并输出数据
countdf1b %>%
left_join(countdf2b) %>%
mutate(总专利申请量 = 发明专利申请量 + 实用新型专利申请量,
总专利申请并最终被授权量 = 发明专利申请并最终被授权量 + 实用新型专利申请并最终被授权量) -> countdf

haven::write_dta("1985~2024年各省市区县、各行业门类、各类型关键数字技术专利申请与授权量.dta",
label = "数据处理:微信公众号 RStata")

附件中也提供了该数据的处理代码供参考:

数据引用格式

在论文中使用该数据请声明数据来源于 RStata 数据中心,或者 RStata Data Center,并使用下述的格式引用:

RStata 数据中心: 1985~2024年各省市区县、各行业、各类型关键数字技术专利申请与授权量. 2026. https://tidyfriday.cn/rsdb2/

英文文献可以使用下面的格式引用:

RStata Data Center: Panel Data on Patent Applications and Grants for Key Digital Technologies by Province, City, County, and Industry in China, 1985–2024. 2026. https://tidyfriday.cn/rsdb2/

关联课程/数据推荐

平台上有丰富的专利数据相关课程和数据,感兴趣的小伙伴可以自行学习:

1985~2024 年关键数字技术专利筛选结果:https://rstata.duanshu.com/#/course/f9129bf93ecc4da8b15a5065e14b90e0

1985~2024 年各省市区县、各IPC部、大类、小类、各类型专利申请与授权量:https://rstata.duanshu.com/#/course/f99176184db141e087ccd4e023517e89

1985~2024 年上市公司与关键数字技术专利数据匹配结果:https://rstata.duanshu.com/#/course/2f5693d3305648d19529eaa904484bbd

1985~2024 年各省市区县间各类型关键数字技术专利合作数量统计:https://rstata.duanshu.com/#/course/c364967992904702915d38fb9e0a7ad0

如果有相关需要,欢迎联系李老师进行付费定制。

点击这里跳转到 RStata 短书平台获取附件:1985~2024 年各省市区县、各行业、各类型关键数字技术专利申请与授权量

评论