2007~2020 年税调企业各行业领域、各类型专利申请与授权数量统计结果

今天给大家分享一份 2007~2020 年税调企业各行业领域、各类型专利申请与授权数量统计结果。

处理方法

需要特别注意的是,不要把小类数量加总得到中类,因为一个专利可能落到多个行业分类里。其他的加总也类似。

该数据是基于税调数据与专利数据匹配结果,按照国民经济行业分类标准(2017版)对税调企业的专利申请与授权数量进行分行业统计得到。

具体处理流程如下:

  1. 数据匹配:首先将税调数据与专利数据进行匹配,得到税调企业的专利申请与授权信息。
  2. 行业分类统一:将专利数据中的国民经济分类统一到2017年标准,使用对照表进行转换。
  3. 去重处理:对专利数据进行去重,去除公开公告号末尾的A、B、U、S(分别代表发明专利申请公开、发明专利授权公告、实用新型专利授权公告、外观设计专利授权公告),避免申请与授权重复计数。
  4. 分行业统计:按照行业门类、大类、中类、小类四个层级,分别统计各类型专利(发明、外观设计、实用新型)的申请量和授权量。
  5. 汇总计算:计算总专利申请量和总专利申请并最终被授权量。

数据概览

为了方便大家使用,我把数据汇总成了四个层级的面板数据:

  • 行业门类:20个行业门类
  • 行业大类:97个行业大类
  • 行业中类:473个行业中类
  • 行业小类:1380个行业小类

数据包含的变量如下:

sdid(税调数据观测值编号)、年份、行业门类、行业门类代码、行业大类、行业大类代码、行业中类、行业中类代码、行业小类、行业小类代码、发明专利申请量、外观设计专利申请量、实用新型专利申请量、总专利申请量、发明专利申请并最终被授权量、外观设计专利申请并最终被授权量、实用新型专利申请并最终被授权量、总专利申请并最终被授权量

数据预览如下:

图表展示

下图展示了2007-2020年各行业门类平均专利申请量的时间趋势:

下图展示了各行业大类专利申请量排名(Top 15):

下图展示了三种专利类型申请量占比变化趋势:

处理代码

数据处理的主要 R 代码如下:

# 读取税调与专利匹配结果
library(tidyverse)
read_csv("/Volumes/ADT/常用大数据/税调与专利数据匹配结果分年.csv") -> df

# 读取国民经济行业分类对照表
read_csv("/Volumes/ADT/数据资料/分行业、省市区县统计专利申请与授权数量/专利国民经济分类.csv") -> industry

# 匹配行业分类
df %>%
inner_join(industry) %>%
select(-国民经济行业_主) %>%
tidytext::unnest_tokens(input = "国民经济分类", output = "国民经济分类", to_lower = F,
token = stringr::str_split, pattern = ";") -> df1

# 统一行业分类到 2017 标准
df1 %>%
select(sdid, newipzlid, 年份, 公开公告号, 申请号, 授权公告日, 专利类型, 国民经济分类) %>%
mutate(国民经济分类 = str_remove_all(国民经济分类, "\\s")) %>%
left_join(haven::read_dta("/Volumes/ADT/数据资料/分行业、省市区县统计专利申请与授权数量/对照表.dta")) -> df2

# 去重
df2 %>%
mutate(公开公告号 = str_remove_all(公开公告号, "[A-Z]$")) %>%
distinct(sdid, 公开公告号, .keep_all = T) %>%
distinct(sdid, 申请号, .keep_all = T) -> df2

# 分行业统计专利申请与授权数量
df2 %>%
distinct(sdid, 年份, 行业门类, 行业门类代码, 专利类型, newipzlid) %>%
count(sdid, 年份, 行业门类, 行业门类代码, 专利类型) %>%
mutate(专利类型 = paste0(专利类型, "专利申请量")) %>%
spread(专利类型, n, fill = 0) %>%
full_join(
df2 %>%
filter(!is.na(授权公告日)) %>%
distinct(sdid, 年份, 行业门类, 行业门类代码, 专利类型, newipzlid) %>%
count(sdid, 年份, 行业门类, 行业门类代码, 专利类型) %>%
mutate(专利类型 = paste0(专利类型, "专利申请并最终被授权量")) %>%
spread(专利类型, n, fill = 0)
) %>%
mutate(总专利申请量 = 发明专利申请量 + 外观设计专利申请量 + 实用新型专利申请量) %>%
mutate(总专利申请并最终被授权量 = 发明专利申请并最终被授权量 + 外观设计专利申请并最终被授权量 + 实用新型专利申请并最终被授权量) %>%
mutate(across(contains("量"), ~if_else(is.na(.x), 0, .x))) -> countdf1

附件中也提供了该数据的处理代码供参考:

注意事项

在统计专利数量时需要注意,专利数据中有很多申请和授权同时存在的专利,在统计专利数量的时候应该先去除这种重复情况。统计时可以先去除公开公告号里面的 A、B、U、S,然后使用 duplicates drop 去除重复的。

数据引用格式

由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:

RStata 数据中心: 2007~2020年税调企业各行业领域、各类型专利申请与授权数量统计结果. 2026. https://tidyfriday.cn/rsdb2/

英文文献可以使用下面的格式引用:

RStata Data Center: Patent Applications and Grants by Industry Sector and Type for Tax Survey Enterprises, 2007–2020. 2026. https://tidyfriday.cn/rsdb2/

关联课程/数据推荐

2007~2020 年税调数据与专利数据匹配结果(版本3):https://rstata.duanshu.com/#/course/040a2ba951304f5b89f6c925320547f3

2007~2016 年各税调各种专利数量及专利知识宽度:https://rstata.duanshu.com/#/course/8a3d6e44dcf5428b892d0239a3e16bf1

2007~2016 年税调与本年及未来三年的专利数据匹配结果:https://rstata.duanshu.com/#/course/78375d171cd14d9686b7cb9f25e60dde

2007~2020 年税调与绿色低碳专利匹配结果:https://rstata.duanshu.com/#/course/91ac36193772474583757c3d04d53465

使用 Stata 进行税调专利匹配:超高效的匹配流程:https://rstata.duanshu.com/#/course/43fd5249e06c462a95c499b2c646046d

点击这里跳转到 RStata 短书平台获取附件:2007~2020 年税调企业各行业领域、各类型专利申请与授权数量统计结果

评论