1985~2024 年瞪羚、独角兽与科技型初创企业各行业领域、各类型专利申请与授权数量统计结果

最近有培训班的小伙伴需要研究瞪羚、独角兽与科技型初创企业在各行业的专利申请情况,由于工作量比较大,所以问我能不能帮忙处理一下,这不就来了!

瞪羚、独角兽与科技型初创企业数据和专利数据库平台上都有分享:

瞪羚、独角兽、创新型企业名录、工商注册信息匹配结果及经纬度数据(2025年6月爬取):https://rstata.duanshu.com/#/course/cd0c453f83f44b2e91e436cafb89027d

1985~2024 年专利申请与授权数据(版本 3,含申请人所处的省市区县):https://rstata.duanshu.com/#/brief/course/2397451274c546d3a36e156ffc865988

今天分享给大家的就是 1985~2024 年瞪羚、独角兽与科技型初创企业各行业领域、各类型专利申请与授权数量统计结果。

数据来源

该数据基于国家知识产权局专利数据库和瞪羚、独角兽与科技型初创企业名录数据,通过以下步骤处理得到:

  1. 数据匹配:将瞪羚、独角兽与科技型初创企业的公司名称与专利数据库中的申请人进行精确匹配
  2. 行业分类:将专利数据中的国民经济行业分类映射到 2017 版行业分类标准(门类、大类、中类、小类四个层级)
  3. 专利统计:按企业 ID、年份、行业分类、专利类型进行去重和计数统计
  4. 汇总整理:生成行业门类、行业大类、行业中类、行业小类四个层级的专利统计面板数据

数据概览

需要特别注意的是,不要把小类数量加总得到中类,因为一个专利可能落到多个行业分类里。其他的加总也类似。

为了方便大家使用,我把数据汇总成了四个层级的瞪羚、独角兽与科技型初创企业专利申请与授权数量面板数据:

  • 行业门类:按国民经济行业门类(A-T)汇总
  • 行业大类:按国民经济行业大类汇总
  • 行业中类:按国民经济行业中类汇总
  • 行业小类:按国民经济行业小类汇总

每个层级的数据包含以下变量:

变量名 说明
ID 企业 ID
年份 年份
行业门类/大类/中类/小类 国民经济行业分类
行业门类代码/大类代码/中类代码/小类代码 行业分类代码
发明专利申请量 发明专利申请数量
外观设计专利申请量 外观设计专利申请数量
实用新型专利申请量 实用新型专利申请数量
总专利申请量 三种专利申请量之和
发明专利授权量 发明专利授权数量
外观设计专利授权量 外观设计专利授权数量
实用新型专利授权量 实用新型专利授权数量
总专利授权量 三种专利授权量之和

该数据可用于研究瞪羚、独角兽与科技型初创企业的创新活动特征,例如分析不同行业的专利申请偏好、创新质量差异等。

数据预览如下:

图表展示

下图展示了 1985-2024 年瞪羚、独角兽与科技型初创企业专利申请与授权量的时间趋势:

下图展示了各行业大类专利申请量的排名情况(Top 15):

下图展示了各类型专利(发明专利、实用新型专利、外观设计专利)申请量的构成变化趋势:

处理代码

数据处理使用 R 语言完成,主要代码如下:

# 读取瞪羚、独角兽与科技型初创企业专利数据
read_csv("/Volumes/ADT/常用大数据/1985~2024年瞪羚、独角兽与科技型初创企业专利申请与授权信息.csv") -> df

# 读取行业分类对照表
read_csv("/Volumes/ADT/数据资料/分行业、省市区县统计专利申请与授权数量/专利国民经济分类.csv") -> industry

# 匹配行业分类
df %>%
inner_join(industry) %>%
select(-国民经济行业_主) %>%
tidytext::unnest_tokens(input = "国民经济分类", output = "国民经济分类", to_lower = F,
token = stringr::str_split, pattern = ";") -> df1

# 统一行业分类到 2017 标准
df1 %>%
mutate(国民经济分类 = str_remove_all(国民经济分类, "\\s")) %>%
left_join(haven::read_dta("/Volumes/ADT/数据资料/分行业、省市区县统计专利申请与授权数量/对照表.dta")) -> df2

# 按行业层级统计专利申请量和授权量
df2 %>%
distinct(ID, 年份, 行业门类, 行业门类代码, 专利类型, newipzlid) %>%
count(ID, 年份, 行业门类, 行业门类代码, 专利类型) %>%
mutate(专利类型 = paste0(专利类型, "专利申请量")) %>%
spread(专利类型, n, fill = 0) %>%
full_join(
df2 %>%
filter(!is.na(授权公告日)) %>%
distinct(ID, 年份, 行业门类, 行业门类代码, 专利类型, newipzlid) %>%
count(ID, 年份, 行业门类, 行业门类代码, 专利类型) %>%
mutate(专利类型 = paste0(专利类型, "专利授权量")) %>%
spread(专利类型, n, fill = 0)
) %>%
mutate(总专利申请量 = 发明专利申请量 + 外观设计专利申请量 + 实用新型专利申请量) %>%
mutate(总专利授权量 = 发明专利授权量 + 外观设计专利授权量 + 实用新型专利授权量) -> countdf

附件中也提供了该数据的处理代码供参考:

数据引用格式

由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:

RStata 数据中心: 1985~2024年瞪羚、独角兽与科技型初创企业各行业领域、各类型专利申请与授权数量统计结果. 2026. https://tidyfriday.cn/rsdb2/

英文文献可以使用下面的格式引用:

RStata Data Center: Statistics on Patent Applications and Grants by Industry Category for Gazelles, Unicorns, and Technology Start-ups, 1985–2024. 2026. https://tidyfriday.cn/rsdb2/

关联课程/数据推荐

瞪羚、独角兽、创新型企业名录、工商注册信息匹配结果及经纬度数据(2025年6月爬取):https://rstata.duanshu.com/#/course/cd0c453f83f44b2e91e436cafb89027d

1985~2024 年瞪羚、独角兽与科技型初创企业专利申请与授权信息:https://rstata.duanshu.com/#/course/fac1b81a8287457bbd6b914d37462a26

1985~2024 年瞪羚、独角兽与科技型初创企业绿色专利申请与授权信息(WIPO版本):https://rstata.duanshu.com/#/course/23b8f2cc51784800b5415a01c6e930e3

1985~2024 年瞪羚、独角兽与科技型初创企业绿色低碳专利申请与授权信息:https://rstata.duanshu.com/#/course/cb09b43b59b84f089f3daffdf8b3086f

1985~2024 年各省市区县、各IPC部、大类、小类、各类型专利申请与授权量:https://rstata.duanshu.com/#/course/f99176184db141e087ccd4e023517e89

如果有 RStata 定制需求,可以联系李老师付费定制。

点击这里跳转到 RStata 短书平台获取附件:1985~2024 年瞪羚、独角兽与科技型初创企业各行业领域、各类型专利申请与授权数量统计结果

评论