1985~2024 年瞪羚、独角兽与科技型初创企业绿色专利申请与授权信息(国家知识产权局筛选标准)

前不久给大家更新了一份绿色专利数据:

1985~2024 年绿色专利申请与授权数据(国家知识产权局标准):https://rstata.duanshu.com/#/course/9cfa513db3a54891bef466caac9e6a62

最近有培训班的小伙伴提出需要将瞪羚、独角兽、创新型企业和更新版的绿色专利数据进行匹配,但是数据量比较大,希望我能帮忙处理一下。瞪羚、独角兽、创新型企业的数据我之前也分享过:

瞪羚、独角兽、创新型企业名录、工商注册信息匹配结果及经纬度数据(2025年6月爬取):https://rstata.duanshu.com/#/course/cd0c453f83f44b2e91e436cafb89027d

今天给大家分享的就是这份瞪羚、独角兽、创新型企业和绿色专利数据匹配的结果。

数据概览

数据的时间范围为 1985~2024 年,为了避免数据过于庞大的问题,我使用了三组文件存放这份数据。

第一组是瞪羚、独角兽与科技型初创企业绿色专利申请与授权信息,一共有 362331 条观测值,里面有 newipzlid 变量(每个 newipzlid 对应一个专利)。

  • 1985~2024年瞪羚、独角兽与科技型初创企业绿色专利申请与授权信息.dta

其中 newipzlid 是我给专利的编号,包含 newipzlid 变量的数据可以直接和这个数据使用该变量匹配;省、省代码、市、市代码、县、县代码是根据经纬度和 2021 年行政区划判断得到。

第二组是 newipzlid 变量和绿色技术分支编号对照表(每个专利所属的绿色类别):

  • 瞪羚、独角兽与科技型初创企业绿色专利ID对照表.dta

第三组是绿色专利分类号筛选标准:

  • 绿色专利分类号筛选标准.dta

为了方便大家使用,我还提供了汇总结果:

  • 1985~2024年瞪羚、独角兽与科技型初创企业绿色专利申请与授权数量统计.dta

下图展示了历年瞪羚、独角兽与科技型初创企业绿色专利申请与授权数量变化:

注意事项

在计算绿色专利申请数量时需要注意,专利数据里面有很多申请和授权同时存在的专利,在统计专利数量的时候应该先去除这种重复情况:

统计的时候可以先去除公开公告号里面的 A、B、U、S。其中 A 代表发明专利的申请公开,B 代表发明专利的授权公告,U 代表实用新型专利的授权公告,S 代表外观设计专利的授权公告。

gen 公开公告号_clean = regexr(公开公告号, "[A-Z]$", "")
replace 专利类型 = "发明" if index(专利类型, "发明")
*- 使用 duplicates drop 去除重复的
duplicates drop 公司代码变量 公开公告号_clean, force
duplicates drop 公司代码变量 申请号, force

数据引用格式

由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:

RStata 数据中心: 1985~2024年瞪羚、独角兽与科技型初创企业绿色专利申请与授权信息(国家知识产权局筛选标准). 2025. https://tidyfriday.cn/rsdb2/

英文文献可以使用下面的格式引用:

RStata Data Center: Panel Data on Green Patent Applications and Grants by Gazelle Enterprises, Unicorns, and Tech Startups, 1985–2024 (CNIPA Screening Criteria). 2025. https://tidyfriday.cn/rsdb2/

点击这里跳转到 RStata 短书平台获取附件:1985~2024 年瞪羚、独角兽与科技型初创企业绿色专利申请与授权信息(国家知识产权局筛选标准)

评论