前不久给大家更新了一份绿色专利数据:
1985~2024 年绿色专利申请与授权数据(国家知识产权局标准):https://rstata.duanshu.com/#/course/9cfa513db3a54891bef466caac9e6a62
最近有培训班的小伙伴提出需要将瞪羚、独角兽、创新型企业和更新版的绿色专利数据进行匹配,但是数据量比较大,希望我能帮忙处理一下。瞪羚、独角兽、创新型企业的数据我之前也分享过:
瞪羚、独角兽、创新型企业名录、工商注册信息匹配结果及经纬度数据(2025年6月爬取):https://rstata.duanshu.com/#/course/cd0c453f83f44b2e91e436cafb89027d
今天给大家分享的就是这份瞪羚、独角兽、创新型企业和绿色专利数据匹配的结果。
数据概览
数据的时间范围为 1985~2024 年,为了避免数据过于庞大的问题,我使用了三组文件存放这份数据。
第一组是瞪羚、独角兽与科技型初创企业绿色专利申请与授权信息,一共有 362331 条观测值,里面有 newipzlid 变量(每个 newipzlid 对应一个专利)。
- 1985~2024年瞪羚、独角兽与科技型初创企业绿色专利申请与授权信息.dta
![]()
其中 newipzlid 是我给专利的编号,包含 newipzlid 变量的数据可以直接和这个数据使用该变量匹配;省、省代码、市、市代码、县、县代码是根据经纬度和 2021 年行政区划判断得到。
第二组是 newipzlid 变量和绿色技术分支编号对照表(每个专利所属的绿色类别):
- 瞪羚、独角兽与科技型初创企业绿色专利ID对照表.dta
![]()
第三组是绿色专利分类号筛选标准:
- 绿色专利分类号筛选标准.dta
![]()
为了方便大家使用,我还提供了汇总结果:
- 1985~2024年瞪羚、独角兽与科技型初创企业绿色专利申请与授权数量统计.dta
![]()
下图展示了历年瞪羚、独角兽与科技型初创企业绿色专利申请与授权数量变化:
![]()
注意事项
在计算绿色专利申请数量时需要注意,专利数据里面有很多申请和授权同时存在的专利,在统计专利数量的时候应该先去除这种重复情况:
![]()
统计的时候可以先去除公开公告号里面的 A、B、U、S。其中 A 代表发明专利的申请公开,B 代表发明专利的授权公告,U 代表实用新型专利的授权公告,S 代表外观设计专利的授权公告。
gen 公开公告号_clean = regexr(公开公告号, "[A-Z]$", "") |
数据引用格式
由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:
RStata 数据中心: 1985~2024年瞪羚、独角兽与科技型初创企业绿色专利申请与授权信息(国家知识产权局筛选标准). 2025. https://tidyfriday.cn/rsdb2/
英文文献可以使用下面的格式引用:
RStata Data Center: Panel Data on Green Patent Applications and Grants by Gazelle Enterprises, Unicorns, and Tech Startups, 1985–2024 (CNIPA Screening Criteria). 2025. https://tidyfriday.cn/rsdb2/
点击这里跳转到 RStata 短书平台获取附件:1985~2024 年瞪羚、独角兽与科技型初创企业绿色专利申请与授权信息(国家知识产权局筛选标准)
评论