1985~2024 年瞪羚、独角兽与科技型初创企业绿色专利申请与授权信息(WIPO版本)

前不久给大家更新了一份绿色专利数据:

1985~2024 年绿色专利申请与授权数据(WIPO标准):https://rstata.duanshu.com/#/course/e2fbfb44b58b4d48a1cf7ba202587bac

最近有培训班的小伙伴提出需要将瞪羚、独角兽、创新型企业和更新版的绿色专利数据进行匹配,但是数据量比较大,希望我能帮忙处理一下。瞪羚、独角兽、创新型企业的数据我之前也分享过:

瞪羚、独角兽、创新型企业名录、工商注册信息匹配结果及经纬度数据(2025年6月爬取):https://rstata.duanshu.com/#/course/cd0c453f83f44b2e91e436cafb89027d

今天给大家分享的就是这份瞪羚、独角兽、创新型企业和绿色专利数据匹配的结果。

数据概览

数据的时间范围为 1985~2024 年,为了避免数据过于庞大的问题,我分年存放了瞪羚、独角兽与科技型初创企业绿色专利申请与授权信息,里面有 newipzlid 变量(每个 newipzlid 对应一个专利)。以 2020 年为例,数据预览如下:

其中 newipzlid 是我给专利的编号,包含 newipzlid 变量的数据可以直接和这个数据使用该变量匹配;省、省代码、市、市代码、县、县代码是根据经纬度和 2021 年行政区划判断得到。

为了方便大家使用,我还提供了汇总结果:

  • 1985~2024年瞪羚、独角兽与科技型初创企业绿色专利申请与授权数量统计(WIPO版本).dta

下图展示了历年瞪羚、独角兽与科技型初创企业绿色专利申请与授权数量变化:

注意事项

在计算绿色专利申请数量时需要注意,专利数据里面有很多申请和授权同时存在的专利,在统计专利数量的时候应该先去除这种重复情况:

统计的时候可以先去除公开公告号里面的 A、B、U、S。其中 A 代表发明专利的申请公开,B 代表发明专利的授权公告,U 代表实用新型专利的授权公告,S 代表外观设计专利的授权公告。

gen 公开公告号_clean = regexr(公开公告号, "[A-Z]$", "")
replace 专利类型 = "发明" if index(专利类型, "发明")
*- 使用 duplicates drop 去除重复的
duplicates drop 公司代码变量 公开公告号_clean, force
duplicates drop 公司代码变量 申请号, force

代码

为方便大家学习,附件中还提供了数据处理和绘图代码以供参考:

数据引用格式

由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:

RStata 数据中心: 1985~2024 年瞪羚、独角兽与科技型初创企业绿色专利申请与授权信息(WIPO版本). 2026. https://tidyfriday.cn/rsdb2/

英文文献可以使用下面的格式引用:

RStata Data Center: Green Patent Application and Authorization Information for Gazelle, Unicorn, and Technology-based Start-ups, 1985–2024 (WIPO Version). 2026. https://tidyfriday.cn/rsdb2/

点击这里跳转到 RStata 短书平台获取附件:1985~2024 年瞪羚、独角兽与科技型初创企业绿色专利申请与授权信息(WIPO版本)

评论