新版本在这里:https://rstata.duanshu.com/#/brief/course/e2fbfb44b58b4d48a1cf7ba202587bac
前不久给大家分享了一份专利全库的数据:
- 1985~2022 年专利申请数据(版本2,含申请人地址的经纬度及其所处的省市区县信息):https://rstata.duanshu.com/#/brief/course/edef981592a64257aa41e2b6d6d21746
授权信息还在爬取中,大家再耐心等等就好~
之前也给大家分享过如何使用 R 语言爬取 WIPO 绿色专利分类号列表、以及如何使用 Stata 进行绿色专利筛选的课程:
- 使用 R 语言爬取处理 WIPO 绿色专利分类数据:https://rstata.duanshu.com/#/brief/course/6edd7ed2f3284915b2c916ead3fbfd10
- 使用 Stata 进行绿色专利的筛选:https://rstata.duanshu.com/#/brief/course/2fd6838527754c94a3f5ccb0e3ba7be1
使用课程中介绍的方法就可以进行绿色专利的筛选了。今天给大家分享的就是筛选后的结果。
数据的时间范围为 1985~2022 年,各年各种类型绿色专利申请数据变化如下图所示:
![]()
2021 及 2022 年的数据不全,使用的时候需注意。
另外需要注意,专利数据里面有很多申请和授权同时存在的专利,在统计专利数量的时候应该先去除这种重复情况:
![]()
专利数据里面有分类号和主分类号两个变量,所以筛选的结果也分为两种:
- 根据分类号筛选;
- 根据主分类号筛选。
例如 2020 年根据主分类号筛选的结果:
![]()
包含如下变量:
newzlid、年份、公开公告号、专利名称、专利类型、摘要、申请人、申请号、申请日、授权公布号、地址、主权项、发明设计人、分类号、主分类号、专利代理机构、分案原申请号、优先权、国际申请、国际公布、代理人、省份或国家代码、专利领域、专利学科、多次公布、城市、所属国省、公开公告日、省、省代码、市、市代码、县、县代码、纬度、经度、参考文献、代码、发布路径、范畴分类、国别、名称、申请国代码、申请来源、邮编、页数、专利号、颁证日、审查员、进入国家日期、摘要附图存储路径、greenIPC、l1title、l2title、l3title、l4title、l5title
其中 newzlid 是我给专利的编号,包含 newzlid 变量的数据可以直接和这个数据使用该变量匹配;greenIPC、l1title、l2title、l3title、l4title、l5title 是绿色专利的类别信息;纬度、经度 是根据申请人地址解析得到的;省、省代码、市、市代码、县、县代码是根据经纬度和 2021 年行政区划判断得到。
最后,下图展示了 2020 年绿色专利申请人地址分布:
![]()
点击这里跳转到 RStata 短书平台获取附件:旧版本|1985~2022 年绿色专利申请数据(版本2,含申请人地址的经纬度及其所处的省市区县信息)
评论