1998~2014 年工企、污染与绿色专利匹配结果

之前给大家分享过工企+污染以及工企+绿色专利的数据:

×

×

其中 工企+绿色专利 是在 工企+专利 的数据基础上,根据 WIPO 绿色专利列表进行筛选,关于如何爬取 WIPO 绿色专利列表数据以及使用 Stata 进行筛选,可以学习下面两个课程:

×

×

由于专利数据包含分类号和主分类号,因此可以得到两份工企 + 绿色专利的匹配结果:

  1. 基于分类号筛选绿色专利;
  2. 基于主分类号筛选绿色专利。

为了方便相互匹配,我给工企数据生成了一个 gqid 变量(每个观测值一个唯一的值)、专利数据生成了一个 zlid 变量,以及污染数据生成了一个 wrid 变量,因此 工企+污染 的匹配结果里面就有 gqid 和 wrid 变量,而 工企+绿色专利 匹配结果中就有 gqid 和 zlid 变量。这样我们只需要使用 gqid 变量就可以匹配这两个结果了。

工企+绿色专利数据的分为完整版和汇总版。完整版里面是一条条的专利,汇总版是每个工企申请的各种专利、绿色专利数量。所以这里我们可以分别使用完整版和汇总版与工企+污染数据匹配,进而得到了如下三份数据:

  1. 1998~2014年工企、污染、绿色专利匹配结果汇总版.dta
  2. 1998~2014年工企、污染、绿色专利匹配结果完整版(绿色专利基于分类号筛选).dta
  3. 1998~2014年工企、污染、绿色专利匹配结果完整版(绿色专利基于主分类号筛选).dta

第一份数据是汇总版匹配结果,包含了工企+污染数据的所有变量以及每个工企申请的各种专利、各种绿色专利的量;后面两份是完整版匹配结果,每一条观测值都是一条专利。

汇总版的数据是这样的:

包含每个工企申请的各种专利、各种绿色专利数量以及污染库的一些信息。

根据是根据主分类号还是分类号筛选的绿色专利,完整版有两种:

)

大家拿到数据之后可能会非常疑惑,为什么汇总版有 74.5 万条观测值?而完整版只有 5.6 万个观测值和 9.4 万个观测值?这是因为在汇总版的数据处理中,是先统计所有的工企污染库中的工企专利申请量,如果没有专利申请,那么申请量就是 0,所以这 74.5 万实际上也正好是工企污染库的观测值数量。

而完整版里面的是专利数据,匹配成功就有,匹配不成功的就没有,也就是说,基于主分类号筛选的匹配成功了 5.6 万条绿色专利,基于分类号筛选的匹配成功了 9.4 万条绿色专利。

最后恰当的匹配结果应该具有连续性,下图展示了该数据中历年各中类型的绿色专利申请量与总绿色专利申请量:

连续性还不错。

点击这里跳转到 RStata 短书平台获取附件:1998~2014 年工企、污染与绿色专利匹配结果

评论