旧版本|1998~2014 年工企数据与绿色专利匹配结果

之前给大家分享过一份 1998~2014 年工企业专利数据匹配结果:1998~2014 年工企业专利数据匹配结果(更新版)

×

使用本数据前也请认真阅读上面的超链接指向的推文哦!

有小伙伴建议是不是可以从中筛选出绿色专利来。

绿色专利的筛选通常使用 WIPO 提供的绿色专利分类范围清单:https://www.wipo.int/classifications/ipc/green-inventory/home

因此我首先爬取了这个网站上的绿色专利范围,根据范围的级别,把范围分成如下四类,不过在此之前我们需要先了解专利分类号的结构。

例如 “B64C25/02” 是起落架的分类号,其中:

  1. “B” 是 部,表示“作业、运输”;
  2. “B64” 是 大类,表示飞行器、航空、宇宙飞船。大类类号用二位数标记;
  3. “B64C” 是 小类,表示飞行。小类类号用大写字母标记;
  4. “B64C25/00” 是 大组,表示起落装置。大组类号用1-3位数加/00标记;
  5. “B64C25/02” 是 小组,表示起落架。

需要注意,大组实际上并不包含小组,如果绿色专利范围是 “B64C25/00”,“B64C25/02” 就不在这个范围内,两者是并列关系。不能认为所有的 “B64C25” 都在该范围内。

所以,可以把绿色专利分为下面四类:

  1. 只有大类的,例如 轨道车辆 类绿色专利的分类号范围是 “B61”;
  2. 只有小类的,例如 生物质的热解或气化 类绿色专利的分类号范围是 “C10J”;
  3. 只有详细的大组或者小组的;
  4. 用 “-” 连接表示范围的,例如 地热利用 类绿色专利的分类号范围是 “F24T 10/00 - 50/00”。

完整版

通过对工企专利匹配结果中的专利分类号进行范围筛选便可得到所有的绿色专利了。由于专利数据里面有两个分类号变量,“分类号”和“主分类号”,所以我进行了两次筛选,分别得到了“基于主分类号筛选的结果”和“基于分类号的筛选结果”两份数据。也就是附件中的下面两个文件:

  1. 1998~2014年工企绿色专利匹配完整版(基于主分类号筛选).dta
  2. 1998~2014年工企绿色专利匹配完整版(基于分类号筛选).dta

例如 1998~2014年工企绿色专利匹配完整版(基于主分类号筛选).dta 数据是这样的:

里面包含了工企的变量和专利的变量,另外还有几个变量大家可能会费解:

  1. group 变量,公司的 ID 变量,可以跨年识别同一家企业,关于它的生成,可以阅读 1998~2014 年工企业专利数据匹配结果(更新版) 了解,需要注意完整版不是面板数据,因为一个公司有多个专利,所以每年每个公司有多个观测值。另外每个专利也有多个观测值,这里面有两个原因,第一是这个专利被多家公司合作申请,第二是这个专利符合多个绿色专利筛选标准,因此完整版的数据需要再处理才能转换成面板使用;
  2. zlid 变量,这个变量是标志专利的,由于完整版的数据里面专利有重复值,所以统计专利数量的时候需要注意先去除重复的专利,而 zlid 就是标志专利的,每个专利拥有唯一的 zlid;
  3. gqid 变量,这个变量是标志工企数据观测值的,工企数据的每个观测值都有唯一的 gqid,注意这个变量并非是标志公司的,同一家公司在不同年份的 group 变量是相同的,但是 gqid 是不同的,另外这个变量的前 4 位是年份;
  4. greenIPC 变量,这个变量是绿色专利范围,表示该观测值对应的专利所处的绿色专利范围;
  5. l1title、l2title、l3title、l4title、l5title 变量,这些变量是绿色专利范围的英文含义,来源于 https://www.wipo.int/classifications/ipc/green-inventory/home

特别需要注意,完整版的数据中每个公司可能有多个专利、每个专利可能有多个观测值、每个专利也可能对应多个公司,原因在上文中。

汇总版

通过对各年、各公司申请专利数量的汇总,可以得到汇总版的数据,也就是附件中的 工企绿色专利匹配汇总版 文件夹。

在汇总版的数据中,工企数据的变量和如下变量:

  1. 设计型专利;
  2. 发明型专利;
  3. 实用型专利;
  4. 总专利数量;
  5. 发明型绿色专利_基于主分类号筛选;
  6. 实用型绿色专利_基于主分类号筛选;
  7. 发明型绿色专利_基于分类号筛选;
  8. 实用型绿色专利_基于分类号筛选。

均为各公司、每年专利申请量,如果没有申请,则为 0,由于汇总版包含了全部的工企数据,因此很大,为了方便大家使用,我特意拆分成了逐年的数据,如果需要合并成多年的面板数据,可以使用如下的代码:

use "工企绿色专利匹配汇总版/工企绿色专利匹配1998(汇总版).dta", clear
forval i = 1999/2014 {
append using "工企绿色专利匹配汇总版/工企绿色专利匹配`i'(汇总版).dta"
}

compress

* 给 2014 年的数据添加企业匹配唯一标识码
* 根据组织机构代码填补 企业匹配唯一标识码
replace 组织机构代码 = strlower(组织机构代码)
bysort 组织机构代码 (年份): carryforward 企业匹配唯一标识码 if !missing(组织机构代码), replace
* 根据企业名称填补 企业匹配唯一标识码
bysort 企业名称 (年份): carryforward 企业匹配唯一标识码 if !missing(企业名称), replace
* 根据法人代表姓名+行政区划+成立年份
bysort 法定代表人 省地县码 开业成立时间年 (年份): carryforward 企业匹配唯一标识码 if !missing(法定代表人) & !missing(省地县码) & !missing(开业成立时间年), replace
* 根据电话号码+行政区划+成立年份
bysort 固定电话 省地县码 开业成立时间年 (年份): carryforward 企业匹配唯一标识码 if !missing(固定电话) & !missing(省地县码) & !missing(开业成立时间年), replace
* 按照成立年份+省地县码+行业代码+县的名字+主营业务匹配
bysort 开业成立时间年 省地县码 行业小类代码 地区市州盟 主要业务活动或主要产品1 (年份): carryforward 企业匹配唯一标识码 if !missing(行业小类代码) & !missing(省地县码) & !missing(开业成立时间年) & !missing(地区市州盟) & !missing(主要业务活动或主要产品1), replace

* 剩余的企业匹配唯一标识码没有填补成功的视为新企业,可以用gqid临时填充一下
tostring gqid, gen(sgqid) format(%10.0f) force
replace 企业匹配唯一标识码 = sgqid if missing(企业匹配唯一标识码)
compress

* 生成个体 id 设定面板
egen group = group(企业匹配唯一标识码)
drop sgqid
order group
* 删除重复的 group
duplicates drop group 年份, force
xtset group 年份
gsort 年份 企业匹配唯一标识码
label var group "面板个体ID变量"
label var 年份 "面板时间变量"
label data "整理:微信公众号 RStata"
save "1998~2014年工企各种类型专利、绿色专利申请量.dta", replace

合并得到的 1998~2014年工企各种类型专利、绿色专利申请量.dta 数据高达 12.6 GB,因此这里就不再提供了,大家直接使用上面的代码合并分年的数据即可。

最后下图展示了各年绿色专利申请量及其占比的变化:

点击这里跳转到 RStata 短书平台获取附件:旧版本|1998~2014 年工企数据与绿色专利匹配结果

评论