前不久给大家更新了绿色专利数据和税调数据:
1985~2024 年绿色专利申请与授权数据(国家知识产权局标准):https://rstata.duanshu.com/#/brief/course/9cfa513db3a54891bef466caac9e6a62
2007~2020 年税调数据与工商注册数据匹配结果:https://rstata.duanshu.com/#/course/339d61648ae94aac8f1863474da2199e
今天再给大家分享一份税调企业与绿色专利数据的匹配结果。
数据概览
数据的时间范围为 2007~2020 年。数据格式方面,我提供的是供 Stata 读取的 dta 格式。为了避免数据过于庞大的问题,我分年存放了税调与绿色专利数据匹配结果,以 2020 年为例,数据预览如下:
![]()
统计数量的时候注意去除重复专利,详情可以阅读绿色专利的介绍(文初的链接)。
附件中也提供了申请量与授权量的统计结果:
- 2007~2020年税调企业绿色专利申请与授权数量统计.dta
![]()
下图更直观地展示了历年各税调企业绿色技术专利申请与授权量变化:
![]()
匹配方法
结合税收调查数据与专利数据的变量,我首先使用税调数据中的企业名称与专利数据中的申请人进行匹配,然后再使用统一信用代码匹配(新版本的专利数据里面有这个变量,然后税调+工商注册信息里面也有这个变量)。
具体匹配方法分为四步:
专利数据中有个申请人变量,每个专利可能有多个申请人,申请人之间使用冒号分隔。因此需要首先处理申请人变量,处理思路如下:

其次,对税调数据库里的企业名称和专利数据里的申请人变量进行处理,主要是改正错字和去除对匹配没有帮助的词汇(例如“有限公司”、“有限责任公司”)。为便于两个数据集的连接,我在税调数据中生成了sdid 变量以在匹配过程中识别每个观测值。在之前的课程「Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例」中,我分享过使用 Stata 进行模糊匹配的方法,不过模糊匹配耗时耗力,并且错误率很高。不同于英文,中文企业名称只要有一个字不同都可能不是同一家企业(英文企业名称有一两个字母不同可能是因为笔误)。所以中文企业名称的模糊匹配没有意义。因此这里我还是使用了精确匹配,考虑到企业名称中经常会把“有限公司”和“有限责任公司”混用,以及有限公司改股份有限公司之类的。所以这里在匹配前删除了下面词汇:股份有限、集团有限、有限责任、有限、责任、股份、公司、厂、 、(集团)、(集团)、(、)、(、)、省、市、区、县、回族自治区、壮族自治区、维吾尔自治区、自治区。这样可以大大提高匹配成功率。
![]()
- Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例:https://rstata.duanshu.com/#/brief/course/d4fb816566244662ab6359fa848f1f1e
- R 语言中的中文模糊匹配——以工企数据和境外投资名录数据匹配为例:https://rstata.duanshu.com/#/brief/course/2a44e6b5be8740a895e1daad087e2a63
使用处理后的企业名称和申请人匹配。
使用统一社会信用代码匹配。这里其实也涉及到上述的拆分。
代码
为方便大家学习,附件中还提供了数据处理和绘图代码以供参考:
![]()
数据引用格式
由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:
RStata 数据中心: 2007~2020 年税调与绿色专利数据匹配结果(国家知识产权局筛选标准). 2026. https://tidyfriday.cn/rsdb2/
英文文献可以使用下面的格式引用:
RStata Data Center: Matching Results of Tax Survey Data and Green Patent Data, 2007–2020 (CNIPA Screening Criteria). 2026. https://tidyfriday.cn/rsdb2/
点击这里跳转到 RStata 短书平台获取附件:2007~2020 年税调与绿色专利数据匹配结果(国家知识产权局筛选标准)
评论