2007~2020 年税调与关键数字技术专利数据匹配结果

最近给大家更新了税调企业与专利数据的匹配结果:

2007~2020 年税调数据与专利数据匹配结果(版本3):https://rstata.duanshu.com/#/course/040a2ba951304f5b89f6c925320547f3

之前也给大家分享过关键数字技术专利的筛选结果:

1985~2024 年关键数字技术专利筛选结果:https://rstata.duanshu.com/#/course/f9129bf93ecc4da8b15a5065e14b90e0

将上面的两份数据进行匹配,就可以得到税调与关键数字技术专利的匹配结果了。

历年数量

下图展示了 2007~2020 年税调与关键数字技术专利数据的匹配数量:

数据概览

为了避免数据过于庞大的问题,我使用了三组文件存放这份数据。

第一组是税调与关键数字技术专利数据匹配结果,按年拆分,里面有 newipzlid 变量(每个 newipzlid 对应一个专利):

  • 税调与关键数字技术专利数据匹配结果(文件夹)

以 2020 年为例,数据预览如下:

数据包含如下变量:

sdid、newipzlid、年份、申请日、标题、摘要、申请人、公开公告号、公开公告日、申请号、专利类型、公开国别、首项权利要求、独立权利要求、文献页数、IPC主分类、IPC、洛迦诺分类号、当前权利人、申请人类型、申请人国家_地区、申请人地址、当前专利权人地址、工商注册 地址、工商公司类型、工商成立日期、工商统一社会信用代码、工商注册号、工商上市代码、工商企业状态、发明人、引证次数、被引证次数、自引次数、他引次数、被自引次数、被他引次数、家族引证次数、家族被引证次数、优先权信息、优先权号、优先权日、授权公告号、授权公告日、省、省代码、市、市代码、县、县代码

其中 newipzlid 是我给专利的编号,包含 newipzlid 变量的数据可以直接和这个数据使用该变量匹配;省、省代码、市、市代码、县、县代码是根据 2021 年行政区划判断得到。

第二组是专利数据编号 newipzlid 变量和 关键数字技术ID 的对照表:

  • 专利编号newipzlid与关键数字技术ID对照表.dta

第三组是每个 关键数字技术ID 的具体含义:

  • 关键数字技术专利IPC对照表.dta

注意事项

在计算专利申请数量时需要注意,专利数据里面有很多申请和授权同时存在的专利,在统计专利数量的时候应该先去除这种重复情况:

统计的时候可以先去除公开公告号里面的 A、B、U、S。其中 A 代表发明专利的申请公开,B 代表发明专利的授权公告,U 代表实用新型专利的授权公告,S 代表外观设计专利的授权公告。

replace 公开公告号 = subinstr(公开公告号, "A", "", .)
replace 公开公告号 = subinstr(公开公告号, "B", "", .)
replace 公开公告号 = subinstr(公开公告号, "U", "", .)
replace 公开公告号 = subinstr(公开公告号, "S", "", .)
replace 专利类型 = "发明" if index(专利类型, "发明")
*- 使用 duplicates drop 去除重复的
duplicates drop 公开公告号, force

代码

为方便大家学习,附件中还提供了数据处理和绘图代码以供参考:

数据引用格式

由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:

RStata 数据中心: 2007~2020 年税调与关键数字技术专利数据匹配结果. 2026. https://tidyfriday.cn/rsdb2/

英文文献可以使用下面的格式引用:

RStata Data Center: Matching Results of Tax Survey Data and Key Digital Technology Patent Data, 2007–2020. 2026. https://tidyfriday.cn/rsdb2/

点击这里跳转到 RStata 短书平台获取附件:2007~2020 年税调与关键数字技术专利数据匹配结果

评论