之前给大家分享过上市公司与专利数据的匹配结果:
1985~2024 年上市公司与专利数据匹配结果(版本3, 含申请、授权信息):https://rstata.duanshu.com/#/course/04100321f88b411f90429be934934bff
也给大家分享了数字经济产业相关专利的筛选结果:
1985~2024 年数字经济产业相关专利筛选结果:https://rstata.duanshu.com/#/course/d5dfb9ca0858457ebc4f176fce9fee80
将上面的两份数据进行匹配,就可以得到上市公司与数字经济产业相关专利的匹配结果了。
申请与授权量
下图展示了历年各上市公司数字经济产业专利申请与授权量变化:
![]()
两种匹配结果
专利数据里面有分类号和主分类号两个变量,所以筛选的结果也分为两种:
- 根据分类号筛选;
- 根据主分类号筛选。
为了避免数据过于庞大的问题,我使用了四组文件存放这份数据。
第一组是上市公司与数字经济专利数据匹配结果,按年拆分,里面有 newipzlid 变量(每个 newipzlid 对应一个专利):
- 基于分类号筛选结果分年(文件夹)
- 基于主分类号筛选结果分年(文件夹)
其中 newipzlid 是我给专利的编号,包含 newipzlid 变量的数据可以直接和这个数据使用该变量匹配;纬度、经度是根据申请人地址解析得到的;省、省代码、市、市代码、县、县代码是根据经纬度和 2021 年行政区划判断得到。
以 2020 年为例,基于分类号筛选结果如下:
![]()
2020 年基于主分类号筛选结果:
![]()
第二组是 newipzlid 变量和 数字经济产业分类ID 的对照表:
- 基于分类号筛选的数字经济专利newipzlid.dta
![]()
- 基于主分类号筛选的数字经济专利newipzlid.dta
![]()
第三组是每个 数据经济产业分类ID 的具体含义:
- 数字经济核心产业分类与国际专利分类参照关系表.dta
![]()
第四组是对上市公司数字经济产业专利匹配结果的汇总统计:
- 1985~2024年上市公司数字经济产业专利申请与授权数量统计.dta
![]()
注意事项
在计算专利申请数量时需要注意,专利数据里面有很多申请和授权同时存在的专利,在统计专利数量的时候应该先去除这种重复情况:
![]()
统计的时候可以先去除公开公告号里面的 A、B、U、S。其中 A 代表发明专利的申请公开,B 代表发明专利的授权公告,U 代表实用新型专利的授权公告,S 代表外观设计专利的授权公告。代码大致如下:
replace 公开公告号 = subinstr(公开公告号, "A", "", .) |
如果需要分类别统计数量,则要分类别 duplicates drop。
数据引用格式
在论文中使用该数据请声明数据来源于RStata 数据中心,或者 RStata Data Center,并使用下述的格式引用:
RStata 数据中心: 1985~2024年上市公司数字经济产业专利申请与授权数据. 2025. https://tidyfriday.cn/rsdb2/
RStata Data Center: Patent Applications and Grants Data in the Digital Economy Industry of Listed Companies (1985-2024). 2025. https://tidyfriday.cn/rsdb2/
另外也建议在说明数据来源的同时,根据本文的介绍在论文中描述数据的详细处理方法。
点击这里跳转到 RStata 短书平台获取附件:1985~2024 年上市公司数字经济产业专利申请与授权数据
评论