2001~2023 年上市公司供应商及客户专利申请与授权信息

最近有培训班的小伙伴需要研究上市公司前5大供应商、客户的专利申请情况,由于工作量比较大,所以问我能不能帮忙处理一下,这不就来了!

上市公司前5大供应商、客户数据和专利数据库我之前都分享过:

2001~2023年上市公司前5大供应商、客户与工商注册信息匹配结果(含经纬度及所处的省市区县):https://rstata.duanshu.com/#/brief/course/c0b17ab7ab2945ffaea746dec9380a8e

1985~2024 年专利申请与授权数据(版本 3,含申请人所处的省市区县):https://rstata.duanshu.com/#/brief/course/2397451274c546d3a36e156ffc865988

今天分享给大家的就是上市公司前5大供应商、客户与专利数据的匹配结果,以及上市公司前5大供应商、客户专利申请与授权数量的汇总统计。

数据概览

上市公司前5大供应商、客户与专利数据匹配结果的时间范围为 1999~2023 年,

供应商匹配到了 142 万条结果:

包含的变量如下:

gysid、股票代码、统计年份、统计截止日期、报表类型、排名、供应商公司ID、供应商名称、是否上市公司、公司股票代码、是否上市公司关联公司、关联上市公司股票代码、供应商采购额、供应商采购额占比、币种、newipzlid、申请日、标题、摘要、申请人、公开公告号、公开公告日、申请号、专利类型、公开国别、首项权利要求、独立权利要求、文献页数、IPC主分类、IPC、洛迦诺分类号、当前权利人、申请人类型、申请人国家_地区、申请人地址、当前专利权人地址、工商注册地址、工商公司类型、工商成立日期、工商统一社会信用代码、工商注册号、工商上市代码、工商企业状态、发明人、引证次数、被引证次数、自引次数、他引次数、被自引次数、被他引次数、家族引证次数、家族被引证次数、优先权信息、优先权号、优先权日、授权公告号、授权公告日、省、省代码、市、市代码、县、县代码

客户匹配到了 464 万条结果:

包含的变量如下:

khid、股票代码、统计年份、统计截止日期、报表类型、排名、客户公司ID、客户名称、是否上市公司、公司股票代码、是否上市公司关联公司、关联上市公司股票代码、客户销售额、客户销售额占比、币种、newipzlid、申请日、标题、摘要、申请人、公开公告号、公开公告日、申请号、专利类型、公开国别、首项权利要求、独立权利要求、文献页数、IPC主分类、IPC、洛迦诺分类号、当前权利人、申请人类型、申请人国家_地区、申请人地址、当前专利权人地址、工商注册地址、工商公司类型、工商成立日期、工商统一社会信用代码、工商注册号、工商上市代码、工商企业状态、发明人、引证次数、被引证次数、自引次数、他引次数、被自引次数、被他引次数、家族引证次数、家族被引证次数、优先权信息、优先权号、优先权日、授权公告号、授权公告日、省、省代码、市、市代码、县、县代码

注意 newipzlid 后面的变量都是专利数据的。

我还汇总统计了历年上市公司前5大供应商、客户各种类型的专利申请与授权数量:

  • 2001~2023年上市公司前5大供应商专利申请与授权数量统计.dta
  • 2001~2023年上市公司前5大客户专利申请与授权数量统计.dta

统计数量的时候注意去除重复专利,详情可以阅读专利的介绍(文初的链接)。

下图更直观地展示了上市公司前5大供应商、客户与专利数据每年匹配成功的数量:

匹配方法

结合前5大供应商、客户数据与专利数据的变量,我首先使用前5大供应商、客户数据中的企业名称与专利数据中的申请人进行匹配,然后再使用统一信用代码匹配(新版本的专利数据里面有这个变量,然后前5大供应商、客户+工商注册信息里面也有这个变量)。

具体匹配方法分为四步:

  1. 专利数据中有个申请人变量,每个专利可能有多个申请人,申请人之间使用冒号分隔。因此需要首先处理申请人变量,处理思路如下:

  1. 其次,对供应商客户数据库里的企业名称和专利数据里的申请人变量进行处理,主要是改正错字和去除对匹配没有帮助的词汇(例如“有限公司”、“有限责任公司”)。为便于两个数据集的连接,我在子数据中生成了 gysid/khid 变量以在匹配过程中识别每个观测值。在之前的课程「Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例」中,我分享过使用 Stata 进行模糊匹配的方法,不过模糊匹配耗时耗力,并且错误率很高。不同于英文,中文企业名称只要有一个字不同都可能不是同一家企业(英文企业名称有一两个字母不同可能是因为笔误)。所以中文企业名称的模糊匹配没有意义。因此这里我还是使用了精确匹配,考虑到企业名称中经常会把“有限公司”和“有限责任公司”混用,以及有限公司改股份有限公司之类的。所以这里在匹配前删除了下面词汇:股份有限、集团有限、有限责任、有限、责任、股份、公司、厂、 、(集团)、(集团)、(、)、(、)、省、市、区、县、回族自治区、壮族自治区、维吾尔自治区、自治区。这样可以大大提高匹配成功率。

Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例:https://rstata.duanshu.com/#/brief/course/d4fb816566244662ab6359fa848f1f1e

R 语言中的中文模糊匹配——以工企数据和境外投资名录数据匹配为例:https://rstata.duanshu.com/#/brief/course/2a44e6b5be8740a895e1daad087e2a63

  1. 使用处理后的供应商、客户企业名称和申请人匹配。

  2. 使用统一社会信用代码匹配。这里其实也涉及到上述的拆分。

点击这里跳转到 RStata 短书平台获取附件:2001~2023 年上市公司供应商及客户专利申请与授权信息

评论