2001~2023 年上市公司供应商与客户关键核心技术突破指标面板数据(熵权法)

今天给大家分享一份 2001~2023 年上市公司供应商与客户关键核心技术突破指标面板数据(熵权法)。

关键核心技术突破(CKTB,Critical and Key Technology Breakthrough)指标体系来源于王海花等(2026)发表于《科学学研究》的论文:《专精特新企业技术专业化与关键核心技术突破》。该研究以我国前五批上市的专精特新小巨人企业中新一代信息技术产业为研究对象,深入探索技术专业化对关键核心技术突破的作用效应,在实证研究中使用专利数据构建了 CKTB 综合评分指标。

处理方法

该指标基于企业专利数据,从基础性、体系性和竞争性三个维度出发,选取了 7 个专利层面指标,再使用熵权法计算综合得分:

特征维度 测度指标 专利指标
基础性 科学关联度 npl(非专利文献引用量)
基础性 技术累积度 bwd_cite(引用专利数量)
基础性 权利要求 claims(权利要求数量)
体系性 社会价值 fwd_cite(3年内被引用次数)
体系性 合作范围 assignees(专利权人数量)
竞争性 同族专利 family(同族成员数量)
竞争性 技术覆盖范围 ipc_cover(跨IPC部分类号数量)

指标说明:

  • 非专利文献引用量(npl):专利引用的科技文献(如学术论文)数量,反映专利的科学知识根基深度
  • 引用专利数量(bwd_cite):专利引用的在先专利数量(向后引用),体现技术积累程度
  • 权利要求数量(claims):专利权利要求条款数,条款越多代表技术覆盖越精细
  • 3年内被引次数(fwd_cite):专利申请后3年内被其他专利引用的次数,体现技术社会价值
  • 专利权人数量(assignees):联合申请人数量,反映合作创新程度
  • 同族成员数量(family):在其他国家/地区提交的同族专利数,体现国际竞争布局
  • IPC覆盖(ipc_cover):企业当年专利跨越的 IPC 部(section)数量,反映技术领域多样性

熵权法是一种客观赋权方法,核心思想是:指标的信息熵越小,该指标提供的信息量越大,在综合评价中所占的权重应越高。计算步骤包括:极差标准化 → 计算信息熵 → 计算差异系数 → 计算权重 → 加权求和得到综合得分。

这七个指标的详细计算方法在以下三个课程中均有讲解(Python、R 语言、Stata 三个版本):

感兴趣的小伙伴可以结合讲义材料学习。附件中也提供了完整的计算代码。

数据概览

为了方便大家使用,我将数据汇总成了企业-年度的关键核心技术突破指标面板数据,包含供应商和客户两份数据。数据的时间范围为 2001~2023 年。

供应商数据包含 gys_id(供应商ID)、year(年份)、CKTB(熵权法综合得分)、n_patents(专利数量)、ipc_cover(IPC覆盖)等变量。客户数据包含 kh_id(客户ID)、year(年份)、CKTB(熵权法综合得分)、n_patents(专利数量)、ipc_cover(IPC覆盖)等变量。

数据预览如下:

供应商数据:

客户数据:

图表展示

下图展示了 2001~2023 年供应商和客户 CKTB 得分的时间趋势、分布直方图和箱线图:

供应商:

客户:

处理代码

从专利原始数据到 CKTB 综合得分的计算代码如下(R 语言版本核心逻辑):

# 读取供应商/客户与专利匹配数据
dt_match <- fread(PATH_MATCH, select = c("gys_id", "newipzlid", "年份",
"引证专利", "引证科技文献",
"IPC", "当前权利人"))

# 提取 7 个专利层面指标
dt <- dt_match %>%
mutate(
npl = str_count(引证科技文献, "</text>"),
npl = if_else(is.na(npl), 0, npl),
bwd_cite = if_else(is.na(引证专利) | 引证专利 %in% c("NA", ""), 0,
str_count(引证专利, ";") + 1),
claims = coalesce(as.numeric(claims_ext), 0),
assignees = if_else(is.na(当前权利人) | 当前权利人 == "", 1,
str_count(当前权利人, ";") + 1),
family = if_else(is.na(扩展同族) | 扩展同族 == "", 0,
str_count(扩展同族, ";") + 1)
)

# 熵权法计算综合得分
entropy_weight <- function(X) {
X <- as.matrix(X)
X[is.na(X)] <- 0
n <- nrow(X)
X_min <- apply(X, 2, min)
X_max <- apply(X, 2, max)
denom <- X_max - X_min
denom[denom == 0] <- 1e-10
X_norm <- sweep(X - rep(X_min, each = n), 2, denom, "/") + 1e-10
P <- sweep(X_norm, 2, colSums(X_norm), "/")
k <- 1 / log(n)
E <- -k * colSums(P * log(P + 1e-10))
E <- pmin(E, 1)
W <- (1 - E) / sum(1 - E)
scores <- as.vector(X_norm %*% W)
list(scores = scores, weights = W, E = E)
}

附件中也提供了该数据的处理代码供参考:

数据引用格式

由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:

RStata 数据中心: 2001~2023年上市公司供应商与客户关键核心技术突破指标面板数据(熵权法). 2026. https://tidyfriday.cn/rsdb2/

英文文献可以使用下面的格式引用:

RStata Data Center: Panel Data on Key Core Technology Breakthrough Indicators for Listed Company Suppliers and Customers, 2001–2023 (Entropy Weight Method). 2026. https://tidyfriday.cn/rsdb2/

关联课程/数据推荐

1985~2024 年上市公司与专利数据匹配结果(版本3, 含申请、授权信息):https://rstata.duanshu.com/#/course/04100321f88b411f90429be934934bff

2001~2023 年上市公司供应商及客户专利申请与授权信息:https://rstata.duanshu.com/#/course/8a2dad50eaf1460289799032a81914ac

1985~2024 年各专利当年~十一年内的被自引、被他引数量统计:https://rstata.duanshu.com/#/course/51e62d1eae074a4d8174a3969f5025c6

1985~2024 年专利申请与授权数据(版本 3,含申请人所处的省市区县):https://rstata.duanshu.com/#/course/2397451274c546d3a36e156ffc865988

点击这里跳转到 RStata 短书平台获取附件:2001~2023 年上市公司供应商与客户关键核心技术突破指标面板数据(熵权法)

评论