指标来源与背景
关键核心技术突破(CKTB,Critical and Key Technology Breakthrough)指标体系来源于王海花等(2026)发表于《科学学研究》的论文:《专精特新企业技术专业化与关键核心技术突破》。
该研究以我国前五批上市的专精特新小巨人企业中新一代信息技术产业为研究对象,深入探索技术专业化对关键核心技术突破的作用效应,在实证研究中使用专利数据构建了 CKTB 综合评分指标。
理论依据
关键核心技术具有以下三个核心特征:
| 特征维度 | 含义 |
|---|---|
| 基础性 | 技术的科学根基深厚、知识积累丰富,体现研究与开发的深度 |
| 体系性 | 技术在产业体系中的地位,体现与上下游关联的广度与合作 |
| 竞争性 | 技术在国际市场中的差异化竞争力,体现技术覆盖与保护范围 |
测度指标
基于三大特征维度,论文构建了如下 7 个专利层面指标:
library(knitr) |
指标说明:
- 非专利文献引用量(npl):专利引用的科技文献(如学术论文)数量,反映专利的科学知识根基深度
- 引用专利数量(bwd_cite):专利引用的在先专利数量(向后引用),体现技术积累程度
- 权利要求数量(claims):专利权利要求条款数,条款越多代表技术覆盖越精细
- 3年内被引次数(fwd_cite):专利申请后3年内被其他专利引用的次数,体现技术社会价值
- 专利权人数量(assignees):联合申请人数量,反映合作创新程度
- 同族成员数量(family):在其他国家/地区提交的同族专利数,体现国际竞争布局
- IPC覆盖(ipc_cover):企业当年专利跨越的 IPC 部(section)数量,反映技术领域多样性
熵权法原理
**熵权法(Entropy Weight Method)**是一种客观赋权方法,不依赖专家主观判断,而是根据各指标的信息量来自动决定权重。其核心思想是:
如果某个指标在所有样本中的取值差异很大,说明它包含的信息量多,应给予更高权重;
反之,若某指标的取值在所有样本中基本相同(无差异),则该指标对区分样本无帮助,权重接近 0。
计算步骤
![]()
熵权法函数实现
entropy_weight <- function(X) { |
数据准备
本讲义使用的数据文件:
| 文件 | 说明 |
|---|---|
2010~2012年上市公司与专利数据匹配结果_含引用与被引用信息.csv |
主数据:专利-企业匹配,含各类引用信息(约 1 GB) |
1985~2024年各专利当年~十一年内的被自引、被他引数量统计.csv |
被引统计:专利被他引的分年统计(约 979 MB) |
拓展专利信息.csv |
拓展信息:权利要求数量、同族专利(约 1.5 GB) |
上市公司数据来自:
1985~2024 年上市公司与专利数据匹配结果(版本3, 含申请、授权信息): https://rstata.duanshu.com/#/brief/course/04100321f88b411f90429be934934bff
被自引、被他引数量统计数据来自:
1985~2024 年各专利当年~十一年内的被自引、被他引数量统计: https://rstata.duanshu.com/#/brief/course/51e62d1eae074a4d8174a3969f5025c6
拓展专利信息.csv 是我又从原始专利数据提取补充的一些变量:
1985~2024 年专利申请与授权数据(版本 3,含申请人所处的省市区县): https://rstata.duanshu.com/#/brief/course/2397451274c546d3a36e156ffc865988
library(dplyr) |
# 设置文件路径(请根据实际情况修改) |
单公司演示:以凯莱英(002821)2012 年为例
为了清晰演示 CKTB 的计算过程,我们以凯莱英(股票代码:002821)2012 年的数据为例,逐步演示每个步骤。凯莱英是一家以化学合成和医药研发为核心的创新型企业,2012 年共申请了 23 件专利,样本量适中,演示效果清晰。
演示时使用
n_max = 300000读取前 30 万行数据(凯莱英记录最远至第 295539 行),确保能完整捕获该公司所有专利。全量计算见下一节。
第一步:读取主数据
# 读取前 300000 行(演示用,覆盖凯莱英全部记录) |
第二步:专利去重
同一专利可能因为多源数据拼接而产生重复记录,需要去重。策略:优先保留在被引用统计表中出现的专利(因为该专利有更完整的引用信息)。
# 读取被引用统计中的专利 ID 集合(用于去重时优先保留) |
# 筛选凯莱英 2012 年的数据 |
第三步:读取拓展信息并合并
df_extend <- read_csv( |
第四步:提取专利层面 CKTB 指标
此处代码需下载讲义材料查看~
各指标描述性统计:
df_demo %>% |
第五步:合并 3 年内被引次数
df_cite_sample <- read_csv( |
第六步:运行熵权法
此处代码需下载讲义材料查看~
熵权法权重结果(基于凯莱英 2012 年内部 r nrow(df_demo) 条专利):
tibble( |
第七步:汇总到企业-年度
firm_demo <- df_demo %>% |
Top 10% 稳健性指标:
top10_thr <- quantile(df_demo$cktb_score, 0.90) |
全量计算:所有公司、所有年份
上面演示了单家公司的计算逻辑,以下代码对全部数据(2010~2012 年)进行批量计算。
注意:由于原始数据文件约 1~1.5 GB,完整运行需要较多内存(建议 16 GB+ RAM)和时间(约 10~30 分钟)。
完整计算代码
library(dplyr) |
变量说明
最终输出的企业-年度面板数据包含以下变量:
tibble( |
把上市公司专利数据替换成全部年份的就可以计算全部结果了~
点击这里跳转到 RStata 短书平台获取附件:名师讲堂|使用 R 语言测算上市公司关键核心技术突破指标面板数据(熵权法)
评论