1985~2024 年各省市区县技术集群指标:技术关联指数与技术多样性指数(技术集群指标)

今天给大家分享一份 1985~2024 年各省市区县技术关联指数与技术多样性指数面板数据。该数据由 RStata 数据中心基于 1985~2024 年专利申请与授权数据计算得到。

处理方法

该数据参考冉征等(2025)在《中国工业经济》发表的《技术集群结构与颠覆式创新——兼论关联性”陷阱”的突破路径》一文,计算了两个核心指标:

  1. 技术关联性(link_c):衡量一个地区内部不同技术领域之间的关联程度。基于技术联系矩阵 Φ,通过余弦相似度思路,计算地区优势技术领域之间的加权关联强度,并使用优势技术领域数量进行标准化。
  2. 技术多样性(diver_c):衡量一个地区拥有比较优势的技术领域数量。基于显性技术比较优势(RTCA)指数,统计 RTCA ≥ 1 的技术领域个数。

计算流程概述:

  • Step 1:读取 1985~2024 年专利申请数据,按地区代码 + 年份 + 公开公告号(去末尾字母)和申请号两步去重,展开 IPC 小类(取前 4 位)。
  • Step 2:构建技术联系矩阵 Φ。基于 1985~2024 年全部专利引用与被引用数据,统计每个技术领域对(citing → cited)的引用频次,再按引用方归一化得到 Φ 矩阵。该矩阵反映技术领域间的知识流动方向与强度。
  • Step 3:逐年计算各地区的 RTCA(显性技术比较优势)。RTCA = (地区在某技术领域的专利占比) / (全国在该技术领域的专利占比),若 RTCA ≥ 1 则认为该地区在该领域具有比较优势。
  • Step 4:计算 diver_c(优势技术领域数)和 link_c(技术关联性)。link_c = Σ Φ(i←j) / diver_c,其中 i、j 为该地区的优势技术领域对。

该数据的详细计算方法在以下三个课程中均有讲解(Python、R 语言、Stata 三个版本):

感兴趣的小伙伴可以结合讲义材料学习。附件中也提供了完整的计算代码。

数据概览

为了方便大家使用,我将数据汇总成了省份、城市、区县三个级别的面板数据。数据的时间范围为 1985~2024 年。每份数据均包含 diver_c(技术多样性指数)和 link_c(技术关联指数)两个核心变量。

变量说明

变量名 含义 说明
年份 年份 1985~2024
省代码 / 省 省份代码与名称 34 个省级单位
市代码 / 市 城市代码与名称 371 个城市(市级数据)
县代码 / 县 区县代码与名称 2802 个区县(区县级数据)
diver_c 技术多样性指数 该地区拥有比较优势(RTCA ≥ 1)的技术领域数量,取值越大表示技术领域越广泛
link_c 技术关联指数 该地区优势技术领域间关联强度的均值,取值越大表示技术领域间联系越紧密

这两个指标对于研究区域创新、产业升级和技术政策具有重要意义,可用于分析技术集群结构与颠覆式创新的关系。

数据规模

级别 文件名 观测值数 地区数
省份 1985~2024 年各省份技术关联指数与技术多样性指数.dta 1,351 34
城市 1985~2024 年各城市技术关联指数与技术多样性指数.dta 13,865 371
区县 1985~2024 年各区县技术关联指数与技术多样性指数.dta 89,192 2,802

数据预览如下:

  • 1985~2024 年各省份技术关联指数与技术多样性指数.dta

  • 1985~2024 年各城市技术关联指数与技术多样性指数.dta

  • 1985~2024 年各区县技术关联指数与技术多样性指数.dta

图表展示

为了便于大家更直观地感受这份数据,我还绘制了一些图。

2024 年各省份技术关联指数分布地图

下图展示了 2024 年各省份技术关联指数(link_c)的地理分布情况。颜色越深表示该省份技术领域间的关联程度越强,反映了各地区技术集群的紧密程度。

1985-2024 年各省市区县技术关联与多样性指数时间趋势

下图展示了 1985-2024 年省级、市级、区县级的两个指数年均值变化趋势。上半部分为技术关联指数(link_c),下半部分为技术多样性指数(diver_c)。可以观察到,技术多样性指数整体呈上升趋势,而技术关联指数在近年来趋于稳定。

各省市区县技术关联指数与技术多样性指数散点图

下图展示了省、市、区县三级数据的散点图,横轴为技术多样性指数(diver_c),纵轴为技术关联指数(link_c),并叠加了 OLS 拟合线。结果显示两个指标之间存在正相关关系,即技术领域越广泛的地区,其技术领域间的关联程度也越高。

处理代码

以下展示该数据计算过程中的关键 R 代码片段。完整的计算代码请参考附件中的 code/计算技术关联性与多样性_全样本_三级.R 文件。

读取并去重专利数据

# 读取专利数据并去重
dt <- fread(path, encoding = "UTF-8", select = sel)

# 过滤地区代码缺失的记录
dt <- dt[!is.na(get(col_code)) & get(col_code) != "" & get(col_code) != "0"]

# 去重:Step1 按地区代码 + 年份 + 公开公告号去重
dt[, 公开公告号_clean := str_replace_all(公开公告号, "[A-Za-z]+$", "")]
dt <- unique(dt, by = c(col_code, "年份", "公开公告号_clean"))

# 去重:Step2 按地区代码 + 年份 + 申请号去重
dt <- unique(dt, by = c(col_code, "年份", "申请号"))

计算显性技术比较优势(RTCA)

# 每个地区 × IPC 小类的专利数
city_tech <- patent_ipc[, .(n = uniqueN(newipzlid)),
by = c(col_code, col_name, "ipc4")]

# 全国每个 IPC 小类的专利总数
nat_tech <- city_tech[, .(n_nat = sum(n)), by = "ipc4"]

# 每个地区的专利总数
city_tot <- city_tech[, .(n_city = sum(n)), by = c(col_code, col_name)]

# 全国总专利数
n_total <- sum(city_tech$n, na.rm = TRUE)

# 计算 RTCA
dt_rtca[, rtca := fifelse(n_city > 0 & n_nat > 0 & n_total > 0,
(n / n_city) / (n_nat / n_total),
NA_real_)]
# 标记优势技术领域
dt_rtca[, x_ci := as.integer(rtca >= 1)]

计算技术多样性(diver_c)与技术关联性(link_c)

# diver_c:优势技术领域数
diver_dt <- dt_rtca[, .(diver_c = sum(x_ci, na.rm = TRUE)),
by = c(col_code, col_name)]

# link_c:技术关联性
# 构建优势技术领域两两配对
adv <- dt_rtca[x_ci == 1, unique(.SD), .SDcols = c(col_code, col_name, "ipc4")]
adv_self <- merge(adv, adv, by = c(col_code, col_name),
allow.cartesian = TRUE,
suffixes = c("_citing", "_cited"))
# 排除自引用
adv_self <- adv_self[ipc4_citing != ipc4_cited]

# 匹配技术联系矩阵 Φ 并求和
adv_phi <- merge(adv_self, phi_dt[, .(ipc_citing, ipc_cited, phi)],
by.x = c("ipc4_citing", "ipc4_cited"),
by.y = c("ipc_citing", "ipc_cited"), all.x = TRUE)
adv_phi[is.na(phi), phi := 0]

# 每个地区的 sum(phi) / diver_c
city_sum_phi <- adv_phi[, .(sum_phi = sum(phi, na.rm = TRUE)),
by = c(col_code, col_name)]
diver_dt <- merge(diver_dt, city_sum_phi, by = c(col_code, col_name), all.x = TRUE)
diver_dt[diver_c > 0, link_c := sum_phi / diver_c]

附件中也提供了该数据的处理代码供参考:

ode_report-1.png)

数据引用格式

由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:

RStata 数据中心: 1985~2024 年各省市区县技术关联指数与技术多样性指数. 2026. https://tidyfriday.cn/rsdb2/

英文文献可以使用下面的格式引用:

RStata Data Center: Provincial, Municipal, and County-Level Technology Relatedness and Technology Diversity Indices in China from 1985 to 2024. 2026. https://tidyfriday.cn/rsdb2/

另外也建议在说明数据来源的同时,根据本文的介绍在论文中描述数据的详细处理方法。

关联课程/数据推荐

1985~2024 年专利申请与授权数据(版本 3,含申请人所处的省市区县):https://rstata.duanshu.com/#/course/2397451274c546d3a36e156ffc865988

1985~2024 年全部专利引用与被引用详细信息:https://rstata.duanshu.com/#/course/225ad0b59a9945e1831d2e8b96ca1001

1985~2024 年各省份、城市间技术互补指数面板数据:https://rstata.duanshu.com/#/course/f1f122c0101941299920b425a36aece2

使用 R 语言计算地区间技术互补指数:https://rstata.duanshu.com/#/course/f75e341e4f924e688de8015f29f85348

RStata 定制|专利数据匹配服务:https://rstata.duanshu.com/#/course/fd3bb2ac5b86425894a9814a02b36ac7

如果有相关的数据定制需要可以联系李老师付费定制。

点击这里跳转到 RStata 短书平台获取附件:1985~2024 年各省市区县技术集群指标:技术关联指数与技术多样性指数(技术集群指标)

评论