2000~2023 年各城市数字产业集聚度

今天给大家分享一份 2000~2023 年各城市数字产业集聚度面板数据。该数据基于工商注册信息和《数字经济及其核心产业统计分类(2021)》计算得到,方法参考屠西伟、史丹(2025)《数字产业集聚与企业能源效率改进》,通过区位熵(Location Quotient)来综合测度城市的数字产业集聚水平。

特别需要注意,这里使用的工商注册信息数据截止 2023 年中旬。

指标介绍

数字产业集聚度(DL)衡量某城市数字产业的相对专业化程度,反映该城市数字产业企业在全国中的集聚优势。计算公式为:

区位熵的经济含义:

  • DL > 1:该城市数字产业集聚度高于全国平均水平,具有相对专业化优势
  • DL = 1:与全国平均水平相当
  • DL < 1:低于全国平均水平

两种测算方法:

数据概览

数据的时间范围为 2000~2023 年,覆盖 371 个城市,共 8904 条城市-年份观测记录。数据包含两个版本:

  • 2000~2023年各城市数字产业集聚度(企业数量版).dta
  • 2000~2023年各城市数字产业集聚度(注册资本版).dta

每个数据文件包含如下变量:

  • 省代码 / 省:省份信息
  • 市代码 / 市:城市信息
  • 年份:2000~2023
  • 存量企业数_家(企业数量版)/ 存量企业注册资本_万元(注册资本版):存量全部企业指标
  • 存量数字企业数_家(企业数量版)/ 存量数字企业注册资本_万元(注册资本版):存量数字产业企业指标
  • DL_原始:未经缩尾处理的原始区位熵
  • 数字产业集聚度:经 5%/95% 分位数 Winsorize 处理后的最终区位熵

数据预览

以下是两个版本数据文件的预览截图,可在 Stata 中直接使用:

企业数量版(基于存量企业数量计算):

注册资本版(基于存量注册资本计算,与论文一致):

图表展示

下图展示了 2000~2023 年两种版本(企业数量版与注册资本版)的全国年均数字产业集聚度变化趋势:

2023 年各省份数字产业集聚度分布地图(企业数量版),可直观看出数字产业集聚的”东高西低”空间格局:

2023 年各城市数字产业集聚度分布直方图(企业数量版),峰值集中在 0.6-0.9 区间,呈右偏分布:

处理代码

以下为核心区位熵计算的关键 R 代码片段(完整代码见 code/ 文件夹):

# 计算区位熵 DL_ct = (X_ct / S_ct) / (∑X_ct / ∑S_ct)

# Step 1: 每年全国总存量
panel_full[, `:=`(
national_n_total = sum(stock_n_total, na.rm = TRUE),
national_n_digi = sum(stock_n_digi, na.rm = TRUE)
), by = year]

# Step 2: 计算原始 DL
panel_full[, DL := fifelse(
stock_n_total > 0 & national_n_total > 0 & national_n_digi > 0,
(stock_n_digi / stock_n_total) / (national_n_digi / national_n_total),
NA_real_
)]

# Step 3: Winsorize 处理极端值 (5%/95% 分位数截断)
dl_valid <- panel_full[!is.na(DL) & is.finite(DL), DL]
p05 <- quantile(dl_valid, 0.05, na.rm = TRUE)
p95 <- quantile(dl_valid, 0.95, na.rm = TRUE)

panel_full[, DL_raw := DL] # 保留原始值
panel_full[!is.na(DL), DL := pmax(pmin(DL, p95), p05)]

附件中也提供了完整的计算代码供参考。

处理方法

该数据基于工商企业注册信息和《数字经济及其核心产业统计分类(2021)》,利用区位熵法计算各城市数字产业集聚度。整个计算流程分为以下步骤:

  1. 读取行业分类:加载《数字经济及其核心产业统计分类(2021)》代码表,识别数字产业核心行业
  2. 构建注销查找表:从注销企业数据中提取 newgcid → exit_year 映射,用于后续个体层面过滤
  3. 单年聚合:逐年读取注册企业 CSV,先关联注销查找表过滤已注销企业,再按城市聚合数字产业与全部产业的注册资本/企业数量
  4. 面板累计:跨年累加,构建各城市各年的存量企业指标面板
  5. 计算区位熵:按 DL 公式计算原始区位熵,再进行 5%/95% 分位数 Winsorize 极端值处理
  6. 输出结果:合并城市名称与行政区划信息,保存为 DTA 文件

该数据的详细计算方法在以下三个课程中均有讲解(Python、R 语言、Stata 三个版本):

感兴趣的小伙伴可以结合讲义材料学习。附件中也提供了完整的计算代码(code/ 文件夹下)。

数据引用格式

由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:

RStata 数据中心: 2000~2023年各城市数字产业集聚度. 2026. https://tidyfriday.cn/rsdb2/

英文文献可以使用下面的格式引用:

RStata Data Center: City-Level Digital Industry Agglomeration Index, 2000–2023. 2026. https://tidyfriday.cn/rsdb2/

关联课程/数据推荐

1949~2023 年工商企业注册信息数据(含经纬度及其所属的省市区县)(版本2):https://rstata.duanshu.com/#/course/6d38a3f10cdb467492f3204d1ebdd313

1970~2023 年各年各省市区县、各行业注销公司工商信息及数量统计面板数据:https://rstata.duanshu.com/#/course/bcdf21ad0e614645b8449e69342e0851

使用 R 语言测算各城市虚拟集聚程度:https://rstata.duanshu.com/#/course/c7ca4e8e24264669ad7b77b8e35b01e3

使用 Stata 测算各城市虚拟集聚程度:https://rstata.duanshu.com/#/course/0c2680fa03ee42f481310be0a0ed7462

点击这里跳转到 RStata 短书平台获取附件:2000~2023 年各城市数字产业集聚度

评论