1949~2023 年各省市区县产业专业化指标面板数据

今天给大家分享一份 1949~2023 年各省市区县产业专业化指标面板数据。该数据基于 1949~2023 年工商企业注册信息数据处理得到,覆盖省、市、区县三个地理层级,逐年测算了各地区制造业的产业专业化指数。

1949~2023 年工商企业注册信息数据(含经纬度及其所属的省市区县)(版本2):https://rstata.duanshu.com/#/course/6d38a3f10cdb467492f3204d1ebdd313

指标含义与计算方法

地区产业专业化指数衡量一个地区的制造业行业结构相对于”其他地区平均水平”的偏离程度:指数越大,说明该地区制造业越集中在少数特定行业(即越”专业化”);指数越小,说明其行业结构越接近整体平均(即越”多样化”)。

计算方法参考自杨本建、唐金汶(2022)《数字经济与区域产业布局》中的公式 (2),其思想源于 Kalemli-Ozcan et al. (2003) 与 Du et al. (2022) 的 Krugman 式专业化指数:

处理过程中的几个关键设定:

该数据的详细计算方法在以下三个课程中均有讲解(Python、R 语言、Stata 三个版本):

感兴趣的小伙伴可以结合讲义材料学习。附件中也提供了完整的计算代码。

数据概览

为了方便大家使用,我把数据汇总成了省、市、区县三个层级的面板数据,每个层级各一个 .dta 文件。数据包含如下变量:

行政区划代码、地区名称、年份、产业专业化指数(注册资本口径)、企业数专业化指数(企业数量口径)、地区数量(当年参与测算的该级地区个数 J)

三个层级的数据预览如下:

省份层级:

城市层级:

区县层级:

需要提醒的是,由于早期年份工商注册数据较为稀疏,越靠近 1949 年参与测算的地区数量(J)越少,1949 年前后的指数可读性有限;同时 2023 年的原始工商数据不太全,使用早期与末期年份时请结合 地区数量 变量谨慎判断。

图表展示

下图展示了 1949~2023 年省级产业专业化指数与企业数专业化指数的年度均值趋势,两种口径整体走势一致:

下图展示了最新年份省级截面上,产业专业化指数(注册资本口径)与企业数专业化指数(企业数量口径)的关系(散点 + OLS 拟合线),两者高度正相关,说明注册资本口径的结果具有稳健性:

下图展示了最新年份省级产业专业化指数的分布(直方图):

处理代码

数据处理采用 R 语言(tidyverse + arrow),逐年流式读取工商注册主数据,先聚合出”进入(E)/退出(X)”两张表,再累计得到各年各地区各行业的存续规模,最后逐年计算专业化指数。核心的专业化指数计算函数如下:

# 对某一年的 (code, industry, output) 数据计算各地区 spec 指数
compute_spec_year <- function(sy, J, all_mfg) {
base <- sy |>
group_by(code) |>
summarise(tot = sum(output), tot_n = sum(n_firm), .groups = "drop") |>
filter(tot > 0, tot_n > 0) # 剔除规模为 0 的地区,避免 0/0=NaN
J <- n_distinct(base$code) # 用实际参与测算的地区数作为 J

crossing(code = base$code, industry = all_mfg) |> # 补全 地区×行业 全网格
left_join(select(sy, code, industry, output, n_firm), by = c("code", "industry")) |>
mutate(output = replace_na(output, 0), n_firm = replace_na(n_firm, 0)) |>
left_join(select(base, code, tot, tot_n), by = "code") |>
mutate(share = output / tot, share_n = n_firm / tot_n) |>
group_by(industry) |>
mutate(sum_share = sum(share), sum_share_n = sum(share_n)) |>
ungroup() |>
mutate(
other_avg = (sum_share - share) / (J - 1), # 其他地区平均份额
sq = (share - other_avg) ^ 2
) |>
group_by(code) |>
summarise(spec = sum(sq), .groups = "drop") |> # 跨行业求和 = 专业化指数
mutate(n_units = J)
}

附件中也提供了该数据的处理代码供参考:

数据引用格式

由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:

RStata 数据中心: 1949~2023年各省市区县产业专业化指标面板数据. 2026. https://tidyfriday.cn/rsdb2/

英文文献可以使用下面的格式引用:

RStata Data Center: Panel Data on Industrial Specialization Indices by Province, City, and District/County, 1949–2023. 2026. https://tidyfriday.cn/rsdb2/

关联课程 / 数据推荐

本数据的原始工商注册信息、注销企业信息以及行业代码统一方法,可参考以下课程与数据:

1949~2023 年工商企业注册信息数据(含经纬度及其所属的省市区县)(版本2):https://rstata.duanshu.com/#/course/6d38a3f10cdb467492f3204d1ebdd313

1970~2023 年各年各省市区县、各行业注销公司工商信息及数量统计面板数据:https://rstata.duanshu.com/#/course/bcdf21ad0e614645b8449e69342e0851

使用 Stata 匹配工商注册信息行业与国民经济行业代码:https://rstata.duanshu.com/#/course/bd1a192a81af45418c0d01ef8ea0c371

点击这里跳转到 RStata 短书平台获取附件:1949~2023 年各省市区县产业专业化指标面板数据

评论