数据分享|2000~2019 年中国各区县指标大全(面板数据,485 个指标,4w+ 观测值)

最近从各省历年的统计年鉴上搜集了各区县的一些指标,经过细心整理得到了一个横跨 2000~2019年,含 485 个指标、52706 个观测值的面板数据,这个数据比之前从县域统计年鉴整理的县域数据更全(县域统计年鉴上仅包含县的数据):

×

不过需要注意,本数据的大多变量存在严重缺失的问题,大家可以将这两份数据结合使用,为了方便大家了解数据缺失的情况,我在文末展示了缺失比例低于 50% 的变量。这 485 个变量包含了大家比较关心的人口、GDP、农业、工业、建筑、交通、教育、财政等方方面面的数据,

大部分指标的数据只到 2018。大约一般的指标没有 2019 年的数据,另外一般有数据的也存在严重缺失的问题,因此需要 2019 年数据的小伙伴可以根据自己的需要选择是否申领这份数据。

为了让大家更加直观的感受这份数据,这里绘制了 2003、2008、2013 和 2018 年中国各区县地区生产总值,同时为了展示缺失值的分布,我没有进行任何缺失值的填补:

2003、2008、2013 和 2018 年中国各区县地区生产总值

另外一个大家很关心的指标是常住人口,不过这个数据缺失的挺严重的,例如 2018 年的中国各区县年末常住人口:

2018 年的中国各区县年末常住人口

不过还可以通过另外一种方法获取常住人口,也就是使用地区生产总值除以人均生产总值,在 Stata 中使用下面的代码即可实现常住人口数据的填补:

replace 年末常住人口数_万人 = (地区生产总值_万元 / 人均生产总值_万元) / 10000 if missing(年末常住人口数_万人)

这样填补方法是靠谱的:

填补常住人口

填补后的效果如下:

填补后的效果

剩余的缺失就需要大家自行处理了。

为了方便大家使用,我给大家提供下面两种格式的数据:

  • 供 Excel 打开的 xlsx 数据;
  • 供 Stata 读取的 dta 数据。

注意事项

  1. 数据缺失较多,大多数指标的数据只到 2018 年。每年的指标并不完全相同,有些指标只有某些年份有,所以缺失很正常,请根据需要选择使用该数据;
  2. 数据共包含 485 个变量,各个变量的缺失比例为(请认真查看你所需变量的缺失情况,不要等拿到数据了再抱怨缺失太多,这里仅展示缺失比例低于 50% 的变量):
变量名称 缺失比例
县代码 0.00%
县 0.00%
年份 0.00%
省 0.00%
市 1.06%
地区生产总值_万元 22.20%
第二产业生产总值_万元 23.33%
第一产业生产总值_万元 24.30%
小学在校学生数_人 25.41%
第三产业生产总值_万元 25.57%
中学在校学生数_人 25.63%
年末金融机构贷款余额_亿元 27.51%
年末城乡居民储蓄存款余额_亿元 28.50%
年末户籍人口数_万人 30.14%
粮食产量_吨 34.47%
行政区域面积_平方公里 37.80%
固定资产投资_亿元 38.58%
人均生产总值_万元 39.25%
油料产量_吨 40.46%
社会福利收养性单位床位数_张 43.77%
社会福利收养性单位数_个 43.88%
农林牧渔业总产值_万元 46.92%
社会消费品零售总额_万元 47.35%
乡村从业人员数_万人 47.40%

点击这里跳转到 RStata 短书平台获取附件:数据分享|2000~2019 年中国各区县指标大全(面板数据,485 个指标,4w+ 观测值)

评论