clear all cd"/Users/ac/Desktop/中国城市CO2排放数据集/" foreach y in 2005 2010 2015 2020 { import excel using "`y'.xlsx", first sheet("二氧化碳排放(万吨)") clear gen 年份 = `y' save`y', replace }
*- 合并 use 2005, clear append using 2010 append using 2015 append using 2020
*- 社会经济数据 foreach y in 2005 2010 2015 2020 { import excel using "`y'.xlsx", first sheet("社会经济数据") clear gen 年份 = `y' save`y', replace }
use 2005, clear append using 2010 append using 2015 append using 2020 ren 省份Province 省份 ren 城市名称NameofCities 城市 drop 城市英文名称NameofCities ren 常住人口万人Permanentpopulation104 常住人口_万人 ren GDP亿元GrossDomesticProduct10 GDP_亿元 ren 人均GDP万元GDPpercapita104RMB 人均GDP_万元 dropG - L order 年份 merge 1:1 年份 省份 城市 using CO2排放数据集 drop _m label data "数据处理:微信公众号 RStata" save"2005~2020年中国各城市CO2排放与社会经济指标数据", replace
删除无用的中间数据:
*- 删除中间数据 cap erase 2005.dta cap erase 2010.dta cap erase 2015.dta cap erase 2020.dta cap erase CO2排放数据集.dta
use 2020cityco2map_db.dta, clear keep 省 - 市代码 duplicatesdrop _all, force keep 省* duplicatesdrop 省, force gen z = substr(省, 1, 6) save provlist, replace
use 2020cityco2map_db.dta, clear keep 省 - 市代码 duplicatesdrop _all, force gen z = substr(市, 1, 6) duplicatesreport 省 z save citylist, replace
然后依次匹配上省份和城市的区划代码:
use"2005~2020年中国各城市CO2排放与社会经济指标数据", clear
*- 省份匹配使用每个省的前两个字: gen z = substr(省, 1, 6) mergem:1 z using provlist dropif _m == 2 drop z _m 省份 order 年份 省* gen z = substr(城市, 1, 6) mergem:1 省 省代码 z using citylist dropif _m == 2
order 年份 省* 市* drop z _merge destring 市代码, replace drop 城市 save"2005~2020年中国各城市CO2排放与社会经济指标数据(带行政区划代码)", replace
评论