新版本在这里:https://rstata.duanshu.com/#/brief/course/f8abc7e7c361418794e8afd8698edb0c
前不久给大家分享了最新的土地出让数据:
2000~2023 年 12 月 31 日土地出让结果公告数据:https://rstata.duanshu.com/#/course/6869f4847d964179b06735fa81455158
很久之前就有小伙伴建议把税调数据和这份土地出让数据匹配下,可以用来研究税调企业的购地行为,这不就来了!税调数据我之前也分享过:
2007~2016 年税调企业地理信息数据(含经纬度及其所处的省市区县):https://rstata.duanshu.com/#/course/76d38022cd004b09b2aa09647936beb0
匹配结果
税调与土地出让数据匹配结果的时间范围为 2007~2016 年,经过匹配之后一共得到了 18.5 万条匹配结果:
![]()
包含的变量如下:
sdid、tdid、法人代码、企业名称、年份、供地全局唯一标志符、省_土地、省代码_土地、市_土地、市代码_土地、县_土地、县代码_土地、行政区划代码、项目序号、编号、电子监管号、项目名称、行业分类、土地级别、宗地编号、土地坐落、供地方式、供地面积_公顷、土地用途、出让年限、成交价格_万元、建筑面积_公顷、最小建筑密度_百分比、最小容积率、最小建筑高度_米、批准文号、批准机关、土地使用权人、土地来源、投资强度_万元每公顷、最大建筑密度_百分比、最大容积率、最小绿化率_百分比、最大建筑高度_米、最大绿化率_百分比、约定交地时间、约定动工时间、约定竣工时间、实际交地时间、实际动工时间、实际交割时间、合同签订日期、批准日期、经度_土地、纬度_土地、省_经纬度解析_土地、省代码_经纬度解析_土地、市_经纬度解析_土地、市代码_经纬度解析_土地、县_经纬度解析_土地、县代码_经纬度解析_土地
匹配数量
为了让大家更直观地感受这份数据,我还绘制了一幅图进行展示。税调企业每年匹配成功的地块数量如下图所示:
![]()
匹配方法
首先土地使用权人可能是多个公司或个人,因此我们首先需要把这些土地使用权人拆分开,例如下面两个地块:
![]()
然后再对税调数据库里的企业名称和土地出让数据里的土地使用权人变量进行处理。在之前的课程「Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例」中我分享过使用 Stata 进行模糊匹配的方法,不过模糊匹配耗时耗力,并且错误率很高。不同于英文,中文企业名称只要有一个字不同都可能不是同一家企业(英文企业名称有一两个字母不同可能是因为笔误)。所以中文企业名称的模糊匹配没有意义。因此这里我还是使用了精确匹配,考虑到企业名称中经常会把“有限公司”和“有限责任公司”混用,以及有限公司改股份有限公司之类的。所以这里在匹配前删除了下面词汇:股份有限、集团有限、有限责任、有限、责任、股份、公司、厂、 、(集团)、(集团)、(、)、(、)、省、市、区、县、回族自治区、壮族自治区、维吾尔自治区、自治区。这样可以大大提高匹配成功率。
Stata 中的中文模糊匹配——以 2014 年工企数据和境外投资名录数据匹配为例:https://rstata.duanshu.com/#/brief/course/d4fb816566244662ab6359fa848f1f1e
![]()
最后直接使用处理后的企业名称和土地使用权人匹配即可得到匹配结果。
附件中也提供了匹配使用的代码供大家参考。
数据匹配的方法都差不多,感兴趣的小伙伴也可以学习下面两个课程:
- 如何匹配中国工业企业数据库和海关数据库?以 2013 年为例:https://rstata.duanshu.com/#/brief/course/5463b8d7afcb438ca1e537fa76c1a45d
- 工企和污染数据是如何匹配的?使用 Stata 完成整个过程:https://rstata.duanshu.com/#/brief/course/7325758d0ad9457790215455dbcbcb1a
点击这里跳转到 RStata 短书平台获取附件:旧版本|2007~2016 年税调与土地出让数据匹配结果
评论