欢迎各位培训班会员参加明晚 8 点的直播课:「使用 R 语言爬取2020年中国各级行政区划代码」
虽然之前讲解过爬取 2019 年的各级行政区划代码的爬取,但是那个方法非常容易出错,所以今天重新讲解一种方法。
对于复杂网页的爬取方法永远是先都下载到本地再慢慢处理!
所以,这次我们还是按照这种想法爬取。
本次数据的爬取流程大致是:
- 下载各省份的页面;
- 从各省份的页面提取各城市页面的链接然后下载各城市的页面;
- 从各城市的页面提取各城市页面的链接然后下载各区县的页面;
- 从各区县的页面提取各城市页面的链接然后下载各乡镇的页面;
- 分别从下载到的 html 文件里面提取各级行政区划数据;
- 匹配合并各级别的行政区划数据;
- 由于东莞、中山和儋州三个城市没有区县,所以这三个城市的数据还需要单独处理修正。
更多内容欢迎参加课程学习!
点击这里跳转到 RStata 短书平台获取附件:使用 R 语言爬取2020年中国各级行政区划代码
评论