使用 R 语言爬取2020年中国各级行政区划代码

欢迎各位培训班会员参加明晚 8 点的直播课:「使用 R 语言爬取2020年中国各级行政区划代码」

虽然之前讲解过爬取 2019 年的各级行政区划代码的爬取,但是那个方法非常容易出错,所以今天重新讲解一种方法。

对于复杂网页的爬取方法永远是先都下载到本地再慢慢处理!

所以,这次我们还是按照这种想法爬取。

本次数据的爬取流程大致是:

  1. 下载各省份的页面;
  2. 从各省份的页面提取各城市页面的链接然后下载各城市的页面;
  3. 从各城市的页面提取各城市页面的链接然后下载各区县的页面;
  4. 从各区县的页面提取各城市页面的链接然后下载各乡镇的页面;
  5. 分别从下载到的 html 文件里面提取各级行政区划数据;
  6. 匹配合并各级别的行政区划数据;
  7. 由于东莞、中山和儋州三个城市没有区县,所以这三个城市的数据还需要单独处理修正。

更多内容欢迎参加课程学习!

点击这里跳转到 RStata 短书平台获取附件:使用 R 语言爬取2020年中国各级行政区划代码

评论