欢迎各位培训班的小伙伴参加明晚 8 点的直播课:「使用 R 语言爬取政府采购数据:多线程爬取 & 正则表达式」
本次课程的主要内容包括:
- 如何进行网页分析?
- 如何下载和解析单个 html 网页文件?
- 如何更高效的下载网页文件:单线程下载与多线程下载的速度比较;
- 是不是线程越多下载速度越快?
- 嵌套数据框的使用;
- 使用正则表达式从文本中提取所需数据。
政府采购网上的数据是这样的:
| 首页 |
|---|
![]() |
点击每一项可以看到合同的详情,根据时间的不同,详情页有两种形式。2020 年 7 月 1 日之前的合同详情页面是这样的:
| 2020 年 7 月 1 日之前的合同详情页面 |
|---|
![]() |
2020 年 7 月 1 日之后的合同详情页面是这样的:
| 2020 年 7 月 1 日之后的合同详情页面 |
|---|
![]() |
所以在使用正则表达式提取所需数据的时候也要注意需要分两种情况处理。
点击这里跳转到 RStata 短书平台获取附件:使用 R 语言爬取政府采购数据:多线程爬取 & 正则表达式(失效课程)



评论