本次课程将主要以 2014 年工业企业数据库和《境外投资名录》数据的精确匹配与模糊匹配为例进行讲解。
最近不少培训班的小伙伴提到了模糊匹配,今天我们就一起来学习下在 R 语言中如何进行中文的模糊匹配,以及模糊匹配在实际案例中的使用。
当你意识到自己需要模糊匹配的时候,也就意味着你要进行的工作会是非常耗费时间的了,模糊匹配的主要功能实际上是减少手工检查的难度和工作量,所以本文的目标并非是真正要用模糊匹配来连接两个数据,而是讲解如何使用模糊匹配来减少手动检查的工作量。(当然连接还是要连接的)
| 讲义文档 |
|---|
![]() |
本次课程的主要内容包括:
- 如何计算字符串的距离;
- 如何进行单变量模糊匹配;
- 如何进行多变量模糊匹配;
- 案例:2014 年工业企业数据库和《境外投资名录》数据的精确匹配与模糊匹配;
- 如何通过分词和词频统计来查找对匹配过程没有帮助的词组。
点击这里跳转到 RStata 短书平台获取附件:R 语言中的中文模糊匹配——以工企数据和境外投资名录数据匹配为例

评论