需求场景,爬虫数据提取。
- 通过text = request.get().text()得到目标网页的内容
- 通过text_html = BeautifulSoup(text)得到html形式
- 通过tag = text_html.find_all(label)[i]得到目标数据所在标签
- 通过NavigableString = tag.get_text()得到目标标签内的字符串内容
- 通过正则表达式匹配出特定字母后面的数据,就是想要的数据
本文遇到的是爬取链家二手房在售数目,最后得到这样一段字符串
所用正则表达式:count:\s\d{1,9}