我们想要从网上获取自己想要的数据,通常有几种常见的方式,方式一,手动复制粘贴,适合收集少量数据;二,自己编写爬虫脚本,获取自己想要得到的数据,能收集大量数据,但需要自己有编码能力;三,使用数据采集软件,既不需要自己编写爬虫脚本,又能收集自己想要的数据。
作为一个日常工作中需要采集大量数据来分析用户需求与行为的人,又不会编写脚本,一个好用的数据采集软件成为我工作中必不可少的工具,这几天我使用了几种数据采集软件,发现最好用的就是前嗅的ForeSpider(http://www.forenose.com/)可视化的操作界面,很高级,功能全面,我需要采集的网站都能满足。下面我给大家分享一下最近的使用心得,希望能帮助到有需要的人。
我采集的网站是大众点评,想要得到50页内所有医院名称,该医院评论总数,医院总体星级,各项评分,医院评论的用户名,评论内容,评论时间,用户点评星级,获赞数量和回应数量。
1、
首先我们先新建一个频道,我给它命名为大众点评,然后在频道配置里输入我们想要爬取数据的网址,需要在频道配置处输入想要得到数据的网址,大众点评需要开启cookie,从右面可以开启,网站不同有的不需要,视情况而定。现在默认模板(1)就是我们要的网站页面,鼠标放在医院标题处如图,从左下角能看到医院的网址链接。
现在点一下右上角的采集预览,我们能得到整个页面的所有网页链接,下拉滚动条到这个位置就会发现跟上图相同格式的链接,这就是我们需要的所有医院的链接。
我们用不到的需要过滤一下,可以通过地址过滤和标题过滤方法筛选。
点击软件右上角模板抽取配置里面的链接抽取,里面有地址过滤和标题过滤两个选项,点击地址过滤,软件右下角如图:
过滤规则选择包含,过滤串内输入想要得到的医院链接,后面这串数字我们用“\d”表示,用“\e”表示结束,例如https://www.dianping.com/shop/\d\e,这样就能采集网页内所有这种格式的网页链接。
2、
当我们想要采集的网页下面有翻页的链接,想要前面的采集到数据,就必须配置翻页。除了在右上角默认模板处抽取我们想要的得到的医院链接外,还要再新建一个链接抽取,抽取页面翻页的地址。
我们继续从采集预览处得到翻页的链接,如下图:
过滤规则选择包含,通过观察发现几个链接的相同点,输入到过滤串里就能得到想要的翻页链接了。
3、
下面我们随便点进一个医院主页内,复制链接建立下一层级模板,
在默认模板(2)的示例地址内输入医院主页的链接,得到模板二
因为我们需要采集该医院所有用户评论,所以我们找到下面的“更多点评”,通过刚刚地址过滤的方法,过滤出更多点评的链接,并建立模板(3),示例地址输入刚刚过滤的得到的更多点评的网址。
注:点击链接抽取,看左下角关联模板处,一定要关联到下一层级的模板,如果是翻页的链接抽取,要关联自身模板,否则会数据采集失败。我失败了好多次都没发现原因,就是因为在这里。大家谨记……
模板配置完了,我们下一步是建立表单,如下图红色字体我们能从模板二采集到,蓝色字体我们能从模板三采集到,所以我们需要建立两个表单
点击表单配置,新建一个表单,添加一个网页主键如图,一定要勾选索引字段,键值唯一,主键字段三个选项,取值类型选择网页主键点击确定。
然后添加下一个字段如标题“title”
取值类型选择“选区内全部文本”,变量类型选择“string”,选择合适的字符长度点击确定。
这是我建立的两个表单的所有字段,表单名称分别为“大众点评1”、“大众点评2”,建立好以后点击保存即可。点开模板配置,每一个模板对应相应的表单,右键模板二“添加数据抽取”,表单名称选择“大众点评1”。
同样在模板三处再添加另外一个数据抽取表单,添加好后如下图所示:
例如单击“title”,然后按住ctrl键同时鼠标左键点击对应标题,内容过多的话按住shift可以调整内容大小,选好后点击保存即可。
全部选取完后点击左上角的文件,然后全部保存,就完成啦!
下一步点击数据,连接数据库,直接点击打开即可,然后再次点击数据,选择数据表,选择刚刚新建两个数据表后点击创建表,创建好后勾选并确定,就可以进行数据采集了(如果表单有问题需要更改,改好后需要重新创建表单),速度慢可以点击设置里面的线程设置,设置多线程(设置太多可能会被网站封ip)
今天的分享就就到这里了,我也是初学者可能用的不是特别好,希望能帮助到有需要的人,这个软件确实对我的工作很有帮助,具体问题不懂得可以点开下面链接查看****,祝大家使用愉快!
下面是一些软件的教程案例,供大家参考!
1、新闻类网站
例如凤凰网,人民网这一类的新闻网站,包括链接抽取,和新闻正文的采集。
具体操作请看****的:
http://www.forenose.com/help/collection/template/video_cases1.html
2、智联招聘
以智联招聘为例,其中包含翻页配置,和数据的抽取。具体的操作请看****:
http://www.forenose.com/help/collection/template/video_cases2.html
3、微信公众号
采集微信公众号内的文章内容,其中包含关键词搜索配置,采集了与关键词相关的所有文章内容。具体的操作请看****:
http://www.forenose.com/help/collection/template/video_cases3.html
4、豆瓣网
采集豆瓣网的影评内容,具体操作请看****。
http://www.forenose.com/help/collection/template/video_cases4.html
5、百度搜索
以百度为例,进行了关键词配置,通过关键词,采集到全部相关的链接。具体操作请看****:
http://www.forenose.com/help/collection/template/video_cases5.html
6、京东商城
以京东商城为例,采集了商品的价格、标题等信息,具体操作请看****:
http://www.forenose.com/help/collection/template/video_cases6.html