一起学爬虫——如何爬取通过ajax加载数据的网站

目前很多网站都使用ajax技术动态加载数据，和常规的网站不一样，数据时动态加载的，如果我们使用常规的方法爬取网页，得到的只是一堆html代码，没有任何的数据。

请看下面的代码：

url = 'https://www.toutiao.com/search/?keyword=美女'

headers = {"User-Agent": "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.36 SE 2.X MetaSr 1.0"}

response = requests.get(url,headers=headers)

print(response.text)

上面的代码是爬取今日头条的一个网页，并打印出get方法返回的文本内容如下图所示，值现在一堆网页代码，并没有相关的头条新闻信息

一起学爬虫——如何爬取通过ajax加载数据的网站

内容过多，只截取部分内容，有兴趣的朋友可以执行上面的代码看下效果。

对于使用ajax动态加载数据的网页要怎么爬取呢？我们先看下近日头条是如何使用ajax加载数据的。通过chrome的开发者工具来看数据加载过程。

首先打开chrome浏览器，打开开发者工具，点击Network选项，点击XHR选项，然后输入网址：https://www.toutiao.com/search/?keyword=美女，点击Preview选项卡，就会看到通过ajax请求返回的数据，Name那一栏就是ajax请求，当鼠标向下滑动时，就会出现多条ajax请求：

一起学爬虫——如何爬取通过ajax加载数据的网站

通过上图我们知道ajax请求返回的是json数据，我们继续分析ajax请求返回的json数据，点击data展开数据，接着点击0展开数据，发现有个title字段，内容刚好和网页的第一条数据匹配，可知这就是我们要爬取的数据。如下所示：

一起学爬虫——如何爬取通过ajax加载数据的网站

鼠标向下滚动到网页底部时就会触发一次ajax请求，下面是三次ajax请求：

https://www.toutiao.com/search_content/?offset=0&format=json&keyword=%E7%BE%8E%E5%A5%B3&autoload=true&count=20&cur_tab=1&from=search_tab&pd=synthesis

https://www.toutiao.com/search_content/?offset=20&format=json&keyword=%E7%BE%8E%E5%A5%B3&autoload=true&count=20&cur_tab=1&from=search_tab&pd=synthesis

https://www.toutiao.com/search_content/?offset=40&format=json&keyword=%E7%BE%8E%E5%A5%B3&autoload=true&count=20&cur_tab=1&from=search_tab&pd=synthesis

观察每个ajax请求，发现每个ajax请求都有offset,format,keyword,autoload,count,cur_tab,from,pd参数，除了offset参数有变化之外，其他的都不变化。每次ajax请求offset的参数变化规律是0,20,40,60...，可以推测offset是偏移量，count参数是一次ajax请求返回数据的条数。

为了防止爬虫被封，每次请求时要把请求时都要传递请求头信息，请求头信息中包含了浏览器的信息，如果请求没有浏览器信息，就认为是网络爬虫，直接拒绝访问。request header信息如下：

headers = {

"User-Agent": "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/68.0.3029.110 Safari/537.36 SE 2.X MetaSr 1.0",

"referer": "https://www.toutiao.com/search/?keyword=%E7%BE%8E%E5%A5%B3",

'x-requested-with': 'XMLHttpRequest'

}

完整代码如下：

import requests

from urllib.parse import urlencode

def parse_ajax_web(offset):

    url = 'https://www.toutiao.com/search_content/?'

    #请求头信息

    headers = {

        "User-Agent": "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/68.0.3029.110 Safari/537.36 SE 2.X MetaSr 1.0",

        "referer": "https://www.toutiao.com/search/",

        'x-requested-with': 'XMLHttpRequest'

    }

    #每个ajax请求要传递的参数

    parm = {

        'offset': offset,

        'format': 'json',

        'keyword': '美女',

        'autoload': 'true',

        'count': 20,

        'cur_tab': 1,

        'from': 'search_tab',

        'pd': 'synthesis'

    }

    #构造ajax请求url

    ajax_url = url + urlencode(parm)

    #调用ajax请求

    response = requests.get(ajax_url, headers=headers)

    #ajax请求返回的是json数据，通过调用json()方法得到json数据

    json = response.json()

    data = json.get('data')

    for item in data:

        if item.get('title') is not None:

            print(item.get('title'))

def main():

    #调用ajax的次数，这里调用5次。

    for offset in (range(0,5)):

        parse_ajax_web(offset*20)

if __name__ == '__main__':

    main()

上面是爬取通过ajax请求加载数据网站的例子，如果想要其他的数据，可以动手自己写，这里只是搭了一个架子，各位可以尝试将数据写入到excel或者数据库中。

一起学爬虫——如何爬取通过ajax加载数据的网站的更多相关文章

Python爬虫《爬取get请求的页面数据》
一.urllib库 urllib是Python自带的一个用于爬虫的库,其主要作用就是可以通过代码模拟浏览器发送请求.其常被用到的子模块在Python3中的为urllib.request和urllib. ...
Ajax 加载数据练习自我有些迷糊了，写的大概请谅解 &Hat; &lowbar; &Hat;
查询表的显示,查询显示如果不嵌入PHP代码的话,用ajax怎么实现? <h1>显示数据</h1> <table width="100%" bord ...
table+ajax加载数据
//ajax加载notice $(function() { //${pageContext.request.contextPath}/ /** var res = [ {noticeTitle:'必答 ...
Ajax加载数据的使用
需求就是不能再进入页面时加载数据,只能在点击其中一个按钮时把数据加载呈现出来.具体效果如最下面的图. 1.前台页面 <h1 " onclick="GetData(1)&quo ...
一起学爬虫——通过爬取豆瓣电影top250学习requests库的使用
学习一门技术最快的方式是做项目,在做项目的过程中对相关的技术查漏补缺. 本文通过爬取豆瓣top250电影学习python requests的使用. 1.准备工作在pycharm中安装request库 ...
python网络爬虫《爬取get请求的页面数据》
一.urllib库 urllib是python自带的一个用于爬虫的库,其主要作用就是可以通过代码模拟浏览器发送请求.其常被用到的子模块在python3中的为urllib.request和urllib. ...
python+selenium+PhantomJS爬取网页动态加载内容
一般我们使用python的第三方库requests及框架scrapy来爬取网上的资源,但是设计javascript渲染的页面却不能抓取,此时,我们使用web自动化测试化工具Selenium+*面浏览 ...
Ajax加载数据后百度分享实例
<script type="text/javascript"> //百度分享 function baidu_share() { var title_val = $(&q ...
Python爬虫学习——使用selenium和phantomjs爬取js动态加载的网页
1.安装selenium pip install selenium Collecting selenium Downloading selenium-3.4.1-py2.py3-none-any.wh ...

随机推荐

资料,来自HTML5前端开发学习⑤群
resource HTML5+CSS3视频教程:http://pan.baidu.com/s/1hsyOjze 密码:c3uw JavaScript视频教程:链接:http://pan.baidu.c ...
LaTex Remove Left Margin 去除左边空间
LaTex中使用itemize的时候,默认的每一项左边都有一小段距离,并不是紧贴着边缘的,那么如果我们想去掉这段距离,我们可以使用下面的命令: \usepackage{enumitem} \setli ...
[mysql]MySql数据类型和java类型对照表
MySQL Type Name Return value ofGetColumnClassName Returned as Java Class BIT(1) (new in MySQL-5.0) B ...
java排序算法-交换排序
public class ExchangeSortUtils { // 冒泡 public static void bubbleSort(int[] array) { int length = arr ...
IndexAction&period;java (Java之负基础实战)
生成Get and Set 方法: 例如:public String view; 右击view > Source > Generate Getters and Setters...
我的日志文件java logger
操作读取日志文件, 1.使用默认的日志文件,并验证默认级别 public void originalConfig() { Logger logger = Logger.getLogger(Logger ...
An internal error occurred during&colon; &quot&semi;Retrieving archetypes&colon;&quot&semi;&period; GC overhead limit exceeded
An internal error occurred during: "Retrieving archetypes:".GC overhead limit exceeded 异常, ...
一次搞懂 Generator 函数
1.什么是 Generator 函数在Javascript中,一个函数一旦开始执行,就会运行到最后或遇到return时结束,运行期间不会有其它代码能够打断它,也不能从外部再传入值到函数体内而Gen ...
银行卡卡bin
卡BIN指的是发卡行识别码,英文全称是 Bank Identification Number,缩写为 BIN.中文即“银行识别代码” 银行卡的卡号是标识发卡机构和持卡人信息的号码一般是13-19位 ...
java基本类型的默认值
基本类型默认值取值范围 (最大/最小) 字节数二进制位数 byte 0 127(2^7-1) -128(-2^7) 1byte 8bit short 0 32767(2^15 - 1) -327 ...