好难受,上次发了做游戏的居然没人看,每天为了给你们写啥,老夫心都操碎了~
真的是,今天来给大家爬一波短视频网站吧,都是些很养眼的~
网站地址在代码里面,大家用心一下就能看到了。
使用的软件
1
2
|
python 3.8
pycharm 2021.2
|
模块
1
2
3
4
5
6
|
requests
parsel
re
concurrent.futures
time
warnings
|
不会安装模块看这篇:python模块的安装以及安装失败的解决方法
知道你们不想看那些步骤,我直接上代码吧
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
|
import requests
import parsel
import re
import concurrent.futures
import time
import warnings
# 取消警告
warnings.filterwarnings( "ignore" )
def get_html(url):
"""发送请求获取网页源代码"""
html_data = requests.get(url = url, verify = False ).text
return html_data
def parse_data_1(html_data):
"""第一次解析, 拿到所有的详情页链接"""
selector = parsel.Selector(html_data)
url_list = selector.xpath( '//a[@class="meta-title"]/@href' ).getall()
return url_list
def parse_data_2(html_data):
"""第二次解析, 获取视频链接"""
video_url = re.findall( 'url: "(.*?)",' , html_data)[ 0 ]
return video_url
def save(video_url):
"""保存视频"""
title = video_url.split( '/' )[ - 1 ] # 取链接当中的字段作为标题
video_data = requests.get(video_url, verify = False ).content # 发送网络请求
with open (f 'video/{title}' , mode = 'wb' ) as f:
f.write(video_data)
print (title, "爬取成功!!!" )
start_time = time.time()
url = 'https://www.520mmtv.com/hd/rewu.html'
# 1. 向目标网站发送请求
html_data = get_html(url = url)
# 2. 第一次解析数据 提取详情页链接
url_list = parse_data_1(html_data = html_data)
for info_url in url_list[: 10 ]:
# 3. 向详情页发送请求
html_data_2 = get_html(url = info_url)
# 4. 第二次解析数据 提取视频播放地址
video_url = parse_data_2(html_data = html_data_2)
# 5. 保存视频
save(video_url = video_url)
print ( '花费时间:' , time.time() - start_time)
|
到此这篇关于Python 短视频爬虫教程的文章就介绍到这了,更多相关Python 爬虫教程内容请搜索服务器之家以前的文章或继续浏览下面的相关文章希望大家以后多多支持服务器之家!
原文链接:https://blog.csdn.net/fei347795790/article/details/121432241