此程序实现了网页源代码捕获,图片链接获取、分析、并将同样的图片链接合并功能,实现了图片抓取功能。利用php强大的网络内容处理函数将指定的网站上的所有图片抓取下来,保存在当前目录下,以下为代码:
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
|
<?php
/*完成网页内容捕获功能*/
function get_img_url( $site_name ){
$site_fd = fopen ( $site_name , "r" );
$site_content = "" ;
while (! feof ( $site_fd )) {
$site_content .= fread ( $site_fd , 1024);
}
/*利用正则表达式得到图片链接*/
$reg_tag = '/<img.*?\"([^\"]*(jpg|bmp|jpeg|gif)).*?>/' ;
$ret = preg_match_all( $reg_tag , $site_content , $match_result );
fclose( $site_fd );
return $match_result [1];
}
/* 对图片链接进行修正 */
function revise_site( $site_list , $base_site ){
foreach ( $site_list as $site_item ) {
if (preg_match( '/^http/' , $site_item )) {
$return_list [] = $site_item ;
} else {
$return_list [] = $base_site . "/" . $site_item ;
}
}
return $return_list ;
}
/*得到图片名字,并将其保存在指定位置*/
function get_pic_file( $pic_url_array , $pos ){
$reg_tag = '/.*\/(.*?)$/' ;
$count = 0;
foreach ( $pic_url_array as $pic_item ){
$ret = preg_match_all( $reg_tag , $pic_item , $t_pic_name );
$pic_name = $pos . $t_pic_name [1][0];
$pic_url = $pic_item ;
print ( "Downloading " . $pic_url . " " );
$img_read_fd = fopen ( $pic_url , "r" );
$img_write_fd = fopen ( $pic_name , "w" );
$img_content = "" ;
while (! feof ( $img_read_fd )){
$img_content .= fread ( $img_read_fd ,1024);
}
fwrite( $img_write_fd , $img_content );
fclose( $img_read_fd );
fclose( $img_write_fd );
print ( "[OK] " );
}
return 0;
}
function main(){
/* 待抓取图片的网页地址 */
$img_url = get_img_url( $site_name );
$img_url_revised = revise_site( $img_url , $site_name );
$img_url_unique = array_unique ( $img_url_revised ); //unique array
get_pic_file( $img_url_unique , "./" );
}
main();
?>
|
此程序还有待完善的地方是,如果图片在网站服务器上不同目录下但文件名是相同的,此时图片有可能是不一样的,但在最后保存时,后面得到的图片会将前面已经保存的图片覆盖掉,解决方法是在每次保存前先检索当前目录下是否已有此文件名,有的话对将要保存的图片重新命名即可。
以上就是为大家分享的php抓取并保存网站图片的方法,以及在实践过程中修正程序不完善的地方,希望这篇文章对大家的学习有所帮助。