python爬取网易评论

学习python不久，最近爬的网页都是直接源代码中直接就有的，看到网易新闻的评论时，发现评论时以json格式加载的.....

爬的网页是习大大2015访英的评论页http://comment.news.163.com/news_guonei8_bbs/SPEC0001B60046CG.html

步骤如下：

1.使用谷歌浏览器分析网页首页加载的数据

打开网页----按下F12----点击Network，此时是空的

python爬取网易评论

刷新以后，会出现如下图：(我以前加载过页面，所以json数据显示的不全)

python爬取网易评论

点击其中的一个json格式的文件，找到url，并在网页中打开，看看是不是自己想要的数据：

python爬取网易评论

我第一次访问网页的时候打了三个，只有一个是并论的内容，首页的网址为：

http://comment.news.163.com/data/news_guonei8_bbs/df/SPEC0001B60046CG_1.html?_=14455959217790

数据为：

python爬取网易评论

2.其他评论页

在点击其他评论页时，先点击一下Network中的清除按钮，方便查找json---从第二页开始观察，几乎都一样

python爬取网易评论

点击找到url，并在浏览器中打开

python爬取网易评论

数据虽然是乱码的，在Python中读取到的是可以正常查看的

python爬取网易评论

3.网址规律

一开始以为网址后面的 python爬取网易评论有什么规律，后来发现去掉也没影响，

所以只要把页数换成对应的评论页就好了(我只能打开34页??)

4.代码

注：由于数据开始有变量名，结尾有分号，在使用json.loads(data)时报错，所以先对数据进行处理

 # encoding=utf-8

 import urllib2

 import json

 import re

 import time

 class JSON():

     def __init__(self):

         self.user_agent='Mozilla/4.0 (compatible; MSIE 5.5; Windows NT)'

         self.headers={'User-Agent':self.user_agent}

         self.url1='http://comment.news.163.com/data/news_guonei8_bbs/df/SPEC0001B60046CG_1.html'

     def getUrls(self,pageIndex):

         url2='http://comment.news.163.com/cache/newlist/news_guonei8_bbs/SPEC0001B60046CG_'+str(pageIndex)+'.html'

         return url2

     def getHtml(self,url):

         try:

             request=urllib2.Request(url,headers=self.headers)

             respone=urllib2.urlopen(request)

             html=respone.read()

             return html

         except urllib2.URLError,e:

             if hasattr(e,'reason'):

                 print u"连接失败",e.reason

                 return  None

     #处理字符串，没有处理干净的可以再打开文件进行处理

     def strDeal(self,data,pageIndex):

         if pageIndex==1:

             data=data.replace('var replyData=','')

         else:

             data=data.replace('var newPostList=','')

         reg=re.compile("&nbsp;\[<a href=''>")

         data=reg.sub('--',data)

         reg2=re.compile('<\\\/a>\]')#<\/a>]的正则?

         data=reg2.sub('',data)

         reg3=re.compile('<br>')

         data=reg3.sub('',data)

         return data

     #解析json数据并存入文件

     def parserJson(self):

         with open('wangyi2.txt','a') as f:

             f.write('用户ID'+'|'+'评论'+'|'+'点赞数'+'\n')

         for i in range(1,35):

             if i==1:

                 url=self.url1

                 data=self.getHtml(url)

                 data=self.strDeal(data,i)[:-1]

                 value=json.loads(data)

                 f=open('wangyi2.txt','a')

                 for item in value['hotPosts']:

                     f.write(item['']['f'].encode('utf-8')+'|')

                     f.write(item['']['b'].encode('utf-8')+'|')

                     f.write(item['']['v'].encode('utf-8')+'\n')

                 f.close()

                 print 'sleeping pageload %d/34'%i

                 time.sleep(6)

             else:

                 url=self.getUrls(i)

                 data=self.getHtml(url)

                 data=self.strDeal(data,i)[:-2]

                 # 转换，一开始得到的数据类型为str，使用json.loads()函数，得到原始数据，此时的value的数据类型为dict，接下来就可以正常访问字典了。

                 value=json.loads(data)

                 f=open('wangyi2.txt','a')

                 for item in value['newPosts']:

                     f.write(item['']['f'].encode('utf-8')+'|')

                     f.write(item['']['b'].encode('utf-8')+'|')

                     f.write(item['']['v'].encode('utf-8')+'\n')

                 f.close()

                 print 'sleeping pageload %d/34'%i

                 time.sleep(6)

 js=JSON()

 js.parserJson()

秒客网

python爬取网易评论

相关文章