xpath的常见操作

1. 获取某一个节点下所有的文本数据：

data = response.xpath('//div[@id="zoomcon"]')

content = ''.join(data.xpath('string(.)').extract())

这段代码将获取，div为某一个特定id的所有文本数据：

xpath的常见操作

http://www.nhfpc.gov.cn/fzs/s3576/200804/cdbda975a377456a82337dfe1cf176a1.shtml

xpath的常见操作

2. 获取html几点属性的值

>>> response.xpath("//div[@id='zoomtime']").extract()

[u'<div class="content_subtitle" id="zoomtime" title="\u53d1\u5e03\u65e5\u671f\uff1a2010-10-26"><span>\u4e2d\u534e\u4eba\u6c11\u5171\u548c\u56fd\u56fd\u5bb6\u536b\u751f\u548c\u8ba1\u5212\u751f\u80b2\u59d4\u5458\u4f1a</span><span class="wzurl_tt" style="margin-left:10px;"></span><span style="margin-left:10px;">2010-10-26</span>\r\n                <span style="margin-left:30px;"></span> </div>']

>>> response.xpath("//div[@id='zoomtime']/@title").extract()

[u'\u53d1\u5e03\u65e5\u671f\uff1a2010-10-26']

这里需要获取的是某一个id下，属性title的值，使用的@title就可以获取到：

xpath的常见操作

scrapy的项目结构：

xpath的常见操作

nhfpc.py

# -*- coding: utf-8 -*-

import scrapy

import sys

import hashlib

from scrapy.contrib.spiders import CrawlSpider, Rule

from scrapy.contrib.linkextractors import LinkExtractor

from datetime import *

from common_lib import *

reload(sys)

sys.setdefaultencoding('utf-8')

class NhfpcItem(scrapy.Item):

    url = scrapy.Field()

    name = scrapy.Field()

    description = scrapy.Field()

    size = scrapy.Field()

    dateTime = scrapy.Field()

class NhfpcSpider(scrapy.contrib.spiders.CrawlSpider):

    name = "nhfpc"

    allowed_domains = ["nhfpc.gov.cn"]

    start_urls = (

        'http://www.nhfpc.gov.cn/fzs/pzcfg/list.shtml',

        'http://www.nhfpc.gov.cn/fzs/pzcfg/list_2.shtml',

        'http://www.nhfpc.gov.cn/fzs/pzcfg/list_3.shtml',

        'http://www.nhfpc.gov.cn/fzs/pzcfg/list_4.shtml',

        'http://www.nhfpc.gov.cn/fzs/pzcfg/list_5.shtml',

        'http://www.nhfpc.gov.cn/fzs/pzcfg/list_6.shtml',

        'http://www.nhfpc.gov.cn/fzs/pzcfg/list_7.shtml',

    )

    rules = (

        Rule(

            LinkExtractor(allow='.*\d{6}/.*'),

            callback='parse_item'

        ),

        Rule(

            LinkExtractor(allow='.*201307.*'),

            follow=True,

        ),

    )

    def parse_item(self, response):

        retList =  response.xpath("//div[@id='zoomtitle']/*/text()").extract()

        title = ""

        if len(retList) == 0:

            retList = response.xpath("//div[@id='zoomtitl']/*/text()").extract()

            title =  retList[0].strip()

        else:

            title = retList[0].strip()

        content = ""

        data = response.xpath('//div[@id="zoomcon"]')

        if len(data) == 0:

            data = response.xpath('//div[@id="contentzoom"]')

        content = ''.join(data.xpath('string(.)').extract())

        pubTime = "1970-01-01 00:00:00"

        time = response.xpath("//div[@id='zoomtime']/@title").extract()

        if len(time) == 0 :

            time = response.xpath("//ucmspubtime/text()").extract()

        else:

            time = ''.join(time).split("：")[1]

        pubTime = ''.join(time)

        pubTime = pubTime + " 00:00:00"

        #print pubTime

        #insertTime = datetime.now().strftime("%20y-%m-%d %H:%M:%S")

        insertTime = datetime.now()

        webSite = "nhfpc.gov.cn"

        values = []

        values.append(title)

        md5Url=hashlib.md5(response.url.encode('utf-8')).hexdigest()

        values.append(md5Url)

        values.append(pubTime)

        values.append(insertTime)

        values.append(webSite)

        values.append(content)

        values.append(response.url)

        #print values

        insertDB(values)

common_lib.py

#!/usr/bin/python

#-*-coding:utf-8-*-

'''

This file include all the common routine,that are needed in

the crawler project.

Author: Justnzhang @(uestczhangchao@qq.com)

Time:2014年7月28日15:03:44

'''

import os

import sys

import MySQLdb

from urllib import quote, unquote

import uuid

reload(sys)

sys.setdefaultencoding('utf-8')

def insertDB(dictData):

    print "insertDB"

    print dictData

    id = uuid.uuid1()

    try:

        conn_local = MySQLdb.connect(host='192.168.30.7',user='xxx',passwd='xxx',db='xxx',port=3306)

        conn_local.set_character_set('utf8')

        cur_local = conn_local.cursor()

        cur_local.execute('SET NAMES utf8;')

        cur_local.execute('SET CHARACTER SET utf8;')

        cur_local.execute('SET character_set_connection=utf8;')                

        values = []

#        print values

        values.append("2")

        values.append("3")

        values.append("2014-04-11 00:00:00")

        values.append("2014-04-11 00:00:00")

        values.append("6")

        values.append("7")

        cur_local.execute("insert into health_policy values(NULL,%s,%s,%s,%s,%s,%s)",values)

        #print "invinsible seperator line-----------------------------------"

        conn_local.commit()

        cur_local.close()

        conn_local.close()

    except MySQLdb.Error,e:

        print "Mysql Error %d: %s" % (e.args[0], e.args[1])

if __name__ == '__main__':

    values = [1,2,4]

    insertDB(values)

SET FOREIGN_KEY_CHECKS=0;

-- ----------------------------

-- Table structure for health_policy

-- ----------------------------

DROP TABLE IF EXISTS `health_policy`;

CREATE TABLE `health_policy` (

  `hid` int(11) NOT NULL AUTO_INCREMENT,

  `title` varchar(1000) DEFAULT NULL COMMENT '政策标题',

  `md5url` varchar(1000) NOT NULL COMMENT '经过MD5加密后的URL',

  `pub_time` datetime DEFAULT NULL COMMENT '发布时间',

  `inser_time` datetime NOT NULL COMMENT '插入时间',

  `website` varchar(1000) DEFAULT NULL COMMENT '来源网站',

  `content` longtext COMMENT '政策内容',

  `url` varchar(1000) DEFAULT NULL,

  PRIMARY KEY (`hid`)

) ENGINE=InnoDB AUTO_INCREMENT=594 DEFAULT CHARSET=utf8;

xpath的常见操作的更多相关文章

动态单链表的传统存储方式和10种常见操作-C语言实现
顺序线性表的优点:方便存取(随机的),特点是物理位置和逻辑为主都是连续的(相邻).但是也有不足,比如:前面的插入和删除算法,需要移动大量元素,浪费时间,那么链式线性表 (简称链表) 就能解决这个问题. ...
C&num;路径/文件/目录/I/O常见操作汇总
文件操作是程序中非常基础和重要的内容,而路径.文件.目录以及I/O都是在进行文件操作时的常见主题,这里想把这些常见的问题作个总结,对于每个问题,尽量提供一些解决方案,即使没有你想要的答案,也希望能提供 ...
X-Cart 学习笔记（四）常见操作
目录 X-Cart 学习笔记(一)了解和安装X-Cart X-Cart 学习笔记(二)X-Cart框架1 X-Cart 学习笔记(三)X-Cart框架2 X-Cart 学习笔记(四)常见操作五.常见 ...
转：jQuery 常见操作实现方式
http://www.cnblogs.com/guomingfeng/articles/2038707.html 一个优秀的 JavaScript 框架,一篇 jQuery 常用方法及函数的文章留存备 ...
jQuery 常见操作实现方式
一个优秀的 JavaScript 框架,一篇 jQuery 常用方法及函数的文章留存备忘. jQuery 常见操作实现方式 $("标签名") //取html元素 document. ...
C&num;路径/文件/目录/I/O常见操作汇总&lt&semi;转载&gt&semi;
文件操作是程序中非常基础和重要的内容,而路径.文件.目录以及I/O都是在进行文件操作时的常见主题,这里想把这些常见的问题作个总结,对于每个问题,尽量提供一些解决方案,即使没有你想要的答案,也希望能提供 ...
[java学习笔记]java语言基础概述之数组的定义&amp&semi;常见操作(遍历、排序、查找)&amp&semi;二维数组
1.数组基础 1.什么是数组: 同一类型数据的集合,就是一个容器. 2.数组的好处: 可以自动为数组中的元素从零开始编号,方便操作这些数据. 3.格式: (一 ...
【转】C&num;路径/文件/目录/I/O常见操作汇总
文件操作是程序中非常基础和重要的内容,而路径.文件.目录以及I/O都是在进行文件操作时的常见主题,这里想把这些常见的问题作个总结,对于每个问题,尽量提供一些解决方案,即使没有你想要的答案,也希望能提供 ...
C&num;路径,文件,目录,I/O常见操作
C#路径,文件,目录,I/O常见操作文件操作是程序中非常基础和重要的内容,而路径.文件.目录以及I/O都是在进行文件操作时的常见主题,这里想把这些常见的问题作个总结,对于每个问题,尽量提供 ...

随机推荐

Linux下设置网卡随系统启动
在GUI下安装RHEL,在配置网卡的时候,有时候会忘了勾选网卡随系统自动启动,解决方法是系统启动后,打开网卡配置文件/etc/sysconfig/network-script/ifcfg-eth*,将 ...
javascript基础学习（三）
javascript之运算符学习要点: 表达式运算符:一元运算符,算术运算符,关系运算符,逻辑运算符,*位运算符,赋值运算符一.表达式表达式有常量表达式,变量表达式,复合表达式. 二.算术运算 ...
oracle日期计算
查询某月有多少天.代码例如以下: select to_number(add_months( trunc(to_date('2014-11-4 11:13:53','yyyy-mm-dd hh24:mi ...
mybatis 并发问题解决，参考hibernate
时候操作同一账户就是典型的样例. 比方A.B操作员同一时候读取一剩余金额为1000元的账户,A操作员为该账户添加100元.B操作员同一时候为该账户减去 50元.A先提交.B后提交. 最后实际账户剩余金 ...
史上最全前端面试题(含答案)-A篇
HTML+CSS1.对WEB标准以及W3C的理解与认识标签闭合.标签小写.不乱嵌套.提高搜索机器人搜索几率.使用外链css和js脚本.结构行为表现的分离.文件下载与页面速度更快.内容能被更多的用户所 ...
Cookie防篡改机制
一.为什么Cookie需要防篡改为什么要做Cookie防篡改,一个重要原因是 Cookie中存储有判断当前登陆用户会话信息(Session)的会话票据-SessionID和一些用户信息. 当发起一个 ...
matlab转C语言
1.软件版本 matlab R2018a 2.步骤 (1).编写特定功能的matlab代码,以及其测试文件 (2).检查matlab代码的兼容性,确保matlab代码都能转换成C/C++代码(并不是 ...
InstallShield&colon; 1628 完成基于脚本的安装失败
问题: 第一次卸载程序失败,以后每次卸载出现1628 完成基于脚本的安装失败,使用安装包打开也会出现相同问题. 原因: 首先检查安装包是否出错,然后检查卸载脚本是否出错. InstallShield程 ...
JavaScript条件语句4--分支语句--if
JavaScript条件语句--分支语句学习目标 1.掌握条件语句if 2.掌握prompt()的应用 3.掌握alert的应用 If语句语法一: If(condition){ statement ...
K-means聚类算法（转）
K-means聚类算法想想常见的分类算法有决策树.Logistic回归.SVM.贝叶斯等.分类作为一种监督学习方法,要求必须事先明确知道各个类别的信息,并且断言所有待分类项都有一个类别与之对应.但是 ...