python爬虫之XPath解析

XPath 简介:

  • XPath 是一门在 XML 文档中查找信息的语言

什么是 XPath?

  • XPath 使用路径表达式在 XML 文档中进行导航
  • XPath 包含一个标准函数库
  • XPath 是 XSLT 中的主要元素
  • XPath 是一个 W3C 标准

事例:

    etree_html = etree.HTML(html)
    print(etree_html)
    # 匹配所有节点 //*
    result = etree_html.xpath('//*')
    # 匹配所有子节点 //a     文本获取:text()
    result = etree_html.xpath('//a/text()')
    print(result)
    # 查找元素子节点 /
    result_article = etree_html.xpath('//div[@class="pic"]/p/text()')  #获取文章
    print(result_article)

    from_name = etree_html.xpath('//div[@class="source"]//span[@class="from"]/a/text()')  # 获取名字
    from_address = etree_html.xpath('//div[@class="source"]//span[@class="from"]/a/@href')  # 获取地址
    # 查找元素所有子孙节点 //
    result_title = etree_html.xpath('//div[@class="channel-item"]//h3/a/text()')  # 获取标题
    # print(result_son)
    # 父节点 ..
    result = etree_html.xpath('//span[@class="pubtime"]/../span/a/text()')
    print(result)
    # 属性匹配 [@class="xxx"]
    # 文本匹配 text() 获取所有文本//text()
    result = etree_html.xpath('//div[@class="article"]//text()')
    print(result)
    # 属性获取 @href
    result = etree_html.xpath('//div[@class="bd"]/h3/a/@href')
    print(result)
    # 属性多值匹配 contains(@class 'xx')
    result = etree_html.xpath('//div[contains(@class, "grid-16-8")]//div[@class="likes"]/text()[1]')
    print(result)
    # 多属性匹配 or, and, mod, //book | //cd, + - * div = != < > <= >=
    result = etree_html.xpath('//span[@class="pubtime" and contains(text(), "09-07")]/text()')
    print(result)
    # 按序选择 [1] [last()] [poistion() < 3] [last() -2]
    # 节点轴
    //li/ancestor::*  所有祖先节点
    //li/ancestor::div div这个祖先节点
    //li/attribute::* attribute轴,获取li节点所有属性值
    //li/child::a[@href="link1.html"]  child轴,获取直接子节点
    //li/descendant::span 获取所有span类型的子孙节点
    //li/following::* 选取文档中当前节点的结束标记之后的所有节点
    //li/following-sibling::*     选取当前节点之后的所用同级节点
    # 同时取到节点和元素
    result = etree_html.xpath('//div[@class="channel-item"] | //span[@class="pubtime"]/../span/a/text()')

推荐一款插件 Xpath Helper:

Xpath Helper 是一种结构化网页元素选择器,支持列表和单节点数据获取,
它可以快速地定位网页元素。
对比 Beautiful Soup,由于 Xpath 网页元素查找性能更有优势;Xpath 相比正则表达式编写起来更方便。
编写 Xpath 之后会实时显示匹配的数目和对应的位置,方便我们判断语句是否编写正确。


image.png
©著作权归作者所有,转载或内容合作请联系作者
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

推荐阅读更多精彩内容

  • XPath 是一门在 XML 文档中查找信息的语言。XPath 可用来在 XML 文档中对元素和属性进行遍历,而将...
    哈耶卡卡阅读 4,945评论 0 1
  • 爬虫是什么爬虫是一段用来抓取互联网数据的一段程序,给定一个位置(url)为起点,爬虫从这个url开始,爬去互联网上...
    zhile_doing阅读 708评论 0 0
  • # XML复习 ## 第一章 ## 思考题 **什么是XML?** XML是可扩展性标记语言,XML是标准通用标记...
    冷漠铁锤丁富贵阅读 842评论 0 0
  • 离开,莫名的忧伤 相见,莫名的伤感 我们离开的时候,总是思念你的存在 我们相见的时候,总是害怕哪些过往的往事 离开...
    文情木子阅读 129评论 0 5
  • 今天是2018年7月16日 星期一 距3月25号下山已过了112天 【美好的一天,从心开始】 分享: 你的人生使命...
    晴息阅读 255评论 0 0