使用xpath解析爬虫数据

1. 获取网页资源

    url = "https://www.douban.com/group/explore"
    headers = {
        "User-Agent": "Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 5.1; 360SE)"
    }
    response = requests.get(url, headers=headers)

2. xpath解析页面(from lxml import etree)

2.1 先将html文本对象转换为etree_html对象

etree_html = etree.HTML(html)

2.2 匹配所有节点

# 匹配所有节点 //*
result = etree_html.xpath('//*')

2.3 匹配所有子节点

# 匹配所有子节点a 并文本获取:text()
result = etree_html.xpath('//a/text()')
print(result)

2.4 查找元素子节点

# 查找元素子节点 /
result = etree_html.xpath('//div/p/text()')
print(result)

2.5 获取当前节点的父节点

父节点 ..  类似于cd ../,查找当前节点的父节点
result = etree_html.xpath('//span[@class="pubtime"]/../span/a/text()')

2.6 属性

单属性匹配 [@class="xxx"]
#文本匹配 text() 获取所有文本//text()
result = etree_html.xpath('//div[@class="article"]//text()')
属性多值匹配 contains(@class 'xx'),说明:当该class有多个值时,使用contains包含
result = etree_html.xpath('//div[contains(@class, "grid-16-8")]//div[@class="likes"]/text()[1]')
多属性匹配
# 多属性匹配 or, and, mod, //book | //cd, + - * div = != < > <= >=
# 按序选择 [1] [last()] [position() < 3] [last() -2] 该选择器是放在xpath内部的,如上多值匹配
result = etree_html.xpath('//span[@class="pubtime" and contains(text(), "昨天")]/text()')
print(result)
属性获取
result = etree_html.xpath('//div[@class="article"]/div/div/@class')[0]
print(result)
result = etree_html.xpath('//div[@class="bd"]/h3/a/@href')
print(result)

2.7 节点轴(了解)

//li/ancestor::*  所有祖先节点
//li/ancestor::div div这个祖先节点
//li/attribute::* attribute轴,获取li节点所有属性值
//li/child::a[@href="link1.html"]  child轴,获取直接子节点
//li/descendant::span 获取所有span类型的子孙节点
//li/following::* 选取文档中当前节点的结束标记之后的所有节点
//li/following-sibling::*     选取当前节点之后的所有同级节点,第一个不算
result = etree_html.xpath('//div[@class="channel-item"]/following-sibling::*')
print(result)
print(len(result))
result = etree_html.xpath('//div[@class="channel-item"][1]/following-sibling::*')
print(result)
print(len(result))
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

  • 一、前言 通过前面的文章,我们已经知道了如何获取网页和下载文件,但是前面我们获取的网页都是未经处理的,冗余的信息太...
    渔父歌阅读 25,632评论 1 19
  • 什么是XPath? xpath(XML Path Language)是一门在XML和HTML文档中查找信息的语言,...
    朝南而行_阅读 5,416评论 0 3
  • ···lxml用法源自 lxml python 官方文档,更多内容请直接参阅官方文档,本文对其进行翻译与整理。lx...
    小丰丰_72a2阅读 4,647评论 0 1
  • 走时 从未想过回首 可我竟摸着苍黑的夜回来了 回来了 临着缓缓东去的涡水 竟成了岸柳依依的影 多少日了 涡水的流啊...
    走不了阅读 2,593评论 0 3
  • 坏情绪也不要都说给别人听 不管怎么样 夜晚你就睡觉吧 白天你就出去散散心 阴天你就吃好喝好 雨天你就听听雨 要记得...
    刀子ABC阅读 5,069评论 0 1

友情链接更多精彩内容