PyQuery解析器

前言 Python关于爬虫的库挺多的,也各有所长。了解前端的也都知道, jQuery 能够通过选择器精确定位 DOM 树中的目标并进行操作,所以我想如果能用 jQuery 去爬网页那就 cool 了。 Python 有没有与 DOM 相关的库什么的?—— PyQuery

PyQuery简介

pyquery相当于jQuery的python实现,可以用于解析HTML网页等。它的语法与jQuery几乎完全相同,对于使用过jQuery的人来说很熟悉,也很好上手。 引用作者的原话就是:

“The API is as much as possible the similar to jquery.” 。

安装

pip3 install pyquery

  • pyquery 依赖于 lxml ,要先安装 lxml ,否则会提示失败。

pip3 install lxml

初始化 有 4 种方法可以进行初始化: 可以通过传入 字符串、lxml、文件 或者 url 来使用PyQuery。

from pyquery import PyQuery as pq
from lxml import etree

d = pq("<html></html>")#传入字符串
d = pq(etree.fromstring("<html></html>"))#传入lxml
d = pq(url='http://google.com/') #传入url
d = pq(filename=path_to_html_file) #传入文件
现在,d 就像 jQuery 中的 $ 一样了。

示例 通过一个简单的例子快速熟悉 pyquery 的用法,传入文件 example.html,内容如下:

<div>
<tr class="item-0">
<td>first section</td>
<td>1111</td>
<td>17-01-28 22:51</td>
</tr>
<tr class="item-1">
<td>second section</td>
<td>2222</td>
<td>17-01-28 22:53</td>
</tr>
</div>

python代码:

image.png

1、.html()和.text() 获取相应的 HTML 块或者文本内容,

p=pq("<head><title>Hello World!</title></head>")

print (p('head').html())# 获取相应的 HTML 块
print (p('head').text())# 获取相应的文本内容

'''输出:
<title>hello Word</title>
Hello World!
'''

2、.('selector'):通过选择器来获取目标内容,

d = pq("<div><p id='item-0'>test 1</p><p class='item-1'>test 2</p></div>")

print (d('div').html())# 获取 <div> 元素内的 HTML 块
print (d('#item-0').text())# 获取 id 为 item-0 的元素内的文本内容
print (d('.item-1').text())# 获取 class 为 item-1 的元素的文本内容

'''输出:
<p id="item-0">test 1</p><p class="item-1">test 2</p>
test 1
test 2
'''

3、.eq(index):根据索引号获取指定元素(index 从 0 开始),

d = pq("<div><p id='item-0'>test 1</p><p class='item-1'>test 2</p></div>")

print (d('p').eq(1).text())# 获取第二个 p 元素的文本内容,

'''输出
test 2
'''

4、.find():查找嵌套元素,

d = pq("<div><p id='item-0'>test 1</p><p class='item-1'>test 2</p></div>")

print d('div').find('p') # 查找 <div> 内的 p 元素
print d('div').find('p').eq(0) # 查找 <div> 内的 p 元素,输出第一个 p 元素

'''输出:
<p id="item-0">test 1</p><p class="item-1">test 2</p>
<p id="item-0">test 1</p>
'''

5、.filter():根据 class、id 筛选指定元素,

d = pq("<div><p id='item-0'>test 1</p><p class='item-1'>test 2</p></div>")

print d('p').filter('.item-1') # 查找 class 为 item-1 的 p 元素
print d('p').filter('#item-0') # 查找 id 为 item-0 的 p 元素

'''输出:
<p class="item-1">test 2</p>
<p id="item-0">test 1</p>
'''

6、.attr():获取、修改属性值,

d = pq("<div><p id='item-0'>test 1</p><a class='item-1'>test 2</p></div>")

print d('p').attr('id') # 获取 <p> 标签的属性 id
print d('a').attr('class','new')# 修改 <a> 标签的 class 属性为 new

'''输出:
item-0
<a class="new">test 2</a>
'''

7、其他操作:

.addClass(value):添加 class;
.hasClass(name):判断是否包含指定的 class,返回 True 或 False;
.children():获取子元素;
.parents():获取父元素;
.next():获取下一个元素;
.nextAll():获取后面全部元素块;
.not_('.selector'):获取所有不匹配该选择器的元素;
for i in d.items('li'):
    print i.text():遍历 d 中的 li 元素
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 211,948评论 6 492
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 90,371评论 3 385
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 157,490评论 0 348
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 56,521评论 1 284
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 65,627评论 6 386
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 49,842评论 1 290
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 38,997评论 3 408
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 37,741评论 0 268
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 44,203评论 1 303
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 36,534评论 2 327
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 38,673评论 1 341
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 34,339评论 4 330
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 39,955评论 3 313
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 30,770评论 0 21
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 32,000评论 1 266
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 46,394评论 2 360
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 43,562评论 2 349

推荐阅读更多精彩内容

  • 通过jQuery,您可以选取(查询,query)HTML元素,并对它们执行“操作”(actions)。 jQuer...
    枇杷树8824阅读 652评论 0 3
  • 一、样式篇 第1章 初识jQuery (1)环境搭建 进入官方网站获取最新的版本 http://jquery.co...
    凛0_0阅读 3,358评论 0 44
  • # Python 资源大全中文版 我想很多程序员应该记得 GitHub 上有一个 Awesome - XXX 系列...
    小迈克阅读 2,965评论 1 3
  • 她问我借钱 他向我展示 昂贵的项链 与 圣诞的德国 我在梦里 吃着歌星买的 冰激凌吐司 想象着萧索陶寂的氛围 与一...
    mrboshen阅读 148评论 0 0
  • 目录上一篇:【第一章:新的阁主(第二卷:彼岸花未开)】 【第二章:有新家了·第二卷:彼岸花未开】 命运之神离开理书...
    钱多欢阅读 239评论 0 0