BeautifulSoup库-标签解析遍历

本文主要内容：BeautifulSoup库的介绍，基本元素，标签树的遍历

安装：pip install BeautifulSoup4

<html>

<body>标签树</body>

...

</html>

BeautifulSoup库是解析、遍历、维护“标签树”的功能库

<p> ...</p> : 标签 Tag

p 名称 Name 成对出现 ; class = "title"属性 Attribute 0个或多个

Beautiful Soup库也叫beautifulsoup4库或bs4库，主要是用BeautifulSoup类

约定引用方式如下：

from bs4 import BeautifulSoup

import bs4

BeautifulSoup类对应了一个HTML/XML文档的全部内容

from bs4 import BeautifulSoup

soup = BeautifulSoup("<html>...</html>","html.parse")

soup = BeautifulSoup(opem("filepath"),"html.parser")

# html.parser为解析器

BeautifulSoup库的解析器

解析器使用方法条件

bs4的解析器 BeautifulSoup(mk,"html.parser") pip install BeautifulSoup4

lxml的HTML解析器 BeautifulSoup(mk,"lxml") pip install lxml

lxml的XML解析器 BeautifulSoup(mk,"lxml") pip install lxml

htmllib5解析器 BeautifulSoup(mk,"htmllib5") pip install html5lib

BeautifulSoup类的基本元素：

Tag标签，最基本的信息组织单元，分别用<>..</>标明开头和结尾

Name标签的名字，<p>..</p>的名字是p，格式：<tag>.name

Attributes标签的属性，class、id等，字典形式组织，格式：<tag>.attrs

NavigableString标签内的非属性字符串，<>..</>中的字符串

Comment标签内字符串的注释部分，一种特殊的Comment类型

示例：

<html>

<head>

<title>403 Forbidden</title>

</head>

<body bgcolor="white">

<h1>403 Forbidden</h1>

<p>

You don't have permission to access the URL on this server. Sorry for the inconvenience.

</p>

<p>

Please report this message and include the following information to us.

Thank you very much!

</p>

<table>

<tr>

<td> URL: </td>

<td> https://www.jianshu.com/ </td>

</tr>

<tr>

<td> Server: </td>

<td> zurich </td>

</tr>

<tr>

<td> Date: </td>

<td> 2019/12/24 11:49:40 </td>

</tr>

</table>

</body>

</html>

将请求返回的html代码用BeautifulSoup库来解析

import requests

from bs4 import BeautifulSoup

r = requests.get('https://www.jianshu.com')

r.encoding ='utf-8' #防止中文乱码

soup = BeautifulSoup(r.text,'html.parser')

print(soup.prettify()) #标签格式化换行输出

Tag标签解析：

任何存在与HTML中的标签都可以使用soup.<tag>来访问获得，当html文档中同事存在多个<tag>标签时，返回第一个

soup.p

输出：<p>You don't have permission to access the URL on this server. Sorry for the inconvenience.<br/>

Please report this message and include the following information to us.<br/>

Thank you very much!</p>

Tag的标签名称解析：

每一个<tag>标签都有自己的名字，通过<tag>.name获取，字符串类型

soup.p.name

输出：'p'

标签的属性attrs解析：

一个标签可以有0个或多个标签属性，他们是字典类型

soup.body.attrs

输出：{'bgcolor': 'white'}

soup.body.attrs['bgcolor']

输出：'white'

Tag的NavigableString解析：

标签内的非属性字符串获取，可以跨越多个层级

soup.title.string

输出：'403 Forbidden'

Tag的Comment解析：

解析标签内的字符串的注释部分

html的内容遍历：

HTML是以标签树的形式来组织信息，标签书遍历一般有下行遍历，上行遍历和平行遍历

下行遍历：从当前节点往下遍历

.contents：子节点的列表，将所有儿子节点存入列表中（只能获取下一级儿子节点）

.children：子节点的迭代类型，与.contents类似，用于循环遍历儿子节点

.descendants：子孙节点的迭代类型，包含所有子孙结点，用于循环遍历（可以获取所有子节点）

用这三种方法来解析一下table中的内容：

a = soup.table.children

for child in a:

if isinstance(child,bs4.element.Tag): #排除非标签元素干扰

for i in child.children:

if isinstance(i,bs4.element.Tag):

print(i.string)

#contents属性与children类似

a = soup.table.descendants

for child in a:

if isinstance(child,str) and child !='\n':

print(child)

输出：

上行遍历：从当前节点向上遍历

.parent：节点的父亲标签

.parents：节点先辈标签的迭代类型，用于循环遍历先辈节点

#打印td的父级标签名称
for i in soup.td.parents:

if i.parent is None:

break

else:

print(i.parent.name)

输出：table

body

html

[document]

平行遍历：获取当前节点的平级前、后一个或多个节点。

.next_sibling：返回按照HTML文本顺序的下一个平行节点标签

.previos_sibling：返回按照HTML文本顺序的上一个平行节点标签

.next_siblings：迭代类型，返回按照HTML文本顺序的后续所有平行节点标签

.previous_siblings：迭代类型，返回按照HTML文本顺序的前续所有平行节点标签

最后编辑于：2020.12.15 17:15:35

人面猴
序言：七十年代末，一起剥皮案震惊了整个滨河市，随后出现的几起案子，更是在滨河造成了极大的恐慌，老刑警刘岩，带你破解...
沈念sama阅读 204,590评论 6赞 478
死咒
序言：滨河连续发生了三起死亡事件，死亡现场离奇诡异，居然都是意外死亡，警方通过查阅死者的电脑和手机，发现死者居然都...
沈念sama阅读 86,808评论 2赞 381
救了他两次的神仙让他今天三更去死
文/潘晓璐我一进店门，熙熙楼的掌柜王于贵愁眉苦脸地迎上来，“玉大人，你说我怎么就摊上这事。” “怎么了？”我有些...
开封第一讲书人阅读 151,151评论 0赞 337
道士缉凶录：失踪的卖姜人
文/不坏的土叔我叫张陵，是天一观的道长。经常有香客问我，道长，这世上最难降的妖魔是什么？我笑而不...
开封第一讲书人阅读 54,779评论 1赞 277
港岛之恋（遗憾婚礼）
正文为了忘掉前任，我火速办了婚礼，结果婚礼上，老公的妹妹穿的比我还像新娘。我一直安慰自己，他们只是感情好，可当我...
茶点故事阅读 63,773评论 5赞 367
恶毒庶女顶嫁案：这布局不是一般人想出来的
文/花漫我一把揭开白布。她就那样静静地躺着，像睡着了一般。火红的嫁衣衬着肌肤如雪。梳的纹丝不乱的头发上，一...
开封第一讲书人阅读 48,656评论 1赞 281
城市分裂传说
那天，我揣着相机与录音，去河边找鬼。笑死，一个胖子当着我的面吹牛，可吹牛的内容都是我干的。我是一名探鬼主播，决...
沈念sama阅读 38,022评论 3赞 398
双鸳鸯连环套：你想象不到人心有多黑
文/苍兰香墨我猛地睁开眼，长吁一口气：“原来是场噩梦啊……” “哼！你这毒妇竟也来了？” 一声冷哼从身侧响起，我...
开封第一讲书人阅读 36,678评论 0赞 258
万荣杀人案实录
序言：老挝万荣一对情侣失踪，失踪者是张志新（化名）和其女友刘颖，没想到半个月后，有当地人在树林里发现了一具尸体，经...
沈念sama阅读 41,038评论 1赞 299
护林员之死
正文独居荒郊野岭守林人离奇死亡，尸身上长有42处带血的脓包…… 初始之章·张勋以下内容为张勋视角年9月15日...
茶点故事阅读 35,659评论 2赞 321
白月光启示录
正文我和宋清朗相恋三年，在试婚纱的时候发现自己被绿了。大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
茶点故事阅读 37,756评论 1赞 330
活死人
序言：一个原本活蹦乱跳的男人离奇死亡，死状恐怖，灵堂内的尸体忽然破棺而出，到底是诈尸还是另有隐情，我是刑警宁泽，带...
沈念sama阅读 33,411评论 4赞 321
日本核电站爆炸内幕
正文年R本政府宣布，位于F岛的核电站，受9级特大地震影响，放射性物质发生泄漏。R本人自食恶果不足惜，却给世界环境...
茶点故事阅读 39,005评论 3赞 307
男人毒药：我在死后第九天来索命
文/蒙蒙一、第九天我趴在偏房一处隐蔽的房顶上张望。院中可真热闹，春花似锦、人声如沸。这庄子的主人今日做“春日...
开封第一讲书人阅读 29,973评论 0赞 19
一桩弑父案，背后竟有这般阴谋
文/苍兰香墨我抬头看了看天上的太阳。三九已至，却和暖如春，着一层夹袄步出监牢的瞬间，已是汗流浃背。一阵脚步声响...
开封第一讲书人阅读 31,203评论 1赞 260
情欲美人皮
我被黑心中介骗来泰国打工，没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留，地道东北人。一个月前我还...
沈念sama阅读 45,053评论 2赞 350
代替公主和亲
正文我出身青楼，却偏偏与公主长得像，于是被迫代替她去往敌国和亲。传闻我的和亲对象是个残疾皇子，可洞房花烛夜当晚...
茶点故事阅读 42,495评论 2赞 343

BeautifulSoup库-标签解析遍历

推荐阅读更多精彩内容