PYTHON XML解析-SAX解析

1.SAX模块

SAX是一种基于事件驱动的API,利用SAX解析XML牵扯到两个部分,解析器和事件处理器。其中解析器负责读取XML文档,并向事件处理器发送事件;事件处理器负责做出响应,对处理的XML数据进行处理。
常用情况:
1.对大型文件进行处理
2.只需要文件的部分内容,或者只需要从文件中得到特定信息
3.想建立自己的对象模型

2.ContentHandler类常用函数介绍

2.1 startDocument( self )

文档启动的时候调用

2.2 endDocument( self )

文档解析结束后调用

2.3 startElement( self, name, attrs )

遇到XML开始标签时调用,name是标签的名字,attrs是标签的属性值字典,例如<user name='MoonMonster'>,那么便可使用attrs['name']来获取name的值。

2.4 endElement( self, name )

遇到XML结束标签时调用,name是结束标签的名称

2.5 characters( self, content )

包含在标签中的值,content就是被包含的值

3.XML示例

<?xml version="1.0"?>
<collection shelf="New Arrivals">
    <movie title="Enemy Behind">
        <type>War, Thriller</type>
        <format>DVD</format>
        <year>2003</year>
        <rating>PG</rating>
        <stars>10</stars>
        <description>Talk about a US-Japan war</description>
    </movie>
    <movie title="Transformers">
        <type>Anime, Science Fiction</type>
        <format>DVD</format>
        <year>1989</year>
        <rating>R</rating>
        <stars>8</stars>
        <description>A schientific fiction</description>
    </movie>
</collection>

4.实例

如果只是需要从文档中把所有的数据都读取出来,那么直接从character()函数中保存content数据即可,然后在endElement()函数中存储。需要注意的是,这种写法需要将没有直接内容的标签排除掉,例如movie标签,不然会出现没有数据的标签出现数据的情况。还有一点需要注意,如果标签中的数据换行了,会带来很多意料之外的情况,像下面这种。

<movie title="Enemy Behind">
    <stars>
        10
    </stars>
    <description>Talk about a US-Japan war</description>
</movie>

from xml import sax


class MovieHandler(sax.ContentHandler):
    def __init__(self):
        super().__init__()
        self.content = None
        self.item = {}
        self.items = []

    def startDocument(self):
        print('XML文档解析开始...')

    def startElement(self, name, attrs):
        if name == 'movie':
            title = attrs['title']
            self.item.update(title=title)

    def characters(self, content):
        self.content = content

    def endElement(self, name):
        if name == 'movie':
            self.items.append(self.item)
            self.item = {}
        else:
            self.item.update({name: self.content})

    def endDocument(self):
        for item in self.items:
            print(item)
            print('*' * 80)
        print('XML文档解析结束...')


if __name__ == '__main__':
    handler = MovieHandler()
    parser = sax.make_parser()
    parser.setContentHandler(handler)
    parser.parse('sax.xml')

或者参照网上其他人的写法:
在这个例子中,使用了self.CurrentData来保存当前标签,但有一个坑的地方是,在endElement函数中,无法获取到像movie这种标签的结束标签。

from xml import sax


class MovieHandler(sax.ContentHandler):
    def __init__(self):
        super().__init__()
        # 初始化数据,并增加一个当前数据
        self.CurrentData = ""
        self.type = ""
        self.format = ""
        self.year = ""
        self.rating = ""
        self.stars = ""
        self.description = ""

    # 文档启动的时候调用
    def startDocument(self):
        print('XML开始解析中...')

    # 元素开始事件处理
    def startElement(self, name, attrs):
        self.CurrentData = name
        if self.CurrentData == 'movie':
            print('*********movie*********')
            title = attrs['title']
            print('Title:{0}'.format(title))

    # 内容事件处理
    def characters(self, content):
        if self.CurrentData == "type":
            self.type = content
        elif self.CurrentData == "format":
            self.format = content
        elif self.CurrentData == "year":
            self.year = content
        elif self.CurrentData == "rating":
            self.rating = content
        elif self.CurrentData == "stars":
            self.stars = content
        elif self.CurrentData == "description":
            self.description = content

    # 元素结束事件处理
    def endElement(self, name):
        if self.CurrentData == 'type':
            print('Type:{0}'.format(self.type))
        elif self.CurrentData == 'format':
            print('Format:{0}'.format(self.format))
        elif self.CurrentData == 'year':
            print('Year:{0}'.format(self.year))
        elif self.CurrentData == 'rating':
            print('Rating:{0}'.format(self.rating))
        elif self.CurrentData == 'stars':
            print('Stars:{0}'.format(self.stars))
        elif self.CurrentData == 'description':
            print('Description:{0}'.format(self.description))
        self.CurrentData = ""

    # 文档结束的时候调用
    def endDocument(self):
        print('XML文档解析结束!')


if __name__ == '__main__':
    handler = MovieHandler()
    parser = sax.make_parser()
    # parser.setFeature(sax.handler.feature_namespaces, 0)
    parser.setContentHandler(handler)
    parser.parse("sax.xml")

5.参考

https://blog.csdn.net/qq_38377523/article/details/78350548
https://www.cnblogs.com/chenadong/p/9117156.html
https://www.cnblogs.com/miniren/p/5091744.html
最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 214,658评论 6 496
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 91,482评论 3 389
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 160,213评论 0 350
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 57,395评论 1 288
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 66,487评论 6 386
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 50,523评论 1 293
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 39,525评论 3 414
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 38,300评论 0 270
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 44,753评论 1 307
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 37,048评论 2 330
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 39,223评论 1 343
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 34,905评论 5 338
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 40,541评论 3 322
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 31,168评论 0 21
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 32,417评论 1 268
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 47,094评论 2 365
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 44,088评论 2 352

推荐阅读更多精彩内容