登录注册写文章

python：判断网页的编码方式

随风化作雨

python：判断网页的编码方式

在学习Python爬取网页的时候，我们经常会遇到编码方式的困扰，为了解决这个编码方式的问题，首先是要获取网页的编码方式，下面就获取网页的编码方式重点说一下三种方法。

一，使用urllib模块的getparam方法

>import urllib
>fopen1 = urllib.urlopen('http://www.baidu.com').info()
>print fopen1.getparam('charset')# baidu

二，使用chardet模块

>import chardet 
>import urllib
>#先获取网页内容
>data1 = urllib.urlopen('http://www.baidu.com').read()
>#用chardet进行内容分析
>chardit1 = chardet.detect(data1)
>print chardit1['encoding'] # baidu

三，利用BeautifulSoup模块方法

>from bs4 import BeautifulSoup
>import urllib2
>content=urllib2.urlopen(url)#这里url是你需要获取的网页
>soup=BeautifulSoup(content)
>print soup.original_encoding #这里的输出就是网页的编码方式

最后编辑于：2017.12.08 00:31:29

©著作权归作者所有,转载或内容合作请联系作者
平台声明：文章内容（如有图片或视频亦包括在内）由作者上传并发布，文章内容仅代表作者本人观点，简书系信息发布平台，仅提供信息存储服务。

推荐阅读更多精彩内容

【变量】python中的字符集和编码
字符集和编码简介在编程中常常可以见到各种字符集和编码，包括ASCII,MBCS,Unicode等字符集。确切的说...
兰山小亭阅读 12,795评论 0赞 13
python多版本控制
可以看我的博客 lmwen.top 或者订阅我的公众号简介有稍微接触python的人就会知道，python中...
ayuLiao阅读 8,429评论 1赞 5
Python 资源大全中文版
GitHub 上有一个 Awesome - XXX 系列的资源整理,资源非常丰富，涉及面非常广。awesome-p...
若与阅读 18,927评论 4赞 418
Python--Flask Django等常用库总结
# Python 资源大全中文版我想很多程序员应该记得 GitHub 上有一个 Awesome - XXX 系列...
aimaile阅读 26,658评论 6赞 427
第三周：红演圈、创意周末（产品分析）
作者：王豆豆Lighthouse写于：2016.3.20 网站：红演圈领域：文化娱乐体育、其他文娱服务简介：红...
一只王聪明阅读 4,021评论 1赞 1

2赞3赞

赞赏

手机看全文