urllib2库的使用

所谓的网页抓取,就是吧url地址中指定的网络资源从网络流中读取出来,保存在本地。
其中,urlbil2库就可以实现。
urlb2是py2自带的模块,不需下载,导入即可使用。
(urllib2在py3中被改为了urllib.request)

代码1:

#coding=utf-8   
import urllib2  #引入库  

#urlopen方法是向指定的url地址发送请求,并且返回服务器响应的类文件对象
response = urllib2.urlopen('http://www.baidu.com')  

#类文件对象  支持  文件对象的操作方法,例如read()方法读取文件的全部内容,返回的是字符串。
html = response.read()

#打印字符串
print html

以上的代码返回的就是百度首页的HTML内容。
通过右键‘查看源代码’看到的内容和返回的代码是一样的。

Request

在代码1中,urlopen()的参数只有一个url地址。
但是为了完成更复杂的操作,比如增加HTTP报头,必须创建Request实例作为urlopen()的参数;而需要访问的url地址则作为Request实例的参数。
代码2:

#coding= utf-8
import urllib2

url = 'http://www.baidu.com'
#url作为Request方法的参数,构造并返回一个Request对象
request = urllib2.Request(url)

#Request对象作为urlopen方法的参数,发送给服务器并接受响应
response = urllib2.urlopen(request)

html = response.read()

print html

上述代码只是把参数url放在了Reuqest中实现而已。
注意: 新建的request实例,除了url参数之外还有设置另外两个参数:

<ul><li>1.data(默认空):和url一起提交数据(比如要post的数据)。只有POST方式的时候使用这个参数。GET方法不用。</li>
<li>2.headers(默认空):字典,包含需要发送的HTTP爆头的键值对</li></ul>

User-Agent:

urllib2默认的user-agent的头为Python-urllib/x.y(x和y是Python主版本和次版本号,例如 Python-urllib/2.7)。所以为了不被发现就需要一个新的‘身份’作为User-Agent。
添加Header信息
在HTTP Headers中添加特定的Header,来构造一个完整的HTTP请求消息。
可以通过Request.add_header()添加/修改一个特定的header,也可以用Request.get_header()来查看已有的headers。
添加一个特定的header
代码3:

import urllib2

url = "http://www.baidu.com"

#IE 9.0 的 User-Agent
header = {"User-Agent" : "Mozilla/5.0 (compatible; MSIE 9.0; Windows NT 6.1; Trident/5.0;"} 
request = urllib2.Request(url, headers = header)

#通过调用Request.add_header() 添加/修改一个特定的header
#keep-alive表示长链接
request.add_header("Connection", "keep-alive")

# 也可以通过调用Request.get_header()来查看header信息
# request.get_header(header_name="Connection")

response = urllib2.urlopen(request)

print response.code     #可以查看响应状态码
html = response.read()

print html

随机添加/修改一个user-agent:

import urllib2
import random
url = "http://www.ittop.cn"

ua_list = [
   "Mozilla/5.0 (Windows NT 6.1; ) Apple.... ",
   "Mozilla/5.0 (X11; CrOS i686 2268.111.0)... ",
   "Mozilla/5.0 (Macintosh; U; PPC Mac OS X.... ",
   "Mozilla/5.0 (Macintosh; Intel Mac OS... "
]

user_agent = random.choice(ua_list)

request = urllib2.Request(url)

#也可以通过调用Request.add_header() 添加/修改一个特定的header
request.add_header("User-Agent", user_agent)

# 第一个字母大写,后面的全部小写
request.get_header("User-agent")

response = urllib2.urlopen(request)

html = response.read()
print html
最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 218,546评论 6 507
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 93,224评论 3 395
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 164,911评论 0 354
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 58,737评论 1 294
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 67,753评论 6 392
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 51,598评论 1 305
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 40,338评论 3 418
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 39,249评论 0 276
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 45,696评论 1 314
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 37,888评论 3 336
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 40,013评论 1 348
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 35,731评论 5 346
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 41,348评论 3 330
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 31,929评论 0 22
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 33,048评论 1 270
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 48,203评论 3 370
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 44,960评论 2 355

推荐阅读更多精彩内容