打卡:1-3爬取真实的网络数据

【要爬取的数据来源】

❤在列表页爬取详细介绍的网址
❤在详细介绍爬取房源具体信息:
标题、地址、价格、第一幅图片、房主姓名、性别、头像

列表页

详情页

【成果(将其输出到TXT文件中了)】

1
2

【代码】

from bs4 import BeautifulSoup
import requests
import time

#一共13页房源信息
list_urls = ['http://bj.xiaozhu.com/search-duanzufang-p{}-0/'.format(i) for i in range(1, 14)]

#此函数用于判断房主性别
def sexual(sex):
    if sex == ['member_ico']:
        return 'male'
    elif sex == ['member_ico1']:
        return 'female'
    else:
        return 'unknown'
    
#此函数用于获取列表页的24个详情页地址,返回值为一个列表
def getList (list_url):
    respond = requests.get(list_url)
    wb_data = BeautifulSoup(respond.text, 'lxml')
    get_urls = wb_data.select('#page_list > ul > li > a')
    urls = []
    for a_url in get_urls:
        url = a_url.get('href')
        urls.append(url)
    return urls

#此函数用于获取详情页的各种信息,返回值为一个字典
def getDetail(url):
    respond = requests.get(url)
    wb_data = BeautifulSoup(respond.text, 'lxml')
    titles = wb_data.select('body > div.wrap.clearfix.con_bg > div.con_l > div.pho_info > h4 > em')
    positions = wb_data.select('body > div.wrap.clearfix.con_bg > div.con_l > div.pho_info > p > span.pr5')
    prices = wb_data.select('#pricePart > div.day_l > span')
    images = wb_data.select('#detailImageBox > div.pho_show_l > div > div:nth-of-type(2) > img')
    names = wb_data.select('#floatRightBox > div.js_box.clearfix > div.w_240 > h6 > a')
    host_images = wb_data.select('#floatRightBox > div.js_box.clearfix > div.member_pic > a > img')
    sexs = wb_data.select('#floatRightBox > div.js_box.clearfix > div.member_pic > div')

    for title, position, price, image, name, host_image, sex in zip(titles, positions, prices, images, names, host_images,
                                                                sexs):
        detail = {
            'title': title.get_text(),
            'position': position.get_text().replace('\n                                  ', ''),
            'price': price.get_text(),
            'image': image.get('src'),
            'name': name.get_text(),
            'host_image': host_image.get('src'),
            'sex': sexual(sex.get('class'))
        }
        return detail

#用于放置300个房源地址的列表
urls = []

#每获取24个房源地址,若列表小于300,则把该地址放入列表中
for list_url in list_urls:
    time.sleep(2)
    urls1 = getList (list_url)
    for urls2 in urls1:
        if len(urls) < 300:
            urls.append(urls2)

    print(len(urls))

#输出300个地址
print(urls)

#打开一个文件,续写模式
path = 'C:/Users/Administrator/DeskTop/sores.txt'
file = open(path,'a')

#计算该房源是第几个房
count = 0
#开始爬取和输出300个房源的具体信息
for url in urls:
    count = count + 1
    if count % 3 == 0:#判断进度
        print (count/3,'%')

    file.write('\n\ncount = '+ str(count) +'\n')
    time.sleep(2)
    file.write(str(getDetail(url)))

file.close()
print('down')
#结束

【debug日记~】

  • 通过select和get('class')过滤得到的性别其实是一个列表,一开始用字符串来判断总是跳到else,而且ico1那个1是数字1而不是英文字母l

  • 轮播图其实有用到js进行控制,所以没办法直接取到图片的selector,但是可以从父级地址中自己添加一个> img 来获取第一张图的地址

  • 一开始取不到头像地址还以为怎么了,换了手机端的header还是不行,结果是忘记写select(蠢到家……)

  • 借助sleep来延迟爬取时间进行保护确实很慢,要学学看新的办法才行

  • 一个比较基础的问题,write只能写入字符串,所以要把字典转换成字符串才行(强制转化还真是好方便,life is short,you need python)

  • User-Agent中间的不是下划线!

  • 找唯一特征时(这次因为每个元素都是单一的所以没怎么用到),一般用.来定位class,用[]来定位属性

  • 愉快地结束了!(一个小tips,如果按照教程总是爬不到所需要的信息,可以留意看看respond的网页内容是不是有所更改~)

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 213,558评论 6 492
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 91,002评论 3 387
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 159,036评论 0 349
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 57,024评论 1 285
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 66,144评论 6 385
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 50,255评论 1 292
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 39,295评论 3 412
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 38,068评论 0 268
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 44,478评论 1 305
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 36,789评论 2 327
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 38,965评论 1 341
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 34,649评论 4 336
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 40,267评论 3 318
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 30,982评论 0 21
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 32,223评论 1 267
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 46,800评论 2 365
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 43,847评论 2 351

推荐阅读更多精彩内容

  • 1. Java基础部分 基础部分的顺序:基本语法,类相关的语法,内部类的语法,继承相关的语法,异常的语法,线程的语...
    子非鱼_t_阅读 31,605评论 18 399
  • 转至元数据结尾创建: 董潇伟,最新修改于: 十二月 23, 2016 转至元数据起始第一章:isa和Class一....
    40c0490e5268阅读 1,692评论 0 9
  • Android 自定义View的各种姿势1 Activity的显示之ViewRootImpl详解 Activity...
    passiontim阅读 171,907评论 25 707
  • 文/晴天过后上一章 目录 “偌一见过小主。”屋外的偌一见到走出树屋的玫瑰,立即伏身行礼。 玫瑰伸手虚扶,“...
    晴天过后阅读 663评论 3 20
  • 响应者对象:在iOS中不是任何对象都能处理事件,只有继承了UIResponder的对象才能接收并处理事件,我们称之...
    风信子的梦想成真阅读 168评论 0 0