爬取unsplash图片

作为今天的一个小练习,爬取了这个网站的一些图片,这个网站的图片都是动态加载(往下拉,又会加载出图片),没有用requests爬过动态的网站,因为我一直找不出他们的规律,这个网站也是在试了很久之后,network抓包,发现在XHR里边发现了一个情况,就是下拉的时候,每到一个地方会触发一个请求,

通过观察,大概可以总结出来一个规律,请求的url中变化的就是page部分,猜测应该是从0开始变化的,per_page通过观察是用来控制一次返回的是多少张图片的,一次12张。看每个url给我们返回的东西,是一个json格式的。
这时可以发现,下载的url也就是中间红框的那个地方是变化的,也就是图片的id。那么想要下载图片,就得得到图片的id,有了这个思路,就可继续分析,刚在也发现了,加载图片页面的url:https://unsplash.com/napi/photospage=3&per_page=12&order_by=latest每次触发,变化的只是page=后边的数字,那么就可以通过for循环构造下拉到底时触发的请求的url来获取图片的id。我是这么构造的:

urls = []
    for i in range(10):
        url = 'https://unsplash.com/napi/photos?page='+str(i)+'&per_page=12&order_by=latest'#构造url动态的
        urls.append(url)

我把它放在了一个列表里边,然后我再遍历url列表发起请求,得到json文件,然后通json.loads将json文件转为字典去取得图片的id。

ids = []
def getHtml(url):
    headers = {
        'User-Agent': 'Mozilla/5.0'
    }
    try:
        r = requests.get(url,headers =headers) # , verify=False
        r.raise_for_status()
        r.encoding = 'utf-8'
        return r.text
    except:
        print('爬取失败')
        return ''

def getId(html):  #获取图片的id
    jd = json.loads(html) #转为字典
    for j in jd:
        ids.append(j['id'])  #得到图片的id并放入到列表里边
def main():
   for url in urls:
        html = getHtml(url)
        getId(html)

在取到图片的id之后,就可以通过id去构造获得图片的url:https://unsplash.com/photos/-iFhGZP_mhk/download
photos/这部分是id/download,那就可以构造出图片的url了

    img_urls = []
    for id in ids:
        ul = 'https://unsplash.com/photos/'+id+'/download' #构造下载图片的url
        img_urls.append(ul)

构造的部分url
['https://unsplash.com/photos/DaQmfmkA20w/download ', 'https://unsplash.com/photos/_SBsVi4kmkY/download ', 'https://unsplash.com/photos/4uYv2fEZ5PU/download ', 'https://unsplash.com/photos/4JnHWc2tuFE/download ' ]
然后就可以通过构造的url去发起请求下载图片了,最后保存到imges文件夹下。

可能是由于网速的限制,太慢了,只保存了几张。

完整代码:
import requests
import json

ids = [] #设置成全局是因为我想存我取到的所有id
i = 0
def getHtml(url):
    headers = {
        'User-Agent': 'Mozilla/5.0'
    }
    try:
        r = requests.get(url,headers =headers) # , verify=False
        r.raise_for_status()
        r.encoding = 'utf-8'
        return r.text
    except:
        print('爬取失败')
        return ''

def getId(html):
    jd = json.loads(html)
    for j in jd:
        ids.append(j['id'])

def getImg(url):
    global i
    for u in url:
        r = requests.get(u)#,verify=False,stream=True
        f = open('imges/'+ids[i]+'.jpg','ab')
        f.write(r.content)
        print('保存第{}张图片成功'.format(i+1))
        i += 1
    print('全部图片保存完成,共{}张图片'.format(i+1))

def main():
    urls = []
    img_urls = []
    for i in range(10):
        url = 'https://unsplash.com/napi/photos?page='+str(i)+'&per_page=12&order_by=latest'#构造url动态的
        urls.append(url)
    for url in urls:
        html = getHtml(url)
        getId(html)
    for id in ids:
        ul = 'https://unsplash.com/photos/'+id+'/download' #构造下载图片的url
        img_urls.append(ul)
    print(img_urls)
    getImg(img_urls)
main()
问题:

1、下载的速度太慢,不知道为什么。
2、保存的图片有下载失败的,可能是受网速的影响,直接在浏览器访问也特别慢

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 217,542评论 6 504
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 92,822评论 3 394
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 163,912评论 0 354
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 58,449评论 1 293
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 67,500评论 6 392
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 51,370评论 1 302
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 40,193评论 3 418
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 39,074评论 0 276
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 45,505评论 1 314
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 37,722评论 3 335
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 39,841评论 1 348
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 35,569评论 5 345
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 41,168评论 3 328
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 31,783评论 0 22
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 32,918评论 1 269
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 47,962评论 2 370
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 44,781评论 2 354

推荐阅读更多精彩内容

  • APP定位 ​ 图片壁纸 采用Splash网站,提供的后台支持,开发的第三方图片壁纸客户端。 API 说明 地...
    人失格阅读 3,613评论 0 1
  • 声明:本文讲解的实战内容,均仅用于学习交流,请勿用于任何商业用途! 一、前言 强烈建议:请在电脑的陪同下,阅读本文...
    Bruce_Szh阅读 12,704评论 6 28
  • Spring Cloud为开发人员提供了快速构建分布式系统中一些常见模式的工具(例如配置管理,服务发现,断路器,智...
    卡卡罗2017阅读 134,656评论 18 139
  • 人生在世,就是要聪明地活,优雅地笑看人生。读书使人明智,使人优雅。聪明的人活得惬意,傻笨的人总是在困境里面撞得头破...
    淘气2016阅读 11,444评论 1 1
  • 说明:由于最新的2.0版本与下面的1.0版本图文有很大的不同,所以请注意有些地方的变化,不过其实功能都大同小异! ...
    小游123阅读 951评论 0 0