Python爬虫之美女图片分类

对爬取到的图片进行分类命名,下面开始了。

一、首先给出URL地址www.wmpic.me/touxiang/nvsheng


唯美图片

二、下载图片,进行分析,并保存图片至本地,直接上代码

import requests

from bs4 import BeautifulSoup

import random

user_agent = [

        'Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 6.1; WOW64; Trident/5.0; SLCC2; .NET CLR 2.0.50727; .NET CLR 3.5.30729; .NET               CLR 3.0.30729; Media Center PC 6.0; .NET4.0C; .NET4.0E)',

        'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.11 (KHTML, like Gecko) Chrome/23.0.1271.64 Safari/537.11',

]

Yes_or_Not = ['y','n']

def download(url,folder,count=0):    #下载图片

    headers = {'User-Agent':random.choice(user_agent)}

    content = requests.get(url,headers=headers).content

    typ = random.choice(Yes_or_Not)  #机器随机选择是Y还是N

    path = folder + "\\" + typ + '_'+str(count)+'.jpg'  #图片格式

    with open(path,'wb') as f:

        f.write(content)  #写入并保存图片至本地文件

base_url = 'http://www.wmpic.me/touxiang/nvsheng/page/'

count = 1

for i in range(1,10):

    url = base_url + str(i)    #url地址

    headers = {'User_Agent':random.choice(user_agent)}

    html = requests.get(url,headers=headers).text

    soup = BeautifulSoup(html,'lxml')  #通过BeautifulSoup的lxml方法解析html

    for item in soup.select('li img'):  #解析定位到li img

        picture_url = item['src']

        if picture_url.find('215x185') != -1:  #215x185图片的宽度和高度

              if count <= 300:

                   download(picture_url,'train_pictures',count)    #保存图片至train_pictures文件夹下

                   print(picture_url)

                   count += 1

              else:

                    download(picture_url,'test_pictures',count)    #保存图片至test_pictures文件夹下

                    print(picture_url)

                   count += 1

三、运行结果


图片URL


存放图片的本地文件夹
下载至本地分类好的图片

详细请参考(七)美女分类器

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

推荐阅读更多精彩内容

  • Spring Cloud为开发人员提供了快速构建分布式系统中一些常见模式的工具(例如配置管理,服务发现,断路器,智...
    卡卡罗2017阅读 135,083评论 19 139
  • 前言根据scrapy官方文档:http://doc.scrapy.org/en/master/topics/pra...
    三两五阅读 1,366评论 3 4
  • #encoding=utf8 frombs4importBeautifulSoup importrequests ...
    简书用户9527阅读 401评论 1 0
  • 一. 声明周期钩子函数 每个 Vue 实例在被创建之前都要经过一系列的初始化过程。例如需要设置数据监听、编译模板、...
    竹溪穆褕阅读 236评论 0 0
  • 班班,剽悍女子一名,近日自填词一首:“吹呀吹呀,我小灶二班骄傲放纵的风~吹呀吹呀,吹到我家大院儿~” 突然冒出想法...
    程影阅读 383评论 7 8