采集川大公管学院教师信息0529

一、采集前准备#

在采集之前,首先进入四川大学公共管理学院的师资队伍页面查看页面显示结构,并用开发者工具“ctrl+shift+i”工具查看其代码排列规则,确定采集字段内容。
基本思想是先在初始页面采集姓名、职称、专业、邮箱,然后通过采集的详情页面链接进入详情页,并采集其基本简历,代表性研究成果,获奖情况、科研项目、人才培养。共10个字段。
过程的操作指导来源于scrapy的官方文档以及老师同学的帮助。

二、新建scrapy项目#

首先新建一个scrapy项目,代码如下:

cd venv
scrapy startproject teachersinfo

三、编写items.py文件#

然后编写项目的items文件,在这个文件中定义将要采集的字段。按照规定格式编写之后,这里的字段将直接用于后面步骤中的采集过程,且便于数据的传递。
代码如下:

# -*- coding: utf-8 -*-

# Define here the models for your scraped items
#
# See documentation in:
# http://doc.scrapy.org/en/latest/topics/items.html

import scrapy


class TeachersinfoItem(scrapy.Item):
    # 教师名字
    name = scrapy.Field()
    # 教师职称
    title = scrapy.Field()
    # 教师院系
    major = scrapy.Field()
    # 教师邮箱
    mail = scrapy.Field()
    # 教师简介
    resume = scrapy.Field()
    # 教师简介
    achieve = scrapy.Field()
    # 教师代表性研究成果
    prize = scrapy.Field()
    # 教师获奖情况
    project = scrapy.Field()
    # 教师科研项目
    training = scrapy.Field()
    # 教师人才培养
    pass

四、编写爬虫#

在项目之下,可以看到基本结构:

teachersinfo的子集结构

在spiders之下新建一个爬虫,命名为:teachers_spider.py

import scrapy
import hashlib

from scrapy.selector import Selector
from teachersinfo.items import TeachersinfoItem


class TeachersinfoSpider(scrapy.Spider):
  name = "teachersinfo"
  start_urls = [
    'http://ggglxy.scu.edu.cn/index.php?c=article&a=type&tid=18&page_1_page=1',
  ]

  def parse(self, response):
    for info in response.xpath("//ul[@class='teachers_ul mt20 cf']/li"):
      item = TeachersinfoItem()
      item['name'] = info.xpath("div[@class='r fr']/h3/text()").extract_first()
      item['title'] = info.xpath("div[@class='r fr']/p/text()").extract_first()
      item['major'] = info.xpath("div[@class='r fr']/div[@class='desc']/p[1]/text()").extract_first().split("E-mail:")[-1]
      item['mail'] = info.xpath("div[@class='r fr']/div[@class='desc']/p[2]/text()").extract_first()
      href = info.xpath("div[@class='l fl']/a/@href").extract_first()
      yield scrapy.Request(response.urljoin(href), meta={'item': item}, callback=self.parse_more_info)

    next_page = response.xpath("//div[@class='pager cf tc pt10 pb10 mobile_dn']/li[last()-1]/a/@href").extract_first()
    last_page = response.xpath("//div[@class='pager cf tc pt10 pb10 mobile_dn']/li[last()]/a/@href").extract_first()
    if last_page:
        next_page = "http://ggglxy.scu.edu.cn/"+next_page
        yield scrapy.http.Request(next_page, callback=self.parse)

  @staticmethod
  def parse_more_info(response):
    item = response.meta['item']
    item['resume'] = response.xpath("//div[@class='desc']/text()").extract()
    item['achieve'] = "".join(response.xpath('/html/body/div[3]/div[2]/div/div[2]//text()').extract())
    item['prize'] = "".join(response.xpath('/html/body/div[3]/div[2]/div/div[3]//text()').extract())
    item['project'] = "".join(response.xpath('/html/body/div[3]/div[2]/div/div[4]//text()').extract())
    item['training'] = "".join(response.xpath('/html/body/div[3]/div[2]/div/div[5]//text()').extract())
    yield item

通过其中meta方法的传递参数,将基础页面的内容与详情页面的内容联系起来,不用重复采集两次教师的姓名以及职称。

五、执行爬虫,并保存文件#

直接用一句代码实现这两步过程,将结果保存为csv格式。

scrapy crawl teachersinfo -o infos.csv

其结果显示如下:

爬虫teachersinfo执行的结果

将infos.csv文件下载并打开,发现excel内容为乱码,于是采用记事本打开并另存,将编码方式换成ANSI,然后再用excel打开即可呈现结果。显示如下:

csv文件内容
csv文件内容

六、补充#

关于翻页###

在进行分页时,尝试使用其他方式,其中xpath的sibling是一个很好的方式。
将翻页代码更改一下:

next_page = response.xpath('/html/body/div[4]/div[2]/div[1]/div[2]/li[@class]/following-sibling::*[1]//@href').extract_first()
    if next_page is not None:
      next_page = response.urljoin(next_page)
      yield scrapy.http.Request(next_page, callback=self.parse)

保存成csv文件,用相同转编码的方式查看,可知可以得到相同的结果。

haha.csv
最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 221,695评论 6 515
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 94,569评论 3 399
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 168,130评论 0 360
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 59,648评论 1 297
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 68,655评论 6 397
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 52,268评论 1 309
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 40,835评论 3 421
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 39,740评论 0 276
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 46,286评论 1 318
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 38,375评论 3 340
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 40,505评论 1 352
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 36,185评论 5 350
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 41,873评论 3 333
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 32,357评论 0 24
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 33,466评论 1 272
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 48,921评论 3 376
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 45,515评论 2 359

推荐阅读更多精彩内容