基于 Jsoup的海投网爬虫

package com.zzz.jsouplib;

import org.jsoup.Jsoup;
import org.jsoup.nodes.Document;
import org.jsoup.nodes.Element;
import org.jsoup.select.Elements;
import java.io.IOException;
import java.util.ArrayList;
import java.util.List;
import java.util.function.Consumer;

public class JsoupTest {
    public static void main(String[] args) {
        List<CompanyJobModel> companyJobModelList = new ArrayList<>();
        //一次性扒20页的数据
        for (int pageNum = 1; pageNum <= 20; pageNum++) {
            try {
                Document doc = Jsoup.connect("https://xyzp.haitou.cc/page-" + pageNum)
                        .data("query", "Java")
                        .userAgent("Mozilla")
                        .get();
                Element bodyElement = doc.getElementsByTag("body").get(0);
                Element scopeElement = bodyElement.getElementsByTag("div").get(0);
                Element pageWrapper = scopeElement.getElementById("page-wrapper");
                Element pageMain = pageWrapper.getElementsByClass("page-main").get(0);
                Element pagePanel = pageMain.getElementsByClass("panel panel-default").get(0);
                Element pagePanel2 = pagePanel.getElementsByClass("panel-body remove padding top bottom").get(0);
                Element gridView = pagePanel2.getElementById("w0");
                Element table = gridView.getElementsByClass("table cxxt-table").get(0);
                Element tbody = table.getElementsByTag("tbody").get(0);
                Elements datas = tbody.getElementsByTag("tr");

                for (Element element : datas
                ) {
                    //该公司的data-key
                    String dataKey = element.attr("data-key");
                    String title = element
                            .getElementsByClass("cxxt-title").get(0)
                            .getElementsByTag("a").get(0)
                            .getElementsByTag("div").get(0)
                            .text();
                    //发布时间
                    String time = element.getElementsByClass("cxxt-time").text();
                    String detailUrl = "https://xyzp.haitou.cc/article/" + dataKey + ".html";

                    //职位列表
                    final List<String> careerList = new ArrayList<>();

                    //职位的a标签的列表
                    Elements careerTagList = element.getElementsByClass("text-ellipsis cxxt-position")
                            .get(0)
                            .getElementsByTag("a");

                    //遍历职位的a标签的列表
                    careerTagList.forEach(new Consumer<Element>() {
                        @Override
                        public void accept(Element element) {
                            String career = element.getElementsByTag("span").get(0).text();
                            careerList.add(career);
                        }
                    });

                    //涉及城市列表
                    final List<String> cityList = new ArrayList<>();
                    //涉及城市的span标签的列表
                    Element citySpanTag = element.getElementsByClass("text-ellipsis")
                            .get(1)
                            .getElementsByTag("span")
                            .get(0);
                    if (citySpanTag.text().equals("不限")) {//当城市的span tag值为不限
                        cityList.add("不限");
                    } else {
                        //城市的span tag 没有值 继续遍历它的子tag
                        //涉及城市的a标签的列表
                        Elements citySpanElements = citySpanTag.getElementsByTag("span");
                        for (int i = 1; i <= citySpanElements.size() - 1; i++) {
                            //排除掉第一项 只要子tag
                            String city = citySpanElements.get(i).text();
                            cityList.add(city);
                        }
                    }

                    //将扒取的信息构建成model
                    CompanyJobModel companyJobModel = new CompanyJobModel(
                            dataKey,
                            title,
                            time,
                            detailUrl,
                            careerList,
                            cityList
                    );
                    //将model添加到扒取列表
                    companyJobModelList.add(companyJobModel);
                }
            } catch (IOException e) {
                e.printStackTrace();
            }
        }
        //查看扒到的所有信息
        System.out.print("list" + companyJobModelList);
    }
}



public class CompanyJobModel {
    private String dataKey;
    private String title;
    private String time;
    private String detailUrl;
    private List<String> careerList;
    private List<String> cityList;

    public CompanyJobModel(
            String dataKey,
            String title,
            String time,
            String detailUrl,
            List<String> careerList,
            List<String> cityList
    ) {
        this.dataKey = dataKey;
        this.title = title;
        this.time = time;
        this.detailUrl = detailUrl;
        this.careerList = careerList;
        this.cityList = cityList;
    }

    @Override
    public String toString() {
        return "dataKey: " + dataKey + "\n" +
                "title: " + title + "\n" +
                "time: " + time + "\n" +
                "detailUrl: " + detailUrl + "\n" +
                "careerList: " + careerList + "\n" +
                "cityList: " + cityList + "\n";
    }
}

项目地址 https://github.com/ZYF99/HaitouApp

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 220,192评论 6 511
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 93,858评论 3 396
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 166,517评论 0 357
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 59,148评论 1 295
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 68,162评论 6 397
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 51,905评论 1 308
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 40,537评论 3 420
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 39,439评论 0 276
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 45,956评论 1 319
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 38,083评论 3 340
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 40,218评论 1 352
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 35,899评论 5 347
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 41,565评论 3 331
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 32,093评论 0 23
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 33,201评论 1 272
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 48,539评论 3 375
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 45,215评论 2 358