用python爬取招聘信息

今天模仿完成了一个小实验,通过python脚本爬取应届生招聘网招聘信息的标题和链接(模仿自https://blog.csdn.net/yaojingdedaogao/article/details/53175458),结果大致如下:

应届生重庆

1.源代码

jupyter notebook

2.解释:

  • 第二段代码通过调用request库,使代码模仿浏览器(header)对目标网站发起访问,获取后续的网页内容content。(chrome浏览器->network->任意name->headers)
  • 第三段代码调用os库,类似linux命令生成JD文件夹
  • 第四段代码调用BeautifulSoup库,提取页面中的HTML元素,比如td、class、a、href等

3.收获:

1 浏览器获取headers,也是从同样位置得知网页编码格式
2 find_all()返回的是列表,fain返回的是搜索的结果
3 os.getcwd()获取当前工作路径,os.path.join()拼接路径
4 request.get()返回的是结构体content,print不出来,需要print(content.text)

4.TBD:

1 举一反三,换boss直聘网站试试(之前试过一次,中文会变成乱码,不知是不是和应届生的页面编码不同导致的)

乱码是因为第二段代码中的内容编码格式设置,应届生中无编码格式,因此可以转换,但是boss直聘页面有编码格式utf-8,这是再设置转为gbk就变成乱码了,因此在举一反三中删除了对内容编码格式设置的语句,文字恢复正常

举一反三 抓取boss直聘信息
举一反三 boss直聘抓取源码
最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

  • 1、通过CocoaPods安装项目名称项目信息 AFNetworking网络请求组件 FMDB本地数据库组件 SD...
    阳明AI阅读 16,317评论 3 119
  • Spring Cloud为开发人员提供了快速构建分布式系统中一些常见模式的工具(例如配置管理,服务发现,断路器,智...
    卡卡罗2017阅读 137,000评论 19 139
  • 词林正韵第十三部平声十二侵 断浦沉云树, 空山挂雨林, 一山一水俱诗音, 信手轻拈凭取任由擒。 过柳柔风醉, 敲花...
    老顽童的诗词人生阅读 831评论 2 2
  • 闺女的梦想 闺女说她有个梦想,想吃什么就吃什么,想看什么就看什么。(电视)闺女的世界里自由是...
    我想做个好辣妈阅读 278评论 0 2
  • 有些人不属于你,但遇见了也挺好! 没有什么过不去,只有再也回不去! 所有的对不起,经过时间,都会变成来不及!
    良树毛阅读 195评论 0 0

友情链接更多精彩内容