用Python脚本自动爬取Bilibili小视频,你学会了吗?

B站在小视频功能处提供了 API 接口,今天的任务爬取Bilibili视频~

B 站视频网址:https://vc.bilibili.com/p/eden/rank#/?tab=全部

image.png

此次爬取视频,我们爬取前100个~

我们做好前期准备~

1:Chrome 浏览器 (能使用开发者模式的浏览器都行)
2:Vim (编辑器任选,老实人比较喜欢Vim界面,所以才用这个啦)
3:Python3 开发环境
4:Kali Linux (其实随便一个操作系统都行啦)
5:API 寻找 && 提取

我们通过 F12 打开开发者模式,然后在 Networking -> Name 字段下找到这个链接:

http://api.vc.bilibili.com/board/v1/ranking/top?page_size=10&next_offset=&tag=%E4%BB%8A%E6%97%A5%E7%83%AD%E9%97%A8&platform=pc

我们查看一下 Headers 属性
image.png

我们可以看到Request URL这个属性值,我们向下滑动加载视频的过程中,发现只有这段url是不变的。

http://api.vc.bilibili.com/board/v1/ranking/top?

next_offset 会一直变化,我们可以猜测,这个可能就是获取下一个视频序号,我们只需要把这部分参数取出来,把 next_offset 写成变量值,用 JSON 的格式返回到目标网页即可。
image.png

代码实现

我们通过上面的尝试写了段代码,发现 B 站在一定程度上做了反爬虫操作,所以我们需要先获取 headers 信息,否则下载下来的视频是空的,然后定义 params 参数存储 JSON 数据,然后通过 requests.get 去获取其参数值信息,用 JSON 的格式返回到目标网页即可,实现代码如下:

def get_json(url):
 headers = {
 'User-Agent': 
 'Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/69.0.3497.100 Safari/537.36'
 }

 params = {
 'page_size': 10,
 'next_offset': str(num),
 'tag': '今日热门',
 'platform': 'pc'
 }

 try:
 html = requests.get(url,params=params,headers=headers)
 return html.json()

 except BaseException:
 print('request error')
 pass

为了能够清楚的看到我们下载的情况,我们折腾了一个下载器上去,实现代码如下:

def download(url,path):
 start = time.time() # 开始时间
 size = 0
 headers = {
 'User-Agent': 
 'Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/69.0.3497.100 Safari/537.36'
 }

 response = requests.get(url,headers=headers,stream=True) # stream属性必须带上
 chunk_size = 1024 # 每次下载的数据大小
 content_size = int(response.headers['content-length']) # 总大小
 if response.status_code == 200:
 print('[文件大小]:%0.2f MB' %(content_size / chunk_size / 1024)) # 换算单位
 with open(path,'wb') as file:
 for data in response.iter_content(chunk_size=chunk_size):
 file.write(data)
 size += len(data) # 已下载的文件大小

效果如下:


image.png

将上面的代码进行汇总,整个实现过程如下:

#!/usr/bin/env python#-*-coding:utf-8-*-import requestsimport randomimport timedef get_json(url):
 headers = {
 'User-Agent': 
 'Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/69.0.3497.100 Safari/537.36'
 }

 params = {
 'page_size': 10,
 'next_offset': str(num),
 'tag': '今日热门',
 'platform': 'pc'
 }

 try:
 html = requests.get(url,params=params,headers=headers)
 return html.json()

 except BaseException:
 print('request error')
 passdef download(url,path):
 start = time.time() # 开始时间
 size = 0
 headers = {
 'User-Agent': 
 'Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/69.0.3497.100 Safari/537.36'
 }

 response = requests.get(url,headers=headers,stream=True) # stream属性必须带上
 chunk_size = 1024 # 每次下载的数据大小
 content_size = int(response.headers['content-length']) # 总大小
 if response.status_code == 200:
 print('[文件大小]:%0.2f MB' %(content_size / chunk_size / 1024)) # 换算单位
 with open(path,'wb') as file:
 for data in response.iter_content(chunk_size=chunk_size):
 file.write(data)
 size += len(data) # 已下载的文件大小

 if __name__ == '__main__':
 for i in range(10):
 url = 'http://api.vc.bilibili.com/board/v1/ranking/top?'
 num = i*10 + 1
 html = get_json(url)
 infos = html['data']['items']
 for info in infos:
 title = info['item']['description'] # 小视频的标题
 video_url = info['item']['video_playurl'] # 小视频的下载链接
 print(title)

 # 为了防止有些视频没有提供下载链接的情况
 try:
 download(video_url,path='%s.mp4' %title)
 print('成功下载一个!')
 
 except BaseException:
 print('凉凉,下载失败')
 pass

 time.sleep(int(format(random.randint(2,8)))) # 设置随机等待时间

爬取效果图如下:


image.png

结果:

image.png

似乎爬取的效果还可以,当然喜欢的朋友不要忘记点赞分享转发哦。

豆瓣.png
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 214,313评论 6 496
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 91,369评论 3 389
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 159,916评论 0 349
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 57,333评论 1 288
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 66,425评论 6 386
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 50,481评论 1 292
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 39,491评论 3 412
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 38,268评论 0 269
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 44,719评论 1 307
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 37,004评论 2 328
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 39,179评论 1 342
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 34,832评论 4 337
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 40,510评论 3 322
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 31,153评论 0 21
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 32,402评论 1 268
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 47,045评论 2 365
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 44,071评论 2 352

推荐阅读更多精彩内容

  • 大家平时空闲的时候都会有刷小视频的习惯吧,我也会在B站上看一些视频,今天就和大家分享一个用Python写的一个自动...
    叫我小包总阅读 1,765评论 0 0
  • B 站小视频网址:http://vc.bilibili.com/p/eden/rank#/?tab=%E5%85%...
    失忆的蝴蝶阅读 735评论 0 2
  • 文/西秦木子 杯子还是那个杯子 还在原来的地方 我坐在对面 时不时看一眼窗外变幻的天空 深呼吸,让心情平静 让大把...
    西秦木子阅读 299评论 0 5
  • 我怕别人说我丑于是我先自己说自己丑 我怕别人说我穷于是我先自己说自己穷 我怕别人欺骗伤害我于是我先试探别人保护自己...
    Gardenia_3094阅读 139评论 0 0
  • 不对别人的生活过度关心,我的关注点在自己身上,我在意自己舒不舒服,远超过好不好看。因为舒服所以自如,因为自如所以好...
    有点饿有点困阅读 310评论 0 0