Python爬虫-爬取腾讯小视频

这两天在爬TX的视频的原始下载地址,遇到的问题挺多,感觉这个网站的规律变化多端的,中间也忘了修改过多少次代码了,而且有时候抓包也抓不到一些想要的内容,最后也只能抓到一些像《拜托啦学妹》、《国产整蛊大师》类似的小视频,长时间的视频最后我看了一下只能拿到前五分钟的视频,现在先记录一下,供后续再研究。

我是利用Chrome直接进行抓包的,可以拿到视频的真实地址(ps.但是后续多次尝试其他小视频竟然抓不到这个真实地址,不知道什么原因):

分析-01.png
http://203.205.148.155/vhot2.qqvideo.tc.qq.com/AXTAonPSZxrOwR7IS-ihDRKKiNXe1AI29z6NWNjAUHzQ/u0559hfpsi7.mp4?sdtfrom=v1104&guid=c05f836b267c173e684cec6410185d3b&vkey=9DB055870FCCE159D79ECF6ACD62777A7783FEC58EB4D18F8B3B54164BF7085FDC5E097BF150ADBE2522011A739A844B6AF7FABF6A72D3D9C32E443A11677BBF33E4946EAB82723509823A4045888AE6C5EF367FC4E92603CFFD593945ED4CD9EC1808A02E0B98391D902371DA83641F0173E69E71E1CF50&platform=2

可以进行简化:

http://203.205.148.155/vhot2.qqvideo.tc.qq.com/u0559hfpsi7.mp4?vkey=9DB055870FCCE159D79ECF6ACD62777A7783FEC58EB4D18F8B3B54164BF7085FDC5E097BF150ADBE2522011A739A844B6AF7FABF6A72D3D9C32E443A11677BBF33E4946EAB82723509823A4045888AE6C5EF367FC4E92603CFFD593945ED4CD9EC1808A02E0B98391D902371DA83641F0173E69E71E1CF50

可以简单的分为两部分:

前半部分:http://203.205.148.155/vhot2.qqvideo.tc.qq.com
后半部分:vid.视频格式?vkey=...

vid的值可以根据输入的小视频所在的网页网址获得;而前半部分以及后半部分的vkey(同一个视频不同次请求vkey是不同的)就要根据抓其他包来获得了:

分析-02.png

可以看看抓到的这个包的返回值:

分析-03.png

前半部分可以在url中拿到(可能存在多个),后半部分可以通过keyid和fvkey拼接拿到。
然后我就再回头看如何请求这个URL,参数很多,我也进行了多次尝试:

https://vv.video.qq.com/getinfo?callback=txplayerJsonpCallBack_getinfo_502855&&charge=0&defaultfmt=auto&otype=json&guid=c05f836b267c173e684cec6410185d3b&flowid=16326941443e441cde6cc6bc8600a4e8_70201&platform=70201&sdtfrom=v1104&defnpayver=0&appVer=3.3.125&host=v.qq.com&ehost=https%3A%2F%2Fv.qq.com%2F&sphttps=1&_rnd=1507894470&spwm=4&unid=d2b03881abf611e79d19a042d42c850a&vid=u0559hfpsi7&defn=&fhdswitch=0&show1080p=0&isHLS=1&dtype=3&sphls=1&defsrc=1&_qv_rmt=4N45ERvoA10847LFR%3D&_qv_rmt2=sOgo9dd11579401rg%3D&_1507894470324=

如何拿到这些参数进行请求是个问题,而且当我想进行一些适当的参数删减的时候发现我拿到的fvkey并不是完整的(个数少了很多),在这个问题上纠结了很多,最后在搜索,把一些参数固定住,简化成这样了:

https://av.video.qq.com/getinfo?callback=JsonpCallBack&&charge=0&defaultfmt=auto&otype=json&guid=c05f836b267c173e684cec6410185d3b&platform=70201&sdtfrom=v1104&defnpayver=0&appVer=3.3.128&host=v.qq.com&ehost=https%3A%2F%2Fv.qq.com%2F&_rnd=1507969615&spwm=4&vid={}&_qv_rmt=ZHrqJgF6A10991DBb%3D&_qv_rmt2=y%2FlweBl0157665zsQ%3D&_1507969615506='.format(vid)

然后就开始写代码了:

import requests
from requests.exceptions import RequestException
import re
import json

headers={
    'Accept-Encoding':'identity;q=1, *;q=0',
    'Accept-Language':'zh-CN,zh;q=0.8',
    'Accept':'*/*',
    'User-Agent':'Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.36',
}

#这一部分是为了得到网页源代码
def get_html(url):
    response=requests.get(url,headers=headers)
    try:
        if  response.status_code==200:
            return response.text
        return None
    except RequestException as e:
        print(e)
        return None

#这一部分是为了得到参数vid
def parse_part_1(url):
    try:
        vid=url.split('/')[-1].split('.')[0]
        print('解析URL第一部分vid:'+vid)
        return vid
    except Exception:
        print('解析vid失败')

#这一部分是为了得到keyid、vkey、title、pre_url
def parse_part_2(html):
    try:
        pattern=re.compile('JsonpCallBack\((.*)\)',re.S)
        data=re.search(pattern,html).group(1)
        data=json.loads(data)
        keyid=data.get('vl').get('vi')[0].get('cl').get('ci')[0].get('keyid')
        if len(keyid.split('.'))==3:
            if '10' in keyid:
                keyid=keyid.replace('10', 'p')
            else:
                keyid=list(keyid)
                keyid[12]='p'
                keyid=''.join(keyid)
        else:
            keyid=keyid
        print('解析URL第二部分keyid:'+keyid)
        vkey=data.get('vl').get('vi')[0].get('fvkey')
        print('解析URL第二部分vkey:'+vkey)
        title=data.get('vl').get('vi')[0].get('ti')
        # print('解析URL第二部分title:' + title)
        for i in range(4):
            pre_url=data.get('vl').get('vi')[0].get('ul').get('ui')[i].get('url')
            print('解析URL第二部分pre_url:'+pre_url)
            yield {
                'keyid':keyid,
                'pre_url':pre_url,
                'vkey':vkey,
                'ti':title
                   }
    except Exception:
        print('解析vkey失败')

#主程序
def main(url):
    try:
        vid=parse_part_1(url)
        if vid:
            url='https://av.video.qq.com/getinfo?callback=JsonpCallBack&&charge=0&defaultfmt=auto&otype=json&guid=c05f836b267c173e684cec6410185d3b&platform=70201&sdtfrom=v1104&defnpayver=0&appVer=3.3.128&host=v.qq.com&ehost=https%3A%2F%2Fv.qq.com%2F&_rnd=1507969615&spwm=4&vid={}&_qv_rmt=ZHrqJgF6A10991DBb%3D&_qv_rmt2=y%2FlweBl0157665zsQ%3D&_1507969615506='.format(vid)
            html=get_html(url)
            if html:
                for each in parse_part_2(html):
                    keyid=each.get('keyid')
                    pre_url=each.get('pre_url')
                    vkey=each.get('vkey')
                    title=each.get('ti')
                    url=pre_url+str(keyid)+'.mp4?vkey='+str(vkey)
                    print('=====视频:{0}=====下载URL:{1}'.format(title,url)+'\n')
    except Exception:
        print('解析视频下载URL失败')

if __name__=='__main__':
    print('温馨提醒:e.g. https://v.qq.com/x/page/g0024s8pd38.html' )
    url=input('请输入腾讯视频地址:')
    main(url)

运行后的结果,得到的下载地址有多个,可随便打开一个:

运行结果-02.png
运行结果-01.png
运行结果-04.png
运行结果-03.png

现在程序还是存在一定问题,比如keyid的讨论,比如不能得到大文件的完整视频,待后续进行研究。

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 224,535评论 6 522
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 96,106评论 3 402
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 171,668评论 0 366
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 60,863评论 1 300
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 69,874评论 6 399
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 53,362评论 1 314
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 41,748评论 3 428
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 40,717评论 0 279
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 47,249评论 1 324
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 39,280评论 3 345
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 41,408评论 1 354
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 37,020评论 5 350
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 42,727评论 3 337
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 33,191评论 0 25
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 34,320评论 1 275
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 49,946评论 3 381
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 46,473评论 2 365

推荐阅读更多精彩内容

  • Android 自定义View的各种姿势1 Activity的显示之ViewRootImpl详解 Activity...
    passiontim阅读 172,422评论 25 707
  • 打开爆米花的网站,然后打开其中一个视频: 分析-00.png 打开F12,然后刷新,可以看到: 分析-01.png...
    小小佐阅读 1,260评论 1 5
  • 马画羽现在感觉到自己生不如死,因为他碰到了一件非常棘手的事,简直比之前碰到过的任何一件事都要棘手。 因为他在荒野之...
    马晓白阅读 359评论 2 1
  • 过了零点就是我的生日了。一年一次,说快好快,说慢也挺慢的。可能是所说的“过了爱做梦的年纪,轰轰烈烈不如平静”,...
    lakey阅读 234评论 0 0