requests-html校验页面链接可用性

1、安装requests-html

pip install requests-html

2、代码块


# 引入requests-html

import requests_html

# 获取页面

html= requests_html.HTMLSession().get('https://www.baidu.com')

# 获取页面全部的链接

url= html.html.absolute_links

# 遍历页面全部链接

for Url in url:

    # 判断url是不是一个链接
    if('https://' in Urlor 'http://' in Url):

            # 获取当前链接页面

             url= requests_html.HTMLSession().get(Url)

             if(url.ok):

                    # 页面可访问就跳过

                    continue

              else:

                    # 页面不能访问就把错误url打印出来

                    print("不能访问\t"+Url)

    else:

            print('不是链接'+Url)

注:(最好设置代理或者连上自己的热点)部分网页https://beian.miit.gov.cn校验不通过,换成自己的热点就能校验通过。

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

友情链接更多精彩内容