Python 给字符串进行加密,生成唯一固定长度字符串

背景

有时候爬虫爬过的url需要进行指纹核对,比如Scrapy就是进行指纹核对,如果是指纹重复则不再爬取。当然在入库的时候我还是需要做一次核对,否则如果爬虫有漏掉,进入数据库就不合适了。

思路

根据Scrapy的指纹生成方式,这次的指纹生成方式也是用hash的MD5对目标URL进行加密,生成固定长度的字符串,然后在数据库里面将字段设置成unique,这样的话在保证url固定长度的情况下还能够保证入库后的唯一性,进最大努力避免出现重复的数据。

指纹生成代码

新建一个文件,然后在里面编写指纹生成的方法,在使用的时候from import进来,调用方法即可。代码为:

import hashlib


def get_md5(url):
    """
    由于hash不处理unicode编码的字符串(python3默认字符串是unicode)
        所以这里判断是否字符串,如果是则进行转码
        初始化md5、将url进行加密、然后返回加密字串
    """
    if isinstance(url, str):
        url = url.encode("utf-8")
    md = hashlib.md5()
    md.update(url)
    return md.hexdigest()

为了验证代码的可用性,再加上代码:

if __name__ == "__main__":
    urls = "http://www.baidus.com"
    print(get_md5(urls))

在本地运行无误,再把下面这串删除。等到调用的时候from import get_md5把文件和方法引入,就可以使用了

©著作权归作者所有,转载或内容合作请联系作者
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

推荐阅读更多精彩内容

  • scrapy学习笔记(有示例版) 我的博客 scrapy学习笔记1.使用scrapy1.1创建工程1.2创建爬虫模...
    陈思煜阅读 12,840评论 4 46
  • title: python语法练习 参考阮一峰等多个文件用来练习python基本语法 [TOC] import文件...
    采香行处蹙连钱阅读 2,458评论 0 2
  • 关于虚拟机重启 sudo reboot 统计图http://www.runoob.com/highchart...
    巴拉巴啦阅读 150评论 0 0
  • 时间的流逝总是残酷的,一下子就跳到了0点,我却仍然没有睡意。脑子里不断想着谭女士临走时候说过的话:“五楼呢...
    人间最爱是清欢阅读 548评论 0 0
  • 正如你终于会明白,无论现时我们经历的是措手不及的幸福喜悦,抑或是无可告人的艰辛苦难,只要继续活着,它们中的大多数细...
    啊啦蕾阅读 390评论 0 1