短网址系统(一)原理分析

前言

短网址已经是一个老生常谈的话题了,我们的链接常常会因为需要携带各式各样的参数,或者随着业务增长,变得越来越长。对于用户而言,过长的链接体验必然是不好的,短网址也由此而生。其原理大致便是,通过将原链接和短链接一一对应,在用户访问短链接后,重定向到原链接。短链接主要有几个作用:

  • 缩短原链接长度,便于营销推广
  • 数据统计,在重定向的过程中进行PV、UV等数据统计
  • 屏蔽原链接域名

短链接生成算法

短网址一般包含的字符是a-z,A-Z,0-9,共62个字符

自增序列算法

  • 设置一个10进制的自增变量x,生成短链接时将其转换为62进制的数值,该数值便作为短链接,下次生成短链接则x+1。该算法运用了低进制转高进制,字符数会变少的原理。

例如:当前10进制自增变量值为20190519,转换为62进制后,值为BNBU3

哈希算法

MD5消息摘要算法
(英语:MD5 Message-Digest Algorithm),一种被广泛使用的密码散列函数用于确保信息传输完整一致。MD5 加密后的位数一般为两种,16 位与32 位,这里我们使用32位。

  • 先将长链接通过md5加密为32位字符串,分为4段,每段8个字节
  • 对这四段循环处理, 取 8 个字节, 将他看成 16 进制串与 0x3fffffff(30位1) 与操作, 即超过 30 位的忽略处理
  • 每次这30位的尾部6位 与16进制的3D进行 &运算,得到一个小于3D的数值(16进制的3D对应10进制的61),再到字符表[a-zA-Z0-9]中取到对应的字符。将这30位进行右移5位的操作,再次进行第三步,最终将得到一个长度为6的字符串。其中为什么是61而不是62呢?因为获取字符串时下标从0开始。
  • 总共能得到4段长度为6的字符串,任取其一即可

优缺点

  • 自增序列算法的优点是简单易理解,而且永不重复。但是该算法存在安全问题,容易被爬取数据。开源的yourls使用的就是这种算法。
  • 哈希算法得到的短链接长度固定,但是存在重复的可能性。

参考:
https://hufangyun.com/2017/short-url/
https://blog.csdn.net/is_zhoufeng/article/details/26503725

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

推荐阅读更多精彩内容

  • 背景 提供一个短址服务你有没有发现,我们的任务中出现长 URL 就会比较麻烦?如果有一个短址生成器就好了。虽然市面...
    guanguans阅读 21,984评论 7 20
  • 短网址 顾名思义,就是将长网址缩短到一个很短的网址,用户访问这个短网址可以重定向到原本的长网址(还原)。这样可以达...
    曲水流觞TechRill阅读 14,270评论 6 24
  • Swift1> Swift和OC的区别1.1> Swift没有地址/指针的概念1.2> 泛型1.3> 类型严谨 对...
    cosWriter阅读 11,174评论 1 32
  • 事情是这样的,今天一人问我一个问题,但是我懒得在说,就在网上找了一篇博客通过QQ发送给他,但是在发送链接时我发现之...
    木子李呀林夕梦阅读 1,354评论 0 1
  • 常用模块 认识模块 什么是模块 什么是模块? 常见的场景:一个模块就是一个包含了python定义和声明的文件,文...
    go以恒阅读 2,034评论 0 6