反爬终极方案总结—字体反爬

最近临时受命,要针对采集我司网站的爬虫进行反制。虽然不太熟悉这个领域,但既然分到咱这儿了,那就上呗,有啥说的,谁让咱是“全栈工程师”呢(牛逼吹的大了点)。

原本公司已经有了一套字体反爬的机制,但效果还是不很理想。花了一周的时间进行研究,最终在现有反爬基础之上,总结了本文要讲的方案。

说是终极方案,是有些吹牛了,大家都知道爬虫和反爬之家的道高一尺魔高一丈的关系。但这个方案可以很大程度上可以增加普通爬虫的采集成本,在不使用OCR的前提下,算是比较极致的方案了。

直接说重点吧!

1、扫盲:

字体反爬也就是自定义字体反爬,通过调用自定义的ttf文件来渲染网页中的文字,而网页中的文字不再是文字,而是相应的字体编码,通过复制或者简单的采集是无法采集到编码后的文字内容!

上图吧:

源码截图

页面展示效果

如图上面图片所看到的,爬虫是无法采集到编码后的文字内容,貌似起到了防爬的效果,呵呵,事实上这个只能防到简单的爬虫。一会我们再继续讲更深一层的防爬机制。

2、思路设计

讲到这里,细心的人会问,为什么不把所有的内容都替换成编码呢?这个就涉及到加载和渲染速度的问题。

我们知道,单纯汉字就有好几千个,如果全部放到自定义字体库中的话,这个文件会有灰常大,几十兆是肯定有的了,那后果啥样就很清楚了,加载肯定很慢,更糟糕的是如此之多的字体需要浏览器去渲染,那效果,OMG!(产品、运营愤怒的小拳头扑面而来)

好吧,这个时候就提现出我们高级程序的价值所在了(嗯、嗯,清清嗓子)。

为了解决这个问题,我们可以选择只渲染少量的、部分的文字,假设50个字,那么字体库就会小到几十K了,相当于一个小图片而已,加上CDN加速之类的,欧耶,解决了。

如此简单?No、No,表着急,童鞋。50个字儿呢可不是随便随便选择的,要选择那些爬虫采集不到就会很大改变整个语句的语义的词,直接点吧,也就是量词、否定词之类的。如原文“我有一头小毛驴,我从来都不骑”,我们把其中的“一”、“不”放到我们的自定义字库中,这样一来,爬虫采集到的就是“我有头小毛驴,我从来都骑”,OMG,这结果完美。嘿嘿,如果加上阿拉伯数字就更完美了,“猎豹以时速公里/小时的速度奔跑在非洲的大草原上”,同学,请问时速多少来着?哈哈哈,好爽.......

3、PK升级

“老李、老李,不行了,不行了。”运营扯着脖子喊到。

“什么玩意不行了,说清楚,一惊一乍的!”

“反爬、反爬不行了,数据被人采到了!”运营气喘吁吁的.....

哎妈呀,貌似方案挺完美的喽,怎么就轻易被爬虫采集到了呢?

Why?Fuck,还没开心一分钟呢,就被狠狠打脸了,怎么回事呢?

貌似自定义字体已经不能被采集到了,但事实可没这么简单呀,要知道,反爬工程师面对的可是N多个大牛群殴的状态,什么神箭手、Gooseeker,随便一个都是谷歌工程师出身的(买糕的,还让人活不啦)。

来,看看他们是怎么破的。

思路很简单,通过fonttools(python工具)将ttf文件转成ttx文件打开后,什么都明白了!

ttx代码

看到了吗,ed12的编码就是“是”字的unicode编码,这样一来,爬虫只要把采集到""直接替换成“是”字就可以了,以此类推,然后,没有然后了,啥都被采集到了,白忙了半天(我艹%#*%$##%^_+!>.........)。

这可如何是好呢?表急,办法总是有的!

如果让“是”字的编码随机变化,但字体信息不变,浏览器渲染出来还是“是”字那不就完美了,哎妈呀,太聪明了,对就这样干。

于是,每个网页加载的时候,都随机加载了一套字体库,字体库的内容还是50个字,但每个字的顺序编码都是变化的,爬虫也就无法用直接替换的方式进行采集了。

4、PK再次升级

“老李、老李,不行了,不行了。”运营又扯着脖子喊着。(我tmd真想掐死他)

“说,咋了!”

“反爬、反爬又不行了,又被人采到了!”运营无奈的看着我.....

好吧,兵来将挡水来土掩,还能咋滴,先看看情况再说。

原来,还是跟ttx有关,虽然我们打乱了关键字的编码顺序,但是每个字对应的字体信息是不变的,例如,“是”字一共有9划,每一笔划都有相应的x、y坐标信息,浏览器正是根据这些笔划信息渲染出对应的字的,看图:

爬虫工程师先手动下载了一个ttf文件,然后根据ttf文件中的文字图形位置再爬虫代码中做一个映射,然后使用程序动态获取到采集的每一篇文章,使用fonttools来循环对比本地之前下载的标本中的字体信息,对比一直,那就是某一个字,如此一来,反爬就轻松被破了。

细节可参考下面文章,我就不啰嗦了!

Python爬虫杂记 - 字体文件反爬(二)​www.jianshu.com

那怎么办呢?只要肯用心,方法总比困难多呀!

既然你对比字体信息,ok,那我就把字型的信息给你随机了,让字变形,这样你就无法对比了,欧耶。看下变形后的图片:

变形后的字体,即便是下载了当前文章的字库,也需要手动去做字体和字的映射,那么多文章呢,手工匹配,显然是不可能的了。事实上,我们准备了几千套的字体,用于应对爬虫的采集,每次刷新文章,字体库就会更换,每篇文章的字体库都不一样,但是替换的文字都是一样的,这样以来,爬虫采集的难度就越来越高了。

反爬本来就是不归路,没有终点,有反爬就有反反爬;

最好的方案,就是让爬虫采集的成本不断增加,直到放弃,那么反爬也就算那是成功了。

至此,字体反爬策略已经基本达到了顶峰。

那么,这是终点吗?是终极方案吗?

OCR一脸奸笑的走来........

备注:

关于这个方案具体业务代码涉及公司利益,就不公布了。而反反爬的文章网上已经挺多了,就不罗列了!

大概思路:基于微软雅黑字库信息,抽取其中的关键字的字体信息,然后随机生成上千套字库,同时做好字与编码和字库文件的mapping关系,持久化到数据库,然后文章显示时随机从库中查询出一套字库,并把文章中的关键字替换成Unicode编码,over!

QQ: 446089152

©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 215,539评论 6 497
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 91,911评论 3 391
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 161,337评论 0 351
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 57,723评论 1 290
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 66,795评论 6 388
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 50,762评论 1 294
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 39,742评论 3 416
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 38,508评论 0 271
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 44,954评论 1 308
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 37,247评论 2 331
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 39,404评论 1 345
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 35,104评论 5 340
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 40,736评论 3 324
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 31,352评论 0 21
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 32,557评论 1 268
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 47,371评论 2 368
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 44,292评论 2 352

推荐阅读更多精彩内容