爬取简书和数据分析

最近使用爬虫爬了一下简书,半天的时间爬取了简书20w用户数据和40w的follow关系。这些存在mysql里面的闲着也是闲着,想试着做一些有意思的数据统计和社交关系分析。

最受欢迎的作者

我统计了简书上面粉丝数最多和被喜欢次数最多的用户,简书上最受欢迎的作者,如下图所示:


![Uploading Figure_1_086232.png . . .]

我把最受欢迎的作者的放到一张图上面,横坐标表示粉丝数,纵坐标表示被喜欢的次数,如下图所示。可以很明显的看出来,这些最受欢迎的作者里面,大多数的作者还是聚集在图的左下角,but,还有几个超级受欢迎的,他们分别分布在图的右侧和上侧。他们分别是,刘淼,彭小六,简黛玉。很可惜,截图上不能附上作者的名字。


Figure_1.png

这是同济最受欢迎的作者的原始数据,我也贴在这里,如下图所示,数据爬取的时间是 2017年10月20日左右。下图的这四列分别是,uid,昵称,粉丝数,被喜欢数。


2017-10-31 19-16-04屏幕截图.png

最能写的作者

统计了发表文章数最多的top20作者,如下图所示:

image.png

排名第一的这位孤鸟差鱼 ( http://www.jianshu.com/u/a4bb86f4ba07),写了1799篇文章啊!我的天!但是这里有一个bug,这位作者虽然能写,但是每篇文章被喜欢的次数很低,基本上是个位数。可能是一位孤独but高产的作者。

平均每个字被喜欢次数坐高的作者

从上面的一个统计里面吸取到的一个灵感,虽然上面的作者很能写,但是被喜欢的次数却很低,这一次统计的是平均每个字被喜欢次数坐高的作者。如下图所示:


image.png

这个结果就更加意外了,排在前面的这几个大哥,就写了一个字,but 收获了48个喜欢!!!!每个字被喜欢的比例是1:48!!!于是,很好奇这位大哥,这一个字写得是什么,跑去围观。。

2017-10-31 19-46-04屏幕截图.png

用户的粉丝数分布的比例

分析了一下每个用户的粉丝数,绝大多数用户的粉丝数只有10人以下,而粉丝数分布在[10,20]之间的用户明显少了很多,简直是锐减!!!这也基本上符合一个社交网络的结果,绝大多数的人都是围观者,都是内容或者是消息的的接收者。拥有大量粉丝的人,往往很少,这一部分的人是这个社交网络的核心,是信息或者是消息的创造者,拥有更加强大的话语权。

image.png
后面的还尝试的做了一些有意思的,最近在写论文,比较忙,待更新中。。。
PS:
  1. 有人私信问代码,我贴在了github上面 https://github.com/zhaozhengcoder/Jianshu_scrapy
  2. 有人私信问原始数据,这个没有在github上面,but,如果你要的话,我也可以发给你
最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

推荐阅读更多精彩内容

  • Android 自定义View的各种姿势1 Activity的显示之ViewRootImpl详解 Activity...
    passiontim阅读 174,126评论 25 709
  • 在本文中我会尝试如何从0数据开始到获取百万页面,进行用户数据分析、建模,再数据信息化、可视化,生成用户画像分析用户...
    hirainchen阅读 25,433评论 121 689
  • 社交红利阅读笔记 书名:社交红利(修订升级版) 作者:徐志斌 出版社:中信出版社 正文前笔记: 推荐序1摘要 社交...
    凫水阅读 9,072评论 4 26
  • 我们经历了邱莹莹的莽撞,关雎尔的单纯,最后到了樊胜美不上不下的生活状态。大多数情况下,我们是遇不到富可敌国的曲筱绡...
    蓝小歌阅读 1,772评论 5 28
  • 得到上有27个专栏,共26位作者,因为王煜全的前哨专栏已经开通了第二季。在这26个作者中只有4个专栏的订阅数超过了...
    蜀陲浪人阅读 617评论 0 51