职业数据分析--excel

数据分析的步骤
1、提出问题——明确数据分析目的
2、理解数据——理解数据列名的意义
3、数据清洗——统一格式内容
4、构建模型——思考用什么样的表现形式把数据呈现出来
5、数据可视化——把数据转化成图

一、提出问题

首先明确这次数据分析的目的是什么?也就是为了解决什么问题?(提出的问题要能用很明确的指标和数字来衡量,切勿模棱两可)

提出问题:
1、在哪些城市找到数据分析师工作的机会比较大?
2、数据分析师的薪水如何?
3、根据工作经验的不同,薪酬是怎样变化的?

二、理解数据

理解表格中的各个字段(列名)表示什么意思


image.png
  • 城市:用于比较不同城市对数据分析师的需求如何
  • 职位所属:分析以后的工作岗位
  • 职位ID:表示职位的唯一表示,也就是每一行数据的唯一标识------用于去掉重复ID
  • 薪水:比较不同城市、和所属领域的薪水区别
  • 工作年限:从时间轴上对比薪资涨幅

三、数据清洗

数据清洗即数据预处理,目的是去掉无效、重复数据,以取得符合我们要求的数据

  • 数据清晰的步骤:
    选择子集->列名重命名->删除重复值->缺失值处理->一致化处理->数据排序->异常值处理

1.选择子集

只选择对数据分析有意义的字段,无意义的字段选择隐藏,即隐藏不需要分析的列(尽量不删,保证数据的完整性)。这里隐藏公司ID和公司全名,保留职位ID和公司简称。


image.png

2.列名重命名

将不合适的列名更改为我们容易理解的形式。

3.删除重复值

对重复数据进行删除,这里我们对【职场ID】列进行删除重复值处理。


image.png

4.缺失值处理

使用筛选功能将缺失值筛选出来。


image.png

只选中空白


image.png

可以看出【城市】这一列缺失2条数据。
一般对缺失值的处理有4种方法,根据情况灵活使用:
① 通过人工手动补全(缺失值较少,并且可以根据其他信息确定该值)
② 删除缺失的数据(无法判断该位置填写何值,或者删除的数据对分析无大的影响
③ 用平均值代替缺失值
④ 用统计模型计算出的值去代替缺失值

  • 这里对【城市】这一列的处理方法:
    由于缺失数据较少,这里选用人工手动补全。使用查找功能里的定位,定位出空值,然后使用Ctrl+Eneter快捷键,在不连续的单元格中同时输入同一个数据或公式时很好用。

5.一致化处理

(1)对数据进行统一的命名和处理。比如数据中的公司的所属领域是“企业服务,数据服务”,对该列数据进行拆分。
步骤:选中要进行拆分的列-选项卡-数据---分列--分隔符号---下一步---勾选 其他,并入输入“,”且 勾选 连续分隔符视为单个处理(注意,将输入法 切到 中文状态 ,因为 中文的逗号和英文的不是一种字符)---下一步--完成,就会看到 在右边生了一列出来,如图:


image.png

image.png

注意事项:
①将数据先复制到最后一列(分列功能会覆盖右边单元格),隐藏原始列----进行分列;
②对拆分出来的一页 添加列名:公司所属领域2,原来列的列名改为公司所属领域1 ,否则数据透视时会出现警告:”数据表字段名无效。

(2)我们将薪水处理成【最低薪水】、【最高薪水】、【平均薪水】,用于存放清洗后的薪水数据。这里有两个方法可以实现:
一种是使用上面提到的分列功能,将【-】作为分隔符号,然后用【查找替换】功能替换掉【k】,再使用函数AVERAGE求出平均薪水。
在算平均薪水时会出现错误值,原因时有的薪资范围是多少k以上。


image.png

解决方法:选中最高薪水列,定位条件为错误。然后delete删除错误值。再在单元格内输入=ctrl+方向键←,让其等于最低薪水;最后Ctrl+enter,批量操作。
在操作的时候会出现数字显示为文本格式,可以选中该列×1,使其转换成数字格式。
当所有操作都完成之后,使用average函数对其求均值

第二种是利用函数实现:
FIND函数的意思是查找一个字符串在另一个字符串中出现的起始位置,用FIND 函数查找分隔符【k】或者【-】。

6.数据排序

我们对【平均薪水】这一列进行降序排序:


image.png

7.异常值处理

使用数据透视表处理表格:


image.png

image.png

image.png

image.png

此时发现【职位名称】中有职位不属于数据分析:


image.png

这些异常值需要去掉,应返回原表重新筛查。
步骤:
① 在原表【职位名称】列后插入新的列命名为“数据分析职位名称”;
② 在下方空白单元格插入函数=IF(COUNT(FIND({"数据运营","数据分析","分析师"},L2)),"是","否");
③ 双击单元格右下方进行自动填充;
④ 使用筛选功能,选择“是”,过滤掉异常值。

四、构建模型及数据可视化

1.在哪些城市找到数据分析师工作机会比较大?

以城市为行标签,工作年限要求为列标签,数据透视分析不同城市对不同年限的数据分析师的需求情况。
步骤:全选--选项卡,数据透视图----将数据透视表字段中的【城市】拖入到行,将【工作年限要求】拖入到列,再将【城市】拖入到值中:


image.png

最后将数值按列汇总的百分比显示数据:


image.png
image.png
image.png

结论:从数据透视表可以看出,在北京数据分析的岗位最多,往后是上海、深圳、杭州、广州;按工作年限要求来看,3-5年的需求量最大,其次是1-3年,这说明数据分析对年轻人需求将更多。

2.数据分析师的薪水如何?

首先,安装EXCEL 的分析工具库功能:选项卡,文件--选项---加载项---管理,选择 EXCEL 加载项---转到---勾选 分析工具库---确定。


image.png

操作步骤:选项卡》数据 在右边出现有:数据分析 点击---对话框中,勾选 描述统计----确定----输入区域,框选中平均薪水列---分组方式--逐列----勾选 标志位于第一行(表明第一行是列名不包括在计算机里面)-----点选中:新工作表组---输入:薪水描述统计(工作表名称)-----勾选 归总统计、平均数置信度95%、第K值大致5、第K值小值5----确定,结果如下图:


image.png

image.png

以城市为行标签,平均薪水为列标签,数据透视表分析城市与平均薪水的关系:


image.png
  • 结论:从上面数据透视结果可以看出,北京的数据分析师平均薪水最高,其次是深圳,上海,杭州。

3.根据工作经验的不同,薪酬是怎样变化的?

以工作年限要求行标签,平均薪水为列标签,数据透视分析工作年限与平均薪水的关系:


image.png

结论:从上面数据透视结果可以看出,随着工作经验的增长,数据分析师的薪酬也在不断增加。
综合上面三个数据透视结果,我们可以得到以下分析结论:
1)数据分析这一岗位,有大量的工作机会集中在北上广深以及新一线城市,如果将来去这些城市找工作,可以提高求职成功的条件概率。
2)从待遇上看,数据分析师留在北京发展是个不错的选择,其次是深圳、上海。
3)数据分析是个年轻的职业方向,大量的工作经验需求集中在1-5年。
对于数据分析师来说,5年似乎是个瓶颈期,如果在5年之内没有提升自己的能力,大概以后的竞争压力会比较大。
4)随着经验的提升,数据分析师的薪酬也在不断提高,10年以上工作经验的人,能获得相当丰厚的薪酬。

上述操作练习数据 : https://pan.baidu.com/s/1sHot1XcGxN0vlX6RKSh_MQ
提取码: n5ie

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 220,295评论 6 512
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 93,928评论 3 396
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 166,682评论 0 357
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 59,209评论 1 295
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 68,237评论 6 397
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 51,965评论 1 308
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 40,586评论 3 420
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 39,487评论 0 276
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 46,016评论 1 319
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 38,136评论 3 340
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 40,271评论 1 352
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 35,948评论 5 347
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 41,619评论 3 331
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 32,139评论 0 23
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 33,252评论 1 272
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 48,598评论 3 375
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 45,267评论 2 358

推荐阅读更多精彩内容

  • 作者:数据分析不是个事儿 链接:https://www.jianshu.com/p/fa5e96eb2476 来源...
    smile_74de阅读 861评论 0 0
  • 通过本次文章你能够得到什么 能得到什么: 1、了解Excel数据分析的入门操作流程; 2、免费获得一份原始数据样本...
    永远海贼王永远热血阅读 13,167评论 3 12
  • 今天学习了秦路大师的Excel实战分析的文章,本文是自己学习过程的总结,分享给大家。 首先,了解一下什么是...
    宁语随记阅读 635评论 0 0
  • 除夕 之夜。辞旧迎新,声声爆竹。 2时间不等人,尽孝要及时 今天除了耳边的爆竹声中一岁除,还有群里的微信祝福短信。...
    熊芳菲阅读 180评论 0 0
  • 晚安 亲爱的你 好看的侧脸 界限分明 睫毛又长又弯 在灯光的照耀下 投射出一块阴影 均匀的呼吸声 沉寂在这个房间里...
    克里泽阅读 170评论 0 2