- ?
数据分析培训学习,怎么用Excel做数据分析
白安
展开
今天科多大数据小课堂来教大家用Excel怎么做数据分析。
现如今,各行各业的求职都需要简历包装。尤其是文职类简历,想要赢得offer,你不得在精通Excel等办公软件上下点功夫么?那么,你真的了解Excel嘛?或者,你知道用它怎么做数据分析嘛?
所谓数据分析在手,走遍天下都不怕。而 Excel 作为最简单的办公软件,功能却不容小觑,同样可以实现分类、聚类、关联和预测来进行数据分析。这些概念听起来比较抽象,其实一点都不难,今日文章直接来一波干货,从具体操作开始讲起。
01 掌握基本 Excel 快捷键
工欲善其事,必先利其器,自从笔者发现了excel快捷键,就打开了新世界的大门。 虽然都是很基础的操作,一旦运用熟练将会大幅提升效率。
最好用的复制命令: Ctrl + R 向右复制 Ctrl + D 向下复制
选择格式粘贴:Ctrl + Alt + V
求和功能:Alt + = 然后按回车键
格式调整:Ctrl + Shift + 7 加上外边框 Ctrl + Shift + - 去掉边框 Ctrl + Shift + 5 改成%数值格式
视图调整及编辑: Ctrl + Shift + = 插入行 Ctrl + - 删除
终极:开始工具栏所有的命令都可以通过 Alt - H - 调用
Alt: 激活选项,配合选项英文字母使用
Shift:连续选择,配合方向键,翻页键等使用; 上位键
Ctrl:配合其他键可以执行一项命令 如Ctrl + C 复制;快速移动光标,配合方向键使用,如向右快速移动光标 (Ctrl + →)
02 数据收集
在数据分析之前,首先需要找到可靠的数据源。国内的公司数据可以在 wind 上下载,宏观数据可以在国家统计局上找到,而国外比较常用的网站有 SEC,WRDS (Wharton Research Data Services)。
需要注意的是,原始数据一般保留不做处理,通过 Excel 或其他编程软件做后续处理。
03 数据清洗与筛选等基础操作
杂乱无章的原始数据是难以分辨的,因此需要对海量数据进行清洗和筛选才能找出其中的规律。
常见的方法有如下几种:
运用描述性统计命令观察数据的离散程度等基本情况:通过添加“分析工具库”加载项找到数据-数据分析-描述统计,可以得到这组数据的中位数、众数、峰度、偏度等基本指标,观察这组数据的特征。此外,数据分析中还有方差分析等其他命令。
运用 VLOOKUP 将数据合理分组,收放自如:VLOOKUP 函数是 Excel 中的一个纵向查找函数,可以用来核对数据,多个表格之间快速导入数据等函数功能。功能是按列查找,最终返回该列所需查询列序所对应的值。比如,我们导出公司的原始报表后,可以通过 VLOOKUP 函数将报表中的数字一一导入到新的管理用的财务报表,这样既不会破坏原始数据,又可以建立良好的模板,方便后续使用。VLOOKUP 的四个参数用通俗的话来说,就是(要找谁,要在哪里找,要找哪一列内容,是精确的还是模糊的)
运用数据透视表分组求平均数、标准差、计数等多个指标:数据透视表是一个非常容易上手的分组工具,对于简单的数据处理甚至在便捷程度上打败了很多编程工具呢。比如要对每个省份的所有专业分数线求一个平均数,将年份和省份轻松地拖动到对应的列和行,就可以得到结果啦。试想,如果在原始表格中手动一个一个求平均数该有多麻烦。
运用条件函数计算融资缺口,检查配平:比如在预测财务报表时,我们常常要判断资产是否等于负债+所有者权益。此时可以用 IF 函数 (资产=负债+所有者权益,TRUE,FALSE)如果是配平的,直接返回 TRUE。此外,还有一些函数如 IRR 可以计算项目的投资回报率。
04 挖掘数据背后的规律
在完成了数据清洗和筛选之后,我们还是要落实到数据分析的重点,也就是数据背后的逻辑。
首先我们可以采用画图的方式。画图可以非常直观地佐证结论,不同情况下要用不同类型的图,比如饼图显示比重,折线图发现趋势,还可以采用叠加多种形式的图。
下面这张图就是一个数据分析应用的经典例子,显示的是一个教育公司在扩张过程中,学习中心同比增速与营业毛利率的关系。试想,如果只是一堆数据放在你的面前,可能根本无法发现其中的规律,但是通过下图,我们可以发现,学习中心的同比增速一般与营业毛利率呈反向关系,这也就意味着,扩张的过程必然要伴随利润下降的阵痛,这样的数据分析就是有效的,可以为公司的扩张战略提供参考依据。
另一种比较常见的数据分析应用就是从历史预测未来。比如如果公司过去几年的存货周转率都比较稳定,可以以此来预测未来几年的存货周转率。又或者通过线性回归发现某两个指标之间过去的线性关系,并以此来预测未来走势,这个操作方法可以用散点图——添加趋势线——选择回归类型(线性)来得出简单的结论。
说了这么多,列举 Excel 数据分析的一个常见运用。
大家知道,金融领域的工作往往要考察搭建财务模型的技巧,而这个模型就是完完全全从 0 开始通过 Excel 制作的。
1. 计算各项指标了解公司的历史经营状态。这一步不仅可以看出公司在盈利能力、成长性、营运能力等多个维度的历史发展状况,还可以与同行业的可比公司进行比较,看出这个公司所处的地位(比如公司的应收账款周转率可以直观看出公司是强势地位还是弱势地位,应收账款周转率如果显著低于同业,那就说明应收账款很容易收到,议价能力强)。
2. 预测公司未来的盈利状况,并通过财务报表的勾稽关系完善财务模型。这一步一定要打开 Excel 的自动迭代功能(选项——公式——启用迭代计算),具体的财务方面知识在此就不再详述。
3. 现金流 DCF 模型及敏感性分析。以之前制作的财务报表为基础,就可以测算出公司未来的自由现金流,在计算出公司资本成本的前提下对现金流进行贴现得到公司绝对估值。其中,基于不同的资本成本和公司永续增长率还可以做成敏感性分析的表格,得出在不同情形下公司的估值。这就需要使用Excel的数据——模拟运算——模拟运算表功能了。如下图所示,将输入引用行的单元格和引用列的单元格分别设为 Equity Valuation 中的永续增长率和Wacc对应的数值,就可以实现啦。
以上这些介绍都只是冰山一角,Excel的功能博大精深,加上VBA等高端操作将会释放更大的威力。配合现当代大数据盛行时期。想要深入,就还得不断学习!
- ?
咪蒙团队也在用的数据分析方法,你要不要学一下?
西恩富戈斯
展开
来源 | 小饿(ID:eshiyiblog)
作者 | 小饿
关注社交媒体运营、互联网科技,提供IT热门话题另类解读。
你自诩为新媒体界的老人,当有人向你问起,你会公众号数据分析吗?你内心一颤,但还是故作镇静:公众号的数据分析不就是阅读、点赞、评论量么?
你每个月汇总出所有推送文章的阅读量总和,选出 3 篇阅读量最高的文章,同时计算出比上个月增长 or 降低了多少百分比的阅读,粉丝也没见涨多少,你或许就轻描淡写略过……
当你战战兢兢把月报数据抄送给老板时,你依然没觉得数据分析跟公众号运营有半毛钱关系。
01
为什么要系统学习数据分析?
数据分析,在众多运营工作中显得比较特殊,相较其他跟内容或用户打交道的业务环节,数据分析更多的是跟数字打交道。通过对后台各种数据的分析,找到数据中存在的问题,提出解决方案,从而指导并调整运营的方向。
麻省理工学院一项研究发现,以数据驱动决策的企业,生产效率要比一般企业高 4% ,利润要高 6% 。
越来越多的创业公司从一开始就通过数据来指导运营,我了解的一些创业公司,由于资金问题,养不起成熟有经验的运营人员,他们更倾向于招聘应届毕业生,公司内部培养运营人员,而培养的方法就是通过数据分析,如 A/B 测试、漏斗模型等方法来小成本试错、快速迭代,实现低成本增长的目标。
而公众号越来越像一个独立的产品,一些大号甚至撑起一个公司。当你接手一个公众号,我估计你一开始就研究怎么涨粉、怎么互推、怎么裂变,粉丝是涨了很不少,但就是一推送文章就掉粉,你甚至会产生自我怀疑,是我的写作水平不行吗?于是你又囤了一堆写作课程,但依然掉粉不止,你越来越焦虑……
读到这里,你停下来仔细想一想,是不是你从一开始就忽略了,对账号本身数据的分析与研究。学会数据分析,也许你会发现,掉粉这件事跟你的写作水平没有半毛钱关系。
学会公众号数据分析,是你快速成长为资深新媒体运营的捷径。
02
公众号数据分析使用什么工具?
也许你一直以为公众号数据分析是一项特别专业的事情,以至于需要借助第三方工具才能实现,现在的数据可视化分析平台动辄每年上万的费用,而且绝大多数是 SaaS 平台。
什么是 SaaS 呢?「软件即服务」,简单理解就是,你购买我的产品多长时间,我提供多长时间的服务,软件我不卖,你得每年交给我使用费。套路啊!正是昂贵的费用,你羞于向老板申请经费,你以为的数据分析迟迟没有开展。
其实,对公众号进行数据分析,使用微信公众平台后台自带数据功能就足够了。记住,在你申请任何一笔钱的时候,你得说服你的领导,经过你的小范围测试,是可以追加一些投入,产生更大的价值。
这也是职场应该养成的一个习惯,不是有了某个工具你的工作效率会大大提高,而是经过你的小范围测试,是适合你的业务的,投入越多,收入越多,这种情况下,为什么不花钱?况且,对公众号的数据分析,并不需要花一分钱。
03
如何看懂公众号后台数据统计?
公众号数据分析主要用到公众平台后台的「统计」版块,它的位置在后台左侧边栏第 6 个功能。我们今天详细介绍的是前 4 个模块。
数据分析的前提是要清楚各项数据指标的定义及用法,这 4 大模块总共涉及 34 个关键指标,而我们运营工作中常用到只有十几个,下面有必要逐一拆解这些常用的关键指标。
▲ 公众平台 4 大数据统计模块 34 个关键指标
用户分析:用户增长和用户属性
用户增长也就是我们常说的涨粉情况,包含 4 个关键指标,新增人数、取关人数、净增人数、累积人数。新增人数和取关人数是每天实时涨粉、掉粉的数据,净增人数 = 新增人数 - 取关人数,而累积人数是当前实时关注总人数。
细心的同学可能注意到,公众号后台首页有个是「总用户数」,是指所有关注过公众号的人数,其中包含已经取关的粉丝量,类似 APP 的装机量,只要安装过 APP 都算在装机量中,不管是不是已经卸载,所以「总用户数」是个虚荣指标,「累积人数」才是实实在在留存下来的粉丝,我们经常谈论的粉丝量是「累积人数」。
用户增长我们需要特别关注新增人数和取关人数曲线的峰值数据。当涨粉特别是掉粉在某一天达到峰值时,一定提高警惕,一推送就掉粉,一般有两种情况,要么粉丝有问题,要么文章有问题。
粉丝有两种,一种是路人粉,也就是通过参与活动关注的账号,他们关注账号只是为了获得奖品,你推送文章不符合他们的预期,所以取关;一种是精准粉,他们是真正喜爱你的产品或内容才关注,你日常推送的文章,都是他们第一个打开阅读。
文章问题导致的掉粉其实很少,除非你的账号定位很不明确,推文质量也良莠不齐。采用前人经验撰写的标题、文章总不会太差,不至于一推送就因为文章质量而取关,所以不要妄自菲薄,过于焦虑。
用户增长还可以查询到用户的关注来源,简单介绍下各个关注渠道的定义:
搜索关注:说明账号有一定影响力或者来自微信之外第三方平台的推荐。扫码关注:主要来自线上线下活动涨粉(线下二维码物料,或线上海报、文中二维码)。图文关注:靠文章内容涨粉。支付关注:一般是开通支付功能的服务号,线下店面支付时同时关注公众号。
通过「用户属性」可以了解粉丝的性别、语言、省份、城市等 4 个信息,你只需要了解粉丝的性别、地域。
比如情感类的账号粉丝性别以女性为主,科技类账号粉丝男性居多;地域只要不出问题即可,什么是出了问题?河北的一个地域号,一半以上粉丝都是湖南的,这就出了问题。
显然了解用户仅凭这些信息还不够,真实的用户信息需要做用户调研,你可以用麦客表单、金数据、问卷星这类问券工具,建一个表单,推送出去或添加在关注自动回复里面。
用户调查的信息通常包含:年龄、收入、职业、爱好等,通过调查发现关注公众号的粉丝 90 后偏多,那就在写推文的时候语言上多一些网络流行元素;粉丝普遍收入比较高,那就在排版、配图上精致一些,满足中产阶层的审美。
图文分析:单篇图文和全部图文
单篇图文的数据分析详情页有 5 个关键指标:送达、公众号会话阅读、从公众号分享到朋友圈、在朋友圈再次分享、在朋友圈阅读。
▲ 单篇图文的数据分析详情页入口
这 5 个指标形成一个转化率漏斗模型,通过数据还原出一篇文章的传播路径:
推送文章→关注账号的粉丝在公众号会话窗口打开文章→从会话窗口分享朋友圈→粉丝的好友再次分享朋友圈→在朋友圈被好友的好友阅读→获得更广泛的传播……
其中前 3 个指标定义为一次传播,后 2 个指标定义为二次传播。公众号文章阅读量 = 一次传播 + 二次传播,通过观察转化率漏斗数据,很容易判断出,一篇文章是否具有传播性,它的阅读量来源于已关注用户,还是朋友圈分享的结果。
▲ 单篇图文转化率漏洞模型
而通过单篇图文「数据概况」中的饼图,也可以分析出文章标题与内容的关系,进而对运营做出调整。这里要引入「阅读量 & 朋友圈分享占比」四象限图:
菜单分析:菜单点击次数查询
公众号会话窗口的底部自定义菜单栏,往往是很多运营人员忽略的流量入口,新改版的公众号关注页面增加了自定义菜单展示,不用关注公众号也可以看到,势必相比之前仅仅在公众号会话窗口底部要带来更多曝光。
通过对菜单栏某个按钮的点击次数监控,及时调整按钮的位置和文案,使链接到按钮的内容获得更多点击,或者,通过数据分析某个按钮压根没人点击,那就干脆去掉。
一些个人公众号,菜单栏设置很随便,什么「撩我」「戳一下」,其实都是很自嗨式的逻辑。
分享一个简单的自定义菜单栏设置模板:文章精华 + 行业工具 + 联系作者。同时,菜单栏的内容也要经常更新,尤其是你的公众号在做活动时,菜单栏可以和文章内容打个小配合。
比如我的公众号自定义菜单是这样设置的:
不要抵触粉丝加你的个人微信,我曾做过一个小调查,很多人在关注一个喜欢的公众号后,都希望能加上作者的个人微信,他们想看到大咖们的朋友圈都分享些什么内容。而且加粉丝为微信好友,通过朋友圈查看你分享的文章,能直接提高公众号文章的打开率。
消息分析:用户自主发往后台消息和关键词自动回复消息
消息是粉丝和你的公众号产生互动的结果,对消息的分析也是指导公众号运营的重要数据。「消息关键词」中列出了后台「自定义关键词」和「非自定义关键词」的发送排行榜。
通过这些数据,你可以直观地看出你之前设置的哪些关键词粉丝发送的多,哪些非自定义关键词突然爆发式增长,及时设置相应的「自定义关键词」提高公众号服务粉丝的意识。
04
案例分析
最后以某餐饮连锁企业的公众号(服务号)为例,运用以上的数据分析方法,截取10月17日数据,对该账号做一次运营诊断。
用户分析
▲ 账号整体情况
▲ 昨日关键指标
▲ 最近 30 天取关人数
▲ 最近 30 天通过「支付关注」渠道新增粉丝
这个账号最近 30 天取关的峰值都是推送文章的日子,属于典型的一推送文章就掉粉的账号。通过分析各渠道涨粉的数据,发现这个主要粉丝来源于「支付关注」,这是线下实体品牌常见的涨粉方式,不难理解,通过支付功能关注的粉丝,其实对公众号的日常内容并没有太大的认同,也就是推送的文章并没有达到用户的心理预期,导致取关。
运营建议:建议设计跟品牌相关的互动文章二维码物料,在餐厅店内摆放,增加顾客对公众号的认知,并与公众号产生主动互动。
图文分析
▲ 10 月份某篇文章图文分析详情页漏斗模型
▲ 10 月份阅读来源分析饼图
这个公众号文章传播路径就是上文提到的,阅读量高全凭标题党,阅读量绝大部分来自于「公众号会话阅读」,文章被分享到朋友圈的几率很少,几乎可以忽略不计,估计绝大部分都是餐厅员工转发。
运营建议:提高内容质量,多发与顾客互动相关的内容,加强与粉丝的互动。特别建议开设品牌的个人微信号,如运营小编个人号、店长个人号,与粉丝建立强关系,可提高文章在朋友圈的打开率,进而促进文章在朋友圈的传播。
菜单分析
▲ 最近30天自定义菜单栏点击情况
一级菜单「会员中心」点击量最高,「更多」作为一级菜单,指向太模糊,该列菜单包含「门店信息」和「加入我们」,均有一定点击量,可以考虑将「更多」改为「联系我们」,提高「门店信息」和「加入我们」的曝光。而一级菜单「好食材」点击量几乎可以忽略,可以尝试寻找更多顾客「痛点」与「痒点」,替换掉「好食材」。
消息分析
▲ 消息发送人数小时报
▲ 最近 30 天消息发送日报
▲ 消息关键词TOP200 非自定义关键词
通过分析最近 30 天消息发送小时报、日报,发现周四、周五饭点期间发送消息的用户达到峰值,而在「非自定义关键词」中建议、菜单、外卖、营业时间等相关关键词发送较为集中。
运营建议:周四、周五饭点前后增加线上客服响应,提高用户咨询相关问题的体验,从而培养用户忠诚度。增加顾客集中咨询的关键词,设置自定义回复,提高用户咨询体验。
- ?
学会数据分析,你就可以变身007
夏念云
展开
今天我想给大家讲个关于林彪的故事。林彪的是非功过我们不去评述,毕竟我们不是谈历史的节目,今天我讲的是林彪在一场战役中的表现,我们的侧重点在于我们能够从中学习什么,我知道这个故事呢是因为有一位叫黄永的朋友,他是军事爱好者,也是一家企业的老板。下班以后他就沉浸到自己的军事世界,我们聊天的时候说到一个地名,他就先思索这个那里是不是曾经发生过什么战役,这一份痴迷我也是醉了。不过从这样的朋友身上真是能学到东西,和他聊天很长学问,我又扯远了是不是,其实并没偏题,这说的还是学习呀,我们要学会随时随地学习,不管是从朋友身上还是看场电影。
话说1948年辽沈战役开始以后,在东北野战军前线指挥所里面,每天深夜都要进行例常的每日军情汇报,由值班参谋读出下属各个重队、师、团,用电台报告当日的战况,还有缴获的情况。那就是千篇一律的枯燥无味的数据,比如每支部队歼敌多少,俘虏多少,缴获的火炮,车辆多少,枪支物资多少。林彪是东北野战军的司令员,他的要求很细,俘虏要分清军官和士兵,缴获的枪支要统计出机枪、长枪、短枪,击毁和缴获那些还能使用的汽车,也要分出来大小和类别。经过一整天紧张的战斗指挥工作,人们都非常疲劳,整个作战司里面估计只有定下这个一个规矩的司令员林彪本人还有那个读电报的倒霉参谋在用心的留意。
在1948年的10月14号,东北野战军以迅雷不及掩耳之势,仅仅用了30个小时就攻克了对手原以为可以长期坚守的锦州并全歼了守敌十余万之后,不顾疲劳,挥师北上,和廖耀湘的精锐部队二十多万人在辽西相遇,一时间形成了混战。战局瞬息万变,谁胜谁负实在是难以预料。战场可不是闹着玩的,如果你看过《血战钢锯》这样的电影,你就会明白,战场简直就是地狱。我们生活在和平时代的人看到电影里的血腥镜头就会发晕,那真实的战场上每时每刻都在发生着那样的惨烈状况。
在紧急的大战中,林彪不管有多忙,仍然坚持着每晚必做的功课。一天深夜,值班参谋正在读着下面某司报上来的战报,说他们下面的部队碰到了一个不大的遭遇战。歼灭了一部分敌人,其余的逃走了,这份报告听上去和其他之前所读的战报并没有什么明显的异样。值班参谋就这样读着读着,林彪突然叫了声停!然后问,刚才念的在胡家窝棚的战斗的缴获,你们听到了吗?大家带着睡意的脸上就出现了茫然的神色,因为这样的战斗每天都有几十起,不都是差不多的一模一样枯燥的数字吗。林彪扫视了一周,看到没有人回答,就接连问了三句,为什么那里缴获的短枪和长枪的比例比其他的战斗略高。为什么那里缴获和击毁的小车和大车的比例比其他的战斗略高。为什么在那里俘虏,击毙的军官和士兵的比例比其他战斗略高。
人们还没有来得及思索,林彪等不及,大步走向挂满军用地图的墙壁,指着地图上的那个点说,我猜想,哦,不,我断定,敌人的指挥所就在这里。随后林彪就口授命令,追击从胡家窝棚逃走的那一部分敌人,并且坚决要把他们打掉。各部队采取分割包围的办法把失去了指挥中枢以后变得混乱的几十万敌军切成了小块,逐一歼灭。司令员的命令随着无线电波发向了参战的各个部队,而这个时候的廖耀湘正庆幸自己刚刚从偶然的一场遭遇战中安全脱身,还和自己的另外一支部队会合。他来不及休息就急于指令各部队尽快调整部署,为下个阶段战斗做准备。可是好景不长,紧追而来的解放军迅速把他的新指挥部团团围住,拼命攻击。漫山遍野的解放军战士口中还不断有人喊着“矮胖子,白净脸,金丝眼镜湖南腔,不要放走廖耀湘”。把对方指挥官的细节特征琢磨到如此细微,并且把它变成了威力巨大的顺口溜。当时穿着满身油渍伙夫服装的廖耀湘只好从俘虏群中站出来,无奈的说我是廖耀湘,举手投降。
对于自己的失败,廖耀湘觉得不可思议,认为那就是一个偶然事件,输得非常的不甘心。但是当他得知林彪是怎么样得出了这个判断以后,这一位出身黄埔军校并且曾经留学法国著名的圣歇尔军校,参加过滇缅战役,在那里把日本鬼子揍得满地找牙的新六军军长说,我服了,败在他手下不丢人。那到底为什么廖耀湘服了呢?
取得这场重要战役的胜利,可不是靠运气。其中一个关键因素是林彪的准确判断,是他对一份普普通通遭遇战之后的战报数据分析,而这来源于他的一个优良军事素养。他从红军带兵时期,身上就有一个小本子,上面记载着每一次战斗的缴获、歼敌数量。数据的积累,数据的挖掘,分析、归纳、整理,既是一支优秀团队所必须具备的基本素养,也是生活在移动互联时代的人们所需要掌握的基本技能。没有这种能力成功可能真的是靠运气和匹夫之勇,而不是真正的实力,也不能带来长久的成功。
从这个故事里,你有什么启发呢?我们每天都在和数据打交道,但我们有没有发掘出数据的价值呢?有一位叫数据小兵的朋友,对这个案例做出了分析,得出了一个数据分析的简单流程,明确目的,获取数据,数据探索,数据分析,提交报告。就林彪这个案例来说,我们分别来看看。首先明确目的,这是通过歼敌的数量和缴获的数据来发现异常,判断敌情。其次,获取数据。由专人负责收集,由下而上,逐成快速流转,从各个部队各个部门传向了司令部。
第三是数据探索,从来自各个方向的数据流向了一个节点,那就是司令部林彪。那必须要对这来自不同方向的各个数据进行口径统一格局式的整理还有纬度的分类汇总,否则就容易乱套。那么第五就是数据分析,林彪采用了对比分析,从时间的维度方面,空间的维度方面,还有其他维度进行对比,发现了显著的差异,确定了敌情。那最后就是分析报告,对比分析之后就得出结论,并且由此制定策略。有人可能要说了,我们又不打仗,你跟我们说这些有什么用呢。当然有用了,比如我们要找一份工作,是不是可以运用这样的数据分析流程?最好出来的分析报告就是一份像样的简历啊。
所以在学习的过程中我们不要总是觉得那个事情和我没关系,有没有关系需要我们去思考去结合,而不是带着排斥的想法去看待这些事物,包括有些人可能觉得林彪是历史罪人,所有有关他的一切我们必须都要持批判的态度。如果那样的话真的不是正确的学习态度。这就像我们上学的时候,如果老师对我们好点,长得漂亮点,那门课我们就上得有劲头,如果老师长得丑或者是非常的凶恶,那我们就不愿意学那门课了。但是现在我们已经是成人了,对不对,不能再那么孩子气了。
数据小兵是搞数据分析的,所以他会从自己的专业角度来看这个案例,你可以从他的看法中进行借鉴,但是原则上来说你应该有自己的看法,结合你的实际工作,你从案例中有什么样的收获呢?你能不能举出自己经历过的非常得意的数据分析例子?
- ?
学会数据分析背后的挖掘思维,分析就完成了一半!
心事
展开
在数据分析中,模型是非常有用和有效的工具和数据分析应用的场景,在建立模型的过程中,数据挖掘很多时候能够起到非常显著的作用。伴随着计算机科学的发展,模型也越来越向智能化和自动化发展。对数据分析而言,了解数据挖掘背后的思想,可以有助于建立更具稳定性的模型和更高效的模型。
数据挖掘前世今生
数据模型很多时候就是一个类似Y=f(X)的函数,这个函数贯穿了模型从构思到建立,从调试再到最后落地应用的全部过程。
Y=f(X)建立之路
对模型而言,其中的规则和参数,最初是通过经验判断人为给出的。伴随着统计方法和技术的发展,在模型的建立过程中,也引入了统计分析的过程。更进一步地,随着计算机科学的发展,建模的过程,也被交给了机器来完成,因此数据挖掘也被用到了模型的建立中。
数据挖掘,是从大量数据中,挖掘出有价值信息的过程。在有的地方,数据挖掘也被成为是数据探矿,正如数据挖掘的英文data mining一样,从数据中挖掘有价值的知识,正如在矿山中采集钻石一般,不断去芜存精,不断发掘数据新的价值。数据挖掘是通过对数据不断的学习,从中发掘规律和信息的过程,因此也被称为统计学习或者是机器学习。对数据挖掘而言,其应用范围广泛,除了建模,在人工智能领域也有使用。
回到模型中,从经验判断到数据挖掘,建立模型的计算特征发生了极大的改变。
计算特征的发展
首先数据的维度开始从少变多,最初只有几个维度,到现在有上百个维度。数据的体量,即记录的条数也从少量到海量,从过去了百条规模到了现在亿条规模。伴随着数据获取的难度下降,数据的维度和记录数量会越来越多。在这种情况下,数据的处理过程也越来越复杂,从过去简单的几次加减计算得到结果,到了现在必须要经历上亿次的复杂运算。同时,伴随着计算性能的提升,对于从数据中提取信息而言,也从渐渐深入,过去只能发现一眼看出的浅表信息,如今可以不断去挖掘隐含的知识。
数据挖掘的基本思想
数据挖掘的别名机器学习和统计学习一样,数据挖掘的实质是通过计算机的计算能力在一堆数据中发掘出规律并加以利用的过程。因此对数据挖掘而言,就需要经历规则学习、规则验证和规则使用的过程。
数据挖掘的基本思想
规则学习又称为模型训练,在这个步骤中,有一个数据集将作为训练集。按照相关的算法和输出规则的要求,从训练集中筛选出需要使用的变量,并根据这些变量生成相关的规则。有的时候,是将过去已经发生的数据作为训练集,在对比已知的结果和输入的变量的过程中,以尽可能降低输出误差的原则,拟合出相应的模型。
当产生了规则后,就需要验证规则的效果和准确度,这个时候就需要引入验证集。验证集和训练集具有相同的格式,既包含了已知的结果也包含了输入的变量。与训练集不同的是,对验证集的应用是直接将规则应用于验证集中,去产生出相应的输出结果,并用输出的结果去对比实际情况,以来确定模型是否有效。如果有效的话,就可以在实际的场景中应用。如果效果不理想,则回头去调整模型
测试集是将模型在实际的场景中使用,是直接应用模型的步骤。在测试集中,只包含输入变量却没有像其他两个数据一样存在的已知结果。正因为结果未知,就需要用测试集通过模型去产生的输出的结果。这个输出结果,将在为结果产生以后进行验证,只要有效,模型就会一直使用下去。
数据挖掘的流程
数据挖掘与数据分析的流程相似,都是从数据中发现知识的过程,只不过由于数据体量和维度的原因,数据挖掘在计算上最大。
数据挖掘的流程
对数据挖掘而言,首先是进行数据获取,数据获取的来源很多,有系统中自行记录的数据,对这种数据只要导出即可,同时也有外来数据,比如网页爬取得数据,或者是购买的数据,这些数据需要按照分析系统的需求进行导入。
在完成了数据获取步骤后,就需要进行数据处理,数据处理即是处理数据中的缺失值,错误值以及异常值,按照相关的规则进行修正或者删除,同时在数据处理中也需要根据变脸之间的关系,产生出一系列的衍生变量。总而言之,数据处理的结果是可以进行分析的数据,所有数据在进行分析以前都需要完成数据处理的步骤。
如果数据在分布上存在较极端的情况,就需要经历数据平衡的不走。例如对于要输出的原始变量而言,存在及其少量的一种类别以及及其大量的另一种类别,就像有大量的0和少量的1一样,在这种情况下,就需要对数据进行平衡,通过复制1或者削减0的形式生成平衡数据集。
当完成数据平衡后,将会把数据处理的结果分出一部分作为验证集使用,如果数据平衡性好,那么剩下的部分作为训练集,如果平衡性不好,那么平衡数据集就会作为训练集使用。当有了训练集后,就按照相关的算法对训练集进行学习,从而产生出相关的规则和参数。当有了规则以后,就将产生的规则用在验证集中,通过对比已知结果和输出结果之间的误差情况,来判断是否通过。如果通过则在后面再测试集中使用,如果未通过,就通过数据平衡、参数调整,以及变量选择等手段重新调整规则,并再次进行验证,直到通过验证。
对于验证集验证的步骤而言,在无监督学习中没有这个步骤,当缠上规则后,就直接用于测试集。
数据挖掘周而复始
数据挖掘是一个周而复始的过程,在生成规则的过程中,不断地对模型进行调整,从而提升精度。同时也将多批次的历史数据引入到数据挖掘的过程中,进行多次的验证,从而在时间上保证模型的稳定性。
数据挖掘的模式
在数据挖掘中,对于规则的获取,存在三种方式,分别是监督学习,无监督学习和半监督学习,这三种方式都是通过从数据的统计学习来制定规则。
在一个数据挖掘问题中,变量可以分为自变量和因变量,规则是以自变量为输入,以因变量为输出的结果,由此对数据挖掘问题,就把自变量定义为X,把因变量定义为Y。
获取规则的方式,来源于对数据的统计学习
对于监督学习而言,训练集中包括了自变量X和因变量Y,通过对比X和Y的关系,得除相应的规则,同时再在验证集中,通过输入验证集的自变量X,借助规则得到因变量Y的预测值,再将Y的预测值与实际值进行对比,看是否可以将模型验证通过,如果通过了,就把只包含自变量X的测试集用于规则中,最终输出因变量Y的预测值。在监督学习中,因变量的实际值和预测值的对比,就起到监督的作用,在规则制定中需要尽量引导规则输出的结果向实际值靠拢。
对无监督学习而言,训练集中,就没有包含因变量Y,需要根据模型的目标,通过对自变量X的分析和对比来得出相关的规则,并能够产生合理的输出结果,即Y,在制定规则的过程中,需要有一些人为的原则对规则进行调整。当完成调整后,就可以把只包含自变量X的测试集放到规则中,去产生规则的结果Y。
对比监督学习和无监督学习,最大的区别就是,在制定规则的过程中,是否有Y用于引导规则的生成。监督学习中,有Y存在,生成规则过程中和生成规则时,也会对比Y的预测值和实际值。而在无监督学习中,就没有Y作为对比的标准,相应的规则都直接由X产生。
半监督学习,与监督学习类似,也需要因变量Y参与到规则生成和规则验证中去。但是在训练集只用只有一少部分的对象既有自变量X和因变量Y,还有大部分对象只包含了自变量X。因此在对半监督学习的规则生成中,需要有一些特殊的手段来处理只包含的自变量X的对象后,再生成相关的规则。在后面的验证和测试的流程都与监督学习一致。因而对于半监督学习,最重要的问题就是如何借助少量的因变量Y而产生出可以适用的规则。
数据挖掘的应用场景
数据挖掘应用的场景很多,通常有四种情况被广泛的使用。
数据挖掘的应用场景
首先是聚类分析,就是将不同的对象,根据其变量特征的分布自然地分成不同的类别。此外是分类模型,这是针对已知的类别,构建出分类的模型,通过分类的模型来探求其他未分类对象的类别。第三是预测估计,集根据对象的连续数据因变量,通过围绕已知的维度,构建出预测因变量的模型,从而对因变量未知的对象进行估计。最后是关联分析,即通过探求数据对象之间的相关关系,来发现对象之间的联系,在关联分析中,更多是以对象之间的关系作为输出。
聚类分析
聚类分析是一种无监督学习的数据挖掘方法,其目的是基于对象之间的特征,自然地将变量划分为不同的类别。在聚类分析中,基本的思想就是根据对象不同特征变量,计算变量之间的距离,距离理得越近,就越有可能被划为一类,离得越远,就越有可能被划分到不同的类别中去。
聚类分析基本思想
例如在坐标系中,B距离A的距离远远小于,B到C的距离,因此,AB更容易划分为一类,而BC更容易为不同的类别。通常来说,一个对象距离同类的距离是最近的,都小于其他类别中对象的距离。
在聚类分析中,有两种常用的方法,一种是K-means聚类,一种是层次聚类。
K-means聚类VS层次聚类
在K-means聚类中,是预先规定出要产生多少个类别的数量,再根据类别数量自动聚成相应的类。对K-means而言,首先是随机产生于类别数相同的初始点,然后判断每个点与初始点的距离,每个点选择最近的一个初始点,作为其类别。当类别产生后,在计算各个类别的中心点,然后计算每个点到中心点的距离,并根据距离再次选择类别。当新类别产生后,再次根据中心点重复选择类别的过程,直到中心点的变化不再明显。最终根据中心点产生的类别,就是聚类的结果。正如图中所示,一组对象中需要生成三个类别,各个类别之间都自然聚焦在一起。
在层次聚类中,不需要规定出类别的数量,最终聚类的数量可以根据人为要求进行划分。对层次聚类,首先每个对象都是单独的类别,通过比较两两之间距离,首先把距离最小的两个对象聚成一类。接着把距离次小的聚成一类,然后就是不断重复按距离最小的原则,不断聚成一类的过程,直到所有对象都被聚成一类。在层次聚类中,可以以一张树状图来表示聚类的过程,如果要讲对象分类的话,就可以从根节点触发,按照树状图的分叉情况,划分出不同的类别来。在图中,把一组对象分成了三个类别,可见这三个类别就是构成了树状图最开始的三个分支。
聚类分析的过程,和分桔子其实很很像,人们通常都把特征相同的桔子分成一类,聚类分析中,也是同样的方式。
聚类分析案例
正如在这个例子中,有A-H的8个桔子,对每个桔子而言有提体积和变量两个变量。通过将各个桔子投射到重量和体积构成的坐标系中,可以发现BEF距离很近,ACG距离很近,而DH距离很近。如果聚成3类的话,可以是ACG、BEF,DH各为一类。如果是聚成两类,BEFDH与ACG相对更近,因此可以是ACG为一类,而BEFDH为另外一类
分类模型
分类模型通常是通过监督学习产生的,根据已知的对象的类别和其具体特征特征的数据,通过训练从而产生由特征判断类别的规则。在分类模型中,规则的输出就是具体的类别。
分类模型基本思想
分类模型的规则产生的过程中,类别判别的原则与训练集中各特征变量的分布息息相关,通常就是在对比各个类别下特征变量的互相关系,而划分出相关的规则,这个过程遵循的原则就是尽可能让输出的类别与实际的类别保持一致。
当前,不管在学术研究领域还是业务应用领域都有大量的分类模型,通常来说,决策树和朴素贝叶斯是非常普遍的分类模型算法,这两个算法在一些文献中也被列为十大数据挖掘算法。
决策树VS朴素贝叶斯
决策树的规则生成算法是将对象按照相关的特诊变量进行依次拆分,在拆分中不断迭代条件,最终划分为最终的类别。决策树的划分过程,就像是一个树一样,从根节点触发,依次开支散叶,最终形成分类准则。
在图中,首先就按照年龄进行分支,直接将所有对象分成了三堆,其中年龄在31-40岁的被划定为购买类,另外的两堆对象,还需要继续进行分支。对年龄小于30岁,按照是否为学生进行分支,其中是学生的被判定为购买类,不是学生的被判定为不买类。同样对年龄大于40岁,按照信用等级进行分类,信用等级高的被判定为不买类,信息等级低的被判定为购买类。就这样,任何一个对象,都可以根据条件达成的情况,最终到达购买或者不买的节点,完成分类过程。
朴素贝叶斯的规则生成算法相对决策树而言,就没有这么直观了,其依赖于概率中的贝叶斯公式。由公式P(AB)=P(A/B)×P(B)=P(B/A)×P(A)得来的后验概率公式P(A/B)=P(B/A)×P(A)/P(B),其中A类别,B表示条件即特征变量。P(A/B)表示在特定条件下该类别的概率,P(B/A)表示在特定类别下该条件的分布概率,P(A)表示已知的特定分类的概率,而P(B)表示已知的特定条件的概率。
在算法中,P(B/A)、P(A)、P(B)都通过训练集能够得到,再加上在条件一定时,P(B)是恒定的,同时每个条件互相独立,根据概率公式,P(类别/总条件)是P(类别)和所有P(条件/类别)的乘积。因此在朴素贝叶斯中,最大的P(类别/总条件)对应的类别,就是被划分的类别...
- ?
学会用数据说话,你才懂如何管理
雅各布
展开
文/刘勇
我曾在国企工作多年,发现一个比较普遍的现象,就是很多领导对数据不感兴趣,不喜欢用数据说话。可能是因为数据的收集、分析是一个苦差事,费神费时,还很枯燥。但这对一个管理者来说并不是一个好现象,只是很多人没有意识到这一点。
他们大多说话做事凭经验凭感觉,看上去胸有成竹,信心满满,但你要是认真起来,问一个为什么?往往是一问三不知。肚里没有什么东西,许多事情仅仅是想当然,停留在表面。而且这样的领导比较固执,不容易改变自己的观点和看法。
而那些掌握大量数据的人同样给人留下两种印象,一是业务精熟,基础工作扎实,注重收集、整理、分析大量的数据,这样的人往往敬业勤业,以工作为唯一关注点。二是能力精干,善于从繁杂的数据中寻找关联,揭示事物的本质,并提出解决问题的建议,这样的人不仅聪明能干,而且令人敬畏。
数据是什么?数据就是一种信号,就是告诉你已经发生了什么,或即将要发生什么的信号。我们就是依据对“信号”的判断来决定我们行事的方向和方式——什么事可以做,什么时候做,以及应当采取什么样的方式来做。
可以说,没有数据,就不会有管理。只有当你真正对数据感兴趣的时候,当你喜欢用数据说话的时候,你才能真正感受到数据的重要性。
首先,数据就是证据和事实,增强你的说服力。
任何好的想法和观点都可能会遭到对手的质疑和反驳,但你把数据亮出来的时候,对方可能就会哑口无言。你能把“黑”说成“白”,但你能把“3”说成“4”吗?
其次,数据可以暴露问题,揭示本质,改变原有的错误观点和习惯性的思维方式。
我们做了那么多愚蠢的决策就是因为没有问问“数据”,而是自己想当然。比如,你负责管理一个纸巾品牌,一卷纸巾售价50元,生产一卷纸巾的实际成本为15元,下属提出两个促销方案:方案A:降价20%,销量增加20%;方案B:降价40%,销量增加80%。你会选择哪个方案呢?
表面上看,降价40%,销量增加80%,应该是一个不错的方案,但实际上是最糟糕的方案。最好的方案反而是保持原价不降价。可见,薄利多销并不总是一个好的策略,也是有条件的。
最后,也是大家容易忽略的一点就是,数据可以增强你的权力和影响。
许多有经验的高层经理就是通过弄一些确切的数字来威吓自己的下属,以加强自己在公司的权力。我曾见过一个很有权力的领导,他就常常用“数据”来威吓下属,下属都很害怕见他。有一次,在一个专业会议上,他问某一个分公司的经理:“你们上个月产品的产量是多少?”这位经理小心地回答说:“大约3万吨。”他立时脸色一沉说:“上个月你们生产了31800吨。”
你想一想,如果你是这位经理,你会有什么感受,如果你不是这位经理,你又会是什么感受。
这方面表面最出色的就是麦克纳马拉了,《蓝血十杰》中记载,他“永远有一颗数学脑瓜、分析脑瓜、能从纷乱中理出头绪和道理的脑瓜。他永远能讲出道理,而且是有事实、有统计数字作依据的道理——他能用事实证明他的分析,把别人吓住。他善于使用图表和统计数字。有一次,他在太平洋美军总司令部连续坐了8个小时,观看有关越南战争的幻灯片。到他看了7个小时的时候,他说:“请停一下。这张幻灯片,第869号,与第11号有矛盾。”人们把第11号重放了一遍。他说得果然不错,两张片子是有矛盾。在场的人全都佩服之至,也有许多人有点害怕。他的名气自然更大了;大家对他敬畏有加。”
记住,“权力是通过掌握事实、通过使别人感到惧怕、使别人对某人的才智和能力感到敬畏来行使的。”数据可以满足这一点。
- ?
数据分析培训学习,怎么用Excel做数据分析
起点站
展开
今天科多大数据小课堂来教大家用Excel怎么做数据分析。
现如今,各行各业的求职都需要简历包装。尤其是文职类简历,想要赢得offer,你不得在精通Excel等办公软件上下点功夫么?那么,你真的了解Excel嘛?或者,你知道用它怎么做数据分析嘛?
所谓数据分析在手,走遍天下都不怕。而 Excel 作为最简单的办公软件,功能却不容小觑,同样可以实现分类、聚类、关联和预测来进行数据分析。这些概念听起来比较抽象,其实一点都不难,今日文章直接来一波干货,从具体操作开始讲起。
01 掌握基本 Excel 快捷键
工欲善其事,必先利其器,自从笔者发现了excel快捷键,就打开了新世界的大门。 虽然都是很基础的操作,一旦运用熟练将会大幅提升效率。
最好用的复制命令: Ctrl + R 向右复制 Ctrl + D 向下复制
选择格式粘贴:Ctrl + Alt + V
求和功能:Alt + = 然后按回车键
格式调整:Ctrl + Shift + 7 加上外边框 Ctrl + Shift + - 去掉边框 Ctrl + Shift + 5 改成%数值格式
视图调整及编辑: Ctrl + Shift + = 插入行 Ctrl + - 删除
终极:开始工具栏所有的命令都可以通过 Alt - H - 调用
Alt: 激活选项,配合选项英文字母使用
Shift:连续选择,配合方向键,翻页键等使用; 上位键
Ctrl:配合其他键可以执行一项命令 如Ctrl + C 复制;快速移动光标,配合方向键使用,如向右快速移动光标 (Ctrl + →)
02 数据收集
在数据分析之前,首先需要找到可靠的数据源。国内的公司数据可以在 wind 上下载,宏观数据可以在国家统计局上找到,而国外比较常用的网站有 SEC,WRDS (Wharton Research Data Services)。
需要注意的是,原始数据一般保留不做处理,通过 Excel 或其他编程软件做后续处理。
03 数据清洗与筛选等基础操作
杂乱无章的原始数据是难以分辨的,因此需要对海量数据进行清洗和筛选才能找出其中的规律。
常见的方法有如下几种:
运用描述性统计命令观察数据的离散程度等基本情况:通过添加“分析工具库”加载项找到数据-数据分析-描述统计,可以得到这组数据的中位数、众数、峰度、偏度等基本指标,观察这组数据的特征。此外,数据分析中还有方差分析等其他命令。
运用 VLOOKUP 将数据合理分组,收放自如:VLOOKUP 函数是 Excel 中的一个纵向查找函数,可以用来核对数据,多个表格之间快速导入数据等函数功能。功能是按列查找,最终返回该列所需查询列序所对应的值。比如,我们导出公司的原始报表后,可以通过 VLOOKUP 函数将报表中的数字一一导入到新的管理用的财务报表,这样既不会破坏原始数据,又可以建立良好的模板,方便后续使用。VLOOKUP 的四个参数用通俗的话来说,就是(要找谁,要在哪里找,要找哪一列内容,是精确的还是模糊的)
运用数据透视表分组求平均数、标准差、计数等多个指标:数据透视表是一个非常容易上手的分组工具,对于简单的数据处理甚至在便捷程度上打败了很多编程工具呢。比如要对每个省份的所有专业分数线求一个平均数,将年份和省份轻松地拖动到对应的列和行,就可以得到结果啦。试想,如果在原始表格中手动一个一个求平均数该有多麻烦。
运用条件函数计算融资缺口,检查配平:比如在预测财务报表时,我们常常要判断资产是否等于负债+所有者权益。此时可以用 IF 函数 (资产=负债+所有者权益,TRUE,FALSE)如果是配平的,直接返回 TRUE。此外,还有一些函数如 IRR 可以计算项目的投资回报率。
04 挖掘数据背后的规律
在完成了数据清洗和筛选之后,我们还是要落实到数据分析的重点,也就是数据背后的逻辑。
首先我们可以采用画图的方式。画图可以非常直观地佐证结论,不同情况下要用不同类型的图,比如饼图显示比重,折线图发现趋势,还可以采用叠加多种形式的图。
下面这张图就是一个数据分析应用的经典例子,显示的是一个教育公司在扩张过程中,学习中心同比增速与营业毛利率的关系。试想,如果只是一堆数据放在你的面前,可能根本无法发现其中的规律,但是通过下图,我们可以发现,学习中心的同比增速一般与营业毛利率呈反向关系,这也就意味着,扩张的过程必然要伴随利润下降的阵痛,这样的数据分析就是有效的,可以为公司的扩张战略提供参考依据。
另一种比较常见的数据分析应用就是从历史预测未来。比如如果公司过去几年的存货周转率都比较稳定,可以以此来预测未来几年的存货周转率。又或者通过线性回归发现某两个指标之间过去的线性关系,并以此来预测未来走势,这个操作方法可以用散点图——添加趋势线——选择回归类型(线性)来得出简单的结论。
说了这么多,列举 Excel 数据分析的一个常见运用。
大家知道,金融领域的工作往往要考察搭建财务模型的技巧,而这个模型就是完完全全从 0 开始通过 Excel 制作的。
1. 计算各项指标了解公司的历史经营状态。这一步不仅可以看出公司在盈利能力、成长性、营运能力等多个维度的历史发展状况,还可以与同行业的可比公司进行比较,看出这个公司所处的地位(比如公司的应收账款周转率可以直观看出公司是强势地位还是弱势地位,应收账款周转率如果显著低于同业,那就说明应收账款很容易收到,议价能力强)。
2. 预测公司未来的盈利状况,并通过财务报表的勾稽关系完善财务模型。这一步一定要打开 Excel 的自动迭代功能(选项——公式——启用迭代计算),具体的财务方面知识在此就不再详述。
3. 现金流 DCF 模型及敏感性分析。以之前制作的财务报表为基础,就可以测算出公司未来的自由现金流,在计算出公司资本成本的前提下对现金流进行贴现得到公司绝对估值。其中,基于不同的资本成本和公司永续增长率还可以做成敏感性分析的表格,得出在不同情形下公司的估值。这就需要使用Excel的数据——模拟运算——模拟运算表功能了。如下图所示,将输入引用行的单元格和引用列的单元格分别设为 Equity Valuation 中的永续增长率和Wacc对应的数值,就可以实现啦。
以上这些介绍都只是冰山一角,Excel的功能博大精深,加上VBA等高端操作将会释放更大的威力。配合现当代大数据盛行时期。想要深入,就还得不断学习!
- ?
学习大数据分析,从哪里开始学习,怎么学?
冯水彤
展开
业务分析是巨大的!业务分析有助于决定如何使用数据,以及可以使用哪些模型来做出更好的业务决策。业务分析可以被称为“企业的数据科学”。尽管有许多模型可用于做出业务决策,但业务分析有助于识别最佳模型。
2.业务分析是一个使用组织中可用的所有统计数据达成建设性结论的程序/研究。组织雇用业务分析专家,评估公司以前的报告,以了解他们是否正确进行。过去的报告有助于他们评估即将发生的事件是否有利于组织或反对。在这两种情况下,对公司都有利。如果企业处于正确的轨道,他们仍然可以改善,如果没有,那么它可以帮助他们找到解决办法来纠正这个问题。
3.首先要掌握基础数学和统计学。了解为什么和在哪里使用平均值,中位数和模式。在你开始之前,你需要爱上你的数据,这是我的教授所说的。当你写关于女朋友的诗,你必须知道我可以从中知道什么。不要用大数据驱动我的误解或数据分析是hadoop,spark等框架。当然,他们有助于更快地获得结果,但逻辑与我们如何将数据转化为有用的信息。按照array老师的视频课程。无论你是学生还是做任何工作,如果你能知道你做什么,那就很容易根据它来找到答案。
4.
· 了解统计信息和多变量统计信息
· 学习SQL和数据库
· 学习编码(Python,R)
· 学习使用新的非结构化数据类型
· 参加MOOC课程数据科学课程(Coursera,Udacity等)
· 考虑数据科学或数据分析的研究生学位
5.您应该深入分析计算的基础知识。您应该了解可扩展性,容错能力,复制性,开放性,地理独立性等分布式编程中的问题。要分析大数据,您需要对统计信息或机器学习有较好的了解。您也可以使用Hadoop,HBase,Hive等分析大数据的工具。DBMS的基础知识也是首选。要使用任何大数据工具,如hadoop,您应该知道一种编程语言(比如Java或Python)。如果要集中精力编程大数据,从分布式计算开始,然后尝试设置一个hadoop集群(单节点,然后是多节点)。我们公司的一个java开发在学Hadoop,别人给了他一套视频,我看了看从基础入门、生态圈组件、商业项目讲解都挺详细的。需要视频的可以到他鹏you圈留言,你可以通过TBanna521找到他。
- ?
数据分析:一切用数据说话
喜洋洋
展开
数据分析是增长黑客日常工作中的基本组成部分。产品功能逻辑越复杂,用户量越大,涉及的利益方越多,数据分析的成本和要求就越高。据统计,今天的互联网中,每60秒会产生10万条Twitter微博、50万次Facebook互动、400万次信息搜索。在纷繁复杂的世界里,学会通过量化的方法观测世界,才能更好地理解和玩转一切。
进行数据分析的首要环节是明确分析的目的。脱离具体目标的单纯数据查看没有任何价值。在有些公司里,向数据支持部门索取数据,需要提交相应的流程,转交给对应的负责人进行手动查询。如果分析目的不明确,无疑是在耽误整体项目进度,浪费他人的时间。好的增长黑客懂得有的放矢,杜绝意义不明的数据索取需求。
其次是要了解数据来源的相关信息,包括各项指标的定义、采集点和上报机制。在一家公司内,不同部门关注的指标可能不尽相同。开发人员警惕代码编写中的错误率,产品人员在意每次版本迭代的留存率,而市场人员将更多目光聚焦在推广费用的投入产出比上。
在大部分情况下,各部门通力合作,但也偶尔存在利益冲突的情况。比如在eBay这样的电商平台,很容易就陷入这样的混乱局面:有的人认为买家数量最重要,有的人认为利润最重要,还有人反驳说卖家数量才是关键。实际上,如果问一问eBay的核心领导,他们就会告诉你真正的指标是商品价值量,以及eBay网站上的活跃卖家在全球电商平台的占比。这就需要一套自上而下推行的核心指标作为共识,来凝聚团队劲往一处使。在Facebook,马克·扎克伯格在公司内部大力推行的核心指标是月活跃用户数,而非像其他社交网络如MySpace、Compact那样关注注册用户数量。
在公司内部强调核心指标,意味着员工磋商问题时即便核心领导者不在场,或者不同业务组之间暂时产生矛盾对立时,人们脑子里依然能清清楚楚地界定:对公司发展而言什么是必须严格恪守的,什么是应当暂时妥协的,什么又是能无憾放弃的。这一理念在思路易发散的团队中尤其重要,很多时候它能终结一场无意义的会议,把更多时间花在产出。
不同产品对指标的定义应当建立在品类特性和自身提供的服务核心价值之上。对一款即时通信应用而言,每日启动用户的数量远不如消息发送量重要。如果人们每天打开你的产品在线挂机,却从来不怎么聊天,那即使再庞大的用户基数也不具备价值。
- ?
成为一名数据分析师,必须掌握的技术,学会了你就是大神
洪惜海
展开
一:编程能力
是否会编程是区别初级数据分析师和高级数据分析师的分水岭。在这里,我定位的是高级数据分析师,所以编程能力尤为重要,我把它放在了第一位。
有关数据分析的编程语言有Python和R语言。R语言倾向于统计分析、绘图等。统计学家或者学统计学的喜欢用R语言,而我推荐学习Python,因为Python是面向未来的语言,无论从流行度、可用性还是学习难度来讲,Python都是最好的入门语言。
当然,如果可以的话,再掌握一下R语言是最好不过的,学习嘛,永无止尽。
书籍推荐《Python编程:从入门到实践》 豆瓣评分:9.0
当然,只有Python基础肯定是不够的,既然是学习数据分析,肯定就要有数据才行,数据从哪里来,肯定是从互联网上来。互联网上的信息何其之多,必须要对其加以过滤处理,提取我们想要的信息。这就要用到Python爬虫,这也是学Python一个很重要的目的和作用。
学习Python爬虫肯定比学习Python基础要困难一下,但好在网上的学习资源十分丰富,努力学习必定会有收获的。
关于Python爬虫的书籍,目前我还没有较好的书籍推荐,如果说实在要推荐的话,我推荐三本书:
《Python网络数据采集》 豆瓣评分:7.7
《Python爬虫开发与项目实战》 豆瓣评分:8.1
《精通Scrapy网络爬虫》 这是十月份出的新书,豆瓣上还没有评分。
知乎里面有很多爬虫大神,没事多逛逛知乎总会有收获的。
关于编程能力,是一个很深的概念,需要靠大量的撸代码积累经验。先暂且说到这些。
二:SQL
学习数据分析,最难最重要的就是编程能力,熬过去了,后面的就稍微简单一些了。
既然是跟数据打交道,就免不了要使用数据库。
目前主要有四种数据库:
1:SQLite 是一个文件型轻量级数据库,它的处理速度很快,在数据量不是很大的情况下,可以使用SQLite。
2:MySQL 是一个应用极其广泛的关系型数据库,它是开源免费的,可以支持大型数据库,很多中小型企业都是用的MySQL。
3:MongoDB 是一个面向文档的非关系型数据库,它功能强大、灵活、易于拓展。
4:Redis 是一个使用ANSI C 编写的高性能key-value数据库,使用内存作为主存储器。
它们各有优点,可以灵活使用,如果说非要选一个的话,我建议使用MySQL,因为它使用最广泛。学习最主流的技术,可以在一定程度上发挥更大的作用。
关于SQL的学习资源:
购买书籍推荐《SQL基础教程》作者:MICK
豆瓣评分:9.0,好像这本书出了第二版了,建议购买最新版的。
三:数据分析能力
前面说了那么多,都是为了数据分析做准备。数据分析就好比亲手做一顿美食,现在食材有了(通过Python爬虫采集),盛放美食的容器也有了(数据库)。现在就差开火做饭了,写到这感觉肚子饿了,哎呀,忍住。
对于数据分析,我还没有过多的涉足,总之,多看书,多做项目。
这里我推荐几本书(都是放在我购物车里还没有买的书)
学习数据分析必看的书单:
《Python数据分析基础》八月份的新书,豆瓣上还没有评分。
《利用Python进行数据分析》2013年的老书,豆瓣评分:8.5
《Python数据处理》六月份的新书,豆瓣上没有评分。
《用数据讲故事》 豆瓣评分:8.7
虽然我还没来得及看这几本书,但是我想认真看了之后,对于数据分析的理解肯定会更加深刻的。
四:数据可视化
现在美食做好了,但不能一股脑的装在碗里吧,美食讲究色香味俱全。所以要给它作一个漂亮的造型,呈现在客人面前。这就是数据可视化。
数据可视化需要借助工具,什么工具呢?那就是大名鼎鼎的tableau!
什么?你没有听说过tableau?现在听我说了也不迟,哈哈。
tableau是一款世界级的商业智能工具软件,tableau可以帮助我们快速的分析、可视化并分享信息。在福布斯2017年公布的《10大需求增长最快的职场技能》报告中,tableau高居第三,成为数据分析和可视化的职场必杀技。
说了这么多,咱们还是好好聊聊怎么学习tableau吧。tableau是一款收费软件,先看一下它的价格吧:
image
果然优秀的软件都是收费的,而且还贵的要死。
但是,tableau的良心之处在于:学生和教师可以免费使用tableau,只需要用我们的学生证信息去免费申请一个序列码,然后就可以下载激活该软件,有效期为1年,如果一年后还是学生的话,还可以用学生证再去申请一个序列号,然后再免费用一年。
- ?
纯干货!教你如何快速学会大数据分析
爵迹
展开
什么是大数据分析?
大数据分析是指对规模巨大的数据进行分析。大数据可以概括为4个V, 数据量大(Volume)、速度快(Velocity)、类型多(Variety)、价值(Value)。利用大数据分析的技术,将海量数据以多维数据分析的形式表示,从不同的维度对数据进行更深入的观察和分析
大数据分析的六个基本方面
大数据分析生命周期的三个阶段
获取:结合传统数据构架与新数据结合,更快更好管理
分析:注重分析数据并形成洞察力
行动:利用洞察力为企业创造价值
大数据分析的应用
随着大数据的发展,大数据分析广泛应用在各行各业,其中在金融与零售行业应用较为广泛
大数据只是一个空洞的商业术语,当然,这并不是说大数据没有具体意义,只是对于不同的人有不同的含义。
A、对于投资人和创业者而言,大数据是个热门的融资标签,如今每一家互联网公司都急于把自己标榜为大数据公司
B、对于大多数互联网公司或者工程师而言,大数据实际上只有一个意思,就是把一堆乱七八糟的数据扔到 HDFS 上面然后进行计算
C、对于消费者或者互联网所谓的“用户“来说,大数据的意思的就是尽可能地搜集跟终端消费者相关的隐私,然后进行营销
大数据分析的成功案例(以百度大数据为例)
百度大数据中心与峨眉山景区强强联合,从搜索行为、游客人群、景区定制数据和百度舆情进行全面合作,以适应对数据的需求、掌控旅游发展的趋势;大数据合作为做好未来旅游发展奠定了重要的基础,能够做到早发现、早分析、早应对,对及时的做好精准营销、社群营销和网络营销都有积极的帮助,无疑是以大数据支撑“互联网+旅游”落地的极佳案例。
学会用数据分析
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并