- ?
数据分析师该有是什么思维又是如何练出来的?
易烟
展开
一名数据分析师的日常工作流是怎样的?
数据分析师这个职位,不同的公司,不同的行业,对于它的理解,以及它覆盖的工作范围不太一样。在有些传统行业,数据分析师工作重点是做行业报告等;在阿里巴巴等大型互联网公司,职位区分比较明确,数据分析师大部分时间只做产品和运营的分析工作,至于基础数据处理、搭建数据产品等等不涉及;在创业公司等相对小型公司,数据分析师要干的活可能要不仅仅是产品和运营分析,基础数据采集和处理,数据产品搭建都属于数据分析师的工作范围。
明确了数据分析师的工作范围,大概也就清楚了每天要做些什么,比如:
产品和运营的数据提供(正常分析师工作)
基础数据采集和处理(类似ETL工作)
数据产品的思考和搭建(类似数据产品经理工作)
数据价值的挖掘(类似数据挖掘工程师工作)
每日的工作流大概如下:
上午:日常项目的跟进,包括跟产品,运营,开发同学的沟通,这部分主要通过Tower和项目PM每天的邮件来互相协作和周知进度,当然,每个项目会有5-10分钟晨会;
每天不定时:日常运营需求的沟通比较多,这个主要是面对面,固化需求以后,邮件周知和记录;
下午晚点和晚上:数据平台自己的活,包括基础数据开发、数据产品搭建等等,就需要我们自己去安排时间完成。创业公司的一个优点就是人员相对少,大家互相协作都是面对面。
如何进行时间和日程管理?
数据分析师工作因为涉及内容比较多,所以经常会被产品/运营叫过去讨论某些项目,营销活动,等等,或者,被不同业务线主管召唤,讨论如何对某个业务线效果进行深入分析,所以,很多时候自己计划的什么时间干什么事情,基本得不到保障。就算得不到保障,每天早上过来以后,也要大概列清楚今天要干的几件事情,提醒自己去抽时间做完。每做完一件事情,就划掉。尽管有很多工具使用,比如,Trello,但是我还是喜欢一个笔记本,一支笔的方式。
时间是一个很奇怪的东西,只要你想要,它就来到你身边。比如,我想晚饭后来写采访的内容,就会拒绝同事邀请去做其他事情。我看过很多时间管理方面的书,也尝试过番茄等各种方法,最后发现,任何想基于时间安排去做时间管理的方法都很难有很好的效果,反而,基于待做工作来做时间管理,更合适。
比如,今天需要做三件事情,按照轻重缓急排序,1)2)3),然后就开始做,不想需要多少时间做完,尽量自己控制时间把它做完。很多人可能觉得这样很糟糕,万一做不完怎么办啊。其实,你自己尝试一下就行了,为什么自己会不得不、不情愿也要做、非要做完。因为,第二天工作又来了,今天做不完,明天这些工作还是你的。除了一浪一浪每天工作的累加的压迫,它更需要一个人的自」。如果有点时间就刷微信,微博,或者找同事闲扯几句,很容易打断工作流,所以最好是一气呵成。不管计划如何完美,如果没有自律,也没有结果。
数据分析师的思维是如何练出来的?
可能提到数据分析师这个职业,思维是被提到最多的一个词。或许这个跟数据分析师思考比较多,沟通过程中更理性,让大家得到的错觉。个人觉得,任何一个职业,任何一个人都应该有一套自己的思维体系和一个好的思维方式。数据分析师的思维仅仅是其中的一个不同的看世界的方式。比如,每个人的思维是一条道路,条条大道通罗马,虽然每个人看世界的方式不一样,但是可能得到的结果一样。
想知道数据分析师思维,首先要了解思维是什么,buang一下,得到思维的定义:
①思维与“感性认识”相对。指理性认识,即思想;或指理性认识的过程,即思考。是人脑对客观事物间接的和概括的反映。包括逻辑思维和形象思维,通常指逻辑思维。
②与“存在”相对。指意识、精神。
显然,定义①是我们这里想讨论的思维。这个定义也清楚的说明了思维是每个人看世界的方式。
数据分析师通过数据来认识产品/业务,所以,它确实有一套跟别人不一样的思维,即类统计学的逻辑思维。除了这个之外,其他基本跟其他同学一样。
从我打篮球、乒乓球的经历,加上5年数据分析师的体验来说,很难通过一些简单的训练就学会某种思维方式,主要还是要自己在工作过程中通过实际的案例多踏几个坑,多开拓眼界来学习。所谓九折臂而成医,大概如此。
在这里分享给大家我平时常用的方法:
看书,看别人的总结。学习大牛是如何认识世界,分析案例,比如《穷查理宝典》——查理芒格,《把时间当做朋友》——李笑来,《系统思维》——德内拉·梅多斯,等等,分析为什么这些作者的思维如此的独特?我和他们认识世界的方式为什么不一样?我们彼此的认识事物的方式哪个更好,哪个更接近真相?为什么他们看到的世界是这样,而我是这样?多问问为什么,多找差异,然后再去找其他的书看,一步步丰富自己。这些作者可能也没得到真相,而是他们可能距离真相近一点。
学会举一反三。做分析师,非常需要举一反三的能力。去食堂吃饭,看到排队的效率如此低,分析一下为啥效率这么低?我们的产品上某个地方是不是也有类似的效率问题?滴滴打车这种叫车模式,我们的产品可以用么?为什么不能用?反正,多问几个为什么,多举一反三,思考,思考。对或者」有些时候不重要,重要的是我们感知世界的能力在变化。
研究别人家的产品和别人家的数据。比如,我非常推荐新的分析师看各个公司的财报。为什么呢?一个大公司的财报如果能看懂了,基本就了解了一个公司的运作模式和重要产品,也明白了如何写一份报告。再者,研究别人家的产品,不管是工具类还是用户类,看看他们的交互,设计,体验上怎么会不一样,别人的用户数为什么是这个,而我们的是多少?
关注经济和社会新闻,多串联起来看新闻。北京大雨了,河北大雨了,南方干旱,南北方需要什么?我们的产品是否能提供这些东西?长征7号上天了,哪些东西可能会不一样?多把不同事物串联起来想,思考,分析。总结一下,数据分析师要有一个系统、整体和部分的思维,也要有一个事物类比思维,更要对事物敏感,可以很迅速的把不同的事物串联起来(敏感),很快的抓到事物的本质特征(类似思维),然后局部整体的来分析和研究(系统思维)。
如何进行跨领域学习?
其实,数据分析师经常面临跨领域,只不过跨的大和小的区别。比如,我之前在阿里妈妈研究广告的竞价,来到空格研究共享经济、服务,也算是一个很大的跨领域。从分析方法和研究产品的角度来说,两者没有差别,但是研究的领域确实不一样了。跨领域学习和交流对于分析师来说还是比较重要的,毕竟,我们不能保证自己所做的东西都是拿手或者了解过的,很多业务和产品都是新产品,新业务,自己要保证快速的跟上。
跨领域学习其实没有那么难。很多事物都是相似的,比如,足球和桌上足球相似,足球和篮球在某些方面也相似,乒乓球和篮球,其实在练习方法上,技巧上也有一些共同的地方。分析师研究产品和业务也一样。如果学会了分析事物背后变化发展规律,也就不存在跨不跨领域学习的问题,比如,一个用户留存模型,即适合Facebook的研究,也适合Uber的研究,为什么呢?因为用户使用产品过程中,行为和体验过程是类似的。
大家可能都被教育过,看事情要看本质,不要浮于表面。这个对于分析师来说更重要。如果看懂了一个商业模式,比如共享经济的模式,不管它是滴滴,还是Airbnb,还是空格,基于大众参与的闲置资源的使用权的让渡特征是不会变的,唯一不同的是三种产品运营和用户体验上的差异。所以,推荐大家建立一套自己认识事物的思维模式。
就像一个VC,或者巴菲特,为什么他们可以投资不同的行业的公司和买不同的股票,为什么他们能看懂看准呢?因为他们各自都有一套认识世界和事物运作的思维模式,这套通用的模式会让他们在跨领域的投资中都能受益。
所以,大家不要局限于怎么样跨领域学习,怎么样学习,学习些什么,以为学了这么多肯定就无所不知,通行天下,但你看到的星星还是星星,太阳还是太阳,从没发现太阳出来了,星星不见了;太阳下山了,月亮出来了的天体运行规律。
归根结底,跨领域学习,要学一套认识事物的思维模式,而不是一点点具体的知识。推荐大家学习一下投资公司评估公司价值的一些原则和方法。还有,可以看看《易经》等从系统和整体上看待事物相关的书籍,锻炼自己系统思维和「凡事看本质的」能力。
数据分析的本质是什么?
查理芒格说过一句话:不要做一个股票分析家,而是做一个商业分析家。
对于数据分析来说,不管我们通过何种分析方法,挖掘算法,还是数据可视化,都是为了分析和研究产品,以及使用产品的人,而产品和人会给我们带来商业上的利益。做产品的目的是为了让别人使用,成立公司是为了获得商业的最大化利润。所以归根结底,数据分析的目的是更好的了解使用产品的人的行为,体验和想法,基于这些了解,再做产品上的改变,获得商业的利益最大化。
比如,很多互联网公司都要分析用户行为路径,为什么要分析这个呢?如果我们非常清楚的知道用户怎么进来,去了哪里,哪里看的多,哪里看的少,从什么地方跳失,我们就可以优化产品的交互和设计,让用户的体验更好,让用户点击我们想让他们点击的东西,从而实现我们产品上的某些成功。
为什么亚马逊会通过分析用户购买的东西,做推荐算法?如果可以找到每个人购买的东西,然后根据概率计算出TA可能潜在购买的商品,然后在用户经过的页面上放上概率大的这些商品,用户购买的概率就会高很多。一切都为了更好的了解用户,服务用户,最终让用户买更多的东西(或者留存率高,可以卖更多广告)。所以,一个好的「数据分析师」是一个好的「商业分析家」。
额外的努力有多重要?
之前在其他文章中提到数据建模的影响,这个额外的努力对于当时的我来说,就是一个爱好和兴趣,没想到会通过它得到什么。最后因为喜欢数据建模而做了数据分析师,只能用看似偶然其实必然来解释了。大家可能都听过一句话:从来没有白费的努力。我也非常认同。
不说努力,就谈工作之外的看似额外的事情吧,比如,看书,运动,听公开课,业余时间学学某种语言,跟有趣的人交流一下,做自己喜欢的晚饭,研究一下一年的节气变化,跟朋友出游自己计划路线,等等,这些很生活,很情趣,看似跟工作不相关的事情,真的不相关么?
工作是什么?工作需要具备什么技能?工作需要解决什么问题?工作需要面对什么?这些问题都是生活的一个侧面,什么侧面?工作需要面对人,工作要解决人喜欢不喜欢你的产品的问题,工作需要具备规划、思考、沟通、观察等技能。
跟有趣的人交流是不是会更好的了解人?研究一下一年的节气变化是不是需要一个研究和思考的过程?跟朋友出游自己计划路线是不是需要一个更好的规划的能力?这些看似不相关的东西都在让我们潜移默化中的某些技能得到提高。
因为大学里面没有数据分析师这个专业,所以,公司招聘数据分析师从来不是按照专业来招聘,而是通过面试考察候选者是否有独立思考、善于观察、有研究精神等特质。只要一个人具备了某种技能,TA一定能干好所有的事情。所以,没有什么额外的,只有你不去观察、体会和思考。
时间花在哪里,收获就在哪里(就算是天天吃东西,也一样会有收获)。喜欢做一件事情的时候,从来没有感觉我竟然在花时间。
- ?
如何判断自己是否适合做数据分析师?
虞迎彤
展开
现如今90%的企业都在利用数据分析为其带来更加便利的服务,从而数据分析师这类人才可谓供不应求。但是并不是所有的数据分析师都配上当下的薪资,很多数据分析师一直都原地踏步,一两年后还是未能升职加薪,这都是有原因的。
那么如何判断自己是否合适做数据分析师呢?
首先,小编觉得无论做什么工作,兴趣都是最重要的,要做数据分析师最基本的就是不讨厌数字,如果你跟他讲那个指标是通过怎么样的乘除加减得到的,他都会觉得不耐烦,那么显然他不适合做数据分析;如果对数据较敏感,能够一眼发现异常值,数据分布情况,这当然是最好的。
再则就是逻辑性了,可以试试爱因斯坦的那道最经典的逻辑题,看看能否解出来,需要多久;逻辑思维对数据分析是尤其重要的,不然会被各种指标的定义规则、与业务的联系纠结死,逻辑思维好的人写SQL等数据处理脚本也会更加的高效。
然后就是业务理解能力,最简单的就是先定义下网站的目标是什么,哪些指标可以作为KPI,用户从进入网站到达成网站目标的整个过程是怎么实现转化的,能否画出业务流程图。
如果偏技术则需要懂一些数据库结构和SQL,如果偏展现需要考验下对图表的掌控能力,什么时候用什么图表合适,甚至如何配色。
最后就是细心、耐心和交流能力,做数据分析有时会很纠结,细心和耐心是必需的,好的交流能力可以让数据分析师更好地阐述清楚各类问题。
以上这些都是比较基础的东西,也是短期难以培养起来的技能。至于另外业务相关的一些知识,可以通过培训获取,问一个未接触过你的网站业务的人一些业务知识其实有些不公平,其实如果具备上面几点,一旦熟悉网站和业务之后,一定会成为优秀的数据分析师。
数据分析师具备技能
● 数据挖掘算法
● 软件建模运用
● 行业案例演练
● 宏观业务决策
总结
如果以上你都有,但如何快速获得岗位专业知识?自学还是接受培训?以下建议可供参考:
自学可以学习到编程技巧,但学不会数据思维和数据挖掘方法,如果是零基础或者刚入门建议通过参加培训系统学习一下相关知识。后续在实践中如果有发现有不足的地方可以通过自学进行补充。
参加培训有老师辅导,会少走很多弯路;同时有不懂的你可以问老师,学习起来会轻松一些。
参加培训会有一个学习和交流的圈子,学习氛围比较好,可以相互交流,共同成长;
分享 IT 技术和行业经验,请关注-技术学派。
- ?
大数据到底是干什么用的?
青词
展开
大数据这个词已经被炒的满天飞,还有的人说它是泡沫,现在什么东西即使没用大数据技术也要加个大数据概念,要不都觉得落伍了,当然这是迎合宣传的手段,不过搞虚假宣传还是不太好的。那真正使用大数据技术的地方且比较有代表性的产品有那些:
·云存储:中国比较好的有百度云,国外比较好的有AWS等。正是因为有这些产品的出现,数据在云端的概念才终于变成现实了,大家都不用踹着U盘到处跑了。
·内容推荐:最具代表性的有今日头条,它正是运用了大数据技术来找到你喜欢的内容并且推荐给你。自从这个产品出现以后已经有很多人抛弃以前的新闻阅读方式。它让网易新闻、新浪新闻、腾讯新闻等产品上了不少火。现在大家都开始纷纷的学习它。
·物品推荐:电影网站、音乐网站、电商网站这些网站都会把根据你的浏览行为进行分析,根据你的兴趣推荐给你相应的物品,比如爱奇艺、QQ音乐、京东等。
·广告计算:应用比较好的有百度、谷歌、淘宝、腾讯,他们要根据广告主的价格和广告的效果计算广告的排序,好在流量中达到最好的变现效果,这时数据的处理速度与数据的量级直接影响了他们的收入。
·金融:银行正使用大数据分析用户的消费行为、购买能力以及还款能力,用来降低提供给用户的贷款风险,减少环帐率。
·信用:支付宝的芝麻信用加入了更多的维度,比如你的人际关系、学历、车等等元素来评估你的信用值,给信用值高的人提供更好的服务,比如信用度高住酒店就不用交押金。
·数据分析:这个具有代表性的产品不多,但确是大数据应用非常主要的场景,一般都是公司内部定制性的,所以一般不公开,但确实各种公司都在用,比如网站的流量分析、相关产品的用户特性分析、微博的语义分析。可以根据这些分析为自己的业务或者产品发展方向提供决策依据。
·智慧城市:这个现在比较有代表性的功能就是可以根据人流控制路灯的亮度,可以达到省电的效果。通过车流控制红绿灯的变化,减少道路拥堵。
正是有了大数据处理技术的应用才使以上这些方面有了更好的发展,如果没有大数据处理技术的出现那可能就会因为数据太多处理不过来或者根本就无法处理。那自然就会导致一些业务的发展落后或者根本无法进行的。当然未来大数据的应用场景将会越来越多,比如物联网、人工智能等等。前景十分看好。
如果以上这些你都不了解那我就再举个更俗的例子,就是”你一撅屁股我就知道你要拉什么屎“。这是因为你对某个人或物接触时间长了,知道了对方足够多的信息,促进了你对事物的认知,从而就能更了解这个事物并预测到它下一步动作。大数据处理技术也就是这么个过程,它的过程可以分为收集,处理,分析识别、预测这四个步骤。其实就是模拟人类对事物认知这个过程并把这个过程程序化、海量化。
还觉得大数据是泡沫的您还这么想吗?可别再继续无知下去了。
- ?
什么叫大数据分析
寻真
展开
大数据行业发展如火如荼,国家政策利好,互联网大佬纷纷在大数据行业布局,我们想让自己的职业生涯在一个朝阳行业发展,肯定又要学习相关技术,让自己与时俱进,但是难就难在大数据是一个新兴事物,目前我国大学的专业里面还鲜少有这个专业,国家刚批的大数据专业,全国目前35个高校,但是从17年开始招生,2021年才有第一批毕业生进入职场,在四年期间,是大数据行业发展的飞速时期,没有行业发展是等着人才进入的,而是需要要虚位以待、蓄势待发,所以在没有高等教育准备好的大数据教育,如何高效的学习大数据,如何快速的与行业发展想契合,那么需要我们成为第一个吃螃蟹的人,作为一个随着大数据行业成长的职业人,首先要知道大数据是个啥?
大数据(big data),指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。
那来帮大家分析下:如何高效的学习大数据。
经常有初学者会问,自己想往大数据方向发展,该学哪些技术,学习路线是什么样的,觉得大数据很火,就业很好,薪资很高……首先,如果你确定了想往这个方面发展,先考虑自己的过去从业经历、专业、兴趣是什么。计算机专业——操作系统、硬件、网络、服务器?软件专业——软件开发、编程、写代码?还是数学、统计学专业——对数据和数字特别感兴趣?
那么你能找师傅带吗?
但凡有这种想法的人,或多或少都会存有侥幸之心,或者叫做“天真,单纯”。希望不花一分钱,就能更快速的学到更优质,更实用的技能。
关于这一点,我只想反问一句你:“如果你是大师,你凭什么愿意带我?”
其实这就是想告诉你大数据的三个发展方向,平台搭建/优化/运维/监控、大数据开发/设计/架构、数据分析/挖掘。
先说一下大数据的4V特征:
数据量大,TB->PB
数据类型繁多,结构化、非结构化文本、日志、视频、图片、地理位置等;
商业价值高,但是这种价值需要在海量数据之上,通过数据分析与机器学习更快速的挖掘出来;
处理时效性高,海量数据的处理需求不再局限在离线计算当中。
现如今,正式为了应对大数据的这几个特点,开源的大数据框架越来越多,越来越强,先列举一些常见的:
文件存储:Hadoop HDFS、Tachyon、KFS
离线计算:Hadoop MapReduce、Spark
流式、实时计算:Storm、Spark Streaming、S4、Heron
K-V、NOSQL数据库:HBase、Redis、MongoDB
资源管理:YARN、Mesos
日志收集:Flume、Scribe、Logstash、Kibana
消息系统:Kafka、StormMQ、ZeroMQ、RabbitMQ
查询分析:Hive、Impala、Pig、Presto、Phoenix、SparkSQL、Drill、Flink、Kylin、Druid
分布式协调服务:Zookeeper
集群管理与监控:Ambari、Ganglia、Nagios、Cloudera Manager
数据挖掘、机器学习:Mahout、Spark MLLib
数据同步:Sqoop
任务调度:Oozie
······
第一步:初识Hadoop
1.1 学会百度与Google
不论遇到什么问题,先试试搜索并自己解决。
Google首选,翻不过去的,就用百度吧。
1.2 参考资料首选官方文档
特别是对于入门来说,官方文档永远是首选文档。
相信搞这块的大多是文化人,英文凑合就行,实在看不下去的,请参考第一步。
1.3 先让Hadoop跑起来
Hadoop可以算是大数据存储和计算的开山鼻祖,现在大多开源的大数据框架都依赖Hadoop或者与它能很好的兼容。
关于Hadoop,你至少需要搞清楚以下是什么:
· Hadoop 1.0、Hadoop 2.0
· MapReduce、HDFS
· NameNode、DataNode
· JobTracker、TaskTracker
· Yarn、ResourceManager、NodeManager
自己搭建Hadoop,请使用第一步和第二步,能让它跑起来就行。
建议先使用安装包命令行安装,不要使用管理工具安装。
另外:Hadoop1.0知道它就行了,现在都用Hadoop 2.0.
1.4 尝试使用Hadoop
· HDFS目录操作命令;
· 上传、下载文件命令;
· 提交运行MapReduce示例程序;
· 打开Hadoop WEB界面,查看Job运行状态,查看Job运行日志。
· 知道Hadoop的系统日志在哪里。
1.5了解它们的原理
MapReduce:如何分而治之;
HDFS:数据到底在哪里,什么是副本;
Yarn到底是什么,它能干什么;
NameNode到底在干些什么;
ResourceManager到底在干些什么;
1.6 自己写一个MapReduce程序
仿照WordCount例子,自己写一个(照抄也行)WordCount程序,
打包并提交到Hadoop运行。
不会Java的话,Shell、Python都可以,有个东西叫Hadoop Streaming。
如果能认真完成了以上几步,恭喜你,你的一只脚已经进来了。
第二步:更高效的WordCount
2.1 学点SQL吧
如果不懂数据库的童鞋先学习使用SQL句。
2.2 SQL版WordCount
在1.6中,你写(或者抄)的WordCount一共有几行代码?
如果用SQL的话:
SELECT word,COUNT(1) FROM wordcount GROUP BY word;
这便是SQL的魅力,编程需要几十行,甚至上百行代码,SQL一句就搞定;使用SQL处理分析Hadoop上的数据,方便、高效、易上手、更是趋势。不论是离线计算还是实时计算,越来越多的大数据处理框架都在积极提供SQL接口。
2.3 安装配置Hive
Hive算是数据仓库工具,安装不难,网上有很多教程,配置完成后,可以正常进入Hive命令行。
2.4 试试使用Hive
尝试在Hive中创建wordcount表,并运行2.2中的SQL语句。在Hadoop WEB界面中找到刚才运行的SQL任务。看SQL查询结果是否和1.4中MapReduce中的结果一致。
明明写的是SQL,为什么Hadoop WEB界面中看到的是MapReduce任务?
2.5 学会Hive的基本命令
创建、删除表;加载数据到表;下载Hive表的数据;并学习更多关于Hive的语法和命令。
0和Hadoop2.0的区别
MapReduce的原理(还是那个经典的题目,一个10G大小的文件,给定1G大小的内存,如何使用Java程序统计出现次数最多的10个单词及次数);
HDFS读写数据的流程;向HDFS中PUT数据;从HDFS中下载数据;
自己会写简单的MapReduce程序,运行出现问题,知道在哪里查看日志;
会写简单的SELECT、WHERE、GROUP BY等SQL语句;
Hive SQL转换成MapReduce的大致流程;
Hive中常见的语句:创建表、删除表、往表中加载数据、分区、将表中数据下载到本地;
从上面的学习,你已经了解到,HDFS是Hadoop提供的分布式存储框架,它可以用来存储海量数据,MapReduce是Hadoop提供的分布式计算框架,它可以用来统计和分析HDFS上的海量数据,而Hive则是SQL On Hadoop,Hive提供了SQL接口,开发人员只需要编写简单易上手的SQL语句,Hive负责把SQL翻译成MapReduce,提交运行。
第三步:把别处的数据搞到Hadoop上
此处也可以叫做数据采集,把各个数据源的数据采集到Hadoop上。
3.1 HDFS PUT命令
put命令在实际环境中也比较常用,通常配合shell、python等脚本语言来使用。建议需熟练掌握。
3.2 HDFS API
HDFS提供了写数据的API,自己用编程语言将数据写入HDFS,put命令本身也是使用API。
实际环境中一般自己较少编写程序使用API来写数据到HDFS,通常都是使用其他框架封装好的方法。比如:Hive中的INSERT语句,Spark中的saveAsTextfile等。
可以尝试了解原理,试着写几个Demo。
3.3 Sqoop
Sqoop是一个主要用于Hadoop/Hive与传统关系型数据库Oracle/MySQL/SQLServer等之间进行数据交换的开源框架。
就像Hive把SQL翻译成MapReduce一样,Sqoop把你指定的参数翻译成MapReduce,提交到Hadoop运行,完成Hadoop与其他数据库之间的数据交换。
自己下载和配置Sqoop(建议先使用Sqoop1,Sqoop2比较复杂)。
了解Sqoop常用的配置参数和方法。
使用Sqoop完成从MySQL同步数据到HDFS;
使用Sqoop完成从MySQL同步数据到Hive表;
PS:如果后续选型确定使用Sqoop作为数据交换工具,那么建议熟练掌握,否则,了解和会用Demo即可。
3.4 Flume
Flume是一个分布式的海量日志采集和传输框架,因为“采集和传输框架”,所以它并不适合关系型数据库的数据采集和传输。Flume可以实时的从网络协议、消息系统、文件系统采集日志,并传输到HDFS上。因此,如果你的业务有这些数据源的数据,并且需要实时的采集,那么就应该考虑使用Flume。
下载和配置Flume。使用Flume监控一个不断追加数据的文件,并将数据传输到HDFS;
PS:Flume的配置和使用较为复杂,如果你没有足够的兴趣和耐心,可以先跳过Flume。
3.5 阿里开源的DataX
之所以介绍这个,是因为以前某公司客户目前使用的Hadoop与关系型数据库数据交换的工具,就是之前基于DataX开发的,个人感觉非常好用。现在DataX已经是3.0版本,支持很多数据源。你也可以在其之上做二次开发。
PS:有兴趣的可以研究和使用一下,对比一下它与Sqoop。
至此,你的“大数据平台”应该是这样的:
第四步:把Hadoop上的数据搞到别处去
前面介绍了如何把数据源的数据采集到Hadoop上,数据到Hadoop上之后,便可以使用Hive和MapReduce进行分析了。那么接下来的问题是,分析完的结果如何从Hadoop上同步到其他系统和应用中去呢?
其实此处的方法和第三步基本一致的。
4.1 HDFS GET命令
把HDFS上的文件GET到本地。需要熟练掌握。
4.2 HDFS API
原理同3.2。
4.3 Sqoop
原理同3.3。
使用Sqoop完成将HDFS上的文件同步到MySQL;
使用Sqoop完成将Hive表中的数据同步到MySQL;
4.4 DataX
原理同3.4
此时,“你的大数据平台”应该是这样的:
走完第三步和第四步的流程,那么你应该已经具备以下技能和知识点:
· 知道如何把已有的数据采集到HDFS上,包括离线采集和实时采集;
· 知道sqoop(或者还有DataX)是HDFS和其他数据源之间的数据交换工具;
· 知道flume可以用作实时的日志采集;
至此,对于大数据平台,应该已经掌握如何搭建Hadoop集群,把数据采集到Hadoop上,使用Hive和MapReduce来分析数据,把分析结果同步到其他数据源。
接下来的问题就是,Hive使用的越来越多,你会发现很多不愉快的地方,特别是速度慢,
大多情况下,明明我的数据量很小,它都要申请资源,启动MapReduce来执行。
第五步:快一点吧,我的SQL
其实大家都已经发现Hive后台使用MapReduce作为执行引擎,实在是有点慢。因此SQL On Hadoop的框架越来越多,按我的了解,最常用的按照流行度依次为SparkSQL、Impala和Presto.这三种框架基于半内存或者全内存,提供了SQL接口来快速查询分析Hadoop上的数据。
目前我们的方案使用的是SparkSQL,至于为什么用SparkSQL,原因大概如下:
· 使用Spark还做了其他事情,不想引入过多的框架;
· Impala对内存的需求太大,没有过多资源部署;
5.1 关于Spark和SparkSQL
什么是Spark,什么是SparkSQL。
Spark有的核心概念及名词解释。
SparkSQL和Spark是什么关系,SparkSQL和Hive是什么关系。
5.2 如何部署和运行SparkSQL
Spark有哪些部署模式?
如何在Yarn上运行SparkSQL?
使用SparkSQL查询Hive中的表。
PS:Spark不是一门短时间内就能掌握的技术,因此建议在了解了Spark之后,可以先从SparkSQL入手,循序渐进。
第六步:一夫多妻制
其实我想说的是数据的一次采集、多次消费。
在实际业务场景下,特别是对于一些监控日志,想即时的从日志中了解一些指标(关于实时计算,后面步节会有介绍),这时候,从HDFS上分析就太慢了,尽管是通过Flume采集的,但Flume也不能间隔很短就往HDFS上滚动文件,这样会导致小文件特别多。
为了满足数据的一次采集、多次消费的需求,这里要说的便是Kafka。
6.1 关于Kafka
Kafka是一种高吞吐量的分布式发布订阅消息系统,它可以处理消费者规模的网站中的所有动作流数据。这种动作(网页浏览,搜索和其他用户的行动)是在现代网络上的许多社会功能的一个关键因素。这些数据通常是由于吞吐量的要求而通过处理日志和日志聚合来解决。
6.2 如何部署和使用Kafka
使用单机部署Kafka,并成功运行自带的生产者和消费者例子。
使用Java程序自己编写并运行生产者和消费者程序。
Flume和Kafka的集成,使用Flume监控日志,并将日志数据实时发送至Kafka。
至此,“大数据平台”应该扩充成这样:
这时,使用Flume采集的数据,不是直接到HDFS上,而是先到Kafka,Kafka中的数据可以由多个消费者同时消费,其中一个消费者,就是将数据同步到HDFS。
总结:
为什么Spark比MapReduce快。
使用SparkSQL代替Hive,更快的运行SQL。
使用Kafka完成数据的一次收集,多次消费架构。
自己可以写程序完成Kafka的生产者和消费者。
前面的学习已经掌握了大数据平台中的数据采集、数据存储和计算、数据交换等大部分技能,而这其中的每一步,都需要一个任务(程序)来完成,各个任务...
- ?
什么是数据、什么叫分析?这才是数据分析!
乐蕊
展开
你说是个笑话也可以,但是确实说明了一个道理!
一个哥们,有次聚会时说自己买了很多条iphone数据线,家里每个房间插一条,走到哪儿都能随时充电·····
在场的姑娘们都当成是段子笑笑就过去了,只有一个细心的姑娘悄悄问他买了多少条,他说:42条!
现在她和他在北京三环内总共42个房间的数套豪宅里愉快地生活,已定好日子:下个月结婚!
这,就是数据分析!
如果你是她,你会反问他吗?如果你是他,你会理解她对数据的分析吗?
- ?
数据分析的目的有哪些?
Walkom
展开
说到数据分析,其实很简单,就是找到问题、来解决问题。在做SEM数据分析之前,首先要了解数据,为什么要分析数据?通过数据分析可以获得什么?
因此,正常的数据分析过程应该是:确定分析的目的→收集所需的数据→组织数据→分析数据→获得优化意见。
数据是我们调整账户的基础。对于刚入门的竞价员来说,数据分析很难理解。由于关键字报告、创意报告、搜索词报告、对话词报告、转化词报告中的出价数据太多,新手常常不知道怎么开始,此时你需要冷静下来,整理每个报告,过滤并查找有效数据以进行比较。
管理过这么多账户,凭借我们团队的经验,今天以快速掌握SEM数据分析进行讲解。
首先,您需要了解SEM数据名词的含义。点击率是多少?转化率是多少?跳出率是多少?等一系列技术术语,例如帐户点击率下降,您需要清楚地知道哪些因素会导致点击率下降,接下来应该做什么;调整帐户后,您必须清楚地知道哪些数据会发生变化,否则一切都是浪费时间。以下是两个月教育行业的数据案例。
数据整理后,复杂的数据将变得清晰。经验丰富的SEMer将知道对上图所示账户进行了哪些调整:这组数据是典型的流量不精准分析图,根据公司政策调整减少消费,平移展现下降、点击下降、对话下降、这些都是正常的数据范围,但是我们消费的下降,应该降低我们的转化成本,这组数据中我们的转化成本并没有降低,反而高出了1块钱,这就说明我们在降低消费时,没有控制我们的精准流量进来,还是以泛流量的方式进行优化账户,(当然这组数据的转化成本是指精准客户转化不是所有的转化成本)这就造成我们降低消费的同时没有一个合理的优化方案去优化账户。
数据 - ?
你真的懂什么是数据分析么?
白思柔
展开
你明白为什么要分析数据么?
说实话,这个问题我自己思考过无数遍,也和很多同事聊过,目前我最认同的还是前老板一句总结:数据是用来反馈经营现实,并帮助管理者指导经营的。
话说出来很简单,但要时刻用这个标准来衡量我们做的数据分析是否有意义却是一个不容易的事儿。很多情况是调取了一堆数据,做各种环比、同比,各种横向、纵向比较,各种占比等等,每个指标你还都能准确找出他们代表的经营现实么?
如果你发现你只能分析出最简单、最基本的数据变化原因的话,那我觉得你应该去实际业务中去看一看、聊一聊、做一做了,数据分析工作绝不是仅在电脑前就能完成的!
当你真的了解业务后,你会发现你具备一种很重要的能力:你可以很轻松的判断一个数据是否可靠!是的,你没听错,即使这个数据在别人看来是多么正常,即使这个数据是SQL跑出来的,你可以1秒钟就告诉领导,这个数据并不准确,我们还是重新核实一下吧!
用数据分析业务,用业务衡量数据!
BY BoraBora
数据分析 - ?
什么样的人比较适合做数据分析?
代珊
展开
我觉得无论什么工作兴趣最重要,要做数据分析师最基本的就是不讨厌数字,如果你跟他讲那个指标是通过怎么样的乘除加减得到的,他会觉得不耐烦,那么显然他不适合做数据分析;如果对数据较敏感,能够一眼发现异常值,数据分布情况,当然是最好的。
再则就是逻辑性,可以让他试试爱因斯坦的那道经典的逻辑题,看看能否解出来,需要多久;逻辑思维对数据分析尤其重要,不然会被各种指标的定义规则、与业务的联系纠结死,逻辑思维好的人写SQL等数据处理脚本也会更加高效。
接着是业务理解能力,最简单的就是让他定义下网站的目标是什么,哪些指标可以作为KPI,用户从进入网站到达成网站目标的整个过程是怎么实现转化的,能否画出业务流程图。(宏观层面,不要深入细节)
如果偏技术则需要懂一些数据库结构和SQL,如果偏展现需要考验下对图表的掌控能力,什么时候用什么图表合适,甚至如何配色。
最后就是细心、耐心和交流能力,做数据分析有时会很纠结,细心和耐心是必需的,好的交流能力可以让数据分析师更好地阐述清楚各类问题。
这些都是比较基础的东西,也是短期难以培养起来的技能。至于另外业务相关的一些知识,可以通过培训获取,问一个未接触过你的网站业务的人一些业务知识其实有些不公平,其实如果具备上面几点,一旦熟悉网站和业务之后,一定会成为优秀的数据分析师。
——谷芬芬
专业内的要求基本就是对数据的意识和一些技能的掌握。下面具体说说从一些非专业内要求的方面出发,有哪些方面能表现这个人更适合数据分析。
首先是看到数据有兴奋感的人。有兴奋感说明你有兴趣,那说明很会有意愿把数据分析好。
其次是愿意学习的人。你分析的内容永远不会一尘不变,即使你分析的主题是相对固定,但业务是变化的,你需要不断的学习业务,同不同人沟通,吸收别人的观点。所以分析师一定要报着学习的态度。
然后是逻辑思维较强的人。数据分析师想要把你的分析好,一定要有结论思维。
还有就是较强的表达与沟通能力。因为数据分析最终价值的实现,一般来说不会是分析师亲自去制定或者实施。所以你一定很有条理、逻辑清晰向别人表达,让业务方认识到你分析结果的价值,从而影响业务方去愿意使用你从数据中得到的观点。
——欧阳帅
觉得还是应该先看清楚自己的未来的方向吧~
我有不少朋友 非数学/计算机/统计学 专业毕业的朋友走的是这个方向,数据相关,非技术路线,更偏向于市场方向,对技术的要求只是Excel、PPT,最多要求SPSS,很少要求会写SQL。这条路线看起来比较高大上,可以走外企路线。
数据分析师方向,很多读数学、统计学、计算机的童鞋会选这个方向,终极目标都是成为数据中心的负责人。中间有2个分叉,一条是从数据分析师到数据产品经理,这个路线最近很流行,主要是结合了数据分析和产品经理的能力。一条是高大上一点的数据挖掘方向,这条路线要求比较高,但薪资也高。当然能走数据挖掘路线是很多数据分析师的梦想,但算法和代码实现能力不是谁都能掌握的。.
根据你自己想走的路,加上自己的技能点。
——张锦华
想了解更多相关内容,记得持续关注我们哦。
如果你觉得有点意思,请有秩序的评论、转发、收藏。
- ?
什么是数据分析、数据分析本质又是什么?
保罗
展开
一般情况下,我们所说的分析是指,使用大量数据、统计和定量分析、解释和预测以及基于事实的管理来推动决策过程与实现价值增生。
根据分析的方法和目的,分析可以被划分为描述性分析(descri-ptive analytics)、预测性分析(predictive analytics)和规范性分析(prescriptive analytics)。描述性分析包括数据收集、整理、制表、制图以及描述正要研究的食物的特征,这类分析以往被称为“报告”。描述性分析可能非常有用,但它不能解释某种结果出现的原因或者未来可能会发生的事情。
预测性分析不仅可以对数据特征和变量(可以假定取消范围的因素)之间的关系进行描述,还可以基于过去的数据预测未来。预测性分析首先会确定变量值之间的关联,然后基于这种已知的关联预测另一种现象出现的可能性,比如在看到某个广告后,一位消费者可能会去买产品的可能性。虽然预测性分析中的预测是基于变量之间的关系做出来的,但这不代表预测性分析中都需要明确因果关系。事实上,准确的预测并不一定与需要基于因果关系。
规范性分析是更高层次的分析,如实验设计和优化等。就像医生会在出处方建议患者采取什么行动一样,实验设计试图通过做实验给出某些事情发生的原因。为了能够在因果关系研究中信心饱满地做出推断,研究人员必须妥善处理一个或多个独立的变量,并有效控制其他的变量。如果处于试验环境下的测试组的表现大大优于照相,决策制定者就应该立即推广这种实验环境。
优化是规范性分析采用的一种方法,指试图识别出一个特定变量和另一个变量之间理想的关系水平。例如,我们可以能会对识别最有可能让产品实现高收益的价格感兴趣。同样地,优化这种方法能够识别出使了零售企业最大限制避免缺货情况的库存水平。
根据分析采用的方法以及收集和分析的数据类型,我们可以将分析分为定性分析(qualitative analysis)和定量分析(quantitative analysis)。定性分析的目的是深入了解某种现象的根本原因和诱因。非结构化数据通常是从少数非代表性案例中收集而来,并进行了非统计性分析。定量分析是分析的最初阶段,他通常是探索性分析的有效工具,定量分析是指通过统计、数学或者计算的方式对现象进行系统的实证研究。通常情况下,结构化数据是从大量典型案例中收集而来,并进行统计分析。
为了服务于研究者的不同研究目的,存在以下几种类型的分析:
*统计学:收集、整理、分析、说明和呈现数据的学科;
*预测:根据已有数据,预测一下一些感兴趣的变量在未来某个特定的时间点的情况;
*数据挖掘:通常使用算法和统计技术,自动或半自动地提取大量数据中未知的有趣模式;
*文字挖掘:用类似数据挖掘的方式从文本中得模式和趋势的过程;
*优化:在同时满足约束条件的情况下,按照某些标准利用数学方法来寻找最优的解决方案;
*实验设计:给各组随机分配被试。然后使用测试组和对照组来推导出特定结果中存在的因果关系。
虽然此处给出了一些列常用的分析方法,但在使用过程中会不可避免地出现相当大的重叠。例如,回归分析(regression analysis)是预测分析中最常用的方法,与此同时,他也是统计学、预测和数据挖掘中常用的方法。此外,时间序列分析(time seties analysis)是用于分析数据随时间变化的一种具体统计方法、在统计学和预测中经常被用到。
- ?
什么是数据分析?数据分析的作用是什么?
秋天里
展开
1.什么是数据分析?
数据分析的目的是把隐藏在一些看似杂乱无章的数据背后的信息提炼出来,总结出所研究对象的内在规律。在实际工作中,数据分析能够帮助管理者进行判断和决策,以便采取适当策略与行动。比如:企业的高管希望通过市场分析和研究,把握当前产品的市场动向,从而制定合理的产品研发和销售计划,这就必须依赖数据分析才能够完成。
简单的说,就是对数据进行分析,比较专业的说法是,数据分析是指用适当的统计分析方法对收集来的大量数据进行分析,未提取有用信息和形成结论而对数据加以详细研究和概括总结的过程。以求最大化地开发数据的功能,发挥数据的作用。
数据分析包含“数据”和“分析”两个方面一方面包括加工和整理数据,另一方面也包括分析数据,从中提取有价值的信息并形成对业务有帮助的结论。
数据分析的成果通常以分析报告的形式呈现。对于数据分析报告,分析就是论点,数据就是论据,两者缺一不可。
2.数据分析类别
其中,探索性数据分析侧重于在数据中发现新的特征,而验证性数据分析则侧重于验证已有假设的真伪证明。
数据分析的划分:描述性数据分析、探索性数据分析、验证性数据分析。
1)描述性数据分析:属于初级数据分析,常见的分析方法有对比分析法、平均分析法、交叉分析法。
2)探索性数据分析:侧重于再数据之中发现新的特征
3)验证性数据分析:侧重于验证已有假设的真伪证明
其中探索性数据分析和验证性数据分析属于高级数据分析,常见的分析方法有相关分析、因子分析、回归分析等等。
3.数据分析的作用
数据分析在日常企业运营中主要有三大作用:
1.现状分析
简单的说就是告诉你过去发生了什么。
具体表现在:
第一,告诉你企业现阶段的整体运营情况,通过各个经营指标的完成情况来衡量企业的运营状态,以说明企业整体运营是更好了还是坏了,好的程度是如何,坏的程度又到哪里。
第二,告诉你企业各项业务的构成,让你了解企业各项业务的发展及变动情况,对企业经营状况有更深入的了解。
现状分析一般通过日常通报来完成,如日报、周报、月报等形式。
2.原因分析
简单的说就是告诉你某一现状为什么发生。经过第一阶段的现状分析,我们对企业的运营情况有了一个基本的了解,但是不知道运营情况具体好在哪里,差在哪里,是什么原因引起的。这时候我们就需要开展原因分析,以进一步确定业务变动的具体原因。
原因分析一般通过专题分析来完成,根据企业运营情况选择针对某一现状进行原因分析。
3.预测分析
简单来说就是告诉你将来会发生什么。
在了解企业运营现状后,有时候还需要对企业未来发展趋势做出预测,为企业制定经营目标以及提供有效的策略参考与决策依据,以确保企业的可持续健康发展。
预测分析一般通过专题分析来完成,通常在制定企业季度、年度等计划时进行,其开展的频率没有现状分析及原因分析高。
什么时候开展什么样的数据分析,需要根据自身的需求及目的来确定。
分享 IT 技术和行业经验,请关注-技术学派。
数据分析是做什么的
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并