中企动力 > 商学院 > 数据分析主要学什么
  • ?

    什么是数据分析、数据分析本质又是什么?

    Palma

    展开

    一般情况下,我们所说的分析是指,使用大量数据、统计和定量分析、解释和预测以及基于事实的管理来推动决策过程与实现价值增生。

    根据分析的方法和目的,分析可以被划分为描述性分析(descri-ptive analytics)、预测性分析(predictive analytics)和规范性分析(prescriptive analytics)。描述性分析包括数据收集、整理、制表、制图以及描述正要研究的食物的特征,这类分析以往被称为“报告”。描述性分析可能非常有用,但它不能解释某种结果出现的原因或者未来可能会发生的事情。

    预测性分析不仅可以对数据特征和变量(可以假定取消范围的因素)之间的关系进行描述,还可以基于过去的数据预测未来。预测性分析首先会确定变量值之间的关联,然后基于这种已知的关联预测另一种现象出现的可能性,比如在看到某个广告后,一位消费者可能会去买产品的可能性。虽然预测性分析中的预测是基于变量之间的关系做出来的,但这不代表预测性分析中都需要明确因果关系。事实上,准确的预测并不一定与需要基于因果关系。

    规范性分析是更高层次的分析,如实验设计和优化等。就像医生会在出处方建议患者采取什么行动一样,实验设计试图通过做实验给出某些事情发生的原因。为了能够在因果关系研究中信心饱满地做出推断,研究人员必须妥善处理一个或多个独立的变量,并有效控制其他的变量。如果处于试验环境下的测试组的表现大大优于照相,决策制定者就应该立即推广这种实验环境。

    优化是规范性分析采用的一种方法,指试图识别出一个特定变量和另一个变量之间理想的关系水平。例如,我们可以能会对识别最有可能让产品实现高收益的价格感兴趣。同样地,优化这种方法能够识别出使了零售企业最大限制避免缺货情况的库存水平。

    根据分析采用的方法以及收集和分析的数据类型,我们可以将分析分为定性分析(qualitative analysis)和定量分析(quantitative analysis)。定性分析的目的是深入了解某种现象的根本原因和诱因。非结构化数据通常是从少数非代表性案例中收集而来,并进行了非统计性分析。定量分析是分析的最初阶段,他通常是探索性分析的有效工具,定量分析是指通过统计、数学或者计算的方式对现象进行系统的实证研究。通常情况下,结构化数据是从大量典型案例中收集而来,并进行统计分析。

    为了服务于研究者的不同研究目的,存在以下几种类型的分析:

    *统计学:收集、整理、分析、说明和呈现数据的学科;

    *预测:根据已有数据,预测一下一些感兴趣的变量在未来某个特定的时间点的情况;

    *数据挖掘:通常使用算法和统计技术,自动或半自动地提取大量数据中未知的有趣模式;

    *文字挖掘:用类似数据挖掘的方式从文本中得模式和趋势的过程;

    *优化:在同时满足约束条件的情况下,按照某些标准利用数学方法来寻找最优的解决方案;

    *实验设计:给各组随机分配被试。然后使用测试组和对照组来推导出特定结果中存在的因果关系。

    虽然此处给出了一些列常用的分析方法,但在使用过程中会不可避免地出现相当大的重叠。例如,回归分析(regression analysis)是预测分析中最常用的方法,与此同时,他也是统计学、预测和数据挖掘中常用的方法。此外,时间序列分析(time seties analysis)是用于分析数据随时间变化的一种具体统计方法、在统计学和预测中经常被用到。

  • ?

    什么是数据分析?数据分析的作用是什么?

    花缘灭

    展开

    1.什么是数据分析?

    数据分析的目的是把隐藏在一些看似杂乱无章的数据背后的信息提炼出来,总结出所研究对象的内在规律。在实际工作中,数据分析能够帮助管理者进行判断和决策,以便采取适当策略与行动。比如:企业的高管希望通过市场分析和研究,把握当前产品的市场动向,从而制定合理的产品研发和销售计划,这就必须依赖数据分析才能够完成。

    简单的说,就是对数据进行分析,比较专业的说法是,数据分析是指用适当的统计分析方法对收集来的大量数据进行分析,未提取有用信息和形成结论而对数据加以详细研究和概括总结的过程。以求最大化地开发数据的功能,发挥数据的作用。

    数据分析包含“数据”和“分析”两个方面一方面包括加工和整理数据,另一方面也包括分析数据,从中提取有价值的信息并形成对业务有帮助的结论。

    数据分析的成果通常以分析报告的形式呈现。对于数据分析报告,分析就是论点,数据就是论据,两者缺一不可。

    2.数据分析类别

    其中,探索性数据分析侧重于在数据中发现新的特征,而验证性数据分析则侧重于验证已有假设的真伪证明。

    数据分析的划分:描述性数据分析、探索性数据分析、验证性数据分析。

    1)描述性数据分析:属于初级数据分析,常见的分析方法有对比分析法、平均分析法、交叉分析法。

    2)探索性数据分析:侧重于再数据之中发现新的特征

    3)验证性数据分析:侧重于验证已有假设的真伪证明

    其中探索性数据分析和验证性数据分析属于高级数据分析,常见的分析方法有相关分析、因子分析、回归分析等等。

    3.数据分析的作用

    数据分析在日常企业运营中主要有三大作用:

    1.现状分析

    简单的说就是告诉你过去发生了什么。

    具体表现在:

    第一,告诉你企业现阶段的整体运营情况,通过各个经营指标的完成情况来衡量企业的运营状态,以说明企业整体运营是更好了还是坏了,好的程度是如何,坏的程度又到哪里。

    第二,告诉你企业各项业务的构成,让你了解企业各项业务的发展及变动情况,对企业经营状况有更深入的了解。

    现状分析一般通过日常通报来完成,如日报、周报、月报等形式。

    2.原因分析

    简单的说就是告诉你某一现状为什么发生。经过第一阶段的现状分析,我们对企业的运营情况有了一个基本的了解,但是不知道运营情况具体好在哪里,差在哪里,是什么原因引起的。这时候我们就需要开展原因分析,以进一步确定业务变动的具体原因。

    原因分析一般通过专题分析来完成,根据企业运营情况选择针对某一现状进行原因分析。

    3.预测分析

    简单来说就是告诉你将来会发生什么。

    在了解企业运营现状后,有时候还需要对企业未来发展趋势做出预测,为企业制定经营目标以及提供有效的策略参考与决策依据,以确保企业的可持续健康发展。

    预测分析一般通过专题分析来完成,通常在制定企业季度、年度等计划时进行,其开展的频率没有现状分析及原因分析高。

    什么时候开展什么样的数据分析,需要根据自身的需求及目的来确定。

    分享 IT 技术和行业经验,请关注-技术学派。

  • ?

    想要从事大数据实时分析都要学习哪些课程?

    宓夜蕾

    展开

    随着时代的发展社会的进步,大数据的发展越来越好,越来越多的人选择大数据,有同学问小编:“我想要从事大数据实时分析都要学习哪些课程?”,下面小编就给大家介绍一下从事大数据实时分析需要学习的课程。

    一、基础篇大数据实时分析需要学习的课程

    任何高楼大厦都离不开一个稳固的地基,想要从事大数据实时分析也是如此,首先打好基础,那么需要学习哪些知识呢,首先需要掌握一门基础语言,Java是非常学习大数据基础语言之一,我们还需要熟练掌控Linux系统的命令,还有要学一些数据库,Mysql这些,学习这些需要花费很长的时间,不要焦躁,要静下心来,打好基础才能把大楼盖上云霄,也相信你这时的付出会换取你将来的回报。

    二、进阶篇

    当你打好基础后就可以登堂入室了,来一见大数据的真容,这个阶段你需要学习的东西也非常的多其中包括Hadoop(包含 大数据的概述,hadoop集群的搭建,HDFS基础概念介绍,HDFS API案例,YARN资源调度框架介绍,Mapreduce介绍,Mapreduce案例),zookeeper,hbase,hive,学完这些还有一些比较难理解的就是python,spark,flume,kafka这些,这些可以说是学习大数据的第三阶段,学习完之后你完全可以去做大数据的任何工作,不过一些高端的工作是需要开发经验的,当你从事大数据几年之后我相信你也会走向这些高端工作,走向人生的高峰。

    三、spark实时分析

    如果你学会了上面的内容那么恭喜你,你已经成为了一名合格的大数据开发工程师,相信无论走到哪里都不用去担心工作和薪资的问题,如果你想做实时分析那么也是非常容易的,因为你已经学会了spark,可以做实时和离线分析。

    四、总结

    想学习任何的东西,都需要扎实的基础,都需要漫长的时间去学习,宝剑锋从磨砺出,梅花香自苦寒来,相信你今天的汗水化作明天别人的仰望。

  • ?

    数据分析师应该具备哪种基本能力?

    神州行

    展开

    在互联网时代,数据是重要的资源,随着数据的持续增长和大数据技术的成熟,数据分析变得越来越重要,要看清楚瞬息万变的网络世界,要知道表象背后的真相,非靠数据分析不可,不管是大数据分析还是传统数据分析,其本质是一样的。数据分析是为了通过对数据现象的查看来完成对产品,营销策略,运营策略的优化。达到最低成本,最优效果。因此,数据分析师对应的要求也越来越高。那么,作为一名优秀的数据分析师,需要有哪些基本能力,才能完成数据分析目标,保证结果的正确性?

    商业数据分析的根本目的就是要洞察数据背后的规律,基于此,企业可以制订决策、并采取相应措施和行动,进而达成想要的结果。这是商业数据分析的最大价值所在。

    数据分析的四个能力

    1. 对业务的理解能力

    数据分析之前,首先要进行的是业务梳理。只有在实践领域从事过数据分析工作,就会明白所有分析的重中之重都是业务知识本身。而业务知识的学习和掌握,需要的积累之深,培养一个业务专家,需要的周期之长,都远远超过后面所说的那些基本技能,成为业务专家实属不易,数据分析师其实是之于业务专家之上的更深层次的思考和总结,否则,谁指导谁都是个问题。业务学习的方式很多,比如将以前的分析报告和取数案例都拿过来研究一下,不懂就问,总是一个渐进的过程,但需要时间和行业的沉淀。数据分析师最需要不断提升的能力就是行业和业务知识,没有之一。

    提升业务理解能力有几个方法

    多使用产品本身,只有不断的尝试产品,体验和了解各种产品,才能在分析时有直观的思考和总结;与 产品相关的业务和技术同学沟通,尤其在进行数据理解和运营理解的时候,需要知道数据元素的含义以及当前运营的方式和形成这种运营方式的原因;多思考产品的内在逻辑,多问几个为什么,这样才不至于做分析方案的时候,遗漏其它的业务流程,或者进行错误的数据模型设计。2.有耐心,善于沟通

    数据处理和逻辑梳理需要足够的耐心,尤其是在各种数据格式不统一,数据表存放混乱,以及业务流程/逻辑异常复杂的情况下,作为数据分析师,一定要有足够的耐心,沉下来进行全面的数据流程确认,画出对应的流程图,理清分析重点。

    同时,数据分析贯穿BIT、数据、技术、业务整个链条,数据分析师将BIT最终转化成决策者理解的语言,跨越的流程很长,你需要面对不同的岗位,碰到不同的角色,采用不同的语言,表达你的要求和获得你需要的东西,成为数据和业务的桥梁,没有足够的沟通能力很难。所以,需要具备一定的沟通能力。在沟通之前,需要清楚的知道本次沟通的目的是什么,以及如何通过对方来达成自己有效数据分析的目标。与技术沟通,是理解参数含义,与运营沟通,是理解分析目标,与产品沟通,则是强调产品逻辑以及背后的思考。同时,如果你容易听取他人的意见,特别是智者的意见,则可以帮你找到另一条出路,你犯错的概率就会降低,相应的,你的分析就更有力量和说服力。

    3. 数据分析的技术

    数据分析有很多技术可以支持,包括SQL,Excle,SPSS,Matlab、Python等等,这些都是通过编程完成基本的数据分析语言编写,然后进行执行得出结果。

    因此,数据分析师必须掌握并精通一两种数据分析编程技巧。包括从数据仓库中获取数据,对数据进行清洗,简化,或者补全,处理数据,计算数据,最后进行可视化的表达。这样才能完成数据分析的目标。这种技术对产品和运营人员也非常重要,只有学会处理数据,分析数据,才能在每个决策上面有据可依。

    但在公司的数据分析中,你在看案例时,往往接触到的数据或使用的数据是局部的,因此,你的视野会受局限,在大多数公司里,很多数据分析师其实缺乏全局的数据视野,因为他不知道到底有多少数据,因此,永远只能在已知的数据里转圈圈,

    当然,大多数数据分析师可能不需要进行系统数据学习,在实践中慢慢熟悉就好了,但自顶向下的数据学习方式可以让你有一个更好的基础和更全局的数据视野。

    4.独立思考的能力

    数据分析并不仅仅是为了完成一些业务上面的数据需求和论证。数据分析者应该在理解业务的基础上,扩大自己的思考范围,提升洞察力。

    成为一个优秀的数据分析师,需要在不同的业务中进行磨练,同时需要足够的耐心和深入业务的思考进行决策支撑。一种客观,理性,同时又科学的数据分析心态是非常重要的,对于公司和产品的发展也是必需。

    数据总是在那里,它不会说话,你不仅要基于业务能力理解它,还要学会推演和分析,从中发现规律,迅速定位某个商业问题的关键属性和决定因素,形成自己独创性的见解,所谓心思缜密,滴水不漏,没有思考逻辑没有数据分析。而要形成独特的见解,则来自于个人不断的学习和思考,这里的学习更多的强调是跨领域和专业,思考则是更多的强调养成思考的习惯。思考本身就是一种实践,它可以将你的知识更加系统化和深入化,数据分析在一定程度上是用来验证思路和启发灵感的,“数据分析”从来不是“数据分析”本身,而是以“数据分析”为手段和表象,对业务的深刻理解、思考和判断。

    数据分析的四个层次

    描述性分析(Descriptive Analysis)诊断性分析(Diagnostic Analysis)预测性分析(Predictive Analysis)处方性分析(Prescriptive Analysis)描述性分析——发生了什么?

    如题目名字一样,该层次主要是对已经发生的事实用数据做出准确的描述。比如某企业本月订单签约额比上月增加2000万,至5500万,但是订单履约率从上月的98%下降到了95%,库存周转率从上月的0.8下降到了0.7。那么,这就是发生了什么?就需要去描述性分析。

    诊断性分析——为什么会发生?

    知道发生了什么,对我们的帮助不大,更重要的是,我们要明白为什么发生。比如经过分析,发现在描述性分析中提到的订单履约率下降的原因是成品生产不出来,无法完成交付。而成品生产不出来的原因则是部分原材料的供应商未能按时送货,导致原材料不齐套,无法开始生产。那么,这就是诊断性分析。

    预测性分析——可能会发生什么?

    基于上述两个层次的分析,我们发现了其中的规律,即原材料供应商的未能及时送货会影响成品订单的履约率。假如上月某原材料供应商A送货及时率只有70%,通过建模,我们可以预测本月该供应商会使我们的订单履约率下降2%。那么,这就是预测性分析。

    处方性分析——我们该做些什么?

    有了预测性分析的结果后,我们无需再做事后诸葛亮,而可以运筹帷幄,在事前就采取措施。上述中,供应商A会导致本月我们的订单履约率下降,我们可能采取的措施就是把A换掉,但是现在有B和C两个供应商供我们选择,该选择哪个呢?通过分析和计算得出:选用供应商B会比选C的订单履约率高1%,因此建议选择供应商B。这就是处方性分析。

    四个层次层层递进,经过这四个层次的分析以后,可以对企业的决策和行动提供有力支撑。

    分享 IT 技术和行业经验,请关注-技术学派。

  • ?

    什么叫大数据分析

    你不在

    展开

    大数据行业发展如火如荼,国家政策利好,互联网大佬纷纷在大数据行业布局,我们想让自己的职业生涯在一个朝阳行业发展,肯定又要学习相关技术,让自己与时俱进,但是难就难在大数据是一个新兴事物,目前我国大学的专业里面还鲜少有这个专业,国家刚批的大数据专业,全国目前35个高校,但是从17年开始招生,2021年才有第一批毕业生进入职场,在四年期间,是大数据行业发展的飞速时期,没有行业发展是等着人才进入的,而是需要要虚位以待、蓄势待发,所以在没有高等教育准备好的大数据教育,如何高效的学习大数据,如何快速的与行业发展想契合,那么需要我们成为第一个吃螃蟹的人,作为一个随着大数据行业成长的职业人,首先要知道大数据是个啥?

    大数据(big data),指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。

    那来帮大家分析下:如何高效的学习大数据。

    经常有初学者会问,自己想往大数据方向发展,该学哪些技术,学习路线是什么样的,觉得大数据很火,就业很好,薪资很高……首先,如果你确定了想往这个方面发展,先考虑自己的过去从业经历、专业、兴趣是什么。计算机专业——操作系统、硬件、网络、服务器?软件专业——软件开发、编程、写代码?还是数学、统计学专业——对数据和数字特别感兴趣?

    那么你能找师傅带吗?

    但凡有这种想法的人,或多或少都会存有侥幸之心,或者叫做“天真,单纯”。希望不花一分钱,就能更快速的学到更优质,更实用的技能。

    关于这一点,我只想反问一句你:“如果你是大师,你凭什么愿意带我?”

    其实这就是想告诉你大数据的三个发展方向,平台搭建/优化/运维/监控、大数据开发/设计/架构、数据分析/挖掘。

    先说一下大数据的4V特征:

    数据量大,TB->PB

    数据类型繁多,结构化、非结构化文本、日志、视频、图片、地理位置等;

    商业价值高,但是这种价值需要在海量数据之上,通过数据分析与机器学习更快速的挖掘出来;

    处理时效性高,海量数据的处理需求不再局限在离线计算当中。

    现如今,正式为了应对大数据的这几个特点,开源的大数据框架越来越多,越来越强,先列举一些常见的:

    文件存储:Hadoop HDFS、Tachyon、KFS

    离线计算:Hadoop MapReduce、Spark

    流式、实时计算:Storm、Spark Streaming、S4、Heron

    K-V、NOSQL数据库:HBase、Redis、MongoDB

    资源管理:YARN、Mesos

    日志收集:Flume、Scribe、Logstash、Kibana

    消息系统:Kafka、StormMQ、ZeroMQ、RabbitMQ

    查询分析:Hive、Impala、Pig、Presto、Phoenix、SparkSQL、Drill、Flink、Kylin、Druid

    分布式协调服务:Zookeeper

    集群管理与监控:Ambari、Ganglia、Nagios、Cloudera Manager

    数据挖掘、机器学习:Mahout、Spark MLLib

    数据同步:Sqoop

    任务调度:Oozie

    ······

    第一步:初识Hadoop

    1.1 学会百度与Google

    不论遇到什么问题,先试试搜索并自己解决。

    Google首选,翻不过去的,就用百度吧。

    1.2 参考资料首选官方文档

    特别是对于入门来说,官方文档永远是首选文档。

    相信搞这块的大多是文化人,英文凑合就行,实在看不下去的,请参考第一步。

    1.3 先让Hadoop跑起来

    Hadoop可以算是大数据存储和计算的开山鼻祖,现在大多开源的大数据框架都依赖Hadoop或者与它能很好的兼容。

    关于Hadoop,你至少需要搞清楚以下是什么:

    · Hadoop 1.0、Hadoop 2.0

    · MapReduce、HDFS

    · NameNode、DataNode

    · JobTracker、TaskTracker

    · Yarn、ResourceManager、NodeManager

    自己搭建Hadoop,请使用第一步和第二步,能让它跑起来就行。

    建议先使用安装包命令行安装,不要使用管理工具安装。

    另外:Hadoop1.0知道它就行了,现在都用Hadoop 2.0.

    1.4 尝试使用Hadoop

    · HDFS目录操作命令;

    · 上传、下载文件命令;

    · 提交运行MapReduce示例程序;

    · 打开Hadoop WEB界面,查看Job运行状态,查看Job运行日志。

    · 知道Hadoop的系统日志在哪里。

    1.5了解它们的原理

    MapReduce:如何分而治之;

    HDFS:数据到底在哪里,什么是副本;

    Yarn到底是什么,它能干什么;

    NameNode到底在干些什么;

    ResourceManager到底在干些什么;

    1.6 自己写一个MapReduce程序

    仿照WordCount例子,自己写一个(照抄也行)WordCount程序,

    打包并提交到Hadoop运行。

    不会Java的话,Shell、Python都可以,有个东西叫Hadoop Streaming。

    如果能认真完成了以上几步,恭喜你,你的一只脚已经进来了。

    第二步:更高效的WordCount

    2.1 学点SQL吧

    如果不懂数据库的童鞋先学习使用SQL句。

    2.2 SQL版WordCount

    在1.6中,你写(或者抄)的WordCount一共有几行代码?

    如果用SQL的话:

    SELECT word,COUNT(1) FROM wordcount GROUP BY word;

    这便是SQL的魅力,编程需要几十行,甚至上百行代码,SQL一句就搞定;使用SQL处理分析Hadoop上的数据,方便、高效、易上手、更是趋势。不论是离线计算还是实时计算,越来越多的大数据处理框架都在积极提供SQL接口。

    2.3 安装配置Hive

    Hive算是数据仓库工具,安装不难,网上有很多教程,配置完成后,可以正常进入Hive命令行。

    2.4 试试使用Hive

    尝试在Hive中创建wordcount表,并运行2.2中的SQL语句。在Hadoop WEB界面中找到刚才运行的SQL任务。看SQL查询结果是否和1.4中MapReduce中的结果一致。

    明明写的是SQL,为什么Hadoop WEB界面中看到的是MapReduce任务?

    2.5 学会Hive的基本命令

    创建、删除表;加载数据到表;下载Hive表的数据;并学习更多关于Hive的语法和命令。

    0和Hadoop2.0的区别

    MapReduce的原理(还是那个经典的题目,一个10G大小的文件,给定1G大小的内存,如何使用Java程序统计出现次数最多的10个单词及次数);

    HDFS读写数据的流程;向HDFS中PUT数据;从HDFS中下载数据;

    自己会写简单的MapReduce程序,运行出现问题,知道在哪里查看日志;

    会写简单的SELECT、WHERE、GROUP BY等SQL语句;

    Hive SQL转换成MapReduce的大致流程;

    Hive中常见的语句:创建表、删除表、往表中加载数据、分区、将表中数据下载到本地;

    从上面的学习,你已经了解到,HDFS是Hadoop提供的分布式存储框架,它可以用来存储海量数据,MapReduce是Hadoop提供的分布式计算框架,它可以用来统计和分析HDFS上的海量数据,而Hive则是SQL On Hadoop,Hive提供了SQL接口,开发人员只需要编写简单易上手的SQL语句,Hive负责把SQL翻译成MapReduce,提交运行。

    第三步:把别处的数据搞到Hadoop上

    此处也可以叫做数据采集,把各个数据源的数据采集到Hadoop上。

    3.1 HDFS PUT命令

    put命令在实际环境中也比较常用,通常配合shell、python等脚本语言来使用。建议需熟练掌握。

    3.2 HDFS API

    HDFS提供了写数据的API,自己用编程语言将数据写入HDFS,put命令本身也是使用API。

    实际环境中一般自己较少编写程序使用API来写数据到HDFS,通常都是使用其他框架封装好的方法。比如:Hive中的INSERT语句,Spark中的saveAsTextfile等。

    可以尝试了解原理,试着写几个Demo。

    3.3 Sqoop

    Sqoop是一个主要用于Hadoop/Hive与传统关系型数据库Oracle/MySQL/SQLServer等之间进行数据交换的开源框架。

    就像Hive把SQL翻译成MapReduce一样,Sqoop把你指定的参数翻译成MapReduce,提交到Hadoop运行,完成Hadoop与其他数据库之间的数据交换。

    自己下载和配置Sqoop(建议先使用Sqoop1,Sqoop2比较复杂)。

    了解Sqoop常用的配置参数和方法。

    使用Sqoop完成从MySQL同步数据到HDFS;

    使用Sqoop完成从MySQL同步数据到Hive表;

    PS:如果后续选型确定使用Sqoop作为数据交换工具,那么建议熟练掌握,否则,了解和会用Demo即可。

    3.4 Flume

    Flume是一个分布式的海量日志采集和传输框架,因为“采集和传输框架”,所以它并不适合关系型数据库的数据采集和传输。Flume可以实时的从网络协议、消息系统、文件系统采集日志,并传输到HDFS上。因此,如果你的业务有这些数据源的数据,并且需要实时的采集,那么就应该考虑使用Flume。

    下载和配置Flume。使用Flume监控一个不断追加数据的文件,并将数据传输到HDFS;

    PS:Flume的配置和使用较为复杂,如果你没有足够的兴趣和耐心,可以先跳过Flume。

    3.5 阿里开源的DataX

    之所以介绍这个,是因为以前某公司客户目前使用的Hadoop与关系型数据库数据交换的工具,就是之前基于DataX开发的,个人感觉非常好用。现在DataX已经是3.0版本,支持很多数据源。你也可以在其之上做二次开发。

    PS:有兴趣的可以研究和使用一下,对比一下它与Sqoop。

    至此,你的“大数据平台”应该是这样的:

    第四步:把Hadoop上的数据搞到别处去

    前面介绍了如何把数据源的数据采集到Hadoop上,数据到Hadoop上之后,便可以使用Hive和MapReduce进行分析了。那么接下来的问题是,分析完的结果如何从Hadoop上同步到其他系统和应用中去呢?

    其实此处的方法和第三步基本一致的。

    4.1 HDFS GET命令

    把HDFS上的文件GET到本地。需要熟练掌握。

    4.2 HDFS API

    原理同3.2。

    4.3 Sqoop

    原理同3.3。

    使用Sqoop完成将HDFS上的文件同步到MySQL;

    使用Sqoop完成将Hive表中的数据同步到MySQL;

    4.4 DataX

    原理同3.4

    此时,“你的大数据平台”应该是这样的:

    走完第三步和第四步的流程,那么你应该已经具备以下技能和知识点:

    · 知道如何把已有的数据采集到HDFS上,包括离线采集和实时采集;

    · 知道sqoop(或者还有DataX)是HDFS和其他数据源之间的数据交换工具;

    · 知道flume可以用作实时的日志采集;

    至此,对于大数据平台,应该已经掌握如何搭建Hadoop集群,把数据采集到Hadoop上,使用Hive和MapReduce来分析数据,把分析结果同步到其他数据源。

    接下来的问题就是,Hive使用的越来越多,你会发现很多不愉快的地方,特别是速度慢,

    大多情况下,明明我的数据量很小,它都要申请资源,启动MapReduce来执行。

    第五步:快一点吧,我的SQL

    其实大家都已经发现Hive后台使用MapReduce作为执行引擎,实在是有点慢。因此SQL On Hadoop的框架越来越多,按我的了解,最常用的按照流行度依次为SparkSQL、Impala和Presto.这三种框架基于半内存或者全内存,提供了SQL接口来快速查询分析Hadoop上的数据。

    目前我们的方案使用的是SparkSQL,至于为什么用SparkSQL,原因大概如下:

    · 使用Spark还做了其他事情,不想引入过多的框架;

    · Impala对内存的需求太大,没有过多资源部署;

    5.1 关于Spark和SparkSQL

    什么是Spark,什么是SparkSQL。

    Spark有的核心概念及名词解释。

    SparkSQL和Spark是什么关系,SparkSQL和Hive是什么关系。

    5.2 如何部署和运行SparkSQL

    Spark有哪些部署模式?

    如何在Yarn上运行SparkSQL?

    使用SparkSQL查询Hive中的表。

    PS:Spark不是一门短时间内就能掌握的技术,因此建议在了解了Spark之后,可以先从SparkSQL入手,循序渐进。

    第六步:一夫多妻制

    其实我想说的是数据的一次采集、多次消费。

    在实际业务场景下,特别是对于一些监控日志,想即时的从日志中了解一些指标(关于实时计算,后面步节会有介绍),这时候,从HDFS上分析就太慢了,尽管是通过Flume采集的,但Flume也不能间隔很短就往HDFS上滚动文件,这样会导致小文件特别多。

    为了满足数据的一次采集、多次消费的需求,这里要说的便是Kafka。

    6.1 关于Kafka

    Kafka是一种高吞吐量的分布式发布订阅消息系统,它可以处理消费者规模的网站中的所有动作流数据。这种动作(网页浏览,搜索和其他用户的行动)是在现代网络上的许多社会功能的一个关键因素。这些数据通常是由于吞吐量的要求而通过处理日志和日志聚合来解决。

    6.2 如何部署和使用Kafka

    使用单机部署Kafka,并成功运行自带的生产者和消费者例子。

    使用Java程序自己编写并运行生产者和消费者程序。

    Flume和Kafka的集成,使用Flume监控日志,并将日志数据实时发送至Kafka。

    至此,“大数据平台”应该扩充成这样:

    这时,使用Flume采集的数据,不是直接到HDFS上,而是先到Kafka,Kafka中的数据可以由多个消费者同时消费,其中一个消费者,就是将数据同步到HDFS。

    总结:

    为什么Spark比MapReduce快。

    使用SparkSQL代替Hive,更快的运行SQL。

    使用Kafka完成数据的一次收集,多次消费架构。

    自己可以写程序完成Kafka的生产者和消费者。

    前面的学习已经掌握了大数据平台中的数据采集、数据存储和计算、数据交换等大部分技能,而这其中的每一步,都需要一个任务(程序)来完成,各个任务...

  • ?

    学习大数据分析,从哪里开始学习,怎么学?

    念烟

    展开

    业务分析是巨大的!业务分析有助于决定如何使用数据,以及可以使用哪些模型来做出更好的业务决策。业务分析可以被称为“企业的数据科学”。尽管有许多模型可用于做出业务决策,但业务分析有助于识别最佳模型。

    2.业务分析是一个使用组织中可用的所有统计数据达成建设性结论的程序/研究。组织雇用业务分析专家,评估公司以前的报告,以了解他们是否正确进行。过去的报告有助于他们评估即将发生的事件是否有利于组织或反对。在这两种情况下,对公司都有利。如果企业处于正确的轨道,他们仍然可以改善,如果没有,那么它可以帮助他们找到解决办法来纠正这个问题。

    3.首先要掌握基础数学和统计学。了解为什么和在哪里使用平均值,中位数和模式。在你开始之前,你需要爱上你的数据,这是我的教授所说的。当你写关于女朋友的诗,你必须知道我可以从中知道什么。不要用大数据驱动我的误解或数据分析是hadoop,spark等框架。当然,他们有助于更快地获得结果,但逻辑与我们如何将数据转化为有用的信息。按照array老师的视频课程。无论你是学生还是做任何工作,如果你能知道你做什么,那就很容易根据它来找到答案。

    4.

    · 了解统计信息和多变量统计信息

    · 学习SQL和数据库

    · 学习编码(Python,R)

    · 学习使用新的非结构化数据类型

    · 参加MOOC课程数据科学课程(Coursera,Udacity等)

    · 考虑数据科学或数据分析的研究生学位

    5.您应该深入分析计算的基础知识。您应该了解可扩展性,容错能力,复制性,开放性,地理独立性等分布式编程中的问题。要分析大数据,您需要对统计信息或机器学习有较好的了解。您也可以使用Hadoop,HBase,Hive等分析大数据的工具。DBMS的基础知识也是首选。要使用任何大数据工具,如hadoop,您应该知道一种编程语言(比如Java或Python)。如果要集中精力编程大数据,从分布式计算开始,然后尝试设置一个hadoop集群(单节点,然后是多节点)。我们公司的一个java开发在学Hadoop,别人给了他一套视频,我看了看从基础入门、生态圈组件、商业项目讲解都挺详细的。需要视频的可以到他鹏you圈留言,你可以通过TBanna521找到他。

  • ?

    成为一名数据分析师,必须掌握的技术,学会了你就是大神

    多余

    展开

    一:编程能力

      是否会编程是区别初级数据分析师和高级数据分析师的分水岭。在这里,我定位的是高级数据分析师,所以编程能力尤为重要,我把它放在了第一位。

      有关数据分析的编程语言有Python和R语言。R语言倾向于统计分析、绘图等。统计学家或者学统计学的喜欢用R语言,而我推荐学习Python,因为Python是面向未来的语言,无论从流行度、可用性还是学习难度来讲,Python都是最好的入门语言。

      当然,如果可以的话,再掌握一下R语言是最好不过的,学习嘛,永无止尽。

      书籍推荐《Python编程:从入门到实践》 豆瓣评分:9.0

      当然,只有Python基础肯定是不够的,既然是学习数据分析,肯定就要有数据才行,数据从哪里来,肯定是从互联网上来。互联网上的信息何其之多,必须要对其加以过滤处理,提取我们想要的信息。这就要用到Python爬虫,这也是学Python一个很重要的目的和作用。

      学习Python爬虫肯定比学习Python基础要困难一下,但好在网上的学习资源十分丰富,努力学习必定会有收获的。

      关于Python爬虫的书籍,目前我还没有较好的书籍推荐,如果说实在要推荐的话,我推荐三本书:

      《Python网络数据采集》 豆瓣评分:7.7

      《Python爬虫开发与项目实战》 豆瓣评分:8.1

      《精通Scrapy网络爬虫》 这是十月份出的新书,豆瓣上还没有评分。

      知乎里面有很多爬虫大神,没事多逛逛知乎总会有收获的。

      关于编程能力,是一个很深的概念,需要靠大量的撸代码积累经验。先暂且说到这些。

    二:SQL

      学习数据分析,最难最重要的就是编程能力,熬过去了,后面的就稍微简单一些了。

      既然是跟数据打交道,就免不了要使用数据库。

      目前主要有四种数据库:

      1:SQLite 是一个文件型轻量级数据库,它的处理速度很快,在数据量不是很大的情况下,可以使用SQLite。

      2:MySQL 是一个应用极其广泛的关系型数据库,它是开源免费的,可以支持大型数据库,很多中小型企业都是用的MySQL。

      3:MongoDB 是一个面向文档的非关系型数据库,它功能强大、灵活、易于拓展。

      4:Redis 是一个使用ANSI C 编写的高性能key-value数据库,使用内存作为主存储器。

      它们各有优点,可以灵活使用,如果说非要选一个的话,我建议使用MySQL,因为它使用最广泛。学习最主流的技术,可以在一定程度上发挥更大的作用。

      关于SQL的学习资源:

      购买书籍推荐《SQL基础教程》作者:MICK

      豆瓣评分:9.0,好像这本书出了第二版了,建议购买最新版的。

    三:数据分析能力

      前面说了那么多,都是为了数据分析做准备。数据分析就好比亲手做一顿美食,现在食材有了(通过Python爬虫采集),盛放美食的容器也有了(数据库)。现在就差开火做饭了,写到这感觉肚子饿了,哎呀,忍住。

      对于数据分析,我还没有过多的涉足,总之,多看书,多做项目。

      这里我推荐几本书(都是放在我购物车里还没有买的书)

      学习数据分析必看的书单:

      《Python数据分析基础》八月份的新书,豆瓣上还没有评分。

      《利用Python进行数据分析》2013年的老书,豆瓣评分:8.5

      《Python数据处理》六月份的新书,豆瓣上没有评分。

      《用数据讲故事》 豆瓣评分:8.7

      虽然我还没来得及看这几本书,但是我想认真看了之后,对于数据分析的理解肯定会更加深刻的。

    四:数据可视化

      现在美食做好了,但不能一股脑的装在碗里吧,美食讲究色香味俱全。所以要给它作一个漂亮的造型,呈现在客人面前。这就是数据可视化。

      数据可视化需要借助工具,什么工具呢?那就是大名鼎鼎的tableau!

      什么?你没有听说过tableau?现在听我说了也不迟,哈哈。

      tableau是一款世界级的商业智能工具软件,tableau可以帮助我们快速的分析、可视化并分享信息。在福布斯2017年公布的《10大需求增长最快的职场技能》报告中,tableau高居第三,成为数据分析和可视化的职场必杀技。

      说了这么多,咱们还是好好聊聊怎么学习tableau吧。tableau是一款收费软件,先看一下它的价格吧:

      image

      果然优秀的软件都是收费的,而且还贵的要死。

      但是,tableau的良心之处在于:学生和教师可以免费使用tableau,只需要用我们的学生证信息去免费申请一个序列码,然后就可以下载激活该软件,有效期为1年,如果一年后还是学生的话,还可以用学生证再去申请一个序列号,然后再免费用一年。

  • ?

    想从事数据分析师应该学什么专业好呢?就业现状怎么样?

    慕梅

    展开

    在回答“从事数据分析师学什么专业”这个问题之前,小编想先给大家介绍下数据分析这师的就业现状!

    一个优秀的数据分析师可以帮助企业根据现有数据做出科学、合理的分析,在前行中准确定位,为企业排除干扰,创造价值。数据分析师这个岗位的可以从事相关数据的职位有很多,如业务数据分析师、数据挖掘师、数据科学家、数据工程师等等。

    上海数据分析网

    业务/商业数据分析师(BA)是完全的咨询师设定,核心价值在分析框架+报告;

    数据科学家是完全的算法设定,核心价值在算法+数学;

    数据工程师是完全的程序员设定,核心价值在程序;

    其他还有建模分析师、数据架构师、数据产品等等;

    可以说数据分析师的就业面非常之广,在公司产生的价值与被重视程度不言而喻。

    小编从各大招聘网站找到国内三家大企业的招聘,从中可以发现企业对数据分析人才专业要求是怎样的。

    上海数据分析网

    可以看到职责描述里,第七条,数学、统计学、信息管理、计算机专业等。

    上海数据分析网

    岗位要求里,第一条:本科以上学历,统计学、数学、电子商务、计算机、市场营销等相关专业。

    上海数据分析网

    任职要求,第一条可以看到数学、统计学、数量经济学、计算机、营销学等相关专业。

    这几条招聘启事专业要求有数学、统计学、信息管理、计算机、电子商务、市场营销、数量经济学专业。这些专业具体都学些什么内容呢?

    数学

    随着科技事业的发展,数学专业和其他专业的联系也越来越紧密,所以数学专业知识也得广泛的应用。

    数据分析师需要有专业的数学功底和严密的逻辑思维,而严密的逻辑思维则来源于扎实的数学功底。 学数学的同学更注重理论的完备性和逻辑链的完整性,即对于在分析过程中出现的任何一些命题,都要能证明它是正确的还是错误的。

    统计学

    统计学贯穿数据分析的全过程,没有统计学基础,很难有专业的数据分析。数据分析的 各个步骤,都要用到统计学的知识。

    信息管理

    信管专业主要对各种“系统”进行分析、设计与实现,技术与管理的有机结合。学习内容:财务、系统数据分析、IT技术,可以说信管专业非常对口数据分析师职位,从信息中 发掘财富。与计算机结合,使计算机作为工具, 信息管理更加有效和实用,随着企业经营规模的现代化,对信息管理 的要求越来越强烈。

    例如铁路订票系统,就是对车票这种信息的查询和管理系统。可以说软件开发的最主要面向的客户就是 帮助企业制作良好的信息管理系统。

    计算机

    学习计算机专业同学可以从事数据研发/开发工程师,数据挖掘/机器学习工程师,对编程技术上的要求高一些。

    上海数据分析网

    电子商务

    电子商务专业培养具备管理、经济、法律及网络技术、计算机技术、市场营销、电子商 务技术以及电子商务管理等方面的知识和基本技能,现在各大交易都在网站等网络平台 交易完成,数据分析在电商行业的应用非常广。

    市场营销

    数据分析师常要为企业的营销决策提供支持,这就要求懂营销。

    具有营销背景的数据分析师思路会更清晰、更开阔。当让他做竞争分析时,他会想到波 特五个力;让他做环境分析时,他会想到PEST、让他做消费者偏好分析,他会想到科 特勒用户决策流程。

    数量经济学

    数量经济学是运用统计学、经济计量学、投入产出分析、最优规划方法、经济控制论和计算技术等各种手段,对各种经济问题进行理论分析、经验检验和政策分析的一门应用经济学科。数量经济学更偏技术类,相比其他经济学金融类专业,数经的优势是统计软件够独立编程。

  • ?

    成为一名数据分析师需要会哪些技能?

    比尔

    展开
    上海数据分析网

    数据分析师这个职业越来越火,越来越多的人想往这个方向发展。

    有在校生,也有转行的小伙伴来咨询数据分析师这个职业的相关问题。

    从大部分情况来看,大家对于数据分析师的职业发展和技能非常关心。

    那么别的先不说,数据分析入门到底要学什么?怎么学?

    Excel

    作为数据分析师,Excel是必备技能。Excel 是经过检验的可靠的数据分析工具,它广泛存在,非程序人员也能便捷操作,所以大多数企业即使也使用其他工具,但 Excel 工具还是他们的不二选择。

    统计学

    统计学同样是数据分析师的必备技能之一,你只有学好了统计学才能谈得上数据分析。统计知识会要求我们以另一个角度看待数据。当你知道AB两组的差异用平均值看是多傻的事情,你的分析技巧也会显著提高。如果你想成为一名出色的数据分析师,那么你就必须要会统计学。

    推荐图书:《深入浅出统计学》

    上海数据分析网

    大概是最啰嗦的深入浅出系列,从卖橡皮鸭到赌博机的案例,囊括了常用的统计分析如假设检验、概率分布、描述统计、贝叶斯等。书本注重应用和趣味性,数学推理一般。

    SQL

    sql是所有数据库查询的语言,sql非常容易入手。

    针对不同的数据库,如mysql、sqlserver、oracle等,sql语法会有所不同,但是总体上大同小异,只是细微处的差别。

    而且如果你有数据库基础的话,只需要找些sql查询的习题来做一下,就会很快的得到提高。

    推荐图书:《MySQL必知必会》

    上海数据分析网

    学习 SQL 的入门书,薄册子一本,看起来很快。SQL 是个性价比很高的技能,简单而强大。任何想进一步提高自己数据分析技能的产品/运营/分析师 同学,都建议点亮 这个技能点。

    数据分析思维

    作为一名数据科学家需要很挑剔,并且善于发现他人会遗漏的东西。那么我们应该如何做到像数据科学家一样思考呢?

    梳理分析思路,并搭建分析框架,把分析目的分解成若干个不同的分析要点,即如何具体开展数据分析,需要从哪几个角度进行分析,采用哪些分析指标(各类分析指标需合理搭配使用)。同时,确保分析框架的体系化和逻辑性。

    推荐图书:金字塔原理

    上海数据分析网

    金字塔的基本结构是:中心思想明确,结论先行,以上统下,归类分组,逻辑递进。先重要后次要,先全局后细节,先结论后原因,先结果后过程。

    行业知识

    对于数据分析师来说,业务的了解比数据方法论更重要。而且业务学习没有捷径。这一部分也没有什么书可以看的了,基本都靠搜索,总结,思考,再搜索,总结,思考。

  • ?

    数据分析怎么学习,要学习什么内容?数据分析学习路线

    Perth

    展开

    就数据分析学习而言,需要的技能模块有统计基础+数据库知识+编程能力。其以后的的职业发展方向,一个是业务层面的方向,一个是数据挖掘层面的方向。今天科多大数据和你们一起来谈谈关于数据分析的学习。

    1.统计基础

    理工科的学生在本科阶段学习过概率论与数理统计,单从做数据分析的角度已经够用。其他方面,可以根据需要查看相关书籍,随时进行查漏补缺即可。个人推荐《深入浅出统计学》,可以让统计理论的学习有趣又自然。

    2.数据库知识

    关系型数据库很重要。在学习数据分析的初期甚至很长一段时间,你接触到的数据都存储在关系型数据库中,需要学习SQL语言进行数据查询。关于SQL语言,强力推荐《SQL必知必会》,整本书通俗易懂,是学习SQL语言的不二之选。

    学习数据库的本质就是在学习一种与数据打交道的逻辑思维与能力。编程中的很多思想都和关系型数据库、SQL相通,比如:SQL中对data进行group by的操作,这个在Excel里类似于透视表,在Python/R中也有相应的group function去处理数据。甚至在以后的进阶过程,你会接触到分布式数据库和所对应的no-SQL语句。

    3.编程能力

    Excel。 透视表(Pivot Table)是做数据分析的必备技能。透视表可以帮你迅速汇总数据,看到各类型数据的直观特征就像是让你站在更高的视角看待数据。作为进阶,Excel自带的函数、各种插件,以及VBA也是很好的工具。

    Python。当数据量大到用Excel打开都要很久或者我们想进步提升能力时,需要学些hardcore技能,即用编程语言做数据分析。这里主要有R和Python两大流派。个人推荐Python,一是代码简单易懂,容易上手;二是学习资料多,降低学习成本。推荐《利用Python进行数据分析》,涵盖了利用Python做数据清洗,数据可视化及分析的技能点,可以作为一本工具书随时查阅。

    Python 是目前科多大数据分析课程里面非常重要的一项内容,下面这张图更能直观反映学习内容

    当然需要特别指出,数据分析课程学习内容肯定不止python这一项内容,还包括数据分析基础,互联网电子商务、经济学基础,数据产品(可视化报表)等各个板块的学习。

数据分析主要学什么

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP