中企动力 > 商学院 > 如何从事数据分析
  • ?

    如何发展AI和数据分析?美国打算这么做

    姜依珊

    展开

    E安全7月16日讯 美国国防高级研究计划局(简称 DARPA)国防科学办公室(DSO)近日发布信息征询书(RFI),呼吁行业和学术界的技术专家权衡量子计算对人工智能(AI)、物理系统、数据分析和其它研究领域的影响。

    本文源自E安全

    随着科技发展打破了量子计算的物理障碍,DARPA 希望更好地了解量子计算这项技术的局限性,并大致了解研究人员何时能达到不同里程碑。

    量子计算面临诸多挑战

    DARPA 在信息征询书中写道:

    “无论是在物理可实现的量子比特数量方面,还是在新的量子搜索和优化算法方面,量子计算领域近年来取得了相当大的进展。然而,为了解决现实世界的问题,仍有诸多挑战需要应对。这些挑战包括规模、环境的相互作用、输入/输出、量子比特连通性、量子存储、量子态准备和读出,以及与传统世界相关联的其它诸多实际和架构挑战。虽然目前存在一些问题,例如量子物理学、量子化学和材料,借助传统的计算平台,但可以使用通用量子计算机成功建模。DARPA希望技术界出谋划策,以解决量子计算的基本限制,并确定量子计算可在哪些解决解决棘手科学和技术问题。”

    不关注密码学

    DARPA 在这份 RFI 中表示,DARPA 邀请感兴趣的各方就这些研究方向的相关问题提出自己的想法和概念,并指出只对“硬”科学和技术感兴趣,密码学不在兴趣范围内。

    DARPA 将利用关于这些问题的答复确定研讨会的参与者和发言人。有兴趣参加具有研讨会的各方必须提交针对 RFI 的回复。 DARPA 将审核提交的内容,并邀请 DARPA 最感兴趣的回复者参加研讨会。RFI 的回复截止日期为2018年8月10日。

    DARPA 希望量子计算加速 AI 发展

    DARPA 表示,它特别感兴趣的是了解量子技术如何提升通用计算性能以及如何加速人工智能(AI)和机器学习系统。

    量子计算技术得到各国的重视,美国联邦技术官员开始担心美国在量子研究领域失去优势,已开始讨论量子计算对数据隐私和其它技术领域的影响方式。美媒称,中国计划2020年前投入100亿美元(约合人民币668.81亿元)开设量子应用研究中心,而相比之下,美国每年在量子研究方面的投入约为2.5亿美元。

    注:本文由E安全编译报道,转载请注明原文地址https://easyaq/news/1610436389.shtml

  • ?

    如何判断自己是否适合做数据分析师?

    暖眸

    展开

    现如今90%的企业都在利用数据分析为其带来更加便利的服务,从而数据分析师这类人才可谓供不应求。但是并不是所有的数据分析师都配上当下的薪资,很多数据分析师一直都原地踏步,一两年后还是未能升职加薪,这都是有原因的。

    那么如何判断自己是否合适做数据分析师呢?

    首先,小编觉得无论做什么工作,兴趣都是最重要的,要做数据分析师最基本的就是不讨厌数字,如果你跟他讲那个指标是通过怎么样的乘除加减得到的,他都会觉得不耐烦,那么显然他不适合做数据分析;如果对数据较敏感,能够一眼发现异常值,数据分布情况,这当然是最好的。

    再则就是逻辑性了,可以试试爱因斯坦的那道最经典的逻辑题,看看能否解出来,需要多久;逻辑思维对数据分析是尤其重要的,不然会被各种指标的定义规则、与业务的联系纠结死,逻辑思维好的人写SQL等数据处理脚本也会更加的高效。

    然后就是业务理解能力,最简单的就是先定义下网站的目标是什么,哪些指标可以作为KPI,用户从进入网站到达成网站目标的整个过程是怎么实现转化的,能否画出业务流程图。

    如果偏技术则需要懂一些数据库结构和SQL,如果偏展现需要考验下对图表的掌控能力,什么时候用什么图表合适,甚至如何配色。

    最后就是细心、耐心和交流能力,做数据分析有时会很纠结,细心和耐心是必需的,好的交流能力可以让数据分析师更好地阐述清楚各类问题。

    以上这些都是比较基础的东西,也是短期难以培养起来的技能。至于另外业务相关的一些知识,可以通过培训获取,问一个未接触过你的网站业务的人一些业务知识其实有些不公平,其实如果具备上面几点,一旦熟悉网站和业务之后,一定会成为优秀的数据分析师。

    数据分析师具备技能

    ● 数据挖掘算法

    ● 软件建模运用

    ● 行业案例演练

    ● 宏观业务决策

    总结

    如果以上你都有,但如何快速获得岗位专业知识?自学还是接受培训?以下建议可供参考:

    自学可以学习到编程技巧,但学不会数据思维和数据挖掘方法,如果是零基础或者刚入门建议通过参加培训系统学习一下相关知识。后续在实践中如果有发现有不足的地方可以通过自学进行补充。

    参加培训有老师辅导,会少走很多弯路;同时有不懂的你可以问老师,学习起来会轻松一些。

    参加培训会有一个学习和交流的圈子,学习氛围比较好,可以相互交流,共同成长;

    分享 IT 技术和行业经验,请关注-技术学派。

  • ?

    如何靠数据分析“上位”?——一位银行业务分析专家的实践

    炙热

    展开

    身处传统行业,数据分析的工作可能会无所适从。我们既没有互联网行业强大的数据驱动基因,甚至都没有大企业完善的信息基础和数据环境。个人不论是数据分析师和DBA,成长都有所局限。

    数据分析很火,懂行的都深知数据对于业务,对于企业生产经营的重要性。但是没有数据、数据不完整、业务不重视、数据分析沦为取数和报表制作......这些问题都阻挠着数据行业的发展,也影响个人自身。

    关于企业的数据分析,如何从0——1着手分析工作?这里想分享一个来自我们客户“小唐”的真实故事,没有鸡汤,只有浓浓的方法论值得借鉴。

    小唐就职于一家股份制银行A,近两年由于银行改制,A银行开始逐渐重视银行信息化的提升,以及数据分析的应用,小唐在对公业务一线做过2年,被委派到的数据部门做业务分析。

    委派到新部门的小唐负责对公业务,需要对下属一级支行南京支行的业务做针对性分析:风险预估、坏账分析、创新业务跟踪。

    从存款金额和贷款金额入手,分析该支行总体的经营状况;想了解存款和贷款主体业务的状况,尤其是坏账的风险;想了解下属各二级机构的经营状况;下属二级支行瑞金支行是新增的二级试点支行,投放了许多创新业务,想在分析过程中对该二级支行加强关注;

    小唐是怎么做的呢?

    分析过程

    业务分析需要借助良好的分析工具,且考虑到上层战略的需要,此项业务分析不仅仅是单一问题的解决,而是需要长期监控的,给部门业务经理监控的。基于这样的场景,小唐需要一个自住性较强、易操作、能实时同步数据、且具有协同功能的数据工具,自然而然的想到了商业智能BI工具FineBI,开展了分析工作,从0-1进行数据分析搭建业务分析模型的工作。

    1、提出问题/需求

    即最原始的问题/需求。

    领导提出“小唐啊,我想看一看部门最近的业绩怎么样?”或者自己发现“最近XX产品的推出好像在市场受到了阻碍,想看看原因在哪”,这都是最原始的问题/需求。这部分问题/需求不直接涉及业务数据,但是和目标“解决问题,提高效益”直接相关,最表象也是大家最关心的事情。

    2、明确问题/需求

    上面提出的问题/需求,不管是领导提出还是自己的诉求,都比较宽泛,如果想要通过数据分析解决问题/需求,自然而然地,需要把问题/需求往数据上靠,用我们的业务去明确问题/需求。可以分成两个步骤:

    ①用我们熟悉的业务名词精简描述

    ②化零为整。

    (1)从存款金额和贷款金额入手,分析该支行总体的经营状况——存款金额、贷款金额→日期即研究不同日期下支行的存款金额和贷款金额。(2)想了解存款和贷款主体业务的状况,尤其是坏账的风险——存款类型、贷款类型,不良贷款额即研究不同业务类型的存款金额和贷款金额的情况,尤其是五级不良贷款。(3)想了解下属各二级机构的经营状况——机构即研究不同机构的存款金额和贷款金额的情况。(4)下属二级支行瑞金支行是新增的二级试点支行,投放了许多创新业务,想在分析过程中对该二级支行加强关注;即研究单一机构的存款金额和贷款金额的情况。

    这样,通过用熟悉的业务名词去明确我们的需求,就变得十分具体,数据分析的切入点就有了突破口。但是这样的描述还是比较零散而且互有重叠,通过化零为整,整合一下我们的需求,即“研究不同时间不同机构不同存款类型/贷款类型下的存款金额/贷款金额”。

    3、梳理指标

    对于“不同时间不同机构不同存款类型/贷款类型下的存款金额/贷款金额”这一明确需求,将相关涉及的所有指标进行进一步梳理,可以先用我们最熟悉的明细表做一个展示,对数据能够有一个非常直观的感知。

    4、搭建业务包(指标分类)

    根据分析思路框架,利用FineBI数据分类的功能来针对性地搭建业务包。

    由于存款类型、贷款类型和贷款质量是三个接近平行的维度,互相之间不干扰,所以我们可以设计三条平行线,分别来看各日期机构下的存款类型、贷款类型、贷款质量的情况,并搭建以下业务包:

    三张事实表(存款数据事实表、贷款数据事实表、不良贷款数据实施表)三张维度表(机构维度表、贷款类型维度表和存款类型维度表),并建立和业务关联。

    5-6、 自助创建仪表板-分析决策

    创建仪表板的过程,实际上是将我们的分析思路以各种指标和图表具象化的过程,是数据分析思维的具体体现,所以做仪表板和分析决策是不能够分开的。这也就决定了创建仪表板的时候,我们需要掌握两个步骤,一是用常用的分析形式和分析指标结合需求落地,二是用分析决策检验和完善我们的仪表板。

    以各日期机构下的存款类型情况进行分析为例,即存款分析为例,先用我们常用的分析形式和分析指标结合需求落地。在这里只需要控制单一变量:

    a. 固定机构,分析它的日期维度。常见对日期进行分析方法有

    趋势分析对比分析(比昨日、比上月、比年初、同比)

    当然还有一些其它的业务分析形式,我们都可以进行尝试。在进行数据分析的时候,我们应该养成看到时间维度就能立马复现出这些分析方法的习惯,不管不是所有对日期进行分析的方法都应该囫囵吞枣,但是把每个分析方法都过一遍是十分有利于我们的思考过程,从而甄别出适合出当前分析的分析形式和指标。

    先对日期进行趋势分析。研究存款总额、对公存款和对私存款的时间变化趋势。而历史数据对于当前的业务影响小,我们更关心近期的数据走势,因此可以过滤出最近10天的数据。

    可以看出南京支行的主体存款业务是由对公存款组成,因此存款总额的变化趋势几乎只受到对公存款业务的影响;对公存款是处于起伏不定的状态,处于停滞不增长的状态,而对私业务乍看也是处于一条水平线,没有什么起伏,然而,当我们取消关注对公存款和存款总额的时候,可以发现对私业务的存款总额竟然是下降的。

    综上,我们发现,最近该支行的总体存款业务是下降的,对公业务没有什么增长,对私业务虽然体量相对较小,但是呈下降趋势,发展出现问题。因此我们可能需要对该机构的存款业务进行重要调整,想办法推进对公业务的继续增长,考虑改变对私业务的推广策略或者放弃相对该支行来说比较鸡肋的对私存款业务。

    同样地,对日期继续进行对比分析,研究比昨日、比上月、比年初、同比的对比情况。

    将当日的营业额度和历史同期比较是非常有说服力的,也可能更能反映时间的周期性问题。可以发现,对公业务和对私业务尽管在近期的发展态势一般,但是较历史同期而言,都几乎有着成倍的增长。

    这说明,过去的经营策略确实取得了巨大的成效,但是可能由于市场饱和或者过去的经营策略所能取得的成效已经饱和,导致了近期的业务增长一般。说明,对于现在支行的发展,可能到达了一个瓶颈,需要对经营的策略进行重大调整,以适应现在的业务情况。

    b. 固定时间,分析它的机构维度。常见对机构进行分析方法有:

    排名分析比例分析机构分析穿透分析指标(平均值)

    同样地,我们只需要将这些分析方法逐一套用,最后结合我们实际的业务需求,选择出合适的分析形式和指标。

    这里对最常用的排名分析和机构分析进行一个介绍。这里由于存款总额是每天累计汇总的,因此关注当天具体的额度变化情况更加有意义。

    可以看到各机构存款总额较上日增幅的排名;对于增幅靠前的机构,可以研究具体这些机构的业务策略进行推广,而对于存款净增额落后的机构单位,一般我们都比较关注在平均值以下的机构,可以进行标红处理做警示作用,同时对于尤其关注的某些特别支行,如瑞金二级支行,可以进行特别关注处理。同样的分析还能用于产品类别、产品、供应商等品类。

    穿透分析、比例分析的落地过程我们略去。这样将我们熟悉和常见的分析形式和指标,结合分析决策的过程去套用,创建我们所需要的仪表板,很快就可以做出以下存款分析报表。

    贷款分析和不良贷款分析,我们也同样地按着存款分析的分析思路过程进行落地。FineBI有一个比较方便的功能,可以直接将模板复用,然后简单地替换成贷款分析和不良贷款分析的各个指标,就快速生成了对应的分析模型。

    分析总结

    在从无到有搭建完业务模型之后,一定要对我们形成的分析模型进行总结,沉淀成为企业内部的指标库,这部分是我们数据分析最终沉淀的内核。

    同时,在进行数据分析时,小唐给了大家两个非常受用的小贴士:

    1、自主分析是个反复尝试的过程,实际上也是思维不断突破的过程。需要养成良好的设计习惯,用常见维分析形式和分析指标去落地,不要希望每次都能一步到位精准反映业务问题,需要踏实做好数据分析,用实际问题来改进分析模型。

    2、不要企图用一张报表解决所有问题 。往往需要制作多张报表来分析发现问题,需要建立系统性,同时也鼓励多部门对于同一类需求/问题进行分析,可以对结论形成互补。

  • ?

    怎么样Excel做数据分析?这几个步骤帮到你

    半生缘

    展开

    每个人都会有机会进行数据展示,为什么别人展示永远获得正视,而我的展示永远只有自己愿意去看,别人在看手机?那怎样做数据图表分析呢请看以下步骤:

    如何对表格进行修饰,本次小编带来两个技巧,一是使用“套用表格格式”,和使用“条件格式”。二是带领大家学会养成修饰表格的思维。

    第一步是对表格进行粗略的修饰调整,思维:行高、列宽、对齐方式、表格线等;

    使用“套用表格格式”、“条件格式”之后看数据不再枯燥无味,而且还更有看头。“条件格式”可以将筛选条件转换为颜色可视化,从而达到一目了然的效果。

    第一个技巧,①“套用表格格式”。方法:任一单元格→开始→套用表格格式。

    ②“条件格式”,方法:选中单元格区域→开始→条件格式。

    条件1:高于平均值

    条件2:数据条

    条件3:色阶

    第二个技巧:养成修饰图表的思维。这次举例柱形图的修饰例子,其他希望大家动用类似的方法进行模拟实践。

    步骤一:根据销售数据建立柱状图,建立方法可参考。选择数据源→插入→柱状图→选择数据源→编辑坐标

    步骤二:添加辅助线。选择数据源→→添加→点击柱体右键,设置数据系列格式→次坐标轴→选中柱体,右键更改图表类型→折线图。

    希望回答对你能有所帮助,如果觉得不错就来点个赞或关注吧,感谢各位了!

  • ?

    什么样的人比较适合做数据分析?

    颜凡旋

    展开

    我觉得无论什么工作兴趣最重要,要做数据分析师最基本的就是不讨厌数字,如果你跟他讲那个指标是通过怎么样的乘除加减得到的,他会觉得不耐烦,那么显然他不适合做数据分析;如果对数据较敏感,能够一眼发现异常值,数据分布情况,当然是最好的。

    再则就是逻辑性,可以让他试试爱因斯坦的那道经典的逻辑题,看看能否解出来,需要多久;逻辑思维对数据分析尤其重要,不然会被各种指标的定义规则、与业务的联系纠结死,逻辑思维好的人写SQL等数据处理脚本也会更加高效。

    接着是业务理解能力,最简单的就是让他定义下网站的目标是什么,哪些指标可以作为KPI,用户从进入网站到达成网站目标的整个过程是怎么实现转化的,能否画出业务流程图。(宏观层面,不要深入细节)

    如果偏技术则需要懂一些数据库结构和SQL,如果偏展现需要考验下对图表的掌控能力,什么时候用什么图表合适,甚至如何配色。

    最后就是细心、耐心和交流能力,做数据分析有时会很纠结,细心和耐心是必需的,好的交流能力可以让数据分析师更好地阐述清楚各类问题。

    这些都是比较基础的东西,也是短期难以培养起来的技能。至于另外业务相关的一些知识,可以通过培训获取,问一个未接触过你的网站业务的人一些业务知识其实有些不公平,其实如果具备上面几点,一旦熟悉网站和业务之后,一定会成为优秀的数据分析师。

    ——谷芬芬

    专业内的要求基本就是对数据的意识和一些技能的掌握。下面具体说说从一些非专业内要求的方面出发,有哪些方面能表现这个人更适合数据分析。

    首先是看到数据有兴奋感的人。有兴奋感说明你有兴趣,那说明很会有意愿把数据分析好。

    其次是愿意学习的人。你分析的内容永远不会一尘不变,即使你分析的主题是相对固定,但业务是变化的,你需要不断的学习业务,同不同人沟通,吸收别人的观点。所以分析师一定要报着学习的态度。

    然后是逻辑思维较强的人。数据分析师想要把你的分析好,一定要有结论思维。

    还有就是较强的表达与沟通能力。因为数据分析最终价值的实现,一般来说不会是分析师亲自去制定或者实施。所以你一定很有条理、逻辑清晰向别人表达,让业务方认识到你分析结果的价值,从而影响业务方去愿意使用你从数据中得到的观点。

    ——欧阳帅

    觉得还是应该先看清楚自己的未来的方向吧~

    我有不少朋友 非数学/计算机/统计学 专业毕业的朋友走的是这个方向,数据相关,非技术路线,更偏向于市场方向,对技术的要求只是Excel、PPT,最多要求SPSS,很少要求会写SQL。这条路线看起来比较高大上,可以走外企路线。

    数据分析师方向,很多读数学、统计学、计算机的童鞋会选这个方向,终极目标都是成为数据中心的负责人。中间有2个分叉,一条是从数据分析师到数据产品经理,这个路线最近很流行,主要是结合了数据分析和产品经理的能力。一条是高大上一点的数据挖掘方向,这条路线要求比较高,但薪资也高。当然能走数据挖掘路线是很多数据分析师的梦想,但算法和代码实现能力不是谁都能掌握的。.

    根据你自己想走的路,加上自己的技能点。

    ——张锦华

    想了解更多相关内容,记得持续关注我们哦。

    如果你觉得有点意思,请有秩序的评论、转发、收藏。

  • ?

    我是怎么从一个IT工程师成为数据分析负责人的

    萨妮

    展开

    有时候,自我满足是不行的

    我是一名工程师,在一家跨国公司工作。对人们来说,这是一种非常幸福的生活,但我有一些其他的梦想。我想在印度以外的地方攻读MBA。

    不幸的是,这个计划没有成功——在财务和个人方面有一些问题,甚至我觉得,我这样的想法有些不切实际。

    生活不就是一场又一场冒险

    虽然我的MBA计划失败了,但我意识到我需要为自己制定一条新的人生路线。我研究了互联网,发现一个叫“数据分析”的新领域。我当时对商业分析没什么概念,也不太了解有哪些正式的培训计划可以学习。

    经过更深层次的研究,我发现,数据分析是一个有趣的领域,但也很复杂。在我看来,为了使分析成为我的职业,我必须花大量时间来学习它。

    因此,我找到了一个全日制的课堂教学项目,并发现了Praxis(在Analytics Vidhya上提供的一个横幅广告)——一个相对新兴的商学院,而且是Business Analytics的正式全职教学的先驱。Praxis有相当全面的课程,令人印象深刻的教授和越来越多的校友。

    我确信这是我想要的职业,我申请了Praxis,幸运地被选中了。

    改变,总是有苦也有甜

    一直以来,我已经习惯了在职业选择中走相对稳妥的路。这是我第一次尝试做一些不同的事情。显然,这并不容易。

    第一个挑战是适应一种不同的学术环境——鼓励辩论、讨论和批判性思维。

    第二个挑战是如何应对各种各样对我来说都是全新的课题。虽然我拥有的是工程学学位,但我从来不是一个数字或技术高手。

    当我选择这个课程时,课程的范畴,包括各种各样的学科,包括先进的统计数据、数据挖掘、机器学习、计量经济学、可视化等,以及像SAS和R这样的工具,起初都是相当令人生畏的。

    然而,教授和同学们的出现确保了学习的效果,虽然严格,但有效,并充满欢乐。

    不管学多少,都是为了这一次

    Praxis的实践至关重要。

    项目设计将课堂授课与案例研究、实验室和项目相结合;还有以测验、作业、考试和项目陈述的形式进行的持续评估。一些课程完全由行业专家讲授。

    我们都在午夜最后期限内度过了多次不眠之夜,做项目并准备项目测试和奖励创新的测试。 通过解决各种问题,完成新课题,我有了新的自信心。知道这一切都是为我选择和喜欢的职业生涯做准备,我觉得我的努力更值得了。

    第一份工作是那么有趣

    学习数据分析的一年让我在这个领域找到了工作。我的第一份工作(通过校园安置计划获得)是3i信息技术(IT技术,IP通信,INFO信息)。当时他们正在建立一个数据分析团队,我们是最初的成员。

    我们通常主要在Excel和R上工作,为客户创建项目演示。3i的旅程很有趣,但当数据分析公司的主管决定离开公司并开始他的创业时,这段旅程就戛然而止了。

    你要更努力,成为更优秀的自己

    我的下一段旅程是和纳布尔·班加罗尔(Nabler Bangalore)合作,他们迅速把我送到美国,为一家名为“Lowes”的财富30强公司建立产品推荐引擎。这是一个绝好的机会,多亏了一些优秀的同事,我努力工作,学到了很多东西。Lowes的工作文化和实践帮助我成长为一名专业人士,我也做好了领导一个团队的准备。

    CarDekho正在建立他们的分析团队,我加入了他们,成为数据分析高级经理。这个角色是完全不同的,份内工作是你必须挖掘并概念化一个项目,把它交给首席执行官,使其获得批准和实施——这才是我应该研究的工作。此外,我还积极参与招聘和管理人员。

    你果然适合站在更高的地方

    最终,我作为数据分析负责人来到Yatra。风险很大,期望也很高。我花了一些时间安定下来,了解系统、产品、人以及数据。我们有一个专门的仪表盘团队,为C级管理人员和业务负责人构建执行仪表板。

    我们有一个数据仓库小组,从不同的来源收集数据,例如预订数据、CRM数据和网络数据,并以可用的格式存储数据。然后我们有一个预测分析小组,它涉及长期项目,如客户流失分析,交叉销售和推荐引擎基于机器学习的概念。我的工作包括结束项目的交付,从概念化到实现。我的大部分时间也用于项目和人员管理。

    回想生命中走过的这段旅程

    从2013年我以分析学的资格毕业,到2016年在Yatra担任数据分析负责人,这是一段非凡的旅程。我将转型的成功归因于以下因素:意识到我需要做些别的事情,而不是只做我的IT工作,我已经把我的工程学完全掌握并积极地寻求一个更适合的职业。

    相信我的直觉,并通过报名参加商业分析的全日制课程过渡到这个领域。

    选择我的新领域—— Praxis在这个领域的持续职业生涯中扮演了一个关键的角色——确保我充分利用了这个机会,最大化了我在实践中应当掌握东西。

    充满激情,在工作中永不停止学习,并在职业生涯中做出一些适时的改变。生活回到了一个正常的轨道,我正在自己开始的地方分享这段旅程!我分享的这个故事,希望可以帮助像我这样的人(想要做一些不同的事情,离开职业束缚),看到自己需要什么,以及如何规划自己的职业。

    Ritesh是一名专业从事数据分析和产品管理领域(统计分析、社会媒体/数字营销)、战略、产品开发和营销等领域,工作经验超过8年的专业人士,并为BFSI、技术、教育、IT和FMCG等多个领域提供服务。

    来源:analyticsvidhya

    作者:Ritesh智能观 编译

  • ?

    想从事数据分析师应该学什么专业好呢?就业现状怎么样?

    燕映天

    展开

    在回答“从事数据分析师学什么专业”这个问题之前,小编想先给大家介绍下数据分析这师的就业现状!

    一个优秀的数据分析师可以帮助企业根据现有数据做出科学、合理的分析,在前行中准确定位,为企业排除干扰,创造价值。数据分析师这个岗位的可以从事相关数据的职位有很多,如业务数据分析师、数据挖掘师、数据科学家、数据工程师等等。

    上海数据分析网

    业务/商业数据分析师(BA)是完全的咨询师设定,核心价值在分析框架+报告;

    数据科学家是完全的算法设定,核心价值在算法+数学;

    数据工程师是完全的程序员设定,核心价值在程序;

    其他还有建模分析师、数据架构师、数据产品等等;

    可以说数据分析师的就业面非常之广,在公司产生的价值与被重视程度不言而喻。

    小编从各大招聘网站找到国内三家大企业的招聘,从中可以发现企业对数据分析人才专业要求是怎样的。

    上海数据分析网

    可以看到职责描述里,第七条,数学、统计学、信息管理、计算机专业等。

    上海数据分析网

    岗位要求里,第一条:本科以上学历,统计学、数学、电子商务、计算机、市场营销等相关专业。

    上海数据分析网

    任职要求,第一条可以看到数学、统计学、数量经济学、计算机、营销学等相关专业。

    这几条招聘启事专业要求有数学、统计学、信息管理、计算机、电子商务、市场营销、数量经济学专业。这些专业具体都学些什么内容呢?

    数学

    随着科技事业的发展,数学专业和其他专业的联系也越来越紧密,所以数学专业知识也得广泛的应用。

    数据分析师需要有专业的数学功底和严密的逻辑思维,而严密的逻辑思维则来源于扎实的数学功底。 学数学的同学更注重理论的完备性和逻辑链的完整性,即对于在分析过程中出现的任何一些命题,都要能证明它是正确的还是错误的。

    统计学

    统计学贯穿数据分析的全过程,没有统计学基础,很难有专业的数据分析。数据分析的 各个步骤,都要用到统计学的知识。

    信息管理

    信管专业主要对各种“系统”进行分析、设计与实现,技术与管理的有机结合。学习内容:财务、系统数据分析、IT技术,可以说信管专业非常对口数据分析师职位,从信息中 发掘财富。与计算机结合,使计算机作为工具, 信息管理更加有效和实用,随着企业经营规模的现代化,对信息管理 的要求越来越强烈。

    例如铁路订票系统,就是对车票这种信息的查询和管理系统。可以说软件开发的最主要面向的客户就是 帮助企业制作良好的信息管理系统。

    计算机

    学习计算机专业同学可以从事数据研发/开发工程师,数据挖掘/机器学习工程师,对编程技术上的要求高一些。

    上海数据分析网

    电子商务

    电子商务专业培养具备管理、经济、法律及网络技术、计算机技术、市场营销、电子商 务技术以及电子商务管理等方面的知识和基本技能,现在各大交易都在网站等网络平台 交易完成,数据分析在电商行业的应用非常广。

    市场营销

    数据分析师常要为企业的营销决策提供支持,这就要求懂营销。

    具有营销背景的数据分析师思路会更清晰、更开阔。当让他做竞争分析时,他会想到波 特五个力;让他做环境分析时,他会想到PEST、让他做消费者偏好分析,他会想到科 特勒用户决策流程。

    数量经济学

    数量经济学是运用统计学、经济计量学、投入产出分析、最优规划方法、经济控制论和计算技术等各种手段,对各种经济问题进行理论分析、经验检验和政策分析的一门应用经济学科。数量经济学更偏技术类,相比其他经济学金融类专业,数经的优势是统计软件够独立编程。

  • ?

    如何做数据分析师?教你从零开始系统规划大数据学习之路

    苔丝

    展开

    大数据的领域非常广泛,往往使想要开始学习大数据及相关技术的人望而生畏。大数据技术的种类众多,这同样使得初学者难以选择从何处下手。

    本文将为你开始学习大数据的征程以及在大数据产业领域找到工作指明道路,提供帮助。目前我们面临的最大挑战就是根据我们的兴趣和技能选定正确的角色。

    为了解决这个问题,我在本文详细阐述了每个与大数据有关的角色,同时考量了工程师以及计算机科学毕业生的不同职位角色。

    我尽量详细地回答了每一项人们在学习大数据过程中遇到或可能会遇到的问题。为帮助你根据兴趣选择发展途径,我添加了一组树图,相信会对你找到正确的途径有所帮助。

    注释:学习之路树状图

    在这个树状图的帮助下,你可以根据你的兴趣和目标选择路径。 然后,你可以开始学习大数据的旅程了。 后台回复“职业路径”3个字,下载高清版本。

    目录表

    1.如何开始?

    2.在大数据领域有哪些职位需求?

    3.你的领域是什么,适合什么方向?

    4.勾勒你在大数据领域的角色

    5.如何成为一名大数据工程师?

    o什么是大数据行业术语?

    o你需要了解的系统和结构

    o学习去设计解决方案并且学习相关技术

    6.大数据学习路径

    7.资源

    1.如何开始?

    人们想开始学习大数据的时候,最常问我的问题是,“我应该学Hadoop(hadoop是一款开源软件,主要用于分布式存储和计算,他由HDFS和MapReduce计算框架组成的,他们分别是Google的GFS和MapReduce的开源实现。由于hadoop的易用性和可扩展性,因此成为最近流行的海量数据处理框架。hadoop这个单词来源于其发明者的儿子为一个玩具大象起的名字。), 分布式计算,Kafka(Kafka是由LinkedIn开发的一个分布式基于发布/订阅的消息系统),NoSQL(泛指非关系型的数据库)还是Spark(Spark 是一种与 Hadoop 相似的开源集群计算环境,但是两者之间还存在一些不同之处)?”

    而我通常只有一个答案:“这取决于你究竟想做什么。”

    因此,让我们用一种有条理的方式来解决这个问题。我们将一步步地探索这条学习之路。

    2. 在大数据行业有哪些职业需求?

    在大数据行业中有很多领域。通常来说它们可以被分为两类:

    大数据工程大数据分析这些领域互相独立又互相关联。

    大数据工程涉及大量数据的设计,部署,获取以及维护(保存)。大数据工程师需要去设计和部署这样一个系统,使相关数据能面向不同的消费者及内部应用。

    而大数据分析的工作则是利用大数据工程师设计的系统所提供的大量数据。大数据分析包括趋势、图样分析以及开发不同的分类、预测预报系统。

    因此,简而言之,大数据分析是对数据的高级计算。而大数据工程则是进行系统设计、部署以及计算运行平台的顶层构建。

    3.你的领域是什么,适合什么方向?

    现在我们已经了解了行业中可供选择的职业种类,让我们想办法来确定哪个领域适合你。这样,我们才能确定你在这个行业中的位置。

    通常来说,基于你的教育背景和行业经验我们可以进行如下分类:

    教育背景(包括兴趣,而不一定与你的大学教育有关)

    计算机科学数学行业经验新人数据学家计算机工程师(在数据相关领域工作)因此,通过上面的分类,你可以把自己的领域定位如下:

    例1:“我是一名计算机科学毕业生,不过没有坚实的数学技巧。”

    你对计算机科学或者数学有兴趣,但是之前没有相关经验,你将被定义为一个新人。

    例2:“我是一个计算机科学毕业生,目前正从事数据库开发工作。”

    你的兴趣在计算机科学方向,你适合计算机工程师(数据相关工程)的角色。

    例3:“我正作为数据科学家从事统计工作。”

    你对数学领域有兴趣,适合数据科学家的职业角色。

    因此,参照着定位你的领域吧。

    (此处定义的领域对你确定在大数据行业的学习路径至关重要。)

    4.根据领域规划你的角色

    现在你已经确定了你的领域,下一步,让我们规划出你要努力的目标职位吧。

    如果你有卓越的编程技巧并理解计算机如何在网络(基础)上运作,而你对数学和统计学毫无兴趣,在这种情况下,你应该朝着大数据工程职位努力。

    如果你擅长编程同时有数学或者统计学的教育背景或兴趣,你应该朝着大数据分析师职位努力。

    5.如何成为一名大数据工程师

    让我们先定义一下,一名受到行业承认的大数据工程师都需要学习和了解什么。首先以及最重要的一步是确认你的需求。你不能在不清楚个人需求的情况下直接开始学习大数据。否则,你将一直盲人摸象。

    为了明确你的需求,你必须了解常用的大数据术语。所以让我们来看一下大数据到底意味着什么?

    5.1 大数据术语

    大数据工程通常包括两个方面 – 数据需求以及处理需求。

    5.1.1 数据需求术语

    结构:你应该知道数据可以储存在表中或者文件中。储存在一个预定义的数据模型(即拥有架构)中的数据称为结构化数据。如果数据储存在文件中且没有预定义模型,则称为非结构化数据。(种类:结构化/非结构化)。

    容量:我们用容量来定义数据的数量。(种类:S/M/L/XL/XXL/流)

    Sink吞吐量:用系统所能接受的数据率来定义Sink吞吐量。(种类:H/M/L)

    源吞吐量:定义为数据更新和转化进入系统的速度。(种类:H/M/L)

    5.1.2 处理需求术语

    查询时间:系统查询所需时间。(种类:长/中/短)

    处理时间:处理数据所需时间。(种类:长/中/短)

    精度:数据处理的精确度。(种类:准确/大约)

    5.2 你需要知道的系统和架构

    情节1的解决方案:销售数据池

    (这是我的个人解决方案,如果你想到一个更高明的解决方案请在下面分享一下)

    那么,一个数据工程师会怎样解决这个问题呢?

    需要记住的一点是,大数据系统的目的不仅仅是无缝整合各种来源的数据,而使其可用,同时它必须能使得,用于开发应用系统的数据的分析和利用变得简单迅速和易得(在这个案例中是智能控制面板)。

    定义最后的目标:

    1. 通过整合各种来源的数据创建一个数据池。

    2. 每隔一定时间自动更新数据(在这个案例中可能是一周一次)。

    3. 可用于分析的数据(在记录时间内,甚至可能是每天)

    4. 易得的架构和无缝部署的分析控制面板。

    既然我们知道了我们最后的目标,让我们尽量用正式术语制定我们的要求吧。

    5.3.1 数据相关要求

    结构:大部分数据是结构化的,并具有一个定义了的数据模型。但数据源如网络日志,客户互动/呼叫中心数据,销售目录中的图像数据,产品广告数据等是非结构化的。 图像和多媒体广告数据的可用性和要求可能取决于各个公司。

    结论:结构化和非结构化数据

    大小:L或XL(选择Hadoop)

    Sink 吞吐量:高

    质量:中等(Hadoop&Kafka)

    完整性:不完整

    5.3.2 处理相关要求

    查询时间:中至长

    处理时间:中至短

    精度:准确

    随着多个数据源的集成,重要的是要注意不同的数据将以不同的速率进入系统。 例如,网络日志可用高颗粒度连续流进入系统。

    基于上述我们对系统要求的分析,我们可以推荐以下大数据体系。

    6.大数据学习路径

    现在,你已经对大数据行业,大数据从业人员的不同角色和要求有所了解。 我们来看看你应该遵循哪条路来成为一名大数据工程师。

    我们知道大数据领域充斥着多种技术。 因此,你学习与你的大数据工作角色相关的技术非常重要。这与任何常规领域有点不同,如数据科学和机器学习中,你可以从某些地方开始并努力完成这一领域内的所有工作。

    下面你会发现一个你应该通过的树状图,以找到你自己的路。即使树状图中的一些技术被指向是数据科学家的强项,但是如果你走上一条路,知道所有的技术直到“树叶节点”总是很好的。 该树状图源自lambda架构范例。

    任何想要调配应用程序的工程师必须知道的基本概念之一是Bash 脚本编程。你必须对linux和bash 脚本编程感到舒适。这是处理大数据的基本要求。

    核心是,大部分大数据技术都是用Java或Scala编写的。但是别担心,如果你不想用这些语言编写代码,那么你可以选择Python或者R,因为大部分的大数据技术现在都支持Python和R。

    因此,你可以从上述任何一种语言开始。 我建议选择Python或Java。

    接下来,你需要熟悉云端工作。 这是因为如果你没有在云端处理大数据,没有人会认真对待。 请尝试在AWS,softlayer或任何其他云端供应商上练习小型数据集。 他们大多数都有一个免费的层次,让学生练习。如果你想的话,你可以暂时跳过此步骤,但请务必在进行任何面试之前在云端工作。

    接下来,你需要了解一个分布式文件系统。最流行的分布式文件系统就是Hadoop分布式文件系统。在这个阶段你还可以学习一些你发现与你所在领域相关的NoSQL数据库。下图可以帮助你选择一个NoSQL数据库,以便根据你感兴趣的领域进行学习。

    好了,今天的知识就分享到这里,欢迎关注爱编程的南风,私信关键词:大数据 ,获取更多学习大数据的资源,如果文章对你有有帮助,

    请收藏关注,在今后与你分享更多学习大数据的文章。同时欢迎在下面评论区留言如何学习大数据。

  • ?

    如何做好数据分析?

    雍绿柳

    展开

    先给大家讲一个数据分析的小故事,发生于四百年前。

    在中世纪,科学界最大的争论在于,到底是地球围绕太阳旋转,还是太阳围绕地球旋转。那时候有一位伟大的天文学家叫第谷·布拉赫,为了解决这个人类科学最初的大争论,开始了寻求数据支持的伟大征程。当时丹麦国王专门为他建了一个天文台,配备了齐全的观测仪器。从那时之后的20年里,第谷每天晚上风雨无阻地观测行星运动的轨迹,把每个行星每天晚上的位置,精确地记录下来,是天文史上第一个真正地开始收集大数据的天文学家,但是他没有足够的智慧从中发现行星运行的规律。 后来,第谷的学生开普勒拿到大量的数据之后,摒弃了每一天的视角,他从每一年的视角来看:地球每365天就会回到原点,而其他的行星还在自己的轨道上运动。他把行星运动的轨道画出来了,得出了所有行星围绕太阳运动的结论。在此基础上,开普勒提出了著名的行星运动三大定律,成就了近代天文学的开端。

    这个故事告诉我们:

    1、数据是数据分析的基础。如果没有第谷20年如一日的观测记录,开普勒不可能取得如今的成就;而如果没有开普勒,第谷的所有观测数据,都将成为一堆毫无用处的废纸。

    2、要客观的分析数据,具备数据分析的视角和思维。第谷一直以“地心说”的思想观察数据变化,开普勒接受了哥白尼的“日心说”思想,在新的角度上结合观测数据才发现行星运动的定律。

    3、要学会合理利用数据。开普勒通过每年的观测数据,才发现了行星运动规律,当我们面对海量数据的时候,最需要的是独具慧眼,在繁杂的数据中找到我们需要的数据,才能真正的将数据运用起来。

  • ?

    如何做数据分析?

    逆夏

    展开

    在互联网的下半场,不断精细化运营的背景下,产品经理不再是单纯的靠感觉来做产品,更需要培养数据的意识,能以数据为依归,来不断改善产品。

    不同于公司专业的数据分析师,产品经理更多的可以从用户、业务的层面去看待数据,去更快更透彻的去寻找数据变动的原因。

    科多大数据带你们看看在数据已经被有效记录的前提下,如何有效的去进行大数据分析呢?

    一、明确数据分析的目的

    1、如果数据分析的目的是要对比页面改版前后的优劣,则衡量的指标应该从页面的点击率,跳出率等维度出发,电商类应用还要观察订单转化率,社交类应用要注重用户的访问时长、点赞转发互动等频次。

    不少新人在设计自己产品的时候,可能会花费很多时间在产品本身的设计上,却没有花精力思考如何衡量产品的成功与否,在产品文档上写上一句类似“用户体验有所”提升的空话,这样既不利于产品设计顺利通过需求评审,也无法更有效的快速提高产品的KPI指标。

    2、如果数据分析的目的是探究某一模块数据异常波动的原因,则分析的方法应该按照金字塔原理逐步拆解,版本->时间->人群。

    比如发现首页猜你喜欢模块最近的点击率从40%下降到了35%,暴跌5%个点,这个时候先看看是不是哪个版本的数据发生了波动,是不是因为新版本上线埋点遗漏或有误造成的。

    如果版本的波动数据保持一致,再看看数据是从什么时候开始变化的,是不是因为受到了圣诞、元旦假日因素的影响,页面上其他模块上线了新的活动影响了猜你喜欢的转化。

    如果不是,则再拆解是不是流量来源构成发生了变动,是不是新用户的曝光数量增加导致的。

    产品经理需要带着明确的目的去分析数据,思考实现目标需要构建哪些维度去验证。大部分时候,产品经理需要非常耐心的一步一步的拆解细分,排查原因。

    二、多渠道收集数据

    收集方式一般有四类渠道。

    1、从外部如易观或艾瑞的行业数据分析报告获取,需要带着审慎的态度去观察数据,提取有效准确的信息,剥离部分可能注水的数据,并需要时刻警惕那些被人处理过的二手数据。

    2、从AppStore、客服意见反馈、微博等社区论坛去主动收集用户的反馈。我自己经常有空的时候就会去社区论坛看看用户的状态评论,一般这样的评论都是非常极端的,要么特别好,要么骂成狗,但这些评论对于自身产品设计的提升还是非常有益的,可以尝试去反推用户当时当刻为什么会产生如此的情绪。

    3、自行参与问卷设计、用户访谈等调研,直面用户,收集一手数据,观察用户使用产品时所遇到的问题及感受。问卷需要提炼核心问题,减少问题,回收结果需剔除无效的敷衍的问卷。用户访谈需要注意不使用引导性的词汇或问题去带偏用户的自然感受。

    4、从已记录的用户行为轨迹去研究数据。大公司一般会有固话的报表/邮件去每天甚至实时反馈线上的用户数据情况,也会提供SQL查询平台给产品经理或数据分析师,让他们可以更有深度的探究对比数据。

    三、有效剔除干扰数据

    1、选取正确的样本数量,选取足够大的数量,剔除极端或偶然性数据的影响。08年奥运会上,姚明的三分投篮命中率为100%,科比的三分投篮命中率为32%,那么是不是说姚明的三分投篮命中率要比科比高?显示有问题,因为那届奥运会,姚明只投了一个三分球,科比投了53个。

    2、制定相同的抽样规则,减少分析结论的偏差性。比如两条Push文案,第1条“您有一个外卖暖心红包未领取,最大的红包只留给最会吃的你,点击进入”,第2条“送你一个外卖低温福利,足不出户吃喝热腾美味,点击领取”。实验数据表明,第二条Push文案的点击率比第一条同比高了30%。那么真的是第二条文案更有吸引力嘛?结果发现是第二条Push文案的接收人群的活跃度明显高于第一条造成的。

    3、剔除版本或节假日因素的干扰,新版本刚上线时的数据表现往往会很好,因为主动升级的用户一般是高活跃度的用户。临近周末或大型节假日的时候,用户的消费需求会被触发,电商类应用的订单转化率也会直线上升。因此,在数据对比的时候,实验组和对照组的数据在时间维度上要保持对应。

    4、对历史数据遗忘。人与数据技术不同,数据技术有着100%的记忆能力,而人类根据艾浩宾斯遗忘定律1天后只能记起33%,6天后25%,31天后21%。因此,我们要合理的选择筛选时间段。比如猜你喜欢模块不仅要对兴趣标签的计分进行一定的加权处理,也要结合商品的生命周期等因素做一系列的回归实验,得出受众人群对各类兴趣和购买倾向的衰退曲线,利用有规律的时间变化有效删除老数据,去提升模块的点击率。

    5、实验需拆分A1组,也就是在实验组B和对照组A上再增加一组A1,A1和A的规则保持一致,然后探究AB的数据波动与AA1比较,剔除数据的自然/异常波动带来的影响。以我实际的A/B实验表明,设立A1组是非常重要且必要的,不管数据量级有多大,相同实验规则的两组在数据也会有一定的小幅波动,而这小幅波动在精细化运营的今天,对我们的判断可能形成较大的干扰偏差。

    四、合理客观的审视数据

    1、不要忽略沉默用户

    产品经理在听到部分用户反馈的时候就做出决策,花费大量的时间开发相应的功能,往往结果,可能这些功能只是极少部分用户的迫切需求,而大部分用户并不在乎。甚至有可能与核心用户的诉求相违背,导致新版产品上线后数据猛跌。

    忽略沉默用户,没有全盘的考虑产品大部分目标用户的核心需求,可能造成人力物力的浪费,更有甚者,会错失商业机会。

    2、全面理解数据结果

    如果实验结果的预期与我们的经验认知有明显的偏差,请不要盲目下结论质疑自己的直觉,而是尝试对数据进行更透彻的分析。

    例如我曾经做过在首页给用户投放活动弹窗的实验,发现实验组的数据不管在首页的点击率,订单转化率乃至7日留存率方面都远超对照组,首页上的每一个模块的转化率都有明显的提升,远远超出了我们的预期,那这真的是活动弹窗刺激了用户的转化率嘛?

    后来我们发现在首页能够展示出活动弹窗的用户,往往在使用环境时的网络状态比较好,在wifi环境下,而未展示弹窗的用户则可能是在公交/地铁/商场等移动场景下,网络通讯可能不佳,因此影响了A/B实验的结果。

    3、不要过度依赖数据

    过度依赖数据,一方面,会让我们做很多没有价值的数据分析;另一方面,也会限制产品经理本来应有的灵感和创意。

    正像罗振宇在时间的朋友跨年演讲上提到的一样。用户要什么,你就给什么,甚至他们没说出来你就猜到了,这叫母爱算法,在内容分发领域没有人比今日头条做得更好,但母爱算法有很大的弊端,在推荐的时候会越推越窄。

    另一面则是父爱算法,站的高,看得远。告诉用户,放下你手里的烂东西,我告诉你一个好东西,跟我来。正像乔帮主当年打造的iPhone系列产品一样,不看市场分析,不做用户调研,打造出超出用户预期的产品。

    五、总结

    美国最成功的视频网站Netflix通过基于用户习惯的分析,将大数据分析深入到电影的创作环节中,塑造了风靡一时的美剧《纸牌屋》。然而Netflix的工作人员告诉我们,不应该迷恋大数据

    如果说电视剧评分9分是精品的话,大数据可以让我们脱离低分6分以下的风险,却也会带我们按部就班的走向平庸的绝大多数7-8分之间。

    产品经理在直觉创造的心智能力,情感理解的社交能力,与大数据相结合,正确的理解数据,让数据真正嵌入到产品的设计中,切实解决用户的实际问题,方能真正做到所谓的“用户洞察”,让产品走到用户需求前面,超出用户的预期。

如何从事数据分析

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP