中企动力 > 商学院 > 数据统计分析师
  • ?

    数据分析师的分布、特征等概览

    窦紫槐

    展开

    ; ; ; ; 随着大数据发展走入我们视野的职业,应该可以算得上是程序员的一个进化分支吧。跟着小编一起用大数据分析一下,高大上的数据分析师的“钱途”究竟如何!

    分析师职位的行业分布情况

      数据显示,数据分析师职位主要集中在互联网、金融、消费品、制药/医疗等行业,其中互联网和金融行业的分析师职位数占比超过了80%,这源于该几类行业已在短期内无论是产品端、用户端、运营端等都实现了大数据的原始积累,且数据增长速度依然可观。此外也说明“数据驱动决策”的趋势在当下变得尤为重要。

    分析师职位的地区分布情况

      从数据分析师职位的区域分布来看,“北上广深杭”等特大一线城市合计占据88.5%的职位份额,单单北京地区占比就超过四成。对于数据分析师的职业发展来说,“坚守而不是逃离一线城市”才是明智的选择。

    互联网行业数据分析职位的特征

      互联网行业数据分析的主要对象是产品、运营和用户,其次是市场和客户。以数据为依据,为产品策略、运营战术、用户研究、市场趋势、客户画像等企业关键领域提供必要决策支持。

    金融行业数据分析职位的特征

      金融行业普遍重视产品与运营层面的数据分析,除此之外最为重视对客户的分析。而对于风险、信用、信贷与投资领域的分析则是金融行业特色,反映出数据分析已在金融核心业务线上都发挥着重要作用。

    企业为分析师职位提供的薪酬(上限)

      无论是初级还是高级岗位,企业都愿意为分析师提供高于行业平均水平的薪酬。同时,随着工作年限的增加,分析师薪酬与行业平均薪酬的差距逐渐拉大,在15年工作年限时,薪资差距拉大到近20万。

    高薪分析师职位在不同行业的分布

      互联网行业年薪超过50万元的分析师职位数最多,占比超过五成;其次为金融行业的21%。巨大的数据量、复杂的数据结构以及结合不同业务而进行的复杂数据开发,造成了数据分析师高端岗位的紧俏。同时也反映出,越来越多的企业(具有大数据基础的)愿意付出高薪解决企业自身数据方面存在的问题。

    高级分析师职位在不同地区的分布

      年薪50万以上的分析师职位主要分布在北京、上海、深圳、杭州、广州。其中北京高端分析师职位最为集中。

    分析师的教育专业背景

      数据分析师从业者的专业背景中,计算机、统计、数学、信息管理等专业的占比相对较高,但其他专业也不少。从另外一个角度来看,无论你是学什么专业出身的,都有新专业、新领域的知识要学。

    高级分析师职位的技能要求

      小·结

      大数据具有数量大(Volume)、高速率(Velocity)、多样性(Variety)、真实性(Veracity)等特点,这就要求从事中高端数据分析的人员除了具有高超的业务理解能力和沟通能力之外,;还必须具有以下四大综合性能力:

      1.卓越的数据处理能力,包括收集、清洗、存储、查询技术等。

      2.数据分析能力,如数学建模、算法设计、文本挖掘、机器学习、统计软件应用等。

      3.数据可视化能力,如基于几何的技术、面向像素技术、基于图标的技术、基于层次的技术、基于图像的技术和分布式技术等。

      4.数据变现能力,如企业运营、产品策略、市场研究、品牌管理、需求分析等。

      据分析,到2018年,我国数据分析师的职位空缺将达到近40000人,而且各行各业均会对数据分析挖掘相关岗位产生很大的需求。

  • ?

    数据分析师和数据科学家有什么区别?

    TACO

    展开

    关于数据分析师,数据工程师和数据科学家有什么区别,三者有着相关的共同点,又有着不同点,数据科学家的影响力与互联网同进同退。数据工程师和数据分析师与数据科学家携手共同完成这幅“大数据时代”巨作。

    数据科学家是什么样一个存在呢?

    通常情况下,数据科学家有数学或物理方面的高等学位。有博士学位的情况并不少见,硕士学位仅是一个前提条件。数据科学家精通统计建模以及如何构建与定制高级数学算法。这既在他们专业范围内,也是他们所擅长的地方。我听到过有人这样形容一个数据科学家“软件工程技能牛过多数人的酷炫统计学家”。

    我结合加工的说:所谓数据科学家,是指运用统计分析、机器学习、分布式处理等技术,从大量数据中提取出对业务有意义的信息,以易懂的形式传达给决策者,并创造出新的数据运用服务的人才。

    数据工程师如何定义呢?

    数据工程师一般被定义成“深刻理解统计学科的明星软件工程师”。如果你正为一个商业问题烦恼,那么你需要一个数据工程师。这些伙计就是那些能提供可建模数据所需平台的人。他们的核心价值在于他们借由清晰数据创建数据管道的能力。

    如何区分数据科学家,数据工程师与数据分析师

    数据工程师对演算法有相当好的理解。因此,数据工程师理应能运行基本数据模型。商业需求的高端化催生了演算高度复杂化的需求。很多时候,这些需求超过了数据工程师掌握知识范围,这个时候你就需要打电话寻求数据科学家的帮助。

    数据分析师如何理解呢?

    数据分析师能洞悉一个方程式的商业意义。他们知道如何提出正确的问题,非常善于数据分析,数据可视化和数据呈现。不管是给另一个数据分析师还是C级执行做演讲,数据分析师都是数据提取,模式识别以及从大量数据中洞察问题方面的能手。

    如果你或者你的公司正考虑顺应这股大数据浪潮的发展,你应该从明确你想利用大数据解决所面临的商业问题处下手。接着找出你真正的需求:是数据采集,检索,仓储还是数据分析?然后编写相应的职位描述并做好准备。

    想要快速进入大数据行业,西线学院大数据培训是不错的选择,除了坚持小班化教学之外,还以项目式教学为宗旨,手把手辅导学员,进行大量的案例操作,保障学员不光学会书本上的知识,更具有实际操作的能力。

  • ?

    数据分析师薪资待遇如何,让大数据分析来告诉你

    科拉

    展开

    随着大数据时代的到来,企业对数据价值的重视,数据分析师的市场越来越大,毫无疑问数据分析师已成为“当今最具发展潜力的职业”,吸引了无数像小编这样的热血青年,在迈进大数据行业之前,先来了解一下数据分析师工资收入多少?

    在美国,大数据分析师平均每年薪酬高达17.5万美元,而国内顶尖互联网公司,大数据分析师的薪酬可能要比同一个级别的其他职位高20%至30%,且颇受企业重视。

    国内拉勾网上,我们通过爬虫采集数据进行分析发现,全国有29个城市的企业有数据分析师的岗位的人才需求,其中将近一半需求产生在北京市,需求量全国第一。排在前5的分别是:北京、上海、深圳、杭州、广州。数据分析这一职业大量集中在北上广深四大一线城市,以及杭州这个互联网和电子商务企业的聚集地。

    通过以上数据可以得出一个结论:数据分析师这高精尖职位,有大量的工作机会集中在北上广深以及杭州,期待往这个方向发展的同学还是要到这些城市去多多尝试。当然,从另一个方面说,这些城市也都集中了大量的各行业人才,竞争压力想必也是很大的。

    任何行业都是看经验的,经验是王道,数据分析师也不例外,按工作经验统计,工作3年至5年薪资待遇普遍不会低于15K,拥有8年至10年经验的数据分析师平均薪资可以达25K左右。怎么样是不是很心动?高薪职业就看你敢不敢来挑战喽!

    数据分析师薪资这么美,工作是不是很累呢?关于数据分析师工作累不累,容大教育来告诉你。

    成为一名合格的数据分析师,不是那么简单的,数据分析师这个职业很肯定说是前途无量,然而,这也说明这并不是一个容易上手的工作,就业门槛是不低的。数据分析师需要储备大量的知识,需要对信息、数据敏感,具备数据分析或数据挖掘的综合能力,承担的责任也是非常重大的。

    那这是否代表数据分析师工作累,需要经常加班呢?NO!数据分析师这只是一个职业,工作累不累和公司行业有很大关系,当然与你的技能熟练程度有一定的关系,刚开始从事这一职业同学初期需要不断的学习,这时相对来说会累一些,当你有一定基础积累经验之后就好多了。

    正所谓“吃得苦中苦,方为人上人”,要想成为一名优秀的数据分析师,赢得高薪走上人生巅峰,坚持就是胜利!

    以上就是容大教育小编给大家分享的数据分析师薪资待遇如何,希望对小伙伴们有所帮助。

  • ?

    大神告诉你优秀数据分析师需具备的技能,让你不走弯路!

    卜广缘

    展开

    优秀的数据分析师需要具备这样一些素质:有扎实的 SQL 基础,熟练使用 Excel,有统计学 基础,至少掌握一门数据挖掘语言(R、SAS、Python、SPSS),有良好的沟通和表达能力,做好 不断学习的准备,有较强的数据敏感度和逻辑思维能力,深入了解业务,有管理者思维,能站在 管理者的角度考虑问题。

    首先,要打好扎实的 SQL 基础。

    SQL 基础之所以重要,是因为数据分析师分析的数据大多都是从数据库中提取而来的。有良好的 SQL 功底并能熟悉使用,不仅能提取到需要的数据,还能大大提高工作效率。尽管有部分数 据可以通过报表等其他途径获得,但绝大多数的数据仍需要通过自己写 SQL 语句。对于一些需要 深入分析用户行为的数据, 用 SQL 提取数据的时间可能会占据整个数据分析过程的 50%,甚至 80% ,而对于未开发成数据报表的常用数据需求,比如游戏封测、开测期间的日报和周报,则需 要编写大量的 SQL 语句来查询相应数据,这时如果熟悉存储过程,能够自动化或半自动化地实现 日常数据收集,就会事半功倍了。

    目前使用较多的数据库有 MySQL、SQL Server 和 Oracle, 数据分析师必须掌握的常用语句和函数有如下几种 。

    (1)合计和标量函数:Count()、Max()、Sum()、Upper()、lower()、Round()等。

    (2)distinct——distinct 关键字可以过滤重复的数据记录。

    (3)Top——结合 select 语句,Top 函数可以查询头几条和末几条的数据记录(仅限 SQL Server, 在其他数据库,可用 limit 语句、rownum 列等方式实现相似的目的)。

    (4)Order By——结合 select语句,Order By 可以让查询结果按某个字段正序和逆序排列。

    (5)Group By——Group By 子句可以对查询的结果集按指定字段分组。

    (6)Group By & Having 子句——Having 语句基于 Group By,定义分组条件。

    (7)Inner Join,Left Outer Join,Right Outer Join and Full outer Join——多表的列关联,即通过 Join 可以将不同物理表中的数据列根据一定的关联条件合并成一个结果集。

    (8)Union 合并查询:Union/Union ALL 查询可以把多张表的数据行合并起来,Union 在合并 时重复的数据仅保留一行,而 Union ALL 则是直接合并,不会处理重复行。 在大数据时代,有很多查询工具可供选择。Hive 和 SQL 是目前比较主流的工具。Hive 是基 于 Hadoop 的一个数据仓库工具,可以将结构化的数据文件映射为一张数据库表,并提供完整的 SQL 查询功能,可以将 SQL 语句转换为 MapReduce 任务进行运行。Hive 和 SQL 是非常相似的, 主要的区别就是 Hive 缺少更新和删除功能。如果你可以熟练使用 SQL,就可以平稳过渡到 Hive。 另外,一定要注意两者在结构和语法上的差异。

    其次,要熟练使用 Excel。

    Excel 可以进行各种数据的处理、统计分析和辅助决策操作,作为常用的数据处理和展现工 具,数据分析师除了要熟练将数据用 Excel 中的图表展现出来,还需要掌握为生成的图表做一系 列的格式设置的方法,如:系列格式美化、三维格式美化,以及坐标轴和网格线设置等,图表可 以与函数或宏等功能一起联用,制作出模拟图表或带有交互效果的高级图表,比如在中国地图上标注各省的人口分布等,实现这些能得到更好地数据分析和查看效果。Excel 里面自带的数据分析 功能,很大程度上能完成专业统计软件(R、SPSS、SAS、Matlab)的数据分析工作,这其中包括 描述性统计、相关系数、概率分布、均值推断、线性、非线性回归、多元回归分析、时间序列等 内容。熟悉使用 Excel 的各项功能对一名优秀的数据分析师来说非常重要。

    再次,要有统计学基础。

    统计学是收集、处理、分析、解释数据并从数据中得出结论的科学,其中的理论及依据就是 数据分析的理论和依据。统计学是数据分析的理论基础,可以使数据分析更加系统化,以系统的 数据科学作为数据分析的指导,才会更好地为数据分析服务。没有统计学基础的分析师的职业发 展之路不会长远,因为其在工作中可能会常常遇到不知道该用什么方法找寻数据规律的瓶颈,因 此掌握数据分析的统计学基础知识是成为一名优秀数据分析师的基础,这也是在招聘数据分析师 岗位时要求应聘者具有统计学知识的原因。当然,如果不是统计或数学专业,分析师还可以通过 自学统计学相关书籍的方法学习。

    统计学知识主要包含: 用于集中趋势分析的平均数、中数、众数;用于离中趋势分析的全距、 四分差、平均差、方差、标准差;研究现象之间是否存在某种依存关系的相关分析;确定两种或 两种以上变数间相互依赖的定量关系的回归分析;揭示同一个变量的各个类别之间的差异,以及 不同变量各个类别之间的对应关系的关联分析、R-Q 型因子分析;研究从变量群中提取共性因子 的因子分析;用于两个及以上样本均数差别的显著性检验的方差分析;概率及分布、参数估计、 假设检验等经典统计学内容。

    最后,至少熟悉并精通一种数据挖掘工具和语言。

    以 R 语言为例,R 编程语言在数据分析与机器学习领域已经成为一款重要的工具。R 作为脚 本语言凭借其良好的互动性和丰富的扩展包资源可以方便地解决大部分数据处理、变换、统计分 析、可视化的问题,并可以重现所有的细节。R 的优势在于有包罗万象的统计函数可以调用,特 别是在时间序列分析方面(在游戏行业也有很好的应用),无论是经典还是前沿的方法都有相应的 包可以直接使用。因此,掌握 R 语言可以提高整体的生产力。然而,要成为一名优秀的数据分析 师,仅学会使用一门语言远远不够,还需要修改数据挖掘语言的程序包或模型,因为现有的程序 包或模型有局限性,在前期数据处理上还是不够自由,如异常值的处理、变量处理等,而自己写 代码编程也可以根据自己的需求进行编写,实现更多的个性化需求。

    一名优秀的数据分析师,还应该主动熟悉业务。

    以游戏公司为例, 如果不熟悉游戏产品制作流程、系统架构、基本运营思路,不知道游戏玩家的基本游戏行为和情感诉求,那么数据分析工作就相当于空中楼阁,所以要多了解策划人员的 游戏设计理念、运营人员的版本计划,抓住一切机会多观察和学习其工作思路和方法,并参与其 具体的实施过程,这样才能逐步积累真正的游戏业务经验。现实情况中很多游戏数据分析师都没有这样的经历,也就没有相关的经验积累,所以他们大多数的工作产出主要是一些非产品相关的 平台数据分析内容和结论;当然,笔者相信并非他们不愿意去积累,而是受限于企业中的一些机 制,比如大多数游戏数据分析师是在技术部门或平台部门,而非具体的产品部门,少有切实深入 到业务现场的机会。 在这种环境下 ,更需要自己主动去了解业务,多玩游戏,多主动和产品部门 联系,若脱离行业认知和游戏业务背景,即使有很好的统计学功底,分析的结果也往往只能停留 在数据解读层面,甚至出现因为不了解业务背景而使结论错误的情况。 从另外一个角度来说 ,懂 业务也是数据敏感的体现,不懂业务的数据分析师,看到的只是一个数字。反之,懂业务的数据 分析师,则看到的不仅仅是数字,他明白这个数字代表什么意义,更能针对数据分析结论提出有 针对性的建议,对产品或者企业来说都是非常有价值的。

    懂游戏业务是做游戏数据分析师的基本要求,这种观点不仅适用于游戏行业,对任何其他行业也是一样的道理。优秀的分析师不仅要懂业务,而且要非常熟悉业务。

    撰写报告的能力对成为一名优秀的分析师来说也非常重要。

    即便有严谨的分析思路和有价值的数据资料,如果不能将其写成报告,或者写的报告未能准确清楚地表达出数据中隐含的规律,那数据的价值将大打折扣。一份好的分析报告,数据资料是 功底,报告的框架是支柱,报告的格式是军装,独特见解是亮点,预测方法是刀枪,正确的判断 是见证。在撰写报告时,深入地思考,深入分析,逻辑严谨,结论有说服力,能提前预测数据趋 势,能从问题中引申出解决方案,提出有指导意义的分析建议,这些都是一名优秀的分析师所体 现的特质。

    除了以上的硬实力,数据敏感力、逻辑思维能力、归纳能力、批判性思维能力、交流沟通能力、责任力这些软性的技能也是优秀分析师必须具备的素质。另外,如果分析师能站在更高的角 度思考问题,有管理者的思维,则能在众多分析师中能脱颖而出。

    以上有些素质是我们在入职场之前就具备的,而有些则需要进入行业环境后逐步积累和建立。 成为优秀的数据分析师需要具备过硬的业务素养和技术能力,这绝非一朝一夕之功,需要在实践 中不断成长和升华。一个优秀的数据分析师应该以数据价值为导向,放眼全局、立足业务、善于 沟通,认真对待每一次的数据分析工作,在工作中快速成长。

  • ?

    成为一名数据分析师需要会哪些技能?

    Mina

    展开
    上海数据分析网

    数据分析师这个职业越来越火,越来越多的人想往这个方向发展。

    有在校生,也有转行的小伙伴来咨询数据分析师这个职业的相关问题。

    从大部分情况来看,大家对于数据分析师的职业发展和技能非常关心。

    那么别的先不说,数据分析入门到底要学什么?怎么学?

    Excel

    作为数据分析师,Excel是必备技能。Excel 是经过检验的可靠的数据分析工具,它广泛存在,非程序人员也能便捷操作,所以大多数企业即使也使用其他工具,但 Excel 工具还是他们的不二选择。

    统计学

    统计学同样是数据分析师的必备技能之一,你只有学好了统计学才能谈得上数据分析。统计知识会要求我们以另一个角度看待数据。当你知道AB两组的差异用平均值看是多傻的事情,你的分析技巧也会显著提高。如果你想成为一名出色的数据分析师,那么你就必须要会统计学。

    推荐图书:《深入浅出统计学》

    上海数据分析网

    大概是最啰嗦的深入浅出系列,从卖橡皮鸭到赌博机的案例,囊括了常用的统计分析如假设检验、概率分布、描述统计、贝叶斯等。书本注重应用和趣味性,数学推理一般。

    SQL

    sql是所有数据库查询的语言,sql非常容易入手。

    针对不同的数据库,如mysql、sqlserver、oracle等,sql语法会有所不同,但是总体上大同小异,只是细微处的差别。

    而且如果你有数据库基础的话,只需要找些sql查询的习题来做一下,就会很快的得到提高。

    推荐图书:《MySQL必知必会》

    上海数据分析网

    学习 SQL 的入门书,薄册子一本,看起来很快。SQL 是个性价比很高的技能,简单而强大。任何想进一步提高自己数据分析技能的产品/运营/分析师 同学,都建议点亮 这个技能点。

    数据分析思维

    作为一名数据科学家需要很挑剔,并且善于发现他人会遗漏的东西。那么我们应该如何做到像数据科学家一样思考呢?

    梳理分析思路,并搭建分析框架,把分析目的分解成若干个不同的分析要点,即如何具体开展数据分析,需要从哪几个角度进行分析,采用哪些分析指标(各类分析指标需合理搭配使用)。同时,确保分析框架的体系化和逻辑性。

    推荐图书:金字塔原理

    上海数据分析网

    金字塔的基本结构是:中心思想明确,结论先行,以上统下,归类分组,逻辑递进。先重要后次要,先全局后细节,先结论后原因,先结果后过程。

    行业知识

    对于数据分析师来说,业务的了解比数据方法论更重要。而且业务学习没有捷径。这一部分也没有什么书可以看的了,基本都靠搜索,总结,思考,再搜索,总结,思考。

  • ?

    数据分析师必备的5项能力!

    Elana

    展开

    一、数据工具

    作为一名数据分析师,EXCEL是必须掌握的,EXCEL的图形表达能力够强大,也能提高你的工作效益,如果你能懂HADOOP,那就离大数据更近了。

    如果你不想你依赖IT人员获取数据,可以学会SQL,SQL是为统计取数而生的方便工具,图形化的透视方式SQL也能表达的淋漓尽致。

    二、分析能力

    可以分广度、深度、速度来分析理解

    速度:互联网发展快速,明明可以一个月的项目,你却花了两个月,这就是在浪费时间与人力。

    广度:每个产品的用户拉新做的好,那么用户留存就会降低,活跃度也会因此降低,所以并不是每个产品都适合一上线就大量拉新,要分析各者之间的关系,保持一个平衡度,这些数据分析在广度上有一定的了解。

    深度:有些问题一个人解决不了或者很难,多几个人就可以了,比如说搬砖,十人人搬总会比一个人搬快得多,哪怕不是十倍速度。而有些问题,靠堆人力是没用的。

    三、技术能力

    作为一名数据分析师,统计学是你的必备基础,然后用高级模型来解决实际业务,学了这些理论知识,你就需要一些工具辅助你,而P和PYTHON是很有名的数据分析工具,而数据分析师是一定跟数据打交道的,而数据都是储存在数据库里面的,所以掌握数据库技术也是必要的。

    如果不知道从哪里找资料学习,推荐《统计学》《R IN ACTION》《深入浅出数据分析》这三本书,会对你很有帮助。

    四、沟通能力

    数据分析贯穿BIT、数据、技术、业务整个链条,通过对产品数据分析的结果从而说服产品和工程方面来改变产品,产生效应。这时候就得展现你的沟通能力了,你能清晰表达并让他们接受,这个过程就靠你自己的语言组织了。实操练习“以上都是理论和工具,但是实践才是出真知,不管是刚接触数据分析的职场人,还是专业学习数据挖掘分析的你,在学习以上内容的同时,多参加一些比赛,学习同领域的专业大神,自己操控一些项目,提升自己的专业能力,积累经验。

  • ?

    大数据工程师和数据分析师有何区别?

    终成伤

    展开

    大数据并不是一种概念,而是一种方法论。简单来说,就是通过分析和挖掘全量的非抽样的数据辅助决策。大数据可以实现的应用可以概括为两个方向,一个是精准化定制,第二个是预测。比如像通过搜索引擎搜索同样的内容,每个人的结果却是大不相同的。

    随着大数据的愈演愈热,相关大数据的职业也成为热门,给人才发展带来带来了很多机会。数据工程师、数据分析师已经成为大数据行业最热门的职位。

    数据分析师是什么?

    数据分析师不同行业中获取数据,并通过获取到的数据对问题进行解答。最后还需要以合适的方式对结果进行展示,以辅助企业做出商业决策。一般来讲,数据分析师的任务是对数据进行清洗、分析以及可视化。

    根据行业的不同,数据分析师的头衔也可能不同。比如:业务分析师、商业智能分析师、运营分析师、数据库分析师等等。不管头衔是什么,数据分析师都可谓是通才。他们能够胜任诸多岗位与团队角色,同时也能在极大程度上帮助企业做出基于数据的决策。

    数据分析师所需技能

    编程,统计学和数学,机器学习,数据可视化和通信技术,数据处理和数据集定义

    数据工程师是什么?

    在大数据的时代,数据工程师的角色愈发地重要。数据工程师一般被定义成“深刻理解统计学科的明星软件工程师”。数据工程师是系统的构建者与优化者,所有公司正常运营的基础之一,数据工程师的职责就是保证数据在接收、转移的准确性,并且保证其它用户对数据的可访问性。

    和数据分析师不同,他们不太关注统计、分析技能、建模等。他们的工作重点在于数据架构、计算、数据存储、数据流等。因此,数据工程师必须具备相当强的编程能力—包括编写数据查询程序的能力。也就是说,他们的能力必须达到开发运营高手的级别。

    数据工程师还负责数据库设计、仓储数据库、建立数据库等。 这就意味着,他们必须十分熟悉现有的数据库技术和数据管理系统,比如和大数据有关的Hadoop与HBase 等。此外,非功能性的基础设施问题,如数据的可扩展性、可靠性、韧性、有效性,备份等也由数据工程师来负责。

    数据工程师所需技能

    数学和统计学,程序设计和计算机科学,分析技能,商业战略

    对于招聘市场端在大数据工程师和大数据分析师二个方向所涉及的岗位具体名称如下图所示:

    大数据工程师方向:

    大数据分析师方向:

    总结:

    数据工程师的重心在“后端”,他们需要持续的优化数据通道,才能保证企业数据的准确性与可用性。同时还需确保在需要的时候能够顺畅地将数据提供给用户。

    数据分析师则是通过使用数据工程师所构建的自定义API来提取新的数据集,并对其中的数据趋势进行识别,同时对异常数据进行分析。分析师们将会对结果进行总结,并以一种清晰直观的方式来展示这些结果,以便于其它非技术团队能够更好地了解他们目前的工作效果。

    有了以上信息,数据分析师和大数据工程师之间的差异应该清楚。对于数据驱动的职位来说,通过数据来找到正确的问题,并据此进行更加精确的试验,这就是其最根本的工作内容。进一步的,数据科学领域将不断发展进步,同时也会对相关从业人员提出持续学习的要求。

    分享 IT 技术和行业经验,请关注-技术学派。

  • ?

    如何区分大数据热门职位——数据科学家、数据分析师

    徐宛海

    展开

    目前数据工程师已经出现在各种招聘上,很多人容易将数据工程师和数据科学家职位弄混淆。接下来我们将探讨这两个职位间的区别与联系,并分析企业在何种情况下需要其中一个,或两个都需要。

    大家一直对数据科学家,数据工程师和统计分析师之间的概念是混淆的。而甚至有一些结论,是认为所有这些人做同样的工作,只是他们的称谓不同而已。我特别惊讶于听到这种答案,下面帮助大家了解数据科学家VS数据工程师的工作角色。这将帮助大家在未来的工作中选择最适合你们的工作角色。

    数据科学家所具备的技能更专注于数学方法和数据分析,而数据工程师的重点是数据挖掘,云计算和编程技能。数据工程师致力于开源大数据的管理。一位数据库行业资深观察者说道,在他最近的一次硅谷之旅中,他发现,在这个作为大数据温床的地方,数据工程师这个术语已经被广泛使用。

    数据工程师这个职位的产生,有部分原因是由于人们对数据科学家的能力预期过高。而现实是,数据科学家的工作描述所涉及的技能太过于宽泛。搭建数据处理集群、程序编码,学习最新的开源数据API。这些都被归结为数据科学家必须掌握的技能之一,但事实上,它们应该是数据工程师的职责范围。

    工作职责

    数据科学家:1、根据商业需要规划和实施数据分析项目;2、致力于数据挖掘架构、模型标准、数据报告、数据分析方法;3、与利益相关人合作在现有的数据系统中集成数据挖掘结果;4、监督数据挖掘系统性能并实施优化和改进。

    数据工程师:1、设计、搭建、安装、测试和维护大规模数据管理系统;2、改进数据基础设施、业务流程和数据标准;3、在现有体系架构中集成新的数据管理技术和软件工具;4、开发用户侧软件和数据分析应用程序。

    必备掌握技能

    Apache hadoop,分布式计算和NoSQL数据库,是数据工程师必须掌握的几个重要技能。

    对于数据科学家而言,其掌握的技能应包括数据统计,统计建模,预测建模和机器学习等。

    薪资待遇

    但总的来说,数据工程师并没有得到与数据科学家同等的薪资待遇。例如,据招聘网站Glassdoo统计,全国数据工程师的平均工资大概为95526美元,而全国数据科学家的平均薪水是113436美元。

    当然,也有例外情况,有的数据工程师薪酬可能会突破100000美元。尽管Dice宣称并没有足够的样本数据来评估数据工程师薪水,但Melk指出了掌握类似技能人员的年薪水平,比如Cassandra(147811美元),Pig(132850美元)和MapReduce编程(131563美元)。这表明数据工程师的薪资可以很容易超过100000美元这个水平。

    职业方向:

    初级数据科学-->数据科学家-->高级数据科学家-->首席数据科学家

    数据工程师-->高级数据工程师-->BI架构师-->数据架构师

    数据工程师和数据科学家的工作现在包含一些混合和重叠的技能。这是在任何新领域或新趋势上都存在的现象。数据工程师目前发展似乎处于上升阶段,毫无疑问的是,数据工程师的出现,表明数据管理领域一直都在发生变化。

  • ?

    一个工作3年的数据分析师,所具备的能力有哪些?

    Manta

    展开

    文 | 邹昕-知乎

    来源:再生谈|reborn_chat

    受本人背景和知识水平所限,本答案局限性如下(包括但不限于):

    1. 更适用于中大型公司;

    2. 更适用于互联网公司;

    3. 可能更适用于美国的工作环境。

    个人以为,一个三年工作经验的数据分析师应该具备以下方面的能力:对技术的掌握,对产品的理解,对数据的敏锐性,数据和产品之间互相转化的能力,分析思维的广度、深度和速度,数理统计的能力,沟通的能力,辅导新人的能力,面试把关的能力。

    以下分开来说,同时举例的时候假设这个数据分析师是知乎这个产品的,目的是为了增长活跃用户。

    【1】对技术的掌握

    不一定需要非常高深的技术,但是基本的一定要过关。比如针对互联网行业的数据分析,SQL 是一定要过关的。在这基础之上,掌握公司惯用的BI工具或者报表工具,譬如帆软系列;Python / R 可以提高长期的工作效率,但在初期并不一定需要。

    简单来说,技术能力决定了一名数据分析能力的下限,而对产品和业务的理解则决定了上限。

    如果缺乏技术的支持,那就只能去当 CEO 了。

    就好比在电影 Margin Call 里,底下的小兵负责分析数据,各种模型预测金融危机什么时候会发生。

    而对于 CEO 来说,他的任务就是猜。

    【2】对产品的理解

    数据分析的目的是为了改进产品。如果缺乏对产品的理解,那么技术再好,也有可能像是无头苍蝇到处乱撞。

    或者是变成 data dump,提供一堆一堆的图表,但其中有互相什么关联,能说明什么问题,提供什么样的建议,却并没有好的想法。

    如果是初入行的话,这还是问题不大的。

    因为新人可以有老板带着,或者是老人带着,但是如果想要更进一步,那就必须能够自己独立的做项目。

    尤其是在互联网行业更是如此,除了新人之外,对大多数人的基本要求都是能单兵作战,不需要详细的指导。

    同时在很多情况下,问题是很开放性的,对于如何解决并没有一个非常固定的套路,或者是因为这完全就是一个新的问题,或者因为不同产品之间套路无法直接套用,需要做大量的调整和创新。

    比如这里面增长的例子,哪些是可以借用于知乎的,哪些是需要调整的,哪些是完全不适用的?

    【3】对数据的敏锐性

    对数据的敏锐性体现在两方面,一是在结果还不是那么清晰的时候,甚至根本就没有什么数据的时候,能够大致感觉往哪个方向深挖是更有可能出成果的;二是在数据出问题的时候,能够反应出来,及时找出原因。

    比如做知乎的数据分析,目的是为了增长活跃用户,可以做的地方有很多,比如增加获新、增加内容、增加用户关注话题数、增加用户关注人数等等。一个经验丰富的老司机可以快糙猛的大概估算一下各个方面的机会有多大,大致的实施难度如何,风险是大是小,产品哪些方面是有缺陷可以改进的。

    另一方面,是人就会犯错,最大的区别在于有的人可以很好的纠错,而有的人则需要别人提醒,还有的人即使别人提醒了也反应不过来。

    【4】数据和产品之间互相转化的能力

    在互联网行业,多数时候问题是很不清晰的,比如说问题可能是2017年新用户留存远差于2015年的用户,如何解决?

    对数据分析师来说,并不会有一个详细的单子来告诉你都有哪些步骤,而是需要自己灵活处理。

    一方面这些问题本身就比较新,虽然会有一个大致的套路,比如 AARRR 模型,解决增长需要先解决留存等等;然而再往下具体的时候,套路就没有那么固定了,因为不同的产品之间可以差别很大。

    即使像是 Quora 和知乎这样理应非常类似的产品,也可能因为一些或大或小的差异,导致给分析数据也带来差别。

    比如 Quora 的 upvote 并不完全代表赞同,而更多带有传播的意味。

    而对于知乎来说,点赞即是赞同,传播只是副产品而已。

    如果只懂数据不懂产品的话,很容易进入一个误区,要么产品/业务方追着问数据,要么没活儿干。

    【5】分析思维的广度、深度和速度

    速度这个比较好理解,尤其是在互联网行业,讲究快糙猛,没有时间精细打磨。

    比如一个项目可以花两个月时间做出 95%,也可以花两周时间做 80%,那么多数时候都会是后者。

    广度:产品的各个方面之间总是互相牵扯的。最简单的例子,如果知乎的拉新做得非常好,那么留存就有可能降低,用户活跃度也有会降低。

    如何分析各者之间的关系,如何保持一个合理的平衡,如何增加其中一个不过于负面影响其它,这些数据分析都需要在广度上有一定的了解。

    深度:有些问题一个人解决不了或者很难,多几个人就可以了,比如说搬砖,十人人搬总会比一个人搬快得多,哪怕不是十倍速度。而有些问题,靠堆人力是没用的。

    【6】数理统计的能力

    这一部分跟 1,3,5 是相关的。不一定需要特别高精尖,但是对于分析问题会有很大的帮助。比如说如何识别数据分析里可能出现的错误。

    【7】沟通的能力

    除非兼任软件工程师和产品经理的职,否则数据分析师总是需要通过说服产品和工程方面来改变产品,产生影响力。

    有了好的结果是第一位,如何影响合作伙伴,让他们接受自己的建议甚至比有好的结果还重要。

    毕竟,没有声音,再好的戏也出不来。

    【8】辅导新人的能力

    毛主席说过,人多力量大,要把敌人淹没在人民战争的汪洋大海中。

    辅导新人,不只是团队 leader/manager 的要求,对于独立贡献者(inpidual contributor)也是一样重要的。

    闻道有先后,术业有专攻。

    一个人的力量终究是有限的,如果把自己的能力复制到整个团队甚至整个公司,是增大自己影响力最有效的办法之一。

    【9】面试把关的能力

    大多数人应该都希望自己的公司处于一个增长的状况,如果是高速增长那就更好不过了。

    有增长,就必然要招人。

    而招人并不是简单的招人来干活,而是招来更优秀的人进一步提高团队的水平。

    这对于高速增长的团队来说是一个很大的挑战,所以提高面试技能和精准的判断面试者的能力,无疑是有效的扩张团队的不二法则。

    【10】少睡的能力

    比如说七周不睡觉,快速成为数据分析师(开玩笑的)。

  • ?

    Top30数据分析师常见面试题(附答案)!

    权力

    展开

    【IT168 评论】这是一个用数据说话的时代,也是一个依靠数据竞争的时代。各大互联网公司都在不断完善自己的数据分析团队,数据分析师的薪酬也是水涨船高。业内人士透露,应届毕业生的平均薪资大概在6K左右,1至3年经验的大概在10K到20K之间,5至10年经验的大概在25K以上。薪资还是十分诱人的,那么,如何快速成长为一名年薪百万的数据分析师呢?快来看看,以下30道数据分析相关面试题,你会多少?

    1、分析数据还要写java代码是不是效率有点低?

    2、成为一名数据分析师需要具备哪些技能?

    要成为一名数据分析师,需要掌握丰富的报告软件包(Business Objects),编程语言(XML,Javascript或ETL框架),数据库(SQL,SQLite等);能够准确分析、组织、收集或传播数据;掌握数据库设计,数据模型,数据挖掘等方面的技术知识以及分析大型数据集(SAS,Excel,SPSS等)的统计软件包知识。

    3、分析项目的各个步骤是什么?

    分析项目的各个步骤包括:

    ·问题定义

    ·数据挖掘

    数据准备

    模型化

    数据认证

    实施跟踪

    4、分析的结果数据特别大,在线请求这些结果数据扛不住了,咋搞?

    5、列出数据清理的最佳实践?

    一些数据清理的最佳实践包括:

    按不同的属性排序数据

    对于大数据集,逐步清理并改进数据,直到获得良好的数据质量

    对大型数据集,可以先将其分解为小数据集,使用更少的数据将增加迭代速度

    要处理常见的清理任务,请创建一组实用程序函数/工具/脚本。它可能包括基于CSV文件或SQL数据库重映射值,或者正则表达式搜索和替换,消除所有不匹配正则表达式的值

    如果在数据清理方面存在问题,请按照估计的频率进行安排并解决问题

    分析每列的汇总统计数据(标准差,均值,缺失值的数量)

    保持对每一个清理操作的跟踪,以便可以根据需要更改或删除操作

    6、海量日志数据,提取出某日访问百度次数最多的那个IP。

    7、可用于数据分析的一些最佳工具清单有什么?

    Tableau

    RapidMiner

    OpenRefine

    KNIME

    Google Search Operators

    Solver

    NodeXL

    io

    Wolfram Alpha’s

    Google Fusion tables

    8、数据挖掘和数据分析之间的区别是什么?

    数据挖掘和数据分析之间的区别在于:

    数据分析:针对个别属性的实例分析。提供有关属性的各种信息,如值范围,离散值及其频率,空值的发生,数据类型,长度等。

    数据挖掘:重点关注聚类分析,异常记录检测,依赖关系,序列发现,多个属性之间的关系控制等。

    9、给定a、b两个文件,各存放50亿个url,每个url各占64字节,内存限制是4G,让你找出a、b文件共同的url?

    10、用于处理分布式计算环境中应用程序大数据集的Apache框架有哪些?

    Hadoop和MapReduce是由Apache开发的用于处理分布式计算环境中应用程序大数据集的编程框架。

    11、腾讯面试题:给40亿个不重复的unsigned int的整数,没排过序的,然后再给一个数,如何快速判断这个数是否在40亿个数当中?

    12、解释KNN插补方法是什么?

    在KNN插补中,通过使用与其值缺失的属性最相似的属性值来推断缺少的属性值。通过使用距离函数,确定两个属性的相似度。

    13、数据分析师使用的数据验证方法是什么?

    通常,数据分析师用于数据验证的方法是数据筛选和数据验证。

    14、解释应该如何处理可疑或缺失数据?

    准备提供所有可疑数据信息的验证报告。它应该提供信息,如失败的验证标准以及发生的日期和时间

    有经验的数据分析师应该检查可疑数据以确定其可接受性

    应该找出无效数据并用验证码替换

    对缺失数据进行处理,使用最佳分析策略,如删除,单一插补方法,基于模型的方法等。

    15、如何避免过拟合?

    过拟合表现在训练数据上的误差非常小,而在测试数据上误差反而增大。其原因一般是模型过于复杂,过分得去拟合数据的噪声和outliers。常见的解决办法是正则化:增大数据集,正则化

    16、解释异常值是什么?

    异常值是分析师使用的一个术语,指的是一个远远超出样本总体模式的值。有两种类型的异常值:

    Univariate

    Multivariate

    17、解释分层聚类算法是什么?

    分层聚类算法结合并划分现有的组,创建分层结构并展示组划分或合并的顺序。

    18、解释K均值算法是什么?

    K均值是一种著名的分区方法。对象被分类为属于K个组中的一个,k是先验选择的。

    在K均值算法中:

    簇是球形的:簇中的数据点以该簇为中心

    簇的方差/扩展是相似的:每个数据点属于最接近的簇

    19、数据分析师所需掌握的关键技能是什么?

    数据科学家必须具备以下技能:

    数据库知识

    数据库管理

    数据混合

    数据查询

    数据操作

    预测分析

    基本描述性统计

    预测建模

    高级分析

    大数据知识

    大数据分析

    非结构化数据分析

    机器学习

    演示技巧

    数据可视化

    报告设计

    20、解释协同过滤是什么?

    协同过滤是一种基于用户行为数据创建推荐系统的简单算法。协同过滤最重要的组件是用户对项目的兴趣。

    协同过滤一个很好的例子就是购物网站上出现的类似“为您推荐”的模块,该模块通常会获取用户的浏览记录信息,以弹出用户可能喜欢或需要的商品。

    21、大数据中通常会使用到哪些工具?

    大数据中使用的工具包括:

    Hadoop

    Hive

    Pig

    Flume

    Mahout

    Sqoop

    22、解释什么是KPI,实验设计和80/20规则?

    关键绩效指标(KPI):它代表关键绩效指标(Key Performance Indicator),它是关于业务流程的报告或图表

    实验设计:这是用于分解数据,采样和建立数据以进行统计分析的初始过程

    80/20规则:这意味着你收入的80%来自客户的20%

    23、解释Map Reduce是什么?

    Map-Reduce是一个处理大型数据集的框架,可以将它们分解成子集,在不同的服务器上处理每个子集,然后混合每个子集上获得的结果。

    24、解释聚类是什么?聚类算法的属性?

    聚类是一种应用于数据的分类方法。聚类算法将数据集划分为自然组或集群。

    聚类算法的属性是:

    Hierarchical or flat

    Iterative

    Hard and soft

    Disjunctive

    25、对数据分析师有用的统计方法是什么?

    对数据科学家有用的统计方法是

    贝叶斯方法

    马尔科夫过程

    空间和集群进程

    统计数据,百分位数,异常值检测

    计算技巧等

    简单的算法

    数学优化

    26、时间序列分析是什么?

    时间序列分析可以在频域和时域两个域中完成。在时间序列分析中,可以通过指数平滑,对数线性回归等各种方法分析数据,来预测特定过程输出。

    27、解释空间自相关分析是什么?

    空间自相关分析是地理空间分析的常用形式。它由一系列为不同空间关系计算的估计自相关系数组成。当原始数据表示为距离而不是单个点的值时,它可以用于构建基于距离的数据相关图。

    28、散列表是什么?散列表冲突是什么?如何避免?

    在计算中,哈希表(散列表)是键值对的映射,这是一个用于实现关联数组的数据结构。它使用散列函数来计算一个时隙阵列的索引,从中可以获取所需的值。

    当两个不同的键散列到相同的值时,发生散列表冲突。两个数据不能存储在阵列的同一个插槽中。

    为了避免散列表碰撞,有很多技巧,这里列出两个:

    分离链接:它使用数据结构来存储散列到同一个插槽的多个项目。

    再探测:在找到查找位置的index的index-1,index+1位置查找,index-2,index+2查找,依次类推。这种方法称为线性再探测。

    29、解释 imputation是什么?列出不同类型的插补技术?哪种插补方法更有利?

    在插补过程中,我们用替代值替换丢失的数据。插补技术涉及的类型有:

    单一插补

    热点插补:从随机选择的类似记录中推断缺失值

    冷却板插补:与热点插补相同,但更先进,从其他数据集中选择供体

    平均估算:在所有其他情况下,用该变量的平均值代替缺失值

    回归插补:用基于其他变量的变量预测值替换缺失值

    随机回归:与回归插补一样,但它将平均回归方差加入到回归估计中

    多重插补:与单个插补不同,多重插补会多次估计值

    虽然单一插补法被广泛使用,但并不能反映随机丢失数据所造成的不确定性。因此,在数据丢失的情况下,多重插补更有利。

    30、解释N-gram是什么?

    N-gram是来自给定序列文本或语音的n个项目的连续序列。这是一种以(n-1)形式预测下一个项目的概率语言模型。

数据统计分析师

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP