- ?
数据分析师需要会什么技能?数据分析师必会的5个技能!
毒蘑菇
展开
数据分析的目的是把隐没在一大批看来杂乱无章的数据中的信息集中、萃取和提炼出来,以找出所研究对象的内在规律。几年前, 数据分析还是一个比较鲜见的职业。而今天,无论各行各业,它无处不在的闪烁着耀人的光芒。那么做数据分析需要掌握哪些技能呢?
数据分析师如何理解?
数据分析师能洞悉一个方程式的商业意义。他们知道如何提出正确的问题,非常善于数据分析,数据可视化和数据呈现。不管是给另一个数据分析师还是C级执行做演讲,数据分析师都是数据提取,模式识别以及从大量数据中洞察问题方面的能手。
数据分析师需要会什么?
理解数据库
还以为要与文本数据打交道吗?答案是:NO!进入了这个领域,你会发现几乎一切都是用数据库来存储数据,如MySQL,PostgreSQL,CouchDB,MongoDB,Cassandra等。理解数据库并且能熟练使用它,将是一个基础能力。
数据和数据仓库数据是数据分析的基础,数据库是数据的承载,数据仓库是有主题的数据库。效率高的数据仓库不那么容易设计出来的。
数据管理
数据管理与数据库的结构有关,这些数据库可以对谁有权访问不同的信息给予复杂的规定。尽可能有效地存储数据有许多的不同方法。 需要数据管理技能的常见工作是数据库管理员。
商业智能
商业智能是通过收集数据来影响业务决策的做法。 例如,一家使用直邮和Facebook广告来推销其产品的公司,可以使用商业智能软件以帮助了解每种营销策略的运作情况。 业务分析师,商业智能开发人员和客户洞察分析师是几项需要商业智能技能的工作。
数据分析
真的,不开玩笑,“数据分析”是数据分析师最需要的技能。 除了知道如何使用特定的编程语言和工具之外,雇主需要你了解数据中的模式是否有意义,以便你可以得出准确和可行的结论。
数据可视化
信息的质量很大程度上依赖于其表达方式。对数字罗列所组成的数据中所包含的意义进行分析,使分析结果可视化,这是对于数据科学家来说十分重要的技能之一。
将数据与设计相结合,让晦涩难懂的信息以易懂的形式进行图形化展现的信息图最近正受到越来越多的关注。
- ?
什么样的人比较适合做数据分析?
邵冥
展开
我觉得无论什么工作兴趣最重要,要做数据分析师最基本的就是不讨厌数字,如果你跟他讲那个指标是通过怎么样的乘除加减得到的,他会觉得不耐烦,那么显然他不适合做数据分析;如果对数据较敏感,能够一眼发现异常值,数据分布情况,当然是最好的。
再则就是逻辑性,可以让他试试爱因斯坦的那道经典的逻辑题,看看能否解出来,需要多久;逻辑思维对数据分析尤其重要,不然会被各种指标的定义规则、与业务的联系纠结死,逻辑思维好的人写SQL等数据处理脚本也会更加高效。
接着是业务理解能力,最简单的就是让他定义下网站的目标是什么,哪些指标可以作为KPI,用户从进入网站到达成网站目标的整个过程是怎么实现转化的,能否画出业务流程图。(宏观层面,不要深入细节)
如果偏技术则需要懂一些数据库结构和SQL,如果偏展现需要考验下对图表的掌控能力,什么时候用什么图表合适,甚至如何配色。
最后就是细心、耐心和交流能力,做数据分析有时会很纠结,细心和耐心是必需的,好的交流能力可以让数据分析师更好地阐述清楚各类问题。
这些都是比较基础的东西,也是短期难以培养起来的技能。至于另外业务相关的一些知识,可以通过培训获取,问一个未接触过你的网站业务的人一些业务知识其实有些不公平,其实如果具备上面几点,一旦熟悉网站和业务之后,一定会成为优秀的数据分析师。
——谷芬芬
专业内的要求基本就是对数据的意识和一些技能的掌握。下面具体说说从一些非专业内要求的方面出发,有哪些方面能表现这个人更适合数据分析。
首先是看到数据有兴奋感的人。有兴奋感说明你有兴趣,那说明很会有意愿把数据分析好。
其次是愿意学习的人。你分析的内容永远不会一尘不变,即使你分析的主题是相对固定,但业务是变化的,你需要不断的学习业务,同不同人沟通,吸收别人的观点。所以分析师一定要报着学习的态度。
然后是逻辑思维较强的人。数据分析师想要把你的分析好,一定要有结论思维。
还有就是较强的表达与沟通能力。因为数据分析最终价值的实现,一般来说不会是分析师亲自去制定或者实施。所以你一定很有条理、逻辑清晰向别人表达,让业务方认识到你分析结果的价值,从而影响业务方去愿意使用你从数据中得到的观点。
——欧阳帅
觉得还是应该先看清楚自己的未来的方向吧~
我有不少朋友 非数学/计算机/统计学 专业毕业的朋友走的是这个方向,数据相关,非技术路线,更偏向于市场方向,对技术的要求只是Excel、PPT,最多要求SPSS,很少要求会写SQL。这条路线看起来比较高大上,可以走外企路线。
数据分析师方向,很多读数学、统计学、计算机的童鞋会选这个方向,终极目标都是成为数据中心的负责人。中间有2个分叉,一条是从数据分析师到数据产品经理,这个路线最近很流行,主要是结合了数据分析和产品经理的能力。一条是高大上一点的数据挖掘方向,这条路线要求比较高,但薪资也高。当然能走数据挖掘路线是很多数据分析师的梦想,但算法和代码实现能力不是谁都能掌握的。.
根据你自己想走的路,加上自己的技能点。
——张锦华
想了解更多相关内容,记得持续关注我们哦。
如果你觉得有点意思,请有秩序的评论、转发、收藏。
- ?
每个人一定要会的数据分析,必须收藏
雾非雾
展开
从普通运营到高级运营,你可能需要具备很多的技能,每个人的专长可能各有侧重,但是有一项你必须掌握,那就是数据分析。
最近听到自己的闺蜜不断的抱怨某节课的高级运营进阶课程好难,太多与数据相关的案例和作业,自己完全没有基础,也不懂数据分析,后悔莫及。其实,从普通的执行层运营到高级运营没有捷径,但是却有一个必备的技能,就是说了千万遍但还是被你忽略的“数据分析”。
大数据时代,数据是一家企业的导航仪,同样也是运营工作的坐标,任何的商业行为,最终都要在数据上体现成果,越来越多的企业专门设立了数据运营,数据分析师等岗位。甚至在招聘网站上随意搜索的运营岗位,工作职责中基本都会涵盖部分数据分析的能力要求,对于运营人来说,拥有数据分析的能力已然成了快速进阶的加速器。
这些应该足够引起你对数据分析的重视。数据分析已经不单单是一种专业垂直的能力,从用户运营,产品运营,新媒体运营,内容运营,渠道运营,活动运营等每个职位本身来讲,都需要数据来追踪效果,得到反馈。
很幸运曾经在专业的数据分析公司做了一年的运营,跟着阿里系的高级数据分析师学习了数据分析以及数据驱动产品和运营的本质内核,今天就从案例和数据分析的方法和价值上讲讲为何你需要这项技能来进阶。
数据驱动运营,运营工作的本质是什么你真的知道吗?
运营工作不管是做一个活动,写好一篇推广文案,还是做一次推广投放,还是管理一个用户群,都是要通过一系列的运营手段,更好的作用于一款产品,辅助产品的成长,还要管理用户的预期,打动用户,与用户建立情感连接。在此过程中,所有的运营行为,最终都要量化成对应的指标,所以,运营工作的任何一步都需要数据支撑。
数据之所以可以驱动运营和商业行为,是因为数据能够带来价值:
可以客观反映一款产品的状态和所处的阶段;做完一次运营行为,可以通过数据知道效果好不好,问题出在哪里;数据可以直接的告诉你实现某个目标的最佳路径;精细化的数据分析可以帮助更加了解用户,理解用户。
所以,数据分析需要以目标为导向,学会做数据维度的逐级拆分,以结构化思维来做运营数据的全面的,系统性的分析。哪个是最好的流量来源渠道?高质量用户的行为特征是什么?活动转化设置的转化率是多少?都是依靠数据来进行调整内容和决策。
数据分析的基本思路和框架
我们可以按照以下思路来进行运营工作中的数据分析:
1. 确定数据分析目标;2. 明确数据目标的关键影响维度拆解;3. 找出不同数据维度之间的关联和关系,从而建立起数据关系模型;4. 发现问题数据及出现的云隐;5. 针对问题数据影响维度做出相应的优化。
任何的运营行为,都可以按照此思路来进行数据的采集、整理、分析,得出我们想要的结论。
运营工作中的数据分析,需要找到当前的关键指标数据
根据企业的商业模式和产品所处的阶段,即便非技术企业也需要一些简单且关乎核心的指标数据,并持续的关注下去。
对照下表,现在你的商业模型和运营工作处于哪一个阶段,还需要什么才能进入下一个阶段?
经典的数据分析方法,百试不爽
海盗指标 AARRR
海盗模型相信做运营比较久的同学都听说过,海盗指标是经典的数据分析方法,应用范围较广泛,大部分的产品模式都可以使用海盗指标AARRR来进行数据监测,也是创业公司及前期的运营行为最需要关注的指标分类:获取用户、提高活跃度、提高留存率、获取营收、自传播,简称AARRR。
这五个指标并不一定遵循严格的先后顺序,例如:用户可能先推荐某一个产品后再购买,或者在光顾很多次之后再注册。
漏斗模型
用户GA的同学应该经常见到这个图片,目前国内的数据分析软件已经能够达到6个层级的漏斗分析,并且十分详细。漏斗模型的分析方法可以帮助你理解产品是如何获取到用户的注意力的,并且能够清晰的得知用户从最初登陆产品的一系列行为的全过程(完成一次购物,生产一些内容,分享一段信息)。
还有常见的金字塔模型、病毒式增长引擎等都是通过固定的模型进行数据分析的分析方法。
第一关键指标的驱动力
在数据分析中,能够有效驱动运营的指标并不是千篇一律,大量的虚拟指标是无效的。因此学会找到第一关键指标很重要。下面通过几个实际案例来说明一下第一关键指标的驱动力。
数据分析并不难(后面会推荐入门及进阶的数据分析书籍),但是,要在众多的数据指标中找到第一关键指标并不容易。
Linkedln 通过数据找到提升转化率的第一指标
Linkedln 是国际知名的职场社交服务,创始人雷德·霍夫曼曾效力于苹果公司及富士通公司,他深知用户的数量与结成的关系网络深度直接决定了其价值的大小,因此,他带领团队做了一系列的增长测试,通过反反复复的试验,做了大量的数据分析,最终确定新注册用户愿意邀请的朋友数量达到“4”个,能实现最大程度的邀请转化率。找到了这个关键指标就对产品和运营工作做了一系列的优化来提升增长。
同理社区型产品,都可以通过找到第一关键指标,比如新注册用户关注几个人,产生多少点赞,评论等行为,留存率会提升,流失率会降低。
MOZ公司通过减少KPI数目来更好的集中注意力
MOZ(SEOmoz)是一家成功的软件即服务(software as aService,SaaS)供应商,主要业务是帮助企业监控和提升其网站在搜索引擎中的排名,在2012年5月份公司成功融资1800万美元之后,MOZ的首席执行官兰德·费西金在网站上发表了文章,还分享了一些非常具体的关于客户从免费试用转化为付费或流失的数据。
MOZ的增长营销官副总裁乔安娜·洛德在后面的访问中提到了moz是如何处理这些指标的:“我们是非常依靠数据做决策的公司,每个团队每周都要向整个公司汇报KPI、进展、并总结。我们还在公司的墙上挂上超大的屏幕,即时显示我们的付费客户数量和试用用户数量,实现全公司层面的数据透明可以使员工随时了解情况,同时也是对公司当前进展的一个很好的提醒。”
对于一个已经找到产品与市场契合点,正在扩大规模的公司而言,保持对单一指标的专注变得更有挑战性,这并不奇怪,不同的部门都在快速的扩张,企业已经大到可以同时处理多件事务。但,即使有了各项同时进行的项目,乔安娜说,还有一个指标远高于其他指标:净增加。这个指标是总的新付费客户(包括从免费试用转化而来和直接购买收费版的客户)减去总退订客户数。
乔安娜说:“净增加有助于我们快速的发现退订量高的日子,并寻求问题,同时还有助于我们理解免费试用版的转化率表现如何。”
Moz也跟踪一些其他数据指标,如总付费客户数、昨日新增免费试用用户、以及七日平均净增加。所有这些都归结为每日平均净增加。
当MOZ进行最后一轮融资时,主要投资人之一、Foundry Group的布德拉·菲尔德建议moz跟踪更少的kpi。
“主要原因是,作为一个公司,你不可能同时影响几十个KPI。”乔安娜说:“布德拉提醒我们太多的数据会适得其反,你会迷失在并不重要的奇怪数据趋势中,很多时间还可以被浪费在报告和沟通一些并不触发行动的数据上,通过将每日KPI控制到几个很少的指标,我们能够更清晰的认识到公司的专注点在哪里,以及做得好不好”
Moz是一家指标驱动的公司,但这并不意味着它被海量数据所淹没,他们专注于唯一一个高于一切的指标:净增加。同时跟踪很多指标很了不起,但也是一条让你失去专注度的不归路。
Solare只关注少数几个关键的指标
Solare Ristorante 是一家意大利餐馆,餐馆的主人兰迪是一名连续创业者,具有技术和数据方面的背景,曾任Teradata 咨询公司总经理,并成功卖出过五家技术创业公司。
他把数据驱动的思维引入参观中,并一直在寻找关于商业指标的例子,他们在一天晚上成功的找到了这个数据:“24”。
他解释数字的含义:“每天,员工都会告诉我前一天人工成本占毛收入的比例,这是餐饮业的很出名的数字,它非常有用,因为它结合了两个你有所掌握的东西:用餐人均消费和人力成本”
“如果人力成本超过了毛收入的30%,就说明餐厅运营的不好,因为这意味着你可以在人工上投入过多,或者顾客人均消费太低。”一家米其林星级餐馆之所以雇得起更多的员工,支付得起更高的工资,就是因为它的红酒售价昂贵且人均消费很高,相反,一家低利润的休闲餐厅必须压低人工成本。
兰迪还使用了一个次级指标预测顾客量,每天下午5点,他的员工会告诉他当晚收到的预约量,如果在5点收到50桌预定,那今晚的孤客量就会在250桌左右,两者之间的比例通常是5:1.它使solare团队能做出及时的调整,增减当班人数或购进更多食材,以应对当晚的客流量。
荐书:学习数据分析的经典书籍
《精益数据分析》精益数据分析是最经典的一本书,很多数据分析师当作教科书来用。
《谁说菜鸟不会数据分析》
这系列有三本,是入门级别的书籍。
再深入一点的同学,可以学习下面的几本:
《深入浅出统计学》
《深入浅出数据分析》
数据分析是一门技术,更是运营人必会的技能,没有数据支撑的运营就好比盲人摸象。想做好运营,一切用数据说话。
- ?
如何成为一名数据分析师?数据分析师需要会什么技能?
Jebel
展开
如何成为一名数据分析师?不仅取决于你的技能和经验,还有教育和培训,都是你成为数据学家的过程中的重要因素。如果全部具备,那么你的数据分析事业将会变得更加顺利。
上海数据分析网数据分析师的薪水
数据分析是一个快速增长和利润丰厚的行业,BLS预测到这个行业职位将在2024年前增长11%。数据分析师目前正是一个热门的职业。在Glassdoor的美国50年最佳职位报告中,数据分析师的职位空缺,薪水和总体满意度评级,在各行业中均名列前茅。以下是一些与数据分析相关的最受欢迎的职位以及每个职位的平均薪水:
分析经理 - 92,249美元商业智能分析师 - 66,003美元数据分析师 - 57,768美元数据架构师 - 112,790美元数据工程师 - 90,811美元研究分析师 - 52970美元研究科学家 - 77,330美元统计员 - 71,374美元
当然数据分析师的薪资与能力是成正比的。
上海数据分析网数据分析师的技能要求
程序设计:编程提高了你的统计技能,帮助你“分析大型数据集”,并使你能够创建自己的工具。
定量分析:分析大型数据集的一项重要技能,定量分析将提高你运行实验分析的能力,扩展你的数据策略并帮助你实现机器学习。
产品直觉:理解产品将有助于你进行定量分析,它还将帮助你预测系统行为,建立指标并提高调试技能。
沟通:可能是所有行业中最重要的软技能,强大的沟通技巧将帮助你“充分利用以前列出的所有技能”。
团队合作:就像沟通一样,团队合作对于成功的数据科学事业至关重要。它需要无私,接受反馈并与团队分享你的知识。
这些都是数据分析师必备技能,但是对初学者来说面对大量的数据,还是会感觉到困扰。
CDA数据分析员是中国商业联合会数据分析专业委员会针对企业基础数据分析岗位推出的基础项目。帮你从小白一步步进阶到数据分析大师。
上海数据分析网课程架构
上海数据分析网数据来源:互联网数据;内部数据;调研数据;
数据处理:清洗与加工;
数据分析方法:描述分析;推断分析;方差分析;回归分析;时间序列;聚类分析;因子分析等,更多数据分析方法咨询课程老师喽!!
报告展示:优秀作品展示;数据可视化
授课方式
CDA数据分析员采取远程学习方式,课件由行业内专家、讲师录制而成。
采用远程学习,可以让任何人在任何时间、任何地点,从任何章节开始学习任何课程,其便捷、灵活的“五个任何”,在学习模式上最直接体现了主动学习的特点,充分满足了现代教育和继续教育的需求。
加入课程后,你将从零开始,熟悉完整的数据分析流程,掌握从数据清洗到数据可视化各环节的关键技能,最终成为顶尖数据分析师,获得国家认证。
- ?
什么叫大数据分析
粱开山
展开
大数据行业发展如火如荼,国家政策利好,互联网大佬纷纷在大数据行业布局,我们想让自己的职业生涯在一个朝阳行业发展,肯定又要学习相关技术,让自己与时俱进,但是难就难在大数据是一个新兴事物,目前我国大学的专业里面还鲜少有这个专业,国家刚批的大数据专业,全国目前35个高校,但是从17年开始招生,2021年才有第一批毕业生进入职场,在四年期间,是大数据行业发展的飞速时期,没有行业发展是等着人才进入的,而是需要要虚位以待、蓄势待发,所以在没有高等教育准备好的大数据教育,如何高效的学习大数据,如何快速的与行业发展想契合,那么需要我们成为第一个吃螃蟹的人,作为一个随着大数据行业成长的职业人,首先要知道大数据是个啥?
大数据(big data),指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。
那来帮大家分析下:如何高效的学习大数据。
经常有初学者会问,自己想往大数据方向发展,该学哪些技术,学习路线是什么样的,觉得大数据很火,就业很好,薪资很高……首先,如果你确定了想往这个方面发展,先考虑自己的过去从业经历、专业、兴趣是什么。计算机专业——操作系统、硬件、网络、服务器?软件专业——软件开发、编程、写代码?还是数学、统计学专业——对数据和数字特别感兴趣?
那么你能找师傅带吗?
但凡有这种想法的人,或多或少都会存有侥幸之心,或者叫做“天真,单纯”。希望不花一分钱,就能更快速的学到更优质,更实用的技能。
关于这一点,我只想反问一句你:“如果你是大师,你凭什么愿意带我?”
其实这就是想告诉你大数据的三个发展方向,平台搭建/优化/运维/监控、大数据开发/设计/架构、数据分析/挖掘。
先说一下大数据的4V特征:
数据量大,TB->PB
数据类型繁多,结构化、非结构化文本、日志、视频、图片、地理位置等;
商业价值高,但是这种价值需要在海量数据之上,通过数据分析与机器学习更快速的挖掘出来;
处理时效性高,海量数据的处理需求不再局限在离线计算当中。
现如今,正式为了应对大数据的这几个特点,开源的大数据框架越来越多,越来越强,先列举一些常见的:
文件存储:Hadoop HDFS、Tachyon、KFS
离线计算:Hadoop MapReduce、Spark
流式、实时计算:Storm、Spark Streaming、S4、Heron
K-V、NOSQL数据库:HBase、Redis、MongoDB
资源管理:YARN、Mesos
日志收集:Flume、Scribe、Logstash、Kibana
消息系统:Kafka、StormMQ、ZeroMQ、RabbitMQ
查询分析:Hive、Impala、Pig、Presto、Phoenix、SparkSQL、Drill、Flink、Kylin、Druid
分布式协调服务:Zookeeper
集群管理与监控:Ambari、Ganglia、Nagios、Cloudera Manager
数据挖掘、机器学习:Mahout、Spark MLLib
数据同步:Sqoop
任务调度:Oozie
······
第一步:初识Hadoop
1.1 学会百度与Google
不论遇到什么问题,先试试搜索并自己解决。
Google首选,翻不过去的,就用百度吧。
1.2 参考资料首选官方文档
特别是对于入门来说,官方文档永远是首选文档。
相信搞这块的大多是文化人,英文凑合就行,实在看不下去的,请参考第一步。
1.3 先让Hadoop跑起来
Hadoop可以算是大数据存储和计算的开山鼻祖,现在大多开源的大数据框架都依赖Hadoop或者与它能很好的兼容。
关于Hadoop,你至少需要搞清楚以下是什么:
· Hadoop 1.0、Hadoop 2.0
· MapReduce、HDFS
· NameNode、DataNode
· JobTracker、TaskTracker
· Yarn、ResourceManager、NodeManager
自己搭建Hadoop,请使用第一步和第二步,能让它跑起来就行。
建议先使用安装包命令行安装,不要使用管理工具安装。
另外:Hadoop1.0知道它就行了,现在都用Hadoop 2.0.
1.4 尝试使用Hadoop
· HDFS目录操作命令;
· 上传、下载文件命令;
· 提交运行MapReduce示例程序;
· 打开Hadoop WEB界面,查看Job运行状态,查看Job运行日志。
· 知道Hadoop的系统日志在哪里。
1.5了解它们的原理
MapReduce:如何分而治之;
HDFS:数据到底在哪里,什么是副本;
Yarn到底是什么,它能干什么;
NameNode到底在干些什么;
ResourceManager到底在干些什么;
1.6 自己写一个MapReduce程序
仿照WordCount例子,自己写一个(照抄也行)WordCount程序,
打包并提交到Hadoop运行。
不会Java的话,Shell、Python都可以,有个东西叫Hadoop Streaming。
如果能认真完成了以上几步,恭喜你,你的一只脚已经进来了。
第二步:更高效的WordCount
2.1 学点SQL吧
如果不懂数据库的童鞋先学习使用SQL句。
2.2 SQL版WordCount
在1.6中,你写(或者抄)的WordCount一共有几行代码?
如果用SQL的话:
SELECT word,COUNT(1) FROM wordcount GROUP BY word;
这便是SQL的魅力,编程需要几十行,甚至上百行代码,SQL一句就搞定;使用SQL处理分析Hadoop上的数据,方便、高效、易上手、更是趋势。不论是离线计算还是实时计算,越来越多的大数据处理框架都在积极提供SQL接口。
2.3 安装配置Hive
Hive算是数据仓库工具,安装不难,网上有很多教程,配置完成后,可以正常进入Hive命令行。
2.4 试试使用Hive
尝试在Hive中创建wordcount表,并运行2.2中的SQL语句。在Hadoop WEB界面中找到刚才运行的SQL任务。看SQL查询结果是否和1.4中MapReduce中的结果一致。
明明写的是SQL,为什么Hadoop WEB界面中看到的是MapReduce任务?
2.5 学会Hive的基本命令
创建、删除表;加载数据到表;下载Hive表的数据;并学习更多关于Hive的语法和命令。
0和Hadoop2.0的区别
MapReduce的原理(还是那个经典的题目,一个10G大小的文件,给定1G大小的内存,如何使用Java程序统计出现次数最多的10个单词及次数);
HDFS读写数据的流程;向HDFS中PUT数据;从HDFS中下载数据;
自己会写简单的MapReduce程序,运行出现问题,知道在哪里查看日志;
会写简单的SELECT、WHERE、GROUP BY等SQL语句;
Hive SQL转换成MapReduce的大致流程;
Hive中常见的语句:创建表、删除表、往表中加载数据、分区、将表中数据下载到本地;
从上面的学习,你已经了解到,HDFS是Hadoop提供的分布式存储框架,它可以用来存储海量数据,MapReduce是Hadoop提供的分布式计算框架,它可以用来统计和分析HDFS上的海量数据,而Hive则是SQL On Hadoop,Hive提供了SQL接口,开发人员只需要编写简单易上手的SQL语句,Hive负责把SQL翻译成MapReduce,提交运行。
第三步:把别处的数据搞到Hadoop上
此处也可以叫做数据采集,把各个数据源的数据采集到Hadoop上。
3.1 HDFS PUT命令
put命令在实际环境中也比较常用,通常配合shell、python等脚本语言来使用。建议需熟练掌握。
3.2 HDFS API
HDFS提供了写数据的API,自己用编程语言将数据写入HDFS,put命令本身也是使用API。
实际环境中一般自己较少编写程序使用API来写数据到HDFS,通常都是使用其他框架封装好的方法。比如:Hive中的INSERT语句,Spark中的saveAsTextfile等。
可以尝试了解原理,试着写几个Demo。
3.3 Sqoop
Sqoop是一个主要用于Hadoop/Hive与传统关系型数据库Oracle/MySQL/SQLServer等之间进行数据交换的开源框架。
就像Hive把SQL翻译成MapReduce一样,Sqoop把你指定的参数翻译成MapReduce,提交到Hadoop运行,完成Hadoop与其他数据库之间的数据交换。
自己下载和配置Sqoop(建议先使用Sqoop1,Sqoop2比较复杂)。
了解Sqoop常用的配置参数和方法。
使用Sqoop完成从MySQL同步数据到HDFS;
使用Sqoop完成从MySQL同步数据到Hive表;
PS:如果后续选型确定使用Sqoop作为数据交换工具,那么建议熟练掌握,否则,了解和会用Demo即可。
3.4 Flume
Flume是一个分布式的海量日志采集和传输框架,因为“采集和传输框架”,所以它并不适合关系型数据库的数据采集和传输。Flume可以实时的从网络协议、消息系统、文件系统采集日志,并传输到HDFS上。因此,如果你的业务有这些数据源的数据,并且需要实时的采集,那么就应该考虑使用Flume。
下载和配置Flume。使用Flume监控一个不断追加数据的文件,并将数据传输到HDFS;
PS:Flume的配置和使用较为复杂,如果你没有足够的兴趣和耐心,可以先跳过Flume。
3.5 阿里开源的DataX
之所以介绍这个,是因为以前某公司客户目前使用的Hadoop与关系型数据库数据交换的工具,就是之前基于DataX开发的,个人感觉非常好用。现在DataX已经是3.0版本,支持很多数据源。你也可以在其之上做二次开发。
PS:有兴趣的可以研究和使用一下,对比一下它与Sqoop。
至此,你的“大数据平台”应该是这样的:
第四步:把Hadoop上的数据搞到别处去
前面介绍了如何把数据源的数据采集到Hadoop上,数据到Hadoop上之后,便可以使用Hive和MapReduce进行分析了。那么接下来的问题是,分析完的结果如何从Hadoop上同步到其他系统和应用中去呢?
其实此处的方法和第三步基本一致的。
4.1 HDFS GET命令
把HDFS上的文件GET到本地。需要熟练掌握。
4.2 HDFS API
原理同3.2。
4.3 Sqoop
原理同3.3。
使用Sqoop完成将HDFS上的文件同步到MySQL;
使用Sqoop完成将Hive表中的数据同步到MySQL;
4.4 DataX
原理同3.4
此时,“你的大数据平台”应该是这样的:
走完第三步和第四步的流程,那么你应该已经具备以下技能和知识点:
· 知道如何把已有的数据采集到HDFS上,包括离线采集和实时采集;
· 知道sqoop(或者还有DataX)是HDFS和其他数据源之间的数据交换工具;
· 知道flume可以用作实时的日志采集;
至此,对于大数据平台,应该已经掌握如何搭建Hadoop集群,把数据采集到Hadoop上,使用Hive和MapReduce来分析数据,把分析结果同步到其他数据源。
接下来的问题就是,Hive使用的越来越多,你会发现很多不愉快的地方,特别是速度慢,
大多情况下,明明我的数据量很小,它都要申请资源,启动MapReduce来执行。
第五步:快一点吧,我的SQL
其实大家都已经发现Hive后台使用MapReduce作为执行引擎,实在是有点慢。因此SQL On Hadoop的框架越来越多,按我的了解,最常用的按照流行度依次为SparkSQL、Impala和Presto.这三种框架基于半内存或者全内存,提供了SQL接口来快速查询分析Hadoop上的数据。
目前我们的方案使用的是SparkSQL,至于为什么用SparkSQL,原因大概如下:
· 使用Spark还做了其他事情,不想引入过多的框架;
· Impala对内存的需求太大,没有过多资源部署;
5.1 关于Spark和SparkSQL
什么是Spark,什么是SparkSQL。
Spark有的核心概念及名词解释。
SparkSQL和Spark是什么关系,SparkSQL和Hive是什么关系。
5.2 如何部署和运行SparkSQL
Spark有哪些部署模式?
如何在Yarn上运行SparkSQL?
使用SparkSQL查询Hive中的表。
PS:Spark不是一门短时间内就能掌握的技术,因此建议在了解了Spark之后,可以先从SparkSQL入手,循序渐进。
第六步:一夫多妻制
其实我想说的是数据的一次采集、多次消费。
在实际业务场景下,特别是对于一些监控日志,想即时的从日志中了解一些指标(关于实时计算,后面步节会有介绍),这时候,从HDFS上分析就太慢了,尽管是通过Flume采集的,但Flume也不能间隔很短就往HDFS上滚动文件,这样会导致小文件特别多。
为了满足数据的一次采集、多次消费的需求,这里要说的便是Kafka。
6.1 关于Kafka
Kafka是一种高吞吐量的分布式发布订阅消息系统,它可以处理消费者规模的网站中的所有动作流数据。这种动作(网页浏览,搜索和其他用户的行动)是在现代网络上的许多社会功能的一个关键因素。这些数据通常是由于吞吐量的要求而通过处理日志和日志聚合来解决。
6.2 如何部署和使用Kafka
使用单机部署Kafka,并成功运行自带的生产者和消费者例子。
使用Java程序自己编写并运行生产者和消费者程序。
Flume和Kafka的集成,使用Flume监控日志,并将日志数据实时发送至Kafka。
至此,“大数据平台”应该扩充成这样:
这时,使用Flume采集的数据,不是直接到HDFS上,而是先到Kafka,Kafka中的数据可以由多个消费者同时消费,其中一个消费者,就是将数据同步到HDFS。
总结:
为什么Spark比MapReduce快。
使用SparkSQL代替Hive,更快的运行SQL。
使用Kafka完成数据的一次收集,多次消费架构。
自己可以写程序完成Kafka的生产者和消费者。
前面的学习已经掌握了大数据平台中的数据采集、数据存储和计算、数据交换等大部分技能,而这其中的每一步,都需要一个任务(程序)来完成,各个任务...
- ?
数据分析怎么学习,要学习什么内容?数据分析学习路线
拉里
展开
就数据分析学习而言,需要的技能模块有统计基础+数据库知识+编程能力。其以后的的职业发展方向,一个是业务层面的方向,一个是数据挖掘层面的方向。今天科多大数据和你们一起来谈谈关于数据分析的学习。
1.统计基础
理工科的学生在本科阶段学习过概率论与数理统计,单从做数据分析的角度已经够用。其他方面,可以根据需要查看相关书籍,随时进行查漏补缺即可。个人推荐《深入浅出统计学》,可以让统计理论的学习有趣又自然。
2.数据库知识
关系型数据库很重要。在学习数据分析的初期甚至很长一段时间,你接触到的数据都存储在关系型数据库中,需要学习SQL语言进行数据查询。关于SQL语言,强力推荐《SQL必知必会》,整本书通俗易懂,是学习SQL语言的不二之选。
学习数据库的本质就是在学习一种与数据打交道的逻辑思维与能力。编程中的很多思想都和关系型数据库、SQL相通,比如:SQL中对data进行group by的操作,这个在Excel里类似于透视表,在Python/R中也有相应的group function去处理数据。甚至在以后的进阶过程,你会接触到分布式数据库和所对应的no-SQL语句。
3.编程能力
Excel。 透视表(Pivot Table)是做数据分析的必备技能。透视表可以帮你迅速汇总数据,看到各类型数据的直观特征就像是让你站在更高的视角看待数据。作为进阶,Excel自带的函数、各种插件,以及VBA也是很好的工具。
Python。当数据量大到用Excel打开都要很久或者我们想进步提升能力时,需要学些hardcore技能,即用编程语言做数据分析。这里主要有R和Python两大流派。个人推荐Python,一是代码简单易懂,容易上手;二是学习资料多,降低学习成本。推荐《利用Python进行数据分析》,涵盖了利用Python做数据清洗,数据可视化及分析的技能点,可以作为一本工具书随时查阅。
Python 是目前科多大数据分析课程里面非常重要的一项内容,下面这张图更能直观反映学习内容
当然需要特别指出,数据分析课程学习内容肯定不止python这一项内容,还包括数据分析基础,互联网电子商务、经济学基础,数据产品(可视化报表)等各个板块的学习。
- ?
数据分析师应该具备哪种基本能力?
咎夜玉
展开
在互联网时代,数据是重要的资源,随着数据的持续增长和大数据技术的成熟,数据分析变得越来越重要,要看清楚瞬息万变的网络世界,要知道表象背后的真相,非靠数据分析不可,不管是大数据分析还是传统数据分析,其本质是一样的。数据分析是为了通过对数据现象的查看来完成对产品,营销策略,运营策略的优化。达到最低成本,最优效果。因此,数据分析师对应的要求也越来越高。那么,作为一名优秀的数据分析师,需要有哪些基本能力,才能完成数据分析目标,保证结果的正确性?
商业数据分析的根本目的就是要洞察数据背后的规律,基于此,企业可以制订决策、并采取相应措施和行动,进而达成想要的结果。这是商业数据分析的最大价值所在。
数据分析的四个能力
1. 对业务的理解能力
数据分析之前,首先要进行的是业务梳理。只有在实践领域从事过数据分析工作,就会明白所有分析的重中之重都是业务知识本身。而业务知识的学习和掌握,需要的积累之深,培养一个业务专家,需要的周期之长,都远远超过后面所说的那些基本技能,成为业务专家实属不易,数据分析师其实是之于业务专家之上的更深层次的思考和总结,否则,谁指导谁都是个问题。业务学习的方式很多,比如将以前的分析报告和取数案例都拿过来研究一下,不懂就问,总是一个渐进的过程,但需要时间和行业的沉淀。数据分析师最需要不断提升的能力就是行业和业务知识,没有之一。
提升业务理解能力有几个方法
多使用产品本身,只有不断的尝试产品,体验和了解各种产品,才能在分析时有直观的思考和总结;与 产品相关的业务和技术同学沟通,尤其在进行数据理解和运营理解的时候,需要知道数据元素的含义以及当前运营的方式和形成这种运营方式的原因;多思考产品的内在逻辑,多问几个为什么,这样才不至于做分析方案的时候,遗漏其它的业务流程,或者进行错误的数据模型设计。2.有耐心,善于沟通
数据处理和逻辑梳理需要足够的耐心,尤其是在各种数据格式不统一,数据表存放混乱,以及业务流程/逻辑异常复杂的情况下,作为数据分析师,一定要有足够的耐心,沉下来进行全面的数据流程确认,画出对应的流程图,理清分析重点。
同时,数据分析贯穿BIT、数据、技术、业务整个链条,数据分析师将BIT最终转化成决策者理解的语言,跨越的流程很长,你需要面对不同的岗位,碰到不同的角色,采用不同的语言,表达你的要求和获得你需要的东西,成为数据和业务的桥梁,没有足够的沟通能力很难。所以,需要具备一定的沟通能力。在沟通之前,需要清楚的知道本次沟通的目的是什么,以及如何通过对方来达成自己有效数据分析的目标。与技术沟通,是理解参数含义,与运营沟通,是理解分析目标,与产品沟通,则是强调产品逻辑以及背后的思考。同时,如果你容易听取他人的意见,特别是智者的意见,则可以帮你找到另一条出路,你犯错的概率就会降低,相应的,你的分析就更有力量和说服力。
3. 数据分析的技术
数据分析有很多技术可以支持,包括SQL,Excle,SPSS,Matlab、Python等等,这些都是通过编程完成基本的数据分析语言编写,然后进行执行得出结果。
因此,数据分析师必须掌握并精通一两种数据分析编程技巧。包括从数据仓库中获取数据,对数据进行清洗,简化,或者补全,处理数据,计算数据,最后进行可视化的表达。这样才能完成数据分析的目标。这种技术对产品和运营人员也非常重要,只有学会处理数据,分析数据,才能在每个决策上面有据可依。
但在公司的数据分析中,你在看案例时,往往接触到的数据或使用的数据是局部的,因此,你的视野会受局限,在大多数公司里,很多数据分析师其实缺乏全局的数据视野,因为他不知道到底有多少数据,因此,永远只能在已知的数据里转圈圈,
当然,大多数数据分析师可能不需要进行系统数据学习,在实践中慢慢熟悉就好了,但自顶向下的数据学习方式可以让你有一个更好的基础和更全局的数据视野。
4.独立思考的能力
数据分析并不仅仅是为了完成一些业务上面的数据需求和论证。数据分析者应该在理解业务的基础上,扩大自己的思考范围,提升洞察力。
成为一个优秀的数据分析师,需要在不同的业务中进行磨练,同时需要足够的耐心和深入业务的思考进行决策支撑。一种客观,理性,同时又科学的数据分析心态是非常重要的,对于公司和产品的发展也是必需。
数据总是在那里,它不会说话,你不仅要基于业务能力理解它,还要学会推演和分析,从中发现规律,迅速定位某个商业问题的关键属性和决定因素,形成自己独创性的见解,所谓心思缜密,滴水不漏,没有思考逻辑没有数据分析。而要形成独特的见解,则来自于个人不断的学习和思考,这里的学习更多的强调是跨领域和专业,思考则是更多的强调养成思考的习惯。思考本身就是一种实践,它可以将你的知识更加系统化和深入化,数据分析在一定程度上是用来验证思路和启发灵感的,“数据分析”从来不是“数据分析”本身,而是以“数据分析”为手段和表象,对业务的深刻理解、思考和判断。
数据分析的四个层次
描述性分析(Descriptive Analysis)诊断性分析(Diagnostic Analysis)预测性分析(Predictive Analysis)处方性分析(Prescriptive Analysis)描述性分析——发生了什么?
如题目名字一样,该层次主要是对已经发生的事实用数据做出准确的描述。比如某企业本月订单签约额比上月增加2000万,至5500万,但是订单履约率从上月的98%下降到了95%,库存周转率从上月的0.8下降到了0.7。那么,这就是发生了什么?就需要去描述性分析。
诊断性分析——为什么会发生?
知道发生了什么,对我们的帮助不大,更重要的是,我们要明白为什么发生。比如经过分析,发现在描述性分析中提到的订单履约率下降的原因是成品生产不出来,无法完成交付。而成品生产不出来的原因则是部分原材料的供应商未能按时送货,导致原材料不齐套,无法开始生产。那么,这就是诊断性分析。
预测性分析——可能会发生什么?
基于上述两个层次的分析,我们发现了其中的规律,即原材料供应商的未能及时送货会影响成品订单的履约率。假如上月某原材料供应商A送货及时率只有70%,通过建模,我们可以预测本月该供应商会使我们的订单履约率下降2%。那么,这就是预测性分析。
处方性分析——我们该做些什么?
有了预测性分析的结果后,我们无需再做事后诸葛亮,而可以运筹帷幄,在事前就采取措施。上述中,供应商A会导致本月我们的订单履约率下降,我们可能采取的措施就是把A换掉,但是现在有B和C两个供应商供我们选择,该选择哪个呢?通过分析和计算得出:选用供应商B会比选C的订单履约率高1%,因此建议选择供应商B。这就是处方性分析。
四个层次层层递进,经过这四个层次的分析以后,可以对企业的决策和行动提供有力支撑。
分享 IT 技术和行业经验,请关注-技术学派。
- ?
App数据分析到底要分析什么
语蕊
展开
按大众化的分法,产品的生命周期(PLC, Product Lifetime Cycle)分为初创期、成长期、成熟期、衰退期,在产品的每个阶段,数据分析的工作权重和分析重点有所区别,下面按阶段结合案例来聊聊。
一、初创期
初创期的重点在于验证产品的核心价值,或者说验证产品的假设:通过某种产品或服务可以为特定的人群解决某个问题。这个阶段应当遵循MVP(Minimum Variable Product) 的思想,以最小的成本来验证创业的想法,并根据用户的反馈快速迭代以调整解决方案,最终在数据上得到验证。
案例:
拿之前做的某款国外移动端论坛社交应用为例,产品在idea时期(12,13年左右)发现了论坛用户经常在吐槽从移动端Wap页访问论坛速度慢、广告多、完全没有移动端适配,于是我们提出假设:做一个App,连接论坛系统与用户,让论坛用户在移动端也能享受流畅的论坛访问体验,并且用户愿意为了这种体验付费。
于是在初期,整个产品完全围绕看帖、发帖两个核心场景进行挖掘,在论坛里进行宣传,售价$18,发现有许多用户为之付费,且这些用户的留存率达到60%+(当然与用户付费了有关),有一半的用户使用时长都超过了70分钟。当时没过多久陆续出来了一些竞品 (Vbulletin团队,当时最大的论坛系统,开发了一个移动端的App,意图解决同样的问题),但是没过多久都远远落在了我们后面,就是因为整个团队遵循MVP的思想,按用户反馈专心反复打磨看帖、发帖的流畅体验,获得了非常好的用户口碑并领先市场,也获得了某著名硅谷投资机构的投资。
关键数据——目标人群画像
除此之外,初创期可以通过接入一些第三方的应用监测SDK来了解初期用户群体的画像,从侧面验证用户群体与假设的目标用户群体特征是否一致,常见的是人口学属性(性别、年龄、学历、地域)。
案例:
今年4月初在和国内某健身类的APP的产品经理聊到, 该APP最初是一款健身、运动记步的工具App,在产品前期新用户的次日留存处于业内平均水平,在其观察到目标用户群体的画像时,发现女性用户明显比男性用户要多,且女性用户留存明显比男性用户要高。于是决定在产品策略上向女性用户倾斜,主攻女性健身、减脂、美容方向的功能以及内容推荐,产品整体次日留存率相比之前增长近100%。
同样,最近服务了一个鹅厂内部客户,他们开发了一款新产品,意在面向年轻人群体,结果却发现其用户年龄分布以青少年和老年人居多:
这正好与他们的用户渠道相关,原来他们有一款面向青少年和老年人的产品,为了给产品带来第一批用户,他们直接从老的产品将用户引流过来,结果发现他们并非产品的目标用户。
关键数据——留存率
在当前用户符合目标受众特征时,核心关注这些用户的留存率、使用时长/频率、用户的黏性等指标,这里就留存率展开来讲。
留存率的维度分很多种(7日,双周,30日等),依据产品特征来选择,若产品本身满足的是小众低频需求,留存率则宜选择双周甚至是30日;留存率高,代表用户对产品价值认可并产生依赖,一般来说,假设便能得到验证,通常低于20%的留存会是一个比较危险的信号。
介绍一个以数据为驱动的先行指标模型,可以通过找到先行性指标指导产品设计,从而提升留存率。先看下先行性指标的定义,先行性指标是指新用户在使用产品早期的一种产品行为,这个指标与用户的留存率指标之间存在着非常高的线性相关关系,可以预测用户是否会在产品中留存下来。
用自己总结的公式来描述,大致如下:
积极预测可能性(%):表示用户执行了该行为,即可预测该用户留存活跃的可能性
消极预测可能性(%) :表示用户如果不执行该行为,即可预测该用户不留存活跃的可能性
最终,先行性指标的可信度=积极预测可能性 X 消极预测可能性 ,我们直接看案例。
案例
拿之前的论坛社交App为假设,假设“用户在注册前10天内添加好友超过7个”为先行性指标,那么我们计算一组数据:
其中,用户前10天内添加好友超过7个,则其30日留存下来可能性为99%;若添加好友小于7个,则其30日不留存下来(流失)可能性为95%,综合指标可信度为0.9405。
同理,计算以下两个先行性指标可信度:
最终,我们得到对比:
以上只是假设的数据,实际上,我们需要对比十几个甚至是二十几个行为指标才能找出先行性可信度最高的行为。
这个模型中第一条“新用户在注册后的10天内添加好友超过7个”,也就是Facebook一个经典的“aha moments”,所谓”aha moments”即当用户意识到产品的核心价值的时刻,也就是我们的“先行指标”。
(Facebook,Instagram推荐好友截图)
除此之外,先行性指标应当满足以下条件:
二、快速成长期
经过了产品打磨的初始阶段,产品有了较好的留存率了,这个时候产品开始进入自发增长期。自发增长期的产品阶段,仍需要关注用户留存、用户时长、用户画像的变化等数据,但可以将侧重点关注在用户的整个生命周期的管理,其中以新用户的增长、激活、触发“aha moments”到产品稳定活跃用户的整个漏斗分析为主。
新用户的增长和激活
其中新用户的增长和激活一般有两种方式,第一种是构建产品的病毒性传播系数, 让产品自发增长,《精益运营数据分析》书中有提到的几个用户病毒式传播分类很有趣:
原生病毒性,即通过App本身的邀请好友功能而传播吸引的新用户的方式;
口碑病毒性,即通过口碑传播,用户主动通过搜索引擎成为的新用户;
人工病毒性,即通过人工干预,如有奖邀请等激励措施来鼓励用户进行邀请行为。
这里关注的一个指标称之为“病毒式传播系数”,感兴趣的同学可以自行深入了解。
新用户下载->激活->‘Aha Moments’->产品稳定活跃
产品开始进入自发增长期后,需要关注用户从新用户到活跃用户(留存后)、到核心用户的生命周期,并将每个过程的关键指标提炼并精细化。
案例
以之前的论坛社交APP为例,新用户进入产品会看到一个欢迎页(如左下图),经过注册、登录后会看到产品的首页(如右下图的Feed流页面),多数App都有类似的流程:
一个新用户从进入App欢迎页到最终成为核心用户大概是以下流程:新用户(探索发现产品价值中)-> 旁观者(逐渐认知产品价值并有一定的参与感)->生产者(认同产品价值并积极参与):
按大众化的分法,产品的生命周期(PLC, Product Lifetime Cycle)分为初创期、成长期、成熟期、衰退期,在产品的每个阶段,数据分析的工作权重和分析重点有所区别,下面按阶段结合案例来聊聊:
此时,对各个阶段的用户行为进行指标分解:
新用户&探索发现者:
欢迎页跳出率新用户注册率新用户引导流程转化率初始看到Feed页跳出率搜索结果转化率推送权限开通率
旁观者(路过者):
平均每个用户关注板块数平均每个用户关注其他用户数平均每个活跃用户赞/分享数Feed卡片展示数Feed卡片点击数订阅内容推送点击率
内容生产者:
· 平均每个活跃用户发帖数
· 平均每个活跃用户发照片、视频数
· 平均每个用户在论坛内使用时长
· 活跃用户在论坛内行为分布
精细化的拆分用户生命周期前中期的行为指标,在产品快速增长期帮助了产品不断打磨细节,将用户从新进到成为核心用户体验不断完善。与此同时,在各节点数据提升并稳定后,产品运营的同学则开始进行各种推广、投放的宣传以扩大盘子、占领市场。
三、成熟期
随着用户快速增长,产品不断完善,产品在进入成熟期前后,数据运营关注的重心开始从用户生命周期的前半段(吸引、激活、留存)往后半段(流失、回流)开始偏移。
这里分享一个在增长期和成熟期关注的数据模板 Daily Net Change (应用自John Egan@Pinterest),区别于只关注DAU、MAU数据,只关注活跃用户数的增减很多时候都是取悦自己,而这个模型能帮助直观地观察到用户增长的因子是什么,或者用户盘子变化的情况,通过一张图展示了产品的新增、回流和留存情况。
其中Net Change = 新增用户 + 回流用户 – 流失用户。
新增用户即当天有多少新用户加入
回流用户即多少老用户连续28天没有使用,今天又开始使用
流失用户即有多少已有用户刚好最后一次使用应用是在28天前
流失与回流
在关注流失回流的过程中,数据会揭示当前用户盘子的一个变化情况,具体分析流失原因则可以参考下方流程:
核心思路即,通过回访定性+数据验证为主要手段,确定流失原因,改变产品运营策略以预防用户流失或拉回用户,促进回流。
除此之外,对于一些稳定的投放渠道,普通的改善方法可能提升转化有限,此时可以进行更精细化的渠道分析来优化提升ROI:
案例:
提升ROI
四、衰退期
最终,产品进入衰退期,一般在进入衰退期前可以采取两种方式:
1、规模化
常出现在零售业中,如开一家按摩养生店,在一定范围内收获好评,那产品成熟的时候则可以开启连锁加盟模式,通过迅速而广泛的扩大市场形成品牌效应,以形成壁垒,此时衰退的风险则被抵御。
2、生态化
在产品增长或接近完善时,单一的产品很容易存在需求过于垂直、用户无法形成依赖的问题,可以开发具有协同能力的新产品以搭建完整的产品生态,使得在当前产品上无法被得到满足或失去兴趣的用户被引流到新产品,作为新产品的新用户;同时新产品的用户也能在新产品上被引流回老产品,产品之间形成互相依赖的链条,最终用户有效流转,形成生态。
- ?
数据分析师需要会什么?数据分析师必备工具!
高孤萍
展开
上海数据分析网工欲善其事,必先利其器。想要成为一名优秀的数据分析师,一款顺手的数据分析工具是必不可少的。下面为大家推荐几款数据分析工具
Excel
上海数据分析网让我们一起面对它吧,即使在高水平语言辈出的年代,Excel工具仍旧被很多人所认可。调查发现59%的数据科学家和分析师使用 Excel 工具,这个数据几乎年年如此,少有变化。Excel 是经过检验的可靠的数据分析工具,它广泛存在,非程序人员也能便捷操作,所以大多数企业即使也使用其他工具,但 Excel 工具还是他们的不二选择。
R语言
上海数据分析网R语言主要适用于EDA(探索性数据分析),也就是你与数据之间的对话,是通过作图来找寻单变量,双变量或者多变量之间的关系,进而发现其相关性。
他的学习也不是很难,掌握了基本操作,要掌握核心的几个包(package),然后经常性的练习,善于借助帮助文档,所谓熟能生巧,就是这个道理。
Python
上海数据分析网人生苦短,我用Python。
Python语言是一门功能非常强大,实用型非常强的语言,Web编程,网络爬虫。
数据分析自然少不了要掌握pandas和numpy两个包,如果用到数据可视化(后面会讲到),肯定要用matplotlib包,这三个包基本上就是Python进行数据分析的半壁江山以上了,好好掌握,不能将就。
Google Refine
上海数据分析网Google Refine。用户在电脑上运行这个应用程序后就可以通过浏览器访问之。这个东西的主要功能是帮用户整理数据,接下来的演示视频效果非常好:用户下载了一个 CSV 文件,但是同一个栏中的同一个属性有多种写法:全称,缩写,后面加了空格的,单数复数格式不一的。。。但是这些其实都代表了同一个属性,Google Refine 的作用就是帮你把这些不规范的写法迅速统一起来。
Gephi
上海数据分析网Gephi是进行社会图谱数据可视化分析的工具,不但能处理大规模数据集并且Gephi是一个可视化的网络探索平台,用于构建动态的、分层的数据图表。
Wordart
上海数据分析网Wordart操作简单。可以分析文本,上传excel,还有分析URL,需要注意的是网站本身没有中文字体,需要先自行添加中文字体,然后再生成词云。Wordart最受欢迎的地方就是词云的字体,配色,图形都支持自定义,生成的图看起来非常高上大。另外做好的图可以分享和下载,但是词频不能下载。
- ?
成为一名数据分析师需要会哪些技能?
北岛
展开
上海数据分析网数据分析师这个职业越来越火,越来越多的人想往这个方向发展。
有在校生,也有转行的小伙伴来咨询数据分析师这个职业的相关问题。
从大部分情况来看,大家对于数据分析师的职业发展和技能非常关心。
那么别的先不说,数据分析入门到底要学什么?怎么学?
Excel
作为数据分析师,Excel是必备技能。Excel 是经过检验的可靠的数据分析工具,它广泛存在,非程序人员也能便捷操作,所以大多数企业即使也使用其他工具,但 Excel 工具还是他们的不二选择。
统计学
统计学同样是数据分析师的必备技能之一,你只有学好了统计学才能谈得上数据分析。统计知识会要求我们以另一个角度看待数据。当你知道AB两组的差异用平均值看是多傻的事情,你的分析技巧也会显著提高。如果你想成为一名出色的数据分析师,那么你就必须要会统计学。
推荐图书:《深入浅出统计学》
上海数据分析网大概是最啰嗦的深入浅出系列,从卖橡皮鸭到赌博机的案例,囊括了常用的统计分析如假设检验、概率分布、描述统计、贝叶斯等。书本注重应用和趣味性,数学推理一般。
SQL
sql是所有数据库查询的语言,sql非常容易入手。
针对不同的数据库,如mysql、sqlserver、oracle等,sql语法会有所不同,但是总体上大同小异,只是细微处的差别。
而且如果你有数据库基础的话,只需要找些sql查询的习题来做一下,就会很快的得到提高。
推荐图书:《MySQL必知必会》
上海数据分析网学习 SQL 的入门书,薄册子一本,看起来很快。SQL 是个性价比很高的技能,简单而强大。任何想进一步提高自己数据分析技能的产品/运营/分析师 同学,都建议点亮 这个技能点。
数据分析思维
作为一名数据科学家需要很挑剔,并且善于发现他人会遗漏的东西。那么我们应该如何做到像数据科学家一样思考呢?
梳理分析思路,并搭建分析框架,把分析目的分解成若干个不同的分析要点,即如何具体开展数据分析,需要从哪几个角度进行分析,采用哪些分析指标(各类分析指标需合理搭配使用)。同时,确保分析框架的体系化和逻辑性。
推荐图书:金字塔原理
上海数据分析网金字塔的基本结构是:中心思想明确,结论先行,以上统下,归类分组,逻辑递进。先重要后次要,先全局后细节,先结论后原因,先结果后过程。
行业知识
对于数据分析师来说,业务的了解比数据方法论更重要。而且业务学习没有捷径。这一部分也没有什么书可以看的了,基本都靠搜索,总结,思考,再搜索,总结,思考。
数据分析要会什么
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并