中企动力 > 商学院 > 从0开始学数据分析
  • ?

    零一《从0开始,教你做数据分析》—07篇下

    海亦

    展开

    HI~!我是零一,我们现在继续讲预测。

    上篇跟大家介绍了数据挖掘的做法,微信的朋友就有人问了,那如果我不会用数据挖掘的算法就不能预测了吗?

    答案是肯定可以的,不用数据挖掘的算法也一样可以通过数据来做预测。

    既然是预测,伙伴们也不用纠结说预测得不准,能有个八成的准头就已经不错了。包括现在很多著名的数据挖掘案例,准头可能都没有个八成,不过因为是建立在大数据的基础上做的挖掘,有时候有个五成都能创造出价值了。

    如果不用数据挖掘的算法,最高境界当属神奇的第六感了,这种我也无能为力。我只能讲我力所能及的通过数据来预测。

    比如预测销量、预测销售额等,我们可以直接用简单的环比增幅或者同比增幅来计算。

    我们利用环比和同比增幅的公式,就可以推算出下列公式。(环/同比之前在初阶的文章中跟大家介绍过了)

    =============================本期数=上期数*(1+环比增幅)

    本期数=同期数*(1+同比增幅)

    =============================

    用环比还是同比,其实都可以,但我们还要考虑趋势的问题,环比、同比表达的就是趋势。

    我们看下图,今年的趋势跟去年的趋势基本是一样的,那么,我们用环比或者同比都是可以,而且预测的效果也比较靠谱了。

    如果今年跟去年的趋势不同,就结合环比和同比都计算出来预估值,然后求两者的平均值即可。

    下面两个场景帮大家理解。

    1、老板让小白同学预测一下行业未来3个月(1季度)的销量。

    首先拉出行业数据2012年1月到2013年7月,要预测2013年8、9、10三个月份的销量。先计算出环比和同比,同时把销量做出趋势图

    然后把环比增幅也做出折线图,可以发现2012年和2013年的趋势是差不多的,因为2012年春节是1月份,也就是从2月份开始恢复正常销售,而2013年春节是2月份,也就是从3月份恢复正常销售。总体来讲,趋势是差不多的。

    我们先假设两年的环比增幅趋势一致,于是可以用2012年8、9、10三个月的环比数据来作为预估。

    将2012年8-10月份的环比数据代入2013年8-10月份,公式就用

    本期数=上期数*(1+环比增幅)

    先根据7月份的数据算出8月的销量,再根据8月算出9月,以此类推。

    年月前面加个字母e,代表预测的意思。

    算出来后如下图,我们可以发现,代用去年的环比增幅预测出来的销量的同比增幅跟7月份是一样的。也说用这种方法的特点,就是假设同比增幅相同。其实和我上面说的假设两年的环比增幅趋势一致是一样的。

    我们可以做出折线图,蓝色背景部分就是预测的销量了。小白同学完成任务。呵呵!

    2、老板让小白同学做一份未来3个月(1季度)店铺的销售计划,里面要预估一下未来3个月的销售额。

    源数据如下,假设这个店就做了7个月的时间,从2013年1月份开始运营。

    这种情况,方法其实很多。但准确率是让人非常头疼的,因为还涉及到供应链、市场环境、店铺运营规划等问题。

    我就介绍一种比较靠谱的思路。

    第一步,与老板、市场负责人等熟悉本行业的相关人员协商,设定(最高或者最低)增幅基数,就假设最高10%/月,最低不低于2%的增幅发展。(也可以直接引用预估的行业增幅,不过可能会让运营人员鸭梨山大)

    第二步,回到第一个任务,预测下行业的趋势,我们直接引用上面的结果

    下图可以看到9月增长,8月和10月都有下降趋势。

    因此,可以认为借着9月行业的增长,店铺也可以达到设定的最高增幅。8月行业持续下降,可以适当调低我们的增幅阈值。预计的结果如下

    同样做出折线图,持续增长是个理想化的东西,只要行业波动不要太大,店铺的动作不要太大(如果某个月连续上聚划算会导致当月增长,过后可能会迎来一段持续下滑的时段),持续增长不是什么大问题。

    最终在验收成果的时候,也是要结合实际的市场动态,如果市场增长的情况下,我方反而下滑,就不正常了。如果市场以100%的增幅快速增长,而我方仍然以10%的增幅蜗牛式增长,这也是有问题的。

    或许,在本店资源供应正常的情况下,行业趋势就是运营的阅卷官吧!

    不知不觉又到凌晨2点了,要培养一名数据分析师不是一件容易的事情,大家加油跟上吧。

  • ?

    如何从零开始进阶数据分析大师?

    阿鸟满麻

    展开

    你还在为数据分析如何入门而苦恼吗?

    该学哪些课程呢?

    要不要学习Excel?

    要不要学习SQL?

    要不要学习数据可视化?

    不会数据分析方法?

    面对数据毫无头绪?

    没有统计学基础怎么办?

    ……

    现在再也不用烦恼了,以上问题,统统帮你解决

    CDA数据分析员是中国商业联合会数据分析专业委员会针对企业基础数据分析岗位推出的基础项目。帮你从小白一步步进阶到数据分析大师。

    上海数据分析网

    课程架构

    上海数据分析网

    数据来源:互联网数据;内部数据;调研数据;

    数据处理:清洗与加工;

    数据分析方法:描述分析;推断分析;方差分析;回归分析;时间序列;聚类分析;因子分析等,更多数据分析方法咨询课程老师喽!!

    报告展示:优秀作品展示;数据可视化

    授课方式

    上海数据分析网

    CDA数据分析员采取远程学习方式,课件由行业内专家、讲师录制而成。

    采用远程学习,可以让任何人在任何时间、任何地点,从任何章节开始学习任何课程,其便捷、灵活的“五个任何”,在学习模式上最直接体现了主动学习的特点,充分满足了现代教育和继续教育的需求。

    加入课程后,你将从零开始,熟悉完整的数据分析流程,掌握从数据清洗到数据可视化各环节的关键技能,最终成为顶尖数据分析师,获得国家认证。

  • ?

    零一《从0开始,教你做数据分析》—04篇

    盼柳

    展开

    先回顾下,前面的内容。简单罗列一下。

    1、店铺自检;2、选品;3、选词;4、设计详情页;5、设计首图;6、分析上下架时间

    以上全部都是准备工作啊!我要很愉快地告诉大家,今天还是准备工作。

    做标题!

    原本并没有打算写标题的制作,因为觉得太简单,但很多朋友跟我反馈,说需要标题和直通车的知识,因此,今天就写写标题,时间点也刚好掐上。

    前面第三件事情,我们做的是选词,选的是主打关键词,并不是做标题。因为这个时候,还不到做标题的时候。有了主打关键词之后,我们根据关键词的人群信息和产品本身来做详情页和首图。而做详情页和首图,本质上是在分析产品,而做标题的第一步,就是分析产品。第六件事情是分析上下架,上下架时间针对的是主打关键词,如果你把整个标题都去分析上下架,那分析出来的结果可能就是无处容身了,没点给你占了。

    那么,我们开始!

    淘宝搜索SEO上的【标题】,和【标题党】并没有半毛钱关系。淘宝上的【标题】是用来描述一个商品的,并且提供给消费者检索。

    淘宝对标题的定义是:商品标题是直接与商品的【搜索】相关,商品标题中一般包含了一些商品【信息、属性、热搜词】等组成。

    标题要将商品的特性展示出来,【且要与商品的基本属性对应】;但是如果热搜词过多,也会影响排序。一般情况下我们可以搜索同类卖家的商品,看看别人的商品标题是如何进行填写的,以此做为参考。

    通过淘宝官方的这段文字可以知道,标题是提供给消费者搜索的,包含了商品的信息、属性和热搜词。

    做标题的步骤,我有我的看点,可能跟其他大神的有些差异。

    第一步:分析产品第二步:找关键词第三步:筛选关键词第五步:组合标题第六步:验证标题

    首先,第一步,分析产品。对于经验丰富的运营,拿到产品的那一刻,标题也就基本成型了。对于新手,也能定个百分之七八十。因为商品会自己告诉你,他的信息和属性。(做详情页和主图的时候,也需要分析产品哦!)

    举个栗子

    这是一件羊毛衫。我们只是看图片的话,能得到一部分信息,我建议选好了款后最好是拍一件回来看看,如果喜欢的话自己穿或者送给闺蜜or老婆,如果不喜欢就完整地退回给卖家(7天无理由退换,买个运费险,等于自己出了个邮费)。这一步很重要,如果我们自己卖的产品,自己连摸都没摸过,那心里会没底。

    拿到了实物,我们接下来的工作就很轻松了。看到实物,再结合我们之前看的数据,可以轻松判断是否要做这个产品。

    我们来细看这件衣服,看存在什么信息。

    羊毛衫,针织开衫,长款,长袖,单排扣,V领,韩版,直筒型,还有点蝙蝠衣的赶脚。

    一个标题也就30个汉字,如果把这些信息组合起来,标题也就完成了80%左右了。

    之前我自己写过词频分析的程序,对程序的分词原理有一定的了解。我发现每个词都有词性,也就是我们小学读书的时候,语文老师教的,名词、动词、形容词等。

    一个标题基本就是由名词、动词、形容词、时间词和数词。而这里面,名词是最重要的。一般标题里面的名词就是品类词。

    这个例子中,羊毛衫和针织开衫,就是名词。其他的都属于形容词,都是用来修饰名词。如,长款的针织开衫,V领的针织开衫等。每个关键词必须包含名词,这才符合用户的搜索习惯。

    第二步:找关键词

    分析完产品后,关键词也就找得差不多了,但是可能会存在一些热搜词,我们不知道。因此,勤快一点,找!

    如果店里产品比较多,且类目不是太小,还可以建立关键词库(有个逼格的名字,叫海词法)。

    下面,我们借助工具来建立一个词库。服装行业,属于大类目,可以建词库。

    找词可以用三个工具(当然市面上还会有其他工具,我也写过相关的工具)。

    1、老A搜词精灵/进阶版2、老A淘词精灵(需要开通淘词——数据魔方专业版或者订购半年以上的标准版)3、老A市场分析精灵

    第一天的时候,有讲过搜词精灵,搜词精灵共有五种提取方式,我们只是用了其中一种。

    通过这几种方式,我们可以很快的建立词库。

    1、通过淘宝的下拉词、长尾词和相关词

    下拉词和长尾词都是给懒人准备的,同时具有引导作用。特别是下拉词的点击率很高。

    很古早的时候,这些词都是自己手动一个一个去复制,然后粘贴到自己的excel里面。现在早已经解放了双手。

    下图我是用两层深度,挖掘出517个关键词。

    别忘了手机无线,这个最好单独抓出来,不要和PC混在一起。

    2、 通过TOP20W词库提取

    这个词库是在直通车的关键词榜单,下载地址是:

    http://taobao/go/act/sale/keyword-dictionary.php?spm=0.0.0.0.F38X0y

    我们可以直接通过工具来获取,下图共获取了736个关键词。

    3、 直通车提取

    这个我相信只要开过直通车的都不会陌生。

    我们在添加直通车关键词的时候会有下图这样的界面。

    这个就是直通车的相关词查询。

    我们也通过工具,一次性把数据提取出来。共394个词。

    最终汇集起来,进行去重处理后,共有1528个词。

    因为我们这件衣服并不是品牌商的货,所以我们把品牌词提出出来,把1528个词里面包含这些品牌词的删掉

    过滤后,剩下1424个词。

    然后再一步根据过滤一些我们不要的词。

    过滤后剩余1390个词,然后开始查询数据(默认的数字都是近一周平均,人群数据是近半年数据)。基本可以挂机了。等明天睡醒词库就好了。

    如果有数据魔方的淘词,用老A淘词精灵会非常方便,分分钟能有几千个词,但是淘词的数据和淘宝指数、直通车流量解析的数据不一样。

    另外,我们还可以用老A市场分析精灵,我们爬抓人气排序的前三页。然后,对前三页的标题进行分词。

    如上图所示,每个词根的出现次数和占比都有,人气排名下的前三页,也就是人气宝贝,这些宝贝标题的热门词根,其实可以直接拿这些词来做标题,但这种标题,不是谁都hold得住的,基本都是热词,竞争不小,要有实力才好玩。

    总而言之,现在找关键词太简单了,也因为简单易学,SEO优化没有以前那么有效,但是,还是会有人做得好,有人做得不好,这里面学问还不少。有时候,没有个3、5年的经验,没有数据分析能力,很是吃亏。

    第三步:筛选关键词

    关于筛选关键词,很多大神都有自己的一套路子,每个人说的都对,都有道理,下面介绍我自己用的野路子。

    数据用的是老A搜词精灵爬取到的,我们将数据表格导出,做进一步筛选。

    算出竞争比,竞争比=搜索指数/宝贝数量。

    算出竞争比加权系数,竞争比加权系数=竞争比/竞争比总和

    最后算出关键词得分,关键词得分=成交指数*竞争比加权系数(想要流量优选搜索指数,想要订单优选成交指数)

    好!至此准备工作完成。下面选择关键词。

    筛选关键词遵循以下两个原则

    1、 必须和宝贝相关

    类目,属性,信息都必须相关,数据里面有人群信息,尽量多找几个人群匹配的词。如上图,我们看到高分词【2014秋装新款女装】,这个词叫热搜词,它好用吗?未必!虽然字面上的信息,是适合的。但我们要先用淘宝指数看一下,毛衣类目是否适用这个词。

    很明显,不适合。

    如果还不信,可以用老A市场分析精灵验证一下搜索结果。搜索这个词,综合排序下,前3页,出现的比例是2.99%,和淘宝指数的2.78%是如此地接近。这意味着什么?展现的机会少了,你要在这个点,权重排名前4,才能进入这个词的搜索前3页。第一页有1个毛衣类目的,做到权重第一才可以出现在首页,这,这,有多难呀?

    2、 关键词得分高的优先选用(等同于必须要有人搜索有人购买)

    这个不用多说了。但是,我发现了好多坑,一个不留神就会被误导,用了烂词。数据完全一致,就宝贝数不一样。差一点点我就中招了。下图64.05分这个词数据应该是在120W个宝贝数的战场产生的。

    这不需要火眼金睛,看词的数据,很容易发现这类词,情况太普遍,太多人被坑过了。

    以下是我初步挑出来的词。

    根据之前分析产品的时候得到的产品特征词:【长款,长袖,单排扣,V领,韩版,直筒型,蝙蝠衣】来筛选出相关的关键词

    2014毛衣女韩版新款羊毛衫毛针织衫针织衫外套毛针织衫开衫针织衫 女 开衫 中长款长款毛衣外套女开衫中长款毛衣长袖针织衫v领羊毛衫女韩版毛衣外套宽松女秋装毛衣女韩版新款蝙蝠毛衣开衫

    第五步组合标题和第六步验证要合在一起讲,一边组合一遍验证,验证这个环节最麻烦

    一个标题是60个字符,折合成文字是30个字(一个汉字两个字符),标点符号算一个字符。

    先把找出来的关键词拆解成词根,词根的分法,也有好几种,我简单分两种就好了。

    名词:品类词

    毛衣,羊毛衫,毛针织衫,外套

    形容词:属性词(描述和形容商品的词)

    开衫,中长款,长袖,V领,韩版,宽松,秋装,新款,蝙蝠

    简单把词根组合起来,假设主打关键词是【长款毛衣外套女开衫】,那这个词就不要拆开,保持紧密性,而且放在前面,如果有多于的字符,可以用空格和其他词隔开。

    正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正(用正字,标记长度)

    长款毛衣外套女开衫 新款中长款韩版毛针织衫 秋装V领宽松羊毛衫

    29个字+两个空格,刚好60个字符。

    验证标题是个粗重活。

    主要验证两样东西

    1、关键词顺序,买家搜索习惯验证。

    关键词的顺序不同,结果可能不同。如,我在找词的时候就发现毛衣女装和女装毛衣,倒一下顺序,连搜索指数都不一样了。

    宝贝数也不一样。

    我们验证的渠道也就是淘宝指数和淘宝主搜(自己搜索看结果),可以对比搜索结果。

    2、关键词紧密关联性验证。

    紧密关联性也就是关键词不能拆分开,词根必须连在一起。很巧合,这个标题我验证过,没有需要紧密关联的情况。那我用另一个词来解释这个紧密关联性,【雪纺连衣裙】,词根是【雪纺】和【连衣裙】,通过淘宝主搜来验证。

    我们发现搜索的结果页上,很多展现的宝贝,标题里面雪纺和连衣裙这两个词根是紧密接在一起的。这种情况,说明这两个词根需要紧密关联。在SEO里面,紧密关联是完全匹配,完全匹配的权重是相对要高一点的。

    验证紧密关联性的渠道是淘宝主搜(搜索结果验证)。

    PS:紧密性不可能做到面面俱到,只要主打关键词保持紧密关联,其他的词尽量就好了,不用强求。

    说了这么多,不知道你懂了没有。做标题是整个环节中,是最简单又最复杂的一个环节。

    可能有人会问,我直接抄别人的标题,行不行?

    答案:行!

    这是绝招,一招搞定。但是要看你的实力是否能承载这个标题了。有时候,我偷懒,也是先抄一个,然后再找出自己的主打关键词,在抄来的标题上修改一下,加上自己的主打关键词,如果自己还发现了其他好词,就再把好词【塞】进去这个抄来的标题里面。

    初期的标题并不是决定因素,重要的是主打关键词。避免用词违规,不要用别人的品牌词,还有一些禁用的词,如淫秽词汇等。有不少朋友误用别人的品牌词,宝贝起来后就被淘宝删掉了(_`)

    在宝贝上架后,会产生宝贝的关键词数据,通过关键词数据来指导操作,这个比初期的打造标题可能要更为重要一些。

  • ?

    如何做数据分析师?教你从零开始系统规划大数据学习之路

    应怜梦

    展开

    大数据的领域非常广泛,往往使想要开始学习大数据及相关技术的人望而生畏。大数据技术的种类众多,这同样使得初学者难以选择从何处下手。

    本文将为你开始学习大数据的征程以及在大数据产业领域找到工作指明道路,提供帮助。目前我们面临的最大挑战就是根据我们的兴趣和技能选定正确的角色。

    为了解决这个问题,我在本文详细阐述了每个与大数据有关的角色,同时考量了工程师以及计算机科学毕业生的不同职位角色。

    我尽量详细地回答了每一项人们在学习大数据过程中遇到或可能会遇到的问题。为帮助你根据兴趣选择发展途径,我添加了一组树图,相信会对你找到正确的途径有所帮助。

    注释:学习之路树状图

    在这个树状图的帮助下,你可以根据你的兴趣和目标选择路径。 然后,你可以开始学习大数据的旅程了。 后台回复“职业路径”3个字,下载高清版本。

    目录表

    1.如何开始?

    2.在大数据领域有哪些职位需求?

    3.你的领域是什么,适合什么方向?

    4.勾勒你在大数据领域的角色

    5.如何成为一名大数据工程师?

    o什么是大数据行业术语?

    o你需要了解的系统和结构

    o学习去设计解决方案并且学习相关技术

    6.大数据学习路径

    7.资源

    1.如何开始?

    人们想开始学习大数据的时候,最常问我的问题是,“我应该学Hadoop(hadoop是一款开源软件,主要用于分布式存储和计算,他由HDFS和MapReduce计算框架组成的,他们分别是Google的GFS和MapReduce的开源实现。由于hadoop的易用性和可扩展性,因此成为最近流行的海量数据处理框架。hadoop这个单词来源于其发明者的儿子为一个玩具大象起的名字。), 分布式计算,Kafka(Kafka是由LinkedIn开发的一个分布式基于发布/订阅的消息系统),NoSQL(泛指非关系型的数据库)还是Spark(Spark 是一种与 Hadoop 相似的开源集群计算环境,但是两者之间还存在一些不同之处)?”

    而我通常只有一个答案:“这取决于你究竟想做什么。”

    因此,让我们用一种有条理的方式来解决这个问题。我们将一步步地探索这条学习之路。

    2. 在大数据行业有哪些职业需求?

    在大数据行业中有很多领域。通常来说它们可以被分为两类:

    大数据工程大数据分析这些领域互相独立又互相关联。

    大数据工程涉及大量数据的设计,部署,获取以及维护(保存)。大数据工程师需要去设计和部署这样一个系统,使相关数据能面向不同的消费者及内部应用。

    而大数据分析的工作则是利用大数据工程师设计的系统所提供的大量数据。大数据分析包括趋势、图样分析以及开发不同的分类、预测预报系统。

    因此,简而言之,大数据分析是对数据的高级计算。而大数据工程则是进行系统设计、部署以及计算运行平台的顶层构建。

    3.你的领域是什么,适合什么方向?

    现在我们已经了解了行业中可供选择的职业种类,让我们想办法来确定哪个领域适合你。这样,我们才能确定你在这个行业中的位置。

    通常来说,基于你的教育背景和行业经验我们可以进行如下分类:

    教育背景(包括兴趣,而不一定与你的大学教育有关)

    计算机科学数学行业经验新人数据学家计算机工程师(在数据相关领域工作)因此,通过上面的分类,你可以把自己的领域定位如下:

    例1:“我是一名计算机科学毕业生,不过没有坚实的数学技巧。”

    你对计算机科学或者数学有兴趣,但是之前没有相关经验,你将被定义为一个新人。

    例2:“我是一个计算机科学毕业生,目前正从事数据库开发工作。”

    你的兴趣在计算机科学方向,你适合计算机工程师(数据相关工程)的角色。

    例3:“我正作为数据科学家从事统计工作。”

    你对数学领域有兴趣,适合数据科学家的职业角色。

    因此,参照着定位你的领域吧。

    (此处定义的领域对你确定在大数据行业的学习路径至关重要。)

    4.根据领域规划你的角色

    现在你已经确定了你的领域,下一步,让我们规划出你要努力的目标职位吧。

    如果你有卓越的编程技巧并理解计算机如何在网络(基础)上运作,而你对数学和统计学毫无兴趣,在这种情况下,你应该朝着大数据工程职位努力。

    如果你擅长编程同时有数学或者统计学的教育背景或兴趣,你应该朝着大数据分析师职位努力。

    5.如何成为一名大数据工程师

    让我们先定义一下,一名受到行业承认的大数据工程师都需要学习和了解什么。首先以及最重要的一步是确认你的需求。你不能在不清楚个人需求的情况下直接开始学习大数据。否则,你将一直盲人摸象。

    为了明确你的需求,你必须了解常用的大数据术语。所以让我们来看一下大数据到底意味着什么?

    5.1 大数据术语

    大数据工程通常包括两个方面 – 数据需求以及处理需求。

    5.1.1 数据需求术语

    结构:你应该知道数据可以储存在表中或者文件中。储存在一个预定义的数据模型(即拥有架构)中的数据称为结构化数据。如果数据储存在文件中且没有预定义模型,则称为非结构化数据。(种类:结构化/非结构化)。

    容量:我们用容量来定义数据的数量。(种类:S/M/L/XL/XXL/流)

    Sink吞吐量:用系统所能接受的数据率来定义Sink吞吐量。(种类:H/M/L)

    源吞吐量:定义为数据更新和转化进入系统的速度。(种类:H/M/L)

    5.1.2 处理需求术语

    查询时间:系统查询所需时间。(种类:长/中/短)

    处理时间:处理数据所需时间。(种类:长/中/短)

    精度:数据处理的精确度。(种类:准确/大约)

    5.2 你需要知道的系统和架构

    情节1的解决方案:销售数据池

    (这是我的个人解决方案,如果你想到一个更高明的解决方案请在下面分享一下)

    那么,一个数据工程师会怎样解决这个问题呢?

    需要记住的一点是,大数据系统的目的不仅仅是无缝整合各种来源的数据,而使其可用,同时它必须能使得,用于开发应用系统的数据的分析和利用变得简单迅速和易得(在这个案例中是智能控制面板)。

    定义最后的目标:

    1. 通过整合各种来源的数据创建一个数据池。

    2. 每隔一定时间自动更新数据(在这个案例中可能是一周一次)。

    3. 可用于分析的数据(在记录时间内,甚至可能是每天)

    4. 易得的架构和无缝部署的分析控制面板。

    既然我们知道了我们最后的目标,让我们尽量用正式术语制定我们的要求吧。

    5.3.1 数据相关要求

    结构:大部分数据是结构化的,并具有一个定义了的数据模型。但数据源如网络日志,客户互动/呼叫中心数据,销售目录中的图像数据,产品广告数据等是非结构化的。 图像和多媒体广告数据的可用性和要求可能取决于各个公司。

    结论:结构化和非结构化数据

    大小:L或XL(选择Hadoop)

    Sink 吞吐量:高

    质量:中等(Hadoop&Kafka)

    完整性:不完整

    5.3.2 处理相关要求

    查询时间:中至长

    处理时间:中至短

    精度:准确

    随着多个数据源的集成,重要的是要注意不同的数据将以不同的速率进入系统。 例如,网络日志可用高颗粒度连续流进入系统。

    基于上述我们对系统要求的分析,我们可以推荐以下大数据体系。

    6.大数据学习路径

    现在,你已经对大数据行业,大数据从业人员的不同角色和要求有所了解。 我们来看看你应该遵循哪条路来成为一名大数据工程师。

    我们知道大数据领域充斥着多种技术。 因此,你学习与你的大数据工作角色相关的技术非常重要。这与任何常规领域有点不同,如数据科学和机器学习中,你可以从某些地方开始并努力完成这一领域内的所有工作。

    下面你会发现一个你应该通过的树状图,以找到你自己的路。即使树状图中的一些技术被指向是数据科学家的强项,但是如果你走上一条路,知道所有的技术直到“树叶节点”总是很好的。 该树状图源自lambda架构范例。

    任何想要调配应用程序的工程师必须知道的基本概念之一是Bash 脚本编程。你必须对linux和bash 脚本编程感到舒适。这是处理大数据的基本要求。

    核心是,大部分大数据技术都是用Java或Scala编写的。但是别担心,如果你不想用这些语言编写代码,那么你可以选择Python或者R,因为大部分的大数据技术现在都支持Python和R。

    因此,你可以从上述任何一种语言开始。 我建议选择Python或Java。

    接下来,你需要熟悉云端工作。 这是因为如果你没有在云端处理大数据,没有人会认真对待。 请尝试在AWS,softlayer或任何其他云端供应商上练习小型数据集。 他们大多数都有一个免费的层次,让学生练习。如果你想的话,你可以暂时跳过此步骤,但请务必在进行任何面试之前在云端工作。

    接下来,你需要了解一个分布式文件系统。最流行的分布式文件系统就是Hadoop分布式文件系统。在这个阶段你还可以学习一些你发现与你所在领域相关的NoSQL数据库。下图可以帮助你选择一个NoSQL数据库,以便根据你感兴趣的领域进行学习。

    好了,今天的知识就分享到这里,欢迎关注爱编程的南风,私信关键词:大数据 ,获取更多学习大数据的资源,如果文章对你有有帮助,

    请收藏关注,在今后与你分享更多学习大数据的文章。同时欢迎在下面评论区留言如何学习大数据。

  • ?

    干货| 从零开始学习大数据挖掘分析

    曼容

    展开

    有朋友想学习大数据,但不知道怎么入手,从哪里开始学习,需要学习哪些东西?对于一个初学者,学习大数据挖掘分析的思路逻辑是什么?本文就梳理了如何从0开始学习大数据挖掘分析,学习的步骤思路,可以给大家一个学习的建议。

    很多人认为数据挖掘需要掌握复杂高深的算法,需要掌握技术开发,才能把数据挖掘分析做好,实际上并非这样。如果钻入复杂算法和技术开发,只能让你走火入魔,越走越费劲,并且效果不大。在公司实际工作中,最好的大数据挖掘工程师一定是最熟悉和理解业务的人。对于大数据挖掘的学习心得,作者认为学习数据挖掘一定要结合实际业务背景、案例背景来学习,这样才是以解决问题为导向的学习方法。那么,大体上,大数据挖掘分析经典案例有以下几种:

    A、预测产品未来一段时间用户是否会流失,流失情况怎么样;

    B、公司做了某个促销活动,预估活动效果怎么样,用户接受度如何;

    C、评估用户信用度好坏;

    D、对现有客户市场进行细分,到底哪些客户才是目标客群;

    E、产品上线投放市场后,用户转化率如何,到底哪些运营策略最有效;

    F、运营做了很多工作,公司资源也投了很多,怎么提升产品投入产出比;

    G、一些用户购买了很多商品后,哪些商品同时被购买的几率高;

    H、预测产品未来一年的销量及收益

    大数据挖掘要做的就是把上述类似的商业运营问题转化为数据挖掘问题。

    一、如何将商业运营问题转化为大数据挖掘问题

    那么,问题来了,我们该如何把上述的商业运营问题转化为数据挖掘问题?可以对数据挖掘问题进行细分,分为四类问题:分类问题、聚类问题、关联问题、预测问题;

    1、分类问题

    用户流失率、促销活动响应、评估用户度都属于数据挖掘的分类问题,我们需要掌握分类的特点,知道什么是有监督学习,掌握常见的分类方法:决策树、贝叶斯、KNN、支持向量机、神经网络和逻辑回归等;

    2、聚类问题

    细分市场、细分客户群体都属于数据挖掘的聚类问题,我们要掌握聚类特点,知道无监督学习,了解常见的聚类算法,例如划分聚类、层次聚类、密度聚类、网格聚类、基于模型聚类等。

    3、关联问题

    交叉销售问题等属于关联问题,关联分析也叫购物篮分析,我们要掌握常见的关联分析算法:Aprior算法、Carma算法,序列算法等。

    4、预测问题

    我们要掌握简单线性回归分析、多重线性回归分析、时间序列等。

    二、用何种工具实操大数据挖掘

    能实现数据挖掘的工具和途径实在太多,SPSS、SAS、Python、R等等都可以,但是我们需要掌握哪个或者说要掌握哪几个,才算学会了数据挖掘?这需要看你所处的层次和想要进阶的路径是怎样的。

    第一层级:达到理解入门层次,了解统计学和数据库即可。

    第二层级:达到初级职场应用层次,数据库+统计学+SPSS(也可以是SPSS代替软件)

    第三层级:达到中级职场应用层次,SAS或R

    第四层级:达到数据挖掘师层次,SAS或R+Python(或其他编程语言)

    三、如何利用Python学习大数据挖掘

    只要能解决实际问题,用什么工具来学习数据挖掘都是无所谓,这里首推Python。那该如何利用Python来学习数据挖掘?需要掌握Python中的哪些知识?

    1、Pandas库的操作

    Panda是数据分析特别重要的一个库,我们要掌握以下三点:

    1)pandas 分组计算;

    2)pandas 索引与多重索引;

    索引比较难,但是却是非常重要的

    3)pandas 多表操作与数据透视表

    2、numpy数值计算

    numpy数据计算主要应用是在数据挖掘,对于以后的机器学习,深度学习,这也是一个必须掌握的库,我们要掌握以下内容:

    1)Numpy array理解;

    2)数组索引操作;

    3)数组计算;

    4)Broadcasting(线性代数里面的知识)

    3、数据可视化-matplotlib与seaborn

    1)Matplotib语法

    python最基本的可视化工具就是matplotlib。咋一看Matplotlib与matlib有点像,要搞清楚二者的关系是什么,这样学习起来才会比较轻松。

    2)seaborn的使用

    seaborn是一个非常漂亮的可视化工具。

    3)pandas绘图功能

    前面说过pandas是做数据分析的,但它也提供了一些绘图的API。

    4、数据挖掘入门

    这部分是最难也是最有意思的一部分,要掌握以下几个部分:

    1)机器学习的定义

    在这里跟数据挖掘先不做区别

    2)代价函数的定义

    3)Train/Test/Validate

    4) Overfitting的定义与避免方法

    5、数据挖掘算法

    数据挖掘发展到现在,算法已经非常多,下面只需掌握最简单的,最核心的,最常用的算法:

    1)最小二乘算法;

    2)梯度下降;

    3)向量化;

    4)极大似然估计;

    5)Logistic Regression;

    6) Decision Tree;

    7) RandomForesr;

    8) XGBoost;

    6、数据挖掘实战

    通过机器学习里面最著名的库scikit-learn来进行模型的理解。

    以上,就是为大家厘清的大数据挖掘学习思路逻辑。可是,这还仅仅是开始,在通往数据挖掘师与数据科学家路上,还要学习文本处理与自然语言知识、Linux与Spark的知识、深度学习知识等等,我们要保持持续的兴趣来学习数据挖掘。

    来源:CDA数据分析师

    - end-

    往期回顾:

    管理问题,其实是沟通问题

    【CIO早班车】CIO的特殊使命,还不快跟上!

    一看吓一跳,导致数据分析失败的原因这么多!

    【e见领袖】IT厂商的“最佳实践”,CIO真的care吗?

  • ?

    「零一」《从0开始,教你做数据分析》—06篇

    张效瑞

    展开

    HI~!我是零一,好久不见了。今天开始我们一起来学习数据分析的中阶课程。

    今天的内容主要是理清数据分析的主要思路和几个进阶的分析方法。

    数据分析一般的任务,有以下四种。

    1、预测

    2、异常检测

    3、探索关系

    4、聚类/分类

    以下4种场景对应的主要任务来帮助大家理解这4种任务。

    1、老板要求小白同学做一份市场分析——预测

    拿到市场分析的数据源,就要明确知道,分析市场的最主要的价值就在于“先知”,比竞争对手提前预知市场行情。因此接到市场分析的工作,不用迷茫,预测是它的价值所在。

    2、老板要求小白同学对店铺的日常数据进行监控——异常检测

    平时监控店铺的一切数据,如果一切正常,那就什么工作都没有。而主要的工作就来自异常情况,包括跟行业阈值对比,一旦低于行业阈值就被视为异常。

    3、老板要求小白同学分析一下订单数据或销售数据——探索关系

    探索关系的工作是最有趣的,因为你说不定会发现一些非常有趣的关系,比如什么因素是影响买家下单的主要因子。在excel应用中,最简单粗暴的方法就是用散点图来观察。

    4、老板要求小白同学分析一下会员数据——聚类

    相信很多朋友有过这样的苦恼,手里有客户数据,但是不知道如何效益最大化地利用。那么这里就涉及到对客户进行分类。通过分类可以知道哪些客户是有价值的,哪些客户是没有价值的。

    这四种任务,会分别在07、08、09、10篇中跟大家详细介绍。07篇估计很快就可以推送给大家。

    那么,今天我要给大家介绍一下多维分析,顾名思义就是维度很多的时候用的分析方法。这个方法非常简单,就是一张图表而已。

    下列几个场景来帮大家掌握多维分析。

    1、老板要求小白同学分析一下店里的几个客服的综合能力。

    将源数据处理一下,跨度不要太大,把询单人数、客单价和总业绩处理成占比即可

    直接用下面的这张图来展示3个客服的综合实力,一目了然。A客服目测是最优秀的,C是最差的。

    2、老板要求小白同学分析一下某个宝贝的搜索关键字。

    某宝贝的关键字数据如下,也是要将数据处理成占比形式

    效果如下图所示,毋庸置疑,“加厚”这个关键字是最好的,接着是2013和包邮(展现量为第一考虑要素,没有展现量,其他的维度数据再高也是白搭的)

    3、老板要求小白同学分析一下最近直通车新推的几个款中,哪个最适合加大投入推广打造爆款。

    假设3款宝贝,同时上的直通车,数据同样处理成百分比形式。

    操作步骤:

    Step1:选中数据,然后找到插入选项卡的其他图表

    Step2:找到雷达图,然后点击

    Step3:美化后如下图所示。

    裤子002是最有潜质的。我们看裤子001,花费太高了,但点击率不高,成交金额跟裤子002也接近。裤子002加大投入应该可以得到比较好的收益效果。

  • ?

    零一《从0开始,教你做数据分析》—03篇

    斯瓦讷克

    展开

    大家好,我是零一。今天接着第一篇的内容,我们继续利用excel2010来做数据分析。

    这系列文章,是从0开始的,可能读者的基础并不是太好,我是这么安排的,先学会基本的操作,会操作了后,再回过来学一些分析思路和方法。自己做过之后,再学心法,可能会有更大的收获。

    说回主题,上一篇中,我们看出了走势图,也看到了占比图。这两个必须同时看,才能清楚的,因为你单看走势图,是看不出占比的。单看占比图也会看不粗走势。因此,这两个图,是结合一起,才能读出相对完整的信息。

    根据我们的目的,了解淘宝美容护肤行业的市场情况

    我们已经拿到了走势和占比两个信息,那么接着还能了解些什么呢?

    可能每个人的问题都不一样,我引出一个问题,每个子行业的竞争程度怎么样呢?

    那么,我们就要思考,这个问题要转化成什么维度呢?我们手里的数据能否来回答这个问题呢?

    我们先观察看一下源数据(源数据下载地址在01篇的底部)

    成交量,统计的是成交的件数。

    销售额,统计的是成交的件数+一口价,这里误差太大,不分析这个数据。

    高质宝贝数,统计的是有一定销量的宝贝数。

    其他维度,跟我们的问题关系不大,这里排除了销售额,那么,就剩下成交量和高质宝贝数。

    成交量/高质宝贝数

    就会得到平均一个高质宝贝数分配到的成交量。这个指标,有人称之为分配量,有人称之为平均占有率,也有人称之为均量。那么,我下面将这个指标命名为均量。

    第一步,插入数据透视表

    第二步,设置字段

    然后,增加一个计算字段,在数据透视表工具——选项——域丶项目和集——计算字段

    公式如下图所示

    确定后,会自动添加,大家可以核对一下字段设置

    然后,我们看到数据透视表,但是面对这个表格,零一点情绪都木有。

    看到表格,而且密密麻麻的这种,脑袋就要开始想【数据展现】。用什么方式来展现这些数据?

    这里解释一下,【时间序列】简单理解就是以时间为展现维度的数据,那么这里刚好就是以时间作为维度。那么,我们看到是垂直柱和线图。那就用这两种结合,来做展现。

    结果如下,天哪!巨坑!这,,,这要比表格还要难看。

    这里一团糟,是因为维度太多了,维度太多了,就要思考【降维】,减少这个图表里面的维度即可。

    下面仔细看,有个倒三角。

    点下倒三角,跟我下图一样,筛选一下即可。

    结果如下。认真看,想想为什么最底下有条水平线?

    最底下那条就是均量了。因为数值太小,所以,好端端的一条曲线就变成了水平线。鼠标点一下。

    最下面的直线就会被选中,右击一下,在弹出来的菜单选择,设置数据系列格式。

    然后,选择次坐标轴,点右下角的关闭

    这就看得清楚了,蓝色是成交量,对应左边的纵坐标轴。红色的是均量,对应的是右边的纵坐标轴。

    发现9月到年前是行业旺季哦!今年的均量在飙升的感觉。均量越高,代表每个宝贝分配到的成交量就越多。

    那么,问题来了,均量高是好事情吗?

    答案是未必,首先要去淘宝搜索判断,目测销量第一页的分布情况,就可以知道。如果要用指标,可以用【极差】来判断。这里其实目测就好了。如果销量都在两三个宝贝,那么,这个事儿对于你来讲就不好了。

    再接着,如果发现分布相对均匀,那么是好事吗?

    还是未必,答案完全看你自己了,如果是小卖家,那是好事儿啊,竞争不会太大,大家都有机会得到成交的机会。

    但是,如果你是有实力的卖家,这就不是件好事儿,蛋糕要大家分呀!这可是蛋疼的事儿。

    好了,解释就到这里。我们继续。开始说了要用两种图来展现。现在只完成了第一步。接着,我们在这个表里面加入柱形。

    点一下红色线性,右击,在菜单中选择更改系列图表类型

    按确定自己看结果吧

    这里又出现个问题了。这里只能看一个行业啊!能不能看所有的行业,或者每个行业都单独看一下?

    答案,是都可以!我们先实现变着行业来看。

    插入切片器,如果找不到地方的,版本不同,自己找。或者就是图表没有在活动状态。

    选好后,按确定,就可以看到切片器,自己点点看看吧。。

    那么,接着,将均量全部拿出来看趋势。重新插入个数据透视表。过程自己思考。不演示了。相信消化了第一篇的童鞋都能自己做的了。

    好,到这里来,基本看得差不多了。但是还有,我还没有说完哦。

    因为考虑到进程问题,这一篇内容要稍微多一些。

    上面均量的走势,我们看得出来,胸部护理的均值最高,但是越下面的各个子行业错综复杂,我们怎么客观地来判断呢?

    这里教大家两个指标【波动系数】和【极差】,这个后面的文章可能要用到,以后讲到,就不解释了!对他们的数学/统计意义感兴趣的童鞋自己百度吧,波动系数,统计学里面叫变异系数。

    统计学意义我就不说了,我先介绍一下,这两个指标,不是什么时候都要用,就是用肉眼,看不出来,拿不准的时候,希望更加科学地来判断,就需要动用他们了。

    【波动系数】=【标准差】/【平均值】

    【极差】=【最大值】-【最小值】

    我从数据透视表复制出部分数据,如下。相信消化了第一篇的童鞋都能自己做的了。

    先算下【标准差】excel里面函数是:STDEV.S

    【极差】公式

    【均值】大家都知道的,但是还是贴出来吧。

    最后,自己算下波动系数哦!

    那么,我算出来T区护理的波动系数是0.43,唇部护理是0.39。极差在上面看得到。这个怎么应用呢?

    要记住这个应用的前提,肉眼看不出来,不明显,错综复杂的走势。那么,就用他了,如果摆在你面前的能用肉眼一眼看穿的,请绕道。

    如果是小卖家,选择波动系数越大的,可能就越好。因为市场波动大,机会就大,前提一样要先验证一下是否是个别商家人为操作起来的市场。

    如果是中级卖家,具体也要看,如果资源好,建议选择波动系数小的,因为这个市场做起来后,就相对稳定,平时不用太操心呗,控制好供应链,其他就没什么大事儿了。

    【极差】作为辅助的维度,不一定要,但是他跟【波动系数】一起看得更全面。

    【波动系数】有个优点也是缺点跟数据本身的大小没关系的。百万级别的源数据跟百位级的源数据,算出来的波动系数可能是一样的,从优点来讲,他可以跨维度,跨数据级对比。从缺点来讲,就是看不全,就可能出现不同级别的数据之间,他们的波动系数相等。

  • ?

    零一《从0开始,教你做数据分析》—09篇

    Cyril

    展开

    大家好,我是零一。这一篇给大家介绍探索关系。

    探索关系是非常好玩的一件事情。先给大家讲个故事。据说很久很久以前美国某个州对多个社区做了一项关于婴儿的调查,其中一个调查结果如下

    调查人员发现多个社区中,这个妈妈纹身的占比越高,这个社区出现畸形儿的概率就越高。那调查人员就很费解了,纹身跟生BB有什么关系呢?后来针对这些纹身妈咪做了调查,结果如下

    调查人员发现原来大部分的纹身妈咪因为出入夜店,大部分有接触过毒品,这才导致了前文说的畸形儿竟然跟纹身有关系。

    以上就是探索关系的一个例子。

    我们先引入一个概念【相关性】

    【相关性】是来反应两个或多个维度之间的相关密切程度,如上面的例子中,关系就是比较紧密的。两者相关紧密并不等于因果,上面的例子也说明了,并不是因为纹身就导致了畸形儿,而是纹身的妈咪多数曾经是不良少女,染上毒品,才导致后面生出畸形儿。

    【相关性】从影响的方向来区分,有3种,分别是正相关,零相关,负相关。下面我们一起看下。

    首先是正相关,只要是呈现下图这种趋势的分布,就称之为正相关,表示任意一个维度增长,另一个就跟着增长,反之,下降就随之下降。

    接着是零相关,只要是呈现下图这种趋势的分布,就称之为零相关。表示维度之间没有什么相关性。

    最后是负相关,只要是呈现下图这种趋势的分布,就称之为负相关。表示任意一个维度增长,另一个就下降,反之,下降就随之增长。

    下面我们一起看一下淘宝数据,淘宝数据也有很多有趣的关系。

    我抓取下来眼镜行业按销量排名的100页,也就是40*100=4000个宝贝的数据。数据大概长这个样子

    按30天成交量和价格来做散点图,得到如下的结果。

    很惊奇发现,居然有个眼镜卖12.8W!!这是在卖眼睛吧??

    大家回想第八篇的内容,这个店就是离群点,我们可以暂时不分析。我们通过设置坐标轴来进一步观察

    售价我先指定在1000元以下,呈负相关的姿态,下图是结果

    有人可能会说,这价格越高就销量越小,这个不用分析都知道了啊!事实上,还真有价格越高销量就越高这种行业,不看下怎么知道呢?我们要用数据说话!

    可以观察到大多数高销量的价格是分布在100元以下的。(0,100]这个区间销量最高在5K(最上面那个离群点不计在内),(100,200]这个区间销量最高在3K左右。

    接着我们可以进一步观察(100,200]这个区间的分布情况

    这个是零相关的分布状态,也就是说,在这个区间,你是定价在100,还是定价在200,不会太影响你的销量。所以,有时候很奇怪,我100也是卖,200也是卖,为什么不卖200呢?

    这个数据源我会提供给大家玩玩。30天成交量和价格的关系,我们就说到这里。下面我们看另一个关系。

    【上架天数】 VS 【30天成交量】

    这个让我差点跌破眼镜,上架了2000天,是什么概念?2000÷365=5(年)。上架了这么久的产品,还在卖!我接触淘宝才3-4个年头。

    我们可以发现,销量在2000以上的爆款主要的聚集区间,在1200天以内,也要有3年的时间了。。。不过我们可以发现,后面的新品,多了很多,正在逐渐上来,不少商家正在尝试用新品来冲击这个市场。

    我把坐标轴范围调整一下,结果看下图,看起来是零相关的样子。

    2000销量以上的,最快的在一个月时间(37天)打造上来。这些是谁呢?那通过这个图,把鼠标停在点上面,会显示这个数据是第几个观测值,那会非常简单就能定位到这些宝贝。

    这种观察方法,有个弊端,就是上面这个图,我只能说,我看起来像是零相关,并不能确定。那是否有一个具体一点的,可以不用靠眼镜的方法来告诉我们相关性呢?

    答案是肯定的!

    在Excel里面,有个函数叫correl,是英文correlation(相关)的前半部分。就是用来算相关性的,这个是适用于线性相关的情况下。非线性的情况下,就不适用了哦!比如类似抛物线的钟型分布(也就是正态分布)

    只要选中我们要的数据就可以了,两个数据组。

    得出的结果是一个[-1,1]的数字,这里是0.685,那这个数字怎么解读呢?

    [0.7,1]表示强正相关

    [0.3,0.7)表示中正相关

    (-0.3,0.3)表示零相关

    (-0.7,-0.3]表示中负相关

    [-1,-0.7]表示强负相关

    那我们这里的结果对应到就是中正相关这个区间。表示,评价量的多少还是会在一定程度上影响销量的。但这个结果没有分析意义,因为一般爆款卖得多评价也多。

    分析师是要考虑分析的结果有没有价值,一般何为有价值的关系呢?

    就是情理之中,但意料之外的这种关系,就非常有价值。

    另外,是要选择看图还是数字呢?

    这个问题很简单,先看图,如果不清晰,就看下数字。

    如果要快速出结果,并且是多个维度的情况下,用excel内置的数据分析的相关系数来快速得出相关矩阵

    结果是一个下三角矩阵

    ==========分割符==========

    下面我们来用数据挖掘套件,探索下数据。

    先把数据设置成表格的格式

    然后再表格工具里面有个分析(必须要有安装了数据挖掘套件才能有这个)

    我们先看下分析关键影响因素(我这里是用的市场数据,但如果大家是拿店铺的数据,大家都懂的)

    运行后结果如下,会有一个相对影响,可以参考。但这个结果,没有先处理缺失值(上一篇有说过异常处理,处理方法看上一篇)

    这个结果,没有太大的参考性。因为最相关的变成缺失值了,可能在获取数据的时候会有一些漏抓。

    ==========分隔符==========

    下一篇会告诉大家怎么做聚类分析,通过聚类,我们可以知道,某一个分类的特征,下图是聚类的一个结果特征(软件通过算法把30成交量大于704的归为一类,以下是这类的主要特征)

    主要特征是:无投诉,主营100%,天猫店,退款速度2.7-6.0等,大家可以看下。下一篇会跟大家详细介绍聚类。

    文中用到的源数据集下载连接:https://pan.baidu/s/1yzGzZKiQq7zj18QLKx1ZIQ

  • ?

    「零一」《从0开始,教你做数据分析》—01篇

    Lambert

    展开

    大家好,我是零一,今天开始给大家带来基础系列教程

    本系列文章适合以下情况的读者:

    1丶淘宝店铺运营或者店长,目前还不会做数据分析,渴望提升自己

    2丶打算在淘宝开店的朋友,目前尚在混派代学习中

    3丶其他对数据分析感兴趣的朋友,尚在入门阶段

    本文是第一篇会比较基础,涉及的概念也少,旨在让读者动手了解工具。

    我们直奔主题

    数据分析的概念必须搞清楚。简单点说,数据分析是将数据进行清洗后,把隐藏在数据背后的信息提炼出来。

    另外,值得一说的是,数据分析是获取新知识的新途径。

    下面看一下菜鸟跟数据分析师的区别,引自《谁说菜鸟不会数据分析》一书

    可以看出来,专业一点的数据玩家的思路会非常清晰,而且会以目的为导向,建议大家参考分析师的思路。

    数据分析的过程已经有非常多的前人做出了总结,我还是引用书中的结果

    分别是,明确分析目的和内容——数据收集——数据处理——数据分析——数据展现——报告撰写

    做任何事情都要有目的,做数据分析也不例外,而且明确目的在数据分析里面上升到了一个非常重要的高度,甚至决定了你后面所做的一切有没有价值。

    做数据分析必须运用工具,没有工具几乎无从开展,大家看下一般数据分析有哪些工具

    可以看到,底层是数据库,在数据量大的情况下,需要动用到数据库。

    报告层是Crystal Reports(动态和可操作的报表,没用过)

    分析层是分析的工具,从左到右分别是Excel(Office套装里面的一员,据说可以和SAS媲美的数据工具之一),UCINET(社会网络关系分析,没用过),SAS(最古老最专业的数据分析工具),SPSS(IBM的工具,以简单易用闻名),clementine(已经被IBM收购属于SPSS系列)

    最后是表现层,也就是做报告的一系列工具,我只接触过PPT和水晶易表,一般会用PPT就可以了。

    接下来讲的数据分析,选择的是大家比较熟悉的Excel,Excel做深入分析的时候比较麻烦也有局限性,但就上手指数来说,Excel是排第一的。数据量在一百万条以内是足够的了。

    我选用的版本是Excel 2010

    第一步,我们要明确分析的目的和内容。因为是实例,我假设

    目的:了解淘宝美容行业的市场情况

    内容:1丶行业分析,2丶属性分析(采用折线图和饼图直观反映行业趋势和容量)

    第二步,数据收集,一般手动收集,也可以用工具收集。

    这里提供工具给大家做练习。提供的是仅支持美容大类的版本,运行环境,excel2010/2013,32位xp/WIN 7,假如没有生e经,那没关系,下面用到的数据源一样会共享给大家,拿着数据源就可以一步一步跟着操作。

    数据来源:生e经(必须有开通生e经,并能查看相应行业数据)

    数据宽度:21(月)

    因为生e经按月展示数据,因此这里的数据宽度,就是月份数。

    打开表格,然后,按下列图片次序操作

    自己登陆生e经复制生e经的地址进来。登陆好,就把窗口关闭即可。其中c2代表服务器编号是2。

    选择正确的服务器编号才能正常抓取。

    选择好后,点开始抓取数据

    耐心等待(等待时间和抓取的月份丶网速有关系),会在excel中出现结果,那么可以把这些数据复制到我们的另一个工作簿上,也可以导出为csv格式。

    导出的文件可以保持在本地,方便下次提取。

    第三步:数据处理,简单举例,可以跟着做。

    做下简单的处理,这里提取年份使用这个公式:=LEFT(E2,4),提取月份使用这个公式:=RIGHT(E2,2),然后填充。如下图所示,鼠标移到单元格的右下角位置,会出现个黑色小方形,鼠标也会变成黑色的十字架,双击即可填充。

    接着,我们插入数据透视表,鼠标点一下我们的数据,任意一个单元格都可以,只要在数据范围内,如图,我点在F10单元格。

    点数据透视表,会自动匹配整个数据框。我们点确定即可。

    点确定后,效果如下图所示

    用鼠标,将字段拉到下面的相应位置即可

    第四步:数据分析

    我们现在就已经完成了数据透视表,通过这个透视表,就可以比较直观的对比各行业间的差异,但是都是数字,不免有些晕,或许用图表来展示会更加直观

    点一下数据透视表,然后点插入——折线图,这里选择第一个样式即可(其他样式可以自己尝试)

    结果如图所示

    发现面膜/面膜粉的走势好像不错。

    接着,我想看一下各行业的容量占比,重点看下面膜/面膜粉这个行业占比多少,就以2013年的数据来统计占比。还是插入数据透视表,先设置好字段,然后再选择2013.

    接着,插入饼图

    结果如图所示

    这里看不到占比,而且也不知道哪个行业,这就需要我们设置一下图表。右击图表——添加数据标签

    出现标签后,我们再右击一下标签,设置数据系列格式

    按下图红框设置即可

    然后改下标题,稍微把图表的尺寸拖大一点

    这样,就比较直观了,面膜/面膜粉在2013年1-9月份中,销量占了整个美容护肤行业的16%。那么我想再仔细看看面膜/面膜粉行业的销量走势。依然先插入并设计数据透视表。

    然后,插入折线图

    结果如下图所示

    两年的销量走势对比,可以看出2013年比2012年增长了不少。增长需要涉及到环比增长和同比增长两个概念,今天先不讲。我们通过目测就已经看出来,今年比去年火,但是这个结论还不是最终结论,只是简单建立在数据层面的初步结论,还要通过淘宝去验证,搞清楚销量的增长是来自哪里。假设是某几家品牌促销的结果,那么这个数据对于我们而言,意义就不一样了。或许我们自己是这个行业的一个品牌商,则需要把后面的分析重点转移到研究这几家品牌的营销研究上面来,弄清楚对手究竟如何改变了这个市场。

    属性分析里面包含了SKU,操作方法跟上面类似,这里就不演示了。

    第四步:数据展现

    把我们以上得到的结果,进一步优化,更加直观丶有序地展现出来。

    第五步:撰写报告(非商业严谨报告,以实用为主)

    把所看到的,所想到的,通过文字的方式记录下来,方便自己或者他人阅读,了解我们的分析思路。

  • ?

    零一《从0开始,教你做数据分析》—10篇

    诱惑

    展开

    大家好,我是零一。这一篇给大家介绍聚类/分类。

    我们先讲一讲聚类。

    上一篇的探索关系,很多朋友反映说非常有趣,这一篇,聚类分析也是相当有趣的。

    聚类分析简称聚类,俗话说物以类聚,人以群分,聚类就是划分子类的过程。算法上面多用k-means和k-medoids,当然,大家可以跳过这些算法的过程,用程序来完成即可。

    说简单一点,通过聚类,可以将我们的数据进行分类,并且描述每个类的特征。

    聚类应用非常广泛,包括在电商领域的应用也是多不胜数。比如

    (1)对客户数据进行聚类分析得到多个客户群组,并且得到各个群组的特征,这可以帮助我们发现客户的共性和差异性;

    (2)竞争对手数据进行聚类分析得到多个对手群组和各自的特征,这一样可以让我们找到对手们的共性和差异性;

    (3)对行业数据进行聚类分析得到多个行业群组和各自的特征,这个可以来发现不同行业之间的共性和差异性

    (4)对销售数据进行聚类分析(比如以其中的地域聚类),可以告诉我们那些地域之间的共性和差异性

    不难发现,我举的4个例子都是在发现共性和差异性。对的!我们了解了这些信息,可以指导我们的运营决策,对不同群组制定不同的策略。

    下图是对地域数据做的聚类分析,得到的一个谱系图,我们从上往下看,首先是分成两大类

    广东,天津,浙江,北京和上海这五个省市为一类,其余的多省为一类。

    再往下看又分成了四大类,西藏作为单独一个分类,广东也作为单独的一个分类,天津和浙江为一类,北京和上海为一类。

    从上往下,越分越细。红色的边框把多个省市划分成5个分类。一般没必要分得太细,这个数据目测是分成了20个细分的分类,除非是确实是需要细分到很细的时候,才需要看最低层的分类。

    当我们知道天津和浙江聚为一类的时候,他们必然存在共性,才会聚在一起。当我们知道天津-浙江类和北京-上海类,作为两个不同的群组聚集,它们之间肯定是存在某种差异。

    =======================================

    下面,我们用上篇共享的数据,跟大家一起探讨聚类,和寻找他们的共性和差异性。

    先处理下缺失值,选择清除数据里面的离群值

    中间要选择需要处理的字段,选择好后,进入以下界面,也一样下一步即可

    选择删除包含离群点的行(因为这里数据量不少,可以删了)

    一般情况下,我们都避免直接修改源数据,需要新建一个变量或者空间或者工作表来存放处理过后的数据。这里选择复制到新的工作表就可以了。

    数据处理好后,就可以进行聚类分析了。在数据挖掘套件里面直接选择聚类分析即可。

    选择需要的数据进入模型里面

    点击参数,然后就会看到下图这个对话框,可以手动输入数字来更改聚类算法,可以看到微软提供的聚类算法有4种,分别是可变的EM,固定的EM,可变的K-means跟固定K-means(EM是最大期望算法,K-means是K平均值算法,可变的是可以伸缩调整的,固定的就是固定不可调整的)

    这里我输入4,选择固定的K-means算法

    下图是选择测试集的比例,默认是30%。【测试集】是数据挖掘特有的名词,数据挖掘里头将数据集一分为二,大头的部分用来训练建立模型,称之为【训练集】,小的部分就用来测试模型,称之为【测试集】。这是数据挖掘和统计学最大的差异之一。统计学是通过统计方法来验证模型是否可靠,而数据挖掘技术是利用测试集来验证模型的可靠性。一般用于预测模型,聚类分析其实可以不用测试集,可以把数值改为0。但我就不改了。就用随机抽取出来的70%的数据来建立模型。

    完成后,就会进入模型浏览界面,我们看到共有划分了7个,这有点儿多,我们可以在选择输入列的时候指定分类的数量,刚才我们是选了自动检测来着。

    线粗代表两个分类之间的关系的强度,越粗关系越强。分类的颜色代表密度,颜色越是深蓝代表这个分类的数据个数越多。那非常明显,系统把大部分的数据归入分类1里头了。

    下面是分类的剖面图,每个分类对应的指标范围在这里一览无遗。

    简单解读一下上面这个分类情况

    【分类1】包含2768个数据,最鲜明的是30天成交量偏大,价格偏低的这一个群组,是中低端爆款类

    【分类2】只有246个数据,这个群组比较失败,发货分丶服务分丶好评率都偏低,销量偏低,价格偏高一点,典型就是卖货不卖服务类

    【分类3】只有187个,集中在广东深圳,DSR很好,评价很好,价格很高,但退款率也很高,应该是高端市场的卖家,标准的价格高,服务好,但不知为何退款率也高,可能是买家收到了,觉得不划算吧,这一类是高端类,但产品或品牌的价值感可能没有做好。

    【分类4】只有65个,也是DSR超好,价格中档,产品的价值完美体现,退款率不错,同样集中在广东深圳,是中档性价比类。

    【分类5】只有61个,这个群组很惨,集中在浙江金华(估计是义乌),价格超低,DSR超烂,好评率很惨,是低端烂货类

    【分类6】和【分类7】规模很小,就不解读了。以上解读仅供参考。一般分个4-5个群组就差不多了,如果数据量确实大,可以考虑分细一些。

    每一个分类都可以单独提取出这个分类下的数据的。

    下图是分类的一些特征,每个特征的概率情况

    下图是分类间的差异性,通过对比可以发现,分类1多是天猫,非分类1的多是C店。

    下面我着重看下分类3和分类4的区别,因为分类3败在退款率上面,而分类四就解决了这个问题。

    我大致上看出来了,分类3的服务(DSR,退款速度)没有分类4的做得好,但分类4的价格又要比分类3低,并且包邮。那作为消费者,肯定选个价格中肯,服务又好的店家。而且分类4的销量还不低,有少部分是心店,我对心店的印象就是心店的服务一般要比大店的要好。

    以上就是对这儿聚类分析结果的简单解读,具体的,亲们实操一下吧。

    =============================================

    下面说说分类。

    聚类和分类,从语义来讲,看似很像,但有一点重要的差异。分类是指定了我们要分析的列(维度),然后通过决策树算法(默认方法是用贝叶斯分类器),来告诉我们,影响这个目标的维度有哪些。下面我们看下过程。

    选择要分析的列,我这里选择的是30天销量,看下会影响销量的是什么因子。

    下图是结果,告诉我们,收藏很重要!收藏跟销量有很强的关系。同样第一张图是决策树,一样有分组的作用。

    决策树一般用来分析影响客户下单或者流失的因子有哪些。有兴趣的朋友可以自己倒腾一下。试下会有哪些意外的收获。

    ===========================================

    下面,告诉大家测试集的使用方法。

    选择准确性图表

    选择模型,一般用于预测模型,刚才的决策树是属于预测模型,而聚类就不属于,因此聚类的模型不可用于准确性图表。

    选择要预测的区间,我选择的是30天成交大于122的情况

    我们之前保留的测试集,就在这里出现了,默认会选择测试集来验证准确性。

    在上图点了完成后,就会得到这样的一个结果(部分截图),会有一个指标, “分类 30天成交”模型提升144.11%,这个数值越大代表模型的准确性越高。但我一般看下面的ROC图。

    蓝色代表没有模型的结果,红色代表理想的结果。而绿色代表我们测试得到的结果。

    绿色的线越接近红色的就代表越好,一般情况下,只要不要太接近蓝色的线(或者低于蓝色的线),就好了。如果接近蓝色的线或者在蓝色线下面,那就不如不用模型了,此时这个模型就没什么存在的意义,如果硬要用那就只是为了做模型玩玩而已了。

从0开始学数据分析

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP