- ?
「零一」《从0开始,教你做数据分析》—06篇
Hubery
展开
HI~!我是零一,好久不见了。今天开始我们一起来学习数据分析的中阶课程。
今天的内容主要是理清数据分析的主要思路和几个进阶的分析方法。
数据分析一般的任务,有以下四种。
1、预测
2、异常检测
3、探索关系
4、聚类/分类
以下4种场景对应的主要任务来帮助大家理解这4种任务。
1、老板要求小白同学做一份市场分析——预测
拿到市场分析的数据源,就要明确知道,分析市场的最主要的价值就在于“先知”,比竞争对手提前预知市场行情。因此接到市场分析的工作,不用迷茫,预测是它的价值所在。
2、老板要求小白同学对店铺的日常数据进行监控——异常检测
平时监控店铺的一切数据,如果一切正常,那就什么工作都没有。而主要的工作就来自异常情况,包括跟行业阈值对比,一旦低于行业阈值就被视为异常。
3、老板要求小白同学分析一下订单数据或销售数据——探索关系
探索关系的工作是最有趣的,因为你说不定会发现一些非常有趣的关系,比如什么因素是影响买家下单的主要因子。在excel应用中,最简单粗暴的方法就是用散点图来观察。
4、老板要求小白同学分析一下会员数据——聚类
相信很多朋友有过这样的苦恼,手里有客户数据,但是不知道如何效益最大化地利用。那么这里就涉及到对客户进行分类。通过分类可以知道哪些客户是有价值的,哪些客户是没有价值的。
这四种任务,会分别在07、08、09、10篇中跟大家详细介绍。07篇估计很快就可以推送给大家。
那么,今天我要给大家介绍一下多维分析,顾名思义就是维度很多的时候用的分析方法。这个方法非常简单,就是一张图表而已。
下列几个场景来帮大家掌握多维分析。
1、老板要求小白同学分析一下店里的几个客服的综合能力。
将源数据处理一下,跨度不要太大,把询单人数、客单价和总业绩处理成占比即可
直接用下面的这张图来展示3个客服的综合实力,一目了然。A客服目测是最优秀的,C是最差的。
2、老板要求小白同学分析一下某个宝贝的搜索关键字。
某宝贝的关键字数据如下,也是要将数据处理成占比形式
效果如下图所示,毋庸置疑,“加厚”这个关键字是最好的,接着是2013和包邮(展现量为第一考虑要素,没有展现量,其他的维度数据再高也是白搭的)
3、老板要求小白同学分析一下最近直通车新推的几个款中,哪个最适合加大投入推广打造爆款。
假设3款宝贝,同时上的直通车,数据同样处理成百分比形式。
操作步骤:
Step1:选中数据,然后找到插入选项卡的其他图表
Step2:找到雷达图,然后点击
Step3:美化后如下图所示。
裤子002是最有潜质的。我们看裤子001,花费太高了,但点击率不高,成交金额跟裤子002也接近。裤子002加大投入应该可以得到比较好的收益效果。
- ?
「零一」《从0开始,教你做数据分析》—08篇
Stella
展开
大家周末好,我是零一。第一次用手机写文章,哈。在车上的时间看了一本书,余下的时间,我想应该可以写一篇文章。图片等到了地儿了,再用电脑补上。
上次跟大家介绍的预测,并没有深入讨论,以后有时间,我在整理一个实例系列的文章,跟大家深入讨论这些技术。今天应该要讲异常检测。异常检测也叫孤立点检测,或离群点检测。
如我前文所说,我们天天监控店铺数据,目的就是为了发现异常并及时预警,如果一切正常,那咱们就啥事儿都没有。万一有异常数据出现,那我们就要做进一步的分析,找出导致异常的罪魁祸首。
异常检测,操作和观测起来异常简单,用箱线图或者散点图即可。
大家看下图,是某行业按销量排名前4004个宝贝的价格散点图。非常明显,有一个孤立点,居然卖12W+
当我们发现这种孤立点的时候,必须要考虑的是:
1、这个数据是否有误?要如何处理?
2、如果数据无误,是什么原因?是否需要处理?
辨别是否有误,就需要调出源数据进行检查。这个相当简单,只要做核对,以及根据逻辑和常理来判别即可。但也有无法判定的情况。
我们先说第一个情况。如果我们判断是数据出错,而我们又无法拿到正确的数据,此时我们就需要对这个异常值进行处理。
异常值(数据有误的情况下)处理的方法:
1、更正。2、删除。3、替换。
下面是通过生e经下载下来的数据,共有325行数据。
对成交量、销售额、高质宝贝数分别作出散点图(我是做演示说明,不要再跟我纠结这个数据准不准等问题了)
销售额这里明显有一个孤立点。如果我们不处理这个孤立点的话,可能会影响我们后续的分析结果。
可以直接定位到这个点的位置,在散点图看一下,是在第77个点,那马上就可以定位到excel的第78行
经过筛选,可以直接拿出毛衣这组数据。
(为什么散点图是第77个点,而excel中是第78行?这个问题其实之前一直有人问我。但如果阅读到这一篇,还不能独立思考这个问题的话,那请先回过头去看前面的7篇)
经过和生e经的数据对比,这个数据没有错,生e经上面就是这个数据。但是根据逻辑和常识,可以立马判定这个数据是个错误值。
“为什么能立马判定这个是错误值?”如果不明白的话还是自己想啊,哈哈。
确定这个数据是个错误值后,我们也无法更正这个数据了。那要如何处理这个数据呢?已经无法更正了,就剩余两个方法:1、删除。2、替换。
删除的话,这里不适用。一删就少了一个月的数据了。那这里就用替换。
怎么替换?那方法就多的去了。最简单的方法是用平均值替换法,平均值替换也有多种技巧。
方法1、取这个值的前后两个数据的平均值,也就是(935086015+894448225)/2=914767120,用这个数字来替换,就要比之前的靠谱多了。
方法2、先剔除错误行,然后算出平均售价,用平均售价乘以错误行的成交量即可。算得173*5292179=915546967
理论上面来讲应该是方法2比较准确一点。我就用方法2替换这个错误值。替换后的散点图如下。
异常值就不见了,我们就可以对这组数据做分析了。
================================================================
这里介绍下数据挖掘套件的功能,数据准备——清除数据——离群值
这个功能也是为了避免数据有误,导致分析结果偏离的问题。
一般操作中,拿到数据,都必须要分析下是否有孤立点,因为孤立点不处理就会影响我们的分析结果
可以选择是要对那一列数据做离群值处理
设定阈值,我们可以通过拖动下面的指示条或者手动输入阈值的方式,来指定。
效果如下,被划线填充的部分就是我们界定的孤立点。这部分数据将会被处理
选择处理方法。这个就根据业务场景来确定的。如果可以删就删,不能删,就可以指定范围更改,或者用平均值。
这个就更加方便一点,方法也可以给我们选择。一般操作中在数据样本少的时候一般是不能删除的,只有数据样本大的时候才可以考虑删除。
===================================================================
另一种情况,如果这个孤立点不是错误值呢?也就是数据无误,那这个时候,我们就要深入分析了。
看下面这个案例吧!虽然特别简单,但可以表达清楚即可。
某店的销售额,每天记录下来,通过观察即可发现(如果是淘宝,数据魔方,生e经等工具都有这个数据的,在网上就可以看到)
发现18号销售额突然下降。依然是先判别是否错误值。判别无误。
数据无错的情况下,我们要找原因(这个案例真心太简单,将就着吧)
第一步是分解指标,找到关键指标。
通过分解销售额=客单价X转化率X访客数
这时,我们需要检查的就是这三个指标。
客单价目测没有问题。
转化率非常明显,在18号有一个最小值。
访客数在8号居然是有升无减。。那锁定转化率的问题。
事情还没完。。我们接着分解转化率。
最终只要细细看下这些转化率指标即可。当然也可以想办法把指标分得更细,再观察。余下的事情就留给读者思考和实践吧。我也到点了。
这一篇我介绍得很简单,大家也不要被我误导了。其实异常检测,不仅仅能做这么简单的事情,很多我们熟知的功能其实就用的异常检测。比如:
1、站长通过日志中的孤立点,发现入侵者
2、老师通过IQ测试分析孤立点,发现天才or白痴
3、气象站人员通过孤立点,发现灾害or极端天气
4、淘宝or银行or电信,发现欺诈or异常行为
等等。
- ?
零一《从0开始,教你做数据分析》—05篇
Ford
展开
大家好,我是零一,今天开始继续给大家带来数据分析基础系列教程。
上一篇中,我们提到波士顿矩阵,波士顿矩阵又称为增长-份额矩阵,它的优点是简单便捷,而缺点也是恰恰是它的优点,因为简单便捷,使得这个模型的解释度降低,它只是在市场营销中使用到的一种方法,作为参考,还要结合其他的方法,绝不能用它来作为决策的唯一指导。
下面,我再具体介绍一下波士顿矩阵的几种模型。
上一篇中我只是单独用了9月份的数据,那么,假设,我用多个月的数据,就会形成一个趋势。
下面是成功轨迹,也是比较理想的成长路线。在高增长下,市场占有率逐渐上升,最终落入金牛区。有这种轨迹的,那么恭喜你,发财了记得请零一吃饭!
(关于交点,可以选择中点或者自己根据自己市场的情况来制定。不过一般选品,是择优,选择中点即可)
(竖轴是增长率,横轴是相对市场份额)
下面是现金支持趋势,可能是较早切入市场,占领了较高的市场份额,但却没有足够资金和营销策略的支持,可能就会面临失败的危险,一旦有这种趋势就要引起警惕。审视一下自己的产品定位有没有偏差丶营销节奏有没有把控好等问题
下面是灾难轨迹,两条路线,一条是从明星——问题——瘦狗,另一条是从金牛——瘦狗。这两个轨迹就是一个产品,一个市场逐渐萎缩死亡的过程。这条路,说多了都是惭愧的泪啊!
这个矩阵是根据最终的数据结果来分析的,那么我们不能脱离商业理解,如果增长降低了,市场份额也降低了,除了竞争加大之外,是否还有其他深层次的原因呢?
其实,我们更多的是要思考消费者是否认同我们的产品和服务?我们的产品是否能吸引消费者?站在买家的角度来思考市场变化。
说到市场,一般从两个方面来细分市场,一个是基于需求的市场细分,一个是基于行为的市场细分。
基于需求的市场细分,主要是指消费者的需要丶欲望。思考得更多的是同样的行业,我们要去满足消费者的哪种心理需求。
基于行为的市场细分更多地关注于消费者可能会购买的某种行为,这句话,我说得挺拗口。其实很简单,就是消费者会倾向于购买什么产品。比如,苹果5s上市了,相应地买了苹果5s的消费者,就可能会产生对苹果5s配件的需求,需求就会转化为购买力。
这两种方法,没有说哪一种更好,都可以去尝试,在数据分析的角度讲,是分析的方法和模型不同。撇开数据,那么这两种方法就是一种思路。
基于需求的要站在买家的角度,心理需求来思考,从而细分市场,发现市场。
基于行为的则根据市场产品结构丶消费行为来细分。
那问题来了,有朋友会想,之前零一教的不是没用了吗?
其实不会没用,之前都是在看容量,看趋势,是在看市场的全貌,而细分就像是在看市场的内部结构。大家好弄清楚它们之间的关系。
下面继续教大家做数据分析,这是初阶的最后一篇了,要为后续的中阶和高阶打基础,理论会稍微多一点,后面不会花篇幅来解释这些。
今天给大家介绍下描述性统计。描述性统计,就是在描述数据。
比如之前介绍给大家的,极差丶波动系数就是在描述数据的离散程度,所谓离散程度,大家看下图,数据是离散的。
再看下面的图,目测在(50,50)附近有很多个点,通过目测就看得出来下面这个数据的离散程度没有上图的高。这个现象用什么来描述,解释呢?就是用我们之前说过的波动系数,就能把这两张图的波动程度给描述出来。
除了离散程度之外,一组数据基本的有:最小值,1/4位数,中位数,3/4位数,最大值,这就是所谓的五数总括。
最小值很简单了,直接在excel里面敲入=min(),就能算最小值。有时候我们需要找出我们最低的销量是多少件,最低的转化率是多少?
最大值也是一样的道理,在excel里面是=max(),就能算出最大值。
这个在第二篇有跟大家简单介绍过的了,就不截图了。
接着是1/4位数丶中位数和3/4位数。如果没有接触过统计学的朋友会比较晕,不知道这个是什么来的。这三个数将数据切成4个等分的小数据集。
大家看下面的数列
1,50,10,100,2
最小值是1,最大值是100,1/4位数是2,中位数是10,3/4位数是50。
下面我们再看个例子,假如是12个月的销量数据
1,2,3,4,5,6,7,8,9,10,11,12
最小值是1,最大值是12,1/4位数是3.75,中位数是6.5,3/4位数是9.25
而我们用得最多的是均值6.5,这里刚好跟中位数一样。
但是,我们再看下面另一组数据
1,2,3,4,5,6,7,8,9,10,11,100
最小值是1,最大值是100,1/4位数是3.75,中位数是6.5,3/4位数是9.25
除了最大值不一样,其他跟前面是一样的。我们看下均值,这里的均值是13.83,跟前面的不同了,这个100这么大的值可能是活动的效果,那这个时候,如果我拿均值来作为指标衡量前面12个月的销量,就只有最后一个数据达标。当数据整体平稳,但前后有很大的异常值的时候,我们用均值来做指标参考就不靠谱了,这种情况更适合的是用中位数来作为指标。
用散点图可以非常直观地发现离散值。将我们上面的一组数据画出散点图,如下图就会发现一个异常值。
在excel里面,用=QUARTILE(),就可以得到这5个数。
另一个指标,众数。
大家看下面这个数列,假如是客服的业绩
1,3,5,5,5,5,5,5,5,5,10,20
我们先算一下平均值,是6.167,如果用这个指标,这里12个数据里面,只有10和20这两个人达标。那么,这个时候,就要用众数了。所谓众数,就是出现的最多的一个数字,毋庸置疑,这里的众数是5,那么,就会有10个人达标了。
众数在excel里面是=mode()
非常简单就能算出来,特别是数据量大的时候,不用目测。
以上的指标是根据数据的分布情况来选用的,一般用散点图看一下,然后就能判断要使用哪个指标来作为参考。
前面说到了异常值,异常值的处理方法有很多,那么,简单的方法,就是把异常值删掉。比如前面的,(1:11,100)这个数列,就可以把100从这个数列里面移走。或者,也可以用均值填充。比如,之前算出来均值是13.83,就可以用这个指来替代变成(1:11,13.83)。
不是什么时候都要处理异常值,只有在异常值严重影响我们判断的时候,就要对它进行处理。
好了,今天的内容就这么多了。最近比较忙,写文章会慢一些,大家不要催哦!最后再啰嗦几句,做数据分析的态度是务实,不要太浮躁,不要太自私,一切用数据说话,这是做数据分析师的基本态度。
- ?
零一《从0开始,教你做数据分析》—07篇下
谢初雪
展开
HI~!我是零一,我们现在继续讲预测。
上篇跟大家介绍了数据挖掘的做法,微信的朋友就有人问了,那如果我不会用数据挖掘的算法就不能预测了吗?
答案是肯定可以的,不用数据挖掘的算法也一样可以通过数据来做预测。
既然是预测,伙伴们也不用纠结说预测得不准,能有个八成的准头就已经不错了。包括现在很多著名的数据挖掘案例,准头可能都没有个八成,不过因为是建立在大数据的基础上做的挖掘,有时候有个五成都能创造出价值了。
如果不用数据挖掘的算法,最高境界当属神奇的第六感了,这种我也无能为力。我只能讲我力所能及的通过数据来预测。
比如预测销量、预测销售额等,我们可以直接用简单的环比增幅或者同比增幅来计算。
我们利用环比和同比增幅的公式,就可以推算出下列公式。(环/同比之前在初阶的文章中跟大家介绍过了)
=============================本期数=上期数*(1+环比增幅)
本期数=同期数*(1+同比增幅)
=============================
用环比还是同比,其实都可以,但我们还要考虑趋势的问题,环比、同比表达的就是趋势。
我们看下图,今年的趋势跟去年的趋势基本是一样的,那么,我们用环比或者同比都是可以,而且预测的效果也比较靠谱了。
如果今年跟去年的趋势不同,就结合环比和同比都计算出来预估值,然后求两者的平均值即可。
下面两个场景帮大家理解。
1、老板让小白同学预测一下行业未来3个月(1季度)的销量。
首先拉出行业数据2012年1月到2013年7月,要预测2013年8、9、10三个月份的销量。先计算出环比和同比,同时把销量做出趋势图
然后把环比增幅也做出折线图,可以发现2012年和2013年的趋势是差不多的,因为2012年春节是1月份,也就是从2月份开始恢复正常销售,而2013年春节是2月份,也就是从3月份恢复正常销售。总体来讲,趋势是差不多的。
我们先假设两年的环比增幅趋势一致,于是可以用2012年8、9、10三个月的环比数据来作为预估。
将2012年8-10月份的环比数据代入2013年8-10月份,公式就用
本期数=上期数*(1+环比增幅)
先根据7月份的数据算出8月的销量,再根据8月算出9月,以此类推。
年月前面加个字母e,代表预测的意思。
算出来后如下图,我们可以发现,代用去年的环比增幅预测出来的销量的同比增幅跟7月份是一样的。也说用这种方法的特点,就是假设同比增幅相同。其实和我上面说的假设两年的环比增幅趋势一致是一样的。
我们可以做出折线图,蓝色背景部分就是预测的销量了。小白同学完成任务。呵呵!
2、老板让小白同学做一份未来3个月(1季度)店铺的销售计划,里面要预估一下未来3个月的销售额。
源数据如下,假设这个店就做了7个月的时间,从2013年1月份开始运营。
这种情况,方法其实很多。但准确率是让人非常头疼的,因为还涉及到供应链、市场环境、店铺运营规划等问题。
我就介绍一种比较靠谱的思路。
第一步,与老板、市场负责人等熟悉本行业的相关人员协商,设定(最高或者最低)增幅基数,就假设最高10%/月,最低不低于2%的增幅发展。(也可以直接引用预估的行业增幅,不过可能会让运营人员鸭梨山大)
第二步,回到第一个任务,预测下行业的趋势,我们直接引用上面的结果
下图可以看到9月增长,8月和10月都有下降趋势。
因此,可以认为借着9月行业的增长,店铺也可以达到设定的最高增幅。8月行业持续下降,可以适当调低我们的增幅阈值。预计的结果如下
同样做出折线图,持续增长是个理想化的东西,只要行业波动不要太大,店铺的动作不要太大(如果某个月连续上聚划算会导致当月增长,过后可能会迎来一段持续下滑的时段),持续增长不是什么大问题。
最终在验收成果的时候,也是要结合实际的市场动态,如果市场增长的情况下,我方反而下滑,就不正常了。如果市场以100%的增幅快速增长,而我方仍然以10%的增幅蜗牛式增长,这也是有问题的。
或许,在本店资源供应正常的情况下,行业趋势就是运营的阅卷官吧!
不知不觉又到凌晨2点了,要培养一名数据分析师不是一件容易的事情,大家加油跟上吧。
- ?
零一《从0开始,教你做数据分析》—03篇
巫代柔
展开
大家好,我是零一。今天接着第一篇的内容,我们继续利用excel2010来做数据分析。
这系列文章,是从0开始的,可能读者的基础并不是太好,我是这么安排的,先学会基本的操作,会操作了后,再回过来学一些分析思路和方法。自己做过之后,再学心法,可能会有更大的收获。
说回主题,上一篇中,我们看出了走势图,也看到了占比图。这两个必须同时看,才能清楚的,因为你单看走势图,是看不出占比的。单看占比图也会看不粗走势。因此,这两个图,是结合一起,才能读出相对完整的信息。
根据我们的目的,了解淘宝美容护肤行业的市场情况
我们已经拿到了走势和占比两个信息,那么接着还能了解些什么呢?
可能每个人的问题都不一样,我引出一个问题,每个子行业的竞争程度怎么样呢?
那么,我们就要思考,这个问题要转化成什么维度呢?我们手里的数据能否来回答这个问题呢?
我们先观察看一下源数据(源数据下载地址在01篇的底部)
成交量,统计的是成交的件数。
销售额,统计的是成交的件数+一口价,这里误差太大,不分析这个数据。
高质宝贝数,统计的是有一定销量的宝贝数。
其他维度,跟我们的问题关系不大,这里排除了销售额,那么,就剩下成交量和高质宝贝数。
成交量/高质宝贝数
就会得到平均一个高质宝贝数分配到的成交量。这个指标,有人称之为分配量,有人称之为平均占有率,也有人称之为均量。那么,我下面将这个指标命名为均量。
第一步,插入数据透视表
第二步,设置字段
然后,增加一个计算字段,在数据透视表工具——选项——域丶项目和集——计算字段
公式如下图所示
确定后,会自动添加,大家可以核对一下字段设置
然后,我们看到数据透视表,但是面对这个表格,零一点情绪都木有。
看到表格,而且密密麻麻的这种,脑袋就要开始想【数据展现】。用什么方式来展现这些数据?
这里解释一下,【时间序列】简单理解就是以时间为展现维度的数据,那么这里刚好就是以时间作为维度。那么,我们看到是垂直柱和线图。那就用这两种结合,来做展现。
结果如下,天哪!巨坑!这,,,这要比表格还要难看。
这里一团糟,是因为维度太多了,维度太多了,就要思考【降维】,减少这个图表里面的维度即可。
下面仔细看,有个倒三角。
点下倒三角,跟我下图一样,筛选一下即可。
结果如下。认真看,想想为什么最底下有条水平线?
最底下那条就是均量了。因为数值太小,所以,好端端的一条曲线就变成了水平线。鼠标点一下。
最下面的直线就会被选中,右击一下,在弹出来的菜单选择,设置数据系列格式。
然后,选择次坐标轴,点右下角的关闭
这就看得清楚了,蓝色是成交量,对应左边的纵坐标轴。红色的是均量,对应的是右边的纵坐标轴。
发现9月到年前是行业旺季哦!今年的均量在飙升的感觉。均量越高,代表每个宝贝分配到的成交量就越多。
那么,问题来了,均量高是好事情吗?
答案是未必,首先要去淘宝搜索判断,目测销量第一页的分布情况,就可以知道。如果要用指标,可以用【极差】来判断。这里其实目测就好了。如果销量都在两三个宝贝,那么,这个事儿对于你来讲就不好了。
再接着,如果发现分布相对均匀,那么是好事吗?
还是未必,答案完全看你自己了,如果是小卖家,那是好事儿啊,竞争不会太大,大家都有机会得到成交的机会。
但是,如果你是有实力的卖家,这就不是件好事儿,蛋糕要大家分呀!这可是蛋疼的事儿。
好了,解释就到这里。我们继续。开始说了要用两种图来展现。现在只完成了第一步。接着,我们在这个表里面加入柱形。
点一下红色线性,右击,在菜单中选择更改系列图表类型
按确定自己看结果吧
这里又出现个问题了。这里只能看一个行业啊!能不能看所有的行业,或者每个行业都单独看一下?
答案,是都可以!我们先实现变着行业来看。
插入切片器,如果找不到地方的,版本不同,自己找。或者就是图表没有在活动状态。
选好后,按确定,就可以看到切片器,自己点点看看吧。。
那么,接着,将均量全部拿出来看趋势。重新插入个数据透视表。过程自己思考。不演示了。相信消化了第一篇的童鞋都能自己做的了。
好,到这里来,基本看得差不多了。但是还有,我还没有说完哦。
因为考虑到进程问题,这一篇内容要稍微多一些。
上面均量的走势,我们看得出来,胸部护理的均值最高,但是越下面的各个子行业错综复杂,我们怎么客观地来判断呢?
这里教大家两个指标【波动系数】和【极差】,这个后面的文章可能要用到,以后讲到,就不解释了!对他们的数学/统计意义感兴趣的童鞋自己百度吧,波动系数,统计学里面叫变异系数。
统计学意义我就不说了,我先介绍一下,这两个指标,不是什么时候都要用,就是用肉眼,看不出来,拿不准的时候,希望更加科学地来判断,就需要动用他们了。
【波动系数】=【标准差】/【平均值】
【极差】=【最大值】-【最小值】
我从数据透视表复制出部分数据,如下。相信消化了第一篇的童鞋都能自己做的了。
先算下【标准差】excel里面函数是:STDEV.S
【极差】公式
【均值】大家都知道的,但是还是贴出来吧。
最后,自己算下波动系数哦!
那么,我算出来T区护理的波动系数是0.43,唇部护理是0.39。极差在上面看得到。这个怎么应用呢?
要记住这个应用的前提,肉眼看不出来,不明显,错综复杂的走势。那么,就用他了,如果摆在你面前的能用肉眼一眼看穿的,请绕道。
如果是小卖家,选择波动系数越大的,可能就越好。因为市场波动大,机会就大,前提一样要先验证一下是否是个别商家人为操作起来的市场。
如果是中级卖家,具体也要看,如果资源好,建议选择波动系数小的,因为这个市场做起来后,就相对稳定,平时不用太操心呗,控制好供应链,其他就没什么大事儿了。
【极差】作为辅助的维度,不一定要,但是他跟【波动系数】一起看得更全面。
【波动系数】有个优点也是缺点跟数据本身的大小没关系的。百万级别的源数据跟百位级的源数据,算出来的波动系数可能是一样的,从优点来讲,他可以跨维度,跨数据级对比。从缺点来讲,就是看不全,就可能出现不同级别的数据之间,他们的波动系数相等。
- ?
数据分析篇:用户增长分析——用户分群分析
邬映之
展开
在产品的增长分析当中,想关注符合某些条件的一部分用户,不仅想知道这些人的整体行为(访问次数,访问时长等),还希望知道其中差异较大的细分群体。用户分群方法,能帮助我们对差异较大的群体分别进行深入分析,从而探究指标数字背后的原因,探索实现用户增长的途径。
用户分群的应用场景
在日常的数据工作中,我们经常接到这样的需求:想关注符合某些条件的一部分用户,不仅想知道这些人的整体行为(访问次数,访问时长等),还希望知道具体是哪些人符合这些条件。然后查看这些人的数据导出用户名单,针对性的发送tips消息。有时还想进一步查看某些人在使用某功能上的具体操作行为。
用户分群,就是用来满足这类需求的工具方法,它能帮助我们对差异较大的群体分别进行深入分析,从而探究指标数字背后的原因,探索实现用户增长的途径。
如用户画像分群,核心价值在于精细化的定位人群特征,挖掘潜在的用户群体。使网站、广告主、企业及广告公司充分认知群体用户的差异化特征,根据群体的差异化特征,帮助客户找到营销机会、运营方向,全面提高客户的核心影响力。
用户分群
用户分群的5个类型类型一:不分群,如全量活跃用户投放,群发短信等,缺点是没有针对性,容易引起用户反感。
类型二:用户基本信息分群,如根据用户注册的信息分群。相比不分群,这种方法已具备一定的针对性, 但是由于对用户不是真正了解,产生不了很好的结果预期。
类型三:用户画像分群,如年龄、性别、地域、用户偏好等,画像建设的焦点是为用户群打“标签”。
一个标签通常是人为规定的高度精炼的特征标识,最后将用户分群的标签综合,即可勾勒出该用户群的立体“画像”。画像分群让我们真正了解了用户的某些特征,对业务推广帮助很大。
类型四:根据用户行为进行分群,此阶段会在画像分群的基础上关注用户的行为特征, 如根据用户的注册渠道和活跃习惯,制定不同的营销推广策略。
类型五:聚类和预测建模分群,聚类建模可以根据用户的综合特征指标,将用户分为不同的群体,如将用户划分为娱乐型、挂机型、社交型、办公型等;
预测建模即尝试去猜测用户下一步的态度与行为(例如想知道什么,想做什么)。正因如此,它对将复杂的行为过程变为营销自动化,是十分有帮助的。
常见的用户分群维度
1. 统计指标:年龄,性别,地域
2. 付费状态:免费,试用,付费用户
3. 购买历史:未付费用户,一次付费用户,多次付费用户
4. 访问位置:用户使用产品的区域位置
5. 使用频率:用户使用产品的频率
6. 使用深度:轻度,中度,重度用户
7. 广告点击:用户点击了广告 vs 未点击广告
常用的聚类分群方法介绍
上面介绍了一些关于分群的方法和思路, 接下来重点讲解一下用户聚类分群,聚类分群可分为层次聚类(合并法,分解法,树状图)和非层次聚类(划分聚类,谱聚类等),而较常用的互联网用户聚类方法为K-means聚类方法和两步聚类法(均为划分聚类)。
聚类分析的特征:
简单、直观;
主要应用于探索性的研究,其分析的结果可以提供多个可能的解,选择最终的解需要研究者 的主观判断和后续的分析;
不管实际数据中是否真正存在不同的类别,利用聚类分析都能得到若干类别的解;
聚类分析的解完全依赖于研究者所选择的聚类变量,增加或删除一些变量对最终的解都可能产生实质性的影响;
研究者在使用聚类分析时应特别注意可能影响结果的各个因素;
异常值和特殊的变量对聚类有较大影响;
当分类变量的测量尺度不一致时,需要事先做标准化处理。
聚类分析的弱点:
聚类是一种无监督类分析方法,无法自动发现应该分成多少个类;
期望能很清楚的找到大致相等的类或细分市场是不现实的;
样本聚类,变量之间的关系需要研究者决定;
不会自动给出一个最佳聚类结果。
聚类分析的应用过程:
一、选择聚类变量
在选取特征的时候,我们会根据一定的假设,尽可能选取对产品使用行为有影响的变量,这些变量一般包含与产品密切相关的用户态度、观点、行为。
但是,聚类分析过程对用于聚类的变量还有一定的要求:
1、这些变量在不同研究对象上的值具有明显差异;
2、这些变量之间不能存在高度相关。
首先,用于聚类的变量数目不是越多越好,没有明显差异的变量对聚类没有起到实质意义,而且可能使结果产生偏差;
其次,高度相关的变量相当于给这些变量进行了加权,等于放大了某方面因素对用户分类的作用。
识别合适的聚类变量的方法:
1、对变量做聚类分析,从聚得的各类中挑选出一个有代表性的变量;
2、做主成份分析或因子分析,产生新的变量作为聚类变量。
二、聚类分析
相对于聚类前的准备工作,真正的执行过程显得异常简单。数据准备好后,导入到统计工具中跑一下,结果就出来了。这里面遇到的一个问题是,把用户分成多少类合适?
通常,可以结合几个标准综合判断:
1、看拐点(层次聚类会出来聚合系数图,一般选择拐点附近的几个类别);
2、凭经验或产品特性判断(不同产品的用户差异性也不同);
3、在逻辑上能够清楚地解释。
聚合系数图三、找出各类用户的重要特征
确定一种分类方案之后,接下来,我们需要返回观察各类别用户在各个变量上的表现。根据差异检验的结果,我们以颜色区分出不同类用户在这项指标上的水平高低。其他变量以此类推。最后,我们会发现不同类别用户有别于其他类别用户的重要特征。
四、聚类解释和命名
在理解和解释用户分类时,最好可以结合更多的数据,例如,人口统计学数据、功能偏好数据等等。然后,选取每一类别最明显的几个特征为其命名,大功告成。
K-means聚类应用案例
在本案例中,我们首先来看最常用的K-Means聚类法(也叫快速聚类法),这是非层次聚类法当中最常用的一种。
因其简单直观的计算方法和比较快的速度(相对层次聚类法而言),进行探索性分析时,K-Means往往是第一个采用的算法。并且,由于其广泛被采用,在协作沟通时也节省了不少用于解释的时间成本。
1、K-means的算法原理:
a、随机取k个元素,作为k个簇各自的中心。
b、计算剩下的元素到k个簇中心的相似度,将这些元素分别划归到相似度最高的簇。
c、根据聚类结果,重新计算k个簇各自的中心,计算方法是取簇中所有元素各自维度的算术平均数。
d、将全部元素按照新的中心重新聚类。
e、重复第4步,直到聚类结果不再变化,然后结果输出。
假设我们提取到原始数据的集合为(X1, X2, …, Xn),并且每个Xi为d维的向量, K-means聚类的目的就是,在给定分类组数k(k ≤ n)值的条件下,将原始数据分成k类,S = {S1, S2, …, Sk},在数值模型上,即对以下表达式求最小值(μi 表示分类Si 的平均值):
2、用户分群背景和目标:
某产品覆盖社会各种群体(不同年龄、不同行业、不同兴趣等),需要将大盘用户进行一定细分,然后针对性的开展运营活动。
3、聚类变量选取:
用户画像特征、用户状态特征、用户活跃特征
4、 聚类分析和结果:
通过相关性分析和变量重要性分析,剔除部分效果差的变量,然后对剩余11个变量进行多次训练(目标聚类个数,参与的变量,组内个体差异容忍度),最终得出聚类结果。
用户分群K-means聚类效果5、结果解读和命名:
聚类1:低端低龄群体
聚类2:学生活跃群体
聚类3:职场高粘性群体
聚类4:职场低粘性群体
聚类5:高龄低活跃群体
用户分群K-mean聚类结果两步聚类和k-means聚类效果对比
前面谈到的K-Means聚类法有简单、直观和快速的优点。但是其缺点是只能采用数值型变量,不能包含类别变量,并且对异常值非常敏感,离群值很容易严重影响聚类结果。
并且,当数据集比较大(在腾讯,这种情况很常见),不能把所有数据点都装进内存的时候,K-Means就无法在单机上运行。
而两步聚类法则克服了以上缺点,可以包含类别变量和数值型变量,并且当硬件条件不足或数据集非常大时,都能顺利运行。
这种两步聚类法可以看成是改进版BIRCH聚类算法和层次聚类法的结合,先用BIRCH算法中的“聚类特征树”做预聚类,形成子类,然后把子类作为输入,做层次聚类。
1、两步聚类的原理:
第一步:预聚类过程:
构建聚类特征树(CFT),分成很多子类。
开始时,把某个观测量放在树的根节点处,它记录有该观测量的变量信息,然后根据指定的距离测度作为相似性依据,使每个后续观测量根据它与已有节点的相似性,放到最相似的节点中,如果没有找到某个相似性的节点,就为它形成一个新的节点。
在这一步当中,离群点将会被识别并剔除,不会像在K-Means当中那么容易地影响结果。
第二步:正式聚类:
将第一步完成的预聚类作为输入,对之使用分层聚类的方法进行再聚类(以对数似然函数作为距离的度量)。
每一个阶段,利用施瓦兹贝叶斯信息准则(BIC)评价现有分类是否适合现有数据,并在最后给出符合准则的分类方案。
2、 两步聚类的优点:
a、海量数据处理;
b、自动标准化数据;
c、能够处理分类变量和连续变量的混合数据;
d、可自动丢弃异常值或者将异常值归入最近的类。
e、可自动确定或者根据业务需要人工指定分类数目;
3、两步聚类的效果对比:
对第六点同样的数据进行两步聚类,得到模型最优结果如下:
用户分群两步聚类效果4、两步聚类结果解读:
聚类1:低端低龄群体
聚类2:学生或新入职场高活跃群体
聚类3:青年低活跃群体
聚类4:青年挂机群体
聚类5:职场办公群体
聚类6:高龄低活跃群体
用户分群两步聚类结果业务案例 – 通过K-Means聚类
业务案例 – 通过K-Means聚类,挖掘特殊行为模式的客户群
1、业务需求
在本案中,产品经理希望了解登录不活跃用户的行为模式,并且能针对不同的行为组合,对庞大的用户群体进行细分,从而关注不同群体的不同需求,甚至挖掘垂直领域需求,从而在产品或运营侧采取措施,拉活沉默用户,提高DAU。
2、分析目标
a、发现使用行为模式异于大盘典型用户的细分群体
b、粗估每个细分群体的用户数量
c、了解每个细分群体的行为特征和用户画像
d、基于上述结果,在拉活方面,提出产品或运营建议或明确进一步探索的方向
3、分析过程
a) 特征提取
分析聚焦于用户的点击行为。在本例中,考虑到用户行为的典型性,选取了4个完整的周,共28天的数据,并且时间窗当中无任何节日。
另外,考虑到计算性能和探索性分析需要反复迭代的场景,只从大盘当中随机抽取千分之一的用户作为代表。
b) 特征筛选
在特征提取阶段一共提取了接近200个功能点的点击数据。但是这些特征当中,有些覆盖面非常低,只有百分之一的用户在28天当中曾经使用,这些低覆盖的特征会首先被去除。
另外,前面谈到高度相关的变量也会干扰聚类过程,这里对所有特征对两两进行计算皮尔逊相关系数,对高相关特征(相关系数大于0.5)则只保留其中保留覆盖面最广的特征,以便最大限度地体现用户差异。
c) 特征改造-探索
经过上面两步后,笔者曾进行过多次聚类探索,但无一例外,聚类结果都呈现出一个超级大类搭配数十个非常小的小类(几个或十几个用户)。这样的结果,显然与我们的分析目标是想违背的。
其一,这里挖掘出的小群体体积太小,从业务角度来说没有价值;其二,超级大类基本等同与大盘用户,没有能找出其中的用户差异。
为什么会有这样的结果呢,主要是因为点击行为基本上遵循的是幂率分布,大量用户集中在低频次区间,而极少量用户却会有极高的频次,这样在典型的聚类算法中,高频次用户都会被聚集成人数极少的小类,而大量的低频词用户就会被聚集成一个超级大类。
点击行为分布点击行为数K-Means聚类示意图对于这种情况,典型的解决方法是对频次取对数,使幂率分布转化为近似的正态分布再进行聚类,在本次研究中,取自然对数后,聚类效果仅有少量改善,但仍然停留在一个超级大类加上若干人数极少的小类的情况。
背后原因,是点击行为数据的特点之一:核心功能和热门项目点击人数极多,而相对冷门的功能则有大量的0值。这样的情况下,取对数是没有改善的。
打开次数分布打开次数分布(自然对数变换)回到本次分析的目标当中,我们需要“发现使用行为模式异于大盘典型用户的细分群体”,如果丢弃这些冷门功能只看热门选项,则无法找出一些相对小众的行...
- ?
零一《从0开始,教你做数据分析》—04篇
章泽洋
展开
先回顾下,前面的内容。简单罗列一下。
1、店铺自检;2、选品;3、选词;4、设计详情页;5、设计首图;6、分析上下架时间
以上全部都是准备工作啊!我要很愉快地告诉大家,今天还是准备工作。
做标题!
原本并没有打算写标题的制作,因为觉得太简单,但很多朋友跟我反馈,说需要标题和直通车的知识,因此,今天就写写标题,时间点也刚好掐上。
前面第三件事情,我们做的是选词,选的是主打关键词,并不是做标题。因为这个时候,还不到做标题的时候。有了主打关键词之后,我们根据关键词的人群信息和产品本身来做详情页和首图。而做详情页和首图,本质上是在分析产品,而做标题的第一步,就是分析产品。第六件事情是分析上下架,上下架时间针对的是主打关键词,如果你把整个标题都去分析上下架,那分析出来的结果可能就是无处容身了,没点给你占了。
那么,我们开始!
淘宝搜索SEO上的【标题】,和【标题党】并没有半毛钱关系。淘宝上的【标题】是用来描述一个商品的,并且提供给消费者检索。
淘宝对标题的定义是:商品标题是直接与商品的【搜索】相关,商品标题中一般包含了一些商品【信息、属性、热搜词】等组成。
标题要将商品的特性展示出来,【且要与商品的基本属性对应】;但是如果热搜词过多,也会影响排序。一般情况下我们可以搜索同类卖家的商品,看看别人的商品标题是如何进行填写的,以此做为参考。
通过淘宝官方的这段文字可以知道,标题是提供给消费者搜索的,包含了商品的信息、属性和热搜词。
做标题的步骤,我有我的看点,可能跟其他大神的有些差异。
第一步:分析产品第二步:找关键词第三步:筛选关键词第五步:组合标题第六步:验证标题
首先,第一步,分析产品。对于经验丰富的运营,拿到产品的那一刻,标题也就基本成型了。对于新手,也能定个百分之七八十。因为商品会自己告诉你,他的信息和属性。(做详情页和主图的时候,也需要分析产品哦!)
举个栗子
这是一件羊毛衫。我们只是看图片的话,能得到一部分信息,我建议选好了款后最好是拍一件回来看看,如果喜欢的话自己穿或者送给闺蜜or老婆,如果不喜欢就完整地退回给卖家(7天无理由退换,买个运费险,等于自己出了个邮费)。这一步很重要,如果我们自己卖的产品,自己连摸都没摸过,那心里会没底。
拿到了实物,我们接下来的工作就很轻松了。看到实物,再结合我们之前看的数据,可以轻松判断是否要做这个产品。
我们来细看这件衣服,看存在什么信息。
羊毛衫,针织开衫,长款,长袖,单排扣,V领,韩版,直筒型,还有点蝙蝠衣的赶脚。
一个标题也就30个汉字,如果把这些信息组合起来,标题也就完成了80%左右了。
之前我自己写过词频分析的程序,对程序的分词原理有一定的了解。我发现每个词都有词性,也就是我们小学读书的时候,语文老师教的,名词、动词、形容词等。
一个标题基本就是由名词、动词、形容词、时间词和数词。而这里面,名词是最重要的。一般标题里面的名词就是品类词。
这个例子中,羊毛衫和针织开衫,就是名词。其他的都属于形容词,都是用来修饰名词。如,长款的针织开衫,V领的针织开衫等。每个关键词必须包含名词,这才符合用户的搜索习惯。
第二步:找关键词
分析完产品后,关键词也就找得差不多了,但是可能会存在一些热搜词,我们不知道。因此,勤快一点,找!
如果店里产品比较多,且类目不是太小,还可以建立关键词库(有个逼格的名字,叫海词法)。
下面,我们借助工具来建立一个词库。服装行业,属于大类目,可以建词库。
找词可以用三个工具(当然市面上还会有其他工具,我也写过相关的工具)。
1、老A搜词精灵/进阶版2、老A淘词精灵(需要开通淘词——数据魔方专业版或者订购半年以上的标准版)3、老A市场分析精灵
第一天的时候,有讲过搜词精灵,搜词精灵共有五种提取方式,我们只是用了其中一种。
通过这几种方式,我们可以很快的建立词库。
1、通过淘宝的下拉词、长尾词和相关词
下拉词和长尾词都是给懒人准备的,同时具有引导作用。特别是下拉词的点击率很高。
很古早的时候,这些词都是自己手动一个一个去复制,然后粘贴到自己的excel里面。现在早已经解放了双手。
下图我是用两层深度,挖掘出517个关键词。
别忘了手机无线,这个最好单独抓出来,不要和PC混在一起。
2、 通过TOP20W词库提取
这个词库是在直通车的关键词榜单,下载地址是:
http://taobao/go/act/sale/keyword-dictionary.php?spm=0.0.0.0.F38X0y
我们可以直接通过工具来获取,下图共获取了736个关键词。
3、 直通车提取
这个我相信只要开过直通车的都不会陌生。
我们在添加直通车关键词的时候会有下图这样的界面。
这个就是直通车的相关词查询。
我们也通过工具,一次性把数据提取出来。共394个词。
最终汇集起来,进行去重处理后,共有1528个词。
因为我们这件衣服并不是品牌商的货,所以我们把品牌词提出出来,把1528个词里面包含这些品牌词的删掉
过滤后,剩下1424个词。
然后再一步根据过滤一些我们不要的词。
过滤后剩余1390个词,然后开始查询数据(默认的数字都是近一周平均,人群数据是近半年数据)。基本可以挂机了。等明天睡醒词库就好了。
如果有数据魔方的淘词,用老A淘词精灵会非常方便,分分钟能有几千个词,但是淘词的数据和淘宝指数、直通车流量解析的数据不一样。
另外,我们还可以用老A市场分析精灵,我们爬抓人气排序的前三页。然后,对前三页的标题进行分词。
如上图所示,每个词根的出现次数和占比都有,人气排名下的前三页,也就是人气宝贝,这些宝贝标题的热门词根,其实可以直接拿这些词来做标题,但这种标题,不是谁都hold得住的,基本都是热词,竞争不小,要有实力才好玩。
总而言之,现在找关键词太简单了,也因为简单易学,SEO优化没有以前那么有效,但是,还是会有人做得好,有人做得不好,这里面学问还不少。有时候,没有个3、5年的经验,没有数据分析能力,很是吃亏。
第三步:筛选关键词
关于筛选关键词,很多大神都有自己的一套路子,每个人说的都对,都有道理,下面介绍我自己用的野路子。
数据用的是老A搜词精灵爬取到的,我们将数据表格导出,做进一步筛选。
算出竞争比,竞争比=搜索指数/宝贝数量。
算出竞争比加权系数,竞争比加权系数=竞争比/竞争比总和
最后算出关键词得分,关键词得分=成交指数*竞争比加权系数(想要流量优选搜索指数,想要订单优选成交指数)
好!至此准备工作完成。下面选择关键词。
筛选关键词遵循以下两个原则
1、 必须和宝贝相关
类目,属性,信息都必须相关,数据里面有人群信息,尽量多找几个人群匹配的词。如上图,我们看到高分词【2014秋装新款女装】,这个词叫热搜词,它好用吗?未必!虽然字面上的信息,是适合的。但我们要先用淘宝指数看一下,毛衣类目是否适用这个词。
很明显,不适合。
如果还不信,可以用老A市场分析精灵验证一下搜索结果。搜索这个词,综合排序下,前3页,出现的比例是2.99%,和淘宝指数的2.78%是如此地接近。这意味着什么?展现的机会少了,你要在这个点,权重排名前4,才能进入这个词的搜索前3页。第一页有1个毛衣类目的,做到权重第一才可以出现在首页,这,这,有多难呀?
2、 关键词得分高的优先选用(等同于必须要有人搜索有人购买)
这个不用多说了。但是,我发现了好多坑,一个不留神就会被误导,用了烂词。数据完全一致,就宝贝数不一样。差一点点我就中招了。下图64.05分这个词数据应该是在120W个宝贝数的战场产生的。
这不需要火眼金睛,看词的数据,很容易发现这类词,情况太普遍,太多人被坑过了。
以下是我初步挑出来的词。
根据之前分析产品的时候得到的产品特征词:【长款,长袖,单排扣,V领,韩版,直筒型,蝙蝠衣】来筛选出相关的关键词
2014毛衣女韩版新款羊毛衫毛针织衫针织衫外套毛针织衫开衫针织衫 女 开衫 中长款长款毛衣外套女开衫中长款毛衣长袖针织衫v领羊毛衫女韩版毛衣外套宽松女秋装毛衣女韩版新款蝙蝠毛衣开衫
第五步组合标题和第六步验证要合在一起讲,一边组合一遍验证,验证这个环节最麻烦
一个标题是60个字符,折合成文字是30个字(一个汉字两个字符),标点符号算一个字符。
先把找出来的关键词拆解成词根,词根的分法,也有好几种,我简单分两种就好了。
名词:品类词
毛衣,羊毛衫,毛针织衫,外套
形容词:属性词(描述和形容商品的词)
开衫,中长款,长袖,V领,韩版,宽松,秋装,新款,蝙蝠
简单把词根组合起来,假设主打关键词是【长款毛衣外套女开衫】,那这个词就不要拆开,保持紧密性,而且放在前面,如果有多于的字符,可以用空格和其他词隔开。
正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正(用正字,标记长度)
长款毛衣外套女开衫 新款中长款韩版毛针织衫 秋装V领宽松羊毛衫
29个字+两个空格,刚好60个字符。
验证标题是个粗重活。
主要验证两样东西
1、关键词顺序,买家搜索习惯验证。
关键词的顺序不同,结果可能不同。如,我在找词的时候就发现毛衣女装和女装毛衣,倒一下顺序,连搜索指数都不一样了。
宝贝数也不一样。
我们验证的渠道也就是淘宝指数和淘宝主搜(自己搜索看结果),可以对比搜索结果。
2、关键词紧密关联性验证。
紧密关联性也就是关键词不能拆分开,词根必须连在一起。很巧合,这个标题我验证过,没有需要紧密关联的情况。那我用另一个词来解释这个紧密关联性,【雪纺连衣裙】,词根是【雪纺】和【连衣裙】,通过淘宝主搜来验证。
我们发现搜索的结果页上,很多展现的宝贝,标题里面雪纺和连衣裙这两个词根是紧密接在一起的。这种情况,说明这两个词根需要紧密关联。在SEO里面,紧密关联是完全匹配,完全匹配的权重是相对要高一点的。
验证紧密关联性的渠道是淘宝主搜(搜索结果验证)。
PS:紧密性不可能做到面面俱到,只要主打关键词保持紧密关联,其他的词尽量就好了,不用强求。
说了这么多,不知道你懂了没有。做标题是整个环节中,是最简单又最复杂的一个环节。
可能有人会问,我直接抄别人的标题,行不行?
答案:行!
这是绝招,一招搞定。但是要看你的实力是否能承载这个标题了。有时候,我偷懒,也是先抄一个,然后再找出自己的主打关键词,在抄来的标题上修改一下,加上自己的主打关键词,如果自己还发现了其他好词,就再把好词【塞】进去这个抄来的标题里面。
初期的标题并不是决定因素,重要的是主打关键词。避免用词违规,不要用别人的品牌词,还有一些禁用的词,如淫秽词汇等。有不少朋友误用别人的品牌词,宝贝起来后就被淘宝删掉了(_`)
在宝贝上架后,会产生宝贝的关键词数据,通过关键词数据来指导操作,这个比初期的打造标题可能要更为重要一些。
- ?
零一《从0开始,教你做数据分析》—09篇
由伟泽
展开
大家好,我是零一。这一篇给大家介绍探索关系。
探索关系是非常好玩的一件事情。先给大家讲个故事。据说很久很久以前美国某个州对多个社区做了一项关于婴儿的调查,其中一个调查结果如下
调查人员发现多个社区中,这个妈妈纹身的占比越高,这个社区出现畸形儿的概率就越高。那调查人员就很费解了,纹身跟生BB有什么关系呢?后来针对这些纹身妈咪做了调查,结果如下
调查人员发现原来大部分的纹身妈咪因为出入夜店,大部分有接触过毒品,这才导致了前文说的畸形儿竟然跟纹身有关系。
以上就是探索关系的一个例子。
我们先引入一个概念【相关性】
【相关性】是来反应两个或多个维度之间的相关密切程度,如上面的例子中,关系就是比较紧密的。两者相关紧密并不等于因果,上面的例子也说明了,并不是因为纹身就导致了畸形儿,而是纹身的妈咪多数曾经是不良少女,染上毒品,才导致后面生出畸形儿。
【相关性】从影响的方向来区分,有3种,分别是正相关,零相关,负相关。下面我们一起看下。
首先是正相关,只要是呈现下图这种趋势的分布,就称之为正相关,表示任意一个维度增长,另一个就跟着增长,反之,下降就随之下降。
接着是零相关,只要是呈现下图这种趋势的分布,就称之为零相关。表示维度之间没有什么相关性。
最后是负相关,只要是呈现下图这种趋势的分布,就称之为负相关。表示任意一个维度增长,另一个就下降,反之,下降就随之增长。
下面我们一起看一下淘宝数据,淘宝数据也有很多有趣的关系。
我抓取下来眼镜行业按销量排名的100页,也就是40*100=4000个宝贝的数据。数据大概长这个样子
按30天成交量和价格来做散点图,得到如下的结果。
很惊奇发现,居然有个眼镜卖12.8W!!这是在卖眼睛吧??
大家回想第八篇的内容,这个店就是离群点,我们可以暂时不分析。我们通过设置坐标轴来进一步观察
售价我先指定在1000元以下,呈负相关的姿态,下图是结果
有人可能会说,这价格越高就销量越小,这个不用分析都知道了啊!事实上,还真有价格越高销量就越高这种行业,不看下怎么知道呢?我们要用数据说话!
可以观察到大多数高销量的价格是分布在100元以下的。(0,100]这个区间销量最高在5K(最上面那个离群点不计在内),(100,200]这个区间销量最高在3K左右。
接着我们可以进一步观察(100,200]这个区间的分布情况
这个是零相关的分布状态,也就是说,在这个区间,你是定价在100,还是定价在200,不会太影响你的销量。所以,有时候很奇怪,我100也是卖,200也是卖,为什么不卖200呢?
这个数据源我会提供给大家玩玩。30天成交量和价格的关系,我们就说到这里。下面我们看另一个关系。
【上架天数】 VS 【30天成交量】
这个让我差点跌破眼镜,上架了2000天,是什么概念?2000÷365=5(年)。上架了这么久的产品,还在卖!我接触淘宝才3-4个年头。
我们可以发现,销量在2000以上的爆款主要的聚集区间,在1200天以内,也要有3年的时间了。。。不过我们可以发现,后面的新品,多了很多,正在逐渐上来,不少商家正在尝试用新品来冲击这个市场。
我把坐标轴范围调整一下,结果看下图,看起来是零相关的样子。
2000销量以上的,最快的在一个月时间(37天)打造上来。这些是谁呢?那通过这个图,把鼠标停在点上面,会显示这个数据是第几个观测值,那会非常简单就能定位到这些宝贝。
这种观察方法,有个弊端,就是上面这个图,我只能说,我看起来像是零相关,并不能确定。那是否有一个具体一点的,可以不用靠眼镜的方法来告诉我们相关性呢?
答案是肯定的!
在Excel里面,有个函数叫correl,是英文correlation(相关)的前半部分。就是用来算相关性的,这个是适用于线性相关的情况下。非线性的情况下,就不适用了哦!比如类似抛物线的钟型分布(也就是正态分布)
只要选中我们要的数据就可以了,两个数据组。
得出的结果是一个[-1,1]的数字,这里是0.685,那这个数字怎么解读呢?
[0.7,1]表示强正相关
[0.3,0.7)表示中正相关
(-0.3,0.3)表示零相关
(-0.7,-0.3]表示中负相关
[-1,-0.7]表示强负相关
那我们这里的结果对应到就是中正相关这个区间。表示,评价量的多少还是会在一定程度上影响销量的。但这个结果没有分析意义,因为一般爆款卖得多评价也多。
分析师是要考虑分析的结果有没有价值,一般何为有价值的关系呢?
就是情理之中,但意料之外的这种关系,就非常有价值。
另外,是要选择看图还是数字呢?
这个问题很简单,先看图,如果不清晰,就看下数字。
如果要快速出结果,并且是多个维度的情况下,用excel内置的数据分析的相关系数来快速得出相关矩阵
结果是一个下三角矩阵
==========分割符==========
下面我们来用数据挖掘套件,探索下数据。
先把数据设置成表格的格式
然后再表格工具里面有个分析(必须要有安装了数据挖掘套件才能有这个)
我们先看下分析关键影响因素(我这里是用的市场数据,但如果大家是拿店铺的数据,大家都懂的)
运行后结果如下,会有一个相对影响,可以参考。但这个结果,没有先处理缺失值(上一篇有说过异常处理,处理方法看上一篇)
这个结果,没有太大的参考性。因为最相关的变成缺失值了,可能在获取数据的时候会有一些漏抓。
==========分隔符==========
下一篇会告诉大家怎么做聚类分析,通过聚类,我们可以知道,某一个分类的特征,下图是聚类的一个结果特征(软件通过算法把30成交量大于704的归为一类,以下是这类的主要特征)
主要特征是:无投诉,主营100%,天猫店,退款速度2.7-6.0等,大家可以看下。下一篇会跟大家详细介绍聚类。
文中用到的源数据集下载连接:https://pan.baidu/s/1yzGzZKiQq7zj18QLKx1ZIQ
- ?
零一《从0开始,教你做数据分析》—10篇
埋没
展开
大家好,我是零一。这一篇给大家介绍聚类/分类。
我们先讲一讲聚类。
上一篇的探索关系,很多朋友反映说非常有趣,这一篇,聚类分析也是相当有趣的。
聚类分析简称聚类,俗话说物以类聚,人以群分,聚类就是划分子类的过程。算法上面多用k-means和k-medoids,当然,大家可以跳过这些算法的过程,用程序来完成即可。
说简单一点,通过聚类,可以将我们的数据进行分类,并且描述每个类的特征。
聚类应用非常广泛,包括在电商领域的应用也是多不胜数。比如
(1)对客户数据进行聚类分析得到多个客户群组,并且得到各个群组的特征,这可以帮助我们发现客户的共性和差异性;
(2)竞争对手数据进行聚类分析得到多个对手群组和各自的特征,这一样可以让我们找到对手们的共性和差异性;
(3)对行业数据进行聚类分析得到多个行业群组和各自的特征,这个可以来发现不同行业之间的共性和差异性
(4)对销售数据进行聚类分析(比如以其中的地域聚类),可以告诉我们那些地域之间的共性和差异性
不难发现,我举的4个例子都是在发现共性和差异性。对的!我们了解了这些信息,可以指导我们的运营决策,对不同群组制定不同的策略。
下图是对地域数据做的聚类分析,得到的一个谱系图,我们从上往下看,首先是分成两大类
广东,天津,浙江,北京和上海这五个省市为一类,其余的多省为一类。
再往下看又分成了四大类,西藏作为单独一个分类,广东也作为单独的一个分类,天津和浙江为一类,北京和上海为一类。
从上往下,越分越细。红色的边框把多个省市划分成5个分类。一般没必要分得太细,这个数据目测是分成了20个细分的分类,除非是确实是需要细分到很细的时候,才需要看最低层的分类。
当我们知道天津和浙江聚为一类的时候,他们必然存在共性,才会聚在一起。当我们知道天津-浙江类和北京-上海类,作为两个不同的群组聚集,它们之间肯定是存在某种差异。
=======================================
下面,我们用上篇共享的数据,跟大家一起探讨聚类,和寻找他们的共性和差异性。
先处理下缺失值,选择清除数据里面的离群值
中间要选择需要处理的字段,选择好后,进入以下界面,也一样下一步即可
选择删除包含离群点的行(因为这里数据量不少,可以删了)
一般情况下,我们都避免直接修改源数据,需要新建一个变量或者空间或者工作表来存放处理过后的数据。这里选择复制到新的工作表就可以了。
数据处理好后,就可以进行聚类分析了。在数据挖掘套件里面直接选择聚类分析即可。
选择需要的数据进入模型里面
点击参数,然后就会看到下图这个对话框,可以手动输入数字来更改聚类算法,可以看到微软提供的聚类算法有4种,分别是可变的EM,固定的EM,可变的K-means跟固定K-means(EM是最大期望算法,K-means是K平均值算法,可变的是可以伸缩调整的,固定的就是固定不可调整的)
这里我输入4,选择固定的K-means算法
下图是选择测试集的比例,默认是30%。【测试集】是数据挖掘特有的名词,数据挖掘里头将数据集一分为二,大头的部分用来训练建立模型,称之为【训练集】,小的部分就用来测试模型,称之为【测试集】。这是数据挖掘和统计学最大的差异之一。统计学是通过统计方法来验证模型是否可靠,而数据挖掘技术是利用测试集来验证模型的可靠性。一般用于预测模型,聚类分析其实可以不用测试集,可以把数值改为0。但我就不改了。就用随机抽取出来的70%的数据来建立模型。
完成后,就会进入模型浏览界面,我们看到共有划分了7个,这有点儿多,我们可以在选择输入列的时候指定分类的数量,刚才我们是选了自动检测来着。
线粗代表两个分类之间的关系的强度,越粗关系越强。分类的颜色代表密度,颜色越是深蓝代表这个分类的数据个数越多。那非常明显,系统把大部分的数据归入分类1里头了。
下面是分类的剖面图,每个分类对应的指标范围在这里一览无遗。
简单解读一下上面这个分类情况
【分类1】包含2768个数据,最鲜明的是30天成交量偏大,价格偏低的这一个群组,是中低端爆款类
【分类2】只有246个数据,这个群组比较失败,发货分丶服务分丶好评率都偏低,销量偏低,价格偏高一点,典型就是卖货不卖服务类
【分类3】只有187个,集中在广东深圳,DSR很好,评价很好,价格很高,但退款率也很高,应该是高端市场的卖家,标准的价格高,服务好,但不知为何退款率也高,可能是买家收到了,觉得不划算吧,这一类是高端类,但产品或品牌的价值感可能没有做好。
【分类4】只有65个,也是DSR超好,价格中档,产品的价值完美体现,退款率不错,同样集中在广东深圳,是中档性价比类。
【分类5】只有61个,这个群组很惨,集中在浙江金华(估计是义乌),价格超低,DSR超烂,好评率很惨,是低端烂货类
【分类6】和【分类7】规模很小,就不解读了。以上解读仅供参考。一般分个4-5个群组就差不多了,如果数据量确实大,可以考虑分细一些。
每一个分类都可以单独提取出这个分类下的数据的。
下图是分类的一些特征,每个特征的概率情况
下图是分类间的差异性,通过对比可以发现,分类1多是天猫,非分类1的多是C店。
下面我着重看下分类3和分类4的区别,因为分类3败在退款率上面,而分类四就解决了这个问题。
我大致上看出来了,分类3的服务(DSR,退款速度)没有分类4的做得好,但分类4的价格又要比分类3低,并且包邮。那作为消费者,肯定选个价格中肯,服务又好的店家。而且分类4的销量还不低,有少部分是心店,我对心店的印象就是心店的服务一般要比大店的要好。
以上就是对这儿聚类分析结果的简单解读,具体的,亲们实操一下吧。
=============================================
下面说说分类。
聚类和分类,从语义来讲,看似很像,但有一点重要的差异。分类是指定了我们要分析的列(维度),然后通过决策树算法(默认方法是用贝叶斯分类器),来告诉我们,影响这个目标的维度有哪些。下面我们看下过程。
选择要分析的列,我这里选择的是30天销量,看下会影响销量的是什么因子。
下图是结果,告诉我们,收藏很重要!收藏跟销量有很强的关系。同样第一张图是决策树,一样有分组的作用。
决策树一般用来分析影响客户下单或者流失的因子有哪些。有兴趣的朋友可以自己倒腾一下。试下会有哪些意外的收获。
===========================================
下面,告诉大家测试集的使用方法。
选择准确性图表
选择模型,一般用于预测模型,刚才的决策树是属于预测模型,而聚类就不属于,因此聚类的模型不可用于准确性图表。
选择要预测的区间,我选择的是30天成交大于122的情况
我们之前保留的测试集,就在这里出现了,默认会选择测试集来验证准确性。
在上图点了完成后,就会得到这样的一个结果(部分截图),会有一个指标, “分类 30天成交”模型提升144.11%,这个数值越大代表模型的准确性越高。但我一般看下面的ROC图。
蓝色代表没有模型的结果,红色代表理想的结果。而绿色代表我们测试得到的结果。
绿色的线越接近红色的就代表越好,一般情况下,只要不要太接近蓝色的线(或者低于蓝色的线),就好了。如果接近蓝色的线或者在蓝色线下面,那就不如不用模型了,此时这个模型就没什么存在的意义,如果硬要用那就只是为了做模型玩玩而已了。
- ?
「零一」《从0开始,教你做数据分析》—01篇
霍曼安
展开
大家好,我是零一,今天开始给大家带来基础系列教程
本系列文章适合以下情况的读者:
1丶淘宝店铺运营或者店长,目前还不会做数据分析,渴望提升自己
2丶打算在淘宝开店的朋友,目前尚在混派代学习中
3丶其他对数据分析感兴趣的朋友,尚在入门阶段
本文是第一篇会比较基础,涉及的概念也少,旨在让读者动手了解工具。
我们直奔主题
数据分析的概念必须搞清楚。简单点说,数据分析是将数据进行清洗后,把隐藏在数据背后的信息提炼出来。
另外,值得一说的是,数据分析是获取新知识的新途径。
下面看一下菜鸟跟数据分析师的区别,引自《谁说菜鸟不会数据分析》一书
可以看出来,专业一点的数据玩家的思路会非常清晰,而且会以目的为导向,建议大家参考分析师的思路。
数据分析的过程已经有非常多的前人做出了总结,我还是引用书中的结果
分别是,明确分析目的和内容——数据收集——数据处理——数据分析——数据展现——报告撰写
做任何事情都要有目的,做数据分析也不例外,而且明确目的在数据分析里面上升到了一个非常重要的高度,甚至决定了你后面所做的一切有没有价值。
做数据分析必须运用工具,没有工具几乎无从开展,大家看下一般数据分析有哪些工具
可以看到,底层是数据库,在数据量大的情况下,需要动用到数据库。
报告层是Crystal Reports(动态和可操作的报表,没用过)
分析层是分析的工具,从左到右分别是Excel(Office套装里面的一员,据说可以和SAS媲美的数据工具之一),UCINET(社会网络关系分析,没用过),SAS(最古老最专业的数据分析工具),SPSS(IBM的工具,以简单易用闻名),clementine(已经被IBM收购属于SPSS系列)
最后是表现层,也就是做报告的一系列工具,我只接触过PPT和水晶易表,一般会用PPT就可以了。
接下来讲的数据分析,选择的是大家比较熟悉的Excel,Excel做深入分析的时候比较麻烦也有局限性,但就上手指数来说,Excel是排第一的。数据量在一百万条以内是足够的了。
我选用的版本是Excel 2010
第一步,我们要明确分析的目的和内容。因为是实例,我假设
目的:了解淘宝美容行业的市场情况
内容:1丶行业分析,2丶属性分析(采用折线图和饼图直观反映行业趋势和容量)
第二步,数据收集,一般手动收集,也可以用工具收集。
这里提供工具给大家做练习。提供的是仅支持美容大类的版本,运行环境,excel2010/2013,32位xp/WIN 7,假如没有生e经,那没关系,下面用到的数据源一样会共享给大家,拿着数据源就可以一步一步跟着操作。
数据来源:生e经(必须有开通生e经,并能查看相应行业数据)
数据宽度:21(月)
因为生e经按月展示数据,因此这里的数据宽度,就是月份数。
打开表格,然后,按下列图片次序操作
自己登陆生e经复制生e经的地址进来。登陆好,就把窗口关闭即可。其中c2代表服务器编号是2。
选择正确的服务器编号才能正常抓取。
选择好后,点开始抓取数据
耐心等待(等待时间和抓取的月份丶网速有关系),会在excel中出现结果,那么可以把这些数据复制到我们的另一个工作簿上,也可以导出为csv格式。
导出的文件可以保持在本地,方便下次提取。
第三步:数据处理,简单举例,可以跟着做。
做下简单的处理,这里提取年份使用这个公式:=LEFT(E2,4),提取月份使用这个公式:=RIGHT(E2,2),然后填充。如下图所示,鼠标移到单元格的右下角位置,会出现个黑色小方形,鼠标也会变成黑色的十字架,双击即可填充。
接着,我们插入数据透视表,鼠标点一下我们的数据,任意一个单元格都可以,只要在数据范围内,如图,我点在F10单元格。
点数据透视表,会自动匹配整个数据框。我们点确定即可。
点确定后,效果如下图所示
用鼠标,将字段拉到下面的相应位置即可
第四步:数据分析
我们现在就已经完成了数据透视表,通过这个透视表,就可以比较直观的对比各行业间的差异,但是都是数字,不免有些晕,或许用图表来展示会更加直观
点一下数据透视表,然后点插入——折线图,这里选择第一个样式即可(其他样式可以自己尝试)
结果如图所示
发现面膜/面膜粉的走势好像不错。
接着,我想看一下各行业的容量占比,重点看下面膜/面膜粉这个行业占比多少,就以2013年的数据来统计占比。还是插入数据透视表,先设置好字段,然后再选择2013.
接着,插入饼图
结果如图所示
这里看不到占比,而且也不知道哪个行业,这就需要我们设置一下图表。右击图表——添加数据标签
出现标签后,我们再右击一下标签,设置数据系列格式
按下图红框设置即可
然后改下标题,稍微把图表的尺寸拖大一点
这样,就比较直观了,面膜/面膜粉在2013年1-9月份中,销量占了整个美容护肤行业的16%。那么我想再仔细看看面膜/面膜粉行业的销量走势。依然先插入并设计数据透视表。
然后,插入折线图
结果如下图所示
两年的销量走势对比,可以看出2013年比2012年增长了不少。增长需要涉及到环比增长和同比增长两个概念,今天先不讲。我们通过目测就已经看出来,今年比去年火,但是这个结论还不是最终结论,只是简单建立在数据层面的初步结论,还要通过淘宝去验证,搞清楚销量的增长是来自哪里。假设是某几家品牌促销的结果,那么这个数据对于我们而言,意义就不一样了。或许我们自己是这个行业的一个品牌商,则需要把后面的分析重点转移到研究这几家品牌的营销研究上面来,弄清楚对手究竟如何改变了这个市场。
属性分析里面包含了SKU,操作方法跟上面类似,这里就不演示了。
第四步:数据展现
把我们以上得到的结果,进一步优化,更加直观丶有序地展现出来。
第五步:撰写报告(非商业严谨报告,以实用为主)
把所看到的,所想到的,通过文字的方式记录下来,方便自己或者他人阅读,了解我们的分析思路。
数据分析篇
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并