中企动力 > 商学院 > 教你做数据分析
  • ?

    「零一」《从0开始,教你做数据分析》—06篇

    堪夏彤

    展开

    HI~!我是零一,好久不见了。今天开始我们一起来学习数据分析的中阶课程。

    今天的内容主要是理清数据分析的主要思路和几个进阶的分析方法。

    数据分析一般的任务,有以下四种。

    1、预测

    2、异常检测

    3、探索关系

    4、聚类/分类

    以下4种场景对应的主要任务来帮助大家理解这4种任务。

    1、老板要求小白同学做一份市场分析——预测

    拿到市场分析的数据源,就要明确知道,分析市场的最主要的价值就在于“先知”,比竞争对手提前预知市场行情。因此接到市场分析的工作,不用迷茫,预测是它的价值所在。

    2、老板要求小白同学对店铺的日常数据进行监控——异常检测

    平时监控店铺的一切数据,如果一切正常,那就什么工作都没有。而主要的工作就来自异常情况,包括跟行业阈值对比,一旦低于行业阈值就被视为异常。

    3、老板要求小白同学分析一下订单数据或销售数据——探索关系

    探索关系的工作是最有趣的,因为你说不定会发现一些非常有趣的关系,比如什么因素是影响买家下单的主要因子。在excel应用中,最简单粗暴的方法就是用散点图来观察。

    4、老板要求小白同学分析一下会员数据——聚类

    相信很多朋友有过这样的苦恼,手里有客户数据,但是不知道如何效益最大化地利用。那么这里就涉及到对客户进行分类。通过分类可以知道哪些客户是有价值的,哪些客户是没有价值的。

    这四种任务,会分别在07、08、09、10篇中跟大家详细介绍。07篇估计很快就可以推送给大家。

    那么,今天我要给大家介绍一下多维分析,顾名思义就是维度很多的时候用的分析方法。这个方法非常简单,就是一张图表而已。

    下列几个场景来帮大家掌握多维分析。

    1、老板要求小白同学分析一下店里的几个客服的综合能力。

    将源数据处理一下,跨度不要太大,把询单人数、客单价和总业绩处理成占比即可

    直接用下面的这张图来展示3个客服的综合实力,一目了然。A客服目测是最优秀的,C是最差的。

    2、老板要求小白同学分析一下某个宝贝的搜索关键字。

    某宝贝的关键字数据如下,也是要将数据处理成占比形式

    效果如下图所示,毋庸置疑,“加厚”这个关键字是最好的,接着是2013和包邮(展现量为第一考虑要素,没有展现量,其他的维度数据再高也是白搭的)

    3、老板要求小白同学分析一下最近直通车新推的几个款中,哪个最适合加大投入推广打造爆款。

    假设3款宝贝,同时上的直通车,数据同样处理成百分比形式。

    操作步骤:

    Step1:选中数据,然后找到插入选项卡的其他图表

    Step2:找到雷达图,然后点击

    Step3:美化后如下图所示。

    裤子002是最有潜质的。我们看裤子001,花费太高了,但点击率不高,成交金额跟裤子002也接近。裤子002加大投入应该可以得到比较好的收益效果。

  • ?

    「零一」《从0开始,教你做数据分析》—02篇

    阎涵瑶

    展开

    大家好,我是零一。今天是第二篇,但不是接着第一篇的。

    这一篇是中间加进来的,主要送给淘宝小卖家和准卖家们。仅用两个工具,淘宝指数和阿里指数,官方工具,完全免费的。

    首先,我先说一下自己用excel等工具做的分析,跟使用这些现成数据平台的区别。

    1丶会用工具自己做分析,不单单局限在淘宝,这个时代什么行业都有数据,如果掌握了,你做什么都能应用到。用淘宝指数或者阿里指数只能局限在淘宝这一块。

    2丶用现成的数据平台,只要求能看懂数据,几乎不需要自己动手分析数据。可能100个人里面有10个人能看懂这些数据并应用这些数据,如果要自己动手分析,100人里面可能只有2-3个有这种能力。往往能自己分析的机会会比别人多一点点。

    我们回到主题,这一篇是送给小卖家或者准卖家,准卖家就是即将成为卖家的朋友。因为我们这个时候没有数据魔方,没有生e经,但是不用怕,依旧做得了分析。这个方法线下开店的朋友也可以参考的哦!

    大家要了解一个概念:【风险把控】

    其实无论什么时候,商业都需要控制风险,把商业活动的风险降到最低。但这4个字,特别对于小卖家或者准卖家而言,却异常重要,因为,我们经不起风险。犹如大海中的一叶孤舟,一个海浪打过来,就消失不见,这种案例我看得太多了。

    因此,要学会风险把控,把风险降到最低。

    那么,接下来,就跟我一起看数据吧。

    淘宝指数:shu.taobao(淘宝指数已经下线,集成在生意参谋专业版中)

    需要登陆,只要是淘宝账号就可以了,不管是买家还是卖家都可以使用。

    先进去排行榜。注意这里面的信息,比如统计时间,还有排名类型,下面是搜索排行

    【这里可以找到在暴增的关键词,关键词跟产品有关系,这个是一个入口。比如风衣,增长了约5倍,我们选择一个在增长中的产品,借助这个产品需求的增长,就相对容易做一些。】

    看到的东西都要去搜索验证一下,因为,我们必须排除人为刷起的市场,如果我误入这种市场,可能会蒙受损失。原来,【风衣】这个词是淘宝的扶植词。没什么问题。

    大家要注意,首先看到的是搜索排行,数据是对比上一周的涨幅。统计时间在右上角,这个要注意。

    如果勤快的话,可以定期来收集数据,把数据贴到excel表格里面。步骤我演示一下,先把数据选起来,然后右击复制

    到excel中,右击,选择性粘贴

    然后,就会看到结果,但是结果不是我们想要的格式。我们就在数据——分列把数据变换一下。

    这样就可以了。以下很多数据,勤快的朋友可以把数据拿下来。

    成交排行里面多了个热销指数,还有一个地域选择,根据自己的地域,可以优先选择一下。这里是品类排行,品类就是产品类别。

    最近7天,排名前三的品类分别是打底衫丶连衣裙和外套。

    这里是品牌排行,代销的朋友可以相对找个好一点的品牌来代理。但有时候是品牌选择你,而不是你选择品牌。所以,找相对好一点的就行。

    最后一个是行业排行。就是淘宝上面的类目排行。同样要注意这个统计时间。

    我随便找一个看看,就家居服套装吧。

    点一下,就可以跳转到这里,默认是搜索指数,但是我一般习惯搜索和成交两个指数一起来参考,可以看出一个行业的淡季和旺季,这个是必须了解的,不要傻到淡季杀入市场。。统计时间记得看,底下可以调统计时间段。

    这里看的出是有增长趋势的。但是要注意这个是针对搜索的。

    为什么要搜索和成交都参考呢?因为搜索代表了需求,但是可能还不到真正的需求点,可能是买家先在了解,时机到了就会成交。成交指数就不用多说了,针对买家人群多的地方,可以进行相应的促销策略,比如用到烂掉的包邮,思路大家自己拓展。

    性别和年龄很重要,跟我们选择产品丶做详情页都有很大的关系。特别服装类的,卖萌装跟成熟装人群明显不同,选择优质人群可能做起来会容易很多。可以看出,女性买家居多,35岁以上的,成交喜好度挺高(成交喜好度(TGI)= 搜索词成交的该人群占比 全网成交的该人群占比 100 ),占比也不小

    对于下面的星座,适合特别适用在年轻一族,有时候,打上星座幸运物/幸运款,转化率会异常高。

    可以看出摩羯丶处女丶射手丶天蝎丶白羊的占比比较多

    买家爱好在详情页上面可以利用。投其所好,提高转化率。比如,我们看到运动一族,那我可以在详情页上适当加入运动元素,或者送一些运动用品。

    不同的买家等级会有不同的特点,比如新手买家,他们可能不会看销量,不懂看评价,不懂DSR丶只要能展现在他面前,他感觉不错就下单了,甚至不会付款。我比较喜欢新手买家,只要我们能耐心教他付款购物,跟他真诚交流,非常容易发展成铁杆粉丝。一般而言,高等级的买家要精明很多,评价丶销量,甚至会看DSR。

    这里以新手和初级买家为主。

    柱形是这个词的消费基数,线型全网的消费基数。基本上都是中层消费等级居多。

    接着,我们看一下市场细分

    这里的类目分布,非常重要,关系到关键词的类目匹配度。这里毋庸置疑,搜索家居套装服的时候默认展现不会出现儿童内衣裤这个类目的宝贝。

    我们往下看,依旧要注意统计时间,和字段。这里有趋势,热销指数和均价。是相关品牌的情况。

    点一下展开可以看到相关的宝贝,这里的款式可以参考。

    下面,我使用人群筛选器,看一下我的目标人群的情况。不同的人群,在选款和定价策略上面会有差别。这里我根据前面看到的性别丶年龄和买家等级来筛选。这里会发现不同的人群喜好是不同的。

    这里是相关商品,系统根据产品的型号或者品类来区分。

    这里是相关属性,属性跟款式是直接挂钩的,也是细分市场的一个维度,所以要仔细看。淘宝可能会优先推荐人气属性的宝贝哦。

    【单看不想是没用的,很多朋友反映说看不懂这些数据,每个人从数据里面读取出来的信息是不同的,这点很难统一。如果我想做低价的,我看到这个均价,我就会知道,我定价要低于这个价格才会有优势。如果我想做中端或以上的,就要高于这个价格。大家不要轻信别人的结论,一定要结合自己的资源和想法来读懂这些数据。没有什么捷径,多练习即可。】

    接着,到阿里指数index.1688/,如果有线下开店的朋友,这个指数可是非常有帮助的哦!指数可通过工具爬取,在文章底部有链接。

    这里是行业大盘,选择相应的类目后就可以看到。可以看到这个行业8月底就开始活跃了。因为淘宝采购指数上升,后面没有填充颜色的部分是对未来的预测。那么,要做的得赶紧。。现在可能已经慢人家一步了。依然注意看统计时间。

    阿里指数连数据解读都给出来了。

    1.未来一个月,睡衣丶家居服丶睡袍丶浴袍行业在淘宝市场:市场需求小幅上升。

    2.建议采购商关注市场行情,保持备货。

    这个是相关行业,或许可以拓展发现某些商机。

    1.最近30天在睡衣丶家居服丶睡袍丶浴袍相关行业中,成人袜在淘宝的市场需求最大。

    2.预测未来一个月,保暖上衣丶套装市场需求有较大增长。预测结果仅供大家参考,建议采购商结合自身实际情况,在关注所选行业之外,可以重点关注保暖上衣丶套装。

    下面进一步看一下属性细分。这里统计的是30天数据。个人觉得这里非常强大,可以给卖家们参考,结合目标人群,选择符合市场的产品。这样可以大大降低风险。

    浅蓝色的条形图代表淘宝在架的宝贝数,宝贝数越多,竞争越大。相应的,宝贝数越少,竞争就越小。

    这里我注意到蝴蝶结,蝴蝶结应该是一个流行元素。

    下面看一下价格,阿里给出的解读是

    1.最近30天,所有面料的睡衣丶家居服丶睡袍丶浴袍,淘宝市场成交最多的商品价格带为>=78.1元,您的同行在1688市场采购最多的商品价格带为31.2~46.9元。

    2.建议采购商根据自身情况,控制采购成本。

    淘宝成交最多的是>=78.1元的产品,这个信息可以指导我们的定价。

    下面看下阿里排行,这个是产品排行榜,可以选择统计时间是7天或者30天,还可以选择交易或者流量维度,流量维度就是看的人多的产品。

    这个产业基地可以了解各行业各的产业分布哦。也是非常不错的!花不了多少时间,就可以知道各个地方有哪些产业,说不定你还可以发现自己所在的地方有不少优质产业。

    认认真真,仔仔细细研究个1-2天,相信对整个市场的理解会上一层楼。不管是线上店主还是线下店主,都能从中受益的。

    一直有人跟我说,看这些没用。其实有没有用真心是看自己,数据都是参考,几乎没有100%准确的数据。

    其实,一些分析的思路,适用于很多领域。只是现在这个工具只适合淘宝这块。任何的东西都需要自己去理解消化,不能生搬硬套。

    数据可以说是我们了解市场的唯一渠道,了解市场后才能做出相应的决策,但一定是结合我们自身来做决策的。(经验其实就是存放在大脑的数据哦)

    小卖家和准卖家们一定要记住,把控好风险。不要给一个波浪打过来就沉下去了哦!

    最后,零一把祝福送给大家!

  • ?

    零一《从0开始,教你做数据分析》—05篇

    酆傲南

    展开

    大家好,我是零一,今天开始继续给大家带来数据分析基础系列教程。

    上一篇中,我们提到波士顿矩阵,波士顿矩阵又称为增长-份额矩阵,它的优点是简单便捷,而缺点也是恰恰是它的优点,因为简单便捷,使得这个模型的解释度降低,它只是在市场营销中使用到的一种方法,作为参考,还要结合其他的方法,绝不能用它来作为决策的唯一指导。

    下面,我再具体介绍一下波士顿矩阵的几种模型。

    上一篇中我只是单独用了9月份的数据,那么,假设,我用多个月的数据,就会形成一个趋势。

    下面是成功轨迹,也是比较理想的成长路线。在高增长下,市场占有率逐渐上升,最终落入金牛区。有这种轨迹的,那么恭喜你,发财了记得请零一吃饭!

    (关于交点,可以选择中点或者自己根据自己市场的情况来制定。不过一般选品,是择优,选择中点即可)

    (竖轴是增长率,横轴是相对市场份额)

    下面是现金支持趋势,可能是较早切入市场,占领了较高的市场份额,但却没有足够资金和营销策略的支持,可能就会面临失败的危险,一旦有这种趋势就要引起警惕。审视一下自己的产品定位有没有偏差丶营销节奏有没有把控好等问题

    下面是灾难轨迹,两条路线,一条是从明星——问题——瘦狗,另一条是从金牛——瘦狗。这两个轨迹就是一个产品,一个市场逐渐萎缩死亡的过程。这条路,说多了都是惭愧的泪啊!

    这个矩阵是根据最终的数据结果来分析的,那么我们不能脱离商业理解,如果增长降低了,市场份额也降低了,除了竞争加大之外,是否还有其他深层次的原因呢?

    其实,我们更多的是要思考消费者是否认同我们的产品和服务?我们的产品是否能吸引消费者?站在买家的角度来思考市场变化。

    说到市场,一般从两个方面来细分市场,一个是基于需求的市场细分,一个是基于行为的市场细分。

    基于需求的市场细分,主要是指消费者的需要丶欲望。思考得更多的是同样的行业,我们要去满足消费者的哪种心理需求。

    基于行为的市场细分更多地关注于消费者可能会购买的某种行为,这句话,我说得挺拗口。其实很简单,就是消费者会倾向于购买什么产品。比如,苹果5s上市了,相应地买了苹果5s的消费者,就可能会产生对苹果5s配件的需求,需求就会转化为购买力。

    这两种方法,没有说哪一种更好,都可以去尝试,在数据分析的角度讲,是分析的方法和模型不同。撇开数据,那么这两种方法就是一种思路。

    基于需求的要站在买家的角度,心理需求来思考,从而细分市场,发现市场。

    基于行为的则根据市场产品结构丶消费行为来细分。

    那问题来了,有朋友会想,之前零一教的不是没用了吗?

    其实不会没用,之前都是在看容量,看趋势,是在看市场的全貌,而细分就像是在看市场的内部结构。大家好弄清楚它们之间的关系。

    下面继续教大家做数据分析,这是初阶的最后一篇了,要为后续的中阶和高阶打基础,理论会稍微多一点,后面不会花篇幅来解释这些。

    今天给大家介绍下描述性统计。描述性统计,就是在描述数据。

    比如之前介绍给大家的,极差丶波动系数就是在描述数据的离散程度,所谓离散程度,大家看下图,数据是离散的。

    再看下面的图,目测在(50,50)附近有很多个点,通过目测就看得出来下面这个数据的离散程度没有上图的高。这个现象用什么来描述,解释呢?就是用我们之前说过的波动系数,就能把这两张图的波动程度给描述出来。

    除了离散程度之外,一组数据基本的有:最小值,1/4位数,中位数,3/4位数,最大值,这就是所谓的五数总括。

    最小值很简单了,直接在excel里面敲入=min(),就能算最小值。有时候我们需要找出我们最低的销量是多少件,最低的转化率是多少?

    最大值也是一样的道理,在excel里面是=max(),就能算出最大值。

    这个在第二篇有跟大家简单介绍过的了,就不截图了。

    接着是1/4位数丶中位数和3/4位数。如果没有接触过统计学的朋友会比较晕,不知道这个是什么来的。这三个数将数据切成4个等分的小数据集。

    大家看下面的数列

    1,50,10,100,2

    最小值是1,最大值是100,1/4位数是2,中位数是10,3/4位数是50。

    下面我们再看个例子,假如是12个月的销量数据

    1,2,3,4,5,6,7,8,9,10,11,12

    最小值是1,最大值是12,1/4位数是3.75,中位数是6.5,3/4位数是9.25

    而我们用得最多的是均值6.5,这里刚好跟中位数一样。

    但是,我们再看下面另一组数据

    1,2,3,4,5,6,7,8,9,10,11,100

    最小值是1,最大值是100,1/4位数是3.75,中位数是6.5,3/4位数是9.25

    除了最大值不一样,其他跟前面是一样的。我们看下均值,这里的均值是13.83,跟前面的不同了,这个100这么大的值可能是活动的效果,那这个时候,如果我拿均值来作为指标衡量前面12个月的销量,就只有最后一个数据达标。当数据整体平稳,但前后有很大的异常值的时候,我们用均值来做指标参考就不靠谱了,这种情况更适合的是用中位数来作为指标。

    用散点图可以非常直观地发现离散值。将我们上面的一组数据画出散点图,如下图就会发现一个异常值。

    在excel里面,用=QUARTILE(),就可以得到这5个数。

    另一个指标,众数。

    大家看下面这个数列,假如是客服的业绩

    1,3,5,5,5,5,5,5,5,5,10,20

    我们先算一下平均值,是6.167,如果用这个指标,这里12个数据里面,只有10和20这两个人达标。那么,这个时候,就要用众数了。所谓众数,就是出现的最多的一个数字,毋庸置疑,这里的众数是5,那么,就会有10个人达标了。

    众数在excel里面是=mode()

    非常简单就能算出来,特别是数据量大的时候,不用目测。

    以上的指标是根据数据的分布情况来选用的,一般用散点图看一下,然后就能判断要使用哪个指标来作为参考。

    前面说到了异常值,异常值的处理方法有很多,那么,简单的方法,就是把异常值删掉。比如前面的,(1:11,100)这个数列,就可以把100从这个数列里面移走。或者,也可以用均值填充。比如,之前算出来均值是13.83,就可以用这个指来替代变成(1:11,13.83)。

    不是什么时候都要处理异常值,只有在异常值严重影响我们判断的时候,就要对它进行处理。

    好了,今天的内容就这么多了。最近比较忙,写文章会慢一些,大家不要催哦!最后再啰嗦几句,做数据分析的态度是务实,不要太浮躁,不要太自私,一切用数据说话,这是做数据分析师的基本态度。

  • ?

    零一《从0开始,教你做数据分析》—03篇

    白云端

    展开

    大家好,我是零一。今天接着第一篇的内容,我们继续利用excel2010来做数据分析。

    这系列文章,是从0开始的,可能读者的基础并不是太好,我是这么安排的,先学会基本的操作,会操作了后,再回过来学一些分析思路和方法。自己做过之后,再学心法,可能会有更大的收获。

    说回主题,上一篇中,我们看出了走势图,也看到了占比图。这两个必须同时看,才能清楚的,因为你单看走势图,是看不出占比的。单看占比图也会看不粗走势。因此,这两个图,是结合一起,才能读出相对完整的信息。

    根据我们的目的,了解淘宝美容护肤行业的市场情况

    我们已经拿到了走势和占比两个信息,那么接着还能了解些什么呢?

    可能每个人的问题都不一样,我引出一个问题,每个子行业的竞争程度怎么样呢?

    那么,我们就要思考,这个问题要转化成什么维度呢?我们手里的数据能否来回答这个问题呢?

    我们先观察看一下源数据(源数据下载地址在01篇的底部)

    成交量,统计的是成交的件数。

    销售额,统计的是成交的件数+一口价,这里误差太大,不分析这个数据。

    高质宝贝数,统计的是有一定销量的宝贝数。

    其他维度,跟我们的问题关系不大,这里排除了销售额,那么,就剩下成交量和高质宝贝数。

    成交量/高质宝贝数

    就会得到平均一个高质宝贝数分配到的成交量。这个指标,有人称之为分配量,有人称之为平均占有率,也有人称之为均量。那么,我下面将这个指标命名为均量。

    第一步,插入数据透视表

    第二步,设置字段

    然后,增加一个计算字段,在数据透视表工具——选项——域丶项目和集——计算字段

    公式如下图所示

    确定后,会自动添加,大家可以核对一下字段设置

    然后,我们看到数据透视表,但是面对这个表格,零一点情绪都木有。

    看到表格,而且密密麻麻的这种,脑袋就要开始想【数据展现】。用什么方式来展现这些数据?

    这里解释一下,【时间序列】简单理解就是以时间为展现维度的数据,那么这里刚好就是以时间作为维度。那么,我们看到是垂直柱和线图。那就用这两种结合,来做展现。

    结果如下,天哪!巨坑!这,,,这要比表格还要难看。

    这里一团糟,是因为维度太多了,维度太多了,就要思考【降维】,减少这个图表里面的维度即可。

    下面仔细看,有个倒三角。

    点下倒三角,跟我下图一样,筛选一下即可。

    结果如下。认真看,想想为什么最底下有条水平线?

    最底下那条就是均量了。因为数值太小,所以,好端端的一条曲线就变成了水平线。鼠标点一下。

    最下面的直线就会被选中,右击一下,在弹出来的菜单选择,设置数据系列格式。

    然后,选择次坐标轴,点右下角的关闭

    这就看得清楚了,蓝色是成交量,对应左边的纵坐标轴。红色的是均量,对应的是右边的纵坐标轴。

    发现9月到年前是行业旺季哦!今年的均量在飙升的感觉。均量越高,代表每个宝贝分配到的成交量就越多。

    那么,问题来了,均量高是好事情吗?

    答案是未必,首先要去淘宝搜索判断,目测销量第一页的分布情况,就可以知道。如果要用指标,可以用【极差】来判断。这里其实目测就好了。如果销量都在两三个宝贝,那么,这个事儿对于你来讲就不好了。

    再接着,如果发现分布相对均匀,那么是好事吗?

    还是未必,答案完全看你自己了,如果是小卖家,那是好事儿啊,竞争不会太大,大家都有机会得到成交的机会。

    但是,如果你是有实力的卖家,这就不是件好事儿,蛋糕要大家分呀!这可是蛋疼的事儿。

    好了,解释就到这里。我们继续。开始说了要用两种图来展现。现在只完成了第一步。接着,我们在这个表里面加入柱形。

    点一下红色线性,右击,在菜单中选择更改系列图表类型

    按确定自己看结果吧

    这里又出现个问题了。这里只能看一个行业啊!能不能看所有的行业,或者每个行业都单独看一下?

    答案,是都可以!我们先实现变着行业来看。

    插入切片器,如果找不到地方的,版本不同,自己找。或者就是图表没有在活动状态。

    选好后,按确定,就可以看到切片器,自己点点看看吧。。

    那么,接着,将均量全部拿出来看趋势。重新插入个数据透视表。过程自己思考。不演示了。相信消化了第一篇的童鞋都能自己做的了。

    好,到这里来,基本看得差不多了。但是还有,我还没有说完哦。

    因为考虑到进程问题,这一篇内容要稍微多一些。

    上面均量的走势,我们看得出来,胸部护理的均值最高,但是越下面的各个子行业错综复杂,我们怎么客观地来判断呢?

    这里教大家两个指标【波动系数】和【极差】,这个后面的文章可能要用到,以后讲到,就不解释了!对他们的数学/统计意义感兴趣的童鞋自己百度吧,波动系数,统计学里面叫变异系数。

    统计学意义我就不说了,我先介绍一下,这两个指标,不是什么时候都要用,就是用肉眼,看不出来,拿不准的时候,希望更加科学地来判断,就需要动用他们了。

    【波动系数】=【标准差】/【平均值】

    【极差】=【最大值】-【最小值】

    我从数据透视表复制出部分数据,如下。相信消化了第一篇的童鞋都能自己做的了。

    先算下【标准差】excel里面函数是:STDEV.S

    【极差】公式

    【均值】大家都知道的,但是还是贴出来吧。

    最后,自己算下波动系数哦!

    那么,我算出来T区护理的波动系数是0.43,唇部护理是0.39。极差在上面看得到。这个怎么应用呢?

    要记住这个应用的前提,肉眼看不出来,不明显,错综复杂的走势。那么,就用他了,如果摆在你面前的能用肉眼一眼看穿的,请绕道。

    如果是小卖家,选择波动系数越大的,可能就越好。因为市场波动大,机会就大,前提一样要先验证一下是否是个别商家人为操作起来的市场。

    如果是中级卖家,具体也要看,如果资源好,建议选择波动系数小的,因为这个市场做起来后,就相对稳定,平时不用太操心呗,控制好供应链,其他就没什么大事儿了。

    【极差】作为辅助的维度,不一定要,但是他跟【波动系数】一起看得更全面。

    【波动系数】有个优点也是缺点跟数据本身的大小没关系的。百万级别的源数据跟百位级的源数据,算出来的波动系数可能是一样的,从优点来讲,他可以跨维度,跨数据级对比。从缺点来讲,就是看不全,就可能出现不同级别的数据之间,他们的波动系数相等。

  • ?

    手把手教你做内容营销的数据分析

    蔡自中

    展开

    最近一直在为写什么内容的文章而头疼,不想写自然搜索和直通车的内容,虽然我知道这是大家最喜欢看的内容,但是我从13年开始写文章,到现在差不多五年的时间 写自然搜索和直通车的内容实在太多,继续写也无异于新瓶装旧酒,所以想写一写那些自己从来没写过的东西。

    上一篇我写了关于如何去做淘宝头条,有好货,必买清单的文章,在文章最后的时候我还说了需要做好内容营销的数据分析,但是因为这个时候文章写的有点长了,我就没有写具体内容了,结果很多商家反馈让我写写如何去做这方面的数据分析的思路。既然大家都有这方面的需求,那今天我们就一起来聊聊这个话题。

    生意参谋是一个非常强大的工具,我们做数据分析的时候想要的数据基本都可以在生意参谋找到,内容营销这一块的也一样,在生意参谋有一个“业务专区”的版块,这里面的数据就是专门针对内容营销数据的。

    在内容分析里面一共有八个子版块,今天我们重点分析前面六个版块。

    1.整体概况

    这里可以看到你最近30天内每一天内容营销的情况,主要是相关内容数的情况和引导进店的情况。

    这里主要要掌握这么几个概念,本店相关内容数和内容引导本店商品数。

    本店相关内容数是指当天发布的内容中,包含本店商品的内容数量(仅包含新增的内容)简单的来说,就是你能通过这个指标知道当天发布的内容中有多少达人是在推荐你家的宝贝的。

    内容引导本店商品数是指有多少个宝贝让达人在推荐。

    从这两个指标你可以判定的是你店铺是否受到达人的喜欢,以及他们喜欢你店铺的程度,例如,如果你的相关内容数数据很大,但是内容引导商品数只有那么两三个,那说明的是,你只不过是少数一两个款式受到了达人的喜欢,可能是因为你在V任务花钱找的达人在推荐这些款,也可能是其他达人之推荐你这个销量高的爆款,只有你这个爆款受到了达人的认可和符合达人的条件。

    如果碰到这种情况,第一个我们要了解的是哪一个宝贝受到了达人在内容中推荐,推荐的渠道是哪一些,推荐的达人主要是哪一些。这些数据你可以在商品top排行榜,渠道top排行榜,达人top排行榜里面都可以看到数据。

    如果你发现有一个款长期受到了达人的某一个渠道的推荐的话,那么你就可以去总结这个款为什么能受到达人的推荐,而其它款人家为什么不给你推荐。首先可以肯定是你这个款是符合推荐要求的,你就要去总结这些要求,例如,你发现某一个款长期受到达人的推荐,正好这个款有了白底图,而其他款没有受到推荐的都没有白底图,那么你就要考虑去把其他的图也把第五张图片设置为白底图。

    在引导情况里面数据对我们帮助很大,通过这个数据我们能知道帮我们推荐的达人是否与我们的店铺定位一致,他们的粉丝群体是否符合我们的店铺要求。

    例如,在前面我们已经知道了本店相关内容数,也就是说,知道了受多少人在帮我们推荐,但是如果这里引导进店次数很少的话,说明是要么没有厉害的达人在我们推荐,要么就是推荐的达人和我们的店铺人群不一致,有没有厉害的达人在推,这个很简单,你直接进入到达人top排行榜里面去找到这个达人的主页,然后看他的人气,看他文章的浏览量,如果发现流量低低,那说明是达人人气不行,但是如果浏览量非常高,但是引导进店次数很低的话,那说明的是达人人群和你的不搭配。

    2.单条分析

    单条分析非常给力,可以看到你每条数据的详细分析,特别是当你相关内容数比较多的时候,这一个功能非常强大,他可知道你是哪一个内容引导的流量最高,互动次数最好,加购,收藏最好

    你可以扫码那个二维码进去看到你对应内容,你能清楚的知道达人是在帮你如何推荐的。从这个数据你完全是可以知道达人的质量的,特别是那些你花钱找的达人的话,就一定要去这里分析数据,否则你根本都不知道别人有没有给你带来你想要的价值,很多人从来都没有去这里看,所以他根本都不知道他花的这个钱到底值不值得。有了这些数据的话,你也就知道下次要不要继续和这个达人合作了,那些表现好的达人我们就要想办法去和他经常保持联系,经常合作,不好的达人就可以淘汰了。

    3.商品分析

    商品分析也很重要,他可以告诉你那个商品在内容营销上做到好,如何是花钱和达人合作的话,一般来说我们肯定是要拿最好的商品去合作,因为这样我们的效益最大,当然,不同目的的时候方法不一样,学会灵活变动。

    要重点分析阅读人数和进店人数,加购人数之间的关系,如果阅读人数高但是进店人数收藏加购人数低的你要去分析是你产品的问题还是达人人群的问题,例如,某个达人本身是很给力的,他给你推荐了一个文章,阅读次数非常高,但是就是进店人数很低,而且他的人群也和你的宝贝是一致的,那么可能就是你的产品不行了,可能款式没选好,图片没拍好,价格不合适等等,这种情况效果不好的话你就不能去怪达人了,只能怪你自己

    同时最重要的一点是要学会总结,就是为什么这个商品在内容营销方面表现好,那一个商品为什么在内容营销方面表现的差,他们的原因是什么,然后总结这个经验,下次的时候扬长避短,这就是复盘的重要性了。

    4.渠道分析

    渠道分析是按照内容的渠道进行数据分析。从这里你可以清楚的知道哪些渠道你表现的好,哪些渠道你表现的差,表现好的渠道,表现好的渠道是哪位达人在给你推荐,他推荐的方式什么样的,这些你都可以清楚的在这里面了解到具体清楚。

    5.合作达人

    很多人总是和我说,哎,我没达人资源,我找不到好的达人,有时候听到这些话我真想骂人,这里的达人不是旺旺联系方式都告诉你了吗?上一篇文章我就告诉你们如何去找到这个人了,最关键的是,因为他之前给你做过推广,你有数据了解到了这个人是不是符合你的要求,他的能力怎么样,这些都是有数据可查了,这样你也不会让坑,对于那些比较好的达人,你完全可以主动的去联系他,给他一个高佣金,因为他已经给你推广了,你完全可以说,我是某某店的负责人,看到您正在帮我们推广产品,为了答谢达人们的支持,我们特意为长期的达人开通了高佣金计划,然后把高佣金链接给他,告诉他让他联系微信或者旺旺通过验证。长期积累下去你还怕没这个资源吗?很多人就是太懒,总是想着别人一下把他所有的资源都给自己,其实,不是自己积累的,就算给你了又有什么用呢,例如很多人总是找我要达人资源,其实我真的就算给你对你有用吗?人家会给你推荐吗?

    6.读者画像

    读者画像我就不详细讲了,从这里你可以知道你内容营销的读者是什么群体,是否和你店铺的人群一致,然后针对性的运营就可以了。这个和其他人群画像分析是一致的。

    7.v任务分析

    如果你经常做v任务分析的话,这个功能对你的帮助就很大了,你可以看到你的v任务的具体数据,不过个人认为,生意参谋在这方面做的还不过详细,很多重要信息么有在这里面展示出来。

  • ?

    零一《从0开始,教你做数据分析》—07篇下

    半兰

    展开

    HI~!我是零一,我们现在继续讲预测。

    上篇跟大家介绍了数据挖掘的做法,微信的朋友就有人问了,那如果我不会用数据挖掘的算法就不能预测了吗?

    答案是肯定可以的,不用数据挖掘的算法也一样可以通过数据来做预测。

    既然是预测,伙伴们也不用纠结说预测得不准,能有个八成的准头就已经不错了。包括现在很多著名的数据挖掘案例,准头可能都没有个八成,不过因为是建立在大数据的基础上做的挖掘,有时候有个五成都能创造出价值了。

    如果不用数据挖掘的算法,最高境界当属神奇的第六感了,这种我也无能为力。我只能讲我力所能及的通过数据来预测。

    比如预测销量、预测销售额等,我们可以直接用简单的环比增幅或者同比增幅来计算。

    我们利用环比和同比增幅的公式,就可以推算出下列公式。(环/同比之前在初阶的文章中跟大家介绍过了)

    =============================本期数=上期数*(1+环比增幅)

    本期数=同期数*(1+同比增幅)

    =============================

    用环比还是同比,其实都可以,但我们还要考虑趋势的问题,环比、同比表达的就是趋势。

    我们看下图,今年的趋势跟去年的趋势基本是一样的,那么,我们用环比或者同比都是可以,而且预测的效果也比较靠谱了。

    如果今年跟去年的趋势不同,就结合环比和同比都计算出来预估值,然后求两者的平均值即可。

    下面两个场景帮大家理解。

    1、老板让小白同学预测一下行业未来3个月(1季度)的销量。

    首先拉出行业数据2012年1月到2013年7月,要预测2013年8、9、10三个月份的销量。先计算出环比和同比,同时把销量做出趋势图

    然后把环比增幅也做出折线图,可以发现2012年和2013年的趋势是差不多的,因为2012年春节是1月份,也就是从2月份开始恢复正常销售,而2013年春节是2月份,也就是从3月份恢复正常销售。总体来讲,趋势是差不多的。

    我们先假设两年的环比增幅趋势一致,于是可以用2012年8、9、10三个月的环比数据来作为预估。

    将2012年8-10月份的环比数据代入2013年8-10月份,公式就用

    本期数=上期数*(1+环比增幅)

    先根据7月份的数据算出8月的销量,再根据8月算出9月,以此类推。

    年月前面加个字母e,代表预测的意思。

    算出来后如下图,我们可以发现,代用去年的环比增幅预测出来的销量的同比增幅跟7月份是一样的。也说用这种方法的特点,就是假设同比增幅相同。其实和我上面说的假设两年的环比增幅趋势一致是一样的。

    我们可以做出折线图,蓝色背景部分就是预测的销量了。小白同学完成任务。呵呵!

    2、老板让小白同学做一份未来3个月(1季度)店铺的销售计划,里面要预估一下未来3个月的销售额。

    源数据如下,假设这个店就做了7个月的时间,从2013年1月份开始运营。

    这种情况,方法其实很多。但准确率是让人非常头疼的,因为还涉及到供应链、市场环境、店铺运营规划等问题。

    我就介绍一种比较靠谱的思路。

    第一步,与老板、市场负责人等熟悉本行业的相关人员协商,设定(最高或者最低)增幅基数,就假设最高10%/月,最低不低于2%的增幅发展。(也可以直接引用预估的行业增幅,不过可能会让运营人员鸭梨山大)

    第二步,回到第一个任务,预测下行业的趋势,我们直接引用上面的结果

    下图可以看到9月增长,8月和10月都有下降趋势。

    因此,可以认为借着9月行业的增长,店铺也可以达到设定的最高增幅。8月行业持续下降,可以适当调低我们的增幅阈值。预计的结果如下

    同样做出折线图,持续增长是个理想化的东西,只要行业波动不要太大,店铺的动作不要太大(如果某个月连续上聚划算会导致当月增长,过后可能会迎来一段持续下滑的时段),持续增长不是什么大问题。

    最终在验收成果的时候,也是要结合实际的市场动态,如果市场增长的情况下,我方反而下滑,就不正常了。如果市场以100%的增幅快速增长,而我方仍然以10%的增幅蜗牛式增长,这也是有问题的。

    或许,在本店资源供应正常的情况下,行业趋势就是运营的阅卷官吧!

    不知不觉又到凌晨2点了,要培养一名数据分析师不是一件容易的事情,大家加油跟上吧。

  • ?

    零一《从0开始,教你做数据分析》—04篇

    孔智宸

    展开

    先回顾下,前面的内容。简单罗列一下。

    1、店铺自检;2、选品;3、选词;4、设计详情页;5、设计首图;6、分析上下架时间

    以上全部都是准备工作啊!我要很愉快地告诉大家,今天还是准备工作。

    做标题!

    原本并没有打算写标题的制作,因为觉得太简单,但很多朋友跟我反馈,说需要标题和直通车的知识,因此,今天就写写标题,时间点也刚好掐上。

    前面第三件事情,我们做的是选词,选的是主打关键词,并不是做标题。因为这个时候,还不到做标题的时候。有了主打关键词之后,我们根据关键词的人群信息和产品本身来做详情页和首图。而做详情页和首图,本质上是在分析产品,而做标题的第一步,就是分析产品。第六件事情是分析上下架,上下架时间针对的是主打关键词,如果你把整个标题都去分析上下架,那分析出来的结果可能就是无处容身了,没点给你占了。

    那么,我们开始!

    淘宝搜索SEO上的【标题】,和【标题党】并没有半毛钱关系。淘宝上的【标题】是用来描述一个商品的,并且提供给消费者检索。

    淘宝对标题的定义是:商品标题是直接与商品的【搜索】相关,商品标题中一般包含了一些商品【信息、属性、热搜词】等组成。

    标题要将商品的特性展示出来,【且要与商品的基本属性对应】;但是如果热搜词过多,也会影响排序。一般情况下我们可以搜索同类卖家的商品,看看别人的商品标题是如何进行填写的,以此做为参考。

    通过淘宝官方的这段文字可以知道,标题是提供给消费者搜索的,包含了商品的信息、属性和热搜词。

    做标题的步骤,我有我的看点,可能跟其他大神的有些差异。

    第一步:分析产品第二步:找关键词第三步:筛选关键词第五步:组合标题第六步:验证标题

    首先,第一步,分析产品。对于经验丰富的运营,拿到产品的那一刻,标题也就基本成型了。对于新手,也能定个百分之七八十。因为商品会自己告诉你,他的信息和属性。(做详情页和主图的时候,也需要分析产品哦!)

    举个栗子

    这是一件羊毛衫。我们只是看图片的话,能得到一部分信息,我建议选好了款后最好是拍一件回来看看,如果喜欢的话自己穿或者送给闺蜜or老婆,如果不喜欢就完整地退回给卖家(7天无理由退换,买个运费险,等于自己出了个邮费)。这一步很重要,如果我们自己卖的产品,自己连摸都没摸过,那心里会没底。

    拿到了实物,我们接下来的工作就很轻松了。看到实物,再结合我们之前看的数据,可以轻松判断是否要做这个产品。

    我们来细看这件衣服,看存在什么信息。

    羊毛衫,针织开衫,长款,长袖,单排扣,V领,韩版,直筒型,还有点蝙蝠衣的赶脚。

    一个标题也就30个汉字,如果把这些信息组合起来,标题也就完成了80%左右了。

    之前我自己写过词频分析的程序,对程序的分词原理有一定的了解。我发现每个词都有词性,也就是我们小学读书的时候,语文老师教的,名词、动词、形容词等。

    一个标题基本就是由名词、动词、形容词、时间词和数词。而这里面,名词是最重要的。一般标题里面的名词就是品类词。

    这个例子中,羊毛衫和针织开衫,就是名词。其他的都属于形容词,都是用来修饰名词。如,长款的针织开衫,V领的针织开衫等。每个关键词必须包含名词,这才符合用户的搜索习惯。

    第二步:找关键词

    分析完产品后,关键词也就找得差不多了,但是可能会存在一些热搜词,我们不知道。因此,勤快一点,找!

    如果店里产品比较多,且类目不是太小,还可以建立关键词库(有个逼格的名字,叫海词法)。

    下面,我们借助工具来建立一个词库。服装行业,属于大类目,可以建词库。

    找词可以用三个工具(当然市面上还会有其他工具,我也写过相关的工具)。

    1、老A搜词精灵/进阶版2、老A淘词精灵(需要开通淘词——数据魔方专业版或者订购半年以上的标准版)3、老A市场分析精灵

    第一天的时候,有讲过搜词精灵,搜词精灵共有五种提取方式,我们只是用了其中一种。

    通过这几种方式,我们可以很快的建立词库。

    1、通过淘宝的下拉词、长尾词和相关词

    下拉词和长尾词都是给懒人准备的,同时具有引导作用。特别是下拉词的点击率很高。

    很古早的时候,这些词都是自己手动一个一个去复制,然后粘贴到自己的excel里面。现在早已经解放了双手。

    下图我是用两层深度,挖掘出517个关键词。

    别忘了手机无线,这个最好单独抓出来,不要和PC混在一起。

    2、 通过TOP20W词库提取

    这个词库是在直通车的关键词榜单,下载地址是:

    http://taobao/go/act/sale/keyword-dictionary.php?spm=0.0.0.0.F38X0y

    我们可以直接通过工具来获取,下图共获取了736个关键词。

    3、 直通车提取

    这个我相信只要开过直通车的都不会陌生。

    我们在添加直通车关键词的时候会有下图这样的界面。

    这个就是直通车的相关词查询。

    我们也通过工具,一次性把数据提取出来。共394个词。

    最终汇集起来,进行去重处理后,共有1528个词。

    因为我们这件衣服并不是品牌商的货,所以我们把品牌词提出出来,把1528个词里面包含这些品牌词的删掉

    过滤后,剩下1424个词。

    然后再一步根据过滤一些我们不要的词。

    过滤后剩余1390个词,然后开始查询数据(默认的数字都是近一周平均,人群数据是近半年数据)。基本可以挂机了。等明天睡醒词库就好了。

    如果有数据魔方的淘词,用老A淘词精灵会非常方便,分分钟能有几千个词,但是淘词的数据和淘宝指数、直通车流量解析的数据不一样。

    另外,我们还可以用老A市场分析精灵,我们爬抓人气排序的前三页。然后,对前三页的标题进行分词。

    如上图所示,每个词根的出现次数和占比都有,人气排名下的前三页,也就是人气宝贝,这些宝贝标题的热门词根,其实可以直接拿这些词来做标题,但这种标题,不是谁都hold得住的,基本都是热词,竞争不小,要有实力才好玩。

    总而言之,现在找关键词太简单了,也因为简单易学,SEO优化没有以前那么有效,但是,还是会有人做得好,有人做得不好,这里面学问还不少。有时候,没有个3、5年的经验,没有数据分析能力,很是吃亏。

    第三步:筛选关键词

    关于筛选关键词,很多大神都有自己的一套路子,每个人说的都对,都有道理,下面介绍我自己用的野路子。

    数据用的是老A搜词精灵爬取到的,我们将数据表格导出,做进一步筛选。

    算出竞争比,竞争比=搜索指数/宝贝数量。

    算出竞争比加权系数,竞争比加权系数=竞争比/竞争比总和

    最后算出关键词得分,关键词得分=成交指数*竞争比加权系数(想要流量优选搜索指数,想要订单优选成交指数)

    好!至此准备工作完成。下面选择关键词。

    筛选关键词遵循以下两个原则

    1、 必须和宝贝相关

    类目,属性,信息都必须相关,数据里面有人群信息,尽量多找几个人群匹配的词。如上图,我们看到高分词【2014秋装新款女装】,这个词叫热搜词,它好用吗?未必!虽然字面上的信息,是适合的。但我们要先用淘宝指数看一下,毛衣类目是否适用这个词。

    很明显,不适合。

    如果还不信,可以用老A市场分析精灵验证一下搜索结果。搜索这个词,综合排序下,前3页,出现的比例是2.99%,和淘宝指数的2.78%是如此地接近。这意味着什么?展现的机会少了,你要在这个点,权重排名前4,才能进入这个词的搜索前3页。第一页有1个毛衣类目的,做到权重第一才可以出现在首页,这,这,有多难呀?

    2、 关键词得分高的优先选用(等同于必须要有人搜索有人购买)

    这个不用多说了。但是,我发现了好多坑,一个不留神就会被误导,用了烂词。数据完全一致,就宝贝数不一样。差一点点我就中招了。下图64.05分这个词数据应该是在120W个宝贝数的战场产生的。

    这不需要火眼金睛,看词的数据,很容易发现这类词,情况太普遍,太多人被坑过了。

    以下是我初步挑出来的词。

    根据之前分析产品的时候得到的产品特征词:【长款,长袖,单排扣,V领,韩版,直筒型,蝙蝠衣】来筛选出相关的关键词

    2014毛衣女韩版新款羊毛衫毛针织衫针织衫外套毛针织衫开衫针织衫 女 开衫 中长款长款毛衣外套女开衫中长款毛衣长袖针织衫v领羊毛衫女韩版毛衣外套宽松女秋装毛衣女韩版新款蝙蝠毛衣开衫

    第五步组合标题和第六步验证要合在一起讲,一边组合一遍验证,验证这个环节最麻烦

    一个标题是60个字符,折合成文字是30个字(一个汉字两个字符),标点符号算一个字符。

    先把找出来的关键词拆解成词根,词根的分法,也有好几种,我简单分两种就好了。

    名词:品类词

    毛衣,羊毛衫,毛针织衫,外套

    形容词:属性词(描述和形容商品的词)

    开衫,中长款,长袖,V领,韩版,宽松,秋装,新款,蝙蝠

    简单把词根组合起来,假设主打关键词是【长款毛衣外套女开衫】,那这个词就不要拆开,保持紧密性,而且放在前面,如果有多于的字符,可以用空格和其他词隔开。

    正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正(用正字,标记长度)

    长款毛衣外套女开衫 新款中长款韩版毛针织衫 秋装V领宽松羊毛衫

    29个字+两个空格,刚好60个字符。

    验证标题是个粗重活。

    主要验证两样东西

    1、关键词顺序,买家搜索习惯验证。

    关键词的顺序不同,结果可能不同。如,我在找词的时候就发现毛衣女装和女装毛衣,倒一下顺序,连搜索指数都不一样了。

    宝贝数也不一样。

    我们验证的渠道也就是淘宝指数和淘宝主搜(自己搜索看结果),可以对比搜索结果。

    2、关键词紧密关联性验证。

    紧密关联性也就是关键词不能拆分开,词根必须连在一起。很巧合,这个标题我验证过,没有需要紧密关联的情况。那我用另一个词来解释这个紧密关联性,【雪纺连衣裙】,词根是【雪纺】和【连衣裙】,通过淘宝主搜来验证。

    我们发现搜索的结果页上,很多展现的宝贝,标题里面雪纺和连衣裙这两个词根是紧密接在一起的。这种情况,说明这两个词根需要紧密关联。在SEO里面,紧密关联是完全匹配,完全匹配的权重是相对要高一点的。

    验证紧密关联性的渠道是淘宝主搜(搜索结果验证)。

    PS:紧密性不可能做到面面俱到,只要主打关键词保持紧密关联,其他的词尽量就好了,不用强求。

    说了这么多,不知道你懂了没有。做标题是整个环节中,是最简单又最复杂的一个环节。

    可能有人会问,我直接抄别人的标题,行不行?

    答案:行!

    这是绝招,一招搞定。但是要看你的实力是否能承载这个标题了。有时候,我偷懒,也是先抄一个,然后再找出自己的主打关键词,在抄来的标题上修改一下,加上自己的主打关键词,如果自己还发现了其他好词,就再把好词【塞】进去这个抄来的标题里面。

    初期的标题并不是决定因素,重要的是主打关键词。避免用词违规,不要用别人的品牌词,还有一些禁用的词,如淫秽词汇等。有不少朋友误用别人的品牌词,宝贝起来后就被淘宝删掉了(_`)

    在宝贝上架后,会产生宝贝的关键词数据,通过关键词数据来指导操作,这个比初期的打造标题可能要更为重要一些。

  • ?

    零一《从0开始,教你做数据分析》—09篇

    坚冰

    展开

    大家好,我是零一。这一篇给大家介绍探索关系。

    探索关系是非常好玩的一件事情。先给大家讲个故事。据说很久很久以前美国某个州对多个社区做了一项关于婴儿的调查,其中一个调查结果如下

    调查人员发现多个社区中,这个妈妈纹身的占比越高,这个社区出现畸形儿的概率就越高。那调查人员就很费解了,纹身跟生BB有什么关系呢?后来针对这些纹身妈咪做了调查,结果如下

    调查人员发现原来大部分的纹身妈咪因为出入夜店,大部分有接触过毒品,这才导致了前文说的畸形儿竟然跟纹身有关系。

    以上就是探索关系的一个例子。

    我们先引入一个概念【相关性】

    【相关性】是来反应两个或多个维度之间的相关密切程度,如上面的例子中,关系就是比较紧密的。两者相关紧密并不等于因果,上面的例子也说明了,并不是因为纹身就导致了畸形儿,而是纹身的妈咪多数曾经是不良少女,染上毒品,才导致后面生出畸形儿。

    【相关性】从影响的方向来区分,有3种,分别是正相关,零相关,负相关。下面我们一起看下。

    首先是正相关,只要是呈现下图这种趋势的分布,就称之为正相关,表示任意一个维度增长,另一个就跟着增长,反之,下降就随之下降。

    接着是零相关,只要是呈现下图这种趋势的分布,就称之为零相关。表示维度之间没有什么相关性。

    最后是负相关,只要是呈现下图这种趋势的分布,就称之为负相关。表示任意一个维度增长,另一个就下降,反之,下降就随之增长。

    下面我们一起看一下淘宝数据,淘宝数据也有很多有趣的关系。

    我抓取下来眼镜行业按销量排名的100页,也就是40*100=4000个宝贝的数据。数据大概长这个样子

    按30天成交量和价格来做散点图,得到如下的结果。

    很惊奇发现,居然有个眼镜卖12.8W!!这是在卖眼睛吧??

    大家回想第八篇的内容,这个店就是离群点,我们可以暂时不分析。我们通过设置坐标轴来进一步观察

    售价我先指定在1000元以下,呈负相关的姿态,下图是结果

    有人可能会说,这价格越高就销量越小,这个不用分析都知道了啊!事实上,还真有价格越高销量就越高这种行业,不看下怎么知道呢?我们要用数据说话!

    可以观察到大多数高销量的价格是分布在100元以下的。(0,100]这个区间销量最高在5K(最上面那个离群点不计在内),(100,200]这个区间销量最高在3K左右。

    接着我们可以进一步观察(100,200]这个区间的分布情况

    这个是零相关的分布状态,也就是说,在这个区间,你是定价在100,还是定价在200,不会太影响你的销量。所以,有时候很奇怪,我100也是卖,200也是卖,为什么不卖200呢?

    这个数据源我会提供给大家玩玩。30天成交量和价格的关系,我们就说到这里。下面我们看另一个关系。

    【上架天数】 VS 【30天成交量】

    这个让我差点跌破眼镜,上架了2000天,是什么概念?2000÷365=5(年)。上架了这么久的产品,还在卖!我接触淘宝才3-4个年头。

    我们可以发现,销量在2000以上的爆款主要的聚集区间,在1200天以内,也要有3年的时间了。。。不过我们可以发现,后面的新品,多了很多,正在逐渐上来,不少商家正在尝试用新品来冲击这个市场。

    我把坐标轴范围调整一下,结果看下图,看起来是零相关的样子。

    2000销量以上的,最快的在一个月时间(37天)打造上来。这些是谁呢?那通过这个图,把鼠标停在点上面,会显示这个数据是第几个观测值,那会非常简单就能定位到这些宝贝。

    这种观察方法,有个弊端,就是上面这个图,我只能说,我看起来像是零相关,并不能确定。那是否有一个具体一点的,可以不用靠眼镜的方法来告诉我们相关性呢?

    答案是肯定的!

    在Excel里面,有个函数叫correl,是英文correlation(相关)的前半部分。就是用来算相关性的,这个是适用于线性相关的情况下。非线性的情况下,就不适用了哦!比如类似抛物线的钟型分布(也就是正态分布)

    只要选中我们要的数据就可以了,两个数据组。

    得出的结果是一个[-1,1]的数字,这里是0.685,那这个数字怎么解读呢?

    [0.7,1]表示强正相关

    [0.3,0.7)表示中正相关

    (-0.3,0.3)表示零相关

    (-0.7,-0.3]表示中负相关

    [-1,-0.7]表示强负相关

    那我们这里的结果对应到就是中正相关这个区间。表示,评价量的多少还是会在一定程度上影响销量的。但这个结果没有分析意义,因为一般爆款卖得多评价也多。

    分析师是要考虑分析的结果有没有价值,一般何为有价值的关系呢?

    就是情理之中,但意料之外的这种关系,就非常有价值。

    另外,是要选择看图还是数字呢?

    这个问题很简单,先看图,如果不清晰,就看下数字。

    如果要快速出结果,并且是多个维度的情况下,用excel内置的数据分析的相关系数来快速得出相关矩阵

    结果是一个下三角矩阵

    ==========分割符==========

    下面我们来用数据挖掘套件,探索下数据。

    先把数据设置成表格的格式

    然后再表格工具里面有个分析(必须要有安装了数据挖掘套件才能有这个)

    我们先看下分析关键影响因素(我这里是用的市场数据,但如果大家是拿店铺的数据,大家都懂的)

    运行后结果如下,会有一个相对影响,可以参考。但这个结果,没有先处理缺失值(上一篇有说过异常处理,处理方法看上一篇)

    这个结果,没有太大的参考性。因为最相关的变成缺失值了,可能在获取数据的时候会有一些漏抓。

    ==========分隔符==========

    下一篇会告诉大家怎么做聚类分析,通过聚类,我们可以知道,某一个分类的特征,下图是聚类的一个结果特征(软件通过算法把30成交量大于704的归为一类,以下是这类的主要特征)

    主要特征是:无投诉,主营100%,天猫店,退款速度2.7-6.0等,大家可以看下。下一篇会跟大家详细介绍聚类。

    文中用到的源数据集下载连接:https://pan.baidu/s/1yzGzZKiQq7zj18QLKx1ZIQ

  • ?

    零一《从0开始,教你做数据分析》—10篇

    丁涛

    展开

    大家好,我是零一。这一篇给大家介绍聚类/分类。

    我们先讲一讲聚类。

    上一篇的探索关系,很多朋友反映说非常有趣,这一篇,聚类分析也是相当有趣的。

    聚类分析简称聚类,俗话说物以类聚,人以群分,聚类就是划分子类的过程。算法上面多用k-means和k-medoids,当然,大家可以跳过这些算法的过程,用程序来完成即可。

    说简单一点,通过聚类,可以将我们的数据进行分类,并且描述每个类的特征。

    聚类应用非常广泛,包括在电商领域的应用也是多不胜数。比如

    (1)对客户数据进行聚类分析得到多个客户群组,并且得到各个群组的特征,这可以帮助我们发现客户的共性和差异性;

    (2)竞争对手数据进行聚类分析得到多个对手群组和各自的特征,这一样可以让我们找到对手们的共性和差异性;

    (3)对行业数据进行聚类分析得到多个行业群组和各自的特征,这个可以来发现不同行业之间的共性和差异性

    (4)对销售数据进行聚类分析(比如以其中的地域聚类),可以告诉我们那些地域之间的共性和差异性

    不难发现,我举的4个例子都是在发现共性和差异性。对的!我们了解了这些信息,可以指导我们的运营决策,对不同群组制定不同的策略。

    下图是对地域数据做的聚类分析,得到的一个谱系图,我们从上往下看,首先是分成两大类

    广东,天津,浙江,北京和上海这五个省市为一类,其余的多省为一类。

    再往下看又分成了四大类,西藏作为单独一个分类,广东也作为单独的一个分类,天津和浙江为一类,北京和上海为一类。

    从上往下,越分越细。红色的边框把多个省市划分成5个分类。一般没必要分得太细,这个数据目测是分成了20个细分的分类,除非是确实是需要细分到很细的时候,才需要看最低层的分类。

    当我们知道天津和浙江聚为一类的时候,他们必然存在共性,才会聚在一起。当我们知道天津-浙江类和北京-上海类,作为两个不同的群组聚集,它们之间肯定是存在某种差异。

    =======================================

    下面,我们用上篇共享的数据,跟大家一起探讨聚类,和寻找他们的共性和差异性。

    先处理下缺失值,选择清除数据里面的离群值

    中间要选择需要处理的字段,选择好后,进入以下界面,也一样下一步即可

    选择删除包含离群点的行(因为这里数据量不少,可以删了)

    一般情况下,我们都避免直接修改源数据,需要新建一个变量或者空间或者工作表来存放处理过后的数据。这里选择复制到新的工作表就可以了。

    数据处理好后,就可以进行聚类分析了。在数据挖掘套件里面直接选择聚类分析即可。

    选择需要的数据进入模型里面

    点击参数,然后就会看到下图这个对话框,可以手动输入数字来更改聚类算法,可以看到微软提供的聚类算法有4种,分别是可变的EM,固定的EM,可变的K-means跟固定K-means(EM是最大期望算法,K-means是K平均值算法,可变的是可以伸缩调整的,固定的就是固定不可调整的)

    这里我输入4,选择固定的K-means算法

    下图是选择测试集的比例,默认是30%。【测试集】是数据挖掘特有的名词,数据挖掘里头将数据集一分为二,大头的部分用来训练建立模型,称之为【训练集】,小的部分就用来测试模型,称之为【测试集】。这是数据挖掘和统计学最大的差异之一。统计学是通过统计方法来验证模型是否可靠,而数据挖掘技术是利用测试集来验证模型的可靠性。一般用于预测模型,聚类分析其实可以不用测试集,可以把数值改为0。但我就不改了。就用随机抽取出来的70%的数据来建立模型。

    完成后,就会进入模型浏览界面,我们看到共有划分了7个,这有点儿多,我们可以在选择输入列的时候指定分类的数量,刚才我们是选了自动检测来着。

    线粗代表两个分类之间的关系的强度,越粗关系越强。分类的颜色代表密度,颜色越是深蓝代表这个分类的数据个数越多。那非常明显,系统把大部分的数据归入分类1里头了。

    下面是分类的剖面图,每个分类对应的指标范围在这里一览无遗。

    简单解读一下上面这个分类情况

    【分类1】包含2768个数据,最鲜明的是30天成交量偏大,价格偏低的这一个群组,是中低端爆款类

    【分类2】只有246个数据,这个群组比较失败,发货分丶服务分丶好评率都偏低,销量偏低,价格偏高一点,典型就是卖货不卖服务类

    【分类3】只有187个,集中在广东深圳,DSR很好,评价很好,价格很高,但退款率也很高,应该是高端市场的卖家,标准的价格高,服务好,但不知为何退款率也高,可能是买家收到了,觉得不划算吧,这一类是高端类,但产品或品牌的价值感可能没有做好。

    【分类4】只有65个,也是DSR超好,价格中档,产品的价值完美体现,退款率不错,同样集中在广东深圳,是中档性价比类。

    【分类5】只有61个,这个群组很惨,集中在浙江金华(估计是义乌),价格超低,DSR超烂,好评率很惨,是低端烂货类

    【分类6】和【分类7】规模很小,就不解读了。以上解读仅供参考。一般分个4-5个群组就差不多了,如果数据量确实大,可以考虑分细一些。

    每一个分类都可以单独提取出这个分类下的数据的。

    下图是分类的一些特征,每个特征的概率情况

    下图是分类间的差异性,通过对比可以发现,分类1多是天猫,非分类1的多是C店。

    下面我着重看下分类3和分类4的区别,因为分类3败在退款率上面,而分类四就解决了这个问题。

    我大致上看出来了,分类3的服务(DSR,退款速度)没有分类4的做得好,但分类4的价格又要比分类3低,并且包邮。那作为消费者,肯定选个价格中肯,服务又好的店家。而且分类4的销量还不低,有少部分是心店,我对心店的印象就是心店的服务一般要比大店的要好。

    以上就是对这儿聚类分析结果的简单解读,具体的,亲们实操一下吧。

    =============================================

    下面说说分类。

    聚类和分类,从语义来讲,看似很像,但有一点重要的差异。分类是指定了我们要分析的列(维度),然后通过决策树算法(默认方法是用贝叶斯分类器),来告诉我们,影响这个目标的维度有哪些。下面我们看下过程。

    选择要分析的列,我这里选择的是30天销量,看下会影响销量的是什么因子。

    下图是结果,告诉我们,收藏很重要!收藏跟销量有很强的关系。同样第一张图是决策树,一样有分组的作用。

    决策树一般用来分析影响客户下单或者流失的因子有哪些。有兴趣的朋友可以自己倒腾一下。试下会有哪些意外的收获。

    ===========================================

    下面,告诉大家测试集的使用方法。

    选择准确性图表

    选择模型,一般用于预测模型,刚才的决策树是属于预测模型,而聚类就不属于,因此聚类的模型不可用于准确性图表。

    选择要预测的区间,我选择的是30天成交大于122的情况

    我们之前保留的测试集,就在这里出现了,默认会选择测试集来验证准确性。

    在上图点了完成后,就会得到这样的一个结果(部分截图),会有一个指标, “分类 30天成交”模型提升144.11%,这个数值越大代表模型的准确性越高。但我一般看下面的ROC图。

    蓝色代表没有模型的结果,红色代表理想的结果。而绿色代表我们测试得到的结果。

    绿色的线越接近红色的就代表越好,一般情况下,只要不要太接近蓝色的线(或者低于蓝色的线),就好了。如果接近蓝色的线或者在蓝色线下面,那就不如不用模型了,此时这个模型就没什么存在的意义,如果硬要用那就只是为了做模型玩玩而已了。

  • ?

    「零一」《从0开始,教你做数据分析》—01篇

    戚安卉

    展开

    大家好,我是零一,今天开始给大家带来基础系列教程

    本系列文章适合以下情况的读者:

    1丶淘宝店铺运营或者店长,目前还不会做数据分析,渴望提升自己

    2丶打算在淘宝开店的朋友,目前尚在混派代学习中

    3丶其他对数据分析感兴趣的朋友,尚在入门阶段

    本文是第一篇会比较基础,涉及的概念也少,旨在让读者动手了解工具。

    我们直奔主题

    数据分析的概念必须搞清楚。简单点说,数据分析是将数据进行清洗后,把隐藏在数据背后的信息提炼出来。

    另外,值得一说的是,数据分析是获取新知识的新途径。

    下面看一下菜鸟跟数据分析师的区别,引自《谁说菜鸟不会数据分析》一书

    可以看出来,专业一点的数据玩家的思路会非常清晰,而且会以目的为导向,建议大家参考分析师的思路。

    数据分析的过程已经有非常多的前人做出了总结,我还是引用书中的结果

    分别是,明确分析目的和内容——数据收集——数据处理——数据分析——数据展现——报告撰写

    做任何事情都要有目的,做数据分析也不例外,而且明确目的在数据分析里面上升到了一个非常重要的高度,甚至决定了你后面所做的一切有没有价值。

    做数据分析必须运用工具,没有工具几乎无从开展,大家看下一般数据分析有哪些工具

    可以看到,底层是数据库,在数据量大的情况下,需要动用到数据库。

    报告层是Crystal Reports(动态和可操作的报表,没用过)

    分析层是分析的工具,从左到右分别是Excel(Office套装里面的一员,据说可以和SAS媲美的数据工具之一),UCINET(社会网络关系分析,没用过),SAS(最古老最专业的数据分析工具),SPSS(IBM的工具,以简单易用闻名),clementine(已经被IBM收购属于SPSS系列)

    最后是表现层,也就是做报告的一系列工具,我只接触过PPT和水晶易表,一般会用PPT就可以了。

    接下来讲的数据分析,选择的是大家比较熟悉的Excel,Excel做深入分析的时候比较麻烦也有局限性,但就上手指数来说,Excel是排第一的。数据量在一百万条以内是足够的了。

    我选用的版本是Excel 2010

    第一步,我们要明确分析的目的和内容。因为是实例,我假设

    目的:了解淘宝美容行业的市场情况

    内容:1丶行业分析,2丶属性分析(采用折线图和饼图直观反映行业趋势和容量)

    第二步,数据收集,一般手动收集,也可以用工具收集。

    这里提供工具给大家做练习。提供的是仅支持美容大类的版本,运行环境,excel2010/2013,32位xp/WIN 7,假如没有生e经,那没关系,下面用到的数据源一样会共享给大家,拿着数据源就可以一步一步跟着操作。

    数据来源:生e经(必须有开通生e经,并能查看相应行业数据)

    数据宽度:21(月)

    因为生e经按月展示数据,因此这里的数据宽度,就是月份数。

    打开表格,然后,按下列图片次序操作

    自己登陆生e经复制生e经的地址进来。登陆好,就把窗口关闭即可。其中c2代表服务器编号是2。

    选择正确的服务器编号才能正常抓取。

    选择好后,点开始抓取数据

    耐心等待(等待时间和抓取的月份丶网速有关系),会在excel中出现结果,那么可以把这些数据复制到我们的另一个工作簿上,也可以导出为csv格式。

    导出的文件可以保持在本地,方便下次提取。

    第三步:数据处理,简单举例,可以跟着做。

    做下简单的处理,这里提取年份使用这个公式:=LEFT(E2,4),提取月份使用这个公式:=RIGHT(E2,2),然后填充。如下图所示,鼠标移到单元格的右下角位置,会出现个黑色小方形,鼠标也会变成黑色的十字架,双击即可填充。

    接着,我们插入数据透视表,鼠标点一下我们的数据,任意一个单元格都可以,只要在数据范围内,如图,我点在F10单元格。

    点数据透视表,会自动匹配整个数据框。我们点确定即可。

    点确定后,效果如下图所示

    用鼠标,将字段拉到下面的相应位置即可

    第四步:数据分析

    我们现在就已经完成了数据透视表,通过这个透视表,就可以比较直观的对比各行业间的差异,但是都是数字,不免有些晕,或许用图表来展示会更加直观

    点一下数据透视表,然后点插入——折线图,这里选择第一个样式即可(其他样式可以自己尝试)

    结果如图所示

    发现面膜/面膜粉的走势好像不错。

    接着,我想看一下各行业的容量占比,重点看下面膜/面膜粉这个行业占比多少,就以2013年的数据来统计占比。还是插入数据透视表,先设置好字段,然后再选择2013.

    接着,插入饼图

    结果如图所示

    这里看不到占比,而且也不知道哪个行业,这就需要我们设置一下图表。右击图表——添加数据标签

    出现标签后,我们再右击一下标签,设置数据系列格式

    按下图红框设置即可

    然后改下标题,稍微把图表的尺寸拖大一点

    这样,就比较直观了,面膜/面膜粉在2013年1-9月份中,销量占了整个美容护肤行业的16%。那么我想再仔细看看面膜/面膜粉行业的销量走势。依然先插入并设计数据透视表。

    然后,插入折线图

    结果如下图所示

    两年的销量走势对比,可以看出2013年比2012年增长了不少。增长需要涉及到环比增长和同比增长两个概念,今天先不讲。我们通过目测就已经看出来,今年比去年火,但是这个结论还不是最终结论,只是简单建立在数据层面的初步结论,还要通过淘宝去验证,搞清楚销量的增长是来自哪里。假设是某几家品牌促销的结果,那么这个数据对于我们而言,意义就不一样了。或许我们自己是这个行业的一个品牌商,则需要把后面的分析重点转移到研究这几家品牌的营销研究上面来,弄清楚对手究竟如何改变了这个市场。

    属性分析里面包含了SKU,操作方法跟上面类似,这里就不演示了。

    第四步:数据展现

    把我们以上得到的结果,进一步优化,更加直观丶有序地展现出来。

    第五步:撰写报告(非商业严谨报告,以实用为主)

    把所看到的,所想到的,通过文字的方式记录下来,方便自己或者他人阅读,了解我们的分析思路。

教你做数据分析

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP