中企动力 > 商学院 > 做数据分析步骤
  • ?

    零一《从0开始,教你做数据分析》—10篇

    项荧荧

    展开

    大家好,我是零一。这一篇给大家介绍聚类/分类。

    我们先讲一讲聚类。

    上一篇的探索关系,很多朋友反映说非常有趣,这一篇,聚类分析也是相当有趣的。

    聚类分析简称聚类,俗话说物以类聚,人以群分,聚类就是划分子类的过程。算法上面多用k-means和k-medoids,当然,大家可以跳过这些算法的过程,用程序来完成即可。

    说简单一点,通过聚类,可以将我们的数据进行分类,并且描述每个类的特征。

    聚类应用非常广泛,包括在电商领域的应用也是多不胜数。比如

    (1)对客户数据进行聚类分析得到多个客户群组,并且得到各个群组的特征,这可以帮助我们发现客户的共性和差异性;

    (2)竞争对手数据进行聚类分析得到多个对手群组和各自的特征,这一样可以让我们找到对手们的共性和差异性;

    (3)对行业数据进行聚类分析得到多个行业群组和各自的特征,这个可以来发现不同行业之间的共性和差异性

    (4)对销售数据进行聚类分析(比如以其中的地域聚类),可以告诉我们那些地域之间的共性和差异性

    不难发现,我举的4个例子都是在发现共性和差异性。对的!我们了解了这些信息,可以指导我们的运营决策,对不同群组制定不同的策略。

    下图是对地域数据做的聚类分析,得到的一个谱系图,我们从上往下看,首先是分成两大类

    广东,天津,浙江,北京和上海这五个省市为一类,其余的多省为一类。

    再往下看又分成了四大类,西藏作为单独一个分类,广东也作为单独的一个分类,天津和浙江为一类,北京和上海为一类。

    从上往下,越分越细。红色的边框把多个省市划分成5个分类。一般没必要分得太细,这个数据目测是分成了20个细分的分类,除非是确实是需要细分到很细的时候,才需要看最低层的分类。

    当我们知道天津和浙江聚为一类的时候,他们必然存在共性,才会聚在一起。当我们知道天津-浙江类和北京-上海类,作为两个不同的群组聚集,它们之间肯定是存在某种差异。

    =======================================

    下面,我们用上篇共享的数据,跟大家一起探讨聚类,和寻找他们的共性和差异性。

    先处理下缺失值,选择清除数据里面的离群值

    中间要选择需要处理的字段,选择好后,进入以下界面,也一样下一步即可

    选择删除包含离群点的行(因为这里数据量不少,可以删了)

    一般情况下,我们都避免直接修改源数据,需要新建一个变量或者空间或者工作表来存放处理过后的数据。这里选择复制到新的工作表就可以了。

    数据处理好后,就可以进行聚类分析了。在数据挖掘套件里面直接选择聚类分析即可。

    选择需要的数据进入模型里面

    点击参数,然后就会看到下图这个对话框,可以手动输入数字来更改聚类算法,可以看到微软提供的聚类算法有4种,分别是可变的EM,固定的EM,可变的K-means跟固定K-means(EM是最大期望算法,K-means是K平均值算法,可变的是可以伸缩调整的,固定的就是固定不可调整的)

    这里我输入4,选择固定的K-means算法

    下图是选择测试集的比例,默认是30%。【测试集】是数据挖掘特有的名词,数据挖掘里头将数据集一分为二,大头的部分用来训练建立模型,称之为【训练集】,小的部分就用来测试模型,称之为【测试集】。这是数据挖掘和统计学最大的差异之一。统计学是通过统计方法来验证模型是否可靠,而数据挖掘技术是利用测试集来验证模型的可靠性。一般用于预测模型,聚类分析其实可以不用测试集,可以把数值改为0。但我就不改了。就用随机抽取出来的70%的数据来建立模型。

    完成后,就会进入模型浏览界面,我们看到共有划分了7个,这有点儿多,我们可以在选择输入列的时候指定分类的数量,刚才我们是选了自动检测来着。

    线粗代表两个分类之间的关系的强度,越粗关系越强。分类的颜色代表密度,颜色越是深蓝代表这个分类的数据个数越多。那非常明显,系统把大部分的数据归入分类1里头了。

    下面是分类的剖面图,每个分类对应的指标范围在这里一览无遗。

    简单解读一下上面这个分类情况

    【分类1】包含2768个数据,最鲜明的是30天成交量偏大,价格偏低的这一个群组,是中低端爆款类

    【分类2】只有246个数据,这个群组比较失败,发货分丶服务分丶好评率都偏低,销量偏低,价格偏高一点,典型就是卖货不卖服务类

    【分类3】只有187个,集中在广东深圳,DSR很好,评价很好,价格很高,但退款率也很高,应该是高端市场的卖家,标准的价格高,服务好,但不知为何退款率也高,可能是买家收到了,觉得不划算吧,这一类是高端类,但产品或品牌的价值感可能没有做好。

    【分类4】只有65个,也是DSR超好,价格中档,产品的价值完美体现,退款率不错,同样集中在广东深圳,是中档性价比类。

    【分类5】只有61个,这个群组很惨,集中在浙江金华(估计是义乌),价格超低,DSR超烂,好评率很惨,是低端烂货类

    【分类6】和【分类7】规模很小,就不解读了。以上解读仅供参考。一般分个4-5个群组就差不多了,如果数据量确实大,可以考虑分细一些。

    每一个分类都可以单独提取出这个分类下的数据的。

    下图是分类的一些特征,每个特征的概率情况

    下图是分类间的差异性,通过对比可以发现,分类1多是天猫,非分类1的多是C店。

    下面我着重看下分类3和分类4的区别,因为分类3败在退款率上面,而分类四就解决了这个问题。

    我大致上看出来了,分类3的服务(DSR,退款速度)没有分类4的做得好,但分类4的价格又要比分类3低,并且包邮。那作为消费者,肯定选个价格中肯,服务又好的店家。而且分类4的销量还不低,有少部分是心店,我对心店的印象就是心店的服务一般要比大店的要好。

    以上就是对这儿聚类分析结果的简单解读,具体的,亲们实操一下吧。

    =============================================

    下面说说分类。

    聚类和分类,从语义来讲,看似很像,但有一点重要的差异。分类是指定了我们要分析的列(维度),然后通过决策树算法(默认方法是用贝叶斯分类器),来告诉我们,影响这个目标的维度有哪些。下面我们看下过程。

    选择要分析的列,我这里选择的是30天销量,看下会影响销量的是什么因子。

    下图是结果,告诉我们,收藏很重要!收藏跟销量有很强的关系。同样第一张图是决策树,一样有分组的作用。

    决策树一般用来分析影响客户下单或者流失的因子有哪些。有兴趣的朋友可以自己倒腾一下。试下会有哪些意外的收获。

    ===========================================

    下面,告诉大家测试集的使用方法。

    选择准确性图表

    选择模型,一般用于预测模型,刚才的决策树是属于预测模型,而聚类就不属于,因此聚类的模型不可用于准确性图表。

    选择要预测的区间,我选择的是30天成交大于122的情况

    我们之前保留的测试集,就在这里出现了,默认会选择测试集来验证准确性。

    在上图点了完成后,就会得到这样的一个结果(部分截图),会有一个指标, “分类 30天成交”模型提升144.11%,这个数值越大代表模型的准确性越高。但我一般看下面的ROC图。

    蓝色代表没有模型的结果,红色代表理想的结果。而绿色代表我们测试得到的结果。

    绿色的线越接近红色的就代表越好,一般情况下,只要不要太接近蓝色的线(或者低于蓝色的线),就好了。如果接近蓝色的线或者在蓝色线下面,那就不如不用模型了,此时这个模型就没什么存在的意义,如果硬要用那就只是为了做模型玩玩而已了。

  • ?

    如何做数据分析?

    青草

    展开

    在互联网的下半场,不断精细化运营的背景下,产品经理不再是单纯的靠感觉来做产品,更需要培养数据的意识,能以数据为依归,来不断改善产品。

    不同于公司专业的数据分析师,产品经理更多的可以从用户、业务的层面去看待数据,去更快更透彻的去寻找数据变动的原因。

    科多大数据带你们看看在数据已经被有效记录的前提下,如何有效的去进行大数据分析呢?

    一、明确数据分析的目的

    1、如果数据分析的目的是要对比页面改版前后的优劣,则衡量的指标应该从页面的点击率,跳出率等维度出发,电商类应用还要观察订单转化率,社交类应用要注重用户的访问时长、点赞转发互动等频次。

    不少新人在设计自己产品的时候,可能会花费很多时间在产品本身的设计上,却没有花精力思考如何衡量产品的成功与否,在产品文档上写上一句类似“用户体验有所”提升的空话,这样既不利于产品设计顺利通过需求评审,也无法更有效的快速提高产品的KPI指标。

    2、如果数据分析的目的是探究某一模块数据异常波动的原因,则分析的方法应该按照金字塔原理逐步拆解,版本->时间->人群。

    比如发现首页猜你喜欢模块最近的点击率从40%下降到了35%,暴跌5%个点,这个时候先看看是不是哪个版本的数据发生了波动,是不是因为新版本上线埋点遗漏或有误造成的。

    如果版本的波动数据保持一致,再看看数据是从什么时候开始变化的,是不是因为受到了圣诞、元旦假日因素的影响,页面上其他模块上线了新的活动影响了猜你喜欢的转化。

    如果不是,则再拆解是不是流量来源构成发生了变动,是不是新用户的曝光数量增加导致的。

    产品经理需要带着明确的目的去分析数据,思考实现目标需要构建哪些维度去验证。大部分时候,产品经理需要非常耐心的一步一步的拆解细分,排查原因。

    二、多渠道收集数据

    收集方式一般有四类渠道。

    1、从外部如易观或艾瑞的行业数据分析报告获取,需要带着审慎的态度去观察数据,提取有效准确的信息,剥离部分可能注水的数据,并需要时刻警惕那些被人处理过的二手数据。

    2、从AppStore、客服意见反馈、微博等社区论坛去主动收集用户的反馈。我自己经常有空的时候就会去社区论坛看看用户的状态评论,一般这样的评论都是非常极端的,要么特别好,要么骂成狗,但这些评论对于自身产品设计的提升还是非常有益的,可以尝试去反推用户当时当刻为什么会产生如此的情绪。

    3、自行参与问卷设计、用户访谈等调研,直面用户,收集一手数据,观察用户使用产品时所遇到的问题及感受。问卷需要提炼核心问题,减少问题,回收结果需剔除无效的敷衍的问卷。用户访谈需要注意不使用引导性的词汇或问题去带偏用户的自然感受。

    4、从已记录的用户行为轨迹去研究数据。大公司一般会有固话的报表/邮件去每天甚至实时反馈线上的用户数据情况,也会提供SQL查询平台给产品经理或数据分析师,让他们可以更有深度的探究对比数据。

    三、有效剔除干扰数据

    1、选取正确的样本数量,选取足够大的数量,剔除极端或偶然性数据的影响。08年奥运会上,姚明的三分投篮命中率为100%,科比的三分投篮命中率为32%,那么是不是说姚明的三分投篮命中率要比科比高?显示有问题,因为那届奥运会,姚明只投了一个三分球,科比投了53个。

    2、制定相同的抽样规则,减少分析结论的偏差性。比如两条Push文案,第1条“您有一个外卖暖心红包未领取,最大的红包只留给最会吃的你,点击进入”,第2条“送你一个外卖低温福利,足不出户吃喝热腾美味,点击领取”。实验数据表明,第二条Push文案的点击率比第一条同比高了30%。那么真的是第二条文案更有吸引力嘛?结果发现是第二条Push文案的接收人群的活跃度明显高于第一条造成的。

    3、剔除版本或节假日因素的干扰,新版本刚上线时的数据表现往往会很好,因为主动升级的用户一般是高活跃度的用户。临近周末或大型节假日的时候,用户的消费需求会被触发,电商类应用的订单转化率也会直线上升。因此,在数据对比的时候,实验组和对照组的数据在时间维度上要保持对应。

    4、对历史数据遗忘。人与数据技术不同,数据技术有着100%的记忆能力,而人类根据艾浩宾斯遗忘定律1天后只能记起33%,6天后25%,31天后21%。因此,我们要合理的选择筛选时间段。比如猜你喜欢模块不仅要对兴趣标签的计分进行一定的加权处理,也要结合商品的生命周期等因素做一系列的回归实验,得出受众人群对各类兴趣和购买倾向的衰退曲线,利用有规律的时间变化有效删除老数据,去提升模块的点击率。

    5、实验需拆分A1组,也就是在实验组B和对照组A上再增加一组A1,A1和A的规则保持一致,然后探究AB的数据波动与AA1比较,剔除数据的自然/异常波动带来的影响。以我实际的A/B实验表明,设立A1组是非常重要且必要的,不管数据量级有多大,相同实验规则的两组在数据也会有一定的小幅波动,而这小幅波动在精细化运营的今天,对我们的判断可能形成较大的干扰偏差。

    四、合理客观的审视数据

    1、不要忽略沉默用户

    产品经理在听到部分用户反馈的时候就做出决策,花费大量的时间开发相应的功能,往往结果,可能这些功能只是极少部分用户的迫切需求,而大部分用户并不在乎。甚至有可能与核心用户的诉求相违背,导致新版产品上线后数据猛跌。

    忽略沉默用户,没有全盘的考虑产品大部分目标用户的核心需求,可能造成人力物力的浪费,更有甚者,会错失商业机会。

    2、全面理解数据结果

    如果实验结果的预期与我们的经验认知有明显的偏差,请不要盲目下结论质疑自己的直觉,而是尝试对数据进行更透彻的分析。

    例如我曾经做过在首页给用户投放活动弹窗的实验,发现实验组的数据不管在首页的点击率,订单转化率乃至7日留存率方面都远超对照组,首页上的每一个模块的转化率都有明显的提升,远远超出了我们的预期,那这真的是活动弹窗刺激了用户的转化率嘛?

    后来我们发现在首页能够展示出活动弹窗的用户,往往在使用环境时的网络状态比较好,在wifi环境下,而未展示弹窗的用户则可能是在公交/地铁/商场等移动场景下,网络通讯可能不佳,因此影响了A/B实验的结果。

    3、不要过度依赖数据

    过度依赖数据,一方面,会让我们做很多没有价值的数据分析;另一方面,也会限制产品经理本来应有的灵感和创意。

    正像罗振宇在时间的朋友跨年演讲上提到的一样。用户要什么,你就给什么,甚至他们没说出来你就猜到了,这叫母爱算法,在内容分发领域没有人比今日头条做得更好,但母爱算法有很大的弊端,在推荐的时候会越推越窄。

    另一面则是父爱算法,站的高,看得远。告诉用户,放下你手里的烂东西,我告诉你一个好东西,跟我来。正像乔帮主当年打造的iPhone系列产品一样,不看市场分析,不做用户调研,打造出超出用户预期的产品。

    五、总结

    美国最成功的视频网站Netflix通过基于用户习惯的分析,将大数据分析深入到电影的创作环节中,塑造了风靡一时的美剧《纸牌屋》。然而Netflix的工作人员告诉我们,不应该迷恋大数据

    如果说电视剧评分9分是精品的话,大数据可以让我们脱离低分6分以下的风险,却也会带我们按部就班的走向平庸的绝大多数7-8分之间。

    产品经理在直觉创造的心智能力,情感理解的社交能力,与大数据相结合,正确的理解数据,让数据真正嵌入到产品的设计中,切实解决用户的实际问题,方能真正做到所谓的“用户洞察”,让产品走到用户需求前面,超出用户的预期。

  • ?

    零一《从0开始,教你做数据分析》—04篇

    糜小夏

    展开

    先回顾下,前面的内容。简单罗列一下。

    1、店铺自检;2、选品;3、选词;4、设计详情页;5、设计首图;6、分析上下架时间

    以上全部都是准备工作啊!我要很愉快地告诉大家,今天还是准备工作。

    做标题!

    原本并没有打算写标题的制作,因为觉得太简单,但很多朋友跟我反馈,说需要标题和直通车的知识,因此,今天就写写标题,时间点也刚好掐上。

    前面第三件事情,我们做的是选词,选的是主打关键词,并不是做标题。因为这个时候,还不到做标题的时候。有了主打关键词之后,我们根据关键词的人群信息和产品本身来做详情页和首图。而做详情页和首图,本质上是在分析产品,而做标题的第一步,就是分析产品。第六件事情是分析上下架,上下架时间针对的是主打关键词,如果你把整个标题都去分析上下架,那分析出来的结果可能就是无处容身了,没点给你占了。

    那么,我们开始!

    淘宝搜索SEO上的【标题】,和【标题党】并没有半毛钱关系。淘宝上的【标题】是用来描述一个商品的,并且提供给消费者检索。

    淘宝对标题的定义是:商品标题是直接与商品的【搜索】相关,商品标题中一般包含了一些商品【信息、属性、热搜词】等组成。

    标题要将商品的特性展示出来,【且要与商品的基本属性对应】;但是如果热搜词过多,也会影响排序。一般情况下我们可以搜索同类卖家的商品,看看别人的商品标题是如何进行填写的,以此做为参考。

    通过淘宝官方的这段文字可以知道,标题是提供给消费者搜索的,包含了商品的信息、属性和热搜词。

    做标题的步骤,我有我的看点,可能跟其他大神的有些差异。

    第一步:分析产品第二步:找关键词第三步:筛选关键词第五步:组合标题第六步:验证标题

    首先,第一步,分析产品。对于经验丰富的运营,拿到产品的那一刻,标题也就基本成型了。对于新手,也能定个百分之七八十。因为商品会自己告诉你,他的信息和属性。(做详情页和主图的时候,也需要分析产品哦!)

    举个栗子

    这是一件羊毛衫。我们只是看图片的话,能得到一部分信息,我建议选好了款后最好是拍一件回来看看,如果喜欢的话自己穿或者送给闺蜜or老婆,如果不喜欢就完整地退回给卖家(7天无理由退换,买个运费险,等于自己出了个邮费)。这一步很重要,如果我们自己卖的产品,自己连摸都没摸过,那心里会没底。

    拿到了实物,我们接下来的工作就很轻松了。看到实物,再结合我们之前看的数据,可以轻松判断是否要做这个产品。

    我们来细看这件衣服,看存在什么信息。

    羊毛衫,针织开衫,长款,长袖,单排扣,V领,韩版,直筒型,还有点蝙蝠衣的赶脚。

    一个标题也就30个汉字,如果把这些信息组合起来,标题也就完成了80%左右了。

    之前我自己写过词频分析的程序,对程序的分词原理有一定的了解。我发现每个词都有词性,也就是我们小学读书的时候,语文老师教的,名词、动词、形容词等。

    一个标题基本就是由名词、动词、形容词、时间词和数词。而这里面,名词是最重要的。一般标题里面的名词就是品类词。

    这个例子中,羊毛衫和针织开衫,就是名词。其他的都属于形容词,都是用来修饰名词。如,长款的针织开衫,V领的针织开衫等。每个关键词必须包含名词,这才符合用户的搜索习惯。

    第二步:找关键词

    分析完产品后,关键词也就找得差不多了,但是可能会存在一些热搜词,我们不知道。因此,勤快一点,找!

    如果店里产品比较多,且类目不是太小,还可以建立关键词库(有个逼格的名字,叫海词法)。

    下面,我们借助工具来建立一个词库。服装行业,属于大类目,可以建词库。

    找词可以用三个工具(当然市面上还会有其他工具,我也写过相关的工具)。

    1、老A搜词精灵/进阶版2、老A淘词精灵(需要开通淘词——数据魔方专业版或者订购半年以上的标准版)3、老A市场分析精灵

    第一天的时候,有讲过搜词精灵,搜词精灵共有五种提取方式,我们只是用了其中一种。

    通过这几种方式,我们可以很快的建立词库。

    1、通过淘宝的下拉词、长尾词和相关词

    下拉词和长尾词都是给懒人准备的,同时具有引导作用。特别是下拉词的点击率很高。

    很古早的时候,这些词都是自己手动一个一个去复制,然后粘贴到自己的excel里面。现在早已经解放了双手。

    下图我是用两层深度,挖掘出517个关键词。

    别忘了手机无线,这个最好单独抓出来,不要和PC混在一起。

    2、 通过TOP20W词库提取

    这个词库是在直通车的关键词榜单,下载地址是:

    http://taobao/go/act/sale/keyword-dictionary.php?spm=0.0.0.0.F38X0y

    我们可以直接通过工具来获取,下图共获取了736个关键词。

    3、 直通车提取

    这个我相信只要开过直通车的都不会陌生。

    我们在添加直通车关键词的时候会有下图这样的界面。

    这个就是直通车的相关词查询。

    我们也通过工具,一次性把数据提取出来。共394个词。

    最终汇集起来,进行去重处理后,共有1528个词。

    因为我们这件衣服并不是品牌商的货,所以我们把品牌词提出出来,把1528个词里面包含这些品牌词的删掉

    过滤后,剩下1424个词。

    然后再一步根据过滤一些我们不要的词。

    过滤后剩余1390个词,然后开始查询数据(默认的数字都是近一周平均,人群数据是近半年数据)。基本可以挂机了。等明天睡醒词库就好了。

    如果有数据魔方的淘词,用老A淘词精灵会非常方便,分分钟能有几千个词,但是淘词的数据和淘宝指数、直通车流量解析的数据不一样。

    另外,我们还可以用老A市场分析精灵,我们爬抓人气排序的前三页。然后,对前三页的标题进行分词。

    如上图所示,每个词根的出现次数和占比都有,人气排名下的前三页,也就是人气宝贝,这些宝贝标题的热门词根,其实可以直接拿这些词来做标题,但这种标题,不是谁都hold得住的,基本都是热词,竞争不小,要有实力才好玩。

    总而言之,现在找关键词太简单了,也因为简单易学,SEO优化没有以前那么有效,但是,还是会有人做得好,有人做得不好,这里面学问还不少。有时候,没有个3、5年的经验,没有数据分析能力,很是吃亏。

    第三步:筛选关键词

    关于筛选关键词,很多大神都有自己的一套路子,每个人说的都对,都有道理,下面介绍我自己用的野路子。

    数据用的是老A搜词精灵爬取到的,我们将数据表格导出,做进一步筛选。

    算出竞争比,竞争比=搜索指数/宝贝数量。

    算出竞争比加权系数,竞争比加权系数=竞争比/竞争比总和

    最后算出关键词得分,关键词得分=成交指数*竞争比加权系数(想要流量优选搜索指数,想要订单优选成交指数)

    好!至此准备工作完成。下面选择关键词。

    筛选关键词遵循以下两个原则

    1、 必须和宝贝相关

    类目,属性,信息都必须相关,数据里面有人群信息,尽量多找几个人群匹配的词。如上图,我们看到高分词【2014秋装新款女装】,这个词叫热搜词,它好用吗?未必!虽然字面上的信息,是适合的。但我们要先用淘宝指数看一下,毛衣类目是否适用这个词。

    很明显,不适合。

    如果还不信,可以用老A市场分析精灵验证一下搜索结果。搜索这个词,综合排序下,前3页,出现的比例是2.99%,和淘宝指数的2.78%是如此地接近。这意味着什么?展现的机会少了,你要在这个点,权重排名前4,才能进入这个词的搜索前3页。第一页有1个毛衣类目的,做到权重第一才可以出现在首页,这,这,有多难呀?

    2、 关键词得分高的优先选用(等同于必须要有人搜索有人购买)

    这个不用多说了。但是,我发现了好多坑,一个不留神就会被误导,用了烂词。数据完全一致,就宝贝数不一样。差一点点我就中招了。下图64.05分这个词数据应该是在120W个宝贝数的战场产生的。

    这不需要火眼金睛,看词的数据,很容易发现这类词,情况太普遍,太多人被坑过了。

    以下是我初步挑出来的词。

    根据之前分析产品的时候得到的产品特征词:【长款,长袖,单排扣,V领,韩版,直筒型,蝙蝠衣】来筛选出相关的关键词

    2014毛衣女韩版新款羊毛衫毛针织衫针织衫外套毛针织衫开衫针织衫 女 开衫 中长款长款毛衣外套女开衫中长款毛衣长袖针织衫v领羊毛衫女韩版毛衣外套宽松女秋装毛衣女韩版新款蝙蝠毛衣开衫

    第五步组合标题和第六步验证要合在一起讲,一边组合一遍验证,验证这个环节最麻烦

    一个标题是60个字符,折合成文字是30个字(一个汉字两个字符),标点符号算一个字符。

    先把找出来的关键词拆解成词根,词根的分法,也有好几种,我简单分两种就好了。

    名词:品类词

    毛衣,羊毛衫,毛针织衫,外套

    形容词:属性词(描述和形容商品的词)

    开衫,中长款,长袖,V领,韩版,宽松,秋装,新款,蝙蝠

    简单把词根组合起来,假设主打关键词是【长款毛衣外套女开衫】,那这个词就不要拆开,保持紧密性,而且放在前面,如果有多于的字符,可以用空格和其他词隔开。

    正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正(用正字,标记长度)

    长款毛衣外套女开衫 新款中长款韩版毛针织衫 秋装V领宽松羊毛衫

    29个字+两个空格,刚好60个字符。

    验证标题是个粗重活。

    主要验证两样东西

    1、关键词顺序,买家搜索习惯验证。

    关键词的顺序不同,结果可能不同。如,我在找词的时候就发现毛衣女装和女装毛衣,倒一下顺序,连搜索指数都不一样了。

    宝贝数也不一样。

    我们验证的渠道也就是淘宝指数和淘宝主搜(自己搜索看结果),可以对比搜索结果。

    2、关键词紧密关联性验证。

    紧密关联性也就是关键词不能拆分开,词根必须连在一起。很巧合,这个标题我验证过,没有需要紧密关联的情况。那我用另一个词来解释这个紧密关联性,【雪纺连衣裙】,词根是【雪纺】和【连衣裙】,通过淘宝主搜来验证。

    我们发现搜索的结果页上,很多展现的宝贝,标题里面雪纺和连衣裙这两个词根是紧密接在一起的。这种情况,说明这两个词根需要紧密关联。在SEO里面,紧密关联是完全匹配,完全匹配的权重是相对要高一点的。

    验证紧密关联性的渠道是淘宝主搜(搜索结果验证)。

    PS:紧密性不可能做到面面俱到,只要主打关键词保持紧密关联,其他的词尽量就好了,不用强求。

    说了这么多,不知道你懂了没有。做标题是整个环节中,是最简单又最复杂的一个环节。

    可能有人会问,我直接抄别人的标题,行不行?

    答案:行!

    这是绝招,一招搞定。但是要看你的实力是否能承载这个标题了。有时候,我偷懒,也是先抄一个,然后再找出自己的主打关键词,在抄来的标题上修改一下,加上自己的主打关键词,如果自己还发现了其他好词,就再把好词【塞】进去这个抄来的标题里面。

    初期的标题并不是决定因素,重要的是主打关键词。避免用词违规,不要用别人的品牌词,还有一些禁用的词,如淫秽词汇等。有不少朋友误用别人的品牌词,宝贝起来后就被淘宝删掉了(_`)

    在宝贝上架后,会产生宝贝的关键词数据,通过关键词数据来指导操作,这个比初期的打造标题可能要更为重要一些。

  • ?

    4个步骤分析运营数据

    窒息感

    展开

    数据能真实反映产品运营的效果,了解哪一块做的好,哪方面有待改进,转化率、留存率等核心指标(也可称为KPI)是多少。这里的产品包括实物、虚拟、内容、活动等,可以当做产品来运营的事物。

    01-数据分析目的

    这是数据分析的起因:为什么要进行数据分析。有了目的,后续开展的相关工作都是围绕这个目的展开。公司上半年会议提出要深度优化产品APP,因此运营部需要通过问卷调查和在官方微信号、微博、APP引导用户反馈使用情况。

    了解用户对之前的产品使用体验怎样,有哪些功能妨碍了正常使用,需要增添什么新功能满足新需求,以及其他意见和建议。这些都是通过分析反馈回来的问卷数据来确定的。

    02-收集什么数据

    有了目的后,就要着手制定执行方案,理清哪些是必要的关键性数据,哪些是辅助性数据,需要多少样本。既然要优化产品APP,那么就要考虑到:

    (1)APP相关数据:APP下载总量、打开次数、使用时长,分析竞争对手的APP。

    (2)用户留存率:某段时间内,有多少用户下载、使用或卸载。

    (3)平均访问时长:每次打开使用多长时间,使用哪部分内容较多,哪部分较少。

    (4)订单数据:通过APP产生的消费情况。

    所谓的关键性数据,就是涉及到产品活的好不好的真实反馈。

    03-数据统计分析

    先了解所要收集的数据代表的内容及统计方式,比如“APP下载总量”指在某段时间内APP在各应用平台的总下载量、新增下载量,同时分为安卓端和ISO端。同时使用数据图表描述,能用图表示的就不用文字叙述。

    对统计出的大量数据,分析出导致这样的结果的原因具体是什么,涉及到哪些因素,怎么去优化。

    04-意见和建议

    通过大量数据统计分析得出的结果,是否符合当初设定的目的和指标,或相差甚远。哪一块需要加强,哪方面需要保持,有什么好的建议让下次做的更好。可以开会讨论各抒己见,或单人面对面交流,或提供报告,多渠道收集反馈,详细分析。

    通过分析产品运营数据,能了解产品、活动或内容推送整体状态,为运营提供决策,也为周报、月报、季报的撰写及其他项目的规划提供分析素材。

  • ?

    这才是正确的数据分析步骤

    死亡谷

    展开

    做好数据分析需要考虑三个问题,数据从哪来,数据到哪去,数据怎么去?今天我们来讲讲数据怎么去的问题,也就是数据分析步骤。

    一、定义

    “勿忘初心,方得始终”,做数据分析前要想好针对的问题是什么,想通过数据分析解决什么问题,数据分析的结果能帮助你达到什么目的,对现阶段你的产品有何实际的意义。

    基于分析目的确定分析范围。比如你想分析用户流失原因,你分析的范围就是流失的用户,你不能去分析新增的用户,再比如电商类产品,你想对高价值用户进行分析,那么什么是高价值用户,那么你可能确定范围:“xx年xx月xx号-xx年xx月xx号,购买次数5次以上,总金额在3000元以上的用户”,这些都是我们在数据分析之前需要确定的,只有范围确定清楚了,分析的数据才具有指导意义。

    规划分析的进度和质量。比如说你要做数据的采集,你就需要考虑清楚用什么样的技术手段采集数据,用什么样的方法进行分析,然后这个过程中产生的误差多大范围内是可接受的,或者是自身有了预判,我知道这种数据分析方式会带来什么样的影响,对最后的结论带来多少干扰。

    二、测量

    测量包含收集获取数据和数据预处理。

    收集获取数据。是用问卷的方式定量分析?还是从服务器调取日志进行分析...,这些都是数据的来源

    预处理:比如说做调查问卷,对于回收来的问卷我们需要判断哪些数据是有效的,哪些数据是无效的,比如调查问卷共15道题,用户就答了一道题,这个就属于无效问卷,需要剔除出去,这个时候他的数据是不完整的,放进去反而会影响最终的数据结果。同样对数据库的数据也需要预处理,比如说你想统计新增用户,但是来了很多羊毛党用户,这部分用户对你是没有价值的,也需要处理掉。预处理的好坏,直接决定数据分析结果的质量。

    三、分析

    分析包含对数据的统计描述和针对问题的归纳和总结。

    数据的统计描述。统计是对数据的定量分析,描述是对数据的定性分析,就是对你的数据进行定性和定量的客观性描述。

    问题的归纳总结。这个是最重要的,也就是拿出我们的结论,数据本身没有价值,数据分析的结果才有价值。

    四、改进

    改进就是找到问题的解决方案和降低负面影响。

    给出解决方案。比如最近产品用户流失比较厉害,你通过调查问卷和用户访谈了解用户流失原因,当得到分析结果以后,你需要给出解决方案。是你的体验没做好,还是竞争对手挖墙脚,亦或是你的商品价格提高了...这些都是原因,找到主要原因,给出专业的解决方案,老板要的是方案,不关心你分析的过程。

    降低负面影响。比如电商的购物流程,浏览商品--》加入购物车--》下单--》支付--》完成购买,你通过漏斗模型分析,发现从加入购物车到下单流失很多,你通过数据分析发现流失的原因是设计上的问题,那么就可以重新优化设计方案,降低负面影响。

    五、控制

    数据分析是一个持续性的过程,所以需要持续的跟踪反馈,比如做数据的日报、周报、月报,它是一个非常持久的工作,而且数据分析的结果发出去以后,不同的人可能会有不同的看法,那么我们产品经理就需要收集不同的观点。

    更新迭代。更新迭代是我们产品经理的一份重要的工作内容,不论是功能上的更新迭代,还是数据上的更新迭代。有的人可能说为什么要做数据上的跟踪迭代呢?因为数据具有时效性,我们分析的往往是一个时间段内的数据,数据会随着时间的推移发生变化,根据这些变化,我们需要做一轮新的数据分析。

  • ?

    数据分析的8种方法详解

    维姬

    展开

    对于具体的业务场景问题,我们该怎么办呢?我们以一个电子商务网站为例,用数据分析产品 GrowingIO 对该网站进行快速地数据采集、清晰和可视化展示,然后给大家分享这 8 种常见的数据分析方法。

    1 数字和趋势

    看数字、看趋势是最基础展示数据信息的方式。

    在数据分析中,我们可以通过直观的数字或趋势图表,迅速了解例如市场的走势、订单的数量、业绩完成的情况等等,从而直观的吸收数据信息,有助于决策的准确性和实时性。

    对于电子商务网站,流量是非常重要的指标。

    上图中,我们将网站的访问用户量(UV)和页面浏览量(PV)等指标汇汇聚到统一的数据看板(Dashboard),并且实时更新。

    这样的一个数据看板,核心数字和趋势一目了然,对于首席增长官来说一目了然。

    2 维度分解

    当单一的数字或趋势过于宏观时,我们需要通过不同的维度对于数据进行分解,以获取更加精细的数据洞察。

    在选择维度时,需要仔细思考其对于分析结果的影响。

    举个例子,当监测到网站流量异常时,可以通过拆分地区、访问来源、设备、浏览器等等维度,发现问题所在。

    3 用户分群

    针对符合某种特定行为或背景信息的用户,进行归类处理,是我们常常讲到的用户分群(segmentation )的手段。

    我们也可以通过提炼某一群用户的特定信息,创建该群体用户的画像。 例如访问购物网站、寄送地址在北京的用户,可以被归类为“北京”用户群体。

    而针对“北京”用户群体,我们可以进一步观察他们购买产品的频度、类别、时间,这样我们就创建出该用户群体的画像。

    在数据分析中,我们往往针对特定行为、特定背景的用户进行有针对性的用户运营和产品优化,效果会更加明显。

    上图中,我们通过 GrowingIO 的用户分群功能将一次促销活动中支付失败的用户挑选出来,然后推送相应的优惠券。

    这样精准的营销推广,可以大幅度提高用户支付的意愿和销售金额。

    4 转化漏斗

    绝大部分商业变现的流程,都可以归纳为漏斗。

    漏斗分析是我们最常见的数据分析手段之一,无论是注册转化漏斗,还是电商下单的漏斗。

    通过漏斗分析可以从先到后还原用户转化的路径,分析每一个转化节点的效率。  其中,我们往往关注三个要点: 第一,从开始到结尾,整体的转化效率是多少?  第二,每一步的转化率是多少?  第三,哪一步流失最多,原因在什么地方?流失的用户符合哪些特征?

    上图中注册流程分为 3 个步骤,总体转化率为45.5%;

    也就是说有 1000 个用户来到注册页面,其中 455 个成功完成了注册。

    但是我们不难发现第二步的转化率是 56.8% ,显着低于第一步 89.3% 和第三步转化率 89.7%,可以推测第二步注册流程存在问题。

    显而易见第二步的提升空间是最大的,投入回报比肯定不低;如果要提高注册转化率,我们应该优先解决第二步。

    5 行为轨迹

    关注行为轨迹,是为了真实了解用户行为。

    数据指标本身往往只是真实情况的抽象,例如,网站分析如果只看访问用户量(UV)和页面访问量(PV)这类指标,断然是无法全面理解用户如何使用你的产品。通过大数据手段,还原用户的行为轨迹,有助于增长团队关注用户的实际体验、发现具体问题,根据用户使用习惯设计产品、投放内容。

    上图中展示了一位用户在某电商网站上的详细行为轨迹,从官网到落地页,再到商品详情页,最后又回到官网首页。

    网站购买转化率低,以往的业务数据无法告诉你具体的原因;通过分析上面的用户行为轨迹,可以发现一些产品和运营的问题(比如是不是商品不匹配等等),从而为决策提供依据。

    6 留存分析

    在人口红利逐渐消褪的时代,留住一个老用户的成本要远远低于获取一个新用户。

    每一款产品,每一项服务,都应该核心关注用户的留存,确保做实每一个客户。

    我们可以通过数据分析理解留存情况,也可以通过分析用户行为或行为组与回访之间的关联,找到提升留存的方法。

    在 LinkedIn,增长团队通过数据发现,如果新用户进来后添加 5 个以上的联系人(上图红色线条),那么他/她在 LinkedIn 上留存要远远高于那些没有添加联系人(上图绿色和紫色的线条)的留存。

    这样,添加联系人称为 LinkedIn 留存新用户的最核心手段之一。除了需要关注整体用户的留存情况之外,市场团队可以关注各个渠道获取用户的留存度,或各类内容吸引来的注册用户回访率,产品团队关注每一个新功能对于用户的回访的影响等等,这些都是常见的留存分析场景。

    7 A/B 测试

    A/B 测试用来对比不同产品设计/算法对结果的影响。

    产品在上线过程中经常会使用 A/B 测试来测试不同产品或者功能设计的效果,市场和运营可以通过 A/B 测试来完成不同渠道、内容、广告创意的效果评估。

    举个例子,我们设计了两种不同的产品交互形式,通过比较实验组(A 组)和对照组(B 组)的访问时长和页面浏览量两个衡量指标,来评估哪一种交互形式更佳。要进行 A/B 测试有两个必备因素:

    第一,有足够的时间进行测试;

    第二,数据量和数据密度较高。

    因为当产品流量不够大的时候,做 A/B 测试得到统计结果是很难的。而像 LinkedIn 这样大体量的公司,每天可以同时进行上千个 A/B 测试。所以 A/B 测试往往在公司数据规模较大时使用会更加精准,更快得到统计的结果。

    8 数学建模

    当一个商业目标与多种行为、画像等信息有关联性时,我们通常会使用数学建模、数据挖掘的手段进行建模,预测该商业结果的产生。

    作为一家 SaaS 企业,当我们需要预测判断客户的流失时,可以通过用户的行为数据、公司信息、用户画像等数据建立流失模型。

    利用统计学的方式进行一些组合和权重计算,从而得知用户满足哪些行为之后流失的可能性会更高。

    我们常常说,不能度量,就无法增长,数据分析对于企业商业价值的提升有着至关重要的作用。

    当然,仅仅掌握单纯的理论还远远不够,实践出真知。数据分析的方法大家不妨在自己日常工作中,有分析相关项目里尝试使用,相信可以事半功倍,创造更多商业价值。

  • ?

    数据分析全流程(内附案例)

    昔瞳

    展开

    (图片来源于网络)

    作者:苏格兰折耳喵

    来源: 运营喵是怎样炼成的 (yymzylc)

    (温馨提示:图片显示毛糙和不清楚,是分辨率过高的缘故,点击图片,即可看到高清大图。 )

    本文将对一个案例进行从数据采集、数据清洗、数据分析再到数据可视化的全流程分析,力求条理清晰的展现外部数据分析的强大威力。以下是本文的写作框架:

    1 分析背景

    1.1 分析原理---为什么选择分析虎嗅网

    在现今数据爆炸、信息质量良莠不齐的互联网时代,我们无时无刻不身处在互联网社会化媒体的“信息洪流”之中,因而无可避免的被它上面泛滥的信息所“裹挟”,也就是说,社会化媒体上的信息对现实世界中的每个人都有重大影响,社会化媒体是我们间接了解现实客观世界和主观世界的一面窗户,我们每时每刻都在受到它的影响。

    综合上述两类情形,可以得出这样的结论,透过社会化媒体,我们可以观察现实世界:

    由此, 社会化媒体是现实主客观世界的一面镜子,而它也会进一步影响人们的行为,如果我们对该领域中的优质媒体所发布的信息进行分析,除了可以了解该领域的发展进程和现状,还可以对该领域的人群行为进行一定程度的预判。

    鉴于此种情况,作为互联网从业者的笔者想分析一下互联网行业的一些现状,于是想到了虎嗅网。

    虎嗅网创办于2012年5月,是一个聚合优质创新信息与人群的新媒体平台。该平台专注于贡献原创、深度、犀利优质的商业资讯,围绕创新创业的观点进行剖析与交流。虎嗅网 的核心,是关注互联网及传统产业的融合、一系列明星公司(包括公众公司与创业型企业)的起落轨迹、产业潮汐的动力与趋势。

    因此,对该平台上的发布内容进行分析,对于研究互联网的发展进程和现状有一定的实际价值。

    1.2 本文的分析目的

    笔者在本项目中的分析目的主要有4个:

    (1)对虎嗅网内容运营方面的若干分析,主要是对发文量、收藏量、评论量等方面的描述性分析;

    (2)通过文本分析,对互联网行业的一些人、企业和细分领域进行趣味性的分析;

    (3)展现文本挖掘在数据分析领域的实用价值;

    (4)将杂芜无序的结构化数据和非结构化数据进行可视化,展现数据之美。

    1.3 分析方法---分析工具和分析类型

    本文中,笔者使用的数据分析工具如下:

    Python3.5.2(编程语言)

    Gensim(词向量、主题模型)

    Scikit-Learn(聚类和分类)

    Keras(深度学习框架)

    Tensorflow(深度学习框架)

    Jieba(分词和关键词提取)

    Excel(可视化)

    Seaborn(可视化)

    新浪微舆情(情绪语义分析)

    Bokeh(可视化)

    Gephi(网络可视化)

    Plotly(可视化)

    使用上述数据分析工具,笔者将进行2类数据分析:第一类是较为传统的、针对数值型数据的描述下统计分析,如阅读量、收藏量等在时间维度上的分布;另一类是本文的重头戏---深层次的文本挖掘,包括关键词提取、文章内容LDA主题模型分析、词向量/关联词分析、DTM模型、ATM模型、词汇分散图和词聚类分析。

    2 数据采集和文本预处理

    2.1 数据采集

    笔者使用爬虫采集了来自虎嗅网主页的文章(并不是全部的文章,但展示在主页的信息是主编精挑细选的,很具代表性),数据采集的时间区间为2012.05~2017.11,共计41,121篇。采集的字段为文章标题、发布时间、收藏量、评论量、正文内容、作者名称、作者自我简介、作者发文量,然后笔者人工提取4个特征,主要是 时间特征 (时点和周几)和 内容长度特征 (标题字数和文章字数),最终得到的数据如下图所示:

    2.2 数据预处理

    数据分析/挖掘领域有一条金科玉律:“Garbage in, Garbage out”,做好数据预处理,对于取得理想的分析结果来说是至关重要的。本文的数据规整主要是对文本数据进行清洗,处理的条目如下:

    (1) 文本分词

    要进行文本挖掘,分词是最为关键的一步,它直接影响后续的分析结果。笔者使用jieba来对文本进行分词处理,它有3类分词模式,即全模式、精确模式、搜索引擎模式:

    · 精确模式:试图将句子最精确地切开,适合文本分析;

    · 全模式:把句子中所有的可以成词的词语都扫描出来, 速度非常快,但是不能解决歧义;

    · 搜索引擎模式:在精确模式的基础上,对长词再次切分,提高召回率,适合用于搜索引擎分词。

    现以“新浪微舆情专注于社会化大数据的场景化应用”为例,3种分词模式的结果如下:

    【全模式】: 新浪/ 微舆情/ 新浪微舆情/ 专注/于/ 社会化/ 大数据/ 社会化大数据/ 的/ 场景化/ 应用

    【精确模式】: 新浪微舆情/ 专注/于/ 社会化大数据/ 的/ 场景化/ 应用

    【搜索引擎模式】:新浪,微舆情,新浪微舆情,专注,于,社会化,大数据,社会化大数据,的,场景化,应用

    为了避免歧义和切出符合预期效果的词汇,笔者采取的是精确(分词)模式。

    (2) 去停用词

    这里的去停用词包括以下三类:

    标点符号:, 。! /、*+-

    特殊符号:▲等

    无意义的虚词: “the”、“a”、“an”、“that”、“你”、“我”、“他们”、“想要”、“打开”、“可以”等

    (3) 去掉高频词、稀有词和计算Bigrams

    去掉高频词、稀有词是针对后续的主题模型(LDA、ATM)时使用的,主要是为了排除对区隔主题意义不大的词汇,最终得到类似于停用词的效果。

    Bigrams是为了自动探测出文本中的新词,基于词汇之间的共现关系---如果两个词经常一起毗邻出现,那么这两个词可以结合成一个新词,比如“数据”、“产品经理”经常一起出现在不同的段落里,那么,“数据_产品经理”则是二者合成出来的新词,只不过二者之间包含着下划线。

    3 描述性分析

    该部分中,笔者主要对数值型数据进行描述性的统计分析,它属于较为常规的数据分析,能揭示出一些问题,做到知其然。

    3.1 发文数量、评论量和收藏量的变化走势

    从下图可以看出,在2012.05~2017.11期间,以季度为单位,主页的发文数量起伏波动不大,在均值1800上下波动,进入2016年后,发文数量有明显提升。

    此外,一头(2012年第二季)一尾(2017年第四季)因为没有统计完全,所以发文数量较小。

    下图则是该时间段内收藏量和评论量的变化情况,评论量的变化不愠不火,起伏不大,但收藏量一直在攀升中,尤其是在2017年的第二季达到峰值。收藏量在一定程度上反映了文章的干货程度和价值性,读者认为有价值的文章才会去保留和收藏,反复阅读,含英咀华,这说明虎嗅的文章质量在不断提高,或读者的数量在增长。

    3.2 发文时间规律分析

    笔者从时间维度里提取出“周”和“时段”的信息,也就是开题提到的“人工特征”的提取,现在做文章分布数量的在“周”和“时”上的交叉分析,得到下图:

    上图是一个热力图,色块颜色上的由暖到冷表征数值的由大变小。很明显的可以看到,中间有一个颜色很明显的区域,即由“6时~19时”和“周一~周五”围成的矩形,也就是说,发文时间主要集中在工作日的白天。另外,周一到周五期间,6时~7时这个时间段是发文的高峰,说明虎嗅的内容运营人员倾向于在工作日的清晨发布文章,这也符合它的人群定位---TMT领域从业、创业者、投资人,他们中的许多人有晨读的习惯,喜欢在赶地铁、坐公交的过程中阅读虎嗅讯息。发文高峰还有9时-11时这个高峰,是为了提前应对读者午休时间的阅读,还有17时~18时,提前应对读者下班时间的阅读。

    3.3 相关性分析

    笔者一直很好奇,文章的评论量、收藏量和标题字数、文章字数是否存在统计学意义上的相关性关系。基于此,笔者绘制出能反映上述变量关系的两张图。

    首先,笔者做出了标题字数、文章字数和评论量之间的 气泡图 (圆形的气泡被六角星替代,但本质上还是气泡图)。

    上图中,横轴是文章字数,纵轴是标题字数,评论数大小由六角星的大小和颜色所反映,颜色越暖,数值越大,五角星越大,数值越大。从这张图可以看出,文章评论量较大的文章,绝大部分分布于由文章字数6000字、标题字数20字所构成的区域内。虎嗅网上的商业资讯文章大都具有原创、深度的特点,文章篇幅中长,意味着能把事情背后的来龙去脉论述清楚,而且标题要能够吸引人,引发读者的大量阅读,合适长度标题和正文篇幅才能做到这一点。

    接下来,笔者将收藏量、评论量和标题字数、文章字数绘制成一张3D立体图,X轴和Y轴分别为标题字数和正文字数,Z轴为收藏量和评论量所构成的 平面 ,通过旋转这个3维的Surface图,我们可以发现收藏量、评论量和标题字数、文章字数之间的相关关系。

    注意,上图的数值表示和前面几张图一样,颜色上的由暖到冷表示数值的由大到小,通过旋转各维度的截面,可以看到在正文字数5000字以内、标题字数15字左右的收藏量和评论量形成的截面出现“华山式”陡峰,因而这里的收藏量和评论量最大。

    3.4 城市提及分析

    在这里,笔者通过构建一个包含全国1~5线城市的词表,提取出经过预处理后的文本中的城市名称,根据提及频次的大小,绘制出 一张反映城市提及频次的地理分布地图 , 进而间接地了解各个城市互联网的发展状况(一般城市的提及跟互联网产业、产品和职位信息挂钩,能在一定程度上反映该城市互联网行业的发展态势)。

    上图反映的结果比较符合常识,北上深广杭这些一线城市的提及次数最多,它们是互联网行业发展的重镇。值得注意的是,长三角地区的大块区域(长江三角洲城市群,它包含 上海 , 江苏省 的 南京 、 无锡 、 常州 、 苏州 、 南通 、 盐城 、 扬州 、 镇江 、 泰州 , 浙江省 的 杭州 、 宁波 、 嘉兴 、 湖州 、 绍兴 、 金华 、 舟山 、 台州 , 安徽省 的 合肥 、 芜湖 、 马鞍山 、 铜陵 、 安庆 、 滁州 、 池州 、 宣城 )呈现出较高的热度值,直接说明这些城市在虎嗅网各类资讯文章中的提及次数较多,结合国家政策和地区因素,可以这样理解地图中反映的这个事实:

    长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。

    长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。

    接下来,笔者将抽取文本中城市之间的 共现关系 ,也就是城市之间两两同时出现的频率,在一定程度上反映出城市间经济、文化、政策等方面的相关关系,共现频次越高,说明二者之间的联系紧密程度越高,抽取出的结果如下表所示:

    将上述结果绘制成如下动态的流向图:

    由于虎嗅网上的文章大多涉及创业、政策、商业方面的内容,因而这种城市之间的共现关系反映出城际间在资源、人员或者行业方面的关联关系,本动态图中,主要反映的是北上广深杭(网络中的枢纽节点)之间的相互流动关系和这几个一线城市向中西部城市的单向流动情形。流动量大、交错密集的区域无疑是中国最发达的3个城市群和其他几个新兴的城市群:

    京津冀城市群

    长江三角洲城市群

    珠江三角洲城市群

    中原城市群

    成渝城市群

    长江中游城市群

    上面的数据分析是基于数值型数据的描述性分析,接下来,笔者将进行更为深入的文本挖掘。

    4 文本挖掘

    数据挖掘是从有结构的数据库中鉴别出有效的、新颖的、可能有用的并最终可理解的模式;而文本挖掘(在文本数据库也称为文本数据挖掘或者知识发现)是从大量非结构的数据中提炼出模式,也就是有用的信息或知识的半自动化过程。

    本文的文本挖掘部分主要涉及高频词统计/关键词提取/关键词云、文章标题聚类、文章内容聚类、文章内容LDA主题模型分析、词向量/关联词分析、ATM模型、词汇分散图和词聚类分析。

    4.1 关键词提取

    对于关键词提取,笔者没有采取词频统计的方法,因为词频统计的逻辑是:一个词在文章中出现的次数越多,则它就越重要。因而,笔者采用的是 TF-IDF (termfrequency–inverse document frequency)的关键词提取方法:

    它用以评估一字/词对于一个文件集或一个语料库中的其中一份文件的重要程度,字/词的重要性会随着它在文件中出现的次数成正比增加,但同时会随着它在语料库中出现的频率成反比下降。

    由此可见,在提取某段文本的关键信息时,关键词提取较词频统计更为可取,能提取出对某段文本具有重要意义的关键词。

    下面是笔者利用jieba在经预处理...

  • ?

    怎么样Excel做数据分析?这几个步骤帮到你

    美人

    展开

    每个人都会有机会进行数据展示,为什么别人展示永远获得正视,而我的展示永远只有自己愿意去看,别人在看手机?那怎样做数据图表分析呢请看以下步骤:

    如何对表格进行修饰,本次小编带来两个技巧,一是使用“套用表格格式”,和使用“条件格式”。二是带领大家学会养成修饰表格的思维。

    第一步是对表格进行粗略的修饰调整,思维:行高、列宽、对齐方式、表格线等;

    使用“套用表格格式”、“条件格式”之后看数据不再枯燥无味,而且还更有看头。“条件格式”可以将筛选条件转换为颜色可视化,从而达到一目了然的效果。

    第一个技巧,①“套用表格格式”。方法:任一单元格→开始→套用表格格式。

    ②“条件格式”,方法:选中单元格区域→开始→条件格式。

    条件1:高于平均值

    条件2:数据条

    条件3:色阶

    第二个技巧:养成修饰图表的思维。这次举例柱形图的修饰例子,其他希望大家动用类似的方法进行模拟实践。

    步骤一:根据销售数据建立柱状图,建立方法可参考。选择数据源→插入→柱状图→选择数据源→编辑坐标

    步骤二:添加辅助线。选择数据源→→添加→点击柱体右键,设置数据系列格式→次坐标轴→选中柱体,右键更改图表类型→折线图。

    希望回答对你能有所帮助,如果觉得不错就来点个赞或关注吧,感谢各位了!

  • ?

    十种常用的数据分析方法

    Zene

    展开

    道家强调四个字,叫“道、法、术、器”。

    层次区别:

    “器”是指物品或工具,在数据分析领域指的就是数据分析的产品或工具,“工欲善其事,必先利其器”;

    “术”是指操作技术,是技能的高低、效率的高下,如对分析工具使用的技术(比如用Excel进行数据分析的水平);

    “法”是指选择的方法,有句话说“选择比努力重要”;

    “道”是指方向,是指导思想,是战略。

    在数据分析和产品、运营优化方面,数据分析方法是其核心,属于“法”和“术”的层次。

    那么如何做好数据分析呢,今天我们来讲讲互联网运营中的十大数据分析方法。

    01 细分分析

    细分分析是分析的基础,单一维度下的指标数据的信息价值很低。

    细分方法可以分为两类, 一类逐步分析, 比如:来北京市的访客可分为朝阳,海淀等区; 另一类是维度交叉, 如:来自付费SEM的新访客。

    细分用于解决所有问题。

    比如漏斗转化,实际上就是把转化过程按照步骤进行细分,流量渠道的分析和评估也需要大量用到细分的方法。

    02 对比分析

    对比分析主要是指将两个相互联系的指标数据进行比较,从数量上展示和说明研究对象的规模大小,水平高低,速度快慢等相对数值, 通过相同维度下的指标对比,可以发现,找出业务在不同阶段的问题。

    常见的对比方法包括: 时间对比,空间对比,标准对比。

    时间对比有三种: 同比,环比,定基比。

    例如: 本周和上周进行对比就是环比;本月第一周和上月第一周对比就是同比;所有数据同今年的第一周对比则为定基比。通过三种方式,可以分析业务增长水平,速度等信息。

    03 漏斗分析

    转化漏斗分析是业务分析的基本模型, 最常见的是把最终的转化设置为某种目的的实现,最典型的就是完成交易。但也可以是其他任何目的的实现,比如一次使用app的时间超过10分钟。

    漏斗帮助我们解决两方面的问题:

    在一个过程中是否发生泄漏,如果有泄漏,我们能在漏斗中看到,并且能够通过进一步的分析堵住这个泄漏点。

    在一个过程中是否出现了其他不应该出现的过程,造成转化主进程收到损害。

    04 同期群分析

    同期群(cohort)分析在数据运营领域十分重要,互联网运营特别需要仔细洞察留存情况。 通过对性质完全一样的可对比群体的留存情况的比较,来分析哪些因素影响用户的留存。

    同期群分析深受欢迎的重要原因是十分简单,但却十分直观。 同期群只用简单的一个图表,直接描述了用户在一段时间周期(甚至是整个LTV)的留存或流失变化情况。

    以前留存分析只要用户有回访即定义为留存,这会导致留存指标虚高。

    05 聚类分析

    聚类分析具有简单,直观的特征, 网站分析中的聚类主要分为:用户,页面或内容,来源。

    用户聚类主要体现为用户分群,用户标签法;页面聚类则主要是相似,相关页面分组法;来源聚类主要包括渠道,关键词等。

    例如: 在页面分析中,经常存在带?参数的页面。 比如: 资讯详情页面,商品页面等,都属于同一类页面。简单的分析容易造成跳出率,退出率等指标不准确的问题,通过聚类分析可以获取同类页面的准确数据用于分析场景。

    06 AB测试

    增长黑客的一个主要思想之一,是不要做一个大而全的东西,而是不断做出能够快速验证的小而精的东西。 快速验证,那如何验证呢?主要方法就是AB测试。

    比如: 你发现漏斗转化中中间有漏洞,假设一定是商品价格问题导致了流失,你看到了问题-漏斗,也想出了主意-改变定价。但主意是否正确,要看真实的用户反应,于是采用AB测试,一部分用户还是看到老价格,一部分用户看到新价格,若你的主意真的管用,新价格就应该有更好的转化,若真如此,新价格就应该确定下来,如此反复优化。

    07 埋点分析

    只有采集了足够的基础数据,才能通过各种分析方法得到需要的分析结果。

    通过分析用户行为,并细分为:浏览行为,轻度交互,重度交互,交易行为,对于浏览行为和轻度交互行为的点击按钮等事件,因其使用频繁,数据简单,采用无埋点技术实现自助埋点,即可以提高数据分析的实效性,需要的数据可立即提取,又大量减少技术人员的工作量,需要采集更丰富信息的行为。

    如: 重度交互(注册,邀请好友等)和交易事件(加购物车,下订单等)则通过SDK批量埋点的方式来实施。

    08 来源分析

    流量红利消失,我们对获客来源的重视度极高,如何有效的标注用户来源,至关重要。

    传统分析工具,渠道分析仅有单一维度,要深入分析不同渠道不同阶段效果,SEM付费搜索等来源渠道和用户所在地区进行交叉分析,得出不同区域的获客详细信息,维度越细,分析结果也越有价值。

    09 用户分析

    用户分析是互联网运营的核心, 常用的分析方法包括:活跃分析,留存分析,用户分群,用户画像,用户细查等。

    可将用户活跃细分为浏览活跃,互动活跃,交易活跃等,通过活跃行为的细分,掌握关键行为指标;通过用户行为事件序列,用户属性进行分群,观察分群用户的访问,浏览,注册,互动,交易等行为,从而真正把握不同用户类型的特点,提供有针对性的产品和服务。

    用户画像基于自动标签系统将用户完整的画像描绘清晰,更有力的支撑运营决策。

    10 表单分析

    填写表单是每个平台与用户交互的必备环节,优秀的表单设计,对转化率的提升起到重要作用。

    用户从进入表单页面之时起,就产生了微漏斗,从进入总人数到最终完成并成功提交表单人数,这个过程之中,有多少人开始填写表单,填写表单时,遇到了什么困难导致无法完成表单,都影响最终的转化效果。

    以上是常见的数据分析方法,更多应用方法需要根据业务场景灵活应用。

  • ?

    数据分析建立六步骤

    仇冰旋

    展开

    一、什么是数据分析?

    二、数据分析的分类

    数据分析的三大作用:现状分析、原因分析、预测分析。

    三、数据分析的六部曲

    1.明确目的和思路

    首先先明确分析目的,然后梳理分析思路,并搭建分析框架,把分析目的分解成若干个不同的分析要点,即如何具体开展数据分析,需要从哪几个角度进行分析,采用哪些分析指标(各类分析指标需合理搭配使用)。同时,确保分析框架的体系化和逻辑性。

    2.数据收集

    一般数据来源于四种方式:数据库、第三方数据统计工具、专业的调研机构的统计年鉴或报告、市场调查。

    3.数据处理

    数据处理主要包括数据清洗、数据转化、数据抽取、数据合并、数据计算等处理方法,将各种原始数据加工成为数据分析所要求的样式。

    4.数据分析

    常用的数据分析工具,掌握Excel的数据透视表,就能解决大多数的问题。需要的话,可以再有针对性的学习SPSS、R等工具。

    数据挖掘是一种高级的数据分析方法,侧重解决四类数据分析问题:分类、聚类、关联和预测,重点在寻找模式与规律。

    5.数据展现

    一般情况下,数据是通过表格和图形的方式来呈现的。

    常用的数据图表包括饼图、柱形图、条形图、折线图、气泡图、散点图、雷达图等。进一步加工整理变成我们需要的图形,如金字塔图、矩阵图、漏斗图、帕雷托图等。

    一般能用图说明问题的就不用表格,能用表说明问题的就不用文字。

    图表制作的五个步骤:

    1、确定要表达主题

    2、确定哪种图表最适合

    3、选择数据制作图表

    4、检查是否真实反映数据

    5、检查是否表达观点

    常用图表类型和作用:

    6.报告撰写

    一份好的数据分析报告,首先需要有一个好的分析框架,并且图文并茂,层次明晰,能够让阅读者一目了然。

    结构清晰、主次分明可以使阅读者正确理解报告内容;图文并茂,可以令数据更加生动活泼,提高视觉冲击力,有助于阅读者更形象、直观地看清楚问题和结论,从而产生思考。

    好的数据分析报告需要有明确的结论、建议或解决方案。

    四、数据分析的四大误区

    1.分析目的不明确,为了分析而分析,这是菜鸟常常容易出现的问题;

    2.缺乏行业、公司业务认知,分析结果偏离实际。数据必须和业务结合才有意义。摸清楚所在产业链的整个结构,对行业的上游和下游的经营情况有大致的了解,再根据业务当前的需要,制定发展计划,归类出需要整理的数据。同时,熟悉业务才能看到数据背后隐藏的信息;

    3.为了方法而方法,为了工具而工具,只要能解决问题的方法和工具就是好的方法和工具;

    4.数据本身是客观的,但被解读出来的数据是主观的。同样的数据由不同的人分析很可能得出完全相反的结论,所以一定不能提前带着观点去分析。

    内容来源:小蚊子数据分析

    百家号-【袁帅数据分析运营】运营者:袁帅,互联网数据分析运营实践者。会展业信息化、数字化领域专家。认证数据分析师、网络营销师、SEM搜索引擎营销师、SEO工程师、电子商务职业经理人。

做数据分析步骤

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP