中企动力 > 商学院 > 做数据分析的
  • ?

    通过基础数据进行数据分析的实例

    冰箱

    展开

    国产〇〇柒

    前几天朋友给了一组行业同行表现数据,让帮忙分析一下自己的店铺问题所在和表现如何。今天我通过这个小示例来跟大家简单分享一下一些基础的分析方法。

    (开始之前先跟小伙伴们说明一下,本案例是一个简单的基于一组数据而进行的分析,并通过这个给大家一个相对比较概括的方法介绍,实际分析操作中会遇到更复杂的情况,而且实际分析中的挖掘深度要比本案例要深)

    下边是朋友提供的一组数据:

    图片:基础数据表01.png

    为了保护隐私避免侵权,公司名称这里就以字母替代

    通过上图我们可以看到这是几组非常简单的数据,这些数据我们都可以在自己的店铺采集到,但是我们也可以看到这组数据有一个问题,多数数据缺乏一个时间参数,从表格中我们只能看到最后两项有一个准确的时间界定,其他项数据均没有这个界定。不过这里我们采用对比模糊分析的方法,不用考虑数据是否精确,只需要进行对比即可,所以缺乏时间参数问题也不太大。接下来我们通过以下几个步骤进行分析。

    一,做筛选

    首先我们要对这些数据进行筛选,只留可对比的数据组,剔除无用的数据。方法很简单,这里我们通过公司名称进行检测,进行主营产品类目检查(这里我是以朋友公司产品类目对基础的),通过分析发现C、G、M三个公司的产品与其他不符,这里我们就直接剔除这三家的数据不做参考。

    整理后的数据如图:

    图片:整理后的数据02.png

    (再更复杂的分析中,剔除噪音数据并非这么简单,这里是用这个简单的方式说明一下这个操作步骤,大家在操作中要根据自己实际情况进行数据甄别,甄别的过程是非常复杂和繁琐的,如果这一步出错,做出的分析结果的准确性就很难得到保障)

    二,做归类

    无用的数据剔除之后,接下来我们就是要对现有的数据进行归类处理。

    通过图表数据的阅读,我们可以把里面的数据简单的归为三类:交易数据、回复率、行为数据。交易数据这里主要就是包含前三项,一达通和信保;回复率就是询盘回复率的表现数据;行为数据这里主要是指人的行为,访客和季度、月询盘数。归类后如图:

    图片:归类后的数据03.png

    这三类数据是有区别的,交易数据和回复率我们可以统一称之为“操作数据”或“加权数据”,因为这些数据的控制权基本掌握在我们手里,我们在这部分数据的积累上有较大的主动权。行为数据可以称之为“结果数据”,这部分数据的直接控制权来自于客户行为,我们无法直接去干预,我们只能通过提升“操作数据”的方法去影响这个“结果数据”。我们之前的操作都是为了这个“结果数据”有较好的表现。

    数据归类之后,我们开始分析

    三,做分析

    由于上面拿到的三类数据有两类属于“操作数据”,这两类对“结果数据”只能产生部分影响,这里我们就不关注这两项数据了(在全局分析中,这些局部数据都可以作为一个参数加入到分析的行列)。这里我们只关注结果数据。这里的结果数据中虽然有三组数据,由于其中一项数据缺少时间参数,所以我们可以把三项数据当作两项去分析,季度和月询盘量可以当作一个有效参数,这个时候我们就把数据优化成两类:访客和询盘。当看到这两个数据的时候我们很简单的就会联想到由他们而衍生出来的一个数据:“转化率”,这个数据能够比较真实的反馈平台效果。接下来我们计算出每一组的“转化率”数据如图(按照月度参数计算):

    图片:转化率04.png

    从上图可以看出“转化率”排名如下:

    H > K > P > A = F > B > D = E > I = O > J > L >N

    当然,转化率高并不代表代表一个店铺的表现就是第一名,这个数据只能判断该店铺引流的精准程度(当然如果需要更深入的分析精准度是需要深入到询盘质量和成交转化中去的,这里不做过多介绍)。我们可以观察一下N店铺的转化率,0.43%的数据与其他店铺相比较差距较大,该店铺的访客流量占据第一位,但是反馈数据在该表中与其他几家并列最后一名,该店铺就需要认真的分析访客来源和未转化的原因(这里就牵扯到了其他数据的数据分析,这里不多介绍)。

    当然,从数据组中我们一共可以看到这些数据条件,也可以计算出一个数据进行比较。但是这并不太说明什么太多的问题。接下来我们用加入条件的方法来进一步深入分析。这里我加入的数据是店铺的产品”上架产品数量“这个参数。加入数据到图标(实际操作中我们可以加入更多的可参考数据进行数据分析),如图:

    图片:加入产品数量条件05.png

    从表格中可以看出产品数量过万的有A B J N ,产品数量5000以上的有D I K L O P,产品数量低于5000的有E F H。从阿里规则上来说,店铺产品数量过多,店铺过于臃肿并不太好,但是这并不代表不用去发布产品了,其实我们真正要做到的是产品数量适中,做到全覆盖即可。从以上店铺的产品数量数据表现可以看出来,该行业的产品数量需要大于5000以上,如果低于5000,应该做不到全覆盖,可能会浪费很多流量(这里是从数据表大致得出结论,如要深入分析具体多少产品数量合适,还需要从其他方面进行综合分析)。我们也可以看到低于5000的几个店铺的访客量分别为:4000,7000,9000(里面有P4P引流数据,所以该数据仅作参考,不可作为实际数据参考),这个数据量并不算高,特别是H,访客是最少,产品数量也是最少,但是我们可以发现H的转化率是最高的,我们这里假设,H拥有A的产品数量(覆盖面),保持转化率不变,其他条件随覆盖面递增,这个时候我们可以看到H的数据应该是这样的,如图:

    图片:修改数据后转化询盘06.png

    当然这是一个理想的假设状态,覆盖,访客,转化这些数据都是的动态的,越是大的数据体量对转化率的控制难度越大,但是不可否认的是,如果产品覆盖能够达到一定程度的话,对访客和询盘转化肯定是有益处的,示例中虽然达不到492条的完美状态,但是询盘数量增加2倍应该还是有保障的。从这些数据的表现我们也可以看到覆盖的重要性(其实覆盖是一个很复杂的事情,并不是咱们想象的那种把产品和关键词上传上去就完事儿的事情,有时间可以跟大家深入交流关于覆盖的问题)。其实这些数据中还有很多可以对比解读的地方,我们今天先这里,以覆盖落幕。

  • ?

    什么是数据分析?数据分析的作用是什么?

    嵇又槐

    展开

    1.什么是数据分析?

    数据分析的目的是把隐藏在一些看似杂乱无章的数据背后的信息提炼出来,总结出所研究对象的内在规律。在实际工作中,数据分析能够帮助管理者进行判断和决策,以便采取适当策略与行动。比如:企业的高管希望通过市场分析和研究,把握当前产品的市场动向,从而制定合理的产品研发和销售计划,这就必须依赖数据分析才能够完成。

    简单的说,就是对数据进行分析,比较专业的说法是,数据分析是指用适当的统计分析方法对收集来的大量数据进行分析,未提取有用信息和形成结论而对数据加以详细研究和概括总结的过程。以求最大化地开发数据的功能,发挥数据的作用。

    数据分析包含“数据”和“分析”两个方面一方面包括加工和整理数据,另一方面也包括分析数据,从中提取有价值的信息并形成对业务有帮助的结论。

    数据分析的成果通常以分析报告的形式呈现。对于数据分析报告,分析就是论点,数据就是论据,两者缺一不可。

    2.数据分析类别

    其中,探索性数据分析侧重于在数据中发现新的特征,而验证性数据分析则侧重于验证已有假设的真伪证明。

    数据分析的划分:描述性数据分析、探索性数据分析、验证性数据分析。

    1)描述性数据分析:属于初级数据分析,常见的分析方法有对比分析法、平均分析法、交叉分析法。

    2)探索性数据分析:侧重于再数据之中发现新的特征

    3)验证性数据分析:侧重于验证已有假设的真伪证明

    其中探索性数据分析和验证性数据分析属于高级数据分析,常见的分析方法有相关分析、因子分析、回归分析等等。

    3.数据分析的作用

    数据分析在日常企业运营中主要有三大作用:

    1.现状分析

    简单的说就是告诉你过去发生了什么。

    具体表现在:

    第一,告诉你企业现阶段的整体运营情况,通过各个经营指标的完成情况来衡量企业的运营状态,以说明企业整体运营是更好了还是坏了,好的程度是如何,坏的程度又到哪里。

    第二,告诉你企业各项业务的构成,让你了解企业各项业务的发展及变动情况,对企业经营状况有更深入的了解。

    现状分析一般通过日常通报来完成,如日报、周报、月报等形式。

    2.原因分析

    简单的说就是告诉你某一现状为什么发生。经过第一阶段的现状分析,我们对企业的运营情况有了一个基本的了解,但是不知道运营情况具体好在哪里,差在哪里,是什么原因引起的。这时候我们就需要开展原因分析,以进一步确定业务变动的具体原因。

    原因分析一般通过专题分析来完成,根据企业运营情况选择针对某一现状进行原因分析。

    3.预测分析

    简单来说就是告诉你将来会发生什么。

    在了解企业运营现状后,有时候还需要对企业未来发展趋势做出预测,为企业制定经营目标以及提供有效的策略参考与决策依据,以确保企业的可持续健康发展。

    预测分析一般通过专题分析来完成,通常在制定企业季度、年度等计划时进行,其开展的频率没有现状分析及原因分析高。

    什么时候开展什么样的数据分析,需要根据自身的需求及目的来确定。

    分享 IT 技术和行业经验,请关注-技术学派。

  • ?

    4个关键,如何清晰的做好数据分析

    吉剑

    展开

    文 | 帆软数据应用研究院 船长

    数据分析就近几年看来,越来越有一种像通用技能发展的趋势,从生产、研发、市场、销售到运营,多多少会存在数据分析的需求。

    关于数据分析,网络上有不少分析报告案例,但细细读来,好多都缺少辨证,逻辑不严谨,又或者分析得浅尝辄止。恰逢最近读了《大数据分析的道与术》,是一套很完整的理论书籍,结合自己多年的数据从业经验,积累了一些心得,想与大家分享。

    作为一个唯物主义者,做事总是爱讲方法论。曾经“农村包围城市,武装夺取政权”作为方法论的代名词,总是挂在嘴边。那么数据分析工作,方法论是什么呢?是“先道后术,以道驭术”,也就是先了解数据分析的核心原则,再掌握数据分析的一些关键技术。

    什么是数据分析?

    数据分析是指用适当的统计分析方法对收集来的大量数据进行分析,为提取有用信息和形成结论而对数据加以详细研究和概括总结的过程。其实简单理解,数据分析本身就是“数据”和“分析”两块工作。一方面是采集、加工、整理数据,另一方面是结合数据背景分析数据,从中提取出对业务有帮助的结论。

    数据分析的成果通常是数据分析报告

    。常见的就是带图、表的PPT、PDF文件,也有一些Web版的图表系统(有兴趣的,可以在应用商店搜索“数据分析”,有各类演示系统可以体验)。对于数据分析报告,类似议论文,分析是论点,数据就是论据。

    数据分析有什么用呢?这个经常被问到,尤其当一篇花里胡哨的报告在网上发布,就有人说报告没用,顺带着撇一嘴数据分析也没用。

    数据分析对企业的巨大价值体现在业务发展的前期(探索期)或阶段性改进期(颠覆期)。当探索和变革业务时,企业需要数据分析去明确业务中的问题、机遇及解决方案。企业最大的成本是决策成本,而数据分析是提高企业决策能力的关键;当业务模式相对成熟时,企业则需要数据建模来提升业务效率,减少运营成本等。

    那,数据分析又有哪些普遍又典型的应用场景呢?笔者经验,主要是三个:掌握业务状态、分析业务潜力、评估业务进展。

    场景-掌握业务状态

    :我们需要通过对核心指标进行监控、解读和分析,掌握业务经营状况。比如某日销量出现异常波动,需要数据分析来定位原因。(产品A本周销量异常上涨10%,是什么原因?怎么分析?)在比如月末、季末部门做关键业务指标总结,并做业务发展趋势分析等。(本季度的关键数据指标如何?各项业务进展如何?都有哪些积极消极因素,具体多大影响,下个月、下个季度业务则呢么发展?)譬如下方用finereport搭建的数据平台,统计监测的业务数据。按照制定的业务分析规则展示,可以清晰地看到哪个环节出错。

    销售额分析

    销售团队分析

    销售指标追踪

    场景-分析业务潜力

    :产品当前的主要问题是什么?下一步的发展潜力在哪里?从数据中挖掘问题原因并提出对策,指明产品的下一步改进方向。比如商品B近3个月流失了1000个会员,原因是什么(分析原因)?如何减少会员流失(找对策)?

    场景-评估业务进展

    :新上线的产品策略或新推进的运营活动,带来了多少业绩提升?项目的覆盖面和影响面如何?其中存在怎样的问题,如何进一步优化等等。比如针对部分客户,设计全新的促销策略,在本月执行后,如何评价促销策略带来的业绩提升?是否目标客户群比上个月购买额增长可以作为促销策略的成果?

    既然数据分析有如此之多的应用场景和使用价值,那么怎么才能做好数据分析呢?只能说,太难,既需要工具技巧的掌握,又要有能明察秋毫洞若观火的业务经验。但相比而言,个人觉得后者更为重要,就像如果只知道方法论,但没有对业务的理解,如何实行的套路,数据分析只会浮于表面,既不能挖掘问题原因,也不能提供解决方案。

    做好数据分析,不谈技术,先认清以下4个关键。

    1、业务调研:理解业务是基础,否则分析是无本之木,甚至是个人意淫。

    2、创新思考:广阔的知识面和积极的思考,是分析思路的源泉,数据分析的创新思考,实质上就是从更多的思路进行分析,找出最合理的思路。

    3、逻辑推理:对数据指标作出正确的归因分析和判断。

    4、可行建议:产生对业务切实有效的改进建议和执行方案。

    “业务调研”是数据分析的起点,也是获取分析思路的基础,但是需要兼具深度和广度的“创新思考”,才能获取更独到的分析思路。分析思路也可以认为是统计数据的角度,完成数据统计后,需要“逻辑推理”来保证从数据到结论判断的正确性。最后,用“可行建议”来保证分析结论的落地执行,产生可量化的业绩。这就是数据分析从业务中来,回到业务中取得完成过程。

    本文是笔者《大数据分析道与术》读书笔记第1篇,浅述了一下。下周将结合自身经验,对业务调研、创新思考、逻辑推理、可行建议逐一做解读分析。

    文 |

    帆软数据应用研究院

    船长

  • ?

    如何做好数据分析?

    缄默

    展开

    先给大家讲一个数据分析的小故事,发生于四百年前。

    在中世纪,科学界最大的争论在于,到底是地球围绕太阳旋转,还是太阳围绕地球旋转。那时候有一位伟大的天文学家叫第谷·布拉赫,为了解决这个人类科学最初的大争论,开始了寻求数据支持的伟大征程。当时丹麦国王专门为他建了一个天文台,配备了齐全的观测仪器。从那时之后的20年里,第谷每天晚上风雨无阻地观测行星运动的轨迹,把每个行星每天晚上的位置,精确地记录下来,是天文史上第一个真正地开始收集大数据的天文学家,但是他没有足够的智慧从中发现行星运行的规律。 后来,第谷的学生开普勒拿到大量的数据之后,摒弃了每一天的视角,他从每一年的视角来看:地球每365天就会回到原点,而其他的行星还在自己的轨道上运动。他把行星运动的轨道画出来了,得出了所有行星围绕太阳运动的结论。在此基础上,开普勒提出了著名的行星运动三大定律,成就了近代天文学的开端。

    这个故事告诉我们:

    1、数据是数据分析的基础。如果没有第谷20年如一日的观测记录,开普勒不可能取得如今的成就;而如果没有开普勒,第谷的所有观测数据,都将成为一堆毫无用处的废纸。

    2、要客观的分析数据,具备数据分析的视角和思维。第谷一直以“地心说”的思想观察数据变化,开普勒接受了哥白尼的“日心说”思想,在新的角度上结合观测数据才发现行星运动的定律。

    3、要学会合理利用数据。开普勒通过每年的观测数据,才发现了行星运动规律,当我们面对海量数据的时候,最需要的是独具慧眼,在繁杂的数据中找到我们需要的数据,才能真正的将数据运用起来。

  • ?

    「零一」《从0开始,教你做数据分析》—01篇

    邓凤妖

    展开

    大家好,我是零一,今天开始给大家带来基础系列教程

    本系列文章适合以下情况的读者:

    1丶淘宝店铺运营或者店长,目前还不会做数据分析,渴望提升自己

    2丶打算在淘宝开店的朋友,目前尚在混派代学习中

    3丶其他对数据分析感兴趣的朋友,尚在入门阶段

    本文是第一篇会比较基础,涉及的概念也少,旨在让读者动手了解工具。

    我们直奔主题

    数据分析的概念必须搞清楚。简单点说,数据分析是将数据进行清洗后,把隐藏在数据背后的信息提炼出来。

    另外,值得一说的是,数据分析是获取新知识的新途径。

    下面看一下菜鸟跟数据分析师的区别,引自《谁说菜鸟不会数据分析》一书

    可以看出来,专业一点的数据玩家的思路会非常清晰,而且会以目的为导向,建议大家参考分析师的思路。

    数据分析的过程已经有非常多的前人做出了总结,我还是引用书中的结果

    分别是,明确分析目的和内容——数据收集——数据处理——数据分析——数据展现——报告撰写

    做任何事情都要有目的,做数据分析也不例外,而且明确目的在数据分析里面上升到了一个非常重要的高度,甚至决定了你后面所做的一切有没有价值。

    做数据分析必须运用工具,没有工具几乎无从开展,大家看下一般数据分析有哪些工具

    可以看到,底层是数据库,在数据量大的情况下,需要动用到数据库。

    报告层是Crystal Reports(动态和可操作的报表,没用过)

    分析层是分析的工具,从左到右分别是Excel(Office套装里面的一员,据说可以和SAS媲美的数据工具之一),UCINET(社会网络关系分析,没用过),SAS(最古老最专业的数据分析工具),SPSS(IBM的工具,以简单易用闻名),clementine(已经被IBM收购属于SPSS系列)

    最后是表现层,也就是做报告的一系列工具,我只接触过PPT和水晶易表,一般会用PPT就可以了。

    接下来讲的数据分析,选择的是大家比较熟悉的Excel,Excel做深入分析的时候比较麻烦也有局限性,但就上手指数来说,Excel是排第一的。数据量在一百万条以内是足够的了。

    我选用的版本是Excel 2010

    第一步,我们要明确分析的目的和内容。因为是实例,我假设

    目的:了解淘宝美容行业的市场情况

    内容:1丶行业分析,2丶属性分析(采用折线图和饼图直观反映行业趋势和容量)

    第二步,数据收集,一般手动收集,也可以用工具收集。

    这里提供工具给大家做练习。提供的是仅支持美容大类的版本,运行环境,excel2010/2013,32位xp/WIN 7,假如没有生e经,那没关系,下面用到的数据源一样会共享给大家,拿着数据源就可以一步一步跟着操作。

    数据来源:生e经(必须有开通生e经,并能查看相应行业数据)

    数据宽度:21(月)

    因为生e经按月展示数据,因此这里的数据宽度,就是月份数。

    打开表格,然后,按下列图片次序操作

    自己登陆生e经复制生e经的地址进来。登陆好,就把窗口关闭即可。其中c2代表服务器编号是2。

    选择正确的服务器编号才能正常抓取。

    选择好后,点开始抓取数据

    耐心等待(等待时间和抓取的月份丶网速有关系),会在excel中出现结果,那么可以把这些数据复制到我们的另一个工作簿上,也可以导出为csv格式。

    导出的文件可以保持在本地,方便下次提取。

    第三步:数据处理,简单举例,可以跟着做。

    做下简单的处理,这里提取年份使用这个公式:=LEFT(E2,4),提取月份使用这个公式:=RIGHT(E2,2),然后填充。如下图所示,鼠标移到单元格的右下角位置,会出现个黑色小方形,鼠标也会变成黑色的十字架,双击即可填充。

    接着,我们插入数据透视表,鼠标点一下我们的数据,任意一个单元格都可以,只要在数据范围内,如图,我点在F10单元格。

    点数据透视表,会自动匹配整个数据框。我们点确定即可。

    点确定后,效果如下图所示

    用鼠标,将字段拉到下面的相应位置即可

    第四步:数据分析

    我们现在就已经完成了数据透视表,通过这个透视表,就可以比较直观的对比各行业间的差异,但是都是数字,不免有些晕,或许用图表来展示会更加直观

    点一下数据透视表,然后点插入——折线图,这里选择第一个样式即可(其他样式可以自己尝试)

    结果如图所示

    发现面膜/面膜粉的走势好像不错。

    接着,我想看一下各行业的容量占比,重点看下面膜/面膜粉这个行业占比多少,就以2013年的数据来统计占比。还是插入数据透视表,先设置好字段,然后再选择2013.

    接着,插入饼图

    结果如图所示

    这里看不到占比,而且也不知道哪个行业,这就需要我们设置一下图表。右击图表——添加数据标签

    出现标签后,我们再右击一下标签,设置数据系列格式

    按下图红框设置即可

    然后改下标题,稍微把图表的尺寸拖大一点

    这样,就比较直观了,面膜/面膜粉在2013年1-9月份中,销量占了整个美容护肤行业的16%。那么我想再仔细看看面膜/面膜粉行业的销量走势。依然先插入并设计数据透视表。

    然后,插入折线图

    结果如下图所示

    两年的销量走势对比,可以看出2013年比2012年增长了不少。增长需要涉及到环比增长和同比增长两个概念,今天先不讲。我们通过目测就已经看出来,今年比去年火,但是这个结论还不是最终结论,只是简单建立在数据层面的初步结论,还要通过淘宝去验证,搞清楚销量的增长是来自哪里。假设是某几家品牌促销的结果,那么这个数据对于我们而言,意义就不一样了。或许我们自己是这个行业的一个品牌商,则需要把后面的分析重点转移到研究这几家品牌的营销研究上面来,弄清楚对手究竟如何改变了这个市场。

    属性分析里面包含了SKU,操作方法跟上面类似,这里就不演示了。

    第四步:数据展现

    把我们以上得到的结果,进一步优化,更加直观丶有序地展现出来。

    第五步:撰写报告(非商业严谨报告,以实用为主)

    把所看到的,所想到的,通过文字的方式记录下来,方便自己或者他人阅读,了解我们的分析思路。

  • ?

    怎么样Excel做数据分析?这几个步骤帮到你

    Vera

    展开

    每个人都会有机会进行数据展示,为什么别人展示永远获得正视,而我的展示永远只有自己愿意去看,别人在看手机?那怎样做数据图表分析呢请看以下步骤:

    如何对表格进行修饰,本次小编带来两个技巧,一是使用“套用表格格式”,和使用“条件格式”。二是带领大家学会养成修饰表格的思维。

    第一步是对表格进行粗略的修饰调整,思维:行高、列宽、对齐方式、表格线等;

    使用“套用表格格式”、“条件格式”之后看数据不再枯燥无味,而且还更有看头。“条件格式”可以将筛选条件转换为颜色可视化,从而达到一目了然的效果。

    第一个技巧,①“套用表格格式”。方法:任一单元格→开始→套用表格格式。

    ②“条件格式”,方法:选中单元格区域→开始→条件格式。

    条件1:高于平均值

    条件2:数据条

    条件3:色阶

    第二个技巧:养成修饰图表的思维。这次举例柱形图的修饰例子,其他希望大家动用类似的方法进行模拟实践。

    步骤一:根据销售数据建立柱状图,建立方法可参考。选择数据源→插入→柱状图→选择数据源→编辑坐标

    步骤二:添加辅助线。选择数据源→→添加→点击柱体右键,设置数据系列格式→次坐标轴→选中柱体,右键更改图表类型→折线图。

    希望回答对你能有所帮助,如果觉得不错就来点个赞或关注吧,感谢各位了!

  • ?

    如何做数据分析?

    莫名其

    展开

    在互联网的下半场,不断精细化运营的背景下,产品经理不再是单纯的靠感觉来做产品,更需要培养数据的意识,能以数据为依归,来不断改善产品。

    不同于公司专业的数据分析师,产品经理更多的可以从用户、业务的层面去看待数据,去更快更透彻的去寻找数据变动的原因。

    科多大数据带你们看看在数据已经被有效记录的前提下,如何有效的去进行大数据分析呢?

    一、明确数据分析的目的

    1、如果数据分析的目的是要对比页面改版前后的优劣,则衡量的指标应该从页面的点击率,跳出率等维度出发,电商类应用还要观察订单转化率,社交类应用要注重用户的访问时长、点赞转发互动等频次。

    不少新人在设计自己产品的时候,可能会花费很多时间在产品本身的设计上,却没有花精力思考如何衡量产品的成功与否,在产品文档上写上一句类似“用户体验有所”提升的空话,这样既不利于产品设计顺利通过需求评审,也无法更有效的快速提高产品的KPI指标。

    2、如果数据分析的目的是探究某一模块数据异常波动的原因,则分析的方法应该按照金字塔原理逐步拆解,版本->时间->人群。

    比如发现首页猜你喜欢模块最近的点击率从40%下降到了35%,暴跌5%个点,这个时候先看看是不是哪个版本的数据发生了波动,是不是因为新版本上线埋点遗漏或有误造成的。

    如果版本的波动数据保持一致,再看看数据是从什么时候开始变化的,是不是因为受到了圣诞、元旦假日因素的影响,页面上其他模块上线了新的活动影响了猜你喜欢的转化。

    如果不是,则再拆解是不是流量来源构成发生了变动,是不是新用户的曝光数量增加导致的。

    产品经理需要带着明确的目的去分析数据,思考实现目标需要构建哪些维度去验证。大部分时候,产品经理需要非常耐心的一步一步的拆解细分,排查原因。

    二、多渠道收集数据

    收集方式一般有四类渠道。

    1、从外部如易观或艾瑞的行业数据分析报告获取,需要带着审慎的态度去观察数据,提取有效准确的信息,剥离部分可能注水的数据,并需要时刻警惕那些被人处理过的二手数据。

    2、从AppStore、客服意见反馈、微博等社区论坛去主动收集用户的反馈。我自己经常有空的时候就会去社区论坛看看用户的状态评论,一般这样的评论都是非常极端的,要么特别好,要么骂成狗,但这些评论对于自身产品设计的提升还是非常有益的,可以尝试去反推用户当时当刻为什么会产生如此的情绪。

    3、自行参与问卷设计、用户访谈等调研,直面用户,收集一手数据,观察用户使用产品时所遇到的问题及感受。问卷需要提炼核心问题,减少问题,回收结果需剔除无效的敷衍的问卷。用户访谈需要注意不使用引导性的词汇或问题去带偏用户的自然感受。

    4、从已记录的用户行为轨迹去研究数据。大公司一般会有固话的报表/邮件去每天甚至实时反馈线上的用户数据情况,也会提供SQL查询平台给产品经理或数据分析师,让他们可以更有深度的探究对比数据。

    三、有效剔除干扰数据

    1、选取正确的样本数量,选取足够大的数量,剔除极端或偶然性数据的影响。08年奥运会上,姚明的三分投篮命中率为100%,科比的三分投篮命中率为32%,那么是不是说姚明的三分投篮命中率要比科比高?显示有问题,因为那届奥运会,姚明只投了一个三分球,科比投了53个。

    2、制定相同的抽样规则,减少分析结论的偏差性。比如两条Push文案,第1条“您有一个外卖暖心红包未领取,最大的红包只留给最会吃的你,点击进入”,第2条“送你一个外卖低温福利,足不出户吃喝热腾美味,点击领取”。实验数据表明,第二条Push文案的点击率比第一条同比高了30%。那么真的是第二条文案更有吸引力嘛?结果发现是第二条Push文案的接收人群的活跃度明显高于第一条造成的。

    3、剔除版本或节假日因素的干扰,新版本刚上线时的数据表现往往会很好,因为主动升级的用户一般是高活跃度的用户。临近周末或大型节假日的时候,用户的消费需求会被触发,电商类应用的订单转化率也会直线上升。因此,在数据对比的时候,实验组和对照组的数据在时间维度上要保持对应。

    4、对历史数据遗忘。人与数据技术不同,数据技术有着100%的记忆能力,而人类根据艾浩宾斯遗忘定律1天后只能记起33%,6天后25%,31天后21%。因此,我们要合理的选择筛选时间段。比如猜你喜欢模块不仅要对兴趣标签的计分进行一定的加权处理,也要结合商品的生命周期等因素做一系列的回归实验,得出受众人群对各类兴趣和购买倾向的衰退曲线,利用有规律的时间变化有效删除老数据,去提升模块的点击率。

    5、实验需拆分A1组,也就是在实验组B和对照组A上再增加一组A1,A1和A的规则保持一致,然后探究AB的数据波动与AA1比较,剔除数据的自然/异常波动带来的影响。以我实际的A/B实验表明,设立A1组是非常重要且必要的,不管数据量级有多大,相同实验规则的两组在数据也会有一定的小幅波动,而这小幅波动在精细化运营的今天,对我们的判断可能形成较大的干扰偏差。

    四、合理客观的审视数据

    1、不要忽略沉默用户

    产品经理在听到部分用户反馈的时候就做出决策,花费大量的时间开发相应的功能,往往结果,可能这些功能只是极少部分用户的迫切需求,而大部分用户并不在乎。甚至有可能与核心用户的诉求相违背,导致新版产品上线后数据猛跌。

    忽略沉默用户,没有全盘的考虑产品大部分目标用户的核心需求,可能造成人力物力的浪费,更有甚者,会错失商业机会。

    2、全面理解数据结果

    如果实验结果的预期与我们的经验认知有明显的偏差,请不要盲目下结论质疑自己的直觉,而是尝试对数据进行更透彻的分析。

    例如我曾经做过在首页给用户投放活动弹窗的实验,发现实验组的数据不管在首页的点击率,订单转化率乃至7日留存率方面都远超对照组,首页上的每一个模块的转化率都有明显的提升,远远超出了我们的预期,那这真的是活动弹窗刺激了用户的转化率嘛?

    后来我们发现在首页能够展示出活动弹窗的用户,往往在使用环境时的网络状态比较好,在wifi环境下,而未展示弹窗的用户则可能是在公交/地铁/商场等移动场景下,网络通讯可能不佳,因此影响了A/B实验的结果。

    3、不要过度依赖数据

    过度依赖数据,一方面,会让我们做很多没有价值的数据分析;另一方面,也会限制产品经理本来应有的灵感和创意。

    正像罗振宇在时间的朋友跨年演讲上提到的一样。用户要什么,你就给什么,甚至他们没说出来你就猜到了,这叫母爱算法,在内容分发领域没有人比今日头条做得更好,但母爱算法有很大的弊端,在推荐的时候会越推越窄。

    另一面则是父爱算法,站的高,看得远。告诉用户,放下你手里的烂东西,我告诉你一个好东西,跟我来。正像乔帮主当年打造的iPhone系列产品一样,不看市场分析,不做用户调研,打造出超出用户预期的产品。

    五、总结

    美国最成功的视频网站Netflix通过基于用户习惯的分析,将大数据分析深入到电影的创作环节中,塑造了风靡一时的美剧《纸牌屋》。然而Netflix的工作人员告诉我们,不应该迷恋大数据

    如果说电视剧评分9分是精品的话,大数据可以让我们脱离低分6分以下的风险,却也会带我们按部就班的走向平庸的绝大多数7-8分之间。

    产品经理在直觉创造的心智能力,情感理解的社交能力,与大数据相结合,正确的理解数据,让数据真正嵌入到产品的设计中,切实解决用户的实际问题,方能真正做到所谓的“用户洞察”,让产品走到用户需求前面,超出用户的预期。

  • ?

    零一《从0开始,教你做数据分析》—10篇

    慕丹亦

    展开

    大家好,我是零一。这一篇给大家介绍聚类/分类。

    我们先讲一讲聚类。

    上一篇的探索关系,很多朋友反映说非常有趣,这一篇,聚类分析也是相当有趣的。

    聚类分析简称聚类,俗话说物以类聚,人以群分,聚类就是划分子类的过程。算法上面多用k-means和k-medoids,当然,大家可以跳过这些算法的过程,用程序来完成即可。

    说简单一点,通过聚类,可以将我们的数据进行分类,并且描述每个类的特征。

    聚类应用非常广泛,包括在电商领域的应用也是多不胜数。比如

    (1)对客户数据进行聚类分析得到多个客户群组,并且得到各个群组的特征,这可以帮助我们发现客户的共性和差异性;

    (2)竞争对手数据进行聚类分析得到多个对手群组和各自的特征,这一样可以让我们找到对手们的共性和差异性;

    (3)对行业数据进行聚类分析得到多个行业群组和各自的特征,这个可以来发现不同行业之间的共性和差异性

    (4)对销售数据进行聚类分析(比如以其中的地域聚类),可以告诉我们那些地域之间的共性和差异性

    不难发现,我举的4个例子都是在发现共性和差异性。对的!我们了解了这些信息,可以指导我们的运营决策,对不同群组制定不同的策略。

    下图是对地域数据做的聚类分析,得到的一个谱系图,我们从上往下看,首先是分成两大类

    广东,天津,浙江,北京和上海这五个省市为一类,其余的多省为一类。

    再往下看又分成了四大类,西藏作为单独一个分类,广东也作为单独的一个分类,天津和浙江为一类,北京和上海为一类。

    从上往下,越分越细。红色的边框把多个省市划分成5个分类。一般没必要分得太细,这个数据目测是分成了20个细分的分类,除非是确实是需要细分到很细的时候,才需要看最低层的分类。

    当我们知道天津和浙江聚为一类的时候,他们必然存在共性,才会聚在一起。当我们知道天津-浙江类和北京-上海类,作为两个不同的群组聚集,它们之间肯定是存在某种差异。

    =======================================

    下面,我们用上篇共享的数据,跟大家一起探讨聚类,和寻找他们的共性和差异性。

    先处理下缺失值,选择清除数据里面的离群值

    中间要选择需要处理的字段,选择好后,进入以下界面,也一样下一步即可

    选择删除包含离群点的行(因为这里数据量不少,可以删了)

    一般情况下,我们都避免直接修改源数据,需要新建一个变量或者空间或者工作表来存放处理过后的数据。这里选择复制到新的工作表就可以了。

    数据处理好后,就可以进行聚类分析了。在数据挖掘套件里面直接选择聚类分析即可。

    选择需要的数据进入模型里面

    点击参数,然后就会看到下图这个对话框,可以手动输入数字来更改聚类算法,可以看到微软提供的聚类算法有4种,分别是可变的EM,固定的EM,可变的K-means跟固定K-means(EM是最大期望算法,K-means是K平均值算法,可变的是可以伸缩调整的,固定的就是固定不可调整的)

    这里我输入4,选择固定的K-means算法

    下图是选择测试集的比例,默认是30%。【测试集】是数据挖掘特有的名词,数据挖掘里头将数据集一分为二,大头的部分用来训练建立模型,称之为【训练集】,小的部分就用来测试模型,称之为【测试集】。这是数据挖掘和统计学最大的差异之一。统计学是通过统计方法来验证模型是否可靠,而数据挖掘技术是利用测试集来验证模型的可靠性。一般用于预测模型,聚类分析其实可以不用测试集,可以把数值改为0。但我就不改了。就用随机抽取出来的70%的数据来建立模型。

    完成后,就会进入模型浏览界面,我们看到共有划分了7个,这有点儿多,我们可以在选择输入列的时候指定分类的数量,刚才我们是选了自动检测来着。

    线粗代表两个分类之间的关系的强度,越粗关系越强。分类的颜色代表密度,颜色越是深蓝代表这个分类的数据个数越多。那非常明显,系统把大部分的数据归入分类1里头了。

    下面是分类的剖面图,每个分类对应的指标范围在这里一览无遗。

    简单解读一下上面这个分类情况

    【分类1】包含2768个数据,最鲜明的是30天成交量偏大,价格偏低的这一个群组,是中低端爆款类

    【分类2】只有246个数据,这个群组比较失败,发货分丶服务分丶好评率都偏低,销量偏低,价格偏高一点,典型就是卖货不卖服务类

    【分类3】只有187个,集中在广东深圳,DSR很好,评价很好,价格很高,但退款率也很高,应该是高端市场的卖家,标准的价格高,服务好,但不知为何退款率也高,可能是买家收到了,觉得不划算吧,这一类是高端类,但产品或品牌的价值感可能没有做好。

    【分类4】只有65个,也是DSR超好,价格中档,产品的价值完美体现,退款率不错,同样集中在广东深圳,是中档性价比类。

    【分类5】只有61个,这个群组很惨,集中在浙江金华(估计是义乌),价格超低,DSR超烂,好评率很惨,是低端烂货类

    【分类6】和【分类7】规模很小,就不解读了。以上解读仅供参考。一般分个4-5个群组就差不多了,如果数据量确实大,可以考虑分细一些。

    每一个分类都可以单独提取出这个分类下的数据的。

    下图是分类的一些特征,每个特征的概率情况

    下图是分类间的差异性,通过对比可以发现,分类1多是天猫,非分类1的多是C店。

    下面我着重看下分类3和分类4的区别,因为分类3败在退款率上面,而分类四就解决了这个问题。

    我大致上看出来了,分类3的服务(DSR,退款速度)没有分类4的做得好,但分类4的价格又要比分类3低,并且包邮。那作为消费者,肯定选个价格中肯,服务又好的店家。而且分类4的销量还不低,有少部分是心店,我对心店的印象就是心店的服务一般要比大店的要好。

    以上就是对这儿聚类分析结果的简单解读,具体的,亲们实操一下吧。

    =============================================

    下面说说分类。

    聚类和分类,从语义来讲,看似很像,但有一点重要的差异。分类是指定了我们要分析的列(维度),然后通过决策树算法(默认方法是用贝叶斯分类器),来告诉我们,影响这个目标的维度有哪些。下面我们看下过程。

    选择要分析的列,我这里选择的是30天销量,看下会影响销量的是什么因子。

    下图是结果,告诉我们,收藏很重要!收藏跟销量有很强的关系。同样第一张图是决策树,一样有分组的作用。

    决策树一般用来分析影响客户下单或者流失的因子有哪些。有兴趣的朋友可以自己倒腾一下。试下会有哪些意外的收获。

    ===========================================

    下面,告诉大家测试集的使用方法。

    选择准确性图表

    选择模型,一般用于预测模型,刚才的决策树是属于预测模型,而聚类就不属于,因此聚类的模型不可用于准确性图表。

    选择要预测的区间,我选择的是30天成交大于122的情况

    我们之前保留的测试集,就在这里出现了,默认会选择测试集来验证准确性。

    在上图点了完成后,就会得到这样的一个结果(部分截图),会有一个指标, “分类 30天成交”模型提升144.11%,这个数值越大代表模型的准确性越高。但我一般看下面的ROC图。

    蓝色代表没有模型的结果,红色代表理想的结果。而绿色代表我们测试得到的结果。

    绿色的线越接近红色的就代表越好,一般情况下,只要不要太接近蓝色的线(或者低于蓝色的线),就好了。如果接近蓝色的线或者在蓝色线下面,那就不如不用模型了,此时这个模型就没什么存在的意义,如果硬要用那就只是为了做模型玩玩而已了。

  • ?

    十种常用的数据分析方法

    歌舒湘

    展开

    道家强调四个字,叫“道、法、术、器”。

    层次区别:

    “器”是指物品或工具,在数据分析领域指的就是数据分析的产品或工具,“工欲善其事,必先利其器”;

    “术”是指操作技术,是技能的高低、效率的高下,如对分析工具使用的技术(比如用Excel进行数据分析的水平);

    “法”是指选择的方法,有句话说“选择比努力重要”;

    “道”是指方向,是指导思想,是战略。

    在数据分析和产品、运营优化方面,数据分析方法是其核心,属于“法”和“术”的层次。

    那么如何做好数据分析呢,今天我们来讲讲互联网运营中的十大数据分析方法。

    01 细分分析

    细分分析是分析的基础,单一维度下的指标数据的信息价值很低。

    细分方法可以分为两类, 一类逐步分析, 比如:来北京市的访客可分为朝阳,海淀等区; 另一类是维度交叉, 如:来自付费SEM的新访客。

    细分用于解决所有问题。

    比如漏斗转化,实际上就是把转化过程按照步骤进行细分,流量渠道的分析和评估也需要大量用到细分的方法。

    02 对比分析

    对比分析主要是指将两个相互联系的指标数据进行比较,从数量上展示和说明研究对象的规模大小,水平高低,速度快慢等相对数值, 通过相同维度下的指标对比,可以发现,找出业务在不同阶段的问题。

    常见的对比方法包括: 时间对比,空间对比,标准对比。

    时间对比有三种: 同比,环比,定基比。

    例如: 本周和上周进行对比就是环比;本月第一周和上月第一周对比就是同比;所有数据同今年的第一周对比则为定基比。通过三种方式,可以分析业务增长水平,速度等信息。

    03 漏斗分析

    转化漏斗分析是业务分析的基本模型, 最常见的是把最终的转化设置为某种目的的实现,最典型的就是完成交易。但也可以是其他任何目的的实现,比如一次使用app的时间超过10分钟。

    漏斗帮助我们解决两方面的问题:

    在一个过程中是否发生泄漏,如果有泄漏,我们能在漏斗中看到,并且能够通过进一步的分析堵住这个泄漏点。

    在一个过程中是否出现了其他不应该出现的过程,造成转化主进程收到损害。

    04 同期群分析

    同期群(cohort)分析在数据运营领域十分重要,互联网运营特别需要仔细洞察留存情况。 通过对性质完全一样的可对比群体的留存情况的比较,来分析哪些因素影响用户的留存。

    同期群分析深受欢迎的重要原因是十分简单,但却十分直观。 同期群只用简单的一个图表,直接描述了用户在一段时间周期(甚至是整个LTV)的留存或流失变化情况。

    以前留存分析只要用户有回访即定义为留存,这会导致留存指标虚高。

    05 聚类分析

    聚类分析具有简单,直观的特征, 网站分析中的聚类主要分为:用户,页面或内容,来源。

    用户聚类主要体现为用户分群,用户标签法;页面聚类则主要是相似,相关页面分组法;来源聚类主要包括渠道,关键词等。

    例如: 在页面分析中,经常存在带?参数的页面。 比如: 资讯详情页面,商品页面等,都属于同一类页面。简单的分析容易造成跳出率,退出率等指标不准确的问题,通过聚类分析可以获取同类页面的准确数据用于分析场景。

    06 AB测试

    增长黑客的一个主要思想之一,是不要做一个大而全的东西,而是不断做出能够快速验证的小而精的东西。 快速验证,那如何验证呢?主要方法就是AB测试。

    比如: 你发现漏斗转化中中间有漏洞,假设一定是商品价格问题导致了流失,你看到了问题-漏斗,也想出了主意-改变定价。但主意是否正确,要看真实的用户反应,于是采用AB测试,一部分用户还是看到老价格,一部分用户看到新价格,若你的主意真的管用,新价格就应该有更好的转化,若真如此,新价格就应该确定下来,如此反复优化。

    07 埋点分析

    只有采集了足够的基础数据,才能通过各种分析方法得到需要的分析结果。

    通过分析用户行为,并细分为:浏览行为,轻度交互,重度交互,交易行为,对于浏览行为和轻度交互行为的点击按钮等事件,因其使用频繁,数据简单,采用无埋点技术实现自助埋点,即可以提高数据分析的实效性,需要的数据可立即提取,又大量减少技术人员的工作量,需要采集更丰富信息的行为。

    如: 重度交互(注册,邀请好友等)和交易事件(加购物车,下订单等)则通过SDK批量埋点的方式来实施。

    08 来源分析

    流量红利消失,我们对获客来源的重视度极高,如何有效的标注用户来源,至关重要。

    传统分析工具,渠道分析仅有单一维度,要深入分析不同渠道不同阶段效果,SEM付费搜索等来源渠道和用户所在地区进行交叉分析,得出不同区域的获客详细信息,维度越细,分析结果也越有价值。

    09 用户分析

    用户分析是互联网运营的核心, 常用的分析方法包括:活跃分析,留存分析,用户分群,用户画像,用户细查等。

    可将用户活跃细分为浏览活跃,互动活跃,交易活跃等,通过活跃行为的细分,掌握关键行为指标;通过用户行为事件序列,用户属性进行分群,观察分群用户的访问,浏览,注册,互动,交易等行为,从而真正把握不同用户类型的特点,提供有针对性的产品和服务。

    用户画像基于自动标签系统将用户完整的画像描绘清晰,更有力的支撑运营决策。

    10 表单分析

    填写表单是每个平台与用户交互的必备环节,优秀的表单设计,对转化率的提升起到重要作用。

    用户从进入表单页面之时起,就产生了微漏斗,从进入总人数到最终完成并成功提交表单人数,这个过程之中,有多少人开始填写表单,填写表单时,遇到了什么困难导致无法完成表单,都影响最终的转化效果。

    以上是常见的数据分析方法,更多应用方法需要根据业务场景灵活应用。

  • ?

    什么样的人比较适合做数据分析?

    崔雍

    展开

    我觉得无论什么工作兴趣最重要,要做数据分析师最基本的就是不讨厌数字,如果你跟他讲那个指标是通过怎么样的乘除加减得到的,他会觉得不耐烦,那么显然他不适合做数据分析;如果对数据较敏感,能够一眼发现异常值,数据分布情况,当然是最好的。

    再则就是逻辑性,可以让他试试爱因斯坦的那道经典的逻辑题,看看能否解出来,需要多久;逻辑思维对数据分析尤其重要,不然会被各种指标的定义规则、与业务的联系纠结死,逻辑思维好的人写SQL等数据处理脚本也会更加高效。

    接着是业务理解能力,最简单的就是让他定义下网站的目标是什么,哪些指标可以作为KPI,用户从进入网站到达成网站目标的整个过程是怎么实现转化的,能否画出业务流程图。(宏观层面,不要深入细节)

    如果偏技术则需要懂一些数据库结构和SQL,如果偏展现需要考验下对图表的掌控能力,什么时候用什么图表合适,甚至如何配色。

    最后就是细心、耐心和交流能力,做数据分析有时会很纠结,细心和耐心是必需的,好的交流能力可以让数据分析师更好地阐述清楚各类问题。

    这些都是比较基础的东西,也是短期难以培养起来的技能。至于另外业务相关的一些知识,可以通过培训获取,问一个未接触过你的网站业务的人一些业务知识其实有些不公平,其实如果具备上面几点,一旦熟悉网站和业务之后,一定会成为优秀的数据分析师。

    ——谷芬芬

    专业内的要求基本就是对数据的意识和一些技能的掌握。下面具体说说从一些非专业内要求的方面出发,有哪些方面能表现这个人更适合数据分析。

    首先是看到数据有兴奋感的人。有兴奋感说明你有兴趣,那说明很会有意愿把数据分析好。

    其次是愿意学习的人。你分析的内容永远不会一尘不变,即使你分析的主题是相对固定,但业务是变化的,你需要不断的学习业务,同不同人沟通,吸收别人的观点。所以分析师一定要报着学习的态度。

    然后是逻辑思维较强的人。数据分析师想要把你的分析好,一定要有结论思维。

    还有就是较强的表达与沟通能力。因为数据分析最终价值的实现,一般来说不会是分析师亲自去制定或者实施。所以你一定很有条理、逻辑清晰向别人表达,让业务方认识到你分析结果的价值,从而影响业务方去愿意使用你从数据中得到的观点。

    ——欧阳帅

    觉得还是应该先看清楚自己的未来的方向吧~

    我有不少朋友 非数学/计算机/统计学 专业毕业的朋友走的是这个方向,数据相关,非技术路线,更偏向于市场方向,对技术的要求只是Excel、PPT,最多要求SPSS,很少要求会写SQL。这条路线看起来比较高大上,可以走外企路线。

    数据分析师方向,很多读数学、统计学、计算机的童鞋会选这个方向,终极目标都是成为数据中心的负责人。中间有2个分叉,一条是从数据分析师到数据产品经理,这个路线最近很流行,主要是结合了数据分析和产品经理的能力。一条是高大上一点的数据挖掘方向,这条路线要求比较高,但薪资也高。当然能走数据挖掘路线是很多数据分析师的梦想,但算法和代码实现能力不是谁都能掌握的。.

    根据你自己想走的路,加上自己的技能点。

    ——张锦华

    想了解更多相关内容,记得持续关注我们哦。

    如果你觉得有点意思,请有秩序的评论、转发、收藏。

做数据分析的

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP