中企动力 > 商学院 > 数据影响分析
  • ?

    大数据如何影响企业的未来?

    樊若冰

    展开

    几个世纪以来,商业企业的基础是获取数据和信息。新的商业世界产生了大量数据,其中技术已经设计出许多途径,使商业企业能够利用这些数据。然而,这一新的世界秩序已经发生了两项重大的监管和公共政策领域,包括就业机会和职业发展.。大数据技术和相关算法给白领带来了巨大挑战。工作对于第二十一世纪企业业务的情况,员工应该做些什么。然而,海量数据将给我们的社会带来巨大的利益,如无数的创造。工作机会。

    在最基本的术语中,大型数据技术是所有工具和流程的总和,这些工具和流程与大量数据集的使用和管理有关。数据的概念是根据需要理解模式、口味、偏好和趋势当人们相互互动,以及商业企业已经建立的系统时创造出来。公司可以使用大量数据分析由谷歌BigQuery为了找出他们最有价值的消费者的海量数据技术,也可以被商业企业使用,在新产品、服务和消费者品牌体验中发挥作用。

    在本文中,我们将讨论如何通过大量数据进行数据处理分析会影响到成长公司在第二十一世纪经营,以及它为未来的业务所拥有的。

    创造竞争优势

    为了超越其在资本主义全球经济中的竞争,许多领先的商业企业都使用了大量的数据技术。目前,企业正致力于发现在可行性研究初期试验期间未明确界定的利益和风险。通过使用大型数据技术,企业现在可以以更精确的方式预测其结果,并导致改进的试验分析。早先采用大型数据技术的公司目前正在使用数据传感器,这些传感器被纳入各种产品中,这些产品来自儿童玩具到工业产品。这将有助于企业的经营产品使用的确定在现实世界里。大型数据也有助于设计未来新产品,并创造新服务,这将大大改善消费者品牌体验。因此,由于销售数量增加,企业将能够实现更高的利润。

    预测分析

    企业所有者或经理现在可以预测趋势利用大数据技术预测分析特征,对企业经营方式进行了可能的改变。该过程从历史数据集从各种来源聚集起来,以及它们在分析预测未来趋势中的应用。公司每天收集的大量数据是面向消费者关于购买的产品和服务以及销售数量。预测分析还使企业能够了解消费者在网站页面上花费的时间,其中产品得到了最丰富的意见,消费者通过社交媒体平台接触。

    netflix和亚马逊等顶级零售企业都专门通过掌握这一关键技术,专门向消费者提供最先进的服务。例如,亚马逊给消费者提供了书籍和小说的建议,他们可能会感兴趣阅读。netflix也使用相同的功能来推荐消费者可能感兴趣的新电影和电视剧。令人惊讶的是,这一特性与消费者的口味和偏好完全匹配,这得益于大数据提供的预测分析。

    数据安全

    由大型数据提供的工具使业务所有者或管理人员能够将整个数据景观映射到公司的所有部门。该工具使企业能够根据监管要求安全地存储敏感信息,并以适当的方式存储。

  • ?

    数据分析的九种方法

    半根烟

    展开

    微信公众号发展至今,整体的产业已趋向成熟,市场对其运营框架也有了大致的共识,基本上可分为:内容运营、活动运营、用户运营,以及渠道运营和数据运营等几大模块。每个不同的运营模块,它们各自独立,同时又相互地影响。

    本文侧重于对运营初学者来说,提供一套简易、有效的数据运营方法论。在开展数据运营工作之前,我们首先得了解数据在整个公众号运营工作中,究竟充当着什么样的角色?

    我认为:“数据是运营的基础,就像一条绳索,贯穿整个运营工作。它既是运营KPI考核的直接呈现方式,同时也是运营方向的理论支撑点”

    在新媒体的数据运营中,数据分析是至关重要的步骤,而数据分析有大概九类方法,你们知道吗?今天小天就来带大家了解一下这些干货吧!

    数据分析的九类方法:直接评判法 — 对比分析法 — 结构分析法 — 分组分析法 — 平均分析法 — 矩阵分析法 — 漏斗图分析法 — 雷达图分析法 — 回归分析法

    1.直接评判法

    直接评判法即根据经验直接判断数据的好坏并给予评判,通常用于内部过往运营状况评估,如评估近期阅读量是否过低,评判近期销售量是否异常,评估当日文章推送量是否正常。

    直接评判法有两个必要的条件:一是运营者有一定的新媒体运营经验,能够对跳出率,阅读量等有正确的评估;二是经过加工处理的数据足够直观,可以直接代表某项数据的优缺点。

    2.对比分析法

    对比分析法,是将两个或两个以上的数据进行对比,分析差异进而揭示这些数据所代表的规律。

    对比分析法包括横向比较及纵向比较。横向比较即同一时间下不同总体指标的对比,如今日头条同领域作者文章阅读量对比,粉丝数对比等;纵向比较不同时间条件下同一总体指标的对比,如本月文章阅读量与上月阅读量进行对比,本月粉丝增长数与上月增长数进行对比等。

    通过对比分析,可以直接观察到目前的运营水平,一方面找到当前已经处于优秀水平的方面,后续予以保持;另一方面及时发现当前的薄弱环节,重点突破。

    3.分组分析法

    分组分析法是指通过一定的指标,将对象统计分组并计算和分析,以便于深入了解所要分析对象的不同特征,性质及相互关系的方法。

    分组分析法遵循相互独立,完全穷尽的枚举分析法原则。所谓相互独立,即分组之间不能有交叉,组别之间具有明显的差异性,每个数据只能归属于某一组;所谓完全穷尽,即分组中不要遗漏任何数据,保持完整性,各组的空间足以容纳总体的所有数据。

    4.结构分析法

    结构分析法是在统计分组的基础上,将组内数据与总体数据之间进行对比的分析方法。结构分析法分析各组部分占总体的比例,属于相对指标。

    例如,新媒体运营团队可以统计粉丝所在的地域分布,统计出各个地方粉丝的占比情况,此情景便属于结构分析法。

    5.平均分析法

    例如,在分析今日头条的文章阅读量时,借助Excel导出的数据可以快速找到阅读量大于平均值的文章,接下来可以继续挖掘这些文章的标题,排版,配图等规律,便于后续内容质量的提升。

    6.矩阵分析法

    矩阵分析法是一种定量分析问题的方法,它是指以数据两个重要指标作为分析依据,并将这两个指标作为横,纵坐标轴,构成四个象限,从而找出解决问题的办法,为运营者提供数据参考。

    例如,某餐饮企业的大众点评评价分析,可以借助四个象限“紧急且重要,重要但不紧急,紧急但不重要,不紧急也不重要”进行矩阵分析,并重点处理“紧急且重要”的事项。

    7.漏斗图分析法

    漏斗图分析法因展现形式如漏斗,故而得名。漏斗图可以对文章阅读量,产品购买量等情况进行逐层分析,展示整个关键路径中每步的转化情况。

    重要强调的是,单一的漏斗图难以衡量各个环节的好坏,运营者可以结合本节介绍的“对比分析法”,对同一环节不同时间对比,评估运营效果。

    8.雷达图分析法

    雷达图常用于指数分析,即通过对新媒体账号的内容质量,领域专注等不同维度的计算而得出的客观评分结果。分数越高,代表账号的质量越好。可以利用雷达图进行分析的指数,包括今日头条指数,大鱼号星级指数,百家号指数等。

    9.回归分析法

    回归分析法是通过研究事物发展变化的因果关系来预测事物发展走向,它是研究变量间相互关系的一种定量预测方法,又称回归模型预测法或因果法。

    例如,将今日头条粉丝数据导出到Excel表格,对累计粉丝数进行一元线性分析,就可以尝试预测某个时间的粉丝量。

  • ?

    数据分析:浅谈大数据对统计学的挑战和机遇,看完长见识了!

    比翼飞

    展开

    浅谈大数据对统计学的挑战和机遇

    引言  国际数据公司的相关研究指出,2011年全球数据生产量达1.8ZB,且全球信息总量每隔两年增长一倍[1]。在大数据时代下,对于统计学发展而言,挑战与机遇并存,挑战指的是现阶段传统统计学相关方法难以适用大数据,机遇指的是基于统计学,大数据展开数据处理、分析,促使大数据具备可视化特性。由此可见,研究大数据对统计学的挑战和机遇有着十分重要的现实意义。  1.大数据及其目的  现阶段,关于大数据仍旧没有一个十分明确的界定,大数据起初是源自于技术领域。在信息量不断扩大的情况下,使得常规电脑原有存储空间已不能对新处理数据进行承载,新兴数据处理技术得以产生,好比雅虎的Hadoop平台、谷歌的MapReduce等。此类技术能够对僵化层次结构、一致性予以消除,促进数据无需通过常规数据库表格进行排列,极大程度地提升了人们可处理的数据量[1]。 

     2.大数据与统计学的对比  2.1样本统计与全样本统计的区别  样本统计属于统计学不可或缺的依赖,样本指的是结合相应的概率自总体中随机筛选并视作总体代表的集合内容,值得一提的是随机抽样是需要成本的,包括社会关系、资金成本或者时间成本等。基于样本数量提升有限前提下,样本估计误差会随着总体数量增多而增大,这亦是样本统计无法避免的不足。大数据时代下,收集整理庞大的数据信息应运而生,数据信息发展表现出总体即是样本的态势,该属性很好的消除了样本统计这一不足。大数据时代下的全样本统计,通常情况下可对完全总体进行覆盖,然而受大部分数据属于半结构、半结构数据影响,使得概率论应用遭受一定的制约[2]。鉴于此,将全样本统计应用到统计学中,应当就总体数据展开相应的归纳、筛选,即好比在样本统计中展开数据预处理。  2.2预测分析与非预测分析的区别  统计学的创立,是为了对变量相互相关关系展开分析,因此获取数据是发生于变量确定之后的,数据分析价值是能够被预测的。相较于统计学的预测分析,庞大数据将互联网、传感器作为载体,存在于分析需求之前,因此构建于大数据上的分析多为非预测性分析。在统计学中,出现大数据无法有效应用局面,这是由于不具备非预测分析所需的庞大数据,庞大数据产生与数据中心、存储系统存在紧密的联系,并非短期产生。也就是说,统计学中大数据的应用发展,说明了非预测分析正逐步取代传统统计学预测分析,数据多次利用正逐步取代传统数据一次性利用的。  3.大数据对统计学的挑战与机遇  3.1数据生产、处理与应用的转变 

     相关统计部门经开展严格的统计设计工作,获得相关的统计数据,数据的预处理分别有数据清洗、非全面数据填补以及数据矫正等。大数据时代下的统计手段尚不十分明确,自大数据流环境而言,要不断探索新型抽样方法,并确保抽样方法的实时、连贯及可行性。除去传统的统计分析方法,还应当开发大数据动态分析、数据流算法等[3]。  3.2大数据时代对市场营销的机遇  3.2.1大数据营销的特点与价值  大数据营销的特点:I.数据采集多平台化特点,即大数据时代下,大数据的数据大多来源于不同的领域、不同的渠道。II.时效性特点,随着信息技术的急速发展,互联网用户消费、购物行为方式往往会瞬间出现转变。国际先进大数据营销企业AdTime基于此大数据营销特点,采取了时间营销措施,即采取相应的技术方式全面获悉用户所需,于第一时间对用户当下的需求进行回应,以使用户在下决心购买的最佳时间及时看到对应的产品广告。III.个性化特点,在大数据时代下,广告商传统媒体导向的营销理念逐步由受众导向取代,现如今,广告商可应用大数据了解用户的地理方位,需求内容等信息,达到对用户个性化营销的目的。  大数据营销的价值:I.升级营销与用户的匹配度,大数据营销不仅可提供给企业了解用户有效的途径,还能够与网络环境下,选取相关技术方法达到对用户精确定位的目的,从而开展好营销工作,升级营销与用户的匹配度。II.改善用户体验,大数据营销促使企业真正意义上认识到用户及其所使用企业产品情况,以给予用户最人性化的提醒。  3.2.2大数据营销的应用  (1)与消费者建立紧密关系  现如今,我国一些企业营销行为仍旧处于个性化定位信息、创意设计阶段,而无法对不同消费者展开个性化的营销活动。大数据时代下,经采用相关数据分析技术方法,基于对消费群体喜好、传媒接触习惯等展开有效的分析,达到特定营销活动明确开展的目的,实现企业精心开展的营销活动精准的辐射至目标消费群体处,与消费者建立紧密关系,极大的改善营销效率、质量[4]。  (2)掌握竞争对手数据  企业通过对竞争对手数据的有效掌握,获悉竞争对手发展状况,基于此帮助企业制定科学合理的产品价格,提升企业产品市场竞争优势。与此同时,企业务必要全面实施以事实为前提的决策手段,广泛地应用数据分析方式对企业每一个发展运营步骤进行优化,经对企业一系列数据的充分优化、对接,促使业务环节中潜在的价值得以被有效挖掘,降低生产成本,知己知彼,促使企业在日趋白热化的市场竞争中占据有利位置。  (3)挖掘企业内部数据  “市场未动,数据先行”俨然转变为国际上企业有效运营发展的一致认识,为了提升企业管理效率,要求企业要充分挖掘企业内部数据,并展开有效的整合、分析,以为企业相关人员做决策提供有利的参考依据,提升决策准确性,促进企业可持续发展。

    3.2.4 企业的应用案例——以亚马逊为例  在应用大数据开展市场营销方面,美国亚马逊公司一直处于领先地位。亚马逊研发出“用户未下单,先发货”功能,即结合用户的购物需求数据信息,分析用户想要购买的产品,达到用户未下单,提前发货的目的。此外,亚马逊通过对用户检索信息的分析,评估流感的传播,但这仅仅为海量检索数据中的一项用途,相同的数据能够应用于预测大选结果、预测某类产品市场行情等等,极大地降低了统计成本[5]。  3.3大数据时代对市场营销的挑战  3.3.1信息收集  大数据并非就是对数据信息展开盲目的收集,即便收集了再多的数据,倘若这些数据并非是市场营销所需要的,如此便会导致前期收集来的数据信息,变成一堆“数据垃圾”。鉴于此,为了避免这一情况发生,务必要充分分析业务需求,再对自身存在价值的数据展开收集、归纳,如此方可实现大数据的有效收集应用。  3.3.2经验与数据  数据采集完毕后,面对参差不齐的数据,还应当做好数据评估工作,评估对何种目标受众开展市场营销工作。鉴于此,要求采取科学合理的手段,将这些参差不齐的数据整合成可被市场营销实践应用的,经结合过去的经验,与采集数据进行有机融合,实现对目标受众的有效分析确定。  3.3.3分析与优化  数据分析,一方面是实现数据优化,一方面是进行决策层面上的调整、转变。此环节对于专业人才的需求提出了严苛的挑战。数据分析、数据优化对于专业人才的知识框架要求大不相同,这要求相关企业不仅要培养专业的数据分析人才,还要打造数据优化人才队伍。 

     3.4大数据营销的未来发展趋势  信息技术不断发展,单一媒体导向的“消费者碎片化”俨然无法达到企业对于数据多样性的需求。大数据时代下,媒体的跨界融合实现对“碎片化”受众的充分聚合。在科学技术技术不断进步的背景下,跨媒介、跨平台、跨终端的多途径将不断被开拓,将使庞大的数据信息获取多维度的整合,并且在多样化网络环境下,消费者主观信息与客观数据有机融合,构筑全面用户数据库环节,将成为未来大数据营销发展的必然趋势[6]。  4.结束语  总而言之,大数据为传统统计学带来了严峻的考验,也为传统统计学有效发展创造了良好的契机。在大数据时代发展潮流中,我们应当充分的认识到大数据对于传统统计学而言,是补充而不是更替,构建于样本统计、预测分析内容上的传统统计学,仍旧于社会统计、经济分析中占据着主导位置。大数据时代下,为了实现企业市场营销的有效开展,相关人员务必要不断专研研究、总结经验,全面分析大数据与统计学的对比,充分认识大数据对统计学的挑战和机遇,“与消费者建立紧密关系”、“掌握竞争对手数据”、“挖掘企业内部数据”等,积极促进企业市场营销的科学合理化。

  • ?

    十种常用的数据分析方法

    温谷槐

    展开

    道家强调四个字,叫“道、法、术、器”。

    层次区别:

    “器”是指物品或工具,在数据分析领域指的就是数据分析的产品或工具,“工欲善其事,必先利其器”;

    “术”是指操作技术,是技能的高低、效率的高下,如对分析工具使用的技术(比如用Excel进行数据分析的水平);

    “法”是指选择的方法,有句话说“选择比努力重要”;

    “道”是指方向,是指导思想,是战略。

    在数据分析和产品、运营优化方面,数据分析方法是其核心,属于“法”和“术”的层次。

    那么如何做好数据分析呢,今天我们来讲讲互联网运营中的十大数据分析方法。

    01 细分分析

    细分分析是分析的基础,单一维度下的指标数据的信息价值很低。

    细分方法可以分为两类, 一类逐步分析, 比如:来北京市的访客可分为朝阳,海淀等区; 另一类是维度交叉, 如:来自付费SEM的新访客。

    细分用于解决所有问题。

    比如漏斗转化,实际上就是把转化过程按照步骤进行细分,流量渠道的分析和评估也需要大量用到细分的方法。

    02 对比分析

    对比分析主要是指将两个相互联系的指标数据进行比较,从数量上展示和说明研究对象的规模大小,水平高低,速度快慢等相对数值, 通过相同维度下的指标对比,可以发现,找出业务在不同阶段的问题。

    常见的对比方法包括: 时间对比,空间对比,标准对比。

    时间对比有三种: 同比,环比,定基比。

    例如: 本周和上周进行对比就是环比;本月第一周和上月第一周对比就是同比;所有数据同今年的第一周对比则为定基比。通过三种方式,可以分析业务增长水平,速度等信息。

    03 漏斗分析

    转化漏斗分析是业务分析的基本模型, 最常见的是把最终的转化设置为某种目的的实现,最典型的就是完成交易。但也可以是其他任何目的的实现,比如一次使用app的时间超过10分钟。

    漏斗帮助我们解决两方面的问题:

    在一个过程中是否发生泄漏,如果有泄漏,我们能在漏斗中看到,并且能够通过进一步的分析堵住这个泄漏点。

    在一个过程中是否出现了其他不应该出现的过程,造成转化主进程收到损害。

    04 同期群分析

    同期群(cohort)分析在数据运营领域十分重要,互联网运营特别需要仔细洞察留存情况。 通过对性质完全一样的可对比群体的留存情况的比较,来分析哪些因素影响用户的留存。

    同期群分析深受欢迎的重要原因是十分简单,但却十分直观。 同期群只用简单的一个图表,直接描述了用户在一段时间周期(甚至是整个LTV)的留存或流失变化情况。

    以前留存分析只要用户有回访即定义为留存,这会导致留存指标虚高。

    05 聚类分析

    聚类分析具有简单,直观的特征, 网站分析中的聚类主要分为:用户,页面或内容,来源。

    用户聚类主要体现为用户分群,用户标签法;页面聚类则主要是相似,相关页面分组法;来源聚类主要包括渠道,关键词等。

    例如: 在页面分析中,经常存在带?参数的页面。 比如: 资讯详情页面,商品页面等,都属于同一类页面。简单的分析容易造成跳出率,退出率等指标不准确的问题,通过聚类分析可以获取同类页面的准确数据用于分析场景。

    06 AB测试

    增长黑客的一个主要思想之一,是不要做一个大而全的东西,而是不断做出能够快速验证的小而精的东西。 快速验证,那如何验证呢?主要方法就是AB测试。

    比如: 你发现漏斗转化中中间有漏洞,假设一定是商品价格问题导致了流失,你看到了问题-漏斗,也想出了主意-改变定价。但主意是否正确,要看真实的用户反应,于是采用AB测试,一部分用户还是看到老价格,一部分用户看到新价格,若你的主意真的管用,新价格就应该有更好的转化,若真如此,新价格就应该确定下来,如此反复优化。

    07 埋点分析

    只有采集了足够的基础数据,才能通过各种分析方法得到需要的分析结果。

    通过分析用户行为,并细分为:浏览行为,轻度交互,重度交互,交易行为,对于浏览行为和轻度交互行为的点击按钮等事件,因其使用频繁,数据简单,采用无埋点技术实现自助埋点,即可以提高数据分析的实效性,需要的数据可立即提取,又大量减少技术人员的工作量,需要采集更丰富信息的行为。

    如: 重度交互(注册,邀请好友等)和交易事件(加购物车,下订单等)则通过SDK批量埋点的方式来实施。

    08 来源分析

    流量红利消失,我们对获客来源的重视度极高,如何有效的标注用户来源,至关重要。

    传统分析工具,渠道分析仅有单一维度,要深入分析不同渠道不同阶段效果,SEM付费搜索等来源渠道和用户所在地区进行交叉分析,得出不同区域的获客详细信息,维度越细,分析结果也越有价值。

    09 用户分析

    用户分析是互联网运营的核心, 常用的分析方法包括:活跃分析,留存分析,用户分群,用户画像,用户细查等。

    可将用户活跃细分为浏览活跃,互动活跃,交易活跃等,通过活跃行为的细分,掌握关键行为指标;通过用户行为事件序列,用户属性进行分群,观察分群用户的访问,浏览,注册,互动,交易等行为,从而真正把握不同用户类型的特点,提供有针对性的产品和服务。

    用户画像基于自动标签系统将用户完整的画像描绘清晰,更有力的支撑运营决策。

    10 表单分析

    填写表单是每个平台与用户交互的必备环节,优秀的表单设计,对转化率的提升起到重要作用。

    用户从进入表单页面之时起,就产生了微漏斗,从进入总人数到最终完成并成功提交表单人数,这个过程之中,有多少人开始填写表单,填写表单时,遇到了什么困难导致无法完成表单,都影响最终的转化效果。

    以上是常见的数据分析方法,更多应用方法需要根据业务场景灵活应用。

  • ?

    数据建模及数据分析浅析

    嵇凤

    展开

    数据分析是一项实践性很强的工作,涉及到很多交叉学科,需要不同的岗位和角色,来实现不同的性质的工作。

    数据建模

    一 、数据分析师中的角色和职责

    数据分析团队师应该在科技部门内部还在业务部门内部一直存在争议。在业务部门内部,对数据场景比较了解,容易找到数据变现的场景,数据分析师对业务提升帮助较大,容易出成绩。但是弊端是仅仅对自己部门的业务数据了解,分析只是局限独立的业务单元之内,在数据获取的效率上,数据维度和数据视角方面缺乏全局观,数据的商业视野不大,对公司整体业务的推动发展有限。业务部门的数据分析团队缺少数据技术能力,无法利用最新的大数据计算和分析技术,来实现数据分析和建模。数据分析和计算依赖于科技部门,效率较低,无法打通各个环节和实现效率和收益最优。

    1. 数据库(仓库)管理员DBA

    DBA最了解企业内部的数据和可用的数据资源,包括数据的存储细节和数据字典,另外其对数据的采集、清洗和转化起到关键作用。

    DBA为数据科学家和数据分析师提供加工好的原始数据,这些数据是数据分析和建模的基础,DBA做了数据分析工作中最重要的基础工作,完成了大量的脏活和累活。

    2 .业务专家

    业务专家的优势是数据的商业敏感度,了解业务需求,可以将业务需求转化为数据需求,进一步找到数据应用场景。另外业务专家也可以通过对数据的分析,找到新的商业机会,同业务部门一起制定商业计划,利用数据分析推动业务增长。

    业务专家的经验对于数据分析和建模是非常关键的,他们可能是风险管理人员、欺诈监测专家、投资专家等。数据建模来源于业务经验和业务知识,正是业务专家的专业分析找到了业务规律,从而找到了建模方向,并对建模工作给出建议和解释。

    3. 数据科学家

    过去统计分析依赖于统计分析工具,大数据时代之后,数据量级的提升和数据类型的复杂程度,让很多传统的统计分析工具无法完成分析计算。这个时候,数据科学家出现了,他们可以利用自己的专业技能帮助业务专家和数据分析人员进行建模和计算。

    过去数据统计分析建模常用SPSS,SAS,MATLAB等工具,现在基于大数据平台的分析建模可以使用Spark+Scala/Python/R/Java。数据科学家了解模型和算法,可以直接承担建模和调优工作,懂得选择合适的算法来进行计算,提高效率。

    4. 数据分析师

    数据分析师站在数据和商业的角度来解读数据,利用图标和曲线等方式向管理层和业务人员展现分析结果,揭示数据分析产生的商业机会和挑战。

    数据分析师将杂乱的数据进行整理后,将数据以不同的形式展现给产品经理、运营人员、营销人员、财务人员、业务人员等。提出基于数据的结果和分析建议,完成数据从原始到商业化应用到关键一步,数据分析师的数据敏感度、商业敏感度、分析角度、表达方式对于商业决策很重要。

    5 .运营专家

    数据分析结果和商业决策出来之后,运营专家负责实现商业决策。通过有计划的运营活动,将数据分析的结果应用到实际的商业活动之中,运营专家是实现数据变现最后一公里的关键人物。

    运营专家属于业务人员,实际上参与业务运营活动,利用数据分析结果,实现业务场景和数据场景的结合,实现数据商业化应用。

    二、 数据分析之前的各项准备工作

    数据分析团队各成员确定之后,将进行下一项工作,就是找到有价值的数据进行分析了。数据是分析的基础,因此数据的质量、数据的相关度、数据的维度等会影响数据分析的结果影,其中GIGO(垃圾进垃圾出)对于数据分析结果影响最大。

    1 .数据源选择

    数据分析团队面对大量的数据源,各个数据源之间交叉联系,各个数据域之间具有逻辑关系,各个产品统计口径不同,不同的时间段数值不同等。这一系列问题多会影响数据分析结果,因此确定数据源选择和数据整理至关重要。

    DBA可以基于数据分析需要,找到相关数据,建立一张数据宽表,将数据仓库的数据引入到这张宽表当中,基于一定的逻辑关系进行汇总计算。这张宽表作为数据分析的基础,然后再依据数据分析需要衍生出一些不同的表单,为数据分析提供干净全面的数据源。宽表一方面是用于集中相关分析数据,一方面是提高效率,不需要每次分析时都查询其他的数据表,影响数据仓库效率。

    2. 数据抽样选择

    简单的数据分析可以调用全体数据进行分析,数据抽样主要用于建模分析,抽样需考虑样本具有代表性,覆盖各种客户类型,抽样的时间也很重要,越近的时间窗口越有利于分析和预测。在进行分层抽样时,需要保证分成出来的样本比例同原始数据基本一致。

    3 .数据类型选择

    数据类型分为连续型和离散型,建模分析时需要确定数据类型。进行业务收入趋势分析、销售额预测分析、RFM分析时,一般采用连续型变量。信用评级、分类预测时一般采用离散变量。

    4 .缺失值处理

    数据分析过程中会面对很多缺失值,其产生原因不同,有的是由于隐私的原因,故意隐去。有的是变量本身就没有数值,有的是数据合并时不当操作产生的数据缺失。

    缺失值处理可以采用替代法(估值法),利用已知经验值代替缺失值,维持缺失值不变和删除缺失值等方法。具体方法将参考变量和自变量的关系以及样本量的多少来决定。

    5. 异常值检测和处理

    异常值对于某些数据分析结果影响很大,例如聚类分析、线性回归(逻辑回归)。但是对决策树、神经网络、SVM支持向量机影响较小。

    一般异常值是指明显偏离观测值的平均值,例如年龄为200岁,平均收入为10万元时,有个异常值为300万元。第一个异常值为无效异常值,需要删掉,但是第二个异常值可能属于有效异常值,可以根据经验来决定是否保留或删掉。

    6 .数据标准化

    数据标准化的目的是将不同性质、不同量级的数据进行指数化处理,调整到可以类比的范围。例如在建立逻辑回归模型时,性别的取值是0或以,但是收入取值可能就是0-100万,跨度较大,需要进行标准化。

    一般可以采用最佳/最大标准化(Min-Max标准化法)将数值定在0和1之间,便于计算。Z分数法和小数定标标准化法也可以采用。

    7 .数据粗分类(Categorization)处理

    归类和分类的目的是减少样本的变量,常有的方法由等间距分类,等频数分类。可以依据经验将自变量分成几类,分类的方法可以不同,建议采用卡方检验来决定采用哪种分类方法。连续型变量可以用WOE变化方法来简化模型,但降低了模型的可解释性。

    8 .变量选择

    数据分析过程中会面对成百上千的变量,一般情况下只有少数变量同目标变量有关,有助于提高预测精度。通常建模分析时,有意义的变量不会超过10-15个,称他们为强相关变量(聪明变量)。可以利用变量过滤器的方法来选择变量。常见的变量过滤器应用场景如下。

    一般IV值大于0.3代表变量的预测力较强,可以采用。

    三 、数据分析过程

    1. 向业务部门进行调研,了解业务需要解决的问题,将业务问题映射成数据分析工作和任务。

    2.调研企业内外部数据,找到分析需要的数据,将数据汇聚到一个特定的区域,数据集市或数据仓库,探索性分析

    3.数据清洗,包括检查数据的一致性,处理异常值和缺失值,删除重复数据等

    4.数据转换,例如数据分箱(Binning),将字符型变量转化为数字型变量,按照数据所需维度进行汇总

    5.建立模型,按照业务需求建立不同模型(例如客户流失预警、欺诈检测、购物篮分析、营销响应等)

    6.模型结果解释和评估,业务专家进行业务解释和结果评价

    四 、大数据分析场景和模型应用

    数据分析建模需要先明确业务需求,然后选择是描述型分析还是预测型分析。如果分析的目的是描述客户行为模式,就采用描述型数据分析,描述型分析就考虑关联规则、序列规则、聚类等模型。

    预测型数据分析就是量化未来一段时间内,某个事件的发生概率。有两大预测分析模型,分类预测和回归预测。常见的分类预测模型中,目标变量通常都是二元分类变量例如欺诈与否,流失与否,信用好坏等。回归预测模型中,目标变量通常都是连续型变量,常见的有股票价格预测、违约损失率预测(LGD)等。

    生存分析聚焦于将事件的结果和出现这一结果所经历的时间进行分析,源于医疗领域,研究患者治疗后的存活时间。生存分析可也可以用于预测客户流失时间,客户下次购买时间,客户违约时间,客户提前偿还贷款时间,客户下次访问网站时间等。

    常见的数据分析应用场景如下:

    1 .市场营销

    营销响应分析建模(逻辑回归,决策树)

    净提升度分析建模(关联规则)

    客户保有分析建模(卡普兰梅尔分析,神经网络)

    购物蓝分析(关联分析Apriori)

    自动推荐系统(协同过滤推荐,基于内容推荐,基于人口统计推荐,基于知识推荐,组合推荐,关联规则)

    客户细分(聚类)

    流失预测(逻辑回归)

    2 .风险管理

    客户信用风险评分(SVM,决策树,神经网络)

    市场风险评分建模(逻辑回归和决策树)

    运营风险评分建模(SVM)

    欺诈检测(决策树,聚类,社交网络)

    五、数据模型评价的方法

    数据建模

    1AUC值判别法

    AUC小于0.7识别能力很弱

    AUC在0.7-0.8之间识别能力可接受

    AUC在0.8-0.9之间识别能力卓越

    AUC大于0.9模型出现意外

    2KS判别法

    KS值大于0.2就表示具有较好的可预测性

    PS:网舟科技长期专注于金融保险、通信、航空、互联网、旅游酒店等行业的电子渠道大数据运营,为客户提供全球领先的电子渠道转型咨询、大数据挖掘和应用定制服务,助力客户互联网转型,提升数字化运营和数据营销能力。

  • ?

    评价数据的分析处理

    水之

    展开

    数据收集

    数据收集是进行安全评价最关键的基础工作。所收集的数据要以满足安全评价需要为前提。由于相关数据可能分别掌握在管理部门(设备、安全、卫生、消防、人事、劳动工资、财务等)、检测部门(质量科、技术科)以及生产车间,因此,数据收集时要做好协调工作。尽量使收集到的数据全面、客观、具体、准确。

    数据范围

    收集数据的范围以已确定的评价边界为限,兼顾与评价项目相联系的接口。如:对改造项目进行评价时,动力系统不属改造范围,但动力系统的变化会导致所评价系统的变化,因此,数据收集应该将动力系统的数据包括在内。

    数据内容

    安全评价要求提供的数据内容一般分为:人力与管理数据、设备与设施数据、物料与材料数据、方法与工艺数据、环境与场所数据。

    数据来源

    被评价单位提供的设计文件(可行性研究报告或初步设计)、生产系统实际运行状况和管理文件等;

    其它法定单位测量、检测、检验、鉴定、检定、判定或评价的结果或结论等;

    评价机构或其委托检测单位,通过对被评价项目或可类比项目实地检查、检测、检验得到的相关数据,以及通过调查、取证得到的安全技术和管理数据。

    相关的法律法规、相关的标准规范、相关的事故案例、相关的材料或物性数据、相关的救援知识,

    数据的真实性和有效性控制

    对收集到的安全评价资料数据,应关注以下几个方面:

    收集的资料数据,要对其真实性和可信度进行评估,必要时可要求资料提供方书面说明资料来源;

    对用作类比推理的资料要注意类比双方的相关程度和资料获得的条件;

    代表性不强的资料(未按随机原则获取的资料)不能用于评价;

    安全评价引用反映现状的资料必须在数据有效期限内。

    数据汇总及数理统计

    通过现场检查、检测、检验及访问,得到大量数据资料,首先应将数据资料分类汇总,再对数据进行处理,保证其真实性、有效性和代表性,必要时可进行复测,经数理统计将数据整理成可以与相关标准比对的格式,采用能说明实际问题的评价方法,得出评价结果。

    数据分类

    定性检查结果,如:符合、不符合、无此项或文字说明等;

    定量检测结果,如:20mg/m3、30mA、88dB(A)、0.8MPa等,带量纲的数据;

    汇总数据,如:起重机械30台/套,职工安全培训率89%等,计数或比例数据;

    检查记录,如:易燃易爆物品储量12t、防爆电器合格证编号等;

    照片、录像,如:法兰间采用四氟乙烯垫片、反应釜设有防爆片和安全阀、将器具放入冲压机光电感应器生效联锁切断电源等用录像记录安全装置试验结果,效果更好,特别是制作评价报告电子版本时,图像数据更为直观。

    其它数据类型,如:连续波形对比数据、数据分布、线性回归、控制图等,图表数据。

    数据结构(格式)

    汇总类,如:厂内车辆取证情况汇总、特种作业人员取证汇总;

    检查表类,如:安全色与安全标志检查表;

    定量数据消除量纲加权变成指数进行分级评价,如:有毒作业分级;

    定性数据通过因子加权赋值变成指数进行分级评价,如:机械工厂安全评价;

    引用类,如:引用其它法定检测机构“专项检测、检验”的数据;

    其它数据格式,如:集合、关系、函数、矩阵、树(林、二叉树)、图(有向图、串)、形式语言(群、环)、偏集和格、逻辑表达式、卡诺图等。

    数据处理

    在安全检测检验中,通常用随机抽取的样本来推断总体。为了使样本的性质充分反映总体的性质,在样本的选取上遵循随机化原则:

    样本各个体选取要具有代表性,不得任意删留;

    样本各个体选取必须是独立的,各次选取的结果互不影响。

    对获得的数据在使用之前,要进行数据处理,消除或减弱不正常数据对检测结果的影响。若采用了无效或无代表性的数据,会造成检查、检测结果错误,得出不符合实际情况的评价结论。

    概率

    随机事件在若干次观测中出现的次数叫频数,频数与总观测次数之比叫频率。当检测次数逐渐增多时,某一检测数据出现的频率总是趋近某一常数,此常数能表示现场出现此检测数据的可能性,这就是概率。在概率论中,把事件发生可能性的数称为概率。在实际工作中,我们常以频率近似地代替概率。

    显著性差异

    概率在0至1的范围内波动。当概率为1时,此事件必然发生;当概率为0时,此事件必然不发生。数理统计中习惯上认为概率P≤0.05为小概率,并以此作为事物间差别有无显著性的界限。

    原设定的系统,若系统之间无显著性差异(通过显著性检验确定),就可将其合并,采用相同的安全技术措施;若系统之间存在显著性差异,就应分别对待。

    数据整理和加工有三种基本形式

    按一定要求将原始数据进行分组,作出各种统计表及统计图;

    将原始数据由小到大顺序排列,从而由原始数列得到递增数列;

    按照统计推断的要求将原始数据归纳为一个或几个数字特征。

    “异常值”和“未检出”的处理

    “异常值”的处理

    异常值是指现场检测或实验室分析结果中偏离其它数据很远的个别极端值,极端值的存在导致数据分布范围拉宽。当发现极端值与实际情况明显不符时,首先要在检测条件中直接查找可能造成干扰的因素,以便使极端值的存在得到解释,并加以修正。

    若发现极端值属外来影响造成则应舍去。

    若查不出产生极端值的原因时,应对极端值进行判定再决定取舍。

    对极端值有许多处理方法。在这里介绍一种“Q值检验法”。

    “Q值检验法”是迪克森(W.J.Dixon)在1951年专为分析化学中少量观测次数(n<10)提出的一种简易判据式。检验时将数据从小到大依次排列:X1,X2,X3,……,Xn-1,Xn,然后将极端值代入以下公式求出Q值,将Q值对照表1-6的Q0.90,若Q值≥Q0.90则有90%的置信此极端值应被舍去。

    例:现场仪器测在同一点上4次测出:0.1014,0.1012,0.1025,0.1016,其中0.1025与其它数值差距较大,是否应该舍去?

    根据“Q值检验法”:

    Xn - Xn-1 0.1025-0.1016

    Q=—————=—————————=0.69<0.76 (4次观测的Q0.90=0.76)

    Xn - X1 0.1025-0.1012

    所以: 0.1025不能舍弃,测出结果应用4次观测均值0.1017

    “未检出”的处理

    在检测上,有时因采样设备和分析方法不够精密,会出现一些小于分析方法“检出限”的数据,在报告中称为“未检出”。这些“未检出”并不是真正的零值,而是处于“零值”与“检出限”之间的值,用“0”来代替不合理(可造成统计结果偏低)。“未检出”的处理在实际工作中可用两种方法进行处理:

    将“未检出”按标准的1/10加入统计整理;

    将“未检出”按分析方法“最低检出限”的1/2加入统计。

    总之,在统计分组时不要轻易将“未检出”舍掉。

    检测数据质量控制

    检测质量控制经常采用两种控制方式来保证获得数据的正确性:一是用线性回归方法对原制作的“标准曲线”进行复核;二是核对精密度和准确度。

    记录精密度和准确度最简便的方法是制作“休哈特控制图”,通过控制图可以看出检测、检验是否在控制之中,有利于观察正、负偏差的发展趋势,及时发现异常,找出原因,采取措施。

    安全评价的数据处理

    收集到的数据要经过筛选和整理,才能用于安全评价。

    来源可靠:收集到的数据要经过甄别,捨去不可靠的数据。

    数据完整:凡安全评价中要使用的数据都应设法收集到。

    取值合理:评价过程取值带有一定主观性,取值正确与否往往影响评价结果。

    为提高取值准确性可从以下三方面着手:

    严格按技术守则规定取值;

    有一定范围的取值,可采用内插法提高精度;

    较难把握的取值,可采用向专家咨询方法,集思广益来解决。

  • ?

    影响审计数据分析工作的四大因素

    Peng

    展开

    当前,影响审计数据分析工作的因素分为两个部分,即外部影响因素和内部影响因素。外部影响因素主要有被审计单位的数据信息资料不完整和被审计单位各业务系统之间的关联性差,内部影响因素主要有审计人员对数据分析的认识不够和审计人员的数据分析能力不高。上述四大因素影响着审计数据分析工作的顺利进行。

    一、四大因素的具体表现及影响

    1.被审计单位的数据信息资料无法做到真实、完整

    不仅是辅助数据信息资料不真实、不完整,一些重要的关键信息也存在缺失或者不准确。例如,一些商业银行的管理信息系统中中录入的贷款人的联系方式与纸质借贷合同中的信息不一致;明明是期房按揭的贷款、信息录入时却录入为现房信息;房地产按揭贷款中不按照实际情况输入按揭楼盘的信息、没有录入楼盘信息或者随意录入楼盘信息等等。不真实的信息会引导审计人员经常走弯路,更有甚者得出错误的分析结果,极大浪费了审计的人力和时间;一些不完整或者不存在的数据信息有时候使一些审计分析工作无法有效地开展,甚至使一些审计分析工作只得被放弃。

    2.被审计单位各业务系统之间的关联性差

    这个问题在目前各行业的信息管理系统中普遍存在。例如,在银行信息管理系统中,存款业务系统和贷款业务系统没有完全实现统一管理。查询贷款情况提供的信息与查询存款情况提供的信息不一致。或者同一用户在存款业务系统中和贷款业务系统中的代码或者名称不一致。由于同一被审计单位各业务系统之间的关联性差,审计人员在审计分析工作中就需要分别对各业务系统进行分析,审计人员无法利用信息系统做到从整体上把握审计事项的完整情况或者加大审计人员的工作负担。

    3.审计人员对数据分析的认识不够

    虽然利用计算机开展审计工作已经获得审计人员的广泛认可,但我们注意到,由于我国审计工作起步时间不长,大部分审计人员来自于从事会计领域工作的同志,习惯于手工审计的查账方式。总认为审计不用计算机或者仅凭简单的计算机技术操作,同样可以查出问题线索。虽然这样做也可以发现一些问题,但是,如此仅凭经验和一些纸质数据信息或者对电子数据的简单浏览就进行审计,势必会增加审计风险。尤其在数据量非常大的今天,如果离开计算机审计的数据分析工作,将无法把审计工作的风险降到最低。

    4.审计人员的数据分析能力不高。

    成功的数据分析工作需要充足有效的数据信息以及分析人员超强的数据分析能力。在审计实践中经常存在两种困境,即获取的大量数据信息却没有用武之地、当要求分析某一事项时又找不到所需要的数据或不知道用什么数据。这两种情况都是由审计人员的数据分析能力不高造成的。审计分析工作需要审计人员成为驾驭电子数据的伯乐,否则很难发现电子数据中隐含的能反映被审计单位业务的关键特征。

    二、有针对性的解决方案

    1.针对被审计单位数据信息资料不真实、不完整,有效地解决方案是被审计单位完善信息管理系统的管理和维护工作。信息对于信息时代来说是非常重要的资源,而真实、完整的信息才能为使用单位乃至社会发挥其必要的作用。因此,有关部门要制定和完善有关制度措施,加大对信息管理系统的监督和管理力度,使信息管理系统使用单位认识到真实、完整信息的重要性。从而将信息管理工作做好,为各使用单位提供真实完整地信息资源,真正使信息管理系统发挥其应该发挥的作用。

    2.针对被审计单位各业务系统之间的关联性差,解决方案是单位建立统一的信息管理系统平台。建立统一的信息系统管理平台,使单位的各项业务统一纳入到信息管理平台中,不仅节省单位的开发和管理成本。而且方便了各单位对信息的综合利用,从而解决同一单位内部信息不对称的问题。

    3.针对审计人员对数据分析的认识不够这一问题,应使审计机关领导尤其是审计业务处室的领导充分认识到数据分析在审计工作中的作用,并能够带头参与或者部分的参与具体的审计数据分析工作。信息不仅仅指纸质的信息,更应该包括电子数据信息资料,只有将纸质和电子数据信息统一综合起来才能够对被审计单位的情况得到好的了解:尤其在信息化环境下,大部分信息都以电子数据的形式存在。只有加强对电子数据的分析才会促进审计工作的顺利开展。

    4.针对审计人员的数据分析能力不高,解决方案是,加强时电子数据分析能力的培训以及培养审计人员发现和研究电子数据特征的敏感性。数据分析是体现分析人员综合能力的技术,更是分析人员思想在行动中集中体现的工作。审计人员只有拥有了良好的分析思路,审时度势的任务管理的知识和能力,才能将数据分析工作发挥到极致。

    审计工作的实质是在分析了解被审计单位各项信息的基础上,发表对其经营管理等企业行为的看法。而分析研究审计工作中存在的薄弱环节并加以重点改进,将是审计工作科学发展的重要工作内容之一。审计人员在审计工作实践中分析研究审计数据分析工作中存在的制约因素,将会促进审计的健康有序发展。

  • ?

    做大数据分析时,这几个技巧可以带来帮助

    海伦

    展开

    现在数据已经成为了一些企业的“天”。近年来,近年来越来越多的公司已经意识到数据分析可以带来的价值,并且已经跳上了大数据旅行车。实际上,现在所有的一切都在被监控和测量,创造了大量的数据流,通常比公司可以处理的速度更快。问题是,根据定义,大数据很大,因此数据收集中的小差异或错误可能导致重大问题,错误信息和不准确的推论。

    对于大数据而言,以业务为中心的方式分析它的挑战是实现这一目标的唯一方法,即确保公司制定数据管理策略。

    但是,有一些技术可以优化您的大数据分析,并最大限度地减少可能渗入这些大型数据集的“噪音”。以下是几个技术技巧做参考:

    优化数据收集

    数据收集是事件链中的第一步,最终导致业务决策。确保收集的数据与业务感兴趣的指标的相关性非常重要。

    定义对公司有影响的数据类型以及分析如何为底线增加价值。从本质上讲,考虑客户行为以及这对您的业务有何针对性,然后使用这些数据进行分析。

    存储和管理数据是数据分析中的重要一步。必须保持数据质量和分析效率。

    把垃圾带出去

    肮脏的数据是大数据分析的祸害。这包括不准确,冗余或不完整的客户信息,可能会对算法造成严重破坏并导致分析结果不佳。基于脏数据做出决策是一个有问题的场景。

    清理数据至关重要,涉及丢弃无关数据并仅保留高质量,最新,完整和相关的数据。人工干预不是理想的范例,是不可持续和主观的,因此数据库本身需要清理。这种类型的数据以各种方式渗透到系统,包括时间相关的转移,例如更改客户信息或数据孤岛中的存储,这可能会破坏数据集。脏数据可能会影响营销和潜在客户生成等明显的行业,但财务和客户关系也会因基于错误信息的业务决策而受到不利影响。后果很普遍,包括盗用资源,重点和时间。

    这个脏数据难题的答案是确保进入系统的数据干净的控制措施。具体而言,重复免费,完整和准确的信息。有些应用程序和公司专门研究反调试技术和清理数据,这些途径应该针对任何对大数据分析感兴趣的公司进行调查。数据卫生是营销人员的首要任务,因为不良数据质量的连锁效应可能会大大降低企业的成本。

    为了在数据方面获得最大收益,必须花时间确保质量足以为决策和营销策略提供准确的业务视图。

    标准化数据集

    在大多数业务情况下,数据来自各种来源和各种格式。这些不一致可能转化为错误的分析结果,这可能会大大扭曲统计推断。为了避免这种可能性,必须确定数据的标准化框架或格式并严格遵守它。

    数据集成

    如今,大多数企业都包含不同的自治部门,因此许多企业都拥有孤立的数据存储库或“孤岛”。这很具挑战性,因为来自一个部门的客户信息的变化不会转移到另一个部门,因此他们将根据不准确的源数据做出决策。

    为了解决这个问题,中央数据管理平台是必要的,集成了所有部门,从而确保了数据分析的准确性,因为任何变更都可以立即被所有部门访问。

    数据隔离

    即使数据干净,有组织和集成在那里,也可能是分析问题。在这种情况下,将数据分组成小组很有帮助,同时牢记分析正在努力实现的目标。这样,可以分析子组内的趋势,这可能更有意义并且具有更大的价值。在查看可能与整个数据集无关的高度特定的趋势和行为时尤其如此。

    数据质量对于大数据分析至关重要。许多公司试图用分析软件直奔潜水,而不考虑进入系统的内容。导致不准确的推断和解释,这可能是昂贵的并且对公司造成损害。一个定义明确,管理良好的数据库管理平台是企业利用大数据分析不可或缺的工具

  • ?

    数据分析的8种方法详解

    幻天

    展开

    对于具体的业务场景问题,我们该怎么办呢?我们以一个电子商务网站为例,用数据分析产品 GrowingIO 对该网站进行快速地数据采集、清晰和可视化展示,然后给大家分享这 8 种常见的数据分析方法。

    1 数字和趋势

    看数字、看趋势是最基础展示数据信息的方式。

    在数据分析中,我们可以通过直观的数字或趋势图表,迅速了解例如市场的走势、订单的数量、业绩完成的情况等等,从而直观的吸收数据信息,有助于决策的准确性和实时性。

    对于电子商务网站,流量是非常重要的指标。

    上图中,我们将网站的访问用户量(UV)和页面浏览量(PV)等指标汇汇聚到统一的数据看板(Dashboard),并且实时更新。

    这样的一个数据看板,核心数字和趋势一目了然,对于首席增长官来说一目了然。

    2 维度分解

    当单一的数字或趋势过于宏观时,我们需要通过不同的维度对于数据进行分解,以获取更加精细的数据洞察。

    在选择维度时,需要仔细思考其对于分析结果的影响。

    举个例子,当监测到网站流量异常时,可以通过拆分地区、访问来源、设备、浏览器等等维度,发现问题所在。

    3 用户分群

    针对符合某种特定行为或背景信息的用户,进行归类处理,是我们常常讲到的用户分群(segmentation )的手段。

    我们也可以通过提炼某一群用户的特定信息,创建该群体用户的画像。 例如访问购物网站、寄送地址在北京的用户,可以被归类为“北京”用户群体。

    而针对“北京”用户群体,我们可以进一步观察他们购买产品的频度、类别、时间,这样我们就创建出该用户群体的画像。

    在数据分析中,我们往往针对特定行为、特定背景的用户进行有针对性的用户运营和产品优化,效果会更加明显。

    上图中,我们通过 GrowingIO 的用户分群功能将一次促销活动中支付失败的用户挑选出来,然后推送相应的优惠券。

    这样精准的营销推广,可以大幅度提高用户支付的意愿和销售金额。

    4 转化漏斗

    绝大部分商业变现的流程,都可以归纳为漏斗。

    漏斗分析是我们最常见的数据分析手段之一,无论是注册转化漏斗,还是电商下单的漏斗。

    通过漏斗分析可以从先到后还原用户转化的路径,分析每一个转化节点的效率。  其中,我们往往关注三个要点: 第一,从开始到结尾,整体的转化效率是多少?  第二,每一步的转化率是多少?  第三,哪一步流失最多,原因在什么地方?流失的用户符合哪些特征?

    上图中注册流程分为 3 个步骤,总体转化率为45.5%;

    也就是说有 1000 个用户来到注册页面,其中 455 个成功完成了注册。

    但是我们不难发现第二步的转化率是 56.8% ,显着低于第一步 89.3% 和第三步转化率 89.7%,可以推测第二步注册流程存在问题。

    显而易见第二步的提升空间是最大的,投入回报比肯定不低;如果要提高注册转化率,我们应该优先解决第二步。

    5 行为轨迹

    关注行为轨迹,是为了真实了解用户行为。

    数据指标本身往往只是真实情况的抽象,例如,网站分析如果只看访问用户量(UV)和页面访问量(PV)这类指标,断然是无法全面理解用户如何使用你的产品。通过大数据手段,还原用户的行为轨迹,有助于增长团队关注用户的实际体验、发现具体问题,根据用户使用习惯设计产品、投放内容。

    上图中展示了一位用户在某电商网站上的详细行为轨迹,从官网到落地页,再到商品详情页,最后又回到官网首页。

    网站购买转化率低,以往的业务数据无法告诉你具体的原因;通过分析上面的用户行为轨迹,可以发现一些产品和运营的问题(比如是不是商品不匹配等等),从而为决策提供依据。

    6 留存分析

    在人口红利逐渐消褪的时代,留住一个老用户的成本要远远低于获取一个新用户。

    每一款产品,每一项服务,都应该核心关注用户的留存,确保做实每一个客户。

    我们可以通过数据分析理解留存情况,也可以通过分析用户行为或行为组与回访之间的关联,找到提升留存的方法。

    在 LinkedIn,增长团队通过数据发现,如果新用户进来后添加 5 个以上的联系人(上图红色线条),那么他/她在 LinkedIn 上留存要远远高于那些没有添加联系人(上图绿色和紫色的线条)的留存。

    这样,添加联系人称为 LinkedIn 留存新用户的最核心手段之一。除了需要关注整体用户的留存情况之外,市场团队可以关注各个渠道获取用户的留存度,或各类内容吸引来的注册用户回访率,产品团队关注每一个新功能对于用户的回访的影响等等,这些都是常见的留存分析场景。

    7 A/B 测试

    A/B 测试用来对比不同产品设计/算法对结果的影响。

    产品在上线过程中经常会使用 A/B 测试来测试不同产品或者功能设计的效果,市场和运营可以通过 A/B 测试来完成不同渠道、内容、广告创意的效果评估。

    举个例子,我们设计了两种不同的产品交互形式,通过比较实验组(A 组)和对照组(B 组)的访问时长和页面浏览量两个衡量指标,来评估哪一种交互形式更佳。要进行 A/B 测试有两个必备因素:

    第一,有足够的时间进行测试;

    第二,数据量和数据密度较高。

    因为当产品流量不够大的时候,做 A/B 测试得到统计结果是很难的。而像 LinkedIn 这样大体量的公司,每天可以同时进行上千个 A/B 测试。所以 A/B 测试往往在公司数据规模较大时使用会更加精准,更快得到统计的结果。

    8 数学建模

    当一个商业目标与多种行为、画像等信息有关联性时,我们通常会使用数学建模、数据挖掘的手段进行建模,预测该商业结果的产生。

    作为一家 SaaS 企业,当我们需要预测判断客户的流失时,可以通过用户的行为数据、公司信息、用户画像等数据建立流失模型。

    利用统计学的方式进行一些组合和权重计算,从而得知用户满足哪些行为之后流失的可能性会更高。

    我们常常说,不能度量,就无法增长,数据分析对于企业商业价值的提升有着至关重要的作用。

    当然,仅仅掌握单纯的理论还远远不够,实践出真知。数据分析的方法大家不妨在自己日常工作中,有分析相关项目里尝试使用,相信可以事半功倍,创造更多商业价值。

  • ?

    9月17日当周重磅事件及数据影响力分析报告

    Huai

    展开

    来源:汇通网

    上周蕴含了较多重要数据事件,包括美联储官员的讲话、美国经济褐皮书、美国CPI及零售销售数据、欧银、英银利率决议、德拉基讲话、原油市场三大月报等,给市场带来不小的波动。

    展望下周,将率先迎来欧佩克+技术性委员会会议和欧元区8月末季调CPI或掀起欧元、油市的大行情。周中还有日银利率决议,此次无经济展望报告,日本行长黑田东彦会发表讲话。下半周还会有新西兰二季度GDP、英国零售销售数据以及欧元区9月消费者信心指数初值等。

    周五,主要是欧洲国家的制造业数据以及加拿大零售销售及CPI数据,预计在下半周欧系货币、加元、黄金的波动将会加大。

    周一(9月17日)关键词:欧佩克+技术性委员会会议、欧元区8月未季调CPI年率终值(%)

    本交易日在亚洲时段没有重要数据,料行情清淡,在进入欧洲时段后欧元区8月未季调CPI年率终值、意大利7月贸易帐都值得留意。因为欧银在上周利率决议中维持近三年的通胀预期在1.7%不变,所以市场预期欧元区8月CPI年率终值同前值持平录得2%。

    不过欧元区8月CPI月率的前值是-0.2%,市场预期是0.3%远高于前值,这和德拉基之前的讲话一致,他认为潜在通胀率在中期逐步抬升,通胀符合目标水平的状况将持续。

    如果数据预测没有出现太大偏差,可能使得欧元走强,尤其是考虑到上周五欧系货币已经出现深幅回调。

    意大利贸易帐的好坏也能评判其经济状况,数据向好则化解财政预算危机,减少欧盟内部的民粹主义情绪。

    另外原定于由9月11日欧佩克和非欧佩克联合会输委员会将在9月17日召开。此前市场人士分析称此次会议召开前将会对如何填补伊朗的原油缺口做进一步的商讨,此次延长不排除以沙特为主产油国将讨论任何增加产量以抢夺伊朗的原油市场份额,这可能会进一步施压油价。

    当下围绕油市的问题还有两个,包括伊朗供给最终会减少多少及弗洛伦斯飓风的具体影响,这些基本面因素应综合考量。

    周二(9月18日)关键词:澳洲联储9月会议纪要、德拉基讲话、第三次朝韩首脑会议

    在亚洲时段,澳大利亚房价指数以及当周消费者信心指数值得关注,在9:30的时候还有澳洲联储9月会议纪要。

    9月决议声明称,低利率持续支持澳大利亚经济,通胀与经济在2019-2020年较目前更高,保持利率不变符合一段时间内CPI达到目标的需求,保持利率不变符合可持续的经济增长需求。

    预计今明两年GDP增速将略高于3%。总体对澳大利亚劳动力市场、全球经济保持乐观预期,如果措辞鹰派可能加大澳元的反弹空间。

    在北京时间15:00,欧洲央行行长德拉基将在主题为“欧洲的金融监督及国家机关作用”的金融监管会议上发表讲话,可能也会加大欧系货币的行情反应。

    最后,朝韩第三次首脑会晤将于9月18-20日举行,之前在已经在非公开高级会议上商定了具体行程。

    据韩国统一部副部长千海成表示,韩方将通过即将举行的“文金会”推动双边关系发展,促朝采取无核化具体措施,争取年内发表终战宣言,促进朝美关系改善和建立韩半岛和平机制。如果北南关系缓和可能打压避险情绪,使得黄金再度承压。

    周三(9月19日) 关键词:日银利率决议、英国CPI月率及零售物价指数、美国二季度贸易帐、API、EIA数据

    亚盘时段,首先会迎来日本贸易帐数据,然后在11:00日本央行会公布利率决议以及货币政策声明。由于日银是实施最大胆宽松货币政策的国家,预计日本央行下将维持当前政策框架不变。

    虽然日元在上一周表现不佳,但是安倍晋三此前称,不认为日本应该永久维持超宽松政策,不过信任行长黑田东彦,由他来决定合适结束宽松政策。

    日本此前允许长短国债利率在0.1%上下两倍区间波动,更多的是照顾银行业盈利状况,考虑到通胀远未达到目标且未来上调消费税的影响,仍难回归正常化货币政策。不过如果有稍显鹰派或者灵活性政策调整都会利多日元。

    英国方面,8月核心CPI年率、8月末季度输入PPI年率、8月零售物价指数年率将在16:30一同公布,留意日内英镑的走势。

    鉴于英国二季度GDP增速回暖以及卡尼对薪资增速的乐观预期,数据不差。不过英镑走势更多受到脱欧进展影响,上周巴尼耶称6-8周内达成协议时可能的,有媒体称英国同意跨爱尔兰海的商品流数据。

    英国和欧盟可能在脱欧后仍保持前所未有的亲密关系,但应当警惕的是目前仍无实质性协议达成,存在变数可能。

    最后纽盘时段还有美国二季度贸易帐数据,预计较前值略有改善。特朗普不愿意承担加杠杆的消费者角色,如果贸易逆差过大可能反而利好美元,因为总统会更加坚定强硬的对外贸易政策。

    上一周API、EIA原油库存都出现了大幅下降得情况,油市趋紧使得油价受到支撑,需留意这些常规数据带来的日内影响。

    周四(9月20日)关键词:新西兰二季度GDP、美国当周初请失业人数、英国零售销售月率、欧元区9月消费者信心指数

    周四早间6:45有新西兰二季度GDP数据,在2017年四季度见顶后一直是下行趋势,需留意能否高于前值扭转这一态势。

    欧洲时段有英国零售销售月率,在消除了天气影响的暂时因素后,这一指标已经反弹,核心零售销售月率为0.9%,后续需留意能否达到5月份1.3%年内高位水平。

    纽盘时段,有美国当周初请失业人数、欧元区9月消费者信心指数初值、美国8月成屋销售年化总数,欧美之间的数据搏杀将加大日内美元指数的波动。

    事件上,日本将开启自民党党内选举,目前安倍晋三优势巨大,或连续3次当选日本自民党总裁。该党405名国会议员中有310人支持首相安倍晋三力连续3次当选,占到整体的76%,最大对手石破茂应该很难上位。

    周五(9月21日)关键词:日本8月全国CPI年率、欧元区9月制造业PMI初值、加拿大8月CPI及零售销售月率、美国9月Markit服务业、制造业初值

    本交易日首先将迎来日本8月全国核心CPI年率,预计较前值0.8%微升至0.9%不过离2%的目标还有很大距离。日本7月份的对于2018财年核心CPI预期为1.1%,2019财年核心CPI预期为1.5%,2020年核心CPI预期为1.6%,也就是说未来数据仍有较大上升空间或利好日元。

    接下来是欧元区9月制造业的PMI初值,另外还有法国、德国的制造业数据。市场预期不会有太大变动,除非特朗普加征汽车关税,否则数据的变化有限。

    纽盘时段,加拿大8月CPI年率能否在7月加速上行后保持涨势值得关注,良好的GDP增速和通胀数据是加拿大年内加息两次的保障,加元的走势也确实相对强劲。此外,7月零售销售数据也是看点,在上月表现不佳的情况下,本次数据可能会带来意外惊喜,因为市场预期10月加拿大央行将会年内第三加息,一定是以经济基本面作为支撑。

    稍晚还有美国9月制造业PMI初值,在美国经济褐皮书中曾提到企业对关税政策忧虑以及贸易政策不确定性因素的风险,供应链断裂导致成本上涨,该先驱指标能帮我们窥探美国三季度GDP是否依旧强劲。

    最后提醒投资者,NYMEX纽约原油10月期货受移仓换月影响,9月21日凌晨2:30完成场内最后交易,凌晨5:00完成电子盘最后交易,请留意交易场所到期换月公告控制风险。此外部分交易平台美油合约到期时间通常较NYMEX官方提前一天,请多加留意。

数据影响分析

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP