中企动力 > 商学院 > 数据分析信息采集
  • ?

    论数据采集对数据分析的重要性

    Jay

    展开

    数据采集是市场研究的重要组成部分,同样因为是进行科学性数据分析的基础。采集数据的准确性直接关系到数据分析结果的价值,所以科学的数据采集方法将是数据分析师分析的前提。

    长期以来关于投资数据分析的理论以日趋成熟,但原始数据获取方法一直是困惑许多投资数据分析人员的屏障。很多数据分析师的工作中,由于数据采集工作没有真正的开展,而使市场研究工作流于形式,形成了空话加套话的报告模式。使人对于科学的数据分析工作的误解越来越深,导致决策的依据严重不足。因此我们需要重视是市场研究的重要性,有认识到它对于投资、运营、生产、销售、产品价格等等重大而深远的意义,我们要基于严谨而科学的数据采集工作来切实开展采集市场研究工作。

    数据采集包括历史数据的采集和当前市场数据的采集。一般来讲,对于已成型的投资或其他项目的再投资,投资的环境基本稳定,项目发展的规律在投资内没有打的改变,我们可以通过搜集准确的历史数据或可比历史数据,根据以往的发展规律,运用定量预测技术对预测结果加以修正。因而,这类的项目的数据采集主要是对历史销售数据的有效采集。而对于新开发的项目,由于缺乏可比性历史数据,或者市场发展规律不明确或者不稳定,我们则首先需要通过市场研究甄别出影响市场需求的主要市场因素的变量,根据项目具体情况选择市场调研的途径和方法,进而采集相关的市场数据,进行数据分析形成预测主要市场因素之间关系的数据基础。

    而数据采集遵循可以下程序(建议)

    指定市场研究的具体计划

    明确数据来源

    明确抽样方案及样本容量

    明确数据采集方法

    问卷设计

    数据处理及分析

    数据分析及处理分别是指;

    数据处理:对采集数据资料要经过一个去伪存真,去粗取精和科学加工处理的过程。从而保证分析工作的客观科学,更好指导整个项目活动的顺利进展。同时,数据资料经过搜集、加工、处理之后,要对其进行分析,从中找到均有普遍意义的规律性。

    数据处理及分析包括了数据输入、数据清理、数据整理及数据图表展示四个环节等等。

  • ?

    大数据信息采集企业营销新动力

    符君浩

    展开

    企业做营销推广

    如何在合适的时间、合适的地点、以合适的方式触达消费者

    随着大数据信息采集的飞速发展

    这些问题的答案已然显现于眼前

    1.依靠大数据信息采集

    类似云速数据挖掘这样的营销系统为支点

    获取到有效的客户信息

    从中快速获取客户的消费需求和达成方式

    2.依据大数据信息采集

    可以对采集到的客户提供产品推广和服务

    预知客户未来需求

    提前做好产品铺垫

    提高客户转化率

    3.大数据信息采集时代

    企业可以利用数据筛选分类

    来确定客户的消费需求

    从而预测客户的下一步消费计划

    从而提供更精准的服务

    总之

    大数据信息采集可以帮助企业营销提供数据支持

    同时也可以依据大数据分析总结规律

    调整营销方案

    帮助企业快速精准做好营销活动

  • ?

    企业进入大数据信息采集时代

    程伟诚

    展开

    做网络营销

    不论是个人还是公司都想要实现产品的渠道拓展和推广宣传

    但绝大多数的企业都不能达成想要的效果

    其实原因有很多

    一、想要做好网络营销

    客户是王道

    没有强大的客户群做后盾

    网络营销的销量不过是空想罢了

    当下客户渠道大多以网络大数据信息采集的方式来获取

    如云速数据挖掘

    通过输入行业关键字

    就能一键采集指定区域的客户信息和联系方式

    省时高效

    二、通过客户信息

    从分考虑分析目标群体的生活轨迹和习惯

    来预测客户下一步的消费行为

    以正确的时间正确的方式传达产品信息

    从而完成营销活动

    三、产品文案的策划一定要以客户需求为重点

    并且简单易懂、快速吸引客户眼球

    才能使转化率达到最佳

  • ?

    干货丨收集最全的数据分析图

    Rodvig

    展开

    来自:数据观 https://shujuguan

    DT时代,我们每天都会收获来自各种渠道的海量数据,它们是对我们上一步行动的反馈,但人脑消化数据的能力却是有限的——如何及时洞察数据中的涵义,就需要数据可视化工具的帮助了。然而,图表的类型非常丰富,如何做出正确的选择,达到“一图胜千言”的效果呢?

    [数据的五种关系]

    首先,我们需要了解,数据通常包含五种相关关系:构成、比较、趋势、分布及联系。

    构成

    主要关注每个部分所占整体的百分比,如果你想表达的信息包括:“份额”、“百分比”以及“预计将达到百分之多少”,这时候可以用到饼图。

    比较

    可以展示事物的排列顺序——是差不多,还是一个比另一个更多或更少呢?“大于”、“小于”或者“大致相当”都是比较相对关系中的关键词,这时候会首选条图。

    趋势

    是最常见的一种时间序列关系,关心数据如何随着时间变化而变化,每周、每月、每年的变化趋势是增长、减少、上下波动或基本不变,这时候使用线图更好地表现指标随时间呈现的趋势。

    分布

    是关心各数值范围内各包含了多少项目,典型的信息会包含:“集中”、“频率”与“分布”等,这时候使用柱图;同时,还可以根据地理位置数据,通过地图展示不同分布特征。

    联系

    主要查看两个变量之间是否表达出我们预期所要证明的模式关系,比如预期销售额可能随着折扣幅度的增长而增长,这时候可以用气泡图来展示,用于表达“与……有关”、“随……而增长”、“随……而不同”变量间的关系。

    对信息中包含的5种关系,可以简单归纳如下:

    构成:占总体的百分比

    比较:项目的排名

    趋势:如何随着时间变化

    分布:项目的频率情况

    联系:变量之间的关系

    [图表的具体适用场景]

    下面,我们具体来看一下图表特点及适用场景:

    以下图表均制作于数据观

    条图

    条图表达比较关系,按照强调的方式可以排列任何顺序,适用于高亮Top3或Top5数据,如在零售行业中统计畅销品的销售情况就是很好的应用。它是最通用的一种图表,应在所有的图集使用中占到25%。

    柱图

    柱图用高度反映数据差异,用来展示有多少项目(频率)会落入一个具有一定特征的数据段中,比如分析公司人员构成是否存在老龄化现象,可以通过柱图看到25岁以下的员工有多少,25岁到35岁之间员工有多少等这种年龄的分布情况。同时,柱图还可以用来表示含有较少数据值的趋势变化关系。

    分析图形有单指标柱图、多指标柱图以及堆叠柱图类型。

    (1)、单指标柱图

    (2)、多指标柱图

    (3)、堆叠柱图

    线图

    线图可用来反映随时间变化而变化的关系,尤其是在趋势比单个数据点更重要的场合。

    在柱图与线图的选择过程中,可以考虑数据的本质。柱图强调的是数量的级别,它更适合于表现在一小段时间里发生的事件,产量的数据很适合这个领域。线图强调的是角度的运动及图像的变换,因此展示数据的发展趋势时最好使用它,存货量就是一个很好的例子。柱图和线图的使用应占到图集看板的50%左右。

    线图类型中可以有单线图,还可以在图中进行多指标趋势性比较。

    (1)、单线图

    (2)、多指标趋势性比较

    饼图

    构成比例关系时,最好使用饼图,给人一种整体的形象,可以展示每一部分所占全部的百分比,比如产品A预计销售额占到所有产品销售额的最大份额。

    为了使饼图尽量发挥作用,在使用中不宜多于6种成分。人的眼睛比较习惯于按顺时针方向进行观察,所以应该讲最重要的部分放在紧靠12点钟的位置,如果没有哪一个部分比其他部分更加重要,那么就应该考虑让它们从大到小的顺序排列。

    数据观除了有标准饼图,还提供中空饼图和环形饼图两种类型。

    (1)、标准饼图

    (2)、中空饼图

    (3)、环形饼图

    Attention!不适用饼图的情况

    饼图是通过面积呈现数据的变化,当各指标所占比例接近时,无法直观的判断面积的大小,此时选择条图来呈现,规律就更加清晰。饼图是应最少使用的图表,在所有的陈述和报告中其使用率应少于5%。

    错误的图表类型:

    正确的图表类型:

    气泡图

    气泡图判断两个变量之间是否存在某种关系,可反映五维数据。每个气泡的不同颜色或标签,以及气泡点大小,都可以反映一个维度。一般使用率为10%。

    KPI图

    最直接显示结果,适用于高亮关注指标值或者差异,可以通过主要指标和次要指标进行体现。信息量避免过多,越直观越好。

    面积图

    与折线图较为类似,面积图强调变量随时间而变化的程度,也可用于引起人们对总值趋势的注意。用填充了颜色或图案的面积来显示数据,面积片数不宜超过5片。

    漏斗图

    漏斗图用来表示逐层分析的过程,从一个总值(最顶端),不断除去不关心的部分,最终得到关心的值的过程。

    多用于业务流程比较规范、周期长、环节多的流程分析,通过比较各个环节宽窄大小,能够直观地发现和说明问题所在。常见应用场景:电商网站、营销推广、CRM等。

    1)电商网站:通过转化率比较能充分展示用户从进入网站到实现购买的最终转化率。2)营销推广:反映搜索营销的各个环节的转化,从展现、点击、访问、咨询,直到生成订单过程中的客户数量及流失。

    3)CRM:销售漏斗图用来展示客户各个阶段转化比较。

    金字塔图

    金字塔图用于展示类似金字塔的层级结构和数据量。例如某个国家的收入分配,金字塔顶部显示高收入类别,逐渐降低到代表低收入的底部。

    雷达图

    雷达图可以用来表现一个周期数值的变化,也可以用来表现特定对象主要参数的相对关系。

    雷达图多用于在财务分析中,用来分析企业负债能力、运营能力、盈利和发展能力等指标。

    地图

    地图是信息密度最大的数据可视化方式,人们在日常生活中就使用地图,所以能直观理解地图。

    数据观基于不同的视觉化原理提供三种地图:区域地图、散点地图和热力地图。

    (1)、区域地图

    区域地图是按照国家、省市行政区划分,用来展现地理信息,以及与地理位置有关的信息,指标的多少可以用颜色深浅区分。

    (2)、散点地图

    散点地图基于高德地图实现,通过定位经纬度,用散点来表示所在位置的信息指标。

    (3)、热力地图

    热力地图以特殊高亮的形式显示访客所在的地理区域的图示,不同颜色反映不同区域密度的分布。

    表格

    表格可以通过拖拽所关心的指标,如通过一级、二级分类,了解更加明细的数据,起到数据透视表功能。

    综合使用

    饼图、柱图、条图、线图、气泡图可以组成可视化报告90%图形,其他视觉化展示可以将图表组合起来综合使用。

    以上就是为大家提供的图表基本使用原则,适用于日常工作中大多数的图表制作。

    最后,希望大家都可以需要根据自己想要表达的信息选择合适的图表,让数据可视化帮助我们的大脑减负,替我们的数据说话。

  • ?

    数据分析全流程(内附案例)

    老愚

    展开

    (图片来源于网络)

    作者:苏格兰折耳喵

    来源: 运营喵是怎样炼成的 (yymzylc)

    (温馨提示:图片显示毛糙和不清楚,是分辨率过高的缘故,点击图片,即可看到高清大图。 )

    本文将对一个案例进行从数据采集、数据清洗、数据分析再到数据可视化的全流程分析,力求条理清晰的展现外部数据分析的强大威力。以下是本文的写作框架:

    1 分析背景

    1.1 分析原理---为什么选择分析虎嗅网

    在现今数据爆炸、信息质量良莠不齐的互联网时代,我们无时无刻不身处在互联网社会化媒体的“信息洪流”之中,因而无可避免的被它上面泛滥的信息所“裹挟”,也就是说,社会化媒体上的信息对现实世界中的每个人都有重大影响,社会化媒体是我们间接了解现实客观世界和主观世界的一面窗户,我们每时每刻都在受到它的影响。

    综合上述两类情形,可以得出这样的结论,透过社会化媒体,我们可以观察现实世界:

    由此, 社会化媒体是现实主客观世界的一面镜子,而它也会进一步影响人们的行为,如果我们对该领域中的优质媒体所发布的信息进行分析,除了可以了解该领域的发展进程和现状,还可以对该领域的人群行为进行一定程度的预判。

    鉴于此种情况,作为互联网从业者的笔者想分析一下互联网行业的一些现状,于是想到了虎嗅网。

    虎嗅网创办于2012年5月,是一个聚合优质创新信息与人群的新媒体平台。该平台专注于贡献原创、深度、犀利优质的商业资讯,围绕创新创业的观点进行剖析与交流。虎嗅网 的核心,是关注互联网及传统产业的融合、一系列明星公司(包括公众公司与创业型企业)的起落轨迹、产业潮汐的动力与趋势。

    因此,对该平台上的发布内容进行分析,对于研究互联网的发展进程和现状有一定的实际价值。

    1.2 本文的分析目的

    笔者在本项目中的分析目的主要有4个:

    (1)对虎嗅网内容运营方面的若干分析,主要是对发文量、收藏量、评论量等方面的描述性分析;

    (2)通过文本分析,对互联网行业的一些人、企业和细分领域进行趣味性的分析;

    (3)展现文本挖掘在数据分析领域的实用价值;

    (4)将杂芜无序的结构化数据和非结构化数据进行可视化,展现数据之美。

    1.3 分析方法---分析工具和分析类型

    本文中,笔者使用的数据分析工具如下:

    Python3.5.2(编程语言)

    Gensim(词向量、主题模型)

    Scikit-Learn(聚类和分类)

    Keras(深度学习框架)

    Tensorflow(深度学习框架)

    Jieba(分词和关键词提取)

    Excel(可视化)

    Seaborn(可视化)

    新浪微舆情(情绪语义分析)

    Bokeh(可视化)

    Gephi(网络可视化)

    Plotly(可视化)

    使用上述数据分析工具,笔者将进行2类数据分析:第一类是较为传统的、针对数值型数据的描述下统计分析,如阅读量、收藏量等在时间维度上的分布;另一类是本文的重头戏---深层次的文本挖掘,包括关键词提取、文章内容LDA主题模型分析、词向量/关联词分析、DTM模型、ATM模型、词汇分散图和词聚类分析。

    2 数据采集和文本预处理

    2.1 数据采集

    笔者使用爬虫采集了来自虎嗅网主页的文章(并不是全部的文章,但展示在主页的信息是主编精挑细选的,很具代表性),数据采集的时间区间为2012.05~2017.11,共计41,121篇。采集的字段为文章标题、发布时间、收藏量、评论量、正文内容、作者名称、作者自我简介、作者发文量,然后笔者人工提取4个特征,主要是 时间特征 (时点和周几)和 内容长度特征 (标题字数和文章字数),最终得到的数据如下图所示:

    2.2 数据预处理

    数据分析/挖掘领域有一条金科玉律:“Garbage in, Garbage out”,做好数据预处理,对于取得理想的分析结果来说是至关重要的。本文的数据规整主要是对文本数据进行清洗,处理的条目如下:

    (1) 文本分词

    要进行文本挖掘,分词是最为关键的一步,它直接影响后续的分析结果。笔者使用jieba来对文本进行分词处理,它有3类分词模式,即全模式、精确模式、搜索引擎模式:

    · 精确模式:试图将句子最精确地切开,适合文本分析;

    · 全模式:把句子中所有的可以成词的词语都扫描出来, 速度非常快,但是不能解决歧义;

    · 搜索引擎模式:在精确模式的基础上,对长词再次切分,提高召回率,适合用于搜索引擎分词。

    现以“新浪微舆情专注于社会化大数据的场景化应用”为例,3种分词模式的结果如下:

    【全模式】: 新浪/ 微舆情/ 新浪微舆情/ 专注/于/ 社会化/ 大数据/ 社会化大数据/ 的/ 场景化/ 应用

    【精确模式】: 新浪微舆情/ 专注/于/ 社会化大数据/ 的/ 场景化/ 应用

    【搜索引擎模式】:新浪,微舆情,新浪微舆情,专注,于,社会化,大数据,社会化大数据,的,场景化,应用

    为了避免歧义和切出符合预期效果的词汇,笔者采取的是精确(分词)模式。

    (2) 去停用词

    这里的去停用词包括以下三类:

    标点符号:, 。! /、*+-

    特殊符号:▲等

    无意义的虚词: “the”、“a”、“an”、“that”、“你”、“我”、“他们”、“想要”、“打开”、“可以”等

    (3) 去掉高频词、稀有词和计算Bigrams

    去掉高频词、稀有词是针对后续的主题模型(LDA、ATM)时使用的,主要是为了排除对区隔主题意义不大的词汇,最终得到类似于停用词的效果。

    Bigrams是为了自动探测出文本中的新词,基于词汇之间的共现关系---如果两个词经常一起毗邻出现,那么这两个词可以结合成一个新词,比如“数据”、“产品经理”经常一起出现在不同的段落里,那么,“数据_产品经理”则是二者合成出来的新词,只不过二者之间包含着下划线。

    3 描述性分析

    该部分中,笔者主要对数值型数据进行描述性的统计分析,它属于较为常规的数据分析,能揭示出一些问题,做到知其然。

    3.1 发文数量、评论量和收藏量的变化走势

    从下图可以看出,在2012.05~2017.11期间,以季度为单位,主页的发文数量起伏波动不大,在均值1800上下波动,进入2016年后,发文数量有明显提升。

    此外,一头(2012年第二季)一尾(2017年第四季)因为没有统计完全,所以发文数量较小。

    下图则是该时间段内收藏量和评论量的变化情况,评论量的变化不愠不火,起伏不大,但收藏量一直在攀升中,尤其是在2017年的第二季达到峰值。收藏量在一定程度上反映了文章的干货程度和价值性,读者认为有价值的文章才会去保留和收藏,反复阅读,含英咀华,这说明虎嗅的文章质量在不断提高,或读者的数量在增长。

    3.2 发文时间规律分析

    笔者从时间维度里提取出“周”和“时段”的信息,也就是开题提到的“人工特征”的提取,现在做文章分布数量的在“周”和“时”上的交叉分析,得到下图:

    上图是一个热力图,色块颜色上的由暖到冷表征数值的由大变小。很明显的可以看到,中间有一个颜色很明显的区域,即由“6时~19时”和“周一~周五”围成的矩形,也就是说,发文时间主要集中在工作日的白天。另外,周一到周五期间,6时~7时这个时间段是发文的高峰,说明虎嗅的内容运营人员倾向于在工作日的清晨发布文章,这也符合它的人群定位---TMT领域从业、创业者、投资人,他们中的许多人有晨读的习惯,喜欢在赶地铁、坐公交的过程中阅读虎嗅讯息。发文高峰还有9时-11时这个高峰,是为了提前应对读者午休时间的阅读,还有17时~18时,提前应对读者下班时间的阅读。

    3.3 相关性分析

    笔者一直很好奇,文章的评论量、收藏量和标题字数、文章字数是否存在统计学意义上的相关性关系。基于此,笔者绘制出能反映上述变量关系的两张图。

    首先,笔者做出了标题字数、文章字数和评论量之间的 气泡图 (圆形的气泡被六角星替代,但本质上还是气泡图)。

    上图中,横轴是文章字数,纵轴是标题字数,评论数大小由六角星的大小和颜色所反映,颜色越暖,数值越大,五角星越大,数值越大。从这张图可以看出,文章评论量较大的文章,绝大部分分布于由文章字数6000字、标题字数20字所构成的区域内。虎嗅网上的商业资讯文章大都具有原创、深度的特点,文章篇幅中长,意味着能把事情背后的来龙去脉论述清楚,而且标题要能够吸引人,引发读者的大量阅读,合适长度标题和正文篇幅才能做到这一点。

    接下来,笔者将收藏量、评论量和标题字数、文章字数绘制成一张3D立体图,X轴和Y轴分别为标题字数和正文字数,Z轴为收藏量和评论量所构成的 平面 ,通过旋转这个3维的Surface图,我们可以发现收藏量、评论量和标题字数、文章字数之间的相关关系。

    注意,上图的数值表示和前面几张图一样,颜色上的由暖到冷表示数值的由大到小,通过旋转各维度的截面,可以看到在正文字数5000字以内、标题字数15字左右的收藏量和评论量形成的截面出现“华山式”陡峰,因而这里的收藏量和评论量最大。

    3.4 城市提及分析

    在这里,笔者通过构建一个包含全国1~5线城市的词表,提取出经过预处理后的文本中的城市名称,根据提及频次的大小,绘制出 一张反映城市提及频次的地理分布地图 , 进而间接地了解各个城市互联网的发展状况(一般城市的提及跟互联网产业、产品和职位信息挂钩,能在一定程度上反映该城市互联网行业的发展态势)。

    上图反映的结果比较符合常识,北上深广杭这些一线城市的提及次数最多,它们是互联网行业发展的重镇。值得注意的是,长三角地区的大块区域(长江三角洲城市群,它包含 上海 , 江苏省 的 南京 、 无锡 、 常州 、 苏州 、 南通 、 盐城 、 扬州 、 镇江 、 泰州 , 浙江省 的 杭州 、 宁波 、 嘉兴 、 湖州 、 绍兴 、 金华 、 舟山 、 台州 , 安徽省 的 合肥 、 芜湖 、 马鞍山 、 铜陵 、 安庆 、 滁州 、 池州 、 宣城 )呈现出较高的热度值,直接说明这些城市在虎嗅网各类资讯文章中的提及次数较多,结合国家政策和地区因素,可以这样理解地图中反映的这个事实:

    长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。

    长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。

    接下来,笔者将抽取文本中城市之间的 共现关系 ,也就是城市之间两两同时出现的频率,在一定程度上反映出城市间经济、文化、政策等方面的相关关系,共现频次越高,说明二者之间的联系紧密程度越高,抽取出的结果如下表所示:

    将上述结果绘制成如下动态的流向图:

    由于虎嗅网上的文章大多涉及创业、政策、商业方面的内容,因而这种城市之间的共现关系反映出城际间在资源、人员或者行业方面的关联关系,本动态图中,主要反映的是北上广深杭(网络中的枢纽节点)之间的相互流动关系和这几个一线城市向中西部城市的单向流动情形。流动量大、交错密集的区域无疑是中国最发达的3个城市群和其他几个新兴的城市群:

    京津冀城市群

    长江三角洲城市群

    珠江三角洲城市群

    中原城市群

    成渝城市群

    长江中游城市群

    上面的数据分析是基于数值型数据的描述性分析,接下来,笔者将进行更为深入的文本挖掘。

    4 文本挖掘

    数据挖掘是从有结构的数据库中鉴别出有效的、新颖的、可能有用的并最终可理解的模式;而文本挖掘(在文本数据库也称为文本数据挖掘或者知识发现)是从大量非结构的数据中提炼出模式,也就是有用的信息或知识的半自动化过程。

    本文的文本挖掘部分主要涉及高频词统计/关键词提取/关键词云、文章标题聚类、文章内容聚类、文章内容LDA主题模型分析、词向量/关联词分析、ATM模型、词汇分散图和词聚类分析。

    4.1 关键词提取

    对于关键词提取,笔者没有采取词频统计的方法,因为词频统计的逻辑是:一个词在文章中出现的次数越多,则它就越重要。因而,笔者采用的是 TF-IDF (termfrequency–inverse document frequency)的关键词提取方法:

    它用以评估一字/词对于一个文件集或一个语料库中的其中一份文件的重要程度,字/词的重要性会随着它在文件中出现的次数成正比增加,但同时会随着它在语料库中出现的频率成反比下降。

    由此可见,在提取某段文本的关键信息时,关键词提取较词频统计更为可取,能提取出对某段文本具有重要意义的关键词。

    下面是笔者利用jieba在经预处理...

  • ?

    数据分析师需要掌握的知识:数据采集内容与程序

    慈悲的

    展开

    数据采集内容

    数据采集包括历史数据的采集和当前市场数据的采集,是科学进行数据分析的基础,数据采集的准确与否直接决定了数据分析的价值。

    在企业运营过程中,假设企业环境基础不稳定,项目发展的规律在运营期间内没有大的变化,我们可以通过搜集准确的历史数据或可比历史数据,根据以往的发展规律,运用定量预测技术对未来收入和成本加以预测,直接推算出预测的相关数据。当运营环境略有改变时,可以利用定性预测技术对预测结果加以修正。因而,这类项目的数据采集主要是对历史数据的有效采集。

    对于新开的发的项目,由于缺乏可比性历史数据,或者市场发展规律不明确或不稳定,我们则先需要通过市场调研甄别影响市场需要求的主要市场因素的变量,根据项目具体情况选择市场调研的途径和方法,进而采集相关的市场数据,形成预测主要市场因素间关系的数据基础。

    企业所在的市场不同,影响需求的主要因素不同,数据采集的途径也不同。

    数据采集程序

    1、制定市场研究的具体计划

    在市场研究工作中数据采集是最重要的部分,它帮助解决投资与经营中相关的重要数据的确定和决策的改进。然而,数据采集工作是要花费资金的,尽量其带来的益处不言而喻,但是,如果要采集数据,就一定要让这笔费用华的物超所值。为了达到这一目标,需要周密的计划、安排和监控。这样做,不仅从协调计划的方面看是很重要的,而且也确保在预计时间内获得重要的数据,同时也可将成本监控在一定的范围内。

    2、明确数据来源

    在数据采集前,必须要对数据资料来源进行选择。数据资料按其来源不同,可分为第一首资料和第二手资料。第一手资料指为了一定的目的采集所得的原始资料。采集第一手资料的费用比较高,但资料的价值相当大。这种资料常常来自现场的调查,其准确度高且针对性强。第二手资料是指采集现成的资料,包括互联网上的信息,各种报刊

    文献上的资料,还有各类权戚机构发布的统计和研究报告等等,在现代项目研究中,由于互联网应用的普及,获取各种二手资料比起以往变得更加便捷,内容也异常丰富,所以二手资料的采集成为非常重要的调研手段.它有方便、快捷.成本较低的优点。数据分析人员还可以从内部资料中提取第二手资料.也可以利用外部资料间接获取。常见的内部资料往往来自企业的财务报表.比如.资金平衡表、销售统计以及其他报表档案。项目数据分析的起点始于采集第二手资料.但是这样的二手资料必须经过仔细统计、筛选及甄别.以尽可能保证资料的精确、可靠和真实。

    3、明确抽样方案及样本容量

    在一手数据的采集中,根据项目所属的特定行业及特定市场定位,许多数据可以通过直接采集得到全部样本,尤其对于成本、费用等可控制的要素;然而,对于其他数据的采集,比如说产销硫及其趋势变化数据,其总体范围很广,很难直接获取全部数据。这时我们常采川抽样技术,从拟采集数据的总体中抽取有代表性的部分单位作为样本,对样本进行调查或观察,并根据样本统计城估计总体参数,对所猫投资数据进行顶测

    4、明确数据采集方法

    数据采集往往采用三种方法:访问调查法、实验法和观察法。访问调查法通过访问代表性样本而获得数据,强调语言应答。而观察法强调非语言方式,通过调研人员在事件发生时或在过去已发生事件的记录中采集信息 · 与上述两种方法相比,实验法能够有效控制调研环境,在实际项目数据采集中,可根据项目特点、数据采集成本费用预算标准、时间及精度要求,采用不同的方法。

    5、问卷设计

    为了达到采集数据的目的,采川问卷方式进行调査是近年应用最广的一种调査手段。问卷设计的好坏,在很大程度上取决于调查问卷的回收率和有效率。另外,—张好的调查问卷必须满足后期数据分析的两个基本标准:相关性与准确性。

    问卷设计部分包括了对问卷结构、问卷设计原则、问卷的问题格式等问题的讨论与分析。

    6、数据处理及分析

    原始数据收集回来后,可能出现虚假、差错、冗余等现象,如果简单地把这些数据投 入预测分析,可能会导致错误的分析结论,从而使整个分析工作失去意义。因此,首先要对数据进行整理和加工,才能进行分析研究并得出科学的结论。数据的处理是指运用科学的方法,将调査所得的原始资料按调査目的进行审核、编码、录人及预分析的过程

  • ?

    数据分析的8种方法详解

    听双

    展开

    对于具体的业务场景问题,我们该怎么办呢?我们以一个电子商务网站为例,用数据分析产品 GrowingIO 对该网站进行快速地数据采集、清晰和可视化展示,然后给大家分享这 8 种常见的数据分析方法。

    1 数字和趋势

    看数字、看趋势是最基础展示数据信息的方式。

    在数据分析中,我们可以通过直观的数字或趋势图表,迅速了解例如市场的走势、订单的数量、业绩完成的情况等等,从而直观的吸收数据信息,有助于决策的准确性和实时性。

    对于电子商务网站,流量是非常重要的指标。

    上图中,我们将网站的访问用户量(UV)和页面浏览量(PV)等指标汇汇聚到统一的数据看板(Dashboard),并且实时更新。

    这样的一个数据看板,核心数字和趋势一目了然,对于首席增长官来说一目了然。

    2 维度分解

    当单一的数字或趋势过于宏观时,我们需要通过不同的维度对于数据进行分解,以获取更加精细的数据洞察。

    在选择维度时,需要仔细思考其对于分析结果的影响。

    举个例子,当监测到网站流量异常时,可以通过拆分地区、访问来源、设备、浏览器等等维度,发现问题所在。

    3 用户分群

    针对符合某种特定行为或背景信息的用户,进行归类处理,是我们常常讲到的用户分群(segmentation )的手段。

    我们也可以通过提炼某一群用户的特定信息,创建该群体用户的画像。 例如访问购物网站、寄送地址在北京的用户,可以被归类为“北京”用户群体。

    而针对“北京”用户群体,我们可以进一步观察他们购买产品的频度、类别、时间,这样我们就创建出该用户群体的画像。

    在数据分析中,我们往往针对特定行为、特定背景的用户进行有针对性的用户运营和产品优化,效果会更加明显。

    上图中,我们通过 GrowingIO 的用户分群功能将一次促销活动中支付失败的用户挑选出来,然后推送相应的优惠券。

    这样精准的营销推广,可以大幅度提高用户支付的意愿和销售金额。

    4 转化漏斗

    绝大部分商业变现的流程,都可以归纳为漏斗。

    漏斗分析是我们最常见的数据分析手段之一,无论是注册转化漏斗,还是电商下单的漏斗。

    通过漏斗分析可以从先到后还原用户转化的路径,分析每一个转化节点的效率。  其中,我们往往关注三个要点: 第一,从开始到结尾,整体的转化效率是多少?  第二,每一步的转化率是多少?  第三,哪一步流失最多,原因在什么地方?流失的用户符合哪些特征?

    上图中注册流程分为 3 个步骤,总体转化率为45.5%;

    也就是说有 1000 个用户来到注册页面,其中 455 个成功完成了注册。

    但是我们不难发现第二步的转化率是 56.8% ,显着低于第一步 89.3% 和第三步转化率 89.7%,可以推测第二步注册流程存在问题。

    显而易见第二步的提升空间是最大的,投入回报比肯定不低;如果要提高注册转化率,我们应该优先解决第二步。

    5 行为轨迹

    关注行为轨迹,是为了真实了解用户行为。

    数据指标本身往往只是真实情况的抽象,例如,网站分析如果只看访问用户量(UV)和页面访问量(PV)这类指标,断然是无法全面理解用户如何使用你的产品。通过大数据手段,还原用户的行为轨迹,有助于增长团队关注用户的实际体验、发现具体问题,根据用户使用习惯设计产品、投放内容。

    上图中展示了一位用户在某电商网站上的详细行为轨迹,从官网到落地页,再到商品详情页,最后又回到官网首页。

    网站购买转化率低,以往的业务数据无法告诉你具体的原因;通过分析上面的用户行为轨迹,可以发现一些产品和运营的问题(比如是不是商品不匹配等等),从而为决策提供依据。

    6 留存分析

    在人口红利逐渐消褪的时代,留住一个老用户的成本要远远低于获取一个新用户。

    每一款产品,每一项服务,都应该核心关注用户的留存,确保做实每一个客户。

    我们可以通过数据分析理解留存情况,也可以通过分析用户行为或行为组与回访之间的关联,找到提升留存的方法。

    在 LinkedIn,增长团队通过数据发现,如果新用户进来后添加 5 个以上的联系人(上图红色线条),那么他/她在 LinkedIn 上留存要远远高于那些没有添加联系人(上图绿色和紫色的线条)的留存。

    这样,添加联系人称为 LinkedIn 留存新用户的最核心手段之一。除了需要关注整体用户的留存情况之外,市场团队可以关注各个渠道获取用户的留存度,或各类内容吸引来的注册用户回访率,产品团队关注每一个新功能对于用户的回访的影响等等,这些都是常见的留存分析场景。

    7 A/B 测试

    A/B 测试用来对比不同产品设计/算法对结果的影响。

    产品在上线过程中经常会使用 A/B 测试来测试不同产品或者功能设计的效果,市场和运营可以通过 A/B 测试来完成不同渠道、内容、广告创意的效果评估。

    举个例子,我们设计了两种不同的产品交互形式,通过比较实验组(A 组)和对照组(B 组)的访问时长和页面浏览量两个衡量指标,来评估哪一种交互形式更佳。要进行 A/B 测试有两个必备因素:

    第一,有足够的时间进行测试;

    第二,数据量和数据密度较高。

    因为当产品流量不够大的时候,做 A/B 测试得到统计结果是很难的。而像 LinkedIn 这样大体量的公司,每天可以同时进行上千个 A/B 测试。所以 A/B 测试往往在公司数据规模较大时使用会更加精准,更快得到统计的结果。

    8 数学建模

    当一个商业目标与多种行为、画像等信息有关联性时,我们通常会使用数学建模、数据挖掘的手段进行建模,预测该商业结果的产生。

    作为一家 SaaS 企业,当我们需要预测判断客户的流失时,可以通过用户的行为数据、公司信息、用户画像等数据建立流失模型。

    利用统计学的方式进行一些组合和权重计算,从而得知用户满足哪些行为之后流失的可能性会更高。

    我们常常说,不能度量,就无法增长,数据分析对于企业商业价值的提升有着至关重要的作用。

    当然,仅仅掌握单纯的理论还远远不够,实践出真知。数据分析的方法大家不妨在自己日常工作中,有分析相关项目里尝试使用,相信可以事半功倍,创造更多商业价值。

数据分析信息采集

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP