中企动力 > 商学院 > 数据分析是什么意思
  • ?

    大数据分析:数据分析报告怎么用?

    冰蝶

    展开

    作者:冯大福

    来源:说说数据分析那些事儿

    大数据,这个被炒烂了的概念,现如今已被人工智能替代。我们先不讨论人工智能,就大数据而言,我们都是在强调它的技术,例如网络热词:hadoop+spark,data mining。而我们在用大数据时候,经常神话它的影响。例如,广告投放精准化,社会安全管理有序,医药行业智能化等。

    当然这些是我们的畅想,同时确实也离不开数据分析影响,但是我们有没有停下脚步去想一想,到底大数据怎么去落地呢,怎么去分析?怎么利用数据来去使企业做出决策,例如:广告投放精准化?

    1

    我们了解什么叫大数据分析吗?

    麦肯锡给大数据定义:

    “一种规模大到在获取、存储、管理、分析方面大大超出了传统数据库软件工具能力范围的数据集合,具有海量的数据规模、快速的数据流转、多样的数据类型和价值密度低四大特征。”

    基于我对以上定义的理解,我总结的大数据分析就是,将获取的数据打通、整合、找寻规律,立即得出决策信息。

    数据获取

    我总结的数据源可分类三类:

    (1)一方数据:用户事实数据

    例如用户在某金融机构购买的理财产品,时间、哪个出单口、姓名、电话等,或者运营数据,例如某互联金融app,用户操作行为数据。

    (2)二方数据:其实这部分叫做广告投放数据

    例如,广告展示量,活动页点击量,广告来源等。也有公司将这部分数据作为第三方数据,因为有些广告监测公司会利用此数据和人群数据整合构建自己dmp这样的公司一般宣称为第三方公司,三方数据。

    (3)三方数据:行业数据,也叫公开数据

    例如行协的数据,或者互联网行为数据,例如某互联网公司用户在此网站的行为数据,或者嵌入sdk的app后我们能采集到的安装活跃列表,以及可采集到线下数据。

    打通:其实就是利用关键点的采集整合一二三方数据。例如我们可以通过手机号将一方和三方数据整合,或者利用cookie,或者imei号等将二方、三方数据整合。但是由于现在监管制度对手机号敏感数据的控制,以及互联网和移动端数据的跨平台打通技术难点,我们现实的匹配率很低,例如一方和三方的数据匹配达到20%其实就算比较不错的情况,当然运营商数据除外。

    找寻规律:目标就是数据清理,从非结构化数据变成结构化数据,以便统计,数据探索,找寻规律,形成数据分析报告观点。本文将会在第三部分阐述。

    立即决策:将数据分析报告中的观点系统化或产品化,目前而言,大部分公司还是会依靠人工决策。

    为什么需要大数据分析?看上去大数据分析似乎按照这些步骤来,但是从第一步的数据源来说,其实已经反应了大数据的特点,就是杂乱无章,那么怎么从这些数据找寻规律,分析的内容和目标是否对应上,似乎就是我们需要大数据分析的理由。

    现在,大数据的分析通常采用的数据报表来反映企业运营状况,同时,对于热点,人群分析,我们看到的统计值,目标核心都是用数据分析报告提炼的观点来指导运营,那么问题来了,怎么用数据分析来指导数据决策呢?

    2

    数据分析的报告思路

    (从移动端的角度进行切入)

    基于我对数据分析的理解,我将数据报告会分成三大类:市场分析、运营分析、用户行为分析。

    市场分析

    由于市场分析一般而言是定性、定量分析,最近热播剧《我的前半生》贺函和唐晶的职业就是来去咨询公司的一般会以访谈、问卷调查来一份市场分析报告去告诉客户他们的市场占有量,消费者观点等。

    这里,我们以移动互联网数据的市场分析为例,通常来说,数据源是公开数据,或者在第三方数据。正如我们所讲,将sdk嵌入开发者应用,就可以收集到安装以及使用列表,那么开发者使用的sdk越多,我们能收集的数据源也越多,这样就可以形成安装app排名,使用app排名,这里面所说的覆盖率、活跃率也是这个意思,例如:即此款应用安装量、使用量在整体金融类的安装量、使用量占比。

    那么,这些市场分析的作用呢,一般而言,是对公司市场营销的总结,比如某金融公司kpi是为了获客,他们做了一系列营销,下个月排名我们可以查询到此款应用的安装量,是否较上个月上升呢? 那么我们的竞品表现呢,他们是不是也做了一些列的营销活动排名上升下降?我们都可以通过市场分析、竞品分析来观测,但是这部分的观点由于是市场数据,我们只能通过大量的搜寻官网活动,或者互联网广告推测营销来推测是否竞争对手排名上升和这些营销活动有关。

    同时,根据市场的走势图,我们能发现潜在的竞争对手,例如:我们能看出下图中的工商银行由于手机属于高覆盖高活跃组,即安装xxapp活跃人群也是最高的,因此,无疑xx银行是所有银行组潜在竞争对手。需要更加注意他们的市场策略。

    运营分析

    移动互联网提出的方法论:3A3R,笔者之前在做咨询的时候,此方法论也可以将网站分析套用,总结来说3A3R就是:

    感知 → 获取 → 活跃 → 获取 → 营收 → 传播 → 感知

    这里需要注明下,运营分析只是一个公司的baseline,让产品经理、运营人员、市场人员根据自己本公司的数据参考做出合理的决定,同时,运营的数据只是参考或者叫警示,若要具体,需要特定细节的分析,例如是否app改版,怎么改?需要增加哪家渠道合作?

    (1)Awareness 感知

    根据广告投放数据进行分析,目的判断渠道广告页对app 或者网站引流情况,同时可以帮助广告主设计监测表格,以数字角度衡量广告投放效果。

    但是,广告数据一般而言在广告监测公司手中,或者公开的使用工具上例如GA,我们需要依靠广告公司设计营销环节,例如活动页,加监测代码,或者在媒体、app应用商店加入代码便于监测广告表现,而往往这样的数据很难加载,一般是由应用商店,或者媒体提供,同时,以上数据,监测公司数据一般而言也不会提供给广告主,只是会提供统计值。

    言归正传,我们看感知数据其实目的就是想衡量我们的大量的营销投放钱花的对不对,广告的展示量、点击量等是最好衡量一个公司的广告市场部门绩效,没有广告投放,就无法带来获客,因此钱花的值不值,能带来多少客人,才会有下一步 acquisition。

    (2)Acquisition 获客

    获客是第一步广告投放拓展,用户点击广告后到达应用商店或者着陆页后去下载app,访问网页后,登陆app后的数据是广告公司或者应用商店提供不了的数据,因此获客其实有两重目的。

    目的1: 衡量第一步提供的数据是否准确,即是否渠道作弊

    目的2: 判断渠道是否好坏

    目的3: 判断营销活动是否有效

    例如下图中,我们发现4成用户是搜索流量较上个月增加了6%,是不是我们需要增加和sem的合作呢?而在媒体引荐渠道中,我们通过渠道衡量客户转化率,点击-用户激活的,激活的注册转化,可否重点对某应用商店增加合作。

    下图是目的3的应用,来衡量三个月内的新增用户,活跃用户是否受活动营销、广告投放、版本更迭等影响。例如:7月28日的版本更迭,增加新用户的利器,那么产品经理需要分析下这个版本到底哪里的改变,让用户增长这么快,而8月份的营销活动会唤醒沉睡用户,反应考核运营人员的绩效,那么,是否我们在做促活时候可以借鉴8月的成功经验呢?而这个成功经验需要进一步做专题分析。

    (3)Activities 活跃

    获客后,我们想看看我们的新增、活跃用户的表现情况,那么就到了第三步 活跃,其实就是为产品经理改版app或者页面提供数据支持。

    活跃分析可参考以下三个步骤:

    第一:从页面浏览次数,独立访问人数,来圈定主要页面分析。

    例如某款app首页是pv,uv最高,我们会重点分析首页。

    第二:根据圈定页面,制作点击热力图,便于产品经理对后续页面改造提供数据支持,例如我们可以将点击量小的按钮在下次改版删除,对点击量大的重新排序。

    第三:根据圈定页面,制作点击热力图,便于产品经理对后续页面改造提供数据支持,例如我们可以将点击量小的按钮在下次改版删除,对点击量大的重新排序。

    (4)Retention留存分析& Revenue & Refer

    这几个实际上在企业运用的并不多,这里简要说明下。

    ① Retention

    用户积累到一定数量后,我们想看下用户粘性,那么我们就来到retention,一般是衡量活动效果时候运用的比较多,来看此次活动过后,是否用户依旧会使用我们的app,但是由于金融app属性不会像游戏应用每天进行访问,因此Retention 在实际应用中不会太多,下面的例子是个展示,不做赘述。

    ② Revenue

    这些留下来的客户给公司贡献多少现金呢?会看收入步骤, 一般公司不会将现金流数据放入在统计平台中,但是我们需要提出用户贡献的流水金额数据供我们使用,便于人群划分,例如下面简要分析:

    Refer 传播:

    最后,我们想让这些客户进行传播;核心是口碑营销,即用户自发的转发给其他用户链接,让他们下载app或者参与活动,因此传播的下一个环节又会转换营销,但是传播会受到很多限制,例如没有奖励机制的口碑传播,几乎转发量为0,同时,传播若要衡量比较困难,尤其在大量互联网用户基础上,这样会造成资源代码叠加,系统负担,因此一般企业也不会设计这样活动让营销人员参考。

    用户分析

    若说大数据分析的核心,其实就是在于用户分析,正如我们前面所讲,用户分析的步骤流程如下:

    即在力所能及的搜集数据范围内,打通数据,客户用户,精准营销。

    第一,我们可以筛选的条件列表,我们可以通过应用条件,位置,标签条件将数据整合,整合的目的就是刻画客户,定出营销策略。

    例如:我们想筛选金融客户(应用条件筛选),出现在五星级酒店(位置条件),且为母婴人群(标签)。

    但是需要注意的是,条件越多,用户轮廓越清晰,人群会越少。

    第二,根据筛选的人群,我们将线上/线上统计化,或者建模多维度分析。

    例如,我们根据筛选的人群,发现男性多于女性,苹果手机属性最高,常手机工具使用,那么我们可以将这部分目标人群用增加手机工具合作,或者和苹果合作获客或者促活。

    第三,整合以上数据分析,形成人群画像。

  • ?

    数据分析,你逃不掉的几大「坑」

    念柏

    展开

    作者:瑶子

    今天想写的主题是:数据分析 ,我一直觉得这属于很多人不知道Ta有多重要、一部分人知道Ta重要但并不重视,只有极少数人真正在工作中重视Ta并且运用Ta。

    说一个东西重要,肯定要讲为什么,不然绝对是要被拿着刀追几条街的。

    那么,数据分析为什么重要呢?至少有以下好处:

    相比“似乎”、“好像”,能够更加客观的呈现真实现状;

    相比“我以为”、“我觉得”,数据的改变是对产品”改变”做出的最直观、最无声的投票,数据可以佐证“改变”是否正确、恰当以及效果如何;

    相比所谓的“经验”、“年纪”、“职位”,数据能够排除掉这些太不可控的“主观”的影响/压力,作为另一个相对客观的决策依据;

    说的更加大白话一些的,那就是:

    你刚接手个新业务,搞不清现状,小伙伴也东一嘴西一嘴的讲的碎碎的,你可以看数据;

    如果你想做某个需求,人家不给你做,你可以甩数据给他看,证明需求的必要性;

    如果你不想做某个需求,但人家硬要你做,你还是可以甩数据,证明需求无意义或者效果不理想;

    如果你做了需求不知道要不要继续迭代下去,你还是可以看数据,去看用户的无声投票如何;

    数据是产品、运营、技术日常装备中必不可少的矛和盾。至于什么时候是矛,什么时候是盾,那就看不同场合不同情况了。

    // 补充:数据分析辅助决策,但并不是决策的唯一要素。我并不鼓吹数据分析天下第一,请注意,合理使用才是王道。

    数据的最大天坑

    数据分析,字面意思,数据分析由两个部分组成:一是数据,二是分析,看起来跟废话一样,但却也是绝大多数人都忽略的。

    大多数人在讲到数据分析的时候,更加注重的是分析,而并不是数据本身,这就造成了数据分析最大的误区:不关心数据怎么来,使劲儿做无用功。

    举个简单的例子呗?

    在App的新版本上,产品经理新加了个子频道。版本上了一段时间数据稳定后,产品经理从数据发现,哎哟,这个子频道很吊炸天啊,点击率、登录比等数据同比甩其他子频道N条街啊,恩,说明这个子频道用户很需要呀,以后要接着往这个方向上做。

    看似,产品经理好像做了正确决策吧?

    然而,oh,no,不幸的消息来了!

    程序员在数据埋点的时候不小心埋错了,他把另一个热门子频道的数据和这个新频道埋在了一起,数据计算的是这两个频道的总和!(抱歉,程序员又一次实力背锅,之后会为你们正名)

    因为错误的数据,得出了错误的分析结果,并且还做了后续错误方向的工作,这在日常中其实并不少见,虽然真的很蠢。

    有效数据分析的前提,是对正确的数据做分析。

    分析的最大天坑

    数据怎么来的,是基础。得来的数据怎么分析,是进阶。光有数据不分析,假把式,还糟蹋了人家的SQL。

    这就引来了一个重要问题:为什么要分析?

    用基本的分析去了解现状以及趋势;

    用针对的分析去验证或者踢翻自己的想法;

    看似很简单,实际做起来却一点儿都不简单。又要举个常见例子呗:

    新版本发布了一段时间,数据也稳定了,产品经理让实习生A、B、C分别做一份用户对新版本各项修改内容的数据分析反馈报告。

    实习生A:这个简单啊,数据组的同学一定有数据,拿过来就是了。

    最后他把各种原始数据表发给了产品经理;

    产品经理内心独白:X,我要你有个啥用?

    实习生B:这个工作,数据同学说不定已经做了,直接找他问就好了嘛。

    最后他把数据挖掘童鞋的口述内容写成了报告发给了产品经理;

    产品经理内心独白:虽然比之前的那个好,但依旧X,你自己的脑子呢?

    实习生C:这个报告不是那么好写的,至少得:

    看下新增、优化、影响了哪些地方做重点观察;

    围绕着这些地方,分别列好目标和可能的猜想;

    找数据挖掘童鞋聊并且记录根据他的角度数据处于什么样的情况,还得记得拿原始数据;

    自己再做一次针对性的数据分析工作;

    得出一些结论,保留一些疑惑等;

    最后他把根据以上步骤得出的观点做成了报告发给了产品经理,同时附带了原始数据的各种变形计算;

    产品经理内心独白:这个上道,可以的可以的。

    实习生A、B其实都属于没有搞清楚为什么要分析,分析的目的到底是什么。没有想清楚这一环节,自然给到的分析结果也没什么用了。

    分析目的是指南针,只有方向对了,后续的各种分析方法以及分析结果才有意义。

    上文举的例子,其实一部分说明了数据分析过程中除了以上两大坑之外的一些其他小坑坑,下面也来简单列一列:

    1. 小团队的数据正确性很难被保证

    这个就是上文举例的时候我说会为开发同学正名的部分。大公司暂且不说,毕竟,光是数据支持团队就比人家小公司一整个团队的人还要多了。

    小公司往往没有资源去组建自己的数据团队,这个时候就要使用各种第三方的统计软件来做数据埋点。然而,各个统计软件又有各自的问题:

    GA:需要翻墙,数据会计漏;

    百度:额,不说了;

    友盟:统计大的数据ok,但是在细致的用户行为方面就比较菜了,代码埋点也是个坑,数据也不图表化!(好久前用的,可能现在已经慢慢有图表了吧?);

    fabric:和友盟其实差不多,但是强在程序报错上,另外数据图表化做的也是很炫酷,但,还是坑爹的代码埋点;

    growing io/诸葛io:强于细致的用户行为数据分析,同时宣称可以无代码埋点。然而无代码埋点又是另一个不亚于代码埋点的大坑,必须符合他的框架写法才行,不然数据统计不上或者出错。然而,框架写法又没有明确的文本说明,开发也不一定能改掉自己的写法。另外,细致的用户行为数据分析,在实际分析操作上也是很蛋疼的;

    完蛋,扯远了,这块如果感兴趣,可以专门搞篇文章写写。想说的是,代码埋点会产生很多问题,例如:

    可能因为不同程序员的页面代码写法不同,计算结果不同;

    可能因为埋点过程中没有沟通好,出现理解偏差,计算结果不同;

    可能因为开发不小心埋错点,计算结果不同;

    可能因为版本迭代修改了某个地方,导致计算结果不同;

    非常多可能性,导致埋点错误,从而导致数据错误。每次看移动端数据,都要ios和android端一起对着看,谁能懂?特么的跟侦探一样样的。

    2. 存在已久并不代表一定正确

    这个存在已有,不仅是指数据,同样也指分析结果。

    某个数据存在已有,所有人都对Ta没有质疑,这就能说明这个数据没错了么?

    其实不一定哦,也许这个数据从未被人注意过,也有可能大家都把质疑数据的正确性这个前提给忽略掉了。

    所以,如果在分析的过程中发现,数据的横向对比或者纵向对比,结果存在一定的违背,那么这个时候就要注意了。

    至于分析结果的存在已久嘛,没啥好说的,产品功能、产品运营手法都有可能导致数据的大变动,分析时段自然要比较新鲜才有用。

    3. 数据条件很重要

    数据条件是什么意思?说白了就是放在数据这两字前的定语,即:什么样的数据。(这是定语还是形容词,傻傻搞不清)

    举个例子:

    极度活跃用户、一般活跃用户、不活跃用户、沉默用户、流失用户。在用户之前的字就是数据条件。

    为啥说数据条件很重要呢?原因在于不同条件的数据在各项指标上可能都会差异非常大,而无法用简单的均值来做概括。例如极度活跃用户在活跃天数、活跃时长、日活跃次数、留存率等上都会甩掉其他用户好几个级别。

    当然,更为日常的情况是,在和数据同学沟通的时候,一定要先确保大家的沟通前提处在同一条件下,不然很可能出现的情况是:拿到的数据是正确的,但是条件是偏差的。

    4. 第一手分析很重要

    很多小伙伴喜欢偷懒,觉得有数据挖掘同学分析数据就可以了,但其实并不是这样的。

    其一:除了数据本身是客观的之外,对数据做的任何处理都是主观的,不管是用模型还是各种数据之间的变形计算,都是主观的,差别在于主观的程度多少而已,每个人都会站在自己的背景知识去处理数据,如何保证别人的和自己相同呢?

    其二:在分析数据的过程中,一般来说,各种横纵向对比,是可以发现一些自己之前没有注意过的结论的。而这点,别人帮你分析的过程中,一般这些信息无形中就不见了。

    5. 分析具有联动性

    绝大多数情况下,单独看某一个数据,一般意义不那么大,或者说达不到更好的效率。

    举些例子:

    评价某模块做的好不好,只看绝对uv,而不同时看模块登录比,介是耍流氓;

    评价内容做的好不好,只看生产的绝对量,而不同时看不同类型内容的分别用户uv占比/生产量,介也是耍流氓;

    联动的看数据,才能更加综合的去判断。

    感觉写的差不多了,那就先这样呗?虽然还有一些其他小坑,哎哟,以后再写吧。再熬夜,感觉一周都要缓不过去了。

    End.

  • ?

    互联网数据分析入门:流量分析

    微风

    展开

    当今时代信息化产业飞速发展,各类底层大数据平台百花齐放,亿级数据、秒级响应已经不再是当年的遥不可及的神话。然而对于企业来说,数据计算快仅仅是满足企业进行业务数据分析的硬件基础,如何发掘这些海量的数据产生应用价值,走好数据分析这最后一公里,引导企业进行战略决策却是至关重要的一步。

    本文以互联网行业为数据业务分析背景,希望能跟大家交流一些数据分析方面的心得和体验。

    ——本文使用数据分析工具为FineBI 商业智能工具

    数据分析的本质其实是做数据对比分析,没有数据对比,单一的指标统计往往难以发挥数据价值。像我们常见的数据对比分析方法有同比、环比、占比等一系列分析指标,那是不是所有的数据业务场景都可以直接进行套用分析呢?比如我们统计企业2018年1月29日的同比流量,是不是可以直接对比2017年1月29日?表面上看好像2017年1月29日确实就是2018年1月29日时间层面上的同比日期,但是我们仔细对比查看这两个日期会发现2018年1月29日是周一,2017年1月29日确是周日。对于很多行业的企业来说,非工作日和工作日的数据往往是有很大差异的,这个时候单纯从日期层面来进行对比其实是没有什么意义的,选择对比同是周一的2017年1月30日的流量数据进行同比计算可能会更加有价值。

    目前互联网行业做搜索引擎的有Google、百度,做综合门户的雅虎、新浪,做即时通讯的主要是腾讯,电子商务方面的主要是阿里、京东、亚马逊等。不论是以上的哪家互联网企业,往往都需要有一套引流、转化、消费、留存方面的运营策略,平台的流量数据分析往往都是非常重要的。

    互联网流量数据分析方面,总结主要有如下四种数据常用分析方法:

    1.对比分析流量规律,针对时段进行企业服务以及推广活动调整;

    2.对比分析结构占比,指导进行定向群体营销推广

    3.对比分析异常情况,及时追责并且进行调整;

    4.对比追踪活动流量变化,总结活动效果经验以便后续有针对性调整。

    如上图所示,我们通过FineBI工具制作出以上的流量数据分析模板,接下来尝试着对数据做一些对比分析。

    一、用户浏览量周分布

    对于互联网企业来说,流量数据往往都会呈工作周相关。对此,我们可以先宏观地统计出周一到周日中的总的平台流量柱状图数据对比情况。首先我们可以仔细观察工作日和非工作日的数据,发现周末的平台流量较工作日流量要高,这在互联网行业来说都是一个比较普遍的现象。

    用户流量的周分布规律之后,我们就大致有一个推广方向,周末休息时间用户群体较大,相较于工作日可以投入更多的和丰富有吸引力推广活动来进行新用户引流和老用户活跃。

    接着我们可以进行下一步思考,那工作日和周末我们的活动推广时间如何制定?有的同学们可能会觉得全天活动都可以,不需要关注具体的活动时间。但是对于互联网行业来说,每个时间段的推广费用都是较为昂贵的,我们完全可以分析出工作日和周末的用户流量趋势,进行有针对性的时间段投入推广,通过更小的成本获取到更多的用户流入。

    首先是工作日的时间段流量统计分布,我们通过BI工具分时间段作图得到如下所示的流量分布图。可以看出,工作日的流量主要集成在每日的9点(上班时间)、13点(午餐时间)、20点(晚间娱乐休息时间),那么在得到这样的一些用户流量规律之后,便可以在这些用户活跃高峰期时间段有针对性对白领群体多做一些相关商品推广活动,以实现最小时间成本和推广费用最大化用户引流效果。

    再来看周末的各时间段流量分布走势,和工作日所不同的是,周末的流量早高峰期延后到了10点,这可能和各位小伙伴们周日作息较晚有关(同学们周末都是几点起床呢),除此之外,晚上的流量高峰退潮期也有延后。针对与周末用户流量分布的特性,互联网企业在周末时可以将活动开始时间和活动结束时间都适当进行延后,这个时候不能再套用工作日制定好的活动时间计划了,因为符合用户群体作息规律的推广促销活动才能达到更好的效果。

    二、推广渠道流量分布

    对于互联网行业的推广渠道分布主要分为三级渠道:线上渠道、线下渠道、新媒体营销等等。对比分析每个渠道对企业所带来的价值占比差异,以指导制定有针对性营销策略。

    如上图所示,由于推广渠道是分多层级的,我们通过BI工具的多层饼图进行数据的分析统计再合适不过了。分析下图的数据我们可以看出,首先是一级渠道的主要战斗力来自于新媒体营销,当今的微信、今日头条等社交媒介社区时代受众广泛,用户群体非常庞大,是公司需要投入主要成本进行推广的。其次线上渠道的效果也不容忽视,对于互联网企业来说,做好百度、Google等SEO搜索引擎关键词推广也是很重要的一部分工作。相较于线上渠道和新媒体营销,线下渠道说所需要的经费和时间、人力成本较大,受众又相对较小,所以此类活动往往针对核心粉丝进行运营即可。

    三、各月份指标对比走势

    在分析各月份指标对比走势数据之前,先简单介绍下互联网营销常用的几个指标概念:

    1.浏览量(pv)

    2.访问次数(visits)

    3.访客数(uv)

    以上三个基础指标常用来衡量流量数据的多少。另外平均访问深度(总浏览量/访问次数)、平均停留时间(总停留时间/总浏览量)、跳失率(跳出次数/访问次数),这三个指标通常可用于衡量流量指标的优劣性。

    我们仔细分析上图中的平台流量指标,可以发现10月份是2017全年的流量高峰期,应该跟企业在国庆黄金假期所做的促销引流活动有关。浏览量、跳失次数、访问次数分别为4941、1290、2182,对比计算可得到跳失率为59.12%,明显低于其他时间段的跳失率,说明10月份的活动效果还不错,其经验对以后的营销推广可以起到参考作用。

    最后是访问深度用户群体分布分析(跳失率=跳出次数/访问次数),我们通过BI工具将企业的VIP用户、老用户、新用户分别进行分时间段的用户群体访问深度分析统计。总体来说可以发现平台的VIP用户访问深度较老用户以及新用户稍微高些,但是不是太明显,说明平台运营的VIP这部分群体的活跃度还有待提升。同时,平台老用户访问深度和新用户更是相差无几,公司对于用户这方面的活跃运营明显需要加油了,建议将平台的部分忠诚度较高的老用户以VIP用户组建起来,共建平台生态圈,增加整体的用户活跃度。同时可以向老用户以及VIP用户实施一些优惠政策,如定向商品折扣、根据用户画像进行喜好商品特惠推送等。

    本次的数据分析经验心得分享暂时先写到这里,后续将继续给大家分享关于互联网数据运营方法的转化、消费、留存等方面的一些经验,欢迎大家一起共同交流探讨互联网运营之道。

  • ?

    不懂计算机,不懂统计学,作为零基础的人,怎么自学数据分析?

    元以蓝

    展开

    没有计算机基础,没有编程基础的人,该怎么学习数据分析,第一步要做到什么,然后应该做什么?怎么一步一步自学?先打哪些基础?很多人都在了解数据分析的时候,都会这么说。数据分析一定要统计学,编程基础吗?

    数据分析如何开始?

    我最早做数据分析是从网站统计开始的,从CNZZ到Google Analytics都有用过。我们能够这些地方知道什么呢?网站流量,用户情况,行为统计等等。以GoogleAnalytics为例,以下是我一个网站的流量图:

    从这个图里面,我们可以看出什么呢?用户数有多少,每个用户访问几个网页,每个用户停留多长时间,跳出率有多高等等。

    如果你是第一次看到这种图,那你肯定是一头雾水,WTF?什么是跳出率?什么是平均会话时长?

    这也是开始学习的过程,接触到陌生概念,就去了解,不要因为一个概念不懂就停止学习。

    经过一段时间的了解,我们学会了各个名词是什么意思,例如我们发现跳出率太高了,那么就证明网站存在某些问题,导致了用户很容易流失。那么我们就进一步, 查看用户的行为数据,例如热点图,点击图等等,分析是什么地方导致了这个问题。

    PS:图上这个跳出率算是很低了,还不错。

    这个图是流量获取概览图,我们可以通过这个图来了解流量是从哪来的,这也能帮助我们做流量的优化甚至引流的工作。

    不要嫌网站统计显得low,基础数据分析都是从这个开始的。

    接下来可以着手去搞一些自己感兴趣的数据,当然,这可能需要学习爬虫知识,一些数据库的知识。

    你可以爬歌词,看大家在唱什么,也可以把公司的订单倒入,看订单有什么规律,还可以把女朋友的微博全部拿出来,看她到底对什么感兴趣。

    这些,其实都是数据分析的应用,从简单的,基础的,自己感兴趣的开始。

  • ?

    作为数据分析师,鬼知道我经历了什么!

    空格

    展开

    谨以此文献给所有数据从业苦逼之人,如有中伤之处,请自行戴好盔甲,以防中伤过深。同时也以此文献给后期对数据热情,想长期从事此行业的年轻人,希望对你们有所启发,并快速的调整思路和方向,以对自己的职业生涯有更好的发展。

    最近听到一些段子,很有意思,分享给大家!

    这些段子是很多数据分析人员的真实写照:

    新招进公司做大数据分析师,好开心好兴奋好激动!!!然而...

    入职第一天,老板给了我一张 50M 的 Excel 表说:

    “你看我们有 100多万条用户信息,这么大的数据,来个大数据分析下!”

    还没从震惊中恢复过来,业务部又神补一刀:

    “我们准备跟星巴克合作,来预测下明年多少人喝咖啡,几千万的大项目,预测不准公司要亏很多钱的,你加油哈!”

    面对这样的业务部,我只想说:“我要是未卜先知为啥不去炒股来给你打工”

    IT大哥贼兮兮的说:“哥们你可来了,那失散到天涯的数据有娘啦!”

    没法,最终还是把数据拼起来开始分析...

    发现好有规律啊~好工整啊~这...是不是有坑?!

    去业务部一问才知道,这些都是被经销商篡改操纵的数据...

    后来拿到了全真实的数据!全部没有规律了!喜极而泣!!

    擦干泪仔细一看,80%的记录缺失,10%记录不全,5%记录出错……

    整完数据开始统计,然而领导觉得只做加减乘除太简单了,有没有更深度的方法(解读:需要纠正的是,有用为先,花哨次之,这种说法不太合理)

    简单了就做个模型吧,然而检验值还没讲完领导表示太复杂搞不懂,能简单点不(解读:这个是解读能力的问题,跟领导没关系...没关系..没关系...)

    改来改去已很多遍了!我已不太记得领导唠叨了什么,总之又听到一句:“再改一下,看看其他维度深入分析分析”,然后默默新建一个文件:《分析报告V16-8版》

    输出结果和业务部的认知差不多,被评价为:

    “我们都知道了啊,这大数据做了跟没做一样啊”

    输出结果和业务部的认知差很多,被评价为:

    “这个与业务经验完全不同,肯定是数据的问题,我们都十多年经验了,快回去检查数据,上次我去见XXX客户人家就不是这样的!一定是你错了!一定!”

    此段子一出,群里都炸开了锅,大家都开始不断的煽风点火,各种数据背锅,各种吐槽,说尽了数据分析师的辛酸苦辣。

    我做数据分析师的时候也经常遇到上面这些遭遇,乃至后来找到了一些规避这些问题的方法,希望对大家有所帮助。

    同时,我也希望借此号召所有的数据从业者,在数据应用实践上能够深入思考并有所突破,在正确的轨道上更好的发挥出数据的价值,从而让数据从业者有更大的 ,不再拘泥于每天的抱怨和自怨自艾中。

    数据之苦

    进入正文,数据人之苦最苦的是:有好处想不到你,出了问题都是你的错

    这句话的意思就是你做好是应该的,做得不好就得承担责任。这种痛苦完全命中了马云蜀黍对离职的两点看法:

    心累(得不到价值肯定)、钱少(没业绩肯定哪来的升职加薪)

    区分数据流程的不同阶段,数据人之苦又有所区分侧重不同,说一下我的个人浅见。

    根据数据应用的不同阶段,我的划分方法如下,从数据底层到最后应用:

    大数据平台

    目前很火,数据源头,各种炫酷新技术,搭建 Hadoop、Hive、Spark、Kylin、Druid、Beam~,前提是你要懂 Java,很多平台都是用 Java 开发的。

    现在很多企业都把数据采集下来了。对于传统的业务,用传统的数据是完全够用的;可是对于用户行为和点击行为这些数据或者很多非结构化的数据,文本、图像和文本类的,由于数据量太大,很多公司都不知道怎么进行存储。

    这里面要解决的是实时、近实时和离线的大数据框架如何搭建,各数据流之间如何耦合和解耦,如何进行容灾、平台稳定、可用是需要重点考虑的。

    我的感觉是:最近两三年中,这块人才还是很稀缺的,因为大数据概念炒作的这么厉害,很多企业都被忽悠说,我们也来开始进入大数据行业吧。但是,进入的前提之一就是需要把数据存储下来,特别是很多用户行为方面的数据,对于业务的提升了比较明显的,如果你能很好的刻画用户,那么对你的产品设计、市场营销、开发市场都是有帮助的。

    现阶段,很多公司都要做第一步:存储更多的数据。这也就是我们这块人员流动性比较高,因为都被高薪挖走了。

    和传统的 SQL 不同的是,针对大数据量的非结构式数据,我们所想的就是:用最廉价的成本存储数据同时能够达到容灾、扩展性高、高性能、跨域,从目前来看有两个方向

    分布式已经被证明是个很好的一个方式。云端会是个很好的方向。不是每个公司都养得起这么多这么贵的大数据平台开发人员和运维人员 OPS,从事这个行业的我们要有很好的危机意识,及时贡献出自己的价值,积极主动的学习新技术、否则你就要被淘汰了。

    此外,花点钱把数据托管给云服务提供商对于创业公司或者一些传统的企业来说是个很好的思路,这样能够最快速地确定数据对你的价值是什么,而不用采购这么多的服务器、雇佣这么多的运维和网站开发人员。

    说了以上这些,主要是想给未来会从事这块的人或者想存储数据的公司一点方向。我自己不做这块,体会不深,大家看看就行。

    这块工作最被吐槽的一点就是:Hive 速度好慢,SQL 查询好慢,集群怎么又挂掉了,Hadoop 版本升级后,怎么数据跑出来不对了等等。

    因此,在这个领域内工作,需要有强大的

    攻坚能力。快速定位和解决 bug 的能力。因为有很多工具都是开源的。Java 开发能力。因为是开源的,所以会出现各种坑爹,甚至出现无法向下兼容的情况。

    如果想在这块做的很好,还需要有整个系统架构的设计能力、比较的强的抗压能力和解决问题的能力、资源收集的能力,可以打入开源社区,这样就可以随时 follow 最新的潮流和技术。

    数据仓库-ETL

    确实做仓库的人很辛苦,单单 Oncall 就会让人望而却步。有很多数据库工程师,晚上睡觉的时候经常被 Oncall 电话吵醒,因为数据流程出问题,需要第一时间去排查,是哪个数据源出问题,并且要立即解决,否则整个数据流程都会受到影响。

    如果数据流程受到了影响,你就可能会被大领导一言不合叫到办公室说:我要的数据怎么还没有准备好,我的业务报表今天怎么没有发出来。

    通过上面这个情景,我们可以知道:这是个很重要的岗位,因为数据流程很重要,决定了数据从源头杂乱无章的状况,通过 ETL 之后变成了整齐的数据,这些整齐一致性的数据可以让你很方便地把各业务的统计结果计算出来,并且能够统一口径。要不然就会变成有几个部门,就有几种统计结果,到时候 A 部门说业务增长了 5%,B 部门说业务涨了 10%,OMG,到底信谁?

    至少在以下几点上,我觉得数据仓库人员是应该要做好:

    数据字典的完整性,用的人都希望能够清晰的知道这个字段的逻辑是什么。字段要保持很好的一致性,不要同样一个字段在不同表里有不同的定义。核心流程的稳定性,不要让每天订单主表能够使用的时间很不稳定,有的时候很早,有的时候要中午才出来,如果不稳定就会导致使用数据的人对你很没有信心。仓库版本迭代不要过于频繁,要保持不同版本之间的兼容性。不要做好了仓库 1.0,很快就把原来的推倒重来,变成了 2.0。在数据仓库中需要考虑到延续性,主表的变动不要太频繁,否则使用的人会非常痛苦,好不容易才用习惯了 1.0 的表结构,没办法这么快进行切换。简单地说,要能向下兼容。在这点上,我是深有体会,之前出现过每来一个大领导都来换一次数据仓库的。保持各业务逻辑的统一性,不要出现同样的业务逻辑,同一个组别的人统计出来的结果不同。原因在于共同的逻辑没有落地成通用的东西,所以导致每个人写法不同。这点其实需要特别注意。

    针对以上,这个岗位的技能要求是:不要成为仅仅会写 SQL 的人,现在工具都很发达,如果你的技能很单一的话,那么可替代指数是非常高的,并且你自身也没有什么成就感。这里并不是说会写 SQL 的人很 low,只是说应该多学一些技能,否则你很危险。

    技能上,除了 SQL 熟练之外,还需要知道如何写 Transform,MapReduce,因为有很多业务逻辑用 SQL 实现起来非常复杂,但是如果你会其他脚本语言,那么就能给你提供便利,让你的效率提升很多。

    另外好的仓库人员需要写 Java 或者 Scala,通过写 UDTF 或者 UDAF 来提升你的效率是很有必要的。

    仓库人员应该要常常思考,如何进行架构设计是最合理的,你要考虑是否需要字段冗余、行存储还是列存储、字段如何扩展最有效,热数据和冷数据如何拆分等,所以需要有架构思维。

    数据仓库人员也应该常常考虑自动化和工具化方面的事情,需要很好的工具或者模块的抽象能力,动手实现自动化的工具来提高整个组织效能。针对经常碰到的数据倾斜问题,需要很快定位问题并进行优化。

    说完了数据存储这块,接下来是数据应用的几个关键职位,在此之前,我想说数据应用的一个最关键的前提是:数据质量、数据质量、数据质量!!在每次阐述你的观点、分析结论或者用算法的时候,都需要先检查,源头数据正确性,否则任何结论都是伪命题。

    数据可视化

    这是个很炫的工作,最好是能懂点前端,比如 js。

    数据可视化人员需要有很好的分析思维,不能为了炫技而忽视对业务的帮助程度。因为我对这个岗位客串的不多,所以没有特别深入的感悟,不过我觉得这个岗位需要有分析的能力,才能把可视化做好。

    另外一方面来说,做数据应用的人都应该懂点数据可视化,要知道观点表达的素材顺序是:图片>表格>文字,一个能够用图片来阐述的机会千万别用文字来描述,因为这样更易于让别人理解。要知道,给大领导讲解事情的时候,需要把大领导设想成是个“数据白痴”,这样才能把一件事情说的比较生动。

    4

    数据分析师

    现在对数据分析的需求是很大的,因为大家都想着说:数据有了,但是能做些什么呢?这就需要有数据分析师, 。

    对数据分析师吐槽最多的是:你分析出来的不就是正常的业务逻辑吗,还需要你分析什么?或者是你分析的结论不对,跟我们的业务逻辑不符合。

    特别是 ABTest 的结果和当初设定的预期不相符合的时候,分析师会常常被拉过去说:分析一下,为什么我的 AB 实验结果不显著,里面肯定有原因的。

    很多时候,宝宝的心里苦啊,你说这个转化率下降了,从数据上可以看出哪个细分渠道下降了,至于为什么客户不下单,我们得问用户去,很多时候,数据上也体现不出来为什么,只能告诉你现状是什么。

    如果你一直在写分析报告,给结论中,持续周而复始,没有直接在业务中体现成绩的时候,数据分析师们该醒醒了,你该想想这个是你要的岗位吗?

    对于数据分析师的定位:个人认为,成为优秀的数据分析师是非常难的,现在市面上也没有多少优秀的分析师。

    我个人对数据分析师的技能要求除了会数据分析、提炼结论、洞察数据背后的原因之外,还需要了解业务,懂算法。只有这样,当面对一个业务问题时,数据分析师们才可以针对问题抽丝剥茧,层层递进去解决问题,再根据定位的问题进行策略的应对,比如是先做上策略进行测试还是应用算法进行优化,用算法用在哪个场景上,能不能用算法来解决问题。

    一个优秀的数据分析师,是个精通业务和算法的全能数据科学家,不是那个只会听从业务的需求而进行拉数据、做报表、只做分析的闲杂人等。

    我们都说分析要给出结论,优秀分析师的结论就是一个能解决问题的一揽子策略和应对措施,同时很多需求是分析师去主动发现并通过数据来挖掘出来的。

    从上述描述中,可以看到对数据分析师的要求是:

    会写sql拉数据精通业务会数据洞察精通算法主动性强

    如果你一直只是忙于应付日常分析需求,热衷于写华丽的报告,那么你要记得,你很危险,因为会有一堆人在那里质疑你存在的价值,特别是小公司。因为数据人员的薪资是个不小的支出。

    大部分不落地的分析都是伪分析,有一些探索性的可行性研究可以不考虑落地,但是其他的特定业务需求的分析都需要考虑落地,然后通过实践来反推你的作用,如此反复,才能慢慢的给你价值的肯定,同时提升你的分析技能,也只有这样才能证明你作为分析师、数据落地者的价值。

    数据挖掘/算法

    这块的话,经过这三年的摸爬滚打,感触蛮多的。体会比较深的吐槽主要有以下几点:

    一个规则搞定了,还用什么算法。你的准确率怎么这么低?!你的准确率可以到 99% 吗?你的推荐有价值吗?你不推荐客人也会下那个产品的订单的。帮我做个大数据预测他想要什么?

    很多时候,不同的场景对准确率的要求是不同的,所以在一定合理的场景下和业务进行据理力争是必要,不要害怕让业务吐槽,更多的时候管理...

  • ?

    雨沐田:到底什么是数据分析?

    琉璃

    展开

    在信息社会,数据是重要的资源,随着数据的持续增长和大数据技术的成熟,数据分析越来越重要,要看清楚瞬息万变的网络世界,要知道表象背后的真相,非靠数据分析不可,不管是大数据分析还是传统数据分析,其本质是一样的,那到底什么是数据分析呢?

    数据分析就是为了特定目的对相关数据在理解的基础上进行消化,并挖掘提取有用信息的过程。

    这里与几个关键词很重要:

    1、特定目的

    这是数据分析的出发点,也是目标。

    没有无目的的数据分析,比如要知道企业的经营现状,要知道员工的健康情况,要知道市场促销的效果,要知道网站的引流情况...等等都是具体的目的,都可以在特定环境下通过数据分析达到这个目的。

    2、相关数据

    为了特定目的要找到相关的数据。

    相关数据没有标准的范围定义,只要和要分析的特定目的有关都可以收集,比如要分析网站的引流情况,我们需要收集网站的浏览量、独立IP数、注册用户、访客停留时间、下单数量等等;但员工的出勤数据,车辆的出勤数据等就对于这个目标而言是不相关的。

    3、理解并消化

    这是分析的前提,先要认识数据。

    收集到的数据先要消化理解,才能进行分析,不然分析无从谈起,就常见的Excel记录而言,我们要知道每一列代表什么意思,每一条记录代表什么,那些对分析有用的,那些对分析没用的等等。

    4、提取有用信息

    数据包含信息,但大多并不能直接被识别,必须通过分析的过程才能提取出有用的信息,而这个“有用”也是相对的,是特定于当前的分析目的而言的。

    简单说,3 只是个数字,但小张3岁,就是一条信息。

    对数据分析而言,企业的1000条销售数据反映出的有用信息可能是:

    销售利润 5000元

    客单价95元,客单价偏低。

    日均订单 13单

    ......

    等等。

    至于何为有用,还是要回到最初说的特定目的,特定目的决定什么是有用的信息。

    数据分析是个专业的技能,但也是人人都会的日常手段,比如,早上要驱车出远门,但不知道路况如何,要决定走国道还是高速,于是马上打开收音机APP,调到交通频道,同时打开交警部门的微信公众号,查看路况播报;多方数据一综合,很快得到信息:高速畅通无阻,决定走高速。

    这个过程看似平常简单,但也是一个简单的数据分析过程,理解数据分析并不难,但要成为专业的数据分析师,就需要更专业的视角去学习了!

    我是「大数据分析狮」,只谈大数据力量!

    关注公号「大数据分析狮」,免费获取百本大数据分析电子书!

  • ?

    数据分析、数据科学、ML应用在哪些行业?

    巫青烟

    展开

    【IT168 资讯】客户关系管理/消费者分析,金融和银行仍然是领先的应用,但医疗保健和欺诈检测正在增长。反垃圾邮件、制造业和社交是2017年发展最快的行业,而石油/天然气/能源和社会网络分析则有所下降。

    2017年应用分析、数据科学、机器学习的行业/领域

    最受欢迎的前三名地区是相同的,与去年几乎相同。医疗保健工作没有进展,从第5位变成第4位,和欺诈检测从第7位上升到第5位。

    ·CRM /消费者分析,16.8%(2016年为16.3%)

    ·金融,15.2%(15.0%)

    ·银行业,14.1%(13.4%)

    ·卫生保健,13.2%(12.0%)

    ·欺诈检测,13.0%(11.1%)

    ▲数据科学和机器学习2016年和2017年的应用分析

    从图像中我们可以看到,与2016年相比,2017年的颜色绿色的增加,如果份额连续两年增加超过1%,则三角形呈现向上,如果2年以上减少超过1%则三角形向下,否则循环。

    与2016年调查相比:2016年数据挖掘和数据科学的应用分析,我们发现最大的增长量为

    ·垃圾邮件/反垃圾邮件,上升106%,从2016年的1.1%至2017年的2.2%

    ·制造业增长60%,从5.6%上升至9.0%

    ·社会公益/非营利,上升35%,从2.0%上升至2.7%

    ·教育,上涨33%,从7.1%上升至9.4%

    ·医疗/制药,增长31%,从6.5%上涨至8.5%

    ·供应链上涨31%,从6.5%上涨至8.5%

    ·人力资源/劳动力分析增长30%,从3.6%下降至4.7%

    申请份额下降幅度最大的行业/地区是

    ·移动应用下降了59%,从3.3%下降到1.3%

    ·投资/股票下跌45%,从6.2%下降至3.4%

    ·安全/反恐怖主义,下降42%,从2.7%下降至1.6%

    ·娱乐/音乐/电视/电影下降32%,从4.0%下降至2.7%

    ·电信/有线,下降30%,从8.3%下降至5.8%

    有意思的是,每个选民的平均行业/地区数量为2.7,与2016年相同,仅与2015年的2.65略有不同。也许在各行业中有效应用数据科学存在限制?

    在这次民意调查中,我们有446名参与者,而2016年申请人数为552人,2015年为350人。

    三年中大部分地区的应用份额比例相对稳定,而且应用程序的多样性也在增加。

    只有2个行业连续两年显示增长10%或以上:

    ·垃圾邮件/反垃圾邮件

    ·欺诈检测

    只有2个地区连续两年下降10%或更多:

    ·石油/天然气/能源

    ·社交媒体/社交网络

    区域分布与去年的调查类似,但与美国/加拿大和欧洲的份额几乎完全相同,亚洲份额较高,非洲/中东和拉丁美洲份额较低:

    ·美国/加拿大39%

    ·欧洲34%

    ·亚洲16%

    ·拉丁美洲5.2%

    ·非洲/中东3.1%

    ·澳大利亚/新西兰2.9%

  • ?

    什么样的人比较适合做数据分析?

    管雁风

    展开

    我觉得无论什么工作兴趣最重要,要做数据分析师最基本的就是不讨厌数字,如果你跟他讲那个指标是通过怎么样的乘除加减得到的,他会觉得不耐烦,那么显然他不适合做数据分析;如果对数据较敏感,能够一眼发现异常值,数据分布情况,当然是最好的。

    再则就是逻辑性,可以让他试试爱因斯坦的那道经典的逻辑题,看看能否解出来,需要多久;逻辑思维对数据分析尤其重要,不然会被各种指标的定义规则、与业务的联系纠结死,逻辑思维好的人写SQL等数据处理脚本也会更加高效。

    接着是业务理解能力,最简单的就是让他定义下网站的目标是什么,哪些指标可以作为KPI,用户从进入网站到达成网站目标的整个过程是怎么实现转化的,能否画出业务流程图。(宏观层面,不要深入细节)

    如果偏技术则需要懂一些数据库结构和SQL,如果偏展现需要考验下对图表的掌控能力,什么时候用什么图表合适,甚至如何配色。

    最后就是细心、耐心和交流能力,做数据分析有时会很纠结,细心和耐心是必需的,好的交流能力可以让数据分析师更好地阐述清楚各类问题。

    这些都是比较基础的东西,也是短期难以培养起来的技能。至于另外业务相关的一些知识,可以通过培训获取,问一个未接触过你的网站业务的人一些业务知识其实有些不公平,其实如果具备上面几点,一旦熟悉网站和业务之后,一定会成为优秀的数据分析师。

    ——谷芬芬

    专业内的要求基本就是对数据的意识和一些技能的掌握。下面具体说说从一些非专业内要求的方面出发,有哪些方面能表现这个人更适合数据分析。

    首先是看到数据有兴奋感的人。有兴奋感说明你有兴趣,那说明很会有意愿把数据分析好。

    其次是愿意学习的人。你分析的内容永远不会一尘不变,即使你分析的主题是相对固定,但业务是变化的,你需要不断的学习业务,同不同人沟通,吸收别人的观点。所以分析师一定要报着学习的态度。

    然后是逻辑思维较强的人。数据分析师想要把你的分析好,一定要有结论思维。

    还有就是较强的表达与沟通能力。因为数据分析最终价值的实现,一般来说不会是分析师亲自去制定或者实施。所以你一定很有条理、逻辑清晰向别人表达,让业务方认识到你分析结果的价值,从而影响业务方去愿意使用你从数据中得到的观点。

    ——欧阳帅

    觉得还是应该先看清楚自己的未来的方向吧~

    我有不少朋友 非数学/计算机/统计学 专业毕业的朋友走的是这个方向,数据相关,非技术路线,更偏向于市场方向,对技术的要求只是Excel、PPT,最多要求SPSS,很少要求会写SQL。这条路线看起来比较高大上,可以走外企路线。

    数据分析师方向,很多读数学、统计学、计算机的童鞋会选这个方向,终极目标都是成为数据中心的负责人。中间有2个分叉,一条是从数据分析师到数据产品经理,这个路线最近很流行,主要是结合了数据分析和产品经理的能力。一条是高大上一点的数据挖掘方向,这条路线要求比较高,但薪资也高。当然能走数据挖掘路线是很多数据分析师的梦想,但算法和代码实现能力不是谁都能掌握的。.

    根据你自己想走的路,加上自己的技能点。

    ——张锦华

    想了解更多相关内容,记得持续关注我们哦。

    如果你觉得有点意思,请有秩序的评论、转发、收藏。

  • ?

    数据分析成功的定义

    左三德

    展开

    在数据分析中定义成功已经有一段时间了。大约两年前,我试图在院长讲座的中探讨这个问题,但最终我认为我错过了这个标记。在那次演讲中,我试图找出标准(我称之为“美学”),通过这些标准,我们可以普遍地评估数据分析的质量,并尝试与音乐理论进行类比。这是一次有趣的谈话,部分原因是因为我必须扮演查尔斯艾夫斯的第二交响曲。

    数据分析

    根据我的经验,统计学家不会非常讨论这个话题。这要么是因为它是如此愚蠢,以至于每个人都对它有一个(未说出口的)理解,或者每个人对它有一点点不同的理解,或者没有人理解它。无论哪种方式,在我作为统计学家近二十年的时间里,我认为我没有与任何人就数据分析的成功进行多次深入的对话。我讨论过话题这个最多的的的英文关于与希拉里帕克的非标准偏差,这是一个经常谈话的话题。最近,希拉里发表了一篇关于这个主题的演讲,所以我受到启发,写了一些东西。

    我想我已经解决了以下数据分析成功的定义,即:

    如果呈现它的受众接受结果,则数据分析是成功的。

    这里有很多要解开的东西,所以我会介绍它们。我认为重要的两个关键概念的英文接受状语从句:观众的概念。

    验收

    第一个想法是接受的概念。将这与信仰混淆是很诱人的,但它们是两个不同的概念需要保持分离(尽管有时可能很难)。接受分析涉及分析本身 - 应用于其的数据和方法,以及解释结果的叙述。对结果的信任取决于分析本身以及分析之外的许多其他事情,包括先前的分析,现有文献和科学状态负责任的受众可以接受分析而不必相信其主要主张,但这两个概念可能是相关的。

    例如,假设贵公司的一个团队设计了一个实验来收集数据,以确定降低窗口小部件的价格是否会对您的小部件制造公司的利润产生影响。在数据收集过程中,出现了一个问题,导致某些数据以潜在的信息方式丢失。然后将数据交给您。您可以通过多种插补或其他调整方法尽力解决缺失和由此产生的不确定性。在一天结束时,您向我展示分析并得出结论,降低小部件的价格将使利润增加3倍。我可能会接受您正确地进行了分析,并相信您已尽最大努力解决使用最先进方法在收集过程中遇到的问题。但我可能不同意这个结论,部分是因为缺少数据引入的问题(不是你的错),也部分是因为我们之前降低了我们销售的另一种产品的价格,并且没有相应的利润增长。考虑到进行实验的巨大成本,我可能最终决定放弃尝试修改小部件的价格并将其保留在原来的 位置(至少目前为止)。分析取得了成功。

    这个简单的例子说明了两件事。首先,分析接受主要取决于分析的细节以及我是否愿意相信分析师所做的事情。丢失的数据是否占了?是否适当提出了不确定性?我可以推断数据并理解数据如何影响结果吗?其次,对我的查询查询结果信念部分取决于分析之外的事情,这些事情主要在分析师的控制范围之外。在这种情况下,这些是收集过程中缺少数据的存在以及降低不同产品价格的完全独立的体验。在您的分析中,我如何权衡这些外部事物是个人偏好。

    验收与有效性

    在科学背景下,考虑有效性的英文很有诱惑力的。在这里,如果声明是真的,则数据分析是成功的。如果我分析有关吸烟习惯和死亡率的数据,并得出吸烟导致肺癌的结论,那么如果这种说法属实,那么我的分析是成功的。该定义的优点在于它消除了接受的主观因素,这取决于呈现分析的受众。但是对于任何给定的分析来说,有效性是一个非常高的标准。在这个吸烟的例子中,吸烟和死亡率数据的初步分析直到完成几十年才被认为是成功的。大多数科学结论要求独立调查人员和分析人员在社区认为或得出结论认为是真实的情况下,多年来会发生多次重复。让数据分析师陷入困境这么长时间似乎不切实际,坦率地说,不公平。最后,只要我们认为他们做得很好,我认为我们不想惩罚数据分析师做出的结论是错误的。这些说法是否真实可能取决于他们无法控制的事情。

    相关的分析标准本质上是内在有效性的概念。我们不是等到我们能够验证分析声明(可能是几十年后),我们可以通过正确或最好的方式评估分析方法已经完成,并采用了正确的方法。但这种方法至少存在两个问题。在许多情况下,不可能知道什么是最好的方法,或者什么是应用方法的最佳组合,这表明在许多分析中,我们不确定成功。这似乎相当不令人满意,最终不切实际。想象一下,聘请数据分析师并对他们说:“在你做的绝大多数分析中,我们都不会知道你是否成功。”其次,即使在理想情况下,我们知道什么是正确的或最好的,内在的有效性是必要的,但远远不够。这是因为上下文其中进行的分析对于理解什么是合适的是至关重要的。如果分析师不了解这种情况,他们可能会从分析和解释的角度出现重大错误。但是,同样的错误在不同的背景下可能是无害的。这一切都取决于,但分析师需要知道差异。

    我想到的一个故事来自乔治·W·布什在2000年美国总统大选中对戈尔的选举胜利。这次选举取决于佛罗里达州的选票,布什和戈尔非常接近。最终,提起诉讼并进行了一次审判,以确定计票的确切方式。统计学家被要求为布什和戈尔作证。为戈尔团队作证的统计学家是前耶鲁大学的尼古拉斯·亨纳特纳(当我在那里时,他是我的本科顾问)。Hengartner对戈尔团队给他的数据进行了彻底的分析,并得出结论,佛罗里达州的选票数量存在差异,而且一些选票数量不足。但是,在盘问时,布什的律师能够在“陷阱”时刻抓住Hengartner,这最终与收集数据的方式有关,关于Hengartner一直没有意识到的数据。分析是否成功?没有直接参与就很难说。没有人质疑Hengartner在分析中使用的方法,这在很大程度上都是一个非常简单的分析。因此,人们可以说它具有内在的有效性。然而,人们也可以争辩说他应该知道如何收集数据(也许是更广泛的背景)的问题,并将其纳入他的分析和向法院提交。Hengartner的分析只是提出的一系列证据中的一个,因此很难说它在最终结果中扮演了什么角色。

    听众

    所有数据分析都有受众,即使您是这样的受众。最终,观众可能会接受分析结果,或者他们可能无法接受,在这种情况下,可能需要进行更多分析。分析师的成功可能取决于与分析师不同的人可能会让一些人觉得不舒服。但是,我认为这是所有数据分析的现实。不幸的是,成功取决于人类,这是分析师必须准备好应对的事情。认识到人性在决定数据分析的成功中起着关键作用,这解释了我们可能认为是好的或坏的分析的一些关键方面。

    叙事的作用

    数据分析应该是关于数据的,对吧?只是事实?在大多数情况下,直到您需要将您的发现传达给观众。问题在于,在任何对他人有意义的数据分析中,只有太多的结果要呈现,因此必须做出选择。根据受众的身份或受众群体的构成,您需要调整演示文稿,以便让受众接受分析。这是怎么做到的?这有两个极端。

    在最糟糕的情况下,它是通过欺骗完成的。带有混乱轴的图形或模糊关键数据的表格; 我们都知道恐怖故事。复杂的观众可能会发现这种诡计并拒绝分析,但也许不会。那就是说,让我们假设我们是纯洁的。如何组织演示才能成功?我们都知道另一个恐怖故事,即数据转储。在这里,分析师展示了他们所做的一切,并基本上将解释的负担转移给了观众。很少这是理想的。在某些情况下,观众只希望数据进行自己的分析,但分析师不需要浪费时间进行任何分析。

    最终,必须分析师选择要呈现的内容,这可能会导致问题。必须做出选择以适应分析师关于“数据发生了什么”的叙述。他们会选择包括一些情节而不是其他情况和一些表格而不是其他表格。这些选择由叙述和数据解释指导。当观众对数据分析感到不安并且他们是诚实的时候,他们通常会对选择的叙述感到不满,而不是事实本身。他们会对分析师选择包含的数据分析师状语从句:选择排除的数据的组合感到不满。你为什么不把这些数据包括在内?为什么这个叙事如此集中于这个或那个方面?

    创造力的作用

    在一个极端情况下,可以认为数据分析师应该很容易被机器取代。对于各种类型的数据和各种类型的问题,应该有一种确定性的分析方法,改变不会据同性质的,这可以被编码到计算机程序中,并且每次都可以将数据馈送到程序中,最后呈现结果。每个数据分析是如此不同以至于需要人来制定解决方案?“创造力”和“数据分析”这两个词怎么能出现在同一个句子里呢?

    嗯,每个分析都是不同的,这是不正确的。例如,许多功率计算是相同的。但是,究竟如何使用这些功率计算可能会因项目而异。即使是相同研究设计的相同计算也可以在不同项目中进行不同的解释。其他类型的分析也是如此,例如回归建模或其他更奇特的建模。在数据分析中需要创造力的原因必须从根本上解决我们传统上认为在数据“外部“的事情。

    观众是“外部数据”和影响力的一个关键因素是如何,我们分析数据并呈现结果。一种有用的方法是考虑需要生产什么样的最终产品,然后从那里向后工作以产生结果。例如,如果“观众”是另一种算法或程序,那么输出的确切性质可能并不重要,因为它可以适当地馈送到管道的下一部分。特别是,可解释性可能不会那么重,因为没有人会关注这部分的输出。但是,如果一个人会在查看结果时,您可能希望专注于一种建模方法,该方法可让该人推理数据并了解数据如何通知结果。例如,您可能想要绘制更多的数据图,或者如果数据集不是那么大,则显示详细的表。

    在一个极端情况下,如果受众是另一个数据分析师,您可能希望进行相对“轻松”的分析,然后以这样的方式准备数据,以便可以轻松地将其分发给其他人进行自己的分析。这可以是R包或CSV文件或其他形式。其他分析师可能不关心你的幻想可视化或模型; 他们宁愿拥有自己的数据并制作自己的结果。

    部分原因是需要创造力,因为数据分析师必须对受众的需求,背景和接收数据分析结果的偏好进行合理评估。如果分析师可以访问受众,分析师应该询问有关如何最好地呈现结果的问题。否则,必须做出合理的假设,或者为演示文稿本身准备意外事件(例如备份幻灯片,附录)。

    “不一致”的结果

    很多时候,我有过为两个不同的观众提供相同演示文稿的经验。一个观众喜欢它而另一个喜欢它。如果两种情况下的分析和表述完全相同,怎么可能呢?事实是,不同的受众可以接受或拒绝分析,具体取决于他们是谁以及他们的期望是什么。一个常见的场景是向“内部人士”做一个演讲,他们非常熟悉该领域的背景和标准实践。将该演示文稿逐字地呈现给不熟悉的“外部”观众通常会导致失败,因为他们无法理解正在发生的事情。如果外部受众希望将某些程序应用于数据,那么他们可能会要求您执行相同的操作,并拒绝接受分析,直到您这样做为止。

    我清楚地记得我曾经介绍过一些我曾经做过的空气污染和健康数据分析的经历。在实践中,与我自己的小组进行的谈话一切顺利,我认为事情已经相当完整。当向外部小组发表同样的谈话时,他们拒绝接受我所做的(甚至解释结果),直到我还使用不同类型的样条模型进行单独的分析。这不是一个不合理的想法,所以我做了单独的分析,并且在同一组的未来事件中,我并排地提出了两个分析。他们对结论并不满意,但辩论不再集中在分析本身,而是集中在其他科学方面。回想起来,即使他们不一定相信结论,我还是接受了分析。

    概要

    我认为我提出的成功数据分析的定义具有挑战性(并且可能令人不安),因为它表明数据分析师负责数据之外的事情。特别是,他们需要了解收集数据的背景以及将呈现结果的受众。我也认为这就是为什么我花了这么长时间来解决它。但我认为这个定义更清楚地解释了为什么成为一名优秀的数据分析师的英文如此困难。当我们考虑使用统计学家开发的传统标准进行数据分析时,我们很难解释为什么有些人比其他人更好的数据分析师以及为什么有些分析比其他人好。但是,当我们考虑数据分析师必须兼顾数据的内部和外部各种因素以取得成功时,我们会更清楚地看到为什么这是一项如此艰巨的工作以及为什么好人很难得到。

    数据分析成功定义的另一个含义是,它表明人性起着重要作用,而且许多成功的数据分析本质上是人类关系的成功谈判。与使用线性模型或二次模型相比,与受众的良好沟通往往在成功中发挥更大的作用。当分析师必须选择要呈现的内容和省略的内容时,分析师和受众之间的信任至关重要。承认人性在数据分析中发挥作用是困难的,因为人类是高度主观的,不一致的,并且难以量化。但是,我认为这样做可以让我们更好地了解如何判断数据分析的质量以及如何在将来改进它们。

    PS:网舟科技长期专注于金融保险、通信、航空、互联网、旅游酒店...

  • ?

    数据分析的目的有哪些?

    李思天

    展开

    说到数据分析,其实很简单,就是找到问题、来解决问题。在做SEM数据分析之前,首先要了解数据,为什么要分析数据?通过数据分析可以获得什么?

    因此,正常的数据分析过程应该是:确定分析的目的→收集所需的数据→组织数据→分析数据→获得优化意见。

    数据是我们调整账户的基础。对于刚入门的竞价员来说,数据分析很难理解。由于关键字报告、创意报告、搜索词报告、对话词报告、转化词报告中的出价数据太多,新手常常不知道怎么开始,此时你需要冷静下来,整理每个报告,过滤并查找有效数据以进行比较。

    管理过这么多账户,凭借我们团队的经验,今天以快速掌握SEM数据分析进行讲解。

    首先,您需要了解SEM数据名词的含义。点击率是多少?转化率是多少?跳出率是多少?等一系列技术术语,例如帐户点击率下降,您需要清楚地知道哪些因素会导致点击率下降,接下来应该做什么;调整帐户后,您必须清楚地知道哪些数据会发生变化,否则一切都是浪费时间。以下是两个月教育行业的数据案例。

    数据

    整理后,复杂的数据将变得清晰。经验丰富的SEMer将知道对上图所示账户进行了哪些调整:这组数据是典型的流量不精准分析图,根据公司政策调整减少消费,平移展现下降、点击下降、对话下降、这些都是正常的数据范围,但是我们消费的下降,应该降低我们的转化成本,这组数据中我们的转化成本并没有降低,反而高出了1块钱,这就说明我们在降低消费时,没有控制我们的精准流量进来,还是以泛流量的方式进行优化账户,(当然这组数据的转化成本是指精准客户转化不是所有的转化成本)这就造成我们降低消费的同时没有一个合理的优化方案去优化账户。

    数据

数据分析是什么意思

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP