中企动力 > 商学院 > 数据分析产品
  • ?

    开眼数据分析如何用于产品迭代?“产品与数据共趣会”告诉你!

    forver

    展开

    7月1日,AIPA(安徽互联网产品经理协会)携手云掌财经,邀请到国内首家完成C轮融资(融资金额达4400万美元)的国内顶尖大数据公司——神策数据,联合举办“产品与数据共趣会”。安徽省中小企业服务中心常务副主任包正军、云掌财经CEO汪伟等出席并致辞,神策数据联合创始人、CTO曹犟与合肥研发中心负责人王灼洲就“数据与产品迭代”进行深入探讨。到会的还有安徽车之翼网络科技有限公司董事长王利伟、瀚硕科技CEO费中强、笃北科技CEO陈天聪,以及百余位安徽互联网产品经理从业者、学生代表。

    云掌财经CEO 汪伟致辞

    产品联合,共迎未来

    AIAP发起人、会长王舒 发表讲话

    AIPA(安徽互联网产品经理协会)会长王舒发言,号召“合肥的产品经理聚集起来,共同发声,一起成长”。王舒认为,一线城市互联网起步早,资源优渥、氛围浓厚,合肥相较来说起步晚,资源匮乏、氛围不足,环境和氛围可以改变个体,同样,优秀的产品经理、互联网从业者聚集在一起也可以造就良好的环境和氛围。合肥正处于高速发展阶段,可以为产品经理、互联网从业者提供广阔的上升空间。王舒说,被现状所同化不是我们想要的,改变现状、改变环境才是我们优秀产品经理优秀的灵魂!我们应该为合肥互联网的美好未来共同前行!

    探究数据,迭代产品

    神策数据联合创始人&CTO 曹犟

    “让企业决策不再依赖‘拍脑袋’,而是靠‘数据驱动’。”

    清华大学硕士、神策数据联合创始人&CTO曹犟,为合肥产品经理带来“数据思维与产品迭代”主题讲解

    神策数据合肥研发中心负责人 王灼洲

    神策数据合肥研发中心负责人王灼洲,为合肥产品经理讲解“Android&iOS埋点基础知识”

    福利

    活动期间,还为现场的小伙伴送上了一份小礼物,恭喜幸运的小伙伴~

    神策数据CEO桑文锋新作《数据驱动》

    部分参会者合影

  • ?

    大数据分析之多维数据分析入门

    Zai

    展开

    阅读本文不需要技术背景。

    总体介绍

    首先模拟一个数据分析场景,某企业积累了如下表格所示的销售数据:

    产品销售数据表

    表格中每一行表示某个时间段内某种商品在某个地区的销售情况。很明显,这些数据涉及到了时间、地区、产品三个业务角度。

    在对这样的数据进行分析时,不同的角色都会基于自己所感兴趣的业务角度提出问题

    销售经理关心各个地区的销售情况,希望找出销售增长率在平均水平之下的地区产品总监则希望了解近期内各种产品的销量对比,以作为后期产品研发方向的参考CEO想要知道近六个月内整体销售环比信息,用以评估是否达到公司运营目标

    对于表格中的数据,可以将其转换为另一种数据格式 - "三维空间立方体",如下图所示:

    图 1 - 数据立方体

    相对于表格,以三维立方体形式呈现的数据结构更加直观。

    在这个数据立方体中,每一个坐标轴都代表一个业务角度(时间、地区、产品),坐标轴上的坐标值则表示了某个业务角度的一个确定的值(如:北京市、3月份、手机),不同坐标轴坐标值的交叉点则表示一个具体的销售额。

    实际上,此数据立方体中表示业务角度的坐标轴就是维度,类似于三维立方体的数据结构则被称为多维数据结构(也称数据立方体)。

    再次回顾前文中销售经理、产品总监、CEO各自提出的问题,不难发现他们各自所关注的维度分别为:地区、产品、时间

    图 2 - 不同角色关注不同维度

    目前我们所模拟的这个数据分析场景较为特殊,因为只有三个维度,所以可以直观的将数据想象成一个三维立方体。

    实际情况中,企业进行数据分析时往往要参考更多的维度,而且提出的问题也会更加复杂,此时,已经不能将数据以经典的三维立方体结构进行呈现。

    虽然无法在三维空间中呈现更多维度的数据结构,但是面对更多维度时进行数据分析的思路却完全不变,不同的角色只需要从自身所关注的维度出发并提出问题即可,他们即不需要了解十几甚至几十维的数据如何存储,也无需考虑多维数据查询的具体实现方式。

    核心概念简介

    在多维数据分析领域中,有几个非常重要的核心概念:

    数据立方体(Cube)维度(Dimension)成员(Member),又称维度成员(Dimension Member)度量(Measure)级别(Level)

    图 3 - 多维数据模型

    维度(Dimension)

    图 4 - 维度

    维度就是描述数据的业务角度。在不同的数据分析场景中,会存在若干个不同的维度。

    以上图为例,存在三个维度:时间、地区、产品。在这个数据分析场景中,“哪种产品销量最好?”这样的问题显然主要关注的是产品这个维度,而“哪些地区连续六个月销售额环比增长?”则同时关注了地区和日期两个维度。

    在一个多维数结构中,维度可以被抽象理解成一个坐标轴,图1中所示的数据分析场景由三个维度组成,每个维度各自代表了三维空间中的一个坐标轴。

    相对于三维空间,具有更多维度的空间结构显然不易于被理解,实际上,您并不需要在头脑中想象出一个更多维度的空间场景,下文中几个简单的步骤将帮助您快速理解多维空间结构:

    【理解一维空间结构】

    图 5 - 一维空间图

    一维空间是一把尺子,只有一个坐标轴,坐标轴上的一个坐标值就能确定一个点

    【理解二维空间结构】

    图 6 - 二维空间图

    二维空间是一个平面,具有两个坐标轴,不同坐标轴上的两个坐标值确定一个点

    【理解三维空间结构】

    图 7 - 三维空间图

    三维空间具有长、宽、高三个坐标轴,三个坐标轴坐标值确定一个点

    【理解四维空间结构】

    四维空间比三维空间多出一个坐标轴,这里我们称这个新的坐标轴为“第四坐标轴”,现在如果需要确定一个点,除了长、宽、高三个轴上的坐标值外,还需要第四坐标轴上的一个坐标值

    【理解N维空间结构】

    N(N可以是大于零的任意整数)维空间中具有N个坐标轴,需要N个不同坐标轴上的坐标值才能确定一个点

    维度成员(Dimension Member)

    前文介绍维度概念时,讲到可将维度理解成表示某种业务角度的坐标轴,而维度成员则非常类似于维度坐标轴上的坐标值。

    以时间维度为例,“一季度”、“1月份”、“2月份”这三个维度成员同属于时间维度,它们各自表示了时间维度下一个具体的时间段。

    由下图可以看出,同一个维度下的维度成员呈现出树状结构,我们将没有子级成员的成员称为明细成员(Leaf Member,又称明细维度成员Leaf Dimension Member),其他成员称为非明细成员。

    图 8 - 明细成员与非明细成员

    数据立方体(Cube)

    数据立方体表示由若干个维度所描述的一个数据集合,每个维度各自表示一个可对此数据集合进行观察和分析的业务角度。

    图 9 - Cube(数据立方体)

    之所以称为“立方体”,是因为由三个维度所描述的一个数据集,能够非常轻松的被想象成三维空间中的一个立方体结构。

    需要注意的是,在多维数据分析体系中,一个数据立方体往往具有更多的维度,虽然更多维度形态并不像三维空间立方体那样直观,但维度表示某些业务角度的作用不会改变。

    度量(Measure)

    图 10 - 度量值

    在一个数据立方体中,从每个维度上都选取一个确定的维度成员,这些维度成员组合所确定的一个点就是度量值。

    在图 10示例中,日期维度:1月份、地区维度:河北省、产品维度:手机确定了一个最细粒度的数据方块,这个小数据方块(下文称为Data Cell)就是销售额6688这个度量值,显然,这表示“河北地区1月份手机产品的销售额是6688”。

    如果仔细观察图 10,您可能会发现并没有一个Data Cell能够直接表示“北京市一季度手机产品的销售额”。由于一季度与1、2、3三个月份是父子级的关系,所以“北京市一季度手机产品的销售额”可以通过汇总计算得到,如下图所示:

    图 11 - 度量值汇总

    一般情况下,数据立方体中并不直接存储非明细成员所描述的度量值,而是通过对其后代成员中的全部明细成员进行汇总计算而得出。

    级别(Level)

    级别表示维度成员所描述业务角度的细节程度,也可理解为通过维度成员观察数据的粒度。例如日期维度中一季度、1月这两个成员,分别属于季度、月份两个不同的级别,显而易见,季度级别的维度成员描述数据的粒度较为宽泛,月级别则较为细致。

    图 12 - Level(级别)

  • ?

    移动互联网产品数据分析

    卢小之

    展开

    一、数据统计的名词术语

    提示:先把基本概念掌握,再慢慢沉淀。

    PV(Page View):即页面浏览量或者点击量,用户没刷新一次即被刷新一次。

    UV(Unique View):独立访客,访问您电脑的一台电脑客户端为一个访客。提示:00:00-24:00内相同的客户端只被计算一次。

    新增用户数:又被称为激活用户数或者安装用户数。

    活跃用户:指一段时间内启动或登录过应用的用户。包括:日活(DAU),即每日活跃用户数;周活(WAU),即每周活跃用户数;月活(MAU),即每月活跃用户数。

    启动次数:用户对产品的一次使用即为一次启动。有日平均启动次数:该日平均每用户启动应用的次数。

    最高用户在线数(PCU),它是衡量系统运行压力的重要指标,以及衡量产品在运营期间受欢迎程度,大多数以游戏产品为主。

    渠道:市场营销专业术语,商品销售路线,是商品的流通路线。我们获取产品的渠道一般为以下商店。

    移动互联网分析

    获客成本:营销成本/新增用户,新客户一般包括:新访客,新注册用户,第一次下单的客户。

    平均付费(ARUP)=总收入/付费用户数,它一般从某个程度上是衡量产品的盈利能力,也是从某个方面衡量产品的发展活力。

    转化率:网站转化率=进行了相应动作的访问量/总访问量。它是衡量网站内容对访问者的吸引程度以及网站的宣传效果。

    二、数据的维度与指标

    提示:理解什么样的数据表现是健康的。

    1、用户留存:用户在某段时间内开始使用应用,经过一段时间后,仍然继续使用应用的被认作是留存用户,这部分用户占当时新增用户的比例即为留存率。次日留存率=(第一天新增的用户中,第二天还登录的用户数)/第一天新增的用户数*100%。

    - 产品生命周期:

    (1)相遇:初期(1-7天内使用产品情况及意愿)

    (2)相知:成长期(2-4周)

    (3)相恋:忠诚期(5-10周)

    (4)相离:流失期(11-12周以后)

    反映问题:用户留存率用来评定用户粘度,应用质量最直观的说明;留存率越高,说明产品的质量越好,用户的忠诚度越高。

    指标维度:

    (1)次日留存(1Day Retention):用户首次体验满意度。

    (2)7日留存(7Day Retention):完整体验后留下来的忠诚用户。

    (3)30日留存(30Day Retention):主要看版本更新后,用户的流失情况。

    健康表现:用户的留存1日,7日和30日留存有着一定的转换关系。从行业的普遍规律来看,留存率的健康指标为:4-2-1,即健康的应用,1日,7日,30日用户留存率应不低于40%-25%-10%的水平。

    2、用户活跃率

    活跃率=一段时间内的活跃用户数/总用户数。

    3、电商平台关注数据指标

    核心指标:成交金额(GMV),交易数量(Transations),均价(ARUP),用户的复购率,购买频次,年度复购率。

    指标维度:用户交易数据,用户行为数据,用户来源数据

    4、内容型平台关注数据指标

    - 基本指标:页面浏览量,访问量,独立访客数,跳出率,页面停留时长,网站停留时长,退出率,转化率,页面退出率

    - 指标维度:

    (1)内容热度:分享次数,推荐次数,点赞次数,评论数

    (2)用户情况:新用户,活跃用户,沉寂用户占比的变化,增长的趋势等

    5、若想了解一个行业或一个产品的数据,如何收集到靠谱的数据呢?

    - 切入思路:从流量、市场占有率、用户交付使用深度,舆情等角度

    - 常用工具:Alexa、AppAnnie,ASO 100,艾瑞的互联网行业研究报告,Gartner的研究报告,IDC,TalkingData的游戏行业研究

    三、如何进行数据估算

    提示:善于理性思维,解决具体问题。

    分析数据需明确边界

    如估计北京有多少辆汽车?

    (1)考察目的:数据分析能力,逻辑分析能力,全面思考能力

    (2)解决问题的思路:

    移动互联网分析

    四、常见的数据统计分析工具

    提示:工欲善其事,必先利其器。

    常用工具:百度统计,CNZZ站长统计(免费),诸葛io(免费+企业版),TalkingData,有盟统计,自主研发

    五、产品数据分析的三个层次

    移动互联网分析

    六、AARRR运营模型

    AARRR模型也称为海盗法则。

    移动互联网分析

    七、数据分析的6步曲

    数据分析过程中,主要包含6个既独立有相互关联的阶段。

    (1)明确分析目的与思路

    (2)数据收集

    (3)数据处理

    (4)数据分析

    (5)数据展现

    (6)撰写报告

    文章来源:Feng继续吹

    PS:网舟科技长期专注于金融保险、通信、航空、互联网、旅游酒店等行业的电子渠道大数据运营,为客户提供全球领先的电子渠道转型咨询、大数据挖掘和应用定制服务,助力客户互联网转型,提升数字化运营和数据营销能力。

  • ?

    数据分析全流程(内附案例)

    虚浮

    展开

    (图片来源于网络)

    作者:苏格兰折耳喵

    来源: 运营喵是怎样炼成的 (yymzylc)

    (温馨提示:图片显示毛糙和不清楚,是分辨率过高的缘故,点击图片,即可看到高清大图。 )

    本文将对一个案例进行从数据采集、数据清洗、数据分析再到数据可视化的全流程分析,力求条理清晰的展现外部数据分析的强大威力。以下是本文的写作框架:

    1 分析背景

    1.1 分析原理---为什么选择分析虎嗅网

    在现今数据爆炸、信息质量良莠不齐的互联网时代,我们无时无刻不身处在互联网社会化媒体的“信息洪流”之中,因而无可避免的被它上面泛滥的信息所“裹挟”,也就是说,社会化媒体上的信息对现实世界中的每个人都有重大影响,社会化媒体是我们间接了解现实客观世界和主观世界的一面窗户,我们每时每刻都在受到它的影响。

    综合上述两类情形,可以得出这样的结论,透过社会化媒体,我们可以观察现实世界:

    由此, 社会化媒体是现实主客观世界的一面镜子,而它也会进一步影响人们的行为,如果我们对该领域中的优质媒体所发布的信息进行分析,除了可以了解该领域的发展进程和现状,还可以对该领域的人群行为进行一定程度的预判。

    鉴于此种情况,作为互联网从业者的笔者想分析一下互联网行业的一些现状,于是想到了虎嗅网。

    虎嗅网创办于2012年5月,是一个聚合优质创新信息与人群的新媒体平台。该平台专注于贡献原创、深度、犀利优质的商业资讯,围绕创新创业的观点进行剖析与交流。虎嗅网 的核心,是关注互联网及传统产业的融合、一系列明星公司(包括公众公司与创业型企业)的起落轨迹、产业潮汐的动力与趋势。

    因此,对该平台上的发布内容进行分析,对于研究互联网的发展进程和现状有一定的实际价值。

    1.2 本文的分析目的

    笔者在本项目中的分析目的主要有4个:

    (1)对虎嗅网内容运营方面的若干分析,主要是对发文量、收藏量、评论量等方面的描述性分析;

    (2)通过文本分析,对互联网行业的一些人、企业和细分领域进行趣味性的分析;

    (3)展现文本挖掘在数据分析领域的实用价值;

    (4)将杂芜无序的结构化数据和非结构化数据进行可视化,展现数据之美。

    1.3 分析方法---分析工具和分析类型

    本文中,笔者使用的数据分析工具如下:

    Python3.5.2(编程语言)

    Gensim(词向量、主题模型)

    Scikit-Learn(聚类和分类)

    Keras(深度学习框架)

    Tensorflow(深度学习框架)

    Jieba(分词和关键词提取)

    Excel(可视化)

    Seaborn(可视化)

    新浪微舆情(情绪语义分析)

    Bokeh(可视化)

    Gephi(网络可视化)

    Plotly(可视化)

    使用上述数据分析工具,笔者将进行2类数据分析:第一类是较为传统的、针对数值型数据的描述下统计分析,如阅读量、收藏量等在时间维度上的分布;另一类是本文的重头戏---深层次的文本挖掘,包括关键词提取、文章内容LDA主题模型分析、词向量/关联词分析、DTM模型、ATM模型、词汇分散图和词聚类分析。

    2 数据采集和文本预处理

    2.1 数据采集

    笔者使用爬虫采集了来自虎嗅网主页的文章(并不是全部的文章,但展示在主页的信息是主编精挑细选的,很具代表性),数据采集的时间区间为2012.05~2017.11,共计41,121篇。采集的字段为文章标题、发布时间、收藏量、评论量、正文内容、作者名称、作者自我简介、作者发文量,然后笔者人工提取4个特征,主要是 时间特征 (时点和周几)和 内容长度特征 (标题字数和文章字数),最终得到的数据如下图所示:

    2.2 数据预处理

    数据分析/挖掘领域有一条金科玉律:“Garbage in, Garbage out”,做好数据预处理,对于取得理想的分析结果来说是至关重要的。本文的数据规整主要是对文本数据进行清洗,处理的条目如下:

    (1) 文本分词

    要进行文本挖掘,分词是最为关键的一步,它直接影响后续的分析结果。笔者使用jieba来对文本进行分词处理,它有3类分词模式,即全模式、精确模式、搜索引擎模式:

    · 精确模式:试图将句子最精确地切开,适合文本分析;

    · 全模式:把句子中所有的可以成词的词语都扫描出来, 速度非常快,但是不能解决歧义;

    · 搜索引擎模式:在精确模式的基础上,对长词再次切分,提高召回率,适合用于搜索引擎分词。

    现以“新浪微舆情专注于社会化大数据的场景化应用”为例,3种分词模式的结果如下:

    【全模式】: 新浪/ 微舆情/ 新浪微舆情/ 专注/于/ 社会化/ 大数据/ 社会化大数据/ 的/ 场景化/ 应用

    【精确模式】: 新浪微舆情/ 专注/于/ 社会化大数据/ 的/ 场景化/ 应用

    【搜索引擎模式】:新浪,微舆情,新浪微舆情,专注,于,社会化,大数据,社会化大数据,的,场景化,应用

    为了避免歧义和切出符合预期效果的词汇,笔者采取的是精确(分词)模式。

    (2) 去停用词

    这里的去停用词包括以下三类:

    标点符号:, 。! /、*+-

    特殊符号:▲等

    无意义的虚词: “the”、“a”、“an”、“that”、“你”、“我”、“他们”、“想要”、“打开”、“可以”等

    (3) 去掉高频词、稀有词和计算Bigrams

    去掉高频词、稀有词是针对后续的主题模型(LDA、ATM)时使用的,主要是为了排除对区隔主题意义不大的词汇,最终得到类似于停用词的效果。

    Bigrams是为了自动探测出文本中的新词,基于词汇之间的共现关系---如果两个词经常一起毗邻出现,那么这两个词可以结合成一个新词,比如“数据”、“产品经理”经常一起出现在不同的段落里,那么,“数据_产品经理”则是二者合成出来的新词,只不过二者之间包含着下划线。

    3 描述性分析

    该部分中,笔者主要对数值型数据进行描述性的统计分析,它属于较为常规的数据分析,能揭示出一些问题,做到知其然。

    3.1 发文数量、评论量和收藏量的变化走势

    从下图可以看出,在2012.05~2017.11期间,以季度为单位,主页的发文数量起伏波动不大,在均值1800上下波动,进入2016年后,发文数量有明显提升。

    此外,一头(2012年第二季)一尾(2017年第四季)因为没有统计完全,所以发文数量较小。

    下图则是该时间段内收藏量和评论量的变化情况,评论量的变化不愠不火,起伏不大,但收藏量一直在攀升中,尤其是在2017年的第二季达到峰值。收藏量在一定程度上反映了文章的干货程度和价值性,读者认为有价值的文章才会去保留和收藏,反复阅读,含英咀华,这说明虎嗅的文章质量在不断提高,或读者的数量在增长。

    3.2 发文时间规律分析

    笔者从时间维度里提取出“周”和“时段”的信息,也就是开题提到的“人工特征”的提取,现在做文章分布数量的在“周”和“时”上的交叉分析,得到下图:

    上图是一个热力图,色块颜色上的由暖到冷表征数值的由大变小。很明显的可以看到,中间有一个颜色很明显的区域,即由“6时~19时”和“周一~周五”围成的矩形,也就是说,发文时间主要集中在工作日的白天。另外,周一到周五期间,6时~7时这个时间段是发文的高峰,说明虎嗅的内容运营人员倾向于在工作日的清晨发布文章,这也符合它的人群定位---TMT领域从业、创业者、投资人,他们中的许多人有晨读的习惯,喜欢在赶地铁、坐公交的过程中阅读虎嗅讯息。发文高峰还有9时-11时这个高峰,是为了提前应对读者午休时间的阅读,还有17时~18时,提前应对读者下班时间的阅读。

    3.3 相关性分析

    笔者一直很好奇,文章的评论量、收藏量和标题字数、文章字数是否存在统计学意义上的相关性关系。基于此,笔者绘制出能反映上述变量关系的两张图。

    首先,笔者做出了标题字数、文章字数和评论量之间的 气泡图 (圆形的气泡被六角星替代,但本质上还是气泡图)。

    上图中,横轴是文章字数,纵轴是标题字数,评论数大小由六角星的大小和颜色所反映,颜色越暖,数值越大,五角星越大,数值越大。从这张图可以看出,文章评论量较大的文章,绝大部分分布于由文章字数6000字、标题字数20字所构成的区域内。虎嗅网上的商业资讯文章大都具有原创、深度的特点,文章篇幅中长,意味着能把事情背后的来龙去脉论述清楚,而且标题要能够吸引人,引发读者的大量阅读,合适长度标题和正文篇幅才能做到这一点。

    接下来,笔者将收藏量、评论量和标题字数、文章字数绘制成一张3D立体图,X轴和Y轴分别为标题字数和正文字数,Z轴为收藏量和评论量所构成的 平面 ,通过旋转这个3维的Surface图,我们可以发现收藏量、评论量和标题字数、文章字数之间的相关关系。

    注意,上图的数值表示和前面几张图一样,颜色上的由暖到冷表示数值的由大到小,通过旋转各维度的截面,可以看到在正文字数5000字以内、标题字数15字左右的收藏量和评论量形成的截面出现“华山式”陡峰,因而这里的收藏量和评论量最大。

    3.4 城市提及分析

    在这里,笔者通过构建一个包含全国1~5线城市的词表,提取出经过预处理后的文本中的城市名称,根据提及频次的大小,绘制出 一张反映城市提及频次的地理分布地图 , 进而间接地了解各个城市互联网的发展状况(一般城市的提及跟互联网产业、产品和职位信息挂钩,能在一定程度上反映该城市互联网行业的发展态势)。

    上图反映的结果比较符合常识,北上深广杭这些一线城市的提及次数最多,它们是互联网行业发展的重镇。值得注意的是,长三角地区的大块区域(长江三角洲城市群,它包含 上海 , 江苏省 的 南京 、 无锡 、 常州 、 苏州 、 南通 、 盐城 、 扬州 、 镇江 、 泰州 , 浙江省 的 杭州 、 宁波 、 嘉兴 、 湖州 、 绍兴 、 金华 、 舟山 、 台州 , 安徽省 的 合肥 、 芜湖 、 马鞍山 、 铜陵 、 安庆 、 滁州 、 池州 、 宣城 )呈现出较高的热度值,直接说明这些城市在虎嗅网各类资讯文章中的提及次数较多,结合国家政策和地区因素,可以这样理解地图中反映的这个事实:

    长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。

    长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。

    接下来,笔者将抽取文本中城市之间的 共现关系 ,也就是城市之间两两同时出现的频率,在一定程度上反映出城市间经济、文化、政策等方面的相关关系,共现频次越高,说明二者之间的联系紧密程度越高,抽取出的结果如下表所示:

    将上述结果绘制成如下动态的流向图:

    由于虎嗅网上的文章大多涉及创业、政策、商业方面的内容,因而这种城市之间的共现关系反映出城际间在资源、人员或者行业方面的关联关系,本动态图中,主要反映的是北上广深杭(网络中的枢纽节点)之间的相互流动关系和这几个一线城市向中西部城市的单向流动情形。流动量大、交错密集的区域无疑是中国最发达的3个城市群和其他几个新兴的城市群:

    京津冀城市群

    长江三角洲城市群

    珠江三角洲城市群

    中原城市群

    成渝城市群

    长江中游城市群

    上面的数据分析是基于数值型数据的描述性分析,接下来,笔者将进行更为深入的文本挖掘。

    4 文本挖掘

    数据挖掘是从有结构的数据库中鉴别出有效的、新颖的、可能有用的并最终可理解的模式;而文本挖掘(在文本数据库也称为文本数据挖掘或者知识发现)是从大量非结构的数据中提炼出模式,也就是有用的信息或知识的半自动化过程。

    本文的文本挖掘部分主要涉及高频词统计/关键词提取/关键词云、文章标题聚类、文章内容聚类、文章内容LDA主题模型分析、词向量/关联词分析、ATM模型、词汇分散图和词聚类分析。

    4.1 关键词提取

    对于关键词提取,笔者没有采取词频统计的方法,因为词频统计的逻辑是:一个词在文章中出现的次数越多,则它就越重要。因而,笔者采用的是 TF-IDF (termfrequency–inverse document frequency)的关键词提取方法:

    它用以评估一字/词对于一个文件集或一个语料库中的其中一份文件的重要程度,字/词的重要性会随着它在文件中出现的次数成正比增加,但同时会随着它在语料库中出现的频率成反比下降。

    由此可见,在提取某段文本的关键信息时,关键词提取较词频统计更为可取,能提取出对某段文本具有重要意义的关键词。

    下面是笔者利用jieba在经预处理å�...

  • ?

    产品运营数据分析驱动增长(AARRR)框架模型总结

    姚弘文

    展开

    本文是关于数据分析驱动增长的模型框架的总结,用一张表把数据分析驱动增长相关目标和方法进行呈现和总结, 希望对你的产品建立运营数据分析工作有帮助和参考。

    1 背景

    对于任何一个新产品从市场调研,痛点分析,产品定位,MVP产品设计和产品实现后,业务增长和商业价值增长将作为团队的核心任务,增长的方法除了和客户保持高频和有效的沟通进行产品优化和价值挖掘以外,建立匹配的科学的数据分析体系是保持产品增长的高效的手段之一。

    表格整理截图信息如下:

    如上内容是个人在工作中对于数据分析驱动增长的目标以及方法的整理,不足之处,欢迎一起讨论指正。

    2 产品数据分析准备

    产品在建立数据分析体系之前,产品本身的要有相对清晰的市场定位、核心痛点解决业务流程实现,包括客户群和市场容量的预估、竞品分析等动作,这样产品运营数据分析的业务体系才有基础的方向和目标。

    举例:一款针对中小企业的在线营销宣传H5的工具产品。

    客户对象:中小企业。核心痛点:企业在营销宣传时制作在线宣传册的繁琐、费时。市场预估:中小企业在企业营销宣传,有多少企业会使用在线宣传营销工具,不同类型的企业在在线营销时支出的成本每年/每季度是多少,可以参考一部分的外部分析数据,比如易观数据、互联网开放数据分析 平台等。竞品分析:类似的产品的市场和营销情况,核心卖点,市场容量,市场占比等等,找到合适自己的差异化的产品卖点。

    根据上面的分析找到合适自己的差异化卖点,并寻找自己相应的种子客户群。

    3产品数据分析驱动增长的目标明确

    在互联网的比较流行的数据分析驱动增长的 AARRR模型 已经比较成熟,贯穿整个产品生命周期,具体的细节不详述。

    在这里需要说明的是,数据分析 AARRR增长模型是一套工具方法论,但是我们不能忘记我们的数据分析的起点和初衷:产品/市场,业务持续增长(商业价值的持续变现以及客户价值的平衡)。

    在产品生命周期中建议的核心关注指标:

    产品的成长初期时:重点关注用户激活率、和留存率,求质量。等待经历若干个周期迭代后,慢慢保证高留存率后。产品成长爆发期时:重点关注用户获取率 和留存率,求高效增长。产品口碑爆发期时:重点关注传播推荐,尝试病毒式增长。产品成熟收割期时:重点关注用户增加收入 和 留存率,求客户价值和商业价值变现的平衡。

    当然在上面的产品生命周期中,我们需要不断观察数据,并保持和客户的高频沟通,并及时了解市场中竞争对手的变化和客户需求的变化,根据市场和产品的变化调整产品策略、运营策略。

    4 产品数据分析驱动增长的方法说明

    产品数据分析驱动产品增长的原则:数据分析必须以业务场景和业务目标为起点,业务决策作为终点,数据本身是没有意义的,数据比对分析和挖掘才有价值。

    (1)数据分析的模式和方法:

    单项分析:趋势洞察、渠道归因、链接标记、漏斗分析、热图分析、分群分析、A/B分析、留存分析组合分析:针对某个细分点,进行多维度组合分析。比如对于某功能、某页面做留存、转化、活跃分析。用户场景分析:时间、地点、需求。 举例:1、早上上班路上 2、用户合约快到期时专题分析:用户体验分析 、产品问题分析、销量增长分析等建模分析:流失预警分析、用户激活分析、付费决策分析等

    (2)数据分析的内容和分类:

    以用户行为中心:用户行为事件、渠道、产品功能点击、事件分析、用户场景分析、用户行为轨迹、页面流、路径分析、活跃用户分析、用户分群、用户分层、用户细查、用户决策模型。以流量访问为中心:PV、UV、跳出率、访问深度、停留时长、热点图、页面升降榜、页面频道流转、用户访问地域、访问终端、访问来源、新老访客、活跃度等。以用户生命周期为中心:新用户、激活用户、活跃用户、衰退用户、流失用户,分析各个人群的数量,分析对应的关于产品、用户行为、转换、留存、注册相关等分析。以用户分群分层为中心:按照新用户、使用用户、活跃用户、付费用户、高价值贡献付费用户分层,按照年龄、地域、消费能力、习惯、进行分群。分析各个人群的数量,分析对应的关于产品、用户行为、转换、留存、注册等相关分析。产品体验数据分析:功能活跃比、核心转化功能分析、产品体验分析报告(市场、客户需求、产品功能结构、交互体验、意见和建议),用户产品和功能体验调研报告。(主观的想法和建议,可以做数据分析支撑和A/B 测试)。业务运营数据分析:业务目标达成分析和总结、活动转化效率评估、软文阅读和分享次数分析、活动策划分析等。技术运营迭代分析:需求上线成功率、上线时长、需求响应时长、迭代周期、页面响应速度、上线后bug数、页面功能稳定性等。

    5 产品数据分析驱动增长的工具和平台建议

    对于上面的分析方法目前对于BAT等一线互联网公司有自己的内部大数据中心,支持营销、运营、产品的数据分析工具支撑。对于中小型成长型企业或者传统行业,建设一套完整的数据分析的工具支撑平台成本大、耗时长,建议使用第三方的免费或付费的工具平台。

    对于第三方数据分析的工具平台主要分为两类:

    以流量为核心第三方数据分析平台:GA、百度统计、友盟统计等(部分功能需要付费)。以用户行为为核心第三方数据分析平台:Growing IO、诸葛 IO、神策IO等(需要付费使用)。

    以上工具平台均支持WEB、H5、移动客户端 统计,平台排名不分先后,仅供参考,团队根据自身情况合理选择使用第三方还是自己建设数据统计分析平台。

    本文来自中国电子商务研究中心,创业家系授权发布,略经编辑修改,版权归作者所有,内容仅代表作者独立观点。

  • ?

    相爱相杀的数据分析师与产品经理

    葛文博

    展开

    场景一:新入职的数据分析师

    场景二:啥都没搞明白就被甩了一脸大活的数据分析师

    场景三:被产品经理涮了的数据分析师

    场景四:望眼欲穿的数据分析师

    场景五:又被产品经理涮了的数据分析师(奇怪我为什么要说又呢)

    场景六:说了那么多相杀总要有点相爱……也许吧

    那么,填坑活动就结束了,下次发图,就说说数据分析师和数据工程师那些不得不说的故事吧,要等我填新坑哦~

  • ?

    产品数据分析浅析

    释然

    展开

    产品的生命周期中各个阶段都伴随着产品数据的变化,产品经理根据这些产品数据来判断产品所在阶段并对后期的产品演进进行合理的规划;在产品需求分析阶段,产品经理可以通过数据分析来鉴别用户需求的真伪;在产品上线后,产品经理可以通过数据验证产品的功能价值并且让数据指导版本迭代。

    针对不同的产品的业务形态有所差异,产品的核心数据也有所不同:比如视频产品侧重的是播放类的数据,如播放时长;电商类产品侧重订单量、交易额等。所以我们可以说,产品的数据分析是产品经理日常工作中必不可少的一环。那么产品有哪些数据指标?具体又该如何分析呢?

    一、 产品的基础数据

    产品的基础数据一般都是与产品APP相关的整体性的数据,用于检测产品的整体趋势,主要的基础数据有以下几项:

    APP/APK下载量:针对客户端产品的数据指标,也称为装机量,是指产品客户端被下载到手机、pad等终端的数量,一般以拥有的独立USERKEY/USERID为一个有效的下载。APP/APK激活量:指用户完成有效下载后,点击客户端并首次成功启动软件的用户数量。APP/APK访问量:指一段时间内用户点击进入客户端的次数。APP/APK访问用户数:APP/APK访问量的去重数据,指一段时间内点击进入客户端的不同身份标识的用户数。人均访问时长: 用户在客户端内停留时间的平均值。同时在线人数:实时数据,即在该时间点正在使用产品的用户数,有时也用并发量来表示,用以衡量客户端可承载的同时在线人数。渠道数据:不同的渠道来源的下载量、访问量等,用以评估不同访问路径以及渠道带来的效果差异。

    二、 产品的付费数据

    产品的付费数据主要是根据用户的付费行为定义的数据指标,付费指标可以看出用户对于产品的认可程度,产品的盈利价值等,主要的付费数据有以下几项:

    付费收入金额:某时段内用户付费的总额。付费用户数:某时段内发生付费行为的用户的总数。新付费用户数:某时段内新增的付费用户的数量。付费转化率=付费用户数/XX用户数,根据产品的业务形态,“XX用户数”可以为视频产品的“点播用户数”。付费率=付费用户数/活跃用户数(日、月)。ARPPU值(付费用户的平均付费值)=日付费收入/日付费用户数。ARPU值(活跃用户的平均付费)=日付费收入/日活跃用户数。收入占比=某单项收入/总付费收入。收入曲线:每日、每周、每月的付费曲线,通过观察付费的高峰期,针对性地进行营销活动;付费路径:分付费路径进行付费收入和付费用户数的占比统计,对占比较大的付费入口进行营销活动的露出,占比较小的入口进行产品侧的优化。

    三、 产品的页面数据

    产品的页面数据主要是根据用户在页面中的行为作出埋点,从而获取的数据;页面数据对产品的功能优化有很大的指导意义,主要的页面数据有以下几项:

    PV(page view):即页面浏览量,针对网站产品而言,,通常是衡量一个网站流量的主要指标;针对客户端产品,则是衡量某个页面的流量的指标。UV:(unique visitor):即页面独立访问量,有称为独立访问用户,是PV经去重后得到的数据。页面平均停留时长:用户在该页面内停留时间的平均值。人均页读数:用户在进入客户端后到达的页面数的均值。跳出率 :指用户在只访问了入口页面(例如软件登录页、开机引导页等)就退出客户端的访问量与所产生总访问量的百分比。页面转化率:页面中某个功能的点击量和到达该页面的访问量的百分比,如电商产品的商品详情页中“立即购买”按钮的点击量与商品详情页的访问量的百分比,就是商品详情页-“立即购买”的转化率。

    四、 产品的用户数据

    产品的用户数据主要是根据用户在各个阶段的角色的不同为维度进行定义的数据,主要的用户数据有以下几项:

    注册用户数:指用户下载运行,并且完成注册的用户数。登录用户数:登录应用后至当前时间,至少登录过一次的用户数;活跃用户数:登录用户数-新增用户数;新增用户数:在某个时间段(一般为第一整天)新登录应用的用户数;日活:当日访客/总用户数。周活:7日内访客(去重)/总用户数。月活:30日内访客(去重)/总用户数。流失率 :是指用户的流失数量与全部用户数量的比例。转化率 :正式成为用户的数量和未知意向的潜在型客户的数量的比率。二跳率(一跳、二跳、三跳):漏斗模型,没进入一个层级用户的流失率。留存率=登录用户数/新增用户数*100%(一般统计周期为天)次日留存率:(当天新增的用户中,在第2天还登录的用户数)/第一天新增总用户数第3日留存率:(第一天新增用户中,在往后的第3天还有登录的用户数)/第一天新增总用户数,还可用7天,30为周期计算周留存率和月留存率。LTV(用户生命周期价值)=一段时间内的付费收入/一段时间内的新增用户数;一般指的是3日、5日、7日、14日、30日、60日、90日LTV,即用户首次登录到以上日期所带来的价值。

    五、数据分析思路

    有了上面提到的这些数据,仅仅是一个基础。更重要的如何利用这些数据,进行分析,从而获取对于产品的指导意义。要让这些数据有意义,首先要建立起产品的数据体系。做好客户端埋点,产品数据定义这些基本工作后,制定日常的数据监测机制。有了周期性的数据监测,才能从数据中发现问题,并深入分析问题,寻找解决问题的方法。

    第一步,找到问题所在,我们要发现发生了什么问题?如一段时间内的用户留存率忽然降低。第二步,找到问题发生的原因,寻求为什么会发生这个问题?在用户层发现的问题,就需要下沉至功能层。如用户留存率降低的原因,是不是因为产品的功能无法满足用户的需求或者功能的改版增大了用户的学习成本。这个阶段中,要勇敢猜测,大胆求证。第三步,在可能的问题发生原因的基础上,通过产品或者运营的方式来尝试解决问题。第四步,在采取一定的解决问题的措施之后,要持续数据监测,通过数据观察措施的有效性;并及时调整措施,知道问题得到改善或解决。

  • ?

    App数据分析到底要分析什么

    海菡

    展开

    按大众化的分法,产品的生命周期(PLC, Product Lifetime Cycle)分为初创期、成长期、成熟期、衰退期,在产品的每个阶段,数据分析的工作权重和分析重点有所区别,下面按阶段结合案例来聊聊。

    一、初创期

    初创期的重点在于验证产品的核心价值,或者说验证产品的假设:通过某种产品或服务可以为特定的人群解决某个问题。这个阶段应当遵循MVP(Minimum Variable Product) 的思想,以最小的成本来验证创业的想法,并根据用户的反馈快速迭代以调整解决方案,最终在数据上得到验证。

    案例:

    拿之前做的某款国外移动端论坛社交应用为例,产品在idea时期(12,13年左右)发现了论坛用户经常在吐槽从移动端Wap页访问论坛速度慢、广告多、完全没有移动端适配,于是我们提出假设:做一个App,连接论坛系统与用户,让论坛用户在移动端也能享受流畅的论坛访问体验,并且用户愿意为了这种体验付费。

    于是在初期,整个产品完全围绕看帖、发帖两个核心场景进行挖掘,在论坛里进行宣传,售价$18,发现有许多用户为之付费,且这些用户的留存率达到60%+(当然与用户付费了有关),有一半的用户使用时长都超过了70分钟。当时没过多久陆续出来了一些竞品 (Vbulletin团队,当时最大的论坛系统,开发了一个移动端的App,意图解决同样的问题),但是没过多久都远远落在了我们后面,就是因为整个团队遵循MVP的思想,按用户反馈专心反复打磨看帖、发帖的流畅体验,获得了非常好的用户口碑并领先市场,也获得了某著名硅谷投资机构的投资。

    关键数据——目标人群画像

    除此之外,初创期可以通过接入一些第三方的应用监测SDK来了解初期用户群体的画像,从侧面验证用户群体与假设的目标用户群体特征是否一致,常见的是人口学属性(性别、年龄、学历、地域)。

    案例:

    今年4月初在和国内某健身类的APP的产品经理聊到, 该APP最初是一款健身、运动记步的工具App,在产品前期新用户的次日留存处于业内平均水平,在其观察到目标用户群体的画像时,发现女性用户明显比男性用户要多,且女性用户留存明显比男性用户要高。于是决定在产品策略上向女性用户倾斜,主攻女性健身、减脂、美容方向的功能以及内容推荐,产品整体次日留存率相比之前增长近100%。

    同样,最近服务了一个鹅厂内部客户,他们开发了一款新产品,意在面向年轻人群体,结果却发现其用户年龄分布以青少年和老年人居多:

    这正好与他们的用户渠道相关,原来他们有一款面向青少年和老年人的产品,为了给产品带来第一批用户,他们直接从老的产品将用户引流过来,结果发现他们并非产品的目标用户。

    关键数据——留存率

    在当前用户符合目标受众特征时,核心关注这些用户的留存率、使用时长/频率、用户的黏性等指标,这里就留存率展开来讲。

    留存率的维度分很多种(7日,双周,30日等),依据产品特征来选择,若产品本身满足的是小众低频需求,留存率则宜选择双周甚至是30日;留存率高,代表用户对产品价值认可并产生依赖,一般来说,假设便能得到验证,通常低于20%的留存会是一个比较危险的信号。

    介绍一个以数据为驱动的先行指标模型,可以通过找到先行性指标指导产品设计,从而提升留存率。先看下先行性指标的定义,先行性指标是指新用户在使用产品早期的一种产品行为,这个指标与用户的留存率指标之间存在着非常高的线性相关关系,可以预测用户是否会在产品中留存下来。

    用自己总结的公式来描述,大致如下:

    积极预测可能性(%):表示用户执行了该行为,即可预测该用户留存活跃的可能性

    消极预测可能性(%) :表示用户如果不执行该行为,即可预测该用户不留存活跃的可能性

    最终,先行性指标的可信度=积极预测可能性 X 消极预测可能性 ,我们直接看案例。

    案例

    拿之前的论坛社交App为假设,假设“用户在注册前10天内添加好友超过7个”为先行性指标,那么我们计算一组数据:

    其中,用户前10天内添加好友超过7个,则其30日留存下来可能性为99%;若添加好友小于7个,则其30日不留存下来(流失)可能性为95%,综合指标可信度为0.9405。

    同理,计算以下两个先行性指标可信度:

    最终,我们得到对比:

    以上只是假设的数据,实际上,我们需要对比十几个甚至是二十几个行为指标才能找出先行性可信度最高的行为。

    这个模型中第一条“新用户在注册后的10天内添加好友超过7个”,也就是Facebook一个经典的“aha moments”,所谓”aha moments”即当用户意识到产品的核心价值的时刻,也就是我们的“先行指标”。

    (Facebook,Instagram推荐好友截图)

    除此之外,先行性指标应当满足以下条件:

    二、快速成长期

    经过了产品打磨的初始阶段,产品有了较好的留存率了,这个时候产品开始进入自发增长期。自发增长期的产品阶段,仍需要关注用户留存、用户时长、用户画像的变化等数据,但可以将侧重点关注在用户的整个生命周期的管理,其中以新用户的增长、激活、触发“aha moments”到产品稳定活跃用户的整个漏斗分析为主。

    新用户的增长和激活

    其中新用户的增长和激活一般有两种方式,第一种是构建产品的病毒性传播系数, 让产品自发增长,《精益运营数据分析》书中有提到的几个用户病毒式传播分类很有趣:

    原生病毒性,即通过App本身的邀请好友功能而传播吸引的新用户的方式;

    口碑病毒性,即通过口碑传播,用户主动通过搜索引擎成为的新用户;

    人工病毒性,即通过人工干预,如有奖邀请等激励措施来鼓励用户进行邀请行为。

    这里关注的一个指标称之为“病毒式传播系数”,感兴趣的同学可以自行深入了解。

    新用户下载->激活->‘Aha Moments’->产品稳定活跃

    产品开始进入自发增长期后,需要关注用户从新用户到活跃用户(留存后)、到核心用户的生命周期,并将每个过程的关键指标提炼并精细化。

    案例

    以之前的论坛社交APP为例,新用户进入产品会看到一个欢迎页(如左下图),经过注册、登录后会看到产品的首页(如右下图的Feed流页面),多数App都有类似的流程:

    一个新用户从进入App欢迎页到最终成为核心用户大概是以下流程:新用户(探索发现产品价值中)-> 旁观者(逐渐认知产品价值并有一定的参与感)->生产者(认同产品价值并积极参与):

    按大众化的分法,产品的生命周期(PLC, Product Lifetime Cycle)分为初创期、成长期、成熟期、衰退期,在产品的每个阶段,数据分析的工作权重和分析重点有所区别,下面按阶段结合案例来聊聊:

    此时,对各个阶段的用户行为进行指标分解:

    新用户&探索发现者:

    欢迎页跳出率新用户注册率新用户引导流程转化率初始看到Feed页跳出率搜索结果转化率推送权限开通率

    旁观者(路过者):

    平均每个用户关注板块数平均每个用户关注其他用户数平均每个活跃用户赞/分享数Feed卡片展示数Feed卡片点击数订阅内容推送点击率

    内容生产者:

    · 平均每个活跃用户发帖数

    · 平均每个活跃用户发照片、视频数

    · 平均每个用户在论坛内使用时长

    · 活跃用户在论坛内行为分布

    精细化的拆分用户生命周期前中期的行为指标,在产品快速增长期帮助了产品不断打磨细节,将用户从新进到成为核心用户体验不断完善。与此同时,在各节点数据提升并稳定后,产品运营的同学则开始进行各种推广、投放的宣传以扩大盘子、占领市场。

    三、成熟期

    随着用户快速增长,产品不断完善,产品在进入成熟期前后,数据运营关注的重心开始从用户生命周期的前半段(吸引、激活、留存)往后半段(流失、回流)开始偏移。

    这里分享一个在增长期和成熟期关注的数据模板 Daily Net Change (应用自John Egan@Pinterest),区别于只关注DAU、MAU数据,只关注活跃用户数的增减很多时候都是取悦自己,而这个模型能帮助直观地观察到用户增长的因子是什么,或者用户盘子变化的情况,通过一张图展示了产品的新增、回流和留存情况。

    其中Net Change = 新增用户 + 回流用户 – 流失用户。

    新增用户即当天有多少新用户加入

    回流用户即多少老用户连续28天没有使用,今天又开始使用

    流失用户即有多少已有用户刚好最后一次使用应用是在28天前

    流失与回流

    在关注流失回流的过程中,数据会揭示当前用户盘子的一个变化情况,具体分析流失原因则可以参考下方流程:

    核心思路即,通过回访定性+数据验证为主要手段,确定流失原因,改变产品运营策略以预防用户流失或拉回用户,促进回流。

    除此之外,对于一些稳定的投放渠道,普通的改善方法可能提升转化有限,此时可以进行更精细化的渠道分析来优化提升ROI:

    案例:

    提升ROI

    四、衰退期

    最终,产品进入衰退期,一般在进入衰退期前可以采取两种方式:

    1、规模化

    常出现在零售业中,如开一家按摩养生店,在一定范围内收获好评,那产品成熟的时候则可以开启连锁加盟模式,通过迅速而广泛的扩大市场形成品牌效应,以形成壁垒,此时衰退的风险则被抵御。

    2、生态化

    在产品增长或接近完善时,单一的产品很容易存在需求过于垂直、用户无法形成依赖的问题,可以开发具有协同能力的新产品以搭建完整的产品生态,使得在当前产品上无法被得到满足或失去兴趣的用户被引流到新产品,作为新产品的新用户;同时新产品的用户也能在新产品上被引流回老产品,产品之间形成互相依赖的链条,最终用户有效流转,形成生态。

  • ?

    产品经理必备的数据分析能力,你有吗?

    秋天

    展开

      大家都知道,对于产品经理的岗位要求的能力还是比较多的,如果我们对这些能力,按照硬技能和软技能进行分类的话,就有且不止以下这些能力:

      软技能:沟通能力、决策能力、逻辑分析能力、执行力、项目管理能力等;

      硬技能(工具能力):文档能力、Visio、Axure、Mindmanger等;

      那么,产品经理的另一种非常重要的能力---数据分析能力,你有吗?蓝鸥资深产品经理讲师为大家整理了答案。

      何为数据分析?

      现在的软件开发,都讲究小而美,单点突破,快速迭代。那么我们在快速迭代时,就要用到数据分析,通过用户使用数据来分析产品的优缺点,甚至方向的正确与否。因此,数据分析,就是产品迭代时的眼镜和耳朵,产品经理也是通过数据分析,来说服开发做功能,说服老板投入资源。

      数据分析的概念:

      数据分析是指用适当的统计方法对收集来的大量第一手的资料和第二手的资料进行分析,以求最大化地开发数据资料的功能,发挥数据的作用。通过对数据的详细研究和概括总结以提取用户信息和形成结论。

      数据分析使用场景列举:

      1、如果某款游戏下载量高,注册率低;是否因为服务器登录问题或者注册流程繁琐,是否近期网络出现故障?

      2、如果某款游戏数据一直良好,某段时间数据突然跌落;是否因为市场宣传力度减弱,是否因为用户生命周期上线,还是说其他精品的冲击?

      我们必须了解的一点,是数据分析不在于数据本身,而在于分析的能力。数据只是参照物,只是标杆,分析才是行为,通过分析数据,我们发现问题的所在,再改进它。

      需要分析哪些数据?

      基础数据:下载量、激活量、新增用户量、活跃用户等;

      社交产品:用户分布、用户留存(次日、3日、7日、次月、3月)等;

      电商:淘宝指数、网站流量、跳出率、页面访问深度等;

      内容类:内容转化率(内容下载量/内容浏览量)、留存量;

      工具类:功能点击量、应用商城排名;

      其他:竞品数据(下载、激活等);

      数据分析的工具:

      1、第三方数据分析工具,如友盟,可快速接入,节省成本,比较适合创业型公司及刚上线的产品,但是无法对关键数据在突发异样时进行跟踪;;

      2、自己开发的数据分析工具,可以对每个数据进行实时跟踪,并快速做出产品的调整,需要足够的开发人员及成本,比较适合大型公司或者成熟型产品;

      如何进行数据分析?

      对于这个问题,我想作为产品的工作人员,我们还不用达到数据分析师的高度,因此也不用说要先对数据建模,再对实际分析数据,看是否与模型吻合。但是,我们却需要要有一个产品数据分析的思路,这个思路可以这样展开:

      1、我为什么分析?即就是明白,我分析的目的是什么,是寻找付费用户下降的原因?还是注册用户减少的原因?

      2、我分析想要达到什么效果?是通过分析付费用户,找到问题,解决问题从而提升收入?

      3、我该分析哪些数据才能达到这个效果?即需要什么数据才能达到分析的目的;

      4、我又该如何采集这些数据?是直接通过第三方数据分析工具或者我们自己开发的工具就可获得?还是说要从数据库调取再交给程序猿哥哥?

      5、我该如何整理这些数据?即我们常说的数据可视化,这样可以便于我们进行分析;

      6、如何分析?即通过分析,找出问题的所在,给出你的结论;

      7、怎么解决问题?给出你的解决方案;

  • ?

    一枚优秀的产品经理是如何做ROI数据分析呢?

    蔡依云

    展开

    产品运营三大核心指标:拉新、活跃、留存。相信每一个小伙伴都不陌生。

    不同的产品阶段可能运营策略重心会有所不同,但肯定对于各种拉新活动并不陌生,例如H5活动、广告投放、软文扩散、渠道换量等。

    每一轮的投放活动都需要衡量投入产出比ROI,每一次活动结束都需要进行复盘讨论,每一轮迭代投放都可能在验证一些猜想。

    我们的目标是:用合理的投入成本,通过各类途径优化,最大化效果产出。

    但实际的运营投放中,往往会遇到各式各样的投放方式:

    这个渠道说,我们不能实现不了直接跳转下载;

    那个渠道又说,我们是做品牌的,高曝光才是我们的优势,转化不关我事;

    还有的时候,一个渠道上,就有3个不同的位置x3种素材x3种跳转方式,跳转应用市场之后到底下载了木有,打开APP了木有,效果怎么衡量,头有点晕……

    但其实,我们关心的是以下几个方向:合理投入、优化路径、最大化产出。简而言之,我们关心的是:投入产出比。

    (在不同的渠道进行拉新)

    如何找到最大化的投入产出比,这是每一个负责拉新业务的小伙伴都曾经或者正在头疼的事情。

    从上图的流程上看,我们可以优化的就是几个环节:产品是否吸引人、渠道是否优质、投放的方式是否高效、效果是否符合预期。

    这里暂时不讨论产品定位,我们只讨论丰富多彩的渠道投放的效果优化。

    我有100种投放姿势,就问你敢不敢试~

    这里,我们虽然是以APP拉新为例,讨论的是一种多渠道效果数据分析体系,但其实适用于每一个就算不是APP产品,或者你的拉新不是以增加APP用户为核心,都可以复用这套数据分析框架。

    设定预期目标

    首先,对于任何一次投放活动,我们都必须界定它的目标产出。只有在清晰的效果衡量体系下,渠道数据的对比才有意义,多渠道的ROI才有可比性。

    对于APP拉新的投放活动来说,常见的预期效果可能是:

    提高对APP的认知(以传播广泛为目的)

    成为APP用户(APP下载并激活)

    在APP内完成特定行为(如购买、身份验证或者领取礼包)

    我们以常见的拉新——“APP下载并激活”为例,先搭建一个数据漏斗,看看我们效果环节上需要观察哪些数据。

    如果我们希望监控的是上述内容中③的效果数据,我们就在激活之后继续添加下一层级的漏斗,统计例如加入购物车、确认下单、付款这样的流程。

    在这样的漏斗流程之上,我们可以搭建监控指标,有时候监控的数据可能无法实现理想的统计指标,我们可能会需要补充其他监控指标,有时候也无需如此精确的数据粒度。

    我们最后监控的数据指标如下(表1):

    而效果数据部分,则可以通过MTA的新增报表——安装来源分析实现。

    为什么这里增加了“下载所用网络占比”?

    原因是在下载完成到安装,这两个事件属于APP应用市场的原生事件,开发者无法主动采集,但我们依然关心这其中的转化步骤,主要是担心用户如果处于较差网络环境下,下载行为可能会被终止,因此这里用了“所用网络占比”这样的辅助字段数据。

    这里的辅助字段数据主要是为了优化转化效果所做的准备。确定了目标,我们第二步就可以做投放过程的数据记录了。

    投放过程记录

    做这一部分的数据记录,主要的目的,一是为了复盘的时候方便做分析对比,二是为了优化迭代的时候更有方向。

    根据埃里克·莱斯的《精益创业》中的观点:每一次的实验迭代,其实都是为了得到一个经证实的认知。

    应用在推广投放体系下,每一次投放策略的设计,都是为了验证一个投放策略的有效性,是为了提升效果产出。

    这个环节是一个多路分支,我们需要做一些版本记录,以便更好的定位问题。过程图大致如下:

    记录过程表2为:

    (表2 广告投放策略记录)

    *根据投放方式的不同,可能记录的方式也会略有不同

    **具体的策略信息可以在详表中展开记录

    然后把表1的效果数据映射在表2之后,得到一条投放活动的完整记录。然后就可以通过数据来验证具体的投放策略的有效性了。

    验证目标是怎样的投放策略,这一点需要在投放开始前就规划好,这样数据分析的时候才能得到有效的结论。

    分析与优化效果

    对于搜集到的众多详细数据,我们接下来就可以做一些数据上的结果分析了。

    首先,我们可能想验证的是投放素材对渠道1的banner-1的影响,那么,我们把表2中渠道1单独拿出来,可以得到如下表格:

    (表3.投放素材对渠道1的banner-1的影响)

    如果我们想比较渠道1上Banner和Feeds流的差别,我们可以得到:

    我们也可以针对人群定向投放效果、不同的投放时间,乃至渠道效果质量对比等多个维度进行数据分析,通过数据来验证我们的策略,优化投入产出比。

    所以,虽然说投放的姿势有千千万,但效果路径总是相似的。

    如果你有丰富多彩的投放策略,不用急,不要慌,把路径理出来,控制策略的版本,采用A/B TEST等加快验证迭代速度,最终得到有效的投放策略与最大化的ROI效果。

    以上是关于投放效果上的数据指标体系分享,相似的分析思路可以复用在不同需求的投放方案中,包括一些线上、线下的运营活动,其实也可以复用这个框架。

    来源:pm28

数据分析产品

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP