中企动力 > 商学院 > 数据分析吧
  • ?

    如何分析淘宝宝贝的数据?主要从哪些方面入手

    盛开的

    展开

    在淘宝开店了以后,想要运营好店铺,是少不了数据分析的,淘宝店铺在进行店铺数据分析的时候,会使用到淘宝大数据分析平台,因为这些平台可以准确的帮您分析出数据,我们来看看淘宝怎么看商品的数据分析吧。

    分析平台有以下4种:

    1、生意参谋专业版:可以了解所属类目什么宝贝最好卖,了解热卖店铺和热销宝贝,关键词成交分析,宝贝取名等。

    2、淘问卷:操作界面简单明了,有问题模板,帮助店主进行营销决策。

    3、生意参谋市场行情:查询热卖宝贝行情,比较同类宝贝的价格和销量。

    4、生意参谋店铺统计:店铺流量统计分析,店铺计数器等增值服务。

    主要分析哪些方面:

    总体来说可以分为商品分析、客户分析、地区分析、时间分析四大维度(参考数据雷达的分析思路)。在这里我重点说商品分析。

    1、销售状况分析:主要分析本月销售情况、本月销售指标完成情况、与去年(或上月)同期对比情况。通过这组数据的分析可以知道同比销售趋势、实际销售与计划的差距。

    2、销售毛利分析:主要分析本月毛利率、毛利额情况,与去年同期对比情况。通过这组数据的分析可以知道同比毛利状况,以及是否在商品毛利方面存在不足。

    3、营运可控费用分析:营运可控费用分析就是指的每个月每个项目的费用明细分析,还会和去年的项目进行对比,这里的各项费用是指:员工成本、能耗、物料及办公用品费用、维修费用、存货损耗、日常营运费用(包括电话费、交通费、垃圾费等)。

    4、橱窗效率:主要是本月橱窗效率情况、与去年同期对比。“日均橱窗效率”是指“日均每个橱窗平均销售额”,即:日均橱窗商品销售金额/橱窗个数。

    感谢大家的耐心观看,在以上的内容中,小编为大家介绍了4种淘宝大数据分析平台,这四种平台一般都是最常用的,大家可以去试试看。

  • ?

    数据分析师在工作中,会遇到什么难题?

    芷卉

    展开

    数据分析师在工作中会遇到什么难题?

    数据分析师,一个名字听起来高大上的职业,其实苦逼程度不亚于代码人员。那么,数据分析师在工作中经常会遇到什么样子的难题呢?

    1)数据质量差

    作为舆情数据分析师,有时需要向技术提取需求,对符合某个关键词的全网舆情进行爬取。满怀希望地把需求提了出去,但有时数据质量并不如你想的那么完美。譬如。你想分析的是全网渠道分布,但是因为某些原因,最终得到的数据并不符合传统的认知。也就是说,这个维度而言,数据是废的。

    这个时候怎么办呢?编么?并不是,这时候你可能就需要重新思考为什么会造成这样的问题,如果说问题没有办法找出的话,那只能找其他维度进行分析,或者找其他数据进行印证分析。

    当然,数据质量差并不这么简单,有时数据缺失很严重,有时数据某个维度有歧义等。而这个时候,就需要你一遍又一遍的进行数据清洗。

    2)数据需求多变

    数据分析师有时接到的需求并不是一成不变的,可能在你分析的过程中,数据需求就会发生变化。好的情况,你可能仅需要修改一点点就可以满足需求。但是更多的是,推到重来,这就相当于浪费了你之前的工作量了。

    3)数据得不到有价值的信息

    更让人绝望的其实是你分析了多种维度,交叉了各种情况。但,最后发现,得到的结论并不能支撑某些结论,更甚者,还会阻碍你的结论。例如有一次,我想分析SEO的价值比SEM的价值高,但是试过多种维度之后,我惊异的发现SEM的价值反而更高,我当时的内心就是一万只***崩腾而过。

    最容易碰到的问题就是自己分析的数据不准确,导致辛苦了半天,分析出来的结果不具备参考价值,甚至都是错误的。

  • ?

    自媒体图文数据分析功能哪家强,百家一点企鹅

    惠访文

    展开

    当下的自媒体已经逐渐的深入到人们的日常资讯阅读当中,成为重头戏。

    由于小编只会写一些图文类文章,我们就来看看这些自媒体门户的数据分析功能吧,到底谁最强大?

    基本上:工具栏和收益栏,功能都差不多,

    唯一区别较大的就是分析栏,上图是百度百家号的分析栏,如图。

    我们先对比BAT今日头条等四大家自媒体的后台主版面,如下:

    一眼看去,百家号最简单,大鱼号内容最多,而企鹅号介于两者之间,而今日头条不叫简单,是最简洁,栏目之间是并列的。

    至于,搜狐号,一点号,网易云阅读,等的后台都和上面的风格版面接近。

    第一,先对比BATT四大家图文自媒体的指数分析,百家号,大鱼号,今日头条,是一样的模式,五个维度加上各维度趋势图,如下:

    而腾讯的企鹅号,是采用自己的计分方式,如下:

    仔细一看,也是采用五维度计分方式,只不过有点想制定自己的标准的感觉。

    第二,关于内容分析,大体的分析类别,分单篇数据,和整体综合数据,

    第三,是最关键的,也是最有意思的,就是关于粉丝画像,这个真的很有趣。

    今日头条,由于叠加了悟空问答,微头条,感觉粉丝的画像有些混乱,也许后台有数据,但是呈现的通道不明确,也不够直观。

    大鱼号的粉丝画像,实时性不够好,滞后。版面还算直观清晰,如下:

    企鹅号的用户分析版面做的还不错,如下:

    接着说下一点号的,粉丝画像版面清晰,有自己的特色,如下:

    至于搜狐号的自媒体,才算刚刚起步吧,需要逐步完善,就不详细说了。

    现在接着来说说百家号,如下:

    基础数据版面,还算直观,看不出特色,但是粉丝画像就非常强大了,和一点号,企鹅号,有得一拼,看来百度的数据分析能力真不是盖的,根基还是有的。

    连台湾地区的具体数据,也清楚标出来。

  • ?

    什么样的人比较适合做数据分析?

    雪柳

    展开

    我觉得无论什么工作兴趣最重要,要做数据分析师最基本的就是不讨厌数字,如果你跟他讲那个指标是通过怎么样的乘除加减得到的,他会觉得不耐烦,那么显然他不适合做数据分析;如果对数据较敏感,能够一眼发现异常值,数据分布情况,当然是最好的。

    再则就是逻辑性,可以让他试试爱因斯坦的那道经典的逻辑题,看看能否解出来,需要多久;逻辑思维对数据分析尤其重要,不然会被各种指标的定义规则、与业务的联系纠结死,逻辑思维好的人写SQL等数据处理脚本也会更加高效。

    接着是业务理解能力,最简单的就是让他定义下网站的目标是什么,哪些指标可以作为KPI,用户从进入网站到达成网站目标的整个过程是怎么实现转化的,能否画出业务流程图。(宏观层面,不要深入细节)

    如果偏技术则需要懂一些数据库结构和SQL,如果偏展现需要考验下对图表的掌控能力,什么时候用什么图表合适,甚至如何配色。

    最后就是细心、耐心和交流能力,做数据分析有时会很纠结,细心和耐心是必需的,好的交流能力可以让数据分析师更好地阐述清楚各类问题。

    这些都是比较基础的东西,也是短期难以培养起来的技能。至于另外业务相关的一些知识,可以通过培训获取,问一个未接触过你的网站业务的人一些业务知识其实有些不公平,其实如果具备上面几点,一旦熟悉网站和业务之后,一定会成为优秀的数据分析师。

    ——谷芬芬

    专业内的要求基本就是对数据的意识和一些技能的掌握。下面具体说说从一些非专业内要求的方面出发,有哪些方面能表现这个人更适合数据分析。

    首先是看到数据有兴奋感的人。有兴奋感说明你有兴趣,那说明很会有意愿把数据分析好。

    其次是愿意学习的人。你分析的内容永远不会一尘不变,即使你分析的主题是相对固定,但业务是变化的,你需要不断的学习业务,同不同人沟通,吸收别人的观点。所以分析师一定要报着学习的态度。

    然后是逻辑思维较强的人。数据分析师想要把你的分析好,一定要有结论思维。

    还有就是较强的表达与沟通能力。因为数据分析最终价值的实现,一般来说不会是分析师亲自去制定或者实施。所以你一定很有条理、逻辑清晰向别人表达,让业务方认识到你分析结果的价值,从而影响业务方去愿意使用你从数据中得到的观点。

    ——欧阳帅

    觉得还是应该先看清楚自己的未来的方向吧~

    我有不少朋友 非数学/计算机/统计学 专业毕业的朋友走的是这个方向,数据相关,非技术路线,更偏向于市场方向,对技术的要求只是Excel、PPT,最多要求SPSS,很少要求会写SQL。这条路线看起来比较高大上,可以走外企路线。

    数据分析师方向,很多读数学、统计学、计算机的童鞋会选这个方向,终极目标都是成为数据中心的负责人。中间有2个分叉,一条是从数据分析师到数据产品经理,这个路线最近很流行,主要是结合了数据分析和产品经理的能力。一条是高大上一点的数据挖掘方向,这条路线要求比较高,但薪资也高。当然能走数据挖掘路线是很多数据分析师的梦想,但算法和代码实现能力不是谁都能掌握的。.

    根据你自己想走的路,加上自己的技能点。

    ——张锦华

    想了解更多相关内容,记得持续关注我们哦。

    如果你觉得有点意思,请有秩序的评论、转发、收藏。

  • ?

    你所知道的数据分析真的有用?

    施夜柳

    展开

    市面上所有一切讲大数据的书,或者个人,都是垃圾

    因为这些假大空的数据除了让你看看之外无任何用处,营销实战中真正的数据分析应该有什么标准呢?符合以下两条:一可落地执行、二能产生收益。

    因为研究与赚钱无关的「大」数据,一不能指导你的营销、销售、策划、执行中的实战,二不能为你所做的事情带来收益;这跟看着苍老师的电影撸了一发有什么区别;你懂了天文地理钱就会从天上掉下来?从地理钻出来?懂历史难不成还去挖祖坟么?

    知道国家数据党和政府不会分一毛给你,知道国际数据联合国都不带看你一眼、知道行业数据同样被竞争对手打得找不着北。

    所以关注大数据的分四类人:

    1、五百强企业决策层,

    2、写毕业论文的大学生,

    3、写商业计划的骗投资者,

    4、傻逼;

    大数据代表性来源分一下几个部分:

    一、国家层面的数据:

    data.stats.gov

    tjcn.orgceicdata/zh-hans 二、行业数据:

    soshoo、

    iresearch  analysys、

    re.qq

    199it 

    告诉你以上这些,为了让你拉黑他,忘掉吧,我们来看一下务实有用,接地气的数据分析:能带你做正确的事情赚到钱的营销相关性数据和竞争比较性数据。

    什么是营销相关性数据?与市场、受众、产品、价格、渠道、宣传、顾客相关的数据。

    什么是竞争比较性数据?和品类比,和对手比,和自己历史比较的数据。

    OK,那么今天先上一道小菜,从分析市场数据说起

    如何分析市场数据,市场数据分区域热点数据、品类热点数据、潜在机会品类数据、市场缝隙数据

    1、分析区域热点数据

    用阿里指数-区域指数-搜索词排行-涨幅榜(网址:alizs.taobao/area),

    查看各省有哪些涨幅迅猛的搜索词

    然后用百度指数和微指数判断转播效果以及是否值得往下拆解,用微博可视化分析工具查看传播节点,用新榜、蓝标公众号榜单(http://blueview.cc/user/toRegister.do?type=oSohw0qBVAn1VQ5aZ6nPmw长按复制打开)、搜狗微信搜索查询微信传播。

    为什么要进行区域数据分析?因为有人气的地方一定有钱赚

    2、分析品类热点

    还是用阿里指数-行业指数-搜索词排行-涨幅榜(网址:https://alizs.taobao/industry),

    查看自己品类有哪些涨幅迅猛的搜索词,并用百度指数和微指数判断转播效果以及是否值得往下拆解,用微博可视化分析工具查看传播节点,用新榜、蓝标公众号榜单(http://blueview.cc/user/toRegister.do?type=oSohw0qBVAn1VQ5aZ6nPmw长按复制打开)、搜狗微信搜索查询微信传播,拆解其增长原因,及我们如何借鉴。

    总之,有行业人气的地方,一定有钱赚。

     3、分析机会品类

    分析品类机会可通过以下五项指标长期监测分析

    五项指标是:

    1、小类目占大类目比(数据魔方)(淘宝生意参谋)

    2、小类目的最近一年增幅(数据魔方)(淘宝生意参谋)

    3、小类目的人群基数(淘宝生意参谋、阿里指数、淘宝指数)

    4、淘内搜索人群重合度(淘宝指数)(生意参谋)

    5、每年的需求高峰(百度指数)不过没前四项没啥卵用

    每周导出生意参谋子行业交易排行榜,对比各细分品类的支付金额占比、与上一周期的比、买家数占比,并长期监测。

    4、分析市场缝隙

    庞大市场处处红海,你得学会用数据分析的方法找到一条缝让自己钻进去,一为遮羞,二为机会;所以,重磅工具来了,如今市面上的工具适用于定位理论的无非两大工具,一是淘宝生意参谋搜索词分析,一是百度关键词规划师;

    所以用淘宝生意参谋-搜索词查询,分析品类相关关键词的搜索人气与在线商品数,搜索人气高需求越多,在线商品数少对手越少。

    打开淘宝生意参谋-关键词查询(网址:https://mq.sycm.taobao/words/search_words.htm),然后:

    1、搜索品类关键词

    2、导出并分类品类数据 关键是采集完数据分类的过程 比如:

    导出女鞋百度关键词规划师数据,并进行清洗、分析、提取,得到以下表:

    进行统计分析得到下表:

    从而得出如下结论:

     

    以上,为数据分析分析市场数据,抛砖引玉部分,深藏功与名,你可以用淘宝生意参谋,提取客户数据,然后分析,来与我讨论。下一篇更新不知道是什么时候,会写完写尽如何分析受众心智数据!

    静待下次更新!

  • ?

    数据分析全流程(内附案例)

    龚以寒

    展开

    (图片来源于网络)

    作者:苏格兰折耳喵

    来源: 运营喵是怎样炼成的 (yymzylc)

    (温馨提示:图片显示毛糙和不清楚,是分辨率过高的缘故,点击图片,即可看到高清大图。 )

    本文将对一个案例进行从数据采集、数据清洗、数据分析再到数据可视化的全流程分析,力求条理清晰的展现外部数据分析的强大威力。以下是本文的写作框架:

    1 分析背景

    1.1 分析原理---为什么选择分析虎嗅网

    在现今数据爆炸、信息质量良莠不齐的互联网时代,我们无时无刻不身处在互联网社会化媒体的“信息洪流”之中,因而无可避免的被它上面泛滥的信息所“裹挟”,也就是说,社会化媒体上的信息对现实世界中的每个人都有重大影响,社会化媒体是我们间接了解现实客观世界和主观世界的一面窗户,我们每时每刻都在受到它的影响。

    综合上述两类情形,可以得出这样的结论,透过社会化媒体,我们可以观察现实世界:

    由此, 社会化媒体是现实主客观世界的一面镜子,而它也会进一步影响人们的行为,如果我们对该领域中的优质媒体所发布的信息进行分析,除了可以了解该领域的发展进程和现状,还可以对该领域的人群行为进行一定程度的预判。

    鉴于此种情况,作为互联网从业者的笔者想分析一下互联网行业的一些现状,于是想到了虎嗅网。

    虎嗅网创办于2012年5月,是一个聚合优质创新信息与人群的新媒体平台。该平台专注于贡献原创、深度、犀利优质的商业资讯,围绕创新创业的观点进行剖析与交流。虎嗅网 的核心,是关注互联网及传统产业的融合、一系列明星公司(包括公众公司与创业型企业)的起落轨迹、产业潮汐的动力与趋势。

    因此,对该平台上的发布内容进行分析,对于研究互联网的发展进程和现状有一定的实际价值。

    1.2 本文的分析目的

    笔者在本项目中的分析目的主要有4个:

    (1)对虎嗅网内容运营方面的若干分析,主要是对发文量、收藏量、评论量等方面的描述性分析;

    (2)通过文本分析,对互联网行业的一些人、企业和细分领域进行趣味性的分析;

    (3)展现文本挖掘在数据分析领域的实用价值;

    (4)将杂芜无序的结构化数据和非结构化数据进行可视化,展现数据之美。

    1.3 分析方法---分析工具和分析类型

    本文中,笔者使用的数据分析工具如下:

    Python3.5.2(编程语言)

    Gensim(词向量、主题模型)

    Scikit-Learn(聚类和分类)

    Keras(深度学习框架)

    Tensorflow(深度学习框架)

    Jieba(分词和关键词提取)

    Excel(可视化)

    Seaborn(可视化)

    新浪微舆情(情绪语义分析)

    Bokeh(可视化)

    Gephi(网络可视化)

    Plotly(可视化)

    使用上述数据分析工具,笔者将进行2类数据分析:第一类是较为传统的、针对数值型数据的描述下统计分析,如阅读量、收藏量等在时间维度上的分布;另一类是本文的重头戏---深层次的文本挖掘,包括关键词提取、文章内容LDA主题模型分析、词向量/关联词分析、DTM模型、ATM模型、词汇分散图和词聚类分析。

    2 数据采集和文本预处理

    2.1 数据采集

    笔者使用爬虫采集了来自虎嗅网主页的文章(并不是全部的文章,但展示在主页的信息是主编精挑细选的,很具代表性),数据采集的时间区间为2012.05~2017.11,共计41,121篇。采集的字段为文章标题、发布时间、收藏量、评论量、正文内容、作者名称、作者自我简介、作者发文量,然后笔者人工提取4个特征,主要是 时间特征 (时点和周几)和 内容长度特征 (标题字数和文章字数),最终得到的数据如下图所示:

    2.2 数据预处理

    数据分析/挖掘领域有一条金科玉律:“Garbage in, Garbage out”,做好数据预处理,对于取得理想的分析结果来说是至关重要的。本文的数据规整主要是对文本数据进行清洗,处理的条目如下:

    (1) 文本分词

    要进行文本挖掘,分词是最为关键的一步,它直接影响后续的分析结果。笔者使用jieba来对文本进行分词处理,它有3类分词模式,即全模式、精确模式、搜索引擎模式:

    · 精确模式:试图将句子最精确地切开,适合文本分析;

    · 全模式:把句子中所有的可以成词的词语都扫描出来, 速度非常快,但是不能解决歧义;

    · 搜索引擎模式:在精确模式的基础上,对长词再次切分,提高召回率,适合用于搜索引擎分词。

    现以“新浪微舆情专注于社会化大数据的场景化应用”为例,3种分词模式的结果如下:

    【全模式】: 新浪/ 微舆情/ 新浪微舆情/ 专注/于/ 社会化/ 大数据/ 社会化大数据/ 的/ 场景化/ 应用

    【精确模式】: 新浪微舆情/ 专注/于/ 社会化大数据/ 的/ 场景化/ 应用

    【搜索引擎模式】:新浪,微舆情,新浪微舆情,专注,于,社会化,大数据,社会化大数据,的,场景化,应用

    为了避免歧义和切出符合预期效果的词汇,笔者采取的是精确(分词)模式。

    (2) 去停用词

    这里的去停用词包括以下三类:

    标点符号:, 。! /、*+-

    特殊符号:▲等

    无意义的虚词: “the”、“a”、“an”、“that”、“你”、“我”、“他们”、“想要”、“打开”、“可以”等

    (3) 去掉高频词、稀有词和计算Bigrams

    去掉高频词、稀有词是针对后续的主题模型(LDA、ATM)时使用的,主要是为了排除对区隔主题意义不大的词汇,最终得到类似于停用词的效果。

    Bigrams是为了自动探测出文本中的新词,基于词汇之间的共现关系---如果两个词经常一起毗邻出现,那么这两个词可以结合成一个新词,比如“数据”、“产品经理”经常一起出现在不同的段落里,那么,“数据_产品经理”则是二者合成出来的新词,只不过二者之间包含着下划线。

    3 描述性分析

    该部分中,笔者主要对数值型数据进行描述性的统计分析,它属于较为常规的数据分析,能揭示出一些问题,做到知其然。

    3.1 发文数量、评论量和收藏量的变化走势

    从下图可以看出,在2012.05~2017.11期间,以季度为单位,主页的发文数量起伏波动不大,在均值1800上下波动,进入2016年后,发文数量有明显提升。

    此外,一头(2012年第二季)一尾(2017年第四季)因为没有统计完全,所以发文数量较小。

    下图则是该时间段内收藏量和评论量的变化情况,评论量的变化不愠不火,起伏不大,但收藏量一直在攀升中,尤其是在2017年的第二季达到峰值。收藏量在一定程度上反映了文章的干货程度和价值性,读者认为有价值的文章才会去保留和收藏,反复阅读,含英咀华,这说明虎嗅的文章质量在不断提高,或读者的数量在增长。

    3.2 发文时间规律分析

    笔者从时间维度里提取出“周”和“时段”的信息,也就是开题提到的“人工特征”的提取,现在做文章分布数量的在“周”和“时”上的交叉分析,得到下图:

    上图是一个热力图,色块颜色上的由暖到冷表征数值的由大变小。很明显的可以看到,中间有一个颜色很明显的区域,即由“6时~19时”和“周一~周五”围成的矩形,也就是说,发文时间主要集中在工作日的白天。另外,周一到周五期间,6时~7时这个时间段是发文的高峰,说明虎嗅的内容运营人员倾向于在工作日的清晨发布文章,这也符合它的人群定位---TMT领域从业、创业者、投资人,他们中的许多人有晨读的习惯,喜欢在赶地铁、坐公交的过程中阅读虎嗅讯息。发文高峰还有9时-11时这个高峰,是为了提前应对读者午休时间的阅读,还有17时~18时,提前应对读者下班时间的阅读。

    3.3 相关性分析

    笔者一直很好奇,文章的评论量、收藏量和标题字数、文章字数是否存在统计学意义上的相关性关系。基于此,笔者绘制出能反映上述变量关系的两张图。

    首先,笔者做出了标题字数、文章字数和评论量之间的 气泡图 (圆形的气泡被六角星替代,但本质上还是气泡图)。

    上图中,横轴是文章字数,纵轴是标题字数,评论数大小由六角星的大小和颜色所反映,颜色越暖,数值越大,五角星越大,数值越大。从这张图可以看出,文章评论量较大的文章,绝大部分分布于由文章字数6000字、标题字数20字所构成的区域内。虎嗅网上的商业资讯文章大都具有原创、深度的特点,文章篇幅中长,意味着能把事情背后的来龙去脉论述清楚,而且标题要能够吸引人,引发读者的大量阅读,合适长度标题和正文篇幅才能做到这一点。

    接下来,笔者将收藏量、评论量和标题字数、文章字数绘制成一张3D立体图,X轴和Y轴分别为标题字数和正文字数,Z轴为收藏量和评论量所构成的 平面 ,通过旋转这个3维的Surface图,我们可以发现收藏量、评论量和标题字数、文章字数之间的相关关系。

    注意,上图的数值表示和前面几张图一样,颜色上的由暖到冷表示数值的由大到小,通过旋转各维度的截面,可以看到在正文字数5000字以内、标题字数15字左右的收藏量和评论量形成的截面出现“华山式”陡峰,因而这里的收藏量和评论量最大。

    3.4 城市提及分析

    在这里,笔者通过构建一个包含全国1~5线城市的词表,提取出经过预处理后的文本中的城市名称,根据提及频次的大小,绘制出 一张反映城市提及频次的地理分布地图 , 进而间接地了解各个城市互联网的发展状况(一般城市的提及跟互联网产业、产品和职位信息挂钩,能在一定程度上反映该城市互联网行业的发展态势)。

    上图反映的结果比较符合常识,北上深广杭这些一线城市的提及次数最多,它们是互联网行业发展的重镇。值得注意的是,长三角地区的大块区域(长江三角洲城市群,它包含 上海 , 江苏省 的 南京 、 无锡 、 常州 、 苏州 、 南通 、 盐城 、 扬州 、 镇江 、 泰州 , 浙江省 的 杭州 、 宁波 、 嘉兴 、 湖州 、 绍兴 、 金华 、 舟山 、 台州 , 安徽省 的 合肥 、 芜湖 、 马鞍山 、 铜陵 、 安庆 、 滁州 、 池州 、 宣城 )呈现出较高的热度值,直接说明这些城市在虎嗅网各类资讯文章中的提及次数较多,结合国家政策和地区因素,可以这样理解地图中反映的这个事实:

    长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。

    长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。

    接下来,笔者将抽取文本中城市之间的 共现关系 ,也就是城市之间两两同时出现的频率,在一定程度上反映出城市间经济、文化、政策等方面的相关关系,共现频次越高,说明二者之间的联系紧密程度越高,抽取出的结果如下表所示:

    将上述结果绘制成如下动态的流向图:

    由于虎嗅网上的文章大多涉及创业、政策、商业方面的内容,因而这种城市之间的共现关系反映出城际间在资源、人员或者行业方面的关联关系,本动态图中,主要反映的是北上广深杭(网络中的枢纽节点)之间的相互流动关系和这几个一线城市向中西部城市的单向流动情形。流动量大、交错密集的区域无疑是中国最发达的3个城市群和其他几个新兴的城市群:

    京津冀城市群

    长江三角洲城市群

    珠江三角洲城市群

    中原城市群

    成渝城市群

    长江中游城市群

    上面的数据分析是基于数值型数据的描述性分析,接下来,笔者将进行更为深入的文本挖掘。

    4 文本挖掘

    数据挖掘是从有结构的数据库中鉴别出有效的、新颖的、可能有用的并最终可理解的模式;而文本挖掘(在文本数据库也称为文本数据挖掘或者知识发现)是从大量非结构的数据中提炼出模式,也就是有用的信息或知识的半自动化过程。

    本文的文本挖掘部分主要涉及高频词统计/关键词提取/关键词云、文章标题聚类、文章内容聚类、文章内容LDA主题模型分析、词向量/关联词分析、ATM模型、词汇分散图和词聚类分析。

    4.1 关键词提取

    对于关键词提取,笔者没有采取词频统计的方法,因为词频统计的逻辑是:一个词在文章中出现的次数越多,则它就越重要。因而,笔者采用的是 TF-IDF (termfrequency–inverse document frequency)的关键词提取方法:

    它用以评估一字/词对于一个文件集或一个语料库中的其中一份文件的重要程度,字/词的重要性会随着它在文件中出现的次数成正比增加,但同时会随着它在语料库中出现的频率成反比下降。

    由此可见,在提取某段文本的关键信息时,关键词提取较词频统计更为可取,能提取出对某段文本具有重要意义的关键词。

    下面是笔者利用jieba在经预处理...

  • ?

    你真的懂什么是数据分析么?

    挂念

    展开

    你明白为什么要分析数据么?

    说实话,这个问题我自己思考过无数遍,也和很多同事聊过,目前我最认同的还是前老板一句总结:数据是用来反馈经营现实,并帮助管理者指导经营的。

    话说出来很简单,但要时刻用这个标准来衡量我们做的数据分析是否有意义却是一个不容易的事儿。很多情况是调取了一堆数据,做各种环比、同比,各种横向、纵向比较,各种占比等等,每个指标你还都能准确找出他们代表的经营现实么?

    如果你发现你只能分析出最简单、最基本的数据变化原因的话,那我觉得你应该去实际业务中去看一看、聊一聊、做一做了,数据分析工作绝不是仅在电脑前就能完成的!

    当你真的了解业务后,你会发现你具备一种很重要的能力:你可以很轻松的判断一个数据是否可靠!是的,你没听错,即使这个数据在别人看来是多么正常,即使这个数据是SQL跑出来的,你可以1秒钟就告诉领导,这个数据并不准确,我们还是重新核实一下吧!

    用数据分析业务,用业务衡量数据!

    BY BoraBora

    数据分析

  • ?

    成为一名数据分析师,必须掌握的技术,学会了你就是大神

    小李子

    展开

    一:编程能力

      是否会编程是区别初级数据分析师和高级数据分析师的分水岭。在这里,我定位的是高级数据分析师,所以编程能力尤为重要,我把它放在了第一位。

      有关数据分析的编程语言有Python和R语言。R语言倾向于统计分析、绘图等。统计学家或者学统计学的喜欢用R语言,而我推荐学习Python,因为Python是面向未来的语言,无论从流行度、可用性还是学习难度来讲,Python都是最好的入门语言。

      当然,如果可以的话,再掌握一下R语言是最好不过的,学习嘛,永无止尽。

      书籍推荐《Python编程:从入门到实践》 豆瓣评分:9.0

      当然,只有Python基础肯定是不够的,既然是学习数据分析,肯定就要有数据才行,数据从哪里来,肯定是从互联网上来。互联网上的信息何其之多,必须要对其加以过滤处理,提取我们想要的信息。这就要用到Python爬虫,这也是学Python一个很重要的目的和作用。

      学习Python爬虫肯定比学习Python基础要困难一下,但好在网上的学习资源十分丰富,努力学习必定会有收获的。

      关于Python爬虫的书籍,目前我还没有较好的书籍推荐,如果说实在要推荐的话,我推荐三本书:

      《Python网络数据采集》 豆瓣评分:7.7

      《Python爬虫开发与项目实战》 豆瓣评分:8.1

      《精通Scrapy网络爬虫》 这是十月份出的新书,豆瓣上还没有评分。

      知乎里面有很多爬虫大神,没事多逛逛知乎总会有收获的。

      关于编程能力,是一个很深的概念,需要靠大量的撸代码积累经验。先暂且说到这些。

    二:SQL

      学习数据分析,最难最重要的就是编程能力,熬过去了,后面的就稍微简单一些了。

      既然是跟数据打交道,就免不了要使用数据库。

      目前主要有四种数据库:

      1:SQLite 是一个文件型轻量级数据库,它的处理速度很快,在数据量不是很大的情况下,可以使用SQLite。

      2:MySQL 是一个应用极其广泛的关系型数据库,它是开源免费的,可以支持大型数据库,很多中小型企业都是用的MySQL。

      3:MongoDB 是一个面向文档的非关系型数据库,它功能强大、灵活、易于拓展。

      4:Redis 是一个使用ANSI C 编写的高性能key-value数据库,使用内存作为主存储器。

      它们各有优点,可以灵活使用,如果说非要选一个的话,我建议使用MySQL,因为它使用最广泛。学习最主流的技术,可以在一定程度上发挥更大的作用。

      关于SQL的学习资源:

      购买书籍推荐《SQL基础教程》作者:MICK

      豆瓣评分:9.0,好像这本书出了第二版了,建议购买最新版的。

    三:数据分析能力

      前面说了那么多,都是为了数据分析做准备。数据分析就好比亲手做一顿美食,现在食材有了(通过Python爬虫采集),盛放美食的容器也有了(数据库)。现在就差开火做饭了,写到这感觉肚子饿了,哎呀,忍住。

      对于数据分析,我还没有过多的涉足,总之,多看书,多做项目。

      这里我推荐几本书(都是放在我购物车里还没有买的书)

      学习数据分析必看的书单:

      《Python数据分析基础》八月份的新书,豆瓣上还没有评分。

      《利用Python进行数据分析》2013年的老书,豆瓣评分:8.5

      《Python数据处理》六月份的新书,豆瓣上没有评分。

      《用数据讲故事》 豆瓣评分:8.7

      虽然我还没来得及看这几本书,但是我想认真看了之后,对于数据分析的理解肯定会更加深刻的。

    四:数据可视化

      现在美食做好了,但不能一股脑的装在碗里吧,美食讲究色香味俱全。所以要给它作一个漂亮的造型,呈现在客人面前。这就是数据可视化。

      数据可视化需要借助工具,什么工具呢?那就是大名鼎鼎的tableau!

      什么?你没有听说过tableau?现在听我说了也不迟,哈哈。

      tableau是一款世界级的商业智能工具软件,tableau可以帮助我们快速的分析、可视化并分享信息。在福布斯2017年公布的《10大需求增长最快的职场技能》报告中,tableau高居第三,成为数据分析和可视化的职场必杀技。

      说了这么多,咱们还是好好聊聊怎么学习tableau吧。tableau是一款收费软件,先看一下它的价格吧:

      image

      果然优秀的软件都是收费的,而且还贵的要死。

      但是,tableau的良心之处在于:学生和教师可以免费使用tableau,只需要用我们的学生证信息去免费申请一个序列码,然后就可以下载激活该软件,有效期为1年,如果一年后还是学生的话,还可以用学生证再去申请一个序列号,然后再免费用一年。

  • ?

    作为数据分析师,鬼知道我经历了什么!

    王冠

    展开

    谨以此文献给所有数据从业苦逼之人,如有中伤之处,请自行戴好盔甲,以防中伤过深。同时也以此文献给后期对数据热情,想长期从事此行业的年轻人,希望对你们有所启发,并快速的调整思路和方向,以对自己的职业生涯有更好的发展。

    最近听到一些段子,很有意思,分享给大家!

    这些段子是很多数据分析人员的真实写照:

    新招进公司做大数据分析师,好开心好兴奋好激动!!!然而...

    入职第一天,老板给了我一张 50M 的 Excel 表说:

    “你看我们有 100多万条用户信息,这么大的数据,来个大数据分析下!”

    还没从震惊中恢复过来,业务部又神补一刀:

    “我们准备跟星巴克合作,来预测下明年多少人喝咖啡,几千万的大项目,预测不准公司要亏很多钱的,你加油哈!”

    面对这样的业务部,我只想说:“我要是未卜先知为啥不去炒股来给你打工”

    IT大哥贼兮兮的说:“哥们你可来了,那失散到天涯的数据有娘啦!”

    没法,最终还是把数据拼起来开始分析...

    发现好有规律啊~好工整啊~这...是不是有坑?!

    去业务部一问才知道,这些都是被经销商篡改操纵的数据...

    后来拿到了全真实的数据!全部没有规律了!喜极而泣!!

    擦干泪仔细一看,80%的记录缺失,10%记录不全,5%记录出错……

    整完数据开始统计,然而领导觉得只做加减乘除太简单了,有没有更深度的方法(解读:需要纠正的是,有用为先,花哨次之,这种说法不太合理)

    简单了就做个模型吧,然而检验值还没讲完领导表示太复杂搞不懂,能简单点不(解读:这个是解读能力的问题,跟领导没关系...没关系..没关系...)

    改来改去已很多遍了!我已不太记得领导唠叨了什么,总之又听到一句:“再改一下,看看其他维度深入分析分析”,然后默默新建一个文件:《分析报告V16-8版》

    输出结果和业务部的认知差不多,被评价为:

    “我们都知道了啊,这大数据做了跟没做一样啊”

    输出结果和业务部的认知差很多,被评价为:

    “这个与业务经验完全不同,肯定是数据的问题,我们都十多年经验了,快回去检查数据,上次我去见XXX客户人家就不是这样的!一定是你错了!一定!”

    此段子一出,群里都炸开了锅,大家都开始不断的煽风点火,各种数据背锅,各种吐槽,说尽了数据分析师的辛酸苦辣。

    我做数据分析师的时候也经常遇到上面这些遭遇,乃至后来找到了一些规避这些问题的方法,希望对大家有所帮助。

    同时,我也希望借此号召所有的数据从业者,在数据应用实践上能够深入思考并有所突破,在正确的轨道上更好的发挥出数据的价值,从而让数据从业者有更大的 ,不再拘泥于每天的抱怨和自怨自艾中。

    数据之苦

    进入正文,数据人之苦最苦的是:有好处想不到你,出了问题都是你的错

    这句话的意思就是你做好是应该的,做得不好就得承担责任。这种痛苦完全命中了马云蜀黍对离职的两点看法:

    心累(得不到价值肯定)、钱少(没业绩肯定哪来的升职加薪)

    区分数据流程的不同阶段,数据人之苦又有所区分侧重不同,说一下我的个人浅见。

    根据数据应用的不同阶段,我的划分方法如下,从数据底层到最后应用:

    大数据平台

    目前很火,数据源头,各种炫酷新技术,搭建 Hadoop、Hive、Spark、Kylin、Druid、Beam~,前提是你要懂 Java,很多平台都是用 Java 开发的。

    现在很多企业都把数据采集下来了。对于传统的业务,用传统的数据是完全够用的;可是对于用户行为和点击行为这些数据或者很多非结构化的数据,文本、图像和文本类的,由于数据量太大,很多公司都不知道怎么进行存储。

    这里面要解决的是实时、近实时和离线的大数据框架如何搭建,各数据流之间如何耦合和解耦,如何进行容灾、平台稳定、可用是需要重点考虑的。

    我的感觉是:最近两三年中,这块人才还是很稀缺的,因为大数据概念炒作的这么厉害,很多企业都被忽悠说,我们也来开始进入大数据行业吧。但是,进入的前提之一就是需要把数据存储下来,特别是很多用户行为方面的数据,对于业务的提升了比较明显的,如果你能很好的刻画用户,那么对你的产品设计、市场营销、开发市场都是有帮助的。

    现阶段,很多公司都要做第一步:存储更多的数据。这也就是我们这块人员流动性比较高,因为都被高薪挖走了。

    和传统的 SQL 不同的是,针对大数据量的非结构式数据,我们所想的就是:用最廉价的成本存储数据同时能够达到容灾、扩展性高、高性能、跨域,从目前来看有两个方向

    分布式已经被证明是个很好的一个方式。云端会是个很好的方向。不是每个公司都养得起这么多这么贵的大数据平台开发人员和运维人员 OPS,从事这个行业的我们要有很好的危机意识,及时贡献出自己的价值,积极主动的学习新技术、否则你就要被淘汰了。

    此外,花点钱把数据托管给云服务提供商对于创业公司或者一些传统的企业来说是个很好的思路,这样能够最快速地确定数据对你的价值是什么,而不用采购这么多的服务器、雇佣这么多的运维和网站开发人员。

    说了以上这些,主要是想给未来会从事这块的人或者想存储数据的公司一点方向。我自己不做这块,体会不深,大家看看就行。

    这块工作最被吐槽的一点就是:Hive 速度好慢,SQL 查询好慢,集群怎么又挂掉了,Hadoop 版本升级后,怎么数据跑出来不对了等等。

    因此,在这个领域内工作,需要有强大的

    攻坚能力。快速定位和解决 bug 的能力。因为有很多工具都是开源的。Java 开发能力。因为是开源的,所以会出现各种坑爹,甚至出现无法向下兼容的情况。

    如果想在这块做的很好,还需要有整个系统架构的设计能力、比较的强的抗压能力和解决问题的能力、资源收集的能力,可以打入开源社区,这样就可以随时 follow 最新的潮流和技术。

    数据仓库-ETL

    确实做仓库的人很辛苦,单单 Oncall 就会让人望而却步。有很多数据库工程师,晚上睡觉的时候经常被 Oncall 电话吵醒,因为数据流程出问题,需要第一时间去排查,是哪个数据源出问题,并且要立即解决,否则整个数据流程都会受到影响。

    如果数据流程受到了影响,你就可能会被大领导一言不合叫到办公室说:我要的数据怎么还没有准备好,我的业务报表今天怎么没有发出来。

    通过上面这个情景,我们可以知道:这是个很重要的岗位,因为数据流程很重要,决定了数据从源头杂乱无章的状况,通过 ETL 之后变成了整齐的数据,这些整齐一致性的数据可以让你很方便地把各业务的统计结果计算出来,并且能够统一口径。要不然就会变成有几个部门,就有几种统计结果,到时候 A 部门说业务增长了 5%,B 部门说业务涨了 10%,OMG,到底信谁?

    至少在以下几点上,我觉得数据仓库人员是应该要做好:

    数据字典的完整性,用的人都希望能够清晰的知道这个字段的逻辑是什么。字段要保持很好的一致性,不要同样一个字段在不同表里有不同的定义。核心流程的稳定性,不要让每天订单主表能够使用的时间很不稳定,有的时候很早,有的时候要中午才出来,如果不稳定就会导致使用数据的人对你很没有信心。仓库版本迭代不要过于频繁,要保持不同版本之间的兼容性。不要做好了仓库 1.0,很快就把原来的推倒重来,变成了 2.0。在数据仓库中需要考虑到延续性,主表的变动不要太频繁,否则使用的人会非常痛苦,好不容易才用习惯了 1.0 的表结构,没办法这么快进行切换。简单地说,要能向下兼容。在这点上,我是深有体会,之前出现过每来一个大领导都来换一次数据仓库的。保持各业务逻辑的统一性,不要出现同样的业务逻辑,同一个组别的人统计出来的结果不同。原因在于共同的逻辑没有落地成通用的东西,所以导致每个人写法不同。这点其实需要特别注意。

    针对以上,这个岗位的技能要求是:不要成为仅仅会写 SQL 的人,现在工具都很发达,如果你的技能很单一的话,那么可替代指数是非常高的,并且你自身也没有什么成就感。这里并不是说会写 SQL 的人很 low,只是说应该多学一些技能,否则你很危险。

    技能上,除了 SQL 熟练之外,还需要知道如何写 Transform,MapReduce,因为有很多业务逻辑用 SQL 实现起来非常复杂,但是如果你会其他脚本语言,那么就能给你提供便利,让你的效率提升很多。

    另外好的仓库人员需要写 Java 或者 Scala,通过写 UDTF 或者 UDAF 来提升你的效率是很有必要的。

    仓库人员应该要常常思考,如何进行架构设计是最合理的,你要考虑是否需要字段冗余、行存储还是列存储、字段如何扩展最有效,热数据和冷数据如何拆分等,所以需要有架构思维。

    数据仓库人员也应该常常考虑自动化和工具化方面的事情,需要很好的工具或者模块的抽象能力,动手实现自动化的工具来提高整个组织效能。针对经常碰到的数据倾斜问题,需要很快定位问题并进行优化。

    说完了数据存储这块,接下来是数据应用的几个关键职位,在此之前,我想说数据应用的一个最关键的前提是:数据质量、数据质量、数据质量!!在每次阐述你的观点、分析结论或者用算法的时候,都需要先检查,源头数据正确性,否则任何结论都是伪命题。

    数据可视化

    这是个很炫的工作,最好是能懂点前端,比如 js。

    数据可视化人员需要有很好的分析思维,不能为了炫技而忽视对业务的帮助程度。因为我对这个岗位客串的不多,所以没有特别深入的感悟,不过我觉得这个岗位需要有分析的能力,才能把可视化做好。

    另外一方面来说,做数据应用的人都应该懂点数据可视化,要知道观点表达的素材顺序是:图片>表格>文字,一个能够用图片来阐述的机会千万别用文字来描述,因为这样更易于让别人理解。要知道,给大领导讲解事情的时候,需要把大领导设想成是个“数据白痴”,这样才能把一件事情说的比较生动。

    4

    数据分析师

    现在对数据分析的需求是很大的,因为大家都想着说:数据有了,但是能做些什么呢?这就需要有数据分析师, 。

    对数据分析师吐槽最多的是:你分析出来的不就是正常的业务逻辑吗,还需要你分析什么?或者是你分析的结论不对,跟我们的业务逻辑不符合。

    特别是 ABTest 的结果和当初设定的预期不相符合的时候,分析师会常常被拉过去说:分析一下,为什么我的 AB 实验结果不显著,里面肯定有原因的。

    很多时候,宝宝的心里苦啊,你说这个转化率下降了,从数据上可以看出哪个细分渠道下降了,至于为什么客户不下单,我们得问用户去,很多时候,数据上也体现不出来为什么,只能告诉你现状是什么。

    如果你一直在写分析报告,给结论中,持续周而复始,没有直接在业务中体现成绩的时候,数据分析师们该醒醒了,你该想想这个是你要的岗位吗?

    对于数据分析师的定位:个人认为,成为优秀的数据分析师是非常难的,现在市面上也没有多少优秀的分析师。

    我个人对数据分析师的技能要求除了会数据分析、提炼结论、洞察数据背后的原因之外,还需要了解业务,懂算法。只有这样,当面对一个业务问题时,数据分析师们才可以针对问题抽丝剥茧,层层递进去解决问题,再根据定位的问题进行策略的应对,比如是先做上策略进行测试还是应用算法进行优化,用算法用在哪个场景上,能不能用算法来解决问题。

    一个优秀的数据分析师,是个精通业务和算法的全能数据科学家,不是那个只会听从业务的需求而进行拉数据、做报表、只做分析的闲杂人等。

    我们都说分析要给出结论,优秀分析师的结论就是一个能解决问题的一揽子策略和应对措施,同时很多需求是分析师去主动发现并通过数据来挖掘出来的。

    从上述描述中,可以看到对数据分析师的要求是:

    会写sql拉数据精通业务会数据洞察精通算法主动性强

    如果你一直只是忙于应付日常分析需求,热衷于写华丽的报告,那么你要记得,你很危险,因为会有一堆人在那里质疑你存在的价值,特别是小公司。因为数据人员的薪资是个不小的支出。

    大部分不落地的分析都是伪分析,有一些探索性的可行性研究可以不考虑落地,但是其他的特定业务需求的分析都需要考虑落地,然后通过实践来反推你的作用,如此反复,才能慢慢的给你价值的肯定,同时提升你的分析技能,也只有这样才能证明你作为分析师、数据落地者的价值。

    数据挖掘/算法

    这块的话,经过这三年的摸爬滚打,感触蛮多的。体会比较深的吐槽主要有以下几点:

    一个规则搞定了,还用什么算法。你的准确率怎么这么低?!你的准确率可以到 99% 吗?你的推荐有价值吗?你不推荐客人也会下那个产品的订单的。帮我做个大数据预测他想要什么?

    很多时候,不同的场景对准确率的要求是不同的,所以在一定合理的场景下和业务进行据理力争是必要,不要害怕让业务吐槽,更多的时候管理...

  • ?

    数据分析的魅力和坑

    梦魇

    展开

    前言

    说实话,数据分析是人人都会的,只是没有把它提升到是一个分析的过程,在每个人的脑子里都有不同的思考的方式。所以今天讲“数据分析的魅力和坑”可能只是在各位原有的一些思维层面上,有一些不太注意的地方会变成坑,然后导致一些不太好的结果。今天主要把我遇到的坑和大家分享,以后在遇到同样的情况下,也可以避开那些坑的情况。我们先思考一个简单的逻辑题,让我们的思维更快速一点。

    珠宝店被盗,警察问了4名嫌疑人,甲说“不是我做的”,乙说“是丁做的”,丙说“丁没有偷”,丁说“肯定是乙偷的,”4个人里一个人说一句话,谁偷的?

    “甲偷的”。为什么是甲偷的?因为这里面有两个人说话是矛盾的,一个是“丁偷的,”一个是“丁没有偷”,两个里面肯定有一个是真的,因为只有一个人说真话,其他两个都是假话,所以甲说“不是我做的,”那就是他做的,就是这样。因为四个人里只有一个人说了真话,有两个人说了相反的一句话,那么其中有一个人肯定是真,有一个人肯定是假的。我不问这两个人谁说的真,谁说的假,另外两个人说的肯定是假,所以是甲做的。这就是逻辑上的关于矛盾的点,一定要关注。其实数据分析也是这样,当你看数的时候,首先看到的有矛盾的数。应该是甲大乙就大,但是现在甲大,乙小了,这两个之间出现了矛盾,就要去关注它。

    下面,我们接着来说数据分析到底能做些什么。

    第一、数据分析来源于生活,每个人在生活中都在解决数据分析的问题。

    第二、数据在很多地方呈现的时候都会误导你,误导你的时候是基于什么?你自己如果有一定的准备你就会知道。

    第三、职场发展的需要。

    第一章:数据分析的作用——解决生活问题

    大家先思考两个问题(如图一)。这两个问题相当经典,也是在数字思考中会出现的问题。只是说遇到的事不一样,但是思维方式是一样的。关于这两个问题,当时我们老师在学校里上课的时候给了我们五分钟的时间思考,当时最快完全答对只有学财务的同学。

    (图一)

    第一道题目,27元是三个人出的,服务员是他进的(账),所以这是两个东西。进(账)的还有谁?老板。所以出的是27元三个人,进账的是老板的25以及服务员2块,所以没有那个1块钱。

    第二道题目,出的是他的50块,为什么只有50块?因为这50块是为了完成这一单交易,所以他所有的出就是这个50块。但是他有入的,就是这一笔生意所赚的利润,这个利润是4块,所以就是46,因为他打了八折。

    当时我们很受启发的原因在于,可能我们把很多东西都想得复杂。但是分析的过程应该是把复杂的东西简单化,尽可能地用一到两个概念来解决它。所以我们说通过这些生活中的故事或者说发生这些大家经常讨论的东西,我们会得到三个点:

    第一,聚焦在矛盾的地方上。如果两个数值,比如说注册到充值、充值到首投是一个流程性的过程,常态来说应该是漏斗流失这样的过程,如果中间出现了反向的,比如注册量少,充值量大,它就是出现了矛盾,那么就要去关注引起这个矛盾的原因。

    第二,避免偷换概念。刚才说的那个一块钱去哪了?那个一块钱根本不存在,你去哪找那一块钱?其实概念已经被偷换了。

    第三,要把复杂的过程想得简单一点。财务的同学当时就是考虑两个维度,一个是出,一个是入,所以他很快就能得出结果。而我们就会在过程中一而再再而三地反复地算,然后得不出正确的答案。

    这就是我举的例子想要跟大家分享的点了。数据分析除了要思考,你可能还要得出结论,如何得出结论?刚才讲的是比较零散的点,我们现在用一个我们生活中实际发生的案例来跟大家过一下一般是怎么样的思维过程来形成完整的报告或者结论。

    这道题目就叫“大姨妈与小表弟”。什么意思?过年的时候我回家,我大姨妈跑过来跟我妈聊天说我小表弟快要中考了,然后这次期末考得不太好。大概是这样的情况,她也很担心,说不知道要是考不起好的中学该怎么办。因为我在房间里,我也没听太清楚,但是我出来的时候就接了一个工作,就是我妈给我的。我妈说“快安慰安慰你大姨妈,帮帮你小表弟”。

    对于我们来说,就等于是接了一个任务目标了,这个任务目标就是这两句话。这其实是两件事情,在场的同学会从哪些角度去考虑?当然你可以问问题,因为你大姨妈就坐那儿,你可以问她。她的目的也很清晰,她担心的是小表弟能不能考上好高中。接着就是你妈说让你安慰一下她、帮一下你的表弟。大家遇到那种情况,一般会问些什么或者说会从哪些角度来考虑这件事情?在这里,我给大家说一下我的思考方式。

    首先,从趋势上进行分析。刚才也有同学谈到,包括环境、行业、竞争对手,就是说小表弟本身的学校排名是什么样的情况。如果他本身是在重点初中里的排名已经很高,你安慰大姨妈肯定首先就是说“这基本上上好一点的高中的问题不大,只是说我们要去哪一个”。好与更好,而不是说好与能不能上,这是两个概念。

    另外,班级最近的氛围怎么样?是不是因为环境造成了小表弟这次考试可能没考好?另外就是小表弟近期的情况,是不是身体原因或者怎么样。

    这些其实都是外围的情况,看完外围的情况就会多维分解一下小表弟自己的考试。比如说他的分数怎么样、有没有偏科、试卷结构怎么样、怎么样制订目标。比如说他有一科很强,其他的很弱,很弱是因为什么?比如说如果是语文很差,语文是哪一块差?

    你这些可以辅助来判断。从安慰大姨妈到帮小表弟的过程应该是更深度地聚焦在到底该怎么样帮的点上,所以要更加往下细分。比如说语文卷面是阅读不好,阅读该怎么办?那就得往下分。

    至于用户细分的考虑这一块其实只是一种运用,可能不是特别恰当,但是只是说有这种思维,你会去分析一下。比如说你刚才已经分析出假如小表弟是语文不太好,那么他们班上语文学习好的这些同学是有哪些特征或者他们是怎么样去学语文的。比如说大家都背诗词或者都在看一些报刊,甚至是不是有老师开小课?这些情况你有没有了解清楚或者说家长知不知道?这些都需要去了解。

    另外,除了本来就学得好的,还有那种排名上升特别快的同学,这些同学是用了什么方法在这么短的时间内有提升?这个方法是不是小表弟也可以学?这个也可以观察。再下面,关于漏斗流失以及如何分析,按道理来说应该是一个路径,这里不应该这样讲。但是实际上可以把思路变化一下,而不是这样的竖向的固定流失,而有可能是横向的结构问题。我们就可以分析他试卷的以往错误率,是因为这次没考好考砸的,还是你本来这一科就一直不好?这也是需要去了解的。另外就是你错误的板块,到底是因为什么原因?是这次的原因还是历史的原因?这是需要提前了解的。

    最后,要快速尝试一下。比如说有些同学排名上升很快的学习方法适不适用?你总要去试一下。

    不仅仅是这些维度,还可能有更多的维度。当然因为数据分析是一种思维,思维是没办法拘禁的。无论你经过多少的思考,最后会有一个结论。这个结论一般会是什么样的结构?你已经问了大姨妈这么多问题,最后怎么样整体来回答她?

    我们的目标一个是安慰,一个是帮小表弟。我们最终得出的是这样的结论。

    首先安慰大姨妈。“大姨妈,你不要着急。从学校和班级的排名来看,小表弟怎么样”,因为首先要对这次小表弟的排名情况或者说考试情况作一个整体的判断,看看这个程度到底去到什么程度,是真的惨不忍睹还是还有得救?你总得给大家一个心理准备,是真的考不起要去花钱找关系,还是说补一补花点钱也能够让他自己努力得了,或者说其实也不要太在意,这次就只是一次小失误。你首先要对大的这次的情况作一个判断。老师对他怎么样是定性?他本身是个什么样的状况?接着就说这次没考好主要是因为什么,这是刚才我们说的哪一个东西影响到他。也就是说我们这次考试除了判断他的事态和程度,还要找到他这次情况的现状,并且分析是因为什么原因导致的。然后“小表弟在这个考点上一直怎么样,从以前的考试情况来看怎么样”,其实是对历史作一个总结。是一直就不怎么样还是说以前的考试还可以,这次不怎么样,要对历史作一个总结。接着就说“他班上的谁在这块学得挺好的,主要是因为怎么样,”那你就要看一下竞品在这一块上到底是怎么做的、有没有借鉴意义?最后就说“我们可以怎么样,下一次考试的目标就是怎么样”,你要对整体作一个建议,以及对目标进行管理。你也不能让大姨妈的期望值太高,要管理期望,不能直接说“高中没问题,考个一中二中什么的”,那也不行,也得让你小表弟喘口气。

    整体的回答就会是这样的逻辑结构。你从接到一个标题或者你要分析的东西一直到它最后出结果,整个流程的辅助维度可能就是这些,其实还会有更多的维度来辅助。其实数据分析在生活中是很常见的,大家也都经常使用它。

    第二章:数据分析的作用——降低被误概率

    除了刚才那些问题可能时不时会发生,但是更多出现的是一些容易被误导的数据。我没有说被骗是因为它也不能叫做骗,只是它误导了你,而你选择了相信。我们经常在一些报刊杂志上看到很多数据就开始传播,我也希望这次听完这些之后,如果不是特别确定的还是不要传播,容易引起恐慌。

    如图二,我们来看这些报刊杂志上是怎么样描述这些数据的。首先是“情感专刊的专家通过读者的反馈研究发现,有80%的家庭表示后悔要小孩”。“人们一般认为平均23度感觉舒适”。“当今交通危险日益增长,据不完全统计,现在因为飞机事故丧生的人数是20年前的15倍”。“北京2012年离婚率是39%,有点不敢结婚。居全国之首,预计到2017年将超过50%。”“甲同学期末五科总分450分,乙同学期末五科总分460分,乙同学比甲同学优秀”。接下来这个是最常见的,“2015年,全国32个主要城市平均薪酬为6070元”。最后是参军海报上写的,“美国海军的死亡率为千分之九,而同期的纽约死亡率为千分之十六。所以参军更安全,鼓励大家参军”。这些都是摘自一些报刊杂志上或者说平时经常会出现的一些东西。至于为什么感觉不是骗了你,而是你被它误导?我们讲完这一章之后来回答,大家也可以想一下,大部分可能已经知道在哪有有不对了。

    (图二)

    我们已经发现了很多生活中出现的“骗”或者说被误导的东西,我们为什么还要统计。哈佛的统计学院的创始人莫斯特勒说过“要用统计很容易,但是不用统计骗人就更容易了”。

    什么叫做数据分析?数据分析是指用适当的统计方法对收集来的大量第一手资料和第二手资料进行分析,以求最大化地开发数据资料的功能,发挥数据的作用。为了提取有用信息和形成结论而对数据加以详细研究和概括总结的过程。里面包含两个关键信息:第一,有用信息。第二,形成结论。

    第一,有用信息。对于数据来说什么是有用信息?主要是三个方面的东西:1、数值。2、比率。3、图形。它还会有很多种,但是我们经常接触到的东西比较多的会是这三种类型。

    1、数值

    大家平时接触得非常多,算术平均数、众数、中位数,平均数大家知道了,众数就是一个数组里出现得最多次数的那个数,中位数就是它的位置处于那一组数据的中间位置的数字。这三个数里面,只有众数是真数,它是不会改变数本身的任何特性的。中位数是半假数,因为当数组出现偶数的时候,它是需要计算的。只要是你需要第二次计算的,就会出现人为操作上的或者是任何形式上的失误,所以中位数叫半假数。而算术平均数实际上就是一个假数,因为它需要你进行二次计算,而且在计算的过程中会经常出现不可意料的坑。

    看图三,三月份投资人数10个,投资总金额1万,平均客单价1000。到了四月份,投资人数涨了,投资金额翻一番,平均客单价是10倍。如果你是做数据分析的,一看到这个数第一时间估计就兴奋得崩溃了,真的要这样往上报吗?

    (图三)

    它上面写的是平均客单价,当提到“平均”这两个字的时候,需要去看一下数本身的情况,也就是说里面有没有异常值。如果说你追回去,最后发现四月份虽然来了20个投资人,投资金额这么大,结果其中一个投资人自己就投了15万。你再一算,平均客单才2500。结果你把这个报上去,老板跟你说“10倍的增长不错,下个月做平均客单12000吧”,你就把自己坑上了,结果实际才2500,也许整个部门都被你坑上了。

    如果真的出现了这样的数要往回追溯,我们说有坑就要埋,怎么样来埋这个坑?首先你要看整个数组里有没有异常值,有异常值是不能用平均值的,必须把异常值剔除掉再来看。

    其次,按道理来说数组里应该是看方差,但是实际工作中我不建议引入更多的数据概念。因为能够得出结论并不是说你用的工具越复杂、越高端越好,而是越能快速...

数据分析吧

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP