中企动力 > 商学院 > 分析数据从哪几方面来看
  • ?

    一份让老板眼前一亮的数据分析是这样做的

    速恋

    展开

    所谓一图胜千言,设计严谨,制作精美的图表能使枯燥的数据变得直观形象、重点突出,迅速传达信息,具有说服力。因此,数据分析的结果往往要通过图表来传达。信息传达到位甚至达到传神的数据分析往往让人眼前一亮。

    要做出好的图表,首先思考以下几个问题:

    1、你要表达什么观点?

    2、那种图表适合你的观点?

    3、该图表对你观点的表达效果如何?涵盖的信息是否全面?图表的形式是否要扩充?

    因此,制作数据分析图也要分为这几个步骤。

    明确表达的信息

    作图首先确定你想从哪个角度来看问题。

    比如这里有一个全国各地区销售额、地区占比及其增长情况表,你能从表中看出哪些信息呢?

    从地区来看,有华东、华南、华北、东北等地区销售,整体来看,东北最低,华东华南不分上下。

    从地区销售情况来看,华东整体呈现增长趋势,东北地区波动较大。

    从全国情况来看,同比增长速度较慢。

    从各地区占比来看…………

    可以看出这张表我们能归纳多个信息,之所以有这么多层信息是因为数据维度多、可思考的角度多,因此,用图表分析的维度也多。

    选择合适的图表

    这里就有个难题,既然要给领导看,你要分析哪几类数据呢?

    如果是要看各区域销售占比,你可以用饼图或者环形图表表示,可是有5年数据,也就是要做5张饼图。如果你要做各地区销售额增长情况和趋势,如果把每个地区的数据都集中在柱状图上,还要用折线图分别表示每个趋势,如果还要看全国销售额等等,这样的图显然很乱。所以在规划图表设计的时候,一定要按照分析的思路来。

    按照分析思路确定数据图表

    假设你是领导,最关心的是什么

    全国的销售额及其增长>>>各地区销售额占比>>>每个地区的销售情况(销售额及增长率)

    思路清楚了,图表的制作流程也就明了了。

    选择合适的工具

    EXCEL:

    然后你想知道每一年的各区域占比,好像又要做5个图表,点击每个区域,查看每区域的销售情况又要做4个图表,好像陷入怪圈了。虽然设计的思路正确了,但方案没有到位,没有构思好用最简单的图表或流程来表达。

    这里我提供两种方案:

    方案一:图表组合

    图表组合的意思是将所有的图表都集成在一个dashboard中,类似如下:

    方案二:多个坐标轴自定义+图表联动钻取

    利用数据可视化分析工具FineBI的多坐标轴自定义功能,将所有区域+全国的数据以基本的图表展现,系列值的展现可以自定义。

    然后点击任何一个年份,出现对应年份的饼图。

    可以参考下图的效果,直接将EXCEL或者数据库的资料导入FineBI,建立两张图表进行关联即可。

    确定有效的表达

    图表的制作的应用方案有多种,其展现效果直接影响整体的表达,确定了图表的制作之后,就要完善信息的表达。

    1、格式要完整

    图表的标题信息、坐标轴、单位、脚注,资料来源,图例、标签等等都要完整,尤其是在政府、银行等组织机构。

    2、减少文字描述

    既然图表展示是核心,流程的描述也要尽量简化,信息表达在图中,刚刚用分析的思路来制作图表就是一个有效的方法,但有时候无法避免的需要文字描述流程,这时候可以使用流程图。

    3、打破思维惯性,让图表令人眼前一亮

    图表的呈现生动,甚至带有故事性,最容易产生共鸣,让效果传神,提高沟通效果,这种称为可视化信息图。它结合了设计、创意、图表的等元素,在使用过程中除了常见的图表工具,还会需要一些图片软件。

    End.

  • ?

    探究数据分析背后的学问(下)

    Rayna

    展开

    编者按:在周一我们推送的探究数据分析背后的学问(上篇),孔淼从消费者和数据两个维度探讨企业如何高效率的开展数据分析,以及自动化数据分析工具是如何激励用户由访客成为销售线索,转而付费的。

    本文(下篇),孔淼会继续探讨数据分析的“道”与“术”,并对国内数据分析产品的优劣势做了客观分析。

    音译:唐传鸿 | 整理:刘梦洁

    校对:臧海 | 审核:闫璐

    九枝兰:您是如何看待工具与人,这种“道”与“术”的关系的?

    孔淼:工具能提高效率,服务于企业,帮助企业提高收入,但不能完全脱离使用者。好工具的使用门槛是比较低的,能帮助企业降低对使用人员的岗位要求,从这个角度看,工具是在帮企业降低成本。同时,合理使用工具可以提高企业的工作效率,在降低企业获客分析的成本的基础上,提升客户及收入的转化,让人人都可以看懂数据分析,依据数据去做决策。归根结底,我认为工具要做到的是让人人都能够快速参与到数据营销的工作、分析和决策中。

    “术”和“道”、“工具”和“人”的关系要看企业的具体情况,以及不同企业在不同阶段的发展方向和业务目的。“道”是在“术”的上一层,就是企业要基于业务有深刻的理解,要知道用户为什么能被打动,从用户的角度去理解他们,然后做行动;不只是为了提升某个特定的指标而做优化,这样才能让用户认同价值留下来,而不是通过方法留住他们,不能够本末倒置。

    从市场人员的工作任务来看,如果他身背KPI,一定会选择能提升指标的工具;如果他只是不想加班,想高效率的完成工作,又会是另一种选择。在数据分析工具出现之前,我们同样是面对两大难题:1、要通过沟通去解决问题,效率显然很低,因为遇到沟通问题的时候,需要反复确认,沟通成本太高了;2、要完成业绩考核,这又是很重要的核心问题。两个难题如何驾轻就熟的攻克,选择权在企业自己。

    九枝兰:您觉得国内数据分析类的产品如何才能脱颖而出?

    孔淼:技术与产品的发展和迭代都会经历一些磨难和考验,甚至也会走一些弯路。这要从大的背景谈起。20年前还没有大数据,因为大家手上的数据很少,现在互联网覆盖几亿用户,哪怕一个拥有10万用户的App,若是想把用户行为都采下来,都可以获得过亿的数据。所以开发者已经走过了没有数据的状态,那么早期那些做数据采集和日志分析的公司的危机就来了,因为单纯的数据是没有任何价值的,数据一定要为业务或目标做支撑,即如何能让客户价值最大化。

    企业数据越来越多,衍生了更多需求,如数据可视化、数据报告等,很多分析平台都可以满足,甚至一些咨询公司通过数据整理也可以为企业提供有趣的数据报告,此时国内大多数数据分析平台都处于为企业挖掘表层数据价值的阶段。

    接着很多平台提供了很多高大上的分析功能,诸如BI可视化、自助式分析,各家平台的差异性就体现在产品设计、运营策略、用户体验等其他方面,比如我的客户流失比较严重,如何去挽回?所以客户需求上升到具体的优化执行层面了,这就需要我们先做好基础的数据分析,呈现出一些「关键点」,给客户提供具体策略,帮助他们去做优化。此时,如果我们将挽回客户流失的策略以营销自动化的形式提供给客户,同时选用匹配该策略的挽回内容,相当于满足了客户需求的「一个条件」,用于激励不活跃的用户。同理,用户的访问、注册、购买等行为都可以简单拆分,将数据分析这件事儿做成自动化优化,激励用户在营销漏斗的层层递进。所以如今分析类产品的趋势是自动化+大数据。

    国外的数据分析公司大体上分两种,一种以SAS为代表,提供可视化分析工具,垂直于比较小的市场,如今是全球比较大的软件公司之一;另一种站在企业业务角度,提供智能化营销工具,通过企业间的收购、并购,可以为企业提供整体的营销数据分析。

    从业务角度来看,分析类产品会历经三个阶段:

    第一个阶段:经营活动总结,协助企业完成KPI;

    第二个阶段:业务发展探索,帮助企业发现并解决业务过程中遇到的用户体验、产品优化等营销问题;

    第三个阶段:自动优化,结合前两个阶段的功能将数据价值最大化,不仅能解决已知的问题,还可以解决人未知的问题。例如两个用户的年龄、行业、地域相同,当我们发现其中的A用户是高UP值的,可以预测B用户也是高UP值,从而为B用户推送更有针对性的、类似A用户的激励措施。

    通过自动优化,为不同用户提供差异化的激励措施和关联内容,千人千面,满足不同行业的更多企业的业务需要,而不是仅限于工具和功能本身。因为企业的发展一定需要转化率的提升,一些不够效率的行业或领域势必会淘汰。AI(人工智能)其实发展了很多年,最早只是停留在算法阶段,随着技术不断发展,如今AI可以基于不同数据的特征,训练出Model(模型),为人类提供推断。

    如今的分析工具更偏向于精细化运营,将业务维度碎片化甚至颗粒化:用户从哪里来,进行了哪些操作,如何付费购买的....我们更关心这些细腻的数据,在不同场景下用户做了什么。所以数据分析产品如果想脱颖而出的话,需要将不同场景的数据做成Model,提供差异化的驱动用户转化策略。

    九枝兰:例举诸葛IO做过的比较好的1-2个案例,帮助企业解决了哪些问题?

    孔淼:安利一个我们服务的案例,光明随心订。光明随心订是光明的线上订奶业务,传统乳业公司很擅长做线下,一个小区门口摆一个小摊位,或者依靠送奶员的推荐,靠人海模式这种比较传统的方式扩大购买人群,业务模式很固定,只有用户的单项选择,选定品类后通常要么就一直延续下去,触达用户的渠道非常被动,和用户互动的方式也非常有限。

    如何让用户更灵活的选择周期、品类?随后,光明搭建了自己的微站、App和官网,用户可以在线上灵活选择心仪的乳品,微站、App和网站成为了企业和用户新的链接。客户的购买力是有的,将订奶业务搬到了线上,将线上业务作为传统线下业务的延伸。诸葛IO帮助光明随心订打通了线上线下数据,基于用户的线上行为数据描绘用户画像,实现精准运营。同时,光明随心订的线上投放,如搜索和朋友圈广告等,可以通过诸葛IO实现投放效果衡量。

    从光明随心订的角度来看,他们非常希望跟客户有更深层次的连接的,也希望能让客户消费升级(up sale)。同时实现「随心订」 -- 客户随时订奶,都能在次日收到,打破过去提前预约订奶的传统消费方式。

    诸葛IO帮助光明随心订从采集数据,用户从曝光到点击,从浏览落地页到下载APP,这些数据可以连贯的追踪。用户的注册和订购流程,每一个细颗粒度的数据我们都会采集,从而搭建起很丰富的用户系统,将用户标签化。在这个过程中还包括优化注册流程,将转化率提高了10%;以及业务方面判断哪些商品关注度高,哪些关注度低,上架数量的配比等等

    值得一提的是,在运营层面,通过我们的智能触达平台,光明随心订设计了很多触发规则,定向选择一批满足特定条件的用户,实现精准触达,比如针对注册后24小时内未下单的用户推送带有优惠券的短信,收到短信的用户中,有7.6%的用户被重新召回并且实现购买,这背后是典型的规划逻辑,然后自动化的完成。传统做法是运营找技术导出数据,然后市场和运营一起分析数据,筛选出目标用户,再导入短信系统发送。

    “为注册后24小时内未下单的用户推送带有优惠券的短信”有几个关键点:1、注册后未下单,对于随心订这样的平台,注册就是要订奶,“一定会”订奶的用户,无需花费额外的运营成本(优惠劵);2、时间定在24小时,如果一天没有订购,流失风险已经很高了,需要及时召回,而24小时恰好会是前一天注册的时间段,意味着是“用户方便的时间”。整个过程是自动化的,不用运营人员繁琐的工作量,也不用协调其他部门的沟通成本,基于诸葛IO,运营人员自己足矣。传统方式的弊端是参与人众多,协调和决策周期很长,等企业做完数据分析后,用户早就流失甚至卸载你的应用了。自动化营销是秒级、分钟级、小时级的,根据每位用户所处的不同场景,自动化的触发挽回/激活/留存的各项规则。所以,诸葛IO打通了从广告投放到用户运营,再到订单交易的闭环。

    简单总结一下,传统线下的订奶方式需要人去对接,受限于订奶员的服务水平,而且容易被当成促销员,遭到抵触。转战线上后,基于用户行为数据,企业可以更深入的了解用户,提供更多样化的选择,增强双向的互动,在提高了转化效率的基础上,增加留存客户的忠诚度,而且相比入驻天猫京东等线上购物商城,在服务体验上也能做的更人性化。(完)

  • ?

    如何分析网站数据报告,这五点你必须知道

    吧吧炉

    展开

    通过几年的经验积累,下面小编将带你一起分析一下网站数据的整体流程(举例如下)

    小编将会以(bodao.org)这个网站进行综合分析,我们需要打开一个站长工具tool.chinaz或者aizhan进行查询,首选对整个网站进行综合判断分析,具体如下:

    1、综合数据分析:

    通过上图我们可以发现该网站的域名年龄为11年1月6天,而网站的百度权重只有1,并且通过百度查询之后收录仅有825条,因此我们可以初步判断网站的内容更新频率、内外链结构以及关键词排名均可能出现问题。

    (1)关键词分析

    通过网站源代码,我们可以看出中国互联网协会网络营销培训关键词不适合作为该网站的核心词,具体数据如下图:

    通过上图我们可以发现,该网站选择的核心关键词优化难度较小,从核心词的选择标准上来看都不是网站的核心关键词来进行优化。

    通过站长工具从新选取的关键词作为核心关键词具体如下:

    通过上图我们可以发现新选取的关键词从指数和优化难度考虑可以做为做为该网站的核心关键词。

    (2)代码分析(, , tdk)

    首选通过网站的源代码来看tdk撰写的不适合作为该网站的优化,并且没有添加h与strong标签。

    首先该网站的tdk需要进行修改:

    Title:网络营销、销售培训、SEO培训

    Description:中国互联网协会网络营销培训是按照网络营销、销售培训、SEO培训三个岗位明确的培训层次实施的网络营销专业培训项目。众多业内实战精英对国际、国内网络营销发展历程、现状以及趋势的综合分析、总结并在此基础上的联合把关极大地保证了教学内容的实战有效性,从实践应用角度、经多位资深网络营销专家倾力合作、自主研发的一套针对性的网络营销培训教材的极大地保证了培训内容的系统性和实战性。

    Keywords:",网络营销培训,销售培训、SEO培训,网络营销实战培训。

    通过网站源代码查看没有H标签与strong标签,建议添加如下:

    H1标签应当添加在网站的logo上,并且在添加上atl属性关键词为“网络营销培训”如下图:

    h标签与strong标签对于网站关键词相关性是有很大帮助的

    H2标签应当添加在栏目导航上并且是最重要的导航,如下:

    Strong标签则需要添加在板块标题上,如下图:

    (3)内链结构

    通过浏览网站内容发现,网站存在文章栏目层级过深的情况,建议将文章栏目页4层修改为短到3层以内,列:目前层级http://bodao.org/2015/news/106.html

    在点击板块标题的时候以及咨询转化入口没有添加相对应的连接形式。

    通过上图来看则需要在重点板块标题上以及转化入口添加相对应的连接。

    (4)网站内容(质量与频率更新)

    通过网站文章查询后,我们发现,网站目前文章出现大量重复内容,不利于网站的优化,如下图:

    建议根据网站重新选择的关键词为网站重点栏目进行文章添加。

    另外通过浏览文章更新时间不是规律更新:如下:

    建议每周一至周五更新20篇伪原创文章,原创文章更新5篇。

    (5)外链分析(友情链接)

    通过网站友情链接查询后,我们发现该网站的友情链接质量较差,多数网站没有进行回链,并且网站数量较少,具体如下:

    建议为网站交换高质量的友情链接,选择权重高以及PR值1以上,收录大于500,外链大于500的与网络营销相关的网站上进行交换,并保持每周交换3—5条友情链接,网站友情链接控制在40以内,交换时应选择核心关键词。

    以上是小编多年积累的经验步骤,在这里分享给大家....

  • ?

    数据技能从哪学起?看看这张矩阵分析图

    高贵

    展开

    大数据文摘出品

    编译:周家乐、睡不着的iris、夏雅薇

    数据科学相关的技能和工具有各种各样的,想要转型数据的公司往往觉得无从下手,自己的团队到底该加强哪方面的技能储备才能有最大商业回报呢?撒网式招聘对于很多初创公司过于昂贵,本文提供了一个分析矩阵,帮你正确评估对针对你投入产出比最高的数据技能。

    数据技能(Data skills)——将数据转化为洞察力和行动的能力——成为现代经济的驱动力。根据世界经济论坛的报告,受到劳动力市场变化影响工作岗位逐渐萎缩,专注于计算和数学领域的工作岗位却呈现出最强劲的增长势头。

    因此,处于数据驱动经济增长的环境下,无论是为了实现自身价值的最大化,或仅仅是为了我们和我们的团队与时俱进,保持在就业市场的竞争性,我们都需要考虑让自己拥有更多与数据相关的技能。但是你应该更关注哪些技能呢?

    我们大多数人能跟上这一趋势吗?还是索性放弃回到那些正逐渐萎缩的领域,把数据相关的技能留给那些专家们去研究?

    我们借助过去用过的一种分析方法来回答这个问题,曾经我们用它分析过如何从收益和成本的角度来确定优先学习哪种Microsoft Excel技能。这次我们将“时间效用分析法”用于数据技能。“时间”表示学习某项技能要花费的时间,代表你或你的团队掌握该项技能的机会成本。“效用”表示从多大程度上你需要这项技能,代表它会为你的公司和职业前景增加多大的价值。

    优先学习哪种技能:

    https://hbr.org/2017/09/a-2x2-matrix-to-help-you-prioritize-the-skills-to-learn-right-now

    把时间和效用相结合,你就可以得到一个简单的2*2的四象限矩阵。

    学习:实用性高,学习时间短。你可以不费吹灰之力就掌握这个技能,并快速为你和你的团队增加价值。

    计划:实用性高,学习时间长。虽然这项技能很有价值,但学习它意味着你要暂时放弃学习其他技能,把它列为最优先学习的。因此你需要确保它物有所值。

    浏览:实用性低,学习时间短。你现在不需要这个技能,但它很容易掌握,所以只要稍微留意一下就行了,说不定哪天会用得着。

    忽略:实用性低,学习时间长。你没时间浪费在它身上。

    为了帮助你决定学习的重点,我们根据这个方法绘制了关键数据技能图。我们列出了各类角色需要具备的数据技能,考虑的职位角色包括:业务分析师,数据分析师,数据科学家,机器学习工程师或者增长黑客。

    然后,我们根据这些技能在招聘信息、新闻报道和我们学员的反馈信息中出现的频率来确定其实用性。最后,我们将技能的实用性与学习难度相结合——用掌握技能所耗时间作为衡量标准,评估学习每项技能的难易程度。

    我们用这种方法评估的是数据技能而不是某项特定技术:因此,我们考虑的是机器学习而不是TensorFlow;是商业智能而不是Microsoft Excel等。一旦你根据自己的情况确定了该优先掌握哪些技能,你就知道什么样的专业软件和学习方法对你最有帮助。

    您还可以根据自己的情况调整分析方法,因为相同的数据技能对不同的人会产生不同的影响。以下是我们的结果:

    在我们公司内部我们发现构建这个矩阵帮助我们解决了一个难题-到底该把主要精力放在哪里:乍一看,我们初选名单中的所有技能看起来都很有价值。但实际上,我们只能期望在少数几个方面取得进展,至少在短期内。基于数据可视化具有高实用性和学习时间较短的特点,我们公司决定提升数据可视化能力,以获取最佳投资收益。依据分析结果,我们已经采取了行动,并且开始使用Tableau为我们的客户提供用量分析。

    你也可以在你自己的公司中尝试这个矩阵,它能帮助你的团队确定现在最需要学习哪些数据技能。

    相关报道:

    https://hbr.org/2018/10/which-data-skills-do-you-actually-need-this-2x2-matrix-will-tell-you

  • ?

    来看看我们数据分析过程中的那些坑

    许香露

    展开

    今天端午节,小2哥祝所有商家和网友节日快乐,端午安康,对于做淘宝的人来说,是没有节日这个概念的,我今天也继续奋斗在工作岗位,闲暇之际,抽点时间来和大家分享分享自己的一些对数据分析的感悟。

    我在很多场合经常听到有人说:数据有毒

    其实,有毒的不是数据,而是我们不懂的分析数据,只知道看表面的数据,没有理解出数据背后的东西。

    我在书友会和书友们说:很多的时候,如果你没有跟着我学数据分析的时候,你凭借着你的经验和第一直觉做可能你还会做的更好一点,但是如果你跟了我学数据分析之后,可能你反而会做的越来越差?

    因为有很多人他第一直觉和经验其实比较好的,不听数据分析他做的决策反而可能正确一些,但是自从他听了我的数据分析之后,他开始不相信自己的直觉和经验,他只相信数据了,特别是看到那些直观的图表的时候,他更愿意去相信数据,可是遗憾的是他只看到了数据表面的东西,并没有把隐藏在数据背后的东西挖出来了,所以他反而让数据表现的东西给误导了,做出了错误的决策。

    我们来看看那些经常因为数据误导我们的案例,这里先举一个例子,很多人经常会去分析关键词的人群画像,下面这个数据来自的是"长袖T恤女"这个关键词的数据

    从这个数据我们可以看到的是18-25岁的人占比最高。所以很多人说,这个关键词背后搜索和喜欢的人群是18-25岁

    其实,如果你说关键词背后搜索人数最多的是18-25岁,那么这句话肯定是对的,这数据也肯定能说明的,但是你没办法说明长袖T恤最受欢迎的人群是18-25岁

    我们再来看一个图,这个图是2015年6月和2016年6月网民的年龄结构分布图,当然,很遗憾的是我没找到今年淘宝网民年龄的结构分布数据。但是从上面这个图里面我们可以看出40-49岁的网民只占了总网民的百分之13%左右,而这个数据还是网民数据,不是淘宝用户的数据,淘宝用户的数据只会比这个数据低很多,因为现在很多40-49岁的人都会玩微信,他们算网民,但是这里面有很多的人从来是不淘宝购物的,他们就算不上淘宝用户,特别是广大农村地区,这个年龄阶段的人用微信的特别多,但是用淘宝的非常小,

    这个时候我们再回过头来看第一个数据,搜索长袖T恤女这个关键词占比最多的人群是18-25岁,但是这个只能说明搜索这个关键词人数最多的是18-25岁人群,并不能说明长袖T恤在18-25岁的人群里面更受欢迎。因为本身这个18-25岁人群在淘宝用户中基数就是最大的,同样的我们再看,40-49岁的这个人群,他虽然只占比16%,比起其他的年龄阶段来说人群占比算比较低的,但是他在淘宝用户这个人群中占比也是非常小的。如果这个数据换一种表达方法,就是每个占比只以各自的年龄阶段为基础,那么估计40-49岁的数据就要比18-25岁的数据大很多了。

    我们继续来看另外的一个案例,很多人都喜欢做市场容量的分析图,去分析市场的容量,他会把过去一段时间的支付金额做成饼图,然后分析根据这个图的占比来分析他的市场容量

    例如,我们在图上看到裤子的市场容量占比是10%,而T恤的市场容量占比是8%,如果从表面上来看,裤子的市场容量是比T恤要更大,但是如果你仔细了解一下背后的数据来源你可能就会有不一样的答案,裤子的数据是有打底裤,休闲裤,西装裤,棉裤/羽绒裤等多个子类目组成,而T恤下面并无子类目,他的所有数据都是来自T恤这个子类目,而且,T恤主要是集中在夏季这一个季节,到了冬季的时候,虽然也有长袖T恤,但是那个占比已经比较少了。而裤子不同,长裤,短裤都是裤子类目,除了牛仔裤外,其他的子类目裤子都是在裤子这个类目,因此,如果你完全根据这个数据的大小去选择市场容量的话,你可能就会出现问题

    有些人在选择市场切入的时候,喜欢选择这种数据大的市场容量的市场,不会去选择数据小的市场容量的市场,他们认为数据小的说明没有市场。

    其实,这里面也是会经常误读的,例如上图,有一个抹胸市场容量占比是0%,可能很多人会觉得这个类目没有什么市场,不值得的去做。

    但是你搜索抹胸这个关键词然后按照销量排名,你觉得这个市场容量会小吗?

    很多的时候我们就是容易让数据表面给误导,例如抹胸我们做的图之所以市场容量为0%,是因为第一个我们统计的数据是按照支付金额统计的,而抹胸因为客单价非常低所以他的支付金额特别比较低,可能三四件抹胸的都没有一件T恤的价格高,这也就导致了他的支付今天看起来比较低,如果你换成的是成交件数,那么肯定你就会得出另外一种结果,另外,0%不代表是真的0,而是因为四舍五入最后的结果是0%。0.4%的结果也是0%,可能很多人还是会说0.4%还是比较低,其实,低和高要看你的基数有多大,如果你的基数是100000亿,那么这个0.4%的数量也不少了的。

    继续再来看一个例子,我们在优化标题的时候都喜欢去看关键词的搜索指数,很多人只要看到搜索指数低的人就认为是没有人在搜索,这种词就不应该用

    例如大家看到上面这个图,可能很多人会觉得这个词带不来流量,因为都没有人搜索,而我曾经有一个宝贝前期就是靠这个关键词带来流量的,虽然每天没有太多,就那么几十个,但是,因为这个词特别精准,我的宝贝竟然每天能成交那么一两单,对于前期来说,这个数据已经非常好了。

    其实,这个也是很多人对数据没有去了解他背后造成原因导致的结果,他把搜索人气零当成了是没有人搜索,其实根本就不是这个意思,搜索人气是根据统计周期内的用户搜索人数拟合出的指数类指标,也就是说,这个数据让淘宝处理了,0只是代表他趋势很小,相对其他的关键词来说,他的这个搜索人数可以忽略不计。但是并不代表他完全没有搜索,中国好几亿的淘宝用户,每天如果只有几十百来个人在搜索,这个数据相对于整体来说基本可以忽略不计,但是如果没有人和你竞争,那么这几十百来个流量也就是你一个人了,对于很多新店铺来说,前期每天能有几十百来个流量也是好的,最关键的是因此词精准,转化率高,虽然每天只能带来一两单,但是相对那些一天一单都带不来的商家,这个数据也算好的。

    举例了这么多,其实都只是想说明一个点,在分析数据的时候,一定要重点分析的是数据背后的东西,他是怎么造成这个数据的,要从多个维度去分析数据。而不是简单的只看看表现的数据,然后根据表面的数据就下决定。

  • ?

    浅析哪几方面可以看出你的SEO是否得体

    Doris

    展开

    得体很多人看字面可能会认为是适当,其实得体的网络含义是“dirty”(垃圾),因为发音很像。很难想象一个词现实中的意思和网络含义相差如此两极化。但是这个得体在我们今天的文章中没差,意思无非就是你的网站SEO是否做的适当或者你的网站的SEO是否垃圾。平常我们分析一个网站的SEO是否得体很大程度上是通过网站的PR分析,但是如今PR的可取性越来越低,今天我们就来浅析还有哪几个方面可以看出的SEO是否得体。

    一:从你的网站的数据上分析SEO是否得体。

    从网站的数据分析你的SEO,可以从几个方面进行分析收录情况,快照更新情况、外链的数量以及质量问题等等。那么我们如何通过这些数据进行分析呢?(1)站点的收录情况,越大的收录对站点越有好处;快照的更新情况,快照尽量在一周之内,超过的话说明你的站点可能已经出现问题了,快照的更新是否正常,反映的是你的站点是否收到搜索引擎的欢迎。(2)外部链接的数量以及质量问题。我们在建设外部链接的时候不仅要在数量上下功夫,更重要的是要在质量上下功夫。效果最明显的外链建设就是友情链接交换,平常我都会去一些友链平台交换链接,例如七彩虹友情链接平台。一个高质量的友链抵得上数十个垃圾的友链。(3)通过数据分析网站的关键词的排名情况,如果你的关键词的排名做的好的话,可以说明的SEO很合适,我们同时也不能忽略长尾关键字的作用。

    二:从你的网站的布局结构方面分析SEO是否得体

    这个方面我们是要以搜索引擎的角度来看,一个网站的整体布局,内链布局,Meta标签、JS代码、网站的源代码等是否符合规范。我们可以从一个几个因素来进行分析。(1)网站的源代码是否简洁规范,网站的源代码如果有太多的冗余,会使站点的访问速度降低。(2)分析你的网站是否结构清晰,对各种浏览器的兼容性好。(3)站点内部的JS代码是否设置得当,删除不必要的JS。(4)图片的ALT标签是否设置得当。等方面对网站的整体机构的合理做一个完整的分析。

    三:网站的用户体验是否良好方面分析SEO是否得体

    判定一个网站的SEO是否得体的最基本的因素就是用户体验情况,用户体验情况的分析我们可以从几个方面进行分析,(1)网站的加载速度,网站的加载速度最长多久用户是可以忍受的,据统计是30秒,超过这个数值大部分用户都会直接关掉你的站点,网站的加载速度的提高可以从网站的服务器及网站的源代码下手,一个好的服务器及简洁的代码可以使你的站点在加载速度上有更多的优势。(2)网站的视觉体验,一个网站在视觉体验上有有创新的想法,网站看起来漂亮舒服,才能留住更多的访客。墨守陈规的网站格式只能让你在互联网的浪潮中淹没。

    做网站难,做SEO更难。但是我们一定要相信自己,我能。笔者就在这里分享这三点经验,大家可以从上面的几个方面对自己的站点进行不断的提升与完善。

    本文由消防自动巡检柜(http://xunjiangui119/)整理发布,谢谢!

  • ?

    亚马逊数据分析中该看哪些数据

    发光的

    展开

    亚马逊数据分析重要吗?非常重要,通过有效的数据分析可以让我们找到自己在店铺运营中的不足,可以让卖家们作出及时的调整,可以说数据分析是在亚马逊开店中非常重要的一部分,而大家在亚马逊运营上的好坏是可以通过数据分析来表现的,那么如何做好数据分析呢?都有哪些数据需要分析,如何分析亚马逊数据呢?接下来亿数通来告诉你!

    一、店铺数据

    在亚马逊开店的过程中,每天都会产生许多的数据,比如说:

    店铺销量,订单数,销售额,报告量、被加入购物车的时间、和昨天对比,和上周对比,和去年同一时间进行对比,通过这样的对比来发现自己产品的销售情况,看看是否有进步。

    在看看产品的评价数据,是否需要增强

    二、广告数据

    亚马逊数据分析中非常重要的环节就是对数据进行分析,而在亚马逊上做好站内引流中,大家第一推荐的就是站内广告,下载站内广告报告,查看报告中的内容,这里面也蕴藏着大量的数据,通过这些数据进行分析,看什么数据呢?

    1、花了多少钱,一天给到的广告预算是否会提前花完,如果不够花,这些钱都花在什么地方了

    2、看卖出了多少订单,花钱打广告,最终的目标就是销售出去自己的产品,看看通过卖出了多少的产品,都是通过哪些词带来的销量。

    3、看看广告投放的ACOS,这是广告投放上非常重要的指标,ACOS越低代表着大家赚到的利润越高。

    通过广告数据分析,卖家们要对广告投放进行调整,剔除无转化无点击的关键词,细化点击高转化的关键词,优化好点击低转化的关键词,通过不断的优化来提升自己的广告效果。

    三、产品数据

    看产品的流量,看产品的销量,将这个数据和昨天的,上周的,上个月的,甚至的去年的数据进行对比,看看看产品处于什么样的周期里,判断是否还有上升的空间和可能。如果通过对比发现流量数据、销量数据下降了,就要看看是否出现了新的跟卖,是否出现了新的差评。

    亚马逊数据分析之产品数据,当然是通过产品的曝光情况,销量情况,转化情况来发现自己的产品有哪些问题,是流量不足,还是流量来的不够准确,还是产品页面优化不到位,通过分析来找到问题,解决问题。

    亚马逊数据分析是亚马逊运营过程中非常重要的一个环节,如果忽视了数据分析,可能很多时候会让卖家们错过爆单的机会。当然除了对自己店铺里的数据进行分析,还可以及时的查看平台上的数据情况,看看最近有哪些新品成了爆款,等等,来帮助自己进行选品,数据分析很重要,大家一定不要忽视哦。

  • ?

    数据分析运用的4要点,你可以看看!

    南极雪

    展开

    我是企业文化从心开始,20余年职场历练,高级企业文化师,中国首届企业自媒体大会优秀总编,中国内刊协会优秀内刊主编。欢迎关注、点赞、评论、转发、收藏、交流!

    时代在发展,信息在进步,目前,许多企业对数据分析的作用已经有了更深刻的认识,那么做好数据分析工作,从企业文化的角度来看,应该把握哪四个要点呢?

    1、随着信息技术的高速发展,数据分析为企业决策提供了有力的支撑。

    众所周知,随着信息技术的高速发展,数据分析的技术条件不断成熟,各类软件的开发和使用已经不再是价格高昂、可望而不可及了。特别是通过数据库、数据软件的使用,已经可以极大的方便各类情况的统计、汇总、分析、运用,节约了领导分析情况的时间,提升了领导做出科学决策的全面性、实时性、针对性和有效性,已经成为信息时代的一个重要工具。从企业文化的角度来说,应该通过各种宣传、培训等方式,在企业内部大力营造学习信息技术、运用信息技术的良好氛围。

    2、数据分析掌握在人的手中,首先要搞定人这个关键。

    做好数据分析,首先要做好人的工作。因为数据分析相较于传统的分析方式虽然有许多的优点,但对于一些年龄较大或者运用传统方法熟练的领导来说,需要他们放下已经得心应手的方法,重新学习新的信息技术知识,对他们的思想和学习能力是一个考验。同时,各类数据的统计、汇总、分析均依赖于最基础的数据来源,对于每个终端数据的提供和录入人员来说,既可能大幅增加了他们的工作量,也可能会影响他们与上级沟通、交流的话语权,是否能够获得他们的支持是数据分析可否真正发挥作用的关键点。从企业文化的角度来说,应通过典型树立、问题剖析、成果分享等方式,不断地提升大家对信息数据的认识程度,强化大家积极学习、主动运用、沟通协作的意识。

    3、数据分析只有更好地服务业务发展,才会有生命力。

    做数据分析工作,最容易出现的一个问题是为分析而分析,为统计而统计,最终成为形而上学的数据,无法为生产经营和业务发展服务。从数据分析工作开始的第一天起,就必须强化全体人员数据分析应为生产经营和业务发展服务的意识。比如说成本控制,以往,许多企业的采购、物流、储存、生产、销售都依靠人工来处理,不仅速度慢,而且错误多。而通过大数据库建设,可以全过程的录入、比对、控制相关数据,实现信息数字化、数据实时化,通过将成本控制所涉及的从原料采购到产品生产、运输、储存、销售(部分可能包括回收、报废)等各环节有机结合起来,形成一个闭合的环,为成本控制提供可靠的数字化的依据。并以此为基础,通过数据分析不断优化,从而达到一个相对合理的平衡状态,最终实现有效控制成本的目的。

    4、数据分析运用应小步快跑,持续为公司创造价值。

    对数据分析运用来说,企业的日常生产经营都可以实施数据分析,但人的精力是有限的,数据分析这个团队的精力也是有限的。必须根据企业生产经营的总体规划,首先进行全面的摸排、梳理,确定企业目前最需要改善、通过数据分析可以实现改善的项目。在项目确定后,数据分析团队应进行充分的现场沟通了解与现状分析,再形成具体的方案,包括目前现状、准备采取的措施、需要公司支持的资源、预期的时间及效果等内容,报公司领导批准后,再正式实施。在这个项目的数据分析运用取得成功之后,再进行第二个项目的实施。在取得一批项目的成功实施后,再组织专题讨论研究会,梳理成功的经验与存在的问题,以及公司目前可以实施数据分析、以改善工作的具体项目,提出可行性的建议,请与会成员集中研究,最终报公司领导批准后实施。

    如此,数据分析通过一次次为企业解决问题、创造价值,不断强化大家对数据分析的正面评价与正向认知,在不断积累经验的基础上,培养人才,营造氛围,从而更好地融入业务工作、服务业务工作,推进生产经营。

    (图片来源自网络,版权属于原作者,如有侵权,请联系本人,以便及时删除处理)

    我是企业文化从心开始,坚持原创,支持原创,如果您有关于企业文化的相关问题,欢迎关注、评论、留言、交流!

  • ?

    数据分析全流程(内附案例)

    Tornio

    展开

    (图片来源于网络)

    作者:苏格兰折耳喵

    来源: 运营喵是怎样炼成的 (yymzylc)

    (温馨提示:图片显示毛糙和不清楚,是分辨率过高的缘故,点击图片,即可看到高清大图。 )

    本文将对一个案例进行从数据采集、数据清洗、数据分析再到数据可视化的全流程分析,力求条理清晰的展现外部数据分析的强大威力。以下是本文的写作框架:

    1 分析背景

    1.1 分析原理---为什么选择分析虎嗅网

    在现今数据爆炸、信息质量良莠不齐的互联网时代,我们无时无刻不身处在互联网社会化媒体的“信息洪流”之中,因而无可避免的被它上面泛滥的信息所“裹挟”,也就是说,社会化媒体上的信息对现实世界中的每个人都有重大影响,社会化媒体是我们间接了解现实客观世界和主观世界的一面窗户,我们每时每刻都在受到它的影响。

    综合上述两类情形,可以得出这样的结论,透过社会化媒体,我们可以观察现实世界:

    由此, 社会化媒体是现实主客观世界的一面镜子,而它也会进一步影响人们的行为,如果我们对该领域中的优质媒体所发布的信息进行分析,除了可以了解该领域的发展进程和现状,还可以对该领域的人群行为进行一定程度的预判。

    鉴于此种情况,作为互联网从业者的笔者想分析一下互联网行业的一些现状,于是想到了虎嗅网。

    虎嗅网创办于2012年5月,是一个聚合优质创新信息与人群的新媒体平台。该平台专注于贡献原创、深度、犀利优质的商业资讯,围绕创新创业的观点进行剖析与交流。虎嗅网 的核心,是关注互联网及传统产业的融合、一系列明星公司(包括公众公司与创业型企业)的起落轨迹、产业潮汐的动力与趋势。

    因此,对该平台上的发布内容进行分析,对于研究互联网的发展进程和现状有一定的实际价值。

    1.2 本文的分析目的

    笔者在本项目中的分析目的主要有4个:

    (1)对虎嗅网内容运营方面的若干分析,主要是对发文量、收藏量、评论量等方面的描述性分析;

    (2)通过文本分析,对互联网行业的一些人、企业和细分领域进行趣味性的分析;

    (3)展现文本挖掘在数据分析领域的实用价值;

    (4)将杂芜无序的结构化数据和非结构化数据进行可视化,展现数据之美。

    1.3 分析方法---分析工具和分析类型

    本文中,笔者使用的数据分析工具如下:

    Python3.5.2(编程语言)

    Gensim(词向量、主题模型)

    Scikit-Learn(聚类和分类)

    Keras(深度学习框架)

    Tensorflow(深度学习框架)

    Jieba(分词和关键词提取)

    Excel(可视化)

    Seaborn(可视化)

    新浪微舆情(情绪语义分析)

    Bokeh(可视化)

    Gephi(网络可视化)

    Plotly(可视化)

    使用上述数据分析工具,笔者将进行2类数据分析:第一类是较为传统的、针对数值型数据的描述下统计分析,如阅读量、收藏量等在时间维度上的分布;另一类是本文的重头戏---深层次的文本挖掘,包括关键词提取、文章内容LDA主题模型分析、词向量/关联词分析、DTM模型、ATM模型、词汇分散图和词聚类分析。

    2 数据采集和文本预处理

    2.1 数据采集

    笔者使用爬虫采集了来自虎嗅网主页的文章(并不是全部的文章,但展示在主页的信息是主编精挑细选的,很具代表性),数据采集的时间区间为2012.05~2017.11,共计41,121篇。采集的字段为文章标题、发布时间、收藏量、评论量、正文内容、作者名称、作者自我简介、作者发文量,然后笔者人工提取4个特征,主要是 时间特征 (时点和周几)和 内容长度特征 (标题字数和文章字数),最终得到的数据如下图所示:

    2.2 数据预处理

    数据分析/挖掘领域有一条金科玉律:“Garbage in, Garbage out”,做好数据预处理,对于取得理想的分析结果来说是至关重要的。本文的数据规整主要是对文本数据进行清洗,处理的条目如下:

    (1) 文本分词

    要进行文本挖掘,分词是最为关键的一步,它直接影响后续的分析结果。笔者使用jieba来对文本进行分词处理,它有3类分词模式,即全模式、精确模式、搜索引擎模式:

    · 精确模式:试图将句子最精确地切开,适合文本分析;

    · 全模式:把句子中所有的可以成词的词语都扫描出来, 速度非常快,但是不能解决歧义;

    · 搜索引擎模式:在精确模式的基础上,对长词再次切分,提高召回率,适合用于搜索引擎分词。

    现以“新浪微舆情专注于社会化大数据的场景化应用”为例,3种分词模式的结果如下:

    【全模式】: 新浪/ 微舆情/ 新浪微舆情/ 专注/于/ 社会化/ 大数据/ 社会化大数据/ 的/ 场景化/ 应用

    【精确模式】: 新浪微舆情/ 专注/于/ 社会化大数据/ 的/ 场景化/ 应用

    【搜索引擎模式】:新浪,微舆情,新浪微舆情,专注,于,社会化,大数据,社会化大数据,的,场景化,应用

    为了避免歧义和切出符合预期效果的词汇,笔者采取的是精确(分词)模式。

    (2) 去停用词

    这里的去停用词包括以下三类:

    标点符号:, 。! /、*+-

    特殊符号:▲等

    无意义的虚词: “the”、“a”、“an”、“that”、“你”、“我”、“他们”、“想要”、“打开”、“可以”等

    (3) 去掉高频词、稀有词和计算Bigrams

    去掉高频词、稀有词是针对后续的主题模型(LDA、ATM)时使用的,主要是为了排除对区隔主题意义不大的词汇,最终得到类似于停用词的效果。

    Bigrams是为了自动探测出文本中的新词,基于词汇之间的共现关系---如果两个词经常一起毗邻出现,那么这两个词可以结合成一个新词,比如“数据”、“产品经理”经常一起出现在不同的段落里,那么,“数据_产品经理”则是二者合成出来的新词,只不过二者之间包含着下划线。

    3 描述性分析

    该部分中,笔者主要对数值型数据进行描述性的统计分析,它属于较为常规的数据分析,能揭示出一些问题,做到知其然。

    3.1 发文数量、评论量和收藏量的变化走势

    从下图可以看出,在2012.05~2017.11期间,以季度为单位,主页的发文数量起伏波动不大,在均值1800上下波动,进入2016年后,发文数量有明显提升。

    此外,一头(2012年第二季)一尾(2017年第四季)因为没有统计完全,所以发文数量较小。

    下图则是该时间段内收藏量和评论量的变化情况,评论量的变化不愠不火,起伏不大,但收藏量一直在攀升中,尤其是在2017年的第二季达到峰值。收藏量在一定程度上反映了文章的干货程度和价值性,读者认为有价值的文章才会去保留和收藏,反复阅读,含英咀华,这说明虎嗅的文章质量在不断提高,或读者的数量在增长。

    3.2 发文时间规律分析

    笔者从时间维度里提取出“周”和“时段”的信息,也就是开题提到的“人工特征”的提取,现在做文章分布数量的在“周”和“时”上的交叉分析,得到下图:

    上图是一个热力图,色块颜色上的由暖到冷表征数值的由大变小。很明显的可以看到,中间有一个颜色很明显的区域,即由“6时~19时”和“周一~周五”围成的矩形,也就是说,发文时间主要集中在工作日的白天。另外,周一到周五期间,6时~7时这个时间段是发文的高峰,说明虎嗅的内容运营人员倾向于在工作日的清晨发布文章,这也符合它的人群定位---TMT领域从业、创业者、投资人,他们中的许多人有晨读的习惯,喜欢在赶地铁、坐公交的过程中阅读虎嗅讯息。发文高峰还有9时-11时这个高峰,是为了提前应对读者午休时间的阅读,还有17时~18时,提前应对读者下班时间的阅读。

    3.3 相关性分析

    笔者一直很好奇,文章的评论量、收藏量和标题字数、文章字数是否存在统计学意义上的相关性关系。基于此,笔者绘制出能反映上述变量关系的两张图。

    首先,笔者做出了标题字数、文章字数和评论量之间的 气泡图 (圆形的气泡被六角星替代,但本质上还是气泡图)。

    上图中,横轴是文章字数,纵轴是标题字数,评论数大小由六角星的大小和颜色所反映,颜色越暖,数值越大,五角星越大,数值越大。从这张图可以看出,文章评论量较大的文章,绝大部分分布于由文章字数6000字、标题字数20字所构成的区域内。虎嗅网上的商业资讯文章大都具有原创、深度的特点,文章篇幅中长,意味着能把事情背后的来龙去脉论述清楚,而且标题要能够吸引人,引发读者的大量阅读,合适长度标题和正文篇幅才能做到这一点。

    接下来,笔者将收藏量、评论量和标题字数、文章字数绘制成一张3D立体图,X轴和Y轴分别为标题字数和正文字数,Z轴为收藏量和评论量所构成的 平面 ,通过旋转这个3维的Surface图,我们可以发现收藏量、评论量和标题字数、文章字数之间的相关关系。

    注意,上图的数值表示和前面几张图一样,颜色上的由暖到冷表示数值的由大到小,通过旋转各维度的截面,可以看到在正文字数5000字以内、标题字数15字左右的收藏量和评论量形成的截面出现“华山式”陡峰,因而这里的收藏量和评论量最大。

    3.4 城市提及分析

    在这里,笔者通过构建一个包含全国1~5线城市的词表,提取出经过预处理后的文本中的城市名称,根据提及频次的大小,绘制出 一张反映城市提及频次的地理分布地图 , 进而间接地了解各个城市互联网的发展状况(一般城市的提及跟互联网产业、产品和职位信息挂钩,能在一定程度上反映该城市互联网行业的发展态势)。

    上图反映的结果比较符合常识,北上深广杭这些一线城市的提及次数最多,它们是互联网行业发展的重镇。值得注意的是,长三角地区的大块区域(长江三角洲城市群,它包含 上海 , 江苏省 的 南京 、 无锡 、 常州 、 苏州 、 南通 、 盐城 、 扬州 、 镇江 、 泰州 , 浙江省 的 杭州 、 宁波 、 嘉兴 、 湖州 、 绍兴 、 金华 、 舟山 、 台州 , 安徽省 的 合肥 、 芜湖 、 马鞍山 、 铜陵 、 安庆 、 滁州 、 池州 、 宣城 )呈现出较高的热度值,直接说明这些城市在虎嗅网各类资讯文章中的提及次数较多,结合国家政策和地区因素,可以这样理解地图中反映的这个事实:

    长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。

    长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。

    接下来,笔者将抽取文本中城市之间的 共现关系 ,也就是城市之间两两同时出现的频率,在一定程度上反映出城市间经济、文化、政策等方面的相关关系,共现频次越高,说明二者之间的联系紧密程度越高,抽取出的结果如下表所示:

    将上述结果绘制成如下动态的流向图:

    由于虎嗅网上的文章大多涉及创业、政策、商业方面的内容,因而这种城市之间的共现关系反映出城际间在资源、人员或者行业方面的关联关系,本动态图中,主要反映的是北上广深杭(网络中的枢纽节点)之间的相互流动关系和这几个一线城市向中西部城市的单向流动情形。流动量大、交错密集的区域无疑是中国最发达的3个城市群和其他几个新兴的城市群:

    京津冀城市群

    长江三角洲城市群

    珠江三角洲城市群

    中原城市群

    成渝城市群

    长江中游城市群

    上面的数据分析是基于数值型数据的描述性分析,接下来,笔者将进行更为深入的文本挖掘。

    4 文本挖掘

    数据挖掘是从有结构的数据库中鉴别出有效的、新颖的、可能有用的并最终可理解的模式;而文本挖掘(在文本数据库也称为文本数据挖掘或者知识发现)是从大量非结构的数据中提炼出模式,也就是有用的信息或知识的半自动化过程。

    本文的文本挖掘部分主要涉及高频词统计/关键词提取/关键词云、文章标题聚类、文章内容聚类、文章内容LDA主题模型分析、词向量/关联词分析、ATM模型、词汇分散图和词聚类分析。

    4.1 关键词提取

    对于关键词提取,笔者没有采取词频统计的方法,因为词频统计的逻辑是:一个词在文章中出现的次数越多,则它就越重要。因而,笔者采用的是 TF-IDF (termfrequency–inverse document frequency)的关键词提取方法:

    它用以评估一字/词对于一个文件集或一个语料库中的其中一份文件的重要程度,字/词的重要性会随着它在文件中出现的次数成正比增加,但同时会随着它在语料库中出现的频率成反比下降。

    由此可见,在提取某段文本的关键信息时,关键词提取较词频统计更为可取,能提取出对某段文本具有重要意义的关键词。

    下面是笔者利用jieba在经预处理...

  • ?

    关于数据分析那些事,看这一篇文章就够了

    Shi

    展开

    目录」

      1.什么是数据分析;

      2.数据分析职业介绍;

      3.数据分析生涯规划;

      4.数据分析薪酬情况;

      5.数据分析基本素质;

    一、到底什么是数据分析呢?

      数据分析是基于商业目的,有目的的进行收集、整理、加工和分析数据,提炼有价信息的一个过程。

      ▊其过程概括起来主要包括:明确分析目的与框架、数据收集、数据处理、数据分析、数据展现和撰写报告等6个阶段。

      1、明确分析目的与框架

      一个分析项目,你的数据对象是谁?商业目的是什么?要解决什么业务问题?数据分析师对这些都要了然于心。

      基于商业的理解,整理分析框架和分析思路。例如,减少新客户的流失、优化活动效果、提高客户响应率等等。不同的项目对数据的要求,使用的分析手段也是不一样的。

      2、数据收集

      数据收集是按照确定的数据分析和框架内容,有目的的收集、整合相关数据的一个过程,它是数据分析的一个基础。

      3、数据处理

      数据处理是指对收集到的数据进行加工、整理,以便开展数据分析,它是数据分析前必不可少的阶段。这个过程是数据分析整个过程中最占据时间的,也在一定程度上取决于数据仓库的搭建和数据质量的保证。

      数据处理主要包括数据清洗、数据转化等处理方法。

      4、数据分析

      数据分析是指通过分析手段、方法和技巧对准备好的数据进行探索、分析,从中发现因果关系、内部联系和业务规律,为商业目提供决策参考。

      到了这个阶段,要能驾驭数据、开展数据分析,就要涉及到工具和方法的使用。其一要熟悉常规数据分析方法,最基本的要了解例如方差、回归、因子、聚类、分类、时间序列等多元和数据分析方法的原理、使用范围、优缺点和结果的解释;其二是熟悉1+1种数据分析工具,Excel是最常见,一般的数据分析我们可以通过Excel完成,后而要熟悉一个专业的分析软件,如数据分析工具SPSS/SAS/R/Matlab等,便于进行一些专业的统计分析、数据建模等。

      5、数据展现

      一般情况下,数据分析的结果都是通过图、表的方式来呈现,俗话说:字不如表,表不如图。。借助数据展现手段,能更直观的让数据分析师表述想要呈现的信息、观点和建议。。

      常用的图表包括饼图、折线图、柱形图/条形图、散点图、雷达图等、金字塔图、矩阵图、漏斗图、帕雷托图等。

      6、撰写报告

      最后阶段,就是撰写数据分析报告,这是对整个数据分析成果的一个呈现。通过分析报告,把数据分析的目的、过程、结果及方案完整呈现出来,以供商业目的提供参考。

      一份好的数据分析报告,首先需要有一个好的分析框架,并且图文并茂,层次明晰,能够让阅读者一目了然。结构清晰、主次分明可以使阅读者正确理解报告内容;图文并茂,可以令数据更加生动活泼,提高视觉冲击力,有助于阅读者更形象、直观地看清楚问题和结论,从而产生思考。

      另外,数据分析报告需要有明确的结论、建议和解决方案,不仅仅是找出问题,后者是更重要的,否则称不上好的分析,同时也失去了报告的意义,数据的初衷就是为解决一个商业目的才进行的分析,不能舍本求末。

    二、数据分析师职业介绍

      做数据分析前我们首先要明确分析目的和内容,对于数据分析师而言,他们的进阶需求无外乎是各个企业对数据分析师的职位要求。在前程无忧、中华英才网以及智联招聘上,我们随便搜索下数据分析的岗位信息,都能找到大量类似于下面的一些职位要求信息:

      ▊别看岗位职责,任职要求这么多,说白了主要就三点要求:

      1)对相关业务的理解;

      2)掌握一到二种数据分析工具;

      3)良好的沟通。

      可能不同的公司因为需求不同,会在要求上有点小小的不同,而这个不同主要集中在数据库上。了解数据分析师的具体需求之前,我们有必要先了解数据分析师的职位体系。

    「数据分析师的职位体系」

      在传统行业中,数据分析更多存在移动、银行、超市等行业,在这些行业中你才会偶尔听到数据分析师这个职位,也许更多是听到数据挖掘工程师、数据建模师。在中国也许只在电信的项目中,才会存在真正的意义上的数据挖掘。

      ▊数据行业从广义上讲可以分为以下几个职位:

      1、数据分析师

      更注意是对数据、数据指标的解读,通过对数据的分析,来解决商业问题。主要有以下几个次层次:

      1)业务监控:诊断当前业务是否正常?是否存在问题?业务发展是否达到预期(KPI)?如果没有达到预期,问主要问题在哪?是什么原因引起的?

      2)建立分析体系:这些数据分析师已经对业务有一定的理解,对业务也相对比较熟悉,更多帮业务方建立一套分析体系,或者更高级是做成数据产品。例如:营销活动。分析师会告诉业务方,在活动前你应该分析哪些数据,从而制定恰当的营销计划。在营销过程中,你应该看哪些数据,从而及时做出营销活动调整。在营销活动,应该如何进行活动效果评估。

      3)行业未来发展的趋势分析:这应该是数据分析师最高级别,有的公司叫做战略分析师/商业分析师。这个层次的数据分析师站的更高,在行业、宏观的层面进行业务分析,预测未来行业的发展,竞争对手的业务构成,帮助公司制定战略发展计划,并及时跟踪、分析市场动态,从而及时对战略进行不断优化。

       主要技能要求:

      数据库知识(SQL至少要熟悉)、基本的统计分析知识、EXCEL要相当熟悉,对SPSS或SAS有一定的了解,对于与网站相关的业务还可能要求掌握GA等网站分析工具,当然PPT也是必备的。

      2、数据挖掘工程师

      更多是通过对海量数据进行挖掘,寻找数据的存在模式、或者说规律,从而通过数据挖掘来解决具体问题。数据挖掘更多是针对某一个具体的问题,是以解决具体问题为导向的。例如:聚类分析,通过对于会员各种人口统计学、行为数据进行分析,对会员进行分类,对不同的类型的会员建立相应的profiling,从而更好的理解会员,知道公司会员是到底如何?高、中、低低价值的会员构成,既可以后期各种会员的运营提供指导,提高活动效率,可以指导公司的营销,例如广告的投放策略。以及用于公司各种战略的制定。

       主要技能要求:

      1)数据库必须精通。很多时候,你模型的数据预处理,可能完成在数据库里完成,你用到的数据库技巧更高。

      2)必须要会成熟的数据挖掘工具、数据挖掘算法,例如:SPSS/CELEMENTINE、SAS/EM等,当然如果你会一、二款开源软件,并会写一些程序代码那是最好的,大公司都喜欢用开源的软件,例如:R、WEKA。

      3、数据建模师

      这个职位与数据挖掘工程师还是有本质区别的。数据建模师,更多偏向于中、小数据量,而且其使用更多更多是统计学的方法,而数据挖掘中的例如:决策树、神经网络、SVM等在这里是根据不会涉及的。

      当然二者有一个共同之处都是,针对很具体的问题,都是会解决某个具体问题,例如:营销反应率,你就可能历史的邮箱、短信的反应情况,来建模型进行预测,从而提高邮件反应率,或者减少对用户来说的“垃圾”邮箱,提高用户体验。所以从掌握的技能上讲,这二者就有很大的区别,数据建模师其实很少会提到算法这个词,更多说使用什么模型,有感觉吗?但是从实务界来看,这二个模型越来越没有明确的分工,一般来说都会二个职位的人都会去学习对方的知识,所以这二个职位有合并的趋势,但在未来几年来,我觉得公司要招人的时候应该还是要有区别的。

      新进入数据行业的同学,可以根据自己的背景背景选择相应的职位,学数据、统计学的朋友更多可以偏向于建模师,而计算机特别是写编程出现和同学,可以走数据挖掘工程师,也许适应性更好,但这不是绝对的。

      ▊数据分析师的职位级别划分:

      不同公司对数据分析师的职位划分骚有不同,在一些中小型企业,没有成立独立的数据中心前,数据分析的相关职位往往是在譬如市场部、运营部这些部门之下,通常数据分析成员在2-4人不等。对于一些大型企业,有独立的数据部门的企业,其数据分析团队人员则是十到百人不等,其职位头衔有通俗的总监、经理、主管划分,也有助理、资深、专家之类的划分。下面是一张微博上传的比较火的某集团的数据分析师职位级别划分图表,大家可根据自身的情况对号入座。

    「下图来自微博阿里的朋友分享」

    (单击图片可缩放查看大图)

    三、数据分析职业生涯规划

      ▊按照不同分析方法所能给人带来的智能程度,可以把分析能力划分为以下8个等级:

      上面的8级划分源自SAS网站的Eight levels of analytics,由IDMer编译而成,个人觉得其中的8张图片非常形象生动,网友@数据小宇军用两个图表将它们更好地展示出来了:

      ▊数据分析师的级别:

      1、数据跟踪员:机械拷贝看到的数据,很少处理数据

      虽然这个工作的人还不能称作数据分析师,但是往往作这样工作的人还都自称是数据分析师,这样的人,只能通过×××系统看到有限的数据,并且很少去处理数据,甚至不理解数据的由来和含义,只是机械的把自己看到的数据拷贝出来,转发给相应的人。这类人发出来的数据,是否有意义,怎么解读,他自己是不知道的,只能期望收到数据的人了。

      2、数据查询员/处理员:数据处理没问题,缺乏数据解读能力

      这些人可以称为分析师了,他们已经对数据有一定的理解了,对于大部分数据,他们也知道数据的定义,并且可以通过监控系统或者原始的数据,处理得到这些数据。统计学的方法,这批人还是很精通的,统计学的工具,他们也是用起来得心应手,你让他们做一下因子分析,聚类肯定是没问题,各类检验也是用的炉火纯青。他们的不足是:1、如果不告诉他们命题,那么他们就不知道该应用什么样的方法去得到结论了。2、对于数据的处理没问题,但是却...

分析数据从哪几方面来看

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP