中企动力 > 商学院 > 数据分析软件需求
  • ?

    大数据分析需要五大基本资源!

    石沅

    展开

    在网络,移动设备,传感器,社交媒体,交易应用程序,日志文件,大数据等实时数据泛滥的情况下,发现了大量垂直市场应用程序,从诈骗检测到科学研究。无论涉及重大隐私问题或企业困难的挑战如何,仅在2017年,大数据投资就获得超过570亿美元的增长势头。预计未来三年的投资将以约10%的年增长率进行增长。

    大数据分析所需的基本资源

    大数据咨询已成为软件开发服务提供商的可行选择。无论是营销还是品牌实施的新产品,公司都不会轻易作出决定。当提到任何重大举措时,企业都会寻找他们客户提供的数据,以确保公司正朝着观众遵循的方向发展。

    从点击流数据到购物车上的信息,都有大量的材料需要筛选,这就是为什么企业支付高价值的大数据咨询服务才能理解这一切。对于新职业市场的人来说,大数据分析是一个不错的选择。 当然,必须熟悉开始处理数字所需的技能和工具。

    大数据分析所需的五个资源如下:

    1.完成MATLAB Mastery Bundle

    MATLAB或Matrix是一个多范型数字计算空间和编程语言。用外行人的话来说,它是一种工具,它使得编写代码,运行脚本以及执行数据分析和可视化等任务变得轻松易懂,从而解决复杂问题,而这些代码还不那么复杂。

    2. Python Power Code BONUS Bundle

    市场上有许多重要的编程语言可供选择,数据分析师使用其日常任务和职责中的很多。但是,如果有人要先学习,那就是Python。 Python语言被誉为用户友好型以及直观性。此外,它拥有众多的功能,这使它能够处理数据争夺。 70小时的培训通过展示如何下载,提取,清理,汇总,分析和可视化数据,开始了编程教育。

    3.大数据和分析主工具包

    数据分析师和高级分析咨询人员使用大量的语言和工具来获取角色,这并不足为奇。这四个模块集合为数据库添加了四个重要的分析工具,即Minitab,SPSS,SAS和R Studio。

    4.使用Tableau Desktop 9 Bundle进行数据可视化

    通过交互式仪表板分析和呈现数据以完全挖掘信息的主要工具之一是Tableau 9.这个收集将使您了解Tableau。因此,可以开始创建自己的可视化数据。

    5.完整介绍R编程包

    R的核心是一种统计编程语言,它非常适合挖掘和分析数据。但是,它也具有高级图形和机器学习功能,在数据可视化和集成复杂算法方面提供了一些独特的优势。在五门课程和三本电子书中,收集指导通过要点使用R来充分发挥潜力。

    大数据优势

    大数据应用程序可让数据科学家,统计人员和其他分析专业人员分析越来越多的结构化数据以及其他形式的数据,而这些数据往往不被传统的商业情报和分析程序所利用。这涵盖了非结构化和半结构化数据的组合,例如互联网点击流数据,网络服务器日志以及来自客户电子邮件的文本,机器数据,社交媒体内容和通过连接的传感器到事物互联网的呼叫细节记录。

    在更大的范围内,数据分析技术迎合数据集分析的手段,并最终帮助企业做出充分知情的决策。商业智能查询回答关于业务绩效和操作的基本查询。大数据是一种高级分析,涉及复杂的应用程序元素,如预测模型,统计算法等。

    用数据咨询创造新的增长机会

    数据分析可以创造大量新的增长机会。此外,它甚至可能会产生一个新的业务类别,例如分析和汇总行业数据的类别。大多数企业将处于大量关于服务和产品,供应商和买家,消费者偏好和意图以及更多信息流的信息中。

    各行各业的企业都应该开始大力创造数据功能。除了广泛的数据外,数据的高频率和实时性也是至关重要的。通过数据分析,实践被更广泛地使用。

    今天的大数据和分析应用市场真是巨大。世界各地的软件开发服务提供商提供了大量的数据咨询工作。现在,大数据体验意味着更有可能从软件开发组织获得有利可图的工作。市场很大,有一系列的项目,交易,服务和合作关系。咨询服务可能会有所不同,具体取决于组织的特定要求,以及需要利用数据分析和解决方案的功能,这些功能可以简化业务流程。

  • ?

    大数据常用软件工具与应用场景

    断续

    展开

    如今,大数据日益成为研究行业的重要研究目标。面对其高数据量、多维度与异构化的特点,以及分析方法思路的扩展,传统统计工具已经难以应对。

    工欲善其事,必先利其器。众多新的软件分析工具作为深入大数据洞察研究的重要助力, 也成为数据科学家所必须掌握的知识技能。

    然而,现实情况的复杂性决定了并不存在解决一切问题的终极工具。实际研究过程中,需要根据实际情况灵活选择最合适的工具(甚至多种工具组合使用),才能更好的完成研究探索。

    为此,本文针对研究人员(非技术人员)的实际情况,介绍当前大数据研究涉及的一些主要工具软件(因为相关软件众多,只介绍常用的),并进一步阐述其应用特点和适合的场景,以便于研究人员能有的放矢的学习和使用。

    -基础篇-

    01 传统分析/商业统计

    Excel、SPSS、SAS 这三者对于研究人员而言并不陌生。

    Excel作为电子表格软件,适合简单统计(分组/求和等)需求,由于其方便好用,功能也能满足很多场景需要,所以实际成为研究人员最常用的软件工具。其缺点在于功能单一,且可处理数据规模小(这一点让很多研究人员尤为头疼)。这两年Excel在大数据方面(如地理可视化和网络关系分析)上也作出了一些增强,但应用能力有限。

    SPSS(SPSS Statistics)和SAS作为商业统计软件,提供研究常用的经典统计分析(如回归、方差、因子、多变量分析等)处理。SPSS轻量、易于使用,但功能相对较少,适合常规基本统计分析

    SAS功能丰富而强大(包括绘图能力),且支持编程扩展其分析能力,适合复杂与高要求的统计性分析。

    上述三个软件在面对大数据环境出现了各种不适,具体不再赘述。但这并不代表其没有使用价值。如果使用传统研究方法论分析大数据时,海量原始数据资源经过前期处理(如降维和统计汇总等)得到的中间研究结果,就很适合使用它们进行进一步研究。

    02 数据挖掘

    数据挖掘作为大数据应用的重要领域,在传统统计分析基础上,更强调提供机器学习的方法,关注高维空间下复杂数据关联关系和推演能力。代表是SPSS Modeler(注意不是SPSS Statistics,其前身为Clementine)

    SPSS Modeler的统计功能相对有限, 主要是提供面向商业挖掘的机器学习算法(决策树、神经元网络、分类、聚类和预测等)的实现。同时,其数据预处理和结果辅助分析方面也相当方便,这一点尤其适合商业环境下的快速挖掘。不过就处理能力而言,实际感觉难以应对亿级以上的数据规模。

    另一个商业软件 Matlab也能提供大量数据挖掘的算法,但其特性更关注科学与工程计算领域。而著名的开源数据挖掘软件Weka,功能较少,且数据预处理和结果分析也比较麻烦,更适合学术界或有数据预处理能力的使用者。

    -中级篇-

    01 通用大数据可视化分析

    近两年来出现了许多面向大数据、具备可视化能力的分析工具,在商业研究领域,TableAU无疑是卓越代表。

    TableAU的优势主要在于支持多种大数据源/格式,众多的可视化图表类型,加上拖拽式的使用方式,上手快,非常适合研究员使用,能够涵盖大部分分析研究的场景。不过要注意,其并不能提供经典统计和机器学习算法支持, 因此其可以替代Excel, 但不能代替统计和数据挖掘软件。另外,就实际处理速度而言,感觉面对较大数据(实例超过3000万记录)时,并没有官方介绍的那么迅速。

    02 关系分析

    关系分析是大数据环境下的一个新的分析热点(比如信息传播图、社交关系网等),其本质计算的是点之间的关联关系。相关工具中,适合数据研究人员的是一些可视化的轻量桌面型工具,最常用的是Gephi。

    Gephi是免费软件,擅长解决图网络分析的很多需求,其插件众多,功能强且易用。我们经常看到的各种社交关系/传播谱图, 很多都是基于其力导向图(Force directed graph)功能生成。

    但由于其由java编写,限制了处理性能(感觉处理超过10万节点/边时常陷入假死),如分析百万级节点(如微博热点传播路径)关系时,需先做平滑和剪枝处理。 而要处理更大规模(如亿级以上)的关系网络(如社交网络关系)数据,则需要专门的图关系数据库(如GraphLab/GraphX)来支撑了,其技术要求较高,此处不再介绍。

    03 时空数据分析

    当前很多软件(包括TableAU)都提供了时空数据的可视化分析功能。但就使用感受来看,其大都只适合较小规模(万级)的可视化展示分析,很少支持不同粒度的快速聚合探索。

    如果要分析千万级以上的时空数据,比如新浪微博上亿用户发文的时间与地理分布(从省到街道多级粒度的探索)时,推荐使用 NanoCubes(http://nanocubes/)。该开源软件可在日常的办公电脑上提供对亿级时空数据的快速展示和多级实时钻取探索分析。下图是对芝加哥犯罪时间地点的分析,网站有更多的实时分析的演示例子。

    04 文本/非结构化分析

    基于自然语言处理(NLP)的文本分析,在非结构化内容(如互联网/社交媒体/电商评论)大数据的分析方面(甚至调研开放题结果分析)有重要用途。其应用处理涉及分词、特征抽取、情感分析、多主题模型等众多内容。

    由于实现难度与领域差异,当前市面上只有一些开源函数包或者云API(如BosonNLP)提供一些基础处理功能,尚未看到适合商业研究分析中文文本的集成化工具软件(如果有谁知道烦请通知我)。在这种情况下,各商业公司(如HCR)主要依靠内部技术实力自主研发适合业务所需的分析功能。

    -高级篇-

    前面介绍的各种大数据分析工具,可应对的数据都在亿级以下,也以结构化数据为主。当实际面临以下要求: 亿级以上/半实时性处理/非标准化复杂需求,通常就需要借助编程(甚至借助于Hadoop/Spark等分布式计算框架)来完成相关的分析。 如果能掌握相关的编程语言能力,那研究员的分析能力将如虎添翼。

    当前适合大数据处理的编程语言,包括:前面的内容介绍了面向大数据研究的不同工具软件/语言的特点和适用场景。 这些工具能够极大增强研究员在大数据环境下的分析能力,但更重要的是研究员要发挥自身对业务的深入理解,从数据结果中洞察发现有深度的结果,这才是最有价值的。

    End.

    来源:网络大数据

  • ?

    做优秀报表?明确数据分析的三层需求

    聂箴

    展开

    为什么有的报表好用,有的报表不好用,有的企业会做一堆乱七八糟的报表,最近经常会思考这些问题。

    有人说数据分析,为了开源节流,这个没有错,今天我从另外一个角度解读。数据分析,是为了应对风险(说明:风险与机会是一起的。PMI中将其共同列为风险管理,本文所有风险与机会同义),开源节流的每一次操作每一个节点,也是风险。

    企业经营,风里来雨里去,免不了碰到大大小小的机会和风险,抓住机会躲避风险是每个企业以及个人的毕生追求。

    PMI中将风险归为以下几类:

    已知的已知风险

    未知的已知风险

    未知的未知风险。

    本文将数据分析,也归纳为三层需求

    第一层需求:应对已知的已知风险

    可以将这一层需求看作为被动使用的数据,拿零售行业的场景举例:

    采购员要进行采购,没有数据作为参考,只能进行盲目采购,那商店的缺断货、商品积压的风险一定出现。所以采购员需要通过数据查看各类商品的销售情况、库存情况、可售天数情况进行判断,以此决定采购需求,避免错误的商品采购所导致的商品缺断货、高库存等风险。此为通过数据来应对已知的已知风险。

    对于企业之中,这类的应用特别多,多到部分企业会忽略这是一种数据分析的应用。企业中常用的业务系统比如erp等软件系统,也会自带一些简单的数据查看类报表,其作用也是很大程度上来应对这一类风险。

    但是,从另一个角度去看,这类风险的应对也有很大的优化空间:

    风险应对的效率:提升风险应对的效率,是提升应用标准化的一个体现,当一个应用难以使用时,容易造成人员惰性,取巧而放弃使用,从而提高了风险发生的概率。

    复杂的已知的已知风险的应对:绝大部分企业并没有将数据覆盖所有的已知风险,举例:新品的引进,新品的引进为商店带来新的盈利点,但是错误的引进甚至会带来负面效应。大部分企业的新品引进并没有一个很好的方案来应对:通过数据进行品类关联并对比,可以看出本店铺对于市场上销量靠前的商品的缺货情况,本店已有商品的市场占有情况,从而可以优化新品引进的策略。这一类的应用还有很大的空间,这也就是为什么很多企业乐于同行之间的交流,希望彼此可以互通有无,发现类似数据场景的应用。

    第二层需求:应对未知的已知风险

    这一类数据一般为主动使用的数据,更多的是周期性使用的数据,常见的比如领导们常看的日报表、周报表等。

    企业的风险发生的概率是分布在每一天的,但是它每一天都可能发生也可能不发生,例如部分员工的消极怠工、部分商品的质量异常、个别门店突然面临的对手竞争等。这一类风险当然是希望在发生的最短时间内就可以发现并且应对。所以企业中产生了大量的这一类型的报表需求。

    这类报表也很常见,但是他们价值的体现不如第一层需求类来的直接,这一类报表经常被浏览,但大部分情况是没有发现风险的,所以有时会产生一种这类报表没什么用的感觉。

    在我们所遇到的项目中,这类需求报表占比是很多的,也是争议最大的。领导层所需要看的日/周/月报类报表相对还好,毕竟是每天都会有人看,并且作为企业数据监督和追踪的一种形式。

    此外,还会有很多分析类的报表也属于这一层级,比如商品的价格带分析:找到某类商品的价格点,对比销售高点或销量高点,从而发现可能的商品价格分布的不合理或者货架摆放位置的不合理(价格点商品附近陈列丰富的商品可以给顾客带来商品丰富的感觉)。进一步调整商品价格分布以应对商品陈列或者价格分布的风险(机会)。

    这类报表的应用难度比较大,因为经验或者知识储备的不同,对风险的认知和识别能力不同。同样以上面的价格带分析报表为例,其目的为应对陈列、商品价格分布、商品引进/采购、目标活动人群选择的风险。但是使用报表的业务人员没有形成对这些风险(机会)的认知,就造成了缺乏对该报表的数据解读能力,该报表便成为了一个花瓶报表,价值无法得到体现。

    针对这一类报表,我的建议是场景化,让每一张报表背后都有它的风险机会描述,当自我不能解读的报表,也就不要指望业务可以解读并使用,并不是将一堆的指标都进行展示就能产生价值,它于落地的应用还相隔甚远。

    第三层需求:应对未知的未知风险

    这类需求近些年来大量出现,大数据概念被大多数人所重视也很大程度上是因为这一类需求。

    风险的不可预测性使得大量人群希望通过技术的手段来帮助识别和发现风险。比如很多人希望通过聚类这类算法的应用,来形成用户画像,发现自己之前无法发现的特性,或者通过对商品关联的挖掘,发现未知的商品关联关系,从而调整商品布局以发现巨大的商机,比如“啤酒与尿布”(不知真伪)。

    但是这类需求实现难度巨大,目前还属于少数互联网公司的专利,对于大多数企业尤其是传统企业而言,其实现成本是难以接受的,个别数据乙方可能会以此为诱饵进行宣讲,但就我所了解到的还难以形成很好的应用。

    但是第三层需要要怎样处理?无论是机器还是算法很多都是对人对模拟,只是拥有更快的速度而已,所以相信通过人的作用可以弥补这一类需求。

    同样以商品模块举例:除了我已知的商品价格、布局风险外,通过对商品价格分布那张报表的分析,发现在非价格点的价位(比如是10元)销量比正常值都高,正常情况10元价格商品的销量是价格点商品销量的1/5,但是报表显示这一期间的比例高达了1/3,通过进一步分析,发现是由于某一天活动对该商品进行打折促销,从而该商品销量上升,再进一步分析该商品的销量上升并没有给企业带来业绩的上升,该商品的周边商品销量基本没有变化,也就是该商品的连带率是很低的,同时该商品库存并非临保商品。通过调查发现是店长和供应商的私下协议而采取的促销行为。

    以上只是举例,通过人的思考可以发现很多的未知的未知风险。这也就是近些年来bi产品的出现的原因,bi产品希望能够给业务人员一个灵活的数据应用环境,让他们的思考得到延伸和数据上的支持,从而应对未知的未知风险。

    当然,理想情况如此,很多企业并没有将bi产品应用成为以上的价值。原因很多,主要的是包括业务人员没有分析意识、没有一个很好的分析入口(不做进一步解读)。

    综上:

    我将对数据分析的需求分为三层,每一层的使用难度也都有不同,越向后越容易产生“这个报表没什么用”的感觉。现实中,也有很大程度上确实是这个报表没法用,因为很多it人员也并没有理解我做好的报表是为了解决什么样的问题,只知道这个指标有用,我就展示给你看。所以这样的报表可能真的很难用。

    我觉得,让数据发挥它的价值,可以尝试将数据与风险相关联,对风险进行数据化的解读,从而来让报表更加落地,更加可用。

    ps:一切的文章都是我当时的想法,不能作为知识来解读,大家尽做参考,欢迎交流。

    End.

  • ?

    软件工程项目需求分析怎么写?需求分析模板和写法详解

    夜已深

    展开

    写需求分析之前,要先了解需求分析的定义和目的。看看百科是怎么说的:需求分析也称为软件需求分析、系统需求分析或需求分析工程等,是开发人员经过深入细致的调研和分析,准确理解用户和项目的功能、性能、可靠性等具体要求,将用户非形式的需求表述转化为完整的需求定义,从而确定系统必须做什么的过程。

    需求分析,可以理解为对用户/客户的需求的分析。也即是开发人员,要弄懂用户想要的是什么,重点在用户的需求。

    需求分析文档名的命名格式,可以参考如下格式:需求分析说明书_某系统_版本号_日期

    如:需求分析说明书_某网上商城服务系统_V5.0_20180119。

    软件工程的需求文档,通常使用word来编写。

    需求分析于软件生命周期

    文章下面内容等,将从一个真实需求分析说明书着手解析。并非所有需求文档均需按此结构和内容。

    需求分析文档主要应包含以下模块,对每个模块,主要需要编写的内容也将给出。

    正文前:修订记录,目录,引言和引用文件

    首先在这些之前,你还需要弄一个封面,封面内容是这个文档的名称,加上如日期,公司名称这些信息。

    修订记录

    列一个含版本号、修订人、修订时间、修订内容记录的表格,每一次进行较大更新时,都应进行记录。

    目录

    目录自动生成即可。每次更新内容,记得更新目录就可以了。

    引言

    引言中包含了“标识”、“数据库概述”、“文档概述”。

    标识即是通过标识号,说明这个文档的属性。如图

    数据库概述需要包含数据库的运行环境,如ORACLE11g。以及涉及到的数据管理问题,同时可以对数据库设备等做一个简单的要求描述。

    文档概述顾名思义,对文档进行简单说明。参考如下:

    “本需求分析说明书是通过规范文档的方式与客户方界定系统的开发范围,同时作为开发人员和测试人员进行系统分析、设计、开发和测试的依据。

    本文对业务需求进行描述,在理解业务的基础上编写需求全景分析描述,提供活动图、业务用例图、及用例过程描述,用于系统建设前期达成统一的建设目标和实现方式”

    引用文件

    文档中涉及引用到的文件,都可以写在这里。而一般而言,你们的投标文件、总体技术方案、实施方案等自然是这里必备的内容。

    业务概述

    业务概述从目标、业务内容、运行环境、关键点、用户特点、技术约束几个方面来写。

    目标

    目标往往就是投标文件或是招标文件的建设目标,也就是这个项目需要完成的事情,需要达到什么效果。

    业务内容

    业务内容主要是对目标的一种详细化,简述目标中的子系统,每个系统包含的大体内容。如建设统一用户管理平台。

    运行环境

    运行环境可以根据内外网等不同进行划分。表达形式上可以参考下图。

    某系统网络运行环境

    关键点

    关键点可以从业务关键点和技术关键点进行切入。如需要满足一定量的高并发、某些业务需要特定的流程等,都可以列条文字表达。这只需要对关键点进行简单罗列和说明即可,不需要写实现方式之类的东西。

    用户特点

    一般来说,用户为pc端,app端等。也有可能有的为自然人,有的人企业/团队,根据自己项目的特点,进行罗列,简单说明他们的区别。

    技术约束

    技术约束可以挑选使用的技术中会对系统进行一定要求的技术来写。一般可以写该技术的概述、基础服务、架构特性和平台约束、

    前两点,根据自己使用技术内容,可以简单完成。后面的架构特性,则是一个从软件层面,一个从硬件层面来阐述。

    下图为SSH下的软件架构可放的图。

    SSH软件架构图

    硬件方面,可以列出的物理设备的清单。如数据库服务器的配置要求,台数、应用服务器的此类要求等。

    功能需求

    功能需求是这个文档的主要内容部分,应占文档篇幅的60%以上。毕竟我们需求分析,主要还是要分析用户的需求的。

    在该大菜单下,需要对之前的建设目标进行分模块的编写。一般而言,除了列举目标中的建设子系统外,还需要加一个“应急系统”和“特殊说明”尾好。

    某一功能系统的功能需求列表

    对于每一种的图的内容,可以直接根据它的名字,在Visio中新建时,找到对应的图进行创建,参考网上搜索的样例进行创作。

    下图为角色用例实现图(仅供参考):

    某系统的用例实现图

    其他需求

    其他需求这里虽然是列举为一点,但是还是要一个列一个大的菜单。可以含“接口及数据需求”、“计算机资源需求”、“数据需求”和“操作需求”。

    接口及数据需求

    这里根据实际情况,列举需要接口和数据要求即可。最好是两个分开。

    计算机资源需求

    这里分计算机硬件需求和计算机软件需求。下图为参考目录结构。

    计算机资源需求

    数据需求

    数据需求则可以从数据量级、特殊数据的输入输出和数据预处理进行。这里需要根据自己项目情况,进行罗列和梳理。

    操作需求

    这里的操作需求可以是普通用户的,也可以是系统操作。如服务器维护,数据库维护等,都可以算是一种操作需求。

    故障处理、算法说明等

    这里的等,可以是下列内容:合格性规定、需求可最总行、尚未解决问题、注解和附录等内容。

    这里的内容一般为可选内容,不过像附录和注解这些,一般都是要有的。而算法等如果有则写,没有也可以不写。

    (如果觉得对你有帮助,希望可以支持一下哦,如需转载,请注明出处,作者:百家号:深海程序员)

  • ?

    大数据领域的12大工具,市面上主要的大数据分析工具都在这了!

    庸颜

    展开

    大数据工具让企业能够从数据仓库获得洞察力,从而在数据驱动的业务环境中提供重要的竞争优势。

    为了满足旺盛需求,大数据工具在迅速遍地开花。在大数据这一概念和业务战略出现以来的十年间,市面上出现了成千上万执行各种任务和流程的工具,它们都承诺可为你节省时间和资金,发掘业务洞察力从而实现创收。显然,一个不断增长的市场呈现在大数据分析工具的面前。

    其中许多工具一开始就像最初的大数据软件框架Hadoop那样是开源项目,但后来商业公司迅速涌现,为开源产品提供新工具或商业支持和开发。

    从中进行遴选可能很困难,尤其是许多大数据工具用途单一,而你可以用大数据处理许多不同的任务,所以你的分析工具箱会塞得满满当当。本文我们列出了市面上主要的大数据分析工具市面上主要的大数据分析工具,分三大?类别来介绍。

    ·主要的大数据工具·

    如前所述,大数据工具往往属于单一用途类别,而使用大数据有多种方式。所以我们将按类别细分,然后讨论每个类别的分析工具。

    一、大数据工具:数据存储和管理

    大数据完全始于数据存储,也就是说始于大数据框架Hadoop。它是Apache基金会运行的一种开源软件框架,用于在大众化计算机集群上分布式存储非常大的数据集。

    很显然,由于大数据需要大量的信息,存储至关重要。但除了存储外,还需要某种方式将所有这些数据汇集成某种格式化/治理结构,从而获得洞察力。因此,大数据存储和管理是真正的基础――离开了它,分析平台一无是处。在一些情况下,这些解决方案还包括员工培训。

    这个领域的大玩家包括:

    1. Cloudera

    实际上是增加了一些额外服务的Hadoop,你会需要它,因为大数据不容易搞。Cloudera的服务团队不仅可以帮助你构建大数据集群,还可以帮助培训你的员工,更好地访问数据。

    2. MongoDB

    MongoDB是最受欢迎的大数据数据库,因为它适用于管理经常变化的数据:非结构化数据,大数据常常是非结构化数据。

    3. Talend

    作为一家提供广泛解决方案的公司,Talend的产品围绕其集成平台而建,该平台集大数据、云、应用程序、实时数据集成、数据准备和主数据管理于一体。

    图1:Talend大数据集成平台包括数据质量和治理功能

    二、大数据工具:数据清理

    在你真正处理数据以获取洞察力之前,需要清理和转换数据,转换成可远程搜索的内容。大数据集往往是非结构化、无组织的,因此需要某种清理或转换。

    当下,数据可能来自任何地方:移动、物联网和社交媒体,数据清理显得更为必要。并非所有这些数据都可以轻松“清理”以获得洞察力,因此优秀的数据清理工具极其重要。实际上,在未来几年,预计经过有效清理的数据会是可接受的大数据系统与真正出色的大数据系统之间的竞争优势。

    4. OpenRefine

    OpenRefine是一款易于使用的开源工具,通过删除重复项、空白字段及??其他错误来清理凌乱的数据。它是开源的,但有一个相当大的社区可提供帮助。

    5. DataCleaner

    与OpenRefine一样,DataCleaner可将半结构化数据集转换成数据可视化工具可以读取的干净可读的数据集。该公司还提供数据仓库和数据管理服务。

    6. 微软Excel

    说真的,Excel有其用途。你可以从各种数据源导入数据。Excel在手动数据输入和复制/粘贴操作方面特别有用。它能消除重复项,查找和替换内容,检查拼写,还有用于转换数据的许多公式。但Excel很快陷入困境,不适合庞大数据集。

    三、大数据工具:数据挖掘

    一旦数据经过清理和准备,你可以通过数据挖掘开始搜索数据了。这时你执行这个实际的过程:发现数据、做出决定和进行预测。

    数据挖掘是大数据流程的真正核心。数据挖掘解决方案通常底层很复杂,但竭力提供 一种外观漂亮、对用户友好的用户界面,说起来容易做起来难。数据挖掘工具面临的另一个挑战是:它们确实需要人来编制查询,所以数据挖掘工具的好坏取决于使用它的专业人员。

    7. RapidMiner

    RapidMiner是一款易于使用的预测分析工具,有着对用户友好的可视化界面,这意味着你没必要编写代码即可运行分析产品。

    8. IBM SPSS Modeler

    IBM SPSS Modeler是一款包括五个数据挖掘产品的套件,面向企业级高级分析。另外IBM的服务和咨询首屈一指。

    9. Teradata

    Teradata为数据仓库、大数据和分析以及营销等应用提供端到端解决方案。这一切意味着贵公司可以真正成为数据驱动的公司,另外还有商业服务、咨询、培训和支持。

    图2:与许多目前的大数据工具一样,RapidMiner解决方案也支持云

    四、大数据工具:数据可视化

    数据可视化是指以一种可读、实用的格式显示你的数据。你可以查看图表图形以及直观显示数据的其他图像。

    数据可视化既是一门科学,又是一门艺术。随着大数据从有大批数据科学家支持的高管转移到整个公司上下,众多员工可以使用可视化工具极为重要。销售代表、IT支持和中层管理,这些团队个个都需要能够理解数据,因此重点放在易用性上。然而,易于阅读的可视化有时与来自深度特征集的数据读出相冲突,这带来了数据可视化工具面临的主要挑战之一。

    10. Tableau

    Tableau是该领域的领导者,其数据可视化工具专注于商业智能,无需懂得编程,即可创建各种地图、图表、图形及更多可视化元素。它共有五款产品,一款名为Tableau Public的免费版供潜在客户试用。

    11. Silk

    Silk是Tableau的简单版,让你可以通过地图和图表将数据可视化,无需任何编程。你在首次加载Silk时,它甚至会试着将数据可视化。它还让用户很容易在网上发布结果。

    12. Chartio

    Chartio使用自己的可视化查询语言,只要点击几下鼠标即可创建功能强大的仪表板,无需懂得SQL或其他建模语言。它有别于其他工具的地方主要在于,你可以直接连接到数据库,因此不需要数据仓库。

    13.IBM Watson Analytics

    IBM Watson Analytics结合了机器学习和人工智能,有助于提供智能数据科学助手,为业务分析员和数据科学家等拥有众多数据科学技能的用户扮演了向导。

    ·大数据工具的三个层次·

    普华永道的移动数据和分析计划首席技术官Ritesh Ramesh表示,就先进程度和市场战略而言,大数据工具可分成三层金字塔。

    第一层:最庞大的是一系列开源工具。每家公司以开源起家,像Cloudera和Hortonworks。除了基本的基础设施、服务器和存储外,没有多大的价值。大多数云厂商已将这一层实现了商品化。

    第二层:在这一层,大多数这类厂商已有意增加各自的市场份额,在开源工具上面构建一些专有应用程序,从而做到与众不同。举例说,Cloudera开发了许多产品,比如驻留在Hadoop核心上的数据科学平台。

    第三层:这些是针对特定垂直领域的应用程序。这些公司大多与普华永道、高知特或埃森哲等系统集成商合作。真正的价值出在这里,这对大数据工具开发商来说也是非常有效的竞争策略。

    Ramesh表示,除了基本功能外,这些工具的三大方面备受欢迎。首先是数据处理工具。他说:“数据学习工具是客户的工具箱中确保数据质量和分析数据的重要工具,比如处理5000万行数据以发现洞察力。”

    他表示,领先的厂商包括Trifacta、Paxata和Talend。

    第二大类应用程序是治理,比如你如何定义元数据。他说:“好多人在这方面遇到困难。人们只是将大量垃圾数据倒到数据湖。市面上可在数据湖中积极发挥功效的工具不多。由于这项工作主要由IT人员完成,他们更有兴趣将数据倒到数据湖,而不是确立一种治理结构。”

    主要厂商包括Waterline Data、以数据编目工具见长的Tamr和Collibra。

    Ramesh说,经常出现的第三大需求是安全。他说:“人们希望一个产品就有安全访问的所有层(列、行和对象)。他们希望一款产品为不同的数据对象支持用户访问和安全。这也是个新兴领域。”

    这个领域的主要厂商是Wandisco和FireEye。

    End.

    来源:网络大数据

    文章推荐

    一份高质量数据分析报告的三板斧

    如何完成一份高质量数据分析报告

    不同行业的软件都爱用什么编程语言开发?

  • ?

    为何数据分析需求大?从企业看数据价值!

    庾尔蓝

    展开

    本文是近年来不同行业、不同领域的大数据公司的一些经典案例总结和解析。虽然涉及国内国外各行各业,但其中的深层逻辑对于我们每个人都会有所启发。

    本文力图从企业运营和管理的角度,梳理出发掘大数据价值的一般规律:

    一是以数据驱动的决策,主要通过提高预测概率,来提高决策成功率;二是以数据驱动的流程,主要是形成营销闭环战略,提高销售漏斗的转化率;三是以数据驱动的产品,在产品设计阶段,强调个性化;在产品运营阶段,则强调迭代式创新。

    从谷歌、亚马逊、Facebook、LinkedIn,到阿里、百度、腾讯,都因其拥有大量的用户注册和运营信息,成为天然的大数据公司。

    而像IBM、Oracle、EMC、惠普这类大型技术公司纷纷投身大数据,通过整合大数据的信息和应用,给其他公司提供“硬件软件 数据”的整体解决方案。我们关注的重点是大数据的价值,第一类公司首当其冲。

    下面就是这些天然大数据公司的挖掘价值的典型案例。

    01 亚马逊的“信息公司”

    如果全球哪家公司从大数据发掘出了最大价值,截至目前,答案可能非亚马逊莫属。亚马逊也要处理海量数据,这些交易数据的直接价值更大。

    作为一家“信息公司”,亚马逊不仅从每个用户的购买行为中获得信息,还将每个用户在其网站上的所有行为都记录下来:页面停留时间、用户是否查看评论、每个搜索的关键词、浏览的商品等等。这种对数据价值的高度敏感和重视,以及强大的挖掘能力,使得亚马逊早已远远超出了它的传统运营方式。

    亚马逊CTO Werner Vogels在CeBIT上关于大数据的演讲,向与会者描述了亚马逊在大数据时代的商业蓝图。长期以来,亚马逊一直通过大数据分析,尝试定位客户和和获取客户反馈。

    “在此过程中,你会发现数据越大,结果越好。为什么有的企业在商业上不断犯错?那是因为他们没有足够的数据对运营和决策提供支持,”Vogels说,“一旦进入大数据的世界,企业的手中将握有无限可能。”

    从支撑新兴技术企业的基础设施到消费内容的移动设备,亚马逊的触角已触及到更为广阔的领域。

    亚马逊推荐:亚马逊的各个业务环节都离不开“数据驱动”的身影。在亚马逊上买过东西的朋友可能对它的推荐功能都很熟悉,“买过X商品的人,也同时买过Y商品”的推荐功能看上去很简单,却非常有效,同时这些精准推荐结果的得出过程也非常复杂。

    亚马逊预测:用户需求预测是通过历史数据来预测用户未来的需求。对于书、手机、家电这些东西——亚马逊内部叫硬需求的产品,你可以认为是“标品”——预测是比较准的,甚至可以预测到相关产品属性的需求。

    但是对于服装这样软需求产品,亚马逊干了十多年都没有办法预测得很好,因为这类东西受到的干扰因素太多了,比如:用户的对颜色款式的喜好,穿上去合不合身,爱人朋友喜不喜欢…… 这类东西太易变,买得人多反而会卖不好,所以需要更为复杂的预测模型。

    亚马逊测试:你会认为亚马逊网站上的某段页面文字只是碰巧出现的吗?其实,亚马逊会在网站上持续不断地测试新的设计方案,从而找出转化率最高的方案。整个网站的布局、字体大小、颜色、按钮以及其他所有的设计,其实都是在多次审慎测试后的最优结果。

    亚马逊记录:亚马逊的移动应用让用户有一个流畅的无处不在的体验的同时,也通过收集手机上的数据深入地了解了每个用户的喜好信息;更值得一提的是Kindle Fire,内嵌的Silk浏览器可以将用户的行为数据一记录下来。

    以数据为导向的方法并不仅限于以上领域,亚马逊的企业文化就是冷冰冰的数据导向型文化。对于亚马逊来说,大数据意味着大销售量。数据显示出什么是有效的、什么是无效的,新的商业投资项目必须要有数据的支撑。对数据的长期专注让亚马逊能够以更低的售价提供更好的服务。

    02 谷歌的意图

    如果说有一家科技公司准确定义了“大数据”概念的话,那一定是谷歌。根据搜索研究公司comScore的数据,仅2012年3月一个月的时间,谷歌处理的搜索词条数量就高达122亿条。谷歌的体量和规模,使它拥有比其他大多数企业更多的应用大数据的途径。

    谷歌搜索引擎本身的设计,就旨在让它能够无缝链接成千上万的服务器。如果出现更多的处理或存储需要,抑或某台服务器崩溃,谷歌的工程师们只要再添加更多的服务器就能轻松搞定。将所有这些数据集合在一起所带来的结果是:企业不仅从最好的技术中获益,同样还可以从最好的信息中获益。下面选择谷歌公司的其中三个亮点。

    谷歌意图:谷歌不仅存储了搜索结果中出现的网络连接,还会储存用户搜索关键词的行为,它能够精准地记录下人们进行搜索行为的时间、内容和方式,坐拥人们在谷歌网站进行搜索及经过其网络时所产生的大量机器数据。

    这些数据能够让谷歌优化广告排序,并将搜索流量转化为盈利模式。谷歌不仅能追踪人们的搜索行为,而且还能够预测出搜索者下一步将要做什么。

    用户所输入的每一个搜索请求,都会让谷歌知道他在寻找什么,所有人类行为都会在互联网上留下痕迹路径,谷歌占领了一个绝佳的点位来捕捉和分析该路径。

    换言之,谷歌能在你意识到自己要找什么之前预测出你的意图。这种抓取、存储并对海量人机数据进行分析,然后据此进行预测的能力,就是数据驱动的产品。

    谷歌分析:谷歌在搜索之外还有更多获取数据的途径。企业安装“谷歌分析”之类的产品来追踪访问者在其站点的足迹,而谷歌也可获得这些数据。网站还使用“谷歌广告联盟”,将来自谷歌广告客户网的广告展示在其站点,因此,谷歌不仅可以洞察自己网站上广告的展示效果,同样还可以对其他广告发布站点的展示效果一览无余。

    谷歌趋势:既然搜索本身是网民的“意图数据库”,当然可以根据某一专题搜索量的涨跌,预测下一步的走势。谷歌趋势可以预测旅游、地产、汽车的销售。此类预测最著名的就是谷歌流感趋势,跟踪全球范围的流感等病疫传播,依据网民搜索,分析全球范围内流感等病疫的传播状况。

    03 eBay的分析平台

    早在2006年,eBay就成立了大数据分析平台。为了准确分析用户的购物行为,eBay定义了超过500种类型的数据,对顾客的行为进行跟踪分析。eBay分析平台高级总监Oliver Ratzesberger说:“在这个平台上,可以将结构化数据和非结构化数据结合在一起,通过分析促进eBay的业务创新和利润增长。”

    eBay行为分析:在早期,eBay网页上的每一个功能的更改,通常由对该功能非常了解的产品经理决定,判断的依据主要是产品经理的个人经验。而通过对用户行为数据的分析,网页上任何功能的修改都交由用户去决定。“每当有一个不错的创意或者点子,我们都会在网站上选定一定范围的用户进行测试。通过对这些用户的行为分析,来看这个创意是否带来了预期的效果。”

    eBay广告分析:更显著的变化反映在广告费上。eBay对互联网广告的投入一直很大,通过购买一些网页搜索的关键字,将潜在客户引入eBay网站。

    04 塔吉特的“数据关联挖掘”

    利用先进的统计方法,商家可以通过用户的购买历史记录分析来建立模型,预测未来的购买行为,进而设计促销活动和个性服务避免用户流失到其他竞争对手那边。

    美国第三大零售商塔吉特,通过分析所有女性客户购买记录,可以“猜出”哪些是孕妇。其发现女性客户会在怀孕四个月左右,大量购买无香味乳液。由此挖掘出25项与怀孕高度相关的商品,制作“怀孕预测”指数。推算出预产期后,就能抢先一步,将孕妇装、婴儿床等折扣券寄给客户。

    塔吉特还创建了一套购买女性行为在怀孕期间产生变化的模型,不仅如此,如果用户从它们的店铺中购买了婴儿用品,它们在接下来的几年中会根据婴儿的生长周期定期给这些顾客推送相关产品,使这些客户形成长期的忠诚度。

    05 中国移动的数据化运营

    通过大数据分析,中国移动能够对企业运营的全业务进行针对性的监控、预警、跟踪。大数据系统可以在第一时间自动捕捉市场变化,再以最快捷的方式推送给指定负责人,使他在最短时间内获知市场行情。

    客户流失预警:一个客户使用最新款的诺基亚手机,每月准时缴费、平均一年致电客服3次,使用WEP和彩信业务。如果按照传统的数据分析,可能这是一位客户满意度非常高、流失概率非常低的客户。

    事实上,当搜集了包括微博、社交网络等新型来源的客户数据之后,这位客户的真实情况可能是这样的:客户在国外购买的这款手机,手机中的部分功能在国内无法使用,在某个固定地点手机经常断线,彩信无法使用——他的使用体验极差,正在面临流失风险。这就是中国移动一个大数据分析的应用场景。

    通过全面获取业务信息,可能颠覆常规分析思路下做出的结论,打破传统数据源的边界,注重社交媒体等新型数据来源,通过各种渠道获取尽可能多的客户反馈信息,并从这些数据中挖掘更多的价值。

    数据增值应用:对运营商来说,数据分析在政府服务市场上前景巨大。运营商也可以在交通、应对突发灾害、维稳等工作中使大数据技术发挥更大的作用。运营商处在一个数据交换中心的地位,在掌握用户行为方面具有先天的优势。

    作为信息技术的又一次变革,大数据的出现正在给技术进步和社会发展带来全新的方向,而谁掌握了这一方向,谁就可能成功。对于运营商来说,在数据处理分析上,需要转型的不仅是技巧和法律问题,更需要转变思维方式,以商业化角度思考大数据营销。

    06 Twitter中的兴趣和情绪

    Twitter兴趣聚类:通过过滤用户归属地、发推位置和相关关键词,Twitter建立了一系列定制化的客户数据流。比如,通过过滤电影片名、位置和情绪标签,你可以知道洛杉矶、纽约和伦敦等城市最受欢迎的电影是哪些。而根据用户发布的个人行为描述,你甚至能搜索到那些在加拿大滑雪的日本游客。

    从这个视角看,Twitter的兴趣图谱的效率优于Facebook的社交图谱。Twitter的用户数据所能产生的潜在价值同样令人惊叹。在社交媒体网站正在收集越来越多的数据的形势下,它们或许能找到更好的方式来利用这些数据盈利,并使其取代广告成为自身提高收入的主要方式。

    这些社交网站真正的价值可能在于数据本身。相信在不久的将来,如果寻找到既能充分利用用户数据,又可合理规避对用户隐私的威胁,社交数据所蕴藏的巨大能量将会彻底被开启。

    Twitter情绪分析:Twitter自己并不经营每一款数据产品,但它把数据授权给了像DataSift这样的数据服务公司,很多公司利用Twitter社交数据,做出了各种让人吃惊的应用,从社交监测到医疗应用,甚至可以去追踪流感疫情爆发,社交媒体监测平台DataSift还创造了一款金融数据产品。

    华尔街“德温特资本市场”公司首席执行官保罗·霍廷每天的工作之一,就是利用电脑程序分析全球3.4亿微博账户的留言,进而判断民众情绪,再以“1”到“50”进行打分。根据打分结果,霍廷再决定如何处理手中数以百万美元计的股票。

    霍廷的判断原则很简单:如果所有人似乎都高兴,那就买入;如果大家的焦虑情绪上升,那就抛售。一些媒体公司会把观众收视率数据打包到产品里,再转卖给频道制作人和内容创造者。

    精确的数据一旦与社交媒体数据相结合,对未来的预测会非常准。

    07 特易购的精准定向

    聪明的商家通过用户的购买历史记录分析来建立模型,为他们量身预测未来的购物清单,进而设计促销活动和个性服务,让他们源源不断地为之买单。

    特易购是全球利润第二大的零售商,这家英国超级市场巨人从用户行为分析中获得了巨大的利益。从其会员卡的用户购买记录中,特易购可以了解一个用户是什么“类别”的客人,如速食者、单身、有上学孩子的家庭等等。

    这样的分类可以为提供很大的市场回报,比如,通过邮件或信件寄给用户的促销可以变得十分个性化,店内的促销也可以根据周围人群的喜好、消费的时段来更加有针对性,从而提高货品的流通。这样的做法为特易购获得了丰厚的回报,仅在市场宣传一项,就能帮助特易购每年节省3.5亿英镑的费用。

    Tesco的优惠券:特易购每季会为顾客量身定做6张优惠券。其中4张是客户经常购买的货品,而另外2张则是根据该客户以往的消费行为数据分析,极有可能在未来会购买的产品。仅在1999年,特易购就送出了14.5万份面向不同的细分客户群的购物指南杂志和优惠券组合。

    更妙的是,这样的低价无损公司整体的盈利水平。通过追踪这些短期优惠券的回...

  • ?

    玩可视化大数据分析软件要掌握的6个核心技术(下)

    居律师

    展开

    上篇已经介绍过了可视化大数据分析软件要掌握的6个核心技术的其中3个,这篇把剩下的3个继续介绍完。这些技术在某种程度上可以促进可视化大数据分析软件的技术更新,所以这也是本篇分享的目的所在。

    大数据可视化

    1. 大数据存储与管理

    总体上,按数据类型的不同,大数据的存储和管理采用不同的技术路线,大致可以分为3类。 第1类主要面对的是大规模的结构化数据。针对这类大数据,通常采用新型数据库集群。它们通过列存储或行列混合存储以及粗粒度索引等技术,结合MPP(Massive Parallel Processing)架构高效的分布式计算模式,实现对PB 量级数据的存储和管理。这类集群具有高性能和高扩展性特点,在企业分析类应用领域已获得广泛应用;

    第2类主要面对的是半结构化和非结构化数据。应对这类应用场景,基于Hadoop开源体系的系统平台更为擅长。它们通过对Hadoop生态体系的技术扩展和封装,实现对半结构化和非结构化数据的存储和管理;

    第3类面对的是结构化和非结构化混合的大数据,因此采用MPP 并行数据库集群与Hadoop 集群的混合来实现对百PB 量级、EB量级数据的存储和管理。

    2. 大数据计算模式与系统

    所谓大数据计算模式,即根据大数据的不同数据特征和计算特征,从多样性的大数据计算问题和需求中提炼并建立的各种高层抽象(abstraction)或模型(model)。例如,MapReduce 是一个并行计算抽象,加州大学伯克利分校著名的Spark系统中的“分布内存抽象RDD”,CMU 著名的图计算系统GraphLab 中的“图并行抽象”(Graph Parallel Abstraction)等。传统的并行计算方法,主要从体系结构和编程语言的层面定义了一些较为底层的并行计算抽象和模型,但由于大数据处理问题具有很多高层的数据特征和计算特征,因此大数据处理需要更多地结合这些高层特征考虑更为高层的计算模式。

    根据大数据处理多样性的需求和以上不同的特征维度,目前出现了多种典型和重要的大数据计算模式。与这些计算模式相适应,出现了很多对应的大数据计算系统和工具。由于单纯描述计算模式比较抽象和空洞,因此在描述不同计算模式时,将同时给出相应的典型计算系统和工具,如表1所示,这将有助于对计算模式的理解以及对技术发展现状的把握,并进一步有利于在实际大数据处理应用中对合适的计算技术和系统工具的选择使用。

    数据分析

    3. 大数据分析与可视化

    在大数据分析的应用过程中,可视化通过交互式视觉表现的方式来帮助人们探索和理解复杂的数据。可视化与可视分析能够迅速和有效地简化与提炼数据流,帮助用户交互筛选大量的数据,有助于使用者更快更好地从复杂数据中得到新的发现,成为用户了解复杂数据、开展深入分析不可或缺的手段。大规模数据的可视化主要是基于并行算法设计的技术,合理利用有限的计算资源,高效地处理和分析特定数据集的特性。通常情况下,大规模数据可视化的技术会结合多分辨率表示等方法,以获得足够的互动性能。在科学大规模数据的并行可视化工作中,主要涉及数据流线化、任务并行化、管道并行化和数据并行化4 种基本技术。微软公司在其云计算平台Azure 上开发了大规模机器学习可视化平台(Azure Machine Learning),将大数据分析任务形式为有向无环图并以数据流图的方式向用户展示,取得了比较好的效果

    关于玩可视化大数据分析软件要掌握的6个核心技术,这里就介绍完毕了。其实这两篇似乎把大数据技术阐述得非常难的感觉,但其实,可视化大数据分析软件的使用并没有那么神乎其神,毕竟可视化大数据分析软件的发明是为了企业日常的数据化运营而产生的,所以不能太过于难用。

  • ?

    可视化数据分析软件几个可能的发展方向

    睡猫

    展开

    大数据时代下,可视化数据分析软件近些年受到众多企业的追捧与欢迎,因此,技术人员更加专注于研发更高级的技术和方式去解决企业更多的需求。那么,未来几年商业智能技术会怎么发展,可视化数据分析软件的发展趋势会怎么走呢?关注商业智能的你不妨来看看。

    第一、管控将与自助式分析融合并促进人们业务的需求 在一般人的意识里,管控和自主本身就是一个矛盾,想要自主就不应该再有管控,两者怎么可能一体融合呢?其实随着商业智能技术的推动,两者相辅相成并不是不可能的。我们也发现在实际的应用的,因为管控方式的合理,反而培养出一种自助式分析文化,有了这种分析文化的支持,具体的业务需求很快得到了满足。

    数据可视化分析

    第二、将有更多的人成为数据产品链的受益者 由于自助式分析产品的出现让人们获得了更多的自主权利,无形当中便让更多的人可以获得数据链带来的好处和支持,尤其是随着新一代年轻人的崛起并成为市场主力的情况下。对于业务部门的人来说,他们想要改进技术方法,最好的方式便是通过商业智能应用系统让数据链中某些特定的数据进行显示或表现,从而获得他们所需要的数据。 第三、促进云模式的应用将更广泛 随着越来越多的人接受云数据,云服务,商业智能系统的应用将促进云端数据和云分析的崛起升空。由于云数据的轻松方便,高速扩展的特点,以及云分析的机动灵活,应变迅速的性能,当前市场已经有越来越多的人改用云系统。在商业智能系统应用的情况下,企业利用云数据,云分析来解决或者获取管理过程中的其他分析数据已经成为一种潮流,可以说云模式的广泛应用同样也是企业发展中不可扭转的趋势。 可以说,未来的可视化数据分析软件会更加智能、自助,移动BI是商业智能BI未来的一大趋势。未来企业中想参与到可视化数据分析平台运营中的人会越来越多,这就需要更高级的商业智能技术和方式。

  • ?

    数据分析都用什么工具

    Hester

    展开

    欢迎关注天善智能,我们是专注于商业智能BI,大数据,数据分析领域的垂直社区,学习,问答、求职一站式搞定!

    本文是上一篇文章《全国及重点城市“数据分析”岗位需求量及工资水平分析》的续篇,从“数据分析”职位招聘单位给出的职位描述中分析各种工具的热门程度。

    1.整体概览

    经常看见有网友争论R和python谁才是主流的数据分析工具,网友们分门别派各抒己见。今天我们从实际需求出发,在招聘单位的职位描述中用正则表达式匹配统计常用的数据分析工具出现的频率,看看谁才是你最应该掌握的工具。

    话不多说,先上图

    毫无疑问,excel才是最主流的数据分析工具,在招聘单位的职位描述中出现频率远远高于其他工具(实际上居第八位的office也含有excel,其真实数据应该比这还高),作为最基础的工具,excel是一个数据分析工作者的必备技能。excel之后的4门工具分别是sqlsever、spss、sas和r,其中排名第二位的sqlsever频率高出另外两门主流数据库语言mysql、oracle近两倍,spss作为无需编程的专业统计软件也在职位描述中有较高的频率,sas则是编程类统计软件的代表,今年来火热的r语言也水涨船高,另一门火热的程序语言python在数据分析方面则要稍稍落后。

    2.各职位具体情况

    数据分析也有细分很多具体职位,那么不同的职位以上各种工具的要求是否存在差异呢?

    表中数据显示“大数据分析师”需掌握的工具主要是r、python、hadoop、spark和java;“数据分析工程师”需要掌握的工具主要是sqlsever、r、python和hadoop,这两个职位都很看重编程开发能力。

    “数据分析经理”、“高级数据分析师”和“数据分析师”需要掌握的工具大体一致,均为excel、sqlsever、spss、sas和r。

    “数据分析主管”、“数据分析”、“数据分析专员”和“数据分析员”等职位对基础技能的要求更为突出,excel、ppt、word等office办公软件出现的频率较其他工具明显更高。

    作为一名数据分析从业者或者想转行过来的人来说,要想有好的职业发展,首先,必须熟练掌握office办公软件,尤其是excel(不要瞧不起excel,你不一定玩得转);其次,还需要学习一门数据库语言,sqlsever是不错的选择(mysql、oracle与sqlsever较为类似,通一门后,其他的学起来也很容易);专业的统计分析工具也需要掌握一门,如果讨厌编程,可以选择spss,如果有编程能力那么sas和r可以选择一个学习,如果你精通python也可以用python做统计分析;如果想往大数据方向发展,或者是做数据分析工程师那就还需要掌握python、hadoop等工具。

    最后附上一张数据分析职位描述的词云图,可以看出招聘单位除了看重工具的使用外,也很注重分析、业务、经验、沟通、团队等方面的能力。

    本文作者:Mr.Hu,转自:一胡诌先生

  • ?

    11种常用的数据分析处理软件

    艾德里安

    展开

      BI(BusinessIntelligence)即商业智能,越来越多的智能软件供应商推出可视化数据分析工具,应对企业业务人员的大数据分析需求。然而如果你觉得不是数据分析专业、没有挖掘算法基础就无法使用BI工具?NO,自助式分析工具已经让数据产品链条变得大众化。为了更好地帮助读者选择分析工具,重庆IT培训的老师将为大家介绍数说立方、数据观、BDP等11款BI-商业智能产品,排名不分先后!

      1、数说立方

      数说立方是数说故事新推出的一款面向数据分析师的在线商业智能产品。最重要的特点是配备百亿级社交数据库,同时支持全网公开数据实时抓取,从数据源端解决分析师难点;另外数说立方搭载了分布式搜索、语义分析、数据可视化三大引擎系统的海量计算平台,实现数据处理“探索式分析”和“秒级响应”的两个核心功能。同时数说立方是数说故事三大主打产品之一,并与其他两大产品数说聚合和数说雷达实现从数据源、数据分析、到数据展示完整的数据解决方案。

      优点:

      即便是个人免费版,体验和功能仍然非常好;

      与自家产品“数说聚合”的无缝接入,支持定向抓取微信、微博等数据;

      功能完善,集数据处理、特征工程、建模、文本挖掘为一体的机器学习平台;

      可视化视图展现、友好的客户感知页面;

      支持SAAS,私有化部署,有权限管理;

      缺点:

      产品新上市,操作指导页不太完善;

      体验过程中有一些小bug;

      2、数加平台

      数加是阿里云发布的一站式大数据平台,可以提供数据采集、结构化、加工到展示分析整套的一站式数据服务。 可采集不同系统及物理存储的源头数据,在分布式计算平台上进行数据的深度整合、计算、挖掘,将计算的结果通过可视化的工具进行个性化的数据分析和展现,也可直观的展示分析现有云上业务系统的数据库数据。

      优点:

      有完整的产品规划,功能完善;

      图形展示和客户感知良好;

      提供SQL查询;

      缺点:

      需要捆绑阿里云才能使用,一般用户还不能真正使用起来;

      部分体验功能一般,有一定的学习成本;

      3、Tableau

      Tableau是目前市面上较为成功的BI工具。产品既有针对性,又有普适性。拖放式界面,操作简单。数据兼容性强,适用于多种数据文件与数据库,同时也兼容多平台,windows、mac、Online均可使用。而且重要的一点是免费为用户安排现场培训或按需求进行在线培训。

      优点:

      处于行业领导者地位,功能完善;

      有较好的图形展现与客户感知;

      新产品开始支持云端展现,但是需要客户端支持;

      缺点:

      相比于商业智能BI,更像一个基于数据查询的数据展示工具;

      处理不规范数据、转化复杂模型比较难;

      无法处理大量数据;

      国内网络连接Online版速度较慢;

      4、Qlik

      QlikView只需轻轻单击几下,就可以对所有数据源进行合并、搜索、可视化和分析,可在不影响性能的前提下连接到多个数据源;其次视图种类丰富,界面简洁,互动性强,总体来说是一款简单易用的BI产品。Qlik用户可通过各类可视化效果,将Qlik扩展到任何应用程序中。另外用户也可以通过使用标准的和最新的网络API,可将可视化效果数据嵌入网站或应用程序。

      优点:

      产品功能完善,图形展现和客户感知良好;

      支持SAAS,有权限管理功能;

      缺点:

      有一定的学习成本;

      报表规范性要求很高;

      数据抓取功能都非常弱,需要有非常好的数据仓库作为基础;

      5、Spotfire

      Spotfire服务对象是一线工作人员和日常决策人员,其交互界面形象易懂,无需写脚本语言和编写程序就可以对数据进行添加、分离操作。内置搜索引擎,可以随意查找任意信息。支持R、S+等统计、挖掘功能;有丰富、开源的R模型。标记有自身特色,提供了过滤、钻取等功能,多个标记同时还可以实现图形化的集合运算。

      优点:

      交互界面形象易懂,即使是普通的业务人员也能轻而易举地进行复杂的数据分析;

      不一定要建数据仓库,还可以直接从多个异构数据源提取数据进行分析;

      支持SAAS,有权限管理功能;

      缺点:

      SAAS版只支持30M,由于是国外服务器所以上传很慢;

      不适合中国式的固定报表;

      进军中国市场较晚,国内案例较少;

      工具的适应性范围广,但是难易跨度大;

      6、神策分析

      神策分析的产品有完整的使用文档,每个模块都有详细的使用说明以及示例,降低了用户的学习成本。而且支持私有部署、任意维度的交叉分析,并帮助客户搭建专属的数据仓库。目前提供事件分析、漏斗分析、留存分析、数据管理等功能,未来预计会增加用户分群、用户人群分析、推送和异常维度组合挖掘等,工具需要付费使用。

      优点:

      专注于用户行为数据分析,不追求做大而追求做全;

      有详细的产品使用文档以及案例;

      提供SQL查询;

      缺点:

      更多的是demo示例,不能开箱即用;

      纯dashboard展示,并不能对单独一块数据作自定义分析;

      7、BDP

      BDP个人版使用免费,只需导入数据,设定分析维度,即可实时得到图表分析结果。产品示例和视频教学很细致,交互页面很友好。每次数据更新,对应的图表也会自动更新,可以免去一些重复分析、制作图表的数据工作。另外,分享环节也很贴心,数据仪表盘可以一键导出,也可直接生成链接分享给他人或分享到微信、微博等社交平台。

      优点:

      产品支持移动端;手机同步呈现最新数据

      用户可以免费使用工具,还有免费公开的数据源;

      操作体验流畅,界面友好,功能全,总体来说是一款不错的产品;

      即便是个人免费版,体验和功能仍然非常好;

      数据可以同步更新,免去了重复劳动的工作;

      缺点:

      官网的介绍比较简单;

      8、永洪BI

      永洪BI是一款可在前端进行多维分析和报表展现的BI软件。支持拖拽操作,数据源格式多样,提供不同级别的查询支持,支持跨库跨源连接。另外永洪提供了一款数据存储、数据处理的软件——MPP数据集市,可与BI打通,使得数据查询,钻取和展示的速度大幅度提高。不过其产品用户体验一般,拖拽过于自由,导致仪表盘布局不好控制;主题样式虽多但是给人感觉样式还是很传统。

      优点:

      商业流程完善,给人专业的感觉;

      产品定制化的版本效果不错;

      支持的数据接入较多;

      缺点:

      SAAS版体验很差,有一定的学习成本;

      UI的视觉效果一般,整体可视化效果不够现代化;

      9、数据观

      数据观的功能设计理念是极简、无门槛,所以它最大的特点就是简单。数据观数据来自云端,如:百度 网盘、微盘、salesforce等。数据上传后,马上有推荐图表,引导明确。另外产品的使用没有技术门槛,无需专业IT知识,同时适用于非专业分析师出身的业务人员,可以快速将数据转化成直观的图表,适合一开始接触数据分析工具的非专业数据从业人员。

      优点:

      注册只需填写邮箱,且支持明道账号登陆;

      使用引导明确,支持salesforce、百度云数据导入;

      分析结果支持链接分享,大大降低用户的沟通成本;

      缺点:

      不支持超过20MB的数据上传;

      数据导入后,数据分析体验方面存在bug;

      产品的使用以点击为主,不支持拖拽操作;

      10、FineBI

      FineBI分为数据处理、可视分析和分享公用三大功能模块。支持多种数据源,图表风格清爽美观,可选择任意维度分析。分析页面由控件和组件组成,控件和组件的数量是可以添加至任意多个,但是布局的交互比较僵硬,且使用逻辑有点乱,引导不明确。需要安装本地客户端才能使用。

      优点:

      有较为详细的行业案例与技术方案;

      产品演示和资源中心也较为清晰

      缺点:

      需要使用客户端,增加了使用的不便利性

      只有仪表盘展示,BI报表需要另一款产品;

      无法处理大量的数据;

      11、魔镜

      魔镜支持自动拖拽建模,同时可视化效果库十分酷炫。用户可以邀请团队成员到自己的项目,合作进行探索分析,并且按照需求有效控制访问数据的成员权限。产品模块规划完整,有基础企业版到hadoop等5种选择为,而且可以支持定制化服务。但是可能是云平台版的缘故,使用过程中出现不少BUG,企业版的体验可能会相对好一点。

      优点:

      产品模块的规划比较健全,其中包括数据源导入、数据分析、仪表盘、数据挖掘和数据工厂;

      官网的设计不错,模板选择性大,颜值控可能会喜欢;

      工具使用指导清晰,使用篇和方法篇等比较详细;

      缺点:

      产品存在较多的BUG,UI和功能相对其他产品来说较简陋;

      部分产品模块并不能切实用于数据分析;

      选择一款适用的BI产品,能够大大简化数据分析的繁杂工作,提高分析效率与质量。当然,以上每个工具各有优点,工具地址都给大家了,接下来就是轮到你动手的时候了,找一个自己喜欢的工具,开始吧!

      

数据分析软件需求

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP