中企动力 > 商学院 > 三大数据分析软件
  • ?

    关于什么是大数据和数据分析?Quora评分较高的3个回答

    晓筠

    展开

    对于这一问题,答案是多种多样的,此文分别从实践者,观察者和预言者三种角度来分析,看完会对您有所启发。

    观点1,实践者的角度来看:

    大数据- 表示数据的几个维度 - 可用数据的多样性,速度,体积和可信度。此外,大数据相关技术使我们能够处理和存储4V的一个或所有特性。

    数据分析- 通常意味着探索性数据分析,可视化和报告。我们可以使用大数据或典型数据来了解和探索数据,并更好地了解上下文。或回答几个商业问题。

    数据科学或更早的业务分析- 让我们建立统计学,数学和机器学习模型,以获得更好的业务成果。我们可以使用大数据来做到这一点。

    观点2,实践者的角度来看:

    大数据只不过是非结构化数据的收集。这些数据不是特定的格式,因为它的数据集大小通常是巨大的 - 测量数十TB,有时跨越PB的门槛。大数据术语之前是使用数据库管理系统(DBMS)进行管理的非常大的数据库(VLDB)。

    大数据分析是检查大量和多样化数据集(即大数据)的过程,以发现隐藏模式,未知相关性,市场趋势,客户偏好和其他有用信息,可帮助组织做出更明智的业务决策。由专业分析系统和软件驱动,大数据分析可以指出各种业务收益,包括新的收入机会,更有效的营销,更好的客户服务,提高运营效率以及竞争对手的竞争优势。

    虽然这些定义可能听起来很简单,但它们是相当复杂的领域。大数据和分析涉及很多步骤和技术。其中一些是数据采集,出生的数字数据,出生的模拟数据,非关系数据库,内存数据库系统,混合数据存储和处理系统 - Apache Hadoop和数据挖掘。

    此外,使用弹性搜索,变得更加容易理解大数据。它用于网页搜索,日志分析和大数据分析。还有许多其他工具,但Elasticsearch更受欢迎,因为它易于安装,扩展到数百个节点,没有额外的软件,并且由于其内置的REST API而易于使用。

    Google的AlphaGo计算机在Go游戏中击败了世界冠军Lee Se-dol,Data已经成为新的货币,全球政府已经开始大力投资智慧城市。围绕大数据的炒作终于结束了,在2017年的今年,我们可以预期数据在数量和种类上都会大幅增长。

    观点3,预言者角度分析:

    HADOOP将成为WIDESPREAD

    今年,我们将看到Hadoop采用的激增以及组织的其他相关解决方案。随着Hadoop的采用,任何规模的组织都可以使用高级分析来处理大量和多种数据。采用更高级的数据库,如MemSQL,Exasol等,已经成为组织成功的关键。

    IOT,云和大数据的收敛

    随着几个互联网连接的IoT设备的出现,大量的结构化和非结构化数据的涌入。这些数据中的大部分部署在云服务中。该数据将驻留在包括Hadoop集群到NoSQL数据库的几个关系和非关系系统中。云迁移十大注意事项

    混合现实

    混合现实将改善数据可视化AR和VR在过去几年中赢得了客户的极大的关注。随着神奇宝贝的推出,增强现实在几个星期内就已经获得了大约1亿用户。虽然AR或VR可能对大公司来说可能不是很有用,但混合现实的概念可能非常好。混合现实将虚拟世界与现实世界结合起来,像微软全能组织这样的设备已经在吸引人。混合现实将为组织提供更好的执行任务以及更好地了解数据的巨大机会。chatbots上升的前五大平台

    深度学习

    深度学习是基于神经网络的高级机器学习形式。深度学习有助于从大量非结构化数据中识别特定的兴趣项目。从大量的结构化和非结构化数据中学习是非常有用的。因此,企业和组织应该更多地关注深度学习算法来应对数据的大量涌入。数据虚拟

    化今年数据虚拟化将呈现强劲势头。数据虚拟化能够从大量数据中解锁隐藏的概念和结论。它还允许企业和组织随时检索和操纵数据。

    结论

    如前所述,今年将是一个令人兴奋的一年,大数据和分析系统将成为组织的首要任务。这些系统预计运作良好,履行对企业价值的承诺。

    想了解更多关于大数据分析的精辟观点,加大数据学习交流8群640193172,或者去看BAT大数据专家私人圈TBanna521。

  • ?

    三大方向预测大数据技术发展未来趋势

    Nona

    展开

    关注我的人都成为了月薪5w以上的技术大牛

    (一)社交网络和物联网技术拓展了数据采集技术渠道

    经过行业信息化建设,医疗、交通、金融等领域已经积累了许多内部数据,构成大数据资源的“存量”;而移动互联网和物联网的发展,大大丰富了大数据的采集渠道,来自外部社交网络、可穿戴设备、车联网、物联网及政府公开信息平台的数据将成为大数据增量数据资源的主体。当前,移动互联网的深度普及,为大数据应用提供了丰富的数据源。

    另外,快速发展的物联网,也将成为越来越重要的大数据资源提供者。相对于现有互联网数据杂乱无章和价值密度低的特点,通过可穿戴、车联网等多种数据采集终端,定向采集的数据资源更具利用价值。例如,智能化的可穿戴设备经过几年的发展,智能手环、腕带、手表等可穿戴正在走向成熟,智能钥匙扣、自行车、筷子等设备层出穷,国外 Intel、Google、Facebook,国内百度、京东、小米等有所布局。

    企业内部数据仍是大数据主要来源,但对外部数据的需求日益强烈。当前,有 32%的企业通过外部购买所获得的数据;只有18%的企业使用政府开放数据。如何促进大数据资源建设,提高数据质量,推动跨界融合流通,是推动大数据应用进一步发展的关键问题之一。

    总体来看,各行业都在致力于在用好存量资源的基础之上,积极拓展新兴数据收集的技术渠道,开发增量资源。社交媒体、物联网等大大丰富了数据采集的潜在渠道,理论上,数据获取将变得越来越容易。

    (二) 分布式存储和计算技术夯实了大数据处理的技术基础

    大数据存储和计算技术是整个大数据系统的基础。

    在存储方面,2000 年左右谷歌等提出的文件系统(GFS)、以及随后的 Hadoop 的分布式文件系统 HDFS(Hadoop Distributed File System)奠定了大数据存储技术的基础。

    与传统系统相比,GFS/HDFS 将计算和存储节点在物理上结合在一起,从而避免在数据密集计算中易形成的 I/O吞吐量的制约,同时这类分布式存储系统的文件系统也采用了分布式架构,能达到较高的并发访问能力。

    在计算方面,谷歌在 2004 年公开的 MapReduce 分布式并行计算技术,是新型分布式计算技术的代表。一个 MapReduce 系统由廉价的通用服务器构成,通过添加服务器节点可线性扩展系统的总处理能力(Scale Out),在成本和可扩展性上都有巨大的优势。

    (三) 深度神经网络等新兴技术开辟大数据分析技术的新时代

    大数据数据分析技术,一般分为联机分析处理(OLAP,OnlineAnalytical Processing)和数据挖掘(Data Mining)两大类。

    OLAP技术,一般基于用户的一系列假设,在多维数据集上进行交互式的数据集查询、关联等操作(一般使用 SQL 语句)来验证这些假设,代表了演绎推理的思想方法。

    数据挖掘技术,一般是在海量数据中主动寻找模型,自动发展隐藏在数据中的模式(Pattern),代表了归纳的思想方法。

    传统的数据挖掘算法主要有:

    (1)聚类 ,又称群分析,是研究(样品或指标)分类问题的一种统计分析方法,针对数据的相似性和差异性将一组数据分为几个类别。属于同一类别的数据间的相似性很大,但不同类别之间数据的相似性很小,跨类的数据关联性很低。企业通过使用聚类分析算法可以进行客户分群,在不明确客户群行为特征的情况下对客户数据从不同维度进行分群,再对分群客户进行特征提取和分析,从而抓住客户特点推荐相应的产品和服务。

    (2)分类 ,类似于聚类,但是目的不同,分类可以使用聚类预先生成的模型,也可以通过经验数据找出一组数据对象的共同点,将数据划分成不同的类,其目的是通过分类模型将数据项映射到某个给定的类别中,代表算法是 CART(分类与回归树)。企业可以将用户、产品、服务等各业务数据进行分类,构建分类模型,再对新的数据进行预测分析,使之归于已有类中。分类算法比较成熟,分类准确率也比较高,对于客户的精准定位、营销和服务有着非常好的预测能力,帮助企业进行决策。

    (3)回归 ,反映了数据的属性值的特征,通过函数表达数据映射的关系来发现属性值之间的一览关系。它可以应用到对数据序列的预测和相关关系的研究中。企业可以利用回归模型对市场销售情况进行分析和预测,及时作出对应策略调整。在风险防范、反欺诈等方面也可以通过回归模型进行预警。

    传统的数据方法,不管是传统的 OLAP 技术还是数据挖掘技术,都难以应付大数据的挑战。首先是执行效率低。传统数据挖掘技术都是基于集中式的底层软件架构开发,难以并行化,因而在处理 TB 级以上数据的效率低。其次是数据分析精度难以随着数据量提升而得到改进,特别是难以应对非结构化数据。

    在人类全部数字化数据中,仅有非常小的一部分(约占总数据量的 1%)数值型数据得到了深入分析和挖掘(如回归、分类、聚类),大型互联网企业对网页索引、社交数据等半结构化数据进行了浅层分析(如排序),占总量近 60%的语音、图片、视频等非结构化数据还难以进行有效的分析。

    所以,大数据分析技术的发展需要在两个方面取得突破,一是对体量庞大的结构化和半结构化数据进行高效率的深度分析,挖掘隐性知识,如从自然语言构成的文本网页中理解和识别语义、情感、意图等;二是对非结构化数据进行分析,将海量复杂多源的语音、图像和视频数据转化为机器可识别的、具有明确语义的信息,进而从中提取有用的知识。

    目前来看,以深度神经网络等新兴技术为代表的大数据分析技术已经得到一定发展。

    神经网络是一种先进的人工智能技术,具有自身自行处理、分布存储和高度容错等特性,非常适合处理非线性的以及那些以模糊、不完整、不严密的知识或数据,十分适合解决大数据挖掘的问题。

    典型的神经网络模型主要分为三大类:第一类是以用于分类预测和模式识别的前馈式神经网络模型,其主要代表为函数型网络、感知机;第二类是用于联想记忆和优化算法的反馈式神经网络模型,以 Hopfield的离散模型和连续模型为代表。第三类是用于聚类的自组织映射方法,以 ART 模型为代表。不过,虽然神经网络有多种模型及算法,但在特定领域的数据挖掘中使用何种模型及算法并没有统一的规则,而且人们很难理解网络的学习及决策过程。

    随着互联网与传统行业融合程度日益加深,对于 web 数据的挖掘和分析成为了需求分析和市场预测的重要段。Web 数据挖掘是一项综合性的技术,可以从文档结构和使用集合中发现隐藏的输入到输出的映射过程。

    目前研究和应用比较多的是 PageRank 算法。PageRank是Google算法的重要内容,于2001年9月被授予美国专利,以Google创始人之一拉里·佩奇(Larry Page)命名。PageRank 根据网站的外部链接和内部链接的数量和质量衡量网站的价值。这个概念的灵感,来自于学术研究中的这样一种现象,即一篇论文的被引述的频度越多,一般会判断这篇论文的权威性和质量越高。

    需要指出的是,数据挖掘与分析的行业与企业特点强,除了一些最基本的数据分析工具外,目前还缺少针对性的、一般化的建模与分析工具。各个行业与企业需要根据自身业务构建特定数据模型。数据分析模型构建的能力强弱,成为不同企业在大数据竞争中取胜的关键。

    好程序员特训营,致力于移动互联网精英人才培养,开设全栈HTML5+、大数据+人工智能、JavaEE+云数据等多门课程。学员入职阿里、新浪、百度、搜狗等知名企业屡见不鲜,成就学员转行、就业,拿高薪进名企的梦想。 大数据+人工智能课程12月18日开班在即,现报名免费试学30天,学费优惠5000元。

  • ?

    IT人,除了数据库,未来还要掌握这个工具!

    Ming

    展开

    不晓得大家有没有发现,过去企业搞IT都强调上系统、搞流程,而近几年,IT相关的新闻、会议,都围绕数据。

    确实,现在任何一个稍具规模的公司,都在强调数据的重要性。无论是否与IT行业有关,数据都是其必不可少的组成部分,各种各样的数据均需要数据库来承载与维护(无论是大型的数据仓库,如DB,还是流行的Oracle、MySQL、Sybase等)。所以一个好的DBA的作用显得极为重要,不仅需要能够进行日常维护,对于数据库本身的优化(包括数据库系统架构优化与SQL优化)及数据库整体架构设计,也非常重要。小编身边不少IT朋友都将DBA作为近5年奋斗的职位。

    但另一方面,随着近几年数据价值的凸显,很多企业的IT部门正通过数据给企业业务层面,经营层面提供有价值的数据信息。数据这块的工作就不单单是停留在数据治理和规划方面,更多需要从数据挖掘对经营对业务有帮助的价值。这也是为什么近几年很多IT人转行往数据分析师、BI分析师,甚至是高精尖的数据科学家发展。

    所以,现在IT人要打交道的不仅仅是数据库,还有能将数据转换成经营决策信息的BI报表工具。

    为什么需要BI报表工具?

    在企业应用中,企业/组织/团体一旦成规模时,数据量是数以万计的,无论数据还是报表都需要协同管理不断更新。面对各大OAERPCRM系统的数据,这时候懂IT的朋友们可能知道,传统用Excel处理数据是hold不住的,即使写SQL也架不住扑面而来的需求。要想快速出报表,快速取数,快速做业务分析需要开放的报表或BI分析工具。FineReport就是其中之一。

    FineReport 可以说是全球最好用的商用报表软件:

    可以快速灵活地制作报表,搭建统一的数据决策和管理平台,让更多的数据用于业务经营和决策;可以快速开发报表,能做到和各类系统的无缝集成,加快项目的开发,节约了开发的人力和成本。

    故事1:7天解决财务半年工作量

    集团子公司有个财务总监,每个月都要给集团上报生产数据分析相关的报表,分产品的,汇总的,与去年同期对比,与预算数对比,单耗,能耗(如果这个不准可能影响销售单价),ERP本身只有最基本的业务数据,其他什么都没有。每个月都要加班两个多星期还不一定可以完成,真的是非常辛苦。后来找到我们信息部,沟通了她的需求,希望我们能用代码帮她自动出报表。但即使是代码,这些需求也要写上3天,每月还要重复写。如果其中逻辑稍有理解出错,就要修改。

    后来经过一个多星期的沟通,最后在FineReport把这一套报表做出来了,现在她只用输入日期,就能看到当月的分析结果,点击品种就可以钻取单品种的详细结果,以至于到现在对我们IT部门都非常感谢,感觉IT人也得到了尊重。

    故事2:二八数据分析,让公司反亏为赢

    老K所在集团有一子公司,销售业绩和盈利能力一直都很差,2014年甚至亏损。但该子公司是集团战略的一个重要环节,那只能对这个公司进行业务改进,具体怎么做呢?

    结合公司的实际管理情况,IT部门用FineReport搭建了数据决策系统,建立了数据仓库,为数据决策提供基础。财务主题分析、财务主题汇总分析、销售主题分析、销售绩效分析、存货主题、资金主题等模块。

    然后,老K拉来子公司的财务数据,做了细致分析:分析哪些产品赚钱?哪些客户赚钱?哪些销售人员赚钱?还真有了大发现:49个产品中只有不到30个产品是赚钱的;给子公司带来利润的下游公司,只有不到20%;为公司创造较多利润的销售人员,也只有57%。于是,老K把这样的结论向上级领导反映,当即就从产品、客户、销售员这三个角度开展改革,砍掉了20%的低毛利产品;重点维护销售额前30%的客户;调整销售利润分配方式。

    改革的效果:2016年销量增加1350万,销售费用率下降4.55%,2016年利润916万,比2015年增加457万,利润的增长来源于销量的增长,两年实现利润1,532万。

    以上可见,报表/BI工具用得好,是可以给业务带来实实在在的价值的。

    “FineReport+”三大技术优势

    以FineReport为例,它的本质是一个通用的报表制作和数据可视化工具。就好比Excel,小到可以存储统计数据、制作各式各样的图表、dashboard,大到制作财务报表、开发进销存系统。

    1、FineReport+业务系统,打破数据壁垒

    一般业务系统自带的报表能力很弱,难以满足企业数据化分析和管理的需求。以OA系统为例,随着企业应用的发展,OA软件越来越重视数据分析与利用,不仅仅数据分析可以形成对信息与流程的管理,更实现对企业数据的有效管理与利用,所以报表应用已经越来越成为企业办公自动化软件(协同办公软件)的一个重要组成部分。但是OA自身报表存在多种先天缺陷:

    a. 其数据全部来自于OA系统,而且报表也从属于OA的功能。比如,统计各部门收、发文的数量,统计员工的出勤日等等,无论是从格式还是统计的内容,都相对比较简单而且是固定的,无法从综合的角度体现各类数据的相关性分析。

    b. 厂商或服务商在实施时为用户做的报表。用户可能会提出要求,实施服务商负责完成报表的开发。虽然这种方式能比较好地满足用户的需求,但灵活性还远远不够,不能针对后续业务的发展做到随需而动。

    所以产品型软件公司在遇到有报表需求的客户时,常会选择和帆软合作,比如用友、金蝶、泛微、致远、万户、蓝凌、神州数码、浪潮,而和FineReport集成的业务系统产品,有OA、ERP、MIS、CRM、TMS、WMS、BPM、EHR、考勤等。

    对最终用户而言,使用FineReport可以快速灵活地制作报表,可以搭建统一的数据决策和管理平台,让更多的数据用于业务经营和决策,让业务系统发挥更大的价值。

    一般而言,FineReport 可解决如下问题:

    市场环境和业务需求多变,无法快速满足变化的报表需求传统SQL+Excel 的方式整合数据做报表,效率低准确性差业务系统数据过于分散形成数据孤岛,难以有效利用缺乏统一的报表管理门户,无法形成全局数据视野,辅助决策

    2、FineReport+BI系统,打造数据分析平台

    报表和BI本来就界限不明,又如何搭配适用呢?举两个例子。

    东北证券的数据平台建设完毕之后,结构化数据初步实现了统一归集,数据报表和图表可视化均可以通过Cognos工具实现。但是,由于Cognos使用繁琐、开发复杂,数据小组一直无法接手该工具,而新需求不断出现,亟需通过系统保存工作中产生的结构化数据,取代excel记录和上报数据的模式。所以,东北证券最后上了FineReport,较为完善的解决了当前数据填报和其他分析需求。

    大华技术股份公司用Qlikview搭建了数据分析平台,但是当他们报表需求爆发时,QlikView根本解决不了问题。最后的解决方式是引入finereport,与QlikView并行使用。领导层几个人用QlikView,中间管理层都使用finereport制作的报表。FineReport是专门的报表软件,在易用性、快捷性和对复杂报表的响应要远胜于QlikView。

    所以,FineReport+BI系统,赢在开发效率,赢在面向中层、面向固定式、面向复杂报表的定位。无论是传统BI如SAP BO、Cognos、 Oracle BIEE等,还是新型自助式BI如Tableau、FineBI、Qlikview、PowerBI等,都用可以FineReport“+”起来。

    3、FineReport+场景需求,定制个性化的业务系统

    信息化系统的本质是录入和展示,恰巧FineReport天然支持这两块功能,本身就是一个可视化的系统DIY工具。所以很多使用者直接应用FineReport开发了一些业务系统,如简易出入库系统、项目周报管理系统、酒店客房收入数据系统、考试分析系统、会员管理系统、刷卡考勤系统、报餐系统、微信小秘书等。

    现在大屏数据展示的需求越来越多,一般应用于行业博览中心、实时监控中心、集团会议中心、战略指挥中心等场景,视觉效果要求也越来越高。无须专门定制开发,使用FineReport就能轻松制作出酷炫的管理驾驶舱,支持发布到多场景的数据大屏上进行可视化集中管控。

    有位CIO说得好,以往IT在任何企业都是支持部门,永远跟在业务后面跑,数据让IT人有了可衡量的价值,是救命稻草。BI/报表工具是好的机器,帮助IT更高效的出报表,管理报表。从将更多的时间花在数据分析上,业务分析项目上,让IT人的价值真正凸显。

  • ?

    全球数据分析之王说,中国数据分析市场正在爆发

    妙晴

    展开

    (被誉为“数据分析之王”的SAS公司CEO Jim Goodnight)

    在2017年4月2-5日美国奥兰多城市举办的2017 SAS Global Forum全球论坛上,全球最大的独立软件公司之一、专注于数据和商业分析超过40年的美国SAS公司创始人兼CEO、2011年被Forbes杂志誉为“数据分析之王”的Jim Goodnight对笔者表示,SAS在中国市场在过去20多年的发展一直比较平稳,但过去几年却取得了爆发式增长。

    SAS公司最早起源于美国北卡罗来纳州立大学1966年的一项开发数据分析软件用于农业数据的研究。40年后的今天,根据IDC的统计,SAS占全球高级和预测分析市场31.6%的份额,比前10名中其它9家相关厂商营收的总合还要多。2016年,SAS在超过30种各类市场调查公司的报告中占据领导者地位,这包括分析、数据管理、数据整合、数据质量、数字营销、高级和预测分析、客户智能、零售分析、商业智能、安全解决方案等。

    可以说在过去40年的时间里,SAS见证了全球数据分析、商业分析和大数据市场从无到有、从小到大的发展历程。2016年,SAS在全球的业务继续保持稳步增长,2016年全球营收达32亿美元,增长主要来自于分析平台、云计算、反欺诈和安全智能解决方案,而且是在全球所有区域都实现了营业额的增长,特别是亚太区和拉丁美洲区成为增长最快的大区。

    全球数据分析三大趋势

    在谈到全新最新数据和商业分析趋势时,Jim Goodnight就SAS公司的业务来说,认为有三大趋势在拉动全球数据分析市场的发展,分别是物联网、新型分析和合作伙伴生态。

    其中,物联网数据分析被视为下一个数据分析的金矿,已经给SAS公司带来了高速增长的业务机会。目前,SAS业务按行业来看的话,营收前三分别是银行(27%)、政府(15%)和专业服务(12%),而电信通讯(6%)、制造(6%)、医疗(5%)、零售(4%)等被视为潜在大数据及分析行业市场却只占了SAS年度营收比例的个位数,说明这些行业还存在巨大的市场空间。

    能拉动电信通讯、制造、医疗和零售等潜在大数据及分析市场的一个抓手就是物联网。物联网作为连接底层传感器设备与互联网的物理信息空间连接器,能够为电信通讯、制造、医疗和零售等行业带来前所未有的视角,让企业管理者能深入到运营第一线实时掌握前沿动态,把前端实时数据与后台运营历史数据结合,就能产生巨大的商业价值。

    Jim Goodnight认为传感器数据分析是一个巨大的机会,汽车里已有传感器每天都在产生海量的数据。SAS公司在2016年推出了ESP实时流数据处理引擎,专门适用于靠近数据产生源的传感器数据实时分析,可每秒处理上百万个事件的分析与处理,通过内存计算可实现近乎实时的流数据分析。自2016年第四季度推向市场以来,已经为SAS公司带来了源源不断的物联网业务。

    在SAS Global Forum 2017上,SAS与思科合作推出了业界首个经过Cisco Validated Design(思科验证设计)的Edge-to-Enterprise(边缘到企业)物联网分析参考框架。SAS EPS现在可运行在Cisco工业集成服务829路由器上,在工厂、卡车等靠近传感器的地方就近分析实时数据。2016年,SAS专门在底特律设立了办公室以支持在汽车制造行业中的业务增长。

    在新型分析方面,云分析是一个重要的数据分析领域。SAS耗资10亿美金开发了面向云计算现代计算架构的云分析服务Viya,并于2016年开始推向市场。在SAS Global Forum 2017上SAS推出了全线的Viya产品,包括一系列可视化分析平台,把SAS Viya与传统软件版本的SAS 9结合起来就能形成一个企业内无处不在的数据分析环境。SAS Viya还提供了大量机器学习和人工智能功能,以满足当前日益增长的企业智能分析需求。

    SAS Result(Result-as-a-Service)是另一个新型的云分析产品。这实际上不是一个产品,而是基于项目的专业服务。SAS公司CTO Oliver Schabenberger在接受笔者采访时表示,对于客户来说不再需要自己去学习、掌握、理解和运用SAS公司的各种数据分析软件产品,而只需要向SAS Result团队提出自己的数据分析需求和数据,由SAS Result数据分析团队在后端完成所有的数据分析和处理后,把结果返回给客户即可。如果涉及到相应的持续云服务等IT需求,也可以选择托管给SAS公司。

    自云分析产品推出以来,已经为SAS在2016年带来了9%的业务增长。随着2017年SAS推出更多Viya产品,有望进一步带来更高回报的营收。Oliver介绍说,SAS Viya可运行在AWS之上以公有云方面运营和部署,也可以在企业内部部署在Cloud Foundry私有云之上为企业内部服务。

    2017年,SAS将继续在包括分析、可视化、数据管理、客户智能、风险和欺诈等在内的领域持续,并在SAS Viya、人工智能、云计算和物联网等领域进行大量投入。在SAS Global Forum 2017上,Jim Goodnight和Oliver还多次演示了利用AWS Echo智能语音音箱来与数据分析报表交互,这将创造新的数据分析互动形式。

    推动全球数据分析市场增长的第三大动力来自合作伙伴生态。随着大数据的崛起和数据分析市场的高营收前景,越来越多的独立软件商、系统集成商和增值分销商开始进入数据分析业务。Jim Goodnight表示,2016年SAS全球销售增长的30%由合作伙伴贡献,他们满足了客户的个性化需求和最终用户需求。SAS全球合伙伙伴生态形成规模化发展,从一个侧面说明了全球数据分析生态已经达到了一定的规模,开始成为拉动市场增长的主力。

    企业大数据分析仍需要时间

    尽管SAS的高速发展向市场传达了一个积极的信号,但在另一方面大数据缓慢给企业带来商业价值的现象也不容忽视。

    SAS的一份调查显示,近几年全球大数据取得了巨大的发展,但大数据仍然难以给企业带来实际的商业价值。SAS全球最佳实践副总裁Jill Dyche认为,现在所有的企业都专注于把大数据收集和存储到大数据平台上,而忘记了其实分析才能真正给大数据带来商业价值。由于大数据的收集、处理和准备等前期阶段耗费的时间过长、成本过高,导致企业高层开始失去耐心,这是当前大数据产业面临的困境。

    对于数据分析实践来说,如果想要获得企业高层以及各业务的认可,就要建立全员数据分析文化,而这是一个过程。尤其是当企业各层管理者的KPI里并没有涉及数据分析或数据分析无法影响这些KPI的时候,企业实际上很难接受在数据分析方面的投入,更不用说懂得数据分析语言的专业人才少之又少。

    Jill建议企业在实践数据分析的时候可参考三大最佳实践:一是把数据分析当成一个业务而看待,而不仅是运营或管理工具,要让数据分析与业务紧密结合而成为业务的一部分,这样就能真正为企业创造价值;二是让数据分析为企业业务战略服务,让数据分析可以深入影响企业的战略,从战略高度获得高层的认可,这远比在基层开展一个又一个小规模的数据分析更有效率;三是要把数据分析与数据管理分开,数据分析与数据管理其实是两个不同的领域,数据管理涉及到大数据等偏技术层面的专业知识和技能,而数据分析其实是要所业务语言和问题与数据结合,通过数据分析解决业务问题,因而数据分析不能等同于数据管理。

    在谈到全球企业数字化转型的时候,Jill认为IT组织和厂商的数字化转型更为重要也更为关键。IT组织和厂商作为企业数字化的技术合作伙伴,如果自身转型都不能成功,又何谈帮助企业成功完成数字化转型呢?现在,很多传统IT厂商在向现代化的数字化技术过程的时候都出现了身份危机,很难在新的时期成功完成自身产品、服务和解决方案的创新、颠覆与转型,比如PC厂商就在这一波数字化大潮中面临巨大的挑战。

    联想高级分析总监鲍若愚在SAS Global Forum 2017上分享了联想在数据分析方面的初步实践,鲍若愚认为联想的数据分析还处于起步阶段,联想数据分析团队还在争取获得联想内部各产品线和高层的认可。联想数据分析团队目前位于新加坡,在联想C级别高管中还无一人负责数据分析,这说明数据分析远未进入联想的战略管理视野。中国企业特别是中国IT企业在向数字化转型的过程中,还有很长的路要走。

    2017年1月,工信部公布了《大数据产业发展规划(2016-2020年)》,提出了到2020年的发展目标:大数据相关产品和服务业务收入突破1万亿元,年均复合增长率保持30%左右。此外,还将培育一批专业化数据服务创新型中小企业、10家国际领先的大数据核心龙头企业和500家大数据应用及服务企业,初步形成大数据产业体系。

    随着中国大数据市场的全面起动以及中国企业向“互联网+”的数字化转型继续推进,SAS公司期待在中国市场迎来更大的发展。“预期SAS中国市场今年增长率保持两位数(百分比)”,已经74岁的Jim Goodnight对中国的数据分析市场非常有信心。(文/宁川)

  • ?

    大数据的三大数据处理趋势

    余含蕾

    展开

    目前,数据处理呈现出3大重要趋势,其一是从离线到在线的趋势,圈里现在基本都不怎么提离线分析了,而是在讨论在线分析。第二个趋势是从统计到AI的趋势,用AI技术去做数据处理不再是未来的事儿,而是现在已经正在发生着。第三个趋势是在线分析平台化,支持多样化的数据如文本、Json、图片等,实现数据融合、统一、联合计算。

    他认为,这些趋势在未来的5年以内,会在中国乃至全球普及,未来数据分析是开放化、在线化的时代。他还指出,对未来企业业务的改造,怎么样让数据部门不再是企业的负担,而是一种增值,也是个很重要的探索方向。

    PB级大数据在线分析对数据计算的要求不仅要面对越来越大的数据量能被在线计算,更要求实时,几秒内返回,还可以被界面交互,并且可以让人人都可以当分析师,同时可以去探索,需要足够的开放性。

    目前阿里大数据分析在线化和开放化的实践,主要应用于电商业务、营销业务、O2O、交通、物流、娱乐、金融、征信、安全等几十个场景。涉及营销管理,安全风控,推荐,预测,洞察等多个方面。

    架构图中,我们发现与众不同的是AnalyticDB,这是阿里自研的大规模高性能分析型数据库,其实AnalyticDB并不是个新产品。会后,离哲在接受笔者采访时表示,AnalyticDB在2014年就上云了,主要目标是做极速低成本的PB级实时数据仓库。

    AnalyticDB主打三个功能:一、低成本;二、极速分析,包含延迟,并发上做到极速。三、上层提供了足够好的应用性,让用户能像用单机数据库一样,绝大部分语言和工具,都能连接。用户可以通过任何BI工具,甚至excel都能连接上来做分析,其目的是让阿里的在线分析能力能被用户以足够低的成本连接和被使用。

    关注佳源信息,关注更多资讯。

    【版权与免责声明】如发现内容存在版权问题,烦请提供相关信息发邮件至jy@jiayuaninfo,我们将及时沟通与处理。

  • ?

    Spark不是唯一,三种新兴的开源数据分析工具

    情绪

    展开

    在数据分析方面,影响深远的变化正在酝酿之中,而开源工具在引领许多变化。当然,你可能已熟悉这个领域的一些明星开源项目,比如Hadoop和Apache Spark,不过现在出现了强烈的要求,需要全面完善数据分析生态系统的新工具。值得注意的是,许多这些工具是为了处理流数据而定制的。

    物联网带来了众多传感器及其他设备,它们在生成源源不断的数据流,而物联网只是推动市场需要新型分析工具的重大趋势之一。比如需要流数据分析工具来改善药物发现,美国宇航局和搜寻外星文明研究所(SETI)甚至在开展合作,分析数TB复杂的外太空无线电信号流。

    虽然Apache Spark在数据分析领域抢走了许多风头,那是由于IBM及其他公司在这方面投入了数十亿美元的研发资金,但几个藉藉无名的开源项目也在迅速崛起。下面是值得探讨的三种新兴的数据分析工具。

    1.Grappa

    大大小小的企业组织正在致力于研究从数据流提取宝贵信息的新方法,其中许多在处理集群上生成的数据,而且在日益处理商用硬件上生成的数据。这样一来,成本合理的、以数据为中心的方法受到了重视,这种方法可以改善MapReduce、甚至Spark等工具的性能和功能。Grappa开源项目这时候闪亮登场了,它可以在大众化集群上扩展数据密集型应用程序,并且提供了一种新型的抽象机制,比经典的分布式共享内存(DSM)系统更胜一筹。

    你可以在此获得Grappa的源代码,并找到关于它的更多信息。Grappa的起源是这样的:一群在克雷(Cray)系统上运行大数据任务方面有着丰富经验的工程师想,是不是可以与克雷系统在现成商用硬件上能够实现的分析功能一较高下。

    正如开发人员特别指出:“Grappa在足够高级的层面提供了抽象,因而包括数据密集型平台所常见的许多性能优化。然而,其相对低级的接口又提供了一种方便的抽象,以便在此基础上构建数据密集型框架。(简化版)MapReduce、GraphLab和关系查询引擎的原型实现就建立在Grappa的基础上,它们的性能比原有系统更胜一筹。”

    采用BSD许可证的Grappa在GitHub上可以免费获取。如果你有兴趣看看Grappa是怎么实际运行的,可以在应用程序的README文件中遵照通俗易懂的快速启动说明,构建Grappa应用程序,并在集群上运行。

    2.Apache Drill

    Apache Drill项目在大数据领域带来了重大的影响,以至于MapR等公司甚至把它纳入到其Hadoop发行版中。它是Apache的一个顶级项目,与Apache Spark一同应用于许多流数据场景。

    比如说,在今年1月份召开的纽约Apache Drill大会上,MapR的系统工程师展示了Apache Spark和Drill如何可以协同用于涉及数据包捕获和近实时查询及搜索的一种使用场合下。

    Drill在流数据应用程序中之所以如此出名,是因为它是一种分布式、无模式(schema-free)的SQL引擎。开发运维和IT人员可以使用Drill,以交互方式探索Hadoop及其他NoSQL数据库(比如HBase和MongoDB)中的数据。不需要明确定义和维护模式,因为Drill可以自动充分利用嵌入到数据中的结构。它能够在操作员之间的内存中流式传输数据,并且尽量减少使用完成查询所需的磁盘。

    3.Apache Kafka

    Apache Kafka项目已凭借实时数据跟踪功能俨然成为一颗明星。它提供了处理实时数据的功能,具有统一、高吞吐量、低延迟等优点。Confluent及其他组织还开发了自定义工具,以便Kafka与数据流结合使用。

    Apache Kafka最初由LinkedIn开发,后来在2011年年初开放了源代码。它是一种经过加固和测试的工具,许多企业组织要求员工拥有Kafka方面的知识。使用Kafka的知名公司包括思科、网飞、贝宝、优步和Spotify。

    LinkedIn当初开发Kafka的那些工程师还成立了Confluent,它专注于Kafka。Confluent大学为Kafka开发人员以及操作员/管理员提供培训课程。现场课程和公开课程都有提供。

    转载地址:linuxprobe

    关注微信公共号,掌握最新IT资讯,免费领取RHCE考试真题。

  • ?

    数据分析必备的三大能力体系

    鄂穆

    展开

    这篇文章从整体框架出发,介绍了数据分析的三大层次。包括对数据分析的整体理解和认识,做数据分析的科学方法,以及数据分析相关的工具介绍。

    数据分析目前在国内互联网圈的受重视程度在逐步提升,但是问题也很突出:

    大家对于数据分析的认知和理解支离破碎,缺乏一个整体的、系统的思维框架;

    大家的视野更多局限在数据报表、BI 系统、广告监测等领域,对于数据以及数据分析其实是缺乏深层次洞察的。

    这篇文章就从整体框架出发,介绍一下数据分析的三大层次。包括对数据分析的整体理解和认识,做数据分析的科学方法,以及数据分析相关的工具介绍。

    一、数据分析价值观

    如何让数据分析真正发挥价值?我认为必须在

    价值认同、工作定位和商业模式

    三点上取得突破。

    (一)数据分析的价值认同

    做好数据分析,首先要认同数据的意义和价值。一个不认同数据、对数据分析的意义缺乏理解的人是很难做好这个工作的。放到一个企业里面,企业的 CEO 及管理层必须高度重视和理解数据分析的价值。你想一下,如果老板都不认可数据分析的价值,那么数据相关的项目在企业里面还能推得动吗?然后,企业内部还需要有数据驱动的公司文化。

    如果大家宁可拍脑袋做决定也不相信数据分析师的建议,那么数据分析往往是事倍功半、走一下形式而已,反之则是事半功倍。

    (二)数据分析的工作定位

    做好数据分析,要对数据分析的价值有清楚的定位。既不要神化数据分析,把它当做万能钥匙;也不要轻易否定数据分析的意义,弃之不用。数据分析应该对业务有实际的指导意义,而不应该流于形式,沦为单纯的 “取数”、“做表”、“写报告”。在 LinkedIn 那么多年的工作时间里面,我们对数据分析的工作早已有了清晰的定位:

    利用(大)数据分析为所有职场人员作出迅捷、高质、高效的决策,提供具有指导意义的洞察和可规模化的解决方案

    当时我们还采用了一套 EOI 的分析框架,对不同业务的数据分析价值有明确的定位。针对核心任务、战略任务和风险任务,我们认为数据分析应该分别起到

    助力(Empower)、优化(Optimize)、创新(Innovate)

    的三大作用。

    (三)数据分析的商业模式

    做好数据分析,要对企业的商业模式非常了解。数据分析的最终目的还是服务于企业的增长目标,所以务必要对行业背景、业务含义、产品和用户有着深刻的认知。

    还是以 LinkedIn 为例,作为企业增长的重要环节,LinkedIn 在产品设计之初就优先考虑到了数据的价值模式。首先是用户的增长、使用和活跃,然后产生大量的数据,最后根据数据进行业务变现(企业广告、企业招聘、高级账号等)和用户增长,从而不断良性循环。

    只有认可分析价值、明确工作定位、深谙商业模式,数据分析才能走在正确的轨道上。

    二、数据分析方法论

    (一)数据分析的框架

    在整个数据分析框架中,用户是数据的来源,也是数据分析最终要服务的对象。整个分析框架可以分为四大层次,依次是:数据规划、数据采集、数据分析和数据决策。

    从用户、业务系统,到数据采集平台、ETL、数据仓库, 再到分析、BI、DM、AI、洞察,再到决策、行为、价值,最终回到用户。

    上面整个分析框架中,越底层的占用的时间和精力越多,而顶层的耗时较少。从产生的价值来看,越底层的产生的价值越低,越顶层的产生的价值越高。大家想一下就会理解,做数据分析的过程大多时间是耗费在数据采集、清理、转换等脏活累活上面,最有价值的分析和决策部分往往耗时很少。

    因此,大家做数据分析应该把重心放在最有价值的分析和决策两个层面上,并且尽可能使用工具实现底层的自动化操作。

    (二)数据分析的方法论

    数据分析应该帮助我们不断优化营销、运营、产品、工程,驱动企业和用户的增长,而不是为了分析而分析。在这里我给大家介绍两个方法论,一个是业务上的 AARRR 模型,另一个是分析上的学习引擎。

    AARRR 是著名的 Growth Hacker (增长黑客)海盗法则,依序分别是 Acquisition(获取用户)、Activation(激发活跃)、Retention(提高留存)、Revenue(增加收入)和 Referral(推荐传播)的首字母简称,覆盖用户整个生命周期。我们在进行数据分析的时候,应该考虑用户正处于 AARRR 模型的哪个部分、关键数据指标是什么、对应的分析方法又是什么?

    “ 学习引擎 ” 是《精益创业》一书中提倡的精益化运营方式,在硅谷被大小企业广泛采纳。当我们有一个想法的时候,可以采用最简可行化产品(MVP)的方式将其构建(Build)出来。产品上线后,我们需要衡量(Measure)用户和市场的反应。通过分析收集到的数据,我们可以验证或者推翻我们之前的想法,从而不断学习(Learn)和优化。

    (三)数据分析的具体方法

    这篇文章的目的不是介绍具体的分析方法,而是为了让大家对整个数据分析能力体系有一个系统的认知,所以我就不对每一个方法进行具体的阐述。

    懂得每一种方法的原理是一回事,在业务中灵活应用又是另外一回事。以产品经理为例,可以把“用户行为 – 数据分析 -产品设计 & 优化 ”三位归于一体,在不断的实践应用中掌握各种分析方法的精髓和要义。数据来源于用户,数据分析的最终目的也是服务于企业和用户。做数据分析之前,一定要清晰业务目的和数据指标,选择科学的分析方法,用数据来指导产品和用户增长。

    三、数据分析工具篇

    (一)为什么工具那么重要?

    “ 工欲善其事,必先利其器 ” !

    整个数据框架下面的部分可能花费了 80% 的时间和精力,但是产生了不到 20% 的价值。大家都在搭建数据采集平台、都在写代码埋点、都在做 ETL、都在建 BI 系统,哪里还有更多的时间和人力来做 Analytics 和 Insight 。

    以前市面上没有好的数据分析工具,大家都只能自己去部署很多的系统、建立很多的机制,甚至雇佣三四个团队去做一件事。

    今天市面上有很多好的工具来帮助我们进行数据分析,为了节省时间、资源(特别是成长型企业),大家完全没有必要内部建造一套分析系统,应该擅用好的工具来帮助自己做数据分析。

    (二)选择合适的分析工具

    选择什么样的分析工具,跟你的工作岗位、分析场景息息相关。每种场景都有若干种工具可以选择,有些工具也可以用于多种分析场景,关键在于你对工具的熟悉和理解。

    Excel 绝对是最基本、最常见的数据分析工具了,对于数据量较小的情况,无论是数据处理、数据可视化还是一些统计分析都能支持。一旦数据量大了,这个时候就需要大型的数据库来支持。

    市场营销人员需要对广告投放进行数据分析,网站流量监测是他们关注的重点。产品和运营重点关注用户行为和产品使用,用户行为数据分析工具是他们的首选。

    以前大家只关注业务数据,然而这些结果型的数据并不能告诉他们中间发生了什么、为什么发生;现在大家越来越关注精细化运营、对用户行为数据的需求也越来越高,这也是我回国创立 GrowingIO 的原因。

    如果你能懂一些 R 和 Python,在数据建模、统计分析、数据科学的方向上有所发展,那么你的数据分析水平就更上一层楼了。

    上面说的这三点构成了数据分析的能力体系。只有认同数据分析的价值、掌握数据分析的方法并且灵活应用数据分析工具,才能真正做好数据分析。

    本文根据张溪梦演讲内容整理编辑。

    作者:张溪梦,GrowingIO 创始人 & CEO

    本文节选自 GrowingIO 2017 年第 3 期电子书《产品经理数据分析手册》

    本文由 @GrowingIO 原创发布于人人都是产品经理。未经许可,禁止转载。

  • ?

    网络营销数据分析的三大绝招方法及工具!-冒一冒

    施又亦

    展开

    俗话说:”知己知彼,百战百胜。”想要竞争激烈的市场脱颖而出,那就要学会监视竞争对手的一举一动!

    那如何监视竞争对手?

    首先就是比价格,列出所有竞争对手每类产品的最高价格和最低价格。

    当然不能纯粹拼价格,只拼价格,你会拼死的,永远有人的价格比你低,那接下来就是比质量,质量怎么比,你肯定比我专业。

    价格、质量,性价比高的时候,最后比的就是营销水平,在这个酒香也怕巷子深的年代,如何把你的好产品在竞争激烈的市场脱颖而出,展现在用户面前?

    首先就是要学会监视竞争对手的一举一动,从他们的营销手段创新出自己的营销手段。

    竞争对手分析的思路:

    公司的定位产品最主要卖点,为谁解决什么问题?产品的功能和特点宣传渠道市场策划方案网络营销运营方式

    如何理解产品,市场,运营这3个角度,说人话:

    产品是生产给用户是用户的,运营是用来维系用户关系的,市场是让用户知道产品,产生购买行为的。

    监视竞争对手的3个方法:

    1、利用招聘网

    去招聘网的招聘需求去分析竞争对手公司人员架构,就能看出竞争对手对互联网营销的重视程度,竞争对手重视网络营销,你必须比他更重视,否则已经是你的客户都可能被对手抢走,不知道你是否有过刚买完一件东西就后悔的情况?年轻貌美时代的maoly就经常这样,去买件衣服,心潮澎湃,热血沸腾,就付款了,可是买完后,还是忍不住再看看,结果总能发现更好的。

    相信你的客户也会这样的,在你这下单后,还是会忍不住再多比一比,网上一搜,只能看到他,不能看到你,他就会觉得那公司比你更有实力,哪怕公司没什么实力,在网络上面都能塑造的高大上,由其是价格却并不比你贵的情况,客户更容易转移战地!所以,你要小心了!

    如果对手不重视网络营销,那恭喜你!可以先入为主,抢占先机,互联网时代,就是谁先占领互联网,谁就能抢占先机。

    2、查看竞争对手的用户评论

    google搜索、在社交平台或电商平台阿里巴巴、Amazon查看竞争对手的用户评价,挖出竞争对手的优势与弱势,更好的完善好自己的产品、售前与售后服务,这一招对竞争对手分析非常有用。

    你需要每周至少查看一次竞争对手的社交媒体动态,这或许可以激发你的新创意。

    3、学会利用数据分析工具

    想要做好互联网营销,特别是外贸企业,网站SEO无疑是最有效的手段,想要让客户通过搜索引擎以及搜索关键词找到你,那肯定是要学会分析竞争对手的网站,看看他们网站的关键词排名,网站流量,以及在哪些平台有发布外链?多看看他们的外链及软文是如何写的?

    那我们可以通过工具“Dragon Metrics”,当你把其他网站添加为你的竞争对手,Dragon Metrics 会像追踪你的网站一样地追踪竞争对手的网站,在排名部分中你可以从多个维度查看某一竞争对手的排名表现。

    好的工具往往多少是需要一些费用的,这一款也不例外,我们也不是推广这一款软件,所以就不多做介绍。

    接着再给大家介绍一款既免费又好用的工具“sharedcount”,能查看对比自己以及竞争对手网站的社交分享次数。

    竞争对手分享102条,你才分享7条,竞争不过对手,你能怪别人吗?知道了竞争对手都做了什么?我们再比他们多做一点,是不是跑到了竞争对手前面?

    哈哈!

    现在是不是发现打败竞争对手,原来那么容易?别急,还有16款工具能帮助到你!比如:

    数据分析的16款工具

    Google alert:跟踪网络上任何你感兴趣的主题Talkwalker:监控社交媒体上的讨论Mention:监控社交媒体上的讨论Socialmention:实时搜索互联网上用户生产的内容,包括博客,评论,书签,新闻,视频,微博等等Simplymeasured:社交媒体统计分析工具FollowerWonk:跟踪分析竞争对手的twitter账号发布时间,频率,内容,互动情况Brandwatch:从多个渠道收集竞争对手在互联网上的讨论Semrush:在竞争对手网站关键词分析方面的功能非常强大Spyfu:用来跟踪竞争对手的SEO及PPC关键字情况Ispionage:查看竞争对手SEO及PPC的关键字Searchmetrics:查看竞争对手的SEO及PPC表现,分析竞争对手网站内容表现Alexa:查看竞争对手的流量趋势及现状Similarweb:在分析网站流量方面的功能非常强大Quantcast:利用大数据对网站受众的信息进行分析Whatrunswhere:是一个展示广告跟踪工具Thesearchmonitor:查看竞争对手桌面端(SEM,PLA)广告情况,广告投放内容,点击率,广告花费等……

    你以为互联网就这些工具?错了,这只是九牛一毛,这些工具,各有各的优势与劣势,不同的企业,不同的行业,企业所发展到不同的阶段,所需用到的工具也是不一样的,我们无需每个工具都用到,只需找到最适合自己的那一款竞争对手数据分析工具足已。

    哈哈,慢慢研究吧!

    时间就是金钱,没时间研究?如果你没有那么多时间去研究所有工具,就找我们百浪吧!专业针对各种企业的不同情况,量身定制属于适合贵公司最好用的工具,因为我们主要就是针对不同企业,一对一上门培训指导,时间就是金钱,节省您挖掘工具以及寻找互联网最佳营销手段的大量宝贵时间,提升您企业的营销效果。

    备注:转载请注明出处 文:网络营销女侠-冒一冒(maoly)

    天天加班,哪有时间看你的文章啊?

    没时间看?那就听啊!就可以边干活边听,或边坐公交边听了,到哪听?

    在“喜马拉雅FM”或者“荔枝FM”搜索冒一冒,就可以收听冒一冒为你读的《每天学点幽默口才》《段子里的经济学》《千万不要结婚》《冒一冒讲网络营销》了!

  • ?

    大数据领域的12大工具,市面上主要的大数据分析工具都在这了!

    向厉

    展开

    大数据工具让企业能够从数据仓库获得洞察力,从而在数据驱动的业务环境中提供重要的竞争优势。

    为了满足旺盛需求,大数据工具在迅速遍地开花。在大数据这一概念和业务战略出现以来的十年间,市面上出现了成千上万执行各种任务和流程的工具,它们都承诺可为你节省时间和资金,发掘业务洞察力从而实现创收。显然,一个不断增长的市场呈现在大数据分析工具的面前。

    其中许多工具一开始就像最初的大数据软件框架Hadoop那样是开源项目,但后来商业公司迅速涌现,为开源产品提供新工具或商业支持和开发。

    从中进行遴选可能很困难,尤其是许多大数据工具用途单一,而你可以用大数据处理许多不同的任务,所以你的分析工具箱会塞得满满当当。本文我们列出了市面上主要的大数据分析工具市面上主要的大数据分析工具,分三大?类别来介绍。

    ·主要的大数据工具·

    如前所述,大数据工具往往属于单一用途类别,而使用大数据有多种方式。所以我们将按类别细分,然后讨论每个类别的分析工具。

    一、大数据工具:数据存储和管理

    大数据完全始于数据存储,也就是说始于大数据框架Hadoop。它是Apache基金会运行的一种开源软件框架,用于在大众化计算机集群上分布式存储非常大的数据集。

    很显然,由于大数据需要大量的信息,存储至关重要。但除了存储外,还需要某种方式将所有这些数据汇集成某种格式化/治理结构,从而获得洞察力。因此,大数据存储和管理是真正的基础――离开了它,分析平台一无是处。在一些情况下,这些解决方案还包括员工培训。

    这个领域的大玩家包括:

    1. Cloudera

    实际上是增加了一些额外服务的Hadoop,你会需要它,因为大数据不容易搞。Cloudera的服务团队不仅可以帮助你构建大数据集群,还可以帮助培训你的员工,更好地访问数据。

    2. MongoDB

    MongoDB是最受欢迎的大数据数据库,因为它适用于管理经常变化的数据:非结构化数据,大数据常常是非结构化数据。

    3. Talend

    作为一家提供广泛解决方案的公司,Talend的产品围绕其集成平台而建,该平台集大数据、云、应用程序、实时数据集成、数据准备和主数据管理于一体。

    图1:Talend大数据集成平台包括数据质量和治理功能

    二、大数据工具:数据清理

    在你真正处理数据以获取洞察力之前,需要清理和转换数据,转换成可远程搜索的内容。大数据集往往是非结构化、无组织的,因此需要某种清理或转换。

    当下,数据可能来自任何地方:移动、物联网和社交媒体,数据清理显得更为必要。并非所有这些数据都可以轻松“清理”以获得洞察力,因此优秀的数据清理工具极其重要。实际上,在未来几年,预计经过有效清理的数据会是可接受的大数据系统与真正出色的大数据系统之间的竞争优势。

    4. OpenRefine

    OpenRefine是一款易于使用的开源工具,通过删除重复项、空白字段及??其他错误来清理凌乱的数据。它是开源的,但有一个相当大的社区可提供帮助。

    5. DataCleaner

    与OpenRefine一样,DataCleaner可将半结构化数据集转换成数据可视化工具可以读取的干净可读的数据集。该公司还提供数据仓库和数据管理服务。

    6. 微软Excel

    说真的,Excel有其用途。你可以从各种数据源导入数据。Excel在手动数据输入和复制/粘贴操作方面特别有用。它能消除重复项,查找和替换内容,检查拼写,还有用于转换数据的许多公式。但Excel很快陷入困境,不适合庞大数据集。

    三、大数据工具:数据挖掘

    一旦数据经过清理和准备,你可以通过数据挖掘开始搜索数据了。这时你执行这个实际的过程:发现数据、做出决定和进行预测。

    数据挖掘是大数据流程的真正核心。数据挖掘解决方案通常底层很复杂,但竭力提供 一种外观漂亮、对用户友好的用户界面,说起来容易做起来难。数据挖掘工具面临的另一个挑战是:它们确实需要人来编制查询,所以数据挖掘工具的好坏取决于使用它的专业人员。

    7. RapidMiner

    RapidMiner是一款易于使用的预测分析工具,有着对用户友好的可视化界面,这意味着你没必要编写代码即可运行分析产品。

    8. IBM SPSS Modeler

    IBM SPSS Modeler是一款包括五个数据挖掘产品的套件,面向企业级高级分析。另外IBM的服务和咨询首屈一指。

    9. Teradata

    Teradata为数据仓库、大数据和分析以及营销等应用提供端到端解决方案。这一切意味着贵公司可以真正成为数据驱动的公司,另外还有商业服务、咨询、培训和支持。

    图2:与许多目前的大数据工具一样,RapidMiner解决方案也支持云

    四、大数据工具:数据可视化

    数据可视化是指以一种可读、实用的格式显示你的数据。你可以查看图表图形以及直观显示数据的其他图像。

    数据可视化既是一门科学,又是一门艺术。随着大数据从有大批数据科学家支持的高管转移到整个公司上下,众多员工可以使用可视化工具极为重要。销售代表、IT支持和中层管理,这些团队个个都需要能够理解数据,因此重点放在易用性上。然而,易于阅读的可视化有时与来自深度特征集的数据读出相冲突,这带来了数据可视化工具面临的主要挑战之一。

    10. Tableau

    Tableau是该领域的领导者,其数据可视化工具专注于商业智能,无需懂得编程,即可创建各种地图、图表、图形及更多可视化元素。它共有五款产品,一款名为Tableau Public的免费版供潜在客户试用。

    11. Silk

    Silk是Tableau的简单版,让你可以通过地图和图表将数据可视化,无需任何编程。你在首次加载Silk时,它甚至会试着将数据可视化。它还让用户很容易在网上发布结果。

    12. Chartio

    Chartio使用自己的可视化查询语言,只要点击几下鼠标即可创建功能强大的仪表板,无需懂得SQL或其他建模语言。它有别于其他工具的地方主要在于,你可以直接连接到数据库,因此不需要数据仓库。

    13.IBM Watson Analytics

    IBM Watson Analytics结合了机器学习和人工智能,有助于提供智能数据科学助手,为业务分析员和数据科学家等拥有众多数据科学技能的用户扮演了向导。

    ·大数据工具的三个层次·

    普华永道的移动数据和分析计划首席技术官Ritesh Ramesh表示,就先进程度和市场战略而言,大数据工具可分成三层金字塔。

    第一层:最庞大的是一系列开源工具。每家公司以开源起家,像Cloudera和Hortonworks。除了基本的基础设施、服务器和存储外,没有多大的价值。大多数云厂商已将这一层实现了商品化。

    第二层:在这一层,大多数这类厂商已有意增加各自的市场份额,在开源工具上面构建一些专有应用程序,从而做到与众不同。举例说,Cloudera开发了许多产品,比如驻留在Hadoop核心上的数据科学平台。

    第三层:这些是针对特定垂直领域的应用程序。这些公司大多与普华永道、高知特或埃森哲等系统集成商合作。真正的价值出在这里,这对大数据工具开发商来说也是非常有效的竞争策略。

    Ramesh表示,除了基本功能外,这些工具的三大方面备受欢迎。首先是数据处理工具。他说:“数据学习工具是客户的工具箱中确保数据质量和分析数据的重要工具,比如处理5000万行数据以发现洞察力。”

    他表示,领先的厂商包括Trifacta、Paxata和Talend。

    第二大类应用程序是治理,比如你如何定义元数据。他说:“好多人在这方面遇到困难。人们只是将大量垃圾数据倒到数据湖。市面上可在数据湖中积极发挥功效的工具不多。由于这项工作主要由IT人员完成,他们更有兴趣将数据倒到数据湖,而不是确立一种治理结构。”

    主要厂商包括Waterline Data、以数据编目工具见长的Tamr和Collibra。

    Ramesh说,经常出现的第三大需求是安全。他说:“人们希望一个产品就有安全访问的所有层(列、行和对象)。他们希望一款产品为不同的数据对象支持用户访问和安全。这也是个新兴领域。”

    这个领域的主要厂商是Wandisco和FireEye。

    End.

    来源:网络大数据

    文章推荐

    一份高质量数据分析报告的三板斧

    如何完成一份高质量数据分析报告

    不同行业的软件都爱用什么编程语言开发?

  • ?

    11种常用的数据分析处理软件

    娜塔莉

    展开

      BI(BusinessIntelligence)即商业智能,越来越多的智能软件供应商推出可视化数据分析工具,应对企业业务人员的大数据分析需求。然而如果你觉得不是数据分析专业、没有挖掘算法基础就无法使用BI工具?NO,自助式分析工具已经让数据产品链条变得大众化。为了更好地帮助读者选择分析工具,重庆IT培训的老师将为大家介绍数说立方、数据观、BDP等11款BI-商业智能产品,排名不分先后!

      1、数说立方

      数说立方是数说故事新推出的一款面向数据分析师的在线商业智能产品。最重要的特点是配备百亿级社交数据库,同时支持全网公开数据实时抓取,从数据源端解决分析师难点;另外数说立方搭载了分布式搜索、语义分析、数据可视化三大引擎系统的海量计算平台,实现数据处理“探索式分析”和“秒级响应”的两个核心功能。同时数说立方是数说故事三大主打产品之一,并与其他两大产品数说聚合和数说雷达实现从数据源、数据分析、到数据展示完整的数据解决方案。

      优点:

      即便是个人免费版,体验和功能仍然非常好;

      与自家产品“数说聚合”的无缝接入,支持定向抓取微信、微博等数据;

      功能完善,集数据处理、特征工程、建模、文本挖掘为一体的机器学习平台;

      可视化视图展现、友好的客户感知页面;

      支持SAAS,私有化部署,有权限管理;

      缺点:

      产品新上市,操作指导页不太完善;

      体验过程中有一些小bug;

      2、数加平台

      数加是阿里云发布的一站式大数据平台,可以提供数据采集、结构化、加工到展示分析整套的一站式数据服务。 可采集不同系统及物理存储的源头数据,在分布式计算平台上进行数据的深度整合、计算、挖掘,将计算的结果通过可视化的工具进行个性化的数据分析和展现,也可直观的展示分析现有云上业务系统的数据库数据。

      优点:

      有完整的产品规划,功能完善;

      图形展示和客户感知良好;

      提供SQL查询;

      缺点:

      需要捆绑阿里云才能使用,一般用户还不能真正使用起来;

      部分体验功能一般,有一定的学习成本;

      3、Tableau

      Tableau是目前市面上较为成功的BI工具。产品既有针对性,又有普适性。拖放式界面,操作简单。数据兼容性强,适用于多种数据文件与数据库,同时也兼容多平台,windows、mac、Online均可使用。而且重要的一点是免费为用户安排现场培训或按需求进行在线培训。

      优点:

      处于行业领导者地位,功能完善;

      有较好的图形展现与客户感知;

      新产品开始支持云端展现,但是需要客户端支持;

      缺点:

      相比于商业智能BI,更像一个基于数据查询的数据展示工具;

      处理不规范数据、转化复杂模型比较难;

      无法处理大量数据;

      国内网络连接Online版速度较慢;

      4、Qlik

      QlikView只需轻轻单击几下,就可以对所有数据源进行合并、搜索、可视化和分析,可在不影响性能的前提下连接到多个数据源;其次视图种类丰富,界面简洁,互动性强,总体来说是一款简单易用的BI产品。Qlik用户可通过各类可视化效果,将Qlik扩展到任何应用程序中。另外用户也可以通过使用标准的和最新的网络API,可将可视化效果数据嵌入网站或应用程序。

      优点:

      产品功能完善,图形展现和客户感知良好;

      支持SAAS,有权限管理功能;

      缺点:

      有一定的学习成本;

      报表规范性要求很高;

      数据抓取功能都非常弱,需要有非常好的数据仓库作为基础;

      5、Spotfire

      Spotfire服务对象是一线工作人员和日常决策人员,其交互界面形象易懂,无需写脚本语言和编写程序就可以对数据进行添加、分离操作。内置搜索引擎,可以随意查找任意信息。支持R、S+等统计、挖掘功能;有丰富、开源的R模型。标记有自身特色,提供了过滤、钻取等功能,多个标记同时还可以实现图形化的集合运算。

      优点:

      交互界面形象易懂,即使是普通的业务人员也能轻而易举地进行复杂的数据分析;

      不一定要建数据仓库,还可以直接从多个异构数据源提取数据进行分析;

      支持SAAS,有权限管理功能;

      缺点:

      SAAS版只支持30M,由于是国外服务器所以上传很慢;

      不适合中国式的固定报表;

      进军中国市场较晚,国内案例较少;

      工具的适应性范围广,但是难易跨度大;

      6、神策分析

      神策分析的产品有完整的使用文档,每个模块都有详细的使用说明以及示例,降低了用户的学习成本。而且支持私有部署、任意维度的交叉分析,并帮助客户搭建专属的数据仓库。目前提供事件分析、漏斗分析、留存分析、数据管理等功能,未来预计会增加用户分群、用户人群分析、推送和异常维度组合挖掘等,工具需要付费使用。

      优点:

      专注于用户行为数据分析,不追求做大而追求做全;

      有详细的产品使用文档以及案例;

      提供SQL查询;

      缺点:

      更多的是demo示例,不能开箱即用;

      纯dashboard展示,并不能对单独一块数据作自定义分析;

      7、BDP

      BDP个人版使用免费,只需导入数据,设定分析维度,即可实时得到图表分析结果。产品示例和视频教学很细致,交互页面很友好。每次数据更新,对应的图表也会自动更新,可以免去一些重复分析、制作图表的数据工作。另外,分享环节也很贴心,数据仪表盘可以一键导出,也可直接生成链接分享给他人或分享到微信、微博等社交平台。

      优点:

      产品支持移动端;手机同步呈现最新数据

      用户可以免费使用工具,还有免费公开的数据源;

      操作体验流畅,界面友好,功能全,总体来说是一款不错的产品;

      即便是个人免费版,体验和功能仍然非常好;

      数据可以同步更新,免去了重复劳动的工作;

      缺点:

      官网的介绍比较简单;

      8、永洪BI

      永洪BI是一款可在前端进行多维分析和报表展现的BI软件。支持拖拽操作,数据源格式多样,提供不同级别的查询支持,支持跨库跨源连接。另外永洪提供了一款数据存储、数据处理的软件——MPP数据集市,可与BI打通,使得数据查询,钻取和展示的速度大幅度提高。不过其产品用户体验一般,拖拽过于自由,导致仪表盘布局不好控制;主题样式虽多但是给人感觉样式还是很传统。

      优点:

      商业流程完善,给人专业的感觉;

      产品定制化的版本效果不错;

      支持的数据接入较多;

      缺点:

      SAAS版体验很差,有一定的学习成本;

      UI的视觉效果一般,整体可视化效果不够现代化;

      9、数据观

      数据观的功能设计理念是极简、无门槛,所以它最大的特点就是简单。数据观数据来自云端,如:百度 网盘、微盘、salesforce等。数据上传后,马上有推荐图表,引导明确。另外产品的使用没有技术门槛,无需专业IT知识,同时适用于非专业分析师出身的业务人员,可以快速将数据转化成直观的图表,适合一开始接触数据分析工具的非专业数据从业人员。

      优点:

      注册只需填写邮箱,且支持明道账号登陆;

      使用引导明确,支持salesforce、百度云数据导入;

      分析结果支持链接分享,大大降低用户的沟通成本;

      缺点:

      不支持超过20MB的数据上传;

      数据导入后,数据分析体验方面存在bug;

      产品的使用以点击为主,不支持拖拽操作;

      10、FineBI

      FineBI分为数据处理、可视分析和分享公用三大功能模块。支持多种数据源,图表风格清爽美观,可选择任意维度分析。分析页面由控件和组件组成,控件和组件的数量是可以添加至任意多个,但是布局的交互比较僵硬,且使用逻辑有点乱,引导不明确。需要安装本地客户端才能使用。

      优点:

      有较为详细的行业案例与技术方案;

      产品演示和资源中心也较为清晰

      缺点:

      需要使用客户端,增加了使用的不便利性

      只有仪表盘展示,BI报表需要另一款产品;

      无法处理大量的数据;

      11、魔镜

      魔镜支持自动拖拽建模,同时可视化效果库十分酷炫。用户可以邀请团队成员到自己的项目,合作进行探索分析,并且按照需求有效控制访问数据的成员权限。产品模块规划完整,有基础企业版到hadoop等5种选择为,而且可以支持定制化服务。但是可能是云平台版的缘故,使用过程中出现不少BUG,企业版的体验可能会相对好一点。

      优点:

      产品模块的规划比较健全,其中包括数据源导入、数据分析、仪表盘、数据挖掘和数据工厂;

      官网的设计不错,模板选择性大,颜值控可能会喜欢;

      工具使用指导清晰,使用篇和方法篇等比较详细;

      缺点:

      产品存在较多的BUG,UI和功能相对其他产品来说较简陋;

      部分产品模块并不能切实用于数据分析;

      选择一款适用的BI产品,能够大大简化数据分析的繁杂工作,提高分析效率与质量。当然,以上每个工具各有优点,工具地址都给大家了,接下来就是轮到你动手的时候了,找一个自己喜欢的工具,开始吧!

      

三大数据分析软件

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP