中企动力 > 商学院 > 大数据bi软件
  • ?

    大数据 as BI商业智能

    蔺天宇

    展开

    如果你听到别人说:

    “大数据就是传统BI的简单升级,其实就是一个包装卖点”

    那不出意外,这个人一定是个传统BI商业智能的从业者。

    但如果你听到别人说:

    传统BI已经过时了,BI产品无法适应大数据时代

    那么,恭喜你又遇到了一个大数据 从业者。

    那么,这两者到底有什么区别,也是好多客户面临的问题,希望本篇文章能给大家一个更佳清晰的认知。

      1、大数据和BI两者的区别

    BI=商业智能,他跟企业或者机构的业务息息相关,没业务就谈不上BI,因为BI产品是企业数据化管理方案中的一个必要的因素,他要帮助企业整合数据,并提供管理者生产报表的功能呈现数据分析维度帮助管理者作出明智的业务经营决策,数据运营,数据营销都是这类问题。

      大数据,第一点区别是对企业拥有庞大的数据进行抽取,管理,处理,这些数据可以是非结构化的,或者看起来无用的数据,也可以是结构化的数据集合,这些数据是需要重新处理才能挖掘出价值。而这些数据是海量,高增长和多样化的信息资产。大数据更侧重解决某一类问题的方法,比如全网的用户画像,用户言论,以及对海量的非结构化物联数据的分析。

      不管定义有什么不同,或者还有多少种解释,大数据与传统BI是互联网以及数字化建设发展到不同阶段的产物。大数据对于传统BI,有继承也有发展,BI与大数据区别在于前者更倾向于业务决策,对事实描述更多是基于历史数据的共性,帮助决策者掌握宏观统计趋势,适合经营运营数据支撑类需求,而大数据则内涵更广,倾向于刻画个体,更多的在于个性化的决策分析。

    所以站在客户的角度来讲,两者可能都是他们需要的,而这两者也确实可以在一定程度上共用,因为两者几乎都是从数据->信息->知识->智慧。 

      2、两者技术上有什么相关性?

      传统BI的技术标签:

    大数据的技术标签:

    等等。可以说大数据和BI既有区别,又有相关。

      传统BI就目前来讲,其功能都可以被对应的大数据组件所替代,但大多数企业缺乏大数据业务的驱动,也缺乏相关的高技术人才,BI更好理解,大数据更加专业。

      如果我们将BI架设在大数据的应用层,利用etl抽取数据在结合大数据的架构,利用大数据算法构建业务模型,得出结果后在结合通用类的业务分析。既满足了海量实时数据分析,也满足了决策型的业务分析。这可以说是新型的BI系统,也可以说是贴合业务场景的大数据系统。

      3、作为企业我们到底选择什么技术?

      在技术领域,虽然传统BI的一些技术难以解决日后海量数据的处理问题,但是,也不能全盘否定或替代成大数据。一些企业采用SAP HANA,FineBI的直连大数据引擎都是基于这个问题优化的方案。所以说并不是每个企业都需要打造自己的大数据平台,需要考虑到企业的信息化水平和更新成本,建议根据实际需求,可以自行研发 ,比如BAT;也可以选型采购,比如传统大企业;

    目前一些大数据产品已经开始重视用户场景,使得整体架构更佳适合大数据管理和分析,再结合上层的场景化分析让大数据容易落地,更好的支撑决策。例如:德塔精要有一款大数据平台叫做智慧中枢,就建立在大数据架构上并深耕业务场景,让大数据产品更好的服务于具体的行业。

      大数据 VS 商业智能

      大数据的发展还需要时间,大数据技术并不重要,重要的是用全新的数据技术手段如何来拓展和优化业务?传统的数据支撑,大多是利用数据历史趋势,在感官上预估结果。举了简单的例子,一个人经常犯错误,我们就可以判断本次任务他犯错误的几率较大。这在一定的条件下确实比较直接有效,但问题是历史数据趋势并没有这么明显,如果两个人在历史数据中状态相当,我们又如何判断呢?

    基于大数据的算法,我们可以利用更多的维度信息,比如:年龄,职位,奖惩,健康,结婚情况,等等表面上毫无关系的数据,来建立模型,并利用大量的真实的数据让模型自我学习,这样再出现一个任务时,我们就可以在两个貌似没有差别的人中,选出更佳适合的人选,这也是传统BI无法实现的,大数据的魅力所在。

      即使如此,传统BI仍旧有大量的市场需求。大数据普及还需要时间,但大数据对BI不仅仅是简单的包含的关系,它涉及了思想、工具和人员深层次的变革,所以大数据绝对不是BI包了一个高大上的空壳,但大数据也千万不要高高在上,它需要更加贴和行业场景,解决实际的业务问题,让自己更好的进行落地。

  • ?

    数据挖掘、可视化ETL、大数据大并发……这才是企业需要的BI工具!

    钮秀

    展开

    在没有利用BI(商业智能)搭建完备的数据分析结构前,企业都是按照传统的方式来实现业务数据需求,就是各部门将自己的需求提给信息化部门去做。

    但“技术问题一股脑的扔给IT部”的方式,沟通成本高、需求响应慢。在倡导“人人都是数据分析师”的年代,是很低效的配合方式。

    自助式BI工具可以解决这些问题。

    我们可以试着将企业涉及数据分析的人群分为两大类:

    1、数据管理员

    这部分人群掌握着数据库、数据仓库,对基础数据拥有设计和建模能力。针对他们,BI可以作为一个平台帮助连接各数据库、数据仓库。管控、整合、清洗数据,为有分析需求的人准备数据,在分析过程中自动建模。功能上力求做到——高速度高性能、稳定。

    2、分析用户

    针对深度分析用户,他们往往就有数据分析基础和理解模型的能力,对数据有再处理加工和深度分析挖掘的需求。此时BI更多充当快速可视化分析的工具,通过可视化辅助数据分析时的思考。

    针对初级分析用户,他们的需求往往是Dashboard即席分析,结合可视化有主题的展示业务数据,实时监控,预警分析。此时的BI最好能有较低的上手门槛,能快速取数。

    针对一些查看数据的用户,比如领导boss们,他们的诉求就是看报告,了解业务状况,辅助业务决策。BI要做到报告可读美观,让用户聚焦于理解仪表板要表达的数据含义。

    也正是基于以上的实际数据分析场景,FineBI 5.0做了焕然一新的升级。聚焦于两个环节,数据的分发和数据的分析。

    数据的分发

    基于数据安全和精细的权限管理,让科技部门放心的把数据权限下放,业务部门能完整方便的拿到所需数据,这是自助分析推行的根基。

    数据的管理是阻碍企业数据分析推行的很大原因。科技部门担心风险,导致业务部门很简单的需求不能得到及时响应;很多数据的需求本身时效性很高,一旦过了这个数据再拿到也已经没有价值了;还有部分是数据给的不完整,脏数据很多,导致业务想进行的分析做到一半进行不下去,逐渐放弃…

    数据的分析

    好的工具能提高效率,优化协作方式。FineBI 5.0想让人人都能成为数据分析师:业务能够很容易的对数据进行分析和观察,甚至一定程度的专业分析;专业的数据分析师能够借助BI,更高效的处理数据做分析。

    最低成本的发现数据价值,也是FineBI 5.0最核心解决的问题。

    FineBI 5.0可以说是真正能够覆盖“个人数据分析”到“企业数据价值挖掘”的数据分析平台。

    新版本赋予了其4类特性:数据分析挖掘、数据处理、大数据高性能、企业级数据管控。

    —数据分析挖掘—

    1、更符合人类思维的探索分析——step by step

    数据分析思考过程不可能是一步到位的,一定是分析——发现问题——修正的螺旋上升的过程。我们发现用户在拿到数据时,都先是尝试性的分析看一下数据的趋势,然后在逐渐一步一步地去深入分析。在这过程中,有可能很多思考是错误的,有些指标是需要再计算的。对于这些“探索性”的操作,FineBI提供增加,修改,删除历史操作功能,及时修正,每一个步骤都可以预览数据。且提供无限层级的数据分析:用户可以对自己权限下的数据任意处理。

    2、分析思维主导的可视化

    5.0的可视化分析,采用全新的设计理念。基于著名的图形语法(The Grammar Of Graphics)设计改良,提供了无限的视觉分析可能,我们称之为“无限图表类型”。

    取消了传统图表类型的概念,取代以'形状'和形状对应的'颜色','大小','提示',‘标签’等属性;取消了'分类'、'系列'等概念,取代以'横轴'、 '纵轴'两个方向。当你分析两个数据字段的相关性时,会自动选择最合适的图表(也可手动调整)。这样的思维更符合大家拿到数据不知如何分析,先初步了解数据情况的探索式分析场景。

    每种图表背后都有很强的数据分析算法,让分析更加专业科学。此外FineBI 5.0还优化了底层数据逻辑,重新设计了图表的大数据模式,支撑图表展示数据量可达百万以上。

    一些FineBI 5.0实现的可视化效果:

    3、新增数据挖掘算法

    在5.0版本中,增加了五类挖掘算法,分别为时间序列、聚类、分类、回归和关联规则。

    也就是说,在这一版本中,如果你想预测未来的销售额,你想智能地给用户群分类,或者你想知道短信发给哪个用户获得的反馈可能性比较大,将会成为现实。

    此外,我们将时间序列算法和聚类算法和图表分析相结合,不用写任何算法代码只需要简单的拖拖拽着就可以立马看到预测和聚类的结果。

    如果需要更多的算法怎么办,我们当然为这种复杂的挖掘需求做好了准备, 5.0可以集成了R语言,可以直接在FineBI中进行R语言编译,实现数据统计和分析的需求。并且直接将数据统计和分析结果通过finebi展现,完美的结合了R语言的统计能力优势和FineBI的展现优势。

    当然,以上还只是开始,未来还会增强FineBI的数据挖掘能力,开发更多的内置算法,让数据挖掘更为简单易用。

    —数据处理—

    让业务人员拿到需要的数据,让IT部门放心的提供数据,是自助分析推行、人人都是数据分析师的根基。FineBI 5.0数据准备功能整合了原SPA螺旋分析和ETL,并做了进一步的增强,更方便、更高效、更强大,业务人员可以在精准的数据权限下,实现对数据进行再处理和深度分析挖掘的需求。

    (1)清晰全面的数据掌控。FineBI 5.0可以让用户对自己的数据,有更全面、更清晰的了解。表结构和表预览两种视图,让表基础信息查看更清晰、更方便,大面积的数据预览区域,更易了解数据内容。数据血缘分析功能,让用户对数据的来源去向、应用状况一目了然。同时,数据的更新情况,何时更新、更新频繁程度,也能直观展示。

    (2)简单高效的数据配置。高效的数据准备和配置,可以减少用户不必要的麻烦。关联智能继承,可以自动对新创建的分析表建立关联,延续数据关联关系。在基础数据更新时,将自动触发分析用户的数据更新。根据数据量、使用频率以及实时性的要求,能实现实时数据和抽取数据的无缝切换,完全不影响用户已经做好的分析。

    (3)强大友好的数据处理。用户可以对自己的数据进行任意处理,即便是已经参与分析的数据也一样,进行如清洗过滤、新增字段、表合并、排序、分组汇总、数据挖掘等操作,来得到自己想要的数据。每一步操作都有数据预览,操作后立即收到反馈,增强用户的数据操纵感,减少不确定性。

    —大数据高性能—

    5.0将直接对接数据库的实时数据引擎与抽取数据的引擎整合统一为Spider计算引擎。用户可以根据数据量、实时性要求、使用频次等,自由选择实时或抽取的方式。实时数据与抽取数据方式的无缝切换,将更加灵活高效支撑前端的高性能分析。

    Spider数据引擎可灵活支撑不同数据量级的分析,在数据量激增之后,可横向扩展机器节点,利用Spider引擎专为支撑海量大数据分析而生的分布式方案。

    Spider引擎分布式方式,结合Hadoop大数据处理思路,以最轻量级的架构实现大数据量高性能分析。此分布式方案集成了Alluxio 、Spark、 HDFS、zookeerer等大数据组件,结合自研高性能算法,列式存储、并行内存计算、计算本地化加上高性能算法,解决大数据量分析问题与在FineBI中快速展示的问题。同时从架构上保证了计算引擎系统全年可正常使用。

    优势:

    (1)引擎支撑前端快速地展示分析,真正实现亿级数据,秒级展示。

    (2)用户可以根据数据量、实时性要求、使用频次等,自由选择实时或抽取的方式,灵活满足实时数据分析与大数据量历史数据分析的需求。

    (3)抽取数据的高性能增量更新功能,可满足多种数据更新场景,减少数据更新时间,减少数据库服务器压力。

    (4)合理的引擎系统架构设计可保证全年无故障,全年可正常使用。

    —企业级数据管控—

    数据管控能力决定BI工具的应用范围和深度。FineBI 5.0提供了精准的企业级数据权限管控方案,管理员可以高效便捷的进行权限配置,放心大胆的交付给分析人员相关数据,无需担心隐私数据泄露。

    (1)权限统一配置。平台统一控制权限,如业务包权限、数据表行权限、数据表列权限等,权限控制的粒度更细致,更科学。通过配置主表权限,所有关联的业务表权限也会生效。

    (2)权限智能继承。分析人员所做的分析表默认继承基础数据的权限,管理员无需再担心这些数据表的权限分配,每个阅读用户自动看到自己权限范围内的数据,这有利于促进分析人员之间的分享和交流。

    (3)满足不同场景。不同场景对数据权限的要求是不同的,每个用户有权将自己权限范围的数据,在有需要的情况下开放给其他用户。比如总部制作的各大区的汇总销售额,想要让每个用户都可以看到,权限继承的情况下,各大区是没有权限看到其他大区的数据的,但是总部的分析表制作用户有权不继承权限,将数据开放给各大区用户。

    ——最后——

    此次的FineBI 5.0版,焕然一新,将企业级自助式BI工具提升到一个新的高度。不仅是数据分析挖掘工具、数据可视化工具、更是适合多数企业复杂流程下的数据分析平台。

    目前5.0 版本已在FineBI官网上线,大家可以自行下载体验!

  • ?

    全球100款大数据工具汇总

    柏浩宇

    展开

    1、 Talend Open Studio

    是第一家针对的数据集成工具市场的ETL(数据的提取Extract、传输Transform、载入Load)开源软件供应商。Talend的下载量已超过200万人次,其开源软件提供了数据整合功能。其用户包括美国国际集团(AIG)、康卡斯特、电子港湾、通用电气、三星、Ticketmaster和韦里逊等企业组织。

    2、DYSON

    探码科技自主研发的DYSON智能分析系统,可以完整的实现大数据的采集、分析、处理。DYSON智能分析系统专业针对互联网数据抓取、处理、分析,挖掘。可以灵活迅速地抓取网页上散乱分布的信息,并通过强大的处理功能,准确挖掘出所需数据,是目前使用人数最多的网页采集工具.

    3、YARN

    一种新的Hadoop资源管理器,它是一个通用资源管理系统,可为上层应用提供统一的资源管理和调度,解决了旧MapReduce框架的性能瓶颈。它的基本思想是把资源管理和作业调度/监控的功能分割到单独的守护进程。

    4、Mesos

    由加州大学伯克利分校的AMPLab首先开发的一款开源群集管理软件,支持Hadoop、ElasticSearch、Spark、Storm 和Kafka等架构。对数据中心而言它就像一个单一的资源池,从物理或虚拟机器中抽离了CPU,内存,存储以及其它计算资源, 很容易建立和有效运行具备容错性和弹性的分布式系统。

    5、Datale

    由探码科技研发的一款基于Hadoop的大数据平台开发套件,RAI大数据应用平台架构。

    6、 Ambari

    作为Hadoop生态系统的一部分,提供了基于Web的直观界面,可用于配置、管理和监控Hadoop集群。目前已支持大多数Hadoop组件,包括HDFS、MapReduce、Hive、Pig、 Hbase、Zookeper、Sqoop和Hcatalog等。

    7、ZooKeeper

    一个分布式的应用程序协调服务,是Hadoop和Hbase的重要组件。它是一个为分布式应用提供一致性服务的工具,让Hadoop集群里面的节点可以彼此协调。ZooKeeper现在已经成为了 Apache的顶级项目,为分布式系统提供了高效可靠且易于使用的协同服务。

    8、Thrift

    在2007年facebook提交Apache基金会将Thrift作为一个开源项目,对于当时的facebook来说创造thrift是为了解决facebook系统中各系统间大数据量的传输通信以及系统之间语言环境不同需要跨平台的特性。

    9、Chukwa

    监测大型分布式系统的一个开源数据采集系统。建立在HDFS/MapReduce框架之上并继承了Hadoop的可伸缩性和可靠性,可以收集来自大型分布式系统的数据,用于监控。它还包括灵活而强大的显示工具用于监控、分析结果。

    10、Lustre

    一个大规模的、安全可靠的、具备高可用性的集群文件系统,它是由SUN公司开发和维护的。该项目主要的目的就是开发下一代的集群文件系统,目前可以支持超过10000个节点,数以PB的数据存储量。

    11、HDFS

    Hadoop Distributed File System,简称HDFS,是一个分布式文件系统。HDFS是一个高度容错性的系统,适合部署在廉价的机器上。HDFS能提供高吞吐量的数据访问,非常适合大规模数据集上的应用。

    12、GlusterFS

    一个集群的文件系统,支持PB级的数据量。GlusterFS 通过RDMA和TCP/IP方式将分布到不同服务器上的存储空间汇集成一个大的网络化并行文件系统。

    13、Alluxio

    前身是Tachyon,是以内存为中心的分布式文件系统,拥有高性能和容错能力,能够为集群框架(如Spark、MapReduce)提供可靠的内存级速度的文件共享服务。

    14、Ceph

    新一代开源分布式文件系统,主要目标是设计成基于POSIX的没有单点故障的分布式文件系统,提高数据的容错性并实现无缝的复制。

    15、PVFS

    一个高性能、开源的并行文件系统,主要用于并行计算环境中的应用。PVFS特别为超大数量的客户端和服务器端所设计,它的模块化设计结构可轻松的添加新的硬件和算法支持。

    16、QFS

    Quantcast File System (QFS) 是一个高性能、容错好、分布式的文件系统,用于开发支持 MapReduce处理或者需要顺序读写大文件的应用。

    17、 Logstash

    一个应用程序日志、事件的传输、处理、管理和搜索的平台。可以用它来统一对应用程序日志进行收集管理,提供了Web接口用于查询和统计。

    18、Scribe

    Scribe是Facebook开源的日志收集系统,它能够从各种日志源上收集日志,存储到一个中央存储系统(可以是NFS,分布式文件系统等)上,以便于进行集中统计分析处理。

    19、Flume

    Cloudera提供的一个高可用的、高可靠的、分布式的海量日志采集、聚合和传输的系统。Flume支持在日志系统中定制各类数据发送方,用于收集数据。同时,Flume支持对数据进行简单处理,并写入各种数据接受方(可定制)。

    20、RabbitMQ

    一个受欢迎的消息代理系统,通常用于应用程序之间或者程序的不同组件之间通过消息来进行集成。RabbitMQ提供可靠的应用消息发送、易于使用、支持所有主流操作系统、支持大量开发者平台。

    21、ActiveMQ

    Apache出品,号称“最流行的,最强大”的开源消息集成模式服务器。ActiveMQ特点是速度快,支持多种跨语言的客户端和协议,其企业集成模式和许多先进的功能易于使用,是一个完全支持JMS1.1和J2EE 1.4规范的JMS Provider实现。

    22、Kafka

    一种高吞吐量的分布式发布订阅消息系统,它可以处理消费者规模网站中的所有动作流数据,目前已成为大数据系统在异步和分布式消息之间的最佳选择。

    23、Spark

    一个高速、通用大数据计算处理引擎。拥有Hadoop MapReduce所具有的优点,但不同的是Job的中间输出结果可以保存在内存中,从而不再需要读写HDFS,因此Spark能更好地适用于数据挖掘与机器学习等需要迭代的MapReduce的算法。它可以与Hadoop和Apache Mesos一起使用,也可以独立使用。

    24、Kinesis

    可以构建用于处理或分析流数据的自定义应用程序,来满足特定需求。Amazon Kinesis Streams 每小时可从数十万种来源中连续捕获和存储数TB数据,如网站点击流、财务交易、社交媒体源、IT日志和定位追踪事件。

    25、 Hadoop

    一个开源框架,适合运行在通用硬件,支持用简单程序模型分布式处理跨集群大数据集,支持从单一服务器到上千服务器的水平scale up。Apache的Hadoop项目已几乎与大数据划上了等号,它不断壮大起来,已成为一个完整的生态系统,拥有众多开源工具面向高度扩展的分布式计算。高效、可靠、可伸缩,能够为你的数据存储项目提供所需的YARN、HDFS和基础架构,并且运行主要的大数据服务和应用程序。

    26、Spark Streaming

    实现微批处理,目标是很方便的建立可扩展、容错的流应用,支持Java、Scala和Python,和Spark无缝集成。Spark Streaming可以读取数据HDFS,Flume,Kafka,Twitter和ZeroMQ,也可以读取自定义数据。

    27、Trident

    是对Storm的更高一层的抽象,除了提供一套简单易用的流数据处理API之外,它以batch(一组tuples)为单位进行处理,这样一来,可以使得一些处理更简单和高效。

    28、Flink

    于今年跻身Apache顶级开源项目,与HDFS完全兼容。Flink提供了基于Java和Scala的API,是一个高效、分布式的通用大数据分析引擎。更主要的是,Flink支持增量迭代计算,使得系统可以快速地处理数据密集型、迭代的任务。

    29、Samza

    出自于LinkedIn,构建在Kafka之上的分布式流计算框架,是Apache顶级开源项目。可直接利用Kafka和Hadoop YARN提供容错、进程隔离以及安全、资源管理。

    30、Storm

    Storm是Twitter开源的一个类似于Hadoop的实时数据处理框架。编程模型简单,显著地降低了实时处理的难度,也是当下最人气的流计算框架之一。与其他计算框架相比,Storm最大的优点是毫秒级低延时。

    31、Yahoo S4 (Simple Scalable Streaming System)

    是一个分布式流计算平台,具备通用、分布式、可扩展的、容错、可插拔等特点。程序员可以很容易地开发处理连续无边界数据流(continuous unbounded streams of data)的应用。它的目标是填补复杂专有系统和面向批处理开源产品之间的空白,并提供高性能计算平台来解决并发处理系统的复杂度。

    32、HaLoop

    是一个Hadoop MapReduce框架的修改版本,其目标是为了高效支持 迭代,递归数据 分析任务,如PageRank,HITs,K-means,sssp等。

    33、Presto

    是一个开源的分布式SQL查询引擎,适用于交互式分析查询,可对250PB以上的数据进行快速地交互式分析。Presto的设计和编写是为了解决像Facebook这样规模的商业数据仓库的交互式分析和处理速度的问题。Facebook称Presto的性能比诸如Hive和MapReduce要好上10倍有多。

    34、 Drill

    于2012年8月份由Apache推出,让用户可以使用基于SQL的查询,查询Hadoop、NoSQL数据库和云存储服务。它能够运行在上千个节点的服务器集群上,且能在几秒内处理PB级或者万亿条的数据记录。它可用于数据挖掘和即席查询,支持一系列广泛的数据库,包括HBase、MongoDB、MapR-DB、HDFS、MapR-FS、亚马逊S3、Azure Blob Storage、谷歌云存储和Swift。

    35、Phoenix

    是一个Java中间层,可以让开发者在Apache HBase上执行SQL查询。Phoenix完全使用Java编写,并且提供了一个客户端可嵌入的JDBC驱动。Phoenix查询引擎会将SQL查询转换为一个或多个HBase scan,并编排执行以生成标准的JDBC结果集。

    36、Pig

    是一种编程语言,它简化了Hadoop常见的工作任务。Pig可加载数据、转换数据以及存储最终结果。Pig最大的作用就是为MapReduce框架实现了一套shell脚本 ,类似我们通常熟悉的SQL语句。

    37、Hive

    是基于Hadoop的一个数据仓库工具,可以将结构化的数据文件映射为一张数据库表,并提供简单的sql查询功能,可以将sql语句转换为MapReduce任务进行运行。 其优点是学习成本低,可以通过类SQL语句快速实现简单的MapReduce统计,不必开发专门的MapReduce应用,十分适合数据仓库的统计分析。

    38、SparkSQL

    前身是Shark,SparkSQL抛弃原有Shark的代码并汲取了一些优点,如内存列存储(In-Memory Columnar Storage)、Hive兼容性等。由于摆脱了对Hive的依赖性,SparkSQL无论在数据兼容、性能优化、组件扩展方面都得到了极大的方便。

    39、Stinger

    原来叫Tez,是下一代Hive,由Hortonworks主导开发,运行在YARN上的DAG计算框架。某些测试下,Stinger能提升10倍左右的性能,同时会让Hive支持更多的SQL。

    40、Tajo

    目的是在HDFS之上构建一个可靠的、支持关系型数据的分布式数据仓库系统,它的重点是提供低延迟、可扩展的ad-hoc查询和在线数据聚集,以及为更传统的ETL提供工具。

    41、Impala

    Cloudera 声称,基于SQL的Impala数据库是“面向Apache Hadoop的领先的开源分析数据库”。它可以作为一款独立产品来下载,又是Cloudera的商业大数据产品的一部分。Cloudera Impala 可以直接为存储在HDFS或HBase中的Hadoop数据提供快速、交互式的SQL查询。

    42、 Elasticsearch

    是一个基于Lucene的搜索服务器。它提供了一个分布式、支持多用户的全文搜索引擎,基于RESTful web接口。Elasticsearch是用Java开发的,并作为Apache许可条款下的开放源码发布,是当前流行的企业级搜索引擎。设计用于云计算中,能够达到实时搜索、稳定、可靠、快速、安装使用方便。

    43、Solr

    基于Apache Lucene,是一种高度可靠、高度扩展的企业搜索平台。知名用户包括eHarmony、西尔斯、StubHub、Zappos、百思买、AT&T、Instagram、Netflix、彭博社和Travelocity。

    44、Shark

    即Hive on Spark,本质上是通过Hive的HQL解析,把HQL翻译成Spark上的RDD操作,然后通过Hive的metadata获取数据库里的表信息,实际HDFS上的数据和文件,会由Shark获取并放到Spark上运算。Shark的特点就是快,完全兼容Hive,且可以在shell模式下使用rdd2sql()这样的API,把HQL得到的结果集,继续在scala环境下运算,支持自己编写简单的机器学习或简单分析处理函数,对HQL结果进一步分析计算。

    45、Lucene

    基于Java的Lucene可以非常迅速地执行全文搜索。据官方网站声称,它在现代硬件上每小时能够检索超过150GB的数据,它拥有强大而高效的搜索算法。

    46、Terracotta

    声称其BigMemory技术是“世界上首屈一指的内存中数据管理平台”,支持简单、可扩展、实时消息,声称在190个国家拥有210万开发人员,全球1000家企业部署了其软件。

    47、 Ignite

    是一种高性能、整合式、分布式的内存中平台,可用于对大规模数据集执行实时计算和处理,速度比传统的基于磁盘的技术或闪存技术高出好几个数量级。该平台包括数据网格、计算网格、服务网格、流媒体、Hadoop加速、高级集群、文件系统、消息传递、事件和数据结构等功能。

    48、GemFire

    Pivotal宣布它将开放其大数据套件关键组件的源代码,其中包括GemFire内存中NoSQL数据库。它已向Apache软件基金会递交了一项提案,以便在“Geode”的名下管理GemFire数据库的核心引擎。

    49、 GridGain

    由Apache Ignite驱动的GridGrain提供内存中数据结构,用于迅速处理大数据,还提供基于同一技术的Hadoop加速器。

    50、MongoDB

    是一个基于分布式文件存储的数据库。由C++...

  • ?

    出色的可视化大数据分析软件都有这些功能

    姜问夏

    展开

    大家都知道,选购可视化大数据分析软件就是为了通过数字化运营来促进收益。一款出色的可视化分析软件会将各个指标的数据都分析到位,帮助领导做出良好正确的决策。然而,不是所有可视化大数据分析软件都能发挥该发挥的作用。其实,在使用可视化大数据分析软件的过程中,学会几招重要技巧,可以帮助最大程度发挥可视化分析软件的功能。

    可视化大数据分析软件

    采用动态报告

    当企业需要实施商业智能解决方案时您应该考虑动态报告。动态报告可以随意创建,操作和修改。

    它们旨在为企业提供想要的信息。企业可以通过添加、过滤,以及更改信息来控制如何查看数据。

    当企业使用动态报告分析销售指标时,可以按地区,产品或客户细分信息。简而言之,动态报告是直接而直观的。静态分析报告无法提供其相同的灵活性。一旦建立了静态报告,就不能改变其基本结构。

    对于像提交月度报告和季度报告,这可能没有问题,但是,企业将无法深入分析数据。

    自助式商业智能

    在数据分析方面,传统上只有专家能够理解复杂的报告。而另一方面,商业智能使数据分析更加简单。现在任何级别的用户都可以随时轻松访问数据。这就是为什么自助式商业智能越来越受欢迎的原因。它允许人们使用商业智能解决方案来实时研究数据,并自行构建准确的可视化报告。

    选择自助式可视化大数据分析软件,将为企业的工作人员提供易用性。

    可视化分析软件

    移动商业智能

    一个良好的商业智能解决方案应该让用户随时随地访问信息。移动应用的增长和智能手机的能力已经导致移动商业智能(Mobile BI)的兴起。

    根据阿伯丁集团的数据,使用移动商业智能的公司比没有采用的公司有更多的时间获得商业数据。这是一个竞争优势,因为能够做出明智的商业决策。

    行业的认可

    企业应该检查自己正在考虑的商业智能提供商是否具有良好的信誉。 包括业务价值,客户满意度,以及供应商支持。

    着眼未来

    对商业智能解决方案的投资是企业对其业务未来的投资。如果企业选择一个正在向前发展的供应商,其业务也将向前发展。

    以上就是一款出色的可视化大数据分析软件该具备的几个被人忽视的功能。好好掌握这几招,将对你的企业决策有一定的帮助。

  • ?

    BI到AI,大数据商业智能分析工具将更智能

    应天薇

    展开

      前不久在乌镇举办的互联网峰会,聚集了当下各大行业大佬,而这次会议讨论最多的大主题莫过于是AI。大佬们纷纷表示未来是智能的世界,去年AlphaGo就预示着AI的到来。各行各业包括象征着智能技术的商业智能行业也将与AI融合,变得更加智能。未来的大数据商业智能分析工具或将加入AI技术,打造更加智能的大数据分析BI工具。

    大数据分析工具

      随着中国经济增速趋于温和,企业跑马圈地、粗犷经营的红利期已经过去,精细化运营的需求正在爆发。“过去,占领一个市场比做一个系统搞精细化运营带来的收益更大。”张云说道,“现在企业已初具规模,想进一步提升收益,就必须要做精细化运营。”

      而数据则是精细化运营的关键所在。阿里巴巴集团董事局主席马云在12月3日第四届世界互联网大会的演讲中表示,在未来的30年中,数据将会成为生产资料,计算会是生产力,互联网会是一种生产关系。“如果我们不数据化,不和互联网相连,那么会比过去30年不通电显得更可怕。”马云说道。

      现代BI已经与早前基于SQL语言技术的传统BI有着显著的区别。“在旧技术下,每提出一个新问题,都需要先联系技术专家做一个新的数据模型,然后作出询问、得到答案。这个过程耗时耗力、成本颇高,操作上并不高效。但随着AI技术的持续进步,其自动化数据准备能力将有助于BI的高性能分析,此外,AI在自然语言处理、图形识别等信息处理和统计方面也均能发挥关键的作用。

    商业智能

      有别于过去旨在实现海量数据管理、简单分析与可视化的传统BI,新的大数据商业智能分析工具将利用人工智能技术推动商业决策,实现商业经营的智能化、自动化。可以预见,三两年后,自然语言和人工智能技术将是很常见的BI技术基础。当然,AI技术只是无限地优化BI技术,不能逾越BI技术本身,研发人员最终要做的还是专研BI技术的提升。

  • ?

    关于BI商业智能的“8大问”|一文读懂大数据BI

    堪笑容

    展开

    这里不再阐述商业智能的概念了,关于BI,就从过往的了解,搜索以及知乎的一些问答,大家困惑的点主要集中于大数据与BI的关系,BI的一些技术问题,以及BI行业和个人职业前景的发展。这里归纳成8个问题点,每个问题都做了精心的解答,希望能给大家带来帮助。

    问题1:商业智能BI和大数据是什么关系,如何选择?

    BI(BusinessIntelligence)即商业智能,它是一套完整的解决方案,用来将企业中现有的数据进行有效的整合,快速准确的提供报表并提出决策依据,帮助企业做出明智的业务经营决策。

    大数据(Big Data)是指在可承受的时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力来适应海量、高增长率和多样化的信息资产。

    两者是不一样的概念,BI相对于大数据更倾向于决策,适合支持经营指标支撑类的问题,大数据则内涵更广,倾向于刻画个体,更多的在于个性化的决策。

    现今,大型互联网企业采用hadoop一类的大数据架构——数据仓库——自己研发的报表、OLAP分析等,或者前端选用成熟的商业智能报表和BI分析软件,像FineBI之类的大数据BI都能对接大数据平台。传统企业,小型的公司没有那么多的业务分析的需求,大多寻求excel、业务系统的简单报表功能或者专业的报表工具来解决问题;一般中大型企业数据量大时会构建数据仓库,用BI在前端分析展现。当然很多传统企业针对特定业务(比如用户画像、风控分析)采用大数据技术。

    整体来讲,选择大数据还是BI依据需求来定,大数据组件大多开源,需要大量的人力开发。BI大多商用,需要一定资金和一定时间的项目实施。

    问题2:什么是大数据BI?什么是自助式BI?和传统BI有何区别?

    大数据BI

    大数据BI有这样几类特性:能对接hadoop一类的大数据平台,做数据分析;能处理大数据量(亿级以上),响应速度快,比较考验的是BI的数据处理计算性能和数据库性能。

    传统BI &自助式BI

    传统BI重在于数据平台搭建,提供报表服务,以IT为主导;自助式BI重在于数据分析,以业务分析为主导。两者的数据处理流程相通。

    传统BI:通常指企业内部大而全的统一报表或分析平台,代表性的老牌BI工具厂商如 IBM的cognos,Oracle的OBIEE,SAP的BO等均包含丰富的功能模块,比较适合于打造一体化的大而全的统一平台。传统BI一般面向IT研发人员,他们多集中在企业的技术部门,传统BI的打造方式基本如下:

    自助BI:面向的是不具备IT背景的业务分析人员,与传统BI相比更灵活且易于使用,而且一定程度上摆脱对IT部门的大幅度依赖。不同于以往“IT主导的报表模式”,转而向“业务主导的自助分析模式”发展。自助BI通常的应用场景:

    问题3:BI的多维数据模型和OLAP是什么,实用价值在哪?

    试想一下分析业务数据时场景,经常会从不同的角度来审视业务的衡量指标。例如分析销售数据,可能会综合时间周期、产品类别、分销渠道、地理分布、客户群类等多种因素来考量。这些分析角度虽然可以通过报表来反映,但每一个分析的角度生成一张报表,各个分析角度的不同组合又生成不同的报表,每尝试分析一次,就得抽一次数,这会使得IT人员的工作量相当大。

    而OLAP的作用就是尽可能将所有的维度条件及聚合值都准备好,供使用者在分析时可以按照任意维度来分析。

    以BI的实际应用来讲,拿到数据,可能需要下钻到比较粗的粒度观察数据,比如从日期时间维度、从地域品类维度来分析数据,对应到BI的操作上,就是拖拽维度、过滤排序、维度切换,钻取等操作,cube或者数据仓库就要响应这种操作,这就使用到了下钻、切边、切块、转轴等功能。

    问题4:商业智能BI在数据分析工作中的作用,是必要的吗?

    在数据分析过程中,BI也算是一个工具,能自助取数,用于快速分析,制作分析报表。很多互联网、零售、金融企业会有自己的数据分析团队会专业的分析人员,使用的工具可能从SPSS、SAS、R、Python不等,这些工具能对准备好的数据做数理统计分析,取数的工作大多还是要交给IT人员去做。像目前的自助式BI因为上手很简单,对于多维度的数据可以从各方面来展示,而且能及时生成数据报告,可在平台上管理报表和分析表单。所以是否有必要,因需求而异。

    问题5:BI如何选型,需要考虑哪些点?

    BI工具可分为传统型BI以及自助型BI。传统型BI,国外以SAP BO、cognos、Oracle BIEE等为主;自助型BI,比如国外的Tableau、Qlikview,国内的FineBI、永洪bi等等。

    站在产品的企业的角度,可以从领先能力、产品能力、服务能力以及价格能力去着手衡量。可通过海比研究给出的一套《BI选型指标体系》来判断。

    1、领先能力=行业地位+领先性

    比如公司在行业中的低位、市场占有率、公司在该领域的专注性以及技术的领先性。商业智能目前的市场格局不算大,可扩展到报表领域去衡量。

    2、产品能力=公司产品线+核心产品功能+解决方案

    一般来讲,公司的产品线越完整,相关产品的整合能力越强,越好。但是,最重要的还是产品的功能是否实能解决企业最关注的的问题,是否能覆盖更多行业,BI解决的是行业通用性的问题,解决能力越强,产品越优秀。

    3、服务能力=服务专业能力+维护能力

    BI的实施很考察人员的专业性,过去由于国外IT巨头的称霸,很多产品的项目都承包给第三方实施,造成服务脱节。现在很多涌现的国内软件公司一般都会有专业的实施团队,本地化服务很占优势,所以这一点不妨考虑本土产品。

    4、价值能力=成功案例+性价比

    选型前可看看同行业的企业伙伴们用的是什么类的BI工具,使用情况如何。包括从功能费用、项目实施费用综合考虑来看的性价比。

    问题6:如何实施BI?

    实施BI的前提,最重要的是基础数据的统一。比如货品信息,客户信息,公司内部信息。缺少的数据虽然可以临时补,但是随着公司业务的扩展,这种数据化运营的方式需要不断精细,数据管理的规范任务要落实到业务员的考察,如果得到领导的支持会更容易推动。有了这些齐全的数据,BI的实施才有保障。

    然后是业务的统一。比如销售模式,采购模式,结算方法,质量管理的统一。比如销售模式不统一,有的分公司先结算后配送,有的公司先配送后结算,业务形式不统一,口径不统一,就会造成数据的时间差。

    其次是业务部署。每个公司的业务部署不同,有的是集中部署有的是分销部署,如果BI是放在总部实施,需要将各地分散的数据统一起来,建立数据仓库,保持基础数据的统一,但其中,如何提高速度,如何优化配合方式,这点需要研究。

    BI人才储备是否足够,需要业务人员和信息人员的积极配合,这个效果才能够比较良好的推动,而且还能够持续的发展。为了让技术和业务人员更好地贴合,要将技术和业务有效结合,最大效率的把报表和BI系统的功能发挥出来。

    对于上BI,还有其他考虑,比如价格预算,比如是否用开源,比如后续开发和维护,这里做个统一的解释。

    明确业务需求:强烈的业务需求,明晰的业务目标,能否抓住核心是一个项目成败的关键。

    “产品+定制+服务”的建设思路:是否要选择开源的产品?如果你有很强的开发能力,可以考虑。但建议专业的事情还是交给专业的工具来做,传统企业不比互联网企业,互联网企业是以数据来驱动的,与传统企业的模式不一样,再说,后续维护也是成本啊。业务项目建设如果不借助比较成熟的产品工具,从技术代码进行创新式的开发,不经过迭代以及检验很难规避风险,很难形成一个成熟的产品。如果觉得国外BI产品“庞大”,完全可以选择FineBI这一类轻量化的工具。

    最后,就是认清技术力量的现状,不妨建议敏捷开发、迭代开发和重构,注重技术和管理的配合。

    问题7:做BI人的前景在哪里?

    刚入门BI这一领域的人,未来的职业发展可以走技术、走管理、走开发。

    1、走技术方向:(按照技术路线进行划分)

    ETL,这块是BI永恒的重点之一,需求也是一直持续,只是相对来说,ETL会比较枯燥。在这一块,掌握一两款顺应潮流的大工具,拥有相应年限的工作经历,行业性要求不太高,可以找到一个不错的岗位。DS、INFA、SSIS这些都是蛮有需求的。

    数据仓库,主要指的数据仓库设计,架构设计等,一般来说LEVEL会比较高,薪水待遇也还行,属于偏高端人才了,一般都会要有5年、7年或更多年限的经验,对行业性经验要求比较高。

    前端应用,SAP BO、COGNOS、BIEE等工具的熟练应用,可以做甲方内部顾问也可以做乙方项目顾问。从前端切入去接触到更多业务和需求,对提高自己的业务水平有好处。

    数据挖掘数据分析方面,这块个人认为是最有前景的,数据分析师的需求一直在增加,但和BI的背景不是非常贴合,要学数据统计学知识,R、Python语言等,学的东西很多。

    2、走管理路线

    管团队管某块业务,做项目总监,而后上升到CIO之类的,偏向管理属性,对人的沟通交流尤其是与高层交流的水平较高,比较IT在企业大多属于业务支撑部门,很多事情很难推动,同时还要思考如何提升IT在企业的地位,这个你只要观察自己的部门领导怎么做的,慢慢摸索了。

    3、走开发

    第三方软件开发公司了,比如SAP之类的公司(有点难度),或者国内帆软、永洪等其他BI公司的软件开发了,难度是要有一定的程序开发基础,但是对业务的理解也能带来一些帮助。再或者是去一些创业公司带团队做BI产品,现在做前端可视化分析的公司有很多,虽然不完全类同于BI,但有很多共通之处。

    问题8:如何系统的学习BI知识?

    这里给出一个学习框架

    1、学习数据库知识, 掌握基础技能SQL

    2、技术选择:数据仓库 / ETL / 前端开发等等

    3、 选择技术工具:

    数据仓库-Oracle、SAP HANA、Hadoop都是主流;

    ETL- informatica 、kettle;

    自助式BI工具-Taleau、帆软FineBI、Power BI

    4、学习业务知识

    5、实操数据分析工作

  • ?

    更高起点再出发,帆软开启大数据BI市场新征程!

    燕夏彤

    展开

    对于国内知名大数据BI和分析平台提供商帆软软件而言,今年无疑是个具有特殊意义的年份。因为自年初以来,公司所发生的系列大事和摘获的一系列优异成绩,都预示着这将是不平凡的一年。

    3月份获评赛迪顾问中国BI市场“年度占有率第一”大奖;6月份入选福布斯2018年国内非上市潜力企业50强榜;本月初与无锡锡东新城商务区喜签入驻协议,未来这里将成为公司总部驻地和大数据BI创新的地方……

    8月初,帆软软件还将发生一件让业界瞩目的大事,将举办首届全行业峰会——智数大会。这将是集结帆软软件行业市场深耕多年优秀案例实践智慧的一次盛会,会议致力于打造一个高质量、高价值的行业信息化交流平台,从而为行业用户深挖数据价值,驾驭数据洪流,变数据为生产力发挥最大化的作用。

    “智数大会”举办在即,凸显三个“不一般”

    那么,作为一次深受行业用户瞩目的盛会,此次智数大会的举办到底有哪些特点?

    据悉,此次智数大会是帆软软件在运作多年的行业IT价值峰会基础上发展而来,是一场名副其实的TOP级行业用户的千人盛会。办会目的也很明确,那就是要给行业用户以及业界提供一个多行业集中交流,跨行业交流的高价值、高质量的信息化交流平台。

    整体而言,大会凸显出三个“不一般”。

    1

    举办规模不一般。从2015年至今,帆软软件已在国内数十个城市举办了十余场大大小小的单行业IT价值峰会。而今年峰会将整合七大行业的峰会资源,可以说不论从参会场地、参会人数规模和影响范围来看都是空前的。预计届时将会迎来800+企业、1300+行业信息化专业人士参会。参照某个维度,那么,智数大会可能是东半球数据分析领域最大规模的信息化领袖峰会了。

    2

    办会内容不一般。据悉,此次峰会作为一场同业分享、异业思维碰撞的信息化交流盛宴,也将是一个大数据BI领域“干货”充沛的场所。在这里,不仅有接地气的数据化管理模型与实践经验分享,也有创新性的工具与场景融合方案的展示;据悉,除了主题演讲外,大会还将推出圆桌对话、高端沙龙以及精品展区等形式的内容。同时还将举办包括三天闭门会议、总计50余场分论坛在内的一系列交流分享活动,涉及医药、银行、时尚、地产、能源化工、电子电器、零售电商七大行业,可以说办会内容精彩纷呈。

    3

    办会规格不一般。大会作为一个行业专业人士平等参与的信息化交流平台,同时也是一个高级别大咖和行业顶尖信息化管理人士及管理者齐聚的盛会。会上,将会有来自国内多个行业的企业高管、智库学者、技术专家围绕数据化管理、商业智能等诸多领域话题展开讨论与思维对撞,也必将为用户在大数据BI领域的实践提供有价值的启迪和借鉴。

    “十二年磨一剑”,让数据真正成为生产力

    随着数字化转型大潮的推进,毫无疑问,数据在今天已经成为企业最重要的一大资产,挖掘数据价值,实现数据驱动,如今已经成为企业的发展愿景和致力实现的目标。

    帆软软件作为一家在大数据BI领域胸怀抱负和使命的企业,深刻洞悉行业客户的需求和痛点。帆软软件较早就意识到,作为大数据和BI领域平台提供商不应仅为用户提供“工具”,而是应该切实帮助行业用户去驾驭数据,并让数据真正发挥最大价值,成为生产力。这恰恰也是此次智数大会的办会初心和帆软软件的发展使命之所在。

    成立12年来,帆软软件一直将“让数据成为生产力”作为发展使命,并致力于通过产品、解决方案、活动以及行业峰会,来助力行业企业用户用好数据和驾驭数据,并真正实现数据的价值。

    首先,在产品及解决方案层面,帆软软件如今拥有着自主知识产权的商业智能和数据分析产品,可以为行业企业用户提供高效易用、简捷智能的大数据分析工具。典型产品包括:企业级WEB报表软件-帆软报表FineReport,自助大数据分析BI工具-帆软商业智能FineBI,移动数据分析平台-FineMobile,大屏数据可视化方案以及云端应用搭建工具-简道云等。

    其次,在活动及行业峰会层面,帆软软件至今已在国内数十个城市举办了13场大大小小的单行业IT价值峰会。此次智数大会则可看作是在IT价值峰会基础上的一次行业资源大整合和平台升级。帆软软件通过多十余年来的市场深耕于行业实践,总结出行业用户最为关注的系列问题,包括:如何让数据成为生产力?如何实现新技术应用落地?激烈市场竞争下企业如何实现转型变革?如何借助IT破局重生塑造企业更强驱动力?跨行业技术交流平台以及阿米巴经营等。那么,通过智数大会的举办,则为用户破解上述问题提供了交流平台和宝贵契机。

    在帆软研究院首席顾问总监杨扬看来,帆软的价值和使命是在长期与客户的接触以及市场摸爬滚打中形成的,有数据的地方就有帆软人的身影。“帆软人一直在探索,怎么把数据变成生产力?”他表示:“通过树立客户标杆、举办各类数据比赛、收集多样化的数据带来业务价值的场景、成立数据应用研究院、构建DA生态系统等,这一切都是帆软软件在为实现‘让数据变成生产力’这一个目标而作出的努力。”

    站在更高起点上,开启大数据及BI市场新征程

    其实,在笔者看来,无论是拿到国内BI市场领先地位,还是在福布斯潜力企业榜上有名;无论是智数大会的举办,还是公司签约新址,都向外界释放出一个清晰而有力的信号:那就是强者恒强的市场法则在大数据及BI领域进一步显现,而帆软软件无疑将在大数据及BI舞台上扮演更为重要的角色,站在了更高的起点之上。

    不得不说,今年对于帆软软件来说成为里程碑式的一年,在帆软软件佳绩取得背后,则是公司在业务规模以及生态方面所取得的突飞猛进的发展。据悉,帆软软件多年来业务一直保持高速增长,2017年销售额超过2.78亿元;2018年帆软销售额目标为4.3亿,从目前来看,年底超额完成已成定局。可以说在国内大数据及BI领域独占鳌头。

    经过十余年的发展,帆软软件目前已经与超7000家企事业单位和组织合作,典型用户包括中信银行,吉利汽车,泰尔重工,顺丰速运,厦门航空,北京大学,大唐电信,中国铁路,国家税务局,复星集团等诸多世界与中国500强客户及单位;如今,帆软软件用户已遍布金融、房产、建筑、医疗卫生、制造、交通、贸易、教育、政府、公共服务等在内的233个细分行业。

    在生态体系建设方面,帆软软件自2015年始进行产品功能模块化,开放更多API以支持外部开发者的开发,并着力打造帆软软件的“APP Store”,致力于为用户提供更为丰富的功能。截止2017年底,帆软市场累计插件下载数量超过26万次,帆软软件论坛注册用户达到了10万人,2017年帆软插件开发大赛,更是吸引2038位开发者报名参赛,最终大赛上架近40个可视化插件。

    不难看出,在大数据BI领域,摆在帆软软件面前的不仅是一个更大的市场舞台和空间,也将是一个更高和崭新的起点。帆软软件也将至此扬帆远航,在助力行业企业用户深挖数据价值,驾驭数据洪流的道路上开启一轮新的征程!

    — End —

    中国方案商500强(VAR500)

    ★2018中国行业十佳ISV★

    ★2018中国方案商百强榜单★

    ★2018中国IT生态新生力量100榜单★

    ★2018中国方案商500强(VAR500)榜单★

  • ?

    大数据和BI商业智能有何区别?有何相关?

    龚子骞

    展开

    Tips:“小鸟云”是深圳前海小鸟云计算有限公司旗下云计算品牌,国内领先的企业级云计算服务商。团队拥有多年行业经验,专注云计算技术研发,面向广大开发者、政企用户、金融机构等,提供基于智能云服务器的全方位云计算解决方案,为用户提供可信赖的企业级公有云服务。

    大数据 ≠BI商业智能,大数据也不是传统商业智能的简单升级。

    1、大数据和BI两者的区别

    BI(BusinessIntelligence)即商业智能,它是企业数据化管理的一整套的方案,用来将企业中现有的数据进行有效的整合,快速准确的提供报表并提出决策依据,帮助企业做出明智的业务经营决策,解决的是管理运营战略的问题。

    大数据(Big Data)是指在可承受的时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力来适应海量、高增长率和多样化的信息资产。大数据侧重于解决某一类问题的方法,比如全网用户画像,对网络、传感器等非结构化海量数据的分析。

    不管定义如何不同,大数据与传统BI是社会发展到不同阶段的产物,大数据对于传统BI,既有继承,也有发展,从"道"的角度讲,BI与大数据区别在于前者更倾向于决策,对事实描述更多是基于群体共性,帮助决策者掌握宏观统计趋势,适合经营运营指标支撑类问题,大数据则内涵更广,倾向于刻画个体,更多的在于个性化的决策。

    当然纯粹从思想的角度讲,两者在概念上是可以实现统一的,都遵循数据-信息-知识-智慧这个脉络,甚至在更高的层次,两者也是可以统一的。

    2、两者技术上有什么相关性?

    传统BI的技术标签:ETL、数据仓库、OLAP、可视化报表。

    大数据的技术标签:Hadoop、MPP、HDFS、MapReduce、流处理等。

    传统BI就目前来讲,其功能都可以被对应的大数据组件所替代,但大多数企业缺乏大数据业务的驱动,也缺乏相关的高技术人才。

    不过新型BI被赋予了更多“大数据”潜能。正如图右侧架构所示,BI架设在大数据应用层,抽取etl后或者Hive来的数据又可作通用类的业务分析。既满足了海量实时数据分析,也满足了决策型的业务分析。

    3、企业应该青睐大数据还是商业智能?

    在技术领域,虽然传统BI的一些技术ETL、数据仓库、OLAP、可视化报表似乎都将处于落后边缘,因为它难以解决日后海量数据的处理问题,但是,也不能全盘否定或替代成大数据。一些企业采用SAP HANA,FineBI的直连大数据引擎都是基于这个问题优化的方案。BI的那套也将长期存在,毕竟企业对BI方案还是很青睐,大数据的普及和应用也是个漫长的过程。

    大数据 VS 商业智能

    大数据不是空口说说,它的第一要务就是解决业务问题,大数据一定程度上就是用全新的数据技术手段来拓展和优化业务,传统企业需要聚集一拨人来研究这个问题,需要有人专门研究和探索。如果对外,想清楚新的商业模式,如果对内,想清楚在哪个场景,可以用大数据的手段提升效率。

    当前大数据可以产生价值的地方,从行业的角度看,金融、银行、互联网、医疗、科研都有广阔的前景。从领域的角度看,广告、营销、风控、供应链都是大数据发挥价值的地方,对于特定企业,比如电信运营商,大数据也可以在网络优化等方面提供新方法。

    并不是每个企业都需要打造自己的大数据平台,需要考虑到企业的信息化水平和各项成本,量力而行吧,可以自行研发 ,比如BAT;也可以选型采购,比如传统大企业;中小型企业也可以租用,比如用阿里云和AWS。

    就事实来讲,BI的应用是远远大于大数据应用的,有其通用的道理。大数据相对于传统BI,也不仅仅是简单的PLUS的关系,它涉及了思想、工具和人员深层次的变革,BI人员既不要一提大数据,就嗤之以鼻,认为它是新包装的马甲,其实就那么回事;也不需妄自菲薄,以为搞大数据就那么高大上,它的确是BI大多数思想的传承。

  • ?

    玩转大数据可视化,推荐几个必学的工具!

    飞瑶

    展开

    如今,企业越来越重视数据分析给业务决策带来的有效应用,而可视化是数据分析结果呈现的重要步骤。而可视化技术/工具在国内国外也发展的相当成熟,很多都已经做成应用(比如可视化图表库,BI工具等等),并投入商用。

    如何利用大数据可视化,如何做好大数据可视化,今天就给大家介绍一些实用的工具,有图表库、有BI ......

    国外产品系列

    1、ChartBlocks

    ChartBlocks是一款网页版的可视化图表生成工具,在线使用。通过导入电子表格或者数据库来构建可视化图表。整个过程可以在图表的向导指示下完成。它的图表在HTML5的框架下,使用强大的JavaScript库D3.js来创建图表。图表是响应式的,可以和任何的屏幕尺寸及设备兼容。 还可以将图表嵌入任何网页中。

    2、D3.js

    D3是个图表库,对于前端工程师来说,D3.js 称得上是最好的数据可视化工具库。

    D3厉害的地方在于它建立了一整套数据到SVG属性的计算框架,常用Data visualization模型,大多都可以再d3.layout里面找到。D3.js运行在JavaScript上,并使用HTML,CSS和SVG。

    D3.js是开源工具,使用数据驱动的方式创建漂亮的网页,D3.js可实现实时交互,这个库非常强大和前沿。

    3、Tableau

    Tableau公司将数据运算与美观的图表完美地嫁接在一起。它的程序很容易上手,各公司可以用它将大量数据拖放到数字"画布"上,转眼间就能创建好各种图表。这一软件的理念是,界面上的数据越容易操控,公司对自己在所在业务领域里的所作所为到底是正确还是错误,就能了解得越透彻。其两种不同的变体是基于云计算的Tableau Online和Tableau Server。

    它们都是为与大数据有关的组织设计的。企业使用这个工具非常方便,而且提供了闪电般的速度。还有一件事对这个工具是肯定的,Tableau具有用户友好的特性,并与拖放功能兼容。但是在大数据方面的性能有所缺陷,每次都是实时查询数据,如果数据量大,会卡顿。

    国内做数据可视化产品/工具的公司

    国内有独立成一行业的公司,围绕可视化做一些应用产品/系统的公司,比如:

    帆软——报表软件finereport、商业智能finebi、大屏可视化阿里——蚂蚁金服可视化控件AntV、数据可视化大屏DataV数字冰雹——大屏可视化百度——开源图表控件Echarts网易——数据分析平台(BI)网易有数

    除此之外,还有很多互联网公司会开发自己的数据可视化产品、BI平台,引用国内外开源,对内形成解决方案,但是不对外。软件集成商也对针对客户需求,做专门的方案,自己开发或者集成别人的应用。

    1、FineBI

    FineBI是一款商业智能BI工具,做数据分析和可视化数据展现,以分析为主,提供多种数据接入方式,可视化功能强大,平台更适合掌握分析方法了解分析的思路的用户,其他用户的使用则依赖于分析师的结果输出。FineBI也是找了很久感觉很不错的一款数据可视化工具。其中还有很多对数据处理的公式和方法,图表也比较全面。相对于百度的echarts,FineBI还是一款比较容易入手的数据分析工具。最后,FineBI提供了免费的版本,功能齐全,更加适合个人对数据分析的学习和使用。

    2、EchartChart

    echarts的优点:

    国产货有语言优势或区域优势。毕竟是中国制造,自己家做出来的,亲和力高,比较适用于我们的思维,对于城市的地理坐标、城市代码等都已经配置好了,需要的时候,直接调用,很方便。免费,各类图,各种形式,K线图完全免费开源。能减少制作成本,也方便使用,(不用担心以后会有什么)当客户选择的时候,我们可以有更多的方案为他们准备。对于处理大量的数据和3D绘图:基于canvas绘图,所以3D绘图方面占据绝对的优势。(可以结合百度地图的使用,而且方便快捷。)一个纯Javascript的图表库:可以流畅的运行在PC和移动设备上,兼容当前绝大部分浏览器(IE6/7/8/9/10/11,chrome,firefox,Safari等),底层依赖轻量级的Canvas类库ZRender,提供直观,生动,可交互。(使用了几个浏览器,均没发现什么问题。)支持和弦图、力导布局图、拖拽重计算、数据视图、值域漫游、大规模散点。支持动态类型切换(十分方便,以内置代码,轻轻动动手指就可)

    3、支付宝AntV

    AntV 是蚂蚁金服的数据可视化解决方案,主要包含「数据驱动的高交互可视化图形语法」G2、专注解决流程与关系分析的图表库 G6、适于对性能、体积、扩展性要求严苛场景下使用的移动端图表库 F2 以及一套完整的图表使用指引和可视化设计规范。已为阿里集团内外2000+个业务系统提供数据可视化能力,其中不乏日均千万 UV 级的产品

  • ?

    大数据BI可视化工具:改变了企业高层的管理思维

    里瓦德奥

    展开

      大数据BI可视化工具的诞生,改不了很多企业的运作模式。数据化运营、数据化思维被大肆宣传推广,每一个现代的企业家都需要具备最基本的数据运营思维模式。那么,作为一个企业高层管理者,怎样在引入一款大数据BI可视化工具之后迅速建立或者说转换自己的管理思维,并迅速适应工具的运用?小编在这里为您分享一点观点。

    大数据可视化工具

      企业在导入数据化管理的过程中,对管理者的数据思维培养是一项必要的工作。管理者没有数据思维,企业的数据化管理将是空的,数据会被管理者放置到一边,而无法起到应有的作用。

      数据化管理是企业的管理变革。自上而下的改变叫变革,自下而上的改变叫革命。如果没有高层的推动,企业的数据化变革就不可能实现。所以高层首先要建立数据思维。在研讨目标、商议工作、布置任务的时候,都要用数据去量化。开会的时候问数据、听数据、分析数据,提出战略目标的时候用数据去说明目标。

      培养管理者的数据思维,需要以企业文化作为基础。数据化管理变革必然带来企业文化的变革。数据讲求的是量化、科学、实事求是,企业在管理中也必须重事实、讲数据。

    大数据BI

      为每个岗位设计标准化的工作表格,为每个管理者设计标准化的数据分析模板。通过培训,教会每个人都使用这些表格和模板。在日常工作中,随时检查相关数据的表格是否严格填写,并在使用过程中,允许并鼓励员工提出改善意见和建议。对于好的建议积极采用,并及时更新原有的表格和模板。培训的时候,高层最好亲自出席,并强调相关内容,传达变革的决心。每个层级必须给下一层级做培训,按照层级递推。并由相关的部门进行跟踪检查,并对每次培训进行打分。培训结束后,可要求每个参与培训的员工填写相关的反馈问卷,必要的时候进行培训效果测试。

      好了,关于引入大数据BI可视化工具,高层该如何转换管理思维的分享,就分享到这里了。其实,很多人往往以为引入大数据可视化工具给IT人员操作就完事了,这样的思维有点落后了,实际上,工具只是辅助作用,作为管理者还是需要改变管理思维,并合理利用大数据BI可视化工具来促进技术和业务的共同进步,才能更好地做决策。

大数据bi软件

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP