中企动力 > 商学院 > 可靠性数据分析软件
  • ?

    简单也能玩出复杂---快速有效的企业基本分析?

    嵇又槐

    展开

    随着政府数据公开的步伐加快,当我们要对一个企业进行风险分析和决策时,呈现在我们面前的数据不是不够多,而是太多。那么,最有用的数据是哪些?最基础有效的分析方法又是哪一种呢?

    1、企业外部数据分析

    政府公开信息中蕴藏着海量的外部数据,对于企业分析非常有用。其中最常用的外部基础数据是各种工商和司法信息。别看只有两类,仅一个工商变更就名目繁多,蕴含许多信息。

    比如,一个注册资本变更可能与企业战略发展方向的改变有关、与股东变更有关、与企业的经营状况有关。若在此信息上叠加司法信息数据,可能帮助我们分析得出企业转型的原因或经营情况的现状。如劳动官司虽然反映企业对劳动法的遵守情况,但也见接反映了企业成本的上升是否能为企业所承受;债务纠纷官司反映企业经营情况和融资渠道问题。成本上升和融资问题是否成为战略方向转变的因素?

    工商变更有几十种情形,信息相当丰富。假如我们将每种变更情形与另一种类别的企业公开数据进行关联并分析,那么基于外部数据的企业画像和商业分析推断已经初步形成,下一步该是交叉验证我们的分析和推断的时候了。

    2、企业内部数据采集

    接下去更重要的一步是采集到企业的内部数据,比如常见的企业财务报表,企业应收和应付账这类贸易流水数据等。那这些财务信息理论上能验证我们企业外部画像得出的结论。比如,企业债务纠纷和企业财报中的负债率、企业应收款等有紧密联系。企业利润和应收账款也与企业战略改变有关系。但是我们往往习惯质疑这些数据的真实可靠性,但又苦于无法获取更满意的企业内部数据。

    这种传统的两难困境如今可以被科技轻易打破。基于大数据的分析软件可以快速找出企业报表中的粉饰成分,或在数以千计的往来交易流水中找出异常流水,比如关联交易、虚假订单、转移支付等,以便我们了解真实情况。大数据可以让我们做到对数据的全样本分析,而人工分析一般以抽查凭经验为主,容易造成错误的判断。

    ◆ ◆◆ ◆ ◆

    我们上面提到的数据种类不超过五类,但是经过企业内外部数据交叉,企业的画像越来越丰满。这一切告诉我们,企业基础分析中对的数据采集的要求并不是那样高,关键是要找到最有效的数据,分析方法和模型。对于数据的第一要求是真实,或者能鉴别数据的真实性。

    验证一个数据分析模型需要花费大量的时间和财力,由于大部分企业没有这方面的积累,那么我们建议的一个简单的方法就是通过经验推断,再用数据交叉验证。这个方法大部分企业中都能找到很快熟练上手的分析人员。如果有条件我们可以在这些基础数据之上,再添加高级分析,比如利用舆情数据分析企业或行业现状,预测未来。最近百度推出了为企业服务的舆情数据,其数据质量毋庸质疑。

    未来,大企业可能会购买部分外部数据并积累大量内部数据,最后创立自己独特的数据分析方法和模型。中小企业则是通过借力,购买数据分析标准化服务,外加自有的经验结合,为企业经营决策、风险控制服务。无论哪种方式其基础是从外部获取一定的资源,通过企业自己的加工,形成自己一套数据使用方法,从中获益。企业利用数据的能力已经成为名不其实的企业核心竞争力之一。

    ◆ ◆◆ ◆ ◆

    从去年开始市场上出现了一些落地的大数据产品,基本上能做到开箱即用,这让企业管理的数据化转型起步变得很容易。例如,某规模较大的融资租赁企业本来需要业务、风控、后台等人员填写各种表格。不但耗费大量人力,而且内部沟通成本也高。

    现在,通过购买数据化服务,只要花很小的成本代价,可以将基础表格填写和信息基本信息采集工作自动化,节省大量人员成本。未来,员工需要填写的是主观分析类信息,时间精力转移到深挖垂直行业、规避风险、建立项目和企业的核心竞争力。

    大数据分析的关键是找到数据之间的关联关系,越直接越有效。大数据利用真没有你想像的那么复杂,起步也比你想象的容易。

    ———————————————————END———————————————————

  • ?

    六大主流大数据采集平台架构分析

    微妙

    展开

    随着大数据越来越被重视,数据采集的挑战变的尤为突出。今天为大家介绍几款数据采集平台:

    Apache Flume Fluentd Logstash Chukwa Scribe Splunk Forwarder

    大数据平台与数据采集

    任何完整的大数据平台,一般包括以下的几个过程:

    数据采集–>数据存储–>数据处理–>数据展现(可视化,报表和监控)

    其中,数据采集是所有数据系统必不可少的,随着大数据越来越被重视,数据采集的挑战也变的尤为突出。这其中包括:

    我们今天就来看看当前可用的六款数据采集的产品,重点关注它们是如何做到高可靠,高性能和高扩展。

    1、Apache Flume

    Flume 是Apache旗下的一款开源、高可靠、高扩展、容易管理、支持客户扩展的数据采集系统。 Flume使用JRuby来构建,所以依赖Java运行环境。

    Flume最初是由Cloudera的工程师设计用于合并日志数据的系统,后来逐渐发展用于处理流数据事件。

    Flume设计成一个分布式的管道架构,可以看作在数据源和目的地之间有一个Agent的网络,支持数据路由。

    每一个agent都由Source,Channel和Sink组成。

    Source

    Source负责接收输入数据,并将数据写入管道。Flume的Source支持HTTP,JMS,RPC,NetCat,Exec,Spooling Directory。其中Spooling支持监视一个目录或者文件,解析其中新生成的事件。

    Channel

    Channel 存储,缓存从source到Sink的中间数据。可使用不同的配置来做Channel,例如内存,文件,JDBC等。使用内存性能高但不持久,有可能丢数据。使用文件更可靠,但性能不如内存。

    Sink

    Sink负责从管道中读出数据并发给下一个Agent或者最终的目的地。Sink支持的不同目的地种类包括:HDFS,HBASE,Solr,ElasticSearch,File,Logger或者其它的Flume Agent。

    Flume在source和sink端都使用了transaction机制保证在数据传输中没有数据丢失。

    Source上的数据可以复制到不同的通道上。每一个Channel也可以连接不同数量的Sink。这样连接不同配置的Agent就可以组成一个复杂的数据收集网络。通过对agent的配置,可以组成一个路由复杂的数据传输网络。

    配置如上图所示的agent结构,Flume支持设置sink的Failover和Load Balance,这样就可以保证即使有一个agent失效的情况下,整个系统仍能正常收集数据。

    Flume中传输的内容定义为事件(Event),事件由Headers(包含元数据,Meta Data)和Payload组成。

    Flume提供SDK,可以支持用户定制开发:

    Flume客户端负责在事件产生的源头把事件发送给Flume的Agent。客户端通常和产生数据源的应用在同一个进程空间。常见的Flume 客户端有Avro,log4J,syslog和HTTP Post。另外ExecSource支持指定一个本地进程的输出作为Flume的输入。当然很有可能,以上的这些客户端都不能满足需求,用户可以定制的客户端,和已有的FLume的Source进行通信,或者定制实现一种新的Source类型。

    同时,用户可以使用Flume的SDK定制Source和Sink。似乎不支持定制的Channel。

    2、Fluentd

    Fluentd是另一个开源的数据收集框架。Fluentd使用C/Ruby开发,使用JSON文件来统一日志数据。它的可插拔架构,支持各种不同种类和格式的数据源和数据输出。最后它也同时提供了高可靠和很好的扩展性。Treasure Data, Inc 对该产品提供支持和维护。

    Fluentd的部署和Flume非常相似:

    Fluentd的架构设计和Flume如出一辙:

    Fluentd的Input/Buffer/Output非常类似于Flume的Source/Channel/Sink。

    Input

    Input负责接收数据或者主动抓取数据。支持syslog,http,file tail等。

    Buffer

    Buffer负责数据获取的性能和可靠性,也有文件或内存等不同类型的Buffer可以配置。

    Output

    Output负责输出数据到目的地例如文件,AWS S3或者其它的Fluentd。

    Fluentd的配置非常方便,如下图:

    Fluentd的技术栈如下图:

    FLuentd和其插件都是由Ruby开发,MessgaePack提供了JSON的序列化和异步的并行通信RPC机制。

    Cool.io是基于libev的事件驱动框架。

    FLuentd的扩展性非常好,客户可以自己定制(Ruby)Input/Buffer/Output。

    Fluentd从各方面看都很像Flume,区别是使用Ruby开发,Footprint会小一些,但是也带来了跨平台的问题,并不能支持Windows平台。另外采用JSON统一数据/日志格式是它的另一个特点。相对去Flumed,配置也相对简单一些。

    3、Logstash

    Logstash是著名的开源数据栈ELK (ElasticSearch, Logstash, Kibana)中的那个L。

    Logstash用JRuby开发,所有运行时依赖JVM。

    Logstash的部署架构如下图,当然这只是一种部署的选项。

    一个典型的Logstash的配置如下,包括了Input,filter的Output的设置。

    几乎在大部分的情况下ELK作为一个栈是被同时使用的。所有当你的数据系统使用ElasticSearch的情况下,logstash是首选。

    4、Chukwa

    官网:https://chukwa.apache.org/

    Apache Chukwa是apache旗下另一个开源的数据收集平台,它远没有其他几个有名。Chukwa基于Hadoop的HDFS和Map Reduce来构建(显而易见,他用Java来实现),提供扩展性和可靠性。Chukwa同时提供对数据的展示,分析和监视。很奇怪的是它的上一次 github的更新事7年前。可见该项目应该已经不活跃了。

    Chukwa的部署架构如下:

    Chukwa的主要单元有:Agent,Collector,DataSink,ArchiveBuilder,Demux等等,看上去相当复杂。由于该项目已经不活跃,我们就不细看了。

    5、Scribe

    代码托管:https://github/facebookarchive/scribe

    Scribe是Facebook开发的数据(日志)收集系统。已经多年不维护,同样的,就不多说了。

    6、Splunk Forwarder

    以上的所有系统都是开源的。在商业化的大数据平台产品中,Splunk提供完整的数据采金,数据存储,数据分析和处理,以及数据展现的能力。

    Splunk是一个分布式的机器数据平台,主要有三个角色:

    Search Head负责数据的搜索和处理,提供搜索时的信息抽取。

    Indexer负责数据的存储和索引 Forwarder,负责数据的收集,清洗,变形,并发送给Indexer

    Splunk内置了对Syslog,TCP/UDP,Spooling的支持,同时,用户可以通过开发 Input和Modular Input的方式来获取特定的数据。在Splunk提供的软件仓库里有很多成熟的数据采集应用,例如AWS,数据库(DBConnect)等等,可以方便的从云或者是数据库中获取数据进入Splunk的数据平台做分析。

    这里要注意的是,Search Head和Indexer都支持Cluster的配置,也就是高可用,高扩展的,但是Splunk现在还没有针对Farwarder的Cluster的功能。也就是说如果有一台Farwarder的机器出了故障,数据收集也会随之中断,并不能把正在运行的数据采集任务Failover到其它的 Farwarder上。

    总结

    我们简单讨论了几种流行的数据收集平台,它们大都提供高可靠和高扩展的数据收集。大多平台都抽象出了输入,输出和中间的缓冲的架构。利用分布式的网络连接,大多数平台都能实现一定程度的扩展性和高可靠性。

    其中Flume,Fluentd是两个被使用较多的产品。如果你用ElasticSearch,Logstash也许是首选,因为ELK栈提供了很好的集成。Chukwa和Scribe由于项目的不活跃,不推荐使用。

    Splunk作为一个优秀的商业产品,它的数据采集还存在一定的限制,相信Splunk很快会开发出更好的数据收集的解决方案。

  • ?

    干货 | 这是一份完整的大数据处理技术总结与分析

    慕蕊

    展开

    一 数据分析处理需求分类

    1 事务型处理

    在我们实际生活中,事务型数据处理需求非常常见,例如:淘宝网站交易系统、12306网站火车票交易系统、超市POS系统等都属于事务型数据处理系统。

    这类系统数据处理特点包括以下几点:

    一是事务处理型操作都是细粒度操作,每次事务处理涉及数据量都很小。

    二是计算相对简单,一般只有少数几步操作组成,比如修改某行的某列;

    三是事务型处理操作涉及数据的增、删、改、查,对事务完整性和数据一致性要求非常高。

    四是事务性操作都是实时交互式操作,至少能在几秒内执行完成;

    五是基于以上特点,索引是支撑事务型处理一个非常重要的技术。

    在数据量和并发交易量不大情况下,一般依托单机版关系型数据库,例如ORACLE、MYSQL、SQLSERVER,再加数据复制(DataGurad、 RMAN、MySQL数据复制等)等高可用措施即可满足业务需求。

    在数据量和并发交易量增加情况下,一般可以采用ORALCE RAC集群方式或者是通过硬件升级(采用小型机、大型机等,如银行系统、运营商计费系统、证卷系统)来支撑。

    事务型操作在淘宝、12306等互联网企业中,由于数据量大、访问并发量高,必然采用分布式技术来应对,这样就带来了分布式事务处理问题,而分布式事务处理很难做到高效,因此一般采用根据业务应用特点来开发专用的系统来解决本问题。

    2 数据统计分析

    数据统计主要是被各类企业通过分析自己的销售记录等企业日常的运营数据,以辅助企业管理层来进行运营决策。典型的使用场景有:周报表、月报表等固定时间提供给领导的各类统计报表;市场营销部门,通过各种维度组合进行统计分析,以制定相应的营销策略等。

    数据统计分析特点包括以下几点:

    一是数据统计一般涉及大量数据的聚合运算,每次统计涉及数据量会比较大。

    二是数据统计分析计算相对复杂,例如会涉及大量goupby、 子查询、嵌套查询、窗口函数、聚合函数、排序等;有些复杂统计可能需要编写SQL脚本才能实现。

    三是数据统计分析实时性相对没有事务型操作要求高。但除固定报表外,目前越来越多的用户希望能做做到交互式实时统计;

    传统的数据统计分析主要采用基于MPP并行数据库的数据仓库技术。主要采用维度模型,通过预计算等方法,把数据整理成适合统计分析的结构来实现高性能的数据统计分析,以支持可以通过下钻和上卷操作,实现各种维度组合以及各种粒度的统计分析。

    另外目前在数据统计分析领域,为了满足交互式统计分析需求,基于内存计算的数据库仓库系统也成为一个发展趋势,例如SAP的HANA平台。

    3 数据挖掘

    数据挖掘主要是根据商业目标,采用数据挖掘算法自动从海量数据中发现隐含在海量数据中的规律和知识。

    数据挖掘主要过程是:根据分析挖掘目标,从数据库中把数据提取出来,然后经过ETL组织成适合分析挖掘算法使用宽表,然后利用数据挖掘软件进行挖掘。传统的数据挖掘软件,一般只能支持在单机上进行小规模数据处理,受此限制传统数据分析挖掘一般会采用抽样方式来减少数据分析规模。

    数据挖掘的计算复杂度和灵活度远远超过前两类需求。一是由于数据挖掘问题开放性,导致数据挖掘会涉及大量衍生变量计算,衍生变量多变导致数据预处理计算复杂性;二是很多数据挖掘算法本身就比较复杂,计算量就很大,特别是大量机器学习算法,都是迭代计算,需要通过多次迭代来求最优解,例如K-means聚类算法、PageRank算法等。

    因此总体来讲,数据分析挖掘的特点是:

    1、数据挖掘的整个计算更复杂,一般是由多个步骤组成计算流,多个计算步骤之间存在数据交换,也就是会产生大量中间结果,难以用一条sql语句来表达。

    2、计算应该能够非常灵活表达,很多需要利用高级语言编程实现。

    二 大数据背景下事务型处理系统相关技术

    在google、facebook、taobao等大互联网公司出现之后,这些公司注册和在线用户数量都非长大,因此该公司交易系统需要解决“海量数据+高并发+数据一致性+高可用性”的问题。

    为了解决该问题,从目前资料来看,其实没有一个通用的解决方案,各大公司都会根据自己业务特点定制开发相应的系统,但是常用的思路主要包括以下几点:

    (1)数据库分片,结合业务和数据特点将数据分布在多台机器上。

    (2)利用缓存等机制,尽量利用内存,解决高并发时遇到的随机IO效率问题。

    (3)结合数据复制等技术实现读写分离,以及提高系统可用性。

    (4)大量采用异步处理机制,对应高并发冲击。

    (5)根据实际业务需求,尽量避免分布式事务。

    1相关系统介绍

    1) 阿里CORBAR系统

    阿里COBAR系统是一个基于MYSQL数据库的分布式数据库系统,属于基于分布式数据库中间件的分布式数据库系统。该系统是前身是陈思儒开发的“变形虫”系统(以前调研过),由于陈思儒离开阿里去了盛大,阿里当心“变形虫”稳定性等问题,重新开发该项目。

    该系统主要采用数据库分片思路,实现了:数据拆分、读写分离、复制等功能。由于此系统由于只需要满足事务型操作即可,因此相对真正并行数据库集群(例如TeraData等),此类系统提供操作没有也不需要提供一些复杂跨库处理,因此该系统存在以下限制:

    (1)不支持跨库的join、分页、排序、子查询。

    (2)insert等变更语句必须包括拆分字段等。

    (3)应该不支持跨机事务(以前变形虫不支持)。

    说白了此类系统不具备并行计算能力,基本上相当于数据库路由器!

    另外此类系统的在实际应用的关键问题是,根据什么对数据进行切分,因为切分不好会导致分布式的事务问题。

    2) 阿里OceanBase系统

    该系统也是淘宝为了解决高并发、大数据环境下事务型处理而定制开发的一个系统。该系统主要思路和特点如下:

    (1)他们发现在实际生成环境中,每天更新的数据只占总体数据的1%不到,因此他们把数据分为:基线数据和增量更新数据。

    (2)基线数据是静态数据,采用分布式存储方式进行存储。

    (3)只在一台服务器上存储和处理增量更新数据,并且是在内存中存储和处理更新数据。

    (4)在系统负载轻的时候,把增量更新批量合并到基线数据中。

    (5)数据访问时同时访问基线数据和增量更新数据并合并。

    因此这样好处是:

    (1)读事务和写事务分离

    (2)通过牺牲一点扩展性(写是一个单点),来避免分布式事务处理。

    说明:该系统虽然能处理高并发的事务型处理,号称很牛逼,但其实也只是根据电商的事务处理来定制开发的专用系统,个人认为其技术难度小于oracle等通用型的数据库。该系统无法应用到银行或者12306等,因为其事务处理的逻辑远远比电商商品买卖处理逻辑复杂。

    在目前的大数据时代,一定是基于应用定制才能找到好的解决方案!

    3) 基于Hbase的交易系统

    在hadoop平台下,HBASE数据库是一个分布式KV数据库,属于实时数据库范畴。支付宝目前支付记录就是存储在HBASE数据库中。

    HBASE数据库接口是非SQL接口,而是KV操作接口(基于Key的访问和基于key范围的scan操作),因此HBASE数据库虽然可扩展性非常好,但是由于其接口限制导致该数据库能支持上层应用很窄。基于HBASE应用的设计中,关键点是key的设计,要根据需要支持的应用来设计key的组成。

    可以认为HBASE数据库只支持作为KEY的这一列的索引。虽然目前HBASE有支持二级索引的方案,二级索引维护将会比较麻烦。

    2并发和并行区别

    并发是指同时执行通常不相关的各种任务,例如交易型系统典型属于高并发系统。

    并行是通过将一个很大的计算任务,划分为多个小的计算任务,然后多个小计算任务的并行执行,来缩短该计算任务计算时间。

    两者主要区别在于:

    (1)通讯与协调方面:在并行计算中,由于多个小任务同属一个大的计算任务,因此小任务之间存在依赖关系,小任务之间需要大量通讯和协调;相反,并发中的多个任务之间基本相互独立,任务与任务之间相关性很小。

    (2)容错处理方面:由于并发任务之间相互独立,某个任务执行失败并不会影响其它的任务。但是并行计算中的多个任务属于一个大任务,因此某个子任务的失败,如果不能恢复(粗粒度容错与细粒度容错),则整个任务都会失败。

    3本章总结

    数据量大不一定需要并行计算,虽然数据量大,数据是分布存储,但是如果每次操作基本上还是针对少量数据,因此每次操作基本上都是在一台服务器上完成,不涉及并行计算。只是需要通过数据复制、数据缓存、异步处理等方式来支撑高并发访问量

    三 大数据背景下数据统计分析技术介绍

    随数据量变大,和事务处理不同的是,单个统计分析涉及数据量会非常大,单个统计分析任务涉及数据会分散在多台服务器上,且由于计算量大,采用单台服务器进行计算,会导致计算时间非常长,单个统计分析任务必须采用并行计算方式来加快单个统计分析任务执行速度。

    1并行查询与并行计算技术介绍

    在大数据背景下的数据统计分析技术门类很多,常见的有:

    n MPP并行数据库 : TeraData、GreenPlum、Vertica等。

    n 基于MapReduce并行计算框架的数据仓库:

    HIVE(Hadoop平台) 、Tenzing(Google公司)

    n 基于Hbase的Phoenix系统

    n HadoopDB系统

    n EMC公司的hapt系统

    n MPP分布式查询引擎: Dremel、Impala、Presto、Shard query、Citusdb。

    n 基于SPARK的Shark、基于Dryad的SCOPE、基于Tez的stinger。

    n 基于hadoop+index的JethroData系统

    n 基于内存计算的Druid系统

    这些系统都解决了海量数据下的数据统计分析的问题,并且这些系统另外一个共同特点是都提供了SQL或者类SQL接口。

    为了能够较好研究这些系统,我们需要对并行查询与并行计算的相关技术做一个简要的介绍。

    首先所有的系统都可以分为三个层次: 语义层、并行计算引擎层、分布式存储层。语义层提供一个编程接口让用户表达所需要计算,并负责把该计算翻译成底层并行计算引擎可以执行的执行计划,并由并行计算引擎来执行,最下面一层是分布式存储层。

    对于提供类SQL接口并行计算系统,语义层可以认为是SQL解析层。

    1) 语义层

    SQL语言是一种声名式语言,SQL只是表达了要做什么,而没有表达怎么做。为此,SQL解析层主要作用是:将用户提交的基于SQL的统计分析请求,转化为底层计算引擎层可以执行的执行计划。也就是解决“怎么做”的问题。

    SQL解析层工作主要包括两个大方面:

    (1) 通过语法分析技术来理解要做什么。在关系数据库中,一般会把SQL语言分析后,形成树型结构的执行计划。

    (2) 在语法分析技术上,利用各种优化技术和算法,找出一种最经济物理执行计划。

    优化可以分为两个方面:一是逻辑层面优化、二是物理执行层面优化。

    (1) 逻辑层优化

    逻辑层面个人认为主要是因为同样表达一个分析请求,有的人SQL写的好,有的人SQL写的烂,因此在逻辑层面可以通过一些等价关系代数变换,实现查询重写,将写的比较烂的sql变换为好的写法。

    比较典型优化是:“把投影和过滤下沉,先执行过滤和投影操作”,减少中间结果。

    (2) 物理层优化

    物理层面优化是在逻辑优化后,结合实际物理执行过程,找出最优的物理执行计划。生成物理查询计划的工作包括:

    ü 增加一些操作符: 包括扫描和排序等。

    ü 确定各个操作符实现算法。例如扫描是全表扫描还是利用索引;Join是采用HASH连接、索引连接、合并排序等实现算法中的那一种。

    ü 确定操作符之间的数据流转方法:物化还是流水线方式。

    ü 采用基于代价估算方法确定最优的物理执行计划,目前代价估算主要是以估算该物理计划需要的IO量。另外对于并行数据库,则还要考虑通讯代价,即尽量减少数据在各个机器之间的传递。

    在物理层优化的代价估算过程中,代价估算需要依靠很多统计信息,如表有多大,表中相关列的值分布是什么样子等。传统数据库在数据Load过程中会事先计算好这些统计信息。并行计算中还需要考虑通讯代价。

    需要指出是,由于imapla、Presto、HIVE等系统只是一个查询引擎,它们可以直接查询以普通文件方式存储在HDFS系统上的文件,因此这些系统一般无法使用索引和各种统计信息来进行物理执行计划的优化,这些系统一般只能在逻辑层进行一些基于规则静态优化。根据SHARK论文,SHARK系统支持根据前面一些节点计算获得的信息,来动态优化后面执行计划。

    (3) 物化与流水线执行方法

    一条SQL语句对开发人员而言,感觉只是一次调用,但是实际上在数据库内部,一条SQL语句执行其实是有多个操作符组合而成的的树型结构计算流。如下图:

    针对该计算流有两种执行方式:一是基于物化或者是实体化执行方式,另外一种是基于数据流的执行方式。

    第一种方法的过程是: 把各个操作运算排序,并把每个操作运算的输出的中间结果存储在磁盘上,直到被另外一个操作运算所...

  • ?

    干货 || 分析9款常用视觉软件

    碧玉

    展开

    一、开源的OpenCV

    OpenCV(Open Source Computer Vision Library:http://opencv.org)是一个开源的基于BSD许可的库,它包括数百种计算机视觉算法。文档OpenCV 2.x API描述的是C++ API,相对还有一个基于C语言的OpenCV 1.x API,后者的描述在文档opencv1.x.pdf中。

    OpenCV具有模块化结构,这就意味着开发包里面包含多个共享库或者静态库。下面是可使用的模块:

    核心功能(Core functionality) - 一个紧凑的模块,定义了基本的数据结构,包括密集的多维Mat数组和被其他模块使用的基本功能。

    图像处理(Image processing) - 一个图像处理模块,它包括线性和非线性图像滤波,几何图形转化(重置大小,放射和透视变形,通用基本表格重置映射),色彩空间转换,直方图等。

    影像分析(video) - 一个影像分析模块,它包括动作判断,背景弱化和目标跟踪算法。

    3D校准(calib3d) - 基于多视图的几何算法,平面和立体摄像机校准,对象姿势判断,立体匹配算法,和3D元素的重建。

    平面特征(features2d) - 突出的特征判断,特征描述和对特征描述的对比。

    对象侦查(objdetect) - 目标和预定义类别实例化的侦查(例如:脸、眼睛、杯子、人、汽车等等)。

    highgui - 一个容易使用的用户功能界面。

    视频输入输出(videoio) - 一个容易使用的视频采集和视频解码器。

    GPU - 来自不同OpenCV模块的GPU加速算法。

    … 一些其他的辅助模块,比如FLANN和谷歌的测试封装,Python绑定和其他。

    OpenCV非常适合底层科研工作者使用,成本较低,使用也非常方便,关键是开源。

    二、VisionPro7.0系统

    康耐视公司(Cognex )推出的 VisionPro 系统组合了世界一流的机器视觉技术,具有快速而强大的应用系统开发能力。 VisionPro QuickStart 利用拖放工具,以加速应用原型的开发。这一成果在应用开发的整个周期内都可应用。通过使用基于 COM/ActiveX 的 VisionPro 机器视觉工具和 Visual Basic 、 Visual C++ 等图形化编程环境,开发应用系统。与 MVS-8100 系列图像采集卡相配合, VisionPro 使得制造商、系统集成商、工程师可以快速开发和配置出强大的机器视觉应用系统。

    快速建立原型和易于集成

    VisionPro 的两层软件结构便于建立原型和集成。交互层利用拖放工具和 ActiveX 控件以加速应用系统的开发;在程序层,将原型应用开发成用户解决方案。基于 COM/ActiveX 技术使 VisionPro 应用系统易于集成第三方实用程序(例如图形函数),而且为整个机器(例如 I/O 、机器人控制、工厂通信)提供了基于 COM 控件应用的易于集成性。

    先进的机器视觉软件

    Cognex 的视觉工具库提供了用于测量、检测、制导和识别的视觉软件程序组。即使是在最具挑战性的视觉应用中,这些工具也被证实具有高可靠性。

    硬件灵活性

    VisionPro 的 用户可在较大范围内选择 MVS-8100 系列图像采集卡,以开发视觉应用。经 VisionPro 软件测试和证明,这些图像采集卡为主机提供了用于图像处理和显示的高速图像转移,以获得快速的视觉应用操作。多相机输入、高速度及对高分辨率相机的支持提高了 VisionPro 系统的采集灵活性。

    技术优势

    快速开发强大的基于 PC 的视觉应用

    简化视觉系统与其他主控制程序的融合处理

    兼容多种 Cognex MVS-8100 系列图像采集卡

    通过 QuickStart 拖放工具加速原型应用

    配合视觉工具库,以获得高性能

    VisionPro 的软件结构

    VisionPro 提供了易于应用的原型、发展和应用。在交互层,通过系列拖放工具, VisionProQuickStart 原型环境加速了强大机器视觉系统的开发速度。用户可以很快定义工具、测试工具行为及有效的运行参数之间的连接。通过 QuickStart 或 Visual Basic 可访问 ActiveX 控件。因此,在程序层,原型应用可通过 Visual Basic 或 Visual C++ 增强,以开发出个性化的解决方案。这一性能将使应用系统的开发时间大大缩短。 VisionPro 的结构使用户可从 QuickStart 、 ActiveX 或 COM 对象中的任何一层开始他们的应用系统开发。

    康耐视公司宣布推出 VisionPro7.0 机器视觉软件。VisionPro 7.0引入了可简化检测应用的开发和现场维修的新概念 InspectionDesigner。VisionPro 7.0还增加了专为全方位和较难读取的一维条码而优化的行业最佳的条码读取工具 1DMax,以及多个新工具和读取功能增强。

    Inspection Designer 的引入 — 首次用于一般检测应用 — 为视觉系统集成商和最终用户提供了可简化检测应用的规范、开发和维修的功能。Inspection Designer 具有三个主要优势:

    缺陷的界定。一种新的图像等级评定实用工具,使集成商和最终用户能够轻松地评定产品图像等级和指定各个图像中的不同缺陷类型。图像等级评定实用工具可创建一个已评定等级的图像库,以便在接下来的步骤中使用。

    验证。验证工具可帮助开发商快速确认视觉系统正在通过比较数百张,甚至数千张已保存且已评定等级的图像的检测结果等级来获取所需结果。

    现场维修。验证工具还允许最终用户对照已评定等级的图像库随时重新测试检验工具,以确认工厂车间调整不会影响之前的检测应用。它还允许用户在已评定等级的工件库中添加新图像。

    “Inspection Designer 的引入为系统集成商及其最终用户提供了一种共同的交流工具,因为它规定了定义好、坏工件的正规标准,”视觉软件业务部门经理 Markku Jaaskelainen 说道,“它可以方便地定义一个项目,并帮助确保集成商和最终用户在项目开始阶段就达成共识。”

    三、LabVIEW用于机器视觉

    美国NI公司的应用软件LabVIEW机器视觉软件编程速度是最快的。LabVIEW是基于程序代码的一种图形化编程语言。其提供了大量的图像预处理、图像分割、图像理解函数库和开发工具,用户只要在流程图中用图标连接器将所需要的子VI(VirtualInstruments LabVIEW开发程序)连接起来就可以完成目标任务。任何1个VI都有3部分组成:可交互的用户界面、流程图和图标连接器。LabVIEW编程简单,而且对工件的正确识别率很高。

    四、德国的MVTecHALCON

    HALCON是德国MVtec公司开发的一套完善的标准的机器视觉算法包,拥有应用广泛的机器视觉集成开发环境。它节约了产品成本,缩短了软件开发周期——HALCON灵活的架构便于机器视觉,医学图像和图像分析应用的快速开发。在欧洲以及日本的工业界已经是公认具有最佳效能的Machine Vision软件。

    HALCON源自学术界,它有别于市面一般的商用软件包。事实上,这是一套imageprocessing library,由一千多个各自独立的函数,以及底层的数据管理核心构成。其中包含了各类滤波,色彩以及几何,数学转换,型态学计算分析,校正,分类辨识,形状搜寻等等基本的几何以及影像计算功能,由于这些功能大多并非针对特定工作设计的,因此只要用得到图像处理的地方,就可以用HALCON强大的计算 分析能力来完成工作。应用范围几乎没有限制,涵盖医学,遥感探测,监控,到工业上的各类自动化检测。

    HALCON支持Windows,Linux和Mac OS X操作环境,它保证了投资的有效性。整个函数库可以用C,C++,C#,Visual basic和Delphi等多种普通编程语言访问。HALCON为大量的图像获取设备提供接口,保证了硬件的独立性。它为百余种工业相机和图像采集卡提供接口,包括GenlCam,GigE和IIDC 1394。

    HALCON功能

    随着MVTec公司与学术界的不断合作,在最新推出的HALCON 13中具有以下新功能:

    1.技术革新

    HALCON 13可以实现真正意义上的目标识别。基于样本的识别方法可以区分出数量巨大的目标对象。使用这种技术可以实现仅依靠颜色或纹理等特征即可识别经过训练的目标,从而无需再采用一维码或二维码等用于目标识别的特殊印记。

    2.强大的三维视觉处理

    HALCON 11提供的一个极为突出的新技术是三维表面比较,即将一个三维物体的表面形状测量结果与预期形状进行比较。HALCON提供的所有三维技术,如多目立体视觉或sheet of light,都可用于表面重构;同时也支持直接通过现成的三维硬件扫描仪进行三维重构。此外,针对表面检测中的特殊应用对光度立体视觉方法进行了改善。不仅如此,HALCON现在还支持许多三维目标处理的方法,如点云的计算和三角测量、形状和体积等特征计算、通过切面进行点云分割等。

    3.高速机器视觉体验

    自动算子并行处理 (AOP) 技术是HALCON的一个独特性能。HALCON 11中支持使用GPU处理进行机器视觉算法的算子超过75个,比其他任何软件开发包提供的数量都多。除此之外,基于聚焦变化的深度图像获取 (depth fromfocus)、快速傅立叶变换 (FFT) 和HALCON的局部变形匹配都有显著的加速。HALCON 11会带给用户更高速的机器视觉体验。

    4.机器学习

    最新版本Halcon13加入了机器学习的功能,进一步强大了Halcon的使用区域。

    5.其他新功能

    1)Aztec码识别;

    2)Micro QR码识别;

    3)为分类自动选择特征;

    4)使用HDevelop性能评测工具进行高效的编码分析;

    5)支持Mac OS X 10.7操作系统;

    6)重新修订HALCON/C++接口;

    7)三维数据快速可视化;

    8)远心镜头立体视觉;

    9)改善摄像机标定技术;

    10)HDevelop OCR助手,包含训练文件浏览器;

    11)用于一维码和二维码识别的GS1术语学;

    12)串行化HALCON/.NET及HALCON/C++;

    13)易用的测量工具;

    14)支持JPEG XR及其他。

    五、MATLAB相关的工具箱

    Image Processing Toolbox (图像处理工具箱)

    Computer Vision System Toolbox (计算机视觉工具箱)

    Image Acquisition Toolbox (图像采集工具箱)

    其他的一些工具箱:

    A

    1。名称:机器视觉工具箱。(Machine Vision Toolbox )

    2。开发者:Peter Corke. 发布日期: 1999

    3。机构:澳大利亚 布里斯班 机器人和自动化研究组 负责人。

    4。下载界面:

    http://cat.csiro.au/cmst/staff/pic/vision-tb.html

    5。简介:这个工具箱是作者研究领域的程序收集:光度测定、

    图像测量、比色、过滤、特征提取、图像读写、过滤、分割等。结合Matlab和工作站,可以作为机器视觉算法研究提供方便的支持。

    B

    1。名称:听觉工具箱。(Auditory Toolbox)

    2。开发者:Malcolm Slaney. 发布日期: 1998

    3。机构:加拿大 Interval Research 公司。

    4。下载界面:

    http://rvl4.ecn.purdue.edu/~malcolm/interval/1998-010/

    5。简介:听觉工具箱可以实现典型的听觉模型,它还可以帮助您验证您的听觉模型假说,揭示人类听觉系统感知声音的原理。

    C

    1。名称:人类循环系统模型工具箱 (PHYSBE,a physiological simulation benchmark experiment)

    2。开发者:Kevin Kohrt。发布日期: 1966年提出理论模型,1999年提供下载。

    3。机构:____。

    4。下载界面:

    http://mathworks/products/demos/simulink/physbe/

    5。简介:经典的人类循环系统仿真模型,可以用来模拟血流中的氧、氮、营养物质、热量和化学示踪剂。

    D

    1。名称:代谢模型 分析与优化工具箱 (MetMAP is a Matlab Toolboxfor Metabolical Modeling, Analysis and oPtimization )

    2。开发者:Julio Vera。发布日期: 2003年。

    3。机构:西班牙 La Laguna大学。

    4。下载界面:http://webpages.ull.es/users/sympbst/pag_ing/pag_metmap/index.htm

    http://webpages.ull.es/users/sympbst/pag_ing/pag_metmap/Downloads.htm

    5。简介:帮助您从理论模型的角度来研究一个代谢系统,分析代谢通路的结构和动力学性质。另外,可以对一个干预措施进行优化设计。

    E

    1。名称:大脑风暴 (脑电磁信号可视化与分析工具箱 BrainStorm is an integrated Matlab Toolbox dedicated toMagnetoencephalography (MEG) and Electroencephalography (EEG) datavisualization and processing. )

    2。开发者: Felix Darvas。更新日期: 2005年1月!

    3。机构:USC, Los Angeles 。

    4。下载界面:http://neuroimage.usc.edu/brainstorm/Downloads.php

    请用我的账号登陆。用户名: tenhospital@hotmail 密码:UsPQ7t5G

    5。简介:能够对脑电图、脑磁波描记图进行可视化和分析。是这方面非常重要的共享件。

    六、加拿大的Maxtor Image library

    MIL软件包是一种硬件独立、有标准组件的32位图象库。它有一整套指令,针对图象的处理和特殊操作,包括:斑痕分析、图象校准、口径测定、二维数据读写、测量、图案识别及光学符号识别操作。它也支持基本图形设备。MIL能够处理二值,灰度或彩色图象。

    此软件包为应用的快速发展设计,便于使用。它有完全透明的管理系统,沿袭虚拟数据对象操作,而非物理数据对象操作,允许独立于平台的应用。这意味着一个MIL应用程序能够在不同环境(Win98/Me/NT/2000)中运行于任何VESA-compatible VGA板或Matrox图象板上。MIL用用系统的观念识别硬件板,单一应用程序可控制一种以上硬件板。MIL能单独在主机上运行...

  • ?

    麦肯锡| 如何让数据分析为你所用

    卜珊珊

    展开

    来自:纽约数据科学 id:NYCDataScience

    原文作者:Helen Mayhew, TamimSaleh, and Simon Williams

    翻译:Peiwen Lin , Youjun Zhai

    校对/编辑:Youjun Zhai

    你的数据有目的吗?如果没有,那么你正在原地踏步。下面是一个如何发现目标,并将其转换为行动的方法。

    数据分析革命

    目前正在进行的数据分析革命具有可以改变公司如何去组织、经营、管理人才和创造价值的潜力。一些公司之中,特别是那些从数据中获得主要回报的企业,正在发生这种变革,但尚未成为主流。

    原因很简单:作为唯一能够推动更广泛的业务变革、充分利用高级数据分析的关键人物,CEO和其他高层管理人员,对于数据分析这种他们看来深奥又有很多门道的新事物,保持着敬而远之的心态。

    在某个层面上考虑,这是可以理解的。数据分析方法的复杂性、机器学习的日益重要性以及数据集的庞大规模,使得管理层更倾向于“把它留给专家们”。

    同时这也是错误的。高级数据分析是一个重要的业务问题。这就意味着CEO和其他高管必须能够清楚地明白这些数据的目的,并将其转化为行动。他们必须要明白,数据分析不单单是数据分析部门的工作,其结果更是能为整个公司都带来洞察力和灵感。

    本文介绍了8个理清数据分析目标和提升行动能力的关键要素。我们确信,充分意识到这两个其重要性的领导者们,不仅能借助数据分析解决一些基本问题,还能够更好地解决他们所面临的许多关键和重要的高级管理方面的挑战:传统商业原则下将分析愿景转化为切实结果的需求,部署一系列生产工具和雇用适当人员的重要性,以及应用严格指标和提出难题的必要性。从而提升使用数据分析提高企业绩效的可能性。

    第一部分 | “目的导向”的数据

    对于不同的公司,“更好的性能”意味着不同的东西。这也意味着应该根据具体案例情况来分离,聚合和分析不同类型的数据。有时,数据点(data point)很难找到,当然,并非所有数据点都是一样的。但是,正是这些能助你达到特定目的的数据点,才是最具价值的。

    1. 提出正确的问题 | Ask the right questions

    你的机构应该问的确切问题取决于你的最优先事项。问题清晰是至关重要的。例如,好的提问包括“我们如何减少开销?”或者“我们如何增加收入?”,甚至更好的是进一步挖掘问题:“我们如何提高团队中每个成员的生产力?”、“我们如何为患者带来高质量的服务?”、“我们如何从根本上加快产品从研发到上市的时间?”

    我们需要考虑如何将重要的功能和领域与最重要的版块结合起来,通过实际的业务示例来,指向真正价值之所在。在对资金和时间有着严格限制的现实世界中,数据分析很难为含糊不清的问题给出答案,例如“数据点显示了什么样的模式?”

    一家大型金融公司也因这种开放性的尝试而遭遇了失败:它试图收集尽可能多的数据,想看看大量的数据背后显示了什么。当公司发行这种开放性的尝试结果,有趣但却对提升企业利益没有任何帮助的时候,他们才重新调整了团队。

    有了来自管理层的强大支持,这家公司首先清晰了自己使用数据分析想要达到的目标:减少产品开发时间,然后使用客户采纳度,作为衡量此目的的指标。提高数据分析的针对性帮助公司为两个细分市场推出成功的产品。

    无独有偶,我们知道的另一个组织也是通过首先创建“数据湖”(data lake)而陷入漫无目的的数据分析中。它花费了过多的时间(实际上是数年的时间)收集和处理原始数据,但几乎没有投入任何精力来思考数据分析的目的以及想要解决的问题到底是什么。管理层之后才意识到那些是急待解决的问题,却已经失去了先机。

    如果这些企业先明确了想要解决的问题,再以此为引导来收集数据,那么他们肯定会更快地取得成效,哪怕只有一部分数据可用作分析。

    例如,一家著名的汽车公司在一开始就着眼于如何提高利润这一基本问题。随后认识到解决此问题最大的机会是减少在匹配产品设计和工程功能时耗费的开发时间(以及成本)。

    一旦公司意识到关键所在,即结合其十年的研发经验教训进行改革,并显著的缩短了开发周期,提升了公司利润。

    2. 看起来微不足道的事物,作用却很大 | Think really small... and very big

    细节可能决定成败。让我们关注下面这张拍摄于1896年奥运会,100米决赛起跑线上的照片。照片中,参赛运动员们的起跑姿势可谓千姿百态,有直立的,有弯着腰的,也有双手摊开的,只有美国田径运动员ThomasBurke一人采用了现在的标准蹲踞式起跑方法。也正是这种蹲踞式起跑,帮助Burke节省了加速时间从而助他在那一届奥运会上,以12秒的成绩夺得100米跑的金牌。Burke的成功使田径界在短跑比赛中开始普及蹲踞式起跑方式,如今,短跑运动员在比赛中都采用了这种准备姿势。

    当然,这个案例可以很好地类比到商业界,那就是当竞争对手迅速采取了同样的最佳方案之后,你的竞争优势就难以维持。

    好消息是,聪明的一方仍然可以不断的提升他们的表现,取得突破并回到领先位置。轻松地保持优势是不可能的,但是公司可以找出微小的差异,然后放大并利用它。

    “大数据”分析的成果通常表现为数千甚至更多的细微改进。如果一个组织可以将单个任务细化为数个细小的组成部分,并在可能的情况下一一对其进行提升改进,那么由此带来的回报是相当可观的。如果一个组织能够将这些小的改进,系统化的合并到整个连续的流程之中,其带来的回报更是呈指数增长的。

    企业所做的一切事情几乎都可以被分解成小的组成模块。

    GE(通用电气)公司在飞机发动机中嵌入传感器,以实时跟踪其各部分的性能,从而实现更快的调整,大大减少停机维护的时间。

    如果这听起来像是最前沿的高科技(实际上确实如此),那么我们可以看一看更接地气的消费品是怎么做的。一家领先的CPG公司试图增加旗下某知名早餐品牌的利润率。它将整个产品制造过程分解为几个大的步骤,然后通过高级分析,仔细检查每个制造过程,以寻求其中是否有可以提高利润的机会。在这个案例中,公司在烤箱里发现了答案:稍微的调整了烘烤温度之后,不仅产品的味道更好,而且还减少了生产成本。证据就是,优秀的试吃的结果,以及同样优秀的财务报表。

    当一系列的流程可以在比原子结构更为复杂的系统中被分解,分析,又被重新组合在一起时,产生的结果可以比原子弹更具威力。一家大型钢铁制造商使用各种分析技术来研究其商业模式的关键阶段,包括需求规划,预测,采购和库存管理。它单独对每个阶段中关键的价值驱动版块进行研究,并缩减或消除效率缺陷,从而节约5%至10%成本。

    当制造商将改进后的流程再重组在一起,并将实时信息在每个阶段之间传送时,这些数据分析所带来的,数以百计的微小改进及其所节约的成本,带来了前所未有的收益激增。

    通过合理化的端到端系统,将需求计划,预测,采购和库存管理连在一起,制造商实现了近50%的成本节约,节约了相当于几亿美元的成本。

    3. 拥抱禁忌 | Embrace the taboo

    谨防废进废出(garbage in, garbage out:要保证数据可靠有用,才能保证分析结果的可靠有用),这个咒语已深入到了商业思维中,有时会阻碍我们的思维和洞察力。

    实际上,有用的数据点在不同的案例中有着不同的形式和规模,通常以自由文本维护报告或者PPT演示文档等形式隐藏在企业之中。然而,不少团队经常会忽视这些数据,因为这些数据质量不一、缺乏一致性、过时或者因为看起来并不像是我们定义中的“数据”而被过滤等。

    但是如果我们能“废物再利用”,正确的使用这些隐藏着的信息,也许将能得到更清晰有力的结论。在日常生活中,在跳出Excel表格进行信息创建,读取或回应的非二进制世界里,即使是最精英的“金融工程师”(“quant”)处理大量定性的信息,其中大部分都是无法量化信息并且不适合用做数据分析。我们知道,生活中很少有确定的事情,通常我们去衡量概率,考虑各方优势并且记录细微的提示信息。

    想一想去超市购物的时候,你总是去4号台结账吗?或者你有没有注意到,今天某个柜台的员工似乎工作效率更高,某个柜台有个顾客拿着现金买单而不是信用卡,某个柜台的收银员没有助手去帮助他打包商品,而在某条队伍排队的顾客的购物车里面有些货物还未称重并且需要分开装?所有这些都是无法量化却可以处理的信息,并且有些数据比其他数据更有价值。但你可能会逐个地去考虑他们,而且当你决定购物车将往哪儿推时会考虑地更多。只是因为4号结账台在你最近几次购物经历中结账速度最快,但这并不意味着在今天也会是最快的。

    事实上,虽然原生数据点和历史数据点是有价值的,但它们有其局限性。有一家公司在建立强大的投资审批流程后遇到了这些问题。公司为减少资本资源的浪费,在没有历史数据,以及可靠的信息支持投资回报率预测的情况下,管理层将不予通过新产品。不幸的是,这种严格的制度导致了公司产品上市周期过长,从而使公司不断错过市场。只有放松数据约束,将诸如行业预测、产品专家预测和社交媒体评论等软数据也纳入考虑之中,公司才能更准确地了解当前市场环境和推出新产品的绝佳时机。

    当然,Twitter信息与远程信息处理并不一样。但是不能仅因为数据不完整或基于设伦,或是存在偏差,就把这些数据当作“垃圾”来对待。软信息确实有它的价值。特别是当人们尝试将获取更精准的数据与更好的推测未来形势时,这些软数据甚至会起到关键作用。

    为了以智能而细致的方式优化可用信息,公司应努力构建一个强大的数据世系模型(data provenance model),以识别信息来源源,并实时评估其可靠性(可能随时间而提升或降低)。记录数据的质量,以及确定数据之类的方法,这不仅是数据透明度问题,同时也是一种风险管理的形式。所有的公司都在一个不确定性下竞争,有时一个关键的决定性数据的确定性不一定能满足人们的期待。一个构架完善的世系模型可以使用负荷测试检查对行/不行决策的可行度,从而帮助管理者决定投资去改善关键数据集的合适的时机。

    4. 连点成线 | Connect the dots

    在边界上往往能产生新见解,就像考虑软数据一样能够带来新见解一样,结合信息来源来全盘考虑,可以使这些见解更加清晰。

    一些企业往往在一项独立的数据集上进行深入挖掘,却没有考虑到各种不同数据集结合在一起时所传达的信息。例如,人力资源部可能有完整的员工绩效数据,营运部门有特定资产的综合信息,而财务部的投资回报率的备份财务报表。仔细审查每一份信息肯定是有用的,但是互相独立的信息数据集之间也许存在着更多尚待未开发的价值。

    有家工业公司提供了一个具有启发性的实例。公司核心业务使用了最先进的机器,它可以同时负载多个任务。机器的每一个部件都价值上百万美元,而公司采购了数百个单元,总共投资了数十亿美元。这些机器可提供了优秀的运行性能数据,该公司据此评估了机器的每个部件一直以来的运行情况。毫不夸张地说,让机器保持持续运作是公司成功的关键。

    尽管如此,这些机器实际上花费了比管理人员预期更长的维护时间和更昂贵的维护费用,停机维修的每一个小时都对公司有着极大的影响。虽然公司派出了强大的分析团队去仔细筛选分析机器的运行性能数据,但还是没有找出确切的故障原因。

    然后,当公司将人力资源部提供的信息也纳入分析考虑中时,产生次级输出的原因变得很清楚:因为负责人在关键时刻未在场,导致机器缺少定期维护检查。

    奖励机制,而非器械性能,才是这个问题的本质原因。最终,一个简单的政策调整就能解决这个问题,但只有当将不同的信息数据集结合起来审查时才能发现问题本质之所在。

    第二部分 | 从分析结果到实际行动

    在前面的工业公司的案例中,在视觉上就像Venn图一样(维恩图,用于显示元素集合重叠区域的图示。):当将两个数据集放在一起观察研究时,数据集重叠的部分往往显示了问题所在。当你同时分析50个数据集时,其呈现信息的能力则更为强大-前提是繁杂的数据没有造成过度的复杂,从而减弱了数据分析的作用。为了避免这个问题,领导者应该鼓励他们的企业,从多方面入手,来分析数据。如果数据分析工作在孤立的环境中进行而不考虑全局的其他影响,如果数据分析结果在实际情况中没有起到作用,更糟糕的是,如果数据分析得到了正确的结论,可企业并未采纳和依次采取对应的实际行动;那么,这个分析工作就是失败的,没有成功的。

    5. 采用迭代循环而不是单向流程 | Run loops, not line...

  • ?

    18年6大BI与数据可视化工具的比较分析

    不言

    展开

    【IT168 资讯】如今,有大量功能强大的可视化工具可以帮助您展示想法、可视化数据、进行谈话,与客户和全球社区分享您的重要分析。在本文中,我们将比较最常用的平台并分析其主要功能,以帮助您选择一个或多个平台,为您的工作交流提供不可或缺的帮助。

    在评估各种商业智能(BI)工具时,很难将事实与虚构分离开来,因为每个BI供应商都将其产品作为唯一的“最佳”解决方案进行销售,这往往使得互联网充斥着偏见的评论。如果你想了解功能性产品的价值,避免大肆宣传和点击无尽的部分评论,那么你来对地方了。

    我们将引导您了解所有主要工具(如QlikView,Klipfolio,Tableau,Geckoboard,Power BI和Google Data Studio)的特性、优点和缺点。我们还将比较它们的关键参数,包括可用性、设置、价格、支持、维护、自助服务功能、不同数据类型的支持等。让我们分别看看每个工具。

    QlikView

    QlikView是一种将用户作为数据接收者的解决方案。它允许用户在工作流程中探索和发现数据,这与开发人员在处理数据时的工作方式类似。为了保持数据探索和可视化方法的灵活性,该软件致力于维护数据之间的关联。这可以帮助最终用户发现您的数据,即使这些搜索项目的来源是令人难以置信的,这些数据也会提醒您检索相关项目。

    QlikView非常灵活。它允许设置和调整每个对象的每个小方面,并自定义可视化和仪表板的外观和感觉。具有如此大的灵活性,还有一个集成的ETL(提取,转换,加载)引擎,使您能够执行普通的数据清理操作。但是,这可能会很昂贵。

    产品差异化

    许多Qlikview在商业智能领域的竞争对手认识到差异化商品的高价值,并试图重现其许多特征,但大多数情况下都失败了。 Qlikview的设计是在avant-garde预构建的仪表板应用程序和联想仪表板的基础上开发的,这些应用程序既创新又直观易用。由于具有先进的搜索功能,它还提供了避免使用数据仓库和使用关联仪表板在内存中提取数据的功能,如上所述。

    特征

    Qlikview的独特性和灵活性的完美结合使其在其他BI供应商中占有一席之地,并为各行各业处理了大量不同规模的业务提供各种有用的应用程序。

    QlikView拥有众多的功能,使其对基于来自多个来源的数据创建高级仪表板非常有用。

    其中一个特点是QlikView能够自动操作数据关联:它可以识别集合中各种数据项之间的关系,而无需用户进行任何明确的预配置工作。这项任务的自动化极大地加快了仪表板开发的进程。

    Qlikview处理数据输入的另一个重要特性是将其保存在多个用户的内存中,即保存在服务器的RAM中。这样可以加快查询速度,从而加快数据探索速度,并改善用户在运行中计算的聚合体验,而不是基于存储的计算。由于Qlikview保留了内存中的数据,因此根据需要计算聚合要快得多,而不是查询预先计算的聚合值。另外,它更具有内存效率。

    将数据保存在内存中肯定是一项艰巨的进步,因为它需要大量的内存来处理所有的数据。 QlikView通过令人难以置信的压缩级别将数据缩小至原始大小的10%来解决此问题。我们相信这是通过大量使用数据字典并仅使用分析所需的最重要的数据获得的最大的Qlikview功能之一。

    可用性

    即使对普通用户来说,QlikView的仪表板和报告也很容易浏览。但是,构建报表可能非常具有挑战性,因为它需要高水平的开发人员技能,熟悉默认SQL以及使用Qlikview的专有查询语言进行训练以构建数据库交互。

    定价

    QlikView被评为BI领域最昂贵的平台之一。完整的价格政策可在以下链接中找到:qlik。定价方案相当复杂,可能令人困惑。许多新用户通过其“文档许可证”陷入了代价高昂的陷阱,该文档许可证以某种模糊的方式表达了工作条件。最初的定价计划实际上可能会让您费用增加一倍,因为速率仅适用于一个“文档”(.tde文件)。许多客户后来发现这是令人不愉快的惊喜,并且它还可以刺激用户的价格近两倍。与Qlikview相比,其他竞争对手的定价政策更直接。

    QlikView是关于目的地的,所以你需要确切地知道你要去的地方。如果有些问题仍然模糊,则可能花费大量时间尝试将多个表单放在一起,最终可能会丢弃多个表单,因为任何误解的数据都会影响最终结果。只要您不改变原始问题,QlikView就可以让您使用您的数据完成精彩的事情。

    总而言之,如果您有正确的思维方式来应用程序化界面,并且能够从一开始就整合正确的问题,以便您的数据以不同形式派生,那么Qlikview可能是适合您的解决方案。当然,您还需要准备投入额外的努力来维护正确的报告。

     KLIPFOLIO

    Klipfolio是一个BI解决方案,在云中占据100%(不需要桌面应用程序),为数据可视化和仪表盘组成提供了一个真正具有洞察力的工具。这使得它能够最有效地处理数据、增强实时解决方案和优化,而不是依赖于周期性回归模型。

    Klipfolio支持连接到各种数据源,包括在线和离线数据源。在线资源整合了一系列云托管存储,包括Google表格、关系数据库和其他以各种形式提供数据的服务。服务部门可以在这里找到连接服务的完整参考资料。使用RESTful API也可以连接到您自己的数据源。

    Klipfolio支持多种离线服务类型:MS Excel、CSV、XML、JSON等。可以通过与上面提到的在线来源相同的链接找到完整的参考列表,但是仅在数据存储库部分。

    所有这些数据源,无论是单独或组合,都可以有效地用于整合各种指标,以提取数据愿景,创建、转换和共享定制可视化,以揭示任何无用数字背后的实际含义。

    Klipfolio采用响应原则,利用智能手机和平板电脑等各种技术平台,以及跨越会议室墙壁的台式计算机和智能电视,帮助发现仪表板。

    产品差异化

    Klipfolio代表了一个功能强大的数据仪表盘构建平台,可以访问真实世界,不断变化的生动数据源。当动态变化非常重要并且可能需要紧急决策时,它最适用于实时监视和控制连续数据流。实时数据连接是数据检索的一种方式,可以保持数据准确性和可靠性所需的时间一致性,而响应速度则可用于快速决策的时间因素。

    特征

    ·将多个数据源整合到一个报告中

    ·无限连接尽可能多的用户

    ·管理重要信息的访问权限和限制

    ·移动辅助功能(iOS,Android,黑莓,Windows)

    ·灵活的REST连接器,用于设置自定义数据源

    ·安全连接到SQL数据库

    ·支持Excel、CSV、JSON、XML文件格式

    ·方便的注释到分享报告的用户看到的报告

    ·自助式KPI编辑平台

    ·易于使用的阈值指标。

    可用性

    Klipfolio包括大量的可视化类型,包括普通表、条形图、饼图、线和面积图,这些图表的组合以及散点图。此外,通过使用一些HTML和CSS,用户可以伪造自己独特的可视化效果。在WYSIWYG编辑器的帮助下,所有这些组件都在复合仪表板上进行布局。一些更复杂的可视化元素添加了各种公式和功能。

    Klipfolio仪表板具有广泛的协作框架,可根据权限与其他用户共享信息,通过电子邮件启用通知和分发。使用Klipfolio时的显著差异出现在建筑图表和图表中。

    用户不必简单地将数据表中的字段拖放到工作表中,而必须使用不同的函数和公式来实现所有计算。通过这种方式,您可以使用任何类型的可视化创建工作表,但是您需要考虑如何组合和更改数据。

    定价

    Klipfolio是BI行业中历史最悠久的企业之一,拥有丰富的经验和专业知识,通过开发可行的解决方案为其铺平了道路。 Klipfolio主要投注今天的云服务,同时也提供前提解决方案选项。 Klipfolio仪表板(作为SaaS)使用用户每月定价政策进行分配,根据数量和时间承诺有一些小的总变化。定价从每月19美元开始,提供多种选项和定制的付款方案。 Klipfolio还提供14天的免费试用期,用于测试和学习目的。

    Tableau

    今天的另一个重要角色就是Tableau。与大多数其他商务智能工具一样,它通过可视化方式进行零数据分析。它旨在轻松创建和分发交互式数据仪表板,通过简单而有效的视觉效果提供对动态,变化趋势和数据密度分布的深入描述。

    与许多其他服务一样,Tableau提供了连接多种系统类型的数据源的工具,如以文件格式(CSV,JSON,XML,MS Excel等)组织的数据系统,关系数据系统和非关系数据系统(PostgreSQL ,MySQL,SQL Server,MongoDB等),云系统(AWS,Oracle Cloud,Google BigQuery,Microsoft Azure)。

    与竞争对手的核心区别在于Tableau具有数据混合的特点。另一个独特的特点是实时协作的能力,使其成为商业和非商业组织的宝贵投资。有几种方法可以在Tableau中共享这些报告:将它们发布到Tableau服务器;通过电子邮件Tableau Reader功能;通过公开发布Tableau工作簿并授予访问任何有链接的人员的权限。这种选择的大小可以带来很大的灵活性并消除许多限制

    产品差异化

    Tableau提供了多种具有鲜明特征的可视化功能,实现了数据发现和深入洞察的智能方式。丰富的可视化类型库包括“文字云”和“气泡图”,可为Tableau提供独特的高级别理解。树图和树形图为视觉效果提供上下文信息。后者通常用于描述零件分类数据,重点关注最相关的信息。

    Tableau仪表板非常灵活。它的中心特征允许以期望的方式用任何“重叠”来布置仪表板,这在屏幕空间人体工程学中非常方便。

    Tableau很容易理解为工作工具,其学习曲线非常温和,因为它努力为任何类型的用户提供其所有权力,甚至是那些以前从未接触过可视化工作流技术细节的用户。

    从开发人员的角度来看,Tableau不仅简单易用,而且在目的地方面也非常整洁,因为它提供了通过附加自定义参数的附加过滤来控制结果的能力。所有的数据都以清晰、有吸引力和互动的方式进行交流。Tableau提供了对数据的深刻见解,并允许有效地压缩复杂的决策过程。

    上面的共享系统以其巨大的灵活性和不同的数据共享选择而闻名。即使是最挑剔的用户也肯定会找到一个合适的解决方案来满足他们最多变的需求。

     特性

    ·免费共享能力(有一定的限制)

    ·支持连接到30多个数据源类型

    ·混合数据源

    ·支持多维数据集

    ·与R的集成,为许多数据库映射现成的驱动程序

    ·领导社区建设工作(各种培训视频、博客、论坛、社交网络参与)

    可用性

    非常容易使用,从这个列表看,它被认为是最好的易于使用的工具。考虑到这些广泛的Tableau特性,它最方便的用例是通过图表、图形和其他可视化类型发现结构化数据。没有其他的BI解决方案可以让它比Tableau更容易,给它的用户带来惊人的力量。对于一个普通的业务用户来说,这很容易,而且与开发工具一样强大。导入数据、构建有吸引力的可视化,共享并以简单明了的形式发布它们。此外,大量的教程视频、howto -tos、blogs和论坛将节省时间,避免寻找正确的解决方案的长期斗争。

    定价

    Tableau有不同的许可计划,类似于其他BI解决方案。Tableau提供了三种截然不同的产品,价格截然不同。

    这三种产品分别是Tableau桌面、Tableau和Tableau服务器,它们的价格不同。详细的价格信息可以在官方网站上找到。

    Tableau桌面是为大多数的个人用户设计的,每年为个人用户提供$999,企业使用$1,999,覆盖支持。个人使用意味着它是针对单个开发人员的,并且支持6个数据源。企业使用意味着它是为业务需求而设计的,并允许多达44个数据源。

    Tableau是一个基于云的BI平台,由Tableau供应商提供web界面。Tableau可以免费使用它的公共选项,但重要的是要记住,这个解决方案是托管在公共服务器上的,所有的报告都是公开共享的。这个私人在线版本的售价为500用户/年。

    Tableau服务器对于运营自己服务器的公司来说是一个成熟的业务工具,它希望对数据流进行完全控制,并保证后台主机的安全性。然而,它的价格是每10个用户1万美元。客户的支持还提供了额外的25%的年成本。

    它是又一个基于云的可视化解决方案。如果你需要使用基本预定义的小部件显示某些值,它可以成为适合您的工具。 Geckoboard提供了使用各种小部件来组合仪表板的功能。它具有丰富的与Facebook准备集成的库: twitter、Salesforce API,以便您可以即时查看您的社交媒体参与或业务数据。

    它还提供了以两种方式与您自己的数据源创建自定义集成的能力::Pull或Push。Pull意味着您的小部件每隔N秒就会提交一次数据请求(您可以设置N值),该数据与提取数据的位置链接到特定的URL(您也可以设置)。Push意味着您可以通过向特殊小部件URL发送HTTP请求来手动为小部件提供数据。这会将您发送的数据与该小部件相关联,并将其显示在仪表板上。

    Geckoboard为您提供了几个可能的小部件模板,如折线图或直方图,每个模板都有自己的可以显示的JSON格式的数据。拉式服务器或推送器以适当的格式发送数据很重要。否则,它不会在仪表板上显示任何内容。

    您还可以更改窗口小部件的样式表,更改颜色模式,添加两个或更多仪表板或添加多个用户。 Geckoboard拥有一支可靠的支持团队,通常能够相对快速地做出响应,...

  • ?

    数据可视化分析工具汇总

    开了

    展开

    俗话说“巧妇难为无米之炊”。数据时代,没有一款好的数据可视化分析工具,光有团队怎么行?

    商场如战场,数据是把枪。亚马逊运用大数据为客户推荐商品信息,阿里用大数据成立了小微金融服务集团,而谷歌更是计划用大数据接管世界……不知不觉,数据已经成为我们生活中必不可少的利器。本文收集了各个平台各种行业的数据可视化分析工具,让你不仅大饱眼福,而且还可以让你事半功倍。

    Excel

    Excel作为一个入门级工具,是快速分析数据的理想工具,也能创建供内部使用的数据图,但是Excel在颜色、线条和样式上课选择的范围有限,这也意味着用Excel很难制作出能符合专业出版物和网站需要的数据图。

    ETHINK大数据平台

    一款集数据可视化分析、数据挖掘、机器学习等功能为一体的综合性大数据平台。拖拽式操作,操作简单,支持多种数据源,上卷下钻,数据预测,聚类分析,相关性分析,数据联想,决策树,地图,组合图等功能。通过强大的2次开发能力,帮助快速复制与行业推广。

    Charting Fonts

    Charting Fonts是将符号字体与字体整合(把符号变成字体),创建出漂亮的矢量化图标。

    Gephi

    Gephi是进行社会图谱数据可视化分析的工具,不但能处理大规模数据集并且Gephi是一个可视化的网络探索平台,用于构建动态的、分层的数据图表。

    CartoDB

    CartoDB是一个不可错过的网站,你可以用CartoDB很轻易就把表格数据和地图关联起来,这方面CartoDB是最优秀的选择。

    Google Chart API

    Google Chart提供了一种非常完美的方式来可视化数据,提供了大量现成的图标类型,从简单的线图表到复杂的分层树地图等。它还内置了动画和用户交互控制。

    D3

    D3(Data Driven Documents)是支持SVG渲染的另一种JavaScript库。但是D3能够提供大量线性图和条形图之外的复杂图表样式,例如Voronoi图、树形图、圆形集群和单词云等。

    Crossfilter

    Crossfilter既是图表,又是互动图形用户界面的小程序,当你调整一个图表中的输入范围时,其他关联图表的数据也会随之改变

    Raphael

    Raphael是创建图表和图形的JavaScript库,与其他库最大的不同是输出格式仅限SVG和VML.

    R语言是主要用于统计分析、绘图的语言和操作环境。虽然R主要用于统计分析或者开发统

    计相关的软件,但也有用作矩阵计算。其分析速度可比美GNUOctave甚至商业软件MATLAB。

    Visual.ly

    如果你需要制作信息图而不仅仅是数据可视化,Visual.ly是最流行的一个选择。

    Weka

    Weka是一个能根据属性分类和集群大量数据的优秀工具,Weka不但是数据分析的强大工具,还能生成一些简单的图表。

    NodeBox

    NodeBox是OS X上创建二维图形和可视化的应用程序,你需要了解Python程序,NodeBox与Processing类似,但没有Processing的互动功能。

    Processing

    Processing是数据可视化的招牌工具。你只需要编写一些简单的代码,然后编译成Java。Processing可以在几乎所有平台上运行。

    Leaflet

    Leaflet是一个开源的JavaScript库,用来开发移动友好地交互地图。

    Openlayers

    Openlayers可能是所有地图库中可靠性最高的一个。虽然文档注释并不完善。且学习曲线非常陡峭,但是对于特定的任务来说,Openlayers能够提供一些其他地图库都没有的特殊工具。

    PolyMaps

    PolyMaps是一个地图库,主要面向数据可视化用户。PolyMaps在地图风格化方面有独到之处,类似CSS样式表的选择器。

    Timeline

    Timeline即时间轴,用户通过这个工具可以一目了然的知道自己在何时做了什么。

    jsDraw2DX

    jsDraw2DX是一个标准的JavaScript库,用来创建任意类型的SVG交互式图形,可生成包括线、矩形、多边形、椭圆、弧线等图形。

    iCharts

    iCharts提供可一个用于创建并呈现引人注目图表的托管解决方案。有许多不同种类的图表可供选择,每种类型都完全可定制,以适合网站的主题。iCharts有交互元素,可以从Google Doc、Excel表单和其他来源中获取数据。

    Modest Maps

    Modest Maps是一个轻量级、可扩展的、可定制的和免费的地图显示类库,这个类库能帮助开发人员在他们自己的项目里能够与地图进行交互。

    Many Eyes

    Many Eyes是一个Web应用程序,用来创建、分享和讨论用户上传图形数据。

    Anychart

    Anychart是一个灵活的基于Flash/JavaScript(HTML5)的图表解决方案、跨浏览器、跨平台。除了图表功能外,它还有一款收费的交互式图表和仪表。

    Kartograph

    Kartograph不需要任何地图提供者像Google Maps,用来建立互动式地图,由两个libraries组成,从空间数据开放格式,利用向量投影的Python library以及post GIS,并将两者结合到SVG和JavaScript library,并把这些SVG资料转变成互动性地图。

    Sigma.js

    Sigma.js是一个开源的轻量级库,用来显示交互式的静态和动态图表。

    Echarts

    经常使用开源软件的朋友应该很熟悉ECharts,大家都知道去年春节以及近期央视大规划报道的百度大数据产品,如百度迁徙、百度司南、百度大数据预测等等,这些产品的数据可视化均是通过ECharts来实现的。

    Zoho Reports

    Zoho Reports支持丰富的功能帮助不同的用户解决各种个性化需求,支持SQL查询、类四暗自表格界面等。

    Quantum GIS(QDIS)

    Quantum GIS(QDIS)是一个用户界面友好、开源代码的GIS客户端程序,支持数据的可视化、管理、编辑与分析和印刷地图的制作。

    Tableau Public

    Tableau Public是一款桌面可视化工具,用户可以创建自己的数据可视化,并将交互性数据可视化发布到网页上。

    Paper.js

    Paper.js是一个开源向量图表叙述架构,能够在HTML5 Canvas 运作,对于初学者来说它是很容易学习的,其中也有很多专业面向可以提供中阶及高阶使用者。

    Dundas Chart

    Dundas Chart处于行业领先地位的NET图表处理控件,于2009年被微软收购,并将图表产品的一部分功能集成到Visual Studio中。

    TimeFlow

    TimeFlow Analytical Timeline是为了暂时性资料的视觉化工具,现在有alpha版本因此有机会可以发现差错,提供以下不同的呈现方式:时间轴、日历、柱状图、表格等。

    Gantti

    Gantti是一个开源的PHP类,帮助用户即时生成Gantti图表。使用Gantti创建图表无需使用JavaScript,纯HTML-CSS3实现。图表默认输出非常漂亮,但用户可以自定义样式进行输出(SASS样式表)。

    Smoothie Charts

    Smoothie Charts是一个十分小的动态流数据图表路。通过推送一个webSocket来显示实时数据流。Smoothie Charts只支持Chorme和Safari浏览器,并且不支持刻印文字或饼图,它很擅长显示流媒体数据。

    Flot

    Flot是一个优秀的线框图表库,支持所有支持canvas的浏览器(目前主流的浏览器如火狐、IE、Chrome等都支持)。

    Pizza Pie Charts

    Pizza Pie Charts是个响应式饼图图表,基于Adobe Snap SVG框架,通过HTML标记和CSS来替代JavaScript对象,更容易集成各种先进的技术。

    Fusion Charts Suit XT

    Fusion Charts Suit XT是一款跨平台、跨浏览器的JavaScript图表组件,为你提供令人愉悦的JavaScript图表体验。它是最全面的图表解决方案,包含90+图表类型和众多交互功能,包括3D、各种仪表、工具提示、向下钻取、缩放和滚动等。它拥有完整的文档以及现成的演示,可以帮助你快速创建图表。

    Protovis

    Protovis是一个可视化JavaScript图表生成工具。

    Arbor.Js

    Arbor.Js提供有效率、以力导向的版面配置演算法,抽象画图表组织以及筛选更新的处理。

    Highchart.js

    Highchart.js是单纯由JavaScript所写的图表资料库,提供简单的方法来增加互动性图表来表达你的网站或网站应用程式。目前它能支援线图、样条函数图。

    Circos

    Circos最初主要用于基因组序列相关数据的可视化,目前已应用于多个领域,例如:影视作品中的人物关系分析,物流公司的订单来源和流向分析等,大多数关系型数据都可以尝试用Circos来可视化。

    NodeXL

    NodeXLDE 主要功能是社交网络可视化。

    BirdEye

    BirdEye是Decearative Visual Analytics,它属于一个群体专案,为了要提升设计和广泛的开源资料视觉化发展,并且为了Adobe Flex建视觉分析图库,这个动作以叙述性的资料库为主,让使用者能够建立多元资料视觉化界面来分析以及呈现资讯。

    Visualize Free

    Visualize Free是一个建立在高阶商业后台集游InetScoft开发的视觉化软体免费的视觉分析工具,可从多元变量资料筛选并看其趋势,或是利用简单地点及方法来切割资料或是小范围的资料。

    OpenStreetMap

    OpenStreetMap是一个世界地图,由像您一样的人们所构筑,可依据开放协议自由使用。

  • ?

    MSA数据分析方法和应用案例

    波琳

    展开

    测量系统是用来对被测特性定量测量或定性评价的仪器或量具、标准、操作、方法、夹具、软件、人员、环境和假设的集合; 是用来获得测量结果的整个过程。从这个定义中可以看出, 测量过程实际上是一个制造数据的过程,获得正确的测量数据则是保证产品质量的第一步。如果不能科学地评价测量系统产生的数据的可靠性, 就无法对测量系统的有效性进行控制, 质量管理和控制就失去了最基本的前提。因此,在ISO/TS16949汽车行业质量体系标准中,测量系统分析(简称MSA)被列为该标准的五大工具之一。

    测量系统分析(MSA) 的目的是确定测量数据的可靠性, 它实际上是一个对测量系统的监督检查程序, 在一定程度上可以看作是一个检验产品控制计划满足程度的把关程序。即对已判定为合格的零件进行抽样检查, 经过科学的统计理论分析, 找出因测量系统因素导致不合格的因素, 并加以整改, 逐渐减少产生不合格产品因素的存在,从而达到控制产品质量的最终目的。

    1 基本MSA方法

    测量系统分析,顾名思义针对的是整个测量系统的稳定性和准确性,它的核心是分析

    测量系统的位置变差、宽度变差。在位置变差中包括测量系统的偏倚、稳定性和线性;在宽度变差中包括测量系统的重复性、再现性。测量系统的偏倚、稳定性、线性、重复性和再现性就是人们通常所说的“五性”。因此,MSA 可简单概括为:分析整个测量系统(仪器或量具、标准、操作、方法、夹具、软件、人员、环境和假设的集合)在测量过程中存在哪些风险和误差的过程。MSA采用的数据分析方法有:独立样本法、图表法、极差法、方差分析法等。按照测量系统分析过程前后顺序,相关方法摘记如下。

    1.1 识别数据类型 在进行测量系统分析前首先要识别测量数据的类型,了解了数据的类型才能使用合适的方法进行测量系统分析。一般数据类型有两种:计数型数据和计量型数据。计数型数据是指不能连续取值的,如砂眼数、裂纹处、疵点数等。计量型数据是可以连续取值的,如长度、尺寸、温度等。

    1.2 选定测量系统分析方法 测量系统分析常用的方法有Gage R&R研究、专家再评估、检验一致性和专家循环研究。重点研究Gage R&R。Gage R&R方法主要用于计量型数据,评定标准是用Gage R&R值。一般Gage R&R值在小于10%以下可接受,Gage R&R值在10%-30%之间为灰色区域,也许可接受,Gage R&R值大于30%,测量系统需改进。同时还要看可区分数NDC,当NDC大于等于5时,通常认为测量系统可靠。用Gage R&R值作为评定标准时还要考虑零件的关键特性,对关健特性测量系统分析结果Gage R&R值大于15%时,我们就要考虑对这个测量系统进行改进。

    1.3 测量系统的重复性和再现性分析方法(简称%GR&R%或R&R) 确定研究主要变差形态的对象/量具(如:游标卡尺、电子秤、硬度计、千分尺等)。工序量具、产品和质量特性;选择使用极差法,均值和极差法中的其中一种方法对检验、测量和试验设备进行分析;从代表整个工作范围的过程中随机抽取样品进行;测量系统分析的工作人员在进行检验、测量和试验设备测量系统的重复性和再现性分析时,必须先对被分析的检验、测量和试验设备进行零件评价人平均值和重复性极差分析,同时所分析的零件评价人平均值和重复性极差之结果必须均受控方可进行被检验、测量和试验设备测量系统的重复性和再现性分析工作;否则该检验、测量和试验设备的测量系统不能检查出零件间的变差且不能将其用于过程控制中。

    1.4 平均值和重复性极差分析 1)选择2-3个操作员(至少2人)在全然不知情的状况下利用校准合格的量具对随机抽取的5-10个样品进行盲测,每个操作员对同一样品的同一特性在盲测的情况下重复测量2-3次。 2)操作员或进行%R&R测量系统分析的工作人员将所测量的结果记录于“零件评价人平均值和重复性极差控制图”上。 3)负责组织此项测量系统分析研究的工作人员,依据“零件评价人平均值和重复性极差控制图”上的数据和产品质量特性规格进行计算和分析,并将其分析的结果记录于“零件评价人平均值和重复性极差控制图”上。

    1.5 均值和极差法(X-R) 1)选择2-3个操作员(至少2人)在全然不知情的状况下利用校准合格的量具对随机抽取的5-10个样品进行盲测,每个操作员对同一样品的同一特性重复测量2-3次。 2)操作员或进行%R&R测量系统分析的工作人员将所测量的结果记录于“量具重复性和再现性X-R分析数据表”上。 3)负责组织此项测量系统分析研究的工作人员,依据“量具重复性和再现性X-R分析数据表”上的数据和产品质量特性/规格进行计算,并将其记录于“量具重性和再现性X-R分析报告”上。

    1.6 极差法(R) 1)选取两位评价人和5个产品进行分析,每个评价人对每个产品进行盲测一次,并将测量结果记录于“量具极差法分析表”中(每个操作员应熟悉和了解使用量具的一般操作程序,避免应操作不一致而影响测量系统的可靠性),并评估不同操作员对量具使用的熟练程度; 2)针对重要特性(尤其指有特殊特性符号的)测量所使用量具的精度应是被测量产品公差的1/10(即其最小刻度应能读到1/过程变差或规格公差较小者),以避免量具的分辩力不足,而一般特性测量所使用量具的精度应是被测量产品公差的1/5;   

    3)负责组织此项%R&R测量系统分析研究的工作人员,依据“量具极差法分析表”的数据和产品质量特性/规格进行计算,并将其计算结果记录于“量具极差法分析表”上;必要时,可将其作成X-R控制图。

    4)%R&R接受准则: a)、%R&R<10%,可接受;b)、10%≤%R&R≤30%,依据量具的重要性、成本及维修费用等因素,决定是否可接受或不可接受;c)、%R&R>30%,不能接受,必须进行改进。

    1.7 线性分析法

    在测量系统工作范围内选定5个产品,它们的测量值应覆盖量具工作范围;在计量室或工具间用全尺寸检验设备(精密量具)测量每个产品10次,并计算其平均值,然后将其确定为“基准值”,同时确定它们各自所取得的“基准值”是否覆盖了被检量具的工作范围;让一位经常使用该量具的操作员(评价人)对5个产品以盲测的方式按随机抽取 顺序分别测量每个产品各10次(或更多次),并将其测量值记录于“量具线性分析报告”中,然后计算各产品的测量平均值,此值即为每个产品的“观察平均值”。

    2 MSA与计量的关系

    MSA主要针在现场环境下,由现场控制人员按照《控制计划》要求的频次,对具体的零件使用正确的监视或者测试设备,按照《检验作业指导书》的方法进行有效的检测和监控(即人机料法环等环节),在每个时期,针对不同的目的,采用不同的MSA方法,研究分析每个环节产生的变差(即分离分离各个变差),最后消除或减小变差,使得我们生产的产品满足技术要求。MSA的数学理论基础为《概率与数理统计》。

    计量主要是实现单位统一和量值准确可靠的测量,它以保证测量统一和准确为目的。测量环境有严格的控制要求。测量的变差分析的数学理论基础为《误差分析与数据处理》,也是根据《概率与数理统计》原理基础上建立起来的。本文主要指计量体系和管理,不涉及具体计量内部运作,只谈与测量系统的相互关系。

    MSA关注对产品技术要求测量的综合反应有影响的结果,用来研究和分析整个测量系统以及影响测量的各个因素。计量的含义则是保证量值传递或溯源准确可靠,而将影响量值的其他分量进行控制,如环境、温度等,更关注的是测量方法。可以这样说:综合研究的是MSA,测量系统分析;只研究测量的是计量,所以也称之为“测量分析”。

    3 两个例子

    3.1 案例一

    盛玉在他的文章《MSA实例分析》中,针对一把高度尺应用MSA分析方法的全过程。

    下面通过日常监控分析常用的线性和R&R 的实例。

    1、线性———验证一把高度尺,基本内容见下表。

    1)在现场取一根曲轴,选其上5 个不同尺寸;

    2)选用比高度尺精度高(一般高3 倍以上)的精密三坐标测量出5 个尺寸的基准值;

    3)用高度尺分别测量5 个尺寸,每个尺寸重复测12 次

    4)输入软件,自动得到结果;

    5)接收准则:≤5%接收,≥10%拒收;5%—10%有条件接收;

    6) 结果处理:该例中线性自动计算为3%至5%,按照接收准则线性可接收。

    若大于5%,我们要从人、机、料、法、环、测几个方面去查找根本原因并改进,若已对产品质量造成影响,还需去追溯造成影响的产品,重新检测,直到满足要求。

    2、重复性和再现性,简称R&R

    在实际生产应用中,R&R 通常一起分析。如:验证曲轴OP100 综合检具上法兰轴头直径∮88.8(+0.804/+0.004),具体计算如下表所示。

    1)按照MSA 计划分别在不同时段收集OP100曲轴共10 根;

    2)3 名熟练操作工分别测量10 个工件,每个件重复测3 次;

    3)把3 人3 次共90 个测量数据输入计算软件(表2 中有底色部分),则会自动得到结果;

    4)接收准则:

    a. R&R 低于10%,测量系统可接受;

    b. 介于10%到30%之间,基于应用的重要性,该量具可能会被接受;

    c. 大于30%,测量系统需要改善,识别出原因并纠正它们;

    d. 数据分级数NDC>=5 测量系统可接受。

    5)分析结果

    前文表格中测量结果明显看出该测量系统不可接受,EV=65.7%、R&R=73.1%且NDC=1。我们测量小组一起到现场查找原因,通过排除法最终找到R&R 超差根本原因如下:

    a. %EV=65.7% (计算软件要求%EV<30%),零件安装时有转动,不稳定;

    b. 数据分级数(NDC)=1 (计算软件要求NDC>=5,测量软件显示分辨力不够,稳定生产条件下被测件尺寸稳定,分组少。

    6)解决方案

    针对a. 零件安装时有转动问题,经过现场反复装夹测量,结果差异0.002mm,由于重新加工制作条件不成熟,对这影响量0.002 mm,我们和工艺一起确认采取收紧控制限方法避免;

    针对b. NDC 分级数偏低问题,现场排除一切可能影响因素,分析软件仍显示分辨力不够,最终确认是10 件样件产品尺寸太接近造成,也可以说是我们现在的产品质量很稳定。对于NDC 偏低问题,在做MSA 取样时要充分考虑到尺寸范围,如留下换刀或平时偶发时发现的不合格产品。

    7)重新取样

    找到2 件接近公差限样件,重新测量输入测量软件后计算结果满足要求见下表,表明我们现在的测量系统稳定可靠,不需要去追溯已经测量的产品。

    一般情况下如果重复性比再现性大,原因可能是:

    1)仪器需要维护;

    2)计量检测设备应重新设计来提高刚度;

    3)夹紧和检验点需要改进;

    4)存在过大的零件变异。

    如果再现性比重复性大,原因可能是:

    1)评价人需要更好的培训如何使用计量检测设备和数据读取方式;

    2)计量检测设备刻度盘上的刻度不清楚或校正不良;

    3)需要某种夹具帮助评价人提高使用计量检测设备的一致性。

    3.2 案例二

    作者洪涛在他的论文《MSA在电能表误差检验中的应用研究》中介绍了MSA方发在分析电能表测量误差中的具体应用过程。

    (一) MSA在电能表误差检验中具体应用

    (1) 研究方案

    在测量系统分析中,准确性特性一般可通过检验装置的量值传递或对比来解决,目前电能表制造企业都已采用。本文重点介绍测量系统的R&R分析。本设计方案和具体实施都是依托国内某知名电能表生产企业的计量测试中心的电能表误差检验系统展开的,

    具有一定的代表性。

    (二) 稳定条件的确定

    进行MSA分析前提是系统处于稳定状态。本文的研究涉及的稳定性包括两个方面:一是检验装置的稳定性,二是电能表的稳定性。综合起来就是电能表误差检验系统的稳定性。方案选择了7块电能表和3个检验装置作为研究对象。对于稳定性的研究,用标准试验室的标准装置(误差等级为0.01级,中国科学研究院比对校准)测试所选7块表的0.1Ib点误差:每块表测试5次,每次读取10个数据,共取得35组350个数据,每次测试前预热十分钟。整个试验是在标准试验室进行的,试验的温度都是严格控制在20±3℃以内。

    试验所取得7块表的数据便是其真值,对数据修约后进行分析,做出Xbar- R控制图,如下图所示,进行分析和判定,发现2号表的误差不稳定,有多个均值统计量和极差统计量超出控制限,淘汰2号表用剩下的6块表做剩下的试验和研究。

    采用同样的方法,对三台检验装置进行稳定性测试和判定,结果3台检验装置均符合要求。

    (三) 重复性和再现性试验及研究

    由于现在的电能表误差检验系统已经实现了测试、读数、计算、显示的自动化,人的影响因素已经消除,针对电能表误差检验系统而言,重复性是指在用同一检验装置检测同一批次电能表时,测试结果之间的一致程度。再现性是指用不同检验装置检测同一批次电能表时,测试...

  • ?

    全球100款大数据工具汇总

    邢德地

    展开

    1、 Talend Open Studio

    是第一家针对的数据集成工具市场的ETL(数据的提取Extract、传输Transform、载入Load)开源软件供应商。Talend的下载量已超过200万人次,其开源软件提供了数据整合功能。其用户包括美国国际集团(AIG)、康卡斯特、电子港湾、通用电气、三星、Ticketmaster和韦里逊等企业组织。

    2、DYSON

    探码科技自主研发的DYSON智能分析系统,可以完整的实现大数据的采集、分析、处理。DYSON智能分析系统专业针对互联网数据抓取、处理、分析,挖掘。可以灵活迅速地抓取网页上散乱分布的信息,并通过强大的处理功能,准确挖掘出所需数据,是目前使用人数最多的网页采集工具.

    3、YARN

    一种新的Hadoop资源管理器,它是一个通用资源管理系统,可为上层应用提供统一的资源管理和调度,解决了旧MapReduce框架的性能瓶颈。它的基本思想是把资源管理和作业调度/监控的功能分割到单独的守护进程。

    4、Mesos

    由加州大学伯克利分校的AMPLab首先开发的一款开源群集管理软件,支持Hadoop、ElasticSearch、Spark、Storm 和Kafka等架构。对数据中心而言它就像一个单一的资源池,从物理或虚拟机器中抽离了CPU,内存,存储以及其它计算资源, 很容易建立和有效运行具备容错性和弹性的分布式系统。

    5、Datale

    由探码科技研发的一款基于Hadoop的大数据平台开发套件,RAI大数据应用平台架构。

    6、 Ambari

    作为Hadoop生态系统的一部分,提供了基于Web的直观界面,可用于配置、管理和监控Hadoop集群。目前已支持大多数Hadoop组件,包括HDFS、MapReduce、Hive、Pig、 Hbase、Zookeper、Sqoop和Hcatalog等。

    7、ZooKeeper

    一个分布式的应用程序协调服务,是Hadoop和Hbase的重要组件。它是一个为分布式应用提供一致性服务的工具,让Hadoop集群里面的节点可以彼此协调。ZooKeeper现在已经成为了 Apache的顶级项目,为分布式系统提供了高效可靠且易于使用的协同服务。

    8、Thrift

    在2007年facebook提交Apache基金会将Thrift作为一个开源项目,对于当时的facebook来说创造thrift是为了解决facebook系统中各系统间大数据量的传输通信以及系统之间语言环境不同需要跨平台的特性。

    9、Chukwa

    监测大型分布式系统的一个开源数据采集系统。建立在HDFS/MapReduce框架之上并继承了Hadoop的可伸缩性和可靠性,可以收集来自大型分布式系统的数据,用于监控。它还包括灵活而强大的显示工具用于监控、分析结果。

    10、Lustre

    一个大规模的、安全可靠的、具备高可用性的集群文件系统,它是由SUN公司开发和维护的。该项目主要的目的就是开发下一代的集群文件系统,目前可以支持超过10000个节点,数以PB的数据存储量。

    11、HDFS

    Hadoop Distributed File System,简称HDFS,是一个分布式文件系统。HDFS是一个高度容错性的系统,适合部署在廉价的机器上。HDFS能提供高吞吐量的数据访问,非常适合大规模数据集上的应用。

    12、GlusterFS

    一个集群的文件系统,支持PB级的数据量。GlusterFS 通过RDMA和TCP/IP方式将分布到不同服务器上的存储空间汇集成一个大的网络化并行文件系统。

    13、Alluxio

    前身是Tachyon,是以内存为中心的分布式文件系统,拥有高性能和容错能力,能够为集群框架(如Spark、MapReduce)提供可靠的内存级速度的文件共享服务。

    14、Ceph

    新一代开源分布式文件系统,主要目标是设计成基于POSIX的没有单点故障的分布式文件系统,提高数据的容错性并实现无缝的复制。

    15、PVFS

    一个高性能、开源的并行文件系统,主要用于并行计算环境中的应用。PVFS特别为超大数量的客户端和服务器端所设计,它的模块化设计结构可轻松的添加新的硬件和算法支持。

    16、QFS

    Quantcast File System (QFS) 是一个高性能、容错好、分布式的文件系统,用于开发支持 MapReduce处理或者需要顺序读写大文件的应用。

    17、 Logstash

    一个应用程序日志、事件的传输、处理、管理和搜索的平台。可以用它来统一对应用程序日志进行收集管理,提供了Web接口用于查询和统计。

    18、Scribe

    Scribe是Facebook开源的日志收集系统,它能够从各种日志源上收集日志,存储到一个中央存储系统(可以是NFS,分布式文件系统等)上,以便于进行集中统计分析处理。

    19、Flume

    Cloudera提供的一个高可用的、高可靠的、分布式的海量日志采集、聚合和传输的系统。Flume支持在日志系统中定制各类数据发送方,用于收集数据。同时,Flume支持对数据进行简单处理,并写入各种数据接受方(可定制)。

    20、RabbitMQ

    一个受欢迎的消息代理系统,通常用于应用程序之间或者程序的不同组件之间通过消息来进行集成。RabbitMQ提供可靠的应用消息发送、易于使用、支持所有主流操作系统、支持大量开发者平台。

    21、ActiveMQ

    Apache出品,号称“最流行的,最强大”的开源消息集成模式服务器。ActiveMQ特点是速度快,支持多种跨语言的客户端和协议,其企业集成模式和许多先进的功能易于使用,是一个完全支持JMS1.1和J2EE 1.4规范的JMS Provider实现。

    22、Kafka

    一种高吞吐量的分布式发布订阅消息系统,它可以处理消费者规模网站中的所有动作流数据,目前已成为大数据系统在异步和分布式消息之间的最佳选择。

    23、Spark

    一个高速、通用大数据计算处理引擎。拥有Hadoop MapReduce所具有的优点,但不同的是Job的中间输出结果可以保存在内存中,从而不再需要读写HDFS,因此Spark能更好地适用于数据挖掘与机器学习等需要迭代的MapReduce的算法。它可以与Hadoop和Apache Mesos一起使用,也可以独立使用。

    24、Kinesis

    可以构建用于处理或分析流数据的自定义应用程序,来满足特定需求。Amazon Kinesis Streams 每小时可从数十万种来源中连续捕获和存储数TB数据,如网站点击流、财务交易、社交媒体源、IT日志和定位追踪事件。

    25、 Hadoop

    一个开源框架,适合运行在通用硬件,支持用简单程序模型分布式处理跨集群大数据集,支持从单一服务器到上千服务器的水平scale up。Apache的Hadoop项目已几乎与大数据划上了等号,它不断壮大起来,已成为一个完整的生态系统,拥有众多开源工具面向高度扩展的分布式计算。高效、可靠、可伸缩,能够为你的数据存储项目提供所需的YARN、HDFS和基础架构,并且运行主要的大数据服务和应用程序。

    26、Spark Streaming

    实现微批处理,目标是很方便的建立可扩展、容错的流应用,支持Java、Scala和Python,和Spark无缝集成。Spark Streaming可以读取数据HDFS,Flume,Kafka,Twitter和ZeroMQ,也可以读取自定义数据。

    27、Trident

    是对Storm的更高一层的抽象,除了提供一套简单易用的流数据处理API之外,它以batch(一组tuples)为单位进行处理,这样一来,可以使得一些处理更简单和高效。

    28、Flink

    于今年跻身Apache顶级开源项目,与HDFS完全兼容。Flink提供了基于Java和Scala的API,是一个高效、分布式的通用大数据分析引擎。更主要的是,Flink支持增量迭代计算,使得系统可以快速地处理数据密集型、迭代的任务。

    29、Samza

    出自于LinkedIn,构建在Kafka之上的分布式流计算框架,是Apache顶级开源项目。可直接利用Kafka和Hadoop YARN提供容错、进程隔离以及安全、资源管理。

    30、Storm

    Storm是Twitter开源的一个类似于Hadoop的实时数据处理框架。编程模型简单,显著地降低了实时处理的难度,也是当下最人气的流计算框架之一。与其他计算框架相比,Storm最大的优点是毫秒级低延时。

    31、Yahoo S4 (Simple Scalable Streaming System)

    是一个分布式流计算平台,具备通用、分布式、可扩展的、容错、可插拔等特点。程序员可以很容易地开发处理连续无边界数据流(continuous unbounded streams of data)的应用。它的目标是填补复杂专有系统和面向批处理开源产品之间的空白,并提供高性能计算平台来解决并发处理系统的复杂度。

    32、HaLoop

    是一个Hadoop MapReduce框架的修改版本,其目标是为了高效支持 迭代,递归数据 分析任务,如PageRank,HITs,K-means,sssp等。

    33、Presto

    是一个开源的分布式SQL查询引擎,适用于交互式分析查询,可对250PB以上的数据进行快速地交互式分析。Presto的设计和编写是为了解决像Facebook这样规模的商业数据仓库的交互式分析和处理速度的问题。Facebook称Presto的性能比诸如Hive和MapReduce要好上10倍有多。

    34、 Drill

    于2012年8月份由Apache推出,让用户可以使用基于SQL的查询,查询Hadoop、NoSQL数据库和云存储服务。它能够运行在上千个节点的服务器集群上,且能在几秒内处理PB级或者万亿条的数据记录。它可用于数据挖掘和即席查询,支持一系列广泛的数据库,包括HBase、MongoDB、MapR-DB、HDFS、MapR-FS、亚马逊S3、Azure Blob Storage、谷歌云存储和Swift。

    35、Phoenix

    是一个Java中间层,可以让开发者在Apache HBase上执行SQL查询。Phoenix完全使用Java编写,并且提供了一个客户端可嵌入的JDBC驱动。Phoenix查询引擎会将SQL查询转换为一个或多个HBase scan,并编排执行以生成标准的JDBC结果集。

    36、Pig

    是一种编程语言,它简化了Hadoop常见的工作任务。Pig可加载数据、转换数据以及存储最终结果。Pig最大的作用就是为MapReduce框架实现了一套shell脚本 ,类似我们通常熟悉的SQL语句。

    37、Hive

    是基于Hadoop的一个数据仓库工具,可以将结构化的数据文件映射为一张数据库表,并提供简单的sql查询功能,可以将sql语句转换为MapReduce任务进行运行。 其优点是学习成本低,可以通过类SQL语句快速实现简单的MapReduce统计,不必开发专门的MapReduce应用,十分适合数据仓库的统计分析。

    38、SparkSQL

    前身是Shark,SparkSQL抛弃原有Shark的代码并汲取了一些优点,如内存列存储(In-Memory Columnar Storage)、Hive兼容性等。由于摆脱了对Hive的依赖性,SparkSQL无论在数据兼容、性能优化、组件扩展方面都得到了极大的方便。

    39、Stinger

    原来叫Tez,是下一代Hive,由Hortonworks主导开发,运行在YARN上的DAG计算框架。某些测试下,Stinger能提升10倍左右的性能,同时会让Hive支持更多的SQL。

    40、Tajo

    目的是在HDFS之上构建一个可靠的、支持关系型数据的分布式数据仓库系统,它的重点是提供低延迟、可扩展的ad-hoc查询和在线数据聚集,以及为更传统的ETL提供工具。

    41、Impala

    Cloudera 声称,基于SQL的Impala数据库是“面向Apache Hadoop的领先的开源分析数据库”。它可以作为一款独立产品来下载,又是Cloudera的商业大数据产品的一部分。Cloudera Impala 可以直接为存储在HDFS或HBase中的Hadoop数据提供快速、交互式的SQL查询。

    42、 Elasticsearch

    是一个基于Lucene的搜索服务器。它提供了一个分布式、支持多用户的全文搜索引擎,基于RESTful web接口。Elasticsearch是用Java开发的,并作为Apache许可条款下的开放源码发布,是当前流行的企业级搜索引擎。设计用于云计算中,能够达到实时搜索、稳定、可靠、快速、安装使用方便。

    43、Solr

    基于Apache Lucene,是一种高度可靠、高度扩展的企业搜索平台。知名用户包括eHarmony、西尔斯、StubHub、Zappos、百思买、AT&T、Instagram、Netflix、彭博社和Travelocity。

    44、Shark

    即Hive on Spark,本质上是通过Hive的HQL解析,把HQL翻译成Spark上的RDD操作,然后通过Hive的metadata获取数据库里的表信息,实际HDFS上的数据和文件,会由Shark获取并放到Spark上运算。Shark的特点就是快,完全兼容Hive,且可以在shell模式下使用rdd2sql()这样的API,把HQL得到的结果集,继续在scala环境下运算,支持自己编写简单的机器学习或简单分析处理函数,对HQL结果进一步分析计算。

    45、Lucene

    基于Java的Lucene可以非常迅速地执行全文搜索。据官方网站声称,它在现代硬件上每小时能够检索超过150GB的数据,它拥有强大而高效的搜索算法。

    46、Terracotta

    声称其BigMemory技术是“世界上首屈一指的内存中数据管理平台”,支持简单、可扩展、实时消息,声称在190个国家拥有210万开发人员,全球1000家企业部署了其软件。

    47、 Ignite

    是一种高性能、整合式、分布式的内存中平台,可用于对大规模数据集执行实时计算和处理,速度比传统的基于磁盘的技术或闪存技术高出好几个数量级。该平台包括数据网格、计算网格、服务网格、流媒体、Hadoop加速、高级集群、文件系统、消息传递、事件和数据结构等功能。

    48、GemFire

    Pivotal宣布它将开放其大数据套件关键组件的源代码,其中包括GemFire内存中NoSQL数据库。它已向Apache软件基金会递交了一项提案,以便在“Geode”的名下管理GemFire数据库的核心引擎。

    49、 GridGain

    由Apache Ignite驱动的GridGrain提供内存中数据结构,用于迅速处理大数据,还提供基于同一技术的Hadoop加速器。

    50、MongoDB

    是一个基于分布式文件存储的数据库。由C++...

  • ?

    大数据是什么?超全的大数据分析工具

    闪客

    展开

    大数据是什么?大数据处理分析的工具有哪些?不管是即将学习大数据的人亦或是转型向学大数据的人都想要了解的。

    1,什么是大数据

    简言之,从各种各样类型的数据中,快速获得有价值信息的能力,就是大数据技术。

    2,大数据最核心的价值

    大数据最核心的价值就是在于对于海量数据进行存储和分析。相比起现有的其他技术而言,大数据的“廉价、迅速、优化”这三方面的综合成本是最优的。

    3,大数据处理分析的六大最好工具

    一、 Apache Hadoop

    Hadoop 是一个能够对大量数据进行分布式处理的软件框架。Hadoop 是可靠的,因为它假设计算元素和存储会失败,因此它维护多个工作数据副本,确保能够针对失败的节点重新分布处理。Hadoop 是高效的,因为它以并行的方式工作,通过并行处理加快处理速度。Hadoop 还是可伸缩的,能够处理 PB 级数据。此外,Hadoop 依赖于社区服务器,因此它的成本比较低,任何人都可以使用。

    Hadoop是一个能够让用户轻松架构和使用的分布式计算平台。用户可以轻松地在Hadoop上开发和运行处理海量数据的应用程序。它主要有以下几个优点:

    ⒈高可靠性。Hadoop按位存储和处理数据的能力值得人们信赖。

    ⒉高扩展性。Hadoop是在可用的计算机集簇间分配数据并完成计算任务的,这些集簇可以方便地扩展到数以千计的节点中。

    ⒊高效性。Hadoop能够在节点之间动态地移动数据,并保证各个节点的动态平衡,因此处理速度非常快。

    ⒋高容错性。Hadoop能够自动保存数据的多个副本,并且能够自动将失败的任务重新分配。

    Hadoop带有用 Java 语言编写的框架,因此运行在 Linux 生产平台上是非常理想的。Hadoop 上的应用程序也可以使用其他语言编写,比如 C++。

    二、HPCC

    HPCC,High Performance Computing and Communications(高性能计算与通信)的缩写。1993年,由美国科学、工程、技术联邦协调理事会向国会提交了“重大挑战项目:高性能计算与 通信”的报告,也就是被称为HPCC计划的报告,即美国总统科学战略项目,其目的是通过加强研究与开发解决一批重要的科学与技术挑战问题。HPCC是美国 实施信息高速公路而上实施的计划,该计划的实施将耗资百亿美元,其主要目标要达到:开发可扩展的计算系统及相关软件,以支持太位级网络传输性能,开发千兆 比特网络技术,扩展研究和教育机构及网络连接能力。

    该项目主要由五部分组成:

    1、高性能计算机系统(HPCS),内容包括今后几代计算机系统的研究、系统设计工具、先进的典型系统及原有系统的评价等;

    2、先进软件技术与算法(ASTA),内容有巨大挑战问题的软件支撑、新算法设计、软件分支与工具、计算计算及高性能计算研究中心等;

    3、国家科研与教育网格(NREN),内容有中接站及10亿位级传输的研究与开发;

    4、基本研究与人类资源(BRHR),内容有基础研究、培训、教育及课程教材,被设计通过奖励调查者-开始的,长期 的调查在可升级的高性能计算中来增加创新意识流,通过提高教育和高性能的计算训练和通信来加大熟练的和训练有素的人员的联营,和来提供必需的基础架构来支 持这些调查和研究活动;

    5、信息基础结构技术和应用(IITA ),目的在于保证美国在先进信息技术开发方面的领先地位。

    三、Storm

    Storm是自由的开源软件,一个分布式的、容错的实时计算系统。Storm可以非常可靠的处理庞大的数据流,用于处理Hadoop的批量数据。 Storm很简单,支持许多种编程语言,使用起来非常有趣。Storm由Twitter开源而来,其它知名的应用企业包括Groupon、淘宝、支付宝、阿里巴巴、乐元素、Admaster等等。

    Storm有许多应用领域:实时分析、在线机器学习、不停顿的计算、分布式RPC(远过程调用协议,一种通过网络从远程计算机程序上请求服务)、 ETL(Extraction-Transformation-Loading的缩写,即数据抽取、转换和加载)等等。Storm的处理速度惊人:经测 试,每个节点每秒钟可以处理100万个数据元组。Storm是可扩展、容错,很容易设置和操作。

    四、Apache Drill

    为了帮助企业用户寻找更为有效、加快Hadoop数据查询的方法,Apache软件基金会近日发起了一项名为“Drill”的开源项目。Apache Drill 实现了 Google's Dremel.

    据Hadoop厂商MapR Technologies公司产品经理Tomer Shiran介绍,“Drill”已经作为Apache孵化器项目来运作,将面向全球软件工程师持续推广。

    该项目将会创建出开源版本的谷歌Dremel Hadoop工具(谷歌使用该工具来为Hadoop数据分析工具的互联网应用提速)。而“Drill”将有助于Hadoop用户实现更快查询海量数据集的目的。

    “Drill”项目其实也是从谷歌的Dremel项目中获得灵感:该项目帮助谷歌实现海量数据集的分析处理,包括分析抓取Web文档、跟踪安装在Android Market上的应用程序数据、分析垃圾邮件、分析谷歌分布式构建系统上的测试结果等等。

    通过开发“Drill”Apache开源项目,组织机构将有望建立Drill所属的API接口和灵活强大的体系架构,从而帮助支持广泛的数据源、数据格式和查询语言。

    五、RapidMiner

    RapidMiner是世界领先的数据挖掘解决方案,在一个非常大的程度上有着先进技术。它数据挖掘任务涉及范围广泛,包括各种数据艺术,能简化数据挖掘过程的设计和评价。

    功能和特点

    免费提供数据挖掘技术和库

    100%用Java代码(可运行在操作系统)

    数据挖掘过程简单,强大和直观

    内部XML保证了标准化的格式来表示交换数据挖掘过程

    可以用简单脚本语言自动进行大规模进程

    多层次的数据视图,确保有效和透明的数据

    图形用户界面的互动原型

    命令行(批处理模式)自动大规模应用

    Java API(应用编程接口)

    简单的插件和推广机制

    强大的可视化引擎,许多尖端的高维数据的可视化建模

    400多个数据挖掘运营商支持

    耶鲁大学已成功地应用在许多不同的应用领域,包括文本挖掘,多媒体挖掘,功能设计,数据流挖掘,集成开发的方法和分布式数据挖掘。

    六、 Pentaho BI

    Pentaho BI 平台不同于传统的BI 产品,它是一个以流程为中心的,面向解决方案(Solution)的框架。其目的在于将一系列企业级BI产品、开源软件、API等等组件集成起来,方便商务智能应用的开发。它的出现,使得一系列的面向商务智能的独立产品如Jfree、Quartz等等,能够集成在一起,构成一项项复杂的、完整的商务智能解决方案。

    Pentaho BI 平台,Pentaho Open BI 套件的核心架构和基础,是以流程为中心的,因为其中枢控制器是一个工作流引擎。工作流引擎使用流程定义来定义在BI 平台上执行的商业智能流程。流程可以很容易的被定制,也可以添加新的流程。BI 平台包含组件和报表,用以分析这些流程的性能。目前,Pentaho的主要组成元素包括报表生成、分析、数据挖掘和工作流管理等等。这些组件通过 J2EE、WebService、SOAP、HTTP、Java、JavaScript、Portals等技术集成到Pentaho平台中来。 Pentaho的发行,主要以Pentaho SDK的形式进行。

    Pentaho SDK共包含五个部分:Pentaho平台、Pentaho示例数据库、可独立运行的Pentaho平台、Pentaho解决方案示例和一个预先配制好的 Pentaho网络服务器。其中Pentaho平台是Pentaho平台最主要的部分,囊括了Pentaho平台源代码的主体;Pentaho数据库为 Pentaho平台的正常运行提供的数据服务,包括配置信息、Solution相关的信息等等,对于Pentaho平台来说它不是必须的,通过配置是可以用其它数据库服务取代的;可独立运行的Pentaho平台是Pentaho平台的独立运行模式的示例,它演示了如何使Pentaho平台在没有应用服务器支持的情况下独立运行;Pentaho解决方案示例是一个Eclipse工程,用来演示如何为Pentaho平台开发相关的商业智能解决方案。

    Pentaho BI 平台构建于服务器,引擎和组件的基础之上。这些提供了系统的J2EE 服务器,安全,portal,工作流,规则引擎,图表,协作,内容管理,数据集成,分析和建模功能。这些组件的大部分是基于标准的,可使用其他产品替换之。

    4. 大数据特点

    第一,数据体量巨大。从TB级别,跃升到PB级别。

    第二,数据类型繁多,如前文提到的网络日志、视频、图片、地理位置信息,等等。

    第三,价值密度低。以视频为例,连续不间断监控过程中,可能有用的数据仅仅有一两秒。

    第四,处理速度快。1秒定律。最后这一点也是和传统的数据挖掘技术有着本质的不同。物联网、云计算、移动互联网、车联网、手机、平板电脑、PC以及遍布地球各个角落的各种各样的传感器,无一不是数据来源或者承载的方式。

    如果对于大数据还有更多的疑问,可以持续关注作者,也可以留言或者私信问题。

可靠性数据分析软件

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP