- ?
《穹顶之下》那些常见数据分析图表
kaiserin
展开
《穹顶之下》是一部由柴静自费100万左右拍摄的雾霾深度调查纪录片,记录片于2015年2月28日播出。通过视频网站、社交网络等共同的力量,让数千万乃至上亿人再次认识到雾霾的危害,并且形象化的对雾霾的构成做了解读,并且通过柴静的行为来告诉我们自己可以做些什么。
当然,这不是数据小兵今天要说的,除了重新认识雾霾之外,我同样关心的是这段视频中露出的数据分析图表,简单来说,视频中的柱图、饼图、线图我们在数据分析报告中经常见到,是最基础、最多见的图表,但就是这些简单常见的图表,却带给我们完全不一样的易懂和震撼。
线形图
线图或折线图是使用最频繁图表之一,制作简单、容易理解,最能清楚的表达上升、下降、波动和保持不变等趋势,尤其是时间序列类的数据。
1、单线
清晰的表达出机动车辆数量逐年递增,上升趋势明显。
一条波动的单线,几个高峰,几个低谷,某些时段集中表现为较高状态。
2、多线
有2条以上折现时,就产生了对比和关联关系,尤其是关联关系包含的信息量更为丰富。
2条不同趋势的折线,尤其是二者本来还有一定正向关联关系,但结果是二者最后的趋势相反,这中间体现了人为能动作用的强大。
很多条线,用红色突出显示其中一条单线,突出强调的对比手法,效果很明显。
柱形图
柱形图用于显示一段时间内的数据变化或显示各项之间的比较情况的一种数据图表,几乎在各类分析报告中都能看到柱形图。它的强项有两个,第一是对比比较,第二是趋势。
每个对象一根柱子,想强调和突出表达就用对比色来标注。比较的效果很明显,一眼就看透。使用的技巧是按照柱子的高度从高到低,或从低到高排列,这样对比的效果会更加明显。
可以把这幅图理解为柱形图的特例,一般上业内也叫条形图,把柱形图横着看就是条形图了。它也是对比效果的高手,如果用主题对象的图形辅助一下的话,这种对比效果会更好。
饼图
饼给人的理解就像是蛋糕,如果你想表达成分占比,饼图最好的选择。制作饼图和浏览饼图时,注意配合理解一下百分比。最为关键的是,建议大家轻易不要用3维立体饼图,因为立体后,百分比的对比效果会下降。
1、单个饼图
两种成分的对比,不同的颜色,悬殊的分块,不用过多语言去解释,眼见就是结果。
2、多个饼图
两个以上饼图同时出现时,眼睛需要左右上下、移动对比。建议饼的个数不要超过2个,太多了,眼睛看不过来。
面积图
面积图强调数量随时间而变化的程度,也可用于引起人们对总值趋势的注意。面积图看上去就是线图带着底下的面积,它具备线图的趋势感,同时还能强烈的引起人们的注意。好大一片的感觉总是让人产生联想。
边沿的线代表波动,时有峰值,红色的面积给人真实。
两个不同面积的对比,配以对比强烈的颜色,孰大孰小一眼见高低。
穹顶之下,柴静是否孤单只有她自己能感受到,而我们能做的,除了学习一场精彩演讲带给我们的感知之外,或许还有更多,至少你分析报告中的图表能窥探一二。
本文由 数据小兵 原创,未经作者许可,请勿转载。百度搜索“数据小兵”可访问作者博客,
- ?
千万级的数据量,如何高性能实现展示分析?
Nikita
展开
日常一提数据分析和可视化,就想到这个工具操作要多简单易用,图表要多美多炫,然而总是忽略背后的数据支撑。
excel 几十万行数据就卡死崩,谈何数据透视表、可视化?近千万行的数据,订单提交数据库,sql sever处理要5分多钟,如果频繁入库/取数的话.....
要知道,为了支撑起业务人员的数据分析,以及日常不考虑计算逻辑和技术难度,IT人员也是要花费很大的心血和精力啊(心疼运维人员n秒)。
随着公司业务的发展,数据量变大是必然的事实。那么,数据部门要做分析,业务部门要看报表,要跑数据,要用BI,大数据量(千万级及以上)的分析,性能该如何优化?
这里借某公司的真实案例,来阐述一下方案。
----------------------------------
作为公司的科技部门人员,经常听到业务部门对自己使用的数据库各种吐槽:
竟然存放在mongoDB中啊,震惊(ΩДΩ)。
数据库慢慢熟悉了还好啊,但是现在每天的数据量越来越大,而且还在增加啊,增加大家很开心,然而数据库并不开心啊,简单的查询统计10多分钟还出不来结果,更不用说有稍微复杂点的统计分析了。
我天天找DBA优化啊,然而并没有什么水花。
数据量还在不断增长,到现在都上亿啦,全量查询统计根本出不来结果啊。
... ...
最终业务人员找到科技部门提需求要弄个BI系统给处理下。
对mongodb瞄了一大通,这就是个业务库。那直接对接mongodb自然不行,速度慢不说,mongodb挂了,分析系统也瘫了。自然就想到了使用中间库,emm mysql oracle 倒是有,可以跑调度抽过来,但是速度依旧不快呢,还要花功夫优化,性价比不高。公司有自己的hadoop平台,将数据抽过来再对接倒是可以,但是要花很大精力跑调度,而且这个数据库不能随意给这个业务部门提供,万一玩挂了可就得不偿失。假设有个具备离线数据存储功能的BI工具,岂不美哉。
于是将市面上有离线数据存储功能的BI工具翻了个遍。期望找到个性能好,可以支持大数据量数据分析的BI工具。
Tableau的hyper功能看起来OK,经不起实际使用,数据量过了亿,等了好久数据抽不好,pass;
其他某BI工具有mpp离线存储,看起来很棒,还能横向扩展,不错。抱有最大期望的用,结果数据量一上亿,直接崩了,崩了,pass;
另一个BI工具去看了看,咦,数据是放在vertica里面的......
后来,找到了FineBI的分布式计算引擎方案,拿的『定制的 Alluxio』作为分布式内存存储框架,内存存储有数据安全性的担心,所以持久化层存储用了HDFS。为了数据分析嘛,自然是列式存储的。计算核心则以熟知的Spark,加上自研算法来处理的。使用熟知的zookeeper整合框架,并用于调度通信。
分布式嘛,横向扩展自然不在话下。而列式存储、并行内存计算、计算本地化加上高性能算法,在FineBI中数据展示速度超快。有意思的是其计算本地化的操作,能减少不必要的shuffle,节省数据传输的消耗,提升数据计算速度。
以下记录利用FineBI4.1工具的系统建设过程。
一、需求分析
针对以上的需求,可以预估到,18年内,常用分析预计最大数据量会达到4.7kw,不常用分析会达到3亿到4亿(包含淡季),数据总的体量最多会达到100G。后面的情况难以预估,就需要系统可横向扩展节点。
二、方案描述
1.系统架构
根据官方推荐,将FineBI的web应用端与数据存储的分布式引擎放在一个机器上(处于安全考虑,也可以分开。这里不涉及太多部门使用,放一起即可),架构如下所示。
架构图难以理解的话,可以看看灵魂画手的杰作~
结合分布式引擎说明的技术原理,将各个机器再细分化各个组件的作用。
以上,将系统架构规划完成,即可具体完成系统。
2.完成从MongoDB取数
在使用BI工具对接MongoDB的时候,使用MongoDB的BI连接器。
感兴趣可以看:MongoDB Download Center
方案原理:mongodb是非结构的数据库,而要想BI来连接,通过建模的方式取表,拆表,建模来分析。通过MONGODB CONNECTOR FOR BI连接器的方式,使用mysql的JDBC驱动来获取数据。
实现过程:
第一步:安装MONGODB CONNECTOR FOR BI
从官网选择版本:MongoDB Download Center
第二步:生成DRDL文件
mongodrdl是生成该文件的主命令。通过添加monogdb的相关参数来获取其中的表生成drdl文件。从官方文档上我们可以找到生成DRDL文件命令的范式:
1 mongodrdl --host myhost.example:27017 \2 --username dbUser \3 --password myPassword \4 --db reports \5 --authenticationDatabase admin \6 --out schema.drdl
范式说明:
--host 是mongodb的ip+端口号,通常可为127.0.0.1:27017--username 是mongodb的用户,需具备相关的数据权限--password 是username的密码--db 是要生成DRDL的数据库实例名--authenticationDatabase 是指定创建用户的数据库。即username创建时被指定到的数据库名。--out 是DRDL输出文件定义。值使用.drdl的文件即可。
第三步:启动连接器,连接上monogdb
启动连接器的主命令服务是mongosqld,由于mongodb开启用户认证了(auth=true)。从官方文档上可知,连接器的启动需要使用-auth参数,再使用auth参数的情况下,mysql驱动来取数就需要SSLl加密认证。
所以第一步需要配置mongosqld的SSL认证;才能启动连接器来取数!!!!!!!!!!这一步神坑,也是踩了多少坑,才找到的解决办法。
此处认证关系是FineBi端的mysql连接与mongosqld的连接之间的SSL认证。在认证时,只需要配置单向SSL的认证即可(mongosqld认证FineBI的连接)。
(1)生成SSL认证文件
SSL认证文件通常采用openSSL来生成,先看看是否安装了openSSL;执行命令:
rpm -qa|grep -i openssl
如安装了会返回信息,未安装需要自行安装OpenSSL。
采用以下命令来生成证书:(由于是测试,就直接自己生成证书,密钥)
openssl req -newkey rsa:2048 -new -x509 -days 365 -nodes -out mongodb-cert.crt -keyout mongodb-cert.key
命令返回会让填写一些值,在后面填写即可。
一般情况下,文件会生成到你所使用的linux用户的要根目录下:比如我用的root用户,就到/root下面查找。
再使用以下命令,将key合到.pem的文件里。
cat mongodb-cert.key mongodb-cert.crt >mongodb.pem
将该文件移动/etc/ssl下面用于验证使用:
mv mongodb.pem /etc/ssl
(2)启动连接器&SSL
再来看官方文档,从所有的参数命令里面,找一找需要的参数;得出以下的范式,在bin目录下启动即可。
mongosqld --auth --sslMode --sslPEMKeyFile --sslAllowInvalidCertificates --defaultAuthSource --mongo-uri --mongo-username --mongo-password --mongo-authenticationSource --schema
说明:
--auth 是开启用户认证的参数,默认值是true--sslMode是开启SSL的标识,如开启可以选择值为“requireSSL”--sslPEMKeyFile是SSL认证文件,一般为.pem结尾的文件;单向认证的时候。--sslAllowInvalidCertificates--defaultAuthSource是mongosqld使用username指向mongodb的有权限的库,默认值是admin--mongo-uri是mongodb的host,一般为ip+端口号--mongo-usrname是drdl生成的用户名--mongo-password是drdl生成的密码--mongo-authenticationSource指定用户的创建库--schema是要连接的drdl文件。
注:一般还是要用nohup 的命令来生成,保证shell断掉,连接器依然可用。
第四步:启动FineBI连接到连接器上
启动FineBI,打开FineBI>数据配置>数据连接:添加数据连接选择mysql,配置如下:
连接名:mongodbURL:jdbc:mysql://127.0.0.1:3307/test?ssl-key=/etc/ssl/mongodb.pem用户名:密码:注:URL:jdbc:mysql://ip+3307/dbname?ssl-key=xx.pem,后面ssl-key是ssl参数
点击测试连接即可。
过程坑点:mongodb的BI连接器神坑,官网文档不多,踩过了几脚坑。
(1)mongosqld按ssl认证开启成功,打印也不错,但是BI连接的时候,还是抛错1043 SQLSTATE: 08S01 (ER_HANDSHAKE_ERROR):this server only allows SSL xxxxx该抛错是mysql抛出来的,握手不良的错误。按道理SSL已经开启了,不应该是这样。后来查了mysql的文档,mysql5.5以上的版本才支持SSL;更换新的driver驱动,使用的是5.1.44完全没问题的。
(2)BI连接的时候抛错 handshake error: ERROR 1043 (08S01): error performing authentication: unable to authenticate conversation 0: unable to authenticate using mechanism "SCRAM-SHA-1": (AuthenticationFailed) Authentication failed.
该抛错的意思,使用“SCRAM-SHA-1”的认证方式,没有认证成功。SCRAM-SHA-1是指用户名密码的方式,这里看是不是用户名/密码错误,注意mongosqld启动时的使用的用户名/密码
(3)一定要开启SSL认证啊!!!
(4)期间有设计器无故死掉的情况,发现是由于内存不足导致。记得空闲内存要足够!!
三.系统效果
1.数据更新
(1) 单个表先全量抽取,之后每天对单表依据时间戳,做增量增加。其中有错误数据做增量删除即可。
(2)有些内部使用的实时性较高的表,设定每2小时更新一次,从上午9点到下午6点。直接从业务库抽取其实是有风险的,当时数据库压力大,抽取比较慢,因此这部分仅作为非重点用户需求场景。
2.数据展示速度
做了一个简单的依据时间的group by,时间在1s之内,翻页速度也很快。
至此,对接mongodb完成,一个用户可以随便玩的系统就好了。即使偶尔mongodb发疯修整,有离线数据在,也不担心业务部门来嚷嚷了。而且速度超快,体验很棒~
最后
如果你也在寻求一个高性能展示分析、数据分析的BI工具的话,不妨尝试下FineBI。
- ?
干货 | 这是一份完整的大数据处理技术总结与分析
黑美人
展开
一 数据分析处理需求分类
1 事务型处理
在我们实际生活中,事务型数据处理需求非常常见,例如:淘宝网站交易系统、12306网站火车票交易系统、超市POS系统等都属于事务型数据处理系统。
这类系统数据处理特点包括以下几点:
一是事务处理型操作都是细粒度操作,每次事务处理涉及数据量都很小。
二是计算相对简单,一般只有少数几步操作组成,比如修改某行的某列;
三是事务型处理操作涉及数据的增、删、改、查,对事务完整性和数据一致性要求非常高。
四是事务性操作都是实时交互式操作,至少能在几秒内执行完成;
五是基于以上特点,索引是支撑事务型处理一个非常重要的技术。
在数据量和并发交易量不大情况下,一般依托单机版关系型数据库,例如ORACLE、MYSQL、SQLSERVER,再加数据复制(DataGurad、 RMAN、MySQL数据复制等)等高可用措施即可满足业务需求。
在数据量和并发交易量增加情况下,一般可以采用ORALCE RAC集群方式或者是通过硬件升级(采用小型机、大型机等,如银行系统、运营商计费系统、证卷系统)来支撑。
事务型操作在淘宝、12306等互联网企业中,由于数据量大、访问并发量高,必然采用分布式技术来应对,这样就带来了分布式事务处理问题,而分布式事务处理很难做到高效,因此一般采用根据业务应用特点来开发专用的系统来解决本问题。
2 数据统计分析
数据统计主要是被各类企业通过分析自己的销售记录等企业日常的运营数据,以辅助企业管理层来进行运营决策。典型的使用场景有:周报表、月报表等固定时间提供给领导的各类统计报表;市场营销部门,通过各种维度组合进行统计分析,以制定相应的营销策略等。
数据统计分析特点包括以下几点:
一是数据统计一般涉及大量数据的聚合运算,每次统计涉及数据量会比较大。
二是数据统计分析计算相对复杂,例如会涉及大量goupby、 子查询、嵌套查询、窗口函数、聚合函数、排序等;有些复杂统计可能需要编写SQL脚本才能实现。
三是数据统计分析实时性相对没有事务型操作要求高。但除固定报表外,目前越来越多的用户希望能做做到交互式实时统计;
传统的数据统计分析主要采用基于MPP并行数据库的数据仓库技术。主要采用维度模型,通过预计算等方法,把数据整理成适合统计分析的结构来实现高性能的数据统计分析,以支持可以通过下钻和上卷操作,实现各种维度组合以及各种粒度的统计分析。
另外目前在数据统计分析领域,为了满足交互式统计分析需求,基于内存计算的数据库仓库系统也成为一个发展趋势,例如SAP的HANA平台。
3 数据挖掘
数据挖掘主要是根据商业目标,采用数据挖掘算法自动从海量数据中发现隐含在海量数据中的规律和知识。
数据挖掘主要过程是:根据分析挖掘目标,从数据库中把数据提取出来,然后经过ETL组织成适合分析挖掘算法使用宽表,然后利用数据挖掘软件进行挖掘。传统的数据挖掘软件,一般只能支持在单机上进行小规模数据处理,受此限制传统数据分析挖掘一般会采用抽样方式来减少数据分析规模。
数据挖掘的计算复杂度和灵活度远远超过前两类需求。一是由于数据挖掘问题开放性,导致数据挖掘会涉及大量衍生变量计算,衍生变量多变导致数据预处理计算复杂性;二是很多数据挖掘算法本身就比较复杂,计算量就很大,特别是大量机器学习算法,都是迭代计算,需要通过多次迭代来求最优解,例如K-means聚类算法、PageRank算法等。
因此总体来讲,数据分析挖掘的特点是:
1、数据挖掘的整个计算更复杂,一般是由多个步骤组成计算流,多个计算步骤之间存在数据交换,也就是会产生大量中间结果,难以用一条sql语句来表达。
2、计算应该能够非常灵活表达,很多需要利用高级语言编程实现。
二 大数据背景下事务型处理系统相关技术
在google、facebook、taobao等大互联网公司出现之后,这些公司注册和在线用户数量都非长大,因此该公司交易系统需要解决“海量数据+高并发+数据一致性+高可用性”的问题。
为了解决该问题,从目前资料来看,其实没有一个通用的解决方案,各大公司都会根据自己业务特点定制开发相应的系统,但是常用的思路主要包括以下几点:
(1)数据库分片,结合业务和数据特点将数据分布在多台机器上。
(2)利用缓存等机制,尽量利用内存,解决高并发时遇到的随机IO效率问题。
(3)结合数据复制等技术实现读写分离,以及提高系统可用性。
(4)大量采用异步处理机制,对应高并发冲击。
(5)根据实际业务需求,尽量避免分布式事务。
1相关系统介绍
1) 阿里CORBAR系统
阿里COBAR系统是一个基于MYSQL数据库的分布式数据库系统,属于基于分布式数据库中间件的分布式数据库系统。该系统是前身是陈思儒开发的“变形虫”系统(以前调研过),由于陈思儒离开阿里去了盛大,阿里当心“变形虫”稳定性等问题,重新开发该项目。
该系统主要采用数据库分片思路,实现了:数据拆分、读写分离、复制等功能。由于此系统由于只需要满足事务型操作即可,因此相对真正并行数据库集群(例如TeraData等),此类系统提供操作没有也不需要提供一些复杂跨库处理,因此该系统存在以下限制:
(1)不支持跨库的join、分页、排序、子查询。
(2)insert等变更语句必须包括拆分字段等。
(3)应该不支持跨机事务(以前变形虫不支持)。
说白了此类系统不具备并行计算能力,基本上相当于数据库路由器!
另外此类系统的在实际应用的关键问题是,根据什么对数据进行切分,因为切分不好会导致分布式的事务问题。
2) 阿里OceanBase系统
该系统也是淘宝为了解决高并发、大数据环境下事务型处理而定制开发的一个系统。该系统主要思路和特点如下:
(1)他们发现在实际生成环境中,每天更新的数据只占总体数据的1%不到,因此他们把数据分为:基线数据和增量更新数据。
(2)基线数据是静态数据,采用分布式存储方式进行存储。
(3)只在一台服务器上存储和处理增量更新数据,并且是在内存中存储和处理更新数据。
(4)在系统负载轻的时候,把增量更新批量合并到基线数据中。
(5)数据访问时同时访问基线数据和增量更新数据并合并。
因此这样好处是:
(1)读事务和写事务分离
(2)通过牺牲一点扩展性(写是一个单点),来避免分布式事务处理。
说明:该系统虽然能处理高并发的事务型处理,号称很牛逼,但其实也只是根据电商的事务处理来定制开发的专用系统,个人认为其技术难度小于oracle等通用型的数据库。该系统无法应用到银行或者12306等,因为其事务处理的逻辑远远比电商商品买卖处理逻辑复杂。
在目前的大数据时代,一定是基于应用定制才能找到好的解决方案!
3) 基于Hbase的交易系统
在hadoop平台下,HBASE数据库是一个分布式KV数据库,属于实时数据库范畴。支付宝目前支付记录就是存储在HBASE数据库中。
HBASE数据库接口是非SQL接口,而是KV操作接口(基于Key的访问和基于key范围的scan操作),因此HBASE数据库虽然可扩展性非常好,但是由于其接口限制导致该数据库能支持上层应用很窄。基于HBASE应用的设计中,关键点是key的设计,要根据需要支持的应用来设计key的组成。
可以认为HBASE数据库只支持作为KEY的这一列的索引。虽然目前HBASE有支持二级索引的方案,二级索引维护将会比较麻烦。
2并发和并行区别
并发是指同时执行通常不相关的各种任务,例如交易型系统典型属于高并发系统。
并行是通过将一个很大的计算任务,划分为多个小的计算任务,然后多个小计算任务的并行执行,来缩短该计算任务计算时间。
两者主要区别在于:
(1)通讯与协调方面:在并行计算中,由于多个小任务同属一个大的计算任务,因此小任务之间存在依赖关系,小任务之间需要大量通讯和协调;相反,并发中的多个任务之间基本相互独立,任务与任务之间相关性很小。
(2)容错处理方面:由于并发任务之间相互独立,某个任务执行失败并不会影响其它的任务。但是并行计算中的多个任务属于一个大任务,因此某个子任务的失败,如果不能恢复(粗粒度容错与细粒度容错),则整个任务都会失败。
3本章总结
数据量大不一定需要并行计算,虽然数据量大,数据是分布存储,但是如果每次操作基本上还是针对少量数据,因此每次操作基本上都是在一台服务器上完成,不涉及并行计算。只是需要通过数据复制、数据缓存、异步处理等方式来支撑高并发访问量
三 大数据背景下数据统计分析技术介绍
随数据量变大,和事务处理不同的是,单个统计分析涉及数据量会非常大,单个统计分析任务涉及数据会分散在多台服务器上,且由于计算量大,采用单台服务器进行计算,会导致计算时间非常长,单个统计分析任务必须采用并行计算方式来加快单个统计分析任务执行速度。
1并行查询与并行计算技术介绍
在大数据背景下的数据统计分析技术门类很多,常见的有:
n MPP并行数据库 : TeraData、GreenPlum、Vertica等。
n 基于MapReduce并行计算框架的数据仓库:
HIVE(Hadoop平台) 、Tenzing(Google公司)
n 基于Hbase的Phoenix系统
n HadoopDB系统
n EMC公司的hapt系统
n MPP分布式查询引擎: Dremel、Impala、Presto、Shard query、Citusdb。
n 基于SPARK的Shark、基于Dryad的SCOPE、基于Tez的stinger。
n 基于hadoop+index的JethroData系统
n 基于内存计算的Druid系统
这些系统都解决了海量数据下的数据统计分析的问题,并且这些系统另外一个共同特点是都提供了SQL或者类SQL接口。
为了能够较好研究这些系统,我们需要对并行查询与并行计算的相关技术做一个简要的介绍。
首先所有的系统都可以分为三个层次: 语义层、并行计算引擎层、分布式存储层。语义层提供一个编程接口让用户表达所需要计算,并负责把该计算翻译成底层并行计算引擎可以执行的执行计划,并由并行计算引擎来执行,最下面一层是分布式存储层。
对于提供类SQL接口并行计算系统,语义层可以认为是SQL解析层。
1) 语义层
SQL语言是一种声名式语言,SQL只是表达了要做什么,而没有表达怎么做。为此,SQL解析层主要作用是:将用户提交的基于SQL的统计分析请求,转化为底层计算引擎层可以执行的执行计划。也就是解决“怎么做”的问题。
SQL解析层工作主要包括两个大方面:
(1) 通过语法分析技术来理解要做什么。在关系数据库中,一般会把SQL语言分析后,形成树型结构的执行计划。
(2) 在语法分析技术上,利用各种优化技术和算法,找出一种最经济物理执行计划。
优化可以分为两个方面:一是逻辑层面优化、二是物理执行层面优化。
(1) 逻辑层优化
逻辑层面个人认为主要是因为同样表达一个分析请求,有的人SQL写的好,有的人SQL写的烂,因此在逻辑层面可以通过一些等价关系代数变换,实现查询重写,将写的比较烂的sql变换为好的写法。
比较典型优化是:“把投影和过滤下沉,先执行过滤和投影操作”,减少中间结果。
(2) 物理层优化
物理层面优化是在逻辑优化后,结合实际物理执行过程,找出最优的物理执行计划。生成物理查询计划的工作包括:
ü 增加一些操作符: 包括扫描和排序等。
ü 确定各个操作符实现算法。例如扫描是全表扫描还是利用索引;Join是采用HASH连接、索引连接、合并排序等实现算法中的那一种。
ü 确定操作符之间的数据流转方法:物化还是流水线方式。
ü 采用基于代价估算方法确定最优的物理执行计划,目前代价估算主要是以估算该物理计划需要的IO量。另外对于并行数据库,则还要考虑通讯代价,即尽量减少数据在各个机器之间的传递。
在物理层优化的代价估算过程中,代价估算需要依靠很多统计信息,如表有多大,表中相关列的值分布是什么样子等。传统数据库在数据Load过程中会事先计算好这些统计信息。并行计算中还需要考虑通讯代价。
需要指出是,由于imapla、Presto、HIVE等系统只是一个查询引擎,它们可以直接查询以普通文件方式存储在HDFS系统上的文件,因此这些系统一般无法使用索引和各种统计信息来进行物理执行计划的优化,这些系统一般只能在逻辑层进行一些基于规则静态优化。根据SHARK论文,SHARK系统支持根据前面一些节点计算获得的信息,来动态优化后面执行计划。
(3) 物化与流水线执行方法
一条SQL语句对开发人员而言,感觉只是一次调用,但是实际上在数据库内部,一条SQL语句执行其实是有多个操作符组合而成的的树型结构计算流。如下图:
针对该计算流有两种执行方式:一是基于物化或者是实体化执行方式,另外一种是基于数据流的执行方式。
第一种方法的过程是: 把各个操作运算排序,并把每个操作运算的输出的中间结果存储在磁盘上,直到被另外一个操作运算所...
- ?
Top30数据分析师常见面试题(附答案)!
痴迷
展开
【IT168 评论】这是一个用数据说话的时代,也是一个依靠数据竞争的时代。各大互联网公司都在不断完善自己的数据分析团队,数据分析师的薪酬也是水涨船高。业内人士透露,应届毕业生的平均薪资大概在6K左右,1至3年经验的大概在10K到20K之间,5至10年经验的大概在25K以上。薪资还是十分诱人的,那么,如何快速成长为一名年薪百万的数据分析师呢?快来看看,以下30道数据分析相关面试题,你会多少?
1、分析数据还要写java代码是不是效率有点低?
2、成为一名数据分析师需要具备哪些技能?
要成为一名数据分析师,需要掌握丰富的报告软件包(Business Objects),编程语言(XML,Javascript或ETL框架),数据库(SQL,SQLite等);能够准确分析、组织、收集或传播数据;掌握数据库设计,数据模型,数据挖掘等方面的技术知识以及分析大型数据集(SAS,Excel,SPSS等)的统计软件包知识。
3、分析项目的各个步骤是什么?
分析项目的各个步骤包括:
·问题定义
·数据挖掘
数据准备
模型化
数据认证
实施跟踪
4、分析的结果数据特别大,在线请求这些结果数据扛不住了,咋搞?
5、列出数据清理的最佳实践?
一些数据清理的最佳实践包括:
按不同的属性排序数据
对于大数据集,逐步清理并改进数据,直到获得良好的数据质量
对大型数据集,可以先将其分解为小数据集,使用更少的数据将增加迭代速度
要处理常见的清理任务,请创建一组实用程序函数/工具/脚本。它可能包括基于CSV文件或SQL数据库重映射值,或者正则表达式搜索和替换,消除所有不匹配正则表达式的值
如果在数据清理方面存在问题,请按照估计的频率进行安排并解决问题
分析每列的汇总统计数据(标准差,均值,缺失值的数量)
保持对每一个清理操作的跟踪,以便可以根据需要更改或删除操作
6、海量日志数据,提取出某日访问百度次数最多的那个IP。
7、可用于数据分析的一些最佳工具清单有什么?
Tableau
RapidMiner
OpenRefine
KNIME
Google Search Operators
Solver
NodeXL
io
Wolfram Alpha’s
Google Fusion tables
8、数据挖掘和数据分析之间的区别是什么?
数据挖掘和数据分析之间的区别在于:
数据分析:针对个别属性的实例分析。提供有关属性的各种信息,如值范围,离散值及其频率,空值的发生,数据类型,长度等。
数据挖掘:重点关注聚类分析,异常记录检测,依赖关系,序列发现,多个属性之间的关系控制等。
9、给定a、b两个文件,各存放50亿个url,每个url各占64字节,内存限制是4G,让你找出a、b文件共同的url?
10、用于处理分布式计算环境中应用程序大数据集的Apache框架有哪些?
Hadoop和MapReduce是由Apache开发的用于处理分布式计算环境中应用程序大数据集的编程框架。
11、腾讯面试题:给40亿个不重复的unsigned int的整数,没排过序的,然后再给一个数,如何快速判断这个数是否在40亿个数当中?
12、解释KNN插补方法是什么?
在KNN插补中,通过使用与其值缺失的属性最相似的属性值来推断缺少的属性值。通过使用距离函数,确定两个属性的相似度。
13、数据分析师使用的数据验证方法是什么?
通常,数据分析师用于数据验证的方法是数据筛选和数据验证。
14、解释应该如何处理可疑或缺失数据?
准备提供所有可疑数据信息的验证报告。它应该提供信息,如失败的验证标准以及发生的日期和时间
有经验的数据分析师应该检查可疑数据以确定其可接受性
应该找出无效数据并用验证码替换
对缺失数据进行处理,使用最佳分析策略,如删除,单一插补方法,基于模型的方法等。
15、如何避免过拟合?
过拟合表现在训练数据上的误差非常小,而在测试数据上误差反而增大。其原因一般是模型过于复杂,过分得去拟合数据的噪声和outliers。常见的解决办法是正则化:增大数据集,正则化
16、解释异常值是什么?
异常值是分析师使用的一个术语,指的是一个远远超出样本总体模式的值。有两种类型的异常值:
Univariate
Multivariate
17、解释分层聚类算法是什么?
分层聚类算法结合并划分现有的组,创建分层结构并展示组划分或合并的顺序。
18、解释K均值算法是什么?
K均值是一种著名的分区方法。对象被分类为属于K个组中的一个,k是先验选择的。
在K均值算法中:
簇是球形的:簇中的数据点以该簇为中心
簇的方差/扩展是相似的:每个数据点属于最接近的簇
19、数据分析师所需掌握的关键技能是什么?
数据科学家必须具备以下技能:
数据库知识
数据库管理
数据混合
数据查询
数据操作
预测分析
基本描述性统计
预测建模
高级分析
大数据知识
大数据分析
非结构化数据分析
机器学习
演示技巧
数据可视化
报告设计
20、解释协同过滤是什么?
协同过滤是一种基于用户行为数据创建推荐系统的简单算法。协同过滤最重要的组件是用户对项目的兴趣。
协同过滤一个很好的例子就是购物网站上出现的类似“为您推荐”的模块,该模块通常会获取用户的浏览记录信息,以弹出用户可能喜欢或需要的商品。
21、大数据中通常会使用到哪些工具?
大数据中使用的工具包括:
Hadoop
Hive
Pig
Flume
Mahout
Sqoop
22、解释什么是KPI,实验设计和80/20规则?
关键绩效指标(KPI):它代表关键绩效指标(Key Performance Indicator),它是关于业务流程的报告或图表
实验设计:这是用于分解数据,采样和建立数据以进行统计分析的初始过程
80/20规则:这意味着你收入的80%来自客户的20%
23、解释Map Reduce是什么?
Map-Reduce是一个处理大型数据集的框架,可以将它们分解成子集,在不同的服务器上处理每个子集,然后混合每个子集上获得的结果。
24、解释聚类是什么?聚类算法的属性?
聚类是一种应用于数据的分类方法。聚类算法将数据集划分为自然组或集群。
聚类算法的属性是:
Hierarchical or flat
Iterative
Hard and soft
Disjunctive
25、对数据分析师有用的统计方法是什么?
对数据科学家有用的统计方法是
贝叶斯方法
马尔科夫过程
空间和集群进程
统计数据,百分位数,异常值检测
计算技巧等
简单的算法
数学优化
26、时间序列分析是什么?
时间序列分析可以在频域和时域两个域中完成。在时间序列分析中,可以通过指数平滑,对数线性回归等各种方法分析数据,来预测特定过程输出。
27、解释空间自相关分析是什么?
空间自相关分析是地理空间分析的常用形式。它由一系列为不同空间关系计算的估计自相关系数组成。当原始数据表示为距离而不是单个点的值时,它可以用于构建基于距离的数据相关图。
28、散列表是什么?散列表冲突是什么?如何避免?
在计算中,哈希表(散列表)是键值对的映射,这是一个用于实现关联数组的数据结构。它使用散列函数来计算一个时隙阵列的索引,从中可以获取所需的值。
当两个不同的键散列到相同的值时,发生散列表冲突。两个数据不能存储在阵列的同一个插槽中。
为了避免散列表碰撞,有很多技巧,这里列出两个:
分离链接:它使用数据结构来存储散列到同一个插槽的多个项目。
再探测:在找到查找位置的index的index-1,index+1位置查找,index-2,index+2查找,依次类推。这种方法称为线性再探测。
29、解释 imputation是什么?列出不同类型的插补技术?哪种插补方法更有利?
在插补过程中,我们用替代值替换丢失的数据。插补技术涉及的类型有:
单一插补
热点插补:从随机选择的类似记录中推断缺失值
冷却板插补:与热点插补相同,但更先进,从其他数据集中选择供体
平均估算:在所有其他情况下,用该变量的平均值代替缺失值
回归插补:用基于其他变量的变量预测值替换缺失值
随机回归:与回归插补一样,但它将平均回归方差加入到回归估计中
多重插补:与单个插补不同,多重插补会多次估计值
虽然单一插补法被广泛使用,但并不能反映随机丢失数据所造成的不确定性。因此,在数据丢失的情况下,多重插补更有利。
30、解释N-gram是什么?
N-gram是来自给定序列文本或语音的n个项目的连续序列。这是一种以(n-1)形式预测下一个项目的概率语言模型。
- ?
数据分析学习笔记——数据可视化
褐瞳
展开
文 | 张俊红
写在前面:本篇来源于书籍《数据之美—一本书学会可视化设计》的学习后整理所得。全篇主要围绕数据可视化的5个步骤展开,其中重点内容是第三步:“应该使用哪种可视化形式”。本篇旨在带你全面认识了解可视化,所以一些具体的工具的使用并未涉及,只是罗列类一些常用的可视化工具。
你有什么数据
关于可视化,人们一般的理解是先设想要达到的可视化效果,然后在去寻找相应的数据。
这样经常会造成:“现有的数据不能够做出事先设想的可视化效果,或者是想要制作理想的图表需要获取更多的数据。”
而实际上关于可视化的步骤应该是先认清你有什么数据。
为了更好的进行可视化,我们将数据分为分类数据、时序数据、空间数据、多元变量数据四大类。
1、分类数据
分类数据是指针反映事物类别的数据。如:用户的设备可以分为Iphone用户和andorid用户两种;支付方式可以分为支付宝、微信、现金支付三种等。诸如此类的分类所得到的数据被称为分类数据。
2、时序数据
时序数据也称时间序列数据,是指同一统一指标按时间顺序记录的数据列。如:每个月的新增用户数量、某公司近十年每年的GMV等。诸如此类按时间顺序来记录的指标对应的数据成为时序数据。
3、空间数据
空间数据是指用来表示空间实体的位置、形状、大小及其分布特征诸多方面信息的数据,它可以用来描述来自现实世界的目标,它具有定位、定性、时间和空间关系等特性。空间数据是一种用点、线、面以及实体等基本空间数据结构来表示人们赖以生存的自然世界的数据。
4、多变量
数据通常以表哥形式的出现,表格中有多个列,每一列代表一个变量,将这份数据就称为多变量数据,多变量常用来研究变量之间的相关性。即用来找出影响某一指标的因素有哪些。
关于数据你想了解什么
关于数据你想了解什么也就是针对数据进行提问。
你想从中得到什么结论(平台上的用户中哪个地区的用户较多、数据分析领域最具有权威的人物是谁、2016年的GMV环比去年是增加类还是降低类)。
了解什么到什么现象(学生成绩好坏可能与家庭背景是否具有一定的相关性、应届生收入和毕业院校是否有一定的相关性)。
应该使用哪种可视化形式
在前面我们已经说过,在做可视化的过程中,我们需要先明确我们有什么数据,然后再去研究这些数据适合做什么类型的可视化,再然后从这些适合的可视化类型中选择能够很好的满足我们需求的(即能够更好的帮助我们了解我们想要的)视图。
为了找到合适的可视化形式我们需要先介绍两个内容:有哪些可视化形式、如何让可视化更加清晰。
1、有哪些可视化形式
基于数据的可视化形式有:视觉暗示、坐标系、标尺、背景信息以及前面四种形式的任意组合。
(1)视觉暗示:
是指通过查看图表就可以与潜意识中的意识进行联系从而得出图表表达的意识。常用的视觉暗示主要有:位置(位置高低)、长度(长短)、角度(大小)、方向(方向上升还是下降)、形状(不同形状代表不同分类)、面积(面积大小)、体积(体积大小)、饱和度(色调的强度,就是颜色的深浅)、色调(不同颜色)。
(2)坐标系:
这里的坐标系和我们之前数学中学到的坐标系是相同的,只不过坐标轴的意义可能稍有不同。常见的坐标系种类有:直角坐标系、极坐标系和地理坐标系。
大家对直角坐标系、极坐标系比较熟悉,这里说一下地理坐标系。
地理坐标系是使用三维球面来定义地球表面位置,以实现通过经纬度对地球表面点位引用的坐标系。但是我们在进行数据可视化的时候一般用投影的方法把其从三维数据转化成二维的平面图形。
(3)标尺:
前面说到的三种坐标系只是定义了展示数据的维度和方向,而标尺的作用是用来衡量不同方向和维度上的大小,其实和我们熟悉的刻度挺像。
(4)背景信息:
此处的背景和我们在语文中学习到的背景是一个概念,是为了说明数据的相关信息(who、what、when、where、why),使数据更加清晰,便于读者更好的理解。
(5)组合组件:
组合组件就是根据目标用途将上面四种信息进行组合。
2、如何让可视化更加清晰
如何让可视化更加清晰:
(1)建立视觉层次:
把图表在视觉上进行分层,把非重点信息弱化,重点信息强化突出。
(2)增强图标可读性:
● 让数据点更容易比较
● 留白,图表之间留有一定空间的空白。
(3)高亮显示重点内容:
高亮就是以特殊形式显示的内容,便于读者在一堆数据中很快抓住重点。
(4)注释可视化:
一般指图标的标题部分。帮助读者更好地理解图表的意思。
能够进行可视化的工具有哪些
1、Microsoft Excel
对于这个软件大家应该并不陌生,对于一般的可视化这个软件完全足矣,但是对于一些数据量较大的数据则不太适合。
2、Google Spreadsheets
Google Spreadsheets是基于Web的应用程序,它允许使用者创建、更新和修改表格并在线实时分享数据。基于Ajax的程序和微软的Excel和CSV(逗号分隔值)文件是兼容的。表格也可以以超文本链接标记语言(HTML)的格式保存。
3、Tableau Software
Tableau Software现在比较受大家的欢迎,既可以超越Excel做一些稍微复杂的数据分析,又不用像R、Python那种编程语言进行可视化那么复杂。好多人都有推荐这款软件。
4、一些需要编程性语言的工具
R语言、JavaScript、HTML、SVG、CSS、Processing、Python。这里主要是列举一下有哪些编程语言可以实现可视化,具体如何实现需要读者自行学习。我目前主要是在学python的可视化,稍后会分享一篇用python进行可视化的学习笔记。
透过可视化你看到了什么、有什么意义
把数据可视化以后,你需要从中发现一些数据之间的相关性以及通过数据暴露出来的问题。比如你会发现某天的新注册用户显著高于或低于其他天的数量,你发现这个问题了,你就需要去调查该问题出现的原因,然后解决他。
或者是你发现某两个指标具有很强的线性相关关系,那么你就需要去通过其他方面去验证这个情况是真实存在的还只是偶然情况。
End.
来源:36大数据
- ?
Excel数据分析表格你能够玩转吗?看看你属于哪一级
单怜阳
展开
小R刚毕业,每天都在公司忙到10点半回家。
作为室友的我,总是打趣地问他:“是不是又在公司蹭空调蹭网络,干嘛不早点回来陪我吃鸡!”
没想到小R低下头落寞地抱怨道:“我也想早点回来,可是我真的搞不定啊!”
原来,小R每天的工作标配就是统计数据。可同事们十几分钟就能轻松搞定的Excel表格,他经常要加几个小时班才能勉强完成。刚开始,他以为是自己不够熟练,多多练习就好了。没想到埋头苦练了半个月,他还是全组最慢的那个,每天被领导催到怀疑人生,甚至被质疑工作能力。
没有对比就没有伤害。看着旁边妹子敲几下键盘就能轻松搞定表格,小R开始惧怕做Excel和数据统计。
如今,几乎所有公司在招聘时都离不开这条要求:熟练使用Excel,精通数据分析者优先。
做方案、汇报工作、数据分析、总账录入、项目进度、工作记录、写代码、帮助记忆、思维导图.......Excel几乎能解决你工作中的所有问题,它不仅仅是某一职业的必备技能,而真实涵盖所有行业:
做行政,你要学会做考勤表;做财务,你要学会做财会报表;做销售,你要学会做销售业绩表;做运营,你要数据分析、工作汇报;做数据分析师,Excel玩得6也是最最最基本的条件.....
大数据是眼下非常时髦的热词,同时也催生出了一些与大数据处理相关的职业,数据分析师便是其中之一。由于专业技能和量化的数据分析为客户或所在公司控制决策分析、保证利益最大化,“数据分析师”一职备受各界青睐,甚至被视为21世纪的黄金职业。
虽然发展前景大好,但很多想要转行数据分析的小白心里多少都会有些疑惑:不会R、Python、SPSS、Tableau,是不是做不了数据分析师?
事实上,精通Excel,对于转行数据分析来说相当重要。因为Excel拥有最大的客户群体,基本上所有的企业、个人的电脑中装的都是office,这也就意味着90%以上使用电脑的人,都会用到Excel,即便如BAT这样的企业,在处理百万级、千万级数据的时候,也会优先使用Excel。
那么,在没有统计学、数学、计算编程等基础的情况下,如何只用Excel,成功转行成为数据分析师呢?
这里就不得不介绍三款用Excel就可以实现数据分析的插件:Power Query(数据查询)、Power Pivot(数据建模)、Power View(数据可视化)。
这三个模块组成了数据分析全过程,这个过程就好比烹饪过程:
第一个模块数据查询——Power Query。与数据源直接对接,就像获取新鲜的食材,对食材进行清洗、分类、整理,使其达到准备入锅的使用状态。这一步非常重要,因为如果食材不新鲜,那么再厉害的大厨也不可能做出一道健康的美味,所以好的数据源是成功的一半。
第二个模块是数据建模——Power Pivot。这一步是数据分析过程中最具有技术含量的核心部分。我们把数据组合起来实现不同维度的分析,就像把食物组合起来利用烹、炸、煎、炒等方式,再添加油、盐、酱、醋等调料,以烹制出想要的味道。
但是光有味道是不够的,最后我们要呈现给顾客的是一道色、香、味俱全的菜,是否能以视觉效果吸引顾客品尝你的美味,这就要看第三个模块——Power View(数据可视化)的功力了。
例如,如果以前你的做表是这样的 :
那现在通过Power View几秒钟就可以做成这样:
是不是相当神奇?!
无论你是像小R一样的职场小白想要提高工作效率实现逆袭,还是零基础转行成为高大上的数据分析师,精通Excel可以让你彻底告别被数据搞晕的日子,实现加薪不加班!
Excel这么重要,如何在短时间内熟练掌握呢?这有一套为你打造的Excel精品课程:容大教育《Excel速成班——数据处理与分析实战》在线课程,教你用Excel实现数据采集、数据转换和清洗、数据分析与建模等,关注容大教育IT培训机构百家号获取学习资料!
- ?
一枚优秀的产品经理是如何做ROI数据分析呢?
十指浅
展开
产品运营三大核心指标:拉新、活跃、留存。相信每一个小伙伴都不陌生。
不同的产品阶段可能运营策略重心会有所不同,但肯定对于各种拉新活动并不陌生,例如H5活动、广告投放、软文扩散、渠道换量等。
每一轮的投放活动都需要衡量投入产出比ROI,每一次活动结束都需要进行复盘讨论,每一轮迭代投放都可能在验证一些猜想。
我们的目标是:用合理的投入成本,通过各类途径优化,最大化效果产出。
但实际的运营投放中,往往会遇到各式各样的投放方式:
这个渠道说,我们不能实现不了直接跳转下载;
那个渠道又说,我们是做品牌的,高曝光才是我们的优势,转化不关我事;
还有的时候,一个渠道上,就有3个不同的位置x3种素材x3种跳转方式,跳转应用市场之后到底下载了木有,打开APP了木有,效果怎么衡量,头有点晕……
但其实,我们关心的是以下几个方向:合理投入、优化路径、最大化产出。简而言之,我们关心的是:投入产出比。
(在不同的渠道进行拉新)
如何找到最大化的投入产出比,这是每一个负责拉新业务的小伙伴都曾经或者正在头疼的事情。
从上图的流程上看,我们可以优化的就是几个环节:产品是否吸引人、渠道是否优质、投放的方式是否高效、效果是否符合预期。
这里暂时不讨论产品定位,我们只讨论丰富多彩的渠道投放的效果优化。
我有100种投放姿势,就问你敢不敢试~
这里,我们虽然是以APP拉新为例,讨论的是一种多渠道效果数据分析体系,但其实适用于每一个就算不是APP产品,或者你的拉新不是以增加APP用户为核心,都可以复用这套数据分析框架。
设定预期目标
首先,对于任何一次投放活动,我们都必须界定它的目标产出。只有在清晰的效果衡量体系下,渠道数据的对比才有意义,多渠道的ROI才有可比性。
对于APP拉新的投放活动来说,常见的预期效果可能是:
提高对APP的认知(以传播广泛为目的)
成为APP用户(APP下载并激活)
在APP内完成特定行为(如购买、身份验证或者领取礼包)
我们以常见的拉新——“APP下载并激活”为例,先搭建一个数据漏斗,看看我们效果环节上需要观察哪些数据。
如果我们希望监控的是上述内容中③的效果数据,我们就在激活之后继续添加下一层级的漏斗,统计例如加入购物车、确认下单、付款这样的流程。
在这样的漏斗流程之上,我们可以搭建监控指标,有时候监控的数据可能无法实现理想的统计指标,我们可能会需要补充其他监控指标,有时候也无需如此精确的数据粒度。
我们最后监控的数据指标如下(表1):
而效果数据部分,则可以通过MTA的新增报表——安装来源分析实现。
为什么这里增加了“下载所用网络占比”?
原因是在下载完成到安装,这两个事件属于APP应用市场的原生事件,开发者无法主动采集,但我们依然关心这其中的转化步骤,主要是担心用户如果处于较差网络环境下,下载行为可能会被终止,因此这里用了“所用网络占比”这样的辅助字段数据。
这里的辅助字段数据主要是为了优化转化效果所做的准备。确定了目标,我们第二步就可以做投放过程的数据记录了。
投放过程记录
做这一部分的数据记录,主要的目的,一是为了复盘的时候方便做分析对比,二是为了优化迭代的时候更有方向。
根据埃里克·莱斯的《精益创业》中的观点:每一次的实验迭代,其实都是为了得到一个经证实的认知。
应用在推广投放体系下,每一次投放策略的设计,都是为了验证一个投放策略的有效性,是为了提升效果产出。
这个环节是一个多路分支,我们需要做一些版本记录,以便更好的定位问题。过程图大致如下:
记录过程表2为:
(表2 广告投放策略记录)
*根据投放方式的不同,可能记录的方式也会略有不同
**具体的策略信息可以在详表中展开记录
然后把表1的效果数据映射在表2之后,得到一条投放活动的完整记录。然后就可以通过数据来验证具体的投放策略的有效性了。
验证目标是怎样的投放策略,这一点需要在投放开始前就规划好,这样数据分析的时候才能得到有效的结论。
分析与优化效果
对于搜集到的众多详细数据,我们接下来就可以做一些数据上的结果分析了。
首先,我们可能想验证的是投放素材对渠道1的banner-1的影响,那么,我们把表2中渠道1单独拿出来,可以得到如下表格:
(表3.投放素材对渠道1的banner-1的影响)
如果我们想比较渠道1上Banner和Feeds流的差别,我们可以得到:
我们也可以针对人群定向投放效果、不同的投放时间,乃至渠道效果质量对比等多个维度进行数据分析,通过数据来验证我们的策略,优化投入产出比。
所以,虽然说投放的姿势有千千万,但效果路径总是相似的。
如果你有丰富多彩的投放策略,不用急,不要慌,把路径理出来,控制策略的版本,采用A/B TEST等加快验证迭代速度,最终得到有效的投放策略与最大化的ROI效果。
以上是关于投放效果上的数据指标体系分享,相似的分析思路可以复用在不同需求的投放方案中,包括一些线上、线下的运营活动,其实也可以复用这个框架。
来源:pm28
- ?
简单几步掌握Excel数据统计分析必备功能-数据透视表
洪如豹
展开
上一篇给大家分享了一下筛选功能的使用,特别要注意不能随意复制粘贴的原因和解决办法。有兴趣的朋友们可以点击或关注百家号,进去查看历史文章。
那么,今天给大家分享下EXCEL透视表功能的简单使用。通常情况下,我们需要做批量数据的统计、用excel出图表等等的时候,需要计数或者求和的结果作展示的时候都会用到。可以说是在大数据分析以及展示结果的时候,所必须会使用到的一个功能。
在此,让我们一起通过一个实例来看一下,excel数据透视表的具体使用方法。只需要简单几步,就可以完成一个简单的数据透视!
首先,我们打开一个要处理的EXCEL,比如需要统计各部门总工资。如下图的数据。通过1月到5月每个人的工资记录,来计算出部门工资的总数及每个月的走势。
第一步:选定A列到H列,即包含所有数据的列。
第二步:点击插入-数据透视表,出现一个创建数据透视表的小窗口,直接点击确定。
此时出现了一个新的sheet页,如下图。这里为了方便大家看全,我把表格横向缩小到了一起。实际上数据透视表字段是在EXCEL最右侧。
第三步:新sheet页的最右侧数据透视表字段,有一个选择要添加到报表的字段,可以看到原始表格的标题列。继续往下看,有四个区域,分别为筛选器,列,行,值。我们把月份点住,拖动到列的区域中。
再分别把部门、姓名拖动到行,部门在上。最后把工资拖动到值。
第四步:值里边默认是计数项,我们需要修改一下,工资是以求和来统计。点击计数项:工资,会出现值字段设置。打开后,选择求和,然后点击确定。
第五步:此时已经可以看到表中的数据都已经出现,每个部门每个人1月到5月工资以及总计的工资。可以点击技术部、科研部、运营部前边的-号,代表隐藏姓名;最后一列的总计,每一行代表这一行数据的总计,比如第一行代表技术部1月到5月的总计工资数目;最后一行的总计,每一列代表的是这一列数据的总计,比如1月的那一列代表1月各个部门的总计工资。这样就满足我们的需求了,可以看到每个部门在每个月以及合计的工资数目。
习惯而言,统计的数据都喜欢有高低顺序来浏览,方便一眼看出哪个部门的工资总额高低。我们可以再点击一下总计那列,然后点击排序,选择降序排列。这样就可以看到一个按高到低排序的工资图表了。
好了,本篇就给大家讲到这里,大家可以自己试着随意在四个区域里,把其他的标题也拖进去,看看会出现什么变化?其实看似枯燥的Excel工具也有非常有趣的一面,更多的技巧就留给大家自己开发吧!有什么问题欢迎留言给我们哦!
- ?
为了改变坏习惯,我记录数据,分析了自己一年的生活
线索
展开
为了寻找不焦虑,有意义,更幸福、成功的生活,我决定记录自己一整年的行为和习惯。这个计划被称为LifeOps。它是一个可以感知目标、行为以及想法的系统,会为你提供建议,帮你更好地实现目标,建立积极的习惯,以取得更大的成功。
一些看似与目标无关的行为会影响我们,但我们没有注意或意识到这种影响。通过了解行为,我们可以发现不足,并能作出相应的调整。通过记录和分析数据,改变行为,我希望能够实现目标,并对自己有更多的了解。
日常生活
白天工作
我的日常生活非常忙碌,不只是忙于本职工作——还需要不停地进行角色转换。我是一个定制软件开发公司解决方案的架构师,这个工作本身就需要我每天将注意力分配到不同的事物中。
作为一名解决方案架构师,处理问题时,我必须尽快地做出方案供大家讨论,没有太多时间去钻研业务领域和技术,或者成为该领域的资深专家。我需要快速了解业务领域和当前的问题,必须利用自己现有的技术知识和经验,然后为解决这些问题设计可能的方案。这些工作需要大量的沟通、协作和高层次的思考。
该工作还要与团队合作解决更具体的问题,设计出的解决方案要在未来带来最佳结果。这方面需要解决许多技术问题,并与开发团队协同工作。
思想和技术领导是工作的另一方面。我需要制定战略和策略(以及了解员工执行的情况),以促进组织内部技术领导力的增长。这意味着我必须立足于高层,而不是在组织层面上,也不是在特定的业务领域。我必须对人们及其目标进行了解,以加强组织的可信度。我还需要指导和激励人们去执行一些战略,以加强组织并帮助他们个人成长。
工作的最后一个方面是研究和发展。我需要掌握最新的技术趋势,掌握新技术如何应用和配合。这有助于我更好地为客户和团队提供架构师的建议和解决方案,同时也很有趣。
梦想
除此之外,我还在2015年立下了多产的梦想。我的目标是为个人、企业和整个世界创造一个更高效、更多产的未来(是的,听起来很俗气)。
我一直相信,为人们创造一种非凡的体验,用科技做一些有用的事情是成功的关键。我会一直这样做下去,而在这场旅行中,我又意识到拥有一个完善的产品是不够的,还需要把思想和努力投入战略、营销、财务管理和其他与业务相关的领域中去。我必须学习和尝试很多东西。
更多的激情
除了上述内容,我还有一种热情在熊熊燃烧,我想教别人,并赋予人们力量。我每月都会举办一次人工智能会议或黑客马拉松,让当地的技术人员了解人工智能技术,从而进一步推进个人和专业项目。
我也经常在会议上分享自己的知识,并与黑客们见面,这对认识新朋友和学习截然不同的东西很有帮助。
另外,我喜欢游戏开发。这是我进入科技领域的重要原因,所以一有空闲,我就会去尝试新想法。
经验
生活的另一部分包括一些娱乐活动,如旅行和体验新文化,感受不同的人文和环境。我一直想去世界各地探索。
最后要说的是,我也是一个社会体验者。我希望能与朋友一起享受时间,讨论想法,合作和结识新朋友。但是,随着工作日渐繁忙,我大概很难有机会去实现工作以外的东西了。
更自然
我之前几年的目标之一是做到更自然。因为当我发现一些有趣或不一样的事情时,总会刻意评估事件走向的所有可能性,自己能掌握的时间,以及做这件事带来的影响。
我想放弃关注所有事情,只做那些感觉正确的事。这就意味着我要去做一些新的事,和那些打乱我原有计划的人一起工作。但结果比自己过度思考,错过那些可能带来乐趣的体验要好,而且也会改变我的心态。
从目前来看,我的生活是非常忙碌的。这些甚至还不包括日常生活中我的所有个人挑战和任务。身体健康和情绪健康是我一直在努力追求的大事,而这也是值得努力和关注的。
重要的一点是,这并不是单纯的忙碌问题——而是精神上的负担。很多人可能会说,“你活的太拼了”,我完全同意。然而,我对以上每一件事都充满热情,充满一种解决问题的渴望。
但是,我需要找到一种方法,在不燃尽激情的前提下继续工作。我讨厌这样忙乱的生活,并一直为此感到焦虑。
因此,这促使我使用数据来了解更多自己的信息,这样就可以尝试着去优化生活。
记录自己
记录生活指标这一想法对我来说并不新鲜。我和一个朋友一直有这个想法,我们一起做了一个平台,可以了解你的目标和行为,然后提供建议、支持和见解,帮助你实现目标。这个平台使用了游戏化技术,还能研究行为变化。这是在2013年的事。
开发了一个基本的原型之后,我意识到要让它变得可用,还需要做很多工作。几年过去了,我几乎没有时间去做这个项目,结果就停滞了下来。
2016年12月,我发现这个应用程序并不是最有价值的。最有价值的是这个想法和它实际能做什么。所以我决定拿我自己来做测试,用电子表格进行模拟。
收集正确的数据
我创建了一个电子表格,包含每天所做事情的指标,以此更深入地了解自己的行为和实现目标的进度。
我感觉自己需要注意的是:
1.要能进行任务切换。确定任务的优先顺序,并在脑海中移除其他事项,直到它们进入计划才开始考虑。
2.不要总想敦促自己去做更多的事情。在完成上一个想法之前,我总有一种冲动,想要开始一个新项目或者考虑其他想法。我总有那么多的想法和问题!这对自己不利。
3.不要总想去学习新事物。我列出了一些想学的东西,并且不断增加这份清单内容,但实际上我没有学好任何东西。
4.要学会关闭思维。大脑需要休息才能有良好的表现。
5.要解决失眠问题。失眠导致我早上睡眠不足,感觉不好。
6.不喝垃圾饮料。我喝了太多软饮料和能量饮料。
7.要自己做饭。我不做饭(真的应该学习),所以经常出去吃,或者从当地的商店买着吃。
8.要有正确的饮食习惯。我经常不吃早餐和午餐,然后吃一顿丰盛的晚餐,有时还会在晚上吃垃圾食品。
9.学会照顾自己。这有点泛泛,包括花时间照顾自己,重视健康,并明白偶尔的无所事事也是可以的。
我为自己制定了一个“固定”的时间表。每天固定安排部分工作,明确主题(最多选两个)。这让我有时间反思,自己当天说了什么,拒绝了什么。
时间表和主题每周都有轻微的调整,但有了上述注意事项,它就能让我消除脑海中那些无用、无效的事情。
组织化
平时我会严格执行待办事项列表中所列的活动。既然已经有了主题,我就可以把不属于当天任务的主题从列表中划掉。Wunderlist这款App真的很有帮助,它可以让你在一天不同时间段里,设定任务优先级来处理任务。
在分析了自己的问题,并对目标和激情有一定了解之后,我开始记录以下内容。
醒来的时间。我有时间照顾自己吗?吃过早餐吗?如果是,吃了什么?离开家上班时,周边的交通情况。到岗的时间。吃过午饭吗?如果是,吃了什么?学习或工作上的成就。下班时间。到家的时间。白天去过的地方。每天自由联想的时间,以及其中的收获。吃过晚餐吗?如果是,吃了什么?休闲时间。我做了什么消遣,花了多长时间(通常是打游戏或看电视)。各种体能练习的重复次数。例如,俯卧撑、蹲坐、仰卧起坐,等等。耗水量。垃圾食品消费情况。酒精消费情况。香烟的数量。试图减少吸烟(或戒烟)。体重。努力让自己更健康。情绪。积极、消极、无聊。日记。对一天的描述。
我从2017年1月10日开始记录每天的这些特征。这是每晚都要进行的“仪式”:上床睡觉时,我会把这些观察记录在文档中。我还做了一些统计,分析自己哪些行为是正确的,哪些是错的。
在几乎没有什么时间的情况下,每天记录数据成了我的第二天性。有很长一段时间,我很晚才到家,或者晚上要出去,但从未耽误收集数据。这也让我学会了反思自己的一天,并思考当天的行为是否能帮助自己实现目标。同时也指引着我去完成第二天的目标。
我还会观察过去几周的行为和趋势,决定下周需要关注的地方。
我的进步
通过评估数据和设定短期目标,我有了一定的改变。这些改变帮助我实现了一小部分目标。
1.时间安排:有了时间表和工作主题,我的工作效率大大提高,可以在特定环境中完成更多的工作。
2.重点任务:由于强迫自己在特定时间只专注于特定的事情,我开始更加关注手头的任务,并取得了很大成绩。
3.饮水量:通过统计分析,我给自己设定了一个饮水量(1.5升),把它当成一个任务来完成。
4.垃圾食品消费:在吃东西或喝东西之前,我都会停下来思考,是健康食品还是垃圾食品。这帮助我避免了大多数软饮料和典型的垃圾食品。
5.健康:通过记录饮水量、饮食,我找到了可以改善的地方。我决定,每天都吃一小份早餐,尽管时间紧迫。所以我每周都买一些酸奶和麦片,这些不需要花多少时间准备,吃起来也很快。
不要误解我的意思,因为之前早上不习惯吃东西,现在不得不强迫自己。我会争取让自己按计划行事。水也是一个大问题。我全天都杜绝喝软饮料,并让自己至少喝1.5升水。饭菜也在变化。有时尽管不是我最满意的一餐,但当我从商店买饭或自己做饭时,都会控制自己吃那些更健康的食物。
6.睡眠:我注意到自己睡眠中有大量不健康的习惯。当我无法入睡时,会想很多关于工作的事,所以我决定找到改善这个问题的办法。我买了一个睡眠追踪仪。还会在睡前洗个热水澡,避免使用手机或笔记本电脑。目前已经有了些效果,但还有很长的路要走。数据还显示,睡眠很可能是影响我一天计划的关键因素。它影响了我的能量、情感和动力。
从数据中汲取经验
我一直按计划管理自己的生活,记录行为数据,根据每天的主题,把注意力集中在待办事项上。以下是我通过分析发现的。
1.睡眠:我平均睡5.5小时,这需要改善。
2.水:摄入量为1.5升。
3.食物:强迫自己按时吃饭,尽管对情绪没有什么影响,但对减肥有好处。
4.垃圾食品:一直在减少,但是当我想作弊的时候,还是会作弊。
5.功能饮料:喝功能饮料会产生负面影响。睡眠受到干扰,并产生恶性循环。
6.学习:学到更多东西或在某件事上做出成就,感觉最快乐,无论目标是什么,都很高兴。
7.体重:通过增加水的摄入量,减少吃垃圾食品,轻度运动,我瘦了9公斤。
8.旅行:长时间的旅行让人疲惫不堪,但当我游览一个新地方时,情绪就会高涨。
9.工作效率:将每周的工作时间按主题段划分,提高了工作效率,减少了焦虑。
这是这项活动最大的成功之一。它让我的注意力更集中,更有效,让大脑每天只花几个小时来完成一项任务,而不是试图处理多个不同的任务。
下一步的打算
在分析了一年的生活数据后,我了解到有些事情必须要做,那就是进一步优化生活,实现目标,并尽可能地做到最好。
1.更细化的目标:我不能只有细碎的数据和远大的目标,需要创建每周的主题和目标,以及每月的主题和目标,通过创建工作重点来完成一些切实可行的事情。
2.思考和创意是伟大的(我一直都在做),但要把它变成有意义的事情则需要行动,如果总把它放在待办事项清单上,那成功的一天永远不会到来。
3.快速完成任务:我经常在一些琐碎的事上拖沓,如清理垃圾,或者清理笔记本电脑。此时需要一个大型的系统管理软件帮你尽快地处理好琐碎任务,回复邮件,做家务,买重要的东西,等等。
通过尽快完成这些任务,你省了不少脑力。即使你认为这些事儿没有占用大脑空间,它们也会影响你。不管你知不知道,这些任务都会引起焦虑。尽可能快地完成一些琐碎任务,会让你觉得自己没有那么懒惰,更有效率,并且在整体上有积极的结果。
4.更多的数据:我需要每天记录更多的数据,以便更好地理解自己的具体活动,正在使用的东西,以及时间分配。
5.轻松处理:用电子表格来处理数据是非常麻烦的。 Misana(这是一个软件系统)的目标是使数据处理变得简单。理想情况下,我会通过手机传感器和机器学习来实现自动化。
6.实时分析和处理方法:我现在需要每天收集所有数据,通过电子表格中的一些高级公式来进行每日、每周、每月和整体分析。如果有什么东西能给我提供实时的分析和指导,我就可以轻松地专心为自己的目标而奋斗了。
除了这些要点外,我还学到了一些无法完全描述或量化的经验,包括承认不足就可以提升自我;努力分析自己(包括做的事,为什么做),并与目标相比较,就可以取得了一些小小的进步。小小地改变了自己和生活,我就能在脑海里实现那些只是“未来目标”的事情,能用所经历的、小而有意识的行动改变生活。
?MSA数据分析方法和应用案例
回游
展开
测量系统是用来对被测特性定量测量或定性评价的仪器或量具、标准、操作、方法、夹具、软件、人员、环境和假设的集合; 是用来获得测量结果的整个过程。从这个定义中可以看出, 测量过程实际上是一个制造数据的过程,获得正确的测量数据则是保证产品质量的第一步。如果不能科学地评价测量系统产生的数据的可靠性, 就无法对测量系统的有效性进行控制, 质量管理和控制就失去了最基本的前提。因此,在ISO/TS16949汽车行业质量体系标准中,测量系统分析(简称MSA)被列为该标准的五大工具之一。
测量系统分析(MSA) 的目的是确定测量数据的可靠性, 它实际上是一个对测量系统的监督检查程序, 在一定程度上可以看作是一个检验产品控制计划满足程度的把关程序。即对已判定为合格的零件进行抽样检查, 经过科学的统计理论分析, 找出因测量系统因素导致不合格的因素, 并加以整改, 逐渐减少产生不合格产品因素的存在,从而达到控制产品质量的最终目的。
1 基本MSA方法
测量系统分析,顾名思义针对的是整个测量系统的稳定性和准确性,它的核心是分析
测量系统的位置变差、宽度变差。在位置变差中包括测量系统的偏倚、稳定性和线性;在宽度变差中包括测量系统的重复性、再现性。测量系统的偏倚、稳定性、线性、重复性和再现性就是人们通常所说的“五性”。因此,MSA 可简单概括为:分析整个测量系统(仪器或量具、标准、操作、方法、夹具、软件、人员、环境和假设的集合)在测量过程中存在哪些风险和误差的过程。MSA采用的数据分析方法有:独立样本法、图表法、极差法、方差分析法等。按照测量系统分析过程前后顺序,相关方法摘记如下。
1.1 识别数据类型 在进行测量系统分析前首先要识别测量数据的类型,了解了数据的类型才能使用合适的方法进行测量系统分析。一般数据类型有两种:计数型数据和计量型数据。计数型数据是指不能连续取值的,如砂眼数、裂纹处、疵点数等。计量型数据是可以连续取值的,如长度、尺寸、温度等。
1.2 选定测量系统分析方法 测量系统分析常用的方法有Gage R&R研究、专家再评估、检验一致性和专家循环研究。重点研究Gage R&R。Gage R&R方法主要用于计量型数据,评定标准是用Gage R&R值。一般Gage R&R值在小于10%以下可接受,Gage R&R值在10%-30%之间为灰色区域,也许可接受,Gage R&R值大于30%,测量系统需改进。同时还要看可区分数NDC,当NDC大于等于5时,通常认为测量系统可靠。用Gage R&R值作为评定标准时还要考虑零件的关键特性,对关健特性测量系统分析结果Gage R&R值大于15%时,我们就要考虑对这个测量系统进行改进。
1.3 测量系统的重复性和再现性分析方法(简称%GR&R%或R&R) 确定研究主要变差形态的对象/量具(如:游标卡尺、电子秤、硬度计、千分尺等)。工序量具、产品和质量特性;选择使用极差法,均值和极差法中的其中一种方法对检验、测量和试验设备进行分析;从代表整个工作范围的过程中随机抽取样品进行;测量系统分析的工作人员在进行检验、测量和试验设备测量系统的重复性和再现性分析时,必须先对被分析的检验、测量和试验设备进行零件评价人平均值和重复性极差分析,同时所分析的零件评价人平均值和重复性极差之结果必须均受控方可进行被检验、测量和试验设备测量系统的重复性和再现性分析工作;否则该检验、测量和试验设备的测量系统不能检查出零件间的变差且不能将其用于过程控制中。
1.4 平均值和重复性极差分析 1)选择2-3个操作员(至少2人)在全然不知情的状况下利用校准合格的量具对随机抽取的5-10个样品进行盲测,每个操作员对同一样品的同一特性在盲测的情况下重复测量2-3次。 2)操作员或进行%R&R测量系统分析的工作人员将所测量的结果记录于“零件评价人平均值和重复性极差控制图”上。 3)负责组织此项测量系统分析研究的工作人员,依据“零件评价人平均值和重复性极差控制图”上的数据和产品质量特性规格进行计算和分析,并将其分析的结果记录于“零件评价人平均值和重复性极差控制图”上。
1.5 均值和极差法(X-R) 1)选择2-3个操作员(至少2人)在全然不知情的状况下利用校准合格的量具对随机抽取的5-10个样品进行盲测,每个操作员对同一样品的同一特性重复测量2-3次。 2)操作员或进行%R&R测量系统分析的工作人员将所测量的结果记录于“量具重复性和再现性X-R分析数据表”上。 3)负责组织此项测量系统分析研究的工作人员,依据“量具重复性和再现性X-R分析数据表”上的数据和产品质量特性/规格进行计算,并将其记录于“量具重性和再现性X-R分析报告”上。
1.6 极差法(R) 1)选取两位评价人和5个产品进行分析,每个评价人对每个产品进行盲测一次,并将测量结果记录于“量具极差法分析表”中(每个操作员应熟悉和了解使用量具的一般操作程序,避免应操作不一致而影响测量系统的可靠性),并评估不同操作员对量具使用的熟练程度; 2)针对重要特性(尤其指有特殊特性符号的)测量所使用量具的精度应是被测量产品公差的1/10(即其最小刻度应能读到1/过程变差或规格公差较小者),以避免量具的分辩力不足,而一般特性测量所使用量具的精度应是被测量产品公差的1/5;
3)负责组织此项%R&R测量系统分析研究的工作人员,依据“量具极差法分析表”的数据和产品质量特性/规格进行计算,并将其计算结果记录于“量具极差法分析表”上;必要时,可将其作成X-R控制图。
4)%R&R接受准则: a)、%R&R<10%,可接受;b)、10%≤%R&R≤30%,依据量具的重要性、成本及维修费用等因素,决定是否可接受或不可接受;c)、%R&R>30%,不能接受,必须进行改进。
1.7 线性分析法
在测量系统工作范围内选定5个产品,它们的测量值应覆盖量具工作范围;在计量室或工具间用全尺寸检验设备(精密量具)测量每个产品10次,并计算其平均值,然后将其确定为“基准值”,同时确定它们各自所取得的“基准值”是否覆盖了被检量具的工作范围;让一位经常使用该量具的操作员(评价人)对5个产品以盲测的方式按随机抽取 顺序分别测量每个产品各10次(或更多次),并将其测量值记录于“量具线性分析报告”中,然后计算各产品的测量平均值,此值即为每个产品的“观察平均值”。
2 MSA与计量的关系
MSA主要针在现场环境下,由现场控制人员按照《控制计划》要求的频次,对具体的零件使用正确的监视或者测试设备,按照《检验作业指导书》的方法进行有效的检测和监控(即人机料法环等环节),在每个时期,针对不同的目的,采用不同的MSA方法,研究分析每个环节产生的变差(即分离分离各个变差),最后消除或减小变差,使得我们生产的产品满足技术要求。MSA的数学理论基础为《概率与数理统计》。
计量主要是实现单位统一和量值准确可靠的测量,它以保证测量统一和准确为目的。测量环境有严格的控制要求。测量的变差分析的数学理论基础为《误差分析与数据处理》,也是根据《概率与数理统计》原理基础上建立起来的。本文主要指计量体系和管理,不涉及具体计量内部运作,只谈与测量系统的相互关系。
MSA关注对产品技术要求测量的综合反应有影响的结果,用来研究和分析整个测量系统以及影响测量的各个因素。计量的含义则是保证量值传递或溯源准确可靠,而将影响量值的其他分量进行控制,如环境、温度等,更关注的是测量方法。可以这样说:综合研究的是MSA,测量系统分析;只研究测量的是计量,所以也称之为“测量分析”。
3 两个例子
3.1 案例一
盛玉在他的文章《MSA实例分析》中,针对一把高度尺应用MSA分析方法的全过程。
下面通过日常监控分析常用的线性和R&R 的实例。
1、线性———验证一把高度尺,基本内容见下表。
1)在现场取一根曲轴,选其上5 个不同尺寸;
2)选用比高度尺精度高(一般高3 倍以上)的精密三坐标测量出5 个尺寸的基准值;
3)用高度尺分别测量5 个尺寸,每个尺寸重复测12 次
4)输入软件,自动得到结果;
5)接收准则:≤5%接收,≥10%拒收;5%—10%有条件接收;
6) 结果处理:该例中线性自动计算为3%至5%,按照接收准则线性可接收。
若大于5%,我们要从人、机、料、法、环、测几个方面去查找根本原因并改进,若已对产品质量造成影响,还需去追溯造成影响的产品,重新检测,直到满足要求。
2、重复性和再现性,简称R&R
在实际生产应用中,R&R 通常一起分析。如:验证曲轴OP100 综合检具上法兰轴头直径∮88.8(+0.804/+0.004),具体计算如下表所示。
1)按照MSA 计划分别在不同时段收集OP100曲轴共10 根;
2)3 名熟练操作工分别测量10 个工件,每个件重复测3 次;
3)把3 人3 次共90 个测量数据输入计算软件(表2 中有底色部分),则会自动得到结果;
4)接收准则:
a. R&R 低于10%,测量系统可接受;
b. 介于10%到30%之间,基于应用的重要性,该量具可能会被接受;
c. 大于30%,测量系统需要改善,识别出原因并纠正它们;
d. 数据分级数NDC>=5 测量系统可接受。
5)分析结果
前文表格中测量结果明显看出该测量系统不可接受,EV=65.7%、R&R=73.1%且NDC=1。我们测量小组一起到现场查找原因,通过排除法最终找到R&R 超差根本原因如下:
a. %EV=65.7% (计算软件要求%EV<30%),零件安装时有转动,不稳定;
b. 数据分级数(NDC)=1 (计算软件要求NDC>=5,测量软件显示分辨力不够,稳定生产条件下被测件尺寸稳定,分组少。
6)解决方案
针对a. 零件安装时有转动问题,经过现场反复装夹测量,结果差异0.002mm,由于重新加工制作条件不成熟,对这影响量0.002 mm,我们和工艺一起确认采取收紧控制限方法避免;
针对b. NDC 分级数偏低问题,现场排除一切可能影响因素,分析软件仍显示分辨力不够,最终确认是10 件样件产品尺寸太接近造成,也可以说是我们现在的产品质量很稳定。对于NDC 偏低问题,在做MSA 取样时要充分考虑到尺寸范围,如留下换刀或平时偶发时发现的不合格产品。
7)重新取样
找到2 件接近公差限样件,重新测量输入测量软件后计算结果满足要求见下表,表明我们现在的测量系统稳定可靠,不需要去追溯已经测量的产品。
一般情况下如果重复性比再现性大,原因可能是:
1)仪器需要维护;
2)计量检测设备应重新设计来提高刚度;
3)夹紧和检验点需要改进;
4)存在过大的零件变异。
如果再现性比重复性大,原因可能是:
1)评价人需要更好的培训如何使用计量检测设备和数据读取方式;
2)计量检测设备刻度盘上的刻度不清楚或校正不良;
3)需要某种夹具帮助评价人提高使用计量检测设备的一致性。
3.2 案例二
作者洪涛在他的论文《MSA在电能表误差检验中的应用研究》中介绍了MSA方发在分析电能表测量误差中的具体应用过程。
(一) MSA在电能表误差检验中具体应用
(1) 研究方案
在测量系统分析中,准确性特性一般可通过检验装置的量值传递或对比来解决,目前电能表制造企业都已采用。本文重点介绍测量系统的R&R分析。本设计方案和具体实施都是依托国内某知名电能表生产企业的计量测试中心的电能表误差检验系统展开的,
具有一定的代表性。
(二) 稳定条件的确定
进行MSA分析前提是系统处于稳定状态。本文的研究涉及的稳定性包括两个方面:一是检验装置的稳定性,二是电能表的稳定性。综合起来就是电能表误差检验系统的稳定性。方案选择了7块电能表和3个检验装置作为研究对象。对于稳定性的研究,用标准试验室的标准装置(误差等级为0.01级,中国科学研究院比对校准)测试所选7块表的0.1Ib点误差:每块表测试5次,每次读取10个数据,共取得35组350个数据,每次测试前预热十分钟。整个试验是在标准试验室进行的,试验的温度都是严格控制在20±3℃以内。
试验所取得7块表的数据便是其真值,对数据修约后进行分析,做出Xbar- R控制图,如下图所示,进行分析和判定,发现2号表的误差不稳定,有多个均值统计量和极差统计量超出控制限,淘汰2号表用剩下的6块表做剩下的试验和研究。
采用同样的方法,对三台检验装置进行稳定性测试和判定,结果3台检验装置均符合要求。
(三) 重复性和再现性试验及研究
由于现在的电能表误差检验系统已经实现了测试、读数、计算、显示的自动化,人的影响因素已经消除,针对电能表误差检验系统而言,重复性是指在用同一检验装置检测同一批次电能表时,测试结果之间的一致程度。再现性是指用不同检验装置检测同一批次电能表时,测试ç...
数据分析记录表
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并