- ?
数据分析可视化重要的是图表思维,而不是工具
情剩
展开
欢迎关注天善智能,我们是专注于商业智能BI,大数据,数据分析领域的垂直社区,学习,问答、求职一站式搞定!
本文作者:天善智能社区数据小魔方杜雨
天善智能社区博客地址:https://hellobi/u/datamofang/articles
很久没有作图了,主要是一时找不到应该练手的案例。
然后昨天逛网易数独栏目的数据新闻,看到一幅还不错的案例,对于我来说值得一试,然后就手痒给照葫芦画瓢弄出来了。(主要是其中涉及到的细节处理很麻烦)
当然过程是花了些时间的,主要是需要慢慢打磨其中的细节,需要利用很多技术来处理图形版面的交接位置。
令我感触最深的是,想要用ggplot2随心所欲的画图,ggplot2掌握的再熟练,也只是勉强过的了技术关,而图表背后的思维和结构更考验人,更具有挑战性。
好在我学习R语言之前,就已经利用Excel临摹了大量的高难度信息图,这一点可视化素养的积累,再结合对ggplot2勤加练习获得的图感,分分钟做出一副自己喜欢的作品,已经不在话下了。
以下是该案例涉及到的扩展包:
library("plyr")
library("tidyr")
library("ggthemes")
library("sca")
library("dplyr")
library("showtext")
library("Cairo")
library("grid")
font.add("myfont","msyh.ttc")
font.add("myfzhzh","方正正粗黑简体.TTF")
我把该案例切割成了两部分来做:
(实际上如果放在一个图里做也是可以实现的,无非是多写一些代码罢了,但是涉及到颜色标度重复的问题,一时半会儿找不到解决方案,为了更加逼真的还原案例效果,我决定分开来做)。
原图中的下半部分(条形图)(以下简称模块1)
上半部分(堆积柱形图+连接带)(以下简称模块2)
导入数据源:
tea_data<-read.csv("D:/R/File/tea_data.csv",stringsAsFactors=FALSE,check.names=FALSE)
tea_data$State[12]<-"印度尼\n西亚"
tea_bump是上半部分(模块2)中堆积柱形图的数据源,我没有使用传统的堆积柱形图去做,而是使用了矩形几何对象,所以数据源中需要指定X轴起始点,Y轴起始点。
tea_bump<-na.omit(tea_data[,c("State","Yield","Ratio")])
tea_bump<-arrange(tea_bump,-Yield)
other_Ratio<-1-sum(tea_bump$Ratio)
other_Yield<-sum(tea_bump$Yield)/sum(tea_bump$Ratio)-sum(tea_bump$Yield)
data1<-data.frame(State="其他",Yield=other_Yield,Ratio=other_Ratio)
tea_bump<-rbind(tea_bump,data1)
tea_bump$end<-cumsum(tea_bump$Yield)
tea_bump$start<-c(0,tea_bump$end[1:nrow(tea_bump)-1])
tea_bump$id<-1:nrow(tea_bump)
tea_bump<-merge(tea_bump,tea_data[,c("State","Consum")],by="State",all.x=TRUE)
tea_bump<-arrange(tea_bump,-Yield)
以下是下半部分柱形图的数据源,同样我也没有使用普通的柱形图几何对象去做,而是使用了范围线图(geom_linerange),这样可以节省调整步骤,但须额外设置线的起始点。
tea_bar<-tea_data[,c("State","Consum")]
tea_bar$id<-1:nrow(tea_bar)
colorpal<-ifelse(tea_data$State %in% tea_bump$State,"#B4BFB4","#E5E5E5")
library("ggplot2")
library("showtext")
library("Cairo")
底部柱形图对象:
(因为需要拼图,所以图形对象要临时存储)
p1<-ggplot()+
geom_hline(aes(yintercept=1:7*400),colour="grey",linetype=2)+
geom_linerange(data=tea_bar,aes(x=id,ymin=max(tea_bar$Consum)-Consum,ymax=max(tea_bar$Consum),colour=Consum),size=24)+
geom_point(data=tea_bar,aes(x=id,y=max(tea_bar$Consum)+165,fill=colorpal),shape=22,colour="white",size=37.5)+
geom_text(data=tea_bar,aes(x=id,y=max(tea_bar$Consum)+165,label=State),size=6,family="myfont",vjust=.5)+
geom_text(data=tea_bar,aes(x=id,y=max(tea_bar$Consum)-Consum+80,label=Consum),size=6,family="myfont",vjust=0.5,colour="white")+
annotate("text",x =5,y=80,label="各国每年人均茶叶消费量(克)",family="myfzhzh",size=11,colour="#515551")+
ylim(0,4800)+
geom_linerange()+
guides(fill=FALSE,colour=FALSE)+
scale_colour_gradient(low="#A1C997",high="#47734A")+
scale_fill_manual(values=c("#B4BFB4","#E5E5E5"))+
theme_map(base_family="myfont") %+replace%
theme(
plot.margin=unit(c(0,1.5,0,1.5), "cm"),
)
以下数据是构造模块2辅助数据:
(上半部分堆积柱形图的下侧连接带数据)的辅助数据,我打算使用多边形几何对象了来模拟那些参差交错的连接带。这就意味着我要找到每一条带子,即四边形的四个拐点坐标,并按顺序排列。)
如果你看的不是很懂,实属正常,这种笨拙的想法,我也不知道是从哪里学来的。
tea_chord<-data.frame(State=tea_data$State)
tea_chord$id<-1:nrow(tea_chord)
tea_chord$mean<-sum(tea_bump$Yield)/nrow(tea_chord)
tea_chord$xend<-cumsum(tea_chord$mean)
tea_chord$xstart<-c(0,tea_chord$xend[1:nrow(tea_chord)-1])
tea_chord_data<-tea_chord[tea_chord$State %in% tea_bump$State,c("State","xstart","xend")]
tea_chord_data<-merge(tea_chord_data,tea_bump[tea_bump$State!="其他",c("State","start","end")],by="State")
tea_chord_data<-tea_chord_data[,c("State","start","end","xend","xstart")]
tea_chord_newdata<-data.frame(t(tea_chord_data),stringsAsFactors=FALSE)
names(tea_chord_newdata)<-tea_chord_data$State;tea_chord_newdata<-tea_chord_newdata[-1,]
rownames(tea_chord_newdata)<-NULL
tea_chord_newdata$order<-1:nrow(tea_chord_newdata)
tea_chord_newdata_final<-gather(tea_chord_newdata,State,long,-order)
tea_chord_newdata_final$lat<-5
tea_chord_newdata_final$lat[tea_chord_newdata_final$order==3|tea_chord_newdata_final$order==4]<--5
tea_chord_newdata_final$long<-as.numeric(tea_chord_newdata_final$long)
所以说上半部分的堆积柱形图(附加连接带)其实是用了两份不同的数据源模拟出来的。
以下是模块2的可视化代码部分:
p2<-ggplot()+
geom_rect(data=tea_bump,aes(xmin=start,xmax=end,ymin=5,ymax=15,fill=Consum),colour="white")+
geom_polygon(data=tea_chord_newdata_final,aes(x=long,y=lat,group=State),fill="#B1C6B0",colour=NA,size=.25,alpha=.8)+
labs(title="全国茶叶年产量406.7(万吨)")+
geom_text(data=tea_bump[tea_bump$State!="其他",],aes(x=start+5.5,y=13,label=round(Yield,1)),size=5.5,family="myfont",vjust=0.5,colour="white")+
geom_text(data=tea_bump[tea_bump$State!="其他",],aes(x=start+6,y=7,label=percent(Ratio,d=1,sep="")),size=5.5,family="myfont",vjust=0.5,colour="white")+
scale_fill_gradient(low="#A1C997",high="#47734A",na.value="#E5E5E5",guide=FALSE)+
theme_map() %+replace%
theme(
plot.title=element_text(size=35,family="myfzhzh",hjust=.5)
)
有了上下两部分的对象,剩下的就好办了,无非就是拼接起来嘛,但是拼接的过程相当考验人的耐性和毅力,不适合浮躁型的人来做。
CairoPNG(file="E:/bump_bar.png",width=1550,height=1200)
showtext.begin()
vie<-viewport(width=1,height=0.215,x=0.5,y=0.8)
p1;print(p2,vp=vie)
grid.text(label="全球茶叶消费排行榜\n喝茶最多的不是中国人",x=.80,y=.20,gp=gpar(col="black",fontsize=45,fontfamily="myfzhzh",draw=TRUE,just="right"))
grid.text(label="数据来源:Euromonitor、国际茶叶委员会(ITC)",x=.80,y=.13,gp=gpar(col="black",fontsize=20,fontfamily="myfzhzh",draw=TRUE,just="right"))
showtext.end()
dev.off()
为了与原图对比,我使用PS修饰了一些细节:
做完回头想想,做这个图我也是真够无聊的,大概要耗费半天的时间去调试,不过调试的过程能学到的东西倒是很有趣,最近看了不起的匠人,感觉多少有些被感染到了,这算不算是强迫症~_~
天善学院svip正火爆报名中!包含Excel BI、Python3爬虫案例、Python机器学习、Python数据科学家、大数据体系、数据分析报告、数据分析师体系、深度学习、R语言案例共10套课程,其他课程只需五折即可,欢迎大家关注报名!
- ?
Excel|数据分析和展示数据分析结果的标准格式与制表习惯
于四娘
展开
1 用于展示数据分析结果的表格
以下是同样的数据、不同的格式所展示出的数据可读性:
很明显,第二份表格更具有可读性,显得一目了然,而不是杂乱无章。
是怎么做到的呢?
1.1 行高设为“18”(字体“11”保持默认);
1.2 数字字体设为Arial;
1.3 项目下的细项进行了缩排(缩进栏宽设为“1”);
1.4 数字列调整为相同宽度,其他列视内容调整宽度。且在上、下、左、右都有空白;
1.5 表格框线:上下粗,其余细或虚,保留横线,去掉竖线,具不显示网格线;
1.6 文字靠左对齐,数字靠右对齐;
1.7 善用背景色凸显重点;
1.8 一列数据尽量不要包括复合的内容,如将“单位”放到单独的列。
2 内容按手动输入、引用、公式区分字体颜色
举例
字体颜色
手动输入的数字
50
黑色
计算公式的数字
=A1+A2
绿色
引用其它工作表的内容
=Sheet3!A1
蓝色
如:
3 用于进行数据分析的事务性数据
具体内容请见《Excel技巧 | 高效的数据分析需要良好的制表习惯》。
- ?
「数据分析」图表篇:散点图
采珊
展开
图表对于数据分析师的作用是非常强大的。
图表是展示工作成果的利器,也是分析工作的精华。
字不如表,表不如图。
大概能代表了大部分的情况。
一、工具
新手做图表常用的工具:
百度echart
优点是配色比较好看。
Excel
基本可以完成大部分图表,操作难度这三者里最大。
Power BI
图表利器,配色的话一言难尽,建议自己下载配色方案。Mac用户需要装windows虚拟机。
二、常用图表
散点图的应用貌似并没有柱形图、饼图那么常见,
但散点图往往更能从大量的无规律数据中发现规律。
我们在拿到数据后,第一件事,就是要观察数据。
散点图就可以帮助我们做这件事。
单纯的散点图
这是一张最基础的散点图。由X轴、Y轴组成了单一象限,数据在象限中按坐标轴排列。
加入回归线的散点图
为了更好的看清楚数据规律,往往会在散点图中加入回归线。
回归线可以帮助我们更好的观察数据趋势。
下面介绍集中辅助线,可以根据业务需要添加。
带折线的散点图
带水平辅助线的散点图
带辅助坐标系的散点图
有时,还会增加散点图的维度。
三维散点图
在数据种类需要区分时,需要增加数据的维度。
按男、女分类数据的散点图
散点图与其他图结合使用,可以更直观的说明问题。
散点图+地图热力图
散点图+箱线图
散点图变种:气泡图
散点图应用
举了这么多散点图应用的案例,相信大家已经对散点图的应用有了一定的了解。之后会出如何制作散点图的教程。请多多关注支持哦~
- ?
Excel数据分析表格你能够玩转吗?看看你属于哪一级
Soller
展开
小R刚毕业,每天都在公司忙到10点半回家。
作为室友的我,总是打趣地问他:“是不是又在公司蹭空调蹭网络,干嘛不早点回来陪我吃鸡!”
没想到小R低下头落寞地抱怨道:“我也想早点回来,可是我真的搞不定啊!”
原来,小R每天的工作标配就是统计数据。可同事们十几分钟就能轻松搞定的Excel表格,他经常要加几个小时班才能勉强完成。刚开始,他以为是自己不够熟练,多多练习就好了。没想到埋头苦练了半个月,他还是全组最慢的那个,每天被领导催到怀疑人生,甚至被质疑工作能力。
没有对比就没有伤害。看着旁边妹子敲几下键盘就能轻松搞定表格,小R开始惧怕做Excel和数据统计。
如今,几乎所有公司在招聘时都离不开这条要求:熟练使用Excel,精通数据分析者优先。
做方案、汇报工作、数据分析、总账录入、项目进度、工作记录、写代码、帮助记忆、思维导图.......Excel几乎能解决你工作中的所有问题,它不仅仅是某一职业的必备技能,而真实涵盖所有行业:
做行政,你要学会做考勤表;做财务,你要学会做财会报表;做销售,你要学会做销售业绩表;做运营,你要数据分析、工作汇报;做数据分析师,Excel玩得6也是最最最基本的条件.....
大数据是眼下非常时髦的热词,同时也催生出了一些与大数据处理相关的职业,数据分析师便是其中之一。由于专业技能和量化的数据分析为客户或所在公司控制决策分析、保证利益最大化,“数据分析师”一职备受各界青睐,甚至被视为21世纪的黄金职业。
虽然发展前景大好,但很多想要转行数据分析的小白心里多少都会有些疑惑:不会R、Python、SPSS、Tableau,是不是做不了数据分析师?
事实上,精通Excel,对于转行数据分析来说相当重要。因为Excel拥有最大的客户群体,基本上所有的企业、个人的电脑中装的都是office,这也就意味着90%以上使用电脑的人,都会用到Excel,即便如BAT这样的企业,在处理百万级、千万级数据的时候,也会优先使用Excel。
那么,在没有统计学、数学、计算编程等基础的情况下,如何只用Excel,成功转行成为数据分析师呢?
这里就不得不介绍三款用Excel就可以实现数据分析的插件:Power Query(数据查询)、Power Pivot(数据建模)、Power View(数据可视化)。
这三个模块组成了数据分析全过程,这个过程就好比烹饪过程:
第一个模块数据查询——Power Query。与数据源直接对接,就像获取新鲜的食材,对食材进行清洗、分类、整理,使其达到准备入锅的使用状态。这一步非常重要,因为如果食材不新鲜,那么再厉害的大厨也不可能做出一道健康的美味,所以好的数据源是成功的一半。
第二个模块是数据建模——Power Pivot。这一步是数据分析过程中最具有技术含量的核心部分。我们把数据组合起来实现不同维度的分析,就像把食物组合起来利用烹、炸、煎、炒等方式,再添加油、盐、酱、醋等调料,以烹制出想要的味道。
但是光有味道是不够的,最后我们要呈现给顾客的是一道色、香、味俱全的菜,是否能以视觉效果吸引顾客品尝你的美味,这就要看第三个模块——Power View(数据可视化)的功力了。
例如,如果以前你的做表是这样的 :
那现在通过Power View几秒钟就可以做成这样:
是不是相当神奇?!
无论你是像小R一样的职场小白想要提高工作效率实现逆袭,还是零基础转行成为高大上的数据分析师,精通Excel可以让你彻底告别被数据搞晕的日子,实现加薪不加班!
Excel这么重要,如何在短时间内熟练掌握呢?这有一套为你打造的Excel精品课程:容大教育《Excel速成班——数据处理与分析实战》在线课程,教你用Excel实现数据采集、数据转换和清洗、数据分析与建模等,关注容大教育IT培训机构百家号获取学习资料!
- ?
MSA数据分析方法和应用案例
Nimat
展开
测量系统是用来对被测特性定量测量或定性评价的仪器或量具、标准、操作、方法、夹具、软件、人员、环境和假设的集合; 是用来获得测量结果的整个过程。从这个定义中可以看出, 测量过程实际上是一个制造数据的过程,获得正确的测量数据则是保证产品质量的第一步。如果不能科学地评价测量系统产生的数据的可靠性, 就无法对测量系统的有效性进行控制, 质量管理和控制就失去了最基本的前提。因此,在ISO/TS16949汽车行业质量体系标准中,测量系统分析(简称MSA)被列为该标准的五大工具之一。
测量系统分析(MSA) 的目的是确定测量数据的可靠性, 它实际上是一个对测量系统的监督检查程序, 在一定程度上可以看作是一个检验产品控制计划满足程度的把关程序。即对已判定为合格的零件进行抽样检查, 经过科学的统计理论分析, 找出因测量系统因素导致不合格的因素, 并加以整改, 逐渐减少产生不合格产品因素的存在,从而达到控制产品质量的最终目的。
1 基本MSA方法
测量系统分析,顾名思义针对的是整个测量系统的稳定性和准确性,它的核心是分析
测量系统的位置变差、宽度变差。在位置变差中包括测量系统的偏倚、稳定性和线性;在宽度变差中包括测量系统的重复性、再现性。测量系统的偏倚、稳定性、线性、重复性和再现性就是人们通常所说的“五性”。因此,MSA 可简单概括为:分析整个测量系统(仪器或量具、标准、操作、方法、夹具、软件、人员、环境和假设的集合)在测量过程中存在哪些风险和误差的过程。MSA采用的数据分析方法有:独立样本法、图表法、极差法、方差分析法等。按照测量系统分析过程前后顺序,相关方法摘记如下。
1.1 识别数据类型 在进行测量系统分析前首先要识别测量数据的类型,了解了数据的类型才能使用合适的方法进行测量系统分析。一般数据类型有两种:计数型数据和计量型数据。计数型数据是指不能连续取值的,如砂眼数、裂纹处、疵点数等。计量型数据是可以连续取值的,如长度、尺寸、温度等。
1.2 选定测量系统分析方法 测量系统分析常用的方法有Gage R&R研究、专家再评估、检验一致性和专家循环研究。重点研究Gage R&R。Gage R&R方法主要用于计量型数据,评定标准是用Gage R&R值。一般Gage R&R值在小于10%以下可接受,Gage R&R值在10%-30%之间为灰色区域,也许可接受,Gage R&R值大于30%,测量系统需改进。同时还要看可区分数NDC,当NDC大于等于5时,通常认为测量系统可靠。用Gage R&R值作为评定标准时还要考虑零件的关键特性,对关健特性测量系统分析结果Gage R&R值大于15%时,我们就要考虑对这个测量系统进行改进。
1.3 测量系统的重复性和再现性分析方法(简称%GR&R%或R&R) 确定研究主要变差形态的对象/量具(如:游标卡尺、电子秤、硬度计、千分尺等)。工序量具、产品和质量特性;选择使用极差法,均值和极差法中的其中一种方法对检验、测量和试验设备进行分析;从代表整个工作范围的过程中随机抽取样品进行;测量系统分析的工作人员在进行检验、测量和试验设备测量系统的重复性和再现性分析时,必须先对被分析的检验、测量和试验设备进行零件评价人平均值和重复性极差分析,同时所分析的零件评价人平均值和重复性极差之结果必须均受控方可进行被检验、测量和试验设备测量系统的重复性和再现性分析工作;否则该检验、测量和试验设备的测量系统不能检查出零件间的变差且不能将其用于过程控制中。
1.4 平均值和重复性极差分析 1)选择2-3个操作员(至少2人)在全然不知情的状况下利用校准合格的量具对随机抽取的5-10个样品进行盲测,每个操作员对同一样品的同一特性在盲测的情况下重复测量2-3次。 2)操作员或进行%R&R测量系统分析的工作人员将所测量的结果记录于“零件评价人平均值和重复性极差控制图”上。 3)负责组织此项测量系统分析研究的工作人员,依据“零件评价人平均值和重复性极差控制图”上的数据和产品质量特性规格进行计算和分析,并将其分析的结果记录于“零件评价人平均值和重复性极差控制图”上。
1.5 均值和极差法(X-R) 1)选择2-3个操作员(至少2人)在全然不知情的状况下利用校准合格的量具对随机抽取的5-10个样品进行盲测,每个操作员对同一样品的同一特性重复测量2-3次。 2)操作员或进行%R&R测量系统分析的工作人员将所测量的结果记录于“量具重复性和再现性X-R分析数据表”上。 3)负责组织此项测量系统分析研究的工作人员,依据“量具重复性和再现性X-R分析数据表”上的数据和产品质量特性/规格进行计算,并将其记录于“量具重性和再现性X-R分析报告”上。
1.6 极差法(R) 1)选取两位评价人和5个产品进行分析,每个评价人对每个产品进行盲测一次,并将测量结果记录于“量具极差法分析表”中(每个操作员应熟悉和了解使用量具的一般操作程序,避免应操作不一致而影响测量系统的可靠性),并评估不同操作员对量具使用的熟练程度; 2)针对重要特性(尤其指有特殊特性符号的)测量所使用量具的精度应是被测量产品公差的1/10(即其最小刻度应能读到1/过程变差或规格公差较小者),以避免量具的分辩力不足,而一般特性测量所使用量具的精度应是被测量产品公差的1/5;
3)负责组织此项%R&R测量系统分析研究的工作人员,依据“量具极差法分析表”的数据和产品质量特性/规格进行计算,并将其计算结果记录于“量具极差法分析表”上;必要时,可将其作成X-R控制图。
4)%R&R接受准则: a)、%R&R<10%,可接受;b)、10%≤%R&R≤30%,依据量具的重要性、成本及维修费用等因素,决定是否可接受或不可接受;c)、%R&R>30%,不能接受,必须进行改进。
1.7 线性分析法
在测量系统工作范围内选定5个产品,它们的测量值应覆盖量具工作范围;在计量室或工具间用全尺寸检验设备(精密量具)测量每个产品10次,并计算其平均值,然后将其确定为“基准值”,同时确定它们各自所取得的“基准值”是否覆盖了被检量具的工作范围;让一位经常使用该量具的操作员(评价人)对5个产品以盲测的方式按随机抽取 顺序分别测量每个产品各10次(或更多次),并将其测量值记录于“量具线性分析报告”中,然后计算各产品的测量平均值,此值即为每个产品的“观察平均值”。
2 MSA与计量的关系
MSA主要针在现场环境下,由现场控制人员按照《控制计划》要求的频次,对具体的零件使用正确的监视或者测试设备,按照《检验作业指导书》的方法进行有效的检测和监控(即人机料法环等环节),在每个时期,针对不同的目的,采用不同的MSA方法,研究分析每个环节产生的变差(即分离分离各个变差),最后消除或减小变差,使得我们生产的产品满足技术要求。MSA的数学理论基础为《概率与数理统计》。
计量主要是实现单位统一和量值准确可靠的测量,它以保证测量统一和准确为目的。测量环境有严格的控制要求。测量的变差分析的数学理论基础为《误差分析与数据处理》,也是根据《概率与数理统计》原理基础上建立起来的。本文主要指计量体系和管理,不涉及具体计量内部运作,只谈与测量系统的相互关系。
MSA关注对产品技术要求测量的综合反应有影响的结果,用来研究和分析整个测量系统以及影响测量的各个因素。计量的含义则是保证量值传递或溯源准确可靠,而将影响量值的其他分量进行控制,如环境、温度等,更关注的是测量方法。可以这样说:综合研究的是MSA,测量系统分析;只研究测量的是计量,所以也称之为“测量分析”。
3 两个例子
3.1 案例一
盛玉在他的文章《MSA实例分析》中,针对一把高度尺应用MSA分析方法的全过程。
下面通过日常监控分析常用的线性和R&R 的实例。
1、线性———验证一把高度尺,基本内容见下表。
1)在现场取一根曲轴,选其上5 个不同尺寸;
2)选用比高度尺精度高(一般高3 倍以上)的精密三坐标测量出5 个尺寸的基准值;
3)用高度尺分别测量5 个尺寸,每个尺寸重复测12 次
4)输入软件,自动得到结果;
5)接收准则:≤5%接收,≥10%拒收;5%—10%有条件接收;
6) 结果处理:该例中线性自动计算为3%至5%,按照接收准则线性可接收。
若大于5%,我们要从人、机、料、法、环、测几个方面去查找根本原因并改进,若已对产品质量造成影响,还需去追溯造成影响的产品,重新检测,直到满足要求。
2、重复性和再现性,简称R&R
在实际生产应用中,R&R 通常一起分析。如:验证曲轴OP100 综合检具上法兰轴头直径∮88.8(+0.804/+0.004),具体计算如下表所示。
1)按照MSA 计划分别在不同时段收集OP100曲轴共10 根;
2)3 名熟练操作工分别测量10 个工件,每个件重复测3 次;
3)把3 人3 次共90 个测量数据输入计算软件(表2 中有底色部分),则会自动得到结果;
4)接收准则:
a. R&R 低于10%,测量系统可接受;
b. 介于10%到30%之间,基于应用的重要性,该量具可能会被接受;
c. 大于30%,测量系统需要改善,识别出原因并纠正它们;
d. 数据分级数NDC>=5 测量系统可接受。
5)分析结果
前文表格中测量结果明显看出该测量系统不可接受,EV=65.7%、R&R=73.1%且NDC=1。我们测量小组一起到现场查找原因,通过排除法最终找到R&R 超差根本原因如下:
a. %EV=65.7% (计算软件要求%EV<30%),零件安装时有转动,不稳定;
b. 数据分级数(NDC)=1 (计算软件要求NDC>=5,测量软件显示分辨力不够,稳定生产条件下被测件尺寸稳定,分组少。
6)解决方案
针对a. 零件安装时有转动问题,经过现场反复装夹测量,结果差异0.002mm,由于重新加工制作条件不成熟,对这影响量0.002 mm,我们和工艺一起确认采取收紧控制限方法避免;
针对b. NDC 分级数偏低问题,现场排除一切可能影响因素,分析软件仍显示分辨力不够,最终确认是10 件样件产品尺寸太接近造成,也可以说是我们现在的产品质量很稳定。对于NDC 偏低问题,在做MSA 取样时要充分考虑到尺寸范围,如留下换刀或平时偶发时发现的不合格产品。
7)重新取样
找到2 件接近公差限样件,重新测量输入测量软件后计算结果满足要求见下表,表明我们现在的测量系统稳定可靠,不需要去追溯已经测量的产品。
一般情况下如果重复性比再现性大,原因可能是:
1)仪器需要维护;
2)计量检测设备应重新设计来提高刚度;
3)夹紧和检验点需要改进;
4)存在过大的零件变异。
如果再现性比重复性大,原因可能是:
1)评价人需要更好的培训如何使用计量检测设备和数据读取方式;
2)计量检测设备刻度盘上的刻度不清楚或校正不良;
3)需要某种夹具帮助评价人提高使用计量检测设备的一致性。
3.2 案例二
作者洪涛在他的论文《MSA在电能表误差检验中的应用研究》中介绍了MSA方发在分析电能表测量误差中的具体应用过程。
(一) MSA在电能表误差检验中具体应用
(1) 研究方案
在测量系统分析中,准确性特性一般可通过检验装置的量值传递或对比来解决,目前电能表制造企业都已采用。本文重点介绍测量系统的R&R分析。本设计方案和具体实施都是依托国内某知名电能表生产企业的计量测试中心的电能表误差检验系统展开的,
具有一定的代表性。
(二) 稳定条件的确定
进行MSA分析前提是系统处于稳定状态。本文的研究涉及的稳定性包括两个方面:一是检验装置的稳定性,二是电能表的稳定性。综合起来就是电能表误差检验系统的稳定性。方案选择了7块电能表和3个检验装置作为研究对象。对于稳定性的研究,用标准试验室的标准装置(误差等级为0.01级,中国科学研究院比对校准)测试所选7块表的0.1Ib点误差:每块表测试5次,每次读取10个数据,共取得35组350个数据,每次测试前预热十分钟。整个试验是在标准试验室进行的,试验的温度都是严格控制在20±3℃以内。
试验所取得7块表的数据便是其真值,对数据修约后进行分析,做出Xbar- R控制图,如下图所示,进行分析和判定,发现2号表的误差不稳定,有多个均值统计量和极差统计量超出控制限,淘汰2号表用剩下的6块表做剩下的试验和研究。
采用同样的方法,对三台检验装置进行稳定性测试和判定,结果3台检验装置均符合要求。
(三) 重复性和再现性试验及研究
由于现在的电能表误差检验系统已经实现了测试、读数、计算、显示的自动化,人的影响因素已经消除,针对电能表误差检验系统而言,重复性是指在用同一检验装置检测同一批次电能表时,测试结果之间的一致程度。再现性是指用不同检验装置检测同一批次电能表时,测试...
- ?
做好数据分析必备的5种典型可视化图表|技能卡片No.1
sw
展开
文/GrowingIO
发布于2天前
阅读1524
评论0
喜欢0
标签:
产品经理
数据分析
单图 | 最基础的可视化数据分析工具
对产品和运营来说,和数据打交道成了日常。总结下来,你的需求具体是什么呢?
1. 数据监控
每次听到老板说,今天浏览量掉了很多。你就心头一紧,老板都知道了你还不知道?
老板:不应该。
产品和运营一定要对网站每天的 PV、UV 等总体数据有一个直观的把握,包括它们的数值、趋势等。用 GrowingIO 的单图建立图表,能让信息传达更迅速、直观,一旦出现数据过高或过低的情况,就可以马上拆解,及时介入。再也不用等老板来告诉你今天数据又掉了。
2. 数据分析,拆解问题
数据掉了,什么原因呢?你又心头一紧,可能是这届用户不行?
老板:加上「可能」,就是你无能。
当一个总体数据出现异常,比如浏览量突然降低,原因可能有很多,产品本身问题、运营问题等等。这时候就需要对浏览量这一指标进行不同维度的拆解,比如各个访问来源的变化,各个浏览设备的变化等,GrowingIO 的单图提供多种指标和维度,能让你准确定位问题,迅速解决问题。
3. 可视化展示
来,给团队同步一下项目进展。你还是心头一紧,毕竟只有一堆冷冰冰的数字啊。
老板:hmmm,不是很想看。
在集体协作中,你需要将分析结果更友好地展示给其他人,比如写周报、项目进展汇报等。而如何更好地呈现你的分析结果呢?来,接下来我们看图说话
一、趋势图
趋势分析是最基础的图表分析,包括线图、柱状图、堆积图等多种形式。
1. 线图
线图可以观察一个或者多个数据指标连续变化的趋势,也可以根据需要与之前的周期进行同比数据分析。
2. 柱状图 & 堆积图
柱状图可以观察某一事件的变化趋势;还可以同时将整体拆分可以做成堆积图,同时观察到部分所占比重及变化趋势。
产品经理和运营人员通过趋势图分析流量的实时走向,如每日 PV、UV、DAU 等基本数量指标以及停留时长、平均访问页面数等质量指标,可以及时把握产品的变化趋势。一旦趋势周期对比发生异常(异常高和异常低),我们需要及时介入排查原因、解决问题。
二、频数图
根据业务需求对指标按照一定维度拆分,对比不同组别的频数,便于分清轻重缓急。
条形图清晰展示了用户在不同类别上的频数,并且按照数量从大到小排序。上图展示的是某产品用户使用浏览器的频数分布,在资源有限的情况下产品可以先适配 Chrome 和 IE 浏览器以提升绝大部分用户体验。
上面的双向条形图展示了某 B 端产品的客户平均停留时长极端情况(非常高和非常低),企业 1-5 非常活跃,可以让运营人员促进客户增购、续约,而企业 6-10 活跃度非常低,用户即将流失,需要运营人员立刻介入干预。
三、比重图
比重分析主要是用来了解不同部分占总体的比例。横向比较,扇形图、环形图可以满足这类需求;纵向比较,百分比堆积图可以显示不同部分所占比例的趋势变化。
1. 环形图
「环形图」显示了某节点访问用户来源渠道比例。
2. 百分比堆积图
「百分比堆积图」动态显示了不同渠道比例的变化趋势,市场或者运营人员可以据此动态优化我们的资源投放。
四、表格
表格信息密集,可以同时分析多维度、多指标数据,适合对数据敏感的人群使用。虽然表格能看到具体的数值,但是不能直观看到趋势、比重。
通过表格不难发现,移动端访问用户占了非常大的比例,但是跳出率非常高。这样的表格数据启示我们有必要优化移动端产品,提升整体访问深度。
五、其他表格
下面介绍的是气泡图,气泡图用来展示一个事件与多个维度之间的关系,如分析 B 端产品客户成单周期与客户活跃度、登录账号数量之间的关系。
除了上述常见的图表,还有散点图、箱线图、股价图、雷达图等图表,在此不一一赘述。
六、写在最后
不同的图表样式可以满足你不同的分析需求,你可以根据自己的目的来选取最合适的指标、维度和图表样式。工具的作用在于,让上手过程更快更顺畅一些,让更多更高级的需求能够被满足和呈现。
GrowingIO 的单图功能提供了很低的门槛,以及很高的自由度。数据分析小白可以用单图做各种基础的数据分析,生成各种报表;对数据分析有深刻理解的人,可以将各种维度指标组合,针对业务场景做出极具洞察力的数据报表。
注:文中所有图表,皆来源于硅谷新一代用户行为数据分析工具 - GrowingIO。
本文由 @GrowingIO 原创发布于产品壹佰,未经许可,禁止转载。
- ?
惊艳全球数据行业的16个数据可视化案例
qicaihong
展开
数据是非常强大的。当然,如果你能真正理解它想告诉你的内容,那它的强大之处就更能体现出来了。
通过观察数字和统计数据的转换以获得清晰的结论并不是一件容易的事。必须用一个合乎逻辑的、易于理解的方式来呈现数据。
谈谈数据可视化。人类的大脑对视觉信息的处理优于对文本的处理——因此使用图表、图形和设计元素,数据可视化可以帮你更容易的解释趋势和统计数据。
但是,并非所有的数据可视化是平等的。(点击“为什么大多数人的图表和图形看起来像废话”了解我想表达的意思)
那么,如何将数据组织起来,使其既有吸引力又易于理解?通过下面的16个有趣的例子获得启发,它们是既注重风格和也注重内容的数据可视化案例。
什么是数据可视化?
数据可视化是指将数据以视觉形式来呈现,如图表或地图,以帮助人们了解这些数据的意义。
文本形式的数据很混乱(更别提有多空洞了),而可视化的数据可以帮助人们快速、轻松地提取数据中的含义。用可视化方式,您可以充分展示数据的模式,趋势和相关性,而这些可能会在其他呈现方式难以被发现。
数据可视化可以是静态的或交互的。几个世纪以来,人们一直在使用静态数据可视化,如图表和地图。交互式的数据可视化则相对更为先进:人们能够使用电脑和移动设备深入到这些图表和图形的具体细节,然后用交互的方式改变他们看到的数据及数据的处理方式。
感到兴奋了吗?让我们来看一些不错的交互和静态数据可视化的例子。
交互数据可视化的实例
1)为什么会有“巴士群”现象
这里有一个关于复杂数据集的很好的例子,它看起来感觉像一个游戏。在这个例子里,Setosa网站为我们呈现了“巴士群”现象是如何发生的,即,当一辆巴士被延迟,就会导致多辆巴士在同一时间到站。
只用数字讲述这个故事是非常困难的,所以取而代之的是,他们把它变成一个互动游戏。当巴士沿着路线旋转时,我们可以点击并按住一个按钮来使巴士延迟。然后,我们所要做的就是观察一个短暂的延迟如何使巴士在一段时间以后聚集起来。
2)世界上的语言
这个由DensityDesign设计的互动是个令人印象深刻的成果,它将世界上众多(或者说,我们大多数人)的语言用非语言的方法表现出来。一共有2678种。
这件作品可以让你浏览使用共同语言的家庭,看看哪些语言是最常用的,并查看语言在世界各地的使用范围。这是一种了不起的视觉叙事方法:将一个有深度的主题用一种易于理解的方式解读。
3)按年龄段分布的美国人口百分比
这是如何以令人信服的方式呈现一种单一的数据的好榜样。Pew Research创造了这个GIF动画,显示随着时间推移的人口统计数量的变化。这是一个好方法,它将一个内容较多的故事压缩成了一个小的package。
此外,这种类型的微内容很容易在社交网络上分享或在博客中嵌入,扩大了内容的传播范围。如果你想自己用Photoshop做GIF,这里有一个详细的教程。
4)NFL(国家橄榄球联盟)的完整历史
体育世界有着丰富的数据,但这些数据并不总是能有效地呈现(或者准确的说,对于这个问题)。然而,FiveThirtyEight网站做的特别好。在下面这个交互式可视化评级中,他们计算所谓“等级分” – 根据比赛结果对球队实力进行简单的衡量 – 在国家橄榄球联盟史上的每一场比赛。总共有超过30,000个评级。观众可以通过比较各个队伍的等级来了解每个队伍在数十年间的比赛表现。
5)Google Flights 上的美国感恩节
下面是将一段时间内在空中移动的物体进行可视化的好方法。这是由Google Trends驱动的项目,它跟踪感恩节前出发、到达和穿越美国的航班。可视化始于当天很早的时间,随着时间的推移,像播放电影一样显示在全国各地飞行中的航班。不需要显示时间外的任何数字,观众即可以看到当天哪段时间是国际航班、国内航班以及往返于全国各地不同枢纽的航班的热门时间。
6)是什么真正造成了全球变暖?
听说过一种建议,“不要只简单地展示数据,讲个故事吧”?这正是彭博商业正在做的可视化 ——用互动讲述故事的来龙去脉。
此图的关键点是要反驳用自然原因解释全球变暖的理论。首先你会看到从1880年至今观测到的温度上升。当你向下滚动,这个可视化图会让你清楚的了解相较于已被观测到的因素,造成全球变暖的不同因素到底有多少,使故事内容更加丰富。作者希望观众能够得到非常清晰的结论。
7)在叙利亚,谁和谁在战斗
许多不同的团体之间的关系可能很难理解 – 尤其是当有11个这样的团体存在的时候,这些团体之间有的结盟,有的敌对,反之亦然。这让人难以理解。但是,Slate网站通过表格的形式和熟悉的视觉效果和色彩,将这些数据简化为一种简单的、易于理解和互动的形式。
观众可以点击任一张脸来查看双方关系的简要描述。
8)最有价值的运动队
这是通过叠加数据来讲述深层故事的一个例子。这个交互由Column Five设计,受福布斯“2014年最具价值的运动队50强”名单得到的启发。但是它不仅将列表可视化,用户还可以通过它看到每支队伍参赛的时间以及夺得总冠军的数量。这为各队的历史和成功提供了更全面的看法。
9)美国风图
下面是是个类似感恩节航班的可视化图,除了图中显示的时刻,它还能实时显示美国本土的风速和风向。它是直观设计的一个很好的案例:风速用线条移动的快慢来表示,方向通过线条移动的路径来表示。它会即时显示美国风向的总体趋势,无需任何数字,除非你在地图上点击鼠标。另外,使用时设定最多两个变量会使它更容易操作。
静态数据可视化实例
10)政治新闻受众渠道分布图
据Pew研究中心称,通常,当设计师在信息内容很多又不能删节的时候,他们通常会把信息放到数据表中,以使其更紧凑。但是,他们使用分布图来代替。为什么呢?因为分布图可以让观众在频谱上看到每个媒体的渠道。在分布图上,每个媒体的渠道之间的距离尤为显著。如果这些点仅仅是在表中列出,观众无法看到每个渠道之间的比较。
11)著名创意人士的日常惯例
这个数据的可视化图是用奇特的想法描绘一个简单的概念。这个表格利用Mason Currey的《日常惯例》一书中的信息展示了那些著名的创意人士的日程安排,解读其时间和活动安排。这不仅是一个操作数据的例子(因为你可以通过单独的活动来浏览日程安排),也是一个品牌宣传的佳作。
12)今年发生了哪些新闻?
最好的数据可视化方式,就是用直观和美丽的方式传达信息。Echelon Insights致力于这一方式,即将2014年Twitter上最受关注的新闻进行可视化。1亿8450万条推文是什么样子?如图所示的艺术品。
13)问题的深度
当你想强调规模的时候,静态数据可视化是表达你的观点的极佳方式。下面这张来自《华盛顿邮报》的信息图长得令人难以置信…这是故意的。他们在图中展示了一架飞机可以探测到的深海信号是多么的深,通过比较飞机的探测深度与高层建筑、已知哺乳动物的最大深度、泰坦尼克号沉船的深度等。这是简单的视觉效果和颜色梯度的极佳使用方式。最后,将数据添加到新闻报道(文中为失踪的马航)是提供背景的好方式。
14)Funding the Final Frontier
上述图表相对简单,以下是创造设计精致的、传递大量数据的图标方法。秘诀何在?用简单的和干净的格式,便于读者理解数据。这个由GOOD Magazine 和 Column Five制作的图表,解读了NASA的五年预算,显示资金将怎么花、花在哪里。此外,它有主题设计-一个全方位的胜利。
15)Kontakladen慈善年度报告
不是所有的数据可视化都需要用动画的形式来表达。当现实世界的数据通过现实生活中的例子进行可视化,结果会令人惊叹。设计师Marion Luttenberger把包含在Kontakladen慈善年报中的数据以一种独特的方法表现出来。该组织为奥地利的吸毒者提供支持,所以Luttenberger的使命就是通过真实的视觉来宣传。例如,这辆购物车形象的表现了受助者每一天可以负担得起多少生活必需品。
16)Austria Solar 年度报告
虽然有许多方法使数据视觉化,但是使用信息主题去真实创建数据可视化(注意了)意义重大。这份来自Austria Solar 的年度报告通过页面上的太阳光感墨水用真正的太阳能赋予公司数据以生命。一句话:他们是天才。
-END-
- ?
作为数据分析师,用的最多的竟是Excel表格
放了线
展开
【摘要】:结合实际数据分析工作,简要介绍了VLOOKUP函数的基础应用,重点介绍亲测高效有难度的VLOOKUP函数高级应用。最后分享我运用Excel的一点技巧。
毕业后,第一份工作是在一家互联网公司做数据分析。
尽管和所学专业没那么匹配,但我还是挺满意。因为向来对数字很敏感,对常用统计软件也都有所了解。
正式入职,发现面试时说的什么SPSS,Eviews统统都不用,基本就是用Excel。对于研究生毕业,第一份工作,我多少有些落差。既来之则安之,我心想用什么工具最方便,工作中应该可以自己选择。对于word和ppt还算熟练,Excel也就一般。多学点总不会差。
开始工作,我发现Excel的功能简直太强大,我之前了解的仅是皮毛。尤其在更新到2013版后,操作更智能和快捷,数据量大时计算较费时。对于日常工作影响倒不大,借助Excel我的数据分析工作也很快上手。
除了宏不太会,工作之余也会多琢磨一些公式和操作。以至于同办公室的同事,甚至外部门的同事都来找我帮忙解决Excel的问题。时间久了,领导特意让我在部门内部定期做教学分享。
我确实喜欢和数据打交道的感觉,从冗杂的繁琐数据中分析出最终的结果相当有成就感。在简书上也看到了许多实用的Excel操作指南或技巧。
今天分享一个职场中最常用,功能强大,却少有人掌握的VLOOKUP函数。很多文章都提到过这个函数的基础应用,此外还有一个高级应用,是我在工作中遇到,亲测高效快捷的有力工具。
VLOOKUP函数---最最最常用的查找函数
四个必备参数=(要查找的值,要查找的区域,返回数据在查找区域的第几列数,逻辑值)
注: FALSE或0,则返回精确匹配,如果找不到,则返回错误值 #N/A(首选)
TRUE或1,则返回近似匹配值,如果找不到,则返回小于第一个参数的最大值。
VLOOKUP函数的基础应用:一对一的匹配
理解上述文字很晦涩,用实例来说明。
例1: 下图中左表为源数据:各类产品在三个城市的日销售数据。
需求:查询产品B和F在上海的销售额。
因为提供的数据量很少,人工查找就能完成。但实际工作中数据量很庞大,人工查找费时费力且准确率低。这时用VLOOKUP一秒搞定。
做法:在G2单元格内,输入公式,见红框内。回车后,出现结果;将公式复制或下拉至G3,同理可得结果。
参数解释:
(1)“F2”为我们要查找的参照值,即在源数据第一列查找“产品B”。当公式下拉复制时,自动切换为查找F3。
(2)“A:C”指我们要在此范围内查找数据。该参数也可写为“$A$2:$C$9”,即绝对引用。这样可保证无论公式如何拖拽复制,数据源始终固定引用该区域。
(3)参数“3”指在选择的数据源“A列-C列”范围内,要查询的销量在引用的第三列,即C列。
(4)FALSE,即精确查找。
这样,通过应用该函数,实现了产品型号和销量一对一的匹配查找。
应用该公式的硬性条件:
(1)必须保证需要查找的参照值与源数据格式一致。
即例1中:F列与A列完全一致,不仅内容相同,尤其保证单元格格式一致,否则只会返回错误值 #N/A。如不一致,查找前需转换成一致的格式。有时较难分辨。
(2)必须保证源数据表中的第一列没有重复项。
即A列中没有出现重复的产品类型。假如源数据中出现了多行“产品B”,那么在查找时只能返回第一次“产品B”出现时对应的销量。
当(2)无法满足时,查找不再是一对一,而是一对多的匹配。需要对VLOOKUP函数进行扩展才得以实现查找功能。
VLOOKUP函数的高级应用:一对多的匹配
例2:下图左表为客服中心的每日工作记录,日积月累,这个表数据量庞大且信息冗杂。
需求:王丹和张鹏岗位变动,需将他们接待过的全部客户汇总转交其他同事维护。
数据量小手动筛选即可,使用透视表也可完成。这里我借助简单的例子,介绍如何使用VLOOKUP完成。当数据量庞大,这是较便利的方法。
做法:
第一步:将A列排序,在A与B列间新插入两列。
第二步:计数。在B2输入公式=COUNTIF(A$2:A2,A2),回车,下拉即可。
目的是对A列中同一个名字的出现次数进行计算。如图李珊出现了四次。
第三步:构建辅助列。在C2输入公式=A2&B2,回车,下拉即可。目的在于将A列B列的内容合并。这时C列即为辅助列。保证了源数据的唯一性,此时已满足VLOOKUP基础应用的第二个硬性条件。
第四步:进行匹配查找。在H2输入公式=VLOOKUP($G2&H$1,$C$2:$D$18,2,FALSE), 复制公式至其他单元格即可得到结果。
与基础应用相比,仅参数1有变化,涉及相对引用和绝对引用问题。
参数1:将“客服姓名&序号“合并作为第一个参数。公式向右向下复制后,“客服姓名”行变列不变,所以锁定列。“序号”列变行不变,所以锁定行。即为:“$G2&H$1”。锁定即绝对引用。(此处较难理解,操作中通过尝试能够理解透)
参数2:绝对引用C2至D18区域。即为:“$C$2:$D$18”,新数据源。
参数3:返回所选区域C2至D18中的第2列数据。即为:客户姓名
参数4:FALSE,即精确查找。
第五步:将H2中的公式向下向右复制至K3,即得全部结果。可对比源数据表验证是否正确。
在序号为4的单元格内出现了#N/A值。表明没有找到“王丹4”和“张鹏4”对应的内容,说明这两人接待的客户仅有3人。
这样,通过其他功能辅助,实现了客服与客户一对多的匹配查找。
总结:VLOOKUP的高级应用是在基础应用的基础上,借助了COUNTIF和&函数,构建辅助列,使得源数据表中第一列无重复。四个必备参数中仅参数1涉及绝对引用和相对引用,略有难度。
应用Excel的技巧
1.填充了公式的单元格,在得到结果后,最好将计算结果转换为“值”。
两个好处:一是避免源数据的任何变动再次影响公式的计算结果;二是Excel本身计算较费时。如公式一直存在,每次打开该文件,或是刷新时都会重新计算,严重影响Excel运算速度。
2.Excel的数据承载量相对较小。2013版每个sheet能够填充接近105万行。
如果涉及较多sheet,数据量可想而知。因此在上一条的基础上,必须及时保存,否则数据量大时Excel难免会出现重启。毕竟多数人用的都是免费版,为了避免做无用功,及时保存很重要。这可是次次抓狂的经验教训。
3.Excel的功能很丰富,没有哪一本书或是哪一个老师能够完全教会所有功能。
更实际的是,从点到面去学习。比如说我介绍了VLOOKUP函数的应用,其中涉及到了绝对引用的概念,以及countif函数的应用,这时就引导你去学习新知识。
任何功能的组合都能起到耳目一新的作用。
4.Excel做不到死记硬背,多练习才利于掌握。
比如说,在工作中我给同事教过无数次VLOOKUP函数的应用,当时似懂非懂,勉强会用。想不到的是他们下一次遇到早已忘得一干二净。在我看来是很简单的一个公式而已,仅需掌握四个参数。关键是他们不常用,而我几乎天天用。
任何技能都是如此。孰能生巧,才能更快掌握更多功能。哪怕是多记几个快捷键,都会为你使用Excel加分不少。
多学一点技能,就能少求助别人,且让别人来求助于你。普通离优秀,永远差一项技能。
写出来为分享,也为记录。
PS:如果没有看懂,或是觉得现在用不到我介绍的公式。没关系,请收藏,因为工作后,无论做什么工作一定一定一定会用到VLOOKUP。
请尊重原创的辛苦。欢迎分享,欢迎交流。
- ?
通过基础数据进行数据分析的实例
车酬海
展开
国产〇〇柒
前几天朋友给了一组行业同行表现数据,让帮忙分析一下自己的店铺问题所在和表现如何。今天我通过这个小示例来跟大家简单分享一下一些基础的分析方法。
(开始之前先跟小伙伴们说明一下,本案例是一个简单的基于一组数据而进行的分析,并通过这个给大家一个相对比较概括的方法介绍,实际分析操作中会遇到更复杂的情况,而且实际分析中的挖掘深度要比本案例要深)
下边是朋友提供的一组数据:
图片:基础数据表01.png
为了保护隐私避免侵权,公司名称这里就以字母替代
通过上图我们可以看到这是几组非常简单的数据,这些数据我们都可以在自己的店铺采集到,但是我们也可以看到这组数据有一个问题,多数数据缺乏一个时间参数,从表格中我们只能看到最后两项有一个准确的时间界定,其他项数据均没有这个界定。不过这里我们采用对比模糊分析的方法,不用考虑数据是否精确,只需要进行对比即可,所以缺乏时间参数问题也不太大。接下来我们通过以下几个步骤进行分析。
一,做筛选
首先我们要对这些数据进行筛选,只留可对比的数据组,剔除无用的数据。方法很简单,这里我们通过公司名称进行检测,进行主营产品类目检查(这里我是以朋友公司产品类目对基础的),通过分析发现C、G、M三个公司的产品与其他不符,这里我们就直接剔除这三家的数据不做参考。
整理后的数据如图:
图片:整理后的数据02.png
(再更复杂的分析中,剔除噪音数据并非这么简单,这里是用这个简单的方式说明一下这个操作步骤,大家在操作中要根据自己实际情况进行数据甄别,甄别的过程是非常复杂和繁琐的,如果这一步出错,做出的分析结果的准确性就很难得到保障)
二,做归类
无用的数据剔除之后,接下来我们就是要对现有的数据进行归类处理。
通过图表数据的阅读,我们可以把里面的数据简单的归为三类:交易数据、回复率、行为数据。交易数据这里主要就是包含前三项,一达通和信保;回复率就是询盘回复率的表现数据;行为数据这里主要是指人的行为,访客和季度、月询盘数。归类后如图:
图片:归类后的数据03.png
这三类数据是有区别的,交易数据和回复率我们可以统一称之为“操作数据”或“加权数据”,因为这些数据的控制权基本掌握在我们手里,我们在这部分数据的积累上有较大的主动权。行为数据可以称之为“结果数据”,这部分数据的直接控制权来自于客户行为,我们无法直接去干预,我们只能通过提升“操作数据”的方法去影响这个“结果数据”。我们之前的操作都是为了这个“结果数据”有较好的表现。
数据归类之后,我们开始分析
三,做分析
由于上面拿到的三类数据有两类属于“操作数据”,这两类对“结果数据”只能产生部分影响,这里我们就不关注这两项数据了(在全局分析中,这些局部数据都可以作为一个参数加入到分析的行列)。这里我们只关注结果数据。这里的结果数据中虽然有三组数据,由于其中一项数据缺少时间参数,所以我们可以把三项数据当作两项去分析,季度和月询盘量可以当作一个有效参数,这个时候我们就把数据优化成两类:访客和询盘。当看到这两个数据的时候我们很简单的就会联想到由他们而衍生出来的一个数据:“转化率”,这个数据能够比较真实的反馈平台效果。接下来我们计算出每一组的“转化率”数据如图(按照月度参数计算):
图片:转化率04.png
从上图可以看出“转化率”排名如下:
H > K > P > A = F > B > D = E > I = O > J > L >N
当然,转化率高并不代表代表一个店铺的表现就是第一名,这个数据只能判断该店铺引流的精准程度(当然如果需要更深入的分析精准度是需要深入到询盘质量和成交转化中去的,这里不做过多介绍)。我们可以观察一下N店铺的转化率,0.43%的数据与其他店铺相比较差距较大,该店铺的访客流量占据第一位,但是反馈数据在该表中与其他几家并列最后一名,该店铺就需要认真的分析访客来源和未转化的原因(这里就牵扯到了其他数据的数据分析,这里不多介绍)。
当然,从数据组中我们一共可以看到这些数据条件,也可以计算出一个数据进行比较。但是这并不太说明什么太多的问题。接下来我们用加入条件的方法来进一步深入分析。这里我加入的数据是店铺的产品”上架产品数量“这个参数。加入数据到图标(实际操作中我们可以加入更多的可参考数据进行数据分析),如图:
图片:加入产品数量条件05.png
从表格中可以看出产品数量过万的有A B J N ,产品数量5000以上的有D I K L O P,产品数量低于5000的有E F H。从阿里规则上来说,店铺产品数量过多,店铺过于臃肿并不太好,但是这并不代表不用去发布产品了,其实我们真正要做到的是产品数量适中,做到全覆盖即可。从以上店铺的产品数量数据表现可以看出来,该行业的产品数量需要大于5000以上,如果低于5000,应该做不到全覆盖,可能会浪费很多流量(这里是从数据表大致得出结论,如要深入分析具体多少产品数量合适,还需要从其他方面进行综合分析)。我们也可以看到低于5000的几个店铺的访客量分别为:4000,7000,9000(里面有P4P引流数据,所以该数据仅作参考,不可作为实际数据参考),这个数据量并不算高,特别是H,访客是最少,产品数量也是最少,但是我们可以发现H的转化率是最高的,我们这里假设,H拥有A的产品数量(覆盖面),保持转化率不变,其他条件随覆盖面递增,这个时候我们可以看到H的数据应该是这样的,如图:
图片:修改数据后转化询盘06.png
当然这是一个理想的假设状态,覆盖,访客,转化这些数据都是的动态的,越是大的数据体量对转化率的控制难度越大,但是不可否认的是,如果产品覆盖能够达到一定程度的话,对访客和询盘转化肯定是有益处的,示例中虽然达不到492条的完美状态,但是询盘数量增加2倍应该还是有保障的。从这些数据的表现我们也可以看到覆盖的重要性(其实覆盖是一个很复杂的事情,并不是咱们想象的那种把产品和关键词上传上去就完事儿的事情,有时间可以跟大家深入交流关于覆盖的问题)。其实这些数据中还有很多可以对比解读的地方,我们今天先这里,以覆盖落幕。
- ?
数据分析全流程(内附案例)
周延恶
展开
(图片来源于网络)
作者:苏格兰折耳喵
来源: 运营喵是怎样炼成的 (yymzylc)
(温馨提示:图片显示毛糙和不清楚,是分辨率过高的缘故,点击图片,即可看到高清大图。 )
本文将对一个案例进行从数据采集、数据清洗、数据分析再到数据可视化的全流程分析,力求条理清晰的展现外部数据分析的强大威力。以下是本文的写作框架:
1 分析背景
1.1 分析原理---为什么选择分析虎嗅网
在现今数据爆炸、信息质量良莠不齐的互联网时代,我们无时无刻不身处在互联网社会化媒体的“信息洪流”之中,因而无可避免的被它上面泛滥的信息所“裹挟”,也就是说,社会化媒体上的信息对现实世界中的每个人都有重大影响,社会化媒体是我们间接了解现实客观世界和主观世界的一面窗户,我们每时每刻都在受到它的影响。
综合上述两类情形,可以得出这样的结论,透过社会化媒体,我们可以观察现实世界:
由此, 社会化媒体是现实主客观世界的一面镜子,而它也会进一步影响人们的行为,如果我们对该领域中的优质媒体所发布的信息进行分析,除了可以了解该领域的发展进程和现状,还可以对该领域的人群行为进行一定程度的预判。
鉴于此种情况,作为互联网从业者的笔者想分析一下互联网行业的一些现状,于是想到了虎嗅网。
虎嗅网创办于2012年5月,是一个聚合优质创新信息与人群的新媒体平台。该平台专注于贡献原创、深度、犀利优质的商业资讯,围绕创新创业的观点进行剖析与交流。虎嗅网 的核心,是关注互联网及传统产业的融合、一系列明星公司(包括公众公司与创业型企业)的起落轨迹、产业潮汐的动力与趋势。
因此,对该平台上的发布内容进行分析,对于研究互联网的发展进程和现状有一定的实际价值。
1.2 本文的分析目的
笔者在本项目中的分析目的主要有4个:
(1)对虎嗅网内容运营方面的若干分析,主要是对发文量、收藏量、评论量等方面的描述性分析;
(2)通过文本分析,对互联网行业的一些人、企业和细分领域进行趣味性的分析;
(3)展现文本挖掘在数据分析领域的实用价值;
(4)将杂芜无序的结构化数据和非结构化数据进行可视化,展现数据之美。
1.3 分析方法---分析工具和分析类型
本文中,笔者使用的数据分析工具如下:
Python3.5.2(编程语言)
Gensim(词向量、主题模型)
Scikit-Learn(聚类和分类)
Keras(深度学习框架)
Tensorflow(深度学习框架)
Jieba(分词和关键词提取)
Excel(可视化)
Seaborn(可视化)
新浪微舆情(情绪语义分析)
Bokeh(可视化)
Gephi(网络可视化)
Plotly(可视化)
使用上述数据分析工具,笔者将进行2类数据分析:第一类是较为传统的、针对数值型数据的描述下统计分析,如阅读量、收藏量等在时间维度上的分布;另一类是本文的重头戏---深层次的文本挖掘,包括关键词提取、文章内容LDA主题模型分析、词向量/关联词分析、DTM模型、ATM模型、词汇分散图和词聚类分析。
2 数据采集和文本预处理
2.1 数据采集
笔者使用爬虫采集了来自虎嗅网主页的文章(并不是全部的文章,但展示在主页的信息是主编精挑细选的,很具代表性),数据采集的时间区间为2012.05~2017.11,共计41,121篇。采集的字段为文章标题、发布时间、收藏量、评论量、正文内容、作者名称、作者自我简介、作者发文量,然后笔者人工提取4个特征,主要是 时间特征 (时点和周几)和 内容长度特征 (标题字数和文章字数),最终得到的数据如下图所示:
2.2 数据预处理
数据分析/挖掘领域有一条金科玉律:“Garbage in, Garbage out”,做好数据预处理,对于取得理想的分析结果来说是至关重要的。本文的数据规整主要是对文本数据进行清洗,处理的条目如下:
(1) 文本分词
要进行文本挖掘,分词是最为关键的一步,它直接影响后续的分析结果。笔者使用jieba来对文本进行分词处理,它有3类分词模式,即全模式、精确模式、搜索引擎模式:
· 精确模式:试图将句子最精确地切开,适合文本分析;
· 全模式:把句子中所有的可以成词的词语都扫描出来, 速度非常快,但是不能解决歧义;
· 搜索引擎模式:在精确模式的基础上,对长词再次切分,提高召回率,适合用于搜索引擎分词。
现以“新浪微舆情专注于社会化大数据的场景化应用”为例,3种分词模式的结果如下:
【全模式】: 新浪/ 微舆情/ 新浪微舆情/ 专注/于/ 社会化/ 大数据/ 社会化大数据/ 的/ 场景化/ 应用
【精确模式】: 新浪微舆情/ 专注/于/ 社会化大数据/ 的/ 场景化/ 应用
【搜索引擎模式】:新浪,微舆情,新浪微舆情,专注,于,社会化,大数据,社会化大数据,的,场景化,应用
为了避免歧义和切出符合预期效果的词汇,笔者采取的是精确(分词)模式。
(2) 去停用词
这里的去停用词包括以下三类:
标点符号:, 。! /、*+-
特殊符号:▲等
无意义的虚词: “the”、“a”、“an”、“that”、“你”、“我”、“他们”、“想要”、“打开”、“可以”等
(3) 去掉高频词、稀有词和计算Bigrams
去掉高频词、稀有词是针对后续的主题模型(LDA、ATM)时使用的,主要是为了排除对区隔主题意义不大的词汇,最终得到类似于停用词的效果。
Bigrams是为了自动探测出文本中的新词,基于词汇之间的共现关系---如果两个词经常一起毗邻出现,那么这两个词可以结合成一个新词,比如“数据”、“产品经理”经常一起出现在不同的段落里,那么,“数据_产品经理”则是二者合成出来的新词,只不过二者之间包含着下划线。
3 描述性分析
该部分中,笔者主要对数值型数据进行描述性的统计分析,它属于较为常规的数据分析,能揭示出一些问题,做到知其然。
3.1 发文数量、评论量和收藏量的变化走势
从下图可以看出,在2012.05~2017.11期间,以季度为单位,主页的发文数量起伏波动不大,在均值1800上下波动,进入2016年后,发文数量有明显提升。
此外,一头(2012年第二季)一尾(2017年第四季)因为没有统计完全,所以发文数量较小。
下图则是该时间段内收藏量和评论量的变化情况,评论量的变化不愠不火,起伏不大,但收藏量一直在攀升中,尤其是在2017年的第二季达到峰值。收藏量在一定程度上反映了文章的干货程度和价值性,读者认为有价值的文章才会去保留和收藏,反复阅读,含英咀华,这说明虎嗅的文章质量在不断提高,或读者的数量在增长。
3.2 发文时间规律分析
笔者从时间维度里提取出“周”和“时段”的信息,也就是开题提到的“人工特征”的提取,现在做文章分布数量的在“周”和“时”上的交叉分析,得到下图:
上图是一个热力图,色块颜色上的由暖到冷表征数值的由大变小。很明显的可以看到,中间有一个颜色很明显的区域,即由“6时~19时”和“周一~周五”围成的矩形,也就是说,发文时间主要集中在工作日的白天。另外,周一到周五期间,6时~7时这个时间段是发文的高峰,说明虎嗅的内容运营人员倾向于在工作日的清晨发布文章,这也符合它的人群定位---TMT领域从业、创业者、投资人,他们中的许多人有晨读的习惯,喜欢在赶地铁、坐公交的过程中阅读虎嗅讯息。发文高峰还有9时-11时这个高峰,是为了提前应对读者午休时间的阅读,还有17时~18时,提前应对读者下班时间的阅读。
3.3 相关性分析
笔者一直很好奇,文章的评论量、收藏量和标题字数、文章字数是否存在统计学意义上的相关性关系。基于此,笔者绘制出能反映上述变量关系的两张图。
首先,笔者做出了标题字数、文章字数和评论量之间的 气泡图 (圆形的气泡被六角星替代,但本质上还是气泡图)。
上图中,横轴是文章字数,纵轴是标题字数,评论数大小由六角星的大小和颜色所反映,颜色越暖,数值越大,五角星越大,数值越大。从这张图可以看出,文章评论量较大的文章,绝大部分分布于由文章字数6000字、标题字数20字所构成的区域内。虎嗅网上的商业资讯文章大都具有原创、深度的特点,文章篇幅中长,意味着能把事情背后的来龙去脉论述清楚,而且标题要能够吸引人,引发读者的大量阅读,合适长度标题和正文篇幅才能做到这一点。
接下来,笔者将收藏量、评论量和标题字数、文章字数绘制成一张3D立体图,X轴和Y轴分别为标题字数和正文字数,Z轴为收藏量和评论量所构成的 平面 ,通过旋转这个3维的Surface图,我们可以发现收藏量、评论量和标题字数、文章字数之间的相关关系。
注意,上图的数值表示和前面几张图一样,颜色上的由暖到冷表示数值的由大到小,通过旋转各维度的截面,可以看到在正文字数5000字以内、标题字数15字左右的收藏量和评论量形成的截面出现“华山式”陡峰,因而这里的收藏量和评论量最大。
3.4 城市提及分析
在这里,笔者通过构建一个包含全国1~5线城市的词表,提取出经过预处理后的文本中的城市名称,根据提及频次的大小,绘制出 一张反映城市提及频次的地理分布地图 , 进而间接地了解各个城市互联网的发展状况(一般城市的提及跟互联网产业、产品和职位信息挂钩,能在一定程度上反映该城市互联网行业的发展态势)。
上图反映的结果比较符合常识,北上深广杭这些一线城市的提及次数最多,它们是互联网行业发展的重镇。值得注意的是,长三角地区的大块区域(长江三角洲城市群,它包含 上海 , 江苏省 的 南京 、 无锡 、 常州 、 苏州 、 南通 、 盐城 、 扬州 、 镇江 、 泰州 , 浙江省 的 杭州 、 宁波 、 嘉兴 、 湖州 、 绍兴 、 金华 、 舟山 、 台州 , 安徽省 的 合肥 、 芜湖 、 马鞍山 、 铜陵 、 安庆 、 滁州 、 池州 、 宣城 )呈现出较高的热度值,直接说明这些城市在虎嗅网各类资讯文章中的提及次数较多,结合国家政策和地区因素,可以这样理解地图中反映的这个事实:
长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。
长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。
接下来,笔者将抽取文本中城市之间的 共现关系 ,也就是城市之间两两同时出现的频率,在一定程度上反映出城市间经济、文化、政策等方面的相关关系,共现频次越高,说明二者之间的联系紧密程度越高,抽取出的结果如下表所示:
将上述结果绘制成如下动态的流向图:
由于虎嗅网上的文章大多涉及创业、政策、商业方面的内容,因而这种城市之间的共现关系反映出城际间在资源、人员或者行业方面的关联关系,本动态图中,主要反映的是北上广深杭(网络中的枢纽节点)之间的相互流动关系和这几个一线城市向中西部城市的单向流动情形。流动量大、交错密集的区域无疑是中国最发达的3个城市群和其他几个新兴的城市群:
京津冀城市群
长江三角洲城市群
珠江三角洲城市群
中原城市群
成渝城市群
长江中游城市群
上面的数据分析是基于数值型数据的描述性分析,接下来,笔者将进行更为深入的文本挖掘。
4 文本挖掘
数据挖掘是从有结构的数据库中鉴别出有效的、新颖的、可能有用的并最终可理解的模式;而文本挖掘(在文本数据库也称为文本数据挖掘或者知识发现)是从大量非结构的数据中提炼出模式,也就是有用的信息或知识的半自动化过程。
本文的文本挖掘部分主要涉及高频词统计/关键词提取/关键词云、文章标题聚类、文章内容聚类、文章内容LDA主题模型分析、词向量/关联词分析、ATM模型、词汇分散图和词聚类分析。
4.1 关键词提取
对于关键词提取,笔者没有采取词频统计的方法,因为词频统计的逻辑是:一个词在文章中出现的次数越多,则它就越重要。因而,笔者采用的是 TF-IDF (termfrequency–inverse document frequency)的关键词提取方法:
它用以评估一字/词对于一个文件集或一个语料库中的其中一份文件的重要程度,字/词的重要性会随着它在文件中出现的次数成正比增加,但同时会随着它在语料库中出现的频率成反比下降。
由此可见,在提取某段文本的关键信息时,关键词提取较词频统计更为可取,能提取出对某段文本具有重要意义的关键词。
下面是笔者利用jieba在经预处理...
数据分析表格案例
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并