- ?
干货 | 男朋友老是说自己R语言很6,快来用这40道题目检测他
老酒
展开
大数据文摘作品,转载要求见文末
作者 | NSS
编译 | 张伯楠,刘云南
弋心,卫青,宁云州
R语言是数据科学领域最流行的语言之一。如果你真想从事数据科学事业,那你要么已经会用R语言要么正在学习它。R语言同样是一个拥有广泛的统计和数据科学库的生态系统。为了帮助数据科学家测试他们的R语言能力,我们为DataFest 2017设计了一部分技能测试题。
超过1500人注册了这项考试并有接近500人完成了测试。下图是不同测试者的成绩分布:
下面是关于成绩分布的一些统计数据:
平均分:16.69
分数中值:19
众数:0
下面是这四十道题目的问题和答案,如果错过了测验,你还有机会完成这四十道题目,看看自己在R语言上究竟处于什么水平。
友情提示:在使用本文代码之前,请先清除格式,或查看本文原文网址复制使用。
祝你学习愉快!
1、请看下列函数
f<- function(x) {
g<- function(y) {
y + z
}
z<- 4
x + g(x)
}
1)如果我们执行下列命令(写在下一行),输出结果会是什么?
z<- 10
f(4)
A) 12
B) 7
C) 4
D) 16
答案:(A)
R语言的作用域规则(scoping rule)会使z<-4的条件优先于z<-10。因此,g(x)会返回8,所以A选项是正确答案。
鸢尾属植物(iris)数据集包括多种具有不同萼片(sepal)长度的花,如多刚毛类(setosa)、杂色类(versicolor)和维尔吉尼卡(virginica)等。现在,我们想分析所有鸢尾属花的萼片长度分布。其中之一的解决方法是通过下面所示的图可视化它们之间的关系。
下列哪个函数能够用于创建上文所示的图?
A) xyplot()B) stripplot()C) barchart()D) bwplot()
答案:(B)
上文所绘是条型图而选项A、C、D会分别产生散点图、柱状图以及箱线图。因此,B选项是正确答案。
3)下列命令哪一项可以在一个数据框架中正确读取上述csv文件的全部五行内容?
A) csv(‘Dataframe.csv’)
B) csv(‘Dataframe.csv’,header=TRUE)
C) dataframe(‘Dataframe.csv’)
D) csv2(‘Dataframe.csv’,header=FALSE,sep=’,’)
答案:(D)
第一个和第二选项会将数据第一行读取为变量名。第三个命令不存在,因此,选项D是正确答案。
Excel文件格式是最常用的储存数据文件格式之一。了解如何将Excel文件转化为R语言格式非常重要。下面是一个Excel文件,其中数据储存在第三个工作表中。
下列哪行代码可以从Excel工作表3中读取数据?
A) Openxlsx::read.xlsx(“Dataframe.xlsx”,sheet=3,colNames=FALSE)
B) Xlsx::read.xlsx(“Dataframe.xlsx”,sheetIndex=3,header=FALSE)
C)XLConnect::readWorksheetFromFile(“Dataframe.xlsx”,sheet=3,header=FALSE)
D)All of the above
答案:(D)
上述的全部选项都是正确的,它们采用了不同的方法来将Excel文件读取入R语言,且都正确读取了文件。因此,D选项是正确答案。
文件名:Dataframe.csv
5)上述csv文件中缺失的值被感叹号(“!”)和问号(“?”)所代替。下列哪行代表可以正确将上述csv文件读取进R语言?
A) csv(‘Dataframe.csv’)
B) csv(‘Dataframe.csv’,header=FALSE, sep=’,’,na.strings=c(‘?’))
C) csv2(‘Dataframe.csv’,header=FALSE,sep=’,’,na.strings=c(‘?’,’!’))
D) dataframe(‘Dataframe.csv’)
Solution: (C)
选项A不能在R语言中把“?” 和“!”读取为“NA”;选项B只能把“?”读取为“NA”而“!”不能;选项4并不存在。因此,选项C是正确答案。
文件名:Dataframe.csv
上述csv文件既有行名称又有列名称。下面哪行代码能够正确地将该csv文件读入R语言?
A) delim(‘Train.csv’,header=T,sep=’,’,row.names=TRUE)
B) csv2(‘Train.csv’,header=TRUE, row.names=TRUE)
C) dataframe(‘Train.csv’,header=TRUE,sep=’,’)
D) csv(‘Train.csv’,,header=TRUE,sep=’,’)
答案:(D)
A和B选项中的row.names参数仅仅引用有包含实际行名称的矢量本身或者一个指向包含行名称的列值数字,而并非一个有效的逻辑值。选项C并不存在。因此,D选项是正确答案。
文件名:Dataframe.csv
下列哪行代码将只读取csv文件中的前两行?
A) csv(‘Dataframe.csv’,header=TRUE,row.names=1,sep=’,’,nrows=2
B) csv2(‘Dataframe.csv’,row.names=1,nrows=2)
C) delim2(‘Dataframe.csv’,header=T,row.names=1,sep=’,’,nrows=2)
D) dataframe(‘Dataframe.csv’,header=TRUE,row.names=1,sep=’,’,skip.last=2)
答案:(A)
因为在csv2函数中的默认分隔符是“;”,而csv文件是“,”,B选项将不能正确读取csv文件,选项C使用了错误的参数值,选项D不存在。因此,选项A是正确答案。
上图为两个数据框,数据1和数据2。
下列哪行代码可以执行出下述结果?
A) merge(dataframe[,1:3],dataframe2)
B) merge(dataframe1,dataframe2)[,1:3]
C) merge(dataframe1,dataframe2,all=TRUE)
D) Both 1 and 2
E) All of the above
答案:(D)
C选项会导致融合后的数据框中包含feature 4,而这不是我们想要的结果。因此,D选项是正确答案。
R语言中已读取了一个数据集并存储在变量“dataframe”中。下列哪行代码可以实现整个数据集的总结(平均数、中位数、众数)?
A) summary(dataframe)
B) stats(dataframe)
C) summarize(dataframe)
D) summarise(dataframe)
E) None of the above
答案:(E)
A选项只会给出平均值和中位数,而不会给出众数。B,C,D选项同样不能提供所需统计信息。因此,E选项是正确答案。
下列哪行代码将不能给出每一列的缺失值?
A) colSums(is.na(dataframe))
B) apply(is.na(dataframe),2,sum)
C) sapply(dataframe,function(x) sum(is.na(x))
D) table(is.na(dataframe))
答案:(D)
D选项将给出缺失值的总数而非每列单独给出。因此,D选项是正确答案。
下列哪个命令能够帮助我们完成任务?
A) hist(dataframed$Value)
B) ggplot2::qplot(dataframed$Value,geom=”Histogram”)
C)ggplot2::ggplot(data=dataframed,aes(dataframe$Value))+geom_histogram()
D) All of the above
答案:(D)
所有给出选项都可以绘制柱状图并可以查看数据的偏度。
诸如XGBOOST等算法只对数值数据有效。在这种情况下,数据集中的分类变量将先被转化为虚拟变量,其可以展示数据集中某个分类是否存在。比如,当对“Parameter”项数据创建虚拟变量后,数据集显示如下。
下面中的哪个命令能实现这个功能?
A) dummies:: dummy.data.frame(dataframe,names=c(‘Parameter’))
B) dataframe$Parameter_Alpha=0
dataframe$Gende_Beta=0
dataframe$Parameter_Alpha[which(dataframe$Parameter==’Alpha’)]=1
dataframe$Parameter_Beta[which(dataframe$Parameter==’Alpha’)]=0
dataframe$Parameter_Alpha[which(dataframe$Parameter==’Beta’]=0
dataframe$Parameter_Beta[which(dataframe$Parameter==’Beta’]=1
C) contrasts(dataframe$Parameter)
D)A和B
答案:D
C选项会将Parameter列的值变成两种类型但不会进行独热编码(one hot encoding)。因此,选项D是正确选择。
以上为名为dataframe的变量。
我们想计算数据表中第二列和第三列之间的相关性,下面代码中的哪个能实现这个目的?
A) corr(dataframe$column2,dataframe$column3)
B) (cov(dataframe$column2,dataframe$column3))/(var(dataframe$column2)*sd(dataframe$column3))
C)
(sum(dataframe$Column2*dataframe$Column3)- (sum(dataframe$Column2)*sum(dataframe$Column3)/nrow(dataframe)))/(sqrt((sum(dataframe$Column2*dataframe$Column2)-(sum(dataframe$Column2)^3)/nrow(dataframe))* (sum(dataframe$Column3*dataframe$Column3)-(sum(dataframe$Column3)^2)/nrow(dataframe))))
D)以上都不是
答案:(D)
在选项A中,corr是错误的函数写法。实际的计算相关性的函数写法是:cor。在选项B中,分母应该是标准差而不是方差。相似地,选项C中的公式是错误的。因此,选项D是正确选择。
上述数据集已经加载进了你的R运行空间中,变量名为“dataframe”,第一行代表列名称。以下哪个代码将仅选择参数为Alpha的行?
A) subset(dataframe, Parameter=’Alpha’)
B) subset(dataframe, Parameter==’Alpha’)
C) filter(dataframe,Parameter==’Alpha’)
D) B和C
E) 上面全部
答案:(D)
A选项中,应该用等值运算符取代赋值运算符,因此选项D正确。
以下哪个函数用于以电子表格格式观察数据集?
A) disp()
B) View()
C) seq()
D) 以上全部
答案:(B)
选项B是采用电子表格形式查看数据集的唯一选项。因此选项B是正确答案。
设定B是一个分类变量,我们需要为每一个分类级别画一个箱线图。以下哪一个命令能帮助我们实现这个功能?
A) boxplot(A,B,data=data)
B) boxplot(A~B,data=data)
C) boxplot(A|B,data=data)
D) 以上都不是
答案(B)
R中画箱线图的函数要求公式中要有分类因素,通过这些分类因素绘制不同的箱线图。因此选项B是正确的答案。
下面命令中的哪一个能把绘图窗口分成4×3的窗口?同时绘图逐列输入窗口。
A) par(split=c(4,3))
B) par(mfcol=c(4,3))
C) par(mfrow=c(4,3))
D) par(col=c(4,3))
答案:(B)
mfcol命令参数能保证图像逐列输入绘图窗口。因此,选项B是正确答案。
一个数据表变量 “df” 具有如下数据:
Dates
2017-02-28
2017-02-27
2017-02-26
2017-02-25
2017-02-24
2017-02-23
2017-02-22
2017-02-21
我们希望把它读取成如下格式:
28 Tuesday Feb 17
27 Monday Feb 17
26 Sunday Feb 17
25 Saturday Feb 17
24 Friday Feb 17
23 Thursday Feb 17
22 Wednesday Feb 17
21 Tuesday Feb 17
下面命令中的哪些(个)能产生期望的输出?
A) format(df,”%d %A %b %y”)
B) format(df,”%D %A %b %y”)
C) format(df,”%D %a %B %Y”)
D) 以上都不是
答案: (D)
以上的选项都不能产生期望的输出。因此选项D是正确答案。
下列哪个命令能将数据表“table”的第二列名称由alpha改成beta
A) colnames(table)[2]=’beta’
B) colnames(table)[which(colnames==’alpha’)]=’beta’
C) setnames(table,’alpha’,’beta’)
D) 以上所有
答案: (D)
上面的选项都是重命名数据表中列名称的不同方法,因此,选项D是正确答案。
R运行中的大部分工作都使用系统内存,如果同时采用大的数据集,当R的工作空间不能保证所有的R对象都保持在内存中时问题就出现了。在这样的情况下,移除无用的对象是一种解决方法。
下面命令中的哪个或哪些可以从工作空间中移除R对象或变量“santa”?
A) remove(santa)B) rm(santa)C) 上面全部D) 都不是
答案 : (C)
remove 和 rm,都能用于清理工作空间。因此选项C是正确答案。
“dplyr”是R中最流行的工具包之一,它包括5个核心数据处理函数。下面选项中的哪一个不是dplyr中的核心函数?
A) select()
B) filter()
C) arrange()
D) summary()
答案: (D)
summary 是R语言基础工具包中的函数而不是dplyr中的函数。
下面命令中的哪些(个)能选择“table”中列3到列6中的所有行?
A) dplyr::select(table,Column3:Column6)
B) table[,3:6]
C) subset(table,select=c(‘Column3’,’Column4’,’Column5’,’Column6’))
D) 以上全部
答案: (D)
选项A、B和C都是不同的选取列的方法,所以选项D是正确答案。
以上为变量名为table的数据表。
下面哪个(些)命令会选取列1中带有“alpha”值的行,同时选取列4中数值小于50的项?这个数据表存储在名为“table”的变量中。
A) dplyr::filter(table,Column1==’Alpha’, Column4<50)
B) dplyr::filter(table,Column1==’Alpha’ & Column4<50)
C) 以上全部
D) 以上都不是
答案: (A)
dplyr中的filter函数使用“,”来添加条件,而不是“&”。因此,选项A是正确答案。
以上为变量名为table的数据表。
下面代码中的哪些(个)能把数据表基于列2进行升序排列,同时对列3进行降序排列?
A) dplyr::arrange(table,desc(Column3),Column2)
B) table[order(-Column3,Column2),]
C) 以上全部
D) 以上都不是
答案: (C)
order和arrange函数都能用于在R中对列进行分类。因此选项C是正确答案。
处理字符串数据(string)是文本分析的一个重要组成部分,当创建参数符号或其它符号时,分割字符串经常是一项常用任务。下面命令行的输出是什么?
A<-paste("alpha","beta","gamma",sep=" " )
B<-paste("phi","theta","zeta",sep="")
parts<-strsplit(c(A,B),split=” ”)
parts[[1]][2]
A) alpha
B) beta
C) gamma
D) phi
E) theta
F) zeta
答案 : (B)
c(A.B) 将合并 A=”alpha beta gamma” 和 B=”phithetazeta” 并将其通过空格隔开。使用strsplit之后,之前合成的字符串会再次将A,B用空格隔开,分别生成两个list 。parts[[1]][2]命令旨在显示第一个list中的第二个元素,是“beta”。因此选项B是正确答案。
以下命令的输出是什么?
grepl(“neeraj”,c(“dheeraj”,”Neeraj”,”neeraj”,”is”,”NEERAJ”))
A) [FALSE TRUE TRUE FALSE TRUE]
B) [FALSE TRUE TRUE FALSE FALSE]
C) [FALSE FALSE TRUE FALSE FALSE]
D) None of the above
答案:(C)
上述命令将检测集合中的元素是否与前面的“neeraj...
- ?
R中计算变量全距的方法
dAmbes
展开
关于全距
全距是统计学中离散指标的测度之一。
全距就是变量的最大值(Xmax)与最小值(Xmin)之差,也叫极差,表明变量的最大变动范围或绝对幅度。全距通常用R表示,即:
R = Xmax - Xmin
全距一般只根据未分组数据或单项式数列计算。
全距是测定变量分布离中趋势最简单的方法,在实际中有较多的应用。如天气预报中的最高温度与最低温度的温差;股票市场中某股票每天的最高成交价与最低成交价之间的价差等。
全距只考虑了两个极端变量值之间的差距,没有利用全距变量值的信息,没有考虑变量中间分布的情况,所以不能充分反映全部变量值之间的实际差异程度,因此在应用中有一定的局限性。
R中计算全距的方法
在R中有两种计算全距的方法
(1)使用max函数和min函数
(2)使用range函数
range函数返回一个向量,包含给定 参数的最小值和最大值。
R计算全距的例子
设从某班某门课程中随机抽取了20个学生的成绩,具体如下:
51,99,65,100,68,84,72,85,78,64,69,95,90,75,66,50,63,55,64,70.
求这20个成绩的全距。
编写R程序如下:
grade<- c(51,99,65,100,68,84,72,85,78,64,69,95,90,75,66,50,63,55,64,70)R1 <- max(grade) - min(grade)print(R1)tmpR <- range(grade)R2 <- tmpR[2] - tmpR[1]print(R2)
在R中运行结果如下图所示:
R中计算全距的例子如果你喜欢,请关注我,我会定期更新有关R、Python、Excel、SPSS等数据分析的方法。
- ?
入职第一天,老板就和我说,Excel的这几个功能一定要会
秋幻珊
展开
入职第一天,老板拿来一堆厚厚的历史数据资料,并扔下一句话说,最后的呈现方式是这样的看板。
Excel小白一脸懵逼,我只会简单的求和啊!
要和庞大的数据打交道,我搜索起Excel入门教程,并做好了熬夜加班的准备。
没想到老板私信了我, VLOOKUP、数据透视表、条件格式…你用这几个技巧做,80%的工作需求都能解决。
今天特意整理了这些操作技巧,拯救同在“表海”中挣扎的你,让你的工作效率超乎想象。
第一篇章 数据整理与保护
1
CTRL+E,截取填充部分文本
如何截取身份证号中的出生年月,一个快捷操作,截取、填充同时搞定。
操作步骤:在数据源当中的第一行,输入:出生年月日,然后选中整列区域,按键盘CTRL+E,完成快速填充。也可以在第一行右下角单元格处,双击十字句柄,点击右下角的填充选项,选择【快速填充】。
2
一键分列,规范日期格式
日期格式千奇百怪,数据类型却完全不一样,分析起来就频频出现错误。分列一下,马上规范起来。
操作步骤:选中数据源,在【数据】选项卡下找到【分列】,按照分割符号,下一步到设置数据类型为日期,点击完成。
3
数据管理的小闹钟:条件格式
对数据进行格式标识,以期更加直观地显示数据,比如员工工资的数额高低、培训成绩的分布、工作进度的控制、异常数据的监测等。
操作步骤:选中数据单元格,点击【开始】选项卡--【条件格式】--【数据条】,让单元格直接嵌上了类似于“柱状图”的效果。
除了数据条,这个功能还有很多种显示方式,见下图
第二篇章 常见函数应用
4
VLOOKUP函数,查找匹配,随心随遇
根据姓名匹配职位、身份证号等信息,总不能一个一个查找复制,耗时耗力,还经常容易出错。因此要用VLOOKUP函数查找引用数据,这也是Excel中使用最频繁的操作。
VLOOKUP函数结构
VLOOKUP精确匹配
VLOOKUP模糊匹配:不再为等级匹配发愁,取代if多层嵌套
5
INDEX+MATCH函数,查找界的王者
从适用性上讲,INDEX+MATCH的组合函数更具威力!
Index+Match中,Match用以确定数据所在的行值和列值(查找姓名所在的行,查找身份证号所在的列,行列交汇的数据就是要匹配出来的数据),Index负责调出由Match确定的行值和列值交叉位置确定的唯一数据,于是查找匹配就自然实现了。
Match:查找到你的位置
Index:提取出相应位置的数据
Index+match+数据有效性,一个小型的查询系统成型了。
第三篇章 数据汇总与分析
6
ALT+=,快速求和
不用再写那么多的SUM了,一个快捷操作统统搞定
7
多表汇总,就用合并计算
对于表结构一致的多表汇总,不用再想着要用到VBA才能解决,合并计算功能就足够了。
8
数据透视表:Excel分析汇总神器
数据透视表,允许用户根据需要对各类数据维度进行划分,进行不同的重组,助你轻松发现隐藏在数据背后的本质。
超强统计:根据你想要呈现的数据报表,透视一下,让你轻松“拖”出来。
多数值计算:求和?计数?平均值?最大值/最小值?标准差?方差?你想要的数值计算方式,应有尽有。
创建组:按季度?分年龄段?数据标签由你定义。
操作方式:选中字段下的数据—右键单击选择【创建组】-创建“起始于”和“终止于”对应的数值,也可采用自带的年、季度、月等组合方式。
切片器:一枚切片器,轻松控制多个数据透视表,数据展现随心而动。
操作方式:选中数据透视表中任一数据——【分析】选项卡—插入切片器—右键单击切片器—报表连接—勾选需要控制的多个表格。
综合运用上面的功能,一张人员基本情况分析的看板就实现了。
第四篇章 数据呈现与可视化
9
图表呈现
相比较枯燥乏味的文字和数据信息,人们更愿意也更容易接受各种图形信息,也就是可视化呈现。通常我们遵循的原则为:能用数据显示的,绝不用文字说明;能用图形显示的,绝不用数据说明。
比如要做这张图:
1、选中数据源,插入一张柱形图,并修改图表类型为组合图。设置:产值:图表类型为-带数据标记的折线图
环比增长:图表类型为-簇状柱形图,勾选次坐标
2.设置柱形图的填充颜色为蓝色,并添加数据标签。
通过调整分类间距的大小,改变柱形图两柱形之间的间距距离。
3设置折线图的标记点显示方式
①设置折线图,线条填充样式为:无线条
②设置标记点:数据标记选项为原型,大小为35
填充颜色为:白色
标记表框为蓝色:5磅,线条类型为粗细结合式
4、设置数据标签及轴坐标。
点击选中次坐标,在设置坐标轴格式中,更改坐标轴的最大值为1,即100%;点击环形图的数据点以后,单击鼠标右键,选:添加数据标签;选中数据标签后,在设置数据标签格式中,更改标签位置为:居中。
5、设置图表标题,删除冗余刻度线条
如果觉得坐标轴的数值比较多的话,可以通过设置坐标轴格式,更改主单位的大小进行调整。
更高阶的图表比如仪表图、动态图、看板等。
- ?
无需专业的数学软件,看看在Excel中是如何做方差分析的!
信任
展开
调用函数
STDEV
估算样本的标准偏差。标准偏差反映相对于平均值(mean)的离散程度。
语法
STDEV(number1,number2,...)
Number1,number2,...为对应于总体样本的1到30个参数。也可以不使用这种用逗号分隔参数的形式,而用单个数组或对数组的引用。
说明
函数STDEV假设其参数是总体中的样本。如果数据代表全部样本总体,则应该使用函数STDEVP来计算标准偏差。
此处标准偏差的计算使用“无偏差”或“n-1”方法。
函数STDEV的计算公式如下:
其中x为样本平均值AVERAGE(number1,number2,…),n为样本大小。
忽略逻辑值(TRUE或FALSE)和文本。如果不能忽略逻辑值和文本,请使用STDEVA工作表函数。
示例
假设有10件工具在制造过程中是由同一台机器制造出来的,并取样为随机样本进行抗断强度检验。
如果您将示例复制到空白工作表中,可能会更易于理解该示例。
操作方法
创建空白工作簿或工作表。
请在“帮助”主题中选取示例。不要选取行或列标题。
从帮助中选取示例。
按Ctrl+C。
在工作表中,选中单元格A1,再按Ctrl+V。
若要在查看结果和查看返回结果的公式之间切换,请按Ctrl+`(重音符),或在“工具”菜单上,指向“公式审核”,再单击“公式审核模式”。
A
1强度
21345
31301
41368
51322
61310
71370
81318
91350
101303
111299
公式说明(结果)
=STDEV(A2:A11)假定仅生产了10件工具,其抗断强度的标准偏差(27.46391572)
方差分析
EXCEL的数据处理除了提供了很多的函数外,但这个工具必须加载相应的宏后才能使用,操作步骤为:点击菜单“工具-加载宏”,会出现一个对话框,从中选择“分析工具库”,点击确定后,在工具菜单栏内出现了这个分析工具。
如果你的电脑中没有出现分析工具库,则需要使用OFFICE的安装光盘,运行安装程序。在自定义中点开EXCEL,找到分析工具库,选择“在本机运行”,安装添加即可。
在数据分析工具库中提供了3种基本类型的方差分析:单因素方差分析、双因素无重复试验和可重复试验的方差分析,本节将分别介绍这三种方差分析的应用:
单因素方差分析
在进行单因素方差分析之前,须先将试验所得的数据按一定的格式输入到工作表中,其中每种水平的试验数据可以放在一行或一列内,具体的格式如表,表中每个水平的试验数据结果放在同一行内。
数据输入完成以后,操作“工具-数据分析”,选择数据分析工具对话框内的“单因素方差分析”,出现一个对话框,对话框的内容如下:
1.输入区域:选择分析数据所在区域,可以选择水平标志,针对表中数据进行分析时选取(绿色)和***区域。
2.分组方式:提供列与行的选择,当同一水平的数据位于同一行时选择行,位于同一列时选择列,本例选择行。
3.如果在选取数据时包含了水平标志,则选择标志位于第一行,本例选取。
4.α:显著性水平,一般输入0.05,即95%的置信度。
5.输出选项:按需求选择适当的分析结果存储位置。
双因素无重复试验方差分析
与单因素方差分析类似,在分析前需将试验数据按一定的格式输入工作表中。
数据输入完成以后,操作“工具-数据分析”,选择数据分析工具库中的“双因素无重复方差分析”,出现一个对话框,对话框的内容如下:
1.输入区域:选择数据所在区域,可以包含因素水平标志。
2.如果数据输入时选择了因素水平标志,请选择标志按钮。
3.显著性水平α:根据实际情况输入,一般选择0.05。
4.输出选项:按需要选择分析结果存储的位置。
双因素可重复方差分析
双因素可重复方差分析与双因素无重复方差分析数据输入的区别在于对重复试验数据的处理,就是将重复试验的数据叠加起来。
数据输入完成以后,操作“工具-数据分析”,选择数据分析工具库中的“双因素可重复方差分析”,出现一个对话框,对话框的内容基本与双因素无重复方差分析相同,区别在于每一样本的行数选项,在此输入重复试验的次数即可。
若须对数据进行方差分析时,在输入区域选择数据所在区域及因素水平标志,在每一样本的行数处输入3,即每种组合重复3次试验,显著性水平选择0.05。在输出选项中可以按照需求选择分析结果储存的位置。选择确定以后分析结果。
(本文内容由百度知道网友hvc258贡献)
- ?
Excel 日常频率超高函数公式汇总,复制粘贴直接使用,拿走不谢!
Edith
展开
在我们的日常工作当中,如果涉及数据的处理,就离不开办公软件Excel的使用,而表格中的函数公式,可以让Excel更加强大,同时可以提高我们的工作效率,节省我们的时间。
常用公式:
1、查找重复内容公式:
=lF(COUNTIF(A:A,A2)>1,"重复")。
2、用出生年月来计算年龄公式:
=TRUNC((DAYS360(H6,"2009/8/30",FALSE))/360,0)。
3、从输人的18位身份证号的出生年月计算公式:
=CONCATENATE(MID(E2,7,4),"/",MID(E2,11,2),"/",MID(E2,13,2))。
4、从输人的身份证号码内让系统自动提取性别,可以输人以下公式:
=lF(LEN(C2)=15,IF(MOD(MID(C2,15,1),2)=1,"男","女"),IF(MOD(MID(C2,17,1),2)=1,"男","女"))公式内的C2”代表的是输人身份证号码的单元格。
常用计算:
1、求和:=SUM(K2:K56)
一对K2到K56这一区域进行求和;
2、平均数:=AVERAGE(K2:K56)
一对K2K56这一区域求平均数;
3、排名:=RANK(K2,K$2:K$56)
一对55名学生的成,绩进行排名;
4、等级:=lF(K2>=85,"优",IF(K2>=74,"良",IF(K2>=60,"及格","不及格")))
5、学期总评:=K2*0.3+M2*0.3+N2*0.4
一假设K列、M列和N列分别存放着学生的“平时总评"“期中期末”三项成绩;
6、最高分:=MAX(K2:K56)
一求K2到K56区域(55名学生)的最高分;
7、最低分:=MIN(K2:K56)
一求K2到K56区域(55名学生)的最低分;
8、分数段人数统计:
(1)=COUNTIF(K2:K56,"100")
一求K2到K56区域100分的人数;假设把结果存放于K57单元格;
(2)=COUNTIF(K2:K56,">=95")-K57
一求K2到K56区域95~99.5分的人数假设把结果存放于K58单元格
(3)=COUNTIF(K2:K56,">=90")-SUM(K57:K58)
一求K2到K56区域90~94.5分的人数;假设把结果存放于K59单元格;
(4)=COUNTIF(K2:K56,">=85")-SUM(K57:K59)
一求K2到K56区域85~89.5分的人数;假设把结果存放于K60单元格;
(5)=COUNTIF(K2:K56,">=70")-SUM(K57:K60)
一求K2到K56区域70~84.5分的人数;假设把结果存放于K61单元格;
(6)=COUNTIF(K2:K56,">=60")-SUM(K57:K61)
一求K2到K56区域60~69.5分的人数;假设把结果存放于K62单元格;
(7)=COUNTIF(K2:K56,"<60")
一求K2到K56区域60分以下的人数;假设把结果存放于K63单元格;说明:COUNTIF函数也可计算某一区域男、女生人数。如:=COUNTIF(C2:C351,"男")一求C2到C351区域(共350人)男性人数;
9、优秀率:=SUM(K57:K60)/55*100
10、及格率:=SUM(K57:K62)/55*100
11、标准差:=STDEV(K2:K56)
一求K2到K56区域(55人)的成绩波动情况数值越小,说明该班学生间的成绩差异较小,反之,说明该班存在两极分化);
12、条件求和:=SUMIF(B2:B56,"男",K2:K56)
一假设B列存放学生的性别,K列存放学生的分数,则此函数返回的结果表示求该班男生的成绩之和;
13、多条件求和:1=SUM(IF(C3:C322="男",IF(G3:G322=1,1,)))
一假设C列(C3:C322区域)存放学生的性别,G列(G3:G322区域)存放学生所在班级代码(1、2、3、4、5),则此函数返回的结果表示求一班的男生人数;这是一个数组函数,输完后要按Ctrl+Shift+Enter组合键(产生“.....了“{}”不能手工输人,只能用组合键产生。
14、根据出生日期自动计算周岁:=TRUNC(DAYS360(D3,NOW0())/360,0)
一假设D列存放学生的出生日期,E列输人该函数后则产生该生的周岁。
问题:
问一:Excel中当某一单元格符合特定条件,如何在另一单元格显示特定的颜色
A1>1时,C1显示红色0
方法如下:
1.单元击C1单元格,点“格式”“条件格式”条件1设为:公式=A1=1
2.点“格式”>“字体”>“颜色”点击红色后点“确定”条件2设为:公式=AND(A1>0,A1<1)
3.点“格式”>“字体”>“颜色”点击绿色后点”确定”条件3设为:公式=A1<0
点“格式”>“字体”“颜色”点击黄色后点”确定”
4、三个条件设定好后,点“确定”即出。
问二:EXCEL中如何控制每列数据的长度并避免重复录人
1、用数据有效性定义数据长度
用鼠标选定你要输,人的数据范围,点"数据"->"有效性"->"设置","有效性条件”设成”允许111文本长度"等于""5"(具体条件可根据你的需要改变)。
还可以定义一些提示信息,出错警告信息和是否打开中文输入法等,定义好后点"确定”。
2、用条件格式避免重复
选定A列,点”格式"->"条件格式",将条件设成“公式=COUNTIF($A:$A,$A1)>1”点"格式"->"字体"->"颜色",选定红色后点两次"确定"。
这样设定好后你输人数据如果长度不对会有提示,如果数据重复字体将会变成红色。
问三:在EXCEL中如何把B列与A列不同之处标识出来?
1、如果是要求A、B两列的同一行数据相比较:
假定第一行为表头,单击A2单元格,点“格式”>“条件格式”将条件设为:
单元格数值”不等于"=B2
点“格式”>“字体颜色”,选中红色,点两次”确定”用格式刷将A2单元格的条件格式向下复制。B列可参照此方法设置。
2、如果是A列与B列整体比较(即相同数据不在同一行)
假定第一行为表头,单击A2单元格,点“格式”>“条件格式”将条件设为:
公式"COUNTIF($B:$B,$A2)=0
点“格式”“字体”“颜色”选中红色,点两次“确定”用格式刷将A2单元格的条件格式向下复制。B列可参照此方法设置。
按以上方法设置后,AB列均有的数据不着色,A列有B列无或者B列有A列无的数据标记为红色字体。
问四:EXCEL中怎样批量地处理按行排序
假定有大量的数据(数值),需要将每一-行按从大到小排序,如何操作?
由于按行排序与按列排序都是只能有一一个主关键字,主关键字相同时才能按次关键字排序。所以,这一问题不能用排序来解决。解决方法如下:
假定你的数据在A至E列,请在F1单元格输入公式:=LARGE($A1:$E1,COLUMN(A1))
用填充柄将公式向右向下复制到相应范围。
你原有数据将按行从大到小排序出现在F至J列。如有需要可用“选择性粘贴/数值”复制到其他地方。
注:第1步的公式可根据你的实际情况(数据范围)作相应的修改。如果要从小到大排序,公式改为:=SMALL($A1:$E1,COLUMN(A1))
问五:巧用函数组合进行多条件的计数统计
例:第一行为表头,A列是“姓名",B列是“班级",C列是“语文成绩",D列是“录取结果”,现在要统计“班级为“二”"“语文成绩”大于等于104,"录取结果”为“重本”的人数。统计结果存放在本工作表的其他列。公式如下:
=SUM(IF((B2:B9999="二")*(C2:C9999>=104)*(D2:D9999="重本"),1,0))
输入完公式后按Ctrl+Shift+Enter键,让它自动加上数组公式符号"{"。
问六:如何判断单元格里是否包含指定文本?
假定对A1单元格进行判断有无”指定文本",以下任--公式均可:
=IF(COUNTIF(A1,"*"&"指定文本"&"*")=1,"有","无")=lF(ISERROR(FIND("指定文本",A1,1)),"无","有")
求某一区域内不重复的数据个数
例如求A1:A100范围内不重复数据的个数,某个数重复多次出现只算一个。有两种计算方法:一是利用数组公式:
=SUM(1/COUNTIF(A1:A100,A1:A100))
输人完公式后按Ctrl+Shift+Enter键,让它自动加上数组公式符号"{"。
二是利用乘积求和函数:
=SUMPRODUCT(1/COUNTIF(A1:A100,A1:A100))
问七:一个工作薄中有许多工作表如何快速整理出-一个目录工作表
1.用宏3.0取出各工作表的名称,方法:
Ctrl+F3出现自定义名称对话框,取名为X,在“引用位置框中输入:
=MID(GET.WORKBOOK(1),FIND("]",GET.WORKBOOK(1))+1,100)确定
2、用HYPERLINK函数批量插入连接,方法:
在目录工作表(一般为第一个sheet)的A2单元格输人公式:
=HYPERLINK("#""&INDEX(X,ROW())&"!A1",INDEX(X,ROW())
将公式向下填充,直到出错为止,目录就生成了。
善于使用表格中的公式,能够让我们的工作事半功倍,极大的提高我们的工作效率,节约我们个人时间,表格中的函数功能非常强大,如果我们能够熟练的使用函数和嵌套函数的话,无论我们遇到什么样的数据处理问题,都可以使用表格来进行解决。
图片来源于网络,如有侵权,请联系删除。
- ?
「进阶」Excel中的方差分析之双因素方差分析
烟灰
展开
预备阅读:【进阶】Excel中的方差分析之单因素方差分析
前言
前面我们说了方差分析中的单因素方差分析,但是在实际工作中,影响因素往往不止一个,需要考虑两个或以上因素对实验结果的影响。比如某公司销售汽车,在销售时,除了要关注汽车的外形、价格、耗油量等因素以外,还要考虑地区差异是否对销量有影响。今天来看一下双因素方差分析。
双因素方差分析
如果将汽车颜色看成是影响销量的A因素,不同地区看成是影响销量的B因素,同时对A因素和B因素进行分析,即为双因素方差分析。
双因素方差分析是指分析两个因素,即行因素和列因素,对试验结果的影响的分析方法。当两个因素对试验结果的影响是相互独立的,且可以分别判断出行因素和列因素对试验数据的影响时,可使用双因素方差分析中的无重复双因素分析,即无交互作用的双因素方差分析方法。当这两个因素不仅会对试验数据单独产生影响,还会因二者搭配而对结果产生新的影响时,便可使用可重复双因素分析,即有交互作用的双因素方差分析方法。今天分享个可重复双因素分析的实例。
实例应用
实例应用:可重复双因素分析方法分析何种因素对效益有显著性影响
1、案例描述
某企业为了了解4种方案(因素2)在4个不同地区(因素1)的销售额状况,分别将4种方案投入4个地区进行试验,现有各个方案在不同地区的3天销售额数据,如下图所示,要求分析不同地区、不同方案,以及二者相交互分别对销售额的影响。
2、实例分析
在假设为5%的显著性水平下使用可重复双因素分析法推断不同地区、方案以及两者之间的交互作用中哪些因素对销售额有显著影响。
3、操作分析
第1步:选择分析工具并设置相关参数。打开“数据分析”——“方差分析:可重复双因素分析”,确定,在弹出的对话框中设置,“输入区域”为“$A$1:$E$13”,设置“每一样本的行数”为“3”,设置“α”为“0.05”,在“输出选项”选择“输出区域”,设置为“$G$2”,确定。需要注意的是“每一样本的行数”为各因素每一水平搭配使用的次数。
第2步:显示可重复双因素分析结果。如下图所示。
4、决策分析
在分析结果第一部分的SUMMARY中,可看到各个方案对应地区的样本观测数、求和、样本平均数、样本方差等数据。在第二部分的“方差分析”中可看到,分析结果不但有样本[行因素/方案(因素2)]和列因素[地区(因素1)]的F统计量和F临界值,也有交互作用的F统计量和F临界值。
对比3项F统计量和各自的F临界值,样本、列、交互的F统计量都大于F临界值,说明方案、地区都对销售额有显著的影响。此外,结果中3个P-value值都小于0.01,也说明了方案和地区以及二者之间的交互作用对销售额都有显著影响,所以,该公司在制定后续的销售决策时,应考虑这些因素对销售额增长的作用。
小结
上面就是今天的主题内容了,今天学习一下Excel中如何进行双因素方差分析,可以分析多个因素对某一事物的影响的显著情况。希望通过上面的操作能帮助大家。如果你有什么好的意见,建议,或者有不同的看法,我都希望你留言和我们进行交流、讨论。
- ?
怎么用excel求协方差?
色调
展开
操作步骤
1. 打开原始数据表格,制作本实例的原始数据需要满足两组或两组以上的数据,结果将给出其中任意两项的相关系数。
2. 选择“工具”-“数据分析”-“描述统计”后,出现属性设置框,依次选择:
输入区域:选择数据区域,注意需要满足至少两组数据。如果有数据标志,注意同时勾选下方“标志位于第一行”;
分组方式:指示输入区域中的数据是按行还是按列考虑,请根据原数据格式选择;
输出区域可以选择本表、新工作表组或是新工作簿;
3.点击“确定”即可看到生成的报表。
可以看到,在相应区域生成了一个3×3的矩阵,数据项目的交叉处就是其相关系数。显然,数据与本身是完全相关的,相关系数在对角线上显示为1;两组数据间在矩阵上有两个位置,它们是相同的,故右上侧重复部分不显示数据。左下侧相应位置分别是温度与压力A、B和两组压力数据间的相关系数。
从数据统计结论可以看出,温度与压力A、B的相关性分别达到了0.95和0.94,这说明它们呈现良好的正相关性,而两组压力数据间的相关性达到了0.998,这说明在不同反应器内的相同条件下反应一致性很好,可以忽略因为更换反应器造成的系统误差。
协方差的统计与相关系数的活的方法相似,统计结果同样返回一个输出表和一个矩阵,分别表示每对测量值变量之间的相关系数和协方差。不同之处在于相关系数的取值在 -1 和 +1 之间,而协方差没有限定的取值范围。相关系数和协方差都是描述两个变量离散程度的指标。
(本文内容由百度知道网友我是来吓宝宝的贡献)
- ?
八年职场老手总结的22个Excel技巧,学会后薪资不翻倍都难!
陈从筠
展开
你知道当我听到说还有刚毕业的大学生说自己不会用Excel 表格时候,我的表情是有多震惊吗!
前几天我在指导刚进公司的一位负责市场的实习生做数据统计时候,我眼看着他打开Excel 然后墨迹了半天无从下手,然后他很一脸无辜告诉我,自己忘了Excel 怎么用了。
我一脸纳闷,难道现在大学生都不学这些基础计算机办公软件操作了吗??
实习生继续一脸无辜的告诉我,大一时候学过,但是三年没用过然后全忘了……
我服啦,那今天明叔就写篇如何教你用好Excel 的文章!就写给那些不长记性学过就忘的人,建议收藏。
Excel表格是一款无论是学生、白领、老师等等工作人员都会用到的办公软件。其实Excel中有很多方便快捷的功能,可以让你效率翻好几倍。
1.不同工作表之间的快速切换:
“Ctrl+PgDn”可以切换到右边的工作表
“Ctrl+PgUp”可以切换到左边的工作表
2.双击格式刷,可以把同一个格式“刷”给多个单元格。
3.快速应用函数:
当你设置好第一行单元格的函数,只需要把光标移动到单元格的右下角,当它变成一个小加号时,双击,公式就会被应用到这一列剩下的所有单元格里。
4.快速调整列宽
看下图,是否觉得单元格太宽了?
别急,纵向选中他们,将光标移至选中区域内的任一条纵向分割线上。
当光标十字形出现的样子时,双击;
大功告成!是不是宽度缩小了呢?!
5.快速增加或删除一列
按住“Ctrl+shift+ ’+’(加号)”就可以在选中的那一列左边再加一列,“Ctrl+shift+ ’-’(减号)”可以删除选中的那一列。
6.快速求和:
快速按下“Alt”和“=”,然后选中一列数字,就可以求出一列数字的和。
7.快速选定不连续的单元格
按下“shift+F8”激活“添加选定”模式,此时工作表状态栏会显示“添加到所选内容”字样,之后分别单击不连续的单元格或单元格区域,即可选定。
8.快速改变数字格式
“Ctrl+shift+4”可以将数字加上美元符号($)
“Ctrl+shift+5”可以让数字变成百分比格式(%)
“Ctrl+shift+1”可以让小数点后面的数字变成两位数格式,如0.5变0.50
9.检查数字错误
“Ctrl+、”可以让数字背后的公式显示出来,一目了然;
10.Excel搜索框快速定位查找指定的内容
按Ctrl+ F打开搜索框,当你不确定搜索关键字的时候,可以试试通配符问号(?)和星号(*)。
通配符就是通过符号指代一些文本,Excel中的通配符很简单,只有问号(?)、星号(*)和转义符号(~)三个。
问号(?)表示任意单个字符。
星号(*)表示任意多个字符,比如要查找的内容是:“西门*”,可以查找到“西门梁子”、“西门卫子”、“西门庆子”等所有以“西门”开头的内容。
要查找问号和星号本身时,需要在前面加上转义符号(~),比如要查找星号(*),就要在搜索框中输入: ~*
11.SUBTOTAL函数
SUBTOTAL函数可谓是全能王,可以对数据进行求平均值、求和、最大最小、相乘、标准差、标准差、计数。
这里还有一些可能会用到的函数,不妨先收着!
1.Count函数:统计数字的个数
PS:大小不一的合并单元格填充公式,要使用Ctrl+Enter。
2.Counta函数:统计非空单元格个数
Countif函数:依据条件统计个数
Countifs函数:多条件统计个数
3.Frequency函数:统计数字区间的频率
4.Sumproduct函数:多条件计数求和
5.average函数:计算数据的平均数
averageif函数:依据条件计算平均值,比如,AVERAGEIF(A1:A10,”>0”),返回的是A1到A10这十个数中,所有大于0的数的平均值。
6.Sum函数:对数据进行求和
7.Max函数:提取一组数中的最大值。比如:MAX(A1:A10)
8.Min函数:提取一组数中的最小值。比如:MIN(A1:A10)
9.Large函数:返回第N个最大值
10.Small函数:返回第N个最小值
11.Mode函数:返回一组数中出现最多的数字
很实用是吧,说的就你,赶紧上手试试吧!
- ?
这些Excel公式,简单却超实用!
糜稳
展开
就业等位来【这些Excel公式,简单却超实用!】①查找重复内容公式:=IF(COUNTIF(A:A,A2)>1,"重复","") ②求和:=SUM(K2:K56) ——对K2到K56这一区域进行求和 ③平均数:=AVERAGE(K2:K56) ——对K2 K56这一区域求平均数 ④排名: =RANK(K2,K$2:K$56) ——对55人的成绩进行排名。 @央视新闻:就业等位来【快转走!常用Excel公式都在这儿了!】求和、平均数、最大值、标准差……如何查找重复值;如何自动标出符合条件的数值……进阶版Excel超实用技巧。存好!有用!
版权声明:如涉及版权问题,请作者持权属证明与本网联系
来源:央视新闻
- ?
用Excel如何做方差分析?
寄翠
展开
以方差分析:无重复双因素分析为例,操作方式如下
1、选择需要进行方差分析的数据区域,然后单击数据选项卡
2、在分析功能组中单击数据分析按钮,弹出数据分析对话框
3、在分析工具列表框中选择方差分析:无重复双因素分析,单击确定,弹出方差分析:无重复双因素分析对话框
4、单击输入区域后的文本框,在表格中选择区域:$A$2:$B$20,单击输出选项,再单击后面的文本框,在表格中选择单元格:$E$1,再单击确定即可。
(本文内容由百度知道网友cctv1102贡献)
excel如何求标准差
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并