- ?
SPSS数据分析方法不知道如何选择
八贝勒
展开
一提到数学,高等数学,线性代数,概率论与数理统计,数值分析,空间解析几何这些数学课程,头疼呀。作为文科生,遇见这些课程时,通常都是各种寻求帮助,班上有位宅男数学很厉害,各种被女生‘围观’,这数学为什么这么难,学了有啥用呀。
有用的,当做数据分析的时候,使用到SPSS,在线SPSS分析的时候就知道用处了,在写论文的时候会用到SPSS数据分析,工作的时候也会用到SPSS数据分析。此时才知道原来数学很重要。我的数学不好肿么办?听我一 一道来。
1. 数据类型
学过数学的童鞋都知道,数学里面分了两类数据,离散和连续数据,听上去文绉绉的,不懂。那我问男人和女人知道不,知道,对了这种就是离散数据。身高体重知道不,知道,这种就是连续数据。离散数据可以理解为分类,类别,数个数;而连续数据理解为算平均值,度量,比如平均身高,平均年龄,但不能说成是平均性别。离散和连续数据是数学上文绉绉的称呼。如果我们是做数据分析,通常又换成另外一种称呼,定类和定量数据。定类就是离散数据,定量就是连续数据。这点get到后,数据分析方法啥都不在话下,让智能化软件SPSSAU【备注:在线网页版SPSS】这些去解决就好,默认出来智能化文字分析结果。
2. X和Y
除了数据类型外,数学上老是有一些符号,比如X,Y,Z, α, β,γ,还有好多拉丁符号,看着都头疼,而且更糟糕的是发音还那么奇怪。这些都是数学用词,如果是数据分析,只需要知道X和Y就可以。为什么这么简单呢?数据分析通常是用于业务场景,让所有人都会所有人都能懂的。而数学符号是专业性名词,一小部分学习数学专业的人群才懂。
而X,Y基本所有人都懂,平面二维式思维,如果加上Y就变成空间三维思维。这种会变得复杂难懂,而数据分析出来结果是让人理解让人懂的,越简单易懂越有意义越有用的结论越受欢迎。因此从数据分析角度来看,只需要懂X,Y这两个符号就OK。别小看X,Y这两个符号,加上上述的数据类型,它们可以产生非常多的组合,也称作分析方法。
有了X,Y,我们可以研究X和Y之间的关系情况,比如X对于Y的影响关系,X对于Y的差异关系等。下面一一讲述。
3. X和Y的组合方法
再讲组合之前,先单独讲下不区分X和Y的分析方法,如下表格:
当不需要区分不区分X和Y时,比如我只研究性别1个数据,或者只研究身高,体重情况如何等。并不需要研究关联关系,所以并不涉及X和Y的关联关系。这种都可统称为数据基本描述统计,当然数据类型不一样时,方法不同。比如性别为定类数据,这时用频数分析;身高体重是定量数据,这时用描述分析。数据的基本描述统计是最基础的数据分析方法,而且通常都需要做这类分析方法,因为了解了基本情况是非常必要的。
接下来将下X和Y之间的关联关系时,会使用到的数据研究方法;如下表格:
从上表可以看到,通常会涉及到差异关系,相关关系和影响关系共三类。比如不同性别的兴趣爱好是否有差异,性别为定类数据,兴趣爱好也是定类数据;此时就应该使用交叉卡方分析方法。比如研究性别人群体重是否有差异,性别为定类数据,体重为定量数据,此时就需要使用T检验;除此之外,如果想研究不同专业(理科、工科、文科)的体重差异时,此时应该使用方差分析。当X是定类数据,Y是定量数据,研究X对于Y的差异时,可以使用T检验和方差分析;区分在哪里呢?如果X的类别个数(比如男和女)只有2个时,通常使用T检验;如果X的类别个数超过2个(比如理科、工科和文科)时,只能使用方差分析。差异关系就只能有3种,接下来继续相关关系。
相关关系是研究X和Y的关系情况,比如身高和体重之间有没有关系;X和Y均是定量数据;此时应该使用相关关系,再具体一点应该叫Pearson相关关系(相关关系的数学公式是Pearson这人发明的)。
最后一类是影响关系;X对于Y的影响;影响关系的分析方法区分,完全是根据Y的类别而定;比如Y是定量数据,我们则应该使用线性回归分析;如果Y为定类数据,此时我们应该使用Logit回归分析,而具体再细分,Logit回归可以有:二元Logit回归,多分类Logit回归,区分在于Y,举例如下表:
如果X影响Y时,Y只分为两类,购买和不购买,愿意和不愿意,是和否等,这时候就需要使用二元Logit回归分析;如果Y分为n类(n>2)时,则需要使用多分类Logit回归。
数据类型,X和Y;这两点搞明白后,绝大多数的数据研究方法都可以搞定,而这也是当前数学研究的核心思想。也是分析软件的设计理念,网页在线版本的SPSS即SPSSAU软件平台,它的设计核心理念就是这样,只需要会区分数据类型,知道X和Y;就可以自己进行数据分析,其它的全部都可以直接由SPSSAU生成智能化文字结果;当然,分析方法还有很多的,比如因子分析,聚类分析等,这些方法不是研究X和Y的关联性,而是别有用处。
4. 其它研究方法
除开X与Y的关联关系研究,其实还有一些其它的研究方法;比如对于很多个X同时进行分析应该使用什么方法呢?此时可能会结合分析用处而对应不同的方法;常见有因子分析和聚类分析两种,如下表:
如果说了30句话,现在想把30句话概括浓缩成5个关键词,这种就叫浓缩;此时需要使用因子分析;如果有300个人想进行分类,分成3类人群,此时可使用聚类分析(常见是K-means聚类方法)。
除了浓缩和聚类,事实还有非常多其它的研究方法,比如信度研究,多因素方差,非参数检验,正态性检验,配对T检验等等。后续慢慢再谈,更多知识也可使用网页版SPSS即SPSSAU【备注:在线网页版SPSS】进行学习,里面智能化分析结果一目了然,‘拖拽点一下’完成分析得到智能化结果,更多研究方法的详述也可直接查到。
- ?
CPDA数据分析师:一个完整的数据分析流程
浮鸥鹭
展开
大数据在国内已经火热了一段时间,无论是政府还是企业都已开始重视大数据,纷纷设立大数据部门,数据之于企业的重要性不言而喻。因此优秀的企业为了分析收集来的海量数据,会毫不犹豫地雇佣专业级的数据分析师来帮助公司进行决策,创造价值。
据某招聘网站调查,一名有经验的数据分析师的年薪不低于20万。而数据工程师、数据科学家等则收入更高。作为数据分析师,无论最初的职业定位方向是技术还是业务,最终发到一定阶段后都会承担数据管理的角色。因此,一个具有较高层次的数据分析师需要具备完整的知识结构。大数据时代,数据分析对于企业决策和发展起到越来越重要的作用。
1.数据采集
了解数据采集的意义在于真正了解数据的原始面貌,包括数据产生的时间、条件、格式、内容、长度、限制条件等。这会帮助数据分析师更有针对性的控制数据生产和采集过程,避免由于违反数据采集规则导致的数据问题;同时,对数据采集逻辑的认识增加了数据分析师对数据的理解程度,尤其是数据中的异常变化。
在数据采集阶段,数据分析师需要更多的了解数据生产和采集过程中的异常情况,如此才能更好的追本溯源。另外,这也能很大程度上避免“垃圾数据进导致垃圾数据出”的问题。
2.数据的加工整理
在明确数据分析目标基础上收集到的数据,往往还需要进行必要的加工整理后才能真正用于分析建模。数据的加工整理通常包括数据缺失值处理、数据的分组、基本描述统计量的计算、基本统计图形的绘制、数据取值的转换、数据的正态化处理等,它能够帮助人们掌握数据的分布特征,是进一步深入分析和建模的基础。
3.数据分析
数据分析相对于数据挖掘更多的是偏向业务应用和解读,当数据挖掘算法得出结论后,如何解释算法在结果、可信度、显著程度等方面对于业务的实际意义,如何将挖掘结果反馈到业务操作过程中便于业务理解和实施是关键。
4.数据展现
数据展现即数据可视化的部分,数据分析师如何把数据观点展示给业务的过程。数据展现除遵循各公司统一规范原则外,具体形式还要根据实际需求和场景而定。基本素质要求如下:
工具:PPT、Excel、Word甚至邮件都是不错的展现工具,任意一个工具用好都很强大。
形式:图文并茂的基本原则更易于理解,生动、有趣、互动、讲故事都是加分项。
原则:领导层喜欢读图、看趋势、要结论,执行层欢看数、读文字、看过程。
场景:大型会议PPT最合适,汇报说明Word最实用,数据较多时Excel更方便。
最重要一点,数据展现永远辅助于数据内容,有价值的数据报告才是关键。
5.数据应用
数据应用是数据具有落地价值的直接体现,这个过程需要数据分析师具备数据沟通能力、业务推动能力和项目工作能力。
数据沟通能力。深入浅出的数据报告、言简意赅的数据结论更利于业务理解和接受,打比方、举例子都是非常实用的技巧。
业务推动能力。在业务理解数据的基础上,推动业务落地实现数据建议。从业务最重要、最紧急、最能产生效果的环节开始是个好方法,同时要考虑到业务落地的客观环境,即好的数据结论需要具备客观落地条件。
项目工作能力。数据项目工作是循序渐进的过程,无论是一个数据分析项目还是数据产品项目,都需要数据分析师具备计划、领导、组织、控制的项目工作能力。
数据分析师技能要求
1、数理统计基础
作为一名数据分析师,一定要掌握一些基础的、成熟的数学模型算法。例如:回归分析、因子分析、聚类分析、决策树、关联规则、神经网络等。同时建议多看一些博文,看别人对于这个方法的理解,怎么在实际业务中应用,以及如何优化等等。在算法上可以不做到用软件编写算法,但是一定要知道原理,知道怎么应用,怎么调整参数,参数的含义等等。
2、工具
对于一个初级的数据分析师要掌握的基础工具,Excel,SPSS,数据库(如mysql等),随着大数据的来临,传统的一些软件已经不足以支撑数据分析、数据挖掘了,随着工作年限的增长,工作内容的加深,R和Python一定要会一个,目前流行的很多机器学习算法要这些软件才能实现。现在机器学习很火,建议多研究一下这方面的内容,不论是对于自身的提升还是对职业发展都是非常有利的。
3、对行业的了解程度
对特定行业的了解可以帮助数据分析师尽快进入状态,加速决策的过程。如果缺少这一前提,你的数据分析师可能不得不花时间来先对整体行业有一个大概地认知,学习相关知识,然后才能投入其中。
4、沟通能力
现代社会,工作通常要通过分工合作来完成。沟通成为其中必不可少的一环。所以你想要雇佣的数据分析师在这方面有所建树的话,可以极大地提升工作效率。另外,拥有良好沟通能力的专家懂得合理地呈现数据可视化成果并且讲好数据故事。
要成为高级数据分析师的话,一方面是要强化对业务的理解,最好是做到通过数据分析帮助公司决策方向,或者说促进企业快速增长。另一方面,要加强机器学习/数据挖掘的专业知识学习,将机器学习成为数据分析的手段。最后,要强调的是,数据分析师是一个实践的职位,要在实际项目中不断的训练。
- ?
「技术干货」分化时间分析—beast2软件介绍
阎莫茗
展开
分化时间,当前宏观进化分析的一个热点,以某一特定类群的化石记录作为参照点,通过基因序列间的分歧程度以及分子钟来估计速率恒定分支间的分歧时间,同时计算系统发育树上其它节点的发生时间,从而推断相关类群的起源时间和不同类群的分歧时间。在这里有一个重要概念,分子钟:一个特定的生物大分子(蛋白质或DNA)在所有的演化谱系中具有恒定的演化速率。其中,演化谱系指不同类群。
目前进行分化时间分析的软件还是比较多的,比如beast2、paml软件包中的mcmctree、mega等软件。
今天呢,就给大家介绍一下如何利用beast2进行分化时间的分析。
beast2软件:
下载地址:http://beast2.org/
测试数据:软件提供的数据集Primates.nex
具体操作步骤:
1、软件安装(已经编译,下载即可运行)
2、相关软件包安装(解决其它生物学问题)
File—Manage Packages—跳出对话框
根据自己的需求去安装
3、序列导入
File—Import Alignment—跳出对话框
4、Link/Unlink partition models
一般在分析中,导入的是比对好的基因序列信息,但有些情况下,也会存在partitions情况,如果联合分析,就需要Link,如果不需要unlink。
5、替代模型设定
针对核苷酸替代模型,可供选择的有GTR、HKY、JC69、TN93,这里用HKY替代模型,Gamma Category Count(碱基替代速率变化等级)一般可设置4-8,在这里选择4。其它参数如Substitution Rate(替代率)、Shape(GAMMA分布的形状参数)、Frequencies(碱基频率)在分析中均估计。
6、分子钟
点击Clock Model,有Strict Clock(严格分子钟)、宽松分子钟(Relaxed Clock Exponential 和Relaxed Clock Log Normal )等。在这里选择Strict Clock,不考虑模型中分支之间的速率变化差异。
7、先验信息设定
点击Priors tree prior:Yule Model 其它默认即可。
分化时间设定:
在Priors这一栏最下方有一个"+" 按钮,点击确定后,出现下图:
在Taxon set label自定义一个名字:比如fossil information。然后选择需要标定分歧时间的两个物种,移到右边边框。
现在需要在校正节点上设置先验分布信息,首先点击monophyletic在下拉菜单([none])中选择Normal
随后设置分歧时间,Homo sapiens 和 Pan的分歧在5-7My,因次设定正态分布中心点是6My,标准偏差0.5My。如图:
备注:可以设定多个分歧时间,重复该步骤即可。
8、MCMC选项设定
点击MCMC
运行链长:10000000(默认1千万步,根据自己实际情况自行调整)
tracelog:链长运行1000次抽样一次
screenlog:运行1000次打印到屏幕一次
treelog.t:tree:运行1000次打印一个拓扑结构树
在第8步运行中,由于设置的链长是10000000次,所以在tracelog、treelog.t:tree等输出的结果文件中,会有10000000/1000=10000个抽样值等信息。具体输出结果多少依据自己的设定信息。
备注:根据设定的运行链长(假设1千万次)
抽样频率太小的话,输出无用信息会很多,且增加运行时间;
抽样频率太大的话,输出有用信息太少,影响后续分析。
在这里设定的是1000次,相对总的运行链长,比较合适。
9、xml文件保存
点击File—Save As,定义一个输出文件名字,结果生成一个XML文件
10、如果是linux系统,运行./beast,产生一个如下对话框,导入制作好的XML文件即可运行 。
命令行模式:nohup ./beast -threads 线程数 test.xml &
其它系统文件导入类似:
11、结果评估
结果主要生成3个文件:日志文件(*.logs)、树文件(*.trees)、xml状态文件(*.state)。
日志文件可用trace(软件)查看,评判结果是否收敛。
Trace软件下载地址:
http://tree.bio.ed.ac.uk/software/tracer/
主要查看:1、ESS ;2、Trace
12、分化时间
利用beast软件包中的程序包treeannotator进行评估。
点击treeannotator,出现对话框:
在这里设定Burnin percentage:50;Posterior probability limit:0.0;Target tree type:Maximum clade credibility tree ;Node heights:Mean heights
Input Tree File:主程序运行生成的树文件(*.trees)
Output File:输出文件名字
设置完成后,点击Run即可,最后会得到一个主要含有分化时间的树文件(NEXUS格式)。
13、查看
上一步生成的树文件可用软件figtree查看。
Figtree软件下载地址:
http://tree.bio.ed.ac.uk/software/figtree/
如图:前面设定Homo sapiens和pan分歧时间在5-7My,结果运行后时间是5.9262百万年。
以上就是利用beast2进行分化时间估算的基本操作步骤,今天下午会给大家做一个实际操作演示,并且针对在已有的系统发育树上如何基于这款软件进行分化时间的分析。
- ?
人人都爱数据分析 Data analysis six fly(3)
盖恩斯伯勒
展开
第3章 数据分析常识
在前面几章里讲了很多关于数据分析市场和数据分析师的职业生涯发展,下面的几篇会重点介绍数据分析的理论知识、数据分析的方法论、数据分析的分析流程、数据分析报告如何撰写、电商中的数据分析应用等具体的应用案例。经常也会被问到作为一个不是统计学背景的学生,能否入行数据分析的问题。还有包括像平时的具体数据分析工作都有哪些?作为数据分析入门菜鸟怎么才能打好数据分析方面的基础,需要看哪些方面的书等等。其实这些问题对于一个刚毕业的或者没有太多数据行业经验的人来说,是很正常的一个情况。包括自己在内,如果要重新跨行去进入一个新领域也会遇到这些问题。首先咨询相关行业的内部师兄师姐,看看相应的介绍和材料,如果能够有比较系统的书籍介绍那是最好不过的了。当然自己也需要花时间去归纳和总结,再结合大量的实践案例长期以往基本上会对这块新领域能够了然于胸了。
前段时间和做大数据培训的创始人聊到,我问他原来是做什么的,让我诧异的是他原来是做用户体验(User Experience Design,UED)出身的。对我来说,第一反应认为产品提需求,UED根据PD的相应需求文档构思设计相应的产品,而对于数据分析以及业务运营,这的确就是很多UED所欠缺的核心,而脱离实际业务的UED并不是真正的UED,没有结合产品和用户需求本身来设计,很多也只是空中楼阁。我和那位创始人聊了很久,特别是他在过去的一些经历和感受,同时他也是阿里巴巴曾经做过UED的同事,我想这个经验分享在互联网公司还是比较有代表性的。
说到用户体验,很多人会感觉这是一个很虚的概念,是一种纯主观的在用户使用一个产品(服务)的过程中建立起来的心理感受。因为它是纯主观的,就带有一定的不确定因素。我接着问道,那平时调查用户体验时你们会关注数据吗?令我欣慰的是,那位创始人说平时太需要数据的支持了。包括之前设计的功能布局、页面结构、按钮的颜色、整体的风格都需要通过大量的AB 测试来验证用户的体验是否符合预期。这在互联网公司尤为典型,像现在上线的产品和功能很多都是拍脑袋决定或者固有的思维模式认为就应该这样,而实际情况没并就一定是用户希望看到的。特别是典型的Facebook从早期的一个简单的社交产品到现在日活跃用户十亿,一个很小的改变就可能会引来用户的强烈感觉。在这些多年里,Facebook尝试了各种方案,像newspaper、clipboard等样式,虽然这些都实现了,但是都因为数据的原因没有上线。
我那位大数据培训的朋友也分享了一下他们亲身经历的故事,是关于当时做超市购物车的案例。购物车是每个网上超市都有的,可以让用户挑选商品,快速结账,所以功能上一点都不能少,而且文案要给用户都能看明白。而在具体设计到购物车的布局时产生了分歧:一种是希望以纵向列表的方式展示,另一种是以大图的方式。但是大家都没有尝试过这种大图的模式,而纵向列表的方式是用户使用最方便的,比较一目了然。另外,对于购物车的单位设计也存在一些争议,很多电商网站都是用“件”来表示一个商品,比如同一件商品买了两个到底是算一件还是两件,大家对此一直争论不休。通过那几年的UED工作,他对UED有了更深的理解,虽然对于UED有很多想法,但是由于各种原因,比如上线时间老板说了算,还有很多想法受限技术的原因很难实现,特别是在实现方案上没有用户研究的数据支撑很难判断而导致最终都没有实现。我听了他的诉苦也是感触很深,跨部门之间的沟通的确需要很大的成本,特别是没有站在对方的利益场上就更难合作。所以如果大家都能有一种共同的价值观和意向,在沟通协调上能够达到事半功倍的效果。
3.1 常见的数据分析问题
如果你希望从事这个数据分析行业的,亦或是对数据分析感兴趣的,那就需要把数据分析常见的一些问题弄明白,避免被别人忽悠到不知东南西北。即使作为在数据分析行业从事了几年的职场老鸟来说,再次回顾常见的数据分析问题也会有不一样的思考和感受。
在我们接触到数据分析这个领域的时候,不同的对象、不同的时期会遇到不同的问题。对于刚入行的同学来说可能需要知道数据分析的基本概念,数据分析都有哪些,包括数据分析和统计分析、数据挖掘的区别和联系是什么,在数据分析上常见的工具都有哪些,还需要了解如何增加自己在数据分析这块的经验和技术,在面试的过程中如何给自己加分等。对于入行1、2年的数据新人来说,需要在有一些基本的数据处理和分析能力基础上思考如何自我成长,在现有的环境下突破瓶颈。对于工作了很长时间的资深数据分析人员来说,则需要考虑如何能够在技能上和个人发展上再次升华。这些都是在数据分析生涯中会遇到的问题。而本小节会重点介绍我们作为入门的数据分析新人遇到的一些常识问题,这些都是我们在数据分析讨论、论坛以及在面试环节可能会聊到的话题。
1. 数据分析是什么?数据分析包含哪些?
数据也称观测值,是实验、测量、观察、调查等的结果,常以数量的形式给出。数据分析的目的是把隐没在一大批看来杂乱无章的数据中的信息集中、萃取和提炼出来,以找出所研究对象的内在规律。在实用中,数据分析可帮助人们作出判断,以便采取适当行动。数据分析是组织有目的地收集数据、分析数据,使之成为信息的过程。这一过程是质量管理体系的支持过程。在产品的整个寿命周期,包括从市场调研到售后服务和最终处置的各个过程都需要适当运用数据分析过程,以提升有效性。例如J.开普勒通过分析行星角位置的观测数据,找出了行星运动规律。又如,一个企业的领导人要通过市场调查,分析所得数据以判定市场动向,从而制定合适的生产及销售计划。因此数据分析有极广泛的应用范围。
而数据分析包括的内容从需求识别、获取数据、整理数据、观察数据到分析数据、数据展现的各个环节。
第一步就是要准确识别需求,定位到问题的核心所在和需要哪些数据来支撑你的观点,这样为收集数据、分析数据提供清楚的目标。区分一个高级数据分析师和一般数据分析师,能够第一眼就识别问题的所在,掌握数据库的熟练程度,第一时间通过数据的校验验证自己的观点。
第二步获取数据,将需求转变成具体的数据要求,明确哪些数据是需要的,他们在什么地方,可以通过谁来获取。
第三步就是观察数据,通过加工、整理分析成有用的信息,通常结合时间序列、对比、趋势等。
第四步分析数据,结合现有的业务和数据发现的问题,提出建议和意见。
最后往往还要再回过头看看数据分析方法是否正确、是否数据质量上还有什么问题、收集到的数据是否真实等。
2. 数据分析与数据挖掘的区别?
在接触数据分析和数据挖掘的时候,也会遇到数据分析和数据挖掘是什么,之间区别有哪些。从实际工作中来看数据分析和数据挖掘也是两件不同的事情,但是两者有很强的相关联性。
从概念上讲,数据分析是在统计数据的基础上通过结合分析方法论得出一定的结论,而数据挖掘更多是对历史数据进行未知结果的探索。像我们最常见的“啤酒与尿布”的故事,我们结合数据只能分析出啤酒和尿布的销量都很高,但是这其中为什么啤酒和尿布是有相关联的,那就需要通过数据挖掘的方法来挖掘,从中发现去买尿布的男士都会顺便去买啤酒。再比如我们通过数据分析发现电商购物的人群70%都是女性,所以结论就是女性更喜欢购物,而通过数据挖掘我们发现由于女性天生喜欢逛街购物、大部分时间会去关注比较漂亮的商品、没有太多目的性,导致女性在电商中的购物比例很高。
在工作内容上,数据分析的工作偏重对业务层面的理解,能够结合具体的业务和已有的数据,给出自己有力的观点,给到业务决策的支持。数据挖掘的工作偏重系统工程,通过历史数据样本召回、数据特征工程和模型算法,对未来结果预测。所以在工作内容上两者的差别也是比较巨大,但又有联系。举个例子,在公司做数据分析师的阶段,日常的工作是整理网站流量趋势变化的报表,如果流量上涨或者下跌要能够分析这其中的原因是什么,可能是业务方有营销活动的动作,也有可能是系统层面的数据问题。而在公司做数据挖掘的平时工作就在某一个小点上,如果利用数据挖掘来预测明天可能有哪些用户会来登陆。涉及登陆频次、用户的个人属性情况、用户使用网站的周期、网站的活动因素等各方面的数据特征。利用模型去训练和预测明天登陆用户的概念。最后在实际的业务场景中去应用。
因而不难发现,数据分析更多是对已有数据进行观察分析,数据挖掘更多是对知识的规律探索总结。在方法论上数据分析更多凭借人结合数据经验,数据挖掘会结合算法模型分析。
3. 数据分析和做报表的区别?
过去BI一直被人认为就是做报表的,所以不管是业务部门还是技术部门一有报表需求就会去找BI部门。而BI部门也不想把自己定位成做报表的部门,所以一直在接这方面的需求没有太多积极性。
咨询行业内有一个经典的故事:
一个农民赶着羊群在草原上走,迎面碰到一个人对他说:“我可以告诉你,你的羊群有几只羊。”随即,他用卫星定位技术和网络技术将信息发到总部的数据库……片刻后,他告诉农民羊群共有1460只羊,并且要求农民给他一只羊作为报酬,农民答应了。随后,农民对他讲:“如果我能说出你是干嘛的,你能否把羊还给我?”那人说,“行”。农民说:“你是一个咨询顾问。”那人很惊讶,问农民是怎么知道的。农民说:“有三个理由足以让我知道:1.我没有请你,你自己就找上门来;2.你告诉了我一个早已知道的东西,还要向我收费;3.一看就知道你不懂我们这一行,你抱的根本不是羊,而是一只牧羊犬。”
这个笑话在咨询界广为流传,并有不同的公司版本,和前段时间“友谊的小船说翻就翻”一样在微博和朋友圈被人转发。而有意思的是,许多资深咨询顾问看到这个笑话并不感到恼怒,而是会心地一笑。公开场合下,他们一定会非常自信地说,咨询非常深刻地影响企业的战略,因此具有非常重要的价值。不过私底下,他们对于是否真的“能改变世界”这一点并不够自信。作为定位于公司辅助决策的数据分析部门而言,BI也在接受这样的调整。名称叫商业智能,指导公司的高层,而在具体的实际行动中,因为高层不懂数据或者数据部门不理解业务,再或者没有足够的数据能够支撑你去做很多的分析,导致最终的很多公司数据部门变成了一个“做报表”的部门。而报表作为管理层经常需要看的媒介,又不可或缺。值得高兴的是,现在有很多可视化的数据工具来帮助传统企业在做报表的过程中提高效率和优化美观,与过去需要数据分析师专门每天去重复拉取excel报表来说明显进步很多。但对于一些更加深入的分析还是需要资深的数据分析师来结合业务单独分析,并非是简单的报表的能够解决的情况。所以资深的数据分析师还是一种是众多公司争抢的资源。
如今在市场方面,数据分析、数据仓库、数据挖掘、大数据等概念热得发烫,数据分析师被认为是万众仰慕的职场新宠,关于数据分析师技能、职责、职业素质、发展前景等的讨论不绝于耳。就像“姚黑”一样,数据分析的质疑声也不断传出和放大,数据分析、挖掘到底能否产生价值,多大价值?
数据分析员、数据分析师不应当只会“数羊”!不应当只是发现本应该发现的“经验”!而应当掌握数据探索,发现潜在的价值,预见可能将发生的某种“坏的未来”!
4. 数据分析难不难学?特别是背景非理工科的。
只要有恒心就会学会,而且这个目前也是一个热门,因为现在数据量越来越大了,所以对这方面的需求也越来越多。学习数据分析,先要打好理论基础,《概率论与数理统计》、《统计学》、《深入浅出数据分析》等。然后就是主流的数据分析软件,关于数据分析主流软件有(从上手度从易到难):Excel,SPSS,Stata,R,Python,SAS等。
如果是理工科背景的,了解数据分析并掌握相对来说比较好上手。重点是对统计学知识的熟练掌握,另外就是在编程方面能够有一定的基础,在处理数据和查询数据、分析上面能够自己操作,特别推荐像R、python这样比较好上手的语言,基本能够解决目前80%的数据分析需求。
如果是非理工科的,那可能还是需要在高等数据、微积分这些上面先花段时间学习一下,了解数学方面的基本方法论。学习常用的数据分析方法论都有哪些,比如趋势分析、对比分析、关联分析、预测分析等。常用的市场分析方法论,如SWOT、PEST、4P、波士顿矩阵、5W2H等。
最后还是需要大量的项目和工作案例来锻炼,学会怎样操作那些数据分析软件,学习从哪些角度去思考分析常见的指标问题。然后是利用软件从数据的清洗开始一步步进行处理,分析,最后输出结果,检验及解读数据。
5. 数据分析可以...
- ?
学习计划|带你10周入门数据分析
强壮的
展开
“我是文科生出身,可以学习数据分析吗?”
“我没有编程基础,可以成为数据分析师吗?”
“学习数据分析必须学习R和Python吗?”
… …
其实,数据分析没有想象中那么难,入门也没有那么多条条框框。
我认识的HR转数据分析,市场营销转数据运营的,大有人在。
数据分析重要的是问题的理解、分析的思路、分析的流程及结果的解读,工具和编程都是实现这些分析思路的手段之一。
不过优秀的数据分析师也并非几日能速成,但入门也有入门的捷径。
盘算了一下数据分析的入门知识,大体分为以下这些,只要拿出你大学时啃高数的状态,每周夯实一个基础,基本能学成。
学习大纲:
数据分析的思维和方法Excel进阶数据库理解和SQL入门数理统计学数据分析软件应用数据可视化常见的业务分析模型Python/R语言掌握业务理解和指标设计增长黑客:数据驱动增长
wo de 接下来,我将花一个月的时间在我的公号里【数据分析不是个事儿】详细讲述每一块教程,欢迎关注。
第一周:培养数据分析思维
为什么数据分析思维很重要?
如果我们在分析一个问题前,思维缺失就像下面图中所表达的一样,往往不知道问题从哪里下手,即使拿到数据也是一脸懵逼。
所以我们要通过训练数据分析思维,帮助在遇到问题时,大家脑中能快速梳理出分析的切入点,甚至是分析的思路,这一点很重要。
常用的一些思维方式:
1、金字塔/结构化思维
把待分析问题按不同方向去分类,然后不断拆分细化,能全方位的思考问题,一般是先把所有能想到的一些论点先写出来,然后在进行整理归纳成金字塔模型。主要通过思维导图来写我们的分析思维。
2、公式化思维
在结构化的基础上,这些论点往往会存在一些数量关系,使其能进行+、-、×、÷的计算,将这些论点进行量化分析,从而验证论点。所谓指标体系,就是这么梳理得来的。
业务化思维
业务化即是深入了解业务情况,结合该项目的具体业务进行分析,并且能让分析结果进行落地执行。用结构化思考+公式化拆解得出的最终分析论点再很多时候表示的是一种现象,不能体现产生结果的原因。所以需要继续去用业务思维去思考,站在业务人员或分析对象的角度思考问题,深究出现这种现象的原因或者通过数据推动业务。
增加业务思维方法:贴近业务,换位思考,积累经验。
同时,这样的思维模式在一些特定业务场景下,还衍生出一些基础的分析方法,比如象限法、多维法、假设法、指数法、二八法、对比法、漏斗法,这个对未来构建分析模型都有帮助。
思维模型的好处是他能提供一种视角或思维框架,从而帮助你建立起观察事物和分析问题的视角。通过对思维模型的学习和训练,能提高你成功的可能性。
第二周:Excel技能进阶
学习Excel是一个循序渐进的过程
基础的:简单的表格数据处理、筛选、排序
函数和公式:常用函数、高级数据计算、数组公式、多维引用、function
可视化图表:图形图示展示、高级图表、图表插件
数据透视表、VBA程序开发
按照我习惯的方法,先过一遍基础,知道什么是什么,然后找几个case练习。多逛逛excelhome论坛,平常多思考如何用excel来解决问题,善用插件。
函数和数据透视表是两个重点,结合业务场景来学习,可参考《谁说菜鸟不会数据分析》。
制作数据模板必须掌握的excel函数
日期函数:day,month,year,date,today,weekday,weeknum。日期函数是做分析模板的必备,可以用日期函数来控制数据的展示,查询指定时间段的数据。
数学函数:product,rand,randbetween,round,sum,sumif,sumifs,sumproduct
统计函数:large,small,max,min,median,mode,rank,count,countif,countifs,average,averageif,averageifs。统计函数在数据分析中具有举足轻重的作用,求平均值,最大值,中位数,众位数都用得到。
查找和引用函数:choose,match,index,indirect,column,row,vlookup,hlookup,lookup,offset,getpivotdata。这几个函数的作用不用多说,特别是vlookup,不会这个函数基本上复杂一点的报表寸步难行。
文本函数:find,search,text,value,concatenate,left,right,mid,len。这几个函数多半用在数据整理阶段使用。
逻辑函数:and,or,false,true,if,iferror。
数据透视表
数据透视表的作用是把大量数据生成可交互的报表,数据透视表具有这样一些重要功能:分类汇总、取平均、最大最小值、自动排序、自动筛选、自动分组;可分析占比、同比、环比、定比、自定义公式。
第三周:学习数据库原理和SQL
做数据分析,数据从哪里来?数据库!怎么取数据?写SQL!
做数据分析,取数、清洗数据,基本都要依赖SQL。
初入门阶段,对于数据库不必精通,只需了解常用的数据库类型,能够在现有的表格里面查询出数据,能够更新数据对数据进行重编码,知道怎么增加添加数据,把数据变得规整就行。理解主键,索引等含义和用处。导入导出数据可以使用工具,分析数据可以使用ODBC或者其他的接口对数据库进行连接。取数的排序,做数据的交集并集,数据转换,数据表合并等这些,最好也能掌握。
这里我总结了几个核心技能:
技能一:学会用select语句添加字段和找出需要的数据
直接给一个随时可以套用的万金油模板吧:
select cola,colb,colc into newtable from oldtable wherecola='x' and colb is not null;
基本上,学会这个就可以完全的查出大部分的数据了。
select后面是一个个的字段,要哪个选哪个。有into意味着放到一张新表里面,没有就是查询出来。where之后的就是我们的条件,等于某个值,或者是不是空值,是最常用的几种查询方式吧。
还有一种select也用的非常多:select cola from oldtable group by cola;
这个语句是看看cola有多少种值的可能性。
select进阶学习,可能要讲讲join,union,以及多个查询组合成的嵌套查询,或者是子查询的模式,以及模糊查询。这个后面我会再花篇幅写出来给大家参考。
技能二:学会alter学会增加,减少字段
alter可以做的事情很多,增加字段,减少字段,增加主键减少主键等等,非常常用。
1. 增加字段:alter table tablename add colname varchar;
这样就可以增加一个空字段,varchar是一种数据类型。
2. 减少字段:alter table tablename drop column colname;
这样就去掉了一个原有的字段。
技能三:学会update学会更新数据更新数据
大概常用的有两种,一种是更新成一个固定值:
update table set col=1;
另一种是从另一张表里面更新,这种方法,在处理一些小型数据的时候经常会导出,然后导入到数据库,就可以用:
update table set col=tableb.col from tablebwhere table.id=tableb.id;
里面table和tableb是两张表,然后通过两张表的id关联起来,学会这个书写结构就行。
第四周:数理统计学
统计学是数据分析师必备的基础知识之一,是一组用于汇总数据和量化给定观测样本域属性的工具。
单独的原始观察数据只是数据,还不能变为我们想要的信息或知识。有了原始数据,那么接下来的问题是:
什么是最常见或可预期的观测?观测的限制条件是什么?数据是什么样子的?回答这些问题,我们需要借助一些统计工具来得出一些结论。借助统计学,你的分析深度、专业度和科学性都会有很大提升。
所以这一周,我们需要掌握统计学的以下几大概念:
1.集中趋势(中数、众数、平均数)
2.变异(四分位数、四分位距、异常值、方差)
3.归一化(标准分数)
4.正态分布
5.抽样分布(中心极限、抽样分布)
6.估计(置性度、置信区间)
7.假设检验
8.T检验
推荐书籍:吴喜之-《统计学·从数据到结论》
第五周:数据分析软件应用
有了数据分析思维基础,懂一些统计学知识之后,我们就可以着手开始相对专业的分析,用可视化的方法探索数据的规律。
这一周,除了Excel,你需要掌握一个傍身的数据分析工具。
考虑到快速入门,这里暂时放一放SPSS、R、Python一类工具,先掌握BI工具的运用,帮助快速熟悉起数据分析的流程。知名的BI产品有Tableau,Power BI,还有国内的FineBI,网上都有体验版和免费版下载。处理好的数据拿来放BI分析,分分钟就能出很漂亮的可视化,比Excel的图表高级多了,而且绝大多数人都能轻松上手。
BI需要掌握数据的连接,连不上数据怎么分析。还有仪表盘Dashboard的概念,知道绝大多数图表适用的场景和怎么绘制,维度和指标的区分。一些数据的清洗,如果BI掌握得透彻也可以放BI处理,但不熟悉还是用SQL处理吧。
第六周:数据可视化
可视化看似是简单的步骤,但也是有造诣的。可视化说白了是一种表达,数据分析结果表达的是否到位,领导是否认同,工资涨不涨,全靠这一纸dashboard(当然还有你“讲故事”的功力)。
如何选择最佳的图表类型?趋势性、相关性、分布性、周期性、地理位置分布性……
颜色和字体等细节样式方面,如何进行更加美观的调配。
布局设计原则,故事性布置可视化仪表板,报告的标题和结论注释,以及整体展现的逻辑性。
还有很多可视化的陷阱,都是值得花一周探究的。
第七周:常见的业务分析模型
基于一些数据分析方法,如象限法、多维法、假设法、指数法、二八法、对比法、漏斗法,在特定业务场景下,还衍生了通用的业务分析模型,常用的有购物篮分析模型,RFM模型,漏斗分析模型,客户生命周期,以及预测、聚类分析等挖掘模型。
这一周我们要掌握常用的分析模型,最好能有深刻的认识,直接套用到实际的业务场景中,活学活用。
第八周:Python/R语言掌握
到这一周,数据分析的入门之路基本上完成一大半。
本着提升自己,以及加大自己求职和面试的筹码,掌握Python或R绝对是加分项。
有关数据分析的编程语言有Python和R语言。R语言倾向于统计分析、绘图等。统计学家或者学统计学的喜欢用R语言,而我更青睐学习Python,因为Python是面向未来的语言,无论从流行度、可用性还是学习难度来讲,Python都是最好的入门语言。
当然,如果可以的话,再掌握一下R语言是最好不过的,学习嘛,永无止尽。
Python有很多分支,但我们学习的主题是数据分析,入门推荐《深入浅出Python编程》
从code academy开始学起,完成上面的所有练习。Code academy涵盖了Python基本概念。当完成了code academy练习之后,看看这个Ipython notebook:
其次,掌握三个库Numpy、Pandas、Matplotlib
Numpy是利用Python科学计算的基础包,对Numpy好的掌握将会帮助你有效地使用其他工具例如Pandas。包括N维数组,索引,数组切片,整数索引,数组转换,通用函数,使用数组处理数据,常用的统计方法等等。
Numpy Basics Tutorial,Index Numpy 遇到Numpy陌生函数,查询用法,推荐!
Pandas包含了高级的数据结构和操作工具,能使得Python数据分析更加快速和容易。包含series, data frams,从一个axis删除数据,缺失数据处理等等。
Pandas Basics Tutorial,Index Pandas 遇到陌生函数,查询用法,推荐!
Matplotlib是一个强大的Python可视化库。几行代码就能绘制出散点图、折线图、直方图、柱状图、箱线图等。
第九周:业务理解和指标设计
到了第九周,大家可以发现,这个学习计划更多是偏业务的数据分析,可见业务理解的重要性。但业务理解需要多年的积累,没有掌握的捷径。刚入门也不会拷问太多业务上的问题,更多时候是考验你逻辑思维能力和数据分析的方法。所以简单花一周时间了解各行业的业态,各业务的通用指标。
其次,指标体系。几乎一个数据岗的岗位要求都会涉及这样一句话:“负责建立和优化部门的数据指标体系”。事实上目前大多的数据岗主要工作都是不断完善与优化数据指标体系,而对层面的工作是比较少的,即使岗位叫做数据分析师 。一个优秀的数据指标体系,不仅能让你快速解决数据需求,洞察出可能会被忽略的价值数据,还能反映出你目前最需解决的业务问题。所以,这一周还要掌握梳理业务指标的思路。
第十周:数据驱动&增长黑客
这个话题比较严肃,需要把数据分析师这...
- ?
数据正态性检验的三种方法
白杨
展开
数据服从正态分布是许多统计方法的基本条件。下面介绍统计分析中验证数据正态性常用的三种方法。
1. 带正态分布概率密度曲线的直方图。 其基本原理是画出样本数据的频数分布(即直方图),然后该组数据的理论分布(密度曲线)进行比较,视觉上判断二者的吻合水平,以对数据的正态性做出初步评判。
当样本含量较小时,由于数据分组太少,可能会产生较大的偏差,对结果造成影响,因此该法适合用于大样本数据。
2. QQ plot。 以样本的分位数取值作为横坐标,其对应的正态分布理论分位数为纵坐标,画散点图,借以比较二者的拟合度。当数据与正态分布拟合较好时,图上的点会大致分布于一条直线上。
3. 利用假设检验。 用于正态性检验的假设检验类型,最常用的是D-W检验。D即 Kolmogorov-Smirnov检验法,该法计算D统计量。W即Shapiro-Wilk检验法,计算W统计量。
此外,偏度和峰度系数也常被用来作为评估数据正态性的参考。
峰度系数(Kurtosis)
当峰度 α >0时,表示分 布比正态分布更集中在平均数周围,分布呈尖峰状态;
α =0分布为正态分布;
α<0时,表示分布比正态分布更分散,分布呈低峰态
偏度系数(Skewness)
偏态系数的数值一般在0与±3之间,越接近0,分布的偏斜度越小;越接近±3,分布的偏斜度越大。
- ?
书单 | 从入门到精通,数据分析不得不看的10本「好书」!
工兵
展开
1、深入浅出数据系列书籍
深入浅出数据分析
入门级别,比较简单,但基本的内容涉及全面,讲解的比较清晰,最后谈到了R语言。以下两本是同一系列。
深入浅出统计学
深入浅出SQL
2、资料之美:优雅资料解决方案的幕后秘籍
知识普及性的书籍,集结了39位数据处理领域的翘楚,现身说法,分享他们如何开发各种简约而优雅的解决方案克服各种挑战,每章都解决一个具体问题,对理解数据分析的应用领域和具体做法很有帮助。
3、R 语言实战
全面而细致的R指南,高度概括了该软件和它的强大功能,展示了使用的统计示例,且对于难以用传统方法处理的凌乱、不完整和非正态的数据给出了优雅的处理方法。
4、数据之魅-基于开源工具的数据分析
包含大量的模拟过程及结果展示,并通过实例来阐述如何使用开源工具来进行数据分析。通过本书的阅读,读者可以清楚地了解这些方法的实际用法及用途。
5、数据挖掘技术:应用于市场营销、销售与客户关系管理
如何利用最新的数据挖掘方法和技术来解决常见的业务问题。
比如提高营销活动的响应率,识别新的客户群并估算信用风险。此外,它涵盖更多高级主题,如准备分析数据以及为公司数据挖掘创建必要的基础架构。
6、Python数据科学手册
每章介绍一到两个Python数据科学中的重点工具包。适合有编程背景,并打算将开源Python工具用作分析、操作、可视化以及学习数据的数据科学研究人员。对于需要处理大量数据的人而言,这是一本非常有价值的工作书,可以有效率地处理每天面对的问题,像是操作、转换,以及清理数据、可视化不同形式的数据,建立统计学或机器学习的模型等等。
7、用数据讲故事
通过大量案例研究介绍数据可视化的基础知识,以及如何利用数据创造出吸引人的、信息量大的、有说服力的故事,进而达到有效沟通的目的。如何充分理解上下文,如何选择合适的图表,如何消除杂乱,如何聚焦受众的视线,如何像设计师一样思考,以及如何用数据讲故事。
8、利用Python进行数据分析
提供了大量的实践案例研究,展示如何使用Python库(如NumPy,pandas,matplotlib, IPython等)有效解决一系列数据分析问题。
9、机器学习实战
用简单的语言把复杂难懂的机器学习算法解释清楚了,它将机器学习的基础理论与日常数据分析的实际工具相结合。使用灵活的Python编程语言来构建实现数据分类、预测、建议以及汇总和简化等更高级功能的算法的程序。
10、机器学习系统设计
比较简单,使用Python进行机器学习并开始构建自己的机器学习项目。本书适用于机器学习初学者的Python程序员,但希望学习机器学习。
最后,花时间将这些中外文书籍吃透,数据分析理论部分就基本入门了,实践方面就需要根据企业业务需求来进行系统的练习和学习!
- ?
零一《从0开始,教你做数据分析》—09篇
Zene
展开
大家好,我是零一。这一篇给大家介绍探索关系。
探索关系是非常好玩的一件事情。先给大家讲个故事。据说很久很久以前美国某个州对多个社区做了一项关于婴儿的调查,其中一个调查结果如下
调查人员发现多个社区中,这个妈妈纹身的占比越高,这个社区出现畸形儿的概率就越高。那调查人员就很费解了,纹身跟生BB有什么关系呢?后来针对这些纹身妈咪做了调查,结果如下
调查人员发现原来大部分的纹身妈咪因为出入夜店,大部分有接触过毒品,这才导致了前文说的畸形儿竟然跟纹身有关系。
以上就是探索关系的一个例子。
我们先引入一个概念【相关性】
【相关性】是来反应两个或多个维度之间的相关密切程度,如上面的例子中,关系就是比较紧密的。两者相关紧密并不等于因果,上面的例子也说明了,并不是因为纹身就导致了畸形儿,而是纹身的妈咪多数曾经是不良少女,染上毒品,才导致后面生出畸形儿。
【相关性】从影响的方向来区分,有3种,分别是正相关,零相关,负相关。下面我们一起看下。
首先是正相关,只要是呈现下图这种趋势的分布,就称之为正相关,表示任意一个维度增长,另一个就跟着增长,反之,下降就随之下降。
接着是零相关,只要是呈现下图这种趋势的分布,就称之为零相关。表示维度之间没有什么相关性。
最后是负相关,只要是呈现下图这种趋势的分布,就称之为负相关。表示任意一个维度增长,另一个就下降,反之,下降就随之增长。
下面我们一起看一下淘宝数据,淘宝数据也有很多有趣的关系。
我抓取下来眼镜行业按销量排名的100页,也就是40*100=4000个宝贝的数据。数据大概长这个样子
按30天成交量和价格来做散点图,得到如下的结果。
很惊奇发现,居然有个眼镜卖12.8W!!这是在卖眼睛吧??
大家回想第八篇的内容,这个店就是离群点,我们可以暂时不分析。我们通过设置坐标轴来进一步观察
售价我先指定在1000元以下,呈负相关的姿态,下图是结果
有人可能会说,这价格越高就销量越小,这个不用分析都知道了啊!事实上,还真有价格越高销量就越高这种行业,不看下怎么知道呢?我们要用数据说话!
可以观察到大多数高销量的价格是分布在100元以下的。(0,100]这个区间销量最高在5K(最上面那个离群点不计在内),(100,200]这个区间销量最高在3K左右。
接着我们可以进一步观察(100,200]这个区间的分布情况
这个是零相关的分布状态,也就是说,在这个区间,你是定价在100,还是定价在200,不会太影响你的销量。所以,有时候很奇怪,我100也是卖,200也是卖,为什么不卖200呢?
这个数据源我会提供给大家玩玩。30天成交量和价格的关系,我们就说到这里。下面我们看另一个关系。
【上架天数】 VS 【30天成交量】
这个让我差点跌破眼镜,上架了2000天,是什么概念?2000÷365=5(年)。上架了这么久的产品,还在卖!我接触淘宝才3-4个年头。
我们可以发现,销量在2000以上的爆款主要的聚集区间,在1200天以内,也要有3年的时间了。。。不过我们可以发现,后面的新品,多了很多,正在逐渐上来,不少商家正在尝试用新品来冲击这个市场。
我把坐标轴范围调整一下,结果看下图,看起来是零相关的样子。
2000销量以上的,最快的在一个月时间(37天)打造上来。这些是谁呢?那通过这个图,把鼠标停在点上面,会显示这个数据是第几个观测值,那会非常简单就能定位到这些宝贝。
这种观察方法,有个弊端,就是上面这个图,我只能说,我看起来像是零相关,并不能确定。那是否有一个具体一点的,可以不用靠眼镜的方法来告诉我们相关性呢?
答案是肯定的!
在Excel里面,有个函数叫correl,是英文correlation(相关)的前半部分。就是用来算相关性的,这个是适用于线性相关的情况下。非线性的情况下,就不适用了哦!比如类似抛物线的钟型分布(也就是正态分布)
只要选中我们要的数据就可以了,两个数据组。
得出的结果是一个[-1,1]的数字,这里是0.685,那这个数字怎么解读呢?
[0.7,1]表示强正相关
[0.3,0.7)表示中正相关
(-0.3,0.3)表示零相关
(-0.7,-0.3]表示中负相关
[-1,-0.7]表示强负相关
那我们这里的结果对应到就是中正相关这个区间。表示,评价量的多少还是会在一定程度上影响销量的。但这个结果没有分析意义,因为一般爆款卖得多评价也多。
分析师是要考虑分析的结果有没有价值,一般何为有价值的关系呢?
就是情理之中,但意料之外的这种关系,就非常有价值。
另外,是要选择看图还是数字呢?
这个问题很简单,先看图,如果不清晰,就看下数字。
如果要快速出结果,并且是多个维度的情况下,用excel内置的数据分析的相关系数来快速得出相关矩阵
结果是一个下三角矩阵
==========分割符==========
下面我们来用数据挖掘套件,探索下数据。
先把数据设置成表格的格式
然后再表格工具里面有个分析(必须要有安装了数据挖掘套件才能有这个)
我们先看下分析关键影响因素(我这里是用的市场数据,但如果大家是拿店铺的数据,大家都懂的)
运行后结果如下,会有一个相对影响,可以参考。但这个结果,没有先处理缺失值(上一篇有说过异常处理,处理方法看上一篇)
这个结果,没有太大的参考性。因为最相关的变成缺失值了,可能在获取数据的时候会有一些漏抓。
==========分隔符==========
下一篇会告诉大家怎么做聚类分析,通过聚类,我们可以知道,某一个分类的特征,下图是聚类的一个结果特征(软件通过算法把30成交量大于704的归为一类,以下是这类的主要特征)
主要特征是:无投诉,主营100%,天猫店,退款速度2.7-6.0等,大家可以看下。下一篇会跟大家详细介绍聚类。
文中用到的源数据集下载连接:https://pan.baidu/s/1yzGzZKiQq7zj18QLKx1ZIQ
- ?
快速掌握SPSS数据分析
曼彻斯特
展开
SPSS难吗?无非就是数据类型的区别后,就能理解应该用什么样的分析方法,对应着分析方法无非是找一些参考资料进行即可。甚至在线网页SPSS软件直接可以将数据分析结果指标人工智能地分析出来,这有多难呢?本文章将周老师(统计学专家)8年的数据分析经验浓缩,便于让不会数据分析的同学,在学习数据分析的过程中可以少走弯路,树立数据分析价值观,以及以数据进行决策的思维意识,并且可以快速的掌握数据分析。本文章分为四个板块进行说明,一是数据分析思维的培养。二是数据间的几类关系情况。三是数据分析方法的选择。四是数据研究的撰写等。
相对来讲,我们国家对于数据价值的重视是最近几年才开始,尤其是大数据时代的兴起,以及人工智能时代的国家战略情况。之前企业进行决策时基本均是凭借主观经验,老板的经验决定企业的成长,这也许叫做‘定性研究’较为适合,这种思路并没有错误。相对来讲,主观个人偏好性是这种经验意识的弊端,而数据思维是用真实的数据作为依据,相对来讲具有更强的科学客观性。但两种思维各有优缺点,数据还可以造假,以及人们还可能会错误的利用数据等。
但无论如何,西方的数据意识,以及数据价值客观存在。我们有必要对其进行重视。作为数据研究人员,首先需要确保的是对数据的敬仰,错误的数据绝对无法容忍,否则永远不会得出科学的结论。因而数据分析思维的素养第一层次即尊重数据。原始数据代表的意义,数据自身带来的属性等均应该逐一确认。
确认数据的真实准确性后,即完成数据清理后,可对数据类型进行区分,一切数据均可分为两种类型,包括定性和定量数据。如同’定性研究‘和’定量研究‘一样,定性数据是那些表示分类,通常使用百分比汇总,无法计算平均值的数据,比如性别,专业。性别仅为男和女,使用数字1和数字2表示,可以分别计算男和女的比例,但是不能算个平均分为1.2,得出性别平均为1.2这样的分析。
另外一种数据叫定量数据,定量数据是那些可以进行量化,通常使用平均值表示,比如年龄,身高,体重,满意度等。可以计算平均年龄,但通常不分分析每个年龄数字的选择百分比。
还有一类数据,其即可以计算百分比,也可以计算平均值,比如问卷研究中的满意度,数字1代表非常不满意,数字2代表比较不满意,数字3代表中立,数字4代表比较满意,数字5代表非常满意。这类数据可以计算各项的百分比,也可以计算平均值。具体此类数据如何应用,可结合实际情况进行即可,但通常的偏好是,如果可以看作为定量数据,则按照定量数据情况进行即可。
在基本的数据类型确认之后,接下来再讨论下数据研究的一些关系情况。如果是初学数据分析,常规的路径可能是开始理解数据算法的原理,然后就懂一个就去,接着再学习另外一个算法。这种方法是常规教科书式的学习路径,非常慢而且容易出现一个问题即懂了理论无法进行实践。
数据分析是挖掘数据间的关系情况,发现潜在的数据规律,找出数据后面潜在的商业价值等。本人将数据间的关系归纳汇总为以下三类。第一是差异关系;第二是相关关系。第三是其它关系。
第一类差异关系通常是研究不同类别的差异性,提到了不同类别,那就涉及到定性数据,差异关系可以包括定性和定量数据的差异性,定性和定性数据的差异性。自然地也就对应到几类研究方法。
第二类为相关关系。比如越如何越如何之类的关系。包括相关关系,还有影响关系等。X对于Y的影响关系情况如何等,此时影响关系又拆分出几种分析算法。
当然还有其它关系,比如数据的浓缩,聚类。此时又分涉及到对应的研究方法。
在进行数据研究时,首先需要想到的是“我想做什么?“,来回就只有三种关系,那么这种关系有着明显的区分性,对应确认关系情况,加上数据类型的判断,对应就会找出合理的数据研究方法。接下来一一概述。
上面两部分分别讲述了数据类型和数据关系情况。接着需要落地,即研究方法的使用。按照上一部分的思路,即三类关系情况进行阐述。
第一类为差异关系
· 定性和定性数据差异关系。比如性别和专业的差异关系,不同性别人群专业偏好上有没有差异呢?此时应该用卡方分析。
· 定性和定量数据差异关系。比如性别和身高的差异关系,不同性别人群身高有没有明显的差异性呢?此时应该用方差分析或者T检验。至于方差分析和T检验的区别上,比如性别为两类,则可以使用方差分析或者T检验;比如研究城市和身高的关系,一线,二线或者三线城市人群他们的身高有没有明显差异性。比较了三组人群,这时候只能用方差分析,不能用T检验。因为方差分析可以对比多组,而T检验只能对比两组。
· 定量数据和定量数据的差异。有时候做实验,比如新型教学方式的使用,在使用前和使用后,学生成绩有没有明显的变化呢?此时则应该使用配对T检验。配对T检验通常都是用于实验研究中,使用时相对需要注意下。
· 定量数据和数字的差异。比如中国人的平均身高是否明显的高于1.70。定量数据和一个数字的差异性,此时应该用单样本T检验。
· 当然还有其它一些研究方法,但先从基础的开始,懂了这些方法后,再逐一深入学习。明白了这几类差异关系,事实上已经理解一部分数据分析。比如差异关系研究时有时候会有非参数检验,这类研究都是和正态性,方差齐这两个名词紧密相关,后续的文章再慢慢剖析。
第二类为相关关系
· 定量和定量数据的相关关系。比如身高和体重之间有没有关系?此时则应该使用相关分析。至于相关分析,又可以再细分为pearson和spearman相关,这两类关系是结合数据正态性情况而定,正常情况下都默认使用pearson相关分析。
· 影响关系情况(X对Y的影响,Y为定量数据)。比如研究学历,年龄,收入,满意度等对于消费金额的影响。此时一般是使用回归分析,或者更多称作是线性回归分析。也有时候会使用到非线性回归分析,但这种情况相对较少。线性回归分析也可以再细分为2类,简单线性(一元线性)和多元线性,研究X对Y的影响,如果X仅为1个则称作简单线性(一元线性);如果X为多个,此时称作多元线性回归分析。如果Y的个数超过1个,可以多进行几次回归就好,更复杂的可以使用结构方程模型进行研究。线性回归时X可以为定性数据也可以为定量数据,如果是定性数据则需要进行虚拟变量(哑变量)设置。
· 影响关系情况(X对Y的影响,Y为定类数据)。比如研究学历,年龄,收入,满意度等对于是否购买iPhone X的影响。此时应该使用logistic回归分析。线性回归和logistic回归的区别在于,线性回归时,Y为定量数据;logistic回归分析时,Y是定类数据。当然logistic回归又区分为三类,分别是二元logistic回归,有序logistic回归,无序logistic回归;区别在于如果Y仅分为两类,比如愿意不愿意,购买不购买,喜欢不喜欢,此时Y只有2个类别则叫做二元logistic回归,此方法的使用频率非常高。比如Y分为三组分别是不喜欢,喜欢和喜欢,此时使用有序logistic回归(其实使用线性回归也是可以的,只是我们这里把Y当成是定类数据所以使用有序logistic回归而已);无序logistic回归时,Y一定是绝对的定性数据,比如出行方式的偏好(自行车,公共汽车,地铁,自驾),此时用无序logistic回归即可。
第三类为其它关系
实际情况中还会有比如数据的浓缩,样本的聚类等研究。
· 数据浓缩:比如说了20句话,是否可以把20句话概括归纳成4个词语表示呢?此时就应该用到数据浓缩,即使用因子分析(也或者主成分分析);以及记住,数据浓缩时,数据一定是定量数据。
· 样本聚类:比如游戏里面分了几种角色,游戏数据分析人员希望对收集到了1万个样本分成几类,便于进行游戏里面的角色定位。此时则需要使用聚类分析。
上述的方法选择,分别与数据关系,或者数据类型间的关联性思路。事实上与网页在线版本的SPSSAU(spssau),完全如出一辙。spssau即是使用这样的思路进行产品设计。确定好数据类型,理解了数据关系情况,即可选择出正确的数据研究方法。
如果已经理解了数据类型,数据关系,并且选择了正确的数据研究方法。最终无非是把数据研究方法得出的结论进行汇总整理,然后写成有逻辑性的报告,并且在结论基础上对应提出有意义有价值的建议措施等。
关于数据报告的撰写,单独从数据分析角度上看,建议以实际需求出发,比如研究差异关系,那么首先得需要知道有没有差异,接着有了差异,具体差异情况如何。有了差异或者没有差异时,对应的建议措施应该如何。按照这样的思路,相信数据研究报告的撰写并非难事。
如果是对具体数据研究方法的结论撰写有困难,可以直接使用spssau进行分析,直接参考里面的智能文字分析即可。以及需要特别注意在于,数据研究结论对应有什么意义,价值在哪里,对实际商业的价值或者指导在哪里?这才是重点。
- ?
SPSS不能错过的一款分析工具!
夜南
展开
身处互联网时代,用户需求差异化越来越大,要想解决用户痛点,就必须根据用户行为数据,制定行之有效的运营策略。然而在庞大的用户数据中,我们怎样才能高效的获取我们需要的数据呢?获取后又该怎样处理、分析呢?这就需要借助一些数据分析工具,比如Excel、SPSS、Python等等。其中SPSS具有五大特点:操作简便、功能强大、数据兼容、扩展便利、模块组合。
正因为它具备这五大特点,让大部分都是文科出生的运营喵们都爱不释手。在实际应用过程中,SPSS可以在零售领域用来刻画用户画像,在互联网领域通过用户浏览、消费行为进行聚类,研究总结用户特征等。
其实,SPSS就是一个傻瓜似的操作软件,你只需熟悉基本界面和常用功能,然后将你需要处理分析的数据导入进去,根据分析目的选择相应的分析功能,软件就会自动得到分析结果。
从上述可知,在数据分析的整个过程中有三点尤为重要:1)数据准备;2)选择合适的分析功能;3)对SPSS处理后的结果进行解读分析、验证。
对于数据准备,其实这并不在我们操心的范畴,因为一般都会有专门的数据分析同事给你提供数据,前提是你要明确你需要那些数据,比如一个电商要从目前的用户中找到高价值用户,那么可能需要用户的ID、交易日期、交易金额等数据。如果没有人为你准备数据,也不要担心,因为你可以通过python爬虫获得需要的数据,千万不要被爬虫吓到哦,因为只要动动手指就可以在网上找到各种爬虫开源代码,我们只要理解,应用就可以啦。
在数据准备好了以后,就需要根据分析目的选择合适的分析功能了。SPSS的功能非常强大,比如描述性统计、均值比较、一般线性模型、相关分析、回归分析、对数线性模型、聚类分析、数据简化、生存分析、时间序列分析、多重响应等几大类,每个大类中又分为很多小类。继续以上面举例中得到的数据为例,那么可以选择RFM分析来处理、分析上面得到的数据,最终可以得到下图所示结果,每个用户都贴了一个标签。
从下图可以看到,分析结果表相比较原始数据表多了几列新的数据,这些数据都是在分析过程产生的。
最后就是对SPSS处理后的结果进行解读分析、验证,该过程会遇到很多不清楚的变量名、图表,但是不要害怕,只要你明确了上面的分析功能之后,就可以凭借百度、谷歌得到相应的解释,你只需进行简单的判断就可以,比如x>0.5则代表模型拟合效果好,则可以采纳该分析结果;x<0.5则代表模型拟合效果不好,则不能采纳该分析结果。
没错,SPSS就是这样一个傻瓜式数据分析工具(这里忽略统计学理论),只要我们花点心思都可以掌握,从而利用它来探寻数据背后的意义,为我们的运营工作提供指导性意见。
干货分享:区分T检验与F检验
1. T 检验和 F 检验的由来
一般而言,为了确定从样本 (sample) 统计结果推论至总体时所犯错的概率,我们会利用统计学家所开发的一些统计方法,进行统计检定。
通过把所得到的统计检定值,与统计学家建立了一些随机变量的概率分布 (probability distribution) 进行比较,我们可以知道在多少 % 的机会下会得到目前的结果。倘若经比较后发现,出现这结果的机率很少,亦即是说,是在机会很 少、很罕有的情况下才出现;那我们便可以有信心的说,这不是巧合,是具有统计学上的意义的 (用统计学的话讲,就是能够拒绝虚无假设 null hypothesis,Ho)。相反,若比较后发现,出现的机率很高,并不罕见;那我们便不能很有信心的直指这不是巧合,也许是巧合,也许不是,但我们没 能确定。
F 值和 t 值就是这些统计检定值,与它们相对应的概率分布,就是 F 分布和 t 分布。统计显著性(sig)就是出现目前样本这结果的机率。
2.统计学意义(P 值或 sig 值)
结果的统计学意义,是结果真实程度(能够代表总体)的一种估计方法。专业上,p 值为结果可信程度的一个递减指标,p 值越大,我们越不能认为样本中变量的关联是 总体中各变量关联的可靠指标。p 值是将观察结果认为有效即具有总体代表性的犯错概率。如 p=0.05 提示样本中变量关联有 5% 的可能是由于偶然性造成的。 即假设总体中任意变量间均无关联,我们重复类似实验,会发现约 20 个实验中有一个实验,我们所研究的变量关联将等于或强于我们的实验结果。(这并不是说如 果变量间存在关联,我们可得到 5% 或 95% 次数的相同结果,当总体中的变量存在关联,重复研究和发现关联的可能性与设计的统计学效力有关。)在许多研究领 域,0.05 的 p 值通常被认为是可接受错误的边界水平。
3. T 检验和 F 检验
至於具体要检定的内容,须看你是在做哪一个统计程序。举一个例子,比如,你要检验两独立样本均数差异是否能推论至总体,而行的 t 检验。
两样本 (如某班男生和女生) 某变量 (如身高) 的均数并不相同,但这差别是否能推论至总体,代表总体的情况也是存在著差异呢? 会不会总体中男女生根本没有差别,只不过是你那麼巧抽到这 2 样本的数值不同?
为此,我们进行 t 检定,算出一个 t 检定值。与统计学家建立的以「总体中没差别」作基础的随机变量 t 分布进行比较,看看在多少% 的机会 (亦即显著性 sig 值) 下会得到目前的结果。
若显著性 sig 值很少,比如 <0.05 (少於5% 机率),亦即是说,「如果」总体「真的」没有差别,那麼就只有在机会很少(5%)、很罕有的情况下, 才会出现目前这样本的情况。虽然还是有5% 机会出错(1-0.05=5%),但我们还是可以「比较有信心」的说:目前样本中这情况(男女生出现差异的情 况)不是巧合,是具统计学意义的,「总体中男女生不存差异」的虚无假设应予拒绝,简言之,总体应该存在著差异。
每一种统计方法的检定的内容都不相同,同样是t-检定,可能是上述的检定总体中是否存在差异,也同能是检定总体中的单一值是否等於0或者等於某一个数值。
至於F-检定,方差分析(或译变异数分析,Analysis of Variance),它的原理大致也是上面说的,但它是透过检视变量的方差而进行的。它主要用于:均数差别的显著性检验、分离各有关因素并估计其对总变异 的作用、分析因素间的交互作用、方差齐性(Equality of Variances)检验等情况。
4. T 检验和 F 检验的关系
t 检验过程,是对两样本均数(mean)差别的显著性进行检验。惟 t 检验须知道两个总体的方差(Variances)是否相等;t 检验值的计算会因方差是否相等而有所不同。也就是说,t 检验须视乎方差齐性(Equality of Variances)结果。所以,SPSS在进行t-test for Equality of Means的同时,也要做Levene”s Test for Equality of Variances 。
1.在Levene”s Test for Equality of Variances一栏中 F值为2.36, Sig. 为.128,表示方差齐性检验「没有显著差异」,即两方差齐(Equal Variances),故下面 t 检验的结果表中要看第一排的数据,亦即方差齐的情况下的t检验的结果。
2. 在t-test for Equality of Means中,第一排(Variances=Equal)的情况:t=8.892, df=84, 2-Tail Sig=.000, Mean Difference=22.99 既然Sig=.000,亦即,两样本均数差别有显著性意义!
3.到底看哪个Levene”s Test for Equality of Variances一栏中sig, 还是看t-test for Equality of Means中那个Sig. (2-tailed)啊?
答案是:两个都要看。
先看Levene”s Test for Equality of Variances,如果方差齐性检验「没有显著差异」,即两方差齐(Equal Variances),故接著的t检验的结果表中要看第一排的数据,亦即方差齐的情况下的t检验的结果。
反之,如果方差齐性检验「有显著差异」,即两方差不齐(Unequal Variances),故接著的t检验的结果表中要看第二排的数据,亦即方差不齐的情况下的t检验的结果。
你做的是T检验,为什么会有F值呢?
就是因为要评估两个总体的方差(Variances)是否相等,要做Levene”s Test for Equality of Variances,要检验方差,故所以就有F值。
另一种解释:
t检验有单样本t检验,配对t检验和两样本t检验。
单样本t检验:是用样本均数代表的未知总体均数和已知总体均数进行比较,来观察此组样本与总体的差异性。
配对t检验:是采用配对设计方法观察以下几种情形,1,两个同质受试对象分别接受两种不同的处理;2, 同一受试对象接受两种不同的处理;3,同一受试对象处理前后。
F检验又叫方差齐性检验。在两样本t检验中要用到F检验。
从两研究总体中随机抽取样本,要对这两个样本进行比较的时候,首先要判断两总体方差是否相同,即方差齐性。若两总体方差相等,则直接用t检验,若不等,可采用t”检验或变量变换或秩和检验等方法。
其中要判断两总体方差是否相等,就可以用F检验。若是单组设计,必须给出一个标准值或总体均值,同时,提供一组定量的观测结果,应用t检验的前提条件就是该组资料必须服从正态分布;若是配对设计,每对数据 的差值必须服从正态分布;
若是成组设计,个体之间相互独立,两组资料均取自正态分布的总体,并满足方差齐性。之所以需要这些前提条件,是因为必须在这样的 前提下所计算出的t统计量才服从t分布,而t检验正是以t分布作为其理论依据的检验方法。
简单来说就是实用T检验是有条件的,其中之一就是要符合方差齐次性,这点需要F检验来验证
统计学意义(p值)
结果的统计学意义是结果真实程度(能够代表总体)的一种估计方法。专业上,p值为结果可信程度的一个递减指标,p值越大,我们越不能认为样本中变量的关联是 总体中各变量关联的可靠指标。p值是将观察结果认为有效即具有总体代表性的犯错概率。如p=0.05提示样本中变量关联有5% 的可能是由于偶然性造成的。 即假设总体中任意变量间均无关联,我们重复类似实验,会发现约20个实验中有一个实验,我们所研究的变量关联将等于或强于我们的实验结果。(这并不是说如 果变量间存在关联,我们可得到5% 或95% 次数的相同结果,当总体中的变量存在关联,重复研究和发现关联的可能性与设计的统计学效力有关。)在许多研究领 域,0.05的p值通常被认为是可接受错误的边界水平。
如何判定结果具有真实的显著性
在最后结论中判断什么 样的显著性水平具有统计学意义,不可避免地带有武断性。换句话说,认为结果无效而被拒绝接受的水平的选择具有武断性。实践中,最后的决定通常依赖于数据集 比较和分析过程中结果是先验性还是仅仅为均数之间的两两>比较,依赖于总体数据集里结论一致的支持性证据的数量,依赖于以往该研究领域的惯例。通 常,许多的科学领域中产生p值的结果≤0.05被认为是统计学意义的边界线,但是这显著性水平还包含了相当高的犯错可能性。结果 0.05≥p>0.01 被认为是具有统计学意义,而 0.01≥p≥0.001 被认为具有高度统计学意义。但要注意这种分类仅仅是研究基础上非正规的 判断常规。
所有的检验统计都是正态分布的吗?
并不完全如此,但大多数检验都直接或间接与之有关,可 以从正态分布中推导出来,如 t检验、f 检验或卡方检验。这些检验一般都要求:所分析变量在总体中呈正态分布,即满足所谓的正态假设。许多观察变量的确是呈 正态分布的,这也是正态分布是现实世界的基本特征的原因。当人们用在正态分布基础上建立的检验分析非正态分布变量的数据时问题就产生了,(参阅非参数和方 差分析的正态性检验)。
这种条件下有两种方法:一是用替代的非参数检验(即无分布性检验),但这种方法不方便,因为从它所提供的结论形式看,这种方法统计 效率低下、不灵活。另一种方法是:当确定样本量足够大的情况下,通常还是可以使用基于正态分布前提下的检验。后一种方法是基于一个相当重要的原则产生的, 该原则对正态方程基础上的总体检验有极其重要的作用。即,随着样本量的增加,样本分布形状趋于正态,即使所研究的变量分布并不呈正态。
End.
作者:小遥yao/路上的你
来源:浅谈数据分析工具-SPSS/SPSS干货分享:区分T检验与F检验
正态数据分析软件
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并