中企动力 > 商学院 > excel中回归数据分析
  • ?

    EXCEL数据分析师常用操作技巧

    申屠莹

    展开

    快捷键

    Excel的快捷键很多,以下主要是能提高效率。

    Ctrl+方向键,对单元格光标快速移动,移动到数据边缘(空格位置)。

    Ctrl+Shift+方向键,对单元格快读框选,选择到数据边缘(空格位置)。

    Ctrl+空格键,选定整列。

    Shift+空格键,选定整行。

    Ctrl+A,选择整张表。

    Alt+Enter,换行。

    Ctrl+Enter,以当前单元格为始,往下填充数据和函数。

    Ctrl+S,快读保存。

    Ctrl+Z,撤回当前操作。

    如果是效率达人,可以学习更多快捷键。Mac用户的Ctrl一般需要用command替换。

    格式转换

    Excel的格式及转换很容易忽略,但格式会如影随形伴随数据分析者的一切场景。

    通常我们将Excel格式分为数值、文本、时间。

    数值常见整数型 Int和小数/浮点型 Float。两者的界限很模糊。

    文本分为中文和英文,存储字节,字符长度不同。

    时间格式在Excel中可以和数值直接互换,也能用加减法进行天数换算。

    时间格式有不同表达。例如2016年11月11日,2016/11/11,2016-11-11等。当数据源多就会变得混乱。我们可以用自定义格式规范时间。

    数组

    数组很多人都不会用到,甚至不知道有这个功能。。

    数组由多个元素组成。普通函数的计算结果是一个值,数组类函数的计算结果返回多个值。

    数组用大括号表示,当函数中使用到数组,应该用Ctrl+Shift+Enter输入,不然会报错。

    先看数组的最基础使用。选择A1

    1区域,输入={1,2,3,4}。记住是大括号。然后Ctrl+Shift+Enter。我们发现数组里的四个值被分别传到四个单元格中,这是数组的独有用法。

    我们再来看一下数组和函数的应用。利用{},我们能做到1匹配a,2匹配b,3匹配c。也就是一一对应。专业说法是Mapping。

    =lookup(查找值,{1,2,3},{"a","b","c"})

    分列

    Excel可以将多个单元格的内容合并,但是不擅长拆分。分列功能可以将某一列按照特定规则拆分。常常用来进行数据清洗。

    上文我有一列地区的数据,我想要将市和区分成两列。我们可以用mid和find函数查找市截取字符。但最快的做法就是用“市”分列。

    合并单元个格

    单元格作为报表整理使用,除非是最终输出格式,例如打印。否则不要随意合并单元格。

    一旦使用合并单元格,绝大多数函数都不能正常使用,影响批量的数据处理和格式转换。合并单元格也会造成Python和SQL的读取错误。

    数据透视表

    数据透视表的主要功能是将数据聚合,按照各子段进行sum( ),count( )的运算。

    下图我选择想要计算的数据,然后点击创建透视表。

    此时会新建一个Sheet,这是数据透视表的优点,将原始数据和汇总计算数据分离。

    数据透视表的核心思想是聚合运算,将字段名相同的数据聚合起来,所谓数以类分。

    列和行的设置,则是按不同轴向展现数据。简单说,你想要什么结构的报表,就用什么样的拖拽方式。

    删除重复项

    一种数据清洗和检验的快速方式。想要验证某一列有多少个唯一值,或者数据清洗,都可以使用。

    条件格式

    条件格式可以当作数据可视化的应用。如果我们要使用函数在大量数据中找出前三的值,可能会用到rank( )函数,排序,然后过滤出1,2,3。

    用条件格式则是另外一种快速方法,直接用颜色标出,非常直观。

    冻结首行首列

    Excel的首行一般是各字段名Header,俗称表头,当行数和列数过多的时候,观察数据比较麻烦。我们可以通过固定住首行,方便浏览和操作。

    Header是一个较为重要的概念。在Python和R中,read_csv函数,会有一个专门的参数header=true,来判断是否读取表头作为columns的名字。

    自定义下拉菜单(数据有效性)

    数据有效性是一种约束,针对单元格限制其输入,也就是让其只能固定几个值。下拉菜单是一种高阶应用,通过允许下拉箭头即可。

    自定义名称

    自定义名称是一个很好用的技巧,我们可以为一个区域,变量、或者数组定义一个名称。后续要经常使用的话,直接引用即可,无需再次定位。这是复用的概念。

    我们将A1:A3区域命名为NUM

    直接使用=sum(NUM) ,等价于sum(A1:A3)。

    查找公式错误

    公式报错也不知道错在哪里的时候可以使用,尤其是各类IF嵌套或者多表关联,逻辑复杂时。查找公式错误是逐步运算的,方便定位。

    分组和分级显示

    分组和分级显示,常用在报表中,在报表行数多到一定程度时,通过分组达到快速切换和隐藏的目的。越是专业度的报表(咨询、财务等),越可以学习这块。在数据菜单下。

    分析工具库

    分析工具库是高阶分析的利器,包含很多统计计算,检验功能等工具。Excel是默认不安装的,要安装需要加载项,在工具菜单下(不同版本安装方式会有一点小差异)。

    分析工具库是统计包,规划求解是计算最优解,类似决策树。

    内容来源:网络整理

    百家号-【袁帅数据分析运营】运营者:袁帅,互联网数据分析运营实践者。会展业信息化、数字化领域专家。认证数据分析师、网络营销师、SEM搜索引擎营销师、SEO工程师、电子商务职业经理人。

  • ?

    数据分析培训学习,怎么用Excel做数据分析

    章若枫

    展开

    今天科多大数据小课堂来教大家用Excel怎么做数据分析。

    现如今,各行各业的求职都需要简历包装。尤其是文职类简历,想要赢得offer,你不得在精通Excel等办公软件上下点功夫么?那么,你真的了解Excel嘛?或者,你知道用它怎么做数据分析嘛?

    所谓数据分析在手,走遍天下都不怕。而 Excel 作为最简单的办公软件,功能却不容小觑,同样可以实现分类、聚类、关联和预测来进行数据分析。这些概念听起来比较抽象,其实一点都不难,今日文章直接来一波干货,从具体操作开始讲起。

    01 掌握基本 Excel 快捷键

    工欲善其事,必先利其器,自从笔者发现了excel快捷键,就打开了新世界的大门。 虽然都是很基础的操作,一旦运用熟练将会大幅提升效率。

    最好用的复制命令: Ctrl + R 向右复制 Ctrl + D 向下复制

    选择格式粘贴:Ctrl + Alt + V

    求和功能:Alt + = 然后按回车键

    格式调整:Ctrl + Shift + 7 加上外边框 Ctrl + Shift + - 去掉边框 Ctrl + Shift + 5 改成%数值格式

    视图调整及编辑: Ctrl + Shift + = 插入行 Ctrl + - 删除

    终极:开始工具栏所有的命令都可以通过 Alt - H - 调用

    Alt: 激活选项,配合选项英文字母使用

    Shift:连续选择,配合方向键,翻页键等使用; 上位键

    Ctrl:配合其他键可以执行一项命令 如Ctrl + C 复制;快速移动光标,配合方向键使用,如向右快速移动光标 (Ctrl + →)

    02 数据收集

    在数据分析之前,首先需要找到可靠的数据源。国内的公司数据可以在 wind 上下载,宏观数据可以在国家统计局上找到,而国外比较常用的网站有 SEC,WRDS (Wharton Research Data Services)。

    需要注意的是,原始数据一般保留不做处理,通过 Excel 或其他编程软件做后续处理。

    03 数据清洗与筛选等基础操作

    杂乱无章的原始数据是难以分辨的,因此需要对海量数据进行清洗和筛选才能找出其中的规律。

    常见的方法有如下几种:

    运用描述性统计命令观察数据的离散程度等基本情况:通过添加“分析工具库”加载项找到数据-数据分析-描述统计,可以得到这组数据的中位数、众数、峰度、偏度等基本指标,观察这组数据的特征。此外,数据分析中还有方差分析等其他命令。

    运用 VLOOKUP 将数据合理分组,收放自如:VLOOKUP 函数是 Excel 中的一个纵向查找函数,可以用来核对数据,多个表格之间快速导入数据等函数功能。功能是按列查找,最终返回该列所需查询列序所对应的值。比如,我们导出公司的原始报表后,可以通过 VLOOKUP 函数将报表中的数字一一导入到新的管理用的财务报表,这样既不会破坏原始数据,又可以建立良好的模板,方便后续使用。VLOOKUP 的四个参数用通俗的话来说,就是(要找谁,要在哪里找,要找哪一列内容,是精确的还是模糊的)

    运用数据透视表分组求平均数、标准差、计数等多个指标:数据透视表是一个非常容易上手的分组工具,对于简单的数据处理甚至在便捷程度上打败了很多编程工具呢。比如要对每个省份的所有专业分数线求一个平均数,将年份和省份轻松地拖动到对应的列和行,就可以得到结果啦。试想,如果在原始表格中手动一个一个求平均数该有多麻烦。

    运用条件函数计算融资缺口,检查配平:比如在预测财务报表时,我们常常要判断资产是否等于负债+所有者权益。此时可以用 IF 函数 (资产=负债+所有者权益,TRUE,FALSE)如果是配平的,直接返回 TRUE。此外,还有一些函数如 IRR 可以计算项目的投资回报率。

    04 挖掘数据背后的规律

    在完成了数据清洗和筛选之后,我们还是要落实到数据分析的重点,也就是数据背后的逻辑。

    首先我们可以采用画图的方式。画图可以非常直观地佐证结论,不同情况下要用不同类型的图,比如饼图显示比重,折线图发现趋势,还可以采用叠加多种形式的图。

    下面这张图就是一个数据分析应用的经典例子,显示的是一个教育公司在扩张过程中,学习中心同比增速与营业毛利率的关系。试想,如果只是一堆数据放在你的面前,可能根本无法发现其中的规律,但是通过下图,我们可以发现,学习中心的同比增速一般与营业毛利率呈反向关系,这也就意味着,扩张的过程必然要伴随利润下降的阵痛,这样的数据分析就是有效的,可以为公司的扩张战略提供参考依据。

    另一种比较常见的数据分析应用就是从历史预测未来。比如如果公司过去几年的存货周转率都比较稳定,可以以此来预测未来几年的存货周转率。又或者通过线性回归发现某两个指标之间过去的线性关系,并以此来预测未来走势,这个操作方法可以用散点图——添加趋势线——选择回归类型(线性)来得出简单的结论。

    说了这么多,列举 Excel 数据分析的一个常见运用。

    大家知道,金融领域的工作往往要考察搭建财务模型的技巧,而这个模型就是完完全全从 0 开始通过 Excel 制作的。

    1. 计算各项指标了解公司的历史经营状态。这一步不仅可以看出公司在盈利能力、成长性、营运能力等多个维度的历史发展状况,还可以与同行业的可比公司进行比较,看出这个公司所处的地位(比如公司的应收账款周转率可以直观看出公司是强势地位还是弱势地位,应收账款周转率如果显著低于同业,那就说明应收账款很容易收到,议价能力强)。

    2. 预测公司未来的盈利状况,并通过财务报表的勾稽关系完善财务模型。这一步一定要打开 Excel 的自动迭代功能(选项——公式——启用迭代计算),具体的财务方面知识在此就不再详述。

    3. 现金流 DCF 模型及敏感性分析。以之前制作的财务报表为基础,就可以测算出公司未来的自由现金流,在计算出公司资本成本的前提下对现金流进行贴现得到公司绝对估值。其中,基于不同的资本成本和公司永续增长率还可以做成敏感性分析的表格,得出在不同情形下公司的估值。这就需要使用Excel的数据——模拟运算——模拟运算表功能了。如下图所示,将输入引用行的单元格和引用列的单元格分别设为 Equity Valuation 中的永续增长率和Wacc对应的数值,就可以实现啦。

    以上这些介绍都只是冰山一角,Excel的功能博大精深,加上VBA等高端操作将会释放更大的威力。配合现当代大数据盛行时期。想要深入,就还得不断学习!

  • ?

    如此手到拈来的excel数据分析功能,你肯定没有见过!

    剑封

    展开

    Excel的数据透视表功能很强大,但从办公的角度来说,可能还是繁琐了一点。以下图为例,现在我们希望得到每个产品的数量及占比:

    如果使用Excel的数据透视表,需要先“创建数据透视表”:

    然后设置要统计的字段列和数值列:

    由于需要在绝对值列的基础上,再多个“占比”,因此,还要在“数量”列上点右键选择“添加到值”,这样增加了一个“求和项”:

    如要将“求和项:数量2”显示为百分比,可在“数量2”上单击,选择“值字段设置--值显示方式”中的“列汇总的百分比”,如下图:

    这样的透视表终于生成:

    现在我们如果改用国产软件foxtable,那就简单了。点击菜单“数据统计-分组统计”,如下图:

    点击“统计”后直接得到结果:

    同时统计多列?很简单,加上相应的分组列和统计列即可:

    生成结果如下图:

    如果按日期统计,还可以自动生成同比和环比数据:

    生成结果如下图(由于原始表的数据都是1999年的,因而无法生成同比数据):

    以上还仅仅只是简单演示了分组统计方面的部分功能,更强大的“交叉统计”留到后面再说。

  • ?

    【独家】一文读懂回归分析

    木棉花

    展开

    前言

    1.“回归”一词的由来

    我们不必在“回归”一词上费太多脑筋。英国著名统计学家弗朗西斯·高尔顿(Francis Galton,1822—1911)是最先应用统计方法研究两个变量之间关系问题的人。“回归”一词就是由他引入的。他对父母身高与儿女身高之间的关系很感兴趣,并致力于此方面的研究。高尔顿发现,虽然有一个趋势:父母高,儿女也高;父母矮,儿女也矮,但从平均意义上说,给定父母的身高,儿女的身高却趋同于或者说回归于总人口的平均身高。换句话说,尽管父母双亲都异常高或异常矮,儿女身高并非也普遍地异常高或异常矮,而是具有回归于人口总平均高的趋势。更直观地解释,父辈高的群体,儿辈的平均身高低于父辈的身高;父辈矮的群体,儿辈的平均身高高于其父辈的身高。用高尔顿的话说,儿辈身高的“回归”到中等身高。这就是回归一词的最初由来。

    回归一词的现代解释是非常简洁的:回归时研究因变量对自变量的依赖关系的一种统计分析方法,目的是通过自变量的给定值来估计或预测因变量的均值。它可用于预测、时间序列建模以及发现各种变量之间的因果关系。

    使用回归分析的益处良多,具体如下:

    1) 指示自变量和因变量之间的显著关系;

    2) 指示多个自变量对一个因变量的影响强度。

    回归分析还可以用于比较那些通过不同计量测得的变量之间的相互影响,如价格变动与促销活动数量之间的联系。这些益处有利于市场研究人员,数据分析人员以及数据科学家排除和衡量出一组最佳的变量,用以构建预测模型。

    2.为什么使用回归分析

    1)更好地了解

    对某一现象建模,以更好地了解该现象并有可能基于对该现象的了解来影响政策的制定以及决定采取何种相应措施。基本目标是测量一个或多个变量的变化对另一变量变化的影响程度。示例:了解某些特定濒危鸟类的主要栖息地特征(例如:降水、食物源、植被、天敌),以协助通过立法来保护该物种。

    2)建模预测

    对某种现象建模以预测其他地点或其他时间的数值。基本目标是构建一个持续、准确的预测模型。示例:如果已知人口增长情况和典型的天气状况,那么明年的用电量将会是多少?

    3)探索检验假设

    还可以使用回归分析来深入探索某些假设情况。假设您正在对住宅区的犯罪活动进行建模,以更好地了解犯罪活动并希望实施可能阻止犯罪活动的策略。开始分析时,您很可能有很多问题或想要检验的假设情况。

    回归分析的作用主要有以下几点:

    1)挑选与因变量相关的自变量;

    2)描述因变量与自变量之间的关系强度;

    3)生成模型,通过自变量来预测因变量;

    4)根据模型,通过因变量,来控制自变量。

    回归分析方法

    现在有各种各样的回归技术可用于预测,这些技术主要包含三个度量:自变量的个数、因变量的类型以及回归线的形状。

    1.回归分析方法

    1)线性回归

    线性回归它是最为人熟知的建模技术之一。线性回归通常是人们在学习预测模型时首选的少数几种技术之一。在该技术中,因变量是连续的,自变量(单个或多个)可以是连续的也可以是离散的,回归线的性质是线性的。线性回归使用最佳的拟合直线(也就是回归线)建立因变量 (Y) 和一个或多个自变量 (X) 之间的联系。用一个等式来表示它,即:

    Y=a+b*X + e

    其中a 表示截距,b 表示直线的倾斜率,e 是误差项。这个等式可以根据给定的单个或多个预测变量来预测目标变量的值。

    一元线性回归和多元线性回归的区别在于,多元线性回归有一个以上的自变量,而一元线性回归通常只有一个自变量。

    线性回归要点:

    1)自变量与因变量之间必须有线性关系;

    2)多元回归存在多重共线性,自相关性和异方差性;

    3)线性回归对异常值非常敏感。它会严重影响回归线,最终影响预测值;

    4)多重共线性会增加系数估计值的方差,使得估计值对于模型的轻微变化异常敏感,结果就是系数估计值不稳定;

    5)在存在多个自变量的情况下,我们可以使用向前选择法,向后剔除法和逐步筛选法来选择最重要的自变量。

    2)Logistic回归

    Logistic回归可用于发现 “事件=成功”和“事件=失败”的概率。当因变量的类型属于二元(1 / 0、真/假、是/否)变量时,我们就应该使用逻辑回归。这里,Y 的取值范围是从 0 到 1,它可以用下面的等式表示:

    odds= p/ (1-p) = 某事件发生的概率/ 某事件不发生的概率

    ln(odds) = ln(p/(1-p))

    logit(p) = ln(p/(1-p)) =b0+b1X1+b2X2+b3X3....+bkXk

    如上,p表述具有某个特征的概率。在这里我们使用的是的二项分布(因变量),我们需要选择一个最适用于这种分布的连结函数。它就是Logit 函数。在上述等式中,通过观测样本的极大似然估计值来选择参数,而不是最小化平方和误差(如在普通回归使用的)。

    Logistic要点:

    1)Logistic回归广泛用于分类问题;

    2)Logistic回归不要求自变量和因变量存在线性关系。它可以处理多种类型的关系,因为它对预测的相对风险指数使用了一个非线性的 log 转换;

    3)为了避免过拟合和欠拟合,我们应该包括所有重要的变量。有一个很好的方法来确保这种情况,就是使用逐步筛选方法来估计Logistic回归;

    4)Logistic回归需要较大的样本量,因为在样本数量较少的情况下,极大似然估计的效果比普通的最小二乘法差;

    5)自变量之间应该互不相关,即不存在多重共线性。然而,在分析和建模中,我们可以选择包含分类变量相互作用的影响;

    6)如果因变量的值是定序变量,则称它为序Logistic回归;

    7)如果因变量是多类的话,则称它为多元Logistic回归。

    3)Cox回归

    Cox回归的因变量就有些特殊,它不经考虑结果而且考虑结果出现时间的回归模型。它用一个或多个自变量预测一个事件(死亡、失败或旧病复发)发生的时间。Cox回归的主要作用发现风险因素并用于探讨风险因素的强弱。但它的因变量必须同时有2个,一个代表状态,必须是分类变量,一个代表时间,应该是连续变量。只有同时具有这两个变量,才能用Cox回归分析。Cox回归主要用于生存资料的分析,生存资料至少有两个结局变量,一是死亡状态,是活着还是死亡;二是死亡时间,如果死亡,什么时间死亡?如果活着,从开始观察到结束时有多久了?所以有了这两个变量,就可以考虑用Cox回归分析。

    4)poisson回归

    通常,如果能用Logistic回归,通常也可以用poission回归,poisson回归的因变量是个数,也就是观察一段时间后,发病了多少人或是死亡了多少人等等。其实跟Logistic回归差不多,因为logistic回归的结局是是否发病,是否死亡,也需要用到发病例数、死亡例数。

    5)Probit回归

    Probit回归意思是“概率回归”。用于因变量为分类变量数据的统计分析,与Logistic回归近似。也存在因变量为二分、多分与有序的情况。目前最常用的为二分。医学研究中常见的半数致死剂量、半数有效浓度等剂量反应关系的统计指标,现在标准做法就是调用Pribit过程进行统计分析。

    6)负二项回归

    所谓负二项指的是一种分布,其实跟poission回归、logistic回归有点类似,poission回归用于服从poission分布的资料,logistic回归用于服从二项分布的资料,负二项回归用于服从负二项分布的资料。如果简单点理解,二项分布可以认为就是二分类数据,poission分布就可以认为是计数资料,也就是个数,而不是像身高等可能有小数点,个数是不可能有小数点的。负二项分布,也是个数,只不过比poission分布更苛刻,如果结局是个数,而且结局可能具有聚集性,那可能就是负二项分布。简单举例,如果调查流感的影响因素,结局当然是流感的例数,如果调查的人有的在同一个家庭里,由于流感具有传染性,那么同一个家里如果一个人得流感,那其他人可能也被传染,因此也得了流感,那这就是具有聚集性,这样的数据尽管结果是个数,但由于具有聚集性,因此用poission回归不一定合适,就可以考虑用负二项回归。

    7)weibull回归

    中文有时音译为威布尔回归。关于生存资料的分析常用的是cox回归,这种回归几乎统治了整个生存分析。但其实夹缝中还有几个方法在顽强生存着,而且其实很有生命力。weibull回归就是其中之一。cox回归受欢迎的原因是它简单,用的时候不用考虑条件(除了等比例条件之外),大多数生存数据都可以用。而weibull回归则有条件限制,用的时候数据必须符合weibull分布。如果数据符合weibull分布,那么直接套用weibull回归自然是最理想的选择,它可以给出最合理的估计。如果数据不符合weibull分布,那如果还用weibull回归,那就套用错误,结果也就会缺乏可信度。weibull回归就像是量体裁衣,把体形看做数据,衣服看做模型,weibull回归就是根据某人实际的体形做衣服,做出来的也就合身,对其他人就不一定合身了。cox回归,就像是到商场去买衣服,衣服对很多人都合适,但是对每个人都不是正合适,只能说是大致合适。至于到底是选择麻烦的方式量体裁衣,还是选择简单到商场直接去买现成的,那就根据个人倾向,也根据具体对自己体形的了解程度,如果非常熟悉,自然选择量体裁衣更合适。如果不大了解,那就直接去商场买大众化衣服相对更方便些。

    8)主成分回归

    主成分回归是一种合成的方法,相当于主成分分析与线性回归的合成。主要用于解决自变量之间存在高度相关的情况。这在现实中不算少见。比如要分析的自变量中同时有血压值和血糖值,这两个指标可能有一定的相关性,如果同时放入模型,会影响模型的稳定,有时也会造成严重后果,比如结果跟实际严重不符。当然解决方法很多,最简单的就是剔除掉其中一个,但如果实在舍不得,觉得删了太可惜,那就可以考虑用主成分回归,相当于把这两个变量所包含的信息用一个变量来表示,这个变量我们称它叫主成分,所以就叫主成分回归。当然,用一个变量代替两个变量,肯定不可能完全包含他们的信息,能包含80%或90%就不错了。但有时候我们必须做出抉择,你是要100%的信息,但是变量非常多的模型?还是要90%的信息,但是只有1个或2个变量的模型?打个比方,你要诊断感冒,是不是必须把所有跟感冒有关的症状以及检查结果都做完?还是简单根据几个症状就大致判断呢?我想根据几个症状大致能确定90%是感冒了,不用非得100%的信息不是吗?模型也是一样,模型是用于实际的,不是空中楼阁。既然要用于实际,那就要做到简单。对于一种疾病,如果30个指标能够100%确诊,而3个指标可以诊断80%,我想大家会选择3个指标的模型。这就是主成分回归存在的基础,用几个简单的变量把多个指标的信息综合一下,这样几个简单的主成分可能就包含了原来很多自变量的大部分信息。这就是主成分回归的原理。

    9)岭回归

    当数据之间存在多重共线性(自变量高度相关)时,就需要使用岭回归分析。在存在多重共线性时,尽管最小二乘法(OLS)测得的估计值不存在偏差,它们的方差也会很大,从而使得观测值与真实值相差甚远。岭回归通过给回归估计值添加一个偏差值,来降低标准误差。

    上面,我们看到了线性回归等式:

    y=a+ b*x

    这个等式也有一个误差项。完整的等式是:

    y=a+b*x+e (误差项), [误差项是用以纠正观测值与预测值之间预测误差的值]

    => y=a+y= a+ b1x1+ b2x2+....+e, 针对包含多个自变量的情形。

    在线性等式中,预测误差可以划分为 2 个分量,一个是偏差造成的,一个是方差造成的。预测误差可能会由这两者或两者中的任何一个造成。在这里,我们将讨论由方差所造成的误差。岭回归通过收缩参数 λ(lambda)解决多重共线性问题。请看下面的等式:

    在这个等式中,有两个组成部分。第一个是最小二乘项,另一个是 β2(β-平方)和的 λ 倍,其中 β 是相关系数。λ 被添加到最小二乘项中用以缩小参数值,从而降低方差值。

    岭回归要点:

    1)除常数项以外,岭回归的假设与最小二乘回归相同;

    2)它收缩了相关系数的值,但没有达到零,这表明它不具有特征选择功能;

    3)这是一个正则化方法,并且使用的是 L2 正则化。

    10)偏最小二乘回归

    偏最小二乘回归也可以用于解决自变量之间高度相关的问题。但比主成分回归和岭回归更好的一个优点是,偏最小二乘回归可以用于例数很少的情形,甚至例数比自变量个数还少的情形。所以,如果自变量之间高度相关、例数又特别少、而自变量又很多,那就用偏最小二乘回归就可以了。它的原理其实跟主成分回归有点像,也是提取自变量的部分信息,损失一定的精度,但保证模型更符合实际。因此这种方法不是直接用因变量和自变量分析,而是用反映因变量和自变量部分信息的新的综合变量来分析,所以它不需要例数一定比自变量多。偏最小二乘回归还有一个很大的优点,那就是可以用于多个因变量的情形,普通的线性回归都是只有一个因变量,而偏最小二乘回归可用于多个因...

  • ?

    Excel数据分析包含哪些知识

    翁秋白

    展开

    相信大家对即将讲述的数据分析内容很感兴趣,想知道Excel数据分析包含哪些知识?本文就言简意赅地后面的系列文章会涉及到的一些内容,在这里进行一下简单的概括,大致分为八大部分分别如下:

    第一部分引入数据挖掘的概念。简要介绍什么是数据挖掘,介绍Excel强大的数据挖掘功能,excel不支持的功能需要使用“加载宏”。

    第二部分介绍简单的数据挖掘和问卷调查;介绍最基本的数据挖掘方法,即利用“平均数”这种最简单的数据统计模型,分析身边的数据或少量数据,介绍问卷调查这种收集数据的常用手段的设计技巧。通过预测商品预期价格。证明从少量样本中也能提取重要信息。

    第三部融入案例预估二手车价格,介绍使信用回归分析进行预测和因子分析的知识,多重回归分析是预估数值和分析因子时非常有效的统计方法,是多变量分析中最常用的统计方法之一.本章以“拍卖行的二手车数据”为例对其进行解说。数据包含定性数据和定量数据,统称为“混合型数据”、经常出现在商务领域中。

    第四部分内容涉及求最优化的问题“规划求解”。Excel支持“规划求解”这个强大的工具。本章介绍用“规划求解”求最优化问题的方法。经营管理中经常遇到如何利用有限的资源,实现营业额和利润最大化,以及费用和成本最小化的问题.用一次方程表示约束条件和目标叫做线性规划,求解方法叫做线性规划法。 “规划求解”不仅适合线性规划法,也适合非线性规划法。还支持整数规划法(这些统称为数理规划法或最优化规划法).本章通过具体实例说明“规划求解”的使用方法。

    第五部分一起来学习分析交叉表,介绍用交叉表判断属性(年龄、性别、职业等)是否有差异的方法。用Excel的函数功能求解;用大量实例详细说明。

    第六部分会通过开发畅销产品的概念组合的案例介绍联合分析,消费者选择或决定购买商品时最重视什么?若能预知消费者重视的内容,就能开发山非常畅销的产品。“联合分析”是以“开发畅销产品的概念组合”为目的。为了把把握消费者和巾场的动向,被广泛运用在市场营销领域中的一种分析方法。计多企业都采用这种调查方法.联合分析也可以用Excel数据分析。

    第七部分通过软件故障何时了的案例,来介绍用规划求解制作生长曲线,预估故障总数,生长曲线可以根据初始数据对商品的需求趋势,未来的人口数量和知识的掌握程度等的变化结果进行预测。本章用规划求解得出最优生长曲线。介绍预测软件停止发生故障的时间的方法。

    最后一部分就也很有趣,是经典的求最优投资组合问题。近年来,对股票感兴趣的人越来越多.投资者最关心资产的运营安全。大部分人都希望:(a)收益越高越好(b)风险越低越好.但是,鱼与熊掌难以兼得。投贤中最基础的理论是“高风险、高收益”,“低风险、低收益”。本章介绍能够兼得鱼与熊掌的“投资组合”方法。即将资产划分成几部分,使各部分之间的正负变动相抵消,尽量降低投资风险。

    以上就是Excel数据分析包含哪些知识的一个概要介绍,当然内容远远不止这些,在接下来的系列精彩文章会运用大量实例介绍了许多数据挖掘的方法。小编希望通过普及这些方法,使所有人都能够将其灵活运用到自己的工作或研究中.这将是我们最大的愿望

  • ?

    Excel中如何对所得数据进行显著性检验

    Taylor

    展开

    excel进行显著性检验的方法与步骤:
    1.先找ADD-IN,添加数据分析工具data analysis tool。 Add-in的选项在File-> Option->Add Ins, 选择analysis tool pack。

    2.会跳出来一个窗口,再选中analysis tookpack ,确定就好了。
    3.把得到的两组数据输入EXCEL里。
    4.在DATA里面,选择data analysis,跳出来新窗口,选中correlation(相关性)。然后按照提示,选中要分析的数据。

    5.EXCEL会自动运行回归分析,给出分析报告。分析报告里mutiple R 接近1,就说明两个的相关性比较大。拟合关系要看R2,显著性看signifnance F。

    (本文内容由百度知道网友茗童贡献)

  • ?

    她说:掌握这些Excel数据分析,你的工作将会翻天覆地!

    尤惜萍

    展开

    又是一年实习季......

    很多优秀的金融小伙伴已经陆陆续续进入了各大券商实习,希望施展拳脚,争取留用机会。

    最近接到几位朋友的倾诉:

    “工作后发现,很多之前听过基础的办公软件,偷懒没学,没想到工作中经常需要用到,然而自己却用的不溜,有些甚至一点不会......”“像数据分析工具,基本从事券商行业都得用,可是老员工一般都比较忙,根本没时间教,只能自己毫无效率的一点一点摸索,唉......”“一起进去实习的有一位,因为提前学习了相关的技能,既会excel数据分析,又会用VBA编程,各种自动化操作,领导一直夸赞,感觉自己留用无望了......”

    听完之后,小编迅速打开招聘网站,果然...... 大部分券商投行等岗位招聘要求是这样的:

    毫无疑问,快速搜集、处理大量金融数据并形成客户和老板想要的结果,是每一个金融从业者都必须具备的核心技能。数据的收集处理能力和财务分析能力一样,构成了金融大咖们的两大核心竞争力。

    因此,对于游走在业绩分析会与路演会间隙做相关数据报告的资深金融人来说,会数据分析尤为重要。

    除此之外

    金融人的工作里头还有大量的Excel表格需要处理,而且需要做的非常高端上档次。因为这样,领导拿出去用,才倍儿有面儿!

    像这样......

    这样......

    因此,花极少的时间,就掌握一门高大上的数据可视化技能,非Excel数据分析不可!这也是金融人士应该掌握的技能。

    还没结束......

    仅简单的Excel技能还不足以满足金融人士的处理需求,在很多条件下,高阶函数和Excel VBA才是制胜王道。如何使用Excel胜任批量操作、处理复杂函数甚至自定义Excel选项卡,是投行大咖的基本标配,也是金融人士的进阶技能——Excel VBA。

    Excel VBA批处理起来,效率那叫一个快!主要用于处理Wind终端导出来的数据,学起来比较简单,属于金融从业者性价比最高的技能之一。

    还可以自动制做可视化图表,批量整理各种数据......

    回归线Excel,致力于为客户提供基于Excel的解决方案。帮助客户提高Excel应用水平,扩展Excel应用能力,改进工作效率,对数据收集,数据清洗,数据分析,数据展现等都有非常直接的经验和方法。

  • ?

    使用EXCEL回归工具做全国乘用车销量预测

    阿鲁通加

    展开

    前面对时间序列的预测方法做了简单的介绍,

    其中反复提到的数据分析工具--回归

    回归分析(regression analysis)是确定两种或两种以上变量间相互依赖的定量关系的一种统计分析方法。

    今天就通过一组数据,来演示一下回归工具的使用方法:

    第一种:线性回归

    时间做为自变量,销量为因变量

    按步骤选择好,按确定,会自动输出结果:

    这个结果,大家可以研究一下,统计学的相关指标里面都有

    我们关注两点:

    R Square:的值越大,这个这条回归线越贴合实际值

    Intercept:回归线与Y轴的交点

    X Variable 1:系数

    方程式就是这样的:Y=Intercept+X Variable 1*TIME

    第二种:非线性回归

    我们学过的一元多次方程

    把时间变量,平方、立方列出来,做自变量

    我们得到的结果就多了几个系数:

    第三种:多元回归

    时间、汽车产量作为自变量

    第四种:自回归

    把汽车销量滞后一期作为自变量

    最后我们来看看成果

    多元回归的R Square值是最大的,多元回归的曲线与实际销量曲线最为贴合

    也说明,汽车产量与销量高度相关。

    说在最后:今年汽车销售市场应该说不景气,到了增长的拐点。

    数据分析只是根据历史数据做的一个判断

    然而,市场环境恶化,经济下行等宏观因素,对未来的汽车销售的影响巨大

    在有宏观环境因素变化时,就要谨慎使用历史数据

    在平稳运行时,依靠数据预测更为准确。

  • ?

    用Excel进行数据分析的正确指南

    宁绝音

    展开

    最近几天,不断有小伙伴在后台问到使用excel做数据分析的相关问题,今天,数据君(ID:shendufenxi)就为大家推送一篇实用技巧。

    高级的数据分析会涉及回归分析、方差分析和T检验等方法,不要看这些内容貌似跟日常工作毫无关系,其实往高处走,MBA的课程也是包含这些内容的,所以早学晚学都得学,干脆就提前了解吧,请查看以下内容。

    在使用之前,首先得安装Excel的数据分析功能,默认情况下,Excel是没有安装这个扩展功能的,安装如下所示:

    1)鼠标悬浮在Office按钮上,然后点击【Excel选项】:

    2)找到【加载项】,在管理板块选择【Excel加载项】,然后点击【转到】:

    3)选择【分析工具库】,点击【确定】:

    4)安装完后,就可以【数据】板块看到【数据分析】功能,如下所示:

    安装完后,首先来了解一下回归分析的内容。

    回归分析

    在详细进行回归分析之前,首先要理解什么叫回归?

    实际上,回归这种现象最早由英国生物统计学家高尔顿在研究父母亲和子女的遗传特性时所发现的 一种有趣的现象:身高这种遗传特性表现出”高个子父母,其后代身高也高于平均身高;但不见得比其父母更高,到一定程度后会往平均身高方向发生’回归’”。

    这种效应被称为”趋中回归”。现在的回归分析则多半指源于高尔顿工作的那样一整套建立变量间的数量关系模型的方法和程序。 这里的自变量是父母的身高,因变量是子女的身高。

    百度百科对于回归分析的定义是: 回归分析(regression analysis)是确定两种或两种以上变数间相互依赖的定量关系的一种统计分析方法。运用十分广泛:

    1)回归分析按照涉及的自变量的多少,可分为一元回归分析和多元回归分析;

    2)按照自变量和因变量之间的关系类型,可分为线性回归分析和非线性回归分析。

    这里举个电商的例子:电子商务的转换率是一定的,网站访问数一般正比对应于销售收入,现在要建立不同访问数情况下对应销售的标准曲线,用来预测搞活动时的销售收入,如下所示:

    1、利用散点图描绘图形:

    2. 添加趋势线,并且显示回归分析的公式和R平方值:

    从图得知,R平方值=0.9995,趋势线趋同于一条直线,公式是:y=0.01028x-27.424

    R 平方值是介于 0 和 1 之间的数字,当趋势线的 R 平方值为 1 或者接近 1 时,趋势线最可靠。因为R2 >0.99,所以这是一个线性特征非常明显的数值,说明拟合直线能够以大于99.99%地解释、涵盖了实际数据,具有很好的一般性, 能够起到很好的预测作用。

    3. 使用Excel的数据分析功能

    1)点击【数据分析】,在弹出的选择框中选择【回归】,然后点击【确定】:

    2)【X值输入区域】选择访问数的单元格,【Y值输入区域】选择销售额的单元格,同时勾选如下所示的选项,包括残差、标准残差、残差图、线性拟合图和正态概率图。

    3)以下内容是残差和标准残差:

    4)以下是残差图:

    残差图是有关于实际值与预测值之间差距的图表,如果残差图中的散点在中轴上下两侧分布,那么拟合直线就是合理的,说明预测有时多些,有时少些,总体来说是符合趋势的,但如果都在上侧或者下侧就不行了,这样有倾向性,需要重新处理。

    5)以下是线性拟合图

    在线性拟合图中可以看到,除了实际的数据点,还有经过拟和处理的预测数据点,这些参数在以上的表格中也有显示。

    6)以下是正态概率图

    正态概率图一般用于检查一组数据是否服从正态分布,是实际数值和正态分布数据之间的函数关系散点图,如果这组数值服从正态分布,正态概率图将是一条直线。回归分析不一定得符合正态分布,这里只是仅仅把它描绘出来而已。

    以上数据表格和图表都说明公式y=0.01028x-27.424是一个值得信赖的预测曲线,假设搞活动时流量有50万访问数的话,那么预测销售将是51373,如下图所示:

  • ?

    如何用EXCEL线性回归分析法快速做数据分析预测

    静珊

    展开

    回归分析法,即二元一次线性回归分析预测法

    先以一个小故事开始本文的介绍。十三多年前,笔者就职于深圳F集团时,曾就做年度库存预测报告,与笔者新入职一台籍高管Edwin分别按不同的方法模拟预测下一个年度公司总存货库存。令我吃惊的是,本人以完整的数据推算做依据,做出的报告结果居然与仅入职数周,数据不齐全的Edwin制定的报告结果吻合度达到99%以上。仍清楚记得,笔者曾用得是标准的周转天数计算公式反推法,而Edwin用的正是本文重点介绍的二元一次线性回归分析法。

    二元一次线性回归分析法是一种数据分析模型。

    在EXCEL函数公式是FORECAST(英文意思是:预测),其用途是根据一条线性回归拟合线返回一个预测值,此函数使用可对未来销售额、库存需求或未来数据趋势进行预测分析。

    要做好库存预测须具备几个条件,首先须具备过去较长的某个时间段的完整整的数据。这里说的时间段最好是上一年度一整年或最近两年的数据。

    完整的数库据指的是需要有年度对应每个月的实际库存与营收额或销货成本。

    同样我们把库存预测肢解成几个关键步骤。

    第一步:数据准备,依要求对EXCEL公式数据输入

    先看一组实际的数据,其中蓝色字体是已知具备的数据,黄色则是需要预测的库存数据。预测库存,则至少需要具备的数据是标注蓝色三行数据。为别是:上一年度月营收,上一年度月实际库存,本年度月营收目标。可参照始下截图与视频。

    二元一次回归分析法实例截图二元一次回归分析公式实例示图

    第二步:依KPI目标调整预测数据

    假设要求实际目标要求对总体存货周转率提升10%,则总体平均存货库存也减少10%,具体数据如下截图标注粉色行。

    依目标进行调整数据截图

    第三步:把总库存分解成不同物料形态的库存。这里讲的不同类别可以指的是:

    物料形态分类:原材料、半成品、在制品以及成品等。

    仓码分类:原材料仓、包装仓、成品仓、重要物资仓、五金仓、配件仓以及辅助物料仓等。

    这里我们以第一种物料类型实例说明。须依据上年度不同物料类别占总库存的比率,再计算对应类别库存总额,如下截图。

    依比率计别算出不同物料库存截图

    第四:验证二无一次线性回归分析方法的准确度。

    存货周转天数=((期初库存+期末库存)/2*30)/(营收*物料成本率)=(平均库存*30)/销售成本。

    依公式反推预测库存,平均库存=(目标周转天数*营收*物料成本率)/30,前提需要更多的数据信息,包括物料成本率与以往的周转天数做为计划依据。

    如下截图,两种不同的方法得出库存预测吻度为97%(或103%)。

    二元一次回归分析法验证截图

    企业管理中,要快速地对企业活动做出判断,需要完整的数据管理积累支撑

    二元一次回归分析法做库存预测速度快,效率更高。而标准的周转天数计算预法会更准确与准确。到底应当选择哪个方法?不同的时期,不同的方法如何选择则是仁者见仁,没有对或错,只有合适与否。但有肯定的一点,那就是类似二元一次回归分析法管理工具的熟练应用,则一定对会对企业管理起到更好的帮助,在做数据调研时也是个好的选择。

excel中回归数据分析

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP