中企动力 > 商学院 > 多元数据分析软件
  • ?

    大数据可视化分析软件不完全等同于数据分析

    冷雪

    展开

    如今很多企业都喜欢炫酷的报表效果,钟情于大数据可视化分析软件此类产品。但是仅仅一个可视化数据分析软件就够了吗?数据可视化完全等同于数据分析吗?讲到数据分析,作为一款现代全能的数据分析工具来说,仅仅好看是不够的,可视化数据分析软件的前端后端技术也很重要。

    大数据可视化

    现如今数据可视化越来越流行,用商业智能来解决问题也越来越普及,但有时我们由此得到的可能是一个欺骗性的方案,为了避免这样问题的发生,我们就必须正确认识数据可视化与数据分析了。

    重要的是区分两种类型的业务分析和智能工具:端到端解决方案和仅是前端的解决方案。端到端解决方案由平台后端组成,基本上是处理准备所有数据的工具和算法,以及创建数据可视化和仪表板报告的前端。

    虽然人们喜欢看到其数据易于处理可视化,但只有这样的平台还不足以从企业的数据获得真正的见解。使用大数据可视化软件,从他们的名字可以想象其作用,人们没有所有的初始,背景阶段的准备和加入的数据。这意味着用户需要首先具有可以送入软件的数据,即预先制作的中央数据库。

    当涉及企业需求时,这两种类型的软件之间的区别是显而易见的。人们需要明白的是,可视化虽然很重要,但不能成为强大的商业智能软件的唯一组件。

    商业智能BI

    为了有效分析的目的,工作人员首先需要把所有的数据放在一个中心位置,希望能够更新和更改它,同时仍然能够使用相同的数据源。然而。如今为业务创建数据存储库不是那么简单。

    可视化工具专注于报告数据而不是分析数据,因此它们只使用限制性平台来限制每个公式可以输入的聚合数。 使用端到端解决方案就可以避免这些繁琐的过程。

    因此,大数据可视化分析软件不完全等同于数据分析,仅仅靠数据可视化是不够的,可以处理大量杂乱数据的健壮的后端对于大多数企业是至关重要的。

  • ?

    数据分析:《多元统计学》课堂案例教学法探讨,看完长见识了

    从霜

    展开

    《多元统计学》课堂案例教学法探讨

    在1920年美国的哈佛商学院倡导采取了一种十分独特的案例形式的教学方式,称其为案例教学法,此案例法实施之后,颇具绩效。在医学研究中,如果每个个体有多个观测数据,或者从数学定义,如果个体的观测数据能表为P维欧几里得空间的点,那么这样的数据称为多元数据,而分析多元数据的统计方法就称为多元统计分析。《多元统计学》课程是医学硕士研究生,特别是预防专业学生的专业基础课,然而《多元统计学》数学理论深奥、统计推导过程复杂,课程内容相对常规统计教学难度较大,本研究,提出适应于《多元统计学》课程的案例教学法,充分调动学生学习热情和积极性,更好的将多元统计分析方法应用到医学科研中[1]。

     

     1 案例教学法在《多元统计学》课程中的重要性  医学统计学是运用统计学的原理和方法研究生物医学问题的一门学科,其是以数理统计和概率论为理论基础,以医学理论为指导的一门应用性学科。该学科的特点为:概念多,公式多,以及内容的逻辑性很强。而大多数的学生都是跳过其理论的基础课而直接的进入到应用的课程来进行学习,我们面对统计学的抽象原理以及繁多的公式与大量的数字进行运算,这使得学生们会经常的感到头痛,有时甚至会产生畏难的情绪出来。本研究提出的适应于《多元统计学》课程的案例教学法,取得了一定成效[2]。  2案例教学法在《多元统计学》课程中的应用步骤  在《多元统计学》课程中,收集整理研究内容主要分为四部分。  2.1案例的前期准备 正式开始上课前一至两周,教师寻找与课程中相关的多元统计分析案例,案例为医学研究相关数据,并把案例的相关材料发给学生们。并让学员们来阅读相关的案例材料,以及查阅一些指定的相关资料与读物来搜集一些必要的相关信息,来初步的形成一些关于案例中有关问题的原因分析与解决的方案。在课程中会使用到国际标准软件,SAS软件,要求学生提前了解SAS软件程序。教师在此阶段列出了一些有关的思考题来让学生们有针对性的开展其准备方面的工作。  2.2准备小组讨论 教师根据学生的医学专业、来自不同附属临床医院、工作经历(是否在职培养)等,将学生划分为由5人组成的几个小组。各个小组进行充分讨论,对多元统计数据结构、分析方法、软件的程序代码交换意见,各个学习小组的讨论地点可就近在各个附属临床医院或者校本部。小组以自己有效的方式组织活动,教师不参与小组活动。  2.3小组集中参与讨论 让各小组成员都选派出自己的代表出来,来发表一些本组对多元统计案例的相关分析以及处理方面的意见,尤其是统计分析方法、软件程序、结果的解释等。成员们发言的时间要控制在25 min以内,其在发言完毕后要接受的其他组成员的讯问以及作出解释,而在此时,本小组的其他成员也是可以代替发言人来回答其问题的。教师可以提出一些意见来,比较其集中的问题以及处理的方式,并组织各个小组来对这些问题以及处理的方式来进行重点的讨论研究。

     

     2.4教师讲授 教师集中这些问题并让个小组来进行集中的讨论,然后留出时间让学生自己进行思考和总结学习的过程和经验,并让学生以书面的形式作出总结,对案例以及案例所反映出来各种问题有一个更加深刻的认识。教师对多元统计的理论进行梳理和详细的讲授,结合案例,对难点着重强调。对于医学生熟练使用软件实际操作分析数据,是必要的,教师应该给予重视。  3 开展好案例式教学的必备条件  经过实践我们发现,作为一种较好的教学模式,案例式教学法应用于《多元统计学》课程中,在师资、教材、实验环境等多个方面对我们提出了较高的要求[3]。  3.1要求教师具备扎实的多元统计理论功底 为医学生开设《多元统计学》的教师应具有扎实的数学、统计学、计算机理论知识和较强的实践能力。同时这也是我国职业教育界对师资提出的基本素质要求。显然,如果没有一支数量充足、质量较高、具有科研项目背景的师资队伍,是不可能开展好案例式教学的。提高教师的统计水平,有以下3种途径:  3.1.1积极开展教学、科研活动 有计划地安排教师与医院进行合作,获得医院真实的临床数据用于数据分析、模拟、研究,提高教师的统计分析水平和实践能力。鼓励教师利用业余时间参与校内外的项目开发和课题研究工作。  3.1.2优化、改进教师队伍结构 引进、聘请本地区综合大学数学专业的专家、教授担任专业的兼职教师。这些老师往往数学功底、基础理论扎实,能够给学生带来大量的理论知识。同时对本学科医学统计学教师要加强教学方法的指导,加大专业课教师的培训力度。

      

    3.1.3鼓励教师参加职业技术资格考试 鼓励教师通过多种途径获取一定级别的、与执教课程相对应的职业资格证书,对于医学统计学专业教师,可多参加SAS软件认证考试。  3.2要求创造良好的实验环境 《多元统计学》的课程实践性要求学校必须配备良好的实验设备,比如,运行速度较快的计算机、甚至刀片机及大型服务器、正版的国际标准统计学软件SAS软件。案例式教学更要求学生要加强实践。对这些设备要加强维护、逐步更新,确保实验的正常开展。  3.3要求学生积极参与 案例式教学的顺利开展不能缺少学生的积极、主动参与。要向学生讲解案例式教学的过程和要求,宣传案例式教学的优越性。要逐步转变学生的学习方法,变被动学习为主动学习,使学生真正成为学习的主体。教师在开展教学时,要由简到难、由浅入深、循序渐进的方式,让学生在案例式教学中不断体会成功的喜悦,激发学生的学习兴趣[4]。  实践证明,案例式教学法是一种适合《多元统计学》教学和研究的有效的教学方法,利用它可以显著地提高教学效果。开展案例式教学,给广大教师带来了压力,更增添了动力和活力。随着师资水平的提高、实验条件的改善、教学方法与教学手段的改进,学生学习的积极性和主动性的不断增强,实践动手能力的不断提高,案例式教学法一定能在医学生培养过程中发挥更加积极的作用。

  • ?

    万字长文测评:3款口碑炸裂的BI数据分析工具,最好用的其实是…

    残骸

    展开

    BI商业智能,这个我安利过很多次。

    作为当下最广泛使用的数据分析工具,它的好处实在太多啦:

    对比Excel、Python、R,不用写代码,不用写SQL,降低了数据分析的准入门槛,小白上手毫不费劲。能快速响应报表需求,准备好数据,出张报表也就是1个小时的事,再不济当取数机器也是极佳的选择。数据挖掘可视化应有尽有,对比Excel,以及开发级的Echarts,简直良心便利,随时随地出报告,直接Pass掉PPT。……

    什么BI分析工具好用?

    这个还真不能一刀切下定论。

    大家听得最多的莫过于Tableau、微软的Power BI,还有我经常推荐的FineBI。

    这3款BI工具各自凭借着可视化、Excel的影响力、以及企业级广泛应用的优势,在市面上都闯出口碑了。而且功能和版本也都在不断更新。

    所以,本文花了3天的功夫,整理了近万字的功能对比,看看这三个产品功能优势和差异究竟在哪里?

    主要这样几个角度考量:

    产品背景数据对接能力数据建模和数据加工数据可视化OLAP计算分析数据挖掘集成应用数据权限管控学习与技术服务一、产品背景

    Tableau即公司名,是最早的一代自助式BI分析工具,一直以来最被人称赞的其可视化,能基于可视化做很多数据分析扩展。

    Power BI是微软的,14年15年开始初见苗头,之前主要是基于Excel的高级功能,包括Power Query,Power Pivot,Power View和Power Map,后来作为Power BI集合推出。

    FineBI源于帆软公司,帆软早期做报表软件,finereport很厉害,在商业领域。后来逐渐发展商业智能BI,目前最新版已迭代到 V5.0。

    讲到产品就要谈谈其定位了,就像介绍人要说姓氏一样。Tableau更多定位是可视化分析的工具,所以可视化很突出。PowerBI有走Excel路子的趋势,发力个人用户,个人数据分析。FineBI更倾向于企业级应用的BI,很多功能都体现其企业级的基因。

    二、数据对接能力

    常规的文件数据如Excel、CSV、TXT等,三者都可以直接导入对接分析。

    传统的数据库例如Oracle、SQLServer、MySQL这三款也都可以直接连接取数分析。

    大数据平台方面,对于现今比较流行的大数据平台如Kylin、Derby、Gbase、ADS、Hbase、Mongodb,Power BI还不支持。这个Tableau、FineBI目前都有接口可以直接对接。FineBI还可以根据数据量以及并发情况选择直连或分布式连的对接方案。

    多维数据库的连接,比如SAP BW、HANA、Essbase等数据仓库,PowerBI还不支持,这块Tableau可以直接连接,FineBI可以通过服务器数据集进行对接。

    FineBI 数据连接

    数据接口开发方面,在一些需要基于java定制的api程序数据集,PowerBI和Tableau都不支持进行对接,FineBI则可以进行对接,基于java api的程序数据集。不过这是国外产品的老子态了。

    Power BI对于一些联机服务器数据源支持的比较好,面向分析,例如Google分析、appFigures等数据。

    三、数据建模和数据加工

    1、数据建模

    首先,三者都是自助式BI,都是自动建模了,这是和传统BI的显著区别之一。打个比方,假设我们要抽取一个数据库的几张表的数据来分析,当导入表时会根据键自动关联,或者手动设置关联联系。

    Tableau建立数据模型属于宽表模型,相当于是在原来元数据表的基础上根据新的关联关系再新生成一个结果集,之后的分析都是基于这个结果集来的,元数据发生变化,除非你手动更新,分析结果也不会有变化。

    FineBI也是类似的原理,不过建立的骨架数据关联模型都是基于元数据的,元数据变化,分析结果也实时变化。

    PowerBI的数据模型建立之后只能针对当前报表进行使用。且在数据源种类整合时,PowerBI无法对不同来源的数据进行实时整合建模,例如下图所示,PowerBI会自动禁用多个数据源的实时建模,需要将数据模式全部修改为抽取数据才可以进行整合关联建模。

    其次,FineBI和PowerBI的数据模式都支持实时和抽取模式,但是抽取模式下,由于FineBI的采用的分布式架构引擎进行数据的列式存储(支持十亿大数据量),PowerBI的数据引擎在抽取模式下仅仅是将数据以行式储存方式导入,所以在面对海量大数据时FineBI比PowerBI计算速度更快、性能处理更加强大。另外在数据编码上,FineBI支持对数据进行多种编码类型转换,PowerBI对这方面的转换是不支持的。

    2、数据加工

    对于数据的清洗加工处理方面,PowerBI提供了一些可视化界面的操作选项,结合M语言和DAX函数,可以进行数据加工处理,但需要用户有一定的公式编码书写能力。

    Tableau Desktop没有系统的数据加工功能,今年最新发布的Tableau prep对数据清洗和数据加工方面做了较大的弥补,从数据清理/调整、检查/筛选数据、联接/合并数据都拥有着比较体系的数据加工策略,可以无缝对接Tableau Desktop使用,不过需要同时安装Tableau Prep和Tableau DeskTop。整体数据工作流还是非常清晰、直观的。

    FineBI对一些有关数据的加工处理功能,统称为“自助数据集”。包括过滤、分组汇总、新增列、合并表、自循环列(可以有树结构的数据进行分层等集团性企业)、行列转换等操作。都可以快速进行处理,且可视化无代码。

    四、数据可视化

    从图表丰富度和可视化报告制作能力来比较。

    1、图表丰富度

    可视化展现能力方面,Tableau最佳,FineBI次之,随后PowerBI。

    Tableau除了常规的图表之外,还有盒须图、标靶图等和分析模型深度结合的图表。FineBI也不弱,常规图表都拥有,在数据地图方面,更是有流向地图、点地图等更实用的图表。PoweBI内置的图表种类相对较少,像玫瑰图、多层饼图、词云图、热力地图、流向地图等,需要进行市场图表拓展下载使用,图形属性方面还算丰富,可以由用户自定义进行图表样式属性的设置调节。

    操作方面,FineBI和Tableau是大差不差的,都是基于著名的图形语法(The Grammar Of Graphics)设计,以“形状“和对应的“颜色“,“大小“,“提示“,“标签“等属性进行图表类型替代。

    在分析区域有两个轴,横轴和纵轴,把所要分析的指标和维度拖拽到两个轴,就会自动出可视化图,图表也是根据分析情况自动给推荐的。

    还支持用户将字段绑定到图表的颜色、大小、形状、标签等属性。这样一来图表的可视化展现能力也就更加丰富灵活了,我们可以通过数据——>图表属性的无限组合,尽情地进行数据可视化认知的探索和洞察。

    Tableau界面

    Power BI就是拖拽图表组件,选定数据的方式来展现。

    2、Dashboard展现能力

    再来看看3个工具的Dashboard展现能力。

    PowerBI首届数据可视化大赛的冠军作品,指标合理呈现,布局直观简洁,秉承微软一贯的方块美。

    FineBI的Dashboard,下图是其中内置的一个比较典型的驾驶舱demo,总体来说更加细腻,柱形图圆角、字体颜色、风格、展现形式等,图表还可以有一些闪烁动效。

    Tableau的可视化更加丰富,有种信息图的感觉,布局也更加自由。

    五、OLAP计算分析

    从OLAP多维能力角度来看,3个工具都支持用户进行钻取、联动、切片、切块等分析操作。

    计算分析能力方面Tableau和FineBI都支持用户进行排名、排序、过滤、同比、环比、方差、标准差、中位数等快速计算操作,但是在一些高级计算例如移动平均、四分位等分析计算场景,Tableau拥有者更加强大的计算分析能力。

    FineBI的快速计算提供现成的同期/环期、同比/环比、排名、累计值、所有值、百分比计算等等,还挺方便的。

    另外Tableau在一些需要进行高级计算的场景下,还支持与Matlab进行集成计算,使用 MATLAB 预处理数据,并将该数据保存到 Tableau 数据提取中以便进一步分析。

    PowerBI大量的计算需要依靠DAX函数来进行运算,有种Excel函数既视感,其实一些常用的计算公式比如同期环期、同比环比像FineBI可以直接快速计算。

    六、数据挖掘能力

    FineBI最新版5.0增加了五类现成的数据挖掘算法,分别为时间序列、聚类、分类、回归和关联规则,还支持R语言的集成。时间序列算法和聚类算法还和图表分析相结合,拖拽操作即可立马看到预测和聚类的结果。

    不考虑时序关联分析

    多元线性回归

    PowerBI目前在数据挖掘这方面没有成熟的分析模块,只是简单的集成了一个R语言的执行脚本组件供用户书写代码集成使用。

    Tableau目前在数据挖掘内置时序分析预测、聚类算法,可进行简单数据挖掘计算处理(类似分类、关联分析、逻辑回归等算法则是没有的),同时也支持与R语言和Python集成以进行深度的数据挖掘分析。

    七、集成应用能力

    WEB级别的集成应用方面,Powe BI开放了丰富的接口供大家集成使用,还支持自定义开发集成第三方图标插件。Tableau和FineBI也有WEB接口,比如进行Iframe网页集成,但是无法进行代码级别的自定义图表开发集成。

    在移动集成应用中,FineBI支持微信集成和钉钉集成,给当今便捷式社交平台的数据分析查看带来了较大的便利,这方面的应用PowerBI并不支持。

    门户集成方面,FineBI开放了单点登录接口,这方面PowerBI暂未直接支持。

    FineBI有专门的一个数据报表管理平台以及运维。

    八、数据管控能力

    数据的权限管控能力方面,PowerBI可以将做好的报表打包发布为组织内容包并且进行指定用户组分配查看权限,并且由管理员进行用户组的行级别权限分配,但是无法控制用户查看的列级别的权限粒度,Tableau也是一样。

    这块是FineBI的优势,之前也在产品定位介绍中提到,FineBI是从企业级应用出身的一款BI,所以具有非常完善的数据权限管控能力。除了提供仪表板的权限分配之外,还能够针对不同部门/岗位/角色的人员进行行/列级别的数据权限管控,使得不同的人能够根据权限限制而只能看到自己的部分数据。另外在针对企业集团数据权限管控方面,FineBI提供了多级管控权限供用户进行多层权限分配,为数据权限管控提供了保障。

    九、学习与技术服务

    Power BI遵循着微软产品相似的理念、原则和体系结构,它也为Windows用户提供了一个简洁熟悉的操作界面,以帮助用户快速适用学习上手。但是,像其他软件一样,它也有其起伏,目前并不是非常成熟,商业选型必须仔细考虑。学习资料方面,关于PowerBI官方的学习资料基础文档还算健全,但是有部分内容是英文的,外部一些Excel社区都各自开了教学课程,但付费居多,这个全靠大家挖掘资料的功力。

    Tableau本身是一款非常成熟的全球化商业软件,拥有着非常强大的数据可视化分析功能。学习资料方面,官网也有很多学习文档、案例、视频等资源供用户进行上手学习。相较而言,Tableau产品学习曲线相对要陡峭一些,因为更加适合有专业数据技术能力的数据分析师使用。国内主要是代理商提供项目实施和技术服务,本土化稍微弱一些。

    FineBI由于是国内帆软的BI分析平台提供商,所以不论是基础的学习文档还是教学视频资料都比较丰富,另外还有着非常活跃的帆软中文社区供所有用户进行学习交流。技术服务方面,尤其是对于企业级别的用户,还会有专业的技术服务团队响应服务,在国内本土化服务做得相当不错。

    最后关键的,价格。

    Tableau个人版有15天免费试用版,过后收费。Power BI和FineBI个人使用都免费。

    商业部署。Tableau光产品,Desktop+Sever,一套一人加税后是11万多,每增加一人多买一个桌面版,就是15000左右,公司体量如果在3、40套,预计得7、80万,不含定制实施和维护服务。Power BI是按设计用户和节点卖的,按年/按月收费。估计了一下,假设200个用户的企业,40个设计用户,1年收费是45万左右,也就是每年要付出这么多,还是比较贵的。FineBI据我了解是类似软件采购买断式的,价格按照功能模块还有并发数定,平均2、30万起,不算服务实施。但这一性价比也远超于前两者了

    个人使用,两者都是免费的。PowerBI毕竟背靠Excel这座大山,和Excel配合使用,大家会普遍觉得习惯。而FineBI又是另一种扁平化的风格,很多计算公式,可视化特效都有现成的,更加自助些。大家不妨都下载试试。

    最后

    作为数据分析师,也是数据产品的爱好者,我呢喜欢把弄各种工具。Tableau的可视化很人性,个人使用就像是Excel透视表的升级版。Power BI除了M语言和DAX语言得心应手比较难,产品操作也都延续了Excel的思想。但是两者共通的毛病,面向企业的产品定制化以及庞杂的报表分析需求,不是特别友好(开发难度太大,报表制作还得依靠Excel)。但这却是国内大多数企业很普遍的需求,这一块不妨青睐于国内“符合国情”的BI工具FineBI。

    所以...

  • ?

    快速掌握SPSS数据分析

    应凝丝

    展开

    SPSS难吗?无非就是数据类型的区别后,就能理解应该用什么样的分析方法,对应着分析方法无非是找一些参考资料进行即可。甚至在线网页SPSS软件直接可以将数据分析结果指标人工智能地分析出来,这有多难呢?本文章将周老师(统计学专家)8年的数据分析经验浓缩,便于让不会数据分析的同学,在学习数据分析的过程中可以少走弯路,树立数据分析价值观,以及以数据进行决策的思维意识,并且可以快速的掌握数据分析。本文章分为四个板块进行说明,一是数据分析思维的培养。二是数据间的几类关系情况。三是数据分析方法的选择。四是数据研究的撰写等。

    相对来讲,我们国家对于数据价值的重视是最近几年才开始,尤其是大数据时代的兴起,以及人工智能时代的国家战略情况。之前企业进行决策时基本均是凭借主观经验,老板的经验决定企业的成长,这也许叫做‘定性研究’较为适合,这种思路并没有错误。相对来讲,主观个人偏好性是这种经验意识的弊端,而数据思维是用真实的数据作为依据,相对来讲具有更强的科学客观性。但两种思维各有优缺点,数据还可以造假,以及人们还可能会错误的利用数据等。

    但无论如何,西方的数据意识,以及数据价值客观存在。我们有必要对其进行重视。作为数据研究人员,首先需要确保的是对数据的敬仰,错误的数据绝对无法容忍,否则永远不会得出科学的结论。因而数据分析思维的素养第一层次即尊重数据。原始数据代表的意义,数据自身带来的属性等均应该逐一确认。

    确认数据的真实准确性后,即完成数据清理后,可对数据类型进行区分,一切数据均可分为两种类型,包括定性和定量数据。如同’定性研究‘和’定量研究‘一样,定性数据是那些表示分类,通常使用百分比汇总,无法计算平均值的数据,比如性别,专业。性别仅为男和女,使用数字1和数字2表示,可以分别计算男和女的比例,但是不能算个平均分为1.2,得出性别平均为1.2这样的分析。

    另外一种数据叫定量数据,定量数据是那些可以进行量化,通常使用平均值表示,比如年龄,身高,体重,满意度等。可以计算平均年龄,但通常不分分析每个年龄数字的选择百分比。

    还有一类数据,其即可以计算百分比,也可以计算平均值,比如问卷研究中的满意度,数字1代表非常不满意,数字2代表比较不满意,数字3代表中立,数字4代表比较满意,数字5代表非常满意。这类数据可以计算各项的百分比,也可以计算平均值。具体此类数据如何应用,可结合实际情况进行即可,但通常的偏好是,如果可以看作为定量数据,则按照定量数据情况进行即可。

    在基本的数据类型确认之后,接下来再讨论下数据研究的一些关系情况。如果是初学数据分析,常规的路径可能是开始理解数据算法的原理,然后就懂一个就去,接着再学习另外一个算法。这种方法是常规教科书式的学习路径,非常慢而且容易出现一个问题即懂了理论无法进行实践。

    数据分析是挖掘数据间的关系情况,发现潜在的数据规律,找出数据后面潜在的商业价值等。本人将数据间的关系归纳汇总为以下三类。第一是差异关系;第二是相关关系。第三是其它关系。

    第一类差异关系通常是研究不同类别的差异性,提到了不同类别,那就涉及到定性数据,差异关系可以包括定性和定量数据的差异性,定性和定性数据的差异性。自然地也就对应到几类研究方法。

    第二类为相关关系。比如越如何越如何之类的关系。包括相关关系,还有影响关系等。X对于Y的影响关系情况如何等,此时影响关系又拆分出几种分析算法。

    当然还有其它关系,比如数据的浓缩,聚类。此时又分涉及到对应的研究方法。

    在进行数据研究时,首先需要想到的是“我想做什么?“,来回就只有三种关系,那么这种关系有着明显的区分性,对应确认关系情况,加上数据类型的判断,对应就会找出合理的数据研究方法。接下来一一概述。

    上面两部分分别讲述了数据类型和数据关系情况。接着需要落地,即研究方法的使用。按照上一部分的思路,即三类关系情况进行阐述。

    第一类为差异关系

    · 定性和定性数据差异关系。比如性别和专业的差异关系,不同性别人群专业偏好上有没有差异呢?此时应该用卡方分析。

    · 定性和定量数据差异关系。比如性别和身高的差异关系,不同性别人群身高有没有明显的差异性呢?此时应该用方差分析或者T检验。至于方差分析和T检验的区别上,比如性别为两类,则可以使用方差分析或者T检验;比如研究城市和身高的关系,一线,二线或者三线城市人群他们的身高有没有明显差异性。比较了三组人群,这时候只能用方差分析,不能用T检验。因为方差分析可以对比多组,而T检验只能对比两组。

    · 定量数据和定量数据的差异。有时候做实验,比如新型教学方式的使用,在使用前和使用后,学生成绩有没有明显的变化呢?此时则应该使用配对T检验。配对T检验通常都是用于实验研究中,使用时相对需要注意下。

    · 定量数据和数字的差异。比如中国人的平均身高是否明显的高于1.70。定量数据和一个数字的差异性,此时应该用单样本T检验。

    · 当然还有其它一些研究方法,但先从基础的开始,懂了这些方法后,再逐一深入学习。明白了这几类差异关系,事实上已经理解一部分数据分析。比如差异关系研究时有时候会有非参数检验,这类研究都是和正态性,方差齐这两个名词紧密相关,后续的文章再慢慢剖析。

    第二类为相关关系

    · 定量和定量数据的相关关系。比如身高和体重之间有没有关系?此时则应该使用相关分析。至于相关分析,又可以再细分为pearson和spearman相关,这两类关系是结合数据正态性情况而定,正常情况下都默认使用pearson相关分析。

    · 影响关系情况(X对Y的影响,Y为定量数据)。比如研究学历,年龄,收入,满意度等对于消费金额的影响。此时一般是使用回归分析,或者更多称作是线性回归分析。也有时候会使用到非线性回归分析,但这种情况相对较少。线性回归分析也可以再细分为2类,简单线性(一元线性)和多元线性,研究X对Y的影响,如果X仅为1个则称作简单线性(一元线性);如果X为多个,此时称作多元线性回归分析。如果Y的个数超过1个,可以多进行几次回归就好,更复杂的可以使用结构方程模型进行研究。线性回归时X可以为定性数据也可以为定量数据,如果是定性数据则需要进行虚拟变量(哑变量)设置。

    · 影响关系情况(X对Y的影响,Y为定类数据)。比如研究学历,年龄,收入,满意度等对于是否购买iPhone X的影响。此时应该使用logistic回归分析。线性回归和logistic回归的区别在于,线性回归时,Y为定量数据;logistic回归分析时,Y是定类数据。当然logistic回归又区分为三类,分别是二元logistic回归,有序logistic回归,无序logistic回归;区别在于如果Y仅分为两类,比如愿意不愿意,购买不购买,喜欢不喜欢,此时Y只有2个类别则叫做二元logistic回归,此方法的使用频率非常高。比如Y分为三组分别是不喜欢,喜欢和喜欢,此时使用有序logistic回归(其实使用线性回归也是可以的,只是我们这里把Y当成是定类数据所以使用有序logistic回归而已);无序logistic回归时,Y一定是绝对的定性数据,比如出行方式的偏好(自行车,公共汽车,地铁,自驾),此时用无序logistic回归即可。

    第三类为其它关系

    实际情况中还会有比如数据的浓缩,样本的聚类等研究。

    · 数据浓缩:比如说了20句话,是否可以把20句话概括归纳成4个词语表示呢?此时就应该用到数据浓缩,即使用因子分析(也或者主成分分析);以及记住,数据浓缩时,数据一定是定量数据。

    · 样本聚类:比如游戏里面分了几种角色,游戏数据分析人员希望对收集到了1万个样本分成几类,便于进行游戏里面的角色定位。此时则需要使用聚类分析。

    上述的方法选择,分别与数据关系,或者数据类型间的关联性思路。事实上与网页在线版本的SPSSAU(spssau),完全如出一辙。spssau即是使用这样的思路进行产品设计。确定好数据类型,理解了数据关系情况,即可选择出正确的数据研究方法。

    如果已经理解了数据类型,数据关系,并且选择了正确的数据研究方法。最终无非是把数据研究方法得出的结论进行汇总整理,然后写成有逻辑性的报告,并且在结论基础上对应提出有意义有价值的建议措施等。

    关于数据报告的撰写,单独从数据分析角度上看,建议以实际需求出发,比如研究差异关系,那么首先得需要知道有没有差异,接着有了差异,具体差异情况如何。有了差异或者没有差异时,对应的建议措施应该如何。按照这样的思路,相信数据研究报告的撰写并非难事。

    如果是对具体数据研究方法的结论撰写有困难,可以直接使用spssau进行分析,直接参考里面的智能文字分析即可。以及需要特别注意在于,数据研究结论对应有什么意义,价值在哪里,对实际商业的价值或者指导在哪里?这才是重点。

  • ?

    数据可视化分析工具汇总

    何十八

    展开

    俗话说“巧妇难为无米之炊”。数据时代,没有一款好的数据可视化分析工具,光有团队怎么行?

    商场如战场,数据是把枪。亚马逊运用大数据为客户推荐商品信息,阿里用大数据成立了小微金融服务集团,而谷歌更是计划用大数据接管世界……不知不觉,数据已经成为我们生活中必不可少的利器。本文收集了各个平台各种行业的数据可视化分析工具,让你不仅大饱眼福,而且还可以让你事半功倍。

    Excel

    Excel作为一个入门级工具,是快速分析数据的理想工具,也能创建供内部使用的数据图,但是Excel在颜色、线条和样式上课选择的范围有限,这也意味着用Excel很难制作出能符合专业出版物和网站需要的数据图。

    ETHINK大数据平台

    一款集数据可视化分析、数据挖掘、机器学习等功能为一体的综合性大数据平台。拖拽式操作,操作简单,支持多种数据源,上卷下钻,数据预测,聚类分析,相关性分析,数据联想,决策树,地图,组合图等功能。通过强大的2次开发能力,帮助快速复制与行业推广。

    Charting Fonts

    Charting Fonts是将符号字体与字体整合(把符号变成字体),创建出漂亮的矢量化图标。

    Gephi

    Gephi是进行社会图谱数据可视化分析的工具,不但能处理大规模数据集并且Gephi是一个可视化的网络探索平台,用于构建动态的、分层的数据图表。

    CartoDB

    CartoDB是一个不可错过的网站,你可以用CartoDB很轻易就把表格数据和地图关联起来,这方面CartoDB是最优秀的选择。

    Google Chart API

    Google Chart提供了一种非常完美的方式来可视化数据,提供了大量现成的图标类型,从简单的线图表到复杂的分层树地图等。它还内置了动画和用户交互控制。

    D3

    D3(Data Driven Documents)是支持SVG渲染的另一种JavaScript库。但是D3能够提供大量线性图和条形图之外的复杂图表样式,例如Voronoi图、树形图、圆形集群和单词云等。

    Crossfilter

    Crossfilter既是图表,又是互动图形用户界面的小程序,当你调整一个图表中的输入范围时,其他关联图表的数据也会随之改变

    Raphael

    Raphael是创建图表和图形的JavaScript库,与其他库最大的不同是输出格式仅限SVG和VML.

    R语言是主要用于统计分析、绘图的语言和操作环境。虽然R主要用于统计分析或者开发统

    计相关的软件,但也有用作矩阵计算。其分析速度可比美GNUOctave甚至商业软件MATLAB。

    Visual.ly

    如果你需要制作信息图而不仅仅是数据可视化,Visual.ly是最流行的一个选择。

    Weka

    Weka是一个能根据属性分类和集群大量数据的优秀工具,Weka不但是数据分析的强大工具,还能生成一些简单的图表。

    NodeBox

    NodeBox是OS X上创建二维图形和可视化的应用程序,你需要了解Python程序,NodeBox与Processing类似,但没有Processing的互动功能。

    Processing

    Processing是数据可视化的招牌工具。你只需要编写一些简单的代码,然后编译成Java。Processing可以在几乎所有平台上运行。

    Leaflet

    Leaflet是一个开源的JavaScript库,用来开发移动友好地交互地图。

    Openlayers

    Openlayers可能是所有地图库中可靠性最高的一个。虽然文档注释并不完善。且学习曲线非常陡峭,但是对于特定的任务来说,Openlayers能够提供一些其他地图库都没有的特殊工具。

    PolyMaps

    PolyMaps是一个地图库,主要面向数据可视化用户。PolyMaps在地图风格化方面有独到之处,类似CSS样式表的选择器。

    Timeline

    Timeline即时间轴,用户通过这个工具可以一目了然的知道自己在何时做了什么。

    jsDraw2DX

    jsDraw2DX是一个标准的JavaScript库,用来创建任意类型的SVG交互式图形,可生成包括线、矩形、多边形、椭圆、弧线等图形。

    iCharts

    iCharts提供可一个用于创建并呈现引人注目图表的托管解决方案。有许多不同种类的图表可供选择,每种类型都完全可定制,以适合网站的主题。iCharts有交互元素,可以从Google Doc、Excel表单和其他来源中获取数据。

    Modest Maps

    Modest Maps是一个轻量级、可扩展的、可定制的和免费的地图显示类库,这个类库能帮助开发人员在他们自己的项目里能够与地图进行交互。

    Many Eyes

    Many Eyes是一个Web应用程序,用来创建、分享和讨论用户上传图形数据。

    Anychart

    Anychart是一个灵活的基于Flash/JavaScript(HTML5)的图表解决方案、跨浏览器、跨平台。除了图表功能外,它还有一款收费的交互式图表和仪表。

    Kartograph

    Kartograph不需要任何地图提供者像Google Maps,用来建立互动式地图,由两个libraries组成,从空间数据开放格式,利用向量投影的Python library以及post GIS,并将两者结合到SVG和JavaScript library,并把这些SVG资料转变成互动性地图。

    Sigma.js

    Sigma.js是一个开源的轻量级库,用来显示交互式的静态和动态图表。

    Echarts

    经常使用开源软件的朋友应该很熟悉ECharts,大家都知道去年春节以及近期央视大规划报道的百度大数据产品,如百度迁徙、百度司南、百度大数据预测等等,这些产品的数据可视化均是通过ECharts来实现的。

    Zoho Reports

    Zoho Reports支持丰富的功能帮助不同的用户解决各种个性化需求,支持SQL查询、类四暗自表格界面等。

    Quantum GIS(QDIS)

    Quantum GIS(QDIS)是一个用户界面友好、开源代码的GIS客户端程序,支持数据的可视化、管理、编辑与分析和印刷地图的制作。

    Tableau Public

    Tableau Public是一款桌面可视化工具,用户可以创建自己的数据可视化,并将交互性数据可视化发布到网页上。

    Paper.js

    Paper.js是一个开源向量图表叙述架构,能够在HTML5 Canvas 运作,对于初学者来说它是很容易学习的,其中也有很多专业面向可以提供中阶及高阶使用者。

    Dundas Chart

    Dundas Chart处于行业领先地位的NET图表处理控件,于2009年被微软收购,并将图表产品的一部分功能集成到Visual Studio中。

    TimeFlow

    TimeFlow Analytical Timeline是为了暂时性资料的视觉化工具,现在有alpha版本因此有机会可以发现差错,提供以下不同的呈现方式:时间轴、日历、柱状图、表格等。

    Gantti

    Gantti是一个开源的PHP类,帮助用户即时生成Gantti图表。使用Gantti创建图表无需使用JavaScript,纯HTML-CSS3实现。图表默认输出非常漂亮,但用户可以自定义样式进行输出(SASS样式表)。

    Smoothie Charts

    Smoothie Charts是一个十分小的动态流数据图表路。通过推送一个webSocket来显示实时数据流。Smoothie Charts只支持Chorme和Safari浏览器,并且不支持刻印文字或饼图,它很擅长显示流媒体数据。

    Flot

    Flot是一个优秀的线框图表库,支持所有支持canvas的浏览器(目前主流的浏览器如火狐、IE、Chrome等都支持)。

    Pizza Pie Charts

    Pizza Pie Charts是个响应式饼图图表,基于Adobe Snap SVG框架,通过HTML标记和CSS来替代JavaScript对象,更容易集成各种先进的技术。

    Fusion Charts Suit XT

    Fusion Charts Suit XT是一款跨平台、跨浏览器的JavaScript图表组件,为你提供令人愉悦的JavaScript图表体验。它是最全面的图表解决方案,包含90+图表类型和众多交互功能,包括3D、各种仪表、工具提示、向下钻取、缩放和滚动等。它拥有完整的文档以及现成的演示,可以帮助你快速创建图表。

    Protovis

    Protovis是一个可视化JavaScript图表生成工具。

    Arbor.Js

    Arbor.Js提供有效率、以力导向的版面配置演算法,抽象画图表组织以及筛选更新的处理。

    Highchart.js

    Highchart.js是单纯由JavaScript所写的图表资料库,提供简单的方法来增加互动性图表来表达你的网站或网站应用程式。目前它能支援线图、样条函数图。

    Circos

    Circos最初主要用于基因组序列相关数据的可视化,目前已应用于多个领域,例如:影视作品中的人物关系分析,物流公司的订单来源和流向分析等,大多数关系型数据都可以尝试用Circos来可视化。

    NodeXL

    NodeXLDE 主要功能是社交网络可视化。

    BirdEye

    BirdEye是Decearative Visual Analytics,它属于一个群体专案,为了要提升设计和广泛的开源资料视觉化发展,并且为了Adobe Flex建视觉分析图库,这个动作以叙述性的资料库为主,让使用者能够建立多元资料视觉化界面来分析以及呈现资讯。

    Visualize Free

    Visualize Free是一个建立在高阶商业后台集游InetScoft开发的视觉化软体免费的视觉分析工具,可从多元变量资料筛选并看其趋势,或是利用简单地点及方法来切割资料或是小范围的资料。

    OpenStreetMap

    OpenStreetMap是一个世界地图,由像您一样的人们所构筑,可依据开放协议自由使用。

  • ?

    数据分析学习笔记——数据可视化

    曼青

    展开

    文 | 张俊红

    写在前面:本篇来源于书籍《数据之美—一本书学会可视化设计》的学习后整理所得。全篇主要围绕数据可视化的5个步骤展开,其中重点内容是第三步:“应该使用哪种可视化形式”。本篇旨在带你全面认识了解可视化,所以一些具体的工具的使用并未涉及,只是罗列类一些常用的可视化工具。

    你有什么数据

    关于可视化,人们一般的理解是先设想要达到的可视化效果,然后在去寻找相应的数据。

    这样经常会造成:“现有的数据不能够做出事先设想的可视化效果,或者是想要制作理想的图表需要获取更多的数据。”

    而实际上关于可视化的步骤应该是先认清你有什么数据。

    为了更好的进行可视化,我们将数据分为分类数据、时序数据、空间数据、多元变量数据四大类。

    1、分类数据

    分类数据是指针反映事物类别的数据。如:用户的设备可以分为Iphone用户和andorid用户两种;支付方式可以分为支付宝、微信、现金支付三种等。诸如此类的分类所得到的数据被称为分类数据。

    2、时序数据

    时序数据也称时间序列数据,是指同一统一指标按时间顺序记录的数据列。如:每个月的新增用户数量、某公司近十年每年的GMV等。诸如此类按时间顺序来记录的指标对应的数据成为时序数据。

    3、空间数据

    空间数据是指用来表示空间实体的位置、形状、大小及其分布特征诸多方面信息的数据,它可以用来描述来自现实世界的目标,它具有定位、定性、时间和空间关系等特性。空间数据是一种用点、线、面以及实体等基本空间数据结构来表示人们赖以生存的自然世界的数据。

    4、多变量

    数据通常以表哥形式的出现,表格中有多个列,每一列代表一个变量,将这份数据就称为多变量数据,多变量常用来研究变量之间的相关性。即用来找出影响某一指标的因素有哪些。

    关于数据你想了解什么

    关于数据你想了解什么也就是针对数据进行提问。

    你想从中得到什么结论(平台上的用户中哪个地区的用户较多、数据分析领域最具有权威的人物是谁、2016年的GMV环比去年是增加类还是降低类)。

    了解什么到什么现象(学生成绩好坏可能与家庭背景是否具有一定的相关性、应届生收入和毕业院校是否有一定的相关性)。

    应该使用哪种可视化形式

    在前面我们已经说过,在做可视化的过程中,我们需要先明确我们有什么数据,然后再去研究这些数据适合做什么类型的可视化,再然后从这些适合的可视化类型中选择能够很好的满足我们需求的(即能够更好的帮助我们了解我们想要的)视图。

    为了找到合适的可视化形式我们需要先介绍两个内容:有哪些可视化形式、如何让可视化更加清晰。

    1、有哪些可视化形式

    基于数据的可视化形式有:视觉暗示、坐标系、标尺、背景信息以及前面四种形式的任意组合。

    (1)视觉暗示:

    是指通过查看图表就可以与潜意识中的意识进行联系从而得出图表表达的意识。常用的视觉暗示主要有:位置(位置高低)、长度(长短)、角度(大小)、方向(方向上升还是下降)、形状(不同形状代表不同分类)、面积(面积大小)、体积(体积大小)、饱和度(色调的强度,就是颜色的深浅)、色调(不同颜色)。

    (2)坐标系:

    这里的坐标系和我们之前数学中学到的坐标系是相同的,只不过坐标轴的意义可能稍有不同。常见的坐标系种类有:直角坐标系、极坐标系和地理坐标系。

    大家对直角坐标系、极坐标系比较熟悉,这里说一下地理坐标系。

    地理坐标系是使用三维球面来定义地球表面位置,以实现通过经纬度对地球表面点位引用的坐标系。但是我们在进行数据可视化的时候一般用投影的方法把其从三维数据转化成二维的平面图形。

    (3)标尺:

    前面说到的三种坐标系只是定义了展示数据的维度和方向,而标尺的作用是用来衡量不同方向和维度上的大小,其实和我们熟悉的刻度挺像。

    (4)背景信息:

    此处的背景和我们在语文中学习到的背景是一个概念,是为了说明数据的相关信息(who、what、when、where、why),使数据更加清晰,便于读者更好的理解。

    (5)组合组件:

    组合组件就是根据目标用途将上面四种信息进行组合。

    2、如何让可视化更加清晰

    如何让可视化更加清晰:

    (1)建立视觉层次:

    把图表在视觉上进行分层,把非重点信息弱化,重点信息强化突出。

    (2)增强图标可读性:

    ● 让数据点更容易比较

    ● 留白,图表之间留有一定空间的空白。

    (3)高亮显示重点内容:

    高亮就是以特殊形式显示的内容,便于读者在一堆数据中很快抓住重点。

    (4)注释可视化:

    一般指图标的标题部分。帮助读者更好地理解图表的意思。

    能够进行可视化的工具有哪些

    1、Microsoft Excel

    对于这个软件大家应该并不陌生,对于一般的可视化这个软件完全足矣,但是对于一些数据量较大的数据则不太适合。

    2、Google Spreadsheets

    Google Spreadsheets是基于Web的应用程序,它允许使用者创建、更新和修改表格并在线实时分享数据。基于Ajax的程序和微软的Excel和CSV(逗号分隔值)文件是兼容的。表格也可以以超文本链接标记语言(HTML)的格式保存。

    3、Tableau Software

    Tableau Software现在比较受大家的欢迎,既可以超越Excel做一些稍微复杂的数据分析,又不用像R、Python那种编程语言进行可视化那么复杂。好多人都有推荐这款软件。

    4、一些需要编程性语言的工具

    R语言、JavaScript、HTML、SVG、CSS、Processing、Python。这里主要是列举一下有哪些编程语言可以实现可视化,具体如何实现需要读者自行学习。我目前主要是在学python的可视化,稍后会分享一篇用python进行可视化的学习笔记。

    透过可视化你看到了什么、有什么意义

    把数据可视化以后,你需要从中发现一些数据之间的相关性以及通过数据暴露出来的问题。比如你会发现某天的新注册用户显著高于或低于其他天的数量,你发现这个问题了,你就需要去调查该问题出现的原因,然后解决他。

    或者是你发现某两个指标具有很强的线性相关关系,那么你就需要去通过其他方面去验证这个情况是真实存在的还只是偶然情况。

    End.

    来源:36大数据

  • ?

    用R语言做数据分析——多元数据的数字特征及相关系数

    小冉

    展开

    对于p元总体(X1,X2,...,Xn),其样本为

    其中第i个样本为

    样本的第j个分量的均值定义为

    样本的第j个分量的方差定义为

    样本的第j个分量与第k个分量的协方差定义为

    为样本的相关矩阵(Pearson相关矩阵)。

    对于多元数据,与二元数据相同,采用数据框的输入方式,可以用mean()函数、cov()函数和cor()函数计算样本的均值、协方差矩阵和相关矩阵。关于相关性检验,仍是使用cor.test()函数作两两分量的相关性检验。

    例子:为测试某种橡胶的性能,现抽取10个样品,每个测量三项指标:硬度、变形和弹性。其数据如下所示,试计算样本均值、样本协方差和样本相关矩阵,并用Pearson相关性检验确认变量X1、X2、X3是否相关?

    首先建立数据文件(文件名:rubber.txt),其格式为:

    X1X2X3

    1654527.6

    2704530.7

    3704831.8

    4694632.6

    5665031.0

    6674631.3

    7684737.0

    8724333.6

    9664733.1

    10684834.2

    >#读取数据

    >rubber<-read.table("rubber.text")

    >#计算均值

    >apply(rubber,2,mean)

    68.1046.5032.29

    >#计算协方差矩阵

    >cov(rubber)

    X14.766667-1.94444441.9344444

    X2-1.9444443.83333330.6166667

    X31.9344440.61666676.1898889

    >#计算相关矩阵

    >cor(rubber)

    X11.0000000-0.45488320.3561291

    X2-0.45488321.00000000.1265962

    X30.35612910.12659621.0000000

    >#相关性检验

    >cor.test(~X1+X2,data=rubber)

    Pearson'sproduct-momentcorrelation

    data:X1andX2

    t=-1.4447,df=8,p-value=0.1865

    alternativehypothesis:truecorrelationisnotequalto0

    95percentconfidenceinterval:

    -0.84305350.2448777

    sampleestimates:

    cor

    -0.4548832

    >cor.test(~X1+X3,data=rubber)

    data:X1andX3

    t=1.078,df=8,p-value=0.3125

    -0.35254860.8052056

    0.3561291

    >cor.test(~X2+X3,data=rubber)

    data:X2andX3

    t=0.36097,df=8,p-value=0.7275

    -0.54659850.7003952

    0.1265962

    计算结果可得出:X1、X2、X3两两均不相关。

    基于相关系数的变量分类

    现在以一个示例说明相关系数的应用——基于相关系数的变量分类。

    例子:现有48位应聘者应聘某公司的某职位,公司为这些应聘者的15项指标打分,这15项指标分别是:求职信的形式(FL)、外貌(APP)、专业能力(AA)、讨人喜欢(LA)、自信心(SC)、洞察力(LC)、诚实(HON)、推销能力(SMS)、经验(EXP)、驾驶水平(DRV)、事业心(AMB)、理解能力(GSP)、潜在能力(POT)、交际能力(KJ)和适应性(SUIT)。每项分数是从0到10分,0分最低,10分最高。每位求职者的15项指标被记录在"employee.txt"文件中,公司计划录用6名最优秀的申请者,问公司将如何挑选这些应聘者。

    解:通常的作法是:做15项指标的平均值

    录用分数最高的6名应聘者。

    "employee.txt"数据如下:

    >#读取数据,计算平均得分,并按照大小顺序排列

    >rt<-read.table("employee.txt")

    >AVG<-apply(rt,1,mean)

    >sort(AVG,decreasing=TRUE)

    4039872322224

    9.6000009.4666679.0000008.6000008.6000008.5333338.4666678.400000

    91016344122017

    8.1333337.6666677.6666677.4000007.4000007.2000007.2000007.000000

    4662115112745

    7.0000006.8666676.7333336.6666676.6666676.6666676.4000006.333333

    133814437151826

    6.2000006.1333336.0000005.9333335.8666675.6666675.5333335.533333

    1925363132333043

    5.4000005.1333335.1333335.0666675.0666674.6666674.5333334.266667

    4134354228474829

    3.6666673.4000003.1333332.8666672.7333332.6000002.4000002.000000

    将上述语句的mean该外sum,即求应聘者的总得分,其选择结果是仙童的。当然,也可按加权平均值计算:

    其中w1,w2,...,w15是权值,满足w1+w2+...+w15=1,wi(i=1,2,...,15),它表示第i项指标的重要性,这里需要确定每项指标的权重。

    上述方法有它的缺点,因为有些指标是相关的,而有些指标不相关。实际上,相关类多的项占的权重大,而相关类少的项占的权重小,因此在作评分之前,应先作相关性分析。

    >cor(rt)

    FLAPPAALASC

    FL1.000000000.23880570.0440408890.3063130370.092144656

    APP0.238805731.00000000.1234192960.3796141510.430769427

    AA0.044040890.12341931.0000000000.0015897660.001106763

    LA0.306313040.37961420.0015897661.0000000000.302439887

    SC0.092144660.43076940.0011067630.3024398871.000000000

    LC0.228432050.37125890.0768244940.4827749280.807545017

    HON-0.106749470.3536910-0.0302696010.6454085950.410090809

    SMS0.270699190.48954900.0547274210.3616438800.799630538

    EXP0.548379630.14092490.2655853520.1407234150.015125832

    DRV0.345576330.34054930.0935220300.3931641480.704340067

    AMB0.284644840.54963590.0440659810.3465550340.842122228

    GSP0.338201960.50629870.1975045520.5028093050.721108973

    POT0.367452920.50737690.2900321510.6055075540.671821239

    KJ0.467206190.2840928-0.3233193520.6851557680.482455962

    SUIT0.585918220.38420840.1400173680.3269574190.250283416

    LCHONSMSEXPDRVAMB

    FL0.22843205-0.1067494720.270699190.548379630.345576330.28464484

    APP0.371258940.3536909690.489549020.140924910.340549270.54963595

    AA0.07682449-0.0302696010.054727420.265585350.093522030.04406598

    LA0.482774930.6454085950.361643880.140723420.393164150.34655503

    SC0.807545020.4100908090.799630540.015125830.704340070.84212223

    LC1.000000000.3558444640.818020800.147201970.697515180.75754208

    HON0.355844461.0000000000.23990754-0.155938490.280184990.21460636

    SMS0.818020800.2399075391.000000000.255417580.814734210.85952656

    EXP0.14720197-0.1559384950.255417581.000000000.337228210.19548192

    DRV0.697515180.2801849890.814734210.337228211.000000000.78032317

    AMB0.757542080.2146063590.859526560.195481920.780323171.00000000

    GSP0.882848650.3858217580.782123220.299268230.714073190.78387073

    POT0.777316170.4156574470.753609830.348338780.788400240.76886954

    KJ0.526835620.4482455220.563284190.214953160.612807670.54712558

    SUIT0.416144670.0027556170.558035850.692636170.622554060.43476824

    GSPPOTKJSUIT

    FL0.33820200.36745290.46720620.585918216

    APP0.50629870.50737690.28409280.384208365

    AA0.19750460.2900322-0.32331940.140017368

    LA0.50280930.60550760.68515580.326957419

    SC0.72110900.67182120.48245600.250283416

    LC0.88284860.77731620.52683560.416144671

    HON0.38582180.41565740.44824550.002755617

    SMS0.78212320.75360980.56328420.558035847

    EXP0.29926820.34833880.21495320.692636173

    DRV0.71407320.78840020.61280770.622554062

    AMB0.78387070.76886950.54712560.434768242

    GSP1.00000000.87583090.54940760.527816315

    POT0.87583091.00000000.53939680.573873154

    KJ0.54940760.53939681.00000000.395798842

    SUIT0.52781630.57387320.39579881.000000000

    >

    下面将变量分组,分组的原则是:同一组中变量之间的相关系数尽可能的高,而不同组之间的相关系数尽可能的低。从相关系数最大的变量开始,LC(洞察力)与GSP(理解能力)的相关系数是0.882,GSP与POT(潜在能力)的相关系数是0.876,而LC与POT之间的相关系数是0.777,因此,这三个变量可以看成一组。SMS(推销能力)也应该包含在这组中,因为它与LC、GSP和POT的相关系数分别是0.818、0.782、0.754,AMB(事业心)也应在此组中,其相关系数分别是:0.758、0.860、0.784和0.769。进一步研究,发现变量DRV(驾驶水平)和SC(自信心)也在此组中,此组中各个变量的相关系数至少在0.672以上。

    再选择第二组变量,按照同样的原理选择FL(求职信的形式)、EXP(经验)和SUIT(适应性),其相关系数分别是:0.548、0.586和0.693。

    第三组先选择KJ(交际能力)、LA(讨人喜欢),相关系数是0.685,,再选择HON(诚实),它与LA的相关系数是0.645,但它与KJ的相关系数只有0.448。由于全部数据均来自“人”的打分,HON变量分在这组也可以认为是合理的。

    再看看AA(专业能力)、APP(外貌)两个变量,AA变量与其他变量的相关系数没有超过0.5,而APP变量与其他变量的相关系数虽然刚刚超过0.5,但仍地狱其他组内的相关系数。

    最后得到五个分组:

    由于每一组的指标基本上代表了同一组的里,因此,我们先得到各组的得分,即

    最后每位申请者的得分是:

    AVG=(G1+G2+G3+G4+G5)/5

    编写相应的R程序如下:

    >attach(rt)

    >rt$G1<-(SC+LC+SMS+DRV+AMB+GSP+POT)/7

    >rt$G2<-(FL+EXP+SUIT)/3

    >rt$G3<-(LA+HON+KJ)/3

    >rt$G4<-AA

    >rt$G5<-APP

    >AVG<-apply(rt[,16:20],1,mean)

    840397239222

    9.0000008.9714298.9142868.6190488.3904768.2095248.0666678.057143

    241646510201344

    8.0380957.5714297.5333337.3142867.3047627.2190487.2095247.095238

    17141262745321

    7.0761907.0476197.0285717.0190486.9142866.9047626.7333336.695238

    151142618253819

    6.6190486.4952386.3904766.3523816.2190486.2000006.1523815.952381

    371364143313032

    5.9238105.8857145.6857145.3619055.3142865.0476195.0095244.647619

    4733354248342829

    4.5238104.4380954.2571434.2571434.1904764.0476193.2666672.514286

    在分组情况下,前6名应聘者是:8、40、39、7、23和9号。

  • ?

    专业统计分析软件IBM SPSS Statistics v25 中文破解版下载

    白莲

    展开

    SPSS 被称为全球领先的统计分析与数据挖掘大牛,因其精湛的统计产品与服务解决方案而执业界牛耳,是世界上应用最广泛的专业统计和数据模型软件。2009年 IBM 全资收购 SPSS 公司,正式更名为“IBM SPSS”。SPSS 提供了执行全程分析所需的核心功能,易于使用,分析结果清晰、直观,可以直接读取EXCEL及DBF数据文件,它和SAS、BMDP并称为国际上最有影响的三大统计软件。在国际学术界有条不成文的规定,即在国际学术交流中,凡是用SPSS软件完成的计算和统计分析,可以不必说明算法,可见其影响之大和信誉之高。

    SPSS 具有完整的数据输入、编辑、统计分析、报表、图形制作等功能。仅SPSS Base模块就提供了从简单的统计描述到复杂的多因素统计分析方法,如数据的探索性分析、统计描述、列联表分析、二维相关、秩相关、偏相关、一元方差分析、非参数检验、多元回归、生存分析、协方差分析、判别分析、因子分析、聚类分析等常见的分析方法。SPSS 能够读取及输出多种格式的文件。比如由dBASE、FoxBASE、FoxPRO产生的*.dbf文件,文本编辑器软件生成的ASCⅡ数据文件,Excel的*.xls文件等均可转换成可供分析的SPSS数据文件。能够把SPSS的图形转换为7种图形文件。结果可保存为*.txt, word, PPT及html格式的文件。

    SPSS 对初学者、熟练者及精通者都比较适用。界面友好,易于操作,您只需适当的练习,就能够掌握简单的操作分析,因此SPSS特别受专业和非统计专业数据分析人员的青睐。

  • ?

    万字长文测评:3款口碑炸裂的BI数据分析工具,最好用的其实是…

    史胜

    展开

    转载自百家号作者:数据分析不是个事儿

    BI商业智能,这个我安利过很多次。

    作为当下最广泛使用的数据分析工具,它的好处实在太多啦:

    对比Excel、Python、R,不用写代码,不用写SQL,降低了数据分析的准入门槛,小白上手毫不费劲。能快速响应报表需求,准备好数据,出张报表也就是1个小时的事,再不济当取数机器也是极佳的选择。数据挖掘可视化应有尽有,对比Excel,以及开发级的Echarts,简直良心便利,随时随地出报告,直接Pass掉PPT。……

    什么BI分析工具好用?

    这个还真不能一刀切下定论。

    大家听得最多的莫过于Tableau、微软的Power BI,还有我经常推荐的FineBI。

    这3款BI工具各自凭借着可视化、Excel的影响力、以及企业级广泛应用的优势,在市面上都闯出口碑了。而且功能和版本也都在不断更新。

    所以,本文花了3天的功夫,整理了近万字的功能对比,看看这三个产品功能优势和差异究竟在哪里?

    主要这样几个角度考量:

    产品背景数据对接能力数据建模和数据加工数据可视化OLAP计算分析数据挖掘集成应用数据权限管控学习与技术服务一、产品背景

    Tableau即公司名,是最早的一代自助式BI分析工具,一直以来最被人称赞的其可视化,能基于可视化做很多数据分析扩展。

    Power BI是微软的,14年15年开始初见苗头,之前主要是基于Excel的高级功能,包括Power Query,Power Pivot,Power View和Power Map,后来作为Power BI集合推出。

    FineBI源于帆软公司,帆软早期做报表软件,finereport很厉害,在商业领域。后来逐渐发展商业智能BI,目前最新版已迭代到 V5.0。

    讲到产品就要谈谈其定位了,就像介绍人要说姓氏一样。Tableau更多定位是可视化分析的工具,所以可视化很突出。PowerBI有走Excel路子的趋势,发力个人用户,个人数据分析。FineBI更倾向于企业级应用的BI,很多功能都体现其企业级的基因。

    二、数据对接能力

    常规的文件数据如Excel、CSV、TXT等,三者都可以直接导入对接分析。

    传统的数据库例如Oracle、SQLServer、MySQL这三款也都可以直接连接取数分析。

    大数据平台方面,对于现今比较流行的大数据平台如Kylin、Derby、Gbase、ADS、Hbase、Mongodb,Power BI还不支持。这个Tableau、FineBI目前都有接口可以直接对接。FineBI还可以根据数据量以及并发情况选择直连或分布式连的对接方案。

    多维数据库的连接,比如SAP BW、HANA、Essbase等数据仓库,PowerBI还不支持,这块Tableau可以直接连接,FineBI可以通过服务器数据集进行对接。

    FineBI 数据连接

    数据接口开发方面,在一些需要基于java定制的api程序数据集,PowerBI和Tableau都不支持进行对接,FineBI则可以进行对接,基于java api的程序数据集。不过这是国外产品的老子态了。

    Power BI对于一些联机服务器数据源支持的比较好,面向分析,例如Google分析、appFigures等数据。

    三、数据建模和数据加工

    1、数据建模

    首先,三者都是自助式BI,都是自动建模了,这是和传统BI的显著区别之一。打个比方,假设我们要抽取一个数据库的几张表的数据来分析,当导入表时会根据键自动关联,或者手动设置关联联系。

    Tableau建立数据模型属于宽表模型,相当于是在原来元数据表的基础上根据新的关联关系再新生成一个结果集,之后的分析都是基于这个结果集来的,元数据发生变化,除非你手动更新,分析结果也不会有变化。

    FineBI也是类似的原理,不过建立的骨架数据关联模型都是基于元数据的,元数据变化,分析结果也实时变化。

    PowerBI的数据模型建立之后只能针对当前报表进行使用。且在数据源种类整合时,PowerBI无法对不同来源的数据进行实时整合建模,例如下图所示,PowerBI会自动禁用多个数据源的实时建模,需要将数据模式全部修改为抽取数据才可以进行整合关联建模。

    其次,FineBI和PowerBI的数据模式都支持实时和抽取模式,但是抽取模式下,由于FineBI的采用的分布式架构引擎进行数据的列式存储(支持十亿大数据量),PowerBI的数据引擎在抽取模式下仅仅是将数据以行式储存方式导入,所以在面对海量大数据时FineBI比PowerBI计算速度更快、性能处理更加强大。另外在数据编码上,FineBI支持对数据进行多种编码类型转换,PowerBI对这方面的转换是不支持的。

    2、数据加工

    对于数据的清洗加工处理方面,PowerBI提供了一些可视化界面的操作选项,结合M语言和DAX函数,可以进行数据加工处理,但需要用户有一定的公式编码书写能力。

    Tableau Desktop没有系统的数据加工功能,今年最新发布的Tableau prep对数据清洗和数据加工方面做了较大的弥补,从数据清理/调整、检查/筛选数据、联接/合并数据都拥有着比较体系的数据加工策略,可以无缝对接Tableau Desktop使用,不过需要同时安装Tableau Prep和Tableau DeskTop。整体数据工作流还是非常清晰、直观的。

    FineBI对一些有关数据的加工处理功能,统称为“自助数据集”。包括过滤、分组汇总、新增列、合并表、自循环列(可以有树结构的数据进行分层等集团性企业)、行列转换等操作。都可以快速进行处理,且可视化无代码。

    四、数据可视化

    从图表丰富度和可视化报告制作能力来比较。

    1、图表丰富度

    可视化展现能力方面,Tableau最佳,FineBI次之,随后PowerBI。

    Tableau除了常规的图表之外,还有盒须图、标靶图等和分析模型深度结合的图表。FineBI也不弱,常规图表都拥有,在数据地图方面,更是有流向地图、点地图等更实用的图表。PoweBI内置的图表种类相对较少,像玫瑰图、多层饼图、词云图、热力地图、流向地图等,需要进行市场图表拓展下载使用,图形属性方面还算丰富,可以由用户自定义进行图表样式属性的设置调节。

    操作方面,FineBI和Tableau是大差不差的,都是基于著名的图形语法(The Grammar Of Graphics)设计,以“形状“和对应的“颜色“,“大小“,“提示“,“标签“等属性进行图表类型替代。

    在分析区域有两个轴,横轴和纵轴,把所要分析的指标和维度拖拽到两个轴,就会自动出可视化图,图表也是根据分析情况自动给推荐的。

    还支持用户将字段绑定到图表的颜色、大小、形状、标签等属性。这样一来图表的可视化展现能力也就更加丰富灵活了,我们可以通过数据——>图表属性的无限组合,尽情地进行数据可视化认知的探索和洞察。

    Tableau界面

    Power BI就是拖拽图表组件,选定数据的方式来展现。

    2、Dashboard展现能力

    再来看看3个工具的Dashboard展现能力。

    PowerBI首届数据可视化大赛的冠军作品,指标合理呈现,布局直观简洁,秉承微软一贯的方块美。

    FineBI的Dashboard,下图是其中内置的一个比较典型的驾驶舱demo,总体来说更加细腻,柱形图圆角、字体颜色、风格、展现形式等,图表还可以有一些闪烁动效。

    Tableau的可视化更加丰富,有种信息图的感觉,布局也更加自由。

    五、OLAP计算分析

    从OLAP多维能力角度来看,3个工具都支持用户进行钻取、联动、切片、切块等分析操作。

    计算分析能力方面Tableau和FineBI都支持用户进行排名、排序、过滤、同比、环比、方差、标准差、中位数等快速计算操作,但是在一些高级计算例如移动平均、四分位等分析计算场景,Tableau拥有者更加强大的计算分析能力。

    FineBI的快速计算提供现成的同期/环期、同比/环比、排名、累计值、所有值、百分比计算等等,还挺方便的。

    另外Tableau在一些需要进行高级计算的场景下,还支持与Matlab进行集成计算,使用 MATLAB 预处理数据,并将该数据保存到 Tableau 数据提取中以便进一步分析。

    PowerBI大量的计算需要依靠DAX函数来进行运算,有种Excel函数既视感,其实一些常用的计算公式比如同期环期、同比环比像FineBI可以直接快速计算。

    六、数据挖掘能力

    FineBI最新版5.0增加了五类现成的数据挖掘算法,分别为时间序列、聚类、分类、回归和关联规则,还支持R语言的集成。时间序列算法和聚类算法还和图表分析相结合,拖拽操作即可立马看到预测和聚类的结果。

    不考虑时序关联分析

    多元线性回归

    PowerBI目前在数据挖掘这方面没有成熟的分析模块,只是简单的集成了一个R语言的执行脚本组件供用户书写代码集成使用。

    Tableau目前在数据挖掘内置时序分析预测、聚类算法,可进行简单数据挖掘计算处理(类似分类、关联分析、逻辑回归等算法则是没有的),同时也支持与R语言和Python集成以进行深度的数据挖掘分析。

    七、集成应用能力

    WEB级别的集成应用方面,Powe BI开放了丰富的接口供大家集成使用,还支持自定义开发集成第三方图标插件。Tableau和FineBI也有WEB接口,比如进行Iframe网页集成,但是无法进行代码级别的自定义图表开发集成。

    在移动集成应用中,FineBI支持微信集成和钉钉集成,给当今便捷式社交平台的数据分析查看带来了较大的便利,这方面的应用PowerBI并不支持。

    门户集成方面,FineBI开放了单点登录接口,这方面PowerBI暂未直接支持。

    FineBI有专门的一个数据报表管理平台以及运维。

    八、数据管控能力

    数据的权限管控能力方面,PowerBI可以将做好的报表打包发布为组织内容包并且进行指定用户组分配查看权限,并且由管理员进行用户组的行级别权限分配,但是无法控制用户查看的列级别的权限粒度,Tableau也是一样。

    这块是FineBI的优势,之前也在产品定位介绍中提到,FineBI是从企业级应用出身的一款BI,所以具有非常完善的数据权限管控能力。除了提供仪表板的权限分配之外,还能够针对不同部门/岗位/角色的人员进行行/列级别的数据权限管控,使得不同的人能够根据权限限制而只能看到自己的部分数据。另外在针对企业集团数据权限管控方面,FineBI提供了多级管控权限供用户进行多层权限分配,为数据权限管控提供了保障。

    九、学习与技术服务

    Power BI遵循着微软产品相似的理念、原则和体系结构,它也为Windows用户提供了一个简洁熟悉的操作界面,以帮助用户快速适用学习上手。但是,像其他软件一样,它也有其起伏,目前并不是非常成熟,商业选型必须仔细考虑。学习资料方面,关于PowerBI官方的学习资料基础文档还算健全,但是有部分内容是英文的,外部一些Excel社区都各自开了教学课程,但付费居多,这个全靠大家挖掘资料的功力。

    Tableau本身是一款非常成熟的全球化商业软件,拥有着非常强大的数据可视化分析功能。学习资料方面,官网也有很多学习文档、案例、视频等资源供用户进行上手学习。相较而言,Tableau产品学习曲线相对要陡峭一些,因为更加适合有专业数据技术能力的数据分析师使用。国内主要是代理商提供项目实施和技术服务,本土化稍微弱一些。

    FineBI由于是国内帆软的BI分析平台提供商,所以不论是基础的学习文档还是教学视频资料都比较丰富,另外还有着非常活跃的帆软中文社区供所有用户进行学习交流。技术服务方面,尤其是对于企业级别的用户,还会有专业的技术服务团队响应服务,在国内本土化服务做得相当不错。

    最后关键的,价格。

    Tableau个人版有15天免费试用版,过后收费。Power BI和FineBI个人使用都免费。

    商业部署。Tableau光产品,Desktop+Sever,一套一人加税后是11万多,每增加一人多买一个桌面版,就是15000左右,公司体量如果在3、40套,预计得7、80万,不含定制实施和维护服务。Power BI是按设计用户和节点卖的,按年/按月收费。估计了一下,假设200个用户的企业,40个设计用户,1年收费是45万左右,也就是每年要付出这么多,还是比较贵的。FineBI据我了解是类似软件采购买断式的,价格按照功能模块还有并发数定,平均2、30万起,不算服务实施。但这一性价比也远超于前两者了

    个人使用,两者都是免费的。PowerBI毕竟背靠Excel这座大山,和Excel配合使用,大家会普遍觉得习惯。而FineBI又是另一种扁平化的风格,很多计算公式,可视化特效都有现成的,更加自助些。大家不妨都下载试试。

    最后

    作为数据分析师,也是数据产品的爱好者,我呢喜欢把弄各种工具。Tableau的可视化很人性,个人使用就像是Excel透视表的升级版。Power BI除了M语言和DAX语言得心应手比较难,产品操作也都延续了Excel的思想。但是两者共通的毛病,面向企业的产品定制化以及庞杂的报表分析需求,不是特别友好(开发难度太大,报表制作还得依靠Excel)。但这却是国内大多数企业很普遍的需求,这一块不妨青睐于国...

  • ?

    出色的可视化大数据分析软件都有这些功能

    噩梦

    展开

    大家都知道,选购可视化大数据分析软件就是为了通过数字化运营来促进收益。一款出色的可视化分析软件会将各个指标的数据都分析到位,帮助领导做出良好正确的决策。然而,不是所有可视化大数据分析软件都能发挥该发挥的作用。其实,在使用可视化大数据分析软件的过程中,学会几招重要技巧,可以帮助最大程度发挥可视化分析软件的功能。

    可视化大数据分析软件

    采用动态报告

    当企业需要实施商业智能解决方案时您应该考虑动态报告。动态报告可以随意创建,操作和修改。

    它们旨在为企业提供想要的信息。企业可以通过添加、过滤,以及更改信息来控制如何查看数据。

    当企业使用动态报告分析销售指标时,可以按地区,产品或客户细分信息。简而言之,动态报告是直接而直观的。静态分析报告无法提供其相同的灵活性。一旦建立了静态报告,就不能改变其基本结构。

    对于像提交月度报告和季度报告,这可能没有问题,但是,企业将无法深入分析数据。

    自助式商业智能

    在数据分析方面,传统上只有专家能够理解复杂的报告。而另一方面,商业智能使数据分析更加简单。现在任何级别的用户都可以随时轻松访问数据。这就是为什么自助式商业智能越来越受欢迎的原因。它允许人们使用商业智能解决方案来实时研究数据,并自行构建准确的可视化报告。

    选择自助式可视化大数据分析软件,将为企业的工作人员提供易用性。

    可视化分析软件

    移动商业智能

    一个良好的商业智能解决方案应该让用户随时随地访问信息。移动应用的增长和智能手机的能力已经导致移动商业智能(Mobile BI)的兴起。

    根据阿伯丁集团的数据,使用移动商业智能的公司比没有采用的公司有更多的时间获得商业数据。这是一个竞争优势,因为能够做出明智的商业决策。

    行业的认可

    企业应该检查自己正在考虑的商业智能提供商是否具有良好的信誉。 包括业务价值,客户满意度,以及供应商支持。

    着眼未来

    对商业智能解决方案的投资是企业对其业务未来的投资。如果企业选择一个正在向前发展的供应商,其业务也将向前发展。

    以上就是一款出色的可视化大数据分析软件该具备的几个被人忽视的功能。好好掌握这几招,将对你的企业决策有一定的帮助。

多元数据分析软件

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP