- ?
数据分析:浅谈大数据对统计学的挑战和机遇,看完长见识了!
山晴
展开
浅谈大数据对统计学的挑战和机遇
引言 国际数据公司的相关研究指出,2011年全球数据生产量达1.8ZB,且全球信息总量每隔两年增长一倍[1]。在大数据时代下,对于统计学发展而言,挑战与机遇并存,挑战指的是现阶段传统统计学相关方法难以适用大数据,机遇指的是基于统计学,大数据展开数据处理、分析,促使大数据具备可视化特性。由此可见,研究大数据对统计学的挑战和机遇有着十分重要的现实意义。 1.大数据及其目的 现阶段,关于大数据仍旧没有一个十分明确的界定,大数据起初是源自于技术领域。在信息量不断扩大的情况下,使得常规电脑原有存储空间已不能对新处理数据进行承载,新兴数据处理技术得以产生,好比雅虎的Hadoop平台、谷歌的MapReduce等。此类技术能够对僵化层次结构、一致性予以消除,促进数据无需通过常规数据库表格进行排列,极大程度地提升了人们可处理的数据量[1]。
2.大数据与统计学的对比 2.1样本统计与全样本统计的区别 样本统计属于统计学不可或缺的依赖,样本指的是结合相应的概率自总体中随机筛选并视作总体代表的集合内容,值得一提的是随机抽样是需要成本的,包括社会关系、资金成本或者时间成本等。基于样本数量提升有限前提下,样本估计误差会随着总体数量增多而增大,这亦是样本统计无法避免的不足。大数据时代下,收集整理庞大的数据信息应运而生,数据信息发展表现出总体即是样本的态势,该属性很好的消除了样本统计这一不足。大数据时代下的全样本统计,通常情况下可对完全总体进行覆盖,然而受大部分数据属于半结构、半结构数据影响,使得概率论应用遭受一定的制约[2]。鉴于此,将全样本统计应用到统计学中,应当就总体数据展开相应的归纳、筛选,即好比在样本统计中展开数据预处理。 2.2预测分析与非预测分析的区别 统计学的创立,是为了对变量相互相关关系展开分析,因此获取数据是发生于变量确定之后的,数据分析价值是能够被预测的。相较于统计学的预测分析,庞大数据将互联网、传感器作为载体,存在于分析需求之前,因此构建于大数据上的分析多为非预测性分析。在统计学中,出现大数据无法有效应用局面,这是由于不具备非预测分析所需的庞大数据,庞大数据产生与数据中心、存储系统存在紧密的联系,并非短期产生。也就是说,统计学中大数据的应用发展,说明了非预测分析正逐步取代传统统计学预测分析,数据多次利用正逐步取代传统数据一次性利用的。 3.大数据对统计学的挑战与机遇 3.1数据生产、处理与应用的转变
相关统计部门经开展严格的统计设计工作,获得相关的统计数据,数据的预处理分别有数据清洗、非全面数据填补以及数据矫正等。大数据时代下的统计手段尚不十分明确,自大数据流环境而言,要不断探索新型抽样方法,并确保抽样方法的实时、连贯及可行性。除去传统的统计分析方法,还应当开发大数据动态分析、数据流算法等[3]。 3.2大数据时代对市场营销的机遇 3.2.1大数据营销的特点与价值 大数据营销的特点:I.数据采集多平台化特点,即大数据时代下,大数据的数据大多来源于不同的领域、不同的渠道。II.时效性特点,随着信息技术的急速发展,互联网用户消费、购物行为方式往往会瞬间出现转变。国际先进大数据营销企业AdTime基于此大数据营销特点,采取了时间营销措施,即采取相应的技术方式全面获悉用户所需,于第一时间对用户当下的需求进行回应,以使用户在下决心购买的最佳时间及时看到对应的产品广告。III.个性化特点,在大数据时代下,广告商传统媒体导向的营销理念逐步由受众导向取代,现如今,广告商可应用大数据了解用户的地理方位,需求内容等信息,达到对用户个性化营销的目的。 大数据营销的价值:I.升级营销与用户的匹配度,大数据营销不仅可提供给企业了解用户有效的途径,还能够与网络环境下,选取相关技术方法达到对用户精确定位的目的,从而开展好营销工作,升级营销与用户的匹配度。II.改善用户体验,大数据营销促使企业真正意义上认识到用户及其所使用企业产品情况,以给予用户最人性化的提醒。 3.2.2大数据营销的应用 (1)与消费者建立紧密关系 现如今,我国一些企业营销行为仍旧处于个性化定位信息、创意设计阶段,而无法对不同消费者展开个性化的营销活动。大数据时代下,经采用相关数据分析技术方法,基于对消费群体喜好、传媒接触习惯等展开有效的分析,达到特定营销活动明确开展的目的,实现企业精心开展的营销活动精准的辐射至目标消费群体处,与消费者建立紧密关系,极大的改善营销效率、质量[4]。 (2)掌握竞争对手数据 企业通过对竞争对手数据的有效掌握,获悉竞争对手发展状况,基于此帮助企业制定科学合理的产品价格,提升企业产品市场竞争优势。与此同时,企业务必要全面实施以事实为前提的决策手段,广泛地应用数据分析方式对企业每一个发展运营步骤进行优化,经对企业一系列数据的充分优化、对接,促使业务环节中潜在的价值得以被有效挖掘,降低生产成本,知己知彼,促使企业在日趋白热化的市场竞争中占据有利位置。 (3)挖掘企业内部数据 “市场未动,数据先行”俨然转变为国际上企业有效运营发展的一致认识,为了提升企业管理效率,要求企业要充分挖掘企业内部数据,并展开有效的整合、分析,以为企业相关人员做决策提供有利的参考依据,提升决策准确性,促进企业可持续发展。
3.2.4 企业的应用案例——以亚马逊为例 在应用大数据开展市场营销方面,美国亚马逊公司一直处于领先地位。亚马逊研发出“用户未下单,先发货”功能,即结合用户的购物需求数据信息,分析用户想要购买的产品,达到用户未下单,提前发货的目的。此外,亚马逊通过对用户检索信息的分析,评估流感的传播,但这仅仅为海量检索数据中的一项用途,相同的数据能够应用于预测大选结果、预测某类产品市场行情等等,极大地降低了统计成本[5]。 3.3大数据时代对市场营销的挑战 3.3.1信息收集 大数据并非就是对数据信息展开盲目的收集,即便收集了再多的数据,倘若这些数据并非是市场营销所需要的,如此便会导致前期收集来的数据信息,变成一堆“数据垃圾”。鉴于此,为了避免这一情况发生,务必要充分分析业务需求,再对自身存在价值的数据展开收集、归纳,如此方可实现大数据的有效收集应用。 3.3.2经验与数据 数据采集完毕后,面对参差不齐的数据,还应当做好数据评估工作,评估对何种目标受众开展市场营销工作。鉴于此,要求采取科学合理的手段,将这些参差不齐的数据整合成可被市场营销实践应用的,经结合过去的经验,与采集数据进行有机融合,实现对目标受众的有效分析确定。 3.3.3分析与优化 数据分析,一方面是实现数据优化,一方面是进行决策层面上的调整、转变。此环节对于专业人才的需求提出了严苛的挑战。数据分析、数据优化对于专业人才的知识框架要求大不相同,这要求相关企业不仅要培养专业的数据分析人才,还要打造数据优化人才队伍。
3.4大数据营销的未来发展趋势 信息技术不断发展,单一媒体导向的“消费者碎片化”俨然无法达到企业对于数据多样性的需求。大数据时代下,媒体的跨界融合实现对“碎片化”受众的充分聚合。在科学技术技术不断进步的背景下,跨媒介、跨平台、跨终端的多途径将不断被开拓,将使庞大的数据信息获取多维度的整合,并且在多样化网络环境下,消费者主观信息与客观数据有机融合,构筑全面用户数据库环节,将成为未来大数据营销发展的必然趋势[6]。 4.结束语 总而言之,大数据为传统统计学带来了严峻的考验,也为传统统计学有效发展创造了良好的契机。在大数据时代发展潮流中,我们应当充分的认识到大数据对于传统统计学而言,是补充而不是更替,构建于样本统计、预测分析内容上的传统统计学,仍旧于社会统计、经济分析中占据着主导位置。大数据时代下,为了实现企业市场营销的有效开展,相关人员务必要不断专研研究、总结经验,全面分析大数据与统计学的对比,充分认识大数据对统计学的挑战和机遇,“与消费者建立紧密关系”、“掌握竞争对手数据”、“挖掘企业内部数据”等,积极促进企业市场营销的科学合理化。
- ?
十个例子,教你用统计学方法高效完成机器学习项目(上)
尔槐
展开
统计学和机器学习是两个联系特别紧密的领域
事实上,这两者的界限有时候非常模糊。然而有一些明显属于统计学领域的方法,不仅可用于机器学习的项目,并且极具价值。公平地说,需要统计学方法来有效地完成机器学习预测建模项目。
问题架构:
这包括了问题类型的选择,例如是回归还是分类,也许还有这个问题的输入和输出的结构及类型。问题的架构并不是一直都很清晰,对于某个领域的新手,可能需要对这个领域中的观察值进行一些深入探索。
统计方法在问题的架构阶段有助于对数据的探索,其中包括:
1、探索性的数据分析。为了从数据中探索到特别的观点,从而进行的汇总和可视化。
2、数据挖掘。自动探索数据间的结构关系和模式。
数据理解:
数据理解意思是对变量的分布和变量之间的关系有一个更详细的理解。这些知识其中一部分来自于这个领域的专业知识,或者需要专业知识去解释。
用在理解数据的统计学模型的两类主流分支是:
1、汇总统计。使用统计数值来汇总变量间的分布和关系的方法。
2、数据可视化。总结变量间的分布和关系的方法需要用到可视化的方法,例如:图表,绘图和图形
数据清洗:
虽然数据是数字化的,但存在一些过程会降低数据的精确性,反过来,后续用到数据的过程及模型也会受其影响。例如:数据破坏、数据损失、数据错误
识别和修复这些问题数据的过程也叫做数据清洗。
统计方法应用于数据清洗中例子有:
1、异常点检测。在数据分布中识别出离期望值很远的观察值的方法
2、数据填补。修复或填补观察值中损坏或缺失数据的方法
数据选择:
在建模时,不是所有观察值或所有变量都是相关的。减小这些元素的数据范围的操作对于做出预测值是很有用的,这个过程叫做数据选择。
应用在数据选择的两种统计学方法:
1、数据采样。从较大的数据集中系统化创建较小的代表性样本的方法。
2、特征选择。自动识别与结果变量更有相关性的变量的方法。
- ?
数据分析:浅谈统计学在生活中的应用,看完长见识了!
Mainz
展开
浅谈统计学在生活中的应用
统计学并不是一门独立存在的学科,它是以数学知识和数理统计作为基础,将数理统计方法和其他学科专业知识交叉融合形成的具有极强推断性的一种分析方法。现阶段,随着科学技术的快速发展,为了加强对自然社会各个领域现象的判断和整理能力,将统计学应用在生活各个方面已经成为现阶段的数理统计的一种便捷方法。
一、统计学的概念 统计学指的是调研人员通过一些列的手段对整理出来的数据信息进行整理分析,从而推断出调研对象本质,甚至可以对未来的类似事情进行预判的一门综合性学科。在进行统计学整体分析的过程中需要用到大量的数学知识以及其他相关学科的专业知识,统计学由于其自身独特的性质,在社会科学和自然科学的各个领域几乎都可以使用。 二、统计学在生活中的应用分析 (一)统计学在经济学中的重要应用 运用统计学对生活中的数据信息进行整理分析,首先要学习统计学的基础知识以及数据统计个分析等学科,这些基础知识和方法都是在开展统计学应用活动之前调研人员所必须掌握的。统计学课程的学习作为经济学学科当中的重要分支,在经济学课程中经常被应用,例如,经济学的计量统计就需要根据统计学在金融里面的重要意义和地位作为基础,将金融知识和统计学知识相结合,将金融计量和时间的序列进行结合,对收集到的金融数据进行整理分析,最后得出金融计量和时间序列的一定关系。 统计学在金融经济学中有着十分重要的工具性作用,主要包括两个方面,分别是:在思想上而言,统计学是对数据统计分析结果进行研究,最后得出研究对象的判断结果,为了保证研究结果的准确可靠性,统计学在进行数据整理分析过程中必须是带着严谨的科学态度,这种严谨的科学态度对于经济学的相关理论分析具有十分重要的指导地位,这是由于研究人员在对金融量进行数学分析的过程中,为了保证金融数学分析结果的准确可靠性就必须保证金融量数据收集分析等预处理过程是科学合理的;其本收集整理次,统计学是经济学进行科学试验研究最优化的选择,经济试验研究活动的多样性以及研究对象之间错综复杂的关系导致经济学的试验研究活动受到诸多限制,运用统计学进行经济学试验研究活动,使得经济学实验研究的对象变得简洁明了,降低试验研究的成本支出。从统计学在经济学中的应用我们可以看出,经济学当中的统计学应用主要是运用了统计学当中经济必然性的思想,使得经济学当中的统计结论不具备复杂的思想成本。
(二)统计学在医学中的重要应用 统计学在医学中应用的主要原因就是生物医学中存在的不确定性和变异性。生物医学主要的研究目标就是与人体健康相关的不确定因素,也就是通常所说的医学变异现象,变异现象在生物体当中是普遍存在的,例如,对于外在条件基本相同的两个病人,在相同的条件下进行治疗时,却有可能出现有的病人被治愈,有的病人治疗效果不明显,甚至还会出现死亡的现象。造成这些外在条件相同的生命体却出现不同程度治愈的主要原因就是生物医学中存在的不确定性或者是人体中存在的错综复杂的随机因素,客观差异存在的原因是因为某种偶然性的潜在的揭露必然性的发现。 在医学临床统计中发现,对于同一种病因的客观性规律进行调查,对于健康人的共同作用的交织与疗效的考查的病人很少。在医学当中运用统计学最主要的就是通过观察不同疗效病人的医疗诊断效果,将实际的医学诊断治疗效果与医学理论和假设进行验证,运用概率论以及数学方法对对比结果进行分析、判断,运用电子计算机等相关软件设备对研究对象的指标进行记录,并绘制相应的图表等,通过综合运用多种数理统计方法,得出与研究对象相关的研究结果。将统计学应用到医学当中,可以促进统计方法和多变量分析法在医学试验研究中的应用,对未知病因所造成的医疗诊断事故进行分析,可以促进医疗诊治手段的不断创新發展。
(三)统计学在体育比赛中竞技指标的应用。 统计学在体育比赛中的应用主要是用统计的职业联赛的数字反应比赛队伍能否成为世界顶级,这是因为在体育比赛中应用统计学可以对比赛中的胜率进行分析,主要是将每个队员在每个赛季比赛的分数和常规赛场上的分数进行统计,通过一系列的数学计算分析,制定出每个队员得分平均值和标准差之间的正态分布图,通过正态分布图的稳定性来判断队员的技术稳定性。以众所周的NBA篮球比赛为例,NBA比赛中由于明星球员众多,在运用统计学进行数据整体分析时,需要依据本质上的规律进行数据统计,而不是随意的选择数据进行统计,例如在进行篮球比赛发球这一项双方队员的进攻和防守的概率时,在进行指标选择时就涉及到随机事件的发生概率,因此,可以运用统计学统计球员在每一场比赛上的均得分,通过这些数据指标的正态分布图来确定球员的技术稳定性。 三、结束语 在日常生活中应用统计学对数据进行管理分析,可以极大提高生产生活中对研究对象的管理效率,使得研究对象变得明确,降低管理成本。在实际的生产生活中应用统计学时,调研人员需要通过多次的试验和随机概率对比来确定事件发生的概率,通过定量定性的数理统计分析工作,充分发挥统计学对生产生活的促进作用。
- ?
数据分析:构建新的统计学专业课程体系的改革实践,看完长见识了
小情操
展开
互联网融合下构建新的统计学专业课程体系的改革与实践
桂林理工大学应用统计学专业在互联网融合新形势下,采取边研究、边实践的方法,对应用统计学专业课程体系进行了改革与实践,在研究中及时将研究成果运用到教学实践中,其研究成果将对互联网新形势下,培养适应我国经济发展、具有理论和实践的统计人才,特别是对广西的统计学教育以及广西的经济发展起到积极的推动、示范作用。
一、构建新的课程体系 在互联网融合下,首先要让学生拥有扎实的数理基础和极强的应用能力,才能让学生尽快地学会、适应互联网融合新形势下社会各个层面對应用统计学专业学生的新要求,并考虑到广西本区经济社会及生源特点的具体情况,我们将应用统计学定位于方法论的科学,确立专业服务方向和培养目标为:适应互联网融合新形势,为全社会进行宏观调控、微观管理和科学研究培养搜集、传输、管理、加工和开发信息的统计信息产品的生产者与管理者。然后,紧紧围绕学科定位与专业培养目标,对课程体系收集整理进行系统的改革和不断完善,并制定相应的培养方案。 我们构建了新的课程体系,对应用统计学与互联网进行了科学的融合。融合的脉络是,以厚实数理为基础,以经济学典型问题为主要媒介及辐射源,以统计方法与互联网计算机技术为手段,去诠释统计方法论的思想及应用。 二、教学模式与手段改革 新的课程体系确定后,如何实现是个关键,在充分论证统计数理抽象性及当代大学生特点的基础上,根据数理基础课程难学,统计学专业课程内容多的特点,我们提出了“抽象理论形象化,教学手段多样化”的实现路径,对教学模式与手段进行了全方位的改革。 (一)多媒体辅助教学为新课程体系提供效率保证 多媒体辅助教学信息量大、形象、直观,在统计学专业课程教学中的应用使得原本传统教学模式无法完成的新课程体系,能按质按量完成。我们根据教学中的具体情况设计与制作多门课程的多媒体课件,其中包括《统计学》《线性代数》《多元统计分析》《实用回归分析》《时间序列分析》《金融工程》《保险精算》等,并及时将这些课件结合传统教学方法应用到教学实践当中,取得很好的效果。利用多媒体技术,拓宽了教学内容的深度和广度,大大增强学生的参与感和实践能力,创造出传统教学手段所达不到的效果。解决了现代统计学所面临的“学时少,内容多”的问题。 (二)把新的教学模式与教学手段运用到课程建设之中 在改革、完善课程体系的过程中,我们紧紧围绕本项目改革目标,及时把新的教学模式与教学手段运用到课程建设之中。 我们以精品课程为龙头,全面带动了课程建设。在建设过程中,使教学内容及时反映统计学科领域的最新科技成果,广泛吸取先进的教学经验,积极整合优秀教改成果。精品课程不仅起到了良好的教学示范作用,更重要的是吸引了任课教师专心、专注于教学工作。 (三)加强案例教学,使学生能轻松上手,领悟统计理论 在统计学理论与实际应用的结合越来越紧密的背景下,案例教学就尤为的重要,一些典型的案例,通常能使得学生能迅速领悟统计理论与方法。为了加强案例教学这一实践环节,在没有适合我们课程体系教材的情况下,项目组成员结合近年来的教研积累和新的课程体系、培养方案等,在专业课程《多元统计分析》《试验设计》《统计模型》《统计软件》《应用时间序列分析》《非参数统计》《统计学导论》《实用回归分析》等都融入了案例教学。编著了《统计学案例分析》讲义。通过案例模块教学,实现了统计理论与实际操作的有效互动,实际教学效果良好。 (四)针对新课程体系,创建网络配套教学平台,开创学生的第二课堂 随着互联网、校园局域网的普及,我们逐步创建网络教学平台,目前,在这个平台上建立了新的课程体系的课程信息资源库,提供丰富的学习资源,实现开放式教学和学生自主学习相结合格局。教学平台配备的主要内容包括:(1)教学大纲(2)教材、教案(3)补充学习资料(4)教学案例(5)实验项目(6)习题和作业(7)多媒体教学软件(8)文献(库,论文)等。
网络教学平台的建立,丰富了现有的教学模式和教学手段,有力地推动课程体系改革。使得传统板书教学、多媒体课件教学、案例教学以及网络教学相互结合,相互补充。 (五)实践教学改革,强化实践能力的培养
培养学生的应用能力与创新能力是我们改革的目标之一。而学生的实际动手能力以及创新能力能否得到提高,主要看是否有一套设置合理的实践教学环节。针对我们新的学科定位、课程体系以及培养目标,我们对实习实践教学环节做了以下改革。 1.实验教学的改革,对实验室实行动态管理,定期试验与开放实验相结合。同时整体上加大了实验课时的比重,依据“抽象理论形象化”的改革理念,我们在很多纯理论课中穿插课程实验,旨意使学生对一些较抽象的理论与方法有更形象的理解。主要有:在线性代数与空间解析几何中安排了6个项目实验,主要使用计算软件Matlab,重点是通过编程过程更深入理解其中的符号、公式的内涵及算法的实现过程;统计学导论引入5个实验项目,使用大众化软件Excel让学生掌握数据收集、整理与分析的基本功能;应用回归分析安排5个项目的实验,完成一元回归应用、多元回归、模型分析及岭回归等;多元统计分析课中安排了6个实验项目,使学生掌握聚类分析、判别分析、因子分析及典范相关分析等;应用随机过程中增加了3个实验课,即泊松过程布朗模拟、布朗运动模拟及齐次马尔可夫过程模拟。同时,不依附于理论课而独立开设实验课,按演示实验、综合实验、设计实验三个层次组织教学,编写实验指导书。适当减少验证性实验,增加综合性、创新性实验,增加选做实验。并把在不断的改革实践中的经验、成果编写出版统计学实验教材《统计实验》。 2.实践教学是统计学专业教学过程的一个必不可少的重要环节,在培养学生专业素养方面具有不可替代的作用。我们采取专题教学、科技立项、社会调查、统计实习、毕业论文等相结合的方法培养学生的学习能力、协调沟通能力、创新能力和创业能力。 根据我们新制定的统计学专业人才的培养目标和培养规格要求,结合我系多年的实践探索,我们建立了国家统计局桂林调查队、桂林市统计局等9个统计学教学实习基地;我们的学生经常被邀请参与实质性的统计工作如经济普查,社会调查等,得到了实际的锻炼。学生的毕业实习论文90%以上的选题都是来源于实际问题,通过运用所学基本统計理论知识,选定有效的统计方法,建立模型,提高学生对实际问题进行合理的分析、解决的能力。
三、学生综合能力全面提高 (一)学生的创新能力强 通过本项目改革、实践,学生拥有扎实的数理基础,丰富的统计应用能力,既懂统计又懂计算机和网络,具有较强的创新能力。 (二)生源充裕、就业率高 我们的毕业生受到了社会和用人单位的普遍欢迎和好评,这几年我们的就业率都在95%以上,且单位出现多样化,不仅有统计、经委等政府机关,还有银行、证券公司、保险公司、集团公司和各类企业单位。由于生源充裕,招生人数由开始每年一个小班约35名,增加至现在每年4个小班约140人。 四、教师素质能力全面提高,教学建设成果显著 激励了教师提高教学水平、参与教学改革的积极性,涌现出包括广西高校教学名师等优秀教师和系列优秀教学成果。把统计学学科建成广西重点学科和广西高等学校优势特色专业,以及把应用统计实验室建成广西高等学校重点实验室。 本研究成果和十多所高校进行了广泛的交流、沟通、推广辐射,许多院校的统计学专业老师多次邀请我们去传经送宝或到我院了解、学习我们的改革经验。本文针对互联网融合新形势下应用统计学专业课程体系进行了综合改革与实践。所获结果对互联网融合新形势下应用统计学本科专业教学改革和学生综合能力培养具有借鉴作用。
- ?
十个惊艳数据行业的可视化案例
苻晓蕾
展开
数据是非常强大的。当然,如果你能真正理解它想告诉你的内容,那它的强大之处就更能体现出来了。通过观察数字和统计数据的转换以获得清晰的结论并不是一件容易的事。必须用一个合乎逻辑的、易于理解的方式来呈现数据。
图表是一种美观而强大的工具,可以帮助我们探索和诠释这个世界。数百年来,人们一直在使用图表来解释跟数据相关的种种。通过下面的12个有趣的例子获得启发,它们是既注重风格和也注重内容的数据可视化案例。
1. 地球
地图应该是最早形式的图表。下面的地图分别由马丁·瓦尔德泽米勒(Martin Waldseemüller)在1507年,亚伯拉罕·奥特柳斯(Abraham Ortelius)在1570年和伊曼纽尔-鲍文(EmanuelBowen)在1744年制作完成的。
2)世界上的语言
这个由DensityDesign设计的互动是个令人印象深刻的成果,它将世界上众多(或者说,我们大多数人)的语言用非语言的方法表现出来。一共有2678种。
3欧洲城市发展图
法国数学家和防御工事主任Charles De Fourcroy于1782年绘制的这张图表,以城市广场和城市总面积的比例作为一个参考标准,对欧洲几个大都市的城市发展状况进行了比较。
4)按年龄段分布的美国人口百分比
这是如何以令人信服的方式呈现一种单一的数据的好榜样。Pew Research创造了这个GIF动画,显示随着时间推移的人口统计数量的变化。这是一个好方法,它将一个内容较多的故事压缩成了一个小的package。
5)美国风图
下面是是个类似感恩节航班的可视化图,除了图中显示的时刻,它还能实时显示美国本土的风速和风向。它是直观设计的一个很好的案例:风速用线条移动的快慢来表示,方向通过线条移动的路径来表示。它会即时显示美国风向的总体趋势,无需任何数字,除非你在地图上点击鼠标。另外,使用时设定最多两个变量会使它更容易操作。
6南丁格尔战争医疗分析图
1858年,著名护士和统计学家Florence Nightingal,为不懂得传统统计报表的公务人员绘制这张玫瑰图,它显示了因病与因伤死亡案例对比数字。此图引起了军方及维多利亚女王的高度关注,医事改良议案得以实施,改善了医院的卫生状况和病人的营养情况,有效减少了战事医院的死亡人数。
7法国军队征俄路线与气候变化图
1969年,Charles Minard做了一张图表,是1812年拿破仑率军攻占莫斯科的行军图,显示了军队规模的缩减。在顶端较粗的线代表了从波兰到莫斯科的行军规模变化。下方的细深色线则代表了撤退时的军队规模。展示了在恶劣天气的影响下,法军由422000名士兵减少到10000名的过程。底部线条是温度和时间刻度,而整个图形分布展示了行军距离。
8伦敦霍乱地图
这是1854年由John Snow医生制作的霍乱死亡病例地图。这张可视化图揭示了死亡病例和病源(水泵)之间的关系,指导相关部门以此为参考部署医疗方案,有效的减少了霍乱的感染人数。
线条代表街道。黑色的长条代表了所在街区死亡的人数。圆点代表抽水泵。特别注意在宽街 (Broad Street)上的抽水泵周围的死亡人数相对集中。
雪诺用他的这幅地图佐证了他极富争议的理论:霍乱是由被污染的饮用水传播开来的。当政府关闭了宽街上的水泵,霍乱的蔓延也平息了。引发霍乱的病菌最终由德国物理学家罗伯特·科赫(Robert Koch)在1883年分离出来。
9)政治新闻受众渠道分布图
据Pew研究中心称,通常,当设计师在信息内容很多又不能删节的时候,他们通常会把信息放到数据表中,以使其更紧凑。但是,他们使用分布图来代替。为什么呢?因为分布图可以让观众在频谱上看到每个媒体的渠道。在分布图上,每个媒体的渠道之间的距离尤为显著。如果这些点仅仅是在表中列出,观众无法看到每个渠道之间的比较。
10为什么会有“巴士群”现象
这里有一个关于复杂数据集的很好的例子,它看起来感觉像一个游戏。在这个例子里,Setosa网站为我们呈现了“巴士群”现象是如何发生的,即,当一辆巴士被延迟,就会导致多辆巴士在同一时间到站。
只用数字讲述这个故事是非常困难的,所以取而代之的是,他们把它变成一个互动游戏。当巴士沿着路线旋转时,我们可以点击并按住一个按钮来使巴士延迟。然后,我们所要做的就是观察一个短暂的延迟如何使巴士在一段时间以后聚集起来。
- ?
SPSS统计分析案例大集锦,全在这里了
千百度
展开
读者朋友们,为了方便大家自学SPSS统计分析,小兵把本号原创发布的统计方法案例,由浅入深全部归纳整理在此篇文章中,请各位收藏。
↓
↓
SPSS统计分析案例:生成随机数
SPSS统计分析案例:箱图
SPSS统计分析案例:误差条图
SPSS统计分析案例:可视离散化
SPSS统计分析案例:别把排序不当回事儿
SPSS统计分析案例:快速统计样本缺失
SPSS统计分析案例:配对样本T检验
SPSS统计分析案例:独立样本T检验
SPSS统计分析案例:卡方检验(2)
SPSS统计分析案例:卡方检验(1)
SPSS统计分析案例:无空白列正交试验设计
SPSS统计分析案例:KS单样本检验
SPSS统计分析案例:游程检验
SPSS统计分析案例:2*2交叉表分析案例
SPSS统计分析案例:正交试验设计
SPSS统计分析案例:一元线性回归
SPSS统计分析案例:多重响应分析案例
SPSS统计分析案例:复本信度
SPSS统计分析案例:多维尺度分析
SPSS统计分析案例:TwoStep二阶聚类
SPSS统计分析案例:K-means聚类
SPSS统计分析案例:聚类分析
SPSS统计分析案例:因子分析
SPSS统计分析案例:主成分分析
SPSS统计分析案例:最优尺度回归
SPSS统计分析案例:多项logistic回归分析
SPSS统计分析案例:生存分析之寿命表
SPSS统计分析案例:对应分析
SPSS统计分析案例:多层感知器神经网络
- ?
数据分析:统计学中一体化教学的运用,看完长见识了!
街角
展开
统计学中一体化教学的运用
据IT、互联网行业对统计类人才需求较大,占全部调研行业需求的35%;同时,约有1/5的用人需求体现在金融行业;房地产行业与服务业分别占1/10。结合上述行业自身特点与用人需求比例,统计类人才招聘主要集中在新兴行业,其中以技术类互联网行业为首。上述25542个统计相关岗位中,对高中以下及硕士以上学历员工需求较少,均不足10%;专、本科学历员工需求量较为突出,占全部需求的近4/5;其中,约有11622个岗位要求大专及同等学历,即符合高职高专学历的岗位约占全部岗位的45.5%。根据企业招聘岗位对学历要求,高职高专学生符合近50%岗位需求。
从统计类人才岗位分布看,统计类相关岗位辐射了各个行业、各个部门,充分体现出企业对于人才需求的多层次、多样化。同时,统计技能在公司内部各岗位有着不可或缺的地位。根据智联招聘网站数据),企业对统计专员岗位需求量尤为突出,占全部岗位比重的近1/2。通过对上述岗位的岗位职责的具体分析,低层次统计人员,如统计专员岗位,在企业内部大多从事简单的数据资料收集、录入及报表汇总等技能性工作,工作中基本不涉及统计算法研究;相反,对中高层统计人才需求量相对较小,主要集中在管理岗及部分高端技术岗位,如数据经理、数据分析专家、首席数据官等。这些岗位要求员工掌握夯实的统计理论、扎实的统计算法技术及具备丰富的从业经验。通过上述职业岗位群分析,目前就业市场需要更多掌握统计技能而非专业统计理论算法的人才。因此,掌握基本的统计技能是学生毕业后迈向社会求职的基础。 一、理论实践一体化教学法在统计课中的改革
通过对课程内容的模块化,把理论知识教学与技能训练相结合,以突出培养学生的职业技能为本。课程内容与要求、进度与教学环节设置均满足职业技能训练。21世纪是知识经济高速发展的时代。当下需要更多掌握新技能、适应新形式的高素质实用型人才。学校作为学生的良师益友、企业的合作伙伴,必须准确定位,根据社会需要和自身特点,在顺应时代发展、迎合企业用人需求的基础上,突出职业教育特色,培养出既有理论知识,又有较高实际操作能力的复合型高技能人才。传统统计学的纯理论教学已不适用。课程教学重心应偏向实践,做到理论结合实践,狠抓学生能力培养。 (一)改革课程结构。 传统学科型培养模式与企业用人需求之间的差距,体现出学生动手能力弱,综合能力差,适应工作岗位慢等短板。通过调研,统计类岗位需要学生了解统计学的基本概念,掌握统计数据的采集、整理、描述方法,熟练绘制统计图和统计表。根据岗位要求,将上述统计学课程知识转化为正确数据采集能力、准确信息分析能力、灵活软件操作能力,意在培养学生基本职业素质——数据敏感力、市场洞察力、统计分析的严谨力及吃苦耐劳精神。理论实践一体化教学打破了传统的章节式教学模式,改为知识模块式与操作模块式同行的教学方式,着重培养学生运用专业知识解决实际问题的能力。知识模块主要介绍统计的产生、发展,统计的研究对象、基本概念等。操作模块是通过Excel、SPSS等配套统计软件,集中讲解统计调查实施、数据整理、指标计算、统计分析报告的撰写等内容。这种模块式教学做到了以学生职业技能与就业能力为基础,教学计划以企业岗位要求为基础,配以大量现场教学,教学进度因学生自身而设定,教师起辅助指导作用,立足学生全面素质的提升。
(二)突出能力培养。 理论实践一体化教学法引入案例教学,鼓励学生独立思考,引导学生由注重知识到注重能力的转变。教师运用PDCA循环对案例教学进行有效控制。P(Plan)——计划:精选案例;D(Do)——执行:讲解案例、拓展案例;C(Check)——检查:评价教学;A(Action)——处理:发现问题,改进案例;在案例教学实施中,通过优秀案例展示,学生首先对案例产生学习兴趣。教师对案例进行重点、难点讲解后,学生明确了学习目标。通过案例学习,学生加深对教学内容的理解,学会模仿案例,自主研究,以达到锻炼学生思考问题、分析问题的能力。 二、改革的反响 (一)理论实践一体化教学法适用于统计学课程。 理论实践一体化教学法在统计课程中实施后,教师感触颇深,学生反响强烈。教师不再被课程章节束缚,不再按照教材照本宣科,能够根据模块需要,从每名学生实际出发,进行贴近学生的有针对性教学,从根本上实现了“宽基础”、“活模块”。与此同时,社会调查、模拟角色扮演等教学形式很好的融入模块教学,教师的身份逐渐转变为教练,更多的从事辅助、指挥、控制工作,为学生实践活动中遇到的难题答疑解惑。此外,案例教学有效的督促教师日常养成收集积累优秀案例的好习惯,做到针对不同基础学生,灵活运用不同案例,真正实现分层次教学。通过学生课堂参与度、课后访谈及部分参与企业实践学生的反馈,学生通过理论实践一体化教学法,激发了学习兴趣,充分发挥了学习的主动性和积极性。在培养自身分析问题、解决问题能力的同时,锻炼了语言表达能力和人际交往能力,增强了团队意识和吃苦耐劳精神,全方位提高了学生的综合素质和岗位胜任力。部分学生先后参与了“绿色环保、节能减排”大赛,把统计学技能运用到赛中,获得市较好名次。
(二)实际教学中还存在一些问题。 每一种改革都是尝试性的,并非能做到一步到位。理论实践一体化教学法也不例外。在实际教学过程中缺乏技能操作部分的教材。目前相当一部分统计学教材依旧按照知识体系编写。章节间并不是按任务进行划分,没有把学生的能力培养放在首位。即使实际教学活动中应用理论实践一体化教学法,教学设计以职业岗位要求为基础,由于缺乏相应配套的技能训练指导书,也给模块教学带来很大不便。技能模块实施的任务与企业实际岗位的工作任务相一致,这就需要传统统计学教材进行适当修订,与之同步。综合案例的缺乏也是理论实践一体化教学中的一个障碍。每位教师都希望找到一个真实的综合案例,贯穿整个教学过程,把所有教学环节融入到该案例中。但由于企业经验不足及行业数据的保密性,在目前课上很难见到从一而终的案例。
- ?
数据分析:统计学教学中存在的问题与对策,看完长见识了
Duke
展开
统计学教学中存在的问题与对策
目前统计学已在各行各业得到了广泛的应用,特别是在大数据时代,人们的生产生活已越来越离不开统计学。由于统计学如此重要,教育部将统计学规定为经济类和工商管理类本科专业的专业核心课程。但是,当前统计学的教学还存在诸多问题,从而使统计学的教学效果大打折扣。本文将结合笔者的教学实践,对统计学教学中存在的主要问题进行分析,并提出相应的对策,期望对统计学的教学改革工作提供一点思路。 一、统计学教学中存在的主要问题
1、在教学过程中忽视对数学知识的复习 当我们在统计学的讲授过程中涉及到概率分布、假设检验以及矩阵运算等知识点的时候,很大一部分学生表现出茫然的神情,表明学生在学习统计学的时候,已经对过去所学的数学知识有所遗忘。《计量经济学》教材一般都会有一个数学附录,可以帮助学生用较短的时间对关键的数学知识进行复习。《统计学》教材一般没有这样的数学附录,统计学教师也不会专门给学生复习相关的数学知识,而这些数学障碍恰好是导致学生学习效率低下的主要原因。中国有句俗语“磨刀不误砍柴工”,因此笔者认为在进行统计学这门课程的教学时,有必要专门安排时间对学好统计学必需的数学基础知识进行复习。 2、在教学过程中忽视案例的运用 统计学是一门实践性很强的学科。统计学中的每一个知识点都是与实践相联系的,比如均值、标志变异度这些看似简单的知识,都包含了丰富的实践意义。而有些教师在上课的时候,主要教学生如何去计算相关的统计指标,把统计学当作一门数学课程来教,学生也把统计学当作数学来学。教师在教学中忽视了对实践收集整理案例的运用,导致学生不能真正理解相关知识点的真正含义,从而觉得统计学又枯燥、又难学,并失去了学习的兴趣。 3、理论讲解与统计软件教学脱节 统计学是一门实践性很强的学科,即学生从统计学中学到的知识是完全可以应用到工作实践的。与教科书中的例题不一样,在工作中所得到的数据的样本容量一般都很大,这就需要通过相应的统计软件来进行处理。据笔者了解,许多高校在安排统计学这门课程的时候,一般安排十六周左右的理论教学,另外安排两周实践教学,在实践教学环节主要是学习SPSS软件。我们认为,这种教学安排并不能很好地促进统计学的教学,其理由主要有两点:其一,理论讲解与统计软件的教学完全脱节。由于是在理论学习完全结束之后才开始教学生进行软件操作,学生可能对学过的理论知识已经遗忘,在学习软件操作时,只是进行机械性的操作,而不明白每一步操作的真实含义。其二,学习软件操作的目的并不是为了简单地进行数据处理和数据分析,事实上通过软件的学习还能促进对理论知识的理解。而像这种教学安排,是先学完理论之后,再学习软件操作,就不能很好地起到通过软件操作促进理论知识学习的目的。 二、提高统计学教学效果的对策
1、注重案例的讲解 由于统计学的实践性很强,我们可以从生产生活中找到许多案例来帮助提高统计学的教学效果。通过合理地运用案例,既可以增进学生对统计理论的理解,同时又能提高学生学习统计学的兴趣。下面将具体介绍笔者在讲授假设检验时是如何通过案例的讲解来增加学生对统计学知识的理解以及提高学习统计学的兴趣的。假设检验是统计学教学中的重点和难点。假设检验是利用样本提供的数据资料来检验事先对总体某些数量特征所作的假设是否可信的一种统计方法。当对总体参数的真实性感到怀疑,需要通过样本来考察其正确与否时,往往借助于假设检验作判断,从而决定接受或拒绝这一假设。 笔者在讲授这部分内容时,引用了吴喜之在其《统计学:从数据到结论》一书中的一个案例。其内容是:如果一个人要证明他从来没有骂过人。他能够证明吗?要证明他没有骂过人,他必须出示他从小到大每一时刻的录音录像,所有书写的东西等等,还要证明这些物证是完全的、真实的、没有间断的,这显然是不可能的。 反过来,如果要证明这个人骂过人很容易,只要有一次被抓住就足够了。这就相当于假设检验中的反证法。在假设检验中,一般要设立一个原假设,比如可将“从来没有骂过人”设为原假设,设立该假设的动机主要是企图利用人们掌握的反映现实世界的数据来找出假设与现实之间的矛盾,从而否定这个假设。如否定不了,说明证据不足,无法否定原假设。许多学生说他们在学习《概率论与数理统计》这门课程时,虽然也学过假设检验,但是从来没有真正明白假设检验的含义,而通过对这个案例的学习,他们对假设检验有一种豁然开朗的感觉,并且觉得统计学原来这么有趣。 另外,对于假设检验中的一类错误和二类错误,学生也很难理解,在讲授这部分内容时,笔者又列举了另外一个案例来帮助学生理解。当一个人被控告为罪犯时,他将面临审讯。控告方提出控诉后,法官必须根据证据做出裁决。事实上,法官就需要进行假设检验。这里有两个假设需要被证明。第一个假设为原假设H0:被告无罪;第二个假设为备择假设H1:被告有罪。事先法官并不知道哪个假设是正确的,他们将根据控辩双方所提供的证据进行判断,最终的结果只有两种可能:判定被告有罪或无罪释放。在统计应用中,判定被告有罪就相当于拒绝原假设,授受备择假设;而判定被告无罪也就相当于不能拒绝原假设,但我们并不能接受原假设。
当我们进行假设检验时,存在两种可能的错误。第一类错误是当原假设正确时,我们却拒绝了它。第二类错误当原假设有错误时,我们却没有拒绝。在上面这个法官审案的例子中,第一类错误就是一个无罪的人被判定有罪。第二类错误就是一个有罪的被告被判定无罪。我们把发生第一类错误的概率记为α,通常它也被称为显著性水平。第二类错误发生的概率为β。发生错误的概率α和β是相反的关系,这就意味着任何尝试减少某一类错误的方法都会使另外一类错误发生的概率增加。根据检验的一般原则,首先要保证犯第一类错误的概率α要足够的小。因为司法审判中,第一类错误被认为是更加严重的。通过对这个案例的学习,学生就能很好地理解,为什么我们会将显著性水平规定为0.01或0.05,最大一般不会超过0.1。
2、强化统计软件的教学 在统计学教学中加强统计软件的教学,并不仅仅是为了教会学生用统计软件去整理数据和分析数据,另外一个目的就是通过操作统计软件帮助学生理解统计理论。目前大多数学校为了合理利用比较紧缺的实验教学资源,往往对理论教学和实践教学环节进行分开安排,而这样做的弊端就是不利于上述目标的实现。事实上现在许多大学生都有自己的个人电脑,对一些统计软件的学习并不一定要去实验室,教师可以在课堂上进行简单的演示,让学生在课后多练习操作。我们认为在统计学教学中使用Stata统计分析软件将更加方便,因为Stata是世界上最权威的三大统计软件之一,具有占用内存小、功能非常强大、运算速度快和不需要安装等优点。 我们在前面的分析中曾谈到为了提高学生学习统计学的效率,很有必要对学好统计学必须具备的数学基础知识进行专门的复习。如果我们用Stata软件来帮助学生复习数学知识,其效率会更高。下面将列举用如何用Stata的矩阵命令帮助学生复习矩阵运算的相关知识。 用Stata录入一个新矩阵的方法非常简单。在Stata的命令窗口输入以下命令:matrix A=(1,0,1\2,1,0\-3,2,-5),就得到了一个3行3列的矩阵。 如果要得到矩阵A的转置矩阵,只需要输入以下命令:matrix A1=A’。A1=(1,2,-3\0,1,2\1,0,-5)即为A的转置矩阵。 如果要得到矩阵A的迹,只需要输入以下命令:scalar a=trace(A);如果要得到矩阵A的逆,只需要输入以下命令:matrix B=inv(A),B=(-2.5,1,-0.5\5,-1,1\3.5,-1,0.5)即为A的逆矩阵。 事实上,在指导学生复习矩阵的相关知识时,并不需要详细地为学生讲解具体的运算过程,比如求矩阵的逆,其运算过程比较复杂,如果详细地讲解运算过程,将花费大量的时间,甚至有本末倒置之嫌。只需要简单讲解一下矩阵逆的概念,其运算过程可以完全交给软件去做。 当然学习统计软件最根本的目的是对搜集到的大量数据进行整理和分析。当学生在学习相应的统计整理和统计分析的理论知识的时候,也必须能运用软件去得到相应的结果。比如当学生学完平均指标和标志变异度指标之后,要学会如何用软件来得到相应的指标。用Stata软件来得到这些指标的方法非常简单的。如果想得到某个变量a的平均数、标准差、极大值、极小值以及25%分位数、75%分位数等,只需要输入命令“sum a,detail”就可以了。 3、加强实践能力的训练 由于统计学的实践性很强,因此必须要注重学生实践能力的训练,在目前的统计学教学中有一个误区,认为教会学生操作相应的统计软件,就是在进行实践能力的训练。事实并不是这样,学生学习统计学的目的主要是为了解决实际问题,因此在教学中要根据相应的教学内容设计不同的课题和任务,让学生实实在在地从搜集数据、整理数据、分析数据到得出统计结论进行完整的训练。通过加强实践能力训练,可以让学生真正明白统计学的实用性,从而产生更大的学习兴趣,并在实践中清楚地知道自己在哪些方面还存在不足,以增加学习统计学的动力。
- ?
数据分析全流程(内附案例)
Winston
展开
(图片来源于网络)
作者:苏格兰折耳喵
来源: 运营喵是怎样炼成的 (yymzylc)
(温馨提示:图片显示毛糙和不清楚,是分辨率过高的缘故,点击图片,即可看到高清大图。 )
本文将对一个案例进行从数据采集、数据清洗、数据分析再到数据可视化的全流程分析,力求条理清晰的展现外部数据分析的强大威力。以下是本文的写作框架:
1 分析背景
1.1 分析原理---为什么选择分析虎嗅网
在现今数据爆炸、信息质量良莠不齐的互联网时代,我们无时无刻不身处在互联网社会化媒体的“信息洪流”之中,因而无可避免的被它上面泛滥的信息所“裹挟”,也就是说,社会化媒体上的信息对现实世界中的每个人都有重大影响,社会化媒体是我们间接了解现实客观世界和主观世界的一面窗户,我们每时每刻都在受到它的影响。
综合上述两类情形,可以得出这样的结论,透过社会化媒体,我们可以观察现实世界:
由此, 社会化媒体是现实主客观世界的一面镜子,而它也会进一步影响人们的行为,如果我们对该领域中的优质媒体所发布的信息进行分析,除了可以了解该领域的发展进程和现状,还可以对该领域的人群行为进行一定程度的预判。
鉴于此种情况,作为互联网从业者的笔者想分析一下互联网行业的一些现状,于是想到了虎嗅网。
虎嗅网创办于2012年5月,是一个聚合优质创新信息与人群的新媒体平台。该平台专注于贡献原创、深度、犀利优质的商业资讯,围绕创新创业的观点进行剖析与交流。虎嗅网 的核心,是关注互联网及传统产业的融合、一系列明星公司(包括公众公司与创业型企业)的起落轨迹、产业潮汐的动力与趋势。
因此,对该平台上的发布内容进行分析,对于研究互联网的发展进程和现状有一定的实际价值。
1.2 本文的分析目的
笔者在本项目中的分析目的主要有4个:
(1)对虎嗅网内容运营方面的若干分析,主要是对发文量、收藏量、评论量等方面的描述性分析;
(2)通过文本分析,对互联网行业的一些人、企业和细分领域进行趣味性的分析;
(3)展现文本挖掘在数据分析领域的实用价值;
(4)将杂芜无序的结构化数据和非结构化数据进行可视化,展现数据之美。
1.3 分析方法---分析工具和分析类型
本文中,笔者使用的数据分析工具如下:
Python3.5.2(编程语言)
Gensim(词向量、主题模型)
Scikit-Learn(聚类和分类)
Keras(深度学习框架)
Tensorflow(深度学习框架)
Jieba(分词和关键词提取)
Excel(可视化)
Seaborn(可视化)
新浪微舆情(情绪语义分析)
Bokeh(可视化)
Gephi(网络可视化)
Plotly(可视化)
使用上述数据分析工具,笔者将进行2类数据分析:第一类是较为传统的、针对数值型数据的描述下统计分析,如阅读量、收藏量等在时间维度上的分布;另一类是本文的重头戏---深层次的文本挖掘,包括关键词提取、文章内容LDA主题模型分析、词向量/关联词分析、DTM模型、ATM模型、词汇分散图和词聚类分析。
2 数据采集和文本预处理
2.1 数据采集
笔者使用爬虫采集了来自虎嗅网主页的文章(并不是全部的文章,但展示在主页的信息是主编精挑细选的,很具代表性),数据采集的时间区间为2012.05~2017.11,共计41,121篇。采集的字段为文章标题、发布时间、收藏量、评论量、正文内容、作者名称、作者自我简介、作者发文量,然后笔者人工提取4个特征,主要是 时间特征 (时点和周几)和 内容长度特征 (标题字数和文章字数),最终得到的数据如下图所示:
2.2 数据预处理
数据分析/挖掘领域有一条金科玉律:“Garbage in, Garbage out”,做好数据预处理,对于取得理想的分析结果来说是至关重要的。本文的数据规整主要是对文本数据进行清洗,处理的条目如下:
(1) 文本分词
要进行文本挖掘,分词是最为关键的一步,它直接影响后续的分析结果。笔者使用jieba来对文本进行分词处理,它有3类分词模式,即全模式、精确模式、搜索引擎模式:
· 精确模式:试图将句子最精确地切开,适合文本分析;
· 全模式:把句子中所有的可以成词的词语都扫描出来, 速度非常快,但是不能解决歧义;
· 搜索引擎模式:在精确模式的基础上,对长词再次切分,提高召回率,适合用于搜索引擎分词。
现以“新浪微舆情专注于社会化大数据的场景化应用”为例,3种分词模式的结果如下:
【全模式】: 新浪/ 微舆情/ 新浪微舆情/ 专注/于/ 社会化/ 大数据/ 社会化大数据/ 的/ 场景化/ 应用
【精确模式】: 新浪微舆情/ 专注/于/ 社会化大数据/ 的/ 场景化/ 应用
【搜索引擎模式】:新浪,微舆情,新浪微舆情,专注,于,社会化,大数据,社会化大数据,的,场景化,应用
为了避免歧义和切出符合预期效果的词汇,笔者采取的是精确(分词)模式。
(2) 去停用词
这里的去停用词包括以下三类:
标点符号:, 。! /、*+-
特殊符号:▲等
无意义的虚词: “the”、“a”、“an”、“that”、“你”、“我”、“他们”、“想要”、“打开”、“可以”等
(3) 去掉高频词、稀有词和计算Bigrams
去掉高频词、稀有词是针对后续的主题模型(LDA、ATM)时使用的,主要是为了排除对区隔主题意义不大的词汇,最终得到类似于停用词的效果。
Bigrams是为了自动探测出文本中的新词,基于词汇之间的共现关系---如果两个词经常一起毗邻出现,那么这两个词可以结合成一个新词,比如“数据”、“产品经理”经常一起出现在不同的段落里,那么,“数据_产品经理”则是二者合成出来的新词,只不过二者之间包含着下划线。
3 描述性分析
该部分中,笔者主要对数值型数据进行描述性的统计分析,它属于较为常规的数据分析,能揭示出一些问题,做到知其然。
3.1 发文数量、评论量和收藏量的变化走势
从下图可以看出,在2012.05~2017.11期间,以季度为单位,主页的发文数量起伏波动不大,在均值1800上下波动,进入2016年后,发文数量有明显提升。
此外,一头(2012年第二季)一尾(2017年第四季)因为没有统计完全,所以发文数量较小。
下图则是该时间段内收藏量和评论量的变化情况,评论量的变化不愠不火,起伏不大,但收藏量一直在攀升中,尤其是在2017年的第二季达到峰值。收藏量在一定程度上反映了文章的干货程度和价值性,读者认为有价值的文章才会去保留和收藏,反复阅读,含英咀华,这说明虎嗅的文章质量在不断提高,或读者的数量在增长。
3.2 发文时间规律分析
笔者从时间维度里提取出“周”和“时段”的信息,也就是开题提到的“人工特征”的提取,现在做文章分布数量的在“周”和“时”上的交叉分析,得到下图:
上图是一个热力图,色块颜色上的由暖到冷表征数值的由大变小。很明显的可以看到,中间有一个颜色很明显的区域,即由“6时~19时”和“周一~周五”围成的矩形,也就是说,发文时间主要集中在工作日的白天。另外,周一到周五期间,6时~7时这个时间段是发文的高峰,说明虎嗅的内容运营人员倾向于在工作日的清晨发布文章,这也符合它的人群定位---TMT领域从业、创业者、投资人,他们中的许多人有晨读的习惯,喜欢在赶地铁、坐公交的过程中阅读虎嗅讯息。发文高峰还有9时-11时这个高峰,是为了提前应对读者午休时间的阅读,还有17时~18时,提前应对读者下班时间的阅读。
3.3 相关性分析
笔者一直很好奇,文章的评论量、收藏量和标题字数、文章字数是否存在统计学意义上的相关性关系。基于此,笔者绘制出能反映上述变量关系的两张图。
首先,笔者做出了标题字数、文章字数和评论量之间的 气泡图 (圆形的气泡被六角星替代,但本质上还是气泡图)。
上图中,横轴是文章字数,纵轴是标题字数,评论数大小由六角星的大小和颜色所反映,颜色越暖,数值越大,五角星越大,数值越大。从这张图可以看出,文章评论量较大的文章,绝大部分分布于由文章字数6000字、标题字数20字所构成的区域内。虎嗅网上的商业资讯文章大都具有原创、深度的特点,文章篇幅中长,意味着能把事情背后的来龙去脉论述清楚,而且标题要能够吸引人,引发读者的大量阅读,合适长度标题和正文篇幅才能做到这一点。
接下来,笔者将收藏量、评论量和标题字数、文章字数绘制成一张3D立体图,X轴和Y轴分别为标题字数和正文字数,Z轴为收藏量和评论量所构成的 平面 ,通过旋转这个3维的Surface图,我们可以发现收藏量、评论量和标题字数、文章字数之间的相关关系。
注意,上图的数值表示和前面几张图一样,颜色上的由暖到冷表示数值的由大到小,通过旋转各维度的截面,可以看到在正文字数5000字以内、标题字数15字左右的收藏量和评论量形成的截面出现“华山式”陡峰,因而这里的收藏量和评论量最大。
3.4 城市提及分析
在这里,笔者通过构建一个包含全国1~5线城市的词表,提取出经过预处理后的文本中的城市名称,根据提及频次的大小,绘制出 一张反映城市提及频次的地理分布地图 , 进而间接地了解各个城市互联网的发展状况(一般城市的提及跟互联网产业、产品和职位信息挂钩,能在一定程度上反映该城市互联网行业的发展态势)。
上图反映的结果比较符合常识,北上深广杭这些一线城市的提及次数最多,它们是互联网行业发展的重镇。值得注意的是,长三角地区的大块区域(长江三角洲城市群,它包含 上海 , 江苏省 的 南京 、 无锡 、 常州 、 苏州 、 南通 、 盐城 、 扬州 、 镇江 、 泰州 , 浙江省 的 杭州 、 宁波 、 嘉兴 、 湖州 、 绍兴 、 金华 、 舟山 、 台州 , 安徽省 的 合肥 、 芜湖 、 马鞍山 、 铜陵 、 安庆 、 滁州 、 池州 、 宣城 )呈现出较高的热度值,直接说明这些城市在虎嗅网各类资讯文章中的提及次数较多,结合国家政策和地区因素,可以这样理解地图中反映的这个事实:
长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。
长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。
接下来,笔者将抽取文本中城市之间的 共现关系 ,也就是城市之间两两同时出现的频率,在一定程度上反映出城市间经济、文化、政策等方面的相关关系,共现频次越高,说明二者之间的联系紧密程度越高,抽取出的结果如下表所示:
将上述结果绘制成如下动态的流向图:
由于虎嗅网上的文章大多涉及创业、政策、商业方面的内容,因而这种城市之间的共现关系反映出城际间在资源、人员或者行业方面的关联关系,本动态图中,主要反映的是北上广深杭(网络中的枢纽节点)之间的相互流动关系和这几个一线城市向中西部城市的单向流动情形。流动量大、交错密集的区域无疑是中国最发达的3个城市群和其他几个新兴的城市群:
京津冀城市群
长江三角洲城市群
珠江三角洲城市群
中原城市群
成渝城市群
长江中游城市群
上面的数据分析是基于数值型数据的描述性分析,接下来,笔者将进行更为深入的文本挖掘。
4 文本挖掘
数据挖掘是从有结构的数据库中鉴别出有效的、新颖的、可能有用的并最终可理解的模式;而文本挖掘(在文本数据库也称为文本数据挖掘或者知识发现)是从大量非结构的数据中提炼出模式,也就是有用的信息或知识的半自动化过程。
本文的文本挖掘部分主要涉及高频词统计/关键词提取/关键词云、文章标题聚类、文章内容聚类、文章内容LDA主题模型分析、词向量/关联词分析、ATM模型、词汇分散图和词聚类分析。
4.1 关键词提取
对于关键词提取,笔者没有采取词频统计的方法,因为词频统计的逻辑是:一个词在文章中出现的次数越多,则它就越重要。因而,笔者采用的是 TF-IDF (termfrequency–inverse document frequency)的关键词提取方法:
它用以评估一字/词对于一个文件集或一个语料库中的其中一份文件的重要程度,字/词的重要性会随着它在文件中出现的次数成正比增加,但同时会随着它在语料库中出现的频率成反比下降。
由此可见,在提取某段文本的关键信息时,关键词提取较词频统计更为可取,能提取出对某段文本具有重要意义的关键词。
下面是笔者利用jieba在经预处理...
- ?
五个大数据分析成功案例分享
细腰
展开
首席信息官正在利用数据分析来提高效率和促进增长,但并不是每一次努力都会产生结果。以下讲述了优秀的首席信息官是如何成功地利用数据分析和机器学习技术来增加收益或降低成本的。
如果把数据比作新的石油,那么掌握如何将其提炼为可使用的情报就是发挥其潜力的关键。为此,首席信息官正在使用预测分析工具,设计机器学习算法和对其他解决方案进行测试,以追求企业的效率和以新的方式为客户服务。
胡椒博士集团(Dr.PepperSnappleGroup)将机器学习技术用于语境相关性工作中
多年来,胡椒博士集团的销售路线员工一直是抓着一本厚厚的活页夹,里面装满了客户数据、销售和促销说明,然后去吸引一些零售客户,如沃尔玛和塔吉特百货公司(Target)等。今天,销售人员不再使用这种活页夹,而是配备了能告诉他们需要拜访哪家商店的iPad,而且还会告诉销售人员该为这些零售商提供何种优惠,以及其他关键指标。胡椒博士集团的首席信息官汤姆·法拉(TomFarrah)表示:“他们都是接订单的销售人员,为此他们感到很骄傲。现在他们配备了信息资料来帮助其实现目标,使他们成为智能的销售人员。”
该MyDPS平台配有机器学习和其他分析工具,可在工作人员加载应用程序时向其提供建议和日常操作记分卡。这些算法向员工显示他们是如何按照预期计划进行工作的,包括他们是否按照自己的计划工作,或是落后于计划,以及给他们提供见解,让他们清楚如何纠正他们的工作。法拉说:“如果我要让某人获得成功,我必须确保他们拥有哪些信息是与工作内容相关的。”
经验教训:为了测试验证MyDPS平台的概念,法拉将该软件分给了一个分公司的四个人,并让业务总裁去拜访他们。他们透露,自从上个月使用MyDPS之后,执行销售额已经提高了50%,这一表现让他批准了该项目。法拉说:“他获得了结果,这就是销售所需要的,这不仅仅是为了项目的商业赞助,而且这也是他们希望得到的结果,这一点非常重要。”
凭借机器学习技术,RRD公司走上新业务之路
营销传播公司R.H.Donnelley公司为RRD公司的前身,几年前,RRD公司设立了物流部门,向消费者和企业配送它的印刷材料。为了支持这项业务,公司自己管理运营,并代表其合作伙伴配送各种物品,包括洗衣机、狗粮等等,最终成长为价值10亿美元的一个企业。这是一个挑战吗?在联邦快递和UPS成为无可争议的霸主的天下,找到一个最优的运费。
诸如天气、地域、司机和政治局面等因素都是业务上的成本。RRD公司的首席信息官肯奥布莱恩(KenO'Brien)表示,随着迫切需要对费率变量进行预测,RRD公司转向了机器学习和数据分析。公司聘请员工和与大学合作来帮助编写算法,在700条路线上测试数千个场景,直到能够以99%的准确率提前7天实时预计运费。奥布莱恩说:“该项目在不到一年的时间就完成了,我们现在仍然看到业务的增长与运费有关。”该公司预计,在2017年,其卡车货运代理业务将从400万美元增长到1600万美元,营收将增长1200万美元,业务规模达6亿美元。
经验教训:新企业需要高水平的全心投入,尽管奥布莱恩承认,他的一些业务同行已准备好在业务的不同环节上认输。该业务并不相信那些通常以感觉和猜测来完成一个流程的技术。RRD公司建立了一个协作环境,业务和IT共同合作来推进结果。“你会遇到困难,你会遇到挑战,但要耐心,”奥布莱恩说。
孟山都公司(Monsanto)利用机器学习技术,实现最佳种植计划
农民永远为要种植何种作物,种植面积,在哪里种植及何时种植而苦恼。种子行业巨人孟山都公司正在研究这项工作,利用数据科学为农业种植提供规范性建议。数学和统计学模型会绘制出雄性作物和雌性作物的最佳种植时间,以及在何处种植,在理想状态下,这就最大限度地提高产量并减少土地使用。孟山都公司全球IT分析主管艾德里安·卡地亚(AdrianCartier)表示,其机器学习算法在数天内完成了超过900亿的数据点,而不是几周或几个月。这是商业利益吗?在2016年,孟山都公司节省了600万美元,其供应链足迹减少了4%。卡地亚说:“北美地区的土地利用率下降了4%,相当于不去使用大面积的土地,这节省了大量资金。”
经验教训:孟山都公司成功的关键是在信息技术与供应链业务之间建立了一个“自始至终”的合作。卡地亚说:“他们具有农业和供应链角度的专业知识,而我们具有数学和统计领域的专业知识,两者结合起来,就创造了我们能够提供的价值。”卡地亚说道,他还寻求在供应链业务中“改变领导者和倡导者”,以形成对反对者一种健康的平衡。
柏克德公司(Bechtel)以卓越的大数据中心来颠覆自己
一个鲜为人知的事实:柏克德公司首席信息官CarolZierhoffer说,与建筑有关的支出占GDP的13%,但整个行业在过去二十年中只有1%的生产率增长。专家表示,通过重新制定合同、提高工人技能以及改进现场执行工作等方式,该行业可以提高50%至60%的生产率。柏克德公司建造了胡佛水坝、英吉利海峡隧道和其他大型设施,已经开始在业务各个环节的数据中挖掘洞察力。
Zierhoffer在沃尔玛、波音和洛克希德马丁公司会见了业内同行,以获得有关如何向前发展的见解。柏克德公司建立了一个先进的大型数据中心,其中包含5千万亿字节数据的数据湖,并开始了概念验证。该数据中心使用照片识别技术,并代表客户来检查和标记各个地点的照片,这节省了200万美元。自然语言处理(NLP)工具可解析索赔、提案请求(RFP)和合同。过去需要几天和几周的评估和计划工作现在只需要数小时。柏克德公司还扩大了分析工作范围,以了解员工的流失率情况,包括试图预测员工将何时离职。Zierhoffer说:“我们相信我们正在敲开解决生产率难题的大门。”
经验教训:数据仓库和质量是支柱。尽管柏克德公司可以分析大量的数据,但在整个业务各环节的数据质量必须提高。“我们不得不颠覆自己,了解我们是如何工作的,并且将数据仓库进行连接。”
数据分析帮助辛辛那提动物园提高客户满意度
辛辛那提动植物园成立于1873年,是世界上著名的动植物园之一,以其物种保护和保存以及高成活率繁殖饲养计划享有极高声誉。它占地面积71英亩,园内有500种动物和3000多种植物,是国内游客人数最多的动植物园之一,曾荣获Zagat十佳动物园,并被《父母》(Parent)杂志评为最受儿童喜欢的动物园,每年接待游客130多万人。
辛辛那提动植物园是一个非营利性组织,是俄亥州同时也是美国国内享受公共补贴最低的动植物园,除去政府补贴,2600万美元年度预算中,自筹资金部分达到三分之二以上。为此,需要不断地寻求增加收入。而要做到这一点,最好办法是为工作人员和游客提供更好的服务,提高游览率。从而实现动植物园与客户和纳税人的双赢。
借助于该方案强大的收集和处理能力、互联能力、分析能力以及随之带来的洞察力,在部署后,企业实现了以下各方面的受益:
-帮助动植物园了解每个客户浏览、使用和消费模式,根据时间和地理分布情况采取相应的措施改善游客体验,同时实现营业收入最大化。
统计学数据分析案例
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并