- ?
数据挖掘的方法以及应用
伊迪萨
展开
大数据时代,数据挖掘是最关键的工作。数据挖掘是一种决策支持过程,它主要基于人工智能、机器学习、模式识别、统计学、数据库、可视化技术等,高度自动化地分析企业的数据,做出归纳性的推理,从中挖掘出潜在的模式,帮助决策者调整市场策略,减少风险,做出正确的决策。
数据挖掘的定义
技术上的定义及含义
数据挖掘(Data Mining)就是从大量的、不完全的、有噪声的、模糊的、随机的实际应用数据中,提取隐含在其中的、人们事先不知道的、但又是潜在有用的信息和知识的过程。这个定义包括好几层含义:数据源必须是真实的、大量的、含噪声的;发现的是用户感兴趣的知识;发现的知识要可接受、可理解、可运用;并不要求发现放之四海皆准的知识,仅支持特定的发现问题。
与数据挖掘相近的同义词有数据融合、人工智能、商务智能、模式识别、机器学习、知识发现、数据分析和决策支持等。
----何为知识从广义上理解,数据、信息也是知识的表现形式,但是人们更把概念、规则、模式、规律和约束等看作知识。人们把数据看作是形成知识的源泉,好像从矿石中采矿或淘金一样。原始数据可以是结构化的,如关系数据库中的数据;也可以是半结构化的,如文本、图形和图像数据;甚至是分布在网络上的异构型数据。发现知识的方法可以是数学的,也可以是非数学的;可以是演绎的,也可以是归纳的。发现的知识可以被用于信息管理,查询优化,决策支持和过程控制等,还可以用于数据自身的维护。因此,数据挖掘是一门交叉学科,它把人们对数据的应用从低层次的简单查询,提升到从数据中挖掘知识,提供决策支持。在这种需求牵引下,汇聚了不同领域的研究者,尤其是数据库技术、人工智能技术、数理统计、可视化技术、并行计算等方面的学者和工程技术人员,投身到数据挖掘这一新兴的研究领域,形成新的技术热点。
这里所说的知识发现,不是要求发现放之四海而皆准的真理,也不是要去发现崭新的自然科学定理和纯数学公式,更不是什么机器定理证明。实际上,所有发现的知识都是相对的,是有特定前提和约束条件,面向特定领域的,同时还要能够易于被用户理解。最好能用自然语言表达所发现的结果。
商业角度的定义
数据挖掘是一种新的商业信息处理技术,其主要特点是对商业数据库中的大量业务数据进行抽取、转换、分析和其他模型化处理,从中提取辅助商业决策的关键性数据。
简而言之,数据挖掘其实是一类深层次的数据分析方法。数据分析本身已经有很多年的历史,只不过在过去数据收集和分析的目的是用于科学研究,另外,由于当时计算能力的限制,对大数据量进行分析的复杂数据分析方法受到很大限制。现在,由于各行业业务自动化的实现,商业领域产生了大量的业务数据,这些数据不再是为了分析的目的而收集的,而是由于纯机会的(Opportunistic)商业运作而产生。分析这些数据也不再是单纯为了研究的需要,更主要是为商业决策提供真正有价值的信息,进而
获得利润。但所有企业面临的一个共同问题是:企业数据量非常大,而其中真正有价值的信息却很少,因此从大量的数据中经过深层分析,获得有利于商业运作、提高竞争力的信息,就像从矿石中淘金一样,数据挖掘也因此而得名。
因此,数据挖掘可以描述为:按企业既定业务目标,对大量的企业数据进行探索和分析,揭示隐藏的、未知的或验证已知的规律性,并进一步将其模型化的先进有效的方法。
数据挖掘常用的方法
利用数据挖掘进行数据分析常用的方法主要有分类、回归分析、聚类、关联规则、特征、变化和偏差分析、Web页挖掘等, 它们分别从不同的角度对数据进行挖掘。
①分类。分类是找出数据库中一组数据对象的共同特点并按照分类模式将其划分为不同的类,其目的是通过分类模型,将数据库中的数据项映射到某个给定的类别。它可以应用到客户的分类、客户的属性和特征分析、客户满意度分析、客户的购买趋势预测等,如一个汽车零售商将客户按照对汽车的喜好划分成不同的类,这样营销人员就可以将新型汽车的广告手册直接邮寄到有这种喜好的客户手中,从而大大增加了商业机会。
②回归分析。回归分析方法反映的是事务数据库中属性值在时间上的特征,产生一个将数据项映射到一个实值预测变量的函数,发现变量或属性间的依赖关系,其主要研究问题包括数据序列的趋势特征、数据序列的预测以及数据间的相关关系等。它可以应用到市场营销的各个方面,如客户寻求、保持和预防客户流失活动、产品生命周期分析、销售趋势预测及有针对性的促销活动等。
③聚类。聚类分析是把一组数据按照相似性和差异性分为几个类别,其目的是使得属于同一类别的数据间的相似性尽可能大,不同类别中的数据间的相似性尽可能小。它可以应用到客户群体的分类、客户背景分析、客户购买趋势预测、市场的细分等。
④关联规则。关联规则是描述数据库中数据项之间所存在的关系的规则,即根据一个事务中某些项的出现可导出另一些项在同一事务中也出现,即隐藏在数据间的关联或相互关系。在客户关系管理中,通过对企业的客户数据库里的大量数据进行挖掘,可以从大量的记录中发现有趣的关联关系,找出影响市场营销效果的关键因素,为产品定位、定价与定制客户群,客户寻求、细分与保持,市场营销与推销,营销风险评估和诈骗预测等决策支持提供参考依据。
⑤特征。特征分析是从数据库中的一组数据中提取出关于这些数据的特征式,这些特征式表达了该数据集的总体特征。如营销人员通过对客户流失因素的特征提取,可以得到导致客户流失的一系列原因和主要特征,利用这些特征可以有效地预防客户的流失。
⑥变化和偏差分析。偏差包括很大一类潜在有趣的知识,如分类中的反常实例,模式的例外,观察结果对期望的偏差等,其目的是寻找观察结果与参照量之间有意义的差别。在企业危机管理及其预警中,管理者更感兴趣的是那些意外规则。意外规则的挖掘可以应用到各种异常信息的发现、分析、识别、评价和预警等方面。
⑦Web页挖掘。随着Internet的迅速发展及Web 的全球普及, 使得Web上的信息量无比丰富,通过对Web的挖掘,可以利用Web 的海量数据进行分析,收集政治、经济、政策、科技、金融、各种市场、竞争对手、供求信息、客户等有关的信息,集中精力分析和处理那些对企业有重大或潜在重大影响的外部环境信息和内部经营信息,并根据分析结果找出企业管理过程中出现的各种问题和可能引起危机的先兆,对这些信息进行分析和处理,以便识别、分析、评价和管理危机。
数据挖掘的功能
数据挖掘通过预测未来趋势及行为,做出前摄的、基于知识的决策。数据挖掘的目标是从数据库中发现隐含的、有意义的知识,主要有以下五类功能。
1、自动预测趋势和行为
数据挖掘自动在大型数据库中寻找预测性信息,以往需要进行大量手工分析的问题如今可以迅速直接由数据本身得出结论。一个典型的例子是市场预测问题,数据挖掘使用过去有关促销的数据来寻找未来投资中回报最大的用户,其它可预测的问题包括预报破产以及认定对指定事件最可能作出反应的群体。
2、关联分析
数据关联是数据库中存在的一类重要的可被发现的知识。若两个或多个变量的取值之间存在某种规律性,就称为关联。关联可分为简单关联、时序关联、因果关联。关联分析的目的是找出数据库中隐藏的关联网。有时并不知道数据库中数据的关联函数,即使知道也是不确定的,因此关联分析生成的规则带有可信度。
3、聚类
数据库中的记录可被化分为一系列有意义的子集,即聚类。聚类增强了人们对客观现实的认识,是概念描述和偏差分析的先决条件。聚类技术主要包括传统的模式识别方法和数学分类学。80年代初,Mchalski提出了概念聚类技术牞其要点是,在划分对象时不仅考虑对象之间的距离,还要求划分出的类具有某种内涵描述,从而避免了传统技术的某些片面性。
4、概念描述
概念描述就是对某类对象的内涵进行描述,并概括这类对象的有关特征。概念描述分为特征性描述和区别性描述,前者描述某类对象的共同特征,后者描述不同类对象之间的区别。生成一个类的特征性描述只涉及该类对象中所有对象的共性。生成区别性描述的方法很多,如决策树方法、遗传算法等。
5、偏差检测
数据库中的数据常有一些异常记录,从数据库中检测这些偏差很有意义。偏差包括很多潜在的知识,如分类中的反常实例、不满足规则的特例、观测结果与模型预测值的偏差、量值随时间的变化等。偏差检测的基本方法是,寻找观测结果与参照值之间有意义的差别。 数据挖掘与传统分析方法的区别
数据挖掘与传统的数据分析(如查询、报表、联机应用分析)的本质区别是数据挖掘是在没有明确假设的前提下去挖掘信息、发现知识.数据挖掘所得到的信息应具有先未知,有效和可实用三个特征.
先前未知的信息是指该信息是预先未曾预料到的,既数据挖掘是要发现那些不能靠直觉发现的信息或知识,甚至是违背直觉的信息或知识,挖掘出的信息越是出乎意料,就可能越有价值.在商业应用中最典型的例子就是一家连锁店通过数据挖掘发现了小孩尿布和啤酒之间有着惊人的联系。
数据挖掘应用
1、数据挖掘解决的典型商业问题
需要强调的是,数据挖掘技术从一开始就是面向应用的。目前,在很多领域,数据挖掘(data mining)都是一个很时髦的词,尤其是在如银行、电信、保险、交通、零售(如超级市场)等商业领域。数据挖掘所能解决的典型商业问题包括:数据库营销(Database Marketing)、客户群体划分(Customer Segmentation & Classification)、背景分析(Profile Analysis)、交叉销售(Cross-selling)等市场分析行为,以及客户流失性分析(Churn Analysis)、客户信用记分(Credit Scoring)、欺诈发现(Fraud Detection)等等。
2、数据挖掘在市场营销的应用
数据挖掘技术在企业市场营销中得到了比较普遍的应用,它是以市场营销学的市场细分原理为基础,其基本假定是“消费者过去的行为是其今后消费倾向的最好说明”。
通过收集、加工和处理涉及消费者消费行为的大量信息,确定特定消费群体或个体的兴趣、消费习惯、消费倾向和消费需求,进而推断出相应消费群体或个体下一步的消费行为,然后以此为基础,对所识别出来的消费群体进行特定内容的定向营销,这与传统的不区分消费者对象特征的大规模营销手段相比,大大节省了营销成本,提高了营销效果,从而为企业带来更多的利润。
商业消费信息来自市场中的各种渠道。例如,每当我们用信用卡消费时,商业企业就可以在信用卡结算过程收集商业消费信息,记录下我们进行消费的时间、地点、感兴趣的商品或服务、愿意接收的价格水平和支付能力等数据;当我们在申办信用卡、办理汽车驾驶执照、填写商品保修单等其他需要填写表格的场合时,我们的个人信息就存入了相应的业务数据库;企业除了自行收集相关业务信息之外,甚至可以从其他公司或机构购买此类信息为自己所用。
这些来自各种渠道的数据信息被组合,应用超级计算机、并行处理、神经元网络、模型化算法和其他信息处理技术手段进行处理,从中得到商家用于向特定消费群体或个体进行定向营销的决策信息。这种数据信息是如何应用的呢?举一个简单的例子,当银行通过对业务数据进行挖掘后,发现一个银行帐户持有者突然要求申请双人联合帐户时,并且确认该消费者是第一次申请联合帐户,银行会推断该用户可能要结婚了,它就会向该用户定向推销用于购买房屋、支付子女学费等长期投资业务,银行甚至可能将该信息卖给专营婚庆商品和服务的公司。数据挖掘构筑竞争优势。
在市场经济比较发达的国家和地区,许多公司都开始在原有信息系统的基础上通过数据挖掘对业务信息进行深加工,以构筑自己的竞争优势,扩大自己的营业额。美国运通公司(American Express)有一个用于记录信用卡业务的数据库,数据量达到54亿字符,并仍在随着业务进展不断更新。运通公司通过对这些数据进行挖掘,制定了“关联结算(Relation ship Billing)优惠”的促销策略,即如果一个顾客在一个商店用运通卡购买一套时装,那么在同一个商店再买一双鞋,就可以得到比较大的折扣,这样既可以增加商店的销售量,也可以增加运通卡在该商店的使用率。再如,居住在伦敦的持卡消费者如果最近刚刚乘英国航空公司的航班去过巴黎,那么他可能会得到一个周末前往纽约的机票打折优惠卡。
基于数据挖掘的营销,常常可以向消费者发出与其以前的消费行为相关的推销材料。卡夫(Kraft)食品公司建立了一个拥有3000万客户资料的数据库,数据库是通过收集对公司发出的优惠券等其他促销手段作出积极反应的客户和销售记录而建立起来的,卡夫公司通过数...
- ?
什么是农业大数据挖掘技术?
小革命
展开
农业大数据挖掘建立农业大数据平台,采集并存储大量的历史数据,外部数据,最终是为了让农业生产更智能,更高效。因此,需要运用先进的数据挖掘技术和人工智能技术来实现农业智能化。例如,根据历史天气状况和农作物生长状况来分析指导最佳实践,来提示预警潜在病虫害的风险和气象病的风险等等。这些智能化应用的实现主要需要用到数据挖掘和人工智能技术。大数据平台提供了数据挖掘和人工智能的算法库,并且还提供了数据建模工具方便用户进行数据清洗,数据建模和数据模型的测试。
农业大数据大数据平台数据挖掘引擎实现了机器学习算法库与统计算法库,支持常用机器学习算法并行化与统计算法并行化,并利用Spark在迭代计算和内存计算上的优势,将并行的机器学习算法与统计算法运行在Spark上。支持的机器学习算法包括逻辑回归、朴素贝叶斯、支持向量机、聚类、线性回归、推荐算法等,统计算法库包括均值、方差、中位数、直方图、箱线图等。可以支持后期在平台上搭建多种分析型应用,例如用户行为分析、精准营销,将对用户贴标签、进行分类,此类应用都会用到平台的数据挖掘功能。
并集成了RStudio Server, Rstudio是R的一种强大而便捷的IDE,提供基于web的开发环境。同时平台提供的RStudio预加载好了并行化后台以及并行化执行引擎的连接模块,并将R脚本的编写、编译、跟踪执行以及中间变量查看和绘图集于一体,为用户提供了一个强大的R的操作环境。用户除了可以自行编写R的程序脚本、调用开源版本R提供了数千个R的包和函数之外,还可以直接调用并行化机器学习算法库。
挖掘算法 - ?
一篇文章让你知道什么是大数据挖掘技术
卜水香
展开
大数据如果想要产生价值,对它的处理过程无疑是非常重要的,其中大数据分析和大数据挖掘就是最重要的两部分。在前几期的科普中,小编已经为大家介绍了大数据分析的相关情况,本期小编就为大家讲解大数据挖掘技术,让大家轻轻松松弄懂什么是大数据挖掘技术。
什么是大数据挖掘?
分享之前我还是要推荐下我自己创建的大数据学习交流Qun531629188
无论是大牛还是想转行想学习的大学生
小编我都挺欢迎,今天的已经资讯上传到群文件,不定期分享干货,
包括我自己整理的一份最新的适合2018年学习的大数据教程,欢迎初学和进阶中的小伙伴。
数据挖掘(Data Mining)是从大量的、不完全的、有噪声的、模糊的、随机的数据中提取隐含在其中的、人们事先不知道的、但又是潜在有用的信息和知识的过程。
数据挖掘对象
根据信息存储格式,用于挖掘的对象有关系数据库、面向对象数据库、数据仓库、文本数据源、多媒体数据库、空间数据库、时态数据库、异质数据库以及Internet等。
数据挖掘流程
定义问题:清晰地定义出业务问题,确定数据挖掘的目的。
数据准备:数据准备包括:选择数据–在大型数据库和数据仓库目标中 提取数据挖掘的目标数据集;数据预处理–进行数据再加工,包括检查数据的完整性及数据的一致性、去噪声,填补丢失的域,删除无效数据等。
数据挖掘:根据数据功能的类型和和数据的特点选择相应的算法,在净化和转换过的数据集上进行数据挖掘。
分享之前推荐一个大数据学习交流群:722680258未来将是大数据时代,需要学习大数据的抓紧时间学习,群内不定期分享视频资料,欢迎加入
结果分析:对数据挖掘的结果进行解释和评价,转换成为能够最终被用户理解的知识。
数据挖掘分类
直接数据挖掘:目标是利用可用的数据建立一个模型,这个模型对剩余的数据,对一个特定的变量(可以理解成数据库中表的属性,即列)进行描述。
间接数据挖掘:目标中没有选出某一具体的变量,用模型进行描述;而是在所有的变量中建立起某种关系。
数据挖掘的方法
神经网络方法
神经网络由于本身良好的鲁棒性、自组织自适应性、并行处理、分布存储和高度容错等特性非常适合解决数据挖掘的问题,因此近年来越来越受到人们的关注。
遗传算法
遗传算法是一种基于生物自然选择与遗传机理的随机搜索算法,是一种仿生全局优化方法。遗传算法具有的隐含并行性、易于和其它模型结合等性质使得它在数据挖掘中被加以应用。
决策树方法
决策树是一种常用于预测模型的算法,它通过将大量数据有目的分类,从中找到一些有价值的,潜在的信息。它的主要优点是描述简单,分类速度快,特别适合大规模的数据处理。
粗集方法
粗集理论是一种研究不精确、不确定知识的数学工具。粗集方法有几个优点:不需要给出额外信息;简化输入信息的表达空间;算法简单,易于操作。粗集处理的对象是类似二维关系表的信息表。
覆盖正例排斥反例方法
它是利用覆盖所有正例、排斥所有反例的思想来寻找规则。首先在正例集合中任选一个种子,到反例集合中逐个比较。与字段取值构成的选择子相容则舍去,相反则保留。按此思想循环所有正例种子,将得到正例的规则(选择子的合取式)。
统计分析方法
在数据库字段项之间存在两种关系:函数关系和相关关系,对它们的分析可采用统计学方法,即利用统计学原理对数据库中的信息进行分析。可进行常用统计、回归分析、相关分析、差异分析等。
模糊集方法
即利用模糊集合理论对实际问题进行模糊评判、模糊决策、模糊模式识别和模糊聚类分析。系统的复杂性越高,模糊性越强,一般模糊集合理论是用隶属度来刻画模糊事物的亦此亦彼性的。
数据挖掘任务
关联分析
两个或两个以上变量的取值之间存在某种规律性,就称为关联。数据关联是数据库中存在的一类重要的、可被发现的知识。关联分为简单关联、时序关联和因果关联。关联分析的目的是找出数据库中隐藏的关联网。一般用支持度和可信度两个阀值来度量关联规则的相关性,还不断引入兴趣度、相关性等参数,使得所挖掘的规则更符合需求。
聚类分析
聚类是把数据按照相似性归纳成若干类别,同一类中的数据彼此相似,不同类中的数据相异。聚类分析可以建立宏观的概念,发现数据的分布模式,以及可能的数据属性之间的相互关系。
分类
分类就是找出一个类别的概念描述,它代表了这类数据的整体信息,即该类的内涵描述,并用这种描述来构造模型,一般用规则或决策树模式表示。分类是利用训练数据集通过一定的算法而求得分类规则。分类可被用于规则描述和预测。
预测
预测是利用历史数据找出变化规律,建立模型,并由此模型对未来数据的种类及特征进行预测。预测关心的是精度和不确定性,通常用预测方差来度量。
时序模式
时序模式是指通过时间序列搜索出的重复发生概率较高的模式。与回归一样,它也是用己知的数据预测未来的值,但这些数据的区别是变量所处时间的不同。
偏差分析
在偏差中包括很多有用的知识,数据库中的数据存在很多异常情况,发现数据库中数据存在的异常情况是非常重要的。偏差检验的基本方法就是寻找观察结果与参照之间的差别。
- ?
年薪百万大数据工程师:告诉大家如何学习大数据
Werner
展开
信息作为二千零一十七世纪流行的技术,大量的数据越来越受到人们的重视。对于一个想进入大数据的朋友来说,他想知道的是:什么是大数据学习?今天,我们将与大家分享数据,并分享一篇关于大数据学习内容系统的文章。
大数据技术体系过于复杂,数据采集,涵盖了基本的数据处理、分布式存储、NoSQL数据库、多模式计算(批处理、联机处理、共享大数据交流学习裙722680258低中高资料每天都有,欢迎大家加入。实时流处理、记忆、处理)多模态计算(图像、文本、视频、音频)、数据仓库、数据挖掘、机器学习、深度学习、人工智能、并行计算、可视化技术和不同层次。此外,大数据应用得到了广泛的应用,不同领域的技术差异仍然很大。在很短的时间内,很难掌握大数据理论和技术的许多领域。从应用的角度出发,从实际应用需求出发,一定要把它修改一下,然后再掌握一些技巧,然后再画横向扩展,这样学习效果会更好。大数据技术初探
大数据分布过去几年到现在的所谓的大数据时代,先进的信息技术在移动互联网、物联网、云计算、人工智能领域、机器人、大数据、火又一个接一个,什么是大数据,大数据技术类包括那些,他们中的许多人都是根据自己的熟悉该领域盲人摸象估计。
从DT以下(数据技术,数据技术)技术,系统地介绍了大数据的普遍看法是什么,包括核心技术、各领域的关系:首先我们说机器学习,机器学习(机器学习),是计算机科学统计的一门交叉学科,其核心目标是通过优化映射的数据,训练函数实现,评价模式我,和一系列的自动分类和预测算法,让计算机具有数据保存功能;机器学习领域包括各种智能算法、分类、聚类、回归和相关分析,对每一类下有很多算法的支持,支持向量机,神经网络,logistic回归,EM、决策树、贝叶斯网络、随机森林、LDA、十或20网络排名算法,只是冰山一角角尖;在计算机智能机器学习为核心,深入学习,核心数据挖掘、商业智能、人工智能、大数据的核心技术,如机器学习、机器学习是用于图像处理处理和机器视觉识别,机器学习是用来模拟自然语言处理人类语言,自然语言处理是机器视觉和一般数据分析、人工智能技术支持的核心数据挖掘,机器学习数据挖掘和商业智能技术的肺。
知识深入学习(深学习)是机器学习的一个分支,它是非常热门的,深层学习是基于神经网络算法,经过几十年的分类和识别,在图像数据的语音识别的条件下,取得了良好的效果,有望成为人工智能核心技术的一个突破。因此,科研机构和IT巨头正在做相关的研究和开发工作,投入了大量的人力和物力。数据挖掘(数据挖掘)是一个非常宽泛的概念。
与采矿相似,我们需要从大量的石头中挖出大量的石头,从大量的数据中挖掘出有价值的、有规律的信息。数据挖掘的核心技术是机器学习领域。例如,深学习是机器学习的一种比较火的算法,当然它也可以用于数据挖掘。此外,传统的商业智能(BI)领域还包括数据挖掘,OLAP多维数据分析可以挖掘和分析,甚至可以对excel的基本统计分析进行挖掘。关键在于你的技术能真正挖掘出有用的信息,如果信息包含在数据挖掘中,那么这些信息可以增强你的决策指导。人工智能(AI)是一个伟大的概念。
工程师智能机器的最终目标是拟人化。机器可以做同样的事情。人的力量只有几瓦,能处理各种复杂的问题和惊人的事情。虽然机器的计算能力强于人类,但人类的理解、感知推理、记忆和幻觉以及心理功能都是D。
- ?
探索大数据挖掘技术在商业银行领域的应用
甘芊芊
展开
摘 要:由于大数据的快速发展,传统的以业务经验模式进行的数据库营销面临极大挑战。针对这种情况,提出基于大数据的数据挖掘技术方法。首先了解业务需求,根据业务目标设计模型,接着进行数据整合、数据清洗等,然后建立模型、对模型结果进行评估。实验结果表明,应用大数据挖掘技术能有效的提高精准营销的成功率、进行风险防控以及运营优化管理。
引 言
随着大数据时代的到来,商业银行数据资产的价值也愈发显得更加重要,为此,探索数据的应用场景和商业模式,建立技术平台,推动商业银行从传统数据库营销到数据化运营,最终到运营数据的转变,成为各家商业银行重点工作。笔者所在的银行依托分行大数据平台,致力于大数据+人工智能+数据挖掘的探索与研究,从2014年就启动了数据挖掘的相关工作,开发了卡分期模型、信用卡疑似套现评分模型、信用卡客户流失预警模型、信用卡逾期预警模型、网点选址优化模型、大额存单交叉营销模型、中高端客户流失预警模型等。下面就精准营销、风险预警、运营优化三个主要应用场景介绍近三年运用大数据挖掘技术建模实践的成效。
1 精准营销
我行基于大数据平台丰富的数据来源及高效的分布式计算技术,通过逻辑回归、决策树、神经网络、支持向量机等机器学习算法,结合业务目标进行分析挖掘、构建模型、制定精准营销方案与策略。下面以大额存单交叉销售模型和信用卡账单分期模型为例简要介绍建模方法及收效。
1.1 大额存单交叉销售模型
个人大额存单产品自推广以来,维持了较高的存款贡献与客户层级上升贡献,是分行应对同业竞争、拓展存款和客户的技术手段和措施。为更好地推动大额存单客户群的维护与拓展,争揽客户行外资金,亟需通过该交叉销售模型找出高响应的客户进行大额存单精准营销活动。
1.1.1建模样本及目标变量定义
建模样本定义为资产5万-100万的客户,模型的目标变量定义为首次购买大额存单的客户。时间窗口定义:观察期,6个月;表现期,3个月,经统计分析,样本的目标变量过少,为此,我们将两个观察期和表现期的数据分布叠加起来,重新整合样本后进行建模。
1.1.2数据预处理
源数据来自客户基础属性、客户持有产品、客户交易行为、客户基础属性变化、客户持有产品变化、贷款信息、代发薪信息、跨行转账信息等数据。数据预处理主要包括变量衍生、异常值检验及处理、缺失值检验及处理三个部分组成。
变量衍生:指根据业务的一些经验值和数据分析结果,主要针对客户交易行为衍生了分渠道、分产品每月的交易金额最大值、均值、最小值及每个产品和渠道对应的交易趋势等变量。
异常值检验及处理:异常值是指一个变量的值非常极端或者出现频率非常低。对于一般的数值型变量根据盖帽原则,将最大值cap值P99分位数;有业务实际意义的,根据业务逻辑来处理。对应字符型变量通过查看其分布来检验,并根据业务逻辑来处理异常值。
缺失值检验及处理:对缺失值处理同样要分数值型和字符型两部分,对应数值型变量缺失值的填充方法有总体均值填充、类均值填充、回归预测填充等,本次模型主要采用总体均值填充的方法和业务实际来填充。对字符型变量的缺失值我们用N来填充。
1.1.3分析建模
变量首次筛选:由于源变量较多,首次筛选去掉那些对目标变量影响不大的变量将会减少后续工作量。结合变量的IV值和单个变量进入逻辑回归模型的结果,筛选出相对重要的变量。
变量分组:由于LOGISTIC回归只能对数值型变量进行建模,对字符型变量需要预处理或分组衍生出哑变量,同样的对数值型变量也做了分组处理。我们在目标变量的监督下,对变量进行分组处理。并将分组结果转换为变量对应的woe值。
变量二次筛选:对转换为woe值后的变量做共线性诊断,剔除相关性较强的变量。
模型开发:首先将建模样本分为训练集和验证集,采用逐步回归的方法进行LOGISTIC回归的开发。基于此模型结果我们可以预测出资产5-100万的客户首次购买大额存单的可能性的大小。根据模型的评分结果,给定营销组A、B和对照组C、D,其中A和C是响应率前10%的客户,B和D组是响应率后90%的客户。前10%的客户提升度为5倍,营销组A的成功率约为对照组D的9倍。
我行业务部门开展了为期1个月的大额存单交叉营销活动,最终大额存单销售量为近500位客户,购买大额存单近600笔,认购总金额2亿多元,人均认购金额超过50万元。购买客户中,AUM月均较上月新增的客户近400位,占比约78%,AUM提升金额近5000万元,高于中高端客户平均增幅,带动了分行开门红个人存款及客户发展工作。
1.2 信用卡账单分期
1.2.1建模样本及目标变量定义
针对最近两年有消费的信用卡客户,筛选当月账单余额绝对值>1111且账单月内消费金额>1111的客户,预测其在未来一个月分期的可能性的大小。
1.2.2数据预处理
源数据包括每日卡信息表、中银卡新发卡数据表、中银卡关系表、中银卡客户信息数据、中银卡账户迟缴数据、中银卡交易数据、账单客户信息表。数据预处理主要包括变量衍生、异常值检验及处理、缺失值检验及处理三个部分组成。
变量衍生:针对客户的消费行为衍生了客户近6个月消费金额、最大消费金额、月均消费金额、分期金额、分期次数、利息次数等变量。
异常值检验及处理:数值型变量通过查看其分位数来检验,根据盖帽原则将最大值cap值P99分位数,当P99分位数为0,但最大值不为0时,将P99分位数以上的值设为1;字符型变量通过查看其分布来检验,并根据业务逻辑来处理异常值。
缺失值检验及处理:对缺失值处理同样要分数值型和字符型两部分,对应数值型变量缺失值的填充方法有总体均值填充、类均值填充、回归预测填充等,本次模型主要采用总体均值填充的方法和业务实际来填充。对字符型变量的缺失值用N来填充。
分析建模流程同大额存单交叉销售模型一致。根据模型结果,可预测出信用卡客户账单分期的可能性的大小,业务人员通过模型打分的筛选结果进行精准营销,取得了良好的业务成效:根据模型结果拨打账单分期响应率高的前60%的客户基本可覆盖98%的分期客户。通过近10个月电话外呼对每月符合账单分期的客户进行卡户分期营销,项目期间卡户分期累计新增交易额近7亿元,同比增长20.5%,实现手续费收入近4000万元,同比增长24%,手续费贡献占比37.7%。
2 风险预警
随着互联网金融迅速崛起,各家商业银行纷纷研究大数据风控的应用场景,笔者结合大数据、人工智能、银行风险防控等技术,为银行加强金融风险管控,保护客户资金安全提供保障。
2.1 中高端客户流失预警模型
我行2016年一季度中高端客户降级流失率为20%左右,中高端客户的流失导致的损失是比较严重的,为预测中高端客户流失的可能性,需找出潜在的流失客户,支撑客户经理的维护工作,定制差异化的产品、服务和营销策略来挽留客户,以防客户流失。
经过对历史数据的分析验证,建模样本及目标变量的定义为:当前6个月资产月日均20万以上,且相对前6个月资产减少不超过50%的客户,未来6个月任意月份资产月日均减少90%以上的可能性的大小。
数据预处理及分析建模流程同大额存单交叉销售模型一致。模型上线后的样本外数据验证结果前10%客户提升度为3倍,同建模结果基本一致。经过模型评分的数据支持,近半年分行客户降级流失率减少5%,挽回近5000万的资产。
此模型的结果同时部署到分行大数据平台midas工具中,利用大数据平台的分布式计算能力,能够实时的得到模型打分结果,并将客户的一些影响流失的重要指标情况实时的反馈给客户经理。下一步,我们将基于此建模方法利用大数据平台的midas进行机器学习,不断的对模型结果进行迭代优化,形成客户流失预警模型的闭环营销流程。
2.2 信用卡疑似套现评分模型
信用卡套现行为给银行带来了呆坏账的风险,需要通过系统智能化的识别,根据持卡人及商户的交易行为特征,建立疑似套现模型,提高疑似套现卡片的甄别率及工作效率的同时,降低银行风险敞口。
通过分析客户最近6个月的消费情况,对客户是否存在套现给定一个评分,该模型是一个经验模型。
为此引入两个概念,客户在某商户的大额交易:客户在商户交易单笔金额大于3000元;客户在某商户的可疑金额:最近6个月,客户在某商户大额交易笔数至少3笔,且累计交易金额大于等于50000元。
信用卡套现主要从客户角度和商户角度入手,如果商户涉嫌套现,那么商户消费金额中有很大比重来自套现,再引入商户可疑度指标,设为ε,商户可疑度=所有客户在该商户的可疑消费金额/该商户的所有消费金额。涉嫌套现的商户一般不正规、不知名、手续费较低。
对商户信息进行清洗和分类,引入白名单,在知名商户的消费不计入套现。不可疑商户标准:普通商户可疑度<0.25;房车商户可疑度<0.3;第三方支付商户可疑度<0.1;批发类商户可疑度<0.15。
如果客户涉嫌套现,其在可疑商户消费金额的比重就较大,引入指标α,β,γ,定义M为客户的总消费金额,Mi为客户在某商户的可疑金额,Mj为客户在某商户的可疑金额2,即最近6个月内,客户在某商户至少5个月有大额交易,且累计交易金额>=5万元。Mx为客户的可疑金额,定义为客户在所有商户的可疑金额之和。
(1)
(2)
(3)
这样,我们初步得到评分公式
(4)
同时经过分析我们发现,取现越多和在知名商户的消费越多,客户套现的概率越低,最后我们得到优化的评分公式
(5)
n1:最近6个月内,客户在可疑商户每笔消费3000元以上的次数。
n2:最近6个月内,客户在可疑商户每笔消费9900元以上的次数。
模型应用于信用卡高额度客户排查、套现排查、套取积分等排查工作中,按模型提供数据,已开展对套现评分最高的500张卡片进行排查,共处置近90张卡片,成功率为业务经验排查的6倍,为分行优化信用卡资产结构及客户质量、有效遏制不良资产新增的提供有效的决策支持。
3 运营优化
在构建了网点选址优化模型后,对其中四家支行的选址进行了对比分析。该模型主要基于客户位置、属性及商圈经济等数据的人流分析、潜在客户分析、位置画像分析、人群画像分析和应用偏好分析,提供金融网点评估建议,作为网点选址优化的依据。
3.1 人流分析
分析人流密度及分布,主要评估人口类型是居住人口、工作人口还是流动人口。
3.2 潜在客户分析
分析客户的活动区域分布、客户的基本属性信息、消费信息等数据。通过look-alike相似人群扩展机器学习算法,将高PA客户群作为种子用户,作为机器学习的正样本,剩下的客户则为负样本。从而将上述问题转化为一个二分类的模型,正负样本组成学习的样本。经过对模型的训练,利用模型结构对客户进行打分,最终得到我们想要的潜在高PA客户群。即根据相似人群的扩大,寻找出符合业务的潜在客群。
3.3 位置画像分析
通过对周边资源的分析,以及金融同业的分析,评估周边交通便利层度。
3.4 人群画像分析
主要分析客户的年龄、性别、学历、职业、婚育状况、车辆情况、应用使用偏好、消费品位、消费品类等多维度。
3.5 应用偏好分析
这里我们着重分析客户对金融类APP的偏好,主要包括金融同业、互联网金融机构等消费倾向的分析。
四家支行从上述五个方面对比分析发现:四家支行的定位差别很大,支行1处于核心区域,位置环境优越,人群质量和业务都占优,潜在客户群大,各方面都具有明显的优势;支行2和支行3处于人口密集区,中国银行手机银行APP安装率较高,说明老客群体相对较多,50岁以上人群在四个支行中人群占比最高;支行4相对于其他三个支行劣势较多。
4 结 语
大数据挖掘可让金融机构更加了解客户,在一段时间内,大数据在金融应用中还将以营销、风控和运营为主要场景。未来,金融机构在合规的前提下,将引入更多维度的外部数据,在大数据分析挖掘取得的成效的基础上,一方面丰富数据指标体系,进行模型的优化工作,全口径掌握客户使用银行产品和服务的状态,以及与其他客户的关系,对客户进行全视角的风险评估;另一方面,充分利用大数据平台计算架构的优势,基于大数据平台的分布式计算能力进行机器学习,为业务发展提供实时的决策与支持。
发表于:《计算机应用与软件》 2017(9)
PS:网舟科技,长期专注于金融保险、通信、航空、互联网、旅游酒店等行业的电子渠道大数据运营,为客户提供全球领先的电子渠道转型咨询、大数据挖掘和应用定制服务,助力客户互联网转型,提升数字化运营和数据营销能力。
- ?
大数据-数据挖掘概述
猪猪妹
展开
数据挖掘是指在大量的数据中挖掘出信息,通过认真分析来揭示数据之间有意义的联系、趋势和模式。而数据挖掘技术就是指为了完成数据挖掘任务所需要的全部技术。金融、零售等企业已广泛采用数据挖掘技术,分析用户的可信度和购物偏好等。大数据研究采用数据挖掘技术,但是数据挖掘中的短期行为较多,多数是为某个具体问题研究应用技术,还无统一的理论。传统的数据挖掘技术在数据维度和规模增大时,所需资源呈现指数级增长,所以对PB级以上的大数据还需研究新的方法。
数据挖掘概述
数据挖掘是近年来伴随数据库系统的大量建立和万维网的广泛应用而发展起来的一门技术。数据挖掘是交叉性学科,它是数据库技术、机器学习、统计学、人工智能、可视化分析、模式识别等多门学科的融合,如下图所示。
数据挖掘的几个概念
数据挖掘
数据挖掘是指从大量的、不完全的、有噪声的、模糊的、随机的实际数据中,提取隐含其内的、人们实现所不知的,但又是有潜在价值的信息和知识的过程。几点说明如下。
数据挖掘涉及数据融合、数据分析和决策支持等内容。数据源必须是真实的、大量的、含有噪声的、用户感兴趣的数据。发现的知识要可接受、可理解、可运用,并不要求发现放之四海而皆准的知识,仅支持特定的问题。数据是知识的源泉,将概念、规则、模式、规律和约束等视为知识,这就好像从矿石中采矿或淘金一样,从数据中获取知识。原始数据可以是结构化数据,如关系型数据库中的数据等,也可以是非结构化数据,如文本、图形和图像等,还可以是半结构化数据,如网页等。挖掘知识的方法可以是数学的方法,也可以是非数学的方法;可以是演绎的方法,也可以是归纳的方法。挖掘的知识具有应用的价值,可以用于信息管理、查询优化、决策支持和过程控制等,还可以用于数据自身的维护。数据挖掘是一门交叉学科,将人们对数据的应用从低层次的简单查询,提升到从数据中挖掘知识,提供决策支持。在需求推动下,不同领域的研究者,尤其是数据库技术、人工智能技术、数理统计、可视化技术、并行计算等方面的知识融合后,形成新的研究热点。
数据的挖掘首先是搜集数据,数据越丰富越好,数据量越大越好,只有获得足够的高质量的数据,才能获得确定的判断,才能产生认知模型,这是量变到质变的过程。由此产生经验,经验的积累就能产生有价值的判断。认知模型是渐进发展的模型,当认识深入以后,将长生更加抽象的模型与许多猜想,通过猜想再扩展模型,从而达到深度学习和深度挖掘。
2. 数据挖掘分类
数据挖掘可以分为两类:直接数据挖掘和间接数据挖掘。
(1)直接数据挖掘
直接数据挖掘的目标是利用可用的数据建立一个模型,利用这个模型对剩余的数据,对一个特定的变量(可以理解成数据库中标的属性,即列)进行描述。分类、估值、预测属于直接数据挖掘。
(2)间接数据挖掘
间接数据挖掘目标中没有选出某一具体的变量,用模型进行描述,而是在所有的变量中建立起某种关系。相关性分组或关联规则、聚类、描述和可视化以及复杂数据类型挖掘。
3. 数据挖掘技术
数据挖掘技术是数据挖掘方法的集合,数据挖掘方法众多。根据挖掘任务可将数据挖掘技术分为预测模型发现、聚类分析、分类与回归、关联分析、序列模式发现、依赖关系或依赖模型发现、异常和趋势发现、离群点检测等。根据挖掘对象可分为关系数据库、面向对象数据库、空间数据库、时态数据库、文本数据源、多媒体数据库、异质数据库、遗产数据库以及环球网Web。根据挖掘方法可分为机器学习方法、统计方法、神经网络方法和数据库方法。机器学习方法中,可细分为归纳学习方法(决策树、规则归纳等)、基于范例学习、遗传算法等。统计方法中,可细分为回归分析(多元回归、自回归等)、判别分析(贝叶斯判别、费歇尔判别和非参数判别等)、聚类分析(系统聚类、动态聚类等)、探索性分析(主元分析法、相关分析法等)等。神经网络方法中,可细分为前向神经网络(BP算法等)、自组织神经网络(自组织特征映射、竞争学习等)等。数据库方法主要是多维数据分析或OLAP方法,另外还有面向属性的归纳方法。
数据挖掘应用了来自其他一些领域的思想与算法,主要包括:
统计学的抽样、估计和假设检验。人工智能、模式识别和机器学习的搜索算法、建模技术和学习理论。最优化、进化计算、信息论、信号处理、可视化和信息检索。
其他一些领域的技术也起到重要的支撑作用,需要数据库系统提供有效的存储、索引和查询处理支持。高性能计算技术、并行计算技术、分布式技术也能帮助处理数据,当数据不能集中到一起处理时更是至关重要。
- ?
作为数据挖掘师,去大数据公司还是传统行业单位,这样选!
之瑶
展开
作为刚毕业的大学生程序员,对大数据非常感兴趣,想从事大数据挖掘的工作,不知道未来前景如何,而且面临选择是去纯大数据公司还是传统行业单位的大数据分析部门。目前大数据和人工智能、物联网一样可以说是大热门。根据中国商业联合会数据分析专业委员会统计,随着大数据及AI等新兴业务的发展,未来中国基础性数据分析人才缺口将达到1400万。这是一个很大数量的缺口,所以选择大数据方向应该是不错的选择。而数据挖掘这种比较偏应用的就业前景也应该不错。
数据挖掘工程师大数据挖掘人员,要做的事情就是从数据库或其它形态的数据文档中发掘出显性或隐性的有价值的数据。除了有一定的数学统计知识等之外,还要具备一定的编程能力,熟悉开发环境等,比如Hadoop、NoSQL、Python、Java等。至于就业去向可以根据自己的性格及发展方向来确定。大数据公司、传统行业的大数据部门各有优点。
大数据大数据挖掘技术在哪里都是差不多的。大数据公司一般会承接各种行业的数据分析,从个人见多识广或大多数人的选择来说可能到大数据公司应该是比较好的选择。长期下去各行各业的数据以及业务形态等等都能够见得到,都会了解一些,而且大数据公司里收入来说相对会高一些。而且对于大数据技术的前沿知识也是很快会接触到,学得到,同行之间交流也多,成长可能更快。但除了几个规模比较大的数据分析公司之外,大部分还是比较新比较小,可能稳定性并不是太好。对于那些有冲劲,不怕冒险的人员来说是个不错的选择。
大数据另一方面如果想成为某一个行业内的专家,那么到某一个传统行业单位也许是一个好的选择。传统行业单位数据更细分,而且更专一。每天接触的,研究的都是这个行业里的数据,长久下去对这个行业更深入,通过数据更能够看到本质,更容易成为某个行业里的专家。比如卫生领域、金融领域、零售领域等等,每一个领域都会有很深的业务知识。这种大数据分析部门依附在传统行业企业里,相对来说可能收入稍低,但稳定性不错。如果人年轻把数据挖掘作为一份工作,有更高一些的收入,想学到更多的知识提升自己,或者觉得一个行业的数据太单调,那么到大数据公司也就是比较好的选择。
- ?
大数据挖掘与大数据分析一样吗?有什么区别?
贺遥
展开
大数据挖掘与大数据分析一样吗?随着大数据越来越火,与大数据相关的职位也开始粉墨登场,引人关注。作为大数据行业最为重要的两种职位,大数据挖掘和大数据分析更是受到了与众不同的待遇。现在有许多的朋友都会问:大数据挖掘和大数据分析有什么区别,不是都是搞数据的吗?在这里,魔据小编认为:尽管大数据挖掘和大数据分析同属于大户数据行业,但是依然有着很大的区别。
大数据挖掘与大数据分析一样吗?一.什么是数据
不谈数据,就无以谈大数据挖掘和大数据分析,因此,我们先说一下什么是数据。
其实很简单,数据就是观测值。例如测量数据。大家可能有个误区,认为客户填写的表单就是数据,对编程序而言,是的,但是不是常规的数据。当然填写的内容,一旦落入到观测空间,自然就成了数据。
二.什么是大数据挖掘和大数据分析
大数据挖掘指对大数据数据分析手段后的信息,进行价值化的分析。
大数据分析指对大数据的一种操作手段,或者算法。目标是针对先验的约束,对数据进行整理、筛选、加工,由此得到信息。
三.大数据挖掘和大数据分析有什么区别
大数据挖掘是对信息的价值化的获取。价值化自然不会考虑数据本身,而是考虑数据是否有价值。由此,一批数据,你尝试对它做不同的价值评估,这是大数据挖掘。
大数据分析是以输入的数据为基础,通过先验的约束,对数据进行处理,但是不以结论何如为调整。例如你需要图像识别,这个属于大数据分析。你要分析人脸,数据就是通过先验的 方法,就是出来个猫脸。你的数据分析也没有问题,你需要默默承受结果,并且尊重事实。因此大数据分析的重点在于数据的有效性、真实性和先验约束的正确性。
大数据挖掘与大数据分析一样吗?此时对比大数据分析,最大的特点就是你需要调整你不同的先验约束,再次对数据进行分析。而先验的约束已经不是针对数据来源自身的特点,例如信噪比处理算法。你期望得到的一个有价值的内容,做先验的约束,以观测,数据根据这个约束,是否有正确的反馈。
大数据挖掘与大数据分析一样吗?不管大数据挖掘和大数据分析有什么不同,这两个职位的前景都是十分好的,现在入行,正是最好的时机。
- ?
快速理解大数据,了解数据挖掘和机器学习
凄美》
展开
数据挖掘和大数据可以做什么?
简而言之,它们赋予我们预测能力。
我们的生活已经数字化了
我们每天所做的许多事情都可以记录下来。 每张信用卡交易都是数字化和可追溯的。 我们的公众形象一直受到许多中央电视台在城市各个角落的监控; 对于企业而言,大多数财务和运营数据都保存在某些类型的ERP中; 随着可穿戴设备的兴起 ,每一次心跳和呼吸都被数字化并保存为可用数据。正当我们的大部分生活被数字化时,计算机现在可以比以往更好地“理解”我们的世界。
2.如果模式保持不变,则过去=未来
我们生活中的许多不同事物都表现出模式。例如,一个人可能在任何工作日内在工作和家庭之间旅行,或者在任何非工作日去度假或看电影,这种模式不太可能改变。商店将拥有任何一天的高峰时段和闲置时间,这种模式不太可能改变。企业将在一年中的某些月份要求更高的劳动力投入,这种模式不太可能改变。
总结第1点和第2点,我们可以得出结论,如果提供过去的模式,计算机很可能预测未来,因为这些模式在很长一段时间内最可能是一致的。
如果计算机可以预测人们的生活方式,它将准确知道什么时候是适合促销的最佳时间,例如,如果这个人每周五的星期五都要洗车,或者是优惠券,那就是洗车促销如果这个人每年三月都要去度假,那就留下来。Businesswise,计算机还可以 预测商店全天的销售预测,然后制定业务战略以最大化总收入。对于企业而言,计算机还可以设计出最合理的劳动力安排的最佳运营计划。
一旦未来变得可预测,我们可以随时提前计划并为可能的最佳行动做好准备。就像“黑客帝国”中的Neo一样,他能够躲避所有的子弹,因为他可以清楚地看到子弹的来源。根据夏洛克·福尔摩斯的说法,“对概率数学的高级掌握,对人类心理学的彻底理解,以及任何特定个体的已知倾向都可以大大减少变量的数量”,换句话说,“大数据给了我们预测未来的力量“。 这是数据挖掘的力量。数据挖掘始终与大数据联系在一起,因为大数据支持大量数据集,从而为所有预测提供了基础。
那么,大数据,数据挖掘和机器学习到底是什么?
大数据
当数据量巨大时,很明显这些数据无法在任何一台机器上处理。一个非常大的文件,比方说10GB,你可能无法在任何Windows系统中打开它,然后崩溃整个事情。 为此目的开发了大数据。您可以将其视为一种特殊的软件,它将大文件拆分为更小的文件,然后可以在多台计算机上进行处理。分割和组合数据片段的过程称为MapReduce。最常用于此过程的软件框架,称为Hadoop。Hadoop解决了基本问题,并且有许多工具可以与Hadoop一起使用,例如Pig,Zookeeper和Hive,以使过程更加容易。Hadoop连同它的许多相关工具通常被称为“大数据技术”。
机器学习
刚才我们根据一块数据的处理方式进行了触摸。假设这条数据包含一组购物者的购买行为,包括购买的商品总数,每个购物者购买的商品数量。这是迄今为止简单的统计分析。但是,如果我们的目标是分析不同类型的购物者之间的相关性,或者如果我们想要推断特定类型的购物者的特定偏好,或者甚至预测任何购物者的性别或年龄,我们将需要更多复杂的模型,我们称之为算法。机器学习可以更容易理解为为数据挖掘目的而开发的所有不同类型的算法,例如逻辑回归,决策树,协同过滤等等。
数据挖掘
通过应用机器学习算法,现有数据实际上可用于预测未知数,这正是数据挖掘的奇迹与机器学习密切相关的原因。然而,任何机器学习算法的强度在很大程度上取决于大量数据集的供应。请记住,无论算法有多复杂,都不能从几行数据中做出灵感预测。大数据技术是机器学习的前提,通过使用机器学习,我们能够从现有数据集中获得有价值的见解,这就是数据挖掘。
- ?
大数据的5大经典案例,挖掘数据背后的价值
觉主
展开
大数据时代的来临,使得企业在业务运作的过程中产生的数据量呈现出了爆发式的增长。各行各业都面临着海量数据的分析和处理问题。如何运用大数据技术从海量数据中挖掘出有价值的信息,将是今后企业发展的一个巨大挑战。我们在迎接挑战的同时,也可以了解、学习国内外大数据应用中的经典案例,希望能对我们有所启示。
01 塔吉特(Target)百货孕妇营销分析
最早关于大数据的故事发生在美国第二大超市塔吉特(Target)百货。孕妇对于零售商来说一直是个含金量很高的顾客群体,但是她们一般都会去专门的孕妇商店。人们一提起塔吉特,往往想到的都是日常生活用品,却忽视了塔吉特也有孕妇需要的一切。在美国,出生记录是公开的,等孩子出生了,新生儿母亲就会被铺天盖地的产品优惠广告包围。如果等到孩子出生再行动就晚了,因此零售商必须赶在孕妇怀孕前期就行动起来。
塔吉特的顾客数据分析部门发现,怀孕的妇女一般会在怀孕第三个月的时候购买很多无香乳液、无添加的化妆品、护肤品等等。几个月后,她们会购买镁、钙、锌等营养补充剂。根据数据分析部门提供的模型,塔吉特制订了全新的广告营销方案,在孕期的每个阶段给客户寄送相应的优惠券。结果,孕期用品销售呈现了爆炸性的增长。2002年到2010年间,塔吉特的销售额从440亿美元增长到了670亿美元。大数据的巨大威力轰动了全美。
02 谷歌的意图
如果说有一家科技公司准确定义了“大数据”概念的话,那一定是谷歌。根据搜索研究公司comScore的数据,仅2012年3月一个月的时间,谷歌处理的搜索词条数量就高达122亿条。谷歌的体量和规模,使它拥有比其他大多数企业更多的应用大数据的途径。
谷歌搜索引擎本身的设计,就旨在让它能够无缝链接成千上万的服务器。如果出现更多的处理或存储需要,抑或某台服务器崩溃,谷歌的工程师们只要再添加更多的服务器就能轻松搞定。将所有这些数据集合在一起所带来的结果是:企业不仅从最好的技术中获益,同样还可以从最好的信息中获益。下面选择谷歌公司的其中三个亮点。
谷歌意图:谷歌不仅存储了搜索结果中出现的网络连接,还会储存用户搜索关键词的行为,它能够精准地记录下人们进行搜索行为的时间、内容和方式,坐拥人们在谷歌网站进行搜索及经过其网络时所产生的大量机器数据。这些数据能够让谷歌优化广告排序,并将搜索流量转化为盈利模式。谷歌不仅能追踪人们的搜索行为,而且还能够预测出搜索者下一步将要做什么。用户所输入的每一个搜索请求,都会让谷歌知道他在寻找什么,所有人类行为都会在互联网上留下痕迹路径,谷歌占领了一个绝佳的点位来捕捉和分析该路径。换言之,谷歌能在你意识到自己要找什么之前预测出你的意图。这种抓取、存储并对海量人机数据进行分析,然后据此进行预测的能力,就是数据驱动的产品。
03 沃尔玛的“啤酒加尿布”
总部位于美国阿肯色州的世界著名商业零售连锁企业沃尔玛拥有世界上最大的数据仓库系统。为了能够准确了解顾客在其门店的购买习惯,沃尔玛对顾客的购物行为进行了“购物篮分析”。沃尔玛数据仓库里集中了其各门店的详细原始交易数据,在这些原始交易数据的基础上,沃尔玛利用NCR数据挖掘工具对这些数据进行分析和挖掘,可以很轻松地知道顾客经常一起购买的商品有哪些。一个意外的发现是:“跟尿布一起购买最多的商品竟是啤酒!”
这是数据挖掘技术对历史数据进行分析的结果,反映了数据内在的规律。沃尔玛派出市场调查人员和分析师对这一数据挖掘结果进行调查分析。经过大量实际的调查和分析,揭示了隐藏在“尿布与啤酒”背后的美国人的一种行为模式:在美国,一些年轻的父亲下班后经常要到超市去买婴儿尿布,而他们中有30%-40%的人同时也为自己买一些啤酒。产生这一现象的原因是:美国的太太们常叮嘱她们的丈夫下班后为小孩买尿布,而丈夫们在买尿布后又随手带回了他们喜欢的啤酒。
既然尿布与啤酒一起被购买的机会很多,于是沃尔玛就在其一个个门店将尿布与啤酒摆放在一起,结果是尿布与啤酒的销售量双双增长。
04 中国移动的数据化运营
通过大数据分析,中国移动能够对企业运营的全业务进行针对性的监控、预警、跟踪。大数据系统可以在第一时间自动捕捉市场变化,再以最快捷的方式推送给指定负责人,使他在最短时间内获知市场行情。
客户流失预警:一个客户使用最新款的诺基亚手机,每月准时缴费、平均一年致电客服3次,使用WEP和彩信业务。如果按照传统的数据分析,可能这是一位客户满意度非常高、流失概率非常低的客户。事实上,当搜集了包括微博、社交网络等新型来源的客户数据之后,这位客户的真实情况可能是这样的:客户在国外购买的这款手机,手机中的部分功能在国内无法使用,在某个固定地点手机经常断线,彩信无法使用——他的使用体验极差,正在面临流失风险。这就是中国移动一个大数据分析的应用场景。通过全面获取业务信息,可能颠覆常规分析思路下做出的结论,打破传统数据源的边界,注重社交媒体等新型数据来源,通过各种渠道获取尽可能多的客户反馈信息,并从这些数据中挖掘更多的价值。
数据增值应用:对运营商来说,数据分析在政府服务市场上前景巨大。运营商也可以在交通、应对突发灾害、维稳等工作中使大数据技术发挥更大的作用。运营商处在一个数据交换中心的地位,在掌握用户行为方面具有先天的优势。作为信息技术的又一次变革,大数据的出现正在给技术进步和社会发展带来全新的方向,而谁掌握了这一方向,谁就可能成功。对于运营商来说,在数据处理分析上,需要转型的不仅是技巧和法律问题,更需要转变思维方式,以商业化角度思考大数据营销。
05 阿里信用贷款和淘宝数据魔方
中国最大的电子商务公司阿里巴巴已经在利用大数据技术提供服务:阿里信用贷款与淘宝数据魔方。
每天有数以万计的交易在淘宝上进行。与此同时相应的交易时间、商品价格、购买数量都会被记录。更重要的是,这些信息可以与买方和卖方的年龄、性别、地址、甚至兴趣爱好等个人特征信息相匹配。各大中小城市的百货大楼做不到这一点,大大小小的超市做不到这一点,而互联网时代的电商可以做到。
淘宝数据魔方就是淘宝平台上的大数据应用方案。通过这一服务,商家可以了解淘宝平台上的行业宏观情况、自己品牌的市场状况、消费者行为情况等,并可以据此进行生产、库存决策,而与此同时,更多的消费者也能以更优惠的价格买到心仪的宝贝。
而阿里信用贷款则是阿里巴巴通过其掌握的企业交易数据,借助大数据技术自动分析判定是否给予企业贷款,全程不会出现人工干预。截至目前,阿里巴巴已经放贷300多亿元,坏账率约0.3%左右,大大低于商业银行。
大数据挖掘数据
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并