中企动力 > 商学院 > 大数据数据挖掘
  • ?

    探索大数据挖掘技术在商业银行领域的应用

    吴梦菲

    展开

    摘 要:由于大数据的快速发展,传统的以业务经验模式进行的数据库营销面临极大挑战。针对这种情况,提出基于大数据的数据挖掘技术方法。首先了解业务需求,根据业务目标设计模型,接着进行数据整合、数据清洗等,然后建立模型、对模型结果进行评估。实验结果表明,应用大数据挖掘技术能有效的提高精准营销的成功率、进行风险防控以及运营优化管理。

    引 言

    随着大数据时代的到来,商业银行数据资产的价值也愈发显得更加重要,为此,探索数据的应用场景和商业模式,建立技术平台,推动商业银行从传统数据库营销到数据化运营,最终到运营数据的转变,成为各家商业银行重点工作。笔者所在的银行依托分行大数据平台,致力于大数据+人工智能+数据挖掘的探索与研究,从2014年就启动了数据挖掘的相关工作,开发了卡分期模型、信用卡疑似套现评分模型、信用卡客户流失预警模型、信用卡逾期预警模型、网点选址优化模型、大额存单交叉营销模型、中高端客户流失预警模型等。下面就精准营销、风险预警、运营优化三个主要应用场景介绍近三年运用大数据挖掘技术建模实践的成效。

    1 精准营销

    我行基于大数据平台丰富的数据来源及高效的分布式计算技术,通过逻辑回归、决策树、神经网络、支持向量机等机器学习算法,结合业务目标进行分析挖掘、构建模型、制定精准营销方案与策略。下面以大额存单交叉销售模型和信用卡账单分期模型为例简要介绍建模方法及收效。

    1.1 大额存单交叉销售模型

    个人大额存单产品自推广以来,维持了较高的存款贡献与客户层级上升贡献,是分行应对同业竞争、拓展存款和客户的技术手段和措施。为更好地推动大额存单客户群的维护与拓展,争揽客户行外资金,亟需通过该交叉销售模型找出高响应的客户进行大额存单精准营销活动。

    1.1.1建模样本及目标变量定义

    建模样本定义为资产5万-100万的客户,模型的目标变量定义为首次购买大额存单的客户。时间窗口定义:观察期,6个月;表现期,3个月,经统计分析,样本的目标变量过少,为此,我们将两个观察期和表现期的数据分布叠加起来,重新整合样本后进行建模。

    1.1.2数据预处理

    源数据来自客户基础属性、客户持有产品、客户交易行为、客户基础属性变化、客户持有产品变化、贷款信息、代发薪信息、跨行转账信息等数据。数据预处理主要包括变量衍生、异常值检验及处理、缺失值检验及处理三个部分组成。

    变量衍生:指根据业务的一些经验值和数据分析结果,主要针对客户交易行为衍生了分渠道、分产品每月的交易金额最大值、均值、最小值及每个产品和渠道对应的交易趋势等变量。

    异常值检验及处理:异常值是指一个变量的值非常极端或者出现频率非常低。对于一般的数值型变量根据盖帽原则,将最大值cap值P99分位数;有业务实际意义的,根据业务逻辑来处理。对应字符型变量通过查看其分布来检验,并根据业务逻辑来处理异常值。

    缺失值检验及处理:对缺失值处理同样要分数值型和字符型两部分,对应数值型变量缺失值的填充方法有总体均值填充、类均值填充、回归预测填充等,本次模型主要采用总体均值填充的方法和业务实际来填充。对字符型变量的缺失值我们用N来填充。

    1.1.3分析建模

    变量首次筛选:由于源变量较多,首次筛选去掉那些对目标变量影响不大的变量将会减少后续工作量。结合变量的IV值和单个变量进入逻辑回归模型的结果,筛选出相对重要的变量。

    变量分组:由于LOGISTIC回归只能对数值型变量进行建模,对字符型变量需要预处理或分组衍生出哑变量,同样的对数值型变量也做了分组处理。我们在目标变量的监督下,对变量进行分组处理。并将分组结果转换为变量对应的woe值。

    变量二次筛选:对转换为woe值后的变量做共线性诊断,剔除相关性较强的变量。

    模型开发:首先将建模样本分为训练集和验证集,采用逐步回归的方法进行LOGISTIC回归的开发。基于此模型结果我们可以预测出资产5-100万的客户首次购买大额存单的可能性的大小。根据模型的评分结果,给定营销组A、B和对照组C、D,其中A和C是响应率前10%的客户,B和D组是响应率后90%的客户。前10%的客户提升度为5倍,营销组A的成功率约为对照组D的9倍。

    我行业务部门开展了为期1个月的大额存单交叉营销活动,最终大额存单销售量为近500位客户,购买大额存单近600笔,认购总金额2亿多元,人均认购金额超过50万元。购买客户中,AUM月均较上月新增的客户近400位,占比约78%,AUM提升金额近5000万元,高于中高端客户平均增幅,带动了分行开门红个人存款及客户发展工作。

    1.2 信用卡账单分期

    1.2.1建模样本及目标变量定义

    针对最近两年有消费的信用卡客户,筛选当月账单余额绝对值>1111且账单月内消费金额>1111的客户,预测其在未来一个月分期的可能性的大小。

    1.2.2数据预处理

    源数据包括每日卡信息表、中银卡新发卡数据表、中银卡关系表、中银卡客户信息数据、中银卡账户迟缴数据、中银卡交易数据、账单客户信息表。数据预处理主要包括变量衍生、异常值检验及处理、缺失值检验及处理三个部分组成。

    变量衍生:针对客户的消费行为衍生了客户近6个月消费金额、最大消费金额、月均消费金额、分期金额、分期次数、利息次数等变量。

    异常值检验及处理:数值型变量通过查看其分位数来检验,根据盖帽原则将最大值cap值P99分位数,当P99分位数为0,但最大值不为0时,将P99分位数以上的值设为1;字符型变量通过查看其分布来检验,并根据业务逻辑来处理异常值。

    缺失值检验及处理:对缺失值处理同样要分数值型和字符型两部分,对应数值型变量缺失值的填充方法有总体均值填充、类均值填充、回归预测填充等,本次模型主要采用总体均值填充的方法和业务实际来填充。对字符型变量的缺失值用N来填充。

    分析建模流程同大额存单交叉销售模型一致。根据模型结果,可预测出信用卡客户账单分期的可能性的大小,业务人员通过模型打分的筛选结果进行精准营销,取得了良好的业务成效:根据模型结果拨打账单分期响应率高的前60%的客户基本可覆盖98%的分期客户。通过近10个月电话外呼对每月符合账单分期的客户进行卡户分期营销,项目期间卡户分期累计新增交易额近7亿元,同比增长20.5%,实现手续费收入近4000万元,同比增长24%,手续费贡献占比37.7%。

    2 风险预警

    随着互联网金融迅速崛起,各家商业银行纷纷研究大数据风控的应用场景,笔者结合大数据、人工智能、银行风险防控等技术,为银行加强金融风险管控,保护客户资金安全提供保障。

    2.1 中高端客户流失预警模型

    我行2016年一季度中高端客户降级流失率为20%左右,中高端客户的流失导致的损失是比较严重的,为预测中高端客户流失的可能性,需找出潜在的流失客户,支撑客户经理的维护工作,定制差异化的产品、服务和营销策略来挽留客户,以防客户流失。

    经过对历史数据的分析验证,建模样本及目标变量的定义为:当前6个月资产月日均20万以上,且相对前6个月资产减少不超过50%的客户,未来6个月任意月份资产月日均减少90%以上的可能性的大小。

    数据预处理及分析建模流程同大额存单交叉销售模型一致。模型上线后的样本外数据验证结果前10%客户提升度为3倍,同建模结果基本一致。经过模型评分的数据支持,近半年分行客户降级流失率减少5%,挽回近5000万的资产。

    此模型的结果同时部署到分行大数据平台midas工具中,利用大数据平台的分布式计算能力,能够实时的得到模型打分结果,并将客户的一些影响流失的重要指标情况实时的反馈给客户经理。下一步,我们将基于此建模方法利用大数据平台的midas进行机器学习,不断的对模型结果进行迭代优化,形成客户流失预警模型的闭环营销流程。

    2.2 信用卡疑似套现评分模型

    信用卡套现行为给银行带来了呆坏账的风险,需要通过系统智能化的识别,根据持卡人及商户的交易行为特征,建立疑似套现模型,提高疑似套现卡片的甄别率及工作效率的同时,降低银行风险敞口。

    通过分析客户最近6个月的消费情况,对客户是否存在套现给定一个评分,该模型是一个经验模型。

    为此引入两个概念,客户在某商户的大额交易:客户在商户交易单笔金额大于3000元;客户在某商户的可疑金额:最近6个月,客户在某商户大额交易笔数至少3笔,且累计交易金额大于等于50000元。

    信用卡套现主要从客户角度和商户角度入手,如果商户涉嫌套现,那么商户消费金额中有很大比重来自套现,再引入商户可疑度指标,设为ε,商户可疑度=所有客户在该商户的可疑消费金额/该商户的所有消费金额。涉嫌套现的商户一般不正规、不知名、手续费较低。

    对商户信息进行清洗和分类,引入白名单,在知名商户的消费不计入套现。不可疑商户标准:普通商户可疑度<0.25;房车商户可疑度<0.3;第三方支付商户可疑度<0.1;批发类商户可疑度<0.15。

    如果客户涉嫌套现,其在可疑商户消费金额的比重就较大,引入指标α,β,γ,定义M为客户的总消费金额,Mi为客户在某商户的可疑金额,Mj为客户在某商户的可疑金额2,即最近6个月内,客户在某商户至少5个月有大额交易,且累计交易金额>=5万元。Mx为客户的可疑金额,定义为客户在所有商户的可疑金额之和。

    (1)

    (2)

    (3)

    这样,我们初步得到评分公式

    (4)

    同时经过分析我们发现,取现越多和在知名商户的消费越多,客户套现的概率越低,最后我们得到优化的评分公式

    (5)

    n1:最近6个月内,客户在可疑商户每笔消费3000元以上的次数。

    n2:最近6个月内,客户在可疑商户每笔消费9900元以上的次数。

    模型应用于信用卡高额度客户排查、套现排查、套取积分等排查工作中,按模型提供数据,已开展对套现评分最高的500张卡片进行排查,共处置近90张卡片,成功率为业务经验排查的6倍,为分行优化信用卡资产结构及客户质量、有效遏制不良资产新增的提供有效的决策支持。

    3 运营优化

    在构建了网点选址优化模型后,对其中四家支行的选址进行了对比分析。该模型主要基于客户位置、属性及商圈经济等数据的人流分析、潜在客户分析、位置画像分析、人群画像分析和应用偏好分析,提供金融网点评估建议,作为网点选址优化的依据。

    3.1 人流分析

    分析人流密度及分布,主要评估人口类型是居住人口、工作人口还是流动人口。

    3.2 潜在客户分析

    分析客户的活动区域分布、客户的基本属性信息、消费信息等数据。通过look-alike相似人群扩展机器学习算法,将高PA客户群作为种子用户,作为机器学习的正样本,剩下的客户则为负样本。从而将上述问题转化为一个二分类的模型,正负样本组成学习的样本。经过对模型的训练,利用模型结构对客户进行打分,最终得到我们想要的潜在高PA客户群。即根据相似人群的扩大,寻找出符合业务的潜在客群。

    3.3 位置画像分析

    通过对周边资源的分析,以及金融同业的分析,评估周边交通便利层度。

    3.4 人群画像分析

    主要分析客户的年龄、性别、学历、职业、婚育状况、车辆情况、应用使用偏好、消费品位、消费品类等多维度。

    3.5 应用偏好分析

    这里我们着重分析客户对金融类APP的偏好,主要包括金融同业、互联网金融机构等消费倾向的分析。

    四家支行从上述五个方面对比分析发现:四家支行的定位差别很大,支行1处于核心区域,位置环境优越,人群质量和业务都占优,潜在客户群大,各方面都具有明显的优势;支行2和支行3处于人口密集区,中国银行手机银行APP安装率较高,说明老客群体相对较多,50岁以上人群在四个支行中人群占比最高;支行4相对于其他三个支行劣势较多。

    4 结 语

    大数据挖掘可让金融机构更加了解客户,在一段时间内,大数据在金融应用中还将以营销、风控和运营为主要场景。未来,金融机构在合规的前提下,将引入更多维度的外部数据,在大数据分析挖掘取得的成效的基础上,一方面丰富数据指标体系,进行模型的优化工作,全口径掌握客户使用银行产品和服务的状态,以及与其他客户的关系,对客户进行全视角的风险评估;另一方面,充分利用大数据平台计算架构的优势,基于大数据平台的分布式计算能力进行机器学习,为业务发展提供实时的决策与支持。

    发表于:《计算机应用与软件》 2017(9)

    PS:网舟科技,长期专注于金融保险、通信、航空、互联网、旅游酒店等行业的电子渠道大数据运营,为客户提供全球领先的电子渠道转型咨询、大数据挖掘和应用定制服务,助力客户互联网转型,提升数字化运营和数据营销能力。

  • ?

    领先大数据企业数据挖掘第四讲:打通数据挖掘的任督二脉(下)

    王小翠

    展开

    上期数据挖掘课堂,我们和大家分享了数据挖掘的流程,但要想成为数据挖掘的“高手”,打通数据挖掘的任督二脉,你还需要get更多数据挖掘的方法和招式!

    图片来自互联网

    六脉神剑——击破数据挖掘方法

    六脉神剑,大理段氏的最高武学,其指力所能及的地方,有如一柄无形的剑,无论是横扫或虚指,均可伤敌。在上期了解数据挖掘的体系与流程之后,要想熟练掌握数据挖掘的核心技能,以下这些方法可要记牢喽!

    (一)聚类(Clustering)

    聚类是将一群事物进行划分,使其归纳到不同群体的过程,即将物理或抽象对象的集合分成由类似的对象组成的多个类的过程。聚类分析是研究分类问题的一种统计分析方法,聚类所要求划分的类是未知的,这也是其与分类的最大区别,聚类是刚开始不能确定每一类的具体特征,需要通过聚合后再总结,发现共同点。聚类分析内容非常丰富,包括系统聚类法、有序样品聚类法、动态聚类法、模糊聚类法、图论聚类法、聚类预报法等。聚类常用于解决用户细分问题,其算法简单,但要达到好的结果却很难。聚类结果的好坏与选择细分的变量有直接关系,深入的需求和业务理解,对聚类的结果将有较大提升。

    (二)关联(Association)

    关联规则是描述两种事物之间关联关系的过程,是形如X→Y的蕴涵式,X和Y分别称为关联规则的先导(antecedent或left-hand-side, LHS)和后继(consequent或right-hand-side, RHS)。在应用关联规则时,要注意两点:关联不一定是因果,关联是有方向的。应用关联规则经常会和相关(Correlation)联系在一起,相关也是考虑两个事物之间的关系。关联最早用在零售行业的产品推荐营销中,后续在不同行业都有扩展,例如电商的捆绑营销、交叉营销、互联网增值产品的交叉营销等。

    (三)分类(Classification)

    分类是将事物进行归类的一种方法,即从历史的样本数据推算出未来数据趋势的过程,分类在数据挖掘中是一项非常重要的任务。分类预测的方法有多种,常用的有回归、决策树、神经网络。分类预测常应用于识别潜在用户的问题,如用户流失预警、增值产品订购等问题。分类预测原理较为简单,如下图所示:

    分类预测需关注以下几个问题:

    1、属于预测的一种特殊形式

    2、事先有一个目标分类:1/0或者A/B/C

    3、需要有已知目标分类的历史样本来训练模型

    4、对目标分类未知的样本预测他们所属的分类(概率)

    (四)预测(Prediction)

    预测是推断事物未来发展可能性的过程,预测的常用方法是时间序列,也可以用回归的方法来预测。时间序列常用的方法有:ARMA、指数平滑和趋势外推等。其最大特点就是充分挖掘事物本身随时间变化的规律,任何事物,比如企业销售额,在没有特别的外在因素影响的情况下,总是有规可循的。

    做预测前需要考虑以下问题:

    1、预测值不是实际值:未来永远不可能和过去一致,对于过去数据的趋势和关系推断,并不能提供未来一定会发生的数值;数据上完善的或复杂的完全适合历史数据的数据模型也不一定可以精确的预测未来;

    2、误差可以被减小:多种模型组合取预测值的平均值,可以有效减小误差;同时,一些简单的模型,即使不能很好的拟合历史数据,也可能实现预较好的测效果。

    3、预测的核心在于管理而不是预测本身:预测值,在尽量高精度下,更应该解决管控的问题;比如收入预测,得到未来周期的预测值,预判我们是否能够完成KPI或者达到我们的目标,进而对当前营销活动提前干预。

    分类与预测是两种数据分析形式,它们可用于抽取能够描述重要数据集合或预测未来数据趋势的模型。分类方法用于预测数据对象的离散类别;而预测则用于预测数据对象的连续取值。

    (五)描述统计(Descriptive statistics)

    简单来说,描述性统计就是对数据的某种特征进行分析的过程,例如数量、平均数、标准值、中位数等,其目的是便于描述测量样本的各种特征,以及它所代表的总体特征。描述统计是复杂统计分析的基础,虽然看似简单,但却是数据挖掘的入门兵器,直观、简单,高手常常用来摘叶飞花。描述统计包括平均数、中位数、众数、分位数、百分比、求和等,经常和统计图配合使用。

  • ?

    大数据环境中常见的针对数据挖掘和数据分析的疑惑与职业选择

    Marvin

    展开

    在大数据的环境下,有许多人都在询问数据分析与数据挖掘有什么区别?数据挖掘与爬虫有什么区别?这样的问题。实际上数据挖掘是对数据源以及数据原始取得的一个过程,而数据分析是对挖掘来的数据进行整理清洗,以及有规律的将它进行展现。那么有性质上来讲,他们就是两个不同的工种。但是在许多人力资源匮乏的公司,这两个职位或者说是两个岗位,他们通常是一个人在操作。由此给公众带来的疑惑和忧虑就是,他们可能是同一个职业。但是从本质和它的岗位设定来讲,本身是两个完全不同的职业。

    我们分清了这两个岗位的不同之后,接下来便是职业选择。数据挖掘比较偏向于完完全全的技术类型,尤其是中高端偏向型技术。它除了涉及到一些简单需要爬取的数据比较容易去获得以外,其他的都需要构架和构思。这不是普通的爬取工具所能够代替或者取代的一个岗位。他需要有一个严格的逻辑思维和一个,严谨的方案,才能去执行深度的挖掘的过程。而数据分析的过程就相对来讲门槛比较低,从最简单的办公office旗下的Excel软件都可以实现对一些数据的简单的分析,提取,筛选,以及简单的处理。

    职业内容

    以上两种职业,无论是从岗位的设定,还是实际操作中的一些流程。对于初学大数据分析或出血到数据挖掘的人来讲,必然是一个难以接受和难以恒定的一个理论或者概念。其实无需疑惑,他们两个岗位有什么区别,因为他们之间有一些共通之处就是,接触的全是数字,或者是树型数组。有区别的就是前台与后端的东西。但是如果这两个技术,无论你要去如何的生活,都是需要去了解数据库,或者熟练的掌握其中一项数据库的技能。在未来便能在未来的大数据分析领域中有一席之地。

    由此可以衍生出来的一个问题就是,什么样的年龄什么样的人,什么样的水平适合去,操作大数据或者系从事大数据相关岗位和相关职业设定的问题。那么我们将在下一篇或下一个章节来单独对这个问题进行讲解。(在此处特别声明的是,在文章中所出现的一些原创性的内容,严禁任何人以任何形式进行分发和复制到其他平台,如需使用,请注明出处,谢谢!)

  • ?

    什么是农业大数据挖掘技术?

    沧颜

    展开

    农业大数据挖掘

    建立农业大数据平台,采集并存储大量的历史数据,外部数据,最终是为了让农业生产更智能,更高效。因此,需要运用先进的数据挖掘技术和人工智能技术来实现农业智能化。例如,根据历史天气状况和农作物生长状况来分析指导最佳实践,来提示预警潜在病虫害的风险和气象病的风险等等。这些智能化应用的实现主要需要用到数据挖掘和人工智能技术。大数据平台提供了数据挖掘和人工智能的算法库,并且还提供了数据建模工具方便用户进行数据清洗,数据建模和数据模型的测试。

    农业大数据

    大数据平台数据挖掘引擎实现了机器学习算法库与统计算法库,支持常用机器学习算法并行化与统计算法并行化,并利用Spark在迭代计算和内存计算上的优势,将并行的机器学习算法与统计算法运行在Spark上。支持的机器学习算法包括逻辑回归、朴素贝叶斯、支持向量机、聚类、线性回归、推荐算法等,统计算法库包括均值、方差、中位数、直方图、箱线图等。可以支持后期在平台上搭建多种分析型应用,例如用户行为分析、精准营销,将对用户贴标签、进行分类,此类应用都会用到平台的数据挖掘功能。

    并集成了RStudio Server, Rstudio是R的一种强大而便捷的IDE,提供基于web的开发环境。同时平台提供的RStudio预加载好了并行化后台以及并行化执行引擎的连接模块,并将R脚本的编写、编译、跟踪执行以及中间变量查看和绘图集于一体,为用户提供了一个强大的R的操作环境。用户除了可以自行编写R的程序脚本、调用开源版本R提供了数千个R的包和函数之外,还可以直接调用并行化机器学习算法库。

    挖掘算法

  • ?

    运营商大数据挖掘——缺失数据处理

    不来梅港

    展开

    作者:网舟科技(席汉斌)

    在运营商大数据挖掘的应用中,由于数据获取的渠道以及数据结构理解的差异等原因,经常会把一些数据记为“未知”,“空白”或使用一些特殊的标识来表示,这类数据通常被称为缺失数据(missing data)或者是不完备数据(incomplete data)。这些缺失数据通常会造成非常大的影响,比如缺失数据会在一定程度上影响抽取数据模式的正确性和导出规则的准确性,从而导致建立错误的数据挖掘模型,并且由于现阶段的大多数数据分析的算法都没有具备分析和处理缺失数据的能力,因而当数据集中含有缺失数据时这些已经被广泛使用的数据分析算法或者系统往往是无能为力的。目前,数据缺失的问题网舟科技团队在工作中已经取得了一些研究性成果,其中包括应用近似值替换方法、随机回归填补方法、神经网络、贝叶斯网络等理论来处理缺失数据的填补问题。

    下面就几种常用的数据补齐方法进行对分析:删除样本法、0-1填补法、均值填补法、EM算法填补、回归填补、MI算法、K-最邻近法。

    1缺失数据补齐技术

    1.1 传统方法

    1.1.1删除法

    这方法的思想是将原来数据集中含有缺失数据的样本删除,从而得到一个包含完整数据的数据集。这种方法简易可行,在含有数据缺失的样本数量比较少的情况下数据补齐效果比较不错。但是,这种方法是以删除含有缺失数据的样本来得到完整数据集,经常会有浪费资源的情况发生。例如,在删除含有缺失数据样本的同时,也失去了隐含在这些样本中的大量有价值信息。并且当含有缺失数据的样本数量比较多时,这种方法对处理后得到的数据集的均值和方差分布方面都会产生较大的偏差。

    1.1.2填充0、1、均值法

    该方法是将原数据集中包含缺失数据的项全都简单地填充为0、1或者相应属性的样本均值,从而得到一个完整的数据集。

    3实验及分析

    3.1 实验数据

    网舟科技出于数据保密的原则,实验数据是从公开数据库UCI机器学习资源库获取的4个含有缺失数据的分类数据集,他们分别是互联网广告数据集(internetadvertisements dataset)、肝炎数据集(hepatitis dataset)、乳腺肿块数据集(mammographic masses dataset)以及众议院投票数据集(house-votes-84 dataset)。以下分别简称这些数据集为ad,hepatitis,mammographic以及house vote。

    这4个数据集均含有不同数量的缺失数据,表1列出了这4个数据集的包含样本总数、属性个数、含有缺失数据样本数以及数据缺失比例。

    大数据挖掘

    3.2数值实验及结果分析

    针对以上4个数据集,分别应用填补0、填补1、填补均值、EM算法(EM)、回归填补法、MI算法(MI)、KNN算法(KNN)以及删除样本的方法对其缺失值进行处理,得到相应的完整数据集。其中KNN算法的k值取10。

    采用支持向量机的分类结果作为检验补齐性能指标度量。SVM的核函数分别采用线性核和Gaussian核。数据集的Gaussian核的Sigma值分别为0.00001,0.0001,0.001,0.01,0.1,1,10,100,1000,10000。使用n-折交叉检验来检验不同缺失值填补方法的处理效果,其中n值均取10。

    图1-4分别给出了支持向量机在Gaussian核下,不同Sigma值下各填补方法的效果。从图中可以选出在合适的Sigma值下,相比其他填补方法,删除样本法及回归法的填补效果比较好。从图1-4的实验结果中,我们可以选出针对不同数据的高斯核参数,即在4组数据下的相对最优Sigma参数分别为100、100、10、10。

    大数据挖掘

    图1. Ad数据在不同sigma参数下的分类准确率

    大数据挖掘

    图2. Hepatitis数据在不同sigma参数下的分类准确率

    大数据挖掘

    图3. Housevotes数据在不同sigma参数下的分类准确率

    大数据挖掘

    图4. Mammographic数据在不同sigma参数下的分类准确率

    表2给出了支持向量机在线性核下(选用线性核的原因是该核无参数),对4个数据集使用不同填补方法的效果,从表2中可以看出删除样本准确率相对较高。

    表3给出了支持向量机在Gaussian核下,对4个数据集使用不同填补方法的效果。

    表2给出了支持向量机在线性核下(选用线性核的原因是该核无参数),对4个数据集使用不同填补方法的效果,从表2中可以看出删除样本准确率相对较高。

    表3给出了支持向量机在Gaussian核下,对4个数据集使用不同填补方法的效果。

    大数据挖掘

    4结 论

    针对4个分类数据集中的数据缺失问题展开对比分析,分别应用填补0、填补1、填补均值、EM算法、回归填补法、MI算法、KNN算法以及删除样本的方法对其缺失值进行处理。使用支持向量机对数据集进行分类验证不同的缺失数据补齐方法的效果。从数值实验结果可以看出,回归补齐法及删除样本法的效果相对较好,补齐后的数据的分类准确率更高。在实际的运营商应用中,其数据样本大,或者样本中缺失属性比较多的情况,删除样本法就不够实用了,因此回归法补齐缺失数据是各类补齐数据方法中相对较好的一种。

  • ?

    作为数据挖掘师,去大数据公司还是传统行业单位,这样选!

    花想容

    展开

    作为刚毕业的大学生程序员,对大数据非常感兴趣,想从事大数据挖掘的工作,不知道未来前景如何,而且面临选择是去纯大数据公司还是传统行业单位的大数据分析部门。目前大数据和人工智能、物联网一样可以说是大热门。根据中国商业联合会数据分析专业委员会统计,随着大数据及AI等新兴业务的发展,未来中国基础性数据分析人才缺口将达到1400万。这是一个很大数量的缺口,所以选择大数据方向应该是不错的选择。而数据挖掘这种比较偏应用的就业前景也应该不错。

    数据挖掘工程师

    大数据挖掘人员,要做的事情就是从数据库或其它形态的数据文档中发掘出显性或隐性的有价值的数据。除了有一定的数学统计知识等之外,还要具备一定的编程能力,熟悉开发环境等,比如Hadoop、NoSQL、Python、Java等。至于就业去向可以根据自己的性格及发展方向来确定。大数据公司、传统行业的大数据部门各有优点。

    大数据

    大数据挖掘技术在哪里都是差不多的。大数据公司一般会承接各种行业的数据分析,从个人见多识广或大多数人的选择来说可能到大数据公司应该是比较好的选择。长期下去各行各业的数据以及业务形态等等都能够见得到,都会了解一些,而且大数据公司里收入来说相对会高一些。而且对于大数据技术的前沿知识也是很快会接触到,学得到,同行之间交流也多,成长可能更快。但除了几个规模比较大的数据分析公司之外,大部分还是比较新比较小,可能稳定性并不是太好。对于那些有冲劲,不怕冒险的人员来说是个不错的选择。

    大数据

    另一方面如果想成为某一个行业内的专家,那么到某一个传统行业单位也许是一个好的选择。传统行业单位数据更细分,而且更专一。每天接触的,研究的都是这个行业里的数据,长久下去对这个行业更深入,通过数据更能够看到本质,更容易成为某个行业里的专家。比如卫生领域、金融领域、零售领域等等,每一个领域都会有很深的业务知识。这种大数据分析部门依附在传统行业企业里,相对来说可能收入稍低,但稳定性不错。如果人年轻把数据挖掘作为一份工作,有更高一些的收入,想学到更多的知识提升自己,或者觉得一个行业的数据太单调,那么到大数据公司也就是比较好的选择。

  • ?

    大数据-数据挖掘概述

    埋没

    展开

    数据挖掘是指在大量的数据中挖掘出信息,通过认真分析来揭示数据之间有意义的联系、趋势和模式。而数据挖掘技术就是指为了完成数据挖掘任务所需要的全部技术。金融、零售等企业已广泛采用数据挖掘技术,分析用户的可信度和购物偏好等。大数据研究采用数据挖掘技术,但是数据挖掘中的短期行为较多,多数是为某个具体问题研究应用技术,还无统一的理论。传统的数据挖掘技术在数据维度和规模增大时,所需资源呈现指数级增长,所以对PB级以上的大数据还需研究新的方法。

    数据挖掘概述

    数据挖掘是近年来伴随数据库系统的大量建立和万维网的广泛应用而发展起来的一门技术。数据挖掘是交叉性学科,它是数据库技术、机器学习、统计学、人工智能、可视化分析、模式识别等多门学科的融合,如下图所示。

    数据挖掘的几个概念

    数据挖掘

    数据挖掘是指从大量的、不完全的、有噪声的、模糊的、随机的实际数据中,提取隐含其内的、人们实现所不知的,但又是有潜在价值的信息和知识的过程。几点说明如下。

    数据挖掘涉及数据融合、数据分析和决策支持等内容。数据源必须是真实的、大量的、含有噪声的、用户感兴趣的数据。发现的知识要可接受、可理解、可运用,并不要求发现放之四海而皆准的知识,仅支持特定的问题。数据是知识的源泉,将概念、规则、模式、规律和约束等视为知识,这就好像从矿石中采矿或淘金一样,从数据中获取知识。原始数据可以是结构化数据,如关系型数据库中的数据等,也可以是非结构化数据,如文本、图形和图像等,还可以是半结构化数据,如网页等。挖掘知识的方法可以是数学的方法,也可以是非数学的方法;可以是演绎的方法,也可以是归纳的方法。挖掘的知识具有应用的价值,可以用于信息管理、查询优化、决策支持和过程控制等,还可以用于数据自身的维护。数据挖掘是一门交叉学科,将人们对数据的应用从低层次的简单查询,提升到从数据中挖掘知识,提供决策支持。在需求推动下,不同领域的研究者,尤其是数据库技术、人工智能技术、数理统计、可视化技术、并行计算等方面的知识融合后,形成新的研究热点。

    数据的挖掘首先是搜集数据,数据越丰富越好,数据量越大越好,只有获得足够的高质量的数据,才能获得确定的判断,才能产生认知模型,这是量变到质变的过程。由此产生经验,经验的积累就能产生有价值的判断。认知模型是渐进发展的模型,当认识深入以后,将长生更加抽象的模型与许多猜想,通过猜想再扩展模型,从而达到深度学习和深度挖掘。

    2. 数据挖掘分类

    数据挖掘可以分为两类:直接数据挖掘和间接数据挖掘。

    (1)直接数据挖掘

    直接数据挖掘的目标是利用可用的数据建立一个模型,利用这个模型对剩余的数据,对一个特定的变量(可以理解成数据库中标的属性,即列)进行描述。分类、估值、预测属于直接数据挖掘。

    (2)间接数据挖掘

    间接数据挖掘目标中没有选出某一具体的变量,用模型进行描述,而是在所有的变量中建立起某种关系。相关性分组或关联规则、聚类、描述和可视化以及复杂数据类型挖掘。

    3. 数据挖掘技术

    数据挖掘技术是数据挖掘方法的集合,数据挖掘方法众多。根据挖掘任务可将数据挖掘技术分为预测模型发现、聚类分析、分类与回归、关联分析、序列模式发现、依赖关系或依赖模型发现、异常和趋势发现、离群点检测等。根据挖掘对象可分为关系数据库、面向对象数据库、空间数据库、时态数据库、文本数据源、多媒体数据库、异质数据库、遗产数据库以及环球网Web。根据挖掘方法可分为机器学习方法、统计方法、神经网络方法和数据库方法。机器学习方法中,可细分为归纳学习方法(决策树、规则归纳等)、基于范例学习、遗传算法等。统计方法中,可细分为回归分析(多元回归、自回归等)、判别分析(贝叶斯判别、费歇尔判别和非参数判别等)、聚类分析(系统聚类、动态聚类等)、探索性分析(主元分析法、相关分析法等)等。神经网络方法中,可细分为前向神经网络(BP算法等)、自组织神经网络(自组织特征映射、竞争学习等)等。数据库方法主要是多维数据分析或OLAP方法,另外还有面向属性的归纳方法。

    数据挖掘应用了来自其他一些领域的思想与算法,主要包括:

    统计学的抽样、估计和假设检验。人工智能、模式识别和机器学习的搜索算法、建模技术和学习理论。最优化、进化计算、信息论、信号处理、可视化和信息检索。

    其他一些领域的技术也起到重要的支撑作用,需要数据库系统提供有效的存储、索引和查询处理支持。高性能计算技术、并行计算技术、分布式技术也能帮助处理数据,当数据不能集中到一起处理时更是至关重要。

  • ?

    一篇文章让你知道什么是大数据挖掘技术

    向真

    展开

    大数据如果想要产生价值,对它的处理过程无疑是非常重要的,其中大数据分析和大数据挖掘就是最重要的两部分。在前几期的科普中,小编已经为大家介绍了大数据分析的相关情况,本期小编就为大家讲解大数据挖掘技术,让大家轻轻松松弄懂什么是大数据挖掘技术。

    什么是大数据挖掘?

    分享之前我还是要推荐下我自己创建的大数据学习交流Qun531629188

    无论是大牛还是想转行想学习的大学生

    小编我都挺欢迎,今天的已经资讯上传到群文件,不定期分享干货,

    包括我自己整理的一份最新的适合2018年学习的大数据教程,欢迎初学和进阶中的小伙伴。

    数据挖掘(Data Mining)是从大量的、不完全的、有噪声的、模糊的、随机的数据中提取隐含在其中的、人们事先不知道的、但又是潜在有用的信息和知识的过程。

    数据挖掘对象

    根据信息存储格式,用于挖掘的对象有关系数据库、面向对象数据库、数据仓库、文本数据源、多媒体数据库、空间数据库、时态数据库、异质数据库以及Internet等。

    数据挖掘流程

    定义问题:清晰地定义出业务问题,确定数据挖掘的目的。

    数据准备:数据准备包括:选择数据–在大型数据库和数据仓库目标中 提取数据挖掘的目标数据集;数据预处理–进行数据再加工,包括检查数据的完整性及数据的一致性、去噪声,填补丢失的域,删除无效数据等。

    数据挖掘:根据数据功能的类型和和数据的特点选择相应的算法,在净化和转换过的数据集上进行数据挖掘。

    分享之前推荐一个大数据学习交流群:722680258未来将是大数据时代,需要学习大数据的抓紧时间学习,群内不定期分享视频资料,欢迎加入

    结果分析:对数据挖掘的结果进行解释和评价,转换成为能够最终被用户理解的知识。

    数据挖掘分类

    直接数据挖掘:目标是利用可用的数据建立一个模型,这个模型对剩余的数据,对一个特定的变量(可以理解成数据库中表的属性,即列)进行描述。

    间接数据挖掘:目标中没有选出某一具体的变量,用模型进行描述;而是在所有的变量中建立起某种关系。

    数据挖掘的方法

    神经网络方法

    神经网络由于本身良好的鲁棒性、自组织自适应性、并行处理、分布存储和高度容错等特性非常适合解决数据挖掘的问题,因此近年来越来越受到人们的关注。

    遗传算法

    遗传算法是一种基于生物自然选择与遗传机理的随机搜索算法,是一种仿生全局优化方法。遗传算法具有的隐含并行性、易于和其它模型结合等性质使得它在数据挖掘中被加以应用。

    决策树方法

    决策树是一种常用于预测模型的算法,它通过将大量数据有目的分类,从中找到一些有价值的,潜在的信息。它的主要优点是描述简单,分类速度快,特别适合大规模的数据处理。

    粗集方法

    粗集理论是一种研究不精确、不确定知识的数学工具。粗集方法有几个优点:不需要给出额外信息;简化输入信息的表达空间;算法简单,易于操作。粗集处理的对象是类似二维关系表的信息表。

    覆盖正例排斥反例方法

    它是利用覆盖所有正例、排斥所有反例的思想来寻找规则。首先在正例集合中任选一个种子,到反例集合中逐个比较。与字段取值构成的选择子相容则舍去,相反则保留。按此思想循环所有正例种子,将得到正例的规则(选择子的合取式)。

    统计分析方法

    在数据库字段项之间存在两种关系:函数关系和相关关系,对它们的分析可采用统计学方法,即利用统计学原理对数据库中的信息进行分析。可进行常用统计、回归分析、相关分析、差异分析等。

    模糊集方法

    即利用模糊集合理论对实际问题进行模糊评判、模糊决策、模糊模式识别和模糊聚类分析。系统的复杂性越高,模糊性越强,一般模糊集合理论是用隶属度来刻画模糊事物的亦此亦彼性的。

    数据挖掘任务

    关联分析

    两个或两个以上变量的取值之间存在某种规律性,就称为关联。数据关联是数据库中存在的一类重要的、可被发现的知识。关联分为简单关联、时序关联和因果关联。关联分析的目的是找出数据库中隐藏的关联网。一般用支持度和可信度两个阀值来度量关联规则的相关性,还不断引入兴趣度、相关性等参数,使得所挖掘的规则更符合需求。

    聚类分析

    聚类是把数据按照相似性归纳成若干类别,同一类中的数据彼此相似,不同类中的数据相异。聚类分析可以建立宏观的概念,发现数据的分布模式,以及可能的数据属性之间的相互关系。

    分类

    分类就是找出一个类别的概念描述,它代表了这类数据的整体信息,即该类的内涵描述,并用这种描述来构造模型,一般用规则或决策树模式表示。分类是利用训练数据集通过一定的算法而求得分类规则。分类可被用于规则描述和预测。

    预测

    预测是利用历史数据找出变化规律,建立模型,并由此模型对未来数据的种类及特征进行预测。预测关心的是精度和不确定性,通常用预测方差来度量。

    时序模式

    时序模式是指通过时间序列搜索出的重复发生概率较高的模式。与回归一样,它也是用己知的数据预测未来的值,但这些数据的区别是变量所处时间的不同。

    偏差分析

    在偏差中包括很多有用的知识,数据库中的数据存在很多异常情况,发现数据库中数据存在的异常情况是非常重要的。偏差检验的基本方法就是寻找观察结果与参照之间的差别。

  • ?

    大数据挖掘与大数据分析一样吗?有什么区别?

    丹琴

    展开

    大数据挖掘与大数据分析一样吗?随着大数据越来越火,与大数据相关的职位也开始粉墨登场,引人关注。作为大数据行业最为重要的两种职位,大数据挖掘和大数据分析更是受到了与众不同的待遇。现在有许多的朋友都会问:大数据挖掘和大数据分析有什么区别,不是都是搞数据的吗?在这里,魔据小编认为:尽管大数据挖掘和大数据分析同属于大户数据行业,但是依然有着很大的区别。

    大数据挖掘与大数据分析一样吗?

    一.什么是数据

    不谈数据,就无以谈大数据挖掘和大数据分析,因此,我们先说一下什么是数据。

    其实很简单,数据就是观测值。例如测量数据。大家可能有个误区,认为客户填写的表单就是数据,对编程序而言,是的,但是不是常规的数据。当然填写的内容,一旦落入到观测空间,自然就成了数据。

    二.什么是大数据挖掘和大数据分析

    大数据挖掘指对大数据数据分析手段后的信息,进行价值化的分析。

    大数据分析指对大数据的一种操作手段,或者算法。目标是针对先验的约束,对数据进行整理、筛选、加工,由此得到信息。

    三.大数据挖掘和大数据分析有什么区别

    大数据挖掘是对信息的价值化的获取。价值化自然不会考虑数据本身,而是考虑数据是否有价值。由此,一批数据,你尝试对它做不同的价值评估,这是大数据挖掘。

    大数据分析是以输入的数据为基础,通过先验的约束,对数据进行处理,但是不以结论何如为调整。例如你需要图像识别,这个属于大数据分析。你要分析人脸,数据就是通过先验的 方法,就是出来个猫脸。你的数据分析也没有问题,你需要默默承受结果,并且尊重事实。因此大数据分析的重点在于数据的有效性、真实性和先验约束的正确性。

    大数据挖掘与大数据分析一样吗?

    此时对比大数据分析,最大的特点就是你需要调整你不同的先验约束,再次对数据进行分析。而先验的约束已经不是针对数据来源自身的特点,例如信噪比处理算法。你期望得到的一个有价值的内容,做先验的约束,以观测,数据根据这个约束,是否有正确的反馈。

    大数据挖掘与大数据分析一样吗?

    不管大数据挖掘和大数据分析有什么不同,这两个职位的前景都是十分好的,现在入行,正是最好的时机。

  • ?

    快速理解大数据,了解数据挖掘和机器学习

    武夜云

    展开

    数据挖掘和大数据可以做什么?

    简而言之,它们赋予我们预测能力。

    我们的生活已经数字化了

    我们每天所做的许多事情都可以记录下来。 每张信用卡交易都是数字化和可追溯的。 我们的公众形象一直受到许多中央电视台在城市各个角落的监控; 对于企业而言,大多数财务和运营数据都保存在某些类型的ERP中; 随着可穿戴设备的兴起 ,每一次心跳和呼吸都被数字化并保存为可用数据。正当我们的大部分生活被数字化时,计算机现在可以比以往更好地“理解”我们的世界。

    2.如果模式保持不变,则过去=未来

    我们生活中的许多不同事物都表现出模式。例如,一个人可能在任何工作日内在工作和家庭之间旅行,或者在任何非工作日去度假或看电影,这种模式不太可能改变。商店将拥有任何一天的高峰时段和闲置时间,这种模式不太可能改变。企业将在一年中的某些月份要求更高的劳动力投入,这种模式不太可能改变。

    总结第1点和第2点,我们可以得出结论,如果提供过去的模式,计算机很可能预测未来,因为这些模式在很长一段时间内最可能是一致的。

    如果计算机可以预测人们的生活方式,它将准确知道什么时候是适合促销的最佳时间,例如,如果这个人每周五的星期五都要洗车,或者是优惠券,那就是洗车促销如果这个人每年三月都要去度假,那就留下来。Businesswise,计算机还可以 预测商店全天的销售预测,然后制定业务战略以最大化总收入。对于企业而言,计算机还可以设计出最合理的劳动力安排的最佳运营计划。

    一旦未来变得可预测,我们可以随时提前计划并为可能的最佳行动做好准备。就像“黑客帝国”中的Neo一样,他能够躲避所有的子弹,因为他可以清楚地看到子弹的来源。根据夏洛克·福尔摩斯的说法,“对概率数学的高级掌握,对人类心理学的彻底理解,以及任何特定个体的已知倾向都可以大大减少变量的数量”,换句话说,“大数据给了我们预测未来的力量“。 这是数据挖掘的力量。数据挖掘始终与大数据联系在一起,因为大数据支持大量数据集,从而为所有预测提供了基础。

    那么,大数据,数据挖掘和机器学习到底是什么?

    大数据

    当数据量巨大时,很明显这些数据无法在任何一台机器上处理。一个非常大的文件,比方说10GB,你可能无法在任何Windows系统中打开它,然后崩溃整个事情。 为此目的开发了大数据。您可以将其视为一种特殊的软件,它将大文件拆分为更小的文件,然后可以在多台计算机上进行处理。分割和组合数据片段的过程称为MapReduce。最常用于此过程的软件框架,称为Hadoop。Hadoop解决了基本问题,并且有许多工具可以与Hadoop一起使用,例如Pig,Zookeeper和Hive,以使过程更加容易。Hadoop连同它的许多相关工具通常被称为“大数据技术”。

    机器学习

    刚才我们根据一块数据的处理方式进行了触摸。假设这条数据包含一组购物者的购买行为,包括购买的商品总数,每个购物者购买的商品数量。这是迄今为止简单的统计分析。但是,如果我们的目标是分析不同类型的购物者之间的相关性,或者如果我们想要推断特定类型的购物者的特定偏好,或者甚至预测任何购物者的性别或年龄,我们将需要更多复杂的模型,我们称之为算法。机器学习可以更容易理解为为数据挖掘目的而开发的所有不同类型的算法,例如逻辑回归,决策树,协同过滤等等。

    数据挖掘

    通过应用机器学习算法,现有数据实际上可用于预测未知数,这正是数据挖掘的奇迹与机器学习密切相关的原因。然而,任何机器学习算法的强度在很大程度上取决于大量数据集的供应。请记住,无论算法有多复杂,都不能从几行数据中做出灵感预测。大数据技术是机器学习的前提,通过使用机器学习,我们能够从现有数据集中获得有价值的见解,这就是数据挖掘。

大数据数据挖掘

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP