中企动力 > 商学院 > 大数据预测算法
  • ?

    大数据技术十大核心原理

    袁冰真

    展开

    科学进步越来越多地由数据来推动,海量数据给数据分析既带来了机遇,也构成了新的挑战。大数据往往是利用众多技术和方法,综合源自多个渠道、不同时间的信息而获得的。究竟大数据技术的核心原理是哪几方面呢?

    数据即价值是目前计算机领域极其推崇的观念。数据无论多少都被归结为大数据,数据分析越来越热门,资本也对贴有大数据标签的公司趋之若鹜。如同流动的数字货币一样被一再的评估、追崇。数据能告诉我们,每一个客户的消费倾向,他们想要什么,喜欢什么,每个人的需求有哪些区别,哪些又可以被集合到一起来进行分类。

    数据核心原理:从“流程”核心转变为“数据”核心

    大数据时代,计算模式也发生了转变,从“流程”核心转变为“数据”核心。Hadoop体系的分布式计算框架已经是“数据”为核心的范式。非结构化数据及分析需求,将改变IT系统的升级方式:从简单增量到架构变化。大数据下的新思维——计算模式的转变。

    科学进步越来越多地由数据来推动,海量数据给数据分析既带来了机遇,也构成了新的挑战。大数据往往是利用众多技术和方法,综合源自多个渠道、不同时间的信息而获得的。为了应对大数据带来的挑战,我们需要新的统计思路和计算方法。

    数据价值原理:有功能是价值转变为数据是价值

    大数据真正有意思的是数据变得在线了,这个恰恰是互联网的特点。非互联网时期的产品,功能一定是它的价值,今天互联网的产品,数据一定是它的价值。

    数据能告诉我们,每一个客户的消费倾向,他们想要什么,喜欢什么,每个人的需求有哪些区别,哪些又可以被集合到一起来进行分类。大数据是数据数量上的增加,以至于我们能够实现从量变到质变的过程。

    全样本原理:从抽样转变为需要全部数据样本

    需要全部数据样本而不是抽样,你不知道的事情比你知道的事情更重要,但如果现在数据足够多,它会让人能够看得见、摸得着规律。

    数据这么大、这么多,所以人们觉得有足够的能力把握未来,对不确定状态的一种判断,从而做出自己的决定。这些东西我们听起来都是非常原始的,但是实际上背后的思维方式,和我们今天所讲的大数据是非常像的。

    关注效率原理:由关注精确度转变为关注效率

    关注效率而不是精确度,大数据标志着人类在寻求量化和认识世界的道路上前进了一大步,过去不可计量、存储、分析和共享的很多东西都被数据化了,拥有大量的数据和更多不那么精确的数据为我们理解世界打开了一扇新的大门。大数据能提高生产效率和销售效率,原因是大数据能够让我们知道市场的需要,人的消费需要。大数据让企业的决策更科学,由关注精确度转变为关注效率的提高,大数据分析能提高企业的效率。

    竞争是企业的动力,而效率是企业的生命,效率低与效率高是衡量企来成败的关键。一般来讲,投入与产出比是效率,追求高效率也就是追求高价值。手工、机器、自动机器、智能机器之间效率是不同的,智能机器效率更高,已能代替人的思维劳动。智能机器核心是大数据制动,而大数据制动的速度更快。在快速变化的市场,快速预测、快速决策、快速创新、快速定制、快速生产、快速上市成为企业行动的准则,也就是说,速度就是价值,效率就是价值,而这一切离不开大数据思维。

    关注相关性原理:由因果关系转变为关注相关性

    关注相关性而不是因果关系,社会需要放弃它对因果关系的渴求,而仅需关注相关关系,也就是说只需要知道是什么,而不需要知道为什么。这就推翻了自古以来的惯例,而我们做决定和理解现实的最基本方式也将受到挑战。

    在这个不确定的时代里面,等我们去找到准确的因果关系,再去办事的时候,这个事情早已经不值得办了。所以“大数据”时代的思维有点像回归了工业社会的这种机械思维——机械思维就是说按那个按钮,一定会出现相应的结果,是这样状态。而农业社会往前推,不需要找到中间非常紧密的、明确的因果关系,而只需要找到相关关系,只需要找到迹象就可以了。社会因此放弃了寻找因果关系的传统偏好,开始挖掘相关关系的好处。

    非法在屋内打隔断的建筑物着火的可能性比其他建筑物高很多。纽约市每年接到2.5万宗有关房屋住得过于拥挤的投诉,但市里只有200名处理投诉的巡视员,市长办公室一个分析专家小组觉得大数据可以帮助解决这一需求与资源的落差。该小组建立了一个市内全部90万座建筑物的数据库,并在其中加入市里19个部门所收集到的数据:欠税扣押记录、水电使用异常、缴费拖欠、服务切断、救护车使用、当地犯罪率、鼠患投诉,诸如此类。

    接下来,他们将这一数据库与过去5年中按严重程度排列的建筑物着火记录进行比较,希望找出相关性。果然,建筑物类型和建造年份是与火灾相关的因素。不过,一个没怎么预料到的结果是,获得外砖墙施工许可的建筑物与较低的严重火灾发生率之间存在相关性。利用所有这些数据,该小组建立了一个可以帮助他们确定哪些住房拥挤投诉需要紧急处理的系统。他们所记录的建筑物的各种特征数据都不是导致火灾的原因,但这些数据与火灾隐患的增加或降低存在相关性。这种知识被证明是极具价值的:过去房屋巡视员出现场时签发房屋腾空令的比例只有13%,在采用新办法之后,这个比例上升到了70%——效率大大提高了。

    全世界的商界人士都在高呼大数据时代来临的优势:一家超市如何从一个17岁女孩的购物清单中,发现了她已怀孕的事实;或者将啤酒与尿不湿放在一起销售,神奇地提高了双方的销售额。大数据透露出来的信息有时确实会起颠覆。比如,腾讯一项针对社交网络的统计显示,爱看家庭剧的男人是女性的两倍还多;最关心金价的是中国大妈,但紧随其后的却是90后。而在过去一年,支付宝中无线支付比例排名前十的竟然全部在青海、西藏和内蒙古地区。

    预测原理:从不能预测转变为可以预测

    大数据的核心就是预测,大数据能够预测体现在很多方面。大数据不是要教机器像人一样思考,相反,它是把数学算法运用到海量的数据上来预测事情发生的可能性。正因为在大数据规律面前,每个人的行为都跟别人一样,没有本质变化,所以商家会比消费者更了消费者的行为。

    此外,随着系统接收到的数据越来越多,通过记录找到的最好的预测与模式,可以对系统进行改进。它通常被视为人工智能的一部分,或者更确切地说,被视为一种机器学习。真正的革命并不在于分析数据的机器,而在于数据本身和我们如何运用数据。一旦把统计学和现在大规模的数据融合在一起,将会颠覆很多我们原来的思维。所以现在能够变成数据的东西越来越多,计算和处理数据的能力越来越强,所以大家突然发现这个东西很有意思。所以,大数据能干啥?能干很多很有意思的事情。

    互联网、移动互联网和云计算机保证了大数据实时预测的可能性,也为企业和用户提供了实时预测的信息,相关性预测的信息,让企业和用户抢占先机。由于大数据的全样本性,人和人都是一样的,所以云计算机软件预测的效率和准确性大大提高,有这种迹象,就有这种结果。

    信息找人原理:从人找信息,转变为信息找人

    互联网和大数据的发展,是一个从人找信息,到信息找人的过程。先是人找信息,人找人,信息找信息,现在是信息找人的这样一个时代。信息找人的时代,就是说一方面我们回到了一种最初的,广播模式是信息找人,我们听收音机,我们看电视,它是信息推给我们的,但是有一个缺陷,不知道我们是谁,后来互联网反其道而行,提供搜索引擎技术,让我知道如何找到我所需要的信息,所以搜索引擎是一个很关键的技术。

    大数据还改变了信息优势。按照循证医学,现在治病的第一件事情不是去研究病理学,而是拿过去的数据去研究,相同情况下是如何治疗的。这导致专家和普通人之间的信息优势没有了。原来我相信医生,因为医生知道的多,但现在我可以到谷歌上查一下,知道自己得了什么病。

    谷歌有一个机器翻译的团队,最开始的时候翻译之后的文字根本看不懂,但是现在60%的内容都能读得懂。谷歌机器翻译团队里头有一个笑话,说从团队每离开一个语言学家,翻译质量就会提高。越是专家越搞不明白,但打破常规让数据说话,得到真理的速度反而更快。

    机器懂人原理:由人懂机器转变为机器更懂人

    不是让人更懂机器,而是让机器更懂人,或者说是能够在使用者很笨的情况下,仍然可以使用机器。甚至不是让人懂环境,而是让我们的环境来懂我们,环境来适应人,某种程度上自然环境不能这样讲,但是在数字化环境中已经是这样的一个趋势,就是我们所在的生活世界,越来越趋向于它更适应于我们,更懂我们。哪个企业能够真正做到让机器更懂人,让环境更懂人,让我们随身携带的整个的生活世界更懂得我们的话,那他一定是具有竞争力的了,而“大数据”技术能够助我们一臂之力。

    大数据技术的其中一个核心目标是要从体量巨大、结构繁多的数据中挖掘出隐蔽在背后的规律,从而使数据发挥最大化的价值。由计算机代替人去挖掘信息,获取知识。从各种各样的数据(包括结构化、半结构化和非结构化数据)中快速获取有价值信息的能力,就是大数据技术。大数据机器分析中,半监督学习、集成学习、概率模型等技术尤为重要。

    电子商务智能原理:大数据改变了电子商务模式,让电子商务更智能

    商务智能,在今天大数据时代它获得的重新的定义。例如:传统企业进入互联网,在掌握了“大数据”技术应用途径之后,会发现有一种豁然开朗的感觉,就像在黑屋子里面找东西,找不着,突然碰到了一个开关,发现那么费力的找东西,原来很容易找得到。大数据思维,事实上它不是一个全称的判断,只是对我们所处的时代某一个纬度的描述。

    大数据时代不是说我们这个时代除了大数据什么都没有,哪怕是在互联网和IT领域,它也不是一切,只是说在我们的时代特征里面加上这么一道很明显的光,从而导致我们对以前的生存状态,以及我们个人的生活状态的一个差异化的一种表达。

    当然,同样的技术也可以运用到疾病诊断、推荐治疗措施,甚至是识别潜在犯罪分子上。或者说,在你还不知道的情况下,体检公司、医院提醒你赶紧去做检查,可能会得某些病,商家比你更了解你自己,以及你这样的人在某种情况下会出现的可能变化。就像互联网通过给计算机添加通信功能而改变了世界,大数据也将改变我们生活中最重要的方面,因为它为我们的生活创造了前所未有的可量化的维度。

    定制产品原理:由企业生产产品转变为由客户定制产品

    下一波的改革是大规模定制,为大量客户定制产品和服务,成本低、又兼具个性化。比如消费者希望他买的车有红色、绿色,厂商有能力满足要求,但价格又不至于像手工制作那般让人无法承担。因此,在厂家可以负担得起大规模定制带去的高成本的前提下,要真正做到个性化产品和服务,就必须对客户需求有很好的了解,这背后就需要依靠大数据技术。

    在互联网大数据的时代,商家最后很可能可以针对每一个顾客进行精准的价格歧视。我们现在很多的行为都是比较粗放的,航空公司会给我们里程卡,根据飞行公里数来累计里程,但其实不同顾客所飞行的不同里程对航空公司的利润贡献是不一样的。所以有一天某位顾客可能会收到一封信,“恭喜先生,您已经被我们选为幸运顾客,我们提前把您升级到白金卡。”这说明这个顾客对航空公司的贡献已经够多了。有一天银行说“恭喜您,您的额度又被提高了,”就说明钱花得已经太多了。

    正因为在大数据规律面前,每个人的行为都跟别人一样,没有本质变化。所以商家会比消费者更了消费者的行为。也许你正在想,工作了一年很辛苦,要不要去哪里度假?打开e-Mail,就有航空公司、旅行社的邮件。

    企业产品直接销售给用户,省去了中间商流通环节,使产品的价格可以以出厂价销售,让销费者获得了好处,网上产品便宜成为用户的信念,网购市场形成了。要让用户成为你的产品粉丝,就必须了解用户需要,定制产品成为用户的心愿,也就成为企业发展的新方向。

    本账号提供最新物联网展会活动资讯,和多家物联网企业形成战略合作伙伴,带领用户与物联网行业大咖、各地物联网俱乐部共同来玩转物联网,为行业创造最酷的物联网线下体验和思想交流的平台。

    IOTCOFFEE

  • ?

    大数据十大经典算法

    Hana

    展开

    最早提出“大数据”时代到来的是全球知名咨询公司麦肯锡,麦肯锡称:“数据,已经渗透到当今每一个行业和业务职能领域,成为重要的生产因素。人们对于海量数据的挖掘和运用,预示着新一波生产率增长和消费者盈余浪潮的到来。”

    “大数据”在物理学、生物学、环境生态学等领域以及军事、金融、通讯等行业存在已有时日,却因为近年来互联网和信息行业的发展而引起人们关注。大数据作为这个信息时代的产物,我们可能无法掌握这些数据的算法,但是可以了解一下大数据都有哪些算法!

    今天,来为大家详细介绍大数据十大经典算法!

    一、C4.5算法

    C4.5,是机器学习算法中的一个分类决策树算法,它是决策树(决策树也就是做决策的节点间的组织方式像一棵树,其实是一个倒树)核心算法ID3的改进算法,所以基本上了解了一半决策树构造方法就能构造它。决策树构造方法其实就是每次选择一个好的特征以及分裂点作为当前节点的分类条件。

    C4.5相比于ID3改进的地方有:

    1、用信息增益率来选择属性。ID3选择属性用的是子树的信息增益,这里可以用很多方法来定义信息,ID3使用的是熵(entropy,熵是一种不纯度度量准则),也就是熵的变化值.而C4.5用的是信息增益率。对,区别就在于一个是信息增益,一个是信息增益率。

    一般来说率就是用来取平衡用的,就像方差起的作用差不多,比如有两个跑步的人,一个起点是10m/s的人、其10s后为20m/s;另一个人起速是1m/s、其1s后为2m/s。如果紧紧算差值那么两个差距就很大了,如果使用速度增加率(加速度,即都是为1m/s^2)来衡量,2个人就是一样的加速度。因此,C4.5克服了ID3用信息增益选择属性时偏向选择取值多的属性的不足。

    2、在树构造过程中进行剪枝,在构造决策树的时候,那些挂着几个元素的节点,不考虑最好,不然容易导致overfitting。

    3、对非离散数据也能处理。

    4、能够对不完整数据进行处理。

    二、The k-means algorithm 即K-Means算法

    k-means algorithm算法是一个聚类算法,把n的对象根据他们的属性分为k个分割(k

    三、 Support vector machines

    支持向量机,英文为Support Vector Machine,简称SV机(论文中一般简称SVM)。

    它是一种监督式学习的方法,它广泛的应用于统计分类以及回归分析中。支持向量机将向量映射到一个更高维的空间里,在这个空间里建立有一个最大间隔超平面。

    在分开数据的超平面的两边建有两个互相平行的超平面,分隔超平面使两个平行超平面的距离最大化。假定平行超平面间的距离或差距越大,分类器的总误差越小。一个极好的指南是C.J.C Burges的《模式识别支持向量机指南》。van der Walt 和 Barnard 将支持向量机和其他分类器进行了比较。

    四、The Apriori algorithm

    Apriori算法是一种最有影响的挖掘布尔关联规则频繁项集的算法。其核心是基于两阶段频集思想的递推算法。该关联规则在分类上属于单维、单层、布尔关联规则。在这里,所有支持度大于最小支持度的项集称为频繁项集,简称频集。

    五、最大期望(EM)算法

    在统计计算中,最大期望 (EM,Expectation–Maximization)算法是在概率(probabilistic)模型中寻找参数最大似然估计的算法,其中概率模型依赖于无法观测的隐藏变量(Latent Variabl)。最大期望经常用在机器学习和计算机视觉的数据集聚(Data Clustering)领域。

    六、 PageRank

    PageRank是Google算法的重要内容。2001年9月被授予美国专利,专利人是Google创始人之一拉里佩奇(Larry Page)。因此,PageRank里的page不是指网页,而是指佩奇,即这个等级方法是以佩奇来命名的。PageRank根据网站的外部链接和内部链接的数量和质量,衡量网站的价值。

    PageRank背后的概念是,每个到页面的链接都是对该页面的一次投票,被链接的越多,就意味着被其他网站投票越多。这个就是所谓的“链接流行度”——衡量多少人愿意将他们的网站和你的网站挂钩。PageRank这个概念引自学术中一篇论文的被引述的频度——即被别人引述的次数越多,一般判断这篇论文的权威性就越高。

    七、AdaBoost

    Adaboost是一种迭代算法,其核心思想是针对同一个训练集训练不同的分类器(弱分类器),然后把这些弱分类器集合起来,构成一个更强的最终分类器 (强分类器)。其算法本身是通过改变数据分布来实现的,它根据每次训练集之中每个样本的分类是否正确,以及上次的总体分类的准确率,来确定每个样本的权值。将修改过权值的新数据集送给下层分类器进行训练,最后将每次训练得到的分类器融合起来,作为最后的决策分类器。

    八、KNN: k-nearest neighbor classification

    K最近邻(k-Nearest Neighbor,KNN)分类算法,是一个理论上比较成熟的方法,也是最简单的机器学习算法之一。该方法的思路是:如果一个样本在特征空间中的k个最相似(即特征空间中最邻近)的样本中的大多数属于某一个类别,则该样本也属于这个类别。

    九、 Naive Bayes

    在众多的分类模型中,应用最为广泛的两种分类模型是决策树模型(Decision Tree Model)和朴素贝叶斯模型(Naive Bayesian Model,NBC)。 朴素贝叶斯模型发源于古典数学理论,有着坚实的数学基础,以及稳定的分类效率。同时,NBC模型所需估计的参数很少,对缺失数据不太敏感,算法也比较简单。

    理论上,NBC模型与其他分类方法相比具有最小的误差率。但是实际上并非总是如此,这是因为NBC模型假设属性之间相互独立,这个假设在实际应用中往往是不成立的,这给NBC模型的正确分类带来了一定影响。在属性个数比较多或者属性之间相关性较大时,NBC模型的分类效率比不上决策树模型。而在属性相关性较小时,NBC模型的性能最为良好。

    十、 CART: 分类与回归树

    CART, Classification and Regression Trees。在分类树下面有两个关键的思想:第一个是关于递归地划分自变量空间的想法;第二个想法是用验证数据进行剪枝。

    看完之后,哪位小伙伴会其中的1-2个算法的,说出来让小编崇拜一下。

    注:算法来源于网络,本文不作为商业价值,仅供学习参考,如侵犯著作权,请联系作者删除。

  • ?

    利用AI大数据预测农作物的未来,你敢信?

    CU

    展开

    8月24日,美国卫星数据分析初创初创公司 Descartes Labs 获得3000万美元的B轮融资,领投方为 March Capital Partners。Descartes Labs 于2014年在美国新墨西哥州圣塔菲成立,是一家卫星数据分析技术服务商,创始人兼CEO为 Mark Johnson。

    Johnson 毕业于斯坦福大学,是一名颇为成功的产品经理,他任职的垂直搜索公司之一 SideStep 被 Kayak 收购,其后加入的社群网站信息服务商 Kosmix 被沃尔玛收购,再来是自然语言搜索引擎 Powerset 被微软收购,他也由此进入微软担任必应的产品经理。

    但是还没完,2009年他进入了新闻聚合平台 Zite ,并于2011年助其成功发布iPad版本后被提升为公司的CEO,2014年 Zite 被 Flipboard 收购,同年他去了新墨西哥州的Los Alamos。

    当时 Descartes Labs还隶属于著名的Los Alamos国家实验室,他联合了实验室中的几位科学大咖,包括在基因算法领域工作十年的Steven Brumby、建立宇宙兆级粒子模型的Mike Warren,以及很多图像识别和机器学习领域的科学家和宇宙学家共同成立了现在的Descartes Labs。

    Descartes Labs 提供地球监测,地理定位搜索以及农产品预告等服务,通过将机器学习技术应用于公共和私人卫星图像提供的地理空间数据,从而推算森林砍伐率、预测食物的供应,以及确定哪里适合建造新型的风农场等与贸易、经济息息相关的信息。

    该公司创建了一个搭载人工智能的超级云计算平台,每天读取和处理近5tb的新数据,包括天气数据和绕地球运行的卫星最新图像。

    通过分析千万亿像素的巨大图片,并将其与过去的数据进行对比,再利用其研发的全自动算法,可以确定一片土地是否适合种植玉米,大豆或其他农作物,并估算它的发芽率。另外,人工智能可以根据该地区的红外光谱确定某一作物的健康状况。

    CEO Johnson表示,他们的人工智能可以预测美国300万平方公里的玉米田的产量,准确率达到99%。有投资人问他们预测玉米田产量的模型有什么秘诀,他说秘诀就是数据和运算,比其他机构更多的数据和更多的运行次数。

    在全球范围内,农业数据可以对很多行业产生影响,比如进出口、食品、能源、城市供给等,而合理配置土地资源也会更有利于农业的可持续发展,因此在2015年5月他们获得了500万美元的A轮融资,领投方为 Cultivian Sandbox Ventures。

    除了经贸领域,通过对地球40多年的卫星图像进行人工智能分析,可以知道气候是如何影响农作物成长的以及干旱何时发生,除了商用,这些数据也会提供给人道主义组织,帮助其尽早进行拯救生命的行动,同时更好的分配救助资源。此轮融资后,获得融资后,Descartes Labs 将继续招揽人才,同时增强其超级计算机的运算能力。

  • ?

    十大步骤帮你有效使用预测分析算法

    天曼

    展开

    一个成功的预测分析项目不仅仅涉及软件部署,使用软件分析数据。了解下面这些步骤可以帮助你为分析项目打下坚实基础。

    越来越多的企业开始使用预测分析算法。描述性分析一般提供一种视角,让你了解已经发生了什么,而与之相比,预测分析则试图发现未来事件,例如,识别那些潜在的客户。

    但为了充分利用预测模型,在使用先进的分析工具,建立新的或改进业务流程和其他企业变动之间,分析团队需要找到一个平衡点。简而言之,如果分析结果不能高效地对决策和企业行为产生积极的影响,那这个分析就是完全无意义的。

    一个有效的预测分析程序需要数据分析生命周期中商业用户的参与和支持。考虑以下10个步骤,有助于发现促进分析活动成功的基本元素。

    1. 找到一个带头人。获得公司高层领导的支持,是很重要的,只有公司高管愿意在分析领域投资,才能确保预测分析过程和运营的顺利。例如,首席营销官可能是一个推动客户分析程序的不错候选人,因为CMO可以提供必要的资金,他还可以推动营销团队使用预测分析算法的结果,来规划营销和促销活动。

    2. 了解公司的主要业务目标。最好的预测模型都具备两个重要特点:业务预测准确性和相关性。数据科学家和分析师进行分析工作时,如果他们非常清楚组织的业务目标,专注于相应的建筑模型来满足这些业务目标,那么其分析结果的准确性和相关性往往很高。

    3. 评估业务流程可能会受到何种影响。预测模型帮助识别商业机会,但如果分析应用程序的结果没有被用来指导业务经理和其员工的行为,即使是最好分析也会变得毫无意义。 基于分析预测分析算法的结果来识别那些可以被改进的业务流程,随后取得部门主管的支持,促使员工把这些研究结果转化为行动。

    4. 定义性能指标。你的预测模型不应该仅仅影响业务流程的改变,他们也应该具备一个衡量其业务影响的指标。你应该制定一个计划来创建指标,可以用来量化模型的实际价值。

    5. 拥有一个能干的团队。分析团队应由具备各种技能的人员组成,这些人员一般包括统计师、数据科学家、数据分析师、工程师和业务分析师、数据变更管理专业人士等。

    6. 定义模型的开发方法。阻碍分析成功的原因之一是开发预测模型时所花费的时间超过了商业机会的窗口。一些企业采取敏捷开发技术加速模型创建过程,随后在部署后,迭代改进该模型。这种增量开发模式更适合开发预测模型,你不再担心无休止的交付延迟。

    7. 确保正确的数据是可用的和可访问的。大数据是一件好坏参半的事。虽然你的企业可能有能力收集和存储大量的数据,分析师仍然需要知道哪些数据是可用的,以及如何访问相关的数据。除了创建数据集的详细目录,,在数据目录保持足够的技术和业务元数据, 以确保特定的预测分析应用程序得到正确的数据。

    8. 构建一个坚实的数据治理项目。企业数据环境是不断变化的, 新的数据集不断被捕获,这些数据来自于内部和外部的数据源。实现数据治理实践,有助于将分析系统数据的质量和一致性保持在一个可接受的水平,与相关数据使用政策一起,防止不同的解释导致分析结果互相冲突。

    9. 当情况有变时,要快速推倒重来。建立分析模型并不困难,但并不是所有分析都能提供有用的信息。迅速建立失败的原则:如果一个预测模型对业务不产生任何有价值的东西,就立刻推倒重来。

    10. 选择正确的工具。市场预测分析工具的市场十分健全,它能为你提供开源和商业两种选择。寻找工具,提供一组核心功能来匹配您的应用程序需求。你要考虑因素包括特定预测分析算法的所需支持,与各种传统大数据平台的互操作性,是否能够处理结构化和非结构化数,,与数据可视化工具的集成以及用于演示的前端工具等。

    熟悉了这十个步骤,并不意味着你就可以轻松构建一个成功的预测分析程序。但它们为分析程序获得持续支持提供了基础,有助于在业务价值基础上构建预测模型,吸引业务用户,管理变更,并让分析师获得高可用性和高置信度的数据。如果这些步骤被正确实施,它们将有助于为开发、测试和部署预测模型流程提供可重复的过程,这些模型能够让业务受益匪浅。

  • ?

    大数据必须掌握的三个基本算法

    冷香凝

    展开

    一全排序

    Hadoop自带的Partitioner的实现有两种,一种为HashPartitioner, 默认的分区方式,计算公式\nhash(key)%reducernum,另一种为TotalOrderPartitioner,\n为排序作业创建分区,分区中数据的范围需要通过分区文件来指定。

    分区文件可以人为创建,如采用等距区间,如果数据分布不均匀导致作业完成时间受限于个别reduce任务完成时间的影响。

    也可以通过抽样器,先对数据进行抽样,根据数据分布生成分区文件,避免数据倾斜。

    注意,key可以是数字型,也可以是BinaryComparable(字符串),当是BinaryComparable时,则以key构造Trie Tree;否则以二分查找来确定key的所属区间。

    二单词共现矩阵算法

    其目的是在海量语料库中发现在固定窗口内单词a和单词b共同出现的频率,从而构建单词共现矩阵,这样的矩阵可以是对称的,也可以是不对称的,这要看具体的应用。

    这种抽象化的任务的有效解决在实际生活中有着很多的应用。例如电子商家希望发现不同物品被同时购买的情况以便有效安排货物的摆放位置;同时对信息检索领域同义词词典的构建以及文本挖掘等都有着重要的实际应用价值。

    根据同现关系的不同,可能需要实现和定制不同的FileInputFormat和RecordReader,如同现关系为一个英文句子,则需要实现以一个英文句子为单位的FileInputFormat和RecordReader,如同现关系为一个段落,则需要实现以一个段落为单位的FileInputFormat和RecordReader

    三倒排索引

    Inverted Index(倒排索引)是目前几乎所有支持全文检索的搜索引擎都要依赖的一个数据结构。基于索引结构,给出一个词(term),能取得含有这个term的文档列表(the list of documents),没什么可说的,必须掌握。

  • ?

    张礼立:大数据预测分析有多靠谱?

    Joe

    展开

    天地人和     经世致用

    Harmony      Knowledge     Solutions

    引子云计算的计算与存储等功能将变得更加强大,拥有自学习型预测性分析解决方案的能力从而适应新的且不断变化的数据流,将对过去的预定义模型发起颠覆性的挑战。

    张礼立盘古智库学术委员玖道科技首席战略官

    如今对大数据预测性分析可谓大肆宣传,人人都想在预测分析市场上分得一杯羹。周末和朋友喝茶聊天,谈到了这个话题。 预测的故事一个接着一个,然而一些关于预测性分析的价值的说法,似乎太过美好且不太真实。

    当然,这个话题很大,可以谈的内容很多。我从“预测性分析”的定义谈起。 关于预测分析的定义有不少种版本,在被广泛接受的版本中,都围绕着三个共通的关键点:第一,从数据中提取信息。第二,预测潜在趋向或行为模式。第三,既关系着未来,也关系着当下和过去。

    把这上述的三个核心特征点融合,我们可以看到预测性分析就是通过分析全面数据(包含了历史数据与实时数据、人类行为数据和机器数据等)预测潜在的结果或可能,而非宣布绝对的确定即将、会或已经发生什么。

    在大数据讨论中,有一句经典的流行语录:大数据预测就好比算命。

     大数据预测vs.算命占卜

    占卜功能来源于《易经》,从来就是神秘高深、不可测。 而我们从《易经》中了解到,每个卦、每一爻都包含了“象”“数”“理”三种含义。就好比,我们在晚宴上,举起红酒杯,左右摇摆,这就是一个“象”, 而左右摇摆了多少度,多少秒钟摇摆一次,就有了它的“数”,为什么要摇摆?所以“理”就出现了。

    宇宙间万事万物都有它的理,也必有它的象, 每个现象必有定数,这是必然的过程。这就是占卜预测的基础与科学。

    中国人讲“旁观者清,当局者迷”。 “当局者迷”是因为自己看不清自己,所以我们要把自己的处境悬架起来,当作一面镜子,这就是卦。把自己的状态、自己的处境,让自己成为旁观者来做评判,这个过程就是算卦,其中对未来的展望就是占卜。

    《易经》把360度的空间通过八八六十四卦,分成了64种情景。 这与大数据预测分析中提出的360度数字画像类似。可是,无论是占卜还是预测分析,我们并不知道自己现在处在哪一个卦或位,也不明白自己所处的情况,只能凭感觉。从占卜来讲,就是通过么一个场景,每一卦的每个一爻找到自己的定位。而大数据预测就需要聚焦到具体的行业应用的特定功能,这也是现代预测的定位要求。

     预测分析的过去与现在

    人处在这个世界上,与这个世界的关系不停地在变化,只要发生了变化,就包含了它的象、数、理。 人的智慧如果能够全面了解事物的象、数、理,就会知道事物的变化,就能够知变,预测未来,这就是《易经》的智慧。

    从制造业预测分析工具来看,过去正是对高质量算法的需求驱动着预测性分析市场的发展。无论是对于库存优化、状态和可靠性维修,还是先进的基于模型的过程控制和过程优化,预测引擎的质量以及对过程或领域动态的了解是获得可靠且可盈利的结果的关键。这是“过去”式的预测分析。

    “现在”的预测分析更象沃森技术。能够解的问题并没有框架,而且沃森可以处理缺损数据,并提供可靠结果的基于平台的计算预测性分析,功能着实强大,正在改变着预测性分析的局面。多种多样且结构不定的大数据促进数据库的制造者比如企业软件供应商和数据库供应商等提供配置功能强大的分析引擎。而强大的分析引擎反过来又使任何人都可以在几乎任何类型的数据基础上进行预测分析并获得可以比较满意的结果。

    2预测分析:准不准与信不信

     

    占卜准不准? 很难讲。 预测准不准,也很难讲。 一件事让10个人来做,一定会有很多种不同的结果。算命或预测亦是如此。

    如果卜出来的结果是好,大利,当然高兴。如果卜出的结果是大凶,不利,我们还要不要继续把工作或事情做下去么? 无论您的心里有多么强大,卜出来的结果多少都是会影响你。占卜是《易经》里面非常重要的内容。作为至圣先师的孔子,因为喜欢《易经》而韦编三绝,但他却忠告世人:不占而已。 既然占卜是《易经》的功能之一,为什么先师又劝我们不占呢?一定有很多种原因。 曾仕强教授认为熟悉卜卦的人,从一开始就知道第一爻到最后一爻,这当中的变化又多少,所以不可以完全相信占卜的结果应该是孔圣人不占的主要原因之一。

    对于大多数企业而言,预测性分析主要是在现有数据的基础上,理解可能出现的可能性。预测的准确性取决于预测算法的好坏或准确性以及预测算法操作时所使用的数据的“质量”。

    随着物联网技术的发展,采集数据的方式多样化,数据的总量显著增多。但是,数据可能质量的确不高。也就是说,数据其实并不精确,这也是大数据分析中讲的要拥抱混乱。如果利用这些不够精确的数据,不管预测算法或模型如何高明,预测结果的准确率都会下降。

    另外一种情况就是数据基本准确,但不够完整。 当然,我们要采集足够的样本又有相当的精确度在现实生活中的难度非常高。预测算法在没有足够的完整数据样本前提下做出的预测,预测结果也不会好到哪里去。当然,如果算法本身有很多不足,不管数据质量多高,预测结果还是很可能有误。

     未来的预测性分析

    随着工业物联网(Industrial IoT) 的发展,传感器、系统、设备等产生的数据正在迅猛增长。过去依赖大量工程及特定领域的预测性分析解决方案将难以跟上如今不断扩大的数据云。云计算的计算与存储等功能将变得更加强大,拥有自学习型预测性分析解决方案的能力从而适应新的且不断变化的数据流,将对过去的预定义模型发起颠覆性的挑战。

    然而,即便基于云的自学型系统提供的预测质量可以与专用解决方案作出的预测结果相媲美,但这还不是未来的预测分析。最终的预测分析的领导者必须符合下面这三个优势:

    第一,能够适应不断增长的复杂数据流的学习型预测分析解决方案。

    第二,可以为特定行业、特定领域、特定功能的模型提供高质量预测结果与创新思路。

    第三,所有企业都支付得起的预测解决方案。

    风险管控是现代管理学也是预测管理学中的一个重点。其背后的思路与《易经》中占卜类似,那就是预测占卜后,我们可以拿结果做为参考,从当中找到合理的,能够趋吉避凶,能把损害减到最小到路径。■

    首发于《中国工业评论》

    相关阅读

    采用工业物联网与大数据分析的四个重点|智能制造

    张礼立

    盘古智库学术委员,博士,拥有20年的全球信息产业工作经验,硅谷IT精英,也是中国互联网先行者。现任上海市侨联青年委员会理事,上海市海外经济技术促进会理事,上海信息化中心专家成员,盘古智库学术委员,上海浦东智慧城市研究院研究员,盘古智库智慧城市研究中心副主任兼秘书长,玖道科技首席战略官。曾任职多家全球上市公司高管,负责销售、产品、团队管理及成功的创业经历。兼任中国人民大学CIO研究中心研究员,国际最佳实践管理联盟中国区副秘书长,国际灾难协会技术委员会理事。著有《IT服务管理新论-中国式智慧和西方文化整合的研究》《大数据时代的云计算敏捷红利》。

  • ?

    32个算法—大数据最核心的关键技术

    荀依珊

    展开

    奥地利符号计算研究所(Research Institute for Symbolic Computation,简称RISC)的Christoph Koutschan博士在自己的页面上发布了一篇文章,提到他做了一个调查,参与者大多数是计算机科学家,他请这些科学家投票选出最重要的算法,以下是这次调查的结果,按照英文名称字母顺序排序。

    1、A* 搜索算法——图形搜索算法,从给定起点到给定终点计算出路径。其中使用了一种启发式的估算,为每个节点估算通过该节点的最佳路径,并以之为各个地点排定次序。算法以得到的次序访问这些节点。因此,A*搜索算法是最佳优先搜索的范例。

    2、集束搜索(又名定向搜索,Beam Search)——最佳优先搜索算法的优化。使用启发式函数评估它检查的每个节点的能力。不过,集束搜索只能在每个深度中发现最前面的m个最符合条件的节点,m是固定数字——集束的宽度。

    3、二分查找(Binary Search)——在线性数组中找特定值的算法,每个步骤去掉一半不符合要求的数据。

    4、分支界定算法(Branch and Bound)——在多种最优化问题中寻找特定最优化解决方案的算法,特别是针对离散、组合的最优化。

    5、Buchberger算法——一种数学算法,可将其视为针对单变量最大公约数求解的欧几里得算法和线性系统中高斯消元法的泛化。

    6、数据压缩——采取特定编码方案,使用更少的字节数(或是其他信息承载单元)对信息编码的过程,又叫来源编码。

    7、Diffie-Hellman密钥交换算法——一种加密协议,允许双方在事先不了解对方的情况下,在不安全的通信信道中,共同建立共享密钥。该密钥以后可与一个对称密码一起,加密后续通讯。

    8、Dijkstra算法——针对没有负值权重边的有向图,计算其中的单一起点最短算法。

    9、离散微分算法(Discrete differentiation)。

    10、动态规划算法(Dynamic Programming)——展示互相覆盖的子问题和最优子架构算法

    11、欧几里得算法(Euclidean algorithm)——计算两个整数的最大公约数。最古老的算法之一,出现在公元前300前欧几里得的《几何原本》。

    12、期望-最大算法(Expectation-maximization algorithm,又名EM-Training)——在统计计算中,期望-最大算法在概率模型中寻找可能性最大的参数估算值,其中模型依赖于未发现的潜在变量。EM在两个步骤中交替计算,第一步是计算期望,利用对隐藏变量的现有估计值,计算其最大可能估计值;第二步是最大化,最大化在第一步上求得的最大可能值来计算参数的值。

    13、快速傅里叶变换(Fast Fourier transform,FFT)——计算离散的傅里叶变换(DFT)及其反转。该算法应用范围很广,从数字信号处理到解决偏微分方程,到快速计算大整数乘积。

    14、梯度下降(Gradient descent)——一种数学上的最优化算法。

    15、哈希算法(Hashing)。

    16、堆排序(Heaps)。

    17、Karatsuba乘法——需要完成上千位整数的乘法的系统中使用,比如计算机代数系统和大数程序库,如果使用长乘法,速度太慢。该算法发现于1962年。

    18、LLL算法(Lenstra-Lenstra-Lovasz lattice reduction)——以格规约(lattice)基数为输入,输出短正交向量基数。LLL算法在以下公共密钥加密方法中有大量使用:背包加密系统(knapsack)、有特定设置的RSA加密等等。

    19、最大流量算法(Maximum flow)——该算法试图从一个流量网络中找到最大的流。它优势被定义为找到这样一个流的值。最大流问题可以看作更复杂的网络流问题的特定情况。最大流与网络中的界面有关,这就是最大流-最小截定理(Max-flow min-cut theorem)。Ford-Fulkerson 能找到一个流网络中的最大流。

    20、合并排序(Merge Sort)。

    21、牛顿法(Newton's method)——求非线性方程(组)零点的一种重要的迭代法。

    22、Q-learning学习算法——这是一种通过学习动作值函数(action-value function)完成的强化学习算法,函数采取在给定状态的给定动作,并计算出期望的效用价值,在此后遵循固定的策略。Q-leanring的优势是,在不需要环境模型的情况下,可以对比可采纳行动的期望效用。

    23、两次筛法(Quadratic Sieve)——现代整数因子分解算法,在实践中,是目前已知第二快的此类算法(仅次于数域筛法Number Field Sieve)。对于110位以下的十位整数,它仍是最快的,而且都认为它比数域筛法更简单。

    24、RANSAC——是“RANdom SAmple Consensus”的缩写。该算法根据一系列观察得到的数据,数据中包含异常值,估算一个数学模型的参数值。其基本假设是:数据包含非异化值,也就是能够通过某些模型参数解释的值,异化值就是那些不符合模型的数据点。

    25、RSA——公钥加密算法。首个适用于以签名作为加密的算法。RSA在电商行业中仍大规模使用,大家也相信它有足够安全长度的公钥。

    26、Schnhage-Strassen算法——在数学中,Schnhage-Strassen算法是用来完成大整数的乘法的快速渐近算法。其算法复杂度为:O(N log(N) log(log(N))),该算法使用了傅里叶变换。

    27、单纯型算法(Simplex Algorithm)——在数学的优化理论中,单纯型算法是常用的技术,用来找到线性规划问题的数值解。线性规划问题包括在一组实变量上的一系列线性不等式组,以及一个等待最大化(或最小化)的固定线性函数。

    28、奇异值分解(Singular value decomposition,简称SVD)——在线性代数中,SVD是重要的实数或复数矩阵的分解方法,在信号处理和统计中有多种应用,比如计算矩阵的伪逆矩阵(以求解最小二乘法问题)、解决超定线性系统(overdetermined linear systems)、矩阵逼近、数值天气预报等等。

    29、求解线性方程组(Solving a system of linear equations)——线性方程组是数学中最古老的问题,它们有很多应用,比如在数字信号处理、线性规划中的估算和预测、数值分析中的非线性问题逼近等等。求解线性方程组,可以使用高斯—约当消去法(Gauss-Jordan elimination),或是柯列斯基分解( Cholesky decomposition)。

    30、Strukturtensor算法——应用于模式识别领域,为所有像素找出一种计算方法,看看该像素是否处于同质区域( homogenous region),看看它是否属于边缘,还是是一个顶点。

    31、合并查找算法(Union-find)——给定一组元素,该算法常常用来把这些元素分为多个分离的、彼此不重合的组。不相交集(disjoint-set)的数据结构可以跟踪这样的切分方法。合并查找算法可以在此种数据结构上完成两个有用的操作:

    查找:判断某特定元素属于哪个组。

    合并:联合或合并两个组为一个组。

    32、维特比算法(Viterbi algorithm)——寻找隐藏状态最有可能序列的动态规划算法,这种序列被称为维特比路径,其结果是一系列可以观察到的事件,特别是在隐藏的Markov模型中。

    以上就是Christoph博士对于最重要的算法的调查结果。你们熟悉哪些算法?又有哪些算法是你们经常使用的?

  • ?

    大数据预测思维方法,相关性并不意味着因果关系

    贲白凝

    展开

    时至今日,关于西方传来的一些哲学思想,不断地占据人们的思维空间,比如墨菲定律,比如二八定律,还有著名的蝴蝶效应。

    蝴蝶效应,通俗浅白形象来说,就是北半球一种蝴蝶展翅飞翔,很可能引起了南半球的一场风暴。

    随着大数据的兴起,人们发现有些风马牛不相及的事情,却有很强的关联性,或者叫做相关性。

    大数据的意义在于从海量的数据里寻找出一定的相关性,然后推演出行为方式的可能性。在大数据时代,随着存储和计算能力在不断提高,能够被数据化的东西也越来越多,所以利用统计学研究各种数据之间的相关关系,研究非相关数据之间的相关性就是相关性分析。这最终可以成为我们决策的依据,大大提升我们的管理效率或者处理事情的能力,也极大地颠覆我们原来的思维。

    虽然他们没有因果关系,例如随着甲的出现,必然会导致乙的出现。

    根据引力的计算,月圆月缺和潮起潮落,其实没有太强的因果关系,月球的引力不足以在地球的海面掀起如此的巨浪,但是他们是紧密相关的。

    几千年都是遵循这样的相关性。比如月相规律和女性的月经的关系,都不是一种强关联性,几乎没有因果关系。

    还有本文起初提到的蝴蝶效应,其实这本质上就是一种相关性,但是并不是因果关系,很显然从物理学力学都说不通。

    还有中医的脉诊,很多人以为这是一个脏腑的反应,其实真的搞错了,这本质就是一种镜像反射,中医把脉所取都在手太阴肺经上,何来直接对应五脏六腑之说?

    就是一种取象,取他们的相关性。

    有一个很精妙的比喻,相关性就像一个人照镜子,镜子里的人和你的动作一模一样,但是你和镜子里的人,没有半毛钱关系,开枪对着镜子里的人打,你却毫发无伤。

    相关性,并不意味着因果,但是可以看到一种趋势,一个结果,就照镜子,开枪把镜子打碎了,人也没事,但是看得清清楚楚,如此而已。

    TwitterHealth是纽约罗彻斯特大学发起的一个研究项目,可以通过分析用户的Twitter微博内容来预测用户会不会感冒。注意,他们仅仅分析微博内容!

    这一项目原来只是给研究人员用作数据挖掘和机器学习系统用的,后来开发出了这一功能。罗彻斯特大学计算机科学系主任Henry Kautz说:“TwitterHealth是一个专门研究分析不同地理位置信息的项目,比如智能手机的GPS信息。”

    Kautz说:“我们发现越来越多的社交媒体开始加入地理位置定位这一功能,人们在发Twitter微博的时候就会顺带上自己的地理位置信息。我们的研究小组就从网站上下载并研究此类信息。”

    Kautz的学生建立起一个计算机网络,专门用来下载地理位置坐标为大城市的Twitter微博。然后他们开始从海量的大数据资源中挑选可用数据。

    “我们发现,人们经常在Twitter微博中提到自己的健康状况。比如说‘我流鼻子了’、‘我感冒了’、‘我感觉不舒服’等。我们就设想,是否可以根据这些词句来跟踪季节性流感?”

    于是研究团队开始拙手写机器学习算法,在几百条实验微博中挑选“感冒微博”。

    最后团队的算法在挑选“感冒微博”时已经可以达到99%的准确率,几乎与人脑分析文本一致,而且“感冒”分析速度要快于美国本土最大的疾病控制中心。

    “从大数据中,我们可以发现季节性流感的分布和传播,我们测量和预测的精度完全不输疾病控制中心。”Kautz说道。

    从这个案例来讲,发微博和感冒完全没有因果关系,但是能够分析出来人群和个体的疾病特征,甚至连宏观的流行性疾病趋势分布图,都一清二楚。

    从这点上看,科学越来越接近玄学了。

    欢迎关注隐士申子源更多文章,与你分析碰撞思维火花!

  • ?

    大数据真的值得盲目崇拜吗?新研究表明大数据预估算法大有问题!

    Palo

    展开

    导语:累犯,就是被判有罪的人受罚之后再次犯罪的情况。目前,有关部门通常利用一些预测算法来估算这个比率。这个算法的结果对犯人来说很重要,它既可能影响最终判决,也可能决定能否假释,不过这种基于大数据的预判算法确实有大多数法官认为的那么可靠吗?

    为了检测算法在实际中的准确程度,由达特茅斯学院的研究人员Julia Dressel和Hany Farid领导的一个研究小组对一款广泛使用的商业风险评估软件(COMPAS)开展了研究,该软件又被称为“罪犯改造管理分析”。

    这款软件是用来预测一个人在定罪后的两年内是否会再次犯罪。

    然而,该研究的结果显示,COMPAS预测累犯率的准确度并不比没有刑事司法从业经历的志愿者们高多少。Dressel和Farid在一个网站上招募了一群志愿者,并随机分配给每人一小部分刑事案件中被告的信息。包括性别,年龄和以前的犯罪史等。研究人员要求他们根据手头的资料,去预测犯人是否会在未来两年内再次犯罪。

    最终结果显示,志愿者预测的平均准确率为62.1%,准确率中位数为64.0%,这已经非常接近COMPAS的准确度:65.2%了。

    此外,研究人员发现,尽管COMPAS会对多达137个信息项进行分析以得出结果,但使用只考虑两项被告信息(被告的年龄和先前的定罪次数)的线性预测法时居然也能得出几乎一样的结果。这足以体现,这种号称精确的算法其实并不完美。

    算法偏见问题

    该团队关心的一个方面是算法可能会具有“偏见”。

    在他们的研究中,志愿者和COMPAS在预测黑人被告的累犯率时都表现出相似的虚高误判率——尽管他们在做出预测时并不知道被告的种族。黑人被告的误判率是37%,而白人被告只有27%。这些志愿者误判的比率和COMPAS的比率相当接近:黑人被告40%,白人被告25%。

    在论文的讨论中,该研究小组指出,“黑人和白人被告在逮捕率上具有较大的差异,使得不同种族间误判率和漏判率的比较变得更为复杂了。”

    这方面的研究得到了美国有色人种协进会提供的数据支持,例如协进会发现“美国黑人和白人吸毒率大致相同,但黑人因吸食毒品而受到监禁处罚的概率几乎是白人的6倍”。

    论文的合著作者们在论文中指出,即使犯人的种族没有明确说明,但参考数据的某些方面也可能与种族相关,从而导致预测结果的差异。

    事实上,当团队为新志愿者提供犯人种族数据并让他们再次预估累犯率时,结果还是大致相同。该小组因此得出结论:“告知志愿者时排除种族并不能完全消除累犯预测中的种族差异”。

    重复的结果

    图|大数据预测算法真的可靠吗

    自从1998年以来,COMPAS已被用于评估超过100万人(虽然其累犯预测功能直到2000年才被推出,但这也足以体现它预测误差的后果可能已经影响甚广)。

    考虑到这庞大的基数,此次研究的结果如下:算法的精度甚至不超过一群没有刑事司法从业经历的志愿者,着实令人震惊。长久以来究竟犯了多少错误,影响了多少被告的正常保释,细思恐极。

    显而易见,这种预测算法远不够精确复杂,需要及早改进、更新。该团队用相同的数据训练了一个功能更强大的非线性支持向量机(NL-SVM),以验证他们的发现。

    图|预测算法的起源

    然而,向量机还是产生了与之前相似的结果,研究人员认为这是因为他们对算法进行了过于接近真实数据的训练,从而使实验结果“反弹”回了原点。

    Dressel和Farid表示,他们之前还专门只使用80%的数据对新向量机进行了算法训练,然后用剩下的20%数据进行测试,就是为了避免“过度拟合”——即当真实数据使用过多、算法对数据的亲和度过高后,算法的准确性会受到影响。

    什么是预测算法?

    图|什么是预测算法?

    最后,研究人员得出结论,也许这种累犯估计所讨论的数据根本就不是线性可分的,这意味着无论多么复杂的预测算法,都不会是预测累犯率的有效方法。

    考虑到被告的未来一定程度上是被估计结果决定的,达特茅斯学院的研究团队认为在使用这些算法做出决定前,一定要仔细斟酌。

    “想象一下,你是一个法官,你在裁决时使用了一款商用评估软件,它说:我们使用大数据进行分析后认为这个人是高风险的,于是你就听信了它的一家之言。”Farid说。

    “现在再想象一下,我告诉你,我在网上随机找了10个人对被告的累犯率进行了同样的预测,这就是他们预测的结果。你会轻易相信我这10个人的预测吗?显然不会。然而,这10个人的预测和所谓软件大数据评估的精度是相同的。这就是之前十多年司法系统做的蠢事:轻信算法。”

    这种预测算法不仅用于刑事司法系统。 实际上,我们每天都会遇到它们:它们几乎遍布日常生活的方方面面:从网络上的产品广告到流媒体服务的音乐推荐,几乎无处不在。

    图| 无处不在的预测算法

    但是,在新闻采访中出现的广告远不及对犯罪者的裁决重要。广告成功与否只关乎一家之利,但对罪犯的裁决却关乎他们之后的整个人生和全社会的稳定。要做到裁决公正,我们不能仅仅盲目轻信算法。对大数据预测算法进行何种程度的改进,对于现在的我们,还任重道远。

    编辑 | 褚茗帆

    审校 | 星亦

    致敬科技

    分享才是热爱

    TechPower科技力

    热爱因科技而发生

  • ?

    大数据探索:大数据预测与算法

    岸上鱼

    展开

    虽然你并没有见到过买彩票中奖的算命先生,但几乎每个中奖的人都会吹嘘自己拥有了算命先生的能力。有些中奖者,就像赵本山的小品中的人物那样,会声称自己是从梦中获得的灵感来选择号码,还有一些中奖者则会声称自己拥有某种超级预测的能力。

    但不管这些人如何声称自己拥有超能力,但我们可以相信,还是很少有正常的企业会高薪聘请这类人来帮助企业做市场预测分析。

    随着互联网和计算机的普及,人们做决策时越来越注重“数据驱动”,也就是说更加依赖于客观的统计数据而不是某些人的所谓“判断”。在这个以事实为基础的领域中,常见的词汇都是“分析学”、“大数据”、“商业情报”以及“数据科学”等。

    统计科学的任务就是在大量微观个体的相互作用中发现可以被辨识的宏观模式,这些模式可以是数学公式,可以是图标,也可以是若干个更为直观的指标或指数,如均值,方差,CPI和PPI等。

    在传统的统计学中,数据是“混合的”(mixed),就像容器内的分子。因此,我们关心的是大量数据中呈现出的宏观量,就像容器内气体的温度。

    但是大数据预测分析则更近了一步,它不仅仅是要搞清楚宏观统计规律,更要弄清宏观数据中的精细结构,例如,大数据分析既关心某款手机的销售量,更关心是哪个群体的人会更有可能购买该款手机。

    因此,在大数据分析的视野中,数据不再是混合的,而是“聚块的”(assorted)。表面上看是混杂的,但放大了看,则有精细的结构:华为手机用户产生的数据;鹿晗粉丝留下的数据;克罗地亚球迷留下的数据;等等。

    所谓的大数据,我将其定义为与人的行为相关的所有数据。人们几乎所有的行为都会留下痕迹,这些痕迹就是所谓的数据。这就意味着,在大数据的视野里,所有的数据就像道路上的脚印,虽然看上去杂乱却是“有迹可循”的。

    数据的“前后相随”形成了“足迹”,大数据分析技术可以帮助我们辨识出无数不同的“足迹”。但是我们一定要注意,这些“足迹”不是相互独立的而是相互影响相互关联的。有些足迹会“殊途同归”而有些足迹则会“分道扬镳”。

    由于人是有限理性的,因此对于问题类型的兴趣各不相同,即使对于同一个问题也会形成不同的看法。不同类型的数据虽然都被埋在了网络中海量的数据库里,但是具有不同兴趣不同知识背景的人们总是能够在其中“嗅出”自己所需要的特殊“信息素”,并进而引发五花八门的聚集行为。

    以维基百科为例。在维基百科的发展过程中,万维网构成了信息聚集和信息流的物理环境。如果有某位作者在维基百科中新增了一个词条,则该词条就会成为一个标识,它所包含的特殊的“信息素”会引导着那些对这个词条感兴趣的读者或编辑的聚集行为。在聚集过程中,他们以网页为媒介间接地进行交往,或增加内容,或修改内容,或激烈争论,持续不断地进行着信息和知识的交流。有时候他们会很快就达成共识,有时候则会在交流和反馈中产生“无中生有”的涌现,形成新的观念和新的词条,从而留下新的“信息素”而引发新的聚集。有时则会因为意见不合或者兴趣衰减而一哄而散。

    人们在由维基百科提供的工作环境基于stigmergic机制的间接交往,使得维基百科涌现出了巨大的“智慧”,其内容的广泛性、专业性、包容性、多样性和时代性都超过了任何一本由少数专家“精心编撰”的百科全书。然而,尽管维基百科呈现出多样性、不断变化、缺乏中央指挥,但无论是从短期看还是从长期看,它都始终保持了协调性。

    不过,实际上我们面对的绝大多数数据并不像维基百科那样有清晰的结构。如何才能在表面杂乱的数据中发现隐藏的结构和秩序,需要的是合适的算法。

    互联网和计算机的普遍使用每天都为我们留下海量的数据。数据仿佛只是无数事实和数字的堆砌,每条数据都显得无聊,有的人看到数据就头疼。然而正如库瓦尼先生所说的“数据是一种新型石油”那样,数据中蕴含着巨大的财富。

    不过数据本身还不是财富,作为原材料的数据只是一个枯燥无味的代码组合。只有通过合理有效的方法提炼出来的规律和知识才是如黄金般珍贵的财富。

    人的能力有限,不可能同时处理如此海量的数据,幸好现在有了计算机。但是,再强的计算机面对着每天都在指数式增长的海量数据也会感到“内存”有限,再强的CPU都会担心在某一时刻是否会因为温度太高而“自焚”。

    写到这里,想到了人的免疫系统。由于病毒或者细菌具有超强的变异能力,这使得新的病毒和细菌层出不穷,从理论上会趋于无限。很显然人的免疫系统中不可能储存如此多的病毒或细菌信息。面对这样的一种情况,密执根大学的John H. Holland教授产生了这样的想法:大自然一定有自己的算法。

    这个想法的伟大之处在于,只要拥有了好的算法(软件),有限的硬件就可以做无限的事情。

    Holland教授指出:“正是由于适应行为而导致的复杂性,阻碍了当今世界许多重大问题的解决。”

    事实上,免疫系统遵循着大自然的“节约”原则,任何一个时刻储存的信息都是有限。那些长期没有出现的细菌和病毒将会被淡忘甚至遗忘,而那些最近出现在身体的疾病信息则会被储存。因此,大多数人在感冒痊愈后的一段时间不再感冒,这是因为免疫系统记住了这些细菌或病毒的特征,只要出现就坚决消灭。而过了一段时间以后,这些病毒或细菌变异后将以陌生的面孔出现在免疫系统面前,从而蒙混过关,让人的病。

    Holland教授根据新达尔文主义的基本观点,抽象地分析了自然系统的自适应过程,提出了遗传算法(Genetic algorithm,简称GA),并以此来实现系统结构的演化过程。

    继遗传算法之后,很快有了进化算法、蚁群算法、鱼群算法、涌现算法和stigmergy算法等等自适应的算法。中国古代先哲老子的“道法自然”的理念在各种适应性算法中得到了完美的实现。

    适应性算法的出现,为一个新的学科——机器学习的诞生奠定了基础。

    机器学习,就是让电脑自动获取新知识和新能力,持续不断地输入现代社会最重要的非自然资源:数据。

    输入数据→机器学习→预测→通过经验数据的反馈再学习,通过这样的一个过程将会不断提高机器的预测能力。

    例如,好莱坞的影视公司会预测,如果某剧本被制作成影片,它是否会受欢迎。如果受欢迎,主要是什么年龄阶层或社会阶层的人会更加欢迎。

    对于足球队教练来说,他要知道哪些运动员会在关键比赛的关键时刻更容易“掉链子”,从而做出有效的换人安排。

    对于美国总统候选人来说,那些摇摆不定的选民更容易接受什么样宣传媒体和宣传口号,从而提高获胜的机会。

    机器学习会从这些发现中尝试建立预测能力,通过对数字的挖掘和试错,运用统计学方法和计算机科学方法实现这种预测。

    接下来,需要讨论的问题是,机器学习能否替代人们的自主学习?机器预测能否替代人的判断?还有一个更大的问题是,在强大的人工智能面前,人怎么实现真正的自由?

    本文作者 龚小庆

大数据预测算法

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP