中企动力 > 商学院 > 聚合大数据
  • ?

    畅谈聚合支付与风控 懂数据才能赢未来

    方开山

    展开

    6月2日,由移动支付网和深圳瑞赛网络科技有限公司(以下简称“瑞赛网络”)联合举办的《聚合支付与风控沙龙——大数据风控助力提升聚合支付商业价值》在深圳顺利召开,威富通CTO王文兴、瑞赛网络CEO张平、爱贝产品总监唐克锋应邀出席本次沙龙并进行主题演讲,沙龙由瑞赛网络产品总监望娟主持。

    会议现场

    聚合支付崛起之下,给大数据风控带来的机遇

    中国移动支付快速发展人所共知,主持人望娟以一个抢劫案故事作为开场,歹徒在这个移动支付时代已经难有现金可以抢掠。昨天,“互联网女皇”玛丽·米克也发布报告,美国的移动支付规模是中国的1/50,在这个移动支付风口,聚合支付又该如何把握机遇呢?

    主持人望娟

    威富通CTO王文兴以《移动聚合支付的挑战》为主题,清晰的解析了聚合支付的历史由来以及主要模式。

    威富通CTO王文兴

    王文兴认为,聚合支付的线下场景不能没有银行的参与,银行是推动聚合支付发展的一个重要角色。在银行卡时代,银行拥有大量的商户,聚合支付时代需要银行的助推才能发展起来,如果与银行进行竞争,争夺用户,新兴的聚合支付服务商会遇到较大的阻力。只有合作各方,互惠互利,向商户提供有价值的服务,产业才能可持续发展。

    此外,在聚合支付的发展过程中,王文兴认为有6个节点非常重要。

    其中,王文兴重点解释央行“二清”整治以及96费改对聚合支付的影响。聚合支付的“二清”之嫌不绝于耳,央行的整治为产业发展铺平了道路。而96费改之后,信用卡刷卡不封顶的举措,使得许多用户改用微信支付宝,这也促进了聚合支付的发展。

    虽然聚合支付在风口,但聚合支付的发展仍然需要面对诸多挑战:

    瑞赛网络CEO张平则接下王文兴的话题,以《移动时代聚合支付商户的风险管理》为主题,解答目前聚合支付如何面对挑战。

    瑞赛网络CEO张平

    在费率低、产业同质化严重、数据安全等诸多问题之下,聚合支付急迫的需要寻找出路。张平认为,聚合支付服务商需要通过大数据来完善自身的商业模式,在风控方面做好,充分了解商户的数据和风险,才有利于聚合支付服务商拓展更多盈利模式。

    目前,支付机构及其代理商风险包括法律风险、渠道被关风险,支付代理商风险还包括二清风险、敏感信息留存风险、产业竞争风险。其中张平也重点讲解了《网络安全法》的实施对产业的影响,聚合支付服务商需要对数据的收集底线更加敏感,不仅仅不能碰资金,对敏感数据更不能触底,《网络安全法》的推出也是从另一个角度给聚合支付服务商敲警钟。

    此外,张平也为现场观众讲解了聚合支付风险的一些新特点。

    在张平对大数据与风控的重要性进行解析之后,爱贝产品总监唐克锋也直接点题本次沙龙主题,以《大数据在聚合支付风控中的价值》为话题,进一步细化大数据风控对于聚合支付的价值。

    爱贝产品总监唐克锋

    风控对于支付链条中的各方都有益处,对于聚合支付服务商而言,通过大数据风控,可以防止系统或安全漏洞导致的风险交易行为。此外,通过数据分析之后,还可以根据不同商户类型进行个性化服务。

    而做好风控也需要聚合支付服务商完善自身的数据来源,无论是内部数据还是外部数据。

    此外,唐克锋认为,风控不是一蹴而就的项目,需要长时间且循环的观测,不断精进风控策略,才能提供更切实有效的验证和参考。

    理论与市场的碰撞游刃于问答之间

    不仅仅有嘉宾的干货分享,沙龙中还有现场观众的不断“发难”,向嘉宾提出自己所遇到的各种市场问题,使得嘉宾的讲解不再理论,而是更多的与具体市场问题贴合。

    观众提问

    观众:聚合支付无法积累大量的C端数据,风控该如何去做?

    嘉宾:的确,无论是政策还是市场,聚合支付所能掌控的数据会略少,但也并不是没有突破口,在不触监管底线的情况之下,聚合支付需要整合各方资源,丰富自身的服务内容,特别是在与支付机构和银行的合作当中。

    观众:在商户方面而言,聚合支付是否会针对商户做定制开发?

    嘉宾:答案是肯定的,不论是ERP还是SaaS服务,聚合支付厂商都需要针对不同的商户进行开发。只有更加深度的接触商户之后,聚合支付才能够调整自身产品策略,推陈出新,在激烈的市场竞争中崭露头角。

    嘉宾回答

    观众:聚合支付哪个地域的发展潜力更大?

    嘉宾:这是一个非常好的问题,聚合支付起初的发展是一线城市先打起来,目前一线城市的市场基本已经被大企业所瓜分,二线城市的机会可能更大,特别是人群集中度较高的城市。值得一提的是,中国是一个巨大的市场,目前也没有哪个聚合支付服务商能够通吃全国,所以在不同地区不同城市都存在很大机遇。对于想要拓展其他地区的聚合支付服务商而言,可以对全国主要城市进行系统的数据分析,其中包括竞品、居民消费习惯等方面,根据自身企业的业务特点,选取不同维度进行分析,进而决定拓展哪些区域市场。这可能是一个浩大的工作,但是对于聚合支付企业的回报也将是丰硕的。

    说在最后

    聚合支付是国内支付行业热门的话题,也是一个风口产业,同样相关企业所面临的挑战也不断涌现。在这大浪淘沙的时代,企业更需要把服务做的更加精细化,为商户提供更加优质,更加深度的服务。而大数据风控正是为企业的精细化服务做保障,懂得商户才能赢得未来。

  • ?

    一起来聊聊最近很火的大数据架构师NoSQL建模技术

    姝梵

    展开

    1.前言

    为了适应大数据应用场景的要求,Hadoop以及NoSQL等与传统企业平台完全不同的新兴架构迅速地崛起。而下层技术基础的革命必将影响上层建筑:数据模型和算法。简单地将传统基于第四范式结构化关系型数据库的模型拷贝到新的引擎上,无异于削足适履,不仅增加了大数据应用开发的难度和复杂度,又无法发释放新框架的潜能。

    该如何构建基于NoSQL的数据模型?现在能供参考的公开知识积累要么是空虚简单的一句“去规范化“或粗暴的宽表化(将query和应用需要访问的所有字段“排排坐“,放在一个有很多列的结构化表中),要么是针对具体工具或具体场景的实现细节,(如《HBase权威指南》中对于如何设计HBase主键的探讨)。没有一个像编程的设计模式一样的,在模型架构层面可以遵循的方法论。

    在比较不同的NoSQL数据库时,通常使用功能以外其他各种指标,如可扩展性、性能和一致性。由于这些指标通常是使用NoSQL的初衷,所以无论从理论的角度还是实践的角度被深入地研究了,而像CAP定理这样的分布式系统基础结论也同样适用于NoSQL系统。另一方面,在NoSQL的数据模型领域,却还没有很好地研究过,也缺乏关系数据库中那种系统性的理论。

    我在这篇文章中从数据建模的角度对NoSQL家族系统做了比较简单的比较,并简要介绍几种常见建模技术。

    2.NoSQL数据模型视图

    要探索数据建模技术,必须先从系统性的NoSQL数据模型视图着手,这多多少少能帮助我们揭示其发展趋势以及相互之间的关系。下图描绘了主要NoSQL家族系统的虚拟“进化”过程,即键值存储,BigTable类型的数据库,文档数据库,全文搜索引擎,数据库和图形数据库:

    首先,我们应该注意到,一般意义上讲,SQL和关系型模型都是在很久以前就被设计出来,目的是为最终用户交互之用。这种面向用户的性质有极深的影响:

    最终用户往往对汇总报表信息感兴趣而不是单独的数据项,因而SQL这方面做了大量的工作。

    不能指望作为自然人的用户能显式地控制并发性、完整性、一致性或者数据类型有效性。这就是为什么SQL竭力关注于事务保证、schema和参照完整性。

    另一方面,软件应用程序往往对在数据库内部做聚合没有太大的兴趣,而且至少在许多情况下,程序能够自己控制完整性和有效性。除此之外,剔除这些功能对于性能和可扩展性存储的影响极其重要。

    新数据模型的演变开始了:

    键-值存储是一个非常简单,但非常强大的模型。下面所描述的许多技术都完全适用于这个模型。

    键值模型最致命的缺点之一就是不适合按范围处理主键的场景。有序的键-值模型突破了这一限制,并显著提高了聚合能力。

    有序的键-值模型非常强大,但它不提供任何针对值(value)的建模框架。在一般情况下,值的建模可以由应用程序完成,但BigTable风格的数据库想得更加周到,它可以将值按照映射的映射的映射(map-of-maps-of-maps)进行建模,说得明确点,分别是列簇(column family)、列(column)和时间戳化的版本。

    文档数据库对BigTable模式提出两个明显的改善。第一,值可以被声明为任意复杂的schema,而不仅仅是一个映射的映射(map-of-maps)。第二,至少有一些产品实现了被数据库管理的索引。就这个意义上来讲,全文搜索引擎也可以同样被认为提供了灵活的schema和自动化的索引。他们之间主要区别在于,文档数据库是根据字段名对索引进行编组,而搜索引擎是使用字段值对索引编组。值得注意的是像Oracle Coherence这样的键-值存储系统增加了索引和内嵌入口处理器的功能,正逐步向文件数据库演进。

    最后,图形数据模型可以被视为有序的键-值模型朝另外一个方向的进化。图形数据库允许对业务实体进行非常透明的建模(这个东西取决于那个东西),而分层建模技术在这方面用的是另外的数据模型,但也可与之媲美。图形数据库和文件数据库息息相关,因为许多实现允许建模的值是映射或者文档。

    3.NoSQL数据建模的一般注意事项

    与关系型建模不同,NoSQL数据建模往往是从特定查询的应用开始:

    关系型建模是典型地被手上可用数据的结构所驱动。设计主要围绕着的是“我有什么样的答案?”

    NoSQL数据建模通常由特定应用的访问模式所驱动,比如需要支持的查询类型。设计主要围绕着的是“我有什么问题?”

    NoSQL数据建模往往比关系数据库建模需要更加深入地了解数据结构和算法。在这篇文章中,我介绍了几个著名的数据结构,他们虽然非NoSQL所特有,但对于实际的NoSQL建模非常有用。

    数据复制和去规范化是一等公民。

    关系数据库在对分层或图形数据进行建模和处理时不是很方便。图形数据库显然是这个领域的完美解决方案,但实际上大多数的NoSQL也都非常善于解决这样的问题。这就是为什么这篇文章为分层数据建模单独写了一个章节。

    虽然数据建模技术基本上和具体实现无关,但我还是列出了在写这篇文章时我能想到的产品:

    键值存储:Oracle Coherence,Redis,Kyoto Cabinet

    BigTable风格的数据库: Apache HBase,Apache Cassandra

    文档数据库: MongoDB,CouchDB

    全文搜索引擎: Apache Lucene,Apache Solr

    图形数据库:Neo4j,FlockDB

    4.概念技术

    本节专门介绍NoSQL数据建模的基本原则。

    1、 去规范化(Denormalization)

    可以将去规范化定义为把相同的数据复制到多个文档或数据表中,这样可以简化/优化查询处理,或者让用户数据能匹配一个特定的数据模型。在本文的大多数技术用到了这样或那样的去规范化。

    一般来说,去规范化用于以下的折衷:

    查询的数据量或每次查询IO**与总数据量的折衷。去规范化可以将一个查询所需的所有数据组合起来存放到同一个地方。这通常意味着对相同数据的不同的查询会访问不同的数据组合。因此,数据需要被复制多份,也就意味着增加了总数据量。

    处理复杂性与总数据量的折衷。建模时的规范化和相应查询的连接(join)明显增加了查询处理器的复杂度,在分布式系统中尤为明显。去规范化允许将数据按照查询友好的方式存储,从而简化查询的处理。

    适用性:键值存储,文档数据库, BigTable风格的数据库

    2、 聚合(Aggregates)

    所有主流NoSQL都提供了这样或那样的松散schema(soft schema)支持:

    键值存储和图形数据库通常不对值进行约束,所以值可能是任意格式。另外,也可以通过使用组合键将一个业务实体表示为多条记录。例如,可以将一个用户帐户建模为UserID_name,UserID_email,UserID_messages等组合键表示的一个实体集合。如果用户没有电子邮件或消息,然后相应的实体不会被记录。

    BigTable模式也支持松散schema,因为一个列簇是可变的列集合,一个单元格又能存储不定数目的数据版本。

    文档数据库天生就没schema,虽然某些文档数据库允许在数据输入时使用用户定义的schema进行验证。

    松散schema允许使用复杂的内部结构(嵌套实体)构造实体的类,也允许改变特定实体的结构。这个更能带来了两个重要的便利:

    通过嵌套的实体,最小化了一对多的关系,也因此减少了连接(join)。

    异构业务实体的模型可以使用一个文档集合或者一个数据表。松散schema掩藏了这种建模和业务实体之间“技术”上的差异。

    我们用下面的图来说明这些便利。该图描绘了对电子商务领域中一个产品实体进行的建模。首先我们可以认为所有的产品都有一个ID、价格(Price)和描述(Description)。进一步来看,我们发现不同类型的产品有不同的属性,如图书包含作者信息,而牛仔裤有长度属性。这些属性中间的某些属性天生就有一对多或这多对多的特性,比如音乐唱片中的曲目。

    更进一步来看,可能有些实体不可能使用固定的类型进行建模。例如,不同品牌的牛仔裤的属性是不固定的,而每个制造商出产的牛仔裤的属性也是不一致的。在规范化的关系型数据模型中虽然这些问题都可以解决,但方法很猥琐。松散schema软架构允许只使用一个聚合(Aggregation)(产品)就能对所有类型的产品及其属性进行建模:

    内嵌的去规范化会在性能和一致性上对更新操作造成很大的影响,所以要特别注意更新过程。

    适用性:键值存储,文档数据库, BigTable的风格数据库

    3、 应用端连接(Application Side Joins)

    很少有NoSQL解决方案支持连接。NoSQL“问题导向”性质的后果就是,通常在设计时处理join,而关系型模型是在执行查询时处理join。查询时处理join几乎肯定会带来性能上的损失,但在许多情况下,可使用去规范化和聚合,即嵌入嵌套实体来避免join。当然,join在许多情况下是不可避免的,而且应该由应用程序处理。主要的用例:

    多对多关系往往是通过链接(link)建模的,这需要join。

    聚合操作往往不适合内部实体会被频繁修改的场景。通常更好的办法是将发生的事情作为一条新的记录保留,并在查询的时候将所有记录做join,而不是去更改值。例如,对于一个信息系统而言,可以用嵌套包含了Message实体的User实体来建模。但是,如果会经常地添加消息,更好的办法可能是把Message提取出来作为独立实体,并在查询时再将其与User进行连接:

    适用性:键值存储,文档数据库, BigTable风格数据库,图形数据库

    5.一般建模技术

    在本节中,我们将讨论适用于各种NoSQL实现的一般建模技术。

    1、 原子聚合(Atomic Aggregates)

    许多NoSQL解决方案提供了有限的事务支持,虽然有些NoSQL不支持。在某些情况下,人们还可以使用分布式锁或应用程序管理的MVCC机制实现事务行为,但常见的是使用聚合技术来对数据建模,以保证一些ACID特性。

    强大的事务处理机制对于关系型数据库而言是不可或缺的,其中原因之一就是规范化的数据通常需要在多个地方进行更新。另一方面,聚合允许一个单个业务实体存储为一个文件,行或键值对,从而可以对其进行原子性的更新:

    当然,做为一种数据建模技术,原子聚合并不是一个完善的事务型解决方案,但如果存储能提供原子性、锁或者TAS(test-and-set,测试并设置)指令上的一些担保,那原子聚合就是可行的。

    (译者注:即将需要事务性操作的业务数据聚合放在一起,存储在一个NoQSQL提供或者应用能提供原子性操作的数据结构中。使用HBase时,将某个用户某个业务的所有数据,如上图,用一行存储就是这种模式的应用。)

    适用性:键值存储,文档数据库, BigTable风格数据库

    2、 可枚举主键(Enumerable Keys)

    也许无序键-值数据模型最大的好处就是可以通过将主键哈希的办法把实体数据分别存储在多个服务器上。排序使事情变得更加复杂,但是即使存储不提供这样的功能,有时应用程序也能利用到有序主键的优势。让我们将对电子邮件建模作为一个例子:

    某些NoSQL存储提供原子计数器,能生成一个顺序化的ID。在这种情况下,可以使用userID_messageID作为一个复合键来存储消息。如果最新的消息ID是已知的,那就可以遍历以前的消息。另外,对于任何一个给定的消息ID,也可以向前或向后进行遍历。

    也可以将消息分桶(bucket),例如,每天的数据放到一个桶里。这样就允许从任何指定日期或当前日期开始,向前或向后遍历一个邮箱。

    适用性:键值存储

    (译者注:能利用主键的一些自然或业务维度的特征,将随机读写转换为顺序读写能提高遍历性能,同时能方便应用逻辑编写。但需要注意对分布式部署时并发写的影响以及对于业务的过度耦合。对于无序主键和有序主键的讨论可以参见《HBase权威指南》中Schema设计章节。)

    3、 降维(Dimensionality Reduction)

    降维这种技术允许将一个多维数据模型映射到一个键-值模型或其他非多维模型。

    传统的地理信息系统使用四叉树(Quadtree)或R树(R-tree)的某种变形来做索引。这些结构需要就地完成更新操作,因此在数据量很大时,维护开销相当的大。另一种方法是对这个二维结构进行遍历,并将其扁平化为一个普通的条目列表。使用这种技术的一个众所周知的例子是Geohash。 Geohash使用类似Z形状的路线来扫描整个二维空间,每次移动根据行进方向被编码为0或1。交错位的经度和纬度上的变更移动以及移动。编码过程在下图中进行了说明,其中黑色和红色位分别代表经度和纬度:

    如图所示,Geohash的一个重要特性是能够通过这种逐位编码的近似程度来估计区域之间的距离。Geohash编码允许使用简单普通的数据模型来存储地理信息,比如用有序键值保存空间上的联系。[6.1]讲述了BigTable中的降维技术。更多有关Geohash及其相关技术的信息可以在[6.2]和[6.3]中找到。

    (译者注:通过交织编码方式来能将原本需要多维度标示的数据,如cube,存储到一维的键值存储系统中,这是一种非常重要的建模模式:提供了不同缩放等级下在多维空间中邻接的数据仍然顺序存储,遍历高效;同时不同主键从前向后的相似度和空间距离的远近相一致,能通过键值的简单顺序比较判断其位置“相似度”。

    它的应用远远不只地理信息的表示,有多个维度属性不同粒度的数据表示都能用到这个技术,比如线下销售交易数...

  • ?

    干货 | 这是一份完整的大数据处理技术总结与分析

    贡夫勒维尔

    展开

    一 数据分析处理需求分类

    1 事务型处理

    在我们实际生活中,事务型数据处理需求非常常见,例如:淘宝网站交易系统、12306网站火车票交易系统、超市POS系统等都属于事务型数据处理系统。

    这类系统数据处理特点包括以下几点:

    一是事务处理型操作都是细粒度操作,每次事务处理涉及数据量都很小。

    二是计算相对简单,一般只有少数几步操作组成,比如修改某行的某列;

    三是事务型处理操作涉及数据的增、删、改、查,对事务完整性和数据一致性要求非常高。

    四是事务性操作都是实时交互式操作,至少能在几秒内执行完成;

    五是基于以上特点,索引是支撑事务型处理一个非常重要的技术。

    在数据量和并发交易量不大情况下,一般依托单机版关系型数据库,例如ORACLE、MYSQL、SQLSERVER,再加数据复制(DataGurad、 RMAN、MySQL数据复制等)等高可用措施即可满足业务需求。

    在数据量和并发交易量增加情况下,一般可以采用ORALCE RAC集群方式或者是通过硬件升级(采用小型机、大型机等,如银行系统、运营商计费系统、证卷系统)来支撑。

    事务型操作在淘宝、12306等互联网企业中,由于数据量大、访问并发量高,必然采用分布式技术来应对,这样就带来了分布式事务处理问题,而分布式事务处理很难做到高效,因此一般采用根据业务应用特点来开发专用的系统来解决本问题。

    2 数据统计分析

    数据统计主要是被各类企业通过分析自己的销售记录等企业日常的运营数据,以辅助企业管理层来进行运营决策。典型的使用场景有:周报表、月报表等固定时间提供给领导的各类统计报表;市场营销部门,通过各种维度组合进行统计分析,以制定相应的营销策略等。

    数据统计分析特点包括以下几点:

    一是数据统计一般涉及大量数据的聚合运算,每次统计涉及数据量会比较大。

    二是数据统计分析计算相对复杂,例如会涉及大量goupby、 子查询、嵌套查询、窗口函数、聚合函数、排序等;有些复杂统计可能需要编写SQL脚本才能实现。

    三是数据统计分析实时性相对没有事务型操作要求高。但除固定报表外,目前越来越多的用户希望能做做到交互式实时统计;

    传统的数据统计分析主要采用基于MPP并行数据库的数据仓库技术。主要采用维度模型,通过预计算等方法,把数据整理成适合统计分析的结构来实现高性能的数据统计分析,以支持可以通过下钻和上卷操作,实现各种维度组合以及各种粒度的统计分析。

    另外目前在数据统计分析领域,为了满足交互式统计分析需求,基于内存计算的数据库仓库系统也成为一个发展趋势,例如SAP的HANA平台。

    3 数据挖掘

    数据挖掘主要是根据商业目标,采用数据挖掘算法自动从海量数据中发现隐含在海量数据中的规律和知识。

    数据挖掘主要过程是:根据分析挖掘目标,从数据库中把数据提取出来,然后经过ETL组织成适合分析挖掘算法使用宽表,然后利用数据挖掘软件进行挖掘。传统的数据挖掘软件,一般只能支持在单机上进行小规模数据处理,受此限制传统数据分析挖掘一般会采用抽样方式来减少数据分析规模。

    数据挖掘的计算复杂度和灵活度远远超过前两类需求。一是由于数据挖掘问题开放性,导致数据挖掘会涉及大量衍生变量计算,衍生变量多变导致数据预处理计算复杂性;二是很多数据挖掘算法本身就比较复杂,计算量就很大,特别是大量机器学习算法,都是迭代计算,需要通过多次迭代来求最优解,例如K-means聚类算法、PageRank算法等。

    因此总体来讲,数据分析挖掘的特点是:

    1、数据挖掘的整个计算更复杂,一般是由多个步骤组成计算流,多个计算步骤之间存在数据交换,也就是会产生大量中间结果,难以用一条sql语句来表达。

    2、计算应该能够非常灵活表达,很多需要利用高级语言编程实现。

    二 大数据背景下事务型处理系统相关技术

    在google、facebook、taobao等大互联网公司出现之后,这些公司注册和在线用户数量都非长大,因此该公司交易系统需要解决“海量数据+高并发+数据一致性+高可用性”的问题。

    为了解决该问题,从目前资料来看,其实没有一个通用的解决方案,各大公司都会根据自己业务特点定制开发相应的系统,但是常用的思路主要包括以下几点:

    (1)数据库分片,结合业务和数据特点将数据分布在多台机器上。

    (2)利用缓存等机制,尽量利用内存,解决高并发时遇到的随机IO效率问题。

    (3)结合数据复制等技术实现读写分离,以及提高系统可用性。

    (4)大量采用异步处理机制,对应高并发冲击。

    (5)根据实际业务需求,尽量避免分布式事务。

    1相关系统介绍

    1) 阿里CORBAR系统

    阿里COBAR系统是一个基于MYSQL数据库的分布式数据库系统,属于基于分布式数据库中间件的分布式数据库系统。该系统是前身是陈思儒开发的“变形虫”系统(以前调研过),由于陈思儒离开阿里去了盛大,阿里当心“变形虫”稳定性等问题,重新开发该项目。

    该系统主要采用数据库分片思路,实现了:数据拆分、读写分离、复制等功能。由于此系统由于只需要满足事务型操作即可,因此相对真正并行数据库集群(例如TeraData等),此类系统提供操作没有也不需要提供一些复杂跨库处理,因此该系统存在以下限制:

    (1)不支持跨库的join、分页、排序、子查询。

    (2)insert等变更语句必须包括拆分字段等。

    (3)应该不支持跨机事务(以前变形虫不支持)。

    说白了此类系统不具备并行计算能力,基本上相当于数据库路由器!

    另外此类系统的在实际应用的关键问题是,根据什么对数据进行切分,因为切分不好会导致分布式的事务问题。

    2) 阿里OceanBase系统

    该系统也是淘宝为了解决高并发、大数据环境下事务型处理而定制开发的一个系统。该系统主要思路和特点如下:

    (1)他们发现在实际生成环境中,每天更新的数据只占总体数据的1%不到,因此他们把数据分为:基线数据和增量更新数据。

    (2)基线数据是静态数据,采用分布式存储方式进行存储。

    (3)只在一台服务器上存储和处理增量更新数据,并且是在内存中存储和处理更新数据。

    (4)在系统负载轻的时候,把增量更新批量合并到基线数据中。

    (5)数据访问时同时访问基线数据和增量更新数据并合并。

    因此这样好处是:

    (1)读事务和写事务分离

    (2)通过牺牲一点扩展性(写是一个单点),来避免分布式事务处理。

    说明:该系统虽然能处理高并发的事务型处理,号称很牛逼,但其实也只是根据电商的事务处理来定制开发的专用系统,个人认为其技术难度小于oracle等通用型的数据库。该系统无法应用到银行或者12306等,因为其事务处理的逻辑远远比电商商品买卖处理逻辑复杂。

    在目前的大数据时代,一定是基于应用定制才能找到好的解决方案!

    3) 基于Hbase的交易系统

    在hadoop平台下,HBASE数据库是一个分布式KV数据库,属于实时数据库范畴。支付宝目前支付记录就是存储在HBASE数据库中。

    HBASE数据库接口是非SQL接口,而是KV操作接口(基于Key的访问和基于key范围的scan操作),因此HBASE数据库虽然可扩展性非常好,但是由于其接口限制导致该数据库能支持上层应用很窄。基于HBASE应用的设计中,关键点是key的设计,要根据需要支持的应用来设计key的组成。

    可以认为HBASE数据库只支持作为KEY的这一列的索引。虽然目前HBASE有支持二级索引的方案,二级索引维护将会比较麻烦。

    2并发和并行区别

    并发是指同时执行通常不相关的各种任务,例如交易型系统典型属于高并发系统。

    并行是通过将一个很大的计算任务,划分为多个小的计算任务,然后多个小计算任务的并行执行,来缩短该计算任务计算时间。

    两者主要区别在于:

    (1)通讯与协调方面:在并行计算中,由于多个小任务同属一个大的计算任务,因此小任务之间存在依赖关系,小任务之间需要大量通讯和协调;相反,并发中的多个任务之间基本相互独立,任务与任务之间相关性很小。

    (2)容错处理方面:由于并发任务之间相互独立,某个任务执行失败并不会影响其它的任务。但是并行计算中的多个任务属于一个大任务,因此某个子任务的失败,如果不能恢复(粗粒度容错与细粒度容错),则整个任务都会失败。

    3本章总结

    数据量大不一定需要并行计算,虽然数据量大,数据是分布存储,但是如果每次操作基本上还是针对少量数据,因此每次操作基本上都是在一台服务器上完成,不涉及并行计算。只是需要通过数据复制、数据缓存、异步处理等方式来支撑高并发访问量

    三 大数据背景下数据统计分析技术介绍

    随数据量变大,和事务处理不同的是,单个统计分析涉及数据量会非常大,单个统计分析任务涉及数据会分散在多台服务器上,且由于计算量大,采用单台服务器进行计算,会导致计算时间非常长,单个统计分析任务必须采用并行计算方式来加快单个统计分析任务执行速度。

    1并行查询与并行计算技术介绍

    在大数据背景下的数据统计分析技术门类很多,常见的有:

    n MPP并行数据库 : TeraData、GreenPlum、Vertica等。

    n 基于MapReduce并行计算框架的数据仓库:

    HIVE(Hadoop平台) 、Tenzing(Google公司)

    n 基于Hbase的Phoenix系统

    n HadoopDB系统

    n EMC公司的hapt系统

    n MPP分布式查询引擎: Dremel、Impala、Presto、Shard query、Citusdb。

    n 基于SPARK的Shark、基于Dryad的SCOPE、基于Tez的stinger。

    n 基于hadoop+index的JethroData系统

    n 基于内存计算的Druid系统

    这些系统都解决了海量数据下的数据统计分析的问题,并且这些系统另外一个共同特点是都提供了SQL或者类SQL接口。

    为了能够较好研究这些系统,我们需要对并行查询与并行计算的相关技术做一个简要的介绍。

    首先所有的系统都可以分为三个层次: 语义层、并行计算引擎层、分布式存储层。语义层提供一个编程接口让用户表达所需要计算,并负责把该计算翻译成底层并行计算引擎可以执行的执行计划,并由并行计算引擎来执行,最下面一层是分布式存储层。

    对于提供类SQL接口并行计算系统,语义层可以认为是SQL解析层。

    1) 语义层

    SQL语言是一种声名式语言,SQL只是表达了要做什么,而没有表达怎么做。为此,SQL解析层主要作用是:将用户提交的基于SQL的统计分析请求,转化为底层计算引擎层可以执行的执行计划。也就是解决“怎么做”的问题。

    SQL解析层工作主要包括两个大方面:

    (1) 通过语法分析技术来理解要做什么。在关系数据库中,一般会把SQL语言分析后,形成树型结构的执行计划。

    (2) 在语法分析技术上,利用各种优化技术和算法,找出一种最经济物理执行计划。

    优化可以分为两个方面:一是逻辑层面优化、二是物理执行层面优化。

    (1) 逻辑层优化

    逻辑层面个人认为主要是因为同样表达一个分析请求,有的人SQL写的好,有的人SQL写的烂,因此在逻辑层面可以通过一些等价关系代数变换,实现查询重写,将写的比较烂的sql变换为好的写法。

    比较典型优化是:“把投影和过滤下沉,先执行过滤和投影操作”,减少中间结果。

    (2) 物理层优化

    物理层面优化是在逻辑优化后,结合实际物理执行过程,找出最优的物理执行计划。生成物理查询计划的工作包括:

    ü 增加一些操作符: 包括扫描和排序等。

    ü 确定各个操作符实现算法。例如扫描是全表扫描还是利用索引;Join是采用HASH连接、索引连接、合并排序等实现算法中的那一种。

    ü 确定操作符之间的数据流转方法:物化还是流水线方式。

    ü 采用基于代价估算方法确定最优的物理执行计划,目前代价估算主要是以估算该物理计划需要的IO量。另外对于并行数据库,则还要考虑通讯代价,即尽量减少数据在各个机器之间的传递。

    在物理层优化的代价估算过程中,代价估算需要依靠很多统计信息,如表有多大,表中相关列的值分布是什么样子等。传统数据库在数据Load过程中会事先计算好这些统计信息。并行计算中还需要考虑通讯代价。

    需要指出是,由于imapla、Presto、HIVE等系统只是一个查询引擎,它们可以直接查询以普通文件方式存储在HDFS系统上的文件,因此这些系统一般无法使用索引和各种统计信息来进行物理执行计划的优化,这些系统一般只能在逻辑层进行一些基于规则静态优化。根据SHARK论文,SHARK系统支持根据前面一些节点计算获得的信息,来动态优化后面执行计划。

    (3) 物化与流水线执行方法

    一条SQL语句对开发人员而言,感觉只是一次调用,但是实际上在数据库内部,一条SQL语句执行其实是有多个操作符组合而成的的树型结构计算流。如下图:

    针对该计算流有两种执行方式:一是基于物化或者是实体化执行方式,另外一种是基于数据流的执行方式。

    第一种方法的过程是: 把各个操作运算排序,并把每个操作运算的输出的中间结果存储在磁盘上,直到被另外一个操作运算所...

  • ?

    中国排名前50的大数据公司(排名不分先后)

    喻幻枫

    展开

    国内大数据服务企业主力阵营:

    1、TakingData

    TakingData以SmartDP为核心的数据智能应用生态为企业赋能,帮助企业逐步实现以数据为驱动力的数字化转型。

    2、友盟+

    友盟+基于全域数据、数据技术和商业场景,构建以7亿消费者为核心,覆盖数据化运营、数据营销、新零售数据服务、金融及手机解决方案的数据智能服务体系,驱动业务持续增长。

    3、精准科技

    精准科技是一家以用户画像为特色的大数据技术公司,致力于推动大数据在营销场景中的使用,业务主要涵盖汽车、金融、房产三大领域。

    4、浪潮

    浪潮互联网大数据采集中心已经采集超过2PB数据,并已建立5大类数据分类处理算法。近日成功发布海量存储系统的最新代表产品AS130000。

    5、腾讯

    腾讯拥有用户关系数据和基于此产生的社交数据,腾讯的思路主要是用数据改进产品,注重QZONE、微信、电商等产品的后端数据打通。

    6、 探码科技

    探码科技自主研发的DYSON只能分析系统,可以完整的实现大数据的采集、分析、处理。一直做的国外项目美国最大的律师平台、医生平台和酒店、机票预订平台的数据采集、分析、处理。将在国内推出一系列面向政务、企业的创新型大数据研究项目与合作,为各大企业提供高端信息技术咨询服务。

    7、中兴通讯

    中兴通讯推出的“聚焦ICT服务的高效数据中心整体服务解决方案”,可帮助运营商有效解决大数据时代建设IDC面临的大部分问题,提升运营商ICT融合服务能力。

    8、神州融

    神州融整合了国内权威的第三方征信机构和电商平台等信贷应用场景的征信大数据,通过覆盖信贷全生命周期管理的顶尖风控技术,为微金融机构提供大数据驱动的信贷风控决策服务。

    9、中科曙光

    中科曙光XData大数据一体机可实现任务自动分解,并在多数据模块上并行执行,全面提高了复杂查询条件下的效率。

    10、华胜天成

    华胜天成自主研发的大数据产品“i维数据”,颇具创新,近期又与IBM达成战略合作关系,涵盖Linux on Power市场、智慧城市、存储业务、管理服务、咨询与应用管理服务。

    11、神州数码

    “神州数码”启动了“智慧城市”战略布局,先后推出了市民融合服务平台、自助终端服务平台等产品,并在佛山、武汉等“智慧城市”建设中实践运用。

    12、用友

    用友在商业分析、大数据处理等领域进行研发,先后推出了用友BQ、用友AE等产品。

    13、东软

    东软大数据战略以医疗行业为突破口,凭借在社保、医疗行业积累的资源,搭建了东软熙康这一智慧医疗平台。

    14、金蝶

    金蝶KBI与金蝶ERP无缝集成,实现BI数据采集——集成——分析决策支持的一体化应用。

    15、宝德

    宝德大数据云备份,是一个专为大数据而设的云备份方案,支持实体机及虚拟机备份,而且具有无限扩充的可能,并且完全自动。

    16、启明星辰

    大数据时代的IP治理和审计,启明星辰提供了终端审计、终端数据防泄露、日志审计,通过综合审计平台来帮助用户解决IP治理需求等解决方案。

    17、拓尔思

    拓尔思通过收购天行网安,可以拓展在公安行业的应用,目前正着力开拓行业应用市场,挖掘各个产业链中的大数据价值。

    18、荣之联

    零售、证券、生物、政府等都是荣之联大数据业务的主要目标行业,已为零售业提供了大数据分析的解决方案,解决了库存问题。

    19、中科金财

    中科金财作为国内领先的高端IT综合服务商,主要服务于金融业的大数据。

    20、美亚柏科

    美亚柏科专注于公安市场,其业务包括电子数据取证、电子数据鉴定、网络舆情分析、数字维权、公证云、搜索云以及取证云服务。

    21、赛思信安

    国内存储技术与服务供应商赛思信安推出了自主研发的大数据管理系统,适用范围包括互联网、公众服务、商业智能、金融、医疗卫生、能源等多个行业。

    22、华宇软件

    华宇软件作为大数据、食品安全、法务软件等相关热门行业软件,同时也是公安领域大数据的上市公司。

    23、天玑科技

    天玑科技的数据中心运维管理服务,为大数据的分析能力提供了强大的后台支撑和保障。

    24、东方国信

    东方国信主营业务为企业商业智能软件及系统解决方案,收购北科亿力和科瑞明,有效拓展了工业和金融大数据领域。

    25、华三

    华三全融合虚拟化网络技术能够极大简化网络结构,减轻网络管理和维护量,为企业数据中心大规模建设提供最强有力的技术支持。

    26、海康威视

    海康威视基于英特尔Hadoop发行版,并融合可以灵活按需调配IT资源对应用和服务进行支持的开放架构云计算技术,打造出了视频智能云计算方案。

    27、高德

    高德与阿里将在地图搜索、产品商业化、数据共享、云计算等领域展开合作,特别是在数据共享方面,高德和阿里巴巴将共建一个大数据服务体系,

    28、四维图新

    作为提供导航地图、地理信息系统软件建设的内容提供商,现在已尝试使用大数据为政府部门提供决策。

    29、海捷科技

    专注于商业智能领域(BI)、数据仓库领域、数据库领域的专业咨询、项目实施、软件开发、系统集成等方面,为金融、电信、快速消费品等行业提供相应方案。

    30、北京信合运通

    信合运通专注于为运营商和行业客户提供基于大数据的深度分析和挖掘技术、渠道支撑服务及行业解决方案。

    31、海云数据

    海云数据专注于从事数据可视化,可为客户提供数据可视化的创意设计、制作和软硬件集成系统服务。

    32、九次方金融数据

    九次方金融数据在国内唯一以企业大数据分析的角度对有投资价值和并购价值的企业进行价值判断,持续跟踪企业动态变化的金融大数据公司。

    33、永洪科技

    永洪BI通过完全自主知识产权的数据集市产品(Z-Data Mart)支持大数据,Z-Data Mart汇聚了数十项自有专利,涵盖了分布式存储和计算、分布式传输和实时通信等关键领域。

    34、集奥聚合

    集奥聚合作为大数据服务提供商,其DataQuate解决方案主要用于解决运营商大数据的接入、挖掘及应用,为运营商大数据的价值转化提供端到端服务。

    35、华院数云

    华院数云以数据挖掘为核心、以商业智能和精准营销为主线、以SAAS云平台为主要服务模式,目前专注于电商领域,为客户提供行业领先的数据分析和精准营销平台服务。

    36、杭州诚道科技

    杭州诚道科技致力于为浙江、全国公安交通管理行业提供一流的信息化服务、产品和方案解决能力,其借助英特尔Hadoop分发版,已解决了大数据的采集和处理问题。

    37、勒卡斯

    勒卡斯是致力于为客户提供全方位直复营销解决方案和服务的大数据公司,主要有潜客沟通、会员管理、CRM软件定制及客户市场调研四大业务。

    38、北京阿尔泰科技

    北京阿尔泰科技专业数据采集系统的制造商。

    39、智拓通达

    智拓通达主要做中国主流社交平台的“大数据”分析,通过整合各大社交平台的用户数据、行为数据和 UGC 内容,为企业和个人用户提供定制化服务。

    40、国双科技

    国双科技数据中心拥有基于OLAP技术的强大交互式数据挖掘平台,可提供不同深度的分析报告,满足不同视角的数据挖掘和分析需求。

    41、时云医疗科技

    时云医疗科技今日发布了医疗领域的大数据“未病”预警云服务“康诺云”,有针对个人健康管理而设计的云律血压节律仪、云悦体质分析仪和云动智能健康监测腕表3款智能硬件。

    42、百分点

    百分点主要为电子商务企业提供站内流量转化和商业智能分析的整体优化解决方案,旗下有推荐引擎技术平台以及跨网站消费偏好平台。产品主要有BRE和BAE。

    43、精硕科技

    精硕科技是国内少有的第三方数字营销监测和调研机构,专注于为广告主提供全流程的网络广告效果监测、分析评估、媒介优化咨询和技术解决方案等服务。

    44、神策数据

    神策数据立足大数据及用户行为分析的技术与实践前沿,业务现已覆盖以互联网、金融、零售快消、高科技、制造等为代表的十多个主要行业、并可支持企业多个职能部门。

    45、百度

    百度的优势体现在海量的数据、沉淀十多年的用户行为数据、自然语言处理能力和深度学习领域的前沿研究。近来百度正式发布大数据引擎,将在政府、医疗、金融、零售、教育等传统领域率先开展对外合作。

    46、阿里巴巴

    阿里巴巴拥有交易数据和信用数据,更多是在搭建数据的流通、收集和分享的底层架构。

    47、华为华为云服务

    整合了高性能的计算和存储能力,为大数据的挖掘和分析提供专业稳定的IT基础设施平台,近来华为大数据存储实现了统一管理40PB文件系统。

    48、同盾科技

    同盾科技将人工智能与业务场景深度结合,为银行、保险、汽车金融、非银行信贷、基金理财、三方支付、航旅、电商、O2O、游戏、社交平台等十余个行业客户提供高效智能的风控、反欺诈及营销分析服务。

    49、国双科技

    国双科技是中国的企业级大数据和人工智能解决方案提供商。

    50、智慧足迹

    智慧足迹是由中国联通和西班牙电信合资成立的专业大数据公司,依托中国联通的数据能力,提供位置信息洞察及相关大数据业务。

  • ?

    友象宝:聚合支付+大数据将帮助企业更好盈利

    米泽尔法特

    展开

    随着市场竞争加剧和移动支付的快速发展,线下收单和线上支付基础服务费用均呈逐步走低趋势,支付产业快速崛起。其中,聚合支付可谓是近两年备受关注的热点,以支付为基础,用服务获得商户认可。借助大数据,许多聚合支付服务商推出各式各类增值服务,优化自身商业模式。

    根据艾瑞咨询的统计数据显示,2016Q4中国第三方移动支付交易规模达到18.5万亿元,2017Q1中国第三方移动支付交易规模已突破20万亿元。移动支付市场总额的逐年递增,向大众释放了一个“无现金时代“即将到来的有利信号和时代发展的必然趋势。

    在友象宝负责人看来,移动支付将会成为未来商业流量的新入口。移动支付的大数据价值将会大于碎片化场景的串联,能够将所有交易结构化。聚合支付如何利用数据帮助客户实现盈利,其实质就是如何帮助企业理解客户。增长智能就是用现代大数据和人工智能高效快速持续发现问题,解决问题,实现可量化商业增长。

    “简单来说,我们现在到外面的小吃店消费,都已经习惯了扫码付费,而小老板们除了能通过绑定的二维码收到钱,还能把所有的点餐、促销、支付大数据都将汇集到后台,通过智能分析,就可以看到店里到底是小笼包受欢迎还是小馄饨吃的人更多,每个季节大家最喜欢的品种是什么,什么样年龄和性别的顾客喜欢来吃等等,类似的数据分析就能让小吃店老板更精准地对上“吃货”胃口。“友象宝负责人说道。

    随着移动互联网的发展使得数据正日渐呈现结构化状态,企业应当对相关的支付数据流形成数据化概念,利用大数据帮助客户精准地找到那些具有支付能力的高潜用户,实现精准个性化营销。而单一的第三方数据并不能够合理分析消费者的诉求,基于第四方支付的友象宝能够结合消费习惯分析,对用户进行分群和精细化运营,帮助企业更好地经营。

    在支付方面,尽管随着消费者支付习惯的改变以及支付场景的增多,逐渐衍生出了更多的支付形式,但在第三方支付市场上,支付宝和微信已经占据了绝大部分市场份额。第四方支付要想在这样的市场获得更多的份额,加强差异化的竞争优势就显得尤为重要。第四方支付基于真实交易的大数据,能有效捕获用户深层次需求,通过支付+金融和支付+营销的模式降低金融服务门槛,提高金融服务效率。

    “友象宝除了能够快速为用户连接支付通道,减少高额成本支出外,还可根据商户的个性化需求提供定制化开发服务,涵盖客户管理系统、对账报表、数据统计分析等,一整套支付系统解决方案。“友象宝负责人介绍,友象宝专精于互联网支付及其衍生的网络金融整体解决方案,未来将加大对第四方支付的大数据应用。

  • ?

    康旗股份:构建大数据行业数据聚合计算的超级大脑

    Ji

    展开

    来源:项城网

    想要查询数据,不知道哪家供应商最靠谱?不知道什么来源最权威?不知道哪些内容最时新?别担心,一份《社会数据黄页报告》即将解决以上所有难题。这是从8月16日康旗股份(股票代码:300061)举办的“数据聚合超算中心”成立发布会上传出的消息。

    康旗股份CEO刘涛在发布会上致辞

    成立“数据聚合超算中心”,是康旗股份协助行业构建良好生态、实现良性共享的全新尝试,亦是赋能金融机构、服务社会大众的有力抓手。上海数据交易中心、谷歌(中国)、上海华瑞银行及沪上多家新闻媒体参加了发布会。

    近年来,上海通过加强大数据发展顶层设计,强化融合创新,深化数据资源共享和开放,已经形成了良好基础和先发优势。在此基础上,数据聚合超算中心的成立,肩负数据生态优化的使命,将建立一整套合理合法合规的数据聚合体系标准,基于数据为业务领域提供强大的智慧支持。

    数据聚合超算中心拥有多种行业背景下的客户特征和标签,其核心内容是数据聚合、超算大脑和成果输出。依托丰富的人工智能算法与可快速扩展的计算能力,构建智能营销、智能风控、智能获客能力,通过B2B2C提供金融科技服务、大数据营销服务和行业信用信息报告服务等,为业务领域提供强大的智慧支持。

    康旗股份数据聚合超算中心联席总监曹锐发言

    据悉,数据聚合超算中心正计划与合作伙伴一起整理并发布一份《社会数据黄页报告》,该报告将对目前行业内所有数据供应商进行一次较为全面的梳理,包括其数据来源、内容、时效性等方面的内容,并做出相应的测评,比如数据质量、服务能力等,测评结果等。这份报告在协助监管部门降低监管成本的同时,也可以帮助数据需求方降低调研成本、提高数据应用效率。

    作为在大数据金融科技领域的先行者和实践者,康旗股份已经拥有了领先的技术和成功的数据价值提升商业应用及运营经验。数据聚合超算中心力争在两年达到业内顶级,并取得政府支持、参与制定行业标准。

    康旗股份总裁刘涛表示,康旗股份未来将持续紧贴国家发布的大数据发展政策,在政策的导向下坚持创新发展、合规发展、赋能合作等核心理念,通过数据聚合超算中心及与各个合作方的共同努力,推动建立一个更加合法、合规的数据生态。

  • ?

    聚合“大数据” 力破“执行难”

    杜阿梅勒兹

    展开

    原标题:聚合“大数据” 力破“执行难”

    聚合“大数据” 力破“执行难”

    福建法治报-海峡法治在线11月19日讯 执行联动单位100家,查询、比对失信被执行人310万多次,拦截、限制、惩戒失信被执行人11万多次,10万多被执行人慑于强大压力自动履行法定义务……

    联动单位不落实责任,不合理实施惩戒,取消文明单位、平安先进单位的评选资格,扣减联动绩效综治考评分值,约谈问责处分负责人……

    “史上最严厉”联合惩戒措施在我省落地见效,失信被执行人面临更加高昂的处罚成本,“一处失信,处处受限”的格局在我省已然形成。

    聚共识——

    百部门“联合作战”惩戒失信

    “执行难”一直以来是法院工作的难点,亦是社会诚信的痛点。

    2016年1月20日,国家发改委、最高人民法院等44家部门联合签署了《关于对失信被执行人实施联合惩戒的合作备忘录》;同年9月,中办、国办发布《关于加快推进失信被执行人信用监督、警示和惩戒建设的意见》。

    为了尽快让这些规范性文件在我省落地生效,省高院多次向省委、省政府及省委政法委作专题汇报。省委、省政府高度重视,省“两办”率先在全国联合下发《关于加快推进失信被执行人信用监督、警示和惩戒机制建设的实施意见》,要求省发改委基于省公共信用信息平台,建立全省失信被执行人联合惩戒平台;各部门在各自业务系统的基础上进一步打破壁垒,加快推进失信被执行人信息与国家机关、人民团体、社会组织、企事业单位信用信息资源共享,最大限度地挤压失信被执行人的生存空间。

    在省委政法委多次牵头、各联动成员单位的大力支持及省高院的积极推动下,省发改委出资建立的“福建省失信被执行人联合惩戒平台”于2017年8月正式上线运行。截至目前,共有65家省直或下属单位完成自动对接,省直其他35家联动单位均以账号的方式登陆平台,通过人工方式反馈落实惩戒情况。

    “百家部门共同打造的全省联合惩戒平台具有惩戒手段多元、对接方式灵活、惩戒措施留痕的优势和特点,是一只‘长了牙齿的老虎’。它的上线运行将有效促进失信被执行人不敢逃债、不能逃债、不愿逃债局面的形成。”省高院副院长林玫瑰如是说。

    抓共建——

    大数据为“执行难”破题

    早在2014年,以“点对点”网络查控系统为基础的福建法院执行信息化作为“福建样本”走向全国。

    “如果说依靠信息化手段精准查控被执行人财产是推动执行工作变革的‘上半篇文章’,那么‘下半篇文章’就是要建立更为严厉的失信联合惩戒机制,让失信被执行人寸步难行。”省高院执行局局长许寿辉如是说。

    在联合惩戒平台搭建之前,各联动部门信息共享不畅,失信惩戒力度不够,部分失信被执行人通过各种渠道欠债不还、规避执行甚至对抗执行等失信行为屡见不鲜。这一系列问题在平台建立后得到了较好的解决。

    今年9月18日15时09分,林某到福州市不动产登记和交易中心准备办理房产证登记。但工作人员告诉林某,因其卷入一场民间借贷欠款纠纷,未履行法院生效判决,故其申请不能获批。交易心切的林某只得主动联系福州市鼓楼区法院,将欠款悉数还清。

  • ?

    基于大数据平台的数据分析

    瞿建辉

    展开

    标签 | 大数据 架构

    作者 | 张逸

    无论是采集数据,还是存储数据,都不是大数据平台的最终目标。失去数据处理环节,即使珍贵如金矿一般的数据也不过是一堆废铁而已。数据处理是大数据产业的核心路径,然后再加上最后一公里的数据可视化,整个链条就算彻底走通了。

    数据处理的分类

    如下图所示,我们可以从业务、技术与编程模型三个不同的视角对数据处理进行归类:

    业务角度的分类与具体的业务场景有关,但最终会制约技术的选型,尤其是数据存储的选型。例如,针对查询检索中的全文本搜索,ElasticSearch会是最佳的选择,而针对统计分析,则因为统计分析涉及到的运算,可能都是针对一列数据,例如针对销量进行求和运算,就是针对销量这一整列的数据,此时,选择列式存储结构可能更加适宜。

    在技术角度的分类中,严格地讲,SQL方式并不能分为单独的一类,它其实可以看做是对API的封装,通过SQL这种DSL来包装具体的处理技术,从而降低数据处理脚本的迁移成本。毕竟,多数企业内部的数据处理系统,在进入大数据时代之前,大多以SQL形式来访问存储的数据。大体上,SQL是针对MapReduce的包装,例如Hive、Impala或者Spark SQL。

    Streaming流处理可以实时地接收由上游源源不断传来的数据,然后以某个细小的时间窗口为单位对这个过程中的数据进行处理。消费的上游数据可以是通过网络传递过来的字节流、从HDFS读取的数据流,又或者是消息队列传来的消息流。通常,它对应的就是编程模型中的实时编程模型。

    机器学习与深度学习都属于深度分析的范畴。随着Google的AlphaGo以及TensorFlow框架的开源,深度学习变成了一门显学。我了解不多,这里就不露怯了。

    机器学习与常见的数据分析稍有不同,通常需要多个阶段经历多次迭代才能得到满意的结果。下图是深度分析的架构图:

    针对存储的数据,需要采集数据样本并进行特征提取,然后对样本数据进行训练,并得到数据模型。倘若该模型经过测试是满足需求的,则可以运用到数据分析场景中,否则需要调整算法与模型,再进行下一次的迭代。

    编程模型中的离线编程模型以Hadoop的MapReduce为代表,内存编程模型则以Spark为代表,实时编程模型则主要指的是流处理,当然也可能采用Lambda架构,在Batch Layer(即离线编程模型)与Speed Layer(实时编程模型)之间建立Serving Layer,利用空闲时间与空闲资源,又或者在写入数据的同时,对离线编程模型要处理的大数据进行预先计算(聚合),从而形成一种融合的视图存储在数据库中(如HBase),以便于快速查询或计算。

    场景驱动数据处理

    不同的业务场景(业务场景可能出现混合)需要的数据处理技术不尽相同,因而在一个大数据系统下可能需要多种技术(编程模型)的混合。

    场景1:某厂商的舆情分析

    某厂商在实施舆情分析时,根据基于需求,与数据处理有关的部分就包括:语义分析、全文本搜索与统计分析。通过网络爬虫抓取过来的数据会写入到Kafka,而消费端则通过Spark Streaming对数据进行去重去噪,之后交给SAS的ECC服务器进行文本的语义分析。分析后的数据会同时写入到HDFS(Parquet格式的文本)和ElasticSearch。同时,为了避免因为去重去噪算法的误差而导致部分有用数据被“误杀”,在MongoDB中还保存了一份全量数据。如下图所示:

    场景2:Airbnb的大数据平台

    Airbnb的大数据平台也根据业务场景提供了多种处理方式,整个平台的架构如下图所示:

    Panoramix(现更名为Caravel)为Airbnb提供数据探查功能,并对结果进行可视化,Airpal则是基于Web的查询执行工具,它们的底层都是通过Presto对HDFS执行数据查询。Spark集群则为Airbnb的工程师与数据科学家提供机器学习与流处理的平台。

    大数据平台的整体结构

    行文至此,整个大数据平台系列的讲解就快结束了。最后,我结合数据源、数据采集、数据存储与数据处理这四个环节给出了一个整体结构图,如下图所示:

    这幅图以查询检索场景、OLAP场景、统计分析场景与深度分析场景作为核心的四个场景,并以不同颜色标识不同的编程模型。从左到右,经历数据源、数据采集、数据存储和数据处理四个相对完整的阶段,可供大数据平台的整体参考。

  • ?

    云媒聚合财商带你看大数据时代

    郜珩

    展开

    当今的社会是一个快速发展的社会,科技信息流通发达,人们之间的交流越来越密切,生活也越来越方便,大数据就是这个新时代的高科技。

    随着云时代的来临,大数据也吸引了越来越多的关注。这些数据在下载到关系型数据库用于分析时会花费过多时间和金钱。大数据分析常和云计算联系到一起,因为实时的大型数据集分析需要像MapReduce一样的框架来向数百或甚至数千的电脑分配工作。

    在现今的社会,大数据的应用越来越彰显他的优势,它占领的领域也越来越大,电子商务,物流配送等,各种利用大数据进行发展的领域正在协助企业不断地发展新业务,创新运营模式。有了大数据这个概念,对于消费者行为的判断,产品销售量的预测,精确的营销范围以及存货的补给已经得到全面的改善与优化。

    "大数据"在互联网行业指的是这样一种现象:互联网公司在日常运营中生成、累积的用户网络行为数据。这些数据的规模是如此庞大,以至于不能衡量。

    大数据到底有多大?一组名为"互联网上一天"的数据告诉我们,一天之中,互联网产生的全部内容可以刻满1.68亿张DVD;发出的邮件有2940亿封之多(相当于美国两年的纸质信件数量);发出的社区帖子达200万个(相当于《时代》杂志770年的文字量);卖出的手机为37.8万台,高于全球每天出生的婴儿数量37.1万…

    截止到2012年,数据量已经从TB(1024GB=1TB)级别跃升到PB(1024TB=1PB)、EB(1024PB=1EB)乃至ZB(1024EB=1ZB)级别。国际数据公司(IDC)的研究结果表明,2008年全球产生的数据量为0.49ZB,2009年的数据量为0.8ZB,2010年增长为1.2ZB,2011年的数量更是高达1.82ZB,相当于全球每人产生200GB以上的数据。而到2012年为止,人类生产的所有印刷材料的数据量是200PB,全人类历史上说过的所有话的数据量大约是5EB。IBM的研究称,整个人类文明所获得的全部数据中,有90%是过去两年内产生的。而到了2020年,全世界所产生的数据规模将达到今天的44倍。

    每一天,全世界会上传超过5亿张图片,每分钟就有20小时时长的视频被分享。然而,即使是人们每天创造的全部信息--包括语音通话、电子邮件和信息在内的各种通信,以及上传的全部图片、视频与音乐,其信息量也无法匹及每一天所创造出的关于人们自身的数字信息量。

    这样的趋势会持续下去。我们现在还处于所谓"物联网"的最初级阶段,而随着技术成熟,我们的设备、交通工具和迅速发展的"可穿戴"科技将能互相连接与沟通。科技的进步已经使创造、捕捉和管理信息的成本降至2005年的六分之一,而从2005年起,用在硬件、软件、人才及服务之上的商业投资也增长了整整50%,达到了4000亿美元。

  • ?

    大数据形势下的三种数据融合方式:组合、整合和聚合

    绮彤

    展开

    一、 跨行业数据合作背景

    国务院副总理马凯,曾经在2015贵阳国际大数据产业博览会中提到:

    融合是大数据的价值所在,应大力推动大数据与产业融合,面向工业、交通、物流、商贸、金融、电信、能源等数据量大的行业领域,开展数据开发和交易,充分挖掘大数据的商业价值,促进产业提质增效升级。

    另外,《大数据时代》的作者舍恩伯格,在该书中也提到一个观点:“大数据不是随机样本而是全体数据”。

    无论是从国家政府部门还是领域专家都不约而同的提到数据需要融合,数据融合才有价值。

    二、 为什么需要数据融合?

    其中最重要原因是用户数据的割裂性,无法全面勾勒用户全貌。比如你的购物数据在京东天猫、通话数据在移动电信、交易数据在银行金融、社交数据在腾讯微信、搜索数据在百度等等。

    数据的割裂性导致对用户的认识比较片面,可能做出错误的决策。比如:现在京东与头条的“京条计划”就是数据合作的一个案例,就是你在京东搜索的物品,会不定时在浏览今日头条中呈现,增加购买率。这里有个缺陷是如果已经在淘宝购买的物品,但还是会出现页面,导致用户体验感知下降。

    数据融合的另一个价值就是新规律新价值的发现。比如以前用户信用主要基于是否有历史借贷违约,但很多人无借贷关系数据,如何评定。芝麻信用就创新的融合上网数据、身份特征、行为偏好、社交关系等生活属性数据,来侧面刻画用户的信用。这就是数据融合价值。

    不同行业数据的融合,具有互补性和完整性,将有效提升数据内涵价值。

    三、 数据融合的三种方式

    数据融合的方式从交互程度来讲,可分为数据组合、数据整合和数据聚合等三个层次,由低到高,逐步实现数据之间的深度交互。

    层级一:数据组合由各方数据的简单组合形成,能够全貌客户用户特征。该数据的融合产生的是物理反应,数据属性本质没有改变。如一份征信报告,有交易数据,有通信数据,有购物数据等,简单的拼装而成。如下图:

    层级二:数据整合由多方的数据共同存在才能够实现产品价值。该数据的融合产生的是化学反应,有价值产生。如:黑名单,通过金融数据和通信行业数据共同才能判断是否黑名单。如该用户有异常金融行为,在加上该用户频繁换手机和停机次数多,基本可判断黑名单用户。

    层级三:数据聚合(核反应)由双方数据聚合孵化产生出新的产品,新模式。如:分期贷款。通过大数据风控能力,不仅减少审核流程,而且也能进行贷中监控和贷后管理,还能够对失联用户进行定位和催收,是一揽子计划。

    四、 面临需要解决的问题

    同样数据融合并不是一件容易的事情,需要解决数据壁垒,数据标准,数据安全等问题。其中较重要的三个问题是:

    问题1:数据安全问题

    如何保证数据安全,保护客户隐私?客户知情权。如何保障符合集团或公司规定的数据变现要求?数据不出库。

    问题2:市场定价

    市场定价市场价格如何确定?基于成本OR基于需求?市场的最终定价权由谁主导?多方数据提供者,听谁的话?

    问题3:利益分配

    利益分成如何界定各方数据价值和分层比例?

    这些都是数据融合时遇到的实际问题,也是在数据创新时必须要解决的。

聚合大数据

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP