中企动力 > 商学院 > 大数据主要内容
  • ?

    大数据应该确定成什么权利

    昌曼荷

    展开

    大数据是依确定目的而挖掘、处理的大量不特定主体的数字信息。大数据的本质属性是财产性而非人身性。大数据发展的指向应该是开放而不是封闭,在个人权益与社会福利间谋求均衡。

    相较于债权、知识产权这两种路径,把大数据确定为物权的制度效率最高。具体要研究、确定大数据在挖掘阶段、存储阶段、分析阶段、应用阶段的权利内容。

    目前学界将“大数据”、“数据”与“个人信息”混为一谈,将注意力集中到人身权、隐私权研究,既忽视了财产性才是大数据的根本属性,又忽视了大数据在挖掘、云存储、云计算和应用等方面与一般数据的诸多客观区别。

    大数据是信息时代的新产物,在法律性质、权利内容、权利归属方面存在着诸多制度空白,进而导致了公地悲剧、市场垄断和逆向选择等负外部性的出现,阻碍社会福利最大化的实现。需要通过法律经济学对大数据确权进行比较制度分析,以解决大数据初始产权的界定问题。

    目前大数据讨论中存在着似是而非的理解

    法律视角中,什么是大数据?大数据和普通数据有什么区别?目前理论、实务界与立法者出于现实考虑,默契一致地选择回避正面回答“什么是大数据”,而是采用了描述性的概念界定即众所周知的“4V标准”,将“大数据”定义为“大量(普通)数据的集合”。这样定义,导致大数据在世界范围内被拖入隐私权争论的泥淖之中。

    不清楚大数据在法律上是什么,何谈确权?如何流转?如何保障?

    笔者认为,大数据是依确定目的而挖掘、处理的大量不特定主体的数字信息。

    不具备“特定目的挖掘”主观要件和“挖掘、处理”客观要件,而只是静置、沉睡的数据,种类和数量再多、处理速度和本身准确性再高也不会产生这种精准预测力,也不是“大数据”。

    “数字信息”是“大数据”与“个人信息”的核心区别。目前,国内由于“大数据”提法的兴起与贩卖个人信息活动日益猖獗的周期高度重合、同步,使得国内舆论与研究者也将除大数据应用之外的主题放到了隐私权保障上,《个人信息保护法》的呼声也日益高涨。但这和大数据的关系似是而非。大数据要分析和处理的是海量数字化信息,在大数据存储、分析的整个流程中,“个人信息”都不再以初始形式存在,大数据的内容是计算机语言表述的数字信息。

    大数据发展的指向应该是开放而不是封闭,在个人权益与社会福利间谋求均衡。

    把大数据界定为物权是较好选择

    探讨大数据的权利性质,就是要研究,将目前法律性质不明的大数据界定为物权、债权还是知识产权的交易成本最低、制度效率最高。由于不同的法律性质意味着不同的保护模式,也就意味着不同的交易成本与制度效率。

    由于“大数据”是依确定目的而挖掘、处理的大量不特定主体的数字信息,显然不是天然存在而是人为加工的一种财产。那么大数据应该属于何种财产权?已颁布的《民法总则》在第五章“民事权利”列明了财产权利的三个主要组成部分,物权、债权和知识产权。从法律经济学来看,大数据的权利性质确定过程可以被视为一种制度选择的过程,在物权、债权、知识产权这三种路径的制度竞争间进行“成本-收益分析”,得出效率最高的制度效率。

    债权路径带有明显的负外部性后果,促使垄断和不正当竞争的形成。债权路径中最主要的是通过契约意思自治来实现大数据确权,这是当前现实中最普遍的形式,比如贵阳和中关村的大数据交易中心所内进行公开交易以及企业间或企业内部进行的非公开数据交易。大数据确权存在制度空白的情况下,通过市场机制进行大数据交易的法律风险过高,进而导致交易成本高。故而大数据企业选择企业机制,在关联企业内部流转大数据形成市场替代。总的来说,如果过度依赖契约路径与放任大数据产权不明晰状态的持续则将产生市场失灵,其主要形态是垄断。届时小型互联网公司将不得不对大数据托拉斯缴纳高昂的市场进入税,直接损害社会福利。微软公司的视窗系统,苹果公司的App Store都已经出现了这一问题。

    从制度需求的角度看,知识产权法主要保护的是实现大数据的外在技术,而对于大数据本身的解释力有限。其解释力主要在于大数据分析和大数据应用,因为此阶段确实包含了大数据工程师的智慧成果。但是在大数据挖掘方面则很难解释,比如Cookies(电脑上网缓存)与网络痕迹,并不包含明显的智慧加工。故而在大数据挖掘方面知识产权性体现的不明显。

    相较于债权、知识产权这两种路径,“物权路径”的制度效率最高,理由在于两方面。

    第一是需要克服的制度禀赋难度低、制度改进成本小。若将大数据解释为一种物权客体,则现有物权体系中的无体物基本能够相融,从而更容易被立法者接受,克服制度禀赋难度较小。具体来说,物权的占有、使用、收益、处分四大权能较好对应大数据流程,占有对应大数据挖掘和大数据存储,使用对应大数据分析和大数据应用,收益和处分对应大数据交易,这方面明显优于知识产权路径。

    第二是抑制制度负外部性,降低交易费用。这又具体分成三个角度,首先是物权路径不会直接导致因过度意思自治带来的垄断和不正当竞争以及其他市场失灵情形,甚至可以有效抑制垄断从而优于债权路径;其次是物权路径权责最为明晰,大数据产权的所有者与应用者即相关法律责任的承担者,相较于债权路径而言降低了因合同相对性与内外双重效力导致的“侵权无责”伤害社会福利的情形;最后是流转顺畅,相较于知识产权路径而言将大数据理解为一种无体物动产则没有复杂的登记与公示,更有利于大数据流转和信息的传播以及由此带来的激励创新等正外部性的产生。

    大数据的权利内容

    大数据的权利内容即哪些具体权利应该被法律明确规定、保障?

    从产业链条上时间先后顺序来看,大体包含大数据挖掘阶段、大数据存储阶段、大数据分析阶段、大数据应用阶段的权利四部分内容。当然,并非大数据的所有权利内容都适宜通过《民法分则》、《个人信息保护法》或其他法律部门予以规制。以下说明的是通过成文法尤其是民法典予以规制更具制度效率的大数据基本权利内容。

    概括地说,大数据挖掘阶段的权利内容主要包括有Cookies辅助数据、网站爬行数据和旁路采集数据等。大数据存储、分析阶段的权利内容主要包括清洁数据、区块链数据、Hadoop的MapReduce分散节点数据、用户行为模型数据等方面。大数据应用阶段主要包括LBS数据、CRM数据等。

    大数据的权利归属

    在物权路径下更为具体的制度选择中,物权由占有、使用、转让、收益、处分等权能构成,故而在大数据各流程中又面临着哪些主体对大数据享有完整物权权能或不完整权能这两种路径之间的制度竞争问题,需要进一步分析。

    挖掘阶段的大数据权属

    大数据挖掘阶段选择完整物权权能路径更有效率,应将Cookies辅助数据、网站爬行数据和旁路采集数据等大数据的物权归属于大数据挖掘者所有。

    从占有权能的角度说,此阶段数据挖掘者占有大数据交易成本更低。对此,目前学界和社会公众中比较流行的看法是“大数据时代个人信息应归个人所有,用户对自己不愿意公开的信息享有被遗忘权”。应该看到,用户确实是个人信息的产生者和所有者,但是并不是被数字化、匿名化以及其他大数据技术处理后的个人信息的产生者与所有者。将挖掘阶段大数据的占有权归属于个人用户的制度设计是明显无效率性的。以全球大数据企业领头羊的Google在欧洲的遭遇为例,每年要收到数万份个人信息删除的请求。

    从使用、处分权能的角度说,由于信息成本过高,挖掘阶段的使用权人应该是大数据挖掘者而不是用户。相较于将挖掘阶段的大数据确权给自然人,确权给有挖掘能力及有效率的企业与政府则更有利于这一技术正外部性的拓展与实现。

    从转让与收益的角度说,相对于用户而言,大数据挖掘者享有转让与收益权更有利于降低交易成本和促成私人谈判。

    存储、分析阶段的大数据权属

    该阶段权利应归委托人所有或依据契约进行产权确认。大数据存储、分析阶段也即“云计算”阶段,此时由于个人信息已被清洁和数字化,从而不再涉及用户所有权问题。故而制度选择方案即是在“云计算委托人”和“云计算受托人”之间进行确权。

    “云计算”的核心资产是大型、超级计算机,核心竞争力是“4V”标准项下的“大量、多样、快速、准确”地运算。国内外提供云服务的企业主要包括Google、IBM、阿里、腾讯以及华为等互联网寡头,这些企业大都本身拥有10亿级别的大数据运算需求,所以本身都拥有自己的云服务软硬件。云服务是在满足自身大数据运算的过程中发现的对主营产品的替代商品,将“剩余运算能力”出售给其他公司实现企业资产配置效率的最大化。总而言之,现在“云市场”中云服务的主要生产者与消费者高度统一。

    应用阶段的大数据权属

    应用阶段的大数据应被界定为公有产权,属于全体社会成员所有,但需要法律对其边界加以具体限制。

    从占有的角度来说,LBS数据、CRM数据等应用阶段的大数据事实上已归属于政府和运营商占有,而这种占用基于法律行为而产生,且目前并未产生足以降低社会福利的负外部性影响,故而暂时不需要调整。

    从使用的角度来说,应用阶段的大数据不应私有化。主要原因在于这将抑制正外部性溢出并催生垄断。从供给侧改革的角度来看,应用阶段大数据若归属于少数大型互联网公司则意味着法律为价格歧视和无谓损失提供温床。从“大众创业,万众创新”的角度来讲,应用阶段的大数据确权将对无偿公开大数据成果产生负面激励,抬高企业创新与科学研究的成本,阻碍正外部性的产生与技术溢出。

    从转让、收益和处分的角度来说,将应用阶段大数据界定为私有产权将导致交易成本陡然增加。

    总而言之,应用阶段的大数据从社会总体福利的角度来讲应该参考土地制度,界定为公共所有并交由政府管理。具体方式可以通过成立“中央大数据银行”对大数据市场实施“统而少治”。一方面限缩大数据的流动规模以保护国家信息安全和防治大数据的“新型国有资产流失”,另一方面限制大数据发展中的市场失灵,比如大型互联网企业大数据托拉斯的形成。

    (文章来源:经济参考报)

  • ?

    浅谈大数据风控的基本框架

    项海安

    展开

    随着监管趋严和行业愈加规范化,大数据风控,尤其是基于弱数据的风控正成为线上信用贷业务最重要的核心竞争力。

    本文授权转载 CreditX氪信, 作者 唐正阳

    近日,中国人民银行成立金融科技(FinTech)委员会,旨在加强金融科技工作的研究规划和统筹协调。

    随着AI、云计算在金融业务层面的快速渗透,也倒逼监管跟进升级,以进一步加强监管的有效性。事实上,这次央行提出监管科技(RegTech),也是对金融科技的肯定,希望其在驱动金融创新,引领金融规范化发展中发挥积极作用。

    金融的核心在于风险,现下谈及互联网金融,很多人都对大数据风控并不陌生,也都在行业野蛮发展的过程中有自己的理解。但如果要定义什么是大数据风控,可能不少行业外围同学的看法难免有些偏颇和碎片化。下面笔者浅显地从大数据风控的基本内容和框架出发,主要为想要了解这个行业的同学简要做一个相对完整的介绍。

    大数据到底有哪些?

    首先我们需要厘清大数据的概念,当下各行各业都在探索大数据的价值,大数据的定义也很多。从技术的角度来理解,本质就是来自多个渠道和系统的结构化和非结构化数据,在金融领域,尤其是消费金融,我们界定大数据到底有哪些维度,其实芝麻信用分是一个非常典型例子,虽然不同公司有自己的分法,但数据主体大都可以归类为身份属性、信用属性、行为数据、消费属性、人脉关系这五大方面。

    身份属性,这是最基础的,包括真实的身份信息、学历、就业经历等。

    信用属性包含的方面比较多,比如过往的履约记录、固定资产、流动资产、收入等都会纳入进来用以衡量一个人还款能力和还款意愿。

    过去我们去银行办理贷款,以上这两个维度就是传统风控的数据来源,但由于大多数人没有这方面比较完整的记录,且流程冗长麻烦,因此只有少部分人才能享受金融服务。

    现在随着互联网的爆发式发展,以及普惠金融的崛起,越来越多的机构正将海量互联网数据和金融结合探索其在表征风险方面的价值。如上所述,长期缺乏金融产品的人群基数庞大,需求旺盛,因此从创业公司到BAT到金融机构,都在拓展更多领域的大数据以抢占消费金融爆发的窗口期。

    数据拓展的第一个领域是消费属性,这块主要是电商或交易数据,比如日常购物商品、消费金额、消费时段等都可以从不同角度来分析出一个人消费稳定度,消费档次,还款能力等风险特征。

    其次,人脉关系也是很重要的一个维度,俗话说“近朱者赤,近墨者黑”。很多时候你的微信朋友圈、经常打电话的朋友也反映了你在风险上的表征。生活中我们和同事沟通比较频繁,而如果一个人社交稳定度差,可能说明他经常换工作,显然风险也会相应增加。

    最后一个维度是行为数据,这块数据涉及面比较广泛,主要是用户在APP上的活动所体现出的行为特点,包括浏览不同类目的频次、时间、风险偏好等等。

    说到这,我们对大数据风控涉及的几类数据应该有了一个基本的认识,那在具体工作中,我们是不是应该先把这些数据都收集好才能做好工作呢?

    答案是否定的,因为数据都是有成本的,开展一个金融业务,从数据、模型、服务再到最后的收益,更为关键的是业务本身的形态,再进一步扩展至产品、场景,我们会发现不同的场景面对不同的客群,风控关注的风险点都会有一定的差异,再反过来寻找能够表征这些风险点的数据也会有所侧重。因此,如果要厘清大数据风控该用哪些数据,首先要对风控场景有所了解,其中最为核心的是理解不同场景下要抓住哪些金融风险。

    金融风险的理解

    风险的概念比较大,为了给大家提供一个最基本的视角来了解,下面以线上信用贷款举例来阐述,这也是互联网消费金融最主要的方向之一。在这个场景下,我们面临的风险主要是信用风险和欺诈风险两块。

    首先是欺诈风险,据数字,在中国,互联网金融50-70%的损失来自欺诈,这也可以说是风控业务中最困难的地方。造成这种现状的原因比较多,一方面是诸如现金贷类型的消费金融短期爆发式发展,大量创业公司涌入赛道以互联网获客运营的流量思路做金融,与此同时相应的风控经验和能力缺失,因此给专业的欺诈分子暴露了较大的风险敞口,通过简单研究业务规则漏洞,并通过互联网传播,可能带来较大的损失;另一方面也是欺诈产业链自身研究实力不断的完善有关,现在的欺诈已经从以往单一的个人欺诈演变为有组织、有规模的集团化欺诈,链条上盗号,数据泄露作为基础账号库,已衍生出一系列包括黑产交易、ID Mapping、定向攻击的完整产业链,其中的分工和技术也非常专业和精细化。

    如图:这种设备称为养卡设备,俗称“猫池”, 实际上就是一个号码卡插槽,可以在不拆卡的情况下将整张卡插到猫池里,连接电脑后使用,还可以接收短信验证码。现在在各种平台注册时都需要填写短信验证码,“刷手”为了获取平台的福利会利用猫池养卡,规避平台的身份确认短信。

    再比如短信拦截马,这是一种可以拦截他人短信的木马,让被攻击者收不到短信,并将短信内容截取到攻击者手机上。这种木马最常见的是通过钓鱼、诱骗、欺诈等方式诱导用户安装,然后通过拦截转发用户短信内容,以此获取各种用户重要的个人隐私信息,如用户姓名、身份证号码、银行卡账户、支付密码及各种登录账号和密码等,造成这些信息的泄露,再利用此信息从而达到窃取用户资金的目的,严重威胁用户的财产安全。

    第二块简单谈一下信用风险,其定义是借款者违约的风险,换句话说,也就是借款人因各种原因未能及时、足额偿还债务或贷款而违约的可能性。一般,我们会从还款能力和还款意愿两个角度去分析信用风险,但在小额信用贷场景中,由于额度一般为2000左右,少就几百,多也就5000,一个正常有工作的人很少会不具备按期还款的能力。所以在这点上我们更多的是从还款意愿角度来看,即借款人对偿还贷款的态度,现实中有不少人会借钱不还,这就是常说的“老赖”,如果我们以违约概率的目标去识别他,还是能挑出不少有正常借款意图的人。

    大数据风控体系的初步构建

    现在我们有了对大数据和风险的基本认知,但如何真正从大数据提炼出风险表征,并进一步转化为实时的金融风险决策服务呢?事实上,这需要重构一整套风控数据架构体系,过去传统金融机构在身份属性和信用属性的数据上沉淀了丰富知识,但在互联网金融业务中,用户能够关联的更多是消费、社交和行为类数据,且越是小额分散的业务,数据的金融属性越弱。近两年小额现金贷也正是由于这部分数据的风控知识体系缺乏,因此陷入高利率覆盖高坏账、暴力催收等乱象。

    随着监管趋严和行业愈加规范化,大数据风控,尤其是基于弱数据的风控正成为线上信用贷业务最重要的核心竞争力,除了基本的身份验证、合规、黑灰名单、规则过滤以外,要防控欺诈风险和信用风险,还需做好以下三个维度的准备:

    第一是设备层面,现在成熟的APP都需要辟如更换登录设备时重新输入短信验证码,或者登录时得手动滑动验证码等,这些既是挡住黑产的第一道关,也是后续风控的重要数据基础。

    第二是知识体系层面,拆解开来看,核心有2点,一是知识工程,二是模型。目前最领先的消金机构都有一套相对成熟的针对特定数据domain的风险特征库和分客群、分目标的模型,比如反欺诈模型、申请评分模型、风险行为预测模型等,贷后还会有催收模型、客户流失预测模型等。在这过程中,引入AI处理弱数据,并在大量样本上不断迭代模型是关键。

    第三是系统层面,试想我们有了清晰的数据认知,结合到场景和风险理解我们也摸索了一套经验证的数据使用方式,但如何与我们的业务系统对接,成为实时的数据服务?这还需要一个完整的支持数据接入、加工处理、得出结果以及监控管理的在线引擎。随着线上个人贷款规模的爆发式增长,控制风险、解放人力已成为最紧迫的需求,数据智能自动化引擎是机构“跑起来”的强大推动力。

    风控与征信

    最后,简单谈一下大数据风控和征信的区别,不少同学会认为风控公司就是征信公司,这其中还是有较大区别的,尤其在大数据领域。

    据百科,征信是专业化的、独立的第三方机构为个人或企业建立信用档案,依法采集、客观记录其信用信息,并依法对外提供信用信息服务的一种活动,它为专业化的授信机构提供了信用信息共享的平台。

    应该看到,征信所对应的数据还局限在开头所说的身份属性和信用属性范围,也就是强金融数据,而大数据风控认为所有数据都是风险数据,更侧重于将弱数据金融化,再提炼出风险表征。因此,征信本质是大数据风控的子集,覆盖的人群和应用领域也更为狭窄。当下大数据风控和征信的确还处于混业经营的状态,但随着行业发展,可预见市场还会逐渐细分,届时前者将更注重在数据生态体系上的经验和沉淀,后者则侧重在独立性和公信力以及监管合规等方面。

  • ?

    大数据促进内容创造和传播

    奕柯

    展开

    【与会嘉宾发言摘登】

    作者:蒋湘辉(阿里巴巴文化娱乐集团大优酷事业群副总编)

    优酷使用大数据的主要用途很明确,就是用今天的文化内容更好地创造、传播,以及对外走出去。最近两年,优酷在内容方面依靠大数据进行了很好的探索,优酷自制、合制了很多精品内容。我们的动画已经出口到国外20多个国家,今年预计出口到100多个国家,而且相关的动漫产品销售额已经达到3亿元以上。

    2017年,我们构建了优酷泛内容大数据智能预测平台——鱼脑,可以为内容策划、营销、商业化提供数据参考和支持,从而提高整个平台的转化效率。同时,优酷在个性化推荐技术方面,实现了从人找内容到内容找人的转变,这个应用的效果非常不错,目前在流量方面提升30%,在时长方面提升10%。

    (光明日报记者邱玥、光明日报见习记者冯帆整理)

    《光明日报》( 2018年05月28日 07版)

    来源:光明网-《光明日报》

  • ?

    你想要的大数据知识,基本都在这里了

    段诗桃

    展开

    前言

    现在市面上的大数据产品太多了,但它们还远远没达到像IaaS层那样的标准化程度,每个产品之间的差别也并不是特别明确清晰。很多企业在做大数据平台或大数据方案的时候,常常不知道该选用哪些产品来满足自己的需求。一般的做法是做调研、学习、搭环境、测试、做各种产品的集成,但通常这个过程会很漫长,成本也很高。

    我们希望这些事情都交给云平台来做,云上所有的产品都可以一键部署、一键伸缩,不论是加节点还是减节点都能够在UI界面上直接操作。对于一个企业来说,真正的核心是自己的业务,而不需要花太多的时间搞明白到底该用哪些工具搭建、部署、管理大数据。大数据产品的运维和管理,应该交给更专注、具有更大规模效益的大数据服务厂商,用户只需聚焦于自己的业务。本文来自青云QingCloud大数据平台架构师李威(Jordan)在青云QingCloud深圳站实践课堂上的分享,全文3158字,阅读时长约为13分钟。

    QingCloud基础架构云和技术平台云

    QingCloud提供了一个完整的基础架构云和技术平台云,这里面分了很多层,最下面一层是大家熟知的IaaS层,包括标准的计算、存储、网络。网络里还有路由器、负载均衡等,存储里面有块存储、共享存储、对象存储等各种面向不同场景的存储服务,计算中有主机、容器、映象等计算资源。

    IaaS层上面是PaaS,QingCloud在几年前就开始做PaaS平台,有一个原则贯穿始终——QingCloud的PaaS服务需要全部基于IaaS,这样做的好处是可以将QingCloudIaaS层所有的技术创新,如资源调度、SDN网络、性能优化,都透过IaaS层被PaaS享用,QingCloud的架构是一套统一的架构。

    此外,QingCloud在PaaS层之上还提供了一些高级的管理服务,如编排、定时器、监控告警等以及客户部署的各种类型服务(如VPC、专属云、托管云)。

    QingCloud完整的企业级大数据平台

    QingCloud的大数据平台包含了完整的数据生命周期:负责数据传输的有Kafka;数据传进来之后可以存储在对象存储、HBase、MongoDB;负责从存储里拿出数据进行计算处理的有主流的实时处理工具Storm、准实时处理工具Spark、批处理工具Hadoop、Hive等;还有一些在公有云上用量非常大的大数据组件:如Elasticsearch,性能和业务性很强,场景非常明确,只要做大数据、海量数据搜索都非常易用,以及Redis、Memcached、ZooKeeper等离用户比较近的大数据产品。

    由于QingCloud是一家云服务商,所以提供的大数据平台是一个通用的服务,这与美团、小米、百度等互联网公司的大数据概念不太一样,它们的平台中会有很多与自己业务相关的东西。而QingCloud是在云上给所有的用户提供服务,所提供的这套大数据平台是一个通用的架构,每个组件之间的关系都非常灵活。QingCloud主要提供主流的大数据组件和组件之间关系的管理。

    大数据产品如何选型?

    很多用户在面对大数据时都会遇到一个相同的问题,应该选用什么产品?其实这个问题没有一个百分之百确定的答案,下面我们将会从各个维度来解析当前主流的大数据产品:

    实时流处理引擎对比

    实时流处理引擎主流的产品有Storm、StormTrident、SparkStreaming、SAMZA、Flink等,在选择它们时可以考虑的维度很多,比如说消息的传递机制保护(Guarantees)有At-least-once(至少传输一次,它带来的结果是消息的重发)和Exactly-once(消息一定只处理一次,无论是在出错的情况还是其他的情况下)的区别;Latency(延迟)方面,如Storm是通过Native实现的流处理,延迟非常低。而SparkStreaming是通过Micro-batching实现的,它会把一段时间内的流组成小批量地处理,这样它的延迟就会高一些;吞吐量(Throughput)方面,Storm的Native吞吐量没有那么高,SparkStreaming的吞吐量就会很高。

    一个企业的架构师或者方案的设计者在选型这些产品的时候,需要平衡自身流处理的业务到底在意什么维度,是在意吞吐量、性能,还是在意消息的处理机制。

    存储-HBasevsCassandra

    HBase和Cassandra是两个非常接近的产品,很多人对它们可能不是很熟。它们都是列存储,都可以处理海量的数据,读写性能都非常好。但它们也有很多维度可以对比,首先是一致性,HBase是基于行的强一致性,Cassandra则是最终一致性,如果在中间的某个点写入数据的时候去读取,有可能不会读到最新数据;

    稳定性方面,HBase有自己的HMaster、NamenodeHA,Cassandra是P2P的架构,去中心化,没有单点故障;分区策略方面,HBase是基于主键有序排列的范围分区,Cassandra是一致性Hash排列,可自定义策略;可用性,HBase是Down掉一台短暂不可读写,Cassandra是Down掉可继续读写。

    从这些对比可以明显地看出来,HBase牺牲了可用性,注重强一致性,Cassandra有高可用性,没有强一致性。因此,在应用场景方面,HBase由于有强一致性,它可以做一些OLTP类型、交易类型的工作。Cassandra因为并发读写的量比较大,性能比较强,但是数据不要求强一致性,不要求数据时时刻刻精准和统一,可以做监控数据的存储。

    常用Ad-hoc&OLAP查询分析产品对比

    常用的数据仓库Ad-hoc和OLAP产品也非常多,在选择的时候可以从三个维度来衡量——数据量、灵活性和性能。

    Hive:

    基于MapReduce,可以处理海量数据,查询灵活,但性能较低;

    Phoenix+HBase:

    也可以处理海量数据,性能高,但查询只能通过Rowkey查询,灵活性较差;

    Elasticsearch:

    可以用来做数据分析和日志分析等应用场景,特点是查询灵活、性能高,但是它目前还支持不了海量数据,只能支撑TB级数据。这个原因主要是和它的架构有关系,Elasticsearch属于全链接的结构,所有节点之间都有通信,这应该是影响扩展性的一个原因;

    Kylin:

    百度、小米、美团等互联网企业都会用它来做数据仓库的分析,它可以处理海量数据,性能也很高,但是灵活性较低。由于Kylin采用的是预聚合查询,在数据仓库中需要把你要算的cube的维度和事实预先计算好,存到Hbase里面才能达到很高的性能,这导致它就丧失了灵活性;

    Druid:

    海量数据、性能、查询灵活都满足了,但是它也有一个限制,数据来源的每条记录里必须有一个Timestand,它是时序数据的处理,更多的被应用在实时处理的场景,比如广告分析;

    HashData(GreenPlum):

    GreenPlum是一个传统的数据仓库,三个创始人依次是雅虎Hadoop团队的研发、全球Hadoop集群的运维和GreenPlum的核心研发工程师。他们在Apache上开源了一个基于Hadoop的数据仓库项目——Apachehook,在这个项目中他们贡献了一半以上的代码。所以,该团队在数据仓库的技术研发能力是很强的,与QingCloud一起实现HashData,这款产品查询灵活,性能高。但是它的局限是只能处理结构化的数据,不能处理非结构化数据。

    计算与存储关系的思考

    做大数据肯定会想到一个问题——大数据的数据到底放在什么地方?是放在硬盘里还是放在对象存储里?如果放在本地的话性能倒是可以满足,但是容量又不够。而放在对象存储里,容量可以无限扩展,但是性能肯定又没有本地硬盘快。例如Hadoop或者Spark,下面的数据如果放在本地机器或集群相关的存储上,它就拥有了大数据中数据本地性这个特性。但是这样做也会有问题,碰到海量小文件就不行了。这个问题谁能帮你解决?对象存储。对象存储针对小文件有专门的合并和优化,问题可以迎刃而解。

    所以,QingCloud要做的就是让计算和数据不仅可以在一起,还可以分开。当数据量达到PB级以上的时候,数据存到IaaS和PaaS之上的分布式存储里成本也很高,这个时候就需要对象存储方案,将很久不用的历史数据和海量小文件都存在对象存储里。当你需要计算的时候,你有两个选择,如果不考虑实时性或者性能的话,你就可以直接在对象存储上面计算。如果需要高性能,可以将数据拉在HDFS上计算,这样就会变得很灵活。

    那么,计算和存储的关系到底是什么呢?我们的理解是,当你想要性能的时候,就让它们在一起。当需要大批量计算处理的时候,就让它们分开。以前我们面对的是一个Hadoop集群或一个Spark集群,数据是到处分散的,而将数据都放在对象存储后,可以做到数据不动、计算随便动,计算引擎可以是Hadoop、Spark、Hive,它们都针对同一份数据进行计算。

    大数据案例分析

    QingCloud在线业务大数据分析流程图

    QingCloud会用自己的大数据服务做业务、市场、销售的分析。我们会将一些线上数据库的数据进行解析、同步,包括典型的ETL处理,数据处理完存在HDFS里面,之后由Spark进行计算,最后把处理结果存到对于业务来说易于使用的产品,如PostgreSQL、Elasticsearch,通过API-server曝露给前端使用。这是一个比较典型的大数据分析流程,我们用它来验证QingCloud大数据平台提供的各种服务。

    某大型互联网社交平台

    这是一个在QingCloud公有云上运行的大型的互联网社交平台,架构非常典型,它有一个数据的服务层,下面可以处理MySQL、缓存、Elasticsearch、MongoDB等数据存储,下面的数据层有ZooKeeper和Kafka,可以将应用级系统日志等信息输入到Spark平台上进行分析,如对于系统推荐的好有,用户是否添加了好友等。

    某创新型综合金融公司

    这是一个QingCloud的私有云案例,QingCloud可以将自己的整个软件全部部署到用户自己的环境当中去,架构主要有三大块:数据的抽取、数据处理、数据服务。数据源涵盖日志、关系型数据,还有一些ETL工具、日志处理框架、实时数据同步系统。中间有离线计算、实时计算。计算完之后会提供给离线服务,比如Hive、Spark,进行内部的数据分析。同时,还有一些在线服务,性能比较高、易用性比较好的服务。

    这些案例的架构千奇百怪,但是仔细看其实都差不多,都分成数据的来源、收集、传输、计算、存储等架构,只不过具体用到的每个产品不一样,这和它的场景是相关的。对于QingCloud来说,无论用户是传统企业还是互联网企业,我们都能够提供一套非常灵活的大数据平台,满足任何一种应用场景的需求。

    QingCloud大数据平台Rodmap

    大数据平台管理架构

    当大数据组件特别多的时候,需要有一个单独的平台来管理。QingCloud会提供一个界面执行一些Hive、SQL、Spark的脚本,在这个平台上你可以看到Storm和ZooKeeper数据的信息,存储可以直接从浏览器、HDFS、对象存储看到文件的结构,可以提交HBase实时的查询,可以看Kafka传输队列里现在的数据结构是什么样的。所以,它相当于一个管理的UI,你可以管理很多大数据的组件。以前用户需要分散管理这些组件,当系统比较复杂的时候,易用性就会变得比较差。

    大数据平台+AppCenter2.0

    大数据技术发展太快了,QingCloud面临一个困境:大数据产品是无穷无尽的,我们不可能把所有的产品提供出来,但是如果用户需要,我们怎么办?

    第一,QingCloud的大数据平台也会通过QingCloudAppCenter交付。如Hadoop、Spark、Elasticsearch等产品都将是AppCenter中的一个APP,当你需要一些非常典型的组合的时候,它也可以作为一个组合的APP出现在AppCenter上。对于用户来说,大数据产品的易用性会大大增强。QingCloudAppCenter不但提供APP的开发框架,它还提供APP运营的框架,你可以在APP上进行编排,将几个简单的APP拼装成一个大的APP。

    第二,大数据的场景太多了,如果QingCloud提供的没有你想用的怎么办?也很简单,如果你对这个产品非常熟,可以用QingCloudAppCenter框架将其做成一个云应用,提供给别人使用。这个概念非常接近于苹果的Appstore中的APP开发者,如果你是一个企业用户或者在大数据领域中技能很强的个人开发者,就可以在QingCloud之上利用AppCenter框架在短期之内把你熟悉的大数据产品变成一个云服务,放在QingCloud的AppCenter上提供给所有人使用。

    这样的事情在以前完全是不可想象的,即使做也需要花非常大的成本,QingCloudAppCenter可以帮你在几天之内将已有的产品变成云服务。同时,云服务的运营管理、生命周期框架都内置于AppCenter中。

    『充电时间』实践课堂第三季已经开始了,本次课程内容仍以技术实践为主,以用户场景为切入带你,主要围绕QingCloud的技术理念、功能特性和使用技巧展开,话题将涵盖如何高效构建原生云应用,云端容器部署,微服务架构,应用感知,自动化运维等业内热点话题。

  • ?

    网络发展,大数据内容方向何去何从?

    挂念

    展开

    随着岁月的飞速流过,互联网这个大市场,该怎么立足,千奇百怪的社交社区、视频、直播、电商、搜索引擎网站等等,这些花式网站,你能记住几个。

    一、作为消费者,这样看:

    比较常用的:搜索引擎、QQ、V信、淘宝等

    其它分类的:直播网站、视频网站、游戏网站、人才招聘网站、社区论坛网站、购物网站等

    我想日常除了使用几个常用的,其它网站都是需要相关内容的时候,在去使用。

    二、作为运营者,这样看:

    我是搜索引擎运营者,该怎么看?

    我是视频网站运营者,该怎么看?

    我是直播网站运营者,该怎么看?

    我是购物网站运营者,该怎么看?

    我是社区论坛网站运营者,该怎么看?

    等等...

    内容,内容,内容,包含段子、图文、视频、直播、商品、各类服务等。

    未来的大数据内容发展方向:

    方向:那就是“内容品类”

    内容第一,你没有内容,渠道广,也会逐渐衰落。

    可以是购物网站、批发网站、视频网站、人才招聘网站、社区论坛网站、直播网站等等。

    维持内容品类的方向:那就是具有“特色”、“创意”、“实用”。

  • ?

    大数据+内容 打造全新的内容营销时代

    莫再讲

    展开

      毋庸置疑,内容营销在这个快速发展的时代中,始终是社会中存在的主体!如果互联网没有了内容,互联网也就失去了存在的意义,试想,一个没有内容的平台,还有什么存在的价值和意义。

      所以,不管内容形式是从最开始的文字发展到图片,还是现如今又从图片发展为视频、音频等等,归根基地只不过是形态的一个变化,而内容从来都在的!未来,它更是能帮助企业花更少的钱,取得更好的营销效果,因此,内容营销受到很多企业的关注,如今已然成为了帮助企业摆脱价格战,抢占市场用户的法宝。然而,今天要和大家谈的不仅仅是内容营销,而是升级版的大数据+内容营销。

      大数据可以帮助品牌发现机遇,如新客户、新市场、新规律、回避风险、潜在威胁等,分析出隐藏在背后的用户行为习惯以及偏好,设计更符合用户需求的产品和服务,可以有助于品牌营销决策的调整与优化。所以我认为,内容营销的今天,离不开大数据发展的时代背景,而大数据也是驱动内容营销的关键,内容营销需要跟大数据进一步结合,才能焕发出更大的市场潜力。那么如何实现大数据+内容呢?

      面对互联网媒体资源在数量以及种类上也在快速增长越发多样化,大数据是通过受众分析,帮助企业主找出目标受众,然后对企业投放的内容、时间、形式等进行预判与调配。

      优质的内容,永远是传播的核心,而营销渠道和推广方式,只是手段。所以内容营销这四个字,是内容核心+营销手段的组合。广义来讲,内容营销会一直存在,而炙手可热的“大数据”会为内容营销带来一场新的革命。今日头条就是大数据与内容结合最好的例子,它最具价值的部分不仅仅是它聚合内容,把新闻头条都放到一个平台上那么简单,更重要的是它的数据化的营销,全景级的数据,和精细化的管理。这些都是它成功路上得关键。

      因此企业想要实现大数据+内容,就要借用大数据的洞察能力,根据消费者实实在在留下的痕迹、数据、算法使得“消费者洞察”真正有迹可循。然后对数据进行解读分析,以此为受众群体提供个性化的内容,完成内容营销的整个过程。

  • ?

    看懂大数据,就能掌握内容时代的大方向

    四眼

    展开

    陆毅伦互联网创业故事

    【第十章节】看懂大数据,就能掌握内容时代的大方向

    请点击此处输入图片描述

    互联网的高速发展,每一天的商业模式都在潜移默化的变化,我考虑的问题是我在这样一个时代,我能以什么样的角色参与到这里面来?那些每天靠疯狂引流,然后通过暴利产品就能变现的时代已经过去了。

    而紧接而来的是,个性崛起的时代,内容为王的时代,想要在这个时代获得这个属于你的位置,那么依靠的是你的个性所彰显的内容以及和你趣味相投的用户。

    很多时候我们明明看到了时机,而还是有很多人失之交臂,为什么呢?因为人的潜意识决定主观行动,因为忘记了自己其实就是一个个体,其实就是个独立存在的个性,因为习惯了把别人的成功当成成功的标准,而忘记了每一个成功的人都不一样,都在做不同的事情。

    而我得出的考虑是,我们不能随波逐流,要回归自己,回归到自己能否把自己的东西给展现出去,是否能结合自己的个性做出别人认为成功的内容。

    所以我要做我自己的内容,最终我发现,依靠互联网创业的人,千奇百怪,琳琅满目,有成功的,有失败的,成功的人永远在分享成功,而失败的却连失败都分享不出去,这就是现实。

    但是我给自己做了计划,先做,想得在多,浪费的时间就越多,于是决定做自己的人生经历,分享十多年的营销经验和实践经验。

    关于加入自媒体大军的几点计划:

    1.有输入才有输出。

    针对于人和动物最大的区别是在于人有思想,所以人就成了高级动物,而人的思想是依靠自身的经历记忆通过自己的思维判断所形成的,也就是说,想要好的思想,就要经历更多的事情,经历越多你的思想就越成熟,越成熟你的思维判断就越准确,就好比现在的大数据,通过大量的网络数据,判断出大众标准。同样要写出好的书,就要靠我们自己大量的去看别人已经写出来的好书,但是现在生活的节奏那么的快,那么的烦躁,我们每天想的是怎么去赚更多的钱过更好的生活,哪里还有人能静下心来,好好研读别人用人生经历的精华提取而写的好书呢?其实最终我们忽略了一点很重要的事情,那就是别人的书是别人经历的缩影,甚至是别人用一生总结出来的经验,如果我们能通过一本书读懂一个人的经验或者读懂一个人一生的精华,那么我们就比别人多活了一世,如果你已经活过一世了,那么你人生就会走少很多弯路。而同样你想要写出好的文章,就要看更多好的文章,所以我给自己制定了每天要大量的去看自媒体上的那些价值的文章。

    2.只要功夫深,铁柱磨成针。

    天底下就没有不劳而获的事情,想要写出好的文章,那么除了依靠大量的阅读,最重要的还是写,如果纯粹只有看没有写,包括我们现在去学习什么理论或者知识,如果没有实践锻炼,那么也徒劳无功,不管学习什么,想要学好,“练”字值千金,而虽然书读得少,可是我是从实践中走过来的,不管我做过什么,学过什么,我都会反复的练,包括我对于电脑的知识,那是从我买第一台电脑开始,就重装系统这一个环节,就让我练坏了几个硬盘,所以我才有今天的电脑知识基础。那么想要写好文章,除了大量阅读,必须靠练写文章。

    3.练习数据分析,依靠数据掌握大方向。

    现在是互联网+大数据时代,互联网给予了我们发挥才华的平台,而我们要想在互联网这个大平台占据一席之地,我们就要依靠大数据去判断互联网大众的取向,所以要抛弃传统的自我观念,文章好不好是别人说了算,如果还是是依靠自我的审美观,那么最终将失去大众对你的取向,文章好不好是别人说了算,你需要的是别人对你的内容产生兴趣,那么就需要对别人的兴趣取向有所了解,而这个就要依靠大数据的分析系统以及对你所发表的文章市场给予的各项数据,比如:阅读量、收藏量、评论量、阅读完成比例等等,所以说掌控大众的阅读取向,你就能掌握自媒体内容时代的大方向。

    我是黄锦宣

    实战资深营销人

    专注创业框架思维研究十多年

    《众创理论》实战创业模式创始人

    希望我的分享能引发你的思考,给你不一样的收获。

    如果你是微信领域工作的,如果你想涉足微信领域的,可以关注我或者留下你的建议,我们一起探讨以及开拓更多商机。

    本文图片均来自网络,如有侵权请及时联系我们.

  • ?

    大数据有关的工作有哪些

    Sunny

    展开

    谈到大数据,肯定有很多人都听说过,但是如果要问大数据有关的工作,知道的人并不多,今天就为大家科普下大数据相关的工作岗位。

    1、数据挖掘师/算法工程师

    做数据挖掘要从海量数据中发现规律, 这就需要一定的数学知识,最基本的比如线性代数、高等代数、凸优化、概率论等。

    2、数据分析师

    数据分析师是数据师的一种,指的是不同行业中,专门从事行业数据搜集、整理、分析,并依据数据做出行业研究、评估和预测的专业人员。在工作中通过运用工具,提取、分析、呈现数据,实现数据的商业意义。

    3、数据挖掘工程师

    大数据工程师主要从事数据挖掘工作,运用算法来解决和分析问题,让数据显露出真相,同时,他们还推动数据解决方案的不断更新。

    4、数据产品经理

    数据产品经理必须了解不同的公司,在不同的阶段,需要哪些数据产品,并能够制作出来,这是此职位的核心要求。

    5、数据架构研究

    数据科学家是指能采用科学方法、运用数据挖掘工具对复杂多量的数字、符号、文字、网址、音频或视频等信息进行数字化重现与认识,并能寻找新的数据洞察的工程师或专家。

    在工资待遇上,不管是在国内还是国外,都是:数据架构研究->数据挖掘师/算法工程师>数据挖掘工程师=数据产品经理>数据分析师。

    以上就是大数据有关的工作,想要从事以上的大数据工作,需要掌握大数据的技能,那么想要从事大数据的工作,需要学习以下内容:

    阶段一:JavaSE开发

    阶段二:JavaEE开发

    阶段三:并发编程实战开发

    阶段四:Linux精讲

    阶段五:Hadoop生态体系

    阶段六:Python实战开发

    阶段七:Storm实时开发

    阶段八:Spark生态体系

    阶段九:ElasticSearch

    阶段十:Docker容器引擎

    阶段十一:机器学习

    阶段十二:超大集群调优

    阶段十三:大数据项目实战

    以上都是想要从事大数据工作需要学习的内容

    以上就是对于大数据相关工作内容的介绍,想要了解更多的大数据学习信息可以去光环大数据官网了解。

  • ?

    互联网大数据报告主要内容有哪些?

    阅微

    展开

    2018年的互联网趋势发展报告已经公布,涵盖了互联网领域的各个方面,从电子、移动设备等到科技领域,了解这些发展趋势能够更好的了解互联网,制定相应的发展计划,下面跟拓天速贷一起来了解互联网数据报告的主要内容。

    1、截止到2018年,现在全世界的互联网使用人数有36亿,其中中国网民占据了7.53亿,占比20.9%左右

    2、其中在网上每天平均花费时间最多的是美国,日均6小时左右。

    3、线上销售占整体零售的比例达到了13%。

    4、在全球20大互联网公司中,中国占据了9个,美国占了11个,其中上榜的有腾讯、阿里、蚂蚁金服、百度、小米、滴滴、京东、美团、头条。这个基本算是先后顺序,不过有时略微有些变化。

    5、全球移动支付中线上支付次数占比已经超过50%,中国目前有超过5亿的人使用移动支出,增速领先。

    6、中国电商交上额上,使用移动端支付的比例高达73%,可以看出移动端的随时随地购物更加符合用户的需求。

    7、互联网公司的活跃用户方面,google和FB 的活跃用户分别是20亿和22亿,比中国的两巨头腾讯和阿里的10、7亿相比高出了1倍,当然前两个是全球化,普及地区较多,中国的两巨头的用户还是以中国为主

    8、对于是否会为了利益而分享数据,,中国的用户有38%的人表示会为了利益而分享数据,虽然不想承认,但这也是我国现在确实存在的。

    9、中国智能手机出货量世界第一,占比40%。

    10、在每天互联网使用时长上面,中国用户主要使用在社交上,其次是视频和游戏。

    在互联网趋势报告中可以看出:中国已经成为了全球互联网发展的重要一部分,互联网对人们的影响很大,大数据给用户带来了便利的同时也带来了一部分影响,个性化推荐实则不是那么个性化,垃圾和广告信息迎面而来,以及对待不同用户的双标问题也是现在互联网公司不道德的一部分。也希望互联网公司都能够严格要求自己,不要借自己的掌握的数据对用户进行侵害,在获得一部分利益的同时,你也会失去更多的用户。

    互联网对我们影响也将越来越大,它对你有什么影响呢

  • ?

    大数据的主要学习内容有哪些

    Zula

    展开

    大数据相关岗位目前基本都属于大缺口,高工资的黄金职业,这吸引了很多想要追赶时代潮流或是改变自己职业方向的人争相学习。大数据相关知识,自学难度大,参加培训成本又偏高,要如何选择才好呢?我们先来了解一下大数据的主要学习内容有哪些再来决定吧!

    学习大数据,要从Java开始学起,如果已经有Java编程语言了,学习大数据就会相对轻松很多。在掌握了大数据的基本编程语言之后,就要正式进入大数据相关知识的学习了。

    首先是基础阶段。这一阶段包括:关系型数据库原理、LINUX操作系统原理及应用。在掌握了这些基础知识后,魔据教育还会安排这些基础课程的进阶课程,即:数据结构与算法、MYSQL数据库应用及开发、SHELL脚本编程。在掌握了这些内容之后,大数据基础学习阶段才算是完成了。

    接下来是大数据专业学习的第二阶段:大数据理论及核心技术。第二阶段也被分为了基础和进阶两部分,先理解基础知识,再进一步对知识内容做深入的了解和实践。基础部分包括:布式存储技术原理与应用、分布式计算技术、HADOOP集群搭建、运维;进阶内容包括:HDFS高可靠、ZOOKEEPER、CDH、Shuffle、HADOOP源码分析、HIVE、HBASE、Mongodb、HADOOP项目实战。

    完成了这部分内容的学习,学员们就已经掌握了大数据专业大部分的知识,并具有了一定的项目经验。但为了学员们在大数据专业有更好的发展,所学知识能更广泛地应用到大数据相关的各个岗位,有个更长远的发展前景,魔据教育还安排了第三阶段的课程学习。

    第三阶段叫做数据分析挖掘及海量数据高级处理技术。基础部分有:PYTHON语言、机器学习算法、FLUME+KAFKA;进阶部分有:机器学习算法库应用、实时分析计算框架、SPARK技术、PYTHON高级语言应用、分布式爬虫与反爬虫技术、实时分析项目实战、机器学习算法项目实战。

    以上便是大数据的主要学习内容。相信在掌握了以上大数据专业知识后,学员们一定能够在将来的工作中得心应手,完成自己的职业理想。

大数据主要内容

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP