中企动力 > 商学院 > 大数据平台数据
  • ?

    大数据平台安全防护

    尹飞丹

    展开

    企业大数据数据源接入越来越多、数据量越来越大、平台越来越复杂,保存了很多企业敏感数据,甚至客户隐私信息。随着数据商业价值的增加,针对数据的攻击、窃取、滥用、泄露等活动的持续泛滥,企业面临着严峻的安全风险。

    安全风险及事件存在以下特点:一、风险成因复杂交织,既有外部攻击,也有内部泄露,既有技术漏洞,也有管理缺陷;既有新技术新模式触发的新风险,也有传统安全问题的持续触发;二、威胁范围全域覆盖,大数据安全威胁渗透在数据生产、交互和消费等大数据产业链的各个环节,包括数据源的提供者、大数据加工平台的提供者以及大数据分析服务的提供者等各类主体;三、事件影响重大深远,数据泄露影响面广,对用户隐私造成极大损害。从企业角度,建议运营者规范数据开发利用规则明确数据权属关系,重点加强个人数据和重点数据的安全管理,针对采集、存储、传输、处理、交换和销毁等各个环节开展全生命周期的保护,从制度流程、人员能力、组织建设和技术工具等方面加强数据安全能力建设。

    安全防护体系的建设需要遵循“三分技术七分管理”的安全防护理念,从技术层面上考虑物理设施的安全,终端安全、网络安全和云平台安全等方面。平台安全管理要强化数据权限控制、数据脱敏和隐私保护和数据可信赖管理。横向涵盖数据流向各环节、纵向平台架构分层进行防护,规划和设计从网络、平台、数据、管理等方面全方位考虑安全防护,构建安全防御体系。

    整体架构上横向主要是在数据采集入口增加安全网关、防火墙防护;建立数据安全隔离区,集中进行数据对内外交互、数据出口侧增加数据防泄漏设备,在交互过程对数据进行授权、隐私保护、水印、加密传递等处理。纵向从大数据平台硬件资源层加强漏洞检测版本补丁更新、Hadoop组件进行安全基线扫描。数据层面:管理上对数据进行敏感等级分类、安全保护机、操作规范制定,根据规则对现有数据进行脱敏处理;应用租户,可通过4A等安全平台进行授权及合规操作等。

    网络安全:

    一、内外网物理隔离:大数据平台部署在企业内网,与外网物理隔离杜绝安全隐患。对网络通讯进行监控,如果发现任何来自于网络内部或外部的黑客入侵或可疑的访问行为,可做到及时的报警与阻断,通过网络平面隔离的方式来保证网络安全。

    二、数据采集安全防护:对内对外系统数据采集网络入口部署防火墙、安全网关,建立数据隔离区,完成大数据平台内外部系统数据交互,保障安全。

    三、数据共享安全防护;多租户隔离,实施多租户访问隔离,数据安全等级划分以及基于标签的强制访问控制,提供数据访问授权模型,提供全局数据视图和私有数据视图,提供数据视图的访问控制。通过数据隔离区,实现大数据平台数据对企业内外部数据共享,在网络出口处部署数据防泄漏设备,实现敏感数据保护。

    四、数据传输安全防护:用户隐私数据脱敏,提供数据脱敏和个人信息去标识化功能,提供满足国际密码算法的用户数据加密服务。各类用户可通过数据共享发布平台访问大数据平台,提交访问数据请求,访问代理层收到用户访问请求后,根据用户权限分析所要访问的数据,与脱敏及访问策略映射库进行比对,对需要脱敏的数据进行脱敏然后加密传输展示给用户。

    五、流量异常监控:搭建数据流量异常监控平台,能够实时监控平台出现的各种网络问题。对网络中所有传输的数据进行检测、分析、诊断,排除网络事故,规避安全风险,有效的提高网络性能。

    六、数据容灾:为集群内部数据提供实时的异地数据备份容灾功能,数据库对外提供跨数据中心的容灾机制。

    平台安全:

    一、硬件安全:主机安全漏洞扫描,系统版本补丁更新,防病毒处理等。加强主机口令、操作管理,减少非法登录。定期备份系统和文件数据,能够快速修复主机的系统问题。建设大数据系统的网关/防火墙,外部攻击首先需要冲破代理的保护才能进一步攻击大数据平台,增加恶意用户的攻击难度。

    二、组件安全:组件安全针对大数据的主流平台HDFS、HIVE、HBASE、Storm、Spark等进行安全基线扫描,分别提出身份、认证、授权、审计等配置方面检查方法,并形成可操作的手册和可执行脚本,并整合入SMP系统管理;增加对大数据平台漏洞信息的管理及处理。

    三、存储安全:存储安全包括数据的加密存储、访问控制、数据的封装、数据的备份与恢复以及残余数据的销毁。敏感数据脱敏保存,禁止明文存储。加强数据文件的校验,保持分布式文件的一致性。根据安全要求,授权访问数据。定期备份数据,一旦发生数据丢失或损坏,可以利用备份来恢复数据,从而保证在故障发生后数据不丢失。

    四、应用安全:用户认证,多租户纳入4A平台集中管理,接入4A平台管控的大数据平台必须开启Kerberos认证配置,以集中管控大数据平台的多租户信息。金库访问:当多租户没有明文数据的查询权限,经审批可以通过金库模块获得明文数据的查看权限。

    数据安全:对数据进行敏感等级分类、安全保护机及操作规范制定。根据敏感数据规则定义对平台存储敏感数据识别、打标及打标数据的分类分级访问控制;根据数据敏感规则,扫描引擎、扫描数据库敏感数据,生成敏感数据及访问策略映射库。

    管理保障:建立大数据安全管理保障制度和规范,安全策略管控方面做到集中管理、集中修订、集中更新安全规则,从而实现统一的安全策略实施,安全管理员能够在中央控制端进行全系统的监控;安全保障要求方面按照规范要求进行数据访问、应用操作。相关制度包括对外合作安全管理(外部业务合作和外部代维代建)、内部安全管理、数据分类分级管理、应急响应机制、资产设施保护和认证授权管理等。

    大数据安全防护体系的建设,需要对大数据安全防护体系内部的各个模块进行详细的研究,通过多种手段保障企业级大数据平台的安全,最终构建大数据安全管控平台,实现敏感数据隐私保护,降低企业运营风险;规范大数据平台操作流程,保证开源系统的安全,做到大数据平台系统“事前可管、事中可控、事后可查”。

  • ?

    中国邮政大数据平台建设之总体架构与实现

    画心

    展开

    【IT168 技术】摘要:通过对数据处理阶段性发展的解析,分析大数据、人工智能技术的发展趋势。结合实际生产需求,验证了基于容器云架构的新一代大数据与人工智能平台在数据分析、处理、挖掘等方面的强大优势。

    关键词:大数据 人工智能 云计算 Docker 基础能力 多租户

    Abstract:Through analyzing the staged development of data processing, this paper analyzes the development trend of big data and AI technology. According to the requirement of customers, the new generation of big data and AI platform based on Docker Cloud verify the powerful advantages in data analysis, processing, mining and so on.

    Key Words:Big data; AI; cloud computing; Docker;basic abilities; Multi-tenant

    引言

    人工智能、大数据与云计算三者有着密不可分的联系。人工智能从1956年开始发展,在大数据技术出现之前已经发展了数十年,几起几落,但当遇到了大数据与分布式技术的发展,解决了计算力和训练数据量的问题,开始产生巨大的生产价值;同时,大数据技术通过将传统机器学习算法分布式实现,向人工智能领域延伸;此外,随着数据不断汇聚在一个平台,企业大数据基础平台服务各个部门以及分支机构的需求越来越迫切。通过容器技术,在容器云平台上构建大数据与人工智能基础公共能力,结合多租户技术赋能业务部门的方式将人工智能、大数据与云计算进行融合。

    数据处理的发展阶段

    随着信息技术的蓬勃发展,特别是近十年,移动互联技术的普及,运营商、泛金融、政府、大型央企、大型国企、能源等领域数据量更是呈现几何级数的增长趋势。数据量的膨胀除了带来了数据处理性能的压力外,数据种类的多样性也为数据处理手段提出了新的要求,大量新系统的建设同时产生了众多数据孤岛,给企业的数据运营维护与价值发掘带来了重大的挑战。随着大数据技术的不断发展,企业的数据处理技术转型也经历了几个阶段,如图1所示。

    ▲图1 企业数据处理转型的阶段变化

    在第一阶段,大数据技术发展的早期,为了打破数据孤岛,将各类数据向大数据平台汇集,形成数据湖的概念,作为多源、异构的数据的数据归集,在此基础上进行数据标准化,建立企业数据的汇聚中心。在这个阶段,对非结构化数据处理以存储检索为主,对结构化数据处理提供各类API和少量SQL支持,使海量的以SQL实现为主的业务难以迁移到大数据平台,新业务开发使用门槛高,大数据技术的推广受到阻碍。

    在第二阶段,企业客户的需求集中表现为,如何更好地处理结构化数据以及将老的IT架构迁移到分布式架构中。各大数据平台厂商开始在SQL on Hadoop领域进行研发和竞争,不断提高SQL标准的兼容程度。在这个过程中,Spark诞生并逐渐取代了过于笨重且TB量级计算性能存在缺陷的MapReduce架构,Hadoop技术开始向结构化数据处理分析更深度的应用领域进发。随着SQL on Hadoop技术的不断发展与星环科技解决了Hadoop分布式事务的难题,越来越多的客户在Hadoop上构建新一代数据仓库,将Hadoop技术应用于越来越多的业务生产场景,技术门槛的降低,使越来越多的客户可以利用强大的分布式计算能力轻松分析处理海量数据。在这个阶段后期,随着企业客户对实时数据分析研判需求的不断提高,流处理技术得以蓬勃发展。

    在第三阶段,一部分企业已经完成了由基于关系型数据库为核心的数据处理体系向基于大数据技术为核心的数据处理体系的转变。在本阶段早期,很多企业客户不满足于通过SQL基于统计对数据的分析和挖掘,促使传统的机器学习算法开始实现分布化,但主要还是针对结构化数据的学习挖掘。随着深度学习技术和分布式技术的碰撞,演化出了新一代的计算框架,如TensorFlow等,计算能力的提升,并结合大量训练数据,使机器学习人工智能技术在结构化与非结构化数据领域产生巨大威力,开始应用于人脸识别、车辆识别、智能客服、无人驾驶等领域;同时,对传统机器学习算法产生了巨大冲击,一定程度上减少了对特征工程与业务领域知识的依赖,降低了机器学习的进入门槛,使人工智能技术得以普及。另一方面,可视化的拖拽页面、丰富的行业模板、高效率的交互式体验,极大地降低了数据分析人员的使用门槛,让人工智能技术进一步走入企业的生产应用。

    大数据、人工智能与云技术的融合

    随着企业内部对于数据资源的应用不再仅仅局限于IT部门,越来越多的内部项目组与分支机构加入大数据平台的使用中,加之数据处理技术的不断发展,如何解决基础平台的资源隔离问题、管理分配问题、编排调度问题;如何将企业业务应用需要的基础服务能力做更好地抽象,降低应用所需的基础服务的环境搭建、开发、测试部署周期,提升IT支撑效能;如何更好地管理众多的基于大数据与人工智能开发的应用等等成为企业急需解决的问题。

    在大数据技术发展的早期,仅仅是在计算框架MapReduce中提供简单的作业调度算法,随着资源管理的需求,在Hadoop 2.0时代,Yarn作为单独组件负责分布式计算框架的资源管理。但是,一方面,Yarn仅仅能够管理调度计算框架的资源;另一方面,资源的管理粒度较为粗放,不能做到有效的资源隔离,越来越不能满足企业客户的需求。

    云计算技术作为资源隔离封装虚拟化,以及管理调度的技术,本应应用于解决上述问题。但是,在Docker容器技术被广泛接受之前,云计算虚拟化技术主要基于虚拟机封装资源,并在其之上加载操作系统,资源利用率低,早期有厂商尝试将大数据平台构建在基于虚拟机技术的云化方案上,由于资源利用和稳定性问题,在私有云上的尝试鲜有成功案例。在公有云方面,借助公有云较为强大的基础平台硬件与运维支持能力,有一些非核心业务的应用尝试。

    随着Docker、Kubernetes等容器技术的发展,与微服务等技术概念的形成,大数据与人工智能基础平台开始基于容器云构建底层资源管理与调度平台。容器云就像一个分布式的操作系统,将集群中的各类硬件资源进行封装、管理以及调度,将封装的资源作为容器承载大数据的相关组件进程,再将这些容器进行编排,组成一个个的大数据和人工智能的基础服务,如分布式文件系统HDFS、NoSQL数据库Hbase、分布式分析型数据库Inceptor、分布式流处理平台Slipstream、分布式机器学习组件Sophon等。由这些基础服务编排构建公共能力服务层,提供如数据仓库、数据集市、图数据库、全文搜索数据库、流处理服务、NoSQL数据库、机器学习平台服务、定制图像识别服务等,为企业打造全新的数据处理核心系统。基于这一核心系统服务于各类企业的不同部门。通过资源隔离技术,通过对每个租户的资源分配和权限管理,满足业务分析人员的个性化分析需求,专注于业务逻辑的开发和数据的分析挖掘。

    技术融合的应用

    中国邮政大数据平台建设以Transwarp Data Hub(以下简称TDH)与Transwarp Operating System(以下简称TOS)作为基础架构系统,搭建的新一代逻辑数据仓库和数据集市,完全取代了Teradata和Oracle。

    总体架构与实现

    中国邮政大数据平台服务于量收、邮务、名址等系统,同时运用容器云TOS实现创新多租户的数据分析挖掘环境。建立从业务层到管理层到决策层的智能分析体系,模拟量化风险和收益,实现对邮政各种业务数据进行分类、管理、统计和分析等功能,给各级管理人员提供各类准确的统计分析预测数据,使其能够及时掌握全面的经营状况,为宏观决策提供支持;为省分公司基层业务人员提供详尽的数据,供其对各自的工作目标、当前和历史状况进行准确的把握,对业务活动进行有效支撑,满足邮政经营分析管理及决策支持。

    中国邮政大数据平台以五大基础服务集群域为基础,分别是数据湖集群域、企业数据仓库集群域、省分服务集群域、机器学习实验室集群域、开发/测试/培训集群域。

    (1)数据湖集群域:基于TDH平台搭建的数据湖,主要承担多源异构的数据归集,数据湖内包括:原始数据池、清洗加工数据池、整合加工数据池等。

    (2)企业数仓集群域:基于TDH搭架的数据仓库集群,基于大数据创新搭架逻辑数据仓库,用于迁移改造原有基于Teradata搭架的数据仓库,数据集市和基于Oracle搭建的报刊集市的邮政量收管理系统。

    (3)省分服务集群域:基于TOS搭建容器化多租户数据分析平台云。为省、市分公司开发人员和业务人员提供省分多租户的平台环境,集团分发数据与自有数据存储计算,自有应用的开发与管理,独立租户使用运行。

    (4)机器学习实验室集群域:基于TOS搭建的容器化多租户大数据机器学习平台,为集团数据中心分析师提供多租户的开发实验环境平台,进行数据探查、业务建模、算法研究、应用开发、成果推广等。

    (5)开发/测试/培训集群域:为应用开发人员、系统测试人员、培训师、学员提供多租户的大数据与机器学习平台,为开发商及内部单位提供开发测试培训服务。

    以此为基础,达到了数据管理、服务管理、运维管控、安全管控四个维度的统一。在风险管控、决策支持、服务支撑、流程优化、品牌创新、交叉营销六大应用领域展开应用。实现了租户管理、数据治理、数据加工、数据挖掘、数据探索、数据展现六大平台功能。

    数据湖和数据仓库基于TDH构建,将包括业务系统数据、实时流数据、合作单位数据、互联网数据等不同数据源,通过ESB接入、ETL工具、Kafka、Sqoop、文本上传、人工接入等方式,统一汇聚进入数据湖。加工后获得的数据资产发布到数据资产目录,通过数据资产目录的构建TDH与TOS用户间数据交互体系。便于用户快速检索数据,通过数据资产目录实现对数据的集成、融合、安全、共享。数据资产目录包括:元数据、主数据、数据安全、数据标准、数据质量、数据轮廓、数据生命周期等。此外,企业用户通过大数据门户按需申请租户存储计算资源、数据资源、审批流程通过后,集群资源管理员按需快速部署集群,自动化将数据从数据湖加载入数据分析集群或省分集群对应的租户空间,供数据开发人员使用。数据开发人员会将数据应用成果固化到数据湖内,对外提供数据服务。

    数据仓库与数据集市的完整迁移

    中国邮政大数据平台是全球首个采用Hadoop(TDH)技术完全取代Teradata和Oracle的混合架构搭建新一代逻辑数据仓库和数据集市的系统。

    原量收系统使用Teradata的数据仓库和Oracle的数据库,数据使用空间目前已接近30TB,现有使用用户约5万人,提供近约900张报表的灵活查询,单日报表查询频次最高能达到40万次,月初高峰查询需支持约2000计算查询并发。

    通过项目前期大量调研准备工作,制定了切实可行的项目实施方案。量收管理系统的总体架构、ESB、BI工具、ETL工具、调度工具、门户等都保持不变,仅将原量收系统的数据仓库和数据集市,使用大数据平台进行完全替换,降低了整个迁移风险。

    整个迁移过程中,包括环境部署、模型迁移改造、接口迁移改造、数据迁移、ETL迁移改造、报表迁移改造、数据核对、性能优化、业务应用迁移、风险控制,系统测试等。例如模型迁移改造,不改变原有业务逻辑,只需对接口层模型,基础层模型、汇总层模型进行轻度改造。对于模型改造来说,系统基础层模型结构相对复杂,关联度相对较高,原系统使用Teradata数据库。TDH全面兼容Teradata的数据类型与SQL方言,降低了迁移成本。同时迁移完成后,性能大幅提升,见图2。

    ▲图2 迁移前后数据集市业务场景500并发测试性能对比

    基于容器云的大数据与机器学习平台的全面应用

    基于TOS实现的多租户新模式,将大数据与机器学习平台组件完全容器化实现,并在TOS提供能力服务。集团统一部署企业内部云平台,对邮政各个租户(集团、省分、市局等)动态分配存储、计算、网络等资源,并实现完整的资源隔离,使得各个租户数据分析人员和业务人员获得相对独立的资源环境,赋能业务创新,同时可动态调配资源,实现资源的共享优势。

    集团、省分、市局各级人员通过多租户平台,实现资源发布、申请,使用及应用开发、成果推广。通过项目立项申请审批后,省分项目组人员在租户空间内,接入访问数据资源,使用平台服务资源,大数据分析工具及机器学习挖掘工具展开数据分析挖掘工作,具体开展数据处理、模型开发、算法应用、应用发布等,在审批验收之后,将成果推广到数据湖上部署对全集团提供数据应用服务。

    通过TOS+TDH搭架厚平台、薄应用的微服务架构,实现租户之间的异构性、独立测试与部署、资源按需伸缩、高性能计算能力、租户间错误问题隔离、团队全功能化。实现数据资产化管理。面对集团数据多样、海量、跨板块、跨专业的需求,集团对数据进行了全面梳理,创新集成各版块、专业数据,创建数据资产目录便于快速检索获取资产,管控治理资产,让数据即资产从理论阶段上升到实现阶段。

    结语

    随着企业数据处理与服务需求的不断发展,由大数据的汇聚,分布式技术释放计算能力开始,技术不断延伸发展,大数据、人工智能与云计算的边界越来越模糊,...

  • ?

    大数据,比你更了解你自己

    穆凤灵

    展开

    每一个为人类创变而萌生的念头都是最高贵的种子,大家好,这里是高贵的种子。

    上周末,英美两国的媒体,爆出了一则与Facebook脸书有关的大新闻。报道称,一家名叫Cambridge Analytica剑桥分析的数据分析公司,通过为脸书平台开发的性格小测试程序,收割了超过5000万的用户数据。并且,利用这5000万用户,操纵了2016年的美国大选。接着便有新闻指出小扎道歉:我们错了!对Facebook数据泄露事件负有责任,不配为用户提供服务,他自己很后悔,将来一定会改正,他还保证不再发生类似事件,有新闻称美国联邦贸易委员会正在开展的调查,若属实,Facebook将面临2000000000000美元罚款!(事件时间线下图)

    那么它们如何抓取用户信息,又是如何操纵大选的大概过程:

    大概意思就是,这个公司针对每个用户的特点,尤其是那些偏中立不知道投谁的选民,投放洗脑政治新闻,进而最终将川普推向大选胜利。利用大数据给人洗脑?还影响选举?小小的一个脸书账号也能搞出这么多事儿?2014年夏天,这个公司和一位剑桥的研究人员合作,展开了一项研究,抓取了大约32万用户的核心数据,这些用户的喜好,性格和交友圈信息,一览无遗。

    我举个简单的例子,我们都知道希拉里是赞同接纳难民的,如果据数据判断,一个用户他经常点赞批判接纳难民的相关内容,或者从该用户的交往人群,信仰等线索蛛丝马迹,大概推断此人反移民或者不支持接纳移民,那么对他的主页频繁推送希拉里“接纳移民”的观点新闻,势必会让该用户产生对希拉里的反感。喜欢耸动新闻?没问题,专门给你发送“震惊”类的内容,一次管饱。当用户在潜移默化中,每天被推送阅读这些定制类的新闻时,你很难说他们不被影响。在大数据帮助下,川普团队潜移默化地影响了很多选民,这也成了他登上总统之位的强效助力。

    事实上,Facebook这种事,影响的不止是选举这样的大事件。大数据还在操纵我们每个人生活的方方面面。这些公司做的第一步,就是收集数据。我们在网络上的所有行为,每一次点赞,每一次分享,每一次浏览,都将成为被记录分析的数据当代人手机电脑不离手,只要连接了网络,我们就在留下痕迹。搜索引擎成了我们联通网络的大门,每次搜索,都会被看门的数据公司,记录下我们往哪个方向走。搜索过游戏,就给你推荐游戏;消费过护肤用品,就给推送同类型产品;转发过汽车新闻,就给推荐汽车。比如有东西加到购物车还没结账,再进入网站时购物车自动恢复,或者看的小说看到一半,再打开网站时自动找到上次读到的位置。本来这项技术是为了提供更好的客户体验,让大家浏览网站时,不需要一次把所有的事情都做完。然而,这个技术被广告商盯上了,掌握了我们网上的一举一动。通过读取cookie,广告商可以知道我们看过什么网页,看了多久,操作到什么地步。除了读取cookie,数据公司还会收集用户的个人基础信息、点赞、社交圈、消费习惯和生活习惯,也就是Facebook这种公司从我们身上拿到的资料。集齐了他们需要的信息,这些公司就开始对这些数据进行分析。这个分析的过程,叫做用户画像。用社交网站上的各种资料,配合用户在网上的浏览信息建立模型,用模型运算预测用户可能发生的行为。广告商根据这些分析结果,就可以预测我们可能会买什么,进行定向投放广告。它们不仅想知道我们搜索了什么,还想了解我们的各个方面乖乖让用户交出个人信息不是一件容易的事,我们又不是傻子,凭什么给这些公司我们的资料。但是事实证明,道高一尺魔高一丈,为了搞到数据,他们想出各种办法,哄得用户乐呵呵地自己奉上隐私数据。像剑桥分析给每个用户5块钱,用户不仅把自己的东西都交代了,还给了他们权限去了解自己的朋友们。想想我们,是不是也有曾经为了返券优惠,提供额外资料给某些app呢?

    就像是我们开始说的那样:大数据,比你更了解你自己。

    在大数据面前,我们每一个人都是赤裸的,待宰羔羊。这次Facebook操作选举的事件,只是揭露了大数据时代危险的冰山一角。原来,我们看到的世界,不过是大数据为我们精心定制的一隅天地。大数据,不止了解我们,掌握着我们一切的信息,就像马云他知道那个省妇女的胸大。能给我们安利心动的产品,提供我们需要的服务,还能让我们觉得我们看到了想看的一切。大数据分析出我们的三观,平台可以按照我们的三观偏好推送信息。当我们毫不设防,我们的视野被控制在大数据为我们预设的轨道里,小到消费购物,大到政治宗教,我们最终沦为大数据的提线木偶。

    了解你,洞悉你,甚至比你自己都清楚你。大数据时代,我们还有何处可逃?大数据下,我们都是一样的赤裸裸,我们经常接到各类保险的推销电话,我们的信息在大数据情况下,都是一样的赤裸裸,我们能做什么呢,我们别在朋友圈去各种秀;我们把相册加密码;但在现在这大数据时代,我们离不开电脑,手机,更离不开网络,所以我们需要国家建设网络安全个人信息的保护制度是迫在眉睫的。你们怎么认为呢,欢迎留言讨论。

  • ?

    8个公开大数据网站推荐,帮数据收集的新手入门!

    袁梦柏

    展开

    如果您对传统企业互联网转型、大数据、工业4.0等内容的文章、资料、PPT等感兴趣(有提供下载哦~),欢迎关注强企阅闻公众号。

    来源/钱塘大数据

    在这个用数据说话的时代,能够打动人的往往是用数据说话的理性分析,无论是对于混迹职场的小年轻,还是需要数据进行分析和研究的同学,能够找到合适的数据源都是非常重要的。特别是想要对一个新的领域进行研究和探索,拥有这个领域的数据那都是有十分重要的意义的。

    1.- 国家数据 -

    http://data.stats.gov/index.htm

    数据来源于中国国家统计局,包含了我国经济民生等多个方面的数据,并且在月度、季度、年度都有覆盖,较为全面和权威,对于社会科学的研究不要太有帮助。最关键的是,网站简洁美观,还有专门的可视化读物。

    2.- CEIC -

    http://ceicdata/zh-hans

    最完整的一套超过128个国家的经济数据,能够精确查找GDP, CPI, 进口,出口,外资直接投资,零售,销售,以及国际利率等深度数据。其中的“中国经济数据库”收编了300,000多条时间序列数据,数据内容涵盖宏观经济数据、行业经济数据和地区经济数据。

    3.- wind(万得)-

    http://wind/

    万得被誉为中国的Bloomberg,在金融业有着全面的数据覆盖,金融数据的类目更新非常快,据说很受国内的商业分析者和投资人的亲睐。

    4.- 搜数网 -

    http://soshoo/

    已加载到搜数网站的统计资料达到7,874本,涵盖1,761,009张统计表格和364,580,479个统计数据,汇集了中国资讯行自92年以来收集的所有统计和调查数据,并提供多样化的搜索功能。

    5.- 中国统计信息网 -

    http://tjcn.org/

    国家统计局的官方网站,汇集了海量的全国各级政府各年度的国民经济和社会发展统计信息,建立了以统计公报为主,统计年鉴、阶段发展数据、统计分析、经济新闻、主要统计指标排行等。

    6.- 亚马逊aws -

    http://aws.amazon/cn/datasets/?nc1=h_ls

    来自亚马逊的跨科学云数据平台,包含化学、生物、经济等多个领域的数据集。

    7.- figshare -

    https://figshare/

    研究成果共享平台,在这里你会发现来自世界的大牛们的研究成果分享,同时get其中的研究数据,内容很有启发性,网站颇具设计感。

    8.- github -

    https://github/caesar0301/awesome-public-datasets

    如果觉得前面的数据源还不够,github上的大神已经为大家整理好了一个非常全面的数据获取渠道,包含各个细分领域的数据库资源,自然科学和社会科学的覆盖都很全面,简直是做研究和数据分析的利器。

    随便上几个图,满满的都是资源啊

    免责声明:本公众号所载文章为本公众号原创或根据网络搜集编辑整理,文章版权归原作者所有。如涉及作品内容、版权和其他问题,请与我们联系! 文章内容为作者独立观点 ,并不代表兮易强企赞同或支持其观点。

  • ?

    怎样搭建一个大数据分析平台?内附资料福利

    莫神伤

    展开

    一般的大数据平台从平台搭建到数据分析大概包括以下几个步骤:

    1、Linux系统安装

    一般使用开源版的Redhat系统--CentOS作为底层平台。为了提供稳定的硬件基础,在给硬盘做RAID和挂载数据存储节点的时,需要按情况配置。比如,可以选择给HDFS的namenode做RAID2以提高其稳定性,将数据存储与操作系统分别放置在不同硬盘上,以确保操作系统的正常运行。

    2、分布式计算平台/组件安装

    当前分布式系统的大多使用的是Hadoop系列开源系统。Hadoop的核心是HDFS,一个分布式的文件系统。在其基础上常用的组件有Yarn、Zookeeper、Hive、Hbase、Sqoop、Impala、ElasticSearch、Spark等。

    使用开源组件的优点:1)使用者众多,很多bug可以在网上找的答案(这往往是开发中最耗时的地方);2)开源组件一般免费,学习和维护相对方便;3)开源组件一般会持续更新;4)因为代码开源,如果出现bug可自由对源码作修改维护。

    常用的分布式数据数据仓库有Hive、Hbase。Hive可以用SQL查询,Hbase可以快速读取行。外部数据库导入导出需要用到Sqoop。Sqoop将数据从Oracle、MySQL等传统数据库导入Hive或Hbase。Zookeeper是提供数据同步服务, Impala是对hive的一个补充,可以实现高效的SQL查询

    3、数据导入

    前面提到,数据导入的工具是Sqoop。它可以将数据从文件或者传统数据库导入到分布式平台。

    4、数据分析

    数据分析一般包括两个阶段:数据预处理和数据建模分析。

    数据预处理是为后面的建模分析做准备,主要工作时从海量数据中提取可用特征,建立大宽表。这个过程可能会用到Hive SQL,Spark QL和Impala。

    数据建模分析是针对预处理提取的特征/数据建模,得到想要的结果。如前面所提到的,这一块最好用的是Spark。常用的机器学习算法,如朴素贝叶斯、逻辑回归、决策树、神经网络、TFIDF、协同过滤等,都已经在ML lib里面,调用比较方便。

    5、结果可视化及输出API

    可视化一般式对结果或部分原始数据做展示。一般有两种情况,行数据展示,和列查找展示。

    以上就简单介绍这么多,如果有小伙伴想了解和学习更多的大数据技术,可以私信小编索要资料

  • ?

    工业大数据平台实现

    微妙

    展开

    当下,互联网技术与可再生能源革命正在开启新一轮工业革命的大幕,人类已经站在新时代的门槛上。

    随着物联网(IOT)技术的飞速发展,对传统企业,能否抓住这一历史机遇,依靠技术进步,改善和产业素质与提高生产效率,对企业进行智能化、工业化相结合的改进升级,从传统的厂发展为高技术企业。借助互联网+物联网等技术, 坚持“创新驱动、质量为先、绿色发展、结构优化、人才为本”的基本方针,实现“中国制造2025”伟大目标。

    在工业领域中,以产品数据为核心,极大延展了传统工业数据范围,同时还包括工业大数据相关技术和应用。其主要来源可分为以下三类:第一类是生产经营相关业务数据。第二类是设备过程数据。第三类是外部数据。

    上述三种数据中,最难获取的是第二类数据,是产业升级中实现过程自动化、机械制造自动化、管理自动化的关键数据来源依据。

    工业大数据平台由后台服务器、WEB服务器、手机APP、数据库、后台监控软件、前端展示框架、现场采集控制主机、工业微电脑控制器、物联网模块、无线网关、4G传输设备、传感模块等组成。

    现场MQTT服务器

    英特隆工业级微电脑控制器

    无线网关集中器

    传感器模块

    GPRS数据传输

    数据化展示

    自组网IOT模块

    整机拓扑框图

  • ?

    空间大数据时代,我们需要什么样的数据管理平台

    伊丽莎白

    展开

    地理信息数据管理现状

    大数据为地理信息行业带来了全新机遇,伴随大数据技术的发展,获取地理信息的各种新技术也在不断涌现。传统的地理信息采集是专业任务,强调几何精确性,测绘遥感是主要的采集手段。而大数据地理信息采集手段更为丰富和自由,传感器网络、个体出行过程、网络行为、消费记录等均可能成为大数据地理信息采集手段。这些地理数据具有体量大、来源广、多样化、多时项、多尺度、高维度、高复杂性和非结构化特点。

    目前,各行业用户拥有的地理数据普遍存在着数据分散、重复布局、更新维护困难等情况,严重影响到数据资源的共享、开发、利用。用户迫切需要一款数据管理平台,帮助自己实现海量数据资源的统一管理与维护。

    ‘安徽·天地图’政务版平台数据管理经验

    安徽基础测绘信息中心应用捷泰天域睿图数据库管理系统建立了一套“高效、灵活、实用”的数据资源管理平台,完成了安徽省天地图“母库”库体建设,实现了全省基础矢量数据、影像数据、地名地址数据、三维数据、街景数据、瓦片数据等各类数据资源的高效管理和可视化应用,提高了中心数据资源管理水平与成果应用效能。

    系统平台建立了灵活、可配置的数据查询体系,实现了数据查询、统计、提取的一体化;建立了融合数据与母库数据同步机制,形成母库与融合数据的良性互补,减少了重复建设;采用众筹思维模式,建立了需求牵引的快速同步更新机制,通过迭代方式快速更新产品库热点区域数据,然后与母库同步更新,从而完善、提高母库数据质量。

    专业数据管理平台——睿图数据库管理系统

    捷泰天域为了解决当前海量数据管理难题,推出睿图数据库管理系统,是以空间对象为主体的地理信息综合管理系统,以数据模型为核心,采用插件式开发框架,实现对基础地理信息数据、专题数据、影像数据、文档资料等各类数据的统一组织和有效管理。支持数据模型定制,可以根据实际情况跟随业务进行调整;支持开发定制,满足各种类型地理信息数据库的快速搭建和定制扩展。

    用户仅需使用极低的成本,即可获得地理信息数据资源的统一存储和高效管理。捷泰天域数据库管理系统帮助用户实现数据资源的统一管理、更新、维护、分发、共享,使数据更好的为业务应用和数据挖掘提供支撑。

    产品的核心价值包括以下几个方面:

    数据资源一体化管理

    为用户提供从数据质检、数据建库、数据更新到数据查询、数据展示、数据分发、数据共享全流程的一体化管理,减少用户进行数据管理、查找、更新、维护工作量。

    灵活的数据建模能力

    产品采用数据模型组织管理数据资源,用户可根据需要建立相应的数据模型。模型具备可扩展性,满足未来用户数据管理内容扩展的需要。

    高效检索,快速、精确定位

    用户无需担忧如何从海量的数据中快速获得到想要的那份数据,首先,产品采用ElasticSearch智能高效检索技术,提升海量数据的检索效率;其次,产品提供多种检索方式,包括空间检索、元数据检索、空间与元数据组合检索等,帮助用户快速、精确的找到需要的数据。

    要素级更新能力

    产品具备要素级更新能力,支持要素级更新数据的历史管理。帮助用户实现要素级的历史回溯。

    提供二次开发接口

    产品具备定制开发能力,用户可以通过库管产品提供的二次开发接口,结合自己的业务需求进行二次开发扩展。

    目前睿图数据库管理系统产品已面向政府、企事业单位和各行业各层面用户提供了专业的数据管理解决方案,并且产品已服务于时空信息云平台大数据管理、天地图母库管理、大数据中心建设等多个应用领域。

  • ?

    基于大数据平台的数据分析

    以山

    展开

    标签 | 大数据 架构

    作者 | 张逸

    无论是采集数据,还是存储数据,都不是大数据平台的最终目标。失去数据处理环节,即使珍贵如金矿一般的数据也不过是一堆废铁而已。数据处理是大数据产业的核心路径,然后再加上最后一公里的数据可视化,整个链条就算彻底走通了。

    数据处理的分类

    如下图所示,我们可以从业务、技术与编程模型三个不同的视角对数据处理进行归类:

    业务角度的分类与具体的业务场景有关,但最终会制约技术的选型,尤其是数据存储的选型。例如,针对查询检索中的全文本搜索,ElasticSearch会是最佳的选择,而针对统计分析,则因为统计分析涉及到的运算,可能都是针对一列数据,例如针对销量进行求和运算,就是针对销量这一整列的数据,此时,选择列式存储结构可能更加适宜。

    在技术角度的分类中,严格地讲,SQL方式并不能分为单独的一类,它其实可以看做是对API的封装,通过SQL这种DSL来包装具体的处理技术,从而降低数据处理脚本的迁移成本。毕竟,多数企业内部的数据处理系统,在进入大数据时代之前,大多以SQL形式来访问存储的数据。大体上,SQL是针对MapReduce的包装,例如Hive、Impala或者Spark SQL。

    Streaming流处理可以实时地接收由上游源源不断传来的数据,然后以某个细小的时间窗口为单位对这个过程中的数据进行处理。消费的上游数据可以是通过网络传递过来的字节流、从HDFS读取的数据流,又或者是消息队列传来的消息流。通常,它对应的就是编程模型中的实时编程模型。

    机器学习与深度学习都属于深度分析的范畴。随着Google的AlphaGo以及TensorFlow框架的开源,深度学习变成了一门显学。我了解不多,这里就不露怯了。

    机器学习与常见的数据分析稍有不同,通常需要多个阶段经历多次迭代才能得到满意的结果。下图是深度分析的架构图:

    针对存储的数据,需要采集数据样本并进行特征提取,然后对样本数据进行训练,并得到数据模型。倘若该模型经过测试是满足需求的,则可以运用到数据分析场景中,否则需要调整算法与模型,再进行下一次的迭代。

    编程模型中的离线编程模型以Hadoop的MapReduce为代表,内存编程模型则以Spark为代表,实时编程模型则主要指的是流处理,当然也可能采用Lambda架构,在Batch Layer(即离线编程模型)与Speed Layer(实时编程模型)之间建立Serving Layer,利用空闲时间与空闲资源,又或者在写入数据的同时,对离线编程模型要处理的大数据进行预先计算(聚合),从而形成一种融合的视图存储在数据库中(如HBase),以便于快速查询或计算。

    场景驱动数据处理

    不同的业务场景(业务场景可能出现混合)需要的数据处理技术不尽相同,因而在一个大数据系统下可能需要多种技术(编程模型)的混合。

    场景1:某厂商的舆情分析

    某厂商在实施舆情分析时,根据基于需求,与数据处理有关的部分就包括:语义分析、全文本搜索与统计分析。通过网络爬虫抓取过来的数据会写入到Kafka,而消费端则通过Spark Streaming对数据进行去重去噪,之后交给SAS的ECC服务器进行文本的语义分析。分析后的数据会同时写入到HDFS(Parquet格式的文本)和ElasticSearch。同时,为了避免因为去重去噪算法的误差而导致部分有用数据被“误杀”,在MongoDB中还保存了一份全量数据。如下图所示:

    场景2:Airbnb的大数据平台

    Airbnb的大数据平台也根据业务场景提供了多种处理方式,整个平台的架构如下图所示:

    Panoramix(现更名为Caravel)为Airbnb提供数据探查功能,并对结果进行可视化,Airpal则是基于Web的查询执行工具,它们的底层都是通过Presto对HDFS执行数据查询。Spark集群则为Airbnb的工程师与数据科学家提供机器学习与流处理的平台。

    大数据平台的整体结构

    行文至此,整个大数据平台系列的讲解就快结束了。最后,我结合数据源、数据采集、数据存储与数据处理这四个环节给出了一个整体结构图,如下图所示:

    这幅图以查询检索场景、OLAP场景、统计分析场景与深度分析场景作为核心的四个场景,并以不同颜色标识不同的编程模型。从左到右,经历数据源、数据采集、数据存储和数据处理四个相对完整的阶段,可供大数据平台的整体参考。

  • ?

    回顾·大数据平台从0到1之后

    詹绯

    展开

    本文根据链家赵国贤老师在DataFun Talk数据架构系列活动“海量数据下数据引擎的选择及应用”中所分享的《大数据平台架构从0到1之后》编辑整理而成,在未改变原意的基础上稍做修改。

    大数据平台构建方法大同小异,但是平台构建以后也面临很多挑战,在面临这些挑战我们如何去克服、修复它,让平台更好满足用户需求,这就是本次主题的重点。下面是本次分享的内容章节,首先讲一下架构1.0与2.0,两者分别是怎么样的,从1.0到2.0遇到了哪些问题;第二部分讲一下数据平台,都有哪些数据平台,这些数据平台都解决什么问题;第三个介绍下当前比较重要的项目“olap引擎的选型与效果”以及遇到的一些问题;第四个简单讲一下在透明压缩方面的研究。

    架构1.0阶段,底层是Hadoop,用来存储数据和分析数据。需要把log数据和事务数据传输到Hadoop平台上,我们使用的是kafka和sqoop进行数据传输。然后在Hadoop平台基础上,通过一个开源的Hive和oozie做一个调度,开发者写Hql来完成业务需求,然后将数据mysql集群或redis集群,上层承接的是一个报表系统。这个需求基本跑了一年,也解决了一些问题。但存在的问题有:(1)架构简单,不易解耦,结合太紧密出现问题需要从底层一直查到上面;(2)平台架构是需求驱动,面临一个需求后需要两周时间来解决问题,有时开发出来运营已经不需要;(3)将大数据工程师做成一个取数工程师,大量时间在获取怎样数据;(4)故障频发,比如Hql跑失败了或者网络延迟没成功,oozie是通过xml配置发布任务,我们解决需要从数据仓库最底层跑到数据仓库最高层,还要重刷msl,花费时间。

    面对这些问题我们做了一次架构调整,数据平台分为三层,第一层就是集群层(Cluster),主要是一些开源产品,Hadoop实现分布式存储,资源调度Yarn,计算引擎MapReduce、spark、Presto等,在这些基础上构建数据仓库Hive。还有一些分布式实时数据库HBase还有oozie、sqoop等,这些作用就是做数据存储、计算和调度,另外还有一个数据安全。第二层就是工具链,这一层是一个自研发调度平台,架构1.0用的oozie。基本满足需求有调度分发,监控报警,还有智能调度、依赖触发,后续会详细介绍。出问题后会有一个依赖关系可视化,数据出问题可以很快定位与修复。然后就是Meta(元数据管理平台),数据仓库目前有3万多张表,通过元数据管理平台实现数据仓库数据可视化。还有一个AdHoc,将数据仓库中的表暴露出去,通过平台需求方就可以自主查找自己需要的数据,我只需要优化查询引擎、记录维护、权限控制、限速和分流。最上层将整个大数据的数据抽象为API,分为三个,面向大数据内部的API,面向公司业务API,通用API。大数据内部API可以满足数据平台一些需求,如可视化平台、数据管理平台等,里面有专有API来管理这些API。面向公司业务API,我们是为业务服务的,通过我们的技术让业务产生更多产出,将用户需要的数据API化,通过API获取数据就行。通用API,数据仓库内部的报表都产生一些API,业务需求方根据自己的需求自动组装就OK了。架构2.0基本解决了我们架构1.0解决的问题。

    第二部分就简单介绍下平台,第一个是存储层-集群层,解决运维工作,我们基于开源做了一个presto。实习人员经过一两周能适应这个工作,释放了运维的压力,数据量目前有18PB,每天的任务有9万+,平均3-4任务/分钟;第二个就是元数据管理平台,这种表抽象为各个层,分析数据、基础细节数据等抽象,提供一个类似百度的搜索框,通过搜索获得所需数据,这样业务人员能够非常方便的使用我们的数据。它能实现数据地图(数据长怎样,关联关系是怎么样都可以显示出来),数据仓库可视化,管理运维数据,数据资产非常好的管理和运维,将数据开发的工作便捷化、简易化。

    第三个数据平台调度系统,数据仓库中的各个层需要流转,数据出现问题后如何去恢复数据。数据调度系统主要的工作有:(1)数据流转调度,可以非常简易的配置出数据的流转调度。(2)依赖触发,充分利用资源,能够让调度任务非常紧凑,能够尽可能快的产出我们的数据。(3)对接多个数据源,需要将多种多样的数据源集成到数据仓库中,如何将sql server数据、Oracle数据等数据导入到数据仓库中,系统能够对接多种数据源,因此我们财务人员、运营人员、业务人员都可以自主将数据接入到数据仓库,然后分析和调度。(4)依赖关系可视化。比如我们有100个任务是关联的,最底层std层有50个任务,中间层有20个任务,如果中间ODS层出问题了,会影响上层依赖层任务,通过可视化就能很方便定位。

    除了前面三个平台,还需要一个平台来展示我们的数据,才能向我们的用户显示数据的价值。我们的指标平台支持上卷下钻、多维分析、自助配置报表,统一公司的各个指标。说一下统一公司的各个指标,比如链家场景,比如说一个业绩(一周卖出十套房子,需要提佣),16年我们发现有多个口径,因此通过指标系统将指标统一化,指标都从这里出,可以去做自己的可视化。还有各种财务人员、区长或店长也可以自主从指标平台上配置自己的数据,做自己的desktop,指标系统的后端使用后续讲Kylin的一个多维分析引擎支撑的。

    指标平台架构,一个应用的可视化平台肯定需要底层能力的支撑,这次主题也是数据引擎,链家使用的是一个叫kylin的开源数据引擎,可以把数据仓库中的数据通过集群调度写入到HBase中做一个预计算。这样就可以支持指标系统千亿级数据亚秒级的查询,不支持明细查询因为做过预计算。还引入了百度开源的palo,经过优化,通过这样一个架构就满足上层的地动仪、指标平台和权限系统。运营、市场、老板都在用这个指标平台,能够实现多维分析、sql查询接口、超大规模数据集、释放数据的能力以及数据可视化。

    我们是需求驱动,每天都会遇到很多需求,数据开发人员就是取出需要的数据。利用adhoc平台将数据从数据仓库中取出,基于这个我们做了一个智能搜索引擎,架构在adhoc上的搜索引擎有很多,比如presto、hive、spark等。用户也不知道该选择那种引擎,他的需求就是尽可能取出自己所需的数据,因此开发智能选择引擎、权限控制,并且能够支撑各种接口、自助查询,这样就基本解决了数据开发的工作。我们自研发了一个queryengine,在底层有presto、sparksql、hive等,queryengine特点就是能够发挥各自引擎的特性,如presto查询快,但是sql支撑能力不强,sparksql同样,在某些特殊sql查询不如hive快,hive就是稳但是慢。queryengine就是智能选择各种引擎,用户把sql提交过来,queryengine判断哪个引擎适合你。如何做的简单介绍下,对sql进行解析成使用的函数、使用的表、需要返回的字段结构,根据各个引擎的能力判断哪个合适。目前还在开发功能就是计费,因为资源是有限的。queryengine支持mysql协议,因为有些用户需要BI能力,需要对返回的数据进行聚合,我们不能开各种各样的BI能力,我们只需满足mysql协议将数据暴露出去,用户只需用其他BI就能使用。

    通过架构1.0到架构2.0衍生出很多平台,大架构已经有了,但是遇到的一些问题如何解决。这里分享两个案例,一个是olap引擎的选型与效果,第二个就是为什么要做透明压缩,是如何做的。Rolap引擎基本是基于关系型数据库,基于关系模型实时进行聚合运算,主要通过传统数据库或spqrk sql和presto,spqrk sql和presto是根据数据实时计算;Molap是基于一个预定义模型,预先进行聚合计算,存储汇总结果。先计算好一个立方体,基于立方体做上传下钻,实现由Kylin/Druid,Druid主要是实时接入(Kylin没有),实时将kafka数据用Spark sql做一次计算然后将数据上传上去,可以支持秒级查询;还有一个比较流行的是叫olap,混合多引擎,不同场景路由到不同引擎。

    Rolap查询时首先将数据扫描出来,然后进行聚合,通过聚合结果将多个节点数据整合到一个节点上然后返回。优势是支持任何sql查询,因为数据是硬算,使用明细数据,没有数据冗余,一致性非常好,缺点是大数据量或复杂数据量返回慢,因为你是基于明细数据,一条一条数据计算无论如何优化还是会出现瓶颈,并发性很差。

    Molap中间会有一个中心立方体cube,在数据仓库通过预计算将数据存储到cube中,通过预聚合存储支持少量计算汇总,为什么少量计算,因为数据都已经预计算好了。优点就是支持超大数据集,快速返回并发高,缺点是不支持明细,需要预先定义维度和指标,适用场景就是能预知查询模式,并发有要求的场景,固化场景可以使用molap。

    对于技术选型,当时面临的需求,基本上开源组件有很多,为什么选择kylin,因为支持较高的并发,面对百亿级数据能够支持亚秒级查询,以离线为主,具有一定的灵活性,最好有sql接口,而这些需求刚好kylin能满足。Apache Kylin是一个开源的分布式分析引擎,提供Hadoop之上的SQL查询接口及多维分析能力,以支持超大规模数据,最初由e Bay Inc. 开发并贡献至开源社区。它能在亚秒内查询巨大的Hive表。其解决方案就是预先定义维度和指标,预计算cube,存储到hbase中,查询时解析sql路由到hbase中获取结果。

    现在讲一下链家olap架构,HBase集群,数据仓库计算和预处理在这块,还有一个为了满足kylin需求而做的HBase集群。Kylin需要做预计算,因此有个build集群,将数据写入到基于kylin的Hadoop集群中,然后利用nginx做一个负载均衡,还有一个query集群,然后就是面向线上的一个查询,还有一个kylin中间件,解决查询、cube任务执行、数据管理、统计。指标平台大部分是查询kylin,但是kylin不能满足明细查询,这个就通过queryengine智能匹配,通过spark集群或presto集群,还有alluxio做压缩,然后将明细查询结果返回指标平台,最终返回其他业务的产品。在横向还做了一个权限管理、监控预警、元数据管理、调度系统,来实现整体平台支撑。

    接下来讲一下链家kylin能力拓展,基本大同小异,遇到的问题主要有:分布式构建,cube增长很快,build集群无法承载,因此做了分布式优化能够满足500cube在规定时间跑完;优化构建时字典下载策略,kylin构建时需要将所有元数据字典全部下载下来,因此从Hadoop将元数据字典下载都得好几分钟,每次build都去下载元数据字典会很耗时,优化后只需要下载一次就可以;优化全局字典锁,build时需要锁住整个build集群,完成后锁才释放,源码发现并不需要全局锁只需要锁住所需要的字段就可以,优化将锁设置到字段级别上;Kylin 的query查询机器使用G1垃圾回收器。我们自研发了一个中间件基本可以容纳一个无限容量的队列,针对特定cube的预先调度,以及权限的管控、实现任务的并发控制。架构有外面的调度系统,有一个kylin中间件,所有的查询和build都经过kylin中间件。还做了一个任务队列、统计、优先级调度、监控报警、cube平分、以及可视化配置和展示。

    架构从0到1.0遇到了另一个问题-集群,存储链家所有数据,数据量大、数据增长快(0-1PB两年时间,1PB-16PB不到一年时间,面临成本问题)、冷数据预期,针对这些问题提出透明压缩项目。就是分层存储(Hadoop特性),根据不同数据分不同级别存储,比如把一部分数据存储在ssd,把另一部分数据存储到磁盘之上。Hot策略将数据全部存储到磁盘之上,warm策略就是一部分数据存储在磁盘上,一部分存储archive(比较廉价,转数小)。第二个就是ZFS文件系统,它具有存储池、 自我修复功能、压缩与可变块大小、 写时拷贝/校验和/快照、 ARC(自适应内存缓存)与L2ARC(SSD做二级缓存)。

    透明压缩设计实现思路是:(1)界定要做数据冷处理隔离的主要内容。需要将一部分数据存储到ZFS文件系统做一个透明压缩来满足减少成本的需求,这样需要把冷数据界定出来;(2)生成特定的通过获取特定的冷数据列表,并标记其冷数据率;然后,定期从冷数据表中取出为完成冷数据迁移的行,进行移动。通过HDFS目录把界定出来的冷数据移动到ZFS压缩之上,把不需要的移除到Ext4上。这样一部分数据存储在ZFS上,一部分存储在EXT4上。

    透明压缩优化工作有:第一个Hadoop冷热数据分离优化。涉及有异构存储策略选择、HDFS冷热数据移动优化;第二个就是ZFS文件系统优化。ZFS支持很多压缩算法,经过测试发现Gz压缩效率最好,下图是各种算法效率对比。随着压缩数据越来越大,CPU占用越来越高。海量数据集群不光是存储还有计算。Datanode对压缩数据的加载时间,直接关系到访问此部分数据时的效率,从表可知,ZFS的gz压缩在datanode加载数据上对LZ4有部分优势。较为接近EXT4。综合考虑压缩率,读取,写入速度,datanode加载速度等,选定gz作为ZFS文件系统的压缩算法。

    透明压缩前数据增长是非常快的,接近30%的增长速率,逻辑数据有3PB,3备份后总空间:9.3PB实际总空间:7PB,就目前简单预估节省成本有300万。压缩后虽然实际数据再增长,但真实数据是缓慢下降的。

    透明压缩未来展望,透明压缩是对cpu是有损耗的,我们希望将透明压缩计算提取出来,通过QAT卡进行压缩,希望...

  • ?

    什么是大数据和大数据平台?

    Greg

    展开

    “大数据”时下一个热门的词语,近几年来,关于大数据的著作和文章铺天盖地,似乎也在共同在传递一个信息:越来越多的行业、人士开始关注并实际探索大数据的应用,我们正在一起描绘着大数据巨大效用的蓝图,但在实践的路上,我们都孩子起步阶段小步前行。

    大数据根基于互联网,数据仓库、数据挖掘、云计算等互联网技术的发展为大数据应用奠定基础。对于任何一个大数据的从业者或初接触者,或者都会有个共同的感触:大数据很有用!但大数据是什么呢?

    今天就给大家讲解一下:

    对于大数据的定义,我们来引用3个比较差用的大数据定义:

    1)Gartner:需要信息处理模式才能具有更强的决策力,洞察发现力和流程优化能力的海量、高增长率很多样化的信息资产。

    2)IDC:海量的数据规模(Volunme)、快速的数据流转和数据体系(Velocity)、多样的数据类型(Variety)、巨大的数据价值(Value)。

    3)Wiki:或称巨量数据、海量数据、大资料,指所涉及的数据量规模巨大到无法通过人工,在合理时间内达到截取、管理、处理、并整理成为人类所能解读的信息。

    其他关于大数据的定义也大抵类型,我们可以用几个关键词对大数据做一个界定。

    首先,“大规模”,这种规模可以从两个维度来衡量,一是时间序列累积大量的数据,二是在深度上更加细化的数据。

    其次,“多样化”,可以是不同的数据格式,如文字、图片、视频等,可以是不同的数据类别,如入口数据,经济数据等,还可以有不同的数据来源,如互联网、传感器等。

    最后,“动态化”,数据是不停变化的,可以随着时间快速增加大量数据,也可以是在空间上不断移动变化的数据。

    这三 个关键词对大数据从形象上做了界定。

    但是还需要一个关键能力,就是“处理速度快”。如果这么大规模、多样化又动态变化的数据有了,但需要很长的时间去处理分析,那不叫大数据。从另一个角度,要实现这些数据快速处理,靠人工肯定是没办法实现的,因此,需要借助于机器实现。

    最终,我们借助机器,通过对这些数据进行快速的处理分析,获取想要的信息或者应用的整套体系,才能称为大数据。

    我们可以用下面的图示给大数据定义:

    这下,就知道什么是大数据了吧

大数据平台数据

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP