中企动力 > 商学院 > 大数据下载软件
  • ?

    玩可视化大数据分析软件要掌握的6个核心技术(上)

    齐严青

    展开

    大数据技术与商业智能BI是相辅相成的,前面的文章就提到大数据技术可以帮助BI产品突破业务和技术的双挑战。可视化大数据分析软件在快速发展的市场环境中,迎来了越来越多的技术要求。这些核心技术成为大数据获取、存储、处理分析或可视化的有效手段,可以说是我们这些专注研究可视化大数据分析软件的工作人员需要去学习和了解的!

    大数据可视化

    1大数据生命周期

    底层是基础设施,涵盖计算资源、内存与存储和网络互联,具体表现为计算节点、集群、机柜和数据中心。在此之上是数据存储和管理,包括文件系统、数据库和类似YARN的资源管理系统。然后是计算处理层,如hadoop、MapReduce和Spark,以及在此之上的各种不同计算范式,如批处理、流处理和图计算等,包括衍生出编程模型的计算模型,如BSP、GAS 等。数据分析和可视化基于计算处理层。分析包括简单的查询分析、流分析以及更复杂的分析(如机器学习、图计算等)。查询分析多基于表结构和关系函数,流分析基于数据、事件流以及简单的统计分析,而复杂分析则基于更复杂的数据结构与方法,如图、矩阵、迭代计算和线性代数。一般意义的可视化是对分析结果的展示。但是通过交互式可视化,还可以探索性地提问,使分析获得新的线索,形成迭代的分析和可视化。基于大规模数据的实时交互可视化分析以及在这个过程中引入自动化的因素是目前研究的热点。

    2.大数据技术生态

    大数据的基本处理流程与传统数据处理流程并无太大差异,主要区别在于:由于大数据要处理大量、非结构化的数据,所以在各处理环节中都可以采用并行处理。目前,Hadoop、MapReduce和Spark等分布式处理方式已经成为大数据处理各环节的通用处理方法。

    数据可视化

    3.大数据采集与预处理

    根据MapReduce产生数据的应用系统分类,大数据的采集主要有4种来源:管理信息系统、Web信息系统、物理信息系统、科学实验系统。对于不同的数据集,可能存在不同的结构和模式,如文件、XML 树、关系表等,表现为数据的异构性。对多个异构的数据集,需要做进一步集成处理或整合处理,将来自不同数据集的数据收集、整理、清洗、转换后,生成到一个新的数据集,为后续查询和分析处理提供统一的数据视图。

    关于玩可视化大数据分析软件要掌握的6个核心技术就先介绍3个,下篇我们再继续。开发一款可视化大数据分析软件需要掌握很多大数据技术,这要求研发人员保持持续学习和更新的态度。这样才能生产出先进的BI产品。

  • ?

    玩可视化大数据分析软件要掌握的6个核心技术(下)

    燕映天

    展开

    上篇已经介绍过了可视化大数据分析软件要掌握的6个核心技术的其中3个,这篇把剩下的3个继续介绍完。这些技术在某种程度上可以促进可视化大数据分析软件的技术更新,所以这也是本篇分享的目的所在。

    大数据可视化

    1. 大数据存储与管理

    总体上,按数据类型的不同,大数据的存储和管理采用不同的技术路线,大致可以分为3类。 第1类主要面对的是大规模的结构化数据。针对这类大数据,通常采用新型数据库集群。它们通过列存储或行列混合存储以及粗粒度索引等技术,结合MPP(Massive Parallel Processing)架构高效的分布式计算模式,实现对PB 量级数据的存储和管理。这类集群具有高性能和高扩展性特点,在企业分析类应用领域已获得广泛应用;

    第2类主要面对的是半结构化和非结构化数据。应对这类应用场景,基于Hadoop开源体系的系统平台更为擅长。它们通过对Hadoop生态体系的技术扩展和封装,实现对半结构化和非结构化数据的存储和管理;

    第3类面对的是结构化和非结构化混合的大数据,因此采用MPP 并行数据库集群与Hadoop 集群的混合来实现对百PB 量级、EB量级数据的存储和管理。

    2. 大数据计算模式与系统

    所谓大数据计算模式,即根据大数据的不同数据特征和计算特征,从多样性的大数据计算问题和需求中提炼并建立的各种高层抽象(abstraction)或模型(model)。例如,MapReduce 是一个并行计算抽象,加州大学伯克利分校著名的Spark系统中的“分布内存抽象RDD”,CMU 著名的图计算系统GraphLab 中的“图并行抽象”(Graph Parallel Abstraction)等。传统的并行计算方法,主要从体系结构和编程语言的层面定义了一些较为底层的并行计算抽象和模型,但由于大数据处理问题具有很多高层的数据特征和计算特征,因此大数据处理需要更多地结合这些高层特征考虑更为高层的计算模式。

    根据大数据处理多样性的需求和以上不同的特征维度,目前出现了多种典型和重要的大数据计算模式。与这些计算模式相适应,出现了很多对应的大数据计算系统和工具。由于单纯描述计算模式比较抽象和空洞,因此在描述不同计算模式时,将同时给出相应的典型计算系统和工具,如表1所示,这将有助于对计算模式的理解以及对技术发展现状的把握,并进一步有利于在实际大数据处理应用中对合适的计算技术和系统工具的选择使用。

    数据分析

    3. 大数据分析与可视化

    在大数据分析的应用过程中,可视化通过交互式视觉表现的方式来帮助人们探索和理解复杂的数据。可视化与可视分析能够迅速和有效地简化与提炼数据流,帮助用户交互筛选大量的数据,有助于使用者更快更好地从复杂数据中得到新的发现,成为用户了解复杂数据、开展深入分析不可或缺的手段。大规模数据的可视化主要是基于并行算法设计的技术,合理利用有限的计算资源,高效地处理和分析特定数据集的特性。通常情况下,大规模数据可视化的技术会结合多分辨率表示等方法,以获得足够的互动性能。在科学大规模数据的并行可视化工作中,主要涉及数据流线化、任务并行化、管道并行化和数据并行化4 种基本技术。微软公司在其云计算平台Azure 上开发了大规模机器学习可视化平台(Azure Machine Learning),将大数据分析任务形式为有向无环图并以数据流图的方式向用户展示,取得了比较好的效果

    关于玩可视化大数据分析软件要掌握的6个核心技术,这里就介绍完毕了。其实这两篇似乎把大数据技术阐述得非常难的感觉,但其实,可视化大数据分析软件的使用并没有那么神乎其神,毕竟可视化大数据分析软件的发明是为了企业日常的数据化运营而产生的,所以不能太过于难用。

  • ?

    中国终于掌握大数据基础软件核心技术,星环科技登顶“世界之巅”

    权问玉

    展开

    日前,央视一套、二套、新闻频道这三个频道,两大新闻栏目连续报道了个新闻:《我国人工智能相关大数据技术获突破》。到底发生了什么大事,值得这么重点报道?

    原来一家中国本土的人工智能和大数据基础软件公司“星环科技”,通过了国际组织TPC难度最高的测试,这在全球范围内尚属首次。有业内观点就认为,国产基础软件领域实现了弯道超车,为中国人工智能技术追赶国际巨头打下坚实基础。

    浏览器版本过低,暂不支持视频播放

    据央视报道:工信部最新的数据显示,截至2017年底,我国人工智能相关企业达到2000多家,核心产业规模超过180亿元,相关产业规模达到2200亿元,预计到2020年,核心产业规模超过1500亿元,带动相关产业规模超过1万亿元。 人工智能的背后,是机器的深度学习,是对海量数据的分析和应用,大数据基础软件是人工智能发展的基石。近日,国产相关技术获得突破,国内软件商星环科技通过了国际组织TPC严格的测试,这在全球范围内还是首次,同时也说明在大数据基础软件领域,国产技术已经实现弯道超车,将为中国人工智能技术追赶国际先进技术,打下坚实基础。

    那么问题来了,这个TPC测试到底是个什么情况?通过这个测试,对行业的影响真的有那么大?

    那么,让我们来了解一下TPC组织、TPC测试,以及通过测试的意义。

    TPC-DS基准测试,数据库领域的珠穆朗玛峰

    TPC 是全名为“事务处理性能委员会”的国际性组织,专门为业界制定数据库领域统一的、客观的、可验证的基准测试标准。组织成员包括Intel,IBM,Oracle,SAP,Teradata,微软、华为等国际知名厂商。

    TPC和SPEC是业界公认的两大测试基准体系。其中SPEC测试主要针对服务器硬件性能测试,而TPC更多的是针对高端领域的整体性能,特别是在线处理能力和数据库能力。国际知名厂商都在争取通过TPC 的权威测试,以证明自己产品的领先性。

    TPC-DS 发布于2006年1月9日,是TPC 测试体系中难度最高的基准测试。它包含了99个测试案例集,覆盖了对大数据集的统计、报表生成、联机查询、数据挖掘等复杂应用,与真实应用场景非常接近。

    TPC-DS测试对数据库厂商的产品提出了极高的挑战,这是因为,该测试要求数据库厂商同时具备很强的事务处理能力、并行能力、一致性和高可用性。为此,世界范围内各大顶级数据库学术会议上,几乎每年或者每隔一年都会有人发表对TPC-DS研究论文。

    面对这样严格的测试要求,虽然传统的数据库厂商事务处理能力已经相当成熟,但是在并行处理能力方面不佳,导致其性能较差,不愿意发布测试结果。

    而新兴的大数据厂商尽管具备较好的并行处理能力,但是其他方面能力较弱,无法通过全部的测试案例集。

    由此,业界公认TPC-DS 是当之无愧的数据库领域的“珠穆朗玛峰”。

    十余年从未有人通过的测试

    和TPC测试体系下不断有厂商发布其他类别基准测试的最新测试结果的情形不同,过去的12年里不断有厂商声称自己的数据库产品可以通过TPC-DS测试,但从未有厂商真的在TPC官网上发布过TPC-DS结果。此前,TPC组织也从未公开宣布过有厂商通过TPC-DS测试。

    例如IBM在其官网声称可以通过99个TPC-DS测试案例集,但从未在TPC组织上公开发布。(点击文末“阅读原文”,跳转IBM官网相关页面)

    这是因为除了TPC-DS测试本身高难度外,测试结果的审核也非常严格。TPC组织聘请了第三方对厂商提交的测试结果进行审计,以确保测试过程、测试结果公正客观,严格符合测试标准。例如,数据库厂商不可以对测试过程中的数据集、语法等做任何倾向性修改,否则测试结果无效。

    面对这样的世界性难题,中国本土企业星环科技创始人孙元浩带领着团队,仅用不到5年的时间,就把星环科技的产品打造成为了具备很强的事务处理能力、并行计算、数据一致并且高可用的分布式数据库系统。

    在经历了5个月的严格审计之后,星环科技大数据平台TDH于2018 年5 月正式通过TPC-DS 测试,成为全球首个通过TPC官方审核的TPC-DS基准测试数据平台,从而打破了该领域十二年来没有厂商通过该项测试的局面,在世界范围内填补了该项技术的空白。

    这实际上也标志着星环科技研发的分布式数据库产品已处于世界的领先地位。

    实际上,在发布TPC-DS结果之前,星环科技还发布了TPCx-HS的测试结果,在同样的数据量级上,星环科技仍然是世界排名第一。

    通过这些测试,并且保持世界领先位置的意义是什么?业内人士就表示,简单来说,这意味着中国在大数据基础软件领域不再受制于人,中国的大数据基础软件可以为中国未来的人工智能、大数据应用的快速发展打下坚实的基础。

    孙元浩坚信,从信息安全角度,中国需要自主可控的基础软件厂商。中国的数据量比美国高出一个数量级,应用场景也更为复杂,更需要本土公司以全新的技术来满足自身需求。

    在他看来,基础软件核心技术是国之重器,只有实现自主可控,才不会受制于人。未来5到10年,国内基础软件这一细分市场会由国内公司主导,而星环科技也会继续专注于企业级市场,特别是企业级核心软件市场,专心做基础软件。

  • ?

    大数据软件市场规模日益壮大,企查查在前进的路上从不止步

    田新竹

    展开

    大数据,如今已经不是一种新兴的技术。在现下信息数据越来越蓬勃发展下,大数据已经渗透于精准营销、金融服务、企业管理等多领域。

    但根据艾瑞咨询对大数据软件及服务的统计及预测来看,自2012年以来,中国大数据软件和服务行业市场规模增长迅猛。2016年,大数据软件市场规模72.6亿元,同比增长47.7%;大数据服务市场规模41.5亿元,同比增长51.1%。软件市场往往高于服务市场。

    (图片来源:艾瑞咨询)

    由此可以看出,大数据的蓬勃发展,带动着数据服务需求的提升,加之“知识付费”的狂潮,人们越来越青睐于付费软件带来的信息数据服务。且人们对于这样的需求服务期望值越来越高。恰好,企查查在这条道路上一直前进着。

    企查查,是苏州朗动网络科技有限公司旗下的主推APP。其是以大数据为支撑,以提供企业信息为服务的企业信用信息查询工具。

    作为第三方应用软件,向用户公开企业信息,这是法律所允许的吗?不少用户都会这样问,2014年的杨京也存在着这样的疑惑。但事实证明这是条正确的道路。

    最初面向用户的时候,企查查是微信版的“企业信用信息查询”,提供企业工商信息服务。谁也不曾料想到,仅仅2个月后,微信端的用户就突破了12万。这对于创始人陈德强、杨京来说,意味着是一次成功的尝试。随后,在2014年10月,陈德强、杨京带领团队发布了iOS 版本企业信用信息查询,并正式定名“企查查”。1个月后,android版本也顺利上线。

    (图片来源:企查查官网)

    正如艾瑞咨询的调查数据显示,软件市场往往高于服务市场。如果一味地只展示通过爬取而来的企业信息数据,没有创新,那么用户就会停滞不前。企查查需要新的技术、新的想法来推动其发展。

    终于,企查查于2016年上线了“图谱”功能。在从全国企业信用信息公示系统、中国裁判文书网、中国商标局、中国专利网等100余家权威网站爬取到企业信息数据后,企查查更是以图谱形式对信息进行特征抽取和整合,以更直观的方式来呈现企业信息。目前,企业的股权分配、对外投资、关系图谱等都是以这样的方式呈现。

    (图片来源:企查查APP)

    如今,经过三年多的发展,企查查功能不断升级,查询维度突破60个,这些基础的功能都是免费的,足以满足大部分人群的需求。但作为APP,都有其精准用户人群,其对软件服务的需求很高。企查查的精准用户就是企业老板、律师、销售、商务、会计和一些政府类机构从业人员了等。对于这部分人群来说,他们更期望付费带来更好的服务。

    而企查查的VIP,可以无限次查询企业老板信息、企业历史信息、企业更多联系方式、获取更多企业维度信息、下载更多董监高任职报告等,这些服务远远优于普通用户,因为其面向的主要是精准用户。惊喜的是,团购VIP,价格更优惠!

  • ?

    为大数据软件准备JAVA、Python环境

    宛丝

    展开

    环境:SUSE1164位

    安装JAVAJDK

    1、确定版本。一般都是安装最新的JDK(JavaSEDevelopmentKit)。个别软件和系统需要特定版本的JDK,根据实际需要下载。

    2、下载地址:http://oracle/technetwork/java/javase/downloads/jdk8-downloads-2133151.html其实百度一下JDK就出来了。

    3、这个表示是JAVA8版本的JDK,小版本是131。这个安装以后验证需要对一下。

    4、确认机型。

    X86服务器下载

    安腾小型机(IA)需要下载

    5、下载.tar.gz的就可以了,直接解压缩比用rpm安装要方便,还可以随意制定java的目录,更灵活。

    6、新建java组。用root用户,使用yast工具,新建java组(yast工具很方便,用语句也可以)。组可以全部使用默认配置,不用配置。把root用户也加到java组中。

    7、使用root用户,建立/java目录。命令:mkdir/java

    8、把下载好的tar.gz包用ftp或者其他工具上传到服务器/java目录。如果开了ssh登录,可以用sftp上传。解压压缩包。命令:tar-zxvfxxxx.tar.gz

    9、修改java目录的权限。用root用户。命令:chown-Rroot:java/java

    10、修改root用户的profile文件。使用root用户。命令:vi/etc/profile

    在profile文件最后增加(jdk1.8.0_91是我下载的版本,这里需要用你下载的替换掉):

    exportJAVA_HOME=/java/jdk1.8.0_91

    exportJRE_HOME=/java/jdk1.8.0_91/jre

    exportPATH=$JAVA_HOME/bin:$JRE_HOME/bin:$PATH

    exportCLASSPATH=.:$JAVA_HOME/lib/jt.jar:$JAVA_HOME/lib/tools.jar:$JAVA_HOME/lib:$CLASSPATH

    如果原来有JAVA_HOME、JRE_HOME的,需要把原来的删掉,否则有可能冲突。

    如果原来有PATH、CLASSPATH的,需要把这次新增加的内容添加到原来PATH、CLASSPATH里,否则会造成以前的安装的软件用不了。

    11、其他用户需要使用JAVA的,要在用户的profile文件中增加内容。如,系统有个用户hadoop,需要在hadoop的home目录下增加profile内容。命令:使用hadoop用户登录

    vi~/.profile

    在文件末尾增加以下内容:

    12、验证JAVA安装。使用root用户,输入java-version。如显示版本号(build1.8.0_91-b14,该版本是JDK8u91)能与下载的版本号对得上,就安装成功。

    安装Python2.7

    1、确认Python版本。Python版本分为2版本和3版本。不要贪图高版本,如果文档要求使用2版本(如2.6、2.7之类的),就不要下载3版本,否则很有可能用不了!不过始终都要升级到高版本的,所以可以多试验。总之,一定要试验以后再投产。

    2、一般服务器上都自带Python。Python版本一般都是2.6,所以需要升级。

    3、下载Python。下载地址:https://python.org/getit/把压缩包下载回来。

    4、安装系统软件。Python软件需要一些系统软件支持。否则安装、使用都会报错。SUSE11系统上需要安装以下软件:

    安装gccgcc-c++用yast,使用系统盘就可以安装

    安装ncurses-devel用yast,使用系统盘就可以安装。

    安装tack用yast,使用系统盘就可以安装。

    gcc和tack是必须要安装的,否则Python的安装会报错。ncurses-devel是安装tack必须的软件。

    以下两个devel包是可选安装,只是影响Python一些附加功能使用,不影响大数据软件,如kafka、storm之类的使用。

    安装readline-devel需要到网上下载安装包,使用rpm安装,CSDN有下载。

    安装zlib-devel需要到网上下载安装包,使用rpm安装,CSDN有下载。

    5、把下载好的压缩包解压到/usr/local/src目录

    6、编译新版本的Python。进入/usr/local/src目录,升级命令如下:

    ./configure--prefix=/usr/local/python2.7(这里用的是2.7版本,根据实际修改一下版本号)

    make&&makeinstall(编译过程,会输出一长串,注意看是否有ERROR)

    7、升级Python。用新版本的Python替换/usr/bin里的Python,命令如下:

    mv/usr/bin/python/usr/bin/python_old(把现有老版本的Python做个备份)

    ln-s/usr/local/python27/bin/python/usr/bin/(/usr/local/python27是放新版本Python的目录,根据实际情况修改)

    8、验证升级情况,使用root用户,输入python,显示如下界面即为成功:

    Python2.4.3(#1,Sep32009,15:37:37)

    [GCC4.1.220080704(RedHat4.1.2-46)]onlinux2

    Type"help","copyright","credits"or"license"formoreinformation.

  • ?

    Bossies 2016:最佳开源大数据工具

    傲儿

    展开

    在今年的 Bossie开源大数据工具中,你会发现最新最好的方法是利用大型集群进行索引、搜索、图形处理、流处理、结构化查询、分布式OLAP和机器学习,因为众多处理器和RAM可降低工作量级。

    处理大数据可能会遇到各种各样的问题,目前没有任何工具可以完美地处理这一切——即便是Spark。

    Bossie奖是英文IT网站InfoWorld针对开源软件颁发的年度奖项,根据这些软件对开源界的贡献,以及在业界的影响力评判获奖对象。本次InfoWorld评选出了13款最佳开源大数据工具,Spark、Beam都名列榜单之上。

    Spark

    Spark是写在Scala中的内存分布式处理框架,在Apache的大数据项目中非常火爆。随着Spark 2.0版本的发布,它的优势似乎在延续。除了SQL语句实现等基础功能,新版本的Spark在性能上也大幅提升。Spark 2.0在DataFrames的基础上进一步完善,比如新的Structured Streaming API 等。这一切改变使Spark程序员的操作更清楚简单,但Structured Streaming 可能会有较大改变。

    从RDD的批处理进程转变为无边界的DataFrame概念,Structured Streaming将使某些特定场景的流处理(比如捕获数据变更和位置更新)更容易实现,允许DataFrame本身的窗口时间序列,而不是进入流管道的新事件,这是Spark流式处理长期以来的痛点,尤其是与Apache Flink和Apache Beam相比,Saprk 2.0终于弥补了这块空白。如果你至今没有学会Spark,你就OUT了。

    Beam

    Google Beam是Apache的孵化器项目,提供了一种不需要每次改变引擎都重写代码的方式。目前看来,Spark可能是未来的编程模型,但如果不是呢?此外,如果你对一些扩展功能和Google DataFlow性能感兴趣,你可以自己在Beam平台编写代码并在DataFlow,Spark甚至是Flink上运行。我们很喜欢即写即运行的想法,但Beam不支持类似REPL的开发者功能,但未来它将是一款不错的分析工具。

    TensorFlow

    TensorFlow是Google针对机器学习提出的开源软件,无论是字符识别,图像识别,自然语言处理还是其他复杂的机器学习应用,TensorFlow可能都是你的首选。

    TensorFlow是用C++写的,但支持Python。此外,它最终会呈现出一个十分方便的方式运行分布式代码,优化GPS和CPU的并行代码。这将是下一个大数据工具,未来将会持续进行讨论。

    Solr

    作为Hadoop重量级厂商Hortonworks,Cloudera以及MapR等的选择,Apache Solr为企业带来可信任的、成熟的搜索引擎技术。Solr基于Apache Lucene引擎,这两个项目共享于许多社区。你可以在类似Instagram,Zappos,Comcast和DuckDuckGO等企业场景背后发现 Solr的身影。

    Solr中的SolrCloud,是利用Apache ZooKeeper创建可伸缩、分布式的搜索和索引解决方案,并且高度抵御分布式系统类似脑裂等常见问题。伴随着可靠性,SolrCloud的规模可按需变化,并且它足够成熟可以处理数十亿文档之间的大量查询请求。

    Elasticsearch

    Elasticsearch同样基于Apache Lucene引擎,是针对现在的REST API 和JSON文档概念的开源分布式搜索引擎。Elasticsearch集群数据从GB向PB级扩展十分容易,只需要很低的处理开销。

    作为ELK堆栈的一部分(Elasticsearch,Logastash和Kibana都是由Elasticsearch创造者Elastic创造的),Elasticsearch已经发现了它作为开源Splunk替代日志分析的杀手级应用。类似于 Nteflix,Facebook,Microsoft以及Linkedln公司在日志基础架构上会选择运行大型Elasticsearch集群。此外,ELK堆栈正在寻找其他方向,比如欺诈检测和特定领域的业务分析,这将使Elasticsearch在更多企业得到使用。

    SlamData

    未来对SlamData来说是一场长途旅行。为什么会选择使用MongoDB作为分析解决方案呢?可能因为这是一个可操作数据库。然而,正如 SlamData的Jeff Carr所言,它并不疯狂。有很多MongoDB方向新的公司和年轻的开发者产生,如果你使用MongoDB数据存储,并且需要运行基础的分析,你要创建整个Hadoop集群或者其他设施报告吗?SlamData允许用熟悉的SQL语法来进行JSON数据的嵌套查询,不需要转换或语法改造。

    该技术的主要特点之一是它的连接器。从MongoDB,HBase,Cassandra和Apache的Spark,SlamData同大多数业界标准的外部数据源可以方便的进行整合,并进行数据转换和分析数据。SlamData有基于SQL的引擎,本质上说和MongoDB类似,但不像MongoDB 有自己的解决方案,SlamData并没有吸纳PostgreSQL的所有数据,并称之为BI连接。既然核心技术是开源的,我认为可以期待未来有更多公司采用其技术不断完善该领域产品。

    Impala

    Apache Impala是针对Hadoop上SQL处理的Cloudera引擎。如果你正在使用Hive,Impala是一种不需要你重复考虑任何事情就可以达到查询性能的简单方法。基于行的分布式大规模并行处理系统,Impala相比于在Spark上组合Hive更加成熟和彻底。即便没有太多的调优,Impala 还是可以提高性能,并且一定比你付出同样努力使用Tez的效果要好。如果你在HDFS的文件之上需要使用SQL,Impala可能是最好的选择。

    Kylin

    如果你正在做N维立方体分析和现代大数据框架,Kylin很对你的口。如果你从没听说过OLAP多维数据集,没关系。如果你正在考虑RDBMS中存在一对多关系表,但有一部分需要计算字段,你可以选择在SQL里进行查询和计算,但是这太缓慢了。当我们的关系和计算量更多更复杂时,又该怎么办呢?不是平面的表,把它们想象成立方体组成的若干块,每一块事先预计价值。你可能有N维或多维数据。Kylin当然不是第一个实现分布式OLAP的,但它是最先进的技术之一,并且目前可以下载并安装在云端。

    Kafka

    Kafka是非常标准的分布式发布和订阅标准,现在已经用于世界上一些比较大的系统,Kafka的消息传递更加可靠,尽管与之前的系统不同,通过分布式提交日志保持耐久性。然而,Kafka的分区流处理支持高速数据加载和大量用户。比较讽刺的是,尽管所有这些功能已经足够让人惊讶了,但Kafka十分容易安装部署,这在大数据和消息传递规则里是个例外。

    StreamSets

    你可能有一些数据需要处理,这些数据可能在文件夹里(比如网络日志)或者正在Kafka上传递,虽然有很多方法可以实现,但使用StreamSets可以在最短的时间内做你想做的任何事情,它比其他解决方案更加完整。也有越来越多的强壮的连接器 (HDFS,Hive,Kafka,Kinesis),REST API,和GUI来监控数据流动,这也正是他们一直在努力做的事情。

    Titan

    直到人们意识到使用图表进行存储非常有用,图形数据库才开始火了起来。一个携带所有附件可插拔式存储的复杂数据库,本质上是指高度可分配的数据库列族。与其他图形数据库相比,Titan可以扩展。与严格的图形分析框架相比,Titan可以提供更好的性能,相比于Giraph,不需要使用内存资源或者时间重构图形,相当于GiraphX,更不用说潜在的优秀的数据完整性特征。

    Zeppelin

    无论你是一个只想要美观图形的开发者,还是想成为数据科学家,Zeppelin可能都适合你,它使用似曾相识的类似于IPython的笔记本概念,允许通过写标记,嵌入式代码,执行代码,它存在于Spark或其他引擎中,通过生成文本,表格或者图表形式输出。Zeppelin仍然缺乏一些特性和多功能DataBrick,但它正在稳步前进。如果你使用Spark,Zeppelin就存在于工具包中。

    本文地址:http://linuxprobe/bossies-2016.html编辑员:郭建鹏,审核员:杨鹏飞

  • ?

    3款在线视频下载工具,50多个主流平台视频任意下载!

    Meta

    展开

    本文为【运了个营】原创文章。

    欢迎个人分享转发,媒体转载请联系作者,未经允许,不得转载。

    目前各大视频网站都会自家视频做了格式保护,下载难度越来越大,很多视频即使下载成功也只能使用指定播放器才能观看,真的很烦...但有了下面这3款视频下载工具,任意网站的网页视频都可以轻松下载。

    微信视频下载

    该工具只能用于下载微信文章中的视频文件,只需复制文章链接,粘贴到工具中,将链接保存到本地即可实现视频下载。(下图以电脑端为例,手机端也可以操作)

    小视频下载

    这个工具已经可以支持爱奇艺、微信公众号、优酷视频、腾讯视频、搜狐视频、乐视视频、B站、快手、土豆、迅雷、QQ浏览器、开眼、V电影、风行网、56网等多个视频平台,只要将他们的视频所在网址输入到搜索框中,均可以一键提取该视频的原始地址。

    V视频助手

    支持下载腾讯视频、秒拍视频、微博视频、今日头条、阳光宽频网、快手、微信、百度视频、梨视频、西瓜视频等。只需复制视频链接至网站进行解析,视频解析后,在下载地址上点击右键保存即可。

  • ?

    分享:大数据学习资料(从下载狂转变为学习狂)

    傲柔

    展开

    很早之前就看过一篇文章,题目就是《从下载狂转变为学习者》,我们经常是一味的寻找资料,下载资料。寻找资料好像一匹狼,恨不得把有关的全部资料全部收入自己的硬盘,这个下载的过程,具有无比的快感,下载后,束之高阁,隐藏在硬盘的N层文件夹以下。

    为什么会如此呢?

    因为我们已经在下载过程中享受过了那种难以形容的快感。快感是一种多么难以重复的物质啊!

    今日开始本人将自己下载的大数据相关电子书,视频讲座不断分享出来,谢谢各位持续关注!

  • ?

    大数据常用软件工具与应用场景

    曲冷玉

    展开

    如今,大数据日益成为研究行业的重要研究目标。面对其高数据量、多维度与异构化的特点,以及分析方法思路的扩展,传统统计工具已经难以应对。

    工欲善其事,必先利其器。众多新的软件分析工具作为深入大数据洞察研究的重要助力, 也成为数据科学家所必须掌握的知识技能。

    然而,现实情况的复杂性决定了并不存在解决一切问题的终极工具。实际研究过程中,需要根据实际情况灵活选择最合适的工具(甚至多种工具组合使用),才能更好的完成研究探索。

    为此,本文针对研究人员(非技术人员)的实际情况,介绍当前大数据研究涉及的一些主要工具软件(因为相关软件众多,只介绍常用的),并进一步阐述其应用特点和适合的场景,以便于研究人员能有的放矢的学习和使用。

    -基础篇-

    01 传统分析/商业统计

    Excel、SPSS、SAS 这三者对于研究人员而言并不陌生。

    Excel作为电子表格软件,适合简单统计(分组/求和等)需求,由于其方便好用,功能也能满足很多场景需要,所以实际成为研究人员最常用的软件工具。其缺点在于功能单一,且可处理数据规模小(这一点让很多研究人员尤为头疼)。这两年Excel在大数据方面(如地理可视化和网络关系分析)上也作出了一些增强,但应用能力有限。

    SPSS(SPSS Statistics)和SAS作为商业统计软件,提供研究常用的经典统计分析(如回归、方差、因子、多变量分析等)处理。SPSS轻量、易于使用,但功能相对较少,适合常规基本统计分析

    SAS功能丰富而强大(包括绘图能力),且支持编程扩展其分析能力,适合复杂与高要求的统计性分析。

    上述三个软件在面对大数据环境出现了各种不适,具体不再赘述。但这并不代表其没有使用价值。如果使用传统研究方法论分析大数据时,海量原始数据资源经过前期处理(如降维和统计汇总等)得到的中间研究结果,就很适合使用它们进行进一步研究。

    02 数据挖掘

    数据挖掘作为大数据应用的重要领域,在传统统计分析基础上,更强调提供机器学习的方法,关注高维空间下复杂数据关联关系和推演能力。代表是SPSS Modeler(注意不是SPSS Statistics,其前身为Clementine)

    SPSS Modeler的统计功能相对有限, 主要是提供面向商业挖掘的机器学习算法(决策树、神经元网络、分类、聚类和预测等)的实现。同时,其数据预处理和结果辅助分析方面也相当方便,这一点尤其适合商业环境下的快速挖掘。不过就处理能力而言,实际感觉难以应对亿级以上的数据规模。

    另一个商业软件 Matlab也能提供大量数据挖掘的算法,但其特性更关注科学与工程计算领域。而著名的开源数据挖掘软件Weka,功能较少,且数据预处理和结果分析也比较麻烦,更适合学术界或有数据预处理能力的使用者。

    -中级篇-

    01 通用大数据可视化分析

    近两年来出现了许多面向大数据、具备可视化能力的分析工具,在商业研究领域,TableAU无疑是卓越代表。

    TableAU的优势主要在于支持多种大数据源/格式,众多的可视化图表类型,加上拖拽式的使用方式,上手快,非常适合研究员使用,能够涵盖大部分分析研究的场景。不过要注意,其并不能提供经典统计和机器学习算法支持, 因此其可以替代Excel, 但不能代替统计和数据挖掘软件。另外,就实际处理速度而言,感觉面对较大数据(实例超过3000万记录)时,并没有官方介绍的那么迅速。

    02 关系分析

    关系分析是大数据环境下的一个新的分析热点(比如信息传播图、社交关系网等),其本质计算的是点之间的关联关系。相关工具中,适合数据研究人员的是一些可视化的轻量桌面型工具,最常用的是Gephi。

    Gephi是免费软件,擅长解决图网络分析的很多需求,其插件众多,功能强且易用。我们经常看到的各种社交关系/传播谱图, 很多都是基于其力导向图(Force directed graph)功能生成。

    但由于其由java编写,限制了处理性能(感觉处理超过10万节点/边时常陷入假死),如分析百万级节点(如微博热点传播路径)关系时,需先做平滑和剪枝处理。 而要处理更大规模(如亿级以上)的关系网络(如社交网络关系)数据,则需要专门的图关系数据库(如GraphLab/GraphX)来支撑了,其技术要求较高,此处不再介绍。

    03 时空数据分析

    当前很多软件(包括TableAU)都提供了时空数据的可视化分析功能。但就使用感受来看,其大都只适合较小规模(万级)的可视化展示分析,很少支持不同粒度的快速聚合探索。

    如果要分析千万级以上的时空数据,比如新浪微博上亿用户发文的时间与地理分布(从省到街道多级粒度的探索)时,推荐使用 NanoCubes(http://nanocubes/)。该开源软件可在日常的办公电脑上提供对亿级时空数据的快速展示和多级实时钻取探索分析。下图是对芝加哥犯罪时间地点的分析,网站有更多的实时分析的演示例子。

    04 文本/非结构化分析

    基于自然语言处理(NLP)的文本分析,在非结构化内容(如互联网/社交媒体/电商评论)大数据的分析方面(甚至调研开放题结果分析)有重要用途。其应用处理涉及分词、特征抽取、情感分析、多主题模型等众多内容。

    由于实现难度与领域差异,当前市面上只有一些开源函数包或者云API(如BosonNLP)提供一些基础处理功能,尚未看到适合商业研究分析中文文本的集成化工具软件(如果有谁知道烦请通知我)。在这种情况下,各商业公司(如HCR)主要依靠内部技术实力自主研发适合业务所需的分析功能。

    -高级篇-

    前面介绍的各种大数据分析工具,可应对的数据都在亿级以下,也以结构化数据为主。当实际面临以下要求: 亿级以上/半实时性处理/非标准化复杂需求,通常就需要借助编程(甚至借助于Hadoop/Spark等分布式计算框架)来完成相关的分析。 如果能掌握相关的编程语言能力,那研究员的分析能力将如虎添翼。

    当前适合大数据处理的编程语言,包括:前面的内容介绍了面向大数据研究的不同工具软件/语言的特点和适用场景。 这些工具能够极大增强研究员在大数据环境下的分析能力,但更重要的是研究员要发挥自身对业务的深入理解,从数据结果中洞察发现有深度的结果,这才是最有价值的。

    End.

    来源:网络大数据

  • ?

    全球100款大数据工具汇总

    寻树人

    展开

    1、 Talend Open Studio

    是第一家针对的数据集成工具市场的ETL(数据的提取Extract、传输Transform、载入Load)开源软件供应商。Talend的下载量已超过200万人次,其开源软件提供了数据整合功能。其用户包括美国国际集团(AIG)、康卡斯特、电子港湾、通用电气、三星、Ticketmaster和韦里逊等企业组织。

    2、DYSON

    探码科技自主研发的DYSON智能分析系统,可以完整的实现大数据的采集、分析、处理。DYSON智能分析系统专业针对互联网数据抓取、处理、分析,挖掘。可以灵活迅速地抓取网页上散乱分布的信息,并通过强大的处理功能,准确挖掘出所需数据,是目前使用人数最多的网页采集工具.

    3、YARN

    一种新的Hadoop资源管理器,它是一个通用资源管理系统,可为上层应用提供统一的资源管理和调度,解决了旧MapReduce框架的性能瓶颈。它的基本思想是把资源管理和作业调度/监控的功能分割到单独的守护进程。

    4、Mesos

    由加州大学伯克利分校的AMPLab首先开发的一款开源群集管理软件,支持Hadoop、ElasticSearch、Spark、Storm 和Kafka等架构。对数据中心而言它就像一个单一的资源池,从物理或虚拟机器中抽离了CPU,内存,存储以及其它计算资源, 很容易建立和有效运行具备容错性和弹性的分布式系统。

    5、Datale

    由探码科技研发的一款基于Hadoop的大数据平台开发套件,RAI大数据应用平台架构。

    6、 Ambari

    作为Hadoop生态系统的一部分,提供了基于Web的直观界面,可用于配置、管理和监控Hadoop集群。目前已支持大多数Hadoop组件,包括HDFS、MapReduce、Hive、Pig、 Hbase、Zookeper、Sqoop和Hcatalog等。

    7、ZooKeeper

    一个分布式的应用程序协调服务,是Hadoop和Hbase的重要组件。它是一个为分布式应用提供一致性服务的工具,让Hadoop集群里面的节点可以彼此协调。ZooKeeper现在已经成为了 Apache的顶级项目,为分布式系统提供了高效可靠且易于使用的协同服务。

    8、Thrift

    在2007年facebook提交Apache基金会将Thrift作为一个开源项目,对于当时的facebook来说创造thrift是为了解决facebook系统中各系统间大数据量的传输通信以及系统之间语言环境不同需要跨平台的特性。

    9、Chukwa

    监测大型分布式系统的一个开源数据采集系统。建立在HDFS/MapReduce框架之上并继承了Hadoop的可伸缩性和可靠性,可以收集来自大型分布式系统的数据,用于监控。它还包括灵活而强大的显示工具用于监控、分析结果。

    10、Lustre

    一个大规模的、安全可靠的、具备高可用性的集群文件系统,它是由SUN公司开发和维护的。该项目主要的目的就是开发下一代的集群文件系统,目前可以支持超过10000个节点,数以PB的数据存储量。

    11、HDFS

    Hadoop Distributed File System,简称HDFS,是一个分布式文件系统。HDFS是一个高度容错性的系统,适合部署在廉价的机器上。HDFS能提供高吞吐量的数据访问,非常适合大规模数据集上的应用。

    12、GlusterFS

    一个集群的文件系统,支持PB级的数据量。GlusterFS 通过RDMA和TCP/IP方式将分布到不同服务器上的存储空间汇集成一个大的网络化并行文件系统。

    13、Alluxio

    前身是Tachyon,是以内存为中心的分布式文件系统,拥有高性能和容错能力,能够为集群框架(如Spark、MapReduce)提供可靠的内存级速度的文件共享服务。

    14、Ceph

    新一代开源分布式文件系统,主要目标是设计成基于POSIX的没有单点故障的分布式文件系统,提高数据的容错性并实现无缝的复制。

    15、PVFS

    一个高性能、开源的并行文件系统,主要用于并行计算环境中的应用。PVFS特别为超大数量的客户端和服务器端所设计,它的模块化设计结构可轻松的添加新的硬件和算法支持。

    16、QFS

    Quantcast File System (QFS) 是一个高性能、容错好、分布式的文件系统,用于开发支持 MapReduce处理或者需要顺序读写大文件的应用。

    17、 Logstash

    一个应用程序日志、事件的传输、处理、管理和搜索的平台。可以用它来统一对应用程序日志进行收集管理,提供了Web接口用于查询和统计。

    18、Scribe

    Scribe是Facebook开源的日志收集系统,它能够从各种日志源上收集日志,存储到一个中央存储系统(可以是NFS,分布式文件系统等)上,以便于进行集中统计分析处理。

    19、Flume

    Cloudera提供的一个高可用的、高可靠的、分布式的海量日志采集、聚合和传输的系统。Flume支持在日志系统中定制各类数据发送方,用于收集数据。同时,Flume支持对数据进行简单处理,并写入各种数据接受方(可定制)。

    20、RabbitMQ

    一个受欢迎的消息代理系统,通常用于应用程序之间或者程序的不同组件之间通过消息来进行集成。RabbitMQ提供可靠的应用消息发送、易于使用、支持所有主流操作系统、支持大量开发者平台。

    21、ActiveMQ

    Apache出品,号称“最流行的,最强大”的开源消息集成模式服务器。ActiveMQ特点是速度快,支持多种跨语言的客户端和协议,其企业集成模式和许多先进的功能易于使用,是一个完全支持JMS1.1和J2EE 1.4规范的JMS Provider实现。

    22、Kafka

    一种高吞吐量的分布式发布订阅消息系统,它可以处理消费者规模网站中的所有动作流数据,目前已成为大数据系统在异步和分布式消息之间的最佳选择。

    23、Spark

    一个高速、通用大数据计算处理引擎。拥有Hadoop MapReduce所具有的优点,但不同的是Job的中间输出结果可以保存在内存中,从而不再需要读写HDFS,因此Spark能更好地适用于数据挖掘与机器学习等需要迭代的MapReduce的算法。它可以与Hadoop和Apache Mesos一起使用,也可以独立使用。

    24、Kinesis

    可以构建用于处理或分析流数据的自定义应用程序,来满足特定需求。Amazon Kinesis Streams 每小时可从数十万种来源中连续捕获和存储数TB数据,如网站点击流、财务交易、社交媒体源、IT日志和定位追踪事件。

    25、 Hadoop

    一个开源框架,适合运行在通用硬件,支持用简单程序模型分布式处理跨集群大数据集,支持从单一服务器到上千服务器的水平scale up。Apache的Hadoop项目已几乎与大数据划上了等号,它不断壮大起来,已成为一个完整的生态系统,拥有众多开源工具面向高度扩展的分布式计算。高效、可靠、可伸缩,能够为你的数据存储项目提供所需的YARN、HDFS和基础架构,并且运行主要的大数据服务和应用程序。

    26、Spark Streaming

    实现微批处理,目标是很方便的建立可扩展、容错的流应用,支持Java、Scala和Python,和Spark无缝集成。Spark Streaming可以读取数据HDFS,Flume,Kafka,Twitter和ZeroMQ,也可以读取自定义数据。

    27、Trident

    是对Storm的更高一层的抽象,除了提供一套简单易用的流数据处理API之外,它以batch(一组tuples)为单位进行处理,这样一来,可以使得一些处理更简单和高效。

    28、Flink

    于今年跻身Apache顶级开源项目,与HDFS完全兼容。Flink提供了基于Java和Scala的API,是一个高效、分布式的通用大数据分析引擎。更主要的是,Flink支持增量迭代计算,使得系统可以快速地处理数据密集型、迭代的任务。

    29、Samza

    出自于LinkedIn,构建在Kafka之上的分布式流计算框架,是Apache顶级开源项目。可直接利用Kafka和Hadoop YARN提供容错、进程隔离以及安全、资源管理。

    30、Storm

    Storm是Twitter开源的一个类似于Hadoop的实时数据处理框架。编程模型简单,显著地降低了实时处理的难度,也是当下最人气的流计算框架之一。与其他计算框架相比,Storm最大的优点是毫秒级低延时。

    31、Yahoo S4 (Simple Scalable Streaming System)

    是一个分布式流计算平台,具备通用、分布式、可扩展的、容错、可插拔等特点。程序员可以很容易地开发处理连续无边界数据流(continuous unbounded streams of data)的应用。它的目标是填补复杂专有系统和面向批处理开源产品之间的空白,并提供高性能计算平台来解决并发处理系统的复杂度。

    32、HaLoop

    是一个Hadoop MapReduce框架的修改版本,其目标是为了高效支持 迭代,递归数据 分析任务,如PageRank,HITs,K-means,sssp等。

    33、Presto

    是一个开源的分布式SQL查询引擎,适用于交互式分析查询,可对250PB以上的数据进行快速地交互式分析。Presto的设计和编写是为了解决像Facebook这样规模的商业数据仓库的交互式分析和处理速度的问题。Facebook称Presto的性能比诸如Hive和MapReduce要好上10倍有多。

    34、 Drill

    于2012年8月份由Apache推出,让用户可以使用基于SQL的查询,查询Hadoop、NoSQL数据库和云存储服务。它能够运行在上千个节点的服务器集群上,且能在几秒内处理PB级或者万亿条的数据记录。它可用于数据挖掘和即席查询,支持一系列广泛的数据库,包括HBase、MongoDB、MapR-DB、HDFS、MapR-FS、亚马逊S3、Azure Blob Storage、谷歌云存储和Swift。

    35、Phoenix

    是一个Java中间层,可以让开发者在Apache HBase上执行SQL查询。Phoenix完全使用Java编写,并且提供了一个客户端可嵌入的JDBC驱动。Phoenix查询引擎会将SQL查询转换为一个或多个HBase scan,并编排执行以生成标准的JDBC结果集。

    36、Pig

    是一种编程语言,它简化了Hadoop常见的工作任务。Pig可加载数据、转换数据以及存储最终结果。Pig最大的作用就是为MapReduce框架实现了一套shell脚本 ,类似我们通常熟悉的SQL语句。

    37、Hive

    是基于Hadoop的一个数据仓库工具,可以将结构化的数据文件映射为一张数据库表,并提供简单的sql查询功能,可以将sql语句转换为MapReduce任务进行运行。 其优点是学习成本低,可以通过类SQL语句快速实现简单的MapReduce统计,不必开发专门的MapReduce应用,十分适合数据仓库的统计分析。

    38、SparkSQL

    前身是Shark,SparkSQL抛弃原有Shark的代码并汲取了一些优点,如内存列存储(In-Memory Columnar Storage)、Hive兼容性等。由于摆脱了对Hive的依赖性,SparkSQL无论在数据兼容、性能优化、组件扩展方面都得到了极大的方便。

    39、Stinger

    原来叫Tez,是下一代Hive,由Hortonworks主导开发,运行在YARN上的DAG计算框架。某些测试下,Stinger能提升10倍左右的性能,同时会让Hive支持更多的SQL。

    40、Tajo

    目的是在HDFS之上构建一个可靠的、支持关系型数据的分布式数据仓库系统,它的重点是提供低延迟、可扩展的ad-hoc查询和在线数据聚集,以及为更传统的ETL提供工具。

    41、Impala

    Cloudera 声称,基于SQL的Impala数据库是“面向Apache Hadoop的领先的开源分析数据库”。它可以作为一款独立产品来下载,又是Cloudera的商业大数据产品的一部分。Cloudera Impala 可以直接为存储在HDFS或HBase中的Hadoop数据提供快速、交互式的SQL查询。

    42、 Elasticsearch

    是一个基于Lucene的搜索服务器。它提供了一个分布式、支持多用户的全文搜索引擎,基于RESTful web接口。Elasticsearch是用Java开发的,并作为Apache许可条款下的开放源码发布,是当前流行的企业级搜索引擎。设计用于云计算中,能够达到实时搜索、稳定、可靠、快速、安装使用方便。

    43、Solr

    基于Apache Lucene,是一种高度可靠、高度扩展的企业搜索平台。知名用户包括eHarmony、西尔斯、StubHub、Zappos、百思买、AT&T、Instagram、Netflix、彭博社和Travelocity。

    44、Shark

    即Hive on Spark,本质上是通过Hive的HQL解析,把HQL翻译成Spark上的RDD操作,然后通过Hive的metadata获取数据库里的表信息,实际HDFS上的数据和文件,会由Shark获取并放到Spark上运算。Shark的特点就是快,完全兼容Hive,且可以在shell模式下使用rdd2sql()这样的API,把HQL得到的结果集,继续在scala环境下运算,支持自己编写简单的机器学习或简单分析处理函数,对HQL结果进一步分析计算。

    45、Lucene

    基于Java的Lucene可以非常迅速地执行全文搜索。据官方网站声称,它在现代硬件上每小时能够检索超过150GB的数据,它拥有强大而高效的搜索算法。

    46、Terracotta

    声称其BigMemory技术是“世界上首屈一指的内存中数据管理平台”,支持简单、可扩展、实时消息,声称在190个国家拥有210万开发人员,全球1000家企业部署了其软件。

    47、 Ignite

    是一种高性能、整合式、分布式的内存中平台,可用于对大规模数据集执行实时计算和处理,速度比传统的基于磁盘的技术或闪存技术高出好几个数量级。该平台包括数据网格、计算网格、服务网格、流媒体、Hadoop加速、高级集群、文件系统、消息传递、事件和数据结构等功能。

    48、GemFire

    Pivotal宣布它将开放其大数据套件关键组件的源代码,其中包括GemFire内存中NoSQL数据库。它已向Apache软件基金会递交了一项提案,以便在“Geode”的名下管理GemFire数据库的核心引擎。

    49、 GridGain

    由Apache Ignite驱动的GridGrain提供内存中数据结构,用于迅速处理大数据,还提供基于同一技术的Hadoop加速器。

    50、MongoDB

    是一个基于分布式文件存储的数据库。由C++...

大数据下载软件

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP