中企动力 > 商学院 > 阿里巴巴数据采集器
  • ?

    阿里巴巴的大数据有多可怕

    征服

    展开

    经中共军委主席习近平批准,中央军委印发《关于进一步加强军队信息安全工作的意见》。文章提出要构建与国家信息安全体系对接的“军队信息安全防护体系。”并特别强调要“确保重要人员、内核数据和关键设备安全”。

    中国人民大学公共管理学院教授刘太刚发表文章《阿里巴巴的大数据有多可怕》,直指马云控制的阿里,以大数据及云计算危及国家安全。

    阿里巴巴在纽交所的成功上市,引发了互联网对阿里及马云的赞誉狂潮。“但从国家的信息安全的角度看,阿里的大数据有多可怕。”

    阿里巴巴的消费数据覆盖之广、累积之深,全球没有任何一家公司和机构能出其右。目前单阿里旗下淘宝的注册用户就接近5亿,从而支撑起阿里的消费者数据、制造业数据和供应商数据。此外还有巨量的支付宝用户、余额宝共同支撑起阿里的金融数据。

    由于阿里未来的进军领域是医疗和文化事业,又将形成中国人的体质健康生理数据和心理意识数据。文章认为,这些数据通过云计算进行挖掘之后,对国家安全的价值会远远超国家保密局所保密的信息价值。

    阿里巴巴的大数据和云计算是有史以来最强大的情报搜集和分析系统,中国人的一举一动及行为偏好都尽在其掌握之中。

    “通过大数据挖掘建立起中国要害人员的个人档案----档主的社会关系、性格禀赋、兴趣爱好、隐私绯闻甚至生理周期和心理缺陷都尽在其中。有了这样一份个人档案,档主的行为偏好及弱点把柄就会被人洞若观火,威胁利诱等策反手段就能事半功倍。”

    “如果阿里的大数据能以现在的规模再累积30年,三十年后的中共领导人或许会从阿里的用户中产生。”阿里的大数据,“从国家安全的角度看,可能导致灾难。”

  • ?

    如何让数据价值最大化?阿里全域大数据系统深度解读

    Man

    展开

    2016年,阿里巴巴集团提出中台概念,阿里巴巴数据技术及产品部作为中台战略中的组成部分,承载了集团数据中台的工作,其核心就是建设全域大数据。究竟全域数据到底是什么?又该如何建设?

    在云栖大会阿里大数据分论坛, 阿里巴巴高级技术专家张磊给出了详细的回答。以下为分享全文实录:

    阿里巴巴高级技术专家张磊

    数据中台

    阿里巴巴数据技术及产品部定位

    2016年阿里巴巴集团提出中台概念,阿里巴巴数据技术及产品部承载了集团数据中台的工作,其核心就是建设全域大数据。

    从内容上看,我们管理和运维着阿里巴巴集团最核心的基础数据;

    从技术上看,我们覆盖了从数据采集、计算加工到数据服务、数据应用等数据链路上的每一个环节,为阿里生态内外的业务、用户、中小企业提供全链路、全渠道的数据服务。

    举个例子,被大家熟知的双11当天可见炫酷数据大屏就是由我们部门负责的。

    阿里数据中台全景图

    上图是阿里数据中台的全景图,从这个图中我们可以看见实际上阿里数据中台在架构的组成上,呈现了一个“四横三纵”的结构,底层的基础设施来自于阿里云平台。

    先来讲四横。 整张架构图从下往上看,最下面这块内容主要从数据采集和接入为角度,按照业态接入数据(比如淘宝、天猫、盒马等),我们把这些数据抽取到计算平台;接着通过OneData体系,以“业务板块+分析维度”为架构去构建“公共数据中心”;再基于公共数据中心在上层根据业务需求去建设:消费者数据体系、企业数据体系、内容数据体系等;经过深度加工后,数据就可以发挥其价值被产品、业务所用;最后通过统一的数据服务中间件“OneService”提供统一数据服务。

    在阿里内部,阿里数据平台上的数据产品已有几十种,每天有上万内部员工在使用数据产品;我们的官方统一数据产品平台“生意参谋”累计服务了超2000万商家……

    接下来是三纵。 基于阿里巴巴如此大体量的数据体系建设背后,我们必须要通过大量工具去保证快速、高效、高质量数据接入,这部分我们通过智能数据研发平台来实现,将我们的理论及实践过程,通过一整套的工具体系及研发流程去保障落地,确保每一个团队,每一个BU,通过统一规则去建设数据体系;同时,当数据多了以后最直接问题就是成本,因此我们还建立了统一的数据质量管理平台。

    全域数据到底是什么?

    阿里巴巴目前生态建设包括了核心的电商业务,淘宝、天猫、聚划算等,同时还有文娱板块的优酷、土豆、UC浏览器等,当然还有本地化服务比如口碑、饿了么等。基于业态背后还有蚂蚁、菜鸟、阿里妈妈、阿里云等等。

    这一系列的生态数据我们都会集中进行存储和管理,并构成了我们的全域数据所覆盖的范围。

    一方面,上述每一种业态都是全域数据的来源;另外一方面基于这些优质的数据,进行解析和处理,再反哺给到业务。我们要实现的是:利用全域数据去驱动业务,让数据发挥更大价值。

    以手淘为例,手机屏幕是非常小的,我们如何在有限的空间内展示给到用户看到他们真正希望看见的内容?“千人千面”这一应用的背后,实际上就是基于大数据的算法应用场景,来实现的。还有芝麻信用、菜鸟的智能物流、阿里妈妈的精准营销等等,它们都是通过大数据驱动之下,构成了业务与数据联通的闭环。

    阿里全域数据建设的初衷

    我们为什么要做全域数据?

    首先,降低成本。 大家都知道大数据建设的资金投入其实是非常巨大的。比如基础建设的投入、机房、机架、服务器、网络带宽,包括软件平台建设,开发运维团队的组建等等,都会耗费企业大量的资金和人力。以优土(优酷土豆的简称)为例,优土去年加入阿里巴巴集团之后,我们开始启动数据融合项目:在此之前,优土有自己的Hadoop集群,阿里巴巴的数据规模则大的多,将优土数据融合到阿里大平台上,可以让优土获得更多弹性资源,也可以在基础设施运维、人力运维、平台运维上复用集团的技术体系;基于OneData大数据建设体系、统一的数据采集规范等,减少人力及运维成本。 当项目完结后,我们发现目前优土在数据建设上的成本不到原来50%。

    其次,技术赋能。 客观来说,在阿里生态内公司的数据能力参差不齐,因此为了赋能其他生态公司,我们通过短时间的数据体系迁移,让他们拥有和阿里集团同样的大数据能力。上述的优土融合项目就是通过半年时间,实现了技术赋能。

    第三,数据连接。 我们知道数据孤岛的现象不光存在于传统行业,互联网行业也是一样。所以只有把数据连接起来,它才能发挥更大的价值,消除数据孤岛,让数据连接起来,也是我们进行全域数据建设的目的之一。

    最后,赋能业务。 无论我们的集群规模有多大,服务体量有多大,最终还是要回归业务、通过业务的数据表现来体现我们的价值——把数据体系统一后,除了让业务可以更加准确、快速的获取决策分析数据外,还能提供业务快速试错的机会,最终为业务创新降低了门槛。

    如何建设全域数据?

    在整个全域数据接入过程中,尽管基础设施建设已经非常强大,但在实际过程中,我们仍然面对了诸多困难和挑战。仍以优土为例,它的大数据机房在青岛,阿里集团大部分数据集群都在内蒙古和张北,而涉及到数据迁移也绝不是“拉一根网线”这么简单——其中涉及到应用体系、大数据架构都需要定制方案去做;

    另外,统一数据采集在接入的过程中也会就原有业务进行统一梳理,包括后面的数据验证,做过数据的人应该都知道其中的痛点;同时在迁移过程中,原有的数据对业务的服务还不能停,这事情我们叫——飞机上换轮子,一边要进行核心零部件更新,一边还要保持高速飞行;

    最后就是项目周期,基于现实情况,大数据建设一般需要较长的周期,无法在几周内完工,因为大数据建设不是一蹴而就,而是一根体系化过程。

    从基础设施来看,阿里经过电商发展,包括多年双11这种特殊场景下的考验,在基础设施上,从数据中心到网络到服务器,到数据库中间件、计算平台、数据平台、算法平台都有了非常多的沉淀。

    因此,在建设全域数据的时候,我们要做的第一步就是将生态公司的数据在基础设施阶段就进行融合。

    我们的数据组件划分如下:

    最底层——数据采集,这是数据的来源;中间——计算存储平台:实时计算采用自主研发的Blink,离线则采用MaxCompute。

    上图则更详细介绍了我们的数据组件:

    基于用户的网上行为去做数据采集(我们有PC和无线的采集体系)然后放到实时、离线计算平台上来,这两个计算平台除本身计算能力外,还有许多基于SQL、Graph等可编程的能力,最上面就是研发工具、产品服务、BI工具。

    有如此强有力的基础支撑外,长在上面的应用能力也非常给力:以研发工具为例,阿里有约两万名研发工程师,而每天基于阿里数据平台开展工作的同学就有近一万人!

    基于这些丰富的大数据组件,大部分的研发同学、专业的或非专业的同学都能在上面基于大数据做一些探索和尝试。

    下面介绍我们在全域数据建设中的几个体系。

    首先看流量体系, 这是互联网行业和传统行业最大的区别。

    打个比方,如果我们把淘宝可以看做流量分发中心,用户进来后把流量给到商品、给到卖家。那么在进行流量数据采集时,大家可能会给出不同的方案。

    我们基于阿里巴巴多年的电商经验,也沉淀出来了一套统一的流量采集规范——超级位置模型:

    以淘宝的页面为例:

    站点就是淘宝,下面会有页面、区块、位置,这些都是可以根据业务实际需求去埋点,并直观获取页面任何位置的数据,比如页面概况分析、路径分析、跳转分析、页面点击、用户分析等等。业务方只需要按照规范埋点,我们就能够迅速给到基础的流量分析能力,而基于此,配套对应的数据产品就可以解决80%的流量方面的数据问题。

    其次,计算组件化。

    众所周知,基于互联网的基础内容其实是能够固化下来特定需求,中间过程可以通过工程化能力去解决,然后迅速把这些东西配置出来,而不需要每一个需求都去做代码开发计算——这就是计算组件化。

    这样做的好处首先就是;配置简单、复用性高,同时,在注意统一规范后,未来接入uc、接入高德等业务,我们可以做到一键接入。

    全域数据建设最核心的体系是——OneData体系。

    目前,从整个大数据建设过程来看,它分为数据接入、规范定义、计算加工、数据验证、数据稳定性,这几个部分合并构成了整体的数据研发流程。

    OneData体系工具是全域建设的保障——我们知道现在存储和计算可能已不是瓶颈。随着分布式技术的发展,以Hadoop为典型代表,廉价的pc服务器即可搭建出超强的计算能力,因此存储和计算未来会变的越来越便宜,但相对昂贵的是工程师的时间成本。

    所以,工具化是解决研发效率的关键一环。我们把大量机械、人肉、不产生价值的工作,通过工具去完成,比如从数据的接入开始,我们有OneClick保证高效接入,根据阿里巴巴完善的元数据,我们有能力把基于业务db的数据一键拉到计算平台,这个过程几乎不需要人的参与。

    同时,通过OneDefine工具来确保数据建设过程是规范的,比如:模型分层、表命名规范、字段命名规范等。

    再看计算过程, 阿里数据应用的群体在能力上是参差不齐的,有专业的数据研发、有算法工程师、有分析师、可能还有业务运营,很多人可能简单自学SQL后,就可以自己跑数据:通常情况下,SQL质量无法保证,如果查询的数据量非常大,可能后台几千台机器就转起来了,为避免类似情况发生,我们会在提交任务过程中做代码校验,对于性能问题、规范问题、代码质量问题都会给出必要的提示,比如sql代码对于除数为0没有做代码兼容,比如我们的ddl语句中没有做数据生命周期的设置,比如sql的query中没有做分区的条件限制,甚至你的sql代码别人已经计算过,可以复用结果不需要重新计算这些问题,我们都会给出精确到提示。

    在数据研发过程中, 代码编写可能只占工作量的20%,那么大部分时间都去干吗了?是数据验证,代码修改前和代码修改后,数据到底差多少,差在哪儿?过去如果没有工具只能写一堆角本,再去验证,效率极其低下,而且极易出错,现在有了“在彼岸”工具我们可以通过简单的勾勾选选就知道前后差异到底差在哪?然后迅速给测试报告,保证整个研发过程的数据质量是有保障的。

    最后,任务上线后,大量时间都在运维,监控数据质量、监控产出时间等等,这些日常要去关注的工作我们也会有相关的工具去支持,因此OneData体系工具是全域数据建设的重要保障。

    工具有了,规范有了,我们还需要与研发流程全程打通,我们就可以确保规范真正的落实到每位开发者身上,因此我们可以这样来理解研发流程:某位研发同学在做数据需求,要先把规范定义完成才能继续进行代码开发。

    代码开发中会有两道检查:

    第一道是SQLscan :这里面会检查代码规范性、代码质量、可能出现的性能问题,把这些问题避免掉;

    另一道是“在彼岸”数据测试 ,重要的数据做了数据变更后,会要求做回归测试流程,轻松简单的勾选,就可以快速给出测试。如果任务需在生产环境运行, 这两个环节必须完成后才能够提交,上述过程就是整个基于OneData体系的研发流程。

    目前阿里巴巴数据总量已超EB级别,总表数也已经超百万,这么大体量下,如何能够做到高效灵活却又不失规范的大数据建设,我们确实探索了很长时间。

    随着阿里业务的不断拓展,对于大数据能力的要求会越来越高,技术上,如何突破传统数仓etl架构?我们从基础设施的计算存储分离、离线在线混布等事情上已经开始探索,相信在不久的将来,我们会对传统数仓etl进行重新的定义。

    你可能还喜欢

    点击下方图片即可阅读

    《阿里巴巴Java开发规约》插件使用详细指南

    云栖大会珍贵花絮,看完倍骄傲!

    本次云栖大会上,阿里开源了哪些顶级项目?

    关注 「阿里技术」

    把握前沿技术脉搏

  • ?

    在数据采集器中用TensorFlow进行实时机器学习

    席沅

    展开

    最新DataOps平台的真正价值,只有在业务用户和应用程序能够从各种数据源来访问原始数据和聚合数据,并且及时地产生数据驱动的认识时,才能够实现。利用机器学习(Machine Learning),分析师和数据科学家可以利用历史数据,以及实时地使用类似TensorFlow(TF)这样的技术,以做出更好的数据驱动业务的线下决策。

    在本文中,你将学习如何利用TensorFlow模型在StreamSets Data Collector3.5.0和StreamSets Data Collector Edge中最新发布的TensorFlow Evaluator*进行预测和分类。

    在深入讨论细节之前,我们来看一些基本概念。

    机器学习(Machine Learning)

    亚瑟·塞缪尔把它描述为:“不需要明确地编写程序而使计算机有能力学习的研究领域。”随着机器学习领域的最新发展,计算机现在有能力做出预测,甚至比人类做的还要好,并且感觉可以解决任何问题。让我们先回顾一下机器学习都解决了什么样的问题吧。

    通常来说,机器学习被分为两大类:

    监督学习(Supervised Learning)

    “监督学习是学习一个函数的机器学习任务,该函数基于输入-输出的实例,将输入映射到输出。”—维基百科(Wikipedia)。

    它涉及到构建一个精准的模型,当历史数据被标记为一些结果的时候,模型就可以预测出结果了。

    用监督学习解决的常见业务问题:

    二元分类(学习预测一个分类值)- 顾客会购买一个特定产品吗?- 癌症是恶性的还是良性的?多级分类(学习预测一个分类值)- 给定的一段文本是否带有病毒、恐吓或淫秽内容?- 这是山鸢尾、蓝旗鸢尾还是北美鸢尾的物种?回归(学习预测一个连续值)- 一个代售房子的预测价格是多少?- 明天旧金山的气温是多少?

    无监督学习

    无监督学习允许我们在知道很少,或是完全不知道输出应该是什么样子的情况下处理问题。它涉及在之前数据上的标签是不可用的情况下创建模型。在这类的问题中,通过对基于数据中变量之间的关系进行数据聚类来导出结构。

    无监督学习的两种常见方法是K-均值聚类(K-means clustering)和DBSCAN。

    注意:Data Collector和Data Collector Edge中的TensorFlow Evaluator目前仅支持监督学习模型。

    神经网络与深度学习

    神经网络是机器学习算法的一种,可以学习和使用受人脑结构启发而来的计算模型。与其它机器学习算法,如决策树、逻辑回归等相比,神经网络具有较高的准确性。

    Andrew Ng在传统人工神经网络的背景下对深度学习进行了描述。在题为“深度学习、自我学习与无监督特征学习”的演讲中,他把深度学习的思想描述为:

    “利用了大脑结构的模仿, 希望:- 让学习算法更好地、更容易地使用;- 在机器学习和人工智能领域取得革命性的进展;我相信这是我们朝着真正的人工智能前进的最好办法。”

    常见的神经网络和深度学习应用包括:

    计算机视觉/图像识别/目标检测语言识别/自然语言处理(NLP)推荐系统(产品、婚介等)异常检测(网络安全等)

    TensorFlow

    TensorFlow是为深度神经网络设计的开源机器学习框架,由Google Brain Team开发的。TensorFlow支持在Windows和Mac操作系统上的可伸缩和便携式的训练,包括CPU、GPU和TPU。迄今为止,它是GitHub上最流行的和最活跃的机器学习项目。

    Data Collector中的TensorFlow

    随着TensorFlow Evaluator的引入,你现在能够创建管道(pipelines),以获取数据或特征,并在一个可控的环境中生成预测结果或分类,而不必发起对作为Web服务而提供和公布的机器学习模型的HTTP或REST API的调用。例如,Data Collector管道现在可以实时地检测欺诈交易或在文本上执行自然语言处理,因为数据在被存储到最终目的地之前,为了进一步的处理或做决策,正在经过各个阶段。

    另外,使用Data Collector Edge,你可以在Raspberry Pi和其它运行在所支持的平台上的设备上运行已经启用了的TensorFlow机器学习管道。例如,在高风险地区检测洪水等自然灾害发生的概率,以防止对人们财产的破坏。

    乳腺癌分类

    让我们考虑将乳腺癌肿瘤分类成恶性还是良性的例子。乳腺癌是一个经典的数据集,可以作为scikit-learn的一部分。要了解如何在Python中使用该数据集训练和导出一个简单的TensorFlow模型,请查看我在GitHub上的代码。正如你将要看到的那样,模型创建和训练被保持在最小范围,并且非常简单,只有几个隐藏层。最需要注意的重要方面是如何使用TensorFlow SavedModelBuilder*来导出和保存模型。

    *注意:要在Data Collector或Data Collector Edge中使用TensorFlow模型,首先应该在你选择支持的开发语言里,如Python,和交互式环境中,如Jupiter Notebook,使用TensorFlow的SavedModelBuilder导出和保存模型。

    一旦使用TensorFlow的SavedModelBuilder训练并导出了模型,那么在数据流管道中使用它进行预测或分类就非常简单了 — 只要模型保存在Data Collector或Data Collector Edge可访问的位置上即可。

    管道概述

    在深入了解细节之前,可以看下管道是什么样的:

    管道细节

    目录源:- 这将从.csv文件中加载乳腺癌的记录数据(注意:这个输入数据源可以非常简单地替换为其它的来源,包括Kafka、AWS S3、MySQL等等);字段转换器:- 这个处理器将转换供模型所使用的所有输入的乳腺癌记录特征数据,从String类型转换到Float类型(mean_radius,mean_texture,mean_perimeter,mean_area,mean_smoothness,mean_compactness,mean_concavity,mean_concave_points,mean_symmetry,mean_fractal_dimension,radius_error,texture_error,perimeter_error,area_error,smoothness_error,compactness_error,concavity_error,concave_points_error,symmetry_error,fractal_dimension_error,worst_radius,worst_texture,worst_perimeter,worst_area,worst_smoothness,worst_compactness,worst_concavity,worst_concave_points,worst_symmetry,worst_fractal_dimension) ;TensorFlow Evaluator*:- 模型的保存路径:指定要使用的预训练的TensorFlow模型的位置;- 模型标签:设置为“serve”,因为元图(在我们导出的模型中)要用于服务中。有关详细信息,请参见tag_constants.py和相关的TensorFlow API documentation;- 输入配置:指定在训练和导出模型期间配置的输入张量信息(请见Train model and save/export it using TensorFlow SavedModelBuilder部分);- 输出配置:指定在训练和导出模型期间配置的输出张量信息(请见Train model and save/export it using TensorFlow SavedModelBuilder部分);- 输出字段:我们想保存分类值的输出记录字段;Expression Evaluator:-该处理器评估模型输出或分类值为0或1(存储在输出的字段TF_Model_Classification之中) ,并用Benign或Malignantrespectively这两个值创建一个新的记录字段“Condition”;Stream Selector:- 该处理器评估癌症状况(良性或恶性)并发送记录到各自的Kafka生产者;Kafka Producers:- 输入记录以及模型的输出或者分类值被有条件地发送给两个Kafka生产者以获得进一步地处理和分析;*TensorFlow Evaluator配置

    注意:一旦TensorFlow Evaluator产生了模型输出结果,本实例中采用的管道阶段是可选的,并且可以根据用例的需要与其它处理器和目标进行互换。

    管道执行

    在预览管道上,乳腺癌数据记录的输入通过了上面所述的数据流管道过程,包括服务于我们的TensorFlow模型。发送给Kafka生产者的最终输出记录数据(如上所示)包括用于分类的模型所使用的乳腺癌特征,在用户定义的字段TF_Model_Classification中模型输出值为0或1,以及由Expression Evaluator创建的Condition字段中表示相应的癌症状况是良性或恶性。

    总结

    本文说明了在Data Collector 3.5.0中使用最新发布的TensorFlow Evaluator。一般来说,这个评估器将允许你提供预训练的TensorFlow模型,用于生成预测结果和分类结果,而无需编写任何自己的代码

  • ?

    阿里巴巴大数据工程师:教你如何快速的搭建数据库

    Prunella

    展开
    阿里云

    数据仓库,是为企业所有级别的决策制定过程,提供所有类型数据支持的战略集合。它是单个数据存储,出于分析性报告和决策支持目的而创建。为需要业务智能的企业,提供指导业务流程改进、监视时间、成本、质量以及控制。我自己是名大数据程序员,建了一个大数据资源共享群593188212 每天分享大数据学习资料和学习方法,下面我们来讲大数据开发核心流程

    当我们接到一个需求,首先会进行需求分析,然后做工作流设计,比如这个任务是什么时候跑的、依赖于哪些业务。工作流设计完成后进行数据采集和数据同步。接下去就是数据开发,我们提供了WEB-IDE,支持SQL、MR、SHELL和 PYTHON等。然后我们提供了冒烟测试的场景,测试完成后发布到线上,让它每天定时进行自动调度,并进行数据质量监控。以上步骤都完成后,就能把我们的数据环流到业务系统库,或者用QuickBI、DataV这些工具进行页面展现。

    我们设计的任务是离线的,每天会在12点的时候把设计的任务变成一个实例快照。目前我们的任务依赖在业内也是最先进的。

    现在最常见的需求就是每天有日报,每周要写周报,每月要写月报。为了节省资源,就可以使用日报的数据直接转成周报或月报。

    线上系统在每天6点的时候要保证数据已经回笼到业务系统,系统要开始使用了。

    如上图所示,假设有D和E两个任务,它们依赖于B和A。任务D的运行时间是1.5小时,E是2小时。我们必须确保B每天在4点之前把B的任务运行完成,一般正常运行时间是2小时。那就要保证A每天任务完成的时间不晚于2点。如果A的运行时间是10分钟,到1点的时候发现A的任务失败了,这时就能计算出A还剩下多少余量,我们可以进行人工监督排查。在1:50之前人工介入,从而保证任务D和E能在6点前准时产出。

    总结

    如图所示,MaxCompute是图上小人的“心脏”,所有运行的任务都在MaxCompute里面。调度是数据架构的“大脑”。“眼睛”是数据监控,目前在数据架构平台上它还是一个“近视眼”,还没有正式推出。数据集成就像两只“手”,不停地从其它地方搬运数据。底层的开发环境和运维中心就像两条“腿”,保证整个数据架构平台走得更远。而数据质量就像是一个“人体健康中心”,也就是数据质量的监控。

    工程师

  • ?

    阿里巴巴平台每天产生海量数据

    马汝燕

    展开

    T20”峰会就在里头举行,英特尔公司CEO Brian Krzanich(布莱恩·科再奇)、CES主办方CTA(美国消费技术协会)总裁兼CEO Gary Shapiro和iRobot联合创始人兼CEO Colin M. Angle,与 iRobot、戴森、BOSE、惠人、飞利浦、博朗、海信等众多全球科技制造企业的CEO及高管共话未来科技趋势。

    阿里巴巴集团CEO张勇表示,阿里巴巴平台每天产生海量数据,它们在阿里巴巴的生态中是非常宝贵的资源。阿里巴巴非常高兴与Intel、CTA等合作伙伴一起,在这个快速变化的世界中为他们共同的客户创造更多价值。这时候疑问来了,双11节骨眼上,为什么说战略的事儿,这明显不是阿里的作风。

    我们可以从阿里11月2日发布的2016年第三季度财报数据中找到苗头。财报显示,阿里的云计算业务营收达到历史新高14.93亿元,同比增长130%,这是连续六个月来的三位数增长,媒体娱乐营收为36亿元,同比暴增302%

  • ?

    无数据不内容,揭秘阿里巴巴大数据如何赋能内容

    唐问枫

    展开

    流量对于电商来说是一条生命线,但随着后流量时代的到来,流量呈现去中心化和碎片化的趋势。2016年,内容创业兴起,内容已然成为当下流量的新入口,而内容营销也成为电商们无法忽视的议题。其中,数据的作用越来越凸显,通过数据分析流量的来源路径和渠道互动效果,可以有效地洞察用户行为,让品牌更好地触达消费者。

    在昨天的“淘宝大学超级公开课”上,阿里巴巴集团高级产品专家、生意参谋业务负责人林鸣晖(花名:默飞)就提出了“无数据不内容”的观点,在现场,他详细介绍了内容行业的发展趋势,及阿里大数据赋能内容的若干计划。据他介绍,今年7月底,生意参谋平台也将通过业务专区推出全新的内容分析小站。

    在林鸣晖看来,阿里巴巴数据赋能内容有三大利器:全内容链路数据采集、全内容渠道数据整合以及跨屏消费者精准洞察。首先是全内容链路采集,阿里巴巴采集用户从发现内容到购买商品整个过程产生的数据,数据全面囊括了“发现曝光”“阅读播放”“评论互动”“品牌传播”“导购成交”,由此可以清晰地观察每个用户在接收内容后不同阶段的特征,进而在内容策划上对不同阶段的消费者有所侧重,使得对每个消费者的触达更为精准,大大提升品牌触达效率。

    然后是全内容渠道数据整合。众所周知,阿里巴巴既有大电商生态数据(淘宝、天猫、聚划算、淘抢购等),又有大文娱生态数据(优酷、土豆、UC、淘宝头条、达人等)。这些全面的数据让谷歌高管都感叹阿里巴巴有着超过“Google+Facebook+Amazon三巨头数据维度的集合体”。这些数据都是真人数据,并且和消费者直接关联,更为重要的是,阿里巴巴基于OneID能力实现了这两方数据的融合和打通,能够准确地识别每个账号背后“真人”的全网行为。随后,阿里巴巴将借助“GProfile”服务,根据用户行为,打上不同的标签,再完成CP与商家的匹配及IP与目标人群的匹配。

    此外,阿里巴巴也做到了跨屏消费者精准洞察。谷歌的调查研究表明,绝大多数的媒体消费都是基于屏幕的,而跨屏消费在其中占据着主导地位。从PC端到移动端,阿里巴巴依托它的强账号体系,收集了用户地域、年龄、职业、品牌偏好、兴趣等多维度数据,把一个人立体动态地勾勒出来,从而洞察用户行为,选择合适的内容及渠道进行营销。

    在阿里全域内容数据体系中,有“内容生产创作数据分析”、“内容发行传播数据模型”、“内容商业变现数据模型”、“用户画像特征数据模型”、“CP价值苹果模型”“CP&商家特征匹配模型”等等板块,从内容生产到合作对接,阿里通过大数据及数据分析技术全方位赋能创作者、品牌以及商家。结合这些数据,可以更好的实现热点事件的内容生产、传播前的媒介选择、目标用户的精准对接;而在内容出品后,通过对其数据的全方位采集,又将反馈完善内容数据体系,做到内容数据的迭代。

    电商的未来将会是“人”、“货”、“场”三者的有机组合,货作为连接“人”和“场”的交集,已经不单纯是物理意义上的货物,从推荐到达人、网红,内容已经成为“货”的重要代表。如今,纯粹靠着编纂、造假、刷量等方式的内容营销方式逐渐被边缘化和淘汰,唯有对内容有着深刻理解,在数据技术支撑下,才能真正地把握内容营销的红利。阿里巴巴正在通过大数据技术正在一步步奠定自己内容变革的地位,开辟内容营销所带来的流量新格局。

  • ?

    数据中台-阿里巴巴的数据整合、价值发掘、社会赋能之道

    赫尔辛基

    展开

    大数据作为Tech Insight热点内容,12月19日上午北京场再一次惊爆会场,前后两个门口都挤满了用户,150人的场子,却挤了300多人,大多数用户边掂着脚认真听讲,还边录音。

    一个参加完大数据场的用户在Tech Insight结束后到前台来给工作人员说到,Tech Insight特别棒,没有听过瘾,明天还有就好了。他还说到,Tech Insight论坛讲的内容都是其它企业的实际应用场景,听起来就像是我们自己公司的业务搭建中的场景再现一样,非常实用。我们来看看阿里巴巴是如何对海量数据进行整合和价值发掘的,同时这对其他企业也具有很好的借鉴意义。

    阿里巴巴大数据建设经历了不断理念革新和实战、不断量变和质变的过程,其中,2014.04-2015.11的阿里集团数据公共层建设和2016.09开启的阿里巴巴大数据能力赋能社会是阿里巴巴在大数据领域的两次关键质变,第一次质变确定了阿里巴巴数据中台业务模式,第二次质变确定了阿里巴巴数据赋能社会的战略。

    一、那么阿里巴巴是怎么通过数据中台业务模式来进行阿里内部数据建设的?

    企业的发展,往往伴随着业务更多元化,而与此同时企业在积极推进业务数据化,因此越来越多的企业伴随着各个垂直业务的发展,形成了一个个垂直的数据中心,如何打通这些数据并且以统一的标准进行建设,以达到技术降本、应用提效、业务赋能的目标,是众多企业面临的问题。

    阿里巴巴提出的数据中台模式正是为解决这些问题而生,并通过实践形成了统一全域数据体系,实现了计算存储累计过亿的成本降低、响应业务效率多倍提升、为业务快速创新提供坚实保障。

    全域数据采集与引入:以需求为驱动,以数据多样性的全域思想为指导,采集与引入全业务、多终端、多形态的数据;

    标准规范数据架构与研发:统一基础层、公共中间层、百花齐放应用层的数据分层架构模式,通过数据指标结构化规范化的方式实现指标口径统一;

    连接与深度萃取数据价值:形成以业务核心对象为中心的连接和标签体系,深度萃取数据价值;

    统一数据资产管理:构建元数据中心,通过资产分析、应用、优化、运营四方面对看清数据资产、降低数据管理成本、追踪数据价值。

    统一主题式服务:通过构建服务元数据中心和数据服务查询引擎,面向业务统一数据出口与数据查询逻辑,屏蔽多数据源与多物理表;

    极大的丰富和完善了阿里巴巴大数据中心,OneData、OneID、OneService渐趋成熟并成为上至CEO、下至一线员工共识的方法论体系。

    二、是否在阿里生态之外,这套在阿里巴巴生态内实战过的数据中台模式可以推而广之、赋能全社会呢?

    这就为大数据能力赋能阿里生态内外的社会思考开始酝酿并悄然拉起帷幕!未来,阿里巴巴还将全力以赴的分享自己的大数据观和基于阿里巴巴大数据观的数据中台业务模式。

    赋能业务并闭环迭代:数据中台的建设的最终目标还是赋能业务,但在赋能业务的过程中,反馈数据和新数据需要源源不断地从业务前台回流到数据中台,形成闭环且可不端迭代。

    企业建设数据中台建设有三个必要条件,战略决心、人才投入和工具保障。数据中台模式的建设不是一个运动,也不是一个一次性的项目,而是需要不断投入迭代的过程,并且可能会驱动企业的组织和流程进化,因此需要企业的决策层从战略上认同和下决心。数据中台的构建需要大数据人才,并通过一套完善的大数据工具来支撑建设。而人才方面可以通过借鉴成熟的方法论+外部服务商的引入+好的大数据工具来降低依赖。阿里的智能数据引擎Dataphin,结合数据中台实践沉淀的方法论和建模化的自动代码生成等技术能力和功能,可以高效、高质助力企业从各垂直业务的数据到统一全域数据的转变,建设自有的数据中台。

    一个企业的大数据架构体系的成熟度将很大程度决定了企业大数据团队资源的长期投入是否能聚焦在业务问题,一般企业只有50%资源投入在业务问题解决,另外50%资源投入在应对源业务系统的突发变更,应对数据架构和模型体系的调整与优化。解决此问题需要从三方面着手:第一:构建一个统一的研发工作平台,让大数据的模型设计与实现一体化协同;第二:采用系统化的方法替代工程师设计,实现物理模型和物理运行代码的自动化生产,让架构调整与优化在系统层面自动完成;第三:构建一个以逻辑模型为中心的数据架构体系,既可以简化数据访问的复杂度,有可以屏蔽数据源变更的影响范围。数据引擎Dataphin从这三方面解决大型企业数据架构问题,帮助企业构建全域数据构建体系,实现企业大数据资源能力要求简化,实现企业大数据资源更加聚焦在利用大数据实现业务价值问题,来帮助大型企业实现数字化转型。

    如何打通这些数据并以统一的标准进行建设,以达到技术降本、应用提效、业务赋能的目标,将会成为众多企业面临的问题,而数据中台模式正是为解决该问题而生。全域数据采集与引入、标准规范数据架构与研发、连接与深度萃取数据价值、统一数据资产管理、统一主题式服务、赋能业务并闭环迭代,是数据中台建设的核心六个方面。对于数据中台建设有三个必要条件,战略决心、人才投入和工具保障,借力阿里的智能数据引擎Dataphin,通过其结合数据中台实践沉淀的方法论和自动化代码生成等技术能力,可极好地解决人才和工具两方面的问题。

  • ?

    采集数据制作阿里巴巴数据包方法

    度半

    展开

    我们知道,阿里巴巴也可以用数据包批量上传商品,可是这个数据包该如何制作?下面为大家揭晓怎么采集数据制作成阿里巴巴数据包为大家批量上传阿里巴巴的商品!

    这里介绍的是抓取阿里巴巴中商品制作成阿里巴巴的数据包,首先我们在工具箱的首页先找到”制作阿里巴巴数据包“这个功能选项,

    选择抓取商品的使用方式有3种抓取商品方式,在这里以B方式做详细介绍,其他方式请查看相关文字提示输入要抓取的宝贝地址或店铺地址到B抓取方式中,再点击“抓取该地址的商品”按钮,如输入的是某宝贝地址   

    选择抓取商品如图:一、可选择抓取整页商品二、抓取整店商品三、批量抓取商品四、按向导抓取商品其中三、四是回到之前界面选择其他方法抓取选择喜欢的方式抓取好商品

    选择好好开始下载商品,然后查看是否成功抓取该商品如显示抓取到的宝贝,则成功抓取

    转换商品类目(这一步如果是同平台的话请直接进入下一步进行参考)详细查看商品类目匹配的是否正确,如有问题可以手动去编辑或批量去编辑类目,

    转换商品详情查看商品详情是否转换正确,如出现属性没有转化正确,可以根据提示批量编辑宝贝的属性

    导出数据包请选择导出数据包位置、导出文件类型及商品描述图片处理方式,再点击“导出”按钮

    成功导出数据包

    注意这个数据包只能用商机助理来上传;在转换商品详情的时候记得多修改宝贝,让宝贝更美观,更个性化,以达到让客户看着更舒心,从而才能提高店铺转化!

  • ?

    阿里巴巴下一代数据集成技术

    九日

    展开

    内容来源:2017年7月8日,阿里云数加平台研发负责人王贲在“阿里云—数据化运营实践分享【上海站】”进行《阿里巴巴下一代数据集成技术》演讲分享。

    阅读字数:1689 | 4分钟阅读

    摘要

    数据集成是把不同来源、格式、特点性质的数据在逻辑上或物理上有机地集中,从而为企业提供全面的数据共享。在企业数据集成领域,已经有了很多成熟的框架可以利用。目前通常采用联邦式、基于中间件模型和数据仓库等方法来构造集成的系统,这些技术在不同的着重点和应用上解决数据共享和为企业提供决策支持。

    大咖演讲视频

    http://t/Rpij3u2

    数据工厂

    数据工厂解决了云上从数据的采集整合,到数据加工、分析与管理,再到数据应用和消费的整个流程。

    上图中红色标注部分是数据集成的位置。数据集成既是把数据采到数据平台部分的数据通道,也是数据出去的通道。

    中间就是所有数据的清洗转换、调度、OLAP分析以及数据挖掘的常用工具和模块。

    最底层是元数据管理,是一个至关重要的模块。

    传统数据处理有时候会叫做数仓,数仓是偏离线的。现在普遍叫数据平台,数据平台更强调它和在线系统的融合打通。

    如上图所示,极简罗汉图构建的体系就是数据工厂。大家要自己搭建一个大数据开发平台的话,这些是基础模块,也是必要的组件。

    最上面是调度,两侧有开发测试的环境,和整个大数据开发的运维管理。中间的“神经系统”是元数据,没有元数据所有东西都是无效的。再往下是整个大数据的计算引擎,阿里巴巴早就已经用完全自研的MaxCompute以及ADS等一系列的计算引擎替换了开源部分。最底下是数据集成,决定了数据怎么进来怎么出去。

    数据集成

    上图所示是数据集成的使用过程。从选择数据源、选择目标,到字段映射,然后进行通道流控的配置,最后就是看日志。

    现在的数据集成已经超出了传统数据集成的范畴,也就是说传统数据集成的“屁股”是坐在数据仓库上的,面向的是业务数据库,对于多媒体文件或整个任意文件的支持还是比较少。现在非结构化数据的比重越来越大,尤其在阿里云上看到这种趋势非常明显。所以我们做了任意二进制文件的支持和视频文件的支持。

    跨公网的数据传输是在云时代下一个非常重要的能力。当数据不在同城机房的时候,要想做一个简单的数据集成都需要跨公网把数据传输到统一的数据仓库中。

    数据集成agent-datax

    DataX是阿里巴巴集团内部被广泛使用的离线数据同步工具/平台,实现包括MySQL、Oracle、HDFS、Hive、OceanBase、HBase、OTS、ODPS等各种异构数据源之间高效的数据同步功能。

    DataX是一个插件式架构,可以插拔,支持读写插件。我们会坚持开源,现在已经有了一定的影响力。它的性能很好,功能和稳定性远超sqoop。最近使用的客户案例有微博、金立、斗鱼直播,效果突出。

    单机首先要把任务进行拆分,然后做到并发。也就是大家能看到的开源版本主要能力就在这里。

    我们服务端的模式支持水平扩展。

    阿里内部在大数据这一块数据采集和传输的主打工具就是DataX,所以它有更多的考虑。流控这方面操作还是有些难度的,很多开源工具不提供这种能力。

    数据集成在处理的时候有脏数据管理并记录,而且还有基于规则的判断,自动把日志打出来,做基本的质量控制。

    任意位置是指跨公网;任意存储是数据集成一开始就坚持的一种能力;还有正交数据采集传输。

    图中画的是从用户机房到阿里云上的VPC。在阿里云上一旦引入VPC就会使网络环境变得很复杂,当然也带来很多好处。但是复杂性尤其是对数据集成这种工具的体验是会产生很大影响的。

    我们为了突破这些也做了很多工作,现在我们可以从任意位置打透用户的机房以及阿里云上用户自己的VPC。

    数加.数据集成线上情况

    每天有11万+作业运行在DI平台之上,DI每天的同步数据量达到10.2TB。每天的同步记录条数达到近500亿,还在持续增长中。阿里自从做数据平台以来,数据集成一直是它的主力工具。

    数加.数据集成能力总结

    支持的类型多。支持任意主流格式和二进制数据、音视频、多媒体。

    传输快。在传输方面我们做了断点续传、分块传输和网络协议加速等工作,现在也取得了一些效果。

    网络通。能够穿透任意复杂的网络环境,例如从VPC到Region,还有跨公网。

    一站式迁移。现在在接触很多大客户的时候,很多客户不想再继续自己维护hadoop了,希望我们能完整地一键把整个hadoop体系迁移到云上,以及把DB迁移到云上。在这种情况下我们可以做到一些一站式的服务。

    还有两个更好的能力就是支持实时采集传输和支持客户端、Web端采集。

    我希望能把数据集成做到极致,做得更大。

    以上就是我今天的分享,谢谢大家!

  • ?

    [连载]《大数据之路:阿里巴巴大数据实践》之日志采集

    Peren

    展开

    D

    本内容出自《大数据之路:阿里巴巴大数据实践》,转载请注明阿里数据。点击阅读原文获取本章全部阅读信息。

    大数据之路

    阿里巴巴大数据实践连载

    作者简介

    阿里巴巴数据技术及产品部。定位于阿里集团数据中台,为阿里生态内外的业务、用户、中小企业提供全链路、全渠道的数据服务。作为阿里大数据战略的核心践行者,致力于“让大数据赋能商业,创造价值”。现在,阿里巴巴数据技术及产品部正通过技术和产品上的创新,探索全域数据的价值,将阿里在大数据上沉淀的能力对外分享,为各行各业的发展带来更多可能性。

    01

    本章内容摘要

    数据采集作为阿里大数据系统体系的第一环尤为重要。因此阿里巴巴建立了一套标准的数据采集体系方案,致力全面、高性能、规范地完成海量数据的采集,并将其传输到大数据平台。

    本章主要介绍数据采集中的日志采集部分,阿里巴巴的日志采集体系方案包括两大体系:

    1)Aplus.JS是Web端(基于浏览器)日志采集技术方案;

    2)UserTrack是APP端(无线客户端)日志采集技术方案。

    本章从浏览器的页面日志采集、无线客户端的日志采集以及我们遇到的日志采集挑战三块内容来阐述阿里巴巴的日志采集经验。

    02

    (1)页面浏览(展现)日志采集

    顾名思义,页面浏览日志是指当一个页面被浏览器加载呈现时采集的日志。此类日志是最基础的互联网日志,也是目前所有互联网产品的两大基本指标:页面浏览量(Page View,PV)和访客数(UniqueVisitors,UV)的统计基础。页面浏览日志是目前成熟度和完备度最高,同时也是最具挑战性的日志采集任务,我们将重点讲述此类日志的采集。

    (2)页面交互日志采集

    当页面加载和渲染完成之后,用户可以在页面上执行各类操作。随着互联网前端技术的不断发展,用户可在浏览器内与网页进行的互动已经丰富到只有想不到没有做不到的程度,互动设计都要求采集用户的互动行为数据,以便通过量化获知用户的兴趣点或者体验优化点。交互日志采集就是为此类业务场景而生的。

    除此之外,还有一些专门针对某些特定统计场合的日志采集需求,如专门采集特定媒体在页面被曝光状态的曝光日志、用户在线状态的实时监测等,但在基本原理上都脱胎于上述两大类。

    03

    无线客户端的日志采集

    众所周知,日志采集多是为了进行后续的数据分析。

    移动端的数据采集,一是为了服务于开发者,协助开发者分析各类设备信息;二是为了帮助各APP更好地了解自己的用户,了解用户在APP上的各类行为,帮助各应用不断进行优化,提升用户体验。

    无线客户端的日志采集采用采集SDK来完成,在阿里巴巴内部,多使用名为UserTrack的SDK来进行无线客户端的日志采集。无线客户端的日志采集和浏览器的日志采集方式有所不同,移动端的日志采集根据不同的用户行为分成不同的事件,“事件”为无线客户端日志行为的最小单位。基于常规的分析,UserTrack(UT)把事件分成了几类,常用的包括页面事件(同前述的页面浏览)和控件点击事件(同前述的页面交互)等。

    对事件进行分类的原因,除了不同事件的日志触发时机、日志内容和实现方式有差异之外,另一方面是为了更好地完成数据分析。在常见的业务分析中,往往较多地涉及某类事件,而非全部事件;故为了降低后续处理的复杂性,对事件进行分类尤为重要。要更好地进行日志数据分析,涉及很多方面的内容,如需要处理Hybrid应用,实现H5和Native日志的统一;又如识别设备,保证同一设备上各应用获取到的设备信息是唯一的。除此之外,对于采集到的数据如何上传,以及后续又如何合理处理等,每个过程都值得我们进行深入的研究和探索。

    04

    日志采集的挑战

    对于目前的互联网行业而言,互联网日志早已跨越初级的饥饿阶段(大型互联网企业的日均日志收集量均以亿为单位计量),反而面临海量日志的淹没风险。各类采集方案提供者所面临的主要挑战已不是日志采集技术本身,而是如何实现日志数据的结构化和规范化组织,实现更为高效的下游统计计算,提供符合业务特性的数据展现,以及为算法提供更便捷、灵活的支持等方面。

    这里介绍两个最典型的场景和阿里巴巴所采用的解决方案。点击[原文阅读]可阅读本章全部信息。

    1.日志分流与定制处理

    2.采集与计算一体化设计

    ▲数据处理全链路

    《大数据之路:阿里巴巴大数据实践》为2017年阿里巴巴数据技术及产品部集合了团队内多位数据一线工作者汇编而成,全面系统介绍阿里巴巴大数据系统架构。回复:书籍,可以获取相关购买信息。

    END

    阿里数据[AliData]_阿里数据中台官方账号

    大数据赋能商业创造价值

    阿里巴巴数据技术及产品部阿里数据中台唯一官方账号

    近距离了解数据在阿里的点滴进程

阿里巴巴数据采集器

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP