中企动力 > 商学院 > 阿里大数据平台
  • ?

    众智开发,阿里云赋能海纳天成物联网大数据平台

    Zhu

    展开

    5月23日,以“数字驱动中国”为主题的云栖大会·武汉峰会在武汉光谷希尔顿酒店隆重举行。大会聚焦IoT大数据、人工智能、物联网等蓬勃发展的科技生态为全景,探讨企业数字化转型之路,助力长江经济带发展,加速产业升级,以信息化培育新动能,新动能推动新发展,新发展创造新辉煌。

    作为本次云栖大会主论坛会议的一个重点,阿里云天池发布全球AI开发者计划,打造一站式人工智能知识共享平台,2年内培养30万AI工程师。同时,阿里云天池正式升级,成为从产业机会到实施交付一站式解决的产业AI众智平台。

    海纳天成作为智慧城市和物联网领域内合作伙伴代表受邀赴会,CEO赫时煊先生亲临现场,并参与了阿里云天池全球AI开发者计划的重磅发布。

    据了解,阿里云天池是一个面向全球人工智能专家及技术爱好者的众智平台,目前平台上活跃着全球范围内超11万技术爱好者、超100家大数据领域的创新创业团队。

    作为全球知名的大数据众智平台,阿里云天池沉淀了大量优秀的大数据创业团队。正式升级后,阿里云天池上将提供一站式定制化服务,包括覆盖金融、电商等行业的海量API接口、数据智能核心产品及各类产业生态的解决方案,帮助有大数据需求企业与大数据创业团队更快对接,发挥数据价值。

    作为阿里云天池生态的重要合作伙伴之一,海纳天成是中国电子旗下城市公共物联网领域的领军企业,以人工智能、大数据、云计算和区块链为技术核心,专门从事城市物联网基础设施的投资、建设和运营。海纳天成公共物联网大数据平台是基于中国电子自主可控技术安全标准和数据共享规范搭建开发的城市公共物联网AI大数据使能平台。该平台通过城市全域物联网采集的城市动态时空大数据,形成城市事件和行为数据分析应用基础应用。此次平台的深度开发主要实现了全域组网后物联网传感器设备数据接入、控制和管理,将视频与结构化数据进行不同形式组合,并在数据展示端展示。

    作为产业AI的拓荒者,阿里云天池越来越重视对产业的赋能作用。未来,基于阿里云强大的赋能作用,海纳天成将充分依托阿里云物联网云端平台和产业生态的强力支持,与阿里云共同构建“一城一云”的城市物联网整体解决方案和城市服务新模式、新业态,在全国范围内不断进行模式复制推广,带动物联网大数据产业生态的不断创新发展。

  • ?

    刚刚,阿里巴巴公布了一个大数据,刷新了全世界的想象力!

    吕乐天

    展开

    今天,阿里巴巴发布了一个让全中国人都竖起大拇指的账单—阿里巴巴平台商家公益账单!

    你知道吗?你在淘宝每买一件宝贝,就可能做了一次公益。据今天的公益账单显示,2017年阿里巴巴平台上通过公益宝贝产生捐赠的商家达到178万家——是2012年的16.4倍,善款总额达2.46亿元——是2012年的31倍,3.5亿买家支持,人均购买公益相关商品17次!

    可以看见,阿里平台卖家带动买家,参与公益已经呈现出“人人参与、日常参与”的特点。不仅如此,伴随中国电子商务服务向全球的延伸,阿里巴巴平台网商的爱心视野,也延伸到了海外地区,比如缅甸、埃塞俄比亚、苏丹等地区。

    据了解,在埃塞俄比亚,按照联合国的贫困标准,目前贫困发生率高达28%,也就是说很多人特别是儿童连吃饭都成问题!在苏丹,公立学校的学生绝大部分来自贫困家庭和难民家庭,在学校学习能不能吃饱都要打个问号!

    而国际微笑儿童项目就是通过公益宝贝平台支持的援助国际饥饿儿童的供餐项目!自 2015 年 6 月上线以来, 国际微笑儿童共通过公益宝贝平台筹集善款 657 万元!

    2015 年-2017 年,国际微笑儿童项目共为苏丹、埃塞俄比亚共计 13 所学校5842名学生免费提供食物,共计支出 575 万元,结余善款将继续用于供餐项目!

    不仅如此,据缅甸教育部 2013 年的数据显示,缅甸全国拥有大学生 60 多万人,其中50%也就是30万人,由于家庭经济困难,培养一个大学生可能要举全村之力,但是有的人连面对面上学都不能够,只能远程函授,而这些情况放在咱们中国,简直就是不可想象!

    由此,缅甸胞波助学金项目自 2017 年 3 月通过“公益宝贝”上线筹资,主要面向缅甸仰光省、曼德勒省全日制在校贫困大学生,已为 1100 名学生提供了助学金,每人每年(两学期)资助 2500 元人民币。更值得注意的是,近期微信的公众平台上线了一个叫做“财富到手”的服务平台,基础信用分500以上的用户就能申请1--3 0 万的额度,利息也是只有万分之三,随时申请随时下款,很多微信用户都在这个平台借钱,网友猜测这个很可能是蚂蚁金服放的大招。另外,仰光地区截至 2017 年 11 月底开展胞波同学会活动 5 场。

    在淘宝天猫买这么多年东西,从来不知道公益宝贝所筹的善款可以帮助这么多人,本身弯腰驼背坐在椅子上的小编一下子挺胸抬头了起来!

    据悉,如今的阿里平台上每6个卖家里,就有一个是公益人,并且他们还带动了四分之一的中国人做公益,怪不得有这么一句话,中国最大的公益群体是“亲”。

    最后,小编只想说,在阿里巴巴平台上当一位“亲”,可能是剁手多年一件最骄傲的事!

  • ?

    为什么阿里巴巴是大数据公司?

    木眼

    展开

    今天要跟大家说一下数据的价值以及如何衡量的问题。这两天我们一直在讨论阿里巴巴的价值,阿里巴巴现在已经不仅仅是一个电商公司,它实际上更是一个数据公司。

    为什么说阿里巴巴是一个数据公司?

    说阿里巴巴是一个数据公司是有原因也是有意义的。我们在使用淘宝天猫等产品的同时,阿里巴巴的服务器上会记载我们的一举一动,而这些都是需要优化的数据。

    比如,你今天在天猫上买了一个iphone8,那么天猫的后台数据就会推测你是不是要买一个苹果的手机壳,如果你没有买手机壳,那下一次在登陆淘宝或者天猫的时候就会在推荐页面出现手机壳。所以淘宝的后台周期预算是非常聪明的,这就相当于每一个人看到界面都是定制的,由此可见,阿里的智能运算已经是非常优化了。

    再比如,你现在想要买一个书柜,可是挑了很多种,最后确定在某几种之中反复挑,但是没有下单。这时候淘宝的后台就会在后面深度搜索、深度优化、深度学习,根据这些数据进行一个大数据的回归。就像我们在亚马逊上通常会看到“买了这本书的人也买了那本书”这样的推荐,同样的原理,当你在选择书柜但是没有下单的时候,平台数据会对比买了类似产品的人会更喜欢哪些东西,然后再根据用户的浏览记录和停留的时间,再向该用户推荐特定东西。

    (淘宝推荐页面)

    通过上面的例子,我们可以看出阿里巴巴实际上更偏向数据公司。

    这个数据是非常可怕的,因为它是不断演进的。十几岁买的东西和六十几岁买的东西是不同的,通过后台的这些数据,能够反应出在不同的时候都你喜欢什么样的东西。比如,一个人总买阿迪达斯的鞋,那就可以分析出这个人是阿迪的粉丝,就不会为其推荐安德玛和耐克;如果知道一个人喜欢Apple,就不会推荐三星,但是有一天这个人看了华为,它就可能开始为其推安卓的手机。

    阿里的数据不仅仅体现在这个方面,在阿里云中也有体现。云的服务是非常强大的,阿里云的市场也是一个上升的市场,市场存量越来越大,不仅仅是500强,很多中大型企业以及小型的企业也需要运算。

    云是什么东西呢?

    简单地讲,云是一个远端的服务器和一个存储的地方。它不仅仅是一个我们理解的把东西存储上去的云盘,更多的是远端的运算功能和一些功能的外包。所以“云”也是非常强大的。根据你的企业经营的范围,以及你的一些特性,通过一个数字化的处理进而能有更深层次的了解。比如做零售需要哪些模块,做游戏的需要哪些模块,做电商的需要哪些模块,卖汽车的需要哪些模块,卖手机的需要哪些模块等,这些都是云处理的常见模块。阿里会根据个人或者企业的消费习惯,给你推荐更有效的、最适合的云服务。

    数据的作用与估值

    一提到阿里就很容易提到京东,京东跟阿里到底是什么样的关系呢?

    这是一个复杂的问题,而且在每一个细分领域这两个公司的情况都是不一样的。今天就只是从数据的角度简单给大家分析一下。

    在讲解数据的作用之前,我们先做一个假设分析。比如,阿里的数据是京东的数据的两倍(零售或者金融等方面的数据),那么思考一下阿里巴巴的数据要比京东的数据贵多少钱呢?倍数关系是怎样的呢?

    为了估算方便,假设京东金融的数据是蚂蚁金服的二分之一(实际上要比这个少很多),蚂蚁金服是2,京东金融是1的话,那么蚂蚁金服的估值应该是京东金融的几倍?是2倍吗?一定不是,可能是20倍甚至200倍。这就好像把姚明和潘长江放到一起对比两者的篮球技术。虽然身高的对比我们可以直观的看出来,但是两个人的篮球技术绝对是无法通过身高的比例来衡量。

    同样的道理,放在蚂蚁金服和京东金融上也是一样的,数据越多,可做的事情就越多,如果数据是两倍,那么在估值方面远不止两倍,可能是几十倍几百倍的增加。当然,我们要知道,实际上蚂蚁金服和京东金融的数据倍数也不是2:1这么简单,虽然这是我们的假设,但是希望大家能明白这其中的道理。

    之前讲阿里巴巴是中国唯一一个真正闭环的企业,从零售、物流、金融到阿里云,这些东西都需要数据的积累,而阿里在这些方面都有布局,也都是核心业务,所以阿里是一个伟大的闭环公司。同时,我们在理解阿里巴巴的时候,要把它理解成一个数据公司,因为其真正的核心竞争力不是天猫界面多好看,也不是叫天猫还是叫京东,这都是门面上的差异,而真正的差异是后面的内核。京东本身是没有什么比较好的云服务,但是阿里有特别好的数据,所以阿里的估值,在同等条件下,会比京东高出许多。

    此外,还有一点,就是大家不要只看GMV。GMV全称Gross Merchandise Volume,在电商网站定义里面是网站成交金额,实际指的是拍下订单金额, 包含付款和未付款的部分。如果单看GMV数据,相信大部分企业都比不上火车站,因为火车一年能运几十万亿的东西,所以通过此数据来判断火车是否比阿里巴巴更有价值是不正确的。

    实际上,阿里巴巴是一个不断颠覆自己的公司,从当年的B2B,C2C,B2C到金融再到云等等,这个公司一直在不断的颠覆自己。现在它最基础的零售业也在不断的发生变化,比如阿里现在已经开了线下店“盒马鲜生”,大家可以刷脸刷信用,不断改变优化用户进店的体验。这些都是零售业已经或者正在发生的变化。

    作为一个数据公司,我相信会在将来出现很多我们还没有想象到的东西。随着物联网的进一步发展,未来阿里巴巴很可能会跟亚马逊一样布局智能家电。比如,你每天早晨起床智能家电就会给你反馈今天的天气,告诉你温度;或者为你测量体温,告诉你个人健康状况;又或者在你想喝啤酒的时候为你智能下单,帮助你选择等等。这不仅仅是一个单向的东西,它很可能会随着技术与消费体验的升级,变成一个咨询式的定制式的,并且随着你的心情、你的状态、你的各种情况而变化体验式服务。

    随着智能硬件的发展,这些事情将会逐渐发展成为现实,而如果阿里巴巴在未来的几年中对这方面有一个更好的布局,那它将会更加准确的成为一个数据公司,也会在这其中越来越接近我们的生活,或许有一天可能发展到大家都不需要去问百度了,只要去问各种智能硬件就好了。如果这真能实现,那将会是一个非常可怕的趋势。

    我们投资一定要跨过自己的“障”,要有自己的想象力。就像手机一样,诺基亚的手机其实没有任何问题,为什么现在没人用了?因为手机现在不仅仅是一个通信工具,更大程度上是一个便携的移动工具和娱乐工具,更大的功能是完成娱乐与沟通。

    同样的,阿里巴巴在很大程度上抓住了一个大趋势,逐渐成为一家数字化公司。未来我们消费趋势可能不仅仅是“我想要什么”,而是阿里觉得“你是否需要这个东西”,因而给你智能推荐。从数据的分析和发掘的角度讲,可能其他公司都会比阿里差很多。作为一个闭环的数据公司,阿里巴巴未来的核心竞争力会非常大,这也是我们能从数据分析中得出来的结论。

    本文章来自职业说内部课程,已获得职业说导师授权,转载请注明出处。

  • ?

    利用百度和阿里大数据,创业成功率提高60%以上,干货分享!

    小丫头

    展开

    很多人都说你的项目是市场刚需,是人的刚需,只是别人没有看到,只有你看到。现在物欲横流的社会中几乎没有什么产品是刚需,或是你想象中的伪刚需罢了。99.99%产品都是供大于求!

    也有很多人在创业过创中或者选择项目过程都是和身边的几个朋友简单聊一下或简单的看一下市场就直接ALL IN(全部投入进去)这样取样的方法:

    不科学不客观取样太少朋友不会用太伤害你的话告诫你的教你两步就可以看出来这个行业或产品的市场占有率和同行业竞争率,

    利用大数据(百度竞价系统和阿里指数或生意参谋)

    为什么要用他们两个呢利用大数据(百度竞价系统和阿里指数或生意参谋)?

    因为一个是搜索端大数据,另一个是电商端大数据!

    这两个流量可以直接反映全中国的市场行情和人们的生活需求。

    第一.利用百度竞价系统就可以看出来你这个产品有多少人天天在点击在搜索。

    百度蜂巢系统

    这个是百度关键字分析师系统,他可以准确的告诉你!

    百度竞价分析师

    你这个关键字每天大概有多少人点击什么样的词是热词,什么是黑马词,什么样的是周末好词有多少人通过手机搜索的到这个关键词的,有多少人通过电脑搜索的到这个关键词的。每个城市有多少人搜索,也就是说全国这个词或这个产品热不热如果这个词在你们本省本市没有多少人访问那么说他并没有多少市场和需求,你就要小心了!这可能是创业的坑。

    第二. 阿里指数或生意参谋

    阿里指数 是了解电子商务平台市场动向的数据分析平台。根据阿里巴巴网站每日运营的基本数据包括每天网站浏览量、每天浏览的人次、每天新增供求产品数、新增公司数和产品数这5项指标统计计算得出。”

    阿里指数

    行业大盘:主要包括市场行情、热门行业、企业分析。以某个行业为视角进行分析。

    市场行情:市场的综合趋势,价格、采购、供应的趋势

    热门行业:各种热门细分子行业的分析,并对各个子行业做出排序 企业分析:针对某个行业下的供应商、采购商根据他们的交易情况分等级,用于表明此行业的大小企业的占比情况。

    全国什么地区什么区卖的好

    行业人群分析,有多人男的多少女的,什么样的星座爱购买。

    在淘宝上搜索指数,指数越高需求越大

    何为生意参谋?

    生意参谋集数据作战室、市场行情、装修分析、来源分析、竞争情报等数据产品于一体,是商家统一数据产品平台,也是大数据时代下赋能商家的重要平台。

    大数据时代,生意参谋要为商家解决哪些痛点?

    一、看数据难、用数据难。数据之间存在不一致性,这种不一致性大大提升了商家看数据的门槛。

    二、数据难懂。数据本身就是门槛,在这个门槛之上,如果提供给商家的数据不标准、不统一,要想读懂难上加难。

    三、商家渴求更全面的数据。商家关注的数据往往来源于多个渠道,不同渠道的数据能否很好地集成在同个平台上,也令人困扰。

    近年来,生意参谋一直致力解决此类难题。基于阿里巴巴全域数据资产层,以及陆续整合量子恒道、数据魔方等的基础上增值创新,生意参谋已经逐步升级为商家端统一数据产品平台。通过生意参谋,商家可以看到口径标准统一、计算全面准确的店铺数据和行业数据,从而成为商务决策的参谋。

    生意参谋

    有了这两个工具,你是不是感觉你的创业成功率瞬间提高10倍以上!

    你可以利用百度大数据为你的网络营销做准备,可以利用新闻和问答做引流。因为你知道什么样的关键字是用户经常搜索的。

    同时你也可以利用阿里指数和生意参谋为你的产品人物精准画像,你就会知道是什么样的人买你的产品,是男是女,多大年龄什么星座的?什么地区地域卖的好,谁是你的对手他们一个月卖多少货?各种分析。希望大家创业成功!

  • ?

    用阿里大数据,攻陷淘宝钻展平台!深知科技CEO陈辉搞大了

    新之

    展开

    作者: 王思齐

    来源:Xtecher

    原标题:深知科技CEO陈辉: 玩转消费级大数据,用广告撕开营销自动化的口子

    拥有消费级大数据,是深知科技的核心资产和致胜秘笈。那么,如何能成为营销界技术最好的公司,并拥有自己的技术壁垒,能够帮助商家把整套市场营销体系搭建起来,最终成为数字化营销的巨头。

    陈辉坚信,营销自动化领域的竞争,最终落脚到对消费级大数据的掌握和分析的技术竞争。数据资产之上,企业营销的高楼才能拔地而起。

    在大数据和人工智能相融合的时代,绝大多数非科技公司,仍尚未迈出营销自动化的步伐。数据显示,2016年,在B2B领域营销自动化收入增长达到60%。其中97%为科技公司。随着Adobe、IBM等科技巨头将目光投向营销自动化,这个具有相当潜力的领域,已然成为新的风口。

    深知科技(杭州深知科技有限公司)作为营销自动化领域的先行者,CEO陈辉要做的,就是在中国市场爆发前夕,依托人工智能技术,快速完成市场布局。

    深知科技从阿里的广告生态切入,以针对钻展平台的产品深钻,为线上商家提供精准广告投放,并将可行的技术与模式推及各个线上平台,布局营销自动化市场。

    最为关键的则是,在这个过程中,挖掘消费级大数据的巨大宝库,为企业提供数据支持和数据化服务。

    陈辉坚信,精准投放广告,仅仅是营销生态中的重要一环。深藏在技术和算法之后,海量消费级大数据的挖掘、分析和利用,才是营销自动化的真正战场。

    让数据活起来

    2014年,决定回国时,陈辉已在谷歌广告部门工作了3个年头。彼时国内互联网行业飞速发展。这位毕业于德克萨斯大学电子计算机工程的博士敏锐察觉,新的可能正在大洋彼岸酝酿。

    作为世界最领先的技术公司,谷歌80%、90%的收入来自于广告。陈辉在世界最领先的技术公司扎根后方,一方面负责用户画像,即利用搜索引擎、浏览历史和用户地理位置定位,挖掘用户兴趣和偏好从而进行分类,实现广告精准投放。

    另一方面,陈辉所在的小组还开发了谷歌色情分类器,以识别色情、暴力、种族主义等不良信息。分类器不仅防止少儿接收不良信息,也为品牌规避不适宜进行广告投放的页面。

    在谷歌工作的经历,让陈辉深谙机器算法对精准广告投放的意义。与国内如火如荼的创业大潮遥相呼应,他心中的创业梦想也开始发芽。

    机会在2014年到来。陈辉接住了阿里集团的橄榄枝,回国加入阿里广告部门阿里妈妈,担任高级专家,继续深耕广告领域。

    和谷歌类似,阿里的收入中60%来自于广告。其广告业务分为搜索广告“直通车”和展示广告“钻石展位”。陈辉负责展示广告的算法和创新。

    这一次,摆在陈辉面前的,是阿里尚未完全挖掘和利用、不亚于谷歌的巨大数据金库。除了海量的电商数据,阿里生态矩阵中的媒体、支付应用、视频网站,以及众多达成战略合作的公司和机构,均成为高质量的数据来源。

    如何让数据活起来?陈辉瞄准这片宝藏,全力“把阿里集团这些数据打通,通过算法和机器学习,取得更好的广告投放效果。”

    自动化智能营销工具“阿里魔镜”,是陈辉做出的一次成功尝试。阿里魔镜将商家自有店铺数据、所在垂直行业数据及全网大数据纳入模型分析,帮助商家精准圈定潜在客户,提升客户规模。

    消费者数据和商家数据“活”了起来。阿里魔镜上线后,成效异常显著。“阿里展示广告平均点击率由2%提升到14%,广告投入产出也上升到原来的两倍。”

    只轻轻一点,就能自动为广告主提供完整、高效的客户管理营销服务——营销自动化的时代已经到来。

    手握技术,怀揣梦想,在阿里经历两年的磨练后,陈辉熟悉了国内互联网环境,并积累了行业领域的资源,对商业模式的思考也愈发深入。时机渐渐成熟,陈辉开始迈出新的步伐。

    撕开营销自动化的口子

    踏上创业之路。2016年4月,离开阿里后,陈辉与同事创立映兔科技,经营视频业务,但业务推进并不顺利。

    如果改变创业方向,突破口在哪里?

    与此同时,广告行业的痛点依旧在陈辉心头徘徊。

    陈辉意识到,谷歌和阿里的广告部门,都是从平台角度出发,致力于优化平台收益及精准定向效率。商家的角色和投资诉求,则在大平台的目标下被悄然弱化。

    两年间,中国互联网广告市场规模达到2000多亿元人民币,到2018年这个数字将达到4000亿。和不断扩大的市场规模相对应,广告行业的变革则相对缓慢。

    在传统广告行业中,投资回报率(ROI)的优化,更多依赖广告投放人员的项目经验。而优秀的营销人员可谓凤毛麟角。

    以阿里的钻展平台为例,广告投放时,商户需要考虑四个因素:定向、广告位、创意和出价。四个因素组合,有三千多万种可能性。即使是少数最顶尖的广告投放人员,也只能依靠特定店铺的有限数据,结合自身经验,进行投放判断和决策。

    陈辉在谷歌和阿里的经验已然证明,广告投放本质上依旧是数据化运营。面对三千万这样庞大的数字,相较传统的人工判断,利用机器进行数据分析和决策,无疑是更加高效可靠的选择。

    由此,陈辉将自己的目光锁定在营销自动化领域。延续从谷歌和阿里获得的经验,只不过,这一次他从广告主的利益和诉求出发,打开新的突破口。

    2017年1月陈辉告别映兔科技。2月,深知科技成立,并很快获得数百万美元天使轮投资。

    深知科技创始团队多是原来阿里的同事,在算法领域造诣深厚。另一位合伙人唐陈俊,是陈辉在中科大的本科校友,在华为浙江联通部担任部长,拥有12年销售经验。

    第一款产品深钻在今年七月落地。深钻针对淘宝平台打造,为钻展用户提供广告一键投放服务。首批客户涵盖女装、男装、美容、家居等主要行业。

    利用“深钻”如何实现广告精准投放?“商户在淘宝的服务市场找到深钻,注册登录后即可免费试用15天。只需输入广告预算和营销目标,深钻便可通过人工智能的方式,在两三天内,从数千万种组合中寻找最优选择,帮助商户自动地做广告投放,提高营销效率。”

    此外,前期积累的经验和资源,在深钻上线时派上了大用场。深钻与阿里妈妈达成战略合作。阿里妈妈开放部分API,将消费者在淘宝平台上搜索、浏览店铺等海量行为数据,以及阿里相关的一些数据媒体矩阵及合作公司的数据,提供给深钻使用。其数据迭代效率也较高,达到每15分钟一次。

    随着用户数据增加,深钻的营销精准度也不断提升。深钻采用深度学习算法Q-Learning,根据反馈回来的投放数据实时修改模型和策略参数,不断优化广告投放策略,从而实现整个产品的自主学习进步。

    强化学习与大数据相结合,一键式便捷操作,深钻为商家带来的效益立竿见影。以某TOP家居品牌的天猫店为例,试用深钻一星期,其店铺的收益就增加45万,在原营收基础上提高10%以上。ROI由原来的3左右提升到15左右。

    深钻也为小体量商户带来了新的用户体验。小商户缺乏专业的营销知识与技能,其投入产出比往往不尽如人意。通过深钻实现精准投放,能让这部分商户,以有限的预算获得最大效益。

    陈辉的短期目标是,在淘宝平台上,以深钻打通淘宝所有垂直行业,覆盖到一万家商户。目前淘宝钻展平台拥有五万商户,并以40%到50%的速度增长。深钻将与淘宝原有的钻展形成互补,为商户提供精准营销服务。

    同时,陈辉希望用半年的时间,将淘宝平台的营销自动化服务做扎实。接下来最重要的事,将进一步强化产品能力。除了深耕深钻的算法,下一步,深知科技还将针对阿里的搜索广告平台直通车开发新产品。两款产品,对应阿里两个广告平台。

    为此,淘宝这块消费数据的巨大宝库,也将为深知科技的发展打下坚实基础。

    挖掘消费级大数据的多种可能

    落地仅两个月,深钻如今已服务六十余家商户。这个数字正以每周数十家的速率加速增长。陈辉预计,年底营收能达到数千万。

    作为一家初创企业,深知科技已成功实现自我造血。这让陈辉对企业的发展能力和速度以及即将进行的融资都充满信心。

    同时,服务商户数量不断增加,要求深钻产品能承载巨大的数据体量。“这个量主要是两部分,第一部分是存储规模,第二是计算能力。”平均每个店铺数据在100万左右。实现一万家商户的目标,后端承载体量则在百亿级。深钻后端目前已具备相应的承载能力。

    深钻在淘宝平台的初露锋芒,印证了陈辉的观察和判断:营销自动化是未来的趋势。这不仅适用于淘宝平台,也适用于整个营销行业。

    陈辉下一步的主要目标是在各消费平台快速布局。“在淘宝生态中继续深耕的同时,深知科技计划将技术和产品渗透并迁移到其他平台。深知的底层技术较为通用,这为拓展平台提供了便利和可能性。”

    陈辉明白,投放仅仅是整个营销环节中的一步。将最终的目标定位广告优化,而从用户首次看到广告,到最终实现成交,其中涉及诸多环节,并非单纯靠广告就可以解决。

    “我们可能不是只做简单的营销、广告投放这一块,而是在营销这个领域,利用数据,利用数据分析带来更大的价值。” 深知科技的野心也不仅限于精准广告投放。

    “举个例子,比如创意本身的制作,用户到店看到店铺的整体情况,他的浏览路径,包括店铺发货情况等。我们可以给他一个预测。当主要新客是通过广告进来的时候,你可以根据你的预算,判断你这个月可能需要储备多少货物。我们也会告诉你哪种货物比较好卖。”

    对店铺运营情况的了解,都将基于深知科技对百亿级消费大数据的掌握和分析。“我们最开始就有数据,这些数据可以随着他的运营,流转到运营中的所有环节。” 企业的精细化运营必然需要数据化运营提供更多的支持。深知科技希望扮演的,是为企业的决策者提供决策辅助的角色。

    陈辉希望,深知科技沿着数据服务公司的方向发展下去。首先,能成为营销行业内技术最好的公司,拥有自己的技术壁垒和数据能力。“只有技术上领先,才有长期领先的可能性”。,

    在此基础上,成为营销自动化领域的旗帜。“不光是在电商这一块,在线上线下可以有很多新的尝试。”从线上扩展到线下,不仅在软件领域,在硬件方面也可能有新的突破。

    技术与数据均掌握在手,陈辉最终希望,能帮助商家把整套市场营销体系搭建起来。

    营销行业的竞争,最终落脚到基于消费级大数据的技术竞争。“就是比谁的数据更多,谁的数据更精准,谁的数据分析能力、策略需求的能力更强。最终比的是数据之上的战略分析。”数据资产之上,企业营销的高楼便能拔地而起。

    拥有消费级大数据,便是深知科技的核心资产和致胜秘笈。

  • ?

    阿里大数据工程师:教你如何快速的搭建数据库

    棱角

    展开

    本文来源:大数据工程师(今日头条作者)原文链接:https:///a6508682747257553411/

    数据仓库,是为企业所有级别的决策制定过程,提供所有类型数据支持的战略集合。它是单个数据存储,出于分析性报告和决策支持目的而创建。为需要业务智能的企业,提供指导业务流程改进、监视时间、成本、质量以及控制。

    下面我们来讲大数据开发核心流程。

    当我们接到一个需求,首先会进行需求分析,然后做工作流设计,比如这个任务是什么时候跑的、依赖于哪些业务。工作流设计完成后进行数据采集和数据同步。接下去就是数据开发,我们提供了WEB-IDE,支持SQL、MR、SHELL和 PYTHON等。然后我们提供了冒烟测试的场景,测试完成后发布到线上,让它每天定时进行自动调度,并进行数据质量监控。以上步骤都完成后,就能把我们的数据环流到业务系统库,或者用QuickBI、DataV这些工具进行页面展现。

    我们设计的任务是离线的,每天会在12点的时候把设计的任务变成一个实例快照。目前我们的任务依赖在业内也是最先进的。

    现在最常见的需求就是每天有日报,每周要写周报,每月要写月报。为了节省资源,就可以使用日报的数据直接转成周报或月报。

    线上系统在每天6点的时候要保证数据已经回笼到业务系统,系统要开始使用了。

    如上图所示,假设有D和E两个任务,它们依赖于B和A。任务D的运行时间是1.5小时,E是2小时。我们必须确保B每天在4点之前把B的任务运行完成,一般正常运行时间是2小时。那就要保证A每天任务完成的时间不晚于2点。如果A的运行时间是10分钟,到1点的时候发现A的任务失败了,这时就能计算出A还剩下多少余量,我们可以进行人工监督排查。在1:50之前人工介入,从而保证任务D和E能在6点前准时产出。

    总结

    如图所示,MaxCompute是图上小人的“心脏”,所有运行的任务都在MaxCompute里面。调度是数据架构的“大脑”。“眼睛”是数据监控,目前在数据架构平台上它还是一个“近视眼”,还没有正式推出。数据集成就像两只“手”,不停地从其它地方搬运数据。底层的开发环境和运维中心就像两条“腿”,保证整个数据架构平台走得更远。而数据质量就像是一个“人体健康中心”,也就是数据质量的监控。

    程序员必备的碎片化学习神器牛X公司的开会方式,明天开始参照执行女程序媛与男程序猿的一天火爆全球的区块链到底是怎么一回事?一文带你看懂对开发来讲,业务重要还是技术重要?

  • ?

    阿里三大数据存储技术抢先看

    心恒动

    展开

    过去 10 年,随着互联网技术的快速发展,数据库呈现井喷式发展,出现了各式各样的产品,如文件存储数据库、列存储数据库、NewSQL 数据库。之所有如此,归结于数据量不断快速膨胀,传统数据库在大数据上的处理性能不能满足需求等。企业和开发者趋于去针对不同应用类型开发不同的数据库,来满足对特定数据处理的需求。

    阿里巴巴在多种场景下同样有不同的数据存储技术实践,比如:

    海量数据场景下的 OLAP 列式数据库 —— HiStore

    HiStore 是一款基于独特的知识网格技术的列式数据库,定位于海量数据高压缩比列式存储,是低存储成本,低维护成本,海量数据 OLAP 存储引擎;有效的解决了海量数据存储的成本问题,以及在百亿数据场景下支持实时高效的多维度自由组合的检索。适用场景:

    日志/事件管理系统:调用链路日志跟踪,消息轨迹分析,系统/网络安全审计记录;

    通信行业:话单分析,用户行为分析等;

    大数据量的分析应用:网页/在线分析,移动分析,客户行为分析,营销和广告数据;

    数据仓库/数据集市:实时展示统计分析后数据,便于用户根据统计结果做决策;

    对数据存储成本敏感,查询有实时性要求的场景应考虑HiStore;

    物联网:保存大量物理节点的采集上报,状态等信息,用于后期统计处理;

    历史评价数据,历史订单数据等。

    高性能时间序列数据库 —— HiTSDB

    HiTSDB 是阿里自主研发的面向物联网及相关领域的高性能时间序列数据库产品,支持每秒1000万时序数据点写入;具备PB级别的数据存储能力,提供高效压缩算法,整体存储成本降低90%;提供时序数据插值计算,降精度计算,时间纬度聚合计算,空间纬度聚合计算的能力。主要解决以下问题。

    大规模的物联网设备的时序数据高并发写入;

    低成本的存储;

    灵活高效的数据分析能力。

    在线海量数据处理分布式数据库 —— Lindorm

    Lindorm 是新一代面向在线海量数据处理的分布式数据库,目前公布的资料不多。在 10 月 11 日- 14 日杭州云栖大会的“互联网新型数据库专场”上,阿里将公布 Lindorm 更多技术详情。届时,阿里的技术专家将通过分享这些多种场景下的数据存储技术实践,帮助企业更好地理解各种数据存储技术的特点,针对自己的业务发展对数据存储技术进行选择和组合。

    原文地址:http://linuxprobe/aliyun-databases.html

  • ?

    阿里如何实现秒级百万TPS?搜索离线大数据平台架构解读

    士萧

    展开

    阿里妹导读:搜索离线数据处理是一个典型的海量数据批次/实时计算结合的场景,阿里搜索中台团队立足内部技术结合开源大数据存储和计算系统,针对自身业务和技术特点构建了搜索离线平台,提供复杂业务场景下单日批次处理千亿级数据,秒级实时百万TPS吞吐的计算能力。

    背景

    什么是搜索离线?

    一个典型的商品搜索架构如下图所示,本文将要重点介绍的就是下图中的离线数据处理系统(Offline System)。

    何谓离线?在阿里搜索工程体系中我们把搜索引擎、在线算分、SearchPlanner等ms级响应用户请求的服务称之为“在线”服务;与之相对应的,将各种来源数据转换处理后送入搜索引擎等“在线”服务的系统统称为“离线”系统。商品搜索的业务特性(海量数据、复杂业务)决定了离线系统从诞生伊始就是一个大数据系统,它有以下一些特点:

    1. 任务模型上区分全量和增量

    1)全量是指将搜索业务数据全部重新处理生成,并传送给在线引擎,一般是每天一次。这么做有两个原因:有业务数据是daily更新;引擎需要全量数据来高效的进行索引整理和预处理,提高在线服务效率。

    2)增量是指将上游数据源实时发生的数据变化更新到在线引擎中。

    3)性能方面有较高要求。全量需要极高吞吐能力,确保数以亿计的数据可以在数小时内完成。增量则需要支持数万TPS秒级的实时性,还需要有极高的可用性。

    2. 需要支持多样化的输入和输出数据源,包括:Mysql,ODPS,TT等各种数据库和消息队列作为输入,搜索、Ranking、图、推荐等各种引擎作为输出。

    3. 需要提供一定能力的数据处理能力,例如多表Join、UDTF支持等,以方便搜索业务的开发和接入。

    在后续的段落中我们会看到离线系统架构围绕着这些特点,针对搜索业务的变化,做出的各种演进和发展。

    发展简介

    阿里商品搜索体系肇始于淘宝搜索,大约在2008年初第一代搜索系统诞生,离线系统随之上线。搜索离线系统经历多年发展,技术架构几经迭代,数据处理能力、业务支持能力不断提升。下面会分阶段介绍搜索离线的主要技术架构和特点。

    ★ 淘宝搜索阶段

    在2008-2012这个阶段,我们重点支持淘宝搜索的业务发展,随着淘宝商品量的不断增加,逐步引入Hadoop、Hbase等开源大数据计算和存储框架,实现了搜索离线系统的分布式化,有力地支持了淘宝搜索业务的发展。但是在这个阶段,我们支持的业务线只有淘系合计不到5个业务线,为此投入了大约10名开发人员,整体效率不高。另一方面相关系统框架代码与淘系业务高度耦合,量身定制了很多特殊代码,不利于架构的推广和其它业务的支持。

    ★ 组件&平台化阶段

    2013年底以来,特别是最近两年,随着集团技术业务线的梳理以及中台化战略的推行,搜索离线系统需要为越来越多的不同业务团队(飞猪、钉钉、1688、AE、Lazada等等)提供支持,技术框架复用、开发效率提升和平台化支持的需求越来越强烈。另一方面随着大数据计算、存储技术的发展,尤其是流计算引擎的飞速发展,离线系统技术架构上的进一步演进也具备了绝佳的土壤。

    我们可以看到整个搜索离线系统的演进是沿着性能和效率两条主线,以业务和技术为双轮驱动,一步一个脚印的走到今天。这是一个技术与业务高度融合互动,互相促进发展的典型样例。

    离线平台技术架构

    上一节我们简要介绍了离线系统的发展历史,也简要提到技术架构的演进,下面将会把离线平台的技术架构展开介绍,主要分为平台流程以及计算和存储架构等几个方面。

    平台组件和任务流程

    上图描述了离线平台技术组件结构,其中部分组件的简介如下:

    Maat:分布式任务调度平台,基于Airflow发展而来,主要改进点是调度性能优化、执行器FaaS化、容器化、API及调度功能扩展等四个部分,在保持对Airflow兼容的基础上,大幅提升性能,提高了稳定性。 一个离线任务的多个Blink job会通过Maat建立依赖关系并进行调度。Bahamut:执行引擎,是整个离线平台的核心,负责离线任务的创建、调度、管理等各种功能,后文会详细介绍。Blink:Flink的阿里内部版本,在大规模分布式、SQL、TableAPI、Batch上做了大量的优化和重构。离线平台的所有计算任务都是Blink job,包括stream和batch。Soman:UI模块,与Bahamut后端对接,提供任务信息展示、状态管理等可视化功能,也是用户创建应用的开发业务逻辑的主要入口。Catalog: 存储表信息管理,提供各种数据源表的DDL能力,负责离线平台存储资源的申请、释放、变更等各种功能。Hippo:阿里搜索自研的分布式资源管理和任务调度服务,类似于Yarn,提供Docker管理能力,主要服务于在线系统。Swift:阿里搜索自研高性能分布式消息队列,支持亿级别消息吞吐能力,存储后端为HDFS,存储计算分离架构。

    下图则描述了一个离线任务从数据源到产出引擎服务数据的整个过程,流程图分成三层:

    数据同步层:将用户定义的数据源表的全量和增量数据同步到Hbase内部表,相当于源表的镜像。这个镜像中我们包含cf和d两个列族,分别存储数据库的镜像和Daily更新的数据。数据关联计算层:按照数据源中定义的各种关系,将不同维度的数据关联到一起,把数据送到自定义的UDTF中进行处理,产出引擎所需的全量和增量数据。数据交互层:提供全量和增量数据的存储信息,与在线服务build模块进行交互。

    全增量统一的计算模型

    那么如何实现对用户屏蔽离线平台内部的这些技术细节,让用户只需要关注业务实现呢?回顾第一节介绍的离线任务概念,离线任务包含全量和增量,它们业务逻辑相同,但是执行模式上有区别。为了让用户能够专注业务逻辑的开发,屏蔽离线平台技术细节实现全增量统一的计算逻辑,我们引入了Business Table(业务表)的概念。

    Business Table(业务表):Business Table是一个抽象表,由一个全量数据表和/或一个增量流表组成,全量/增量表的Schema相同,业务含义相同。

    基于业务表和数据处理组件,用户可以开发出一个描述离线处理流程的业务逻辑图,我们称之为Business Graph。下图就是一个Business Graph的样例,其中上侧红框标识的就是只包含ODPS全量数据源的Business Table,最下方红框中标识的是包含Hdfs+Swift的Business Table,除此之外我们还支持Mysql+DRC/ODPS+Swift等多种业务表的组合。图中还可以看到Join、UDTF等常用的数据处理组件,业务表与处理组件结合在一起就能够描述常见的离线业务处理逻辑。

    那么如何把这个Business Graph转化为真正的离线任务呢?Bahamut作为离线平台的执行引擎,会按照Business Graph->APP Graph->Job Graph->(Blink Job/Maat Job)的顺序把一个业务描述转化为可执行的离线任务,具体如下:

    1. Business Graph->APP Graph:在这个环节中我们主要有2个重要的工作:

    1)正确性校验:根据BG中的节点信息,校验节点间连接的合法性(例如两个输入源节点不能直接连接)、节点配置的正确性(数据库配置/ODPS的配置是否正确)、Schema推导是否正确。

    2)任务分层优化:为了用Blink Stream模式来统一完成全量和增量的执行,我们需要将输入源数据存入内部Hbase,直接使用Blink维表Join功能来完成数据的连接。于是在节点遍历过程中遇到Join、Merge组件时,需要在AppGraph中插入一个内部的HTable节点,将Merge或者Join上游的数据同步进入Hbase。

    2. APP Graph->Job Graph:JobGraph是一个Blink/Maat任务的配置DAG,其中每个节点包含配置信息,可以在后续的过程中直接转化为计算或者调度任务。

    1)Blink JobGraph:从数据源业务表节点开始遍历AppGraph,每当碰到一个内部HTable节点时,会生成两个(增量/全量)同步层的Blink JobGraph。所有同步层Blink JobGraph生成后,以所有的内部HTable/queue为输入,生成两个(增量/全量)关联处理层的Blink JobGraph。

    ①同步层:采用Business Table中的全量/增量表配置,分别生成全量和增量的Blink任务配置,描述把数据从数据源同步到内部HTable过程。例如对于Mysql+DRC的表,全量阶段将会从mysql中拉取全表数据并转化为HFile bulkload到HTable中,增量阶段则是从DRC中拉取变化数据,直接写入HTable,并根据需求写入驱动queue。②关联处理层:关联多个HTable,生成大宽表后调用UDTF处理,产出最终的进入引擎的数据。同样需要分别生成全量和增量任务配置2)Maat JobGraph:基于Maat的调度任务描述DAG,主要目的是将各个层次的Blink任务按照依赖进行调度,同时执行特定的脚本完成与外部系统的交互等职责。一般来说一个离线任务会生成Build/Publish/Stop/Release等多个Maat JobGraph。3. Job Graph->Blink/Maat Job:遍历JobGraph,调用Translator将JobGraph转换为Blink/Maat的任务代码。引入JobGraph的目的是将底层的计算引擎与计算任务描述解耦,例如:我们底层的计算引擎曾经是MapReduce +Blink-1.4-TableAPI,最近刚完成了Blink-2.1 基于SQL的升级,我们所有的工作基本上是重写了一套Translator,对上层的代码结构没有任何变动。

    经过了上述的三个步骤,我们完成了BusinessGraph(业务描述)到Blink/Maat job的转化,生成了若干数据同步/处理的Blink job,以及将这些Blink job进行依赖调度的完成不同功能的Maat job。特别的针对搜索离线的场景,在调度流程中加入了大量与下游引擎交互的逻辑,包括24小时不间断增量、触发引擎消费数据、切换引擎消费增量queue等重要的业务流程。

    存储与计算

    ★ 基于Hbase的存储架构

    搜索离线大约在2012年即引入了Hbase作为数据的存储引擎,有力的支持了搜索业务从淘宝主搜到离线平台的整个发展历程,历经多次双11考验,稳定性和性能都得到明确的验证。从功能层面,搜索离线引入Hbase的原因主要是以下几点:

    通过Scan/Get可以批量/单条的获取数据,通过bulkload/put可以批量/单条的导入数据,这与搜索的全量/增量模型完全吻合,天然适合支持搜索离线业务。底层存储基于HDFS,LSM-Tree的的架构能够确保数据安全性,计算存储分离的架构保证了集群规模水平可扩展,易于提高整体的吞吐。通过单机性能优化(Async、BucketCache、Handler分层、Offheap)和集群的扩容,确保了业务大幅增长时,存储从来没有成为系统的瓶颈。Free Schema的特性能够很好的应对业务数据频繁变化的情况,也能够方便支持一些特殊业务场景的数据逻辑。

    通过引入Hbase做为离线系统的内部数据存储,我们成功解决了每天全量时对上游Mysql造成很大压力的问题,大幅度的提升了整体系统的吞吐。数据存储到Hbase也是全量任务向流式处理流程转型(MR->Stream)的基础,而这一点为后来Blink流引擎在搜索离线的孕育和发展也埋下了伏笔。

    当然Hbase也不是毫无缺点,JVM内存管理的痼疾、单机Handler打满导致雪崩、缺乏容器化部署能力等也带来了不少烦恼,很快我们就会替换Hbase为阿里内部发展的另外一套存储引擎,期望能够部分的解决这些问题。

    ★ 基于Flink的计算架构

    2016年中,搜索离线逐渐开始引入Flink作为计算引擎,重点解决搜索实时计算场景碰到的大量问题。在社区Flink版本的基础上,实时计算团队开发了Blink,增加原生yarn模式、Incremetal checkpoint等若干解决Flink大规模分布式运行问题的特性,另一方面,在DataStream/DataSet接口的基础上,进一步加强了TableAPI和SQL的功能,真正统一了Stream和Batch的调用接口,并实现计算业务逻辑的sql化开发模式。

    离线平台是Blink的早期使用者和开发者,从0.8版本开始经历了多个Blink版本的升级和变迁,先后使用了DataStream、TableAPI和SQL作为任务接口,同时也开发了大量Connector以支持不同数据源之间的交互。目前离线平台已经在使用最新的Blink-2.1.1,Bahamut利用SqlTranslator直接生成SQL来描述任务逻辑,通过Bayes(Blink SQL开发平台)服务化直接提交任务到不同的Yarn集群,这样做有以下几个明显的优势:

    采用SQL来描述Blink任务业务逻辑非常清晰,可以直接利用Blink提供的各种Operator完成数据处理,方便任务的调试,例如:dim join、groupby,而不是在Datastream时期需要自行编写完成类似Hbase Join的Operator。Blink 2.1原生支持Batch,采用Batch模式可以直接完成生成HFile的任务,下线MR任务,彻底统一计算引擎到Blink。Batch模式任务执行时采用分阶段调度可以大幅的节省计算资源,提高集群效率。Blink SQL可以通过修改提交模式,分别转化为Stream或Batch任务,在保持业务逻辑稳定的同时方便任务调试和验证。通过Bayes这样的开发平台服务化的方式提交任务到不同集群,彻底解决以前任务通过GateWay提交运维复杂的问题,添加新的Yarn集群只需要简单配置即可完成。另外在Bayes上同样会保存Bahamut自动生成提交的Sql,可以在Bayes上直接进行任务的调试和管理,方便了开发人员。下图是一个Bahamut自动生成的Blink Sql样例,描述同步层的一个任务,任务中包含Source,Select Oper和Sink三个O...

  • ?

    从内部业务到外部赋能,详解阿里大数据计算平台的扩张野心

    郜珩

    展开

    2018 年是阿里巴巴公司成立的第 19 个年头。在这过去的 19 年里,伴随着中国互联网的快速发展,阿里巴巴也无到有、从小到大,迅速成长为一家世界级的互联网巨头,创造了一个令世界瞩目的「中国奇迹」。

    而在这 19 年的时间内,公众对于阿里巴巴公司的认知也在悄然发生着变化。从早年间的 B2B 公司到后来的 C2C(淘宝)、B2C(天猫)的电商公司再到现在一个无所不包的阿里巴巴生态体系,「阿里巴巴到底是一家什么公司?」这个问题可以有多个回答的角度,比如,阿里巴巴是一家以用户需求为导向的互联网公司,再比如,阿里巴巴是一家「商业太过成功以至于掩盖了技术创新的公司」(阿里巴巴 CTO 张建锋语)。

    但如果从最微观的角度切入,阿里巴巴其实一家大数据公司。在阿里所有的产品里,流淌的着是各种各样的数据,比如天猫淘宝的电商数据、阿里云的企业业务数据、支付宝的支付数据等等,这些海量的数据组成了阿里巴巴各个产品线,而让这些数据转化为业务和产品,最终成为可以让普通用户享受到的服务,则离不开一个稳定可靠的大数据计算平台,这也是阿里巴巴计算平台所要承担的艰巨任务。

    公开资料显示,阿里巴巴计算平台支撑了整个阿里经济体 90% 以上的结构化/非结构化数据的存储、交换、管控,数据规模已超 EB 级别。在上周的云栖大会上,阿里巴巴副总裁、计算平台负责人周靖人博士及其团队像外界展示了阿里巴巴大数据智能计算引擎的核心技术能力,比如可以实现海量数据规模下的高性价的离线实时计算,以及实时+离线任务一体化研发能力等等,这一系列新的能力也让其具备了新一代计算引擎的诸多特点。

    更重要的是,不管是大数据引擎 MaxCompute 还是实时计算引擎 Blink,都是在阿里内部被业务一步步「锻炼」出来的产品,因此具有实战性、可用性的优势。另一方面,作为阿里巴巴大数据研发平台的 DataWorks,在经过 9年 内部发展、5年公共云、3年专有云的发展后,也成为阿里巴巴大数据赋能行业的重要技术输出口。

    MaxCompute 与 Blink,从在线业务到民生业务的数据引擎

    先来看看 MaxCompute。这是阿里巴巴自主研发的大数据计算平台,从 2010 年开始正式开始运行在阿里云飞天分布式操作系统智商,提供统一的计算引擎,支持 SQL、MR、迭代计算、图计算、流计算。

    在历经多次、不同规模的业务锤炼后,目前 MaxCompute 承载了阿里巴巴集团内部 99% 的数据存储及 95% 的计算能力。

    与此同时,MaxCompute的成长速度也非常惊人。去年10月的云栖大会上,MaxCompute与TPC委员会的benchmark适配,在业界领先的基于端到端的大数据分析领域应用级测试基准下,MaxCompute完成了全球首次基于公共云的bigbench大数据基准测试,数据规模拓展到100TB,性能达到7830QPM,成为首个突破7000分的数据引擎。

    2018年,该性能测试的结果再次提升超过2倍,达到18176.71QPM。这一系列成绩充分展现了 MaxCompute 作为一款中国自主研发的大数据引擎,已经具备了可以引领行业发展的能力。

    再来看看看看 Blink。Blink 是阿里巴巴基于 Apache Flink 开源流处理框架所开发的实时计算引擎,过去三年,阿里的实时计算团队针对其内部特定的业务场景,对 Flink 做了大量优化迭代,并命名为 Blink。

    实时计算场景在电商业务里非常普遍,比如电商促销的场景,如何让用户的需求在短暂的促销阶段被更多地刺激出来,就考验着电商平台的搜索和推荐,这就需要电商平台的数据能在最短的时间内实现模型更新,这就是实时计算最能发挥作用的应用场景。

    在历年的双十一的大考中,公众最关注的 GMV 大屏幕的背后技术就是 Blink 实时计算引擎,每一条交易信息都是一个数据,从数据写入数据开始,到被实时处理并最终显现到大屏幕,都要求数据计算的精确性、可用性以及低延时(延迟在亚秒级别)。而双十一全天的活动里,每秒几十万笔的交易和支付的实时聚合统计操作全部是由Blink计算完成,从而最大限度地保证了双十一的稳定运行。

    从上文可以看出,MaxCompute 和 Blink 分别对应了不同领域的计算需求,前者主要应对海量数据的离线计算,而后者,则在实时计算中扮演重要角色,两个计算相辅相成,成为阿里巴巴内部诸多产品的底层数据支持平台。

    2016 年,阿里云推出 ET 城市大脑项目,在杭州,阿里云希望将城市交通数据统一到一个「大脑」中,通过云端的海量、实时计算,实现对城市发展的数字化管理,这也是对 MaxCompute 和 Blink 计算引擎的新考验,如果说过去的数据计算是处理互联网的交易数据,那么当数据范围扩大到物理世界,MaxCompute 和 Blink 能否有效应对呢?

    答案也很乐观。在上周发布的杭州城市大脑 2.0 中,阿里云 ET 城市大脑相的管辖范围扩大了28倍,优化信号灯路口1300个,覆盖杭州四分之一路口,同时已接入了视频4500 路。这意味着,MaxCompute 和 Blink 不仅可以计算互联网数据,还完全可以承载一个城市的离线和实时计算需求。

    这样灵活、强大的数据计算能力,也正在成为驱动其他行业变革的新变量。

    DataWorks,一站式数据开发平台

    事实上,MaxCompute 和 Blink 实时计算都已经运行在阿里云平台,企业和开发者可以根据自身需求去购买相应的服务。而在此次云栖大会上,阿里巴巴计算平台的多位技术专家还分享了 DataWorks 的数据研发平台对于更多行业的数据赋能能力。

    首先,DataWorks 的可用性已经得到验证。作为一个在阿里内部「孕育」出来的数据研发平台,DataWorks 也被广泛应用到阿里集团、蚂蚁金服、菜鸟、优酷、高德等所有事业部的数据开发流程里,还通过阿里云的公共云平台和专有云平台被广泛应用到多个国家和地区。

    其次,DataWorks 的技术能力毋庸置疑。不完全统计,2017年,以 DataWorks 为主体的阿里云数加,获得了国际软博会金奖;2018年,DataWorks 名列国家大数据博览会十佳产品,荣获最佳案例实践奖。

    2018 年 3 月,咨询机构 Forrester 发布 Cloud Data Warehouse 第一季度榜单,DataWorks 携手 MaxCompute,与AWS,Microsoft Azure,Google Cloud 一众强手共同进入云数仓第一阵营,是唯一入选榜单的中国企业,也奠定了世界级大数据研发平台的地位。

    第三,在产品设计上,DataWorks 拥有完整的开发流程,实现了端到端的数据开发。DataWorks 将上文提及的 MaxCompute 离线计算能力和 Blink 实时计算能力封装为可用的接口,另外还将阿里巴巴机器学习平台 PAI 的机器学习能力融合到平台里,覆盖从数据计算到模型训练、线上数据服务,再到云上应用搭建的一站式云上大数据解决方案。

    另外,基于云上编程环境 Cloud IDW,DataWorks 还提供从 Sql、python,甚至 Java 的开发能力,这也意味着,开发者不必花费过多时间和精力去配置各种开发变量,只需将开发环境切换到云端,然后直接写代码就能快速搭建自己的产品。

    DataWorks 的上述能力也在体现在阿里巴巴计算平台日前举办的云上编程比赛中,各路选手需要利用DataWorks 快速搭建一个天气预报云端应用。

    第一步是离线数据导入和处理。选手们要将历史数据通过数据集成导入到MaxCompute 表,然后在 DataWorks 编写离线 SQL 进行数据预处理,处理后的数据在 PAI 机器学习平台通过引用内置的各种算法/模板进行建模、训练,并最终一键发布到EAS提供预测服务。

    第二步则是实时数据的接入和处理。将实时采集的气象数据通过数据集成导入到DataHub,然后在DataWorks编写实时SQL进行数据加工,加工后的实时数据和离线基础数据拖过简单拖拽就可以装载到Lightning引擎进行异构数据整合,并提供实时交互式查询服务。

    第三步构建应用。在DataWorks 的数据服务中,可快速的打通 EAS 服务和 Lightning 引擎并生成高性能的在线 API,同时在 AppStudio 中可无缝对接数据服务API;用可视化组件模板,简单几步配置就可以完成云上Web应用开发;另外AppStudio也提供了在线IDE环境可支持Java在线开发、编译、调试、运行、版本管理、多用户协同编辑等功能。

    尾巴:数据时代的红利

    无论承认与否,「数据是新时代的石油」已然成为行业共识,向数据要价值正在成为全社会各个行业的方法论。在这场数据智能的淘金热里,阿里将自己放在行业赋能者的位置,既有能提供处理海量数据的 MaxCompute,还有支撑双十一的实时计算引擎 Blink,也有面向机器智能开发的 PAI,而在这一系列产品的上层,也就是最接近企业、开发者的那一层,DataWorks 整合了所有的核心技术,并以友好的界面、一站式的流程展现给企业、开发者。

    如果阿里巴巴过去 19 年的努力,践行了「让天下没有难做的生意」的口号,那么,现在的阿里巴巴大数据计算平台上的这些产品,则正在努力实现「让天下没有计算不了的数据」的新愿景,这是阿里巴巴技术驱动型公司最直接的体现,也是数据时代企业、个人开发者的新红利。(完)

  • ?

    从阿里云看行业大数据

    Dwight

    展开

    马云曾说过:阿里巴巴不是一家电子商务型公司,而是一家技术性企业。新零售以及Ewpt(电子世界贸易平台)的提出正式马云在关键时刻做出的变革,在高科技的战场上,马云一次又一次的攻城拔寨,震惊了美国,震惊了世界。

    阿里巴巴的成就有目共睹,特别是在全球化道路上一直敢为先人,这是一种责任更是一种使命。

    就算是市值达到8000亿的苹果在云计算方面也是被阿里云远远甩在身后,阿里云已经在多个国家建立数据中心,其实力位于全球前三,与亚马逊和微软一较高下,让美国巨头真实感受到了阿里在云计算领域的爆发力。

    从阿里云的发展我们不难看出,数据化时代在国内乃至世界已经掀起了巨浪,许多公司开始做企业数据信息库的建立,科技大数据营销已经走进各行各业,传统企业也开始改革创新;2017年5月31日北京CBD探索企业信用体系监管新模式,其中北京CBD中心区“综合资源管理系统”与“CBD功能区产业转型升级和楼宇经济管理系统”已经建设完成,整合了多部门近3000万条数据,初步建立了企业征信大数据库;加之下半年投入使用的企业信用监管综合平台,将实现北京商务中心区商务诚信事前、事中、事后全方位监管。

    企业做数据库管理主要是为了能很好的跟踪到新老客户的变化,客户数据是整个数据库的灵魂,在构建客户数据库的过程中,第一个原则就是尽可能的将客户的完整资料保存下来,不同于传统的纸质档案收集方式,也不同与电子档案,数据库的客户信息收集能上传到云端数据备份,对于每一个的客户的信息变动能及时做出跟踪反馈。

    未来云端技术必将是企业发展的方向,结合数据库来整合客户企业数据信息,便于调动和更改信息,提前预知市场的发展做出合理的调整,英联国泰数据管理系统,利用云端技术和数据库收集,对于每一个信息建立独立的数据库。

阿里大数据平台

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP