中企动力 > 商学院 > 大数据是哪一年
  • ?

    到底什么叫大数据?

    安迪

    展开

    大数据到底是什么,到今天应该还是稀里糊涂的一笔账。

    百度百科是这样定义的:

    大数据(big data),指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。在维克托·迈尔-舍恩伯格及肯尼斯·库克耶编写的《大数据时代》中大数据指不用随机分析法(抽样调查)这样捷径,而采用所有数据进行分析处理。大数据的5V特点(IBM提出):Volume(大量)、Velocity(高速)、Variety(多样)、Value(低价值密度)、Veracity(真实性)。

    这个定义最大的特点,和很多红皮书白皮书黑皮书之类的差不多,就是装逼。说白了,不说人话。反正我是没听明白大数据和小数据有什么本质的区别。无非是数据和处理数据的工具以及从数据里面提取有用信息变成钱的过程。曾经我们在做这些事情,现在我们在做这些事情,将来我们也会继续做这些事情。

    以前几年国内大数据概念炒上天的情况来看,其实真的谁也不知道大数据是什么,谁也不清楚大数据怎么玩,但是各行各业忽如一夜春风来,冒出无数个大数据公司大数据专家。

    现在我们可以看到各行各业都在谈论大数据。从政府到企业,从互联网行业到传统行业,随便写个App背后没有大数据都不能叫好App。现在大数据都上升到国家高度了。比如说政府办公要上大数据,一个三线城市,放两三台机器搞定的,这数据真的非常的大。

    如果我们撇开大数据这个概念不谈,自从有了数据以来,人类一直做的事情是什么?这个其实也是今天大数据的背景下大家都在做的事情,概括起来讲:分析数据,产生有价值的信息。

    这个事情20年前在做10年前也在做,今天还是在做,其实没什么变化。 那么什么东西发生了变化呢?最大的一个是工具的能力发生了变化。 现在我们可以几千几万台机器一起协同做计算了。其次是性价比的变化。以前买Oracle的数据库IBM大型机Teradata的解决方案,贼贵。现在开源软件一搭,弄些PC机就好。糙一点无所谓,所谓便宜才能普及。

    然而本质来讲,大家做的事情并无改变。所以我们不需要去纠结于大数据到底是什么,而是要看清楚具体业务问题是什么,有什么合适的工具去解决。这些工具可能是新的也可能是旧的。我想大数据的所谓发展无非就是工具的进步使得大家能够更有能力去在限定的时间内处理更多的数据,获得更有效的信息。

    关注佳源信息,关注更多资讯。

    【版权与免责声明】如发现内容存在版权问题,烦请提供相关信息发邮件至jy@jiayuaninfo,我们将及时沟通与处理。

  • ?

    什么是大数据,大数据时代怎么理解?

    又莲

    展开

    “大数据”是近年来IT行业的热词,大数据在各个行业的应用逐渐变得广泛起来,如2014年的两会,我们听得最多的也是大数据分析,那么,什么是大数据呢,大数据时代怎么理解呢,一起来看看吧。

    大数据的定义。大数据,又称巨量资料,指的是所涉及的数据资料量规模巨大到无法通过人脑甚至主流软件工具,在合理时间内达到撷取、管理、处理、并整理成为帮助企业经营决策更积极目的的资讯。

    大数据的特点。数据量大、数据种类多、 要求实时性强、数据所蕴藏的价值大。在各行各业均存在大数据,但是众多的信息和咨询是纷繁复杂的,我们需要搜索、处理、分析、归纳、总结其深层次的规律。

    大数据的采集。科学技术及互联网的发展,推动着大数据时代的来临,各行各业每天都在产生数量巨大的数据碎片,数据计量单位已从从Byte、KB、MB、GB、TB发展到PB、EB、ZB、YB甚至BB、NB、DB来衡量。大数据时代数据的采集也不再是技术问题,只是面对如此众多的数据,我们怎样才能找到其内在规律。

    大数据的挖掘和处理。大数据必然无法用人脑来推算、估测,或者用单台的计算机进行处理,必须采用分布式计算架构,依托云计算的分布式处理、分布式数据库、云存储和虚拟化技术,因此,大数据的挖掘和处理必须用到云技术。

    大数据的应用。大数据可应用于各行各业,将人们收集到的庞大数据进行分析整理,实现资讯的有效利用。举个本专业的例子,比如在奶牛基因层面寻找与产奶量相关的主效基因,我们可以首先对奶牛全基因组进行扫描,尽管我们获得了所有表型信息和基因信息,但是由于数据量庞大,这就需要采用大数据技术,进行分析比对,挖掘主效基因。例子还有很多。

    大数据的意义和前景。总的来说,大数据是对大量、动态、能持续的数据,通过运用新系统、新工具、新模型的挖掘,从而获得具有洞察力和新价值的东西。以前,面对庞大的数据,我们可能会一叶障目、可见一斑,因此不能了解到事物的真正本质,从而在科学工作中得到错误的推断,而大数据时代的来临,一切真相将会展现在我么面前。

  • ?

    科普:大数据专家告诉你到底什么是大数据

    忆山

    展开

    近年来大数据发展越来越好,身处互联网的环境中,突然发现,周围的人经常谈的话题变了,很多人都在谈论大数据、人工智能、智慧城市,大数据中心等大数据相关的内容,看来大数据是真的火起来了,但是大数据到底是什么?很多人其实并不清楚,今天就为大家分享下,到底什么是大数据?

    下面我们一起来看看大数据的概念

    马云爸爸说“我们已从IT时代进入了DT时代,未来我们的汽车、电灯泡、电视机、电冰箱等将全部装上操作系统,并进行数据集成,数据将会让机器更“聪明”。DT时代,数据将成为主要的能源,离开了数据,任何组织的创新都基本上是空壳。”

    大数据是眼下非常时髦的热词,同时也催生出了一些与大数据处理相关的职业,通过对数据的挖掘分析来影响企业的商业决策。随着大数据在国内的发展,大数据相关人才却出现了供不应求的状况,大数据高级研发工程师、大数据分析师更是被媒体称为“未来最具发展潜力的职业之一”。

  • ?

    诞生至今,大数据的真正含义到底是什么?

    依柔

    展开

    [来自IT168]  【IT168 评论】在五六年前,大数据已经成为了流行趋势。但目前的大数据还保持着原来的含义吗?Micro Focus南非区域总经理Gary De Menezes给予了否定回答。

    如今,为了满足业务需求,厂商都开始研发各种大数据解决方案来帮助企业管理海量的非结构化数据,这也许就是目前大数据存在的意义。  De Menezes表示,如今很多企业都成功的创建了数据存储系统。在业务层面,企业花钱收集和存储数据,但很多没有利用价值的数据也被收集到一起,无法将数据进行类别存储,数据利用率很低。因此,我们需要进入到一个可控的大数据收集时代,只收集和保存我们需要的数据。想要实现这一点,我们就需要对数据进行分析规划。  数据需要以预定义的方式进行管理,方便了解它们跟业务之间的关系。Micro Focus南非区域的渠道经理Gareth De Laporte表示,数据得到有效规划,企业的业务和内容管理(ECM)才能发挥更大的价值。一些手动干预业务流程的企业,想要进行ECM(内容管理),则必须将他们的业务流程数字化。他们可以通过将业务中的所有数据数字化转存到中央存储库中,实现企业的数字化之路。  听起来很容易,但做起来却很难。在过去三年里,人们越来越关注数据收集和存储方面的安全问题,新隐私法的出现也使这个问题更加复杂。继去年实施的《网络安全法》在业界掀起一股狂风暴雨之后,一个更加严厉的《个人信息保护法》预计今年年底发布。  De Laporte补充道,从数据治理的角度上看,从数据的创建到该数据不再被需要,企业必须能够跨越生命周期管理数据。内容管理作为一门哲学,正在成为实现最大化数据价值的金钥匙。  对于企业内容管理(ECM),Gartner给出了这样的解释:企业内容管理从内涵上应该包括企业内部内容管理、Web内容管理、电子商务交易内容管理和企业外部网(Extranet)信息共享内容管理。  De Laporte用南非司法系统的例子阐述了他之前的观点。媒体经常会报道关于档案或案卷丢失的案子,这对司法制度和维护法律产生了极大的负面影响。如果数据被数字化,内容以正确的方式得以管理,数据只被授权的个人访问,没有任何可被随意篡改的空子,或许数据丢失的案件会减少很多。  De Laporte表示,随着我们的聚焦点从纯粹的数据服务转移到内容管理上,数据就不再是以往的数据,它们有相关的数据背景以及与业务之间的联系方式。因此除了ECM,我们还需要进行数据分析,对重要数据进行分类,然后按类别储存。  除此之外,能够跨数据搜索且与特定事件或主题相关的所有可用信息也是至关重要的。De Menezes解释到,ECM不是一个新概念,早在上世纪90年代它就已经出现了,并且带来了可跨越不同数据类型的弹性搜索,数据类型包括声音、视频和图像。并且发展到现在已经是颠覆性级别的了。  将所有的数据保存在一起,企业业务运行效率必然很低,企业希望数据可以被分类保存,不需要的数据可以及时被剔除掉,并且有相关审计实时追踪存储时间、访问权限以及处理权限的人员。这也是大数据目前面临的巨大挑战之一。  De Laporte总结到,数据是一个企业的必须品,每个公司员工都希望有权限访问它们,但是又不能对所有的员工开放数据访问权限,最好的方法就是企业内容管理和数字化。

  • ?

    大数据是什么?大数据时代四个特点

    王涵易

    展开

    大数据是什么?其实很简单,大数据其实就是海量资料巨量资料,这些巨量资料来源于世界各地随时产生的数据,在大数据时代,任何微小的数据都可能产生不可思议的价值。大数据有4个特点,为别为:Volume(大量)、Variety(多样)、Velocity(高速)、Value(价值),一般我们称之为4V。

    大数据

    所谓4V,具体指如下4点:

    1.大量。大数据的特征首先就体现为“大”,从先Map3时代,一个小小的MB级别的Map3就可以满足很多人的需求,然而随着时间的推移,存储单位从过去的GB到TB,乃至现在的PB、EB级别。随着信息技术的高速发展,数据开始爆发性增长。社交网络(微博、推特、脸书)、移动网络、各种智能工具,服务工具等,都成为数据的来源。淘宝网近4亿的会员每天产生的商品交易数据约20TB;脸书约10亿的用户每天产生的日志数据超过300TB。迫切需要智能的算法、强大的数据处理平台和新的数据处理技术,来统计、分析、预测和实时处理如此大规模的数据。

    2.多样。广泛的数据来源,决定了大数据形式的多样性。任何形式的数据都可以产生作用,目前应用最广泛的就是推荐系统,如淘宝,网易云音乐、今日头条等,这些平台都会通过对用户的日志数据进行分析,从而进一步推荐用户喜欢的东西。日志数据是结构化明显的数据,还有一些数据结构化不明显,例如图片、音频、视频等,这些数据因果关系弱,就需要人工对其进行标注。

    大数据

    3.高速。大数据的产生非常迅速,主要通过互联网传输。生活中每个人都离不开互联网,也就是说每天个人每天都在向大数据提供大量的资料。并且这些数据是需要及时处理的,因为花费大量资本去存储作用较小的历史数据是非常不划算的,对于一个平台而言,也许保存的数据只有过去几天或者一个月之内,再远的数据就要及时清理,不然代价太大。基于这种情况,大数据对处理速度有非常严格的要求,服务器中大量的资源都用于处理和计算数据,很多平台都需要做到实时分析。数据无时无刻不在产生,谁的速度更快,谁就有优势。

    4.价值。这也是大数据的核心特征。现实世界所产生的数据中,有价值的数据所占比例很小。相比于传统的小数据,大数据最大的价值在于通过从大量不相关的各种类型的数据中,挖掘出对未来趋势与模式预测分析有价值的数据,并通过机器学习方法、人工智能方法或数据挖掘方法深度分析,发现新规律和新知识,并运用于农业、金融、医疗等各个领域,从而最终达到改善社会治理、提高生产效率、推进科学研究的效果。

    大数据

    在大数据时代,每个人都会享受到大数据所带来的便利。买东西可以足不出户;有急事出门可以不用再随缘等出租车;想了解天下事只需要动动手指。虽然大数据会产生个人隐私问题,但总的来说,大数据还是在不断的改善我们的生活,让生活更加方便

    若是对大数据是什么仍然还有疑问,可以留言或者关注私信一起交流。

  • ?

    大数据起源,给你解析到底什么是大数据!

    邵天曼

    展开

    大数据,英文名big data。因为传播已经成为习惯,我们并没有过多的去思考为什么用big data去描述,但是现在我们仔细回味一下,会发现大数据这个大为什么不用large为什么不用海量vast呢?归根结底我们可能就需要从语法上,来分析一下,它们三个之间的区别。big形容大小。更多的时候,是一种比较行为上的大,是种相对来说的感觉,而large和vast更多的时候形容的是的是一种形体上的巨大。

    那么现在来推敲一下big data这个词,大数据这个大其实是一种相对的说法是相对于传统的数据体量来说的,过去任何时候的数据相对于现在来说都显得太过于渺小,而现在我们所说的大数据是一种量变最后达到了质变的概念。

    数据这个词最早在媒体上风靡应该是2007年左右。往上追溯应该就是05年谷歌参加有美国官方举办的一个机器翻译大赛,最终由于使用了海量的相关数据而夺得第一,在那之后大数据这个概念渐渐的被业内人士所传播。那么到底什么是大数据呢?

    大数据顾名思义,最表象的特征就是数据量够大。但是仅仅数据量够大,并不能构成大数据整体的含义。如果是海量杂乱无章,互之间没有关联的数据,即便再怎么定义,它也算不上是大数据。就譬如一个人体内的基因图谱,详细的基因图谱数据如果记录出来是一个很大体量的,但是没有意义。

    大数据而且还有个概念,那就是多维度。在十年前,如果说国内哪一家公司最有资格说大数据的,那无疑是百度了。作为一个独占13亿用户专属的搜索公司来说,百度对于用户画像的记录,无疑是多维的。百度搜索,至今记录了无数用户每天在互联网上搜索的问题,或者说知识。在时间维度上用户对某些词汇搜索的频次高低这些都是数据。它可以通过对注册用户的甄别就可以知道搜索这个词汇或者是这个问题的用户是男生还是女生?年龄分布是是小孩、青年抑或是一个中年大叔?再到后来个人电脑开始普及,通过记录ip等信息,根据ip搜索的百度的问题的分类,可以判断中国各个区域,是南方富裕一点,还是北方富裕点?是江苏人更爱吃,还是闽南人更喜欢谈论吃?百度完全可以根据自己的数据生成得到国内各种关于此类的数据,普查之后所能得到的答案这就是因为百度所具有的数据是一个多维度的数据。他的数据收集过程,是一个长期的持续性的工作。

    除了百度之外,腾讯的qq确实每年都会有一个关于qq的城市报告。它会根据qq的用户数据,甚至于至于活跃地点。在一个大的范围内青年QQ用户的占比,最终可以得到中国城市年轻度排行榜。可以根据这些数据判断,哪一个城市是,年轻人毕业之后最愿意去的。可以判断哪一个城市的,年轻人毕业之后,是回归率最高的。也可以判断哪一个城市的人才流失率更低,更容易留住外来人才。这些都是大数据多维度的应用。

    大数据还有一个非常重要的特点,那就是全面性。经常在某些大型活动之前我们都会遇到。某些公司对于这件事情,会做出预测。然后最终的结果让我们大失所望。预测无疑是需要基于数据基础的预测,如果这个数据不够全面的话,最终的预测结果肯定相差甚大。

    关于数据全面性有一个最经典的案例这是12年美国大选大选事件。一个名叫斯威尔的年轻人,利用大数据预测。成功预测出了51个州的选举果,要知道这在之前是从来没有发生过的事情。美国大选在之前就一直有专业的预测机构做预测,但是就连这种长期做数据,分析的公司都从来没有如此成功的预测过。那是因为斯威尔将网上所有关于选举的数据,包括新闻稿,以及facebook和推特上面人们关于选举的言论,所有的数据都做了甄选处理。这份数据反映的是网民全面几乎没有遗漏的想法,最终得到了某种程度上来说,比较具有完备性的数据,所以能够如此成功的预测13年美国大选的结果。

    关于大数据的科普我们就到这里了,有任何问题可以留言咱一起交流,本文由玩机丧志原创,欢迎关注,带你一起长知识!

  • ?

    大数据看“成都年”,哪些最有年味?

    爱德华

    展开

    王效 摄

    四川在线消息(记者 吴亚飞)3月2日,2018年元宵节,“过节耍成都·寻找最年味”活动总结大会举行,发布“成都年”大数据,用数字诠释红红火火“成都年”。

    至2月5日起,成都市商务委、成都市旅游局、成都市文广新局联合主办“过节耍成都”活动。2018武侯祠成都大庙会、第50届成都国际熊猫灯会、第九届成都诗圣文化节、2018成都金沙太阳节……2000多个大大小小的年味活动,共同组成了成都浓得化不开的年味。

    哪些活动最有年味?成都的春节收获了什么?

    张直 摄

    看数据:

    大数据看热闹“成都年”

    春节的成都,八方宾客云集。都说今年成都年热闹,怎么个热闹法呢?总结会上公布的一组数据,直观体现成都年的吸引力和吸金力。

    成都市旅游局数据显示,春节期间全市接待游客1575.5万人次,过夜游客303.6万人次、一日游游客1271.9万人次,实现旅游收入140.3亿元,同比增长27.4%。武侯祠、洛带古镇和黄龙溪景区人气最高。

    成都餐饮行业营业额与去年同期相比,均有5%—9%的提升。全市老字号销售额818.1万元,总销售额较去年同期增长20%左右。

    成都市零售行业方面,2月15日-2月21日,全市30家零售商超客流量超773万人次,累计销售额7.8亿元,同比增长7.3%。

    据成都双流机场、成都市铁路局的统计数据显示,2月1日至2月21日,成都机场安全起降航班20961架次,平均每日998个航班,比去年同期的19611架次增加了1350个航班,增长了6.9%,创历年同期春运最高水平。春节期间,成都铁路日均发送列车236对。接待游客137.4万人次。

    来自银联的大数据更直观。2月15-2月21日,成都区域内银行卡交易金额192.51亿元,占全省银行卡交易金额的54.09%,同比增长145.75%。在省外游客统计中,江苏游客最舍得花钱,得益于西城高铁等原因,北京、山西、陕西来蓉游客银行卡交易金额同比出现成倍增长。

    郭广宇 摄

    看人气:

    65万人次参与投票2018“成都最年味”评选出炉

    为了让八方宾客感受地道“成都年”,“过节耍成都”活动也推出春节特别活动——“过节耍成都·寻找最年味”,整合餐饮、零售、楼宇等行业资源和银联、摩拜、滴滴等平台资源,以“成都年味儿”串联起吃、住、行、游、购、娱、文全链条。

    该活动从启动以来,76个成都新春活动参与角逐,65万人次关注投票,最终通过网络投票+专家评审,评选出“2018成都最年味活动”、“2018成都最年味创新奖”、“2018成都最年味区域”,让成都年味集中呈现。

    看效应

    行业、区域多方通力配合“抱团迎客”

    春节期间,在成都餐饮同业公会、成都市烹饪协会倡导下,全市300多家餐饮企业、20余家中华老字号,春节不打烊,让来蓉游客吃得舒心;在零售商协会的推动下,全市61家商场卖场春节期间正常营业或延迟关门,推出各种优惠活动,让各地顾客买得尽兴。

    旅游也抱团迎客。“天府成都·热动蓉城——冬季到成都来看你”活动,打造“成都冬季旅游”线路产品矩阵,成都旅游景区协会针对西成高铁开通,发起“乐乘高铁、惠游成都”倡议活动,20多家A级景区参加。成都博物馆、武侯祠、杜甫草堂、金沙遗址博物馆和永陵博物馆等5家博物馆也开展“元旦春节文化惠民行”活动。

    各行各业敞开胸怀拥抱八方宾客过年耍成都,成都22个区(市)县也积极主动地加入“寻找最年味”活动,通过“寻找”,创新性地将原来散落的春节活动集中呈现。

    “过节耍成都·寻找最年味”获奖名单

    一、2018成都最年味活动

    2018戊戌狗年洛带镇“客家年”春节系列活动

    2018武侯祠成都大庙会

    第50届成都国际熊猫灯会

    中国酒村2018戊戌新年炫彩酒灯节暨超萌财神闹春会

    第九届成都诗圣文化节

    “成都文化四季风·民俗闹春”蒲江县2018龙腾狮舞闹元宵活动

    蔚然花海龙泉驿大庙会

    好秾人第二届七彩风车季

    2018成都金沙太阳节

    2018“玉犬争春耀神州·古堰倾城颂天府”都江堰市民俗闹春系列文化活动

    彭州市新兴镇“古镇年浓”海窝子民俗文化大巡游

    温江“春节不打烊”美食品鉴

    新津纯阳观新春民俗文化大庙会

    成都远洋太古里“福满戊戌盼旺里巷”

    “ofo联名卡”发布春节游温江骑绿道

    四川首届乡村艺术大展

    全球大熊猫齐聚都江堰

    IFS“春满花开十分爱loveinspring”

    郫都区2018“寻味中国年”文化旅游节

    彭州市白鹿镇“迎新春”灯光秀

    二、2018成都最年味创新奖

    金牛区、成华区、青白江区、崇州市、新津县

    三、2018成都最年味区域

    锦江区青羊区武侯区龙泉驿区温江区郫都区都江堰市彭州市邛崃市蒲江县

  • ?

    大数据,到底大在哪里?

    Hogan

    展开

    对于经常上网的朋友来说,大数据这个词一定并不陌生,上到国家层面,下到一家小型的创业型公司,对于大数据的关注程度都是一样的高。那么,到底什么是大数据呢?大数据具体又 “大”在哪里呢?

    一、什么是大数据

    大数据( big data ),指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。

    在维克托 · 迈尔 - 舍恩伯格及肯尼斯 · 库克耶编写的《大数据时代》 中大数据指不用随机分析法样捷径,而采用所有数据进行分析处理。大数据的 5V 特点: Volume (大量)、 Velocity (高速)、 Variety (多样)、 Value (低价值密度)、 Veracity (真实性)。

    简而言之,大数据就是可以通过各个不同端口对数据尽兴收集与交互,从而描绘出用户群体的信息汇总,可以准确的将用户的上网习惯,关注领域精准的描绘出来,从而对其进行有针对性的推广。

    二、大数据有什么价值?

    首先是对于商家以及企业来说,大数据的价值体现在以下几个方面:

    1) 对大量消费者提供产品或服务的企业可以利用大数据进行精准营销

    2) 做小而美模式的中小微企业可以利用大数据做服务转型

    3) 面临互联网压力之下必须转型的传统企业需要与时俱进充分利用大数据的价值

    而对于消费者而言,大数据对其价值更多的体现在产品的人性化上面,包括硬件以及 APP ,可以根据大数据来对其最感兴趣的以及最需要的内容进行推送,使其更加人性化,也更具有效率。

    三、大数据的发展趋势

    趋势一:数据的资源化

    有别于传统意义上的资源,在大数据的概念中,数据也是重要的战略资源之一,对于企业来说,如何通过大数据来把我最新的市场动态以及用户动态成为最重要的战略决策因素之一。

    趋势二:与云计算的深度结合

    大数据与云处理是相辅相成的,云处理为大数据提供了基础,是产生大数据的重要平台。自 2013 年开始,大数据技术已开始和云计算技术紧密结合,预计未来两者关系将更为密切。

    趋势三:科学理论的突破

    随着大数据的快速发展,就像计算机和互联网一样,大数据很有可能是新一轮的技术革命。随之兴起的数据挖掘、机器学习和人工智能等相关技术,可能会改变数据世界里的很多算法和基础理论,实现科学技术上的突破。

    趋势四:数据科学和数据联盟的成立

    数据科学将成为一门专门的学科,被越来越多的人所认知。各大高校将设立专门的数据科学类专业,也会催生一批与之相关的新的就业岗位。

    趋势五:数据泄露泛滥

    对于企业来说,未来的数据泄露事件的增长率也许会达到 100% ,除非数据在其源头就能够得到安全保障。可以说,在未来,每个企业都会面临数据方面的攻击,并且都需要重新审视今天的安全定义。

    趋势六:数据管理成为核心竞争力

    数据的收集以及分析能力将直接影响一个企业的发展,在未来数据管理能力将成为企业的核心竞争力。

    四、大数据,大在哪里?

    那么,大数据,到底大在哪里呢?

    首先,大数据的大,最主要指的是数据体量的庞大,相较于传统数据来说,大数据所包括的体量是完全不同于以往传统的数据量的。

    其次,是指数据的类型,所有用户在使用互联网时留下的数据都可以作为大数据的计算内容,因此,各种类型的数据都可以包含其中

    第三,数据计算量庞大,不同于以往传统的数据分析与计算的方式,现在大数据对数据的收集和分析,是配合云计算对所有数据进行的分析与计算,其计算数量也是难以想象的。

    五、大数据如何影响生活?

    那么,仅仅从一个普通的消费者以及网民的角度来说,大数据到底是通过什么样的方式来影响你的生活呢?

    就拿当今的智能手表为例,一个手表如果在加入了大数据这个领域以后,会和以前的传统手表相比产生哪些天翻地覆的变化呢?

    首先,大数据在智能可穿戴领域的运用包括三个主要部分,即 “硬件终端”,“人机交互”以及“云数据”,具体来看就是将智能手表本身作为一个人体数据收集的平台,而收集数据的类型也包括我们生活的方方面面,而在通过 APP 将数据上传到后台云数据服务平台,然后对收集到的数据进行海量分析计算,从而得出实用,符合实际,有用的数据分析报告,再反馈给用户,这样就形成了大数据在智能可穿戴领域的完整产业链与价值闭环。

    今后的未来,大数据的发展会更进一步,而其又会怎样具体的体现到用户硬件实用领域,我们共同期待。

  • ?

    大数据是什么(续)

    阿菜

    展开

    专业知识,不容错过

    ━━━━━━

    背景

    从亚马逊到Facebook,再到谷歌和微软,全球最顶尖、最有影响力的技术公司都将目光转向了人工智能(AI)。本文将介绍AI、机器学习以及深度学习,其中着重介绍深度学习是如何工作的,以及深度学习为何直到今天才开始成熟,最后,介绍开源的深度学习框架。

    “人工智能(AI)”这个词由达特茅斯大学助理教授John McCarthy在1956年提出,作为一种统称,AI可用于指代可体现出智能行为的硬件或软件。按照McCarthy教授的说法,这是一种“可以制造出智能的机器,尤其是智能的计算机程序的科学和工程。”

    机器学习

    机器学习(ML)是AI的一个子集。所有机器学习都是AI,但并非所有AI都是机器学习。当今人们对AI的兴趣主要体现在对机器学习技术的关注中,使得这一技术快速得到显著进步。

    机器学习算法可通过训练进行学习。最开始,可以为算法提供输出结果已知的样本数据,并将实际结果与预测结果的差异进行对比,随后对所输出内容的权重进行调优,借此改善预测结果的精确度,知道最终获得优化。因此机器学习算法的界定特征就在于通过经验结果进行改善所取得的质量。我们提供的数据越多就能创建出越好的预测引擎。

    目前机器学习方法已经超过15种,每种都可以使用不同的算法结构通过收到的数据对预测进行优化。作为其中的一种方法,“深度学习”在很多全新领域实现了突破性的结果,下文将详细介绍。算法其实还有很多,其他算法虽然不像深度学习那样获得了最为广泛的关注,但也有自己的价值,因为可以使用与更广泛的用例中。除了深度学习,其它最实用的机器学习算法还包括:“Random forests(随机深林)”,通过穿件大量决策树对预测进行优化;“Bayesian networks(贝叶斯网络)”,使用基于概率的方法分析变量和变量之间的关系;“支持向量机(Vector machine)”,可通过多种分类样本并创建模型将新的输入内容分配给某一类。每种方法各有利弊,并能混合使用。针对特定问题选择哪种算法,主要取决于各种因素,包括可用数据集的本质特征等。实际上开发者通常趋向于通过多种实验确定最佳算法。

    机器学习技术的用例因具体需求和想象力而各不相同。只要有合适的数据,我们就可以为无数用途构建所需的算法,例如:根据购买记录推荐顾客可能愿意购买的产品,预测汽车组装流水线的机器手什么时候会故障,预测邮件地址是否输入有误,估算某笔信用卡存在欺诈情况的可能性等。

    深度学习

    深度学习(Deep Learning)的概念由加拿大多伦多大学教授Geoffrey Hinton等人于2006年提出,它本质上是一种神经网络算法,其原理是通过模拟人脑进行分析学习,算法训练时可以不用人工干预,因此它也属于一种无监督机器学习算法。从深度学习的概念提出至今,已历经十年多时间,期间,无论是国际互联网巨头Google、微软、百度,还是全世界各大学术研究机构,都投入了巨大的人力、财力用于理论和工业级应用的探索,并在字符识别(OCR)、图像分类、语音识别、无人自动驾驭、自然语言处理等众多领域内取得了突破性的进展,极大地推动了人工智能(AI)的发展。

    2012年斯坦福大学的Andrew Ng和Jeff Dean教授共同主导的Google Brain项目通过使用深度学习让系统能够自动学习并识别猫,这项目研究引起了学术界何工业界极大的轰动,激起了全世界范围研究深度学习的热潮。2016年3月,Google旗下DeepMind公司开发的AlphaGo以4:1的总比分战胜了世界围棋冠军、职业九段选手李世石,这让人们对人工智能(AI)的认知越到一个新的阶段。

    深度学习在众多领域的成功应用,离不开学术界及工业界对该技术的开放态度,在深度学习发展初始,相关代码就被开源,使得深度学习“飞入寻常百姓家”,大大降低了学术界研究及工业界使用的门槛。本节对当前主流的开源深度学习框架发展趋势进行分析。

    深度学习是如何工作的

    鉴于其重要性,我们有必要对深度学习的工作原理进行介绍。深度学习需要使用人造“神经网络”,这是一种相互连接的“神经元”的集合。人造神经元可以接受一种或多种输入。神经元会针对输入结果执行数学运算,并产生可输出的结果。输出的结果取决于每类输入的“权重”以及神经元的“输入-输出函数”配置。输入-输出函数各异。神经元可以是:1.一种线性单位,输出结果与输入总权重成比例;2.一种阈值单位,输出结果为两个级别中的一种,取决于总输入是否高于某一特定值;3. 一种S型代为,输出结果频繁变化,而不像输入那样呈现线性变化的态势。

    多个神经元相互连接组成神经网络,一个神经元输出可以成为另一个神经元的输入,如下图所示。

    神经网络可通过组织整理呈现为多层神经元(这也是“深度”这个词的由来)。其中“输入层”负责接收由网络处理的信息,例如一组图片。“输出层”负责提供结果。输入和输出层之间还有“隐藏层”,大部分活动均在这一层中发生。通常来说,神经网络上每一层神经元的输出内容均可成为下一层神经元的输入内容之一。如下图所示。

    以图像识别算法举例说明。假设要识别图片中的人脸。将数据装入神经网络后,第一层负责识别局部对比模式,例如图片边缘,这是一种底层特征。随着图片在整个网络中流动,逐渐提取出高层特征,例如从边缘到鼻子,再从鼻子到面孔,如下图所示。

    在输出层面,根据训练效果,神经网络会就图片是每种特定类型的可能性给出概率(人脸:97%;气球:1%;树叶:2%)。

    通常来说,神经网络的训练过程需要大量已经进行过分类的样本。随后算法会通过检测出的错误和神经元之间的连接权重进行调整,借此改善效果。优化过程的重复性极高,训练完成后即可部署系统并对未分类图片进行评估。

    上文描述的是一种很简单的神经网络,实际上神经网络的结构可能各异,并且大部分都非常复杂。各种常见变体包括:同层神经元之间的额不同连接,每层神经元数量的变化,以及将神经元的输出结果流向前一层网络(递归神经网络)的连接。

    神经网络的设计和完善需要投入相当多的技能。例如针对特定应用调整网络结构,提供事宜的训练数据集,根据进展调整网络结构,以及多种方法的混合使用等。

    为何深度学习直到今天才开始成熟

    由于新算法的陆续完善,所需要数据的大量丰富,用于训练的硬件日益强大,以及云服务对开发者的逐渐催化,AI的实际应用效果在近些年有了大幅改进。

    1. 算法的改进

    虽然深度学习算不上一种新技术,早在1965年就有人提出了第一个实际有效的多层神经网络规范,但最近十年深度学习算法的革新催生了截然不同的结果。

    识别图像中物体的能力随着卷积神经网络(CNN,Convolutional Neural Network)的发展产生了突飞猛进的提高。受到动物视觉脑皮层工作原理启发设计而来的CNN中,神经网络中的每一层均可从当判断特定模式是否存在所用的刷选器。2015年,微软基于CNN的计算机视觉系统在对图片中物体进行识别方面实现了比人类更高的准确度(计算机:95.1%;人类:94.9%)。

    与此同时,随着递归神经网络(RNN,Recurrent Neural Network)的诞生,语音和手写识别方面也取得飞速进展。不同于卷积神经网络仅向下馈送的运作方式,RNN可通过反馈连接让数据呈环路流动。RNN还出现了一种更强大的新类型:长短期记忆(LSTM,Long Short Term Memory)模型。在额外的连接和内存细胞的帮助下,RNN可以记住自己在数前部操作之前看到的数据,并使用这些数据对后续需要关注的内容进行解释:这一特性对语音识别产生了巨大的帮助,因为对下一个词的理解通常会受到之前所处理词汇的影像。从2012年开始,谷歌就在使用LSTM驱动Android中的语音识别系统。

    2. 专用硬件

    图像处理器(GPU, GraphicsProcessing Unit)是一种特殊设计的电子电路,可大幅缩短为深度学习训练神经网路所需的时间。

    现代化的GPU最初诞生于二十世纪九十年代末,当时主要是为了3D游戏和3D开发应用程序进行加速。在3D环境中平移和缩放镜头需要重复用到一种名为矩阵计算的数据运算过程,串行架构的微处理器,包括当今大部分计算机所用的CPU很不适合用来处理此类任务。为了更高效地执行举证计算,GPU通常会使用大规模并行架构来制造(Nvidia M40包含3072个内核)。

    神经网络的训练会设计大量矩阵计算。因此人们发现原本针对3D游戏设计的GPU其实很适合用来对深度学习过程加速。这样做获得了巨大的收益:一颗GPU即可让神经网络的训练时间缩短5倍,针对一些较大规模的问题甚至可实现10倍甚至更高的加速。在配合针对深度学习框架进行优化的软件开发工具包之后,甚至还可以进一步加快训练速度。

    3. 海量的数据

    深度学习所用的神经网络通常需要用大量的数据集进行训练,样本数量从数千起步,甚至可高达数百万。好在数据的创建速度和可用型也经历了指数形式的增长。今天,随着我们大数据时代,人类平均每天会生成2.2EB(23亿GB)数据,全球数据总量中有90%是过去24个月创建的。

    4. 云服务

    开发者对机器学习的应用还受到云端机器学习基础架构和业界领先云供应商所提供服务的推动。谷歌、亚马逊、微软,以及IBM均提供了云端基础架构,这也是的机器学习能力的开发成本和难度大幅降低。

    此外他们还提供了正在飞速发张的一系列云端机器学习服务,开发者可将其(从图像识别语音翻译)直接用于自己的应用程序内。谷歌的机器学习服务针对下列领域提供了易于访问的服务:视觉(物体识别、显性内容检测、人脸检测、图像情绪分析);语音(语音识别和语音到文字转换)文字分析(实体识别、情绪分析、语言检测和翻译);以及职员工作检索(机会呈现和基于资历匹配)。

    开源深度学习框架

    下面将对目前一些优秀的开源深度学习框架进行介绍,包括基于GPU的单机开源深度学习框架和融合了GPU的开源分布式深度学习框架。

    1. 单机开源深度学习框架

    目前拥有众多的学术机构如国际顶级名校加州大学伯克利分校,以及互联网巨头如Google、微软等开源的深度学习工具,比较成熟的基于GPU的单机开源深度学习框架有:

    Theano:深度学习开源工具的鼻祖,由蒙特利尔理工学院开发于2008年将开源。框架使用Python语言开发。与许多学术界和工业界有影响力的深度学习框架都构建在Theano之上,并逐步形成了自身的生态系统,这其中就包含了著名了Keras,Lasagne和Blocks。

    Torch:Facebook和Twitter主推的一款开源深度学习框架,Google和多个大学援救机构也在使用Torch。出于性能的考虑,Torch使用一种比较小众的语言(Lua)作为其开发的语言,目前在音频、图像及视频处理方面有着大量的应用。大名鼎鼎的AlphaGo便是基于Torch开发的,只不过在Google开源TensorFlow之后,AlphaGo将迁移到TensorFlow上

    TensorFlow:Google开源的一筐深度学习工具,使用C++语言开发,上层提供Python API。在开源之后,在工业界和学术界引起了极大的震动,因为TensorFlow曾经是著名Google Brain计划的一部分,Google Brain项目的成功曾经吸引了众多科学家和研究人员王深度学习这个“坑”里面跳,这也是当今深度学习如此繁荣的重要原因,足见TensorFlow的影响力。TensorFlow一直在往分布式方向发展,特别是在Spark平台上迁移。

    2. 分布式开源深度学习框架

    Google研究院JeffyDean在2012发表了一篇《Large Sacle DistributedDeep Networks》 对分布式环境下的深度学习算法设计原理进行了阐述,给出了深度学习在分布式环境下的两种不同的思路:规模并行化(Model parallelism)和数据并行化(Model Parellelism)。模型并行化将训练的模型分割并发送到各Worker节点上;数据并行化数据进行切分,然后将模型副本发送到各Worker节点,通过参数服务器(Parameter Server)对训练的参数进行更新。

    目前开源分布式深度学习框架大多数采用是数据并行化的方式进行设计。目前有两大类:框架自身具备分布式模型训练能力:构建在Hadoop生态体系内,通过分布式文件系统(HDFS)、资源调度系统(Yarn)及Spark计算平台进行深度学习模型训练。其中框架自身具备分布式模型训练能力的开源深度学习框架有:

    DSSTNE:亚马逊开源的一套深度学习工具,英文全名为Deep Sacalable Sparse Tensor Network Engine(DSSTNE),由C++语言实现,解决稀疏数据场景下的深度学习问题。值得一提的是,亚马逊在是否走开源的道路上一直扭扭捏捏,开源DSSTNE,似乎也是在Google、Facebook等巨头抢占开源深度学习领域高迪之后的无奈之举。

    Paddle:百度开源的并行分布式开源深度学些框架,由C++语言实现并提供Pyhton API。Paddle框架已经经过百度内部多个产品线检验,包括搜索光宝中的点击率预估、图像分类、光学字符识别、搜索排...

  • ?

    大数据是什么,未来10年到20年的发展趋势究竟是什么呢?

    阮若剑

    展开

    大数据是IT界的行业术语,本名叫巨量数据集合。

    大数据(big data),指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。

    在各种购物平台,用户所收到的购物产品推荐,就是运用大数据的结果。经常使用淘宝的人可能会有这种感触,前几天搜索了一款产品,后几天就会时常收到相关产品的推荐。不光是购物上,大数据还可用来为未来的形势做预估。伴随着大数据的普遍使用,未来大数据的应用已是必然趋势。

    在即将到来的10到20年之间,大数据的发展趋势必定更加迅猛。

    趋势一:数据的市场化

    当大数据进入人们的生活,所有的数据必定成为资源,而掌握了数据的人就会拥有较好的市场。日本有学者提出“生活者”的概念,意思是,随着社会化媒体的出现,消费者不再是单方面接受信息的买方,而是将所有与生活有关的信息都放在社会化媒体上的生命体。这时,不光是产品信息,消费者的兴趣、年龄、收入、产品反馈等都会被列入商家批量生产产品所要考虑的要素之列。而面对几千、几万计的消费者,普通信息统计已经不能满足需求,这时,就需要专门的大数据处理公司,或者是公司单独设立用户数据处理中心,使用大数据技术,更加精准地把握用户需求,这将会给企业带来意想不到的回报。

    趋势二:与云计算一起获得双赢

    网络用户呈现出爆炸式增长,传统的信息运算技术显然已经不能满足现在庞大的用户基数了,所以在这时,拥有强大计算能力的云计算技术成为大数据技术的好伙伴。本来需要很长时间才能处理的数据,在云计算的加入之下,很快就能处理好,大大提升企业、政府和社会组织的效率。除了云计算之外,物联网等新兴的技术为大数据提供数据来源,人们可选择的数据样本越来越丰富,大数据所能得出的结论可信程度将会日益提高。

    趋势三:数据处于泄露的巅峰

    大数据从哪儿来的呢?自然是从不同用户中抽取而来的。它为社会运转、企业盈利带来好处,但与此同时,很多问题也出现了。用户的信息被计算机一股脑儿的抓取,在这其中,人们的隐私也暴露了。随之而来的,是伦理上、法律上对大数据的争议。很多相关争论就此展开。在运用大数据时,人们不得不更加谨慎。

    趋势四:数据管理和质量成为核心竞争力

    马云在演讲时就说过:“大数据时代人人有机会,必须要有独特的视角把个人的能力与大数据结合起来,才能够发挥自己的最大优势。”

    当数据市场化之后,企业、组织和个人已经逐渐认识到大数据的重要性。为了能吸引用户,个性化推荐技术,根据用户信息制定的营销方案,已经为人们所青睐。但是,和技术运用相对应的,是技术的处理方式。在使用大数据时,要把握什么样的信息是重要的,什么样的是次要的。信息的管理者也需要建立数据库,利用好已经搜集到的数据,以便随时应用,在这个信息发达、创意频出的时代占领先机。

大数据是哪一年

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP