中企动力 > 商学院 > 大数据的数据来源
  • ?

    关于大数据,真的是你以为的吗?

    牧伯云

    展开

    每天人们在吃饭,睡觉,工作,娱乐都会产生数据——大量的数据。根据IBM(国际机器商业公司)记录,人类每天会产生2.5万亿字节的数据,这相当于一堆DVD到达月球又返回来,我们发送的所有文本,和我们上传到工业传感器指标的照片,以及机器之间的通信这么大的量。

    这是“大数据”成为一个很普遍的短语的重要原因。简单来讲,人们所谈论的大数据是指针对大量的数据,然后对它进行分析,最后把它转变成有用的东西的一种能力。

    精确的来讲,什么是大数据?

    然而,大数据远不止这些,

    它是关于:

    1、通常从多个来源,获取大量的数据,

    2、不仅仅只是大量的数据,而且都是不同类型的数据——就是在同一时间获取多种类型的数据,还有那些随时间变化的数据——他们并不需要在第一时间转换成一种特定的模式或者变成一致的,

    3、用这样的一种方式去分析数据,就是允许针对相同的数据池依据不同目的进行不间断的分析

    4、可以快速完成这些,即使是一些实时的数据

    在早期,工业提出,用首字母所写的方式来描述上述四个方面中的其中三个:VVV,分别是大量的(大量的数据),多样化(不同类型的数据,数据随时间变化的事实)以及速度(快速)。

    大数据VS数据仓库

    这个VVV首字母缩写缺失的是数据不需要进行永久性的改变(或转换)来对数据分析的关键概念。针对不同需求来对相同的数据池进行分析和可以对依据不同目的而收集的数据来进行分析。

    相比而言,数据仓库是为了满足特定的需求来对特定的数据进行分析而建立的,而且数据结构化然后转化为特定的格式,在这个过程中,基本上毁坏了原始的数据,特定的需求指的就是——没有别的——提取,转换,加载(ETL)。数据仓库的ETL仅限于对特定数据进行特定分析的处理。当你所有的数据都被存储在你的交换系统中时是极好的,但是在当今互联网连接的世界中,来自各个地方的数据并不是这样的。

    但是,你不要以为大数据使数据仓库过时了。虽然,大数据系统让你用随之而来的无结构化的数据进行工作,但是你所获得的查询结果远远不及数据仓库的复杂性,毕竟,数据仓库是为了深入数据而设计的,它可以做的很精确,因为它把全部的数据转化成同一种形式,这样可以让你做一些事情,例如,为了深入钻取而构建立方体。数据仓库的供应商花了好多年的时间使他们的查询引擎最佳化,查询引擎是用来回答业务环境中典型的询问。

    大数据可以让你从更多的来源中分析更多的数据,但是分辨率更低。因此,我们在很长一段时间内与传统的数据仓库和新型的大数据一起生活。

    在大数据之后,有了技术性的突破

    为了完成大数据的四个需求面——大量,多样化啊,非破坏化得使用,以及快速——需要有多种技术性的突破,包括分布式文件系统(Hadoop)的发展,一种快速了解不同数据的方法(首先是谷歌的MapReduce,然后是最近的Apache Spark),一个根据需求来进行访问和移动数据的云/互联网的基础设施。

    直到大约十几年前,在任何一个时间都不可能去操控相对少量的数据。(是的,当时我们都认为我们的数据仓库是巨大的,然而自从互联网产生并且与各地的数据开始连接之后,这种环境发生了明显的转变。)数据的存储量,计算能力,对从多个数据源收集的不同格式的数据的处理能力的局限性,使得所有的任务都是不可能完成的。

    接下来,在2003年左右,谷歌的研究者开发了MapReduce,该编程技术通过首先将数据映射到一系列键/值对来简化处理大数据集,然后对类似的键值进行计算把它们减少到单个的值,在成百上千的低成本的机器上来并行处理每一个数据块。这种巨大的并行性允许谷歌从越来越大量的数据中更快的产生查询结果。

    在2003年左右,谷歌创造了两个突破,使大数据变得可能:一个是Hadoop,它是由两个关键的服务组成:

    1、使用Hadoop分布式文件系统(HDFS)实现数据的可靠存储

    2、使用MapReduce技术使处理并行数据高效化

    Hadoop是使一系列的的商品,在无共享的服务器上运行的,在Hadoop这个集合上按照你的意愿来添加和删除服务;系统检测并补偿在任何服务器上的硬件或系统问题。换句话说,Hadoop是可以自我修复的,尽管系统发生改变或故障,它还是可以传递数据——运行大规模的、高性能的处理作业。

    尽管Hadoop为数据存储和并行处理提供了一个平台,但是真正有价值的还是技术的附加、交叉集成和自定义实现。为此,Hadoop提供了子项目,它给平台增加了新的功能:

    Hadoop Common:支持Hadoop的其他的子项目的普遍实用工具

    Chukwa:一个是为了管理更大的分布式系统数据收集系统

    HBase:可扩展的分布式数据库支持大量的结构化数据

    窗体顶端

    HHDGRG窗体底端

    HDFS: 一种分布式系统,可以对应用程序数据提供高吞吐量访问

    Hive:提供数据摘要和即席查询的数据仓库基础设施

    MapReduce:用于在计算集群上分布式处理大型数据集的软件框架

    Pig:并行计算的高级数据流语言和执行框架

    ZooKeeper:分布式应用程序的高性能协调服务

    Hadoop平台的大多数实施方案至少包含这些子项目中的一些,因为他们通常是开发大数据所必需的。例如,大多数组织选择使用HDFS作为主要的分布式系统,把HBase作为数据库,它可以存储十亿行的数据,MapReduce的使用和最新的Spark几乎是给定的,因为他们给Hadoop平台带来了速度和灵活性。

    使用MapReduce,开发人员可以在分布式处理器集群或者独立计算机上创建一个并行处理大量的非结构化数据的程序。MapReduce框架可以分为两个功能区域:

    Map:把工作包发送到分布式集群的不同节点的功能

    Reduce:整理工作并把结果解析成单个值的功能

    MapReduce的主要优点之一就是它是容错的,它是通过监视集群中的每个节点来完成的;预计每个节点会周期性地报道已经完成的工作和状态更新,如果每个节点保持静默的时间比预计间隔长,那么主节点会记录下来,并把这个工作重新分配给其他节点。

    Apache Hadoop,它是一个把MapReduce作为核心的开源框架,在两年之后开发出来。最初建成索引的搜索引擎是Nutch,而Hadoop现在几乎被用于广泛的大数据工作的主要行业。由于Hadoop的分布式文件系统和YARN(另一个资源协商者),这个软件让用户可以在数以千计的设备上传播大量的数据,就好像它们全都在一台巨大的机器上。

    2009年,加州大学伯克利分校的研究人员开发了ApacheSpark作为MapReduce的替代品,因为Spark使用内存存储执行并行计算,因此它可以比MapReduce快100倍。Spark可以作为一个单独的框架或在Hadoop内部工作。

    即使是使用Hadoop,你仍然需要一种存储和访问数据的方式。这通常是通过如MongoDB、CouchDB以及Cassandra这些数据库来完成,这专门适用于处理分布在大型机器上非结构化或半结构化的数据。与数据仓库不同的是,大量的并多类型的数据会被融合成统一的格式然后存储在单个数据存储中,这些工具不会改变底层属性和数据的位置---邮件还是邮件,传感器数据还是传感器数据---事实上,它们可以被存储在任何地方。

    尽管如此,在一个机器集群的数据库中想要存储大量的数据仍然不是容易的,除非你用它做了一些事情。这就是大数据分析的原理,像Tableau、Splunk和Jasper BI工具可以让你从语法上分析数据,以识别模式,提取意义并揭示新的见解。你所做的事情会因你的需求而不同。

    原文地址:https://infoworld/article/3220044/big-data/what-is-big-data-everything-you-need-to-know.html

  • ?

    大数据是怎么毁掉你的生活的?

    寄琴

    展开

    本文选自中信书院阅读时差栏目。阅读时差动态实时同步全球前沿新知,为你打破知识的国界。

    本期阅读时差为你分享的这本书是《大数据的真相》。

    透过书名不难看出,本书的目的就是让读者看清楚大数据的暗黑面,从而对大数据保持清醒、客观的认识。在今天,大数据已经不再是陌生的事物,从上网购物的广告精准投放,再到驾车出行的路线规划,都可以看到大数据的身影。在大数据的支持下,人们的生活越来越便捷,越来越智能。

    但是大数据的背后同样也隐藏着不为人知的阴暗面。因为大数据是依靠算法模型得来的,而算法模型是由人来设计的。所以,只要有人的参与,就势必会掺杂个人情感或认知偏见,导致得出的结论也难免会有失公允甚至还可能会带来歧视、扭曲事实、失去正义,造成不公平泛滥。

    所以,如果不能对大数据加以正确的引导,则可能会带来歧视、扭曲事实、失去正义,造成不公平泛滥。只有明确地将更好的价值观加入到大数据的算法中,我们才能创造出符合道德准则的大数据模型,从而更好地为人类服务。

    全文提纲

    围绕算法模型中存在的阴暗面,我们来分享一下大数据滥用的“四宗罪”:

    首先是偏见,看看大数据是怎样用技术包装偏见的;

    第二是逐利,看看掠夺式广告是怎样兜售虚假或高价承诺的;

    第三是剥削,分析大数据对底层人民的压榨式调度;

    最后一个是歧视,揭露大数据是如何给民众带来不公平待遇的。

    1

    偏见,大数据用技术包装偏见

    首先来看第一个重点内容:偏见,看看大数据是怎样用技术包装偏见的。

    我们知道,大数据的基础在于数据和模型,其中模型处于主导地位,能够从海量的数据中抽离出相对有用的部分,对外部环境进行抽象概括,从而得出结论指导现实。值得注意的是,模型的本性就是简单化,不可能囊括现实世界的复杂性或者人类交流的细微差别。在人的设置和干预下,有些信息不可避免地会被遗漏或突出,从而体现为偏见。这种偏见在大数据出现之前,是体现在过程之中,而大数据出现之后,偏见就提前埋伏在算法模型里了。因此,冰冷的计算机和数据化风险模型得出的结论,虽然看起来就是一副公正无私的样子,其实是把偏见隐藏在了更深的地方。

    来看一个带有种族偏见的数据模型。长期以来,种族是美国审判的一个主要因素。研究表明,在休斯顿市,对于同样罪行的犯人,检察官判非裔美国人死刑的几率比白人高三倍,判西班牙裔美国人死刑的几率比白人高四倍。为改变这种情况,美国有24个州的法院采用了一种再犯模型,帮助法官评估每一个罪犯构成的危险,减少法官的情绪和偏见所带来的影响。其中,一个叫做LSI–R的普及模型应用最为广泛。这个模型要求罪犯填写冗长的问卷调查。比如“你之前犯罪次数是多少?”“其他人对这次犯罪起了多大的作用?毒品和酒精对于你犯罪起了多大作用?”等等。

    这些问题看起来很正常,没毛病,但在实际操作中却存在问题。来自有特权背景的罪犯和来自治安差的平民街区的罪犯,答案肯定不一样。

    比如,同样问“你第一次遭遇警察”的原因,在舒适郊区长大的罪犯也许会告诉你这是第一次入狱,而来自平民街区的年轻的黑人男性很可能已经被警察多次拦截,即使他们什么错事也没做。

    研究报告显示,14-24岁的黑人男性和拉丁美洲男性仅占该市总人口的4.7%,但他们占被警察拦截盘查总人数的40.6%。而且,那些被盘查的人中90%多都是无辜的。然而根据模型统计,经常被拦截的嫌犯判分更高,更容易被模型分类为高风险等级,从而误导法官量刑。

    更严重的是,罪犯还会被问到出生和成长的环境,他们的朋友和亲戚是否有过犯罪记录等等。事实上,法官应该对所做的事情进行审判,而不是对嫌犯的身份进行审判。这些细节不应该和刑事案件或者量刑相关。

    然而,在LSI-R这样的数据模型下,原本身处底层社会的有色人种受到了更加严重的种族问题。“高风险”得分等级的人很可能是失业人员,而他的许多朋友和家人都触犯过法律。而且多年和一群罪犯关在一起,又增加了他再次犯罪的可能性。等他出狱时会回到同样的贫穷社区,有了犯罪记录,找工作就更难。如果他再犯罪,再犯模型又一次成功验证。事实上,正是这一模型导致了恶性循环,且一再地自行巩固。

    面对真实现状,作者禁不住提出疑问,我们是利用大数据彻底根除了人类偏见,还是只是用技术包装了人类偏见?答案其实就在眼前。

    2

    逐利,掠夺式广告通过大数据兜售虚假承诺

    说完偏见的问题,再来看看大数据的第二宗罪,逐利,来看看掠夺式广告,怎样通过大数据精确找出弱势群体,兜售虚假或高价承诺的。

    经常网上购物的朋友会发现,互联网会利用我们点击、阅读的习惯,确定偏好和模式,为我们在数百种模型中进行排名、分类以及评分。这为合法的广告奠定了强大的基础,但同时也助长了掠夺式广告的泛滥。

    掠夺式广告是什么呢?

    打个比方,如果人们缺钱,就提供大量高息发薪日贷款;如果他们的电脑运转缓慢,那它可能中了一个掠夺式广告携带的病毒,然后广告商提供修理服务。总的来说,在人们既有需求又很无知的任何地方,你都能看到掠夺式广告。

    掠夺式广告发现不平等,并大肆利用,最终的结果是巩固了现存的社会分层,加速对穷人的掠夺。

    作者认为,美国的营利性大学之所以如此繁荣,就是掠夺式广告的功劳。这些营利性大学就像江湖骗子一样,倾向于锁定最贫困地区的人,尤其是特别关注那些点击过贷款广告的人,然后利用他们的私密信息攻击他们。他们是怎样找到这些私密信息的呢?很多人在Google上搜索答案或者在填写问卷时,不知不觉中就暴露了自己的隐私。

    2010年,一条引人注目的广告刊登了奥巴马总统的照片,广告词为:“奥巴马呼吁妈妈们回到学校:完成你的学位,把助学金给有资格的人。”这则广告暗示,总统签署了一项旨在让母亲重返校园的新法案。但这是一个谎言。当消费者点击这个广告时,会被问到几个问题,包括年龄和电话号码,然后就会接到一所营利性学校的电话,主动提出帮她借钱申请入学。据报道,营利性大学20%-30%的广告预算都用于开发潜在客户。大学每收到一个最有希望的学生,就支付给提供者高达150美元的费用。

    美国底层40%的人口没有财富,普通家庭的负债平均为14800美元,其中大部分是利率过高的信用卡账户。而他们一直被灌输“赚钱的关键是接受教育”这样的理念。这些以盈利为目的的大学就通过大数据的模型,筛选出这些弱势群体,然后向他们承诺,只要接受教育就能够给他们一个美好未来。然而当学生入校之后,就会告知要通过各种贷款来解决学费问题,从而增加更多的债务。贫穷学生因此变得无望、绝望,怀疑教育的价值,加剧美国的贫富差距。

    不幸的是,除了营利性大学,还有很多利用掠夺式广告的公司。你只需要想一下人们的痛点在哪里,就会发现广告商在哪里使用掠夺性模型。数据支持的模型在不断地筛选我们的数据,搜寻我们的习惯、意愿、忧虑和渴望,推送的每一条广告都能够锁定最有效的信息,在对的时间出现在潜在客户眼前。

    精准信息触发顾客决定,从而成功地拖住又一个付费客户,使得掠夺者所花的每一分钱都能产生最大的效益。所以,站在掠夺式广告商的角度来看,穷人在搜索引擎上的查询和点过的优惠券,实际上是在呼叫特别关注。

    3

    剥削,大数据对底层人民的压榨式调度

    大数据模型不但干预生活,还能够给工作带来重大影响,有些负面影响甚至比周扒皮的半夜鸡叫有过之而无不及。这就是大数据的第三宗罪:剥削,来看看大数据对底层人民的压榨式调度。

    这主要体现在人力调度软件上。这种软件可以利用大数据分析顾客流量,精确计算出每一天、每小时他们需要多少人力,从而降低人力资源成本。比如,某天中午下雨,公园里的人可能会跑进咖啡店;每周五晚上大街上将出现更多的行人等等。软件能够根据这些情况变化合理配置人力,来匹配不断波动的需求。乍看之下,你会觉得这套机制很先进,但事实上却是一种赤裸裸的压榨。

    在低效率的经营模式下,职员有可预测的工作时间和固定的闲暇时间。有些人可以在工作时间读书,甚至做研究。现在,由电脑程序进行人力配置,职员每一分钟都很忙,几乎连个人时间也都被压榨一空。2014年,《纽约时报》报道过一个单亲妈妈简奈特·纳薇欧的遭遇,她的生活被大数据监控并影响。她一边努力读大学,一边在星巴克担任咖啡师,同时还得照顾她四岁的孩子。大数据指导下的工作调整,让纳薇欧的生活陷入混乱,无法安排固定的托儿服务,只好暂停学业。

    《纽约时报》这篇文章报道后几周内,遭到点名的大公司宣布将调整这种调度方式。但追踪报道显示,这些公司压根就没有信守承诺。归根结底,还是利润在作怪,像星巴克这种上市公司的商业模型,都是以提高盈利为目的的。

    人力调度软件对社会同样造成了极大的影响。像纳薇欧这样的群体,因为工作时间非常不稳定,不可能回学校念书,而这又损害了她的就业前途,只能当一名供大于求的低薪劳工。于是他们会格外焦虑,睡眠不足,继而产生剧烈的情绪波动。据统计,美国死在公路上的人估计有13%是因为睡眠不足。更糟糕的是,因为这种软件是来替企业省钱的,它们往往会将员工每周工作时间限制在30小时之内,这样公司就不必为他们提供医疗保险。在这种情况下,低薪劳工永无出头之日。

    4

    歧视,大数据给民众带来不公平待遇

    大数据不但成为资本家为虎作伥的帮凶,甚至还会加剧社会的不公。这就是大数据的第四宗罪:歧视,我们来看看大数据是如何给民众带来不公平待遇的。

    现在,大多数人都相信,数据越多越好。对于大数据来说确实如此。如果只关注很少的数据,那么只能呈现出相互独立、毫无关联的点;而将更多的数据纳入模型,就能够构建出事物的整体面貌。但同时,这些大量的数据来源于规模巨大的群体,忽略了相对较少的个体。而且,这种模型使用频率越高、数据量越大,越能够增加这种不公平的待遇。

    我们来看暴力犯罪的大数据模型案例。有一款软件叫做“预防政策”,原本这是一个地震预测软件,但应用到犯罪预测领域,不但能够定位犯罪最有可能发生的地方,还能预测连续犯罪。这主要是源于警察局把“轻微犯罪”的数据纳入“预防政策”这个软件中。这些数据包括天天发生的商店行窃、小额欺诈,甚至是违规停车。

    英国肯特郡警察局在2013年尝试使用“预防政策”软件,确实奏效了。根据“预防政策”的指引,在指定广场巡逻的效率是随机巡逻的十倍,精确度是警方情报分析的两倍。那么,模型最擅长预测的是什么类型的犯罪呢?答案是包括随意大小便的醉汉、小偷小摸的偷车贼等等的轻微犯罪。

    但最令人可悲的是,大数据勾勒出的犯罪地图证实,大部分罪行都是穷人干的。为什么会得出这样的结论呢?这里面固然有穷人的比例远高于富人的原因,同时也有数据模型和警察的原因。为了支撑大量的数据,警察就会把各种轻微犯罪录入模型,而模型又反馈出穷人犯罪的高概率。

    反过来看,那些富人实施的犯罪行为都哪去了?是他们奉公守法吗?当然不是。作者写道,在本世纪头十年,金融大亨通过撒谎、欺诈几乎摧毁了全球经济,使得数以百万计的人失去了家园、工作和医疗保障,犯下了滔天罪行。但是,联邦调查局和证券交易委员会的调查人员却拿他们没有任何办法。富人们在政治家身上投入了大量资金,而且他们经营的银行直接影响到国家经济,因此受到了保护。除了一些像庞氏骗局操作者伯纳德·马多夫这样的极端犯罪,金融家不会被逮捕。更何况这个群体在2008年的市场崩盘中几乎毫发无损,现在依然逍遥法外,享受特权。

    在这种情况下,尽管“预防政策”是一个非常有益、甚至高尚的软件工具,但它也成为了数学毁灭武器。“预防政策”软件授权警察局锁定穷人,拦截更多穷人,逮捕一部分穷人,把一些穷人罪犯关进监狱。现在,有了大数据的支持,警方更加捍卫了他们在这一行为的合法性,与此同时增加了办案的精确性和“科学性”。结果是,我们把贫困看作是犯罪,相信我们的工具既科学又公平。

    这突出了数学毁灭武器的另一个常见特征,即往往惩罚穷人。部分原因是数学模型是用来评估数量多的人群。相反...

  • ?

    大数据的四个“V”

    Stev

    展开
    大数据培训

    文如题,今天我们重点来介绍一下大数据的四个”V”,其实这四个“V”也影射出了大数据行业的特点,如果连大数据的特点都不知道,那就要是去参加大数据培训的话,那可就有点尴尬了。

    大数据课程

    第一,多样化(variety)。这里包含两个方面,一个是数据来源多样化,就是我们采集的数据通过不同的渠道,不同平台产生的多样化;还有就是数据的结构数据多样,有结构化的和结构化的等等。

    第二,就是大量化(volume),这个我们比较好了解,毕竟名字就带着这个意思。互联网的发展规模,我们每天通过它产生的数据也是与日俱增,现在我们可能一年里产生的数据量,都能和之前的史上数据相匹敌了,大量化实至名归啊。

    而第三个“V”,叫做速度化(velocity)。这里面涉及到大数据的整个流程,比如数据的增长速度,还有我们对数据的处理速度,很多类型的数据我们已经能够做到时时反馈了,刚刚收集到马上就能反过来影响我们的生活。

    而最后一个相对于前三个来说有点陌生,叫做价值密度低(value)。也就是大数据虽然数量巨大,但是也不是越多越好的,其中有很多都是没意义的,有用的数据就被淹没在这海量的没用数据之中了,而这一点也是大数据技术的工作难点之一,要将那些海量无用的、复杂的数据做深度的分析,从其中挖掘那些对我们来说是有价值的数据。

    说完这些,再来回忆我们之前对大数据的认知,是不是有些迷茫的点变得清晰了,对大数据也有了一个更深的理解了吧。这回我们再去大数据培训,心里也有了底气了。如果你想了解更多大数据知识,记得点赞,分享我的文章,虽然篇幅不是很长,但是会对大家有所帮助,小编在这里谢过啦!

  • ?

    所谓大数据,那到底什么才是大数据?

    安雨珍

    展开

    世界包含的多得难以想象的数字化信息变得更多更快,从商业到科学,从政府到艺术,这种影响无处不在。科学家和计算机工程师们给这种现象创造了一个新名词:“大数据”。所谓大数据,那到底什么是大数据,他的来源在哪里,定义究竟是什么呢?

    一:大数据的定义。

    1、大数据,又称巨量资料,指的是所涉及的数据资料量规模巨大到无法通过人脑甚至主流软件工具,在合理时间内达到管理、处理、并整理成为帮助企业经营决策更积极目的的资讯。

    2、大数据技术,是指从各种各样类型的大数据中,快速获得有价值信息的技术的能力,包括数据采集、存储、管理、分析挖掘、可视化等技术及其集成。

    3、大数据应用,是指对特定的大数据集合,集成应用大数据技术,获得有价值信息的行为。对于不同领域、不同企业的不同业务,甚至同一领域不同企业的相同业务来说,由于其业务需求、数据集合和分析挖掘目标存在差异,所运用的大数据技术和大数据信息系统也可能有着相当大的不同。

    二:大数据的类型和价值挖掘方法

    1、大数据的类型大致可分为三类:

    1)传统企业数据:包括消费者数据,传统的ERP数据,库存数据以及账目数据等。2)机器和传感器数据:包括呼叫记,智能仪表,设备日志,交易数据等。3)社交数据:包括用户行为记录,反馈数据等。2、大数据挖掘商业价值的方法主要分为四种:1)客户群体细分,然后为每个群体量定制特别的服务。2)模拟现实环境,发掘新的需求同时提高投资的回报率。3)加强部门联系,提高整条管理链条和产业链条的效率。4)降低服务成本,发现隐藏线索进行产品和服务的创新。

    三:大数据的特点

    具体来说,大数据具有4个基本特征:

    1、是数据体量巨大

    2、是数据类别大和类型多样3、是处理速度快4、是价值真实性高和密度低

    四:大数据的作用

    1、对大数据的处理分析正成为新一代信息技术融合应用的结点移动互联网、物联网、社交网络、数字家庭、电子商务等是新一代信息技术的应用形态,这些应用不断产生大数据。云计算为这些海量、多样化的大数据提供存储和运算平台。通过对不同来源数据的管理、处理、分析与优化,将结果反馈到上述应用中,将创造出巨大的经济和社会价值。2、大数据是信息产业持续高速增长的新引擎面向大数据市场的新技术、新产品、新服务、新业态会不断涌现。在软件与服务领域,大数据将引发数据快速处理分析、数据挖掘技术和软件产品的发展。3、大数据利用将成为提高核心竞争力的关键因素各行各业的决策正在从“业务驱动” 转变“数据驱动”。对大数据的分析可以使零售商实时掌握市场动态并迅速做出应对;可以为商家制定更加精准有效的营销策略提供决策支持;可以帮助企业为消费者提供更加及时和个性化的服务;4、大数据时代科学研究的方法手段将发生重大改变,抽样调查是社会科学的基本研究方法。在大数据时代,可通过实时监测、跟踪研究对象在互联网上产生的海量行为数据,进行挖掘分析,揭示出规律性的东西,提出研究结论和对策。

    五:大数据的商业价值

    1、对顾客群体细分

    2、模拟实境3、提高投入回报率4、数据存储空间出租5、管理客户关系6、个性化精准推荐7、数据搜索

    六:大数据对经济社会的重要影响

    1、能够推动实现巨大经济效益2、能够推动增强社会管理水平3、如果没有高性能的分析工具,大数据的价值就得不到释放

  • ?

    8个公开大数据网站推荐,帮数据收集的新手入门!

    阿维克修

    展开

    如果您对传统企业互联网转型、大数据、工业4.0等内容的文章、资料、PPT等感兴趣(有提供下载哦~),欢迎关注强企阅闻公众号。

    来源/钱塘大数据

    在这个用数据说话的时代,能够打动人的往往是用数据说话的理性分析,无论是对于混迹职场的小年轻,还是需要数据进行分析和研究的同学,能够找到合适的数据源都是非常重要的。特别是想要对一个新的领域进行研究和探索,拥有这个领域的数据那都是有十分重要的意义的。

    1.- 国家数据 -

    http://data.stats.gov/index.htm

    数据来源于中国国家统计局,包含了我国经济民生等多个方面的数据,并且在月度、季度、年度都有覆盖,较为全面和权威,对于社会科学的研究不要太有帮助。最关键的是,网站简洁美观,还有专门的可视化读物。

    2.- CEIC -

    http://ceicdata/zh-hans

    最完整的一套超过128个国家的经济数据,能够精确查找GDP, CPI, 进口,出口,外资直接投资,零售,销售,以及国际利率等深度数据。其中的“中国经济数据库”收编了300,000多条时间序列数据,数据内容涵盖宏观经济数据、行业经济数据和地区经济数据。

    3.- wind(万得)-

    http://wind/

    万得被誉为中国的Bloomberg,在金融业有着全面的数据覆盖,金融数据的类目更新非常快,据说很受国内的商业分析者和投资人的亲睐。

    4.- 搜数网 -

    http://soshoo/

    已加载到搜数网站的统计资料达到7,874本,涵盖1,761,009张统计表格和364,580,479个统计数据,汇集了中国资讯行自92年以来收集的所有统计和调查数据,并提供多样化的搜索功能。

    5.- 中国统计信息网 -

    http://tjcn.org/

    国家统计局的官方网站,汇集了海量的全国各级政府各年度的国民经济和社会发展统计信息,建立了以统计公报为主,统计年鉴、阶段发展数据、统计分析、经济新闻、主要统计指标排行等。

    6.- 亚马逊aws -

    http://aws.amazon/cn/datasets/?nc1=h_ls

    来自亚马逊的跨科学云数据平台,包含化学、生物、经济等多个领域的数据集。

    7.- figshare -

    https://figshare/

    研究成果共享平台,在这里你会发现来自世界的大牛们的研究成果分享,同时get其中的研究数据,内容很有启发性,网站颇具设计感。

    8.- github -

    https://github/caesar0301/awesome-public-datasets

    如果觉得前面的数据源还不够,github上的大神已经为大家整理好了一个非常全面的数据获取渠道,包含各个细分领域的数据库资源,自然科学和社会科学的覆盖都很全面,简直是做研究和数据分析的利器。

    随便上几个图,满满的都是资源啊

    免责声明:本公众号所载文章为本公众号原创或根据网络搜集编辑整理,文章版权归原作者所有。如涉及作品内容、版权和其他问题,请与我们联系! 文章内容为作者独立观点 ,并不代表兮易强企赞同或支持其观点。

  • ?

    什么样的数据才算大数据?——大数据的特性

    芬妮

    展开

    什么是大数据?大数据就是指在一定时间范围内无法使用传统数据库工具对其进行捕捉、管理、计算、分析和处理的数据集合,大数据有以下四个特性:海量的数据规模(Volumn),数据类型繁多(Variety),数据流转速度极快(Velocity)以及价值密度较低(Value),我们就说说这四大特性。

    海量的数据规模

    我们接触最多最敏感的数据那就是我们手机所购买的流量,最常见的数据计量单位为K、M和G,他们的关系为1G=1024M,1M=1024KB。也许你也听过TB,1TB=1024G,这个数据单位对我们来世已经相当庞大了,我们的笔记本最大的容量也就在1TB这个级别,但是在大数据眼里最小的数据也得10TB起,比TB级还大的数据计量单位还有吗?有,而且还很多,1PB=1024TB,1EB=1024PB,1ZB=1024EB,1YB=1024ZB......我们已经无法感知这么大的数据量了。截止到2011 年,互联网用户数已达到20 亿; RFID 标签在2005 年的保有量仅有13亿个,但是到2010 年这个数字超过了300 亿;2006 年资本市场的数据比2003 年增长了17.5倍;日前新浪微博上每天上传的微博数超过1 亿条;Facebook 每天处理10TB 的数据;世界气象中心积累了220TB 的Web 数据,9PB 其他类型数据……

    极快的数据流转

    数据具有一定的时效性,是不停的变化的,可以随时间数据量逐渐增大,也可在空间上不断移动变化的数据。如果我们采集到的数据不经过流转,最终会过期作废。客户的体验在分秒级别,海量的数据,带来的第一个问题就是大大延长了各类报表生成时间,我们能否在极端的时间内提取最有价值的信心呢?数据在1秒内得不到流转处理,就会给客户带来较差的使用体验,若我们的数据处理软件达不到“秒”处理,所带来的商业价值就会大打折扣。

    价值密度低

    尽管大数据的数据量巨大,但是有价值的信息极少,我们要通过分析才能将大数据从数据到价值的转变,这些工作量极其庞大,所以云计算是一个很好的解决途径。以监控视频为例,一小时的视频,在不间断的监控过程中,可能有用的数据仅仅只有一两秒。

    数据种类繁多

    数据的格式是多样化的,如文字、图片、视频、音频、地理位置信息等,也可以是不同的数据类别,也可以有不容的来源,如传感器、互联网。首先用户是一个复杂的个体,单一的行为数据是不足以描述用户的各种行为,多元化的信息采集处理就像拼图一样,逐渐勾勒出我们身体的骨架,增添上我们的血肉。我们在淘宝、京东购物时,总会在下面的推荐区推荐我们想要的东西,比如我们去频繁的搜索浏览某件商品,这是他们就会采集我们浏览的数据,从中挖去有价值的信息,推送给我们。所以说这样的模式给一种体验,那就是这些app越来越懂我们的爱好和需求。

    大数据未来会渗透在很多领域,大数据与云计算,机器学习与人工智能,物联网,区块链等。

  • ?

    都说大数据,你知道到底什么是大数据吗?

    着凉

    展开

    俺黑君够黑,慎关注!

    究竟什么是大数据?如何对大数据进行定义?大数据有哪些特征?了解了这些才能更好的知道自己学习是怎样的一门技术,以及它的前景如何。本文达妹就带大家一起了解大数据。

    DT时代,人人言必称大数据,所有的新系统几乎都是基于大数据,有人认为用了MongoDB就是大数据,也有人用了Hadoop就是大数据,或者认为数据量大就是大数据。

    更有甚者,笔者看到一篇新闻报道,说某企业成功实施大数据项目,结果只是SQL-Server集群……天呐,这可是上世纪的技术了!

    说了这么多到底什么是大数据呢,其实大数据并没有教科书式的明确定义,但是却有比较公认的特性描述,符合这些特性的就可以称作大数据,即大数据的4个V。

    第一个V——高容量

    这个最好理解,数据量一定要大,才好意思称自己为大数据嘛。大到什么程度呢?依目前行情来看,至少也要到TB级,很多案例都是PB甚至更高。但如果是GB级,非说自己是大数据也不是不可以,就是有点无颜见江东父老啊……

    第二个V——多样化

    这个很关键了!是区别于以往海量数据挖掘的最主要特征。它有两层含义,一是数据来源多样化,系统数据、设备日志、传感器、文件系统等等来源。二是数据结构多样化,这是核心特征!要包含结构化数据、非结构数据(包括所谓半结构化数据)。

    总结起来就是,多源异构。这就是为什么有人认为使用NoSQL数据库(如MongoDB)就是大数据了,因为满足了多样化的特征,但其实还不够。

    第三个V——高速

    即时效性,基本上至少也要达到亿级数据一秒查询,做的比较好的可以达到千亿级数据一秒查询。这个特征几乎决定了传统技术架构无法满足要求,因此Hadoop架构的出现催化了大数据的发展,也是有人认为Hadoop就是大数据的原因。

    第四个V——价值

    这个很好理解,数据一定要有价值、而后才能产生价值。就好比存商品的叫才能仓库,存垃圾的叫垃圾填满坑一样。没价值的数据就像一个垃圾填满坑,这也是为什么数据治理在大数据实施中非常重要的原因之一。

    最后,也是最重要的,以上4个V是逻辑与的关系,即需同时、注意是同时满足上述四个特征,就可以放心的说自己是大数据了!

    文版权归原作者所有。转载文章仅为传播更多信息之目的,如有侵权请与我们联系,我们将及时处理。

  • ?

    什么是大数据和大数据平台?

    思枫

    展开

    “大数据”时下一个热门的词语,近几年来,关于大数据的著作和文章铺天盖地,似乎也在共同在传递一个信息:越来越多的行业、人士开始关注并实际探索大数据的应用,我们正在一起描绘着大数据巨大效用的蓝图,但在实践的路上,我们都孩子起步阶段小步前行。

    大数据根基于互联网,数据仓库、数据挖掘、云计算等互联网技术的发展为大数据应用奠定基础。对于任何一个大数据的从业者或初接触者,或者都会有个共同的感触:大数据很有用!但大数据是什么呢?

    今天就给大家讲解一下:

    对于大数据的定义,我们来引用3个比较差用的大数据定义:

    1)Gartner:需要信息处理模式才能具有更强的决策力,洞察发现力和流程优化能力的海量、高增长率很多样化的信息资产。

    2)IDC:海量的数据规模(Volunme)、快速的数据流转和数据体系(Velocity)、多样的数据类型(Variety)、巨大的数据价值(Value)。

    3)Wiki:或称巨量数据、海量数据、大资料,指所涉及的数据量规模巨大到无法通过人工,在合理时间内达到截取、管理、处理、并整理成为人类所能解读的信息。

    其他关于大数据的定义也大抵类型,我们可以用几个关键词对大数据做一个界定。

    首先,“大规模”,这种规模可以从两个维度来衡量,一是时间序列累积大量的数据,二是在深度上更加细化的数据。

    其次,“多样化”,可以是不同的数据格式,如文字、图片、视频等,可以是不同的数据类别,如入口数据,经济数据等,还可以有不同的数据来源,如互联网、传感器等。

    最后,“动态化”,数据是不停变化的,可以随着时间快速增加大量数据,也可以是在空间上不断移动变化的数据。

    这三 个关键词对大数据从形象上做了界定。

    但是还需要一个关键能力,就是“处理速度快”。如果这么大规模、多样化又动态变化的数据有了,但需要很长的时间去处理分析,那不叫大数据。从另一个角度,要实现这些数据快速处理,靠人工肯定是没办法实现的,因此,需要借助于机器实现。

    最终,我们借助机器,通过对这些数据进行快速的处理分析,获取想要的信息或者应用的整套体系,才能称为大数据。

    我们可以用下面的图示给大数据定义:

    这下,就知道什么是大数据了吧

  • ?

    大数据分析及其数据来源

    费复天

    展开

    提到大数据,就不得不说大数据分析。说到大数据分析,第一步需要确定数据分析的方向和将要解决的问题,然后才会确定所需数据和大概的分析范围。大数据驱动的分析主要的挑战不是技术手段问题,而是分析方向和组织领导的问题,要确定方向,提出问题,并解决问题,都需要对大数据有很深入的了解。当然,大数据分析最核心的,是关于数据的来源。在信息获取量和数据量非常大的今天,如何获取到自己想要的数据,如何获取到真实的数据,如何高效利用所拥有的数据都是我们需要不断探讨的问题。

    大数据分析 概念

    大数据分析,顾名思义,就是对规模巨大的数据进行分析,是研究大量的数据的过程中寻找模式,相关性和其他有用的信息,可以帮助企业更好地适应变化,并做出更明智的决策。

    大数据分析首先要将杂乱排列的大数据进行处理,转换成简洁,高效,能让数据使用者一眼看懂的数据。所以就要将数据进行“抽取—转换—加载”(the Extract-Transform-Load,ETL),这就是所谓的数据处理三部曲。该环节需要将来源不同、类型不同的数据如关系数据、平面数据文件等抽取出来,然后进行清洁、转换、集成,最后加载到数据仓库或数据集市中,成为联机分析处理、数据挖掘的基础。看似大数据处理三部曲对于我们来说带来了很大的好处,但是却因为数据处理本身的局限性给我们造成一定困扰。比如,大数据产生的相关关系可能是虚假的,在完全随机的数据中显示了某些规律,因为数据的量非常大,可能产生向各个方向辐射的各种联系,有可能会得到与事实完全相反的结论。但是只要数据足够大,数据挖掘总能发现一些相关关系,可以帮助我们发现趋势和异常情况。

    数据来源

    大数据分析的数据来源有很多种,包括公司或者机构的内部来源和外部来源。分为以下几类:

    1、交易数据。包括POS机数据、信用卡刷卡数据、电子商务数据、互联网点击数据、“企业资源规划”(ERP)系统数据、销售系统数据、客户关系管理(CRM)系统数据、公司的生产数据、库存数据、订单数据、供应链数据等。

    2、移动通讯数据。能够上网的智能手机等移动设备越来越普遍。移动通信设备记录的数据量和数据的立体完整度,常常优于各家互联网公司掌握的数据。移动设备上的软件能够追踪和沟通无数事件,从运用软件储存的交易数据(如搜索产品的记录事件)到个人信息资料或状态报告事件(如地点变更即报告一个新的地理编码)等。

    3、机器和传感器数据。来自感应器、量表和其他设施的数据、定位/GPS系统数据等。来自物联网的数据可以用于构建分析模型,连续监测预测性行为(如当传感器值表示有问题时进行识别),提供规定的指令(如警示技术人员在真正出问题之前检查设备)等。

    4、互联网上的“开放数据”来源,如政府机构,非营利组织和企业免费提供的数据。

    5、人为数据即通过人类行为产生的数据。人为数据包括电子邮件、文档、图片、音频、视频,以及通过微信、博客、推特、维基、脸书等社交媒体产生的数据流。这些数据大多数为非结构性数据,需要用文本分析功能进行分析。

    总之,知道了大数据分析方法及数据来源,可以让我们更好的利用大数据为我们创造价值。

    关注佳源信息,关注更多资讯。

    【版权与免责声明】如发现内容存在版权问题,烦请提供相关信息发邮件至jy@jiayuaninfo,我们将及时沟通与处理。

  • ?

    大数据是什么?大数据时代四个特点

    Doris

    展开

    大数据是什么?其实很简单,大数据其实就是海量资料巨量资料,这些巨量资料来源于世界各地随时产生的数据,在大数据时代,任何微小的数据都可能产生不可思议的价值。大数据有4个特点,为别为:Volume(大量)、Variety(多样)、Velocity(高速)、Value(价值),一般我们称之为4V。

    大数据

    所谓4V,具体指如下4点:

    1.大量。大数据的特征首先就体现为“大”,从先Map3时代,一个小小的MB级别的Map3就可以满足很多人的需求,然而随着时间的推移,存储单位从过去的GB到TB,乃至现在的PB、EB级别。随着信息技术的高速发展,数据开始爆发性增长。社交网络(微博、推特、脸书)、移动网络、各种智能工具,服务工具等,都成为数据的来源。淘宝网近4亿的会员每天产生的商品交易数据约20TB;脸书约10亿的用户每天产生的日志数据超过300TB。迫切需要智能的算法、强大的数据处理平台和新的数据处理技术,来统计、分析、预测和实时处理如此大规模的数据。

    2.多样。广泛的数据来源,决定了大数据形式的多样性。任何形式的数据都可以产生作用,目前应用最广泛的就是推荐系统,如淘宝,网易云音乐、今日头条等,这些平台都会通过对用户的日志数据进行分析,从而进一步推荐用户喜欢的东西。日志数据是结构化明显的数据,还有一些数据结构化不明显,例如图片、音频、视频等,这些数据因果关系弱,就需要人工对其进行标注。

    大数据

    3.高速。大数据的产生非常迅速,主要通过互联网传输。生活中每个人都离不开互联网,也就是说每天个人每天都在向大数据提供大量的资料。并且这些数据是需要及时处理的,因为花费大量资本去存储作用较小的历史数据是非常不划算的,对于一个平台而言,也许保存的数据只有过去几天或者一个月之内,再远的数据就要及时清理,不然代价太大。基于这种情况,大数据对处理速度有非常严格的要求,服务器中大量的资源都用于处理和计算数据,很多平台都需要做到实时分析。数据无时无刻不在产生,谁的速度更快,谁就有优势。

    4.价值。这也是大数据的核心特征。现实世界所产生的数据中,有价值的数据所占比例很小。相比于传统的小数据,大数据最大的价值在于通过从大量不相关的各种类型的数据中,挖掘出对未来趋势与模式预测分析有价值的数据,并通过机器学习方法、人工智能方法或数据挖掘方法深度分析,发现新规律和新知识,并运用于农业、金融、医疗等各个领域,从而最终达到改善社会治理、提高生产效率、推进科学研究的效果。

    大数据

    在大数据时代,每个人都会享受到大数据所带来的便利。买东西可以足不出户;有急事出门可以不用再随缘等出租车;想了解天下事只需要动动手指。虽然大数据会产生个人隐私问题,但总的来说,大数据还是在不断的改善我们的生活,让生活更加方便

    若是对大数据是什么仍然还有疑问,可以留言或者关注私信一起交流。

大数据的数据来源

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP