中企动力 > 商学院 > 大数据信息数据
  • ?

    大数据时代,掌握大数据等于掌握掌握世界

    禹扬

    展开

    什么是大数据?

    大数据是指无法在一定时间内用常规软件工具对其内容进行抓取、管理和处理的数据集合。大数据技术,是指从各种各样类型的数据中,快速获得有价值信息的能力。适用于大数据的技术,包括大规模并行处理(MPP)数据库,数据挖掘电网,分布式文件系统,分布式数据库,云计算平台,互联网,和可扩展的存储系统。

    大数据有何作用?

    第一,对大数据的处理分析正成为新一代信息技术融合应用的结点。移动互联网、物联网、社交网络、数字家庭、电子商务等是新一代信息技术的应用形态,这些应用不断产生大数据。云计算为这些海量、多样化的大数据提供存储和运算平台。通过对不同来源数据的管理、处理、分析与优化,将结果反馈到上述应用中,将创造出巨大的经济和社会价值。大数据具有催生社会变革的能量。但释放这种能量,需要严谨的数据治理、富有洞见的数据分析和激发管理创新的环境(Ramayya Krishnan,卡内基·梅隆大学海因兹学院院长)。

    第二,大数据是信息产业持续高速增长的新引擎。面向大数据市场的新技术、新产品、新服务、新业态会不断涌现。在硬件与集成设备领域,大数据将对芯片、存储产业产生重要影响,还将催生一体化数据存储处理服务器、内存计算等市场。在软件与服务领域,大数据将引发数据快速处理分析、数据挖掘技术和软件产品的发展。

    第三,大数据利用将成为提高核心竞争力的关键因素。各行各业的决策正在从“业务驱动” 转变“数据驱动”。对大数据的分析可以使零售商实时掌握市场动态并迅速做出应对;可以为商家制定更加精准有效的营销策略提供决策支持;可以帮助企业为消费者提供更加及时和个性化的服务;在医疗领域,可提高诊断准确性和药物有效性;在公共事业领域,大数据也开始发挥促进经济发展、维护社会稳定等方面的重要作用。

    第四,大数据时代科学研究的方法手段将发生重大改变。例如,抽样调查是社会科学的基本研究方法。在大数据时代,可通过实时监测、跟踪研究对象在互联网上产生的海量行为数据,进行挖掘分析,揭示出规律性的东西,提出研究结论和对策。

    了解了大数据的概念和作用,我们先来看一下商业巨头们如何利用大数据吧。

    一、谷歌公司(google Inc)

    第一个 :ReCAPTCHA案例。

    这个虽然是被谷歌收购的,但是,具有典型的谷歌思维。为了解决垃圾邮件和网络机器人的问题,冯.安发明了验证码的解决方案。如果只限于此,也就没有特别可以称道的,但是他意识到每天有这么多人要浪费10秒钟的时间输入这堆恼人的字母,而随后大量的信息被随意地丢弃时,他开始寻找能使人的计算能力得到更有效利用的方法。 他想到了一个继任者,恰如其分地将其命名为ReCaptcha。和原有随机字母输入不同,人们需要从计算机光学字符识别程序无法识别的文本扫描项目中读出两个单词并输入。其中一个单词其他用户也识别过,从而可以从该用户的输入中判断注册者是人;另一个单词则是有待辨识和解疑的新词。为了保证准确度,系统会将同一个模糊单词发给五个不同的人,直到他们都输入正确后才确定这个单词是对的。在这里,数据的主要用途是证明用户是人,但它也有第二个目的:破译数字化文本中不清楚的单词。ReCaptcha的作用得到了认可,2009年谷歌收购了冯·安的公司,并将这一技术用于图书扫描项目,再后来,谷歌街景也开始使用这项技术。把验证码和OCR需求巧妙结合起来,这展示了思维的威力,实现了ReCaptcha技术提供者和使用者的双赢,技术提供者利用OCR识别获得了自己的受益,使用者不需要任何付费(互联网免费思维),也愿意使用,对于用户其实也没有影响,没有增加额外的工作。上研究生的时候,就研究OCR汉字识别问题,识别率始终是个问题,对于手写就更低了,要花费大量人力来解决,并且,人工识别工作是非常无聊,没有办法来保障质量。再想起12306的验证码,更令人无语了。我们浪费了多少资源?我们有多少资源可用充分来利用?

    第二个:拼写检查纠错的案例。

    我们都经常使用微软的Word,其中就有拼写检查纠错功能,微软实现这个功能,采用的是传统的软件思维,也就是利用规则和词库来解决,这个需要不断耗费人力进行规则和词库的升级,对于不同的语言,耗费更是巨大。谷歌解决这个方法,用的相对巧妙,在搜索的时候,当你输入一个错误的词时,会给一个提示,要找的是不是建议的词,如果用户确认后,谷歌就进行记录处理,后面,再经过一些算法处理,经过大量的数据学习,各个拼写检查纠错就越来越好,并且,这个后续维护成本很低, 效果越来越好。其实,谷歌翻译也使用了类似的思路,虽然前期算法,包括大数据处理花费了比较多,后续,基本实现了自动化,系统会越来越强,维护升级成本很低,项目就变成可持续发展。

    第三个:对流感的预测

    2009年,一种新型的流感病毒h1n1在全球迅速传播开来。美国,和世界上所有的国家一样,要求医生们发现案例市告知疾病控制与预防中心。但是,人们并不是在第一时间去医院检查,而是会有一段时间的延迟,消息要传达到疾控中心也要时间,从而造成一定的滞后性。

    在该病毒爆发的几周前,谷歌公司的工程师们在《自然》杂志上发表了一篇论文。文中解释了谷歌为什么能够预测冬季流感的传播:不仅是全美范围内,而且具体到特定的地区和州。

    谷歌如何做到的呢?数据。

    谷歌通过观察人们在网上的搜索记录来完成这个预测,谷歌保存了多年来所有的搜索记录,每天都会超过30亿条的搜索指令。如此庞大的数据资源才能支撑谷歌完成这项工作。

    二、facebook。

    Facebook(脸书)是美国的一个社交网络服务网站 ,创立于2004年2月4日,总部位于美国加利福尼亚州帕拉阿图,2012年3月6日发布Windows版桌面聊天软件Facebook Messenger ,主要创始人马克·扎克伯格。它是世界排名领先的照片分享站点,截至2013年11月每天上传约3.5亿张照片、截至2012年5月,拥有约9亿用户。Facebook的总部设在硅谷的门洛帕克(Menlo Park)——1 Hacker Way 从2006年9月11日起,任何用户输入有效电子邮件地址和自己的年龄段,即可加入。在2015年8月28日,单日用户数突破10亿。

    fancebook,拥有这庞大数据,同时它也不会浪费这些数据。Facebook通过用户社交网络图得知人们的喜好、

    说完了,我们转过头看一下我们国内。

    大数据现今在国内也是蓬勃发展,让我让数据说话!

    大数据企业发展态势

    态势一:2017年,我国大数据企业依旧整体呈现“金字塔”状的实力分布,从金字塔上层来看,我国大数据企业发展指数高于50的企业数量占比仅为7.4%,与去年相比,中高区间的龙头企业发展指数均有不同程度的提升,体现出“强者恒强”的发展势头。2017年,随着新晋企业数量增多、初创企业发展活力不断提升,金字塔根基更趋稳固;专精特新的独角兽企业发展势头迅猛,成为我国大数据企业发展的中坚力量。

    态势二:2017年,我国大数据企业基础画像指数呈现较为明显的三重集团趋势,可以分为领军企业(数量占比9.23%,指数跨度从62.50到10.46)、中坚企业(数量占比29.49%,指数跨度从9.89到1.00)、上升企业(数量占比为50.16%,指数跨度从0.98到0.001)三类企业。从构成占比上看,2017年,我国大数据领军企业占比基本维持不变,而中坚企业占比显著增加,上升企业比例对比2016年有较为明显的减少。

    态势三:2017年,我国大数据企业技术研发指数呈现“龙头领先、中小微主体跟进”总体趋势,技术研发指数超过10的龙头企业数量占比为9.85%,低于10的企业占比达到90.15%。大数据企业技术研发指数平均值为4.06,同比2016增长了3.18%,其中,以华为、中兴等通信企业和BAT等互联网企业为代表的TOP20龙头企业的技术研发指数同比2016年增长了5.73%。

    态势四:2017年,我国大数据企业市场拓展指数呈现出“龙头带动、全面壮大”的分布格局,我国大数据企业市场拓展指数小于30的企业数量占到92.88%,指数超过30的大数据企业占比为7.12%。与2016年相比,龙头企业依旧强势引领大数据市场,中间企业及长尾企业亦积极拓展市场版图,行业整体呈稳步发展态势。

    态势五:2017年,大数据企业尤其是骨干企业发展集聚态势进一步强化,绝大多数企业集聚在北京、天津、山东、江苏、浙江、上海、广东、福建等东部沿海信息技术产业基础较好的省市。与2016年相比,东北、中西部等重点城市,以及乌鲁木齐、呼和浩特等地的大数据企业集聚化趋势日益明显。

    态势六:2017年,我国产业环节大数据企业聚焦数据采集、数据存储、数据预处理、数据分析、数据可视化、数据流通,跨度从19.48到6.87,发展指数相对比较均衡,数据分析环节企业发展指数水平相对突出,发展指数达到19.48,数据大数据分析挖掘环节必将涌现出更多的独角兽企业。与2016年相比,大数据分析环节指数增长3.8,其他环节指数均有不同程度下降。

    态势七:2017年,我国重点行业大数据产业企业聚焦政务、工业、健康医疗、交通、农业、金融、教育、能源等17个行业领域,企业平均发展指数为23.36,最高的安防大数据企业发展指数达到35.71,最低的能源大数据企业发展指数为16.89。与2016年相比,主要行业大数据企业平均发展指数同比增加了0.25,大多数行业发展指数都稳中有进,除安防领域初步定型,同比2016年降低了4.01,其他重点行业领域指数均有不同程度上升。

    态势八:2017年,我国特色细分领域大数据企业主要分为三大阵营,与2016年相比,三大阵容的特色细分领域发生了明显变化。一是从事人工智能相关的龙头企业处于第一阵营,平均发展指数维持在21左右;二是从事工控安全、数据库、区块链、征信分析、商业智能BI、数据中心IDC、数据营销、基因测序等10类细分领域大数据相关业务的龙头企业处于第二阵营,平均发展指数处于13.97到17.78之间;三是以虚拟现实、开源技术和车联网为代表的第三阵营,整体发展指数相对略低,处于12左右。

    进过调研分析,我们可以作出预判

    2018年我国大数据产业发展的主要趋势有:

    1、产业将持续保持快速增长态势。预计2018年我国大数据核心产业规模将突破5700亿元。

    2、融合渗透效应向更深层次延伸。延伸方向既包括经济运行、社会生活等应用领域,也包括物联网、人工智能等关联技术。

    3、制造业数字转型作用日益凸显。以大数据驱动制造业数字化转型的新模式、新业态将不断涌现。

    4、技术创新仍是产业发展主基调。大数据领域核心关键技术将加速突破,跨学科、跨领域交叉融合技术研究将成为发展重点。

    5、产业集聚特色化发展态势逐步显现。国家大数据综合试验区建设的不断深入,一批省级大数据产业集聚区将进一步优化资源配置、形成集聚效应、发挥辐射带动作用。

    6、产业生态体系迈入成熟完善阶段。大数据相关政策将加快落地实施,更多创新性政策将加快出台,大数据产业发展环境将进一步优化。

    区域大数据产业发展态势:

    态势一:2017年,国家大数据综合试验区依然引领产业发展,其所在区域的大数据产业发展总指数在全国大数据产业发展总指数的占比达37.54%。试验区内各省市指数较去年增幅均值为6.23,高于全国增幅均值的5.78,大数据产业发展速度高于全国平均水平。

    态势二:2017年,大数据产业集聚发展效应进一步凸显,长三角地区、珠三角地区、中西部地区和东北地区大数据产业集聚发展格局基本形成。

    态势三:2017年,北京、江苏、广东、浙江、上海等五省市成为大数据产业发展第一梯队,其大数据发展总指数在全国大数据发展总指数的占比高达26.52%,领先的优势地位明显。浙江省大数据产业发展指数较去年增长12.71,成为全国大数据产业发展指数增幅最高城市。

    态势四:2017年,我国东部、西部、中部、东北四个分区产业发展差异化明显。东部地区整体发展水平最高,大数据产业发展指数增幅均值为7.39,远超全国平均水平5.78,天津、河北、海南排名上升;西部地区未来仍有巨大发展空间,重庆大数据产业发展指数较去年增长10.12,增幅仅次于浙江省位列全国第二,宁夏、内蒙古二地成后起之秀;中部地区整体发展速度高于西部和东北,山西发力大数据产业,排名明显提升。东北地区辽宁继续蝉联区域榜首,辐射带动作用逐步凸显。

    态势五:2017年,各省市大数据产业发展环境均呈现向好态势,各省市的发展环境平均指数为10.9,较去年提高32.9%,18个省市的发展环境指数高于平均值,占比达到58%,而发展环境指数在去年平均值以上的省市高达30个;同时,江苏、重庆、安徽等地由于组织机制进一步完善、区域信息化水平加速提升等因素影响,较去年排名增速明显。

    态势六:2017年,全国各省市大数据产业发展水平均有提升,大数据产业发展总指数为363.9,较去年提升16.8%;

    但受数据集聚开放水平、大数据产业规模、大数据企业主体等多种因素共同影响,各省...

  • ?

    肖锋:信息泄露拷问互联网,大数据面前我们都在裸奔

    仲诗槐

    展开

    马云有次在浙商大会上得意地说,你们知道中国各省份女性的胸围尺码吗?他还卖了个关子,只暗示浙江是排最后几位的。

    马云引用的是淘宝大数据。还有一次,他提问“谁知道哪个省份的比基尼卖得最好”,答案是新疆。马云的解释是因为远离大海,新疆小伙能做的最浪漫的事,就是哪天给心爱的人穿上比基尼,到海边去浪漫一下。马云的解释当然是错的。因为众所周知的原因,在一些地方人们买比基尼只有上网。

    关于大数据,最著名的例子就是婴儿尿布和啤酒的关系:男人到超市买尿布顺便会给自己带几瓶啤酒,所以有心的超市会把尿布和啤酒放在相邻的货架上。这听起来是个不错的主义,只是没有多少超市会真的这么做。

    但大数据在我们的生活中的确已经无孔不入。今天,包括阿里这样的互联网巨头都号称自己是数据公司,数据早已成为一门大生意。随便一个网站、app,就有可能把我们的姓名、年龄、电话、职业甚至身份证号、银行账户、实时定位、家庭住址、个人喜好、社交圈子搞到。在我们享受互联网便利的同时,自己的隐私也成为商家的“数据大餐”:你的数据被卖给品牌商、保险推销、房产中介、诈骗团伙,甚至被用来操纵选票。大数据面前,我们都在“裸奔”。

    最近引爆的Facebook(脸书)泄露事件,被曝超过 5000 万用户信息遭到泄露,这些大数据被用来为特朗普助选。此次的泄露事件正在动摇Facebook的整套商业逻辑。简单来说,Facebook的模式是从用户处获得数据并对其进行特征分析,通过模型来向用户精准投放广告,然后允许第三方使用这些数据来支持他们的业务,Facebook也从中获取一部分利益。

    丑闻中,一家名为剑桥分析(Cambridge Analytica)的公司,非法获取了5000万Facebook用户的个人信息,然后对这些用户进行大数据分析,分析他们的喜好、偏向、政治倾向,然后通过Facebook的广告系统精准投放他们喜好的新闻和广告,潜移默化地给他们洗脑,最终影响他们投票,从而左右整个美国大选。

    举个简单的例子,如果你经常点赞旅游博主的美照,你对旅游感兴趣,就会收到旅行团、打折酒店机票,户外装备之类的广告。而如果你给哪条民粹主义新闻点了赞,就能由此分析出你的性格、生活习惯、政治倾向等,就会专门为你推送这方面的新闻,有些是煽动性的新闻。这家公司号称“给我68个点赞我就知道你是谁”,通过你对哪些内容点了赞,再套取你的个人信息,就能通过推送信息控制你的政治选票。

    在风暴中沉默几天后,CEO小扎发长文自救,坦承三年前就已知情用户数据外泄。而美国用户则发起集体诉讼,要讨个公道;美国议员表示,如果脸书无法解决这类隐患,就只有通过立法解决。欧盟则提出要对这些互联网巨头征收数字税。

    脸书事件拷问整个互联网营利模式,而小扎的辩解也难以服人。

    首先,侵犯用户权益的事件一但发生,平台方的责任不可推卸。第三方公司用你的平台贩卖虚假产品、窃取用户信息、推送不良信息,平台是无法置身事外的。淘宝卖假阿里难脱干系,这次信息泄露脸书也难脱责任。

    其次,从法理上说,即便是平台方使用数据,也得与用户签订认可协议,否则也不能随意推送宣传信息。这条我认为很重要,将来要尽早要立法。

    我知道你知道我是裸体的,但请你不要用它来做生意,除非我同意。更不能泄露我的“裸照”给第三方,否则犯法。

    问个尖锐的问题,平台方又比第三方更有商业伦理和良知吗?人性中都有两种对立的能量,谁又能差别化区分“不作恶”的标准呢。

    让我们再回到国内。我们都不知道BAT等互联网巨头用我们的信息干了什么,也不知道电信巨头用我们的信息干了什么,反正我们天天都被各种金融机构、房产中介、教育培训电话打爆:“您好,请问您是xx吗?我们看到您xxxxx,我们这有一个xxxxx,有没有兴趣了解一下?”这样的泄露事情每天都在发生。

    利用大数据营销是否合法,这方面国内的法律监管更是严重滞后的。包括BAT、今日头条、微博、各类app等,所有的大数据公司都受到不少质疑。

    最近,平日打得头破血流的国产手机厂商,终于抱团围剿微信小程序了。巨头们争抢的就是用户的信息。因此新手机拿到手第一步,就该是卸载所有内置应用app,然后再有选择性下载。可有些手机设定了不可卸载的流氓规定,这就需要法规介入。法律要将选择权还给用户。

    所以,不要对互联网(还有区块链)去中心化抱过多幻想。公平公正不会自动生成。这需要每位用户权利意识的觉醒和积极勇敢的维权。

  • ?

    大数据信息泄露?!

    恋红尘

    展开

    众所周知的阿里是一家购物公司,但却不知阿里除淘宝天猫外,其他旗下公司到底是做什么的?仅仅是为了赚钱,或者扩大市场?那么接下来我们看看马爸爸的战略布局:

    阿里集团主要下属公司

    v 阿里健康

    v 滴滴快滴,高德地图

    v 微博,陌陌

    v 优酷土豆,阿里影业,光线

    v 恒生电子

    v 菜鸟网络

    v 蚂蚁金服,支付宝

    v 口碑,饿了么

    v 淘宝,天猫

    阿里的战略布局

    阿里的公司布局范围为何如此之广?难道仅仅是为了不断的扩大资本或者开拓市场?其背后原因不止如此简单。马云的前瞻性早已在大数据时代布好了一局棋,那就是数据采集与数据分析和管理。为何这么说呢?那么接下来对其所属主要公司进行详细的分析。

    阿里公司的数据采集

    n 阿里健康,是对市场药品实时数据的采集

    n 滴滴快滴和高德地图,是对大众出行数据的采集

    n 微博和陌陌,是对人们社交关系数据的采集

    n 优酷土豆与阿里影业以及光线,是对线上娱乐数据的采集

    n 恒生电子,是对证券交易数据的采集

    n 菜鸟网络,是对物流数据的采集

    n 蚂蚁金服和支付宝,是对支付数据的采集

    n 口碑和饿了么,是对餐饮服务数据的采集

    n 淘宝天猫,则是对交易数据的采集

    阿里数据的作用

    阿里如此之大的数据量,自然引得更多商人在阿里入户。当阿里在淘宝与天猫中采集的数据被分享至各个商户手中时,大量的数据可以让商家更好的进行市场分析与自我产品定位,进而使市场资源配置更加完善,也使商家利润快速增长。这似乎是个很好的事情,但任何事物都有其两面性。假使这些大量的购物数据被无良商家所利用,会发生什么呢?这些购物数据中包含用户是否常购买品牌产品,或者是否常购买低价货,那无良商家拿到这些数据后会做些什么?如果你常购买品牌产品,那商家就会给你发真货,因为数据告诉他,你懂是不是真货。但你常购买低价货呢?不好意思,只发高仿品。同样,数据告诉他,你的消费水平不高,“见少识窄”只给你高仿,不能再真了。另外,若你平时购物的退货率低,那好给你瑕疵产品,因为数据告诉他,你会将就。最后,若你所购买商品,在你居住地并无专卖店,直接给你假货,因为地址数据告诉他,你没办法验证真假。

    看到这里,你是否为之一颤呢?

  • ?

    什么样的数据才算大数据?——大数据的特性

    海螺

    展开

    什么是大数据?大数据就是指在一定时间范围内无法使用传统数据库工具对其进行捕捉、管理、计算、分析和处理的数据集合,大数据有以下四个特性:海量的数据规模(Volumn),数据类型繁多(Variety),数据流转速度极快(Velocity)以及价值密度较低(Value),我们就说说这四大特性。

    海量的数据规模

    我们接触最多最敏感的数据那就是我们手机所购买的流量,最常见的数据计量单位为K、M和G,他们的关系为1G=1024M,1M=1024KB。也许你也听过TB,1TB=1024G,这个数据单位对我们来世已经相当庞大了,我们的笔记本最大的容量也就在1TB这个级别,但是在大数据眼里最小的数据也得10TB起,比TB级还大的数据计量单位还有吗?有,而且还很多,1PB=1024TB,1EB=1024PB,1ZB=1024EB,1YB=1024ZB......我们已经无法感知这么大的数据量了。截止到2011 年,互联网用户数已达到20 亿; RFID 标签在2005 年的保有量仅有13亿个,但是到2010 年这个数字超过了300 亿;2006 年资本市场的数据比2003 年增长了17.5倍;日前新浪微博上每天上传的微博数超过1 亿条;Facebook 每天处理10TB 的数据;世界气象中心积累了220TB 的Web 数据,9PB 其他类型数据……

    极快的数据流转

    数据具有一定的时效性,是不停的变化的,可以随时间数据量逐渐增大,也可在空间上不断移动变化的数据。如果我们采集到的数据不经过流转,最终会过期作废。客户的体验在分秒级别,海量的数据,带来的第一个问题就是大大延长了各类报表生成时间,我们能否在极端的时间内提取最有价值的信心呢?数据在1秒内得不到流转处理,就会给客户带来较差的使用体验,若我们的数据处理软件达不到“秒”处理,所带来的商业价值就会大打折扣。

    价值密度低

    尽管大数据的数据量巨大,但是有价值的信息极少,我们要通过分析才能将大数据从数据到价值的转变,这些工作量极其庞大,所以云计算是一个很好的解决途径。以监控视频为例,一小时的视频,在不间断的监控过程中,可能有用的数据仅仅只有一两秒。

    数据种类繁多

    数据的格式是多样化的,如文字、图片、视频、音频、地理位置信息等,也可以是不同的数据类别,也可以有不容的来源,如传感器、互联网。首先用户是一个复杂的个体,单一的行为数据是不足以描述用户的各种行为,多元化的信息采集处理就像拼图一样,逐渐勾勒出我们身体的骨架,增添上我们的血肉。我们在淘宝、京东购物时,总会在下面的推荐区推荐我们想要的东西,比如我们去频繁的搜索浏览某件商品,这是他们就会采集我们浏览的数据,从中挖去有价值的信息,推送给我们。所以说这样的模式给一种体验,那就是这些app越来越懂我们的爱好和需求。

    大数据未来会渗透在很多领域,大数据与云计算,机器学习与人工智能,物联网,区块链等。

  • ?

    大数据知识点:一文理解数据、信息和知识之间的区别

    Teresa

    展开

    大数据是比较火的一个热词,但说到什么是数据,很多人首先想到的是数字,如1,2,3等。其实这是数据的狭义定义。数据所涉及的范围很广,并且随着技术的发展,数据的定义范围也越来越宽泛,比如在互联网时代文字,图片和视频都是数据,医院里面的医学影像图片也都是数据,甚至包括公司和工厂的设计图案、解决方案等等。

    数据是一种客体存在,并随着文明的发展而不断扩大和变化。以前并不是数据的,但现在看来都已经变成了数据内的范畴,比如在互联网出现之前,文字并不被认为是数据,但是互联网出来以后,通过将文字进行电子化储存,因此成了可以计算的文本,这就涉及到自然语言处理技术。甚至包括我们聊天记录、网页内容、打电话记录、用户生存内容(UGC)、论坛评论,购物数据,社会关系,行程记录等等都是数据内容。数据也经历了从结构化到非结构化的转变,而且非结构化数据中蕴含这更大的价值。

    但今天人们谈论数据的时候,经常将其与信息混为一谈。甚至将数据处理等同与信息处理。其实这两者是有共同之处,但是还是有细微差别。

    信息是对世界人和事等描述,它比数据更加抽象。信息是隐藏在数据背后的规律,需要人类的挖掘和探索才能够发现。比如地球的面积和质量,物理学中的参数,圆周率等。

    数据是信息的载体,从数据到信息不仅是一门技术,也是一门艺术。以胡夫大金字塔为例,该金字塔的周长和高度的比值为大约6.29,金字塔的长为20埃及古尺长,宽为10埃及古尺长,但高度为11.18埃埃及古尺长。为什么不是一个整数?

    通过考古专家的分析,这是为了保证对角线都是整数,分别是15和25(见上图)。通过对这些数据处理,我们可以得到在古埃及就懂得了勾股定理。

    数据和信息处理以后就会得到知识。而知识是数据和信息的更加高级和抽象的概念。知识具有系统性、规律性和可预测性。

    比如我们通过观察可以记录星球的位置和出现的时间等原始数据,再对得到的数据进行分析和挖掘,就能够计算出星球运动的规律,这就是信息,然后对信息进行总结和提炼,就可以得到开普勒三定律,这就是知识。而得到的知识,能够使我们更加清晰的了解世界和生活,还能够通过知识不断改变我们周围的世界。而所有的一切的基础就是数据。

    从数据到信息再到知识,清晰界定各概念的范围,有利于我们学习大数据。从数据到信息,涉及到不同的处理方法,这就涉及到机器学习处理技术。不同的技术处理,可能会得到不同的信息。而从信息到知识,更加体现一个人的概括总结能力,它直接导致了后期的数据的应用场景和使用价值。最后才能到达最高层级就是具有智慧。

    如果同样的星球移动轨迹数据,你能发现开普勒定理吗?而这也是我们学习大数据的最终目的。

  • ?

    大数据,比你更了解你自己

    傅远航

    展开

    每一个为人类创变而萌生的念头都是最高贵的种子,大家好,这里是高贵的种子。

    上周末,英美两国的媒体,爆出了一则与Facebook脸书有关的大新闻。报道称,一家名叫Cambridge Analytica剑桥分析的数据分析公司,通过为脸书平台开发的性格小测试程序,收割了超过5000万的用户数据。并且,利用这5000万用户,操纵了2016年的美国大选。接着便有新闻指出小扎道歉:我们错了!对Facebook数据泄露事件负有责任,不配为用户提供服务,他自己很后悔,将来一定会改正,他还保证不再发生类似事件,有新闻称美国联邦贸易委员会正在开展的调查,若属实,Facebook将面临2000000000000美元罚款!(事件时间线下图)

    那么它们如何抓取用户信息,又是如何操纵大选的大概过程:

    大概意思就是,这个公司针对每个用户的特点,尤其是那些偏中立不知道投谁的选民,投放洗脑政治新闻,进而最终将川普推向大选胜利。利用大数据给人洗脑?还影响选举?小小的一个脸书账号也能搞出这么多事儿?2014年夏天,这个公司和一位剑桥的研究人员合作,展开了一项研究,抓取了大约32万用户的核心数据,这些用户的喜好,性格和交友圈信息,一览无遗。

    我举个简单的例子,我们都知道希拉里是赞同接纳难民的,如果据数据判断,一个用户他经常点赞批判接纳难民的相关内容,或者从该用户的交往人群,信仰等线索蛛丝马迹,大概推断此人反移民或者不支持接纳移民,那么对他的主页频繁推送希拉里“接纳移民”的观点新闻,势必会让该用户产生对希拉里的反感。喜欢耸动新闻?没问题,专门给你发送“震惊”类的内容,一次管饱。当用户在潜移默化中,每天被推送阅读这些定制类的新闻时,你很难说他们不被影响。在大数据帮助下,川普团队潜移默化地影响了很多选民,这也成了他登上总统之位的强效助力。

    事实上,Facebook这种事,影响的不止是选举这样的大事件。大数据还在操纵我们每个人生活的方方面面。这些公司做的第一步,就是收集数据。我们在网络上的所有行为,每一次点赞,每一次分享,每一次浏览,都将成为被记录分析的数据当代人手机电脑不离手,只要连接了网络,我们就在留下痕迹。搜索引擎成了我们联通网络的大门,每次搜索,都会被看门的数据公司,记录下我们往哪个方向走。搜索过游戏,就给你推荐游戏;消费过护肤用品,就给推送同类型产品;转发过汽车新闻,就给推荐汽车。比如有东西加到购物车还没结账,再进入网站时购物车自动恢复,或者看的小说看到一半,再打开网站时自动找到上次读到的位置。本来这项技术是为了提供更好的客户体验,让大家浏览网站时,不需要一次把所有的事情都做完。然而,这个技术被广告商盯上了,掌握了我们网上的一举一动。通过读取cookie,广告商可以知道我们看过什么网页,看了多久,操作到什么地步。除了读取cookie,数据公司还会收集用户的个人基础信息、点赞、社交圈、消费习惯和生活习惯,也就是Facebook这种公司从我们身上拿到的资料。集齐了他们需要的信息,这些公司就开始对这些数据进行分析。这个分析的过程,叫做用户画像。用社交网站上的各种资料,配合用户在网上的浏览信息建立模型,用模型运算预测用户可能发生的行为。广告商根据这些分析结果,就可以预测我们可能会买什么,进行定向投放广告。它们不仅想知道我们搜索了什么,还想了解我们的各个方面乖乖让用户交出个人信息不是一件容易的事,我们又不是傻子,凭什么给这些公司我们的资料。但是事实证明,道高一尺魔高一丈,为了搞到数据,他们想出各种办法,哄得用户乐呵呵地自己奉上隐私数据。像剑桥分析给每个用户5块钱,用户不仅把自己的东西都交代了,还给了他们权限去了解自己的朋友们。想想我们,是不是也有曾经为了返券优惠,提供额外资料给某些app呢?

    就像是我们开始说的那样:大数据,比你更了解你自己。

    在大数据面前,我们每一个人都是赤裸的,待宰羔羊。这次Facebook操作选举的事件,只是揭露了大数据时代危险的冰山一角。原来,我们看到的世界,不过是大数据为我们精心定制的一隅天地。大数据,不止了解我们,掌握着我们一切的信息,就像马云他知道那个省妇女的胸大。能给我们安利心动的产品,提供我们需要的服务,还能让我们觉得我们看到了想看的一切。大数据分析出我们的三观,平台可以按照我们的三观偏好推送信息。当我们毫不设防,我们的视野被控制在大数据为我们预设的轨道里,小到消费购物,大到政治宗教,我们最终沦为大数据的提线木偶。

    了解你,洞悉你,甚至比你自己都清楚你。大数据时代,我们还有何处可逃?大数据下,我们都是一样的赤裸裸,我们经常接到各类保险的推销电话,我们的信息在大数据情况下,都是一样的赤裸裸,我们能做什么呢,我们别在朋友圈去各种秀;我们把相册加密码;但在现在这大数据时代,我们离不开电脑,手机,更离不开网络,所以我们需要国家建设网络安全个人信息的保护制度是迫在眉睫的。你们怎么认为呢,欢迎留言讨论。

  • ?

    大数据与信息安全(四)数据信息与安全管理

    袁映秋

    展开

    大数据与信息安全(四)

    作者:卡尔赫林

    从出生到老年,陪伴你我终身的,会有几份档案资料。包括:户籍档案、人事档案、健康档案、求职档案(简历)、诚信档案……这些档案资料,陪伴终身,具有一定的法律效力。这些档案,或保密、或公开、或半公开,大多都保存在官方的档案管理系统之中,或由你我就职单位的档案管理人员保管。一般都是在保密状态下保存,正常情况下不会被人泄漏和倒卖。

    在使用各项网络和移动互联网服务时,当登录了购物网站和社交平台之后,网站和平台的数据库中,也就保存了你我的网络档案——其中一些网络档案,是根据系统的规定和要求,或依据系统提供的各种表格,由用户自行填写的;而另一些档案,是网站系统跟踪采集的,当用户在使用网络服务的过程中,会产生的一系列信息和数据——而这些信息和数据,都无一遗漏的被网站系统采集和收录。当网站的大数据系统更加完善之后,跟踪、监控、采集和收录用户信息、数据的工作,将越发的便捷和全面。

    当你我在社交平台上尽情展现自我,在购物网站沉浸在“买买买”的欢愉快慰之中,却不曾想到——我们的一举一动,都在被网站监控、监测、监视和监听……伴随着网站大数据系统的更加强大,似乎可以把我们的一切都掌握——身份信息、银行卡号、手机号码、居住地址、出行信息、交易记录、消费记录等等,甚至还有一些隐私信息,都无一例外的被大数据系统收集。读到这里,你是不是觉得自己,顿时没有了安全感?

    以前,上网的时候,大家都惧怕一件事情,那就是人肉搜索——人肉搜索,可以通过发动线下的人力,来查找预定目标。而现在,有比人肉搜索更加厉害的,那就是大数据检索。在某些网站的大数据系统之中,稍加检索,都可以把一个人的近乎所有的信息,都揪出来(而不是挖出来,揪比挖的效率要快得多)。

    近年来,官方机构和私立网站,都纷纷组建了大数据系统,而且一些网站的大数据系统实现了数据信息的实时共享。大数据系统的建立,对官方机构和部门的社会管理、数据统计、信息采集、统筹规划,推出相应利民便民措施等等,提供了便利,既便于相关机构更加全面的了解国情和民情,又提升了政府部门的工作效率。

    而大数据系统,对商业企业的合理经营和健康发展,也起到了促进和辅助的作用,便于商业企业进行客户管理、数据采集、产品设计、服务定位和潜在市场开发等等,帮助商业企业更深入的了解客户,更全面的采集市场动态信息,更准确的判断未来市场的发展趋向和流行趋势,从而制定行之有效的经营策略和发展战略。这些都是大数据系统建立之后,为社会管理和商业生活,带来的一系列好处。

    不过,事物往往是存在两面性的,既有好处,又有坏处。在某些网站的大数据系统之中,建立的用户档案,非常的全面和详细,却有涉嫌侵犯用户个人隐私的嫌疑(你都不知道,大数据系统采集收录了什么信息和数据)。而私立网站的用户资料和数据信息,又有被人为窃取、泄漏和倒卖的风险。而网站倒卖用户信息的案例,已是屡见不鲜。

    即便网站不会主动的叛卖用户资料,那么伴随着黑客技术的不断进步,各个网站的大数据库,都有被破解和入侵的可能。近年来,在网络新闻中经常会看到一些新闻:某个大网站的数据库被黑客入侵,用户资料被窃取和遭到人为泄漏,甚至有人高价倒卖这些用户信息。而网站的大数据系统,收录的信息数据越详实越全面,当数据库的防护措施被攻克,造成信息泄漏之后给用户造成的损失就越大,越无法估量。

    所以,在此呼吁官方机构和私立网站,一定要对各自的大数据系统严加管理,做好周密的防盗和防入侵措施,以更好的维护信息数据安全。同时,希望官方机构和政府部门,对私立网站的大数据系统加强监管(或加以接管),并加大对倒卖用户资料和贩卖个人信息等违法行为的打击力度,以更好的维护人民群众的人身财产安全。

    同时,官方机构和部门,也要下大力气阻断信息和数据流向境外的通道和途径。一旦大批量的数据信息,流泄到境外的研究机构,那么国外研究人员便可以通过分析数据,而更深入的了解中国国情,了解中国的社会结构,人民的健康状况、居民收入、消费层次和生活水平等等一系列国情和社会信息,从而更加有针对性的制定对华的方案、策略和措施。

    综上所述,大数据系统和数据库的保密和防盗、防攻击等安保措施,不容忽视和小觑,容不得半点马虎大意。而各机构、各部门和各网站的大数据系统,应该采用先进的安防加密措施,及时发现和修补系统漏洞,不断改进安防手段和提升安防水平,才能更好的维护信息数据的保密和安全,维护好公民与用户的权益、利益和人身财产安全。

    对于普通网民来说,在上网冲浪和使用各项移动互联网服务的时候,一定要有自我保护意识。可以通过安全管理软件,设置手机app的各项权限,对一些涉嫌侵犯隐私的权限要加以阻止和拒绝。

    在登录各大社交网站和社交平台的时候,也要保护好自己的个人信息。除了按照系统要求,做好实名制认证之外,就不要随便的在网站上公开自己的个人信息。也就是说,除了在婚恋网站、商务社交和求职网站上,可以公布一些真实的个人信息之外,在其他社交平台,就没有必要去展现太过真实的自己。

    在其他社交平台上,就不要把真实的个人照片和身份信息,填写在对外公开的“个性资料”里面。这些个性资料,你填写的越真实越全面,你所面临的风险就越大。

    在网络上,如果想更加全面的去了解一个人,有时候真的很容易——只要查阅几个其经常登录的社交网站,汇总一下所填写的个性资料就行了,就可以汇总编辑出一份这个人的简历或人生履历(以其填写的真实个人信息为基础)。所以,在一般的社交平台上,不要填写太多真实的个性信息。而在求职网站上,也要对自己的求职档案做好保护,不要让任何人都能随意的调阅你的求职简历,以免自己的个人利益和人身安全遭受侵害。

    读到这里,可能有朋友会说:把自己真实的个人信息,公开到网络上,没什么大不了——你看那些明星的个人信息,不都在百科里面挂着吗?在这儿,我只想说:很多明星的名字,都是假的(都是使用的艺名),你确信百科资料里公布的明星资料,都是百分百真实的吗?

    为了更好的维护自身的人身和财产安全,无论是在网络,还是在现实生活中,都不要忽视信息安全,要不断提高自我保护意识,阅读相关书籍和文章,学习一些自我保护,预防金融诈骗,防范各种危害和风险的常识技能。

    在日常生活中,可以使用两个手机号码,一个号码对外公开,用于对外联络和收发快递;另一个私密号码,用于绑定银行账号(这个号码只有家人知道,不对外界公开)。

    在平时去超市购物,要携带超市会员卡。如果忘了带会员卡,买的东西再不多,就别积分了——尽量不要以当众报手机号码的方式,来告知营业员进行积分,以免手机号码被别有用心的默记(有时候,说者无心听者有意)。可能有时候,一张超市会员卡,几位家庭成员共用,来不及调剂——那么可以,事先裁剪一张会员卡大小的纸片,将手机号码写在上面,结账时递给收银员,结算完毕再装回钱包里,也比当众报手机号强许多。

    其实,如果不在乎购物的那点积分,不在乎年终积分换购的那点商品,就不要在超市里办会员卡——因为办理超市会员卡的时候,大多需要携带本人身份证,而办卡时提交的个人身份信息,就存储到超市的数据库之中了。由此,个人的身份信息,也就有了被贩卖的风险。

    在之前的文章《大数据时代,如何保护个人隐私?》里面,我已经写了大数据时代,如何保护个人隐私的17条建议,而在近期写作的与大数据相关的文章之中,也提出了一些建议,在此就不多言了。

    写作本文,只为呼吁官方机构和政府部门,加强对各级大数据系统的监督管理,同时也想通过文章提高一下读者的自我保护意识。

    ——今天的文章,是“大数据与信息安全”系列的第四篇文章。有关大数据,我已经写了七篇文章了(本文是第七篇),今后能不能再以“大数据”为话题,而继续写下去,就看我脑子里还有没有新的写作灵感和思路吧。

    感谢朋友们一直以来的关注和支持。真诚的谢谢朋友们,谢谢大家!!

    卡尔赫林 2017年10月6日 12:37:28

    (头条号 | 吉恩瀚棠,作者:卡尔赫林)

  • ?

    大数据时代的危机意识:要如何防范数据信息泄露?

    Qoqa

    展开

    近日,社交媒体巨头Facebook因5000万用户数据泄露一事,被推到舆论的风口浪尖。事实上,生活中无论是个人还是企业都不想自己的信息被他人盗取加以不良利用。作为个人需要对自己的信息多加防范,采取措施降低信息泄露的风险;对于拥有众多用户信息的平台和企业,更是需要重视用户信息的保护,并有义务保障用户的信息安全。

    信息泄露正以无孔不入的态势入侵大家的正常生活,尤其是扫码支付已经成了我们日常生活中一部分。显然移动端所面临的数据问题更严重,可能无意中点击的功能或者下载的应用,都存在信息被实时获取的可能性,可能还会存在手机被ROOT的风险,毕竟有些软件它可以绕过任何权限,无论用户是否同意,都可以记录用户所有操作,做任何想做的事情。

    那么面对这些未知的风险,我们又该如何防范数据信息泄露?

    【个人】

    1、 设置复杂的密码

    密码是信息盗取的第一道门槛,冗长又复杂的密码会增加信息破密难度系数。建议用户可采用“大小写+数字+特殊符号”这样的形式来设置账户密码。需要注意的是,众多账户尽可能不要使用同一个密码。还有如果记不住过于繁杂的密码,可以将它记在纸上,放在自己知道的秘密空间里

    2、 定期更改密码

    定期修改密码,会增加账户的安全度,3个月更改一次密码最佳。(不说了,写完这篇稿小编就去更改APP的密码…)

    3、 不要轻易出售个人信息

    目前很多平台或APP为了拉动新用户注册率,会以各种优惠的活动吸引用户,诱导用户进行注册甚至是信息绑定,当有APP或平台需要获得你的各项信息权限的时候,可千万要注意了,别薅羊毛不成反被羊咬。

     【企业】

    1、 加强安全管理

    作为企业管理人员需要加强信息安全管理工作,做到有偿负责管理,数据的安全需要管理权限与加密,堤防内鬼的出现

    2、 培训员工安全意识

    给员工进行定期培训,加强安全防范意识。让企业员工知道钓鱼攻击的来源及各种钓鱼手段,警惕在不明网址输入用户名和密码。这将有助于消除攻击的频次,加大攻击者窃取用户凭证的难度,防止大规模的数据泄露。

    3、 接入云服务安全平台保护企业信息安全

    有些企业并不具备信息安全保护的能力该怎么办呢?此时,他们可以借助专业的云安全产品或服务,以精密的技术,保障企业的信息安全。防止数据泄露,及时发现漏洞、修复漏洞是关键。

    例如国内领先的阿里云安全,多层防护+云端大数据。集阿里巴巴集团多年来安全技术研究积累的成果,同时结合阿里云计算平台强大的数据分析能力,为客户提供一整套安全产品和服务,帮助用户发现安全短板。

    在互联网特别是移动互联网已经成为大家生活的一部分的时候,Facebook的信息“泄露”事件引发的全球性影响也为我们国内互联网平台和用户的信息安全敲响了警钟,信息安全及隐私不仅关涉企业,同样需要个人保护。

  • ?

    什么是大数据和大数据平台?

    全荣轩

    展开

    “大数据”时下一个热门的词语,近几年来,关于大数据的著作和文章铺天盖地,似乎也在共同在传递一个信息:越来越多的行业、人士开始关注并实际探索大数据的应用,我们正在一起描绘着大数据巨大效用的蓝图,但在实践的路上,我们都孩子起步阶段小步前行。

    大数据根基于互联网,数据仓库、数据挖掘、云计算等互联网技术的发展为大数据应用奠定基础。对于任何一个大数据的从业者或初接触者,或者都会有个共同的感触:大数据很有用!但大数据是什么呢?

    今天就给大家讲解一下:

    对于大数据的定义,我们来引用3个比较差用的大数据定义:

    1)Gartner:需要信息处理模式才能具有更强的决策力,洞察发现力和流程优化能力的海量、高增长率很多样化的信息资产。

    2)IDC:海量的数据规模(Volunme)、快速的数据流转和数据体系(Velocity)、多样的数据类型(Variety)、巨大的数据价值(Value)。

    3)Wiki:或称巨量数据、海量数据、大资料,指所涉及的数据量规模巨大到无法通过人工,在合理时间内达到截取、管理、处理、并整理成为人类所能解读的信息。

    其他关于大数据的定义也大抵类型,我们可以用几个关键词对大数据做一个界定。

    首先,“大规模”,这种规模可以从两个维度来衡量,一是时间序列累积大量的数据,二是在深度上更加细化的数据。

    其次,“多样化”,可以是不同的数据格式,如文字、图片、视频等,可以是不同的数据类别,如入口数据,经济数据等,还可以有不同的数据来源,如互联网、传感器等。

    最后,“动态化”,数据是不停变化的,可以随着时间快速增加大量数据,也可以是在空间上不断移动变化的数据。

    这三 个关键词对大数据从形象上做了界定。

    但是还需要一个关键能力,就是“处理速度快”。如果这么大规模、多样化又动态变化的数据有了,但需要很长的时间去处理分析,那不叫大数据。从另一个角度,要实现这些数据快速处理,靠人工肯定是没办法实现的,因此,需要借助于机器实现。

    最终,我们借助机器,通过对这些数据进行快速的处理分析,获取想要的信息或者应用的整套体系,才能称为大数据。

    我们可以用下面的图示给大数据定义:

    这下,就知道什么是大数据了吧

  • ?

    大数据的时代,我们每个人的信息都是数据化的,要注意保护

    冷夏

    展开

    现在的每一个人都是被数据绑架了的,如果表达这样的观点的话,会有人反驳吗?我想应该是没有的,因为我们现在就是处在一个大数据的时代里面。我们每天使用的是我们的智能手机,智能手机里面有一个功能叫做云功能。这不是新鲜的词汇了吧,这就相当于为你自己的所有信息做了一个收集,而且你的手机的智能性会根据你每天的浏览状态和消耗状态的情况为你智能匹配出属于你的内容。

    真的是实现了一句话,叫做世界上不会有两片相同的树叶。只不过是改头换面了一下,因为每个人的数据绝对是不一样的。我们的数据是有什么用的呢,要知道我们这些创造的数据那是相当有用的。就像是我们知道的很多商业的大亨,他们都是十分的看重我们的数据的,因为在他们的眼里我们的数据都是可以转化金钱的可能性,对这就是数据的强大性。

    我们一般来说,我们每天接受到的推送真的接受过精密的计算的,这就要论算法的强大性。当我们的数据量被工程师接收到之后,就会通过细致的分析,最后产生一份详尽的报告。这样的报告就会反馈给我们的手机,现在的手机应该都可以自己计算了吧!总之就是属于你的手机真的是越来越像你自己,因为里面记录了太多属于你的痕迹。

    所以说,为什么我们的马云、,马化腾这样的人物会踏上我们的中国首富,正是利用了数据的强大性。可以有效的分析自己的目标人群在哪里,可以知道自己的隐形的客户是谁,可以为自己的下一步的商业推广指明方向,所以APP上就会有越来越多的客户。这就是线上的一些推广策略,一定是要精准定位的,才可以有效的使用自己公司的人力。

    就像马云的公司里面,招到的都是一些高精尖的人才。有一个男孩在几分钟的时间之内,迅速的攻破了阿里的防护网络,简直就是要惊掉下巴的节奏,因为我们知道的,阿里的安全维护也是做得相当好的,也是有很多人才都在做这些工作,但是这个男孩这么厉害,最后去哪了呢,不用说,当然是被马云招到自己公司了。这样一个厉害的数据人才,马云一定是不会放过的。

    我们生活中所有使用的APP都有类似的功能,尤其在快递业越来越发达的今天,好像时不时就是买个快递,订个外卖,所以好像我们的信息越来越透明化了。但是,这样自己的信息被别人知道不会很危险吗?是的,是很危险的,尤其是近段时间,相信我们也听说了很多的事情,无一不是和信息的流出有关系。

    所以,在这个大数据时代,我们一定要注意保护自己的信息。因为,你的信息基本上就是可以代表你这个人,当每个人都是由无数的代码组成的话,如果你不注意保护自己的信息,最后你就变成透明的了,是很可怕的。

大数据信息数据

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP