中企动力 > 商学院 > 大数据分析技术现状
  • ?

    大数据安全市场现状和需求分析

    小米粥

    展开

    后web2.0时代,互联网、物联网每天都在生产大量数据,人们对于这些庞大数据资源的价值渴求,使得“大数据”的概念得以问世。如果说“数据”是支撑未来核心技术的基础“原材料”,那么“大数据”正在演变成一种战略资源,当“用户需求导向”成为企业共识,大数据的收集、挖掘和分析开始支撑企业的业务运转、营销策略乃至战略方向,数据成为企业愈加珍视的宝贵资产。

    目前,建设有大数据平台的企业不在少数,对比传统数据库,大数据平台数据大量集中,且蕴含更高价值,其安全建设要求明显更高。然而,由于大数据平台使用非结构化数据库类型,以及不同于以往应用与数据库,对应相对简单的传统网络结构,大数据平台安全建设为平台开发和运维者提出了难题。

    日前,安华金和面向各行业IT运维和开发人群开展了一次大数据安全市场现状和需求调研。希望借此方式了解用户的大数据使用和运维安全现状,发现各行业用户在数据库运维工作中的安全需求,并梳理出整套适用于大数据平台特性的数据安全方案,帮助用户开展安全建设。安华金和从多方通道获取的近400份问卷中抽取170份有效样本进行统计分析,总结归纳出此份《大数据安全市场现状和需求分析》,摘取报告重点分析结论,分享给关注大数据安全的人士。

    参与人员概况

    抽取调研样本来自不同行业的部门或企业,包括:政府、制造、医疗、金融、通信、教育、能源、交通、保险行业等。调查对象主要为技术人员,直接从事IT运维或技术开发工作,或者为用户提供运维服务、解决方案及相关产品咨询,其中以技术经理、运维工程师、技术开发者占大多数,他们在单位中会指导或直接参与大数据平台的建设和运维,肩负大数据安全建设的责任,这为此份调研报告的客观性、专业度提供了基本的保障。

    调查结果

    大数据技术应用现状

    本次调研中,半数受访者表示已经将大数据技术应用于单位部分业务中,或者明确列在应用计划内,处于技术选型阶段,另外半数受访者虽然没有真正启动大数据应用项目,但同样关注并处于技术调研阶段。同时,在已经投入大数据应用的受访者中,45%的受访者表示将大数据技术应用在了单位核心的数据分析或业务系统中,意味着单位核心业务数据写入大数据平台,这部分数据与平台分析结果具有非常高的商业价值,需要更高敏感度。

    可以肯定的是,大数据技术已经受到各行业用户的广泛关注,当市场中近半数群体已经有所动作,一旦行业标杆案例成熟落地,另半数用户的方案复制和普及将很快开展起来。

    大数据产品的使用情况

    对于很多需要提供24小时不间断服务的网站来说,对数据库系统进行升级和扩展是非常痛苦的事情,往往需要停机维护和数据迁移,除了这些,大数据平台对传统的关系型数据库提出了更多的挑战,包括:高性能的事务管理性要求、读写实时性要求、高可用性要求。因此,在大数据平台的建设中,关系型数据库的很多特性失去了用武之地,非关系型数据库(NoSQL)成为大数据平台的标配。

    在本次调研中,我们列出了目前相对常见的几类非关系型数据库产品,希望对几款产品的市场接受度加以了解:

    32%的受访者应用了MangoDB数据库,使用最为广泛:Mongo最大的特点是支持的查询语言非常强大,语法类似于面向对象的查询语言,可以实现类似关系数据库单表查询的大部分功能,而且还支持对数据建立索引。MongoDB主要解决的是海量数据的访问效率问题,当数据量达到50GB以上的时候,Mongo的数据库访问速度是MySQL的10倍以上,这也是MongoDB广受青睐的主要原因。

    其次为Hbase、Hive、Redis等几类,均在22%左右:Hive与HBase都是基于Hadoop平台的数据仓库工具,其优点是学习成本低,可以通过类SQL语句快速实现简单的MapReduce统计,不必开发专门的MapReduce应用,十分适合数据仓库的统计分析。

    Spark紧随其后,占比17%:Spark 是一种与 Hadoop 相似的开源集群计算环境,拥有Hadoop MapReduce所具有的优点;但不同于MapReduce的是——Job中间输出结果可以保存在内存中,从而不再需要读写HDFS,因此Spark能更好地适用于数据挖掘与机器学习等需要迭代的MapReduce的算法。

    此外,在其他选项的答案中也出现了DB2、阿里大数据云等产品。

    大数据平台中有哪些数据?

    我们谈安全建设的时候,首先要搞清楚保护对象,不同业务类型、不同敏感级别的数据,需要根据其本身的敏感级别以及被访问和使用的情况,选择恰当的保护手段。因此,我们需要了解用户群体到底把哪些数据放到了大数据平台中存储和使用。

    调研结果显示,50%的受访者会将“生产数据”放入大数据平台中,也就是单位主营业务系统实时产生的重要数据。这些数据从生产环境直接写入大数据平台,具有很强的实时性和敏感度。

    41%的受访者选择“用户资料”,也是企业赖以生存的商业数据;此外,访问日志和交易信息分别有34%和24%的受访者选择。

    更有14-15%的受访者表示会将第三方数据和财务数据放在大数据平台中,这里面第三方数据的出现,是指业务中的数据多方共享,测试、开发、分析场景中的数据分发等情况。此外,也有少数受访者提到了企业征信数据。

    用户们的安全顾虑

    大数据平台中汇集了一个单位方方面面的数据,并向各类对内或对外的业务系统开放接口,这意味着传统环境下的数据安全威胁在大数据应用场景下发生了更复杂的叠加和自由组合。那么用户们对大数据平台的安全顾虑更偏重哪方面呢?

    59%的受访者选择漏洞攻击,56%的受访者选择“数据共享安全”,相较传统环境,共享场景下的安全问题在大数据技术的应用中显得更为突出,已经能与传统安全威胁中的“漏洞攻击”打个平手。不难理解,大数据平台除了提供存储和查询的功能,更重要的价值在于数据分析和价值挖掘,这决定了大数据平台需要向多部门甚至多家单位开放,比如政务大数据平台会向该地区各政府单位提供数据接口。

    46%的受访者选择“企业机密泄露”,看来用户在安全问题引发的后果中,更担心机密数据泄露,这关乎企业的命脉。

    38%的受访者选择“权限控制弱”,这与大数据平台所涉及的人员规模和角色复杂程度有关,目前只有具备一定技术水平的单位具备大数据平台建设能力,但同样需要引入第三方开发、测试人员,在后期的数据维护和挖掘中,需要引入第三方服务公司,这些不同访问角色的权限划分和管控愈加重要。

    28%的受访者选择“无审计信息”,可见用户对于大数据平台的审计记录比较关注,这将提供一切安全事件的追责依据。

    值得注意的是,只有13%的受访者选择“违反国家法规”,这不同于以往“安全需求多出自政策要求”的传统观念,保障数据安全的刚需成为越来越多用户考虑的重点。

    哪些大数据安全产品最受青睐?

    传统的安全建设思路对于大数据安全同样适用,但真正落地到技术手段的实现和方案的整合中,非关系型数据库的技术结构比传统关系型数据库难度更大。另外,由于大数据平台的数据访问来源、对象以及过程都要复杂的多,安全策略的制定和实现难度也会更高,那么在数据安全产品的选择上,用户更倾向哪几类呢?

    大数据运维管控产品受到59%的受访者青睐,这侧面体现了用户对运维侧的行为管控最为重视,事实上,相比应用侧的数据读写,运维侧的开发、测试、分析人员会拥有更高的数据操作权限,也意味着更高的管控难度。

    其次,大数据防火墙产品为41%,由于防火墙多用于应用侧的对外安全防护,也正应了用户对漏洞攻击等外部入侵的安全防护需求。

    32%的受访者选择大数据审计,该数字低于运维管控和防火墙产品,这与传统环境下的安全需求差异明显,看来用户更看重能够提供事中管控的安全手段,审计产品的旁路监控和事后追查能力也重要,但看起来没那么迫切。

    “大数据风险扫描”、“敏感数据梳理”的选择者各有27%和28%。安全风险扫描能够帮助用户发现安全隐患,如安全漏洞、弱安全配置、弱口令等,有些问题可以人工修复,提高平台安全基线,也能够指导安全方案的规划。敏感数据梳理是整体数据安全建设的基础,但这项技术在规模庞大且数据类型繁杂的大数据平台中落地,会面临不小的挑战。“大数据脱敏”有20%的青睐者,这项技术适用于数据分发和共享场景下的安全需求,但这个数字没有想象中高,也许用户是出于性能考虑?有待观察。

  • ?

    海外大数据生态现状与大数据分析的精彩故事——2017年全球大数据产业报告海外篇

    海鸟

    展开

    专注营销,不止于百度

    关注“百度营销中心”

    “人人都在谈论大数据,可大数据究竟是一个噱头还是能够实实在在提供价值的珍贵资源?

    前不久腾讯云和中国电信先后在厦门及辽阳的政务信息云系统投标中,以0.01元的价格中标预算数百万元的项目引发了热烈的讨论,有分析认为腾讯与电信是希望通过价格优势顺利拿到项目,从而接触到具备更高价值的民生与政务大数据及其算法,而我们认为通过免费模式先入局,再通过增值服务获取长期合作下的利益,这种互联网公司惯用的方法,对于那些想快速获取大量数据的科技巨头来说非常实用,比如他们的对手阿里云就早已经免费向12306网站提供技术协助了。

    国内大数据资源的争夺已经在具备前瞻眼光的巨头们之间展开,围绕大数据的庞大产业链条也在逐渐发展成熟,然而大数据能够带来的价值远非百万级别可以衡量,而且不得不承认,相比于国外市场,国内在大数据资源的运营及价值提取方面依然有一定的差距,因此我们与星河研究院此次对海外的大数据公司做了一次系统性的盘点,希望能够从数据分析方法、商业模式、应用案例等角度阐述出一个海外大数据产业的全景图,提供给这一行业的创业者、投资人,及大数据行业的爱好者一个客观全面的参考,并期待能够带给大家一些启发。

    大数据行业的整体生态结构

    第一大数据的技术基础

    早在1980年,著名未来学家托夫勒在其所著的《第三次浪潮》中就热情地将“大数据”称颂为 “第三次浪潮的华彩乐章”,这标志着人们首次对海量数据所能够产生的价值有了初步的了解。

    但由于连接方式的局限,长期以来人们对于数据的应用大多以企业内部的商业智能为主,随着互联网、移动互联网的普及,企业终于能够直接与用户产生链接并获得大量的用户行为与消费等数据,大数据产业应用的轮廓才渐渐清晰。

    2000年初Google为了实现对大量网页的信息抓取、存储,并完成索引的建立及排序功能,同时又希望降低硬件采购成本而逐渐摸索出了利用普通物理机实现的分布式存储、计算体系。这一技术以MapReduce及GFS而为人所熟知,借此大数据得以分布存储在多个数据库中,并进行大规模并发处理,解决了以往单一计算机存储能力不够,计算时间过长而不具备实用性的问题。

    依据2003年底Google所发布的论文,前雅虎工程师开发出了类似的分布式存储计算技术Hadoop,随后围绕Hadoop产生了庞大的生态体系,逐渐使大数据基础架构日臻完善。

    Hadoop功能包括从数据采集、存储、分析、转运、再到页面展示,完整涵盖了整个流程。例如HDFS实现了数据的分布式存储,HBase负责实现数据库的功能,Flume执行对数据的收集,Sqoop能够对数据进行转移、治理, MapReduce可以通过算法实现分布式计算,Hive则做数据仓库,Pig做数据流处理,Zookeeper实现了各节点间的反馈收集与负载平衡服务,Ambari能够让管理员了解架构整体的工作运行情况。

    Hadoop生态技术架构

    而随着技术的发展,一些适应独特应用场景的数据库、计算处理等软件也越发丰富,例如非结构化数据库MongoDB就因为其较为强大的条件查询功能以及灵活的数据结构获得了广泛的应用;Spark则将Hadoop中的存储介质替换为闪存,而获得了百倍处理速度的增长,Databricks Cloud就是这一架构下的产品化服务。

    除此之外大数据生态中还存在着很多的技术发展路径,其中MPP技术主要还是以关系型数据库为主和Hadoop技术目标类似,都为了将数据切分、独立计算后再汇总。相对于SQL on Hadoop,MPP具有数据优化程度高、计算速度快,擅长被用于进行交叉分析等优点,适合企业进行数据分析使用,但其扩展性相对Hadoop来说较弱,一般在10个节点以上便丧失了计算优势,并且由于非开源架构导致其对特定硬件依赖程度较高。

    采用MPP存储模式的表性公司有Teradata,能够通过进行企业数据分析帮助员工减轻大数据处理的精力消耗与费用成本,使企业能够更加专注于业务运营。在传统数据库公司与意图进入数据库市场的企业服务公司(例如SAP)掀起的收购热潮中,Teradata是目前市场仅存的几家大型独立数据分析公司之一。

    第二大数据的数据来源

    2011年麦肯锡发布了一份题为“Big Data: The Next Frontier for Innovation, Competition and Productivity”的报告,里面提到美国拥有1000人以上规模的公司平均存储了超过200T的数据,如果对数据进行价值挖掘将激发很多行业及公司的潜力,这一报告标志了商业领域大数据热潮的开端,也使企业服务软件成为了大数据最初的数据源。

    随着存储及计算能力的加强和国内大数据产业的兴起,部分从业者在看到行业巨大前景的同时也意识到了国内数据资源的缺乏,由于民生、电信、交通、电力等具有很高价值的数据都掌握在政府及大型国企中并不开放,如何获取数据源成为了比如何提升数据处理方法更大的问题。

    目前国内能够进行脱敏并使用的市场数据的来源主要还是集中在手机、PC等单一渠道与场景中,TalkingData、友盟,以及艾瑞、易观等数据分析及咨询机构很大程度上依赖着这些资源,却也被这些资源所局限。而由于政府数据的敏感性,仅有少数机构能够对接政府数据资源。因此预计随着对数据需求的日益强烈以及数据资源价值被渐渐接受,政府数据资源将会成为数据源的重要组成部分。

    而更大范围的数据采集工作将会依托于物联网领域。我们在《即将被281亿个传感器包围,你却还没弄懂物联网技术?》中曾讲到,预计2020年我们将会被281亿个传感器包围,本月27号中国联通也宣布截至目前其物联网联通数量已超过5000万个。可以预见的是,在消费者视角内,未来衣食住行等方方面面都将会配备物联网设备实时采集数据,而采集来的数据将会让商家提供更优质、甚至是定制化的服务,形成双赢。而在工业领域,物联网所采集的大数据也将发挥很大的作用,形成良性循环。

    同样随着数据样本与采集渠道的丰富,针对数据采集过程、数据转换与传送和数据存储环节的服务也已经有了很大的发展,Informatica及Mulesoft就是多渠道数据的集成与数据治理行业中的代表性企业。

    第三大数据的分析及可视化

    在有了足够的存储与计算能力,并获得了大量的数据后,数据分析产业的发展水到渠成。目前通用性的数据分析行业,主要有数据分析、数据分析可视化、大数据检索,以及延伸出的数据服务平台、商业智能分析及大数据预测与咨询这6大类业务。

    数据分析的内容将会在第二及第三篇文章中详细介绍,今天仅介绍一下数据分析的整体情况,及未来可能的发展方向。

    大数据分析的出现,对企业而言最大的价值就是能够将大量沉淀的用户行为数据、消费数据、企业服务软件中的数据进行整合,并通过对这些数据的分析来优化产品设计、价格的制定和销售方法的提升,同时降低企业内部运转的成本提高运营效率,例如Pentho通过抓取企业服务软件(主要为SAP)中的各类数据并挖掘及分析,最终能够帮助企业节约大量的报表制作时间,并让管理者能够实时看到企业的运行情况。

    同样对于电信、电力以及交通等专业领域的企业来说,通过收集用户数据,可以分析并预测未来的需求,提前对价格进行实时智能调节,并合理分配负载,从而实现利润的最大化并保证运行的安全。

    而对舆情数据的分析能够帮助企业及时了解市场情绪,并快速迭代自己的产品与服务,对于金融企业来说也可以快速获知最新动态避免因为信息不对称而暴露于风险中。例如Datameer提供的数据分析引擎就能够实时监测公共消息,检测其语言和传播方式,使用户能够早于媒体报道获得最新资讯,并通过可视化的方式使用户轻松快速上手。

    大数据可视化,则是建立在大数据分析之上的,让人们能够更加便捷的理解数据分析结果的手段。大多数提供数据可视化业务的公司都将其作为对数据分析的延伸业务,例如Bottlenose 在进行数据分析自动化业务的同时,提供对社交媒体分析的“声纳图”,能够让用户对复杂的关系及逻辑线条一目了然,提升了用户对其数据分析业务的采纳程度。

    预计随着数据分析手段与方法的不断升级,数据的可视化工作将成为重点方向,将日益复杂化的数据分析结果与人相连接将会面临技术不断的挑战。

    第四大数据的行业应用

    大数据技术已经被视为了未来经济生活中的基础设施,这意味着几乎全部行业都能够在大数据分析技术之上获得经济效率的提升。星河研究院此次将大数据应用的研究范围覆盖到了20多个行业,包含电子商务、媒体营销、物流、企业服务、教育、汽车、金融科技等诸多产业,这一部分行业与公司的介绍将会放在第四到第七篇文章中。

    在销售行业中,通过输入客户的性格、穿搭习惯、所处行业及历史销售数据等信息,销售员将会被大数据分析告知,何时给哪一位客户打电话获得订单的概率最高;在品牌形象建立中,Persado能够依据市场情绪的分析,写出与用户能够产生共鸣的文案从而获取消费者好感;法律行业中Ravel能够“阅读”过去数十万判决案例,针对用户输入的案件给出判决概率预测,帮助律师制定辩护策略,而长期来看法律大数据企业很有可能取代大部分初级律师;同样在零售、广告、医疗等诸多领域,大数据技术都能通过分析数据内在的关系而帮助用户实现购买预测、受众精准投放以及病情辅助判断等功能。大数据的行业应用精彩纷呈,远不止上文所提到的这些,接下来的文章中我们会逐一展现大数据应用的神奇。

    第五大数据成为AI产业的燃料

    人工智能技术一直是科学家与技术人员的追求,但其发展并不是一帆风顺。例如最初的自然语言识别技术中,科学家希望通过语法规则使计算机理解语义从而实现智能化,但显示证明这一路径并不可行,其后依据大量数据样本的统计方法才有效的提升了自然语言处理的准确度并逐渐达到可用水平。

    如今随着计算技术与数据量的提升,大数据能够带给我们的福利已经不仅限于资料的查找,识别语言、视觉的AI技术提供给我们的,除了经常看到的“个人助理”和动态美颜等功能外,仿照大脑结构进行写作、自动记录会议纪要、情绪识别与性格分析,甚至是视频内容的搜索等功能都能够对商业及产业起到较大的推动作用。

    聚焦于大数据的分析、可视化及BI领域

    虽然这三个领域在功能及应用范围上各有千秋,但实质上可以说是相辅相成:通过大数据的基础分析工具,研究人员可以获得数据内部的逻辑及结果表现,但通常这些结果过于复杂并缺乏合理的表达形式,使数据科学家及企业的管理者无法快速领会并对经营活动进行调整。

    因此大数据的可视化方案应运而生,多数可视化方案都作为数据分析工具的延伸而存在,但也有少部分公司另辟蹊径,采用非传统方式将数据的可视化更加贴近需求。BI则是大数据分析和可视化与业务场景的结合,作为企业内部管理工具,使企业的价值有了极大的增长,成为了大数据应用领域重要的一环。

    第一大数据分析领域,在朝向易用、简单化发展

    大部分大数据分析企业的现状,可以说是将数据的分析、可视化及数据的采集、治理、集成进行了一体化,以大数据的分析平台形式存在。例如Fractal Analytics除了具备数据分析功能外,还提供自动化数据清理及验证服务,能够返回标准化的结构化数据; Voyager Labs则能够实时采集、分析遍布世界各地的数十亿个数据点,帮助用户进行预测。

    上述典型公司主要面向大型企业进行定制化全流程服务,客单价有时高达千万美元级别,例如Fractal Analytics的客户就包括飞利浦、金佰利等大型公司,其高昂的价格及服务令小型企业望尘莫及。

    但随着大数据技术的逐渐普及,SaaS化的大数据分析服务将是一个明确的发展方向,而其使用门槛也将大幅降低,从而将大数据分析的能力逐步赋予给中小企业,以真正的实现其基础资源的价值。同时确保企业数据安全的数据脱敏、数据保护市场也会随着SaaS化的到来而逐步拓展出新的市场空间。

    目前大数据技术简化、低成本、易用的趋势已经在部分公司的产品策略上有所体现,例如大数据分析公司Domino的产品让数据科学家只需专注于自己的分析工作,而不用关注软硬件基础设施的建立及维护,Datameer更进一步开发出的产品屏蔽了复杂的大数据分析底层技术,通过类似电子表格的可视化数据分析用户界面,让企业的员工能够快速上手使用,RapidMiner Studio可零代码操作客户端,实现机器学习、数据挖掘、文本挖掘、预测性分析等功能。

    在大数据分析能力普及的同时,提升数据分析性能、优化数据分析结果的技术研发也在快速进展中。例如SigOpt通过自主开发的贝叶斯优化(Bayesian Optimization)算法来调整模型的参数,获得了比常见的网格搜索(grid searching technique)解决方案更快、更稳定、更易于使用的结果,目前SigOpt 的产品不仅可以让用户测试不同变量,还能够提供下一步的测试建议,以帮助用户持续优化改善数据分析结果。

    令人感到欣喜...

  • ?

    一图看懂光大银行大数据发展现状

    Gaby

    展开

    构建大数据与人工智能的基石

    构建多元化的大数据AI技术互联平台,实现从数据到分析,从分析到互联交互的端到端过程。

    数据服务轻型化、智能化转型,减员增效;全生命周期数据资产管理,安全质量高;大数据组织及人才培养,自主可控。

    打造助力价值转化的数据产品

    打造多项数据产品,面向业务场景进行快速封装,覆盖全行风险、零售、对公等主要业务条线。

    基于“客户画像模型工厂”,打造 “大零售客户画像超市”数据产品,双剑合璧形成客户画像AI能力,支持网点转型、千人千面、智能营销、普惠金融等多个领域。

    探索创新的人工智能技术应用

    在产品创新、客户服务、风险控制、市场营销、运营管理等业务流程中探索人工智能创新应用,通过金融科技重塑银行服务模式。

    更多的数据维度、更强的智能算法、更快的更新频率,通过融合大数据与人工智能技术优势,打造“会思考”的风控模型,实现更智能的风控。

    创立具有创新活力的大数据社区

    “像外行一样思考,像专家一样实践”,业务与科技携手并进,共建大数据文化,是我们站在浪潮之巅的唯一方法。

    以互联网产品理念为中心,以业务创意碰撞融合为驱动力,打造大数据项目孵化机制,加速产品创新。

  • ?

    大数据分析的现状和未来|昆山杜克大学教授来历城二中做报告

    西门庆

    展开

    2017年9月15日,美国杜克大学电子与计算机工程系教授,昆山杜克大学应用科学与工程研究院院长和大数据研究中心主任李昕教授为历城二中高三学生带来《大数据分析的现状和未来》的主题报告,并做了招生宣讲。

    杜克大学是全美排名第八的优秀大学,在全球有很大的影响力,尤其是其计算机科学和大数据研究领域。

    大数据分析将各学科交叉融合,在我们的生活中有着广泛应用。在汽车领域中,大到外架,小到齿轮,都离不开数据的分析。我们人类的大脑每天也进行着大数据分析。大数据分析将生物学和电子学结合,可以有助于残疾人的日常生活;将声音记录和视频影像结合,可以改变目前不被重视的早教;将编程学和计算科目融合,可以方便每天的日常出行。

    人类迈入互联网时代,每一分、每一秒,都在创造强大的数据流。电子网络,统计算法,如同庞大的触角,深入生活中的每个角落。个人也从人潮中的一个个孤岛,串联成广阔的大陆,拉近了彼此之间的距离。在这样一个全新的时代,数字数据不单单是普通的字符,更是为时代添加韵动的音符。

    跨学科的交融,大数据的交叉,在这种背景下,我们要博学广识,让知识真正“为我所用”。

    听了报告,同学们受益匪浅,对大数据的应用和前景有了一定了解,对现代科技的发展有了更深刻的认识。报告最后,同学们积极提问,了解了更多有关大数据和昆山杜克大学的信息。

    李昕教授简介:

    李昕教授于2005年获美国卡内基梅隆大学电子与计算机工程系博士,2007年至2016年先后为美国卡内基梅隆大学电子与计算机工程系助理教授和副教授。现为美国杜克大学电子与计算机工程系正教授,昆山杜克大学应用科学与工程研究院院长和大数据研究中心主任,美国国家自然科学基金CAREER奖获得者,国际电气电子工程师协会会士(IEEE Fellow),大数据与人工智能专家,被富士康集团创始人、董事长郭台铭誉为“世界知名的制造业大数据分析专家”,多次承担美国国家自然科学基金、美国国防部先进研究项目局(DARPA)、英特尔、丰田、富士康等政府与公司的研究项目。作为项目带头人,获得的研究资金总额超过430万美元。作为项目参与人,另获得的研究资金总额超过600万美元。集自身在机器学习、计算机视觉、智能制造等方面的专长,成功开拓多领域的交叉研究,得到国际同行高度赞誉和广泛引用及应用。于2005年创立了美国Xigmix公司,担任公司的技术总监(CTO)。Xigmix于2007年被Extreme-DA收购,然后于2011年以2千6百万美金的价格转让给美国纳斯达克上市公司新思科技(Nasdaq: SNPS)。目前是R&B Smart Devices(中国香港)、X&L Holding(中国香港)和伊沃人工智能技术(江苏)有限公司的董事。于2009年至2012年担任美国电路与系统联合研究中心助理主任,管理3000万美金的科研经费。出版著作4本,在国际顶级期刊发表论文50余篇,在国际顶级学术会议发表论文130余篇,获得6次最佳论文奖和6次最佳论文提名。

  • ?

    中国大数据行业就业现状

    刘俊驰

    展开

    大数据(big data),指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。

    大数据5V特性:

    ——Volume(大量)

    ——Velocity(高速)

    ——Variety(多样)

    ——Value(低价值密度)

    ——Veracity(真实性)

    大数据的就业前景?

    近年来大数据迅速发展,成为工业界,学术界,甚至世界各地政府,高度关注的热点。大数据领域正面临全球性的“人才荒”。而在国内,根据数联寻英发布《大数据人才报告》,目前全国的大数据人才仅46万,3-5年内大数据人才的缺口将高达150万。

    对数据的占有和控制,将成为国家间和企业间新的争夺焦点。大数据正在成为继云计算之后的新的热词,大数据时代已然来临,大数据背后,隐匿着巨大的商机。包括IBM,微软,谷歌,亚马逊等一大批知名企业纷纷掘金这一市场。

    中国商业联合会数据分析专业委员会统计,未来中国基础性数据分析人才缺口将达到1400万,而在BAT企业招聘的职位里,60%以上都在招大数据人才。

    职位技能需求

    1.学历需求现状:大专最多,本科次之

    2.工作经验需求现状:半数企业经验不限

    从工作经验来看,69.1%的企业对求职者的要求是经验不限,这很大一部分说明的人才的稀缺,这对于应届大学生而言,无疑是一大机遇,因为企业对于工作经验要求的低,而应届大学生只需要通过培训就能掌握该岗位应有的技能,就能轻松上岗拿高薪,这也充分说明当下学习大数据绝对是千载难逢的黄金时间点。

    不管你是谁,学历如何,只要技术好,你就是老大!!!

    大数据就业薪资

    1. Hadoop大数据开发方向

    据了解Hadoop开发工程师入门薪资已经达到了 8K 以上,工作1年可达到 1.2W 以上,具有2-3年工作经验的hadoop开发工程师年薪可以达到 30万—50万,一般需要大数据开发的公司基本上都是大公司,Hadoop开发工程师是目前BAT企业、大数据公司最急需的人才,所以学习大数据专业也是进大公司的捷径!

    2. 数据挖掘、数据分析&机器学习方向

    机器学习职位薪水范围:12k--30K,最大值30k+若干股票,最小值12k+若干期权,上四分位25k,中位数18k,下四分位13k;数据挖掘薪水范围:12k--30K,最大值30k+若干股票,最小值12k,上四分位23k,中位数18k,下四分位14k。

    ★北京大数据开发平均工资: 30230/月。

    1、基础人才-数据分析师

    北京数据分析平均工资: 10630/月,取自 15526 份样本,较 2016 年,增长 9.4%。

    2、大数据开发工程师

    北京大数据开发平均工资: 30230/月。

    3、Hadoop开发工程师

    北京hadoop平均工资: 20130/月,取自 1734 份样本。

    4、数据挖掘工程师

    北京数据挖掘平均工资: 21740/月,取自 3449 份样本,较 2016 年,增长 20.3%;

    5、算法工程师

    北京算法工程师平均工资: 22640/月,取自 10176 份样本。

  • ?

    深入浅出学习大数据:详解大数据产业特点及现状!

    元菱

    展开

    今天主要介绍大数据产业特点及现状,新朋友可以翻阅我前面的文章,跟上学习大数据的步伐。希望大家持续学习,每天关注,我会连续更新文章,让大家系统学习和认识大数据。

    一、大数据产业分类及特点

    1.1 大数据产业分类

    产业分类目前对于大数据产业的分类并没有统一规定,依据不同角度可以总结为以下几种:

    (1)二分法 。主要依据占有大数据的情况,分为大数据产业和大数据衍生产业。大数据产业主要指自身生产数据或者获取数据的存储、分析、应用类产业。大数据衍生产业主要指从事大数据产业所需要的基础设施和技术支持类产业。

    (2)三分法 。主要依据数据的营销模式将大数据产业分为3类:①应用大数据进行用户信息行为分析,实现企业自身产品和广告推介的产业;②通过对大数据进行整合,为用户提供从硬件、软件到数据整体解决方案的企业;③出售数据产品和为用户提供具有针对性解决方案的服务产业。

    (3)五分法。 按照产业的价值模式分为大数据内生型价值模式、外生型价值模式、寄生型价值模式、产品型价值模式和云计算服务型价值模式(见表)。

    1.2 大数据产业特点

    (1)产业数据资产化 。在大数据时代,数据渗透到每个行业,逐渐成为企业资产,也成为大数据产业创新的核心驱动力。自身生产数据的互联网企业具有得天独厚的优势,其可以利用其丰厚的数据资产,挖掘数据的潜在价值,洞察用户的信息行为,推动产业利用数据实现精准和个性化的生产、营销和获利模式。

    (2)产业技术的高创新性 。创新是大数据产业发展的基石。世界上每天都在生成海量数据,如何有效地获取数据、存储数据、整合数据和服务用户,需要大数据产业技术不断革新。具体来讲,包括对大数据的去冗降噪技术、高效率低成本的大数据存储与有效融合技术、非结构化和半结构化数据的高效处理、适合不同行业的大数据挖掘分析工具和开发环境、大幅度降低数据处理、存储和通信能耗等技术的不断优化和创新,为用户提供高效、高质量、个性化的服务。

    (3)产业决策智能化 。大数据产业在推动企业决策智能化发展中起到领头羊的作用。首先是产业自身决策智能化的发展,其次是为行业决策智能化提供数据、技术与管理平台。赛迪的研究报告显示:过去,企业对数据的关注只是存储和传输,而企业利用的数据不足其获得数据的5%,在数据量每年约60%增长的情况下,企业平均只获取其中25%~30%的数据,作为企业战略的数据还远未得到挖掘。随着大数据产业的发展,分布式计算的大数据推动生产组织向去中心、扁平化、自组织、自协调方向演化,促进劳动与资本一体化,并且在决策过程中极大地克服人类的有限理性,推动决策朝着智能化、科学化的方向发展。

    (4)产业服务个性化。 Monetate公司的调查报告显示,与未利用数据分析的企业相比,投入并分析数据的企业增长率为49%,而通过可量化的个性化实现在线销售额的增长率为19%。因而,基于数据的分析成为大数据产业提供个性化服务的重要工具。这些产业通过数据挖掘用户的兴趣和偏好,针对个体需求开展个性化定制与云推荐业务,提升产品服务质量,满足用户更高级别的需求,以获得更高的经济收益。

    二、我国大数据产业发展现状

    2.1 政策与法律层面

    (1)虽然我国大数据产业目前缺乏国家层面的政策,但是在相关的国家战略中已经涉及大数据技术与发展规划。例如《“十二五”国家战略性新兴产业发展规划》提出支持海量数据存储、处理技术的研发与产业化;《物联网“十二五”发展规划》也将信息处理技术列为4项关键技术创新工程之一,其中包括海量数据存储、数据挖掘、图像视频智能分析,另外3项关键技术创新工程包括信息感知技术、信息传输技术、信息安全技术,这些也是大数据产业的重要组成部分,与大数据产业发展密切相关。但这些只是大数据产业链的部分环节,尚缺乏系统性、整体性、纲领性的大数据产业政策。

    (2)开放数据是指非专有的、机器可读的、免费的数据,任何人可以不受法律或技术限制来使用、重复使用、操作和传播这些数据。公布政府数据的目的不仅是为了接受监督,还可以激发创意,通过数据再处理来增加数据价值。政府部门所拥有的数据占整个社会数据的绝大部分,而政府数据开放政策的制定会进一步推动大数据产业的深入发展。与国外相比,我国在政府数据开放方面还没有相应的政策、法规出台,在一定程度上制约了我国大数据产业的发展。

    (3)大数据环境下,关于信息主权的界定和网络用户隐私的保护将对国家安全和数字经济的发展创造良好环境。目前我国关于网络用户隐私保护的问题在相关法律中有所涉及。例如《计算机信息网络国际联网安全保护管理办法》第7条规定:“用户的通信自由和通信秘密受法律保护。任何单位和个人不得违反法律规定,利用国际联网侵犯用户的通信自由和通信秘密。”《计算机信息网络国际联网管理暂行规定实施办法》第18条规定:“不得擅自进行未经许可的计算机操作,篡改他人信息,冒用他人名义发出信息,侵犯他人隐私。”大数据环境下,这些法律条款在用户隐私保护方面虽然起到一定的作用,但远远不够,目前我国并没有制定关于网络用户隐私安全的单行法律,这是我国大数据产业发展的一个重要制约因素。

    2.2 产业层面

    (1)产业区位。 我国大数据产业集聚区位于经济比较发达的地区,北京、上海依旧是发展的核心地区,这些地区的信息技术产业基础良好,并且已经形成了较完备的产业链,产业规模也在不断扩大,吸纳了全国比较优秀的信息技术人才,为相关企业向大数据产业迅速转型奠定了良好基础。同时,在这些地区也涌现出很多初创的公司加入到数据存储和数据分析的开发和研究中来。

    (2)产业结构 。根据赛迪顾问云计算产业研究中心发布的报告,2012年,我国大数据产业链雏形已经初显。大数据产业链主要涉及数据的收集、存储、分析和应用等几个主要环节,国内很多信息技术企业也纷纷开始转型,向数据的管理、应用和服务转型。这种转型带来的变化主要有:①企业更加注重自身的数据开放和应用,提高企业决策效率和完善产品、服务营销策略;②硬件企业的升级和转型。例如联想通过与全球知名的存储公司EMC合作,正式进入大数据的企业级应用领域;③互联网企业提高数据分析能力。例如阿里巴巴利用大数据提供阿里信用贷款与淘宝数据魔方,百度已经建成百度指数、司南等5大数据体系平台和消费者画像、品牌探针等技术分析方法。

    2.3 人才层面

    大数据产业迅速发展,数据科学家的概念应运而生。根据哈佛商业评论所言:数据科学家将成为21世纪最性感的职业。数据科学家是采用科学方法、运用数据挖掘工具寻找新的数据洞察的工程师。数据科学家除应具备好奇心和怀疑的精神外,还应具有分析能力、技术能力、沟通与合作能力(见表)。数据科学家是复合型高端人才。麦肯锡预计,到2018年,仅在美国市场,数据科学家人才缺口就将达到14~19万,而相关方面的管理人才缺口将达到150万。人才短缺也是制约我国大数据产业发展的重要因素。

    今天介绍了大数据产业特点及现状,后面会继续带你认识不一样的大数据。

    如果您想长期获取科技信息的解读,记得关注我,我会每天更新,谢谢。同时如果您有什么意见和建议,欢迎评论。

    本文来自巨头挖掘机,创业家系授权发布,略经编辑修改,版权归作者所有,内容仅代表作者独立观点。

  • ?

    2018年大数据安全行业发展现状分析 技术有待进一步发展

    万诗双

    展开

    一、大数据安全分为三个层次

    大数据安全技术体系分为大数据平台安全、数据安全和个人隐私保护三个层次,自下而上为依次承载的关系。大数据平台不仅要保障自身基础组件安全,还要为运行其上的数据和应用提供安全机制保障;除平台安全保障外,数据安全防护技术为业务应用中的数据流动过程提供安全防护手段;隐私安全保护是在数据安全基础之上对个人敏感信息的安全防护。

    大数据平台安全是对大数据平台传输、存储、运算等资源和功能的安全保障,包括传输交换安全、存储安全、计算安全、平台管理安全以及基础设施安全。

    数据安全防护是指平台为支撑数据流动安全所提供的安全功能,包括数据分类分级、元数据管理、质量管理、数据加密、数据隔离、防泄露、追踪溯源、数据销毁等内容。

    隐私保护是建立在数据安全防护基础之上的保障个人隐私权的更深层次安全要求。然而,大数据时代的隐私保护不再是狭隘地保护个人隐私权,而是在个人信息收集、使用过程中保障数据主体的个人信息自决权利。实际上,个人信息保护已经成为一个涵盖产品设计、业务运营、安全防护等在内的体系化工程,不是一个单纯的技术问题。

    二、大数据平台自身安全机制存在局限性

    目前,Hadoop已经成为应用最广泛的大数据计算软件平台,其技术发展与开源模式结合。Hadoop的最初设计是为了管理大量的公共web数据,假设集群总是处于可信的环境中,由可信用户使用的相互协作的可信计算机组成。因此最初的Hadoop没有设计安全机制,也没有安全模型和整体的安全规划。随着Hadoop的广泛应用,越权提交作业、修改JobTracker状态、篡改数据等恶意行为不断出现。据CVE漏洞列表显示,从2013年到2017年,Hadoop暴露出来的漏洞数量共计18个,其中有5个是关于信息泄露的漏洞,并且漏洞数量逐年增长。

    三、数据泄露事件数量持续增长,造成的危害日趋严重

    大数据因其蕴藏的巨大价值和集中化的存储管理模式成为网络攻击的重点目标,针对大数据的勒索攻击和数据泄露问题日趋严重,重大数据安全事件频发。Gemalto《2017数据泄露水平指数报告》显示,2017年上半年全球范围内数据泄露总量为19亿条,超过2016年全年总量(14亿),比2016年下半年增长了160%多。仅2017年,全球发生了多起影响重大的数据泄露事件,美国共和党下属数据分析公司、征信机构先后发生大规模用户数据泄露事件,影响人数均达到亿级规模。我国数据泄露事件也时有发生。2017年3月,京东试用期员工与网络黑客勾结,盗取涉及交通、物流、医疗等个人信息50亿条,在网络黑市贩卖。此外,数据泄露的潜在隐患同样不容乐观,据Shodan统计,截至2017年2月3日,中国有15046个MangoDB数据库暴露在公网,存在严重安全问题。

    四、大数据安全技术有待进一步发展

    国内外大数据平台安全、数据安全、隐私保护相关的技术已经取得了一定的进展;但在应对一些新的网络攻击形式、数据应用场景、隐私保护需求方面,大数据安全技术的现有能力和水平还存在一定差距。

    1、平台安全方面

    集中的安全配置管理和安全机制部署能够基本满足目前平台的安全需求,大数据平台的漏洞扫描与攻击监测技术相对薄弱。Hadoop仍处在快速发展的阶段,认证机制依赖Kerberos,其认证中心可能会成为系统瓶颈。平台防攻击技术方面,目前大数据平台仍然使用传统网络安全的防护手段,对大数据环境下扩大的防护边界和更加隐蔽的攻击方式无法做到全面覆盖,而且行业对大数据平台本身可能的攻击手段关注较少,预防手段不足,一旦有新的漏洞出现,波及范围将十分巨大。

    2、数据安全方面

    数据安全监控和防泄露技术相对成熟,数据的共享安全、非结构化数据库的安全防护以及数据泄露溯源技术亟待改进。密文计算技术、数据泄露追踪技术的发展仍无法满足实际的应用需求,难以解决数据处理过程的机密性保障问题和数据流动路径追踪溯源问题。具体而言,密文计算技术的研究仍处在理论阶段,运算效率远未达到实际应用的需求;数字水印技术无法满足大数据环境下大量、快速更新的应用需求;数据血缘追踪技术未获得足够的应用验证,其成熟度尚未达到产业化应用水平。

    3、隐私保护方面

    技术的发展明显无法满足当前迫切的隐私保护需求,大数据应用场景下的个人信息保护问题需要构建法律、技术、经济等多重手段相结合的保障体系。目前,应用广泛的数据脱敏技术受到多源数据汇聚的严重挑战而可能面临失效,匿名化算法等前沿技术目前鲜有实际应用案例,普遍存在运算效率过低、开销过大等问题,还需要在算法的优化方面进行持续改进,以满足大数据环境下的隐私保护需求。

    以上数据及分析均来自于前瞻产业研究院《2018-2023年中国工业大数据产业发展前景与投资战略规划分析报告》。

    更多深度行业分析尽在【前瞻经济学人APP】,还可以与500+经济学家/资深行业研究员交流互动。

  • ?

    大数据技术学习,深度挖掘大数据的现状分析

    沙谷芹

    展开

    技术型的高科技创业公司都喜欢闪闪发光的新东西,而“大数据”跟3年前火热程度相比反而有些凄惨。虽然Hadoop创建于2006年,在“大数据”的概念兴起到达白热化是在2011年至2014年期间,当时在媒体和行业面前,大数据就是“黑金石油”。2015年数据世界中时尚年轻人喜欢转移到AI的相关概念,他们口味变成:机器智能,深度学习等。

    企业级技术 = 艰苦的工作

    其实大数据有趣的是它不是直接可以炒作的东西。

    能够获得广泛兴趣的产品和服务往往是那些人们可以触摸和感受到的,比如:移动应用,社交网络,可穿戴设备,虚拟现实等。

    但大数据,从根本上说是“管道”。当然,大数据支持许多消费者或企业用户体验,但其核心是企业的技术:数据库,分析等:而这后面几乎没人能看到东西运行。

    而且如果大家真正工作过的都知道,在企业中改造新技术并不大可能在一夜之间发生。

    早年的大数据是在大型互联网公司中(特别是谷歌,雅虎,Facebook,Twitter,LinkedIn等),它们重度使用和推动大数据技术。这些公司突然面临着前所未有的数据量,没有以前的基础设施,并能招到一些最好的工程师,所以他们基本上是从零开始搭建他们所需要的技术。开源的风气迅速蔓延,大量的新技术与更广阔的世界共享。随着时间推移,其中一些工程师离开了大型网络公司,开始自己的大数据初创公司。其他的“数字原生”的公司,其中包括许多独角兽,开始面临跟大型互联网公司同样需求,无论有没有基础设施,它们都是这些大数据技术的早期采用者。而早期的成功导致更多的创业和风险投资。

    现在一晃几年了,我们现在是有大得多而棘手的机会:数据技术通过更广泛从中型企业到非常大的跨国公司。不同的是“数字原生”的公司,不必从头开始做。他们也有很多损失:在绝大多数的公司,现有的技术基础设施“够用”。这些组织也明白,宜早不宜迟需要进化,但他们不会一夜之间淘汰并更换关键任务的系统。任何发展都需要过程,预算,项目管理,导航,部门部署,全面的安全审计等。大型企业会小心谨慎地让年轻的创业公司处理他们的基础设施的关键部分。而且,一些(大多数?)企业家压根不想把他们的数据迁移到云中,至少不是公有云。

    大数据分析的基本流程图

    从另一个关键点大家就明白了:大数据的成功是不是实现一小片技术(如Hadoop的或其他任何东西),而是需要放在一起的技术,人员,流程的流水线。你需要采集数据,存储数据,清理数据,查询数据,分析数据,可视化数据。这将由产品来完成,有些由人力来完成。一切都需要无缝集成。归根结底,对于这一切工作,整个公司,从高级管理人员开始,需要致力于建立一个数据驱动的文化,大数据不是小事,而是全局的事。

    换句话说:这是大量艰苦的工作。

    部署阶段

    以上解释了为什么几年后,虽然很多高调的创业公司上线也拿到引人注目的风险投资,但只是到达大数据部署和早期成熟阶段。

    更有远见的大公司(称他们为“尝鲜者”在传统的技术采用周期),在2011 - 2013年开始早期实验大数据技术,推出Hadoop系统,或尝试单点解决方案。他们招聘了形形色色的人,可能工作头衔以前不存在(如“数据科学家”或“首席数据官”)。他们通过各种努力,包括在一个中央储存库或“数据湖”倾倒所有的数据,有时希望魔术随之而来(通常没有)。他们逐步建立内部竞争力,与不同厂商尝试,部署到线上,讨论在企业范围内实施推广。在许多情况下,他们不知道下一个重要的拐点在哪里,经过几年建设大数据基础架构,从他们公司业务用户的角度来看,也没有那么多东西去显示它。但很多吃力不讨好的工作已经完成,而部署在核心架构之上的应用程序又要开始做了。

    下一组的大公司(称他们为“早期大众”在传统的技术采用周期)一直呆在场边,还在迷惑的望着这整个大数据这玩意。直到最近,他们希望大供应商(例如IBM)提供一个一站式的解决方案,但它们知道不会很快出现。他们看大数据全局图很恐怖,就真的想知道是否要跟那些经常发音相同,也就凑齐解决方案的创业公司一起做。他们试图弄清楚他们是否应该按顺序并逐步工作,首先构建基础设施,然后再分析应用层,或在同一时间做所有的,还是等到更容易做的东西出现。

    生态系统正在走向成熟

    同时,创业公司/供应商方面,大数据公司整体第一波(那些成立于2009年至2013)现在已经融资多轮,扩大他们的规模,积累了早期部署的成功与失败教训,也提供更成熟,久经考验的产品。现在有少数是上市公司(包括HortonWorks和New Relic 它们的IPO在2014年12月),而其他(Cloudera,MongoDB的,等等)都融了数亿美元。

    VC投资仍然充满活力,2016年前几个星期看到一些巨额融资的晚期大数据初创公司:DataDog(9400万),BloomReach(5600万),Qubole(3000万), PlaceIQ( 2500万)这些大数据初创公司在2015年收到的$ 66.4亿创业投资,占高科技投资总额的11%。

    并购活动仍然不高(35次)。

    随创业活动和资金的持续涌入,有些不错的资本退出,日益活跃的高科技巨头(亚马逊,谷歌和IBM),公司数量不断增加,这里就是2016年和2017年大数据全景图:

    很显然这里密密麻麻很多公司,从基本走势方面,动态的(创新,推出新的产品和公司)已逐渐从左向右移动,从基础设施层(开发人员/工程师)到分析层(数据科学家和分析师的世界)到应用层(商业用户和消费者),其中“大数据的本地应用程序”已经迅速崛起- 这是我们预计的格局。

    大数据基础架构:创新仍然有很多

    正是因为谷歌十年前的MapReduce和BigTable的论文,Doug Cutting, Mike Cafarella开发 创建Hadoop的,所以大数据的基础架构层成熟了,也解决了一些关键问题。

    而基础设施领域的不断创新蓬勃发展还是通过大量的开源活动。

    Spark带着Hadoop飞

    2015年毫无疑问是Apache Spark最火的一年,这是一个开源框架,利用内存中做处理。这开始得到了不少争论,从我们发布了前一版本以来,Spark被各个对手采纳,从IBM到Cloudera都给它相当的支持。 Spark的意义在于它有效地解决了一些使用Hadoop很慢的关键问题:它的速度要快得多(基准测试表明:Spark比Hadoop的MapReduce的快10到100倍),更容易编写,并非常适用于机器学习。

    其他令人兴奋的框架的不断涌现,并获得新的动力,如Flink,Ignite,Samza,Kudu等。一些思想领袖认为Mesos的出现(一个框架以“对你的数据中心编程就像是单一的资源池”),不需要完全的Hadoop。即使是在数据库的世界,这似乎已经看到了更多的新兴的玩家让市场持续,大量令人兴奋的事情正在发生,从图形数据库的成熟(Neo4j),此次推出的专业数据库(时间序列数据库InfluxDB),CockroachDB,(受到谷歌Spanner启发出现,号称提供二者最好的SQL和NoSQL),数据仓库演变(Snowflake)。

    大数据分析:现在的AI

    在过去几个月的大趋势上,大数据分析已经越来越注重人工智能(各种形式和接口),去帮助分析海量数据,得出预测的见解。

    最近AI的复活就好比大数据生的一个孩子。深度学习(获取了最多的人工智能关注的领域)背后的算法大部分在几十年前,但直到他们可以应用于代价便宜而速度够快的大量数据来充分发挥其潜力(Yann LeCun, Facebook深度学习研究员主管)。 AI和大数据之间的关系是如此密切,一些业内专家现在认为,AI已经遗憾地“爱上了大数据”(Geometric Intelligence)。

    反过来,AI现在正在帮助大数据实现承诺。AI /机器学习的分析重点变成大数据进化逻辑的下一步:现在我有这些数据,我该怎么从中提取哪些洞察?当然,这其中的数据科学家们 - 从一开始他们的作用就是实现机器学习和做出有意义的数据模型。但渐渐地机器智能正在通过获得数据去协助数据科学家。新兴产品可以提取数学公式(Context Relevant)或自动构建和建议数据的科学模式,有可能产生最好的结果(DataRobot)。新的AI公司提供自动完成复杂的实体的标识(MetaMind,Clarifai,Dextro),或者提供强大预测分析(HyperScience)。

    由于无监督学习的产品传播和提升,我们有趣的想知道AI与数据科学家的关系如何演变 - 朋友还是敌人? AI是肯定不会在短期内很快取代数据科学家,而是希望看到数据科学家通常执行的简单任务日益自动化,最后生产率大幅提高。

    通过一切手段,AI /机器学习不是大数据分析的唯一趋势。令人兴奋的趋势是大数据BI平台的成熟及其日益增强的实时能力(SiSense,Arcadia)。

    大数据应用:一个真正的加速度

    由于一些核心基础架构难题都已解决,大数据的应用层迅速建立。

    在企业内部,各种工具已经出现,以帮助企业用户操作核心功能。例如,大数据通过大量的内部和外部的数据,实时更新数据,可以帮助销售和市场营销弄清楚哪些客户最有可能购买。客户服务应用可以帮助个性化服务; HR应用程序可帮助找出如何吸引和留住最优秀的员工;等

    专业大数据应用已经在几乎任何垂直领域都很出色,从医疗保健(特别是在基因组学和药物研究),到财经到时尚到司法(Mark43)。

    两个趋势值得关注。

    首先,很多这些应用都是“大数据同乡”,因为他们本身就是建立在最新的大数据技术,并代表客户能够充分利用大数据的有效方式,无需部署底层的大数据技术,因为这些已“在一个盒子“,至少是对于那些特定功能 - 例如,ActionIQ是建立在Spark上,因此它的客户可以充分利用他们的营销部门Spark的权力,而无需实际部署Spark自己 - 在这种情况下,没有“流水线”。

    第二,人工智能同样在应用程序级别有强大吸引力。例如,在猫捉老鼠的游戏,安全上,AI被广泛利用,它可以识别黑客和打击网络攻击。 “人工智能”对冲基金也开始出现。全部由AI驱动数字助理行业已经去年出现,从自动安排会议(x.ai)任务,到购物为您带来一切。这些解决方案依赖人工智能的程度差别很大,从接近100%的自动化,到个人的能力被AI增强 - 但是,趋势是明确的。

    在许多方面,我们仍处于大数据的早期。尽管它发展了几年,建设存储和数据的过程只是第一阶段的基础设施。 AI /机器学习出现在大数据的应用层的趋势。大数据和AI的结合将推动几乎每一个行业的创新,这令人难以置信。从这个角度来看,大数据机会甚至可能比人们认为的还大。

  • ?

    利用大数据技术,分析80后90后的收入现状

    牵绊

    展开

    当今已经成为00后的天下了,小鲜肉层出不穷。80后已经在奔四的路上,已经不知不觉的步入中年人的行列。然而80后、90后的收入状况怎么样呢?利用大数据技术对80后和90后的收入状况、生活现状、健康状况如何进行了一系列的调查分析。

    根据复旦大学公布的报告显示,80后中高收入群体的收入增长则更快,2012年进入前10%和前1%的收入门槛为12万元和30万元,2016年已分别提高至20万元和50万元。增长的速度令人惊讶,短短四年间几乎翻了一倍。

    1.90后大学毕业后薪资有多高

    90年的小伙伴转眼间也已经27岁了,不再是年少无知的少男少女,那么90后的高校毕业生的薪资有多高呢?根据城市的不同,薪资自然也有所不同 ,比如在北上广深一线城市工作的同学,根据麦可思数据显示,2013届本科毕业生,毕业3年后,他们拿到的月薪平均为8644元。而2016届本科毕业生,毕业半年后,月薪为5437元。

    2.90后从事哪些行业工资比较高

    发展大数据技术有什么优势?根据麦可思数据显示,以2016届本科毕业生为例,这些毕业半年后月薪最高的专业是信息安全、软件工程、网络工程等,起步薪资就不低,平均月薪达到6k以上,他们中薪资最高的职业大多是计算机相关程序员、大数据工程师、数据分析师、互联网开发师等工作。

    比如北京的大数据工程师的起步薪资在8k左右,工作两三年之后,平均月薪在1.5w-2w左右,并且会随着工作经验的不断积累薪资水平也在不断的上升。

    3.大数据调查学历越高收入越高么

    此次调查数据实力打脸“读书无用论”,此次调查表明学历和收入成正比,学历上升一个层次,薪资就会跟着上升一个层次。博士、硕士的起步薪资比本科专科的薪资待遇要高就说明了这点。

    而且80后对工作从一而终,很大一部分人换工作的次数不超过2次。80后在就业观上很保守,而90后就比较开放了,跳槽是很正常的事情,甚至成为涨薪的手段。换工作的次数与工资收入和受教育程度的关系也很有趣:工资收入越低,越爱换工作;反之收入越高越不爱换工作。

    4.大数据技术分析高收入群体身体更为健康

    其实这个是依据的,不同阶层的生活方式已经出现分化,高收入群体有时间、有精力、有物质条件进行健康资源和促进健康的行为,其体检率、运动频率、健康消费支出等指标都更优。无论在衣食住用行各方面都优于低收入群体。

  • ?

    大数据行业,发展现状及前景分析!

    向卉

    展开

    大数据时代的到来,简单的说是海量数据同完美计算能力结合的结果。确切的说是移动互联网、物联网产生了海量的数据,大数据计算技术完美地解决了海量数据的收集、存储、计算、分析的问题。大数据时代开启人类社会利用数据价值的另一个时代。

    分享之前推荐一个大数据学习交流,未来将是大数据时代,需要学习大数据的抓紧时间学习,群内不定期分享视频资料,欢迎加入关注作者其他文章,可以找到大数据学习群

    大数据行业发展现状

    1、一些数据的记录是以模拟形式存在,或者以数据形式存在,但是存贮在本地,不是公开数据资源,没有开放给互联网用户,例如音乐、照片、视频、监控录像等影音资料。现在这些数据不但数据量巨大,并且共享到了互联网上,面对所有互联网用户,其数量之大是前所未有。

    2、移动互联网出现后,移动设备的很多传感器收集了大量的用户点击行为数据,已知IPHONE有3个传感器,三星有6个传感器。它们每天产生了大量的点击数据,这些数据被某些公司所有拥有,形成用户大量行为数据。

    3、电子地图如高德、百度、Google地图出现后,其产生了大量的数据流数据,这些数据不同于传统数据,传统数据代表一个属性或一个度量值,但是这些地图产生的流数据代表着一种行为、一种习惯,这些流数据经频率分析后会产生巨大的商业价值。基于地图产生的数据流是一种新型的数据类型,在过去是不存在的。

    4、进入了社交网络的年代后,互联网行为主要由用户参与创造,大量的互联网用户创造出海量的社交行为数据,这些数据是过去未曾出现的。其揭示了人们行为特点和生活习惯。

    5、电商户崛起产来了大量网上交易数据,包含支付数据,查询行为,物流运输、购买喜好,点击顺序,评价行为等,其是信息流和资金流数据。

    6、传统的互联网入口转向搜索引擎之后,用户的搜索行为和提问行为聚集了海量数据。单位存储价格的下降也为存储这些数据提供了经济上的可能。

    我们所指的大数据不同与过去传统的数据,其产生方式、存储载体、访问方式、表现形式、来源特点等都同传统数据不同。大数据更接近于某个群体行为数据,它是全面的数据、准确的数据、有价值的数据。

    中国的大数据之路任重而道远

    中国目前的大数据应用环境和技术相对于美国而言,在整体技术水平、应用环境、国民意识、商业环境、技术厂商、技术平台上面相差超过5年左右。在大数据应用的国家战略层面落后的也较多。

    2012年3月,美国奥巴马政府宣布推出“大数据的研究和发展计划”。该计划涉及美国国家科学基金、美国国家卫生研究院、美国能源部、美国国防部、美国国防部高级研究计划局、美国地质勘探局等6个联邦政府部门,承诺将投资两亿多美元,大力推动和改善与大数据相关的收集、组织和分析工具及技术,以推进从大量的、复杂的数据集合中获取知识和洞见的能力。美国奥巴马政府宣布投资大数据领域,是大数据从商业行为上升到国家战略的分水岭,表明大数据正式提升到战略层面,大数据在经济社会各个层面、各个领域都开始受到重视。

    2014年从“两会”的提案、议案看,很多人建议将大数据业务上升为国家战略,互联网领军人物李彦宏在政协记者会上表示,政府应该把更多和人民生活有关的数据资料,公开地放到网络上;雷军则直接建议将大数据纳入国家战略,推动大数据切实地被用起来;科大讯飞刘庆峰建议国家建设声纹数据库进行大数据反恐。张近东、马化腾、杨元庆的提案也与数据应用有着紧密联系。但是在中国大数据国家战略和大数据产业发展发面还没有一个清晰的蓝图。

    最后总结一下,大数据时代将会给人类社会带来巨大变化。它是一个好的工具,就像计算机一样,帮助人们提升社会生产效率,了解事物真相,认识客观规律,同时加快进入智慧社会。

    以上种种,无不揭示着大数据未来发展的大好前景!时不我待,抓住机遇!

大数据分析技术现状

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP