中企动力 > 商学院 > 大数据哪里比较好
  • ?

    大数据告诉你,哪些职位薪水更高,哪些公司待遇更好

    鲁从云

    展开

    之前抓了一些拉勾的数据,包括将近10w个公司以及100w个招聘职位的数据,最近有时间了拿来做一些分析。

    先来看公司的一些情况

    一、看看公司的地域分布

    从图中能看出,北京的公司数量占了绝对领导地位,甚至我们能发现跟城市的人口分布符合Zipf法则一样,公司的发展数量也基本符合Zipf法则法则,当然这跟拉勾base北京也有一定关系。北上广深作为一线城市,互联网发展也是处于第一梯队,而有阿里、网易驻扎的杭州紧随其后,地处天府之国的成都,近些年由于政策刺激和人才回流,其互联网产业目前也是蓬勃发展。

    二、看看公司的融资情况

    我们现在处于一个万众创业的阶段,大量的公司如春笋般生长,一大批未融资的公司等待资本和市场的检验。而从天使轮到C轮,每一个节点之后的公司数量都基本减半。从图中能看出,C轮可以说是一个创业公司的一个很关键的milestone。

    三、看看哪些类别的公司更多

    从图中看出,当今是移动互联网的热潮,电子商务和O2O紧随其后,企业服务、数据服务等几个类别,正在和即将迎来各自的黄金期。

    四、看看哪些标签是公司最常用的

    基于拉勾上每个公司的标签,提取出现次数最高的一些标签,最终做成一个标签云,可以看出,公司还是更喜欢强调员工的福利。

    五、看看哪些词是经常用来介绍公司的

    互联网时代,服务是核心竞争力,技术、平台、产品和团队是公司的核心资产,这幅图可以说是“公司描述”的自我画像。

    接下来我们看看招聘职位的一些数据分析

    六、哪些城市工作机会多

    北京无疑是工作机会的集大本营,上深广杭四大城市处于同一个梯队,成都以及第二梯队城市旺盛的招聘需求,显示出互联网在这些城市的迅猛发展,也说明互联网正在越来越深入到各行各业。

    七、哪轮融资的公司需要招更多人

    从上图可以看到,公司的发展基本上需要资本的参与,当公司进入A轮及后面的融资阶段后,对招聘的需求大大增加,说明公司的业务发展也非常迅速,这个需求增长在C轮达到最高。C轮之后,公司发展进入另一个稳定阶段,对招聘的需求开始降低。

    招聘离不开薪水待遇这个终极话题,我们来看看一些待遇方面的分析。

    八、哪个城市平均待遇更好

    从待遇上看,广州输给了杭州,北上杭深成为第一梯队,有趣的是,从中国房地产业协会主办的中国房价平台的数据来看,2016年3月份,广州的平均房价是20451万每平米,同比增长3.13%,杭州的是18404万平米,同比增长6.18%。所以房价上杭州也大有领先广州的势头。大家可以对照各城市的平均房价,这样对自己选择工作有一定的参考价值。

    九、哪个待遇区间的公司最多

    从上图可以看到,目前平均薪水在6k-8k的公司最多,当然公司招聘的岗位很多种,总体来看,技术类的薪水最高,产品类紧随其后,设计、运营和市场等职位再次之,但是就某一类职位来看,也是符合正态分布的。此外,我们还发现有少数公司薪水待遇极高,分析发现,基本上这些公司只有很少几个职位,并且是招聘CTO、合伙人这样的岗位。

    十、哪个类别的公司更壕

    从这张图大致能看出哪些行业目前受资本的追捧。当今“深度学习”、“大数据”、“互联网金融”等异常火爆,催生了一大批数据服务类以及互联网金融类的公司,“游戏”、“社交网络”、“移动互联网”以及“旅游”是上一拨互联网狂潮,目前这些行业都产生了一批上市公司和行业巨头。当然,由于计算的是行业平均,以及每个行业的招聘需求各有不同,所以并不代表行业有优劣之分,根据自己的兴趣,选择合适自己的平台是最重要的。

    十一、哪轮融资的公司待遇更好

    从上图看得出,未融资的公司存在较大的资金压力,整体待遇上比其他情况要差一些。但是一旦公司获得融资,很大程度上,员工的待遇也会得到改善,从天使轮到D轮,待遇也是水涨船高。当然薪水并不是全部,加入创业公司往往也会得到期权或者股权的激励,选择干一份有价值的事情也同样重要。

    十二、工作经验是否重要

    以上两张图展示了工作经验在找工作中的重要性,前一幅图说明,工作年限越长,薪水待遇总体越高,公司更愿意为经验丰富的求职者舍本。后面的图说明1-3年工作经验的是招聘中的主要目标人群,一方面已经不再是刚毕业的应届生,具有工业界的实战经历,另一方面,3年工作期满,很多人希望换一个环境。10年以上工作经验的,虽然待遇很不错,但是招聘职位并不多,一般这样的职场老鸟,也比较少换工作了。

    十三、学历是否重要

    上面这两张图展示的是学历与求职的关系,前一幅图说明,总体来看,硕士生的薪水是最高的,博士生的稍低于硕士,要求大专学历和不限学历的工作,薪水差异也比较小,本科生的处于中间。后一幅图说明当前的职位招聘更多集中在本科和大专和学历不限这几个级别,对要求硕士和博士的还是很少。因此,当就薪水这一点考虑,相信大家对学历追求会有自己的选择。当然学历并不代表一切,漫长的职场生涯,工作上的积累和提升更加重要。

    ===============================

    八点数据,用数据说话,从数据中洞察真相

  • ?

    大数据学习资料,大数据学习路线哪家好

    凯茜

    展开

    今天,我们正被数据包围。全球43亿部电话、20亿位互联网用户每秒都在不断地产生大量数据,人们发送短信给朋友、上传视频、用手机拍照、更新社交网站的信息、转发微博、点击广告等,使得机器产生和保留了越来越多的数据。数据的指数级增长对处于市场领导地位的互联网公司,如Facebook、谷歌、雅虎、亚马逊、腾讯等提出了挑战。它们需要对TB级别和PB级别的数据进行分析处理,以发现哪些网站更受欢迎,哪些商品更具有吸引力,哪些广告更吸引用户。传统的工具对于处理如此规模的数据集越来越无能为力。

    计算机改变了人类生活,人们每天接触的信息量成千上万,数据化时代来临,“大数据”成了21世纪热门的话题之一。各行各业对大数据人才的需求,以及技术从业者希望跻身大数据高级人才的需求变得越来越强烈。但大学中的计算机技术已经满足不了现在企业对大数据技术人才的要求,很多人开始将目光转向了大数据开发培训机构,以求得技术的更新和迅速在大数据领域占领一席之地。

    大数据学习应该怎么学呢?给大家一个循序渐进的过程:

    java(Java se,javaweb)

    Linux(shell,高并发架构,lucene,solr)

    Hadoop(Hadoop,HDFS,Mapreduce,yarn,hive,hbase,sqoop,zookeeper,flume)

    机器学习(R,mahout)

    Storm(Storm,kafka,redis)

    Spark(scala,spark,spark core,spark sql,spark streaming,spark mllib,spark graphx)

    Python(python,spark python)

    云计算平台(docker,kvm,openstack)

    物以稀为贵,人才也是。因为人才的紧缺,导致目前大数据开发相关的岗位出现了薪资待遇高,发展空间大的特点,很多行外人都开始关注大数据开发这个行业,甚至有部分人已经开始参加培训,尝试转型进入大数据开发行业发展,抓住这个机遇。

  • ?

    大数据时代,哪一种数据含金量最高?

    薛晓灵

    展开

    数据分很多种类,交易数据、位置数据、医疗数据、消费数据,哪种数据含金量更高?

    第一,所有的数据都有价值,而且你发现了吗?这个分类其实是个挺有意思的事,它就跟乐高积木一样,就是这点材料,怎么组装,看上去是完全不同的形状。数据也是一样,你用不同的方式去分类,去拎出一个结构呢,都会得到完全不同的结果。

    比如说你说到的交易数据、位置数据、医疗数据、消费数据,这几个分类其实就不是互相排斥的,对不对?里面是互相包含的。

    比如消费数据和交易数据,你怎么区分?还有医疗消费数据就可能会既进入医疗数据,也会进入消费数据。而医院的位置可能算医疗数据,也算地理位置数据。所以,对分类要有一个动态的全面认识。

    但是,我们不妨从数据的颗粒度和敏感度来想想什么数据最有用。

    首先是颗粒度的数据,举个例子。一个国家的GDP是1万亿美金,和一个国家的人均GDP是1万美金,人口是1亿,哪个数据更好?显然是后者,对吧?后者可以反推前者,但只有前者推不出后者。所以,颗粒度越细的数据越有用。

    当然了,数据量大,处理起来非常痛苦。所以,在数据处理和颗粒度之间,我们一定会有个平衡。

    社会是个人组成的,所以一般来说我觉得,颗粒度具体到个人就已经挺完美的了。

    那除了颗粒度,还有敏感度问题。社会文明的一个标志是对个人隐私的尊重。所以,在数据保护中,个人隐私是需要绝对尊重的,有些底线你是不能触碰的。这就决定了关于个人的很多状态是敏感的。

    比如在西方礼仪里边,冒然地去问别人的年龄、身高、体重,都是挺不礼貌的行为。这就是对一种隐私的尊重。

    所以,个人信息,包括你的身体状况、财务状况,这些都非常敏感,各国的数据保护也保护得比较严格。

    我们再想下去,要更好地观察经济状况,什么数据最有用呢?经济是人的活动,所以,人的活动密度是个非常直接的指标,可以观察出很多经济的细节。人的地理位置是不需要和个人ID挂上钩的,你只要看整体就可以得到很多有趣的结论了。

    所以,最近我们团队也在研究,怎么从数据里面挖掘经济活动的细节,这个感受特别深。从目前来看,我感觉地理位置的数据会很有应用前景,是一个含金量很高的数据。

    我听过一场关于加密技术的讲座,让我想到,以后加密技术发展到一定规模以后,尤其是可以在本地来进行加密的话,个人数据的使用可能会变得非常地便利和快捷。什么数据含金量最高,这可能也是一个动态演化的过程。

    区块链能不能在一些公众希望被公开的行业做一些试点,比如慈善、红十字会。

    我给他一个非常肯定的回答,我觉得这是个特别好的方向。但是,不知道区块链行业的会怎么想。

    欢迎你把你的前沿知识传播给你身边的朋友,让他们一块儿跟你走进新的数据时代

  • ?

    云计算和大数据哪个发展前景好?

    Haidee

    展开

    云计算和大数据哪个发展前景好?

    说实在话,二者之间都是未来的发展趋势,没有说那种好或者不好,根据你的兴趣,你未来的发展方向,来判断你想走那条路!

    大数据相当于海量数据的“数据库”,而且通观大数据领域的发展也能看出,当前的大数据处理一直在向着近似于传统数据库体验的方向发展,Hadoop的产生使我们能够用普通机器建立稳定的处理TB级数据的集群,把传统而昂贵的并行计算等概念一下就拉到了我们的面前,但是其不适合数据分析人员使用(因为MapReduce开发复杂),所以PigLatin和Hive出现了(分别是Yahoo!和facebook发起的项目,说到这补充一下,在大数据领域Google、facebook、twitter等前沿的互联网公司作出了很积极和强大的贡献),为我们带来了类SQL的操作,到这里操作方式像SQL了,但是处理效率很慢,绝对和传统的数据库的处理效率有天壤之别,所以人们又在想怎样在大数据处理上不只是操作方式类SQL,而处理速度也能“类SQL”,Google为我们带来了Dremel/PowerDrill等技术,Cloudera(Hadoop商业化最强的公司,Hadoop之父cutting就在这里负责技术领导)的Impala也出现了。

    整体来看,未来的趋势是,云计算作为计算资源的底层,支撑着上层的大数据处理,而大数据的发展趋势是,实时交互式的查询效率和分析能力,借用Google一篇技术论文中的话,“动一下鼠标就可以在秒级操作PB级别的数据”难道不让人兴奋吗?

    在谈大数据的时候,首先谈到的就是大数据的4V特性,即类型复杂,海量,快速和价值。IBM原来谈大数据的时候谈3V,没有价值这个V。而实际我们来看4V更加恰当,价值才是大数据问题解决的最终目标,其它3V都是为价值目标服务。在有了4V的概念后,就很容易简化的来理解大数据的核心,即大数据的总体架构包括三层,数据存储,数据处理和数据分析。类型复杂和海量由数据存储层解决,快速和时效性要求由数据处理层解决,价值由数据分析层解决。

    数据先要通过存储层存储下来,然后根据数据需求和目标来建立相应的数据模型和数据分析指标体系对数据进行分析产生价值。而中间的时效性又通过中间数据处理层提供的强大的并行计算和分布式计算能力来完成。三层相互配合,让大数据最终产生价值。

    传统的BI分析通过大量的ETL数据抽取和集中化,形成一个完整的数据仓库,而基于大数据的BI分析,可能并没有一个集中化的数据仓库,或者将数据仓库本身也是分布式的了,BI分析的基本方法和思路并没有变化,但是落地到执行的数据存储和数据处理方法却发生了大变化。

    谈了这么多,核心还是想说明大数据两大核心为云技术和BI,离开云技术大数据没有根基和落地可能,离开BI和价值,大数据又变化为舍本逐末,丢弃关键目标。简单总结就是大数据目标驱动是BI,大数据实施落地式云技术。

  • ?

    人们常说的大数据真的好么?

    Ernest

    展开

    现如今,每个公司都拥有大量数据可供使用,比如入侵检测系统日志、网络基础设施日志、服务器日志、应用程序日志等等。这些日志加起来,甚至可以达到PB级。然后当发现可疑事件时,威胁响应团队使用适当的工具,通过将高级数据分析技术应用于这些海量数据,对这些历史数据和实时数据进行查询、关联以及处理,以验证该事件是否危险并分析其危险程度。

    然而,在现实世界中实现这一点说起来容易做起来真的很难。第一,一般公司使用安全信息和事件管理(SIEM)平台来管理所有这些数据。但是,这些管理SIEM平台中的很多都不是以大数据为基础构建的,所以对于各种设备产生PB级的日志数据,缺乏相应的处理大数据的计算能力来进行实时分析。第二,许多SIEM和安全分析工具都是在本地部署的。当数据呈数量级增长时,本地基础架构很难扩展。第三,大多数SIEM工具都会按照每GB处理的数据量向客户收费。这使得处理海量的数据成本高得令人难以置信。此外,大多数安全团队只能访问数周的历史数据,因为大规模存储和处理这些数据的成本也是昂贵的。但是,一旦事件发生,安全团队需要进行深入的历史分析,以充分调查攻击事件的有效性和影响度。这种数据处理成本限制了安全团队长时间实时的识别监测攻击事件的消息。最后一个常见的挑战是由SIEM工具产生的大量误报。由于在操作系统日志、云基础设施日志、入侵检测系统和其他监控设备每天捕获如此多的数据,很容易识别数百个可疑事件。许多事件并不能马上做出判断,需要依靠个人力量审查数百个警报,包括大量的误报,以确定每个威胁是否是真的。最终,不堪重负的安全团队将出现警报疲劳,忽略一些事件,然而那些事件可能实际上是真正威胁的事件。

    所以,大数据时代真个好么?如果没有与之匹配的数据处理能力,大数据终将造成等量的威胁。还好的是,云计算的出现以及人工智能的发展或许在不久的未来可以使大数据能更好的为人类所用。

  • ?

    近来很火的大数据,原来这么好理解

    荀语柳

    展开

    现在互联网最流行、我们日常最常听到的词汇是什么?

    没错,就是大数据、云计算和人工智能。

    虽然众多媒体每天都在吹捧,但小编却是认为还有众多吃瓜群众还是一知半解的。所以就打算专写三篇来分别介绍这三个概念。

    首先是大数据。顾名思义,大数据就是一个体量特别大,数据类别特别大的数据集。

    近来在网上看到一个有趣的关于大数据的笑话,小编觉得很形象,分享给大家,应该能让大家更好理解。

    某比萨店的电话铃响了,客服人员拿起电话。客服:XXX比萨店。您好,请问有什么需要我为您服务 ?顾客:你好,我想要一份……客服:先生,烦请先把您的会员卡号告诉我。顾客:16846146***。客服:陈先生,您好!您是住在泉州路一号12楼1205室,您家电话是2646****,您公司电话是4666****,您的手机是1391234****。请问您想用哪一个电话付费?顾客:你为什么知道我所有的电话号码?客服:陈先生,因为我们联机到CRM系统。顾客:我想要一个海鲜比萨……客服:陈先生,海鲜比萨不适合您。顾客:为什么?客服:根据您的医疗记录,你的血压和胆固醇都偏高。顾客:那你们有什么可以推荐的?客服:您可以试试我们的低脂健康比萨。顾客:你怎么知道我会喜欢吃这种的?客服:您上星期一在中央图书馆借了一本《低脂健康食谱》。顾客:好。那我要一个家庭特大号比萨,要付多少钱?客服:99元,这个足够您一家六口吃了。但您母亲应该少吃,她上个月刚刚做了心脏搭桥手术,还处在恢复期。顾客:那可以刷卡吗?客服:陈先生,对不起。请您付现款,因为您的信用卡已经刷爆了,您现在还欠银行4807元,而且还不包括房贷利息。顾客:那我先去附近的提款机提款。客服:陈先生,根据您的记录,您已经超过今日提款限额。顾客:算了,你们直接把比萨送我家吧,家里有现金。你们多久会送到?客服:大约30分钟。如果您不想等,可以自己骑车来。顾客:为什么?客服:根据我们CRM全球定位系统的车辆行驶自动跟踪系统记录。您登记有一辆车号为SB-748的摩托车,而目前您正在解放路东段华联商场右侧骑着这辆摩托车。顾客当即晕倒。

    虽说故事有所夸大,但是跟大数据的本质差不多。

    以目前的科学技术水平,还做不到这么详细的数据分析,但是不代表未来做不到。特别是云计算的发展,不难判断未来人在科技的发展下隐私越来越少。时代越进步,人就越离不开网络。淘宝天猫的消费记录,线下的移动支付,微博微信空间的言论,百度搜索。把所有人这些数据集中起来就是大数据,再通过云计算,就能分析出来这个人的消费水平,消费习惯,社会阶级,家庭地址,性格等等。今天你在淘宝淘到了一件裤子,明天你在刷某个app的时候说不定就向你弹窗关于这个裤子品牌的其他裤子广告。甚至通过大数据分析所有买了这件裤子的人,都消费了什么商品(比如某件上衣或者鞋子)然后向你推荐。

    所以说,大数据的战略意义不在于掌握了多么庞大的数据信息,而是用什么方法分析这些数据(涉及到云计算,下篇再做解释什么是云计算)然后得出含有意义的信息。如果把大数据比作一种产业,那么这种产业实现盈利的关键:在于提高对数据的“加工能力”,通过“加工”实现数据的“增值”。

    之所以大数据现在前景这么火,是因为以下这些事实:

    1.目前全世界信息产生量足以用爆炸来形容,近两年来的产生的数据量比整个人类历史产生的还要多。

    2.到2020年,至少三分之一的数据会通过云端传输,届时人类会更依赖智能设备。

    3.现在,得到分析使用的数据还占不到总量的0.5%,可见潜力巨大。

    大数据正逐渐影响着我们,可以说是把双刃剑,朝哪个方向发展就让我们拭目以待吧。

  • ?

    【前瞻】大数据分析是好还是坏?

    祝白曼

    展开



    数据本身并不会窥探人,真正窥探人的是人类本身。但是,这么简单的事实却经常很难被理解。美国国家安全局丑闻、日常数据泄露以及电视监视人们私人谈话的故事……这些事件导致公众越来越不信任数据收集,这并不奇怪。91%的美国人认为用户已经失去了对商业公司如何收集和使用他们个人信息的控制。而61%的公众希望多做一些事来保护他们的网上信息。不管这些数据是故意通过社交媒体披露的,还是不知不觉中通过手机或网站数字足迹被收集的,人们已经为隐私、信息自由,甚至民主受到威胁而感到恐慌。


    当通过法庭了解到所有相关的诉讼细节以及看到媒体上讨论的种种可怕的数据泄露的可能性的时候,我们很容易得出结论说大数据分析有其固有的邪恶的一面。那么,果真如此吗?


    利大于弊


    全球最大数据分析公司之一Teradata的首席分析官比尔·弗兰克斯(Bill Franks)最近就与一些州议员及高管参加了一个会议,来讨论如何帮助他们的州更好的控制支出、减少欺诈以及如何运用大数据更精密的分析和更新数据管理平台,更有效率的进行公共服务。隐私权和数据滥用的问题被提出并引起了激烈讨论。讨论的中心是:考虑到数据有可能被掌权者滥用,政府收集大量的数据是否是个好主意。


    其中举了一些例子来说明健康的数据可以提供极大的好处。想想那些负责监控有虐待儿童史的家庭的国家社会工作者。当一个新的案件工作者无法拿到与此家庭有关的历史数据时,这个家庭的孩子可能会遭到没有必要的伤害甚至死亡威胁。打个比方,有很多儿童的死亡是因为工作人员没有掌握重要的信息,从而没有及时了解到孩子已经面临的危险。


    一个政府官员指出了对于这些工作人员收集的高度敏感的数据的合理担忧:要让这些数据容易得到就意味着低收入、非技术人员将掌握着这些高度隐私和敏感的信息,而且显然这些信息将会被滥用。





    然而,现实是利用这些信息解救的儿童的案例远比被滥用的情况多。尤其是当这些能够接触数据的人知道滥用数据不仅会让他们的工作处于危险的境地,也会引起曾经信任他们的人的强烈控诉(也就是说,你将不会再被信任)的时候。


    这有一点像开车。我们每一次开车都在冒失去性命的危险。即使我们没有做错任何事,也随时有可能被某人猛撞然后丧命。当这件事情发生的时候,它无疑是一场悲剧,但因为它发生的概率很低,因此人们把它看作可接受的风险。我们从开车这项技能中所获得的许多好处远远超过并足以弥补其可能带来的风险。没有人严肃的提出禁止汽车上路来避免这些完全可以避免的交通事故。整个社会都认同汽车带来的好处比风险多很多。


    对于大数据及分析我们应该持相同的态度。只要合理的利用大数据,益处将是巨大的。但是,无论我们有多么小心,有时数据依然会被滥用。我们的目标应该是将滥用发生的机率最小化,并且将处罚力度定在足以阻止大部分人不去尝试。如果政府和其他的组织都能从哪怕一小部分的积极面去利用大数据,促进信息之间的对接、流通、反馈,这就会发生其杠杆效应,那么我们都会变得更好。

  • ?

    用好大数据的六个诀窍,你知道多少?

    千秋

    展开

    (图片来源于网络)

    “大数据”概念最早由维克托·迈尔·舍恩伯格和肯尼斯·库克耶在编写《大数据时代》中提出,指不用随机分析法(抽样调查)的捷径,而是采用所有数据进行分析处理。大数据有4V特点,即Volume(大量)、Velocity(高速)、Variety(多样)、Value(价值)。

    怎样能够高效、准确的用好大数据,使大数据的威力发挥到最大,这也是很多人想问的。小编结合了三位大数据运营人员各自的经验,总结出6个用好大数据的诀窍:

    诀窍一:目标和定位

    拥有再多的数据,也不能代表它所有的信息都能够被完全利用上。只有真正懂得如何利用大数据,了解到公司利用大数据可以达到什么目标,公司最终才有可能真正成功。明确目标和定位,缩小选择范围聚焦精力去发展,才有助于公司进行持续长久的良好运作。

    诀窍二:分清“西瓜”和“芝麻”

    现在,数据成为很多公司发展的重要助力,可供分析的数据更多,可以用来分析数据的工具和方法也比以前更方便。大多数公司喜欢去分析和处理他们收集到的大量高精度的数据,因为获得的数据越精确,就越有利于分析受众群体,也更有利于公司进行相关战略和产品的调整。但是有时候这些数据也会过于分散,会耗费大量的时间去处理这些数据,但是结果可能不如预期,之就叫做“做白功”。所以舍小取大,要分清什么才是有用的,只有抓住关键才能使数据发挥它最大的作用。

    诀窍三:做好团队的协调

    最有价值和作用的数据往往不多,为了找到这些有价值的数据,公司的数据团队和各部门以及管理层应保持良好的沟通交流,这样公司才能良好高效的运行,有效的协调配合需要通过有效的沟通交流来实现。

    诀窍四:利用工具

    为了研究特定消费者的消费行为模式对其进行研究分析,依据不同的消费者选择不同的模型,进而对消费者行为进行追踪研究。如果真通过人工分析,那就需要花费太多的时间和精力了。所以,利用一些相关分析小工具所分析的时间会大大减少,当然人工成本也会大大降低。

    诀窍五:谨慎的对待数据

    有时,企业是没有能力去获取数据的,也就没法用数据去解决问题。就算公司获得了一些数据,他们往往也不清楚这些数据最终能否解决他们的问题。应谨慎认真对待数据,数据会真实客观地告诉你想要的答案。有时,数据能告诉你的会让你大吃一惊。

    诀窍六:要避免得出错误的结论

    由于人为主观因素和不相关数据的干扰,有时候得出的结论往往是错误的。

    “不要让不相干的数据影响到整个结果,有相当一部分的数据并不重要,“如果使用了错误的数据,得出的结论往往也是错的。”

    “为了消除数据上的误差,你需要准确找到特定的目标人群,这些人的行为往往可以准确地回答你需要解决的问题。”

    数据选择上的错误会影响人们解决问题的过程,也会影响人们如何看待这些数据和结果。错误的数据选择可能影响到公司做出相关决策。

    作为国内优秀的企业大数据服务平台,自由数据致力于为企业和开发者提供优质的数据资源、API接口和数据定制服务等,重点覆盖企业征信数据、金融数据、社会舆情、生活数据等领域。自由数据有专门的数据分析团队,数据分析能力不仅专业性高,针对性也强,能从企业的角度出发解决这个问题。

    (以上个别观点来源于网络)

  • ?

    大数据的学科这么火爆,为什么找个好工作还是那么难?

    罗丝

    展开

    AI 前线导读:你可能经常听到这样的说法:数据科学家是 21 世纪最性感的工作,干这行有赚不完的钱、这行里有很多经验丰富的人才,似乎一切都表明这是一份理想的工作。又或许你也曾听过:数据科学家是当下科技行业最火爆的职位。本人转载自 AI前线小组但实际上,想成为数据科学家的人很多,最后真的能成为数据科学家的人却不多。这个岗位看上去既神秘又高大上,还有那么一点遥不可及,很多数据科学爱好者发现,照理说数据科学这么热门的岗位应该有不少空缺,但找到一份工作却相当困难。一位外国网友在 Quora 上提了这样一个问题:数据科学既然如此热门,为什么找工作还是困难重重?AI 前线翻译了其中几个精彩回答,与大家共同探讨,也欢迎留言分享你的思考。

    大多数人都没有足够的能力成为合格的数据科学家

    回答者:Riya Dubey,数据科学家 回答于 2018 年 10 月 24 日

    谢邀,我的答案可能会伤害那些胸怀抱负的数据科学家们的感受。不过我还是得实话实说——大多数有志者都没有足够的能力成为合格的数据科学家。请不要误解我的意思,但 大多数希望成为数据科学家的朋友都不具备足够的技能储备。

    虽然市场对于数据科学家确实有着巨大的需求,但大多数人的技能都太烂了(请原谅,我就是这么坦率)。

    并不是企业不想雇用新人担任数据科学家这类角色。事实上,不只是应届毕业生,就算是企业通过社招吸纳的数据科学家们也未必能够顺利完成任务。数据科学是一类极具挑战性的工作,要求敏锐的分析能力、强大的数字能力以及卓越的商业理解能力。即使我们立刻着手学习这些技能,要达到游刃有余仍然需要耗费漫长的周期。简单地总结,单凭在大学里的教育背景不足以支撑大家完成相关工作。

    而以上提到的,还只是数据科学所提出的最低技能要求。从行业角度来看,迈入数据科学领域还需要其它多种技能。下面来看其中的一些主要项目:

    对于统计及统计学技术几乎无可挑剔的认知与理解。你需要对推理统计数据拥有良好的控制能力。良好的 R 与 Python 编程能力。这两种是目前大家最需要了解的高人气数据科学语言。数据可视化技能,包括对 Tableau 以及 Qlikview 等工具的熟练掌握。预测建模能力,意味着你需要了解各类机器学习算法。现在,着眼于上述技能,大家会意识到其涵盖范围极广,甚至足以彻底将我们吞没。更具体地讲,要精通这些技能需要相当长的时间——更遑论很多人穷尽一生可能也无法掌握。

    很少有企业会雇用应届毕业生出任数据科学职位,但在接受企业培训并拥有 6 到 12 个月的工作经验之后,他们会逐步赢得数据科学家头衔。Mu Sigma、LatentView Analytics 以及 Absolute data 等就是这类开放性企业的典型代表。然而,必须承认,鲜有公司愿意提供这样的机会。

    需要考量的另一大重要因素在于,大多数希望出任数据科学家的年轻人都就读于 IIT/NIT 以及 BITS Pilani 等顶尖高校。企业意识到,这类大学的毕业生技术能力出众,学习速度快且能够轻松完成训练。因此,企业更倾向于选择这些高校的学生。在入职之后,这些学生会自行学习其它技术性技能,或者接受企业内部提供的培训。

    然而,对于其他一些毕业生来讲,以上只是一种不切实际的幻想。因此,要进入数据科学领域,你只能全程自学。

    目前存在众多面向数据科学方向的平台,你可以在其中学习数据科学领域的各类技能。Data camp、Data Science、Coursera、edX 以及 Udemy 等都能够为你提供理想的技能积累环境。

    除了上述平台之外,大家还应该尝试 Kaggle 以及 KDnuggets 等,这些是通过数据科学项目磨练水平的好去处。事实上,这些平台甚至更为重要。正如我之前所提到,数据科学极具挑战性,因此除了真正投身于实际项目之外,大家根本不可能真正加以掌握。

    因此,在大家通过上述平台学习时,请确保同时参与具体项目以实现理论与实践的结合。此外,大家还需要利用这些项目展示自己的实际工作能力。在数据科学领域,我们参与的项目以及借此做出的有价值的贡献才是对技能的真正考验。对于新手而言,数据清洁往往最为重要。而如果你才刚刚起步,那么参与项目绝对是个良好的选择。当然,你所选择的项目,最好涉及一切作为数据科学家所需要的技能方向。

    总体来讲,作为一位胸怀大志的数据科学家,如果你希望找到理想的工作,请遵循以下方法:

    学习数据科学领域的必要技能。开展项目工作,借此建立自己的技能组合并磨练技术水平。赢得数据科学职位。今年春季,我和我的未婚夫买了辆新车。买车当然不是件小事,原本我们也根本没打算买,但这辆车一下子抓住了我们的心。我们也考虑了其它一些车型,并且进行了全面的试乘试驾体验。

    我们对于自己的需求有着非常明确的认知,但最终促使我们下定决心的,还是这款产品的出色性价比。

    与汽车类似,数据科学家同样成本高昂。身为客户,企业雇主当然希望找到那些最能满足自身需求的目标。

    你认为哪些因素决定着他们的招聘意愿?

    想象一下,对于典型的数据科学职位,候选人的分布可能如下所示,其中 x 轴代表“符合要求”的情况,或者说人才自身吸引力的直观指标:

    备注: 上图完全基于我的假设,与实际数据无关。

    另外需要注意的是:

    每一家企业都希望获得标注为绿色的候选人。标注为绿色的候选人希望选择最出色的企业。标注为蓝色的候选人愿意就职于任何企业。标注为红色的候选人根本搞不清楚自己的求职需求。像我们普通人一样,企业也有预算额度,而且不愿意接受存在风险的支出。标注为绿色的候选人最为安全,标注为蓝色的候选人由于缺乏经验而代表存在风险,而标注为红色的候选人则直接被排除在外。

    那么,作为客户,你认为企业会做何选择?

    如果我们能够购买一台全新的微软 Surface 笔记本,或者是选择一款号称具有同等配置且几乎同等价位的“即将推出”的新产品,你会如何决定?

    毫无疑问,市场对于标注为绿色的候选人拥有最迫切的需求。每一家企业都希望选择这类人才,而鲜有企业愿意选择标注为蓝色的候选人并承担相关风险。

    总而言之,每一家企业都希望选择“最具性价比”的目标。

    数据科学家职位对技能在深度与广度层面的要求远远超出大多数人的认知。

    由于大多数现实世界中的数据科学任务,具体体现为机器学习,而机器学习属于一类硬核编程工作。

    如果你无法使用 Python 语言编程,那么你根本得不到这份工作。事实就是如此。

    因为你无法完成数据清洁工作,因此没人在乎你能多么高效地从 GitHub 上复制现成代码。

    因为 SQL 远比建模更重要,而新手们根本就不明白这背后的原因所在。我们不再关注那些 SQL 实际使用经验不足两年的候选人。事实上,学习建模要比学习关系数据库理论简单得多。

    数据处理是一项极为艰深的工作。

    因此如果我是一家企业的老板,而且我愿意拿出 15 万美元以上雇用一名员工,那这家伙最好能够充分满足我提出的技能需求。

    在接触这一领域五年之后,我还没见过任何真正的初级数据科学家——这里只存在初级机器学习工程师,而且他们大多是由编程或者数据相关岗位转型而来。

    数据科学岗位候选人的增长速度远超过就业机会的增长速度

    原因在于数据科学岗位的候选人正呈现出指数级增长,而就业机会虽然同样增长极快,但却不足以抵消新生人才数量。这在一定程度上类似于博士生的全面爆发,其直接导致博士学历的市场竞争力快速削弱。有人可能会想:为什么还会有那么多人愿意读博?几年下来,市场对于人才的要求可能已经发生剧变了呀。没错,我认为这个问题的答案在一定程度上与数据科学家问题存在相似之处:

    四年之前,当企业找不到任何真正合格的数据科学家时,这些企业在学术界与 Data camps 的帮助下,刻意营造出了人才极度匮乏的整体印象。这使得市场呈现出一种类似庞氏骗局的形势,如今许多所谓的数据科学家并没有真正的一线工作可做,而只能转向为那些有意成为数据科学家的年轻人提供教学服务。 对于博士生来说情况同样如此:很多人开始靠帮其他人当论文枪手来赚钱。与此同时,企业也开始以越来越谨慎的态度审视那些自称为“数据科学家”的候选人的实际价值。与大多数博士生一样,特别是那些拿不出什么原创性研究成果的新人,他们的学位价值开始大幅下降。必要承认的是,时至今日,来自顶尖大学的毕业生仍然能够比较轻松地找到一份理想的工作——这一点同样适用于数据科学家群体。只接受过短期培训的人们将很难找到工作。 然而,像地理学家、工程师或者拥有丰富专业数据经验的物理学家这样的群体,虽然可能没有接受过正式的数据科学培训,但却仍然能够更轻松地拿到数据科学家的 offer(虽然具体职称可能略有不同)。与许多应届毕业生一样,他们的职业经历就如同实习经历一样能够为其提供有力的积累与证明。目前有很多人自称为数据科学家,但他们的实际水平最多只能算“数据科学爱好者”。 由于缺少实践经验,他们很难找到合适的工作。当企业进行校招并与应届毕业生交谈时,年轻人们往往能够比较轻松地得到实习岗位。这种方式在效率上远高于通过互联网进行简历盲投。 或者,当你看到 Facebook 公司发布的数据科学工程师招募广告时,你也可以想办法与其互动并发布一些有水平的评论,而非坐等人力部门与自己联系。事实上,如今简历已经变得非常过时,有可能再过一段时间就会彻底消失在历史舞台之上, 至少我认为是如此。为什么不在 GitHub 上(或者其它重要网站上)发布一些贡献呢——只要项目或内容质量足够好,广受好评并得到采用,我们总有办法向企业证明自己的价值。约有 90% 的朋友希望通过领英与我联系,但我往往会直接拒绝,因为他们与数据科学毫无交集。与大家一样,我只能与 3 万个人建立关联,因此我得精心安排这些名额。企业的情况是差不多的,他们需要考虑自己的预算水平。根据你的实际定位与工资预期,就职情况可能比我之前提到的略好或者更差。某些数据科学家(通常负责管理大型团队)能够在美国或者其它一些国家拿到超过 25 万美元的年薪,而也有一些数据科学家能够管理自己的公司并获得超过 50 万美元的年收入——这些都属于合理范围。但如果你无法达到基准水平(即能够产出实际价值)的要求,那么你的收入将与前者天差地别。

  • ?

    都在说大数据好,带你看看大数据到底怎么样?

    Mangena

    展开

    近几年,大数据这个词突然变得很火,不仅纳入阿里巴巴、谷歌等互联网公司的战略规划中,同时也在我国国务院和其他国家的政府报告中多次提及,大数据无疑成为当今互联网世界中的新宠儿。

    而近期朋友圈疯转的“马云无人超市迎客,再不努力你将无工可打”,“看李彦宏如何谈AI”等新闻热点,无不展示着人工智能的快速发展,但在直木看来,人工智能之所以能取得突飞猛进的进展的背后,不能不说这些年来大数据长足发展的结果。

    人工智能和大数据有什么关系呢?

    如果我们把人工智能看成一个嗷嗷待哺拥有无限潜力的婴儿,某一领域专业的海量的深度的数据就是喂养这个天才的奶粉。奶粉的数量决定了婴儿是否能长大,而奶粉的质量则决定了婴儿后续的智力发育水平。

    据数联寻英发布《大数据人才报告》显示,目前全国的大数据人才仅46万,未来3-5年内大数据人才的缺口将高达150万,越来越多人加入到大数据培训,都希望在大数据培训机构中学习最前沿的知识,找一份不错的工作。

    本文从4个方向让大家充分了解大数据,望对同学们的大数据从业有帮助:

    大数据就业前景

    大数据就业方向

    大数据就业薪资

    大数据职业发展

    一、大数据就业前景

    据职业社交平台LinkedIn发布的《2016年中国互联网最热职位人才报告》显示,研发工程师、产品经理、人力资源、市场营销、运营和数据分析是当下中国互联网行业需求最旺盛的六类人才职位。其中研发工程师需求量最大,而数据分析人才最为稀缺。领英报告表明,数据分析人才的供给指数最低,仅为0.05,属于高度稀缺。数据分析人才跳槽速度也最快,平均跳槽速度为19.8个月。根据中国商业联合会数据分析专业委员会统计,未来中国基础性数据分析人才缺口将达到1400万,而在BAT企业招聘的职位里,60%以上都在招大数据人才。

    二、大数据就业方向

    大数据领域三个大的技术方向,这些不同的技术方向,对应企业的哪些招聘岗位?

    1. Hadoop大数据开发方向

    市场需求旺盛,大数据培训的主体,目前IT培训机构的重点

    对应岗位:大数据开发工程师、爬虫工程师、数据分析师 等

    2. 数据挖掘、数据分析&机器学习方向

    学习起点高、难度大,市面上只有很少的培训机构在做。

    对应岗位:数据科学家、数据挖掘工程师、机器学习工程师等

    3. 大数据运维&云计算方向

    市场需求中等,更偏向于Linux、云计算学科

    对应岗位:大数据运维工程师

    精通任何方向之一者,均会 “ 前(钱)”途无量。

    三个方向中,大数据开发是基础。以Hadoop开发工程师为例,Hadoop入门月薪已经达到了 8K 以上,工作1年月薪可达到 1.2W 以上,具有2-3年工作经验的hadoop人才年薪可以达到 30万—50万,一般需要大数据处理的公司基本上都是大公司,所以学习大数据专业也是进大公司的捷径。

    三、大数据就业薪资

    1、基础人才-数据分析师

    北京数据分析平均工资: 10630/月,取自 15526 份样本,较 2016 年,增长 9.4%。

    2、大数据开发工程师

    北京大数据开发平均工资:30230/月。

    3、Hadoop开发工程师

    北京hadoop平均工资: 20130/月,取自 1734 份样本。

    4、数据挖掘工程师

    北京数据挖掘平均工资:21740/月,取自 3449 份样本,较 2016 年,增长 20.3%;

    5、算法工程师

    北京算法工程师平均工资: 22640/月,取自 10176 份样本。

    四、大数据职业发展

    最后一个问题,到底哪些公司需求大数据人才?

    事实上,大到世界500强,BAT这样的公司,小到创业公司,他们都需求数据人才。

    目前,大数据人才数量较少,因此大多数公司的数据部门一般都是扁平化的层级模式,大致分为数据分析师、资深研究员、部门总监3个级别。、

    大公司可能按照应用领域的维度来划分不同团队,而在小公司则需要身兼数职。有些特别强调大数据战略的互联网公司则会另设最高职位—如阿里巴巴的首席数据官。这个职位的大部分人会往研究方向发展,成为重要数据战略人才。另一方面,大数据工程师对商业和产品的理解,并不亚于业务部门员工,因此也可转向产品部或市场部,乃至上升为公司的高级管理层。

    马云说“我们已从IT时代进入了DT时代,未来我们的汽车、电灯泡、电视机、电冰箱等将全部装上操作系统,并进行数据集成,数据将会让机器更“聪明”。DT时代,数据将成为主要的能源,离开了数据,任何组织的创新都基本上是空壳。”

    我们从大哥大,小灵通,到诺基亚塞班,到今天的人手一部智能手机,每天各大企业会收到多少数据,如何从这些数据里面分析础客户的需求,这都是企业所要做的事,总之,数据,是未来的一切。

大数据哪里比较好

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP