中企动力 > 商学院 > 数据分析实战
  • ?

    成为一名数据分析师,必须掌握的技术,学会了你就是大神

    Petra

    展开

    一:编程能力

      是否会编程是区别初级数据分析师和高级数据分析师的分水岭。在这里,我定位的是高级数据分析师,所以编程能力尤为重要,我把它放在了第一位。

      有关数据分析的编程语言有Python和R语言。R语言倾向于统计分析、绘图等。统计学家或者学统计学的喜欢用R语言,而我推荐学习Python,因为Python是面向未来的语言,无论从流行度、可用性还是学习难度来讲,Python都是最好的入门语言。

      当然,如果可以的话,再掌握一下R语言是最好不过的,学习嘛,永无止尽。

      书籍推荐《Python编程:从入门到实践》 豆瓣评分:9.0

      当然,只有Python基础肯定是不够的,既然是学习数据分析,肯定就要有数据才行,数据从哪里来,肯定是从互联网上来。互联网上的信息何其之多,必须要对其加以过滤处理,提取我们想要的信息。这就要用到Python爬虫,这也是学Python一个很重要的目的和作用。

      学习Python爬虫肯定比学习Python基础要困难一下,但好在网上的学习资源十分丰富,努力学习必定会有收获的。

      关于Python爬虫的书籍,目前我还没有较好的书籍推荐,如果说实在要推荐的话,我推荐三本书:

      《Python网络数据采集》 豆瓣评分:7.7

      《Python爬虫开发与项目实战》 豆瓣评分:8.1

      《精通Scrapy网络爬虫》 这是十月份出的新书,豆瓣上还没有评分。

      知乎里面有很多爬虫大神,没事多逛逛知乎总会有收获的。

      关于编程能力,是一个很深的概念,需要靠大量的撸代码积累经验。先暂且说到这些。

    二:SQL

      学习数据分析,最难最重要的就是编程能力,熬过去了,后面的就稍微简单一些了。

      既然是跟数据打交道,就免不了要使用数据库。

      目前主要有四种数据库:

      1:SQLite 是一个文件型轻量级数据库,它的处理速度很快,在数据量不是很大的情况下,可以使用SQLite。

      2:MySQL 是一个应用极其广泛的关系型数据库,它是开源免费的,可以支持大型数据库,很多中小型企业都是用的MySQL。

      3:MongoDB 是一个面向文档的非关系型数据库,它功能强大、灵活、易于拓展。

      4:Redis 是一个使用ANSI C 编写的高性能key-value数据库,使用内存作为主存储器。

      它们各有优点,可以灵活使用,如果说非要选一个的话,我建议使用MySQL,因为它使用最广泛。学习最主流的技术,可以在一定程度上发挥更大的作用。

      关于SQL的学习资源:

      购买书籍推荐《SQL基础教程》作者:MICK

      豆瓣评分:9.0,好像这本书出了第二版了,建议购买最新版的。

    三:数据分析能力

      前面说了那么多,都是为了数据分析做准备。数据分析就好比亲手做一顿美食,现在食材有了(通过Python爬虫采集),盛放美食的容器也有了(数据库)。现在就差开火做饭了,写到这感觉肚子饿了,哎呀,忍住。

      对于数据分析,我还没有过多的涉足,总之,多看书,多做项目。

      这里我推荐几本书(都是放在我购物车里还没有买的书)

      学习数据分析必看的书单:

      《Python数据分析基础》八月份的新书,豆瓣上还没有评分。

      《利用Python进行数据分析》2013年的老书,豆瓣评分:8.5

      《Python数据处理》六月份的新书,豆瓣上没有评分。

      《用数据讲故事》 豆瓣评分:8.7

      虽然我还没来得及看这几本书,但是我想认真看了之后,对于数据分析的理解肯定会更加深刻的。

    四:数据可视化

      现在美食做好了,但不能一股脑的装在碗里吧,美食讲究色香味俱全。所以要给它作一个漂亮的造型,呈现在客人面前。这就是数据可视化。

      数据可视化需要借助工具,什么工具呢?那就是大名鼎鼎的tableau!

      什么?你没有听说过tableau?现在听我说了也不迟,哈哈。

      tableau是一款世界级的商业智能工具软件,tableau可以帮助我们快速的分析、可视化并分享信息。在福布斯2017年公布的《10大需求增长最快的职场技能》报告中,tableau高居第三,成为数据分析和可视化的职场必杀技。

      说了这么多,咱们还是好好聊聊怎么学习tableau吧。tableau是一款收费软件,先看一下它的价格吧:

      image

      果然优秀的软件都是收费的,而且还贵的要死。

      但是,tableau的良心之处在于:学生和教师可以免费使用tableau,只需要用我们的学生证信息去免费申请一个序列码,然后就可以下载激活该软件,有效期为1年,如果一年后还是学生的话,还可以用学生证再去申请一个序列号,然后再免费用一年。

  • ?

    观远数据苏春园:零售数据分析的挑战与实战案例分享

    Sidi

    展开

    来源:搜狐

    以下为正文分享。

    一、数据分析与决策的场景与挑战

    任何一个企业都不缺数据,怎么处理这些数据,如何通过数据产生决策及对应的商业价值呢?今天跟大家聊聊我的体会。

    观远数据团队过去十几年一直在做数据相关的事情,包括数据分析与挖掘、商业智能等等,服务了包括星巴克、肯德基、7-Eleven、麦德龙、Adidas等大企业,也有机会看到他们从本土到全球的扩张过程中数据所扮演的关键价值。

    说到零售,大家都在谈人货场,任何一种决策都需要打通人货场的环节。然而我们还发现新零售的第四个要素在扮演越来越重要的角色——“脑”,也就是决策的大脑。

    我们以连锁经营品牌的门店运营为例,100家或者1000家也好,这些门店里哪些门店哪个时段的表现好还是不好,如何判断?过去一周哪些重要的吸客商品经常在晚高峰来临前售罄?低于安全水位的商品能否第一时间预警补货?端午小长假不同客群标签的门店销售有什么样的不同趋势,如何提前准备备货与营销?

    这些决策的背后都需要打通人、货、场等不同的维度,甚至进入到背后的市场支撑——进、销、存、ERP等等。因此决策本质上需要的能力是怎样系统化、规模化的从运营、品牌营销到供应链的角度进行数据的分析。

    企业里面是有大量数据,但是却无法根据这些数据做出决策。最典型的三个挑战有:

    第一,有数据,没分析。比如在开会结束后,CEO让小张把结果找出来。这就是数据。如果CEO让小张把商品在过去3天销售幅度下降排名前十的找出来。这就是分析。

    第二,周期长,响应慢。这里面的周期、门槛等原因使得会议当时很难形成决策。会议上大家只可能把数据拿出来进行处理,而不会在现场进行分析决策。

    第三,只能看,没行动。大量的数据可以用传统的报表等方式呈现,但当数据呈现以后,怎么去解读这些数据,更进一步应该采取哪些行动,又是让业务决策人员非常头痛的问题。

    这里面最基本的挑战是有数据,但是难以形成比较好的决策。

    二、从基础分析到智能决策的方法论

    怎样从简单分析进而进行智能决策呢?这里面有5个步骤。

    敏捷化:观远数据和很多客户在非常短的时间内形成大屏,比如CEO看板、快速监控等重要指标。我们会轻、快、易、灵,极度敏捷的开启数据分析。以便利店为例,运营部门从总部、区域到门店,从单品到单店、供应链、营销,每一个环节的数据都在变,如何快速形成指标体系是一个非常重要的基础。

    场景化:除了敏捷的构建,观远数据给客户针对不同行业的方案。以连锁便利店为例,里面最重要的角色是门店运营。我们通过行业专家构建了最适合这个行业的十大分析主题,100个指标,若干个分析场景,并不断和同行一起丰富最合适的分析场景、一键式应用等,把所有场景关联到模板。

    自动化:当前面分析构建后,接下来企业决策是在出现异常时的“数据追人”。根据历史数据的分析规律,观远数据会做数据处理、监控及分析过程,并做出潜在预测可能会对经营的变化,通知对应的设定的决策。

    行动化:自动化更聚焦业务环节,用数据追人,告诉他应该采取什么样的行动,这是观远数据和客户合作的场景。过去每周有销售数据,以简化版为例,右上角有异常点,这个点高是异常还是不是异常,应该采取什么对应策略。我们、在后台有机器学习算法,对于连锁门店来说,每日的销售额极为重要,观远数据通过杜邦模型,在后台通过算法,发现最有可能影响销售的原因,以社区生鲜店为例,如果到了中午12点,销量只有预计的30%,系统就应该主动给门店店长提供决策建议。

    增强化:从BI到AI越来越深入,比如更精准的预测门店第二天的销量以及智能订购更合适的时效性商品数量,并且形成数据闭环,让业务与算法不断磨合,不断产生可以量化的效益提升。

    首先是敏捷化。过去不管是Excel还是传统的报表系统,最大的问题是大家不在一个频道上对话。而敏捷的看板能保证老板、CEO关注的数据和一线门店的店长要看到的数据在一个平台上。这里面的挑战是它所构建的门槛较高,需要专门懂BI或者能建立模型的人。而在互联网时代,客户需要的是“极度敏捷”,不需要具备太多的IT知识和培训,在以小时为单位之内的实际,就能快速的将对应的数据拿出来分析好。

    上面这是一个从数据到形成分析的过程。背后一个经典的例子是啤酒与尿布的故事,大家都耳熟能详,沃尔玛通过算法发现啤酒与尿布在特定的一些季节有销售的关联关系。而在企业中,要探索类似这些关联,需要专门的算法团队或工程师,对每天经营后台的相关数据使其关联计算、分析,以发现某些品类与其他品类的关系。而通过观远数据产品,我们把这个赋能给业务人员。

    又比如,企业往往会考核某一单店或者某一品类的盈利结构。从财务角度我们往往会看企业的毛利,毛利又可细化为不同的指标,如销售、客单价和销量等等。当一步步分解到最后,影响它的实际是在某一时段某一商品的销售异常。而我们可以通过机器学习、AI的算法做因子分解,找到最有可能发生的应用场景,并及时预警。

    以一家连锁门店为例,当连续两天下午四点出现商品库短缺的情况,对应门店的负责人就会第一时间通过手机端或者OA收到推送,这背后不光是告诉他数据的变化,更多是告诉他一些业务规则并给到行动建议。

    三、案例分析与讨论

    1、来伊份——从IT到DT的数字化转型

    我们分享的第一个案例是来伊份。来伊份是个上市公司,有2000多家连锁门店。他们的IT基础比较完善,尤其创新意识非常的前瞻。线下门店只是它的一部分业态,此外还有很多创新的全渠道业务场景。观远数据与来伊份有很多深入合作,这里面简单提两个场景:

    第一个场景是监控大屏。通常在关键的业务场景中都会设置一个数据监控大屏,有了这些大屏之后就可以根据业务的变化及时发现问题并弥补解决。观远数据建议的并非是大家都要去花很大投入做一个类似阿里的双十一作战大屏,那个更是形象工程;我们的建议是需要根据业务的真实需要,快速构建场景大屏,以及之后的快速调整监控指标,并及时发现问题。

    第二个场景是数据自动分析和数据追人。以财务为例,来伊份作为上市公司,财务的数据非常复杂,要求很高。但这里面有很多数据处理与分析流程是相对重复的,怎么把这个动作自动化呢?我们只要花上几分钟的时间就可以自动运行,并分发给不同的人,通过更自动化以及全维度的分析现场的方式将80%的场景自动覆盖掉。

    2、Today便利店——数据驱动经营进化

    Today便利店是中国便利店的新锐领军品牌,华中地区的行业领导者,门店数达到400家。怎样用数据驱动门店的精细化经营以做到单店极致?

    上图是Today的大数据规划,观远数据有幸参与这个规划和构建的过程,并提供观远数据产品技术进行协助。如何支撑整体运营决策?怎样形成各个业务部门的指标体系?怎样借助每一块业务对应的指标体系形成的主题分析,智能的解决问题?这些都是逐层递进的关系。

    举个例子,上图是门店健康检查的模拟demo,适用于各种连锁业态,比如星巴克等等。我们试想:当门店超过百家后,如何评判一个门店的表现是否健康?如果不健康,最后可能是什么原因?是产品端还是客流,还是库存,或者是其他非常规因素需要引起警惕?门店的日商有哪些维度的指标组合?这些组合如何导致了最后的销售表现?

    图的左边是一个理论框架,但光有框架还远远不够,还要得出类似于右边图的健康诊断报告,通过模型化的算法和自动化分析的体系把左边的体系通过分析得出右边的结论。比如早上8点钟,自动诊断过去一天的表现,再自动拆解到最有可能的影响原因,到个时间段的销售是否正常,哪些品类的销售有异常等等。这背后我们创新的置入了“虚拟标杆店”等这样的模型与算法,最后自动的进行分析与诊断。

    3、某全球知名运动品牌在中国的零售挑战

    观远数据另一个客户是全球知名运动鞋服集团,旗下包含一系列大家很熟悉的子品牌。和我们服务的其他500强客户类似,他们也是基于SAP的ERP系统,它的整个IT架构较为复杂。从数据分析的角度来说,因为是多品牌、多渠道、多区域,它面临的挑战是需要分析的数据颗粒度差异很大。

    随着中国的业务不断创新,大量的业务数据,以商品管理这条线为例,需要不断进行二次加工、汇总、分析与分发,与相关的生产计划部门进行库存管理和生产安排。而数据有些是在不同Excel的不同表里,有些是在ERP的不同模块里,有些又是经过预处理的中间数据。

    通过和观远数据合作,让商品部门自动化的对每一个商品进行库存分析,第一时间发现库存里不同SKU存在的的潜在问题,并关联到对应的角色。以这一个小场景为例,原来需要每周2天的相对重复性的工作,直接降低到20分钟,而且是系统自动的完成。

    总结一下,用数据赋能零售,本质上是要让企业里面95%的普通人员,在大部分场景下,具备企业里面最懂分析最会管理的那5%的人的决策能力。通过构建零售数据决策引擎,去系统化的支撑企业的经营扩张和精细化管理。

  • ?

    线下培训|python数据分析实战

    孩子

    展开

    你是即将毕业的大学生?

    在职数据分析师?

    零基础数据分析入门者?

    对数据感兴趣却无从下手的人员?

    中国统计网

    Python与数据分析实战

    Python作为一门面向对象的编程语言,简洁的语法使得编写数十行代码即可实现爬虫功能,获取海量互联网数据。使用Python来编写爬虫实现简单且效率高,同时爬取的数据可以使用Python强大的第三方数据处理库来进行分析,最重要的是学习成本低,如此之好的东西怎能不学习呢?

    有人预言,Python会成为继C++和Java之后的第三个主流编程语言。不过,对于尚未踏入职场的数据人士来说,更关心的是:人才需求量大吗?就业空间如何?学完Python好找工作吗?会不会因为招聘人员少而不能顺利就业?那么我们就来告诉你Python就业的几大优势:就业薪酬高、人才就业率高、人才需求量大、就业方向广、升职速度快。

    这是Python的培训

    更是系统的数据分析培训

    当客户流失、利润下滑,

    却无力扭转颓势?

    产品的质量问题频出,

    却找不到根源?

    做了大量的数据报表,

    但却始终感到隔靴搔痒,

    找不到问题的关键?

    缺少数据分析思路?

    本次课程让您真正学会

    数据与业务理解相结合

    ......

    2017年,中国统计网将会陆续开展线下分享会、数据分析实战课程,邀请在数据分析领域有多年实战经验的行业精英做嘉宾,为您提供最实战、最真实,能给你工作带来实操性的干货。

    Python

    数据分

    析

    实战

    课程介绍

    为给大家最好的学习效果,本次课程严格限制人数20人

    讲师介绍

    肖凯,BAT数据挖掘专家,“数据科学中的R和python”博客博主,多年的R语言和python数据挖掘经验,10年数据处理从业经验,承担过多个大型数据挖掘与分析项目,翻译并出版数据挖掘与机器学习专著两部。

    金宏,南开毕业,加拿大McMaster University硕士,统计学出生,任职蚂蚁金服,专职风控数据挖掘,有丰富的python、R语言编程经验,多次担任python数据挖掘与机器学习培训讲师。

    课程安排

    1

    4月8日

    上午:

    1.1.1 python和基础工具箱介绍

    1.1.2 python安装环境

    1.1.3 python的基础功能介绍

    1.1.4 Notebook功能练习

    1.1.5 python基础知识

    数据结构、基本语法(条件、循环、函数、类、模块)

    下午:

    1.2.1 Numpy包介绍和练习

    array基础概念介绍、array的操作和计算

    1.2.2 Pandas包介绍

    序列、Dataframe、时间序列的操作和计算

    2

    4月9日

    2.1.1 pandas包习题讲解:挖掘QQ聊天记录&NBA比赛数据分析

    2.1.2 数据可视化matploblib包介绍

    2.2.1 统计知识介绍

    1. 描述性统计

    2.分布和随机变量

    3.假设检验

    2.2.2 最优化问题

    2.2.3 线性模型

    2.3.4 练习:上证综指建模练习&titanic数据建模练习

    此次课程

    ⊙理论加实践

    学习解决问题的方法

    精英讲师答疑解惑

    讲师负责、行业经验丰富

    配套相关线上课程

    方便回顾、反复练习

    报名方式

    FENTRY MODE

    费用:1999元

    识别左边二维码,加课程顾问微信,获取付款链接,及价值500元配套线上课程,并拉进课程群。

    举办单位

    中国统计网,国内最大的数据分析门户网站。提供数据分析行业资讯,统计百科知识、数据分析、商业智能(BI)、数据挖掘技术,Excel、SPSS、SAS、R等数据分析软件等在线学习平台。

  • ?

    一起聊聊数据分析师的那些技能(硬功夫)

    景明辉

    展开

    在前面写了《聊聊我的R语言学习路径和感受》一文,很多朋友在公众号后台给我留言,问如何学习数据分析、如何转行数据分析、如何快速的掌握数据分析技能等等类似的问题。为了回答这些问题,就在这里跟大家聊聊我个人从事数据分析行业后的一些感受和建议。也欢迎各位看官提出你自己的想法和经验,帮助到其他同行的朋友。

    感受1:SQL很重要

    SQL很重要!SQL很重要!SQL很重要!重要的事说三遍,数据库查询对于一个数据分析师来说真的是必备技能。没有它,你的工作真的非常难找,往往在面试的时候,对方都会出一些数据库相关的问题。数据库之所以重要,那是因为你工作中所需要分析的数据基本都是来自于数据库,如果你不会从数据库查询,就等同于“巧妇难为无米之炊”。

    学习建议

    数据库目前在市面是有很多种,如Oracal、SQL Server、MySQL、Hive等,并不是都要一一学个遍,因为它是结构化的查询语言,各种数据库的语法都非常相似,可以说是一通百通。如果你想从事数据分析岗,但又没有接触过数据库(学生或准备换行的朋友),建议你下载一个MySQL的社区版本(https://dev.mysql/downloads/mysql/),然后买一本相对实战且基础的书籍(《SQL必知必会》)进行学习。这本书一共介绍了30个章节的内容,你只需重点吸收数据库的查询、修改、删除、插入、存储过程等知识点,我认为通过这些知识点的吸收和应用,基本上可以满足数据分析岗的面试要求了。当然对于老手来说,这本书里面也有很多其他值得学习和实战的例子(如存储过程、游标、事件、性能等)。

    感受2:可视化显水平

    数据可视化的技能,也是数据分析师的必备要求,因为枯燥的数据表肯定不如一张张图更吸引眼球,更何况这些报表更多的是给那些业务繁忙的Boss看。那报表的展现方式总不能每次发一个PPT给对方吧,如何让对方随时随地的查看到你的报表呢?Tableau!

    它有两个强大的版本,一个是DeskTop版,即分析人员的可视化设计版本;另一个是Server版,即通过DeskTop将设计好的可视化报表上传至服务器,实现随时查阅报表的功能,而这两个版本的结合就能恰到好处的满足随时随地查报表。最大的好处是你无需编程即可完成高质量的可视化任务,只需通过简单的托拉拽,就让数据可视化想怎么玩就怎么玩。目前越来越多的企业,在招聘时,都会要求或注明有Tableau的使用经验。

    学习建议

    这里推荐《Tableau数据可视化从入门到精通》一书,这也是我看的众多Tableau书籍中比较好的一本,而且该书籍在售书平台上的评价也非常棒。该书一共16个章节,从基础的工具简介、数据读取、字段操作、函数使用到可视化实操,讲到了很多细节方面的内容,最后还以两个案例作为压轴戏,分别是“网上超市运营分析”和“网站流量统计分析”。这两个主题抓的非常贴切,一个从电商运营角度来思考常见的可视化问题;另一个则从网站运营角度来分析有哪些核心指标可供选择和及对应的展现方式。这两个角度都顺应了互联网时代下的需求,我相信当你读完并操作完数里面的案例,会对你的可视化能力有一个质的提升,也是进入数据分析行业的加分项。

    感受3:Excel很普及

    作为一个数据分析师或BI,其实很多工作内容都可以通过SQL提数和Excel的加工就可以任务完成,困难的是如何梳理好SQL的提数逻辑和灵活的应用Excel减轻你的工作量。之所以说它应用很普及,是因为它不仅仅是个装数据的容器,更多的是会借助于强大函数、可视化等帮你完成工作。

    各式各样的字符串函数(LEFT、RIGHT、MID、LEN、REPLACE、TRIM、FIND、SEARCH、CONCATENATE、REPT等)、数值函数(ABS、EXP、LOG、POWER、SQRT、CEILING、FLOOR、MOD、ROUND、SIGN等)、日期函数(DATE、YEAR、MONTH、DAY、WEEKDAY、WORKDAY、TODAY等)、统计函数(MIN、MAX、AVERAGE、MEDIAN、VAR.S、SUM、SUMIFS、COUNT、SKEW、NORM.DIST等)、匹配函数(ROWS、COLUMNS、MATCH INDEX、VLOOKUP)等可以让你在数据处理过程中变的非常简单而轻松;强大的可视化功能(如饼图、条形图、柱状图、折线图、面积图、散点图、气泡图、雷达图等)也会为你的数据分析助一臂之力,但面对大数据量时就显得非常捉急,这也是无法跟Tableau媲美的;灵活的宏功能,可以避免我们不断的做重复性工作,从而节约时间,提高我们的工作效率,宏语句是由一系列的命令和函数组织起来的,尽管它在工作中用的并不是那么的频繁,但一有机会,你去用它来开发报表或表计算的话,会大大提高你的成就感,当然,我希望你能够会一些宏语句,这样你身边的朋友或同事都会觉得你很了不起呢!

    学习建议

    这里向大家推荐《Excel函数与公式速查手册》和《Excel2016宝典》两本书。第一本书涵盖了近600个函数的讲解,而且这些函数都是借助于一个个实例来完成的,有助于读者的操作和理解,可以说,读完这本关于函数的书就可以在工作中使用函数时显得游刃有余;第二本光从书名就知道是一本知识点比较全面的书籍,该书涉及Excel的公式和函数、图表可视化以及Excel的各种设置。个人建议可以把这两本书当作工具来使用,没必要系统的过一遍,当你需要某个知识点时,从目录去查找相关关键词,然后操作几遍就记得如何使用了。

    数据挖掘秀肌肉

    我相信,当你找数据分析相关的工作岗位时,基本上都会看见对方要求你会数据挖掘或数据建模方面的能力,同时也会附上一条熟练使用Python、R等工具。此时你会掂量掂量自己,这方面的技能我会吗?工具使用的熟悉程度能够达到对方的预期吗?我有哪些相关的建模经验?

    在面试或工作中比较常见的数据挖掘算法有四类,分别是预测、分类、聚类和关联,个人觉得前两类的使用频率会更高一些。这里提几个重要的挖掘算法:线性回归、Logistic回归、决策树、贝叶斯、SVM、随机森林、K均值和关联规则。希望不熟或不会数据挖掘的朋友可以先从这几个着手学习,而且学习的时候先通过代码完成落地,然后再去慢慢研究其理论知识。

    学习建议

    如果你是统计学或经济学等类似专业的朋友,建议你去学习R语言,而如果你是计算机专业或理工科的朋友,则建议你去学习Python。因为这两个工具的思维有一点点差异,毕竟R语言是由统计学家创建的(偏向于函数概念),而Python是由计算机学家创建的(偏向于类概念)。而且又有一些相似性,同时学习的话会比较容易混淆。如果你选择R语言的话,这里推荐《R语言实战》和《机器学习与R语言》这两本书,前一本书偏向于语法编程,同时也会含有案例来说明统计学方面的知识点,后一本则通过实战的方式来介绍常用的数据挖掘技术,能够助你快速的进入R语言的挖掘状态;如果你选择Pythond的话,同样介绍两本书,即《利用Python进行数据分析》和《Python数据分析与挖掘实战》,第一本更多的是介绍数据分析方面的Python库,如numpy、pandas和matplotlib,这也是一本基础书,第二本则是教你如何按部就班地完成每一个实战案例,具有代入感,让读者学习起来很顺畅;如果你还想补一补数据挖掘的理论知识,则推荐《数据挖掘概念与技术》,个人看了好几遍,不是很难,有比较好的操作性。

    OK,如上就是我从事数据分析岗位的一些学习经验和感悟,希望对各位读者有一点点的帮助。学习是一种投资,需要耐得下性子,坐得住板凳,敲得住键盘,同时,还要不断的坚持。只有这样,我相信一定会成为数据分析或挖掘的强者。

    End.

    作者:刘顺祥(中国统计网特邀认证作者)

    点击下面链接 查看历史文章

    一文综述数据科学家必备的10大统计技术:线性回归、分类、无监督学习...

    【漫画版】12星座程序员写代码

    怎样成为知乎大V?爬取张佳玮138w+知乎关注者:数据可视化

    一步一步教你分析消费者大数据

  • ?

    spark搜狗日志数据分析实战

    觅风

    展开

    一.数据来源

    本次示例所用数据是来自搜狗实验室的用户查询日志。搜索引擎查询日志库设计为包括约1个月(2008年6月)Sogou搜索引擎部分网页查询需求及用户点击情况的网页查询日志数据集合。为进行中文搜索引擎用户行为分析的研究者提供基准研究语料。

    数据下载地址为:http://sogou/labs/resource/q.php。可以根据自己需求下载不同版本数据,这里下载的是迷你版本的tar.gz格式的文件。

    数据格式为

    访问时间\t用户ID\t[查询词]\t该URL在返回结果中的排名\t用户点击的顺序号\t用户点击的URL

    其中,用户ID是根据用户使用浏览器访问搜索引擎时的Cookie信息自动赋值,即同一次使用浏览器输入的不同查询对应同一个用户ID。:

    打开该文件,其内容如下图所示:

    2.通过sc读取textFile

    val sougou = sc.textFile("G:\\SogouQ.txt")

    然后通过count来看一下一共有多少条数据

    sougou.count()

    3.过滤有效数据

    过滤出有效数据。步骤如下:

    1.首先调用sogou.map(_.split("\\s"))方法,根据“\\s"符号对RDD中的每行数据进行切分生成一个字符数组;

    2.然后调用RDD的filter方法对切分后的数据进行过滤,只保留每个字符数组的长度为6的数据;

    3.最后会调用RDD的count方法统计过滤后的数据量。

    val filterSG = sougou.map(_.split("\\s")).filter(_.length ==6)println(filterSG.count()) // 10000

    注意:下载后的文件格式和官网说的有一点出入,就是该URL在返回结果中的排名和用户点击的顺序号之间不是以Tab键分隔的,而是以空格分隔,所以如果以split("\t")切分,那么结果就是0,因为length不等于6。此处用到正则,匹配Tab键也可以用\\s来匹配。

    关于常用正则表达式链接如下:代码+图文讲解spark中scala常用正则匹配

    http://blog.csdn/rivercode/article/details/60570620

    4.过滤搜索结果排名和点击结果排名都是第一的数据

    获得搜索结果排名和点击结果排名都是第一的数据。搜索结果排名对应的是改文件中URL在返回结果中的排名,点击结果排名指的是用户点击的顺序号。经过上面第三步过滤的有效数据的操作,已经把每行数据切分成一个长度为6的字符数组,要获得搜索结果排名和点击结果排名都是第一的数据也就是RDD中每个字符数组中第4个元素(索引为3)和第5个元素(索引为4)的值都为1才满足。因此,下面会连续调用两个filter方法来对数据进行过滤,然后调用RDD的count来统计满足要求的数据量。

    val rdd = filterSG.filter(_(3).toInt == 1).filter(_(4).toInt == 1)

    5.计算用户查询次数排行榜(降序)

    计算用户查询次数排行榜(降序),并把结果存储到G盘里的sgresult文件夹下。用户的查询次数指的是每个用户一共查询了多少单词,也就是指同样的用户ID一共查询了多少单词。这里已经在第四步生成的rdd的基础上来计算用户查询次数排行榜。步骤如下:

    1.首先,会调用rdd的map方法把rdd中的每个字符数组中索引为1的元素通过一个函数生成key-value型的元组;

    2.然后,调用RDD的reduceByKey方法对key相同的元素进行求和操作;

    3.再调用map方法调整每个元组中key和value的顺序;

    4.接着调用sortByKey方法对交换过key和value顺序的元组按照key的大小进行降序排序;

    5.之后,再交换每个元组的key和value的顺序;

    6.最后通过saveAsTextFile方法把操作结果保存到指定位置的指定目录中。

    rdd.map(x => (x(1),1)).reduceByKey(_+_).map(x => (x._2,x._1)).sortByKey(false).map(x =>(x._2,x._1)).saveAsTextFile("G:\\sgresult")

    通过saveAsTextFile后的文件为如下图所示:

    6.相关链接:

    以上其实已经把完整代码都写完了,如果想下载完整代码,(豪们,会员给点鼓励,多下载。不是会员者,不建议下载,因为基本已是完整代码)链接如下:

    spark搜狗日志数据分析实战源码 http://download.csdn/detail/rivercode/9795582

    spark累加器介绍-案例通过累加器统计文章中空白行数量 http://blog.csdn/rivercode/article/details/60574856

  • ?

    你值5K还是15K?实战案例,测测你的数据分析功力

    情薄

    展开

    本文源自陈老师遇到的真实案例。

    老板说:“我们今年准备参加展会,做一年。以前我没参加过,没关系,这里有一份展会数据,你回去分析下哪些有价值,后边组织的时候有个指导”。现在你收到任务了,咋办?

    一

    屏

    幕

    思

    考

    时

    间

    第一步:拿到问题,先干什么?

    5K表哥:“好嘞,我回去研究一下数据”

    15K分析师:老板,我们做展会的目标是什么啊?是准备促业绩,还是做推广?促业绩我们考核意向成单还是实际成单?做推广,我们如何考核推广效果?是微信关注人数、还是获得销售线索数,还是……?如果两个都有,哪个更重要?如果一定要丢一个会丢哪个?

    第二步:看到数据,思考什么

    5K表哥:“恩,我是用层次分析法评价呢,还是建一个模型呢?要用什么模型呢?有没有模板可以参考呢?哪里有模板呢?”

    15K分析师:“这个数据是从哪里来的?谁统计的?预计参与人数怎么预计?”

    第三步:数据不够,要怎么办?

    5K表哥:“回到眼前,这数据也太少了吧,手头的表格只有展会名称,举办方,参展预计人数,展会级别,展会主题等几个字段,好像也分析不出什么来”

    15K分析师:“经查,数据是可信的,还可以用。看起来这里还有些字段可以做处理,比如展会参展人数,找一些参加过展会的人了解,1万人以上就算大型了,5千左右算中型,那可以先分个大中小。组织者级别可以分成高级,中级,初级。恩恩,还有其他一些字段,处理完再说。”

    第四步:抓着数据,怎么分析?

    5K表哥:“额,不知道咋分析,拍脑袋好了”

    15K分析师:“依据现有的信息,可以列举三个假设:”

    假设1:展会人数多的,成单量会高

    假设2:展会级别高的,成单量会高

    假设3:展会组织者专业度高的,成单量会高

    依据这三个假设,可以先建议ABC三场会议参加,预计A的成单量最好,未来以A为成单参照。现场参与人员,需协助收集XXX信息,以辅助事后分析。

    第五步:事后总结怎么做

    虽然目前还没有真实开展,但是可以预计到,未来的总结会这么做

    5K表哥:“额,谁有展会活动的总结模板啊,求一个模板”

    5K表哥:“老板又说我考虑的不周全,可是数据就这么多啊!怎么周全”

    5K表哥:“老板又让我修改,我快崩溃了,改了16版了”

    15K分析师:“针对预期成单目标,本次达成率为x%,达成目标”

    15K分析师:“对比两次活动,可见XX假设是不成立了,展会专业度比人数更有利于成单”

    15K分析师:“未来可集中向专业度高的行业性展会,预计节省参展成本X万元,增加成单XXX万元”

    ——全文当然还没有完——

    所以差别在哪里?差别就是等靠要和主动性的区别

    差别是优秀的数据分析师不但有良好的职业知识,更有优异的职业素养

    这种职业素养体现在九个方面:

    收到任务时

    目标明确:凡事必有一个目标,不能含糊,不能一锅炖,不能高大全。目标不清是万恶之源。

    目标清晰:可量化,可追踪,可对比。可量化才能分析,不可量化是扯皮之源。

    目标聚焦:有先后,有重点。如果有两个目标,那么两个之间要排先和顺序,如果有三个,三个必须要有重点。越多的目标,意味着事情本身越难达成,也意味着分析时候会越混乱。

    数据处理时

    清晰含义:清晰名称-来源-计算方式。避免歧义,防止错误是一切分析的基础。

    重视收集:尽可能收集数据,提高质量。没有数据确实很难分析,优质的数据能极大的帮助分析,不加管理的垃圾数据只会把分析带沟里去。

    解读含义:分类解读,找到数据后业务含义。很多分析师被业务部门嫌弃,就是因为只知道出数字,不懂得解读数据背后的含义。月消费10000和高消费群体,对业务部门是完全不同的两个概念,只有多多找含义,才能更好地找到数据的价值。

    输出报告时

    树立标杆:树立明确的评价标准。凡是涉及到“好”“坏”“高”“低”的,一定要有参照物,一定要有标杆,因为本身这些词语都是相对比较的词,而且很大几率和领导的个人看法有关系。如果不设标杆,在事后总结评估的时候就会陷入无休无止的口水战和扯皮里边去。

    明确假设:设计待数据验证的假设。有了假设,分析的时候才容易总结,才容易看出来哪些路子是容易走通的,哪些是可能有坑的,才能在多次实验中沉淀下经验。

    逐步迭代:每次分析,不断验证假设,沉淀经验。经验是越积累越多,越积累越丰富的。好的分析师知道把每一次经验总结起来,让自己的判断越来越准。

    数据分析师的本质就是:用数据和逻辑代替拍脑袋,用系统和科学取代神秘主义,因此9条要点中有7条都和清晰明确有关。

    数据分析师的价值在于:以数据指导工作,从数据找到方法。因此不能仅仅就数论数,而是要看清楚数据背后的含义,找到业务部门思考的脉络,这样才能让分析更接近业务部门的需求,让建议更贴合实际情况。

    数据分析师的要求是专业,专业不仅体现在懂计算,懂代码,懂操作,更体现在深入全面的考虑问题,循循善诱的解答问题,因此面对业务部门的咨询的时候,保持头脑冷静,保持耐心,抽丝剥茧的问话,本身就是专业性的体现。

    与大家共勉。

  • ?

    营销实战|数据分析及落地转化(专业好文)

    大猫咪

    展开

    欢迎关注百家号,不定期推送分享专业好文,与您一起成长。

    作者简介:

    肖玮,国家工商管理专业经济师。大学毕业后,进入快消品行业从事营销及管理工作,从一线业务人员成长为一名职业营销经理人。

    可能大家都觉得,从事快消行业,作为一名销售人员,坚持每天的跑路线拜访客户,就可以啦。实际上不是这样的。现代的竞争社会,比你勤奋又坚持的人很多,咱们要出尖,更需要一些营销专业上的支持。

    这里先简单分享一个小小的案例。虽然整个测试不那么严谨和规范,但是有启发作用。大家知道价格签吗,他对销售的提升有多大?

    图片来自网络,示意参考。

    在山区县城负责某一线品牌的销售时,我做了个测试,随机选择30家乡镇的超市,通过价签来试验,试验进行如下:30家超市,都选择店内入口最佳的位置,投入1排的陈列排面。然后选择10家做销量参照,选择另外的10家投放价格签,选择剩下的10家投放价格签和宣传签。通过各家的前后销量对比,进行统计分析。结果是,有价格签的销量,提升约5%。而有价格签和宣传签的商店销量和仅投价格签的销量并没有明显区别。

    你看,小小的价格签,就能提升这么多销量。而多投的宣传签,在销量上居然没有起到更加明显的作用。

    从今天再去看当时这个试验,大家会说,那个宣传签虽然没有起到销量作用,也许起到品牌宣传作用呢。嗯,你可能是对的。

    ------

    后来调离到其他主销区域任区域主管的时候,承担的压力更大了。

    当时团队是5名业务人员编制。分别负责4个乡镇。在第一季度末的经分销商库存还有300万左右,并且还需要完成全年600万、上半年300万的任务量,而从同期市场净销量来看,每个月差不多在100万左右,总结之:3个月内需要将600万的产品进入渠道和市场,其中300万可以通过市场净销量完成,另外300万需要积压在通路上。

    我们该怎么开展市场较为合适呢?

    大家可以先思考下再继续往下看。

    ------

    既然是数据分析落地转化,那肯定和数据分析有关。得益于主销区的数据较为齐整,我调阅出所有可查询的批发、终端客户信息和各网点的销量,安排业务团队对市场进行信息收集和实地排查,如批发下属的主要终端客户月均销量和陈列现状等等,一个星期内基本将信息摸排完整。

    以上完成了基本面的信息收集,下面就是信息分析和构建数据模型了。

    ------

    通过一系列的测算评估,优先选用这个方案:

    1、将现有终端售点月进货5000元以上的全部列出列为A类,2000以上为B类,1000以上为C类客户,1000元以下为D类客户。其中, A类是30家,B类120家,C类200家。

    2、将批发售点月进货10万元以上的终端全部列为批A类,5万元以上为批B类。5万以下为批C类。其中,批发售点A类是5家,B类客户20家。

    ---

    在市场动作方面,也给予不同的策略方式:

    可控终端售点AB类实行堆陈+进货奖励,按平均1.5-2倍的库存进行进货支持,并给予10%的现金回报率。Cd类通过补货上货架,扩大陈列面和维持合理库存来实现自助动销。

    这样,在可控终端售点,基本上完成(5000*30+120*2000+1000*200)*1.5=88.5万元。

    对批发售点AB类给予货品5%的回报率予以进货奖励。对库存上给予1倍库存量即可。C类维持正常进货促销。

    在批发售点上,基本完成(10*5+5*20)*1=150万。

    ------

    这样,基本上,货品处在通路上的存量达到240万左右。

    每个经分销商的库存平均在10-15万元之间,保持轻库存。

    ------

    应用这一套数据模型的目的,既可以保持通路和终端的库存,整个市场保持高压态势,又能让客户又有较为合理的收益点,便于业务团队工作开展。

    同时也可以预防整体进度不顺畅时,还可以通过经销商的高库存来缓冲,推行第二方案。

    通过推行这样的方案,总体费销比不超出10%,属于合理范围内,也容易说服上级批准。

    最终,我们在第二季度顺利完成了600万元的任务量,客户、团队、领导、公司皆大欢喜。

    ------

    例子说完了。说明下,列举的数据不是真实的,因为时间太久以及资料丢失等原因,只能列举个大约数字。

    咱们总结下,数据分析,大概就是按目标深度解读、数据(信息)收集、(关键)分类定义、制定策略方案、预期与评估的步骤推进;但是,仅仅完成数据分析还是不够的,还要落地转化,而落地转化则涉及更多的人员安排及市场营销管理方案,比如业务团队的工作饱和度、人员分工安排以及方案落地后可遇见的问题处理等等,需要认真仔细的评估。

    图片来自网络,示意参考。

    ------

    最后,从工作角度,总结一句话,当一个合格的主管,还是要劳心劳力的。

    -----

    转载请保留文章创作者署名,谢谢。

  • ?

    《游戏数据分析实战》:盛大游戏数据分析专家16年的实战经验分享

    支冬寒

    展开

    来源:数据猿 作者:abby

    从游戏产业诞生开始,数据分析就一直伴随游戏的研发和运营的全过程。 2001 年,盛大网络通过《热血传奇》开启了中国网络游戏产业。网络游戏的 24 小时在线和高度的用户互动,为游戏数据分析提供了前提条件;通过数据分析输出的结果,及时有效地反馈到游戏的研发设定和线上社区,形成了良性和有效的循环。

    早在2003年,盛大网络向行业输出了 PRAPA 分析模型,针对游戏的用户推广(Promotion)、注册用户(Register)、活跃(Active)、付费(Pay)、平均用户收益(ARPU)进行有效的分析指导,为游戏行业的成熟提供了标杆。在当时的盛大内部,我们针对游戏的用户体验瓶颈环节,设立“卡外掉充安”(卡机、外挂、掉线、充值、安全)专项,通过数据分析不断进行验证和调整,使得用户体验满意度持续行业领先。

    同时,游戏数据分析还指导着产业变革。在2005年,盛大率先变革游戏商业模式,从之前的时长计费变为道具收费,这意味着之前的逾10亿元年收入归零后重新开始。在此之前,公司内部已进行了超过半年的数据分析和业务试点,最终全面施行,深刻影响了游戏产业。伴随数据分析技术的发展、游戏形态从端游到手游的进化、渠道与社交网络的演进,基于大数据的用户画像和数据多维交叉分析,为游戏的精细化运营提供了新的契机和动力。

    而《游戏数据分析实战》的作者黎湘艳就是盛大游戏数据分析专家,从事游戏行业16年,历经多种岗位,亲历了中国游戏行业从萌芽到蓬勃发展的历程。她在本书中集结了她完整的数据分析思想及50多个游戏项目数据支持的积累提炼。

    《游戏数据分析实战》贯穿整个游戏生命周期,提供了丰富的数据分析案例,从预热到封测,再到公测, 均为作者在实际工作中经历的真实案例。案例分析包含数据来源、分析方法、分析过程、分析结论及小结。通过学习本书不但能较深入地学习数据分析方法,还能了解到运营和市场的相关知识。

    该书主要分为三部分:

    第一部分:主要介绍游戏数据分析相关指标体系,通过这套体系,可以初步监控游戏整体运营情况;

    第二部分:主要介绍游戏正式发行前期的市场调研、渠道用户质量分析、竞品分析及投资收益预测,对游戏品质进行定位,评估正式上线后的效果;

    第三部分:主要对游戏正式发行后的用户流失、活跃用户分类、付费习惯、版本迭代效果、区服合并等主要问题进行深入探讨,实现游戏的精益化运营。

    该书的特色是以详细案例为主,通过SPSS、Excel 等工具逐步展示实施步骤,用手把手的方式让读者快速掌握游戏数据分析方法。

    适读人群:

    黎湘艳,盛大游戏数据分析专家,从2008年开始在盛大游戏从事数据分析工作,先后主持或参与50多款游戏的数据分析工作,主要产品有:《热血传奇》《传奇世界》《龙之谷》《永恒之塔》《最终幻想14》《血族》《超级地城之光》《Love Live》《城与龙》等。

    叶洋,游卡桌游资深数据分析师,具有7年游戏行业数据分析、数据挖掘工作经验。

    购买链接:https://item.jd/12248029.html

  • ?

    大数据分析项目实战直播分享

    尤寒天

    展开

    随着大数据相关技术的发展,大数据在行业内的应用越来越广泛,大数据又分为数据采集、数据清洗、数据存储、数据建模、数据呈现等多个环节。

    由于缺乏对应的大数据人才,以及国家对大数据的支持,目前很多人都开始关注大数据领域。考虑到很多人想了解大数据,我们特地准备了一个关于大数据可视化分析的项目实战课,里面包含多个大数据分析项目的讲解和演示,每周两到三次。具体的信息说明在最后。

    往期大数据分析项目展示:

    大数据项目实战案例一:二手房交易数据分析

    大数据项目实战案例二:数据可视化职位分析

    大数据项目实战三:智慧城市运营中心项目

    大数据项目实战案例四:空气质量监测

    大数据项目实战案例五:全国IT行业招聘信息分析

    项目知识点:大数据分析,大数据可视化呈现。在哪里学习?大数据项目实战467095527

    我们所处的这个时代,是一个知识大爆发的时代。仅就编程这项技能来说,现在几乎人人都能写上一两行,程序员这个群体也比十年前有了更多维度上的扩展。所以面对热门的大数据技术,有必要多做了解,多学习,才有利于长远的发展。

  • ?

    离线数据分析平台实战之Flume

    景鸿涛

    展开

    Nginx介绍

    一款轻量级的Web是Nginx, 也是反向代理服务器和电子邮件代理服务器。其、优点在于占有内存少,并发能力高,实际上它的并发能力确实在同等条件下相同类型的服务器中效果明显。通常情况下,我们会把nginx服务器当做一个静态资源的访问容器。

    Nginx安装步骤

    1. 用户root登录。

    2. 观察nginx信息,执行命令:yum info nginx.

    3. 如果nginx提示nginx找不见的信息,通过修改rpm源来处理后续操作,执行命令:rpm -ivh http://nginx.org/packages/centos/6/noarch/RPMS/nginx-release-centos-6-0.el6.ngx.noarch.rpm

    4. 观察nginx信息。

    5. 安装,执行命令: yum install nginx。在安装的过程可以输入y。

    6. 启动nginx,执行命令:service nginx start

    7. 访问http://192.168.0.120 查看nginx下的web页面。

    Flume介绍:

    它是的特点是,一个提供高可用的,高可靠,聚合和传输的系统,支持日志系统中定制各类数据发出和运用于收集数据信息;同时它也能够提供对数据进行简易的操作和处理,并把数据写到接受对方。

    现在Flume只有两个版本,

    Flume0.9x 之前名字叫:Flume-og

    Flume1.X 之前的名字叫:Flume-ng

    它们的主要区别如下:

    Flume-og采用master结构体,能够保证数据的统一性,把zookeeper引入进行管理。Flume-ng就取消了master和zookeeper管理机制,变成了单一的传输工具。

    Flume-ng采用不同线程对数据进行读写;在Flume-og中,读数据和写数据是由相同的一个数量的线程处理的,写的比较慢,说明阻塞flume的接收数据的当然只是肯能。

    Flume结构体

    Flume选择Agent为基本单位,单个agent包含source、channel、sink,三种组件。

    source组件功能是接收外部数据,将数据传递到channel中;

    sink组件功能是发送flume,接收到数据到目的地;

    channel作用为数据传输和保存。

    Flume结构分为三类:1:单agent结构:2:多agent链式,3:多路复用agent。

    多agent链式结构

    多路复用agent结构

    source介绍

    Source的作用就是接收客户端发来的数据,将数据发到channel中,source和channel是多对多关系,通常情况下一个 source会相对应多个channel。

    Flume常用的source都有这些:Avro Source、Thrift Source、Exec Source、Kafka Source、Netcat Source等。

    格式看下图

    Channel介绍

    Channel的就是提供一个数据传输隧道,供数据传输和存储。

    source将数据放到channel中,sink从channel中获得数据。

    Flume用的channel都有有:Memory Channel、JDBC Channel等。

    格式看下图:

    Sink介绍

    Sink作用就是定义数据写出形式,通常情况sink从channel中拿来的数据,将数据写出到file、hdfs上。

    channel和sink关系是一对多的关系。

    Flume用sink都有有:Hdfs Sink、Hive Sink、File Sink、HBase Sink等。

    格式如下:

    安装Flume步骤

    ·下载flume:wget

    · 修改conf/flume-env.sh文件

    · 添加到flume的bin目录到环境变量中去。

    · 验证是否安装成功,执行命令: flume-ng version

    Flume案例

    Nginx身为日志服务器,通过exec source监听日志文件,使用memory channel作为数据传输隧道,用hdfs sink将数据存储到hdfs上面。

    感谢谢今日头条平台,大家喜欢交流技术的加群233025331,里面提供技术解答和行业交流!

数据分析实战

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP