- ?
数据分析的九种方法
梦臆
展开
微信公众号发展至今,整体的产业已趋向成熟,市场对其运营框架也有了大致的共识,基本上可分为:内容运营、活动运营、用户运营,以及渠道运营和数据运营等几大模块。每个不同的运营模块,它们各自独立,同时又相互地影响。
本文侧重于对运营初学者来说,提供一套简易、有效的数据运营方法论。在开展数据运营工作之前,我们首先得了解数据在整个公众号运营工作中,究竟充当着什么样的角色?
我认为:“数据是运营的基础,就像一条绳索,贯穿整个运营工作。它既是运营KPI考核的直接呈现方式,同时也是运营方向的理论支撑点”
在新媒体的数据运营中,数据分析是至关重要的步骤,而数据分析有大概九类方法,你们知道吗?今天小天就来带大家了解一下这些干货吧!
数据分析的九类方法:直接评判法 — 对比分析法 — 结构分析法 — 分组分析法 — 平均分析法 — 矩阵分析法 — 漏斗图分析法 — 雷达图分析法 — 回归分析法
1.直接评判法
直接评判法即根据经验直接判断数据的好坏并给予评判,通常用于内部过往运营状况评估,如评估近期阅读量是否过低,评判近期销售量是否异常,评估当日文章推送量是否正常。
直接评判法有两个必要的条件:一是运营者有一定的新媒体运营经验,能够对跳出率,阅读量等有正确的评估;二是经过加工处理的数据足够直观,可以直接代表某项数据的优缺点。
2.对比分析法
对比分析法,是将两个或两个以上的数据进行对比,分析差异进而揭示这些数据所代表的规律。
对比分析法包括横向比较及纵向比较。横向比较即同一时间下不同总体指标的对比,如今日头条同领域作者文章阅读量对比,粉丝数对比等;纵向比较不同时间条件下同一总体指标的对比,如本月文章阅读量与上月阅读量进行对比,本月粉丝增长数与上月增长数进行对比等。
通过对比分析,可以直接观察到目前的运营水平,一方面找到当前已经处于优秀水平的方面,后续予以保持;另一方面及时发现当前的薄弱环节,重点突破。
3.分组分析法
分组分析法是指通过一定的指标,将对象统计分组并计算和分析,以便于深入了解所要分析对象的不同特征,性质及相互关系的方法。
分组分析法遵循相互独立,完全穷尽的枚举分析法原则。所谓相互独立,即分组之间不能有交叉,组别之间具有明显的差异性,每个数据只能归属于某一组;所谓完全穷尽,即分组中不要遗漏任何数据,保持完整性,各组的空间足以容纳总体的所有数据。
4.结构分析法
结构分析法是在统计分组的基础上,将组内数据与总体数据之间进行对比的分析方法。结构分析法分析各组部分占总体的比例,属于相对指标。
例如,新媒体运营团队可以统计粉丝所在的地域分布,统计出各个地方粉丝的占比情况,此情景便属于结构分析法。
5.平均分析法
例如,在分析今日头条的文章阅读量时,借助Excel导出的数据可以快速找到阅读量大于平均值的文章,接下来可以继续挖掘这些文章的标题,排版,配图等规律,便于后续内容质量的提升。
6.矩阵分析法
矩阵分析法是一种定量分析问题的方法,它是指以数据两个重要指标作为分析依据,并将这两个指标作为横,纵坐标轴,构成四个象限,从而找出解决问题的办法,为运营者提供数据参考。
例如,某餐饮企业的大众点评评价分析,可以借助四个象限“紧急且重要,重要但不紧急,紧急但不重要,不紧急也不重要”进行矩阵分析,并重点处理“紧急且重要”的事项。
7.漏斗图分析法
漏斗图分析法因展现形式如漏斗,故而得名。漏斗图可以对文章阅读量,产品购买量等情况进行逐层分析,展示整个关键路径中每步的转化情况。
重要强调的是,单一的漏斗图难以衡量各个环节的好坏,运营者可以结合本节介绍的“对比分析法”,对同一环节不同时间对比,评估运营效果。
8.雷达图分析法
雷达图常用于指数分析,即通过对新媒体账号的内容质量,领域专注等不同维度的计算而得出的客观评分结果。分数越高,代表账号的质量越好。可以利用雷达图进行分析的指数,包括今日头条指数,大鱼号星级指数,百家号指数等。
9.回归分析法
回归分析法是通过研究事物发展变化的因果关系来预测事物发展走向,它是研究变量间相互关系的一种定量预测方法,又称回归模型预测法或因果法。
例如,将今日头条粉丝数据导出到Excel表格,对累计粉丝数进行一元线性分析,就可以尝试预测某个时间的粉丝量。
- ?
数据分析:统计学与概率论的教学思考,看完长见识了!
轻尘
展开
为了在教学方面自我完善,自我提高,更好的服务于教学工作,结合自己的教学实践浅谈一些自己的心得: 一、统计与概率的内涵的进一步认识 数据能够帮助我们认识世界、做出决策和预测,而统计正是与数据打交道的科学,它是在人们对现实生活中数据资料的收集、整理、分析的过程中发展起来的。 (1)紧密联系学生生活实际,创设情境。有了这样的情感学生学起数学知识来当然是事半功倍了。例如:“分苹果”的情境创设,动手操作,激发了学生提出问题,解决问题的欲望,让学生在情境中感受、理解数学问题。再如:圆的周长收集整理的实际测量,也练习了学生的动手操作。 (2)在课堂上让学生充分交流讨论。在民主、和谐的氛围中开拓思维,积极参与,充分合作。教师适时地参与到学生的讨论和交流当中,较好地扮演了组织者、参与者、合作者的角色。 (3)运用丰富多彩的课堂教学手段。随着科技的进步和发展,我们的课堂也要跟上时代的潮流改变传统的一支粉笔进课堂,这两节数学课让我增长了很多见识,随着一个个课件的展示,本来很难理解的数学难题变得形象、具体,一个个教学难点也随之被攻破。课堂也显得生动活泼了很多。如果有条件我们也要丰富我们的课堂,提高课堂的教学效率。
(4)引用《不列颠百科全书》对统计学的一个定义。《不列颠百科全书》对统计学的一个定义:“统计学是关于收集和分析数据的科学和艺术”。我认为定义中有三个比较关键的核心词,第一个是数据。“数据”和“数”的最重要的区别是数据是具有实际背景的,而“数”则并不一定。从这个意义上我们就可以理解了为什么说可以把“统计”从过去我们认为的“数的运算”中单独出来,成为一个相对独立的学习领域,统计主要作用正是通过数据处理来提取信息从而帮助人们进行决策。进一步,“随着信息高速的增长,我们需要进一步扩大对数据的认识。事实上,现在的数据不仅仅是数,其实图像也可以看成是数据、语句也可以看成是数据。只要蕴含着一定信息的,无论是什么表现形式,都可以看作是数据”。 二、教学当中概念的处理方法 在教学中,我们应该首先注重学生统计观念的形成与培养。能从统计的角度思考与数据信息有关的问题;能通过收集数据、描述数据、分析数据的过程,作出合理的决策,认识到统计对决策的作用;能对数据的来源、处理数据的方法以及由此得到的结论进行合理的质疑。收集整理养出来的感觉,统计学习要培养学生能自觉地想到运用统计的方法解决有关的问题。学生没有经历数据的收集过程,随机的数据对他们来说还是确定的,学生也就根本无从体会统计思想方法的价值。因此必须创设原始的随机情境,突出活动性,让学生亲身面对实际问题,亲自调查、收集数据,先体会随机数据的不确定、杂乱无章,然后组织学生经历数据的分类整理,凸现随机数据的特点。在这样的教学情形下,学生才深深地领悟到统计思想确实很有用。
我们还要注重学生在概率实验中的操作体验。教学中应以学生亲身经历和体验统计过程作为主线,即对数据从收集、整理、描述到分析、运用的全过程中突出学生的主体参与,再此过程中引导学生发现并提出问题,用适当的方法收集和整理数据,用合适的图表展示数据,对数据作简单的分析并对自己的分析、思考进行交流和改进。由于处理数据没有唯一的样式,在统计过程中,不同情况下、不同的学生会用不同的方法来记录和表示数据。因此,引导学生经历数据处理过程的教学具有很强的探索性。 三、如何介绍收集和数据的分析和运用 统计处理数据的步骤主要包括:第一是要确定需要解决什么问题;第二是决定收集数据的方法并收集数据;第三是整理并尽可能清晰地描述数据;第四是分析数据,并做出决策和推断。统计学有着它科学的一面,但也有艺术的一面。对于同样的数据,由于背景和目标不同可以有多种分析的方法,需要根据问题的实际背景选择合适的方法。也就是统计的方法没有简单的理论意义上的对和错,只有好和不好。 统计在收集数据和运用数据做出推断等方面吸收了概率的主要成果和主要方法,产生了以抽样为特征的数学与概率论的统计学。数理统计学是运用统计的方法来研究随机现象、从而描述随机现象总体趋势的数学模型,它不会把注意力停留在个别的现象特征上,而是了解大量随机现象的总体的变化趋势,并由此得出随机现象的基本统计规律,进而得到关于社会发展、科学发现的统计预测。
最后,我们再概括地分析一下统计与概率的关系。实际上,众所周知,统计与概率都是研究随机现象的学科。“不论怎么说,机遇(或说偶然性)无所不在,机遇伴随着人的一生(当然随人的情况而有异),这是一个无法回避的现实”。统计与概率正是从不同的角度来研究怎样更好的刻画随机现象,统计主要侧重于从数据来刻画随机,概率则主要侧重于建立理论模型来刻画随机。另一方面,概率为统计提供了理论基础。在运用样本估计总体的过程中,抽样的合理性、样本推断总体的合理性,包括犯错误的风险,都需要概率的知识来提供科学依据(这在下文还要论述)。“‘机遇(机会)的数学’,它包含数学中的两个学科分支——概率论和数理统计学。概括来说就是,前者属于机遇数量化的理论基础。而后者则是其应用。” 四、统计与概率课程的教育价值 由上一段内容我们可以看出,统计的关键是客观地提炼和表述现实世界中广泛存在的随机信息,准确地分析并把握随机信息中的关键因素的规律性,科学地应用数据并做出正确决策是统计与概率的主要任务,而这也构成了大学阶段学习统计与概率的重要原因。具体来说,学习统计与概率的主要目的是让学生适应现代社会的需要;帮助学生形成和运用数据进行推断的思考方式;有助于学生朝着数学思考、解决问题、情感态度等多方面的发展。/
在以信息和技术为基础的现代社会里,生活中充满着大量的数据和随机现象,各种信息量以成倍地速度增长,这时就需要人们面对它们做出合理的决策。事实上,每个人每天都会遇到许多需要判断和推理的事情。总之,生活已先于数学课程将统计与概率推到了学生的面前,统计与概率的思想已渗入人们日常生活和社会生活的方方面面。 许多的例子表明,随着计算机等信息技术的飞速发展,数据日益成为一种重要的信息,21世纪的公民面临着更多的机会和挑战,常常需要在不确定情境中,根据大量无组织的数据,做出合理的决策,这就需要人们能对纷繁复杂的信息做出恰当的选择与判断,具有一定的收集??处理信息、做出决策的能力,并且能够进行有效的表达与交流。而统计与概率正是通过对数据的收集、整理和分析,来为人们更好的制定决策提供依据和建议。因此,要培养学生具有收集并处理数据、做出恰当的选择和判断的能力,以适应现代社会的发展,就必须将统计与概率的基本思想、方法和知识作为义务教育阶段数学课程的重要组成部分。统计与概率的学习必将为数学与学生的日常生活及其他学科联系起来提供一条自然的途径。
- ?
数据分析:人力资源社会保障统计基础性作用探析,看完长见识了!
Gail
展开
人力资源社会保障统计工作的基础性作用探析 一、人力资源社会保障统计工作内容
统计就业、创业工作信息 人力资源社会保障系统工作中,各级党委、政府切身落实就业、创业工作,通过创新政策、加大援助、提升服务质量等措施促进社会就业,以此作为经济社会发展的优先目标。人力资源社会保障统计工作包括筹集的就业资金额、稳定就业人口、创业人口、城镇失业率等就业信息的统计。 2.统计社会保障信息
人力资源社会保障还包含着社会保障制度的拟定,随着统筹城乡的社会保障制度不断完善,社会保障体系建设也逐步趋于纵深拓本理展,如社会保障待遇以及社会保险的征缴等社会保障政策不断细致化、人性化,而人力资源社会保障统计工作则涵盖了医疗保险、失业保险、工伤保险、生育保险的参保人数、数额以及社会保障资金落到实处的金额、人员等信息,帮助制定更加合理、科学的社会保障政策。 3.统计技术人才资源数据 人力资源社会保障统计的重要一部分数据是对所在范围内人才资源的统计,包括各行业的技术人才数量、社会企业缺乏的相关人才数量以及引进技术人才所需的资金等信息量。
4.统计劳动者合法权益的维护与实施 人力资源社会保障系统有责任维护劳动者的合法权益,因此相关部门应统计各地区范围劳动者权益纠纷、合法权益内容等详细信息,深入调查在权益案件中处理的工资、社会保险,切实维护劳动者的合法权益。 5.统计分析 统计分析是统计工作中最为重要的工作,是指对人力资源社会保障统计、调查得到的数据信息进行文字化,即把大量的统计数据转化成对人力资源社会保障状况的生动反映,形象的体现人力资源社会保障统计对象在不同时期的发展水平、变化水平和相互联系等情况。 二、人力资源社会保障统计工作的基础性作用 1.为就业政策的制定提供了科学依据 (1)根据相关的就业信息数据统计,帮助政府部门出台就业政策提供了科学的决策依据,有效的化解经济形势对就业的不利影响。促进就业的政策措施帮助提高劳动者就业与用人单位经营运转的信心,有力的促进了社会就业局势整体稳定的发展。
(2)健全了就业帮扶机制,有针对性的实施重点群体的帮扶、毕业生储备、就业实习基地以及实训基地的就业帮扶计划,落实高校毕业生、就业困难户、失地失海人员等人员的就业援助措施,实现社会失业零动态的目标。 (3)扎实推进了职业培训工作,帮助企业职工岗位技能提升培训、高校毕业生就业技能培训以及失地失海人员技能培训等基地建设的稳步实施,同时有序的开展创业培训,提高城镇人口的职业技能与职业素质,使得就业人员技能更加专业、管理机构更加规范。 2.完善了社会保障体系 随着《社会保险法》及相关政策的宣传,社会保险征缴范围逐渐扩大,基本上完成了城镇职工“五险”的缴纳,参保缴费工作全面启动,有力的推进了社会经济持续、稳定的发展。而由于城市规划区外的城镇户籍人员也纳入了职工养老保险,更进一步促进了城乡的社会保障制度的健全。 人力资源社会保障统计系统实现了职工社会保障的社会化管理,及时、有效的反映出缴纳社保员工的就业、失业信息,社会保险经办业务可根据监控数据采取防范措施与合理的处理方式,及时处理失业、工伤、养老等社会保障,实现社会保险经办的精确化管理 3.扩大人才队伍的建设 人力资源社会保障统计数据可以反馈社会对不同技术型人才的需求,为政府部门建设教育基地、在线培训系统等培训平台提供了科学的依据,帮助社会培训一批又一批的技术型人才,有效落实了各个层次人才的不同需求。人才培养计划也促使校企合作的不断拓展,帮助学员毕业后直接就业,减少了毕业生盲目从业的概率,为社会、企业、部门提供了高层次、技术专业的领先人才,加快了技能人才队伍建设的步伐。同时扩展海外学员的引进,增加技术上的交流,实现国际人才的合作,通过引智服务助推当地的经济技术的不断发展。
4.维护劳动者合法权益 劳动合同的签署、社会保障金的发放、劳动者工资的追回等直接关系着社会的和谐劳动关系,统计分析的结果可以真实的体现社会保障在这些问题上的处理结果与反响,因此根据统计系统的结果可以有方向的维护劳动者的合法权益,深入基层推进劳动关系的和谐关系,从基层解决劳动关系矛盾纠纷的问题,促进街道协调部门的工作职能。 由于企业的工资分配宏观力度调控较大,根据薪酬调查的深入,便于全面了解所在范围内各企业职工的工资收入状况,并制定合理的市场工资指导价位,为职工的合法权益提供重要保障。
5.人力资源社会保障工作水平不断提高 人力资源社会保障工作依法行使,使法制工作制度更加健全;随着“十二五”规划的执行监控、分析及跟进,进一步加强了人力资源社会保障统计服务的作用;健全工伤保险基金管理的监督机制,快速方便开展社会保障资金的使用审计工作。同时统计工作减少了干部队伍的腐败与作风问题,实现了工作透明制,在党风廉政建设上取得新成效,提高了人力资源社会保障工作水平。
- ?
数据分析全流程(内附案例)
Glenna
展开
(图片来源于网络)
作者:苏格兰折耳喵
来源: 运营喵是怎样炼成的 (yymzylc)
(温馨提示:图片显示毛糙和不清楚,是分辨率过高的缘故,点击图片,即可看到高清大图。 )
本文将对一个案例进行从数据采集、数据清洗、数据分析再到数据可视化的全流程分析,力求条理清晰的展现外部数据分析的强大威力。以下是本文的写作框架:
1 分析背景
1.1 分析原理---为什么选择分析虎嗅网
在现今数据爆炸、信息质量良莠不齐的互联网时代,我们无时无刻不身处在互联网社会化媒体的“信息洪流”之中,因而无可避免的被它上面泛滥的信息所“裹挟”,也就是说,社会化媒体上的信息对现实世界中的每个人都有重大影响,社会化媒体是我们间接了解现实客观世界和主观世界的一面窗户,我们每时每刻都在受到它的影响。
综合上述两类情形,可以得出这样的结论,透过社会化媒体,我们可以观察现实世界:
由此, 社会化媒体是现实主客观世界的一面镜子,而它也会进一步影响人们的行为,如果我们对该领域中的优质媒体所发布的信息进行分析,除了可以了解该领域的发展进程和现状,还可以对该领域的人群行为进行一定程度的预判。
鉴于此种情况,作为互联网从业者的笔者想分析一下互联网行业的一些现状,于是想到了虎嗅网。
虎嗅网创办于2012年5月,是一个聚合优质创新信息与人群的新媒体平台。该平台专注于贡献原创、深度、犀利优质的商业资讯,围绕创新创业的观点进行剖析与交流。虎嗅网 的核心,是关注互联网及传统产业的融合、一系列明星公司(包括公众公司与创业型企业)的起落轨迹、产业潮汐的动力与趋势。
因此,对该平台上的发布内容进行分析,对于研究互联网的发展进程和现状有一定的实际价值。
1.2 本文的分析目的
笔者在本项目中的分析目的主要有4个:
(1)对虎嗅网内容运营方面的若干分析,主要是对发文量、收藏量、评论量等方面的描述性分析;
(2)通过文本分析,对互联网行业的一些人、企业和细分领域进行趣味性的分析;
(3)展现文本挖掘在数据分析领域的实用价值;
(4)将杂芜无序的结构化数据和非结构化数据进行可视化,展现数据之美。
1.3 分析方法---分析工具和分析类型
本文中,笔者使用的数据分析工具如下:
Python3.5.2(编程语言)
Gensim(词向量、主题模型)
Scikit-Learn(聚类和分类)
Keras(深度学习框架)
Tensorflow(深度学习框架)
Jieba(分词和关键词提取)
Excel(可视化)
Seaborn(可视化)
新浪微舆情(情绪语义分析)
Bokeh(可视化)
Gephi(网络可视化)
Plotly(可视化)
使用上述数据分析工具,笔者将进行2类数据分析:第一类是较为传统的、针对数值型数据的描述下统计分析,如阅读量、收藏量等在时间维度上的分布;另一类是本文的重头戏---深层次的文本挖掘,包括关键词提取、文章内容LDA主题模型分析、词向量/关联词分析、DTM模型、ATM模型、词汇分散图和词聚类分析。
2 数据采集和文本预处理
2.1 数据采集
笔者使用爬虫采集了来自虎嗅网主页的文章(并不是全部的文章,但展示在主页的信息是主编精挑细选的,很具代表性),数据采集的时间区间为2012.05~2017.11,共计41,121篇。采集的字段为文章标题、发布时间、收藏量、评论量、正文内容、作者名称、作者自我简介、作者发文量,然后笔者人工提取4个特征,主要是 时间特征 (时点和周几)和 内容长度特征 (标题字数和文章字数),最终得到的数据如下图所示:
2.2 数据预处理
数据分析/挖掘领域有一条金科玉律:“Garbage in, Garbage out”,做好数据预处理,对于取得理想的分析结果来说是至关重要的。本文的数据规整主要是对文本数据进行清洗,处理的条目如下:
(1) 文本分词
要进行文本挖掘,分词是最为关键的一步,它直接影响后续的分析结果。笔者使用jieba来对文本进行分词处理,它有3类分词模式,即全模式、精确模式、搜索引擎模式:
· 精确模式:试图将句子最精确地切开,适合文本分析;
· 全模式:把句子中所有的可以成词的词语都扫描出来, 速度非常快,但是不能解决歧义;
· 搜索引擎模式:在精确模式的基础上,对长词再次切分,提高召回率,适合用于搜索引擎分词。
现以“新浪微舆情专注于社会化大数据的场景化应用”为例,3种分词模式的结果如下:
【全模式】: 新浪/ 微舆情/ 新浪微舆情/ 专注/于/ 社会化/ 大数据/ 社会化大数据/ 的/ 场景化/ 应用
【精确模式】: 新浪微舆情/ 专注/于/ 社会化大数据/ 的/ 场景化/ 应用
【搜索引擎模式】:新浪,微舆情,新浪微舆情,专注,于,社会化,大数据,社会化大数据,的,场景化,应用
为了避免歧义和切出符合预期效果的词汇,笔者采取的是精确(分词)模式。
(2) 去停用词
这里的去停用词包括以下三类:
标点符号:, 。! /、*+-
特殊符号:▲等
无意义的虚词: “the”、“a”、“an”、“that”、“你”、“我”、“他们”、“想要”、“打开”、“可以”等
(3) 去掉高频词、稀有词和计算Bigrams
去掉高频词、稀有词是针对后续的主题模型(LDA、ATM)时使用的,主要是为了排除对区隔主题意义不大的词汇,最终得到类似于停用词的效果。
Bigrams是为了自动探测出文本中的新词,基于词汇之间的共现关系---如果两个词经常一起毗邻出现,那么这两个词可以结合成一个新词,比如“数据”、“产品经理”经常一起出现在不同的段落里,那么,“数据_产品经理”则是二者合成出来的新词,只不过二者之间包含着下划线。
3 描述性分析
该部分中,笔者主要对数值型数据进行描述性的统计分析,它属于较为常规的数据分析,能揭示出一些问题,做到知其然。
3.1 发文数量、评论量和收藏量的变化走势
从下图可以看出,在2012.05~2017.11期间,以季度为单位,主页的发文数量起伏波动不大,在均值1800上下波动,进入2016年后,发文数量有明显提升。
此外,一头(2012年第二季)一尾(2017年第四季)因为没有统计完全,所以发文数量较小。
下图则是该时间段内收藏量和评论量的变化情况,评论量的变化不愠不火,起伏不大,但收藏量一直在攀升中,尤其是在2017年的第二季达到峰值。收藏量在一定程度上反映了文章的干货程度和价值性,读者认为有价值的文章才会去保留和收藏,反复阅读,含英咀华,这说明虎嗅的文章质量在不断提高,或读者的数量在增长。
3.2 发文时间规律分析
笔者从时间维度里提取出“周”和“时段”的信息,也就是开题提到的“人工特征”的提取,现在做文章分布数量的在“周”和“时”上的交叉分析,得到下图:
上图是一个热力图,色块颜色上的由暖到冷表征数值的由大变小。很明显的可以看到,中间有一个颜色很明显的区域,即由“6时~19时”和“周一~周五”围成的矩形,也就是说,发文时间主要集中在工作日的白天。另外,周一到周五期间,6时~7时这个时间段是发文的高峰,说明虎嗅的内容运营人员倾向于在工作日的清晨发布文章,这也符合它的人群定位---TMT领域从业、创业者、投资人,他们中的许多人有晨读的习惯,喜欢在赶地铁、坐公交的过程中阅读虎嗅讯息。发文高峰还有9时-11时这个高峰,是为了提前应对读者午休时间的阅读,还有17时~18时,提前应对读者下班时间的阅读。
3.3 相关性分析
笔者一直很好奇,文章的评论量、收藏量和标题字数、文章字数是否存在统计学意义上的相关性关系。基于此,笔者绘制出能反映上述变量关系的两张图。
首先,笔者做出了标题字数、文章字数和评论量之间的 气泡图 (圆形的气泡被六角星替代,但本质上还是气泡图)。
上图中,横轴是文章字数,纵轴是标题字数,评论数大小由六角星的大小和颜色所反映,颜色越暖,数值越大,五角星越大,数值越大。从这张图可以看出,文章评论量较大的文章,绝大部分分布于由文章字数6000字、标题字数20字所构成的区域内。虎嗅网上的商业资讯文章大都具有原创、深度的特点,文章篇幅中长,意味着能把事情背后的来龙去脉论述清楚,而且标题要能够吸引人,引发读者的大量阅读,合适长度标题和正文篇幅才能做到这一点。
接下来,笔者将收藏量、评论量和标题字数、文章字数绘制成一张3D立体图,X轴和Y轴分别为标题字数和正文字数,Z轴为收藏量和评论量所构成的 平面 ,通过旋转这个3维的Surface图,我们可以发现收藏量、评论量和标题字数、文章字数之间的相关关系。
注意,上图的数值表示和前面几张图一样,颜色上的由暖到冷表示数值的由大到小,通过旋转各维度的截面,可以看到在正文字数5000字以内、标题字数15字左右的收藏量和评论量形成的截面出现“华山式”陡峰,因而这里的收藏量和评论量最大。
3.4 城市提及分析
在这里,笔者通过构建一个包含全国1~5线城市的词表,提取出经过预处理后的文本中的城市名称,根据提及频次的大小,绘制出 一张反映城市提及频次的地理分布地图 , 进而间接地了解各个城市互联网的发展状况(一般城市的提及跟互联网产业、产品和职位信息挂钩,能在一定程度上反映该城市互联网行业的发展态势)。
上图反映的结果比较符合常识,北上深广杭这些一线城市的提及次数最多,它们是互联网行业发展的重镇。值得注意的是,长三角地区的大块区域(长江三角洲城市群,它包含 上海 , 江苏省 的 南京 、 无锡 、 常州 、 苏州 、 南通 、 盐城 、 扬州 、 镇江 、 泰州 , 浙江省 的 杭州 、 宁波 、 嘉兴 、 湖州 、 绍兴 、 金华 、 舟山 、 台州 , 安徽省 的 合肥 、 芜湖 、 马鞍山 、 铜陵 、 安庆 、 滁州 、 池州 、 宣城 )呈现出较高的热度值,直接说明这些城市在虎嗅网各类资讯文章中的提及次数较多,结合国家政策和地区因素,可以这样理解地图中反映的这个事实:
长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。
长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。
接下来,笔者将抽取文本中城市之间的 共现关系 ,也就是城市之间两两同时出现的频率,在一定程度上反映出城市间经济、文化、政策等方面的相关关系,共现频次越高,说明二者之间的联系紧密程度越高,抽取出的结果如下表所示:
将上述结果绘制成如下动态的流向图:
由于虎嗅网上的文章大多涉及创业、政策、商业方面的内容,因而这种城市之间的共现关系反映出城际间在资源、人员或者行业方面的关联关系,本动态图中,主要反映的是北上广深杭(网络中的枢纽节点)之间的相互流动关系和这几个一线城市向中西部城市的单向流动情形。流动量大、交错密集的区域无疑是中国最发达的3个城市群和其他几个新兴的城市群:
京津冀城市群
长江三角洲城市群
珠江三角洲城市群
中原城市群
成渝城市群
长江中游城市群
上面的数据分析是基于数值型数据的描述性分析,接下来,笔者将进行更为深入的文本挖掘。
4 文本挖掘
数据挖掘是从有结构的数据库中鉴别出有效的、新颖的、可能有用的并最终可理解的模式;而文本挖掘(在文本数据库也称为文本数据挖掘或者知识发现)是从大量非结构的数据中提炼出模式,也就是有用的信息或知识的半自动化过程。
本文的文本挖掘部分主要涉及高频词统计/关键词提取/关键词云、文章标题聚类、文章内容聚类、文章内容LDA主题模型分析、词向量/关联词分析、ATM模型、词汇分散图和词聚类分析。
4.1 关键词提取
对于关键词提取,笔者没有采取词频统计的方法,因为词频统计的逻辑是:一个词在文章中出现的次数越多,则它就越重要。因而,笔者采用的是 TF-IDF (termfrequency–inverse document frequency)的关键词提取方法:
它用以评估一字/词对于一个文件集或一个语料库中的其中一份文件的重要程度,字/词的重要性会随着它在文件中出现的次数成正比增加,但同时会随着它在语料库中出现的频率成反比下降。
由此可见,在提取某段文本的关键信息时,关键词提取较词频统计更为可取,能提取出对某段文本具有重要意义的关键词。
下面是笔者利用jieba在经预处理...
- ?
2017大数据、数据分析学习资料合集(含学习路线图)
向雪
展开
给大家整理一下本年度一些优质的文章,根据大数据相关的知识点一个个整理的,整理的内容包括知识点普及、学习书籍、学习路线图、学习笔记、学习资料、学习视频等等。
AI时代就业指南
未来已来:AI时代就业指南
AI时代就业指南:计算机、统计完全零基础,到底能不能学数据分析?
AI时代就业指南:数据科学人才成长之路
AI时代就业指南:Java 程序员如何转行做大数据?
AI时代就业指南:企业在招什么样的大数据工程师?
AI时代就业指南:女生适合做数据分析吗?
AI时代就业指南:数据挖掘工程师成长之路
AI时代就业指南:数学专业,你看不见的前尘似锦
AI时代就业指南:数据挖掘入门与指南
AI时代就业指南:普通程序员如何转向AI方向
AI时代就业指南:作为大数据从业人员,如何写好一份可堪入目的简历?
大数据
【入门】大数据行业如何入门-书籍、工具、案例(问题集锦)
【工具】2017 年你应该学习的编程语言、框架和工具
【资料】史上最全的“大数据”学习资源(上)
【资料】史上最全的“大数据”学习资源(下)
【路线图】大数据工程师学习路线图
【路线图】2017年最全的数据科学学习计划
【就业】2016年数据科学薪酬大盘点
【学习群】数据挖掘-机器学习
数据分析
【入门】数据分析那些事(数据分析师入门必看)
【职业】数据分析与数据挖掘类的职位必备技能
【职业】与大数据相关的工作职位有哪些?
【路线图】数据分析师学习路线图
【路线图】数据科学学习路线图
【书单】数据分析师的必读书单
【学习群】人人都是数据咖
统计学
【书单】统计学入门经典书单
【视频】大数据统计学基础
【学习群】大数据-统计分析
SQL
【文章】实用SQL语句大全
【笔记】SQL学习点滴合集
【视频】13次课了解sql2008的故事
Python
【教程】python快速教程
【文章】python爬虫实战
【文章】Python-pandas技巧系(量化小讲堂)
【路线图】python学习路线图
【路线图】Python大数据学习之路
【资料】python机器学习入门资料梳理
【视频】Python入门:数据分析与数据挖掘
【课程】Python进阶:数据挖掘实战
【学习群】Python数据挖掘-初级
【学习群】Python数据挖掘-高级
R
【文章】R语言知识体系
【文章】怎样学习R(上、下)
【文章】ggplot2绘图入门系列
【文章】R利剑NoSQL系列文章
【文章】R语言常用数据挖掘包
【路线图】R语言学习路线图
【视频】R学习免费学习视频
【课程】R语言入门
【课程】R语言实战
【课程】机器学习与R语言实践
【课程】R语言量化交易
【工具】全球最火的R工具包一网打尽,超过300+工具,还在等什么?
【学习群】R语言数据挖掘-初级
【学习群】R语言数据挖掘-中高级
Hadoop
【文章】Hadoop学习路线图
【文章】RHadoop实践系列文章
【教程】Spark入门实战系列教程
【课程】大数据实战工具Spark
【学习群】大数据-hadoop-spark
数据挖掘/机器学习
【入门】机器学习和数据挖掘推荐书单
【路线图】R语言学习路线图及R数据挖掘包
【路线图】Python数据分析和数据挖掘学习路线图
【路线图】机器学习路线图
【资料】近200篇机器学习&深度学习资料
【学习群】大数据-机器学习
因文本问题无法嵌入链接,请复制http://ppvke/Blog/archives/27665 至浏览器查看原文
- ?
互联网数据分析入门:流量分析
吉飞绿
展开
当今时代信息化产业飞速发展,各类底层大数据平台百花齐放,亿级数据、秒级响应已经不再是当年的遥不可及的神话。然而对于企业来说,数据计算快仅仅是满足企业进行业务数据分析的硬件基础,如何发掘这些海量的数据产生应用价值,走好数据分析这最后一公里,引导企业进行战略决策却是至关重要的一步。
本文以互联网行业为数据业务分析背景,希望能跟大家交流一些数据分析方面的心得和体验。
——本文使用数据分析工具为FineBI 商业智能工具
数据分析的本质其实是做数据对比分析,没有数据对比,单一的指标统计往往难以发挥数据价值。像我们常见的数据对比分析方法有同比、环比、占比等一系列分析指标,那是不是所有的数据业务场景都可以直接进行套用分析呢?比如我们统计企业2018年1月29日的同比流量,是不是可以直接对比2017年1月29日?表面上看好像2017年1月29日确实就是2018年1月29日时间层面上的同比日期,但是我们仔细对比查看这两个日期会发现2018年1月29日是周一,2017年1月29日确是周日。对于很多行业的企业来说,非工作日和工作日的数据往往是有很大差异的,这个时候单纯从日期层面来进行对比其实是没有什么意义的,选择对比同是周一的2017年1月30日的流量数据进行同比计算可能会更加有价值。
目前互联网行业做搜索引擎的有Google、百度,做综合门户的雅虎、新浪,做即时通讯的主要是腾讯,电子商务方面的主要是阿里、京东、亚马逊等。不论是以上的哪家互联网企业,往往都需要有一套引流、转化、消费、留存方面的运营策略,平台的流量数据分析往往都是非常重要的。
互联网流量数据分析方面,总结主要有如下四种数据常用分析方法:
1.对比分析流量规律,针对时段进行企业服务以及推广活动调整;
2.对比分析结构占比,指导进行定向群体营销推广
3.对比分析异常情况,及时追责并且进行调整;
4.对比追踪活动流量变化,总结活动效果经验以便后续有针对性调整。
如上图所示,我们通过FineBI工具制作出以上的流量数据分析模板,接下来尝试着对数据做一些对比分析。
一、用户浏览量周分布
对于互联网企业来说,流量数据往往都会呈工作周相关。对此,我们可以先宏观地统计出周一到周日中的总的平台流量柱状图数据对比情况。首先我们可以仔细观察工作日和非工作日的数据,发现周末的平台流量较工作日流量要高,这在互联网行业来说都是一个比较普遍的现象。
用户流量的周分布规律之后,我们就大致有一个推广方向,周末休息时间用户群体较大,相较于工作日可以投入更多的和丰富有吸引力推广活动来进行新用户引流和老用户活跃。
接着我们可以进行下一步思考,那工作日和周末我们的活动推广时间如何制定?有的同学们可能会觉得全天活动都可以,不需要关注具体的活动时间。但是对于互联网行业来说,每个时间段的推广费用都是较为昂贵的,我们完全可以分析出工作日和周末的用户流量趋势,进行有针对性的时间段投入推广,通过更小的成本获取到更多的用户流入。
首先是工作日的时间段流量统计分布,我们通过BI工具分时间段作图得到如下所示的流量分布图。可以看出,工作日的流量主要集成在每日的9点(上班时间)、13点(午餐时间)、20点(晚间娱乐休息时间),那么在得到这样的一些用户流量规律之后,便可以在这些用户活跃高峰期时间段有针对性对白领群体多做一些相关商品推广活动,以实现最小时间成本和推广费用最大化用户引流效果。
再来看周末的各时间段流量分布走势,和工作日所不同的是,周末的流量早高峰期延后到了10点,这可能和各位小伙伴们周日作息较晚有关(同学们周末都是几点起床呢),除此之外,晚上的流量高峰退潮期也有延后。针对与周末用户流量分布的特性,互联网企业在周末时可以将活动开始时间和活动结束时间都适当进行延后,这个时候不能再套用工作日制定好的活动时间计划了,因为符合用户群体作息规律的推广促销活动才能达到更好的效果。
二、推广渠道流量分布
对于互联网行业的推广渠道分布主要分为三级渠道:线上渠道、线下渠道、新媒体营销等等。对比分析每个渠道对企业所带来的价值占比差异,以指导制定有针对性营销策略。
如上图所示,由于推广渠道是分多层级的,我们通过BI工具的多层饼图进行数据的分析统计再合适不过了。分析下图的数据我们可以看出,首先是一级渠道的主要战斗力来自于新媒体营销,当今的微信、今日头条等社交媒介社区时代受众广泛,用户群体非常庞大,是公司需要投入主要成本进行推广的。其次线上渠道的效果也不容忽视,对于互联网企业来说,做好百度、Google等SEO搜索引擎关键词推广也是很重要的一部分工作。相较于线上渠道和新媒体营销,线下渠道说所需要的经费和时间、人力成本较大,受众又相对较小,所以此类活动往往针对核心粉丝进行运营即可。
三、各月份指标对比走势
在分析各月份指标对比走势数据之前,先简单介绍下互联网营销常用的几个指标概念:
1.浏览量(pv)
2.访问次数(visits)
3.访客数(uv)
以上三个基础指标常用来衡量流量数据的多少。另外平均访问深度(总浏览量/访问次数)、平均停留时间(总停留时间/总浏览量)、跳失率(跳出次数/访问次数),这三个指标通常可用于衡量流量指标的优劣性。
我们仔细分析上图中的平台流量指标,可以发现10月份是2017全年的流量高峰期,应该跟企业在国庆黄金假期所做的促销引流活动有关。浏览量、跳失次数、访问次数分别为4941、1290、2182,对比计算可得到跳失率为59.12%,明显低于其他时间段的跳失率,说明10月份的活动效果还不错,其经验对以后的营销推广可以起到参考作用。
最后是访问深度用户群体分布分析(跳失率=跳出次数/访问次数),我们通过BI工具将企业的VIP用户、老用户、新用户分别进行分时间段的用户群体访问深度分析统计。总体来说可以发现平台的VIP用户访问深度较老用户以及新用户稍微高些,但是不是太明显,说明平台运营的VIP这部分群体的活跃度还有待提升。同时,平台老用户访问深度和新用户更是相差无几,公司对于用户这方面的活跃运营明显需要加油了,建议将平台的部分忠诚度较高的老用户以VIP用户组建起来,共建平台生态圈,增加整体的用户活跃度。同时可以向老用户以及VIP用户实施一些优惠政策,如定向商品折扣、根据用户画像进行喜好商品特惠推送等。
本次的数据分析经验心得分享暂时先写到这里,后续将继续给大家分享关于互联网数据运营方法的转化、消费、留存等方面的一些经验,欢迎大家一起共同交流探讨互联网运营之道。
- ?
不懂计算机,不懂统计学,作为零基础的人,怎么自学数据分析?
Ziva
展开
没有计算机基础,没有编程基础的人,该怎么学习数据分析,第一步要做到什么,然后应该做什么?怎么一步一步自学?先打哪些基础?很多人都在了解数据分析的时候,都会这么说。数据分析一定要统计学,编程基础吗?
数据分析如何开始?
我最早做数据分析是从网站统计开始的,从CNZZ到Google Analytics都有用过。我们能够这些地方知道什么呢?网站流量,用户情况,行为统计等等。以GoogleAnalytics为例,以下是我一个网站的流量图:
从这个图里面,我们可以看出什么呢?用户数有多少,每个用户访问几个网页,每个用户停留多长时间,跳出率有多高等等。
如果你是第一次看到这种图,那你肯定是一头雾水,WTF?什么是跳出率?什么是平均会话时长?
这也是开始学习的过程,接触到陌生概念,就去了解,不要因为一个概念不懂就停止学习。
经过一段时间的了解,我们学会了各个名词是什么意思,例如我们发现跳出率太高了,那么就证明网站存在某些问题,导致了用户很容易流失。那么我们就进一步, 查看用户的行为数据,例如热点图,点击图等等,分析是什么地方导致了这个问题。
PS:图上这个跳出率算是很低了,还不错。
这个图是流量获取概览图,我们可以通过这个图来了解流量是从哪来的,这也能帮助我们做流量的优化甚至引流的工作。
不要嫌网站统计显得low,基础数据分析都是从这个开始的。
接下来可以着手去搞一些自己感兴趣的数据,当然,这可能需要学习爬虫知识,一些数据库的知识。
你可以爬歌词,看大家在唱什么,也可以把公司的订单倒入,看订单有什么规律,还可以把女朋友的微博全部拿出来,看她到底对什么感兴趣。
这些,其实都是数据分析的应用,从简单的,基础的,自己感兴趣的开始。
- ?
数据分析:浅谈统计学在生活中的应用,看完长见识了!
闻梦呓
展开
浅谈统计学在生活中的应用
统计学并不是一门独立存在的学科,它是以数学知识和数理统计作为基础,将数理统计方法和其他学科专业知识交叉融合形成的具有极强推断性的一种分析方法。现阶段,随着科学技术的快速发展,为了加强对自然社会各个领域现象的判断和整理能力,将统计学应用在生活各个方面已经成为现阶段的数理统计的一种便捷方法。
一、统计学的概念 统计学指的是调研人员通过一些列的手段对整理出来的数据信息进行整理分析,从而推断出调研对象本质,甚至可以对未来的类似事情进行预判的一门综合性学科。在进行统计学整体分析的过程中需要用到大量的数学知识以及其他相关学科的专业知识,统计学由于其自身独特的性质,在社会科学和自然科学的各个领域几乎都可以使用。 二、统计学在生活中的应用分析 (一)统计学在经济学中的重要应用 运用统计学对生活中的数据信息进行整理分析,首先要学习统计学的基础知识以及数据统计个分析等学科,这些基础知识和方法都是在开展统计学应用活动之前调研人员所必须掌握的。统计学课程的学习作为经济学学科当中的重要分支,在经济学课程中经常被应用,例如,经济学的计量统计就需要根据统计学在金融里面的重要意义和地位作为基础,将金融知识和统计学知识相结合,将金融计量和时间的序列进行结合,对收集到的金融数据进行整理分析,最后得出金融计量和时间序列的一定关系。 统计学在金融经济学中有着十分重要的工具性作用,主要包括两个方面,分别是:在思想上而言,统计学是对数据统计分析结果进行研究,最后得出研究对象的判断结果,为了保证研究结果的准确可靠性,统计学在进行数据整理分析过程中必须是带着严谨的科学态度,这种严谨的科学态度对于经济学的相关理论分析具有十分重要的指导地位,这是由于研究人员在对金融量进行数学分析的过程中,为了保证金融数学分析结果的准确可靠性就必须保证金融量数据收集分析等预处理过程是科学合理的;其本收集整理次,统计学是经济学进行科学试验研究最优化的选择,经济试验研究活动的多样性以及研究对象之间错综复杂的关系导致经济学的试验研究活动受到诸多限制,运用统计学进行经济学试验研究活动,使得经济学实验研究的对象变得简洁明了,降低试验研究的成本支出。从统计学在经济学中的应用我们可以看出,经济学当中的统计学应用主要是运用了统计学当中经济必然性的思想,使得经济学当中的统计结论不具备复杂的思想成本。
(二)统计学在医学中的重要应用 统计学在医学中应用的主要原因就是生物医学中存在的不确定性和变异性。生物医学主要的研究目标就是与人体健康相关的不确定因素,也就是通常所说的医学变异现象,变异现象在生物体当中是普遍存在的,例如,对于外在条件基本相同的两个病人,在相同的条件下进行治疗时,却有可能出现有的病人被治愈,有的病人治疗效果不明显,甚至还会出现死亡的现象。造成这些外在条件相同的生命体却出现不同程度治愈的主要原因就是生物医学中存在的不确定性或者是人体中存在的错综复杂的随机因素,客观差异存在的原因是因为某种偶然性的潜在的揭露必然性的发现。 在医学临床统计中发现,对于同一种病因的客观性规律进行调查,对于健康人的共同作用的交织与疗效的考查的病人很少。在医学当中运用统计学最主要的就是通过观察不同疗效病人的医疗诊断效果,将实际的医学诊断治疗效果与医学理论和假设进行验证,运用概率论以及数学方法对对比结果进行分析、判断,运用电子计算机等相关软件设备对研究对象的指标进行记录,并绘制相应的图表等,通过综合运用多种数理统计方法,得出与研究对象相关的研究结果。将统计学应用到医学当中,可以促进统计方法和多变量分析法在医学试验研究中的应用,对未知病因所造成的医疗诊断事故进行分析,可以促进医疗诊治手段的不断创新發展。
(三)统计学在体育比赛中竞技指标的应用。 统计学在体育比赛中的应用主要是用统计的职业联赛的数字反应比赛队伍能否成为世界顶级,这是因为在体育比赛中应用统计学可以对比赛中的胜率进行分析,主要是将每个队员在每个赛季比赛的分数和常规赛场上的分数进行统计,通过一系列的数学计算分析,制定出每个队员得分平均值和标准差之间的正态分布图,通过正态分布图的稳定性来判断队员的技术稳定性。以众所周的NBA篮球比赛为例,NBA比赛中由于明星球员众多,在运用统计学进行数据整体分析时,需要依据本质上的规律进行数据统计,而不是随意的选择数据进行统计,例如在进行篮球比赛发球这一项双方队员的进攻和防守的概率时,在进行指标选择时就涉及到随机事件的发生概率,因此,可以运用统计学统计球员在每一场比赛上的均得分,通过这些数据指标的正态分布图来确定球员的技术稳定性。 三、结束语 在日常生活中应用统计学对数据进行管理分析,可以极大提高生产生活中对研究对象的管理效率,使得研究对象变得明确,降低管理成本。在实际的生产生活中应用统计学时,调研人员需要通过多次的试验和随机概率对比来确定事件发生的概率,通过定量定性的数理统计分析工作,充分发挥统计学对生产生活的促进作用。
- ?
数据分析怎么学习,要学习什么内容?数据分析学习路线
缪鸣凤
展开
就数据分析学习而言,需要的技能模块有统计基础+数据库知识+编程能力。其以后的的职业发展方向,一个是业务层面的方向,一个是数据挖掘层面的方向。今天科多大数据和你们一起来谈谈关于数据分析的学习。
1.统计基础
理工科的学生在本科阶段学习过概率论与数理统计,单从做数据分析的角度已经够用。其他方面,可以根据需要查看相关书籍,随时进行查漏补缺即可。个人推荐《深入浅出统计学》,可以让统计理论的学习有趣又自然。
2.数据库知识
关系型数据库很重要。在学习数据分析的初期甚至很长一段时间,你接触到的数据都存储在关系型数据库中,需要学习SQL语言进行数据查询。关于SQL语言,强力推荐《SQL必知必会》,整本书通俗易懂,是学习SQL语言的不二之选。
学习数据库的本质就是在学习一种与数据打交道的逻辑思维与能力。编程中的很多思想都和关系型数据库、SQL相通,比如:SQL中对data进行group by的操作,这个在Excel里类似于透视表,在Python/R中也有相应的group function去处理数据。甚至在以后的进阶过程,你会接触到分布式数据库和所对应的no-SQL语句。
3.编程能力
Excel。 透视表(Pivot Table)是做数据分析的必备技能。透视表可以帮你迅速汇总数据,看到各类型数据的直观特征就像是让你站在更高的视角看待数据。作为进阶,Excel自带的函数、各种插件,以及VBA也是很好的工具。
Python。当数据量大到用Excel打开都要很久或者我们想进步提升能力时,需要学些hardcore技能,即用编程语言做数据分析。这里主要有R和Python两大流派。个人推荐Python,一是代码简单易懂,容易上手;二是学习资料多,降低学习成本。推荐《利用Python进行数据分析》,涵盖了利用Python做数据清洗,数据可视化及分析的技能点,可以作为一本工具书随时查阅。
Python 是目前科多大数据分析课程里面非常重要的一项内容,下面这张图更能直观反映学习内容
当然需要特别指出,数据分析课程学习内容肯定不止python这一项内容,还包括数据分析基础,互联网电子商务、经济学基础,数据产品(可视化报表)等各个板块的学习。
- ?
数据分析初学者应该怎么学?数据分析入门学习路线分享
闾丘翠
展开
针对想要自学数据分析的小伙伴们,科多大数据给大家分享一位数据分析小白的自学之路。
作为数据分析的小白初学者,在开始正式学数据分析前,肯定都想先看看别人学习的经验。我的大概情况是,目前研二通信专业,本科专业测控,由于种种原因,对数据分析比较感兴趣,于是开始了独自摸索过程,这里总结我自学数据分析2个多月的经历。希望能给后面的初学者带来一些启发。
一、数据分析师的方向
先选择了正确的方向,再朝着这个方向努力是学习一个新领域的正确姿势,因此开始正式学习前,我首先查阅了大量资料,了解数据分析分为哪些方向,并明确自己想往哪个方向走。
1.数据分析的方向分类
数据分析可分为两类:一种偏向产品和运营,更加注重业务,主要工作包括日常业务的异常监控、客户和市场研究、参与产品开发、建立数据模型提升运营效率等;另一种则更注重数据挖掘技术,门槛较高,需要扎实的算法能力和代码能力。(总结了@路人甲大神的说法)
2.数据分析的行业分类
1)互联网行业是数据分析应用最广的行业,是数据分析师理想的成长平台。
2)其次是咨询公司。相对来说,数据分析师在咨询公司成长的速度更快,专业也会更全面。3)再次是
3)金融行业,比如银行和证券等行业,该行业对数据分析的依赖需求,越来越大。4)最后是
4)电信行业,(移动、联通和电信),它们拥有海量的数据,在严峻的竞争下,也越来越重视数据分析,但进入这些公司的门槛比较高。
3.确定自己的方向 由上可知数据分析大致分为两类:偏重业务和偏技术路线的,明显偏技术路线是很难速成的,鉴于我今年9月份要开始校招找工作,且自己对产品向很感兴趣,因而我选择了更偏向业务的数据分析。此外,自己最感兴趣的行业是互联网。
基于以上确定了我的最理想职位:互联网公司的偏向业务的数据分析。
此外,为了了解公司对该职位的最新要求,招聘数据分析实习生的互联网公司我都进行了网申,我知道以自己两个月所学还不能满足职位要求,只是为了做了一下笔试题,从而了解公司的数据分析到底偏重哪些技能,并进行有针对性的了解相应的知识。(目前我做过了阿里、京东、美团的数据分析实习生的笔试题,觉得这是个了解公司数据分析岗位最新要求的有效方法)
二.我是如何学习的?
结合公司的招聘要求,我是按照以下几个部分进行学习的:
1.统计学学习。
统计学是数据分析的基础,因而我选择从这个开始学习。
已有基础:大学我学过概率论统计学这门课,学的还不错。
看完书籍:《深入浅出统计学》、《从零进阶!数据分析的统计基础》
花费时间:共计11天每天上午3个小时,一共33个小时。
推荐书籍:《从零进阶!数据分析的统计基础》
推荐理由:
前面很多高赞答案推荐《深入浅出统计学》,因而开始的时候我选用的这本,已将整本书看完,感觉重点不够突出,太过啰嗦以至于浪费时间,逻辑不是很连贯,尤其是假设检验那一章写的太绕了,后来又入手看完了《从零进阶!数据分析的统计基础》这本书,这本书每一节有相应的少量习题和配套答案可巩固,逻辑和重点都非常清晰,有了对比之后,强烈建议和我一样的小白初学者使用《从零进阶!数据分析的统计基础》这本书!
知识巩固:每看完一章,我都会进行总结梳理一章的内容,这样可以让知识结构化;此外,由于统计学有很多概念,都很生涩,为了加深印象,我列出了很多诸如置信水平、区间估计、假设检验、P值等概念,做成了几张图片,偶尔就给同学发过去,让她随机挑选一个,然后我再用通俗的语言给她解释下这个是什么东西。(这样做的好处既能加深自己的印象,又能模拟面试官的提问。一举两得。)
2. EXEL看完书籍:《谁说菜鸟不会数据分析》
共计时间:这个相对来说不怎么耗费脑子,而且鼓捣图表比较好玩,很有成就感。因而我是每天吃完下午饭后进行学习Excel,因为这个时候我的学习效率相对较低(比较高效的时间段,我用来学习Python)。EXcel学习共计13天,每天晚上7点到9点2个小时,共计26个小时。
读完感受:这本书不错,内容比较详细,且书中介绍了数据分析的一些常见方法,并重点介绍了EXEL的数据透视表,函数,各类图表适用场景及如何制作的内容,自己感觉比较适合我们初学者,可以先根据这本书学习EXEL。
巩固提升:由于菜鸟这本书对函数部分设计的比较少,所以我又跟着大神的专栏进行了学习,感觉这几篇文章整理的很好,所以在此列出。
第一篇数据分析—函数篇。主要简单讲解常用的函数,以及与之对应的SQL/Python函数。第二篇数据分析—技巧篇。主要简单讲解很有新价比的功能,提高工作效率。第三篇数据分析—实战篇。主要将前两篇的内容以实战方式进行,简单地进行了一次数据分析。数据源采用了真实的爬虫数据,是5000行数据分析师岗位数据。
碎片化学习
3.数据库
数据库基础
学习网站:基础知识我是跟着最多人推荐的这个网站学习的:SQL教程_w3cschool
个人感觉:这个教程条理清晰,比较适合我们小白初学者。
共计时间:查看了我的时间表,算了一下数据库基础知识部分,我一共花了30个小时
左右,感觉数据库还是比较容易上手的,不是很难,所以你们不要怕哈~
刷题:基础教程学完后,我用了这两套题刷题:
SQL练习题及答案(连接写法)
SQL练习题及答案(多次子查询)
因为基础知识跟着网站学习的时候,我学的比较粗糙,刷题才发现有很多知识漏点,所以又返回去查缺补漏,因而刷题时间耗费的时间很长,用了大概20多个小时。
强烈建议:学完数据库基础知识后一定要刷至少一套题,刷完后你会发现对数据库的理解深入了很多,然后那几天我睡觉的时候满脑子都是select......
4.业务学习
推荐书籍:《精益数据分析》、《增长黑客》、《数据挖掘与数据化运营实战,思路、方法、技巧与应用》
个人感觉:学习一样新东西,不断感受它的有趣性才是持久性动力。所以我一般是看Python代码看烦了的时候,就会看一下这三本书,感受一下数据对运营和用户的作用,真的很有趣。由于都是利用这些碎时间看的,所以这三本书目前还没看完,但就目前所看,我觉得都很好,尤其是增长黑客附录里给了一些数据常用指标,很有用。至于《深入浅出数据分析》这本书,我看了两章之后放弃了,还是觉得太啰嗦了(仅是个人见解),因而没有读下去,可能我不太适合这种从大量言语中找重点的书籍。
碎片化学习:要了解公司是如何运营,产品是如何开发的,这些需要不断地积累和广泛的阅读。所以我利用自己玩手机的时间来训练这些思维,我关注了“互联网周刊”、“人人都是产品经理”、“逻辑思维”
这几个微信公众号(我认为这几个都很不错) ,偶尔在不想学习,玩手机的时候会看一下这几个的推送文章,但不是看完就算了,比如“人人都是产品经理”前一段时间推了一篇文章《美团和滴滴的战争,饿了么如何选择?》,我会先尝试着思考一下自己的答案,然后再看下文章里传达的看法,看完之后我会再试着从多角度去思考这个问题,并在去食堂吃饭的路上和同学讨论下这个问题,阐述下自己的看法。(真的觉得向别人讲述才是成长的最大利器!)
此外,我关注了喜马拉雅FM听书电台APP的PMCAFF产品社区专辑,这里面是每天解答一个围绕关于产品和运营的小问题,我列几个我有印象的:“微信消息为什么没有已读未读的提示?”、“微信和支付宝为什么一直没有加入启动页广告呢?”、“继短视频后,下一个流量风口会是什么?”,每个都很简短,只有3分钟到4分钟左右,非常简短又有趣,每天晚上睡觉前,趟床上睡不着的时候,我会选择听一个,感觉对我关于产品和运营的认识有很大提高。
5.Python学习
使用工具:Anaconda+Pycharm(或者Spyder也很好用)
如果还没有开始Python工具下载的初学者,切记不要直接装Python,推荐直接装Anaconda搭建起来的科学环境要方便很多。建议安装Anaconda+Pycharm来学习Python,尤其是对于学习数据分析的同学。(多次入坑的血泪之谈,避免很多麻烦啊!)
安装教程:和大多初学者一样,我在纠结于安装什么样的IDE,以及怎样安装上浪费了很长时间,终于安装成功。这其中差点在安装过程的繁琐中就放弃了学习,因而我写下了我的安装过程,非常详细,细致到了每一步安装过程的截图,希望能让后面的初学者不在安装上面浪费时间。
Python学习之工具准备——Anaconda+Pycharm的安装过程
学习网站:廖雪峰的Python3教程
学完感受:觉得整体都很好,比较适合我们小白学习,但是个别知识不够结构化,比如列表、元祖、字典、集合这几个知识点太分散了,我觉得放在一起学习讲述它们的联系与区别比较好。刚学完这几个,我全都混淆了,所以立马搜索了一下这几个相关知识,发现有人网上有博主总结的很好,立马清晰了很多。所以,这里我想说,不要单一靠一个学习资源(但前提是只以一个为主),遇到没搞懂的,立马百度补充。
进阶补充:由于数据分析需要熟悉Numpy、Pandas、Scrip、Matplotlib等常用的包,而廖老师的网站中缺乏这部分的内容,所以学完基础Python后,包的学习我是跟着一个视频学习的,目前刚进入这阶段的学习,所以无法提供什么有效信息,待我学完这部分,我再来评价吧。
6.基础算法和图表可视化
这两部分目前也还没开始学习,所以也无法提供有效信息。
三.最后的建议
1.时间管理
为了敦促自己的学习,我做了一个Excel时间管理表,其中包含了周计划和月计划,并记录了每天的进程,我觉得这个方法对我来说很有效,所以推荐给你们。
2. 碎片化学习
Python、统计学之类的还是要系统化学习,毕竟让我在等公交的时间看一个Python代码或者算一个概率题,我可能想打人!!。 但运营和产品等业务知识,还是可以利用我们的零碎时间来不断积累,其实只要将平时刷娱乐新闻的时间换成互联网消息就可以了,习惯了之后会发现,这些知识真的更有趣!
作为一个小白,讲述了自己这两个多月的学习历程,可能会有错误,仅供参考,非常感谢!
数据分析的统计基础
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并