- ?
EXCEL如何做一份让领导眼前一亮的数据分析报表?
Hayle
展开
浏览器版本过低,暂不支持视频播放施老师:
在平常的办公中,经常有学员问我,怎样做一份让领导眼前一亮的数据分析报表,而且是自动的。下面就由宁双学好网施老师来教你。
一、首先打出一份员工产量统计表
二、然后把员工姓名复制一行到下面的位置,右边打好筛选月份,
三、然后在下方输入公式:=VLOOKUP($J$2,$B$2:$G$8,COLUMN()-1,0),鼠标往右拉,得出员工一月份的产量,然扣右边用【数据】- 【数据有效性】算出筛选月份的序列。
四、然后点击插入菜单【图表】-【柱型图】,选择下方的一月,就自动生成柱型图表
五、将图表的底纹填充好看一些
最后我们可以点击筛选月份,点击什么月份就会出现该月份的柱型数据。是不是很方便啊。
- ?
通过基础数据进行数据分析的实例
白寒
展开
国产〇〇柒
前几天朋友给了一组行业同行表现数据,让帮忙分析一下自己的店铺问题所在和表现如何。今天我通过这个小示例来跟大家简单分享一下一些基础的分析方法。
(开始之前先跟小伙伴们说明一下,本案例是一个简单的基于一组数据而进行的分析,并通过这个给大家一个相对比较概括的方法介绍,实际分析操作中会遇到更复杂的情况,而且实际分析中的挖掘深度要比本案例要深)
下边是朋友提供的一组数据:
图片:基础数据表01.png
为了保护隐私避免侵权,公司名称这里就以字母替代
通过上图我们可以看到这是几组非常简单的数据,这些数据我们都可以在自己的店铺采集到,但是我们也可以看到这组数据有一个问题,多数数据缺乏一个时间参数,从表格中我们只能看到最后两项有一个准确的时间界定,其他项数据均没有这个界定。不过这里我们采用对比模糊分析的方法,不用考虑数据是否精确,只需要进行对比即可,所以缺乏时间参数问题也不太大。接下来我们通过以下几个步骤进行分析。
一,做筛选
首先我们要对这些数据进行筛选,只留可对比的数据组,剔除无用的数据。方法很简单,这里我们通过公司名称进行检测,进行主营产品类目检查(这里我是以朋友公司产品类目对基础的),通过分析发现C、G、M三个公司的产品与其他不符,这里我们就直接剔除这三家的数据不做参考。
整理后的数据如图:
图片:整理后的数据02.png
(再更复杂的分析中,剔除噪音数据并非这么简单,这里是用这个简单的方式说明一下这个操作步骤,大家在操作中要根据自己实际情况进行数据甄别,甄别的过程是非常复杂和繁琐的,如果这一步出错,做出的分析结果的准确性就很难得到保障)
二,做归类
无用的数据剔除之后,接下来我们就是要对现有的数据进行归类处理。
通过图表数据的阅读,我们可以把里面的数据简单的归为三类:交易数据、回复率、行为数据。交易数据这里主要就是包含前三项,一达通和信保;回复率就是询盘回复率的表现数据;行为数据这里主要是指人的行为,访客和季度、月询盘数。归类后如图:
图片:归类后的数据03.png
这三类数据是有区别的,交易数据和回复率我们可以统一称之为“操作数据”或“加权数据”,因为这些数据的控制权基本掌握在我们手里,我们在这部分数据的积累上有较大的主动权。行为数据可以称之为“结果数据”,这部分数据的直接控制权来自于客户行为,我们无法直接去干预,我们只能通过提升“操作数据”的方法去影响这个“结果数据”。我们之前的操作都是为了这个“结果数据”有较好的表现。
数据归类之后,我们开始分析
三,做分析
由于上面拿到的三类数据有两类属于“操作数据”,这两类对“结果数据”只能产生部分影响,这里我们就不关注这两项数据了(在全局分析中,这些局部数据都可以作为一个参数加入到分析的行列)。这里我们只关注结果数据。这里的结果数据中虽然有三组数据,由于其中一项数据缺少时间参数,所以我们可以把三项数据当作两项去分析,季度和月询盘量可以当作一个有效参数,这个时候我们就把数据优化成两类:访客和询盘。当看到这两个数据的时候我们很简单的就会联想到由他们而衍生出来的一个数据:“转化率”,这个数据能够比较真实的反馈平台效果。接下来我们计算出每一组的“转化率”数据如图(按照月度参数计算):
图片:转化率04.png
从上图可以看出“转化率”排名如下:
H > K > P > A = F > B > D = E > I = O > J > L >N
当然,转化率高并不代表代表一个店铺的表现就是第一名,这个数据只能判断该店铺引流的精准程度(当然如果需要更深入的分析精准度是需要深入到询盘质量和成交转化中去的,这里不做过多介绍)。我们可以观察一下N店铺的转化率,0.43%的数据与其他店铺相比较差距较大,该店铺的访客流量占据第一位,但是反馈数据在该表中与其他几家并列最后一名,该店铺就需要认真的分析访客来源和未转化的原因(这里就牵扯到了其他数据的数据分析,这里不多介绍)。
当然,从数据组中我们一共可以看到这些数据条件,也可以计算出一个数据进行比较。但是这并不太说明什么太多的问题。接下来我们用加入条件的方法来进一步深入分析。这里我加入的数据是店铺的产品”上架产品数量“这个参数。加入数据到图标(实际操作中我们可以加入更多的可参考数据进行数据分析),如图:
图片:加入产品数量条件05.png
从表格中可以看出产品数量过万的有A B J N ,产品数量5000以上的有D I K L O P,产品数量低于5000的有E F H。从阿里规则上来说,店铺产品数量过多,店铺过于臃肿并不太好,但是这并不代表不用去发布产品了,其实我们真正要做到的是产品数量适中,做到全覆盖即可。从以上店铺的产品数量数据表现可以看出来,该行业的产品数量需要大于5000以上,如果低于5000,应该做不到全覆盖,可能会浪费很多流量(这里是从数据表大致得出结论,如要深入分析具体多少产品数量合适,还需要从其他方面进行综合分析)。我们也可以看到低于5000的几个店铺的访客量分别为:4000,7000,9000(里面有P4P引流数据,所以该数据仅作参考,不可作为实际数据参考),这个数据量并不算高,特别是H,访客是最少,产品数量也是最少,但是我们可以发现H的转化率是最高的,我们这里假设,H拥有A的产品数量(覆盖面),保持转化率不变,其他条件随覆盖面递增,这个时候我们可以看到H的数据应该是这样的,如图:
图片:修改数据后转化询盘06.png
当然这是一个理想的假设状态,覆盖,访客,转化这些数据都是的动态的,越是大的数据体量对转化率的控制难度越大,但是不可否认的是,如果产品覆盖能够达到一定程度的话,对访客和询盘转化肯定是有益处的,示例中虽然达不到492条的完美状态,但是询盘数量增加2倍应该还是有保障的。从这些数据的表现我们也可以看到覆盖的重要性(其实覆盖是一个很复杂的事情,并不是咱们想象的那种把产品和关键词上传上去就完事儿的事情,有时间可以跟大家深入交流关于覆盖的问题)。其实这些数据中还有很多可以对比解读的地方,我们今天先这里,以覆盖落幕。
- ?
做好数据分析必备的5种典型可视化图表|技能卡片No.1
天曼
展开
文/GrowingIO
发布于2天前
阅读1524
评论0
喜欢0
标签:
产品经理
数据分析
单图 | 最基础的可视化数据分析工具
对产品和运营来说,和数据打交道成了日常。总结下来,你的需求具体是什么呢?
1. 数据监控
每次听到老板说,今天浏览量掉了很多。你就心头一紧,老板都知道了你还不知道?
老板:不应该。
产品和运营一定要对网站每天的 PV、UV 等总体数据有一个直观的把握,包括它们的数值、趋势等。用 GrowingIO 的单图建立图表,能让信息传达更迅速、直观,一旦出现数据过高或过低的情况,就可以马上拆解,及时介入。再也不用等老板来告诉你今天数据又掉了。
2. 数据分析,拆解问题
数据掉了,什么原因呢?你又心头一紧,可能是这届用户不行?
老板:加上「可能」,就是你无能。
当一个总体数据出现异常,比如浏览量突然降低,原因可能有很多,产品本身问题、运营问题等等。这时候就需要对浏览量这一指标进行不同维度的拆解,比如各个访问来源的变化,各个浏览设备的变化等,GrowingIO 的单图提供多种指标和维度,能让你准确定位问题,迅速解决问题。
3. 可视化展示
来,给团队同步一下项目进展。你还是心头一紧,毕竟只有一堆冷冰冰的数字啊。
老板:hmmm,不是很想看。
在集体协作中,你需要将分析结果更友好地展示给其他人,比如写周报、项目进展汇报等。而如何更好地呈现你的分析结果呢?来,接下来我们看图说话
一、趋势图
趋势分析是最基础的图表分析,包括线图、柱状图、堆积图等多种形式。
1. 线图
线图可以观察一个或者多个数据指标连续变化的趋势,也可以根据需要与之前的周期进行同比数据分析。
2. 柱状图 & 堆积图
柱状图可以观察某一事件的变化趋势;还可以同时将整体拆分可以做成堆积图,同时观察到部分所占比重及变化趋势。
产品经理和运营人员通过趋势图分析流量的实时走向,如每日 PV、UV、DAU 等基本数量指标以及停留时长、平均访问页面数等质量指标,可以及时把握产品的变化趋势。一旦趋势周期对比发生异常(异常高和异常低),我们需要及时介入排查原因、解决问题。
二、频数图
根据业务需求对指标按照一定维度拆分,对比不同组别的频数,便于分清轻重缓急。
条形图清晰展示了用户在不同类别上的频数,并且按照数量从大到小排序。上图展示的是某产品用户使用浏览器的频数分布,在资源有限的情况下产品可以先适配 Chrome 和 IE 浏览器以提升绝大部分用户体验。
上面的双向条形图展示了某 B 端产品的客户平均停留时长极端情况(非常高和非常低),企业 1-5 非常活跃,可以让运营人员促进客户增购、续约,而企业 6-10 活跃度非常低,用户即将流失,需要运营人员立刻介入干预。
三、比重图
比重分析主要是用来了解不同部分占总体的比例。横向比较,扇形图、环形图可以满足这类需求;纵向比较,百分比堆积图可以显示不同部分所占比例的趋势变化。
1. 环形图
「环形图」显示了某节点访问用户来源渠道比例。
2. 百分比堆积图
「百分比堆积图」动态显示了不同渠道比例的变化趋势,市场或者运营人员可以据此动态优化我们的资源投放。
四、表格
表格信息密集,可以同时分析多维度、多指标数据,适合对数据敏感的人群使用。虽然表格能看到具体的数值,但是不能直观看到趋势、比重。
通过表格不难发现,移动端访问用户占了非常大的比例,但是跳出率非常高。这样的表格数据启示我们有必要优化移动端产品,提升整体访问深度。
五、其他表格
下面介绍的是气泡图,气泡图用来展示一个事件与多个维度之间的关系,如分析 B 端产品客户成单周期与客户活跃度、登录账号数量之间的关系。
除了上述常见的图表,还有散点图、箱线图、股价图、雷达图等图表,在此不一一赘述。
六、写在最后
不同的图表样式可以满足你不同的分析需求,你可以根据自己的目的来选取最合适的指标、维度和图表样式。工具的作用在于,让上手过程更快更顺畅一些,让更多更高级的需求能够被满足和呈现。
GrowingIO 的单图功能提供了很低的门槛,以及很高的自由度。数据分析小白可以用单图做各种基础的数据分析,生成各种报表;对数据分析有深刻理解的人,可以将各种维度指标组合,针对业务场景做出极具洞察力的数据报表。
注:文中所有图表,皆来源于硅谷新一代用户行为数据分析工具 - GrowingIO。
本文由 @GrowingIO 原创发布于产品壹佰,未经许可,禁止转载。
- ?
Excel数据分析表格你能够玩转吗?看看你属于哪一级
安笑旋
展开
小R刚毕业,每天都在公司忙到10点半回家。
作为室友的我,总是打趣地问他:“是不是又在公司蹭空调蹭网络,干嘛不早点回来陪我吃鸡!”
没想到小R低下头落寞地抱怨道:“我也想早点回来,可是我真的搞不定啊!”
原来,小R每天的工作标配就是统计数据。可同事们十几分钟就能轻松搞定的Excel表格,他经常要加几个小时班才能勉强完成。刚开始,他以为是自己不够熟练,多多练习就好了。没想到埋头苦练了半个月,他还是全组最慢的那个,每天被领导催到怀疑人生,甚至被质疑工作能力。
没有对比就没有伤害。看着旁边妹子敲几下键盘就能轻松搞定表格,小R开始惧怕做Excel和数据统计。
如今,几乎所有公司在招聘时都离不开这条要求:熟练使用Excel,精通数据分析者优先。
做方案、汇报工作、数据分析、总账录入、项目进度、工作记录、写代码、帮助记忆、思维导图.......Excel几乎能解决你工作中的所有问题,它不仅仅是某一职业的必备技能,而真实涵盖所有行业:
做行政,你要学会做考勤表;做财务,你要学会做财会报表;做销售,你要学会做销售业绩表;做运营,你要数据分析、工作汇报;做数据分析师,Excel玩得6也是最最最基本的条件.....
大数据是眼下非常时髦的热词,同时也催生出了一些与大数据处理相关的职业,数据分析师便是其中之一。由于专业技能和量化的数据分析为客户或所在公司控制决策分析、保证利益最大化,“数据分析师”一职备受各界青睐,甚至被视为21世纪的黄金职业。
虽然发展前景大好,但很多想要转行数据分析的小白心里多少都会有些疑惑:不会R、Python、SPSS、Tableau,是不是做不了数据分析师?
事实上,精通Excel,对于转行数据分析来说相当重要。因为Excel拥有最大的客户群体,基本上所有的企业、个人的电脑中装的都是office,这也就意味着90%以上使用电脑的人,都会用到Excel,即便如BAT这样的企业,在处理百万级、千万级数据的时候,也会优先使用Excel。
那么,在没有统计学、数学、计算编程等基础的情况下,如何只用Excel,成功转行成为数据分析师呢?
这里就不得不介绍三款用Excel就可以实现数据分析的插件:Power Query(数据查询)、Power Pivot(数据建模)、Power View(数据可视化)。
这三个模块组成了数据分析全过程,这个过程就好比烹饪过程:
第一个模块数据查询——Power Query。与数据源直接对接,就像获取新鲜的食材,对食材进行清洗、分类、整理,使其达到准备入锅的使用状态。这一步非常重要,因为如果食材不新鲜,那么再厉害的大厨也不可能做出一道健康的美味,所以好的数据源是成功的一半。
第二个模块是数据建模——Power Pivot。这一步是数据分析过程中最具有技术含量的核心部分。我们把数据组合起来实现不同维度的分析,就像把食物组合起来利用烹、炸、煎、炒等方式,再添加油、盐、酱、醋等调料,以烹制出想要的味道。
但是光有味道是不够的,最后我们要呈现给顾客的是一道色、香、味俱全的菜,是否能以视觉效果吸引顾客品尝你的美味,这就要看第三个模块——Power View(数据可视化)的功力了。
例如,如果以前你的做表是这样的 :
那现在通过Power View几秒钟就可以做成这样:
是不是相当神奇?!
无论你是像小R一样的职场小白想要提高工作效率实现逆袭,还是零基础转行成为高大上的数据分析师,精通Excel可以让你彻底告别被数据搞晕的日子,实现加薪不加班!
Excel这么重要,如何在短时间内熟练掌握呢?这有一套为你打造的Excel精品课程:容大教育《Excel速成班——数据处理与分析实战》在线课程,教你用Excel实现数据采集、数据转换和清洗、数据分析与建模等,关注容大教育IT培训机构百家号获取学习资料!
- ?
作为数据分析师,用的最多的竟是Excel表格
闪亮的
展开
【摘要】:结合实际数据分析工作,简要介绍了VLOOKUP函数的基础应用,重点介绍亲测高效有难度的VLOOKUP函数高级应用。最后分享我运用Excel的一点技巧。
毕业后,第一份工作是在一家互联网公司做数据分析。
尽管和所学专业没那么匹配,但我还是挺满意。因为向来对数字很敏感,对常用统计软件也都有所了解。
正式入职,发现面试时说的什么SPSS,Eviews统统都不用,基本就是用Excel。对于研究生毕业,第一份工作,我多少有些落差。既来之则安之,我心想用什么工具最方便,工作中应该可以自己选择。对于word和ppt还算熟练,Excel也就一般。多学点总不会差。
开始工作,我发现Excel的功能简直太强大,我之前了解的仅是皮毛。尤其在更新到2013版后,操作更智能和快捷,数据量大时计算较费时。对于日常工作影响倒不大,借助Excel我的数据分析工作也很快上手。
除了宏不太会,工作之余也会多琢磨一些公式和操作。以至于同办公室的同事,甚至外部门的同事都来找我帮忙解决Excel的问题。时间久了,领导特意让我在部门内部定期做教学分享。
我确实喜欢和数据打交道的感觉,从冗杂的繁琐数据中分析出最终的结果相当有成就感。在简书上也看到了许多实用的Excel操作指南或技巧。
今天分享一个职场中最常用,功能强大,却少有人掌握的VLOOKUP函数。很多文章都提到过这个函数的基础应用,此外还有一个高级应用,是我在工作中遇到,亲测高效快捷的有力工具。
VLOOKUP函数---最最最常用的查找函数
四个必备参数=(要查找的值,要查找的区域,返回数据在查找区域的第几列数,逻辑值)
注: FALSE或0,则返回精确匹配,如果找不到,则返回错误值 #N/A(首选)
TRUE或1,则返回近似匹配值,如果找不到,则返回小于第一个参数的最大值。
VLOOKUP函数的基础应用:一对一的匹配
理解上述文字很晦涩,用实例来说明。
例1: 下图中左表为源数据:各类产品在三个城市的日销售数据。
需求:查询产品B和F在上海的销售额。
因为提供的数据量很少,人工查找就能完成。但实际工作中数据量很庞大,人工查找费时费力且准确率低。这时用VLOOKUP一秒搞定。
做法:在G2单元格内,输入公式,见红框内。回车后,出现结果;将公式复制或下拉至G3,同理可得结果。
参数解释:
(1)“F2”为我们要查找的参照值,即在源数据第一列查找“产品B”。当公式下拉复制时,自动切换为查找F3。
(2)“A:C”指我们要在此范围内查找数据。该参数也可写为“$A$2:$C$9”,即绝对引用。这样可保证无论公式如何拖拽复制,数据源始终固定引用该区域。
(3)参数“3”指在选择的数据源“A列-C列”范围内,要查询的销量在引用的第三列,即C列。
(4)FALSE,即精确查找。
这样,通过应用该函数,实现了产品型号和销量一对一的匹配查找。
应用该公式的硬性条件:
(1)必须保证需要查找的参照值与源数据格式一致。
即例1中:F列与A列完全一致,不仅内容相同,尤其保证单元格格式一致,否则只会返回错误值 #N/A。如不一致,查找前需转换成一致的格式。有时较难分辨。
(2)必须保证源数据表中的第一列没有重复项。
即A列中没有出现重复的产品类型。假如源数据中出现了多行“产品B”,那么在查找时只能返回第一次“产品B”出现时对应的销量。
当(2)无法满足时,查找不再是一对一,而是一对多的匹配。需要对VLOOKUP函数进行扩展才得以实现查找功能。
VLOOKUP函数的高级应用:一对多的匹配
例2:下图左表为客服中心的每日工作记录,日积月累,这个表数据量庞大且信息冗杂。
需求:王丹和张鹏岗位变动,需将他们接待过的全部客户汇总转交其他同事维护。
数据量小手动筛选即可,使用透视表也可完成。这里我借助简单的例子,介绍如何使用VLOOKUP完成。当数据量庞大,这是较便利的方法。
做法:
第一步:将A列排序,在A与B列间新插入两列。
第二步:计数。在B2输入公式=COUNTIF(A$2:A2,A2),回车,下拉即可。
目的是对A列中同一个名字的出现次数进行计算。如图李珊出现了四次。
第三步:构建辅助列。在C2输入公式=A2&B2,回车,下拉即可。目的在于将A列B列的内容合并。这时C列即为辅助列。保证了源数据的唯一性,此时已满足VLOOKUP基础应用的第二个硬性条件。
第四步:进行匹配查找。在H2输入公式=VLOOKUP($G2&H$1,$C$2:$D$18,2,FALSE), 复制公式至其他单元格即可得到结果。
与基础应用相比,仅参数1有变化,涉及相对引用和绝对引用问题。
参数1:将“客服姓名&序号“合并作为第一个参数。公式向右向下复制后,“客服姓名”行变列不变,所以锁定列。“序号”列变行不变,所以锁定行。即为:“$G2&H$1”。锁定即绝对引用。(此处较难理解,操作中通过尝试能够理解透)
参数2:绝对引用C2至D18区域。即为:“$C$2:$D$18”,新数据源。
参数3:返回所选区域C2至D18中的第2列数据。即为:客户姓名
参数4:FALSE,即精确查找。
第五步:将H2中的公式向下向右复制至K3,即得全部结果。可对比源数据表验证是否正确。
在序号为4的单元格内出现了#N/A值。表明没有找到“王丹4”和“张鹏4”对应的内容,说明这两人接待的客户仅有3人。
这样,通过其他功能辅助,实现了客服与客户一对多的匹配查找。
总结:VLOOKUP的高级应用是在基础应用的基础上,借助了COUNTIF和&函数,构建辅助列,使得源数据表中第一列无重复。四个必备参数中仅参数1涉及绝对引用和相对引用,略有难度。
应用Excel的技巧
1.填充了公式的单元格,在得到结果后,最好将计算结果转换为“值”。
两个好处:一是避免源数据的任何变动再次影响公式的计算结果;二是Excel本身计算较费时。如公式一直存在,每次打开该文件,或是刷新时都会重新计算,严重影响Excel运算速度。
2.Excel的数据承载量相对较小。2013版每个sheet能够填充接近105万行。
如果涉及较多sheet,数据量可想而知。因此在上一条的基础上,必须及时保存,否则数据量大时Excel难免会出现重启。毕竟多数人用的都是免费版,为了避免做无用功,及时保存很重要。这可是次次抓狂的经验教训。
3.Excel的功能很丰富,没有哪一本书或是哪一个老师能够完全教会所有功能。
更实际的是,从点到面去学习。比如说我介绍了VLOOKUP函数的应用,其中涉及到了绝对引用的概念,以及countif函数的应用,这时就引导你去学习新知识。
任何功能的组合都能起到耳目一新的作用。
4.Excel做不到死记硬背,多练习才利于掌握。
比如说,在工作中我给同事教过无数次VLOOKUP函数的应用,当时似懂非懂,勉强会用。想不到的是他们下一次遇到早已忘得一干二净。在我看来是很简单的一个公式而已,仅需掌握四个参数。关键是他们不常用,而我几乎天天用。
任何技能都是如此。孰能生巧,才能更快掌握更多功能。哪怕是多记几个快捷键,都会为你使用Excel加分不少。
多学一点技能,就能少求助别人,且让别人来求助于你。普通离优秀,永远差一项技能。
写出来为分享,也为记录。
PS:如果没有看懂,或是觉得现在用不到我介绍的公式。没关系,请收藏,因为工作后,无论做什么工作一定一定一定会用到VLOOKUP。
请尊重原创的辛苦。欢迎分享,欢迎交流。
- ?
图表信息题的精髓就是分析
嵇凝安
展开
中考的图表信息题基本上每年都要考的,它是通过图形、图像、图表以及相关的文字说明给出信息提供问题情境,用来探索变量与变量之间的关系,再综合运用有关函数等知识加以分析,以达到解决实际问题的题型。
每年这个题目都非常新颖的,主要来源于当年的日常生活,蕴含的信息非常丰富,解决方法灵活,主要是考察学生的对信息收集、整理与处理信息的能力。针对这种情况除了关注日常生活之外,一定要培养自己处理信息的能力,我们只有通过对图形、图像、图表等相关信息的分析、观察、猜想、抽象、概括,才能从中获取图表中隐含的解题信息和思路、方法,然后再进行推理、探究、发现和计算,从而解决问题。常考的类型有:图形类、图像类、表格类和统计类。
图形类可能会出现在选择的最后一题或者填空题最后一题,主要是让你观察图形变化,找到规律之后,推理出其他答案。图像类可能反应的路程、时间、速度等相关数量关系的变化。表格题也会经常考察,它的代表类型就是每个月水电费,观察每个月数据的变化,求相关函数的变化。统计类主要是直方图,以简答题的形式出现,与数据分析处理相结合,考察学生的对信息分析的能力。
不管怎么样遇到图表信息题,一定要学会分析,抓住问题的主要矛盾,进行整合推理出更多有用的信息来解决问题。
- ?
关于数据分析问题的汇总,给出了以下答案!
侠客
展开
文 | 去哪儿
源 | 简书
很多读者给我后台留言数据分析应该怎么入门,怎么提升,怎么找工作?那我想说数据分析你可以看做一个职业也可以看做一项技能,薪资水平决定你需要的能力是多少?
以下我就整理了一些关于数据分析的问题,统一回复。
问题一:无任何分析经验和基础想要入门数据分析,如何入门?
我先用一个比较接地气的例子介绍一下数据分析。在企业中,数据分析就像做一道菜,菜是你最终需求的成品,数据分析师就是厨师,设计方案就是下单,数据采集就是备料,数据处理就是切配,数据分析就是烹饪,数据呈现就是菜品最后的呈现装饰。
再举个简单的例子,假设你需要用数据分析去选择A,B,C三种护肤品中的一个,这是你的目的,这时你的选择困难症来了,你现在知道的信息如下:A,B,C的价格,A,B,C的功效各自不一样,价格和功效都是你关心的(你想要价格适中,具有保湿程度相对好一点的,但在这两种里,你更看重功效),但是功效比重各不一致,这时候就可以用到数据分析了,三个样本的价格和功效的数据表示,就是分析所需要的最基础的原料,而有些时候这些数据不是我们要分析的数据形式,比如说功效这个产品说明里面是用程度去表示的,比如说保湿极好,防晒一般,那这些是定性数据,我们没办法对定性数据进行分析,所以要将这些数据进行一些加工和转换,比如说将极好,一般这些程度词用数字(1-5中的某个值表示),值越大,表示极好,越小表示几乎无效。当用数字可以表示,可以应用在我们之后的分析模型的时候,这就是一个数据准备的过程了;这部分时间要花去数据分析时间的70%,因为数据准备的质量决定着之后的分析质量。数据准备中主要两大知识块:缺失值的处理和异常值的处理。
之后就是模型的建立,像以上的例子中,我们假定已经够造了一个模型(层次分析法)解决这个问题,那这里问题来了,我们怎么知道用哪些方法和哪些模型呢,这就需要知识储备了(一些分析方法和算法的掌握,比如说预测:AR模型,MA模型,分类:决策树,不要被这些算法吓到了哈,我只是举个例子)。那这个模型构造出来了,每个模型并不是完美的,怎么去评价你的模型呢,即怎么评价你的结果如何呢?
那后面就是模型评价了,在上述的例子中就是看你分析出的结果,即你根据模型分析选择的B符不符合你当初的期望值,是不是吻合(当然,在正规的数据分析中有对应的评价指标,比如说分类的混淆矩阵,预测的梯度提升等)。在我的工作经验中,这部分应用一般,主要是实用为主,但是如果是做研究,写论文等,这部分很重要,就是对你模型优劣的论证。
数据分析大致流程就是四个方面:数据准备,模型设计,模型评价,分析报告展示(如果应对的是需求客户的话这一步骤也不可少),步骤虽然少,但是每个方面涉及的内容多到崩溃,所以结合您的实际情况我的建议是先找一个有关您课题的分析目标,然后从这个目标出发,结合我上面所说的那四个流程,每个流程下选择您需要解决的这个问题的解决方案(比如你的目的是评分),然后针对这个问题去了解这个模型所需要的解决方法(比如说层次分析法,主成分分析法之类),这样由问题展开去学习,比刚开始做足准备再去开始有效的多。
那上面是数据分析的学习方式,再梳理一下学习工具。个人学习的话强烈建议用R语言去做统计分析,现在利用R语言尤其是在科研研究中是主流趋势。R语言不需要很厉害的编程逻辑或思维,入门比较容易(最慢三个月也入门了),它里面都有现成的函数工具包,而且模型应用面很广,几乎现在涉及的统计分析和大多数算法都能找到现成的函数包。
工作场景的话,建议把Excel用熟练,因为最常见的就是做报表,制作数据决策报告了。Excel可以灵活地应用各种本地数据的处理,如果要涉及到和数据库的交互的话,公司可能会有报表系统,或者OA、ERP自带的报表功能。那像我的话,公司有数据中心项目,用finereport搭建了一套数据决策报表平台,用设计器开发报表,类似excel。
推荐基本我看过并且很受益的入门书籍
从易到难,按安排时间阅读为好:
1 数据分析:企业的贤内助(入门级)
有kindle mobi版,如果入门级书优先推荐,那我首推这一本
特点:重点讲述了数据分析的应用场景和一些简单的统计分析方法。也比较有趣
阅读难度:1颗星
有趣程度:3颗星
受益程度:4颗星
2 谁说菜鸟不会数据分析(入门篇和工具篇2本,有电子书)
有趣程度:2颗星
受益程度:2颗星
特点:以生动有趣的方式讲述数据分析是“神马”,数据分析的几个步骤。以及以EXCEL为分析工具进行的分析操作和方法。
3 赤果果的统计学(有电子版)
阅读难度:2颗星
有趣程度:4颗星
受益程度:5颗星
这本书主要是结合现实中有趣的现象去阐述统计学,是我阅读过的通俗易懂而且内容对于知识的理解很是有深度启发性的统计学书籍,没有之一。
4 深入浅出数据分析
以下内容是粘贴百度百科的,因为比较全面
以类似"章回小说"的活泼形式,生动地向读者展现优秀的数据分析人员应知应会的技术:数据分析基本步骤、实验方法、最优化方法、假设检验方法、贝叶斯统计方法、主观概率法、启发法、直方图法、回归法、误差处理、相关数据库、数据整理技巧;正文之后,意犹未尽地以三篇附录介绍数据分析十大要务、R工具及ToolPak工具,在充分展现目标知识以外,为读者搭建了走向深入研究的桥梁。
工具篇:
R语言实战(有电子版)
有趣程度:1颗星
这本书利用R语言对于统计方法的应用很全面,特别全面,是我入门R语言的最好的启蒙书。刚开始学可以先将这本书上的示例和程序都手动模仿学习一遍,这本书是值得阅读两遍的书。
问题二:sas,r,python在金融行业数据分析,数据挖掘方面的优劣比较,及未来发展趋势
解答:先说一下sas与其他两个工具的区别
1 sas是付费分析工具,主要是大型咨询公司或者外企会用这个工具比较多,原因:因为付费,有保障,通俗的来讲,出了错会有赔付会有责任,对于公司来说,更有保障,风险很低,所以如果以后面试大型咨询公司,金融行业公司或者外企学会这个工具还是很有必要的,sas以前在本科的时候用过一点点,语法相对r和python比较简单。因为本人是在主要是在做电商里面的物流这一块,所以对sas实际操作了解不多,所以这个不能给予更全面的解答。
2 R和python是开源软件,即免费的,是现在国内大多数IT行业做数据分析与挖掘的首选,R语言在做学校研究和公司轻量级的研究和分析(即数据量在T级别以下)比较好用,因为其语法简洁,有很多可以直接应用的工具包(目前主流的一些算法比如说决策树,神经网络,kmeans聚类算法等都能找到工具包和相应的函数,编写简单的程序调用即可,以及还有关于金融相关的风险预测等都可以找到相应的一些函数包),所以编写算法不是R语言主要花时间的地方,主要耗时间的地方在数据处理这一部分,往往数据分析中数据处理和最后做分析花的时间比例大概是7:3,也就是70%的时间会花在数据处理,使得最后调用函数的时候数据格式符合函数要求格式(比如说一些缺失值的处理等),话说回来,R语言主要的优势就是入门快,没有很高的编程要求,数据可视化比python要强。
那我再说一下python,它跟R语言分析功能以及工具的使用方式都差不多是一样的,但是为什么python会用的更广一些呢,主要原因:其一是因为它稳定,它是一门工程类语言,类似于java,稳定性比较强,应用在开发环境中,有一定的规则范式,可以说是介于R语言和java这类语言特性之间,而且在网上的资料会更全面更权威一点,之前说了R语言还有一个弱势就是处理的数据量的大小,我现在工作中用R语言比较多一点,我主要用它做仿真建模,数据量不要求很大,但是如果某天要将代码应用在工程里并且分析的数据量大于T级的时候,R语言的稳定性和效率就很差了,可以想象,当一个APP上某个输出如果很慢的话,会造成怎样的影响,所以如果python在做分析,并且这个代码要嵌套在开发环境中,那python相比于R语言是一个更好的选择。
我现在工作在用R,主要因为R用的比较熟练比较难换过去(因为学习新的语言需要成本),另外分析的数据量不是很大,之前有过经验,当excel里的数据超过100万条的时候,R语言运行速度已经成吃力了,python也自学过一部分,但是也是在循序渐进的学习python,因为这是一种趋势,虽然R语言现在也有Rspark之类的解决运行速度这一类问题,但是发展还是比较缓慢的,而且网上可以搜集的资料也是很有限的,现在的数据都是按指数级增长的,如果你想让自己的职业技能更深入,想在数据分析和挖掘这条路上越走越远的话,建议提早学python。
这是工具方面的一个建议,但是工具只是工具,以我现在的工作经验来看,分析工具层出不穷,更新迭代的速度真的很快,现在又有tensorflow这种工具出来了(专注于机器学习和深度学习),所以我建议不要把大量精力放在很多工具的学习上,工具就像我们从起始点到目的地的一个交通工具一样,你用汽车,公交车都能到达目的地,最主要的是培养一种思维方式,就是解决需求任务的思路和能力,比如你拿到一个问题,怎么利用已知条件,或者在问题里找出这个条件(即提取特征),应用这些条件,构造出一个解决方案(即模型),并且能够严谨准确的去评价你的方案或者模型。这是需要花时间和花精力去学习的。
- ?
数据分析师面试最常见的十道面试题分享!
赫善愁
展开
以下是容大教育小编日常整理的数据分析师面试时经常遇到的十道数据分析面试题,下面让我们一起看看数据分析师面试最常见的十道面试题:
1、海量日志数据,提取出某日访问百度次数最多的那个IP
首先是这一天,并且是访问百度的日志中的IP取出来,逐个写入到一个大文件中。注意到IP是32位的,最多有个2^32个IP。同样可以采用映射的方法,比如模1000,把整个大文件映射为1000个小文件,再找出每个小文中出现频率最大的IP(可以采用hash_map进行频率统计,然后再找出频率最大的几个)及相应的频率。然后再在这1000个最大的IP中,找出那个频率最大的IP,即为所求。
或者如下阐述:
算法思想:分而治之+Hash
1.IP地址最多有2^32=4G种取值情况,所以不能完全加载到内存中处理;
2.可以考虑采用“分而治之”的思想,按照IP地址的Hash(IP)24值,把海量IP日志分别存储到1024个小文件中。这样,每个小文件最多包含4MB个IP地址;
3.对于每一个小文件,可以构建一个IP为key,出现次数为value的Hash map,同时记录当前出现次数最多的那个IP地址;
4.可以得到1024个小文件中的出现次数最多的IP,再依据常规的排序算法得到总体上出现次数最多的IP;
2、搜索引擎会通过日志文件把用户每次检索使用的所有检索串都记录下来,每个查询串的长度为1-255字节
假设目前有一千万个记录(这些查询串的重复度比较高,虽然总数是1千万,但如果除去重复后,不超过3百万个。一个查询串的重复度越高,说明查询它的用户越多,也就是越热门。),请你统计最热门的10个查询串,要求使用的内存不能超过1G。
典型的Top K算法,还是在这篇文章里头有所阐述,
文中,给出的最终算法是:
第一步、先对这批海量数据预处理,在O(N)的时间内用Hash表完成统计(之前写成了排序,特此订正。July、2011.04.27);
第二步、借助堆这个数据结构,找出Top K,时间复杂度为N‘logK。
即,借助堆结构,我们可以在log量级的时间内查找和调整/移动。因此,维护一个K(该题目中是10)大小的小根堆,然后遍历300万的Query,分别和根元素进行对比所以,我们最终的时间复杂度是:O(N) + N’*O(logK),(N为1000万,N’为300万)。ok,更多,详情,请参考原文。
或者:采用trie树,关键字域存该查询串出现的次数,没有出现为0。最后用10个元素的最小推来对出现频率进行排序。
3、有一个1G大小的一个文件,里面每一行是一个词,词的大小不超过16字节,内存限制大小是1M。返回频数最高的100个词
方案:顺序读文件中,对于每个词x,取hash(x)P00,然后按照该值存到5000个小文件(记为x0,x1,…x4999)中。这样每个文件大概是200k左右。
如果其中的有的文件超过了1M大小,还可以按照类似的方法继续往下分,直到分解得到的小文件的大小都不超过1M。
对每个小文件,统计每个文件中出现的词以及相应的频率(可以采用trie树/hash_map等),并取出出现频率最大的100个词(可以用含100个节点的最小堆),并把100个词及相应的频率存入文件,这样又得到了5000个文件。下一步就是把这5000个文件进行归并(类似与归并排序)的过程了。
4、有10个文件,每个文件1G,每个文件的每一行存放的都是用户的query,每个文件的query都可能重复。要求你按照query的频度排序
还是典型的TOP K算法,解决方案如下:
方案1:
顺序读取10个文件,按照hash(query)的结果将query写入到另外10个文件(记为)中。这样新生成的文件每个的大小大约也1G(假设hash函数是随机的)。
找一台内存在2G左右的机器,依次对用hash_map(query, query_count)来统计每个query出现的次数。利用快速/堆/归并排序按照出现次数进行排序。将排序好的query和对应的query_cout输出到文件中。这样得到了10个排好序的文件(记为)。
对这10个文件进行归并排序(内排序与外排序相结合)。
方案2:
一般query的总量是有限的,只是重复的次数比较多而已,可能对于所有的query,一次性就可以加入到内存了。这样,我们就可以采用trie树/hash_map等直接来统计每个query出现的次数,然后按出现次数做快速/堆/归并排序就可以了。
方案3:
与方案1类似,但在做完hash,分成多个文件后,可以交给多个文件来处理,采用分布式的架构来处理(比如MapReduce),最后再进行合并。
5、 给定a、b两个文件,各存放50亿个url,每个url各占64字节,内存限制是4G,让你找出a、b文件共同的url?
方案1:可以估计每个文件安的大小为5G×64=320G,远远大于内存限制的4G。所以不可能将其完全加载到内存中处理。考虑采取分而治之的方法。
遍历文件a,对每个url求取hash(url)00,然后根据所取得的值将url分别存储到1000个小文件(记为a0,a1,…,a999)中。这样每个小文件的大约为300M。
遍历文件b,采取和a相同的方式将url分别存储到1000小文件(记为b0,b1,…,b999)。这样处理后,所有可能相同的url都在对应的小文件(a0vsb0,a1vsb1,…,a999vsb999)中,不对应的小文件不可能有相同的url。然后我们只要求出1000对小文件中相同的url即可。
求每对小文件中相同的url时,可以把其中一个小文件的url存储到hash_set中。然后遍历另一个小文件的每个url,看其是否在刚才构建的hash_set中,如果是,那么就是共同的url,存到文件里面就可以了。
方案2:如果允许有一定的错误率,可以使用Bloom filter,4G内存大概可以表示340亿bit。将其中一个文件中的url使用Bloom filter映射为这340亿bit,然后挨个读取另外一个文件的url,检查是否与Bloom filter,如果是,那么该url应该是共同的url(注意会有一定的错误率)。
Bloom filter日后会在本BLOG内详细阐述。
6、在2.5亿个整数中找出不重复的整数,注,内存不足以容纳这2.5亿个整数
方案1:采用2-Bitmap(每个数分配2bit,00表示不存在,01表示出现一次,10表示多次,11无意义)进行,共需内存2^32 * 2 bit=1 GB内存,还可以接受。然后扫描这2.5亿个整数,查看Bitmap中相对应位,如果是00变01,01变10,10保持不变。所描完事后,查看bitmap,把对应位是01的整数输出即可。
方案2:也可采用与第1题类似的方法,进行划分小文件的方法。然后在小文件中找出不重复的整数,并排序。然后再进行归并,注意去除重复的元素。
7、腾讯面试题:给40亿个不重复的unsigned int的整数,没排过序的,然后再给一个数,如何快速判断这个数是否在那40亿个数当中?
与上第6题类似,我的第一反应时快速排序+二分查找。以下是其它更好的方法:
方案1:oo,申请512M的内存,一个bit位代表一个unsigned int值。读入40亿个数,设置相应的bit位,读入要查询的数,查看相应bit位是否为1,为1表示存在,为0表示不存在。
方案2:这个问题在《编程珠玑》里有很好的描述,大家可以参考下面的思路,探讨一下:
又因为2^32为40亿多,所以给定一个数可能在,也可能不在其中;
这里我们把40亿个数中的每一个用32位的二进制来表示
假设这40亿个数开始放在一个文件中。
然后将这40亿个数分成两类:
1.最高位为0
2.最高位为1
并将这两类分别写入到两个文件中,其中一个文件中数的个数<=20亿,而另一个>=20亿(这相当于折半了);
=20亿(这相当于折半了);
与要查找的数的最高位比较并接着进入相应的文件在查找
再然后把这个文件为又分成两类:
1.次最高位为0
2.次最高位为1
并将这两类分别写入到两个文件中,其中一个文件中数的个数<=10亿,而另一个>=10亿(这相当于折半了);
=10亿(这相当于折半了);
与要查找的数的次最高位比较并接着进入相应的文件在查找。
…….
以此类推,就可以找到了,而且时间复杂度为O(logn),方案2完。
附:这里,再简单介绍下,位图方法:
使用位图法判断整型数组是否存在重复
判断集合中存在重复是常见编程任务之一,当集合中数据量比较大时我们通常希望少进行几次扫描,这时双重循环法就不可取了。
位图法比较适合于这种情况,它的做法是按照集合中最大元素max创建一个长度为max+1的新数组,然后再次扫描原数组,遇到几就给新数组的第几位置上1,如遇到5就给新数组的第六个元素置1,这样下次再遇到5想置位时发现新数组的第六个元素已经是1了,这说明这次的数据肯定和以前的数据存在着重复。这种给新数组初始化时置零其后置一的做法类似于位图的处理方法故称位图法。它的运算次数最坏的情况为2N。如果已知数组的最大值即能事先给新数组定长的话效率还能提高一倍。
欢迎,有更好的思路,或方法,共同交流。
8、怎么在海量数据中找出重复次数最多的一个?
方案:先做hash,然后求模映射为小文件,求出每个小文件中重复次数最多的一个,并记录重复次数。然后找出上一步求出的数据中重复次数最多的一个就是所求(具体参考前面的题)。
9、上千万或上亿数据(有重复),统计其中出现次数最多的前N个数据
方案:上千万或上亿的数据,现在的机器的内存应该能存下。所以考虑采用hash_map/搜索二叉树/红黑树等来进行统计次数。然后就是取出前N个出现次数最多的数据了,可以用第2题提到的堆机制完成。
10、一个文本文件,大约有一万行,每行一个词,要求统计出其中最频繁出现的前10个词,请给出思想,给出时间复杂度分析
方案1:这题是考虑时间效率。用trie树统计每个词出现的次数,时间复杂度是O(nle)(le表示单词的平准长度)。然后是找出出现最频繁的前10个词,可以用堆来实现,前面的题中已经讲到了,时间复杂度是O(nlg10)。所以总的时间复杂度,是O(nle)与O(nlg10)中较大的哪一个。
附、100w个数中找出最大的100个数。
方案2:在前面的题中,我们已经提到了,用一个含100个元素的最小堆完成。复杂度为O(100w*lg100)。
方案3:采用快速排序的思想,每次分割之后只考虑比轴大的一部分,知道比轴大的一部分在比100多的时候,采用传统排序算法排序,取前100个。复杂度为O(100w*100)。
方案4:采用局部淘汰法。选取前100个元素,并排序,记为序列L。然后一次扫描剩余的元素x,与排好序的100个元素中最小的元素比,如果比这个最小的要大,那么把这个最小的元素删除,并把x利用插入排序的思想,插入到序列L中。依次循环,知道扫描了所有的元素。复杂度为O(100w*100)。
以上就是容大教育数据分析师培训在线学习小编给大家分享的数据分析师面试最常见的十道面试题分享,希望对小伙伴们有所帮助,容大教育IT培训机构,能够为你提供良好的技术学习,能够更好地了解每个学习者的需求,根据每个学习者特定的需求为其配置最合适的资产组合,无疑更加符合学习者的需求。
- ?
电商第一步,学会表格数据分析
飞鸽
展开
今天为大家分享一个数据分析的方法,大家可以打开店铺后台,看着步骤来操作。
很多电商人都知道数据分析的重要性,但是真正做起来却发现无从下手,而且即使是看到数据之后,也不知道怎么分析,往往是看着一个连接“莫名奇妙”的爆了,又“莫名其妙”的死了。
其实每个链接的起爆和衰落都是有原因的,只要掌握今天的数据分析方法,在以后的操作过程中才能真正看清数据,掌握数据
首先,打开生意参谋,商品-商品效果-选择日期,在选择日期时,建议大家往前倒推15天的时间,比如今天是30号,那么,就从这个月的15号开始,选择好日期之后,点击下载。
下载好15号的数据之后,再选择16号,继续下载,把最近15的的数据下载下来以后是这样的。
这是我们店铺所有链接在过去15天的所有数据,而且非常详细,可以说,过去15天的店铺的起落兴衰内在原因都在这里了,接下来我们开始将这些数据重新组合整理,以便于更直观的看到所有链接的详细数据,从而进行数据对比,分析,得出结论,打开第一个表格是这样的。
这是所有的链接在10.10日的数据,第一个链接是主打款,是主要分析目标,所以把这一排全部复制下来,放在一个新的表格里。
然后把10.11之后的所有数据全部复制下来,放在一个表格里,把无关紧要的数据删掉,以免影响我们的专注力。
ps:在删无关紧要的数据时要注意看数据浮动大不大,比如平均停留时长这一项,如果这一项波动特别大就不要删掉,波动不大的话就删掉,因为它只是次要数据,不是核心数据,最后留下来的核心数据,见下图:
这个是我已经做好的表格,最后的收藏率和加购率是手动加上去的,因为官方没有提供这两个数据,但是官方提供了收藏人数和访客数,所以我们就可以手动算出来。
在收藏率下输入公式:‘=收藏人数/访客数’然后回车,就会得到这个链接的收藏率,把这一列拖下来即可得到所有日期的收藏率,加购率也是一样操作即可
为了方便观察数据,我们把所属终端这一行改成日期,见下图:
这样是不是一目了然了?哈哈哈,是不是感觉所有原因都自动跳出来了!
重点看流量暴涨的10.19号--22号这4天数据:
访客数暴涨的同时,搜索引导的访客数也在暴涨,而且直通车并没有加大投入,所以接下来我们着重看搜索数据,我们知道,现在所有的数据,都是结果,是上一个周期的数据浮动才导致的结果。
所以接下来我们看上一个周期发生了什么。
发现什么秘密没有?
每次流量大涨之前的一天,搜索支付转化率都是超过5%的!记住这个数字。
10.17号和10.18号,连续两天都超过了5%,然后导致10.19号访客数直接翻翻!
所以也就是说,在这个类目,这个客单价下,我们的搜索支付转化率不能低于5%,这是一个系统云计算得出的数据,只要能够稳住这个数值,理论上来说,这个链接是必爆无疑的!
当然,除了数据之外,还有很多其他方面的权重值也很重要,比如客服回复时长,动销率,发货速度,好评率,dsr,等等,我们今天只分析数据,其他方面有空再详解。
还有一点值得注意的是:
有些类目权重计算核心并不是支付转化率!
有些类目权重计算核心并不是支付转化率!
有些类目权重计算核心并不是支付转化率!
但是大部分类目都逃不过这个表格里的所有数据,有了这个表格基本都能够计算出来类目权重算法,目前最核心的数据有:支付转化率,uv价值,收藏率,加购率。
只要能够找出自己类目的核心权重,然后维护好这个数据,在产品没问题的情况下,想不爆,太难了!
客单价69左右的女裤类目的核心权重是转化率,客单价129左右的天猫女鞋核心权重是uv价值,这一点很难复制,只能用自己的店铺数据去推断,找出这个潜在规律即可。
免责声明:本文使用图文及视频等作品部分源于网络,我们尊重著作权所有人的合法权益,如涉及版权争议,请著作权人告知我方删除
- ?
Top30数据分析师常见面试题(附答案)!
毁我心
展开
【IT168 评论】这是一个用数据说话的时代,也是一个依靠数据竞争的时代。各大互联网公司都在不断完善自己的数据分析团队,数据分析师的薪酬也是水涨船高。业内人士透露,应届毕业生的平均薪资大概在6K左右,1至3年经验的大概在10K到20K之间,5至10年经验的大概在25K以上。薪资还是十分诱人的,那么,如何快速成长为一名年薪百万的数据分析师呢?快来看看,以下30道数据分析相关面试题,你会多少?
1、分析数据还要写java代码是不是效率有点低?
2、成为一名数据分析师需要具备哪些技能?
要成为一名数据分析师,需要掌握丰富的报告软件包(Business Objects),编程语言(XML,Javascript或ETL框架),数据库(SQL,SQLite等);能够准确分析、组织、收集或传播数据;掌握数据库设计,数据模型,数据挖掘等方面的技术知识以及分析大型数据集(SAS,Excel,SPSS等)的统计软件包知识。
3、分析项目的各个步骤是什么?
分析项目的各个步骤包括:
·问题定义
·数据挖掘
数据准备
模型化
数据认证
实施跟踪
4、分析的结果数据特别大,在线请求这些结果数据扛不住了,咋搞?
5、列出数据清理的最佳实践?
一些数据清理的最佳实践包括:
按不同的属性排序数据
对于大数据集,逐步清理并改进数据,直到获得良好的数据质量
对大型数据集,可以先将其分解为小数据集,使用更少的数据将增加迭代速度
要处理常见的清理任务,请创建一组实用程序函数/工具/脚本。它可能包括基于CSV文件或SQL数据库重映射值,或者正则表达式搜索和替换,消除所有不匹配正则表达式的值
如果在数据清理方面存在问题,请按照估计的频率进行安排并解决问题
分析每列的汇总统计数据(标准差,均值,缺失值的数量)
保持对每一个清理操作的跟踪,以便可以根据需要更改或删除操作
6、海量日志数据,提取出某日访问百度次数最多的那个IP。
7、可用于数据分析的一些最佳工具清单有什么?
Tableau
RapidMiner
OpenRefine
KNIME
Google Search Operators
Solver
NodeXL
io
Wolfram Alpha’s
Google Fusion tables
8、数据挖掘和数据分析之间的区别是什么?
数据挖掘和数据分析之间的区别在于:
数据分析:针对个别属性的实例分析。提供有关属性的各种信息,如值范围,离散值及其频率,空值的发生,数据类型,长度等。
数据挖掘:重点关注聚类分析,异常记录检测,依赖关系,序列发现,多个属性之间的关系控制等。
9、给定a、b两个文件,各存放50亿个url,每个url各占64字节,内存限制是4G,让你找出a、b文件共同的url?
10、用于处理分布式计算环境中应用程序大数据集的Apache框架有哪些?
Hadoop和MapReduce是由Apache开发的用于处理分布式计算环境中应用程序大数据集的编程框架。
11、腾讯面试题:给40亿个不重复的unsigned int的整数,没排过序的,然后再给一个数,如何快速判断这个数是否在40亿个数当中?
12、解释KNN插补方法是什么?
在KNN插补中,通过使用与其值缺失的属性最相似的属性值来推断缺少的属性值。通过使用距离函数,确定两个属性的相似度。
13、数据分析师使用的数据验证方法是什么?
通常,数据分析师用于数据验证的方法是数据筛选和数据验证。
14、解释应该如何处理可疑或缺失数据?
准备提供所有可疑数据信息的验证报告。它应该提供信息,如失败的验证标准以及发生的日期和时间
有经验的数据分析师应该检查可疑数据以确定其可接受性
应该找出无效数据并用验证码替换
对缺失数据进行处理,使用最佳分析策略,如删除,单一插补方法,基于模型的方法等。
15、如何避免过拟合?
过拟合表现在训练数据上的误差非常小,而在测试数据上误差反而增大。其原因一般是模型过于复杂,过分得去拟合数据的噪声和outliers。常见的解决办法是正则化:增大数据集,正则化
16、解释异常值是什么?
异常值是分析师使用的一个术语,指的是一个远远超出样本总体模式的值。有两种类型的异常值:
Univariate
Multivariate
17、解释分层聚类算法是什么?
分层聚类算法结合并划分现有的组,创建分层结构并展示组划分或合并的顺序。
18、解释K均值算法是什么?
K均值是一种著名的分区方法。对象被分类为属于K个组中的一个,k是先验选择的。
在K均值算法中:
簇是球形的:簇中的数据点以该簇为中心
簇的方差/扩展是相似的:每个数据点属于最接近的簇
19、数据分析师所需掌握的关键技能是什么?
数据科学家必须具备以下技能:
数据库知识
数据库管理
数据混合
数据查询
数据操作
预测分析
基本描述性统计
预测建模
高级分析
大数据知识
大数据分析
非结构化数据分析
机器学习
演示技巧
数据可视化
报告设计
20、解释协同过滤是什么?
协同过滤是一种基于用户行为数据创建推荐系统的简单算法。协同过滤最重要的组件是用户对项目的兴趣。
协同过滤一个很好的例子就是购物网站上出现的类似“为您推荐”的模块,该模块通常会获取用户的浏览记录信息,以弹出用户可能喜欢或需要的商品。
21、大数据中通常会使用到哪些工具?
大数据中使用的工具包括:
Hadoop
Hive
Pig
Flume
Mahout
Sqoop
22、解释什么是KPI,实验设计和80/20规则?
关键绩效指标(KPI):它代表关键绩效指标(Key Performance Indicator),它是关于业务流程的报告或图表
实验设计:这是用于分解数据,采样和建立数据以进行统计分析的初始过程
80/20规则:这意味着你收入的80%来自客户的20%
23、解释Map Reduce是什么?
Map-Reduce是一个处理大型数据集的框架,可以将它们分解成子集,在不同的服务器上处理每个子集,然后混合每个子集上获得的结果。
24、解释聚类是什么?聚类算法的属性?
聚类是一种应用于数据的分类方法。聚类算法将数据集划分为自然组或集群。
聚类算法的属性是:
Hierarchical or flat
Iterative
Hard and soft
Disjunctive
25、对数据分析师有用的统计方法是什么?
对数据科学家有用的统计方法是
贝叶斯方法
马尔科夫过程
空间和集群进程
统计数据,百分位数,异常值检测
计算技巧等
简单的算法
数学优化
26、时间序列分析是什么?
时间序列分析可以在频域和时域两个域中完成。在时间序列分析中,可以通过指数平滑,对数线性回归等各种方法分析数据,来预测特定过程输出。
27、解释空间自相关分析是什么?
空间自相关分析是地理空间分析的常用形式。它由一系列为不同空间关系计算的估计自相关系数组成。当原始数据表示为距离而不是单个点的值时,它可以用于构建基于距离的数据相关图。
28、散列表是什么?散列表冲突是什么?如何避免?
在计算中,哈希表(散列表)是键值对的映射,这是一个用于实现关联数组的数据结构。它使用散列函数来计算一个时隙阵列的索引,从中可以获取所需的值。
当两个不同的键散列到相同的值时,发生散列表冲突。两个数据不能存储在阵列的同一个插槽中。
为了避免散列表碰撞,有很多技巧,这里列出两个:
分离链接:它使用数据结构来存储散列到同一个插槽的多个项目。
再探测:在找到查找位置的index的index-1,index+1位置查找,index-2,index+2查找,依次类推。这种方法称为线性再探测。
29、解释 imputation是什么?列出不同类型的插补技术?哪种插补方法更有利?
在插补过程中,我们用替代值替换丢失的数据。插补技术涉及的类型有:
单一插补
热点插补:从随机选择的类似记录中推断缺失值
冷却板插补:与热点插补相同,但更先进,从其他数据集中选择供体
平均估算:在所有其他情况下,用该变量的平均值代替缺失值
回归插补:用基于其他变量的变量预测值替换缺失值
随机回归:与回归插补一样,但它将平均回归方差加入到回归估计中
多重插补:与单个插补不同,多重插补会多次估计值
虽然单一插补法被广泛使用,但并不能反映随机丢失数据所造成的不确定性。因此,在数据丢失的情况下,多重插补更有利。
30、解释N-gram是什么?
N-gram是来自给定序列文本或语音的n个项目的连续序列。这是一种以(n-1)形式预测下一个项目的概率语言模型。
表格数据分析题
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并