- ?
5个大数据处理/数据分析/分布式工具
之玉
展开
0.Hadoop
Hadoop是一个开源框架,它允许在整个集群使用简单编程模型计算机的分布式环境存储并处理大数据。它的目的是从单一的服务器到上千台机器的扩展,每一个台机都可以提供本地计算和存储。
1.Druid
Druid是实时数据分析存储系统,Java语言中最好的数据库连接池。Druid能够提供强大的监控和扩展功能。
2.Ambari
大数据平台搭建、监控利器;类似的还有CDH
提供Hadoop集群
Ambari为在任意数量的主机上安装Hadoop服务提供了一个逐步向导。Ambari处理集群Hadoop服务的配置。
管理Hadoop集群
Ambari为整个集群提供启动、停止和重新配置Hadoop服务的中央管理。
监视Hadoop集群
Ambari为监视Hadoop集群的健康状况和状态提供了一个仪表板。
3.Spark
大规模数据处理框架(可以应付企业中常见的三种数据处理场景:复杂的批量数据处理(batch data processing);基于历史数据的交互式查询;基于实时数据流的数据处理,Ceph:Linux分布式文件系统。
4.Storm
Storm是一个免费开源、分布式、高容错的实时计算系统。Storm令持续不断的流计算变得容易,弥补了Hadoop批处理所不能满足的实时要求。Storm经常用于在实时分析、在线机器学习、持续计算、分布式远程调用和ETL等领域。Storm的部署管理非常简单,而且,在同类的流式计算工具,Storm的性能也是非常出众的。
以上5个大数据处理/数据分析/分布式工具,有任何IT问题都欢迎问我~这里有一些我收集的资料想要的评.论!回复【资料】即可
- ?
来看看我们数据分析过程中的那些坑
长相
展开
今天端午节,小2哥祝所有商家和网友节日快乐,端午安康,对于做淘宝的人来说,是没有节日这个概念的,我今天也继续奋斗在工作岗位,闲暇之际,抽点时间来和大家分享分享自己的一些对数据分析的感悟。
我在很多场合经常听到有人说:数据有毒
其实,有毒的不是数据,而是我们不懂的分析数据,只知道看表面的数据,没有理解出数据背后的东西。
我在书友会和书友们说:很多的时候,如果你没有跟着我学数据分析的时候,你凭借着你的经验和第一直觉做可能你还会做的更好一点,但是如果你跟了我学数据分析之后,可能你反而会做的越来越差?
因为有很多人他第一直觉和经验其实比较好的,不听数据分析他做的决策反而可能正确一些,但是自从他听了我的数据分析之后,他开始不相信自己的直觉和经验,他只相信数据了,特别是看到那些直观的图表的时候,他更愿意去相信数据,可是遗憾的是他只看到了数据表面的东西,并没有把隐藏在数据背后的东西挖出来了,所以他反而让数据表现的东西给误导了,做出了错误的决策。
我们来看看那些经常因为数据误导我们的案例,这里先举一个例子,很多人经常会去分析关键词的人群画像,下面这个数据来自的是"长袖T恤女"这个关键词的数据
从这个数据我们可以看到的是18-25岁的人占比最高。所以很多人说,这个关键词背后搜索和喜欢的人群是18-25岁
其实,如果你说关键词背后搜索人数最多的是18-25岁,那么这句话肯定是对的,这数据也肯定能说明的,但是你没办法说明长袖T恤最受欢迎的人群是18-25岁
我们再来看一个图,这个图是2015年6月和2016年6月网民的年龄结构分布图,当然,很遗憾的是我没找到今年淘宝网民年龄的结构分布数据。但是从上面这个图里面我们可以看出40-49岁的网民只占了总网民的百分之13%左右,而这个数据还是网民数据,不是淘宝用户的数据,淘宝用户的数据只会比这个数据低很多,因为现在很多40-49岁的人都会玩微信,他们算网民,但是这里面有很多的人从来是不淘宝购物的,他们就算不上淘宝用户,特别是广大农村地区,这个年龄阶段的人用微信的特别多,但是用淘宝的非常小,
这个时候我们再回过头来看第一个数据,搜索长袖T恤女这个关键词占比最多的人群是18-25岁,但是这个只能说明搜索这个关键词人数最多的是18-25岁人群,并不能说明长袖T恤在18-25岁的人群里面更受欢迎。因为本身这个18-25岁人群在淘宝用户中基数就是最大的,同样的我们再看,40-49岁的这个人群,他虽然只占比16%,比起其他的年龄阶段来说人群占比算比较低的,但是他在淘宝用户这个人群中占比也是非常小的。如果这个数据换一种表达方法,就是每个占比只以各自的年龄阶段为基础,那么估计40-49岁的数据就要比18-25岁的数据大很多了。
我们继续来看另外的一个案例,很多人都喜欢做市场容量的分析图,去分析市场的容量,他会把过去一段时间的支付金额做成饼图,然后分析根据这个图的占比来分析他的市场容量
例如,我们在图上看到裤子的市场容量占比是10%,而T恤的市场容量占比是8%,如果从表面上来看,裤子的市场容量是比T恤要更大,但是如果你仔细了解一下背后的数据来源你可能就会有不一样的答案,裤子的数据是有打底裤,休闲裤,西装裤,棉裤/羽绒裤等多个子类目组成,而T恤下面并无子类目,他的所有数据都是来自T恤这个子类目,而且,T恤主要是集中在夏季这一个季节,到了冬季的时候,虽然也有长袖T恤,但是那个占比已经比较少了。而裤子不同,长裤,短裤都是裤子类目,除了牛仔裤外,其他的子类目裤子都是在裤子这个类目,因此,如果你完全根据这个数据的大小去选择市场容量的话,你可能就会出现问题
有些人在选择市场切入的时候,喜欢选择这种数据大的市场容量的市场,不会去选择数据小的市场容量的市场,他们认为数据小的说明没有市场。
其实,这里面也是会经常误读的,例如上图,有一个抹胸市场容量占比是0%,可能很多人会觉得这个类目没有什么市场,不值得的去做。
但是你搜索抹胸这个关键词然后按照销量排名,你觉得这个市场容量会小吗?
很多的时候我们就是容易让数据表面给误导,例如抹胸我们做的图之所以市场容量为0%,是因为第一个我们统计的数据是按照支付金额统计的,而抹胸因为客单价非常低所以他的支付金额特别比较低,可能三四件抹胸的都没有一件T恤的价格高,这也就导致了他的支付今天看起来比较低,如果你换成的是成交件数,那么肯定你就会得出另外一种结果,另外,0%不代表是真的0,而是因为四舍五入最后的结果是0%。0.4%的结果也是0%,可能很多人还是会说0.4%还是比较低,其实,低和高要看你的基数有多大,如果你的基数是100000亿,那么这个0.4%的数量也不少了的。
继续再来看一个例子,我们在优化标题的时候都喜欢去看关键词的搜索指数,很多人只要看到搜索指数低的人就认为是没有人在搜索,这种词就不应该用
例如大家看到上面这个图,可能很多人会觉得这个词带不来流量,因为都没有人搜索,而我曾经有一个宝贝前期就是靠这个关键词带来流量的,虽然每天没有太多,就那么几十个,但是,因为这个词特别精准,我的宝贝竟然每天能成交那么一两单,对于前期来说,这个数据已经非常好了。
其实,这个也是很多人对数据没有去了解他背后造成原因导致的结果,他把搜索人气零当成了是没有人搜索,其实根本就不是这个意思,搜索人气是根据统计周期内的用户搜索人数拟合出的指数类指标,也就是说,这个数据让淘宝处理了,0只是代表他趋势很小,相对其他的关键词来说,他的这个搜索人数可以忽略不计。但是并不代表他完全没有搜索,中国好几亿的淘宝用户,每天如果只有几十百来个人在搜索,这个数据相对于整体来说基本可以忽略不计,但是如果没有人和你竞争,那么这几十百来个流量也就是你一个人了,对于很多新店铺来说,前期每天能有几十百来个流量也是好的,最关键的是因此词精准,转化率高,虽然每天只能带来一两单,但是相对那些一天一单都带不来的商家,这个数据也算好的。
举例了这么多,其实都只是想说明一个点,在分析数据的时候,一定要重点分析的是数据背后的东西,他是怎么造成这个数据的,要从多个维度去分析数据。而不是简单的只看看表现的数据,然后根据表面的数据就下决定。
- ?
数据分析、机器学习必读书目系列——《利用Python进行数据分析》
初丹
展开
数据分析、机器学习及人工智能必读书目——工具篇之《利用Python进行数据分析》
我们已经进入了全新的数据时代,大数据、云计算、物联网、机器学习、人工智能等等一系列技术纷至沓来,数据的管理和应用已经渗透到每一个行业和业务领域,成为当今以及未来商业运作的基础资产。可以说,只有掌握数据并善于运用数据的人,才会在竞争日益激烈的环境中寻得先机。 那么我们该怎么样学习大数据分析、机器学习以及人工智能?作者认为,学习大数据、机器学习和人工智能,所需的知识分为五个层次,一是数学知识;二是统计学知识;三是算法知识;四是工具知识;五是哲学思想知识。所谓工具知识,就是我们需要借助计算机软件来完成相关的分析和运算,目前大数据和机器学习领域热门的语言就是 R 和 Python。我们会分别介绍这五个层次所需要看的书,希望对大家有用。
《利用Python进行数据分析》
作者:Wes McKinney
译者:唐学韬 等
页数: 464
出版:机械工业出版社 2013年版
简要评价:
Python 正迅速成为数据科学家们钟爱的编程语言,原因在于其简单优雅,提供了一种覆盖范围更为广阔的编程语言生态系统,以及具有一定计算深度且性能良好的科学计算库。在 Python 自带的科学计算库中,Pandas 模块是最适于数据科学相关操作的工具。它与 Scikit-learn 两个模块几乎提供了数据科学家所需的全部工具。
本书正是由大名鼎鼎的 Pandas 模块的作者亲自撰写的,功底非常深厚,数据分析有着很丰富的经验,因此写出的书也是深入浅出,让人很容易就能看懂,非常适合刚刚接触 Python 的分析人员以及刚刚接触科学计算的 Python 程序员。当然,因为定位为入门,所以这本书相对比较浅显,看完之后想再进一步,还需要更加深入的钻研。
内容介绍:
还在苦苦寻觅用Python控制、处理、整理、分析结构化数据的完整课程?本书含有大量的实践案例,你将学会如何利用各种Python库(包括NumPy、pandas、matplotlib以及IPython等)高效地解决各式各样的数据分析问题。 由于作者Wes McKinney是pandas库的主要作者,所以本书也可以作为利用Python实现数据密集型应用的科学计算实践指南。本书适合刚刚接触Python的分析人员以及刚刚接触科学计算的Python程序员。
将IPython这个交互式Shell作为你的首要开发环境。
学习NumPy(Numerical Python)的基础和高级知识。
从pandas库的数据分析工具开始。
利用高性能工具对数据进行加载、清理、转换、合并以及重塑。
利用matplotlib创建散点图以及静态或交互式的可视化结果。
利用pandas的groupby功能对数据集进行切片、切块和汇总操作。
处理各种各样的时间序列数据。
通过详细的案例学习如何解决Web分析、社会科学、金融学以及经济学等领域的问题。
作者简介
Wes McKinney 资深数据分析专家,对各种Python库(包括NumPy、pandas、matplotlib以及IPython等)等都有深入研究,并在大量的实践中积累了丰富的经验。撰写了大量与Python数据分析相关的经典文章,被各大技术社区争相转载,是Python和开源技术社区公认的权威人物之一。开发了用于数据分析的著名开源Python库——pandas,广获用户好评。在创建Lambda Foundry(一家致力于企业数据分析的公司)之前,他曾是AQR Capital Management的定量分析师。
名家推荐
“科学计算和数据分析社区已经等待这本书很多年了:大量具体的实践建议,以及大量综合应用方法。本书在未来几年里肯定会成为Python领域中技术计算的权威指南。”
——Fernando Pérez 加州大学伯克利分校 研究科学家, IPython的创始人之一
书籍目录
前言
第1章 准备工作
本书主要内容
为什么要使用Python进行数据分析
重要的Python库
安装和设置
社区和研讨会
使用本书
致谢
第2章 引言
来自bit.ly的1.usa.gov数据
MovieLens 1M数据集
1880-2010年间全美婴儿姓名
小结及展望
第3章 IPython:一种交互式计算和开发环境
IPython基础
内省
使用命令历史
与操作系统交互
软件开发工具
IPython HTML Notebook
利用IPython提高代码开发效率的几点提示
高级IPython功能
第4章 NumPy基础:数组和矢量计算
NumPy的ndarray:一种多维数组对象
通用函数:快速的元素级数组函数
利用数组进行数据处理
用于数组的文件输入输出
线性代数
随机数生成
范例:随机漫步
第5章 pandas入门
pandas的数据结构介绍
基本功能
汇总和计算描述统计
处理缺失数据
层次化索引
其他有关pandas的话题
第6章 数据加载、存储与文件格式
读写文本格式的数据
二进制数据格式
使用HTML和Web API
使用数据库
第7章 数据规整化:清理、转换、合并、重塑
合并数据集
重塑和轴向旋转
数据转换
字符串操作
示例:USDA食品数据库
第8章 绘图和可视化
matplotlib API入门
pandas中的绘图函数
绘制地图:图形化显示海地地震危机数据
Python图形化工具生态系统
第9章 数据聚合与分组运算
GroupBy技术
数据聚合
分组级运算和转换
透视表和交叉表
示例:2012联邦选举委员会数据库
第10章 时间序列
日期和时间数据类型及工具
时间序列基础
日期的范围、频率以及移动
时区处理
时期及其算术运算
重采样及频率转换
时间序列绘图
移动窗口函数
性能和内存使用方面的注意事项
第11章 金融和经济数据应用
数据规整化方面的话题
分组变换和分析
更多示例应用
第12章 NumPy高级应用
ndarray对象的内部机理
高级数组操作
广播
ufunc高级应用
结构化和记录式数组
更多有关排序的话题
NumPy的matrix类
高级数组输入输出
性能建议
附录A Python语言精要
喜欢闲适安静的生活,懂一点计算机编程,懂一点统计学和数据分析。(爱编程爱统计)
- ?
有哪些你看了以后大呼过瘾的数据分析书?
万靖荷
展开
推荐两本真正意义上的神书,一本是《Pattern Recognition and Machine Learning》(PRML),一本是《Deep Learning》(Ian Goodfellow和Yoshua Bengio写的那本),绝对符合题主“看了以后大呼过瘾”的标准。这两本书都是属于“大而全”的类型,两本书都是从头到尾讲清楚了一个领域的细节。PRML是传统机器学习,《Deep Learning》是讲的最近几年兴起的深度学习。
先说说PRML。之前也看过很多机器学习的书,大多数书讲解模型时,都只会讲一个在某种情形下简化的特殊版本。如针对分类的模型,讲了一个0-1两类分类模型就结束了,如何应用到多分类就一笔带过。再比如回归模型,也只是讲个单变量不带正则项的最简化版。至于加什么正则、为什么这么加更是很少涉及的话题。而看PRML的感觉就像作者拿着一个放大镜,带你从模型的motivation、模型的推导过程、模型的推广、这个模型和其他模型的联系等方方面面讲解,而且每一个部分都很详细,都有非常细致的推导过程,每步推导过程还都有解释,这真的是太贴心了。
可能这样说还是会有人不是很明白,我就举几个具体的例子。比如线性回归,很简单的人人都懂的: ,大多数书会讲到 的求解就结束了,稍微详细点的书会告诉你线性回归的本质是:回归目标在 列向量张成的空间的投影,就是最好的 ,但也就仅此而已了。PRML里讲线性回归用的式子是 y=wTΦ(x) ,不仅可以讲清楚线性回归的基本原理,而且可以利用 Φ(x)告诉你线性回归实际上也可以看做一种核方法,这就给之后章节做了铺垫。PRML还推导了以下事情:1. 为什么多维的y与一维的y在本质上是等价的(从一维到多维的推广) 2. 加L2正则和L1正则项本质是以不同的先验分布看待w 3. 为什么L1正则会产生sparse的结果 4. 对线性回归的bias-variance decomposition告诉你机器学习中无处不在的tradeoff:bias、variance等等。这样整个模型才算是学透了。
另外PRML概率图的那一章写的真的太棒了,堪称完美,也是看这一章我才真正搞懂了概率图模型。写到这里请允许我小小的黑一下周志华老师的西瓜书,西瓜书中讲概率图模型时直接就是隐马尔科夫模型,这样虽然比较简洁,但让人搞不懂概率图究竟是怎么定义的、还有隐马尔科夫模型的图是怎么画出来的。西瓜书上只是说“图中的箭头表示了变量间的依赖关系”,然而到底是什么样的依赖关系?实在是让我一头雾水(隐马尔科夫确实是一个难点,见过好多人无法理解。。)。直到看到PRML中时我才搞清楚所谓“依赖关系”实际上是变量间的“条件独立”。PRML中是怎么样讲概率图模型的呢?它是从概率论中的条件独立讲起的,相当于是讲模型之前先带你把最重要的基础知识复习一遍。讲完条件独立后又讲了最简单的三个概率图: A<--B-->C、A-->B-->C、A-->B<--C。并一一分析了图中蕴含的条件独立性,又做了联合分布的分解。这之后才开始过渡到隐马尔科夫模型,这样一步一个台阶,非常容易理解。
《Deep Learning》和PRML有点像。同样也是非常详细的,就不展开写了。
说了那么多,其实我想表达的是:与其对很多模型一知半解,不如真正学懂一个模型,这样其实是节省时间的。原因在于当你搞懂一个模型后,就算你忘记了某些细节,再次查看资料也可以很快回忆起来。而当你不懂一个模型时,每次回忆都要从零开始,来来回回其实浪费了很多时间。而PRML和《Deep Learning》就是让你真正理解机器学习算法的最佳途径之一,强烈推荐。
“如果你有大把时间的话,可以忽视以下回答,直接转入scikit-learn: machine learning in Python”
如果能仔仔细细看完,保证你基础扎实的不要不要的。因为其实我看过的百分之七十的教材都是在部分官方文档上进行讲解,推广与应用,比如from sklearn...import...,降维啊,如何处理有问题的raw dataset等等。(我看的不多,不排除有更好的书)
如果你不想看官方文档的话...
推荐教材的来源来:PACKT,O‘Reilly,Springer和Apress出版社。其中以PACKT偏多,时不时逛逛PACKT主页,会有好多Latest Releases书籍和Bestselling eBooks,其中不乏许多数据分析类的书,可以多留个心眼~当然我不是从这上面买的ebook...贵...底下会贴一个免费下载书的网站,其中基本上囊括了上面多位答主提到的好书。
第一本《Hands-On Machine Learning with Scikit-Learn and TensorFlow》
这是我读的第一本数据分析加深度学习类且觉得过瘾的的书。来来回回读了大概有三遍。
亚马逊评分:
另外也可以发现....
全书编排思路非常清晰,分为两部分:The Fundamentals of Machine Learning以及Neural Networks and Deep Learning,前一部分基于sklearn,介绍通用的机器学习算法,后一部分涵盖了TensorFlow的多服务器部署,CNN,RNN,自编码器,强化学习,非常全面,而且不失深度。本书在第一章综述之后,在第二章就直接上California Housing Prices数据集,用实例讲解了如何对数据进行各种处理、可视化等等,各种注意点写的非常详细。后半部分又很好地与目前很火的深度学习、强化学习等对接。另外在每一章最后都有Exercise模块,考察读者对每种算法的理解程度,同时在附录A中也给出了Exercise Solutions。这本书的Appendix也是一大亮点。不足之处就是没有介绍Naive Bayes(好吧其实要深入了解贝叶斯可以去看楼上提到的绿皮书,理论部分可以看《Bayesian Reasoning and Machine Learning》)。自己去看就知道了~全书564页。
第二本书是《Python: End-to-end Data Analysis》
在PACKT官网上属于Bestselling eBooks。
先说明一下这本书有1501页...从Module1中如何使用最基本的工具包部分Numpy,Pandas,Matplotlib,PyMongo,sklearn开始,到Module2中的Statistical data analysis and probability以及Web Mining,Database,and Big Data,亦或Selecting Stocks with Financial Data Anaylsis等等,到最后Module3中的机器学习算法的应用,基本上涵盖了几乎所有与数据分析相关的内容。重要的事说三遍:全书1501页,全书1501页,全书1501页。
第三本是《Python Machine Learning Blueprints》
以下是它的目录以及亚马逊上一位读者的feedback:
I'd been working on some personal projects in Python 3 that related to Machine Learning and Natural Language Processing when I saw the author's post on LinkedIn, so I picked it up. As it happened, it saved me some time and trouble, as well as showed me ways I could have avoided some of the same......What the author does, successfully, is take a lot of the guesswork and research on the topics in the book and make them easily done by someone with basic Python experience.I highly recommend this book for anyone that wants to pe into machine learning and is willing to work through the examples - at least the ones that interest them. With code on Github or downloadable from the Publisher's site, it's easy to proceed at the reader's own rate.
与其他一些只讲最基本原理和sklearn基本功能的书相比,这本书一看目录就是那种想让人跃跃欲试的有木有?全书324页。
最后一本是《Advanced Machine Learning with Python》
说实话这本书让我大呼过瘾的地方是其中的Further reading部分,包括了许多国外讲解算法的优秀博客、PPT、视频教程等,就像作者在所说:
At the end of each chapter, I refer you to further reading, in a book or online article, so that you can build a broader base of relevant knowledge. I'd suggest that it's worth doing additional reading around any unfamiliar concept that comes up as you work through this book, as machine learning knowledge tends to tie together synergistically; the more you have, the more readily you'll understand new concepts as you expand your toolkit.
比如以下就是第八章Ensemble Methods最后Further reading部分中作者给出的额外阅读材料:
。 但是至于其他部分的话,作者介绍的PCA,SOM,RBM等在其他资料中也可以看到,大同小异。可看可不看。全书390页。
- ?
2017大数据、数据分析学习资料合集(含学习路线图)
居律师
展开
给大家整理一下本年度一些优质的文章,根据大数据相关的知识点一个个整理的,整理的内容包括知识点普及、学习书籍、学习路线图、学习笔记、学习资料、学习视频等等。
AI时代就业指南
未来已来:AI时代就业指南
AI时代就业指南:计算机、统计完全零基础,到底能不能学数据分析?
AI时代就业指南:数据科学人才成长之路
AI时代就业指南:Java 程序员如何转行做大数据?
AI时代就业指南:企业在招什么样的大数据工程师?
AI时代就业指南:女生适合做数据分析吗?
AI时代就业指南:数据挖掘工程师成长之路
AI时代就业指南:数学专业,你看不见的前尘似锦
AI时代就业指南:数据挖掘入门与指南
AI时代就业指南:普通程序员如何转向AI方向
AI时代就业指南:作为大数据从业人员,如何写好一份可堪入目的简历?
大数据
【入门】大数据行业如何入门-书籍、工具、案例(问题集锦)
【工具】2017 年你应该学习的编程语言、框架和工具
【资料】史上最全的“大数据”学习资源(上)
【资料】史上最全的“大数据”学习资源(下)
【路线图】大数据工程师学习路线图
【路线图】2017年最全的数据科学学习计划
【就业】2016年数据科学薪酬大盘点
【学习群】数据挖掘-机器学习
数据分析
【入门】数据分析那些事(数据分析师入门必看)
【职业】数据分析与数据挖掘类的职位必备技能
【职业】与大数据相关的工作职位有哪些?
【路线图】数据分析师学习路线图
【路线图】数据科学学习路线图
【书单】数据分析师的必读书单
【学习群】人人都是数据咖
统计学
【书单】统计学入门经典书单
【视频】大数据统计学基础
【学习群】大数据-统计分析
SQL
【文章】实用SQL语句大全
【笔记】SQL学习点滴合集
【视频】13次课了解sql2008的故事
Python
【教程】python快速教程
【文章】python爬虫实战
【文章】Python-pandas技巧系(量化小讲堂)
【路线图】python学习路线图
【路线图】Python大数据学习之路
【资料】python机器学习入门资料梳理
【视频】Python入门:数据分析与数据挖掘
【课程】Python进阶:数据挖掘实战
【学习群】Python数据挖掘-初级
【学习群】Python数据挖掘-高级
R
【文章】R语言知识体系
【文章】怎样学习R(上、下)
【文章】ggplot2绘图入门系列
【文章】R利剑NoSQL系列文章
【文章】R语言常用数据挖掘包
【路线图】R语言学习路线图
【视频】R学习免费学习视频
【课程】R语言入门
【课程】R语言实战
【课程】机器学习与R语言实践
【课程】R语言量化交易
【工具】全球最火的R工具包一网打尽,超过300+工具,还在等什么?
【学习群】R语言数据挖掘-初级
【学习群】R语言数据挖掘-中高级
Hadoop
【文章】Hadoop学习路线图
【文章】RHadoop实践系列文章
【教程】Spark入门实战系列教程
【课程】大数据实战工具Spark
【学习群】大数据-hadoop-spark
数据挖掘/机器学习
【入门】机器学习和数据挖掘推荐书单
【路线图】R语言学习路线图及R数据挖掘包
【路线图】Python数据分析和数据挖掘学习路线图
【路线图】机器学习路线图
【资料】近200篇机器学习&深度学习资料
【学习群】大数据-机器学习
因文本问题无法嵌入链接,请复制http://ppvke/Blog/archives/27665 至浏览器查看原文
- ?
关于数据分析那些事,看这一篇文章就够了
安南
展开
「目录」
1.什么是数据分析;
2.数据分析职业介绍;
3.数据分析生涯规划;
4.数据分析薪酬情况;
5.数据分析基本素质;
一、到底什么是数据分析呢?
数据分析是基于商业目的,有目的的进行收集、整理、加工和分析数据,提炼有价信息的一个过程。
▊其过程概括起来主要包括:明确分析目的与框架、数据收集、数据处理、数据分析、数据展现和撰写报告等6个阶段。
1、明确分析目的与框架
一个分析项目,你的数据对象是谁?商业目的是什么?要解决什么业务问题?数据分析师对这些都要了然于心。
基于商业的理解,整理分析框架和分析思路。例如,减少新客户的流失、优化活动效果、提高客户响应率等等。不同的项目对数据的要求,使用的分析手段也是不一样的。
2、数据收集
数据收集是按照确定的数据分析和框架内容,有目的的收集、整合相关数据的一个过程,它是数据分析的一个基础。
3、数据处理
数据处理是指对收集到的数据进行加工、整理,以便开展数据分析,它是数据分析前必不可少的阶段。这个过程是数据分析整个过程中最占据时间的,也在一定程度上取决于数据仓库的搭建和数据质量的保证。
数据处理主要包括数据清洗、数据转化等处理方法。
4、数据分析
数据分析是指通过分析手段、方法和技巧对准备好的数据进行探索、分析,从中发现因果关系、内部联系和业务规律,为商业目提供决策参考。
到了这个阶段,要能驾驭数据、开展数据分析,就要涉及到工具和方法的使用。其一要熟悉常规数据分析方法,最基本的要了解例如方差、回归、因子、聚类、分类、时间序列等多元和数据分析方法的原理、使用范围、优缺点和结果的解释;其二是熟悉1+1种数据分析工具,Excel是最常见,一般的数据分析我们可以通过Excel完成,后而要熟悉一个专业的分析软件,如数据分析工具SPSS/SAS/R/Matlab等,便于进行一些专业的统计分析、数据建模等。
5、数据展现
一般情况下,数据分析的结果都是通过图、表的方式来呈现,俗话说:字不如表,表不如图。。借助数据展现手段,能更直观的让数据分析师表述想要呈现的信息、观点和建议。。
常用的图表包括饼图、折线图、柱形图/条形图、散点图、雷达图等、金字塔图、矩阵图、漏斗图、帕雷托图等。
6、撰写报告
最后阶段,就是撰写数据分析报告,这是对整个数据分析成果的一个呈现。通过分析报告,把数据分析的目的、过程、结果及方案完整呈现出来,以供商业目的提供参考。
一份好的数据分析报告,首先需要有一个好的分析框架,并且图文并茂,层次明晰,能够让阅读者一目了然。结构清晰、主次分明可以使阅读者正确理解报告内容;图文并茂,可以令数据更加生动活泼,提高视觉冲击力,有助于阅读者更形象、直观地看清楚问题和结论,从而产生思考。
另外,数据分析报告需要有明确的结论、建议和解决方案,不仅仅是找出问题,后者是更重要的,否则称不上好的分析,同时也失去了报告的意义,数据的初衷就是为解决一个商业目的才进行的分析,不能舍本求末。
二、数据分析师职业介绍
做数据分析前我们首先要明确分析目的和内容,对于数据分析师而言,他们的进阶需求无外乎是各个企业对数据分析师的职位要求。在前程无忧、中华英才网以及智联招聘上,我们随便搜索下数据分析的岗位信息,都能找到大量类似于下面的一些职位要求信息:
▊别看岗位职责,任职要求这么多,说白了主要就三点要求:
1)对相关业务的理解;
2)掌握一到二种数据分析工具;
3)良好的沟通。
可能不同的公司因为需求不同,会在要求上有点小小的不同,而这个不同主要集中在数据库上。了解数据分析师的具体需求之前,我们有必要先了解数据分析师的职位体系。
「数据分析师的职位体系」
在传统行业中,数据分析更多存在移动、银行、超市等行业,在这些行业中你才会偶尔听到数据分析师这个职位,也许更多是听到数据挖掘工程师、数据建模师。在中国也许只在电信的项目中,才会存在真正的意义上的数据挖掘。
▊数据行业从广义上讲可以分为以下几个职位:
1、数据分析师
更注意是对数据、数据指标的解读,通过对数据的分析,来解决商业问题。主要有以下几个次层次:
1)业务监控:诊断当前业务是否正常?是否存在问题?业务发展是否达到预期(KPI)?如果没有达到预期,问主要问题在哪?是什么原因引起的?
2)建立分析体系:这些数据分析师已经对业务有一定的理解,对业务也相对比较熟悉,更多帮业务方建立一套分析体系,或者更高级是做成数据产品。例如:营销活动。分析师会告诉业务方,在活动前你应该分析哪些数据,从而制定恰当的营销计划。在营销过程中,你应该看哪些数据,从而及时做出营销活动调整。在营销活动,应该如何进行活动效果评估。
3)行业未来发展的趋势分析:这应该是数据分析师最高级别,有的公司叫做战略分析师/商业分析师。这个层次的数据分析师站的更高,在行业、宏观的层面进行业务分析,预测未来行业的发展,竞争对手的业务构成,帮助公司制定战略发展计划,并及时跟踪、分析市场动态,从而及时对战略进行不断优化。
主要技能要求:
数据库知识(SQL至少要熟悉)、基本的统计分析知识、EXCEL要相当熟悉,对SPSS或SAS有一定的了解,对于与网站相关的业务还可能要求掌握GA等网站分析工具,当然PPT也是必备的。
2、数据挖掘工程师
更多是通过对海量数据进行挖掘,寻找数据的存在模式、或者说规律,从而通过数据挖掘来解决具体问题。数据挖掘更多是针对某一个具体的问题,是以解决具体问题为导向的。例如:聚类分析,通过对于会员各种人口统计学、行为数据进行分析,对会员进行分类,对不同的类型的会员建立相应的profiling,从而更好的理解会员,知道公司会员是到底如何?高、中、低低价值的会员构成,既可以后期各种会员的运营提供指导,提高活动效率,可以指导公司的营销,例如广告的投放策略。以及用于公司各种战略的制定。
主要技能要求:
1)数据库必须精通。很多时候,你模型的数据预处理,可能完成在数据库里完成,你用到的数据库技巧更高。
2)必须要会成熟的数据挖掘工具、数据挖掘算法,例如:SPSS/CELEMENTINE、SAS/EM等,当然如果你会一、二款开源软件,并会写一些程序代码那是最好的,大公司都喜欢用开源的软件,例如:R、WEKA。
3、数据建模师
这个职位与数据挖掘工程师还是有本质区别的。数据建模师,更多偏向于中、小数据量,而且其使用更多更多是统计学的方法,而数据挖掘中的例如:决策树、神经网络、SVM等在这里是根据不会涉及的。
当然二者有一个共同之处都是,针对很具体的问题,都是会解决某个具体问题,例如:营销反应率,你就可能历史的邮箱、短信的反应情况,来建模型进行预测,从而提高邮件反应率,或者减少对用户来说的“垃圾”邮箱,提高用户体验。所以从掌握的技能上讲,这二者就有很大的区别,数据建模师其实很少会提到算法这个词,更多说使用什么模型,有感觉吗?但是从实务界来看,这二个模型越来越没有明确的分工,一般来说都会二个职位的人都会去学习对方的知识,所以这二个职位有合并的趋势,但在未来几年来,我觉得公司要招人的时候应该还是要有区别的。
新进入数据行业的同学,可以根据自己的背景背景选择相应的职位,学数据、统计学的朋友更多可以偏向于建模师,而计算机特别是写编程出现和同学,可以走数据挖掘工程师,也许适应性更好,但这不是绝对的。
▊数据分析师的职位级别划分:
不同公司对数据分析师的职位划分骚有不同,在一些中小型企业,没有成立独立的数据中心前,数据分析的相关职位往往是在譬如市场部、运营部这些部门之下,通常数据分析成员在2-4人不等。对于一些大型企业,有独立的数据部门的企业,其数据分析团队人员则是十到百人不等,其职位头衔有通俗的总监、经理、主管划分,也有助理、资深、专家之类的划分。下面是一张微博上传的比较火的某集团的数据分析师职位级别划分图表,大家可根据自身的情况对号入座。
「下图来自微博阿里的朋友分享」
(单击图片可缩放查看大图)
三、数据分析职业生涯规划
▊按照不同分析方法所能给人带来的智能程度,可以把分析能力划分为以下8个等级:
上面的8级划分源自SAS网站的Eight levels of analytics,由IDMer编译而成,个人觉得其中的8张图片非常形象生动,网友@数据小宇军用两个图表将它们更好地展示出来了:
▊数据分析师的级别:
1、数据跟踪员:机械拷贝看到的数据,很少处理数据
虽然这个工作的人还不能称作数据分析师,但是往往作这样工作的人还都自称是数据分析师,这样的人,只能通过×××系统看到有限的数据,并且很少去处理数据,甚至不理解数据的由来和含义,只是机械的把自己看到的数据拷贝出来,转发给相应的人。这类人发出来的数据,是否有意义,怎么解读,他自己是不知道的,只能期望收到数据的人了。
2、数据查询员/处理员:数据处理没问题,缺乏数据解读能力
这些人可以称为分析师了,他们已经对数据有一定的理解了,对于大部分数据,他们也知道数据的定义,并且可以通过监控系统或者原始的数据,处理得到这些数据。统计学的方法,这批人还是很精通的,统计学的工具,他们也是用起来得心应手,你让他们做一下因子分析,聚类肯定是没问题,各类检验也是用的炉火纯青。他们的不足是:1、如果不告诉他们命题,那么他们就不知道该应用什么样的方法去得到结论了。2、对于数据的处理没问题,但是却...
- ?
数据分析运用的4要点,你可以看看!
梦一常
展开
我是企业文化从心开始,20余年职场历练,高级企业文化师,中国首届企业自媒体大会优秀总编,中国内刊协会优秀内刊主编。欢迎关注、点赞、评论、转发、收藏、交流!
时代在发展,信息在进步,目前,许多企业对数据分析的作用已经有了更深刻的认识,那么做好数据分析工作,从企业文化的角度来看,应该把握哪四个要点呢?
1、随着信息技术的高速发展,数据分析为企业决策提供了有力的支撑。
众所周知,随着信息技术的高速发展,数据分析的技术条件不断成熟,各类软件的开发和使用已经不再是价格高昂、可望而不可及了。特别是通过数据库、数据软件的使用,已经可以极大的方便各类情况的统计、汇总、分析、运用,节约了领导分析情况的时间,提升了领导做出科学决策的全面性、实时性、针对性和有效性,已经成为信息时代的一个重要工具。从企业文化的角度来说,应该通过各种宣传、培训等方式,在企业内部大力营造学习信息技术、运用信息技术的良好氛围。
2、数据分析掌握在人的手中,首先要搞定人这个关键。
做好数据分析,首先要做好人的工作。因为数据分析相较于传统的分析方式虽然有许多的优点,但对于一些年龄较大或者运用传统方法熟练的领导来说,需要他们放下已经得心应手的方法,重新学习新的信息技术知识,对他们的思想和学习能力是一个考验。同时,各类数据的统计、汇总、分析均依赖于最基础的数据来源,对于每个终端数据的提供和录入人员来说,既可能大幅增加了他们的工作量,也可能会影响他们与上级沟通、交流的话语权,是否能够获得他们的支持是数据分析可否真正发挥作用的关键点。从企业文化的角度来说,应通过典型树立、问题剖析、成果分享等方式,不断地提升大家对信息数据的认识程度,强化大家积极学习、主动运用、沟通协作的意识。
3、数据分析只有更好地服务业务发展,才会有生命力。
做数据分析工作,最容易出现的一个问题是为分析而分析,为统计而统计,最终成为形而上学的数据,无法为生产经营和业务发展服务。从数据分析工作开始的第一天起,就必须强化全体人员数据分析应为生产经营和业务发展服务的意识。比如说成本控制,以往,许多企业的采购、物流、储存、生产、销售都依靠人工来处理,不仅速度慢,而且错误多。而通过大数据库建设,可以全过程的录入、比对、控制相关数据,实现信息数字化、数据实时化,通过将成本控制所涉及的从原料采购到产品生产、运输、储存、销售(部分可能包括回收、报废)等各环节有机结合起来,形成一个闭合的环,为成本控制提供可靠的数字化的依据。并以此为基础,通过数据分析不断优化,从而达到一个相对合理的平衡状态,最终实现有效控制成本的目的。
4、数据分析运用应小步快跑,持续为公司创造价值。
对数据分析运用来说,企业的日常生产经营都可以实施数据分析,但人的精力是有限的,数据分析这个团队的精力也是有限的。必须根据企业生产经营的总体规划,首先进行全面的摸排、梳理,确定企业目前最需要改善、通过数据分析可以实现改善的项目。在项目确定后,数据分析团队应进行充分的现场沟通了解与现状分析,再形成具体的方案,包括目前现状、准备采取的措施、需要公司支持的资源、预期的时间及效果等内容,报公司领导批准后,再正式实施。在这个项目的数据分析运用取得成功之后,再进行第二个项目的实施。在取得一批项目的成功实施后,再组织专题讨论研究会,梳理成功的经验与存在的问题,以及公司目前可以实施数据分析、以改善工作的具体项目,提出可行性的建议,请与会成员集中研究,最终报公司领导批准后实施。
如此,数据分析通过一次次为企业解决问题、创造价值,不断强化大家对数据分析的正面评价与正向认知,在不断积累经验的基础上,培养人才,营造氛围,从而更好地融入业务工作、服务业务工作,推进生产经营。
(图片来源自网络,版权属于原作者,如有侵权,请联系本人,以便及时删除处理)
我是企业文化从心开始,坚持原创,支持原创,如果您有关于企业文化的相关问题,欢迎关注、评论、留言、交流!
- ?
成为一名数据分析师,必须掌握的技术,学会了你就是大神
乔治
展开
一:编程能力
是否会编程是区别初级数据分析师和高级数据分析师的分水岭。在这里,我定位的是高级数据分析师,所以编程能力尤为重要,我把它放在了第一位。
有关数据分析的编程语言有Python和R语言。R语言倾向于统计分析、绘图等。统计学家或者学统计学的喜欢用R语言,而我推荐学习Python,因为Python是面向未来的语言,无论从流行度、可用性还是学习难度来讲,Python都是最好的入门语言。
当然,如果可以的话,再掌握一下R语言是最好不过的,学习嘛,永无止尽。
书籍推荐《Python编程:从入门到实践》 豆瓣评分:9.0
当然,只有Python基础肯定是不够的,既然是学习数据分析,肯定就要有数据才行,数据从哪里来,肯定是从互联网上来。互联网上的信息何其之多,必须要对其加以过滤处理,提取我们想要的信息。这就要用到Python爬虫,这也是学Python一个很重要的目的和作用。
学习Python爬虫肯定比学习Python基础要困难一下,但好在网上的学习资源十分丰富,努力学习必定会有收获的。
关于Python爬虫的书籍,目前我还没有较好的书籍推荐,如果说实在要推荐的话,我推荐三本书:
《Python网络数据采集》 豆瓣评分:7.7
《Python爬虫开发与项目实战》 豆瓣评分:8.1
《精通Scrapy网络爬虫》 这是十月份出的新书,豆瓣上还没有评分。
知乎里面有很多爬虫大神,没事多逛逛知乎总会有收获的。
关于编程能力,是一个很深的概念,需要靠大量的撸代码积累经验。先暂且说到这些。
二:SQL
学习数据分析,最难最重要的就是编程能力,熬过去了,后面的就稍微简单一些了。
既然是跟数据打交道,就免不了要使用数据库。
目前主要有四种数据库:
1:SQLite 是一个文件型轻量级数据库,它的处理速度很快,在数据量不是很大的情况下,可以使用SQLite。
2:MySQL 是一个应用极其广泛的关系型数据库,它是开源免费的,可以支持大型数据库,很多中小型企业都是用的MySQL。
3:MongoDB 是一个面向文档的非关系型数据库,它功能强大、灵活、易于拓展。
4:Redis 是一个使用ANSI C 编写的高性能key-value数据库,使用内存作为主存储器。
它们各有优点,可以灵活使用,如果说非要选一个的话,我建议使用MySQL,因为它使用最广泛。学习最主流的技术,可以在一定程度上发挥更大的作用。
关于SQL的学习资源:
购买书籍推荐《SQL基础教程》作者:MICK
豆瓣评分:9.0,好像这本书出了第二版了,建议购买最新版的。
三:数据分析能力
前面说了那么多,都是为了数据分析做准备。数据分析就好比亲手做一顿美食,现在食材有了(通过Python爬虫采集),盛放美食的容器也有了(数据库)。现在就差开火做饭了,写到这感觉肚子饿了,哎呀,忍住。
对于数据分析,我还没有过多的涉足,总之,多看书,多做项目。
这里我推荐几本书(都是放在我购物车里还没有买的书)
学习数据分析必看的书单:
《Python数据分析基础》八月份的新书,豆瓣上还没有评分。
《利用Python进行数据分析》2013年的老书,豆瓣评分:8.5
《Python数据处理》六月份的新书,豆瓣上没有评分。
《用数据讲故事》 豆瓣评分:8.7
虽然我还没来得及看这几本书,但是我想认真看了之后,对于数据分析的理解肯定会更加深刻的。
四:数据可视化
现在美食做好了,但不能一股脑的装在碗里吧,美食讲究色香味俱全。所以要给它作一个漂亮的造型,呈现在客人面前。这就是数据可视化。
数据可视化需要借助工具,什么工具呢?那就是大名鼎鼎的tableau!
什么?你没有听说过tableau?现在听我说了也不迟,哈哈。
tableau是一款世界级的商业智能工具软件,tableau可以帮助我们快速的分析、可视化并分享信息。在福布斯2017年公布的《10大需求增长最快的职场技能》报告中,tableau高居第三,成为数据分析和可视化的职场必杀技。
说了这么多,咱们还是好好聊聊怎么学习tableau吧。tableau是一款收费软件,先看一下它的价格吧:
image
果然优秀的软件都是收费的,而且还贵的要死。
但是,tableau的良心之处在于:学生和教师可以免费使用tableau,只需要用我们的学生证信息去免费申请一个序列码,然后就可以下载激活该软件,有效期为1年,如果一年后还是学生的话,还可以用学生证再去申请一个序列号,然后再免费用一年。
- ?
书单 | 从入门到精通,数据分析不得不看的10本「好书」!
纪醉蝶
展开
1、深入浅出数据系列书籍
深入浅出数据分析
入门级别,比较简单,但基本的内容涉及全面,讲解的比较清晰,最后谈到了R语言。以下两本是同一系列。
深入浅出统计学
深入浅出SQL
2、资料之美:优雅资料解决方案的幕后秘籍
知识普及性的书籍,集结了39位数据处理领域的翘楚,现身说法,分享他们如何开发各种简约而优雅的解决方案克服各种挑战,每章都解决一个具体问题,对理解数据分析的应用领域和具体做法很有帮助。
3、R 语言实战
全面而细致的R指南,高度概括了该软件和它的强大功能,展示了使用的统计示例,且对于难以用传统方法处理的凌乱、不完整和非正态的数据给出了优雅的处理方法。
4、数据之魅-基于开源工具的数据分析
包含大量的模拟过程及结果展示,并通过实例来阐述如何使用开源工具来进行数据分析。通过本书的阅读,读者可以清楚地了解这些方法的实际用法及用途。
5、数据挖掘技术:应用于市场营销、销售与客户关系管理
如何利用最新的数据挖掘方法和技术来解决常见的业务问题。
比如提高营销活动的响应率,识别新的客户群并估算信用风险。此外,它涵盖更多高级主题,如准备分析数据以及为公司数据挖掘创建必要的基础架构。
6、Python数据科学手册
每章介绍一到两个Python数据科学中的重点工具包。适合有编程背景,并打算将开源Python工具用作分析、操作、可视化以及学习数据的数据科学研究人员。对于需要处理大量数据的人而言,这是一本非常有价值的工作书,可以有效率地处理每天面对的问题,像是操作、转换,以及清理数据、可视化不同形式的数据,建立统计学或机器学习的模型等等。
7、用数据讲故事
通过大量案例研究介绍数据可视化的基础知识,以及如何利用数据创造出吸引人的、信息量大的、有说服力的故事,进而达到有效沟通的目的。如何充分理解上下文,如何选择合适的图表,如何消除杂乱,如何聚焦受众的视线,如何像设计师一样思考,以及如何用数据讲故事。
8、利用Python进行数据分析
提供了大量的实践案例研究,展示如何使用Python库(如NumPy,pandas,matplotlib, IPython等)有效解决一系列数据分析问题。
9、机器学习实战
用简单的语言把复杂难懂的机器学习算法解释清楚了,它将机器学习的基础理论与日常数据分析的实际工具相结合。使用灵活的Python编程语言来构建实现数据分类、预测、建议以及汇总和简化等更高级功能的算法的程序。
10、机器学习系统设计
比较简单,使用Python进行机器学习并开始构建自己的机器学习项目。本书适用于机器学习初学者的Python程序员,但希望学习机器学习。
最后,花时间将这些中外文书籍吃透,数据分析理论部分就基本入门了,实践方面就需要根据企业业务需求来进行系统的练习和学习!
- ?
数据分析入门必看的六个问题
古震剑
展开
大学生们就业难,连一些将被社会淘汰行业人员想要转行也不是件容易的事情?其实,很大一部分原因还是因为这些人既不愿意做辛苦的工作,又不愿意工资低,或者是因为没有选择一个前景好的行业。在这样的情况下,不如多多提升自身的技能,选择一个高薪的机会,而大数据就是这样的一个行业。下面西线学院为想要学习大数据的朋友们解答一些疑问。
一、为什么要学大数据?
大数据应用产业发展快速,大数据技术人才需求量大,麦肯锡预测,到2018年,在“具有深入分析能力的人才”方面,美国可能面临着14万~19万人的缺口,而“可以利用大数据分析来作出有效决策的经理和分析师”缺口则会达到150万。国内大数据人才有多大的缺口?目前尚无权威研究报告指出,不过今年2月万达集团的一份“求贤帖”颇能说明问题:万达开出50万~70万元年薪吸纳大数据架构师、大数据研发工程师和算法工程师,应者寥寥。
二、大数据难不难学?
回答是肯定的,大数据的学习是有一定的难度,但是只要你用心去学习,结果不会差。现在很多大数据培训机构都有零基础的课程,就是针对从来没有接触过大数据的朋友们的。其次,在大数据的职位中,如果你实在怕自己学不会,可能数据分析相对来说会简单一些。
这里也想对那些嫌弃自己薪资低又不愿意付出努力提升自己的朋友说:不要在空想了,不努力就踏实做自己现在的工作吧。
三、大数据要学习哪些课程?时间要多久?
课程可能每个培训机构学习的都是不同的,大数据需要java的基础,一般课程会分为R语言,python和大数据部分。时间要看你学习什么课程,零基础课程在4个月左右。西线学院课程每个阶段都有案例和项目结合,从简单到专业一步一步带领学生走进大数据世界,帮助学生顺利走上数据分析师的道路!
四、大数据该选择什么学习方式呢?
学习的方式有自学、视频学习、在线学习和线下学习。那么什么样的学习方式最适合你呢。建议是如果是零基础学习、自控力比较差、自学能力不是很强选择线下培训,有人监督加上交了钱,学习效果肯定要比自学好很多。另一种选择线下培训的情况是想要快速学习,不想办周期拖太长。其他如果是自学能力强,自控力也好的,可以选择自学。
五、大数据的薪资有多少?
大数据行业现在正是用人的时候,对于不少刚毕业的学生,薪资是非常可观的。而且经过沉淀,薪资过万很容易。
六、有没有哪家培训机构是可以保障就业薪资的?
有,但是你的想想,薪资是不是得按照个人的技术掌握情况来定,如果你自己都知道技术掌握不够好,培训机构跟你说保障你1万,你自己会信吗?心里有底吗?所以,薪资的多少,还是要根据个人的学习情况。
以上就是一些关于大数据的疑问解答,说得不对的地方,希望大家根据自身情况吸收。
数据分析必看
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并