- ?
Excel系列:Excel数据分析——参数估计
Kong
展开
一、描述统计
在数据分析的时候,一般首先要对数据进行描述性统计分析(Descriptive Analysis),以发现其内在的规律,再选择进一步分析的方法。描述性统计分析要对调查总体所有变量的有关数据做统计性描述,主要包括数据的频数分析、数据的集中趋势分析、数据离散程度分析、数据的分布、以及一些基本的统计图形,常用的指标有均值、中位数、众数、方差、标准差等等。
数据的集中趋势一般采用平均值、中位数表示。数据的离散程度一般采用方差、标准差表示。数据的分布情况一般采用直方图表示。
案例:北京房屋价格(数据文件:house_price.xlsx)
分析问题:
1)北京市政府为调控房地产价格,希望知道北京各小区房屋价格的分布,请分析房地产价格的集中趋势,并选择合适的图形呈现。
2)房地产商想知道北京各个环线房屋装修状况的对比情况,以便进行产品设计和市场拓展,计算指标并设计合适的图形呈现结果,最后给房地产商一些建议。
3)选择合适的图形反映北京各个区住宅区房屋分布情况
操作步骤:
1)基本描述统计
打开excel数据文件house_price.xlsx
选择描述统计,单击“确定”按钮。
2)直方图
根据描述统计的结果,在空白列构造间隔为0.5的等差数列作为接收区域D1:D19,最大值为9,最小值为0。
选择数据,单击“数据”选项卡,选择“数据分析”选项框中的“直方图”选项
输入区域选择房屋价格avgprice列$B$2:$B$186,接收区域选择第一步构造的接收数据,即D1:D19数据。
输出区域选择G3,勾选图表输出,然后单击“确定”按钮。
选中整个直方图,右键单击选择“设置数据系列格式”,单击“系列选项”,分类间距设为0。
备注:
基本概念:数据的集中趋势 离散程度 数据分布情况 透视表 直方图 柱形图 饼形图 堆积柱形图
二、排位与百分比排位
“排位与百分比排位”分析工具可以产生一个数据表,在其中包含数据集中各个数值的顺序排位和百分比排位。该工具用来分析数据集中各数值间的相对位置关系。该工具使用工作表函数 RANK 和 PERCENTRANK。
例:10名同学统计学考试成绩如下:
试进行排位和百分比排位。
(1)在EXCEL数据分析工具库中选择“排位与百分比排位”,弹出对话框如下:
排位与百分比排位对话框设置
(2)单击“确定”生成排位结果如图。
排位与百分比排位结果
(3)其中的百分比排位为:小于该值的个数/(小于该值的个数+大于该值的个数)
如88,小于该值的有7个,大于该值的有2个,百分比排位为7/9=77.78%,该工具截去了十分位数。
- ?
极简入门数据挖掘(一)
Cyprus
展开
如何快速入门数据挖掘?本文将以工程界公认的实施步骤为基础,并结合小编的多年实际工作经验,来给你打开数据挖掘的冰山一角。
其实工程界经过多年的实战经验,已经对数据挖掘形成了自己一套标准流程,该流程英文名叫CRISP-DM(Cross-industry Standard Process for Data Mining),中文名是“跨行业数据挖掘标准流程”,该流程是对数据挖掘生命周期的全面描述,共包含了6个步骤,其中特别注意的是该步骤并不是按照直线顺序进行,而是环状结构,需要根据实际项目情况,经常会回到上一个步骤中。
那么,每步骤具体要做什么?需要注意哪些点?不急!咱们往下看。
步骤1:业务理解
业务理解是指能够界定业务问题范围和理解业务目标,并能够根据具体业务需求,制定灵活的措施。该步骤作为第一步当然是至关重要,因为它指明了数据挖掘的分析方向和范围。有句俗话说的好“方向比努力更重要”。
为了更好的理解该步骤,就以小编的工作经历给大家说一下。有一天,领导在办公室突然大叫一声:“这个月收入下滑低太刺激,客户流失太严重了,吓死宝宝了”,并走到你的面前,“小王,你不是在玩数据建模吗,建一个客户流失模型吧,看看如何挽留客户提升收入。”小编接到这个艰巨的任务,头脑中灵光一闪,明白了领导的意图应该包含了三个问题。
问题1:预测哪些客户可能会流失?
问题2:可能流失客户有哪些特征?
问题3:如果开展营销活动,那么产生的预期收益是多少?
而要完成以上三个问题,这需要提前解答一下疑问:
(1)如何定义流失:是销户用户?还是3个月内无通话用户?还是欠费3个月以上用户?还是话费消费低于前六个月70%用户?因为不同的业务场景其定义不同,将导致模型输出不同。
(2)选择那些变量:比如用户基础信息,如年龄、性别、入网时长等;用户行为信息,如通话、上网、消费,订购等;用户交往信息,如社交圈等。这需要根据自身系统储存数据情况而定。
(3)如何确定时间窗口:考虑具体的业务场景,数据采集时间,营销需求等因素来确定时间窗口。
(4)如何获得效益:根据流失客户的特征描述,采集不同的营销举措,其中预期效益= 流失客户预期收入 - 流失客户挽留成本。
该步骤是将商业业务问题转化为数据问题,因此需要具备较强的业务背景知识储备以及对自有数据的熟悉程度。
步骤2:数据理解
数据理解是通过对收集的数据进行探索性分析,能够了解数据质量状况,同时考察数据的大致分布情况。其中数据探索是通过检验数据集的数据质量、绘制图标、计算某些特征量等手段,对样本数据集的机构和规律机型分析的过程。主要包括数据质量分析和数据特征分析。
(1)数据质量分析
数据质量分析包括缺失值分析、异常值分析和一致性分析。主要分析数据是否能够达到使用的标准。如数据缺失严重,分布异常等情况,将会导致数据质量低下,在进行后期建模的时候要慎重选择。
1)缺失值分析
缺失值分析分析包括原因分析、影响分析和统计分析。
缺失值产生的原因有:暂时无法获取或获取成本大;如用户地址;被遗漏;如基站故障,无法获取用户位置;属性值不存在;如校园客户的工作单位,儿童的配偶。
缺失值带来的影响有:可能导致丢失大量的有用信息;数据挖掘过程中模型蕴含的规律难把握,导致不确定性。
缺失值的统计分析: 通过简单的统计分析,统计含有缺失值属性的个数、以及每个属性的为缺失值和缺失率等相关指标;整体来讲可对缺失值进行不处理、删除、对可能值进行插补。
2)异常分析
异常分析包括简单统计、3σ原则、箱形图分析。
简单统计:可以做描述性统计,如统计最大值和最小值,判定数据是否在合理区间;如年龄超过200,则该值为异常值;
3σ原则:如果数据符合正态分布,异常值则定义为测量值超过平均值3倍标准差的值。P(|x-μ| ≥3σ )≤ 0.003
箱形图分析:异常值可表示为: QL - 1.5IQR或QU+1.5IQR ;其中QU为上分位,QL为下分位,IQR= QU - QL其中
3)一致性分析
一致性分析包括不一致影响和不一致产生原因
不一致影响:数据不一致主要是指数据的矛盾性、不相容性等原因造成的;如果不处理会导致相反的结果;
不一致产生原因:名称不一致,如终端品牌或机型的中英文;重复存放的数据未进行一致性更新;不同数据来源的数据,统计口径不同,导致数据不一致;
(2)数据特征分析
数据特征分布包括分布分析、对比分析、统计量分析、周期性分析、贡献度分析、相关性分析。主要了解数据自身的分布情况以及数据间的关联情况。
1)分布分析
分布分析可以揭示数据的分布特征和分布类型。
针对定性数据,可以做饼形图或条形图反应分布类型;
针对定量数据,可以做频率图或直方图进行直观地分析;
2)对比分析
对比分析是指把两个相关联系的指标进行横纵向或时间序列的对比分析
绝对数比较;利用绝对数进行比较;
相对数比较;用两个有联系的指标对比计算,包括结构相对数;比例相对数;强度相对数;动态相对数;完成度相对数;
3)统计量分析
统计量分析是用统计指标对数据进行统计描述,主要包括集中趋势和离中趋势两方面度量
集中趋势:反应平均水平的指标,即集中程度,主要包括平均数、中位数、众数等指标。
离中趋势:反应变异程度的指标,即偏离平均水平的程度,主要包括极差、标准差、变异系数,四分位数间距
4)周期性分析
周期性分析是探索某变量的变化是否随时间呈现周期性变化,主要有年、季度、月度、周、天、时等周期变化.
5)贡献度分析
贡献度分析又称20/80定律。同样的投入对不同客户会产生不同的收益
6)相关性分析
相关性分析是指用适当的统计指标来反映连续性变量之间线性相关程度的强弱。主要分析方式包括散点图和相关性系数
相关系数:Pearson相关系数、Spearman秩相关系数和判定系数
数据理解是保证数据挖掘分析结论有效性和准确性的基础。该步骤能够将业务与数据有机结合起来,保证后期的模型的可解读性。
【明天继续讲步骤3-6】
- ?
Python 爬虫实操,顺便做了个数据分析
柯水风
展开
【IT168 资讯】本文作者是一名地地道道的程序员,最大的乐趣就是爬各种网站。特别是在过去的一年里,为了娱乐和利润而爬掉了无数网站。从小众到主流电子商店再到新闻媒体和文学博客,通过使用简单的工具(如BeautifulSoup)获得了很多有趣且干净的数据—我也很喜欢Chrome 的Headless模式。
本文,作者将分析从Greek wine e-shop商店(一个希腊葡萄酒网站)中获得的数据,来看看哪种葡萄酒最受欢迎。
scraper本身相当简单,可以在GitHub页面(https://github/Florents-Tselai/greek-wines-analysis)找到。作者将着重于通过使用标准的Python包对得到的数据(1125个独特的标签)做一些快速的探索性分析。
scraper本身暴露了一个相当简单的API。首先,请求葡萄酒页面的数据,并将数据返回给nicedict,如下所示:
In [2]:
In [3]:
Out[3]:
然后,定义一些matplotlib。
In [4]:
加载由houseofwine_gr.dump模块生成的数据转储,开发者也可以在GitHub页面找到.json,.csv和.xlsx的数据集。
In [5]:
以下是所拥有数据的视图:
In [6]:
Out[6]:
用np.nan替换空的字符串,使它们更容易处理 Pandas。
In [7]:
重命名一些包含特殊字符的列名,以便将它们用作本机DataFrame存储器。
In [8]:
我们还将适当的类型分配给列:
In [9]:
让我们将color列值从希腊语翻译成英语。
In [10]:
以下是数据集的颜色直方图。
In [11]:
以下是每种葡萄酒的简单指标分布情况:
In [12]:
如图所示,Average Rating列几乎为正态分布,μ值高达85以上。 Reddit上的Kroutoner解释了为什么会发生这种情况(并纠正了作者以前的错误):
典型的葡萄酒评级是50-100,而不是0-100。所以看起来似乎只有一半分布,实际上是一个几乎完全的分布。此外,90分以上的葡萄酒一般被认为效果更好,销售也更好。这个事实改变了对数据的解释,也就是说大多数葡萄酒被评为好,只有一小部分被评为非常好。
为了进一步推进,来看一下tags 列。
似乎每个标签列表可以给出有关葡萄酒的各种属性(品种,甜味等)的信息。接下来,作者将这些属性分开,将tags列元素从list 转换为set列表元素,因为这样会使操作更简单。也就是说,不是在一个if x in -else-try-except-IndexError中,我们将使用set操作。
现在,做一些简单操作来提取关于甜度,温和性等信息,以下信息同样从希腊语翻译到了英语。
以下是4个属性中每一个属性的直方图:
在这一点上,开发者可以(几乎)安全地假设所有剩下的标签显示每种葡萄酒的品种信息,所以定义一个新的列来存储它们。
由于解析错误,列中出现了一些整数,我们将其过滤掉。
我们也可以添加一个布尔变量varietal。酒中的混合物只有一种的称为varietal,至少有两种混合物的称作blends。
对于varietal葡萄酒,我们设定了一个single_variety - 对于其他非varietal的葡萄酒来说,这个数值将是NaN。
让我们来看看Varietal / Blend的分布是怎样的。
这是一些指示性的情节。
In [27]:
看起来Chardonnay是最流行的品种,而Vidal和Sangiovese是最昂贵的品种。评分最高的是Malvasia,但所有品种都非常接近。
把注意力转移到blends上,我们做了一些Numpy和Scikit-Learn来产生blends的矩阵。
上面的代码简单地从这里得到:
对此:
这些是blends中出现频率最高的品种。
In [30]:
这里是一个热图,显示哪些品种通常混合在一起。
In [31]:
In [32]:
如果你有兴趣,欢迎来Github页面与作者交流。
- ?
首席数据分析师教你怎么一步步提升Kaggle竞赛模型的精确度
新晴
展开
作者:Werner Chao
翻译:白静
术语校对:黄凯波
本文长度为2800字,建议阅读8分钟
线上心理健康公司KaJin Health首席数据分析师教你怎么一步步提升Kaggle竞赛模型的精确度。
最近,Kaggle竞赛非常受欢迎,很多人都试图获得好成绩。但是,这些竞赛竞争十分激烈,获胜者通常不会透露其方法。通常情况下,获胜者只会写一个他们所做的事情的简单概述,而不会透露很多,所以用何种方法可用的提高模型精确度仍是一个谜。
这篇博文介绍了如何在Kaggle竞赛中提高模型精确度。我将分享一些如何获得较高分数且排名相对靠前(达到前10%)的步骤。这篇博文结构如下:
1. 数据探索(Data Exploratory)
1.1 数值数据(Numerical Data)
1.2 分类数据(Categorical Data)
2. 模型建立(Model Building)
2.1 线性回归(Linear Regression)
2.2 LASSO回归(Lasso Regression)
2.3岭回归(Ridge Regression)
2.3.1 数据转换(Data Transformation)
2.4 随机森林(Random Forest)
2.5 梯度推进器1(Gradient Boosting Machine)
2.6 神经网络(Neural Network)
2.7 叠加模型(Stacking Models)
1. 数据探索(Data Exploratory)
1.1 数值数据(Numerical Data)
首先,我们迅速浏览一下数据。这里有14组连续(数值)特征。令人感到意外的是,这些数据相当整齐。看以下两个图表,如果我们注意到平均数和标准差,会发现平均数在0.5左右,标准差在0.2上下。这意味着这些数据已经被转换过了。
接下来,我们将为这14组连续特征绘制直方图,这里我们要注意的是特征“cont7”和“cont9”左偏。
损失(Loss)变量的绘制情况并不好,因此我们为其绘制一个单独的直方图,发现损失变量也是左偏。
为了查明这些变量的偏斜程度,我们计算了偏斜度。“cont7”“cont9”和“损失”这三个变量的偏斜程度最高。
如果进一步绘制一个箱线图,我们会再次发现“cont7”和“cont9”有很多离群值。如果我们尝试修正偏斜度,可能会减少离群值的数量。
在此,我们将尝试三种转换类型,对它们进行比较,找出效果最好的一种,这三种转换类型分别是:对数(log)、开平方根(sqrt)和Boxcox转换。
我们能够清楚地发现Boxcox变换对这三种情况都起作用。但是我们不能将Boxcox变换用在“损失”(Loss)变量上,因为目前在Python里,没有撤销Boxcox的功能。因此,我们无法做到:在预测之后将“损失” (Loss)转换回去,再计算平均绝对误差(mean absolute error)。随后,我们将使用对数(log)来转换“损失”(Loss)变量。
1.2 分类特征(Categorical Features)
对于分类特征,我们可以绘制频率图。关于分类特征的几个要点如下:
类别标签A、B只与分类特征1到分类特征72有关;
73-78特征描述了两个以上的类别;
109-116特征表达了多种类别。
这里有几幅采样频率图来证明以上三点:
2. 模型建立(Model Building)
2.1 线性回归(Linear Regression)
分析完连续特征和分类特征之后,我们就可以开始建立模型了。要注意的是这个数据集非常完整,没有任何缺失数据。这里我们将要做的是建立一个工作流程,首先输入原始数据,然后随着我们对数据进行不同转换,可以将新模型与基准模型(原始数据案例)进行比较。原始数据案例是未经转换的连续特征和虚拟编码特征。至少,我们必须对分类数据做虚拟编码,这是因为sklearn模型不允许观察数据中有字符串。
我们可以拟合一个如下所示的线性回归:
如上所示,测试得分远大于训练得分。这意味着训练集过拟合。关于这个估计需要说明的一点是:我们正在使用平均绝对误差,这里这个值是负数是因为sklearn使其成为负值。所以当我们降低这个误差时(调整模型使误差更接近零),看起来却像是在提高分数(即:-1﹣(-2)=1,因此新成绩比以前的成绩高了1分)
2.2 LASSO回归(Lasso Regression)
很明显我们需要一个正则化,因此将使用Lasso回归。记住,Lasso回归只是线性回归加一个正则化项。我们可以在下面看到一个5折的交叉验证。我们得到的交叉验证分数大约为1300,接近之前线性回归1288的分数。这意味着我们处在正确的轨道上!虽然三种不同的情况产生的结果非常接近,但注意下面的网格搜索告诉我们最好的alpha是0.1.
2.3 岭回归(Ridge Regression)
另一个易于使用的正则化是岭回归。由于我们已经知道Lasso回归的效果很好,所以这个数据集很有可能是一个线性问题,我们将使用岭回归来解决这个问题。
2.3.1 数据转换(Data Transformation)
现在有了工作流程设置,我们将使用岭回归来检测不同的数据转换,探究哪种转换能得出最好的结果。记得之前我们已经对特征“cont7”和“cont9”进行了boxcox转换,但是并未真正实行(直到现在我们使用的一直是原始连续特征和独热编码分类特征)。现在我们将实行这个转换。
我们将实施并比较这些转换:
原始(数值/连续特征)+虚拟编码(分类特征)
Raw (numerical/continuous features) + Dummy Encode (categorical features)
归一化(数值)+虚拟(分类)
Normalized (num) + Dum (cat)
Boxcox转换&归一化(数值)+虚拟(分类)
Boxcox Transformed & Normalized (Num) + Dum (cat)
Box&范数(数值)+虚拟(分类)+log1(损失变量)
Box & Norm (num) + Dum (cat) + Log1 (Loss variable)
下表并列比较了交叉验证的误差,我们发现使用损失(目标)变量的对数得到了最好的结果。
2.4 随机森林(Random Forest)
现在我们已经进行了转换,并且知道这个问题是一个线性案例,我们可以转向更复杂的模型,比如,随机森林。
我们马上发现交叉验证得分从1251(来自岭回归)改进到1197。
2.5 梯度推进器(Gradient Boosting Machine)
我们将进一步采用更加高级的模型——梯度推进器(Gradient Boosting Machine)。这个程序库被称为极端梯度提升2(Xgboost),因为它优化了梯度推进算法。在此,我将分享优化过的超参数。调整极端梯度提升(Xgboost)是一门耗时的艺术,因此我们不在这里谈论。这篇博文论述的是一种循序渐进的方法,我将简要介绍这里采取的一般步骤:
1. 推测学习率和n_estimator
Guess learning_rate & n_estimator
2. 交叉验证调整min_child_weight和max_depth
Cross validate to tune for min_child_weight & max_depth
3. 交叉验证调整colsample_bytree和subsample
Cross validate to tune for colsample_bytree & subsample
4. 交叉验证调整gamma
Cross validate to tune for gamma
5. 降低学习率并调整n_estimator
Decrease learning_rate & tune for n_estimator
通过使用这些参数,我们能够得到的交叉验证分数为1150——再次改进了误差!
2.6 神经网络(Neural Network)
我们也将使用神经网络来拟合这个数据集。如今,不使用神经网络几乎不可能赢得竞赛。
神经网络的主要问题是它很难调整、也很难知道有多少层次、要使用多少隐藏节点。我的做法是先从单层开始,并且我使用的隐藏节点的数量是特征数量的两倍,然后慢慢增加更多的层次,最后我得到了如下结构。我用Keras作为前端,Tensorflow作为后端。在这个模型中,我得到的交叉验证分数是1115。
因此,可比较不同的模型:
2.7 叠加模型(Stacking Models)
还记得我们的初始平均绝对误差是1300吗?我们已经将这一误差改进了14%,数值降至1115。然而单一模型并不能让你在Kaggle竞赛中取得好名次,我们需要叠加模型。
叠加模型的概念是每个模型在什么情况下运行良好,就采用其最好部分。这篇博文一个扩展的指南和解释。
简化版本如下:
将训练集分割成几份(在我的案例中分成了5份);
在不同份数下训练每个模型,并对分割的训练数据进行预测;
设置一个简单的机器学习算法,如线性回归;
使用每个模型训练的权重作为线性回归的特征;
使用原始数据训练集目标作为线性回归的目标。
为了更容易理解上述步骤,我创建了下表:
我的叠加代码在Github存储库中。我叠加了两个最好的模型: 极端梯度提升(Xgboost)和神经网络。
提交我的叠加模型之后,我的测试得分为1115.75.
通过排行榜可以得知,如果我在竞赛结束之前提交模型,1115.75在3055个团队中大概排名326,你可以通过Kaggle排行榜链接进行查证,大概排在前10%到11%。
1.译者注:又译“梯度提升机”。
2.译者注:XGBoost是“极端梯度提升”(eXtreme Gradient Boosting)的简称,XGBoost源于梯度提升框架,但是更加高效。XGBoost已屡屡斩获Kaggle各项竞赛的冠军宝座。
- ?
用R语言做数据分析——R的四种图形系统
Winnie
展开
我们学习了各种各样的图形,它们大部分都是利用R语言的基础图形系统创建的。在R语言中,除了基础图形系统之外,R语言还提供了grid、lattice和ggplot2这三种图形系统,它们克服了R基础图形系统的低效性,大大扩展了的R语言的绘图能力。
grid图形系统可以很轻松地控制图形基础单元,给予编程者创作图形极大的灵活性。lattice包通过一维、二维或三维条件绘图来对多元变量关系进行直观展示。ggplot2包则基于一种全面的图形语法,提供了一种全新的图形创建方式。因为grid没有提供生成统计图形以及完整绘图的函数,因此数据分析师很少直接采用grid包来分析数据。这里重点介绍lattice和ggplot2图形系统。
四种图形系统的载入方式有所不同,基础图形函数可以自动调用,grid和lattice函数的调用必须要加载相应的包(library(lattice)),要调用ggplot2函数需要下载并安装该包(install.packages("ggplot2")),第一次使用还要引入加载该包(library(ggplot2))。
lattice包为单变量和多变量数据的可视化提供了一个全面的图形系统,它可以轻松生成栅栏图形。
在一个或多个其他变量的条件下,栅栏图形展示某个变量的分布或与其他变量间的关系。lattice包中singer数据集包含了合唱成员的身高和声部数据,让我们考虑以下问题:纽约合唱团歌手的身高随着他们所属的声部如何变化?来看以下代码:
>library(lattice)
> histogram(~height|voice.part, data=singer,main="Distribution of Heights by Voice Pitch", xlab="Height (inches)")
height是因变量,voice.part被称作条件变量,这段代码对八个声部的每一个都创建了一个直方图。图形显示了男高音和男低音比女低音和女高音身高要高。
在栅栏图形中,单个面板要依据条件变量的各个水平来创建。如果指定了多个条件变量,那么一个面板将按照各个因子水平的组合来创建。然后面板将被排成一个阵列以进行比较。每个面板在一个区域都会有一个标签,这里的区域称作条带区域。随后我们可以看到,用户可对每个面板中展示的图形、条带的格式和位置、面板的摆放、图例的内容和位置以及其他许多图形特征进行控制。
lattice包提供了丰富的函数,可生成单变量图形(点图、核密度图、直方图、柱状图和箱线图)、双变量图形(散点图、带状图和平行箱线图)和多变量图形(三维图和散点图矩阵)。
各种高级绘图函数都服从以下格式:
graph_function(formula, data=, options)
graph_function为图形类型函数;
formula指定要展示的变量和条件变量;
data指定一个数据框;
options是逗号分隔函数,用来修改图形的内容、摆放方式和标准。
lattice包中常见的图形类型函数如下:
lattice包中图形函数常见的配置选项如下:
设小写字母代表数值型变量,大写字母代表类别型变量(因子)。在高级绘图函数中,表达式形式通常为:
y ~ x | A * B
在竖线左边的变量称为主要变量,右边的变量称为条件变量。主要变量将变量映射到每个面板的坐标轴上,此处,y ~ x表示变量分别映射到纵轴和横轴上。对于单变量绘图,用~x代替y ~ x即可;对于三维图形,用z ~ x*y代替y ~ x,而对于多变量绘图(散点图矩阵或平行坐标图)用一个数据框代替y ~ x即可。注意,条件变量总是可以自行挑选的。
根据上述逻辑, ~ x | A即展示因子A各个水平下水平下数值型变量x的分布情况; y ~ x | A*B即展示因子A和B各个水平下组合下数值型变量x和y间的关系。而A ~ x则表示类别型变量A在纵轴上,数值型变量x在横轴上进行展示。 ~ x表示仅展示数值型变量x。
下面以数据框mtcar为例,我们使用以下代码进行lattice图形的绘制:
library(lattice)
attach(mtcars)
gear<- factor(gear, levels = c(3,4,5),labels = c("3 gears", "4 gears", "5 gears"))
cyl<- factor(cyl, levels = c(4,6,8), labels = c("4 cylinders","6 cylinders","8 cylinders"))
densityplot(~mpg,main="Density Plot", xlab = "Miles per Gallon")
densityplot(~mpg | cyl,main="Density Plot", xlab = "Miles per Gallon")
xyplot(mpg ~ wt | cyl * gear, main="Scatter Plots by Cylinders and Gears",xlab = "Car Weight",ylab = "Miles per Gallon")
cloud(mpg~wt*qsec | cyl, main="3D Scatter Plots by Cylinders")
dotplot(cyl ~ mpg | gear, main="Dot Plots by Number of Gears and Cylinders", xlab="Miles Per Gallon")
splom(mtcars[c(1,3,4,5,6)], main="Scatter Plot Matrix for mtcars Data")
detach(mtcars)
我们可以存储和操作lattice包中的高级绘图函数生成的图形。来看下列代码:
mygraph<- densityplot(~height | voice.part, data=singer)
plot(mygraph)
它创建了一个栅栏密度图,并存储在mygraph对象中。但是此时不会展示任何图形,只有调用plot(mygraph)或(mygraph)时才会展示图形。
我们可以通过options轻松地修改lattice图形对象,另外还可以使用update()函数来修改lattice对象,例如:
update(mygraph, col="red", pch=16, cex=.8, jitter=.05, lwd=2)
- ?
数据可视化.图表篇——饼图
兔灰灰
展开
上一篇文章我们介绍了 Excel 其中两大男神:柱状图和折线图,这次小数接着带大家追另外一位憨态可掬的男神:饼图。
(为了让大家有更直观的感受,基础图表篇系列文章里的图表都是借助 Excel 生成)
按套路,咱们还是先看官方解释:
饼图英文学名为Sector Graph, 又名 Pie Graph。仅排列在工作表的一列或一行中的数据可以绘制到饼图中。饼图显示一个数据系列中各项的大小与各项总和的比例。饼图中的数据点显示为整个饼图的百分比。
打开 Excel,你可以很明显看出在饼图的目录下,包括了:二维饼图、三维饼图和圆环图三个大类。
总的来说,饼图的理解比较简单,就是用于表示总体中各部分的比例。
饼图在可视化方面则有趣很多,有很多我们值得去玩的点,下面我将借助丰富的举例说明:
logo色应用
数据源如下:
插入-选择生成环形图后,得到下图:
分别两次点击红色或蓝色区域,即可修改填充色为 logo 色(本文中用到的都是 DataHunter 的 logo 色),然后简单修改标题和图例,得到优化效果:
优点:简单易操作
缺点:过于单薄
多色应用
单纯的 logo 色过于简单,怎么丰富拓展呢?聪明的小伙伴可能想到了:在一个环形图的基础上,多生成几个同心环形图,再进行着色不就行啦?没错,就是这样!
原理:引入辅助列,分别着色再合并
数据源:
刚开始是这样的,四个数据列生成了四个同心环:
操作步骤:分别点击每个环形进行单独着色,再根据需要进行合并,添加标题、修改图例,就优化成了下图:
是不是比刚开始有层次一些?
局部放大
在整体的饼图中,有时需要对某个部分做重点突出展示, Excel 中的次坐标轴设置功能完全可以hold 住!
原理:利用次坐标轴,画出两个饼图,然后做饼图分离
数据源如下:
操作步骤:利用数据生成两个饼图(刚开始看不出来,两个饼图是完全重合在一起的),然后右键—修改图表系列—将其中一个饼图设置为次坐标—设置饼图分离,改变两个饼图的大小—最后将外围的饼图进行部分透明着色
是不是看着很复杂?无须纠结。这篇文章目的让大家理解饼图可视化思维的演变,你不必非得按着操作步骤做出来,而且 Excel 中操作确实较为繁琐,如果采用一些可视化工具或者 DataHunter 的后台进行生成,就会非常简单,后续我们会开辟专门的栏目给大家演示。
回过头来,小数通过上边步骤优化,得到了局部放大的饼图:
所以,DataHunter 最吸引大家的地方是有qian 途,对么?
南丁格尔玫瑰图
有人把南丁格尔玫瑰图当做是直方图的变形(区别是南丁格尔玫瑰图是圆形的直方图),但也有人把它当做饼图的变形(区别是半径不同)。
它的鼻祖长这样:
现代版经常长这样:
如果用 Excel 制作的话,这个涉及混合图表类型,追加图表序列,录制修改宏等一系列鬼东西,所以您还是了解一下就好,尽量不要那么狠的逼自己用 Excel 操作。如果您非得要挑战的话,具体操作方法请出门左转百度,或者微信后台给小数留言,我来帮您。
在应用方面,南丁格尔玫瑰图相比普通饼图,可在一个图表中集中反映多个维度方面的百分比构成数据,幅面小,信息量大,形式新颖,够高级,够给力。
实物辅助&超越想象
前面我们讲了通过对饼图的颜色、大小做变化来进行可视化。理论上现在你距离更酷炫的可视化只差两步了哦~
第一步:会借助实物,比如这样儿的:
@谷朴文化
@Wired杂志
第二步:发挥想象 /邪恶的微笑,比如这样儿的:
@Simon 阿文
小结:饼图可视化可简单从改变饼图的颜色、突出某部分大小、改变某个比例的形状等方面着手,还可以借助实物发挥想象来做进一步优化。
最后借用爱因斯坦老爷爷的话来作为本文的结尾:“逻辑会把你从A带到B,想象力能带你去任何地方。”
所以要做好数据可视化,就请撒开你的想象力吧!
部分图片来源网络,侵删
- ?
教你如何使用直方图拍摄更好的照片
Hayle
展开
使用直方图拍摄更好的照片
您可能在数码摄影学校看过一些关于 在Lightroom和Photoshop中编辑图片时使用直方图的文章,但是当您外出拍摄图像时它也可以是一个非常方便的工具。大多数相机都能够在后LCD屏幕上查看照片时显示直方图,有些甚至可以让您在实时视图中查看实时直方图。虽然这一开始看起来有些令人生畏,但在拍摄照片时学会使用直方图可能会对您的摄影产生巨大影响,并帮助您了解如何为您正在拍摄的照片获得正确的曝光。
Sorority Bid Day由直方图的魔法属性带给您。
简而言之,直方图显示了图片中各种红色,绿色和蓝色值的数据记录量。虽然您通常可以看到分离为离散图形的所有三种颜色的数据,但我认为对于一般拍摄最有用的是将所有三种RGB值组合成一个视觉表示的直方图。直方图显示在从非常暗到非常轻的照片的色调范围内记录了多少数据。图表中的峰值意味着已经为那些特定的黑暗或亮度值记录了更多的数据,并且下降意味着没有保存太多数据。通常,正确曝光的图片应该具有如下所示的直方图:
正确曝光照片的假设直方图示例。
类似于这个例子的直方图意味着大多数颜色数据集中在中间:最大数量 的像素既不 太暗也 不太亮。大多数照片会有一些较暗的像素和一些较亮的像素,但一般来说,相机的图像传感器捕获的所有信息都应该介于最暗的黑暗(即非常黑)和最亮的灯(即非常白)之间。向右倾斜的直方图表示图像有点过度曝光,因为大多数颜色数据位于较轻的一侧,而左侧曲线的直方图显示曝光不足的图像。这是使用后处理软件时的良好信息,因为它不仅向您显示给定图片的颜色数据存在位置,而且还显示已剪切任何数据的位置:即,它不存在,因此不能编辑。在现场也有很好的信息,例如下面的例子:
大多数相机允许您在播放期间将直方图叠加在给定照片的顶部,或者在使用实时显示时拍摄照片。
我可以马上告诉你,一些大学生玩Quidditch的照片有点过度曝光,但在我的相机上查看直方图数据给了我额外的信息,帮助我当场调整我的拍摄。右侧的大曲线告诉我,大多数颜色信息都集中在较轻的一侧,这实际上是一件好事,因为实际上会在图像的高亮部分收集更多数据,然后可以将其降下来在像Lightroom这样的计划中。(这是一种称为右侧曝光的技术,如果您愿意花一些时间在计算机上编辑图片,这是一种从摄影中获得更多功能的绝佳方式。)
正如您在上面的直方图中所看到的,此图像的问题在于图形字面上偏离了右侧的图表。这意味着一些高光被剪裁:不再有任何数据可以恢复,无论我在Photoshop或Lightroom中做什么,我的图像的某些部分显示为纯白色,不能编辑。剪裁在最暗和最亮区域的照片的示例直方图如下所示:
在拍完第一张照片并意识到某些数据因裁剪而丢失后,我能够调整曝光设置并获得更好的图像:
魁地奇不仅在霍格沃茨打球。
这张照片的直方图也集中在右侧,但是在我拍摄之后,我能够看到没有数据因剪裁而丢失。这在当下并没有太大帮助,但这意味着我在Lightroom中编辑图片时有足够的信息可供使用。另一个例子,这是俄克拉荷马州立大学校园内独特建筑的图片:
俄克拉荷马州立大学校园内的贵族研究中心。
当我看着相机的背面时,好像照片非常好。天空有点明亮,但我觉得一切都会很好。这与我以前的许多情况类似,当我认为只是通过观察相机液晶显示屏上的照片时,如果它正确曝光,我可以说出来,但快速检查直方图可以产生更多信息。尽管上面的图像看起来不错,但相机直方图却说明了另一个故事:
上面照片的直方图表明高光上的严重剪辑,这意味着照片的某些部分非常明亮,以至于我无法在Lightroom中修复它。
如果我没有看到直方图,我将永远不会看到一大块天空被剪掉,这意味着照片中最亮的部分根本没有颜色数据。当我将照片放入Lightroom并调整各种参数以使图像看起来像我想要的时候,对于我的后期处理来说,这将是一个严重的问题。在查看直方图之后,我重新调整了曝光设置并拍摄了另一张照片,该照片在整个光谱范围内改善了颜色数据的平衡:
相同的构图,但具有不同的曝光设置,导致更好的曝光,没有剪切数据。
这张图片的一个奇怪的方面是,当天空现在被正确曝光时,建筑物上的玻璃面板看起来太暗了。查看直方图,您可以看到虽然图像的较暗部分肯定存在大量数据(因此图表左侧的尖峰),但没有数据因剪切而丢失。这意味着我有很大的灵活性来改善Lightroom中的图像,这导致了以下完成的照片:
大多数无反光镜相机以及在实时视图中拍摄时的一些数码单反相机的一个好处是能够为您提供实时指示图像的任何区域,这些区域将被曝光过度或曝光不足。这通常被称为斑马纹,它基本上覆盖了图像的任何部分上的一系列条纹,其中数据将被剪切。请记住,正如我之前所说,今天许多相机都能够向您显示实时更新的实时直方图,这样您不仅可以看到图像上的颜色数据集中在明/暗光谱的哪个位置,而且还可以提醒您拍摄照片时会发生的任何剪辑。
这些只是当你拍摄照片时直方图如何有用的几个例子,而不仅仅是你在计算机上编辑它们时。你如何使用直方图,以及你有什么其他提示和技巧来分享使用它来增强你的摄影?请在下面的评论中留下您的想法。
- ?
Excel快速搞定统计中的频数分析
Raissa
展开
在excel中可以利用FREQUENCY函数进行频数统计,利用“数据分析”中的“直方图”宏程序进行频数分析。
函数 FREQUENCY 可以计算数值在某个区域内的出现频率,然后返回一个垂直数组,
由于 函数FREQUENCY 返回一个数组,所以它必须以数组公式的形式输入。
通过频数分布函数可以对数据进行分组和归类,从而使数据的分布形态更加清楚地表现出来。
下图是某课程的学生成绩,我们对其进行统计分析。
学生成绩分数我们把学生成绩进行分段0-60、60-70、70-80、80-90、90-100。
我们在C2:C5区域一次输入59、69、79、89作为频数的接收区域(输入的不是每组上限,上限不在本组内),因为分5组,所以有4个分段点,最后一个不用分段点,但是在计算时要包含进去。
选中D2:D6区域,编辑栏中输入:=FREQUENCY(B2:B25,C2:C5),再按Ctrl+Shift+Enter组合键,得到频数分布结果。
重新整理得到频数分布表。
我们利用直方图也可以获得各组的频数,在菜单“数据”选项卡下“数据分析”选项。如果没有找到需要先在excel选项中的“自定义功能区”中把“开发工具”选中。
然后打开“开发工具”加载项,选中“分析工具库”和“分析工具库-VBA函数”复选框。
这时我们打开“数据”选项卡,单击“数据分析”,弹出“数据分析”对话框。我们选择“直方图”。
在弹出的“直方图”对话框中选工作表中B2:B25填入输入区域,C2:C5填入接收区域。在输出区域中选一个单元格作为输出图表的起始区域,我们这里选G11,同时选中“累计百分比”、“图表输出”。(选中相应单元格区域系统自动加上绝对引用符号)如下图所示:
单击确定按钮,得到频数分布表、直方图及累计频数图。
直方图你会了吗 - ?
Excel 2016直方图使用指南
吉姆
展开
图/文 | 安伟星
直方图是用于展示数据分布情况的图表,经常用于数据统计中。
它可清晰地展示出数据的分类情况和各类别之间的差异,为分析和判断数据提供依据。
01创建直方图
创建直方图,只用一列数据即可,直方图的分类标签是根据数值的大小进行自动分组。比如对一组测试数据,我们想要考察测试分数的分布情况。
①选择数据,选中上图所示的数据区域;
②单击“插入”>“插入统计信息图表”>“直方图”。
默认生成的直方图是个样子的。到这里,一定会有几个疑问:
①这些柱子的个数是怎么决定的?
②横坐标轴代表的含义是什么?
③这个图能够说明什么问题?
带着这些问题,我们继续学习。
02配置直方图箱
右键单击图表的水平坐标轴,单击“设置坐标轴格式”,然后单击“坐标轴选项”。
直方图的核心就在“横坐标轴”选项中,这里官方的说法是“箱”,关于“箱”的设置,有六个选项。
这六个选项的使用方法,总结如下表所示,Excel默认生成的直方图是自动模式,此时箱宽度通过使用 Scott 正态引用规则计算(1)。
我们通过自定义箱宽度的方式,设置每个箱子的宽度。其实这个宽度指的是数值的分组跨度,输入20,那么这组数据将按照20的间隔进行分组。
数据分组的间距越窄,图表拆分的箱型就越多,分析的区间就越精准。但是这个区间不是无限度的细分的,否则就失去了统计的意义了。
从图中可以明显看出,分数处于在(60,80]之间的最多,(80,100]之间的最少。通过成绩的分布,可以分析出整体水平、测试题目的难易度等等,从而为我们的决策做依据。这就是直方图的最典型的意义。
03帕累托图
帕累托图(Pareto chart),以意大利经济学家V.Pareto的名字而命名,在反映质量问题、展现质量改进项目等领域有广泛应用。
它是按照发生频率大小顺序绘制的直方图,表示有多少结果是由已确认类型或范畴的原因所造成。
从帕累托图的定义中,可以知道,将直方图进行排序,基本上就变成了帕累托图,同时帕累托图还有一条表示累计百分比的折线。因此可以说,帕累托图是直方图的增强版。
举例说明
▼
比如有六项因素能够影响测验成绩,选中此数据表。
单击“插入”>“插入统计信息图表”>然后选择“直方图”右侧的“排列图”。
然后,你看Excel 2016竟然可以一键生成帕累托图,而且还可以自动对项目按照值的大小进行排序,自动计算累计百分比。
①图中的柱形代表每个因素的频数(出现的次数);
②折线图是累计百分比,最终值一定要落在100%上;
与帕累托图紧密相关的是二八法则,在这里体现在“影响结果80%的因素,集中在所有因素的20%里面”,所以集中力量解决这20%的因素,就能将成绩(或者品质)提升80%。
▌注:(1)用于在 Excel 2016 中创建直方图的公式,自动选项(Scott 正态引用规则)
·END·
- ?
用直方图数据教你拍出更好的照片
微风
展开
你们好,我是法国人孙木森,喜欢去全世界各地拍摄有趣的照片,来中国八年了,第一次进行中文写作,希望大家支持!
你可能在《数码摄影学校》上看到过一些关于在Lightroom和Photoshop中编辑图片时使用直方图的文章,但当你外出拍摄图片时,它也是一个非常方便的工具。大多数相机都有能力在你查看后置LCD屏幕上的照片时显示直方图,有些甚至允许你在实时视图中看到实时直方图。虽然这在一开始似乎有点吓人,但学会在外出拍摄照片时使用直方图会对你的摄影产生巨大的影响,并帮助你了解如何为拍摄的照片获得正确的曝光。
女生联谊会竞标日带给你的神奇属性的直方图。
简而言之,直方图显示了在图片中记录的各种红色、绿色和蓝色值的数据量。虽然您通常可以看到将所有三种颜色分隔成离散图形的数据,但我认为对一般拍摄最有用的是将所有三个RGB值组合成一个可视表示形式的直方图。直方图显示了从非常暗到非常亮的照片的色调范围内记录了多少数据。图中的尖峰表示记录了大量的数据,这些数据的特定值为暗或明度,而尖峰表示没有保存多少数据。一般来说,一个适当曝光的图片应该有一个直方图,看起来像这样:
一个关于适当曝光照片的假设直方图的例子。
类似于本例的直方图将意味着大多数颜色数据集中在中间:最大的像素量既不太暗也不太亮。大多数照片会有一些较暗的像素和一些较亮的像素,但一般来说,相机图像传感器捕捉到的所有信息应该介于最暗的(即非常黑)和最亮的(即非常白)之间。向右倾斜的直方图表示图片曝光过度,因为大多数颜色数据都在较浅的一侧,而左边的曲线直方图表示图片曝光不足。当使用后期处理软件时,这是一个很好的信息,因为它不仅向您显示了给定图片的颜色数据存在的位置,而且还显示了任何数据被裁剪的位置:也就是说,它不存在,因此无法编辑。在这个领域中也有很好的信息,比如下面的例子:
大多数相机允许您在回放期间或使用实时视图拍摄照片时将直方图覆盖在给定的照片上。
我马上就能看出,这张一些大学生玩魁地奇的照片有点曝光过度,但看着我相机上的直方图数据,我获得了额外的信息,帮助我调整了拍摄现场。大型曲线右边告诉我,大多数的颜色信息集中在轻端,这实际上是一件好事,因为实际上是收集更多的数据在图像的突出部分,然后可以在Lightroom的程序。(这是一种名为“向右曝光”(expose to the right)的技术,如果你愿意花点时间在电脑上编辑图片,这是一种从你的摄影作品中获取更多信息的绝佳方式。)
这个图像的问题是,正如你可以在上面的直方图中看到的那样,这个图形从右边的图表上消失了。这意味着一些亮点已经被剪掉了:不再有任何数据可以恢复,无论我在Photoshop或Lightroom中做什么,我的图像的某些部分都显示为纯白色,无法编辑。在最暗和最浅的地方都剪下的照片的直方图是这样的:
在拍完第一张照片后,我意识到有些数据会因为剪辑而丢失,于是我调整了曝光设置,得到了一张更好的照片:
这张照片的直方图也集中在右边一点,但在我拍摄之后,我可以看到没有数据丢失,因为剪辑。这在当时并没有多大帮助,但这意味着我在Lightroom编辑图片时有很多信息可以使用。再举一个例子,这是一张俄克拉荷马州立大学校园内的独特建筑的照片:
位于俄克拉荷马州立大学校园的诺贝尔研究中心。
当我看我的相机背面时,似乎这张照片是相当不错的。天空有点亮,但我想总体来说一切都会很好。这与我所经历过的许多情况类似,当时我以为只要看一下我相机液晶显示屏上的照片,就能判断照片是否被正确曝光,但快速检查一下直方图就能得到更多的信息。虽然上面的图片一开始看起来还不错,但相机的直方图却讲述了另一个故事:
上面这张照片的直方图显示了高光部分的严重剪辑,这意味着照片的某些部分太亮了,我无法在Lightroom修复它。
如果我没有看直方图,我就不会看到天空中有一大块被剪掉了,这意味着照片中最亮的部分根本没有颜色数据。当我把我的图片带到Lightroom并调整各种参数使图片看起来像我想要的时候,这将是我后期处理的一个严重问题。在查看了直方图后,我重新调整了曝光设置,并拍了另一张照片,照片上的颜色数据在光谱上的平衡得到了改善:
相同的成分,但不同的曝光设置,导致更好的曝光没有剪切数据。
这张照片的一个奇怪的方面是,虽然现在天空是正确的暴露,建筑上的玻璃面板看起来太暗了。查看直方图,您可以看到,虽然在图像较暗的部分肯定有很多数据(因此图左侧的尖峰),但没有数据因为剪切而丢失。这意味着我有很大的灵活性来改善Lightroom的图像,这导致了以下完成的照片:
大多数无反光镜相机以及一些单反相机在实时拍摄时的一个优点是,它们能够实时显示图像中任何可能曝光过度或曝光不足的区域。这通常被称为斑马图案,它本质上覆盖了一系列的条纹在图像的任何部分,数据将被裁剪。记住,如前所述,很多相机今天有能力给你一个生活的柱状图,实时更新所以你不仅可以看到图片上的颜色数据集中整个光明/黑暗领域,但也提醒你任何剪裁,会发生当你把这张照片。
这些只是几个例子,说明了直方图在你外出拍摄照片时是多么有用,而不仅仅是在你的电脑上编辑它们的时候。你如何使用直方图,以及关于如何使用直方图来增强你的摄影,你有什么其他的技巧和技巧可以分享?请在下面的评论中留下你的想法。
数据分析直方图怎么做
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并