中企动力 > 商学院 > 统计学的数据分析
  • ?

    大数据和统计学之间的关系,你怎么看?

    闵妙海

    展开

    普遍的定义认为,统计学是关于数据的科学,研究如何收集数据,并科学地推断总体特征。大数据和统计学还是存在一定区别的,其一是数据分析时不再进行抽样,而是采用population(n=all);其二是分析方法,侧重所有变量之间的相关性,而不再根据背景学科理论筛选变量,进行假设检验。

    现在社会上有一种流行的说法,认为在大数据时代,“样本=全体”,人们得到的不是抽样数据而是全数据,因而只需要简单地数一数就可以下结论了,复杂的统计学方法可以不再需要了。

    普查和抽样调查是传统的两大数据收集方法。普查不需要统计学方法进行推断估计,因为通过普查,已经取得了所有个体数据和总体的实际分布,这也是为什么人类开始懂得计数就开始进行普查。抽样调查是利用抽样理论解决如何科学设计样本,取得样本个体数据,并科学地推断总体分布及特征。无论是普查还是抽样调查,其核心问题之一是要取得准确的“个体数据”。但在大数据时代,一切皆可量化,一切皆可记录,如何利用更全面、更及时、更经济的网络电子化数据,以及通过对这些数据使用新的分析及挖掘技术,产生新的见解和认识,是我们面临的重大机遇。

    大数据的应用可以说是在减少人类处理数据时带入的主观假设的影响,而完全依靠数据间的相关性来阐述。而由于消除人为因素带入的误差,已经分析人员作出假设的限制(如果教育背景和保险购买额是相关的,而分析人员没想到,那这个结论就不会被分析出来,这在实际案例中是很容易发生的,大数据的核心也就在于它能更充分的发掘数据的全部真实含义。

    在大数据时代,数据分析的很多根本性问题和小数据时代并没有本质区别。当然,大数据的特点,确实对数据分析提出了全新挑战。例如,许多传统统计方法应用到大数据上,巨大计算量和存储量往往使其难以承受;对结构复杂、来源多样的数据,如何建立有效的统计学模型也需要新的探索和尝试。对于新时代的数据科学而言,这些挑战也同时意味着巨大的机遇,有可能会产生新的思想、方法和技术。

    西线学院培训机构提供良好的教学环境,良好的师资以及行业资源,使得西线学院教学永远都是跟随行业进步的步伐。说了这么多,其实就是想让你更加了解大数据。如此优秀的资源和别人望眼欲穿的实习机会,再不行动就要被后来居上的技术人员拍死在沙滩上了。

  • ?

    不懂计算机,不懂统计学,作为零基础的人,怎么自学数据分析?

    蒙托伊尔

    展开

    没有计算机基础,没有编程基础的人,该怎么学习数据分析,第一步要做到什么,然后应该做什么?怎么一步一步自学?先打哪些基础?很多人都在了解数据分析的时候,都会这么说。数据分析一定要统计学,编程基础吗?

    数据分析如何开始?

    我最早做数据分析是从网站统计开始的,从CNZZ到Google Analytics都有用过。我们能够这些地方知道什么呢?网站流量,用户情况,行为统计等等。以GoogleAnalytics为例,以下是我一个网站的流量图:

    从这个图里面,我们可以看出什么呢?用户数有多少,每个用户访问几个网页,每个用户停留多长时间,跳出率有多高等等。

    如果你是第一次看到这种图,那你肯定是一头雾水,WTF?什么是跳出率?什么是平均会话时长?

    这也是开始学习的过程,接触到陌生概念,就去了解,不要因为一个概念不懂就停止学习。

    经过一段时间的了解,我们学会了各个名词是什么意思,例如我们发现跳出率太高了,那么就证明网站存在某些问题,导致了用户很容易流失。那么我们就进一步, 查看用户的行为数据,例如热点图,点击图等等,分析是什么地方导致了这个问题。

    PS:图上这个跳出率算是很低了,还不错。

    这个图是流量获取概览图,我们可以通过这个图来了解流量是从哪来的,这也能帮助我们做流量的优化甚至引流的工作。

    不要嫌网站统计显得low,基础数据分析都是从这个开始的。

    接下来可以着手去搞一些自己感兴趣的数据,当然,这可能需要学习爬虫知识,一些数据库的知识。

    你可以爬歌词,看大家在唱什么,也可以把公司的订单倒入,看订单有什么规律,还可以把女朋友的微博全部拿出来,看她到底对什么感兴趣。

    这些,其实都是数据分析的应用,从简单的,基础的,自己感兴趣的开始。

  • ?

    用Python结合统计学知识进行数据探索分析

    杰罗姆

    展开

    本文用Python统计模拟的方法,介绍四种常用的统计分布,包括离散分布:二项分布和泊松分布,以及连续分布:指数分布和正态分布,最后查看人群的身高和体重数据所符合的分布。

    # 导入相关模块import pandas as pdimport numpy as npimport matplotlib.pyplot as pltimport seaborn as sns%matplotlib inline%config InlineBackend.figure_format = 'retina'

    随机数

    计算机发明后,便产生了一种全新的解决问题的方式:使用计算机对现实世界进行统计模拟。该方法又称为“蒙特卡洛方法(Monte Carlo method)”,起源于二战时美国研制原子弹的曼哈顿计划,它的发明人中就有大名鼎鼎的冯·诺依曼。蒙特卡洛方法的名字来源也颇为有趣,相传另一位发明者乌拉姆的叔叔经常在摩洛哥的蒙特卡洛赌场输钱,赌博是一场概率的游戏,故而以概率为基础的统计模拟方法就以这一赌城命名了。

    使用统计模拟,首先要产生随机数,在Python中,numpy.random 模块提供了丰富的随机数生成函数。比如生成0到1之间的任意随机数:

    np.random.random(size=5) # size表示生成随机数的个数

    array([ 0.32392203, 0.3373342 , 0.51677112, 0.28451491, 0.07627541])

    又比如生成一定范围内的随机整数:

    np.random.randint(1, 10, size=5) # 生成5个1到9之间的随机整数

    array([5, 6, 9, 1, 7])

    计算机生成的随机数其实是伪随机数,是由一定的方法计算出来的,因此我们可以按下面方法指定随机数生成的种子,这样的好处是以后重复计算时,能保证得到相同的模拟结果。

    np.random.seed(123)

    在NumPy中,不仅可以生成上述简单的随机数,还可以按照一定的统计分布生成相应的随机数。这里列举了二项分布、泊松分布、指数分布和正态分布各自对应的随机数生成函数,接下来我们分别研究这四种类型的统计分布。

    np.random.binomial()

    np.random.poisson()

    np.random.exponential()

    np.random.normal()

    二项分布

    二项分布是 n 个独立的是/非试验中成功的次数的概率分布,其中每次试验的成功概率为 p 。这是一个离散分布,所以使用概率质量函数(PMF)来表示k次成功的概率:

    最常见的二项分布就是投硬币问题了,投n次硬币,正面朝上次数就满足该分布。下面我们使用计算机模拟的方法,产生10000个符合(n,p)的二项分布随机数,相当于进行10000次实验,每次实验投掷了n枚硬币,正面朝上的硬币数就是所产生的随机数。同时使用直方图函数绘制出二项分布的PMF图。

    def plot_binomial(n,p): '''绘制二项分布的概率质量函数''' sample = np.random.binomial(n,p,size=10000) # 产生10000个符合二项分布的随机数 bins = np.arange(n+2) plt.hist(sample, bins=bins, align='left', normed=True, rwidth=0.1) # 绘制直方图 #设置标题和坐标 plt.title('Binomial PMF with n={}, p={}'.format(n,p)) plt.xlabel('number of successes') plt.ylabel('probability')plot_binomial(10, 0.5)

    投10枚硬币,如果正面或反面朝上的概率相同,即p=0.5, 那么出现正面次数的分布符合上图所示的二项分布。该分布左右对称,最有可能的情况是正面出现5次。

    但如果这是一枚作假的硬币呢?比如正面朝上的概率p=0.2,或者是p=0.8,又会怎样呢?我们依然可以做出该情况下的PMF图。

    fig = plt.figure(figsize=(12,4.5)) #设置画布大小p1 = fig.add_subplot(121) # 添加第一个子图plot_binomial(10, 0.2)p2 = fig.add_subplot(122) # 添加第二个子图plot_binomial(10, 0.8)

    这时的分布不再对称了,正如我们所料,当概率p=0.2时,正面最有可能出现2次;而当p=0.8时,正面最有可能出现8次。

    泊松分布

    泊松分布用于描述单位时间内随机事件发生次数的概率分布,它也是离散分布,其概率质量函数为:

    比如你在等公交车,假设这些公交车的到来是独立且随机的(当然这不是现实),前后车之间没有关系,那么在1小时中到来的公交车数量就符合泊松分布。同样使用统计模拟的方法绘制该泊松分布,这里假设每小时平均来6辆车(即上述公式中lambda=6)。

    lamb = 6sample = np.random.poisson(lamb, size=10000) # 生成10000个符合泊松分布的随机数bins = np.arange(20)plt.hist(sample, bins=bins, align='left', rwidth=0.1, normed=True) # 绘制直方图# 设置标题和坐标轴plt.title('Poisson PMF (lambda=6)')plt.xlabel('number of arrivals')plt.ylabel('probability')plt.show()

    指数分布

    指数分布用以描述独立随机事件发生的时间间隔,这是一个连续分布,所以用质量密度函数表示:

    比如上面等公交车的例子,两辆车到来的时间间隔,就符合指数分布。假设平均间隔为10分钟(即1/lambda=10),那么从上次发车开始,你等车的时间就满足下图所示的指数分布。

    tau = 10sample = np.random.exponential(tau, size=10000) # 产生10000个满足指数分布的随机数plt.hist(sample, bins=80, alpha=0.7, normed=True) #绘制直方图plt.margins(0.02) # 根据公式绘制指数分布的概率密度函数lam = 1 / taux = np.arange(0,80,0.1)y = lam * np.exp(- lam * x)plt.plot(x,y,color='orange', lw=3)#设置标题和坐标轴plt.title('Exponential distribution, 1/lambda=10')plt.xlabel('time')plt.ylabel('PDF')plt.show()

    正态分布

    正态分布是一种很常用的统计分布,可以描述现实世界的诸多事物,具备非常漂亮的性质,我们在下一讲参数估计之中心极限定理时会详细介绍。其概率密度函数为:

    以下绘制了均值为0,标准差为1的正态分布的概率密度曲线,其形状好似一口倒扣的钟,因此也称钟形曲线。

    def norm_pdf(x,mu,sigma): '''正态分布概率密度函数''' pdf = np.exp(-((x - mu)**2) / (2* sigma**2)) / (sigma * np.sqrt(2*np.pi)) return pdfmu = 0 # 均值为0sigma = 1 # 标准差为1# 用统计模拟绘制正态分布的直方图sample = np.random.normal(mu, sigma, size=10000)plt. hist(sample, bins=100, alpha=0.7, normed=True)# 根据正态分布的公式绘制PDF曲线x = np.arange(-5, 5, 0.01)y = norm_pdf(x, mu, sigma)plt.plot(x,y, color='orange', lw=3)plt.show()

    身高、体重的分布

    以上从计算机模拟的角度出发,介绍了四种分布,现在让我们看一下现实中的数据分布。继续上一讲数据探索之描述性统计中使用的BRFSS数据集,我们查看其中的身高和体重数据,看看他们是不是满足正态分布。

    首先导入数据,并编写绘制PDF和CDF图的函数plot_pdf_cdf(),便于重复使用。

    # 导入BRFSS数据import brfssdf = brfss.ReadBrfss()height = df.height.dropna()weight = df.weight.dropna()

    人群的身高分布比较符合正态分布。

    plot_pdf_cdf(data=height, xbins=21, xrange=(1.2, 2.2), xlabel='height')

    但是体重分布明显右偏,与对称的正态分布存在一定的差异。

    plot_pdf_cdf(data=weight, xbins=60, xrange=(0,300), xlabel='weight')

    将体重数据取对数值后,其分布就与正态分布非常吻合。

    log_weight = np.log(weight)plot_pdf_cdf(data=log_weight, xbins=53, xrange=(3,6), xlabel='log weight')

    参考资料:

    维基百科:蒙特卡罗方法

    《Think Stats 2》

    《统计学》,William Mendenhall著

    End.

    作者:鱼心DrFish

    链接:http://jianshu/p/8a0479f55b21

    已获作者授权

  • ?

    数据分析:统计学与概率论的教学思考,看完长见识了!

    家沛蓝

    展开

    为了在教学方面自我完善,自我提高,更好的服务于教学工作,结合自己的教学实践浅谈一些自己的心得:  一、统计与概率的内涵的进一步认识  数据能够帮助我们认识世界、做出决策和预测,而统计正是与数据打交道的科学,它是在人们对现实生活中数据资料的收集、整理、分析的过程中发展起来的。  (1)紧密联系学生生活实际,创设情境。有了这样的情感学生学起数学知识来当然是事半功倍了。例如:“分苹果”的情境创设,动手操作,激发了学生提出问题,解决问题的欲望,让学生在情境中感受、理解数学问题。再如:圆的周长收集整理的实际测量,也练习了学生的动手操作。  (2)在课堂上让学生充分交流讨论。在民主、和谐的氛围中开拓思维,积极参与,充分合作。教师适时地参与到学生的讨论和交流当中,较好地扮演了组织者、参与者、合作者的角色。  (3)运用丰富多彩的课堂教学手段。随着科技的进步和发展,我们的课堂也要跟上时代的潮流改变传统的一支粉笔进课堂,这两节数学课让我增长了很多见识,随着一个个课件的展示,本来很难理解的数学难题变得形象、具体,一个个教学难点也随之被攻破。课堂也显得生动活泼了很多。如果有条件我们也要丰富我们的课堂,提高课堂的教学效率。

    (4)引用《不列颠百科全书》对统计学的一个定义。《不列颠百科全书》对统计学的一个定义:“统计学是关于收集和分析数据的科学和艺术”。我认为定义中有三个比较关键的核心词,第一个是数据。“数据”和“数”的最重要的区别是数据是具有实际背景的,而“数”则并不一定。从这个意义上我们就可以理解了为什么说可以把“统计”从过去我们认为的“数的运算”中单独出来,成为一个相对独立的学习领域,统计主要作用正是通过数据处理来提取信息从而帮助人们进行决策。进一步,“随着信息高速的增长,我们需要进一步扩大对数据的认识。事实上,现在的数据不仅仅是数,其实图像也可以看成是数据、语句也可以看成是数据。只要蕴含着一定信息的,无论是什么表现形式,都可以看作是数据”。  二、教学当中概念的处理方法  在教学中,我们应该首先注重学生统计观念的形成与培养。能从统计的角度思考与数据信息有关的问题;能通过收集数据、描述数据、分析数据的过程,作出合理的决策,认识到统计对决策的作用;能对数据的来源、处理数据的方法以及由此得到的结论进行合理的质疑。收集整理养出来的感觉,统计学习要培养学生能自觉地想到运用统计的方法解决有关的问题。学生没有经历数据的收集过程,随机的数据对他们来说还是确定的,学生也就根本无从体会统计思想方法的价值。因此必须创设原始的随机情境,突出活动性,让学生亲身面对实际问题,亲自调查、收集数据,先体会随机数据的不确定、杂乱无章,然后组织学生经历数据的分类整理,凸现随机数据的特点。在这样的教学情形下,学生才深深地领悟到统计思想确实很有用。

    我们还要注重学生在概率实验中的操作体验。教学中应以学生亲身经历和体验统计过程作为主线,即对数据从收集、整理、描述到分析、运用的全过程中突出学生的主体参与,再此过程中引导学生发现并提出问题,用适当的方法收集和整理数据,用合适的图表展示数据,对数据作简单的分析并对自己的分析、思考进行交流和改进。由于处理数据没有唯一的样式,在统计过程中,不同情况下、不同的学生会用不同的方法来记录和表示数据。因此,引导学生经历数据处理过程的教学具有很强的探索性。  三、如何介绍收集和数据的分析和运用  统计处理数据的步骤主要包括:第一是要确定需要解决什么问题;第二是决定收集数据的方法并收集数据;第三是整理并尽可能清晰地描述数据;第四是分析数据,并做出决策和推断。统计学有着它科学的一面,但也有艺术的一面。对于同样的数据,由于背景和目标不同可以有多种分析的方法,需要根据问题的实际背景选择合适的方法。也就是统计的方法没有简单的理论意义上的对和错,只有好和不好。  统计在收集数据和运用数据做出推断等方面吸收了概率的主要成果和主要方法,产生了以抽样为特征的数学与概率论的统计学。数理统计学是运用统计的方法来研究随机现象、从而描述随机现象总体趋势的数学模型,它不会把注意力停留在个别的现象特征上,而是了解大量随机现象的总体的变化趋势,并由此得出随机现象的基本统计规律,进而得到关于社会发展、科学发现的统计预测。

    最后,我们再概括地分析一下统计与概率的关系。实际上,众所周知,统计与概率都是研究随机现象的学科。“不论怎么说,机遇(或说偶然性)无所不在,机遇伴随着人的一生(当然随人的情况而有异),这是一个无法回避的现实”。统计与概率正是从不同的角度来研究怎样更好的刻画随机现象,统计主要侧重于从数据来刻画随机,概率则主要侧重于建立理论模型来刻画随机。另一方面,概率为统计提供了理论基础。在运用样本估计总体的过程中,抽样的合理性、样本推断总体的合理性,包括犯错误的风险,都需要概率的知识来提供科学依据(这在下文还要论述)。“‘机遇(机会)的数学’,它包含数学中的两个学科分支——概率论和数理统计学。概括来说就是,前者属于机遇数量化的理论基础。而后者则是其应用。”  四、统计与概率课程的教育价值  由上一段内容我们可以看出,统计的关键是客观地提炼和表述现实世界中广泛存在的随机信息,准确地分析并把握随机信息中的关键因素的规律性,科学地应用数据并做出正确决策是统计与概率的主要任务,而这也构成了大学阶段学习统计与概率的重要原因。具体来说,学习统计与概率的主要目的是让学生适应现代社会的需要;帮助学生形成和运用数据进行推断的思考方式;有助于学生朝着数学思考、解决问题、情感态度等多方面的发展。/ 

    在以信息和技术为基础的现代社会里,生活中充满着大量的数据和随机现象,各种信息量以成倍地速度增长,这时就需要人们面对它们做出合理的决策。事实上,每个人每天都会遇到许多需要判断和推理的事情。总之,生活已先于数学课程将统计与概率推到了学生的面前,统计与概率的思想已渗入人们日常生活和社会生活的方方面面。  许多的例子表明,随着计算机等信息技术的飞速发展,数据日益成为一种重要的信息,21世纪的公民面临着更多的机会和挑战,常常需要在不确定情境中,根据大量无组织的数据,做出合理的决策,这就需要人们能对纷繁复杂的信息做出恰当的选择与判断,具有一定的收集??处理信息、做出决策的能力,并且能够进行有效的表达与交流。而统计与概率正是通过对数据的收集、整理和分析,来为人们更好的制定决策提供依据和建议。因此,要培养学生具有收集并处理数据、做出恰当的选择和判断的能力,以适应现代社会的发展,就必须将统计与概率的基本思想、方法和知识作为义务教育阶段数学课程的重要组成部分。统计与概率的学习必将为数学与学生的日常生活及其他学科联系起来提供一条自然的途径。

  • ?

    数据分析:浅论统计学在市场营销中的运用,看完长见识了!

    阿甘

    展开

    浅论统计学在市场营销中的运用

    当今社会中多数企业为了能够更好地促进市场营销效果,将本企业或者本行业几个月或者几个季度以及几年内的市场营销数据,通过数据加载分析来评估当前市场形势以及以后的发展趋势,而对数据的分析现代企业运用最多的手段就是统计学,统计学中的数理统计、多元统计分析,抽样调查都为企业的数据分析提供了最科学和可靠的方法。通过市场营销管理中统计学理论及方法的运用,为企业市场营销管理工作奠定基础、为企业的市场营销工作提供准确详实的市场信息。针对市场营销管理中对统计学应用的需求,现代企业市场营销管理中应加强对统计学理论及内容的关注。运用统计学方法解决企业营销管理中的实际问题,提高企业综合市场竞争力。  

     一、数据进行统计分析特点和管理方法   数理统计中统计分析的特征是定量和定性分析进行结合;把处理的数据作为依据,以统计的数据作为结果;分析方法具有特殊性;分析的范围具有广泛性。要紧紧依靠这些统计数据的特点,同时,充分把握好企业市场营销这一行业的特殊性,才能真正做好市场营销统计学分析的工作。正常来讲,企业市场营销管理的步骤可分为:分析市场所具备的机会、选择合适的目标市场、确立正确的营销组合策略、市场营销的决策和决策的实施与控制。这四个步骤与相应的统计学分析方法相配合,才能更好地为企业赢得更多的市场机遇,同时使企业的市场竞争力不断提升。   二、市场营销中的统计学分析方法   针对所属行业销售特点选择统计学方法的应用。针对不同行业的销售特点,企业市场营销管理中的统计学应用也存在着差异。根据行业销售特点,统计学方法的运用也有着一定的规律。在饮料、日用化工等快消品的销售收集整理中,描述统计、推断统计、顺序变量等方法的应用能够为快消品行业的市场营销管理提供翔实准确的市场信息,为快消品企业的市场营销策划方案提供科学的数据。通过统计学方法的运用使企业的快消品营销策划工作更加符合市场规律、符合市场销售特点,进而满足现代快消品企业销售目标需求、满足市场销售需求。   在现代社会里,企业如果要获得长远的竞争优势,一定离不开目标群体的满意度和支持度。目标群体,一般就是指顾客,当他们的需求被满足之后会产生心理的愉悦感。从统计学来分析,这个满意度就是指顾客的期望值与实际感知效果之间的差异函数,如果顾客实际感知的效果小于期望值,顾客就不会感到满意,反之,就会表现出满足。通常,顾客过去的购买经历,竞争者与销售者对自身产品的宣传与承诺,身边朋友的评论等,都会影响到顾客的期望值。因此,企业非常有必要通过统计学,对顾客满意度进行分析、测量,给企业的营销和决策提供更加可靠的依据。

     

     三、以数据为依托分析当前市场状况   通过对统计学知识的运用,以当近期市场的数据反馈为依托,对当前的市场行情进行分析与比对。在当今市场经济的营销管理中,对市场的动态信息进行科学合理的分析,能够帮助企业的决策者们及时修改营销方案,满足市场变化对企业营销管理的需求。这一现状要求企业的市场营销管理部门能够及时掌握市场动态,运用統计学知识及统计学理论中的调研、整理、分子技巧为企业的市场营销管理工作提供准去的市场信息,确保企业市场营销管理工作能够符合市场销售的实际需求。针对现代企业市场营销现状及营销管理工作的需求,现代企业的市场营销管理工作中应强化对市场销售信息的收集与整理。利用统计学原理及要知道市场销售信息收集与管理工作,以此使企业的市场营销信息收集、整理、分析以及方案制定在统计学理论指导下得到有效开展,满足现代市场经济发展过程中企业的营销管理需求。

      

    四、从市场的定价角度看统计分析的重要性   通常来说,企业的市场定价会受到多种因素的综合影响。成本导向、需求导向、竞争导向是企业市场定价的三种方法,这三种方法都是对于企业自身在市场上的竞争力而言,是企业为了让自己的产品或服务在如今激烈的市场竞争中更好的定位,赢得更多更大的市场份额而制定出的价格策略。这种定价策略要分析人为订立的利润与企业成本之间的比例,要充分研究竞争对手等各方面的定价因素,并认真分析消费者的有效需求,以寻求各个价格变量之间存在的近似的线性关系,从而准确进行营销策划。因子分析方法是市场定价中的统计学分析较多采用一种方法,根据几个不同因子的比较而获得多个值,并对这些值进行平均值的计算,从而确定产品的基准价格。本质上看,就是把统计模型的运算和决策问题运用到市场定价问题中,不同利润下的标准差和期望值制定出不同的市场定价方案。所以,在市场定价中准确的统计决策模型,不仅有利于提高资金周转速度,节约企业成本,还有利于提高企业的市场竞争力。在现代企业市场营销管理工作中,科学的市场调研是掌握市场动态、保障市场销售信息有效传达的关键。因此,在企业的市场营销管理工作中,应科学运用统计学调研方法对企业所属行业市场信息进行收集与整理。以基础数据、变量、统计逻辑学、管理统计学等内容及基础,对销售人员的调研信息进行统计与分析,对信息的科学性进行甄别。以翔实准确为中心进行市场信息的收集与调研、以科学性为重点进行信息的统计与分析,以此保障现代企业市场营销管理方案制定基础满足市场需求。统计学分析方法在市场调查过程中,无论是最初的信息收集阶段,还是信息处理阶段的分析过程和数据辨别,都发挥着无可辩驳的关键作用。在我们当前的市场经济活动中,要重视以人为本的管理方法,大力地强调定性向定量的方向发展,这一切都会涉及统计学方法。国家在进行经济调控时,也往往会使用到统计表格来表示一系列经济收支的情况,以便在宏观上对未来的经济投入比例进行相应的调整。   总之,企业要想得到最优化的市场营销方案,必须通过统计手段对市场的全面、科学分析才能获得,科学合理的统计分析,可以随时灵活地更改营销方案。

  • ?

    数据分析:统计学教学中存在的问题与对策,看完长见识了

    臾凉

    展开

    统计学教学中存在的问题与对策

    目前统计学已在各行各业得到了广泛的应用,特别是在大数据时代,人们的生产生活已越来越离不开统计学。由于统计学如此重要,教育部将统计学规定为经济类和工商管理类本科专业的专业核心课程。但是,当前统计学的教学还存在诸多问题,从而使统计学的教学效果大打折扣。本文将结合笔者的教学实践,对统计学教学中存在的主要问题进行分析,并提出相应的对策,期望对统计学的教学改革工作提供一点思路。  一、统计学教学中存在的主要问题 

     1、在教学过程中忽视对数学知识的复习  当我们在统计学的讲授过程中涉及到概率分布、假设检验以及矩阵运算等知识点的时候,很大一部分学生表现出茫然的神情,表明学生在学习统计学的时候,已经对过去所学的数学知识有所遗忘。《计量经济学》教材一般都会有一个数学附录,可以帮助学生用较短的时间对关键的数学知识进行复习。《统计学》教材一般没有这样的数学附录,统计学教师也不会专门给学生复习相关的数学知识,而这些数学障碍恰好是导致学生学习效率低下的主要原因。中国有句俗语“磨刀不误砍柴工”,因此笔者认为在进行统计学这门课程的教学时,有必要专门安排时间对学好统计学必需的数学基础知识进行复习。  2、在教学过程中忽视案例的运用  统计学是一门实践性很强的学科。统计学中的每一个知识点都是与实践相联系的,比如均值、标志变异度这些看似简单的知识,都包含了丰富的实践意义。而有些教师在上课的时候,主要教学生如何去计算相关的统计指标,把统计学当作一门数学课程来教,学生也把统计学当作数学来学。教师在教学中忽视了对实践收集整理案例的运用,导致学生不能真正理解相关知识点的真正含义,从而觉得统计学又枯燥、又难学,并失去了学习的兴趣。  3、理论讲解与统计软件教学脱节  统计学是一门实践性很强的学科,即学生从统计学中学到的知识是完全可以应用到工作实践的。与教科书中的例题不一样,在工作中所得到的数据的样本容量一般都很大,这就需要通过相应的统计软件来进行处理。据笔者了解,许多高校在安排统计学这门课程的时候,一般安排十六周左右的理论教学,另外安排两周实践教学,在实践教学环节主要是学习SPSS软件。我们认为,这种教学安排并不能很好地促进统计学的教学,其理由主要有两点:其一,理论讲解与统计软件的教学完全脱节。由于是在理论学习完全结束之后才开始教学生进行软件操作,学生可能对学过的理论知识已经遗忘,在学习软件操作时,只是进行机械性的操作,而不明白每一步操作的真实含义。其二,学习软件操作的目的并不是为了简单地进行数据处理和数据分析,事实上通过软件的学习还能促进对理论知识的理解。而像这种教学安排,是先学完理论之后,再学习软件操作,就不能很好地起到通过软件操作促进理论知识学习的目的。  二、提高统计学教学效果的对策

      1、注重案例的讲解  由于统计学的实践性很强,我们可以从生产生活中找到许多案例来帮助提高统计学的教学效果。通过合理地运用案例,既可以增进学生对统计理论的理解,同时又能提高学生学习统计学的兴趣。下面将具体介绍笔者在讲授假设检验时是如何通过案例的讲解来增加学生对统计学知识的理解以及提高学习统计学的兴趣的。假设检验是统计学教学中的重点和难点。假设检验是利用样本提供的数据资料来检验事先对总体某些数量特征所作的假设是否可信的一种统计方法。当对总体参数的真实性感到怀疑,需要通过样本来考察其正确与否时,往往借助于假设检验作判断,从而决定接受或拒绝这一假设。  笔者在讲授这部分内容时,引用了吴喜之在其《统计学:从数据到结论》一书中的一个案例。其内容是:如果一个人要证明他从来没有骂过人。他能够证明吗?要证明他没有骂过人,他必须出示他从小到大每一时刻的录音录像,所有书写的东西等等,还要证明这些物证是完全的、真实的、没有间断的,这显然是不可能的。  反过来,如果要证明这个人骂过人很容易,只要有一次被抓住就足够了。这就相当于假设检验中的反证法。在假设检验中,一般要设立一个原假设,比如可将“从来没有骂过人”设为原假设,设立该假设的动机主要是企图利用人们掌握的反映现实世界的数据来找出假设与现实之间的矛盾,从而否定这个假设。如否定不了,说明证据不足,无法否定原假设。许多学生说他们在学习《概率论与数理统计》这门课程时,虽然也学过假设检验,但是从来没有真正明白假设检验的含义,而通过对这个案例的学习,他们对假设检验有一种豁然开朗的感觉,并且觉得统计学原来这么有趣。  另外,对于假设检验中的一类错误和二类错误,学生也很难理解,在讲授这部分内容时,笔者又列举了另外一个案例来帮助学生理解。当一个人被控告为罪犯时,他将面临审讯。控告方提出控诉后,法官必须根据证据做出裁决。事实上,法官就需要进行假设检验。这里有两个假设需要被证明。第一个假设为原假设H0:被告无罪;第二个假设为备择假设H1:被告有罪。事先法官并不知道哪个假设是正确的,他们将根据控辩双方所提供的证据进行判断,最终的结果只有两种可能:判定被告有罪或无罪释放。在统计应用中,判定被告有罪就相当于拒绝原假设,授受备择假设;而判定被告无罪也就相当于不能拒绝原假设,但我们并不能接受原假设。 

     当我们进行假设检验时,存在两种可能的错误。第一类错误是当原假设正确时,我们却拒绝了它。第二类错误当原假设有错误时,我们却没有拒绝。在上面这个法官审案的例子中,第一类错误就是一个无罪的人被判定有罪。第二类错误就是一个有罪的被告被判定无罪。我们把发生第一类错误的概率记为α,通常它也被称为显著性水平。第二类错误发生的概率为β。发生错误的概率α和β是相反的关系,这就意味着任何尝试减少某一类错误的方法都会使另外一类错误发生的概率增加。根据检验的一般原则,首先要保证犯第一类错误的概率α要足够的小。因为司法审判中,第一类错误被认为是更加严重的。通过对这个案例的学习,学生就能很好地理解,为什么我们会将显著性水平规定为0.01或0.05,最大一般不会超过0.1。  

    2、强化统计软件的教学  在统计学教学中加强统计软件的教学,并不仅仅是为了教会学生用统计软件去整理数据和分析数据,另外一个目的就是通过操作统计软件帮助学生理解统计理论。目前大多数学校为了合理利用比较紧缺的实验教学资源,往往对理论教学和实践教学环节进行分开安排,而这样做的弊端就是不利于上述目标的实现。事实上现在许多大学生都有自己的个人电脑,对一些统计软件的学习并不一定要去实验室,教师可以在课堂上进行简单的演示,让学生在课后多练习操作。我们认为在统计学教学中使用Stata统计分析软件将更加方便,因为Stata是世界上最权威的三大统计软件之一,具有占用内存小、功能非常强大、运算速度快和不需要安装等优点。  我们在前面的分析中曾谈到为了提高学生学习统计学的效率,很有必要对学好统计学必须具备的数学基础知识进行专门的复习。如果我们用Stata软件来帮助学生复习数学知识,其效率会更高。下面将列举用如何用Stata的矩阵命令帮助学生复习矩阵运算的相关知识。  用Stata录入一个新矩阵的方法非常简单。在Stata的命令窗口输入以下命令:matrix A=(1,0,1\2,1,0\-3,2,-5),就得到了一个3行3列的矩阵。  如果要得到矩阵A的转置矩阵,只需要输入以下命令:matrix A1=A’。A1=(1,2,-3\0,1,2\1,0,-5)即为A的转置矩阵。  如果要得到矩阵A的迹,只需要输入以下命令:scalar a=trace(A);如果要得到矩阵A的逆,只需要输入以下命令:matrix B=inv(A),B=(-2.5,1,-0.5\5,-1,1\3.5,-1,0.5)即为A的逆矩阵。  事实上,在指导学生复习矩阵的相关知识时,并不需要详细地为学生讲解具体的运算过程,比如求矩阵的逆,其运算过程比较复杂,如果详细地讲解运算过程,将花费大量的时间,甚至有本末倒置之嫌。只需要简单讲解一下矩阵逆的概念,其运算过程可以完全交给软件去做。  当然学习统计软件最根本的目的是对搜集到的大量数据进行整理和分析。当学生在学习相应的统计整理和统计分析的理论知识的时候,也必须能运用软件去得到相应的结果。比如当学生学完平均指标和标志变异度指标之后,要学会如何用软件来得到相应的指标。用Stata软件来得到这些指标的方法非常简单的。如果想得到某个变量a的平均数、标准差、极大值、极小值以及25%分位数、75%分位数等,只需要输入命令“sum a,detail”就可以了。  3、加强实践能力的训练  由于统计学的实践性很强,因此必须要注重学生实践能力的训练,在目前的统计学教学中有一个误区,认为教会学生操作相应的统计软件,就是在进行实践能力的训练。事实并不是这样,学生学习统计学的目的主要是为了解决实际问题,因此在教学中要根据相应的教学内容设计不同的课题和任务,让学生实实在在地从搜集数据、整理数据、分析数据到得出统计结论进行完整的训练。通过加强实践能力训练,可以让学生真正明白统计学的实用性,从而产生更大的学习兴趣,并在实践中清楚地知道自己在哪些方面还存在不足,以增加学习统计学的动力。   

  • ?

    数据分析:浅谈统计学在生活中的应用,看完长见识了!

    Raissa

    展开

    浅谈统计学在生活中的应用

    统计学并不是一门独立存在的学科,它是以数学知识和数理统计作为基础,将数理统计方法和其他学科专业知识交叉融合形成的具有极强推断性的一种分析方法。现阶段,随着科学技术的快速发展,为了加强对自然社会各个领域现象的判断和整理能力,将统计学应用在生活各个方面已经成为现阶段的数理统计的一种便捷方法。

      

    一、统计学的概念   统计学指的是调研人员通过一些列的手段对整理出来的数据信息进行整理分析,从而推断出调研对象本质,甚至可以对未来的类似事情进行预判的一门综合性学科。在进行统计学整体分析的过程中需要用到大量的数学知识以及其他相关学科的专业知识,统计学由于其自身独特的性质,在社会科学和自然科学的各个领域几乎都可以使用。   二、统计学在生活中的应用分析   (一)统计学在经济学中的重要应用   运用统计学对生活中的数据信息进行整理分析,首先要学习统计学的基础知识以及数据统计个分析等学科,这些基础知识和方法都是在开展统计学应用活动之前调研人员所必须掌握的。统计学课程的学习作为经济学学科当中的重要分支,在经济学课程中经常被应用,例如,经济学的计量统计就需要根据统计学在金融里面的重要意义和地位作为基础,将金融知识和统计学知识相结合,将金融计量和时间的序列进行结合,对收集到的金融数据进行整理分析,最后得出金融计量和时间序列的一定关系。   统计学在金融经济学中有着十分重要的工具性作用,主要包括两个方面,分别是:在思想上而言,统计学是对数据统计分析结果进行研究,最后得出研究对象的判断结果,为了保证研究结果的准确可靠性,统计学在进行数据整理分析过程中必须是带着严谨的科学态度,这种严谨的科学态度对于经济学的相关理论分析具有十分重要的指导地位,这是由于研究人员在对金融量进行数学分析的过程中,为了保证金融数学分析结果的准确可靠性就必须保证金融量数据收集分析等预处理过程是科学合理的;其本收集整理次,统计学是经济学进行科学试验研究最优化的选择,经济试验研究活动的多样性以及研究对象之间错综复杂的关系导致经济学的试验研究活动受到诸多限制,运用统计学进行经济学试验研究活动,使得经济学实验研究的对象变得简洁明了,降低试验研究的成本支出。从统计学在经济学中的应用我们可以看出,经济学当中的统计学应用主要是运用了统计学当中经济必然性的思想,使得经济学当中的统计结论不具备复杂的思想成本。   

    (二)统计学在医学中的重要应用   统计学在医学中应用的主要原因就是生物医学中存在的不确定性和变异性。生物医学主要的研究目标就是与人体健康相关的不确定因素,也就是通常所说的医学变异现象,变异现象在生物体当中是普遍存在的,例如,对于外在条件基本相同的两个病人,在相同的条件下进行治疗时,却有可能出现有的病人被治愈,有的病人治疗效果不明显,甚至还会出现死亡的现象。造成这些外在条件相同的生命体却出现不同程度治愈的主要原因就是生物医学中存在的不确定性或者是人体中存在的错综复杂的随机因素,客观差异存在的原因是因为某种偶然性的潜在的揭露必然性的发现。   在医学临床统计中发现,对于同一种病因的客观性规律进行调查,对于健康人的共同作用的交织与疗效的考查的病人很少。在医学当中运用统计学最主要的就是通过观察不同疗效病人的医疗诊断效果,将实际的医学诊断治疗效果与医学理论和假设进行验证,运用概率论以及数学方法对对比结果进行分析、判断,运用电子计算机等相关软件设备对研究对象的指标进行记录,并绘制相应的图表等,通过综合运用多种数理统计方法,得出与研究对象相关的研究结果。将统计学应用到医学当中,可以促进统计方法和多变量分析法在医学试验研究中的应用,对未知病因所造成的医疗诊断事故进行分析,可以促进医疗诊治手段的不断创新發展。

      

    (三)统计学在体育比赛中竞技指标的应用。   统计学在体育比赛中的应用主要是用统计的职业联赛的数字反应比赛队伍能否成为世界顶级,这是因为在体育比赛中应用统计学可以对比赛中的胜率进行分析,主要是将每个队员在每个赛季比赛的分数和常规赛场上的分数进行统计,通过一系列的数学计算分析,制定出每个队员得分平均值和标准差之间的正态分布图,通过正态分布图的稳定性来判断队员的技术稳定性。以众所周的NBA篮球比赛为例,NBA比赛中由于明星球员众多,在运用统计学进行数据整体分析时,需要依据本质上的规律进行数据统计,而不是随意的选择数据进行统计,例如在进行篮球比赛发球这一项双方队员的进攻和防守的概率时,在进行指标选择时就涉及到随机事件的发生概率,因此,可以运用统计学统计球员在每一场比赛上的均得分,通过这些数据指标的正态分布图来确定球员的技术稳定性。   三、结束语   在日常生活中应用统计学对数据进行管理分析,可以极大提高生产生活中对研究对象的管理效率,使得研究对象变得明确,降低管理成本。在实际的生产生活中应用统计学时,调研人员需要通过多次的试验和随机概率对比来确定事件发生的概率,通过定量定性的数理统计分析工作,充分发挥统计学对生产生活的促进作用。

  • ?

    数据分析:统计学方法在数据挖掘中的应用探究,看完长见识了!

    花海泪

    展开

    统计学方法在数据挖掘中的应用探究

    数据挖掘就是指从众多实际应用数据中获取批量大、有噪声、且随机性强的数据,将潜在的信息与数据提取出来,就是从数据中挖掘有价值的知识,而大多数原始数据具有一定的结构化特征,比如,关系数据库中的数据;也可以通过文本、图形、图像等半结构化发掘有用知识,这些知识可以是数学的也可以是非数学形式的;数据挖掘能以归纳形式存在,能够被广泛应用到信息查询、信息管理、信息决策控制中,方便数据的维护与管理。由此可见,数据挖掘是一门交叉性强的学科,加强对其的研究非常有意义,下面将对统计方法在数据挖掘中的具体应用进行分析。 

     一、数据挖掘与统计学的关系  (一)数据挖掘的内涵  通常来说,数据挖掘的定义较为模糊,没有明确界定,大部分对其的定义只是停留在其背景与观点的内容上。通过对不同观点的统一整理,人们最终将其描述为:从大量多样化的信息中发现隐晦性、规律性等潜在信息,并对这些信息进行创造、加工的过程。数据挖掘作为一门重要的交叉学科,能够将数据库、人工智能、机器学习、统计学等众多的科学融入到一起,从而实现技术与理论的创新与发展[1]。其中,数据库、人工智能与统计学是数据挖掘当中的三大支柱理论。数据挖掘的目的是从数据库当中发掘各种隐含的知识与信息,此过程的方法非常多,有统计学知识、遗传算法、粗集方法、决策法、模糊逻辑法等,还可以应用向邻近的可视技术、模式识别技术等,在以上所有技术的支持上能够使数据挖掘更为科学、有序。  (二)数据挖掘与统计学间的关系  通常来说,统计学的主要功能是对统计原理与统计方法进行研究的科学。具体来说就是指对数字资料进行的收集、整理、排序、分析、利用的过程,数字资料是各种信息的归纳与总结,可以将其作为特性原理的认知、推理方法[2]。而统计学则表示的是使用专业的统计学、概率理论原理等对各种属性关系的统计与分析过程,通过分析成功找到属性间的关联与发展的规律。在此过程中,统计分析方法是数据挖掘最为重要的手段之一。

      在数据挖掘这一课题被提出来之前,统计分析技术对于人们来说更熟悉,也是人们日常开展工作、寻找数据间规律最常使用的收集整理方法。但是不能简单的将数据挖掘作为统计学的延伸与替代工具,而是要将两者的区别认识到位,再结合两者间的不同特点分析其应用特点[3]。大部分的统计学分析技术都是建立在数学理论与技巧上的,预测通常较为准确,效果能够让大部分人满意。数据挖掘能够充分借鉴并吸收统计学技术,在融入到自身特点以后成为一种数据挖掘技术。  统计学与数据挖掘存在的目标都是一致的,就是不断对数据结构进行发掘。鉴于统计学与数据挖掘在目标上的一致性,致使很多研究学者与专家将数据挖掘作为了统计学的一个分支机构[4]。但是这种认知非常不正确,因为数据挖掘不仅体现在与统计学的关系上还体现在思想、工具与方法上,尤其是在计算机科学领域对数据挖掘起到的作用非常大。比如,通过借助数据库技术与人工智能的学习,能够关注到更多统计学与数据挖掘上的共通点,但是两者存在的差异依然非常大。数据挖掘就是指对大量的数据信息不断挖掘的过程,DM能够对数据模式内的数据关系进行充分挖掘,并对观测到的数据库处理有着极高的关注度。  二、数据挖掘的主要过程  从数据本身出发探讨数据挖掘过程,数据挖掘的过程分为信息的收集、数据集成、数据处理、数据变换、数据挖掘实施等过程。

     

     首先,要将业务对象确定下来,明确不同业务定义,并认清数据挖掘的目的,这是做好数据挖掘最关键的一步,也是最重要的一步,虽然挖掘的结果不能被准确预测到,但却需要对问题的可预见性进行探索[5]。其次,还要做好数据准备工作,包含数据清理、数据变换等工作,数据清理的实际意义是将噪声与空缺值补全,针对这一问题,可以使用平滑技术,而空缺值的处理则是属性中最常见的,可以将统计中最可能出现的值作为一个空缺值[6]。  信息收集指的是按照特定的数据分析对象,可以将分析中需要的特征信息抽象出来,并在此基础上选择出较为科学、适合的信息收集方法,将全部的信息全部录入到特定的数据库中。如果数据量较大,则可以选择一个专门的管理数据的仓库,实现对信息的有效保护与管理;数据集成就是指将来源不同、格式不同、性质不同、特点不同的数据集成到一起,进而为企业提供更为全面、系统的数据共享平台;数据变换就是通过聚集、概化、规范化等方式对数据进行挖掘,对于一些实用数据,则可以通过分层与分离方式实现对数据的转换;数据挖掘就是结合数据仓库中的数据信息点,并选择正确的分析方法实现对有价值数据的挖掘,事例推理、规则推理、遗传算法等都是应用较多的方法[7]。  三、统计学方法中的聚类分析  在统计学聚类方法基础上能够构建出潜在的概率分布假设,可以使用试图优化的方法构建数据与统计模型的拟合效果。基于统计学聚类方法当中,Cobweb方法是在1987年由Fisher提出的,能够以分类树作为层次聚类创建的方法,在分类树上,每一个节点都能代表着一个概念,该方法就是对节点概率描述的过程。Cobweb方法还使用了启发式估算方式,使用分类效用对分类树的构建进行指导,从而实现对最高分类的划分目的,能够将不同分类对象全部归类到一个类别中,并依据这些内容创建出一个新的类别。但是这种方法也存在一定局限性,局限性在于假设的属性概率分布都是独立的,并不能始终处于成立状态中。

  • ?

    数据分析:浅谈大数据对统计学的挑战和机遇,看完长见识了!

    羊冷安

    展开

    浅谈大数据对统计学的挑战和机遇

    引言  国际数据公司的相关研究指出,2011年全球数据生产量达1.8ZB,且全球信息总量每隔两年增长一倍[1]。在大数据时代下,对于统计学发展而言,挑战与机遇并存,挑战指的是现阶段传统统计学相关方法难以适用大数据,机遇指的是基于统计学,大数据展开数据处理、分析,促使大数据具备可视化特性。由此可见,研究大数据对统计学的挑战和机遇有着十分重要的现实意义。  1.大数据及其目的  现阶段,关于大数据仍旧没有一个十分明确的界定,大数据起初是源自于技术领域。在信息量不断扩大的情况下,使得常规电脑原有存储空间已不能对新处理数据进行承载,新兴数据处理技术得以产生,好比雅虎的Hadoop平台、谷歌的MapReduce等。此类技术能够对僵化层次结构、一致性予以消除,促进数据无需通过常规数据库表格进行排列,极大程度地提升了人们可处理的数据量[1]。 

     2.大数据与统计学的对比  2.1样本统计与全样本统计的区别  样本统计属于统计学不可或缺的依赖,样本指的是结合相应的概率自总体中随机筛选并视作总体代表的集合内容,值得一提的是随机抽样是需要成本的,包括社会关系、资金成本或者时间成本等。基于样本数量提升有限前提下,样本估计误差会随着总体数量增多而增大,这亦是样本统计无法避免的不足。大数据时代下,收集整理庞大的数据信息应运而生,数据信息发展表现出总体即是样本的态势,该属性很好的消除了样本统计这一不足。大数据时代下的全样本统计,通常情况下可对完全总体进行覆盖,然而受大部分数据属于半结构、半结构数据影响,使得概率论应用遭受一定的制约[2]。鉴于此,将全样本统计应用到统计学中,应当就总体数据展开相应的归纳、筛选,即好比在样本统计中展开数据预处理。  2.2预测分析与非预测分析的区别  统计学的创立,是为了对变量相互相关关系展开分析,因此获取数据是发生于变量确定之后的,数据分析价值是能够被预测的。相较于统计学的预测分析,庞大数据将互联网、传感器作为载体,存在于分析需求之前,因此构建于大数据上的分析多为非预测性分析。在统计学中,出现大数据无法有效应用局面,这是由于不具备非预测分析所需的庞大数据,庞大数据产生与数据中心、存储系统存在紧密的联系,并非短期产生。也就是说,统计学中大数据的应用发展,说明了非预测分析正逐步取代传统统计学预测分析,数据多次利用正逐步取代传统数据一次性利用的。  3.大数据对统计学的挑战与机遇  3.1数据生产、处理与应用的转变 

     相关统计部门经开展严格的统计设计工作,获得相关的统计数据,数据的预处理分别有数据清洗、非全面数据填补以及数据矫正等。大数据时代下的统计手段尚不十分明确,自大数据流环境而言,要不断探索新型抽样方法,并确保抽样方法的实时、连贯及可行性。除去传统的统计分析方法,还应当开发大数据动态分析、数据流算法等[3]。  3.2大数据时代对市场营销的机遇  3.2.1大数据营销的特点与价值  大数据营销的特点:I.数据采集多平台化特点,即大数据时代下,大数据的数据大多来源于不同的领域、不同的渠道。II.时效性特点,随着信息技术的急速发展,互联网用户消费、购物行为方式往往会瞬间出现转变。国际先进大数据营销企业AdTime基于此大数据营销特点,采取了时间营销措施,即采取相应的技术方式全面获悉用户所需,于第一时间对用户当下的需求进行回应,以使用户在下决心购买的最佳时间及时看到对应的产品广告。III.个性化特点,在大数据时代下,广告商传统媒体导向的营销理念逐步由受众导向取代,现如今,广告商可应用大数据了解用户的地理方位,需求内容等信息,达到对用户个性化营销的目的。  大数据营销的价值:I.升级营销与用户的匹配度,大数据营销不仅可提供给企业了解用户有效的途径,还能够与网络环境下,选取相关技术方法达到对用户精确定位的目的,从而开展好营销工作,升级营销与用户的匹配度。II.改善用户体验,大数据营销促使企业真正意义上认识到用户及其所使用企业产品情况,以给予用户最人性化的提醒。  3.2.2大数据营销的应用  (1)与消费者建立紧密关系  现如今,我国一些企业营销行为仍旧处于个性化定位信息、创意设计阶段,而无法对不同消费者展开个性化的营销活动。大数据时代下,经采用相关数据分析技术方法,基于对消费群体喜好、传媒接触习惯等展开有效的分析,达到特定营销活动明确开展的目的,实现企业精心开展的营销活动精准的辐射至目标消费群体处,与消费者建立紧密关系,极大的改善营销效率、质量[4]。  (2)掌握竞争对手数据  企业通过对竞争对手数据的有效掌握,获悉竞争对手发展状况,基于此帮助企业制定科学合理的产品价格,提升企业产品市场竞争优势。与此同时,企业务必要全面实施以事实为前提的决策手段,广泛地应用数据分析方式对企业每一个发展运营步骤进行优化,经对企业一系列数据的充分优化、对接,促使业务环节中潜在的价值得以被有效挖掘,降低生产成本,知己知彼,促使企业在日趋白热化的市场竞争中占据有利位置。  (3)挖掘企业内部数据  “市场未动,数据先行”俨然转变为国际上企业有效运营发展的一致认识,为了提升企业管理效率,要求企业要充分挖掘企业内部数据,并展开有效的整合、分析,以为企业相关人员做决策提供有利的参考依据,提升决策准确性,促进企业可持续发展。

    3.2.4 企业的应用案例——以亚马逊为例  在应用大数据开展市场营销方面,美国亚马逊公司一直处于领先地位。亚马逊研发出“用户未下单,先发货”功能,即结合用户的购物需求数据信息,分析用户想要购买的产品,达到用户未下单,提前发货的目的。此外,亚马逊通过对用户检索信息的分析,评估流感的传播,但这仅仅为海量检索数据中的一项用途,相同的数据能够应用于预测大选结果、预测某类产品市场行情等等,极大地降低了统计成本[5]。  3.3大数据时代对市场营销的挑战  3.3.1信息收集  大数据并非就是对数据信息展开盲目的收集,即便收集了再多的数据,倘若这些数据并非是市场营销所需要的,如此便会导致前期收集来的数据信息,变成一堆“数据垃圾”。鉴于此,为了避免这一情况发生,务必要充分分析业务需求,再对自身存在价值的数据展开收集、归纳,如此方可实现大数据的有效收集应用。  3.3.2经验与数据  数据采集完毕后,面对参差不齐的数据,还应当做好数据评估工作,评估对何种目标受众开展市场营销工作。鉴于此,要求采取科学合理的手段,将这些参差不齐的数据整合成可被市场营销实践应用的,经结合过去的经验,与采集数据进行有机融合,实现对目标受众的有效分析确定。  3.3.3分析与优化  数据分析,一方面是实现数据优化,一方面是进行决策层面上的调整、转变。此环节对于专业人才的需求提出了严苛的挑战。数据分析、数据优化对于专业人才的知识框架要求大不相同,这要求相关企业不仅要培养专业的数据分析人才,还要打造数据优化人才队伍。 

     3.4大数据营销的未来发展趋势  信息技术不断发展,单一媒体导向的“消费者碎片化”俨然无法达到企业对于数据多样性的需求。大数据时代下,媒体的跨界融合实现对“碎片化”受众的充分聚合。在科学技术技术不断进步的背景下,跨媒介、跨平台、跨终端的多途径将不断被开拓,将使庞大的数据信息获取多维度的整合,并且在多样化网络环境下,消费者主观信息与客观数据有机融合,构筑全面用户数据库环节,将成为未来大数据营销发展的必然趋势[6]。  4.结束语  总而言之,大数据为传统统计学带来了严峻的考验,也为传统统计学有效发展创造了良好的契机。在大数据时代发展潮流中,我们应当充分的认识到大数据对于传统统计学而言,是补充而不是更替,构建于样本统计、预测分析内容上的传统统计学,仍旧于社会统计、经济分析中占据着主导位置。大数据时代下,为了实现企业市场营销的有效开展,相关人员务必要不断专研研究、总结经验,全面分析大数据与统计学的对比,充分认识大数据对统计学的挑战和机遇,“与消费者建立紧密关系”、“掌握竞争对手数据”、“挖掘企业内部数据”等,积极促进企业市场营销的科学合理化。

  • ?

    数据分析:大数据时代背景下对应用统计学专业的思考,看完长见识

    Nigel

    展开

    大数据时代背景下对应用统计学专业的思考

    一、概述 众所周知,统计学自古至今就是一门以研究数据为主的学科,至今已经形成了较为成熟的数据研究体系与框架。统计学专业的学生的主要就业方向是银行、会计师事务所、市场调查公司或其它企事业单位。因此目前统计学教育的主要目的是能够培养出独立完成问卷设计、数据收集、应用模型进行数据分析的高级统计人才,其主要专业课程包括:高等概率论与数理统计、应用回归、多元统计、市场调查实务、时间序列分析、金融计算等,这些课程仍然是传统的课程设置,并不符合大数据时代数据科学家的专业知识构成。因此,在大数据时代背景下对应用型本科院校应用统计学专业的培养模式和教学改革的思考是非常有必要的。   2012年3月29日,美国在倡议书中指出,美国将应用收集巨大、复杂数据的挖掘能力,加速科学与工程学科的创新脚步,改革学生培养模式。北京师范大学邱东教授探讨了面对大数据潮流人们应持有的科学态度,从大数据的概念功能、统计学与数据科學的关系、大数据潮流对统计学产生的影响等4个方面论述了大数据对统计学的挑战[1]。英国学者维克托·迈尔·舍恩伯格认为大数据的精髓在于分析信息时的3个转变:一是可以分析和处理更多甚至是全部的数据,不再依赖随机抽样;二是研究数据如此之多,以至于人们不再追求精确度;三是人们不再热衷于寻找因果关系[2]。为适应大数据时代对数据处理人才更高综合素质的要求,统计学科教师与专业教育应在知识结构、教育内容、教育方式和人才培养模式等方面,主动进行与时俱进的充实、调整及变革[3]。文章拟从数据挖掘与统计分析的联系与区别、大数据对统计教育及统计人才的机遇与挑战的新形势下从政府、企业和人才等多个角度进行展开调查,对于应用型本科院校培养顺应时代发展的应用统计学专业的高层次人才提供相应的建议。  

    二、统计分析与数据挖掘的区别与联系   统计分析是指运用统计收集整理方法及与分析对象有关的知识,从定量与定性的结合上进行的研究活动。   统计分析过程:描述要分析的数据的性质,研究基础群体的数据关系,创建一个模型,总结数据与基础群体的联系,证明(或否定)该模型的有效性,采用预测分析来预测将来的趋势。   统计分析方法:(1)描述统计:将研究中所得的数据加以整理、归类、简化或绘制成图表,以此描述和归纳数据的特征及变量之间的关系的方法。集中趋势、离散程度、相关强度等、指标有平均数、标准差、相关系数等;(2)推断统计:用概率形式来决断数据之间是否存在某种关系及用样本统计值来推测总体特征的一种重要的统计方法。总体参数估计、假设检验、Z检验、T检验、卡方检验等数据挖掘是从庞大的数据中分析出有目标数据群,筛选出利于决策的有效信息。数据挖掘的数据量极大,注重数据查询分析的可行性。数据挖掘是着眼于预测未来,从大量的数据中寻找某些规律。

    数据挖掘过程:(1)定义问题:分析业务需求、定义问题的范围、定义计算模型所使用的度量、定义数据挖掘项目的特定目标等;(2)准备数据:删除错误数据或插入缺失值、查找数据中的隐含相关性、标识最准确的数据源、确定哪些列最适合用于分析;(3)浏览数据:计算最小值和最大值、计算平均偏差和标准偏差、查看数据的分布;(4)部署和更新模型:根据实际数据部署、更新模型;(5)浏览和验证模型:测试模型的性能、需要使用不同配置创建多个模型,并对所有这些模型进行测试,查看哪个模型为最佳;(6)生成模型:通过创建挖掘结构定义要使用的数据列、将挖掘结构链接到数据源,但只有对挖掘结构进行处理后,该结构才会实际包含数据。 从上可以看出大数据虽与统计学密切相关,但二者也在研究目的、数据处理对象和技术工具上有着诸多差异。大数据的兴起不仅在分析手段、工作重心和价值理念上给统计学带来了重大影响,而且也使担负着培养现代统计工作和数据分析之人才的统计教育面临严峻挑战。  

    三、大数据对统计人才及统计教育的机遇与挑战   根据2014年大数据应用现状和趋势展开的调研分析,被调查者最关注的大数据技术中,排在前三位的分别是数据分析(统计分析与数据挖掘等)(25.5%)、数据采集(19.9%)、数据处理 (18.5%)。企业数据管理面临的挑战:缺乏专业的大数据人才(26.95%)成为企业面临的最大挑战,其次是非结构化数据的分析和处理(26.65%)、传统技术难以处理大数据(25.27%)以及新技术门槛过高(21.13%)。根据2015年2月Forrest报告,很多企业都在努力挖掘其拥有的大量数据,包括结构化、非结构化、半结构化数据等,探索对数据的深入利用。从国内企业大数据应用的现状和规划来看,已经部署大数据应用的企业所占比例达到21.89%,计划1年内部署的企业占27.92%,计划2年内部署的企业占14.34%,没有相关计划和不确定的企业分别占11.32%和24.53%。大数据相关人才的欠缺将会成为影响大数据市场发展的一个重要因素。据Gartner预测,到2016年,全球将新增440万个与大数据相关的工作岗位,且会有25%的组织设立首席数据官职位。大数据的相关职位需要的是复合型人才,能够对数学、统计学、数据分析、机器学习和自然语言处理等多方面知识综合掌控。   根据学院统计学不同方向等专业的学生、老师、专家以及政府范围工作人员等进行访问调查的结果,然后结合现如今大数据时代企业和政府对人才的需求,最终制定应用型人才培养方案分别如下:   (一)深化课程教学内容改革   1. 更新教学内容,紧跟时代发展——大数据、互联网金融、国民经济统计、货币银行、经济预测与决策;2. 强化统计基础,提高实践操作——统计方法、软件实现、贝叶斯统计、非参数估计、统计软件、数据挖掘;3. 强调专业导向,拓宽就业方向-选修、考证;金融类、经济类、管理类、会计类;统计从业资格证书。   最终根据学院不同方向统计学专业设置专业核心课如下:   (1)应用统计学:主要专业课 调整为:概率论、数理统计、统计学、回归分析、时间序列分析、多元统计分析,抽样技术、数据挖掘、贝叶斯统计、计量经济学、统计软件、非参数统计、统计调查等;(2)应用统计学(金融统计):主要专业课 调整為:概率论、数理统计、统计学、回归分析、时间序列分析、多元统计分析,抽样技术、数据挖掘、金融计量学、风险管理、保险学、非寿险精算、统计软件、国民经济核算、统计调查等;(3)经济统计学:主要专业课 调整为:概率论、数理统计、统计学、回归分析、时间序列分析、多元统计分析,抽样技术、数据挖掘、国民经济核算、风险管理、保险学、非寿险精算、统计软件、金融计量学、统计调查等。  

    (二)重视教学方法改革   1. 教师教学理念——单向灌输式转向引导探究式、教学案例能贴近实际问题(体测数据、大学生婚恋、手机);2. 鼓励学生参与各类项目——科研、调研、方案设计、抽样调查、统计调查、学科竞赛、教师课题(分解子课题);3. 注重综合能力提升——表达、协作、创新、研究报告、PPT展示等。   (三)建立完善的实践教学系统   1. 基本知识技能实验——理论教学的课内实验,大一、二:数学类;大二、大三(上):专业基础;2. 综合性实践教学——综合性数据的采集、处理、分析,大三(下)、四(上):数据挖掘、统计软件、统计调查;3. 探索性实践教学——社会调查、毕业实习、毕业论文,大四(下)。   (四)改革课程考试方式   1. 基本知识(理论)+实验报告(平时)+综合实验(期末)数学类;专业基础课程;2. 方案设计、调研报告、抽样调查、统计调查;3. 综合实验,数据挖掘、统计软件。   四、结束语   最终学院统计系下设两个教研室和一个研究中心,即基础统计教研室、专业统计教研室和大数据统计科学应用研究中心。秉承和依托母体学校——上海财经大学的办学宗旨和学术底蕴。在全校统计学公共课教学方面,针对学生的特点,课程教学采用课堂教学、调查实践与统计调查大赛相结合的教学方式与形式。也采取和校外企业、单位等合作项目老师指导学生参与的形式,这样既提高学生的实践能力又加强了师生之间的交流。在这样边学理论边实践的过程中也让学生足够了解现在企业所需人才的类型、找到自己的不足再补充理论方面的知识,然后学生还可以向学校反馈信息,这样最终形成一个学院专业始终跟得上经济的发展形势,不断地改革和完善教学内容,争取培养出在各级政府机关、银行、证券以及上市公司、企业集团、跨国公司等企事业单位和经营管理机构从事统计、市场调研、市场预测与决策、信息咨询、可行性研究和综合评价等实际工作以及科研单位从事研究工作的应用型人才。

统计学的数据分析

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP