- ?
大数据时代,什么专业火的一塌糊涂?
杳然
展开
随着大数据,电商的兴起,在近十年来统计硕士申请,就业,招聘相关热度持续升温。特别是很多学校开始了商业分析和数据科学的项目,吸引了大量申请人,其实这两个方向的课程结构也有一半以上的统计课程。那么统计有哪些就业领域呢?
在国内,统计学就业主要集中在政府部门及金融领域。比如统计局,文学情报中心,标准化研究院及国家信息中心这类政府机构。此外还有,咨询公司,各公司的市场研究部门,制造业,市场营销,工业企业的质量检测部门等企业事业单位。
一、金融领域
中国统计专业学生多面的的就业前景,就业形势还是非常不错的,银行,保险公司,证券公司等金融部门都是统计学可以考虑的方向。
1、量化投资方向,包括卖方金工、买方量化投研,量化控股。但由于门槛太高,不偏好应届生,进入较难。
2、信用卡中心也是一个大量需要统计的地方。工作相对安逸,但是工资真的不低。
3、P2P行业去做P2P信贷。
4、省分行。支行很多人都想回家,而回家有没有什么大公司。所以省分行,支行就是最好的选择。
5、其他金融岗位。比如投行,行研,固收销售交易,银行管培,券商管培,非量化风险等等,也有很多人会签。
另外,大数据很火,京东阿里给 数据挖掘之类的岗位的起薪不低,但是纯统计学想要做数据挖掘难度还是比较大。
二、其他行业
医疗卫生方向就业可以考虑去研究公司工作,想ppd就是全球最大的cro。在做新药研究临床试验方面这个职位还是有蛮大的需求的。
对于学校比较有感情,可以继续读Phd,然后各大高校也是选择之一,毕竟薪火需要有人传嘛。另外可以去政府机关,也可以靠公务员,主要岗位:卫生监督、食药监、出入境等。
三、统计专业就业因素
统计的就业方面可以说广的不行,而最终回去做什么工作,取决于:能去什么样的岗位;本科背景;个人性格偏好等
看完这些特点,你对统计学真的感兴趣吗?
很多同学是因为拥挤专业更容易找工作而选择统计,实际上并不能去从统计的专业中感受到乐趣。那么看了上面统计的就业领域,是不是觉得作为一门实用工具,统计专业亦能给你别样的探索世界的乐趣呢?
- ?
浅议大数据时代下的各自媒体平台后台数据现状
灵凡
展开
世界互联网大会上阿里BAT互联网老大们都有提及到今后的发展趋势将是从IT时代向DT时代发展,DT时代就是大数据的意思。
那么,近年来互联网相关企业产品利用大数据的能力真的那么成熟了吗?笔者以为,还未到成熟阶段,了不起大家越来越重视数据的作用啦。以案例来说说具体表现吧:
笔者入驻过现在流行的几个自媒体平台,一般其后台都有一个所谓的大数据统计功能,因为是自己写的文章,自己的帐号后台,数据统计的精准与否,我是第一时间就知晓的,最起码可以知道这份数据报告的真实性与准确性到底有多大吧。以下就从笔者的不同自媒体平台后台截图实际说说各自大数据的能力到底有何高低吧!
1,UC订阅号
从这个表里可看出,明显的统计信息不准确,11月12号才213人关注,几天时间突然冲到关注人数610人啦,然后昨天又突然变成关注人数仍为295人,而取消关注人数统计数却显示为0,这连小学生都看出它的不准确性啦,因此,笔者侧面认为,这个UC大数据能力不过关,一个字:差。(重大BUG)
2,360众媒平台
这个360,笔者对其真是无语啦!前段时间360云盘宣布关闭个人免费业务,那时就让我对这个以搅局上位的公司心存厌恶,今天看到这个众媒平台后台所谓的大数据更是不高兴,明明有近60个文章评论量,而在文章阅读量上却显示为0,这不是明显的垃圾统计嘛,两个字形容“极差”。
其它平台,暂不多说啦,都是八九不离十,不相上下啦!
笔者由此得出结论,所谓的大数据开放能力暂时只是发展初期水平,并没有互联网大会上所说的那么发展迅速!大数据是未来,各大公司都认可这个东西,但只能说是跟风,作个后台表格装下逼而已,缺乏真材实料!
未来已来,机会还有很多,关键还是要靠自己!相信平台的力量,你将无路可走!
END如有不认同本人价值观的欢迎吐槽!
内心的火热让我觉得天天都有好事情发生呢!
- ?
大数据时代的百度指数
紫霜
展开
日常生活中,我们每个人都在用百度搜索,百度的产品已经深深融入我们的生活和学习中,我们有事都会“百度一下”,可是我们每个人在这个过程中得到的信息都是琐碎和分散的,相对来说,接收到的信息是侧面的,有点“一叶障目不见泰山”的感觉,那么有没有一款可以让我们轻点两下鼠标,就可以看到整体趋势变化的网站呢?答案是肯定的,百度指数就给我们提供了这样的机会,我们再也不用像地理信息系统专业那样做大量的数据统计工作,当然了,我们也可以不用理会那些专业的、晦涩难懂的软件。最关键的是,你不用抓耳挠腮的去用爬虫程序去爬这些数据,既然铺垫都做好了,那么我们接下来重点介绍一下这款属于大数据时代的分析工具—百度指数。
抛开学科的复杂性,我们用一组例子来阐述说明百度指数。就拿我们日常关注的手机品牌说起吧。我们知道每个人都有自己喜欢的手机品牌,那么就全国范围来说,每个人喜欢的品牌到底有什么地域和性别差别呢?接下来我们就以小米手机和华为手机为例子给大家说明。举一反三,如果大家喜欢比较别的品牌,也可以自己操作。
下面是小米手机和华为手机的地域搜索对比,也就是说每个省份的人们都会有自己喜欢的品牌,所以每个省份对品牌的搜索程度是不一样的,这就是百度指数给我们提供的结果。
图1 手机地域搜索全局对比图在图上右半部分我们可以看到,我们不但可以了解省份之间的差异,我们还可以看到区域和城市的变化。颜色越深说明该区域的关注程度越高,不出我们所料,发达的省份搜索程度相对较高,西部的相对来说较低。既然搜索程度相对较高,那么人们一般的购买意愿也就较强。还有一个有意思的情况,那就是华为手机(绿色)的搜索量明显高于小米手机的搜索量,这也从一个侧面反映出华为的品牌效应这么多年不是盖的,实力上明显是要强于小米的。
接下来我们带来的是人群属性的分析,我们迫切想知道喜欢这些品牌的人的年龄分布和性别分布是怎么样的,那么快点往下看吧!
图2 性别和年龄对比图如果仔细看这张图的话,我们就可以发现,两个品牌虽然整体相似,但是也出现了一些微妙的变化。小米在20-29岁占的比例比华为略大,而在40-49岁之间华为比小米更多,这已经很能说明问题了,那就是小米吸引的年轻一代更多,而华为有一批忠实的中年用户。相别上两者并无多大差别,可以看出性别并不是影响选择的最主要因素,但是会有一定的影响。
最后我来做个抛砖引玉的作用,我们上面所介绍的是当月的情况,我们还可以自定义时间,也可以看到整体趋势、PC端变化、移动端的变化趋势。
图3 各平台变化趋势图我们也可以看到资讯图谱,红色表示在这个平台搜索趋势是上升的,而绿色表示在该平台是下降的。这大大方便了我们的调研工作。图示如下:
图4 不同平台搜索热度图图5 搜索热度数字表述图今天的内容就是这些了,如果大家觉得还不错,欢迎大家转发给更多人,让更多的人享受到科技的乐趣!
- ?
大数据时代,网站流量统计分析的重要性
破色
展开
随着时代越来越向大数据靠拢,各行各业的商业信息都会存储在大数据里,而网站流量的统计就成了一切数据来源分析的基石。网站流量记录网站每天的访问情况,记载网站访问的变化量,而网站流量统计分析就是企业寻找新客户的一个渠道。
大数据时代我们可以从网站流量统计分析里面看出哪些用户对自身的产品、服务有兴趣,探索潜在客户的价值。那么下面我们了解一下网站流量统计分析系统的一些功能作用。
首先,统计概况分析—
网站综合情况的一个汇总。把网站的PV,独立访客。等按日/年累计做一个总体的概述。
其次,按在线情况分析—
在线情况分析分别记录在线用户的活动信息,包括:来访时间、访客地域、来路页面、当前停留页面 等。这些功能对企业实时掌握自身网站流量有很大的帮助。
然后,按时段进行分析—
时段分析提供网站任意时间内的流量变化情况。或者某一段时间到某一段时间的流量变化,比如小时段分布,日访问量分布,对于企业了解用户浏览网页的的时间段有一个很好的分析,比如说企业要投百度广告,谷哥广告时,可以选择这个时间段放更多的资源与精力。增加转化率。
接着,按搜索引擎分析—
搜索引擎统计分析提供各搜索引擎带来的关键词搜索次数、IP、独立访客、人均搜索次数、页面停留时间等数据。这些数据可以让企业了解用户通过什么关键词来找到自己的网站,那么在做SEO时/百度竞价推广时,提供一些数据分析。提高推广关键词的精确度。
最后,对访客详情分析—
访客详情分析一般提供地区分布,网络接入商,浏览器,分辨率,操作系统,语言,端类型,插件安装数据。这些数据很重要。对于地区投放广告提供一个一个参考数据,同时企业网站调整与网站设计得到一些用户习惯数据,从而设计出一个真正符合用户浏览习惯的高质量网站。
综上所述,我们不难发现,网站流量统计分析是每一个做互联网行业不可或缺的一份子。
- ?
大数据时代的现下,讲述人类第一份大数据统计:死亡统计表
余含蕾
展开
三百年前一位居住在伦敦的非凡人物,第一位数据挖掘者,业余科学家——约翰·格兰特。
格兰特生活的年代,人类正面临最艰难生存考验,即黑死病。
格兰特开始在教区的死亡记录中搜寻线索,也就是死亡统计表。
死亡统计表基本上就是随机的一组组信息,而他将其归纳整理并在其中找到了规律。
他将所有的死亡记录汇编到一起,而这些统计数据让他发现了,别人没发现的规律。
他列出一系列死亡原因并将其归类整理,即使现在我们回头查找都能知道当时人们的死因。
在瘟疫的受害者数据中,格兰特发现了隐藏规律。他用数据反驳了一个档是公认的看法,即瘟疫是由人与人接触而传播,他同时也反驳了另一个当时被公认的说法,新国王登基之年常出现瘟疫。
(记录了当时伦敦死亡人员的死亡原因)
格兰特对数据研究越多就发现越多规律,人们开始从全新角度观察伦敦城,他是首个估算出伦敦人口的人,他证明了男婴出生率高于女婴,但更高的男性死亡率又使性别比例恢复了平衡。
它告诉世人可以通过挖掘数据得到惊人而实用的想法,只要你用对了方法。
他彻底改变了人们对于信息的观念并革新了提取有用数据的方法。格兰特算得上是此领域的先驱者。
格兰特是统计学和流行病学的奠基人,流行病学主要研究疾病的规律,起因与影响,而这些数据对于现代医学也有极其重要的价值。
- ?
经验分享:大数据时代,如何让数据成为资产
孤独人
展开
数据飞速增长的今天,生活在大数据的压力下,从事大数据行业的你,该如何更好地自处?
今天小编给大家分享一篇经验帖,希望能够给你带来帮助!
作者从从大数据开发的角度,到大数据治理的必要性,再到图形化建模的畅想,最后在数据质量的把关,然后到大数据可视化的应用,总结他的所见所闻以及他的学习的成果,分享给大家。
大数据开发
大数据开发,有几个阶段:
1.数据采集【原始数据】
2.数据汇聚【经过清洗合并的可用数据】
3.数据转换和映射【经过分类,提取的专项主题数据】
4.数据应用 【提供api 智能系统 应用系统等】
数据采集
数据采集有线上和线下两种方式,线上一般通过爬虫、通过抓取,或者通过已有应用系统的采集,在这个阶段,我们可以做一个大数据采集平台,依托自动爬虫(使用python或者nodejs制作爬虫软件),ETL工具、或者自定义的抽取转换引擎,从文件中、数据库中、网页中专项爬取数据,如果这一步通过自动化系统来做的话,可以很方便的管理所有的原始数据,并且从数据的开始对数据进行标签采集,可以规范开发人员的工作。并且目标数据源可以更方便地管理。
数据采集的难点在于多数据源,例如mysql、postgresql、sqlserver 、 mongodb 、sqllite。还有本地文件、excel统计文档、甚至是doc文件。如何将他们规整的、有方案的整理进我们的大数据流程中也是必不可缺的一环。
数据汇聚
数据的汇聚是大数据流程最关键的一步,你可以在这里加上数据标准化,你也可以在这里做数据清洗,数据合并,还可以在这一步将数据存档,将确认可用的数据经过可监控的流程进行整理归类,这里产出的所有数据就是整个公司的数据资产了,到了一定的量就是一笔固定资产。
数据汇聚的难点在于如何标准化数据,例如表名标准化,表的标签分类,表的用途,数据的量,是否有数据增量?,数据是否可用? 需要在业务上下很大的功夫,必要时还要引入智能化处理,例如根据内容训练结果自动打标签,自动分配推荐表名、表字段名等。还有如何从原始数据中导入数据等。
数据转换和映射
经过数据汇聚的数据资产如何提供给具体的使用方使用?在这一步,主要就是考虑数据如何应用,如何将两个?三个?数据表转换成一张能够提供服务的数据。然后定期更新增量。
经过前面的那几步,在这一步难点并不太多了,如何转换数据与如何清洗数据、标准数据无二,将两个字段的值转换成一个字段,或者根据多个可用表统计出一张图表数据等等。
数据应用
数据的应用方式很多,有对外的、有对内的,如果拥有了前期的大量数据资产,通过restful API提供给用户?或者提供流式引擎 KAFKA 给应用消费? 或者直接组成专题数据,供自己的应用查询?这里对数据资产的要求比较高,所以前期的工作做好了,这里的自由度很高。
大数据治理
大数据治理应该贯穿整个大数据开发流程,它有扮演着重要的角色,浅略的介绍几点:
数据血缘
数据质量审查
全平台监控
数据血缘
从数据血缘说起,数据血缘应该是大数据治理的入口,通过一张表,能够清晰看见它的来龙去脉,字段的拆分,清洗过程,表的流转,数据的量的变化,都应该从数据血缘出发,我个人认为,大数据治理整个的目标就是这个数据血缘,从数据血缘能够有监控全局的能力。
数据血缘是依托于大数据开发过程的,它包围着整个大数据开发过程,每一步开发的历史,数据导入的历史,都应该有相应的记录,数据血缘在数据资产有一定规模时,基本必不可少。
数据质量审查
数据开发中,每一个模型(表)创建的结束,都应该有一个数据质量审查的过程,在体系大的环境中,还应该在关键步骤添加审批,例如在数据转换和映射这一步,涉及到客户的数据提供,应该建立一个完善的数据质量审查制度,帮助企业第一时间发现数据存在的问题,在数据发生问题时也能第一时间看到问题的所在,并从根源解决问题,而不是盲目的通过连接数据库一遍一遍的查询sql。
全平台监控
监控呢,其实包含了很多的点,例如应用监控,数据监控,预警系统,工单系统等,对我们接管的每个数据源、数据表都需要做到实时监控,一旦发生殆机,或者发生停电,能够第一时间电话或者短信通知到具体负责人,这里可以借鉴一些自动化运维平台的经验的,监控约等于运维,好的监控提供的数据资产的保护也是很重要的。
大数据可视化
大数据可视化不仅仅是图表的展现,大数据可视化不仅仅是图表的展现,大数据可视化不仅仅是图表的展现,重要的事说三遍,大数据可视化归类的数据开发中,有一部分属于应用类,有一部分属于开发类。
在开发中,大数据可视化扮演的是可视化操作的角色, 如何通过可视化的模式建立模型? 如何通过拖拉拽,或者立体操作来实现数据质量的可操作性? 画两个表格加几个按钮实现复杂的操作流程是不现实的。
在可视化应用中,更多的也有如何转换数据,如何展示数据,图表是其中的一部分,平时更多的工作还是对数据的分析,怎么样更直观的表达数据?这需要对数据有深刻的理解,对业务有深刻的理解,才能做出合适的可视化应用。
智能的可视化平台
可视化是可以被再可视化的,例如superset,通过操作sql实现图表,有一些产品甚至能做到根据数据的内容智能分类,推荐图表类型,实时的进行可视化开发,这样的功能才是可视化现有的发展方向,我们需要大量的可视化内容来对公司发生产出,例如服装行业,销售部门:进货出货,颜色搭配对用户的影响,季节对选择的影响 生产部门:布料价格走势? 产能和效率的数据统计? 等等,每一个部门都可以有一个数据大屏,可以通过平台任意规划自己的大屏,所有人每天能够关注到自己的领域动向,这才是大数据可视化应用的具体意义。
总结:大数据开发的难点
大数据开发的难点主要是监控,怎么样规划开发人员的工作?开发人员随随便便采集了一堆垃圾数据,并且直连数据库。 短期来看,这些问题比较小,可以矫正。 但是在资产的量不断增加的时候,这就是一颗定时炸弹,随时会引爆,然后引发一系列对数据资产的影响,例如数据混乱带来的就是数据资产的价值下降,客户信任度变低。
如何监控开发人员的开发流程?
答案只能是自动化平台,只有自动化平台能够做到让开发人员感到舒心的同时,接受新的事务,抛弃手动时代。
这就是前端开发工程师在大数据行业中所占有的优势点,如何制作交互良好的可视化操作界面?如何将现有的工作流程、工作需求变成一个个的可视化操作界面? 可不可以使用智能化取代一些无脑的操作?
从一定意义上来说,大数据开发中,我个人认为前端开发工程师占据着更重要的位置,仅次于大数据开发工程师。至于后台开发,系统开发是第三位的。好的交互至关重要,如何转换数据,如何抽取数据,一定程度上,都是有先人踩过的坑,例如kettle,再例如kafka,pipeline ,解决方案众多。关键是如何交互? 怎么样变现为可视化界面? 这是一个重要的课题。
现有的各位朋友的侧重点不同,认为前端的角色都是可有可无,我觉得是错误的,后台的确很重要,但是后台的解决方案多。 前端实际的地位更重要,但是基本无开源的解决方案,如果不够重视前端开发, 面临的问题就是交互很烂,界面烂,体验差,导致开发人员的排斥,而可视化这块的知识点众多,对开发人员的素质要求更高。
OK,分享结束,小本本记满了木有?
作者:张泰峰
- ?
大数据时代:什么是数据分析的灵魂
姚寒香
展开
在数据“爆炸”的时代,大数据常常被寄予厚望。到底,什么样的数据才算大数据,怎样才能用好大数据,传统统计学是否还有用武之地?
让大数据区别于数据的,是其海量积累、高增长率和多样性
什么是数据?数据(data)在拉丁文里是“已知”的意思,在英文中的一个解释是“一组事实的集合,从中可以分析出结论”。笼统地说,凡是用某种载体记录下来的、能反映自然界和人类社会某种信息的,就可称之为数据。古人“结绳记事”,打了结的绳子就是数据。步入现代社会,信息的种类和数量越来越丰富,载体也越来越多。数字是数据,文字是数据,图像、音频、视频等都是数据。
什么是大数据呢?量的增多,是人们对大数据的第一个认识。随着科技发展,各个领域的数据量都在迅猛增长。有研究发现,近年来,数字数据的数量每3年多就会翻一番。
大数据区别于数据,还在于数据的多样性。正如高德纳咨询公司研究报告指出的,数据的爆炸是三维的、立体的。所谓的三维,除了指数据量快速增大外,还指数据增长速度的加快,以及数据的多样性,即数据的来源、种类不断增加。
从数据到大数据,不仅是量的积累,更是质的飞跃。海量的、不同来源、不同形式、包含不同信息的数据可以容易地被整合、分析,原本孤立的数据变得互相联通。这使得人们通过数据分析,能发现小数据时代很难发现的新知识,创造新的价值。
通过数据来研究规律、发现规律,贯穿了人类社会发展的始终。人类科学发展史上的不少进步都和数据采集分析直接相关,例如现代医学流行病学的开端。伦敦1854年发生了大规模的霍乱,很长时间没有办法控制。一位医师用标点地图的方法研究了当地水井分布和霍乱患者分布之间的关系,发现有一口水井周围,霍乱患病率明显较高,借此找到了霍乱暴发的原因:一口被污染的水井。关闭这口水井之后,霍乱的发病率明显下降。这种方法,充分展示了数据的力量。
本质上说,许多科学活动都是数据挖掘,不是从预先设定好的理论或者原理出发,通过演绎来研究问题,而是从数据本身出发通过归纳来总结规律。近现代以来,随着我们面临的问题变得越来越复杂,通过演绎的方式来研究问题常常变得很困难。这就使得数据归纳的方法变得越来越重要,数据的重要性也越发凸显出来。
大数据是非竞争性资源,有助于政府科学决策、商家精准营销
大数据时代,数据的重要作用更加凸显,许多国家都把大数据提升到国家战略的高度。
政府合理利用大数据,引导决策的将是基于实证的事实,政府会更有预见性、更加负责、更加开放。中国古代治国就已经有重数据的思想,如商鞅提出,“强国知十三数……欲强国,不知国十三数,地虽利,民虽众,国愈弱至削”。大数据时代,循“数”治国将更加有效。小数据时代,政府做决策更多依凭经验和局部数据,难免头痛医头、脚痛医脚。比如,交通堵塞就多修路。大数据时代,政府做决策能够从粗放型转向集约型。路堵了,利用大数据分析,可以得知哪一时间、哪一地段最容易堵,或在这一地段附近多修路,或提前预警引导居民合理安排出行,实现对交通流的最佳配置和控制,改善交通。
对于商家来说,大数据使精准营销成为可能。一个有趣的故事,是沃尔玛超市的“啤酒、尿布”现象。沃尔玛超市分析销售数据时发现,顾客消费单上和尿布一起出现次数最多的商品,竟然是啤酒。跟踪调查后发现,有不少年轻爸爸会在买尿布时,顺便买些啤酒喝。沃尔玛发现这一规律后,搭配促销啤酒、尿布,销量大幅增加。大数据时代,每个人都会“自发地”提供数据。我们的各种行为,如点击网页、使用手机、刷卡消费、观看电视、坐地铁出行、驾驶汽车,都会生成数据并被记录下来,我们的性别、职业、喜好、消费能力等信息,都会被商家从中挖掘出来,以分析商机。
大数据也将使个人受益。从生物学、医学上讲,以前生物学家只是通过对单个或几个基因的操控来观察其对生物体的影响,很难发现整体的关联。现在由于技术的发展,可以分析很多,如遗传信息、全体基因的表达量信息、蛋白质族谱信息、全基因组甲基化信息、表观遗传信息等。同时还有个人健康指标、病历、药物反应等数据。如果真能达成生物学上多维多向数据的有机融合,就能够把个人完整地描述出来,从而实现精准医疗的目的。
大数据时代,审核数据的真实性也有了更有效的手段。大数据的特征之一是多样性,不同来源、不同维度的数据之间存在一定的关联度,可以交叉验证。例如,某地的工业产值虚报了一倍,但用电量和能耗却没有达到相应的规模。这就是数据异常,很容易被系统识别出来。发现异常后,相关部门再进行复核,就能更有针对性地防止、打击数据造假。
数据是一种资源,但数据又跟煤、石油等物质性资源不一样。物质性资源不可再生,你用多了,别人就用少了,因而很难共享。数据可以重复使用、不断产生新的价值。大数据资源的使用是非恶性竞争的,共享的前提下,更能够制造双赢。从另一个角度来说,数据如果不被融合、联系在一起,也不能称之为大数据。
大数据不能被直接拿来使用,统计学依然是数据分析的灵魂
现在社会上有一种流行的说法,认为在大数据时代,“样本=全体”,人们得到的不是抽样数据而是全数据,因而只需要简单地数一数就可以下结论了,复杂的统计学方法可以不再需要了。
在我看来,这种观点非常错误。首先,大数据告知信息但不解释信息。打个比方说,大数据是“原油”而不是“汽油”,不能被直接拿来使用。就像股票市场,即使把所有的数据都公布出来,不懂的人依然不知道数据代表的信息。大数据时代,统计学依然是数据分析的灵魂。正如加州大学伯克利分校迈克尔·乔丹教授指出的,“没有系统的数据科学作为指导的大数据研究,就如同不利用工程科学的知识来建造桥梁,很多桥梁可能会坍塌,并带来严重的后果。”
其次,全数据的概念本身很难经得起推敲。全数据,顾名思义就是全部数据。这在某些特定的场合对于某些特定的问题确实可能实现。比如,要比较清华、北大两校同学数学能力整体上哪个更强,可以收集到两校同学高考时的数学成绩作为研究的数据对象。从某种意义上说,这是全数据。但是,并不是说我们有了这个全数据就能很好地回答问题。
一方面,这个数据虽然是全数据,但仍然具有不确定性。入校时的数学成绩并不一定完全代表学生的数学能力。假如让所有同学重新参加一次高考,几乎每个同学都会有一个新的成绩。分别用这两组全数据去做分析,结论就可能发生变化。另一方面,事物在不断地发展和变化,同学入校时的成绩并不能够代表现在的能力。全体同学的高考成绩数据,仅对于那次考试而言是全数据。“全”是有边界的,超出了边界就不再是全知全能了。事物的发展充满了不确定性,而统计学,既研究如何从数据中把信息和规律提取出来,找出最优化的方案;也研究如何把数据当中的不确定性量化出来。
所以说,在大数据时代,数据分析的很多根本性问题和小数据时代并没有本质区别。当然,大数据的特点,确实对数据分析提出了全新挑战。例如,许多传统统计方法应用到大数据上,巨大计算量和存储量往往使其难以承受;对结构复杂、来源多样的数据,如何建立有效的统计学模型也需要新的探索和尝试。对于新时代的数据科学而言,这些挑战也同时意味着巨大的机遇,有可能会产生新的思想、方法和技术。
广州四方传媒股份有限公司,为众多客户提供大数据精准营销服务
网址:http://sefve/
- ?
数据分析:大数据时代背景下对应用统计学专业的思考,看完长见识
宓昊焱
展开
大数据时代背景下对应用统计学专业的思考
一、概述 众所周知,统计学自古至今就是一门以研究数据为主的学科,至今已经形成了较为成熟的数据研究体系与框架。统计学专业的学生的主要就业方向是银行、会计师事务所、市场调查公司或其它企事业单位。因此目前统计学教育的主要目的是能够培养出独立完成问卷设计、数据收集、应用模型进行数据分析的高级统计人才,其主要专业课程包括:高等概率论与数理统计、应用回归、多元统计、市场调查实务、时间序列分析、金融计算等,这些课程仍然是传统的课程设置,并不符合大数据时代数据科学家的专业知识构成。因此,在大数据时代背景下对应用型本科院校应用统计学专业的培养模式和教学改革的思考是非常有必要的。 2012年3月29日,美国在倡议书中指出,美国将应用收集巨大、复杂数据的挖掘能力,加速科学与工程学科的创新脚步,改革学生培养模式。北京师范大学邱东教授探讨了面对大数据潮流人们应持有的科学态度,从大数据的概念功能、统计学与数据科學的关系、大数据潮流对统计学产生的影响等4个方面论述了大数据对统计学的挑战[1]。英国学者维克托·迈尔·舍恩伯格认为大数据的精髓在于分析信息时的3个转变:一是可以分析和处理更多甚至是全部的数据,不再依赖随机抽样;二是研究数据如此之多,以至于人们不再追求精确度;三是人们不再热衷于寻找因果关系[2]。为适应大数据时代对数据处理人才更高综合素质的要求,统计学科教师与专业教育应在知识结构、教育内容、教育方式和人才培养模式等方面,主动进行与时俱进的充实、调整及变革[3]。文章拟从数据挖掘与统计分析的联系与区别、大数据对统计教育及统计人才的机遇与挑战的新形势下从政府、企业和人才等多个角度进行展开调查,对于应用型本科院校培养顺应时代发展的应用统计学专业的高层次人才提供相应的建议。
二、统计分析与数据挖掘的区别与联系 统计分析是指运用统计收集整理方法及与分析对象有关的知识,从定量与定性的结合上进行的研究活动。 统计分析过程:描述要分析的数据的性质,研究基础群体的数据关系,创建一个模型,总结数据与基础群体的联系,证明(或否定)该模型的有效性,采用预测分析来预测将来的趋势。 统计分析方法:(1)描述统计:将研究中所得的数据加以整理、归类、简化或绘制成图表,以此描述和归纳数据的特征及变量之间的关系的方法。集中趋势、离散程度、相关强度等、指标有平均数、标准差、相关系数等;(2)推断统计:用概率形式来决断数据之间是否存在某种关系及用样本统计值来推测总体特征的一种重要的统计方法。总体参数估计、假设检验、Z检验、T检验、卡方检验等数据挖掘是从庞大的数据中分析出有目标数据群,筛选出利于决策的有效信息。数据挖掘的数据量极大,注重数据查询分析的可行性。数据挖掘是着眼于预测未来,从大量的数据中寻找某些规律。
数据挖掘过程:(1)定义问题:分析业务需求、定义问题的范围、定义计算模型所使用的度量、定义数据挖掘项目的特定目标等;(2)准备数据:删除错误数据或插入缺失值、查找数据中的隐含相关性、标识最准确的数据源、确定哪些列最适合用于分析;(3)浏览数据:计算最小值和最大值、计算平均偏差和标准偏差、查看数据的分布;(4)部署和更新模型:根据实际数据部署、更新模型;(5)浏览和验证模型:测试模型的性能、需要使用不同配置创建多个模型,并对所有这些模型进行测试,查看哪个模型为最佳;(6)生成模型:通过创建挖掘结构定义要使用的数据列、将挖掘结构链接到数据源,但只有对挖掘结构进行处理后,该结构才会实际包含数据。 从上可以看出大数据虽与统计学密切相关,但二者也在研究目的、数据处理对象和技术工具上有着诸多差异。大数据的兴起不仅在分析手段、工作重心和价值理念上给统计学带来了重大影响,而且也使担负着培养现代统计工作和数据分析之人才的统计教育面临严峻挑战。
三、大数据对统计人才及统计教育的机遇与挑战 根据2014年大数据应用现状和趋势展开的调研分析,被调查者最关注的大数据技术中,排在前三位的分别是数据分析(统计分析与数据挖掘等)(25.5%)、数据采集(19.9%)、数据处理 (18.5%)。企业数据管理面临的挑战:缺乏专业的大数据人才(26.95%)成为企业面临的最大挑战,其次是非结构化数据的分析和处理(26.65%)、传统技术难以处理大数据(25.27%)以及新技术门槛过高(21.13%)。根据2015年2月Forrest报告,很多企业都在努力挖掘其拥有的大量数据,包括结构化、非结构化、半结构化数据等,探索对数据的深入利用。从国内企业大数据应用的现状和规划来看,已经部署大数据应用的企业所占比例达到21.89%,计划1年内部署的企业占27.92%,计划2年内部署的企业占14.34%,没有相关计划和不确定的企业分别占11.32%和24.53%。大数据相关人才的欠缺将会成为影响大数据市场发展的一个重要因素。据Gartner预测,到2016年,全球将新增440万个与大数据相关的工作岗位,且会有25%的组织设立首席数据官职位。大数据的相关职位需要的是复合型人才,能够对数学、统计学、数据分析、机器学习和自然语言处理等多方面知识综合掌控。 根据学院统计学不同方向等专业的学生、老师、专家以及政府范围工作人员等进行访问调查的结果,然后结合现如今大数据时代企业和政府对人才的需求,最终制定应用型人才培养方案分别如下: (一)深化课程教学内容改革 1. 更新教学内容,紧跟时代发展——大数据、互联网金融、国民经济统计、货币银行、经济预测与决策;2. 强化统计基础,提高实践操作——统计方法、软件实现、贝叶斯统计、非参数估计、统计软件、数据挖掘;3. 强调专业导向,拓宽就业方向-选修、考证;金融类、经济类、管理类、会计类;统计从业资格证书。 最终根据学院不同方向统计学专业设置专业核心课如下: (1)应用统计学:主要专业课 调整为:概率论、数理统计、统计学、回归分析、时间序列分析、多元统计分析,抽样技术、数据挖掘、贝叶斯统计、计量经济学、统计软件、非参数统计、统计调查等;(2)应用统计学(金融统计):主要专业课 调整為:概率论、数理统计、统计学、回归分析、时间序列分析、多元统计分析,抽样技术、数据挖掘、金融计量学、风险管理、保险学、非寿险精算、统计软件、国民经济核算、统计调查等;(3)经济统计学:主要专业课 调整为:概率论、数理统计、统计学、回归分析、时间序列分析、多元统计分析,抽样技术、数据挖掘、国民经济核算、风险管理、保险学、非寿险精算、统计软件、金融计量学、统计调查等。
(二)重视教学方法改革 1. 教师教学理念——单向灌输式转向引导探究式、教学案例能贴近实际问题(体测数据、大学生婚恋、手机);2. 鼓励学生参与各类项目——科研、调研、方案设计、抽样调查、统计调查、学科竞赛、教师课题(分解子课题);3. 注重综合能力提升——表达、协作、创新、研究报告、PPT展示等。 (三)建立完善的实践教学系统 1. 基本知识技能实验——理论教学的课内实验,大一、二:数学类;大二、大三(上):专业基础;2. 综合性实践教学——综合性数据的采集、处理、分析,大三(下)、四(上):数据挖掘、统计软件、统计调查;3. 探索性实践教学——社会调查、毕业实习、毕业论文,大四(下)。 (四)改革课程考试方式 1. 基本知识(理论)+实验报告(平时)+综合实验(期末)数学类;专业基础课程;2. 方案设计、调研报告、抽样调查、统计调查;3. 综合实验,数据挖掘、统计软件。 四、结束语 最终学院统计系下设两个教研室和一个研究中心,即基础统计教研室、专业统计教研室和大数据统计科学应用研究中心。秉承和依托母体学校——上海财经大学的办学宗旨和学术底蕴。在全校统计学公共课教学方面,针对学生的特点,课程教学采用课堂教学、调查实践与统计调查大赛相结合的教学方式与形式。也采取和校外企业、单位等合作项目老师指导学生参与的形式,这样既提高学生的实践能力又加强了师生之间的交流。在这样边学理论边实践的过程中也让学生足够了解现在企业所需人才的类型、找到自己的不足再补充理论方面的知识,然后学生还可以向学校反馈信息,这样最终形成一个学院专业始终跟得上经济的发展形势,不断地改革和完善教学内容,争取培养出在各级政府机关、银行、证券以及上市公司、企业集团、跨国公司等企事业单位和经营管理机构从事统计、市场调研、市场预测与决策、信息咨询、可行性研究和综合评价等实际工作以及科研单位从事研究工作的应用型人才。
- ?
数据分析:浅谈大数据对统计学的挑战和机遇,看完长见识了!
燕双双
展开
浅谈大数据对统计学的挑战和机遇
引言 国际数据公司的相关研究指出,2011年全球数据生产量达1.8ZB,且全球信息总量每隔两年增长一倍[1]。在大数据时代下,对于统计学发展而言,挑战与机遇并存,挑战指的是现阶段传统统计学相关方法难以适用大数据,机遇指的是基于统计学,大数据展开数据处理、分析,促使大数据具备可视化特性。由此可见,研究大数据对统计学的挑战和机遇有着十分重要的现实意义。 1.大数据及其目的 现阶段,关于大数据仍旧没有一个十分明确的界定,大数据起初是源自于技术领域。在信息量不断扩大的情况下,使得常规电脑原有存储空间已不能对新处理数据进行承载,新兴数据处理技术得以产生,好比雅虎的Hadoop平台、谷歌的MapReduce等。此类技术能够对僵化层次结构、一致性予以消除,促进数据无需通过常规数据库表格进行排列,极大程度地提升了人们可处理的数据量[1]。
2.大数据与统计学的对比 2.1样本统计与全样本统计的区别 样本统计属于统计学不可或缺的依赖,样本指的是结合相应的概率自总体中随机筛选并视作总体代表的集合内容,值得一提的是随机抽样是需要成本的,包括社会关系、资金成本或者时间成本等。基于样本数量提升有限前提下,样本估计误差会随着总体数量增多而增大,这亦是样本统计无法避免的不足。大数据时代下,收集整理庞大的数据信息应运而生,数据信息发展表现出总体即是样本的态势,该属性很好的消除了样本统计这一不足。大数据时代下的全样本统计,通常情况下可对完全总体进行覆盖,然而受大部分数据属于半结构、半结构数据影响,使得概率论应用遭受一定的制约[2]。鉴于此,将全样本统计应用到统计学中,应当就总体数据展开相应的归纳、筛选,即好比在样本统计中展开数据预处理。 2.2预测分析与非预测分析的区别 统计学的创立,是为了对变量相互相关关系展开分析,因此获取数据是发生于变量确定之后的,数据分析价值是能够被预测的。相较于统计学的预测分析,庞大数据将互联网、传感器作为载体,存在于分析需求之前,因此构建于大数据上的分析多为非预测性分析。在统计学中,出现大数据无法有效应用局面,这是由于不具备非预测分析所需的庞大数据,庞大数据产生与数据中心、存储系统存在紧密的联系,并非短期产生。也就是说,统计学中大数据的应用发展,说明了非预测分析正逐步取代传统统计学预测分析,数据多次利用正逐步取代传统数据一次性利用的。 3.大数据对统计学的挑战与机遇 3.1数据生产、处理与应用的转变
相关统计部门经开展严格的统计设计工作,获得相关的统计数据,数据的预处理分别有数据清洗、非全面数据填补以及数据矫正等。大数据时代下的统计手段尚不十分明确,自大数据流环境而言,要不断探索新型抽样方法,并确保抽样方法的实时、连贯及可行性。除去传统的统计分析方法,还应当开发大数据动态分析、数据流算法等[3]。 3.2大数据时代对市场营销的机遇 3.2.1大数据营销的特点与价值 大数据营销的特点:I.数据采集多平台化特点,即大数据时代下,大数据的数据大多来源于不同的领域、不同的渠道。II.时效性特点,随着信息技术的急速发展,互联网用户消费、购物行为方式往往会瞬间出现转变。国际先进大数据营销企业AdTime基于此大数据营销特点,采取了时间营销措施,即采取相应的技术方式全面获悉用户所需,于第一时间对用户当下的需求进行回应,以使用户在下决心购买的最佳时间及时看到对应的产品广告。III.个性化特点,在大数据时代下,广告商传统媒体导向的营销理念逐步由受众导向取代,现如今,广告商可应用大数据了解用户的地理方位,需求内容等信息,达到对用户个性化营销的目的。 大数据营销的价值:I.升级营销与用户的匹配度,大数据营销不仅可提供给企业了解用户有效的途径,还能够与网络环境下,选取相关技术方法达到对用户精确定位的目的,从而开展好营销工作,升级营销与用户的匹配度。II.改善用户体验,大数据营销促使企业真正意义上认识到用户及其所使用企业产品情况,以给予用户最人性化的提醒。 3.2.2大数据营销的应用 (1)与消费者建立紧密关系 现如今,我国一些企业营销行为仍旧处于个性化定位信息、创意设计阶段,而无法对不同消费者展开个性化的营销活动。大数据时代下,经采用相关数据分析技术方法,基于对消费群体喜好、传媒接触习惯等展开有效的分析,达到特定营销活动明确开展的目的,实现企业精心开展的营销活动精准的辐射至目标消费群体处,与消费者建立紧密关系,极大的改善营销效率、质量[4]。 (2)掌握竞争对手数据 企业通过对竞争对手数据的有效掌握,获悉竞争对手发展状况,基于此帮助企业制定科学合理的产品价格,提升企业产品市场竞争优势。与此同时,企业务必要全面实施以事实为前提的决策手段,广泛地应用数据分析方式对企业每一个发展运营步骤进行优化,经对企业一系列数据的充分优化、对接,促使业务环节中潜在的价值得以被有效挖掘,降低生产成本,知己知彼,促使企业在日趋白热化的市场竞争中占据有利位置。 (3)挖掘企业内部数据 “市场未动,数据先行”俨然转变为国际上企业有效运营发展的一致认识,为了提升企业管理效率,要求企业要充分挖掘企业内部数据,并展开有效的整合、分析,以为企业相关人员做决策提供有利的参考依据,提升决策准确性,促进企业可持续发展。
3.2.4 企业的应用案例——以亚马逊为例 在应用大数据开展市场营销方面,美国亚马逊公司一直处于领先地位。亚马逊研发出“用户未下单,先发货”功能,即结合用户的购物需求数据信息,分析用户想要购买的产品,达到用户未下单,提前发货的目的。此外,亚马逊通过对用户检索信息的分析,评估流感的传播,但这仅仅为海量检索数据中的一项用途,相同的数据能够应用于预测大选结果、预测某类产品市场行情等等,极大地降低了统计成本[5]。 3.3大数据时代对市场营销的挑战 3.3.1信息收集 大数据并非就是对数据信息展开盲目的收集,即便收集了再多的数据,倘若这些数据并非是市场营销所需要的,如此便会导致前期收集来的数据信息,变成一堆“数据垃圾”。鉴于此,为了避免这一情况发生,务必要充分分析业务需求,再对自身存在价值的数据展开收集、归纳,如此方可实现大数据的有效收集应用。 3.3.2经验与数据 数据采集完毕后,面对参差不齐的数据,还应当做好数据评估工作,评估对何种目标受众开展市场营销工作。鉴于此,要求采取科学合理的手段,将这些参差不齐的数据整合成可被市场营销实践应用的,经结合过去的经验,与采集数据进行有机融合,实现对目标受众的有效分析确定。 3.3.3分析与优化 数据分析,一方面是实现数据优化,一方面是进行决策层面上的调整、转变。此环节对于专业人才的需求提出了严苛的挑战。数据分析、数据优化对于专业人才的知识框架要求大不相同,这要求相关企业不仅要培养专业的数据分析人才,还要打造数据优化人才队伍。
3.4大数据营销的未来发展趋势 信息技术不断发展,单一媒体导向的“消费者碎片化”俨然无法达到企业对于数据多样性的需求。大数据时代下,媒体的跨界融合实现对“碎片化”受众的充分聚合。在科学技术技术不断进步的背景下,跨媒介、跨平台、跨终端的多途径将不断被开拓,将使庞大的数据信息获取多维度的整合,并且在多样化网络环境下,消费者主观信息与客观数据有机融合,构筑全面用户数据库环节,将成为未来大数据营销发展的必然趋势[6]。 4.结束语 总而言之,大数据为传统统计学带来了严峻的考验,也为传统统计学有效发展创造了良好的契机。在大数据时代发展潮流中,我们应当充分的认识到大数据对于传统统计学而言,是补充而不是更替,构建于样本统计、预测分析内容上的传统统计学,仍旧于社会统计、经济分析中占据着主导位置。大数据时代下,为了实现企业市场营销的有效开展,相关人员务必要不断专研研究、总结经验,全面分析大数据与统计学的对比,充分认识大数据对统计学的挑战和机遇,“与消费者建立紧密关系”、“掌握竞争对手数据”、“挖掘企业内部数据”等,积极促进企业市场营销的科学合理化。
- ?
大数据时代应该懂的统计学——戴维·萨尔斯伯格《女士品茶》
韦一一
展开
内容
简介
统计学之所以被滥用、误用,其实是因为它太有用,在某种程度上,可以说改变了世界上处理问题的方式。
这是一部统计学的史诗。一百多年来,统计学从无到有,以至于蔚为壮观。一部统计学的发展史,就是一部不断革新现有科学体系的历史。本书深入浅出地描绘了这一历程,为读者奉献了一场思想的饕餮盛宴。
这是一部关于叱咤风云的统计学学霸的传奇故事书。回望那段波澜壮阔的时代,一张张脸孔水一样掠过。在英国剑桥的某个午后,有位女士声称,把茶加到牛奶里,和把牛奶加到茶里,两种方法调出来的下午茶喝起来味道不同。在座的科学家都对她的说法嗤之以鼻,但有位来访的瘦小绅士,R.A.费希尔,提议要用科学的方法,来检验这位女士的假设……本书以这位喝下午茶的英国女士为起点,带领读者一一回顾“统计”这门应用范围很广的科学,了解若干重要理论的发展过程与应用,亲近那些隐身幕后的统计学家,看看统计究竟为今天这个世界,带来了什么样的改变。
这是一部大数据时代不容错过的实用之书。大数据时代,一切以数据说话,如何解读数据便与每个人的日常生活息息相关。统计学的本质就在于解读数据,读懂了本书,你就是大数据时代的明白人。
作者简介
戴维·萨尔斯伯格(David Salsburg),康涅狄格大学统计学博士,原辉瑞公司资深统计研究员,美国国家统计学会(ASA)会员,先后任教于哈佛大学公共卫生学院、康涅狄格大学、宾州大学、罗德岛学院及三一学院,著有多部统计学专著,本书是其代表作。
刘清山,清华大学毕业,译有《横向领导力》《物种起源》等作品。
目录
简目
自 序
第 1 章 品茶的女士
第 2 章 偏斜分布
第 3 章 亲爱的戈塞特先生
第 4 章 堆积如山的记事本
第 5 章 《收成变动研究》
第 6 章 “百年一遇的洪水”
第 7 章 费希尔的胜利
第 8 章 致死剂量
第 9 章 钟形曲线
第 10 章 拟合优度检验
第 11 章 假设检验
第 12 章 信任的骗局
第 13 章 贝叶斯的“异端邪说”
第 14 章 数学界的莫扎特
第 15 章 小人物的视角
第 16 章 摆脱参数
第 17 章 部分优于整体
第 18 章 吸烟会致癌吗?
第 19 章 如果你想得到最佳人选……
第 20 章 单纯的得州农家孩子
第 21 章 家族中的天才
第 22 章 统计领域的毕加索
第 23 章 污染处理
第 24 章 工业的重新缔造者
第 25 章 黑衣女子的建议
第 26 章 鞅的发展历程
第 27 章 意向性治疗
第 28 章 将自己提起来的计算机
第 29 章 建立在沙土上的摩天大厦
后 记
大事年表
出版后记
彩书摘
第一章
女士品茶
20世纪20年代末一个夏日的午后,在英国剑桥,一群大学教员、他们的妻子以及一些客人围坐在室外的一张桌子周围喝下午茶。一位女士坚持认为,将茶倒进牛奶里和将牛奶倒进茶里的味道是不同的。在座的科学家都觉得这种观点很可笑,没有任何意义。这能有什么区别呢?他们觉得两种液体的混合物在化学成分上不可能有任何区别。此时,一个又瘦又矮、戴着厚厚的眼镜、留着尖髯的男子表情变得严肃起来,这个问题让他陷入了沉思。
“让我们检验这个命题吧。”他激动地说。他开始规划一个实验,让声称两种茶存在区别的女士按顺序品尝若干杯饮品,其中有些是加了茶的牛奶,有些是加了牛奶的茶。
有些读者会说:这绝对是吃饱了撑的!他们会问:“不管这位女士能否分辨两种饮品,这件事有什么意义呢?”“这个问题一点儿也不重要,对科学也没有益处,”他们嘲笑道,“这些聪明人应该把他们的头脑用在能够造福人类的事情上。”
不幸的是,不管普通大众如何看待科学及其影响,根据我的经验,大多数科学家之所以投入到研究当中,是因为他们对结果感兴趣,并能从工作中获得知识性的乐趣。优秀的科学家很少会考虑他们的工作是否具有重要意义。回到剑桥那个阳光明媚的夏日午后。女士有可能猜中饮品的混合方式,也有可能猜错。这件事的乐趣在于找出一种方法判断她的说法是否正确。在尖髯男子的指导下,他们开始讨论如何验证这种判断。
许多人充满热情地加入到设计实验的工作中。几分钟之后,他们开始在那位女士看不到的地方以不同的方式泡茶。最后,决定性的时刻到了,尖髯男子把第一杯茶递给了女士。她品了一分钟,宣布这杯茶是将牛奶倒在茶里制作出来的。尖髯男子将她的回答记录下来,没有发表任何评论,然后把第二杯茶递给她……
科学的合作本质
20世纪60年代末,我从一个当天下午在场的人那里听到了这个故事。他叫休·史密斯(HughSmith),不过他的科学论文都是以H.费尔菲尔德·史密斯(H.FairfieldSmith)的名字发表的。我认识他的时候,他是斯托尔斯的康涅狄格大学的统计学教授。两年之前,我在康涅狄格大学获得了统计学博士学位。在宾夕法尼亚大学任教之后,我加入了大型制药公司辉瑞公司的临床研究部。该研究部位于康涅狄格州格罗顿市,距离斯托尔斯大约一个小时车程。我在辉瑞需要处理许多棘手的数学问题。当时我是那里唯一的统计学家,我需要与大家讨论这些问题和我的“解决方案”。
通过在辉瑞的工作,我发现科学研究几乎无法依靠一个人独自完成,通常需要多人合作。这是因为人们很容易犯错误。当我提出用于解决某个问题的数学模型,这个模型有时是不恰当的,或者我对当时的情况引入了一条错误的假设,或者我发现的“解决方案”来自等式的一个错误分支,就连我的验算也可能出错。
每当我去斯托尔斯的大学与史密斯教授讨论,或是去找辉瑞公司的化学家和药理学家讨论问题,他们通常都对我提出的问题表示欢迎。他们会带着热情和兴趣和我讨论。大多数科学家对工作的兴趣通常来自解决问题的激情。他们期待着研究问题、理解问题时与他人的交流。
实验设计
回到那个夏日午后的剑桥。留着尖髯的男子叫罗纳德·艾尔默·费希尔(RonaldAylmerFisher),当时不到四十岁。他后来被封为罗纳德·费希尔爵士。1935年,他写了一本名为《实验设计》的书,在第2章描述了女士品茶的实验。在书中,费希尔将这位女士和她的观点作为假设问题进行了讨论。他考虑了各种实验设计方法,以确定这位女士是否能判断出两种茶的区别。设计这项实验的问题在于,如果给她一杯茶,那么即使她无法判断出区别,她也有50%的机会猜对茶的种类。如果给她两杯茶,她仍然可能猜对。实际上,如果她知道两杯茶的制作方式不同,那么她对两杯茶的猜测可能都是对的(或者都是错的)。
类似地,即使她能判断出区别,仍然存在问题。她可能犯错误:某杯茶可能混合得不够好,混合的时候茶的温度可能不够高。面对10杯茶,她也可能只答对9杯。
在书中,费希尔讨论了这种实验的各种可能结果,描述了如何确定应当测试多少杯茶、测试的顺序以及应向女士透露多少顺序信息。他计算出了在女士拥有或没有辨别能力时出现不同结果的概率。在讨论中,他并没有暗示这种实验曾经发生过,也没有描述实验的真正结果。
费希尔这本关于实验设计的书是20世纪上半叶横扫所有科学领域的一场统计革命的重要组成部分。在费希尔登场前,科学实验已经进行了几百年。16世纪下半叶,英国物理学家威廉·哈维(WilliamHarvey)曾用动物做实验,通过阻断不同静脉和动脉的血流,发现血液是循环流动的,从心脏流到肺,回到心脏,再流向身体各个部分,最后流回心脏。
费希尔并没有将实验作为获取新知识的方式。在费希尔以前,实验是每个科学家的个人作品。优秀的科学家通过构造实验获取新的知识。平庸的科学家往往会通过“实验”得到许多数据,但是无法获得新的知识,如19世纪晚期诸多试图测量光速的科学家毫无结果的努力。直到美国物理学家阿尔伯特·迈克尔逊(AlbertMichelson)用光和镜子构造了一系列非常复杂的实验,人们才得到了第一组良好的光速估计值。
19世纪,科学家很少发布实验结果,他们会宣布他们已发表的数据“证明了”他们所得结论的正确性。格雷戈尔·孟德尔(GregorMendel)没有公布所有豌豆育种实验的数据。他描述了实验顺序,然后写道:“两组实验的前10个结果可以用于说明……”(20世纪40年代,费希尔检查了孟德尔用于“说明”的数据,发现它们的精确程度过高,没有表现出应当具有的随机性,不可能是真实的。)
尽管科学的发展来自仔细的思考、观察和实验,但从来没有人能说清应当如何做实验,而且人们通常不会把完整的实验结果告诉读者。19世纪末20世纪初的农业研究尤其如此。20世纪早期费希尔工作过的洛桑农业实验站在费希尔到来之前对不同肥料成分(叫做“人造肥料”)进行了将近90年的实验。在每次实验中,工人通常会在整个一块田地上播撒磷酸盐和氮盐的混合物,然后种植谷物,并对收获的粮食以及当年夏季的降水量进行统计。他们用一些详细的公式“修正”一年中一块田地的产出,以便与另一块田地或同一块田地其他年份的产出进行比较。它们被称为“肥料指数”。每个农业实验站都有自己的肥料指数,人们都认为自己的指数比别人的指数准确。
实验站90年实验的结果是一堆混乱的结论和大量没有发表的、毫无用处的数据。看起来,某些小麦品种比其他品种更适合某种肥料,前提是当年要有足够多的雨水。另一些实验似乎表明,头一年使用硫酸钾,第二年使用硫酸钠,可以让某些马铃薯品种增收,但对其他品种没有效果。
对于这些人造肥料,人们能得出的最好结论是,有些肥料有时也许可能有效。作为一名出色的数学家,费希尔查看了洛桑的农业科学家用于修正实验结果中不同年份天气差异因素的肥料指数。他研究了与之竞争的其他农业实验站使用的指数。他发现,在基本的代数层面上,它们属于同一公式的不同表现形式。换句话说,相互之间激烈竞争的两组指数实际上做的是同样的修正。1921年,他在顶级农业期刊《应用生物学年报》发表了一篇论文,指出使用不同指数的效果是相同的。这篇论文还指出,所有这些修正都不足以纠正不同田地肥料的差异。这篇出色的论文结束了20年的科学争论。
接着,费希尔研究了过去90年的降水量和作物产量数据,指出不同年份天气因素的影响比不同肥料的影响大得多。根据费希尔后来在实验设计理论中的说法,不同年份的天气差异和不同年份的人造肥料差异是“混合的”。这意味着我们无法将二者从这些实验数据中分离开。这表明,90年的实验和超过20年的科学争论几乎完全是在浪费时间。
这让费希尔开始思考实验和实验设计。他的结论是,科学家在实验之前需要为实验结果建立数学模型。所谓数学模型,指的是一组等式,其中一些符号代表实验中收集的数据,另一些符号代表实验的总体结果。
科学家需要根据实验中得到的数据,计算出相应科学问题的合理结果。考虑一位老师与某个学生的简单例子。老师想用某种方法衡量学生对知识的掌握程度。为此,老师通过对学生进行一组测试来“实验”。
每个测试的评分为0到100分。任何一次测试对学生学习程度的估计并不准确。学生可能不知道测试上的那些问题,但是知道许多测试上没有提到的知识;学生可能在参加某次测试的当天头疼;学生可能在参加某次测试的早上与父母吵了一架。出于很多原因,一次测试无法对学生掌握的知识做出良好的估计。所以,老师布置了一组测试,将所有这些测试的平均分作为对学生学习程度的参考。学生对知识的掌握程度是结果。
每次测试的分数是数据。
老师如何组织这些测试呢?每次测试应当只涉及过去几天讲授的内容吗?每次测试应当包含之前讲授过的所有内容吗?这些测试应当每月进行一次,每天进行一次,还是每个单元结束后进行一次呢?所有这些都是实验设计需要考虑的问题。
如果农业科学家想知道某种人造肥料对小麦生长的影响,他需要构造一个实验,得出对这种影响进行估计的数据。费希尔指出,这种实验设计的第一步是建立一组描述实验测量数据与估计结果之间关系的数学等式。接着,为了实现目的,这个实验必须能够让人们对这些结果进行估计。实验必须是具体的,能让科学家确定源自天气的结果差异与源自不同肥料的结果差异的比值。此外,必须将同一实验中比较的所有处理因素包含进来,这些因素后来被称为“对照因素”。
在《实验设计》中,费希尔提供了几个优秀的实验设计例子,总结出了良好实验设计的一般原则。不过,他的方法涉及的数学非常复杂,大多数科学家都无法独自构造实验设计,只能使用费希尔在书中提到的某个设计模型。
...
大数据时代统计
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并