中企动力 > 商学院 > 数据分析技术支持
  • ?

    数据分析运用的4要点,你可以看看!

    潘正豪

    展开

    我是企业文化从心开始,20余年职场历练,高级企业文化师,中国首届企业自媒体大会优秀总编,中国内刊协会优秀内刊主编。欢迎关注、点赞、评论、转发、收藏、交流!

    时代在发展,信息在进步,目前,许多企业对数据分析的作用已经有了更深刻的认识,那么做好数据分析工作,从企业文化的角度来看,应该把握哪四个要点呢?

    1、随着信息技术的高速发展,数据分析为企业决策提供了有力的支撑。

    众所周知,随着信息技术的高速发展,数据分析的技术条件不断成熟,各类软件的开发和使用已经不再是价格高昂、可望而不可及了。特别是通过数据库、数据软件的使用,已经可以极大的方便各类情况的统计、汇总、分析、运用,节约了领导分析情况的时间,提升了领导做出科学决策的全面性、实时性、针对性和有效性,已经成为信息时代的一个重要工具。从企业文化的角度来说,应该通过各种宣传、培训等方式,在企业内部大力营造学习信息技术、运用信息技术的良好氛围。

    2、数据分析掌握在人的手中,首先要搞定人这个关键。

    做好数据分析,首先要做好人的工作。因为数据分析相较于传统的分析方式虽然有许多的优点,但对于一些年龄较大或者运用传统方法熟练的领导来说,需要他们放下已经得心应手的方法,重新学习新的信息技术知识,对他们的思想和学习能力是一个考验。同时,各类数据的统计、汇总、分析均依赖于最基础的数据来源,对于每个终端数据的提供和录入人员来说,既可能大幅增加了他们的工作量,也可能会影响他们与上级沟通、交流的话语权,是否能够获得他们的支持是数据分析可否真正发挥作用的关键点。从企业文化的角度来说,应通过典型树立、问题剖析、成果分享等方式,不断地提升大家对信息数据的认识程度,强化大家积极学习、主动运用、沟通协作的意识。

    3、数据分析只有更好地服务业务发展,才会有生命力。

    做数据分析工作,最容易出现的一个问题是为分析而分析,为统计而统计,最终成为形而上学的数据,无法为生产经营和业务发展服务。从数据分析工作开始的第一天起,就必须强化全体人员数据分析应为生产经营和业务发展服务的意识。比如说成本控制,以往,许多企业的采购、物流、储存、生产、销售都依靠人工来处理,不仅速度慢,而且错误多。而通过大数据库建设,可以全过程的录入、比对、控制相关数据,实现信息数字化、数据实时化,通过将成本控制所涉及的从原料采购到产品生产、运输、储存、销售(部分可能包括回收、报废)等各环节有机结合起来,形成一个闭合的环,为成本控制提供可靠的数字化的依据。并以此为基础,通过数据分析不断优化,从而达到一个相对合理的平衡状态,最终实现有效控制成本的目的。

    4、数据分析运用应小步快跑,持续为公司创造价值。

    对数据分析运用来说,企业的日常生产经营都可以实施数据分析,但人的精力是有限的,数据分析这个团队的精力也是有限的。必须根据企业生产经营的总体规划,首先进行全面的摸排、梳理,确定企业目前最需要改善、通过数据分析可以实现改善的项目。在项目确定后,数据分析团队应进行充分的现场沟通了解与现状分析,再形成具体的方案,包括目前现状、准备采取的措施、需要公司支持的资源、预期的时间及效果等内容,报公司领导批准后,再正式实施。在这个项目的数据分析运用取得成功之后,再进行第二个项目的实施。在取得一批项目的成功实施后,再组织专题讨论研究会,梳理成功的经验与存在的问题,以及公司目前可以实施数据分析、以改善工作的具体项目,提出可行性的建议,请与会成员集中研究,最终报公司领导批准后实施。

    如此,数据分析通过一次次为企业解决问题、创造价值,不断强化大家对数据分析的正面评价与正向认知,在不断积累经验的基础上,培养人才,营造氛围,从而更好地融入业务工作、服务业务工作,推进生产经营。

    (图片来源自网络,版权属于原作者,如有侵权,请联系本人,以便及时删除处理)

    我是企业文化从心开始,坚持原创,支持原创,如果您有关于企业文化的相关问题,欢迎关注、评论、留言、交流!

  • ?

    数据分析也可以如此智能——Smartbi 首发AI 大数据分析

    配角

    展开

    引言: 2017年6月17日,广州思迈特公司在北京举行Smartbi大数据分析技术年度峰会。思迈特公司CEO吴华夫先生亲临现场,携最新的Smartbi Insight V7版本分享数据分析新四化的最新成果,并演示人工智能和数据分析的”首次融合”。

    Smartbi智能语音助手数据分析演示

    下面分享具体演讲内容:

    很感谢大家在周末休息的时候来参加Smartbi V7产品的发布会。

    下面,我会介绍一下关于思迈特公司的情况、Smartbi Insight V7版本的新特性和功能。

    公司简介

    思迈特公司定位成一家大数据分析可视化和商业智能的产品提供商。我们知道数据是企业最重要的资产,要发挥它的价值,就需要使用数据分析,数据分析是企业的重要武器。思迈特软件Smartbi insight就是一个利器,能够有助于发掘企业数据资产的价值。

    思迈特公司成立于2011年底,通过这几年的发展,我们在北上广、成都、西安、武汉都有技术支持和销售,希望为各个地方的用户提供更好的体验和服务。

    客户介绍

    下面介绍我们的客户,我们在金融、政府、企业、高校等领域都有很多的应用。

    金融行业。我们的银行客户并不仅仅是项目级别的应用,而是总行、全行、全业务线级别的应用。比如中国银行,我们的产品应用在20多家分行。股份制银行比如说民生银行、光大银行也是我们的老客户。

    保险有泰康人寿,PICC、太保、中英人寿、幸福人寿等;证券有中信证券、银河证券、中投证券等客户;另外还有基金、投资公司、金融公司、财务公司等。

    政府领域。我们在卫生、税务、财政、工商、公安等政府领域都有比较广泛的应用。

    企业客户。比如海航集团、中国电信、石化、南方电网等。

    教育行业。我们做了部级、省厅级、以及一百多个大学的大数据分析系统。

    Smartbi Insight V7产品重要特性

    刚刚介绍了公司和客户的情况,现在我们介绍Smartbi Insight V7的重要特性。

    技术架构

    Smartbi Insight 是一个大数据中间件产品,定位为数据分析和数据可视化软件产品。

    第一层是数据层。包含RDBMS、OLAP Server、MPP、 Hadoop数据库。

    第二层是引擎层。目前包含四个引擎:

    元数据引擎。它是把技术的数据转换成业务数据,基于它实现我们的自助多维分析。

    数据查询分析引擎。包含多维数据库、关系数据库、以及其他扩展的查询。

    分布式内存计算。主要功能有ETL数据处理、机器学习、跨数据库计算。

    人工智能引擎。这个是我们新增的,在目前所有的国内大数据分析产品中人工智能引擎是我们首创并最先提出来的。

    第三层是功能层。主要包含报表报告、数据可视化、数据探查和分析、移动协同决策和人工智能深度学习这五个方面,后面我们会详细介绍。的

    第四层是行业产品。除了平台产品,我们还根据行业的应用提供大数据分析解决方案产品。主要包括银行自助分析云平台和高校大数据分析系统。

    报表报告

    企业报表

    Spreadsheet(电子表格)是企业报表平台的解决方案专家,创新的基于Office Excel实现报表设计,满足各种格式的行业监管报表、内部管理报表的需求。包括:清单报表、交叉报表、分组报表、多源分片报表、分块报表、表单报表、图形报表、回写报表、假设分析报表、二次计算报表、套打报表、段落式报表、预警报表(Excel条件格式)、组合报表(智能评语)。

    它包括三个特点:

    1、 简单易用。电子表格使用Excel、WPS作为报表设计器,可以帮助用户在最熟悉的环境中很容易的获取广泛和丰富的资源去实现需求。

    2、 功能强大。不仅支持一般业内的负责报表如交叉报表等,还支持市场上其他报表不具备的统计预测和规划求解,如支持使用Excel函数,包括财务函数、统计函数等。

    3、 图表丰富。Excel报表、图形模板资源丰富,本身作图能力也非常强大,日本画家可以基于Excel可以做很多水墨画,甚至美女图。只要有想象力,就可以创造出非常丰富的图形出来。

    在V7版本继续增强了报表的功能,主要体现在:

    1、 照相机功能。通过照相机拍照功能可以把多个报表合并组合成新的页面,类似黑板报,从而使页面布局灵活、数据格式动态同步,并易于维护更新。

    2、 功能增强。包括大清单表的性能优化和对填报审核流程的改进。

    3、 增加动态图形。不仅支持Excel静态图形,还支持Echarts动态图形,使图形效果更佳动感,交互性更强。

    分析报告

    Office Word/PPT也可作为报告的开发工具,基于报表体系制作可刷新数据的报告模板,将数据从IT环节贯通到办公系统,提高报告的制作效率,使业务的工作重心回归问题的原因分析和解决方案设计上。

    Smartbi支持使用Word和PowerPoint来开发报告,在开发过程完全可视化,无程序编码,开发的工具Office插件还支持检测更新,自动提醒升级;开发的报告不仅支持在浏览器、移动端上直接查看和一键刷新,还支持后台定时任务,发布报表到个人邮箱。

    数据可视化

    数据可视化是目前一个炙手可热的话题,我们产品也有自己的可视化特色。主要包括:

    交互仪表盘

    我们的交互仪表盘就是基于Web上实现的H5版本的水晶易表,和市面上其他的可视化工具不一样,我们是基于Excel的数据模型,利用Excel的计算能力,并通过绑定关系多维数据源来实现交互性强的页面出来。

    交互仪表盘的设计更简单、交互性更强、计算能力更强。如下示例:

    图一:参数控件、图表联动,在Excel中配置,几分钟即可实现。

    图二:what-if分析的示例。它是基于数据模型,通过简单点击交互操作的方式来挖据数据之前的关联影响,从而找到经营指标之间的关系,让领导更容易做出决策。

    对公司来说,增加研发费用投入,成本增加了,利润是会增加还是会减少呢?若研发的投入会使产品的竞争力更强,则会有更多的收入。对于这样一个测算的过程,我们只需要通过简单的点击,基于底层的数据模型,就会很容易看出增加的经费对净利润、产品销售量、成本、收入等指标的关联关系的影响。

    数据大屏幕

    数据大屏幕适用于大型的管理机构,信息量高度集中,相比仪表盘来说弱化交互性,强化炫酷的展示效果。 Smartbi Insight支持非常灵活的布局、样式和图形效果,并且设计、上线速度极快,远超各种开发技术实现的大屏幕!

    图形可视化

    我们现在有两套图形引擎:静态图形引擎和动态图形引擎。除了内置的两套图形引擎,还支持扩展接口,第三方图形引擎很容易接到我们产品中来。

    *动态图形。Smartbi Insight提供丰富的ECharts图形可视化选择,包括散点图、、南丁格尔玫瑰图、油量图、散点图、气泡图、雷达图、关系图、热力图、词云图等等。

    *静态图形。通过电子表格(Excel)作图时可使用Excel完成更为复杂的图形设计,如:甘特图、山形图、手风琴图、子弹图、小又多图等等。以及对表格设置条件格式(数据条、色阶、图标集)。

    地图分析

    地图分析将企业经营数据在地图上进行可视化呈现,形成企业经营的地理导航仪,通过点击、下钻以及图表联动等方式,进行数据分析和展示。

    直接支持迁徙地图、航线图、百度地图、热力地图、散点地图、地产密度图等等。地产密度图是和ArcGIS更专业的GIS系统结合,我们产品本身也内置GIS引擎,可以支持各种各样的地图分析。

    数据探索和分析

    我们在数据自助分析包含两个方面:查询数据和分析数据。这个功能尤其应用在金融电信行业。目前,我们有专门的自助分析云平台的解决方案。

    自助查询

    自助查询是指用户通过鼠标简单的勾选拖拽就可以找到关心的指标和字段,很轻松在上亿的数据中进行明细查询。这个功能的应用经验是从银行中积累的,因此我们在大数据支撑方面做过很多优化,是经过实践检验的,性能上相对于其他产品是有优势的。

    多维分析

    企业用户都希望对业务、管理数据进行多维度分析,Smartbi Insight充分满足此类OLAP需求,无论客户的数据环境为多维数据库还是关系数据库,都可以提供相应的功能。

    *若使用关系数据库,则无须建模。支持自由钻取、切片、同环比、分组、计算字段、预警、图表联动等。

    *若使用多维数据库,可使用Analysis功能,同样可以完成切片、钻取、同环比等功能。

    移动协同

    移动应用

    移动应用让企业员工可以随时随地通过手机、平板查看和分析数据。丰富的图形让数据展现栩栩如生,离线下载随身携带数据,手写批注让信息分享、决策讨论更加轻松。

    我们的移动应用开发简单、功能强大,特点如下:

    android、iOS的手机、平板都支持

    一键发布、支持批注与分享(到社交软件)

    集成能力:企业微信、OA及其它移动应用整合

    安全性:设备安全管理,通讯加密,离线安全

    协同决策

    Smartbi产品的协同决策功能就类似一个私有的微信平台,把领导线下决策执行的过程转到线上。在这个平台上,你不仅可以随时发送报表报告、进行实时评论、分享工作,还可以交流讨论、组织在线会议等,让用户可以在Smartbi Insight中进行多人多团队决策、提高决策精准度。

    数据源

    Smartbi兼容支持各种数据源。我们支持关系数据库(包括Vertica等MPP数据库),多维数据库、大数据库。在V7版本上新增了华为、星环和Kylin等的支持。

    系统集成

    为了ISV能基于Smartbi平台产品更加方便的打造自己的大数据解决方案,我们对界面可视化配置、权限体系、集成等方面又做了更大的完善和改进,主要包括:

    界面风格(LOGO)随意更换,不用重启服务器

    J2EE架构、纯WEB方式、无需安装其他插件

    用户集成(权限自主管理:资源权限、数据权限、操作权限)

    报表集成支持外部链接或内嵌到其它系统中

    运维可视化

    作为一个大型系统,若有万以上级别的报表该如何管理呢?可以使用我们的运维可视化功能。界面操作,非常易用。

    通过界面可视化的运维管理,使得:

    运维管理能力更强。可以通过元数据引擎查看报表的关联关系,可以查看报表的访问情况。如看一张报表的访问次数,若少则可下线。

    解决问题能力更强。当慢、卡各种情况发生,通过CPU监控、内存监控、网络监控等功能快速定位问题。

    自动检测能力更强。系统支持定时提醒,支持自动检测优化,支持调整系统参数,能最好的满足用户的需求。

    人工智能

    随着大数据作为企业的资产,它的重要性毋庸置疑。我们提供很多方法让用户去查询分析数据,比如通过报表报告发给领导查看,通过大屏幕查看关键KPI指标,通过自助分析使业务人员简单的操作就能自助查询分析数据。的

    但是,若是能通过语音语义来表达诉求,通过一个工具接受指令,直接把需要的数据传递给你,会对大数据分析方式产生很大的变革,会使更多的人受益于大数据,会更方便的挖掘大数据的价值。

    因此,V7版本上我们发布了人工智能小麦的功能。她基于语音语义模型,通过深度学习的引擎,实现自然语言的理解,并支持用户使用偏好,从而实现数据查询和分析。目前,我们支持打开已有资源,切换参数;还支持自助探索分析。

    这种人机交互的方式体现了AI和BI的结合。当然这只是迈开的第一步,我们未来的目标是通过自然语言,用户能轻松自由的利用大数据,不仅能了解现状、挖掘规律,更是预测未来。

  • ?

    中国大数据分析启用上海原创技术

    堪乐蓉

    展开

    记者昨天从工信部组织的“大数据和实体经济深度融合高峰论坛暨2018大数据产业发展试点示范项目发布会”上获悉,使用上海原创技术的“通用拟态大数据平台”,入选工信部2018年大数据产业发展试点示范项目,将为我国在大数据分析挖掘领域实现高效能、高安全提供国际原创技术路径。

    当前,我国正在实施大数据战略。随着各行各业积累数据量的增加,数据处理的复杂性、系统能耗、数据安全等挑战随之凸显。“数据大”转换为服务经济社会发展的“大数据”难度,与数字经济蓬勃发展的强劲需求形成反差。如何消除这种反差?中国工程院院士、国家数字交换系统工程技术研究中心主任邬江兴认为,通用拟态大数据平台能提供解决方案。

    “通用拟态大数据平台”由上海红神信息技术有限公司、上海红阵信息技术有限公司、复旦大学等单位牵头研制。“拟态大数据”源自“拟态计算”,后者则源自一种动物——拟态章鱼。它能通过扭曲肢体、改变颜色,模仿十几种动物的外表和行为。受此启发,邬江兴提出了研发拟态计算机的构想:计算结构动态可变,适应各种不同应用,以提高计算机效能。在科技部和上海市科委支持下,他带领团队耗时6年,研制出世界首台拟态计算机原理样机。2013年,这项成果入选两院院士评选的“2013年中国十大科技进展”。

    2015年,“拟态安全”作为重大战略项目,写入上海科创中心建设“22条意见”。从那以后,拟态计算和拟态安全技术得到市科委、市经信委的更大支持。研发团队将其应用于大数据领域,并牵头成立了全国首个“大数据试验场”联盟,建设引领学术、技术、应用、产业发展的创新策源平台。“大数据试验场”的建设运营,为通用拟态大数据平台此次入选国家示范项目打下了基础。目前,来自试验场的成果正在嘉兴审计系统全面上线应用。

    邬江兴表示,与国内外大多数大数据产品不同,通用拟态大数据平台打破了立足于通用计算资源与开源架构的堆叠技术路线,一改数据安全和业务安全领域普遍采取的“外挂式”被动防御策略,引入国际原创的拟态计算和拟态防御理论,从根本上突破体系架构单一性束缚,提高了数据处理与存储效率。通用拟态大数据平台能适应当前“有毒带菌”的网络空间生态,以一体化鲁棒构造产生的内生安全机制,推动该平台形成“自身免疫力”,完成系统整体的升级换代。

    据悉,通用拟态大数据平台的建设目标是研制面向大数据处理场景、软硬件深度耦合、节能高效和安全可靠的大数据标准化装备,探索建立自主可控的大数据基础设施,为数据获取、存储、分析、运用等环节提供安全高效的解决方案。(记者 俞陶然)

  • ?

    魔据带你了解大数据分析

    妙菡

    展开

      随着云时代的来临,大数据也吸引了越来越多的关注。在现今的社会,大数据的应用越来越彰显他的优势,它占领的领域也越来越大,电子商务、O2O、物流配送等,各种利用大数据进行发展的领域正在协助企业不断地发展新业务,创新运营模式。有了大数据这个概念,对于消费者行为的判断,产品销售量的预测,精确的营销范围以及存货的补给已经得到全面的改善与优化。“大数据”在互联网行业指的是这样一种现象:互联网公司在日常运营中生成、累积的用户网络行为数据。这些数据的规模是如此庞大,以至于不能用G或T来衡量。

      

    大数据的特点。数据量大、数据种类多、 要求实时性强、数据所蕴藏的价值大。在各行各业均存在大数据,但是众多的信息和咨询是纷繁复杂的,我们需要搜索、处理、分析、归纳、总结其深层次的规律。

    大数据的采集。科学技术及互联网的发展,推动着大数据时代的来临,各行各业每天都在产生数量巨大的数据碎片,数据计量单位已从从Byte、KB、MB、GB、TB发展到PB、EB、ZB、YB甚至BB、NB、DB来衡量。大数据时代数据的采集也不再是技术问题,只是面对如此众多的数据,我们怎样才能找到其内在规律。

    大数据的挖掘和处理。大数据必然无法用人脑来推算、估测,或者用单台的计算机进行处理,必须采用分布式计算架构,依托云计算的分布式处理、分布式数据库、云存储和虚拟化技术,因此,大数据的挖掘和处理必须用到云技术。

    大数据的应用。大数据可应用于各行各业,将人们收集到的庞大数据进行分析整理,实现资讯的有效利用。

      今后数据分析成为大数据技术的核心 数据分析在数据处理过程中占据十分重要的位置,随着时代的发展,数据分析也会逐渐成为大数据技术的核心。大数据的价值体现在对大规模数据集合的智能处理方面,进而在大规模的数据中获取有用的信息。要想逐步实现这个功能,就必须对数据进行分析和挖掘。而数据的采集、存储、和管理都是数据分析步骤的基础,通过进行数据分析得到的结果,将应用于大数据相关的各个领域。

      基于云的数据分析平台将更加完善 近几年来,云计算技术发展的越来越快,与此相应的应用范围也越来越宽。云计算的发展为大数据技术的发展提供了一定的数据处理平台和技术支持。云计算为大数据提供了分布式的计算方法、可以弹性扩展、相对便宜的存储空间和计算资源,这些都是大数据技术发展中十分重要的组成部分。此外,云计算具有十分丰富的IT资源、分布较为广泛,为大数据技术的发展提供了技术支持。随着云计算技术的不断发展和完善,发展平台的日趋成熟,大数据技术自身将会得到快速提升,数据处理水平也会得到显著提升。

  • ?

    数据分析专业可任职九大工作岗位

    GP02

    展开

    这个时代是大数据时代,也是大数据人才稀缺的时代。由于中国人才缺口比较大,大数据也迅速成为行业和市场的热点,更多的企业无论是对大数据人才的招聘都成了刚需,这也促使大数据人才的薪资在同岗位中是最高的,掌握大数据技术,工资提升40%左右是很常见的。

    大数据的就业领域是很宽广的,不管是科技领域,还是食品产业,零售业等等,都是需要大数据人才进行大数据的处理,以提供更好的用户体验,以及优化库存,降低成本,预测需求。下面跟小编一起看看大家今后可以从事的工作岗位及未来发展方向。

    大数据分析九大热门工作岗位

    一、BI工程师

    1:负责BI数据仓库的规划,搭建报表平台

    2:参与需求分析,数据仓库建模,功能设计及评审

    3:与业务部门沟通协调需求并提出各种新的数据分析项目或方案

    4:负责日常业务运营提供数据支撑,对分析结果进行报表开发设计

    5:负责数据仓库的日常管理与维护

    6:负责BI模型设计、报表开发和数据平台门户界面开发

    7: 根据项目的数据分析需求进行BI的设计和项目开发

    8: 对数据进行挖掘、整理和分析,提取数据进行系统建模

    9:根据需求进行数据仓库模型设计,进行程序的开发,构建企业级数据中心

    二、数据仓库工程师

    1:负责对应业务线数据建模及数据仓库相关产品的设计、开发、测试

    2:元数据的搭建和ETL设计、开发、测试

    3:构建本行业大数据中心,创建OLAP多维分析模型并组织数据,开发数据集市

    4:参与大数据平台数据仓库的建设工作

    三、ETL工程师

    1:遵循开发任务的计划与目标,服从项目经理的工作安排,参与或负责项目的详细设计、ETL开发等工作,保证项目的顺利研发及推广

    2:负责数据中心建模、业务运营数据的导入、数据预处理的设计和开发

    3:负责数据中心ETL流程的优化及解决ETL相关技术问题。

    4:具备良好的ETL实施经验,能够按要求完成ETL设计和开发工作

    四、数据分析师

    1:深入理解业务数据分析需求,支持面向业务的数据服务

    2:进行数据产品的算法研究和实现,并定期优化迭代

    3:数据分析的流程、规范和方法建立,及相关文档的撰写

    4:通过API收集数据,进行数据清洗并保存到数据库

    五、数据库开发工程师

    1:负责数据库系统日常架构,开发,部署,维护,备份和运行方案设计

    2:负责软件开发项目中的数据库设计工作

    3:负责数据库日常运维程序的编写

    4:根据业务需求设计数据库结构,编写表、存储过程、触发、函数等脚本,及性能优化、疑难问题的解决

    六、报表开发工程师(Cognos、MSTR)

    1:按照要求使用ETL工具对数据进行清洗和整理

    2:针对SQLSERVER或者ORACLE数据库编写存储过程

    3:使用COGNOS或MSTR等报表工具进行模型创建和报表开发

    七、软件实施工程师

    1:负责BI项目的需求调研与分析工作

    2:负责BI项目的方案设计、实施或项目管理工作

    3:了解岗位范围内的硬件、软件、网络的状况,实施维护或更新计划、确保正常使用

    4:负责上线企业的BI系统维护,提供技术支持对接服务

    5:接受上级领导工作安排,完成其它临时性或突发性任务

    八、运维工程师

    1:负责BI系统的日常维护、故障排查、性能调优

    2:负责系统的日常监测与维护、故障处理、性能分析与优化

    3:负责系统模块部署、配置、维护、备份与监测

    4:负责服务器维护和监控

    5:负责系统的相关文档编写、运维信息统计等

    九、软件测试工程师

    1:根据产品需求完成测试计划、测试设计以及测试用例的编写,完成测试报告的分析与输出

    2:对系统bug进行跟踪、推动解决,保障产品质量

    3:根据需要完成关键模块的白盒测试工作

    以上就是容大教育小编对数据分析专业可任职九大工作岗位整理,容大教育IT培训机构,专业数据分析培训机构,能够为你提供良好的技术学习,能够更好地了解每个学习者的需求,根据每个学习者特定的需求为其配置最合适的资产组合,无疑更加符合学习者的需求。

  • ?

    麦肯锡| 如何让数据分析为你所用

    Petra

    展开

    来自:纽约数据科学 id:NYCDataScience

    原文作者:Helen Mayhew, TamimSaleh, and Simon Williams

    翻译:Peiwen Lin , Youjun Zhai

    校对/编辑:Youjun Zhai

    你的数据有目的吗?如果没有,那么你正在原地踏步。下面是一个如何发现目标,并将其转换为行动的方法。

    数据分析革命

    目前正在进行的数据分析革命具有可以改变公司如何去组织、经营、管理人才和创造价值的潜力。一些公司之中,特别是那些从数据中获得主要回报的企业,正在发生这种变革,但尚未成为主流。

    原因很简单:作为唯一能够推动更广泛的业务变革、充分利用高级数据分析的关键人物,CEO和其他高层管理人员,对于数据分析这种他们看来深奥又有很多门道的新事物,保持着敬而远之的心态。

    在某个层面上考虑,这是可以理解的。数据分析方法的复杂性、机器学习的日益重要性以及数据集的庞大规模,使得管理层更倾向于“把它留给专家们”。

    同时这也是错误的。高级数据分析是一个重要的业务问题。这就意味着CEO和其他高管必须能够清楚地明白这些数据的目的,并将其转化为行动。他们必须要明白,数据分析不单单是数据分析部门的工作,其结果更是能为整个公司都带来洞察力和灵感。

    本文介绍了8个理清数据分析目标和提升行动能力的关键要素。我们确信,充分意识到这两个其重要性的领导者们,不仅能借助数据分析解决一些基本问题,还能够更好地解决他们所面临的许多关键和重要的高级管理方面的挑战:传统商业原则下将分析愿景转化为切实结果的需求,部署一系列生产工具和雇用适当人员的重要性,以及应用严格指标和提出难题的必要性。从而提升使用数据分析提高企业绩效的可能性。

    第一部分 | “目的导向”的数据

    对于不同的公司,“更好的性能”意味着不同的东西。这也意味着应该根据具体案例情况来分离,聚合和分析不同类型的数据。有时,数据点(data point)很难找到,当然,并非所有数据点都是一样的。但是,正是这些能助你达到特定目的的数据点,才是最具价值的。

    1. 提出正确的问题 | Ask the right questions

    你的机构应该问的确切问题取决于你的最优先事项。问题清晰是至关重要的。例如,好的提问包括“我们如何减少开销?”或者“我们如何增加收入?”,甚至更好的是进一步挖掘问题:“我们如何提高团队中每个成员的生产力?”、“我们如何为患者带来高质量的服务?”、“我们如何从根本上加快产品从研发到上市的时间?”

    我们需要考虑如何将重要的功能和领域与最重要的版块结合起来,通过实际的业务示例来,指向真正价值之所在。在对资金和时间有着严格限制的现实世界中,数据分析很难为含糊不清的问题给出答案,例如“数据点显示了什么样的模式?”

    一家大型金融公司也因这种开放性的尝试而遭遇了失败:它试图收集尽可能多的数据,想看看大量的数据背后显示了什么。当公司发行这种开放性的尝试结果,有趣但却对提升企业利益没有任何帮助的时候,他们才重新调整了团队。

    有了来自管理层的强大支持,这家公司首先清晰了自己使用数据分析想要达到的目标:减少产品开发时间,然后使用客户采纳度,作为衡量此目的的指标。提高数据分析的针对性帮助公司为两个细分市场推出成功的产品。

    无独有偶,我们知道的另一个组织也是通过首先创建“数据湖”(data lake)而陷入漫无目的的数据分析中。它花费了过多的时间(实际上是数年的时间)收集和处理原始数据,但几乎没有投入任何精力来思考数据分析的目的以及想要解决的问题到底是什么。管理层之后才意识到那些是急待解决的问题,却已经失去了先机。

    如果这些企业先明确了想要解决的问题,再以此为引导来收集数据,那么他们肯定会更快地取得成效,哪怕只有一部分数据可用作分析。

    例如,一家著名的汽车公司在一开始就着眼于如何提高利润这一基本问题。随后认识到解决此问题最大的机会是减少在匹配产品设计和工程功能时耗费的开发时间(以及成本)。

    一旦公司意识到关键所在,即结合其十年的研发经验教训进行改革,并显著的缩短了开发周期,提升了公司利润。

    2. 看起来微不足道的事物,作用却很大 | Think really small... and very big

    细节可能决定成败。让我们关注下面这张拍摄于1896年奥运会,100米决赛起跑线上的照片。照片中,参赛运动员们的起跑姿势可谓千姿百态,有直立的,有弯着腰的,也有双手摊开的,只有美国田径运动员ThomasBurke一人采用了现在的标准蹲踞式起跑方法。也正是这种蹲踞式起跑,帮助Burke节省了加速时间从而助他在那一届奥运会上,以12秒的成绩夺得100米跑的金牌。Burke的成功使田径界在短跑比赛中开始普及蹲踞式起跑方式,如今,短跑运动员在比赛中都采用了这种准备姿势。

    当然,这个案例可以很好地类比到商业界,那就是当竞争对手迅速采取了同样的最佳方案之后,你的竞争优势就难以维持。

    好消息是,聪明的一方仍然可以不断的提升他们的表现,取得突破并回到领先位置。轻松地保持优势是不可能的,但是公司可以找出微小的差异,然后放大并利用它。

    “大数据”分析的成果通常表现为数千甚至更多的细微改进。如果一个组织可以将单个任务细化为数个细小的组成部分,并在可能的情况下一一对其进行提升改进,那么由此带来的回报是相当可观的。如果一个组织能够将这些小的改进,系统化的合并到整个连续的流程之中,其带来的回报更是呈指数增长的。

    企业所做的一切事情几乎都可以被分解成小的组成模块。

    GE(通用电气)公司在飞机发动机中嵌入传感器,以实时跟踪其各部分的性能,从而实现更快的调整,大大减少停机维护的时间。

    如果这听起来像是最前沿的高科技(实际上确实如此),那么我们可以看一看更接地气的消费品是怎么做的。一家领先的CPG公司试图增加旗下某知名早餐品牌的利润率。它将整个产品制造过程分解为几个大的步骤,然后通过高级分析,仔细检查每个制造过程,以寻求其中是否有可以提高利润的机会。在这个案例中,公司在烤箱里发现了答案:稍微的调整了烘烤温度之后,不仅产品的味道更好,而且还减少了生产成本。证据就是,优秀的试吃的结果,以及同样优秀的财务报表。

    当一系列的流程可以在比原子结构更为复杂的系统中被分解,分析,又被重新组合在一起时,产生的结果可以比原子弹更具威力。一家大型钢铁制造商使用各种分析技术来研究其商业模式的关键阶段,包括需求规划,预测,采购和库存管理。它单独对每个阶段中关键的价值驱动版块进行研究,并缩减或消除效率缺陷,从而节约5%至10%成本。

    当制造商将改进后的流程再重组在一起,并将实时信息在每个阶段之间传送时,这些数据分析所带来的,数以百计的微小改进及其所节约的成本,带来了前所未有的收益激增。

    通过合理化的端到端系统,将需求计划,预测,采购和库存管理连在一起,制造商实现了近50%的成本节约,节约了相当于几亿美元的成本。

    3. 拥抱禁忌 | Embrace the taboo

    谨防废进废出(garbage in, garbage out:要保证数据可靠有用,才能保证分析结果的可靠有用),这个咒语已深入到了商业思维中,有时会阻碍我们的思维和洞察力。

    实际上,有用的数据点在不同的案例中有着不同的形式和规模,通常以自由文本维护报告或者PPT演示文档等形式隐藏在企业之中。然而,不少团队经常会忽视这些数据,因为这些数据质量不一、缺乏一致性、过时或者因为看起来并不像是我们定义中的“数据”而被过滤等。

    但是如果我们能“废物再利用”,正确的使用这些隐藏着的信息,也许将能得到更清晰有力的结论。在日常生活中,在跳出Excel表格进行信息创建,读取或回应的非二进制世界里,即使是最精英的“金融工程师”(“quant”)处理大量定性的信息,其中大部分都是无法量化信息并且不适合用做数据分析。我们知道,生活中很少有确定的事情,通常我们去衡量概率,考虑各方优势并且记录细微的提示信息。

    想一想去超市购物的时候,你总是去4号台结账吗?或者你有没有注意到,今天某个柜台的员工似乎工作效率更高,某个柜台有个顾客拿着现金买单而不是信用卡,某个柜台的收银员没有助手去帮助他打包商品,而在某条队伍排队的顾客的购物车里面有些货物还未称重并且需要分开装?所有这些都是无法量化却可以处理的信息,并且有些数据比其他数据更有价值。但你可能会逐个地去考虑他们,而且当你决定购物车将往哪儿推时会考虑地更多。只是因为4号结账台在你最近几次购物经历中结账速度最快,但这并不意味着在今天也会是最快的。

    事实上,虽然原生数据点和历史数据点是有价值的,但它们有其局限性。有一家公司在建立强大的投资审批流程后遇到了这些问题。公司为减少资本资源的浪费,在没有历史数据,以及可靠的信息支持投资回报率预测的情况下,管理层将不予通过新产品。不幸的是,这种严格的制度导致了公司产品上市周期过长,从而使公司不断错过市场。只有放松数据约束,将诸如行业预测、产品专家预测和社交媒体评论等软数据也纳入考虑之中,公司才能更准确地了解当前市场环境和推出新产品的绝佳时机。

    当然,Twitter信息与远程信息处理并不一样。但是不能仅因为数据不完整或基于设伦,或是存在偏差,就把这些数据当作“垃圾”来对待。软信息确实有它的价值。特别是当人们尝试将获取更精准的数据与更好的推测未来形势时,这些软数据甚至会起到关键作用。

    为了以智能而细致的方式优化可用信息,公司应努力构建一个强大的数据世系模型(data provenance model),以识别信息来源源,并实时评估其可靠性(可能随时间而提升或降低)。记录数据的质量,以及确定数据之类的方法,这不仅是数据透明度问题,同时也是一种风险管理的形式。所有的公司都在一个不确定性下竞争,有时一个关键的决定性数据的确定性不一定能满足人们的期待。一个构架完善的世系模型可以使用负荷测试检查对行/不行决策的可行度,从而帮助管理者决定投资去改善关键数据集的合适的时机。

    4. 连点成线 | Connect the dots

    在边界上往往能产生新见解,就像考虑软数据一样能够带来新见解一样,结合信息来源来全盘考虑,可以使这些见解更加清晰。

    一些企业往往在一项独立的数据集上进行深入挖掘,却没有考虑到各种不同数据集结合在一起时所传达的信息。例如,人力资源部可能有完整的员工绩效数据,营运部门有特定资产的综合信息,而财务部的投资回报率的备份财务报表。仔细审查每一份信息肯定是有用的,但是互相独立的信息数据集之间也许存在着更多尚待未开发的价值。

    有家工业公司提供了一个具有启发性的实例。公司核心业务使用了最先进的机器,它可以同时负载多个任务。机器的每一个部件都价值上百万美元,而公司采购了数百个单元,总共投资了数十亿美元。这些机器可提供了优秀的运行性能数据,该公司据此评估了机器的每个部件一直以来的运行情况。毫不夸张地说,让机器保持持续运作是公司成功的关键。

    尽管如此,这些机器实际上花费了比管理人员预期更长的维护时间和更昂贵的维护费用,停机维修的每一个小时都对公司有着极大的影响。虽然公司派出了强大的分析团队去仔细筛选分析机器的运行性能数据,但还是没有找出确切的故障原因。

    然后,当公司将人力资源部提供的信息也纳入分析考虑中时,产生次级输出的原因变得很清楚:因为负责人在关键时刻未在场,导致机器缺少定期维护检查。

    奖励机制,而非器械性能,才是这个问题的本质原因。最终,一个简单的政策调整就能解决这个问题,但只有当将不同的信息数据集结合起来审查时才能发现问题本质之所在。

    第二部分 | 从分析结果到实际行动

    在前面的工业公司的案例中,在视觉上就像Venn图一样(维恩图,用于显示元素集合重叠区域的图示。):当将两个数据集放在一起观察研究时,数据集重叠的部分往往显示了问题所在。当你同时分析50个数据集时,其呈现信息的能力则更为强大-前提是繁杂的数据没有造成过度的复杂,从而减弱了数据分析的作用。为了避免这个问题,领导者应该鼓励他们的企业,从多方面入手,来分析数据。如果数据分析工作在孤立的环境中进行而不考虑全局的其他影响,如果数据分析结果在实际情况中没有起到作用,更糟糕的是,如果数据分析得到了正确的结论,可企业并未采纳和依次采取对应的实际行动;那么,这个分析工作就是失败的,没有成功的。

    5. 采用迭代循环而不是单向流程 | Run loops, not line...

  • ?

    成为一名数据分析师,必须掌握的技术,学会了你就是大神

    宋芫

    展开

    一:编程能力

      是否会编程是区别初级数据分析师和高级数据分析师的分水岭。在这里,我定位的是高级数据分析师,所以编程能力尤为重要,我把它放在了第一位。

      有关数据分析的编程语言有Python和R语言。R语言倾向于统计分析、绘图等。统计学家或者学统计学的喜欢用R语言,而我推荐学习Python,因为Python是面向未来的语言,无论从流行度、可用性还是学习难度来讲,Python都是最好的入门语言。

      当然,如果可以的话,再掌握一下R语言是最好不过的,学习嘛,永无止尽。

      书籍推荐《Python编程:从入门到实践》 豆瓣评分:9.0

      当然,只有Python基础肯定是不够的,既然是学习数据分析,肯定就要有数据才行,数据从哪里来,肯定是从互联网上来。互联网上的信息何其之多,必须要对其加以过滤处理,提取我们想要的信息。这就要用到Python爬虫,这也是学Python一个很重要的目的和作用。

      学习Python爬虫肯定比学习Python基础要困难一下,但好在网上的学习资源十分丰富,努力学习必定会有收获的。

      关于Python爬虫的书籍,目前我还没有较好的书籍推荐,如果说实在要推荐的话,我推荐三本书:

      《Python网络数据采集》 豆瓣评分:7.7

      《Python爬虫开发与项目实战》 豆瓣评分:8.1

      《精通Scrapy网络爬虫》 这是十月份出的新书,豆瓣上还没有评分。

      知乎里面有很多爬虫大神,没事多逛逛知乎总会有收获的。

      关于编程能力,是一个很深的概念,需要靠大量的撸代码积累经验。先暂且说到这些。

    二:SQL

      学习数据分析,最难最重要的就是编程能力,熬过去了,后面的就稍微简单一些了。

      既然是跟数据打交道,就免不了要使用数据库。

      目前主要有四种数据库:

      1:SQLite 是一个文件型轻量级数据库,它的处理速度很快,在数据量不是很大的情况下,可以使用SQLite。

      2:MySQL 是一个应用极其广泛的关系型数据库,它是开源免费的,可以支持大型数据库,很多中小型企业都是用的MySQL。

      3:MongoDB 是一个面向文档的非关系型数据库,它功能强大、灵活、易于拓展。

      4:Redis 是一个使用ANSI C 编写的高性能key-value数据库,使用内存作为主存储器。

      它们各有优点,可以灵活使用,如果说非要选一个的话,我建议使用MySQL,因为它使用最广泛。学习最主流的技术,可以在一定程度上发挥更大的作用。

      关于SQL的学习资源:

      购买书籍推荐《SQL基础教程》作者:MICK

      豆瓣评分:9.0,好像这本书出了第二版了,建议购买最新版的。

    三:数据分析能力

      前面说了那么多,都是为了数据分析做准备。数据分析就好比亲手做一顿美食,现在食材有了(通过Python爬虫采集),盛放美食的容器也有了(数据库)。现在就差开火做饭了,写到这感觉肚子饿了,哎呀,忍住。

      对于数据分析,我还没有过多的涉足,总之,多看书,多做项目。

      这里我推荐几本书(都是放在我购物车里还没有买的书)

      学习数据分析必看的书单:

      《Python数据分析基础》八月份的新书,豆瓣上还没有评分。

      《利用Python进行数据分析》2013年的老书,豆瓣评分:8.5

      《Python数据处理》六月份的新书,豆瓣上没有评分。

      《用数据讲故事》 豆瓣评分:8.7

      虽然我还没来得及看这几本书,但是我想认真看了之后,对于数据分析的理解肯定会更加深刻的。

    四:数据可视化

      现在美食做好了,但不能一股脑的装在碗里吧,美食讲究色香味俱全。所以要给它作一个漂亮的造型,呈现在客人面前。这就是数据可视化。

      数据可视化需要借助工具,什么工具呢?那就是大名鼎鼎的tableau!

      什么?你没有听说过tableau?现在听我说了也不迟,哈哈。

      tableau是一款世界级的商业智能工具软件,tableau可以帮助我们快速的分析、可视化并分享信息。在福布斯2017年公布的《10大需求增长最快的职场技能》报告中,tableau高居第三,成为数据分析和可视化的职场必杀技。

      说了这么多,咱们还是好好聊聊怎么学习tableau吧。tableau是一款收费软件,先看一下它的价格吧:

      image

      果然优秀的软件都是收费的,而且还贵的要死。

      但是,tableau的良心之处在于:学生和教师可以免费使用tableau,只需要用我们的学生证信息去免费申请一个序列码,然后就可以下载激活该软件,有效期为1年,如果一年后还是学生的话,还可以用学生证再去申请一个序列号,然后再免费用一年。

  • ?

    干货 | 这是一份完整的大数据处理技术总结与分析

    誓言

    展开

    一 数据分析处理需求分类

    1 事务型处理

    在我们实际生活中,事务型数据处理需求非常常见,例如:淘宝网站交易系统、12306网站火车票交易系统、超市POS系统等都属于事务型数据处理系统。

    这类系统数据处理特点包括以下几点:

    一是事务处理型操作都是细粒度操作,每次事务处理涉及数据量都很小。

    二是计算相对简单,一般只有少数几步操作组成,比如修改某行的某列;

    三是事务型处理操作涉及数据的增、删、改、查,对事务完整性和数据一致性要求非常高。

    四是事务性操作都是实时交互式操作,至少能在几秒内执行完成;

    五是基于以上特点,索引是支撑事务型处理一个非常重要的技术。

    在数据量和并发交易量不大情况下,一般依托单机版关系型数据库,例如ORACLE、MYSQL、SQLSERVER,再加数据复制(DataGurad、 RMAN、MySQL数据复制等)等高可用措施即可满足业务需求。

    在数据量和并发交易量增加情况下,一般可以采用ORALCE RAC集群方式或者是通过硬件升级(采用小型机、大型机等,如银行系统、运营商计费系统、证卷系统)来支撑。

    事务型操作在淘宝、12306等互联网企业中,由于数据量大、访问并发量高,必然采用分布式技术来应对,这样就带来了分布式事务处理问题,而分布式事务处理很难做到高效,因此一般采用根据业务应用特点来开发专用的系统来解决本问题。

    2 数据统计分析

    数据统计主要是被各类企业通过分析自己的销售记录等企业日常的运营数据,以辅助企业管理层来进行运营决策。典型的使用场景有:周报表、月报表等固定时间提供给领导的各类统计报表;市场营销部门,通过各种维度组合进行统计分析,以制定相应的营销策略等。

    数据统计分析特点包括以下几点:

    一是数据统计一般涉及大量数据的聚合运算,每次统计涉及数据量会比较大。

    二是数据统计分析计算相对复杂,例如会涉及大量goupby、 子查询、嵌套查询、窗口函数、聚合函数、排序等;有些复杂统计可能需要编写SQL脚本才能实现。

    三是数据统计分析实时性相对没有事务型操作要求高。但除固定报表外,目前越来越多的用户希望能做做到交互式实时统计;

    传统的数据统计分析主要采用基于MPP并行数据库的数据仓库技术。主要采用维度模型,通过预计算等方法,把数据整理成适合统计分析的结构来实现高性能的数据统计分析,以支持可以通过下钻和上卷操作,实现各种维度组合以及各种粒度的统计分析。

    另外目前在数据统计分析领域,为了满足交互式统计分析需求,基于内存计算的数据库仓库系统也成为一个发展趋势,例如SAP的HANA平台。

    3 数据挖掘

    数据挖掘主要是根据商业目标,采用数据挖掘算法自动从海量数据中发现隐含在海量数据中的规律和知识。

    数据挖掘主要过程是:根据分析挖掘目标,从数据库中把数据提取出来,然后经过ETL组织成适合分析挖掘算法使用宽表,然后利用数据挖掘软件进行挖掘。传统的数据挖掘软件,一般只能支持在单机上进行小规模数据处理,受此限制传统数据分析挖掘一般会采用抽样方式来减少数据分析规模。

    数据挖掘的计算复杂度和灵活度远远超过前两类需求。一是由于数据挖掘问题开放性,导致数据挖掘会涉及大量衍生变量计算,衍生变量多变导致数据预处理计算复杂性;二是很多数据挖掘算法本身就比较复杂,计算量就很大,特别是大量机器学习算法,都是迭代计算,需要通过多次迭代来求最优解,例如K-means聚类算法、PageRank算法等。

    因此总体来讲,数据分析挖掘的特点是:

    1、数据挖掘的整个计算更复杂,一般是由多个步骤组成计算流,多个计算步骤之间存在数据交换,也就是会产生大量中间结果,难以用一条sql语句来表达。

    2、计算应该能够非常灵活表达,很多需要利用高级语言编程实现。

    二 大数据背景下事务型处理系统相关技术

    在google、facebook、taobao等大互联网公司出现之后,这些公司注册和在线用户数量都非长大,因此该公司交易系统需要解决“海量数据+高并发+数据一致性+高可用性”的问题。

    为了解决该问题,从目前资料来看,其实没有一个通用的解决方案,各大公司都会根据自己业务特点定制开发相应的系统,但是常用的思路主要包括以下几点:

    (1)数据库分片,结合业务和数据特点将数据分布在多台机器上。

    (2)利用缓存等机制,尽量利用内存,解决高并发时遇到的随机IO效率问题。

    (3)结合数据复制等技术实现读写分离,以及提高系统可用性。

    (4)大量采用异步处理机制,对应高并发冲击。

    (5)根据实际业务需求,尽量避免分布式事务。

    1相关系统介绍

    1) 阿里CORBAR系统

    阿里COBAR系统是一个基于MYSQL数据库的分布式数据库系统,属于基于分布式数据库中间件的分布式数据库系统。该系统是前身是陈思儒开发的“变形虫”系统(以前调研过),由于陈思儒离开阿里去了盛大,阿里当心“变形虫”稳定性等问题,重新开发该项目。

    该系统主要采用数据库分片思路,实现了:数据拆分、读写分离、复制等功能。由于此系统由于只需要满足事务型操作即可,因此相对真正并行数据库集群(例如TeraData等),此类系统提供操作没有也不需要提供一些复杂跨库处理,因此该系统存在以下限制:

    (1)不支持跨库的join、分页、排序、子查询。

    (2)insert等变更语句必须包括拆分字段等。

    (3)应该不支持跨机事务(以前变形虫不支持)。

    说白了此类系统不具备并行计算能力,基本上相当于数据库路由器!

    另外此类系统的在实际应用的关键问题是,根据什么对数据进行切分,因为切分不好会导致分布式的事务问题。

    2) 阿里OceanBase系统

    该系统也是淘宝为了解决高并发、大数据环境下事务型处理而定制开发的一个系统。该系统主要思路和特点如下:

    (1)他们发现在实际生成环境中,每天更新的数据只占总体数据的1%不到,因此他们把数据分为:基线数据和增量更新数据。

    (2)基线数据是静态数据,采用分布式存储方式进行存储。

    (3)只在一台服务器上存储和处理增量更新数据,并且是在内存中存储和处理更新数据。

    (4)在系统负载轻的时候,把增量更新批量合并到基线数据中。

    (5)数据访问时同时访问基线数据和增量更新数据并合并。

    因此这样好处是:

    (1)读事务和写事务分离

    (2)通过牺牲一点扩展性(写是一个单点),来避免分布式事务处理。

    说明:该系统虽然能处理高并发的事务型处理,号称很牛逼,但其实也只是根据电商的事务处理来定制开发的专用系统,个人认为其技术难度小于oracle等通用型的数据库。该系统无法应用到银行或者12306等,因为其事务处理的逻辑远远比电商商品买卖处理逻辑复杂。

    在目前的大数据时代,一定是基于应用定制才能找到好的解决方案!

    3) 基于Hbase的交易系统

    在hadoop平台下,HBASE数据库是一个分布式KV数据库,属于实时数据库范畴。支付宝目前支付记录就是存储在HBASE数据库中。

    HBASE数据库接口是非SQL接口,而是KV操作接口(基于Key的访问和基于key范围的scan操作),因此HBASE数据库虽然可扩展性非常好,但是由于其接口限制导致该数据库能支持上层应用很窄。基于HBASE应用的设计中,关键点是key的设计,要根据需要支持的应用来设计key的组成。

    可以认为HBASE数据库只支持作为KEY的这一列的索引。虽然目前HBASE有支持二级索引的方案,二级索引维护将会比较麻烦。

    2并发和并行区别

    并发是指同时执行通常不相关的各种任务,例如交易型系统典型属于高并发系统。

    并行是通过将一个很大的计算任务,划分为多个小的计算任务,然后多个小计算任务的并行执行,来缩短该计算任务计算时间。

    两者主要区别在于:

    (1)通讯与协调方面:在并行计算中,由于多个小任务同属一个大的计算任务,因此小任务之间存在依赖关系,小任务之间需要大量通讯和协调;相反,并发中的多个任务之间基本相互独立,任务与任务之间相关性很小。

    (2)容错处理方面:由于并发任务之间相互独立,某个任务执行失败并不会影响其它的任务。但是并行计算中的多个任务属于一个大任务,因此某个子任务的失败,如果不能恢复(粗粒度容错与细粒度容错),则整个任务都会失败。

    3本章总结

    数据量大不一定需要并行计算,虽然数据量大,数据是分布存储,但是如果每次操作基本上还是针对少量数据,因此每次操作基本上都是在一台服务器上完成,不涉及并行计算。只是需要通过数据复制、数据缓存、异步处理等方式来支撑高并发访问量

    三 大数据背景下数据统计分析技术介绍

    随数据量变大,和事务处理不同的是,单个统计分析涉及数据量会非常大,单个统计分析任务涉及数据会分散在多台服务器上,且由于计算量大,采用单台服务器进行计算,会导致计算时间非常长,单个统计分析任务必须采用并行计算方式来加快单个统计分析任务执行速度。

    1并行查询与并行计算技术介绍

    在大数据背景下的数据统计分析技术门类很多,常见的有:

    n MPP并行数据库 : TeraData、GreenPlum、Vertica等。

    n 基于MapReduce并行计算框架的数据仓库:

    HIVE(Hadoop平台) 、Tenzing(Google公司)

    n 基于Hbase的Phoenix系统

    n HadoopDB系统

    n EMC公司的hapt系统

    n MPP分布式查询引擎: Dremel、Impala、Presto、Shard query、Citusdb。

    n 基于SPARK的Shark、基于Dryad的SCOPE、基于Tez的stinger。

    n 基于hadoop+index的JethroData系统

    n 基于内存计算的Druid系统

    这些系统都解决了海量数据下的数据统计分析的问题,并且这些系统另外一个共同特点是都提供了SQL或者类SQL接口。

    为了能够较好研究这些系统,我们需要对并行查询与并行计算的相关技术做一个简要的介绍。

    首先所有的系统都可以分为三个层次: 语义层、并行计算引擎层、分布式存储层。语义层提供一个编程接口让用户表达所需要计算,并负责把该计算翻译成底层并行计算引擎可以执行的执行计划,并由并行计算引擎来执行,最下面一层是分布式存储层。

    对于提供类SQL接口并行计算系统,语义层可以认为是SQL解析层。

    1) 语义层

    SQL语言是一种声名式语言,SQL只是表达了要做什么,而没有表达怎么做。为此,SQL解析层主要作用是:将用户提交的基于SQL的统计分析请求,转化为底层计算引擎层可以执行的执行计划。也就是解决“怎么做”的问题。

    SQL解析层工作主要包括两个大方面:

    (1) 通过语法分析技术来理解要做什么。在关系数据库中,一般会把SQL语言分析后,形成树型结构的执行计划。

    (2) 在语法分析技术上,利用各种优化技术和算法,找出一种最经济物理执行计划。

    优化可以分为两个方面:一是逻辑层面优化、二是物理执行层面优化。

    (1) 逻辑层优化

    逻辑层面个人认为主要是因为同样表达一个分析请求,有的人SQL写的好,有的人SQL写的烂,因此在逻辑层面可以通过一些等价关系代数变换,实现查询重写,将写的比较烂的sql变换为好的写法。

    比较典型优化是:“把投影和过滤下沉,先执行过滤和投影操作”,减少中间结果。

    (2) 物理层优化

    物理层面优化是在逻辑优化后,结合实际物理执行过程,找出最优的物理执行计划。生成物理查询计划的工作包括:

    ü 增加一些操作符: 包括扫描和排序等。

    ü 确定各个操作符实现算法。例如扫描是全表扫描还是利用索引;Join是采用HASH连接、索引连接、合并排序等实现算法中的那一种。

    ü 确定操作符之间的数据流转方法:物化还是流水线方式。

    ü 采用基于代价估算方法确定最优的物理执行计划,目前代价估算主要是以估算该物理计划需要的IO量。另外对于并行数据库,则还要考虑通讯代价,即尽量减少数据在各个机器之间的传递。

    在物理层优化的代价估算过程中,代价估算需要依靠很多统计信息,如表有多大,表中相关列的值分布是什么样子等。传统数据库在数据Load过程中会事先计算好这些统计信息。并行计算中还需要考虑通讯代价。

    需要指出是,由于imapla、Presto、HIVE等系统只是一个查询引擎,它们可以直接查询以普通文件方式存储在HDFS系统上的文件,因此这些系统一般无法使用索引和各种统计信息来进行物理执行计划的优化,这些系统一般只能在逻辑层进行一些基于规则静态优化。根据SHARK论文,SHARK系统支持根据前面一些节点计算获得的信息,来动态优化后面执行计划。

    (3) 物化与流水线执行方法

    一条SQL语句对开发人员而言,感觉只是一次调用,但是实际上在数据库内部,一条SQL语句执行其实是有多个操作符组合而成的的树型结构计算流。如下图:

    针对该计算流有两种执行方式:一是基于物化或者是实体化执行方式,另外一种是基于数据流的执行方式。

    第一种方法的过程是: 把各个操作运算排序,并把每个操作运算的输出的中间结果存储在磁盘上,直到被另外一个操作运算所...

  • ?

    数据分析师应该具备哪种基本能力?

    Millom

    展开

    在互联网时代,数据是重要的资源,随着数据的持续增长和大数据技术的成熟,数据分析变得越来越重要,要看清楚瞬息万变的网络世界,要知道表象背后的真相,非靠数据分析不可,不管是大数据分析还是传统数据分析,其本质是一样的。数据分析是为了通过对数据现象的查看来完成对产品,营销策略,运营策略的优化。达到最低成本,最优效果。因此,数据分析师对应的要求也越来越高。那么,作为一名优秀的数据分析师,需要有哪些基本能力,才能完成数据分析目标,保证结果的正确性?

    商业数据分析的根本目的就是要洞察数据背后的规律,基于此,企业可以制订决策、并采取相应措施和行动,进而达成想要的结果。这是商业数据分析的最大价值所在。

    数据分析的四个能力

    1. 对业务的理解能力

    数据分析之前,首先要进行的是业务梳理。只有在实践领域从事过数据分析工作,就会明白所有分析的重中之重都是业务知识本身。而业务知识的学习和掌握,需要的积累之深,培养一个业务专家,需要的周期之长,都远远超过后面所说的那些基本技能,成为业务专家实属不易,数据分析师其实是之于业务专家之上的更深层次的思考和总结,否则,谁指导谁都是个问题。业务学习的方式很多,比如将以前的分析报告和取数案例都拿过来研究一下,不懂就问,总是一个渐进的过程,但需要时间和行业的沉淀。数据分析师最需要不断提升的能力就是行业和业务知识,没有之一。

    提升业务理解能力有几个方法

    多使用产品本身,只有不断的尝试产品,体验和了解各种产品,才能在分析时有直观的思考和总结;与 产品相关的业务和技术同学沟通,尤其在进行数据理解和运营理解的时候,需要知道数据元素的含义以及当前运营的方式和形成这种运营方式的原因;多思考产品的内在逻辑,多问几个为什么,这样才不至于做分析方案的时候,遗漏其它的业务流程,或者进行错误的数据模型设计。2.有耐心,善于沟通

    数据处理和逻辑梳理需要足够的耐心,尤其是在各种数据格式不统一,数据表存放混乱,以及业务流程/逻辑异常复杂的情况下,作为数据分析师,一定要有足够的耐心,沉下来进行全面的数据流程确认,画出对应的流程图,理清分析重点。

    同时,数据分析贯穿BIT、数据、技术、业务整个链条,数据分析师将BIT最终转化成决策者理解的语言,跨越的流程很长,你需要面对不同的岗位,碰到不同的角色,采用不同的语言,表达你的要求和获得你需要的东西,成为数据和业务的桥梁,没有足够的沟通能力很难。所以,需要具备一定的沟通能力。在沟通之前,需要清楚的知道本次沟通的目的是什么,以及如何通过对方来达成自己有效数据分析的目标。与技术沟通,是理解参数含义,与运营沟通,是理解分析目标,与产品沟通,则是强调产品逻辑以及背后的思考。同时,如果你容易听取他人的意见,特别是智者的意见,则可以帮你找到另一条出路,你犯错的概率就会降低,相应的,你的分析就更有力量和说服力。

    3. 数据分析的技术

    数据分析有很多技术可以支持,包括SQL,Excle,SPSS,Matlab、Python等等,这些都是通过编程完成基本的数据分析语言编写,然后进行执行得出结果。

    因此,数据分析师必须掌握并精通一两种数据分析编程技巧。包括从数据仓库中获取数据,对数据进行清洗,简化,或者补全,处理数据,计算数据,最后进行可视化的表达。这样才能完成数据分析的目标。这种技术对产品和运营人员也非常重要,只有学会处理数据,分析数据,才能在每个决策上面有据可依。

    但在公司的数据分析中,你在看案例时,往往接触到的数据或使用的数据是局部的,因此,你的视野会受局限,在大多数公司里,很多数据分析师其实缺乏全局的数据视野,因为他不知道到底有多少数据,因此,永远只能在已知的数据里转圈圈,

    当然,大多数数据分析师可能不需要进行系统数据学习,在实践中慢慢熟悉就好了,但自顶向下的数据学习方式可以让你有一个更好的基础和更全局的数据视野。

    4.独立思考的能力

    数据分析并不仅仅是为了完成一些业务上面的数据需求和论证。数据分析者应该在理解业务的基础上,扩大自己的思考范围,提升洞察力。

    成为一个优秀的数据分析师,需要在不同的业务中进行磨练,同时需要足够的耐心和深入业务的思考进行决策支撑。一种客观,理性,同时又科学的数据分析心态是非常重要的,对于公司和产品的发展也是必需。

    数据总是在那里,它不会说话,你不仅要基于业务能力理解它,还要学会推演和分析,从中发现规律,迅速定位某个商业问题的关键属性和决定因素,形成自己独创性的见解,所谓心思缜密,滴水不漏,没有思考逻辑没有数据分析。而要形成独特的见解,则来自于个人不断的学习和思考,这里的学习更多的强调是跨领域和专业,思考则是更多的强调养成思考的习惯。思考本身就是一种实践,它可以将你的知识更加系统化和深入化,数据分析在一定程度上是用来验证思路和启发灵感的,“数据分析”从来不是“数据分析”本身,而是以“数据分析”为手段和表象,对业务的深刻理解、思考和判断。

    数据分析的四个层次

    描述性分析(Descriptive Analysis)诊断性分析(Diagnostic Analysis)预测性分析(Predictive Analysis)处方性分析(Prescriptive Analysis)描述性分析——发生了什么?

    如题目名字一样,该层次主要是对已经发生的事实用数据做出准确的描述。比如某企业本月订单签约额比上月增加2000万,至5500万,但是订单履约率从上月的98%下降到了95%,库存周转率从上月的0.8下降到了0.7。那么,这就是发生了什么?就需要去描述性分析。

    诊断性分析——为什么会发生?

    知道发生了什么,对我们的帮助不大,更重要的是,我们要明白为什么发生。比如经过分析,发现在描述性分析中提到的订单履约率下降的原因是成品生产不出来,无法完成交付。而成品生产不出来的原因则是部分原材料的供应商未能按时送货,导致原材料不齐套,无法开始生产。那么,这就是诊断性分析。

    预测性分析——可能会发生什么?

    基于上述两个层次的分析,我们发现了其中的规律,即原材料供应商的未能及时送货会影响成品订单的履约率。假如上月某原材料供应商A送货及时率只有70%,通过建模,我们可以预测本月该供应商会使我们的订单履约率下降2%。那么,这就是预测性分析。

    处方性分析——我们该做些什么?

    有了预测性分析的结果后,我们无需再做事后诸葛亮,而可以运筹帷幄,在事前就采取措施。上述中,供应商A会导致本月我们的订单履约率下降,我们可能采取的措施就是把A换掉,但是现在有B和C两个供应商供我们选择,该选择哪个呢?通过分析和计算得出:选用供应商B会比选C的订单履约率高1%,因此建议选择供应商B。这就是处方性分析。

    四个层次层层递进,经过这四个层次的分析以后,可以对企业的决策和行动提供有力支撑。

    分享 IT 技术和行业经验,请关注-技术学派。

  • ?

    一个工作3年的数据分析师,所具备的能力有哪些?

    我的1997

    展开

    文 | 邹昕-知乎

    来源:再生谈|reborn_chat

    受本人背景和知识水平所限,本答案局限性如下(包括但不限于):

    1. 更适用于中大型公司;

    2. 更适用于互联网公司;

    3. 可能更适用于美国的工作环境。

    个人以为,一个三年工作经验的数据分析师应该具备以下方面的能力:对技术的掌握,对产品的理解,对数据的敏锐性,数据和产品之间互相转化的能力,分析思维的广度、深度和速度,数理统计的能力,沟通的能力,辅导新人的能力,面试把关的能力。

    以下分开来说,同时举例的时候假设这个数据分析师是知乎这个产品的,目的是为了增长活跃用户。

    【1】对技术的掌握

    不一定需要非常高深的技术,但是基本的一定要过关。比如针对互联网行业的数据分析,SQL 是一定要过关的。在这基础之上,掌握公司惯用的BI工具或者报表工具,譬如帆软系列;Python / R 可以提高长期的工作效率,但在初期并不一定需要。

    简单来说,技术能力决定了一名数据分析能力的下限,而对产品和业务的理解则决定了上限。

    如果缺乏技术的支持,那就只能去当 CEO 了。

    就好比在电影 Margin Call 里,底下的小兵负责分析数据,各种模型预测金融危机什么时候会发生。

    而对于 CEO 来说,他的任务就是猜。

    【2】对产品的理解

    数据分析的目的是为了改进产品。如果缺乏对产品的理解,那么技术再好,也有可能像是无头苍蝇到处乱撞。

    或者是变成 data dump,提供一堆一堆的图表,但其中有互相什么关联,能说明什么问题,提供什么样的建议,却并没有好的想法。

    如果是初入行的话,这还是问题不大的。

    因为新人可以有老板带着,或者是老人带着,但是如果想要更进一步,那就必须能够自己独立的做项目。

    尤其是在互联网行业更是如此,除了新人之外,对大多数人的基本要求都是能单兵作战,不需要详细的指导。

    同时在很多情况下,问题是很开放性的,对于如何解决并没有一个非常固定的套路,或者是因为这完全就是一个新的问题,或者因为不同产品之间套路无法直接套用,需要做大量的调整和创新。

    比如这里面增长的例子,哪些是可以借用于知乎的,哪些是需要调整的,哪些是完全不适用的?

    【3】对数据的敏锐性

    对数据的敏锐性体现在两方面,一是在结果还不是那么清晰的时候,甚至根本就没有什么数据的时候,能够大致感觉往哪个方向深挖是更有可能出成果的;二是在数据出问题的时候,能够反应出来,及时找出原因。

    比如做知乎的数据分析,目的是为了增长活跃用户,可以做的地方有很多,比如增加获新、增加内容、增加用户关注话题数、增加用户关注人数等等。一个经验丰富的老司机可以快糙猛的大概估算一下各个方面的机会有多大,大致的实施难度如何,风险是大是小,产品哪些方面是有缺陷可以改进的。

    另一方面,是人就会犯错,最大的区别在于有的人可以很好的纠错,而有的人则需要别人提醒,还有的人即使别人提醒了也反应不过来。

    【4】数据和产品之间互相转化的能力

    在互联网行业,多数时候问题是很不清晰的,比如说问题可能是2017年新用户留存远差于2015年的用户,如何解决?

    对数据分析师来说,并不会有一个详细的单子来告诉你都有哪些步骤,而是需要自己灵活处理。

    一方面这些问题本身就比较新,虽然会有一个大致的套路,比如 AARRR 模型,解决增长需要先解决留存等等;然而再往下具体的时候,套路就没有那么固定了,因为不同的产品之间可以差别很大。

    即使像是 Quora 和知乎这样理应非常类似的产品,也可能因为一些或大或小的差异,导致给分析数据也带来差别。

    比如 Quora 的 upvote 并不完全代表赞同,而更多带有传播的意味。

    而对于知乎来说,点赞即是赞同,传播只是副产品而已。

    如果只懂数据不懂产品的话,很容易进入一个误区,要么产品/业务方追着问数据,要么没活儿干。

    【5】分析思维的广度、深度和速度

    速度这个比较好理解,尤其是在互联网行业,讲究快糙猛,没有时间精细打磨。

    比如一个项目可以花两个月时间做出 95%,也可以花两周时间做 80%,那么多数时候都会是后者。

    广度:产品的各个方面之间总是互相牵扯的。最简单的例子,如果知乎的拉新做得非常好,那么留存就有可能降低,用户活跃度也有会降低。

    如何分析各者之间的关系,如何保持一个合理的平衡,如何增加其中一个不过于负面影响其它,这些数据分析都需要在广度上有一定的了解。

    深度:有些问题一个人解决不了或者很难,多几个人就可以了,比如说搬砖,十人人搬总会比一个人搬快得多,哪怕不是十倍速度。而有些问题,靠堆人力是没用的。

    【6】数理统计的能力

    这一部分跟 1,3,5 是相关的。不一定需要特别高精尖,但是对于分析问题会有很大的帮助。比如说如何识别数据分析里可能出现的错误。

    【7】沟通的能力

    除非兼任软件工程师和产品经理的职,否则数据分析师总是需要通过说服产品和工程方面来改变产品,产生影响力。

    有了好的结果是第一位,如何影响合作伙伴,让他们接受自己的建议甚至比有好的结果还重要。

    毕竟,没有声音,再好的戏也出不来。

    【8】辅导新人的能力

    毛主席说过,人多力量大,要把敌人淹没在人民战争的汪洋大海中。

    辅导新人,不只是团队 leader/manager 的要求,对于独立贡献者(inpidual contributor)也是一样重要的。

    闻道有先后,术业有专攻。

    一个人的力量终究是有限的,如果把自己的能力复制到整个团队甚至整个公司,是增大自己影响力最有效的办法之一。

    【9】面试把关的能力

    大多数人应该都希望自己的公司处于一个增长的状况,如果是高速增长那就更好不过了。

    有增长,就必然要招人。

    而招人并不是简单的招人来干活,而是招来更优秀的人进一步提高团队的水平。

    这对于高速增长的团队来说是一个很大的挑战,所以提高面试技能和精准的判断面试者的能力,无疑是有效的扩张团队的不二法则。

    【10】少睡的能力

    比如说七周不睡觉,快速成为数据分析师(开玩笑的)。

数据分析技术支持

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP