- ?
从粗放到精耕:大数据+新技术驱动量化投资进入全新发展阶段
毕弘文
展开
“穷究天数为九,厚德载物为坤”,九坤投资之名取自中国传统文化中的《周易》,寓意公司对数字与计算的极致追求。公司团队自2011年开始从事国内期货、证券的量化投资,一路发展至今,始终专注于国际前沿的量化交易技术和交易策略开发,致力于发掘国内股票、期货市场的盈利机会,为投资人提供风险收益相适应的量化投资产品。
在九坤投资总经理王琛看来,量化投资是一门典型的交叉学科,它融合了概率统计、公司财务、大数据、计算机技术等多门学科,做好量化需要对理论(策略)和技术(交易)进行完美的融合。
九坤投资在投研上的一个核心理念是:市场是动态博弈变化的,再好的“老”策略都会因为市场逐渐了解而效用下降,只有“新鲜”的,也就是低相关性的策略才有价值。正是由于这样的理念,九坤投资在中国做交易以来一直非常关注做出来策略的“新鲜”度,即使国外成熟策略在中国也会有保质期,如果不能持续挖掘新策略,业绩也难以有延续性。这一点在交易规则、市场结构经常快速变化的中国市场尤为重要。
高收益低回撤的独家绝招
从2012年4月成立九坤投资到至今,已经走过足足六个年头,期间九坤投资遭遇了牛熊交替与市场风格切换的行情,量化投资在中国也备受考验,九坤投资从开始交易到至今,每年均保持同策略业内领先的业绩表现,为投资人提供了收益风险比极佳的投资标的。
如何能做到高收益与低回撤双收?
王琛介绍,首先要有大量优质的策略因子。就像做出一顿好吃的饭菜首先需要新鲜和丰富的食材,策略因子就是一个量化投资组合的“食材”。九坤在开发策略因子过程中,筛选标准极其严格,以此保证每一个策略都有更好的收益风险比,也因此九坤才更有“底气”让策略投资能够获得更好的收益风险比。
有了好的因子,如何在投资组合上控制整体风险也非常考究。中国市场变化非常快,除了要使用定量化的风险模型控制敞口外,九坤还会根据市场变化对风险模型本身进行不断的迭代更新,在模型中识别和加入新的风险来源。
另外,每个投资人都有各自的投资目标,有人愿意承担高风险,有人不愿意。九坤投资会针对不同产品客户的预期定位,设置不同的量化风险预算,保证在不让资金承担超过预期风险的前提下获取最大化收益,而不是盲目或者故意为了增加收益而扩大风险暴露。
优秀团队是核心竞争力
量化投资在今天的中国市场,已经进入团队竞争的时期,九坤投资审时度势,在过去几年持续在做的就是不断吸引最优秀的人才加入九坤,并且尽力打磨投资团队,通过有效分工保持每个人专注于自己研究的细节,再组合成最整体化的投资体系。
回望过往的6年投资经历,九坤投资除了在业绩口碑上分外亮眼外,也培养出了一大批优秀的量化投资人才,目前九坤团队人员接近70人,他们绝大部分来自于清华、北大等名校,核心成员更是全部拥有海外对冲基金经验。高水平个人加体系化团队,也成为九坤投资最大的竞争力。让王琛引以为傲的是,公司每一个产品的投资几乎都有九坤所有人员添砖加瓦的贡献,正是团队的力量,铸造了九坤投在在业界超越同行的业绩与口碑。
业绩是私募基金的生命线,也是九坤投资对投资者最大的责任。九坤投资一直坚持业绩优先的原则,公司近期公告暂停增加管理规模,就是综合考虑到市场情况和策略情况做出的决定。未来九坤也会根据策略容量和市场情况采用总额度控制的方式动态控制规模。
九坤开始资管业务是在2016年,也正是中国量化行业最低谷的时刻,九坤投资过去两年用一个个产品逆市环境下的突出表现证明了自己的投资能力,也收获了投资者的信任。
量化投资未来两大发展趋势
2010-2013年是中国量化交易市场处于起步阶段,市场以股指期货的量化策略为主。2014-2015年,尤其是股灾期间,基本面投资的基金净值一泻千里,大部分量化基金都很好的通过对冲控制了净值回撤,甚至在大盘下跌期间还能斩获盈利,量化投资由此进入主流投资的视野。2017年是公认的价值投资元年,蓝筹白马起舞,量化投资却遭遇滑铁卢。
作为一家量化策略私募管理机构,王琛介绍量化策略将有两大发展趋势:
一是策略研究更加精细化。2014年前的多因子大家做的很粗放,几个传统因子用一用就能得到不错的收益率,市场流动性也很好,先把规模做上来最重要;而这两年市场难做,如果只在简单地做,“看天吃饭”,是无法保证业绩的。
在策略精细化要求更高的趋势下,九坤投资坚持团队协作模式,而所谓团队协作就是专业分工+持续钻研。量化投资都可以分解为“数据+因子+组合+交易执行+风控”这几个环节,虽然不同策略研究对象会有差别,但每个环节里方法论反而很相似并且可以互相借鉴。通过分工,每个人专注于一个环节,把它打磨好,再拼装出来效果就会好很多。
二是新数据、新技术会更多的应用。除了传统的市场行情和基本面数据来源,量化投资已经并将更大范围地使用包括互联网数据在内的新数据进行策略开发,这很可能给量化投资注入新的生命力。另外包括AI在内的一些新的技术也可能在未来对量化投资产生颠覆性的影响。
在同类型私募中择优
市场在不同阶段风格不同,投资者盲目在不同风格中不断切换,往往会因踏错节奏而损失惨重。就如何投资私募基金,王琛也和投资者分享了他的心得,那就是降低预期,关注长期,择优而投。
王琛介绍,无论量化策略还是主观策略,都有它的周期性,也会在某些市场环境下表现不利,但最基本的一个原理是,当市场上大量资金都投向某一类策略时,多半是因为过去短期内其表现非常亮眼,比如2015年上半年的量化对冲,2016年的CTA,2017年的价值投资等,那么接下来无论基于市场周期调整,还是因资金追逐导致的盈利空间下降,都可能带来该类策略短期的低潮。”
但这并不是说看空过去表现好的策略,而是投任何策略要放平心态降低预期,多看长期表现,尽量进行长期投资配置,不要对短期业绩产生过度反应而频繁择时切换策略投向。另外,在同类型策略中,应该选择在有利和不利的市场阶段都能表现更优秀的私募基金。能做到以上两点,就不会经常出现在基金回撤前上车的情况,长期投资收益就会更有保障。
结语:
目前量化投资在中国发展迅速,关于如何在团队壮大和策略开发方面提前布局,王琛表示九坤投资将继续吸引优秀人才加入九坤,这是量化投资最核心的竞争力。在策略开发方面会继续加大纵深方向的拓展,而策略开发是个系统工程,需要很多方面的配合,归根结底是公司整体投研、交易体系能力的提升。
中国量化对冲基金在投研体系上相比于国外成熟的对冲基金巨头们还有比较长的路要走,面对愈加开放的金融市场,九坤从未停止完善研究体系、提升技术实力的步伐,以超前的眼光审视着公司的发展和决策。而相对于国外巨头,本土私募更熟悉中国市场,对市场变化有更多的前瞻性和适应性。展望未来,九坤将继续坚持团队协作的模式,提升自身的投资能力,一如既往地用更好的产品和业绩回馈投资者。
- ?
零售大数据分析应用的四个阶段
Fidelia
展开
中国零售业所面临的最具挑战的竞争,就是顾客和市场需求的纷繁复杂及其飘忽不定的变化。而零售企业成功乃至存活的关键,就是如何采取灵活多变且机智的应对行动,这就要求管理者要能够顺应市场的变化、快速发现并处理问题,并且及时的制定解决方案和抓住市场机会。因此,基于数据和事实,质量更高、速度更快、成本更低的决策显现了前所未有的重要性。
- ?
大数据时代,您要怎么干?
柏越泽
展开
大数据已经上升为国家战略,“十三五”规划纲要中明确指出,要把大数据作为基础性战略资源,加快推动数据资源共享开放和开发应用,助力产业转型升级和社会治理创新。大数据正日益对各行各业的方方面面产生深远影响。如何突破大数据关键技术,运用大数据推动行业发展,同时确保信息安全,已成为业内普遍关注的热点问题。
传媒行业从口口相传到文字印刷、电报之后,走到了互联网时代,网络颠覆了传统媒体的传播模式和产业形态。传媒不再是简单的单向传播,加强交互成为现代传媒行业的重点,也是抢抓用户的利器。大数据利用在线性、海量性、实时性等优势,掌握用户收视路径背后的方法论,用数据感知用户需求,提升服务层次和运营能力,进而反哺内容制作。
大数据之电视新闻与节目制作目前随着内容碎片化,媒体分众化趋势更加显著,消费个性化的同时,更需要利用好数据分析,感知用户需求、传递更多有效信息给制作团队。 特别是较之传统媒体的非实时、抽样化的数据,新媒体时代全样本、实时数据的分析利用,“让广电人知道怎么有的放矢,把节目拍得让观众喜欢看。” 在电视新闻方面,利用大数据分析,可快速发现新闻线索,发掘用户真正关心的热点问题,并提升数据新闻的客观性与说服力。在新闻报道结束之后,可通过数据分析与处理,合理跟踪与引导舆论走向。 在节目制作方面,国内广电媒体开始接受互联网思维“指导”。“节目的制作过程一般分为策划、预热、播出、播后四个阶段,其中最核心的是用户和节目之间不断地产生交互。” 在策划阶段,通过收集实时、全样本数据,分析观众喜好,有针对性地创作内容。 在预热阶段,通过大数据分析了解到观众的喜好、特性,从而决定什么样的内容采用什么样的传播推广方法。 在播出阶段,有了数据分析,节目组能够及时得到观众来自社交媒体、论坛、搜索引擎等各种网络渠道的反馈。 在播后阶段,通过深入的数据分析,并根据观众需求的动态变化来调整和优化节目内容。 管理决策层面,有效应用“大数据”可以帮助广电管理层告别漫无目的、厚到天际的报告,搭建一个辅助领导决策、可扩展的数据管理平台,从而做出更智能、更高效的决策。 除了传统的收视率、收视份额以及收视排名等,管理层还可以看到IPTV的数据分析,包括用户点击量、微博提及率、网媒关注度等一切可融入管理的数据。 同时,利用“大数据”,所有的分析结果都可以显示在无纸化的界面上,管理层可以根据不同职责权限,实时、快速地查阅。大数据之互动电视平台广电互动电视平台是典型的“大数据”系统。互动平台利用双向网络,在网络覆盖的区域范围内将数以百万个机顶盒、成百上千台服务器以及运营支撑系统(BOSS)、地理信息系统(GIS)、媒资系统等多个异构的业务系统紧密连接,每天产生、传输和存储数以TB甚至PB的海量数据。这些数据包含文档、文本、图片、XML、HTML、各类报表、图像和音视频信息,是典型的非结构化数据。 广电传统的数据分析主要是随机抽样用户方式的收视率调查,这种数据采集和分析方法已经无法满足双向收视数据的要求,特别是互动视频点播等增值业务及相对小众频道的调研分析。而且网络公司的各种资源管理也逐渐趋向数字化,BOSS系统、网络资源管理系统、媒体资产系统等都可以成为用户数据分析的一部分。因此,互动平台的发展让更广泛更多样的数据采集成为可能,传统的电视收视分析必将演变成用户的行为数据分析,应用层面也随之扩大到不同的领域。让广电网络的业务经营分析、管理变得有据可依。 随着数字化和国家三网融合战略的展开,传统广电运营商由原来的单一网络运营商向多媒体网络及信息服务运营商转变,广电业务也向着移动互联网等新媒体拓展。如何通过大数据系统对海量数据进行发掘,掌握用户的消费喜好、消费层次、成员构成、年龄范围等,提高运营商的服务层次和运营能力,将成为各大广电运营商优化现有商业模式、创造新型商业模式、提高运营效率和服务质量的重要战略举措。构建大数据平台还要注意什么改变传统广电单向传播的思维定式,增强互联互动,通过逆向传播丰富内容资源,激发用户参与激情,充分了解用户真实意愿。现行的网络广播电视台基本上都延续了单向传播的方式,UGC资源较少,互动性较低。以影响最大的中国网络电视台为例,在国家层面的大力扶持下以及中央电视台的鼎力支持下,中国网络电视台以国家网络视频数据库(内容云)为核心,以国家新媒体集成播控平台、全球网络视频分发体系为支撑,目前已成为亚洲最大的网络电视直播、点播平台,其核心优势在于拥有中央电视台50万小时优秀历史影像资料和全国电视机构每天播出的1000多个小时的视频资源。然而中国网络电视台的商业价值未被充分发掘,其广告份额仅占视频广告总份额的3.6%,与门户三巨头优酷、土豆和搜狐对比相去甚远。究其原因,是由于海量的内容资源与碎片化的用户对接上出现错位,一方面,电视观众与互联网用户差异较大,电视观众以中老年为主,互联网用户年轻人居多,两者消费视频内容的喜好大不一样;另一方面,由于缺乏对用户数据的全面采集和深入分析,难以针对用户提供超细分的精准服务。在网络广播电视台之间实现内容资源的互通有无和用户数据的开源共享。通过整合各台的内容资源数据库,形成多库互通、数字传输、采集分发、分布检索一体化的公共媒体资源管理,有利于降低成本,扩大影响,产生规模效益。在互联网领域,共享与合作是大势所趋,比如p2p共享软件、社区、搜索引擎、云计算等等,视频网站的发展也不能例外,优酷和土豆已合并,爱奇艺、腾讯视频结成版权共享联盟,深圳电视台联合全国多家城市电视台成立“城市联盟网络电视台”。广电主管部门应积极倡导全行业网络广播电视台的资源共享和互联互通,打通壁垒,由单打独斗式的个体店转变为规模化的大超市经营。尤其是对用户数据资源,必须做到行业内的开源共享和分布式计算,才可能实现经济效益和社会效益的双赢,即通过用户数据,掌握用户的个性化需求和变化,实施细分服务及精准营销,获取持续的商业利益;通过用户数据,全面监测网络舆情,及时应对,有效进行网络舆论引导。逐步将管理方式由以节目为核心转变成以用户为核心,用户数据资源的掌握和开发是实现管理方式转变的重要基础,也是网络广播电视台获得核心竞争力的关键所在。麦特卡尔夫定律指出,网络的价值增长会与网络用户数的平方成正比,以用户为中心的全面整合竞争已经拉开序幕,未来互联网的主体将从内容转移到人。当内容已经形成海量甚至泛滥之后,内容的价值在迅速下降,互联网的关注焦点必然转移到个人需求上,提供一种设计得更好、更直接更完美的用户体验,正成为互联网未来商业模式的核心。编后编后在三网融合的背景下,大数据时代已经到来,广电行业站在多据信息融合的制高点,掌握了大量数据。大数据时代不仅对广电行业的发展带来了巨大的影像,广电行业也应利用大数据做出顺应时代的改进。结合数据挖掘、数据分析相关技术,广电行业可以获得更多详细的信息,生产出分流更细的产品呈现给用户,为用户生活带来更多方便。大数据技术的战略意义不在于掌握庞大的数据信息,而在于对于这些信息进行专业化处理得到更有用内容。如果把大数据比作一个庞大的工厂,那么数据挖掘在其中则扮演“加工”,对于工厂效益的提高,则需通过增加加工能力来实现。
- ?
大数据的入门级学习
青亦
展开
1.Linux基础和分布式集群技术
学完此阶段可掌握的核心能力:
熟练使用Linux,熟练安装Linux上的软件,了解熟悉负载均衡、高可靠等集群相关概念,搭建互联网高并发、高可靠的服务架构;
学完此阶段可解决的现实问题:
搭建负载均衡、高可靠的服务器集群,可以增大网站的并发访问量,保证服务不间断地对外服务;
学完此阶段可拥有的市场价值:
具备初级程序员必要具备的Linux服务器运维能力。
1.内容介绍:关注作者:需要大数据学习视频资料可以加我QQ群,此文里面连起来的数字,你会找到我的
在大数据领域,使用最多的操作系统就是Linux系列,并且几乎都是分布式集群。该课程为大数据的基础课程,主要介绍Linux操作系统、Linux常用命令、Linux常用软件安装、Linux网络、防火墙、Shell编程等。
2.案例:搭建互联网高并发、高可靠的服务架构。
2.离线计算系统课程阶段
1. 离线计算系统课程阶段
Hadoop核心技术框架
学完此阶段可掌握的核心能力:欢迎加入722680258零基础到项目实战
1、通过对大数据技术产生的背景和行业应用案例了解hadoop的作用;2、掌握hadoop底层分布式文件系统HDFS的原理、操作和应用开发;3、掌握MAPREDUCE分布式运算系统的工作原理和分布式分析应用开发;4、掌握Hive数据仓库工具的工作原理及应用开发。
学完此阶段可解决的现实问题:
1、熟练搭建海量数据离线计算平台;2、根据具体业务场景设计、实现海量数据存储方案;3、根据具体数据分析需求实现基于mapreduce的分布式运算程序;
学完此阶段可拥有的市场价值:
具备企业数据部初级应用开发人员的能力
1.1 HADOOP快速入门
1.1.1 hadoop知识背景
什么是hadoop、hadoop产生背景、hadoop在大数据云计算中的位置和关系、国内hadoop的就业情况分析及课程大纲介绍
国内外hadoop应用案例介绍
分布式系统概述、hadoop生态圈及各组成部分的简介
1.1.2 HIVE快速入门
hive基本介绍、hive的使用、数据仓库基本知识
1.1.3 数据分析流程案例
web点击流日志数据挖掘的需求分析、数据来源、处理流程、数据分析结果导出、数据展现
1.1.4 hadoop数据分析系统集群搭建
集群简介、服务器介绍、网络环境设置、服务器系统环境设置、JDK环境安装、hadoop集群安装部署、集群启动、集群状态测试
HIVE的配置安装、HIVE启动、HIVE使用测试
1.2 HDFS详解
1.2.1 HDFS的概念和特性
什么是分布式文件系统、HDFS的设计目标、HDFS与其他分布式存储系统的优劣势比较、HDFS的适用场景
1.2.2 HDFS的shell操作
HDFS命令行客户端启动、HDFS命令行客户端的基本操作、命令行客户端支持的常用命令、常用参数介绍
1.2.3 HDFS的工作机制
HDFS系统的模块架构、HDFS写数据流程、HDFS读数据流程
NAMENODE工作机制、元数据存储机制、元数据手动查看、元数据checkpoint机制、NAMENODE故障恢复、DATANODE工作机制、DATANODE动态增减、全局数据负载均衡
1.2.4 HDFS的java应用开发
搭建开发环境、获取api中的客户端对象、HDFS的java客户端所具备的常用功能、HDFS客户端对文件的常用操作实现、利用HDFS的JAVA客户端开发数据采集和存储系统
1.3 MAPREDUCE详解
1.3.1 MAPREDUCE快速上手
为什么需要MAPREDUCE、MAPREDUCE程序运行演示、MAPREDUCE编程示例及编程规范、MAPREDUCE程序运行模式、MAPREDUCE程序调试debug的几种方式
1.3.2 MAPREDUCE程序的运行机制
MAPREDUCE程序运行流程解析、MAPTASK并发数的决定机制、MAPREDUCE中的combiner组件应用、MAPREDUCE中的序列化框架及应用、MAPREDUCE中的排序、MAPREDUCE中的自定义分区实现、MAPREDUCE的shuffle机制、MAPREDUCE利用数据压缩进行优化、MAPREDUCE程序与YARN之间的关系、MAPREDUCE参数优化
通过以上各组件的详解,深刻理解MAPREDUCE的核心运行机制,从而具备灵活应对各种复杂应用场景的能力
MAPREDUCE实战编程案例:通过一个实战案例来熟悉复杂MAPREDUCE程序的开发。该程序是从nginx服务器产生的访问服务器中计算出每个访客的访问次数及每次访问的时长。原始数据样例如下:
通过一系列的MAPREDUCE程序——清洗、过滤、访问次数及时间分析,最终计算出需求所要的结果,用于支撑页面展现:
1.4 HIVE增强
1.4.1 HIVE基本概念
HIVE应用场景、HIVE内部架构、HIVE与hadoop的关系、HIVE与传统数据库对比、HIVE的数据存储机制、HIVE的运算执行机制
1.4.2 HIVE基本操作
HIVE中的DDL操作、HIVE中的DML操作、在HIVE中如何实现高效的JOIN查询、HIVE的内置函数应用、HIVE shell的高级使用方式、HIVE常用参数配置、HIVE自定义函数和TRANSFORM的使用技巧、HIVE UDF开发实例
1.4.3 HIVE高级应用
HIVE执行过程分析及优化策略、HIVE在实战中的最佳实践案例、HIVE优化分类详解、HIVE实战案例--数据ETL、HIVE实战案例--用户访问时长统计
HIVE实战案例--级联求和报表实例:
离线数据挖掘系统
学完此阶段可掌握的核心能力:
1、通过对数据仓库知识的加强初步掌握数据仓库的核心概念和设计流程;2、通过对HADOOP生态圈关键辅助工具的学习掌握hadoop分析系统的整合能力;3、通过电商系统点击流日志数据挖掘系统实战项目,掌握hadoop离线数据挖掘系统从数据采集、入库、分析及报表展现的整套流程
学完此阶段可解决的现实问题:
1、可根据企业具体场景设计海量数据分析系统的通用架构2、根据具体场景的特点有针对性地调整数据分析各环节的技术选型;3、根据具体需求搭建起整套离线数据分析系统;4、简单数据仓库模型的设计和架构5、各环节具体功能模块的开发实现
学完此阶段可拥有的市场价值:
具备企业数据部中高级应用开发和初级架构师能力
2.1 数据仓库增强
2.1.1 数据仓库及数据模型入门
什么是数据仓库、数据仓库的意义、数据仓库核心概念、数据仓库的体系结构
2.1.2 数据仓库设计
建立数据仓库的步骤、数据的抽取、数据的转换、数据的加载、什么是数据模型、数据模型的常见类型、如何设计数据模型、如何选择数据建模的架构
典型数据模型——星型建模实例
2.1.3 数据仓库建模样例
业务建模、领域建模、逻辑建模、物理建模
web点击流日志分析系统数据仓库设计实战:
通过对数据特点和业务需求的分析,关系梳理,设计出一个主题明确、层次合理的数据模型
2.2 离线辅助系统
2.2.1 数据采集系统
数据采集概念介绍
FLUME日志采集框架介绍、FLUME工作机制、FLUME核心组件、FLUME参数配置说明、FLUME采集nginx日志实战案例
2.2.2 任务调度系统
任务调度系统概念介绍、常用任务调度工具比较、OOZIE介绍、OOZIE核心概念、OOZIE的配置说明、OOIZE实现mapreduce/hive等任务调度实战案例
2.2.3 数据导出
数据导出概念介绍、SQOOP基础知识、SQOOP原理及配置说明、SQOOP数据导入实战、SQOOP数据导出实战、SQOOP批量作业操作
2.3 web点击流日志分析系统实战项目
2.3.1 项目介绍
1. 在PC时代,营销的核心是购买,在移动互联网时代,其核心是如何实现用户个性化互动,对用户传播更为精准化的内容,而实现这一核心的基础就是对数据的管理和分析——数据驱动型商业模型。
2. 各类互联网服务产品(如网站、APP)都可以通过前端技术获取用户的详细行为数据(如访问的页面,点击的区域、登陆的频次、注册行为、购买的行为等),将这些点击流日志数据与后台商业数据综合起来,就可以挖掘对公司运营决策意义非凡的商业价值。
3. 本项目则是一个用大数据技术平台实现的点击流日志分析数据挖掘系统,项目内容涵盖一个典型数据挖掘系统中,包括需求分析、数据采集、数据存储管理、数据清洗、数据仓库设计、ETL、业务模型统计分析、数据可视化的全部流程。
2.3.2 需求分析
什么是点击流日志、点击流日志的商业价值、点击流日志分析需求
业务模型指标体系设计——流量分析、来源分析、受访分析、访客分析、转化率分析
2.3.3 系统设计及开发
1. 系统架构设计
2. 数据采集设计及开发——数据格式、数据内容分析、数据生成规律、采集系统技术选型解析、FLUME采集系统实现
3. 数据存储设计及开发——存储技术选型、存储业务流程解析、存储目录规划及文件命名规则、小文件合并实现
4. 数据统计设计及开发——数据预处理、数据加载、原始数据表的创建、数据入库、数据ETL
5. 报表统计设计——数据模型设计、事实表设计、维度表梳理
6. 业务指标设计及开发——PV统计(时间维度、终端维度、地域维度)、来访次数统计(时间维度、地域维度、终端维度)、独立访客统计(时间维度、终端维度、地域维度)、受访页面统计(时间维度、栏目维度)、页面热点图、转化率分析、来源关键词分析、来源搜索引擎分析、来源广告推广分析
2.3.4 任务调度系统设计实现
任务调度单元实现、各环节任务运行频次及依赖关系梳理、工作流设计及实现、工作流定义配置上传部署、工作流启动即状态监控
2.3.5 数据可视化——结果报表展现
1. hive分析结果使用sqoop导出到msyql数据库
2. 报表展现系统技术选型:
后台使用spingmvc + spring + mybatis
前端页面使用全静态异步刷新技术jQuery + Echarts
3. web展现程序架构搭建,使用maven构建项目工程
4. web展现程序页面设计开发:原型页面设计、js代码开发
5. 最终实现以下数据可视化效果:
(1)流量概况可视化效果:
(2)来源地域分析可视化效果:
(3)来源类型分析可视化效果:
3.Storm实时计算部分阶段
实时课程分为两个部分:流式计算核心技术和流式计算计算案例实战。
1.流式计算核心技术
流式计算核心技术主要分为两个核心技术点:Storm和Kafka,学完此阶段能够掌握Storm开发及底层原理、Kafka的开发及底层原理、Kafka与Storm集成使用。具备开发基于storm实时计算程序的技术能力。
学完此阶段可掌握的核心能力:
(1)、理解实时计算及应用场景
(2)、掌握Storm程序的开发及底层原理、掌握Kafka消息队列的开发及底层原理
(3)、具备Kafka与Storm集成使用的能力
学完此阶段可解决的现实问题:
具备开发基于storm的实时计算程序的能力
学完此阶段可拥有的市场价值:
具备实时计算开发的技术能力、但理解企业业务的能力不足
1.1、流式计算一般结构
2011年在海量数据处理领域,Hadoop是人们津津乐道的技术,Hadoop不仅可以用来存储海量数据,还以用来计算海量数据。因为其高吞吐、高可靠等特点,很多互联网公司都已经使用Hadoop来构建数据仓库,高频使用并促进了Hadoop生态圈的各项技术的发展。一般来讲,根据业务需求,数据的处理可以分为离线处理和实时处理,在离线处理方面Hadoop提供了很好的解决方案,但是针对海量数据的实时处理却一直没有比较好的解决方案。就在人们翘首以待的时间节点,storm横空出世,与生俱来的分布式、高可靠、高吞吐的特性,横扫市面上的一些流式计算框架,渐渐的成为了流式计算的首选框架。如果庞麦郎在的话,他一定会说,这就是我要的滑板鞋!
上图是流式分析的一般架构图,抽象出四个步骤就是数据采集、数据缓冲、数据处理、数据输出。一般情况下,我们采用Flume+kafka+Storm+Redis的结构来进行流式数据分析。实时部分的课程主要是针对Kafka、Storm进行学习
1.2、流式计算可以用来干什么
一淘-实时分析系统:实时分析用户的属性,并反馈给搜索引擎。最初,用户属性分析是通过每天在云梯上定时运行的MR job来完成的。为了满足实时性的要求,希望能够实时分析用户的行为日志,将最新的用户属性反馈给搜索引擎,能够为用户展现最贴近其当前需求的结果。
携程-网站性能监控:实时分析系统监控携程网的网站性能。利用HTML5提供的performance标准获得可用的指标,并记录日志。Storm集群实时分析日志和入库。使用DRPC聚合成报表,通过历史数据对比等判断规则,触发预警事件。
一个游戏新版本上线,有一个实时分析系统,收集游戏中的数据,运营或者开发者可以在上线后几秒钟得到持续不断更新的游戏监控报告和分析结果,然后马上针对游戏的参数和平衡性进行调整。这样就能够大大缩短游戏迭代周期,加强游戏的生命力。
实时计算在腾讯的运用:精准推荐(广点通广告推荐、新闻推荐、视频推荐、游戏道具推荐);实时分析(微信运营数据门户、效果统计、订单画像分析);实时监控(实时监控平台、游戏内接口调用)
为了更加精准投放广告,阿里妈妈后台计算引擎需要维护每个用户的兴趣点(理想状态是,你对什么感兴趣,就向你投放哪类广告)。用户兴趣主要基于用户的历史行为、用户的实时查...
- ?
2017大数据版图:大数据、云计算、AI
隐心
展开
请点击输入图片描述
2017年大数据开始进入部署阶段,大数据的炒作逐渐散去,它的应用却正在蓬勃发展,代表成熟度的标志性IPO也正在出现。而大数据在几年前经历的泡沫正在无可争议地转移到人工智能身上,过去几个月AI所经历的共同意识“大爆炸”与大数据当年相比甚至有过之而无不及。
从2013开始制作大数据版图的Matt Turck刚刚发布了最新的2017年大数据版图,我们一起来看看在这个领域有哪些最新趋势和玩家的分布情况。
高层趋势
大数据+AI=新栈
2016年无疑是机器学习之年,任何目睹过众多pitch的VC都应该能感受到这一点,那就是每一家初创企业都成为了“机器学习公司”,“.ai”变成了必备域名,而“等等,可是我们是用机器学习做到这个的”也成为了pitch deck的必备幻灯片。机器学习正在迅速成为许多应用的关键建构块。
相应地,一个新兴的技术栈正在出现,在这个技术栈里面,大数据被用于处理核心的数据工程挑战,而机器学习则用于以分析洞察或者行动的形式从数据中析取出价值。
换言之,大数据提供管道,AI提供智能。当然,这种共生关系已经出现多年,只是能实现这个的目前还不多而已。
但是,现在这些技术开始大众化的普及。“大数据+AI”正在成为众多现代应用(不管是消费者型还是企业型)的默认技术栈。无论是初创企业还是一些财富1000强公司都在利用这一新的技术栈。而且在云巨头的努力下,这个技术栈往往还有云计算这个更基础的建构块的加入,以机器学习云的形式出现。
但是AI的大众化是否就意味着这种技术在短期内能实现商品化呢?现实是AI在技术上仍然非常困难。尽管许多工程师都在争先培养AI技能,但全球这方面的领域专家仍然十分稀缺。
不过这股大众化的趋势已经不可逆转,而机器学习早晚都要从竞争优势演变成桌面筹码。
这对初创企业和大公司都会产生影响。对于初创企业来说,除非你把AI软件做成自己的最终产品,否则的话自我标榜为“机器学习公司”将变得毫无意义。对于大公司来说,如果现在你不积极推进大数据+AI的战略,就会有变得过时的风险。AI已经是下一个风口了。
企业预算:一切向钱看
从2016年的情况来看,财富1000强公司已经在纷纷增加预算用于升级核心基础设施以及分析,其关键的关注点正是大数据技术。分析机构IDC预计大数据和分析市场将从2016年的1300亿美元增长到2020年的超过2030亿美元。
而且财富1000强公司里面的许多买家在大数据技术方面正在变得越来越娴熟、越来越目光敏锐。这些公司过去几年做了很多功课,正在进入全面部署阶段。这种情况不仅发生在技术导向型的公司,在很多行业都是如此。
在大公司每隔几年就要发生的旧技术替代自然周期的推动下,这种情况得到进一步加速。大数据遭遇的环境也从逆风变成了顺风。当然,很多大公司仍然处在大数据部署的早期阶段,但是情况似乎在快速演变。
企业数据向云端迁移
直到几年前,把企业数据迁移到公有云上面对于大公司CIO来说还是不可想象的事情,顶多是在开发环境下或者拿非关键的、面向外部的应用来尝试一下。但现在画风开始有所变化,大家对此的态度似乎变得更加开放了,比方说你会听到这样的说法“不管怎么说我们的客户数据已经放到Salesforce云上面了”,或者“在网络安全方面我们永远也不会有像AWS那么多的预算”。但目前里大多数企业都向公有云迁移还远得很,这部分是因为遗留系统和管制方面的原因。不过云供应商正在竭尽全力来加速这一趋势的转变。比如说AWS甚至可以开卡车来运你的硬盘到云端。
2017年大数据版图
作为对比我们先看看2016年版本:
请点击输入图片描述
2017年版本:
请点击输入图片描述
整合要来了吗?
从上图可看出,这张图已经变得越来越拥挤,那么一个显然的问题来了:行业是否濒临大规模整合的边缘了呢?
似乎还没有。至少目前如此。
首先VC仍然继续乐于给新老公司提供资金扶持。2017年的第一季度成长阶段的大数据初创企业拿到了不少的可观融资,其中包括:Looker(8100万美元D轮),InsideSales (5000万美元F轮),DataRobot (5400万美元C轮),Confluent (5000万美元C轮),Collibra (5000万美元C轮),Uptake (4000万美元C轮),WorkFusion (35M00万美元D轮) and MapD (3500万美元B轮)等。去年12月DataBricks也拿到了6000万美元的C轮。
2016年,大数据初创企业的总融资达到了148亿美元,占到了全球技术风险投资的10%。
其次,自去年的大数据版图推出以来,本领域的并购活动一直在稳步推进,但不是特别显著,其中部分原因也许是未上市公司的估值仍然高企。入选2016大数据版图的公司当中共有41家被收购(完整清单参见附注),这个节奏跟上一年是一致的。
另一方面,2017年刚开始就发生了一些大型的并购事件,其中包括Mobileye(被英特尔以153亿美元收购),AppDynamics(被思科以37亿美元收购),以及Nimble Storage(被HPE以12亿美元收购)。
去年还有一个显著的现象,那就是大型技术公司纷纷收购AI初创企业,尤其是那些解决水平问题、有着很好团队的AI初创企业。其中包括Turi(苹果)、Magic Pony(Twitter)、Viv Labs(三星)、MetaMind(Salesforce)、Geometric Intelligence(Uber)、API.ai(Google)以及Wise.io(GE)。当然,这种现象未必能持续太久,因为对AI的需求太旺盛了,人才实在是不够用了。
第三,一些较大的大数据初创企业羽翼渐丰,正在成为独立的上市公司。Snap无疑引领了技术公司IPO的复兴,但是目前为止是大数据公司借了这股东风。
2016年只有Talend一家大数据公司上市,但2017年大数据公司已经呈现出爆发之势。其中Mulesoft和Alteryx已经上市并且表现不错,而Cloudera也即将上市,其最新估值(41亿美元)与收入(2.61亿美元)之间的差异将延至“独角兽”估值现象的成色。另外,MapR以及定位智能公司Yext也已经在排队等待了。
下一个会是谁呢?也许是Palantir这个超级独角兽。这家多年以来保持神秘的公司已经公开表达了上市的兴趣。其最新估值达到了200亿美元,如果上市的话必将引起轰动。
云大战
虽然大规模并购尚未出现,但业界的另一股趋势值得注意,这就是“功能性整合”,这种现象在云端尤其显著。一些关键的玩家正在通过自研产品和开源计算引擎的实现逐步构建“大数据+AI”的基础构件,面向众多客户群提供其所期盼的“一站式”的服务。
AWS在产品发布的速度和幅度方面继续给人留下深刻印象。目前AWS几乎提供了大数据和AI方面的所有服务,包括分析框架、实时分析、数据库(NoSQL、图谱等)、商业智能以及日益丰富的AI能力,尤其是深度学习方面的能力。按照这种速度发展下去,AWS产品几乎就要把大数据版图的所有的基础设施和分析细分领域都占据了。
加入云大战稍晚的Google一直在积极开发广泛的大数据产品(BigQuery、DataFlow、Dataproc、Datalab以及Dataprep等),并且把AI视为跨越式发展的杀手锏。在AI方面Google去年做了很多事情,包括推出了新的翻译引擎,聘请了李飞飞和李佳领导新成立的Cloud AI and Machine Learning部门,推出了视频识别的机器学习API,并且收购了数据科学家社区Kaggle。
其他大型的IT供应商,比如微软、IBM、SAP、Oracle以及Salesforce等也在努力推出大数据产品(包括云端和本地)。除了技术自研和进行收购以外,这些玩家还越来越重视通过合作来打造生态链,其合作的重点是手上有数据的公司以及有“头脑(AI)”的公司。IBM与Salesforce的合作以及SAP与Google的合作就是值得注意的案例。
用企业IT的行业标准来看,云供应商还比较小,但是其不断膨胀的野心(其中包括从企业栈底层的IaaS向应用发展的企图)与企业数据逐渐向云端迁移的趋势结合,将打开庞大的企业技术市场大门,与传统IT供应商展开激战,而大数据和AI将是核心战场。
2017数据生态体系概览
基础设施
去年的许多趋势今年仍将延续,比如流处理技术,这方面Spark目前是主宰,不过像Flink这样的有趣竞争者正在出现。此外,还有以下一些趋势:
SQL正式回归
在给NoSQL当了10年副手之后,曾经的霸主SQL数据库正式吹响了回归的号角。Google最近发布了Spanner数据库的云端版。Spanner和CockroachDB(Spanner的开源版)都提供了可行的、强一致性的、可伸缩的SQL数据库。Amaozn推出了Athena,跟Snowflake等产品类似,这是一款SQL数据引擎,可直接查询S3下的数据。Google BigQuery、SparkSQL以及Presto等在企业逐渐获得采用——这些都是SQL产品。
数据可视化
与公有云采用相关的一个有趣的趋势是数据可视化。旧的ETL处理需要转移大量的数据(而且往往要建立冗余数据集)并且建立数据仓库,而数据可视化可以在数据保持不动的情况对其进行分析,提高了速度和敏捷性。许多下一代的分析供应商现在都可以同时提供数据可视化和数据准备服务,并让客户可访问存储在云端的数据。
数据治理与安全
随着大数据在企业侧走向成熟,以及数据的多样性和体量的不断发展,像数据治理这样的主题也变得日益重要。许多公司已经选择了“数据湖”作为把所有数据收集起来的手段。但除非你知道里面有什么东西,并且能够访问到合适的数据进行分析,否则的话数据湖再大也没有意义。但是想让用户方便地找到想要的东西同时管理好权限并不容易。除了数据湖以外,治理的另一个集中的主题是以安全的、可审计的方式为任何人提供对可靠数据的便捷访问。Informatica、 Collibra、Alation等大小供应商提供了数据目录、参考数据管理、数据字典以及数据帮助台等服务。
结论
通过大数据与AI的黄金搭档,我们正在进入大数据技术的“收获”阶段。其潜能将非常巨大。随着核心基础设施不断走向成熟,以及在AI推动下应用侧的爆发,2017年的大数据(以及AI)生态体系将开足马力,驶向光明的未来。
- ?
2017年,大数据发展的二十个新趋势
徐不斜
展开
来源:看传媒(ID:iseemedia)
伴随着互联网的深度发展,巨大信息流背后产生的海量数据已成为亟待挖掘的宝藏。2016即将结束,人们已经在期望新一年的大数据会带来哪些新的变化。下面,我们一起来看看2017年大数据发展的二十个新趋势。
“大数据”不再只是一个流行词。弗雷斯特研究公司的研究人员发现,“2016年,近40%的公司在实施大数据技术,并且扩大了采用力度。另有30%的公司计划在未来12个月内采用大数据技术。”
类似的,NewVantage Partners的《2016年大数据高管调查》发现,如今62.5%的公司在生产环境中至少有一个大数据项目,只有5.4%的企业组织没有计划或开展大数据项目。
研究人员表示,采用大数据技术的势头不太可能很快就减慢。IDC主管分析和信息管理的集团副总裁丹·维塞特(Dan Vesset)说:“出现的大量数据、新一代技术,以及数据驱动型决策的文化转变,这些因素继续促使市场需要大数据和分析技术及服务。预计该市场会以11.7%的复合年增长率继续增长,一直持续到2020年。”
虽然大数据市场在增长,但企业组织将如何使用大数据仍不大明朗。新的大数据技术在进入市场,而一些旧技术的使用也在继续增长。
1. 数据量将持续增长
数据量的不断增加意味着通过数据的快速分析获取宝贵的市场洞察已经成为大数据业务运营的关键环节。机构和企业组织必须将其内部未被利用的每一字节的大数据,也就是我们所谓的“黑暗数据”(dark data)加以合理化的整合并转化成可以利用的数据资源。
如果大数据还没有为你的企业带来可供战略参考用的新见解,那么在2017年记得为你所在的企业提出有关大数据的创新计划,只有这样才能提升企业的竞争优势。
2.利用大数据提升客户体验
对于企业的并购,可以将遗留下来的数据资源转交到分包商系统,这种大数据的使用方式除了可以改进消费者体验之外,还可以升级核心系统。
让消费者使用灵活性的自助服务方式可以让大数据分析为企业快速掌握市场发展的主导趋势,还可以为客户需求增长机遇带来更多有竞争力的市场洞察。
利用大数据更深入的了解客户需求可以让搭配销售或者促销活动提高企业的一线财政收入水平,同时还可以免除因客户流失所导致的业绩缩水风险。
3.Hadoop的应用领域将更加广泛
将会有越来越多的企业选择采用Hadoop和其他类型的大数据存贮架构,相应的,分包商们也将为业主提供更加有创新功能的Hadoop解决方案。
当Hadoop架构占据有利地位时,企业使用高级分析方法所处理大量数据可以为盈利决策找到宝贵信息的金矿。
4.预测分析将崭露头角
精准地预测未来可能放生的行为和事件可以提高企业的利润。为降低企业收入风险暴露所使用的欺诈行为快速鉴别和预判技术将会迎来质的飞跃,同时企业运营的卓越性将进一步得到改进。
5.基于云的数据分析将获得更多关注
将数据分析业务迁移到云端可以加速企业采用最新的技术能力,并实现数据资源到行动计划的快速转变。数据分析业务转移到云端之后,企业的运营和技术维护成本也将削减不少。
6.向信息学领域进军并注重数据价值的界定
新的一年,使用信息学助推复杂数据收集、分析与可视化技术的整合可以从数据资源中推导出企业所需的收益来源。从未被充分利用的数据当中提取资源可以提高企业运营绩效。
7.数据可视化将放大商业智能的作用与优势
数据可视化技术让隐藏在大数据资源背后的真相呈现在众人面前。无论数据怎样形成,无论数据资源在哪里,图形数据可视化可以让企业组织在业务繁忙的同时对数据进行检索与处理。
8.物联网、云技术、大数据和网络安全深层融合
数据管理技术,比如说数据质量控制、数据准备、数据分析以及数据整合等方面的融合程度将在新的一年当中达到新的高度。当我们对智能设备的依赖程度增加时,互通性以及机器学习将会成为保护资产免遭网络安全危害的重要手段。
9.提升数字渠道优化与多渠道体验
以客户偏好的渠道与其保持有效接触可以让企业在传统渠道与数字渠道之间找到最佳平衡点。通过不同渠道不断寻求创新手段提高客户体验度可以带来企业的竞争优势。
10.数据准备和分析的自助式服务将提高效率
无论企业数据类型属于结构化、半结构化还是非结构化,自助服务式的数据预备工具可以加速企业数据准备的时间。使用自助式数据技术可以降低企业对开发团队的依赖程度,从而更重视用户的使用感受,同时企业的运营效率也可以提升。
11.开源
Apache Hadoop和Spark等其他开源应用软件已逐渐主导大数据领域,这个趋势看起来可能会保持下去。一项调查发现,到今年年底,近60%的企业预计会在生产环境中运行Hadoop集群。而据弗雷斯特公司声称,Hadoop的使用量以每年32.9%的速度增长。
研究者们表示,2017年,许多企业会加大使用Hadoop和NoSQL技术的力度,并想方设法加快大数据处理速度。许多企业会寻求让自己得以实时访问和响应数据的技术。
12.内存技术
许多公司在调查研究,试图加快大数据处理速度的一项技术就是内存技术。
在传统数据库中,数据存储在配备硬盘驱动器或固态硬盘(SSD)的存储系统中。内存技术改而将数据存储在内存中,这大大提高了数据处理速度。弗雷斯特研究公司的一份报告预测,内存数据架构每年会增长29.2%。
几家厂商提供内存数据库技术,尤其是SAP、IBM和Pivotal。
13.机器学习
随着大数据分析能力不断增强,一些企业已开始投入于机器学习。机器学习是人工智能的一个分支,专注于让计算机可以在没有明确编程的情况下学习新事物。换句话说,它分析现有的大数据存储系统,从而得出可能改变应用程序运行方式的结论。
据Gartner声称,机器学习是2017年的十大战略技术趋势之一。它特别指出,如今最先进的机器学习和人工智能系统正在超越“基于规则的传统算法,构建能够理解、学习、预测、适应,甚至自主操作的系统。”
14.预测分析
预测分析与机器学习密切相关。实际上,机器学习系统常常为预测分析软件提供引擎。在大数据分析的早期阶段,企业组织回顾数据、查看过去发生了什么,然后开始使用分析工具来调查那些事情为何发生。而预测分析更进了一步,它使用大数据分析工具来预测将来会发生什么。
据普华永道在2016年的一项调查显示,如今使用预测分析技术的企业组织数量少得惊人,只有29%。然而,无数厂商最近推出了预测分析工具,随着公司越来越意识到这种功能强大的工具,这个数字在未来几年可能会急剧提高。
15.智能应用程序
企业使用机器学习和人工智能技术的另一种方式就是构建智能应用程序。这种应用程序常常结合大数据分析技术,分析用户以前的行为,以便提供个性化和更好的服务。大家已经非常熟悉的一个例子就是,现在支持许多电子商务和娱乐应用程序的推荐引擎。
Gartner在2017年的十大战略技术趋势中,将智能应用程序列在第二位。Gartner副总裁兼研究员大卫·凯洛莱(David Cearley)说:“在今后十年,几乎每个应用、应用程序和服务都会结合某种级别的人工智能。这会成为一种长期趋势,不断演变,并不断扩大人工智能和机器学习在应用程序和服务的应用范围。”
16.智能安全
许多企业还将大数据分析技术纳入到安全战略中。企业组织的安全日志数据提供了以往网络攻击方面的宝贵信息,企业可以利用这些信息来预测、预防和缓解未来的攻击企图。因而,一些企业组织将安全信息和事件管理(SIEM)软件与Hadoop等大数据平台整合起来。另一些企业求助于提供的产品整合大数据分析功能的安全厂商。
17.物联网
物联网也可能对大数据产生相当大的影响。据IDC在2016年9月的一份报告声称,“31.4%的受访公司已启动了物联网解决方案,另有43%期望在今后12个月部署这类解决方案。”
随着所有那些新设备和应用程序纷纷上网,企业组织会遇到比过去还要疯狂的数据增长势头。许多企业需要新的技术和系统,以便能够处理和解读来自部署的物联网的潮水般的大数据。
18.边缘计算
边缘计算是一种可以帮助公司处理物联网大数据的新技术。在边缘计算中,大数据分析非常靠近物联网设备和传感器来进行,而不是在数据中心或云端来进行。对企业来说,这带来了一些显著的好处。在网络上传输的数据比较少,这可以改善性能,并节省云计算成本。它让企业组织得以删除只在有限的时间内有价值的物联网数据,从而降低存储和基础设施成本。边缘计算还可以加快分析过程,让决策者得以在获得洞察力后比以前更迅速地采取行动。
19.高薪
对IT工人来说,大数据分析技术的发展可能意味着拥有大数据技能的人才方面需求旺盛,薪水优厚。据IDC称:“光在美国,2018年会有181,000个深度分析岗位,是需要数据管理和解读相关技能的岗位数量的五倍。”
由于人才紧缺,Robert Half Technology公司预测,2017年数据科学家的平均薪资将提高6.5%,年薪在116000美元至163500美元。同样,明年大数据工程师的薪资也将提高5.8%,年薪在135000美元至196000美元。
20.自助服务
由于聘请大数据专家的成本上升,许多企业可能寻求让普通专业人员可以满足自己的大数据分析要求的工具。IDC之前预测“可视化数据发现工具的增长速度将比商业智能(BI)市场的其余工具快2.5倍。到2018年,投入于支持最终用户自助服务的这种工具将成为所有企业的要求。”
几家厂商已经发布了拥有“自助服务”功能的大数据分析工具,专家预计这个趋势会持续到2017年及之后。由于大数据分析变得更加融入到公司所有部门的工作人员的工作方式之中,IT部门可能不太参与到这个过程。
来源:《【趋势】2017年大数据领域的十大趋势》,亚联大数据;《重磅推荐 | 2017年大数据发展的十大新趋势》,数据大家。
- ?
零售大数据分析应用的四个阶段
灵阳
展开
中国零售业所面临的最具挑战的竞争,就是顾客和市场需求的纷繁复杂及其飘忽不定的变化。而零售企业成功乃至存活的关键,就是如何采取灵活多变且机智的应对行动,这就要求管理者要能够顺应市场的变化、快速发现并处理问题,并且及时的制定解决方案和抓住市场机会。因此,基于数据和事实,质量更高、速度更快、成本更低的决策显现了前所未有的重要性。
中国零售企业在经历的十几年的信息化高度发展的历程,也积攒了大量的宝贵数据,但面对大数据这个“金矿”,各家企业由于经营模式、管理风格、重视程度、资金投入等不同,对于这个“金矿”的挖掘程度有极大的不同,零售大数据的分析应用均处在不同的阶段,甚至出现的“两极分化”的局面。
下面就是我在日常和零售企业接触的过程所总结出来的零售大数据分析应用的四个阶段,希望能够给大家指明方向。
第一阶段丨集成展示
有句话说的好“销售额首先是追踪出来的,其次才是分析出来的”。
ERP在中国普及进程已经有了10多年历史,没有ERP的企业可谓越来越少。零售企业利用ERP可以搜集和整合整个企业的数据,形成一个完整的数据流,把企业内不同来源的数据信息集中到单一的一个仓库中来,使各个职能在自己需要的时间和地点通过图表看板、计分板的形式看到自己所需要的数据,并且展现出决策者最为关注的运营要素—关键绩效指标如销售额、坪效、利润率、客单价、进店率、转化率、目标完成率、同比增长率等等,这些都可以以“商业报告”的形式出现,该报告的主题紧紧围绕着“过去发生了什么”以及“正在发生什么”而展开,这也是大多数BI系统和数据中心平台的核心功能。
这一阶段的最大的困难为数据的集成和整合,每个零售企业都有数十个大大小小的部门系统,而这些系统都是一个独立的数据源,他们都有自己的定义、标准和侧重,而对这些来源不同数据进行合并、清理、转换和简化,最终建立一致性的数据是非常有挑战性的。
第二阶段丨分析判断
在第一阶段整合了数据来源后,零售业决策者关心的重点发生了转移,从“发生了什么”转向“为什么发生”。分析判断数据的目的是了解数据报表、商业报告的背后的含义,以及这些过往行为发生的动机和原因,这就需要对更加详细的数据进行多维度的分析。这种分析判断更多的是建立在对于零售业务逻辑的理解之上,一般会采用简单有效的分析方法和简便的分析工具对数据进行处理。
该阶段数据分析师这一角色开始真正出现,数据分析师需要非常熟悉业务,最好有实际业务操作的背景,能够用业务的语言和逻辑把运营异常解释的通顺,此阶段不要求对算法、模型和工具的应用非常高深,而对于快速将数据分析结果进行落地,赢取各个业务部门的信任的要求非常高。
例如一个服装品牌的一款裙装销售好的超出预期,那就要找从“人、货、场”三个核心来找原因分析判断火爆原因:
是否有什么买赠、打折、捆绑、支付等促销活动,店员对该商品是否有特殊的推荐等;
该商品的陈列、包装、设计、款式等是否有特色、是否是限量销售、限时特价等等;
以及顾客购买此商品的动机是什么,是否要释放压力、还是从众心理、攀比心态等;
此外,还要考虑竞争对手是否有断货问题、大型企业客户是否有团购等因素,甚至出现了在排除各种原因之后才知道,这款裙装和当时热播电视剧中某个明星穿的比较相似,因电视剧热播而带动了该款裙子的热销,虽然在该款衣服上所投入过多的市场资源其实并不多。
第三阶段丨预测未来
企业在有了前两个阶段的基础之后,关注点会进一步超越当前,开始思考更贴近经营上的问题:“将来会发生什么”。
从本质上说预测就是根据零售企业所过去发生的事件以及当前实时的影响因素,对于销售额、利润率、成本等未来的取值做出自动化和智能化的估计。简单的分析对于估算畅销概率的作用有限,在大多数复杂的应用中,需要建立数学模型来还原零售的业务规律。
例如建立销售预测模型来量化销量的影响因素及各因素之间的交互影响、建立定价优化模型来还原价格与销量之间的关系并找到最科学的价格以实现经营目标。而建立模型的目的就是将之前各个角落里的经验用数学的形式表现出来,虽然并不是十全十美,但会无限逼近真实情况。
要建立数学模型要解决三个问题,首先是数据的量要达到一定的规模和质量;其实是用什么样的算法,如用时间序列还是回归或是人工智能算法;第三是“数据+算法”可以围绕什么业务场景,建立什么样的模型及参数。
例如Google的工程师从众多关于流感的关键词组合中,挑出45个重要检索词条作为特征,训练了一个线性回归模型来预测2007年和2008年流感传播的趋势、时间和地点,该模型预测结果的准确率最后高达97%,而该模型完全可以和关于流感的商品如口罩、营养食品、非处方药品等销售建立起联系,构建“流感商品销售指数”,来指导这些商品在特定时间、地点的具体销售数量。
再例如7-Eleven零售门店通过卫星云图了解到两天后气温将上升两度,会提前订购比平常销量多30%的矿泉水。
第四阶段丨指导决策
这一阶段侧重于对业务、营运、经营、战略的决策的指导,回答的问题其实就是:“我应该做什么”才能达到最佳的状态。前三个阶段都不是终极目的,例如销售预测不是为了预测而预测,预测准确率达到100%又如何,关键是做了预测以后能给企业的决策行为带来什么样的帮助,对于零售企业而言,销售预测以后紧接着的行为就是补货,补货过程中就会涉及到多级库存管理。
而补货行为又驱动了后续的采购、生产、物流、仓储等行为,同时企业的决策层可以根据未来的预测来做出是否要开设渠道、建立工厂、购买仓库等重要战略决策,这些行为的决策都是建立在前三个阶段之上的。同时决策模拟也是这个阶段的重要应用,针对零售流程中的随机因素,引入各种约束条件,构建出若干个相互关联的场景模型来全真模拟真实情景,从而事先预知各种决策可能的结果,提高决策准确性。
大数据时代已经悄然来临,不懂大数据就做不了大生意,未来甚至做不了生意。
我所接触的不少中国零售企业对于大数据的分析应用都处在第一或者第二阶段,也有少数企业如京东、华为处在第三甚至初步进入第四阶段,虽然不少企业所处的阶段还比较低,但是至少有两点让我看到了希望:很多企业的数据基础都很不错,积攒了大量的数据,同时很多零售企业对于大数据应用的意愿和兴趣都非常强烈和热切。
这些企业对于自身的业务也非常的精通,只是受制于算法、人才、技术等对于如何把业务和数据结合在一起产生价值还不甚清楚,但是这些未来都不会成为中国零售企业对于大数据孜孜追求的障碍,因为未来一定会出现大量的第三方公司来提供专业的数据分析、建模和优化服务,帮助企业早日迈入数据驱动决策阶段。
- ?
百度迁徙之后,大数据进入实用阶段
Nyborg
展开
这几天,世界上最大规模的“动物迁徙”运动——中国春运达到最高潮。CCTV“据”说春节专题报道,利用百度迁徙、百度指数等大数据产品宏观、直观地呈现春运这一年度事件。想必大家对去年“百度迁徙”以烟花般绚丽的图层呈现春运大潮依然记忆犹新,今年百度迁徙升级到2.0版,增加了百度天眼、机场热度、车站热度等新的视角,这反映了春运的变迁,背后是大数据技术的升级。
新时代春运:“飞跃”时代到来
随着中国经济高速发展,承载春运的交通工具已从绿皮车升级为高铁、飞机、自驾多种方式,航空这种过去“高大上”的出行方式已成为普通人的选择。根据民航局预测,2015年春运期间,预计全国民航客运量将达到4752万人次,相比去年同期增长8%。
中国的“空中市场”还在不断普及。2014年英国《金融时报》报道,波音副总裁预测中国2033年将取代美国成为世界最大的航空市场,中国在未来20年里购买6000架客机,中国的机队规模将增至现在的3倍。与机队规模增长对应的是,飞行价格的大幅下降:国内机票几百元已常态化,甚至不少航线已低过对应的高铁。另外,机场接驳城市地铁的发达、燃油附加费的下调、机票购买渠道的便捷性都成为飞行这一出行方式普及的推动力。
在越来越多游子们选择“飞回家”的大背景之下,百度迁徙今年特别引入了飞行大数据:透过百度天眼可实时查看航班轨迹,天上有哪些飞机正在飞行、飞到了哪里都一目了然。点击对应飞机和航线还可查看飞机型号、机龄、起降时间、有无晚点等详细信息,甚至可以像机场塔台一样看到飞机经纬度、速度、海拔等数据。百度还借助LBS大数据提供机场热度展示,新闻报道可以根据这一数据了解全国机场人流密集程度,直观呈现春运现象。不论是百度天眼还是机场热度,都将冷冰冰地数字转化为直观的图像呈现在我们眼前。
大数据:多维度交叉运用更具价值
CCTV“据”说春节引入了百度迁徙、百度热力图、百度指数多个大数据产品,全方位详实地报道春节,涵盖春节期间人们的吃穿住行诸多方面。除了春运这个最受关注的迁徙运动之外,让我印象深刻还有一个“中国人对烟花爆竹的态度”报道。
CCTV通过可视化报表呈现了不同区域、不同城市的人们对烟花爆竹的态度,结论是一二三四五六线城市越到后面,对烟花爆竹关注度越高,这说明大城市对烟花爆竹管制更严格,同时也说明民俗在农村、四五六线城市保留更完善。这个可视化报表并不需要像过去那样通过“问卷调查”这么高成本获得,数据来自百度指数,百度指数则是根据用户搜索关键词、用户所处位置这些“大数据”挖掘得到。
如果大家留意到CCTV“据”说春节栏目,对于大数据与我们生活的结合正在日趋紧密相比更有认同感。它可以了解人流整体迁徙特征、不同地段人流分布情况、不同城市人们在关注什么、不同年龄段人们在春节的兴趣,等等。而能够做到这些,就必须要掌握海量用户各种维度的数据。实际上,拥有大数据的企业并不少,比如地图玩家都有LBS数据、腾讯有用户聊天数据、航班管家这类App拥有航线数据、12306则有铁路出行相关数据,但这些玩家要么数据比较单一,要么不具备挖掘的能力。
百度之所以在大数据上能够走得最快,成为CCTV等权威媒体报道的数据来源,核心在于两点:百度拥有多维度的交叉大数据:LBS、搜索、团购等等,并且具备把这些数据关联交叉并进一步挖掘的技术。百度迁徙、百度热力图、百度预测这些产品背后其实都是数据和技术在支撑。
大数据正在从“绚丽”到“实用”阶段
如果看回几年前的“云计算”,不少人都觉得这是噱头、是概念,但现在云存储、云视频、云计算都已成为主流应用。在我印象中,大数据在去年都还被不少人认为是噱头,不过现在它同样已进入了“不再是噱头而是常态”的阶段,人们正在适应大数据与生活的紧密结合。从“百度迁徙”的升级便可对大数据的发展见微知著。
百度迁徙去年推出后,不少人都赞叹:华丽、牛X、炫酷。可以对于它具体能够做什么,还是摸不着头脑。百度官方解释是,它可以直观宏观地呈现人口迁徙情况,对于新闻报道、社科研究、全民科普等具有巨大价值,同时还可以辅助政府和企业更有效地决策,比如规划线路等等。不过这些对于用户而言感受并不直观。今年百度迁徙一个变化就是更加关注,它可以给普通用户带来什么价值。
百度天眼整合航班信息,以可视化方式呈现不说,还可以查询航班起降状态、关注某个航班等翔实信息,在保证产品够酷的同时具备实用性,等于说它做了航班管家在做的事情。常坐飞机的人一定会安装航班管家或者航旅纵横,足以说明航班信息对于航空旅行者的价值。百度车站和机场热力图对于用户规划出行、接送亲友,都有参考价值。百度天眼呈现的实际是整个大数据从“噱头”到“实用”这个变化。
2014年,百度成立专门的大数据实验室,在大数据上动作频频,产品化、大众化、开放化是几个明显的方向。一是预测业务,陆陆续续推出世界杯预测、票房预测、景点预测、高考预测诸多预测业务,并整合预测能力为百度大数据预测评测;二是LBS大数据,百度迁徙一炮走红后,又陆续推出百度热力图、百度天眼等产品,其中热力图可以呈现商圈、景区的人口密度。三是整合能力到大数据引擎推出,让前文提及的具备大数据但无挖掘能力的大中型企业和政府机构可以挖掘手里的数据。大数据成果背后是NLP(自然语言处理)、精准定位技术、大数据模型、深度学习以及GPU机器集群等底层技术在支撑。
显而易见,百度大数据已经从实验室走出来,变成产品、融入产品,走向大众,同时开放给行业。大数据对于百度而言,并不是噱头和炒作。已经成为其核心业务。整个行业对于大数据,也已从“看不懂不理不问、不看清跟风炒作”进入到“试着看跟进学习”这个阶段。我们已经置身大数据世界,被大数据所影响,不论是你是否感知是否承认,你都在为大数据世界贡献着数据和样本,并受益于此。
微博@互联网阿超 微信 罗超 (luochaotmt),扫码来关注:
- ?
学习大数据和人工智能的十大阶段
姜问夏
展开
1.Unix基础
2.python基础
3.数据库SQL
4.前端与移动开发
5.web全栈开发
6.人工智能1(爬虫及搜索)
7.人工智能2(大数据分析)
8.人工智能3(机器学习)
9.人工智能4(深度学习)
10.云计算(PAAS,SAAS,IAAS)
毫无疑问,现在web的开发语言,Java是依然占据主流市场。其次是php,然后还有,python等等。所以,足以见得,在web,前端,全栈中python可能排在5,6,7,8位。但是在数据爬虫过程中,毫无以为python是首屈一指的。
对于云计算来说,目前并没有一个官方的定义。在百度百科中有这样的定义:“现阶段广为接受的是美国国家标准与技术研究院(NIST)定义:云计算是一种按使用量付费的模式,这种模式提供可用的、便捷的、按需的网络访问, 进入可配置的计算资源共享池(资源包括网络,服务器,存储,应用软件,服务),这些资源能够被快速提供,只需投入很少的管理工作,或与服务供应商进行很少的交互。”
大数据是指数据达到或者接近PB量级。大量的数据背后是隐藏着客观规律的。
机器学习实际上就是一种方法,一种算法,是数据背后所体现的一种客观算法。算法虽然是人为创造出来的,但是是人类发现的。
算法,是用大量数学和统计学。一种是监督类的算法,一种是非监督类的算法。分为聚类、分类、回归、推荐、降维
例如,决策树实际上是回归聚类的算法
人工智能,实际上是机器学习的一个应用方向。数据挖掘也是机器学习的一个应用方向。人工智能和技术无关,是一个范式的概念。机器学习中有一个很重要的概念叫拟人。整个机器算法的目的都是为 模拟人类的思维过程,替代人类在生产生活过程中承担的角色。
如果在做数据挖掘和人工智能过程中,数据量很少的情况下是不能称为数据挖掘和人工智能的。很简单是因为不具有普遍性。没有大数据不存在人工智能和数据挖掘。
随着我国不同行业的数据量的储备,把人工智能和数据挖掘这一系列的概念推向风口。
- ?
大数据发展经历的阶段
西德尼
展开
大数据是这个时代最热的话题,仿佛一夜春风来。经过几年的表演,仿佛又成为了烂大街的话题。那么对于我们每个人来说,到底何为大数据?它又跟我们每个人有什么关系呢?接下来我会带领大家一起找寻答案。
首先,有请度娘上场,它给出的定义如下:大数据(big data),指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。
然后是研究机构Gartner。“大数据”是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力来适应海量、高增长率和多样化的信息资产。
最后麦肯锡全球研究所给出的定义是:一种规模大到在获取、存储、管理、分析方面大大超出了传统数据库软件工具能力范围的数据集合,具有海量的数据规模、快速的数据流转、多样的数据类型和价值密度低四大特征。
对比上面三个定义不知道细心的读者是什么感觉,晕?还是抽象?其实从定义中我们不难找出共同的关键字,例如常规、传统、新处理模式、信息资产。
那么我们抽象一下它的定义结构就是:
形容(传统)不能满足+需要(新处理模式)=大数据。
如果觉得还没有描述清晰大数据,我们再加入4v的定义。4v是指Volume(大量)、Velocity(高速)、Variety(多样)、Value(价值)。结构变化如下:
形容(传统)不能满足+需要(新处理模式)=大数据+具有4v特征。
到这里的时候,大家应该对大数据的定义有了一个更加清晰的认识。那么为什么突然就大数据了呢?其是数据一直都在,只不过是记录数据的方式在变化。自古至今我认为可以简单分为四个阶段。
第一个阶段,以前没有IT前我们用书本等记录数据,这个时候受限于采集数据的手段单一、人生产数据的工作效率低以及分享的不便捷性,导致数据单一、量少。这个时候数据的特点是少量、价值密度高。
第二个阶段当有了IT技术后,我们把我们的工作数据和个人数据记录在服务器里面,这也就是信息化。例如银行的业务系统,企业的OA系统等,通过信息化引发的各种工作数据、业务数据开始进入到服务器中。这个时候的数据呈现出业务性特点。
第三个阶段当出现了互联网后,我们的数据开始加大、开始出现分享的文档、图片、视频等数据。这个时候数据开始出现大量、多样性、价值密度低等特点。
第四个阶段也就是我们目前所处的阶段,这其实也是由新技术以及环境的变化引发的现象。物联网的兴起带来了大量的高速的物联数据,例如gps设备、监控心跳和血压等设备。移动互联网导致我们以手机为终端实时产生大量的语音、图片、视频等多样性的数据,例如我们每天用微信聊天沟通,支付等。这个阶段的数据的特点是随时随地产生数据。真正达到了具备4V的特征。
所以说大数据跟我们每个人是息息相关的,你可以回想一下我们每个人每天的场景。我们带的穿戴式设备、用的智能家电、手机等设备,我们每天上下班的乘坐的交通工具,我们进入单位后的打卡数据、工作行为、上网行为、购物行为等。
在这个信息爆炸的时代我们每个人是一台生产数据的机器,全社会上的人都在源源不断地制造数据。这是个万物互联,数据连接的时代。换言之我们每个人都是大数据的缔造者。那么我们理所当然也应成为大数据的受益者,接下来会为大家娓娓道来。
大数据阶段
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并