- ?
盘点丨2017年国内最酷的10家大数据创业公司
Cytheria
展开
【IT168 专稿】导语:IDC发布的预测报告显示,到2021年中国数字经济的比重将达55%。中国的人口和经济规模决定了中国的数据资产规模冠于全球。这不仅为大数据技术的发展提供了演练场,同时也提出了更多、更高的要求。
大数据领域每年都会涌现出大量新的技术,成为大数据获取、治理、存储、分析或可视化的有效手段。而创业公司正在成为大数据技术创新的中坚力量,他们正在不断开发更多更加先进的软件或系统来满足这些大数据需求。
2017年,国内大数据领域就有这样10家创业公司吸引了我们的注意。(排名不分先后)
星环
▲CEO:孙元浩
星环的研发团队是国内最早的大数据Apache Hadoop发行版团队,专注于大数据和人工智能基础平台研发,主打产品一站式大数据综合平台(TDH)和通用人工智能平台Sophon。产品虽然源于Hadoop,但超越了Hadoop,特别是在分析型数据库、流处理技术、大规模分析型搜索引擎以及图形化的大数据开发工具套件方面,已经完全重构。
通过自主研发,星环实现了多项技术的突破, 如基于Hadoop平台构建数据仓库,实现利用Hadoop技术替代传统数据仓库案例;实时计算引擎,融合了低延时的事件驱动机制和复杂批处理编程模型的流处理引擎,支持复杂SQL、CEP复杂时间规则和机器学习,和Spark Streaming相比,星环Slipstream延时低至10ms;大规模搜索引擎,实现PB数量级上秒级延迟,同时具备搜索和统计分析能力。
2017年发布的TDH5.0,让基于容器化进行部署大数据平台成为可能。Sophon支持图形化拖拽式的统计分布式机器学习和深度学习的模型开发以及自动建模。
TDH社区版目前向所有人免费开放,在星环官网或腾讯云上都可以下载使用。
星环成立于2013年,总部位于上海。在Gartner发布的2016版数据仓库及数据管理解决方案市场的魔力象限中,星环是唯一上榜的中国公司。今年10月,在IDC发布的《IDC MarketScape:中国大数据管理平台厂商评估,2017》报告中被评为领导者。
融资方面,2017年5月,星环完成了由腾讯领投的C轮2.55亿融资。 6月在全球著名的第三方评测组织TPC上发布的TPCx-HS10TB测试结果,位列全球第一。
百分点
▲CEO:苏萌
百分点成立于2009年,总部位于北京,是一家大数据与人工智能解决方案提供商。产品线全面涵盖大数据技术、管理、应用各个层面,其核心产品包括技术层的大数据操作系统(BD-OS),管理层的用户画像标签管理系统,以及应用层的推荐引擎、分析引擎和营销引擎。
2017年12月百分点发布Deep Matrix AI决策系统,通过该系统,用户可以进行复杂业务问题的自动识别、判断并做出前瞻或实时决策。
从百分点公开案例数据显示, 国家质检总局凭借这套智能决策系统进行召回判断,由每季度组织十多名专家耗费数百小时的会商制度转变为“1人+机器协同”的实时决策。上线1年,百分点这款产品已经处理了1000多起汽车召回案例,也协助完成了5000多万辆汽车的召回。
在Gartner发布的“2016 China Cool Vendor”评选榜单中,百分点曾作为唯一一家大数据公司入选。2017年,又被APAC CIO Outlook杂志评选为2017年亚太区大数据企业25强。
在融资方面,百分点已完成D轮融资,累计融资额10亿元人民币,创企业级大数据领域融资最高记录。2017年12月29日,百分点还宣布,全资并购在线调研公司极速洞察。
与大部分大数据创业公司业务都在国内不同,百分点还在积极开拓海外市场,其产品在非洲、拉美以及更多国家和地区都有落地。
明略数据
▲CEO:吴明辉
明略数据成立于2014年,总部位于北京,是行业大数据和行业人工智能的解决方案提供商,技术能力较强,无论是大数据还是人工智能,都有自己的核心产品,并由这些产品构成自己的解决方案。
2017年上半年,明略数据发布了行业人工智能大脑“明智系统”,知识图谱数据库“蜂巢”和智能决策支持问答系统“小明”。通过以上产品,用户可以较为容易的构建特定行业领域的知识图谱,并实现人机交互,从而提高企业决策的精度、速度、敏捷度,降低知识劳动力成本。
明略数据核心业务有三个板块:公安、金融、工业。虽然不多,但每一个行业做得都很深, 2017年,明略数据获“德勤—华兴中国明日之星”,其公安情报大数据系统还入选数博会“十佳大数据案例”等。
在融资方面,据了解,明略数据2017年已经完成C轮融资,但并未对外发布,具体金额不详。
天眼查
▲CEO:柳超
天眼查成立于2014年,是一个以公开数据为切入点,以关系为核心的大数据产品平台。其使命是“通过技术让每个人公平地看清这个世界”。
目前,天眼查收录了全国超1.4亿家市场主体,80多种数据维度信息。不仅可以可视化呈现复杂的商业关系,还能深度挖掘和分析相关数据,预警风险等。其核心功能为“查公司”、“查老板”、“查关系”。
天眼查产品能广泛服务于政府机构、泛金融、泛法律、泛商务等领域,应用于金融信贷、风险控制、 项目尽调、商业合作、信用评级、精准决策、客户营销等各类场景。
融资方面,2017年3月,天眼查完成A轮1.3亿人民币融资,这超过了世界上95%的A轮融资额度,也是商业调查工具行业至今最高额度的投资。
神策数据
▲CEO:桑文锋
神策数据成立于2015年,总部位于北京,是一家大数据分析服务公司。主打产品神策分析(Sensors Analytics),是一款用户行为分析产品,主要针对营销渠道效果评估、精细化运营改进、产品功能及用户体验优化、辅助管理层决策等典型业务场景。提供私有化部署和SaaS两种部署方式、实现基础数据采集与建模,并可作为 PaaS 平台支持二次开发。
该公司特色是技术团队对众多开源技术平台进行了重写,如对Impala查询引擎等技术的重构,通过数十万的代码的重写实现了真正海量数据秒级查询,这在国内的大数据领域独树一帜。
神策分析能有效帮助企业用户节省数据团队与业务团队之间的沟通成本与人力成本,同时使一些不具备设立数据团队的创业公司有了自己的数据资产累积平台,从而提升了企业决策效率。
融资方面,2017年,神策数据完成1100万美元B轮融资。
PingCAP
▲CEO:刘奇
PingCAP 是开源的分布式关系型数据库提供商,核心产品 TiDB 是一款定位于在线事务处理/在线分析处理的融合型数据库产品,该产品从根本上解决了传统单机关系型数据库的水平扩展问题。
TiDB 模型参考了 Google 最新的全球分布式数据库 Spanner/F1,具备一键水平伸缩,强一致性的多副本数据安全,分布式事务,实时 OLAP 等特性,同时兼容 MySQL 协议和生态,迁移便捷,运维成本低。
据了解,目前准生产测试用户约 500 余家,其中摩拜单车、同程旅游、360 金融、游族网络,去哪儿网等数十家不同行业的领先企业已经应用在实际生产环境,涉及互联网、游戏、金融、政府、电信、制造业等多个领域,帮助企业解决了海量数据存储、超大规模并发访问及交易问题。
PingCAP 总部位于北京,成立于 2015 年。融资方面,2017 年,PingCAP 完成了 1500 万美元的 B 轮融资;2017年,PingCAP还完成与腾讯云、UCloud 等大型公有云平台深度集成。
爱可生
▲CEO:李恒
爱可生成立于2003年,总部位于上海,定位于开源数据库整体解决方案和行业数据应用。相关数据技术已服务于中国银行、招商银行、中国人保、航天科技、金风科技、中国移动等众多金融、智能制造、电力、电信等行业大型企业。
爱可生的云树产品系列具备自主研发的分布式技术和私有云数据库(RDS)核心技术, 并入围了央采2017年度软件招标名录。 产品满足了金融行业对开源数据库高可用、扩展性、容灾的严苛需求以及金融体系运维体系规范要求。产品已在线上系统中支撑了众多金融等行业的核心交易系统,并支持了数千个开源数据库实例的大体量运维管理。
行业数据应用方面,爱可生基于对智能制造、电力行业等工业互联网场景需求理解,融合结构化和非结构化的数据处理技术,帮助用户建立统一数据管理和服务平台,在多场景下的基于数据的决策或预测模型已形成可落地的解决方案。
融资方面,爱可生是新三板创新层企业,2017年完成了B轮融资,融资金额5065万元,投资方为达晨创投、毅达资本以及创合汇。
2017年,爱可生在“融资中国资本年会”上荣获 “年度最具投资价值新三板公司”。
瀚思科技
▲CEO:高瀚昭
瀚思科技成立于2014年,总部位于北京,是一家大数据安全公司,拥有整套自主研发的基于大数据的信息安全产品,通过以HanSight Enterprise产品为核心的各个产品相互配合、补充,形成完整的信息分析的平台,来满足用户信息安全需要。
基于大数据的安全分析, 机器学习的用户行为分析,深度学习的未知病毒木马检测引擎DeepSense等技术,瀚思科技能大量缩减企业威胁的发现和处置时间,并通过自动化分析处置流程提高威胁分析处理效率,帮助企业降低安全风险。
融资方面,2017年 ,瀚思科技获得国科嘉和、IDG领投资的人民币1亿元B轮融资。
2017年,瀚思科技入围央采2017年度软件招标名单,并连续三季度入选Cybersecurity Ventures2017网络安全全球500强,在入围的中国安全企业中排名第三,同期入围《安全牛》发布的2017中国网络安全企业50强,位列第38位。
SequoiaDB巨杉数据库
▲CEO:王涛
巨杉数据库成立于2011年,总部在广州,是分布式数据库提供商。主要产品有两个:企业级分布式数据库SequoiaDB巨杉数据库,以及分布式企业内容管理软件SequoiaCM。
其核心数据库产品目前实现了分布式OLTP,分布式对象存储以及分布式NoSQL实现全类型数据的覆盖。技术上具备分布式架构、多模数据管理(Multimodel)、标准化数据访问、数据安全双活容灾、与混合负载HTAP等几个重要的技术特性。
巨杉一大特点是坚持自主研发, 其产品在稳定性和企业级支持服务、开发应用友好度、性价比和高可用安全等方面的口碑不错。目前其产品不仅在超过20家银行用户上运行。还拥有近百家的企业用户。
2017年,巨杉数据库入选Gartner数据库报告,这是中国数据库产品的首次入选,一同入选的还有南大通用和阿里云。
据了解,目前,巨杉数据库除了国内市场外还在积极布局海外市场。
热云数据
▲CEO:白冬立
热云数据成立于2013年11月,总部在北京,是一家定位移动互联网领域的第三方大数据服务商。通过精准的人群定位、全面的用户画像及实时的广告效果监测来帮助广告主优化广告投放策略、投放质量、从而节约广告投放成本,提高运营效率。
自主开发了游戏运营支撑平台、防作弊监测技术、移动广告效果监测平台、用户流失预测模型、移动DMP、移动大数据标签系统、渠道数据分析系统等技术产品。
热云数据在数据分析技术方面较为领先,独创的防作弊技术、防刷量和去重等机制,能帮助移动互联网企业在投放过程发现作弊和刷量等点击数据,真实反馈用户的真实行为,减少投放浪费,高效获取真实的用户。
在融资方面,2017年5月热云数据完成B轮1亿元人民币融资。2017年,热云数据还牵头成立了“中国诚信移动广告联盟”-CMAA。
- ?
2017最新架构+大数据课程,java程序员学会可以薪资翻倍了
Ian
展开
互联网架构师+大数据工程师+机器学习与人工智能
第一部分 Java高并发编程
1.Java 线程、锁基础知识
2.深入剖析volatile、synchronized、Lock、AtomicX关键字(一)
3.深入剖析volatile、synchronized、Lock、AtomicX关键字(二)
4.深入剖析java concurrent 包 阻塞队列、ConcurrentMap
5.深入剖析java concurrent包 闭锁、栅栏、交换机、信号量
6.深入剖析java concurrent 包 执行器服务、线程池、Jvm调优
Java程序员还在为涨薪发愁吗?学会这些薪资翻倍
第二部分 分布式系统+Zookeeper + 消息中间件
7.项目简介:Springboot简介入门配置项目准备
8.MariaDB主从安装SpringBoot整合MyBatis配置
9.MyBatis主从实现代码读写分离应用以及实现
10.RocketMQ入门及其使用(一)
11.RocketMQ入门及其使用(二)
12.RocketMQ与项目整合
13.消息可靠性投递和幂等设计与实现
14.Zookeeper Java api 、rmi高可用分布式集群
15.Zookeeper整合RocketMQ代码实现
16.生产、消费平台消息业务场景讲解(一)
17.生产、消费平台消息业务场景讲解(二)
18.项目架构总结
Java程序员还在为涨薪发愁吗?学会这些薪资翻倍
第三部分 分布式搜索引擎
19.课程大纲介绍 elk相关技术栈的介绍
20.搜索引擎相关技术知识
21.Elasticsearch的学习与使用(一)
22.Elasticsearch的学习与使用(二)
23.ElasticSearch, Logstash, Kibana技术栈的学习与使用(一)
24.ElasticSearch, Logstash, Kibana技术栈的学习与使用(二)
25.扩展开源日志组件实现java项目日志与ES结合
26.分布式服务链路跟踪平台设计与代码实现一
27.分布式服务链路跟踪平台设计与代码实现二
28.分布式服务链路跟踪平台设计与代码实现三
29.分布式服务链路跟踪平台设计与代码实现四
30.项目架构总结
Java程序员还在为涨薪发愁吗?学会这些薪资翻倍
第四部分 NIO + Netty高并发编程
31.网络编程的伪异步IO模式、模型概念、原理
32.网络编程的NIO、AIO编程模型讲解
33.通信框架Netty实战部署以及Netty服务讲解
34.Netty的TCP粘包拆包、序列化以及自定义协议
35.Netty实战数据通信以及集群心跳检测服务
36.数据交换项目通信服务场景讲解和环境搭建
37.数据交换项目设计、代码实现(一)
38.数据交换项目设计、代码实现(二)
39.数据交换项目设计、代码实现(三)
40.数据交换项目设计、代码实现(四)
41.数据交换项目设计、代码实现(五)
42.项目架构总结
Java程序员还在为涨薪发愁吗?学会这些薪资翻倍
第五部分 高并发+高可用+微服务分布式互联网架构实战
43.项目简介,SpringCloud简介、作用
44.数据库表结构设计整体项目微服务概述
45.微服务讲解与搭建(一)
46.微服务讲解与搭建(二)
47.微服务讲解与搭建(三)
48.Nginx学习与使用
49.Redis数据类型、JDBC、持久化(AOF+RDB)
50.Redis Transaction事务、pipeline以及优化和Sentinel高可用集群
51.Nginx分离zuul+Redis实现token网关登录认证
52.Activiti工作流核心讲解(一)
53.Activiti工作流核心讲解(二)
54.实现动态工作流事项申请审批流程
55.项目架构总结
Java程序员还在为涨薪发愁吗?学会这些薪资翻倍
第六部分 Hadoop Hive分布式大数据存储与计算
56.Hadoop核心介绍、集群结构、伪分布搭建方案
57.HDFS底层原理、分布式搭建实现方案
58.HDFS中datanode以及namenode详解
59.Hadoop2.x集群搭、HA、集群常见问题以及HA部署
60.Yarn平台详解、HDFS总结
61.MapReduce工作流程、切片机制详解、Shuffle Sort介绍
62.Wordcount实例工作流程介绍、MapReduce总结
63.MapReduce实战案例以及Pagerank算法
64.Hive体系以及集群构建、
65.Hive HiveQL、数据类型、表结构、
66.Hive DML、DDL、select与客户端
67.Hive 自定义函数、Hive与JDBC
68.外部表分区表讲解、Hive优化
69.ZooKeeper集群、数据一致性与Paxos算法和数据模型讲解
70.写操作和ZooKeeper对应关系以及Watcher关系和集群管理
71.大型电商日志以及订单管理项目实战讲解
Java程序员还在为涨薪发愁吗?学会这些薪资翻倍
第七部分 Python与Scala
72.Python基础 注释、逻辑、数据类型等、元组、列表、字典等
73.Python 常见内建函数、函数参数、类与继承网络爬虫案例
74.Python mongodb基础、数据库连接、pip安装模块、
75.Scala语言基础 解释器、变量、常量、数据类型、条件表达式、输入输出
76.Scala 语言 元组、映射、对象、类、包、引入、继承
77.Scala高阶函数、操作符、集合和数据库连接
Java程序员还在为涨薪发愁吗?学会这些薪资翻倍
第八部分 Hbase Spark Kafka Storm分布式实时存储与流式计算
78.HBase数据模型、系统架构、集群构建
79.HBase树形表设计,读、写优化以及案例分析
80.Spark介绍以及与Hadoop和Strom比较、安装
81.Spark中RDD、Transformation、Action以及PageRank
82.Spark缓存策略以及容错处理和宽窄依赖讲解
83.Spark集群构建、任务调度、性能优化以及源码解读
84.Spark Streaming实时计算方案
85.Kafka体系结构、存储策略、分区、发布与订阅
86.Kafka 整合zookeeper协调管理 java scala操作kafka
87.Flume和Storm与Kafka整合
88.Storm集群构建、配置文件以及常见问题解决
89.Storm分组策略以及常用组件和第一个Storm实例
90.Storm整合消息队列、Storm Trident以及整合Hadoop2.x
91.电信基站话务数据实时分析项目讲解
Java程序员还在为涨薪发愁吗?学会这些薪资翻倍
第九部分 分布式数据挖掘、机器学习、人工智能
92.R语言 数据类型、循环、函数使用、
93.SparkMLlib机器学习以及贝叶斯、随机森林算法实现以及互联网平台大数据分析项目项目实战讲解
94.Mahout讲解以及分类、聚类讲解
95.项目实战 微博营销数据挖掘项目以及推送项目讲解
96.项目实战 分布式计算平台、数据采集flume、数据清洗ETL、
97.项目实战数据库 HBase、redis 机器学习Mahout
98.机器学习与TensorFlow
第十部分 搭建企业级分布式云
环境
99.Docker VM、docker对比、系统架构、进程虚拟化 轻量级虚拟化
100.Docker 镜像制作、常用命令、镜像迁移、docker pipework、docker weave
101.KVM 系统架构、适用场景、Qemu、Libvirt、快照、系统扩展及java、Python控制kvm
102.OpenStack 模块和基本原理分析、多节点安装部署、Keystone、glance、cinder、swift、Neutron、 openstack Api二次开发
第十一部分 附加内容
103. 区块链技术
想学习吗? 赶快关注小编吧,每日更新最新视频资料供大家欣赏。
- ?
网站二次开发如何获取更多访问量?秘诀原来是这样!
Rojo
展开
一般说来,一个站长开发了一个网站,无非就是一个目的,就是希望有更多的网民关注自己的这个网站,然后带来更多的流量,从而实现盈利。但是现实并没有想象中那么好的,想要有人关注你的网站,那么你的网站就要建设得好,打开速度要快,所以很有必要进行网站二次开发。今天郑州易美科技网站建设公司小编就给大家说说进行二次开发如何获取更多访问量。
在进行网站二次开发的时候应该要进来做到以下4点:
1、清楚的展示你的关键内容
进行网站二次开发的中心是产品,那么将自己的主营模块提炼给客户,并能清楚的展示才华获得用户好感,一样网站有必要具有特征(我们所谓的特征不是特效和一起,而是我们对网站有必定的格式“也便是所谓的视界”)和比赛的优势,这样读者才会对你的网站进行分析点评,然后会获得收获,千万不要想着坐收渔利,或许因为怕麻烦或许想到了疑问没有去执行,那么你终将被筛选。失利至少有两大原因:底子没初步和没能坚持下去。
就像前面说的一样,要条件对自己的网站进行包括网站的构思的来历、比赛环境和比赛战略分析等方面要认真细致的概括评述,要经过自评让别人先得益再支付,千万不要盼望别人会无条件的满足你。
2、一个适宜用户阅读的网站结构
网站结构必定要简洁明了,目录结构不能过于凌乱,不管用户从引擎端仍是首页拜访而来,都应当能快速的查询到自己想了解的有关信息。
3、及时交流工具
不要想着客户会很情况,会甘愿给您打电话,网站缔造到终究推广出去,许多客户担忧咨询浪费电话费而毕竟抛弃,只是大略的查看下您的产品信息便离开了,所以我们要供给用户最方便的沟通东西,让他即便能了解产品的功能和特征。终究完成客户对您其他产品的重视和长期协作的希望。
4、一个心旷神怡的页面设计
首要我们用漂亮、时尚、特性来选择网站这个非常首要,一个具有自己文明特征的公司站,也就意味着网站计划的时分有必要赋有构思,不要盼望读者对着千人一面的网站会有爱好去点评,因为互联网太大,一抓一大把,您的网站太过于普通只会让用户直接疏忽,没有影响。
好了,以上就是郑州易美科技网站建设小编为大家介绍的关于进行网站二次开发如何获取更多访问量介绍,从上文中可以很清楚地看到,要想网站二次开发可以吸引更多网民的话,那么就应该要做到4个内容,缺少一个都是不行的。郑州易美科技通过网络大数据驱动营销,对营销过程进行精细管理,帮助中小企业进行网络营销时真正落地,彻底告别噱头、盲目与粗放式的网络营销。突破网络营销瓶颈,开启全网营销新格局,让企业真正赢在互联网!
- ?
大数据构架师从入门到精通学习必看宝典
等你老
展开
经常有初学者在博客和QQ问我,自己想往大数据方向发展,该学哪些技术,学习路线是什么样的,觉得大数据很火,就业很好,薪资很高。如果自己很迷茫,为了这些原因想往大数据方向发展,也可以,那么我就想问一下,你的专业是什么,对于计算机/软件,你的兴趣是什么?是计算机专业,对操作系统、硬件、网络、服务器感兴趣?是软件专业,对软件开发、编程、写代码感兴趣?还是数学、统计学专业,对数据和数字特别感兴趣。
其实这就是想告诉你的大数据的三个发展方向,平台搭建/优化/运维/监控、大数据开发/ 设计/ 架构、数据分析/挖掘。请不要问我哪个容易,哪个前景好,哪个钱多。
分享之前我还是要推荐下我自己创建的大数据学习交流Qun531629188无论是大牛还是想转行想学习的大学生小编我都挺欢迎,今天的已经资讯上传到群文件,不定期分享干货,包括我自己整理的一份最新的适合2018年学习的大数据教程,欢迎初学和进阶中的小伙伴。
先扯一下大数据的4V特征:
数据量大,TB->PB
数据类型繁多,结构化、非结构化文本、日志、视频、图片、地理位置等;
商业价值高,但是这种价值需要在海量数据之上,通过数据分析与机器学习更快速的挖掘出来;
处理时效性高,海量数据的处理需求不再局限在离线计算当中。
现如今,正式为了应对大数据的这几个特点,开源的大数据框架越来越多,越来越强,先列举一些常见的:
文件存储:Hadoop HDFS、Tachyon、KFS
离线计算:Hadoop MapReduce、Spark
流式、实时计算:Storm、Spark Streaming、S4、Heron
K-V、NOSQL数据库:HBase、Redis、MongoDB
资源管理:YARN、Mesos
日志收集:Flume、Scribe、Logstash、Kibana
消息系统:Kafka、StormMQ、ZeroMQ、RabbitMQ
查询分析:Hive、Impala、Pig、Presto、Phoenix、SparkSQL、Drill、Flink、Kylin、Druid
分布式协调服务:Zookeeper
集群管理与监控:Ambari、Ganglia、Nagios、Cloudera Manager
数据挖掘、机器学习:Mahout、Spark MLLib
数据同步:Sqoop
任务调度:Oozie
眼花了吧,上面的有30多种吧,别说精通了,全部都会使用的,估计也没几个。就我个人而言,主要经验是在第二个方向(开发/设计/架构),且听听我的建议吧。
第一章:初识Hadoop
1.1 学会百度与Google
不论遇到什么问题,先试试搜索并自己解决。Google首选,翻不过去的,就用百度吧。
1.2 参考资料首选官方文档
特别是对于入门来说,官方文档永远是首选文档。相信搞这块的大多是文化人,英文凑合就行,实在看不下去的,请参考第一步。
1.3 先让Hadoop跑起来
Hadoop可以算是大数据存储和计算的开山鼻祖,现在大多开源的大数据框架都依赖Hadoop或者与它能很好的兼容。
关于Hadoop,你至少需要搞清楚以下是什么:
Hadoop 1.0、Hadoop 2.0
MapReduce、HDFS
NameNode、DataNode
JobTracker、TaskTracker
Yarn、ResourceManager、NodeManager
自己搭建Hadoop,请使用第一步和第二步,能让它跑起来就行。建议先使用安装包命令行安装,不要使用管理工具安装。另外:Hadoop1.0知道它就行了,现在都用Hadoop 2.0.
1.4 试试使用Hadoop
HDFS目录操作命令;上传、下载文件命令;提交运行MapReduce示例程序;打开Hadoop WEB界面,查看Job运行状态,查看Job运行日志。知道Hadoop的系统日志在哪里。
1.5 你该了解它们的原理了
MapReduce:如何分而治之;HDFS:数据到底在哪里,什么是副本;
Yarn到底是什么,它能干什么;NameNode到底在干些什么;Resource Manager到底在干些什么;
1.6 自己写一个MapReduce程序
请仿照WordCount例子,自己写一个(照抄也行)WordCount程序,
打包并提交到Hadoop运行。你不会Java?Shell、Python都可以,有个东西叫Hadoop Streaming。如果你认真完成了以上几步,恭喜你,你的一只脚已经进来了。
第二章:更高效的WordCount
2.1 学点SQL吧
你知道数据库吗?你会写SQL吗?如果不会,请学点SQL吧。
2.2 SQL版WordCount
在1.6中,你写(或者抄)的WordCount一共有几行代码?给你看看我的:
SELECT word,COUNT(1) FROM wordcount GROUP BY word;
这便是SQL的魅力,编程需要几十行,甚至上百行代码,我这一句就搞定;使用SQL处理分析Hadoop上的数据,方便、高效、易上手、更是趋势。不论是离线计算还是实时计算,越来越多的大数据处理框架都在积极提供SQL接口。
2.3 SQL On Hadoop之Hive
什么是Hive?官方给的解释如下:The Apache Hive data warehouse software facilitates reading, writing, and managing large datasets residing in distributed storage and queried using SQL syntax.
为什么说Hive是数据仓库工具,而不是数据库工具呢?有的朋友可能不知道数据仓库,数据仓库是逻辑上的概念,底层使用的是数据库,数据仓库中的数据有这两个特点:最全的历史数据(海量)、相对稳定的;所谓相对稳定,指的是数据仓库不同于业务系统数据库,数据经常会被更新,数据一旦进入数据仓库,很少会被更新和删除,只会被大量查询。而Hive,也是具备这两个特点,因此,Hive适合做海量数据的数据仓库工具,而不是数据库工具。
2.4 安装配置Hive
请参考1.1 和 1.2 完成Hive的安装配置。可以正常进入Hive命令行。
2.5 试试使用Hive
请参考1.1 和 1.2 ,在Hive中创建wordcount表,并运行2.2中的SQL语句。
在Hadoop WEB界面中找到刚才运行的SQL任务。看SQL查询结果是否和1.4中MapReduce中的结果一致。
2.6 Hive是怎么工作的
明明写的是SQL,为什么Hadoop WEB界面中看到的是MapReduce任务?
2.7 学会Hive的基本命令
创建、删除表;加载数据到表;下载Hive表的数据;请参考1.2,学习更多关于Hive的语法和命令。
如果你已经按照《写给大数据开发初学者的话》中第一章和第二章的流程认真完整的走了一遍,那么你应该已经具备以下技能和知识点:
MapReduce的原理(还是那个经典的题目,一个10G大小的文件,给定1G大小的内存,如何使用Java程序统计出现次数最多的10个单词及次数);
HDFS读写数据的流程;向HDFS中PUT数据;从HDFS中下载数据;
自己会写简单的MapReduce程序,运行出现问题,知道在哪里查看日志;
会写简单的SELECT、WHERE、GROUP BY等SQL语句;
Hive SQL转换成MapReduce的大致流程;
Hive中常见的语句:创建表、删除表、往表中加载数据、分区、将表中数据下载到本地;
从上面的学习,你已经了解到,HDFS是Hadoop提供的分布式存储框架,它可以用来存储海量数据,MapReduce是Hadoop提供的分布式计算框架,它可以用来统计和分析HDFS上的海量数据,而Hive则是SQL On Hadoop,Hive提供了SQL接口,开发人员只需要编写简单易上手的SQL语句,Hive负责把SQL翻译成MapReduce,提交运行。
此时,你的”大数据平台”是这样的:那么问题来了,海量数据如何到HDFS上呢?
第三章:把别处的数据搞到Hadoop上
此处也可以叫做数据采集,把各个数据源的数据采集到Hadoop上。
3.1 HDFS PUT命令
这个在前面你应该已经使用过了。put命令在实际环境中也比较常用,通常配合shell、python等脚本语言来使用。建议熟练掌握。
3.2 HDFS API
HDFS提供了写数据的API,自己用编程语言将数据写入HDFS,put命令本身也是使用API。
实际环境中一般自己较少编写程序使用API来写数据到HDFS,通常都是使用其他框架封装好的方法。比如:Hive中的INSERT语句,Spark中的saveAsTextfile等。建议了解原理,会写Demo。
3.3 Sqoop
Sqoop是一个主要用于Hadoop/Hive与传统关系型数据库,Oracle、MySQL、SQLServer等之间进行数据交换的开源框架。就像Hive把SQL翻译成MapReduce一样,Sqoop把你指定的参数翻译成MapReduce,提交到Hadoop运行,完成Hadoop与其他数据库之间的数据交换。
自己下载和配置Sqoop(建议先使用Sqoop1,Sqoop2比较复杂)。了解Sqoop常用的配置参数和方法。
使用Sqoop完成从MySQL同步数据到HDFS;使用Sqoop完成从MySQL同步数据到Hive表;如果后续选型确定使用Sqoop作为数据交换工具,那么建议熟练掌握,否则,了解和会用Demo即可。
3.4 Flume
Flume是一个分布式的海量日志采集和传输框架,因为“采集和传输框架”,所以它并不适合关系型数据库的数据采集和传输。Flume可以实时的从网络协议、消息系统、文件系统采集日志,并传输到HDFS上。
因此,如果你的业务有这些数据源的数据,并且需要实时的采集,那么就应该考虑使用Flume。
下载和配置Flume。使用Flume监控一个不断追加数据的文件,并将数据传输到HDFS;Flume的配置和使用较为复杂,如果你没有足够的兴趣和耐心,可以先跳过Flume。
3.5 阿里开源的DataX
之所以介绍这个,是因为我们公司目前使用的Hadoop与关系型数据库数据交换的工具,就是之前基于DataX开发的,非常好用。
可以参考我的博文《异构数据源海量数据交换工具-Taobao DataX 下载和使用》。现在DataX已经是3.0版本,支持很多数据源。你也可以在其之上做二次开发。有兴趣的可以研究和使用一下,对比一下它与Sqoop。
第四章:把Hadoop上的数据搞到别处去
Hive和MapReduce进行分析了。那么接下来的问题是,分析完的结果如何从Hadoop上同步到其他系统和应用中去呢?其实,此处的方法和第三章基本一致的。
4.1 HDFS GET命令
把HDFS上的文件GET到本地。需要熟练掌握。
4.2 HDFS API
同3.2.
4.3 Sqoop
同3.3.使用Sqoop完成将HDFS上的文件同步到MySQL;使用Sqoop完成将Hive表中的数据同步到MySQL。
4.4 DataX
同3.5. 如果你认真完成了上面的学习和实践,此时,你的”大数据平台”应该是这样的:
如果你已经按照《写给大数据开发初学者的话2》中第三章和第四章的流程认真完整的走了一遍,那么你应该已经具备以下技能和知识点:
知道如何把已有的数据采集到HDFS上,包括离线采集和实时采集;你已经知道sqoop(或者还有DataX)是HDFS和其他数据源之间的数据交换工具;你已经知道flume可以用作实时的日志采集。
从前面的学习,对于大数据平台,你已经掌握的不少的知识和技能,搭建Hadoop集群,把数据采集到Hadoop上,使用Hive和MapReduce来分析数据,把分析结果同步到其他数据源。
接下来的问题来了,Hive使用的越来越多,你会发现很多不爽的地方,特别是速度慢,大多情况下,明明我的数据量很小,它都要申请资源,启动MapReduce来执行。
第五章:快一点吧,我的SQL
其实大家都已经发现Hive后台使用MapReduce作为执行引擎,实在是有点慢。因此SQL On Hadoop的框架越来越多,按我的了解,最常用的按照流行度依次为SparkSQL、Impala和Presto.这三种框架基于半内存或者全内存,提供了SQL接口来快速查询分析Hadoop上的数据。关于三者的比较,请参考1.1.
我们目前使用的是SparkSQL,至于为什么用SparkSQL,原因大概有以下吧:使用Spark还做了其他事情,不想引入过多的框架;Impala对内存的需求太大,没有过多资源部署。
5.1 关于Spark和SparkSQL
什么是Spark,什么是SparkSQL。
Spark有的核心概念及名词解释。
SparkSQL和Spark是什么关系,SparkSQL和Hive是什么关系。
SparkSQL为什么比Hive跑的快。
5.2 如何部署和运行SparkSQL
Spark有哪些部署模式?
如何在Yarn上运行SparkSQL?
使用SparkSQL查询Hive中的表。Spark不是一门短时间内就能掌握的技术,因此建议在了解了Spark之后,可以先从SparkSQL入手,循序渐进。
关于Spark和SparkSQL,如果你认真完成了上面的学习和实践,此时,你的”大数据平台”应该是这样的。
第六章:一夫多妻制
请不要被这个名字所诱惑。其实我想说的是数据的一次采集、多次消费。
在实际业务场景下,特别是对于一些监控日志,想即时的从日志中了解一些指标(关于实时计算,后面章节会有介绍),这时候,从HDFS上分析就太慢了,尽管是通过Flume采集的,但Flume也不能间隔很短就往HDFS上滚动文件,这样会导致小文件特别多。
为了满足数据的一次采集、多次消费的需求,这里要说的便是Kafka。
6.1 关于Kafka
什么是Kafka?Kafka的核心概念及名词解释。
6.2 如何部署和使用Kafka
使用单机部署Kafka,并成功运行自带的生产者和消费者例子。使用Java程序自己编写并运行生产者和消费者程序。Flume和Kafka的集成,使用Flume监控日志,并将日志数据实时发送至Kafka。
如果你认真完成了上面的学习和实践,此时,你的”大数据平台”应该是这样的。
这时,使用Flume采集的数据,不是直接到HDFS上,而是先到Kafka,Kafka中的数据可以由多个消费者同时消费,其中一个消费者,就是将数据同步到HDFS。
如果你已经按照《写给大数据开发初学者的话3》中第五章和第六章的流程认真完整的走了一遍,那么你应该已经具备以下技能和知识点:
为什么Spark比MapReduce快。
使用SparkSQL代替Hive,更快的运行SQL。
使用Kafka完成数据的一次收集,多次消费架构。
自己可以写程序完成Kafka的生产者和消费者。
从前面的学习,你已经掌握了大数据平台中的数据采集、数据存储和计算、数据交换等大部分技能,而这其中的每一步,都需要一个任务(程序)来完成,各个任务之间又存在一...
- ?
大数据平台云化的「从0到1」
青阳玲
展开
大数据的时代已经来临,到底什么是大数据,大数据技术如何和企业运营结合起来?读完本文,你会有新的答案。
本文为青云QingCloud 大数据平台研发工程师迟连义在 青云QingCloud 实践课堂·南京站中的演讲总结而来,他以《大数据平台的应用化、场景化及服务化实践》为议题,分享了青云QingCloud 大数据平台的整体架构及每个组件的应用场景,大数据产品云化的过程中的经验、青云 AppCenter 2.0 的整体结构和功能特性以及青云QingCloud 大数据平台未来的发展规划。全文5320字,建议阅读时间13分钟.
青云QingCloud 大数据平台架构
上图详细介绍了青云QingCloud 大数据平台目前的整体架构。分层来看:输入端的数据源,可以是企业的用户浏览记录数据、电商平台的交易数据、视频用户的浏览记录、播放时长记录等数据。这些数据会接入到存储或者计算单元进行分析。
在整个过程中需要有一个缓冲区去缓冲数据。青云QingCloud 提供了主流的 Kafka 分布式消息队列服务来满足这一需求,它的优点是:以订阅和发布模式有效地解耦了输入端与输出端,可以实现即使只有一次输入,输出端也可以多次消费,彼此之间不会发生影响。
在存储层,青云QingCloud 提供 MongoDB 非关系型数据库。MongoDB 是最接近关系型数据库的非关系型数据库,它可以提供类 SQL 的访问模式,并且提供 HBase,一个可以承载海量数据存储的分布式数据库。HBase 有一个特点,只能通过 RowKey 进行检索,但它能够保证每行很好的一致性访问,同时具备很好的读写性能,如果不想把数据存在数据库里面,青云QingCloud 还提供了 HDFS 和对象存储服务。HDFS 本身是针对于大文件进行设计的,在处理小文件的时候它会有一些问题。小文件同样会在 HDFS namenode 里面占一块内存,如果小文件过多就会导致 namenode 的内存性能受到一定影响。同时,在后续做数据分析的时候,小文件过多会导致 MapRuduce 中的 Map 数量过多,整体分析过程会很慢。相比之下,对象存储则会对小文件做一些优化,所以如果需要处理大量小文件,存储到对象存储里面是更好的选择。
从数据本地化的角度来看,如果经常要进行计算,还是采用本地化的存储计算会更快,因为从对象存储取数据会通过公网。从成本角度来说,存在 HDFS 内会比存在对象存储上成本稍高。青云QingCloud 是对数据进行分层分类,如果需要处理的是一些历史数据,不需要经常进行查询和分析,可以放在对象存储上,而对于一年内经常进行分析和查询可以放在 HDFS 上。
在数据计算层,青云QingCloud 提供了实时数据处理 Storm 和准实时处理的 Spark (包括Spark Streaming)。同时提供了 Hadoop MapReduce 及 Hive 等离线批处理工具。在服务协调方面,提供 Zookeeper 服务,Zookeeper 是一个非常通用的功能,很多大数据组件,如 HBase、Kafka 等都依赖于 Zookeeper,很多企业用户也会基于 Zookeeper 开发自己的服务协调。
Elasticsearch,常用于企业内部的日志查询及分析。除了 Elasticsearch 集群,青云QingCloud 还提供一个 ELK 套件,囊括了从日志收集、日志检索到分析结果最终展现的全过程的功能套件,青云QingCloud 还提供了 Redis 和 memcached 两个非常通用的缓存工具。
大数据管理平台
上图列出了比较主流的大数据工具,但有一个问题,这些大数据工具彼此之间都是独立的。比如:Storm 有自己的一套监控 UI,监控拓扑的执行情况以及是否存在延迟等。在 Hadoop 中,HDFS 也有一套自己的 UI,可以监控每一个 namenode 节点的状况和文件的情况。那么,如果一个企业用了很多大数据组件,一定需要一个统一的平台把所有大数据组件管理起来,青云QingCloud 提供了这样一个大数据管理平台,可以把该平台理解成一个 UI,把所有大数据组件囊括其中。
该平台根据开源 Hue 做的二次开发,支持直接 Hive 查询,结果可以通过图表展现出来,也可以提交 Spark SQL、Spark Shell 等。还可以将关系型数据库,如 MySQL,放进来统一管理。在 Job 方面,可以直接用 Oozie 进行调度,也能直接看到 MapReduce Job 目前的运行情况,包括刚才提到的 Storm 拓扑的管理,以及 Zookeeper 节点信息展现。
在储管层面,对 HDFS 及 QingStor 对象存储,都提供了数据路径的监控及展示页面,HBase 可以在管理平台上面直接做 Shell 查询,也可以看到表的信息等等。Kafka, 可以清楚展示 topic 的信息,和每个 Kafka Group 对某个 topic 的消费情况。
大数据产品云化瓶颈
在对这些应用进行运化开发的过程中,青云QingCloud 也遇到了一些问题,会影响到以后大数据平台的扩展。主要这三个方面:
第一个是大数据发展太快,各个领域存在很多竞品。比如在列式数据库方面,青云QingCloud 提供了 HBase,但还有 Canssandra。在离线计算方面,还有比 Hive 快很多倍的 Impala 这些工具目前青云QingCloud 还没有放到云平台上。另外,在一些特有领域,如 AI,区块链,机器学习,深度学习方面,如容器应用领域,这些应用都还没有集成到青云QingCloud 的大数据平台上。这些领域的产品非常多,但青云QingCloud 的精力有限,这是遇到的第一个挑战。
第二个挑战是云化周期长。以青云QingCloud 的经验要云化一个大数据产品,把大数据产品真正放到 QingCloud 上,作为一个云原生应用大约需要两到三个月的时间。首先要搭建一个整体开发测试环境,要把大数据应用的一些自带的东西放在开发设计环境里面去,同时开发人员要对青云的 API,包括生命周期管理体系都要有一定的了解。在开发过程中,撰写针对云平台生命周期管理的代码,之后还要开发应用监控、报警等功能,最后经过测试,需对接云平台内的计费、工单等等这些系统,最终做成一个独立的应用。
第三个是挑战产品间的组合非常复杂。比如,目前青云QingCloud 的 Hadoop 和 HBase 是独立提供的。 如果一个用户要想一键部署一个 Hadoop + HBase 的集群,青云QingCloud 就需要按第二点提到的开发流程重新做一个新的产品发布出来。这样子导致组件间的组合特别复杂。
同时,青云QingCloud 还需要一种服务之间的自动发现能力。比如:Kafka 是依赖于 Zookeeper 的,如果在一个部署的 ZooKeeper 集群中添加或删除一个节点,Kafka 集群需要手动修改与 ZooKeeper 的链接地址。青云QingCloud 希望这一过程是自动的,自动感知变化并作出修改 。
面对这三个挑战,最终青云QingCloud 找到了比较好的解决方案,就是青云QingCloud 的 AppCenter 2.0。首先产品特别多,而青云QingCloud 自身精力有限。但是青云QingCloud 可以联合一些技术能力很强的开发伙伴,让他们可以基于青云QingCloud 去便捷地开发云化一些大数据产品。做到这点的关键是需要提供一套很方便开发的手段,降低开发难度。
AppCenter 2.0 提供了一套模版化的开发流程,大幅降低开发难度。同时,AppCenter 2.0 也把主要的功能,如应用生命周期管理,监控告警,工单系统,计费等等全部抽象出来,以标准化的形式交付出来,最终把整个应用的开发周期从几个月降低到了几周,这也解决了第二个开发周期长的挑战。
青云QingCloud AppCenter 2.0 简介
青云QingCloud AppCenter 2.0 是什么样的平台?
首先,AppCenter 2.0 是一个经过高度抽象,可以部署各种分布式应用的平台。青云QingCloud 知道分布式应用整体架构多种多样的,比如: ZooKeeper 是 peer to peer 架构; Hadoop 是主从架构; Redis cluster 是分片式的。AppCenter 2.0 会对这些不同的架构做高度的抽象,把应用整个生命周期抽象出来,然后开发者只需用类似自然语言的方式在模版中进行修改,表明应用需要在生命周期的不同阶段,做哪些动作从而完成整个开发流程。这种高度抽象使云上的应用开发和交付变的异常的简便和标准化,它是以模版的形式提供给开发者。
其次,AppCenter 2.0 是全新的云操作系统,贯穿资源与应用平台。青云QingCloud 可以把 IaaS 理解成对物理资源的虚拟化,可以类比成现在用的 PC 机。实际上最终用户在使用 PC 机时用到的是上层的软件应用,在 PC 机和软件之间还有一定的距离,需要一个东西去调动 PC 机中的各种资源,这个东西就是操作系统。
AppCenter 2.0 实质上就是架构在 IaaS (云平台) 层上的操作系统,操作系统会提供很多接口,让开发者在青云QingCloud 操作系统上开发各种各样的应用,最终提供给最终用户去使用。
AppCenter 2.0 架构图
上图为 AppCenter 2.0 的整体架构图,主要分三块:开发者控制台、用户控制台以及调度系统(中间部分)。首先,开发者控制台:开发者可以通过这里创建一个应用及不同的版本,然后基于每个版本,分别创建配置文件,其中会描述需要被定义的信息,如环境变量、集群节点的可选个数、每一个节点角色需要的 CPU 和内存配置等。
同时还要在模版文件中完整定义整个应用的生命周期。之后将配置文件打成一个压缩包并在开发者控制台提交,之后青云QingCloud 人员会进行审核,对应用进行详细的测试,看它的监控报警是否有完善等等。当青云QingCloud 觉得该应用符合标准,会批准开发者进行发布。应用发布之后,在用户控制台,最终用户便可以看到它的应用。如果用户对该应用感兴趣,就可以进行安装和部署。
用户部署以后会真正的进入调度系统的处理范围。青云QingCloud 调度系统首先会在用户需要中创建一个元数据管理服务,基于一个 3 节点的集群,对最终用户是免费开放。然后会根据最终用户的选择,创建相应数量的节点,CPU 核数,内存容量及存储空间等资源。
在AppCenter 中, 这些资源是支持 KVM、Docker、及 LXC 三种架构。创建好资源后,这些资源的元数据信息会被注册到元数据管理集群。之后在资源管理层面会启动一个 confd,它相当于一个 agent,会时刻监控元数据管理服务中注册进去的元数据。如果这些元数据发生变化,那么会触发由开发者定义好的要执行命令,后者更新配置文件等各类操作。
接下来,调度系统会负责整个应用的生命周期管理,包括创建、扩容、关闭或启动等等这些操作。同时调度系统还会周期性地调用由开发者定义的一系列管理操作,如监控、健康检查等等。
接下来青云QingCloud 详细看一下 AppCenter 2.0 的功能和技术特性。上图显示的是开发者需要提供的一些模板文件,比较重要是这几个第一个 config.json,主要用来配置应用的 UI,其中定义了最终用户在前端需要看到的一些信息,如该应用可以选择多少核的 CPU,多少容量的内存,每一类节点橘色可以创建多少个节点。
因为很多应用对节点数量是由限制的:Hadoop 集群,salve 节点的数量最少需要 3 个;像 ZooKeeper 集群,节点数量一般都是奇数个的。对于这样的限制,都可以在在模版文件中具体的进行配置。
Json 文件最终的效果会是,青云QingCloud 通过预置好的统一的 UI 界面,把 json 文件中的各项配置在前端提供给最终用户。然后是 cluster.json.mustache,该文件实际上定义了整个应用的基础架构。
基础架构包括定义应用中需要哪些类型或角色的节点,如 Hadoop 集群中会分三种不同角色的节点,而针对每一个节点的角色,开发者需要定义其完整的生命周期管理以及监控报警。生命周期管理刚才有提到,包括如横向扩容和纵向扩容等等操作。
开发者要通过 cluster.json.mustache 模版文件,告诉调度系统需要执行哪些操作,需要执行主机里面哪些脚本,那么调度系统在生命周期到来的时候,会触发这些脚本的执行。
接下来是监控报警功能,这一点在青云QingCloud 审核过程中,会强制要求每一个应用必须存在。因为作为一个云应用,监控和报警很重要,在客户业务出现问题的时候,他需要了解到底是业务出现问题还是产品出现问题。
最后一个是多语言翻译功能,青云QingCloud 提供的是英文,最终用户其实想看到一些中文展示,开发者需要定义一个多语言翻译的文件,告诉青云QingCloud 它的行业变量和角色对应的中文是什么样的名字,青云QingCloud 会最终展示在界面上。
以上这张图就是一个上传配置文件的界面,开发者在创建应用和版本以后,并完成以上的两个配置文件的撰写后,就在该位置提交,并发布版本。之后会现在后台通过青云QingCloud 的审核。青云QingCloud 现在的审核比较严格,因为青云QingCloud 要对最终用户负责,开发者对应链接到控制台测试,测试一下配置文件写的是否合理,测试生命周期管理,并测试监控报警是否合理。
以上介绍的是 AppCenter 2.0 的一些基本功能,可以帮助开发者通过模板文件的方式很便捷地在运平台上开发一个自己的应用。还有一个比较高级的功能,就是应用编排。通过元数据管理集群以及 Confd 这两者之间的交互,可以实现应用之间的自主感知。举例来说,Kafka 需要依赖 ZooKeeper,那么如果 ZooKeeper 集群发生了增加或删减节点的变化,Kafka 集群是可以感知到该变化,并自动执行配置文件更新和重启集群等操作。
另外一个例子是上文提到的大数据平台管理 UI 系统。该 UI 在启动的时候通过应用间自主感知能力,可以感知到用户的 VPC 下面已经使用了哪些大数据产品,之后可以自动将大数据产品添加到管理 UI 里面去,而且后续如果在同一个 VPC 下,...
- ?
什么叫大数据分析
雨莹
展开
大数据行业发展如火如荼,国家政策利好,互联网大佬纷纷在大数据行业布局,我们想让自己的职业生涯在一个朝阳行业发展,肯定又要学习相关技术,让自己与时俱进,但是难就难在大数据是一个新兴事物,目前我国大学的专业里面还鲜少有这个专业,国家刚批的大数据专业,全国目前35个高校,但是从17年开始招生,2021年才有第一批毕业生进入职场,在四年期间,是大数据行业发展的飞速时期,没有行业发展是等着人才进入的,而是需要要虚位以待、蓄势待发,所以在没有高等教育准备好的大数据教育,如何高效的学习大数据,如何快速的与行业发展想契合,那么需要我们成为第一个吃螃蟹的人,作为一个随着大数据行业成长的职业人,首先要知道大数据是个啥?
大数据(big data),指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。
那来帮大家分析下:如何高效的学习大数据。
经常有初学者会问,自己想往大数据方向发展,该学哪些技术,学习路线是什么样的,觉得大数据很火,就业很好,薪资很高……首先,如果你确定了想往这个方面发展,先考虑自己的过去从业经历、专业、兴趣是什么。计算机专业——操作系统、硬件、网络、服务器?软件专业——软件开发、编程、写代码?还是数学、统计学专业——对数据和数字特别感兴趣?
那么你能找师傅带吗?
但凡有这种想法的人,或多或少都会存有侥幸之心,或者叫做“天真,单纯”。希望不花一分钱,就能更快速的学到更优质,更实用的技能。
关于这一点,我只想反问一句你:“如果你是大师,你凭什么愿意带我?”
其实这就是想告诉你大数据的三个发展方向,平台搭建/优化/运维/监控、大数据开发/设计/架构、数据分析/挖掘。
先说一下大数据的4V特征:
数据量大,TB->PB
数据类型繁多,结构化、非结构化文本、日志、视频、图片、地理位置等;
商业价值高,但是这种价值需要在海量数据之上,通过数据分析与机器学习更快速的挖掘出来;
处理时效性高,海量数据的处理需求不再局限在离线计算当中。
现如今,正式为了应对大数据的这几个特点,开源的大数据框架越来越多,越来越强,先列举一些常见的:
文件存储:Hadoop HDFS、Tachyon、KFS
离线计算:Hadoop MapReduce、Spark
流式、实时计算:Storm、Spark Streaming、S4、Heron
K-V、NOSQL数据库:HBase、Redis、MongoDB
资源管理:YARN、Mesos
日志收集:Flume、Scribe、Logstash、Kibana
消息系统:Kafka、StormMQ、ZeroMQ、RabbitMQ
查询分析:Hive、Impala、Pig、Presto、Phoenix、SparkSQL、Drill、Flink、Kylin、Druid
分布式协调服务:Zookeeper
集群管理与监控:Ambari、Ganglia、Nagios、Cloudera Manager
数据挖掘、机器学习:Mahout、Spark MLLib
数据同步:Sqoop
任务调度:Oozie
······
第一步:初识Hadoop
1.1 学会百度与Google
不论遇到什么问题,先试试搜索并自己解决。
Google首选,翻不过去的,就用百度吧。
1.2 参考资料首选官方文档
特别是对于入门来说,官方文档永远是首选文档。
相信搞这块的大多是文化人,英文凑合就行,实在看不下去的,请参考第一步。
1.3 先让Hadoop跑起来
Hadoop可以算是大数据存储和计算的开山鼻祖,现在大多开源的大数据框架都依赖Hadoop或者与它能很好的兼容。
关于Hadoop,你至少需要搞清楚以下是什么:
· Hadoop 1.0、Hadoop 2.0
· MapReduce、HDFS
· NameNode、DataNode
· JobTracker、TaskTracker
· Yarn、ResourceManager、NodeManager
自己搭建Hadoop,请使用第一步和第二步,能让它跑起来就行。
建议先使用安装包命令行安装,不要使用管理工具安装。
另外:Hadoop1.0知道它就行了,现在都用Hadoop 2.0.
1.4 尝试使用Hadoop
· HDFS目录操作命令;
· 上传、下载文件命令;
· 提交运行MapReduce示例程序;
· 打开Hadoop WEB界面,查看Job运行状态,查看Job运行日志。
· 知道Hadoop的系统日志在哪里。
1.5了解它们的原理
MapReduce:如何分而治之;
HDFS:数据到底在哪里,什么是副本;
Yarn到底是什么,它能干什么;
NameNode到底在干些什么;
ResourceManager到底在干些什么;
1.6 自己写一个MapReduce程序
仿照WordCount例子,自己写一个(照抄也行)WordCount程序,
打包并提交到Hadoop运行。
不会Java的话,Shell、Python都可以,有个东西叫Hadoop Streaming。
如果能认真完成了以上几步,恭喜你,你的一只脚已经进来了。
第二步:更高效的WordCount
2.1 学点SQL吧
如果不懂数据库的童鞋先学习使用SQL句。
2.2 SQL版WordCount
在1.6中,你写(或者抄)的WordCount一共有几行代码?
如果用SQL的话:
SELECT word,COUNT(1) FROM wordcount GROUP BY word;
这便是SQL的魅力,编程需要几十行,甚至上百行代码,SQL一句就搞定;使用SQL处理分析Hadoop上的数据,方便、高效、易上手、更是趋势。不论是离线计算还是实时计算,越来越多的大数据处理框架都在积极提供SQL接口。
2.3 安装配置Hive
Hive算是数据仓库工具,安装不难,网上有很多教程,配置完成后,可以正常进入Hive命令行。
2.4 试试使用Hive
尝试在Hive中创建wordcount表,并运行2.2中的SQL语句。在Hadoop WEB界面中找到刚才运行的SQL任务。看SQL查询结果是否和1.4中MapReduce中的结果一致。
明明写的是SQL,为什么Hadoop WEB界面中看到的是MapReduce任务?
2.5 学会Hive的基本命令
创建、删除表;加载数据到表;下载Hive表的数据;并学习更多关于Hive的语法和命令。
0和Hadoop2.0的区别
MapReduce的原理(还是那个经典的题目,一个10G大小的文件,给定1G大小的内存,如何使用Java程序统计出现次数最多的10个单词及次数);
HDFS读写数据的流程;向HDFS中PUT数据;从HDFS中下载数据;
自己会写简单的MapReduce程序,运行出现问题,知道在哪里查看日志;
会写简单的SELECT、WHERE、GROUP BY等SQL语句;
Hive SQL转换成MapReduce的大致流程;
Hive中常见的语句:创建表、删除表、往表中加载数据、分区、将表中数据下载到本地;
从上面的学习,你已经了解到,HDFS是Hadoop提供的分布式存储框架,它可以用来存储海量数据,MapReduce是Hadoop提供的分布式计算框架,它可以用来统计和分析HDFS上的海量数据,而Hive则是SQL On Hadoop,Hive提供了SQL接口,开发人员只需要编写简单易上手的SQL语句,Hive负责把SQL翻译成MapReduce,提交运行。
第三步:把别处的数据搞到Hadoop上
此处也可以叫做数据采集,把各个数据源的数据采集到Hadoop上。
3.1 HDFS PUT命令
put命令在实际环境中也比较常用,通常配合shell、python等脚本语言来使用。建议需熟练掌握。
3.2 HDFS API
HDFS提供了写数据的API,自己用编程语言将数据写入HDFS,put命令本身也是使用API。
实际环境中一般自己较少编写程序使用API来写数据到HDFS,通常都是使用其他框架封装好的方法。比如:Hive中的INSERT语句,Spark中的saveAsTextfile等。
可以尝试了解原理,试着写几个Demo。
3.3 Sqoop
Sqoop是一个主要用于Hadoop/Hive与传统关系型数据库Oracle/MySQL/SQLServer等之间进行数据交换的开源框架。
就像Hive把SQL翻译成MapReduce一样,Sqoop把你指定的参数翻译成MapReduce,提交到Hadoop运行,完成Hadoop与其他数据库之间的数据交换。
自己下载和配置Sqoop(建议先使用Sqoop1,Sqoop2比较复杂)。
了解Sqoop常用的配置参数和方法。
使用Sqoop完成从MySQL同步数据到HDFS;
使用Sqoop完成从MySQL同步数据到Hive表;
PS:如果后续选型确定使用Sqoop作为数据交换工具,那么建议熟练掌握,否则,了解和会用Demo即可。
3.4 Flume
Flume是一个分布式的海量日志采集和传输框架,因为“采集和传输框架”,所以它并不适合关系型数据库的数据采集和传输。Flume可以实时的从网络协议、消息系统、文件系统采集日志,并传输到HDFS上。因此,如果你的业务有这些数据源的数据,并且需要实时的采集,那么就应该考虑使用Flume。
下载和配置Flume。使用Flume监控一个不断追加数据的文件,并将数据传输到HDFS;
PS:Flume的配置和使用较为复杂,如果你没有足够的兴趣和耐心,可以先跳过Flume。
3.5 阿里开源的DataX
之所以介绍这个,是因为以前某公司客户目前使用的Hadoop与关系型数据库数据交换的工具,就是之前基于DataX开发的,个人感觉非常好用。现在DataX已经是3.0版本,支持很多数据源。你也可以在其之上做二次开发。
PS:有兴趣的可以研究和使用一下,对比一下它与Sqoop。
至此,你的“大数据平台”应该是这样的:
第四步:把Hadoop上的数据搞到别处去
前面介绍了如何把数据源的数据采集到Hadoop上,数据到Hadoop上之后,便可以使用Hive和MapReduce进行分析了。那么接下来的问题是,分析完的结果如何从Hadoop上同步到其他系统和应用中去呢?
其实此处的方法和第三步基本一致的。
4.1 HDFS GET命令
把HDFS上的文件GET到本地。需要熟练掌握。
4.2 HDFS API
原理同3.2。
4.3 Sqoop
原理同3.3。
使用Sqoop完成将HDFS上的文件同步到MySQL;
使用Sqoop完成将Hive表中的数据同步到MySQL;
4.4 DataX
原理同3.4
此时,“你的大数据平台”应该是这样的:
走完第三步和第四步的流程,那么你应该已经具备以下技能和知识点:
· 知道如何把已有的数据采集到HDFS上,包括离线采集和实时采集;
· 知道sqoop(或者还有DataX)是HDFS和其他数据源之间的数据交换工具;
· 知道flume可以用作实时的日志采集;
至此,对于大数据平台,应该已经掌握如何搭建Hadoop集群,把数据采集到Hadoop上,使用Hive和MapReduce来分析数据,把分析结果同步到其他数据源。
接下来的问题就是,Hive使用的越来越多,你会发现很多不愉快的地方,特别是速度慢,
大多情况下,明明我的数据量很小,它都要申请资源,启动MapReduce来执行。
第五步:快一点吧,我的SQL
其实大家都已经发现Hive后台使用MapReduce作为执行引擎,实在是有点慢。因此SQL On Hadoop的框架越来越多,按我的了解,最常用的按照流行度依次为SparkSQL、Impala和Presto.这三种框架基于半内存或者全内存,提供了SQL接口来快速查询分析Hadoop上的数据。
目前我们的方案使用的是SparkSQL,至于为什么用SparkSQL,原因大概如下:
· 使用Spark还做了其他事情,不想引入过多的框架;
· Impala对内存的需求太大,没有过多资源部署;
5.1 关于Spark和SparkSQL
什么是Spark,什么是SparkSQL。
Spark有的核心概念及名词解释。
SparkSQL和Spark是什么关系,SparkSQL和Hive是什么关系。
5.2 如何部署和运行SparkSQL
Spark有哪些部署模式?
如何在Yarn上运行SparkSQL?
使用SparkSQL查询Hive中的表。
PS:Spark不是一门短时间内就能掌握的技术,因此建议在了解了Spark之后,可以先从SparkSQL入手,循序渐进。
第六步:一夫多妻制
其实我想说的是数据的一次采集、多次消费。
在实际业务场景下,特别是对于一些监控日志,想即时的从日志中了解一些指标(关于实时计算,后面步节会有介绍),这时候,从HDFS上分析就太慢了,尽管是通过Flume采集的,但Flume也不能间隔很短就往HDFS上滚动文件,这样会导致小文件特别多。
为了满足数据的一次采集、多次消费的需求,这里要说的便是Kafka。
6.1 关于Kafka
Kafka是一种高吞吐量的分布式发布订阅消息系统,它可以处理消费者规模的网站中的所有动作流数据。这种动作(网页浏览,搜索和其他用户的行动)是在现代网络上的许多社会功能的一个关键因素。这些数据通常是由于吞吐量的要求而通过处理日志和日志聚合来解决。
6.2 如何部署和使用Kafka
使用单机部署Kafka,并成功运行自带的生产者和消费者例子。
使用Java程序自己编写并运行生产者和消费者程序。
Flume和Kafka的集成,使用Flume监控日志,并将日志数据实时发送至Kafka。
至此,“大数据平台”应该扩充成这样:
这时,使用Flume采集的数据,不是直接到HDFS上,而是先到Kafka,Kafka中的数据可以由多个消费者同时消费,其中一个消费者,就是将数据同步到HDFS。
总结:
为什么Spark比MapReduce快。
使用SparkSQL代替Hive,更快的运行SQL。
使用Kafka完成数据的一次收集,多次消费架构。
自己可以写程序完成Kafka的生产者和消费者。
前面的学习已经掌握了大数据平台中的数据采集、数据存储和计算、数据交换等大部分技能,而这其中的每一步,都需要一个任务(程序)来完成,各个任务...
- ?
空间大数据时代,我们需要什么样的数据管理平台
空虚
展开
地理信息数据管理现状
大数据为地理信息行业带来了全新机遇,伴随大数据技术的发展,获取地理信息的各种新技术也在不断涌现。传统的地理信息采集是专业任务,强调几何精确性,测绘遥感是主要的采集手段。而大数据地理信息采集手段更为丰富和自由,传感器网络、个体出行过程、网络行为、消费记录等均可能成为大数据地理信息采集手段。这些地理数据具有体量大、来源广、多样化、多时项、多尺度、高维度、高复杂性和非结构化特点。
目前,各行业用户拥有的地理数据普遍存在着数据分散、重复布局、更新维护困难等情况,严重影响到数据资源的共享、开发、利用。用户迫切需要一款数据管理平台,帮助自己实现海量数据资源的统一管理与维护。
‘安徽·天地图’政务版平台数据管理经验
安徽基础测绘信息中心应用捷泰天域睿图数据库管理系统建立了一套“高效、灵活、实用”的数据资源管理平台,完成了安徽省天地图“母库”库体建设,实现了全省基础矢量数据、影像数据、地名地址数据、三维数据、街景数据、瓦片数据等各类数据资源的高效管理和可视化应用,提高了中心数据资源管理水平与成果应用效能。
系统平台建立了灵活、可配置的数据查询体系,实现了数据查询、统计、提取的一体化;建立了融合数据与母库数据同步机制,形成母库与融合数据的良性互补,减少了重复建设;采用众筹思维模式,建立了需求牵引的快速同步更新机制,通过迭代方式快速更新产品库热点区域数据,然后与母库同步更新,从而完善、提高母库数据质量。
专业数据管理平台——睿图数据库管理系统
捷泰天域为了解决当前海量数据管理难题,推出睿图数据库管理系统,是以空间对象为主体的地理信息综合管理系统,以数据模型为核心,采用插件式开发框架,实现对基础地理信息数据、专题数据、影像数据、文档资料等各类数据的统一组织和有效管理。支持数据模型定制,可以根据实际情况跟随业务进行调整;支持开发定制,满足各种类型地理信息数据库的快速搭建和定制扩展。
用户仅需使用极低的成本,即可获得地理信息数据资源的统一存储和高效管理。捷泰天域数据库管理系统帮助用户实现数据资源的统一管理、更新、维护、分发、共享,使数据更好的为业务应用和数据挖掘提供支撑。
产品的核心价值包括以下几个方面:
数据资源一体化管理
为用户提供从数据质检、数据建库、数据更新到数据查询、数据展示、数据分发、数据共享全流程的一体化管理,减少用户进行数据管理、查找、更新、维护工作量。
灵活的数据建模能力
产品采用数据模型组织管理数据资源,用户可根据需要建立相应的数据模型。模型具备可扩展性,满足未来用户数据管理内容扩展的需要。
高效检索,快速、精确定位
用户无需担忧如何从海量的数据中快速获得到想要的那份数据,首先,产品采用ElasticSearch智能高效检索技术,提升海量数据的检索效率;其次,产品提供多种检索方式,包括空间检索、元数据检索、空间与元数据组合检索等,帮助用户快速、精确的找到需要的数据。
要素级更新能力
产品具备要素级更新能力,支持要素级更新数据的历史管理。帮助用户实现要素级的历史回溯。
提供二次开发接口
产品具备定制开发能力,用户可以通过库管产品提供的二次开发接口,结合自己的业务需求进行二次开发扩展。
目前睿图数据库管理系统产品已面向政府、企事业单位和各行业各层面用户提供了专业的数据管理解决方案,并且产品已服务于时空信息云平台大数据管理、天地图母库管理、大数据中心建设等多个应用领域。
- ?
数据商业化的司法保障——评首例大数据产品不正当竞争案
冯采梦
展开
文 / 王琼飞
垦丁网络法 首席专家
近年来大数据产业蓬勃发展并影响到各行各业,发挥了越来越重要的价值。但由于在数据方面的立法相对缺失或模糊,使得数据各利益关联方的权益处于不安定状态,极大制约了数据产业的发展。数据产业呼唤有保障的可预期的法律营商环境,而杭州互联网法院最近的一个判决为此提供了一个突破创新的司法解决方案。
2018年8月16日,杭州互联网法院对淘宝诉美景公司利用技术手段非法共享 “生意参谋”零售电商数据一案进行判决,确认淘宝公司对大数据产品“生意参谋”数据享有竞争性财产权益,美景公司非法共享行为构成不正当竞争。
该案对数据产业具有重大指引作用。数据产业要发展,数据要发挥价值,必须要厘清几个基本的问题:网络运营者可以收集数据吗?应当如何收集?可以共享给他人使用吗?应当如何共享?可以进行二次开发吗?开发的大数据产品的权益归属?竞争者也来获取数据,法律能制止吗?
而互联网法院的判决,在一定程度上对上述问题进行了回答,特别是对大数据产品的权益归属从司法层面首次进行了明确。具体而言,该案厘清了网络运营者收集、使用、共享、开发用户数据的行为边界,同时第一次开创性地确认了网络运营者对其合法收集的用户数据进行二次开发而形成的大数据产品享有竞争性财产权益。该判决为行业划定了数据方面的游戏规则,平衡各方利益并解决数据贡献者的后顾之忧,这将使得数据产业的参与各方的积极性被极大调动,数据生产、开发、利用环节的各方利益得到司法保障,推动整个产业步入良性发展。
来具体看看该判决的亮点以及对行业的影响:
- ?
Hadoop二次开发项目案例方案汇总
幼枫
展开
转载自百家号作者:电商大兵
大数据Hadoop应用开发技术正可谓如火如荼推进中,以为大数据已经不仅仅是局限在互联网领域,而是已经被上升到了国家战略的高度层面。大数据正在深刻影响和改变我们的日常生活和工作方式。
Hadoop应用开发太过偏底层,难度之大真不是我们一般人所能够理解的。有的人会说,不都是倒腾代码吗?有什么难的!如果真是这样想,那就真的完蛋了。做hadoop底层的开发,真不是一般人和一般的企业就能够去做的。问个超级简单的问题,你知道的网络公司多,还是做大数据hadoop开发的公司多?估计没几个人知道做大数据hadoop开发的公司有哪些吧?
Hadoop起源于国外,所以说国内的Hadoop应用开发起步是落后国外很多的。这也就导致了Hadoop开发中的很多游戏规则我们也只能遵从别人已经制定好的玩了。虽然说国内的Hadoop开发起步晚,但总算是有一些企业在做的。比如国产手机界扛把子的华为,还一直默默的在做底层开发的大快搜索!华为的大数据解决方案主要是满足自主产品的需求,好像目前不对外的吧!
当然,国内做Hadoop开发的不是只有这两家了。国内做Hadoop开发的公司以二次包装为主,做Hadoop原生态开发的至少我知道的也就是上面刚才说的大快搜索是在做的。感兴趣的可以搜索找一下大快搜索推出的国产发行版dkhadoop,应该还是可以申请拿一个玩一下的!
Hadoop二次开发的应用案例比较多,简单的介绍几个Hadoop二次开发的应用方案案例:
1、首先是在政务方面的应用:政务大数据平台解决方案——推行电子政务、建设智慧城市等为抓手,以数据集中和共享为途径,推动技术融合、业务融合、数据融合,打通信息壁垒,形成覆盖全国、统筹利用、统一接入的数据共享大平台,构建全国信息资源共享体系,实现跨层级、跨地域、跨系统、跨部门、跨业务的协同管理和服务。
Hadoop二次开发2、企业级大数据处理平台——这是针对大型企业或者行业,如果是一般的小企业就没有必要了。
Hadoop二次开发3、城市智慧停车解决方案——智慧城市建设的重要组成部分,前些时候分享过一个大快搜索的城市智慧停车云平台解决方案,感兴趣的可以看一下!
Hadoop二次开发上述这个三个Hadoop二次开发的应用案例可以说是目前比较典型的三种了。码字就码到这里吧,感兴趣的可以自己去查一下这方面的。大快搜索的网站上这三个案例的方案有详细的介绍,还有一些其他的方面的案例介绍,不妨可以看看!
- ?
大数据产品应用层—数据可视化
Hayley
展开
数据可视化是什么?数据可视化——借助于图形化手段,清晰有效地传达与沟通信息同时对数据进行交互分析。
为什么需要数据可视化?数据可视化可以将海量数据通过图形、表格等形式直观反映给大众。降低数据读取门槛,可以让企业通过形象化方式对自身产品进行营销。由于人类大脑在记忆能力的限制,所以我们利用视觉获取的信息量多于感官,在大数据与互联网时代,企业从传统的流程式管理方式过渡到基于数据的管理方式将会成为必然的趋势,数据可视化能够帮助分析的人对数据有更全面的认识。
数据可视化的常见形式圆环图——展示组合数据所占比
雷达图——多变量可视化图形
折线图——同一事物不同阶段的变化
热力图——用户使用情况统计
数据可视化常见方法数据采集数据是可视化对象,可以通过仪器采样,调查记录、模拟计算等方式采集。在可视化解决方案中,了解数据来源采集方法和数据属性,才能有的放矢解决问题。数据处理和变换原始数据含有噪音和误差同时数据模式和特征往往被隐藏。通过去噪、数据清洗、提取特征等变换为用户可理解模式。请可视化映射(核心)将数据的数值、空间坐标、不同位置数据间的联系等映射为可视化视觉通道的不同元素如标记、位置、形状、大小和颜色等。最终让用户通过可视化洞察数据和数据背后隐含的现象和规律。用户感知用户感知从数据可视化结果中提取信息、知识和灵感。数据可视化可用于从数据中探索新的假设,也可严重相关假设与数据是否吻合,还可帮助专家向公众展示数据中的信息。
数据可视化市场分析优秀的数据可视化讲究场景应用,结合数据分析逻辑,制定高效决策。好的数据可视化的体验,是通过美好有效的表达更好的分享和传达数据信息。数据可视化给大数据的各种实践落地提供了检验依据,大量枯燥的数据可以通过数据合理的数据可视化实践,得以落地且容易被用户感知。大数据的绝大部分应用都将以可视化的形式呈现,可视化信息表、H5、视频、动态应用等等。目前整个数据可视化大致可以分为两个方向:注重展示,注重分析。
数据可视化行业应用当前用户普遍存在的个性化需求,通过产品表象,我们都需要与数据紧密话,把数据当作一个解决问题的角色,通过数据本身的交互探索一些未知的方向及创新的点子。根据当前市场需求,开创云合作过多个大数据类产品,基本是提供全平台数据统一、二次开发简单、定制化需求等。现有的数据可视化产品已涉猎的领域有:互联网、零售快消、电商、O2O、餐饮、金融、医疗和教育等众多行业。如下展示几个优秀案例加以说明:o2o指动生活
我们画像服务的架构:数据源包括基础日志、商家数据和订单数据。数据完成处理后存放在一系列标签页中,同时我们会对整个业务流程实施监控。主要分为两部分,第一部分是对数据处理流程的监控,利用用内部自研的数据治理平台,监控每天各标签页产生的时间、数据量以及数据分布是否有异常。第二部分是对服务的监控。目前画像系统支持的下游服务包括:广告、排序、运营等系统。开创云智慧餐饮
为了能全面让商户了解和分析经营情况,我们固化了十多个常用“视角”:分别包括:订单分析、周订单分布、月订单分布、菜品销量分析、流量分析、用户跨平台分析、用户平台对比、配送分析、评价词云。其中的每一个仪表盘,都能拆分出不同的表格,以做便于详细对比。其中的每一个仪表盘,都能拆分出不同的表格,并提供不同的切片、切块视图,配备了全局筛选(主要是时间和平台)可以对整个仪表盘内的图做同一控制。如订单分析就包含了:订单量、平台订单对比、分平台订单量。
结语数据可视化的发展,将改变传统的管理方式,让数据的呈现更及时、更直观、更简单。让数据的管理更客观,针对性更强。简单粗暴一点来说,未来有数据、有分析的地方就有就有可视化的需求,当大数据的处理技术逐步发展的同时,可视化可以承载让用户更容易阅读和理解的工作,辅助大数据的神秘,让用户体验更佳!
二次开发大数据
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并