- ?
云计算工程师分享:你所不知的云计算与大数据运维工程师大揭秘
收藏
展开
分享:你所不知的云计算与大数据运维工程师大揭秘--由成都达内小编分享给大家
2018年转眼即逝,在这半年里,各种大会铺天盖地,频频听到身边发问“近几年的运维大会真多呀”的朋友也越来越多。Linux运维及云计算仿佛成为了跟Web开发和平面设计一样的火爆岗位。
我们知道Linux诞生于1991年,那个时候“马云”还是一名教书匠,OICQ(QQ早期产品)的概念还没有出来,更不用提百度是什么了。那个时候的互联网在美国,而中国的互联网真正开始是从2000开始,百度,阿里,网易,搜狐等国内现在大家耳熟能详的老牌公司也均是那个时代的产物,时至今日依然影响着广大民众生活的方方面面,而且已然成为民众生活的“水”和“电”。
虽人们享受着当日送货上门的便利,亲朋好友千里之外流畅视频通话的温情,人类的吃穿住行及所能想像的任何物件背后都直接或间接基于Linux,却鲜有人知道:
Linux是什么?
运维是干什么的?
运维?网管?修电脑的?
现在手机在手,就能干很多事情,只需点一点屏幕,轻松完成聊天、娱乐、甚至支付功能。这些操作看似简单,但其背后,有一系列复杂请求和响应。而在阿里、百度等这些互联网巨头的机房里,就有千上万台服务器,为你服务请求提供服务的。这些服务器中,95%以上,是Linux系统、或类Linux系统。
从行业来划分:通信、金融、互联网、教育、电子商务、机械制造、军工航天、电器业等等,都离不开Linux平台。
远的不讲,近的来讲,马云的双十一。最大的变化诸位剁手的朋友印象应该很深,不再需要漫长的等待,就能拿到自己心仪的货品,最快的次日就已经拿到货品了。这背后少不了大数据的帮忙,而所有的这些均是基于Linux之上,而这只是ITLinux的冰山一角,在应用层面提出来“互联网+”的概念,大数据成为人类的资源,Linux的前景不言而喻。
运维工程师是干嘛的?
一句话概括:负责线上业务稳定,基于Linux平台集合网络、应用、数据库、开发、安全工作于一身的“复合性人才”。 就运维行业来讲,能力越大,责任越大,你有多大的能耐就有多大回报,平均年薪在10万+,动辄100w年薪也是常有的是,只要你够努力。
看看大公司的平台运维架构是什么样的?
搜狐畅游运维的演变:
苏宁大数据平台:
腾讯游戏智能运维平台:
稳定压力一切,运维很重要!
- ?
卓豪OpManager助力贵州移动建设大数据中心运维管理平台
hjh_h
展开
近年来,贵州将大数据产业作为转型升级、加快发展的战略重点,以大数据引领产业升级,促进新一代信息技术与三次产业融合发展。在贵州大数据产业的宏伟蓝图中,中国移动(贵州)大数据中心可谓是一颗璀璨夺目的明珠。
项目背景:
贵州移动大数据中心共有花溪、金阳和贵安三个省级数据机房,对内支撑贵州省移动公司所有业务,对外提供IDC存储、云计算等服务;机房拥有刀箱、刀片、虚拟化、网络安全等数量庞大的基础设施,需要一套综合运维管理系统对所有设施进行全方位的监控和管理,以保证移动业务的正常运行和高标准IDC服务的要求。
项目概述:
经过充分的调研,贵州移动最终选择卓豪数据中心运维管理解决方案,实现对网络设备、服务器、虚拟化、进程服务、存储、告警、网络拓扑等全面监控和管理。
其中,在网络监控方面:
通过卓豪OpManager网络监控模块,对贵州移动花溪、金阳和贵安三个数据中心的基础网络设施进行监控,系统采用独立部署模式,通过一套系统监控三个数据中心的所有网络、安全设备,对其设备性能进行监控、对链路通断和流量进行分析告警;在设备性能超标、链路中断和流量满载情况下及时报警通知管理人员;形成三个IDC数据中心的机房拓扑图和贵州移动IDC机房总拓扑图,通过逻辑拓扑图实时呈现IDC机房网络运行情况。
在机房设施监控方面:
通过卓豪Applications Manager性能监控模块,对贵州移动三个IDC机房的机房基础设施进行监控,整体思路是从3个方向去实现IDC机房整体监控:
第一:从底层的IBM刀箱、刀片的处理器、磁盘状态、LED告警灯状态、主板等物理性能指标的监控,到其上运行的VMware虚拟化集群、主机等的CPU、内存、流量、容量等性能指标再到虚拟机的CPU、内存、磁盘等性能监控,最终形成VMware虚拟化拓扑视图,最后再对虚拟系统上的数据库、中间件、应用等进行纵向全方位监控,最终形成业务视图。
第二:从底层的Cisco UCS进行物理级别的处理器,磁盘状态等物理性能指标进行监控,到其上的VMware虚拟化监控,最后再对虚拟系统上的数据库、中间件、应用等进行纵向全方位监控,最终形成业务视图。
第三:从存储方向对IDC机房内部的存储设备包括RAID、光纤交换机等进行监控;包括磁盘状态、容量、LUN、卷等,光纤交换机的端口状态、流量等最终形成了存储环境的业务逻辑拓扑图。
统一门户展示平台:
通过和合作伙伴通力合作,进一步打造贵州移动统一门户展示平台,首先通过卓豪运维监控系统对基础设施的整体监控,提供基础性能和告警数据,然后通过统一门户平台的集中展示,直观呈现贵州移动大数据中心IT基础设施的整体性能状态。
客户评价:
贵州移动表示:“卓豪的解决方案完全满足我们对监控项目的需求,实施团队专业的实施能力,为该项目顺利落地提供了有利的保障,满足了我们对大数据中心的三个IDC机房基础设施实时监控的需求。后续,我们还要将卓豪IT运维管理系统作为机房租赁服务的增值服务为全省的机房租赁用户提供IT运维管理支持。”
ManageEngine各款产品均提供免费试用和技术支持服务,欢迎来官网下载体验: https://manageengine
- ?
CIO早班车 丨 大数据系统的运维应该怎么办?
Ruth
展开
CIO早班车 - 第八期.mp35:30
来自网络
暂停几分钟,工作更轻松。
上周,我们谈到了关于人工智能和深度学习在大数据方面的应用,今天来和各位CIO朋友们一起聊一聊将大数据技术应用在IT运维领域的“IT运维分析”(也就是ITOA)的话题。
本期主讲嘉宾
IBM 大中华区资深架构师 黄友怿
黄友怿是IBM 大中华区技术服务部资深架构师及系统服务产品线经理,曾参与多个大中华区银行、保险、电信、制造、零售业的核心系统、业务系统、大数据分析、系统监控、服务管理等项目与服务产品的规划、设计,咨询与实施工作。
今天由于市场竞争越来越激烈,企业内部业务部门对IT的依赖越来越高,企业外部客户对企业提供的服务也越来越苛求,因此企业对IT服务水平的要求就越来越高。 此外,CIO还要面临一系列的挑战,例如:系统变更频繁、人力不足、人员流动率高、系统复杂度增加,还有永无止境的成本压力。
因此越来越多的企业,开始在传统系统监控的基础之上,利用 ITOA来更好地从海量的操作数据中收集、组织、分析、发现、识别和预测运维过程中复杂的模式和信息,作为运维优化的基础,或是进一步运用这些洞察力达到业务创新,获得更高的商业价值。
为了更进一步理解这些原始运维数据背后隐藏的信息或代表的意义,ITOA常会用到可视化分析、机器学习、预测性分析、根本原因分析、图形分析、文字分析、行为分析等不同方法,从各种不同角度对运维数据进行深度分析。
ITOA在异常发现与预测、异常诊断、性能容量管理、事件管理、告警优化、网络与安全管理、运维自动化、用户体验优化等应用场景能起到非常好的作用。
△ 举个例子
我们有一个大型企业的客户,由于业务增长快速,在内部搭建了一个包含数千虚拟机的私有云平台,为了支撑多变的应用需求,云平台每天必须处理高达数万次的操作命令,完成大量资源布署、调整、移转、回收等动作。在这些操作过程中,难免因为一些软硬件或人为的原因,造成作业的失败。
在过去,由于云平台规模庞大,管理团队人力不足,为了发现这些运维异常的状况,必须依赖传统监控工具,但这些工具能力有限,往往只能检查特定指标有没有超过阀值,或是在个别系统出现错误日志之后才发出告警,但这种作法的效果并不好,比如在建立虚拟机的作业中,其中一个所需的资源因为某种原因处在锁定状态,云平台可能会重复启动多次的尝试请求而不会立刻发出错误的返回码,在这种状况下,必须等到很长的时间经过,而整个作业却仍然不能完成后,系统才会返回超时的错误信息,触发告警。
另外在某些状况下,由于工作线程本身消失或出现异常,预定的作业无法进行,这种问题也常常不能及时被发现。在这些状况下,用户往往必须在事后才能被动的发现故障,通知管理团队开始定位、诊断与处理问题,如此一来,系统资源不能在预定时间完成供应,对系统可用性就会直接产生影响。
为了改善这种状况,这家企业的CIO采取了ITOA日志大数据分析技术进行监控系统的优化。
首先管理团队将云平台系统海量的历史日志进行集中化存储与分析,接著,再从这些日志所代表的运维轨迹,发现每个云平台作业的操作模式,这些操作模式再与生产环境中实时产生的运维数据作比对,一旦发现生产环境产生的数据与正常操作模式发生重大的差异,就代表系统作业可能产生异常,此时监控系统就会针对这种可疑状况及时发出告警,讓管理团队能够提早发现系统的异常或可疑状况,并及时采取必要行动,避免问题的恶化或发生。
经由上述案例的说明,可以知道如果能够善用大数据运维分析的方法,的确可以显著提高企业IT系统运维的质量
随著客户对企业运营穩定性的要求越来越高,IT在企业创新过程中扮演的角色越来越重要,ITOA的应用势必日益受到企业CIO们的进一步重视。
IBM作为全球领先的运维服务商,累积大量运维经验,实际应用认知与大数据技术,来提升生产环境的运维质量,也能提供端到端解决方案,来满足不同运维场景的需求。
客户可以轻易的结合自身业务与环境的状况,选择适合的平台、工具与方法,优化自身运维能力,提高系统可用性,满足业务需求,并通过数据驱动业务创新。
- ?
大数据全栈运维——是你的铁饭碗,更是你的生意经
咎青丝
展开
晨起打开电视机,想看会新闻节目,父亲节将至,新闻自然会给予一定关住度,新闻中用到了大量的大数据提供的最为客观的信息,来调查父亲节礼物,这种统计方式让你不得不感叹科技的革新带来的巨大的变化,正在悄悄改变我们的生活。
大数据时代,名副其实的“信息社会”。大数据将重塑我们的生活、工作和思维方式。大数据需要人们重新讨论决策、命运和正义的性质。拥有知识曾意味着掌握过去,现在则更意味着能够预测未来。很多情况下,弄清楚“是什么”比找寻“为什么”更加重要,因为前者表明事实才是我们生活和思维的基础。
现在精明的企业,在想要采取任何一个动作前,最先做的是数据调查,用数据说话,这种数据不受个人意志为转移,无疑是更理性更具权威性,任何人都必须臣服于大数据的精准判断。
有需求就有市场,一大数据为依托的数据运维行业应运而生,但是由于市场的需求量大,大数据人才市场供不应求,目前互联网的朝阳行业,就算你掌握了大数据的命脉,假使你有一天想创业,自己当老板,掌握了数据思维就相当于掌握了珍贵的商业信息,总之,目前大数据真的是一项可以帮你转业提薪的绝佳机会,观望的越久,损失越大!
一根筋教育,名师指导,课程脉络一目了然,四个月时间,让你掌握一门手艺,也是一门生意经。想了解的就联系一根筋官网客服,课程大纲、还有免费资料可以拿。
- ?
大数据开发运维工程师(非数据分析挖掘)需要掌握哪些技能
Gerald
展开
分享之前我还是要推荐下我自己创建的大数据学习资料分享群 232840209,这是全国最大的大数据学习交流的地方,2000人聚集,不管你是小白还是大牛,小编我都挺欢迎,今天的源码已经上传到群文件,不定期分享干货,包括我自己整理的一份最新的适合2017年学习的前端资料和零基础入门教程,欢迎初学和进阶中的小伙伴。
大数据开发运维工程师(非数据分析挖掘)需要掌握的技能:
了解各种常用集群的搭建及性能调优
Hadoop集群,storm集群,spark集群
其实会hadoop的搭建,其它就很容易了
这里有时会涉及硬件管理或网络管理,具体看项目
这里需要到的技能是:对Linux系统的常用操作,包括对shell脚本语言的开发使用, 硬件管理(磁盘,内存,CPU等),网络
2. 学会集群的各类组件的原理和使用及配置
这块内容比较多也比较杂,一般来说常用的组件有Hive, Yarn, Hdfs, Hbase, Zookeeper等
能够理解和使用Mapreduce算法框架
如果是做实时处理需要掌握Flume, Kafka, Redis等的使用
3. 会使用至少两种主流开发语言
包括 Java,Scala,Python,Java的话至少要掌握Java基础,J2ee一般可不考虑(具体看公司招聘需求)
数据分析挖掘工程师:
技能:传统SQL, HiveQL开发, Scala(对应Spark), R语言,Shell, 基础Linux操作,有的还需要一到两种主流开发语言(以上不一定要求都懂,具体看项目需求)
要会使用分析工具,包括spss等
要懂常用机器学习算法的适用场景及使用方法,包括聚类分析,逻辑回归等等
以上是我之前接触到的在大数据项目中会使用到的技术和工具,
不得不说,以上任何一个技术点单拎出来都能写一本书 。。。
而且大数据生态圈组件非常多,我们只是使用到了其中一部分,同时大数据相关技术更新也很快,
总体来说,Java或者Python程序员转大数据相对要容易些。
- ?
【独家】基于工业大数据的AI智慧运维系统,蔚蓝数据已完成500万元天使轮融资
失心疯
展开
今日,猎云网独家获悉,基于工业大数据的人工智能智慧运维系统研发商蔚蓝数据已于2017年6月完成500万元天使轮融资,投资方为个人。目前项目正在寻求Pre-A轮融资,拟融资1500-3000万元,出让股份10%-20%。
2013年4月,德国推出“工业4.0”,主张将制造业向智能化转型,第四次工业革命由此诞生。在国际产业大变革的趋势下,对标工业4.0,2015年中国围绕实现制造强国的战略目标推出《中国制造2025》,国务院总理李克强曾表示,中国制造是国家综合国力提升的关键之一,但目前中国在国际产业分工中总体还处于中低端水平。
在工业制造领域,蔚蓝数据创始人薛路放认为,传统工业常常将对已产生问题进行自动化检测视为工业智能,却未意识到数据采集对设备衰退的追踪、量化以及预测性诊断的重要性。其次,现阶段企业在运维方面,工业数字化改进、现代化高效管理等方面依然存在很多不足,造成人力、设备系统的资源浪费。
在国内IT算法等技术有了新突破,并持续发展的情况下,薛路放决定放弃全球500强企业的工作,回国创办了“蔚蓝数据”,彼时他已深耕能源和工业行业12年。据了解,蔚蓝数据已获得双软认证、中关村金种子企业以及中关村高新技术企业认证。
蔚蓝数据成立于2015年10月,是一家基于工业大数据的人工智能智慧运维系统研发商,主要服务于工业、商业等领域行业客户,为企业提供能源和智慧运维服务,提高运维效率,使每个企业都可以使用基于大数据及AI技术的智慧运维系统,致力于通过大数据分析为企业提供端到端的深化服务。
值得一提的是,蔚蓝数据构建了DEMMS Cloud工业大数据云平台,涉及能源管理、环境管理、安全管理、设备健康管理及运维服务,自主研发了AIE能源管理采集器、AIG工业级大数据网关、环境监测等硬件设备产品,通过大数据挖掘及分析为工、商业企业提供综合性解决方案。
商业模式上,初期阶段,蔚蓝数据主要以产品及服务的直销模式与企业方建立合作,并签订5-10年的长期服务。其收费以智慧运维的商业建筑面积为标准,为20-30元/平米。举个例子,在合作中的园区平均建筑面积为5万平米,5年合同服务期,运维费用则为500万元人民币。成立至今,蔚蓝数据积累了一批工商业领域的种子客户,其中包括中粮蒙牛、万科、滴滴、万达院线以及北京供热企业等。
据猎云网了解,蔚蓝数据已完成万达院线CBD店的部署,将院线的运维反应时间从2周缩短至2天,同时空调系统节能率达55%,整体提升了院线的能源使用效率。相关案例还包括北京朝阳区虎城热力,自2017年11月起,蔚蓝数据已提供近25万平米的供暖改造服务,帮助供热企业降低能耗近18%,人力资源减低60%。
谈及下一步规划,蔚蓝数据方面透露,未来3年,公司将专注于布局中高端商业园区项目提供服务,同时也会继续为已有的乳品行业市场提供智慧运维服务。后期阶段,在产品技术迭代打磨稳定后,公司规划拓展代理模式,进行全国范围内的市场推广。
关于团队,现段蔚蓝数据团队共有14人。创始人兼 CEO薛路放,毕业于东南大学热能工程专业,拥有超20年工业能源行业经验,在北美的全球500强企业有逾10年工作经验;COO王倩男,10年以上工业热力行业管理工作经验。
项目:蔚蓝数据公司:蔚蓝城市(北京)科技有限公司网址:demms
- ?
苏宁易购大数据平台运维实践
宣一凤
展开
苏宁大数据平台基本介绍
大数据平台运维的痛点及解决方案
痛点1. 部署及运维复杂痛点2. 无资源使用视图
痛点3. 任务相互影响,资源隔离性差
痛点4. 排查问题耗时长,应用优化门槛高
解决1. 平台化、自动化
大数据管理平台:主机管理,集群管理自动化
元数据管理:数据字典,权限申请审批实施自动化
数据流管理平台:集成Flume,智能扩缩容,插件式
数据开发平台:支持10种不同的任务类型,支持任务流/任务管理,解决复杂依赖问题,可扩展
解决2.资源可视化、人民币化
存储/计算资源计量计费
资源池使用可视化
任务展板
解决3.差异化服务、物理隔离
解决4. 智能诊断、优化建议
平台优化及增强
稳定
Hive metaserver 连接数过高的问题
修改bonecp的配置:maxConnectionsPerPartition=1
Spark Streaming & Druid System CPU过高的问题
设置vm.zone_reclaim_mode=0
透明大页导致System CPU过高的问题
echo never >/sys/kernel/mm/transparent_hugepage/defrag
安全
账户/权限体系:每个系统一个账户,不允许跨账户写
Hive metaserver 密码加密
基于User/IP的访问控制策略:RPC层面控制,白名单
skipTrash禁用:防止误删数据
扩展性
结合HDFS的压力、瓶颈问题的逐步优化:
程序优化,扫全表: Hive慎用unix_timestamp方法
小文件合并
YARN日志降低副本至1
YARN日志单独放在另一个集群
Federation + Alluxio 实现统一命名空间
DOING & TO DO
Flink推广OLAP平台建设
流计算消息回溯
多活&灾备
资源统一管理
- ?
如何逐步实现大数据安全运维
绫罗缎
展开
随着智能科技发展的今天,几乎所有的行业客户都将业务系统建立在网络应用的基础之上,互联网的应用与业务的融合给用户带来了巨大的效率提升和持续的竞争力,而在背后默默支撑这一切的都基于大数据深度运算和应用。作为大数据典型产物的人工智能更被誉为人类科技上的一次飞跃。然而,近年来,因遭受互联网攻击而直接导致的经济损失,并呈现出逐年增加的趋势,这无疑给让企业在享受智能改变的同时,也面临巨大的考验。
如果说过去我们反复降调企业用户在互联网安全领域中居安思危,面对安全故障我们应该迅速做出补救修复措施。那么在海量数据面前,企业能承担多少个下一秒的损失呢?
“大数据”时代的来临 ,在安全领域中信息系统的规划,建设,投资等决策将日益基于数据和分析做出判断,而非过去基于经验和直觉的模式。如何采集,分析数据,提供定期的报表统计,包括攻击类型分布,高风险攻击事件统计,安全漏洞发布等。如何直观展现信息系统的实时安全态势,为安全决策提供数字依据成为企业安全运维面临的首要问题。
那么我们应该如何着手建设安全机制方面的运维管理呢?
1 建立信息系统安全事件监测机制,及时发现信息系统安全隐患。
运维阶段中,我们如何及时提前发现异常行为?这是正常用户应该出现的行为吗?该用户是否被控制或穿了马甲?举个栗子:某天某台服务器出现了大量的外联上传行为,进出访问IP中出现大量境外IP,或者CNCERT 通报的恶意IP等。应该如何识别呢?
因此,企业用户需要建立一套有效的安全事件监控和预警措施,能够在信息系统即将遭受攻击,或者已经遭受攻击的同时,迅速精准的发现攻击行为,并且迅速启动处置和应急机制,同时可以对信息系统的安全事件进行综合分析,了解当前整体系统的安全态势,为整体网络与信息安全规划提供有效的数据支持。
2 预先防范,提前做好安全性检查,全面提升主动检测能力。
WEB 应用的安全性成为越来越需要关注的问题,有近40% 的入侵是由于web 应用的问题造成的。在Applied Research 发表的一份调查报告中,企业反馈超过一半的最频繁的攻击是针对web 应用的,这些攻击种甚至有一半在著名的“OWASP 十大威胁”名单中,面对这些持续而频繁的攻击,企业用户需要进行定期的安全检查,及时主动发现信息系统中存在的安全漏洞及潜在威胁。
3 提高安全事件的相应和处理能力。
综合监控中发现的问题,以及在安全检查中对自身系统脆弱性的认识,为应急方案提供依据。同时,根据企业自己的运行情况及行业特性,建立安全知识库,鉴于目前多数企业不具备完全独立处理安全事件的技术能力,企业通常也可以借助专业安全服务厂商提供安全事件的预警,相应和必要的技术支持,提供企业的安全事件处理能力。
4 通过强大的综合分析能力,为信息部门提供数据参考和决策支持。
应随时了解信息系统的运行情况和安全状况,安全态势,在海量数据的基础上,进行综合分析,得出宏观的规律和不同事件相互联系的规律。为信息部门提供强有力的数据参考和决策支持。
关注创联致信,关注更多技术资讯
更多详情请致电
创联致信,中国优秀IT运维服务商
- ?
海量大数据平台的运维智能化实践
初柳
展开
【IT168 技术】本文根据徐小飞在2018年5月12日【第九届中国数据库技术大会(DTCC)】现场演讲内容整理而成。
讲师简介:
徐小飞,阿里巴巴技术专家,目前就职于阿里计算平台大数据基础工程技术团队,主要负责支撑阿里大数据智能运维体系(公司内部产品名称——Tesla)的建设,团队致力于打造通用的智能化SRE中台,目前该中台运维体系承载阿里10w+规模节点运维工作。
本文摘要:
介绍Tesla如何支撑阿里离线计算和实时计算两大海量大数据平台的标准化日常运维运营,以及探索如何构筑运维领域的知识图谱,打造针对大数据平台和大数据业务的数据化全息投影,实现多维的立体化监控、智能决策分析、自动化执行的运维闭环。Tesla是面向企业级复杂业务系统的数据化驱动运维解决方案,解决方案包含一个统一运维门户(运维工单、运维垂直搜索)和四个运维基础平台(流程平台、配置平台、作业平台、数据平台),集日常运维工单管理、自动化发布变更、统一配置管理、统一任务调度、智能监控告警管理、异常检测预测、故障自愈等。
分享大纲:
·运维新趋势
·Tesla运维解决方案
·DataOps数据化运维
·数据价值转化
·AIOps征程
演讲正文:
大家好,我叫徐小飞,很开心能够有这样的一个机会在这里和大家交流。今天主要给大家介绍一下围绕阿里大数据体系的的运维智能化实践。
我所在的团队叫大数据基础工程技术,通俗点说就是大数据SRE(为什么起基础工程技术这个名字? SRE文化里有个最核心的点就是使用软件工程的思想来解决运维问题),我们团队支撑的是整个阿里大数据生态的运维运营,并沉淀出一套自己的运维解决方案体系——Tesla,这套体系是一个分层体系,包含了面向运维领域功能的运维中台和面向具体大数据平台业务的运维应用。目前Tesla承载了阿里大数据平台及业务共10w+规模节点的日常运维工作。相信了解阿里的人都听过这样一个词——“大中台和小前台”战略,同样在运维领域,我们也是利用这个战略来构筑我们的业务:大中台提供通用的运维领域功能,而小前台可以基于业务场景快速试错、创新。首先我们先看下运维的新趋势。
一.运维新趋势
刚好这几天Google IO大会也正在召开,相信在座的很多同学都会关注,今年的大会中有一个很吸引眼球的话题,就是在开场第一天放出来的两段Demo视频,是个电话录音视频,内容是Google助手帮助客户打电话到发廊或餐厅去做预约。那么亮点在哪里呢?在整个电话预约的过程中,发廊和餐厅的人完全没有感知到和他们交流的是AI机器人。换句话说,AI机器人已经达到了以假乱真的效果,不仅在交流过程中有语气词和思考,而且当话题出现中断时,还会提出反问句,能让话题回到机器人所要的情景进行下去。
Google对外宣称在某些特定领域,例如预约领域,他们已经通过了图灵测试。图灵测试大家可以去了解一下,图灵有一篇针对未来机器智能的论文,一句话解释论文里的图灵测试:当人机交互时,人类完全感觉不到对方是个机器人,那么就标志着进入了机器智能的时代。
大概在三年前,Google提出了AI战略。时至今日,我们看到Google在很多领域都渗透了AI,Google的AI并不是做一个全新的AI产品,而是将AI赋能到它的顶尖产品中。所以,我们表面看到的是预约服务,但其实为了达到这个效果是需要很强大的数据+算法的支撑。我们经常提到的ABC(AI,BigData,Cloud),想要实现AI,前提一定是大数据和云计算,而在运维领域也同样是如此。这两年AIOps特别火,同样地我们认为要实现AIOps,一定是先有运维的数据和计算,就是说从DevOps到AIOps之间,有一段DataOps必经之路。
如何理解DataOps呢?首先,我们要拿数据来感知我们所运维的系统,继而利用数据分析做一些决策,再往下就是去触发自动化的智能闭环。我们认为DataOps中最核心的过程就是运维感知、决策和执行。
我们把无人驾驶和无人运维做了一个类比。无人驾驶也是Google第一个提出来的,现在有很多厂商投身其中,如果细看无人驾驶,其实我们发现与无人运维类似——无人驾驶是在传统汽车上附加智能感知、决策、智能控制系统。但是真正的无人驾驶还没有达到,即使是Tesla(马斯克的特斯拉)也不例外。而终极AIOps想要达到的是也是无人运维的效果,即在DataOps 的感知、决策和执行三个阶段都附加上AI智能。接下来先看下整体的Tesla运维解决方案。
二.Tesla运维解决方案
上面这张图是阿里大数据的体系,左边最底层是基础设施,包含了底层依赖,机房、天基、Staragent;其上有两大基础平台,一个是飞天平台,这是完全自研的,另一个是Hadoop平台。这两套平台之上分别对应的是MaxCompute和StreamCompute两大存储计算平台;再往上是数据应用层。而右边是Tesla大数据运维解决方案,我们可以看到Tesla贯穿了整个阿里的大数据体系,负责从基础设施到基础平台到存储计算平台的所有产品的运维支撑。
简而言之,Tesla就是在为阿里的大数据保驾护航。
MaxCompute是大数据的核心业务,而DataWorks可以理解为是一个面向开发者的前端,是MaxCompute的门户。 MaxCompute基本上承载了集团90%以上的计算和存储。在阿里,凡是和数据打交道同学都会用到DataWorks。StreamCompute承载了集团几十个BU的实时作业。大家可能感触最多的是每年的双11大屏,这背后都是由StreamCompute实时作业传上去的,可以达到秒级、毫秒级。最后是我们内部的机器学习PAI和AnalyticDB。
这张图是Tesla运维解决方案架构图。整个Tesla运维解决方案是一个分层的体系,从SRE中台到SRE应用。整体是一个垂直体系,也可以拿SPI来分,中台最底层是IaaS,IaaS层是最基础的公共集团的设施,之上是核心运维PaaS层,其中包含四大平台+两大类服务。 四大平台与运维人日常的工作相关,分别是配置平台、作业平台、流程事件平台和数据分析平台。再往上就是SaaS层,提供了所有的平台和服务。Tesla平台支撑了阿里大数据的十几个平台,因为每个大数据平台业务产品的运维特性都是不一样的,肯定无法做到一套运维系统支撑所有的产品运维运营,所以我们就采用了分层战略: 运维开发团队提供平台,而针对具体产品的运维应用由SRE同学利用平台去构筑。典型的SRE应用包括常见的集群管理、资源管理、监控告警、故障管理等。在这张图里我们可以看到DataOps体现在数据分析平台这一层。
这张图是应用维度。SRE应用这一层的功能也是分层的,最下面是其所依赖的基础平台,往上是面向业务的功能(包含业务中心、服务管控、平台运营、工具服务、运维中心和运筹优化),利用这些功能向上支撑具体的运维场景(围绕稳定性、成本、质量、效率、安全以及体验的维度),最终服务好业务的各类用户。
在运维/运营平台中抽象出了几块内容,开发框架、资源整合、运维数据化和智能分析。因为最终系统都是相似的,所以我们会给提供前后端框架、服务网关、二方依赖包以及工具插件,业务SRE只需在环境上去获取数据,做数据处理、元数据管理以及提供数据查询的服务。运维数据化(DataOps)就是我们前面提到的,智能分析支撑常见的运维场景,比如最典型的故障处理、监控分析、大促保障以及值班客服等,他们面临的客户是一堆客户,这也是DataOps在SRE应用上的体现。接下来我们重点解释到底什么是DataOps。
三.DataOps数据化运维
什么是DataOps?如何做DataOps?阿里五新战略中有一个新能源,我们认为数据就是新能源,现在已经进入到信息爆炸的时代,大家刷淘宝天猫时的每一次行为都会触发日志,这些日志最终都流到我们的平台里。如此海量的数据,如果能有效的组织管理好,那么就可以从中挖掘出价值,但如果管理不好,就可能会是个大灾难。
算法+技术,再结合数据就会产生新能源,而现在比较通用的数据挑战是我们怎么有效的去收集、清洗数据?如何保证数据的实时性、准确性?如何将无序的、没有结构的数据有序、有结构的分类、组织、存储管理起来?如何通过算法去打通数据,连接、分析数据,并从中提炼出价值?这一系列的问题就是DataOps需要解决的。
什么是数据化运维? 我们这样定义:就是把所有系统的运维数据全部采集起来、真正打通,深度挖掘这些数据的价值,为运维提供数据决策基础和依赖。 从系统“稳定性、成本、效率、安全”多个维度去驱动自动化、智能化的运维运营,从而助力实现真正的AIOps。
相比于传统运维,DataOps的改变可能就是把传统的使用命令、人工决策的运维过程转变成数据+算法的模式。
DataOps是实现AIOps的一个必经之路,是一个运维闭环。如何做数据化运维呢?右边这张图来自《大数据之路》这本书,当然这张图说的是阿里整个的数据中台,阿里数据中台把全公司所有和数据相关的东西都整合了起来,提供了一套统一的数据中台。其中,最下面是数据采集层,往上是数据库同步工具,中间是MaxCompute和StreamCompute,也就是数据存储计算层,最上面是数据服务层和数据应用层。
数据中台中的方案体系是OneData,它是用来规范数据中台,如何维护、组织、管理和使用数据的。OneData之上是OneService,有了这套组织管理和两大计算平台之后,就可以提供各式各样的数据服务,并再向上提供数据应用。在阿里,基本上所有的业务部门都是按照这个套路来做的。
如何做数据化运维?其实就是利用这套大数据体系来构筑大数据的数据化运营体系。这句话可能有点难以理解,更直白一点说,这套体系是由我们来运维保障的,但是过程中我们也利用其来构筑了运维运营体系。因为我们的使命是为阿里大数据保驾护航,而我们的做法也是用阿里大数据来做运维分析,数据化运维分解下来就是运维的数据采集、运维的数据计算、运维的数据服务以及运维的数据应用。
前面讲的是方法论,现在讲讲具体的实操。利用数据中台,我们首先做的是按照OneData规范建立运维的数据仓库,然后把所有运维相关的数据做分类抽象,包含公共数据、业务数据、元数据,runtime实时数据。基于这些数据抽象,我们提供了大量的运维服务和数据服务,比如异常检测分析、故障自愈、可视化流程、运维搜索、运筹优化、全链路诊断以及业务驱动。下面结合几个例子来具体解释下如何做数据化运维。
以全链路分析诊断为例,MaxCompute是一套离线计算平台框架,每天有百万级的任务在跑,这些任务都是由开发同学提交,当作业因为各种原因出现不可预知的错误,大家就会@运维值班人员看看是哪里的问题。后来我们发现,大部分问题是相似的,所以就总结经验,从用户都在这个平台上提交作业到最后执行的每个阶段都去打点、采集分析,做了一套全链路作业诊断工具。
这是一个自助式的全链路诊断产品,提供一个入口,用户只要输入作业ID,我们就能延伸到整个上下游去查询所有的有可能的问题,包括它的资源申请情况、配置是否正确、数据依赖是否都已满足、历史情况如何、是否有长尾倾斜等等。
上图中有我们工具的页面截图,可以看到左边是有分类的,其实在做这个全链路分析工具的时候,我们就把这个场景和去医院体检做了个类比,体检时医生要针对病人的各个环节做判断,然后输出病人的状态,OK还是不OK?如果有问题,立即提出来让病人去某诊室随诊。同样的,我们也是针对作业做了多个维度的检测,而且还会将诊断详情、时间分析、图表分析以及历史对比等,全部都透视给用户。最后的结果报告是用图表分析的,例如稀疏图形资源争抢,毛刺图形部分长尾、任意机器进程CPU消耗分析。
第二个案例场景是硬件自愈,目前我们已经有10万+台物理机了,每天有大量的硬件故障在发生,比如硬盘坏了,主板坏了等等。如果机器比较少,那么我们可能人肉或者直接提单就可以了,但是当量级到了一定程度,每天几十单或者是上百单的硬件故障,这种方式就不适用了。
所以我们就利用这套数据化的思路做了一个硬件自愈的流程。我们也是从服务器上采集到数据,然后流进流计算平台Blink再到数据仓库,做检测分析并得出决策。决策触发流程平台做一些自动化执行的action,调用集群操作系统去做机器维修等。
硬件自愈的本质也是一个三阶段的闭环,在这其中我们的角色有很多。例如有些故障重启一下服务或者双向配置即可解决,而有些故障需要使用万能大法,重启机器才能解决。如果碰到解决不了的问题就要进入无盘状态,去做业务隔离、重新克隆、整机维修,维修完之后自动上线。整套流程全部是自动流转,我们是无人值守的状态。
四.数据价值转化
通过前文的方法论和两个案例,我们大概解释了一下如何做数据化运维,接下来,我们再透视一下数据化运维的本质——从运维数据到知识的价值提取。
这里会涉及到几个概念,数据化运维的前提是先将一切对象数据化,也就是运维的全域数据,构筑完之后,使用知识图谱将这些数据连接起来,之后将数据当做服务提供给人,利用运维搜索去提供一些快速直达的服务。...
- ?
如何成为一名优秀的大数据运维工程师?
王涵易
展开
大数据与医疗
随着大数据技术的发展成熟以及国家对大数据产业发展的支持,搭建大数据平台也不在限与BAT级别的大型互联网企业,越来越多企业或个人参与到大数据行业中,并且已经尝到了大数据和大数据技术带来的甜头。
大数据与旅游
而由于大数据井喷式的发展,作为技术人员,很多的人考虑的是学习大数据开发技术,大数据与业务应用。但技术产业的不断发展成熟,分工也必将越来越明确,尤其是互联网产业,个人是很难完全掌控全局的。
分工明确,环环相扣
大数据产业当中,企业的IT架构不断扩展,服务器、存储设备的数量越来越多,网络也变得更加复杂,从而给运维工作带来了巨大的挑战,特别是分支机构众多的大型企业或垂直层级较多的政府单位,为了保障良好的用户体验和数据时效性,运维工作显得十分艰巨。因此,在大数据集中趋势越来越明显的时代,具备实时采集和海量分析能力的IT运维管理产品将会成为数据分析应用的新增长点。
IT运维产品的发展趋势决定了,要在企业复杂的异构网络环境和系统面前毫不畏惧,有这种实力才能实现业务系统所依托的网络平台资源、服务器资源、应用系统资源、信息服务资 源等进行统一综合管理。
大数据运维需要掌握什么
那么对于本身从事运维工作,或从其他岗位转做大数据运维工程师的朋友,应该掌握哪些技能,才能让我们在实际工作中得心应手,运筹帷幄呢?
linux
首先Linux,对于从事开发工作的朋友,必然并不陌生,即使没有系统学习过,但是简单常用的命令必然了解。但对于想从事大数据运维朋友们,我们必须要进行系统的学习,除了常用的命令,基础的有网络安全、用户、磁盘管理,文件目录管理,系统监测维护;之后是Linux下部署企业中用到的各种服务和构建各种高级服务的方法,特别是系统管理员日常管理工作中常见的问题,最初步的安装到系统的安全和优化,以及各种服务的搭建和管理都有一些小技巧,都必须掌握。
关于Linux这块,作为大数据运维工程师,我们还需要具备Linux下进行进程控制开发、进程间通信开发、多线程开发、网络的开发能力,为后续深入掌握嵌入式Linux驱动和系统编程打下坚实的基础。然后逐步进阶,再通过项目实战,搞定Linux中小规模集群构建与优化。当然这里必须要提一下,需要熟练掌握运用Shell编程。
Redis
作为运维工作人员,常规数据库的操作必不可少,而针对大数据运维,一些高性能数据库必须熟悉,如Redis等。在此基础上,基本可以尝试完成一些大规模集群架构构建了。
Python自动化运维
自动化运维能够大大提高运维效率,而python凭借其灵活性,在自动化运维方面已经被广泛使用,而且服务器规模越大,优势越明显。通过python实现自动监控,系统安全、报表管理,Ansible,Saltstack等等。学习过程中可以可以使用python自动化运维实现大规模流量监控与管理,来体验自动化运维在实际业务场景的应用,提升实际使用能力。
hadoop生态圈
既然是大数据运维,大数据平台集群构建和云计算平台集群构建自然需要熟练,了解hadoop生态体系,有条件的话,可以尝试搭建千万级的高并发大数据网站平台(自学估计比较困难)。针对云计算平台,OpenStack易于部署、功能丰富且易于扩展,应该作为我们重点学习对象。针对这块也有像COA认证等受认可的培训认证,有条件的朋友可以参与,对就业帮助还是非常不错的。
OpenStack
讲了这么多,其实很多本身从事企业网管、技术支持或者硬件网络方面的朋友,对文中的部分内容还是非常熟悉的。对于这类有一定经验基础的朋友,学习起来自然会更轻松。运维工作相对与编码,比较看重人的逻辑思维能力,对于未知情况做出逻辑判断,主动出击,对于沟通、团队能力更加看重。有兴趣的朋友可以尝试深入了解。
大数据时代,“连接一切”将是一个时尚的词句,物物相连,人人相连,人物相连。在这个巨大且复杂的网络中,以大数据、云计算为基础的智能感知世界,让我们张开双臂,拥抱未来,以大数据为基础,精准感知,精准运维。
大数据运维系统
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并