- ?
艾科智慧建筑能源管理系统
龚以寒
展开
关于艾科
广东艾科技术股份有限公司成立于1997年,是一家专注于数据采集、传输、处理与应用,将物联网与云计算等技术运用于智慧建筑能源管理与智慧供热行业,为智慧能源管理领域提供整体解决方案的现代信息化服务商。
作为行业引领者,艾科始终专注行业发展和标准建设。1998年,艾科率先研发国内首套集中(中央)空调计费系统,并取得该领域的首项专利;2010年自主研发供热计量管理系统。
2009年艾科主编集中(中央)空调计费领域首部国家标准《时间法集中空调分户计量装置》,参编了国家标准《公共建筑节能设计标准》GB50189-2015、楼宇自控领域《建筑设备监控系统工程技术规范》JGJ/T334-2014和供热计量领域《通断时间面积法热计量装置技术条件》JG/T379-2012等多项标准。
截止2016年底,艾科的产品与解决方案已服务全球1800多个标志性建筑,包括万科、保利、万达、绿地、富力、碧桂园、华润置地、越秀、招商、龙光、SOHO等地产旗下知名商业综合体写字楼;中国工程院院士楼、中国科学院动物研究所、上海自然博物馆等大型公共建筑;长沙运达国际广场瑞吉酒店、W酒店、广州万豪酒店、郑州丽笙酒店等顶级酒店;广州国际金融中心、深圳平安国际金融中心、上海滩国际金融中心等高级写字楼;以及佛山市第一人民医院、甘肃省妇幼保健院、泰州人民医院等大型医院。
作为智慧建筑能源管理与智慧供热管理行业的领导者,艾科将始终致力于为客户和合作伙伴创造长期价值和潜在增长,为绿色建筑和建筑节能作出贡献。
系统概述
云计算、移动互联网和物联网的发展促使智慧建筑能源管理行业发生了重大变革,新形势的变化让许多技术和模式拥有了新的血液、新的力量。艾科,中央空调计费行业的开创者,站在了行业变革的节点上,感受到了一股夹带着新技术与新理念的巨浪正在来袭。
早在1997年,艾科就率先提出“管理促节能”的主动能源管理理念,提倡运用管理思想与方法,以智能化、信息化技术和经济手段,对用能系统进行计量、分析、管控和优化改进,从而实现可持续的节能降耗。
正是在这一极具战略眼光的理念指导下,艾科技术团队于上世纪末研发出首款中央空调计费系统,开辟出一个全新的中央空调计费行业。
18年来,基于“管理促节能”的理念和强烈的创新意识与开拓能力,艾科将能源管理的道路越走越宽阔。
如今的艾科已拥有多项技术专利,多种智慧建筑能源管理整体解决方案,并成为国标的主编者……不论是过去还是现在,艾科人永远选择不断开拓、锐意进取;选择紧随时代步伐,精准把握建筑能源的脉搏。
艾科已将智慧管控转化为持续的内在信念。
洞悉大数据,展望云未来;未来,艾科所倡导的基于“大数据+平台”的能源管理运营模式,会将数字化与信息化深刻应用于建筑能源管理的每个环节,为客户提供端到端的专业建筑节能管理服务,以最优的节能管理方案给建筑能源管理一颗智慧、强健的心。
系统优势
艾科智慧建筑能源管理系统方案,包括数据感知层、数据处理层、数据中心、平台,将先进的软、硬件技术与数据信息服务紧密结合,为客户提供各类型先进的解决方案。
1、基于专业的嵌入式Linux硬件平台,分布式采集与集中控制,令系统更加稳定、安全与高效;
2、支持Modbus、BACnet/IP、BACnet MS/TP、DL/T645-1997、CJ/T188-2004及厂家自定义等众多协议;
3、基于强大的设备集成引擎,把新设备的协议远程注册到采集器,让系统在短时间内即可支持新设备,快速满足客户需求;
4、基于面向服务体系架构(SOA)设计,降低了系统的耦合度,让系统随着不同的项目规模而轻松弹性扩展;
5、支持分布式海量数据的存储与高速计算,提高数据的存储和处理能力,轻松处理PB级的海量数据;
6、支持TCP/IP或无线通讯网络的数据采集与控制,使分布在不同区域的终端设备轻松接入到该平台;
7、在同一平台,实现微观上分析监控每个终端设备状态或负载能耗情况,宏观上监测各楼宇、园区以及各个行政区域的能耗;同时提供多种计费模式对空调、水、电、气等多种能源进行计量收费。
建筑能耗监管系统
艾科建筑能耗监管系统是建筑能源管理系统的子系统,是对建筑能耗进行实时在线监测与分析的大型信息化平台。它以建筑中各项能耗数据为依据,结合各类建筑的特殊性,通过分布式采集水、电、气、热能等各种能耗数据后,进行动态监测分析,洞察建筑中存在的不合理用能问题,优化了现有的设备运行,既满足了用户对建筑环境的舒适要求,又能助推绿色建筑的建设。
1、符合国家机关办公建筑和大型公共建筑能耗监测系统技术导则及相关技术规范的要求;
2、基于B/S系统架构,通过浏览器即可访问;
3、可对建筑各个监测支路能耗数据进行访问授权;
4、随时便捷地在线批量查看仪表的实时状态读数;
5、同一平台支持不同角色的用户访问。
中央空调计费系统
艾科中央空调计费系统是建筑能源管理系统的子系统,主要包括能量型、时间法、VAV等集中空调分户计量系统。
1、符合国家标准《时间法集中空调分户计量装置》要求,支持分时段计费;
2、基于B/S系统架构,通过浏览器即可访问,支持OPC数据接口;
3、可对建筑各个监测支路收费数据进行访问授权;
4、随时便捷地在线批量查看仪表的实时状态读数;
5、同一平台支持不同角色的用户访问。
建筑能耗计费系统
建筑能耗计费系统是对建筑物内的集中空调、水、电、燃气、蒸汽等能源消耗进行计量,并根据核定的能源单价,对能源进行收费的综合性系统。
特点
1、灵活的组网方式,支持无线、有线、网络等多种通讯方式;
2、能耗数据采集器兼容多种通讯总线仪表,使用更方便;
3、系统整合了所有能源仪表抄表功能,方便物业管理;
4、支持对水、电、气阶梯单价收费和尖峰平谷用电收费;
5、通过配置协议即可快速集成第三方水、电、气、传感器等仪表设备;
功能
1、远程抄读、监测仪表的数据,为费用结算提供数据支持;
2、多类别能耗报表输出,为物业管理人员提供方便;
3、多样的数据集成接口,支持OPC、WebService等接口,集成更方便。
经典案例
中国建筑科学研究院CABR近零能耗示范楼
广州白云国际会议中心
上海美林阁大酒店
深圳平安国际金融中心
深圳清华紫光南方产业基地
莆田市第一人民医院
厦门中银大厦
广州山水庭院
- ?
高速公路自动气象监测系统介绍(详细版)
万诗双
展开
高速公路气象监测系统,顾名思义,其本身主要的作用是针对高速公路的气候数据监测的设备,高速公路气象监测系统的可以实现监测是数据有:温度、湿度、风速、风向、露点、雨量、气压、地温、能见度等气候数据信息,因为高速公路自动气象监测系统要对高速公路进行全程监测,因此一套系统往往包括的气象站监测点较多!安装一般都是批量安装,为了避免不必要的功能浪费资金,因此高速公路气象监测站设备可以根据用户的需求去为用户搭配适合的气象监测要素!
高速公路自动气象监测系统本身组成部分有传感器、支架、供电系统、通讯系统、防雷系统,传感器本身指的就是每个监测点的气象传感器,每个个监测点都需要一个气象支架,来安装气象监测传感器,监测的数据可以通过无线传输的方式将数据传输至监控室,通过电脑端之间展示!至于供电系统,高速公路自动气象站监测系统的每个监测点都可以支持蓄电池供电(可安装太阳能电板)和市电供电,用户可以根据自身需求去选择合适的供电方式!另外监测点需要安装防雷措施!比如郑州托莱斯生产的高速公路气象站设备采集器中自带有防雷组件!更加安全! 高速公路自动气象监测系统特色功能,除了普通的额温度、湿度、风速风向以外,还有能见度、路面状况的监测,都知道高速行车,一旦遇到大雾天气,往往容易引发交通事故,能见度监测传感器不但能监测高速公路的大雾情况,还能对于风沙、扬尘等恶劣气候的能见度进行实时监测,一旦能见度异常,及时提醒工作人员进行对于高速公路禁行封锁!另外路面状况监测主要是对于路表温度、凝结点温度、干燥、潮湿、湿润、残余含盐量、凝结时湿润度、冰和雪这些数据的监测,遇到气温地下,路面潮湿的情况,易结冰,不利于安全行车!通过数据的采集和监测采取措施! 目前高速公路自动气象监测系统在国内很多路段都已经开始使用,已经取得了不错的效果!随着以后人们生活水平的提高,高速出行已经是一种普遍的现象!相信在今后,高速公路自动气象监测系统将会在越来越的多的高速路段安装使用!为人们的安全出行提供安全保障!
- ?
大数据在智慧高速中的创新应用
新欢
展开
摘 要:通过分析信息化建设脉络中高速公路数据的海量产生,结构复杂的海量数据存储及处理,阐述大数据平台在智慧高速建设中的作用,总结大数据在智慧高速中的客户服务、运营优化、稽查分析、应急资源调度、预测预警等方面的具体应用,对交通指挥中心工作提供支持。
1 引言
随着经济社会的发展,城市人口持续增长,数量持续增长的车辆给交通基础设施通行能力带来极大压力。交通拥堵、交通事故、环境污染及能源短缺已成为目前面临的重要问题,尤其在高速公路交通管理尤其变得更加明显。如何有效利用传统的高速公路数据与设备,提高交通运输效率、安全性、整体效益,提高交通的科学管理和组织服务水平是管理者迫切需要解决的问题。
车辆在高速公路上,本身的动作及设备会产生海量数据,在没有大数据平台之前,高速公路上产生的数据分门别类的分布在Oracle、MySQL等数据库中,因为各自处理语言不同,在刚使用时分析速度尚且可以,但随着数据量越来越多,查询调用越来越频繁,速度变得越来越慢,无法满足高速管理需求。
2 高速公路数据产生
高速公路的信息化建设包含从基建到信息记录等多个层面。所有的环节都在不停地产生数据,成为智慧高速中的海量数据来源。首先是高速公路的硬件和基础设施,当一辆车开进收费站,先经过地下预埋的地感线圈,经过地板线圈进行切割磁力线,产生很弱的电流,车辆开进来会由定焦在地感线圈的摄像机拍一张图片,产生车辆进入收费站的第一个数据。继而递交收费卡、读卡、写卡,写卡的同时计算从A点到B点的费用,每一个动作都在产生数据。高速公路收费还涉及更加复杂的情况,如起点A到终点B,中间经过三段高速公路,三段的收费主体不同,需要在收费的金额上进行三个收费主体的拆分,这涉及到后台的数据计算。所以一辆车从进入收费口到驶离收费口,至少会产生两张图片,十余条流水数据,同时还会产生车道摄像和停位摄像等大量的视频信息。
产生大量车辆数据的同时,收费员的动作,如按抬杆键、放行键、军车键等,也会产生数据记录,方便后续稽查时的图片分析,避免逃费等行为。设备本身也会产生大量数据,比如抬杆、打票、红绿灯转换,全部都会产生日志信息进入数据库,这还只是收费相关的数据信息。在看不到的地面上,还会存在很多信息采集系统,比如地磁式传感器、摄像头,检测车辆通过时的平均速度、平均车间距和平均占有率等等信息,大量数据都会进入数据库,进行后续的存储分析。一辆车在驶离高速公路时,已经产生了大量的数据信息,其中包含结构化和非结构化数据、流数据等多种数据形式。
3 大数据平台架构设计及数据处理
高速公路上产生的海量数据,需要一个企业级的大数据平台,对数据进行分门别类的存储管理,TDH企业级一站式大数据平台,以分布式架构对数据进行存储和计算,并在此基础上进行数据处理和应用。
3.1 大数据平台架构设计
数据进入大数据平台,上游业务系统中的数据,通过文件交换或Sqoop方式同步到大数据平台的贴源层,然后经过批处理加工后,形成明细层、汇总层和模型层。对于历史数据,比如收费站入口流水表和出口流水表,选择存储在Search引擎中,可以进行快速的历史数据检索。对于非结构化数据,例如图片和视频影像,选择存储在Hyperbase引擎中。
同时,为了提高大数据平台的数据质量,使用Governor管理元数据(包括表和存储过程),监控所有数据的更改历史,进行数据血缘分析和影响分析。对上层的基于大数据平台的应用,可以使用标准的JDBC或ODBC与大数据平台进行连接,对数据挖掘需求,如节假日车流量预测、高速路拥堵程度预测等,可以图形化拖拽机器学习平台Sophon组件进行预测。
3.2 高速公路的数据存储及处理
高速公路中产生的车辆动作和收费员动作、信息采集系统等产生的海量数据都进入大数据平台进行存储和处理。这些结构复杂,形式多样的海量数据,对数据存储和处理提出了很高的要求。
大数据平台支持兼容Oracle 、DB2 、Teradata数据库/数据仓库SQL方言,可以轻松的将数据从传统架构中进行迁移,所以方便应用研发人员利用这一特性实现数据处理核心的升级换代。同时,TDH支持低延时和高吞吐的实时计算场景,可实现基础结构化数据、非结构化数据和流数据的存储,并随时无缝扩容。大数据平台基本架构在于,对全省高速路网监控收费运营数据进行采集和整合,进入数据中心,基础数据库经过大数据平台处理形成专题数据库,然后将路网设备设施等资源统一融合,形成GIS和视频支撑平台,继而在集成平台以GIS和视频平台做支撑形成五大应用系统相互协作,最终在终端设置,如监控中心的监控大屏、会商室显示、普通的监控工作站、移动终端等设备上进行展示和发布。
高速公路大数据由几个大的部分构成:高速收费数据主要应用于收费管理、风险管理、运营优化;监控设备数据主要应用于视频监控、运营管理、指挥调度;交调设备数据主要应用于基础采集、运营管理、指挥调度。交通数据尤其是视频数据和图像数据,在一个省份数万个摄像头下,以TB量级甚至PB量级增长,数据量巨大,在大数据平台支撑下,完成平滑扩容和查询分析等业务应用。
4 智慧高速中的大数据应用
4.1 大数据平台的处理
大数据平台把实时数据,包括高速公路上的收费、监控等实时数据上传,与传统业务数据进行整合,包括一些城市交通等外联单位的历史数据。将各类结构化、非结构化、半结构化的数据,包括监控图像、抓拍信息、收费日志和视频等信息,进行数据集成、数据转换处理,然后各自建模分析,形成专题数据,把专题数据应用到相应的应用系统中,提供支撑。
4.2 主要应用方面
大数据在高速中的应用主要包括以下几方面:
客户服务。在ETC用户管理与车辆引导中,主要使用Apriori算法进行关联分析,提供客户增值服务和精准信息推送,同时满足客户关系管理的要求。可以根据客户的车辆迁徙路线等分析,进行相关的路线信息推送等。
在ETC用户管理与车辆引导中,基于客户历史迁徙路线和商品购买历史,运用高维矩阵分解方法,发现客户购买偏好和潜在需求以及出行规律。当客户通过ETC时,实时拍照识别鉴定客户之后,基于客户车辆历史通过卡口数据,调用训练好在线数据挖掘模型,可以以大数据可视化的方式显示出来客户迁徙路线,并预测出客户未来迁徙线路,进而进行精准的地点线路信息推送。
路线迁徙的可视化和路线预测的建模过程如下:
利用大数据可视化方法,不仅可以详细每个车辆在地图上车辆行驶轨迹,而且可以显示所有车辆的运行总线路。例如春运年前的时候,可以看到小轿车大部分都是从北上广深流向中西部城市,年后的时候大部分车辆向北上广深汇集。再者,某个客运或者货车司机的路线有其固定的运行线路。路线预测建模过程如下:
基于客户信息、车辆信息、车辆通过何时通过卡口数据历史数据,利用关联分析和高维矩阵分解方法,找到车辆和卡口进出对应关系,预测客户在下一段时间会通过的卡口,进而预测车辆行驶轨迹,从而提供精准的信息推送。
运营优化。通过流式机器学习实现时效分析,提前预警,协同各单位指挥调度;在进入大数据平台之后,通过数据分析,可以通过高速公路热点视频查看,进行自动推送;建立领导驾驶舱,设定流量排名,为优化运营提供决策依据。
通过流式机器学习实现时效分析,提前预警,协同各单位指挥调度;在进入大数据平台之后,通过数据分析,可以通过高速公路热点视频查看,进行自动推送;建立领导驾驶舱,设定流量排名,为优化运营提供决策依据。基于sophon的在线的流式增量机器学习算法,开发时空深度残差网络(ST-ResNet)预测车辆密度。例如把高速公路,划成很多个矩形小区域,多个区域同时分析,它是一种整体性的预测。主要基于平滑性、周期性以及趋势性等三个个时间属性 以及空时间属性和外部天气数据。
第一,模拟局部相邻时刻。它是一个平滑的过程,比如中午三点跟中午四点流量变化不会很大。
第二,模拟周期性。把对应时间点昨天、前天、近一周平均、近一个月平均这个时刻的数据,作为输入,来刻画周期性。
第三,模拟趋势性。把当前时间点更远点(前推半个、一个小时)的时间点(例如昨天、上周、上个月)的数据,模拟趋势性。
第四,抽取空间属性。利用深度卷积神经网络,把一些地区划成子区域之后,相关的区域做会做卷积运算并合并,通过卷积之后,抓住了这个区域周围的车辆流量的相关性。这样卷积多次之后,相当于把更远相关区域的属性的影响都聚合到一起了。
基于这四个结果,系统再做一个融合。第一部分融合,就是只考虑它的时间和空间属性。再考虑外部因素,比如最近的附近天气数据拿做第二次融合得到最终结果。
稽查分析。通过在Inceptor中对原始交易流水费分析,提供逃费稽查、出入口流水对比等异常行为的分析服务。
通过在Inceptor中对原始的交易流水统计分析,抽取车辆逃费稽查和出入口流量相关历史特征,具体有,车辆最近一周、最近一个月、最近半年的缴费信息,缴费卡口每天每个时间点的出入流量信息。
利用discover模型融合方法,融合时序预测模型和异常检测模型,效果较单独一种方法提升1.6倍。具体实现如下:
首先,利用discover大数据分布式自动的时序预测方法,预测此卡口的当前流量,并和当前实际的出入情况对比,如果当前流量少于预测流量,则可能有逃费稽查情况出现;其次,利用分布式异常检测算法iforest和无监督算法深度自编码器检测数据异常,发现行为诡异车辆,业界先进的iforest和深度自编码器算法可以自动异常检测此种逃费稽查的车辆,会和平时它的缴费习惯不同,也会和其自前所属群体的习惯有所偏离,综合的偏离程度月的,逃费的概率越大。最后,利用非线性模型融合的方法,融合时序预测模型和异常检测模型两者的优点,能更准确的定位异常行为的车辆,为车辆稽查分析提供智能。
联合指挥。通过各项数据在Inceptor中的汇总和分析,综合呈现各相关数据,形成联合指挥。基于应急资源管理、路网交通协同调度、应急预案管理、处置效果评估、无人机监控等模块,实现交警、消防、路政等多部门联动响应,为各类交通事件条件下的路网协同控制和诱导管理提供可视化管理界面和决策支持。
应急资源调度。借助Inceptor的大规模数据处理能力,整合传统的应急资源设备与资源,协同建立最优化的调度。应急指挥调度系统可以采取“挂图作战”的形式进行,有效地保证在出现特殊情况时可以采取科学的应急措施,积极、快速、有序地处理各类事件,保障高速公路的正常、安全运行,实现应急指挥、应急资源和应急过程的信息化管理。
预测预警。扩充传统全面风险管理的数据维度,在交通预警等角度分析,提前告知用户。根据往年节假日各收费站流量统计数据,通过分析算法对本年节假日流量做出预测并进行排名。预测值是否超过对应收费站设定的报警门限,可以根据颜色分级进行预警。根据历史通行数据对车流量进行分析和预测,为节假日高峰时段的安全畅通发出预警、提前采取保畅措施,为高速路网的安全畅通提供保障。
基于对各收费站实时数据的分析结果,可以对平日车流量按站点、小时/天分别进行统计得到时间序列,ARIMA是做时间序列预测较为成熟的模型,分别对该时间时间序列采用ARIMA自回归进行建模,然后对未来一个周期的数据进行预测。ARIMA全称为自回归积分滑动平均模型,可以记作ARIMA(p,d,q),其中p为自回归项,d为差分阶数,q为移动平均项数,通过ARIMA模型可以对收费站某个时段流量进行预测与应用,从而提升对车流量的预测预警。
资产管理。结合Inceptor和workflow,实现交通设备资产全生命周期管理,包括设备故障预测、质量分析等;通过设备监控专题,可以对高速公路外场设备如车检器、摄像机、气象站、情报板、GPS车辆及无人机等进行基于GIS地图的一体化监控;点击设备图标即可查看各种设备的状态、数据及图像。
结合Inceptor和workflow,实现交通设备资产全生命周期管理,包括设备故障预测、质量分析等;通过设备监控专题,可以对高速公路外场设备如车检器、摄像机、气象站、情报板、GPS车辆及无人机等进行基于GIS地图的一体化监控;点击设备图标即可查看各种设备的状态、数据及图像。
基于新老设备的历史数据,建立设别的寿命预测,可以大大降低故障率,及时对故障进行预警,并及时更换设备。抽取样本从当前状态到达设备不能使用或者故障的状态所经过的时间作为样本标签,设备的各种温度、电压、电流、功率、脉冲,表面数字清晰度、当前个指标的误差等作为特征,从而基于这些的建立训练数据,训练一个GBDT模型。经过交叉验证,证明此...
- ?
欧维姆在线数据采集系统为中国桥梁安全实时保驾护航
冰松鼠
展开
近期,由柳州欧维姆机械股份有限公司(以下简称欧维姆公司)承建的世界跨径最大钢桁梁斜拉桥——鸭池河特大桥索力监测系统升级顺利完成。至此,该桥索力监测系统由离线模式数据采集系统正式升级为在线模式数据采集系统,使鸭池河特大桥的健康、安全得到实时保障。
欧维姆在线数据采集系统为中国桥梁安全实时保驾护航
鸭池河特大桥作为贵黔高速全线控制性工程,跨越鸭池河,大桥全长1461米,是主跨为800米的双塔双索面钢桁架斜拉桥,主塔采用H型索塔,桥面至水面高差达380米,东塔高243.2米,西塔高258.2米,是目前建成的世界跨径最大钢桁梁斜拉桥,同时创世界山区斜拉桥之最。大桥采用了OVM250钢绞线拉索体系产品及施工服务,于2016年5月20日顺利合龙。
斜拉桥是一个内部高次超静定的结构体系,许多因素的变化,例如,钢绞线的应力松弛、主梁及索塔混凝土的收缩徐变、气候的变化等,都会对整个桥梁结构产生影响,其外在反映最突出的表现就是,斜拉索索力重新分配并导致主梁线形发生变化,索力变化也会使主梁及索塔产生二次内力。尤其在成桥之后的数年时间内,其变化更为显著,斜拉桥索力的变化是判断桥梁是否处于正常运营状态的一个重要指标,而索力测量是分析拉索是否处于正常运营状态的一个重要依据,通过监测斜拉索的受力状况,判断和分析斜拉索的健康状态,已经成为斜拉桥安全监测的重要内容。
2015年11月,欧维姆工程公司人员入场开展索力监测系统首期搭建工作,2016年6月顺利竣工。鸭池河特大桥首期采用的是基于磁通量传感器技术的索力监测系统,于每束斜拉索塔端锚具内安装磁通量传感器测量单根钢绞线受力;于每8束斜拉索中部位置布设1台数据采集装置,安装于塔内塔壁上。这个索力监测系统为离线模式数据采集系统,需人工定期上桥进行数据采集。
为了更好的了解鸭池河特大桥斜拉索在运营期内的受力情况,业主提出了实时采集数据的新要求,于是欧维姆公司于近期,在鸭池河大桥原索力监测系统的基础上,增设了7台磁弹仪和4套数据采集主站,由原系统升级为在线模式数据采集系统,可以实现实时采集数据,实时反馈大桥斜拉索的受力情况,为鸭池河特大桥的运营状况分析提供可靠、有效的依据。
该桥结构索力监测系统采用目前国内最先进的磁通量传感器,均由欧维姆公司自主研发及生产。
作为中国预应力行业领军,欧维姆公司五十多年来一直坚持科技创新,在提升了企业自主创新能力和核心竞争力的同时,通过科技创新产品推动中国预应力行业的发展,为中国桥梁结构健康与安全一直做着不懈的努力。OVM桥梁健康监测系统解决方案曾为毕都北盘江大桥、安徽铜陵长江公铁大桥、杭州湾大桥、厦门集美大桥等中国乃至世界大型桥梁的寿命周期提供技术支撑,推动中国未来大型桥梁产业化发展。(本文来自欧维姆)
- ?
全球100款大数据工具汇总
层岑
展开
1、 Talend Open Studio
是第一家针对的数据集成工具市场的ETL(数据的提取Extract、传输Transform、载入Load)开源软件供应商。Talend的下载量已超过200万人次,其开源软件提供了数据整合功能。其用户包括美国国际集团(AIG)、康卡斯特、电子港湾、通用电气、三星、Ticketmaster和韦里逊等企业组织。
2、DYSON
探码科技自主研发的DYSON智能分析系统,可以完整的实现大数据的采集、分析、处理。DYSON智能分析系统专业针对互联网数据抓取、处理、分析,挖掘。可以灵活迅速地抓取网页上散乱分布的信息,并通过强大的处理功能,准确挖掘出所需数据,是目前使用人数最多的网页采集工具.
3、YARN
一种新的Hadoop资源管理器,它是一个通用资源管理系统,可为上层应用提供统一的资源管理和调度,解决了旧MapReduce框架的性能瓶颈。它的基本思想是把资源管理和作业调度/监控的功能分割到单独的守护进程。
4、Mesos
由加州大学伯克利分校的AMPLab首先开发的一款开源群集管理软件,支持Hadoop、ElasticSearch、Spark、Storm 和Kafka等架构。对数据中心而言它就像一个单一的资源池,从物理或虚拟机器中抽离了CPU,内存,存储以及其它计算资源, 很容易建立和有效运行具备容错性和弹性的分布式系统。
5、Datale
由探码科技研发的一款基于Hadoop的大数据平台开发套件,RAI大数据应用平台架构。
6、 Ambari
作为Hadoop生态系统的一部分,提供了基于Web的直观界面,可用于配置、管理和监控Hadoop集群。目前已支持大多数Hadoop组件,包括HDFS、MapReduce、Hive、Pig、 Hbase、Zookeper、Sqoop和Hcatalog等。
7、ZooKeeper
一个分布式的应用程序协调服务,是Hadoop和Hbase的重要组件。它是一个为分布式应用提供一致性服务的工具,让Hadoop集群里面的节点可以彼此协调。ZooKeeper现在已经成为了 Apache的顶级项目,为分布式系统提供了高效可靠且易于使用的协同服务。
8、Thrift
在2007年facebook提交Apache基金会将Thrift作为一个开源项目,对于当时的facebook来说创造thrift是为了解决facebook系统中各系统间大数据量的传输通信以及系统之间语言环境不同需要跨平台的特性。
9、Chukwa
监测大型分布式系统的一个开源数据采集系统。建立在HDFS/MapReduce框架之上并继承了Hadoop的可伸缩性和可靠性,可以收集来自大型分布式系统的数据,用于监控。它还包括灵活而强大的显示工具用于监控、分析结果。
10、Lustre
一个大规模的、安全可靠的、具备高可用性的集群文件系统,它是由SUN公司开发和维护的。该项目主要的目的就是开发下一代的集群文件系统,目前可以支持超过10000个节点,数以PB的数据存储量。
11、HDFS
Hadoop Distributed File System,简称HDFS,是一个分布式文件系统。HDFS是一个高度容错性的系统,适合部署在廉价的机器上。HDFS能提供高吞吐量的数据访问,非常适合大规模数据集上的应用。
12、GlusterFS
一个集群的文件系统,支持PB级的数据量。GlusterFS 通过RDMA和TCP/IP方式将分布到不同服务器上的存储空间汇集成一个大的网络化并行文件系统。
13、Alluxio
前身是Tachyon,是以内存为中心的分布式文件系统,拥有高性能和容错能力,能够为集群框架(如Spark、MapReduce)提供可靠的内存级速度的文件共享服务。
14、Ceph
新一代开源分布式文件系统,主要目标是设计成基于POSIX的没有单点故障的分布式文件系统,提高数据的容错性并实现无缝的复制。
15、PVFS
一个高性能、开源的并行文件系统,主要用于并行计算环境中的应用。PVFS特别为超大数量的客户端和服务器端所设计,它的模块化设计结构可轻松的添加新的硬件和算法支持。
16、QFS
Quantcast File System (QFS) 是一个高性能、容错好、分布式的文件系统,用于开发支持 MapReduce处理或者需要顺序读写大文件的应用。
17、 Logstash
一个应用程序日志、事件的传输、处理、管理和搜索的平台。可以用它来统一对应用程序日志进行收集管理,提供了Web接口用于查询和统计。
18、Scribe
Scribe是Facebook开源的日志收集系统,它能够从各种日志源上收集日志,存储到一个中央存储系统(可以是NFS,分布式文件系统等)上,以便于进行集中统计分析处理。
19、Flume
Cloudera提供的一个高可用的、高可靠的、分布式的海量日志采集、聚合和传输的系统。Flume支持在日志系统中定制各类数据发送方,用于收集数据。同时,Flume支持对数据进行简单处理,并写入各种数据接受方(可定制)。
20、RabbitMQ
一个受欢迎的消息代理系统,通常用于应用程序之间或者程序的不同组件之间通过消息来进行集成。RabbitMQ提供可靠的应用消息发送、易于使用、支持所有主流操作系统、支持大量开发者平台。
21、ActiveMQ
Apache出品,号称“最流行的,最强大”的开源消息集成模式服务器。ActiveMQ特点是速度快,支持多种跨语言的客户端和协议,其企业集成模式和许多先进的功能易于使用,是一个完全支持JMS1.1和J2EE 1.4规范的JMS Provider实现。
22、Kafka
一种高吞吐量的分布式发布订阅消息系统,它可以处理消费者规模网站中的所有动作流数据,目前已成为大数据系统在异步和分布式消息之间的最佳选择。
23、Spark
一个高速、通用大数据计算处理引擎。拥有Hadoop MapReduce所具有的优点,但不同的是Job的中间输出结果可以保存在内存中,从而不再需要读写HDFS,因此Spark能更好地适用于数据挖掘与机器学习等需要迭代的MapReduce的算法。它可以与Hadoop和Apache Mesos一起使用,也可以独立使用。
24、Kinesis
可以构建用于处理或分析流数据的自定义应用程序,来满足特定需求。Amazon Kinesis Streams 每小时可从数十万种来源中连续捕获和存储数TB数据,如网站点击流、财务交易、社交媒体源、IT日志和定位追踪事件。
25、 Hadoop
一个开源框架,适合运行在通用硬件,支持用简单程序模型分布式处理跨集群大数据集,支持从单一服务器到上千服务器的水平scale up。Apache的Hadoop项目已几乎与大数据划上了等号,它不断壮大起来,已成为一个完整的生态系统,拥有众多开源工具面向高度扩展的分布式计算。高效、可靠、可伸缩,能够为你的数据存储项目提供所需的YARN、HDFS和基础架构,并且运行主要的大数据服务和应用程序。
26、Spark Streaming
实现微批处理,目标是很方便的建立可扩展、容错的流应用,支持Java、Scala和Python,和Spark无缝集成。Spark Streaming可以读取数据HDFS,Flume,Kafka,Twitter和ZeroMQ,也可以读取自定义数据。
27、Trident
是对Storm的更高一层的抽象,除了提供一套简单易用的流数据处理API之外,它以batch(一组tuples)为单位进行处理,这样一来,可以使得一些处理更简单和高效。
28、Flink
于今年跻身Apache顶级开源项目,与HDFS完全兼容。Flink提供了基于Java和Scala的API,是一个高效、分布式的通用大数据分析引擎。更主要的是,Flink支持增量迭代计算,使得系统可以快速地处理数据密集型、迭代的任务。
29、Samza
出自于LinkedIn,构建在Kafka之上的分布式流计算框架,是Apache顶级开源项目。可直接利用Kafka和Hadoop YARN提供容错、进程隔离以及安全、资源管理。
30、Storm
Storm是Twitter开源的一个类似于Hadoop的实时数据处理框架。编程模型简单,显著地降低了实时处理的难度,也是当下最人气的流计算框架之一。与其他计算框架相比,Storm最大的优点是毫秒级低延时。
31、Yahoo S4 (Simple Scalable Streaming System)
是一个分布式流计算平台,具备通用、分布式、可扩展的、容错、可插拔等特点。程序员可以很容易地开发处理连续无边界数据流(continuous unbounded streams of data)的应用。它的目标是填补复杂专有系统和面向批处理开源产品之间的空白,并提供高性能计算平台来解决并发处理系统的复杂度。
32、HaLoop
是一个Hadoop MapReduce框架的修改版本,其目标是为了高效支持 迭代,递归数据 分析任务,如PageRank,HITs,K-means,sssp等。
33、Presto
是一个开源的分布式SQL查询引擎,适用于交互式分析查询,可对250PB以上的数据进行快速地交互式分析。Presto的设计和编写是为了解决像Facebook这样规模的商业数据仓库的交互式分析和处理速度的问题。Facebook称Presto的性能比诸如Hive和MapReduce要好上10倍有多。
34、 Drill
于2012年8月份由Apache推出,让用户可以使用基于SQL的查询,查询Hadoop、NoSQL数据库和云存储服务。它能够运行在上千个节点的服务器集群上,且能在几秒内处理PB级或者万亿条的数据记录。它可用于数据挖掘和即席查询,支持一系列广泛的数据库,包括HBase、MongoDB、MapR-DB、HDFS、MapR-FS、亚马逊S3、Azure Blob Storage、谷歌云存储和Swift。
35、Phoenix
是一个Java中间层,可以让开发者在Apache HBase上执行SQL查询。Phoenix完全使用Java编写,并且提供了一个客户端可嵌入的JDBC驱动。Phoenix查询引擎会将SQL查询转换为一个或多个HBase scan,并编排执行以生成标准的JDBC结果集。
36、Pig
是一种编程语言,它简化了Hadoop常见的工作任务。Pig可加载数据、转换数据以及存储最终结果。Pig最大的作用就是为MapReduce框架实现了一套shell脚本 ,类似我们通常熟悉的SQL语句。
37、Hive
是基于Hadoop的一个数据仓库工具,可以将结构化的数据文件映射为一张数据库表,并提供简单的sql查询功能,可以将sql语句转换为MapReduce任务进行运行。 其优点是学习成本低,可以通过类SQL语句快速实现简单的MapReduce统计,不必开发专门的MapReduce应用,十分适合数据仓库的统计分析。
38、SparkSQL
前身是Shark,SparkSQL抛弃原有Shark的代码并汲取了一些优点,如内存列存储(In-Memory Columnar Storage)、Hive兼容性等。由于摆脱了对Hive的依赖性,SparkSQL无论在数据兼容、性能优化、组件扩展方面都得到了极大的方便。
39、Stinger
原来叫Tez,是下一代Hive,由Hortonworks主导开发,运行在YARN上的DAG计算框架。某些测试下,Stinger能提升10倍左右的性能,同时会让Hive支持更多的SQL。
40、Tajo
目的是在HDFS之上构建一个可靠的、支持关系型数据的分布式数据仓库系统,它的重点是提供低延迟、可扩展的ad-hoc查询和在线数据聚集,以及为更传统的ETL提供工具。
41、Impala
Cloudera 声称,基于SQL的Impala数据库是“面向Apache Hadoop的领先的开源分析数据库”。它可以作为一款独立产品来下载,又是Cloudera的商业大数据产品的一部分。Cloudera Impala 可以直接为存储在HDFS或HBase中的Hadoop数据提供快速、交互式的SQL查询。
42、 Elasticsearch
是一个基于Lucene的搜索服务器。它提供了一个分布式、支持多用户的全文搜索引擎,基于RESTful web接口。Elasticsearch是用Java开发的,并作为Apache许可条款下的开放源码发布,是当前流行的企业级搜索引擎。设计用于云计算中,能够达到实时搜索、稳定、可靠、快速、安装使用方便。
43、Solr
基于Apache Lucene,是一种高度可靠、高度扩展的企业搜索平台。知名用户包括eHarmony、西尔斯、StubHub、Zappos、百思买、AT&T、Instagram、Netflix、彭博社和Travelocity。
44、Shark
即Hive on Spark,本质上是通过Hive的HQL解析,把HQL翻译成Spark上的RDD操作,然后通过Hive的metadata获取数据库里的表信息,实际HDFS上的数据和文件,会由Shark获取并放到Spark上运算。Shark的特点就是快,完全兼容Hive,且可以在shell模式下使用rdd2sql()这样的API,把HQL得到的结果集,继续在scala环境下运算,支持自己编写简单的机器学习或简单分析处理函数,对HQL结果进一步分析计算。
45、Lucene
基于Java的Lucene可以非常迅速地执行全文搜索。据官方网站声称,它在现代硬件上每小时能够检索超过150GB的数据,它拥有强大而高效的搜索算法。
46、Terracotta
声称其BigMemory技术是“世界上首屈一指的内存中数据管理平台”,支持简单、可扩展、实时消息,声称在190个国家拥有210万开发人员,全球1000家企业部署了其软件。
47、 Ignite
是一种高性能、整合式、分布式的内存中平台,可用于对大规模数据集执行实时计算和处理,速度比传统的基于磁盘的技术或闪存技术高出好几个数量级。该平台包括数据网格、计算网格、服务网格、流媒体、Hadoop加速、高级集群、文件系统、消息传递、事件和数据结构等功能。
48、GemFire
Pivotal宣布它将开放其大数据套件关键组件的源代码,其中包括GemFire内存中NoSQL数据库。它已向Apache软件基金会递交了一项提案,以便在“Geode”的名下管理GemFire数据库的核心引擎。
49、 GridGain
由Apache Ignite驱动的GridGrain提供内存中数据结构,用于迅速处理大数据,还提供基于同一技术的Hadoop加速器。
50、MongoDB
是一个基于分布式文件存储的数据库。由C++...
- ?
网络分流器|高速骨干网流量采集与分流实现方案
路易莎
展开
网络分流器|高速骨干网流量采集与分流实现方案
网络分流器1, 流量采集|戎腾网络分流器
所谓流量采集,就是将网络流量通过物理层、数据链路层的信号解析和解帧,实现IP原始报文的获取。骨干网流量采集系统是一种对骨干网进行流量获取并分析的系统,主要应用于政府网络管理、运行商广告推送、运行商计费取证服务、运行商信令监控服务、园区网审计、公安网监、大数据分析等领域。
2, 高速网络流量采集系统|网络分流器
随着以太网技术和光纤通信技术的应用,骨干网带宽的增长及规模的扩大,大规模的网络流量采集面临着数据规模庞大和流量日益复杂的挑战,传统的基于软件的流量采集技术的性能已然无法满足要求。现有的高速骨干网流量采集方案主要分为三类:基于多核处理器的流量采集方案,基于交换芯片的流量采集方案,和基于FPGA的网络流量采集方案。
每种方案各有特色,下文将一一进行说明。
a) 基于多核处理器的戎腾高速网络流量采集系统
多核处理器能够提供强大的并行计算能力,应用于流量采集系统的主要型号有Broadcom的XLP、XLR、XLS,Cavium的CN6880、CN5880,以及Tilera的TILE-GX36等。采用此方案的系统可编程实现流量采集,还可对报文进行修改,具有非常高的灵活性。但系统CPU的处理能力有限,无法真正实现线速处理,整体性能不会很高,但是由于有处理器的参与,比较复杂的处理,如流表的管理、应用层协议识别、Radius上线与报文绑定等功能比较容易实现。
网络分流器|戎腾高速骨干网流量采集与分流实现方案
网络分流器图1一种基于CaviumCN6880的戎腾流量采集器CDP2000
b) 基于交换芯片的高速网络流量采集系统
交换芯片的价格较便宜,且有成熟的套片解决方案可供参考。但其过滤功能非常弱,只支持非常简单的精确多元组过滤,无法做深度报文检测(DPI: Deep Package Inspection),且无法支持POS和WAN等以太网接口,这也使得基于交换芯片的流量采集方案在实际使用的范围受到限制。
c) 基于FPGA的高速网络流量采集系统
基于FPGA的解决方案目前较少,主要原因是FPGA芯片价格较贵,且需自行设计所有高速电路和过滤算法,技术门槛较高,需要深厚的研发能力。但其兼有多核系统的高灵活性和交换系统的高性能,优势也是非常明显的。
网络分流器图2基于FPGA的100G戎腾网络流量采集系统HFC602
表1 三种流量采集方案的比较
基于多核处理器 基于交换芯片 基于FPGA
芯片价格 一般 较低 较高
硬件设计难易度 一般 较容易 较难
软件开发难易度 一般 较容易 较难
常见网络接口的兼容性 中 低 高
流量采集的灵活性 高 低 一般
是否实现线速处理 否 否 是
基于多核处理器+交换芯片的流量采集方案是目前应用最为普遍的方案,虽然系统整体价格略贵,但软硬件发开难度不大,入门门槛较低。
但随着FPGA的发展,其内部资源日益丰富,特别是内部嵌入了大量IP核,在处理速率、逻辑容量等方面不断提升,基于FPGA的方案受到了越来越多的关注,国内外许多研究机构及公司先后推出了基于FPGA的网络流量采集系统。
图2所示是常见基于FPGA的流量采集系统的结构图,流量采集及预处理平台获取网络端口送来的网络数据包,并对数据包进行流量统计和分析,最终根据流量分析的结果将网络数据包进行分流重新转发回网络中。系统采用硬件和软件协同实现设计思路,对于数据包的协议解析、数据预处理都由硬件电路实现;后端服务器进行流量的具体分析处理。通过预处理平台对流量进行分类归并和低负载数据传输,有效减少了后端服务器的工作量;服务器对预处理后的数据进行处理,可以有效降低流量处理过程的负载开销。
戎腾网络分流器网络分流器|高速骨干网流量采集与分流实现方案
3 小结|戎腾网络分流器
戎腾网络推出的100G采集设备(采用ATCA-NTW6401机箱和HFC602业务处理板卡)是目前市面上唯一经过了实网验证的设备,10G独立机箱设备(PET160/320)是目前最大密度的协转设备,3G/LTE产品(ATCA-NTW6402)由于采用软硬结合方案(FPGA+NPU),单板处理能力达到40G bps 3G GRE/ 160G LTE,具有最高性价比|网络分流器
戎腾网络分流器 - ?
携程用户数据采集与分析系统
蛋蛋
展开
一、携程实时用户数据采集系统设计实践
随着移动互联网的兴起,特别是近年来,智能手机、pad等移动设备凭借便捷、高效的特点风靡全球,同时各类APP的快速发展进一步降低了移动互联网的接入门槛,越来越多的网民开始从传统PC转移至移动终端上。但传统的基于PC网站和访问日志的用户数据采集系统已经无法满足实时分析用户行为、实时统计流量属性和基于位置服务(LBS)等方面的需求。
我们针对传统用户数据采集系统在实时性、吞吐量、终端覆盖率等方面的不足,分析了在移动互联网流量剧增的背景下,用户数据采集系统的需求,研究在多种访问终端和多种网络类型的场景下,用户数据实时、高效采集的方法,并在此基础上设计和实现实时、有序和健壮的用户数据采集系统。此系统基于Java NIO网络通信框架(Netty)和分布式消息队列(Kafka)存储框架实现,其具有实时性、高吞吐、通用性好等优点。
1、技术选型和设计方案:
一个典型的数据采集分析统计平台,对数据的处理,主要由如下五个步骤组成:
图1、数据平台处理流程
其中,数据采集步骤是最核心的问题,数据采集是否丰富、准确和实时,都直接影响整个数据分析平台的应用的效果。本论文关注的步骤主要在数据采集、数据传输和数据建模存储这三部分。
为满足数据采集服务实时、高效性、高吞吐量和安全性等方面的要求,同时能借鉴互联网大数据行业一些优秀开源的解决方案,所以整个系统都将基于Java技术栈进行设计和实现。整个数据采集分析平台系统架构如下图所示:
图2(数据采集分析平台系统架构)
其中整个平台系统主要包括以上五部分:客户端数据采集SDK以Http(s)/Tcp/Udp协议根据不同的网络环境按一定策略将数据发送到Mechanic(UBT-Collector)服务器。服务器对采集的数据进行一系列处理之后将数据异步写入Hermes(Kafka)分布式消息队列系统。为了关联业务服务端用户业务操作埋点、日志,业务服务器需要获取由客户端SDK统一生成的用户标识(C-GUID),然后业务服务器将用户业务操作埋点、日志信息以异步方式写入Hermes(Kafka)队列。最后数据消费分析平台,都从Hermes(Kafka)中消费采集数据,进行数据实时或者离线分析。其中Mechanic(UBT-Collector)系统还包括对采集数据和自身系统的监控,这些监控信息先写入Hbase集群,然后通过Dashboard界面进行实时监控。
(1)基于NIO的Netty网络框架方案
要满足前面提到的高吞吐、高并发和多协议支持等方面的要求。我们调研了几种开源异步IO网络服务组件(如Netty、MINI、xSocket),用它们和NginxWeb服务器进行了性能对比,决定采用Netty作为采集服务网络组件。下面对它进行一些概要介绍:Netty是一个高性能、异步事件驱动的NIO框架,它提供了对TCP、UDP和文件传输的支持,Netty的所有IO操作都是异步非阻塞的,通过Future-Listener机制,用户可以方便的主动获取或者通过通知机制获得IO操作结果。
图3(Netty框架内部组件逻辑结构)
Netty的优点有:
a、功能丰富,内置了多种数据编解码功能、支持多种网络协议。
b、高性能,通过与其它主流NIO网络框架对比,它的综合性能最佳。
c、可扩展性好,可通过它提供的ChannelHandler组件对网络通信方面进行灵活扩展。
d、易用性,API使用简单。
e、经过了许多商业应用的考验,在互联网、网络游戏、大数据、电信软件等众多行业得到成功商用。
Netty采用了典型的三层网络架构进行设计,逻辑架构图如下:
图4(Netty三层网络逻辑架构)
第一层:Reactor通信调度层。该层的主要职责就是监听网络的连接和读写操作,负责将网络层的数据读取到内存缓冲区中,然后触发各种网络事件,例如连接创建、连接激活、读事件、写事件等,将这些事件触发到Pipeline中,再由Pipeline充当的职责链来进行后续的处理。
第二层:职责链Pipeline层。负责事件在职责链中有序的向前(后)传播,同时负责动态的编排职责链。Pipeline可以选择监听和处理自己关心的事件。
第三层:业务逻辑处理层,一般可分为两类:a. 纯粹的业务逻辑处理,例如日志、订单处理。b. 应用层协议管理,例如HTTP(S)协议、FTP协议等。
我们都知道影响网络服务通信性能的主要因素有:网络I/O模型、线程(进程)调度模型和数据序列化方式。
在网络I/O模型方面,Netty采用基于非阻塞I/O的实现,底层依赖的是JDKNIO框架的Selector。
在线程调度模型方面,Netty采用Reactor线程模型。常用的Reactor线程模型有三种,分别是:
a、Reactor单线程模型:Reactor单线程模型,指的是所有的I/O操作都在同一个NIO线程上面完成。对于一些小容量应用场景,可以使用单线程模型。
b、Reactor多线程模型:Rector多线程模型与单线程模型最大的区别就是有一组NIO线程处理I/O操作。主要用于高并发、大业务量场景。
c、主从Reactor多线程模型:主从Reactor线程模型的特点是服务端用于接收客户端连接的不再是一个单独的NIO线程,而是一个独立的NIO线程池。利用主从NIO线程模型,可以解决一个服务端监听线程无法有效处理所有客户端连接的性能不足问题。Netty线程模型并非固定不变的,它可以支持三种Reactor线程模型。
在数据序列化方面,影响序列化性能的主要因素有:
a、序列化后的码流大小(网络带宽占用)。
b、序列化和反序列化操作的性能(CPU资源占用)。
c、并发调用时的性能表现:稳定性、线性增长等。
Netty默认提供了对GoogleProtobuf二进制序列化框架的支持,但通过扩展Netty的编解码接口,可以实现其它的高性能序列化框架,例如Avro、Thrift的压缩二进制编解码框架。
通过对Netty网络框架的分析研究以及对比测试(见后面的可行性分析测试报告)可判断,基于Netty的数据采集方案能解决高数据吞吐量和数据实时收集的难点。
》》点击阅读全文
- ?
基于大数据技术的全国高速公路通行数据 动态监测平台建设
巫道之
展开
项目背景
大数据及其应用迅速发展,已经渗透到各个行业和业务职能领域,成为重要的生产因素,2015年8月国务院印发《促进大数据发展行动纲要》,将大数据提升为国家战略。在未来的5-10年,我国将把大数据作为提升政府治理能力的重要手段,大力推进大数据在政府管理中创新应用。为此,《交通运输信息化”十三五”发展规划》中提出要”运用大数据分析技术,开展交通运输经济运行分析、政策实施效果评价、交通发展趋势研判等分析工作,提高交通运输宏观掌控能力”。《交通运输统计发展纲要》也提出要”充分利用大数据、云计算等现代信息技术,变革统计生产方式,再造统计业务流程,丰富统计服务产品,不断提升统计生产能力、管理能力和服务能力,开创交通运输统计发展新局面”。
“十二五”以来,信息化逐渐融入行业管理的方方面面,作为大数据应用的基础,交通运输行业数据资源日益丰富。随着以高速公路联网收费、运输车辆联网联控、智能公交、物流信息平台等为代表的行业信息化重大工程的稳步实施,交通运输行业管理部门所掌握的交通大数据规模爆发性增长,这为推进交通运输行业大数据的应用,以大数据支撑行业管理决策,提高交通行业管理自动化、智能化水平提供了基础性条件。
2012年以来,受交通运输部委托,交通运输部科学研究院以行业中信息化基础最好的高速公路联网收费业务为示范,通过建立全国统一的数据采集规范和数据治理标准,开发基于大数据技术的全国高速公路通行数据动态监测平台,实现了全国29个省高速公路通行数据(源于高速公路联网收费系统)的动态采集,并利用该数据开展行业大数据应用,显著提升了交通运输行业应用大数据的能力,为行业管理决策提供了有力的支撑,成为行业大数据应用创新的典范。
项目概况
主要建设内容
“基于大数据技术的全国高速公路通行数据动态监测平台建设”属于交通运输行业”十二五”信息化重大工程的重要内容,其主要任务是要从全国29个实现了省级高速公路联网收费省份,动态采集其高速公路联网收费数据,并以大数据平台为支撑,在交通运输部实现对全国数据的集中存储与管理,结合行业管理的需要建立业务模型,对全国高速公路联网收费数据进行分析与挖掘,提升行业管理部门的动态监测能力和科学决策水平。
主要问题和挑战
各省高速公路联网收费系统独立建设,系统架构和数据指标差异大
交通行业信息化由交通运输部进行行业指导,各省结合业务管理需要自行进行建设。在高速公路管理信息化领域,各省建设进程差异巨大,东部发达省份高速公路建设起步早,信息化程度相对较高,许多省份在“十一五”期间已经实现了省级高速公路联网收费,而西部许多省份例如新疆、青海等省则在近几年才开始建设省级高速公路联网收费系统。由于管理体制的差异,各省在建设过程中所采用的技术架构不一、数据管理模式千差万别。大部分省高速公路联网收费系统采用ORACLE进行数据存储与管理,而一些发达省份,由于数据量庞大,已经逐步采用大数据管理系统作为数据管理工具。这些差异对从各省的系统中按照统一的技术标准采集数据带来巨大的困难。
各省高速公路联网收费数据指标体系不一,数据质量参差不齐
在数据指标方面,由于不同省份的高速公路联网收费系统都是独立建设,各省结合所采集的指标也存在较大差异,所采集的数据指标和内容也不尽一致,例如,涉及高速公路收费数据的核心数据表,有些省份采集了80多项指标,至有一些省份则拆分成100多项指标。在数据质量方面,不同省份也存在较大差异,例如,数据质量较好的省份,所采集的车牌号信息完整、规范,而一些省份所采集的车牌号,仅仅只录入了车牌号的后3位数字。由于高速公路数据指标体系不统一,数据质量层次不齐,导致数据分析工作难以开展。
交通运输行业缺乏对大数据的处理和分析能力
在交通运输行业,”十三五”之前大量的应用系统建设采用传统的技术架构传输、存储,大数据技术应用在行业管理中的应用处于起步研究阶段。而全国高速公路联网收费数据规模庞大,目前每个月数据量接近10亿条,在全国平台上实现29个省市的高速公路数据的采集,传输,汇聚,对平台的数据承载能力以及稳定性提出了挑战。此外,日益提升的高速公路数据分析需求,对平台数据建模以及计算效率也提出新的要求。
技术方案
针对上述的需求以及技术挑战,自2012年开始,交通运输部科学研究院结合各省高速公路联网收费系统建设的进度以及行业管理决策能力提升的需求对平台进行建设。主要从以下几个方面着手: 1、构建高速公路大数据指标体系,统一数据标准。2、构建跨省的数据采集系统,实现部省之间、不同技术架构系统之间的数据的统一采集、质量控制与数据汇聚。3、利用大数据技术,建立全国高速公路通行数据的管理平台,实现对全国数据的集中存储、管理以及大数据分析挖掘。
统一的数据指标体系
根据交通运输部开展交通运输行业动态监测,进行全国公路运输量测算、分析路网运行特点的需要,经过分析各省所采集的高速公路收费明细数据,我院制定了统一的部级数据采集指标体系,其主要内容包括高速公路公路收费明细数据、高速公路收费站信息、车辆信息以及高速公路电子地图等,核心内容如下:
①明细数据。包括入口网络编号、入口站编号、入口时间、出口网络编号、出口站编号、出口时间、出口车道编号、车牌号、车型代码、车种代码、里程、总轴数、轴型及轴重、车货总重、限重、超限率、是否绿色通道车辆代码、免费类型代码、路径标识、是否ETC车辆代码、ETC车辆电子标签OBU编号、支付方式代码等22项信息。
②数据字典。包括以下5项:
一是高速公路收费站字典。包括网络编号、收费站编号、收费站名称、所在线路编号、所在线路名称、是否省界站、开通时间、所属地市名称、是否开放式收费站、收费站状态、收费站经度、收费站纬度、备注等信息。二是高速公路收费车型字典。包括收费车型代码、车种代码、收费车型定义等信息。三是高速公路货车轴型字典。包括单轴组轴型代码、轴型定义等。四是高速公路免费类型代码字典。包括免费类型代码、免费类型定义等。五是高速公路标识站字典。包括标识站编号、标识站名称、所处路段名称。
此外,高速公路电子地图则以GIS地图的形式采集。
基本业务流程
总体业务主要包括数据报送以及数据分析两部分,数据报送业务主要实现各省原始数据的采集,审核,清洗,存储。数据分析业务则实现了对于数据的分析,查询以及可视化的展示。
总体业务流程如图所示
系统总体架构
整体架构分为6层,数据源层,数据采集层,数据存储层,数据处理层,数据分析层,数据应用层。
数据源层是指各省高速公路联网收费系统,在数据采集层,利用ETL工具和数据传输中间件从各省的前置机采集数据。系统实施时在每个省都部署了数据采集的前置机,在前置机上,通过ETL来对数据进行采集、清洗和标准化,数据传回部里后,利用关系数据库开展常规的统计工作,利用分布式的大数据平台,来进行数据的分析挖掘以及与其他数据之间的关联分析。在数据存储层,采用基于大数据的混合式数据存储架构,利用基于hadoop的分布式文件系统来管理高速公路明细数据,利用关系型数据库存储来存储ods层、dw层和dm层的数据,形成完善的数据仓库架构,在数据处理层,支持批处理、流式处理和混合处理三种方式的数据处理,在数据分析层:利用impala、spark等技术支持即席查询、信息检索,深度挖掘,在数据应用层,以地图、报表的形式展现分析成果。
系统总体框架如图所示:
下图所示为系统数据采集的流程示意图:
系统主要功能
平台主要功能包括数据质量监控、数据统计与查询、专题分析、系统管理、动态配置4个部分,系统的总体功能框架如下图所示:
数据质量监控
通过内置数据审核规则,对各省上报的高速公路通行数据进行质量审核,保证数据的有效性和完整性,对异常数据进行系统报警,提示数据管理人员进行相应处理。数据质量审核包括数据传输监控、数据异常情况预警、数据文件入库情况监控、数据动态监测等。
数据传输监控
数据传输过程监控功能监视ETL工具从各省前置机采集数据以及数据从各省向部传输的过程中是否存在数据丢失的情况。
数据异常情况预警
数据异常情况预警对数据指标按照设定的审核规则进行审核,如有异常则预警提示。审核规则包括入口网络编号+入口站编号不在枚举字典中、货车总轴数为空、货车车货总重为空等多项规则。
数据入库情况监控
根据数据记录数、最小记录时间、最大记录时间等条件实时监控当前数据入库进度,确保数据完整,不存在丢失的情况。
数据动态监测
数据量监测功能对每月各省数据量指标进行监控,从数据指标的角度,通过与上年、上月数据的变化情况监测各省报送的数据质量是否存在问题,主要包括数据量监测、车流量预警、行驶量预警等。
数据统计与查询
根据交通运输部开展运输量统计以及行业经济运行分析的需要,在系统中自动生成客车(分车型)的车流量、行驶量,省内的流量流量等;货车(分轴数)的车流量、行驶量、货物发送量、货物周转量、省内的流量流量等;货车的车货总重、超限率情况;免费车情况、ETC车流量占比情况等40余张监测报表,用于经济运行分析、向国务院报送的交通运输简明月报等相关分析材料中。
数据分析与挖掘
OD分析
该功能对省内城市与城市之间客流、货流的趋势和迁移规律,在地图中用可视化的方式反映某一个城市到其他城市的车辆迁徙特点,或者一个省全部城市之间的车辆迁移特点。
车籍地分析
根据高速公路通行数据中的车牌号信息,在地图中按照”外地车来本省”和”本省车去外地”两个维度,反映省与省之间高速公路车辆行驶的特点和联系情况。
热点收费站分析
该功能主要对全国各省收费站通行量进行统计分析,通过预设不同的筛选条件,如省份,开始时间、结束时间、车辆类型等条件,对通行量排名前10的收费站进行图、表多维展示,对某一个收费站,还支持直接查看其24小时的车流量情况。
收费站流量分析
该功能主要对全国各省高速公路收费站流量数据进行统计分析,通过预设不同的筛选条件,如省份,开始时间、结束时间、车辆类型等条件,对通行量进行图、表多维展示。
通行量时空分析
该功能主要用于分析高速公路上行驶车辆的时间和空间分布的特征,反映车辆在高速公路上行驶的时间和距离特点。
高速公路车流量分析
该功能主要从高速公路车流量角度出发,对不同省份(区域或全国)、不同时间段、不同车型的通行量情况进行统计,利用地图和曲线进行多维展示。
?NCTech推出虚拟数据采集系统iSTAR Pulsar
厮守
展开
位于爱丁堡的英国公司NCTech正在采用VR/AR并进行扩展,并提供360度真实成像系统来简化图像文档的工作流程,甚至可以将其用于远程设置。他们在这一领域的最新成果是推出全新的虚拟数据采集系统iSTAR Pulsar,以便在移动中捕获数据。
iSTAR Pulsar设计用于车辆,无人机或步行时捕获360度数据。该系统设计简单易用,不需要任何摄影经验甚至电脑操作。iSTAR Pulsar应用程序提供了规划路线,以及在线查看和分享内容的能力。
iSTAR Pulsar专门为捕捉360度移动数据而设计,并与索尼和英特尔联合开发。该系统可用于各种工业和智能城市应用。
产品详情如下:
无与伦比的11K球形分辨率将iSTAR Pulsar定义为几乎是标准8K球形系统像素分辨率的两倍,可提供6050万像素的全景图像。
预先校准到亚像素级别与先进的深度分析算法相结合,确保在移动平台上实现最精确的全景拼接。
iSTAR Pulsar针对移动平台进行了优化,可在处理过程中调整捕获速率,以提供一致的距离间隔,从而最大限度地减少数据存储和处理要求。
全自动后处理流水线包括一个可选的自动水平仪稳定功能,以纠正步行捕捉时产生的任何俯仰和滚动。
坚固的设计,耐候性和防震性,内置高精度GPS和IMU传感器,确保与GIS系统直接集成。
先进的对称和非对称加密技术确保从采集到交付的端到端数据安全。
NCTech在本周早些时候在伦敦Geo商业展上展示了iSTAR Pulsar ,并将在下个月初在加利福尼亚州阿纳海姆会议中心举行SPAR 3D Expo上展示他们的产品 。
“只需轻敲一下,iSTAR Pulsar就可以提供全自动的360°全景图像拍摄功能。它不是传统意义上的摄像头,它捕获大量高分辨率数据,并连接到我们庞大的云处理管道,从捕获到交付提供全自动工作流程。”
?六大主流大数据采集平台架构分析
酆南松
展开
随着大数据越来越被重视,数据采集的挑战变的尤为突出。今天为大家介绍几款数据采集平台:
Apache Flume Fluentd Logstash Chukwa Scribe Splunk Forwarder
大数据平台与数据采集
任何完整的大数据平台,一般包括以下的几个过程:
数据采集–>数据存储–>数据处理–>数据展现(可视化,报表和监控)
其中,数据采集是所有数据系统必不可少的,随着大数据越来越被重视,数据采集的挑战也变的尤为突出。这其中包括:
我们今天就来看看当前可用的六款数据采集的产品,重点关注它们是如何做到高可靠,高性能和高扩展。
1、Apache Flume
Flume 是Apache旗下的一款开源、高可靠、高扩展、容易管理、支持客户扩展的数据采集系统。 Flume使用JRuby来构建,所以依赖Java运行环境。
Flume最初是由Cloudera的工程师设计用于合并日志数据的系统,后来逐渐发展用于处理流数据事件。
Flume设计成一个分布式的管道架构,可以看作在数据源和目的地之间有一个Agent的网络,支持数据路由。
每一个agent都由Source,Channel和Sink组成。
Source
Source负责接收输入数据,并将数据写入管道。Flume的Source支持HTTP,JMS,RPC,NetCat,Exec,Spooling Directory。其中Spooling支持监视一个目录或者文件,解析其中新生成的事件。
Channel
Channel 存储,缓存从source到Sink的中间数据。可使用不同的配置来做Channel,例如内存,文件,JDBC等。使用内存性能高但不持久,有可能丢数据。使用文件更可靠,但性能不如内存。
Sink
Sink负责从管道中读出数据并发给下一个Agent或者最终的目的地。Sink支持的不同目的地种类包括:HDFS,HBASE,Solr,ElasticSearch,File,Logger或者其它的Flume Agent。
Flume在source和sink端都使用了transaction机制保证在数据传输中没有数据丢失。
Source上的数据可以复制到不同的通道上。每一个Channel也可以连接不同数量的Sink。这样连接不同配置的Agent就可以组成一个复杂的数据收集网络。通过对agent的配置,可以组成一个路由复杂的数据传输网络。
配置如上图所示的agent结构,Flume支持设置sink的Failover和Load Balance,这样就可以保证即使有一个agent失效的情况下,整个系统仍能正常收集数据。
Flume中传输的内容定义为事件(Event),事件由Headers(包含元数据,Meta Data)和Payload组成。
Flume提供SDK,可以支持用户定制开发:
Flume客户端负责在事件产生的源头把事件发送给Flume的Agent。客户端通常和产生数据源的应用在同一个进程空间。常见的Flume 客户端有Avro,log4J,syslog和HTTP Post。另外ExecSource支持指定一个本地进程的输出作为Flume的输入。当然很有可能,以上的这些客户端都不能满足需求,用户可以定制的客户端,和已有的FLume的Source进行通信,或者定制实现一种新的Source类型。
同时,用户可以使用Flume的SDK定制Source和Sink。似乎不支持定制的Channel。
2、Fluentd
Fluentd是另一个开源的数据收集框架。Fluentd使用C/Ruby开发,使用JSON文件来统一日志数据。它的可插拔架构,支持各种不同种类和格式的数据源和数据输出。最后它也同时提供了高可靠和很好的扩展性。Treasure Data, Inc 对该产品提供支持和维护。
Fluentd的部署和Flume非常相似:
Fluentd的架构设计和Flume如出一辙:
Fluentd的Input/Buffer/Output非常类似于Flume的Source/Channel/Sink。
Input
Input负责接收数据或者主动抓取数据。支持syslog,http,file tail等。
Buffer
Buffer负责数据获取的性能和可靠性,也有文件或内存等不同类型的Buffer可以配置。
Output
Output负责输出数据到目的地例如文件,AWS S3或者其它的Fluentd。
Fluentd的配置非常方便,如下图:
Fluentd的技术栈如下图:
FLuentd和其插件都是由Ruby开发,MessgaePack提供了JSON的序列化和异步的并行通信RPC机制。
Cool.io是基于libev的事件驱动框架。
FLuentd的扩展性非常好,客户可以自己定制(Ruby)Input/Buffer/Output。
Fluentd从各方面看都很像Flume,区别是使用Ruby开发,Footprint会小一些,但是也带来了跨平台的问题,并不能支持Windows平台。另外采用JSON统一数据/日志格式是它的另一个特点。相对去Flumed,配置也相对简单一些。
3、Logstash
Logstash是著名的开源数据栈ELK (ElasticSearch, Logstash, Kibana)中的那个L。
Logstash用JRuby开发,所有运行时依赖JVM。
Logstash的部署架构如下图,当然这只是一种部署的选项。
一个典型的Logstash的配置如下,包括了Input,filter的Output的设置。
几乎在大部分的情况下ELK作为一个栈是被同时使用的。所有当你的数据系统使用ElasticSearch的情况下,logstash是首选。
4、Chukwa
官网:https://chukwa.apache.org/
Apache Chukwa是apache旗下另一个开源的数据收集平台,它远没有其他几个有名。Chukwa基于Hadoop的HDFS和Map Reduce来构建(显而易见,他用Java来实现),提供扩展性和可靠性。Chukwa同时提供对数据的展示,分析和监视。很奇怪的是它的上一次 github的更新事7年前。可见该项目应该已经不活跃了。
Chukwa的部署架构如下:
Chukwa的主要单元有:Agent,Collector,DataSink,ArchiveBuilder,Demux等等,看上去相当复杂。由于该项目已经不活跃,我们就不细看了。
5、Scribe
代码托管:https://github/facebookarchive/scribe
Scribe是Facebook开发的数据(日志)收集系统。已经多年不维护,同样的,就不多说了。
6、Splunk Forwarder
以上的所有系统都是开源的。在商业化的大数据平台产品中,Splunk提供完整的数据采金,数据存储,数据分析和处理,以及数据展现的能力。
Splunk是一个分布式的机器数据平台,主要有三个角色:
Search Head负责数据的搜索和处理,提供搜索时的信息抽取。
Indexer负责数据的存储和索引 Forwarder,负责数据的收集,清洗,变形,并发送给Indexer
Splunk内置了对Syslog,TCP/UDP,Spooling的支持,同时,用户可以通过开发 Input和Modular Input的方式来获取特定的数据。在Splunk提供的软件仓库里有很多成熟的数据采集应用,例如AWS,数据库(DBConnect)等等,可以方便的从云或者是数据库中获取数据进入Splunk的数据平台做分析。
这里要注意的是,Search Head和Indexer都支持Cluster的配置,也就是高可用,高扩展的,但是Splunk现在还没有针对Farwarder的Cluster的功能。也就是说如果有一台Farwarder的机器出了故障,数据收集也会随之中断,并不能把正在运行的数据采集任务Failover到其它的 Farwarder上。
总结
我们简单讨论了几种流行的数据收集平台,它们大都提供高可靠和高扩展的数据收集。大多平台都抽象出了输入,输出和中间的缓冲的架构。利用分布式的网络连接,大多数平台都能实现一定程度的扩展性和高可靠性。
其中Flume,Fluentd是两个被使用较多的产品。如果你用ElasticSearch,Logstash也许是首选,因为ELK栈提供了很好的集成。Chukwa和Scribe由于项目的不活跃,不推荐使用。
Splunk作为一个优秀的商业产品,它的数据采集还存在一定的限制,相信Splunk很快会开发出更好的数据收集的解决方案。
高速数据采集系统
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并
我们尽快联系您