- ?
如何建设工业大数据可视化系统
水瑶
展开
(本文系土人创新原创,转载请注明出处)
一、工业大数据的特性
工业大数据不同于商业大数据,工业领域通常有大量的机理模型、专家经验的深厚积累,其分析范式更加注重数据科学与行业经验的融合。
工业大数据产业生态根植于传统大数据和工业自动化产业,以IBM、SAP、微软、GE、西门子等为代表的巨头企业利用先发者优势占据产业链重要环节。
工业大数据应用成为领先企业智能化实施重点方向,但数据模型及经验积累不足仍制约着全流程、全系统的综合应用发展。
二、可视化是推动工业大数据发展的引擎
让大数据有意义,使之更贴近大多数人,最重要的手段之一就是数据可视化。数据可视化是寻路仪,从字面上理解,就如同街头的路标指引你到公路,从象征意义上理解,其颜色、大小或抽象元素的位置都会传达信息。在某种意义上,恰当的可视化标识可以提供较短的路线,帮助指导决策,成为通过数据分析传递信息的一种重要工具。
通过增加数据可视化使用,企业能够发现他们追求的价值。创建更多的信息图表,使用更多的资源,让他们更快地获得更多的信息。这使他们意识到他们已经知道很多信息,而这些信息先前就应该是很明显的。这就增加了部门的作用,因为他们能够提出更好的问题。它创建了似乎没有任何联系的数据点之间的连接。人们能够分辨出有用的和没用的数据,这样,就能最大限度的提高他们的生产力,让信息的价值最大化。
利用大数据资产对任何公司来说都是很重要的,不论公司大小。当大数据的潜力通过可视化达到最大时,之前未看到的趋势就很容易被发现。
具体到工业大数据领域,其可视化又有自己独特的特点,呈现出与互联网大数据可视化不同的难点和方向,我总结了一下,工业大数据可视化有以下几个特点:
1、数据量呈现海量趋势,且更新频率极高。
2、大量的监控点,无法进行有效地显示。
3、整体与局部如何有效地结合。
4、局部与细节如何兼顾。
5、如何实现工业数据的有效检索和有效推送。
6、如何将数据转化为有效地信息提供给用户。
三、数据可视化产品体系结构
ProdaOn是土人创新工坊自主创新研发的一套面向工业智能制造的数据可视化解决方案,向制造企业提供安全、快捷的工业生产数据接入服务,并通过云平台数据分析服务,向制造企业输出智能生产(提出ProductionIntelligence,简称PI的概念)数据分析服务,制造企业通过ProdaOn提供的PI服务,可实现对生产设备的实时监控和管理,并能通过ProdaOn云端服务实现对企业生产数据的远程移动访问与多维可视化展现。
ProdaOn核心产品体系
3.1数据整合
数据整合是把在不同数据源的数据收集、整理、清洗,转换后加载到一个新的数据源,为数据消费者提供统一数据视图的数据集成方式。
工业生产数字化转型不仅仅意味着企业简单的数字化,而是把数字作为智能制造的核心驱动力需要利用数据去整合产业链和价值链。
3.2数据处理
工业数据来源于企业产业链的各个环节,通过条形码、二维码、RFID、工业传感器、工业自动控制系统、工业物联网、ERP、CAD/CAM/CAE/CAI等技术采集,工业企业中生产线处于高速运转,由工业设备所产生、采集和处理的数据量远大于企业中计算机和人工产生的数据,从数据类型看也多是非结构化数据,生产线的高速运转则对数据的实时性要求也更高,所以必须对多源、异构数据信息进行同构化处理,以构建完整的数据结构视图。
3.3可视化分析
对数据统计分析结果按照自定义方式进行形象、直观的可视化展视。ProdaOn提供灵活、易用、高性能的可视化分析能力,帮助客户快速洞察市规律,及时发现业务盲点;同时提供多达几十种可视化展示效果,让数据说话。
3.4智能分析
在万物互联的时代,获得海量数据并不困难,但只有当数据插上智能分析的翅膀,才能从“大而无当”成为真正为企业和客户创造价值的智能大数据。ProdaOn提供筛选分析、多维分析、对比拆分、数据预警、图表联动等功能,土人创新拥有专业的大数据分析团队,具备聚类算法、决策树、神经网络、基因算法等深层次数据挖掘能力。
3.5报告分发
ProdaOn内置基于角色的访问控制体系,让企业的每个人的工作都实现数据驱动;同时还支持多种类型终端的展示,不仅能够在PC端使用,还支持在移动端数据展示,让企业人员随时随地掌控业务情况。
土人创新是一个接地气的创业项目孵化工坊,一直坚持提供科学精准、人性化的专业IT技术服务,聚焦“网络安全、移动应用、物联大数据”三大方向,为客户提供信息安全化、应用便捷化、数据可视化、分析智能化服务。
- ?
工业大数据采集时需要注意的问题
贺三毒
展开
工业大数据最基础的工作当然是数据采集,没有数据,一切跟大数据相关的技术、应用都是空中楼阁,那么,工业大数据的采集和传统的互联网大数据采集有哪些不同,又会涉及到哪些技术呢?今天我们就来聊一聊。
在谈工业大数据采集之前,先看看都有哪些类型的工业数据需要采集。互联网的数据主要来自于互联网用户和服务器等网络设备,主要是大量的文本数据、社交数据以及多媒体数据等,而工业数据主要来源于机器设备数据、工业信息化数据和产业链相关数据。这些上一部分我们已经基本谈到了。在此不再赘述。
那么这些数据从类型上能分为哪些类型呢?主要包括以下几种:
1、海量的Key-Value数据。在传感器技术飞速发展的今天,包括光电、热敏、气敏、力敏、磁敏、声敏、湿敏等不同类别的工业传感器在现场得到了大量应用,而且很多时候机器设备的数据大概要到ms的精度才能分析海量的工业数据,因此,这部分数据的特点是每条数据内容很少,但是频率极高。
2、文档数据。包括工程图纸、仿真数据、设计的CAD图纸等,还有大量的传统工程文档。
3、信息化数据。由工业信息系统产生的数据,一般是通过数据库形式存储的,这部分数据是最好采集的。
4、接口数据。由已经建成的工业自动化或信息系统提供的接口类型的数据,包括txt格式、JSON格式、XML格式等。
5、视频数据。工业现场会有大量的视频监控设备,这些设备会产生大量的视频数据。
6、图像数据。包括工业现场各类图像设备拍摄的图片(例如,巡检人员用手持设备拍摄的设备、环境信息图片)。
7、音频数据。包括语音及声音信息(例如,操作人员的通话、设备运转的音量等)。
8、其他数据。例如遥感遥测信息、三维高程信息等等。
那么,对如此海量的工业数据进行采集,主要有哪些技术难点呢?主要包括以下几方面:
1、数据量巨大。任何系统,在不同的数据量面前,需要的技术难度都是完全不同的,我们设计一个数据采集软件,如果每秒采集1000条,我相信大部分程序员都可以很好地完成这个工作,如果是10W呢?1000W呢?甚至几十亿呢?如果频率提高到ms级呢?这就是技术难度非常复杂的任务了。
如果单纯是将数据采到,可能还比较好完成,但采集之后还需要处理,因为必须考虑数据的规范与清洗,因为大量的工业数据是“脏”数据,直接存储无法用于分析,在存储之前,必须进行处理,对海量的数据进行处理,从技术上又提高了难度。
2、工业数据的协议不标准。互联网数据采集一般都是我们常见的HTTP等协议,但在工业领域,会出现ModBus、OPC、CAN、ControlNet、DeviceNet、Profibus、Zigbee等等各类型的工业协议,而且各个自动化设备生产及集成商还会自己开发各种私有的工业协议,导致在工业协议的互联互通上,出现了极大地难度。很多开发人员在工业现场实施综合自动化等项目时,遇到的最大问题及时面对众多的工业协议,无法有效的进行解析和采集。
下面这张图是我从网上找到的一张工业协议的汇总图,其实这仅仅是众多协议中的一部分。
3、视频传输所需带宽巨大。传统工业信息化由于都是在现场进行数据采集,视频数据传输主要在局域网中进行,因此,带宽不是主要的问题。但随着云计算技术的普及及公有云的兴起,大数据需要大量的计算资源和存储资源,因此工业数据逐步迁移到公有云已经是大势所趋了。但是,一个工业企业可能会有几十路视频,成规模的企业会有上百路视频,这么大量的视频文件如何通过互联网顺畅到传输到云端,是开发人员需要面临的巨大挑战。
4、对原有系统的采集难度大。在工业企业实施大数据项目时,数据采集往往不是针对传感器或者PLC,而是采集已经完成部属的自动化系统上位机数据。这些自动化系统在部署时厂商水平参差不齐,大部分系统是没有数据接口的,文档也大量缺失,大量的现场系统没有点表等基础设置数据,使得对于这部分数据采集的难度极大。
5、安全性考虑不足。原先的工业系统都是运行在局域网中,安全问题不是突出考虑的重点。一旦需要通过云端调度工业之中最为核心的生产能力,又没有对安全的充分考虑,无异于“傻白甜”彻底暴露在“猥琐男”面前!一旦造成损失,是难以弥补的。2015年,受网络安全事件影响的工业企业占比达到30%,因病毒造成停机的企业高达20%。仅美国国土安全部的工业控制系统网络应急响应小组(ICS-CERT)就收到了295起针对关键基础设施的攻击事件。不久之前,德国一家钢铁厂遭受高级持续性威胁(APT)网络攻击,导致工控系统的控制组件和整个生产线被迫停止运转,损失惨重。前一段时间的半个美国网络瘫痪,对于工业来说也算是“警钟长鸣”。
因此,在选择工业大数据的采集方案时,一定要慎重选择,不要迷恋新技术,更多的要考虑安全、可靠、稳定,毕竟工业领域出现问题是有可能造成无法挽回的损失的。
- ?
工业大数据,我们要看得更高(下篇)
邓凤妖
展开
工业大数据应用的价值潜力巨大。但是,实现这些价值还有很多工作要做。一个是大数据意识建立的问题。过去,企业也会在生产制造过程中记录相关数据,但由于没有大数据的意识,数据分析手段也不足,很多实时数据被丢弃或束之高阁,大量数据的潜在价值被埋没。 还有一个重要问题是数据孤岛的问题。很多工业企业的数据分布于企业中的各个孤岛中,特别是在大型跨国公司内,要想在整个企业内提取这些数据相当困难。 因此,工业大数据应用的一个重要议题是集成应用,想要充分的利用大数据任重而道远。
工业大数据结合云计算 数据增值还靠分析处理 美国辛辛那提大学讲座教授、美国国家科学基金会智能维护系统产学合作中心主任李杰曾说:“工业大数据分析,你有数据不代表你有资产,你看多少书不代表你就是有多少知识的人,你要懂得消化,数据本身不会说话,分析之后才会说明,那你怎么去把它分析出来。” 大数据技术的战略意义不在于掌握庞大的数据信息,而在于对这些含有意义的数据进行专业化处理。换而言之,如果把大数据比作一种产业,那么这种产业实现盈利的关键,在于提高对数据的“加工能力”,通过“加工”实现数据的“增值”。 技术是大数据价值体现的手段和前进的基石。在这里分别从云计算、分布式处理技术、存储技术和感知技术的发展来说明大数据从采集、处理、存储到形成结果的整个过程。大数据与云计算的关系就像一枚硬币的正反面一样密不可分。大数据必然无法用单台的计算机进行处理,必须采用分布式架构。它的特色在于对海量数据进行分布式数据挖掘。但它必须依托云计算的分布式处理、分布式数据库和云存储、虚拟化技术。 大数据分析常和云计算联系到一起,因为实时的大型数据需要特殊的技术,以有效地处理大量的容忍经过时间内的数据。适用于大数据的技术,包括大规模并行处理(MPP)数据库、数据挖掘电网、分布式文件系统、分布式数据库、云计算平台、互联网和可扩展的存储系统。 自2013年开始,大数据技术已开始和云计算技术紧密结合,预计未来两者关系将更为密切。除此之外,物联网、移动互联网等新兴计算形态,也将一齐助力大数据革命,让大数据营销发挥出更大的影响力。
工业大数据共享和安全 政策法规与数据平台共发展 由于工业大数据是数字化的和横跨企业边界甚至是跨越国界的,因此安全、开放、共享等一些政策问题必须得到有效解决。随着工业大数据的价值越来越被重视,生产设施和数据中的商业秘密和专利技术也必须同样受到保护。智能制造时代,研究并出台相应的安全策略、架构和标准,保护制造企业的生产系统的安全、数据安全,提升系统的紧密性、完整性和有效性,将是个非常重要的问题。 在利用云计算、大数据推动商业模式创新方面,很多政府都带头示范,进行了卓有成效的探索尝试。但是,公共数据开放的正面事例还不算常态。在很多情况下,我国发展大数据产业都要面临着“信息孤岛”的挑战。跨部门、跨行业的数据共享仍不顺畅,有价值的公共信息资源和商业数据开放程度低,基本处于死锁状态,无法顺畅流动。 另外,对于企业来说,大数据产业标准的不统一,无形之中增加了企业使用数据的成本。大数据产品应具有安全性、易用性和稳定性,评价这些性能需要一把“尺子”,需要制定出一些标准。 对此,政府部门应将所拥有的丰富数据资源合理利用,也需要运用大数据来提升治理效率。通过向社会开放数据、加强与社会企业和组织的数据合作、向社会购买服务等方式,推动环保、医疗、教育、交通等关键领域的大数据整合与集成应用,提高政务和公共服务效率。 此外,据有关专家介绍,我国信息安全和数据管理体系尚未建立。数据所有权、隐私权等相关法律法规和信息安全、开放共享等标准规范缺乏,技术安全防范和管理能力不够,尚未建立起兼顾安全与发展的数据开放、管理和信息安全保障体系,制约了大数据发展。针对这些问题,需要政府制定平衡数据使用与数据安全保护的政策,制定鼓励数据共享的奖励措施、建立有效的促进创新的知识产权框架,以及面向公众开放政府部门拥有的能够公开的大数据,从而促进工业大数据共享和整合以及价值创造。 未来,企业需要认清数据共享与安全的现实,从新的角度来确保自身以及客户数据,所有数据在创建之初便需要获得安全保障,而并非在数据保存的最后一个环节,仅仅加强后者的安全措施已被证明于事无补。与此同时,基于数据这个基础平台,也将建立起跨领域的数据共享平台,之后,数据共享将扩展到企业层面,并且成为未来产业的核心一环。 把握现在 探索大数据应用新模式 “大数据是信息化发展的延伸。”中国信息通信研究院移动与大数据部副主任魏凯在接受记者专访时表示。他直言“大数据”这一概念与日常生活是息息相关的,无论是政府办公、企业运转,还是车间生产、物流运输,每天都有大量的数据生成。 对于实时数据的应用,以前很长一段时间都是国外软件垄断,然而,朗坤公司于2002年开始组建团队,进行技术储备,研发实时数据软件技术。历时3年,第一个稳定版产品发布,从而在能源行业开始取代国外的实时数据库产品。 通过项目的实施推动了国电云南实现企业的“网络化办公,数据化描述,流程化管理,精确化控制”目标,将国电云南打造成了国内一流,国际先进的集约化、标准化、数字化的发电企业。 当然,我国在大数据的技术创新与支撑能力方面还有所不足。大数据需要从底层芯片到基础软件再到应用分析软件等信息产业全产业链的支撑,无论是新型计算平台、分布式计算架构,还是大数据处理、分析和呈现方面与国外均存在较大差距,难以满足各行各业大数据应用需求。 未来,大数据综合试验区建设不是简单的建产业园、建数据中心、建云平台等,而是要充分依托已有的设施资源,把现有的利用好,把新建的规划好,避免造成空间资
- ?
2018年最值得推荐的6款大数据采集工具
青烟
展开
数据肯定是无价的。但分析数据并非易事,因为结果越准确,成本就越高。鉴于数据急剧增长,需要一个过程来提供有意义的信息,最终变成实用的洞察力。
数据挖掘是指这个过程:在庞大数据集当中发现模式,将它转换成有效的信息。该技术利用特定的算法、统计分析、人工智能和数据库系统,从庞大数据集中提取信息,并转换成易于理解的形式。本文介绍了广泛用于大数据行业的6种综合数据挖掘工具。
1. Rapid Miner
Rapid Miner是一个数据科学软件平台,为数据准备、机器学习、深度学习、文本挖掘和预测分析提供一种集成环境。它是领先的数据挖掘开源系统之一。
该程序完全用Java编程语言编写。该程序提供了一个选项,以便用户试用大量可任意嵌套的操作符,这些操作符在XML文件中有详细说明,可由Rapid Miner的图形用户界面来构建。
2. Oracle Data Mining
它是Oracle高级分析数据库的代表。市场领先的公司用它最大限度地发掘数据的潜力,做出准确的预测。该系统配合强大的数据算法,锁定最佳客户。
此外,它可识别异常情况和交叉销售机会,让用户能够根据需要运用不同的预测模型。此外,它以所需的方式定制客户画像。
3. IBM SPSS Modeler
说到大规模项目,IBM SPSS Modeler最适合。在这个建模器中,文本分析及其最先进的可视化界面极具价值。它有助于生成数据挖掘算法,基本上不需要编程。
它可广泛用于异常检测、贝叶斯网络、CARMA、Cox回归以及使用多层感知器和反向传播学习的基本神经网络。
4. KNIME
Konstanz Information Miner是一个开源数据分析平台。你可以迅速在其中部署、扩展和熟悉数据。在商业智能界,KNIME号称是有助于为毫无经验的用户提供预测智能的平台。
此外,数据驱动的创新系统有助于发掘数据潜力。此外,它包括数千个模块和随时可用的示例以及一大批集成的工具和算法。
5. Python
Python是一种免费的开源语言,因易用性常常与R相提并论。与R不同,Python学起来往往很容易上手,易于使用。许多用户发现可以在几分钟内开始构建数据,并进行极其复杂的亲和度分析。
只要你熟悉变量、数据类型、函数、条件语句和循环等基本编程概念,最常见的业务用例数据可视化就很简单。
6.火车采集器
火车采集器由合肥乐维信息技术有限公司开发,是一款专业的网络数据采集/信息挖掘处理软件,通过灵活的配置,可以很轻松迅速地从网页上抓取结构化的文本、图片、文件等资源信息,可编辑筛选处理后选择发布到网站后台,各类文件或其他数据库系统中。
- ?
大数据十大平台集合
羊明杰
展开
1数据星河大数据平台
全球首款大数据产业链生态平台,大数据界的App store。
实现数据模型、可视化引擎工具、应用场景、采集爬虫工具、清洗脱敏工具、数据分析平台、数据开发平台、数据管理平台、数据安全组件等大数据资产的分类展示、检索和使用。
一站式服务,快速实现大数据应用设计,同时可在平台进行应用产品交易。
2大数据可视化平台
标准的、友好易用、具备丰富展示形式、与底层数据分析实现解耦。
提供丰富的专业级可视化图表组件,在线进行图表配置、导出,提供使用指导。
提供可视化产品工厂,以及Dashboard自定义布局。
具备可视化编程能力,供用户快速开发可视化图表应用。
3企信宝APP
拥有约9000万海量企业信息数据。
提供失信企业及失信人查询及公布失信榜单,全国各企业查询,股东高管数据挖掘,企业网站地址查询,企业风险信息监测。
4农业大数据平台
涵盖农业监测预警大数据平台、农产品全产业链追溯预警大数据平台和农业产业链企业信用大数据平台。
覆盖农林牧副渔各行业,贯穿农业生产经营管理服务全过程。
目标群体包括部级农业部门、地方农业部门、涉农企业、农业金融机构等。
5金融大数据——54个九宫格小场景
九宫格应用场景包含四大类别,分别是基础数据库类、决策类、预测类、预警类,基础数据库类场景满足客户对基本数据的查询,决策类场景助理用户根基数据分析得到的价值信息进行有效决策,预测类场景便于用户对于潜在的风险及时规避。同时,用户可以根据自身需求进行场景化自定义组合,以满足个性需求。
6工商大数据平台
包括工商大数据分析展示、企业信用信息大数据监管和市场主体全景谱图大数据分析服务。
一网、一库、一中心、一平台、一门户,提升工商公共服务能力、市场监管能力、辅助决策能力和助推发展能力
7食药监大数据平台
对食品、药品、餐饮、中药材的生产、仓储、分销、物流运输、市场巡检及消费者等信息,以及产品名称、执行标准、配料、生产工艺、标签标识等数据,进行采集、跟踪、分析。
使监管部分实现产品种养、生产、销售、流通、公众服务、物流等环节的整个生命周期的监管
通过互联网等途径,实时呈现给消费者,实现食品药品全过程的全知晓。
8旅游大数据平台
显示最直观的客源、客流、经济收入数据、履约企业运营趋势、市场景气指数等指标。
管理部门可以从宏观角度了解地区旅游产业的整体发展水平和竞争力,辅助管理者制定基于大数据的行业发展决策。
所有数据来源于近五年累计数据(2011-2017),每周更新。
9民意云大数据平台
从海量的数据中分析民意诉求,精准分析民意热点——这是大数据在服务民意诉求中的重要作用。九次方民意云大数据平台,通过提供大数据操作台,方便用户实时全面了解区域内民意变化,根据推送消息进行应急反应。
10传播力监测大数据
根据全网采集的文章标题、作者、来源、时间等信息,计算文章的规范被转载量、非规范被转载量、以及文章的影响地域分析,并将各指标进行加权算法,帮助没提了解具体文章的全网传播详情。
协助监管部门加强没提传播监管和提升媒体机构的传播咯、公信力、影响力和引导力。
- ?
工业大数据分析的几种途径
陈子默
展开
“大数据+工业”是国家的战略目标,盲目的生产只会造成货品的堆积或者是匮乏,而工业大数据分析能够实现智能化的生产,在大数据的严密严控下,企业能够联合各个平台,实现企业的智能化管理。目前工业大数据分析主要有以下三种途径,下面来一一解析。
工业大数据分析第一种途径:用物联网实现数据统筹
工业大数据分析是建立在系统物联网体系基础之上,企业只有系统的构建了“软件+云服务”的互联网+体系,才能实现大数据的分析与处理。在工业大数据分析工作中,物联网是极其重要的途径,通过物联网可以准确而迅速的采集到工业生产中的各个数据,使得大数据分析结果更科学更准确。
第二种途径:在系统机构中寻找数据模型
工业智能运作管理系统是企业非常重要的管理系统之一,工业大数据分析第二个重用的途径就是在该系统中,将企业数据汇集在一起,建成应用集成总线与平台。由于工业中的系统之间的数据全部统一采集,实现无缝集成和分析。
第三种途径:将先进分析工具与数据平台结合
通过时间序列、图像、视频、机器学习、地理空间、预测模型、优化、模拟和统计过程控制等先进的分析工具与企业内的大数据收集平台结合系统分析,从而洞见尚未显现的情况。将物联网数据与先进的软件分析平台相结合,即能获取软件中强大的存储功能,又能快速实现数据的分析功能。
以上就是工业大数据分析的三种主要的途径,大数据分析工作至关重要,其途径是分析工作的第一步,价格适中的工业大数据分析能够帮助企业实现智能化的管理体系。因此,有需求的企业可以找专业的公司帮助自己完成大数据的分析。比如美林数据的Tempo大数据分析平台,就是一款集数据接入、数据处理、数据挖掘、数据可视化、数据应用于一体的软件产品。它秉持“智能、互动、增值”的设计理念,面向企业级用户提供自助式数据探索与分析能力,为企业提供从BI到AI的一体化数据分析与应用解决方案。目前Tempo大数据分析平台已经广泛应用于电力、制造、金融等行业领域,为用户数据价值发现与应用提供强有力的支撑,帮助企业实现基于数据的运营监控、工艺优化、客户分析、精准营销等多种深入业务的智能数据应用,助力企业数字化运营。
- ?
工业大数据通用业务架构
的狼
展开
工业大数据一般如何进行处理呢?我画了一个相对通用的架构图来解释一下:
工业大数据在业务逻辑大的分层上和互联网大数据类似,一般都分为三部分,数据采集层、数据处理层和数据展现层,当然,具体到一个实际案例中,或者说根据不同的应用场景,可以划分为更多的层次,比如数据处理可以分为元数据管理层、数据交互层、数据分析层等等,如果你有兴趣,可以把大数据划分为N层。在分层的同时,还有许多同等重要的事情,例如安全保障、运维服务、测试规范等等,要都说清楚,基本也就搞不清楚工业大数据是怎么回事了。所以我们今天只讨论通用的、简化的、适用于一般场景的架构,而且仅仅是业务和逻辑层面的,技术层面的我们后面再详细说明。
工业大数据系统非常重要的,也是基础的层次是数据采集。没有数据采集,所有的强大的、华丽的、技术非常NB的各种东东只能躲在黑暗里哭泣,英雄无用武之地。在这一层,也是工业大数据与互联网大数据差异非常大的一层,互联网大树的数据采集主要靠用户的各种操作,例如网页浏览、系统登录、信息的互动、鼠标的点击等,而工业大数据的数据来源更加多种多样,最基本的是用于采集各类工业信号的传感器,通过传感器的采集,可以获得机器设备的运行状态、环境的指标、操作人的操作行为等各类信息。除通过传感器采集的信息,还包括现场的视频信息,各类图像设备拍摄的图片(例如,巡检人员用手持设备拍摄的设备、环境信息图片),语音及声音信息(例如,操作人员的通话、设备运转的音量等),遥感遥测信息等等,这些信息都是通过各类设备传输的。除此之外,还有操作人员手工录入的各类信息,采集软件抓取的企业内网的信息、互联网上与企业相关的信息等等。这些信息共同构成了数据采集的来源。
数据采集领域也是自动化和信息化交叉最多的领域,其实也是一般IT从业人员比较头疼的领域,跨学科嘛,哈!
数据采集结束后,就进入了数据处理阶段,这一阶段,软件人员就可以大显身手了,大部分技术都和互联网大数据技术差不太多。通常,我们会对采集到的数据先进行一定程度的处理,各类工业协议需要解析、视频流需要解码、语音需要识别等等,识别处理好后再对数据进行规范、清洗,洗刷刷完成后,干净数据才好用。需要立即处理的数据,例如报警、监测等,直接送到实时处理系统中进行处理,不着急的非急诊数据请进入仓库,按照类型存起来先。然后慢慢分析加工。存储可能会用到多种数据库,包括工业实时数据库、关系型数据库、地理数据库、分布式数据库、非关系型数据库、内存数据库等,这些数据库的整合、管理、链接又是工业大数据的一个难题,这个我们放到后面详细谈。今天先聊宏观。
洗干净、切成块、冷冻好的红烧肉,啊,不是,存储好的工业数据如此之海量,怎么推送给用户就成为数据可视化层要干的事情了。数据可视化最近也比较火,原先做报表的,现在都号称大数据可视化公司了,其实,单纯的大数据可视化是没有意义的,没有对工业业务的深入理解,很难做出让客户的满意的可视化结果。可视化包括许多方式,如报表、二维地图、三维地图、三维模型、短信、手机APP、微信、大屏等等,总之,通过一切手段让用户看到自己想看的数据即可。
基于通用业务架构,都涉及到哪些技术环节,需要了解哪些技术呢,咱们下一部分再来谈这个问题。
- ?
六大主流大数据采集平台架构分析
白乘风
展开
随着大数据越来越被重视,数据采集的挑战变的尤为突出。今天为大家介绍几款数据采集平台:
Apache Flume Fluentd Logstash Chukwa Scribe Splunk Forwarder
大数据平台与数据采集
任何完整的大数据平台,一般包括以下的几个过程:
数据采集–>数据存储–>数据处理–>数据展现(可视化,报表和监控)
其中,数据采集是所有数据系统必不可少的,随着大数据越来越被重视,数据采集的挑战也变的尤为突出。这其中包括:
我们今天就来看看当前可用的六款数据采集的产品,重点关注它们是如何做到高可靠,高性能和高扩展。
1、Apache Flume
Flume 是Apache旗下的一款开源、高可靠、高扩展、容易管理、支持客户扩展的数据采集系统。 Flume使用JRuby来构建,所以依赖Java运行环境。
Flume最初是由Cloudera的工程师设计用于合并日志数据的系统,后来逐渐发展用于处理流数据事件。
Flume设计成一个分布式的管道架构,可以看作在数据源和目的地之间有一个Agent的网络,支持数据路由。
每一个agent都由Source,Channel和Sink组成。
Source
Source负责接收输入数据,并将数据写入管道。Flume的Source支持HTTP,JMS,RPC,NetCat,Exec,Spooling Directory。其中Spooling支持监视一个目录或者文件,解析其中新生成的事件。
Channel
Channel 存储,缓存从source到Sink的中间数据。可使用不同的配置来做Channel,例如内存,文件,JDBC等。使用内存性能高但不持久,有可能丢数据。使用文件更可靠,但性能不如内存。
Sink
Sink负责从管道中读出数据并发给下一个Agent或者最终的目的地。Sink支持的不同目的地种类包括:HDFS,HBASE,Solr,ElasticSearch,File,Logger或者其它的Flume Agent。
Flume在source和sink端都使用了transaction机制保证在数据传输中没有数据丢失。
Source上的数据可以复制到不同的通道上。每一个Channel也可以连接不同数量的Sink。这样连接不同配置的Agent就可以组成一个复杂的数据收集网络。通过对agent的配置,可以组成一个路由复杂的数据传输网络。
配置如上图所示的agent结构,Flume支持设置sink的Failover和Load Balance,这样就可以保证即使有一个agent失效的情况下,整个系统仍能正常收集数据。
Flume中传输的内容定义为事件(Event),事件由Headers(包含元数据,Meta Data)和Payload组成。
Flume提供SDK,可以支持用户定制开发:
Flume客户端负责在事件产生的源头把事件发送给Flume的Agent。客户端通常和产生数据源的应用在同一个进程空间。常见的Flume 客户端有Avro,log4J,syslog和HTTP Post。另外ExecSource支持指定一个本地进程的输出作为Flume的输入。当然很有可能,以上的这些客户端都不能满足需求,用户可以定制的客户端,和已有的FLume的Source进行通信,或者定制实现一种新的Source类型。
同时,用户可以使用Flume的SDK定制Source和Sink。似乎不支持定制的Channel。
2、Fluentd
Fluentd是另一个开源的数据收集框架。Fluentd使用C/Ruby开发,使用JSON文件来统一日志数据。它的可插拔架构,支持各种不同种类和格式的数据源和数据输出。最后它也同时提供了高可靠和很好的扩展性。Treasure Data, Inc 对该产品提供支持和维护。
Fluentd的部署和Flume非常相似:
Fluentd的架构设计和Flume如出一辙:
Fluentd的Input/Buffer/Output非常类似于Flume的Source/Channel/Sink。
Input
Input负责接收数据或者主动抓取数据。支持syslog,http,file tail等。
Buffer
Buffer负责数据获取的性能和可靠性,也有文件或内存等不同类型的Buffer可以配置。
Output
Output负责输出数据到目的地例如文件,AWS S3或者其它的Fluentd。
Fluentd的配置非常方便,如下图:
Fluentd的技术栈如下图:
FLuentd和其插件都是由Ruby开发,MessgaePack提供了JSON的序列化和异步的并行通信RPC机制。
Cool.io是基于libev的事件驱动框架。
FLuentd的扩展性非常好,客户可以自己定制(Ruby)Input/Buffer/Output。
Fluentd从各方面看都很像Flume,区别是使用Ruby开发,Footprint会小一些,但是也带来了跨平台的问题,并不能支持Windows平台。另外采用JSON统一数据/日志格式是它的另一个特点。相对去Flumed,配置也相对简单一些。
3、Logstash
Logstash是著名的开源数据栈ELK (ElasticSearch, Logstash, Kibana)中的那个L。
Logstash用JRuby开发,所有运行时依赖JVM。
Logstash的部署架构如下图,当然这只是一种部署的选项。
一个典型的Logstash的配置如下,包括了Input,filter的Output的设置。
几乎在大部分的情况下ELK作为一个栈是被同时使用的。所有当你的数据系统使用ElasticSearch的情况下,logstash是首选。
4、Chukwa
官网:https://chukwa.apache.org/
Apache Chukwa是apache旗下另一个开源的数据收集平台,它远没有其他几个有名。Chukwa基于Hadoop的HDFS和Map Reduce来构建(显而易见,他用Java来实现),提供扩展性和可靠性。Chukwa同时提供对数据的展示,分析和监视。很奇怪的是它的上一次 github的更新事7年前。可见该项目应该已经不活跃了。
Chukwa的部署架构如下:
Chukwa的主要单元有:Agent,Collector,DataSink,ArchiveBuilder,Demux等等,看上去相当复杂。由于该项目已经不活跃,我们就不细看了。
5、Scribe
代码托管:https://github/facebookarchive/scribe
Scribe是Facebook开发的数据(日志)收集系统。已经多年不维护,同样的,就不多说了。
6、Splunk Forwarder
以上的所有系统都是开源的。在商业化的大数据平台产品中,Splunk提供完整的数据采金,数据存储,数据分析和处理,以及数据展现的能力。
Splunk是一个分布式的机器数据平台,主要有三个角色:
Search Head负责数据的搜索和处理,提供搜索时的信息抽取。
Indexer负责数据的存储和索引 Forwarder,负责数据的收集,清洗,变形,并发送给Indexer
Splunk内置了对Syslog,TCP/UDP,Spooling的支持,同时,用户可以通过开发 Input和Modular Input的方式来获取特定的数据。在Splunk提供的软件仓库里有很多成熟的数据采集应用,例如AWS,数据库(DBConnect)等等,可以方便的从云或者是数据库中获取数据进入Splunk的数据平台做分析。
这里要注意的是,Search Head和Indexer都支持Cluster的配置,也就是高可用,高扩展的,但是Splunk现在还没有针对Farwarder的Cluster的功能。也就是说如果有一台Farwarder的机器出了故障,数据收集也会随之中断,并不能把正在运行的数据采集任务Failover到其它的 Farwarder上。
总结
我们简单讨论了几种流行的数据收集平台,它们大都提供高可靠和高扩展的数据收集。大多平台都抽象出了输入,输出和中间的缓冲的架构。利用分布式的网络连接,大多数平台都能实现一定程度的扩展性和高可靠性。
其中Flume,Fluentd是两个被使用较多的产品。如果你用ElasticSearch,Logstash也许是首选,因为ELK栈提供了很好的集成。Chukwa和Scribe由于项目的不活跃,不推荐使用。
Splunk作为一个优秀的商业产品,它的数据采集还存在一定的限制,相信Splunk很快会开发出更好的数据收集的解决方案。
- ?
工业大数据数据采集常见的工业协议简介(上)
EG
展开
在工业大数据领域的从业者有很大一部分是传统IT从业人员,对于工业控制协议比较陌生,因此再做工业大数据采集时,对于各类工业协议有时容易搞不清楚,我简单把在做工业大数据采集时常见的几种工业协议整理了一下,以便搞清这些工业协议的概念和区别。
为了容易理解,我把常见的工业协议按照OSI(Open System Interconnect)参考模型分到了不同层次,注意,这只是为了容易理解和区分各类协议,实际上,随着各种协议的发展,很多自身都跨越了很多层次,能够实现多层协议的功能,我们做的划分只是它最重要的功能所处的协议层。
接下来,按照从低到高的顺序,介绍一下上面图中这几种常见的工业协议。
1、RS232
在串行通讯时,要求通讯双方都采用一个标准接口,使不同的设备可以方便地连接起来进行通讯。RS-232-C接口是目前最常用的一种串行通讯接口。RS-232-C是美国电子工业协会EIA(Electronic Industry Association)制定的一种串行物理接口标准。RS是英文“推荐标准”的缩写,232为标识号,C表示修改次数(“RS-232-C”中的“-C”只不过表示RS-232的版本,所以与“RS-232”简称是一样的) 。。RS-232-C总线标准设有25条信号线,包括一个主通道和一个辅助通道。工业控制的RS-232口一般只使用RXD、TXD、GND三条线。通常 RS-232 接口以9个引脚 (DB-9) 或是25个引脚 (DB-25) 的型态出现,一般个人计算机上会有两组 RS-232 接口,分别称为 COM1 和 COM2。
2、RS485
随着企业信息化法发着的需要,企业在仪表选型时其中的一个必要条件就是要具有联网通信接口。最初是数据模拟信号输出简单过程量,后来仪表接口是RS232接口,这种接口可以实现点对点的通信方式,但这种方式不能实现联网功能。随后出现的RS485解决了这个问题。
485通讯接口一个对通讯接口的硬件描述,它只需要两根通讯线,即可以在两个或两个以上的设备之间进行数据传输。这种数据传输的连接,是半双工的通讯方式。在某一个时刻,一个设备只能进行发送数据或接收数据。而RS232是全双工,最少3条通信线(RX,TX,GND),因为使用绝对电压表示逻辑,由于干扰,导线电阻等原因,通讯距离不远,低速时几十米也是可以的。
在RS232或RS485设备联成的设备网中,如果设备数量超过2台,就必须使用RS485做通讯介质,RS485网的设备间要想相互通信息只有通过“主(Master)”设备中转才能实现,这个主设备通常是PC,而这种设备网中只允许存在一个主设备,其余全部是"从(Slave)"设备。而现场总线技术是以ISO/OSI模型为基础的,具有完整的软件支持系统,能够解决总线控制、冲突检测、链路维护等问题 。
3、CAN
控制器局域网CAN( Controller Area Network)属于现场总线的范畴,是一种有效支持分布式控制系统的串行通信网络。是由德国博世公司在20世纪80年代专门为汽车行业开发的一种串行通信总线。由于其高性能、高可靠性以及独特的设计而越来越受到人们的重视,被广泛应用于诸多领域。CAN协议分为二层:物理层和数据链路层。CAN的信号传输采用短帧结构,传输时间短,具有自动关闭功能,具有较强的抗干扰能力。CAN支持多主工作方式,并采用了非破坏性总线仲裁技术,通过设置优先级来避免冲突,通讯距离最远可达10KM/5Kbps/s,通讯速率最高可达40M /1Mbp/s,网络节点数实际可达110个。
由于CAN总线本身的特点,其应用范围目前已不再局限于汽车行业,而向自动控制、航空航天、航海、过程工业、机械工业、纺织机械、农用机械、机器人、数控机床、医疗器械及传感器等领域发展。
- ?
工业大数据平台实现
崔虔纹
展开
当下,互联网技术与可再生能源革命正在开启新一轮工业革命的大幕,人类已经站在新时代的门槛上。
随着物联网(IOT)技术的飞速发展,对传统企业,能否抓住这一历史机遇,依靠技术进步,改善和产业素质与提高生产效率,对企业进行智能化、工业化相结合的改进升级,从传统的厂发展为高技术企业。借助互联网+物联网等技术, 坚持“创新驱动、质量为先、绿色发展、结构优化、人才为本”的基本方针,实现“中国制造2025”伟大目标。
在工业领域中,以产品数据为核心,极大延展了传统工业数据范围,同时还包括工业大数据相关技术和应用。其主要来源可分为以下三类:第一类是生产经营相关业务数据。第二类是设备过程数据。第三类是外部数据。
上述三种数据中,最难获取的是第二类数据,是产业升级中实现过程自动化、机械制造自动化、管理自动化的关键数据来源依据。
工业大数据平台由后台服务器、WEB服务器、手机APP、数据库、后台监控软件、前端展示框架、现场采集控制主机、工业微电脑控制器、物联网模块、无线网关、4G传输设备、传感模块等组成。
现场MQTT服务器英特隆工业级微电脑控制器无线网关集中器传感器模块GPRS数据传输数据化展示自组网IOT模块整机拓扑框图
工业大数据采集平台
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并