中企动力 > 商学院 > 数据采集系统资料
  • ?

    NCTech推出虚拟数据采集系统iSTAR Pulsar

    Tewfik

    展开

    位于爱丁堡的英国公司NCTech正在采用VR/AR并进行扩展,并提供360度真实成像系统来简化图像文档的工作流程,甚至可以将其用于远程设置。他们在这一领域的最新成果是推出全新的虚拟数据采集系统iSTAR Pulsar,以便在移动中捕获数据。

    iSTAR Pulsar设计用于车辆,无人机或步行时捕获360度数据。该系统设计简单易用,不需要任何摄影经验甚至电脑操作。iSTAR Pulsar应用程序提供了规划路线,以及在线查看和分享内容的能力。

    iSTAR Pulsar专门为捕捉360度移动数据而设计,并与索尼和英特尔联合开发。该系统可用于各种工业和智能城市应用。

    产品详情如下:

    无与伦比的11K球形分辨率将iSTAR Pulsar定义为几乎是标准8K球形系统像素分辨率的两倍,可提供6050万像素的全景图像。

    预先校准到亚像素级别与先进的深度分析算法相结合,确保在移动平台上实现最精确的全景拼接。

    iSTAR Pulsar针对移动平台进行了优化,可在处理过程中调整捕获速率,以提供一致的距离间隔,从而最大限度地减少数据存储和处理要求。

    全自动后处理流水线包括一个可选的自动水平仪稳定功能,以纠正步行捕捉时产生的任何俯仰和滚动。

    坚固的设计,耐候性和防震性,内置高精度GPS和IMU传感器,确保与GIS系统直接集成。

    先进的对称和非对称加密技术确保从采集到交付的端到端数据安全。

    NCTech在本周早些时候在伦敦Geo商业展上展示了iSTAR Pulsar ,并将在下个月初在加利福尼亚州阿纳海姆会议中心举行SPAR 3D Expo上展示他们的产品 。

    “只需轻敲一下,iSTAR Pulsar就可以提供全自动的360°全景图像拍摄功能。它不是传统意义上的摄像头,它捕获大量高分辨率数据,并连接到我们庞大的云处理管道,从捕获到交付提供全自动工作流程。”

  • ?

    浅谈工业生产现场数据采集

    人痴缠

    展开

    工业生产现场数据采集原则有两点:一是目的性,二是经济性;

    目的性是指在做设备的数据采集之前,先要明确所要采集的数据是否具有可观的价值。工业现场其实已经有很多的数据采集系统了,SCADA、HMI什么的也都是应用很广泛了,但是,其中又有多少数据被充分的分析,挖掘其潜在的价值的呢?

    大部分情况是,采集了数据后并不知道怎么去利用。国内大部分的工业现场还处在解决生产过程可见性的阶段,能够先把数据采集上来是当务之急,至少能够实时地了解到现场都发生了什么。在智能制造背景下,要将目光放长远,在做数据采集之前,尽可能地多去思考一下什么样的数据对我们的业务改进帮助最大,这样也许会让我们在数据采集方面的投资回报率更好看一些。

    经济性是指投资的回报效益。对于工业现场的数据采集,很多人第一个想法就是装传感器。不管什么样的项目,我们首先需要考虑的是投资回报率的问题,装传感器的方式可能是投资最大的一种。因此,做设备层的数据采集,一定要结合我们的数采目标,充分利用设备的现有条件(比如,设备已经具备的上位机系统、已经具备的通讯协议等)用最经济高效的方式来做数采技术路线的设计。

    工业数据采集设备分类:有上位机系统的设备(设备自带的监控系统)、基于非TCP/IP通讯协议的设备、基于TCP/IP通讯协议的设备、不具备通讯接口的设备。

    自动化系统设备数据采集系统采集方法主要是通过Web系统、生产线工作站系统、OPC服务器等配置对生产线上的各个设备的生产数据进行监控。同时将有效数据采集仓储在数据库中。这对整个生产系统进行生产线、工序参数、工作流程、设备参数、设备类型、OPC服务、通讯协议的全方位设置、管理。

    如需增加设备,只要在中心管理系统增加相应的设备类型,配置好相关的采集参数即可,可有效节约成本;生产过程中通过缓存交互数据,不直接和数据库交互,极大的提高了数据采集的性能;通过心跳检测程序,实时反馈生产设备的异常,保证生产数据完整性。

    一种自动化生产线设备数据采集方法,可以是如下步骤:

    1.根据自动化生产线上各种设备的不同协议类型,将支持OPC相关协议的设备与OPC连接;将支持TCP开放协议的设备与生产线工作站系统中的网口交换机连接;将支持COM开放协议的设备与生产线工作站系统中的串口交换机连接;

    2.通过Web系统配置生产线的全局属性;

    3.生产线工作站系统启动时从Web系统中同步本生产线所有相关配置,并存入缓存;

    4.生产线工作站初始化时,根据设备在Web系统的协议类型,连接每个设备,并启用OPC监听、TCP监听或COM监听。对于“基于TCP/IP通讯协议”,比较常用的有OPC Classic、Siemens S7、Modbus-TCP等通用协议,也有设备厂商自行定义的私有协议。这些协议的特点是都是基于TCP/IP协议簇,只是应用层协议不同。采用这些协议的设备一般都会有RJ45的接口,也就是以太网口,都可以直接通过以太网接入到车间网络中。对这些设备的数据采集,我们需要做的就是对上述协议的解析。对于OPC等通用协议,已经有很多成熟的SCADA产品可以利用,近些年,也有很多开源框架、商业化的组件可以应用,比如Eclipse neoSCADA,Kepware等等,都能够在完成上述协议的解析的同时,将其转换为一些IT领域常用的接口(RESTful API),方便其他信息系统的对接。

    5、将监听到的每个设备数据写入工作站数据库。

    设备数据分析,可以通过多种查询工具可以快速查询生产实时数据、相关历史数据。给管理人员重要决策提供有效数据基础。可以对数据进行横向比较,可以对历史数据进行分析。通过系统统计分析没太机器的运转率,故障时间累计以及车间设备总体利用率。系统可以提供柱状图、饼图、报表等分析工具,展现现场设备运转统计分析数据。自动统计每天限的产量数据,可以按照不同的班组、时间段等多种条件进行综合查询。

    同时对于设备的故障管理也可以进行相关数据记录,比如不同的设备及其台号,故障类型、时间段等多种条件进行历史查询赛选。这样可以进行历史数据查询,更好的帮助技术人员进行设备故障原因分分析,提高问题解决效率。

  • ?

    “最牛社保职工”发明采集系统 数据采集3分钟搞定

    依珊

    展开

    “最牛社保职工”发明采集系统

    社保卡数据采集,3分钟搞定 投用一年为安顺市民节约160万元

    市民在操作数据采集系统。

    “没想到这么方便,几分钟就能办好!”9月12日下午,安顺市社保局办事大厅内,市民王蕾站在社保卡制卡数据采集机前,刷身份证、输入电话号码、根据提示拍照,简单几个步骤,不到3分钟,社保卡信息已采集完毕。

    从“便民”出发萌生新创意

    这个让市民“少跑路”的信息采集“神器”,正是安顺市社会保险事业局网络管理科科长龙元鑫的新发明。

    据了解,以往参保人申请制作社会保障卡,需自费到指定的商业相馆拍照,再到社保经办机构服务窗口排队进行数据采集,如果相片不规范,还得返回相馆重拍,整个过程至少半天才能完成。

    从事社保工作15年来,看到参保人长时间排队等待,来回折腾于金融部门——社保机构——工作单位之间,2013年,计算机软件专业出身的龙元鑫萌生了一个想法:自己设计一个集信息采集和拍照于一体的系统!让群众办理业务少掏钱、少跑路、少耗时。

    说做就做,于是,龙元鑫开始了一场漫长的创造之旅。

    忍受3年的枯燥坚持研发

    构思、画图、设计控制板,自掏腰包购买相机、升降机、机柜,绘制电路图、制作电路板、编写程序控制硬件……而这些工作,龙元鑫都只能利用业余时间来完成。

    “家里客厅、卧室到处都是我要用的零件。”龙元鑫笑着说,“女儿也总是被我拉过来当模特试验拍照效果,后来一听到爸爸叫拍照就要躲”。并且,长期伏案导致才40岁出头的他犯了颈椎病,也正因为如此,家人免不了有些抱怨。

    时间一天天过去了,作品还总是有需要改进的地方,对于这个过程,龙元鑫用了两个字来总结——枯燥。远离了原来一起打羽毛球的朋友,没时间陪孩子,龙元鑫偶尔也想过放弃,第二天却又再次全身心地投入其中。

    投用一年为市民节约160万

    功夫不负有心人,2016年初,龙元鑫研制的“社保卡制卡数据采集系统”第一代开始投用,参保人只需3分钟就能完成信息录入。

    仅投用的第一年,该系统就采集了制卡人数据8万余条,将全市291.8万户籍人口持卡率提高了2.7个百分点。如按每拍摄一张制卡相片花费20元计算,仅拍照费用一项就为制卡人群节约了160万余元。

    “目前安顺户籍人口尚有183.4万人未制作社保卡,而这类人群大都居住在农村。”龙元鑫说,他接着对系统进行升级改造,2017年,体积缩小一半,重量约50斤,功能更完善的第二代、第三代便携“社保卡制卡数据采集系统”已覆盖全市98个乡镇,还有30多台可以随时带进高校、农村进行参保数据采集。

    初步预算,这一系统可为百姓节省3000多万元,将有效助力扩大社会保障。(实习生甘良莹 记者张光平 来源:贵州都市报)

  • ?

    数据采集接口网关

    爱丝特

    展开

    FC-Gateway数据采集接口网关是北京华恒信远专门为工业标准通讯接口OPC Server软件、数据采集接口软件配套定制开发的一款嵌入式硬件产品,内置两个标准RS-232串口(其中一个串口可以通过跳线设置成RS-485)和两个RJ45以太网口,型号为Gateway-227B, 此外,还有Gateway-240B、Gateway-230B等嵌入式工控机型号。 该设备操作系统有Windows、Linux两种,其功能与特点如下: 1、OPC服务器:可连接DCS、PLC等控制系统,读写实时数据,包装成OPC Server工业标准通讯接口,提供给实时数据库系统、先进控制系统和MES系统集成商; 2、安全隔离:当数据采集接口网关为实时数据库系统提供实时数据时,它一般位于自动化控制系统和实时数据库服务器之间,由于数据采集接口网关采用了内置单向数据传输技术,可达到自动化控制系统和实时数据库服务器之间的安全隔离目的。 3、该产品操作系统、数据采集程序等均固化,不可修改。一旦被修改,重新启动后,自动恢复到初始状态,可防止病毒以及黑客软件攻击。 4、结构先进、安装方便,该产品高度1U,可以直接安装在标准机柜中,独特的散热技术,1U机箱有多个磁悬浮风扇散热。 5、数据采集冗余设计:支持双机双网冗余通讯。 6、可作为InfoPlus.21、PI、PHD等实时数据库系统的数据采集终端,也可写数据至关系数据库,为MIS、ERP等管理信息系统提供生产实时数据。

  • ?

    探码Web数据源采集分析系统

    叶兰

    展开

    摘要:面对互联网海量的信息,如何方便快捷的获取有效的信息对企业已经变得至关重要了。如果采用原始的手工收集方式,费时费力且毫无效率,面对越来越多的信息资源,劳动强度和难度可想而知。

    2017年,探码科技开发一个金融行业投融资交易大数据平台,在项目进行前期,需要对资料的搜集准备和数据源的整理,最后整理出来了很多需要采集的数据源,为了进一步落实数据源的数据量、是否有采集价值、采集价值有多大等一列问题,探码科技研发了一套探码Web数据源采集分析系统。

    Web数据源采集分析要么对网站访客行为的分析,即包括:网站流量报告,也可能包括电子邮件回应率、直接邮件活动资料、销售与客户资料、使用者效能资料如点击热点地图、或者其他定制需求资讯等等,然后进行行为分析,最终形成网络数据报告,以此来了解和优化网站;要么是爬取整个网站数据源资料、栏目、项目等进行数据源的采集,然后进行分析形成信息数据报告,最终用在:产生潜在的客户列表;从竞争对手中收集企业所需信息;抓取新兴业务数据;建立企业的产品目录;整合行业信息,辅助经营决策;确定新客户,增加新订单;挖掘老客户,获取利益……总之,Web页面内容所显示的即可采集进行分析形成可视化为企业所用。

    探码Web数据源采集分析系统主要采用Ruby on Rails + vue.js + Bootstrap实现数据源分析系统的后台和前端展示的搭建。根据各行业的需求可将整体分为多个模块多种形式进行可视化。其主要的步骤:1、从目标Web文档中获得待采集信息;2、判断待采集信息类型是否是所需数据,3、剔除无用的、重复的信息数据,按照所需信息数据进行过滤校验;4、保存所需数据。

    探码Web数据源采集分析系统——采集

    其特征是利用云计算服务器协同工作,能快速采集大量数据,而且也避免了一台计算机硬件资源的瓶颈,另外对数据采集的要求越来越高,传统post采集不能解决的技术问题也逐步被解决,以探码Kapow/Dyson采集器为代表的新一代智能采集器,能模拟人的思维,模拟人的操作,从而彻底解决了ajax等技术难题,因为网页一般都是设计来给人浏览的,所以能模拟人的智能采集器工作起来就非常顺利,不论后台技术是什么,当数据最终显示在人的面前的时候,智能采集器就开始提取。这最终把计算机的能力发挥到了极致,使得计算机可以代替人做所有网页数据采集的工作。同时利用大数据云采集技术,把计算机的计算能力也发挥到了极致。

    探码Web数据源采集分析系统——分析

    主要是通过对既有数据源进行分类整理、栏目划分、字段拆解,形成一个完整的数据源分析报告,以及对采集到的信息数据进行智能分析最终通过数据源的分析,发现数据之间的关系、规律和取值范围,为数据采用任务做准备。

    探码Web数据源采集分析系统的优势

    1、全方位的采集

    只要是Web页面可以看见的内容都可以采集,采集的内容数据包括文字、图片、flash动画、视频等各类内容;

    2、可实现复杂的对象的采集

    可实现正文和回复内容的同时采集,一级页面二级页面内容也可轻松实现合并,采集的内容可以是分散在多个页面内,结果可以是复杂的父子表结构;

    3、采集速度比普通采集快

    探码Web数据源采集分析系统采用前沿先进的技术,可运行多条线程同时抓取采集,采集速度比普通采集快上很多倍;

    4、精准度高,覆盖面广

    只要能在Web页面中可以看到的内容,几乎都可以按照需要的格式、所需信息数据进行采集。

    5、数据可视化,结果输出多样化

    采集的信息数据可采用探码TMDash可视化,呈现给企业,简单易读易懂。

    互联网时代,先进的大数据,人工智能和深度学习等技术实现了互联网平台的数据接口,探码Web数据源采集分析系统能提供专业的数据采集服务,精准采集分析所需信息数据。

    注:Web数据源采集系统的原理类似于搜索引擎的爬虫,是合法的。

  • ?

    令人羡慕的程序猿!小哥的数据采集系统一年销售400余万

    影清瘦

    展开

    现在更多的人们去尝试使用与购买了无人机,这也代表着无人机的发展越来越先进,愈发的走进人们的生活当中。但现在市场中的无人机公司部队仍旧没有过多的扩张,于是就有更多的人们想要进入到无人机的市场中。胡心怡便是其中一个。但无人机,并没有想象中那么好做。

    胡心怡曾是上海交通大学机械自动化专业的学生,身为浙江人,他总觉得体内流淌着浙商的血液,计划着在年满30岁时创业圆梦。他决定从旧公司离职,做一家为B端客户制造工业级无人机并提供完整解决方案的公司——伯镭智能科技。

    2015年7月,胡心怡找好了办公场地,同团队研发第一款工业无人机。

    就在同月,一家位于上海的央企航天机电联系到了胡心怡,决定来他的办公室看一看。航空机电的需求,是做一套可以搭载热成像镜头的无人四旋翼飞行器,用来完成光伏板巡检等工作。而航空机电最后选择了伯镭科技,并给了他们30余万元的合同。

    在创业初期,资源匮乏的情况下,每一步都需要走得小心谨慎。在2016年3月,伯镭科技成为了大疆授权的行业应用系统方案提供商,在大疆飞行平台上进行二次开发。

    以屋顶光伏电站前期勘测为例,传统人工探测需要至少2天时间,由工人爬上屋顶后测量具体数值。测量后,人员会将数据带回公司,用CAD做出简图后,再完成光伏电站设计。而使用伯镭科技开发的屋顶勘测套装只需要20分钟就可以完成上述全部工作。

    据胡心怡介绍,目前在浙江省已有超过10家B端客户在使用伯镭科技的产品及服务,客单价在数万元不等,而客户使用伯镭的工具勘测一个屋顶的成本价格在100余元/次。

    下一步,胡心怡计划将伯镭科技发展为智能化的大数据企业。他希望通过利用机器学习等技术,在云平台上教会计算机如何识别工程后期巡检过程出现的问题。例如可用无人机完成桥梁巡检,并将桥体出现的裂缝、坑槽、锈蚀等问题通过提取特征后使用机器学习算法将其归类,并自动生成报告送交客户。

    现阶段,伯镭科技在全国范围内已拥有近50家客户。其主要获取客户的手段为通过行业渠道进行推广。2016年,公司共完成400余万元销售额,总计服务客户超50家,仅在浙江省就有超过10家采购单位。

    据了解,该公司已在2016年6月完成天使轮融资,现正开启Pre-A轮融资,计划融资金额为500万元,拟出让10%股份。

    未来,胡心怡计划进行新一轮融资,资金将用于团队建设、产品研发、市场推广等方面。

    本文来自生意我最行,创业家系授权发布,略经编辑修改,版权归作者所有,内容仅代表作者独立观点。

  • ?

    制造业生产数据采集的作用与意义

    雅楠

    展开

    制造业生产数据采集的作用与意义导读:制造业是我国国民经济的支柱产业,也是推动工业化的原动力,现代制造业已经并且正在深刻地改变着人们的生产方式、生活方式甚至社会文化。全球经济一体化的趋势愈演愈烈,国际竞争不断加剧,制造业的发展必须不断提高在质量保障、品种多样化、快速设计制造、快速检测响应以及快速重组等方面的要求。于是,“以信息化带动工业化,以工业化促进信息化”被提到了前所未有的高度、深度和广度。

    制造业生产数据采集的作用与意义

    众所周知,制造业的信息化主要包括设计数字化、生产数字化、装备数字化、管理数字化、企业数字化等。信息化的大趋势使世界各国争先恐后的把先进技术和信息化引进到传统工业和制造业。1990 年,美国 AMR(Advanced Manufacturing Research)所提出的制造行业的ERP(Enterprise Resources Planning,企业资源规划)/MES(Manufacturing Execution System,制造执行系统)/PCS(Process Control System,过程控制系统)三层结构,已经成功地在许多行业得到了应用,并被越来越多的企业所认可.

    美国 AMR 研究公司对MES 的定义表述为:MES 是一个常驻工厂层的信息系统,介于企业领导层的计划系统与生产过程的直接工业控制系统之间,它以当前视角向操作人员、管理人员提供生产过程的全部资源(人、设备、材料、工具和客户要求)的数据和信息,其着重点是将信息技术运用于改善制造过程。

    而作为MES中低层的数据采集功能,可以实现对生产现场各种数据的收集、整理工作,是进行物料跟踪、生产计划、产品历史记录维护以及其它生产管理的基础。它可以为企业中其他例如ERP等管理信息系统提供实时数据。另一方面,MES也要从其它管理系统中获取相关的数据以保证MES自身正常运行。因此要满足MES快速、实时的要求,作为各种功能模块运行基础的数据就显得十分重要。一个迅速而可靠的数据采集系统是整个MES能够正常稳定工作的有力保证。

    制造企业面临的数据采集现状

    作为车间底层的数据采集系统,在企业实际生产过程中却存在着许多困难,尤其是在离散企业中由于自动化程度较低,往往存在着以下特点:

    生产过程不可视:主要体现在不能实时了解生产现场中在制品、人员、设备、物料等制造资源和加工任务状态的动态变化。

    生产过程复杂性:由于产品结构和加工工艺的复杂性,造成生产过程中各制造过程的关联性强,生产环境复杂多变(临时插单、材料短缺等) 。

    制造过程信息集成度低:制造过程中的各种信息不能有效进行集成,导致产能不能得到充分利用。

    信息不能有效与上层管理系统进行集成:这种隔断造成生产过程不透明,生产进度、在制品状况、设备利用状况等关键数据不能到达管理层,增加了过程管理和生产决策的复杂性。

    制造过程信息的真实性差:现场数据信息过多依赖人机交互界面通过人工录入,增加了出错的机率。

    制造过程信息的实时性低:作业任务随市场需求的频繁调整变化,不利于制造过程信息的实时采集,再加上制造过程信息交互的速度和效率低下,造成企业对市场变化的响应速度慢。

    企业设计层和管理层到车间层特别是车间设备层的信息采集困难,一方面车间设备层的重要信息难于采集和上传,无法达到对生产过程的监控。另一方面上层系统难以深入到车间和设备层,从而影响管理信息系统的准确运行,使动态信息成为脱离实际的无源之水难于及时下达,从而使整个企业信息化难以产生更大的效益。

    上述特点反映了制造车间迫切需要对制造过程进行信息化的数据采集管理,从而建立一个完整高效的离散制造车间数据采集及其分析处理系统是实现离散车间信息化的基础。数据采集及其分析处理系统的主要功能就是将车间的各种离散数据完整实时的采集到车间数据库中,并进行初步的分析处理,将车间生产的信息实时准确的反馈到车间的管理层,加强管理人员对车间生产现场的监控和管理,并为企业管理人员制定生产计划提供依据。

    华磊迅拓科技专业提供SCADA数据采集监控系统,OrBit-SCADA(Supervisory Control And Data Acquisition)系统是"制造业物联网信息总线"的具体实现,它包含两个层次的含义:一是分步式的实时数据采集系统,即工业通讯与控制的PC上位机系统 ;另一个是生产现场的场景建模和显示系统。

  • ?

    岸电电源的数据采集系统介绍

    褚山晴

    展开

    岸电电源系统采集包括空调、通风系统、报警系统、输入/输出开关柜、输入/输出变压器、岸电电源、拖缆设施、船舶并网等设备的运行状态、电气参数、启停控制、故障报警等信号,信号类型包括:

    (1)硬线接口:具备启动、停止、复位、紧急停止命令。

    (2)工作状态信号:具备岸电电源就绪、运行、停止、报警、故障(停机)信号。

    (3)模拟量接口:具备同步指令给定信号(4~20mA)、输出电流、电压、频率(4~20mA)接口。同时必须考虑预留至少一定数量的输入输出点位。

    通信网络控制系统还需采用本地控制和远程控制2种方式,其中本地控制采用LCD现场控制盘来实现,远程控制采用以太网、modbus或profibus等通信协议来实现。

    现场LCD控制盘可同时显示多个实际值与给定值,可存储多条控制器数据,每个数值应带有时间标签;可作为WEB SERVER以便PC机远程存取、控制触摸屏人机界面上载与下载文件。主要界面:岸电电源并网同步过程监视、岸电电源运行情况、参数显示、设定、岸电电源故障诊断。主要参数记录和查询包括:输出电流、输出电压、输出频率、网侧输入电流、网侧输入电压、警报事件、故障事件。显示功能:应可对输出电源的频率、三相电压平均值、三相电流平均值、三相线(相)电压、三相线电流、三相不平衡度、有功功率、无功功率、功率因素等参数显示并对有功功率电度、无功功率电度进行统计计量。所有数据应可以在装置屏上显示,且能够支持一定时间内连续供电参数(包括频率、电压、电流等参数)等记录和回放功能,所有这些数据应随时可在控制系统中查询。

    远程操作系统功能,应该具备完成整个系统的操作、监控、控制等功能;同时,操作系统还应配置数据管理功能,包括:事件、故障记录与保存;能够将运行过程中的事件、故障记录并保存到数据库,为维护、维修提供数据支持。

    创统SPS岸电电源系统

  • ?

    网页信息采集,大数据采集技术综述

    虞白卉

    展开

    大数据采集技术就是对数据进行ETL操作,通过对数据进行提取、转换、加载,最终挖掘数据的潜在价值。然后提供给用户解决方案或者决策参考。ETL,是英文 Extract-Transform-Load 的缩写,数据从数据来源端经过抽取(extract)、转换(transform)、加载(load)到目的端,然后进行处理分析的过程。

    用户从数据源抽取出所需的数据,经过数据清洗,最终按照预先定义好的数据模型,将数据加载到数据仓库中去,最后对数据仓库中的数据进行数据分析和处理。

    数据采集位于数据分析生命周期的重要一环,它通过传感器数据、社交网络数据、移动互联网数据等方式获得各种类型的结构化、半结构化及非结构化的海量数据。

    由于采集的数据种类错综复杂,对于这种不同种类的数据。

    我们进行数据分析,必须通过提取技术。将复杂格式的数据,进行数据提取,从数据原始格式中提取(extract)出我们需要的数据,这里可以丢弃一些不重要的字段。

    对于数据提取后的数据,由于数据源头的采集可能存在不准确。

    所以我们必须进行数据清洗,对于那些不正确的数据进行过滤、剔除。

    针对不同的应用场景,对数据进行分析的工具或者系统不同,我们还需要对数据进行数据转换(transform)操作,将数据转换成不同的数据格式,最终按照预先定义好的数据仓库模型,将数据加载(load)到数据仓库中去。

    大数据处理目前比较流行的是两种方法,一种是离线处理,一种是在线处理,基本处理架构如下:

    在互联网应用中,不管是哪一种处理方式,其基本的数据来源都是日志数据,例如对于web应用来说,则可能是用户的访问日志、用户的点击日志等。

    如果对于数据的分析结果在时间上有比较严格的要求,则可以采用在线处理的方式来对数据进行分析,如使用Spark、Storm等进行处理。比较贴切的一个例子是天猫双十一的成交额,在其展板上,我们看到交易额是实时动态进行更新的,对于这种情况,则需要采用在线处理。

    当然,如果只是希望得到数据的分析结果,对处理的时间要求不严格,就可以采用离线处理的方式,比如我们可以先将日志数据采集到HDFS中,之后再进一步使用MapReduce、Hive等来对数据进行分析,这也是可行的。

    在现实生活中,数据产生的种类很多,并且不同种类的数据产生的方式不同。

    对于大数据采集系统,主要分为以下三类系统:

    一、系统日志采集系统。

    许多公司的业务平台每天都会产生大量的日志数据。对于这些日志信息,我们可以得到出很多有价值的数据。通过对这些日志信息进行日志采集、收集,然后进行数据分析,挖掘公司业务平台日志数据中的潜在价值。

    为公司决策和公司后台服务器平台性能评估提高可靠的数据保证。

    系统日志采集系统做的事情就是收集日志数据提供离线和在线的实时分析使用。

    目前常用的开源日志收集系统有Flume、Scribe等。Apache Flume是一个分布式、可靠、可用的服务,用于高效地收集、聚合和移动 大量的日志数据,它具有基于流式数据流的简单灵活的架构。

    其可靠性机制和许多故障转移和恢复机制,使Flume具有强大的容错能力。

    Scribe是Facebook开源的日志采集系统。Scribe实际上是一个分布式共享队列,它可以从各种数据源上收集日志数据,然后放入它上面的共享队列中。

    Scribe可以接受thrift client发送过来的数据,将其放入它上面的消息队列中。然后通过消息队列将数据Push到分布式存储系统中,并且由分布式存储系统提供可靠的容错性能。

    如果最后的分布式存储系统crash时,Scribe中的消息队列还可以提供容错能力,它会还日志数据写到本地磁盘中。Scribe支持持久化的消息队列,来提供日志收集系统的容错能力。

    二、网络数据采集系统。

    通过网络爬虫和一些网站平台提供的公共API(如Twitter和新浪微博API)等方式从网站上获取数据。这样就可以将非结构化数据和半结构化数据的网页数据从网页中提取出来。

    并将其提取、清洗、转换成结构化的数据,将其存储为统一的本地文件数据。目前常用的网页爬虫系统有Apache Nutch、Crawler4j、Scrapy等框架。

    Apache Nutch是一个高度可扩展和可伸缩性的分布式爬虫框架。

    Apache通过分布式抓取网页数据,并且由Hadoop支持,通过提交MapReduce任务来抓取网页数据,并可以将网页数据存储在HDFS分布式文件系统中。

    Nutch可以进行分布式多任务进行爬取数据,存储和索引。由于多个机器并行做爬取任务,Nutch利用多个机器充分利用机器的计算资源和存储能力,大大提高系统爬取数据能力。

    Crawler4j、Scrapy都是一个爬虫框架,提供给开发人员便利的爬虫API接口。开发人员只需要关心爬虫API接口的实现,不需要关心具体框架怎么爬取数据。Crawler4j、Scrapy框架大大降低了开发人员开发速率,开发人员可以很快的完成一个爬虫系统的开发。

    三、数据库采集系统。

    一些企业会使用传统的关系型数据库MySQL和Oracle等来存储数据。

    除此之外,Redis和MongoDB这样的NoSQL数据库也常用于数据的采集。企业每时每刻产生的业务数据,以数据库一行记录形式被直接写入到数据库中。

    通过数据库采集系统直接与企业业务后台服务器结合,将企业业务后台每时每刻都在产生大量的业务记录写入到数据库中,最后由特定的处理分许系统进行系统分析。

    针对大数据采集技术,目前主要流行以下大数据采集分析技术。Hive是Facebook团队开发的一个可以支持PB级别的可伸缩性的数据仓库。

    这是一个建立在Hadoop之上的开源数据仓库解决方案。 Hive支持使用类似SQL的声明性语言(HiveQL)表示的查询,这些语言被编译为使用Hadoop执行的MapReduce作业。

    另外,HiveQL使用户可以将自定义的map-reduce脚本插入到查询中。该语言支持基本数据类型,类似数组和Map的集合以及嵌套组合。

    HiveQL语句被提交执行。首先Driver将查询传递给编译器compiler,通过典型的解析,类型检查和语义分析阶段,使用存储在Metastore中的元数据。

    编译器生成一个逻辑任务,然后通过一个简单的基于规则的优化器进行优化。

    最后生成一组MapReduce任务和HDFS Task的DAG优化后的Task。 然后执行引擎使用Hadoop按照它们的依赖性顺序执行这些Task。

    Hive简化了对于那些不熟悉Hadoop MapReduce接口的用户学习门槛,Hive提供了一些列简单的HiveQL语句,对数据仓库中的数据进行简要分析与计算。

  • ?

    携程用户数据采集与分析系统

    叶兰

    展开

    一、携程实时用户数据采集系统设计实践

    随着移动互联网的兴起,特别是近年来,智能手机、pad等移动设备凭借便捷、高效的特点风靡全球,同时各类APP的快速发展进一步降低了移动互联网的接入门槛,越来越多的网民开始从传统PC转移至移动终端上。但传统的基于PC网站和访问日志的用户数据采集系统已经无法满足实时分析用户行为、实时统计流量属性和基于位置服务(LBS)等方面的需求。

    我们针对传统用户数据采集系统在实时性、吞吐量、终端覆盖率等方面的不足,分析了在移动互联网流量剧增的背景下,用户数据采集系统的需求,研究在多种访问终端和多种网络类型的场景下,用户数据实时、高效采集的方法,并在此基础上设计和实现实时、有序和健壮的用户数据采集系统。此系统基于Java NIO网络通信框架(Netty)和分布式消息队列(Kafka)存储框架实现,其具有实时性、高吞吐、通用性好等优点。

    1、技术选型和设计方案:

    一个典型的数据采集分析统计平台,对数据的处理,主要由如下五个步骤组成:

    图1、数据平台处理流程

    其中,数据采集步骤是最核心的问题,数据采集是否丰富、准确和实时,都直接影响整个数据分析平台的应用的效果。本论文关注的步骤主要在数据采集、数据传输和数据建模存储这三部分。

    为满足数据采集服务实时、高效性、高吞吐量和安全性等方面的要求,同时能借鉴互联网大数据行业一些优秀开源的解决方案,所以整个系统都将基于Java技术栈进行设计和实现。整个数据采集分析平台系统架构如下图所示:

    图2(数据采集分析平台系统架构)

    其中整个平台系统主要包括以上五部分:客户端数据采集SDK以Http(s)/Tcp/Udp协议根据不同的网络环境按一定策略将数据发送到Mechanic(UBT-Collector)服务器。服务器对采集的数据进行一系列处理之后将数据异步写入Hermes(Kafka)分布式消息队列系统。为了关联业务服务端用户业务操作埋点、日志,业务服务器需要获取由客户端SDK统一生成的用户标识(C-GUID),然后业务服务器将用户业务操作埋点、日志信息以异步方式写入Hermes(Kafka)队列。最后数据消费分析平台,都从Hermes(Kafka)中消费采集数据,进行数据实时或者离线分析。其中Mechanic(UBT-Collector)系统还包括对采集数据和自身系统的监控,这些监控信息先写入Hbase集群,然后通过Dashboard界面进行实时监控。

    (1)基于NIO的Netty网络框架方案

    要满足前面提到的高吞吐、高并发和多协议支持等方面的要求。我们调研了几种开源异步IO网络服务组件(如Netty、MINI、xSocket),用它们和NginxWeb服务器进行了性能对比,决定采用Netty作为采集服务网络组件。下面对它进行一些概要介绍:Netty是一个高性能、异步事件驱动的NIO框架,它提供了对TCP、UDP和文件传输的支持,Netty的所有IO操作都是异步非阻塞的,通过Future-Listener机制,用户可以方便的主动获取或者通过通知机制获得IO操作结果。

    图3(Netty框架内部组件逻辑结构)

    Netty的优点有:

    a、功能丰富,内置了多种数据编解码功能、支持多种网络协议。

    b、高性能,通过与其它主流NIO网络框架对比,它的综合性能最佳。

    c、可扩展性好,可通过它提供的ChannelHandler组件对网络通信方面进行灵活扩展。

    d、易用性,API使用简单。

    e、经过了许多商业应用的考验,在互联网、网络游戏、大数据、电信软件等众多行业得到成功商用。

    Netty采用了典型的三层网络架构进行设计,逻辑架构图如下:

    图4(Netty三层网络逻辑架构)

    第一层:Reactor通信调度层。该层的主要职责就是监听网络的连接和读写操作,负责将网络层的数据读取到内存缓冲区中,然后触发各种网络事件,例如连接创建、连接激活、读事件、写事件等,将这些事件触发到Pipeline中,再由Pipeline充当的职责链来进行后续的处理。

    第二层:职责链Pipeline层。负责事件在职责链中有序的向前(后)传播,同时负责动态的编排职责链。Pipeline可以选择监听和处理自己关心的事件。

    第三层:业务逻辑处理层,一般可分为两类:a. 纯粹的业务逻辑处理,例如日志、订单处理。b. 应用层协议管理,例如HTTP(S)协议、FTP协议等。

    我们都知道影响网络服务通信性能的主要因素有:网络I/O模型、线程(进程)调度模型和数据序列化方式。

    在网络I/O模型方面,Netty采用基于非阻塞I/O的实现,底层依赖的是JDKNIO框架的Selector。

    在线程调度模型方面,Netty采用Reactor线程模型。常用的Reactor线程模型有三种,分别是:

    a、Reactor单线程模型:Reactor单线程模型,指的是所有的I/O操作都在同一个NIO线程上面完成。对于一些小容量应用场景,可以使用单线程模型。

    b、Reactor多线程模型:Rector多线程模型与单线程模型最大的区别就是有一组NIO线程处理I/O操作。主要用于高并发、大业务量场景。

    c、主从Reactor多线程模型:主从Reactor线程模型的特点是服务端用于接收客户端连接的不再是一个单独的NIO线程,而是一个独立的NIO线程池。利用主从NIO线程模型,可以解决一个服务端监听线程无法有效处理所有客户端连接的性能不足问题。Netty线程模型并非固定不变的,它可以支持三种Reactor线程模型。

    在数据序列化方面,影响序列化性能的主要因素有:

    a、序列化后的码流大小(网络带宽占用)。

    b、序列化和反序列化操作的性能(CPU资源占用)。

    c、并发调用时的性能表现:稳定性、线性增长等。

    Netty默认提供了对GoogleProtobuf二进制序列化框架的支持,但通过扩展Netty的编解码接口,可以实现其它的高性能序列化框架,例如Avro、Thrift的压缩二进制编解码框架。

    通过对Netty网络框架的分析研究以及对比测试(见后面的可行性分析测试报告)可判断,基于Netty的数据采集方案能解决高数据吞吐量和数据实时收集的难点。

    》》点击阅读全文

数据采集系统资料

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP