中企动力 > 商学院 > 数据采集系统设置
  • ?

    MES制造执行系统数据采集方式

    茜茜

    展开

    MES制造执行系统的特点,就是能实时收集生产过程中的各类信息、数据,然后汇集到数据库中,作数据分析及供管理层查询。如何高效的采集车间的各类数据,是决定一个MES制造执行系统软件项目实施成败的重要关键环节。为您简单介绍一下几类常见的数据采集方式。

    数据收集是MES制造执行系统业务进行的根本,也是MES制造执行系统进行统计分析的基础。MES制造执行系统软件应用中根据不同的数据、应用场景、人员能力、设备投入等方面的因素需要采用不同的数据收集方式,选择不同的数据收集设备。根据各类数据的分类,采用不同的数据采集方式。

    1、必须录入的数据

    必须录入的数据指系统必须直接从外部获得的数据。系统可以通过规格基础定义功能以及过程数据基础定义功能完全的自行建立属于企业自己的数据收集项目库。

    例如产品的编码、产品流程、工序名称、工艺条件目标等。

    2、系统自动生成的的数据

    生产过程中的部分由事件触发的数据可以由系统在过程中自动收集,主要包括:工序开始操作的时间、结束时间、设备状态等。这一类的数据,可由时间触发之后,根据原本设定的基础数据,由系统自动收集。

    3、通过条码采集的方式

    通过条码收集制造数据的方式是最为普遍的方式之一。条码收集数据的前提是信息可以以编码的方式表达或与预设的数据通过编码建立对应关系。

    条码方式可收集的数据主要包括:产品批号、物料批号、加工资源编号、运输资源编号、人员编号、异常类别、异常现象、设备状态(维修、保养、故障停机等)、作业开始、作业结束等。

    条码可以提高数据录入的准确性,提高录入速度,且成本较低。因此,建议尽可能的将数据进行分类然后编码处理,转化成条码的方式表达以便于现场的数据采集。

    4、传感器采集数据

    某些行业对温度、压力、湿度等的要求有严格要求的,其相关数据来源可以增加各类传感器。采集模式主要为温度传感器、压力传感器、无线数据采集卡和PC等构成。

    5、RFID数据采集

    在汽车行业中,由于完全依据订单进行生产,并且几乎没有两辆完全一样的订购汽车,因此自动化的物流跟踪是顺利生产的前提条件。对于每道生产工序,必须要对汽车进行明确的识别,以避免诸如错误安装了空调、调漆颜色不对等问题。在装配流水线上应用RFID技术以尽可能大量地生产用户定制的汽车,用户可以从上万种内部和外部选项中选定自己所需要的颜色、引擎型号等,这样汽车装配流水线上就得装配上百种样式的汽车。在装配流水线上配有RFID系统,使用可重复使用的电子标签,该标签上可带有详细的汽车所需的所有信息,在每个工作点都有RFID读写器,这样可以保证汽车在各个流水线位置处能毫不出错的完成装配任务。

    实时、准确的生产数据采集并实现是MES制造执行系统得以成功的重要基础,企业MES制造执行系统软件建设中应该充分考虑其数据采集的特点,在采集过程中,根据完整性、实时性原则、多种采集技术综合应用、人机结合原则、易于集成应用原则,运用多种数据采集方式,并利用计算机、数据网络语通信设备、各种技术标准和实时历史数据库软件的有机组合来实现生产数据的集成应用。

    效率MES解决方案在自动化的基础上,显著提高工厂的智能化水平,降低人为因素的影响,便捷、“傻瓜式”的操作将大大降低人力成本。

    来源:深圳效率科技efficient.hk

  • ?

    令人羡慕的程序猿!小哥的数据采集系统一年销售400余万

    穆天磊

    展开

    现在更多的人们去尝试使用与购买了无人机,这也代表着无人机的发展越来越先进,愈发的走进人们的生活当中。但现在市场中的无人机公司部队仍旧没有过多的扩张,于是就有更多的人们想要进入到无人机的市场中。胡心怡便是其中一个。但无人机,并没有想象中那么好做。

    胡心怡曾是上海交通大学机械自动化专业的学生,身为浙江人,他总觉得体内流淌着浙商的血液,计划着在年满30岁时创业圆梦。他决定从旧公司离职,做一家为B端客户制造工业级无人机并提供完整解决方案的公司——伯镭智能科技。

    2015年7月,胡心怡找好了办公场地,同团队研发第一款工业无人机。

    就在同月,一家位于上海的央企航天机电联系到了胡心怡,决定来他的办公室看一看。航空机电的需求,是做一套可以搭载热成像镜头的无人四旋翼飞行器,用来完成光伏板巡检等工作。而航空机电最后选择了伯镭科技,并给了他们30余万元的合同。

    在创业初期,资源匮乏的情况下,每一步都需要走得小心谨慎。在2016年3月,伯镭科技成为了大疆授权的行业应用系统方案提供商,在大疆飞行平台上进行二次开发。

    以屋顶光伏电站前期勘测为例,传统人工探测需要至少2天时间,由工人爬上屋顶后测量具体数值。测量后,人员会将数据带回公司,用CAD做出简图后,再完成光伏电站设计。而使用伯镭科技开发的屋顶勘测套装只需要20分钟就可以完成上述全部工作。

    据胡心怡介绍,目前在浙江省已有超过10家B端客户在使用伯镭科技的产品及服务,客单价在数万元不等,而客户使用伯镭的工具勘测一个屋顶的成本价格在100余元/次。

    下一步,胡心怡计划将伯镭科技发展为智能化的大数据企业。他希望通过利用机器学习等技术,在云平台上教会计算机如何识别工程后期巡检过程出现的问题。例如可用无人机完成桥梁巡检,并将桥体出现的裂缝、坑槽、锈蚀等问题通过提取特征后使用机器学习算法将其归类,并自动生成报告送交客户。

    现阶段,伯镭科技在全国范围内已拥有近50家客户。其主要获取客户的手段为通过行业渠道进行推广。2016年,公司共完成400余万元销售额,总计服务客户超50家,仅在浙江省就有超过10家采购单位。

    据了解,该公司已在2016年6月完成天使轮融资,现正开启Pre-A轮融资,计划融资金额为500万元,拟出让10%股份。

    未来,胡心怡计划进行新一轮融资,资金将用于团队建设、产品研发、市场推广等方面。

    本文来自生意我最行,创业家系授权发布,略经编辑修改,版权归作者所有,内容仅代表作者独立观点。

  • ?

    智能制造工厂生产车间无线数据采集系统解决方案

    Terry

    展开

    工业物联网无线数据采集系统,是一套具备终端数据采集,无线数据传输和数据应用分析等多功能的智能化数据采集和监控系统,它在市政供排水管网、供汽管网、热力管网、石油天然气管网、地下管沟监控;游泳池水箱水塔液位、大坝、河道水位、泵房浸水监控;蔬菜蘑菇、针金菇、水果、花卉、育苗等农业大棚智能环境监控;畜牧、家禽、水产等农业养殖智能环境监控;化工危化品石油天然气储罐区、电池、面粉仓库智能环境监控;电信机房、实验室、医院药房、生产车间、冷柜冰箱、图书馆、博物馆、档案室、粮库、烟草、酒糟酒曲酒窖等仓储馆藏智能环境监控;社区楼宇、港口工业园区、公园景区、校园广场、超市商场等大气环境质量智能监控;发动机、变频器等生产机器设备运行状态、仪器仪表能耗及生产缺料的智能监控等多个领域有着广泛的应用。

    近年来,工业物联网无线数据采集系统的发展趋势是简化终端结构,在数据采集终端与主机之间采用无线通信,以代替复杂、不灵活的现场布线。该阶段数据采集系统采用更先进的模块式结构,根据不同的应用要求,通过简单的增加和更改模块,并结合系统编程,就可以扩展或修改系统,满足不同领域的需要。

    针对工厂生产车间机器设备运行状态、运行工艺参数、运行能耗数据,以及管网运行状态数据、变配电系统运行数据、车间仓储库房环境参数等数据的采集、监控,深圳信立科技结合XL.SN无线传感器网络2.4GHz或433MHz模块技术、MES制造执行系统技术及无线传感器、无线测控装置RTU等,自主研发设计了一套工业版工厂生产车间无线数据采集系统解决方案,实现实时获取完整、准确的工厂生产制造过程中的各种数据,为企业提高生产制造管理提供基础数据,全面优化生产制造的管理手段、提高生产制造管理效率,向工业4.0靠近!

    一、系统功能

    1、采集设备运行状态:停止、待机、运行、故障、检修等等,以及发生的时间点;

    2、采集设备运行工艺参数:压力、温度、流量、转速、计数、风速、位移等;

    3、采集设备运行能耗:电流、功率、电能;汽、气消耗量;

    4、采集企业供水、供汽、空压、制冷等设备及相应管网的运行状态数据;

    5、采集企业变配电系统运行数据;

    6、监控车间环境参数,以及仓储库房环境参数。

    二、系统通讯方案

    1、XL.SN智能传感网络采集结构

    XL90物联网智能网关,可同时构建433MHz和2.4GHz两种不同结构的传感网络,用于接收终端采集的数据,并上传至服务器。其中433MHz用于跨车间、厂区内的数据传输,2.4GHz用于车间内的数据传输。

    2、XL.SN通讯网络方案

    a、XL90物联网智能网关通过2.4GHz或433MHz等方式读取节点设备数据后,进行协议转换、数据处理,通过局域网,上传数据至MES服务器;

    b、XL90物联网智能网关通过以太网,从第三方监控系统,如电力监控系统、EMS、DCS、智能楼宇系统等等,读取数据;

    c、MES服务器,或XL90物联网智能网关,通过以太网,将数据转发给第三方系统,如EMS、ERP等。如图2。

    3、物联网智能网关数据接入MES系统通讯方案

    XL90物联网智能网关通过企业局域网,和MES服务器通讯。 XL90智能网关和MES的通信协议,可选以下3种: 建议首选:XL/9E-RDF Redis数据交换协议; 建议次选:XL/9E-DF 数据库格式协议; 建议再次选:XL/9E-UDP 通信协议; 工业以太网通用协议:MODBUS TCP。(不太建议选择)

    三、系统解决方案

    1、设备信号采集

    配置XL60智能测装置,采集机器设备的运行信号,通过2.4GHz或433MHz方式上传,实现生产制造设备的信号采集。

    2、设备控制器的数据采集

    选配XL66智能转换器,读取机器设备控制装置及现场监控仪表采集的信号,通过2.4GHz或433MHz等方式接入传感网络。

    3、管道压力、温度,车间环境、仓储环境的气体浓度、温湿度采集

    选配XL61系列智能传感器,采集管道压力、温度,车间环境、仓储环境的气体浓度、温湿度,通过无线上传,并在需要的通道,出、入口设置声光报警器,或启动紧急设备。

    4、其他信号采集

    选配XL60智能测控装置,及XL68智能环境监测装置,采集火灾探测器、噪音传感器,光照传感器,液位变送器,压力变送器等等设备,以及系统原配的仪表数据。

    四、系统优势

    1、工厂生产车间无线数据采集系统建设过程中,无需布线,或减少布线数量,减少系统建设成本。

    2、系统所需的设备安装调试方便,设备支持手机调试,提高运营维护的效率。

    3、系统底层终端各种数据采集后统一接入企业MES系统,便于监控管理,提高企业生产管理效率。

    五、系统配套

    整个无线数据采集系统方案,根据应用需要配套的软硬件设备,包括XL90物联网无线智能网关、XL60智能测控装置RTU、XL68智能环境测控装置RTU、XL66智能转换器,以及XL61无线压力传感器、XL61无线温度传感器、XL61无线气体传感器、XL51无线温湿度传感器等无线传感器,还有MES制造执行系统软件。

    六、适用范围

    深圳信立科技设计的工业版工厂生产车间无线数据采集系统解决方案,适用于在我国珠三角、长三角、京津冀等沿海发达地区,以及重庆、成都、湖北、河南、安徽等内陆省份的电子加工制造、汽车制造、钢铁冶炼、机械装备、食品生产、医药生产等各行业制造业工厂。

  • ?

    浅谈工业生产现场数据采集

    欢迎

    展开

    工业生产现场数据采集原则有两点:一是目的性,二是经济性;

    目的性是指在做设备的数据采集之前,先要明确所要采集的数据是否具有可观的价值。工业现场其实已经有很多的数据采集系统了,SCADA、HMI什么的也都是应用很广泛了,但是,其中又有多少数据被充分的分析,挖掘其潜在的价值的呢?

    大部分情况是,采集了数据后并不知道怎么去利用。国内大部分的工业现场还处在解决生产过程可见性的阶段,能够先把数据采集上来是当务之急,至少能够实时地了解到现场都发生了什么。在智能制造背景下,要将目光放长远,在做数据采集之前,尽可能地多去思考一下什么样的数据对我们的业务改进帮助最大,这样也许会让我们在数据采集方面的投资回报率更好看一些。

    经济性是指投资的回报效益。对于工业现场的数据采集,很多人第一个想法就是装传感器。不管什么样的项目,我们首先需要考虑的是投资回报率的问题,装传感器的方式可能是投资最大的一种。因此,做设备层的数据采集,一定要结合我们的数采目标,充分利用设备的现有条件(比如,设备已经具备的上位机系统、已经具备的通讯协议等)用最经济高效的方式来做数采技术路线的设计。

    工业数据采集设备分类:有上位机系统的设备(设备自带的监控系统)、基于非TCP/IP通讯协议的设备、基于TCP/IP通讯协议的设备、不具备通讯接口的设备。

    自动化系统设备数据采集系统采集方法主要是通过Web系统、生产线工作站系统、OPC服务器等配置对生产线上的各个设备的生产数据进行监控。同时将有效数据采集仓储在数据库中。这对整个生产系统进行生产线、工序参数、工作流程、设备参数、设备类型、OPC服务、通讯协议的全方位设置、管理。

    如需增加设备,只要在中心管理系统增加相应的设备类型,配置好相关的采集参数即可,可有效节约成本;生产过程中通过缓存交互数据,不直接和数据库交互,极大的提高了数据采集的性能;通过心跳检测程序,实时反馈生产设备的异常,保证生产数据完整性。

    一种自动化生产线设备数据采集方法,可以是如下步骤:

    1.根据自动化生产线上各种设备的不同协议类型,将支持OPC相关协议的设备与OPC连接;将支持TCP开放协议的设备与生产线工作站系统中的网口交换机连接;将支持COM开放协议的设备与生产线工作站系统中的串口交换机连接;

    2.通过Web系统配置生产线的全局属性;

    3.生产线工作站系统启动时从Web系统中同步本生产线所有相关配置,并存入缓存;

    4.生产线工作站初始化时,根据设备在Web系统的协议类型,连接每个设备,并启用OPC监听、TCP监听或COM监听。对于“基于TCP/IP通讯协议”,比较常用的有OPC Classic、Siemens S7、Modbus-TCP等通用协议,也有设备厂商自行定义的私有协议。这些协议的特点是都是基于TCP/IP协议簇,只是应用层协议不同。采用这些协议的设备一般都会有RJ45的接口,也就是以太网口,都可以直接通过以太网接入到车间网络中。对这些设备的数据采集,我们需要做的就是对上述协议的解析。对于OPC等通用协议,已经有很多成熟的SCADA产品可以利用,近些年,也有很多开源框架、商业化的组件可以应用,比如Eclipse neoSCADA,Kepware等等,都能够在完成上述协议的解析的同时,将其转换为一些IT领域常用的接口(RESTful API),方便其他信息系统的对接。

    5、将监听到的每个设备数据写入工作站数据库。

    设备数据分析,可以通过多种查询工具可以快速查询生产实时数据、相关历史数据。给管理人员重要决策提供有效数据基础。可以对数据进行横向比较,可以对历史数据进行分析。通过系统统计分析没太机器的运转率,故障时间累计以及车间设备总体利用率。系统可以提供柱状图、饼图、报表等分析工具,展现现场设备运转统计分析数据。自动统计每天限的产量数据,可以按照不同的班组、时间段等多种条件进行综合查询。

    同时对于设备的故障管理也可以进行相关数据记录,比如不同的设备及其台号,故障类型、时间段等多种条件进行历史查询赛选。这样可以进行历史数据查询,更好的帮助技术人员进行设备故障原因分分析,提高问题解决效率。

  • ?

    ForeSpider数据采集系统脚本的几个小方法

    家飞凤

    展开

    今天给大家介绍一下我平时使用前嗅forespider数据采集系统配置模板的时候用到的几种方法,以前写过一个链接抽取的教程,今天就不给大家介绍了,没看过的用户可以关注一下我以前的文章,有很多有用的教程。

    首先,大家看一下这是我准备采集数据的网页:

    截图中三个圈起来的地方就是我要取的三个字段,然后分别取到下面每一行的数据,一直到结束。

    像这种多行的数据又不确定行数,我们就要使用循环,先取到最上面一行,然后往下循环。一直到结束。

    上图是我写的数据抽取脚本,这个数据抽取一共有3个字段,名字分别为“word”“inde”“rank”,对应脚本中“re.***”,每一行的脚本上都有绿色的注释,

    解释每一行的作用。

    总结一下脚本中用到的几种方法:

    ① DOM.FindClass:HTML文档的操作方法,通过标签class属性值查找标签节点(还有能通过标签名称和ID属性值查找标签节点的方法,本文未使用)。

    ② DOM.GetTextAll:获取HTML标签节点及所有子节点的可见文本。

    ③ next:返回标签节点的后一节点。

    ④ if、while:常见的判断、循环语句。

    *想了解更详细的使用方法请看软件文档。

    采集示例网址:http://top.chinaz/Html/site_ali213.html

    大家可以根据网页源码,软件帮助文档,对照着脚本看一下,理解每一行的意思。

    也可以看一下往期的文章教程,有兴趣的朋友关注一下,经常会更新教程和有意思的东西,希望大家使用的一切顺利。

    往期精选:

    ForeSpider链接抽取脚本:http://toutiao/item/6454813216395493902/

    ForeSpider如何通过关键词进行采集:http://toutiao/item/6451829518142276110/

    为什么总是入库错误?关于字段属性的问题:http://toutiao/item/6451485277398499853/

    想了解前嗅?ForeSpider到底是做什么的?http://toutiao/i6437323628127191554/

  • ?

    携程用户数据采集与分析系统

    Perth

    展开

    一、携程实时用户数据采集系统设计实践

    随着移动互联网的兴起,特别是近年来,智能手机、pad等移动设备凭借便捷、高效的特点风靡全球,同时各类APP的快速发展进一步降低了移动互联网的接入门槛,越来越多的网民开始从传统PC转移至移动终端上。但传统的基于PC网站和访问日志的用户数据采集系统已经无法满足实时分析用户行为、实时统计流量属性和基于位置服务(LBS)等方面的需求。

    我们针对传统用户数据采集系统在实时性、吞吐量、终端覆盖率等方面的不足,分析了在移动互联网流量剧增的背景下,用户数据采集系统的需求,研究在多种访问终端和多种网络类型的场景下,用户数据实时、高效采集的方法,并在此基础上设计和实现实时、有序和健壮的用户数据采集系统。此系统基于Java NIO网络通信框架(Netty)和分布式消息队列(Kafka)存储框架实现,其具有实时性、高吞吐、通用性好等优点。

    1、技术选型和设计方案:

    一个典型的数据采集分析统计平台,对数据的处理,主要由如下五个步骤组成:

    图1、数据平台处理流程

    其中,数据采集步骤是最核心的问题,数据采集是否丰富、准确和实时,都直接影响整个数据分析平台的应用的效果。本论文关注的步骤主要在数据采集、数据传输和数据建模存储这三部分。

    为满足数据采集服务实时、高效性、高吞吐量和安全性等方面的要求,同时能借鉴互联网大数据行业一些优秀开源的解决方案,所以整个系统都将基于Java技术栈进行设计和实现。整个数据采集分析平台系统架构如下图所示:

    图2(数据采集分析平台系统架构)

    其中整个平台系统主要包括以上五部分:客户端数据采集SDK以Http(s)/Tcp/Udp协议根据不同的网络环境按一定策略将数据发送到Mechanic(UBT-Collector)服务器。服务器对采集的数据进行一系列处理之后将数据异步写入Hermes(Kafka)分布式消息队列系统。为了关联业务服务端用户业务操作埋点、日志,业务服务器需要获取由客户端SDK统一生成的用户标识(C-GUID),然后业务服务器将用户业务操作埋点、日志信息以异步方式写入Hermes(Kafka)队列。最后数据消费分析平台,都从Hermes(Kafka)中消费采集数据,进行数据实时或者离线分析。其中Mechanic(UBT-Collector)系统还包括对采集数据和自身系统的监控,这些监控信息先写入Hbase集群,然后通过Dashboard界面进行实时监控。

    (1)基于NIO的Netty网络框架方案

    要满足前面提到的高吞吐、高并发和多协议支持等方面的要求。我们调研了几种开源异步IO网络服务组件(如Netty、MINI、xSocket),用它们和NginxWeb服务器进行了性能对比,决定采用Netty作为采集服务网络组件。下面对它进行一些概要介绍:Netty是一个高性能、异步事件驱动的NIO框架,它提供了对TCP、UDP和文件传输的支持,Netty的所有IO操作都是异步非阻塞的,通过Future-Listener机制,用户可以方便的主动获取或者通过通知机制获得IO操作结果。

    图3(Netty框架内部组件逻辑结构)

    Netty的优点有:

    a、功能丰富,内置了多种数据编解码功能、支持多种网络协议。

    b、高性能,通过与其它主流NIO网络框架对比,它的综合性能最佳。

    c、可扩展性好,可通过它提供的ChannelHandler组件对网络通信方面进行灵活扩展。

    d、易用性,API使用简单。

    e、经过了许多商业应用的考验,在互联网、网络游戏、大数据、电信软件等众多行业得到成功商用。

    Netty采用了典型的三层网络架构进行设计,逻辑架构图如下:

    图4(Netty三层网络逻辑架构)

    第一层:Reactor通信调度层。该层的主要职责就是监听网络的连接和读写操作,负责将网络层的数据读取到内存缓冲区中,然后触发各种网络事件,例如连接创建、连接激活、读事件、写事件等,将这些事件触发到Pipeline中,再由Pipeline充当的职责链来进行后续的处理。

    第二层:职责链Pipeline层。负责事件在职责链中有序的向前(后)传播,同时负责动态的编排职责链。Pipeline可以选择监听和处理自己关心的事件。

    第三层:业务逻辑处理层,一般可分为两类:a. 纯粹的业务逻辑处理,例如日志、订单处理。b. 应用层协议管理,例如HTTP(S)协议、FTP协议等。

    我们都知道影响网络服务通信性能的主要因素有:网络I/O模型、线程(进程)调度模型和数据序列化方式。

    在网络I/O模型方面,Netty采用基于非阻塞I/O的实现,底层依赖的是JDKNIO框架的Selector。

    在线程调度模型方面,Netty采用Reactor线程模型。常用的Reactor线程模型有三种,分别是:

    a、Reactor单线程模型:Reactor单线程模型,指的是所有的I/O操作都在同一个NIO线程上面完成。对于一些小容量应用场景,可以使用单线程模型。

    b、Reactor多线程模型:Rector多线程模型与单线程模型最大的区别就是有一组NIO线程处理I/O操作。主要用于高并发、大业务量场景。

    c、主从Reactor多线程模型:主从Reactor线程模型的特点是服务端用于接收客户端连接的不再是一个单独的NIO线程,而是一个独立的NIO线程池。利用主从NIO线程模型,可以解决一个服务端监听线程无法有效处理所有客户端连接的性能不足问题。Netty线程模型并非固定不变的,它可以支持三种Reactor线程模型。

    在数据序列化方面,影响序列化性能的主要因素有:

    a、序列化后的码流大小(网络带宽占用)。

    b、序列化和反序列化操作的性能(CPU资源占用)。

    c、并发调用时的性能表现:稳定性、线性增长等。

    Netty默认提供了对GoogleProtobuf二进制序列化框架的支持,但通过扩展Netty的编解码接口,可以实现其它的高性能序列化框架,例如Avro、Thrift的压缩二进制编解码框架。

    通过对Netty网络框架的分析研究以及对比测试(见后面的可行性分析测试报告)可判断,基于Netty的数据采集方案能解决高数据吞吐量和数据实时收集的难点。

    》》点击阅读全文

  • ?

    前嗅:手把手教你数据采集

    萧书桃

    展开

    ForeSpider 前嗅:手把手教你数据采集

    ForeSpider是一款非常好用的数据采集软件,因为属于专业性工具,除了帮助文档外很少有使用教程。所有有很多人在使用的过程中遇到问题难以解决,今天给大家介绍ForeSpider数据采集系统的使用教程,希望能对大家的工作有所帮助。

    教程的示例网站是大众点评,要得到50页内所有医院名称,该医院评论总数,医院总体星级,各项评分,医院评论的用户名,评论内容,评论时间,用户点评星级,获赞数量和回应数量。

    首先我们先新建一个频道,我给它命名为大众点评,然后在频道配置里输入我们想要爬取数据的网址,需要在频道配置处输入想要得到数据的网址,大众点评需要开启cookie,从右面可以开启,网站不同有的不需要,视情况而定。 现在默认模板(1)就是我们要的网站页面,鼠标放在医院标题处如图,从左下角能看到医院的网址链接。

    现在点一下右上角的采集预览,我们能得到整个页面的所有网页链接,下拉滚动条到这个位置就会发现跟上图相同格式的链接,这就是我们需要的所有医院的链接。

    我们用不到的需要过滤一下,可以通过地址过滤和标题过滤方法筛选。点击软件右上角模板抽取配置里面的链接抽取,里面有地址过滤和标题过滤两个选项,点击地址过滤,软件右下角如图:

    过滤规则选择包含,过滤串内输入想要得到的医院链接,后面这串数字我们用“\d”表示,用“\e”表示结束,例如https://dianping/shop/\d\e,这样就能采集网页内所有这种格式的网页链接。

    当我们想要采集的网页下面有翻页的链接,就必须配置翻页。除了在右上角默认模板处抽取我们想要的得到的医院链接外,还要再新建一个链接抽取,抽取页面翻页的地址。

    我们继续从采集预览处得到翻页的链接,过滤规则选择包含,通过观察发现几个链接的相同点,输入到过滤串里就能得到想要的翻页链接了。

    第一层级的模板建好了,下面我们随便点进一个医院主页内,复制链接建立下一层级模板。在默认模板(2)的示例地址内输入医院主页的链接。

    因为我们需要采集该医院所有用户评论,所以我们找到下面的“更多点评”,通过刚刚地址过滤的方法,过滤出更多点评的链接,并建立模板(3),示例地址输入刚刚过滤的得到的“更多点评”的网址。

    注:点击链接抽取,看左下角关联模板处,一定要关联到下一层级的模板,如果是翻页的链接抽取,要关联自身模板,否则会数据采集失败。这点一定要注意。

    这样模板的基本配置就完成了,下一步是建立表单,下图是我们的需求,红色字体我们能从模板二采集到,蓝色字体我们能从模板三采集到,所以我们需要建立两个表单。

    点击表单配置,新建一个表单,添加一个网页主键如图,一定要勾选索引字段,键值唯一,主键字段三个选项,取值类型选择网页主键点击确定。

    然后添加下一个字段如标题“title”

    取值类型选择“选区内全部文本”,变量类型选择“string”,选择合适的字符长度点击确定。依次建立所有字段。

    这是我建立的两个表单的所有字段,表单名称分别为“大众点评1”、“大众点评2”,建立好以后点击保存即可。点开模板配置,每一个模板对应相应的表单,右键模板二“添加数据抽取”,表单名称选择“大众点评1”。

    同样在模板三处再添加另外一个数据抽取表单,添加好后如下图所示:

    单击“title”,然后按住ctrl键同时鼠标左键点击对应标题,内容过多的话按住shift可以调整内容大小,选好后点击保存。

    全部选取完后点击左上角的文件,然后全部保存。

    下一步点击数据,连接数据库,然后再次点击数据,选择数据表,选择刚刚新建两个数据表的字段后创建表,创建好后勾选并确定,就可以进行数据采集了(如果表单有问题需要更改,改好后需要重新创建表单),速度慢可以点击设置里面的线程设置,设置多线程。

    这只是一个简单的教程,软件还有很多强大的功能,祝大家使用愉快!

数据采集系统设置

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP