中企动力 > 商学院 > 高速数据采集
  • ?

    全业务数据挖掘 可视化综合展现——大唐电信高速公路交通大数据分析平台

    刺青

    展开

    刘颖 大唐软件 产品规划师

    一、产品应用

    大唐电信高速公路交通大数据分析平台已成功应用于河北高速,平台项目一期于2016年底上线运行,项目二期也即将于2017年年底上线。该项目整合了河北高速公路管理局近五年来的收费、路况、气象等业务数据,并基于已整合的海量数据,实现了对河北高速路网通行能力、通行量分布、拥堵状况、服务设施忙闲状态、路况分布规律、重点时段流量预判等反应路网运行状态的关键指标进行多维综合分析和关联挖掘分析。分析后的成果数据为河北高速路网的日常监管、道路运营、道路安全管理以及公众出行提供了全面且精细化的数据支撑。

    二、产品定位

    大唐电信高速公路交通大数据分析平台,以整合高速公路行业海量业务数据及硬件资源合理规划为基础,实现对业务数据的分析和价值挖掘,为路网运行管理、道路合理调度、养护预案制定、违法车辆治理、公众服务以及内外部数据共享等提供高效、直观的数据支撑,辅助管理者做出基于数据的决策,实现用数据发现,用数据认知、用数据决策、用数据说话的大数据工作模式。

    三、设计理念

    平台关注大数据分析挖掘技术解决能力,参考了NIST大数据技术参考模型并与传统JavaEE架构融合,在整体上采用了基于J2EE/JavaEE技术架构的多层模型。整个平台的能力建设范围包括数据汇聚能力、数据构建能力、分析挖掘能力和数据共享能力。各类数据能力和业务能力的服务形式包括被动的数据接口与查询服务和主动的实时数据计算服务两部分,基于大数据的业务分析服务功能均可在后台7x24小时持续运行,从而保证了对数据分析服务响应的实时性。

    大唐电信高速公路交通大数据分析平台能力架构

    四、产品功能

    数据整合服务:实现对高速公路内部已有各业务系统海量数据的整合、分类、归纳,搭建数据仓库,实现数据的分层、分类存储及分布式存储。

    数据分析服务:实现路网交通运行分析、路网调度决策分析、道路养护决策分析、机电设备养护决策分析、异常车辆分析及节假日流量等专题数据决策分析服务。

    数据综合展现服务:将分析后的辅助决策数据以图、表等形式进行交互式综合展现,支持PC、大屏、电视、手机等多种媒介。

    数据共享服务:为公众出行服务系统提供出行数据共享支撑;为高速公路外部系统提供数据采集和服务的接口,实现与高速公路外部数据的跨行业、跨市域的协同共享服务。

    五、产品特色

    全业务数据的综合挖掘——使决策更精准

    基于路况、流量、收费、养护等全业务数据及业务需求构建交通分析模型,建立业务规则库,针对不同应用场景选择适用的分析算法,采用分布式挖掘技术,实现多维统计分析、交叉关联分析以及深度预测分析等可定制的交通大数据业务价值的综合挖掘,辅助管理者做出更加精准的数据决策。

    多级灵活的数据保障机制——使决策更安全

    平台对于数据的采集、传输、处理、共享、访问和管理提供了多级灵活的安全保障机制。采用数据敏感、身份认证、网络隔离与透传技术,以及通过制定专用数据协议,提高数据安全性,防止数据在传输过程中被篡改和窃取。平台提供多种权限控制选择机制,包括对数据资源管理权限控制,数据访问权限控制以及用户访问权限控制等。

    交互式的可视化综合展现——使决策更直观

    该平台采用大数据可视化工具,将分析挖掘后的路网运行数据、交通预测数据、异常车辆数据,以及专题分析数据等,均以图表等形式通过PC、大屏、手机APP、电视等多种媒介进行可视化综合展现,并保持一致、友好、易用的交互式用户体验,满足用户通过不同终端进行数据分析,从而做出正确、快速的决策需求。

  • ?

    网络分流器|高速骨干网流量采集与分流实现方案

    绮彤

    展开

    网络分流器|高速骨干网流量采集与分流实现方案

    网络分流器

    1, 流量采集|戎腾网络分流器

    所谓流量采集,就是将网络流量通过物理层、数据链路层的信号解析和解帧,实现IP原始报文的获取。骨干网流量采集系统是一种对骨干网进行流量获取并分析的系统,主要应用于政府网络管理、运行商广告推送、运行商计费取证服务、运行商信令监控服务、园区网审计、公安网监、大数据分析等领域。

    2, 高速网络流量采集系统|网络分流器

    随着以太网技术和光纤通信技术的应用,骨干网带宽的增长及规模的扩大,大规模的网络流量采集面临着数据规模庞大和流量日益复杂的挑战,传统的基于软件的流量采集技术的性能已然无法满足要求。现有的高速骨干网流量采集方案主要分为三类:基于多核处理器的流量采集方案,基于交换芯片的流量采集方案,和基于FPGA的网络流量采集方案。

    每种方案各有特色,下文将一一进行说明。

    a) 基于多核处理器的戎腾高速网络流量采集系统

    多核处理器能够提供强大的并行计算能力,应用于流量采集系统的主要型号有Broadcom的XLP、XLR、XLS,Cavium的CN6880、CN5880,以及Tilera的TILE-GX36等。采用此方案的系统可编程实现流量采集,还可对报文进行修改,具有非常高的灵活性。但系统CPU的处理能力有限,无法真正实现线速处理,整体性能不会很高,但是由于有处理器的参与,比较复杂的处理,如流表的管理、应用层协议识别、Radius上线与报文绑定等功能比较容易实现。

    网络分流器|戎腾高速骨干网流量采集与分流实现方案

    网络分流器

    图1一种基于CaviumCN6880的戎腾流量采集器CDP2000

    b) 基于交换芯片的高速网络流量采集系统

    交换芯片的价格较便宜,且有成熟的套片解决方案可供参考。但其过滤功能非常弱,只支持非常简单的精确多元组过滤,无法做深度报文检测(DPI: Deep Package Inspection),且无法支持POS和WAN等以太网接口,这也使得基于交换芯片的流量采集方案在实际使用的范围受到限制。

    c) 基于FPGA的高速网络流量采集系统

    基于FPGA的解决方案目前较少,主要原因是FPGA芯片价格较贵,且需自行设计所有高速电路和过滤算法,技术门槛较高,需要深厚的研发能力。但其兼有多核系统的高灵活性和交换系统的高性能,优势也是非常明显的。

    网络分流器

    图2基于FPGA的100G戎腾网络流量采集系统HFC602

    表1 三种流量采集方案的比较

    基于多核处理器  基于交换芯片   基于FPGA

    芯片价格       一般        较低       较高

    硬件设计难易度    一般        较容易      较难

    软件开发难易度    一般        较容易      较难

    常见网络接口的兼容性  中        低        高

    流量采集的灵活性    高        低        一般

    是否实现线速处理    否        否        是

    基于多核处理器+交换芯片的流量采集方案是目前应用最为普遍的方案,虽然系统整体价格略贵,但软硬件发开难度不大,入门门槛较低。

    但随着FPGA的发展,其内部资源日益丰富,特别是内部嵌入了大量IP核,在处理速率、逻辑容量等方面不断提升,基于FPGA的方案受到了越来越多的关注,国内外许多研究机构及公司先后推出了基于FPGA的网络流量采集系统。

    图2所示是常见基于FPGA的流量采集系统的结构图,流量采集及预处理平台获取网络端口送来的网络数据包,并对数据包进行流量统计和分析,最终根据流量分析的结果将网络数据包进行分流重新转发回网络中。系统采用硬件和软件协同实现设计思路,对于数据包的协议解析、数据预处理都由硬件电路实现;后端服务器进行流量的具体分析处理。通过预处理平台对流量进行分类归并和低负载数据传输,有效减少了后端服务器的工作量;服务器对预处理后的数据进行处理,可以有效降低流量处理过程的负载开销。

    戎腾网络分流器

    网络分流器|高速骨干网流量采集与分流实现方案

    3 小结|戎腾网络分流器

    戎腾网络推出的100G采集设备(采用ATCA-NTW6401机箱和HFC602业务处理板卡)是目前市面上唯一经过了实网验证的设备,10G独立机箱设备(PET160/320)是目前最大密度的协转设备,3G/LTE产品(ATCA-NTW6402)由于采用软硬结合方案(FPGA+NPU),单板处理能力达到40G bps 3G GRE/ 160G LTE,具有最高性价比|网络分流器

    戎腾网络分流器

  • ?

    90天150亿数据采集,得出互联网主要用户已不再是人类,而是机器

    翟雪柳

    展开

    人们都知道人口学的马尔萨斯假设——粮食生产呈算数增长,人口呈几何数增长。在单位亩产不可能有大突破的状况下,以粮食为主的生产资料只能依靠土地扩张。工业革命、农业科技和人口管理缓解了马尔萨斯问题。今天这个类似的危机又在虚拟世界里出现了。

    大数据世界的马尔萨斯定律可以这样描述:人口以算数极数增长,数据以几何级数增长。数据量以线性规律增加,计算量以非线性规律增长。

    世界所产生的数据始终在高速增长。这是因为数据赋能使所有人、所有人人类活动都在产生数据,只要想记录,就有无数的数据可以“无中生有”。

    很多电商网站早期只追求抢地盘、抢用户,重运营、清数据,并不在意数据布局。举个例子,用户如果只关闭了一个订单,过去电商系统并不记录这个行为,只会直接删除这个下单数据。但是后来发现记录和分析用户的失败交易数据也是有商业价值的,可以用于统计用户信用、喜好等,于是决定记录下来。每个行为都有被记录,数据量就开始成倍增长。

    数据的存储一直是一个大问题。根据市场研究公司Forrester估计,每部智能手机产生的数据平均可达1G。全球智能手机用户数量保守估计达20多亿。每天可产生20多亿G数据。如果用普通的1TB硬盘存储,每天所需的硬盘数量就达200多万块,1年就需要近8亿块硬盘。这已经远远超过全球硬盘生产商的产能。

    更恐怖的是,产生数据的主要还不是人类活动,incapsula在全世界2万个每天至少有10个访问量的网站,统计了90天150亿的访问数据后得出了这样一个数据:56%的网页浏览量都是爬虫机器人贡献。话句话说主要的互联网用户已经不是人类。大部分点击数据都是机器程序产生的。

    非人类访问中,近一半来自善意机器人,如搜索引擎的内容爬虫,它们能够对网页建立索引,方便人们快速查找到对应的网页内容。百度和谷歌就是使用这种方法整理全世界的信息。另外超过一半的浏览量就来自恶意机器人,比如盗取内容的爬虫、各种黑客工具、垃圾邮件等,而且比例还在不断增加。这就是互联网另一面的真实写照。这只是网页浏览状况,在整个人类社会,随着信息化和物联网的快速发展,连接入网的所有硬件都在时刻产生数据,互相通信。发电机组上的监测芯片时刻侦测运行状况并把数据发回服务器。

    遍布城市的摄像头把监控数据上传指挥中心,家里的智能电视,冰箱等都在采集和上传数据,即使全人类都沉沉睡去,世界也依然在数据海洋中律动。

  • ?

    六大主流大数据采集平台架构分析

    赖成风

    展开

    随着大数据越来越被重视,数据采集的挑战变的尤为突出。今天为大家介绍几款数据采集平台:

    Apache Flume Fluentd Logstash Chukwa Scribe Splunk Forwarder

    大数据平台与数据采集

    任何完整的大数据平台,一般包括以下的几个过程:

    数据采集–>数据存储–>数据处理–>数据展现(可视化,报表和监控)

    其中,数据采集是所有数据系统必不可少的,随着大数据越来越被重视,数据采集的挑战也变的尤为突出。这其中包括:

    我们今天就来看看当前可用的六款数据采集的产品,重点关注它们是如何做到高可靠,高性能和高扩展。

    1、Apache Flume

    Flume 是Apache旗下的一款开源、高可靠、高扩展、容易管理、支持客户扩展的数据采集系统。 Flume使用JRuby来构建,所以依赖Java运行环境。

    Flume最初是由Cloudera的工程师设计用于合并日志数据的系统,后来逐渐发展用于处理流数据事件。

    Flume设计成一个分布式的管道架构,可以看作在数据源和目的地之间有一个Agent的网络,支持数据路由。

    每一个agent都由Source,Channel和Sink组成。

    Source

    Source负责接收输入数据,并将数据写入管道。Flume的Source支持HTTP,JMS,RPC,NetCat,Exec,Spooling Directory。其中Spooling支持监视一个目录或者文件,解析其中新生成的事件。

    Channel

    Channel 存储,缓存从source到Sink的中间数据。可使用不同的配置来做Channel,例如内存,文件,JDBC等。使用内存性能高但不持久,有可能丢数据。使用文件更可靠,但性能不如内存。

    Sink

    Sink负责从管道中读出数据并发给下一个Agent或者最终的目的地。Sink支持的不同目的地种类包括:HDFS,HBASE,Solr,ElasticSearch,File,Logger或者其它的Flume Agent。

    Flume在source和sink端都使用了transaction机制保证在数据传输中没有数据丢失。

    Source上的数据可以复制到不同的通道上。每一个Channel也可以连接不同数量的Sink。这样连接不同配置的Agent就可以组成一个复杂的数据收集网络。通过对agent的配置,可以组成一个路由复杂的数据传输网络。

    配置如上图所示的agent结构,Flume支持设置sink的Failover和Load Balance,这样就可以保证即使有一个agent失效的情况下,整个系统仍能正常收集数据。

    Flume中传输的内容定义为事件(Event),事件由Headers(包含元数据,Meta Data)和Payload组成。

    Flume提供SDK,可以支持用户定制开发:

    Flume客户端负责在事件产生的源头把事件发送给Flume的Agent。客户端通常和产生数据源的应用在同一个进程空间。常见的Flume 客户端有Avro,log4J,syslog和HTTP Post。另外ExecSource支持指定一个本地进程的输出作为Flume的输入。当然很有可能,以上的这些客户端都不能满足需求,用户可以定制的客户端,和已有的FLume的Source进行通信,或者定制实现一种新的Source类型。

    同时,用户可以使用Flume的SDK定制Source和Sink。似乎不支持定制的Channel。

    2、Fluentd

    Fluentd是另一个开源的数据收集框架。Fluentd使用C/Ruby开发,使用JSON文件来统一日志数据。它的可插拔架构,支持各种不同种类和格式的数据源和数据输出。最后它也同时提供了高可靠和很好的扩展性。Treasure Data, Inc 对该产品提供支持和维护。

    Fluentd的部署和Flume非常相似:

    Fluentd的架构设计和Flume如出一辙:

    Fluentd的Input/Buffer/Output非常类似于Flume的Source/Channel/Sink。

    Input

    Input负责接收数据或者主动抓取数据。支持syslog,http,file tail等。

    Buffer

    Buffer负责数据获取的性能和可靠性,也有文件或内存等不同类型的Buffer可以配置。

    Output

    Output负责输出数据到目的地例如文件,AWS S3或者其它的Fluentd。

    Fluentd的配置非常方便,如下图:

    Fluentd的技术栈如下图:

    FLuentd和其插件都是由Ruby开发,MessgaePack提供了JSON的序列化和异步的并行通信RPC机制。

    Cool.io是基于libev的事件驱动框架。

    FLuentd的扩展性非常好,客户可以自己定制(Ruby)Input/Buffer/Output。

    Fluentd从各方面看都很像Flume,区别是使用Ruby开发,Footprint会小一些,但是也带来了跨平台的问题,并不能支持Windows平台。另外采用JSON统一数据/日志格式是它的另一个特点。相对去Flumed,配置也相对简单一些。

    3、Logstash

    Logstash是著名的开源数据栈ELK (ElasticSearch, Logstash, Kibana)中的那个L。

    Logstash用JRuby开发,所有运行时依赖JVM。

    Logstash的部署架构如下图,当然这只是一种部署的选项。

    一个典型的Logstash的配置如下,包括了Input,filter的Output的设置。

    几乎在大部分的情况下ELK作为一个栈是被同时使用的。所有当你的数据系统使用ElasticSearch的情况下,logstash是首选。

    4、Chukwa

    官网:https://chukwa.apache.org/

    Apache Chukwa是apache旗下另一个开源的数据收集平台,它远没有其他几个有名。Chukwa基于Hadoop的HDFS和Map Reduce来构建(显而易见,他用Java来实现),提供扩展性和可靠性。Chukwa同时提供对数据的展示,分析和监视。很奇怪的是它的上一次 github的更新事7年前。可见该项目应该已经不活跃了。

    Chukwa的部署架构如下:

    Chukwa的主要单元有:Agent,Collector,DataSink,ArchiveBuilder,Demux等等,看上去相当复杂。由于该项目已经不活跃,我们就不细看了。

    5、Scribe

    代码托管:https://github/facebookarchive/scribe

    Scribe是Facebook开发的数据(日志)收集系统。已经多年不维护,同样的,就不多说了。

    6、Splunk Forwarder

    以上的所有系统都是开源的。在商业化的大数据平台产品中,Splunk提供完整的数据采金,数据存储,数据分析和处理,以及数据展现的能力。

    Splunk是一个分布式的机器数据平台,主要有三个角色:

    Search Head负责数据的搜索和处理,提供搜索时的信息抽取。

    Indexer负责数据的存储和索引 Forwarder,负责数据的收集,清洗,变形,并发送给Indexer

    Splunk内置了对Syslog,TCP/UDP,Spooling的支持,同时,用户可以通过开发 Input和Modular Input的方式来获取特定的数据。在Splunk提供的软件仓库里有很多成熟的数据采集应用,例如AWS,数据库(DBConnect)等等,可以方便的从云或者是数据库中获取数据进入Splunk的数据平台做分析。

    这里要注意的是,Search Head和Indexer都支持Cluster的配置,也就是高可用,高扩展的,但是Splunk现在还没有针对Farwarder的Cluster的功能。也就是说如果有一台Farwarder的机器出了故障,数据收集也会随之中断,并不能把正在运行的数据采集任务Failover到其它的 Farwarder上。

    总结

    我们简单讨论了几种流行的数据收集平台,它们大都提供高可靠和高扩展的数据收集。大多平台都抽象出了输入,输出和中间的缓冲的架构。利用分布式的网络连接,大多数平台都能实现一定程度的扩展性和高可靠性。

    其中Flume,Fluentd是两个被使用较多的产品。如果你用ElasticSearch,Logstash也许是首选,因为ELK栈提供了很好的集成。Chukwa和Scribe由于项目的不活跃,不推荐使用。

    Splunk作为一个优秀的商业产品,它的数据采集还存在一定的限制,相信Splunk很快会开发出更好的数据收集的解决方案。

  • ?

    大数据创新应用:高速公路的数据存储及处理

    Xian

    展开

    【IT168 技术】摘 要:通过分析信息化建设脉络中高速公路数据的海量产生,结构复杂的海量数据存储及处理,阐述大数据平台在智慧高速建设中的作用,总结大数据在智慧高速中的客户服务、运营优化、稽查分析、应急资源调度、预测预警等方面的具体应用,对交通指挥中心工作提供支持。

    关键词:智慧高速 分布式数据处理 数据挖掘 客户服务 优化运营 预测预警

    Abstract:This paper analyzes the effect of big data platform in the construction of expressway construction by analyzing the mass production of expressway data and the complicated data storage and processing in the context of information construction, summarizes the customer service and operation optimization of big data in expressway, inspection and analysis, emergency resource scheduling, forecasting and early warning of specific applications, so as to provide support for the traffic command center.

    Key words:intelligence expressway; distributed data processing; data mining; customer service; operation optimization; forecasting early warning

    引言

    随着经济社会的发展,城市人口持续增长,数量持续增长的车辆给交通基础设施通行能力带来极大压力。交通拥堵、交通事故、环境污染及能源短缺已成为目前面临的重要问题,尤其在高速公路交通管理尤其变得更加明显。如何有效利用传统的高速公路数据与设备,提高交通运输效率、安全性、整体效益,提高交通的科学管理和组织服务水平是管理者迫切需要解决的问题。

    车辆在高速公路上,本身的动作及设备会产生海量数据,在没有大数据平台之前,高速公路上产生的数据分门别类的分布在Oracle、MySQL等数据库中,因为各自处理语言不同,在刚使用时分析速度尚且可以,但随着数据量越来越多,查询调用越来越频繁,速度变得越来越慢,无法满足高速管理需求。

    高速公路数据产生

    高速公路的信息化建设包含从基建到信息记录等多个层面。所有的环节都在不停地产生数据,成为智慧高速中的海量数据来源。首先是高速公路的硬件和基础设施,当一辆车开进收费站,先经过地下预埋的地感线圈,经过地板线圈进行切割磁力线,产生很弱的电流,车辆开进来会由定焦在地感线圈的摄像机拍一张图片,产生车辆进入收费站的第一个数据。继而递交收费卡、读卡、写卡,写卡的同时计算从A点到B点的费用,每一个动作都在产生数据。高速公路收费还涉及更加复杂的情况,如起点A到终点B,中间经过三段高速公路,三段的收费主体不同,需要在收费的金额上进行三个收费主体的拆分,这涉及到后台的数据计算。所以一辆车从进入收费口到驶离收费口,至少会产生两张图片,十余条流水数据,同时还会产生车道摄像和停位摄像等大量的视频信息。

    产生大量车辆数据的同时,收费员的动作,如按抬杆键、放行键、军车键等,也会产生数据记录,方便后续稽查时的图片分析,避免逃费等行为。设备本身也会产生大量数据,比如抬杆、打票、红绿灯转换,全部都会产生日志信息进入数据库,这还只是收费相关的数据信息。在看不到的地面上,还会存在很多信息采集系统,比如地磁式传感器、摄像头,检测车辆通过时的平均速度、平均车间距和平均占有率等等信息,大量数据都会进入数据库,进行后续的存储分析。一辆车在驶离高速公路时,已经产生了大量的数据信息,其中包含结构化和非结构化数据、流数据等多种数据形式。

    大数据平台架构设计及数据处理

    高速公路上产生的海量数据,需要一个企业级的大数据平台,对数据进行分门别类的存储管理,TDH企业级一站式大数据平台,以分布式架构对数据进行存储和计算,并在此基础上进行数据处理和应用。

    大数据平台架构设计

    数据进入大数据平台,上游业务系统中的数据,通过文件交换或Sqoop方式同步到大数据平台的贴源层,然后经过批处理加工后,形成明细层、汇总层和模型层。对于历史数据,比如收费站入口流水表和出口流水表,选择存储在Search引擎中,可以进行快速的历史数据检索。对于非结构化数据,例如图片和视频影像,选择存储在Hyperbase引擎中。同时,为了提高大数据平台的数据质量,使用Governor管理元数据(包括表和存储过程),监控所有数据的更改历史,进行数据血缘分析和影响分析。对上层的基于大数据平台的应用,可以使用标准的JDBC或ODBC与大数据平台进行连接,对数据挖掘需求,如节假日车流量预测、高速路拥堵程度预测等,可以图形化拖拽机器学习平台Sophon组件进行预测,如图1所示。

    ▲图1大数据平台架构

    高速公路的数据存储及处理

    高速公路中产生的车辆动作和收费员动作、信息采集系统等产生的海量数据都进入大数据平台进行存储和处理。这些结构复杂,形式多样的海量数据,对数据存储和处理提出了很高的要求。大数据平台支持兼容Oracle 、DB2 、Teradata数据库/数据仓库SQL方言,可以轻松的将数据从传统架构中进行迁移,所以方便应用研发人员利用这一特性实现数据处理核心的升级换代。同时,TDH支持低延时和高吞吐的实时计算场景,可实现基础结构化数据、非结构化数据和流数据的存储,并随时无缝扩容。大数据平台基本架构在于,对全省高速路网监控收费运营数据进行采集和整合,进入数据中心,基础数据库经过大数据平台处理形成专题数据库,然后将路网设备设施等资源统一融合,形成GIS和视频支撑平台,继而在集成平台以GIS和视频平台做支撑形成五大应用系统相互协作,最终在终端设置,如监控中心的监控大屏、会商室显示、普通的监控工作站、移动终端等设备上进行展示和发布。

    高速公路大数据由几个大的部分构成:高速收费数据主要应用于收费管理、风险管理、运营优化;监控设备数据主要应用于视频监控、运营管理、指挥调度;交调设备数据主要应用于基础采集、运营管理、指挥调度。交通数据尤其是视频数据和图像数据,在一个省份数万个摄像头下,以TB量级甚至PB量级增长,数据量巨大,在大数据平台支撑下,完成平滑扩容和查询分析等业务应用。

    智慧高速中的大数据应用

    大数据平台的处理

    大数据平台把实时数据,包括高速公路上的收费、监控等实时数据上传,与传统业务数据进行整合,包括一些城市交通等外联单位的历史数据。将各类结构化、非结构化、半结构化的数据,包括监控图像、抓拍信息、收费日志和视频等信息,进行数据集成、数据转换处理,然后各自建模分析,形成专题数据,把专题数据应用到相应的应用系统中,提供支撑。

    主要应用方面

    大数据在高速中的应用主要包括以下几方面:

    (1)客户服务。在ETC用户管理与车辆引导中,主要使用Apriori算法进行关联分析,提供客户增值服务和精准信息推送,同时满足客户关系管理的要求。可以根据客户的车辆迁徙路线等分析,进行相关的路线信息推送等。

    在ETC用户管理与车辆引导中,基于客户历史迁徙路线和商品购买历史,运用高维矩阵分解方法,发现客户购买偏好和潜在需求以及出行规律。当客户通过ETC时,实时拍照识别鉴定客户之后,基于客户车辆历史通过卡口数据,调用训练好在线数据挖掘模型,可以以大数据可视化的方式显示出来客户迁徙路线,并预测出客户未来迁徙线路,进而进行精准的地点线路信息推送。

    路线迁徙的可视化和路线预测的建模过程如下:

    利用大数据可视化方法,不仅可以详细每个车辆在地图上车辆行驶轨迹,而且可以显示所有车辆的运行总线路。例如春运年前的时候,可以看到小轿车大部分都是从北上广深流向中西部城市,年后的时候大部分车辆向北上广深汇集。再者,某个客运或者货车司机的路线有其固定的运行线路。路线预测建模过程如下:

    基于客户信息、车辆信息、车辆通过何时通过卡口数据历史数据,利用关联分析和高维矩阵分解方法,找到车辆和卡口进出对应关系,预测客户在下一段时间会通过的卡口,进而预测车辆行驶轨迹,从而提供精准的信息推送。

    (2)运营优化。通过流式机器学习实现时效分析,提前预警,协同各单位指挥调度;在进入大数据平台之后,通过数据分析,可以通过高速公路热点视频查看,进行自动推送;建立领导驾驶舱,设定流量排名,为优化运营提供决策依据。

    通过流式机器学习实现时效分析,提前预警,协同各单位指挥调度;在进入大数据平台之后,通过数据分析,可以通过高速公路热点视频查看,进行自动推送;建立领导驾驶舱,设定流量排名,为优化运营提供决策依据。基于sophon的在线的流式增量机器学习算法,开发时空深度残差网络(ST-ResNet)预测车辆密度。例如把高速公路,划成很多个矩形小区域,多个区域同时分析,它是一种整体性的预测。主要基于平滑性、周期性以及趋势性等三个个时间属性 以及空时间属性和外部天气数据。

    第一,模拟局部相邻时刻。它是一个平滑的过程,比如中午三点跟中午四点流量变化不会很大。

    第二,模拟周期性。把对应时间点昨天、前天、近一周平均、近一个月平均这个时刻的数据,作为输入,来刻画周期性。

    第三,模拟趋势性。把当前时间点更远点(前推半个、一个小时)的时间点(例如昨天、上周、上个月)的数据,模拟趋势性。

    第四,抽取空间属性。利用深度卷积神经网络,把一些地区划成子区域之后,相关的区域做会做卷积运算并合并,通过卷积之后,抓住了这个区域周围的车辆流量的相关性。这样卷积多次之后,相当于把更远相关区域的属性的影响都聚合到一起了。

    基于这四个结果,系统再做一个融合。第一部分融合,就是只考虑它的时间和空间属性。再考虑外部因素,比如最近的附近天气数据拿做第二次融合得到最终结果。

    (3)稽查分析。通过在Inceptor中对原始交易流水费分析,提供逃费稽查、出入口流水对比等异常行为的分析服务。

    通过在Inceptor中对原始的交易流水统计分析,抽取车辆逃费稽查和出入口流量相关历史特征,具体有,车辆最近一周、最近一个月、最近半年的缴费信息,缴费卡口每天每个时间点的出入流量信息。

    利用discover模型融合方法,融合时序预测模型和异常检测模型,效果较单独一种方法提升1.6倍。具体实现如下:

    首先,利用discover大数据分布式自动的时序预测方法,预测此卡口的当前流量,并和当前实际的出入情况对比,如果当前流量少于预测流量,则可能有逃费稽查情况出现;其次,利用分布式异常检测算法iforest和无监督算法深度自编码器检测数据异常,发现行为诡异车辆,业界先进的iforest和深度自编码器算法可以自动异常检测此种逃费稽查的车辆,会和平时它的缴费习惯不同,也会和其自前所属群体的习惯有所偏离,综合的偏离程度月的,逃费的概率越大。最后,利用非线性模型融合的方法,融合时序预测模型和异常检测模型两者的优点,能更准确的定位异常行为的车辆,为车辆稽查分析提供智能。

    (4)联合指挥。通过各项数据在Inceptor中的汇总和分析,综合呈现各相关数据,形成联合指挥。基于应急资源管理、路网交通协同调度、应急预案管理、处置效果评估、无人机监控等模块,实现交警、消防、路政等多部门联动响应,为各类交通事件条件下的路网协同控制和诱导管理提供可视化管理界面和决策支持。

    (5)应急资源调度。借助Inceptor的大规模数据处理能力,整合传统的应急资源设备与资源,协同建立最优化的调度。应急指挥调度系统可以采取“挂图作战”的形式进行,有效地保证在出现特殊情况时可以采取科学的应急措施,积极、快速、有序地处理各类事件,保障高速公路的正常、安全运行,实现应急指挥、应急资源和应急过程的信息化管理。

    (6)预测预警。扩充传统全面风险管理的数据维度,在交通预警等角度分析,提前告知用户。根据往年节假日各收费站流量统计数据,通过分析算法对本年节假日流量做出预测并进行排名。预测值是否超过对应收费站设定的报警门限,可以根据颜色分级进行预警。根据历史通行数据对车流量进行分析和预测,为节假日高峰时段的安全畅通发出预警、提前采取保畅措施,为高速路网的安全畅通提供保障。

    基于对各收费站实时数据的分析结果,可以对平日车流量按站点、小时/天分别进行统计得到时间序列,ARIMA是做时间序列预测较为成熟的模型,分别对该时间时间序列采用ARIMA自回归进行建模,然后对未来一个周期的数据进行预测。ARIMA全称为自回归积分滑动平均模型,可以记作ARIMA(p,d,q),其中p为自回归项,d为差分阶数,q为移动平均项数,通过ARIMA模型可以对收费站某个时段流量进行预测与应用,从而提升对车流量的预测预警。

    (7)资产管理。结合Inceptor和workflow,实现交通设备资产全生命周期管理,包括设备故障预测、质量分析等;通过设备监控专题,可以对高速公路外场设备如车检器、摄像机、气象站、情报板、GPS车辆及无人机等进行基于GIS地图的一体化监控;点击设备图标即可查看各种设备的状态、数据及图像。

    结合Inceptor和workflow,实现交通设备资产全生命周期管...

  • ?

    高速高清扫描,数字化存储您的需求!

    Malak

    展开

    随着时代的进步,生活节奏也越来越快,但凡事不能只讲究快,在快的同时,还要做好;而要做好,说起来容易,做起来难。

    正所谓“商海无情,不进则退”再追求效率的同时,我们也要追求做的更好。出差在外当我们需要收发邮件、处理电子档时,可以用电脑解决,但当需要将纸质文档处理为电子档时,常常都会感到束手无策,而手机拍摄的又不能够1:1或者没有那么清晰,这时只能去附近的店里,当遇到重要文档需要保密时,会感到不知所措。

    而plustek为了满足使用者的需求,自主研发推出了MobileOffice C600文档拍摄仪,只需1秒就能将纸质文档快速且高清录入;机身采用结实耐用的金属支架,人性化的外形设计,做工小巧、精致;操作干脆灵敏,触控式LED补光灯、可外接摄像头数据插口;可调节金属拍摄支架,A3、A4幅面一键调节。

    可以扫描A3幅面及A3幅面以下文件,硬质卡片扫描;长时间没有进行任何操作时,会自动进入休眠,既环保又节能;机身搭配两个数据扩展插口,可外接摄像头或独立麦克风,也可外接U盘、移动硬盘、投影仪等;除可拍摄纸张文件和三维实物外,拍摄杆还可以270度翻转直立拍摄或录制现场人员或环境,内置高亮LED补光灯,通过底座的三级触控调光按键开关,可以根据环境变化适当补光,有效避免灯光过亮或过暗导致的曝光过度及补光不足。

    除可以扫描正常的平面纸张外,还可以扫描立体实物,并能进行精确对焦,并快速拍摄采集;智能连拍、自动对拍摄结果进行歪斜纠正,并去黑边裁切。

    机身体积小巧,不占空间,可以置放于桌面任何地方,特别适合于空间狭小的柜台、桌面使用。采用标准的TWAIN和WIA驱动程序作为接口,确保与TIF、JPG、PDF和Microsoft Office文件格式以及各种影像编辑软件及扫描环境的兼容性。

    支持自动扫描应用,可感应识别新置入的纸张,自动启动拍摄,减少反复按键的繁琐操作;可轻松将拍摄到的两张图像整合拼接在一起,合并为一个影像文件,支持上下、左右合并。

    plustek一切为了使用者!

  • ?

    高速无线数传电台/高性能专业数据传输电台

    黑与白

    展开

    高速无线数传电台是一款借助DSP技术和软件无线电技术实现的高性能专业数据传输电台,信道速率可达到19200bps。它允许用户构建专用的高速无线数据通信网。在该无线数据通信平台上,用户可以高速数据传输。适用领域:船舶、城市交通、出租车对讲系统、工业自动化控制、电力调度、水利工程监控、铁路采集信号传输、采油输油测控、油井水井计量、水情水文监测、气象资料传输、环保监测设备、仓储货柜管理、商场超市理货、林业防护设施、智能大厦、无线信标、江河航运、地质勘探、移动定位、军事训练、公安报警、医疗监护、遥控遥测等自动化控制领域。

    固迪GD230VH-E是工作于230MHz频段的高速数传电台,空中速率为9600和19200bps。大多应用于无线数据采集与控制系统的主站和远距离从站,大数据量传输的应用也常选用该电台。

    高速数传电台

    GD230VH-E高速数传电台产品特点

    ● 散热性能优良,适用于主站或大功率从站,以及大数据量发送;

    ● 通过设置软件设定发射功率,提供5级可设置功率;

    ● 采用温补频率基准源,确保高稳定收发频率;

    ● 电源指示灯、收发指示灯及数据指示灯使工作状态一目了然;

    ● 精密压铸铝结构配合专业的电路设计,抗干扰能力强;

    ● 采用频率合成技术,通过设置软件方便地设置频率;

    ● 提供多种数据接口配置,方便连接各种外部设备进行数据传输;

    ● 透明数据传输,支持点对点、点对多点、灵活组网;

    ● 兼容话音传输,方便实现通话;

    ● 可选配手持通话器配件,直接对讲,方便工程施工;

    ● 工业级产品设计,温度范围宽。

  • ?

    基于大数据技术的全国高速公路通行数据 动态监测平台建设

    苍白

    展开

    项目背景

    大数据及其应用迅速发展,已经渗透到各个行业和业务职能领域,成为重要的生产因素,2015年8月国务院印发《促进大数据发展行动纲要》,将大数据提升为国家战略。在未来的5-10年,我国将把大数据作为提升政府治理能力的重要手段,大力推进大数据在政府管理中创新应用。为此,《交通运输信息化”十三五”发展规划》中提出要”运用大数据分析技术,开展交通运输经济运行分析、政策实施效果评价、交通发展趋势研判等分析工作,提高交通运输宏观掌控能力”。《交通运输统计发展纲要》也提出要”充分利用大数据、云计算等现代信息技术,变革统计生产方式,再造统计业务流程,丰富统计服务产品,不断提升统计生产能力、管理能力和服务能力,开创交通运输统计发展新局面”。

    “十二五”以来,信息化逐渐融入行业管理的方方面面,作为大数据应用的基础,交通运输行业数据资源日益丰富。随着以高速公路联网收费、运输车辆联网联控、智能公交、物流信息平台等为代表的行业信息化重大工程的稳步实施,交通运输行业管理部门所掌握的交通大数据规模爆发性增长,这为推进交通运输行业大数据的应用,以大数据支撑行业管理决策,提高交通行业管理自动化、智能化水平提供了基础性条件。

    2012年以来,受交通运输部委托,交通运输部科学研究院以行业中信息化基础最好的高速公路联网收费业务为示范,通过建立全国统一的数据采集规范和数据治理标准,开发基于大数据技术的全国高速公路通行数据动态监测平台,实现了全国29个省高速公路通行数据(源于高速公路联网收费系统)的动态采集,并利用该数据开展行业大数据应用,显著提升了交通运输行业应用大数据的能力,为行业管理决策提供了有力的支撑,成为行业大数据应用创新的典范。

    项目概况

    主要建设内容

    “基于大数据技术的全国高速公路通行数据动态监测平台建设”属于交通运输行业”十二五”信息化重大工程的重要内容,其主要任务是要从全国29个实现了省级高速公路联网收费省份,动态采集其高速公路联网收费数据,并以大数据平台为支撑,在交通运输部实现对全国数据的集中存储与管理,结合行业管理的需要建立业务模型,对全国高速公路联网收费数据进行分析与挖掘,提升行业管理部门的动态监测能力和科学决策水平。

    主要问题和挑战

    各省高速公路联网收费系统独立建设,系统架构和数据指标差异大

    交通行业信息化由交通运输部进行行业指导,各省结合业务管理需要自行进行建设。在高速公路管理信息化领域,各省建设进程差异巨大,东部发达省份高速公路建设起步早,信息化程度相对较高,许多省份在“十一五”期间已经实现了省级高速公路联网收费,而西部许多省份例如新疆、青海等省则在近几年才开始建设省级高速公路联网收费系统。由于管理体制的差异,各省在建设过程中所采用的技术架构不一、数据管理模式千差万别。大部分省高速公路联网收费系统采用ORACLE进行数据存储与管理,而一些发达省份,由于数据量庞大,已经逐步采用大数据管理系统作为数据管理工具。这些差异对从各省的系统中按照统一的技术标准采集数据带来巨大的困难。

    各省高速公路联网收费数据指标体系不一,数据质量参差不齐

    在数据指标方面,由于不同省份的高速公路联网收费系统都是独立建设,各省结合所采集的指标也存在较大差异,所采集的数据指标和内容也不尽一致,例如,涉及高速公路收费数据的核心数据表,有些省份采集了80多项指标,至有一些省份则拆分成100多项指标。在数据质量方面,不同省份也存在较大差异,例如,数据质量较好的省份,所采集的车牌号信息完整、规范,而一些省份所采集的车牌号,仅仅只录入了车牌号的后3位数字。由于高速公路数据指标体系不统一,数据质量层次不齐,导致数据分析工作难以开展。

    交通运输行业缺乏对大数据的处理和分析能力

    在交通运输行业,”十三五”之前大量的应用系统建设采用传统的技术架构传输、存储,大数据技术应用在行业管理中的应用处于起步研究阶段。而全国高速公路联网收费数据规模庞大,目前每个月数据量接近10亿条,在全国平台上实现29个省市的高速公路数据的采集,传输,汇聚,对平台的数据承载能力以及稳定性提出了挑战。此外,日益提升的高速公路数据分析需求,对平台数据建模以及计算效率也提出新的要求。

    技术方案

    针对上述的需求以及技术挑战,自2012年开始,交通运输部科学研究院结合各省高速公路联网收费系统建设的进度以及行业管理决策能力提升的需求对平台进行建设。主要从以下几个方面着手: 1、构建高速公路大数据指标体系,统一数据标准。2、构建跨省的数据采集系统,实现部省之间、不同技术架构系统之间的数据的统一采集、质量控制与数据汇聚。3、利用大数据技术,建立全国高速公路通行数据的管理平台,实现对全国数据的集中存储、管理以及大数据分析挖掘。

    统一的数据指标体系

    根据交通运输部开展交通运输行业动态监测,进行全国公路运输量测算、分析路网运行特点的需要,经过分析各省所采集的高速公路收费明细数据,我院制定了统一的部级数据采集指标体系,其主要内容包括高速公路公路收费明细数据、高速公路收费站信息、车辆信息以及高速公路电子地图等,核心内容如下:

    ①明细数据。包括入口网络编号、入口站编号、入口时间、出口网络编号、出口站编号、出口时间、出口车道编号、车牌号、车型代码、车种代码、里程、总轴数、轴型及轴重、车货总重、限重、超限率、是否绿色通道车辆代码、免费类型代码、路径标识、是否ETC车辆代码、ETC车辆电子标签OBU编号、支付方式代码等22项信息。

    ②数据字典。包括以下5项:

    一是高速公路收费站字典。包括网络编号、收费站编号、收费站名称、所在线路编号、所在线路名称、是否省界站、开通时间、所属地市名称、是否开放式收费站、收费站状态、收费站经度、收费站纬度、备注等信息。二是高速公路收费车型字典。包括收费车型代码、车种代码、收费车型定义等信息。三是高速公路货车轴型字典。包括单轴组轴型代码、轴型定义等。四是高速公路免费类型代码字典。包括免费类型代码、免费类型定义等。五是高速公路标识站字典。包括标识站编号、标识站名称、所处路段名称。

    此外,高速公路电子地图则以GIS地图的形式采集。

    基本业务流程

    总体业务主要包括数据报送以及数据分析两部分,数据报送业务主要实现各省原始数据的采集,审核,清洗,存储。数据分析业务则实现了对于数据的分析,查询以及可视化的展示。

    总体业务流程如图所示

    系统总体架构

    整体架构分为6层,数据源层,数据采集层,数据存储层,数据处理层,数据分析层,数据应用层。

    数据源层是指各省高速公路联网收费系统,在数据采集层,利用ETL工具和数据传输中间件从各省的前置机采集数据。系统实施时在每个省都部署了数据采集的前置机,在前置机上,通过ETL来对数据进行采集、清洗和标准化,数据传回部里后,利用关系数据库开展常规的统计工作,利用分布式的大数据平台,来进行数据的分析挖掘以及与其他数据之间的关联分析。在数据存储层,采用基于大数据的混合式数据存储架构,利用基于hadoop的分布式文件系统来管理高速公路明细数据,利用关系型数据库存储来存储ods层、dw层和dm层的数据,形成完善的数据仓库架构,在数据处理层,支持批处理、流式处理和混合处理三种方式的数据处理,在数据分析层:利用impala、spark等技术支持即席查询、信息检索,深度挖掘,在数据应用层,以地图、报表的形式展现分析成果。

    系统总体框架如图所示:

    下图所示为系统数据采集的流程示意图:

    系统主要功能

    平台主要功能包括数据质量监控、数据统计与查询、专题分析、系统管理、动态配置4个部分,系统的总体功能框架如下图所示:

    数据质量监控

    通过内置数据审核规则,对各省上报的高速公路通行数据进行质量审核,保证数据的有效性和完整性,对异常数据进行系统报警,提示数据管理人员进行相应处理。数据质量审核包括数据传输监控、数据异常情况预警、数据文件入库情况监控、数据动态监测等。

    数据传输监控

    数据传输过程监控功能监视ETL工具从各省前置机采集数据以及数据从各省向部传输的过程中是否存在数据丢失的情况。

    数据异常情况预警

    数据异常情况预警对数据指标按照设定的审核规则进行审核,如有异常则预警提示。审核规则包括入口网络编号+入口站编号不在枚举字典中、货车总轴数为空、货车车货总重为空等多项规则。

    数据入库情况监控

    根据数据记录数、最小记录时间、最大记录时间等条件实时监控当前数据入库进度,确保数据完整,不存在丢失的情况。

    数据动态监测

    数据量监测功能对每月各省数据量指标进行监控,从数据指标的角度,通过与上年、上月数据的变化情况监测各省报送的数据质量是否存在问题,主要包括数据量监测、车流量预警、行驶量预警等。

    数据统计与查询

    根据交通运输部开展运输量统计以及行业经济运行分析的需要,在系统中自动生成客车(分车型)的车流量、行驶量,省内的流量流量等;货车(分轴数)的车流量、行驶量、货物发送量、货物周转量、省内的流量流量等;货车的车货总重、超限率情况;免费车情况、ETC车流量占比情况等40余张监测报表,用于经济运行分析、向国务院报送的交通运输简明月报等相关分析材料中。

    数据分析与挖掘

    OD分析

    该功能对省内城市与城市之间客流、货流的趋势和迁移规律,在地图中用可视化的方式反映某一个城市到其他城市的车辆迁徙特点,或者一个省全部城市之间的车辆迁移特点。

    车籍地分析

    根据高速公路通行数据中的车牌号信息,在地图中按照”外地车来本省”和”本省车去外地”两个维度,反映省与省之间高速公路车辆行驶的特点和联系情况。

    热点收费站分析

    该功能主要对全国各省收费站通行量进行统计分析,通过预设不同的筛选条件,如省份,开始时间、结束时间、车辆类型等条件,对通行量排名前10的收费站进行图、表多维展示,对某一个收费站,还支持直接查看其24小时的车流量情况。

    收费站流量分析

    该功能主要对全国各省高速公路收费站流量数据进行统计分析,通过预设不同的筛选条件,如省份,开始时间、结束时间、车辆类型等条件,对通行量进行图、表多维展示。

    通行量时空分析

    该功能主要用于分析高速公路上行驶车辆的时间和空间分布的特征,反映车辆在高速公路上行驶的时间和距离特点。

    高速公路车流量分析

    该功能主要从高速公路车流量角度出发,对不同省份(区域或全国)、不同时间段、不同车型的通行量情况进行统计,利用地图和曲线进行多维展示。

    ?

    2018年最值得推荐的6款大数据采集工具

    苦茶

    展开

    数据肯定是无价的。但分析数据并非易事,因为结果越准确,成本就越高。鉴于数据急剧增长,需要一个过程来提供有意义的信息,最终变成实用的洞察力。

    数据挖掘是指这个过程:在庞大数据集当中发现模式,将它转换成有效的信息。该技术利用特定的算法、统计分析、人工智能和数据库系统,从庞大数据集中提取信息,并转换成易于理解的形式。本文介绍了广泛用于大数据行业的6种综合数据挖掘工具。

    1. Rapid Miner

    Rapid Miner是一个数据科学软件平台,为数据准备、机器学习、深度学习、文本挖掘和预测分析提供一种集成环境。它是领先的数据挖掘开源系统之一。

    该程序完全用Java编程语言编写。该程序提供了一个选项,以便用户试用大量可任意嵌套的操作符,这些操作符在XML文件中有详细说明,可由Rapid Miner的图形用户界面来构建。

    2. Oracle Data Mining

    它是Oracle高级分析数据库的代表。市场领先的公司用它最大限度地发掘数据的潜力,做出准确的预测。该系统配合强大的数据算法,锁定最佳客户。

    此外,它可识别异常情况和交叉销售机会,让用户能够根据需要运用不同的预测模型。此外,它以所需的方式定制客户画像。

    3. IBM SPSS Modeler

    说到大规模项目,IBM SPSS Modeler最适合。在这个建模器中,文本分析及其最先进的可视化界面极具价值。它有助于生成数据挖掘算法,基本上不需要编程。

    它可广泛用于异常检测、贝叶斯网络、CARMA、Cox回归以及使用多层感知器和反向传播学习的基本神经网络。

    4. KNIME

    Konstanz Information Miner是一个开源数据分析平台。你可以迅速在其中部署、扩展和熟悉数据。在商业智能界,KNIME号称是有助于为毫无经验的用户提供预测智能的平台。

    此外,数据驱动的创新系统有助于发掘数据潜力。此外,它包括数千个模块和随时可用的示例以及一大批集成的工具和算法。

    5. Python

    Python是一种免费的开源语言,因易用性常常与R相提并论。与R不同,Python学起来往往很容易上手,易于使用。许多用户发现可以在几分钟内开始构建数据,并进行极其复杂的亲和度分析。

    只要你熟悉变量、数据类型、函数、条件语句和循环等基本编程概念,最常见的业务用例数据可视化就很简单。

    6.火车采集器

    火车采集器由合肥乐维信息技术有限公司开发,是一款专业的网络数据采集/信息挖掘处理软件,通过灵活的配置,可以很轻松迅速地从网页上抓取结构化的文本、图片、文件等资源信息,可编辑筛选处理后选择发布到网站后台,各类文件或其他数据库系统中。

  • ?

    前嗅:手把手教你数据采集

    高老四

    展开

    ForeSpider 前嗅:手把手教你数据采集

    ForeSpider是一款非常好用的数据采集软件,因为属于专业性工具,除了帮助文档外很少有使用教程。所有有很多人在使用的过程中遇到问题难以解决,今天给大家介绍ForeSpider数据采集系统的使用教程,希望能对大家的工作有所帮助。

    教程的示例网站是大众点评,要得到50页内所有医院名称,该医院评论总数,医院总体星级,各项评分,医院评论的用户名,评论内容,评论时间,用户点评星级,获赞数量和回应数量。

    首先我们先新建一个频道,我给它命名为大众点评,然后在频道配置里输入我们想要爬取数据的网址,需要在频道配置处输入想要得到数据的网址,大众点评需要开启cookie,从右面可以开启,网站不同有的不需要,视情况而定。 现在默认模板(1)就是我们要的网站页面,鼠标放在医院标题处如图,从左下角能看到医院的网址链接。

    现在点一下右上角的采集预览,我们能得到整个页面的所有网页链接,下拉滚动条到这个位置就会发现跟上图相同格式的链接,这就是我们需要的所有医院的链接。

    我们用不到的需要过滤一下,可以通过地址过滤和标题过滤方法筛选。点击软件右上角模板抽取配置里面的链接抽取,里面有地址过滤和标题过滤两个选项,点击地址过滤,软件右下角如图:

    过滤规则选择包含,过滤串内输入想要得到的医院链接,后面这串数字我们用“\d”表示,用“\e”表示结束,例如https://dianping/shop/\d\e,这样就能采集网页内所有这种格式的网页链接。

    当我们想要采集的网页下面有翻页的链接,就必须配置翻页。除了在右上角默认模板处抽取我们想要的得到的医院链接外,还要再新建一个链接抽取,抽取页面翻页的地址。

    我们继续从采集预览处得到翻页的链接,过滤规则选择包含,通过观察发现几个链接的相同点,输入到过滤串里就能得到想要的翻页链接了。

    第一层级的模板建好了,下面我们随便点进一个医院主页内,复制链接建立下一层级模板。在默认模板(2)的示例地址内输入医院主页的链接。

    因为我们需要采集该医院所有用户评论,所以我们找到下面的“更多点评”,通过刚刚地址过滤的方法,过滤出更多点评的链接,并建立模板(3),示例地址输入刚刚过滤的得到的“更多点评”的网址。

    注:点击链接抽取,看左下角关联模板处,一定要关联到下一层级的模板,如果是翻页的链接抽取,要关联自身模板,否则会数据采集失败。这点一定要注意。

    这样模板的基本配置就完成了,下一步是建立表单,下图是我们的需求,红色字体我们能从模板二采集到,蓝色字体我们能从模板三采集到,所以我们需要建立两个表单。

    点击表单配置,新建一个表单,添加一个网页主键如图,一定要勾选索引字段,键值唯一,主键字段三个选项,取值类型选择网页主键点击确定。

    然后添加下一个字段如标题“title”

    取值类型选择“选区内全部文本”,变量类型选择“string”,选择合适的字符长度点击确定。依次建立所有字段。

    这是我建立的两个表单的所有字段,表单名称分别为“大众点评1”、“大众点评2”,建立好以后点击保存即可。点开模板配置,每一个模板对应相应的表单,右键模板二“添加数据抽取”,表单名称选择“大众点评1”。

    同样在模板三处再添加另外一个数据抽取表单,添加好后如下图所示:

    单击“title”,然后按住ctrl键同时鼠标左键点击对应标题,内容过多的话按住shift可以调整内容大小,选好后点击保存。

    全部选取完后点击左上角的文件,然后全部保存。

    下一步点击数据,连接数据库,然后再次点击数据,选择数据表,选择刚刚新建两个数据表的字段后创建表,创建好后勾选并确定,就可以进行数据采集了(如果表单有问题需要更改,改好后需要重新创建表单),速度慢可以点击设置里面的线程设置,设置多线程。

    这只是一个简单的教程,软件还有很多强大的功能,祝大家使用愉快!

高速数据采集

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP