中企动力 > 商学院 > 高速数据采集存储
  • ?

    大数据处理的关键技术及应用

    噙泪花

    展开

    数据处理是对纷繁复杂的海量数据价值的提炼,而其中最有价值的地方在于预测性分析,即可以通过数据可视化、统计模式识别、数据描述等数据挖掘形式帮助数据科学家更好的理解数据,根据数据挖掘的结果得出预测性决策。

    一、大数据采集技术

    数据是指通过RFID射频数据、传感器数据、社交网络交互数据及移动互联网数据等方式获得的各种类型的结构化、半结构化(或称之为弱结构化)及非结构化的海量数据,是大数据知识服务模型的根本。重点要突破分布式高速高可靠数据爬取或采集、高速数据全映像等大数据收集技术;突破高速数据解析、转换与装载等大数据整合技术;设计质量评估模型,开发数据质量技术。

    大数据采集一般分为:

    1)大数据智能感知层:主要包括数据传感体系、网络通信体系、传感适配体系、智能识别体系及软硬件资源接入系统,实现对结构化、半结构化、非结构化的海量数据的智能化识别、定位、跟踪、接入、传输、信号转换、监控、初步处理和管理等。必须着重攻克针对大数据源的智能识别、感知、适配、传输、接入等技术。

    2)基础支撑层:提供大数据服务平台所需的虚拟服务器,结构化、半结构化及非结构化数据的数据库及物联网络资源等基础支撑环境。重点攻克分布式虚拟存储技术,大数据获取、存储、组织、分析和决策操作的可视化接口技术,大数据的网络传输与压缩技术,大数据隐私保护技术等。

    二、大数据预处理技术

    完成对已接收数据的辨析、抽取、清洗等操作。

    1)抽取:因获取的数据可能具有多种结构和类型,数据抽取过程可以帮助我们将这些复杂的数据转化为单一的或者便于处理的构型,以达到快速分析处理的目的。

    2)清洗:对于大数据,并不全是有价值的,有些数据并不是我们所关心的内容,而另一些数据则是完全错误的干扰项,因此要对数据通过过滤“去噪”从而提取出有效数据。

    三、大数据存储及管理技术

    大数据存储与管理要用存储器把采集到的数据存储起来,建立相应的数据库,并进行管理和调用。重点解决复杂结构化、半结构化和非结构化大数据管理与处理技术。主要解决大数据的可存储、可表示、可处理、可靠性及有效传输等几个关键问题。开发可靠的分布式文件系统(DFS)、能效优化的存储、计算融入存储、大数据的去冗余及高效低成本的大数据存储技术;突破分布式非关系型大数据管理与处理技术,异构数据的数据融合技术,数据组织技术,研究大数据建模技术;突破大数据索引技术;突破大数据移动、备份、复制等技术;开发大数据可视化技术。

    开发新型数据库技术,数据库分为关系型数据库、非关系型数据库以及数据库缓存系统。其中,非关系型数据库主要指的是NoSQL数据库,分为:键值数据库、列存数据库、图存数据库以及文档数据库等类型。关系型数据库包含了传统关系数据库系统以及NewSQL数据库。

    开发大数据安全技术:改进数据销毁、透明加解密、分布式访问控制、数据审计等技术;突破隐私保护和推理控制、数据真伪识别和取证、数据持有完整性验证等技术。

    四、大数据分析及挖掘技术

    大数据分析技术:改进已有数据挖掘和机器学习技术;开发数据网络挖掘、特异群组挖掘、图挖掘等新型数据挖掘技术;突破基于对象的数据连接、相似性连接等大数据融合技术;突破用户兴趣分析、网络行为分析、情感语义分析等面向领域的大数据挖掘技术。

    数据挖掘就是从大量的、不完全的、有噪声的、模糊的、随机的实际应用数据中,提取隐含在其中的、人们事先不知道的、但又是潜在有用的信息和知识的过程。

    数据挖掘涉及的技术方法很多,有多种分类法。根据挖掘任务可分为分类或预测模型发现、数据总结、聚类、关联规则发现、序列模式发现、依赖关系或依赖模型发现、异常和趋势发现等等;根据挖掘对象可分为关系数据库、面向对象数据库、空间数据库、时态数据库、文本数据源、多媒体数据库、异质数据库、遗产数据库以及环球网Web;根据挖掘方法分,可粗分为:机器学习方法、统计方法、神经网络方法和数据库方法。

    机器学习中,可细分为归纳学习方法(决策树、规则归纳等)、基于范例学习、遗传算法等。统计方法中,可细分为:回归分析(多元回归、自回归等)、判别分析(贝叶斯判别、费歇尔判别、非参数判别等)、聚类分析(系统聚类、动态聚类等)、探索性分析(主元分析法、相关分析法等)等。神经网络方法中,可细分为:前向神经网络(BP算法等)、自组织神经网络(自组织特征映射、竞争学习等)等。数据库方法主要是多维数据分析或OLAP方法,另外还有面向属性的归纳方法。

    数据挖掘主要过程是:根据分析挖掘目标,从数据库中把数据提取出来,然后经过ETL组织成适合分析挖掘算法使用宽表,然后利用数据挖掘软件进行挖掘。传统的数据挖掘软件,一般只能支持在单机上进行小规模数据处理,受此限制传统数据分析挖掘一般会采用抽样方式来减少数据分析规模。

    数据挖掘的计算复杂度和灵活度远远超过前两类需求。一是由于数据挖掘问题开放性,导致数据挖掘会涉及大量衍生变量计算,衍生变量多变导致数据预处理计算复杂性;二是很多数据挖掘算法本身就比较复杂,计算量就很大,特别是大量机器学习算法,都是迭代计算,需要通过多次迭代来求最优解,例如K-means聚类算法、PageRank算法等。

  • ?

    大赞中国军科专家!这款雷达芯片一上,别国雷达只能干瞪眼

    不评

    展开

    11月20日-11月23日,第二届"地面雷达复杂电磁环境效应研究"培训研讨班在苏州市举行,指导单位为中国雷达行业协会,主办单位为《现代雷达》编辑部,并由上海威固信息技术股份有限公司、苏州市航天航空产业协会等专业研究机构协办。与此同时,还特邀了空军研究院、国防科技大学和中电科第14所的专家和高级工程师,旨在交流和研讨中,共同推动地面雷达复杂电磁环境适应能力的提升。

    现如今,军用雷达在国防领域发挥着越来越重要的作用,世界上许多国家都在研发新型军用雷达或者采购军用雷达。雷达已然成了国家军事实力的重要衡量标准,在信息化战争下的国家防御上具有不可估量的战略地位。但随着雷达工作电磁环境的不断恶化,雷达的生存能力和作战能力都受到了严重影响,进而会影响作战进程甚至作战结局。

    其中,作为中国雷达行业协会会员单位的上海威固,在雷达信号处理等领域拥有国际领先的技术与品质管理水平,成为了国内多家军工科研院所的合格供方。在此之际,威固创新技术研究院院长李礼博士发表了题为《"威电"—— 雷达信息采集专用存储控制芯片》的主题演讲,并分享了相关研究成果,助力完善国家安全战略全局 。

    李博士表示,雷达信号采集记录特点是采样精度要高(达8GB/s以上),存储容量需求大(单板容量最高可超过32TB )和不能短时间掉速等,要求十分严苛。而国内针对雷达数据采集的存储系统前端往往采用SRIO接口进行数据传输,商用存储控制芯片则基于SATA或者 PCIe接口,具有自主可控性差、能耗比低和成本高等缺点,难以满足军用、商用需求。

    对此,"威电"专用SSD存储控制芯片的体系结构做了优化:在芯片结构上,它集成24路Nand Flash接口,支持RAID0、万兆以太网和PCIE3.0转储等,转储最高可到3GB/s。在关键运行机制上,它则采用控制通路与数据通路相分离的结构设计,针对雷达信号采集定制FTL页表以及文件系统设计、垃圾回收策略等,从而解决浪费DDR容量与带宽、采集的实时性受到影响等难题。

    可以说,"威电"雷达信息记录专用SSD存储控制芯片具备自主可控性强、成本低、可靠性高、功耗低、易于实现小型化和定制性强的优势。

    除此之外,威固还在会上展示了威固最新研究成果——高速信号采集存储系统,该成果刚在9月19日举办的2018第二十届中国国际工业博览会空间产业暨北斗导航技术应用展上荣获"创新银奖"。

    它具备多层次并发访问技术、多维度存储介质可靠性增强和高速、高可靠、高密度电路系统架构的关键技术,还在系统架构、信号计算融合技术、信号计算融合技术上进行了创新,从而实现高速实时记录系统、自定义的文件系统的安全加密等目标,填补了国内外对大流量数据"能采不能存"的空白,为雷达数据的深入研究提供了更大的空间。目前,这款产品主要应用于雷达信号一致性对比测试、车载/舰载高速雷达数据记录等。

    演讲最后,李博士还提到了威固的未来展望,他表示:威固将坚持计算与存储融合和小型化封装的路线,下一代"威电"专用芯片将集成可重构信号处理模块和先进封装技术,实现脉冲压缩、动目标检测、恒虚警门限检测、体积小巧和连接牢固等优化。相信在威固和相关专业机构的不断努力之下,我国的雷达发展将在降能耗、反干扰、高分辨上有重大突破。

  • ?

    存储记录仪与数字示波器、数据采集仪的区别

    鼓浪屿

    展开

      现在,记录波形观测装置分成三大类:高速领域的示波器、中低速领域的存储记录仪、低速领域的数据采集仪。至于如何来选择的话,可以根据所要测量的信号波形的频率或记录间隔来选择,或是测量回路上GND电位不同的情况下,根据输入信号的电压值等来决定。

      数字示波器在观测高速现象方面是优先选择,但因为示波器通道之间共地,因此在测量回路中测量有GND电位差的地方或测量有强?弱电混合存在的机电一体化控制回路等的时候,可能会引起回路之间的短路或接地故障之类的事故。

      存储记录仪的通道之间是绝缘的,因此可以在观测工频电源的AC波形同时进行DC控制系统的测量或是变频器、逆变器的输入输出之间的波形记录等,在前面所述的强?弱电混合回路方面的测量中发挥实力。

      数据采集英文为Data Acquisition,简称DAQ,指测量电压、电流、温度、压力、声音、编码数据等电气或物理现象的过程。数据采集器指从传感器和其它设备等模拟和数字被测单元中,自动采取非电量或电量信号,送到上位机或计算机中进行分析和处理的仪器。数据采集器应用广泛:可视测量、数据记录、控制、自动化测试、监测、原型机制造等。

    存储记录仪与数字示波器、数据采集仪的

      另外,由于提高了采样速度,具备了音频领域以上的f特性,通过后面所述的各种丰富的输入单元,还可进行机械?振动之类的物理测量。图1-6所示为各领域分类的信号波形的频率范围以及所对应的波形观测装置的范围。

    原文来自http://hyxyyq/wz/fwzc/cpyy/yywz/2017/1120/2445.html

  • ?

    基于大数据技术的全国高速公路通行数据 动态监测平台建设

    施寄真

    展开

    项目背景

    大数据及其应用迅速发展,已经渗透到各个行业和业务职能领域,成为重要的生产因素,2015年8月国务院印发《促进大数据发展行动纲要》,将大数据提升为国家战略。在未来的5-10年,我国将把大数据作为提升政府治理能力的重要手段,大力推进大数据在政府管理中创新应用。为此,《交通运输信息化”十三五”发展规划》中提出要”运用大数据分析技术,开展交通运输经济运行分析、政策实施效果评价、交通发展趋势研判等分析工作,提高交通运输宏观掌控能力”。《交通运输统计发展纲要》也提出要”充分利用大数据、云计算等现代信息技术,变革统计生产方式,再造统计业务流程,丰富统计服务产品,不断提升统计生产能力、管理能力和服务能力,开创交通运输统计发展新局面”。

    “十二五”以来,信息化逐渐融入行业管理的方方面面,作为大数据应用的基础,交通运输行业数据资源日益丰富。随着以高速公路联网收费、运输车辆联网联控、智能公交、物流信息平台等为代表的行业信息化重大工程的稳步实施,交通运输行业管理部门所掌握的交通大数据规模爆发性增长,这为推进交通运输行业大数据的应用,以大数据支撑行业管理决策,提高交通行业管理自动化、智能化水平提供了基础性条件。

    2012年以来,受交通运输部委托,交通运输部科学研究院以行业中信息化基础最好的高速公路联网收费业务为示范,通过建立全国统一的数据采集规范和数据治理标准,开发基于大数据技术的全国高速公路通行数据动态监测平台,实现了全国29个省高速公路通行数据(源于高速公路联网收费系统)的动态采集,并利用该数据开展行业大数据应用,显著提升了交通运输行业应用大数据的能力,为行业管理决策提供了有力的支撑,成为行业大数据应用创新的典范。

    项目概况

    主要建设内容

    “基于大数据技术的全国高速公路通行数据动态监测平台建设”属于交通运输行业”十二五”信息化重大工程的重要内容,其主要任务是要从全国29个实现了省级高速公路联网收费省份,动态采集其高速公路联网收费数据,并以大数据平台为支撑,在交通运输部实现对全国数据的集中存储与管理,结合行业管理的需要建立业务模型,对全国高速公路联网收费数据进行分析与挖掘,提升行业管理部门的动态监测能力和科学决策水平。

    主要问题和挑战

    各省高速公路联网收费系统独立建设,系统架构和数据指标差异大

    交通行业信息化由交通运输部进行行业指导,各省结合业务管理需要自行进行建设。在高速公路管理信息化领域,各省建设进程差异巨大,东部发达省份高速公路建设起步早,信息化程度相对较高,许多省份在“十一五”期间已经实现了省级高速公路联网收费,而西部许多省份例如新疆、青海等省则在近几年才开始建设省级高速公路联网收费系统。由于管理体制的差异,各省在建设过程中所采用的技术架构不一、数据管理模式千差万别。大部分省高速公路联网收费系统采用ORACLE进行数据存储与管理,而一些发达省份,由于数据量庞大,已经逐步采用大数据管理系统作为数据管理工具。这些差异对从各省的系统中按照统一的技术标准采集数据带来巨大的困难。

    各省高速公路联网收费数据指标体系不一,数据质量参差不齐

    在数据指标方面,由于不同省份的高速公路联网收费系统都是独立建设,各省结合所采集的指标也存在较大差异,所采集的数据指标和内容也不尽一致,例如,涉及高速公路收费数据的核心数据表,有些省份采集了80多项指标,至有一些省份则拆分成100多项指标。在数据质量方面,不同省份也存在较大差异,例如,数据质量较好的省份,所采集的车牌号信息完整、规范,而一些省份所采集的车牌号,仅仅只录入了车牌号的后3位数字。由于高速公路数据指标体系不统一,数据质量层次不齐,导致数据分析工作难以开展。

    交通运输行业缺乏对大数据的处理和分析能力

    在交通运输行业,”十三五”之前大量的应用系统建设采用传统的技术架构传输、存储,大数据技术应用在行业管理中的应用处于起步研究阶段。而全国高速公路联网收费数据规模庞大,目前每个月数据量接近10亿条,在全国平台上实现29个省市的高速公路数据的采集,传输,汇聚,对平台的数据承载能力以及稳定性提出了挑战。此外,日益提升的高速公路数据分析需求,对平台数据建模以及计算效率也提出新的要求。

    技术方案

    针对上述的需求以及技术挑战,自2012年开始,交通运输部科学研究院结合各省高速公路联网收费系统建设的进度以及行业管理决策能力提升的需求对平台进行建设。主要从以下几个方面着手: 1、构建高速公路大数据指标体系,统一数据标准。2、构建跨省的数据采集系统,实现部省之间、不同技术架构系统之间的数据的统一采集、质量控制与数据汇聚。3、利用大数据技术,建立全国高速公路通行数据的管理平台,实现对全国数据的集中存储、管理以及大数据分析挖掘。

    统一的数据指标体系

    根据交通运输部开展交通运输行业动态监测,进行全国公路运输量测算、分析路网运行特点的需要,经过分析各省所采集的高速公路收费明细数据,我院制定了统一的部级数据采集指标体系,其主要内容包括高速公路公路收费明细数据、高速公路收费站信息、车辆信息以及高速公路电子地图等,核心内容如下:

    ①明细数据。包括入口网络编号、入口站编号、入口时间、出口网络编号、出口站编号、出口时间、出口车道编号、车牌号、车型代码、车种代码、里程、总轴数、轴型及轴重、车货总重、限重、超限率、是否绿色通道车辆代码、免费类型代码、路径标识、是否ETC车辆代码、ETC车辆电子标签OBU编号、支付方式代码等22项信息。

    ②数据字典。包括以下5项:

    一是高速公路收费站字典。包括网络编号、收费站编号、收费站名称、所在线路编号、所在线路名称、是否省界站、开通时间、所属地市名称、是否开放式收费站、收费站状态、收费站经度、收费站纬度、备注等信息。二是高速公路收费车型字典。包括收费车型代码、车种代码、收费车型定义等信息。三是高速公路货车轴型字典。包括单轴组轴型代码、轴型定义等。四是高速公路免费类型代码字典。包括免费类型代码、免费类型定义等。五是高速公路标识站字典。包括标识站编号、标识站名称、所处路段名称。

    此外,高速公路电子地图则以GIS地图的形式采集。

    基本业务流程

    总体业务主要包括数据报送以及数据分析两部分,数据报送业务主要实现各省原始数据的采集,审核,清洗,存储。数据分析业务则实现了对于数据的分析,查询以及可视化的展示。

    总体业务流程如图所示

    系统总体架构

    整体架构分为6层,数据源层,数据采集层,数据存储层,数据处理层,数据分析层,数据应用层。

    数据源层是指各省高速公路联网收费系统,在数据采集层,利用ETL工具和数据传输中间件从各省的前置机采集数据。系统实施时在每个省都部署了数据采集的前置机,在前置机上,通过ETL来对数据进行采集、清洗和标准化,数据传回部里后,利用关系数据库开展常规的统计工作,利用分布式的大数据平台,来进行数据的分析挖掘以及与其他数据之间的关联分析。在数据存储层,采用基于大数据的混合式数据存储架构,利用基于hadoop的分布式文件系统来管理高速公路明细数据,利用关系型数据库存储来存储ods层、dw层和dm层的数据,形成完善的数据仓库架构,在数据处理层,支持批处理、流式处理和混合处理三种方式的数据处理,在数据分析层:利用impala、spark等技术支持即席查询、信息检索,深度挖掘,在数据应用层,以地图、报表的形式展现分析成果。

    系统总体框架如图所示:

    下图所示为系统数据采集的流程示意图:

    系统主要功能

    平台主要功能包括数据质量监控、数据统计与查询、专题分析、系统管理、动态配置4个部分,系统的总体功能框架如下图所示:

    数据质量监控

    通过内置数据审核规则,对各省上报的高速公路通行数据进行质量审核,保证数据的有效性和完整性,对异常数据进行系统报警,提示数据管理人员进行相应处理。数据质量审核包括数据传输监控、数据异常情况预警、数据文件入库情况监控、数据动态监测等。

    数据传输监控

    数据传输过程监控功能监视ETL工具从各省前置机采集数据以及数据从各省向部传输的过程中是否存在数据丢失的情况。

    数据异常情况预警

    数据异常情况预警对数据指标按照设定的审核规则进行审核,如有异常则预警提示。审核规则包括入口网络编号+入口站编号不在枚举字典中、货车总轴数为空、货车车货总重为空等多项规则。

    数据入库情况监控

    根据数据记录数、最小记录时间、最大记录时间等条件实时监控当前数据入库进度,确保数据完整,不存在丢失的情况。

    数据动态监测

    数据量监测功能对每月各省数据量指标进行监控,从数据指标的角度,通过与上年、上月数据的变化情况监测各省报送的数据质量是否存在问题,主要包括数据量监测、车流量预警、行驶量预警等。

    数据统计与查询

    根据交通运输部开展运输量统计以及行业经济运行分析的需要,在系统中自动生成客车(分车型)的车流量、行驶量,省内的流量流量等;货车(分轴数)的车流量、行驶量、货物发送量、货物周转量、省内的流量流量等;货车的车货总重、超限率情况;免费车情况、ETC车流量占比情况等40余张监测报表,用于经济运行分析、向国务院报送的交通运输简明月报等相关分析材料中。

    数据分析与挖掘

    OD分析

    该功能对省内城市与城市之间客流、货流的趋势和迁移规律,在地图中用可视化的方式反映某一个城市到其他城市的车辆迁徙特点,或者一个省全部城市之间的车辆迁移特点。

    车籍地分析

    根据高速公路通行数据中的车牌号信息,在地图中按照”外地车来本省”和”本省车去外地”两个维度,反映省与省之间高速公路车辆行驶的特点和联系情况。

    热点收费站分析

    该功能主要对全国各省收费站通行量进行统计分析,通过预设不同的筛选条件,如省份,开始时间、结束时间、车辆类型等条件,对通行量排名前10的收费站进行图、表多维展示,对某一个收费站,还支持直接查看其24小时的车流量情况。

    收费站流量分析

    该功能主要对全国各省高速公路收费站流量数据进行统计分析,通过预设不同的筛选条件,如省份,开始时间、结束时间、车辆类型等条件,对通行量进行图、表多维展示。

    通行量时空分析

    该功能主要用于分析高速公路上行驶车辆的时间和空间分布的特征,反映车辆在高速公路上行驶的时间和距离特点。

    高速公路车流量分析

    该功能主要从高速公路车流量角度出发,对不同省份(区域或全国)、不同时间段、不同车型的通行量情况进行统计,利用地图和曲线进行多维展示。

    ?

    第20届工博会在上海召开,威固高速信号采集存储系统获创新银奖

    艾许莉

    展开

    9月19日至23日,2018第20届中国国际工业博览会(简称"工博会"、CIIF)在国家会展中心(上海)举办。而此次展会由国务院批准,国家工信部、发改委、商务部、科技部和上海市政府等共同主办,上海威固信息技术股份有限公司、中国兵器装备集团上海电控研究所和中国航空工业集团公司等知名企业均应邀出席此次大会。

    据悉,在制造业转型升级背景下,本届工博会聚焦"中国制造2025"国家战略,突出"创新、智能、绿色"主题,设9大专业展,面积28万平方米,是中国乃至亚太地区最具规模和影响力的国际工业盛会之一。从某种程度上而言,第20届工博会可以算是今年中国国际进口博览会(简称"进博会")的一次预演。

    值得一提的是,在上一届工博会中,评选的荣誉奖、产品奖和创新奖中,有多个奖项均是在空间产业暨北斗导航技术应用展览会(9大专业展之一,简称"空间展")上展出,这届工博会也不例外。上海威固信息技术股份有限公司的高速信号采集存储系统就荣获了"第二十届中国国际工业博览会空间产业暨北斗导航技术应用展创新银奖"。

    而空间展主要展示空间产业整体发展的最新成果,为的是推动我国卫星与导航产业的发展,这就涉及到雷达信号存储技术。而随着雷达技术的日益发展,中频雷达信号的速度不断提高,对采集精度、存储速度和性能也提出了新的需求。但目前国内外市场上的采集存储设备的吞吐量难以突破2GSPS/16bit,主要是受限于存储以及背后的 CPU为核心的系统架构等,这些问题亟待解决。对此,威固在展会上发布并获奖的高速信号采集存储系统,无疑正好贴合此次展会的宗旨。

    据了解,威固的高速信号采集存储系统研究基于多层次FPGA数据分发、RAID管理等技术,建立小型化、高性能、高速信号采集系统的产品体系,旨在研制出一套基于VPX风冷结构、配套的软件API接口的高速采集存储系统,以及可以解决10GB/s甚至更高带宽的采集存储设备。

    目前,威固的高速信号采集存储系统已具有两大创新点:其一是系统架构创新,该存储系统采用了FPGA直接管理存储模块和采集接口的方案,相比以往的采集系统,在接口延时和系统处理上达到最小延时和最小额外开销,同时在FPGA加以MicroBlaze虚拟CPU系统等,使整个设备实现高速实时记录,安全性也得到一定提升。

    其二是信号计算融合技术创新,该存储系统将被采集的雷达数据按照时间、频率、幅值、占空比等信息做好归类,从而实现根据关键词以及特征缩小查找/转存范围,大大提高了后续数据应用的效率。

    在应用层面上,威固的高速信号采集存储系统主要应用于雷达信号一致性对比测试、车载/舰载高速雷达数据记录等。可以说,它填补了国内外对大流量数据"能采不能存"的空白,为雷达数据的深入研究提供了更大的空间。

    除了威固的高速信号采集存储系统外,上海索迪龙自动化公司和上海司南卫星导航公司等,均在该展会上展出了相关产品。总的来看,本届工博会的举办对我国意义重大,它不仅发挥了展示全球先进制造业发展和最新科技成果、彰显我国一流工业制造水准的作用,还有利于我们学习国外的先进技术等。相信在这个展览会的举办之后,我们在人工智能、卫星与导航等领域的发展将越来越好。

  • ?

    90天150亿数据采集,得出互联网主要用户已不再是人类,而是机器

    Ros

    展开

    人们都知道人口学的马尔萨斯假设——粮食生产呈算数增长,人口呈几何数增长。在单位亩产不可能有大突破的状况下,以粮食为主的生产资料只能依靠土地扩张。工业革命、农业科技和人口管理缓解了马尔萨斯问题。今天这个类似的危机又在虚拟世界里出现了。

    大数据世界的马尔萨斯定律可以这样描述:人口以算数极数增长,数据以几何级数增长。数据量以线性规律增加,计算量以非线性规律增长。

    世界所产生的数据始终在高速增长。这是因为数据赋能使所有人、所有人人类活动都在产生数据,只要想记录,就有无数的数据可以“无中生有”。

    很多电商网站早期只追求抢地盘、抢用户,重运营、清数据,并不在意数据布局。举个例子,用户如果只关闭了一个订单,过去电商系统并不记录这个行为,只会直接删除这个下单数据。但是后来发现记录和分析用户的失败交易数据也是有商业价值的,可以用于统计用户信用、喜好等,于是决定记录下来。每个行为都有被记录,数据量就开始成倍增长。

    数据的存储一直是一个大问题。根据市场研究公司Forrester估计,每部智能手机产生的数据平均可达1G。全球智能手机用户数量保守估计达20多亿。每天可产生20多亿G数据。如果用普通的1TB硬盘存储,每天所需的硬盘数量就达200多万块,1年就需要近8亿块硬盘。这已经远远超过全球硬盘生产商的产能。

    更恐怖的是,产生数据的主要还不是人类活动,incapsula在全世界2万个每天至少有10个访问量的网站,统计了90天150亿的访问数据后得出了这样一个数据:56%的网页浏览量都是爬虫机器人贡献。话句话说主要的互联网用户已经不是人类。大部分点击数据都是机器程序产生的。

    非人类访问中,近一半来自善意机器人,如搜索引擎的内容爬虫,它们能够对网页建立索引,方便人们快速查找到对应的网页内容。百度和谷歌就是使用这种方法整理全世界的信息。另外超过一半的浏览量就来自恶意机器人,比如盗取内容的爬虫、各种黑客工具、垃圾邮件等,而且比例还在不断增加。这就是互联网另一面的真实写照。这只是网页浏览状况,在整个人类社会,随着信息化和物联网的快速发展,连接入网的所有硬件都在时刻产生数据,互相通信。发电机组上的监测芯片时刻侦测运行状况并把数据发回服务器。

    遍布城市的摄像头把监控数据上传指挥中心,家里的智能电视,冰箱等都在采集和上传数据,即使全人类都沉沉睡去,世界也依然在数据海洋中律动。

  • ?

    一篇文章看懂大数据的5大关键技术

    龚子骞

    展开

    大数据技术,就是从各种类型的数据中快速获得有价值信息的技术。大数据领域已经涌现出了大量新的技术,它们成为大数据采集、存储、处理和呈现的有力武器。大数据处理关键技术一般包括:大数据采集、大数据预处理、大数据存储及管理、大数据分析及挖掘、大数据展现和应用(大数据检索、大数据可视化、大数据应用、大数据安全等)。

    一、大数据采集技术

    数据采集是指通过RFID射频数据、传感器数据、社交网络交互数据及移动互联网数据等方式获得的各种类型的结构化、半结构化(或称之为弱结构化)及非结构化的海量数据,是大数据知识服务模型的根本。重点要突破分布式高速高可靠数据爬取或采集、高速数据全映像等大数据收集技术;突破高速数据解析、转换与装载等大数据整合技术;设计质量评估模型,开发数据质量技术。

    大数据采集一般分为大数据智能感知层:主要包括数据传感体系、网络通信体系、传感适配体系、智能识别体系及软硬件资源接入系统,实现对结构化、半结构化、非结构化的海量数据的智能化识别、定位、跟踪、接入、传输、信号转换、监控、初步处理和管理等。必须着重攻克针对大数据源的智能识别、感知、适配、传输、接入等技术。基础支撑层:提供大数据服务平台所需的虚拟服务器,结构化、半结构化及非结构化数据的数据库及物联网络资源等基础支撑环境。重点攻克分布式虚拟存储技术,大数据获取、存储、组织、分析和决策操作的可视化接口技术,大数据的网络传输与压缩技术,大数据隐私保护技术等。

    二、大数据预处理技术

    主要完成对已接收数据的辨析、抽取、清洗等操作。

    1、抽取:因获取的数据可能具有多种结构和类型,数据抽取过程可以帮助我们将这些复杂的数据转化为单一的或者便于处理的构型,以达到快速分析处理的目的。

    2、清洗:对于大数据,并不全是有价值的,有些数据并不是我们所关心的内容,而另一些数据则是完全错误的干扰项,因此要对数据通过过滤“去噪”从而提取出有效数据。

    三、大数据存储及管理技术

    大数据存储与管理要用存储器把采集到的数据存储起来,建立相应的数据库,并进行管理和调用。重点解决复杂结构化、半结构化和非结构化大数据管理与处理技术。主要解决大数据的可存储、可表示、可处理、可靠性及有效传输等几个关键问题。开发可靠的分布式文件系统(DFS)、能效优化的存储、计算融入存储、大数据的去冗余及高效低成本的大数据存储技术;突破分布式非关系型大数据管理与处理技术,异构数据的数据融合技术,数据组织技术,研究大数据建模技术;突破大数据索引技术;突破大数据移动、备份、复制等技术;开发大数据可视化技术。

    开发新型数据库技术,数据库分为关系型数据库、非关系型数据库以及数据库缓存系统。其中,非关系型数据库主要指的是NoSQL数据库,分为:键值数据库、列存数据库、图存数据库以及文档数据库等类型。关系型数据库包含了传统关系数据库系统以及NewSQL数据库。

    开发大数据安全技术。改进数据销毁、透明加解密、分布式访问控制、数据审计等技术;突破隐私保护和推理控制、数据真伪识别和取证、数据持有完整性验证等技术。

    四、大数据分析及挖掘技术

    大数据分析技术。改进已有数据挖掘和机器学习技术;开发数据网络挖掘、特异群组挖掘、图挖掘等新型数据挖掘技术;突破基于对象的数据连接、相似性连接等大数据融合技术;突破用户兴趣分析、网络行为分析、情感语义分析等面向领域的大数据挖掘技术。

    数据挖掘就是从大量的、不完全的、有噪声的、模糊的、随机的实际应用数据中,提取隐含在其中的、人们事先不知道的、但又是潜在有用的信息和知识的过程。数据挖掘涉及的技术方法很多,有多种分类法。

    根据挖掘任务可分为分类或预测模型发现、数据总结、聚类、关联规则发现、序列模式发现、依赖关系或依赖模型发现、异常和趋势发现等等;

    根据挖掘对象可分为关系数据库、面向对象数据库、空间数据库、时态数据库、文本数据源、多媒体数据库、异质数据库、遗产数据库以及环球网Web;

    根据挖掘方法分,可粗分为:机器学习方法、统计方法、神经网络方法和数据库方法。机器学习中,可细分为:归纳学习方法(决策树、规则归纳等)、基于范例学习、遗传算法等。统计方法中,可细分为:回归分析(多元回归、自回归等)、判别分析(贝叶斯判别、费歇尔判别、非参数判别等)、聚类分析(系统聚类、动态聚类等)、探索性分析(主元分析法、相关分析法等)等。神经网络方法中,可细分为:前向神经网络(BP算法等)、自组织神经网络(自组织特征映射、竞争学习等)等。数据库方法主要是多维数据分析或OLAP方法,另外还有面向属性的归纳方法。

    从挖掘任务和挖掘方法的角度,着重突破:

    1、可视化分析。数据可视化无论对于普通用户或是数据分析专家,都是最基本的功能。数据图像化可以让数据自己说话,让用户直观的感受到结果。

    2、数据挖掘算法。图像化是将机器语言翻译给人看,而数据挖掘就是机器的母语。分割、集群、孤立点分析还有各种各样五花八门的算法让我们精炼数据,挖掘价值。这些算法一定要能够应付大数据的量,同时还具有很高的处理速度。

    3、预测性分析。预测性分析可以让分析师根据图像化分析和数据挖掘的结果做出一些前瞻性判断。

    4、语义引擎。语义引擎需要设计到有足够的人工智能以足以从数据中主动地提取信息。语言处理技术包括机器翻译、情感分析、舆情分析、智能输入、问答系统等。

    5、数据质量和数据管理。数据质量与管理是管理的最佳实践,透过标准化流程和机器对数据进行处理可以确保获得一个预设质量的分析结果。

    五、大数据展现与应用技术

    大数据技术能够将隐藏于海量数据中的信息和知识挖掘出来,为人类的社会经济活动提供依据,从而提高各个领域的运行效率,大大提高整个社会经济的集约化程度。在我国,大数据将重点应用于以下三大领域:商业智能、政府决策、公共服务。例如:商业智能技术,政府决策技术,电信数据信息处理与挖掘技术,电网数据信息处理与挖掘技术,气象信息分析技术,环境监测技术,警务云应用系统(道路监控、视频监控、网络监控、智能交通、反电信诈骗、指挥调度等公安信息系统),大规模基因序列分析比对技术,Web信息挖掘技术,多媒体数据并行化处理技术,影视制作渲染技术,其他各种行业的云计算和海量数据处理应用技术等。

    介绍完了技术,最后推荐一款高性价比的大数据分析平台——极星大数据分析平台,因为只有合适的平台,才能将大数据技术的价值和潜力发挥出来。

    关于极星大数据分析平台

    极星大数据分析平台,是一款专为大型企业及专业机构海量数据,打造的大数据一体化解决方案。极星大数据分析平台能提供强大的海量数据的处理功能,如:数据采集、数据存储、数据处理、数据挖掘、数据分析、数据可视化、数据专业算法等,广泛适用于金融、电力、制造业、石化、燃气、交通等各行各业。

    极星大数据分析平台:http://szcomtop/fastar/index.html

  • ?

    大数据产业高速发展 个人信息存储是否合规受关注

    超频

    展开

    光明网讯 (记者 孙满桃)最高人民法院研究室副主任、中国法学会证券法学研究会会长郭峰在17日举行的“2017大数据合作与合规峰会”上表示,大数据产业快速发展中,数据泄露、个人信息保护等问题日益凸显。完善数据领域立法、提升监管执法效率,优化行业自律标准等问题已成为摆在大数据产业面前的“门槛性”问题。

    近年来,“互联网+”与传统行业深度融合,大数据、云计算、人工智能为行业赋能、助产业升级。政府、企业、社会组织等纷纷走上数字化转型道路,建设智慧城市、推行电子政务。大数据成为信息化发展的新阶段,而数据也被视为重要的战略资源。

    公开数据显示,2015年我国大数据市场规模为1100亿元,占全球市场大数据总规模的20.30%。2016年我国包括大数据核心软硬件产品和大数据服务在内的市场规模将超过1700亿元,与2015年相比,增长了61%。

    中国社会科学院法学研究所所长陈甦表示,互联网、大数据、人工智能等信息技术正在引发新一轮科技革命,数据已成为国家基础性战略资源,大数据合规、用户隐私保护备受瞩目。数字经济中大数据的发展和应用离不开法律的保驾护航,法律要为数字经济的创新发展提供良好的法律政策环境。

    郭峰说,大数据产业的持续健康发展,对我国的立法、司法、行政监管提出新的任务和课题,要重视数字经济背景下个人信息商业利用的法律边界问题。

    另外,针对用户个人信息保护相关的政策法规正在逐步落地。今年《网络安全法》及其相关规则和标准的陆续颁布,对数据保护带来深远影响。

    为落实《网络安全法》对个人信息保护的相关要求,中央网信办、工信部、公安部、国家标准委等四部门组成的专家工作组对微信、淘宝等十款网络产品和服务的隐私条款评审,规范收集、保存、使用、转让用户个人信息的行为。这表明数据保护和网络安全风险正被日益重视。

    大数据安全需要考虑安全标准。中国电子技术化研究院副院长杨建军介绍,此次隐私保护专项评审工作中,隐私条款透明度增强、用户选择权增多成为亮点。“十款产品和服务在隐私政策方面均有不同程度提升,均做到明示其收集、使用个人信息的规则,并征求用户的明确授权。”杨建军说。

    “用户也需要提升个人隐私保护的意识,查看隐私条款的具体内容。”杨建军认为,产品和服务向用户主动提示,满足用户的知情权,而在线“一站式”撤回和关闭授权,在线访问、更正、删除其个人信息,在线注销账号等新功能设计,也为用户提供更多选择。

    腾讯集团法务副总裁江波表示,在数据采集、存储、开放共享等存在安全隐患的大背景下,保护个人信息、保障网络安全,需要社会各界充分协作、共同参与。企业加强自律,强化信息安全管理体系;政府部门加强个人信息保护的全方位、多渠道监管。

    例如,微信在功能设计中包含用户撤回其同意采集、使用敏感信息的设置,用户可以根据其需要通过便捷的操作随时撤回其同意。

    个人信息的收集、使用应当获取用户明确授权,而隐私政策的内容应该让用户更加易读,提升数据处理透明度。同时,清晰地操作指引和完善的咨询渠道,给予用户更多的控制权,提升用户对其个人信息的控制力。

    此外,对于大数据的监管也需要新的思路。国家工商总局网络商品交易监管司副司长韦犁表示,大数据应用的商业模式跟传统的商业模式有很大区别,这意味着不能用传统的思维监管大数据商业发展,合规监管要带有审慎包容的态度。

  • ?

    高速高清扫描,数字化存储您的需求!

    任秋珊

    展开

    随着时代的进步,生活节奏也越来越快,但凡事不能只讲究快,在快的同时,还要做好;而要做好,说起来容易,做起来难。

    正所谓“商海无情,不进则退”再追求效率的同时,我们也要追求做的更好。出差在外当我们需要收发邮件、处理电子档时,可以用电脑解决,但当需要将纸质文档处理为电子档时,常常都会感到束手无策,而手机拍摄的又不能够1:1或者没有那么清晰,这时只能去附近的店里,当遇到重要文档需要保密时,会感到不知所措。

    而plustek为了满足使用者的需求,自主研发推出了MobileOffice C600文档拍摄仪,只需1秒就能将纸质文档快速且高清录入;机身采用结实耐用的金属支架,人性化的外形设计,做工小巧、精致;操作干脆灵敏,触控式LED补光灯、可外接摄像头数据插口;可调节金属拍摄支架,A3、A4幅面一键调节。

    可以扫描A3幅面及A3幅面以下文件,硬质卡片扫描;长时间没有进行任何操作时,会自动进入休眠,既环保又节能;机身搭配两个数据扩展插口,可外接摄像头或独立麦克风,也可外接U盘、移动硬盘、投影仪等;除可拍摄纸张文件和三维实物外,拍摄杆还可以270度翻转直立拍摄或录制现场人员或环境,内置高亮LED补光灯,通过底座的三级触控调光按键开关,可以根据环境变化适当补光,有效避免灯光过亮或过暗导致的曝光过度及补光不足。

    除可以扫描正常的平面纸张外,还可以扫描立体实物,并能进行精确对焦,并快速拍摄采集;智能连拍、自动对拍摄结果进行歪斜纠正,并去黑边裁切。

    机身体积小巧,不占空间,可以置放于桌面任何地方,特别适合于空间狭小的柜台、桌面使用。采用标准的TWAIN和WIA驱动程序作为接口,确保与TIF、JPG、PDF和Microsoft Office文件格式以及各种影像编辑软件及扫描环境的兼容性。

    支持自动扫描应用,可感应识别新置入的纸张,自动启动拍摄,减少反复按键的繁琐操作;可轻松将拍摄到的两张图像整合拼接在一起,合并为一个影像文件,支持上下、左右合并。

    plustek一切为了使用者!

  • ?

    大数据创新应用:高速公路的数据存储及处理

    阮虔纹

    展开

    【IT168 技术】摘 要:通过分析信息化建设脉络中高速公路数据的海量产生,结构复杂的海量数据存储及处理,阐述大数据平台在智慧高速建设中的作用,总结大数据在智慧高速中的客户服务、运营优化、稽查分析、应急资源调度、预测预警等方面的具体应用,对交通指挥中心工作提供支持。

    关键词:智慧高速 分布式数据处理 数据挖掘 客户服务 优化运营 预测预警

    Abstract:This paper analyzes the effect of big data platform in the construction of expressway construction by analyzing the mass production of expressway data and the complicated data storage and processing in the context of information construction, summarizes the customer service and operation optimization of big data in expressway, inspection and analysis, emergency resource scheduling, forecasting and early warning of specific applications, so as to provide support for the traffic command center.

    Key words:intelligence expressway; distributed data processing; data mining; customer service; operation optimization; forecasting early warning

    引言

    随着经济社会的发展,城市人口持续增长,数量持续增长的车辆给交通基础设施通行能力带来极大压力。交通拥堵、交通事故、环境污染及能源短缺已成为目前面临的重要问题,尤其在高速公路交通管理尤其变得更加明显。如何有效利用传统的高速公路数据与设备,提高交通运输效率、安全性、整体效益,提高交通的科学管理和组织服务水平是管理者迫切需要解决的问题。

    车辆在高速公路上,本身的动作及设备会产生海量数据,在没有大数据平台之前,高速公路上产生的数据分门别类的分布在Oracle、MySQL等数据库中,因为各自处理语言不同,在刚使用时分析速度尚且可以,但随着数据量越来越多,查询调用越来越频繁,速度变得越来越慢,无法满足高速管理需求。

    高速公路数据产生

    高速公路的信息化建设包含从基建到信息记录等多个层面。所有的环节都在不停地产生数据,成为智慧高速中的海量数据来源。首先是高速公路的硬件和基础设施,当一辆车开进收费站,先经过地下预埋的地感线圈,经过地板线圈进行切割磁力线,产生很弱的电流,车辆开进来会由定焦在地感线圈的摄像机拍一张图片,产生车辆进入收费站的第一个数据。继而递交收费卡、读卡、写卡,写卡的同时计算从A点到B点的费用,每一个动作都在产生数据。高速公路收费还涉及更加复杂的情况,如起点A到终点B,中间经过三段高速公路,三段的收费主体不同,需要在收费的金额上进行三个收费主体的拆分,这涉及到后台的数据计算。所以一辆车从进入收费口到驶离收费口,至少会产生两张图片,十余条流水数据,同时还会产生车道摄像和停位摄像等大量的视频信息。

    产生大量车辆数据的同时,收费员的动作,如按抬杆键、放行键、军车键等,也会产生数据记录,方便后续稽查时的图片分析,避免逃费等行为。设备本身也会产生大量数据,比如抬杆、打票、红绿灯转换,全部都会产生日志信息进入数据库,这还只是收费相关的数据信息。在看不到的地面上,还会存在很多信息采集系统,比如地磁式传感器、摄像头,检测车辆通过时的平均速度、平均车间距和平均占有率等等信息,大量数据都会进入数据库,进行后续的存储分析。一辆车在驶离高速公路时,已经产生了大量的数据信息,其中包含结构化和非结构化数据、流数据等多种数据形式。

    大数据平台架构设计及数据处理

    高速公路上产生的海量数据,需要一个企业级的大数据平台,对数据进行分门别类的存储管理,TDH企业级一站式大数据平台,以分布式架构对数据进行存储和计算,并在此基础上进行数据处理和应用。

    大数据平台架构设计

    数据进入大数据平台,上游业务系统中的数据,通过文件交换或Sqoop方式同步到大数据平台的贴源层,然后经过批处理加工后,形成明细层、汇总层和模型层。对于历史数据,比如收费站入口流水表和出口流水表,选择存储在Search引擎中,可以进行快速的历史数据检索。对于非结构化数据,例如图片和视频影像,选择存储在Hyperbase引擎中。同时,为了提高大数据平台的数据质量,使用Governor管理元数据(包括表和存储过程),监控所有数据的更改历史,进行数据血缘分析和影响分析。对上层的基于大数据平台的应用,可以使用标准的JDBC或ODBC与大数据平台进行连接,对数据挖掘需求,如节假日车流量预测、高速路拥堵程度预测等,可以图形化拖拽机器学习平台Sophon组件进行预测,如图1所示。

    ▲图1大数据平台架构

    高速公路的数据存储及处理

    高速公路中产生的车辆动作和收费员动作、信息采集系统等产生的海量数据都进入大数据平台进行存储和处理。这些结构复杂,形式多样的海量数据,对数据存储和处理提出了很高的要求。大数据平台支持兼容Oracle 、DB2 、Teradata数据库/数据仓库SQL方言,可以轻松的将数据从传统架构中进行迁移,所以方便应用研发人员利用这一特性实现数据处理核心的升级换代。同时,TDH支持低延时和高吞吐的实时计算场景,可实现基础结构化数据、非结构化数据和流数据的存储,并随时无缝扩容。大数据平台基本架构在于,对全省高速路网监控收费运营数据进行采集和整合,进入数据中心,基础数据库经过大数据平台处理形成专题数据库,然后将路网设备设施等资源统一融合,形成GIS和视频支撑平台,继而在集成平台以GIS和视频平台做支撑形成五大应用系统相互协作,最终在终端设置,如监控中心的监控大屏、会商室显示、普通的监控工作站、移动终端等设备上进行展示和发布。

    高速公路大数据由几个大的部分构成:高速收费数据主要应用于收费管理、风险管理、运营优化;监控设备数据主要应用于视频监控、运营管理、指挥调度;交调设备数据主要应用于基础采集、运营管理、指挥调度。交通数据尤其是视频数据和图像数据,在一个省份数万个摄像头下,以TB量级甚至PB量级增长,数据量巨大,在大数据平台支撑下,完成平滑扩容和查询分析等业务应用。

    智慧高速中的大数据应用

    大数据平台的处理

    大数据平台把实时数据,包括高速公路上的收费、监控等实时数据上传,与传统业务数据进行整合,包括一些城市交通等外联单位的历史数据。将各类结构化、非结构化、半结构化的数据,包括监控图像、抓拍信息、收费日志和视频等信息,进行数据集成、数据转换处理,然后各自建模分析,形成专题数据,把专题数据应用到相应的应用系统中,提供支撑。

    主要应用方面

    大数据在高速中的应用主要包括以下几方面:

    (1)客户服务。在ETC用户管理与车辆引导中,主要使用Apriori算法进行关联分析,提供客户增值服务和精准信息推送,同时满足客户关系管理的要求。可以根据客户的车辆迁徙路线等分析,进行相关的路线信息推送等。

    在ETC用户管理与车辆引导中,基于客户历史迁徙路线和商品购买历史,运用高维矩阵分解方法,发现客户购买偏好和潜在需求以及出行规律。当客户通过ETC时,实时拍照识别鉴定客户之后,基于客户车辆历史通过卡口数据,调用训练好在线数据挖掘模型,可以以大数据可视化的方式显示出来客户迁徙路线,并预测出客户未来迁徙线路,进而进行精准的地点线路信息推送。

    路线迁徙的可视化和路线预测的建模过程如下:

    利用大数据可视化方法,不仅可以详细每个车辆在地图上车辆行驶轨迹,而且可以显示所有车辆的运行总线路。例如春运年前的时候,可以看到小轿车大部分都是从北上广深流向中西部城市,年后的时候大部分车辆向北上广深汇集。再者,某个客运或者货车司机的路线有其固定的运行线路。路线预测建模过程如下:

    基于客户信息、车辆信息、车辆通过何时通过卡口数据历史数据,利用关联分析和高维矩阵分解方法,找到车辆和卡口进出对应关系,预测客户在下一段时间会通过的卡口,进而预测车辆行驶轨迹,从而提供精准的信息推送。

    (2)运营优化。通过流式机器学习实现时效分析,提前预警,协同各单位指挥调度;在进入大数据平台之后,通过数据分析,可以通过高速公路热点视频查看,进行自动推送;建立领导驾驶舱,设定流量排名,为优化运营提供决策依据。

    通过流式机器学习实现时效分析,提前预警,协同各单位指挥调度;在进入大数据平台之后,通过数据分析,可以通过高速公路热点视频查看,进行自动推送;建立领导驾驶舱,设定流量排名,为优化运营提供决策依据。基于sophon的在线的流式增量机器学习算法,开发时空深度残差网络(ST-ResNet)预测车辆密度。例如把高速公路,划成很多个矩形小区域,多个区域同时分析,它是一种整体性的预测。主要基于平滑性、周期性以及趋势性等三个个时间属性 以及空时间属性和外部天气数据。

    第一,模拟局部相邻时刻。它是一个平滑的过程,比如中午三点跟中午四点流量变化不会很大。

    第二,模拟周期性。把对应时间点昨天、前天、近一周平均、近一个月平均这个时刻的数据,作为输入,来刻画周期性。

    第三,模拟趋势性。把当前时间点更远点(前推半个、一个小时)的时间点(例如昨天、上周、上个月)的数据,模拟趋势性。

    第四,抽取空间属性。利用深度卷积神经网络,把一些地区划成子区域之后,相关的区域做会做卷积运算并合并,通过卷积之后,抓住了这个区域周围的车辆流量的相关性。这样卷积多次之后,相当于把更远相关区域的属性的影响都聚合到一起了。

    基于这四个结果,系统再做一个融合。第一部分融合,就是只考虑它的时间和空间属性。再考虑外部因素,比如最近的附近天气数据拿做第二次融合得到最终结果。

    (3)稽查分析。通过在Inceptor中对原始交易流水费分析,提供逃费稽查、出入口流水对比等异常行为的分析服务。

    通过在Inceptor中对原始的交易流水统计分析,抽取车辆逃费稽查和出入口流量相关历史特征,具体有,车辆最近一周、最近一个月、最近半年的缴费信息,缴费卡口每天每个时间点的出入流量信息。

    利用discover模型融合方法,融合时序预测模型和异常检测模型,效果较单独一种方法提升1.6倍。具体实现如下:

    首先,利用discover大数据分布式自动的时序预测方法,预测此卡口的当前流量,并和当前实际的出入情况对比,如果当前流量少于预测流量,则可能有逃费稽查情况出现;其次,利用分布式异常检测算法iforest和无监督算法深度自编码器检测数据异常,发现行为诡异车辆,业界先进的iforest和深度自编码器算法可以自动异常检测此种逃费稽查的车辆,会和平时它的缴费习惯不同,也会和其自前所属群体的习惯有所偏离,综合的偏离程度月的,逃费的概率越大。最后,利用非线性模型融合的方法,融合时序预测模型和异常检测模型两者的优点,能更准确的定位异常行为的车辆,为车辆稽查分析提供智能。

    (4)联合指挥。通过各项数据在Inceptor中的汇总和分析,综合呈现各相关数据,形成联合指挥。基于应急资源管理、路网交通协同调度、应急预案管理、处置效果评估、无人机监控等模块,实现交警、消防、路政等多部门联动响应,为各类交通事件条件下的路网协同控制和诱导管理提供可视化管理界面和决策支持。

    (5)应急资源调度。借助Inceptor的大规模数据处理能力,整合传统的应急资源设备与资源,协同建立最优化的调度。应急指挥调度系统可以采取“挂图作战”的形式进行,有效地保证在出现特殊情况时可以采取科学的应急措施,积极、快速、有序地处理各类事件,保障高速公路的正常、安全运行,实现应急指挥、应急资源和应急过程的信息化管理。

    (6)预测预警。扩充传统全面风险管理的数据维度,在交通预警等角度分析,提前告知用户。根据往年节假日各收费站流量统计数据,通过分析算法对本年节假日流量做出预测并进行排名。预测值是否超过对应收费站设定的报警门限,可以根据颜色分级进行预警。根据历史通行数据对车流量进行分析和预测,为节假日高峰时段的安全畅通发出预警、提前采取保畅措施,为高速路网的安全畅通提供保障。

    基于对各收费站实时数据的分析结果,可以对平日车流量按站点、小时/天分别进行统计得到时间序列,ARIMA是做时间序列预测较为成熟的模型,分别对该时间时间序列采用ARIMA自回归进行建模,然后对未来一个周期的数据进行预测。ARIMA全称为自回归积分滑动平均模型,可以记作ARIMA(p,d,q),其中p为自回归项,d为差分阶数,q为移动平均项数,通过ARIMA模型可以对收费站某个时段流量进行预测与应用,从而提升对车流量的预测预警。

    (7)资产管理。结合Inceptor和workflow,实现交通设备资产全生命周期管理,包括设备故障预测、质量分析等;通过设备监控专题,可以对高速公路外场设备如车检器、摄像机、气象站、情报板、GPS车辆及无人机等进行基于GIS地图的一体化监控;点击设备图标即可查看各种设备的状态、数据及图像。

    结合Inceptor和workflow,实现交通设备资产全生命周期管...

高速数据采集存储

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP