中企动力 > 商学院 > 环保数据采集软件
  • ?

    APP数据采集是怎么实现的

    常汝燕

    展开

    最近半年,我们八爪鱼陆续接到好几个APP数据采集的项目需求,我在群里面,偶尔也看到有些用户在问,有没有APP数据采集的工具。鉴于我们做过的几个APP数据采集项目的经验,我可以告诉大家,现在APP数据采集,市面上还没有通用的工具。我们八爪鱼内部是有一套工具,但由于使用的难度较高,需要编写脚本,所以不对普通用户公开,我们仅接受项目定制。

    虽然不对外公开,但并不妨碍我们将技术分享出来,APP数据采集,一般走以下两种方式:

    1.两种思路

    1. 抓包

    2. HOOK

    2.抓包

    有代码经验或APP开发的同学都很容易理解,其实很多APP,走的都是webservice通讯协议的方式,并且由于是公开数据,而且大部分是无加密的。所以只要对网络端口进行监测,对APP进行模拟操作,即可知道APP里面的数据是如何获取的。

    我们只需要写代码模拟请求,无论POST还是GET,即可得到该请求所返回的信息。再通过对返回的信息结构化解析,即可得到我们想要的数据。

    public static void main(String[] args) {

    Spider.create(new GithubRepoPageProcessor())

    //从https://github/****开始抓

    .addUrl("https://github/****")

    //设置Scheduler,使用Redis来管理URL队列

    .setScheduler(new RedisScheduler("localhost"))

    //设置Pipeline,将结果以json方式保存到文件

    .addPipeline(new JsonFilePipeline("D:\\data\\webmagic"))

    //开启5个线程同时执行

    .thread(5)

    //启动爬虫

    .run();

    }

    以模拟采集“meizu”应用市场为例

    应用市场产品

    抓包返回参数

    整个抓包过程

    3.HOOK技术

    HOOK技术是一种走操作系统内核的技术,由于安卓系统是开源的,所以可以借助一些框架修改内核,从而实现你要的功能。HOOK的形式,我们走的是Xposed框架。Xposed是一款可以在不修改任何其他开发者开发的应用(包括系统服务)的情况下,改变程序运行的一个开源框架服务。基于它可以制作出许多功能强大的模块,以此来达到应用程序按照你的意愿运行的目的。

    如果把安卓手机看做一座城堡,那Xposed可以让你拥有一个上帝视角,城里的运作细节尽收你眼底,还能让你插一手改变城堡的运作规律。

    什么意思呢?简单的说就是你可以通过他,自动化的控制你的APP。如果将我们的APP开在模拟器上,我们可以通过编码,通过他告诉APP这一步干什么,下一步干什么。你把它理解成类似游戏打怪外挂就可以了。

    而他每走一步,APP与服务端交互的数据,均可获取下来。这种方式广泛用于一些成熟的APP。比如某信采集。

    public class HookActivity implements IXposedHookLoadPackage {

    @Override

    public void handleLoadPackage(LoadPackageParam lpparam) throws Throwable {

    final String packageName = lpparam.packageName;

    XposedBridge.log("--------------------: " + packageName);

    try {

    XposedBridge.hookAllMethods

    (Activity.class, "onCreate", new XC_MethodHook() {

    @Override

    protected void afterHookedMethod(MethodHookParam param)

    throws Throwable {

    XposedBridge.log("=== Activity onCreate: " + param.thisObject);

    }

    });

    } catch (Throwable error) {

    XposedBridge.log("xxxxxxxxxxxx: " + error);

    }

    }

    }

    其实我们八爪鱼曾经也想开发一款通用的APP数据采集工具,并且两年前在这块投入研究了小半年,我们做出了一款APP采集脚本编辑工具,可以让一款APP的数据采集项目缩减到3-5天即可开发完成。但我们认为,这个工具需要编写脚本一般用户是比较难上手的,所以仅作为内部项目使用。

    以HOOK某APP为例:

    HOOK指令打开某

    4.这些年走过的坑

    聊完APP采集的思路,我们跟大家分享一些遇过的坑吧,让大家乐一乐

    坑一:签名算法

    以某信的文章列表页及某信息页为例,对其http访问进行抓包,会发现其url的一个核心参数是我们无法知道如何生成的,这就导致,我们不可能直接用该url进行信息爬取;签名算法如果无法破解,HTTP这条路就是死路了。

    坑二:http爬取回来的信息和页面显示不一致

    以某信的某信息页为例,对比直接访问某信页面及http爬取的信息,可明显发现http爬取到的信息较少。造成得两种方式都用,才能既照顾速度又照顾完整性。

    坑三:模拟器中的坑

    APP自动识别你的运行环境进行屏蔽,最厉害的还是某信,连你是用模拟器打开还是真机打开,是什么内核的,全部进行限制。曾经见过牛人,找某手机厂商专门定做真机来配合。

    坑四:帐号的坑

    这个坑就有点大了,要找号、养号,都不是件容易的事情,更惨的是封号,真真让你一夜回到解放前。

  • ?

    机动车尾气在线监测系统

    霍霸

    展开

    一、 项目背景

    据国家环保部统计,在大气的主要污染中近几年煤烟污染(主要是S02等)得到了比较好的控制,但是NO等污染物的比例早逐年上升趋势,而NO的主要排放源之一来自于在用机动车尾气的排放。按照目前经济发展状况,机动车的数量按照每年10%的速度递增,机动车尾气已经或将很快成为很多城市大气的主要污染源。

    目前,人们对在用机动车的关注通常只偏重于安全性能和动力性能,而对车辆带来的尾气污染一般来说重视不够。其中相当一部分车辆由于超载、过度使用,维护保养条件差等情况,使得其尾气中污染物排放量要比美国等发达国家高15倍以上。

    早在2000年,我国部分城市就开始用简易工况法取代当时的怠速法来进行车辆年检的工作,北京在2002年下半年在全国率先正式应用了简易工况法检测,在全国范闱内率先对车辆的NO排放采取了严格控制措施,近两年,昆明、深圳、杭州等城市也由于实施了简易工况法联网,对机动车尾气的排放控制都取得了良好的效果。

    实践证明:通过实施有效的机动车排放监管系统(建立I/M制度),对保证车辆的达标使用,加速老旧同车辆的更新淘汰,减少机动车排放污染,改善大气环境质量,是目前最为有效的办法。

    为了使城市的空气更加透明,更加清新,蓝天白云更多地出现在人们的视野里,各地都加快了改善大气环境质量的步伐,其中,对机动车尾气排放进行有效的监测和控制成为实现城市大气质量的根本性好转的关键措施。

    二、 功能特点

    基于RFID的汽车尾气在线监测平台是针对环保领域机动车排气污染监督管理工作的实际需求而研制开发。系统将综合运用RFID(无线射频)技术、图像识别技术、数据加密技术、视频监管、计算机与网络技术等国际国内领先的技术手段有机的结合运用,旨在增强机动车环保标志管理工作的信息化、智能化,完善机动车排放监管系统(I/M 制度)。通过对高排放车辆的精确管理,保证在用车的达标使用,加速老旧车辆的更新淘汰,减少机动车排放污染,改善大气环境质量。在项目建设完成后,具有以下功能特点:

    1) 信息审核、申请及处理

    待检车辆录入人员通过入待建车辆的车牌号码和车牌颜色,系统将自动提取该车辆的档案信息,录入人员核对车辆信息,确保每辆车录入的数据都是准确的,确保在基础数据的公正公平,不存在弄虚作假。

    若车辆信息有误,检测员可申请修改车辆数据。录入人员可申请复检车辆跨站检测解锁检测,还可申请更换车辆检测方法进行检测。

    2) 检测业务查询

    系统实现检测业务数据的查询功能,通过检测机构区域、检测机构名称、设备编号、检测类型、检测方法、车牌号码、检测日期、检测结果、车牌类别、检测报告编号、复测情况、检测机构性质、数据类型等属性进行查询,对查询结果可查看详细信息,并导出Excel、Word等类型文件,或生成日报、周报、月报、年报等几种形式展示。

    3) 检测站点管理

    检测站点管理主要实现检测站点的添加、删除、设置和修改信息等操作,还包括对多个站点发标审核进行管理、授权设置,各站点的资质申报、资质到期提示、资质延续申报、终止或变更的管理,将对检测站点的日常管理和审核实现自动化和信息化管理。

    4) 检测业务统计

    系统实现检测业务数据的统计功能,通过区域、站点名称、报表类型、首检情况、燃料类别、检测方法、检测结果、日期等进行统计,对统计结果可查看详细信息,统计结果可导出Excel、Word等类型文件,并生成饼状图、柱状图、日报、周报、月报、年报等几种形式展示。

    5) 过程数据分析

    过程数据分析模块通过对排放过程数据的自动分析能判断检测过程中检测设备是否正确安装,检测设备是否工作正常,检测设备内的软件系统是否符合规范。系统采用多种可疑数据分析的算法,通过对防作弊装置记录的过程数据进行连续自动的智能分析,并与检测结果进行比对,自动筛选检测过程中的可疑数据,实现对检测作弊行为的重点排查。

    三、 系统原理

    本方案采用在主要路段设置远距离读写器,汽车上安装电子标签的方式对通过该路段的汽车进行动态尾气检测。汽车上的电子标签记录本车唯一的ID号,以及尾气是否达标的信息,当汽车通过安装读写器的路段时会把这些信息发送给读写器,读写器通过以太网或GPRS连接远程服务器,可以将尾气超标的汽车ID传给远程服务器。相关部门可以通过登陆远程服务器对尾气超标的汽车进行处理。

    电子标签采用有源RFID技术,工作频率2.4GHz,识别距离70m,识别速度可达200公里/小时,采用GFSK调制方式,工作温度-25℃~+85℃,工作湿度小于90%;当尾气超标时,电子标签采用主动方式进行工作,主动将本车ID及尾气指标参数发射给读写器;在标签内部增加高能电池,可保证电子标签工作5年。

    读写器的工作频点、调制方式与电子标签一样,发射功率可以软件设置,读写器通过以太网或GPRS连接远程服务器,可以将尾气超标的汽车ID传给远程服务器。相关部门可以通过登陆远程服务器对尾气超标的汽车进行处理。

    通过将前端检测设备实施联网,建立一套完整的机动车排放数据库管理信息系统,完成管理、控制、数据采集、分析决策等工作,同时整合实现新车管理、环保标志发放管理、路检执法、抽检管理、维修管理、在用车监管及淘汰报废等机动车污染综合管理功能。

    在车辆进行尾气检测过程中,检测线采集的数据实时上传云中心,云中心在5秒内完成检测结果计算,并与标准限值进行比对,然后下发裁决结果。

    检测线只是一个数据采集端,所有数据的运算、比对都在云中心进行,检测线无法作假,也更方便环保部门监管,在云检测系统运行过程中,可随时通过视频和数据查看任意一条检测线的工作情况。根据相关要求,每条检测线都要配备监控摄像头,工作人员只要点击任意一个视频画面,实时检测数据就会显示在图像旁边的屏幕上。检测过程中的每一秒的检测数据都实时在屏幕上显示,如果出现问题,可以进行视频、数据双追溯,有效杜绝故意造假行为。

    最后所有数据均上传至云检测中心,云检测管理中心能够提供省、市、县的精确污染量综合数据,有利于政府部门控制区域大气污染物排放总量和对高排放车辆实施淘汰政策。云检测系统基于真实的检测数据源进行各项智能图表统计分析,可按时、日、周、月、季、年进行各项污染分析和状态分析,为政策研究和排放量公布提供可信数据源。

    四、 系统框架

    系统是以一个监管中心、检测站为主体架构,系统整体运行在计算机硬件、网络、存储平台、操作系统、数据库平台以及中间件平台上,用来搭建整个机动车尾气在线监测系统的底层结构,连接车辆检测设备控制系统、视频监控设备、后台数据管理系统及公共服务平台等,此外还包含用于支撑机动车尾气排放监管系统的基础组件和一些中间件。监控中心端系统包括车辆管理、车型库管理、检测机构管理、环保标志管理、报警防作弊等子系统,检测站端系统包括车辆报检、标志联网发放、数据采集等子系统。

    机动车尾气在线检测系统建设方案包括五大平台,分别是机动车污染防治感知平台、网络和基础设施平台、环境管理数据库平台、应用支撑平台和对外发布平台。

    4.1 机动车尾气污染防治感知平台

    主要包括处于监测前端的视频或录像设备、检测设备或仪器等实时监控与采集机动车排放尾气的各类监测数据,具备网络数据传输功能,与环境数据管理中心相连,实现数控中心与检测场所间实时的数据传输和监控;交管部门提供相应的接口,实现跨部门的数据交互;提供路检信息和抽检信息的接口,实现数据的交互和对数据进行统一管理。

    4.2 网络和基础设施平台

    系统具有数据通讯功能,周期地采集各个现场数据采集器发来的各种信息,进行处理、存储、显示及上传。系统能提供模拟信号和RS232、RS422、RS485等数字信号的接入及输出功能,可按照环保部门要求通过GPRS、电话拨号、电缆线、有线局域网、无线局域网、GSM、光纤等多种传输方式,向数据库平台定时传输数据和图表,并随时接受数据查询。

    系统中预置了多种通信协议(国家、省、地、市的通讯协议),用户只需选择通信端口和通信协议,借助GPRS就能实现数据远程上传。

    支持群发手机短信的方式发送排放数据和报警信息。客户通过手机就可随时随地掌控系统运行情况。

    4.3 中心数据库平台

    包括数据库服务器,数据库是应用系统环境的核心,保存和提供系统基本信息参数;车型数据库(VLT);环保车型目录数据;全市机动车环保数据库;检测站数据库(包括检测数据及视频数据);检测站信息数据;路检、抽检、遥感检测数据;对外发布数据;各类通知、投诉及反馈的数据管理;控制参数;维修信息。

    由于数据支撑平台的操作特点,使应用对于硬件的网络、内存、CPU、硬件可靠性都具有较高的需求,根据业务压力和应用规模,数据支持平台服务器采用2台服务器,部署双机方案,如果其中一台服务器由于业务压力或者软硬件故障引起的停机,可以由另一台服务器承担所有数据库服务,保证中心数据平台的高可靠性。

    4.4 应用支撑平台

    包括检测站监控服务器,车辆信息管理/抽检服务器,这部分建设方案属于机动车尾气监管系统的核心应用支撑平台,主要功能是接受保存各个检测站的检测工位传送的数据和视频,并自动加以分析;实现数据采集与传输、能检测数据真实性分析、检测站视频监控功能、对检测工位和检测过程实施全面的监控和管理、检测站信息管理;实现车辆档案信息维护管理;对常规路检、停放地抽检、遥感检测、超标车辆复检以及其它自动检测的管理功能;对常规路检、停放地抽检、遥感检测、超标车辆复检以及其它自动检测的管理功能。

    为满足系统应能够每天24小时连续不间断工作,支持连续多个用户的数据浏览和输入和并发访问,并能满足后期业务扩展的要求。应用支撑平台服务器选择选择高端双路服务器。

    4.5 对外发布平台

    主要功能包括公众信息查询及对外发布服务器,提供管理部门发布相关业务信息功能,面向公众发布机动车管理相关的各项政策法规以及与环保相关的各种信息、新闻,及车辆相关信息的查询功能。

    公众信息查询及对外发布服务器是前端检测平台、公众和后台支撑平台的接口,为了防止服务器的故障,导致用户无法访问支撑平台,方案配置2台以上服务器,既能实现客户端接入的负载均衡,还能保证未来业务扩展。

    此外,为了防止操作系统出现操作失误、软件错误或者硬件故障导致数据丢失,需要将全部或部分数据集合从后台支撑平台产生的数据,备份到一个独立的设备中。由于平台产生的数据量较大,考虑到方案的成本,本次方案中配置1台备份一体机,采用LAN备份方式,将数据直接备份到存储服务器本地。

    五、 方案优势

    机动车尾气在线监测系统通过先进的计算机网络技术将机动车检测机构的排气污染检测工位和检测设备、流动检测设备及未来新增加的检测设备实施联网,建立一套完整的机动车排放数据库管理信息系统。

    深入了解客户应用,提供稳定可靠的硬件基础平台,帮助客户完成管理、控制、数据采集、分析决策等工作。

    方案致力于提高行政管理效率和综合执法能力,为机动车污染防治的各项措施提供有效平台和载体,为监督管理提供科学依据和决策支持,项目建成后具有以下优势:

    1、 将先进的计算机网络技术与认证的检测排放终端设备、流动检测设备及未来新增加的检测设备与数据中心联网,实现检测实时同步进行数据采集、传输、监控、分析决策、管理服务等。

    2、 建立机动车排气污染检测站端系统,包括车辆检测设备控制系统、检测站管理、视频监控设备,实现数据采集工作。

    3、 提供稳定可靠的计算机硬件、网络、存储等基础平台,用来搭建整个机动车尾气排放监管系统的底层支撑平台,为机动车尾气监管系统提供稳定的计算能力和存储资源。

    4、 硬件平台具有良好的扩展性,满足未来业务的扩展。

    5、 提供数据保护方案,保证数据安全性。

    六、 联系我们

    1、 公司介绍

    天津智易时代科技发展有限公司是由南开大学博士团队创建的高科技软件研发与信息系统集成公司,注册于天津市滨海高新技术产业园区,公司主要从事软件开发、系统集成、互联网信息技术领域的软件研发和信息系统集成。

    公司与南开大学软件学院、南开大学信息学院、天津大学信息学院始终保持着良好的合作。以南开大学为技术核心支撑,校企优势互补,促进科研成果转化。

    我们开发的项目及案例:天津市科技型中小企业创新基金天使投资项目申报系统;天津中医一附属医院大型一卡通项目,包括食堂售饭,超市购物,职工门禁,职工自行车借用等子系统;互联网+智慧消防水源管理系统;安卓项目评...

  • ?

    ForeSpider数据采集软件之链接抽取脚本

    Diane

    展开

    ForeSpider数据采集软件之链接抽取脚本

    前嗅ForeSpider数据采集软件是一款通用性互联网数据采集软件,软件几乎可以采集互联网上所有公开的数据,通过可视化的操作流程,从建表、过滤、采集到入库一步到位。同时软件内置了强大的爬虫脚本语言。如果有通过可视化采集不到的内容,都可以通过简单几行代码,实现强大的脚本采集。

    很多用户说可视化的操作太简单,一定要看软件脚本的教程,所以今天给大家出一个爬虫脚本的链接抽取教程,满足用户更多的需求。

    案例使用的是大众点评网,要抽取下面的翻页链接。

    第一步先看每一页的链接地址有没有规律。

    可以看到每一页的链接地址只有最后一个数字是不一样的,分别是对应的页码数,我们可以通过拼接的方式得到所有翻页的链接地址。下面写了拼接第二页链接地址的脚本:

    第一行代码:定义一个url类的变量u

    第二行代码:u.urlname是网页的链接地址,为其赋值

    第三行代码:u.tmplid是这个链接抽取所要关联的模板id,这里是翻页,所以关联自身模板

    第四行代码:这个链接抽取所对应的频道id

    第五行代码:u.title是链接标题,为其赋值

    第六行代码:将所拼接的链接添加到最后的结果中

    上面只是解释每一行代码的作用,取到的只是第二页的链接,下面给大家放完整的内容:

    通过FindClass的方式,从源码中得到总页数,然后使用for循环拼接每一页的链接。一共才用了12行(其中还包含了两行注释)就得到了自己想要的链接,是不是非常的简单呢,希望大家多看帮助文档,很多问题在帮助文档里就有了答案(我也经常遇到不会的然后去看文档)。

    前嗅ForeSpider是一款非常简单好用的通用型数据采集软件,操作简单功能强大的同时还保证了采集速度,完全可以满足企业级用户需求。

  • ?

    六大主流大数据采集平台架构分析

    雅绿

    展开

    随着大数据越来越被重视,数据采集的挑战变的尤为突出。今天为大家介绍几款数据采集平台:

    Apache Flume Fluentd Logstash Chukwa Scribe Splunk Forwarder

    大数据平台与数据采集

    任何完整的大数据平台,一般包括以下的几个过程:

    数据采集–>数据存储–>数据处理–>数据展现(可视化,报表和监控)

    其中,数据采集是所有数据系统必不可少的,随着大数据越来越被重视,数据采集的挑战也变的尤为突出。这其中包括:

    我们今天就来看看当前可用的六款数据采集的产品,重点关注它们是如何做到高可靠,高性能和高扩展。

    1、Apache Flume

    Flume 是Apache旗下的一款开源、高可靠、高扩展、容易管理、支持客户扩展的数据采集系统。 Flume使用JRuby来构建,所以依赖Java运行环境。

    Flume最初是由Cloudera的工程师设计用于合并日志数据的系统,后来逐渐发展用于处理流数据事件。

    Flume设计成一个分布式的管道架构,可以看作在数据源和目的地之间有一个Agent的网络,支持数据路由。

    每一个agent都由Source,Channel和Sink组成。

    Source

    Source负责接收输入数据,并将数据写入管道。Flume的Source支持HTTP,JMS,RPC,NetCat,Exec,Spooling Directory。其中Spooling支持监视一个目录或者文件,解析其中新生成的事件。

    Channel

    Channel 存储,缓存从source到Sink的中间数据。可使用不同的配置来做Channel,例如内存,文件,JDBC等。使用内存性能高但不持久,有可能丢数据。使用文件更可靠,但性能不如内存。

    Sink

    Sink负责从管道中读出数据并发给下一个Agent或者最终的目的地。Sink支持的不同目的地种类包括:HDFS,HBASE,Solr,ElasticSearch,File,Logger或者其它的Flume Agent。

    Flume在source和sink端都使用了transaction机制保证在数据传输中没有数据丢失。

    Source上的数据可以复制到不同的通道上。每一个Channel也可以连接不同数量的Sink。这样连接不同配置的Agent就可以组成一个复杂的数据收集网络。通过对agent的配置,可以组成一个路由复杂的数据传输网络。

    配置如上图所示的agent结构,Flume支持设置sink的Failover和Load Balance,这样就可以保证即使有一个agent失效的情况下,整个系统仍能正常收集数据。

    Flume中传输的内容定义为事件(Event),事件由Headers(包含元数据,Meta Data)和Payload组成。

    Flume提供SDK,可以支持用户定制开发:

    Flume客户端负责在事件产生的源头把事件发送给Flume的Agent。客户端通常和产生数据源的应用在同一个进程空间。常见的Flume 客户端有Avro,log4J,syslog和HTTP Post。另外ExecSource支持指定一个本地进程的输出作为Flume的输入。当然很有可能,以上的这些客户端都不能满足需求,用户可以定制的客户端,和已有的FLume的Source进行通信,或者定制实现一种新的Source类型。

    同时,用户可以使用Flume的SDK定制Source和Sink。似乎不支持定制的Channel。

    2、Fluentd

    Fluentd是另一个开源的数据收集框架。Fluentd使用C/Ruby开发,使用JSON文件来统一日志数据。它的可插拔架构,支持各种不同种类和格式的数据源和数据输出。最后它也同时提供了高可靠和很好的扩展性。Treasure Data, Inc 对该产品提供支持和维护。

    Fluentd的部署和Flume非常相似:

    Fluentd的架构设计和Flume如出一辙:

    Fluentd的Input/Buffer/Output非常类似于Flume的Source/Channel/Sink。

    Input

    Input负责接收数据或者主动抓取数据。支持syslog,http,file tail等。

    Buffer

    Buffer负责数据获取的性能和可靠性,也有文件或内存等不同类型的Buffer可以配置。

    Output

    Output负责输出数据到目的地例如文件,AWS S3或者其它的Fluentd。

    Fluentd的配置非常方便,如下图:

    Fluentd的技术栈如下图:

    FLuentd和其插件都是由Ruby开发,MessgaePack提供了JSON的序列化和异步的并行通信RPC机制。

    Cool.io是基于libev的事件驱动框架。

    FLuentd的扩展性非常好,客户可以自己定制(Ruby)Input/Buffer/Output。

    Fluentd从各方面看都很像Flume,区别是使用Ruby开发,Footprint会小一些,但是也带来了跨平台的问题,并不能支持Windows平台。另外采用JSON统一数据/日志格式是它的另一个特点。相对去Flumed,配置也相对简单一些。

    3、Logstash

    Logstash是著名的开源数据栈ELK (ElasticSearch, Logstash, Kibana)中的那个L。

    Logstash用JRuby开发,所有运行时依赖JVM。

    Logstash的部署架构如下图,当然这只是一种部署的选项。

    一个典型的Logstash的配置如下,包括了Input,filter的Output的设置。

    几乎在大部分的情况下ELK作为一个栈是被同时使用的。所有当你的数据系统使用ElasticSearch的情况下,logstash是首选。

    4、Chukwa

    官网:https://chukwa.apache.org/

    Apache Chukwa是apache旗下另一个开源的数据收集平台,它远没有其他几个有名。Chukwa基于Hadoop的HDFS和Map Reduce来构建(显而易见,他用Java来实现),提供扩展性和可靠性。Chukwa同时提供对数据的展示,分析和监视。很奇怪的是它的上一次 github的更新事7年前。可见该项目应该已经不活跃了。

    Chukwa的部署架构如下:

    Chukwa的主要单元有:Agent,Collector,DataSink,ArchiveBuilder,Demux等等,看上去相当复杂。由于该项目已经不活跃,我们就不细看了。

    5、Scribe

    代码托管:https://github/facebookarchive/scribe

    Scribe是Facebook开发的数据(日志)收集系统。已经多年不维护,同样的,就不多说了。

    6、Splunk Forwarder

    以上的所有系统都是开源的。在商业化的大数据平台产品中,Splunk提供完整的数据采金,数据存储,数据分析和处理,以及数据展现的能力。

    Splunk是一个分布式的机器数据平台,主要有三个角色:

    Search Head负责数据的搜索和处理,提供搜索时的信息抽取。

    Indexer负责数据的存储和索引 Forwarder,负责数据的收集,清洗,变形,并发送给Indexer

    Splunk内置了对Syslog,TCP/UDP,Spooling的支持,同时,用户可以通过开发 Input和Modular Input的方式来获取特定的数据。在Splunk提供的软件仓库里有很多成熟的数据采集应用,例如AWS,数据库(DBConnect)等等,可以方便的从云或者是数据库中获取数据进入Splunk的数据平台做分析。

    这里要注意的是,Search Head和Indexer都支持Cluster的配置,也就是高可用,高扩展的,但是Splunk现在还没有针对Farwarder的Cluster的功能。也就是说如果有一台Farwarder的机器出了故障,数据收集也会随之中断,并不能把正在运行的数据采集任务Failover到其它的 Farwarder上。

    总结

    我们简单讨论了几种流行的数据收集平台,它们大都提供高可靠和高扩展的数据收集。大多平台都抽象出了输入,输出和中间的缓冲的架构。利用分布式的网络连接,大多数平台都能实现一定程度的扩展性和高可靠性。

    其中Flume,Fluentd是两个被使用较多的产品。如果你用ElasticSearch,Logstash也许是首选,因为ELK栈提供了很好的集成。Chukwa和Scribe由于项目的不活跃,不推荐使用。

    Splunk作为一个优秀的商业产品,它的数据采集还存在一定的限制,相信Splunk很快会开发出更好的数据收集的解决方案。

  • ?

    省安监总局安全数据采集管理中心解决方案

    车伊

    展开

    第一部分系统目标

    省安全生产监督管理局安全数据采集管理中心的总体建设目标,就是建设一个对安监网安全巡查的数据进行统一采集、存储、管理的中心平台,实现能够使县市乃至省级安监局相关单位在安监专网网络范围内通过此系统将安全巡查过程中智能安全帽所记录巡查的各类数据(视频、音频和照片)上传到系统平台,进行统一存储管理,便于各县市省级单位同事及领导登录系统后,对上传的各类数据(视频、音频和相片)进行检索、查看、浏览、下载,满足对安监网巡查工作更细致的情况追踪和监控,实现更高效的业务转化。

    系统主要特点

    1、拥有自主研发的智能安全帽,使用该安全帽可实现在巡查工作过程中的全自动巡查记录或重点记录,在不影响巡查工作的各项操作下,实现静默且稳定的图像资料记录和保存,实现巡查工作的忠实记录和保存,以便于巡查工作更好的保存和追踪。

    2、拥有自主研发的智能安全帽数据采集柜,具备智能的门锁技术,实现安全帽和储存柜的互相绑定,安全帽配合采集柜实现设备保存、设备充电、设备数据自动采集三合一功能,大大简化使用流程和提升使用便利性。

    3、采集柜本机具备超大容量存储空间的同时,可实现手动或自动上传备份数据或者传输数据至制定数据位置,实现数据的分布存储或集中存储的不同需求。可根据条件设置自动化执行任务,实现自动定时或针对性备份或传输特定数据,同时不同数据支持互相迁移。

    4、灵活多样、满足多途径的数据检索、统计和再利用能力,通过通用浏览器即可方便访问数据管理平台,实现远程的数据检索、预览、下载或备份。

    5、完善的日志管理和追踪功能,用户在系统中的各项操作均会生成日志记录,方便层层溯源追踪把控。

    6、完善的用户层级和权限管理,上百项细致入微的用户自定义权限内容,精确把控不同用户可在系统中获取的数据及操作权限,方便不同的使用和管理需求。

    7、支持网状模型连接扩展,可无限扩展架构层级,无损添加新节点,满足不断扩张成长的业务需求。

    通过该系统平台的建设,帮助省安监局各地单位建立远程的巡查数据管理入口,实现巡查业务更加精确高效安全的同时,将各地区的数据区块汇总接入,最终建立起属于省安监局单位独有的云端巡查数据管理中心。

    第二部分系统逻辑结构

    该方案可分为两种形成,每种形式各有优势和缺点,可以根据实际的需求情况,采用不同的搭建形式,满足不同的建设目标。、

    一、分布存储独立架构

    该架构下系统包含:一级应用服务器一台运行数据管理中心平台软件;一级数据服务器一台用于备份特殊重要数据满足少量独立存储需求;二级分布式数据采集柜多台。

    通过多台数据采集柜互联构成采集柜网状结构,经由网络统一直接连接到一级应用服务器托管,实现应用服务器对所有网络内的数据采集柜的远程连接、访问和管理,同时一级数据服务器接入应用服务器,作为数据管理平台的备份数据存储中心,常规数据全部储存在区块中各自独立的数据采集柜内,网络内电脑通过浏览器开启数据管理中心后台登陆,即可实现远程的数据访问与管理,并根据应用服务器内的权限层级设定,实现不同的功能和效果。

    结构拓扑图见(图1)

    优点:

    该模式下搭建平台更为简单快速,由于单层结构设计,可以大大免去网络层级的部署和规划,同时简化接入流程,提供快速更高效的平台建设和数据传输流程。数据采集柜接入网络,连接应用服务器即可实现托管。建设简单,相对建设成本较低,满足快速搭建小型网络平台或初期建立平台雏形,后续可方便的升级变换架构,升级成中心存储集群式。

    缺点:

    由于采用较为简单的单层结构,数据全部分布存储于数据采集柜,数据存储较为分散,访问并管理的效率较低,同时由于分布存储的原因,只安排了较小的数据服务器满足低比例的特殊备份需求,大量数据分散存储于不同地区采集柜中,数据产生丢失或者无法访问的风险较高,需要稳定的供电和网络维持基本的连接。同时分布式存储导致的数据访问并发情况较多,对网络的承载压力较大,传输链路较多跳转,导致效率较低。

    二、中心存储集群架构

    该架构下系统包含:一级应用服务器一台运行数据管理中心平台软件;一级数据服务器多台或多级数据服务器多台用于备份特定区块数据满足集群数据存储需求;二级分布式数据采集柜多台。

    通过多台数据采集柜互联构成采集柜网状结构,经由网络连接到区块内独立数据服务器,区块设立可依据地区或者业务规划来定,多区块数据服务器最终通过网络统一连接中心应用服务器,实现应用服务器对所有网络内的数据采集柜和数据服务器都能实现远程连接、访问和管理,设定不同的权限层级可满足区块内数据访问的相对独立和区块间的数据仍能通信的需求,同时通过中心应用服务器设定自动化自定义条件任务,自动执行数据从数据采集柜汇总备份到区块数据服务器进行多层级分布式存储,最终实现数据的多重安全备份,高效汇总和自动化的分配目标。

    结构拓扑图见(图2)

    优点:

    该架构下搭建而成的平台具备多区块分布存储备份,数据永不丢失,安全可靠,同时基于分布式存储技术接入网络后可实现更高效的可访问性和更稳定的数据传输。基于自动化的自定义任务可以在网络闲时自动静默汇总分散于采集柜中的零散数据集中传输至区块内的专用数据服务器进行存储,同时借由数据服务器的高速处理能力,实现更高效的远程访问、预览、下载、传输及检索操作。架构内采集工作、数据存储、中心访问分工明确,互不干扰运行更加稳定,同时可方便的无限拓展数据服务器数量,满足长远的平台成长需求。

    缺点:

    该方案搭建需要配合规划区块,搭建相对独立的数据服务器,同时由于多层级的架构加大了初期建设的工程难度和成本,基于分布式存储的形态需要安排更多的服务器安装空间。

    第三部分系统运行环境

    系统分为采集端CS程序和浏览器BS管理程序两部分。

    系统采集程序运行在windows环境下,支持各种版本的windows系统,数据库支持SQL Server系列的数据库或其它版本的关系型数据库。

    对安全帽采集数据的管理后台使用浏览器,支持目前主流的各种版本的浏览器。

    第四部分产品介绍

    智能安全帽

    l高清宽动态摄像头,支持高清录像

    l开机自动录像,免去繁琐操作

    l机身一体化设计,镜头及照明灯内置,产品更美观

    l高强度复合材料帽身,提供专业的安全帽应有的防护功能

    l简约的功能操作设计,一键开机,一键录像,一键亮灯

    l支持大容量最高128GB存储扩展,满足更持久的录像需求

    数据采集柜

    l高强度框架式机身,抗冲击防腐蚀外壳

    l安全内部排布设计,满足长时间连续稳定运行需求

    l内置键盘鼠标,屏幕支持触摸,多种操作方面满足不同场景需求

    l多设备独立存储仓设计,方便单独存储安全帽以及其他装备。

    l智能电子独立门锁设计,可实现独立开启每个存储仓位。

    l支持多设备同时接入,满足大批量安全帽充电需求同时实现自动化数据采集上传

    l支持网络化运行,可单机使用也可接入网络后交由统一服务器托管,实现多台采集柜互联构建采集网络。

    l主柜6口,副柜10口,最多一主两副一共26口,但实际可用最多22口。

    数据管理平台(服务器)

    lBS轻量化设计架构,通用浏览器即可访问,满足更好的兼容性

    l支持多条件数据检索,满足快速书筛选需求

    l支持多层级网络架构,实现不同的平台建设需求

    l支持用户权限管理,根据实际需求定义用户不同权限实现不同管控

    l远程预览,远程下载,可通过网络随时访问数据并进行管理

    l高度自定义的自动化任务系统,设定周期,时间,人员,单位等条件实现自动化数据备份操作。

    第五部分:产品功能说明

    一、产品示意图

  • ?

    工厂排放污染源在线无线监测应用

    秦靖琪

    展开

    方案需求

    工业污染源远程无线监测是了解和掌握区域排污状况和排污的情况,其监测结果开展环境保护工作的依据。只有加强对污染源在线监测监控设备的监管,提高环境管理科学化、信息化水平,才能确保全市自动监控设备的正常、稳定运行。通过对污染产生、治理、排放过程中重要过程参数的采集,建立其与污染源排放在线监测数据的关联关系,判断污染物排放数据的合理性,为总量核算、排污监察、排污收费提供技术支持。现场设备可以通过有线或无线通讯方式实现监测数据的远程传输,实现各级主管部门对污染治理设施的远程实时监测、监控,历史数据提取及强制反控等操作。

    通过对重点污染源排放状态的自动监控,及时、准确、全面地反映环境质量现状,为环境管理、污染源控制、环境规划、环境评价提供客观的依据,增强企业的守法自觉性,提高环保现场执法的现代化水平,逐步达到提高环境质量的最终目的。

    技术部署

    工业污染源远程无线监测是由监控站点传感器、数据传输、污染源监控中心、污染源在线远程监管系统等组成。采用了计算机、通讯和云计算领域技术,从而搭建污染源在线自动监控监测系统平台。

    工业污染源远程无线监测分为现场层、网络传输层和中心监控层三个层次。现场层包括数据采集传输仪和各种监测、采样设备。完成数据采集、存储、发送及命令接收等方面的功能。

    污染源排放在线监测传感器采集烟尘(烟尘、SO2、NOx)、污水(COD、流量、TOC、总磷、氨氮)、污染源噪声等数据,欣仰邦DTU数传终端通过2G/3G/4G网络将数据传输到云服务器,数传终端数据采集传输仪以RS485/RS232接口和各种监测、采样设备。完成数据采集、存储、发送及命令接收等方面的功能。并与服务器之间交换数据、指令下达,以实现对现场层的集中远程监控。

    方案优点

    l 数传终端:实用性强、覆盖面广、灵活性好的环保数据采集传输;

    l 多重网络:LoRa/NB-IoT/2G/3G/4G无线传输为环境监测提供了很好的联网解决方案;

    l 接口兼容:标准RS232/485 接口,支持Modbus 通信协议及非标准通讯协议的开发

    l 监控功能:在监控中心可以通过网络实时监测各站点的实时数据;

    l 报警功能:任何现场的异常报警信号能在监控中心集中进行声光、画面报警;

    l 数据储存:按规定的数据库格式保存现场原始数据、报警数据和操作记录的数据;

    l 数据发布:中心数据库数据能实现数据共享,对其它系统具有开放性。

  • ?

    福利,数据采集工具和一些云平台推荐

    冷霜

    展开

    目前有很多数据采集云平台,如百度统计,腾讯统计、乐驰云采集等等,还有一些平台也非常不错:

    一. 友盟+

    支持移动端和web端数据采集,个性化场景数据定制采集方案。官网给的一些demo可以参考来设计大数据的分析展现,例如:

    友盟的:

    百度的:

    值得借鉴~

    二. 乐驰云采集

    以高性能分布式采集、存储为核心,建立分工明确的功能模块进行高度协作,融合打码、分词、代理、排重等实用性服务,帮助用户以最低成本、最少人力、最高效率完成大数据应用开发,从而满足当下广大中小企业对“实时、高难、海量”级大数据业务场景的根本需求。

    http://lewell/service.html#tabcon_4

    值得一看

    三. 火车采集器

    火车采集器,一款专业的互联网数据抓取、处理、分析,挖掘软件,可以灵活迅速地抓取网页上散乱分布的数据信息,并通过一系列的分析处理,准确挖掘出所需数据。火车采集器历经十二年的升级更新,积累了大量用户和良好口碑,是目前最受欢迎的网页数据采集软件。

    对于网站采集数据的主流实现方式是通过javascript脚本引入,记录页面动作与变化,搜集数据后作为参数,通过gif图片(gif图片格式请求可以解决跨域问题)请求上报。

    比如一些大型网站,可以看到他们的数据采集方式:如淘宝,百度,京东,聚划算等

    个人设计的web采集数据方案:

    lg.js脚本引入页面中通过gif图片请求到后端服务器服务器记录请求参数到日志文件日志文件实时抓取到消息队列实时计算系统消费队列消息,完成分析整理分析结果入ES,kibana二次开发展示ES历史数据入Hadoop

  • ?

    前嗅的这款数据采集软件和像八爪鱼这类的软件有什么区别,优势在哪?

    老尸

    展开

    前嗅的这款数据采集软件,这个可以去它官网,好像百度经验不允许粘网址。搜“前嗅”或就可以找到官网。建议大家先在官网注册登录,免费试用前嗅ForeSpider爬虫软件,如果满意的话再使用付费版也不迟。不过小编觉得还是很好用,不信你可以试试,免费体验就可以抓取很多数据信息。

    前嗅采集器logo

    之前小编发现很多公司使用八爪鱼等采集工具互相合作过,但是八爪鱼采集速度太慢,小编是开着服务器用八爪鱼采集,一个月差不多采到100万条数据。后来是朋友介绍知道的前嗅,用前嗅的软件,小编仅仅开着笔记本采,一天给小编采了几百万条,差距还是很明显的。

    他们的ForeSpider数据采集软件很高级,不论是采集速度还是采集的数据全面,都完成的非常好。另外值得一提的是他们可视化的操作,对于小编这种技术白很是方便,几步的配置就能完成采集。有一些比较复杂的网站,也可以用他们自己的爬虫脚本。就算自己不想配置,也可以直接找他们买模板,拿回来自己一点按钮就能采集,小编也是每次都是直接买的模板。

    最主要他们不仅仅能采集,他们还有自己的数据分析系统。数据采集后把数据交给他们,进行分析,然后给小编分析报告也是非常的详细和具体,省了小编很多的事。分析方面给我提供了很多有价值的建议,有效的提升了小编公司的市场竞争力。 小编也是现在跟前嗅合作久了,觉得很是不错,总想着推荐给同行们使用,良心推荐一下。

    数据采集抽象图

    可以采集,案例的话。。。我也没有。。你可以找他们客服要,应该有吧。大家觉得我说的哪里不对的,欢迎大家给小编留言指点,谢谢!

  • ?

    QQ数据采集软件-QQ营销必备

    侯元柏

    展开

    QQ数据采集器-QQ营销必备工具

    导语

    现在是大数据时代,无论做什么营销都需要用到数据。数据是根本,数据能引导你的营销思维。做QQ营销同样需要大量的精准数据,今天小编为大家介绍一款QQ数据采集软件,这款软件既可以采集精准客户QQ,同时也可以采集精准客户QQ群以及QQ群成员。

    软件功能特点

    ⊙支持按关键词采集精准客户qq

    ⊙支持自动检测所采集好友是否为单双向好友

    ⊙支持自动检测所采集qq是否开通临时会话功能

    ⊙支持自动识别qq所在城市、性别。年龄

    ⊙支持按关键词采集精准客户qq群

    ⊙支持自动筛选出群主qq

    ⊙支持自动检测是否可以直接添加qq群

    ⊙支持以文本文档格式导出qq群

    ⊙支持采集qq附近的人(全国定位)

    ⊙支持采集本地好友和群

    ⊙支持采集空间qq

    ⊙支持采集微博听众

    ⊙支持采集企业qq

    ⊙支持论坛qq采集

    软件功能效果展示

    易推客营销软件

  • ?

    2018年最值得推荐的6款大数据采集工具

    岑之槐

    展开

    数据肯定是无价的。但分析数据并非易事,因为结果越准确,成本就越高。鉴于数据急剧增长,需要一个过程来提供有意义的信息,最终变成实用的洞察力。

    数据挖掘是指这个过程:在庞大数据集当中发现模式,将它转换成有效的信息。该技术利用特定的算法、统计分析、人工智能和数据库系统,从庞大数据集中提取信息,并转换成易于理解的形式。本文介绍了广泛用于大数据行业的6种综合数据挖掘工具。

    1. Rapid Miner

    Rapid Miner是一个数据科学软件平台,为数据准备、机器学习、深度学习、文本挖掘和预测分析提供一种集成环境。它是领先的数据挖掘开源系统之一。

    该程序完全用Java编程语言编写。该程序提供了一个选项,以便用户试用大量可任意嵌套的操作符,这些操作符在XML文件中有详细说明,可由Rapid Miner的图形用户界面来构建。

    2. Oracle Data Mining

    它是Oracle高级分析数据库的代表。市场领先的公司用它最大限度地发掘数据的潜力,做出准确的预测。该系统配合强大的数据算法,锁定最佳客户。

    此外,它可识别异常情况和交叉销售机会,让用户能够根据需要运用不同的预测模型。此外,它以所需的方式定制客户画像。

    3. IBM SPSS Modeler

    说到大规模项目,IBM SPSS Modeler最适合。在这个建模器中,文本分析及其最先进的可视化界面极具价值。它有助于生成数据挖掘算法,基本上不需要编程。

    它可广泛用于异常检测、贝叶斯网络、CARMA、Cox回归以及使用多层感知器和反向传播学习的基本神经网络。

    4. KNIME

    Konstanz Information Miner是一个开源数据分析平台。你可以迅速在其中部署、扩展和熟悉数据。在商业智能界,KNIME号称是有助于为毫无经验的用户提供预测智能的平台。

    此外,数据驱动的创新系统有助于发掘数据潜力。此外,它包括数千个模块和随时可用的示例以及一大批集成的工具和算法。

    5. Python

    Python是一种免费的开源语言,因易用性常常与R相提并论。与R不同,Python学起来往往很容易上手,易于使用。许多用户发现可以在几分钟内开始构建数据,并进行极其复杂的亲和度分析。

    只要你熟悉变量、数据类型、函数、条件语句和循环等基本编程概念,最常见的业务用例数据可视化就很简单。

    6.火车采集器

    火车采集器由合肥乐维信息技术有限公司开发,是一款专业的网络数据采集/信息挖掘处理软件,通过灵活的配置,可以很轻松迅速地从网页上抓取结构化的文本、图片、文件等资源信息,可编辑筛选处理后选择发布到网站后台,各类文件或其他数据库系统中。

环保数据采集软件

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP