中企动力 > 商学院 > 网络数据采集系统
  • ?

    令人羡慕的程序猿!小哥的数据采集系统一年销售400余万

    陆人雄

    展开

    现在更多的人们去尝试使用与购买了无人机,这也代表着无人机的发展越来越先进,愈发的走进人们的生活当中。但现在市场中的无人机公司部队仍旧没有过多的扩张,于是就有更多的人们想要进入到无人机的市场中。胡心怡便是其中一个。但无人机,并没有想象中那么好做。

    胡心怡曾是上海交通大学机械自动化专业的学生,身为浙江人,他总觉得体内流淌着浙商的血液,计划着在年满30岁时创业圆梦。他决定从旧公司离职,做一家为B端客户制造工业级无人机并提供完整解决方案的公司——伯镭智能科技。

    2015年7月,胡心怡找好了办公场地,同团队研发第一款工业无人机。

    就在同月,一家位于上海的央企航天机电联系到了胡心怡,决定来他的办公室看一看。航空机电的需求,是做一套可以搭载热成像镜头的无人四旋翼飞行器,用来完成光伏板巡检等工作。而航空机电最后选择了伯镭科技,并给了他们30余万元的合同。

    在创业初期,资源匮乏的情况下,每一步都需要走得小心谨慎。在2016年3月,伯镭科技成为了大疆授权的行业应用系统方案提供商,在大疆飞行平台上进行二次开发。

    以屋顶光伏电站前期勘测为例,传统人工探测需要至少2天时间,由工人爬上屋顶后测量具体数值。测量后,人员会将数据带回公司,用CAD做出简图后,再完成光伏电站设计。而使用伯镭科技开发的屋顶勘测套装只需要20分钟就可以完成上述全部工作。

    据胡心怡介绍,目前在浙江省已有超过10家B端客户在使用伯镭科技的产品及服务,客单价在数万元不等,而客户使用伯镭的工具勘测一个屋顶的成本价格在100余元/次。

    下一步,胡心怡计划将伯镭科技发展为智能化的大数据企业。他希望通过利用机器学习等技术,在云平台上教会计算机如何识别工程后期巡检过程出现的问题。例如可用无人机完成桥梁巡检,并将桥体出现的裂缝、坑槽、锈蚀等问题通过提取特征后使用机器学习算法将其归类,并自动生成报告送交客户。

    现阶段,伯镭科技在全国范围内已拥有近50家客户。其主要获取客户的手段为通过行业渠道进行推广。2016年,公司共完成400余万元销售额,总计服务客户超50家,仅在浙江省就有超过10家采购单位。

    据了解,该公司已在2016年6月完成天使轮融资,现正开启Pre-A轮融资,计划融资金额为500万元,拟出让10%股份。

    未来,胡心怡计划进行新一轮融资,资金将用于团队建设、产品研发、市场推广等方面。

    本文来自生意我最行,创业家系授权发布,略经编辑修改,版权归作者所有,内容仅代表作者独立观点。

  • ?

    供水管网 GPRS 数据采集与监控系统解决方案

    荣擎汉

    展开

    一、GPRS 网络

    GPRS 是目前解决移动通信信息服务的一种较完美的业务,它是以数据流量计费、或大 数据的包月包年计费。覆盖范围广泛、数据传输速度更快。GPRS 的推出,为行业和企业用 户开展无线数据传输提供了基础设施平台,为推动移动办公的应用和发展创造了有利条件。 与有线网络相比,GPRS 网络具有租用费用低、移动办公,不受地域制约等优点。GPRS 的出 现为企业和行业用户开展无线办公提供了一种新的选择。

    GPRS 通信方式更适合于各类数据采集业务,目前城市供水管网系统与各采用有线交互传输或电台方式,甚至有些偏远井道要有线网络接入成了不可能。月租费太高,用电话线传送数据按时间计费,带来诸多不便,费用也不便宜。GPRS的网络优点,包括5个方面:

    1、覆盖范围

    构建城市供水管网系统要求数据通信覆盖范围广,扩容无限制,接入地点无限制,能满足城区、乡镇和跨地区的接入需求。由于管网检测点数量众多,分布在地 区的各个角落,而且地理位置分散。另外,还必须考虑今后系统扩充的可能,必须具有良 好的可扩展性。由于目前 GPRS 已覆盖省内绝大部分地区,能够满足城市供水管网系统对覆 盖范围的要求。

    2、数据传输速率高

    目前 GPRS 实际数据传输速率在 40Kbps 左右,完全能满足供水管 网系统数据传输速率的需求。

    3、系统的传输容量大

    城市供水管网系统要和每一个监测点实现实时连接。由于监测 点数量众多,系统要求能满足突发性数据传输的需要,而 GPRS 技术能很好地满足传输突发 性数据的需要。

    4、通信费用控制灵活

    采用传统的有线方式建立供水管网系统,必须租用专线或电话 线进行连接。由于管网监测点必须与中心随时保持连线状态,而每次数据发送的数据量很 小,线路资源利用率很低,平均每一个监测点每月的线路费用为 800~1200 元。而如果采 用 GPRS 通信方式,由于 GPRS 采用按数据流量计费的方式,资源利用率高,月通信费用将 在 200 元之内,如果数据量很大的情况下也可按包月或包年计费。

    5、良好的实时响应与处理能力

    与短消息服务比较,由于 GPRS 具有实时在线特性,系统无时延,可很好的满足系统对数据采集和传输实时性的要求。

    二、供水管网管理的概述

    随着我国经济的发展、城市规模的扩大和现代化程度的不断提高,城市的供水管网系统也越来越庞大,且许多供水管线的填埋情况复杂、资料不清,有些管线甚至仅凭当时施工工人的记忆去寻找,造成诸多设计上的失误和施工中的事故。

    采用人工方法,借助图纸、各类卡片来管理城市供水管网系统,已越来越难以满足 实际需要。所以实现对供水管网管理系统的需求是相当迫切的。业内众多有识之士已达成 共识:使用计算机,借助无线网络系统技术来进行供水管网的管理、管网设计及数据采集,已是势在必行。

    基于 GPRS 网络平台的无线数据传输技术自 2002 年在中国正式商用以来,以“实时在线、 按流量计费、覆盖率广”等优势在各行业取得广泛应用。随着信息化的发展,无线采集传输已经完全取代了以往的各种有线接入。而以往的有线连接必须依赖于网络布线、固定电话线路,对于发展移动性的服务、增设新的服务网点、增设临时性的窗口常会受到有线连接的困扰。 同时布线还需要昂贵的费用和铺设时间,对已有的网络也会有影响,所以有线连接已经严重限制了目前各种信息化应用的主要原因。

    三、供水管网数据采集与监控系统的概述

    深圳信立科技供水管网数据采集与监控系统,基于XL.SN无线传感器网络技术、传感器技术和计算机技术,通过无线传感器采集节点管网温度、压力数据,并以433M通讯方式上传至物联网智能网关,物联网智能网关将接收到数据以GPRS通讯方式实时传输到监控服务器,工作人员在电脑、手机端通过XL.VIEW组态软件解析监控服务器的管网压力、温度数据,实现对城市不同地方多点管网温度、压力的监控。

    管网数据采集与监控系统,包括三个工作层:

    1、数据采集层,负责采集节点数据。

    2、数据传输层,负责接收、传输节点数据。

    3、监控应用层,负责对节点数据的解析、查看、统计、分析、打印。

    四、供水管网数据采集与监控系统的工程界面

    1、登录界面

    2、数据报表

    3、历史曲线

    4、报警信息

    五、供水管网数据采集与监控系统的优点

    1、供水管网数据采集与监控系统建设过程中,无需布线,或减少布线数量,减少系统建设成本。

    2、系统所需的设备安装调试方便,设备支持手机调试,提高运营维护的效率。

    3、系统底层终端各种数据采集后统一传输到监控服务器,便于监控管理,提高供水管网管理效率。

    六、供水管网数据采集与监控系统的软硬件设备

    1、无线压力传感器

    集压力采集、无线传输等功能,自动保存或恢复补传数据,支持手机现场调试的XL61无线压力传感器,也叫智能压力传感器,无线压力采集器等,属于无线传感器网络产品。

    XL61无线压力传感器,具有防爆、低功耗、高精度、稳定性强、使用寿命长等特点,可选433MHZ,2.4GHZ,WI-FI等无线传输方式。XL61无线压力传感器,也叫智能压力传感器,无线压力采集器。它的应用范围广,无需布线,减少运维成本,安装便捷,即插即用,适用于供水管网、供气管网、供油管网、环境、制造业、化工、能源、仓储、办工场所等环境的温度实时采集、无线传输、现场或远程监测和预警。

    2、无线温度传感器

    集温度采集、无线传输等功能,自动保存或恢复补传数据,支持手机现场调试的XL61无线温度传感器(插入式),也叫智能温度传感器,无线湿度采集器,属于无线传感器网络产品。

    XL61无线温度传感器(插入式),具有防爆、低功耗、高精度、稳定性强、使用寿命长等特点,可选433MHZ,2.4GHZ,WI-FI等无线传输方式。

    XL61无线温度传感器(插入式)应用范围广,无需布线,减少运维成本,安装便捷,即插即用,适用于各种管网管道管沟、气象、农业大棚、养殖场、仓储馆藏、冷藏冰柜、实验室、机房、生产车间等环境的温度实时采集、无线传输、现场或远程监测和预警。

    3、物联网智能网关

    智能网关,也称为无线数据通讯网关、数据采集网关、物联网智能网关,具有高度集成化的特点,集数据接收、协议转换、无线通讯传输等功能,支持多种通讯协议和通讯方式,如可采用GPRS,433mhz,2.4G及以太网等多种通讯方式。

    XL90智能网关,集通讯管理、数据接收、协议转换、数据处理转发等功能,支持手机现场调试,可同时接收多个无线传感器数据,支持2路以太网口(Ethernet)、RS485和1路RS232串口、无线传输等上行方式, 可选GPRS,433MHZ,2.4GHZ等无线传输方式。适用于构建大容量的智能传感网络,广泛应用于机房、机站动力、环境监控系统,低压配电监控系统,电能数据监控系统,工厂机器设备、生产线运行状态监控系统,生产信息采集系统等无线监测与预警。

    4、XL.VIEW组态监控软件

    XL.view组态监控软件是基于SQLServer 数据库的系统控制中心,负责系统历史数据存贮,更高层级的数据计算、统计、分析,数据展示、发布、推送等,支持XLPS、MODBUS TCP、MODBUS RTU、OPC等通信协议,可按用户要求提供定制协议,支持Mssql、Mysql、Access等数据库接口,支持Active/Com/Dll,并通过Java Script调用,支持Windows、Android、iOS平台访问,适用于Window XP,Windows 7,Windows Server 2003/2008 操作系统。

    该组态软件,读取XL90、XL91智能网关,以及XL65、XL68通过GPRS上传的数据,生成历史数据库。对数据进行统计、分析,生成用户所需的各种报表、曲线、图形,技术指标;实时显示、发布各种环境参数数据等;自动推送通知、报警信息,提醒相关人员进行支援; PC、移动终端,依据访问权限,查询、浏览相关数据; 通过PC或移动智能终端,对现场设备进行控制; 支持百度地图和视频图像显示。

  • ?

    国内五大主流网站内容抓取工具、采集软件大盘点

    杭荟

    展开

    大数据技术用了多年时间进行演化,才从一种看起来很炫酷的新技术变成了企业在生产经营中实际部署的服务。其中,数据采集产品迎来了广阔的市场前景,无论国内外,市面上都出现了许多技术不一、良莠不齐的采集软件。

    今天,我们将对比国内五大主流采集软件优缺点,帮助你选择最适合的爬虫,体验数据hunting带来的快感。

    国内篇

    1.火车头

    作为采集界的老前辈,我们火车头是一款互联网数据抓取、处理、分析,挖掘软件,可以抓取网页上散乱分布的数据信息,并通过一系列的分析处理,准确挖掘出所需数据。它的用户定位主要是拥有一定代码基础的人群,适合编程老手。

    采集功能完善,不限网页与内容,任意文件格式都可下载具有智能多识别系统以及可选的验证方式保护安全支持PHP和C#插件扩展,方便修改处理数据具有同义,近义词替换、参数替换,伪原创必备技能Conclusion:火车头适用于编程能手,规则编写容易,软件的定位比较专业而且精准化。

    2.八爪鱼

    一款可视化免编程的网页采集软件,可以从不同网站中快速提取规范化数据,帮助用户实现数据的自动化采集、编辑以及规范化,降低工作成本。云采集是它的一大特色,相比其他采集软件,云采集能够做到更加精准、高效和大规模。

    自定义采集过程中,八爪鱼采集器系统自写的Xpath、自动生成的流程,可能无法满足数据采集需求。对数据质量要求高,则需自写Xpath,调成流程图等,以优化规则。

    使用自定义采集的同学,虽然八爪鱼操作简单,比较容易上手。但是,仍需对八爪鱼采集原理有所了解,看完相关教程,循序渐进,成长周期较长。

    可视化操作,无需编写代码,制作规则采集,适用于零编程基础的用户云采集是其主要功能,支持关机采集,并实现自动定时采集

    Conclusion:八爪鱼是一款适合小白用户尝试的采集软件,云功能强大,当然爬虫老手也能开拓它的高级功能。

    3.集搜客

    一款简单易用的网页信息抓取软件,能够抓取网页文字、图表、超链接等多种网页元素。同样可通过简单可视化流程进行采集,服务于任何对数据有采集需求的人群。

    可视化流程操作,与八爪鱼不同,集搜客的流程重在定义所抓取的数据和爬虫路线,八爪鱼的规则流程十分明确,由用户决定软件的每一步操作

    支持抓取在指数图表上悬浮显示的数据,还可以抓取手机网站上的数据

    会员可以互助抓取,提升采集效率,同时还有模板资源可以套用

    Conclusion:集搜客操作较简单,适用于初级用户,功能方面没有太大的特色,后续付费要求比较多。

    4.神箭手云爬虫

    一款新颖的云端在线智能爬虫/采集器,基于神箭手分布式云爬虫框架,帮助用户快速获取大量规范化的网页数据。

    直接接入代理IP,避免IP封锁

    自动登录验证码识别,网站自动完成验证码输入

    可在线生成图标,采集结果以丰富表格化形式展现本地化隐私保护,云端采集,可隐藏用户IP

    Conclusion: 神箭手类似一个爬虫系统框架,具体采集还需用户自写爬虫,需要代码基础。

    5.狂人采集器

    一套专业的网站内容采集软件,支持各类论坛的帖子和回复采集,网站和博客文章内容抓取,分论坛采集器、CMS采集器和博客采集器三类。

    支持对文章内容中的文字、链接批量替换和过滤可以同时向网站或论坛的多个版块一起批量发文具备采集或发帖任务完成后自动关机功能

    Conclusion: 专注论坛、博客文本内容的抓取,对于全网数据的采集通用性不高。

    注:给火车采集器的新手们一点学习建议

    火车采集器是一个非常专业的数据抓取和数据处理软件,对软件使用者有较高的技术要求, 使用者要有基本的HTML基础,能看得懂网页源码,网页结构。

    同时如果用到web发布或数据库发布,则对自己文章系统及数据存储结构要非常了解。

  • ?

    乐驰分布式采集系统,六大特色克服传统数据采集难题!

    赖雪珊

    展开

    随着大数据越来越被人重视,数据采集的挑战变得尤为突出。这其中包括:

    数据源多种多样数据量大变化快如何保证数据采集的可靠性的性能如何避免重复数据如何保证数据的质量

    高性能分布式采集,帮助用户以最低成本、最少人力、最高效率完成大数据应用开发,乐驰分布式采集系统替您解决一切采集难题!

    乐驰分布式采集系统

    合肥乐维信息技术有限公司开发的一款大数据服务产品

    (补充说明:合肥乐维成立于2008年,是国内最早从事大数据服务的企业之一、合肥市首批大数据认定企业、安徽省大数据产业联盟理事成员、安徽省软件行业协会“双软”认证企业。)

    以高性能分布式采集、存储为核心,建立分工明确的功能模块进行高度协作,融合打码、分词、代理、排重等实用性服务,乐驰分布式采集系统真正做到了满足当下广大中小企业对“实时、高难、海量”级大数据业务场景的根本需求。

    乐驰特色与难点攻克

    方便的web管理

    新增、编辑、删除、分发、执行、周期与间隔配置等,系统的所有管理都可以在网页上完成。

    灵活的应用框架

    基于框架开发应用,可适应各种采集场景。

    多场景多任务多线程,自动运行、分发,管理。

    无缝对接火车采集器火车浏览器的规则脚本。

    极限的采集能力与海量的存储能力

    单日亿级别数据采集量

    最大支持两百集群

    支持200M/s的写入速度

    按需配置,弹性增加存储节点

    强大的统计功能

    网络、数据、集群等信息实时监控。

    多维度,多角度查看任务实时状态。

    轻松突破IP封锁

    支持Http代理

    支持PPOPE拨号换IP

    支持PPTP拨号换IP

    支持VPN拨号换IP

    验证码识别毫无压力

    针对当前众多网页普遍存在的反爬虫机制之一“验证码”识别,乐驰提供了多种应对方案:

    支持接入现有的各种打码平台用户可根据接口自行开发打码插件可使用乐驰自带的验证码识别方案

    基于分布式中心控制服务器群组打造大数据云采集支撑平台,乐驰分布式云采集系统功能更多,应用更为灵活,可操作性更强,性能与效率也更高。

    满足实时、海量、高难,将针对传统采集过程中常见的难点一一攻克,六大特色助乐驰分布式云采集系统采集数据毫无压力!

  • ?

    智能制造工厂生产车间无线数据采集系统解决方案

    穆菲音

    展开

    工业物联网无线数据采集系统,是一套具备终端数据采集,无线数据传输和数据应用分析等多功能的智能化数据采集和监控系统,它在市政供排水管网、供汽管网、热力管网、石油天然气管网、地下管沟监控;游泳池水箱水塔液位、大坝、河道水位、泵房浸水监控;蔬菜蘑菇、针金菇、水果、花卉、育苗等农业大棚智能环境监控;畜牧、家禽、水产等农业养殖智能环境监控;化工危化品石油天然气储罐区、电池、面粉仓库智能环境监控;电信机房、实验室、医院药房、生产车间、冷柜冰箱、图书馆、博物馆、档案室、粮库、烟草、酒糟酒曲酒窖等仓储馆藏智能环境监控;社区楼宇、港口工业园区、公园景区、校园广场、超市商场等大气环境质量智能监控;发动机、变频器等生产机器设备运行状态、仪器仪表能耗及生产缺料的智能监控等多个领域有着广泛的应用。

    近年来,工业物联网无线数据采集系统的发展趋势是简化终端结构,在数据采集终端与主机之间采用无线通信,以代替复杂、不灵活的现场布线。该阶段数据采集系统采用更先进的模块式结构,根据不同的应用要求,通过简单的增加和更改模块,并结合系统编程,就可以扩展或修改系统,满足不同领域的需要。

    针对工厂生产车间机器设备运行状态、运行工艺参数、运行能耗数据,以及管网运行状态数据、变配电系统运行数据、车间仓储库房环境参数等数据的采集、监控,深圳信立科技结合XL.SN无线传感器网络2.4GHz或433MHz模块技术、MES制造执行系统技术及无线传感器、无线测控装置RTU等,自主研发设计了一套工业版工厂生产车间无线数据采集系统解决方案,实现实时获取完整、准确的工厂生产制造过程中的各种数据,为企业提高生产制造管理提供基础数据,全面优化生产制造的管理手段、提高生产制造管理效率,向工业4.0靠近!

    一、系统功能

    1、采集设备运行状态:停止、待机、运行、故障、检修等等,以及发生的时间点;

    2、采集设备运行工艺参数:压力、温度、流量、转速、计数、风速、位移等;

    3、采集设备运行能耗:电流、功率、电能;汽、气消耗量;

    4、采集企业供水、供汽、空压、制冷等设备及相应管网的运行状态数据;

    5、采集企业变配电系统运行数据;

    6、监控车间环境参数,以及仓储库房环境参数。

    二、系统通讯方案

    1、XL.SN智能传感网络采集结构

    XL90物联网智能网关,可同时构建433MHz和2.4GHz两种不同结构的传感网络,用于接收终端采集的数据,并上传至服务器。其中433MHz用于跨车间、厂区内的数据传输,2.4GHz用于车间内的数据传输。

    2、XL.SN通讯网络方案

    a、XL90物联网智能网关通过2.4GHz或433MHz等方式读取节点设备数据后,进行协议转换、数据处理,通过局域网,上传数据至MES服务器;

    b、XL90物联网智能网关通过以太网,从第三方监控系统,如电力监控系统、EMS、DCS、智能楼宇系统等等,读取数据;

    c、MES服务器,或XL90物联网智能网关,通过以太网,将数据转发给第三方系统,如EMS、ERP等。如图2。

    3、物联网智能网关数据接入MES系统通讯方案

    XL90物联网智能网关通过企业局域网,和MES服务器通讯。 XL90智能网关和MES的通信协议,可选以下3种: 建议首选:XL/9E-RDF Redis数据交换协议; 建议次选:XL/9E-DF 数据库格式协议; 建议再次选:XL/9E-UDP 通信协议; 工业以太网通用协议:MODBUS TCP。(不太建议选择)

    三、系统解决方案

    1、设备信号采集

    配置XL60智能测装置,采集机器设备的运行信号,通过2.4GHz或433MHz方式上传,实现生产制造设备的信号采集。

    2、设备控制器的数据采集

    选配XL66智能转换器,读取机器设备控制装置及现场监控仪表采集的信号,通过2.4GHz或433MHz等方式接入传感网络。

    3、管道压力、温度,车间环境、仓储环境的气体浓度、温湿度采集

    选配XL61系列智能传感器,采集管道压力、温度,车间环境、仓储环境的气体浓度、温湿度,通过无线上传,并在需要的通道,出、入口设置声光报警器,或启动紧急设备。

    4、其他信号采集

    选配XL60智能测控装置,及XL68智能环境监测装置,采集火灾探测器、噪音传感器,光照传感器,液位变送器,压力变送器等等设备,以及系统原配的仪表数据。

    四、系统优势

    1、工厂生产车间无线数据采集系统建设过程中,无需布线,或减少布线数量,减少系统建设成本。

    2、系统所需的设备安装调试方便,设备支持手机调试,提高运营维护的效率。

    3、系统底层终端各种数据采集后统一接入企业MES系统,便于监控管理,提高企业生产管理效率。

    五、系统配套

    整个无线数据采集系统方案,根据应用需要配套的软硬件设备,包括XL90物联网无线智能网关、XL60智能测控装置RTU、XL68智能环境测控装置RTU、XL66智能转换器,以及XL61无线压力传感器、XL61无线温度传感器、XL61无线气体传感器、XL51无线温湿度传感器等无线传感器,还有MES制造执行系统软件。

    六、适用范围

    深圳信立科技设计的工业版工厂生产车间无线数据采集系统解决方案,适用于在我国珠三角、长三角、京津冀等沿海发达地区,以及重庆、成都、湖北、河南、安徽等内陆省份的电子加工制造、汽车制造、钢铁冶炼、机械装备、食品生产、医药生产等各行业制造业工厂。

  • ?

    前嗅:手把手教你数据采集

    曼荷

    展开

    ForeSpider 前嗅:手把手教你数据采集

    ForeSpider是一款非常好用的数据采集软件,因为属于专业性工具,除了帮助文档外很少有使用教程。所有有很多人在使用的过程中遇到问题难以解决,今天给大家介绍ForeSpider数据采集系统的使用教程,希望能对大家的工作有所帮助。

    教程的示例网站是大众点评,要得到50页内所有医院名称,该医院评论总数,医院总体星级,各项评分,医院评论的用户名,评论内容,评论时间,用户点评星级,获赞数量和回应数量。

    首先我们先新建一个频道,我给它命名为大众点评,然后在频道配置里输入我们想要爬取数据的网址,需要在频道配置处输入想要得到数据的网址,大众点评需要开启cookie,从右面可以开启,网站不同有的不需要,视情况而定。 现在默认模板(1)就是我们要的网站页面,鼠标放在医院标题处如图,从左下角能看到医院的网址链接。

    现在点一下右上角的采集预览,我们能得到整个页面的所有网页链接,下拉滚动条到这个位置就会发现跟上图相同格式的链接,这就是我们需要的所有医院的链接。

    我们用不到的需要过滤一下,可以通过地址过滤和标题过滤方法筛选。点击软件右上角模板抽取配置里面的链接抽取,里面有地址过滤和标题过滤两个选项,点击地址过滤,软件右下角如图:

    过滤规则选择包含,过滤串内输入想要得到的医院链接,后面这串数字我们用“\d”表示,用“\e”表示结束,例如https://dianping/shop/\d\e,这样就能采集网页内所有这种格式的网页链接。

    当我们想要采集的网页下面有翻页的链接,就必须配置翻页。除了在右上角默认模板处抽取我们想要的得到的医院链接外,还要再新建一个链接抽取,抽取页面翻页的地址。

    我们继续从采集预览处得到翻页的链接,过滤规则选择包含,通过观察发现几个链接的相同点,输入到过滤串里就能得到想要的翻页链接了。

    第一层级的模板建好了,下面我们随便点进一个医院主页内,复制链接建立下一层级模板。在默认模板(2)的示例地址内输入医院主页的链接。

    因为我们需要采集该医院所有用户评论,所以我们找到下面的“更多点评”,通过刚刚地址过滤的方法,过滤出更多点评的链接,并建立模板(3),示例地址输入刚刚过滤的得到的“更多点评”的网址。

    注:点击链接抽取,看左下角关联模板处,一定要关联到下一层级的模板,如果是翻页的链接抽取,要关联自身模板,否则会数据采集失败。这点一定要注意。

    这样模板的基本配置就完成了,下一步是建立表单,下图是我们的需求,红色字体我们能从模板二采集到,蓝色字体我们能从模板三采集到,所以我们需要建立两个表单。

    点击表单配置,新建一个表单,添加一个网页主键如图,一定要勾选索引字段,键值唯一,主键字段三个选项,取值类型选择网页主键点击确定。

    然后添加下一个字段如标题“title”

    取值类型选择“选区内全部文本”,变量类型选择“string”,选择合适的字符长度点击确定。依次建立所有字段。

    这是我建立的两个表单的所有字段,表单名称分别为“大众点评1”、“大众点评2”,建立好以后点击保存即可。点开模板配置,每一个模板对应相应的表单,右键模板二“添加数据抽取”,表单名称选择“大众点评1”。

    同样在模板三处再添加另外一个数据抽取表单,添加好后如下图所示:

    单击“title”,然后按住ctrl键同时鼠标左键点击对应标题,内容过多的话按住shift可以调整内容大小,选好后点击保存。

    全部选取完后点击左上角的文件,然后全部保存。

    下一步点击数据,连接数据库,然后再次点击数据,选择数据表,选择刚刚新建两个数据表的字段后创建表,创建好后勾选并确定,就可以进行数据采集了(如果表单有问题需要更改,改好后需要重新创建表单),速度慢可以点击设置里面的线程设置,设置多线程。

    这只是一个简单的教程,软件还有很多强大的功能,祝大家使用愉快!

  • ?

    2018年最值得推荐的6款大数据采集工具

    伯肯黑德

    展开

    数据肯定是无价的。但分析数据并非易事,因为结果越准确,成本就越高。鉴于数据急剧增长,需要一个过程来提供有意义的信息,最终变成实用的洞察力。

    数据挖掘是指这个过程:在庞大数据集当中发现模式,将它转换成有效的信息。该技术利用特定的算法、统计分析、人工智能和数据库系统,从庞大数据集中提取信息,并转换成易于理解的形式。本文介绍了广泛用于大数据行业的6种综合数据挖掘工具。

    1. Rapid Miner

    Rapid Miner是一个数据科学软件平台,为数据准备、机器学习、深度学习、文本挖掘和预测分析提供一种集成环境。它是领先的数据挖掘开源系统之一。

    该程序完全用Java编程语言编写。该程序提供了一个选项,以便用户试用大量可任意嵌套的操作符,这些操作符在XML文件中有详细说明,可由Rapid Miner的图形用户界面来构建。

    2. Oracle Data Mining

    它是Oracle高级分析数据库的代表。市场领先的公司用它最大限度地发掘数据的潜力,做出准确的预测。该系统配合强大的数据算法,锁定最佳客户。

    此外,它可识别异常情况和交叉销售机会,让用户能够根据需要运用不同的预测模型。此外,它以所需的方式定制客户画像。

    3. IBM SPSS Modeler

    说到大规模项目,IBM SPSS Modeler最适合。在这个建模器中,文本分析及其最先进的可视化界面极具价值。它有助于生成数据挖掘算法,基本上不需要编程。

    它可广泛用于异常检测、贝叶斯网络、CARMA、Cox回归以及使用多层感知器和反向传播学习的基本神经网络。

    4. KNIME

    Konstanz Information Miner是一个开源数据分析平台。你可以迅速在其中部署、扩展和熟悉数据。在商业智能界,KNIME号称是有助于为毫无经验的用户提供预测智能的平台。

    此外,数据驱动的创新系统有助于发掘数据潜力。此外,它包括数千个模块和随时可用的示例以及一大批集成的工具和算法。

    5. Python

    Python是一种免费的开源语言,因易用性常常与R相提并论。与R不同,Python学起来往往很容易上手,易于使用。许多用户发现可以在几分钟内开始构建数据,并进行极其复杂的亲和度分析。

    只要你熟悉变量、数据类型、函数、条件语句和循环等基本编程概念,最常见的业务用例数据可视化就很简单。

    6.火车采集器

    火车采集器由合肥乐维信息技术有限公司开发,是一款专业的网络数据采集/信息挖掘处理软件,通过灵活的配置,可以很轻松迅速地从网页上抓取结构化的文本、图片、文件等资源信息,可编辑筛选处理后选择发布到网站后台,各类文件或其他数据库系统中。

  • ?

    网页信息采集,大数据采集技术综述

    裘一德

    展开

    大数据采集技术就是对数据进行ETL操作,通过对数据进行提取、转换、加载,最终挖掘数据的潜在价值。然后提供给用户解决方案或者决策参考。ETL,是英文 Extract-Transform-Load 的缩写,数据从数据来源端经过抽取(extract)、转换(transform)、加载(load)到目的端,然后进行处理分析的过程。

    用户从数据源抽取出所需的数据,经过数据清洗,最终按照预先定义好的数据模型,将数据加载到数据仓库中去,最后对数据仓库中的数据进行数据分析和处理。

    数据采集位于数据分析生命周期的重要一环,它通过传感器数据、社交网络数据、移动互联网数据等方式获得各种类型的结构化、半结构化及非结构化的海量数据。

    由于采集的数据种类错综复杂,对于这种不同种类的数据。

    我们进行数据分析,必须通过提取技术。将复杂格式的数据,进行数据提取,从数据原始格式中提取(extract)出我们需要的数据,这里可以丢弃一些不重要的字段。

    对于数据提取后的数据,由于数据源头的采集可能存在不准确。

    所以我们必须进行数据清洗,对于那些不正确的数据进行过滤、剔除。

    针对不同的应用场景,对数据进行分析的工具或者系统不同,我们还需要对数据进行数据转换(transform)操作,将数据转换成不同的数据格式,最终按照预先定义好的数据仓库模型,将数据加载(load)到数据仓库中去。

    大数据处理目前比较流行的是两种方法,一种是离线处理,一种是在线处理,基本处理架构如下:

    在互联网应用中,不管是哪一种处理方式,其基本的数据来源都是日志数据,例如对于web应用来说,则可能是用户的访问日志、用户的点击日志等。

    如果对于数据的分析结果在时间上有比较严格的要求,则可以采用在线处理的方式来对数据进行分析,如使用Spark、Storm等进行处理。比较贴切的一个例子是天猫双十一的成交额,在其展板上,我们看到交易额是实时动态进行更新的,对于这种情况,则需要采用在线处理。

    当然,如果只是希望得到数据的分析结果,对处理的时间要求不严格,就可以采用离线处理的方式,比如我们可以先将日志数据采集到HDFS中,之后再进一步使用MapReduce、Hive等来对数据进行分析,这也是可行的。

    在现实生活中,数据产生的种类很多,并且不同种类的数据产生的方式不同。

    对于大数据采集系统,主要分为以下三类系统:

    一、系统日志采集系统。

    许多公司的业务平台每天都会产生大量的日志数据。对于这些日志信息,我们可以得到出很多有价值的数据。通过对这些日志信息进行日志采集、收集,然后进行数据分析,挖掘公司业务平台日志数据中的潜在价值。

    为公司决策和公司后台服务器平台性能评估提高可靠的数据保证。

    系统日志采集系统做的事情就是收集日志数据提供离线和在线的实时分析使用。

    目前常用的开源日志收集系统有Flume、Scribe等。Apache Flume是一个分布式、可靠、可用的服务,用于高效地收集、聚合和移动 大量的日志数据,它具有基于流式数据流的简单灵活的架构。

    其可靠性机制和许多故障转移和恢复机制,使Flume具有强大的容错能力。

    Scribe是Facebook开源的日志采集系统。Scribe实际上是一个分布式共享队列,它可以从各种数据源上收集日志数据,然后放入它上面的共享队列中。

    Scribe可以接受thrift client发送过来的数据,将其放入它上面的消息队列中。然后通过消息队列将数据Push到分布式存储系统中,并且由分布式存储系统提供可靠的容错性能。

    如果最后的分布式存储系统crash时,Scribe中的消息队列还可以提供容错能力,它会还日志数据写到本地磁盘中。Scribe支持持久化的消息队列,来提供日志收集系统的容错能力。

    二、网络数据采集系统。

    通过网络爬虫和一些网站平台提供的公共API(如Twitter和新浪微博API)等方式从网站上获取数据。这样就可以将非结构化数据和半结构化数据的网页数据从网页中提取出来。

    并将其提取、清洗、转换成结构化的数据,将其存储为统一的本地文件数据。目前常用的网页爬虫系统有Apache Nutch、Crawler4j、Scrapy等框架。

    Apache Nutch是一个高度可扩展和可伸缩性的分布式爬虫框架。

    Apache通过分布式抓取网页数据,并且由Hadoop支持,通过提交MapReduce任务来抓取网页数据,并可以将网页数据存储在HDFS分布式文件系统中。

    Nutch可以进行分布式多任务进行爬取数据,存储和索引。由于多个机器并行做爬取任务,Nutch利用多个机器充分利用机器的计算资源和存储能力,大大提高系统爬取数据能力。

    Crawler4j、Scrapy都是一个爬虫框架,提供给开发人员便利的爬虫API接口。开发人员只需要关心爬虫API接口的实现,不需要关心具体框架怎么爬取数据。Crawler4j、Scrapy框架大大降低了开发人员开发速率,开发人员可以很快的完成一个爬虫系统的开发。

    三、数据库采集系统。

    一些企业会使用传统的关系型数据库MySQL和Oracle等来存储数据。

    除此之外,Redis和MongoDB这样的NoSQL数据库也常用于数据的采集。企业每时每刻产生的业务数据,以数据库一行记录形式被直接写入到数据库中。

    通过数据库采集系统直接与企业业务后台服务器结合,将企业业务后台每时每刻都在产生大量的业务记录写入到数据库中,最后由特定的处理分许系统进行系统分析。

    针对大数据采集技术,目前主要流行以下大数据采集分析技术。Hive是Facebook团队开发的一个可以支持PB级别的可伸缩性的数据仓库。

    这是一个建立在Hadoop之上的开源数据仓库解决方案。 Hive支持使用类似SQL的声明性语言(HiveQL)表示的查询,这些语言被编译为使用Hadoop执行的MapReduce作业。

    另外,HiveQL使用户可以将自定义的map-reduce脚本插入到查询中。该语言支持基本数据类型,类似数组和Map的集合以及嵌套组合。

    HiveQL语句被提交执行。首先Driver将查询传递给编译器compiler,通过典型的解析,类型检查和语义分析阶段,使用存储在Metastore中的元数据。

    编译器生成一个逻辑任务,然后通过一个简单的基于规则的优化器进行优化。

    最后生成一组MapReduce任务和HDFS Task的DAG优化后的Task。 然后执行引擎使用Hadoop按照它们的依赖性顺序执行这些Task。

    Hive简化了对于那些不熟悉Hadoop MapReduce接口的用户学习门槛,Hive提供了一些列简单的HiveQL语句,对数据仓库中的数据进行简要分析与计算。

  • ?

    六大主流大数据采集平台架构分析

    夏一手

    展开

    随着大数据越来越被重视,数据采集的挑战变的尤为突出。今天为大家介绍几款数据采集平台:

    Apache Flume Fluentd Logstash Chukwa Scribe Splunk Forwarder

    大数据平台与数据采集

    任何完整的大数据平台,一般包括以下的几个过程:

    数据采集–>数据存储–>数据处理–>数据展现(可视化,报表和监控)

    其中,数据采集是所有数据系统必不可少的,随着大数据越来越被重视,数据采集的挑战也变的尤为突出。这其中包括:

    我们今天就来看看当前可用的六款数据采集的产品,重点关注它们是如何做到高可靠,高性能和高扩展。

    1、Apache Flume

    Flume 是Apache旗下的一款开源、高可靠、高扩展、容易管理、支持客户扩展的数据采集系统。 Flume使用JRuby来构建,所以依赖Java运行环境。

    Flume最初是由Cloudera的工程师设计用于合并日志数据的系统,后来逐渐发展用于处理流数据事件。

    Flume设计成一个分布式的管道架构,可以看作在数据源和目的地之间有一个Agent的网络,支持数据路由。

    每一个agent都由Source,Channel和Sink组成。

    Source

    Source负责接收输入数据,并将数据写入管道。Flume的Source支持HTTP,JMS,RPC,NetCat,Exec,Spooling Directory。其中Spooling支持监视一个目录或者文件,解析其中新生成的事件。

    Channel

    Channel 存储,缓存从source到Sink的中间数据。可使用不同的配置来做Channel,例如内存,文件,JDBC等。使用内存性能高但不持久,有可能丢数据。使用文件更可靠,但性能不如内存。

    Sink

    Sink负责从管道中读出数据并发给下一个Agent或者最终的目的地。Sink支持的不同目的地种类包括:HDFS,HBASE,Solr,ElasticSearch,File,Logger或者其它的Flume Agent。

    Flume在source和sink端都使用了transaction机制保证在数据传输中没有数据丢失。

    Source上的数据可以复制到不同的通道上。每一个Channel也可以连接不同数量的Sink。这样连接不同配置的Agent就可以组成一个复杂的数据收集网络。通过对agent的配置,可以组成一个路由复杂的数据传输网络。

    配置如上图所示的agent结构,Flume支持设置sink的Failover和Load Balance,这样就可以保证即使有一个agent失效的情况下,整个系统仍能正常收集数据。

    Flume中传输的内容定义为事件(Event),事件由Headers(包含元数据,Meta Data)和Payload组成。

    Flume提供SDK,可以支持用户定制开发:

    Flume客户端负责在事件产生的源头把事件发送给Flume的Agent。客户端通常和产生数据源的应用在同一个进程空间。常见的Flume 客户端有Avro,log4J,syslog和HTTP Post。另外ExecSource支持指定一个本地进程的输出作为Flume的输入。当然很有可能,以上的这些客户端都不能满足需求,用户可以定制的客户端,和已有的FLume的Source进行通信,或者定制实现一种新的Source类型。

    同时,用户可以使用Flume的SDK定制Source和Sink。似乎不支持定制的Channel。

    2、Fluentd

    Fluentd是另一个开源的数据收集框架。Fluentd使用C/Ruby开发,使用JSON文件来统一日志数据。它的可插拔架构,支持各种不同种类和格式的数据源和数据输出。最后它也同时提供了高可靠和很好的扩展性。Treasure Data, Inc 对该产品提供支持和维护。

    Fluentd的部署和Flume非常相似:

    Fluentd的架构设计和Flume如出一辙:

    Fluentd的Input/Buffer/Output非常类似于Flume的Source/Channel/Sink。

    Input

    Input负责接收数据或者主动抓取数据。支持syslog,http,file tail等。

    Buffer

    Buffer负责数据获取的性能和可靠性,也有文件或内存等不同类型的Buffer可以配置。

    Output

    Output负责输出数据到目的地例如文件,AWS S3或者其它的Fluentd。

    Fluentd的配置非常方便,如下图:

    Fluentd的技术栈如下图:

    FLuentd和其插件都是由Ruby开发,MessgaePack提供了JSON的序列化和异步的并行通信RPC机制。

    Cool.io是基于libev的事件驱动框架。

    FLuentd的扩展性非常好,客户可以自己定制(Ruby)Input/Buffer/Output。

    Fluentd从各方面看都很像Flume,区别是使用Ruby开发,Footprint会小一些,但是也带来了跨平台的问题,并不能支持Windows平台。另外采用JSON统一数据/日志格式是它的另一个特点。相对去Flumed,配置也相对简单一些。

    3、Logstash

    Logstash是著名的开源数据栈ELK (ElasticSearch, Logstash, Kibana)中的那个L。

    Logstash用JRuby开发,所有运行时依赖JVM。

    Logstash的部署架构如下图,当然这只是一种部署的选项。

    一个典型的Logstash的配置如下,包括了Input,filter的Output的设置。

    几乎在大部分的情况下ELK作为一个栈是被同时使用的。所有当你的数据系统使用ElasticSearch的情况下,logstash是首选。

    4、Chukwa

    官网:https://chukwa.apache.org/

    Apache Chukwa是apache旗下另一个开源的数据收集平台,它远没有其他几个有名。Chukwa基于Hadoop的HDFS和Map Reduce来构建(显而易见,他用Java来实现),提供扩展性和可靠性。Chukwa同时提供对数据的展示,分析和监视。很奇怪的是它的上一次 github的更新事7年前。可见该项目应该已经不活跃了。

    Chukwa的部署架构如下:

    Chukwa的主要单元有:Agent,Collector,DataSink,ArchiveBuilder,Demux等等,看上去相当复杂。由于该项目已经不活跃,我们就不细看了。

    5、Scribe

    代码托管:https://github/facebookarchive/scribe

    Scribe是Facebook开发的数据(日志)收集系统。已经多年不维护,同样的,就不多说了。

    6、Splunk Forwarder

    以上的所有系统都是开源的。在商业化的大数据平台产品中,Splunk提供完整的数据采金,数据存储,数据分析和处理,以及数据展现的能力。

    Splunk是一个分布式的机器数据平台,主要有三个角色:

    Search Head负责数据的搜索和处理,提供搜索时的信息抽取。

    Indexer负责数据的存储和索引 Forwarder,负责数据的收集,清洗,变形,并发送给Indexer

    Splunk内置了对Syslog,TCP/UDP,Spooling的支持,同时,用户可以通过开发 Input和Modular Input的方式来获取特定的数据。在Splunk提供的软件仓库里有很多成熟的数据采集应用,例如AWS,数据库(DBConnect)等等,可以方便的从云或者是数据库中获取数据进入Splunk的数据平台做分析。

    这里要注意的是,Search Head和Indexer都支持Cluster的配置,也就是高可用,高扩展的,但是Splunk现在还没有针对Farwarder的Cluster的功能。也就是说如果有一台Farwarder的机器出了故障,数据收集也会随之中断,并不能把正在运行的数据采集任务Failover到其它的 Farwarder上。

    总结

    我们简单讨论了几种流行的数据收集平台,它们大都提供高可靠和高扩展的数据收集。大多平台都抽象出了输入,输出和中间的缓冲的架构。利用分布式的网络连接,大多数平台都能实现一定程度的扩展性和高可靠性。

    其中Flume,Fluentd是两个被使用较多的产品。如果你用ElasticSearch,Logstash也许是首选,因为ELK栈提供了很好的集成。Chukwa和Scribe由于项目的不活跃,不推荐使用。

    Splunk作为一个优秀的商业产品,它的数据采集还存在一定的限制,相信Splunk很快会开发出更好的数据收集的解决方案。

  • ?

    携程用户数据采集与分析系统

    妙松

    展开

    一、携程实时用户数据采集系统设计实践

    随着移动互联网的兴起,特别是近年来,智能手机、pad等移动设备凭借便捷、高效的特点风靡全球,同时各类APP的快速发展进一步降低了移动互联网的接入门槛,越来越多的网民开始从传统PC转移至移动终端上。但传统的基于PC网站和访问日志的用户数据采集系统已经无法满足实时分析用户行为、实时统计流量属性和基于位置服务(LBS)等方面的需求。

    我们针对传统用户数据采集系统在实时性、吞吐量、终端覆盖率等方面的不足,分析了在移动互联网流量剧增的背景下,用户数据采集系统的需求,研究在多种访问终端和多种网络类型的场景下,用户数据实时、高效采集的方法,并在此基础上设计和实现实时、有序和健壮的用户数据采集系统。此系统基于Java NIO网络通信框架(Netty)和分布式消息队列(Kafka)存储框架实现,其具有实时性、高吞吐、通用性好等优点。

    1、技术选型和设计方案:

    一个典型的数据采集分析统计平台,对数据的处理,主要由如下五个步骤组成:

    图1、数据平台处理流程

    其中,数据采集步骤是最核心的问题,数据采集是否丰富、准确和实时,都直接影响整个数据分析平台的应用的效果。本论文关注的步骤主要在数据采集、数据传输和数据建模存储这三部分。

    为满足数据采集服务实时、高效性、高吞吐量和安全性等方面的要求,同时能借鉴互联网大数据行业一些优秀开源的解决方案,所以整个系统都将基于Java技术栈进行设计和实现。整个数据采集分析平台系统架构如下图所示:

    图2(数据采集分析平台系统架构)

    其中整个平台系统主要包括以上五部分:客户端数据采集SDK以Http(s)/Tcp/Udp协议根据不同的网络环境按一定策略将数据发送到Mechanic(UBT-Collector)服务器。服务器对采集的数据进行一系列处理之后将数据异步写入Hermes(Kafka)分布式消息队列系统。为了关联业务服务端用户业务操作埋点、日志,业务服务器需要获取由客户端SDK统一生成的用户标识(C-GUID),然后业务服务器将用户业务操作埋点、日志信息以异步方式写入Hermes(Kafka)队列。最后数据消费分析平台,都从Hermes(Kafka)中消费采集数据,进行数据实时或者离线分析。其中Mechanic(UBT-Collector)系统还包括对采集数据和自身系统的监控,这些监控信息先写入Hbase集群,然后通过Dashboard界面进行实时监控。

    (1)基于NIO的Netty网络框架方案

    要满足前面提到的高吞吐、高并发和多协议支持等方面的要求。我们调研了几种开源异步IO网络服务组件(如Netty、MINI、xSocket),用它们和NginxWeb服务器进行了性能对比,决定采用Netty作为采集服务网络组件。下面对它进行一些概要介绍:Netty是一个高性能、异步事件驱动的NIO框架,它提供了对TCP、UDP和文件传输的支持,Netty的所有IO操作都是异步非阻塞的,通过Future-Listener机制,用户可以方便的主动获取或者通过通知机制获得IO操作结果。

    图3(Netty框架内部组件逻辑结构)

    Netty的优点有:

    a、功能丰富,内置了多种数据编解码功能、支持多种网络协议。

    b、高性能,通过与其它主流NIO网络框架对比,它的综合性能最佳。

    c、可扩展性好,可通过它提供的ChannelHandler组件对网络通信方面进行灵活扩展。

    d、易用性,API使用简单。

    e、经过了许多商业应用的考验,在互联网、网络游戏、大数据、电信软件等众多行业得到成功商用。

    Netty采用了典型的三层网络架构进行设计,逻辑架构图如下:

    图4(Netty三层网络逻辑架构)

    第一层:Reactor通信调度层。该层的主要职责就是监听网络的连接和读写操作,负责将网络层的数据读取到内存缓冲区中,然后触发各种网络事件,例如连接创建、连接激活、读事件、写事件等,将这些事件触发到Pipeline中,再由Pipeline充当的职责链来进行后续的处理。

    第二层:职责链Pipeline层。负责事件在职责链中有序的向前(后)传播,同时负责动态的编排职责链。Pipeline可以选择监听和处理自己关心的事件。

    第三层:业务逻辑处理层,一般可分为两类:a. 纯粹的业务逻辑处理,例如日志、订单处理。b. 应用层协议管理,例如HTTP(S)协议、FTP协议等。

    我们都知道影响网络服务通信性能的主要因素有:网络I/O模型、线程(进程)调度模型和数据序列化方式。

    在网络I/O模型方面,Netty采用基于非阻塞I/O的实现,底层依赖的是JDKNIO框架的Selector。

    在线程调度模型方面,Netty采用Reactor线程模型。常用的Reactor线程模型有三种,分别是:

    a、Reactor单线程模型:Reactor单线程模型,指的是所有的I/O操作都在同一个NIO线程上面完成。对于一些小容量应用场景,可以使用单线程模型。

    b、Reactor多线程模型:Rector多线程模型与单线程模型最大的区别就是有一组NIO线程处理I/O操作。主要用于高并发、大业务量场景。

    c、主从Reactor多线程模型:主从Reactor线程模型的特点是服务端用于接收客户端连接的不再是一个单独的NIO线程,而是一个独立的NIO线程池。利用主从NIO线程模型,可以解决一个服务端监听线程无法有效处理所有客户端连接的性能不足问题。Netty线程模型并非固定不变的,它可以支持三种Reactor线程模型。

    在数据序列化方面,影响序列化性能的主要因素有:

    a、序列化后的码流大小(网络带宽占用)。

    b、序列化和反序列化操作的性能(CPU资源占用)。

    c、并发调用时的性能表现:稳定性、线性增长等。

    Netty默认提供了对GoogleProtobuf二进制序列化框架的支持,但通过扩展Netty的编解码接口,可以实现其它的高性能序列化框架,例如Avro、Thrift的压缩二进制编解码框架。

    通过对Netty网络框架的分析研究以及对比测试(见后面的可行性分析测试报告)可判断,基于Netty的数据采集方案能解决高数据吞吐量和数据实时收集的难点。

    》》点击阅读全文

网络数据采集系统

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP