中企动力 > 商学院 > 数据采集系统供应商
  • ?

    NCTech推出虚拟数据采集系统iSTAR Pulsar

    华曼梅

    展开

    位于爱丁堡的英国公司NCTech正在采用VR/AR并进行扩展,并提供360度真实成像系统来简化图像文档的工作流程,甚至可以将其用于远程设置。他们在这一领域的最新成果是推出全新的虚拟数据采集系统iSTAR Pulsar,以便在移动中捕获数据。

    iSTAR Pulsar设计用于车辆,无人机或步行时捕获360度数据。该系统设计简单易用,不需要任何摄影经验甚至电脑操作。iSTAR Pulsar应用程序提供了规划路线,以及在线查看和分享内容的能力。

    iSTAR Pulsar专门为捕捉360度移动数据而设计,并与索尼和英特尔联合开发。该系统可用于各种工业和智能城市应用。

    产品详情如下:

    无与伦比的11K球形分辨率将iSTAR Pulsar定义为几乎是标准8K球形系统像素分辨率的两倍,可提供6050万像素的全景图像。

    预先校准到亚像素级别与先进的深度分析算法相结合,确保在移动平台上实现最精确的全景拼接。

    iSTAR Pulsar针对移动平台进行了优化,可在处理过程中调整捕获速率,以提供一致的距离间隔,从而最大限度地减少数据存储和处理要求。

    全自动后处理流水线包括一个可选的自动水平仪稳定功能,以纠正步行捕捉时产生的任何俯仰和滚动。

    坚固的设计,耐候性和防震性,内置高精度GPS和IMU传感器,确保与GIS系统直接集成。

    先进的对称和非对称加密技术确保从采集到交付的端到端数据安全。

    NCTech在本周早些时候在伦敦Geo商业展上展示了iSTAR Pulsar ,并将在下个月初在加利福尼亚州阿纳海姆会议中心举行SPAR 3D Expo上展示他们的产品 。

    “只需轻敲一下,iSTAR Pulsar就可以提供全自动的360°全景图像拍摄功能。它不是传统意义上的摄像头,它捕获大量高分辨率数据,并连接到我们庞大的云处理管道,从捕获到交付提供全自动工作流程。”

  • ?

    上海双湖科技“设备数据采集/联网与生产管理”亮相CCMT2018

    禹颤

    展开

    CCMT2018数控机床展将为您呈现业界最新的数字化制造、信息互联解决方案和智能制造系统等方面的内容。

    上海双湖信息科技有限公司研发的“时视”--设备数据采集/联网与生产管理系统亮相CCMT2018上海数控机床展.

    工业互联网平台是面向制造业数字化、网络化、智能化需求,构建基于海量数据采集、汇聚、分析的服务体系,支撑制造资源泛在连接、弹性供给、高

    效配置的工业云平台,包括边缘、平台(工业 PaaS)、应用三大核心层级。可以认为,工业互联网平台是工业云平台的延伸发展,其 本质是在传统云

    平台的基础上叠加物联网、大数据、人工智能等新兴技术,构建更精准、实时、高效的数据采集体系,建设包括存储、集成、访问、分析、管理功能的

    使能平台,实现工业技术、经验、知识模型化、软件化、复用化,以工业 APP 的形式为制造企业各类创新应用,最终形成资源富集、多方参与、合作

    共赢、协同演进的制造业生态。

    时视-设备数据采集/联网与生产管理系统,为企业设备与生产的智能化管理,提供基于互联网及大数据平台技术的解决方案。

    时视系统由“时视BOX”智能硬件、数据传输网络、数据应用软件、 数据管理平台组成。采用创新的数据采集、传输、存储、分析、云计 算、集成的大数据和智能化技术,实现设备与生产管理的信息化、数据 化、可视化。

    数字安灯与生产可视用工业触屏,在触屏上配置安灯内容(计划与产 量、质量与报废、设备与点检、故障与维修、物料与批号、 模具与刀具等)。发生问题按动触屏软键时,数据通过时视 BOX实时传递到APP和数据平台,数据平台同时记录安灯数 据和问题解决时间,还可以使用大数据分析对经常发生的问 题进行分析。

    从ERP自动或人工生成采购订单,采购订单数据上传至供应链协同平台,供应商从供应链协同平台打印条码标 签和条码送货单;工厂扫描收货、物料扫描上架。 生产过程中,采用扫描工单、扫描发料、扫描采集生产工人、机器、物料批号、生产方法和环境、产品测试数 据等信息,实现生产质量的全程追溯.

    数据采集与智能制造 工业互联网、MES与智能工厂的实施,设备数据采集是基础;数据平台(PAAS)是核心;工业APP是关键。 设备和生产的数据通过时视BOX的数据互联和采集,不但可以构建各种管理应用模块和数据分析模块,还可以在 EAP数据管理平台上构建出多种MES功能模。

  • ?

    浅析工业数据采集产业发展现状

    祝若蕊

    展开

    (一) 工业数据采集产业综述

    1. 市场规模潜力巨大:

    中国作为世界第一制造大国,随着工业互联网市场的不断发展和完善,企业对工业数据采集的实时性、可靠性和专业解决方案需求日益增强,中国工业数据采集市场呈现巨大潜力,相关软硬件和服务提供商迎来了良好的发展机遇。

    2. 市场各方积极参与

    从消化政策、推出工业数据采集解决方案,到发布工业互联网平台,各市场参与方努力寻求业务转型,外资企业和本土企业均在积极部署工业数据采集产品体系和解决方案,谋划市11场布局。

    3. 技术产品和解决方案持续推进与完善

    当前,工业数据采集技术产品和解决方案仍处于发展阶段,但已有部分厂商推出了一些多样化的解决方案,比如通过构建兼容转换协议的技术产品体系,实现工业数据互联互通;或是通过部署边缘计算模块,实现数据在机器设备端的轻量级运算和实时分析。

    点击上方“关注”,共同学习工业互联网相关知识!

    (二) 工业数据采集产业规模和预测

    整体市场情况2017 年,中国工业数据采集产业市场规模达到 570 亿元,同比增长 16.3%。预计未来 2-3 年,中国工业数据采集市场将保持稳定增长趋势。

    图:2015-2020 年中国工业数据采集市场规模

    2. 细分产品市场情况

    图:2017 年中国工业数据采集细分产品市场规模

    备注 1:传感器包括光电传感器、接近传感器、视觉传感器、位移传感器、速度传感器、加速度传感器等。读码设备包括条码设备、射频识别等。工业通讯模块包含工业串口卡、总线卡、串口服务器、工业电源、以太网模块等。

    3. 细分行业市场情况

    图:2017 年中国工业数据采集细分行业市场规模

    点击上方“关注”,共同学习工业互联网相关知识!

    (三) 工业数据采集存在的主要问题

    当前工业数据采集面临的突出问题可以总结为“三不”:不敢传(数据安全问题)、不能传(协议标准不统一)、不需传(本地化和实时性问题),无法支撑实时数据采集和实时分析、智能优化和科学决策。

    (1) 工业数据采集存在数据安全隐患

    工业数据采集会涉及到大量重要工业数据和用户隐私信息,在传输和存储时都会存在一定的数据安全隐患,也存在黑客窃取数据、攻击企业生产系统的风险。急需从技术、管理和法律法规等多方面保障数据安全。

    (2) 工业协议标准不统一且数据开放性不够

    目前在工业数据采集领域,存在 Profibus、Modbus、CAN、LonWorks、HART、Profinet、EthernetIP 等多种工业协议标准,各个自动化设备生产及集成商还会自己开发各种私有的工业协议,各种协议标准不统一、互不兼容;同时很多设备和系统的数据开放性不够,缺乏数据开放接口及文档说明。导致协议适配、协议解析和数据互联互通困难。

    (3) 工业数据采集实时性要求难以保证

    生产线的高速运转,精密生产和运动控制等场景则对数据采集的实时性要求不断提高,传统数据采集技术对于高精度、低时延的工业场景难以保证重要的信息实时采集和上传,无法满足生产过程的实时监控需求。

    (四) 我国工业数据采集产业格局

    当前,工业数据采集发展越来越快,工业互联网的跑道越来越宽,工业自动化企业、网络通信企业、信息技术企业身影已纷纷出现。就当前情况而言,工业自动化企业具备先天竞争优势,起步和前期推广相对容易,可以在原有系统客户上深度耕耘。信息技术企业和网络通信企业在技术架构的高度上更有比较优势,战略构想和规划能力更为突出。

    目前,工业数据采集产业供应侧主要有以下三类企业:

    一是工业自动化企业,从自身核心产品能力出发,主要为工业数据采集提供接入设备,作为工业数据采集的源头,例如15西门子、研华、霍尼韦尔、安控等;

    二是工业网络服务企业,主要为工业数据采集提供工业网络协议转换、传输、安全等配套设备和服务,部分企业从原有优势领域正在积极向制造业领域延伸发展,例如中国电信、中兴通讯、华为等;

    三是工业数据采集解决方案企业,主要提供工业数据采集解决方案、系统开发、项目实施、系统集成等服务,例如北自所、和利时、明匠智能等。

    已阅读完毕,点击上方“关注”,共同学习工业互联网相关知识!

  • ?

    汇众泰普(北京)科技有限公司-整车道路数据采集系统

    心动

    展开

    xPro_Therm32

    32通道同步采样,热电偶转CAN系统

    extending CAN-Logging Systems with 32 Thermocouple Inputs

    CAN记录系统32通道热电偶扩展模块

    xPro_Analog32 is a signal conditioning unit which extends any CAN logger with additional 32 Thermoelemente Typ K inputs.

    xPro_Analog32是一款信号调理单元,可以接入任何CAN记录设备,32个K型热电偶输入。

    Input Range Thermocouples热电偶输入范围

    The input range for Type-K thermocouples is a wide -200 C to 1350 c. Each channel is sampled in paralle with 7 Hz enough even for dynamically changing temperatures.

    K型热电偶的输入范围是 -200℃to 1350 ℃,通道在7Hz的采样率下同步采集温度的变化。

    By the use of 24-Bits-Technology xPro_Therm32 does not need any pre-amplifiers which usually introduce a lot of drift and noise. Therfore xPro_Therm32 outputs a very stable signal with a high resolution, which provides information down to 0.01 degrees.

    xPro_Therm32使用24位技术,无需预放大器,避免带来大的漂移和噪声。因此xPro_Therm32输出高分辨率的稳定的信号,可以带来0.01度的高分辨率。

    xPro_Therm32 has been designed with using the latest technology. Each channel does have its own power supply and also channels are galvanically separeted.

    xPro_Therm32设计时采用最新的技术,每个通道单独供电,通道间光隔离。

    Each inpidual channel is equipped with a local cold junction compensation, which results in an excellent overall precision.

    每个通道配有本地冷端补偿,带来完美的精度。

    Power Supply供电

    xPro_Therm32 comes with a wide range power supply of 10 … 30 VDC.

    xPro_Therm32供电范围为: 10 … 30 VDC。

    Vehicle Ground and instrument ground are consequently galvanically isolated, thus reliably avoiding ground loops.

    汽车地和仪器地是光隔离的,避免地线回路。

    xPro_Therm32 does have an electronic protection against wrong polarity of the supply.

    xPro_Therm32 带有供电极性保护,防止极性反接损坏设备。

    Status-LEDs and internal CAN-Hub

    内置状态LED灯显示和CAN路由

    Each input channel of xPro_Therm32 is equipped with a separate multi-colour status LED. These LEDs signal if a channel has been activated for acquisition and if the signal is within the predefined range.

    xPro_Therm32每个通道配有不同的多个颜色的LED灯,假如通道激活,信号在其设置范围内,LED可以指示其状态。

    By using the internal CAN-Hub ofxPro_Therm32 several units can be chained without the need to attach an external router.

    xPro_Therm32的CAN路由功能可以将多个设备串联在一起食用,无需额外的路由设备。

  • ?

    数据采集过程中的常见问题

    臭皮匠

    展开

    经过两周的整理总结,沉淀出来好多数据采集的经验与大家分享。

    前嗅免费模板共享链接:http://forenose/help/collection/template/cases.html

    1.如何进行数据采集?

    ①下载安装软件后,登录到软件上。

    ②准备好模板:在前嗅的官网上下载免费的模板或自己配置好的模板

    ③将下载的官网导入到软件中。

    点击文件---点击导入采集文件(将采集文件导入,自己配置的模板请忽略这一步)

    ④在数据建表中建关联数据表

    选中需要采集模板下的表单---点击创建关联数据表,所创表名不能为汉字,点击确定---在所创数据表前的方框打勾即可关联数据表。详情见下图。

    此时在数据浏览中就存在了刚刚建的关联数据表。

    ⑤进行数据采集。

    在需要进行数据采集的模板前打勾--点击允许采集--点击开始按钮即可进行数据采集。详情见下图。

    ⑥数据预览及导出

    选中关联表---点击刷新按钮即可查看数据---点击导出按钮即可导出数据。详情见下图。

    多种导出方式:

    a.可以将采集到的数据全部导出。

    b.可以将数据分割导出,设置特定数目后数据会分别储存放在文件夹中。

    c.可以将每个字段所采集到的内容分别导出到不同文件夹,方便查看。

    数据导出教程:

    http://forenose/help/guildbook/crawler_new/5-2.html

    2.所采集的网站弹验证码是怎么回事?

    弹验证码分为四种情况:

    ①登录需要验证码:登录时只需要一个验证码,所以直接手动填写配置即可。

    ②多账号登录:每次账号登录都需要验证码,此时应该接第三方打码平台。

    前嗅(forenose)是首个深度大数据专家。

    提供数据采集-分析-处理-管理-营销-应用,自主知识产权的全套大数据产品 。

  • ?

    前嗅:手把手教你数据采集

    四眼

    展开

    ForeSpider 前嗅:手把手教你数据采集

    ForeSpider是一款非常好用的数据采集软件,因为属于专业性工具,除了帮助文档外很少有使用教程。所有有很多人在使用的过程中遇到问题难以解决,今天给大家介绍ForeSpider数据采集系统的使用教程,希望能对大家的工作有所帮助。

    教程的示例网站是大众点评,要得到50页内所有医院名称,该医院评论总数,医院总体星级,各项评分,医院评论的用户名,评论内容,评论时间,用户点评星级,获赞数量和回应数量。

    首先我们先新建一个频道,我给它命名为大众点评,然后在频道配置里输入我们想要爬取数据的网址,需要在频道配置处输入想要得到数据的网址,大众点评需要开启cookie,从右面可以开启,网站不同有的不需要,视情况而定。 现在默认模板(1)就是我们要的网站页面,鼠标放在医院标题处如图,从左下角能看到医院的网址链接。

    现在点一下右上角的采集预览,我们能得到整个页面的所有网页链接,下拉滚动条到这个位置就会发现跟上图相同格式的链接,这就是我们需要的所有医院的链接。

    我们用不到的需要过滤一下,可以通过地址过滤和标题过滤方法筛选。点击软件右上角模板抽取配置里面的链接抽取,里面有地址过滤和标题过滤两个选项,点击地址过滤,软件右下角如图:

    过滤规则选择包含,过滤串内输入想要得到的医院链接,后面这串数字我们用“\d”表示,用“\e”表示结束,例如https://dianping/shop/\d\e,这样就能采集网页内所有这种格式的网页链接。

    当我们想要采集的网页下面有翻页的链接,就必须配置翻页。除了在右上角默认模板处抽取我们想要的得到的医院链接外,还要再新建一个链接抽取,抽取页面翻页的地址。

    我们继续从采集预览处得到翻页的链接,过滤规则选择包含,通过观察发现几个链接的相同点,输入到过滤串里就能得到想要的翻页链接了。

    第一层级的模板建好了,下面我们随便点进一个医院主页内,复制链接建立下一层级模板。在默认模板(2)的示例地址内输入医院主页的链接。

    因为我们需要采集该医院所有用户评论,所以我们找到下面的“更多点评”,通过刚刚地址过滤的方法,过滤出更多点评的链接,并建立模板(3),示例地址输入刚刚过滤的得到的“更多点评”的网址。

    注:点击链接抽取,看左下角关联模板处,一定要关联到下一层级的模板,如果是翻页的链接抽取,要关联自身模板,否则会数据采集失败。这点一定要注意。

    这样模板的基本配置就完成了,下一步是建立表单,下图是我们的需求,红色字体我们能从模板二采集到,蓝色字体我们能从模板三采集到,所以我们需要建立两个表单。

    点击表单配置,新建一个表单,添加一个网页主键如图,一定要勾选索引字段,键值唯一,主键字段三个选项,取值类型选择网页主键点击确定。

    然后添加下一个字段如标题“title”

    取值类型选择“选区内全部文本”,变量类型选择“string”,选择合适的字符长度点击确定。依次建立所有字段。

    这是我建立的两个表单的所有字段,表单名称分别为“大众点评1”、“大众点评2”,建立好以后点击保存即可。点开模板配置,每一个模板对应相应的表单,右键模板二“添加数据抽取”,表单名称选择“大众点评1”。

    同样在模板三处再添加另外一个数据抽取表单,添加好后如下图所示:

    单击“title”,然后按住ctrl键同时鼠标左键点击对应标题,内容过多的话按住shift可以调整内容大小,选好后点击保存。

    全部选取完后点击左上角的文件,然后全部保存。

    下一步点击数据,连接数据库,然后再次点击数据,选择数据表,选择刚刚新建两个数据表的字段后创建表,创建好后勾选并确定,就可以进行数据采集了(如果表单有问题需要更改,改好后需要重新创建表单),速度慢可以点击设置里面的线程设置,设置多线程。

    这只是一个简单的教程,软件还有很多强大的功能,祝大家使用愉快!

  • ?

    携程用户数据采集与分析系统

    宁书蝶

    展开

    一、携程实时用户数据采集系统设计实践

    随着移动互联网的兴起,特别是近年来,智能手机、pad等移动设备凭借便捷、高效的特点风靡全球,同时各类APP的快速发展进一步降低了移动互联网的接入门槛,越来越多的网民开始从传统PC转移至移动终端上。但传统的基于PC网站和访问日志的用户数据采集系统已经无法满足实时分析用户行为、实时统计流量属性和基于位置服务(LBS)等方面的需求。

    我们针对传统用户数据采集系统在实时性、吞吐量、终端覆盖率等方面的不足,分析了在移动互联网流量剧增的背景下,用户数据采集系统的需求,研究在多种访问终端和多种网络类型的场景下,用户数据实时、高效采集的方法,并在此基础上设计和实现实时、有序和健壮的用户数据采集系统。此系统基于Java NIO网络通信框架(Netty)和分布式消息队列(Kafka)存储框架实现,其具有实时性、高吞吐、通用性好等优点。

    1、技术选型和设计方案:

    一个典型的数据采集分析统计平台,对数据的处理,主要由如下五个步骤组成:

    图1、数据平台处理流程

    其中,数据采集步骤是最核心的问题,数据采集是否丰富、准确和实时,都直接影响整个数据分析平台的应用的效果。本论文关注的步骤主要在数据采集、数据传输和数据建模存储这三部分。

    为满足数据采集服务实时、高效性、高吞吐量和安全性等方面的要求,同时能借鉴互联网大数据行业一些优秀开源的解决方案,所以整个系统都将基于Java技术栈进行设计和实现。整个数据采集分析平台系统架构如下图所示:

    图2(数据采集分析平台系统架构)

    其中整个平台系统主要包括以上五部分:客户端数据采集SDK以Http(s)/Tcp/Udp协议根据不同的网络环境按一定策略将数据发送到Mechanic(UBT-Collector)服务器。服务器对采集的数据进行一系列处理之后将数据异步写入Hermes(Kafka)分布式消息队列系统。为了关联业务服务端用户业务操作埋点、日志,业务服务器需要获取由客户端SDK统一生成的用户标识(C-GUID),然后业务服务器将用户业务操作埋点、日志信息以异步方式写入Hermes(Kafka)队列。最后数据消费分析平台,都从Hermes(Kafka)中消费采集数据,进行数据实时或者离线分析。其中Mechanic(UBT-Collector)系统还包括对采集数据和自身系统的监控,这些监控信息先写入Hbase集群,然后通过Dashboard界面进行实时监控。

    (1)基于NIO的Netty网络框架方案

    要满足前面提到的高吞吐、高并发和多协议支持等方面的要求。我们调研了几种开源异步IO网络服务组件(如Netty、MINI、xSocket),用它们和NginxWeb服务器进行了性能对比,决定采用Netty作为采集服务网络组件。下面对它进行一些概要介绍:Netty是一个高性能、异步事件驱动的NIO框架,它提供了对TCP、UDP和文件传输的支持,Netty的所有IO操作都是异步非阻塞的,通过Future-Listener机制,用户可以方便的主动获取或者通过通知机制获得IO操作结果。

    图3(Netty框架内部组件逻辑结构)

    Netty的优点有:

    a、功能丰富,内置了多种数据编解码功能、支持多种网络协议。

    b、高性能,通过与其它主流NIO网络框架对比,它的综合性能最佳。

    c、可扩展性好,可通过它提供的ChannelHandler组件对网络通信方面进行灵活扩展。

    d、易用性,API使用简单。

    e、经过了许多商业应用的考验,在互联网、网络游戏、大数据、电信软件等众多行业得到成功商用。

    Netty采用了典型的三层网络架构进行设计,逻辑架构图如下:

    图4(Netty三层网络逻辑架构)

    第一层:Reactor通信调度层。该层的主要职责就是监听网络的连接和读写操作,负责将网络层的数据读取到内存缓冲区中,然后触发各种网络事件,例如连接创建、连接激活、读事件、写事件等,将这些事件触发到Pipeline中,再由Pipeline充当的职责链来进行后续的处理。

    第二层:职责链Pipeline层。负责事件在职责链中有序的向前(后)传播,同时负责动态的编排职责链。Pipeline可以选择监听和处理自己关心的事件。

    第三层:业务逻辑处理层,一般可分为两类:a. 纯粹的业务逻辑处理,例如日志、订单处理。b. 应用层协议管理,例如HTTP(S)协议、FTP协议等。

    我们都知道影响网络服务通信性能的主要因素有:网络I/O模型、线程(进程)调度模型和数据序列化方式。

    在网络I/O模型方面,Netty采用基于非阻塞I/O的实现,底层依赖的是JDKNIO框架的Selector。

    在线程调度模型方面,Netty采用Reactor线程模型。常用的Reactor线程模型有三种,分别是:

    a、Reactor单线程模型:Reactor单线程模型,指的是所有的I/O操作都在同一个NIO线程上面完成。对于一些小容量应用场景,可以使用单线程模型。

    b、Reactor多线程模型:Rector多线程模型与单线程模型最大的区别就是有一组NIO线程处理I/O操作。主要用于高并发、大业务量场景。

    c、主从Reactor多线程模型:主从Reactor线程模型的特点是服务端用于接收客户端连接的不再是一个单独的NIO线程,而是一个独立的NIO线程池。利用主从NIO线程模型,可以解决一个服务端监听线程无法有效处理所有客户端连接的性能不足问题。Netty线程模型并非固定不变的,它可以支持三种Reactor线程模型。

    在数据序列化方面,影响序列化性能的主要因素有:

    a、序列化后的码流大小(网络带宽占用)。

    b、序列化和反序列化操作的性能(CPU资源占用)。

    c、并发调用时的性能表现:稳定性、线性增长等。

    Netty默认提供了对GoogleProtobuf二进制序列化框架的支持,但通过扩展Netty的编解码接口,可以实现其它的高性能序列化框架,例如Avro、Thrift的压缩二进制编解码框架。

    通过对Netty网络框架的分析研究以及对比测试(见后面的可行性分析测试报告)可判断,基于Netty的数据采集方案能解决高数据吞吐量和数据实时收集的难点。

    》》点击阅读全文

  • ?

    如何采集招投标类网站数据

    何蓉

    展开

    网上有很多公布招投标信息的网站,招标公告中的信息是有很大的价值的。比如你想了解一个公司的资质,你想了解一个项目的投资资金,你想知道招投标公司之间的关系,这些都能从招投标信息中分析出来,数据是分析的基础,只有获得大量数据,分析才更准确更有说服力。今天教大家如何采集招投标类网站的数据。

    示例网站:http://tjconstruct/zbxx.aspx?type=sjzb

    一.首先打开ForeSpider数据采集软件,点击“采集频道列表”的“+”符号,创建新的频道。然后在采集地址处把准备采集网站的网址粘贴进去。

    频道配置

    二.频道入口地址配置好以后,点击“模板配置”,在右侧模板一处新建一个链接抽取,两个链接抽取,分别起名为“翻页”和“工程抽取”。这两个链接抽取分别抽取页面内的工程项目和翻页链接。

    添加链接抽取

    三.点击采集预览,发现采集预览中没有我想要的项目工程的链接,但是有翻页的链接,那就需要写脚本来抽取工程链接。翻页链接抽取可以通过可视化的操作完成。以前说过链接抽取的脚本如何写,这里就不多介绍了。

    链接抽取教程:http://toutiao/i6454813216395493902/

    链接抽取脚本

    四.通过预览发现每一个翻页链接地址中都包含“page=”这个词,那我将这个词放在“翻页”的地址过滤中,将过滤规则选择为“包含”。

    翻页地址过滤

    链接抽取配置好,可以点击采集预览看一下效果,如果配置的有问题可以及时改正。

    预览效果

    五.可以看到预览效果没有问题,那继续配置下一层模板。下一层为招标公告页,也就是数据页。先建好表单字段,在表单名称处选择建好的表单。

    选择表单

    六.数据页中有一部分字段使用可视化的操作就能完成,有一部分需要脚本,所以我就把需要写脚本的部分分别写在了字段下。字段处理选择“脚本处理”。

    字段下脚本处理

    八.全部字段配置好以后,可以先点击采集预览,看一下效果,如果效果不好可以改正。

    招投标类网站都是实时更新的,ForeSpider数据采集软件有增量采集的功能,可以采集新增数据,长时间时时监控网站新增数据。

    虽然教程看起来简单,最重要的还是多亲自上手实践。多多实践才能更熟练的使用软件采集自己想要的数据。

数据采集系统供应商

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP