中企动力 > 商学院 > 采集数据
  • ?

    三大核心解读大数据信息采集

    阮碧莲

    展开

    对于大数据的理解

    大多人还停留在很大的数据这一概念上

    其实不然

    大数据指的是存在于网络上的海量的信息碎片

    通过类似云速数据挖掘这种先进的技术将其采集、整合、

    从而发现隐藏于其中的关联信息

    下面通过三个核心来解读什么是大数据信息采集

    一、大数据营销是将所有营销行为和销售行为数据化

    将这些可挖掘、整理的数据作为营销活动的核心部分

    贴合需求打造符合市场及消费需求的商业模式、

    二、大数据信息采集实现线上线下结合的网络营销时代

    线上的营销活动不受时间空间限制

    将线上数据与传统模式结合起来

    打通数据库实现技术共享

    将是未来营销工作的首要重点

    三、大数据信息采集实现企业高效转化

    大数据营销的核心意在大规模的个性化互动

    指的是有针对性的传播内容

    更加人性化的服务

    而实现这以核心的基础就是大数据信息采集

  • ?

    一种无需开发就可以实现采集收银数据、消费者数据的方法

    失意者

    展开

    收银数据,特别是消费者消费数据是一切营销的基础数据。比如说做会员营销,卡券营销,会员充值等,如果无法知道消费者的消费数据,那么这一切营销都无从谈起。

    在目前的采集收银数据的方法中,需要软件对接门店的收银系统,面对市场上不同品牌,不同功能的收银系统,这种一对一对接开发方式成本过高,耗时过大,很难大规模使用。

    数贝通(TB有售)提供了一种新的解决方案。数贝通使用数据线连接在收银机和打印机中间,可以采集、识别每一张消费小票信息,并且可以自动在消费小票后面追加打印二维码。这个二维码用户可以根据实际需要自行设置。可以是文本,也可以是二维码。可以对接会员、手机支付、抽奖、游戏等。

    数贝通最大的优势是不需要在收银机上安装任何软件,不需要对接收银系统,不需要开发,也不需要收银员任何操作,完全实现即插即用。

    数贝通兼容USB、并口、串口、网口的小票打印机,采集识别数据安全高效。

  • ?

    企业进入大数据信息采集时代

    天寿

    展开

    做网络营销

    不论是个人还是公司都想要实现产品的渠道拓展和推广宣传

    但绝大多数的企业都不能达成想要的效果

    其实原因有很多

    一、想要做好网络营销

    客户是王道

    没有强大的客户群做后盾

    网络营销的销量不过是空想罢了

    当下客户渠道大多以网络大数据信息采集的方式来获取

    如云速数据挖掘

    通过输入行业关键字

    就能一键采集指定区域的客户信息和联系方式

    省时高效

    二、通过客户信息

    从分考虑分析目标群体的生活轨迹和习惯

    来预测客户下一步的消费行为

    以正确的时间正确的方式传达产品信息

    从而完成营销活动

    三、产品文案的策划一定要以客户需求为重点

    并且简单易懂、快速吸引客户眼球

    才能使转化率达到最佳

  • ?

    制造业生产数据采集的作用与意义

    谷南

    展开

    制造业生产数据采集的作用与意义导读:制造业是我国国民经济的支柱产业,也是推动工业化的原动力,现代制造业已经并且正在深刻地改变着人们的生产方式、生活方式甚至社会文化。全球经济一体化的趋势愈演愈烈,国际竞争不断加剧,制造业的发展必须不断提高在质量保障、品种多样化、快速设计制造、快速检测响应以及快速重组等方面的要求。于是,“以信息化带动工业化,以工业化促进信息化”被提到了前所未有的高度、深度和广度。

    制造业生产数据采集的作用与意义

    众所周知,制造业的信息化主要包括设计数字化、生产数字化、装备数字化、管理数字化、企业数字化等。信息化的大趋势使世界各国争先恐后的把先进技术和信息化引进到传统工业和制造业。1990 年,美国 AMR(Advanced Manufacturing Research)所提出的制造行业的ERP(Enterprise Resources Planning,企业资源规划)/MES(Manufacturing Execution System,制造执行系统)/PCS(Process Control System,过程控制系统)三层结构,已经成功地在许多行业得到了应用,并被越来越多的企业所认可.

    美国 AMR 研究公司对MES 的定义表述为:MES 是一个常驻工厂层的信息系统,介于企业领导层的计划系统与生产过程的直接工业控制系统之间,它以当前视角向操作人员、管理人员提供生产过程的全部资源(人、设备、材料、工具和客户要求)的数据和信息,其着重点是将信息技术运用于改善制造过程。

    而作为MES中低层的数据采集功能,可以实现对生产现场各种数据的收集、整理工作,是进行物料跟踪、生产计划、产品历史记录维护以及其它生产管理的基础。它可以为企业中其他例如ERP等管理信息系统提供实时数据。另一方面,MES也要从其它管理系统中获取相关的数据以保证MES自身正常运行。因此要满足MES快速、实时的要求,作为各种功能模块运行基础的数据就显得十分重要。一个迅速而可靠的数据采集系统是整个MES能够正常稳定工作的有力保证。

    制造企业面临的数据采集现状

    作为车间底层的数据采集系统,在企业实际生产过程中却存在着许多困难,尤其是在离散企业中由于自动化程度较低,往往存在着以下特点:

    生产过程不可视:主要体现在不能实时了解生产现场中在制品、人员、设备、物料等制造资源和加工任务状态的动态变化。

    生产过程复杂性:由于产品结构和加工工艺的复杂性,造成生产过程中各制造过程的关联性强,生产环境复杂多变(临时插单、材料短缺等) 。

    制造过程信息集成度低:制造过程中的各种信息不能有效进行集成,导致产能不能得到充分利用。

    信息不能有效与上层管理系统进行集成:这种隔断造成生产过程不透明,生产进度、在制品状况、设备利用状况等关键数据不能到达管理层,增加了过程管理和生产决策的复杂性。

    制造过程信息的真实性差:现场数据信息过多依赖人机交互界面通过人工录入,增加了出错的机率。

    制造过程信息的实时性低:作业任务随市场需求的频繁调整变化,不利于制造过程信息的实时采集,再加上制造过程信息交互的速度和效率低下,造成企业对市场变化的响应速度慢。

    企业设计层和管理层到车间层特别是车间设备层的信息采集困难,一方面车间设备层的重要信息难于采集和上传,无法达到对生产过程的监控。另一方面上层系统难以深入到车间和设备层,从而影响管理信息系统的准确运行,使动态信息成为脱离实际的无源之水难于及时下达,从而使整个企业信息化难以产生更大的效益。

    上述特点反映了制造车间迫切需要对制造过程进行信息化的数据采集管理,从而建立一个完整高效的离散制造车间数据采集及其分析处理系统是实现离散车间信息化的基础。数据采集及其分析处理系统的主要功能就是将车间的各种离散数据完整实时的采集到车间数据库中,并进行初步的分析处理,将车间生产的信息实时准确的反馈到车间的管理层,加强管理人员对车间生产现场的监控和管理,并为企业管理人员制定生产计划提供依据。

    华磊迅拓科技专业提供SCADA数据采集监控系统,OrBit-SCADA(Supervisory Control And Data Acquisition)系统是"制造业物联网信息总线"的具体实现,它包含两个层次的含义:一是分步式的实时数据采集系统,即工业通讯与控制的PC上位机系统 ;另一个是生产现场的场景建模和显示系统。

  • ?

    学会使用PowerBI/Excel批量采集网页数据

    Lena

    展开

    前面介绍PowerBI数据获取的时候,曾举了一个从网页中获取数据的例子,但当时只是爬取了其中一页数据,这篇文章来介绍如何用PowerBI批量采集多个网页的数据。

    本文以智联招聘网站为例,采集工作地点在上海的职位发布信息。

    下面是详细操作步骤:

    (一)分析网址结构

    打开智联招聘网站,搜索工作地点在上海的数据,

    下拉页面到最下面,找到显示页码的地方,点击前三页,网址分别如下,

    http://sou.zhaopin/jobs/searchresult.ashx?jl=%e4%b8%8a%e6%b5%b7&sm=0&sg=fe782ca83bfa4b018d27de559d0a5db0&p=1http://sou.zhaopin/jobs/searchresult.ashx?jl=%e4%b8%8a%e6%b5%b7&sm=0&sg=fe782ca83bfa4b018d27de559d0a5db0&p=2http://sou.zhaopin/jobs/searchresult.ashx?jl=%e4%b8%8a%e6%b5%b7&sm=0&sg=fe782ca83bfa4b018d27de559d0a5db0&p=3

    可以看出最后一个数字就是页码的ID,是控制分页数据的变量。

    (二)使用PowerBI采集第一页的数据

    打开PowerBI Desktop,从网页获取数据,从弹出的窗口中选择【高级】,根据上面分析的网址结构,把除了最后一个页码ID的网址输入第一行,页码输入第二行,

    从URL预览中可以看出,已经自动把上面两行的网址合并到一起;这里分开输入只是为了后面更清晰的区分页码变量,其实直接输入全网址也是一样可以操作的。

    (如果页码变量不是最后一位,而是在中间,应该分三行输入网址)

    点击确定后,发现出来很多表,

    从这里可以看出,智联招聘网站上每一条招聘信息都是一个表格,不用管它,任意选择一个表格,比如勾选Table0,点击编辑进入Power Query编辑器。

    在PQ编辑器中直接删除掉【源】之后的所有步骤,然后展开数据,并把前面没有的几列数据删除。

    这样第一页的数据就采集过来了。然后对这一页的数据进行整理,删除掉无用信息,添加字段名,可以看出一页包含60条招聘信息。

    这里整理好第一页数据以后,下面进行采集其他页面时,数据结构都会和第一页整理后的数据结构一致,采集的数据可以直接拿来用;这里不整理也没关系,可以等到采集所有网页数据后一起整理。

    如果要大批量的抓取网页数据,为了节省时间,对第一页的数据可以先不整理,直接进入下一步。

    (三)根据页码参数设置自定义函数

    这是最重要的一步。

    还是刚才第一页数据的PQ编辑器窗口,打开【高级编辑器】,在let前输入:

    (p as number) as table =>

    并把let后面第一行的网址中,&后面的"1"改为(这就是第二步使用高级选项分两行输入网址的好处):

    (Number.ToText(p))

    更改后【源】的网址变为:

    "http://sou.zhaopin/jobs/searchresult.ashx?jl=%e4%b8%8a%e6%b5%b7&sm=0&sg=fe782ca83bfa4b018d27de559d0a5db0&p="&(Number.ToText(p)))),

    确定以后,刚才第一页数据的查询窗口直接变成了自定义函数的输入参数窗口,Table0表格也变成了函数的样式。为了更直观,把这个函数重命名为Data_Zhaopin.

    到这里自定义函数完成,p是该函数的变量,用来控制页码,随便输入一个数字,比如7,将抓取第7页的数据,

    输入参数只能一次抓取一个网页,要想批量抓取,还需要下面这一步。

    (四)批量调用自定义函数

    首先使用空查询建立一个数字序列,如果想抓取前100页的数据,就建立从1到100的序列,在空查询中输入

    ={1..100}

    回车就生成了从1到100的序列,然后转为表格。gif操作图如下:

    然后调用自定义函数,

    在弹出的窗口中点击【功能查询】下拉框,选择刚才建立的自定义函数Data_Zhaopin,其他都按默认就行,

    点击确定,就开始批量抓取网页了,因为100页数据比较多,耗时5分钟左右,这也是我第二步提前数据整理造成的后果,导致抓取比较慢。展开这一个表格,就是这100页的数据,

    至此,批量抓取智联招聘100页的信息完成,上面的步骤看起来很多,实际上熟练掌握以后,10分钟左右就可以搞定,最大块的时间还是最后一步进行抓取数据的过程比较耗时。

    网页的数据是不断更新的,在操作完以上的步骤之后,在PQ中点击刷新,可以随时一键提取网站实时的数据,一次做好,终生受益!

    以上主要使用的是PowerBI中的Power Query功能,在可以使用PQ功能的Excel中也是可以同样操作的。

    当然PowerBI并不是专业的爬取工具,如果网页比较复杂或者有防爬机制,还是得用专业的工具,比如R或者Python。在用PowerBI批量抓取某网站数据之前,先尝试着采集一页试试,如果可以采集到,再使用以上的步骤,如果采集不到,就不用再耽误工夫了。

    现在就打开PowerBI/,尝试着抓取你感兴趣的网站数据吧。

  • ?

    APP数据采集是怎么实现的

    曹宫苴

    展开

    最近半年,我们八爪鱼陆续接到好几个APP数据采集的项目需求,我在群里面,偶尔也看到有些用户在问,有没有APP数据采集的工具。鉴于我们做过的几个APP数据采集项目的经验,我可以告诉大家,现在APP数据采集,市面上还没有通用的工具。我们八爪鱼内部是有一套工具,但由于使用的难度较高,需要编写脚本,所以不对普通用户公开,我们仅接受项目定制。

    虽然不对外公开,但并不妨碍我们将技术分享出来,APP数据采集,一般走以下两种方式:

    1.两种思路

    1. 抓包

    2. HOOK

    2.抓包

    有代码经验或APP开发的同学都很容易理解,其实很多APP,走的都是webservice通讯协议的方式,并且由于是公开数据,而且大部分是无加密的。所以只要对网络端口进行监测,对APP进行模拟操作,即可知道APP里面的数据是如何获取的。

    我们只需要写代码模拟请求,无论POST还是GET,即可得到该请求所返回的信息。再通过对返回的信息结构化解析,即可得到我们想要的数据。

    public static void main(String[] args) {

    Spider.create(new GithubRepoPageProcessor())

    //从https://github/****开始抓

    .addUrl("https://github/****")

    //设置Scheduler,使用Redis来管理URL队列

    .setScheduler(new RedisScheduler("localhost"))

    //设置Pipeline,将结果以json方式保存到文件

    .addPipeline(new JsonFilePipeline("D:\\data\\webmagic"))

    //开启5个线程同时执行

    .thread(5)

    //启动爬虫

    .run();

    }

    以模拟采集“meizu”应用市场为例

    应用市场产品

    抓包返回参数

    整个抓包过程

    3.HOOK技术

    HOOK技术是一种走操作系统内核的技术,由于安卓系统是开源的,所以可以借助一些框架修改内核,从而实现你要的功能。HOOK的形式,我们走的是Xposed框架。Xposed是一款可以在不修改任何其他开发者开发的应用(包括系统服务)的情况下,改变程序运行的一个开源框架服务。基于它可以制作出许多功能强大的模块,以此来达到应用程序按照你的意愿运行的目的。

    如果把安卓手机看做一座城堡,那Xposed可以让你拥有一个上帝视角,城里的运作细节尽收你眼底,还能让你插一手改变城堡的运作规律。

    什么意思呢?简单的说就是你可以通过他,自动化的控制你的APP。如果将我们的APP开在模拟器上,我们可以通过编码,通过他告诉APP这一步干什么,下一步干什么。你把它理解成类似游戏打怪外挂就可以了。

    而他每走一步,APP与服务端交互的数据,均可获取下来。这种方式广泛用于一些成熟的APP。比如某信采集。

    public class HookActivity implements IXposedHookLoadPackage {

    @Override

    public void handleLoadPackage(LoadPackageParam lpparam) throws Throwable {

    final String packageName = lpparam.packageName;

    XposedBridge.log("--------------------: " + packageName);

    try {

    XposedBridge.hookAllMethods

    (Activity.class, "onCreate", new XC_MethodHook() {

    @Override

    protected void afterHookedMethod(MethodHookParam param)

    throws Throwable {

    XposedBridge.log("=== Activity onCreate: " + param.thisObject);

    }

    });

    } catch (Throwable error) {

    XposedBridge.log("xxxxxxxxxxxx: " + error);

    }

    }

    }

    其实我们八爪鱼曾经也想开发一款通用的APP数据采集工具,并且两年前在这块投入研究了小半年,我们做出了一款APP采集脚本编辑工具,可以让一款APP的数据采集项目缩减到3-5天即可开发完成。但我们认为,这个工具需要编写脚本一般用户是比较难上手的,所以仅作为内部项目使用。

    以HOOK某APP为例:

    HOOK指令打开某

    4.这些年走过的坑

    聊完APP采集的思路,我们跟大家分享一些遇过的坑吧,让大家乐一乐

    坑一:签名算法

    以某信的文章列表页及某信息页为例,对其http访问进行抓包,会发现其url的一个核心参数是我们无法知道如何生成的,这就导致,我们不可能直接用该url进行信息爬取;签名算法如果无法破解,HTTP这条路就是死路了。

    坑二:http爬取回来的信息和页面显示不一致

    以某信的某信息页为例,对比直接访问某信页面及http爬取的信息,可明显发现http爬取到的信息较少。造成得两种方式都用,才能既照顾速度又照顾完整性。

    坑三:模拟器中的坑

    APP自动识别你的运行环境进行屏蔽,最厉害的还是某信,连你是用模拟器打开还是真机打开,是什么内核的,全部进行限制。曾经见过牛人,找某手机厂商专门定做真机来配合。

    坑四:帐号的坑

    这个坑就有点大了,要找号、养号,都不是件容易的事情,更惨的是封号,真真让你一夜回到解放前。

  • ?

    数据采集过程中的常见问题

    落笔

    展开

    经过两周的整理总结,沉淀出来好多数据采集的经验与大家分享。

    前嗅免费模板共享链接:http://forenose/help/collection/template/cases.html

    1.如何进行数据采集?

    ①下载安装软件后,登录到软件上。

    ②准备好模板:在前嗅的官网上下载免费的模板或自己配置好的模板

    ③将下载的官网导入到软件中。

    点击文件---点击导入采集文件(将采集文件导入,自己配置的模板请忽略这一步)

    ④在数据建表中建关联数据表

    选中需要采集模板下的表单---点击创建关联数据表,所创表名不能为汉字,点击确定---在所创数据表前的方框打勾即可关联数据表。详情见下图。

    此时在数据浏览中就存在了刚刚建的关联数据表。

    ⑤进行数据采集。

    在需要进行数据采集的模板前打勾--点击允许采集--点击开始按钮即可进行数据采集。详情见下图。

    ⑥数据预览及导出

    选中关联表---点击刷新按钮即可查看数据---点击导出按钮即可导出数据。详情见下图。

    多种导出方式:

    a.可以将采集到的数据全部导出。

    b.可以将数据分割导出,设置特定数目后数据会分别储存放在文件夹中。

    c.可以将每个字段所采集到的内容分别导出到不同文件夹,方便查看。

    数据导出教程:

    http://forenose/help/guildbook/crawler_new/5-2.html

    2.所采集的网站弹验证码是怎么回事?

    弹验证码分为四种情况:

    ①登录需要验证码:登录时只需要一个验证码,所以直接手动填写配置即可。

    ②多账号登录:每次账号登录都需要验证码,此时应该接第三方打码平台。

    前嗅(forenose)是首个深度大数据专家。

    提供数据采集-分析-处理-管理-营销-应用,自主知识产权的全套大数据产品 。

  • ?

    工业互联网中的数据采集与控制技术

    陶哲瀚

    展开

    工业互联网是在传统互联网的基础上建立起来的。这种演化是工业技术发展的必然趋势。传统互联网将人与人通过计算机网络连接在一起,分享各种信息,传递各种需求,获得各种服务,这是人类社会、经济、科技发展的巨大进步。但是,这种连接的能力还是非常有限的。因为如果只有人而没有机器的参与,我们应用互联网的空间不是完整的。只有当全球70多亿人口和600亿台左右的机器都能够连接在一起的时候,互联网的价值才能得到最大程度的彰显,人类社会才能完全从体力和脑力劳动中彻底解放出来。我们今天已经步入了“复杂的工作要用最简单的方法来处理”的时代。这就是工业互联网技术发展的原动力,发展的趋势不可逆转。在传统互联网的基础上,影响这项技术发展速度的一个重要因素是机器侧的数据采集和云控制技术问题。事实上,这就是自动化技术与信息化技术深度融合的问题。这个问题处理好了,工业互联网的发展就会更顺利一些。机器的连接只是手段,能对机器的有效管控才是工业互联网发展的重要目的。

    工业互联网

    目前,数据采集技术主要受到两个方面的制约。一是部分机器没有数据接口,二是存在大量异构的通讯规范。与此同时,我们还要考虑到工业发展的惯性,不能完全采用新旧技术彻底更替的办法来解决这两方面的问题。所以,工业社会必须要有这样的技术,在没有数据接口的机器上能够增加数据接口(包括传感器),在异构通讯规范之间采用全兼容的数据采集技术。通用网关是提供这种全兼容技术的产品。在工业互联网技术体系中,通用网关属于边缘计算的一部分。这是与传统互联网明显不同的地方。每一种通讯协议都对应着通用网关中的一种通讯驱动。一项新的技术是把通讯数据包交给通用网关中边缘计算来处理,以便分解出有效的信息来。这将极大地降低通用网关的通讯处理开发成本,提高通用网关数据采集的灵活性。边缘计算的另一个用途当然是对采集来的数据进行必要的处理,以减轻云平台的计算压力。同时,多个边缘计算构成的雾计算,也是工业互联网的重要组成部分。雾计算的加入,可极大地提升工业互联网的分布计算能力。考虑到互联网通讯的不确定性,还需要在通用网关中增加断网续传的功能,以保持数据的完整性。除此之外,我们还需要关注数据的实时性和同步性问题。这些特性一般能够通过调整通讯的请求周期和标记数据的时间戳来确定。显而易见,通用网关是数据采集的重要设备,它在整个工业互联网中构成了一个庞大的通讯节点系统,对于整个工业互联网的运行有着非常重要的影响。为此,我们需要一种有效的网络工具,用于管理这样的通讯节点系统,对它们的运行状态,采集数据更新,采集周期等状态进行监控,同时也能对相应的软件维护、节点参数、接口配置等进行动态的调整。

    数据采集

    云控制是工业互联网很重要的一项功能。但是,目前工业互联网的关注点主要集中在数据的处理和信息的管理方面。事实上,由于工业互联网中云平台能够综合更多的数据,因此它不仅可以对企业的管理过程提供重要的决策,而且可以对机器的控制过程提供更优的指令。云机器人和能源互联网都属于云控制的典型的应用。人工智能的技术需要强大的计算资源的支持,而这只有在云计算环境中才能得到满足。只有当强大的云控制功能和强大的数据采集功能结合在一起的时候,工业互联网才能具有真正强大的支配机器的能力。一般情况下,工业互联网的云平台是按照PaaS架构进行设计的。云控制可利用这方面的计算资源,进行智能控制、资源调度、优化决策,以及多个生产过程的协同作业等方面的计算处理,从而为机器的先进控制提供最优的设定值。云控制需要解决的关键技术问题是:互联网通讯的不确定性造成的数据通讯延迟补偿,如何让复杂算法的编辑、编译和基于工业互联网的动态调试过程变得更加简单和直观。工业APP提供的可视化能力,也为云控制技术的工程应用提供了有力支撑。另外,云控制需要边缘计算的协同。边缘计算一方面为云控制提供数据通讯的通道,一方面也为云控制过程提供安全保障。随着工业互联网技术的快速发展,云控制将逐步成为工业领域中最重要的一种生产技术。

    控制技术

    工业互联网是生产企业控制与管理深度融合的重要技术设施。数据采集和控制是工业互联网连接机器社会的重要手段。数据采集和云控制技术的研究与应用,将有效消除人们对工业互联网发展的质疑,并产生积极的促进作用。

  • ?

    前嗅:手把手教你数据采集

    代桃

    展开

    ForeSpider 前嗅:手把手教你数据采集

    ForeSpider是一款非常好用的数据采集软件,因为属于专业性工具,除了帮助文档外很少有使用教程。所有有很多人在使用的过程中遇到问题难以解决,今天给大家介绍ForeSpider数据采集系统的使用教程,希望能对大家的工作有所帮助。

    教程的示例网站是大众点评,要得到50页内所有医院名称,该医院评论总数,医院总体星级,各项评分,医院评论的用户名,评论内容,评论时间,用户点评星级,获赞数量和回应数量。

    首先我们先新建一个频道,我给它命名为大众点评,然后在频道配置里输入我们想要爬取数据的网址,需要在频道配置处输入想要得到数据的网址,大众点评需要开启cookie,从右面可以开启,网站不同有的不需要,视情况而定。 现在默认模板(1)就是我们要的网站页面,鼠标放在医院标题处如图,从左下角能看到医院的网址链接。

    现在点一下右上角的采集预览,我们能得到整个页面的所有网页链接,下拉滚动条到这个位置就会发现跟上图相同格式的链接,这就是我们需要的所有医院的链接。

    我们用不到的需要过滤一下,可以通过地址过滤和标题过滤方法筛选。点击软件右上角模板抽取配置里面的链接抽取,里面有地址过滤和标题过滤两个选项,点击地址过滤,软件右下角如图:

    过滤规则选择包含,过滤串内输入想要得到的医院链接,后面这串数字我们用“\d”表示,用“\e”表示结束,例如https://dianping/shop/\d\e,这样就能采集网页内所有这种格式的网页链接。

    当我们想要采集的网页下面有翻页的链接,就必须配置翻页。除了在右上角默认模板处抽取我们想要的得到的医院链接外,还要再新建一个链接抽取,抽取页面翻页的地址。

    我们继续从采集预览处得到翻页的链接,过滤规则选择包含,通过观察发现几个链接的相同点,输入到过滤串里就能得到想要的翻页链接了。

    第一层级的模板建好了,下面我们随便点进一个医院主页内,复制链接建立下一层级模板。在默认模板(2)的示例地址内输入医院主页的链接。

    因为我们需要采集该医院所有用户评论,所以我们找到下面的“更多点评”,通过刚刚地址过滤的方法,过滤出更多点评的链接,并建立模板(3),示例地址输入刚刚过滤的得到的“更多点评”的网址。

    注:点击链接抽取,看左下角关联模板处,一定要关联到下一层级的模板,如果是翻页的链接抽取,要关联自身模板,否则会数据采集失败。这点一定要注意。

    这样模板的基本配置就完成了,下一步是建立表单,下图是我们的需求,红色字体我们能从模板二采集到,蓝色字体我们能从模板三采集到,所以我们需要建立两个表单。

    点击表单配置,新建一个表单,添加一个网页主键如图,一定要勾选索引字段,键值唯一,主键字段三个选项,取值类型选择网页主键点击确定。

    然后添加下一个字段如标题“title”

    取值类型选择“选区内全部文本”,变量类型选择“string”,选择合适的字符长度点击确定。依次建立所有字段。

    这是我建立的两个表单的所有字段,表单名称分别为“大众点评1”、“大众点评2”,建立好以后点击保存即可。点开模板配置,每一个模板对应相应的表单,右键模板二“添加数据抽取”,表单名称选择“大众点评1”。

    同样在模板三处再添加另外一个数据抽取表单,添加好后如下图所示:

    单击“title”,然后按住ctrl键同时鼠标左键点击对应标题,内容过多的话按住shift可以调整内容大小,选好后点击保存。

    全部选取完后点击左上角的文件,然后全部保存。

    下一步点击数据,连接数据库,然后再次点击数据,选择数据表,选择刚刚新建两个数据表的字段后创建表,创建好后勾选并确定,就可以进行数据采集了(如果表单有问题需要更改,改好后需要重新创建表单),速度慢可以点击设置里面的线程设置,设置多线程。

    这只是一个简单的教程,软件还有很多强大的功能,祝大家使用愉快!

  • ?

    干货丨大数据是如何被采集及应用的

    Galina

    展开

    尽管“大数据”一词近年来屡遭热捧

    但很多人都还不知道什么是大数据

    更不知道大数据有甚卵用

    这两年,发现“大数据”这个词出现的越来越频繁了

    不仅企业,连国家都在部署大数据战略

    一番百度了之后

    Oh~ emmmmmmmmm~ +_+

    还是没搞懂大数据到底是个什么玩意儿

    直到有一天

    我发现一个秘密

    不管我在网上搜索什么

    页面都会跳出我要搜索的相关产品或关联事物

    然后,我恍然大悟!

    所谓大数据,就是算法!

    它能够“算”出我们“心中所想”

    那么问题来了

    大数据技术是如何采集到我们的信息的呢?

    数据采集,又称数据获取,是利用一种装置,从系统外部采集数据并输入到系统内部的一个接口。在互联网行业快速发展的今天,数据采集已经被广泛应用于互联网及分布式领域,比如摄像头,麦克风,都是数据采集工具。

    数据采集系统整合了信号、传感器、激励器、信号调理、数据采集设备和应用软件。在数据大爆炸的互联网时代,数据的类型也是复杂多样的,包括结构化数据、半结构化数据、非结构化数据。结构化最常见,就是具有模式的数据。非结构化数据是数据结构不规则或不完整,没有预定义的数据模型,包括所有格式的办公文档、文本、图片、XML, HTML、各类报表、图像和音频/视频信息等等。大数据采集,是大数据分析的入口,所以是相当重要的一个环节。

    我们首先来了解一下数据采集的三大要点:

    一、数据采集的三大要点

    (1)全面性

    数据量足够具有分析价值、数据面足够支撑分析需求。

    比如对于“查看商品详情”这一行为,需要采集用户触发时的环境信息、会话、以及背后的用户id,最后需要统计这一行为在某一时段触发的人数、次数、人均次数、活跃比等。

    (2)多维性

    数据更重要的是能满足分析需求。灵活、快速自定义数据的多种属性和不同类型,从而满足不同的分析目标。

    比如“查看商品详情”这一行为,通过埋点,我们才能知道用户查看的商品是什么、价格、类型、商品id等多个属性。从而知道用户看过哪些商品、什么类型的商品被查看的多、某一个商品被查看了多少次。而不仅仅是知道用户进入了商品详情页。

    (3)高效性

    高效性包含技术执行的高效性、团队内部成员协同的高效性以及数据分析需求和目标实现的高效性。也就是说采集数据一定要明确采集目的,带着问题搜集信息,使信息采集更高效、更有针对性。此外,还要考虑数据的及时性。

    不同应用领域的大数据其特点、数据量、用户群体均不相同。不同领域根据数据源的物理性质及数据分析的目标采取不同的数据采集方法。

    那么,接下来我们再来了解一下常用的数据采集的方法。

    常用的数据采集方法归结为以下三类:传感器、日志文件、网络爬虫。

    (1)传感器

    传感器通常用于测量物理变量,一般包括声音、温湿度、距离、电流等,将测量值转化为数字信号,传送到数据采集点,让物体有了触觉、味觉和嗅觉等感官,让物体慢慢变得活了起来。

    (2)系统日志采集方法

    日志文件数据一般由数据源系统产生,用于记录数据源的执行的各种操作活动,比如网络监控的流量管理、金融应用的股票记账和 web 服务器记录的用户访问行为。

    很多互联网企业都有自己的海量数据采集工具,多用于系统日志采集,如Hadoop的Chukwa,Cloudera的Flume,Facebook的Scribe等,这些工具均采用分布式架构,能满足每秒数百MB的日志数据采集和传输需求。

    (3)Web 爬虫

    网络爬虫是指为搜索引擎下载并存储网页的程序,它是搜索引擎和 web 缓存的主要的数据采集方式。通过网络爬虫或网站公开API等方式从网站上获取数据信息。该方法可以将非结构化数据从网页中抽取出来,将其存储为统一的本地数据文件,并以结构化的方式存储。它支持图片、音频、视频等文件或附件的采集,附件与正文可以自动关联。

    此外,对于企业生产经营数据上的客户数据,财务数据等保密性要求较高的数据,可以通过与数据技术服务商合作,使用特定系统接口等相关方式采集数据。比如八度云计算的数企BDSaaS,无论是数据采集技术、BI数据分析,还是数据的安全性和保密性,都做的很好。

    数据的采集是挖掘数据价值的第一步,当数据量越来越大时,可提取出来的有用数据必然也就更多。只要善用数据化处理平台,便能够保证数据分析结果的有效性,助力企业实现数据驱动。

采集数据

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP