中企动力 > 商学院 > 数据如何采集
  • ?

    数据采集做不好,何谈大数据!

    宣元容

    展开

    在数字经济时代,未来每个企业都可能是数字企业。数字企业则必须有自己完整的大数据体系。上期小编邀请数据大牛为大家解析了大数据底层架构(资深数据大牛深度解析:大数据底层架构!),而今天我们介绍的,便是每个企业大数据体系中最基础和最根本的部分——数据采集。

    数据采集是一切有效分析的前提。如:数据接入;数据传输;数据建模/存储;数据查询;数据可视化等。总体上可以将企业大数据体系分成:

    采集与存储平台:主要职责是对企业的相关大数据进行收集,并将收集到的数据进行存储。以便与企业管理及运用,同时也是未来数字企业的最重要资产之一。

    分析与挖掘平台:主要职责是对企业采集到的数据进行专门的分析、BI等,以及在此基础上进一步的数据挖掘、人工智能等。

    洞察与决策平台:主要职责是利用大数据分析的结果,通过自动加人工双重决策,更高效的运用到产品,业务,商业等环节以及相应的行动等。

    覆盖全局数据安全平台:主要职责是负责确保数据的安全性,保证企业的数据资产不受到损害,例如数据不丢失、不损坏、不被窃、不被改等。

    数据采集与存储平台将占据非常重要的位置。将来自各种数据源的原始大数据采集、分析、存储等。通常中小企业也可以不用自己拥有专门的大数据分析与挖掘平台,选择与相对专业的企业合作。

    面对来源各异、以结构化/半结构化为主的数据,拍拍信使用linkedin开源的camus来采集消息类数据,使用kettle来采集RMDB的数据,具有以下优势:

    1提高采集效率,降低工程成本;

    2支持Web、iOS、Android、HTML等多种平台;

    3采集全面属性、维度、指标等,使数据资源更优质;

    4建立预测模型,实时智能监控、分析、预测用户行为;

    5支持代码埋点,和全(无)埋点,按需选择,灵活运用。

    采集方案:客户端(前端);服务器日志;业务数据库;历史数据;第三方数据等。

    数据采集与存储平台一般也可以分为三个层次,即数据采集层、预处理层和存储层。同时,大数据采集平台还需要一个覆盖全局的数据安全体系。

    采集层负责采集企业各种来源的大数据;预处理层负责对采集回来的数据进行一些规范化的处理;存储层则是将预处理后的大数据进行存储,将企业大数据资产用一种方式保存起来。数据安全体系即数据安全平台。值得注意的是,当存储技术足够好、存储设备成本足够低容量足够大时,预处理层或可以选择忽略。

    本期对大数据采集的分享就到这里啦,欢迎大家联系探讨。

    (小编的鸡腿就靠各位老板啦(づ ̄ 3 ̄)づ)

    感谢您对拍拍信的认可与支持

    我们一直在路上

  • ?

    数据采集使用与保护隐私如何处理

    Dang

    展开

    全球进入互联网特别是移动互联网时代后,一个巨大进步是一切活动包括政治经济文化娱乐等都在往互联网特别是移动互联网这个舞台上转移。所有社会活动、经济金融交易等都在网络上留下了痕迹或者说有迹可循。这相对于过去在网络线下相比较带来的进步是革命性、历史性、颠覆性的。

    革命性主要在于通过对人们在网路上留下的印记的采集、挖掘、提炼与分析,可以分析出背后许多经济金融文化甚至政治等有巨大价值的东西。思想支配行动,行动又反映思想。从网路上的留印行动中挖掘分析后就可以基本得出其思想所在,从网络上对一个主体各个方面留痕进行大挖掘、大计算、大分析基本就可以摸清楚预测出来这个主体想要什么,需求何在?这就可以分类施策、细分客户、精准营销。这个商业价值,其实不仅是商业价值包括政治文化价值都是无限的。

    我仅从经济学上讲一个例子。此前,马云曾经讲过,大数据、云计算诞生以后,经济或可以进入到计划经济体制里。猛一看,貌似梦想一样,但细细分析似乎也不无道理。计划经济与市场经济都是配置资源的手段。计划经济之所以比市场经济在效率等方面低,弊端多,不在于计划经济体制本身,而在于没有技术等手段与能力来实现计划经济的高效性与准确性。过去往往是拍脑袋搞计划,即使到市场调查,准确性也难以达到。这是问题所在。

    目前有了网络,有了网络上的大数据积累,有了云计算,或给计划经济以重新复活的机会,给了计划经济体制优越性以证明的机会。这种可能性不是没有。插上大数据、云计算翅膀的计划经济或比市场经济更加高效,更加精准,对市场的周期性破坏或就此消失。

    这就是所说的大数据是一座大金库的原因。不过,这个大金库要充分挖掘与发挥出来的话,一个大前提是要对大数据进行充分的采集、挖掘、整理、甄别、分类、分析等。这个大数据中包括你我他几乎全部在网路上的百姓民众消费者。也就是说,每一个在网络上留下印记即数据的你我她他都是被分析的对象,你留下的几乎所有信息都在被采集挖掘分析的范围之内。这就牵扯到另一个问题:隐私保护问题。

    近期,用户在查阅自己的支付宝年度账单时默认勾选“我同意《芝麻服务协议》”这件事引起一阵波澜,蚂蚁金服也回应道歉了。无论处于什么好意,默认勾选“同意”肯定是不合适的。不过,从这件事中的一些争论反应看,确实存在着一些对大数据在采集使用与隐私保护上的较大偏差甚至是糊涂认识。需要以理性的思考予以梳理厘清。

    我的认识是,只要你在网路上留下了印记即数据基本上没有隐私可言。即使在没有网络、都是线下交易活动的过去也基本如此。例如:过去你到银行办理存款贷款汇款,你到房管所办理房子登记过户,你到派出所办理户口入户迁移,你办理入学入托上大学等等都要登记家庭、身份证、电话等基本情况与信息。现在在网络上同样如此。只要存在这些情况,你的信息或者隐私已经裸露出来了。除非你生活在大山深处的世外桃源里。

    当然,在网络时代个人信息与隐私或者裸露的更加严重而已。这里一个关键问题必须甄别清楚,每一个人在网络积累的大数据不让采集挖掘分析使用是绝对不行的。这不是对大数据金矿的极大浪费吗?关键在于如何使用?关键在于不是不让使用而是使用后一定要为客户的隐私以及普通信息数据保密。保密,是问题的关键所在。

    对每一个人数据信息的使用是不可避免的。只要有交易,就一定要使用你的数据。比如,你有贷款信用需求,这个金融交易一定要充分使用你的数据信息的。网络信息如此,线下在银行贷款比如房贷等,对你的个人所有情况、数据信息等几乎是挖地三尺的。关键在于使用以后,不能泄露给第三方,要替交易客户保护好数据信息。所谓的保护隐私数据,主要的问题在这里。

    非金融信用业务也有保护数据信息隐私问题。你去一个网站注册、你想使用共享单车都需要注册相关信息数据的。注册这些数据信息以后,你不能说不让网站等挖掘使用你的数据信息,注册时也等于是一种交易,除非你不注册。关键的问题还在于,网站、共享单车等使用客户数据后,一定要对客户保密。

    这里面牵扯第三方使用数据如何办的问题。我个人认为,牵扯所有经济体的金融信用数据问题,各大平台包括央行在内都可以共享信用等级数据。目的在于形成一种“有信走遍天下,无信寸步难行”的社会氛围与高压态势,使有信用者得以提倡褒扬,无信用者如过街老鼠人人喊打。全社会形成:信用贵如金子,无信耻辱透顶,这才能形成信用的正向激励机制。

    第三方使用其它数据,网站等平台应该通过协议约束征得被采集人的同意。同样,必须有约束条款,第三方也必须给客户数据信息保密。

    总之,大数据这座金矿必须充分利用使用与挖掘开采,不能造成这么宝贵的大数据资源闲置浪费,同时,使用以后关键在于要保护好被采集数据者的数据信息以及隐私。

  • ?

    农产品追溯系统:追溯数据如何进行采集?

    武如冰

    展开

    农产品追溯系统:追溯数据如何进行采集?追溯采集方案

    为确保追溯信息的完整性、数据采集的高效性、准确性以及数据采集的可行性,追溯数据采集将采用条码技术以及布局合理的采集点来完成追溯信息的采集。

    条码规则

    通过条码扫描可实现数据的快速、准确的采集,为了结合条码扫描采集,XX科技需要形成自己的产品条码规则以及关键物料的条码规则,形成的物料条码中包含追溯件的关键物料代号、供方代号、物料批次号等信息。

    条码生成规则 通过配置条码生成规则,如前缀代号、起始序号、生成数量等,系统可实现快速、批量的生成所需的条码,并实现条码的导出与打印,以此可大大缩减条码管理的工作量,同时针对产品和物料可按不同规则生成条码。

    采集点布局

    确保追溯信息的完整性以及采集效率的高效性,系统实施过程中将设计完整的采集点布局以完成数据的采集,如下图所示。涉及XX科技采集点的布局将根据实际应用场景以及采集内容,调研时展开采集点评估,最后形成完整的采集点布局图。

    追溯信息采集内容

    结合客户需求,并确保质量追溯数据的贯通以及质量信息的完整性,系统将采集生产过程5M1E信息以及影响产品质量的关键信息,采集内容如下:

    1:生产计划订单信息

    2:供应商物料批次信息

    3:进货检验报告制造过程5M1E(人、机、料、法、环、测)

    4:制造过程检验信息

    5:不合格品处理信息(含进货检验及制造过程)

    生产计划订单信息采集

    系统具备生产计划管理功能,包含了订单号、生产指令号等信息,系统支持计划的在线制定、审核与发布,并可导出至EXCEL。系统可通过集成现有订单管理系统,采用定时自动或手动刷新导入生产订单及批次信息,为质量追溯贯通客户订单、生产批次以及产品编号的衔接。 进货检验信息采集

    在进货检验环节IQC需要按批次记录物料名称、物料批次、供应商名称、来料数、抽检数、抽检检验数据信息、检验的合格状态等信息,当检验发现物料不良时需要明确记录物料的不良项以及批次不良的处理结果,包括挑件、退回供方或降级使用等,当在制造过程或售后发现物料不良后可通过物料批次号快速追溯到进货检验报告、不合格处理结论以及库存量等。

    制造过程信息(5M1E)采集

    追溯过程中为了还原生产环境,挖掘产生产品质量异常的原因,需要在生产过程中采集制造过程的5M1E信息,包括人、机、料、法、环、测等,系统在采集过程中将按采集点布局进行采集,采集内容及方式如下:

    物料信息:

    在关键工序设置采集点,采集该工序产品所装配的关键物料的批次号、物料代号、供应商代号等信息。为了快速、准确的记录物料批次信息,系统将采用条码扫描技术来完成物料批次信息的记录,操作员扫描产品条码后,系统自动导入产品编号、订单号、产品型号等信息,同时扫描物料条码后,系统将自动记录物料代号、物料批次号、物料供应商代号信息与产品编号关联。系统将通过条码扫描技术快速、准确的完成供应商物料批次信息的采集。

    人员信息:

    系统设置工序与人员绑定,扫描产品条码后系统自动保存当前工序人员与时间信息;

    方法:

    记录关键工序的加工工艺、工装选择、操作规程以及相关工艺参数等;

    环境:

    记录当时工作地的温度、湿度、照明和清洁条件等;

    使用仪器设备

    制造过程检验信息采集

    制造过程检验信息为反应产品质量的关键信息,系统将在关键工序配置采集点采集检验信息,但采集过程中往往录入的工作量较大,考虑到实际应用场景,系统将采用条码扫描以及实现仪器接口等方式完成检验信息的采集。

    采集信息包含:

    半成品测试、老化测试、成品测试、出货检验、不合格品处理采集方式有:

    1:检验信息

    扫描产品号条码后,系统自动导入产品型号、订单号、批次号等信息,检验人员只需要填写数量,工序与不良设定关联,检验员只需要录入对应不良数量即可。

    2:产品关键检测数据

    可以对检测设备展开集成,通过RS232、485通讯接口自动导入检测数据,并关联产品号进行匹配保存。

    不合格品处理信息采集:

    当检验员发现不合格品时,检验人员可以在线填写不合格处理单,并由相应权限人员填写不合格品处理结论,通过在线完成不合格品的审理记录。

  • ?

    企业进入大数据信息采集时代

    庞盼秋

    展开

    做网络营销

    不论是个人还是公司都想要实现产品的渠道拓展和推广宣传

    但绝大多数的企业都不能达成想要的效果

    其实原因有很多

    一、想要做好网络营销

    客户是王道

    没有强大的客户群做后盾

    网络营销的销量不过是空想罢了

    当下客户渠道大多以网络大数据信息采集的方式来获取

    如云速数据挖掘

    通过输入行业关键字

    就能一键采集指定区域的客户信息和联系方式

    省时高效

    二、通过客户信息

    从分考虑分析目标群体的生活轨迹和习惯

    来预测客户下一步的消费行为

    以正确的时间正确的方式传达产品信息

    从而完成营销活动

    三、产品文案的策划一定要以客户需求为重点

    并且简单易懂、快速吸引客户眼球

    才能使转化率达到最佳

  • ?

    2018年最值得推荐的6款大数据采集工具

    琥珀

    展开

    数据肯定是无价的。但分析数据并非易事,因为结果越准确,成本就越高。鉴于数据急剧增长,需要一个过程来提供有意义的信息,最终变成实用的洞察力。

    数据挖掘是指这个过程:在庞大数据集当中发现模式,将它转换成有效的信息。该技术利用特定的算法、统计分析、人工智能和数据库系统,从庞大数据集中提取信息,并转换成易于理解的形式。本文介绍了广泛用于大数据行业的6种综合数据挖掘工具。

    1. Rapid Miner

    Rapid Miner是一个数据科学软件平台,为数据准备、机器学习、深度学习、文本挖掘和预测分析提供一种集成环境。它是领先的数据挖掘开源系统之一。

    该程序完全用Java编程语言编写。该程序提供了一个选项,以便用户试用大量可任意嵌套的操作符,这些操作符在XML文件中有详细说明,可由Rapid Miner的图形用户界面来构建。

    2. Oracle Data Mining

    它是Oracle高级分析数据库的代表。市场领先的公司用它最大限度地发掘数据的潜力,做出准确的预测。该系统配合强大的数据算法,锁定最佳客户。

    此外,它可识别异常情况和交叉销售机会,让用户能够根据需要运用不同的预测模型。此外,它以所需的方式定制客户画像。

    3. IBM SPSS Modeler

    说到大规模项目,IBM SPSS Modeler最适合。在这个建模器中,文本分析及其最先进的可视化界面极具价值。它有助于生成数据挖掘算法,基本上不需要编程。

    它可广泛用于异常检测、贝叶斯网络、CARMA、Cox回归以及使用多层感知器和反向传播学习的基本神经网络。

    4. KNIME

    Konstanz Information Miner是一个开源数据分析平台。你可以迅速在其中部署、扩展和熟悉数据。在商业智能界,KNIME号称是有助于为毫无经验的用户提供预测智能的平台。

    此外,数据驱动的创新系统有助于发掘数据潜力。此外,它包括数千个模块和随时可用的示例以及一大批集成的工具和算法。

    5. Python

    Python是一种免费的开源语言,因易用性常常与R相提并论。与R不同,Python学起来往往很容易上手,易于使用。许多用户发现可以在几分钟内开始构建数据,并进行极其复杂的亲和度分析。

    只要你熟悉变量、数据类型、函数、条件语句和循环等基本编程概念,最常见的业务用例数据可视化就很简单。

    6.火车采集器

    火车采集器由合肥乐维信息技术有限公司开发,是一款专业的网络数据采集/信息挖掘处理软件,通过灵活的配置,可以很轻松迅速地从网页上抓取结构化的文本、图片、文件等资源信息,可编辑筛选处理后选择发布到网站后台,各类文件或其他数据库系统中。

  • ?

    绩效考核数据收集困难繁琐,这几步让你掌握采集方法和思路

    Cyprus

    展开

    在辅导企业开展绩效考核的过程中,发现绩效数据的提供是一项工程量浩大、繁琐的工作,也是考核中最容易出问题的地方,对于考核数据到底应该由谁提供,每个企业有着不同的认知,在操作中也各有不同,因此一个规范、严谨的程序是必须建立的。

    今天在跟踪A公司绩效考评时发生了一件事引起了笔者的反思,事情的经过是这样的:人力资源部小张将各部门的考核打分表和考核数据汇总起来后,上报给分管领导审核,结果被分管领导一顿狠批,认为其中有几项考核指标的打分非常不合理,明明这个月已经接到了几个客户的投诉电话,可是现场服务的得分还是很高。小张非常的委屈,这些数据都是各个部门之间互相提供给对方的,双方也都签字确认了,人力资源部只是一个二传手,怎么可能知道数据是否准确,如果人力资源部要参与所有数据的提供和审核,那人力资源部还有什么精力去干别的?

    但是在有些企业情况恰恰相反,一到考核打分的阶段,绩效专员就忙得团团转,因为各个部门的打分都找他要数据,甚至有些企业干脆就是由人力资源部给各部门打分的。绩效专员为了给各部门搜集数据,就只能找这个要、找那个要,找谁要谁都觉得你影响了我的工作,不积极配合,或者干脆推脱没有数据、应该由别人提供等等,数据好不容易收集上来了,人力资源部还得一一的审核和反复的确认,搞得绩效专员很头大,很无奈。

    这两个现象很有意思,它们虽然是两个极端,但其实都是因为人力资源部没有梳理清楚自身在绩效管理过程中所能发挥的作用和应该履行的职责,人力资源部在整个绩效管理过程中仅承担组织者、技术支持者、信息提供者、监控者的作用,而不是亲力亲为者。一方面是因为人力资源部不可能对公司的所有业务和所有管理行为都了如指掌,另一方面也是因为各个部门自身必须对本部门的绩效负责任,而不能让人力资源部负责任。

    具体到绩效管理的各个阶段,绩效计划阶段,人力资源部负责组织各部门制定绩效计划,并将各部门的绩效计划汇总起来,审视其对公司战略目标的支撑性,相互之间的牵制性、平衡性等问题,但对具体指标和标准只能是提供建议而已。绩效实施阶段,人力资源部负责跟踪各部门绩效管理日志的记录、绩效数据的积累工作,并不能参与其绩效实施过程。绩效评估阶段,人力资源部负责组织各部门考核打分,在这个过程中,人力资源部要负责为各部门的绩效打分提供数据平台,但不应该代替各部门打分。绩效改进阶段,人力资源部要负责跟踪各部门对绩差的指标或个人制定改进计划,并跟踪改进计划的实施情况,而不能对改进的结果负责。

    其他几个方面的责任其实还是比较好界定的,大多数的企业也都能做到人力资源部和运营部门各尽其责,就在绩效数据到底由谁提供方面还存在着分歧。各部门在考核打分时,部分绩效数据必须来源于第三方,这是客观事实,也是绩效管理的要求。各部门通常既是数据的提供方,也是数据的需求方,这样就形成了纵横交错的一个网,如果不能梳理清楚,就会存在较大问题。

    如A公司在刚开始实行绩效考评时,为了减轻人力资源部的工作量,没有采用笔者提出的数据采集程序和工具,而是让数据提供方和需求方自行对接,结果第一个月考核时,发现几乎没有一个部门有扣分或加分现象。究其原因,各部门有的是并没有找其他部门要数据,有的是去要了,对方没给,反正都是应付着打的分。因此第二个月考核时,人力资源部要求各部门在考核时,必须让数据提供部门在考核表上签字确认,这样情况确实好多了,基本真实反映了各部门的实际工作情况,但是繁琐的程序让各部门抱怨不断,对绩效考核的配合度也一直不高。

    而另外一家公司就是相反的情况,有些考核指标是需要在各部门提供的数据基础上进行进一步计算的,例如成本降低额,是需要将当月的各产品成本按照不变价重新核算后与公司核定的标准成本进行比较,而财务部仅提供根据当月市场价格结算的成本,人力资源部必须根据不变价重新计算,造成了大量的工作量,并且被考核部门也总是在质疑人力资源部考核打分的合理性。

    这两家公司我们都建议他们实施绩效数据的统一采集、集中审核流程,具体操作方式分为以下几步:

    1、人力资源部在组织各部门建立考核指标时,就要求各部门明确其数据的来源部门,如果数据来源不明的,由人力资源部组织相关部门共同讨论确定。

    2、人力资源部编制《绩效考核数据一览表》,按部门分类,将各个部门应该提供给其他部门的数据列示清楚,包括需求岗位、考核指标、指标说明、计算公式等,要求各部门分析提供的可能性后签字确认。

    3、人力资源部根据考核周期收集各部门的《绩效考核数据一览表》,并根据重要程度排序,分别上报至相应的分管领导处审核,并采集部分来源自高层的考核信息,如客户的抱怨、各种分析报告的质量等。

    4、人力资源部将审核汇总后的考核数据重新整理,按照数据需求部门分类反馈。

    在上述流程中,人力资源部统一采集汇总数据,避免了各部门交叉提供数据的混乱和遗漏;分管领导对数据的审核,确保了数据的准确和高层信息的及时补充,提高了考核质量和效率;人力资源部统一将数据反馈给各部门,确保了各部门数据来源的客观和可信,简化了后续审核。

    大家有好的想法,欢迎在评论区给我留言

  • ?

    数据采集过程中的常见问题

    李听兰

    展开

    经过两周的整理总结,沉淀出来好多数据采集的经验与大家分享。

    前嗅免费模板共享链接:http://forenose/help/collection/template/cases.html

    1.如何进行数据采集?

    ①下载安装软件后,登录到软件上。

    ②准备好模板:在前嗅的官网上下载免费的模板或自己配置好的模板

    ③将下载的官网导入到软件中。

    点击文件---点击导入采集文件(将采集文件导入,自己配置的模板请忽略这一步)

    ④在数据建表中建关联数据表

    选中需要采集模板下的表单---点击创建关联数据表,所创表名不能为汉字,点击确定---在所创数据表前的方框打勾即可关联数据表。详情见下图。

    此时在数据浏览中就存在了刚刚建的关联数据表。

    ⑤进行数据采集。

    在需要进行数据采集的模板前打勾--点击允许采集--点击开始按钮即可进行数据采集。详情见下图。

    ⑥数据预览及导出

    选中关联表---点击刷新按钮即可查看数据---点击导出按钮即可导出数据。详情见下图。

    多种导出方式:

    a.可以将采集到的数据全部导出。

    b.可以将数据分割导出,设置特定数目后数据会分别储存放在文件夹中。

    c.可以将每个字段所采集到的内容分别导出到不同文件夹,方便查看。

    数据导出教程:

    http://forenose/help/guildbook/crawler_new/5-2.html

    2.所采集的网站弹验证码是怎么回事?

    弹验证码分为四种情况:

    ①登录需要验证码:登录时只需要一个验证码,所以直接手动填写配置即可。

    ②多账号登录:每次账号登录都需要验证码,此时应该接第三方打码平台。

    前嗅(forenose)是首个深度大数据专家。

    提供数据采集-分析-处理-管理-营销-应用,自主知识产权的全套大数据产品 。

  • ?

    如何采集招投标类网站数据

    吉怜蕾

    展开

    网上有很多公布招投标信息的网站,招标公告中的信息是有很大的价值的。比如你想了解一个公司的资质,你想了解一个项目的投资资金,你想知道招投标公司之间的关系,这些都能从招投标信息中分析出来,数据是分析的基础,只有获得大量数据,分析才更准确更有说服力。今天教大家如何采集招投标类网站的数据。

    示例网站:http://tjconstruct/zbxx.aspx?type=sjzb

    一.首先打开ForeSpider数据采集软件,点击“采集频道列表”的“+”符号,创建新的频道。然后在采集地址处把准备采集网站的网址粘贴进去。

    频道配置

    二.频道入口地址配置好以后,点击“模板配置”,在右侧模板一处新建一个链接抽取,两个链接抽取,分别起名为“翻页”和“工程抽取”。这两个链接抽取分别抽取页面内的工程项目和翻页链接。

    添加链接抽取

    三.点击采集预览,发现采集预览中没有我想要的项目工程的链接,但是有翻页的链接,那就需要写脚本来抽取工程链接。翻页链接抽取可以通过可视化的操作完成。以前说过链接抽取的脚本如何写,这里就不多介绍了。

    链接抽取教程:http://toutiao/i6454813216395493902/

    链接抽取脚本

    四.通过预览发现每一个翻页链接地址中都包含“page=”这个词,那我将这个词放在“翻页”的地址过滤中,将过滤规则选择为“包含”。

    翻页地址过滤

    链接抽取配置好,可以点击采集预览看一下效果,如果配置的有问题可以及时改正。

    预览效果

    五.可以看到预览效果没有问题,那继续配置下一层模板。下一层为招标公告页,也就是数据页。先建好表单字段,在表单名称处选择建好的表单。

    选择表单

    六.数据页中有一部分字段使用可视化的操作就能完成,有一部分需要脚本,所以我就把需要写脚本的部分分别写在了字段下。字段处理选择“脚本处理”。

    字段下脚本处理

    八.全部字段配置好以后,可以先点击采集预览,看一下效果,如果效果不好可以改正。

    招投标类网站都是实时更新的,ForeSpider数据采集软件有增量采集的功能,可以采集新增数据,长时间时时监控网站新增数据。

    虽然教程看起来简单,最重要的还是多亲自上手实践。多多实践才能更熟练的使用软件采集自己想要的数据。

  • ?

    APP数据采集是怎么实现的

    纯净

    展开

    最近半年,我们八爪鱼陆续接到好几个APP数据采集的项目需求,我在群里面,偶尔也看到有些用户在问,有没有APP数据采集的工具。鉴于我们做过的几个APP数据采集项目的经验,我可以告诉大家,现在APP数据采集,市面上还没有通用的工具。我们八爪鱼内部是有一套工具,但由于使用的难度较高,需要编写脚本,所以不对普通用户公开,我们仅接受项目定制。

    虽然不对外公开,但并不妨碍我们将技术分享出来,APP数据采集,一般走以下两种方式:

    1.两种思路

    1. 抓包

    2. HOOK

    2.抓包

    有代码经验或APP开发的同学都很容易理解,其实很多APP,走的都是webservice通讯协议的方式,并且由于是公开数据,而且大部分是无加密的。所以只要对网络端口进行监测,对APP进行模拟操作,即可知道APP里面的数据是如何获取的。

    我们只需要写代码模拟请求,无论POST还是GET,即可得到该请求所返回的信息。再通过对返回的信息结构化解析,即可得到我们想要的数据。

    public static void main(String[] args) {

    Spider.create(new GithubRepoPageProcessor())

    //从https://github/****开始抓

    .addUrl("https://github/****")

    //设置Scheduler,使用Redis来管理URL队列

    .setScheduler(new RedisScheduler("localhost"))

    //设置Pipeline,将结果以json方式保存到文件

    .addPipeline(new JsonFilePipeline("D:\\data\\webmagic"))

    //开启5个线程同时执行

    .thread(5)

    //启动爬虫

    .run();

    }

    以模拟采集“meizu”应用市场为例

    应用市场产品

    抓包返回参数

    整个抓包过程

    3.HOOK技术

    HOOK技术是一种走操作系统内核的技术,由于安卓系统是开源的,所以可以借助一些框架修改内核,从而实现你要的功能。HOOK的形式,我们走的是Xposed框架。Xposed是一款可以在不修改任何其他开发者开发的应用(包括系统服务)的情况下,改变程序运行的一个开源框架服务。基于它可以制作出许多功能强大的模块,以此来达到应用程序按照你的意愿运行的目的。

    如果把安卓手机看做一座城堡,那Xposed可以让你拥有一个上帝视角,城里的运作细节尽收你眼底,还能让你插一手改变城堡的运作规律。

    什么意思呢?简单的说就是你可以通过他,自动化的控制你的APP。如果将我们的APP开在模拟器上,我们可以通过编码,通过他告诉APP这一步干什么,下一步干什么。你把它理解成类似游戏打怪外挂就可以了。

    而他每走一步,APP与服务端交互的数据,均可获取下来。这种方式广泛用于一些成熟的APP。比如某信采集。

    public class HookActivity implements IXposedHookLoadPackage {

    @Override

    public void handleLoadPackage(LoadPackageParam lpparam) throws Throwable {

    final String packageName = lpparam.packageName;

    XposedBridge.log("--------------------: " + packageName);

    try {

    XposedBridge.hookAllMethods

    (Activity.class, "onCreate", new XC_MethodHook() {

    @Override

    protected void afterHookedMethod(MethodHookParam param)

    throws Throwable {

    XposedBridge.log("=== Activity onCreate: " + param.thisObject);

    }

    });

    } catch (Throwable error) {

    XposedBridge.log("xxxxxxxxxxxx: " + error);

    }

    }

    }

    其实我们八爪鱼曾经也想开发一款通用的APP数据采集工具,并且两年前在这块投入研究了小半年,我们做出了一款APP采集脚本编辑工具,可以让一款APP的数据采集项目缩减到3-5天即可开发完成。但我们认为,这个工具需要编写脚本一般用户是比较难上手的,所以仅作为内部项目使用。

    以HOOK某APP为例:

    HOOK指令打开某

    4.这些年走过的坑

    聊完APP采集的思路,我们跟大家分享一些遇过的坑吧,让大家乐一乐

    坑一:签名算法

    以某信的文章列表页及某信息页为例,对其http访问进行抓包,会发现其url的一个核心参数是我们无法知道如何生成的,这就导致,我们不可能直接用该url进行信息爬取;签名算法如果无法破解,HTTP这条路就是死路了。

    坑二:http爬取回来的信息和页面显示不一致

    以某信的某信息页为例,对比直接访问某信页面及http爬取的信息,可明显发现http爬取到的信息较少。造成得两种方式都用,才能既照顾速度又照顾完整性。

    坑三:模拟器中的坑

    APP自动识别你的运行环境进行屏蔽,最厉害的还是某信,连你是用模拟器打开还是真机打开,是什么内核的,全部进行限制。曾经见过牛人,找某手机厂商专门定做真机来配合。

    坑四:帐号的坑

    这个坑就有点大了,要找号、养号,都不是件容易的事情,更惨的是封号,真真让你一夜回到解放前。

  • ?

    干货丨大数据是如何被采集及应用的

    落年

    展开

    尽管“大数据”一词近年来屡遭热捧

    但很多人都还不知道什么是大数据

    更不知道大数据有甚卵用

    这两年,发现“大数据”这个词出现的越来越频繁了

    不仅企业,连国家都在部署大数据战略

    一番百度了之后

    Oh~ emmmmmmmmm~ +_+

    还是没搞懂大数据到底是个什么玩意儿

    直到有一天

    我发现一个秘密

    不管我在网上搜索什么

    页面都会跳出我要搜索的相关产品或关联事物

    然后,我恍然大悟!

    所谓大数据,就是算法!

    它能够“算”出我们“心中所想”

    那么问题来了

    大数据技术是如何采集到我们的信息的呢?

    数据采集,又称数据获取,是利用一种装置,从系统外部采集数据并输入到系统内部的一个接口。在互联网行业快速发展的今天,数据采集已经被广泛应用于互联网及分布式领域,比如摄像头,麦克风,都是数据采集工具。

    数据采集系统整合了信号、传感器、激励器、信号调理、数据采集设备和应用软件。在数据大爆炸的互联网时代,数据的类型也是复杂多样的,包括结构化数据、半结构化数据、非结构化数据。结构化最常见,就是具有模式的数据。非结构化数据是数据结构不规则或不完整,没有预定义的数据模型,包括所有格式的办公文档、文本、图片、XML, HTML、各类报表、图像和音频/视频信息等等。大数据采集,是大数据分析的入口,所以是相当重要的一个环节。

    我们首先来了解一下数据采集的三大要点:

    一、数据采集的三大要点

    (1)全面性

    数据量足够具有分析价值、数据面足够支撑分析需求。

    比如对于“查看商品详情”这一行为,需要采集用户触发时的环境信息、会话、以及背后的用户id,最后需要统计这一行为在某一时段触发的人数、次数、人均次数、活跃比等。

    (2)多维性

    数据更重要的是能满足分析需求。灵活、快速自定义数据的多种属性和不同类型,从而满足不同的分析目标。

    比如“查看商品详情”这一行为,通过埋点,我们才能知道用户查看的商品是什么、价格、类型、商品id等多个属性。从而知道用户看过哪些商品、什么类型的商品被查看的多、某一个商品被查看了多少次。而不仅仅是知道用户进入了商品详情页。

    (3)高效性

    高效性包含技术执行的高效性、团队内部成员协同的高效性以及数据分析需求和目标实现的高效性。也就是说采集数据一定要明确采集目的,带着问题搜集信息,使信息采集更高效、更有针对性。此外,还要考虑数据的及时性。

    不同应用领域的大数据其特点、数据量、用户群体均不相同。不同领域根据数据源的物理性质及数据分析的目标采取不同的数据采集方法。

    那么,接下来我们再来了解一下常用的数据采集的方法。

    常用的数据采集方法归结为以下三类:传感器、日志文件、网络爬虫。

    (1)传感器

    传感器通常用于测量物理变量,一般包括声音、温湿度、距离、电流等,将测量值转化为数字信号,传送到数据采集点,让物体有了触觉、味觉和嗅觉等感官,让物体慢慢变得活了起来。

    (2)系统日志采集方法

    日志文件数据一般由数据源系统产生,用于记录数据源的执行的各种操作活动,比如网络监控的流量管理、金融应用的股票记账和 web 服务器记录的用户访问行为。

    很多互联网企业都有自己的海量数据采集工具,多用于系统日志采集,如Hadoop的Chukwa,Cloudera的Flume,Facebook的Scribe等,这些工具均采用分布式架构,能满足每秒数百MB的日志数据采集和传输需求。

    (3)Web 爬虫

    网络爬虫是指为搜索引擎下载并存储网页的程序,它是搜索引擎和 web 缓存的主要的数据采集方式。通过网络爬虫或网站公开API等方式从网站上获取数据信息。该方法可以将非结构化数据从网页中抽取出来,将其存储为统一的本地数据文件,并以结构化的方式存储。它支持图片、音频、视频等文件或附件的采集,附件与正文可以自动关联。

    此外,对于企业生产经营数据上的客户数据,财务数据等保密性要求较高的数据,可以通过与数据技术服务商合作,使用特定系统接口等相关方式采集数据。比如八度云计算的数企BDSaaS,无论是数据采集技术、BI数据分析,还是数据的安全性和保密性,都做的很好。

    数据的采集是挖掘数据价值的第一步,当数据量越来越大时,可提取出来的有用数据必然也就更多。只要善用数据化处理平台,便能够保证数据分析结果的有效性,助力企业实现数据驱动。

数据如何采集

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP