- ?
绩效考核数据收集困难繁琐,这几步让你掌握采集方法和思路
钱乾
展开
在辅导企业开展绩效考核的过程中,发现绩效数据的提供是一项工程量浩大、繁琐的工作,也是考核中最容易出问题的地方,对于考核数据到底应该由谁提供,每个企业有着不同的认知,在操作中也各有不同,因此一个规范、严谨的程序是必须建立的。
今天在跟踪A公司绩效考评时发生了一件事引起了笔者的反思,事情的经过是这样的:人力资源部小张将各部门的考核打分表和考核数据汇总起来后,上报给分管领导审核,结果被分管领导一顿狠批,认为其中有几项考核指标的打分非常不合理,明明这个月已经接到了几个客户的投诉电话,可是现场服务的得分还是很高。小张非常的委屈,这些数据都是各个部门之间互相提供给对方的,双方也都签字确认了,人力资源部只是一个二传手,怎么可能知道数据是否准确,如果人力资源部要参与所有数据的提供和审核,那人力资源部还有什么精力去干别的?
但是在有些企业情况恰恰相反,一到考核打分的阶段,绩效专员就忙得团团转,因为各个部门的打分都找他要数据,甚至有些企业干脆就是由人力资源部给各部门打分的。绩效专员为了给各部门搜集数据,就只能找这个要、找那个要,找谁要谁都觉得你影响了我的工作,不积极配合,或者干脆推脱没有数据、应该由别人提供等等,数据好不容易收集上来了,人力资源部还得一一的审核和反复的确认,搞得绩效专员很头大,很无奈。
这两个现象很有意思,它们虽然是两个极端,但其实都是因为人力资源部没有梳理清楚自身在绩效管理过程中所能发挥的作用和应该履行的职责,人力资源部在整个绩效管理过程中仅承担组织者、技术支持者、信息提供者、监控者的作用,而不是亲力亲为者。一方面是因为人力资源部不可能对公司的所有业务和所有管理行为都了如指掌,另一方面也是因为各个部门自身必须对本部门的绩效负责任,而不能让人力资源部负责任。
具体到绩效管理的各个阶段,绩效计划阶段,人力资源部负责组织各部门制定绩效计划,并将各部门的绩效计划汇总起来,审视其对公司战略目标的支撑性,相互之间的牵制性、平衡性等问题,但对具体指标和标准只能是提供建议而已。绩效实施阶段,人力资源部负责跟踪各部门绩效管理日志的记录、绩效数据的积累工作,并不能参与其绩效实施过程。绩效评估阶段,人力资源部负责组织各部门考核打分,在这个过程中,人力资源部要负责为各部门的绩效打分提供数据平台,但不应该代替各部门打分。绩效改进阶段,人力资源部要负责跟踪各部门对绩差的指标或个人制定改进计划,并跟踪改进计划的实施情况,而不能对改进的结果负责。
其他几个方面的责任其实还是比较好界定的,大多数的企业也都能做到人力资源部和运营部门各尽其责,就在绩效数据到底由谁提供方面还存在着分歧。各部门在考核打分时,部分绩效数据必须来源于第三方,这是客观事实,也是绩效管理的要求。各部门通常既是数据的提供方,也是数据的需求方,这样就形成了纵横交错的一个网,如果不能梳理清楚,就会存在较大问题。
如A公司在刚开始实行绩效考评时,为了减轻人力资源部的工作量,没有采用笔者提出的数据采集程序和工具,而是让数据提供方和需求方自行对接,结果第一个月考核时,发现几乎没有一个部门有扣分或加分现象。究其原因,各部门有的是并没有找其他部门要数据,有的是去要了,对方没给,反正都是应付着打的分。因此第二个月考核时,人力资源部要求各部门在考核时,必须让数据提供部门在考核表上签字确认,这样情况确实好多了,基本真实反映了各部门的实际工作情况,但是繁琐的程序让各部门抱怨不断,对绩效考核的配合度也一直不高。
而另外一家公司就是相反的情况,有些考核指标是需要在各部门提供的数据基础上进行进一步计算的,例如成本降低额,是需要将当月的各产品成本按照不变价重新核算后与公司核定的标准成本进行比较,而财务部仅提供根据当月市场价格结算的成本,人力资源部必须根据不变价重新计算,造成了大量的工作量,并且被考核部门也总是在质疑人力资源部考核打分的合理性。
这两家公司我们都建议他们实施绩效数据的统一采集、集中审核流程,具体操作方式分为以下几步:
1、人力资源部在组织各部门建立考核指标时,就要求各部门明确其数据的来源部门,如果数据来源不明的,由人力资源部组织相关部门共同讨论确定。
2、人力资源部编制《绩效考核数据一览表》,按部门分类,将各个部门应该提供给其他部门的数据列示清楚,包括需求岗位、考核指标、指标说明、计算公式等,要求各部门分析提供的可能性后签字确认。
3、人力资源部根据考核周期收集各部门的《绩效考核数据一览表》,并根据重要程度排序,分别上报至相应的分管领导处审核,并采集部分来源自高层的考核信息,如客户的抱怨、各种分析报告的质量等。
4、人力资源部将审核汇总后的考核数据重新整理,按照数据需求部门分类反馈。
在上述流程中,人力资源部统一采集汇总数据,避免了各部门交叉提供数据的混乱和遗漏;分管领导对数据的审核,确保了数据的准确和高层信息的及时补充,提高了考核质量和效率;人力资源部统一将数据反馈给各部门,确保了各部门数据来源的客观和可信,简化了后续审核。
大家有好的想法,欢迎在评论区给我留言
- ?
我们怎样获取监控数据?
霸王龙
展开
在百度云Noah智能监控产品中,我们提供了多维度数据聚合计算、智能异常检测、数据可视化、智能报警合并、逐级通告等丰富功能。今天,我们追根溯源,讲讲所有这些能力的基础:数据的来源和监控数据采集(入门篇)。
不同业务场景下都有着不同的监控需求,比如服务器的运行时信息、服务进程信息、日志信息、网络状态信息以及服务状态信息等。与之对应的,数据采集也需要提供丰富的采集方式来满足这些需求,一般,针对应用场景的不同,可分别通过本地客户端采集和远程服务采集的方式来实现。
图1 监控平台架构简化图
本地客户端采集主要负责服务器自身的信息采集以及服务器上运行程序的信息采集,远程服务采集则通过远程发起探测的方式进行域名监控、网络监控、死机探测等,本文也将从这几个方面来阐述。当然,除此之外,还有更高级的数据采集方式,暂不在本文(入门篇)讨论范畴内。
本地客户端采集
本地客户端采集提供基础的机器信息采集和用户服务信息采集。机器信息采集主要关注机器硬件信息、机器资源使用、机器负载情况等。服务信息采集则通过插件的形式提供服务,包括进程采集、日志采集、自定义脚本采集、自定义HTTP采集等。
图2 本地客户端架构图
机器数据采集
服务器信息采集我们可提供数百个监控指标,其中大家常用的如CPU、内存、磁盘、网络等指标,一般要提供高频度的采集,比如Noah监控提供了最细粒度5秒采集频率,采集延时小于1秒的采集能力;对于系统内核等信息,由于不常变化,一般会使用小时级或天级的采集频率。主要指标如下表:
服务数据采集
1.进程采集
服务进程信息采集,最简单粗暴的指标莫过于采集进程是否存活,另外,就要通过进程的资源消耗来一窥服务运行状态。关于进程采集,我们提供了CPU使用、内存使用、FD使用信息、磁盘IO读写信息近30个监控指标,大多数信息都可以从/proc/${pid}/下的各个文件获取并计算得到。
在采集客户端设计研发的过程中,我们发现,很多场景下FD资源会成为一个紧缺资源,因此,部署到所有机器的采集客户端,对于机器资源占用都有着比较严格的要求,通常FD数量占用也不宜过高,避免影响机器其他服务的运行。所以,对于进程的FD使用监控显得尤为重要,为了进一步了解服务使用的FD信息,我们还提供了块设备FD数、字符设备FD数、管道FD数、网络FD数、文件FD数、FD总数、FD上限的监控。
图3 进程采集的数据
图4 进程FD监控
2.日志采集
服务的运行状况通常可以通过打印日志方式来记录,业务的指标也可以通过分析这些日志得到。比如服务流量指标、异常请求指标、响应时间指标等都是服务的重要业务指标,通过客户端提供的日志采集插件可以统统满足。
对于基本的流量指标,我们可以用正则匹配等较简单的方式来进行采集,当然还有很多复杂的需求。需要进行多维度数据分析或故障诊断的时候,就需要提供高级版的功能。通过提取日志中的具体字段构成数据的维度信息,从多维度的角度来计算、查看、分析这份数据。
简单的多维度日志数据采集举例:一个最典型的多维度日志数据采集的例子,就是通过提取日志中请求来源IP,来生成各地域、运营商等的流量信息。
通过提取日志中的IP字段,并进一步反解该IP所属的省份、运营商信息,便于直观的统计来源请求。当然,要支持海外流量的统计需求,还需要监控系统支持海外的IP国家归属信息查询。
如下图所示,我们可以将日志中各个字段的值进行提取,如关注的URI字段、IDC字段、IP字段等,进一步,还以可将某些字段进行二次解析,例如,将IP字段所属的省份运营商进行解析。
图5 日志维度提取
再进一步,我们将数据按照提取的维度进行聚合,可以查看机房维度的流量信息。
3.自定义采集
为了应对某些定制化的场景,比如服务的指标并不在日志中体现,那么我们还提供了一些常见自定义采集插件来满足业务需求。包括通过自定义脚本进行数据的采集,以及服务提供的HTTP接口进行数据采集。
比如服务的某些信息不适合通过日志的方式采集,那么此时便可以通过自定义脚本或者HTTP接口的形式将该数据吐出来,通过配置自定义监控来采集这些数据,之后可以方便查看数据、后续的聚合计算以及报警配置等。
一种简单的自定义脚本输出形式:
图6 自定义脚本输出
对应的监控输出如下:
图7 自定义脚本监控
远程服务采集
服务监控
远程探测的形式是从监控机向用户机器发起探测请求,并校验返回的结果,根据结果来判断服务是否正常。根据请求内容的类型我们主要提供以下三种功能:
1.端口监控:探测目标端口是否存活。
2.语义监控:发送请求到目标机器,校验返回的数据是否符合预期,支持各种文本类型的协议,如HTTP/HTTPS。
3.结构体监控:对于二进制等文本形式难以描述的服务接口,则通过结构体监控来解决二进制内容的监控。
死机检测
机器故障或者死机是线上的一个常见问题 ,死机检测功能则可以帮助用户及时发现故障机器,进行服务的迁移或者降级来保障服务可用性。死机检测往往很难通过单一手段来判断,这里,我们通过分别检测本地客户端的存活状况、SSH等常用端口来判断机器是否故障以及故障的类型。
总结
本文主要介绍了百度云Noah智能监控中的数据采集(入门篇),数据采集需要针对不同的应用场景,通过不同的方式进行采集。基础的数据采集,可以通过部署本地客户端和远程服务采集两种方式来完成。通用化的服务器信息、进程信息等,可以通过预置方式进行采集,无需用户操心或干预。而针对不同业务的个性化情况,则提供灵活的插件形式进行采集,由用户来灵活配置采集的形式,满足定制化的需求。
- ?
数据采集做不好,何谈大数据!
酆灵松
展开
在数字经济时代,未来每个企业都可能是数字企业。数字企业则必须有自己完整的大数据体系。上期小编邀请数据大牛为大家解析了大数据底层架构(资深数据大牛深度解析:大数据底层架构!),而今天我们介绍的,便是每个企业大数据体系中最基础和最根本的部分——数据采集。
数据采集是一切有效分析的前提。如:数据接入;数据传输;数据建模/存储;数据查询;数据可视化等。总体上可以将企业大数据体系分成:
采集与存储平台:主要职责是对企业的相关大数据进行收集,并将收集到的数据进行存储。以便与企业管理及运用,同时也是未来数字企业的最重要资产之一。
分析与挖掘平台:主要职责是对企业采集到的数据进行专门的分析、BI等,以及在此基础上进一步的数据挖掘、人工智能等。
洞察与决策平台:主要职责是利用大数据分析的结果,通过自动加人工双重决策,更高效的运用到产品,业务,商业等环节以及相应的行动等。
覆盖全局数据安全平台:主要职责是负责确保数据的安全性,保证企业的数据资产不受到损害,例如数据不丢失、不损坏、不被窃、不被改等。
数据采集与存储平台将占据非常重要的位置。将来自各种数据源的原始大数据采集、分析、存储等。通常中小企业也可以不用自己拥有专门的大数据分析与挖掘平台,选择与相对专业的企业合作。
面对来源各异、以结构化/半结构化为主的数据,拍拍信使用linkedin开源的camus来采集消息类数据,使用kettle来采集RMDB的数据,具有以下优势:
1提高采集效率,降低工程成本;
2支持Web、iOS、Android、HTML等多种平台;
3采集全面属性、维度、指标等,使数据资源更优质;
4建立预测模型,实时智能监控、分析、预测用户行为;
5支持代码埋点,和全(无)埋点,按需选择,灵活运用。
采集方案:客户端(前端);服务器日志;业务数据库;历史数据;第三方数据等。
数据采集与存储平台一般也可以分为三个层次,即数据采集层、预处理层和存储层。同时,大数据采集平台还需要一个覆盖全局的数据安全体系。
采集层负责采集企业各种来源的大数据;预处理层负责对采集回来的数据进行一些规范化的处理;存储层则是将预处理后的大数据进行存储,将企业大数据资产用一种方式保存起来。数据安全体系即数据安全平台。值得注意的是,当存储技术足够好、存储设备成本足够低容量足够大时,预处理层或可以选择忽略。
本期对大数据采集的分享就到这里啦,欢迎大家联系探讨。
(小编的鸡腿就靠各位老板啦(づ ̄ 3 ̄)づ)
感谢您对拍拍信的认可与支持
我们一直在路上
- ?
让您了解大数据采集最新技术
赖盈
展开
现在谈论大数据已经没有新意了,形形色色的产品、平台和公司都贴满大数据标签,但大数据却并没有掀起预期飓风,甚至还被冠以“伪命题”污名。
大数据开启了一个大规模生产、分享和应用数据的时代,它给技术和商业带来了巨大的变化。大数据在核心领域的渗透速度有目共睹,然而调查显示,未被使用的信息比例高达99.4%,很大程度都是由于高价值的信息无法获取采集。
因此在大数据时代背景下,如何从大数据中采集出有用的信息已经是大数据发展的关键因素之一,数据采集才是大数据产业的基石。那么什么是大数据采集技术呢?
什么是数据采集?
数据采集(DAQ), 又称数据获取,是指从传感器和其它待测设备等模拟和数字被测单元中自动采集信息的过程。数据分类新一代数据体系中,将传统数据体系中没有考虑过的新数据源进行归纳与分类,可将其分为线上行为数据与内容数据两大类。
线上行为数据:页面数据、交互数据、表单数据、会话数据等。
内容数据:应用日志、电子文档、机器数据、语音数据、社交媒体数据等。
大数据的主要来源:1)商业数据 2)互联网数据 3)传感器数据
传统数据采集的不足
传统的数据采集来源单一,且存储、管理和分析数据量也相对较小,大多采用关系型数据库和并行数据仓库即可处理。对依靠并行计算提升数据处理速度方面而言,传统的并行数据库技术追求高度一致性和容错性,根据CAP理论,难以保证其可用性和扩展性。
大数据采集新的方法
以博为软件101异构数据采集技术为例:通过获取软件系统的底层数据交换、软件客户端和数据库之间的网络流量包,基于底层IO请求与网络分析等技术,采集目标软件产生的所有数据,将数据转换与重新结构化,输出到新的数据库,供软件系统调用。
博为软件技术特点如下:
1. 无需原软件厂商配合;
2. 实时数据采集,数据端到端的响应速度达秒级;
3. 兼容性强,可采集汇聚Windows平台各种软件系统数据;
4. 输出结构化数据,作为数据挖掘、大数据分析应用的基础;
5. 自动建立数据间关联,实施周期短、简单高效;
6. 支持自动导入历史数据,通过I/O人工智能自动将数据写入目标软件;
7. 配置简单、实施周期短。
优点:其优势在于不需要“接口”配合,这就摆脱了对软件厂商的依赖。特别是在在需要集成多个系统数据时,不仅能节省大量时间、人力与资金,实现“一站式”完成;还避免了因个别系统开发团队解体、源代码丢失等原因导致系统数据集成出现烂尾的情况。
缺点:只采集Windows平台的各软件系统数据
版权声明:本文部分来自网络,如有侵权,请联系删除!
- ?
如何采集链家网二手房成交数据?
鄂惜芹
展开
首先我们看一个城市的成交页面:https://sh.lianjia/chengjiao/pg2/
拥有非常多的条件组合,同时最大显示页数为100页,如果希望获取100页之外的,那就只能拆分搜索条件了。
知道了条件组合 以及最大页数之后,那么问题来了,上面如果希望查看详情的话就需要下载APP,那么APP是必须下载的吗?
通过查看html源码可以发现,房屋的图片 有详情页的链接,从而可以避免下载APP了。
采集程序的大致思路就出来了,
首先是整理条件组合,区域+面积+房型差不多就够用了
其次是采集列表
最后是采集详情。
那么在采集之前,首先是先建立好数据库表结构,如下:
两个经纬度这块是我们自己添加的。网页中显示的是百度经纬度。
之后就开始写代码了,参考链接:https://qianjieyun/new_14CAC3214C8272F32708BA0B2098912C.html
- ?
学会使用PowerBI/Excel批量采集网页数据
佘温
展开
前面介绍PowerBI数据获取的时候,曾举了一个从网页中获取数据的例子,但当时只是爬取了其中一页数据,这篇文章来介绍如何用PowerBI批量采集多个网页的数据。
本文以智联招聘网站为例,采集工作地点在上海的职位发布信息。
下面是详细操作步骤:
(一)分析网址结构
打开智联招聘网站,搜索工作地点在上海的数据,
下拉页面到最下面,找到显示页码的地方,点击前三页,网址分别如下,
http://sou.zhaopin/jobs/searchresult.ashx?jl=%e4%b8%8a%e6%b5%b7&sm=0&sg=fe782ca83bfa4b018d27de559d0a5db0&p=1http://sou.zhaopin/jobs/searchresult.ashx?jl=%e4%b8%8a%e6%b5%b7&sm=0&sg=fe782ca83bfa4b018d27de559d0a5db0&p=2http://sou.zhaopin/jobs/searchresult.ashx?jl=%e4%b8%8a%e6%b5%b7&sm=0&sg=fe782ca83bfa4b018d27de559d0a5db0&p=3
可以看出最后一个数字就是页码的ID,是控制分页数据的变量。
(二)使用PowerBI采集第一页的数据
打开PowerBI Desktop,从网页获取数据,从弹出的窗口中选择【高级】,根据上面分析的网址结构,把除了最后一个页码ID的网址输入第一行,页码输入第二行,
从URL预览中可以看出,已经自动把上面两行的网址合并到一起;这里分开输入只是为了后面更清晰的区分页码变量,其实直接输入全网址也是一样可以操作的。
(如果页码变量不是最后一位,而是在中间,应该分三行输入网址)
点击确定后,发现出来很多表,
从这里可以看出,智联招聘网站上每一条招聘信息都是一个表格,不用管它,任意选择一个表格,比如勾选Table0,点击编辑进入Power Query编辑器。
在PQ编辑器中直接删除掉【源】之后的所有步骤,然后展开数据,并把前面没有的几列数据删除。
这样第一页的数据就采集过来了。然后对这一页的数据进行整理,删除掉无用信息,添加字段名,可以看出一页包含60条招聘信息。
这里整理好第一页数据以后,下面进行采集其他页面时,数据结构都会和第一页整理后的数据结构一致,采集的数据可以直接拿来用;这里不整理也没关系,可以等到采集所有网页数据后一起整理。
如果要大批量的抓取网页数据,为了节省时间,对第一页的数据可以先不整理,直接进入下一步。
(三)根据页码参数设置自定义函数
这是最重要的一步。
还是刚才第一页数据的PQ编辑器窗口,打开【高级编辑器】,在let前输入:
(p as number) as table =>
并把let后面第一行的网址中,&后面的"1"改为(这就是第二步使用高级选项分两行输入网址的好处):
(Number.ToText(p))
更改后【源】的网址变为:
"http://sou.zhaopin/jobs/searchresult.ashx?jl=%e4%b8%8a%e6%b5%b7&sm=0&sg=fe782ca83bfa4b018d27de559d0a5db0&p="&(Number.ToText(p)))),
确定以后,刚才第一页数据的查询窗口直接变成了自定义函数的输入参数窗口,Table0表格也变成了函数的样式。为了更直观,把这个函数重命名为Data_Zhaopin.
到这里自定义函数完成,p是该函数的变量,用来控制页码,随便输入一个数字,比如7,将抓取第7页的数据,
输入参数只能一次抓取一个网页,要想批量抓取,还需要下面这一步。
(四)批量调用自定义函数
首先使用空查询建立一个数字序列,如果想抓取前100页的数据,就建立从1到100的序列,在空查询中输入
={1..100}
回车就生成了从1到100的序列,然后转为表格。gif操作图如下:
然后调用自定义函数,
在弹出的窗口中点击【功能查询】下拉框,选择刚才建立的自定义函数Data_Zhaopin,其他都按默认就行,
点击确定,就开始批量抓取网页了,因为100页数据比较多,耗时5分钟左右,这也是我第二步提前数据整理造成的后果,导致抓取比较慢。展开这一个表格,就是这100页的数据,
至此,批量抓取智联招聘100页的信息完成,上面的步骤看起来很多,实际上熟练掌握以后,10分钟左右就可以搞定,最大块的时间还是最后一步进行抓取数据的过程比较耗时。
网页的数据是不断更新的,在操作完以上的步骤之后,在PQ中点击刷新,可以随时一键提取网站实时的数据,一次做好,终生受益!
以上主要使用的是PowerBI中的Power Query功能,在可以使用PQ功能的Excel中也是可以同样操作的。
当然PowerBI并不是专业的爬取工具,如果网页比较复杂或者有防爬机制,还是得用专业的工具,比如R或者Python。在用PowerBI批量抓取某网站数据之前,先尝试着采集一页试试,如果可以采集到,再使用以上的步骤,如果采集不到,就不用再耽误工夫了。
现在就打开PowerBI/,尝试着抓取你感兴趣的网站数据吧。
- ?
如何采集招投标类网站数据
纪天蓝
展开
网上有很多公布招投标信息的网站,招标公告中的信息是有很大的价值的。比如你想了解一个公司的资质,你想了解一个项目的投资资金,你想知道招投标公司之间的关系,这些都能从招投标信息中分析出来,数据是分析的基础,只有获得大量数据,分析才更准确更有说服力。今天教大家如何采集招投标类网站的数据。
示例网站:http://tjconstruct/zbxx.aspx?type=sjzb
一.首先打开ForeSpider数据采集软件,点击“采集频道列表”的“+”符号,创建新的频道。然后在采集地址处把准备采集网站的网址粘贴进去。
频道配置
二.频道入口地址配置好以后,点击“模板配置”,在右侧模板一处新建一个链接抽取,两个链接抽取,分别起名为“翻页”和“工程抽取”。这两个链接抽取分别抽取页面内的工程项目和翻页链接。
添加链接抽取
三.点击采集预览,发现采集预览中没有我想要的项目工程的链接,但是有翻页的链接,那就需要写脚本来抽取工程链接。翻页链接抽取可以通过可视化的操作完成。以前说过链接抽取的脚本如何写,这里就不多介绍了。
链接抽取教程:http://toutiao/i6454813216395493902/
链接抽取脚本
四.通过预览发现每一个翻页链接地址中都包含“page=”这个词,那我将这个词放在“翻页”的地址过滤中,将过滤规则选择为“包含”。
翻页地址过滤
链接抽取配置好,可以点击采集预览看一下效果,如果配置的有问题可以及时改正。
预览效果
五.可以看到预览效果没有问题,那继续配置下一层模板。下一层为招标公告页,也就是数据页。先建好表单字段,在表单名称处选择建好的表单。
选择表单
六.数据页中有一部分字段使用可视化的操作就能完成,有一部分需要脚本,所以我就把需要写脚本的部分分别写在了字段下。字段处理选择“脚本处理”。
字段下脚本处理
八.全部字段配置好以后,可以先点击采集预览,看一下效果,如果效果不好可以改正。
招投标类网站都是实时更新的,ForeSpider数据采集软件有增量采集的功能,可以采集新增数据,长时间时时监控网站新增数据。
虽然教程看起来简单,最重要的还是多亲自上手实践。多多实践才能更熟练的使用软件采集自己想要的数据。
- ?
数据采集过程中的常见问题
无语
展开
经过两周的整理总结,沉淀出来好多数据采集的经验与大家分享。
前嗅免费模板共享链接:http://forenose/help/collection/template/cases.html
1.如何进行数据采集?
①下载安装软件后,登录到软件上。
②准备好模板:在前嗅的官网上下载免费的模板或自己配置好的模板
③将下载的官网导入到软件中。
点击文件---点击导入采集文件(将采集文件导入,自己配置的模板请忽略这一步)
④在数据建表中建关联数据表
选中需要采集模板下的表单---点击创建关联数据表,所创表名不能为汉字,点击确定---在所创数据表前的方框打勾即可关联数据表。详情见下图。
此时在数据浏览中就存在了刚刚建的关联数据表。
⑤进行数据采集。
在需要进行数据采集的模板前打勾--点击允许采集--点击开始按钮即可进行数据采集。详情见下图。
⑥数据预览及导出
选中关联表---点击刷新按钮即可查看数据---点击导出按钮即可导出数据。详情见下图。
多种导出方式:
a.可以将采集到的数据全部导出。
b.可以将数据分割导出,设置特定数目后数据会分别储存放在文件夹中。
c.可以将每个字段所采集到的内容分别导出到不同文件夹,方便查看。
数据导出教程:
http://forenose/help/guildbook/crawler_new/5-2.html
2.所采集的网站弹验证码是怎么回事?
弹验证码分为四种情况:
①登录需要验证码:登录时只需要一个验证码,所以直接手动填写配置即可。
②多账号登录:每次账号登录都需要验证码,此时应该接第三方打码平台。
前嗅(forenose)是首个深度大数据专家。
提供数据采集-分析-处理-管理-营销-应用,自主知识产权的全套大数据产品 。
- ?
APP数据采集是怎么实现的
小情操
展开
最近半年,我们八爪鱼陆续接到好几个APP数据采集的项目需求,我在群里面,偶尔也看到有些用户在问,有没有APP数据采集的工具。鉴于我们做过的几个APP数据采集项目的经验,我可以告诉大家,现在APP数据采集,市面上还没有通用的工具。我们八爪鱼内部是有一套工具,但由于使用的难度较高,需要编写脚本,所以不对普通用户公开,我们仅接受项目定制。
虽然不对外公开,但并不妨碍我们将技术分享出来,APP数据采集,一般走以下两种方式:
1.两种思路
1. 抓包
2. HOOK
2.抓包
有代码经验或APP开发的同学都很容易理解,其实很多APP,走的都是webservice通讯协议的方式,并且由于是公开数据,而且大部分是无加密的。所以只要对网络端口进行监测,对APP进行模拟操作,即可知道APP里面的数据是如何获取的。
我们只需要写代码模拟请求,无论POST还是GET,即可得到该请求所返回的信息。再通过对返回的信息结构化解析,即可得到我们想要的数据。
public static void main(String[] args) {
Spider.create(new GithubRepoPageProcessor())
//从https://github/****开始抓
.addUrl("https://github/****")
//设置Scheduler,使用Redis来管理URL队列
.setScheduler(new RedisScheduler("localhost"))
//设置Pipeline,将结果以json方式保存到文件
.addPipeline(new JsonFilePipeline("D:\\data\\webmagic"))
//开启5个线程同时执行
.thread(5)
//启动爬虫
.run();
}
以模拟采集“meizu”应用市场为例
应用市场产品抓包返回参数整个抓包过程3.HOOK技术
HOOK技术是一种走操作系统内核的技术,由于安卓系统是开源的,所以可以借助一些框架修改内核,从而实现你要的功能。HOOK的形式,我们走的是Xposed框架。Xposed是一款可以在不修改任何其他开发者开发的应用(包括系统服务)的情况下,改变程序运行的一个开源框架服务。基于它可以制作出许多功能强大的模块,以此来达到应用程序按照你的意愿运行的目的。
如果把安卓手机看做一座城堡,那Xposed可以让你拥有一个上帝视角,城里的运作细节尽收你眼底,还能让你插一手改变城堡的运作规律。
什么意思呢?简单的说就是你可以通过他,自动化的控制你的APP。如果将我们的APP开在模拟器上,我们可以通过编码,通过他告诉APP这一步干什么,下一步干什么。你把它理解成类似游戏打怪外挂就可以了。
而他每走一步,APP与服务端交互的数据,均可获取下来。这种方式广泛用于一些成熟的APP。比如某信采集。
public class HookActivity implements IXposedHookLoadPackage {
@Override
public void handleLoadPackage(LoadPackageParam lpparam) throws Throwable {
final String packageName = lpparam.packageName;
XposedBridge.log("--------------------: " + packageName);
try {
XposedBridge.hookAllMethods
(Activity.class, "onCreate", new XC_MethodHook() {
@Override
protected void afterHookedMethod(MethodHookParam param)
throws Throwable {
XposedBridge.log("=== Activity onCreate: " + param.thisObject);
}
});
} catch (Throwable error) {
XposedBridge.log("xxxxxxxxxxxx: " + error);
}
}
}
其实我们八爪鱼曾经也想开发一款通用的APP数据采集工具,并且两年前在这块投入研究了小半年,我们做出了一款APP采集脚本编辑工具,可以让一款APP的数据采集项目缩减到3-5天即可开发完成。但我们认为,这个工具需要编写脚本一般用户是比较难上手的,所以仅作为内部项目使用。
以HOOK某APP为例:
HOOK指令打开某4.这些年走过的坑
聊完APP采集的思路,我们跟大家分享一些遇过的坑吧,让大家乐一乐
坑一:签名算法
以某信的文章列表页及某信息页为例,对其http访问进行抓包,会发现其url的一个核心参数是我们无法知道如何生成的,这就导致,我们不可能直接用该url进行信息爬取;签名算法如果无法破解,HTTP这条路就是死路了。
坑二:http爬取回来的信息和页面显示不一致
以某信的某信息页为例,对比直接访问某信页面及http爬取的信息,可明显发现http爬取到的信息较少。造成得两种方式都用,才能既照顾速度又照顾完整性。
坑三:模拟器中的坑
APP自动识别你的运行环境进行屏蔽,最厉害的还是某信,连你是用模拟器打开还是真机打开,是什么内核的,全部进行限制。曾经见过牛人,找某手机厂商专门定做真机来配合。
坑四:帐号的坑
这个坑就有点大了,要找号、养号,都不是件容易的事情,更惨的是封号,真真让你一夜回到解放前。
- ?
干货丨大数据是如何被采集及应用的
聂乞
展开
尽管“大数据”一词近年来屡遭热捧
但很多人都还不知道什么是大数据
更不知道大数据有甚卵用
这两年,发现“大数据”这个词出现的越来越频繁了
不仅企业,连国家都在部署大数据战略
一番百度了之后
Oh~ emmmmmmmmm~ +_+
还是没搞懂大数据到底是个什么玩意儿
直到有一天
我发现一个秘密
不管我在网上搜索什么
页面都会跳出我要搜索的相关产品或关联事物
然后,我恍然大悟!
所谓大数据,就是算法!
它能够“算”出我们“心中所想”
那么问题来了
大数据技术是如何采集到我们的信息的呢?
数据采集,又称数据获取,是利用一种装置,从系统外部采集数据并输入到系统内部的一个接口。在互联网行业快速发展的今天,数据采集已经被广泛应用于互联网及分布式领域,比如摄像头,麦克风,都是数据采集工具。
数据采集系统整合了信号、传感器、激励器、信号调理、数据采集设备和应用软件。在数据大爆炸的互联网时代,数据的类型也是复杂多样的,包括结构化数据、半结构化数据、非结构化数据。结构化最常见,就是具有模式的数据。非结构化数据是数据结构不规则或不完整,没有预定义的数据模型,包括所有格式的办公文档、文本、图片、XML, HTML、各类报表、图像和音频/视频信息等等。大数据采集,是大数据分析的入口,所以是相当重要的一个环节。
我们首先来了解一下数据采集的三大要点:
一、数据采集的三大要点
(1)全面性
数据量足够具有分析价值、数据面足够支撑分析需求。
比如对于“查看商品详情”这一行为,需要采集用户触发时的环境信息、会话、以及背后的用户id,最后需要统计这一行为在某一时段触发的人数、次数、人均次数、活跃比等。
(2)多维性
数据更重要的是能满足分析需求。灵活、快速自定义数据的多种属性和不同类型,从而满足不同的分析目标。
比如“查看商品详情”这一行为,通过埋点,我们才能知道用户查看的商品是什么、价格、类型、商品id等多个属性。从而知道用户看过哪些商品、什么类型的商品被查看的多、某一个商品被查看了多少次。而不仅仅是知道用户进入了商品详情页。
(3)高效性
高效性包含技术执行的高效性、团队内部成员协同的高效性以及数据分析需求和目标实现的高效性。也就是说采集数据一定要明确采集目的,带着问题搜集信息,使信息采集更高效、更有针对性。此外,还要考虑数据的及时性。
不同应用领域的大数据其特点、数据量、用户群体均不相同。不同领域根据数据源的物理性质及数据分析的目标采取不同的数据采集方法。
那么,接下来我们再来了解一下常用的数据采集的方法。
常用的数据采集方法归结为以下三类:传感器、日志文件、网络爬虫。
(1)传感器
传感器通常用于测量物理变量,一般包括声音、温湿度、距离、电流等,将测量值转化为数字信号,传送到数据采集点,让物体有了触觉、味觉和嗅觉等感官,让物体慢慢变得活了起来。
(2)系统日志采集方法
日志文件数据一般由数据源系统产生,用于记录数据源的执行的各种操作活动,比如网络监控的流量管理、金融应用的股票记账和 web 服务器记录的用户访问行为。
很多互联网企业都有自己的海量数据采集工具,多用于系统日志采集,如Hadoop的Chukwa,Cloudera的Flume,Facebook的Scribe等,这些工具均采用分布式架构,能满足每秒数百MB的日志数据采集和传输需求。
(3)Web 爬虫
网络爬虫是指为搜索引擎下载并存储网页的程序,它是搜索引擎和 web 缓存的主要的数据采集方式。通过网络爬虫或网站公开API等方式从网站上获取数据信息。该方法可以将非结构化数据从网页中抽取出来,将其存储为统一的本地数据文件,并以结构化的方式存储。它支持图片、音频、视频等文件或附件的采集,附件与正文可以自动关联。
此外,对于企业生产经营数据上的客户数据,财务数据等保密性要求较高的数据,可以通过与数据技术服务商合作,使用特定系统接口等相关方式采集数据。比如八度云计算的数企BDSaaS,无论是数据采集技术、BI数据分析,还是数据的安全性和保密性,都做的很好。
数据的采集是挖掘数据价值的第一步,当数据量越来越大时,可提取出来的有用数据必然也就更多。只要善用数据化处理平台,便能够保证数据分析结果的有效性,助力企业实现数据驱动。
如何采集数据
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并