- ?
多款手机App过度采集数据
骆妙旋
展开
香港《南华早报》12月1日文章,原题:内地消费者机构称,中国的智能手机App正收集过多个人信息
中国许多智能手机都在过度收集有关用户的个人信息,其中包括用户位置、通讯录和手机号码等。
中国消费者协会近期对100款App进行测评后发布报告称,其中91款涉嫌过度收集个人信息,但该报告并未将(所有)这些App的名称公之于众。该报告分别列出相关App在数据隐私及保护声明中存在的常见问题。
“从本次测评情况看,大多数App仅达到及格水平甚至低于及格水平,而且各类App差距明显,尤其是中小企业App问题较为突出,存在过度收集信息、无隐私条款、条款不完整以及不合理格式条款等问题。以上问题凸显我国保护消费者信息形势的严峻性,应当引起相关部门的高度重视。”该报告称。
报告显示,导航、旅游、酒店预订、云存储和健康管理等服务提供商收集用户信息最多。例如,美图秀秀涉嫌过度收集有关用户的可识别生物信息、财务信息等。小黄车向关联公司及第三方分享相关信息时,未单独征得用户同意。支付宝未在收集的信息种类中注明个人敏感信息,且未对核心和附加功能进行区分。
在中国,数字经济崛起意味着如今人们越来越多的活动都在线上进行,对用户隐私、数据安全以及全世界科技企业如何处理个人信息的担忧正与日俱增。▲(作者莎拉-戴,会聪译)
- ?
亿信华辰数据采集平台i@Report这样抓取数据
戚易真
展开
数据抓取方案是从指定网址上抓取数据,存储到用户使用的i@Report产品中。对于数据抓取的创建,使用者需要了解其基本的功能使用。跟着小亿的介绍,一起来了解一下。
数据抓取方案
系统会自动生成一个dadmin帐号(默认密码dadmin),使用该帐号登录系统,可以看到数据抓取模块,该用户的权限已经初始化完成。
创建抓取方案,需要进行抓取的相关设置。
基本属性设置
【抓取地址】抓取的目标网址。
【关键字】目标表格的表头文字、表格里面的文字(协助定位表格的文字),支持多个关键字定位,关键字之间的分割符可以设置为空格,英文的分号、逗号。
【方案名称】抓取方案的名称。如果不填写,点击“测试”,会默认取抓取目标网址的标题。
【数据起始行】标志数据起始的行号,行号之前的会被识别为表头,行号及之后的数据被识别为数据。
基本配置完成之后,点击"测试"按钮,会根据默认的抓取规则,从目标地址中将
标签的内容抓取出来重新渲染。
高级属性设置
【表格ID】数据所在表格DOM元素的id属性值。在网页上的表格无明显关键字或者有多个同样标题的表格时,可以考虑取表格的ID来定位表格。
【表格名称】用途与表格ID一致,对应DOM对象的name属性。
【分页参数】在目标网站支持分页,且数据有多页的情况下,可以设置分页参数,这里指参数名。
例如:
http://192.168.1.200/bbs//forumdisplay.php?fid=30&page=2 该地址的分页参数就是page。
【页码起止】配置抓取的起止码,从第几页抓到第几页,可以只填写分页起始行,不填写截止行。
【取数去重】设置是否去除重复数据。勾选后将不再抓取重复的数据到数据库,数据是否重复的范围是所有期的数据中去比较是否有重复,默认不去重。
登录属性设置
以BI的登录地址为例
【登录地址】执行登录的地址。
【用户名参数】用户名对应的参数名。
【用户名】用户的ID。
【密码参数】用户密码的参数名。
【密码】用户的密码。
【登出地址】执行登出的地址。
执行属性设置
【取数频率】执行数据抓取的频率设置。
【启动】是否启动自动抓取。
根据实际需要配置完成后,点击“保存”,可以将当前配置保存,并生成对应的抓取方案。一个方案会同步生成一个irpt的任务和一个计划任务,任务保存在数据抓取任务组,计划任务保存到数据抓取分组。
保存完成后,会提示是否执行数据抓取,点击“确认”可以执行一次数据抓取,也可以在树形抓取方案上,右键"执行"来执行抓取。
编辑抓取方案
点击左树上的方案配置,可以查看抓取方案的配置,
可以对执行设置等配置进行编辑,其中目标地址、关键字、表格id、表格名称无法编辑。
查看抓取数据
点击左树抓取方案下的"数据"节点,可以查看抓取到的数据,
抓取一次将生成一期数据,数据只能查看,不能编辑。数据由2张表组成,一张基本表,一张数据表,基本表记录抓取的一些基本信息。
查看日志
点击左树抓取方案下的"日志"节点,可以查看抓取数据的日志信息。
?手机APP采集残疾人需求
Darnell
展开
本报讯 (记者谢菁菁 郑国瑞彭红霞)为积极深入“大学习、深调研、真落实”活动开展,进一步推动惠城区“两强一提”工程实施,日前,惠城区残联工作人员深入到汝湖镇、水口街道,现场督导检查该区残疾人基本服务状况和需求信息数据动态更新工作进展情况。记者了解到,为确保残疾人动态更新工作的顺利开展,全区所有村(社区)将采取手机APP数据采集和录入,各级及时筹划、增加投入、主动作为,为动态更新工作的常态化开展打下坚实的基础。
据悉,残疾人基本服务状况和需求信息数据动态更新工作,是评估现行社会保障和基本公共服务的政策效果,也是制订国家和残疾人事业发展规划中完善残疾人兜底保障制度和残疾人基本公共服务的相关决策依据,更是为健全残疾人信息平台和实现残疾人工作智能化管理服务机制奠定了基础。
为扎实推进动态更新工作,区残联严格落实挂钩联系基层制度,成立了动态更新工作办公室,对相关工作进行具体分工,区、镇(街道)残联所有人员,对全区的调查工作进行了责任区分,包干到村(社区)。按照“统一领导、分级负责、层层落实责任制”的组织原则,统一思想、统一筹划、全面部署,确保调查员培训工作组织健全、责任清晰。
同时,充分发挥各级专职委员在各级残联和服务对象之间的桥梁纽带作用,发挥他们作为残疾人工作的宣传员、信息员、联络员的作用。在业务培训、入户调查等工作中让专职委员充分参与,切实提高残疾人专职委员的整体能力和业务素质,让他们在工作中得到锻炼,提高水平,增长能力。
版权声明:图片来源于网络,图文无关。如涉及版权问题,请作者持权属证明与本网联系
来源:惠州日报
?升级万亿机械加工产业,「智能云科」要做机加工领域的工业互联网平台
旧城
展开
2017年中国机加工市场规模达8万亿元,其中1000家的机床生产企业,80万家机床使用企业。庞大的机加工市场同时存在着很大痛点,高端控制系统被国外垄断、客户分散、订单不稳定、设备闲置率高、同质化竞争利润低、人力成本高等,国内的加工制造业已经在外流,行业急需升级。
智能云科是一家聚焦机加工领域的工业互联网平台公司,由沈阳机床联合神州控股、光大金控于2015年在上海共同投资设立。
工业互联网平台有很多家在做,可以从以下几个关键维度去快速理解智能云科在做的事情。
行业方面,智能云科聚焦在机加工领域。服务对象,核心是上游机床厂商、下游加工厂。服务内容,从设备、生产数据联网,到产能交易、设备运维、租赁、供应链金融、工业APP等产业全生命周期服务。
有了框架,下面来具体看看,智能云科的iSESOL工业互联网平台是怎么做的,如何产生价值。
可以把智能云科的服务粗略分为两个大类:数据采集联网、数据应用。
数据采集联网:不止是采集,还能直接产生客户价值
朱志浩曾带领团队历时7年,于2014年推出了自主研发的机床控制系统i5,并于同年开始销售搭载i5系统的i5智能机床。
“这件事情的意义,类似于将传统手机升级为智能手机,智能机床通过i5系统,可以快速开发上层应用,从而将宝贵的工业机理、经验持续沉淀下来”朱志浩告诉36氪。
此前,机床厂商做的是一次性买卖生意,现在通过智能机床,能持续提供增值服务,例如零部件的故障预测,帮助客户及时更换,避免生产故障。这样,设备厂商能够从设备使用全周期的角度做这门生意,提高附加值,促使不断提高产品、服务质量,产生良性循环。
更进一步,朱志浩希望能把此项能力开放给市面上更多设备制造厂商。2017年,团队将i5机床控制系统进行独立封装,推出i5OS。可以将i5理解成苹果手机专属的iOS系统,而i5OS则是面向所有设备厂商的Android系统。
智能云科的数据采集联网业务,对于i5智能机床,或者搭载i5OS的设备,可以通过标准接口协议快速获取丰富的加工数据,对于其他机床,智能云科提供iSESOL BOX产品,进行数据采集和联网。
与市面大多数据采集联网设备不同,iSESOL BOX自带操作系统和边缘计算能力,可以直接支持APP应用,如耗电优化、刀具切削优化、温度补偿等。客户付出了连接成本,可以直接获得相应价值,不是为了连接而连接,从而增强客户买单动力。
以上说的是设备层面的数据采集和联网问题,而对于设备的使用方加工厂,智能云科提供iSESOL WIS产品帮助中小微加工厂完成企业信息化。
iSESOL WIS可以理解为轻量化的云MES系统,甚至不需要接入数据采集硬件,直接通过移动设备录入信息方式,将生产过程和结果信息化、可视化。
“工厂老板最关心的是生产情况如何,哪些订单要交货,已经完成了多少,是否有风险。WIS系统不做很复杂的东西,就聚焦在客户最核心的痛点,让他们用得起。”朱志浩告诉36氪。
总结来看,智能云科通过i5 OS、iSESOL BOX、iSESOL WIS产品,将设备和生产数据采集联网,并在连接的同时,直接产生了客户价值。
产业生态应用:基于真实数据,提供精准服务
有了数据,联了网,这只是开始。
智能云科提供了工业APP、产能交易、设备运维、租赁、供应链金融等一系列产业生态应用服务。
工业APP今年很火热,在朱志浩看来,工业互联网平台单纯的汇聚APP没有意义,一定要有承载体。对智能云科来说,承载体就是i5 OS和iSESOL BOX产品,能够与底层制造装备紧密对接,向上为APP提供开发平台。设备商、工厂、研究机构,都可以将自己对于工业机理的理解,以APP的方式沉淀下来,借助平台轻量化、低成本的推广到机加工行业,获取回报。
基于工厂真实透明的生产数据,可以形成较精准的工厂画像,包括每家工厂擅长加工哪些东西,产能情况,需要哪些工业品,经营状况等。智能云科可以更精准的对接订单加工方和需求方,对接工业品的供应方和购买方,对接金融机构和中小微加工厂等。
对于设备厂商来说,基于设备数据,可以进行远程运维、分时租赁等服务,降本增效,创新商业模式。
行业落地和挑战
智能云科的整套服务覆盖面很广,要怎么逐步实现呢?
朱志浩告诉36氪,智能云科从2015年成立,先用了3年时间,把核心产品和整套商业模式架构搭建起来,并通过i5数控机床进行了内部试验验证。当前阶段以及2019年要重点实现社会化落地,先以iSESOL BOX和iSESOL WIS为核心业务,把数据问题解决,再不断延伸产业生态服务。
官方信息显示,截至2018年11月,iSESOL服务范围已涵盖26省、161市,服务企业客户3000余家,已连接智能设备22000多台,累计服务机时5000多千时,覆盖汽车刹车盘、铝雕、消费电子、珠宝等行业。
36氪还了解到,智能云科目前正在准备A轮融资,总金额在亿元以上。
目前,国内已有数十家工业互联网平台公司,包括树根互联、徐工信息、海尔、富士康、智能云科等工业背景公司,浪潮、运营商等ICT巨头,阿里等互联网巨头,用友等IT公司,以及众多科技创业公司等。
智能云科的特点是基于深厚的机加工装备背景,聚焦机加工垂直领域。相比于通用平台,能从机床内部机理入手,更深入的挖掘数据价值。同时具备机加工行业较广泛的客户基础、市场基础(已销售3万台i5智能机床)。
当然,智能云科也面临着很多挑战,包括其i5 OS以及iSESOL BOX能多快多广的覆盖到行业客户,实现工业互联网平台的构建。以及其他设备厂商的接受意愿,是否有竞争顾虑,是否能接受智能机床的新模式等。
——————
我是36氪记者陈绍元,关注物联网、AI、科技,交流或寻求报道(不收费)加微信:963757163,请注明公司、职位、姓名,否则不加。
?实时数据采集 将平台资源匹配
唱片
展开
匹配算法实现,通过将用户属性、用户学习状态属性、用户操作行为统计属性与资源属性进行匹配,数据容量大,遥测距离远,人机界面友好,可靠性高的优点,可广泛用于学校和社区小区域范围环境服务。
也适合于气象、海洋、环境、机场、港口、工及等领域使用.实时数据采集与上传该模块主要功能是通过无线方式获取环境观测站采集的实时数据并显示.数据采集的基本算法如下:首先判断是否到发送数据时间,若到了执行数据发送命令。
为了方便学习者查找资源以及系统推送资源,须对学习者和资源的属性进行标记,即创建属性元数据.本研究采用标签技术分别建立学习者和资源的属性元数据.学习者的属性标签主要来自于用户注册时的信息(用户属性)、学习者的学习状态属性以及学习者系统操作行为统计属性(对上传、下载、浏览、评论等操作的统计)。
资源的属性标签主要来自于资源提供者根据学科和关键字分类的标签以及资源使用者对资源的评价、标记等.根据研究性学习的主题、用户学习进度,系统可以将用户可能感兴趣,其他用户感兴趣或评分高、浏览次数多,相同领域的最优资源或相似领域的最佳资源推送给用户,系统根据学习者的学习主题,将平台中评价最高的相关资源、教师指定的资源和拓展的相关资源进行匹配,
?手机APP过度采集数据,谁是个人信息泄露的幕后“黑手”?
曼彤
展开
来源:人民日报
不久前发生的一系列事件让个人信息安全再成舆论热点:华住旗下多家酒店品牌疑似发生大规模信息泄露事件,数据涉及约1.23亿条官网注册资料、1.3亿条入住登记身份信息;有“暗网”用户声称手握3亿条顺丰快递客户数据,包括寄收件人姓名、地址、电话等个人信息,并积极叫卖……
网络时代,我们的个人信息安全状况如何?谁是个人信息泄露的幕后“黑手”?护航个人信息安全,政府和企业需要再做些什么?
个人身份信息最容易被侵犯
全国消协组织受理的消费者投诉数据显示,今年上半年,电商平台、社交平台软件等非法采集消费者个人信息现象成消费投诉新热点,位居十大投诉榜榜首。不久前,中消协发布的《APP个人信息泄露情况调查报告》(以下简称《报告》)也反映,遇到过个人信息泄露情况的人数占比为85.2%。
“网络具有即时性与虚拟性,加上个人信息被广泛采集却未受到良好保护,公民个人信息一旦泄露,普遍存在举证难、损失认定难的情况,因此,个人信息泄露问题没得到有效治理。”中国法学会消费者权益保护法研究会副秘书长陈音江说。
“个人信息主要有三种形式:第一种叫个人隐私信息,这是隐私权保护的范围;第二种叫个人身份信息,如身份证号码、电话号码、个人账户信息等,用个人信息权予以保护;第三种是衍生数据,是对网络上留存的海量的个人数据进行加工处理形成的新数据,已经与个人的身份信息脱敏。”中国人民大学法学院教授杨立新认为,个人隐私信息和个人身份信息都要依照法律的规定进行支配,只有衍生数据才可以在大数据时代中进行商业处理。
杨立新认为,最容易被侵犯的个人信息是身份信息,各类商业推销、电信诈骗等大多是基于个人身份信息泄露而出现的。《报告》显示,约86.5%的受访者曾收到推销电话或短信的骚扰,约75.0%的受访者接到诈骗电话,约63.4%的受访者收到垃圾邮件,这是最常见的三大问题。此外,消费者还面临着收到非法链接、个人账户密码被盗等风险。
据介绍,去年3月,公安部开展了打击整治黑客攻击破坏和网络侵犯公民个人信息犯罪专项行动,仅4个月就侦破相关案件1800余起,查获各类被非法倒卖公民个人信息500余亿条。
手机应用软件过度采集个人信息
《报告》发现,个人信息泄露的两条最主要途径,一是经营者未经本人同意暗自收集个人信息,二是经营者或不法分子故意泄露、出售或者非法向他人提供个人信息,这两者均超过调查总样本的60%。
据了解,部分APP会“私自窃密”。例如,部分记账理财APP会通过留存消费者的个人网银登录账号、密码等信息,并模仿消费者网银登录的方式,获取账户交易明细等信息。有的APP在提供服务时,采取特殊方式来获得用户授权,这本质上仍属“未经同意”。例如,在用户协议中,将“同意”之选项设置为较小字体,且已经预先勾选,导致部分消费者在未知情况下进行授权。
另外,手机APP过度采集个人信息呈现普遍趋势。“最突出的是在非必要的情况下获取位置信息和访问联系人权限。”中消协秘书长朱剑雄说,“比如,像天气预报、手电筒这类功能单一的手机APP,在安装协议中也提出要读取通讯录,这与《全国人民代表大会常务委员会关于加强网络信息保护的决定》明确规定的手机软件在获取用户信息时要坚持‘必要’原则相悖。”
《报告》还发现,在安装和使用手机APP时,很少有用户仔细阅读应用权限和用户协议或隐私政策。“不授权就没法用,只能被迫接受。”不少消费者在接受采访时表示。
“双方当事人无法进行面对面协商,这决定了消费者只能先接受平台提出的交易规则,否则就无法进行交易。”杨立新说,问题的关键在于,网络交易平台提供的交易规则是否合法,“对此,商务、市场监管等有关部门在实体和程序上都做了规定。若交易规则内容违法,消费者可以主张废除该规则,也可以行使撤销权撤销该交易,造成损害的还可以请求损害赔偿。”
与此同时,个人信息买卖已形成一条规模大、链条长、利益大的产业链。“这条产业链结构完整、分工细化,个人信息被明码标价,流通变现环节主要包含三个方面。”据中国人民大学法学院博士后刘笑岑介绍,上游环节负责“源头供货”,非法获取或向他人提供个人信息,主要来自于黑客攻击和“内鬼”外泄;中游环节负责对从上游处获取的个人信息进行处理与再加工,通过买卖、交换等形式形成规模化市场;下游环节负责“应用变现”,将所获个人信息应用于电信诈骗、恶意营销等不法渠道以牟取高额利润。
在公安部今年的“净网2018”专项行动中,公安机关对侵犯公民个人信息犯罪、黑客攻击破坏犯罪和非法销售“黑卡”犯罪进行严厉打击,半年内抓获犯罪嫌疑人8000余名,其中涉电信服务商、互联网企业、银行等行业内部人员300余名,黑客1200余名,缴获“黑卡”270余万张。
引导行业建立个人信息分级分类保护体系
据统计,目前有近40部法律、30余部法规涉及个人信息保护,包括民法总则、刑法、消费者权益保护法、网络安全法以及新近通过的电子商务法。
杨立新认为,现有的法律法规已经足以保护个人信息,问题在于,侵害个人信息构成犯罪的,能够追究其刑事责任,但对于侵权行为,仍然制裁不力。“重点是加强司法上的民法保护,在惩戒手段、赔偿问题上落实落细,加强对侵害个人信息权行为的打击力度,承担赔偿责任。”“个人信息保护的主管机关还未确定,目前公安、工信、网信、司法等多家部门都在管,需拧成监管合力。”刘笑岑认为,还处于立法计划当中的个人信息保护法,将来应致力于解决这些问题。
个人信息泄露的源头是什么?“问题出在过度采集上。”陈音江说,“合法、正当、必要”六字是目前相关法律对个人信息采集和使用的规定,必须贯彻落实,同时要尽快明确,哪些事项必须通过实名制注册或办理,哪些事项无需实名,避免信息采集主体过多、实名登记事项过度。
“如何引导行业对于个人信息进行分类,构建分级分类保护体系,这是当前个人信息防泄露问题要着重考虑的一项。”腾讯守护者计划安全专家马瑞凯说。
受访专家表示,个人信息获取、存储和利用的环节众多,许多信息的传播又具有隐蔽性和复杂性,做到切实保障公民个人信息安全,需要公民、信息采集机构、技术人员和有关部门协同共治。就企业管理层面而言,要推动数据防窃密、防篡改、防泄露等安全技术的研发和部署,有效降低不法分子窃密风险;就监管部门而言,要进一步加大对电信诈骗、网络诈骗等违法犯罪活动的打击力度,持续形成高压态势,保护消费者的合法权益。
?2018年最值得推荐的6款大数据采集工具
陶语雪
展开
数据肯定是无价的。但分析数据并非易事,因为结果越准确,成本就越高。鉴于数据急剧增长,需要一个过程来提供有意义的信息,最终变成实用的洞察力。
数据挖掘是指这个过程:在庞大数据集当中发现模式,将它转换成有效的信息。该技术利用特定的算法、统计分析、人工智能和数据库系统,从庞大数据集中提取信息,并转换成易于理解的形式。本文介绍了广泛用于大数据行业的6种综合数据挖掘工具。
1. Rapid Miner
Rapid Miner是一个数据科学软件平台,为数据准备、机器学习、深度学习、文本挖掘和预测分析提供一种集成环境。它是领先的数据挖掘开源系统之一。
该程序完全用Java编程语言编写。该程序提供了一个选项,以便用户试用大量可任意嵌套的操作符,这些操作符在XML文件中有详细说明,可由Rapid Miner的图形用户界面来构建。
2. Oracle Data Mining
它是Oracle高级分析数据库的代表。市场领先的公司用它最大限度地发掘数据的潜力,做出准确的预测。该系统配合强大的数据算法,锁定最佳客户。
此外,它可识别异常情况和交叉销售机会,让用户能够根据需要运用不同的预测模型。此外,它以所需的方式定制客户画像。
3. IBM SPSS Modeler
说到大规模项目,IBM SPSS Modeler最适合。在这个建模器中,文本分析及其最先进的可视化界面极具价值。它有助于生成数据挖掘算法,基本上不需要编程。
它可广泛用于异常检测、贝叶斯网络、CARMA、Cox回归以及使用多层感知器和反向传播学习的基本神经网络。
4. KNIME
Konstanz Information Miner是一个开源数据分析平台。你可以迅速在其中部署、扩展和熟悉数据。在商业智能界,KNIME号称是有助于为毫无经验的用户提供预测智能的平台。
此外,数据驱动的创新系统有助于发掘数据潜力。此外,它包括数千个模块和随时可用的示例以及一大批集成的工具和算法。
5. Python
Python是一种免费的开源语言,因易用性常常与R相提并论。与R不同,Python学起来往往很容易上手,易于使用。许多用户发现可以在几分钟内开始构建数据,并进行极其复杂的亲和度分析。
只要你熟悉变量、数据类型、函数、条件语句和循环等基本编程概念,最常见的业务用例数据可视化就很简单。
6.火车采集器
火车采集器由合肥乐维信息技术有限公司开发,是一款专业的网络数据采集/信息挖掘处理软件,通过灵活的配置,可以很轻松迅速地从网页上抓取结构化的文本、图片、文件等资源信息,可编辑筛选处理后选择发布到网站后台,各类文件或其他数据库系统中。
?前嗅:手把手教你数据采集
龚以寒
展开
ForeSpider 前嗅:手把手教你数据采集
ForeSpider是一款非常好用的数据采集软件,因为属于专业性工具,除了帮助文档外很少有使用教程。所有有很多人在使用的过程中遇到问题难以解决,今天给大家介绍ForeSpider数据采集系统的使用教程,希望能对大家的工作有所帮助。
教程的示例网站是大众点评,要得到50页内所有医院名称,该医院评论总数,医院总体星级,各项评分,医院评论的用户名,评论内容,评论时间,用户点评星级,获赞数量和回应数量。
首先我们先新建一个频道,我给它命名为大众点评,然后在频道配置里输入我们想要爬取数据的网址,需要在频道配置处输入想要得到数据的网址,大众点评需要开启cookie,从右面可以开启,网站不同有的不需要,视情况而定。 现在默认模板(1)就是我们要的网站页面,鼠标放在医院标题处如图,从左下角能看到医院的网址链接。
现在点一下右上角的采集预览,我们能得到整个页面的所有网页链接,下拉滚动条到这个位置就会发现跟上图相同格式的链接,这就是我们需要的所有医院的链接。
我们用不到的需要过滤一下,可以通过地址过滤和标题过滤方法筛选。点击软件右上角模板抽取配置里面的链接抽取,里面有地址过滤和标题过滤两个选项,点击地址过滤,软件右下角如图:
过滤规则选择包含,过滤串内输入想要得到的医院链接,后面这串数字我们用“\d”表示,用“\e”表示结束,例如https://dianping/shop/\d\e,这样就能采集网页内所有这种格式的网页链接。
当我们想要采集的网页下面有翻页的链接,就必须配置翻页。除了在右上角默认模板处抽取我们想要的得到的医院链接外,还要再新建一个链接抽取,抽取页面翻页的地址。
我们继续从采集预览处得到翻页的链接,过滤规则选择包含,通过观察发现几个链接的相同点,输入到过滤串里就能得到想要的翻页链接了。
第一层级的模板建好了,下面我们随便点进一个医院主页内,复制链接建立下一层级模板。在默认模板(2)的示例地址内输入医院主页的链接。
因为我们需要采集该医院所有用户评论,所以我们找到下面的“更多点评”,通过刚刚地址过滤的方法,过滤出更多点评的链接,并建立模板(3),示例地址输入刚刚过滤的得到的“更多点评”的网址。
注:点击链接抽取,看左下角关联模板处,一定要关联到下一层级的模板,如果是翻页的链接抽取,要关联自身模板,否则会数据采集失败。这点一定要注意。
这样模板的基本配置就完成了,下一步是建立表单,下图是我们的需求,红色字体我们能从模板二采集到,蓝色字体我们能从模板三采集到,所以我们需要建立两个表单。
点击表单配置,新建一个表单,添加一个网页主键如图,一定要勾选索引字段,键值唯一,主键字段三个选项,取值类型选择网页主键点击确定。
然后添加下一个字段如标题“title”
取值类型选择“选区内全部文本”,变量类型选择“string”,选择合适的字符长度点击确定。依次建立所有字段。
这是我建立的两个表单的所有字段,表单名称分别为“大众点评1”、“大众点评2”,建立好以后点击保存即可。点开模板配置,每一个模板对应相应的表单,右键模板二“添加数据抽取”,表单名称选择“大众点评1”。
同样在模板三处再添加另外一个数据抽取表单,添加好后如下图所示:
单击“title”,然后按住ctrl键同时鼠标左键点击对应标题,内容过多的话按住shift可以调整内容大小,选好后点击保存。
全部选取完后点击左上角的文件,然后全部保存。
下一步点击数据,连接数据库,然后再次点击数据,选择数据表,选择刚刚新建两个数据表的字段后创建表,创建好后勾选并确定,就可以进行数据采集了(如果表单有问题需要更改,改好后需要重新创建表单),速度慢可以点击设置里面的线程设置,设置多线程。
这只是一个简单的教程,软件还有很多强大的功能,祝大家使用愉快!
?六大主流大数据采集平台架构分析
Santa
展开
随着大数据越来越被重视,数据采集的挑战变的尤为突出。今天为大家介绍几款数据采集平台:
Apache Flume Fluentd Logstash Chukwa Scribe Splunk Forwarder
大数据平台与数据采集
任何完整的大数据平台,一般包括以下的几个过程:
数据采集–>数据存储–>数据处理–>数据展现(可视化,报表和监控)
其中,数据采集是所有数据系统必不可少的,随着大数据越来越被重视,数据采集的挑战也变的尤为突出。这其中包括:
我们今天就来看看当前可用的六款数据采集的产品,重点关注它们是如何做到高可靠,高性能和高扩展。
1、Apache Flume
Flume 是Apache旗下的一款开源、高可靠、高扩展、容易管理、支持客户扩展的数据采集系统。 Flume使用JRuby来构建,所以依赖Java运行环境。
Flume最初是由Cloudera的工程师设计用于合并日志数据的系统,后来逐渐发展用于处理流数据事件。
Flume设计成一个分布式的管道架构,可以看作在数据源和目的地之间有一个Agent的网络,支持数据路由。
每一个agent都由Source,Channel和Sink组成。
Source
Source负责接收输入数据,并将数据写入管道。Flume的Source支持HTTP,JMS,RPC,NetCat,Exec,Spooling Directory。其中Spooling支持监视一个目录或者文件,解析其中新生成的事件。
Channel
Channel 存储,缓存从source到Sink的中间数据。可使用不同的配置来做Channel,例如内存,文件,JDBC等。使用内存性能高但不持久,有可能丢数据。使用文件更可靠,但性能不如内存。
Sink
Sink负责从管道中读出数据并发给下一个Agent或者最终的目的地。Sink支持的不同目的地种类包括:HDFS,HBASE,Solr,ElasticSearch,File,Logger或者其它的Flume Agent。
Flume在source和sink端都使用了transaction机制保证在数据传输中没有数据丢失。
Source上的数据可以复制到不同的通道上。每一个Channel也可以连接不同数量的Sink。这样连接不同配置的Agent就可以组成一个复杂的数据收集网络。通过对agent的配置,可以组成一个路由复杂的数据传输网络。
配置如上图所示的agent结构,Flume支持设置sink的Failover和Load Balance,这样就可以保证即使有一个agent失效的情况下,整个系统仍能正常收集数据。
Flume中传输的内容定义为事件(Event),事件由Headers(包含元数据,Meta Data)和Payload组成。
Flume提供SDK,可以支持用户定制开发:
Flume客户端负责在事件产生的源头把事件发送给Flume的Agent。客户端通常和产生数据源的应用在同一个进程空间。常见的Flume 客户端有Avro,log4J,syslog和HTTP Post。另外ExecSource支持指定一个本地进程的输出作为Flume的输入。当然很有可能,以上的这些客户端都不能满足需求,用户可以定制的客户端,和已有的FLume的Source进行通信,或者定制实现一种新的Source类型。
同时,用户可以使用Flume的SDK定制Source和Sink。似乎不支持定制的Channel。
2、Fluentd
Fluentd是另一个开源的数据收集框架。Fluentd使用C/Ruby开发,使用JSON文件来统一日志数据。它的可插拔架构,支持各种不同种类和格式的数据源和数据输出。最后它也同时提供了高可靠和很好的扩展性。Treasure Data, Inc 对该产品提供支持和维护。
Fluentd的部署和Flume非常相似:
Fluentd的架构设计和Flume如出一辙:
Fluentd的Input/Buffer/Output非常类似于Flume的Source/Channel/Sink。
Input
Input负责接收数据或者主动抓取数据。支持syslog,http,file tail等。
Buffer
Buffer负责数据获取的性能和可靠性,也有文件或内存等不同类型的Buffer可以配置。
Output
Output负责输出数据到目的地例如文件,AWS S3或者其它的Fluentd。
Fluentd的配置非常方便,如下图:
Fluentd的技术栈如下图:
FLuentd和其插件都是由Ruby开发,MessgaePack提供了JSON的序列化和异步的并行通信RPC机制。
Cool.io是基于libev的事件驱动框架。
FLuentd的扩展性非常好,客户可以自己定制(Ruby)Input/Buffer/Output。
Fluentd从各方面看都很像Flume,区别是使用Ruby开发,Footprint会小一些,但是也带来了跨平台的问题,并不能支持Windows平台。另外采用JSON统一数据/日志格式是它的另一个特点。相对去Flumed,配置也相对简单一些。
3、Logstash
Logstash是著名的开源数据栈ELK (ElasticSearch, Logstash, Kibana)中的那个L。
Logstash用JRuby开发,所有运行时依赖JVM。
Logstash的部署架构如下图,当然这只是一种部署的选项。
一个典型的Logstash的配置如下,包括了Input,filter的Output的设置。
几乎在大部分的情况下ELK作为一个栈是被同时使用的。所有当你的数据系统使用ElasticSearch的情况下,logstash是首选。
4、Chukwa
官网:https://chukwa.apache.org/
Apache Chukwa是apache旗下另一个开源的数据收集平台,它远没有其他几个有名。Chukwa基于Hadoop的HDFS和Map Reduce来构建(显而易见,他用Java来实现),提供扩展性和可靠性。Chukwa同时提供对数据的展示,分析和监视。很奇怪的是它的上一次 github的更新事7年前。可见该项目应该已经不活跃了。
Chukwa的部署架构如下:
Chukwa的主要单元有:Agent,Collector,DataSink,ArchiveBuilder,Demux等等,看上去相当复杂。由于该项目已经不活跃,我们就不细看了。
5、Scribe
代码托管:https://github/facebookarchive/scribe
Scribe是Facebook开发的数据(日志)收集系统。已经多年不维护,同样的,就不多说了。
6、Splunk Forwarder
以上的所有系统都是开源的。在商业化的大数据平台产品中,Splunk提供完整的数据采金,数据存储,数据分析和处理,以及数据展现的能力。
Splunk是一个分布式的机器数据平台,主要有三个角色:
Search Head负责数据的搜索和处理,提供搜索时的信息抽取。
Indexer负责数据的存储和索引 Forwarder,负责数据的收集,清洗,变形,并发送给Indexer
Splunk内置了对Syslog,TCP/UDP,Spooling的支持,同时,用户可以通过开发 Input和Modular Input的方式来获取特定的数据。在Splunk提供的软件仓库里有很多成熟的数据采集应用,例如AWS,数据库(DBConnect)等等,可以方便的从云或者是数据库中获取数据进入Splunk的数据平台做分析。
这里要注意的是,Search Head和Indexer都支持Cluster的配置,也就是高可用,高扩展的,但是Splunk现在还没有针对Farwarder的Cluster的功能。也就是说如果有一台Farwarder的机器出了故障,数据收集也会随之中断,并不能把正在运行的数据采集任务Failover到其它的 Farwarder上。
总结
我们简单讨论了几种流行的数据收集平台,它们大都提供高可靠和高扩展的数据收集。大多平台都抽象出了输入,输出和中间的缓冲的架构。利用分布式的网络连接,大多数平台都能实现一定程度的扩展性和高可靠性。
其中Flume,Fluentd是两个被使用较多的产品。如果你用ElasticSearch,Logstash也许是首选,因为ELK栈提供了很好的集成。Chukwa和Scribe由于项目的不活跃,不推荐使用。
Splunk作为一个优秀的商业产品,它的数据采集还存在一定的限制,相信Splunk很快会开发出更好的数据收集的解决方案。
?线下大数据智能采集投放平台
宋芫
展开
智能硬件结合大数据优势,全方位挖掘用户线下、线上行为,精准定义目标客群特征、消费偏好、地域分布,为零售客户提供选址招商、运营管理、客群洞察、推广营销、实现 营销的“点对点”高效精准的传播,是新一代人工智能思维下的营销新武器。
店内优化
客流实时监测
顾客质量和转化率
顾客运动轨迹热点动图
店内商品试用、转化率
新客招募
厘米级精准定位新客,信息采集分析
对接各个广告平台,精准投放
广告效果评估
提高活动效果
展示真实人流,轨迹动图,客观评估活动效果
场景式营销,广告实时送达
用户画像
了解品牌受众,帮助品牌定位
进店顾客人群画像采集
人员、物品管理
优化员工管理系统,监测到岗及工作时间
贵重物品定位,防盗防损
优化库存管理
探针
集探针,iBeacon,商品触碰探测为一体
wifi与gprs两种上报信息方式
搭载gps模块,采集地理位置信息
出色的定位技术
手机号与mac地址绑定方案
平台化运作,提供丰富的上层接口给集成商
解决方案
购买地址:https://detail.1688/offer/551150997804.html?spm=b26110380.sw1688.mof001.1.b4WnET
或阿里巴巴搜索:58数云、潜客宝
手机数据采集平台
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并
我们尽快联系您