- ?
任正非:重视数据的录入和采集,这是人工智能和自动化的源头
Tobias
展开
题图来源:视觉中国
今年初,华为总裁任正非在人工智能应用GTS(全球技术服务)研讨会上明确了GTS人工智能对华为的重要意义。
当时他提出,要实现高质量数据输出,在网规网优等关键场景要敢于投资,以及率先在简工勘和自动化设计方面打歼灭战。
8月29日,华为专门召开了GTS人工智能实践进展的汇报会。任正非提醒,虽然GTS机器学习有了很大的进步,但仍然需要重视数据的录入和采集,这是人工智能和自动化的源头。
会议上,任正非对于华为内部人工智能发展提出了三点要求:
一、聚焦内部效率提升,利用人工智能改变作业模式、简化管理,结合业务场景解决一线实际问题。
二、围绕业务,持续加大GTS数据系统、AI算法和AI 使能平台的投资。
三、人工智能未来对内要横向扩张,与周边部门协同产生倍增效益;客户界面升级服务内容,在设备和网络的生命周期内,创造更大的价值。
会议还透露,华为在全球有460万站点,每年会在100万站点上作业。任正非希望在5G时代,能先把华为的基站连起来。
任正非提出了加快开发公司统一的人工智能平台要求,部署统一的人工智能训练环境,并期待在2018年首先在GTS实践和应用。(钛媒体记者李程程整理报道)
附:任正非在GTS人工智能实践进展汇报会上的讲话
一、聚焦内部效率提升,利用人工智能改变作业模式、简化管理,结合业务场景解决一线实际问题。
人工智能的核心在于应用,GTS把人工智能作为一个工具,研究海量重复性活动的智能化自动化,提升人的效率和辅助人的工作。从你们的探索来看,实践经验非常重要。
在人工智能和自动化推动过程中,要关注交付服务流程以及人员思想、行为模式的改变,如果他们还是老一套思路,不重视数据的录入和采集,我们人工智能和自动化就会失去源头,同时要看到人工智能是一个持续演进和迭代的过程,大家在推进过程中要不急不躁,持续改进,关键要抓好数据治理和平台构架设计,保证我们大方向正确,在正确的方向上加快迭代,小步快跑。
第一,利用人工智能简化站点作业活动,把设计、报告自动化,同时要联合产品线,构建免安装、免调测网络。
我们在全球有460万站点,每年会在100万站点上作业,任何一次的站点作业都是成本。要通过构建站点信息库,开发站点3D扫描能力,把站点勘测简单化,上站录入表格的时间也就大大节省了。以后的数据录入还可以进一步简化,捆绑一个好的语音系统,现场作业完成了,自己说一遍,表格就自动生成,然后回家把这个表格稍微修改,就能完成交付作业。
基站设计方案模型很多,现在通过机器学习,实现基站连线图和配置参数的自动化生成,降低对现场工程师的要求。面向未来,要在设备模型归一、免安装、免调测上做研究。5G时代万物互联,能不能先把我们的基站连起来?荒山野岭,咱们有多少站点?应该是数百万个。可以请位快递哥骑个摩托车上山,把基站挂上,通电一开,无线连接所有设备都自动连上了,这样减少了错误,也节省了人工。
质量检查只要拍个照,通过与标准图样对比,分包商在站点安装的时候就可以检测安装质量的好坏,一次把事情做对,避免了多次上站,节省了工时,提升了效率。不要小看1~2个小时的节省,这是一个点,若是有几十万个站可推广,乘以系数,就有几十万的规模效益。
第二,网规网优要敢于应用地理、测绘、数学等先进技术和新的业务模式,只要能提升效果,都为我所用。
网规网优基于数据、算法、成本的影响,选择人工智能突破口,通过“分析机器人”提升人员效率,在无线干扰分析、天馈系统方向角优化调整等方面加强人工智能技术的引入,提升无线网络优化规划效率,同时基于产品数据的虚拟路测是一个方向,不需要路测就可以清楚网络的信号状况,一个城市节省3000公里路测,十几个城市就相当于绕地球一圈。
人工智能理论是所有人类瑰宝,都可以为我所用,而不只是我们的理论。网规网优是一个基于数据的业务,人工智能也容易发挥效益,所以我们要敢于招一些统计学、系统工程学、哲学、遥感、遥测……等专业的优秀博士、硕士,就像当年我要求招一些地理测绘专业的人员一样,只要实践两年,自然就明白了。
第三,万亿存量是我们的优势,不断积累小样本,维护模式要从被动问题处理到主动预测预防,并进一步反馈到制造、产品设计,形成闭环改进。
面对海量的、确定性的重复工作,逐步将复杂的成千上万的场景收敛,通过表格、建模等方法不断的总结提炼经验。就像我年轻的时候,一个庞大的数字设备,出了问题就一次一次的闪灯,从闪灯中慢慢看集中在哪个区,再看电路,一判断,是电阻坏了,然后打开,修好了,这就是小样本!这些小样本提供给你们,你们再归纳、总结,上升到理论高度,就是故障模型。
维护的最终模式要从被动问题处理走向预测预防为主。问题处理方面,我们至少可以把问题经验库丰富起来,谁暴露的问题最多、解决的最好,也可以搞小奖励。在预测预防方面,通过障碍发现的芯片及批次等相关问题要进一步反馈到公司的制造部门、产品设计环节,从源头上提升设备的稳健性。
二、围绕业务,持续加大GTS数据系统、AI算法和AI 使能平台的投资。
第一,行为即记录,记录即数据,构建并持续完善GTS数据系统。
数据是一门科学,是人工智能的基础,要把业界做得好的方法借鉴过来。GTS沿着作业活动,把作业过程、对象、规则和经验数字化,持续完善GTS的数据系统。各产品线也要把自己的产品数字化,这是服务数字化的基础。要强化云平台基础设施建设,丰富单兵数据采集工具,给每个员工配个数据采集器,员工在现场作业完后,回到驻地处理一下,一按键就发出去了。
数据要以用促建,利用表格、建模等方法输出作业数据,将高质量的作业数据输出作为作业完成的衡量标准,要形成对工程师高质量作业数据输出的牵引,形成指导和模板。
第二,算法要服务于业务,算法科学家与熟悉服务场景的工程师紧密配合,在服务客户的战场上提升能力
人工智能应用是实践科学,在实践和应用当中迭代式前进,效果不是一蹴而就的。实践初期,算法达不到高级工程师的水平也要坚持使用,以人为主,机器为辅,对算法进行持续的训练和提升。
人工智能开发,算法专家、产品线专家要与GTS业务专家组成混合编队,共同识别实际场景中的AI应用机会、理解业务场景、设计算法模型、优化算法效果。
第三,加快开发公司统一的人工智能平台,并于2018年首先在GTS实践和应用。
开发公司统一的人工智能平台,部署统一的人工智能训练环境,首先在GTS实践和应用,把GTS积累的站点作业、网络维护、网规网优领域的算法、知识、方法、经验都固化到这个平台上。
人工智能平台在GTS的应用要急用先行、小步快跑,聚焦服务场景一个个解决,选择与场景匹配的、相对成熟的算法,快速构筑数据处理、模型训练等工程能力,边战斗边优化,并于2018年将平台部署在GTS系统上。
三、人工智能未来对内要横向扩张,与周边部门协同产生倍增效益;客户界面升级服务内容,在设备和网络的生命周期内,创造更大的价值。
第一,自动化也是人工智能,改善一个点,可能有几十万个着力点可推广,就有几十万的倍增效益。
跨领域也应有着力点进行推广,通过数据互联互通、业务交叉融合,公司很多部门就可以精简了。比如财务在人工智能上也梳理了100多个点,其中有些点和GTS有交互,如项目核算要开票,GTS可以这个点为起点,横向发展到财务那里去。
我们要矢志不渝地前进,让一些确定性工作自动化、智能化,减少重复劳动。不能总是强调人工智能对模糊问题的判断和处理,为什么对确定性问题就不行呢?自动化也是人工智能。改善一个点,乘以系数,就可能有几十万的倍增效益。GTS人员都应实验性地“洗一次澡”,有些人在循环中变得更厉害,产生新的工作方法,大幅提高工作效率。
第二,在自身实践成功的基础上,利用数据和智能技术,升级服务内容、构建在线服务模式,解决客户挑战。
基于万亿存量数据的优势,通过改善自身管理的循环实践,构建全球智能网络大平台,平台的能力再以服务方式向客户开放,并将服务内容扩展到设备和网络的全生命周期,解决客户挑战的同时华为也获得收益。
站点的选择,能否根据流量预测和动态变化,进行精准的网络规划?几百万台设备,也不能一天二十四小时高速开着,如果能根据流量动态设定产品能耗,是不是就可能极大地提升网络和能源效率?更远的未来,能否将预防预测能力延伸到整个网络,有预见地应对自然灾害、重大事件等带来的挑战。
我们抓住这些机会,升级服务内容,就可以利用在线服务等手段,在网络全生命周期持续为客户创造价值。
更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App
- ?
36氪首发 | 做环保、消防物联网平台,「知路科技」获数千万元A轮融资
Hebe
展开
传统产业的物联网升级已成为趋势,基于物联网可以自动、实时采集大量原本无法获取,或需要人工定期采集的数据,用于实时监测、完成特定任务等。例如在消防设备上布设传感,替代人工定期检测等。
同时,物联网升级也存在大量问题。底层终端接入,接口协议多样,工作环境差异大,费时费力;通信层面的带宽、可靠性、延时问题;行业需求复杂多样,定制化程度高等。
“应该在什么领域,怎么提供物联网升级服务,才能产生较高的收益?”
—— 这是众多服务提供商的普遍困惑。
物联网平台服务商知路科技,通过5年十余个领域的物联网升级探索,已形成了较清晰的模式:基于自研通用物联网操作系统平台,以环保、消防为重点领域,快速、低成本提供从终端接入、通信到云端服务的物联网平台方案。
近日36氪获悉,知路科技已获得君盛投资数千万元A轮投资。此前,知路科技还获得过中科创星、宜华资本、深圳松禾彩梦想等多家机构的数千万元投资。
下面具体看看知路科技是怎么做的。
知路科技于2014年初始创于华为研发班底,核心技术骨干均具备近20年的研发技术经验。
成立前三年,知路在医疗、能源、工业制造、交通、教育等领域,承接了大量物联网方案项目,最终沉淀研发出MIA智能物联网操作系统平台。
简单说,MIA平台就是物联网解决方案的“Android”系统,可高效实现各类物联网感知层的前端设备、传感器的连接控制,进而实现终端联动、自组网、前端数据解析等能力。而这些能力是物联网解决方案每次都会涉及的,因而可以减少大量重复开发工作。
有了MIA平台,还得找准落地场景。
知路又花了一年时间探索,结合此前3年的跨行业项目经验,于2017年下半年,确定了环保和消防这两大核心落地领域。
智慧环保。基于MIA平台,知路开发出大气、扬尘、污水、油烟、园区、各类自然水体的环保在线监测平台。功能上,能够为政府、国企、央企客户,提供监测数据采集、分析、污染预测、成因分析、决策建议,和效果检查的闭环业务流,而非仅仅做BI展示。
智慧消防。知路采取了和行业龙头深度捆绑合作的模式。依托合作伙伴的产业资源,重点提供智慧消防平台的研发技术支持,以支持合作伙伴智慧消防项目落地,逐步过渡到在消防产业内,提供平台数据服务的商业模式。
知路是如何选择落地行业的呢?创始人梁晓东总结了4点:
刚需。例如环保行业,政府为了经济结构调整、可持续发展,在大力推动智慧环保产业。客户毛利率高。决定了客户的付费能力。有较一致标准。决定了可复制性,例如环保行业有较标准的国标、部标,解决方案不会差异太大。一定壁垒。包括一定的技术壁垒和行业knowhow壁垒,能积累自己的先发优势。盈利模式上,知路目前以硬件产品、方案定制开发、平台服务费为主。
梁晓东告诉36氪,知路今年已经从过去的核心平台研发和广泛尝试,进入到明确的场景落地阶段,明年整体营收会有大幅增长,预计可达5000万元。
目前,知路已开启了新一轮融资。
君盛投资高级投资经理朱志豪表示:“物联网在技术层面涉及到硬件、软件、通信、云的集成和融合,且各行业的需求跨度极大,我们会着重考察几个方面:第一,团队构成、技术经验及其后续的战略打法。路科技核心团队大部分来自华为,已经具备了to运营商级别的系统搭建能力。第二,找到对物联网有刚需且有支付能力的行业进行落地,有实际落地的项目。知路科技已经在多个行业有标杆项目落地。
——————
我是36氪记者陈绍元,关注物联网、AI、科技,交流或寻求报道(不收费)加微信:963757163,请注明公司、职位、姓名,否则不加。
- ?
APP数据采集是怎么实现的
飞虫
展开
最近半年,我们八爪鱼陆续接到好几个APP数据采集的项目需求,我在群里面,偶尔也看到有些用户在问,有没有APP数据采集的工具。鉴于我们做过的几个APP数据采集项目的经验,我可以告诉大家,现在APP数据采集,市面上还没有通用的工具。我们八爪鱼内部是有一套工具,但由于使用的难度较高,需要编写脚本,所以不对普通用户公开,我们仅接受项目定制。
虽然不对外公开,但并不妨碍我们将技术分享出来,APP数据采集,一般走以下两种方式:
1.两种思路
1. 抓包
2. HOOK
2.抓包
有代码经验或APP开发的同学都很容易理解,其实很多APP,走的都是webservice通讯协议的方式,并且由于是公开数据,而且大部分是无加密的。所以只要对网络端口进行监测,对APP进行模拟操作,即可知道APP里面的数据是如何获取的。
我们只需要写代码模拟请求,无论POST还是GET,即可得到该请求所返回的信息。再通过对返回的信息结构化解析,即可得到我们想要的数据。
public static void main(String[] args) {
Spider.create(new GithubRepoPageProcessor())
//从https://github/****开始抓
.addUrl("https://github/****")
//设置Scheduler,使用Redis来管理URL队列
.setScheduler(new RedisScheduler("localhost"))
//设置Pipeline,将结果以json方式保存到文件
.addPipeline(new JsonFilePipeline("D:\\data\\webmagic"))
//开启5个线程同时执行
.thread(5)
//启动爬虫
.run();
}
以模拟采集“meizu”应用市场为例
应用市场产品抓包返回参数整个抓包过程3.HOOK技术
HOOK技术是一种走操作系统内核的技术,由于安卓系统是开源的,所以可以借助一些框架修改内核,从而实现你要的功能。HOOK的形式,我们走的是Xposed框架。Xposed是一款可以在不修改任何其他开发者开发的应用(包括系统服务)的情况下,改变程序运行的一个开源框架服务。基于它可以制作出许多功能强大的模块,以此来达到应用程序按照你的意愿运行的目的。
如果把安卓手机看做一座城堡,那Xposed可以让你拥有一个上帝视角,城里的运作细节尽收你眼底,还能让你插一手改变城堡的运作规律。
什么意思呢?简单的说就是你可以通过他,自动化的控制你的APP。如果将我们的APP开在模拟器上,我们可以通过编码,通过他告诉APP这一步干什么,下一步干什么。你把它理解成类似游戏打怪外挂就可以了。
而他每走一步,APP与服务端交互的数据,均可获取下来。这种方式广泛用于一些成熟的APP。比如某信采集。
public class HookActivity implements IXposedHookLoadPackage {
@Override
public void handleLoadPackage(LoadPackageParam lpparam) throws Throwable {
final String packageName = lpparam.packageName;
XposedBridge.log("--------------------: " + packageName);
try {
XposedBridge.hookAllMethods
(Activity.class, "onCreate", new XC_MethodHook() {
@Override
protected void afterHookedMethod(MethodHookParam param)
throws Throwable {
XposedBridge.log("=== Activity onCreate: " + param.thisObject);
}
});
} catch (Throwable error) {
XposedBridge.log("xxxxxxxxxxxx: " + error);
}
}
}
其实我们八爪鱼曾经也想开发一款通用的APP数据采集工具,并且两年前在这块投入研究了小半年,我们做出了一款APP采集脚本编辑工具,可以让一款APP的数据采集项目缩减到3-5天即可开发完成。但我们认为,这个工具需要编写脚本一般用户是比较难上手的,所以仅作为内部项目使用。
以HOOK某APP为例:
HOOK指令打开某4.这些年走过的坑
聊完APP采集的思路,我们跟大家分享一些遇过的坑吧,让大家乐一乐
坑一:签名算法
以某信的文章列表页及某信息页为例,对其http访问进行抓包,会发现其url的一个核心参数是我们无法知道如何生成的,这就导致,我们不可能直接用该url进行信息爬取;签名算法如果无法破解,HTTP这条路就是死路了。
坑二:http爬取回来的信息和页面显示不一致
以某信的某信息页为例,对比直接访问某信页面及http爬取的信息,可明显发现http爬取到的信息较少。造成得两种方式都用,才能既照顾速度又照顾完整性。
坑三:模拟器中的坑
APP自动识别你的运行环境进行屏蔽,最厉害的还是某信,连你是用模拟器打开还是真机打开,是什么内核的,全部进行限制。曾经见过牛人,找某手机厂商专门定做真机来配合。
坑四:帐号的坑
这个坑就有点大了,要找号、养号,都不是件容易的事情,更惨的是封号,真真让你一夜回到解放前。
- ?
不用写代码,史上最全QQ音乐播单数据一键采集
伊甸园
展开
本文主要介绍如何使用后羿采集器的智能模式,免费采集QQ音乐播单数据的播单名、播单链接、播放量、歌曲、歌手等信息。
采集工具简介:
后羿采集器是一款基于人工智能技术的网页采集器,只需要输入网址就能够自动识别网页数据,无需配置即可完成数据采集,是业内首家支持三种操作系统(包括Windows、Mac和Linux)的网络爬虫软件。
该软件是一款真正免费的数据采集软件,对采集结果导出没有任何限制,没有编程基础的小白用户也可轻松实现数据采集要求。
采集对象简介:
QQ音乐是腾讯公司推出的网络音乐平台,是中国互联网领域领先的正版数字音乐服务的领先平台,有着个性明星主题:大咖装,添星妆!同时也是一款免费的音乐播放器,始终走在音乐潮流最前端,向广大用户提供方便流畅的在线音乐和丰富多彩的音乐社区服务。
采集字段:
播单名、播单链接、播单作者、播放量、歌曲、歌手、专辑、时长
功能点目录:
如何采集列表+详情页类型网页
什么是深入采集
采集结果预览:
下面我们来详细介绍一下如何免费采集QQ音乐播单信息的数据,我们以经典音乐播单为例,具体步骤如下:
步骤一:下载安装后羿采集器,并注册登录
1、打开后羿采集器官网,下载并安装爬虫软件工具—后羿采集器软件
2、点击注册登录,注册新账号,登录后羿采集器
【温馨提示】您可以直接使用此款爬虫软件,不需要进行注册,但是匿名账户下的任务在切换到注册用户时会丢失,因此建议您注册后使用。
后羿采集器为神箭手云旗下产品,如果您是神箭手用户,可直接登录。
步骤二:新建采集任务
1、复制QQ音乐经典音乐播单的网页(需要搜索结果页的网址,而不是首页的网址)
2、新建智能模式采集任务
您可以在软件上直接新建采集任务,也可以通过导入规则来创建任务。
步骤三:配置采集规则
1、设置提取数据字段
在智能模式下,我们输入网址后软件即可自动识别出页面上的数据并生成采集结果,每一类数据对应一个采集字段,我们可以右击字段进行相关设置,包括修改字段名称、增减字段、处理数据等。
在列表页上,我们需要采集QQ经典音乐播单的播单名、播单链接、播单作者及播放量等信息,字段设置效果如下:
2、使用深入采集功能提取详情页数据
在列表页上只展示了QQ音乐经典播单的整体信息,如果需要采集播单的具体歌曲内容,我们需要右击播单链接,然后使用“深入采集”功能,跳转到详情页进行采集。
点此了解如何采集列表+详情页类型网页。
在详情页上默认的是单页类型的网页,但是我们播单歌曲是列表类型的,这时候我们可以手动设置抽取字段,并修改字段名称。
详情页字段设置效果如下:
步骤四:设置并启动采集任务
1、设置采集任务
完成了详情页的采集数据添加,我们跳转回列表页,然后开始启动采集任务。在启动之前我们需要对采集任务进行一些设置,从而提高采集的稳定性和成功率。
点击“设置”按钮,在弹出的运行设置页面中我们可以进行运行设置和防屏蔽设置,这里我们勾选“跳过继续采集”,设置“2”秒请求等待时间,勾选“不加载网页图片”,防屏蔽设置就按照系统默认设置,然后点击保存。
2、启动采集任务
点击“保存并启动”按钮,可在弹出的页面中进行一些高级设置,包括定时启动、自动入库和下载图片,本次示例中未使用到这些功能,直接点击“启动”运行爬虫工具。
【温馨提示】免费版本可以使用非周期性定时采集功能,下载图片功能是免费的。个人专业版及以上版本可以使用高级定时功能和自动入库功能。
3、运行任务提取数据
任务启动之后便开始自动采集数据,我们从界面上可以直观的看到程序运行过程和采集结果,采集结束之后会有提醒。
步骤五:导出并查看数据
数据采集完成后,我们可以查看和导出数据,后羿采集器支持多种导出方式(手动导出到本地、手动导出到数据库、自动发布到数据库、自动发布到网站)和导出文件的格式(EXCEL、CSV、HTML和TXT),我们选择自己需要的方式导出。
【温馨提示】:所有手动导出功能都是免费的。个人专业版及以上版本可以使用发布到网站功能。
- ?
让您了解大数据采集最新技术
Mora
展开
现在谈论大数据已经没有新意了,形形色色的产品、平台和公司都贴满大数据标签,但大数据却并没有掀起预期飓风,甚至还被冠以“伪命题”污名。
大数据开启了一个大规模生产、分享和应用数据的时代,它给技术和商业带来了巨大的变化。大数据在核心领域的渗透速度有目共睹,然而调查显示,未被使用的信息比例高达99.4%,很大程度都是由于高价值的信息无法获取采集。
因此在大数据时代背景下,如何从大数据中采集出有用的信息已经是大数据发展的关键因素之一,数据采集才是大数据产业的基石。那么什么是大数据采集技术呢?
什么是数据采集?
数据采集(DAQ), 又称数据获取,是指从传感器和其它待测设备等模拟和数字被测单元中自动采集信息的过程。数据分类新一代数据体系中,将传统数据体系中没有考虑过的新数据源进行归纳与分类,可将其分为线上行为数据与内容数据两大类。
线上行为数据:页面数据、交互数据、表单数据、会话数据等。
内容数据:应用日志、电子文档、机器数据、语音数据、社交媒体数据等。
大数据的主要来源:1)商业数据 2)互联网数据 3)传感器数据
传统数据采集的不足
传统的数据采集来源单一,且存储、管理和分析数据量也相对较小,大多采用关系型数据库和并行数据仓库即可处理。对依靠并行计算提升数据处理速度方面而言,传统的并行数据库技术追求高度一致性和容错性,根据CAP理论,难以保证其可用性和扩展性。
大数据采集新的方法
以博为软件101异构数据采集技术为例:通过获取软件系统的底层数据交换、软件客户端和数据库之间的网络流量包,基于底层IO请求与网络分析等技术,采集目标软件产生的所有数据,将数据转换与重新结构化,输出到新的数据库,供软件系统调用。
博为软件技术特点如下:
1. 无需原软件厂商配合;
2. 实时数据采集,数据端到端的响应速度达秒级;
3. 兼容性强,可采集汇聚Windows平台各种软件系统数据;
4. 输出结构化数据,作为数据挖掘、大数据分析应用的基础;
5. 自动建立数据间关联,实施周期短、简单高效;
6. 支持自动导入历史数据,通过I/O人工智能自动将数据写入目标软件;
7. 配置简单、实施周期短。
优点:其优势在于不需要“接口”配合,这就摆脱了对软件厂商的依赖。特别是在在需要集成多个系统数据时,不仅能节省大量时间、人力与资金,实现“一站式”完成;还避免了因个别系统开发团队解体、源代码丢失等原因导致系统数据集成出现烂尾的情况。
缺点:只采集Windows平台的各软件系统数据
版权声明:本文部分来自网络,如有侵权,请联系删除!
- ?
云飞虫情信息自动采集传输设备实现监测系统智能化
Zuza
展开
虫情信息自动采集传输设备是新一代的虫情测报工具,该灯采用不锈钢材料,利用现代光、电、数控技术,实现虫体远红外自动处理、接虫袋自动转换、整灯自动运行等功能,在无人监管的情况下,能自动完成诱虫、杀虫、收集、分装、排水等系统作业。虫情信息自动采集传输设备可对昆虫的发生、发展进行实时自动拍照、实现图像采集和监测分析,自动上传到远端的云飞物联网监控服务平台,为农业现代化提供服务,满足虫情预测预报、采集标本的需要。
云飞虫情信息自动采集传输设备在农业生产中,传统农作物病虫害监测设备随着信息技术的应用面临新变革,虫情信息自动采集传输设备兼容性强,无流量、通过无线传输将全天候实时采集信息数据发送到中心站广泛收集农业生产地的实时空气、土壤、病虫害等数据;将物联网数据接入农业大数据平台,进行归纳整理与系统分析;物联网数据结合专家诊断,海量数据将合并最终生成为当时当地特定农作物生长模型,通过大数据平台基地产品信息和市场信息的海量数据分析将总结出生产和销售规律;基于大数据形成的作物生产模型,将反过来指导物联网生产,最终实现精准化和自动化的农业大数据生产。
虫情信息自动采集传输设备实现农业有害生物测报的数字化、智能化、可视化、规范化、智能化,林业部门可以应用,测报人员远程就可以了解森林虫情动态,为虫情防控工作的开展提供了不少方便。
- ?
学会使用PowerBI/Excel批量采集网页数据
羞答答
展开
前面介绍PowerBI数据获取的时候,曾举了一个从网页中获取数据的例子,但当时只是爬取了其中一页数据,这篇文章来介绍如何用PowerBI批量采集多个网页的数据。
本文以智联招聘网站为例,采集工作地点在上海的职位发布信息。
下面是详细操作步骤:
(一)分析网址结构
打开智联招聘网站,搜索工作地点在上海的数据,
下拉页面到最下面,找到显示页码的地方,点击前三页,网址分别如下,
http://sou.zhaopin/jobs/searchresult.ashx?jl=%e4%b8%8a%e6%b5%b7&sm=0&sg=fe782ca83bfa4b018d27de559d0a5db0&p=1http://sou.zhaopin/jobs/searchresult.ashx?jl=%e4%b8%8a%e6%b5%b7&sm=0&sg=fe782ca83bfa4b018d27de559d0a5db0&p=2http://sou.zhaopin/jobs/searchresult.ashx?jl=%e4%b8%8a%e6%b5%b7&sm=0&sg=fe782ca83bfa4b018d27de559d0a5db0&p=3
可以看出最后一个数字就是页码的ID,是控制分页数据的变量。
(二)使用PowerBI采集第一页的数据
打开PowerBI Desktop,从网页获取数据,从弹出的窗口中选择【高级】,根据上面分析的网址结构,把除了最后一个页码ID的网址输入第一行,页码输入第二行,
从URL预览中可以看出,已经自动把上面两行的网址合并到一起;这里分开输入只是为了后面更清晰的区分页码变量,其实直接输入全网址也是一样可以操作的。
(如果页码变量不是最后一位,而是在中间,应该分三行输入网址)
点击确定后,发现出来很多表,
从这里可以看出,智联招聘网站上每一条招聘信息都是一个表格,不用管它,任意选择一个表格,比如勾选Table0,点击编辑进入Power Query编辑器。
在PQ编辑器中直接删除掉【源】之后的所有步骤,然后展开数据,并把前面没有的几列数据删除。
这样第一页的数据就采集过来了。然后对这一页的数据进行整理,删除掉无用信息,添加字段名,可以看出一页包含60条招聘信息。
这里整理好第一页数据以后,下面进行采集其他页面时,数据结构都会和第一页整理后的数据结构一致,采集的数据可以直接拿来用;这里不整理也没关系,可以等到采集所有网页数据后一起整理。
如果要大批量的抓取网页数据,为了节省时间,对第一页的数据可以先不整理,直接进入下一步。
(三)根据页码参数设置自定义函数
这是最重要的一步。
还是刚才第一页数据的PQ编辑器窗口,打开【高级编辑器】,在let前输入:
(p as number) as table =>
并把let后面第一行的网址中,&后面的"1"改为(这就是第二步使用高级选项分两行输入网址的好处):
(Number.ToText(p))
更改后【源】的网址变为:
"http://sou.zhaopin/jobs/searchresult.ashx?jl=%e4%b8%8a%e6%b5%b7&sm=0&sg=fe782ca83bfa4b018d27de559d0a5db0&p="&(Number.ToText(p)))),
确定以后,刚才第一页数据的查询窗口直接变成了自定义函数的输入参数窗口,Table0表格也变成了函数的样式。为了更直观,把这个函数重命名为Data_Zhaopin.
到这里自定义函数完成,p是该函数的变量,用来控制页码,随便输入一个数字,比如7,将抓取第7页的数据,
输入参数只能一次抓取一个网页,要想批量抓取,还需要下面这一步。
(四)批量调用自定义函数
首先使用空查询建立一个数字序列,如果想抓取前100页的数据,就建立从1到100的序列,在空查询中输入
={1..100}
回车就生成了从1到100的序列,然后转为表格。gif操作图如下:
然后调用自定义函数,
在弹出的窗口中点击【功能查询】下拉框,选择刚才建立的自定义函数Data_Zhaopin,其他都按默认就行,
点击确定,就开始批量抓取网页了,因为100页数据比较多,耗时5分钟左右,这也是我第二步提前数据整理造成的后果,导致抓取比较慢。展开这一个表格,就是这100页的数据,
至此,批量抓取智联招聘100页的信息完成,上面的步骤看起来很多,实际上熟练掌握以后,10分钟左右就可以搞定,最大块的时间还是最后一步进行抓取数据的过程比较耗时。
网页的数据是不断更新的,在操作完以上的步骤之后,在PQ中点击刷新,可以随时一键提取网站实时的数据,一次做好,终生受益!
以上主要使用的是PowerBI中的Power Query功能,在可以使用PQ功能的Excel中也是可以同样操作的。
当然PowerBI并不是专业的爬取工具,如果网页比较复杂或者有防爬机制,还是得用专业的工具,比如R或者Python。在用PowerBI批量抓取某网站数据之前,先尝试着采集一页试试,如果可以采集到,再使用以上的步骤,如果采集不到,就不用再耽误工夫了。
现在就打开PowerBI/,尝试着抓取你感兴趣的网站数据吧。
- ?
QQ数据采集软件-QQ营销必备
徐豪英
展开
QQ数据采集器-QQ营销必备工具
导语
现在是大数据时代,无论做什么营销都需要用到数据。数据是根本,数据能引导你的营销思维。做QQ营销同样需要大量的精准数据,今天小编为大家介绍一款QQ数据采集软件,这款软件既可以采集精准客户QQ,同时也可以采集精准客户QQ群以及QQ群成员。
软件功能特点
⊙支持按关键词采集精准客户qq
⊙支持自动检测所采集好友是否为单双向好友
⊙支持自动检测所采集qq是否开通临时会话功能
⊙支持自动识别qq所在城市、性别。年龄
⊙支持按关键词采集精准客户qq群
⊙支持自动筛选出群主qq
⊙支持自动检测是否可以直接添加qq群
⊙支持以文本文档格式导出qq群
⊙支持采集qq附近的人(全国定位)
⊙支持采集本地好友和群
⊙支持采集空间qq
⊙支持采集微博听众
⊙支持采集企业qq
⊙支持论坛qq采集
软件功能效果展示
易推客营销软件
- ?
国内五大主流网站内容抓取工具、采集软件大盘点
禹严青
展开
大数据技术用了多年时间进行演化,才从一种看起来很炫酷的新技术变成了企业在生产经营中实际部署的服务。其中,数据采集产品迎来了广阔的市场前景,无论国内外,市面上都出现了许多技术不一、良莠不齐的采集软件。
今天,我们将对比国内五大主流采集软件优缺点,帮助你选择最适合的爬虫,体验数据hunting带来的快感。
国内篇
1.火车头
作为采集界的老前辈,我们火车头是一款互联网数据抓取、处理、分析,挖掘软件,可以抓取网页上散乱分布的数据信息,并通过一系列的分析处理,准确挖掘出所需数据。它的用户定位主要是拥有一定代码基础的人群,适合编程老手。
采集功能完善,不限网页与内容,任意文件格式都可下载具有智能多识别系统以及可选的验证方式保护安全支持PHP和C#插件扩展,方便修改处理数据具有同义,近义词替换、参数替换,伪原创必备技能Conclusion:火车头适用于编程能手,规则编写容易,软件的定位比较专业而且精准化。
2.八爪鱼
一款可视化免编程的网页采集软件,可以从不同网站中快速提取规范化数据,帮助用户实现数据的自动化采集、编辑以及规范化,降低工作成本。云采集是它的一大特色,相比其他采集软件,云采集能够做到更加精准、高效和大规模。
自定义采集过程中,八爪鱼采集器系统自写的Xpath、自动生成的流程,可能无法满足数据采集需求。对数据质量要求高,则需自写Xpath,调成流程图等,以优化规则。
使用自定义采集的同学,虽然八爪鱼操作简单,比较容易上手。但是,仍需对八爪鱼采集原理有所了解,看完相关教程,循序渐进,成长周期较长。
可视化操作,无需编写代码,制作规则采集,适用于零编程基础的用户云采集是其主要功能,支持关机采集,并实现自动定时采集
Conclusion:八爪鱼是一款适合小白用户尝试的采集软件,云功能强大,当然爬虫老手也能开拓它的高级功能。
3.集搜客
一款简单易用的网页信息抓取软件,能够抓取网页文字、图表、超链接等多种网页元素。同样可通过简单可视化流程进行采集,服务于任何对数据有采集需求的人群。
可视化流程操作,与八爪鱼不同,集搜客的流程重在定义所抓取的数据和爬虫路线,八爪鱼的规则流程十分明确,由用户决定软件的每一步操作
支持抓取在指数图表上悬浮显示的数据,还可以抓取手机网站上的数据
会员可以互助抓取,提升采集效率,同时还有模板资源可以套用
Conclusion:集搜客操作较简单,适用于初级用户,功能方面没有太大的特色,后续付费要求比较多。
4.神箭手云爬虫
一款新颖的云端在线智能爬虫/采集器,基于神箭手分布式云爬虫框架,帮助用户快速获取大量规范化的网页数据。
直接接入代理IP,避免IP封锁
自动登录验证码识别,网站自动完成验证码输入
可在线生成图标,采集结果以丰富表格化形式展现本地化隐私保护,云端采集,可隐藏用户IP
Conclusion: 神箭手类似一个爬虫系统框架,具体采集还需用户自写爬虫,需要代码基础。
5.狂人采集器
一套专业的网站内容采集软件,支持各类论坛的帖子和回复采集,网站和博客文章内容抓取,分论坛采集器、CMS采集器和博客采集器三类。
支持对文章内容中的文字、链接批量替换和过滤可以同时向网站或论坛的多个版块一起批量发文具备采集或发帖任务完成后自动关机功能
Conclusion: 专注论坛、博客文本内容的抓取,对于全网数据的采集通用性不高。
注:给火车采集器的新手们一点学习建议
火车采集器是一个非常专业的数据抓取和数据处理软件,对软件使用者有较高的技术要求, 使用者要有基本的HTML基础,能看得懂网页源码,网页结构。
同时如果用到web发布或数据库发布,则对自己文章系统及数据存储结构要非常了解。
- ?
干货推荐|教你用采集软件批量采集新闻信息数据并搭建语言数据库
Dawn
展开
半个世纪以来,随着计算机技术全面融入社会生活,信息爆炸已经积累到了一个开始引发变革的程度。它不仅使世界充斥着比以往更多的信息,而且其增长速度也在加快,创造出了“大数据(BigData)”这个概念。如今,这个概念几乎应用到了所有人类智力与发展的领域中。
BigData是近来的一个技术热点,历史上,数据库、数据仓库、数据集市等信息管理领域的技术,很大程度上也是为了解决大规模数据的问题。被誉为数据仓库之父的BillInmon早在20世纪90年代就经常提及BigData。
21世纪是数据信息大发展的时代,移动互联、社交网络、电子商务等极大拓展了互联网的边界和应用范围,各种数据正在迅速膨胀并变大。
近年来互联网、云计算、移动和物联网的迅猛发展。无所不在的移动设备、RFID、无
线传感器每分每秒都在产生数据,数以亿计用户的互联网服务时时刻刻在产生巨量的交互。
互联网(社交、搜索、电商)、移动互联网(微博)、物联网(传感器,智慧地球)、车联网、GPS、医学影像、安全监控、金融(银行、股市、保险)、电信(通话、短信)都在疯狂产生着数据:1)全球每秒钟发送2.9百万封电子邮件;2)每天会有2.88万个小时的视频上传到Youtube;3)推特上每天发布5千万条消息;4)每天亚马逊上将产生6.3百万笔订单;4)每个月网民在Facebook上要花费7千亿分钟;5)Google上每天需要处理24PB的数据。
我们在一个大数据的时代漩涡中,每天都有是以亿计的数据产生,如何获取这些数据,如何使用这些数据,如何用好这些数据,都是一个难题。之前遇到的一位做语言学研究的小姐姐,研究课题需要建立自己的语言数据库,每次都要在新闻网站上去搜索关键字的文章,然后复制黏贴下来,非常的辛苦和费事费时,我听说之后非常吃惊,问她这种机械却又累人的工作,为什么不让软件解决,而要自己一个个手动复制黏贴。她的回答是自己是学文科的,又不会写代码,又搞不懂编程,所以她只能自己辛苦一点了。听完她的回答之后,我很心痛,所以我立马给他推荐了一款软件,帮助她从复杂的复制黏贴工作中解脱出来。
这款软件对小白用户十分友好,智能模式只要输入网址就能帮忙采集了,是谷歌大牛回国写的一款软件,而且还是免费采集和导出的,现在把这个软件分享出来,希望对大家有所帮助。我会以新闻网站中国日报为例,为大家演示如何通过这款爬虫软件自动采集数据。
首先,需要下载安装软件,大家可以到官网上下载最新版本的软件,然后注册新用户登录,游客用户也可以采集数据,但是可能会丢失,建议还是注册新用户。
首先,复制需要采集的网址,打开软件输入网址,新建智能采集任务。
在智能模式下,我们输入网址后软件即可自动识别出页面上的数据并生成采集结果,每一类数据对应一个采集字段,可以右击字段进行相关设置,包括修改字段名称、增减字段、处理数据等。
由于在列表页上只展示了部分的新闻信息,如果需要采集具体的新闻内容,我们需要右击链接使用“深入采集”功能,跳转到详情页进行采集。
接着点击“保存并启动”按钮,可在弹出的页面中进行一些高级设置,包括定时启动、自动入库和下载图片,我们如果没有用到这些功能,可以直接点击“启动”运行任务。
数据采集完毕后我们可以导出数据,这款软件比较好的一点是不仅采集免费,而是可以导出多种格式的文档,对导出也没有什么限制。
为方便查看我们导出一个Excel2007的表格,我们可以看到数据质量还是挺高的,大家可以直接使用这些数据,也可以在这个基础上对数据进行加工处理。
自动采集数据
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并