中企动力 > 商学院 > 数据采集定制
  • ?

    双11黑科技:大数据实时计算量身定制

    慕苠

    展开

    数据时代,大数据计算已经渗透到了各行各业,业务沉淀数据,数据计算产生新的业务价值,大数据计算正不断地用这种方式推动业务向前发展。电商双11,商家与消费者狂欢的背后,同样离不开大数据计算带来的价值贡献,特别是应用越来越广泛的“实时计算”。

    现实世界中,数据连续产生,并被实时采集和计算

    我们要做数据计算,挖掘产品商业价值,首要解决的问题是数据的问题。现实世界里,数据往往是随着时间的推进连续产生的,比如用户浏览商品,一系列的鼠标点击操作,会产生一连串的后台数据;开车使用手机导航,GPS定位每隔一段时间更新一次,也会不断产生日志数据;用户浏览新闻推送、搜索歌曲、监控摄像头定时采集图片上传到云端存储、视频直播等等场景,这背后生成的数据都是连续产生的。连续产生的业务数据,又被实时采集起来,就形成了数据流。

    流式数据一经采集,就可以立即参与计算,同时将计算结果投入到业务应用中,这就是实时计算。实时数据计算其实早已经进入到人们生活的方方面面了,比如天气预报,以前人们的习惯是每天接收一次天气预报信息,现在则可以实时查看天气预测,同一个时间点的天气预测会随着时间的接近越来越准确,这就是监测数据采集更新及实时数据计算带来的效果。

    根据兴趣量身定制,实时计算让产品越来越了解用户

    实时数据来源越来越多、数量越来越大,每年的数据量都在成倍地增长,这对实时计算本身是利好的,可以有更多的应用场景、更好的应用效果,还可能促成一些革命性的变化。那么,大数据实时计算还能做什么?

    在网易,考拉海购双11、618海淘盛典等活动期间,都会有一块网易有数大屏幕实时展示当前最新的销售总额、每个商品品类的销售比例、订单增长趋势、活跃用户地理位置等,各种维度的信息都在一块屏幕上不断跳动。每个用户每笔订单所产生的影响都会实时更新到大屏上。这种可视化的实时应用效果,除了增添一份电商狂欢节的氛围,更易于发现数据价值,指导市场运营、辅助商业决策。

    金融风控是另一种典型的实时计算应用场景。对金融业务这种风险敏感的业务来说,仅仅能把数据可视化是远远不够的,它需要流计算系统能够利用一些风险模型的匹配规则,去实时分析海量的用户行为数据,发现异常事件、判断风险等级,并作出相应的风险控制措施,自动化地去做报警通知、改变业务流程。通过实时计算做金融风控,带来的好处是更快、更准、更广。其他许多类似风控这样的事件驱动计算场景,实时计算都能解决好。

    实时计算在推荐领域的应用也已经很深入了。不论是新闻推荐、音乐推荐还是读书推荐,基本都已经做到了千人千面,每个人接收到的推送内容都是根据个人兴趣偏好量身定制的。而用户的兴趣偏好,往往是通过实时数据计算不断在更新的。 以新闻推送为例,当用户点击一条条推送消息时,背后产品其实时刻在对用户的行为做实时分析,实时更新用户的兴趣偏好,不断发现用户新的兴趣点,对用户越来越了解,最后给用户推送他更感兴趣的内容。再以音乐推荐为例,如果一个用户某段时间收藏了几首悲伤的歌曲,通过实时数据分析,系统可以识别出这一信息,同时有针对性的推送一些歌曲去抚慰用户。这种场景是只有实时计算才能解决的,也最能体现实时计算的价值。

    越来越多的实时计算场景会被开发出来,未来人们对“一切都在变化之中”的感受会越来越深刻。

    从“先存后算”到“边算边存”,实时计算不再怕“大”数据

    实时计算这么好,在实现层面应该怎么做,有哪些困难和挑战是必须解决的?

    首先从整体架构看,数据计算,无外乎三样东西:数据输入→计算→数据输出。传统的计算模型,以数据库为例,是先将数据存储在一个数据表中,用户通过执行查询语句触发数据库的计算操作,最后数据库完成计算后输出结果。这种“先存后算”的模型在大数据实时计算场景下是行不通的。我们所要计算的数据很“大”,一个计算结果所涉及的源数据可能是涵盖过往一天的数据,可能是上千亿条数据记录。如果每增加一些新数据,都把所有数据都重新计算一遍,这样的开销是非常大的,最终的效果会是很“慢”,达不到实时的效果。比较合理的做法是“边算边存”,意思是数据进入实时计算系统后,不一定需要先存储起来,可以直接参与计算,而且这里的计算是把当前新增的数据在之前历史数据的计算结果上做“增量计算”,同一条数据不重复参与计算,计算完成之后,再把计算结果保存起来,供业务使用,这时数据存储的压力也小了很多。同时“大”意味着数据并发很高,每秒可能需要计算上千万条新数据,这样的计算量不是单机能承受的,所以大数据实时计算要解决好的是分布式系统架构下的一系列技术问题。

    分布式实时计算面临的挑战包括很多方面。数据从采集、到计算、到输出整个过程必须做到低延迟,除了计算节点本身采用“增量计算”的模型,还要求上游数据传输模块具有很高的吞吐能力,并且具备数据缓存的能力,在大流量场景下可以起到缓冲的作用,下游输出模块也需要做数据压缩、批量输出等优化,以保证输出结果的实时性。低延迟这个大前提对实时计算系统的其他特性提出了更高的要求。比如双11凌晨0点的时候,大量消费者在同一时刻下单支付,这是涌进实时计算系统的瞬时数据量是巨大的,系统需要有强大的并行处理数据的能力,将大量瞬时流量合理分配到成百上千个计算节点,并将这些节点的计算结果汇聚到一起计算出一个总体的结果,在高吞吐的情况下仍保证低延迟。

    从“批量计算”到“增量计算”,最具挑战的是准确性和易用性

    和低延迟同样关键的挑战是准确性。“增量计算”模型和传统“批量计算”模型是有区别的,所以不能照搬过往的技术经验,否则就会有准确性方面的问题。需要考虑清楚新进入的数据如何叠加到老的计算结果上,有些场景下甚至要支持从老的计算结果中撤除部分计算值,以保证最终结果的准确性。

    分布式系统中的某个节点出现故障是很常见的,实时流计算系统的故障恢复能力也相当重要,因为当故障发生时,系统必须快速恢复,否则系统的输出更新可能就停滞了,实时性也就无从谈起。同时故障发生也不能破坏“增量计算”这个模型,否则退化到“批量计算”的模型就又得不到实时的计算结果了,而且结果准确性也难以保证。

    事实上网易大数据在实现自研流计算平台Sloth的过程中,遇到并克服了上述技术难点。网易流计算平台Sloth作为一个平台化的产品,在产品易用性、多租户隔离方面做了大量的工作。就实时计算而言,易用性是一个比较值得讨论的方面。

    对于开发人员而言,写一个分布式程序比写单机程序会困难一些,而写一个分布式实时计算程序,会更难。好在业界有一些开源的流计算引擎帮助完成了不少工作,开发人员可以使用这些流计算引擎完成流计算任务的开发,他们可能不再需要关心计算任务如何分发到多个计算节点上、数据在计算节点间如何传输等问题,只需要专注于计算逻辑的开发、控制好不同计算阶段的计算并行度。

    以计算一篇文章的单词数为例,一个分布式计算程序的内容可能包括三个部分,首先是用几个计算节点共同把每一行文本拆分成一个一个的单词;第二步是用另外一些计算节点去统计单词的个数(考虑到数据量巨大的情况,这里有必要用多个节点去做计算);第三步是由一个计算节点把上游各各节点算出的部分计数汇聚成一个总的计数。这样一个最简单的场景,需要开发的代码量大约是200行。实际业务场景下,数据流经的计算节点远远不止3个,计算类型也比基础的求和复杂很多,所以即使有了流计算引擎,分布式实时计算程序的开发仍然是比较困难的。再进一步看,即使开发完成了,还需要把大量的时间投入到调试、计算框架维护等方面,一旦计算需求发生变化,所有的工作都需要重新迭代一遍,这是个比较痛苦的过程。如何让流式计算程序更易编写,是实时计算平台需要去完成的挑战。

    且不考虑实时流计算系统如何解决易用性这个问题,看下计算机科学发展过程中,类似问题是怎么解决的。人们希望编程可以容易一些,所以越来越多的高级编程语言被发明出来了;人们希望数据计算可以容易一些,然后就有了数据库,以及SQL语言——结构化查询语言;到了大数据时代,人们还在折腾离线批量计算的时候,就遇到的依靠计算引擎编程复杂的问题,最终通过把SQL语言应用到分布式离线计算系统上,解决了这个问题。而现在实时计算的迅速发展的现在,是否同样可以用SQL语言去解决这个问题?答案是肯定的。不过有许多细节的问题需要去推敲求证。

    实时流计算中的数据流,可以理解为一张动态的数据表

    上文提及了离线批量计算模型和实时增量计算模型是有差异的,当SQL语言分别作用与批量计算和流式计算时,其语义也是需要发生变化的。批量计算和流式计算最主要的区别是前者计算的数据是有限的、后者计算的数据是无限的是不断采集进入系统的。当一个SQL查询作用在一批离线数据上面时,计算完成、输出结果,这条SQL查询也就完成了。映射到流式计算,当SQL查询触发计算,它是不会结束的,因为数据在持续不断地流入,按照离线SQL的语义,SQL结束之前,计算不会输出结果,这显然不是流计算期望的效果,所以流式SQL其本质应当是定义一系列流计算任务,同时这些任务是边执行边输出计算结果的。

    离线SQL处理的是静态数据表,而流式SQL处理的是数据流,SQL的计算语义(如求和、平均值、数据表连接等)作用在数据流上是否合理。理解这个问题需要做一个概念上的转换:离线SQL是把静态的数据表转换成另一张静态数据表;而实时流计算中的数据流,可以理解为一张动态的数据表(数据会不断增长的动态数据表)。不同的时刻这个数据表又不同的样子,执行SQL会得到不同的计算结果,把这些不同的计算结果像电影幻灯片放映一样串联起来,我们就得到了一张动态的结果表——流式SQL做的工作就是把一张动态数据表转换成另一张动态数据表,这样流SQL的计算语义就比较容易理解了。实时流计算系统要解决的问题就缩小到了“如何实现动态数据表的计算”上来。

    流SQL引擎的自动优化是当前主要的技术突破方向

    实时流计算系统的易用性,是可以用SQL语言来解决的,网易流计算平台Sloth的生产实践也证实了这一理论。用户不再需要学习各种计算引擎的编程接口,不再需要调试分布式计算程序,不再需要自己维护流计算系统,只需要把原来跑在离线平台上的SQL迁移到实时流计算平台上,就可以完成复杂的实时计算逻辑。

    用户端的工作大大减少了,实时流计算平台的工作势必是要增加的,其中比较困难的部分是如何把SQL查询转化成实际的计算逻辑,实现一个支持流式SQL的计算引擎,类似数据库引擎的角色,而且就像之前讨论的,这个引擎的计算逻辑必须符合“增量计算”模型。同时为了能让实时计算结果应用到各种各样的业务场景中,计算引擎需要能够对接各种存储角色,比如数据、消息队列、离线存储等。

    双11大屏只是大数据实时流计算的一种应用场景,未来会有越来越多的实时计算场景,比如除了文本计算实时化,图像、语音计算也可以实时化,在线机器学习,物联网实时计算等。实时数据以及实时流计算场景的类型都是指数增长的,实时计算引擎会面临不小的挑战。基于SQL的流式计算描述也正在向前演化,会越来越多的纳入流计算特有的属性,比如输出触发、过期数据处理、多种规则的数据窗口划分等。流SQL引擎的自动优化也是当前主要的一个技术突破方向,相信未来实时流计算会随着技术的进步,应用得跟深入、更广泛。

  • ?

    重磅 | EasyDL新上线定制文本分类等功能

    Enoch

    展开

    尊敬的百度AI开放平台用户:

    感谢长期以来各位企业用户与开发者对EasyDL的支持!EasyDL是百度AI开放平台在2017年11月14日正式上线推出的定制化训练和服务平台,通过可视化的便捷操作,并通过少量数据进行训练,即使零算法基础也可定制高精度的AI能力。

    在追求精益求精的道路上,我们从未止步。百度EasyDL在11.30日升级新版,上线了众多开发者期待已久的新功能!

    1、 定制化文本分类正式上线,基于自建分类体系的机器学习方法,实现文本定制分类。

    无论投诉信息、媒体文章、还是文本审核标准,从此都可以个性定制。

    欢迎访问【EasyDL定制化文本分类】随时体验全新功能。

    2、 支持API形式管理数据集,提高训练数据管理效率,优化体验。

    针对需要上传大规模训练数据量的用户,拖拉拽式操作需要往往需要保持网页长时间运行状态,API形式的管理数据集功能的上线,对训练数据集较大的用户来讲,大幅提高了管理数据(特别是上传数据)的便捷性和灵活性。

    在数据集管理中心,增加了调用接口管理数据,点击后可进入数据集增删改查共计6个接口文档。

    3、 大部分模型发布实现免人审,大幅提高模型发布效率。

    长久以来,EasyDL坚持T+0到T+1的审批时效,为进一步提升用户体验,新版升级后,绝大多数模型上线将实现免人审,实现分钟级自动上线。

    4、 图像分类模型支持调参,为高玩用户自助提升模型效果提供一臂之力。

    熟悉EasyDL的朋友会了解,使用EasyDL发布模型无需懂机器学习基础,而由于EasyDL使用的便捷性和高精度的效果,很多有机器学习基础的高玩用户也习惯使用EasyDL来打造AI模型。 本次迭代,也为这类用户群体提供了更为便捷的调参工具。

    通过调节参数,用户可以更灵活地选择数据预处理的方法、自定义训练超参数,进一步提升模型效果。

    已有调参权限的用户,可以在训练模型前选择开启调参:

    5、 数据支持正式上线,大幅降低用户的数据采集及标注成本。

    惊艳的模型效果往往依赖于高质量的训练数据,采集和标注图片的成本无法规避。为降低广大开发者的数据成本,本次正式上线两大核心数据支持方式:

    百度众测:提交具体的数据采集或数据标注要求,由百度众测提供数据服务支持。

    数据服务商:EasyDL已有多家第三方数据服务合作伙伴,可提供包括数据采集、数据标注等多项数据服务。

    所有新功能,欢迎访问EasyDL官网体验。

  • ?

    APP数据采集是怎么实现的

    宝剑峰

    展开

    最近半年,我们八爪鱼陆续接到好几个APP数据采集的项目需求,我在群里面,偶尔也看到有些用户在问,有没有APP数据采集的工具。鉴于我们做过的几个APP数据采集项目的经验,我可以告诉大家,现在APP数据采集,市面上还没有通用的工具。我们八爪鱼内部是有一套工具,但由于使用的难度较高,需要编写脚本,所以不对普通用户公开,我们仅接受项目定制。

    虽然不对外公开,但并不妨碍我们将技术分享出来,APP数据采集,一般走以下两种方式:

    1.两种思路

    1. 抓包

    2. HOOK

    2.抓包

    有代码经验或APP开发的同学都很容易理解,其实很多APP,走的都是webservice通讯协议的方式,并且由于是公开数据,而且大部分是无加密的。所以只要对网络端口进行监测,对APP进行模拟操作,即可知道APP里面的数据是如何获取的。

    我们只需要写代码模拟请求,无论POST还是GET,即可得到该请求所返回的信息。再通过对返回的信息结构化解析,即可得到我们想要的数据。

    public static void main(String[] args) {

    Spider.create(new GithubRepoPageProcessor())

    //从https://github/****开始抓

    .addUrl("https://github/****")

    //设置Scheduler,使用Redis来管理URL队列

    .setScheduler(new RedisScheduler("localhost"))

    //设置Pipeline,将结果以json方式保存到文件

    .addPipeline(new JsonFilePipeline("D:\\data\\webmagic"))

    //开启5个线程同时执行

    .thread(5)

    //启动爬虫

    .run();

    }

    以模拟采集“meizu”应用市场为例

    应用市场产品

    抓包返回参数

    整个抓包过程

    3.HOOK技术

    HOOK技术是一种走操作系统内核的技术,由于安卓系统是开源的,所以可以借助一些框架修改内核,从而实现你要的功能。HOOK的形式,我们走的是Xposed框架。Xposed是一款可以在不修改任何其他开发者开发的应用(包括系统服务)的情况下,改变程序运行的一个开源框架服务。基于它可以制作出许多功能强大的模块,以此来达到应用程序按照你的意愿运行的目的。

    如果把安卓手机看做一座城堡,那Xposed可以让你拥有一个上帝视角,城里的运作细节尽收你眼底,还能让你插一手改变城堡的运作规律。

    什么意思呢?简单的说就是你可以通过他,自动化的控制你的APP。如果将我们的APP开在模拟器上,我们可以通过编码,通过他告诉APP这一步干什么,下一步干什么。你把它理解成类似游戏打怪外挂就可以了。

    而他每走一步,APP与服务端交互的数据,均可获取下来。这种方式广泛用于一些成熟的APP。比如某信采集。

    public class HookActivity implements IXposedHookLoadPackage {

    @Override

    public void handleLoadPackage(LoadPackageParam lpparam) throws Throwable {

    final String packageName = lpparam.packageName;

    XposedBridge.log("--------------------: " + packageName);

    try {

    XposedBridge.hookAllMethods

    (Activity.class, "onCreate", new XC_MethodHook() {

    @Override

    protected void afterHookedMethod(MethodHookParam param)

    throws Throwable {

    XposedBridge.log("=== Activity onCreate: " + param.thisObject);

    }

    });

    } catch (Throwable error) {

    XposedBridge.log("xxxxxxxxxxxx: " + error);

    }

    }

    }

    其实我们八爪鱼曾经也想开发一款通用的APP数据采集工具,并且两年前在这块投入研究了小半年,我们做出了一款APP采集脚本编辑工具,可以让一款APP的数据采集项目缩减到3-5天即可开发完成。但我们认为,这个工具需要编写脚本一般用户是比较难上手的,所以仅作为内部项目使用。

    以HOOK某APP为例:

    HOOK指令打开某

    4.这些年走过的坑

    聊完APP采集的思路,我们跟大家分享一些遇过的坑吧,让大家乐一乐

    坑一:签名算法

    以某信的文章列表页及某信息页为例,对其http访问进行抓包,会发现其url的一个核心参数是我们无法知道如何生成的,这就导致,我们不可能直接用该url进行信息爬取;签名算法如果无法破解,HTTP这条路就是死路了。

    坑二:http爬取回来的信息和页面显示不一致

    以某信的某信息页为例,对比直接访问某信页面及http爬取的信息,可明显发现http爬取到的信息较少。造成得两种方式都用,才能既照顾速度又照顾完整性。

    坑三:模拟器中的坑

    APP自动识别你的运行环境进行屏蔽,最厉害的还是某信,连你是用模拟器打开还是真机打开,是什么内核的,全部进行限制。曾经见过牛人,找某手机厂商专门定做真机来配合。

    坑四:帐号的坑

    这个坑就有点大了,要找号、养号,都不是件容易的事情,更惨的是封号,真真让你一夜回到解放前。

  • ?

    定制化大数据精准营销—助力你的营销活动

    赫访琴

    展开

    传统营销方式主要是以海报,DM单,大型展牌等等,而大数据的出现在极大程度上改变了这些传统营销模式,大数据通一系列数据支持下,可以让你的营销活动变得十分精准,十分的有效,可以充分提高营销成本和效率。

    大数据是由线上与线下渠道结合方式,帮助广告主直达到多屏时代,还利用大数据的用户画像分析,市场状况分析,触达场景分析,营销产品内容分析,东西营销对象的诉求点,从而利用个性化推荐的技术,实现了精准个性化营销。

    大数据分析未来行为

    个性化精准营销是精准营销的终极状态,从过去的千人一面倒现在的千人千面,而这些都是由线下大数据来支持者着,让个性化精准营销变为了现实。

    精准营销都主要包括哪些方面呢?

    基本属性:年龄、男女比例、消费水平、学历等等.....

    搜索偏好:热点话题、影视动漫、热门人物、娱乐游戏等等......

    兴趣爱好:关注家电品牌、关注服饰品牌、关注箱包品牌等等.....

    顾客来源:顾客来源主要是对数据采集后进行位置分析,可以看到客户具体分布在哪。

    数据多维度分析

    当广告主在线下采集到足够数据后,方可实现精准营销。广告主可以针对这些数据进行投放,并且同时对这些数据在我们搜易优数据库中进行对比后,在和相似数据的人,也进行精准定位,同时进行投放,在23大移动平台中投放营销活动,进行全网覆盖,最后根据采集数据-准确投放-统计回馈-分析成本这样一个思路我们还能给出相应的意见和建议,让下一次的营销活动更加符合广告主,实现个性化精准营销。

    关于营销时代的变迁,传统的企业大多还停留在“营销1.0”时代:即以产品为中心,满足传统的消费者需;进入“营销2.0”时代:以社会价值与品牌为使命,也不能完全精准对接个性化需求;而进入“营销3.0”的数据时代:我们要对每个消费者进行个性化匹配,一对一的营销,让我的服务可以刚刚对上你的需求,精确算清楚成交转化率,完全实现个性化精准营销。

  • ?

    Dyson数据采集定制化-新闻媒体解决方案

    相似

    展开

    在碎片化的当下,如何把握用户琐碎的时间,是每个新闻媒体机构都在思考的问题。以前是用户去找热点,而如今是热点来找用户,我们从用户主动接收到现在的选择性接受都告诉了我们一个道理只有牢牢的掌握用户所关心的,才能将流量给锁住!

    在大数据的环境下传统媒体应进行以互联网为核心,用户为重心,数据为导向的转型,促进融合,挖掘新的商业盈利模式。本文从探码Dyson定制采集为成都本土的新闻行业所做的数据解决方案,为大家讲述数据采集是如何在新媒体中发挥至关重要的作用的!

    Dyson定制采集的解决方案

    客户需求

    在我们与客户沟通的过程中,他们希望结合自己在新闻媒体行业的深刻理解及沉淀,利用数据采集技术,搜集掌握时下热点创造处更多热门资讯!

    热门资讯采集

    Dyson定制采集系统会对当下的热门资讯平台的每日热点进行抓取,通过社内外数据资源统一汇聚管理,将这些热点推送给采编人员提供写稿所需新闻素材,即提升新闻内容生产的效率又保证了资讯的质量热点性。

    热点事件详情展示

    在热点资讯选材确认好之后,我们会收集相关资讯的热门文章、评论推送给编辑人员使得写出来的软文更具阅读性!

    地域分析

    在采集热门资讯时我们也会将查看、评论该资讯的用户的地域信息进行收集分析。以便我们在做信息推送时能更加精准有效果,更好的做到本地化的分发!

    用户画像

    在新闻内容推荐环节,通过准确、及时获取、分析读者用户的偏好习惯,构建推荐引擎,进行个性化推荐,提升用户体验。dyson定制采集利用数据爬虫以及数据清洗工具可以处理非结构化大数据源,并且会分析出忽略推动客户兴趣和流失的因素。

    Dyson定制采集已应用到了金融机构、旅行社、电商等行业中,像这类对数据要求极为精确,数据量大的行业传统的采集工具无法进行需求化,定制化的采集无非是最好的选择!

    总结:随着科学技术的飞速发展以及传播媒体介质的多样化,争夺新闻线索、新闻线索采集,已经成为现阶段媒体之间相互竞争的主要内容。随着自媒体时代的到来,对于新闻线索的采集与使用,正深刻影响到新闻改革进程以及电视新闻传播的格局。

    文章转自:探码科技

  • ?

    如何利用数据定制采集挖掘流量红利,助力旅行社数字化转型?

    流年

    展开

    2017年国内旅游市场游客人数已经达到50亿人次且近年来我国国内旅游市场的游客人数一直保持着稳定增长的趋势,增长率在10%以上。目前我国步入大众旅游时代,旅游休闲已成为百姓的生活常态。

    旅行社的现状

    游客人群单一,客源下降

    随着便利的网络以及交通的建设,年轻游客的旅游方式更加多元化和个性化,跟团游已逐渐被其排斥在外,自助游异军突起已成为这部分群体的首选旅游方式,导致了旅行社客源急剧下降,主流已成中老年人。旅游市场经历大浪淘沙之后,实体旅行社的原有优势消失殆尽,如果旅行社还沿用旧的理念和服务方式,肯定和当前市场需求不匹配,注定要陷入举步维艰的局面。

    各个旅行社的“价格战”导致旅行社活动单一、利润微薄

    电子商务和现代互联网的结合更给消费者带来了更多的旅游决策选择,特别是随着旅游论坛的建设,消费者可以实现在线共享信息和及时互动,在另一个层面降低了旅行管理的层级,节约了交易成本,从而引发了旅游社的价格战。旅游企业在实现利润的同时,必然不断拓展市场规模并力图实现规模经济。这一结果往往导致旅游产品供应的相对单一化,消费者的选择余地被大大地压缩。

    传统资讯方式落伍,无法寻找潜在客户

    由于互联网信息的开放让消费者能够在最短的时间内了解需要了解的信息,对旅游资源的掌握往往在短时间内就可以完成。在这种情况下,旅行社的传统的不可替代的咨询功能就消失殆尽。

    从以上分析不难看出,由于数据的缺乏,致使管理阶层无法精准掌握客户需求,从而应对市场和用户的变化本文从探码Dyson定制采集为成都本土的一家大型旅行社所做的数据解决方案,为大家讲述数据采集是如何在旅游行业中发挥至关重要的作用的!

    Dyson定制采集的解决方案

    在与客户的交谈中我们了解到该旅行社规模较大,服务项目很多,境外游也是其发展的重要方向。他们希望结合自己在旅行行业的深刻理解及沉淀,利用数据采集技术,搜集掌握时下旅游热点和旅客需求对运营方向进行调整从而达到创收的价值!

    热门景区、论坛采集

    Dyson定制采集系统会对当下的热门旅游平台的每日热点景区进行抓取,并且还会对马蜂窝、驴友论坛等旅游热门论坛的数据进行采集。时时掌握客户需求,根据收集数据开发真正有价值的旅游路线。

    每月最佳景区采集

    11月佳木斯的红枫、12月雾凇岛的白雪茫茫!时间的变换带来了,旅客需求的改变。作为旅行社更应对这些时刻保持敏感。Dyson定制采集系统从(景点玩乐、美食、购物街区、酒店)4大要素对每个月份最热门的的景点信息进行采集反馈给管理者,使得路线的规划更加符合客户的口味。

    地域分析

    我们在采集旅游站点上对某个景点的评论时,会将旅客的所处地域的信息进行采集,如下图我们明显发现上海地方的游客丽江古镇讨论的热度很高,我们将这一信息反馈给旅行社,他们可以根据以上信息重点开放下上海去丽江的旅游路线,推出该条路线的优惠活动,做到主动的市场营销。

    人群画像分析

    游客之间年龄的跨度特别大,我们无法制定了几个旅游路线就都能满足他们的需求,我们对同年龄阶段用户的旅游爱好就行收集划分,从而进行个性化的旅游路线推荐,锁住更多用户,提升用户体验。dyson定制采集利用数据爬虫以及数据清洗工具可以处理非结构化大数据源,并且会分析出推动客户兴趣和流失的因素。

    Dyson定制采集已应用到了金融机构、电商、新闻媒体等行业中,像这类对数据要求极为精确,数据量大的行业传统的采集工具无法进行需求化,定制化的采集无非是最好的选择!

    总结:大数据时代旅行社借助于数据采集,可以充分获取和运用信息,更加准确地了解市场主体需求,提高服务,加强市场的竞争能力!

    文章转自:探码科技

  • ?

    2018年最值得推荐的6款大数据采集工具

    梦中人

    展开

    数据肯定是无价的。但分析数据并非易事,因为结果越准确,成本就越高。鉴于数据急剧增长,需要一个过程来提供有意义的信息,最终变成实用的洞察力。

    数据挖掘是指这个过程:在庞大数据集当中发现模式,将它转换成有效的信息。该技术利用特定的算法、统计分析、人工智能和数据库系统,从庞大数据集中提取信息,并转换成易于理解的形式。本文介绍了广泛用于大数据行业的6种综合数据挖掘工具。

    1. Rapid Miner

    Rapid Miner是一个数据科学软件平台,为数据准备、机器学习、深度学习、文本挖掘和预测分析提供一种集成环境。它是领先的数据挖掘开源系统之一。

    该程序完全用Java编程语言编写。该程序提供了一个选项,以便用户试用大量可任意嵌套的操作符,这些操作符在XML文件中有详细说明,可由Rapid Miner的图形用户界面来构建。

    2. Oracle Data Mining

    它是Oracle高级分析数据库的代表。市场领先的公司用它最大限度地发掘数据的潜力,做出准确的预测。该系统配合强大的数据算法,锁定最佳客户。

    此外,它可识别异常情况和交叉销售机会,让用户能够根据需要运用不同的预测模型。此外,它以所需的方式定制客户画像。

    3. IBM SPSS Modeler

    说到大规模项目,IBM SPSS Modeler最适合。在这个建模器中,文本分析及其最先进的可视化界面极具价值。它有助于生成数据挖掘算法,基本上不需要编程。

    它可广泛用于异常检测、贝叶斯网络、CARMA、Cox回归以及使用多层感知器和反向传播学习的基本神经网络。

    4. KNIME

    Konstanz Information Miner是一个开源数据分析平台。你可以迅速在其中部署、扩展和熟悉数据。在商业智能界,KNIME号称是有助于为毫无经验的用户提供预测智能的平台。

    此外,数据驱动的创新系统有助于发掘数据潜力。此外,它包括数千个模块和随时可用的示例以及一大批集成的工具和算法。

    5. Python

    Python是一种免费的开源语言,因易用性常常与R相提并论。与R不同,Python学起来往往很容易上手,易于使用。许多用户发现可以在几分钟内开始构建数据,并进行极其复杂的亲和度分析。

    只要你熟悉变量、数据类型、函数、条件语句和循环等基本编程概念,最常见的业务用例数据可视化就很简单。

    6.火车采集器

    火车采集器由合肥乐维信息技术有限公司开发,是一款专业的网络数据采集/信息挖掘处理软件,通过灵活的配置,可以很轻松迅速地从网页上抓取结构化的文本、图片、文件等资源信息,可编辑筛选处理后选择发布到网站后台,各类文件或其他数据库系统中。

  • ?

    六大主流大数据采集平台架构分析

    赫柏

    展开

    随着大数据越来越被重视,数据采集的挑战变的尤为突出。今天为大家介绍几款数据采集平台:

    Apache Flume Fluentd Logstash Chukwa Scribe Splunk Forwarder

    大数据平台与数据采集

    任何完整的大数据平台,一般包括以下的几个过程:

    数据采集–>数据存储–>数据处理–>数据展现(可视化,报表和监控)

    其中,数据采集是所有数据系统必不可少的,随着大数据越来越被重视,数据采集的挑战也变的尤为突出。这其中包括:

    我们今天就来看看当前可用的六款数据采集的产品,重点关注它们是如何做到高可靠,高性能和高扩展。

    1、Apache Flume

    Flume 是Apache旗下的一款开源、高可靠、高扩展、容易管理、支持客户扩展的数据采集系统。 Flume使用JRuby来构建,所以依赖Java运行环境。

    Flume最初是由Cloudera的工程师设计用于合并日志数据的系统,后来逐渐发展用于处理流数据事件。

    Flume设计成一个分布式的管道架构,可以看作在数据源和目的地之间有一个Agent的网络,支持数据路由。

    每一个agent都由Source,Channel和Sink组成。

    Source

    Source负责接收输入数据,并将数据写入管道。Flume的Source支持HTTP,JMS,RPC,NetCat,Exec,Spooling Directory。其中Spooling支持监视一个目录或者文件,解析其中新生成的事件。

    Channel

    Channel 存储,缓存从source到Sink的中间数据。可使用不同的配置来做Channel,例如内存,文件,JDBC等。使用内存性能高但不持久,有可能丢数据。使用文件更可靠,但性能不如内存。

    Sink

    Sink负责从管道中读出数据并发给下一个Agent或者最终的目的地。Sink支持的不同目的地种类包括:HDFS,HBASE,Solr,ElasticSearch,File,Logger或者其它的Flume Agent。

    Flume在source和sink端都使用了transaction机制保证在数据传输中没有数据丢失。

    Source上的数据可以复制到不同的通道上。每一个Channel也可以连接不同数量的Sink。这样连接不同配置的Agent就可以组成一个复杂的数据收集网络。通过对agent的配置,可以组成一个路由复杂的数据传输网络。

    配置如上图所示的agent结构,Flume支持设置sink的Failover和Load Balance,这样就可以保证即使有一个agent失效的情况下,整个系统仍能正常收集数据。

    Flume中传输的内容定义为事件(Event),事件由Headers(包含元数据,Meta Data)和Payload组成。

    Flume提供SDK,可以支持用户定制开发:

    Flume客户端负责在事件产生的源头把事件发送给Flume的Agent。客户端通常和产生数据源的应用在同一个进程空间。常见的Flume 客户端有Avro,log4J,syslog和HTTP Post。另外ExecSource支持指定一个本地进程的输出作为Flume的输入。当然很有可能,以上的这些客户端都不能满足需求,用户可以定制的客户端,和已有的FLume的Source进行通信,或者定制实现一种新的Source类型。

    同时,用户可以使用Flume的SDK定制Source和Sink。似乎不支持定制的Channel。

    2、Fluentd

    Fluentd是另一个开源的数据收集框架。Fluentd使用C/Ruby开发,使用JSON文件来统一日志数据。它的可插拔架构,支持各种不同种类和格式的数据源和数据输出。最后它也同时提供了高可靠和很好的扩展性。Treasure Data, Inc 对该产品提供支持和维护。

    Fluentd的部署和Flume非常相似:

    Fluentd的架构设计和Flume如出一辙:

    Fluentd的Input/Buffer/Output非常类似于Flume的Source/Channel/Sink。

    Input

    Input负责接收数据或者主动抓取数据。支持syslog,http,file tail等。

    Buffer

    Buffer负责数据获取的性能和可靠性,也有文件或内存等不同类型的Buffer可以配置。

    Output

    Output负责输出数据到目的地例如文件,AWS S3或者其它的Fluentd。

    Fluentd的配置非常方便,如下图:

    Fluentd的技术栈如下图:

    FLuentd和其插件都是由Ruby开发,MessgaePack提供了JSON的序列化和异步的并行通信RPC机制。

    Cool.io是基于libev的事件驱动框架。

    FLuentd的扩展性非常好,客户可以自己定制(Ruby)Input/Buffer/Output。

    Fluentd从各方面看都很像Flume,区别是使用Ruby开发,Footprint会小一些,但是也带来了跨平台的问题,并不能支持Windows平台。另外采用JSON统一数据/日志格式是它的另一个特点。相对去Flumed,配置也相对简单一些。

    3、Logstash

    Logstash是著名的开源数据栈ELK (ElasticSearch, Logstash, Kibana)中的那个L。

    Logstash用JRuby开发,所有运行时依赖JVM。

    Logstash的部署架构如下图,当然这只是一种部署的选项。

    一个典型的Logstash的配置如下,包括了Input,filter的Output的设置。

    几乎在大部分的情况下ELK作为一个栈是被同时使用的。所有当你的数据系统使用ElasticSearch的情况下,logstash是首选。

    4、Chukwa

    官网:https://chukwa.apache.org/

    Apache Chukwa是apache旗下另一个开源的数据收集平台,它远没有其他几个有名。Chukwa基于Hadoop的HDFS和Map Reduce来构建(显而易见,他用Java来实现),提供扩展性和可靠性。Chukwa同时提供对数据的展示,分析和监视。很奇怪的是它的上一次 github的更新事7年前。可见该项目应该已经不活跃了。

    Chukwa的部署架构如下:

    Chukwa的主要单元有:Agent,Collector,DataSink,ArchiveBuilder,Demux等等,看上去相当复杂。由于该项目已经不活跃,我们就不细看了。

    5、Scribe

    代码托管:https://github/facebookarchive/scribe

    Scribe是Facebook开发的数据(日志)收集系统。已经多年不维护,同样的,就不多说了。

    6、Splunk Forwarder

    以上的所有系统都是开源的。在商业化的大数据平台产品中,Splunk提供完整的数据采金,数据存储,数据分析和处理,以及数据展现的能力。

    Splunk是一个分布式的机器数据平台,主要有三个角色:

    Search Head负责数据的搜索和处理,提供搜索时的信息抽取。

    Indexer负责数据的存储和索引 Forwarder,负责数据的收集,清洗,变形,并发送给Indexer

    Splunk内置了对Syslog,TCP/UDP,Spooling的支持,同时,用户可以通过开发 Input和Modular Input的方式来获取特定的数据。在Splunk提供的软件仓库里有很多成熟的数据采集应用,例如AWS,数据库(DBConnect)等等,可以方便的从云或者是数据库中获取数据进入Splunk的数据平台做分析。

    这里要注意的是,Search Head和Indexer都支持Cluster的配置,也就是高可用,高扩展的,但是Splunk现在还没有针对Farwarder的Cluster的功能。也就是说如果有一台Farwarder的机器出了故障,数据收集也会随之中断,并不能把正在运行的数据采集任务Failover到其它的 Farwarder上。

    总结

    我们简单讨论了几种流行的数据收集平台,它们大都提供高可靠和高扩展的数据收集。大多平台都抽象出了输入,输出和中间的缓冲的架构。利用分布式的网络连接,大多数平台都能实现一定程度的扩展性和高可靠性。

    其中Flume,Fluentd是两个被使用较多的产品。如果你用ElasticSearch,Logstash也许是首选,因为ELK栈提供了很好的集成。Chukwa和Scribe由于项目的不活跃,不推荐使用。

    Splunk作为一个优秀的商业产品,它的数据采集还存在一定的限制,相信Splunk很快会开发出更好的数据收集的解决方案。

  • ?

    Dyson数据采集定制化-你身边的私人数据师

    经十三

    展开

    刚刚结束的双十一淘宝达成了2000多亿的成交额的壮举它意味着:数据的增长从未停歇,如今我们对数据依赖程度的加深,促使了很多大数据产业的发展。

    传统采集工具的诟病

    数据采集工具作为获取数据的重要途径,在采集工具的选择上是我们不得不面对的一个问题。且这种通用的数据采集工具大多都存在功能复杂,上手难,分类不方便,兼容性不好等方面的问题,采集结果与需求不符。而这种工具对于作为客户的我们不但没有任何帮助还显得非常的鸡肋,使用这些通用的工具还有可能会导致我们数据的丢失和泄漏最终得不尝试。

    为何探码科技选择定制采集服务

    探码科技作为成都行业类专业的大数据公司,在前期我们与客户交流的过程中发现他们对采集的要求很难统一,针对性很强,且用户对软件的使用习惯方式方面也各不相同。很难去打造一款大家都非常满意的采集工具。市面上也没有出现一款大家都喜欢的采集工具难道不是嘛?于是我们选择用自主研发的Dyson采集系统为客户做专业的定制采集。

    何为定制采集

    数据定制指基于互联网上有海量的数据信息基础,根据用户的需求对特定的数据进行采集、筛选、清洗、运算加工输出数据结果的过程称为数据定制。让客户从对工具说需求转化到了面对面的与技术人员做交流,下文从探码Dyson采集为国内知名国企打造的投融资并购平台为大家来讲述定制采集!

    Dyson定制采集解决方案:

    客户需求的确定

    在我们与客户沟通的过程中,他们希望结合自己在产权行业的深刻理解及沉淀,利用技术手段,设计出一款能够解决当前并购市场及投融资界信息不完整、不对称、不透明、缺乏客观分析与评价等行业痛点的金融信息交易平台。

    确定客户需要采集的字段需求

    根据客户所需搜集的投融资项目信息与客户沟通之后我们总结了一下需要收集的字段。

    确定搜集数据来源的页面与平台

    当我们明确采集字段后,找到匹配度高的网站运用探码自主研发的Dyson采集系统对这些网站进行采集,下图展示小部分的爬取的网站截图。

    采集数据展示

    在采集结果出来后,将筛选出来的及时反馈给客户查看确认之后在更新到前台展示,保持高频度的交流。

    数据清洗去除重复

    在数据采集的过程中难免会有重复的过时的消息,Dyson采集系统展示出爬虫程序抓取到的数据,方便我们进行清洗。数据清洗系统主要由两部分组成:

    手工清洗:通过Web前端展示出抓取到的数据,对数据进行直观分析,得出哪些条件的数据需要删除,哪些条件的数据需要修改。自动清洗:经过手工清洗之后,可能会得出一些清洗模式,这种模式适用于所有数据。我们把这种模式记录在程序里,将来的数据只要匹配这种模式,数据将来会被自动清洗,不再需要人工清洗。

    定时采集

    客户所需建设的为大型的投融资的聚和平台,信息每天每小时都有大量的新数据拥进,为了保证平台的权威专业性我们时时对信息进行检测将真实可靠的信息采集更新到平台。

    全天候的技术支持

    在后期的平台维护中我们会指派平台开发人员,定期对后台数据采集等工作的检测,保障了系统的平稳运行。并且时时与客户进行交流收集后期使用过程中的修改意见。进行平台运行后的功能调整满足客户需求。

    Dyson数据采集定制化行业应用

    电商

    电商平台数据大量且繁琐,传统采集工具根本无法做到细致化的采集,需要专业的数据采集人员提供采集方向并且增加相应的功能设置才可做到数据的精准采集,具体案例可以看Dyson采集为成都的客户打造的电商服装平台。

    金融机构

    在数据急速膨胀的今天,金融财经行业面临大数据的诸多挑战,例如数据应用深度不断加强,数据分析技术更新频率加快,数据类型不断增多等。基于业务和政策需求,数据的收集、整理、传输、分析和发布是一个连续而复杂的过程,然而传统的采集工具根本无法做到如此专业的数据采集,数据的准确性对于金融行业来说就是命门,数据上不能出现任何差池。定制化的数据采集对金融业来说是最好的选择。

    新闻媒体

    互联网技术的发展,新闻媒体的不断涌现,特别是大数据技术的到来,传统的新闻采集方式(通过来访,来信、来电的途径)已经不能够适应互联网的发展需求。新闻行业需要抓住事件的热点才能在信息流高度发展的今天生存下去,如果使用传统的采集工具根本无法做到热点的跟踪采集,对于这个信息极为敏感的行业。定制化的数据采集无非是最佳的选择!

    旅行社

    旅行者的信息比以往任何时候都要多,因为大数据让他们可以在社交媒体上与同龄人分享信息。因此,旅游公司需要了解以下问题,并找到应对即将到来的形势的策略。而传统的采集工具大都没有做到细致的筛选致使采集出来的数据变的价值不高,而且容易误导管理者的决策。而定制化的采集会做到人工和机器的双重筛选从而使采集更加有价值!

    总结:再动听的音乐不符合你的心情也会成为噪音,在大的数据不符合你的需求也是一堆废铁。摆脱与机器的木讷对白,将你的需求高速真正懂你的人,从而发挥数据真正的价值---Dyson数据采集定制化就在你身边!

    文章转自:探码科技

  • ?

    慢慢买 | 比价API电商数据采集定制

    You

    展开

    在当今社会竞争极大的情况下,想要开发一个电商网站前端数据的优化是必不可少的,加之处于移动互联网时代,面对风云莫测的市场环境,企业对于业务快速落地、产品灵活迭代的需求势必更加迫切。而慢慢买拥有业内领先的购物搜索引擎技术,如果您的网站想集成商品比价功能,并且想要充分利用各自的资源优势形成互补,拓展市场提高流量转换。那您必须了解下慢慢买的比价API功能:

    在当今社会竞争极大的情况下,想要开发一个电商网站前端数据的优化是必不可少的,加之处于移动互联网时代,面对风云莫测的市场环境,企业对于业务快速落地、产品灵活迭代的需求势必更加迫切。而慢慢买拥有业内领先的购物搜索引擎技术,如果您的网站想集成商品比价功能,并且想要充分利用各自的资源优势形成互补,拓展市场提高流量转换。那您必须了解下慢慢买的比价API功能:

    能满足以下2种使用场景:

    场景1:有自已的产品库,希望通过API获取该产品在各电商上的最新报价。

    先通过搜索API匹配产品报价,将报价与自有的产品库进行绑定入库,在前台用报价读取API读取最新的价格。

    场景2:仅仅想做一个比一比价这样的购物搜索系统该API有高效成熟的分词搜索技术,精准匹配搜索结果,并对结果排序,价格、品牌筛选等功能。

    这是个辅助API,配合搜索API的场景1使用,前端显示产品时,通过这个API获取最新的价格。

    这是一个独立的解决方案,推荐使用,主要有以下优势:

    1)集成了前面2个API接口的功能,减少合作方的开发成本;

    2)价格巡检系统,超出设定的价格范围就提醒(或价格波动提醒);

    3)数据可通过Excel灵活导出;

    4)合作方的商品数据可通过API导入,也可以灵活添加,以商品编号为唯一标识;

    5)设定需要哪些商城、商家的报价。可定制采集,做到商品价格全面准确;

    6)商城有商品上下架时自动识别绑定以及下架提示;

    7)通过API对接输出数据(主要是已绑定的价格信息),合作方将数据应用在自身平台。

    展示图:

    这也是一个API接口,可通过url获取商品各类信息。如果你想在文章内容里插入商品,并在用户浏览时自动显示最新报价(优惠信息)和历史价格走势,那就对了!用这个接口吧。

    1、商品编号API(id匹配标题与价格)

    2、商品地址返回信息(url获取商品名称及价格)

    3、商品地址返回优惠信息

    为什么选择慢慢买比价API

    1.获取数据成本低:开发一套合适成熟的比价软件,需要用到大量人工+配置,更重要的是时间耗不起;

    2.实时的数据采集,精准的数据来源;

    3.拥有独立的数据监控系统,随时可以获取调用信息;

    4.数据源覆盖国内多个电商平台商品信息。

    我们的客户

数据采集定制

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP