中企动力 > 商学院 > 大数据采集分发
  • ?

    金立软件商店大数据:分发能力提升

    解天菱

    展开

    2017年已过四分之一,金立软件商店数据中心发布了2017年Q1数据报告。报告显示,截止日前,金立软件商店历史用户量已超过7500W,历史分发量已突破80亿,呈现快速增长势头。相比2016年Q1,历史分发量增长近一倍。

    应用分发趋势虽曲折,但增幅明显

    从数据报告来看,近两年来APP整体的分发趋势相对较曲折,但总体来看还是呈现上升趋势且有较大的增长,尤其在2017年春节前后。春节期间,用户对各类APP的需求增大,另一大原因还在于软件商店内策划的为期18天的红包雨活动,活动期间用户活跃度一度高涨,福利的发放极大地推动了用户下载,APP分发量出现较大的增幅,再次实现新突破。

    系统安全强者多,头部应用占比高

    金立软件商店Q1下载量Top100的应用主要分布在系统安全、影音视听两大类别,其中下载量Top10的应用就有7款应用隶属其中,可见用户在对娱乐有较大需求的同时还对手机安全有着较强的意识,这点也契合了金立软件商店一直强调的“安全下载”理念。

    在各类别Top5应用中,头部应用几乎占据了绝大部分流量,除影音视听外,其他类别的Top5应用的下载量总和占该类别总下载量50%以上。下载量Top5的应用几乎都是网友日常生活中耳熟能详的应用,影响着网友生活的方方面面。头部应用愈发强大,中小开发者若想实现新的作为,唯有抓住细分领域作为攻克的缺口方能锁住更多流量。

    用户对游戏的需求增大,游戏占比提升

    在游戏领域,参与门槛较低的休闲益智类游戏下载量仍然最高,网络游戏超越棋牌桌游类游戏跃居第二,其中下载量Top5的游戏有三款是休闲益智类游戏,入榜的均是时下最热门的游戏,分别是王者荣耀、JJ斗地主、开心消消乐、球球大作战以及我的世界,其中王者荣耀备受用户喜爱,多次荣登各应用商店游戏下载榜榜首。

    相对应用类APP来说,游戏类APP的总下载量占比并不高,但与去年同期相比,游戏的下载量占比有明显提升。随着近年来金立软件商店对游戏推广力度的加大,且移动用户对游戏的需求不断增大,游戏类APP的总下载量占比有望再次提升。

    男女用户兴趣差异大,但都爱影音视听

    在此次报告中我们对其用户群体进行了分析,目前金立软件商店65%都是男性用户,相对女性用户,男性用户更喜欢社交和游戏类APP。每个年龄段的用户对应用的偏好有所不同,但都钟爱搜索下载影音视听类应用。值得一提的是,在用户群体男性居多的金立软件商店,更符合男性用户群体的游戏和社交类的APP相对其他类别APP更能获得更好的推广效果。

    女神直播点击热度高,圈子文化深人心

    金立软件商店V9300版本加入了娱乐版块,版块汇集了各类媒体化的娱乐内容,其中女神直播最受用户喜爱,吸引了娱乐板块的绝大部分流量。不仅如此,新版本还丰富了原有的圈子内容,用户每天在此发帖、回帖,早已形成独特的圈子文化,深得用户心,用户粘性更足,互动价值不断上升。

    这两年,金立手机加大推广力度,产品销量也水涨船高,凭借着天然的入口优势金立软件商店的用户还将持续增长,而金立软件商店也紧随互联网的发展脚步优化升级产品,不断提高运营能力,外加分发模式的多样化,分发能力将再次得到较大的提升。

  • ?

    企业进入大数据信息采集时代

    Obelia

    展开

    做网络营销

    不论是个人还是公司都想要实现产品的渠道拓展和推广宣传

    但绝大多数的企业都不能达成想要的效果

    其实原因有很多

    一、想要做好网络营销

    客户是王道

    没有强大的客户群做后盾

    网络营销的销量不过是空想罢了

    当下客户渠道大多以网络大数据信息采集的方式来获取

    如云速数据挖掘

    通过输入行业关键字

    就能一键采集指定区域的客户信息和联系方式

    省时高效

    二、通过客户信息

    从分考虑分析目标群体的生活轨迹和习惯

    来预测客户下一步的消费行为

    以正确的时间正确的方式传达产品信息

    从而完成营销活动

    三、产品文案的策划一定要以客户需求为重点

    并且简单易懂、快速吸引客户眼球

    才能使转化率达到最佳

  • ?

    瞿天锋:耕耘航旅大数据十余年 实时数据高并发分发形成产业壁垒

    映秋

    展开

    出镜 | 维辰

    嘉宾 | 敬众科技创始人 瞿天锋

    浏览器版本过低,暂不支持视频播放

    提及大数据应用,大众熟悉的更多是与目前的消费互联网相关的领域,通过获得消费者浏览、购物等相关数据,分析其消费习惯、生活方式等,从而进行精准营销。这很大程度上缘于BAT在消费互联网时代一直以来的战略布局。但是,消费互联网的大数据应用有很多局限性:一是数据仅掌握在少数商家手中,二是数据应用的合法性尚未明确。而企业的数据是真实所属企业所有,并且具有核心经济价值。所以,大数据的应用价值一定更多体现在产业里。

    近年来,随着我国综合国力的提升,航天事业得到了飞速发展。航天领域在研制、运行和发布成果的全过程中,都会产生大数据和应用大数据的需求,数据既是航天理论的基础,又是航天实践的基石,因而航天领域是大数据应用最早也最成熟,取得成果最多的领域。

    当我们翻看近几年航天领域的大数据成果,绝对不可以跳过的一个名字,就是敬众科技。

    上海敬众科技股份有限公司成立于2005年,是上海市科委认证并积极扶持的高新技术企业,敬众科技目前的主要业务分为航空数据分发、征信数据服务和软件开发三个版块。

    找准跑道

    早在2005年成立之际,作为创始人,瞿天锋已经看到了整个航天业未来的发展契机,所以才会在在大数据如此宽泛的一个领域内,深耕于航空业的数据。随着经济的发展,尤其是最近两三年世界航空运输业发展形势良好。无论是乘客人数还是企业利润,都创下了新纪录。而中国的航空运输业,则出现了南航、东航和国航三大大型航空公司,无论是乘客数量还是飞机数量,都远超韩国、日本的大型航空公司。而事实上,在过去的十多年里,航空业每年增长的幅度都是非常惊人的。

    可以说,敬众科技是找准了大数据的跑道,数据可视化是大数据领域所有价值的终极呈现,而航天领域的可视化,缘其数据总量更多,精确度更高,价值更高,一直被誉为数据可视化领域之巅。在航旅大数据分发这一特殊细分领域中,因为数据源的门槛,还未形成统一的行业规范和标准。敬众科技寄望通过航旅大数据研究中心收集海内外航旅相关法规,填补行业标准“空白”。

    做自己擅长的事

    航旅数据分发领域,客户的基本要求是“稳、准、快”,而大量实时数据的高并发分发本身具有一定的技术壁垒,需要综合多个技术领域的解决方案。经过多年积累,敬众科技掌握了一套适合于大规模航空业数据分发的技术系统,并掌握了运维这套系统的能力,形成了自己独特的技术优势。

    根据艾瑞监测数据,目前在线旅游市场互联网渗透率突破10%,在线机票是发展最为成熟、占比最大的在线旅游细分市场,目前国内的线上渗透率已经达到40%左右,OTA分销是目前在线旅游业最核心的商业模式,在整体市场中的交易额占比约60%-80%。

    敬众科技主要针对广大OTA公司在线查询服务模块的个性化需求,为其提供解决方案。公司2015年、2016年累计总查询量分别为408086万次、842113万次,单日峰值分别达到2200万次、5884万次,在这一专业细分领域的优势明显。

    最后,瞿天锋也告诉我们,航天领域始终是一块很大的蛋糕,里面涉及的产业非常之多。那么在航空这一个背景之下,针对目前整个中国经济发展的阶段,我们正处在消费升级的过程之中,巨大的消费需求,必将为整个航空领域带来更多的发展机会。

    (创TALK原创文章,转载请注明出处)

    作者:祁琴慧 出镜:维辰 编辑:夏天

  • ?

    干货丨大数据是如何被采集及应用的

    亦丝

    展开

    尽管“大数据”一词近年来屡遭热捧

    但很多人都还不知道什么是大数据

    更不知道大数据有甚卵用

    这两年,发现“大数据”这个词出现的越来越频繁了

    不仅企业,连国家都在部署大数据战略

    一番百度了之后

    Oh~ emmmmmmmmm~ +_+

    还是没搞懂大数据到底是个什么玩意儿

    直到有一天

    我发现一个秘密

    不管我在网上搜索什么

    页面都会跳出我要搜索的相关产品或关联事物

    然后,我恍然大悟!

    所谓大数据,就是算法!

    它能够“算”出我们“心中所想”

    那么问题来了

    大数据技术是如何采集到我们的信息的呢?

    数据采集,又称数据获取,是利用一种装置,从系统外部采集数据并输入到系统内部的一个接口。在互联网行业快速发展的今天,数据采集已经被广泛应用于互联网及分布式领域,比如摄像头,麦克风,都是数据采集工具。

    数据采集系统整合了信号、传感器、激励器、信号调理、数据采集设备和应用软件。在数据大爆炸的互联网时代,数据的类型也是复杂多样的,包括结构化数据、半结构化数据、非结构化数据。结构化最常见,就是具有模式的数据。非结构化数据是数据结构不规则或不完整,没有预定义的数据模型,包括所有格式的办公文档、文本、图片、XML, HTML、各类报表、图像和音频/视频信息等等。大数据采集,是大数据分析的入口,所以是相当重要的一个环节。

    我们首先来了解一下数据采集的三大要点:

    一、数据采集的三大要点

    (1)全面性

    数据量足够具有分析价值、数据面足够支撑分析需求。

    比如对于“查看商品详情”这一行为,需要采集用户触发时的环境信息、会话、以及背后的用户id,最后需要统计这一行为在某一时段触发的人数、次数、人均次数、活跃比等。

    (2)多维性

    数据更重要的是能满足分析需求。灵活、快速自定义数据的多种属性和不同类型,从而满足不同的分析目标。

    比如“查看商品详情”这一行为,通过埋点,我们才能知道用户查看的商品是什么、价格、类型、商品id等多个属性。从而知道用户看过哪些商品、什么类型的商品被查看的多、某一个商品被查看了多少次。而不仅仅是知道用户进入了商品详情页。

    (3)高效性

    高效性包含技术执行的高效性、团队内部成员协同的高效性以及数据分析需求和目标实现的高效性。也就是说采集数据一定要明确采集目的,带着问题搜集信息,使信息采集更高效、更有针对性。此外,还要考虑数据的及时性。

    不同应用领域的大数据其特点、数据量、用户群体均不相同。不同领域根据数据源的物理性质及数据分析的目标采取不同的数据采集方法。

    那么,接下来我们再来了解一下常用的数据采集的方法。

    常用的数据采集方法归结为以下三类:传感器、日志文件、网络爬虫。

    (1)传感器

    传感器通常用于测量物理变量,一般包括声音、温湿度、距离、电流等,将测量值转化为数字信号,传送到数据采集点,让物体有了触觉、味觉和嗅觉等感官,让物体慢慢变得活了起来。

    (2)系统日志采集方法

    日志文件数据一般由数据源系统产生,用于记录数据源的执行的各种操作活动,比如网络监控的流量管理、金融应用的股票记账和 web 服务器记录的用户访问行为。

    很多互联网企业都有自己的海量数据采集工具,多用于系统日志采集,如Hadoop的Chukwa,Cloudera的Flume,Facebook的Scribe等,这些工具均采用分布式架构,能满足每秒数百MB的日志数据采集和传输需求。

    (3)Web 爬虫

    网络爬虫是指为搜索引擎下载并存储网页的程序,它是搜索引擎和 web 缓存的主要的数据采集方式。通过网络爬虫或网站公开API等方式从网站上获取数据信息。该方法可以将非结构化数据从网页中抽取出来,将其存储为统一的本地数据文件,并以结构化的方式存储。它支持图片、音频、视频等文件或附件的采集,附件与正文可以自动关联。

    此外,对于企业生产经营数据上的客户数据,财务数据等保密性要求较高的数据,可以通过与数据技术服务商合作,使用特定系统接口等相关方式采集数据。比如八度云计算的数企BDSaaS,无论是数据采集技术、BI数据分析,还是数据的安全性和保密性,都做的很好。

    数据的采集是挖掘数据价值的第一步,当数据量越来越大时,可提取出来的有用数据必然也就更多。只要善用数据化处理平台,便能够保证数据分析结果的有效性,助力企业实现数据驱动。

  • ?

    2018年最值得推荐的6款大数据采集工具

    瓦尔迪维亚

    展开

    数据肯定是无价的。但分析数据并非易事,因为结果越准确,成本就越高。鉴于数据急剧增长,需要一个过程来提供有意义的信息,最终变成实用的洞察力。

    数据挖掘是指这个过程:在庞大数据集当中发现模式,将它转换成有效的信息。该技术利用特定的算法、统计分析、人工智能和数据库系统,从庞大数据集中提取信息,并转换成易于理解的形式。本文介绍了广泛用于大数据行业的6种综合数据挖掘工具。

    1. Rapid Miner

    Rapid Miner是一个数据科学软件平台,为数据准备、机器学习、深度学习、文本挖掘和预测分析提供一种集成环境。它是领先的数据挖掘开源系统之一。

    该程序完全用Java编程语言编写。该程序提供了一个选项,以便用户试用大量可任意嵌套的操作符,这些操作符在XML文件中有详细说明,可由Rapid Miner的图形用户界面来构建。

    2. Oracle Data Mining

    它是Oracle高级分析数据库的代表。市场领先的公司用它最大限度地发掘数据的潜力,做出准确的预测。该系统配合强大的数据算法,锁定最佳客户。

    此外,它可识别异常情况和交叉销售机会,让用户能够根据需要运用不同的预测模型。此外,它以所需的方式定制客户画像。

    3. IBM SPSS Modeler

    说到大规模项目,IBM SPSS Modeler最适合。在这个建模器中,文本分析及其最先进的可视化界面极具价值。它有助于生成数据挖掘算法,基本上不需要编程。

    它可广泛用于异常检测、贝叶斯网络、CARMA、Cox回归以及使用多层感知器和反向传播学习的基本神经网络。

    4. KNIME

    Konstanz Information Miner是一个开源数据分析平台。你可以迅速在其中部署、扩展和熟悉数据。在商业智能界,KNIME号称是有助于为毫无经验的用户提供预测智能的平台。

    此外,数据驱动的创新系统有助于发掘数据潜力。此外,它包括数千个模块和随时可用的示例以及一大批集成的工具和算法。

    5. Python

    Python是一种免费的开源语言,因易用性常常与R相提并论。与R不同,Python学起来往往很容易上手,易于使用。许多用户发现可以在几分钟内开始构建数据,并进行极其复杂的亲和度分析。

    只要你熟悉变量、数据类型、函数、条件语句和循环等基本编程概念,最常见的业务用例数据可视化就很简单。

    6.火车采集器

    火车采集器由合肥乐维信息技术有限公司开发,是一款专业的网络数据采集/信息挖掘处理软件,通过灵活的配置,可以很轻松迅速地从网页上抓取结构化的文本、图片、文件等资源信息,可编辑筛选处理后选择发布到网站后台,各类文件或其他数据库系统中。

  • ?

    金融大数据分析的数据分流应用

    江诗桃

    展开

    随着金融大数据技术应用,以及相关业务大数据应用不断创新,金融机构的数据分析和业务创新,以及数据安全如何深度融合,是当前金融机构信息化面临的重要挑战。

    中国银监会印发《银行业金融机构信息系统风险管理指引》(2006年),其中第二十七条:银行业金融机构应加强数据采集、存贮、传输、使用、备份、恢复、抽检、清理、销毁等环节的有效管理,不得脱离系统采集加工、传输、存取数据;优化系统和数据库安全设置,严格按授权使用系统和数据库,采用适当的数据加密技术以保护敏感数据的传输和存取,保证数据的完整性、保密性。

    中国银监会印发《银行业金融机构全面风险管理指引》(银监发〔2016〕44号),其中第四十三条:银行业金融机构应当建立与业务规模、风险状况等相匹配的信息科技基础设施;第四十四条 银行业金融机构应当建立健全数据质量控制机制,积累真实、准确、连续、完整的内部和外部数据,用于风险识别、计量、评估、监测、报告,以及资本和流动性充足情况的评估。

    从银监会的两次下发指引文件要求中,我们可以看到,针对金额行业的数据分析,相对传统行业,在数据的采集、存储和处理过程中,在数据安全性、完整性、业务管理全面性上,有着更为严格的要求。

    那在金融大数据技术应用领域,如何更高效、安全的实现金融业务数据的精细化采集管理,是其中一个细分的技术领域,也是我们今天探讨的话题。

    金融业务大数据的采集管理技术需求

    金融行业的信息化在众多异构系统和DT环境中,越来越重视可视化和业务关联性,在互联网化金融交易和大数据技术应用的背景下,相关数据采集、分析的技术需求演进出现了新的变化,那就是分别是分流调度管理技术和业务可视化技术。

    可视化分析业务,需要采集、分析不同类别的数据,如基础数据,日志数据,安全数据或特定业务数据,因此需要分门别类进行分类调度。专业的分析应用需要专业的设备和系统配合。

    比如风险监管日趋严谨,每家金融机构对贷前风控、贷后风险管理的重视空前提高。而通过信息化手段实现风控能力上,数据准确完整,算法和模型是风控部署的核心。

    现在的金融机构IT架构大多分为在线系统、近线系统与离线系统。在线系统主要面向最终用户的交易请求;近线系统则针对一段时间内的历史数据进行存放和进行溯源查询;而离线系统则对历史时间的数据进行归档,在特殊情况下会被恢复进行使用。

    随着大数据技术的蓬勃发展,金融机构对全量历史数据的认知有新的变化。如何从历史数据中挖掘其潜在价值,如何将离线数据在线化以满足监管部门的需求,是很多银行开始利用大数据技术解决的问题。

    例如征信,银行已经能够获取社会各类有意义的信息进行记录,例如网上的各地各楼盘的房价、人行征信、法院执行纪录、工商局信息、企业上下游现金流等信息,然后通过这种信息对个人企业进行分析对比,对超常理的数据进行风险警告,便于审计人员快速判断识别潜在风险。

    又比如客户的POS刷卡记录,企业上下游流水账单,交税信息等等,整个可对企业进行现金流测算。又或者对客户信用卡还款时间,转账时间等等来判断客户手中现金或者回款时间,把推荐的理财营销时间推送给其客户经理等,实现真正的精准营销。

    总体来说,金融现有的业务需要把数据的有效分析和灵活应用到金融体系中去,而非空谈大数据应用。

    那在大数据业务分析、内容安全审计和业务应用可视化的应用中,面临最核心问题,那就是如何把业务流量正确、按需的方式传递给所需的数据分析系统。笔者认为需要专业的业务流数据管理系统才能够精准的识别、分类和分发传递。

    比如很多运维日志数据是通过UDP 514传递的,那日志服务器不需要接受其他内容,针对性采集即可。如交易或征信业务只需要采集数据库的Mysql TCP 3306 和Oracle TCP 1521端口往返数据,那分析系统也可降低性能负载,摘取所需数据是当前数据分析的必要措施。

    另外不得不说的是流量不少是无用的数据载荷。而常见的分析系统平台大多为千兆速率,那么网络单接口流量在万兆或更高流量时候,是增强系统分析系统的硬件配置还是通过数据裁剪方式来部署,那选择显而易见是裁剪优化而不是升级分析平台的硬件平台,因为那将是更高昂的硬件摊销成本。

    比如交易数据或征信数据等,可以进行剥离掉帧头帧尾和部分封装协议。数据分析服务器(比如性能分析类)吞吐量较低,无法承载大流量分析能力,需要将分发流量进行载荷截短,降低数据流量带宽,提升服务器分析效率。

    金融大数据采集分析应用建议使用专业分流技术

    上述的金融业务可视化分析以及IT系统环境运维过程中问题,是我们常见的数据采集、归类、提取再分发分析的技术需求和环境。

    因此在金融大数据识别、分类采集、分发存储等应用方面建议使用专业数据分流技术,因为其系统的精细化数据流管理功能为相关业务应用提供专业能力的保障,而这个数据分流应用并已在诸多的行业的运维和业务应用可视化领域成熟应用。

    目前国内市场上还没有针对金融行业系统应用的专业分流器出现。迈普公司凭借多年服务于金融经验,适时推出了与国外品牌相媲美的“网视”系列网络“数据分流器”产品。三大硬件系列、八大核心功能,在金融行业“可视化运维”部署业务中获得了充分验证和应用部署,打开了国产专业化网络分流器的新篇章。

    迈普“网视”系列“数据分流器”采用定制化专业流处理芯片,采用灵活流量调度技术,针对金融行业面临的全网安全审计和多业务点性能分析需求,重点解决基础网络设备“流”分发使用限制多、安全风险高、扩展能力弱等问题。

    过滤选项可以帮助用户在数据包层级,选择发送何种数据包到指定的监测端口。专业数据分流特性能实现业务流量正确、按需的方式传递给所需的分析系统,才能实现高效、快捷的问题定位、安全回溯,业务分析等应用。在满足上述需求的同时,更具有不影响原有业务网络、端口密度高和关键数据脱敏等技术优势。

    “八大核心功能”依次是:分析流M:N、分析流1:N负载、分析流溯源标识、分析流时间戳标签、分析流数据脱敏、分析流载荷截短、分析流远端IP传输和分析流对称HASH,可以满足运维过程中流量灵活分类、流量压缩、多业务支持的三个关键业务需求,解决传统网络设备的功能不足。

    迈普“网视”系列“数据分流器”是国内领先的行业级数据分流器产品,产品功能丰富、定制能力强,目前已经与大量流量可视化厂家实现了应用对接,如天旦、Ixia 、Netscout、赛门铁克、Compuware、科来、绿盟等。

    ---------------------------------------------------------

    1.本文援引自互联网,旨在传递更多网络信息,仅代表作者本人观点,与本网站无关。

    2.本文仅供读者参考,本网站未对该内容进行证实,对其原创性、真实性、完整性、及时性不作任何保证。

  • ?

    大数据信息采集的营销方式

    Sebastian

    展开

    企业做精准营销

    简单的来说就是利用互联网信息技术手段来实现个性化营销的活动

    需要依靠大数据信息采集系统作支撑

    企业精准营销可以从以下几个方面进行

    1.存在于网络中的信息碎片是独立错乱的

    需要将这些信息打通、链接实现信息共享

    为此要构建大数据交换共享平台

    实现用户的精准识别和数据汇集

    2.利用大数据信息采集工具实现精准营销和用户维系

    比如通过云速数据挖掘

    采集筛选精准需求客户信息

    进行一对一产品信息推广

    提高营销转化率

    3.实现运营精准化的基础是细分用户市场

    要求根据用户的消费习惯、需求等分析研究

    定位目标市场

    才能为精准营销提供依据

    最后要以客户为中心进行市场营销活动

    传统的营销模式以产品为导向

    对市场的反应速度缓慢

    大数据时代的精准营销

    是以客户的需求着手

    进行市场营销活动

  • ?

    线下大数据智能采集投放平台

    鲍嘉熙

    展开

    智能硬件结合大数据优势,全方位挖掘用户线下、线上行为,精准定义目标客群特征、消费偏好、地域分布,为零售客户提供选址招商、运营管理、客群洞察、推广营销、实现 营销的“点对点”高效精准的传播,是新一代人工智能思维下的营销新武器。

    店内优化

    客流实时监测

    顾客质量和转化率

    顾客运动轨迹热点动图

    店内商品试用、转化率

    新客招募

    厘米级精准定位新客,信息采集分析

    对接各个广告平台,精准投放

    广告效果评估

    提高活动效果

    展示真实人流,轨迹动图,客观评估活动效果

    场景式营销,广告实时送达

    用户画像

    了解品牌受众,帮助品牌定位

    进店顾客人群画像采集

    人员、物品管理

    优化员工管理系统,监测到岗及工作时间

    贵重物品定位,防盗防损

    优化库存管理

    探针

    集探针,iBeacon,商品触碰探测为一体

    wifi与gprs两种上报信息方式

    搭载gps模块,采集地理位置信息

    出色的定位技术

    手机号与mac地址绑定方案

    平台化运作,提供丰富的上层接口给集成商

    解决方案

    购买地址:https://detail.1688/offer/551150997804.html?spm=b26110380.sw1688.mof001.1.b4WnET

    或阿里巴巴搜索:58数云、潜客宝

  • ?

    六大主流大数据采集平台架构分析

    访风

    展开

    随着大数据越来越被重视,数据采集的挑战变的尤为突出。今天为大家介绍几款数据采集平台:

    Apache Flume Fluentd Logstash Chukwa Scribe Splunk Forwarder

    大数据平台与数据采集

    任何完整的大数据平台,一般包括以下的几个过程:

    数据采集–>数据存储–>数据处理–>数据展现(可视化,报表和监控)

    其中,数据采集是所有数据系统必不可少的,随着大数据越来越被重视,数据采集的挑战也变的尤为突出。这其中包括:

    我们今天就来看看当前可用的六款数据采集的产品,重点关注它们是如何做到高可靠,高性能和高扩展。

    1、Apache Flume

    Flume 是Apache旗下的一款开源、高可靠、高扩展、容易管理、支持客户扩展的数据采集系统。 Flume使用JRuby来构建,所以依赖Java运行环境。

    Flume最初是由Cloudera的工程师设计用于合并日志数据的系统,后来逐渐发展用于处理流数据事件。

    Flume设计成一个分布式的管道架构,可以看作在数据源和目的地之间有一个Agent的网络,支持数据路由。

    每一个agent都由Source,Channel和Sink组成。

    Source

    Source负责接收输入数据,并将数据写入管道。Flume的Source支持HTTP,JMS,RPC,NetCat,Exec,Spooling Directory。其中Spooling支持监视一个目录或者文件,解析其中新生成的事件。

    Channel

    Channel 存储,缓存从source到Sink的中间数据。可使用不同的配置来做Channel,例如内存,文件,JDBC等。使用内存性能高但不持久,有可能丢数据。使用文件更可靠,但性能不如内存。

    Sink

    Sink负责从管道中读出数据并发给下一个Agent或者最终的目的地。Sink支持的不同目的地种类包括:HDFS,HBASE,Solr,ElasticSearch,File,Logger或者其它的Flume Agent。

    Flume在source和sink端都使用了transaction机制保证在数据传输中没有数据丢失。

    Source上的数据可以复制到不同的通道上。每一个Channel也可以连接不同数量的Sink。这样连接不同配置的Agent就可以组成一个复杂的数据收集网络。通过对agent的配置,可以组成一个路由复杂的数据传输网络。

    配置如上图所示的agent结构,Flume支持设置sink的Failover和Load Balance,这样就可以保证即使有一个agent失效的情况下,整个系统仍能正常收集数据。

    Flume中传输的内容定义为事件(Event),事件由Headers(包含元数据,Meta Data)和Payload组成。

    Flume提供SDK,可以支持用户定制开发:

    Flume客户端负责在事件产生的源头把事件发送给Flume的Agent。客户端通常和产生数据源的应用在同一个进程空间。常见的Flume 客户端有Avro,log4J,syslog和HTTP Post。另外ExecSource支持指定一个本地进程的输出作为Flume的输入。当然很有可能,以上的这些客户端都不能满足需求,用户可以定制的客户端,和已有的FLume的Source进行通信,或者定制实现一种新的Source类型。

    同时,用户可以使用Flume的SDK定制Source和Sink。似乎不支持定制的Channel。

    2、Fluentd

    Fluentd是另一个开源的数据收集框架。Fluentd使用C/Ruby开发,使用JSON文件来统一日志数据。它的可插拔架构,支持各种不同种类和格式的数据源和数据输出。最后它也同时提供了高可靠和很好的扩展性。Treasure Data, Inc 对该产品提供支持和维护。

    Fluentd的部署和Flume非常相似:

    Fluentd的架构设计和Flume如出一辙:

    Fluentd的Input/Buffer/Output非常类似于Flume的Source/Channel/Sink。

    Input

    Input负责接收数据或者主动抓取数据。支持syslog,http,file tail等。

    Buffer

    Buffer负责数据获取的性能和可靠性,也有文件或内存等不同类型的Buffer可以配置。

    Output

    Output负责输出数据到目的地例如文件,AWS S3或者其它的Fluentd。

    Fluentd的配置非常方便,如下图:

    Fluentd的技术栈如下图:

    FLuentd和其插件都是由Ruby开发,MessgaePack提供了JSON的序列化和异步的并行通信RPC机制。

    Cool.io是基于libev的事件驱动框架。

    FLuentd的扩展性非常好,客户可以自己定制(Ruby)Input/Buffer/Output。

    Fluentd从各方面看都很像Flume,区别是使用Ruby开发,Footprint会小一些,但是也带来了跨平台的问题,并不能支持Windows平台。另外采用JSON统一数据/日志格式是它的另一个特点。相对去Flumed,配置也相对简单一些。

    3、Logstash

    Logstash是著名的开源数据栈ELK (ElasticSearch, Logstash, Kibana)中的那个L。

    Logstash用JRuby开发,所有运行时依赖JVM。

    Logstash的部署架构如下图,当然这只是一种部署的选项。

    一个典型的Logstash的配置如下,包括了Input,filter的Output的设置。

    几乎在大部分的情况下ELK作为一个栈是被同时使用的。所有当你的数据系统使用ElasticSearch的情况下,logstash是首选。

    4、Chukwa

    官网:https://chukwa.apache.org/

    Apache Chukwa是apache旗下另一个开源的数据收集平台,它远没有其他几个有名。Chukwa基于Hadoop的HDFS和Map Reduce来构建(显而易见,他用Java来实现),提供扩展性和可靠性。Chukwa同时提供对数据的展示,分析和监视。很奇怪的是它的上一次 github的更新事7年前。可见该项目应该已经不活跃了。

    Chukwa的部署架构如下:

    Chukwa的主要单元有:Agent,Collector,DataSink,ArchiveBuilder,Demux等等,看上去相当复杂。由于该项目已经不活跃,我们就不细看了。

    5、Scribe

    代码托管:https://github/facebookarchive/scribe

    Scribe是Facebook开发的数据(日志)收集系统。已经多年不维护,同样的,就不多说了。

    6、Splunk Forwarder

    以上的所有系统都是开源的。在商业化的大数据平台产品中,Splunk提供完整的数据采金,数据存储,数据分析和处理,以及数据展现的能力。

    Splunk是一个分布式的机器数据平台,主要有三个角色:

    Search Head负责数据的搜索和处理,提供搜索时的信息抽取。

    Indexer负责数据的存储和索引 Forwarder,负责数据的收集,清洗,变形,并发送给Indexer

    Splunk内置了对Syslog,TCP/UDP,Spooling的支持,同时,用户可以通过开发 Input和Modular Input的方式来获取特定的数据。在Splunk提供的软件仓库里有很多成熟的数据采集应用,例如AWS,数据库(DBConnect)等等,可以方便的从云或者是数据库中获取数据进入Splunk的数据平台做分析。

    这里要注意的是,Search Head和Indexer都支持Cluster的配置,也就是高可用,高扩展的,但是Splunk现在还没有针对Farwarder的Cluster的功能。也就是说如果有一台Farwarder的机器出了故障,数据收集也会随之中断,并不能把正在运行的数据采集任务Failover到其它的 Farwarder上。

    总结

    我们简单讨论了几种流行的数据收集平台,它们大都提供高可靠和高扩展的数据收集。大多平台都抽象出了输入,输出和中间的缓冲的架构。利用分布式的网络连接,大多数平台都能实现一定程度的扩展性和高可靠性。

    其中Flume,Fluentd是两个被使用较多的产品。如果你用ElasticSearch,Logstash也许是首选,因为ELK栈提供了很好的集成。Chukwa和Scribe由于项目的不活跃,不推荐使用。

    Splunk作为一个优秀的商业产品,它的数据采集还存在一定的限制,相信Splunk很快会开发出更好的数据收集的解决方案。

  • ?

    三大核心解读大数据信息采集

    Dean

    展开

    对于大数据的理解

    大多人还停留在很大的数据这一概念上

    其实不然

    大数据指的是存在于网络上的海量的信息碎片

    通过类似云速数据挖掘这种先进的技术将其采集、整合、

    从而发现隐藏于其中的关联信息

    下面通过三个核心来解读什么是大数据信息采集

    一、大数据营销是将所有营销行为和销售行为数据化

    将这些可挖掘、整理的数据作为营销活动的核心部分

    贴合需求打造符合市场及消费需求的商业模式、

    二、大数据信息采集实现线上线下结合的网络营销时代

    线上的营销活动不受时间空间限制

    将线上数据与传统模式结合起来

    打通数据库实现技术共享

    将是未来营销工作的首要重点

    三、大数据信息采集实现企业高效转化

    大数据营销的核心意在大规模的个性化互动

    指的是有针对性的传播内容

    更加人性化的服务

    而实现这以核心的基础就是大数据信息采集

大数据采集分发

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP