- ?
大数据信息采集的营销方式
静珊
展开
企业做精准营销
简单的来说就是利用互联网信息技术手段来实现个性化营销的活动
需要依靠大数据信息采集系统作支撑
企业精准营销可以从以下几个方面进行
1.存在于网络中的信息碎片是独立错乱的
需要将这些信息打通、链接实现信息共享
为此要构建大数据交换共享平台
实现用户的精准识别和数据汇集
2.利用大数据信息采集工具实现精准营销和用户维系
比如通过云速数据挖掘
采集筛选精准需求客户信息
进行一对一产品信息推广
提高营销转化率
3.实现运营精准化的基础是细分用户市场
要求根据用户的消费习惯、需求等分析研究
定位目标市场
才能为精准营销提供依据
最后要以客户为中心进行市场营销活动
传统的营销模式以产品为导向
对市场的反应速度缓慢
大数据时代的精准营销
是以客户的需求着手
进行市场营销活动
- ?
大数据平台安全防护
段勒
展开
企业大数据数据源接入越来越多、数据量越来越大、平台越来越复杂,保存了很多企业敏感数据,甚至客户隐私信息。随着数据商业价值的增加,针对数据的攻击、窃取、滥用、泄露等活动的持续泛滥,企业面临着严峻的安全风险。
安全风险及事件存在以下特点:一、风险成因复杂交织,既有外部攻击,也有内部泄露,既有技术漏洞,也有管理缺陷;既有新技术新模式触发的新风险,也有传统安全问题的持续触发;二、威胁范围全域覆盖,大数据安全威胁渗透在数据生产、交互和消费等大数据产业链的各个环节,包括数据源的提供者、大数据加工平台的提供者以及大数据分析服务的提供者等各类主体;三、事件影响重大深远,数据泄露影响面广,对用户隐私造成极大损害。从企业角度,建议运营者规范数据开发利用规则明确数据权属关系,重点加强个人数据和重点数据的安全管理,针对采集、存储、传输、处理、交换和销毁等各个环节开展全生命周期的保护,从制度流程、人员能力、组织建设和技术工具等方面加强数据安全能力建设。
安全防护体系的建设需要遵循“三分技术七分管理”的安全防护理念,从技术层面上考虑物理设施的安全,终端安全、网络安全和云平台安全等方面。平台安全管理要强化数据权限控制、数据脱敏和隐私保护和数据可信赖管理。横向涵盖数据流向各环节、纵向平台架构分层进行防护,规划和设计从网络、平台、数据、管理等方面全方位考虑安全防护,构建安全防御体系。
整体架构上横向主要是在数据采集入口增加安全网关、防火墙防护;建立数据安全隔离区,集中进行数据对内外交互、数据出口侧增加数据防泄漏设备,在交互过程对数据进行授权、隐私保护、水印、加密传递等处理。纵向从大数据平台硬件资源层加强漏洞检测版本补丁更新、Hadoop组件进行安全基线扫描。数据层面:管理上对数据进行敏感等级分类、安全保护机、操作规范制定,根据规则对现有数据进行脱敏处理;应用租户,可通过4A等安全平台进行授权及合规操作等。
网络安全:
一、内外网物理隔离:大数据平台部署在企业内网,与外网物理隔离杜绝安全隐患。对网络通讯进行监控,如果发现任何来自于网络内部或外部的黑客入侵或可疑的访问行为,可做到及时的报警与阻断,通过网络平面隔离的方式来保证网络安全。
二、数据采集安全防护:对内对外系统数据采集网络入口部署防火墙、安全网关,建立数据隔离区,完成大数据平台内外部系统数据交互,保障安全。
三、数据共享安全防护;多租户隔离,实施多租户访问隔离,数据安全等级划分以及基于标签的强制访问控制,提供数据访问授权模型,提供全局数据视图和私有数据视图,提供数据视图的访问控制。通过数据隔离区,实现大数据平台数据对企业内外部数据共享,在网络出口处部署数据防泄漏设备,实现敏感数据保护。
四、数据传输安全防护:用户隐私数据脱敏,提供数据脱敏和个人信息去标识化功能,提供满足国际密码算法的用户数据加密服务。各类用户可通过数据共享发布平台访问大数据平台,提交访问数据请求,访问代理层收到用户访问请求后,根据用户权限分析所要访问的数据,与脱敏及访问策略映射库进行比对,对需要脱敏的数据进行脱敏然后加密传输展示给用户。
五、流量异常监控:搭建数据流量异常监控平台,能够实时监控平台出现的各种网络问题。对网络中所有传输的数据进行检测、分析、诊断,排除网络事故,规避安全风险,有效的提高网络性能。
六、数据容灾:为集群内部数据提供实时的异地数据备份容灾功能,数据库对外提供跨数据中心的容灾机制。
平台安全:
一、硬件安全:主机安全漏洞扫描,系统版本补丁更新,防病毒处理等。加强主机口令、操作管理,减少非法登录。定期备份系统和文件数据,能够快速修复主机的系统问题。建设大数据系统的网关/防火墙,外部攻击首先需要冲破代理的保护才能进一步攻击大数据平台,增加恶意用户的攻击难度。
二、组件安全:组件安全针对大数据的主流平台HDFS、HIVE、HBASE、Storm、Spark等进行安全基线扫描,分别提出身份、认证、授权、审计等配置方面检查方法,并形成可操作的手册和可执行脚本,并整合入SMP系统管理;增加对大数据平台漏洞信息的管理及处理。
三、存储安全:存储安全包括数据的加密存储、访问控制、数据的封装、数据的备份与恢复以及残余数据的销毁。敏感数据脱敏保存,禁止明文存储。加强数据文件的校验,保持分布式文件的一致性。根据安全要求,授权访问数据。定期备份数据,一旦发生数据丢失或损坏,可以利用备份来恢复数据,从而保证在故障发生后数据不丢失。
四、应用安全:用户认证,多租户纳入4A平台集中管理,接入4A平台管控的大数据平台必须开启Kerberos认证配置,以集中管控大数据平台的多租户信息。金库访问:当多租户没有明文数据的查询权限,经审批可以通过金库模块获得明文数据的查看权限。
数据安全:对数据进行敏感等级分类、安全保护机及操作规范制定。根据敏感数据规则定义对平台存储敏感数据识别、打标及打标数据的分类分级访问控制;根据数据敏感规则,扫描引擎、扫描数据库敏感数据,生成敏感数据及访问策略映射库。
管理保障:建立大数据安全管理保障制度和规范,安全策略管控方面做到集中管理、集中修订、集中更新安全规则,从而实现统一的安全策略实施,安全管理员能够在中央控制端进行全系统的监控;安全保障要求方面按照规范要求进行数据访问、应用操作。相关制度包括对外合作安全管理(外部业务合作和外部代维代建)、内部安全管理、数据分类分级管理、应急响应机制、资产设施保护和认证授权管理等。
大数据安全防护体系的建设,需要对大数据安全防护体系内部的各个模块进行详细的研究,通过多种手段保障企业级大数据平台的安全,最终构建大数据安全管控平台,实现敏感数据隐私保护,降低企业运营风险;规范大数据平台操作流程,保证开源系统的安全,做到大数据平台系统“事前可管、事中可控、事后可查”。
- ?
线下大数据智能采集投放平台
底线
展开
智能硬件结合大数据优势,全方位挖掘用户线下、线上行为,精准定义目标客群特征、消费偏好、地域分布,为零售客户提供选址招商、运营管理、客群洞察、推广营销、实现 营销的“点对点”高效精准的传播,是新一代人工智能思维下的营销新武器。
店内优化
客流实时监测
顾客质量和转化率
顾客运动轨迹热点动图
店内商品试用、转化率
新客招募
厘米级精准定位新客,信息采集分析
对接各个广告平台,精准投放
广告效果评估
提高活动效果
展示真实人流,轨迹动图,客观评估活动效果
场景式营销,广告实时送达
用户画像
了解品牌受众,帮助品牌定位
进店顾客人群画像采集
人员、物品管理
优化员工管理系统,监测到岗及工作时间
贵重物品定位,防盗防损
优化库存管理
探针
集探针,iBeacon,商品触碰探测为一体
wifi与gprs两种上报信息方式
搭载gps模块,采集地理位置信息
出色的定位技术
手机号与mac地址绑定方案
平台化运作,提供丰富的上层接口给集成商
解决方案
购买地址:https://detail.1688/offer/551150997804.html?spm=b26110380.sw1688.mof001.1.b4WnET
或阿里巴巴搜索:58数云、潜客宝
- ?
基于大数据平台的数据分析
梦碎
展开
标签 | 大数据 架构
作者 | 张逸
无论是采集数据,还是存储数据,都不是大数据平台的最终目标。失去数据处理环节,即使珍贵如金矿一般的数据也不过是一堆废铁而已。数据处理是大数据产业的核心路径,然后再加上最后一公里的数据可视化,整个链条就算彻底走通了。
数据处理的分类
如下图所示,我们可以从业务、技术与编程模型三个不同的视角对数据处理进行归类:
业务角度的分类与具体的业务场景有关,但最终会制约技术的选型,尤其是数据存储的选型。例如,针对查询检索中的全文本搜索,ElasticSearch会是最佳的选择,而针对统计分析,则因为统计分析涉及到的运算,可能都是针对一列数据,例如针对销量进行求和运算,就是针对销量这一整列的数据,此时,选择列式存储结构可能更加适宜。
在技术角度的分类中,严格地讲,SQL方式并不能分为单独的一类,它其实可以看做是对API的封装,通过SQL这种DSL来包装具体的处理技术,从而降低数据处理脚本的迁移成本。毕竟,多数企业内部的数据处理系统,在进入大数据时代之前,大多以SQL形式来访问存储的数据。大体上,SQL是针对MapReduce的包装,例如Hive、Impala或者Spark SQL。
Streaming流处理可以实时地接收由上游源源不断传来的数据,然后以某个细小的时间窗口为单位对这个过程中的数据进行处理。消费的上游数据可以是通过网络传递过来的字节流、从HDFS读取的数据流,又或者是消息队列传来的消息流。通常,它对应的就是编程模型中的实时编程模型。
机器学习与深度学习都属于深度分析的范畴。随着Google的AlphaGo以及TensorFlow框架的开源,深度学习变成了一门显学。我了解不多,这里就不露怯了。
机器学习与常见的数据分析稍有不同,通常需要多个阶段经历多次迭代才能得到满意的结果。下图是深度分析的架构图:
针对存储的数据,需要采集数据样本并进行特征提取,然后对样本数据进行训练,并得到数据模型。倘若该模型经过测试是满足需求的,则可以运用到数据分析场景中,否则需要调整算法与模型,再进行下一次的迭代。
编程模型中的离线编程模型以Hadoop的MapReduce为代表,内存编程模型则以Spark为代表,实时编程模型则主要指的是流处理,当然也可能采用Lambda架构,在Batch Layer(即离线编程模型)与Speed Layer(实时编程模型)之间建立Serving Layer,利用空闲时间与空闲资源,又或者在写入数据的同时,对离线编程模型要处理的大数据进行预先计算(聚合),从而形成一种融合的视图存储在数据库中(如HBase),以便于快速查询或计算。
场景驱动数据处理
不同的业务场景(业务场景可能出现混合)需要的数据处理技术不尽相同,因而在一个大数据系统下可能需要多种技术(编程模型)的混合。
场景1:某厂商的舆情分析
某厂商在实施舆情分析时,根据基于需求,与数据处理有关的部分就包括:语义分析、全文本搜索与统计分析。通过网络爬虫抓取过来的数据会写入到Kafka,而消费端则通过Spark Streaming对数据进行去重去噪,之后交给SAS的ECC服务器进行文本的语义分析。分析后的数据会同时写入到HDFS(Parquet格式的文本)和ElasticSearch。同时,为了避免因为去重去噪算法的误差而导致部分有用数据被“误杀”,在MongoDB中还保存了一份全量数据。如下图所示:
场景2:Airbnb的大数据平台
Airbnb的大数据平台也根据业务场景提供了多种处理方式,整个平台的架构如下图所示:
Panoramix(现更名为Caravel)为Airbnb提供数据探查功能,并对结果进行可视化,Airpal则是基于Web的查询执行工具,它们的底层都是通过Presto对HDFS执行数据查询。Spark集群则为Airbnb的工程师与数据科学家提供机器学习与流处理的平台。
大数据平台的整体结构
行文至此,整个大数据平台系列的讲解就快结束了。最后,我结合数据源、数据采集、数据存储与数据处理这四个环节给出了一个整体结构图,如下图所示:
这幅图以查询检索场景、OLAP场景、统计分析场景与深度分析场景作为核心的四个场景,并以不同颜色标识不同的编程模型。从左到右,经历数据源、数据采集、数据存储和数据处理四个相对完整的阶段,可供大数据平台的整体参考。
- ?
三大核心解读大数据信息采集
姬尔
展开
对于大数据的理解
大多人还停留在很大的数据这一概念上
其实不然
大数据指的是存在于网络上的海量的信息碎片
通过类似云速数据挖掘这种先进的技术将其采集、整合、
从而发现隐藏于其中的关联信息
下面通过三个核心来解读什么是大数据信息采集
一、大数据营销是将所有营销行为和销售行为数据化
将这些可挖掘、整理的数据作为营销活动的核心部分
贴合需求打造符合市场及消费需求的商业模式、
二、大数据信息采集实现线上线下结合的网络营销时代
线上的营销活动不受时间空间限制
将线上数据与传统模式结合起来
打通数据库实现技术共享
将是未来营销工作的首要重点
三、大数据信息采集实现企业高效转化
大数据营销的核心意在大规模的个性化互动
指的是有针对性的传播内容
更加人性化的服务
而实现这以核心的基础就是大数据信息采集
- ?
企业进入大数据信息采集时代
顾冰萍
展开
做网络营销
不论是个人还是公司都想要实现产品的渠道拓展和推广宣传
但绝大多数的企业都不能达成想要的效果
其实原因有很多
一、想要做好网络营销
客户是王道
没有强大的客户群做后盾
网络营销的销量不过是空想罢了
当下客户渠道大多以网络大数据信息采集的方式来获取
如云速数据挖掘
通过输入行业关键字
就能一键采集指定区域的客户信息和联系方式
省时高效
二、通过客户信息
从分考虑分析目标群体的生活轨迹和习惯
来预测客户下一步的消费行为
以正确的时间正确的方式传达产品信息
从而完成营销活动
三、产品文案的策划一定要以客户需求为重点
并且简单易懂、快速吸引客户眼球
才能使转化率达到最佳
- ?
工业大数据平台实现
Isabella
展开
当下,互联网技术与可再生能源革命正在开启新一轮工业革命的大幕,人类已经站在新时代的门槛上。
随着物联网(IOT)技术的飞速发展,对传统企业,能否抓住这一历史机遇,依靠技术进步,改善和产业素质与提高生产效率,对企业进行智能化、工业化相结合的改进升级,从传统的厂发展为高技术企业。借助互联网+物联网等技术, 坚持“创新驱动、质量为先、绿色发展、结构优化、人才为本”的基本方针,实现“中国制造2025”伟大目标。
在工业领域中,以产品数据为核心,极大延展了传统工业数据范围,同时还包括工业大数据相关技术和应用。其主要来源可分为以下三类:第一类是生产经营相关业务数据。第二类是设备过程数据。第三类是外部数据。
上述三种数据中,最难获取的是第二类数据,是产业升级中实现过程自动化、机械制造自动化、管理自动化的关键数据来源依据。
工业大数据平台由后台服务器、WEB服务器、手机APP、数据库、后台监控软件、前端展示框架、现场采集控制主机、工业微电脑控制器、物联网模块、无线网关、4G传输设备、传感模块等组成。
现场MQTT服务器英特隆工业级微电脑控制器无线网关集中器传感器模块GPRS数据传输数据化展示自组网IOT模块整机拓扑框图 - ?
大数据监控平台实践之路
余元菱
展开
综述
日志和监控开发人员工作中必不可少的两只眼睛,日志是为了快速定位排查故障,监控是为了发现潜在问题并能及时告警,是故障诊断和分析的重要辅助利器,同样监控系统对大数据平台重要性不言而喻。在发生事故之前就能预警,最大限度降低系统故障率,是监控的终极目标和价值体现。本文旨在帮助大家了解监控系统,并能快速搭建公司的监控平台。
监控体系
监控粒度、监控指标完整性、监控实时性是评价监控系统的三要素。从分层体系可以把监控系统分为三个层次:
业务层:业务系统本质目的是为了达成业务目标,因此监控业务系统是否正常最有效的方式是从数据上监控业务目标是否达成。对业务运营数据进行监控,可及时发现程序bug或业务逻辑设计缺陷,比如注册失败率、登录失败率、付款失败率等。业务系统的多样性决定了应由各个业务系统实现监控指标开发。应用层:对应用的整体运行状况进行了解、把控,如果将应用当成黑盒子,开发、运维就无从知晓应用当前状态,不能及时发现潜在故障。应用监控不应局限于业务系统,还包括各种中间件、计算引擎,如Spark、Jstorm、redis、zookeeper、kafka等。常用监控数据:JVM堆内存、GC、CPU使用率、线程数、TPS、吞吐量等。一般通过抽象出的统一指标收集组件,收集应用级指标,比如不管是支付系统还是交易系统,都要监控jvm内存使用。系统层:实时掌握服务器工作状态,留意性能、内存消耗、容量和整体系统健康状态,保证服务器稳定运行。监控指标:内存、磁盘、CPU、网络流量、系统进程等系统级性能指标架构设计
工欲善其事必先利其器,根据对现有监控产品的调研,以及我们对监控的分层介绍、所需解决的问题,可以发现监控系统从收集到分析的流程架构:采集-存储-展示-告警:
Telegraf:插件化的指标收集和指标报告服务,能定制化开发并轻松添加所需插件。已经内置了很多常用服务的插件,这也是我们选择telegraf的原因之一,不用再重复造轮子
InfluxDB:高性能的布式时间序列指标数据库。监控指标收集是非常频繁的,否则就失去了实时性,高频收集的结果就是大数据量,也要对时间序列进行分析,InfluxDB就能满足这种应用场景
Grafana:时间序列分析和监控的开放平台,支持多种数据源(InfluxDB、OpenTSDB时间序列数据库)、丰富的展现形式、支持email/dingding报警
Telegraf
go语言编写的插件化指标收集agent,编译成一个没有外部依赖的二进制文件,安装部署很便捷,直接下载、解压就行,默认配置文件在$TELEGRAF_HOME/etc/telegraf/telegraf.conf目录下。telegraf插件分为两大类:input、output。
input:收集inputs配置的所有指标,已内置的input插件:elasticsearch、redis、jolokia等。也可直接收集运行agent server的各种指标,比如内存、cpu、磁盘、磁盘IO、进程、swap等。input配置都很简明易用,一般只需配置服务IP地址就可以,如redis指标收集配置:
如果没有内置收集插件,有两种实现方案:
开发input插件,但这需要有GO语言基础借助于httpjson input插件,该插件请求http url,返回json格式。url配置为自定义指标收集服务,在指标收集服务内实现指标收集功能,然后指标封装成json返回或指标数据直接在服务内入库。我们监控Kettle Carte、spark、jstorm等用的这种实现思路。output:将收集到的度量数据序列化存储,Telegraf指标由四个部分组成:度量、标签、字段、时间戳。支持以下存储结构:InfluxDB、Graphite、JSON,比如度量输出到InfluxDB的配置:
urls:InfluxDB端口
database:存储的数据库
retention_policy:数据保留策略
调度频率:所有指标收集频率是一样的,在配置文件agent项下配置:
服务启动:
--config:配置文件
--config-directory:配置文件目录,如果有多个配置文件时使用
InfluxDB
InfluxDB是为时间序列构建的高性能数据存储,提供类SQL的查询语言、特定分析时间序列的功能。通过设置数据保留策略,自动从系统中删除过期数据,释放存储空间。社区版只支持单台服务器,会有单点故障风险,商业版版支持高可用,对我们来说,单机InfluxDB已经能满足需求。选择InfluxDB的原因:
InflluxDB是用GO写的,编译后是一个完全无依赖的二进制文件,安装部署非常便捷,解压缩包即可高性能时间序列专有数据库,对时间序列的存储和查询都做了优化类SQL查询语言,降低使用门槛数据保留策略可以有效的自动清理过期数据 InfluxDB的数据是以shard groups形式存储,指定时间间隔的数据存储到一个shard groups里,这个时间间隔称为shardGroupDuration。
服务启动:
influx进入shell命令行:
常用命令:
show databases:查看所有数据库
use db_name:进入数据库
show measurements:显示数据库下所有度量
select *from cpu limit 10:查询一个度量的数据
Telegraf默认是将收集的数据持久化到telegraf这个数据库下,每个input对应一个度量表,比如zookeeper的指标数据就在zookeeper这个度量下:
查询数据保留策略:
duration:数据保留时间,0表示无限制,InfluxDB默认30分钟检查一次保留策略。ALTER RETENTION语句修改保留7天数据。
replicaN:每个度量在集群里的副本数,副本保证数据高可用性,社区版(单节点)不支持副本数设置
Java Client:
Java Client对http api进行了封装,底层用Retrofit框架进行http请求,是线程安全的,只需在一个应用中创建一个InfluxDB Client对象。
client的写操作支持batch,其实现原理:1、创建后台单线程定时调度任务,线程每隔一定时间发送请求:
2、每次writer时,把请求放到BlockingQueue队列里,如果队列大于batch数,就启动线程发送请求:
Client Api使用例子: 1、创建数据库连接:
InfluxDB influxDB= InfluxDBFactory.connect(url, user, password);
url:InfluxDB的地址和端口,比如 http://localhost:8086
user/password:InfluxDB的用户名/密码
2、设置访问的数据库:
influxDB.setDatabase(database);
3、数据写入:
Point.Builder builder = Point.measurement(measurement);
builder.tag(tags);
builder.fields(fields);
influxDB.write(builder.build());
Grafana
Grafana是一个指标查询、可视化、监控的开源应用,有着非常漂亮的图表和布局展示,功能齐全的度量仪表盘和图形编辑器,支持Graphite、zabbix、InfluxDB、Prometheus和OpenTSDB作为数据源。
Grafana主要特性:
灵活丰富的图形化组件,包括热力图、直方图、地图等在同一dashboard内可以混合多种展示组件开源社区有大量的插件可供选择,包括数据源插件、图形插件、通知插件可以在同一个视图里使用多个不同数据源简单使用介绍:
安装:下载&解压二进制包配置:配置文件:$GRAFANA_HOME$/conf配置端口号、Email、登录用户start:命令:/opt/grafana/bin/grafana-server start访问:http://ip:port连接数据源、图表开发、报警设置可参看官方文档本文为原创,欢迎分享到朋友圈。
- ?
六大主流大数据采集平台架构分析
翁鸿煊
展开
随着大数据越来越被重视,数据采集的挑战变的尤为突出。今天为大家介绍几款数据采集平台:
Apache Flume Fluentd Logstash Chukwa Scribe Splunk Forwarder
大数据平台与数据采集
任何完整的大数据平台,一般包括以下的几个过程:
数据采集–>数据存储–>数据处理–>数据展现(可视化,报表和监控)
其中,数据采集是所有数据系统必不可少的,随着大数据越来越被重视,数据采集的挑战也变的尤为突出。这其中包括:
我们今天就来看看当前可用的六款数据采集的产品,重点关注它们是如何做到高可靠,高性能和高扩展。
1、Apache Flume
Flume 是Apache旗下的一款开源、高可靠、高扩展、容易管理、支持客户扩展的数据采集系统。 Flume使用JRuby来构建,所以依赖Java运行环境。
Flume最初是由Cloudera的工程师设计用于合并日志数据的系统,后来逐渐发展用于处理流数据事件。
Flume设计成一个分布式的管道架构,可以看作在数据源和目的地之间有一个Agent的网络,支持数据路由。
每一个agent都由Source,Channel和Sink组成。
Source
Source负责接收输入数据,并将数据写入管道。Flume的Source支持HTTP,JMS,RPC,NetCat,Exec,Spooling Directory。其中Spooling支持监视一个目录或者文件,解析其中新生成的事件。
Channel
Channel 存储,缓存从source到Sink的中间数据。可使用不同的配置来做Channel,例如内存,文件,JDBC等。使用内存性能高但不持久,有可能丢数据。使用文件更可靠,但性能不如内存。
Sink
Sink负责从管道中读出数据并发给下一个Agent或者最终的目的地。Sink支持的不同目的地种类包括:HDFS,HBASE,Solr,ElasticSearch,File,Logger或者其它的Flume Agent。
Flume在source和sink端都使用了transaction机制保证在数据传输中没有数据丢失。
Source上的数据可以复制到不同的通道上。每一个Channel也可以连接不同数量的Sink。这样连接不同配置的Agent就可以组成一个复杂的数据收集网络。通过对agent的配置,可以组成一个路由复杂的数据传输网络。
配置如上图所示的agent结构,Flume支持设置sink的Failover和Load Balance,这样就可以保证即使有一个agent失效的情况下,整个系统仍能正常收集数据。
Flume中传输的内容定义为事件(Event),事件由Headers(包含元数据,Meta Data)和Payload组成。
Flume提供SDK,可以支持用户定制开发:
Flume客户端负责在事件产生的源头把事件发送给Flume的Agent。客户端通常和产生数据源的应用在同一个进程空间。常见的Flume 客户端有Avro,log4J,syslog和HTTP Post。另外ExecSource支持指定一个本地进程的输出作为Flume的输入。当然很有可能,以上的这些客户端都不能满足需求,用户可以定制的客户端,和已有的FLume的Source进行通信,或者定制实现一种新的Source类型。
同时,用户可以使用Flume的SDK定制Source和Sink。似乎不支持定制的Channel。
2、Fluentd
Fluentd是另一个开源的数据收集框架。Fluentd使用C/Ruby开发,使用JSON文件来统一日志数据。它的可插拔架构,支持各种不同种类和格式的数据源和数据输出。最后它也同时提供了高可靠和很好的扩展性。Treasure Data, Inc 对该产品提供支持和维护。
Fluentd的部署和Flume非常相似:
Fluentd的架构设计和Flume如出一辙:
Fluentd的Input/Buffer/Output非常类似于Flume的Source/Channel/Sink。
Input
Input负责接收数据或者主动抓取数据。支持syslog,http,file tail等。
Buffer
Buffer负责数据获取的性能和可靠性,也有文件或内存等不同类型的Buffer可以配置。
Output
Output负责输出数据到目的地例如文件,AWS S3或者其它的Fluentd。
Fluentd的配置非常方便,如下图:
Fluentd的技术栈如下图:
FLuentd和其插件都是由Ruby开发,MessgaePack提供了JSON的序列化和异步的并行通信RPC机制。
Cool.io是基于libev的事件驱动框架。
FLuentd的扩展性非常好,客户可以自己定制(Ruby)Input/Buffer/Output。
Fluentd从各方面看都很像Flume,区别是使用Ruby开发,Footprint会小一些,但是也带来了跨平台的问题,并不能支持Windows平台。另外采用JSON统一数据/日志格式是它的另一个特点。相对去Flumed,配置也相对简单一些。
3、Logstash
Logstash是著名的开源数据栈ELK (ElasticSearch, Logstash, Kibana)中的那个L。
Logstash用JRuby开发,所有运行时依赖JVM。
Logstash的部署架构如下图,当然这只是一种部署的选项。
一个典型的Logstash的配置如下,包括了Input,filter的Output的设置。
几乎在大部分的情况下ELK作为一个栈是被同时使用的。所有当你的数据系统使用ElasticSearch的情况下,logstash是首选。
4、Chukwa
官网:https://chukwa.apache.org/
Apache Chukwa是apache旗下另一个开源的数据收集平台,它远没有其他几个有名。Chukwa基于Hadoop的HDFS和Map Reduce来构建(显而易见,他用Java来实现),提供扩展性和可靠性。Chukwa同时提供对数据的展示,分析和监视。很奇怪的是它的上一次 github的更新事7年前。可见该项目应该已经不活跃了。
Chukwa的部署架构如下:
Chukwa的主要单元有:Agent,Collector,DataSink,ArchiveBuilder,Demux等等,看上去相当复杂。由于该项目已经不活跃,我们就不细看了。
5、Scribe
代码托管:https://github/facebookarchive/scribe
Scribe是Facebook开发的数据(日志)收集系统。已经多年不维护,同样的,就不多说了。
6、Splunk Forwarder
以上的所有系统都是开源的。在商业化的大数据平台产品中,Splunk提供完整的数据采金,数据存储,数据分析和处理,以及数据展现的能力。
Splunk是一个分布式的机器数据平台,主要有三个角色:
Search Head负责数据的搜索和处理,提供搜索时的信息抽取。
Indexer负责数据的存储和索引 Forwarder,负责数据的收集,清洗,变形,并发送给Indexer
Splunk内置了对Syslog,TCP/UDP,Spooling的支持,同时,用户可以通过开发 Input和Modular Input的方式来获取特定的数据。在Splunk提供的软件仓库里有很多成熟的数据采集应用,例如AWS,数据库(DBConnect)等等,可以方便的从云或者是数据库中获取数据进入Splunk的数据平台做分析。
这里要注意的是,Search Head和Indexer都支持Cluster的配置,也就是高可用,高扩展的,但是Splunk现在还没有针对Farwarder的Cluster的功能。也就是说如果有一台Farwarder的机器出了故障,数据收集也会随之中断,并不能把正在运行的数据采集任务Failover到其它的 Farwarder上。
总结
我们简单讨论了几种流行的数据收集平台,它们大都提供高可靠和高扩展的数据收集。大多平台都抽象出了输入,输出和中间的缓冲的架构。利用分布式的网络连接,大多数平台都能实现一定程度的扩展性和高可靠性。
其中Flume,Fluentd是两个被使用较多的产品。如果你用ElasticSearch,Logstash也许是首选,因为ELK栈提供了很好的集成。Chukwa和Scribe由于项目的不活跃,不推荐使用。
Splunk作为一个优秀的商业产品,它的数据采集还存在一定的限制,相信Splunk很快会开发出更好的数据收集的解决方案。
- ?
干货丨大数据是如何被采集及应用的
Penco
展开
尽管“大数据”一词近年来屡遭热捧
但很多人都还不知道什么是大数据
更不知道大数据有甚卵用
这两年,发现“大数据”这个词出现的越来越频繁了
不仅企业,连国家都在部署大数据战略
一番百度了之后
Oh~ emmmmmmmmm~ +_+
还是没搞懂大数据到底是个什么玩意儿
直到有一天
我发现一个秘密
不管我在网上搜索什么
页面都会跳出我要搜索的相关产品或关联事物
然后,我恍然大悟!
所谓大数据,就是算法!
它能够“算”出我们“心中所想”
那么问题来了
大数据技术是如何采集到我们的信息的呢?
数据采集,又称数据获取,是利用一种装置,从系统外部采集数据并输入到系统内部的一个接口。在互联网行业快速发展的今天,数据采集已经被广泛应用于互联网及分布式领域,比如摄像头,麦克风,都是数据采集工具。
数据采集系统整合了信号、传感器、激励器、信号调理、数据采集设备和应用软件。在数据大爆炸的互联网时代,数据的类型也是复杂多样的,包括结构化数据、半结构化数据、非结构化数据。结构化最常见,就是具有模式的数据。非结构化数据是数据结构不规则或不完整,没有预定义的数据模型,包括所有格式的办公文档、文本、图片、XML, HTML、各类报表、图像和音频/视频信息等等。大数据采集,是大数据分析的入口,所以是相当重要的一个环节。
我们首先来了解一下数据采集的三大要点:
一、数据采集的三大要点
(1)全面性
数据量足够具有分析价值、数据面足够支撑分析需求。
比如对于“查看商品详情”这一行为,需要采集用户触发时的环境信息、会话、以及背后的用户id,最后需要统计这一行为在某一时段触发的人数、次数、人均次数、活跃比等。
(2)多维性
数据更重要的是能满足分析需求。灵活、快速自定义数据的多种属性和不同类型,从而满足不同的分析目标。
比如“查看商品详情”这一行为,通过埋点,我们才能知道用户查看的商品是什么、价格、类型、商品id等多个属性。从而知道用户看过哪些商品、什么类型的商品被查看的多、某一个商品被查看了多少次。而不仅仅是知道用户进入了商品详情页。
(3)高效性
高效性包含技术执行的高效性、团队内部成员协同的高效性以及数据分析需求和目标实现的高效性。也就是说采集数据一定要明确采集目的,带着问题搜集信息,使信息采集更高效、更有针对性。此外,还要考虑数据的及时性。
不同应用领域的大数据其特点、数据量、用户群体均不相同。不同领域根据数据源的物理性质及数据分析的目标采取不同的数据采集方法。
那么,接下来我们再来了解一下常用的数据采集的方法。
常用的数据采集方法归结为以下三类:传感器、日志文件、网络爬虫。
(1)传感器
传感器通常用于测量物理变量,一般包括声音、温湿度、距离、电流等,将测量值转化为数字信号,传送到数据采集点,让物体有了触觉、味觉和嗅觉等感官,让物体慢慢变得活了起来。
(2)系统日志采集方法
日志文件数据一般由数据源系统产生,用于记录数据源的执行的各种操作活动,比如网络监控的流量管理、金融应用的股票记账和 web 服务器记录的用户访问行为。
很多互联网企业都有自己的海量数据采集工具,多用于系统日志采集,如Hadoop的Chukwa,Cloudera的Flume,Facebook的Scribe等,这些工具均采用分布式架构,能满足每秒数百MB的日志数据采集和传输需求。
(3)Web 爬虫
网络爬虫是指为搜索引擎下载并存储网页的程序,它是搜索引擎和 web 缓存的主要的数据采集方式。通过网络爬虫或网站公开API等方式从网站上获取数据信息。该方法可以将非结构化数据从网页中抽取出来,将其存储为统一的本地数据文件,并以结构化的方式存储。它支持图片、音频、视频等文件或附件的采集,附件与正文可以自动关联。
此外,对于企业生产经营数据上的客户数据,财务数据等保密性要求较高的数据,可以通过与数据技术服务商合作,使用特定系统接口等相关方式采集数据。比如八度云计算的数企BDSaaS,无论是数据采集技术、BI数据分析,还是数据的安全性和保密性,都做的很好。
数据的采集是挖掘数据价值的第一步,当数据量越来越大时,可提取出来的有用数据必然也就更多。只要善用数据化处理平台,便能够保证数据分析结果的有效性,助力企业实现数据驱动。
大数据采集平台
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并