网站性能检测评分
注:本网站页面html检测工具扫描网站中存在的基本问题,仅供参考。
数据集成
新的未来!Salesforce和IBM推出了更多数据集成工具 企业视频课程
周四,Salesforce和IBM推出了一套新的联合产品,为客户带来更多的数据整合。
这两家公司的联盟始于今年3月,Salesforce Einstein和IBM Watson之间宣布了人工智能合作伙伴关系。
这笔交易让Salesforce的客户可以直接访问沃森人工智能平台上的数据。
与此同时,IBM也在内部签署了使用Salesforce服务云服务的协议。
这一新的联合产品将为Salesforce客户带来IBM的天气洞察,以及IBM的云计算集成。
Salesforce的IBM 云计算集成让联合客户能够在云计算和数据中心系统中同步Salesforce的业务数据。
此外,IBM的天气洞察现在正在Salesforce AppExchange上为三个新Lightning组件供电。
有关零部件的计划最早在今年3月公布,所以这条新闻实际上是关于细节的。
首先,一个组件叫做“天气焦点”,它允许开发者使用天气数据来构建智能应用。
另一个组件是日程安排助理,它可以让企业根据天气状况来安排预约。
第三个组件被称为天气记录仪,它让用户能够将天气数据从特定的日期和时间记录到Salesforce的案例记录中。
Salesforce提到了一名保险代理人,他将索赔作为该服务的实际用例。
IBM公司Bluewolf也将增强其全球咨询业务的能力,在关键市场推出新的Salesforce客户互动中心。
年产3000万吨水泥背后的数据集成平台 营销视频课程
中国葛洲坝集团水泥公司近年来不断加快转型升级步伐,资产总额达130亿,下辖19家子分公司,年水泥产能约3000万吨...
伴随呈指数式增长的设备数据、生产数据、工艺数据,公司在战略执行与数据归集应用上面临多重挑战:
如何逐级分解战略计划,实现追踪执行?如何让各异构系统数据实现联动、共享?如何从碎片化业务数据中挖掘资源价值?
一、数据分析与执行效率并行
泛微以葛洲坝集团水泥公司挑战为核心导向,打造支撑战略执行及经营数据决策的大数据协同管理平台,赋能公司实现经济效益与社会效益双丰收。
(大数据协同管理平台总架构)1、执行力平台:计划分解、追踪、落地
1)战略计划“分解器”
为了让管理者的战略计划逐级分解至部门与员工工作计划,构建以公司经营目标为核心的工作分解执行体系,提升公司战略计划执行力。
葛洲坝集团水泥公司借助泛微目标执行力平台,将公司战略目标按照组织、岗位、时间、类型分解成可执行的任务。
通过任务明晰每个岗位的职责,保证岗位职责与公司目标对接。
(泛微目标执行力平台)2)战略计划“记录仪”
任务分配后,管理者需要实时掌握完成情况及进度,执行力平台通过周期性的总结报告来进行反馈,并在系统内生成任务执行完整记录。
3)战略计划“助推器”
为了使计划能高效落地,执行力平台中的周期性报告一般分为周、月、半年度、年度,并与个人绩效挂钩,上级可根据报告进行评估,确保任务能持续推进。
小结:建立了以目标为核心的执行力平台,实现从战略计划执行到流程固化应用转变,从单项业务管理向业务联动管理转变。
2、大数据应用中心:归集、分析、呈现
1)系统整合,数据自动归集
因数据分散造成的资源浪费与信息安全薄弱现状,极大制约了葛洲坝集团水泥公司进一步发展与扩张。
泛微借助OA系统的适配性与整合力,实现公司生产系统、销售系统、财务系统等异构系统数据流、业务流的有效集成整合。
利用工作流与生俱来的业务场景连续化功能,渗透各业务环节抓取数据,全面整合各业务板块经营管理数据。
实现数据联动、自动抓取归集,节省人工重复导入数据工作。
(数据整合)2)多维报表,数据深度分析
为了让数据中心收集到的数据能系统化、多样化的展现,方便管理层透过数据分析业务情况。
泛微通过数据中心与报表系统深度集成,完成报表模块与图形化分析模块设计,形成数据一体化整合及应用平台。
(图形化分析报表)数据应用平台提供图形化分析、质量报表、日报台账、月报台账等多种形式的数据展示。
最终形成管理驾驶舱分析图表,并根据权限规则向公司目标用户推送、展现。
为公司日常运营管理纠偏与经营战略决策提供及时、准确的数据支撑与分析工具。
(数据梳理分析)同时,梳理决策数据到管理流程、具体业务场景中,便于葛洲坝集团水泥公司开展基于能源管理等专项领域工业大数据应用研究。
3)权限管控,数据安全呈现
数据实现互联、共享后就会产生安全顾虑,葛洲坝企业子分公司、本分部、业务条线涉及的人员众多,数据权限管理必然是重头戏。
泛微在大数据应用平台中部署报表权限管理中心,根据地区、本分部、业务条线、岗位级别等进行安全设置。
让数据能有条件的进行针对性呈现,增强数据安全管控。
小结:大数据应用平台的搭建为管理层提供准确的经营战略决策与调整支撑,公司数据资源价值实现最大化,社会效益与经济效益实现双赢。
二、实现经济、社会效益双赢
泛微大数据协同管理平台在葛洲坝集团水泥公司企业决策支持、管理效率提升、能源管理专项应用方面均取得较好成效;
(大数据协同管理平台效益)基于能源实时监控数据及各维度统计分析报表,公司开展了针对工厂整体用能效率与管理水平提升的实践工作,并取得明显降本增效收益。
经济效益:年平均节约电耗约1832万元,年平均节约煤耗约1375万元,年平均降低碳排放经济效益约468万元。
社会效益:公司年平均碳排放指标同比下降2.57%,切实履行了中央企业的绿色环保社会责任,同时企业内部管理效率取得极大提升。
python-数据集成 互联网视频课程
数据挖掘需要的数据往往分布在不同的数据源中,数据集成就是将多个数据源合并存放在一个一致的数据存储(如数据仓库)中的过程。
需要考虑字段表达不一样,以及属性冗余。将源数据在最底层上加以转换,提炼,集成。
1:数据变换
目的:适用于挖掘的任务以及算法的需要
(1):简单函数变换:平方,开方,取对数,差分运算等
简单的函数变换用来将不具有正态分布的数据变换成具有正态分布的数据。在时间序列分析中,有时简单的对数变换或者差分运算就可以将非平稳序列转换成平稳序列。在数据挖掘中简单的函数变换很有必要。
(2):为了清除指标之间量纲和取值范围的差异影响,将数据按照比例进行缩放,使之落在指定的范围内。
最小---最大规范化
零---均值规范化
小数定标规范化
(3)连续属性离散化
有些分类算法(如ID3算法,Apriori算法等)要求数据是分类属性,故需要将联系性属性转换成分类属性,称连续属性离散化。
等宽法
等频法
基于聚类分析的方法
(4)属性构造
(5)小波变换
数据规约
属性规约:合并属性,逐步向前选择,逐步向后删除,决策树归纳,主成分分析
数值规约:统一数值
真实案例:企业数据集成面临的那些挑战 企业视频课程
什么是数据集成?最简单的应用场景就是:一个数据源,一个数据目的地,数据目的地可以是个数据仓库,把关系型数据库的数据同步到数据仓库里,就形成了一次数据集成。
我们先来看一个真实的数据集成案例。
G公司是DataPipeline的一个典型客户,拥有近千个数据源,类型主要包括Oracle、SQL Server、MySQL等。根据业务的需要和现有的基础设施情况,这些数据源分别需要同步到不同的目的端,类型主要包括MySQL、HDFS、Kafka等。基于以上背景,G公司的具体要求如下:
1. 需要支持约5TB日新增数据量的同步,今年将增长5-10倍。
2. 这些数据一部分数据源要求实时同步,另一部分可接受定时同步。
3. 缺乏强大的运维人才,现有数据源的业务承载压力有限,对压力非常的敏感,要求进行限流。
4. 从这些数据源到目的地的同步都是Kettle写脚本实现的,管理起来比较混乱,要求通过一个管理平台对任务进行集中化的配置和管理。
5. 上游的数据源和下游的数据目的都不稳定,随时可能出现各种问题,要求通过一个高可用的平台以减少数据传输中断的影响。
6. 当数据同步任务被随机的暂停/恢复时,要求可以保证数据的完整性。
7. 当数据源和目的地随机出现故障和过载时,要求可以保证数据的完整性。
8. 当数据源Schema发生变化时,要求可以根据业务需求灵活配置目的地策略。
G公司的案例只是当前企业数据集成需求的一个典型应用场景。事实上,无论是互联网企业还是传统企业,在面临数据集成的时候都会遇到以下4个挑战:
1. 数据源的异构性:传统ETL方案中,从数据源到目的地的同步都是脚本实现的,异构数据源就意味着企业要做大量的适配工作。
2. 数据源的动态性:在数据集成时,上游的数据源端经常会发生各种变化,有些数据源可能被删掉一些结构,这可能会影响到后续数据分析的结果。
3. 任务的可伸缩性:当数据集成只有几个数据源,系统压力的问题不太突出。当数据集成面临的是成百上千个数据源时,多任务并行就需要进行一些限速与缓冲的调度,让读写速度相互匹配。
4. 任务的容错性:当数据在传输过程中出现问题的时候,是否可以实现断点重传,且不产生重复的数据。
以上也是DataPipeline要为企业数据集成过程中解决的最关键的4个问题。
更多关于实时数据集成的问题,欢迎关注DataPipeline微信公众号,或直接访问官方网址申请试用:datapipeline
阿里巴巴下一代数据集成技术 行业视频课程
内容来源:2017年7月8日,阿里云数加平台研发负责人王贲在“阿里云—数据化运营实践分享【上海站】”进行《阿里巴巴下一代数据集成技术》演讲分享。
阅读字数:1689 | 4分钟阅读
摘要
数据集成是把不同来源、格式、特点性质的数据在逻辑上或物理上有机地集中,从而为企业提供全面的数据共享。在企业数据集成领域,已经有了很多成熟的框架可以利用。目前通常采用联邦式、基于中间件模型和数据仓库等方法来构造集成的系统,这些技术在不同的着重点和应用上解决数据共享和为企业提供决策支持。
大咖演讲视频
http://t/Rpij3u2
数据工厂
数据工厂解决了云上从数据的采集整合,到数据加工、分析与管理,再到数据应用和消费的整个流程。
上图中红色标注部分是数据集成的位置。数据集成既是把数据采到数据平台部分的数据通道,也是数据出去的通道。
中间就是所有数据的清洗转换、调度、OLAP分析以及数据挖掘的常用工具和模块。
最底层是元数据管理,是一个至关重要的模块。
传统数据处理有时候会叫做数仓,数仓是偏离线的。现在普遍叫数据平台,数据平台更强调它和在线系统的融合打通。
如上图所示,极简罗汉图构建的体系就是数据工厂。大家要自己搭建一个大数据开发平台的话,这些是基础模块,也是必要的组件。
最上面是调度,两侧有开发测试的环境,和整个大数据开发的运维管理。中间的“神经系统”是元数据,没有元数据所有东西都是无效的。再往下是整个大数据的计算引擎,阿里巴巴早就已经用完全自研的MaxCompute以及ADS等一系列的计算引擎替换了开源部分。最底下是数据集成,决定了数据怎么进来怎么出去。
数据集成
上图所示是数据集成的使用过程。从选择数据源、选择目标,到字段映射,然后进行通道流控的配置,最后就是看日志。
现在的数据集成已经超出了传统数据集成的范畴,也就是说传统数据集成的“屁股”是坐在数据仓库上的,面向的是业务数据库,对于多媒体文件或整个任意文件的支持还是比较少。现在非结构化数据的比重越来越大,尤其在阿里云上看到这种趋势非常明显。所以我们做了任意二进制文件的支持和视频文件的支持。
跨公网的数据传输是在云时代下一个非常重要的能力。当数据不在同城机房的时候,要想做一个简单的数据集成都需要跨公网把数据传输到统一的数据仓库中。
数据集成agent-datax
DataX是阿里巴巴集团内部被广泛使用的离线数据同步工具/平台,实现包括MySQL、Oracle、HDFS、Hive、OceanBase、HBase、OTS、ODPS等各种异构数据源之间高效的数据同步功能。
DataX是一个插件式架构,可以插拔,支持读写插件。我们会坚持开源,现在已经有了一定的影响力。它的性能很好,功能和稳定性远超sqoop。最近使用的客户案例有微博、金立、斗鱼直播,效果突出。
单机首先要把任务进行拆分,然后做到并发。也就是大家能看到的开源版本主要能力就在这里。
我们服务端的模式支持水平扩展。
阿里内部在大数据这一块数据采集和传输的主打工具就是DataX,所以它有更多的考虑。流控这方面操作还是有些难度的,很多开源工具不提供这种能力。
数据集成在处理的时候有脏数据管理并记录,而且还有基于规则的判断,自动把日志打出来,做基本的质量控制。
任意位置是指跨公网;任意存储是数据集成一开始就坚持的一种能力;还有正交数据采集传输。
图中画的是从用户机房到阿里云上的VPC。在阿里云上一旦引入VPC就会使网络环境变得很复杂,当然也带来很多好处。但是复杂性尤其是对数据集成这种工具的体验是会产生很大影响的。
我们为了突破这些也做了很多工作,现在我们可以从任意位置打透用户的机房以及阿里云上用户自己的VPC。
数加.数据集成线上情况
每天有11万+作业运行在DI平台之上,DI每天的同步数据量达到10.2TB。每天的同步记录条数达到近500亿,还在持续增长中。阿里自从做数据平台以来,数据集成一直是它的主力工具。
数加.数据集成能力总结
支持的类型多。支持任意主流格式和二进制数据、音视频、多媒体。
传输快。在传输方面我们做了断点续传、分块传输和网络协议加速等工作,现在也取得了一些效果。
网络通。能够穿透任意复杂的网络环境,例如从VPC到Region,还有跨公网。
一站式迁移。现在在接触很多大客户的时候,很多客户不想再继续自己维护hadoop了,希望我们能完整地一键把整个hadoop体系迁移到云上,以及把DB迁移到云上。在这种情况下我们可以做到一些一站式的服务。
还有两个更好的能力就是支持实时采集传输和支持客户端、Web端采集。
我希望能把数据集成做到极致,做得更大。
以上就是我今天的分享,谢谢大家!
真实案例:企业数据集成面临的那些挑战 企业视频课程
什么是数据集成?最简单的应用场景就是:一个数据源,一个数据目的地,数据目的地可以是个数据仓库,把关系型数据库的数据同步到数据仓库里,就形成了一次数据集成。
我们先来看一个真实的数据集成案例。
G公司是DataPipeline的一个典型客户,拥有近千个数据源,类型主要包括Oracle、SQL Server、MySQL等。根据业务的需要和现有的基础设施情况,这些数据源分别需要同步到不同的目的端,类型主要包括MySQL、HDFS、Kafka等。基于以上背景,G公司的具体要求如下:
1. 需要支持约5TB日新增数据量的同步,今年将增长5-10倍。
2. 这些数据一部分数据源要求实时同步,另一部分可接受定时同步。
3. 缺乏强大的运维人才,现有数据源的业务承载压力有限,对压力非常的敏感,要求进行限流。
4. 从这些数据源到目的地的同步都是Kettle写脚本实现的,管理起来比较混乱,要求通过一个管理平台对任务进行集中化的配置和管理。
5. 上游的数据源和下游的数据目的都不稳定,随时可能出现各种问题,要求通过一个高可用的平台以减少数据传输中断的影响。
6. 当数据同步任务被随机的暂停/恢复时,要求可以保证数据的完整性。
7. 当数据源和目的地随机出现故障和过载时,要求可以保证数据的完整性。
8. 当数据源Schema发生变化时,要求可以根据业务需求灵活配置目的地策略。
G公司的案例只是当前企业数据集成需求的一个典型应用场景。事实上,无论是互联网企业还是传统企业,在面临数据集成的时候都会遇到以下4个挑战:
1. 数据源的异构性:传统ETL方案中,从数据源到目的地的同步都是脚本实现的,异构数据源就意味着企业要做大量的适配工作。
2. 数据源的动态性:在数据集成时,上游的数据源端经常会发生各种变化,有些数据源可能被删掉一些结构,这可能会影响到后续数据分析的结果。
3. 任务的可伸缩性:当数据集成只有几个数据源,系统压力的问题不太突出。当数据集成面临的是成百上千个数据源时,多任务并行就需要进行一些限速与缓冲的调度,让读写速度相互匹配。
4. 任务的容错性:当数据在传输过程中出现问题的时候,是否可以实现断点重传,且不产生重复的数据。
以上也是DataPipeline要为企业数据集成过程中解决的最关键的4个问题。
更多关于实时数据集成的问题,欢迎关注DataPipeline微信公众号,或直接访问官方网址申请试用:datapipeline