- ?
人工智能在线特征系统中的数据存取技术
周依凝
展开
一、在线特征系统
主流互联网产品中,不论是经典的计算广告、搜索、推荐,还是垂直领域的路径规划、司机派单、物料智能设计,建立在人工智能技术之上的策略系统已经深入到了产品功能的方方面面。相应的,每一个策略系统都离不开大量的在线特征,来支撑模型算法或人工规则对请求的精准响应,因此特征系统成为了支持线上策略系统的重要支柱。美团点评技术博客之前推出了多篇关于特征系统的文章,如《机器学习中的数据清洗与特征处理综述》侧重于介绍特征生产过程中的离线数据清洗、挖掘方法,《业务赋能利器之外卖特征档案》侧重于用不同的存储引擎解决不同的特征数据查询需求。而《外卖排序系统特征生产框架》侧重介绍了特征计算、数据同步和线上查询的特征生产Pipeline。
本文以美团酒旅在线特征系统为原型,重点从线上数据存取角度介绍一些实践中的通用技术点,以解决在线特征系统在高并发情形下面临的问题。
1.1 在线特征系统框架——生产、调度、服务一体化
在线特征系统就是通过系统上下文,获得相关特征数据的在线服务。其功能可以是一个简单的Key-Value(KV)型存储,对线上提供特征查询服务,也可以辐射到通用特征生产、统一特征调度、实时特征监控等全套特征服务体系。可以说,几个人日就可以完成一个简单能用的特征系统,但在复杂的业务场景中,把这件事做得更方便、快速和稳定,却需要一个团队长期的积累。
以上结构图为一体化特征系统的概貌,自底向上为数据流动的方向,各部分的功能如下:
数据源:用于计算特征的原始数据。根据业务需求,数据来源可能是分布式文件系统(如Hive),关系型数据库(如MySQL),消息队列(如Kafka)等。
特征生产:该部分负责从各种数据源读取数据,提供计算框架用于生产特征。生产框架需要根据数据源的类型、不同的计算需求综合设计,因此会有多套生产框架。
特征导入:该部分负责将计算好的特征写入到线上存储供特征服务读取。该部分主要关注导入作业之间的依赖、并发写入的速度与一致性等问题。
特征服务:该部分为整个特征系统的核心功能部分,提供在线特征的存取服务,直接服务于上层策略系统。
特征的生命周期按照上述过程,可以抽象为五个步骤:读、算、写、存、取。整个流程于特征系统框架内成为一个整体,作为特征工程的一体化解决方案。本文主要围绕特征服务的核心功能“存”、“取”,介绍一些通用的实践经验。特征系统的延伸部分,如特征生产、系统框架等主题会在后续文章中做详细介绍。
1.2 特征系统的核心——存与取
简单来说,可以认为特征系统的核心功能是一个大号的HashMap,用于存储和快速提取每次请求中相关维度的特征集合。然而实际情况并不像HashMap那样简单,以我们的通用在线特征系统(Datahub)的系统指标为例,它的核心功能主要需面对存储与读取方面的挑战:
高并发:策略系统面向用户端,服务端峰值QPS超过1万,数据库峰值QPS超过100万(批量请求造成)。
高吞吐:每次请求可能包含上千维特征,网络IO高。服务端网络出口流量均值500Mbps,峰值为1.5Gbps。
大数据:虽然线上需要使用的特征数据不会像离线Hive库那样庞大,但数据条数也会超过10亿,字节量会达到TB级。
低延迟:面对用户的请求,为保持用户体验,接口的延迟要尽可能低,服务端TP99指标需要在10ms以下。
以上指标数字仅是以我们系统作为参考,实际各个部门、公司的特征系统规模可能差别很大,但无论一个特征系统的规模怎样,其系统核心目标必定是考虑:高并发、高吞吐、大数据、低延迟,只不过各有不同的优先级罢了。当系统的优化方向是多目标时,我们不可能独立的用任何一种方式,在有限资源的情况下做到面面俱到。留给我们的是业务最重要的需求特性,以及对应这些特性的解决方案。
二、在线特征存取技术
本节介绍一些在线特征系统上常用的存取技术点,以丰富我们的武器库。主要内容也并非详细的系统设计,而是一些常见问题的通用技术解决方案。但如上节所说,如何根据策略需求,利用合适的技术,制定对应的方案,才是各位架构师的核心价值所在。
2.1 数据分层
特征总数据量达到TB级后,单一的存储介质已经很难支撑完整的业务需求了。高性能的在线服务内存或缓存在数据量上成了杯水车薪,分布式KV存储能提供更大的存储空间但在某些场景又不够快。开源的分布式KV存储或缓存方案很多,比如我们用到的就有Redis/Memcache,HBase,Tair等,这些开源方案有大量的贡献者在为它们的功能、性能做出不断努力,本文就不更多着墨了。
对构建一个在线特征系统而言,实际上我们需要理解的是我们的特征数据是怎样的。有的数据非常热,我们通过内存副本或者是缓存能够以极小的内存代价覆盖大量的请求。有的数据不热,但是一旦访问要求稳定而快速的响应速度,这时基于全内存的分布式存储方案就是不错的选择。对于数据量级非常大,或者增长非常快的数据,我们需要选择有磁盘兜底的存储方案——其中又要根据各类不同的读写分布,来选择存储技术。
当业务发展到一定层次后,单一的特征类型将很难覆盖所有的业务需求。所以在存储方案选型上,需要根据特征类型进行数据分层。分层之后,不同的存储引擎统一对策略服务提供特征数据,这是保持系统性能和功能兼得的最佳实践。
2.2 数据压缩
海量的离线特征加载到线上系统并在系统间流转,对内存、网络带宽等资源都是不小的开销。数据压缩是典型的以时间换空间的例子,往往能够成倍减少空间占用,对于线上珍贵的内存、带宽资源来说是莫大的福音。数据压缩本质思想是减少信息冗余,针对特征系统这个应用场景,我们积累了一些实践经验与大家分享。
2.2.1 存储格式
特征数据简单来说即特征名与特征值。以用户画像为例,一个用户有年龄、性别、爱好等特征。存储这样的特征数据通常来说有下面几种方式:
JSON格式,完整保留特征名-特征值对,以JSON字符串的形式表示。
元数据抽取,如Hive一样,特征名(元数据)单独保存,特征数据以String格式的特征值列表表示。
元数据固化,同样将元数据单独保存,但是采用强类型定义每个特征,如Integer、Double等而非统一的String类型。
三种格式各有优劣:
JSON格式的优点在特征数量可以是变长的。以用户画像为例,A用户可能有年龄、性别标签。B用户可以有籍贯、爱好标签。不同用户标签种类可以差别很大,都能便捷的存储。但缺点是每组特征都要存储特征名,当特征种类同构性很高时,会包含大量冗余信息。
元数据抽取的特点与JSON格式相反,它只保留特征值本身,特征名作为元数据单独存放,这样减少了冗余特征名的存储,但缺点是数据格式必须是同构的,而且如果需要增删特征,需要更改元数据后刷新整个数据集。
元数据固化的优点与元数据抽取相同,而且更加节省空间。然而其存取过程需要实现专有序列化,实现难度和读写速度都有成本。
特征系统中,一批特征数据通常来说是完全同构的,同时为了应对高并发下的批量请求,我们在实践中采用了元数据抽取作为存储方案,相比JSON格式,有2~10倍的空间节约(具体比例取决于特征名的长度、特征个数以及特征值的类型)。
2.2.2 字节压缩
提到数据压缩,很容易就会想到利用无损字节压缩算法。无损压缩的主要思路是将频繁出现的模式(Pattern)用较短的字节码表示。考虑到在线特征系统的读写模式是一次全量写入,多次逐条读取,因此压缩需要针对单条数据,而非全局压缩。目前主流的Java实现的短文本压缩算法有Gzip、Snappy、Deflate、LZ4等,我们做了两组实验,主要从单条平均压缩速度、单条平均解压速度、压缩率三个指标来对比以上各个算法。
数据集:我们选取了2份线上真实的特征数据集,分别取10万条特征记录。记录为纯文本格式,平均长度为300~400字符(600~800字节)。
压缩算法:Deflate算法有1~9个压缩级别,级别越高,压缩比越大,操作所需要的时间也越长。而LZ4算法有两个压缩级别,我们用0,1表示。除此之外,LZ4有不同的实现版本:JNI、Java Unsafe、Java Safe,详细区别参考 https://github/lz4/lz4-java ,这里不做过多解释。
实验结果图中的毫秒时间为单条记录的压缩或解压缩时间。压缩比的计算方式为压缩前字节码长度/压缩后字节码长度。可以看出,所有压缩算法的压缩/解压时间都会随着压缩比的上升而整体呈上升趋势。其中LZ4的Java Unsafe、Java Safe版由于考虑平台兼容性问题,出现了明显的速度异常。
从使用场景(一次全量写入,多次逐条读取)出发,特征系统主要的服务指标是特征高并发下的响应时间与特征数据存储效率。因此特征压缩关注的指标其实是:快速的解压速度与较高的压缩比,而对压缩速度其实要求不高。因此综合上述实验中各个算法的表现,Snappy是较为合适我们的需求。
2.2.3 字典压缩
压缩的本质是利用共性,在不影响信息量的情况下进行重新编码,以缩减空间占用。上节中的字节压缩是单行压缩,因此只能运用到同一条记录中的共性,而无法顾及全局共性。举个例子:假设某个用户维度特征所有用户的特征值是完全一样的,字节压缩逐条压缩不能节省任何的存储空间,而我们却知道实际上只有一个重复的值在反复出现。即便是单条记录内部,由于压缩算法窗口大小的限制,长Pattern也很难被顾及到。因此,对全局的特征值做一次字典统计,自动或人工的将频繁Pattern加入到字典并重新编码,能够解决短文本字节压缩的局限性。
2.3 数据同步
当每次请求,策略计算需要大量的特征数据时(比如一次请求上千条的广告商特征),我们需要非常强悍的在线数据获取能力。而在存储特征的不同方法中,访问本地内存毫无疑问是性能最佳的解决方式。想要在本地内存中访问到特征数据,通常我们有两种有效手段:内存副本和客户端缓存。
2.3.1 内存副本技术
当数据总量不大时,策略使用方可以在本地完全镜像一份特征数据,这份镜像叫内存副本。使用内存副本和使用本地的数据完全一致,使用者无需关心远端数据源的存在。内存副本需要和数据源通过某些协议进行同步更新,这类同步技术称为内存副本技术。在线特征系统的场景中,数据源可以抽象为一个KV类型的数据集,内存副本技术需要把这样一个数据集完整的同步到内存副本中。
推拉结合——时效性和一致性
一般来说,数据同步为两种类型:推(Push)和拉(Pull)。Push的技术比较简单,依赖目前常见的消息队列中间件,可以根据需求做到将一个数据变化传送到一个内存副本中。但是,即使实现了不重不漏的高可靠性消息队列通知(通常代价很大),也还面临着初始化启动时批量数据同步的问题——所以,Push只能作为一种提高内存副本时效性的手段,本质上内存副本同步还得依赖Pull协议。Pull类的同步协议有一个非常好的特性就是幂等,一次失败或成功的同步不会影响下一次进行新的同步。
Pull协议有非常多的选择,最简单的每次将所有数据全量拉走就是一种基础协议。但是在业务需求中需要追求数据同步效率,所以用一些比较高效的Pull协议就很重要。为了缩减拉取数据量,这些协议本质上来说都是希望高效的计算出尽量精确的数据差异(Diff),然后同步这些必要的数据变动。这里介绍两种我们曾经在工程实践中应用过的Pull型数据同步协议。
基于版本号同步——回放日志(RedoLog)和退化算法
在数据源更新时,对于每一次数据变化,基于版本号的同步算法会为这次变化分配一个唯一的递增版本号,并使用一个更新队列记录所有版本号对应的数据变化。
内存副本发起同步请求时,会携带该副本上一次完成同步时的最大版本号,这意味着所有该版本号之后的数据变化都需要被拉取过来。数据源方收到请求后,从更新队列中找到大于该版本号的所有数据变化,并将数据变化汇总,得到最终需要更新的Diff,返回给发起方。此时内存副本只需要更新这些Diff数据即可。
对于大多数的业务场景,特征数据的生成会收口到一个统一的更新服务中,所以递增版本号可以串行的生成。如果在分布式的数据更新环境中,则需要利用分布式id生成器来获取递增版本号。
另一个问题则是更新队列的长度。如果不进行任何优化,更新队列理论上是无限长的,甚至会超过数据集的大小。一个优化方法是我们限制住更新队列的最大长度,一旦长度超过限制,则执行合并(Merge)操作。Merge操作将队列中的数据进行两两合并,合并后的版本号以较大的版本号为准,合并后的更新数据集是两个数据集的并。Merge后,新的队列长度下降为原更新队列的一半。
Merge之后的更新队列,我们依然可以使用相同的算法进行同步Diff计算:在队列中找到大于上一次更新版本号的所有数据集。可以看到由于版本号的...
- ?
欧维姆在线数据采集系统为中国桥梁安全实时保驾护航
霍人达
展开
近期,由柳州欧维姆机械股份有限公司(以下简称欧维姆公司)承建的世界跨径最大钢桁梁斜拉桥——鸭池河特大桥索力监测系统升级顺利完成。至此,该桥索力监测系统由离线模式数据采集系统正式升级为在线模式数据采集系统,使鸭池河特大桥的健康、安全得到实时保障。
欧维姆在线数据采集系统为中国桥梁安全实时保驾护航
鸭池河特大桥作为贵黔高速全线控制性工程,跨越鸭池河,大桥全长1461米,是主跨为800米的双塔双索面钢桁架斜拉桥,主塔采用H型索塔,桥面至水面高差达380米,东塔高243.2米,西塔高258.2米,是目前建成的世界跨径最大钢桁梁斜拉桥,同时创世界山区斜拉桥之最。大桥采用了OVM250钢绞线拉索体系产品及施工服务,于2016年5月20日顺利合龙。
斜拉桥是一个内部高次超静定的结构体系,许多因素的变化,例如,钢绞线的应力松弛、主梁及索塔混凝土的收缩徐变、气候的变化等,都会对整个桥梁结构产生影响,其外在反映最突出的表现就是,斜拉索索力重新分配并导致主梁线形发生变化,索力变化也会使主梁及索塔产生二次内力。尤其在成桥之后的数年时间内,其变化更为显著,斜拉桥索力的变化是判断桥梁是否处于正常运营状态的一个重要指标,而索力测量是分析拉索是否处于正常运营状态的一个重要依据,通过监测斜拉索的受力状况,判断和分析斜拉索的健康状态,已经成为斜拉桥安全监测的重要内容。
2015年11月,欧维姆工程公司人员入场开展索力监测系统首期搭建工作,2016年6月顺利竣工。鸭池河特大桥首期采用的是基于磁通量传感器技术的索力监测系统,于每束斜拉索塔端锚具内安装磁通量传感器测量单根钢绞线受力;于每8束斜拉索中部位置布设1台数据采集装置,安装于塔内塔壁上。这个索力监测系统为离线模式数据采集系统,需人工定期上桥进行数据采集。
为了更好的了解鸭池河特大桥斜拉索在运营期内的受力情况,业主提出了实时采集数据的新要求,于是欧维姆公司于近期,在鸭池河大桥原索力监测系统的基础上,增设了7台磁弹仪和4套数据采集主站,由原系统升级为在线模式数据采集系统,可以实现实时采集数据,实时反馈大桥斜拉索的受力情况,为鸭池河特大桥的运营状况分析提供可靠、有效的依据。
该桥结构索力监测系统采用目前国内最先进的磁通量传感器,均由欧维姆公司自主研发及生产。
作为中国预应力行业领军,欧维姆公司五十多年来一直坚持科技创新,在提升了企业自主创新能力和核心竞争力的同时,通过科技创新产品推动中国预应力行业的发展,为中国桥梁结构健康与安全一直做着不懈的努力。OVM桥梁健康监测系统解决方案曾为毕都北盘江大桥、安徽铜陵长江公铁大桥、杭州湾大桥、厦门集美大桥等中国乃至世界大型桥梁的寿命周期提供技术支撑,推动中国未来大型桥梁产业化发展。(本文来自欧维姆)
- ?
扬尘在线监测系统的数据采集和传输系统
经以珊
展开
扬尘在线监测系统感知层,污染源在线监测仪,包括颗粒物浓度监测仪、气象五参数监测仪、噪声监测仪和视频监控摄像机,对颗粒物浓度、气象参数、噪声和现场视频进行连续自动在线监测;OSEN-YZ颗粒物监测仪就可以实现扬尘的实时监测,数据无线上报。传输层:采用有线、无线、3G/4G等方式传输各种监测数据。平台层:数据服务云平台,依托在建工地扬尘与噪声监测平台的数据,进行系统分析、提供跨区域、全时间、多层次的数据挖掘和对比,为科学治理雾霾提供数据支撑,应用层:面向不同环保局、建筑工地的客户端系统,实现基于Web的污染源实时数据在线监测、现场图像和视频的监控、污染源超标报警、以及面向不同管理层的各种管理与统计分析。
扬尘在线监测系统由颗粒物在线监测仪、数据采集和传输系统、视频监控系统、后台数据处理系统及信息监控管理平台共四部分组成。系统集成了物联网、大数据和云计算技术,通过光散射在线监测仪、云台摄像头、气象五参数采集设备和采集传输等设备,实现了实时、远程、自动监控颗粒物浓度;数据通过采用3G/4G网络传输,可以在智能移动平台、桌面PC机等多终端访问;监控平台还具有多种统计和高浓度报警功能,可广泛应用在散货堆场和码头、混凝土搅拌站以及工厂企业无组织排放的实时监控。
扬尘在线监测系统的功能与系统特点,人机交换界面,采样频率自主设定,高低上限报警,8路常开继电器,标准RS485 RS232数据提取 RJ45以太网接口,标准MODBUS RTU通讯协议。符合国家标准:GB3096-2008《声环境质量标准》和GB3095-2012《环境空气质量标准》采用在线式粉尘监测仪,性能稳定,数据准确。具有数据观察窗功能,以方便用户就地查看测量数据。具有扬尘预警、超标提醒、图像抓拍功能。全天候全自动24小时365天持续不间断工作,故障提示报警功能。气象参数扩展:可选配温湿度、风速风向、气压、降雨量、一体化摄像头等。工作环境:温度-20~80℃,相对温度不高于90%.
- ?
全球100款大数据工具汇总
罗丝
展开
1、 Talend Open Studio
是第一家针对的数据集成工具市场的ETL(数据的提取Extract、传输Transform、载入Load)开源软件供应商。Talend的下载量已超过200万人次,其开源软件提供了数据整合功能。其用户包括美国国际集团(AIG)、康卡斯特、电子港湾、通用电气、三星、Ticketmaster和韦里逊等企业组织。
2、DYSON
探码科技自主研发的DYSON智能分析系统,可以完整的实现大数据的采集、分析、处理。DYSON智能分析系统专业针对互联网数据抓取、处理、分析,挖掘。可以灵活迅速地抓取网页上散乱分布的信息,并通过强大的处理功能,准确挖掘出所需数据,是目前使用人数最多的网页采集工具.
3、YARN
一种新的Hadoop资源管理器,它是一个通用资源管理系统,可为上层应用提供统一的资源管理和调度,解决了旧MapReduce框架的性能瓶颈。它的基本思想是把资源管理和作业调度/监控的功能分割到单独的守护进程。
4、Mesos
由加州大学伯克利分校的AMPLab首先开发的一款开源群集管理软件,支持Hadoop、ElasticSearch、Spark、Storm 和Kafka等架构。对数据中心而言它就像一个单一的资源池,从物理或虚拟机器中抽离了CPU,内存,存储以及其它计算资源, 很容易建立和有效运行具备容错性和弹性的分布式系统。
5、Datale
由探码科技研发的一款基于Hadoop的大数据平台开发套件,RAI大数据应用平台架构。
6、 Ambari
作为Hadoop生态系统的一部分,提供了基于Web的直观界面,可用于配置、管理和监控Hadoop集群。目前已支持大多数Hadoop组件,包括HDFS、MapReduce、Hive、Pig、 Hbase、Zookeper、Sqoop和Hcatalog等。
7、ZooKeeper
一个分布式的应用程序协调服务,是Hadoop和Hbase的重要组件。它是一个为分布式应用提供一致性服务的工具,让Hadoop集群里面的节点可以彼此协调。ZooKeeper现在已经成为了 Apache的顶级项目,为分布式系统提供了高效可靠且易于使用的协同服务。
8、Thrift
在2007年facebook提交Apache基金会将Thrift作为一个开源项目,对于当时的facebook来说创造thrift是为了解决facebook系统中各系统间大数据量的传输通信以及系统之间语言环境不同需要跨平台的特性。
9、Chukwa
监测大型分布式系统的一个开源数据采集系统。建立在HDFS/MapReduce框架之上并继承了Hadoop的可伸缩性和可靠性,可以收集来自大型分布式系统的数据,用于监控。它还包括灵活而强大的显示工具用于监控、分析结果。
10、Lustre
一个大规模的、安全可靠的、具备高可用性的集群文件系统,它是由SUN公司开发和维护的。该项目主要的目的就是开发下一代的集群文件系统,目前可以支持超过10000个节点,数以PB的数据存储量。
11、HDFS
Hadoop Distributed File System,简称HDFS,是一个分布式文件系统。HDFS是一个高度容错性的系统,适合部署在廉价的机器上。HDFS能提供高吞吐量的数据访问,非常适合大规模数据集上的应用。
12、GlusterFS
一个集群的文件系统,支持PB级的数据量。GlusterFS 通过RDMA和TCP/IP方式将分布到不同服务器上的存储空间汇集成一个大的网络化并行文件系统。
13、Alluxio
前身是Tachyon,是以内存为中心的分布式文件系统,拥有高性能和容错能力,能够为集群框架(如Spark、MapReduce)提供可靠的内存级速度的文件共享服务。
14、Ceph
新一代开源分布式文件系统,主要目标是设计成基于POSIX的没有单点故障的分布式文件系统,提高数据的容错性并实现无缝的复制。
15、PVFS
一个高性能、开源的并行文件系统,主要用于并行计算环境中的应用。PVFS特别为超大数量的客户端和服务器端所设计,它的模块化设计结构可轻松的添加新的硬件和算法支持。
16、QFS
Quantcast File System (QFS) 是一个高性能、容错好、分布式的文件系统,用于开发支持 MapReduce处理或者需要顺序读写大文件的应用。
17、 Logstash
一个应用程序日志、事件的传输、处理、管理和搜索的平台。可以用它来统一对应用程序日志进行收集管理,提供了Web接口用于查询和统计。
18、Scribe
Scribe是Facebook开源的日志收集系统,它能够从各种日志源上收集日志,存储到一个中央存储系统(可以是NFS,分布式文件系统等)上,以便于进行集中统计分析处理。
19、Flume
Cloudera提供的一个高可用的、高可靠的、分布式的海量日志采集、聚合和传输的系统。Flume支持在日志系统中定制各类数据发送方,用于收集数据。同时,Flume支持对数据进行简单处理,并写入各种数据接受方(可定制)。
20、RabbitMQ
一个受欢迎的消息代理系统,通常用于应用程序之间或者程序的不同组件之间通过消息来进行集成。RabbitMQ提供可靠的应用消息发送、易于使用、支持所有主流操作系统、支持大量开发者平台。
21、ActiveMQ
Apache出品,号称“最流行的,最强大”的开源消息集成模式服务器。ActiveMQ特点是速度快,支持多种跨语言的客户端和协议,其企业集成模式和许多先进的功能易于使用,是一个完全支持JMS1.1和J2EE 1.4规范的JMS Provider实现。
22、Kafka
一种高吞吐量的分布式发布订阅消息系统,它可以处理消费者规模网站中的所有动作流数据,目前已成为大数据系统在异步和分布式消息之间的最佳选择。
23、Spark
一个高速、通用大数据计算处理引擎。拥有Hadoop MapReduce所具有的优点,但不同的是Job的中间输出结果可以保存在内存中,从而不再需要读写HDFS,因此Spark能更好地适用于数据挖掘与机器学习等需要迭代的MapReduce的算法。它可以与Hadoop和Apache Mesos一起使用,也可以独立使用。
24、Kinesis
可以构建用于处理或分析流数据的自定义应用程序,来满足特定需求。Amazon Kinesis Streams 每小时可从数十万种来源中连续捕获和存储数TB数据,如网站点击流、财务交易、社交媒体源、IT日志和定位追踪事件。
25、 Hadoop
一个开源框架,适合运行在通用硬件,支持用简单程序模型分布式处理跨集群大数据集,支持从单一服务器到上千服务器的水平scale up。Apache的Hadoop项目已几乎与大数据划上了等号,它不断壮大起来,已成为一个完整的生态系统,拥有众多开源工具面向高度扩展的分布式计算。高效、可靠、可伸缩,能够为你的数据存储项目提供所需的YARN、HDFS和基础架构,并且运行主要的大数据服务和应用程序。
26、Spark Streaming
实现微批处理,目标是很方便的建立可扩展、容错的流应用,支持Java、Scala和Python,和Spark无缝集成。Spark Streaming可以读取数据HDFS,Flume,Kafka,Twitter和ZeroMQ,也可以读取自定义数据。
27、Trident
是对Storm的更高一层的抽象,除了提供一套简单易用的流数据处理API之外,它以batch(一组tuples)为单位进行处理,这样一来,可以使得一些处理更简单和高效。
28、Flink
于今年跻身Apache顶级开源项目,与HDFS完全兼容。Flink提供了基于Java和Scala的API,是一个高效、分布式的通用大数据分析引擎。更主要的是,Flink支持增量迭代计算,使得系统可以快速地处理数据密集型、迭代的任务。
29、Samza
出自于LinkedIn,构建在Kafka之上的分布式流计算框架,是Apache顶级开源项目。可直接利用Kafka和Hadoop YARN提供容错、进程隔离以及安全、资源管理。
30、Storm
Storm是Twitter开源的一个类似于Hadoop的实时数据处理框架。编程模型简单,显著地降低了实时处理的难度,也是当下最人气的流计算框架之一。与其他计算框架相比,Storm最大的优点是毫秒级低延时。
31、Yahoo S4 (Simple Scalable Streaming System)
是一个分布式流计算平台,具备通用、分布式、可扩展的、容错、可插拔等特点。程序员可以很容易地开发处理连续无边界数据流(continuous unbounded streams of data)的应用。它的目标是填补复杂专有系统和面向批处理开源产品之间的空白,并提供高性能计算平台来解决并发处理系统的复杂度。
32、HaLoop
是一个Hadoop MapReduce框架的修改版本,其目标是为了高效支持 迭代,递归数据 分析任务,如PageRank,HITs,K-means,sssp等。
33、Presto
是一个开源的分布式SQL查询引擎,适用于交互式分析查询,可对250PB以上的数据进行快速地交互式分析。Presto的设计和编写是为了解决像Facebook这样规模的商业数据仓库的交互式分析和处理速度的问题。Facebook称Presto的性能比诸如Hive和MapReduce要好上10倍有多。
34、 Drill
于2012年8月份由Apache推出,让用户可以使用基于SQL的查询,查询Hadoop、NoSQL数据库和云存储服务。它能够运行在上千个节点的服务器集群上,且能在几秒内处理PB级或者万亿条的数据记录。它可用于数据挖掘和即席查询,支持一系列广泛的数据库,包括HBase、MongoDB、MapR-DB、HDFS、MapR-FS、亚马逊S3、Azure Blob Storage、谷歌云存储和Swift。
35、Phoenix
是一个Java中间层,可以让开发者在Apache HBase上执行SQL查询。Phoenix完全使用Java编写,并且提供了一个客户端可嵌入的JDBC驱动。Phoenix查询引擎会将SQL查询转换为一个或多个HBase scan,并编排执行以生成标准的JDBC结果集。
36、Pig
是一种编程语言,它简化了Hadoop常见的工作任务。Pig可加载数据、转换数据以及存储最终结果。Pig最大的作用就是为MapReduce框架实现了一套shell脚本 ,类似我们通常熟悉的SQL语句。
37、Hive
是基于Hadoop的一个数据仓库工具,可以将结构化的数据文件映射为一张数据库表,并提供简单的sql查询功能,可以将sql语句转换为MapReduce任务进行运行。 其优点是学习成本低,可以通过类SQL语句快速实现简单的MapReduce统计,不必开发专门的MapReduce应用,十分适合数据仓库的统计分析。
38、SparkSQL
前身是Shark,SparkSQL抛弃原有Shark的代码并汲取了一些优点,如内存列存储(In-Memory Columnar Storage)、Hive兼容性等。由于摆脱了对Hive的依赖性,SparkSQL无论在数据兼容、性能优化、组件扩展方面都得到了极大的方便。
39、Stinger
原来叫Tez,是下一代Hive,由Hortonworks主导开发,运行在YARN上的DAG计算框架。某些测试下,Stinger能提升10倍左右的性能,同时会让Hive支持更多的SQL。
40、Tajo
目的是在HDFS之上构建一个可靠的、支持关系型数据的分布式数据仓库系统,它的重点是提供低延迟、可扩展的ad-hoc查询和在线数据聚集,以及为更传统的ETL提供工具。
41、Impala
Cloudera 声称,基于SQL的Impala数据库是“面向Apache Hadoop的领先的开源分析数据库”。它可以作为一款独立产品来下载,又是Cloudera的商业大数据产品的一部分。Cloudera Impala 可以直接为存储在HDFS或HBase中的Hadoop数据提供快速、交互式的SQL查询。
42、 Elasticsearch
是一个基于Lucene的搜索服务器。它提供了一个分布式、支持多用户的全文搜索引擎,基于RESTful web接口。Elasticsearch是用Java开发的,并作为Apache许可条款下的开放源码发布,是当前流行的企业级搜索引擎。设计用于云计算中,能够达到实时搜索、稳定、可靠、快速、安装使用方便。
43、Solr
基于Apache Lucene,是一种高度可靠、高度扩展的企业搜索平台。知名用户包括eHarmony、西尔斯、StubHub、Zappos、百思买、AT&T、Instagram、Netflix、彭博社和Travelocity。
44、Shark
即Hive on Spark,本质上是通过Hive的HQL解析,把HQL翻译成Spark上的RDD操作,然后通过Hive的metadata获取数据库里的表信息,实际HDFS上的数据和文件,会由Shark获取并放到Spark上运算。Shark的特点就是快,完全兼容Hive,且可以在shell模式下使用rdd2sql()这样的API,把HQL得到的结果集,继续在scala环境下运算,支持自己编写简单的机器学习或简单分析处理函数,对HQL结果进一步分析计算。
45、Lucene
基于Java的Lucene可以非常迅速地执行全文搜索。据官方网站声称,它在现代硬件上每小时能够检索超过150GB的数据,它拥有强大而高效的搜索算法。
46、Terracotta
声称其BigMemory技术是“世界上首屈一指的内存中数据管理平台”,支持简单、可扩展、实时消息,声称在190个国家拥有210万开发人员,全球1000家企业部署了其软件。
47、 Ignite
是一种高性能、整合式、分布式的内存中平台,可用于对大规模数据集执行实时计算和处理,速度比传统的基于磁盘的技术或闪存技术高出好几个数量级。该平台包括数据网格、计算网格、服务网格、流媒体、Hadoop加速、高级集群、文件系统、消息传递、事件和数据结构等功能。
48、GemFire
Pivotal宣布它将开放其大数据套件关键组件的源代码,其中包括GemFire内存中NoSQL数据库。它已向Apache软件基金会递交了一项提案,以便在“Geode”的名下管理GemFire数据库的核心引擎。
49、 GridGain
由Apache Ignite驱动的GridGrain提供内存中数据结构,用于迅速处理大数据,还提供基于同一技术的Hadoop加速器。
50、MongoDB
是一个基于分布式文件存储的数据库。由C++...
- ?
全新在线式可视化数据记录仪
仇冰旋
展开
GMC-I集团旗下公司Camille Bauer最新一代可视化数据记录仪LINAX DR2000、LINAX DR3000非常适合过程控制数据的可视化监测和记录,可以将读入的数据存储或者进行分组,支持拓展控制功能、限值监测和数学函数运算,广泛的应用于数据记录、高标准监控显示单元、小型过程控制系统、限制监测报警系统。
LINAX DR3000 数据记录仪
多种显示界面
产品特点
01、强大的高性能可视化记录仪
02、简单直观操作,带有内置帮助
03、达到12数学函数信道用于复杂计算
04、应用于复杂环境,符合IP65/NEMA4设备保护协议(前面板)
05、数据安全符合FDA21CFR Part11标准
06、保证数据完整性(闪存)
07、低操作费用(TCO)
技术数据
01、信道数: 4,8,12,16,20通用输入或达到40用于现场总线
02、显示: 17.8 cm (7 inch) TFT
03、操作: 导航器,触摸屏,键盘,鼠标
04、存储: 内存+SD卡+USB记忆棒
05、通信: Modbus RTU/TCP从设备,Modbus RTU/TCP主设备,现场总线DP从设备,
PROFINET IO-设备,以太网/IP
06、变送器供电电源: 最大250mA
07、可选: 批量和电子告警功能
08、外形尺寸:190 x 144 x 158 mm
- ?
拥抱智能制造,实现生产数据实时采集
腐蚀
展开
在《中国制造2025》战略实施后,“制造业数字化、网络化、智能化”被定义为新工业革命的核心技术。
离开生产数据采集,生产管理部门不能及时、准确地得到工件生产数量;无法准确、科学地制定生产计划;无法实现生产管理协同等。
可见,只有有效的实现生产数据的采集和分析,才能从根本上解决车间管理中计划跟踪迟滞、设备利用率低、产品质量难以提升等问题。
自动地、及时地、准确地数据采集,是现代化工业车间的基础。而我们,能为数字化工厂打造一个更加可视、实时、精细、可追溯的制造环境。
东芝,是日本最大的半导体制造商,也是第二大综合电机制造商。公司创立于1875年,业务领域包括数码产品、电子元器件、社会基础设备、家电等。东芝信息机器(杭州)有限公司是日本东芝株式会社的全资子公司,也是东芝笔记本电脑全球唯一的生产基地。
面临的挑战
东芝电脑产品及机板配件生产部门每天都需要及时产出大量的生产数据统计报表,同时质检部门也需要定时定期巡检设备生产相关的异常信息,方便对生产数据进行快速高效和精细化的管理。
但是东芝之前通过excel记录生产数据已无法满足现有业务量的需求:
1、数据采集难:依然采用人工采集、手工输入等方式采集生产线信息;
2、手工数据质量差:excel记录不仅准确性不足,还存在一定的错误率;
3、报送周期长,统计延时:手工输入只能定时进行,无法实时更新系统中的生产数据,滞后情况严重,不利于生产线的顺利进行,制约了产能的进一步提高。
4、事后监管机制:不能及时发现生产过程问题,生产效率提升缓慢;
5、数据分析不足:不能进行可视化的展现,无法给领导提供决策支撑。
为什么选择亿信华辰
1、经受考验的成熟度
支撑30多个国家级部委完成监管、普查、抽查、统计等应用场景的数据采集与分析,助力100余家银行完成统一报表平台和统一数据平台的建设,业务稳定运行。
2、技术先进性
12年的技术沉淀,围绕数据全生命周期自主研发了多款重量级核心智能产品,产品线涵盖了数据采集、数据处理、数据存储、数据分析、数据挖掘等多个领域。
3、高品质强口碑
亿信华辰不仅提供成熟的平台化产品,而且不断地给客户成功交付数据中心、决策支持等应用系统,并以几乎100%的项目成功率,取得了远超同业公司的客户满意度。
平台建设
东芝制造车间生产过程中的数据包括车间人员、物料、加工设备、工票、工装、加工过程等,涉及车间各个部分。面向东芝内部的生产部门,为一线生产人员及质检部门提供数据填报及数据分析平台,是一个完全基于互联网技术构建的智能数据系统。
1、生产数据自动采集并上报
生产部门需要定时每天填写电脑产品及机板配件等的生产信息日报等,利用亿信华辰i@Report产品可以自动将数据库中的设备相关信息初始化到固定格式的报表中,然后根据相关业务逻辑公式,自动统计工数、时长、产出等,生产业务人员确认后直接上报,即可完成数据的采集填报工作,生产组长可以快速汇总其下属各个人员的生产数据,并将数据逐层上报。
2、异常数据提前预警
品质部门需要监管生产流水线的产品生产情况,并形成品质报告定期输出,利用i@Report移动填报功能,品质部门会去现场定时定期巡检,并将异常原因、设备编号等信息在平板电脑上立即进行填报,并拍照上传相关图片留档;同时,对于异常原因利用亿信BI进行历史数据的相关分析,形成问题检索表,方便对比分析。
方案价值
总体而言,利用i@Report+亿信BI两个产品,将以往需要大量的人工通过excel方式报送报表,改为只需要在移动端/PC端在线填报数据的工作模式,极大的减少了业务人员的工作量,提高了数据的共享效率;并将手工数据按照统一的标准存储到数据库,增强了数据的完整统一,也更加有利于对历史数据的对比关联分析。
同时,因为有效的流程监控,在生产过程中,可及时发现异动数据,提前预警,进一步提升了生产质量,降低了事故率,亿信华辰帮助客户收获更高的运营效率和生产质量。
目前,通过智能数据平台的搭建,亿信华辰帮助东芝提升生产能力的同时,也保证了数据的安全性和可靠性,着实为互联网时代的制造业注入了新的活力。
- ?
集客魔盒丨客户数据无感采集神器
郦慕青
展开
通捷集客魔盒基于微波脉冲技术,为您提供更好的采集数据应用服务,为您打通了数据化营销的闭环。收集范围内人群电话信息,提供自助化的新媒体广告投放平台(平台上已整合95%以上主流APP广告资源)、以及搭建大数据云平台服务, 助力企业打通线上线下数据便于更系统数据化管理和营销。
1.无感采集客户数据
线下3-100米场景内客户数据无感采集后回传到瑞通捷后台。系统转化电话号,在线拨打电话,号码不会被泄露,不会侵犯用户隐私。
2.全面分析客户数据
个人画像/兴趣标签/线上线下行为轨迹/客群数据等多维度数据。
3.线下数据线上营销
利用线上大数据画像和用户线下行为精准识别目标客户,打通线上线下数据。
4.近场营销三大工具
可锁定采集的数据,通过短信、外呼通话,与目标客户直接联动。
5.定向投新媒体广告
集客魔盒已整合95%+新媒体广告资源。可锁定采集数据,投放朋友圈/腾讯新闻等主流APP广告。
广告形式多样化,可运用于多种平台!
当你走近我,我就能了解你
通捷集客魔盒---你的营销利器,
是你打败对手脱颖而出的秘诀。
联合5000+媒体资源,支持电话短信,
通捷集客魔盒,就在这里等着你!
- ?
国内五大主流网站内容抓取工具、采集软件大盘点
甄笑翠
展开
大数据技术用了多年时间进行演化,才从一种看起来很炫酷的新技术变成了企业在生产经营中实际部署的服务。其中,数据采集产品迎来了广阔的市场前景,无论国内外,市面上都出现了许多技术不一、良莠不齐的采集软件。
今天,我们将对比国内五大主流采集软件优缺点,帮助你选择最适合的爬虫,体验数据hunting带来的快感。
国内篇
1.火车头
作为采集界的老前辈,我们火车头是一款互联网数据抓取、处理、分析,挖掘软件,可以抓取网页上散乱分布的数据信息,并通过一系列的分析处理,准确挖掘出所需数据。它的用户定位主要是拥有一定代码基础的人群,适合编程老手。
采集功能完善,不限网页与内容,任意文件格式都可下载具有智能多识别系统以及可选的验证方式保护安全支持PHP和C#插件扩展,方便修改处理数据具有同义,近义词替换、参数替换,伪原创必备技能Conclusion:火车头适用于编程能手,规则编写容易,软件的定位比较专业而且精准化。
2.八爪鱼
一款可视化免编程的网页采集软件,可以从不同网站中快速提取规范化数据,帮助用户实现数据的自动化采集、编辑以及规范化,降低工作成本。云采集是它的一大特色,相比其他采集软件,云采集能够做到更加精准、高效和大规模。
自定义采集过程中,八爪鱼采集器系统自写的Xpath、自动生成的流程,可能无法满足数据采集需求。对数据质量要求高,则需自写Xpath,调成流程图等,以优化规则。
使用自定义采集的同学,虽然八爪鱼操作简单,比较容易上手。但是,仍需对八爪鱼采集原理有所了解,看完相关教程,循序渐进,成长周期较长。
可视化操作,无需编写代码,制作规则采集,适用于零编程基础的用户云采集是其主要功能,支持关机采集,并实现自动定时采集
Conclusion:八爪鱼是一款适合小白用户尝试的采集软件,云功能强大,当然爬虫老手也能开拓它的高级功能。
3.集搜客
一款简单易用的网页信息抓取软件,能够抓取网页文字、图表、超链接等多种网页元素。同样可通过简单可视化流程进行采集,服务于任何对数据有采集需求的人群。
可视化流程操作,与八爪鱼不同,集搜客的流程重在定义所抓取的数据和爬虫路线,八爪鱼的规则流程十分明确,由用户决定软件的每一步操作
支持抓取在指数图表上悬浮显示的数据,还可以抓取手机网站上的数据
会员可以互助抓取,提升采集效率,同时还有模板资源可以套用
Conclusion:集搜客操作较简单,适用于初级用户,功能方面没有太大的特色,后续付费要求比较多。
4.神箭手云爬虫
一款新颖的云端在线智能爬虫/采集器,基于神箭手分布式云爬虫框架,帮助用户快速获取大量规范化的网页数据。
直接接入代理IP,避免IP封锁
自动登录验证码识别,网站自动完成验证码输入
可在线生成图标,采集结果以丰富表格化形式展现本地化隐私保护,云端采集,可隐藏用户IP
Conclusion: 神箭手类似一个爬虫系统框架,具体采集还需用户自写爬虫,需要代码基础。
5.狂人采集器
一套专业的网站内容采集软件,支持各类论坛的帖子和回复采集,网站和博客文章内容抓取,分论坛采集器、CMS采集器和博客采集器三类。
支持对文章内容中的文字、链接批量替换和过滤可以同时向网站或论坛的多个版块一起批量发文具备采集或发帖任务完成后自动关机功能
Conclusion: 专注论坛、博客文本内容的抓取,对于全网数据的采集通用性不高。
注:给火车采集器的新手们一点学习建议
火车采集器是一个非常专业的数据抓取和数据处理软件,对软件使用者有较高的技术要求, 使用者要有基本的HTML基础,能看得懂网页源码,网页结构。
同时如果用到web发布或数据库发布,则对自己文章系统及数据存储结构要非常了解。
- ?
数据挖掘,不止在线上
老醋
展开
(Photograph: Paul Gordon/Zuma Press / eyevine)
原文:https://theguardian/world/2017/aug/23/silicon-valley-big-data-extraction-amazon-whole-foods-facebook
作者:Ben Tarnoff
翻译:肥寒
天气一热冷饮会不会立马涨价?
英国消费者很快就会得到答案,据报道,英国三大连锁超市会在部门门店推出动态价格。这意味着,一天之内冷饮的价格会随着供需而变化。在午餐高峰期吃饭的价格会想高峰期间的Uber那样波动。
这听着可能有些极端,但比这更剧烈的变化即将到来,本文发表的一周期,亚马逊宣布以137亿美元全资收购whole Foods。亚马逊一直致力于替代实体经济,但是现在他在三个国家有超过460家的线下门店。
这单亚马逊有史以来的最大收购案让一些股市观察家很吃惊。 但亚马逊的眼光通常领先竞争对手十年 。亚马逊的成功也正源于超前的意识。 94年,他们发现了电商,2006年他们又比别人先一步发现了云计算的潜力。收购Whole Foods又表示亚马逊类似的经验将发现一个新的高价值领域。
亚马逊并非要放弃电商转向线下零食,他们计划将线上和线下打通,这将使我们的日常生活数据化,让零售商品价格大幅波动显得更为自然,并将硅谷基于数据监测的商业模式扩大到实体领域,通过监测我们的每一步来赚钱。
硅谷是一个开采产业,他开采的对象不是石油也不是铜矿,而是数据。企业通过尽可能滴观察消费者在线上的行为来采集数据。企业可能通过社交媒体、搜素引擎,甚至是你的鼠标在屏幕特定区域停留时间。单独来看,个体的行为痕迹并没有什么意义,不过如果和成千上万人行为一起比较,企业就可以发现隐藏的模式,确定你是哪种人,你可能购买哪些东西。
硅谷通过这些方式向人们推销商品或推送广告,这样的模式有巨大的商机。但是这种模式需要源源不断的数据去提高算法的准确度,而线上的数据是有限的,并非取之不尽。
一百年前,你在德州随便挖个洞就能开采石油。今天,石油公司不得不去远海开采石油。高科技企业也面临类似的情况,遍地是商机的日子一去不复返。最容易获得的大部分线上数据已经被企业收入囊中。FB和谷歌就占到了美国在线广告收入的76%。
要想获得更多的利润,硅谷必须扩大数据源。一种方法是让人们在互联网上花更多的时间:发布新的APP,使他们尽可能滴让用户上瘾。另一个办法是让更多人上网,FB最近推出了Free Basics计划,准备在欠发达地区提供免费上网机会,希望从世界各地的穷人身上收集数据。
但这两个方面会遗漏大量数据。毕竟,我们的上网时间是有限的。我们的笔记本、平板、手机和可穿戴设备已经占据了我们大量时间,但却不是全部。对于硅谷的企业来说,无法完全知道用户的数据意味着收入的损失。任何一个没有被监测的时刻都可能是错失的机会。
亚马逊正在向科技界证明如何去监考更多的时刻:把企业监测深深滴嵌入实体行业中,就像在线上做的一样。硅谷已经通过监视我们在线上的行为获取了巨额利益,很快硅谷会通过对线下行为的监控获得更多的收入。
如何运作这个并不难,相关技术已经存在。去年底,亚马逊在西雅图开设了一家智能杂货店。你不必在收银台排队买单,只需要拿着商品走出店门。店门上安置的传感器会探测到你买了什么,在你走的时候从你预留的账户上进行扣费。
亚马逊一直向消费者强调这样的好处:不用再排长队,也不用掏出钱包。同时这项技术也会跟踪消费者的每个轨迹。
你想象一下,你家附近的超市像FB或谷歌那样密切关注你会是怎样的情景。它不仅会知道你买了什么,还会知道你在哪件商品前停留了多久,还会知道你逛超市的路线。 这些数据因为揭示了消费者的个性和喜欢而异常宝贵。亚马逊依靠这些数据可以在线上和线下向你出售更多商品。
超市不是实现这些想法的唯一场所。监测能把任何实体场所变成数据矿场。数据最丰富的场所就是你的家,那里包含了关于你的最多信息。
这就是亚马逊积极推广智能音箱echo的原因,Echo提供了类似Siri的语音助手Alexa。Alexa可以播报天气预报、读新闻、制定你的日程计划和其他任务。它是个非常好的倾听者,它不仅记录你和他的互动情况,也记录你所有的事情,并将这些数据回传给亚马逊进行分析。
把Echo放在你的房子里是亚马逊加深对用户了解的好办法。另外,亚马逊也试图在空中收集你家的数据。7月底,亚马逊获得了一项无人机专利,他们计划用无人机来送货。比如,无人机在送货时发现你的屋顶坏了,亚马逊可以向你推荐维修服务。亚马逊还在测试送货无人机,一旦投入使用,他们将会不断滴收集你家周围的数据。
亚马逊这些计划可能会遇到一些阻力,人们并不情愿超市监视他们,也不喜欢家里成为向算法提供数据的地方。但资本会推动行为规范的迅速调整,我们绝不能低估这一点。
二十年前,公司读取你的邮件,观察你的社交互动,追踪你的地理位置,这会被社会大众认为侵犯隐私。但现在,人们已经对这些事情习以为常,甚至无动于衷。需要注意的是,在今后二十年内,随着硅谷更深入我们的生活以挖掘数据,进一步的妥协将成为常态。
技术派会认为消费者可以自主选择是否接受,如果你反对那么可以不用Echo,不用FB这些产品和服务。但是要知道在垄断资本主义下,消费者自主选择看上去是个伪命题。谷歌,亚马逊,FB掌控了数字世界,我们无处逃避。
对此,普通消费者无能为力,唯一的解决方法是政治。作为公民,我们可以要求更民主的形式管理我们的数据。 数据是公共财富,我们将数据集中起来使得数据更有意义,只有通过采集和分析数据,才可找到数据的有效使用模式。
没有谁会让矿产行业单方面决定如何开采、提炼资源,在哪里开厂。但是我们却在科技公司面前妥协,几乎没人去监督硅谷这些企业。 地球属于我们所有人,挖掘数据的公司理应像矿产行业一样被公众监督以保障公众的利益。
在线采集数据
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并