- ?
在数据采集器中用TensorFlow进行实时机器学习
大牙
展开
最新DataOps平台的真正价值,只有在业务用户和应用程序能够从各种数据源来访问原始数据和聚合数据,并且及时地产生数据驱动的认识时,才能够实现。利用机器学习(Machine Learning),分析师和数据科学家可以利用历史数据,以及实时地使用类似TensorFlow(TF)这样的技术,以做出更好的数据驱动业务的线下决策。
在本文中,你将学习如何利用TensorFlow模型在StreamSets Data Collector3.5.0和StreamSets Data Collector Edge中最新发布的TensorFlow Evaluator*进行预测和分类。
在深入讨论细节之前,我们来看一些基本概念。
机器学习(Machine Learning)
亚瑟·塞缪尔把它描述为:“不需要明确地编写程序而使计算机有能力学习的研究领域。”随着机器学习领域的最新发展,计算机现在有能力做出预测,甚至比人类做的还要好,并且感觉可以解决任何问题。让我们先回顾一下机器学习都解决了什么样的问题吧。
通常来说,机器学习被分为两大类:
监督学习(Supervised Learning)
“监督学习是学习一个函数的机器学习任务,该函数基于输入-输出的实例,将输入映射到输出。”—维基百科(Wikipedia)。
它涉及到构建一个精准的模型,当历史数据被标记为一些结果的时候,模型就可以预测出结果了。
用监督学习解决的常见业务问题:
二元分类(学习预测一个分类值)- 顾客会购买一个特定产品吗?- 癌症是恶性的还是良性的?多级分类(学习预测一个分类值)- 给定的一段文本是否带有病毒、恐吓或淫秽内容?- 这是山鸢尾、蓝旗鸢尾还是北美鸢尾的物种?回归(学习预测一个连续值)- 一个代售房子的预测价格是多少?- 明天旧金山的气温是多少?
无监督学习
无监督学习允许我们在知道很少,或是完全不知道输出应该是什么样子的情况下处理问题。它涉及在之前数据上的标签是不可用的情况下创建模型。在这类的问题中,通过对基于数据中变量之间的关系进行数据聚类来导出结构。
无监督学习的两种常见方法是K-均值聚类(K-means clustering)和DBSCAN。
注意:Data Collector和Data Collector Edge中的TensorFlow Evaluator目前仅支持监督学习模型。
神经网络与深度学习
神经网络是机器学习算法的一种,可以学习和使用受人脑结构启发而来的计算模型。与其它机器学习算法,如决策树、逻辑回归等相比,神经网络具有较高的准确性。
Andrew Ng在传统人工神经网络的背景下对深度学习进行了描述。在题为“深度学习、自我学习与无监督特征学习”的演讲中,他把深度学习的思想描述为:
“利用了大脑结构的模仿, 希望:- 让学习算法更好地、更容易地使用;- 在机器学习和人工智能领域取得革命性的进展;我相信这是我们朝着真正的人工智能前进的最好办法。”
常见的神经网络和深度学习应用包括:
计算机视觉/图像识别/目标检测语言识别/自然语言处理(NLP)推荐系统(产品、婚介等)异常检测(网络安全等)
TensorFlow
TensorFlow是为深度神经网络设计的开源机器学习框架,由Google Brain Team开发的。TensorFlow支持在Windows和Mac操作系统上的可伸缩和便携式的训练,包括CPU、GPU和TPU。迄今为止,它是GitHub上最流行的和最活跃的机器学习项目。
Data Collector中的TensorFlow
随着TensorFlow Evaluator的引入,你现在能够创建管道(pipelines),以获取数据或特征,并在一个可控的环境中生成预测结果或分类,而不必发起对作为Web服务而提供和公布的机器学习模型的HTTP或REST API的调用。例如,Data Collector管道现在可以实时地检测欺诈交易或在文本上执行自然语言处理,因为数据在被存储到最终目的地之前,为了进一步的处理或做决策,正在经过各个阶段。
另外,使用Data Collector Edge,你可以在Raspberry Pi和其它运行在所支持的平台上的设备上运行已经启用了的TensorFlow机器学习管道。例如,在高风险地区检测洪水等自然灾害发生的概率,以防止对人们财产的破坏。
乳腺癌分类
让我们考虑将乳腺癌肿瘤分类成恶性还是良性的例子。乳腺癌是一个经典的数据集,可以作为scikit-learn的一部分。要了解如何在Python中使用该数据集训练和导出一个简单的TensorFlow模型,请查看我在GitHub上的代码。正如你将要看到的那样,模型创建和训练被保持在最小范围,并且非常简单,只有几个隐藏层。最需要注意的重要方面是如何使用TensorFlow SavedModelBuilder*来导出和保存模型。
*注意:要在Data Collector或Data Collector Edge中使用TensorFlow模型,首先应该在你选择支持的开发语言里,如Python,和交互式环境中,如Jupiter Notebook,使用TensorFlow的SavedModelBuilder导出和保存模型。
一旦使用TensorFlow的SavedModelBuilder训练并导出了模型,那么在数据流管道中使用它进行预测或分类就非常简单了 — 只要模型保存在Data Collector或Data Collector Edge可访问的位置上即可。
管道概述
在深入了解细节之前,可以看下管道是什么样的:
管道细节
目录源:- 这将从.csv文件中加载乳腺癌的记录数据(注意:这个输入数据源可以非常简单地替换为其它的来源,包括Kafka、AWS S3、MySQL等等);字段转换器:- 这个处理器将转换供模型所使用的所有输入的乳腺癌记录特征数据,从String类型转换到Float类型(mean_radius,mean_texture,mean_perimeter,mean_area,mean_smoothness,mean_compactness,mean_concavity,mean_concave_points,mean_symmetry,mean_fractal_dimension,radius_error,texture_error,perimeter_error,area_error,smoothness_error,compactness_error,concavity_error,concave_points_error,symmetry_error,fractal_dimension_error,worst_radius,worst_texture,worst_perimeter,worst_area,worst_smoothness,worst_compactness,worst_concavity,worst_concave_points,worst_symmetry,worst_fractal_dimension) ;TensorFlow Evaluator*:- 模型的保存路径:指定要使用的预训练的TensorFlow模型的位置;- 模型标签:设置为“serve”,因为元图(在我们导出的模型中)要用于服务中。有关详细信息,请参见tag_constants.py和相关的TensorFlow API documentation;- 输入配置:指定在训练和导出模型期间配置的输入张量信息(请见Train model and save/export it using TensorFlow SavedModelBuilder部分);- 输出配置:指定在训练和导出模型期间配置的输出张量信息(请见Train model and save/export it using TensorFlow SavedModelBuilder部分);- 输出字段:我们想保存分类值的输出记录字段;Expression Evaluator:-该处理器评估模型输出或分类值为0或1(存储在输出的字段TF_Model_Classification之中) ,并用Benign或Malignantrespectively这两个值创建一个新的记录字段“Condition”;Stream Selector:- 该处理器评估癌症状况(良性或恶性)并发送记录到各自的Kafka生产者;Kafka Producers:- 输入记录以及模型的输出或者分类值被有条件地发送给两个Kafka生产者以获得进一步地处理和分析;*TensorFlow Evaluator配置
注意:一旦TensorFlow Evaluator产生了模型输出结果,本实例中采用的管道阶段是可选的,并且可以根据用例的需要与其它处理器和目标进行互换。
管道执行
在预览管道上,乳腺癌数据记录的输入通过了上面所述的数据流管道过程,包括服务于我们的TensorFlow模型。发送给Kafka生产者的最终输出记录数据(如上所示)包括用于分类的模型所使用的乳腺癌特征,在用户定义的字段TF_Model_Classification中模型输出值为0或1,以及由Expression Evaluator创建的Condition字段中表示相应的癌症状况是良性或恶性。
总结
本文说明了在Data Collector 3.5.0中使用最新发布的TensorFlow Evaluator。一般来说,这个评估器将允许你提供预训练的TensorFlow模型,用于生成预测结果和分类结果,而无需编写任何自己的代码
- ?
线下大数据智能采集投放平台
溪乐
展开
智能硬件结合大数据优势,全方位挖掘用户线下、线上行为,精准定义目标客群特征、消费偏好、地域分布,为零售客户提供选址招商、运营管理、客群洞察、推广营销、实现 营销的“点对点”高效精准的传播,是新一代人工智能思维下的营销新武器。
店内优化
客流实时监测
顾客质量和转化率
顾客运动轨迹热点动图
店内商品试用、转化率
新客招募
厘米级精准定位新客,信息采集分析
对接各个广告平台,精准投放
广告效果评估
提高活动效果
展示真实人流,轨迹动图,客观评估活动效果
场景式营销,广告实时送达
用户画像
了解品牌受众,帮助品牌定位
进店顾客人群画像采集
人员、物品管理
优化员工管理系统,监测到岗及工作时间
贵重物品定位,防盗防损
优化库存管理
探针
集探针,iBeacon,商品触碰探测为一体
wifi与gprs两种上报信息方式
搭载gps模块,采集地理位置信息
出色的定位技术
手机号与mac地址绑定方案
平台化运作,提供丰富的上层接口给集成商
解决方案
购买地址:https://detail.1688/offer/551150997804.html?spm=b26110380.sw1688.mof001.1.b4WnET
或阿里巴巴搜索:58数云、潜客宝
- ?
你们好奇地图软件是如何采集路况实景以及实时信息的吗?
千柳
展开
想必大家平常也很好奇百度地图以及高德地图等地图软件是如何采集实景以及实时路况等实时信息的,今天小编就为大家解密,其实地图软件精准的实时交通大数据之中有78%来自于ugc众包的数据,有22%来自出租车以及物流车等行业浮动的车辆,地图软件的实时交通动态事件的数据,其中有85%来自用户上报,其余15%来自于交管所和政府职能部门、
另外,地图软件还受益于阿里巴巴集团的大数据,例如菜鸟的运单数据以及物流车数据,和口碑网的外卖订单等数据,通过数据技术融合,地图软件方面可以发掘poi的新增与变化,从而强化地图基础数据、
例如高德方面表示,为了让专业采集员和采集设备采集的数据更多实时传递更快,达成地图数据更新速度接近零时差的目标,高德地图的自主专业采集能力在三个方向上实现了加强,在线化、自动化以及智能化,与此同时高德地图整个数据采集生产链条由过去的人工主导,计划式采集生产转变为由大数据以及自动化主导的智能化采集调度与生产处理新模式、
- ?
MES中的RFID数据采集
方涵菡
展开
RFID随着企业信息化的不断深入,制造执行系统(MES)是连接计划层和现场控制层之间的纽带,是实施企业敏捷制造战略和实现车间生产敏捷化的基本技术手段。MES是根据生产计划的要求,对生产过程进行必要的实时数据采集和记录的管理系统,它可以有效地进行质量跟踪和追溯,保证产品严格按质量要求被加工制造。
在传统的生产过程中,生产数据是通过手工在生产管理文件上记录每一批次产品在每一个工序的生产过程的数据,等到该批产品加工完毕后,再把生产数据通过手工录入到计算机中。这样的操作方法烦冗,而且数据记录滞后,无法实现实时监控和统计,数据的可靠性差,效率也非常低。而制造执行系统的数据采集功能则提供了一种高效、可靠的实时数据采集技术——RFID技术。它不仅保证了数据的可靠性、准确性,同时也提供了高效获取生产数据的技术方法。
MES中的数据采集功能,是负责采集生产现场中的各种必要的实时更新的数据信息,并为其他MES功能的数据管理提供数源。RFID技术作为一种数据采集与管理的手段,正从供应链进入制造过程的核心,MES可以充分利用RFID的特性,在复杂车间现场安装RFID数据采集终端。它可以自动跟踪物料、在制品等的实时分布状况,进行产品和在制品的身份认证和标识,建立产品个体级别上的实时档案。通过在车间层逐步采用RFID技术,可以无缝且不间断地集成从RFID捕获的信息并链接到现有的控制系统基础结构,与配置RFID功能的供应链协调,充分发挥出MES贴近底层调度生产的优势,发送准确、可靠的实时信息流,提高生产效率和大幅度地节省投资。
MES携手RFID打造智慧车间RFID和MES的结合,就是将RFID技术贯穿于生产的全过程中,对进料、加工、包装、运输和仓储等进行全方位和全程的可视化跟踪:
1、质量管理方面
RFID可以提供不断更新的实时数据,用来保证正确使用劳动力、机器、工具和部件,从而实现无纸化生产和减少停机时间,以保证可靠性和高质量。
2、产品追踪方面
只要零件进入生产线或到达完工区,将自动记录工序、设备和操作者等信息,实现从原材料到终极产品的全面跟踪,避免因手工录入导致的数据误差。
3、计划调度方面
如机床等加工设备上的RFID提供运转时间、可用性状态、性能特征,并含有技术参数、已进行的生产活动等,这样就可以结合产品工艺规程单按现有设备利用率进行车间内实时计划排程。
4、设备管理方面
操作者可以通过读取标签上的信息来检查设备及其所在位置,对设备进行包养或维修,然后写进最新的数据更新RFID标签,有助于进步设备价值,优化设备性能和最大化设备利用率。
RFID技术不仅实现了MES中的信息交流,改善了业务流程,还使得生产过程和存储运输过程中对在制品的跟踪以及成品的质量追溯更为清晰有据。有助于企业降低产品缺陷率,缩短产品制造周期,降低生产成本,提高生产效率,提升企业在市场上的综合竞争力。
编辑:Nistone乐石科技
- ?
让您了解大数据采集最新技术
清新
展开
现在谈论大数据已经没有新意了,形形色色的产品、平台和公司都贴满大数据标签,但大数据却并没有掀起预期飓风,甚至还被冠以“伪命题”污名。
大数据开启了一个大规模生产、分享和应用数据的时代,它给技术和商业带来了巨大的变化。大数据在核心领域的渗透速度有目共睹,然而调查显示,未被使用的信息比例高达99.4%,很大程度都是由于高价值的信息无法获取采集。
因此在大数据时代背景下,如何从大数据中采集出有用的信息已经是大数据发展的关键因素之一,数据采集才是大数据产业的基石。那么什么是大数据采集技术呢?
什么是数据采集?
数据采集(DAQ), 又称数据获取,是指从传感器和其它待测设备等模拟和数字被测单元中自动采集信息的过程。数据分类新一代数据体系中,将传统数据体系中没有考虑过的新数据源进行归纳与分类,可将其分为线上行为数据与内容数据两大类。
线上行为数据:页面数据、交互数据、表单数据、会话数据等。
内容数据:应用日志、电子文档、机器数据、语音数据、社交媒体数据等。
大数据的主要来源:1)商业数据 2)互联网数据 3)传感器数据
传统数据采集的不足
传统的数据采集来源单一,且存储、管理和分析数据量也相对较小,大多采用关系型数据库和并行数据仓库即可处理。对依靠并行计算提升数据处理速度方面而言,传统的并行数据库技术追求高度一致性和容错性,根据CAP理论,难以保证其可用性和扩展性。
大数据采集新的方法
以博为软件101异构数据采集技术为例:通过获取软件系统的底层数据交换、软件客户端和数据库之间的网络流量包,基于底层IO请求与网络分析等技术,采集目标软件产生的所有数据,将数据转换与重新结构化,输出到新的数据库,供软件系统调用。
博为软件技术特点如下:
1. 无需原软件厂商配合;
2. 实时数据采集,数据端到端的响应速度达秒级;
3. 兼容性强,可采集汇聚Windows平台各种软件系统数据;
4. 输出结构化数据,作为数据挖掘、大数据分析应用的基础;
5. 自动建立数据间关联,实施周期短、简单高效;
6. 支持自动导入历史数据,通过I/O人工智能自动将数据写入目标软件;
7. 配置简单、实施周期短。
优点:其优势在于不需要“接口”配合,这就摆脱了对软件厂商的依赖。特别是在在需要集成多个系统数据时,不仅能节省大量时间、人力与资金,实现“一站式”完成;还避免了因个别系统开发团队解体、源代码丢失等原因导致系统数据集成出现烂尾的情况。
缺点:只采集Windows平台的各软件系统数据
版权声明:本文部分来自网络,如有侵权,请联系删除!
- ?
生产管理电子看板系统软件数据实时采集及管理技术
Kenneth
展开
生产管理电子看板系统软件性能分析将实际制造过程测定的结果与过去的历史记录和企业制定的目标以及客户的要求进行比较,其输出的报告或在线显示用以辅助性能的改进和提高;主要是数据输入失败,或校验失败等异常发生时的提示报警信息,以及各种产量数据信息。生产管理电子看板系统软件市场要求产品的品种和数量经常变化,靠人工和经验调整生产显然效率低、反应慢、缺乏竞争力。在此过程中,有效的提高了企业信息流通性,并且为企业管理人员提供了更快速的综合性数据信息。生产管理电子看板系统软件将现场实时采集的数据,以及监督控制的状态等信息,生产管理电子看板系统软件立即存入数据库;不但涉及最新的生产状态,也包括长期储存的历史数据,再利用数据库强大的查询、分析、报表功能,优化现场管理。生产管理电子看板系统软件依托生产实际信息,通过计划、目标以及结果对比,从现场设备管理、生产管理和业务决策三方面优化生产管理过程,实现精准决策。对不同项目进行及时和实时地观测有助于了解局势并加以利用,生产的领导者可以据此更快也更恰当地做出反应,生产任务管理包括生产任务接收与管理、任务进度展示和任务查询等功能。
生产管理电子看板系统软件自动判断产品工序的正确性,结合车间现场或警示灯进行提示;生产制造过程的工序检验与产品质量管理,能够实现对工序检验与产品质量过程追溯,对不合格品以及整改过程进行严格控制。对现行进行全面的调查分析,提出为实现总体规划确定的功能所做的各种总体技术考虑和设计。这些都是生产管理中最基础数据。具体化从测试作业因数的许多异样的功能收集的信息,这样的结果应该以报告的形式准备或可以在线提供对执行的实时评价的信息及时收集、上传和处理。作为企业生产执行层面的信息化核心,生产管理电子看板系统软件凭借其强大功能,为越来越多的用户寻找到了改善生产效益的神奇之路。传统生产管理电子看板系统软件软件的作用就是实现企业的连续信息流。
企业也将不再是某一项生产管理电子看板系统软件功能,而是面向企业的整体解决方案,生产管理电子看板系统软件正在向整体解决方案发展。质量统计过程控制是一个开环,通过对所取得的数据分析来监测生产过程的状态。它的数量、构成、周转速度等要素直接影响到企业生产的活动能力,企业需要的是合理地占有资金、灵活地支配资金和经济地利用资金,以确保企业生产活动的顺利进行,借以提髙企业与社会的整体效益。制造过程生产特定等级或质量的产品。究竟生产管理电子看板系统软件报价较为贵重,公司自身的建设也是迅速改变的。车间信息反馈即时监控各车间生产信息可通过控制器对当前紧急状态进行即时报告,并汇总在监控中心的看板上,使用新的开发技术、新设备等,或是新的应用组合,提供各种用户所需要的报表,实现工厂管理智能化。生产管理电子看板系统软件基于设备、工具、人员等车间有限资源,按照交货期、最优库存等算法,将工序分解到每一设备、每一分钟上精确执行,通过复杂而智能的算法来优化车间的生产作业排序和调度。
生产管理电子看板系统软件的生产计划管理的生产计划管理共同构成了企业整个生产过程的生产计划管理。数据的收集、存储和管理都在数据库中,能够帮助企业更好的管理车间,提高管理效率。生产管理电子看板系统软件该项功能可以大量减少工作现场因人为疏忽造成产品再加工或损坏,因而降低了直接人工、物料及成本,并具有产品预警的效果。此外用户还提出了较高的稳定性,实时性,可靠性要求,客户端的响应能力,处理能力,通讯能力等都必须符合生产节奏,避免造成生产停线。
- ?
数据实时采集+车间透明管控开启智造之路
Fidelia
展开
企业简介
青岛丰光精密机械股份有限公司是一家以精密机械加工、压铸制造为核心技术并致力于为高端装备制造、高速列车/轨道交通、汽车、工业智能化等行业提供核心零部件的中外合资企业。2011年取得了高新技术企业称号,2014年1月24日公司在全国股份转让系统成功挂牌。
作为一家精密零部件制造企业,企业充分意识到信息化对于企业管理的提升和促进作用。通过U8+产品和专业信息化实施服务团队,让企业打破了原有的流程壁垒,改变了原有的工作方式;管理范围和管理内容都有了非常大的改善,条码技术的应用、车间管理透明化让企业开始走向智能制造之路。
总体业务流程
销售接单后,计划部门编排滚动计划,LRP运算出生产计划、采购计划、委外计划。
“自制”属性的物料,按照制造部门和产品组合分开下达,便于后续执行、区分和统计。
“采购”属性的物料,下达请购,通知采购进行采购的后续流程;“委外”属性的物料,下达委外请购,此处的委外指产品委外,计划下达后,即可通知采购执行委外流程。
根据生产订单号,制作工序流转卡,经过每道工序进行条码扫描开工、报工、完工。
成品完成后,扫描条码入库,实现单台管理,实时盘库。
软件自动进行生产成本归集,自动进行成本核算。
提前安排发货计划,扫描发货,验证发货准确。
关键应用场景
基础数据管理
基础业务数据是企业信息化的根基,根据丰光精密机械业务特点,将所有存货(原材料、半成品、产成品、工具、模具、低值易耗等)进行多级分类;并针对存货属性(内销、自制、采购、委外、生产耗用等)、计划属性(固定提前期、供应倍数、最低供应量、销售跟单、安全库存、批号)等进行分析。
丰光精密机械属于精加工型企业,工艺路线设置的规范性与准确性,直接影响到车间现场信息化应用效果,为此针对企业的工艺特点,对产品+工序+设备的组合(宽放系数、机加工时间、人工安装时间、权重、单机人数)维护对应的参数。
库存管理条码应用
企业互联从条码应用开始,条码技术在丰光精密机械业务中的应用,开启了企业智能制造的第一步,条码标签与识读设备的软硬件结合,让数据采集在企业中更加便捷、高效,同步提升了其供应链上的准确性和效率。
通过条码技术的应用,从材料入库和产品生产下线时开始进行赋码、打码、贴码,整个供应链上端到下端的业务通过扫码方式进行连接,并保持物流与数据流的同步。箱码的使用,让产成品一次扫码,批量出库。集准确与便捷于一体,集软件与硬件于一体,集信息流与物流为一体,是条码技术带给丰光精密机械最显著的价值。
车间现场管理与车间条码应用
丰光精密机械的产品属于多工序连续加工。对于车间现场的组织管理,除了要做到生产订单级的管控外,还需要对工序、机台设备以及班组人员做到细化管理。但是由于车间现场数据的产生需要到完工之后集中录入,场地约束与时间的滞后性导致企业数据收集的不方便与不及时。
车间条码技术的应用为企业数据实时采集提供便利,根据生产订单生成的工序流转卡,采用PDA移动报工方式,各班组作业者使用终端设备上岗开工后开始加工作业,每个工序加工完成后,扫描工序流转卡中的工序二维码,扫描人员条码、机器设备条码并输入对应的合格数量,完成数据实时采集。
应用价值
提供多层次的计划及平衡系统,细化生产计划,构成完整灵活的LRP解决方案:需求规划实现对采购计划进行编制,并提供计划调整建议,可以针对销售订单编制物料的需求计划。
优化生产管理,提供集成的混合模式制造解决方案,实现有效的生产过程控制:通过生产订单管理实现生产领退料严格管理及生产订单的审核、下达、关闭和生产统计;通过车间管理实现工艺路线管理、车间执行汇报、车间统计和车间工时记录。
与财务、供应链全面集成,实现精细化的成本管理:解决跨部门生产产品的成本费用归集;帮助企业实现按单进行成品成本核算,实现更加精细的成本管理。
全面的企业运营监控管理:从销售、采购、生产、库存、财务、成本等各个环节,深入全面监控企业运营状况,帮助管理者集中精力迅速找出潜在问题并予以解决,同时又能在复杂的经济形势下识别并充分利用新的商机。
全面内控管理:企业的运营过程涉及到多种不同的流程,通过ERP在众多的内部控制点进行了控制,深入到每个业务链条的各个环节。通过规范业务流程和严格操作控制,有效预防风险事件的发生;保证信息采集渠道的畅通和监控的实时性、及时性,辅助各级管理者、决策者全面透视企业内部、掌握企业全局。
- ?
携程用户数据采集与分析系统
巴兰基利亚
展开
一、携程实时用户数据采集系统设计实践
随着移动互联网的兴起,特别是近年来,智能手机、pad等移动设备凭借便捷、高效的特点风靡全球,同时各类APP的快速发展进一步降低了移动互联网的接入门槛,越来越多的网民开始从传统PC转移至移动终端上。但传统的基于PC网站和访问日志的用户数据采集系统已经无法满足实时分析用户行为、实时统计流量属性和基于位置服务(LBS)等方面的需求。
我们针对传统用户数据采集系统在实时性、吞吐量、终端覆盖率等方面的不足,分析了在移动互联网流量剧增的背景下,用户数据采集系统的需求,研究在多种访问终端和多种网络类型的场景下,用户数据实时、高效采集的方法,并在此基础上设计和实现实时、有序和健壮的用户数据采集系统。此系统基于Java NIO网络通信框架(Netty)和分布式消息队列(Kafka)存储框架实现,其具有实时性、高吞吐、通用性好等优点。
1、技术选型和设计方案:
一个典型的数据采集分析统计平台,对数据的处理,主要由如下五个步骤组成:
图1、数据平台处理流程
其中,数据采集步骤是最核心的问题,数据采集是否丰富、准确和实时,都直接影响整个数据分析平台的应用的效果。本论文关注的步骤主要在数据采集、数据传输和数据建模存储这三部分。
为满足数据采集服务实时、高效性、高吞吐量和安全性等方面的要求,同时能借鉴互联网大数据行业一些优秀开源的解决方案,所以整个系统都将基于Java技术栈进行设计和实现。整个数据采集分析平台系统架构如下图所示:
图2(数据采集分析平台系统架构)
其中整个平台系统主要包括以上五部分:客户端数据采集SDK以Http(s)/Tcp/Udp协议根据不同的网络环境按一定策略将数据发送到Mechanic(UBT-Collector)服务器。服务器对采集的数据进行一系列处理之后将数据异步写入Hermes(Kafka)分布式消息队列系统。为了关联业务服务端用户业务操作埋点、日志,业务服务器需要获取由客户端SDK统一生成的用户标识(C-GUID),然后业务服务器将用户业务操作埋点、日志信息以异步方式写入Hermes(Kafka)队列。最后数据消费分析平台,都从Hermes(Kafka)中消费采集数据,进行数据实时或者离线分析。其中Mechanic(UBT-Collector)系统还包括对采集数据和自身系统的监控,这些监控信息先写入Hbase集群,然后通过Dashboard界面进行实时监控。
(1)基于NIO的Netty网络框架方案
要满足前面提到的高吞吐、高并发和多协议支持等方面的要求。我们调研了几种开源异步IO网络服务组件(如Netty、MINI、xSocket),用它们和NginxWeb服务器进行了性能对比,决定采用Netty作为采集服务网络组件。下面对它进行一些概要介绍:Netty是一个高性能、异步事件驱动的NIO框架,它提供了对TCP、UDP和文件传输的支持,Netty的所有IO操作都是异步非阻塞的,通过Future-Listener机制,用户可以方便的主动获取或者通过通知机制获得IO操作结果。
图3(Netty框架内部组件逻辑结构)
Netty的优点有:
a、功能丰富,内置了多种数据编解码功能、支持多种网络协议。
b、高性能,通过与其它主流NIO网络框架对比,它的综合性能最佳。
c、可扩展性好,可通过它提供的ChannelHandler组件对网络通信方面进行灵活扩展。
d、易用性,API使用简单。
e、经过了许多商业应用的考验,在互联网、网络游戏、大数据、电信软件等众多行业得到成功商用。
Netty采用了典型的三层网络架构进行设计,逻辑架构图如下:
图4(Netty三层网络逻辑架构)
第一层:Reactor通信调度层。该层的主要职责就是监听网络的连接和读写操作,负责将网络层的数据读取到内存缓冲区中,然后触发各种网络事件,例如连接创建、连接激活、读事件、写事件等,将这些事件触发到Pipeline中,再由Pipeline充当的职责链来进行后续的处理。
第二层:职责链Pipeline层。负责事件在职责链中有序的向前(后)传播,同时负责动态的编排职责链。Pipeline可以选择监听和处理自己关心的事件。
第三层:业务逻辑处理层,一般可分为两类:a. 纯粹的业务逻辑处理,例如日志、订单处理。b. 应用层协议管理,例如HTTP(S)协议、FTP协议等。
我们都知道影响网络服务通信性能的主要因素有:网络I/O模型、线程(进程)调度模型和数据序列化方式。
在网络I/O模型方面,Netty采用基于非阻塞I/O的实现,底层依赖的是JDKNIO框架的Selector。
在线程调度模型方面,Netty采用Reactor线程模型。常用的Reactor线程模型有三种,分别是:
a、Reactor单线程模型:Reactor单线程模型,指的是所有的I/O操作都在同一个NIO线程上面完成。对于一些小容量应用场景,可以使用单线程模型。
b、Reactor多线程模型:Rector多线程模型与单线程模型最大的区别就是有一组NIO线程处理I/O操作。主要用于高并发、大业务量场景。
c、主从Reactor多线程模型:主从Reactor线程模型的特点是服务端用于接收客户端连接的不再是一个单独的NIO线程,而是一个独立的NIO线程池。利用主从NIO线程模型,可以解决一个服务端监听线程无法有效处理所有客户端连接的性能不足问题。Netty线程模型并非固定不变的,它可以支持三种Reactor线程模型。
在数据序列化方面,影响序列化性能的主要因素有:
a、序列化后的码流大小(网络带宽占用)。
b、序列化和反序列化操作的性能(CPU资源占用)。
c、并发调用时的性能表现:稳定性、线性增长等。
Netty默认提供了对GoogleProtobuf二进制序列化框架的支持,但通过扩展Netty的编解码接口,可以实现其它的高性能序列化框架,例如Avro、Thrift的压缩二进制编解码框架。
通过对Netty网络框架的分析研究以及对比测试(见后面的可行性分析测试报告)可判断,基于Netty的数据采集方案能解决高数据吞吐量和数据实时收集的难点。
》》点击阅读全文
- ?
实时数据采集 将平台资源匹配
邢十三
展开
匹配算法实现,通过将用户属性、用户学习状态属性、用户操作行为统计属性与资源属性进行匹配,数据容量大,遥测距离远,人机界面友好,可靠性高的优点,可广泛用于学校和社区小区域范围环境服务。
也适合于气象、海洋、环境、机场、港口、工及等领域使用.实时数据采集与上传该模块主要功能是通过无线方式获取环境观测站采集的实时数据并显示.数据采集的基本算法如下:首先判断是否到发送数据时间,若到了执行数据发送命令。
为了方便学习者查找资源以及系统推送资源,须对学习者和资源的属性进行标记,即创建属性元数据.本研究采用标签技术分别建立学习者和资源的属性元数据.学习者的属性标签主要来自于用户注册时的信息(用户属性)、学习者的学习状态属性以及学习者系统操作行为统计属性(对上传、下载、浏览、评论等操作的统计)。
资源的属性标签主要来自于资源提供者根据学科和关键字分类的标签以及资源使用者对资源的评价、标记等.根据研究性学习的主题、用户学习进度,系统可以将用户可能感兴趣,其他用户感兴趣或评分高、浏览次数多,相同领域的最优资源或相似领域的最佳资源推送给用户,系统根据学习者的学习主题,将平台中评价最高的相关资源、教师指定的资源和拓展的相关资源进行匹配,
- ?
拥抱智能制造,实现生产数据实时采集
弗朗西斯
展开
在《中国制造2025》战略实施后,“制造业数字化、网络化、智能化”被定义为新工业革命的核心技术。
离开生产数据采集,生产管理部门不能及时、准确地得到工件生产数量;无法准确、科学地制定生产计划;无法实现生产管理协同等。
可见,只有有效的实现生产数据的采集和分析,才能从根本上解决车间管理中计划跟踪迟滞、设备利用率低、产品质量难以提升等问题。
自动地、及时地、准确地数据采集,是现代化工业车间的基础。而我们,能为数字化工厂打造一个更加可视、实时、精细、可追溯的制造环境。
东芝,是日本最大的半导体制造商,也是第二大综合电机制造商。公司创立于1875年,业务领域包括数码产品、电子元器件、社会基础设备、家电等。东芝信息机器(杭州)有限公司是日本东芝株式会社的全资子公司,也是东芝笔记本电脑全球唯一的生产基地。
面临的挑战
东芝电脑产品及机板配件生产部门每天都需要及时产出大量的生产数据统计报表,同时质检部门也需要定时定期巡检设备生产相关的异常信息,方便对生产数据进行快速高效和精细化的管理。
但是东芝之前通过excel记录生产数据已无法满足现有业务量的需求:
1、数据采集难:依然采用人工采集、手工输入等方式采集生产线信息;
2、手工数据质量差:excel记录不仅准确性不足,还存在一定的错误率;
3、报送周期长,统计延时:手工输入只能定时进行,无法实时更新系统中的生产数据,滞后情况严重,不利于生产线的顺利进行,制约了产能的进一步提高。
4、事后监管机制:不能及时发现生产过程问题,生产效率提升缓慢;
5、数据分析不足:不能进行可视化的展现,无法给领导提供决策支撑。
为什么选择亿信华辰
1、经受考验的成熟度
支撑30多个国家级部委完成监管、普查、抽查、统计等应用场景的数据采集与分析,助力100余家银行完成统一报表平台和统一数据平台的建设,业务稳定运行。
2、技术先进性
12年的技术沉淀,围绕数据全生命周期自主研发了多款重量级核心智能产品,产品线涵盖了数据采集、数据处理、数据存储、数据分析、数据挖掘等多个领域。
3、高品质强口碑
亿信华辰不仅提供成熟的平台化产品,而且不断地给客户成功交付数据中心、决策支持等应用系统,并以几乎100%的项目成功率,取得了远超同业公司的客户满意度。
平台建设
东芝制造车间生产过程中的数据包括车间人员、物料、加工设备、工票、工装、加工过程等,涉及车间各个部分。面向东芝内部的生产部门,为一线生产人员及质检部门提供数据填报及数据分析平台,是一个完全基于互联网技术构建的智能数据系统。
1、生产数据自动采集并上报
生产部门需要定时每天填写电脑产品及机板配件等的生产信息日报等,利用亿信华辰i@Report产品可以自动将数据库中的设备相关信息初始化到固定格式的报表中,然后根据相关业务逻辑公式,自动统计工数、时长、产出等,生产业务人员确认后直接上报,即可完成数据的采集填报工作,生产组长可以快速汇总其下属各个人员的生产数据,并将数据逐层上报。
2、异常数据提前预警
品质部门需要监管生产流水线的产品生产情况,并形成品质报告定期输出,利用i@Report移动填报功能,品质部门会去现场定时定期巡检,并将异常原因、设备编号等信息在平板电脑上立即进行填报,并拍照上传相关图片留档;同时,对于异常原因利用亿信BI进行历史数据的相关分析,形成问题检索表,方便对比分析。
方案价值
总体而言,利用i@Report+亿信BI两个产品,将以往需要大量的人工通过excel方式报送报表,改为只需要在移动端/PC端在线填报数据的工作模式,极大的减少了业务人员的工作量,提高了数据的共享效率;并将手工数据按照统一的标准存储到数据库,增强了数据的完整统一,也更加有利于对历史数据的对比关联分析。
同时,因为有效的流程监控,在生产过程中,可及时发现异动数据,提前预警,进一步提升了生产质量,降低了事故率,亿信华辰帮助客户收获更高的运营效率和生产质量。
目前,通过智能数据平台的搭建,亿信华辰帮助东芝提升生产能力的同时,也保证了数据的安全性和可靠性,着实为互联网时代的制造业注入了新的活力。
数据实时采集
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并