中企动力 > 商学院 > 研发数据采集系统
  • ?

    太友QCData:助力汽车零部件企业实现高效数据采集与质量管控

    廖羊青

    展开

    【前言】

    汽车制造业是机械制造业的重要组成部分,主要以离散型生产为主,离散型就是将单独的零部件一个一个进行组装最终形成产品,以零部件的拼接为主要的工序。汽车制造业产品的质量在很大程度上是受到零部件采购的质量影响,因此提高零部件采集质量管理,做好零部件的基础工作管理,对于不合格的产品需要进行严格的控制,保证采购零部件的质量。

    【案例讲解】:某汽车零部件企业实现高效的数据采集与质量管控

    企业背景:该企业是国内专业生产中小型车用发动机及零部件的企业,年产各型号发动机20万台套。

    该公司面临的主要挑战包括:

    公司质量总部负责协调管理分布在两个不同地方的工厂的质量控制和持续改进工作。两个工厂的生产线和测量车间都有大批用三坐标测量仪(CMM)、圆度仪、影像测量仪等测量得到的数据,但这些数据都分散存储在独立的数据文件中,且格式各不相同,这就给这些数据的利用造成了不小的挑战:

    ① 往往同一个零件的圆度测量数据文件在一台电脑上,而长度或其他尺寸的测量数据文件在另外一台电脑上,每次进行数据分析时,需要先从各地方归总数据,花很多时间进行整理后才能分析多次这样很容易大减分的。

    ② 从测量数据产生到形成质量数据分析结果往往需要好长的时间,无法及时了解制程质量状况,预防不合格品的产生。

    ③ 质量总部的管理人员每次都需要催好多次,才能拿到每个工厂提供的数据和分析结果,无法实时了解每个工厂的质量状况。

    【解决方案】

    针对此问题,太友科技公司自主研发了一套QCData系统,系统能够自动采集各种仪器上的数据并能将多个仪器设备上的数据同时采集到同一张报表中,消除数据孤岛;同时系统支持SPC实时监控与分析的功能,能够帮助预防不合格品的产生,通过强大的实时监控面板可对测量参数进行实时监控,超规格数据实时,质量总部的管理人员坐在办公室就能了解每个工厂各个生产机台的状态,并可随时查阅相关人员对质量警报的处理进程。

    QCData系统具有九大核心优势功能,能够完美解决目前汽车零部件企业所面临的痛点:

    ① 自动数据采集

    ② 多类仪器数据采集到同一张报表

    ③ 杜绝数据作假(多种数据操作权限)

    ④ 百变报表录入模板

    ⑤ QC数据挖掘分析

    ⑥ 多种形式的数据预警(声音、颜色、邮件、微信、报警灯)

    ⑦ 即可单机使用,又可灵活组网

    ⑧ 连通MES、ERP系统

    ⑨ 高性价比的质量解决方案

    【成果】:消除了数据孤岛,使测量数据的取用变成了一件轻而易举的事情;提前的质量预警使得停线情况明显减少,产品报废率显著降低;管理人员对各工厂的质量管控更加透明、即时、有效;在十几秒内自动生成各种报表,大大缩短报表制作的时间,提升效率。

  • ?

    中国排名前50的大数据公司(排名不分先后)

    元又菱

    展开

    国内大数据服务企业主力阵营:

    1、TakingData

    TakingData以SmartDP为核心的数据智能应用生态为企业赋能,帮助企业逐步实现以数据为驱动力的数字化转型。

    2、友盟+

    友盟+基于全域数据、数据技术和商业场景,构建以7亿消费者为核心,覆盖数据化运营、数据营销、新零售数据服务、金融及手机解决方案的数据智能服务体系,驱动业务持续增长。

    3、精准科技

    精准科技是一家以用户画像为特色的大数据技术公司,致力于推动大数据在营销场景中的使用,业务主要涵盖汽车、金融、房产三大领域。

    4、浪潮

    浪潮互联网大数据采集中心已经采集超过2PB数据,并已建立5大类数据分类处理算法。近日成功发布海量存储系统的最新代表产品AS130000。

    5、腾讯

    腾讯拥有用户关系数据和基于此产生的社交数据,腾讯的思路主要是用数据改进产品,注重QZONE、微信、电商等产品的后端数据打通。

    6、 探码科技

    探码科技自主研发的DYSON只能分析系统,可以完整的实现大数据的采集、分析、处理。一直做的国外项目美国最大的律师平台、医生平台和酒店、机票预订平台的数据采集、分析、处理。将在国内推出一系列面向政务、企业的创新型大数据研究项目与合作,为各大企业提供高端信息技术咨询服务。

    7、中兴通讯

    中兴通讯推出的“聚焦ICT服务的高效数据中心整体服务解决方案”,可帮助运营商有效解决大数据时代建设IDC面临的大部分问题,提升运营商ICT融合服务能力。

    8、神州融

    神州融整合了国内权威的第三方征信机构和电商平台等信贷应用场景的征信大数据,通过覆盖信贷全生命周期管理的顶尖风控技术,为微金融机构提供大数据驱动的信贷风控决策服务。

    9、中科曙光

    中科曙光XData大数据一体机可实现任务自动分解,并在多数据模块上并行执行,全面提高了复杂查询条件下的效率。

    10、华胜天成

    华胜天成自主研发的大数据产品“i维数据”,颇具创新,近期又与IBM达成战略合作关系,涵盖Linux on Power市场、智慧城市、存储业务、管理服务、咨询与应用管理服务。

    11、神州数码

    “神州数码”启动了“智慧城市”战略布局,先后推出了市民融合服务平台、自助终端服务平台等产品,并在佛山、武汉等“智慧城市”建设中实践运用。

    12、用友

    用友在商业分析、大数据处理等领域进行研发,先后推出了用友BQ、用友AE等产品。

    13、东软

    东软大数据战略以医疗行业为突破口,凭借在社保、医疗行业积累的资源,搭建了东软熙康这一智慧医疗平台。

    14、金蝶

    金蝶KBI与金蝶ERP无缝集成,实现BI数据采集——集成——分析决策支持的一体化应用。

    15、宝德

    宝德大数据云备份,是一个专为大数据而设的云备份方案,支持实体机及虚拟机备份,而且具有无限扩充的可能,并且完全自动。

    16、启明星辰

    大数据时代的IP治理和审计,启明星辰提供了终端审计、终端数据防泄露、日志审计,通过综合审计平台来帮助用户解决IP治理需求等解决方案。

    17、拓尔思

    拓尔思通过收购天行网安,可以拓展在公安行业的应用,目前正着力开拓行业应用市场,挖掘各个产业链中的大数据价值。

    18、荣之联

    零售、证券、生物、政府等都是荣之联大数据业务的主要目标行业,已为零售业提供了大数据分析的解决方案,解决了库存问题。

    19、中科金财

    中科金财作为国内领先的高端IT综合服务商,主要服务于金融业的大数据。

    20、美亚柏科

    美亚柏科专注于公安市场,其业务包括电子数据取证、电子数据鉴定、网络舆情分析、数字维权、公证云、搜索云以及取证云服务。

    21、赛思信安

    国内存储技术与服务供应商赛思信安推出了自主研发的大数据管理系统,适用范围包括互联网、公众服务、商业智能、金融、医疗卫生、能源等多个行业。

    22、华宇软件

    华宇软件作为大数据、食品安全、法务软件等相关热门行业软件,同时也是公安领域大数据的上市公司。

    23、天玑科技

    天玑科技的数据中心运维管理服务,为大数据的分析能力提供了强大的后台支撑和保障。

    24、东方国信

    东方国信主营业务为企业商业智能软件及系统解决方案,收购北科亿力和科瑞明,有效拓展了工业和金融大数据领域。

    25、华三

    华三全融合虚拟化网络技术能够极大简化网络结构,减轻网络管理和维护量,为企业数据中心大规模建设提供最强有力的技术支持。

    26、海康威视

    海康威视基于英特尔Hadoop发行版,并融合可以灵活按需调配IT资源对应用和服务进行支持的开放架构云计算技术,打造出了视频智能云计算方案。

    27、高德

    高德与阿里将在地图搜索、产品商业化、数据共享、云计算等领域展开合作,特别是在数据共享方面,高德和阿里巴巴将共建一个大数据服务体系,

    28、四维图新

    作为提供导航地图、地理信息系统软件建设的内容提供商,现在已尝试使用大数据为政府部门提供决策。

    29、海捷科技

    专注于商业智能领域(BI)、数据仓库领域、数据库领域的专业咨询、项目实施、软件开发、系统集成等方面,为金融、电信、快速消费品等行业提供相应方案。

    30、北京信合运通

    信合运通专注于为运营商和行业客户提供基于大数据的深度分析和挖掘技术、渠道支撑服务及行业解决方案。

    31、海云数据

    海云数据专注于从事数据可视化,可为客户提供数据可视化的创意设计、制作和软硬件集成系统服务。

    32、九次方金融数据

    九次方金融数据在国内唯一以企业大数据分析的角度对有投资价值和并购价值的企业进行价值判断,持续跟踪企业动态变化的金融大数据公司。

    33、永洪科技

    永洪BI通过完全自主知识产权的数据集市产品(Z-Data Mart)支持大数据,Z-Data Mart汇聚了数十项自有专利,涵盖了分布式存储和计算、分布式传输和实时通信等关键领域。

    34、集奥聚合

    集奥聚合作为大数据服务提供商,其DataQuate解决方案主要用于解决运营商大数据的接入、挖掘及应用,为运营商大数据的价值转化提供端到端服务。

    35、华院数云

    华院数云以数据挖掘为核心、以商业智能和精准营销为主线、以SAAS云平台为主要服务模式,目前专注于电商领域,为客户提供行业领先的数据分析和精准营销平台服务。

    36、杭州诚道科技

    杭州诚道科技致力于为浙江、全国公安交通管理行业提供一流的信息化服务、产品和方案解决能力,其借助英特尔Hadoop分发版,已解决了大数据的采集和处理问题。

    37、勒卡斯

    勒卡斯是致力于为客户提供全方位直复营销解决方案和服务的大数据公司,主要有潜客沟通、会员管理、CRM软件定制及客户市场调研四大业务。

    38、北京阿尔泰科技

    北京阿尔泰科技专业数据采集系统的制造商。

    39、智拓通达

    智拓通达主要做中国主流社交平台的“大数据”分析,通过整合各大社交平台的用户数据、行为数据和 UGC 内容,为企业和个人用户提供定制化服务。

    40、国双科技

    国双科技数据中心拥有基于OLAP技术的强大交互式数据挖掘平台,可提供不同深度的分析报告,满足不同视角的数据挖掘和分析需求。

    41、时云医疗科技

    时云医疗科技今日发布了医疗领域的大数据“未病”预警云服务“康诺云”,有针对个人健康管理而设计的云律血压节律仪、云悦体质分析仪和云动智能健康监测腕表3款智能硬件。

    42、百分点

    百分点主要为电子商务企业提供站内流量转化和商业智能分析的整体优化解决方案,旗下有推荐引擎技术平台以及跨网站消费偏好平台。产品主要有BRE和BAE。

    43、精硕科技

    精硕科技是国内少有的第三方数字营销监测和调研机构,专注于为广告主提供全流程的网络广告效果监测、分析评估、媒介优化咨询和技术解决方案等服务。

    44、神策数据

    神策数据立足大数据及用户行为分析的技术与实践前沿,业务现已覆盖以互联网、金融、零售快消、高科技、制造等为代表的十多个主要行业、并可支持企业多个职能部门。

    45、百度

    百度的优势体现在海量的数据、沉淀十多年的用户行为数据、自然语言处理能力和深度学习领域的前沿研究。近来百度正式发布大数据引擎,将在政府、医疗、金融、零售、教育等传统领域率先开展对外合作。

    46、阿里巴巴

    阿里巴巴拥有交易数据和信用数据,更多是在搭建数据的流通、收集和分享的底层架构。

    47、华为华为云服务

    整合了高性能的计算和存储能力,为大数据的挖掘和分析提供专业稳定的IT基础设施平台,近来华为大数据存储实现了统一管理40PB文件系统。

    48、同盾科技

    同盾科技将人工智能与业务场景深度结合,为银行、保险、汽车金融、非银行信贷、基金理财、三方支付、航旅、电商、O2O、游戏、社交平台等十余个行业客户提供高效智能的风控、反欺诈及营销分析服务。

    49、国双科技

    国双科技是中国的企业级大数据和人工智能解决方案提供商。

    50、智慧足迹

    智慧足迹是由中国联通和西班牙电信合资成立的专业大数据公司,依托中国联通的数据能力,提供位置信息洞察及相关大数据业务。

  • ?

    全球100款大数据工具汇总

    灵枫

    展开

    1、 Talend Open Studio

    是第一家针对的数据集成工具市场的ETL(数据的提取Extract、传输Transform、载入Load)开源软件供应商。Talend的下载量已超过200万人次,其开源软件提供了数据整合功能。其用户包括美国国际集团(AIG)、康卡斯特、电子港湾、通用电气、三星、Ticketmaster和韦里逊等企业组织。

    2、DYSON

    探码科技自主研发的DYSON智能分析系统,可以完整的实现大数据的采集、分析、处理。DYSON智能分析系统专业针对互联网数据抓取、处理、分析,挖掘。可以灵活迅速地抓取网页上散乱分布的信息,并通过强大的处理功能,准确挖掘出所需数据,是目前使用人数最多的网页采集工具.

    3、YARN

    一种新的Hadoop资源管理器,它是一个通用资源管理系统,可为上层应用提供统一的资源管理和调度,解决了旧MapReduce框架的性能瓶颈。它的基本思想是把资源管理和作业调度/监控的功能分割到单独的守护进程。

    4、Mesos

    由加州大学伯克利分校的AMPLab首先开发的一款开源群集管理软件,支持Hadoop、ElasticSearch、Spark、Storm 和Kafka等架构。对数据中心而言它就像一个单一的资源池,从物理或虚拟机器中抽离了CPU,内存,存储以及其它计算资源, 很容易建立和有效运行具备容错性和弹性的分布式系统。

    5、Datale

    由探码科技研发的一款基于Hadoop的大数据平台开发套件,RAI大数据应用平台架构。

    6、 Ambari

    作为Hadoop生态系统的一部分,提供了基于Web的直观界面,可用于配置、管理和监控Hadoop集群。目前已支持大多数Hadoop组件,包括HDFS、MapReduce、Hive、Pig、 Hbase、Zookeper、Sqoop和Hcatalog等。

    7、ZooKeeper

    一个分布式的应用程序协调服务,是Hadoop和Hbase的重要组件。它是一个为分布式应用提供一致性服务的工具,让Hadoop集群里面的节点可以彼此协调。ZooKeeper现在已经成为了 Apache的顶级项目,为分布式系统提供了高效可靠且易于使用的协同服务。

    8、Thrift

    在2007年facebook提交Apache基金会将Thrift作为一个开源项目,对于当时的facebook来说创造thrift是为了解决facebook系统中各系统间大数据量的传输通信以及系统之间语言环境不同需要跨平台的特性。

    9、Chukwa

    监测大型分布式系统的一个开源数据采集系统。建立在HDFS/MapReduce框架之上并继承了Hadoop的可伸缩性和可靠性,可以收集来自大型分布式系统的数据,用于监控。它还包括灵活而强大的显示工具用于监控、分析结果。

    10、Lustre

    一个大规模的、安全可靠的、具备高可用性的集群文件系统,它是由SUN公司开发和维护的。该项目主要的目的就是开发下一代的集群文件系统,目前可以支持超过10000个节点,数以PB的数据存储量。

    11、HDFS

    Hadoop Distributed File System,简称HDFS,是一个分布式文件系统。HDFS是一个高度容错性的系统,适合部署在廉价的机器上。HDFS能提供高吞吐量的数据访问,非常适合大规模数据集上的应用。

    12、GlusterFS

    一个集群的文件系统,支持PB级的数据量。GlusterFS 通过RDMA和TCP/IP方式将分布到不同服务器上的存储空间汇集成一个大的网络化并行文件系统。

    13、Alluxio

    前身是Tachyon,是以内存为中心的分布式文件系统,拥有高性能和容错能力,能够为集群框架(如Spark、MapReduce)提供可靠的内存级速度的文件共享服务。

    14、Ceph

    新一代开源分布式文件系统,主要目标是设计成基于POSIX的没有单点故障的分布式文件系统,提高数据的容错性并实现无缝的复制。

    15、PVFS

    一个高性能、开源的并行文件系统,主要用于并行计算环境中的应用。PVFS特别为超大数量的客户端和服务器端所设计,它的模块化设计结构可轻松的添加新的硬件和算法支持。

    16、QFS

    Quantcast File System (QFS) 是一个高性能、容错好、分布式的文件系统,用于开发支持 MapReduce处理或者需要顺序读写大文件的应用。

    17、 Logstash

    一个应用程序日志、事件的传输、处理、管理和搜索的平台。可以用它来统一对应用程序日志进行收集管理,提供了Web接口用于查询和统计。

    18、Scribe

    Scribe是Facebook开源的日志收集系统,它能够从各种日志源上收集日志,存储到一个中央存储系统(可以是NFS,分布式文件系统等)上,以便于进行集中统计分析处理。

    19、Flume

    Cloudera提供的一个高可用的、高可靠的、分布式的海量日志采集、聚合和传输的系统。Flume支持在日志系统中定制各类数据发送方,用于收集数据。同时,Flume支持对数据进行简单处理,并写入各种数据接受方(可定制)。

    20、RabbitMQ

    一个受欢迎的消息代理系统,通常用于应用程序之间或者程序的不同组件之间通过消息来进行集成。RabbitMQ提供可靠的应用消息发送、易于使用、支持所有主流操作系统、支持大量开发者平台。

    21、ActiveMQ

    Apache出品,号称“最流行的,最强大”的开源消息集成模式服务器。ActiveMQ特点是速度快,支持多种跨语言的客户端和协议,其企业集成模式和许多先进的功能易于使用,是一个完全支持JMS1.1和J2EE 1.4规范的JMS Provider实现。

    22、Kafka

    一种高吞吐量的分布式发布订阅消息系统,它可以处理消费者规模网站中的所有动作流数据,目前已成为大数据系统在异步和分布式消息之间的最佳选择。

    23、Spark

    一个高速、通用大数据计算处理引擎。拥有Hadoop MapReduce所具有的优点,但不同的是Job的中间输出结果可以保存在内存中,从而不再需要读写HDFS,因此Spark能更好地适用于数据挖掘与机器学习等需要迭代的MapReduce的算法。它可以与Hadoop和Apache Mesos一起使用,也可以独立使用。

    24、Kinesis

    可以构建用于处理或分析流数据的自定义应用程序,来满足特定需求。Amazon Kinesis Streams 每小时可从数十万种来源中连续捕获和存储数TB数据,如网站点击流、财务交易、社交媒体源、IT日志和定位追踪事件。

    25、 Hadoop

    一个开源框架,适合运行在通用硬件,支持用简单程序模型分布式处理跨集群大数据集,支持从单一服务器到上千服务器的水平scale up。Apache的Hadoop项目已几乎与大数据划上了等号,它不断壮大起来,已成为一个完整的生态系统,拥有众多开源工具面向高度扩展的分布式计算。高效、可靠、可伸缩,能够为你的数据存储项目提供所需的YARN、HDFS和基础架构,并且运行主要的大数据服务和应用程序。

    26、Spark Streaming

    实现微批处理,目标是很方便的建立可扩展、容错的流应用,支持Java、Scala和Python,和Spark无缝集成。Spark Streaming可以读取数据HDFS,Flume,Kafka,Twitter和ZeroMQ,也可以读取自定义数据。

    27、Trident

    是对Storm的更高一层的抽象,除了提供一套简单易用的流数据处理API之外,它以batch(一组tuples)为单位进行处理,这样一来,可以使得一些处理更简单和高效。

    28、Flink

    于今年跻身Apache顶级开源项目,与HDFS完全兼容。Flink提供了基于Java和Scala的API,是一个高效、分布式的通用大数据分析引擎。更主要的是,Flink支持增量迭代计算,使得系统可以快速地处理数据密集型、迭代的任务。

    29、Samza

    出自于LinkedIn,构建在Kafka之上的分布式流计算框架,是Apache顶级开源项目。可直接利用Kafka和Hadoop YARN提供容错、进程隔离以及安全、资源管理。

    30、Storm

    Storm是Twitter开源的一个类似于Hadoop的实时数据处理框架。编程模型简单,显著地降低了实时处理的难度,也是当下最人气的流计算框架之一。与其他计算框架相比,Storm最大的优点是毫秒级低延时。

    31、Yahoo S4 (Simple Scalable Streaming System)

    是一个分布式流计算平台,具备通用、分布式、可扩展的、容错、可插拔等特点。程序员可以很容易地开发处理连续无边界数据流(continuous unbounded streams of data)的应用。它的目标是填补复杂专有系统和面向批处理开源产品之间的空白,并提供高性能计算平台来解决并发处理系统的复杂度。

    32、HaLoop

    是一个Hadoop MapReduce框架的修改版本,其目标是为了高效支持 迭代,递归数据 分析任务,如PageRank,HITs,K-means,sssp等。

    33、Presto

    是一个开源的分布式SQL查询引擎,适用于交互式分析查询,可对250PB以上的数据进行快速地交互式分析。Presto的设计和编写是为了解决像Facebook这样规模的商业数据仓库的交互式分析和处理速度的问题。Facebook称Presto的性能比诸如Hive和MapReduce要好上10倍有多。

    34、 Drill

    于2012年8月份由Apache推出,让用户可以使用基于SQL的查询,查询Hadoop、NoSQL数据库和云存储服务。它能够运行在上千个节点的服务器集群上,且能在几秒内处理PB级或者万亿条的数据记录。它可用于数据挖掘和即席查询,支持一系列广泛的数据库,包括HBase、MongoDB、MapR-DB、HDFS、MapR-FS、亚马逊S3、Azure Blob Storage、谷歌云存储和Swift。

    35、Phoenix

    是一个Java中间层,可以让开发者在Apache HBase上执行SQL查询。Phoenix完全使用Java编写,并且提供了一个客户端可嵌入的JDBC驱动。Phoenix查询引擎会将SQL查询转换为一个或多个HBase scan,并编排执行以生成标准的JDBC结果集。

    36、Pig

    是一种编程语言,它简化了Hadoop常见的工作任务。Pig可加载数据、转换数据以及存储最终结果。Pig最大的作用就是为MapReduce框架实现了一套shell脚本 ,类似我们通常熟悉的SQL语句。

    37、Hive

    是基于Hadoop的一个数据仓库工具,可以将结构化的数据文件映射为一张数据库表,并提供简单的sql查询功能,可以将sql语句转换为MapReduce任务进行运行。 其优点是学习成本低,可以通过类SQL语句快速实现简单的MapReduce统计,不必开发专门的MapReduce应用,十分适合数据仓库的统计分析。

    38、SparkSQL

    前身是Shark,SparkSQL抛弃原有Shark的代码并汲取了一些优点,如内存列存储(In-Memory Columnar Storage)、Hive兼容性等。由于摆脱了对Hive的依赖性,SparkSQL无论在数据兼容、性能优化、组件扩展方面都得到了极大的方便。

    39、Stinger

    原来叫Tez,是下一代Hive,由Hortonworks主导开发,运行在YARN上的DAG计算框架。某些测试下,Stinger能提升10倍左右的性能,同时会让Hive支持更多的SQL。

    40、Tajo

    目的是在HDFS之上构建一个可靠的、支持关系型数据的分布式数据仓库系统,它的重点是提供低延迟、可扩展的ad-hoc查询和在线数据聚集,以及为更传统的ETL提供工具。

    41、Impala

    Cloudera 声称,基于SQL的Impala数据库是“面向Apache Hadoop的领先的开源分析数据库”。它可以作为一款独立产品来下载,又是Cloudera的商业大数据产品的一部分。Cloudera Impala 可以直接为存储在HDFS或HBase中的Hadoop数据提供快速、交互式的SQL查询。

    42、 Elasticsearch

    是一个基于Lucene的搜索服务器。它提供了一个分布式、支持多用户的全文搜索引擎,基于RESTful web接口。Elasticsearch是用Java开发的,并作为Apache许可条款下的开放源码发布,是当前流行的企业级搜索引擎。设计用于云计算中,能够达到实时搜索、稳定、可靠、快速、安装使用方便。

    43、Solr

    基于Apache Lucene,是一种高度可靠、高度扩展的企业搜索平台。知名用户包括eHarmony、西尔斯、StubHub、Zappos、百思买、AT&T、Instagram、Netflix、彭博社和Travelocity。

    44、Shark

    即Hive on Spark,本质上是通过Hive的HQL解析,把HQL翻译成Spark上的RDD操作,然后通过Hive的metadata获取数据库里的表信息,实际HDFS上的数据和文件,会由Shark获取并放到Spark上运算。Shark的特点就是快,完全兼容Hive,且可以在shell模式下使用rdd2sql()这样的API,把HQL得到的结果集,继续在scala环境下运算,支持自己编写简单的机器学习或简单分析处理函数,对HQL结果进一步分析计算。

    45、Lucene

    基于Java的Lucene可以非常迅速地执行全文搜索。据官方网站声称,它在现代硬件上每小时能够检索超过150GB的数据,它拥有强大而高效的搜索算法。

    46、Terracotta

    声称其BigMemory技术是“世界上首屈一指的内存中数据管理平台”,支持简单、可扩展、实时消息,声称在190个国家拥有210万开发人员,全球1000家企业部署了其软件。

    47、 Ignite

    是一种高性能、整合式、分布式的内存中平台,可用于对大规模数据集执行实时计算和处理,速度比传统的基于磁盘的技术或闪存技术高出好几个数量级。该平台包括数据网格、计算网格、服务网格、流媒体、Hadoop加速、高级集群、文件系统、消息传递、事件和数据结构等功能。

    48、GemFire

    Pivotal宣布它将开放其大数据套件关键组件的源代码,其中包括GemFire内存中NoSQL数据库。它已向Apache软件基金会递交了一项提案,以便在“Geode”的名下管理GemFire数据库的核心引擎。

    49、 GridGain

    由Apache Ignite驱动的GridGrain提供内存中数据结构,用于迅速处理大数据,还提供基于同一技术的Hadoop加速器。

    50、MongoDB

    是一个基于分布式文件存储的数据库。由C++...

  • ?

    探码Web数据源采集分析系统

    好雨

    展开

    摘要:面对互联网海量的信息,如何方便快捷的获取有效的信息对企业已经变得至关重要了。如果采用原始的手工收集方式,费时费力且毫无效率,面对越来越多的信息资源,劳动强度和难度可想而知。

    2017年,探码科技开发一个金融行业投融资交易大数据平台,在项目进行前期,需要对资料的搜集准备和数据源的整理,最后整理出来了很多需要采集的数据源,为了进一步落实数据源的数据量、是否有采集价值、采集价值有多大等一列问题,探码科技研发了一套探码Web数据源采集分析系统。

    Web数据源采集分析要么对网站访客行为的分析,即包括:网站流量报告,也可能包括电子邮件回应率、直接邮件活动资料、销售与客户资料、使用者效能资料如点击热点地图、或者其他定制需求资讯等等,然后进行行为分析,最终形成网络数据报告,以此来了解和优化网站;要么是爬取整个网站数据源资料、栏目、项目等进行数据源的采集,然后进行分析形成信息数据报告,最终用在:产生潜在的客户列表;从竞争对手中收集企业所需信息;抓取新兴业务数据;建立企业的产品目录;整合行业信息,辅助经营决策;确定新客户,增加新订单;挖掘老客户,获取利益……总之,Web页面内容所显示的即可采集进行分析形成可视化为企业所用。

    探码Web数据源采集分析系统主要采用Ruby on Rails + vue.js + Bootstrap实现数据源分析系统的后台和前端展示的搭建。根据各行业的需求可将整体分为多个模块多种形式进行可视化。其主要的步骤:1、从目标Web文档中获得待采集信息;2、判断待采集信息类型是否是所需数据,3、剔除无用的、重复的信息数据,按照所需信息数据进行过滤校验;4、保存所需数据。

    探码Web数据源采集分析系统——采集

    其特征是利用云计算服务器协同工作,能快速采集大量数据,而且也避免了一台计算机硬件资源的瓶颈,另外对数据采集的要求越来越高,传统post采集不能解决的技术问题也逐步被解决,以探码Kapow/Dyson采集器为代表的新一代智能采集器,能模拟人的思维,模拟人的操作,从而彻底解决了ajax等技术难题,因为网页一般都是设计来给人浏览的,所以能模拟人的智能采集器工作起来就非常顺利,不论后台技术是什么,当数据最终显示在人的面前的时候,智能采集器就开始提取。这最终把计算机的能力发挥到了极致,使得计算机可以代替人做所有网页数据采集的工作。同时利用大数据云采集技术,把计算机的计算能力也发挥到了极致。

    探码Web数据源采集分析系统——分析

    主要是通过对既有数据源进行分类整理、栏目划分、字段拆解,形成一个完整的数据源分析报告,以及对采集到的信息数据进行智能分析最终通过数据源的分析,发现数据之间的关系、规律和取值范围,为数据采用任务做准备。

    探码Web数据源采集分析系统的优势

    1、全方位的采集

    只要是Web页面可以看见的内容都可以采集,采集的内容数据包括文字、图片、flash动画、视频等各类内容;

    2、可实现复杂的对象的采集

    可实现正文和回复内容的同时采集,一级页面二级页面内容也可轻松实现合并,采集的内容可以是分散在多个页面内,结果可以是复杂的父子表结构;

    3、采集速度比普通采集快

    探码Web数据源采集分析系统采用前沿先进的技术,可运行多条线程同时抓取采集,采集速度比普通采集快上很多倍;

    4、精准度高,覆盖面广

    只要能在Web页面中可以看到的内容,几乎都可以按照需要的格式、所需信息数据进行采集。

    5、数据可视化,结果输出多样化

    采集的信息数据可采用探码TMDash可视化,呈现给企业,简单易读易懂。

    互联网时代,先进的大数据,人工智能和深度学习等技术实现了互联网平台的数据接口,探码Web数据源采集分析系统能提供专业的数据采集服务,精准采集分析所需信息数据。

    注:Web数据源采集系统的原理类似于搜索引擎的爬虫,是合法的。

  • ?

    携程用户数据采集与分析系统

    褚绿凝

    展开

    一、携程实时用户数据采集系统设计实践

    随着移动互联网的兴起,特别是近年来,智能手机、pad等移动设备凭借便捷、高效的特点风靡全球,同时各类APP的快速发展进一步降低了移动互联网的接入门槛,越来越多的网民开始从传统PC转移至移动终端上。但传统的基于PC网站和访问日志的用户数据采集系统已经无法满足实时分析用户行为、实时统计流量属性和基于位置服务(LBS)等方面的需求。

    我们针对传统用户数据采集系统在实时性、吞吐量、终端覆盖率等方面的不足,分析了在移动互联网流量剧增的背景下,用户数据采集系统的需求,研究在多种访问终端和多种网络类型的场景下,用户数据实时、高效采集的方法,并在此基础上设计和实现实时、有序和健壮的用户数据采集系统。此系统基于Java NIO网络通信框架(Netty)和分布式消息队列(Kafka)存储框架实现,其具有实时性、高吞吐、通用性好等优点。

    1、技术选型和设计方案:

    一个典型的数据采集分析统计平台,对数据的处理,主要由如下五个步骤组成:

    图1、数据平台处理流程

    其中,数据采集步骤是最核心的问题,数据采集是否丰富、准确和实时,都直接影响整个数据分析平台的应用的效果。本论文关注的步骤主要在数据采集、数据传输和数据建模存储这三部分。

    为满足数据采集服务实时、高效性、高吞吐量和安全性等方面的要求,同时能借鉴互联网大数据行业一些优秀开源的解决方案,所以整个系统都将基于Java技术栈进行设计和实现。整个数据采集分析平台系统架构如下图所示:

    图2(数据采集分析平台系统架构)

    其中整个平台系统主要包括以上五部分:客户端数据采集SDK以Http(s)/Tcp/Udp协议根据不同的网络环境按一定策略将数据发送到Mechanic(UBT-Collector)服务器。服务器对采集的数据进行一系列处理之后将数据异步写入Hermes(Kafka)分布式消息队列系统。为了关联业务服务端用户业务操作埋点、日志,业务服务器需要获取由客户端SDK统一生成的用户标识(C-GUID),然后业务服务器将用户业务操作埋点、日志信息以异步方式写入Hermes(Kafka)队列。最后数据消费分析平台,都从Hermes(Kafka)中消费采集数据,进行数据实时或者离线分析。其中Mechanic(UBT-Collector)系统还包括对采集数据和自身系统的监控,这些监控信息先写入Hbase集群,然后通过Dashboard界面进行实时监控。

    (1)基于NIO的Netty网络框架方案

    要满足前面提到的高吞吐、高并发和多协议支持等方面的要求。我们调研了几种开源异步IO网络服务组件(如Netty、MINI、xSocket),用它们和NginxWeb服务器进行了性能对比,决定采用Netty作为采集服务网络组件。下面对它进行一些概要介绍:Netty是一个高性能、异步事件驱动的NIO框架,它提供了对TCP、UDP和文件传输的支持,Netty的所有IO操作都是异步非阻塞的,通过Future-Listener机制,用户可以方便的主动获取或者通过通知机制获得IO操作结果。

    图3(Netty框架内部组件逻辑结构)

    Netty的优点有:

    a、功能丰富,内置了多种数据编解码功能、支持多种网络协议。

    b、高性能,通过与其它主流NIO网络框架对比,它的综合性能最佳。

    c、可扩展性好,可通过它提供的ChannelHandler组件对网络通信方面进行灵活扩展。

    d、易用性,API使用简单。

    e、经过了许多商业应用的考验,在互联网、网络游戏、大数据、电信软件等众多行业得到成功商用。

    Netty采用了典型的三层网络架构进行设计,逻辑架构图如下:

    图4(Netty三层网络逻辑架构)

    第一层:Reactor通信调度层。该层的主要职责就是监听网络的连接和读写操作,负责将网络层的数据读取到内存缓冲区中,然后触发各种网络事件,例如连接创建、连接激活、读事件、写事件等,将这些事件触发到Pipeline中,再由Pipeline充当的职责链来进行后续的处理。

    第二层:职责链Pipeline层。负责事件在职责链中有序的向前(后)传播,同时负责动态的编排职责链。Pipeline可以选择监听和处理自己关心的事件。

    第三层:业务逻辑处理层,一般可分为两类:a. 纯粹的业务逻辑处理,例如日志、订单处理。b. 应用层协议管理,例如HTTP(S)协议、FTP协议等。

    我们都知道影响网络服务通信性能的主要因素有:网络I/O模型、线程(进程)调度模型和数据序列化方式。

    在网络I/O模型方面,Netty采用基于非阻塞I/O的实现,底层依赖的是JDKNIO框架的Selector。

    在线程调度模型方面,Netty采用Reactor线程模型。常用的Reactor线程模型有三种,分别是:

    a、Reactor单线程模型:Reactor单线程模型,指的是所有的I/O操作都在同一个NIO线程上面完成。对于一些小容量应用场景,可以使用单线程模型。

    b、Reactor多线程模型:Rector多线程模型与单线程模型最大的区别就是有一组NIO线程处理I/O操作。主要用于高并发、大业务量场景。

    c、主从Reactor多线程模型:主从Reactor线程模型的特点是服务端用于接收客户端连接的不再是一个单独的NIO线程,而是一个独立的NIO线程池。利用主从NIO线程模型,可以解决一个服务端监听线程无法有效处理所有客户端连接的性能不足问题。Netty线程模型并非固定不变的,它可以支持三种Reactor线程模型。

    在数据序列化方面,影响序列化性能的主要因素有:

    a、序列化后的码流大小(网络带宽占用)。

    b、序列化和反序列化操作的性能(CPU资源占用)。

    c、并发调用时的性能表现:稳定性、线性增长等。

    Netty默认提供了对GoogleProtobuf二进制序列化框架的支持,但通过扩展Netty的编解码接口,可以实现其它的高性能序列化框架,例如Avro、Thrift的压缩二进制编解码框架。

    通过对Netty网络框架的分析研究以及对比测试(见后面的可行性分析测试报告)可判断,基于Netty的数据采集方案能解决高数据吞吐量和数据实时收集的难点。

    》》点击阅读全文

  • ?

    未来已来!微链与智幕科技研发订单一键化生产机器人WEROBOTICS

    童迎梅

    展开

    C2F新零售是一种使得消费者的利益最大化,同时也是将消费者放在消费链顶端的消费模式。消费者的需求直接对接工厂,没有中间商、零售商;没有实体店面费、没有渠道推销费,将所有的利益都投入市场,交到消费者手里。

    近日,在微链科技公司总部,北京智幕科技有限公司和微链科技签署了战略合作协议。此次战略合作协议内容涉及双方在建筑行业智能化生产领域建立长期的战略合作伙伴关系。

    北京智幕科技有限公司是一家专业从事BIM智能化工业化企业,微链科技是一家机器人视觉研发公司,是机器人认知技术的提供者和领导者,双方就工业4.0解决方案将进行深入落地的合作与推进。双方将共同研发“订单一键化生产机器人WEROBOTICS”,在未来的建筑材料行业:当用户在手机APP上挑选所需要的产品并支付、工厂里的机器人就会根据订单的不同,在仓库里自动挑拣配件及原材料,输送到自动化生产线上进行生产、装箱与打包、物流的发送,直到用户签收货物、系统会自动派单给服务人员,服务人员会到用户现场安装,一直到服务评价。WEROBOTICS机器人全程的系统服务包括大数据收集分析并能够提前预知产品的健康状况,甚至在产品还没有损坏之前就进行维修更换。

    《国务院办公厅关于促进建筑业持续健康发展的意见》提出:加快先进建造设备、智能设备的研发、制造和推广应用,提升各类施工机具的性能和效率,提高机械化施工程度。限制和淘汰落后、危险工艺工法,保障生产施工安全。积极支持建筑业科研工作,大幅提高技术创新对产业发展的贡献率。

    2017年,住建部发布《住房城乡建设科技创新“十三五”专项规划》,提出了近五年的八项重点任务,明确促进建筑业向工业化、绿色化、智能化转型升级提供科技支撑的目标。

    对此,智幕科技与微链科技积极响应此项号召,为推动城市绿色发展,促进建筑业向工业化、绿色化、智能化转型升级提供科技支撑。双方的合作破解了传统建筑业普遍存在的作业效率低、原材料消耗大、环境污染严重等难题。

    长期以来,由于建筑市场的信用缺失,虚假信息众多,影响了国民经济和投资效益,加大了企业经营成本与风险,更导致社会资源使用效率低下。

    我国建筑业体量大但信息化水平低,存在较大提升空间。建筑业是我国经济支柱型产业,近年来保持着良好的增长态势,在国内GDP中的比重一直保持在6%以上,2016年我国建筑业总产值达到19.36万亿,其中建筑业增加值达到4.95万亿,超越美国位居全球第一。但与此相对的是,我国建筑业信息化率仅约为0.03%,与国际建筑业信息化率0.3%的平均水平相比差距高达10倍左右。基于我国建筑业现有的庞大体量测算,信息化率每提升0.1%个百分点就将带来近200亿的增量市场,未来提升空间巨大。

    转型,是传统产业目前最大的议题,建筑行业也一样。在房地产市场与“中国制造4.0”的双重转型压力下,建筑行业的转型与升级也愈发迅速。借助最新的科学技术,自动化、智能化成为建筑行业转型发展方式的主要方向。

    智幕科技作为专业从事BIM智能化工业化企业,具有如下的优势与亮点:

    1.针对幕墙行业全流程BIM咨询、设计和服务

    2.通过BIM技术实现客户建筑信息数据化,终端幕墙产品生产企业制造智能化,利用智幕平台实现C2M(客户到生产销售企业)与S2B(供应链到生产销售企业)高度整合。

    3.基于建筑信息数字化,为企业提供智能智造全流程解决方案并实现智能生产。

    建筑信息模型(BIM)技术在规划、勘察、设计、施工和运营维护全过程的集成应用,实现工程建设项目全生命周期数据共享和信息化管理,为项目方案优化和科学决策提供依据,促进建筑业提质增效。

    微链科技作为一家机器人视觉研发公司,专注于认知机器人研发,是人工智能领域专家。具有如下的核心技术与优势:

    1.微链拥有大数据挖掘及分析、机器人控制系统、机器人视觉系统、认知机器人操作系统、云计算安全、计算机图片认知等50多项软件著作权。具有机器人及人工智能等领域10多项专利。

    2.核心技术:

    机器人驱动器控制芯片——机器人驱动芯片是集成有CMOS 控制电路和DMOS 功率器件的芯片,利用它可以与主处理器、电机和增量型编码器构成一个完整的运动控制系统。可以用来驱动直流电机、步进电机和继电器等感性负载。微链掌握最新的机器人集成驱动技术,可以使机器人更精巧,速度更快,精度更高。

    机器人视觉三维算法——微链自主知识产权的机器人三维视觉算法,远远领先于目前的2D视觉系统,处于国际领先水平。 大数据采集分析技术——微链科技的大数据研发工程师具有十年以上的IT系统研发经验,技术已经应用于华为实验室和中科院植物基因遗传研究所。

    图片认知及力矩传感技术——机器人是复杂的硬件和软件系统,人类认识世界的基本途径是眼睛所捕捉到的图像和皮肤神经所感知的触觉,微链科技具有优异的图片认知技术和力矩传感器研发设计能力。

    3.机器人感知系统——如同人类一样,视觉和触觉是机器人感知世界 的第一步。得益于WELINKIRT的优秀算法,通过将人工智能(AI)与WETHINK COGNITIVE和 WEROBOTICS软件结合在一起,微链WTHINK COGNITIVE套件能够解决对于传统机器视觉系统而言过于困难、繁重或昂贵的复杂应用。该机器人感知系统搭载于机器人前端,可以实时采集机器人所观察到的图像和感受到力量反馈,并负责将这些数据实时传输到WETHINK认知处理器。从而使机器人获得认知能力、能够根据不同的工件,在不同的位置和维度,以及合适的力量进行抓取或者装配。

    4.机器人认知系统——通过搭载于机器人前端的机器人感知系统,WETHINK认知处理系统可以实时采集机器人所观察到的图像和感受到力量反馈,WELINKIRT认知处理系统通过WEROBOTICS软件算法,将数据进行重构、计算和处理。从而使机器人获得认知能力、能够根据不同的工件,在不同的位置和维度,以及合适的力量进行抓取或者装配、检测。

    最快:0.1s,从图像及数据处理到机器人引导

    精度最高:20微米即0.02mm

    不需要编程,操作简单) 微链认知系统可以实现机器人定位、引导和检测,是目前世界上速度最快、精度最高、能实现工业 化场景最多的机器视觉技术。

    5.视觉识别技术

    ※Welinkirt视觉识别技术是监督机器深度学习人工智能技术,它通过单镜头就能对物体进行2D、2.5D和3D识别,对物体选中的特征点进行识别分析,能够完全对各种复杂形状进行分析判断,指导机器人进行相对位置的精准工作。

    ※在视觉技术的支持下,机器人能够完美的解决物体在传送过程中发生的定位偏移、旋转和高度差等问题。且视觉的定位精度达到0.02毫米,这是传统机器人无法解决的。

    ※我们还搭载独有的大数据采集分析系统,可通过工业物联网实时监测机器人状态。

    数据采集:可准确采集机器人工作中的各项参数的实时数据。

    大数据分析:可对机器人工作的实时参数通过大数据算法比对找出机器人工作状态的偏差,以便更好的维护和使用机器人。

    物联网传输:机器人分析数据可接入工业物联网系统,便于机器人的管理监控。

    微链科技董事长冉祥先生表示:“今天的合作不仅对于智幕科技和微链科技来说,意义重大,更是对中国的建筑行业,对中国的智能制造,是一个美好的开始,我们不仅提高了建筑生产企业的的智能化和降低了生产成本,更使企业能满足用户的个性化需求,实现了柔性化生产,提高了企业的竞争力和客户满意度。未来,随着两个企业之间的不断碰撞,我相信一定还有更多精彩的火花产生。我们期待和智幕一起,在建筑行业的转型升级中做出更有影响力、有价值的事情。”

  • ?

    数据产品经理必修课(66):大数据研发之采集技术

    压抑感

    展开

    既然产品、研发与运营是互联网的三板斧,那么就不得不说说大数据时代的研发。我一直在困惑,究竟应该如何向广大的产品经理同学们讲清楚什么是大数据的研发。说详细了,必然使其困惑,而且我也不一定都能够明了其中的细节;说的粗略了,产品经理同学又会觉得不痛不痒,毫无感觉与世纪效果。再加上,本身打数据的研发就包罗万象,即便是单独成书则废寝忘食不能成也。除此之外,大数据门派众多,云计算、虚拟化、微服务都算是与大数据紧密相关的,那到底什么该讲什么不该讲呢?

    我制定了大致这样的规则,我们想和各位产品经理同学讲一讲大数据的代表性工作,Hadoop平台以及围绕该平台大致需要做的一些事情,我们并不会具体到一种语言,也不会具体到某种技术,而是从宏观的视角,把产品经理在数据上扎的根生出的藤蔓深向原本只有工程师们才能够触及的墙角与远方,并在每一处需要精心雕琢与深究的地方稍加缠绕,略微展开谈一谈这些宏观过程其中的内部机理。还记得我们在第二部分介绍数据挖掘相关技能的时候,我们使用了CRISP-DM的流程来介绍数据挖掘与数据分析的标准化步骤。如果那个时候的介绍看成是逻辑层面的流程的话,我们这里想要沿着物理层面的主线来向数据产品经理同学们展现什么是打数据的研发。具体来说,我们会按照数据采集、数据存储、数据计算以及数据分析这样四个步骤去介绍这些过程在工程师的手中,在他们心爱的服务器上都发生了什么。

    让我们还是先来看看数据采集吧。

    现如今,相信很多人手上的手机已经变成了全屏幕的触屏手机,而如果时光回到十年前,你拿起那个屏幕尺寸更小,手机功能更少的键盘机的话,不知会作何感想。那个时候的手机对于我们来说,只有三个意义:电话、短信、小游戏。如果你的手机可以播放视频,那一定是诺基亚与摩托罗拉的高端机型了。在那个时候,我们通过移动电话设备产生的数据无非也就是通话与短信数据,这些数据存储在三大运营商,他们知道我们在什么时间给谁发短信或者打电话,如果他们乐意,甚至还可以知道我们发了什么,说了什么。那个时候的数据采集量小到可怜,而且大多数还握在运营商手中。

    随着屏幕尺寸的扩大,安卓与iOS的入局,整个手机生态被打破,人们还是习惯于看大屏幕的收集,习惯使用一根手指去戳屏幕,习惯于在自己的电子设备上装上各色花花绿绿的应用,以至于在各种公共场合人们低头猛戳手机,甚至还收获了一个专有的名词叫做“低头族”。这个时候,出现了微信、微博,人们开始习惯使用微信给好友递送消息,而不再使用短信。这样的现象也改造着运营商的业务,以前每个月最需要在意的是套餐中包含多少条短信,而现如今则是每个月的套餐中的流量有多少。尽管运营商还是掌握着我们海量的数据,但是能够收集数据的人再也不止那三家运营商了。手机的生产者需要为手机在出厂的时候生产操作系统,因而他们成为了天然的数据收集方,原则上他们可以了解到你在手机里做的一切,就好比在一个封闭的屋子里装上了一个闭路电视,这个屋子就是该厂商生产的手机,你可以不进去,但是一旦你进去,所有的行为将被监控与知晓,至于这个闭路电视的监控视频内容何时被何人查看则取决于布下该系统的人的意愿罢了。除了这个房屋的建造者,还有很多的家居提供商也具备监控行为的能力,这些家居的提供商就是手机里花红叶绿的各色APP,原则上,只要你使用这样的家居产品,你在使用该产品的行为就会被记录,如果这样的家居公司与房屋的建造公司关系不错,除了能够收集自家家居产品的使用数据之外,还能顺便了解到但凡有本家公司家居产品的屋子里都还有哪些家居产品,甚至连用户是如何使用其他家居产品都是知道的。这样,数据进一步被积累,除了以前的运营商(地皮所有者)之外,手机操作系统厂商(房屋建造者)与手机内应用开发者(家居厂商)都是数据的拥有者。

    原本数据只是一口池塘,池塘中仅有的几条大鱼已经翻不过来身了,而现如今风云突变,池塘变成了湖泊,不仅这几条大鱼能够鱼翔浅底,而且随着湖泊生态的演变,鱼群变得越来越密集,每条鱼都可以自由的吮吸着湖泊中的融氧,变强,变大。就在此时此刻,湖泊的平面再一次的上升,而鱼群们则更加跃跃欲试,这个湖就是我们现在知道的大数据。

    抒情了这么久,只说了数据采集的一半,即可以采集哪些数据。当然,上面是以采集收集的数据为例来进行的说明的,而传统的网页也无非大同小异。可是这些数据究竟是怎么被厂商们采集回去的呢?也就是说到底采集的方法有哪些呢?

    我们大致可以将数据的采集分为两类,一类谓之传送带式,一类谓之土方车式。且听我细细为你道来。

    对于传送带方式的数据采集来说,实际上实在采集的前沿阵地和数据存储的大后方建立了一个传送带,一旦有星星点点的数据被采集回来就会被立即送上传送带,经过一段距离的传输就会被递送到存储的地方存储起来或者是被计算。就好像是在很多煤矿或者石料企业的现场看到一条长长的传送带,前方的挖煤机或者是采石机但凡能够搅下半点原料,这些原料就会被立刻送上传送带,送到后方。尽管在实际的场景中,这些传送带的后方有可能也是一些仓库,但不妨把这些仓库看成是在数据采集档口上的第一道存储服务器罢了。在这样的情况下,运送土方或者数据的通道是一直建立的,存储土方和数据的仓库也是时时刻刻在接受的,只要采集数据的过程不停止,那么运行这个传送带的机器与看守仓库的人就不可以停止与下班,因而在这样的实时数据采集过程中,人的注意力不可以离开,需要一直专注于整个流程,我们称他们是长连接,就好比是人的思想之弦一直紧绷,一刻不松懈的关注者另一端很长时间。与这样方式类似的数据处理形式称之为数据流处理,而打电话就是一种典型的数据流处理形式,在整个打电话的过程中,听话人需要一直关注对方在说什么,甚至需要通过听辨声音来判断通话是否还存在于线上或是已经挂断。

    对于土方车式的数据采集来说,往往是挖掘机把挖掘到的土(数据)放到土方车上,但是这些土方车不会因为有了一抔土就立刻送走离开,而是等车装满后再听从现场指挥的命令按照次序离开并送到指定的地点,这样的方式因为是需要将数据积累到一定的量,因而是一种相较前一种数据采集的方式更加随意的方式,它的随意就体现在数据并不要求实时,而是一段时间发送一次。于是乎,在挖掘机工作的时候,土方车的驾驶员(传送人)与仓库的保管员(存储人)可以稍加休息或是处理其他事情。这种数据采集的模式称之为短链接,顾名思义,人们的神经并不需要死死地盯住一个事情,而是仅仅需要在需要处理的时候响应它,在处理完了之后转而去做别的事情或者处理别人的请求即可。目前大多数的APP内的数据采集使用的就是这样的短链接模式,先将数据积累在本地,然后再一段时间把这些数据递送一次。除此之外,当你访问网页的时候,也是这样的短链接模式,你送给服务器一个URL,告诉他你想要这个网址的内容,服务器找到之后发送给你,但是它并不关心你是否能够收到,只要它一旦发出就去处理别的事情了,除非你再次请求他,否则它也不会再来理你。

    这就是你所应该知道的数据采集过程。

  • ?

    “最牛社保职工”发明采集系统 数据采集3分钟搞定

    海灵子

    展开

    “最牛社保职工”发明采集系统

    社保卡数据采集,3分钟搞定 投用一年为安顺市民节约160万元

    市民在操作数据采集系统。

    “没想到这么方便,几分钟就能办好!”9月12日下午,安顺市社保局办事大厅内,市民王蕾站在社保卡制卡数据采集机前,刷身份证、输入电话号码、根据提示拍照,简单几个步骤,不到3分钟,社保卡信息已采集完毕。

    从“便民”出发萌生新创意

    这个让市民“少跑路”的信息采集“神器”,正是安顺市社会保险事业局网络管理科科长龙元鑫的新发明。

    据了解,以往参保人申请制作社会保障卡,需自费到指定的商业相馆拍照,再到社保经办机构服务窗口排队进行数据采集,如果相片不规范,还得返回相馆重拍,整个过程至少半天才能完成。

    从事社保工作15年来,看到参保人长时间排队等待,来回折腾于金融部门——社保机构——工作单位之间,2013年,计算机软件专业出身的龙元鑫萌生了一个想法:自己设计一个集信息采集和拍照于一体的系统!让群众办理业务少掏钱、少跑路、少耗时。

    说做就做,于是,龙元鑫开始了一场漫长的创造之旅。

    忍受3年的枯燥坚持研发

    构思、画图、设计控制板,自掏腰包购买相机、升降机、机柜,绘制电路图、制作电路板、编写程序控制硬件……而这些工作,龙元鑫都只能利用业余时间来完成。

    “家里客厅、卧室到处都是我要用的零件。”龙元鑫笑着说,“女儿也总是被我拉过来当模特试验拍照效果,后来一听到爸爸叫拍照就要躲”。并且,长期伏案导致才40岁出头的他犯了颈椎病,也正因为如此,家人免不了有些抱怨。

    时间一天天过去了,作品还总是有需要改进的地方,对于这个过程,龙元鑫用了两个字来总结——枯燥。远离了原来一起打羽毛球的朋友,没时间陪孩子,龙元鑫偶尔也想过放弃,第二天却又再次全身心地投入其中。

    投用一年为市民节约160万

    功夫不负有心人,2016年初,龙元鑫研制的“社保卡制卡数据采集系统”第一代开始投用,参保人只需3分钟就能完成信息录入。

    仅投用的第一年,该系统就采集了制卡人数据8万余条,将全市291.8万户籍人口持卡率提高了2.7个百分点。如按每拍摄一张制卡相片花费20元计算,仅拍照费用一项就为制卡人群节约了160万余元。

    “目前安顺户籍人口尚有183.4万人未制作社保卡,而这类人群大都居住在农村。”龙元鑫说,他接着对系统进行升级改造,2017年,体积缩小一半,重量约50斤,功能更完善的第二代、第三代便携“社保卡制卡数据采集系统”已覆盖全市98个乡镇,还有30多台可以随时带进高校、农村进行参保数据采集。

    初步预算,这一系统可为百姓节省3000多万元,将有效助力扩大社会保障。(实习生甘良莹 记者张光平 来源:贵州都市报)

  • ?

    智能制造工厂生产车间无线数据采集系统解决方案

    z_l_j

    展开

    工业物联网无线数据采集系统,是一套具备终端数据采集,无线数据传输和数据应用分析等多功能的智能化数据采集和监控系统,它在市政供排水管网、供汽管网、热力管网、石油天然气管网、地下管沟监控;游泳池水箱水塔液位、大坝、河道水位、泵房浸水监控;蔬菜蘑菇、针金菇、水果、花卉、育苗等农业大棚智能环境监控;畜牧、家禽、水产等农业养殖智能环境监控;化工危化品石油天然气储罐区、电池、面粉仓库智能环境监控;电信机房、实验室、医院药房、生产车间、冷柜冰箱、图书馆、博物馆、档案室、粮库、烟草、酒糟酒曲酒窖等仓储馆藏智能环境监控;社区楼宇、港口工业园区、公园景区、校园广场、超市商场等大气环境质量智能监控;发动机、变频器等生产机器设备运行状态、仪器仪表能耗及生产缺料的智能监控等多个领域有着广泛的应用。

    近年来,工业物联网无线数据采集系统的发展趋势是简化终端结构,在数据采集终端与主机之间采用无线通信,以代替复杂、不灵活的现场布线。该阶段数据采集系统采用更先进的模块式结构,根据不同的应用要求,通过简单的增加和更改模块,并结合系统编程,就可以扩展或修改系统,满足不同领域的需要。

    针对工厂生产车间机器设备运行状态、运行工艺参数、运行能耗数据,以及管网运行状态数据、变配电系统运行数据、车间仓储库房环境参数等数据的采集、监控,深圳信立科技结合XL.SN无线传感器网络2.4GHz或433MHz模块技术、MES制造执行系统技术及无线传感器、无线测控装置RTU等,自主研发设计了一套工业版工厂生产车间无线数据采集系统解决方案,实现实时获取完整、准确的工厂生产制造过程中的各种数据,为企业提高生产制造管理提供基础数据,全面优化生产制造的管理手段、提高生产制造管理效率,向工业4.0靠近!

    一、系统功能

    1、采集设备运行状态:停止、待机、运行、故障、检修等等,以及发生的时间点;

    2、采集设备运行工艺参数:压力、温度、流量、转速、计数、风速、位移等;

    3、采集设备运行能耗:电流、功率、电能;汽、气消耗量;

    4、采集企业供水、供汽、空压、制冷等设备及相应管网的运行状态数据;

    5、采集企业变配电系统运行数据;

    6、监控车间环境参数,以及仓储库房环境参数。

    二、系统通讯方案

    1、XL.SN智能传感网络采集结构

    XL90物联网智能网关,可同时构建433MHz和2.4GHz两种不同结构的传感网络,用于接收终端采集的数据,并上传至服务器。其中433MHz用于跨车间、厂区内的数据传输,2.4GHz用于车间内的数据传输。

    2、XL.SN通讯网络方案

    a、XL90物联网智能网关通过2.4GHz或433MHz等方式读取节点设备数据后,进行协议转换、数据处理,通过局域网,上传数据至MES服务器;

    b、XL90物联网智能网关通过以太网,从第三方监控系统,如电力监控系统、EMS、DCS、智能楼宇系统等等,读取数据;

    c、MES服务器,或XL90物联网智能网关,通过以太网,将数据转发给第三方系统,如EMS、ERP等。如图2。

    3、物联网智能网关数据接入MES系统通讯方案

    XL90物联网智能网关通过企业局域网,和MES服务器通讯。 XL90智能网关和MES的通信协议,可选以下3种: 建议首选:XL/9E-RDF Redis数据交换协议; 建议次选:XL/9E-DF 数据库格式协议; 建议再次选:XL/9E-UDP 通信协议; 工业以太网通用协议:MODBUS TCP。(不太建议选择)

    三、系统解决方案

    1、设备信号采集

    配置XL60智能测装置,采集机器设备的运行信号,通过2.4GHz或433MHz方式上传,实现生产制造设备的信号采集。

    2、设备控制器的数据采集

    选配XL66智能转换器,读取机器设备控制装置及现场监控仪表采集的信号,通过2.4GHz或433MHz等方式接入传感网络。

    3、管道压力、温度,车间环境、仓储环境的气体浓度、温湿度采集

    选配XL61系列智能传感器,采集管道压力、温度,车间环境、仓储环境的气体浓度、温湿度,通过无线上传,并在需要的通道,出、入口设置声光报警器,或启动紧急设备。

    4、其他信号采集

    选配XL60智能测控装置,及XL68智能环境监测装置,采集火灾探测器、噪音传感器,光照传感器,液位变送器,压力变送器等等设备,以及系统原配的仪表数据。

    四、系统优势

    1、工厂生产车间无线数据采集系统建设过程中,无需布线,或减少布线数量,减少系统建设成本。

    2、系统所需的设备安装调试方便,设备支持手机调试,提高运营维护的效率。

    3、系统底层终端各种数据采集后统一接入企业MES系统,便于监控管理,提高企业生产管理效率。

    五、系统配套

    整个无线数据采集系统方案,根据应用需要配套的软硬件设备,包括XL90物联网无线智能网关、XL60智能测控装置RTU、XL68智能环境测控装置RTU、XL66智能转换器,以及XL61无线压力传感器、XL61无线温度传感器、XL61无线气体传感器、XL51无线温湿度传感器等无线传感器,还有MES制造执行系统软件。

    六、适用范围

    深圳信立科技设计的工业版工厂生产车间无线数据采集系统解决方案,适用于在我国珠三角、长三角、京津冀等沿海发达地区,以及重庆、成都、湖北、河南、安徽等内陆省份的电子加工制造、汽车制造、钢铁冶炼、机械装备、食品生产、医药生产等各行业制造业工厂。

研发数据采集系统

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP