中企动力 > 商学院 > 数据采集产品
  • ?

    01数据产品经理从零到一:数据产品能力模型构建

    毛毛雨

    展开

    笔者正在由电商产品经理转型数据产品经理,为了提升自己学习的效率,尝试以这种输出驱动输入的模式,将自己学习的思路和学习内容分享给大家,也希望可以与其他数据产品经理多多交流。

    本文尝试凭借笔者的理解构建一套数据产品经理能力模型,作为自己未来学习的方向。本文共分四个部分,第一部分,从招聘市场需求入手,看市场上的招聘高级数据产品经理都需要掌握哪些硬实力;第二部分,结合一些数据产品经理的分享,梳理数据产品经理的朋友圈,因为沟通者一定程度决定了需要掌握多少“共通语言”;第三部分,构建数据产品经理能力模型,第四部分,详解一些数据产品常常接触的概念和系统。

    一、从招聘要求看能力要求

    笔者在拉勾网和猎聘网上搜索数据产品经理和高级数据产品经理,将岗位职责汇总整理,招聘方对于数据产品经理的需求如下所示:

    1、熟练使用MySQL,SQL、Hive等语言;2、熟悉数据生产加工流程;3、对主流大数据产品、BI产品;4、对数据仓库技术及理论有基本的了解,并对其发展趋势有深入了解;5、了解数据分析,数据建模和数据挖掘技术及理论;6、能很好地掌握产品思路、技术方案、商务策略等,驱动各角色解决问题 ,具有良好的商业洞察与判断,很强的逻辑思维能力、产品策划、品牌包装与宣传能力,对数据和业务敏感,有一定技术背景优先考虑。

    从上面的企业招聘需求可以看出,数据产品经理除了需要具备一些普通产品经理基础能力外,对数据分析,商业智能,数据挖掘等技能有着非常高的专业门槛。虽然数据产品经理也细分出应用方向,大数挖掘方向,数据分析方向,但为了更加有效的共同,还是有必要补全知识结构。数据产品经理多是数据分析师和数据开发通过内部转岗完成的,笔者属于电商产品转应用方向数据产品,在发挥业务理解优势的同时,需要快速补全数据分析相关知识,便于与对接同事高效协作。

    二、数据产品经理的朋友圈

    曾经分析过AI产品经理模型,也是从产品经理的朋友圈说起,因为产品经理很多时候承担着协调推进角色,也承担了部分”翻译官“的觉,将业务需求转化成不同的语言表达,找老板要资源,请开发写代码,叙述清楚页面设计要求,这个时候就需要产品掌握不同分科中的一些”黑话“,让对方感觉你是自己人,数据产品经理也是同样的,我们来看看数据产品经理的朋友圈,也有助于进一步理解数据产品能力模型。

    源于《阿里巴巴数据产品经理工作(总结篇)》

    数据产品经理本质是互联网产品经理的一个细分领域,其产品的用户是公司内部,外部客户等,其目标是通过数据分析和挖掘,辅助其发现问题,提高决策准确性,而为了完成这类产品,我们不单要与传统的开发,交互,设计,用研,客户,测试同学打交道,还需要与数据分析师,数据科学家,AI工程师,数据仓库管理员等同学沟通,为了可以保证沟通中的效率,我们需要清楚沟通时可能会涉及到哪些专业名词,技术实现边界,行业发展情况,竞品实现逻辑,笔者将尝试在后续文章中梳理总结。

    三、能力模型构建

    数据产品经理是产品经理岗位的一个细分领域,其能力模型可以理解为一般产品经理能力模型+专业能力补充模型。下图是腾讯产品经理能力模型体系,清晰界定了不同等级产品经理19个能力侧重方向,整体来看学习能力,执行力,沟通能力,市场/用户调研与分析是最核心能力。

    以上19个基础能力模型中,数据产品经理在技术知识模块和市场分析能力/前瞻性需要了解/熟悉/掌握如下知识和技能:

    1、计算机语言层面:熟练使用MySQL,SQL、Hive等语言;2、熟悉数据生产加工流程:数据采集,数据预处理,数据存储,数据分析,数据挖掘,数据可视化,数据服务产品化;3、需要了解的各类技术理论及发展趋势了解主流大数据产品及分布式大数据技术,如Hadoop(HDFS和MapReduce),Hive等;了解主流大数据编程语言,如python、R、mongodb等、了解主流BI产品,如Tableau、saiku、kylin、BDP、growingIO、神策等、了解数据仓库技术及理论,并对其发展趋势有深入了解;了解数据分析,数据建模和数据挖掘技术及理论;

    四、数据产品经理经常面对的基础概念

    1、可能接触到的英文缩写

    数据仓库 Data Warehouse

    数据集市 Data Mart

    数据挖掘 Data Mining

    DBMS:Database Management System数据库管理系统

    DBA: Database Administrator数据库管理员

    RDBMS:Relational Database Management System关系数据库管理系统

    OLAP:(On-Line Analytical Processing)联机分析处理。OLAP是数据仓库系统的主要应用,支持复杂的分析操作,侧重决策支持,并且提供直观易懂的查询结果。

    OLTP:(On-Line Transaction Processing)联机事务处理。OLTP是传统的关系型数据库的主要应用,主要是基本的、日常的事务处理,例如银行交易。

    BI: Business Intelligence 商业智能

    KDD:knowledge discovery in databases 数据库知识发现

    2、数据分析,数据建模和数据挖掘的定义和区别

    数据分析:Analysis of data is a process of inspecting, cleansing, transforming, and modeling data with the goal of discovering useful information, suggesting conclusions, and supporting decision-making.[源于wikipedia]可以看出,数据分析强调使用统计学方法,发现有用信息,支持决策,构造建设性结论。

    数据挖掘:Data mining is the computational process of discovering patterns in large data sets involving methods at the intersection of artificial intelligence, machine learning, statistics, and database systems. It is an interdisciplinary subfield of computer science. The overall goal of the data mining process is to extract information from a data set and transform it into an understandable structure for further use.[源于wikipedia]数据挖掘与大数据关联性更加密切,利用人工智能,机器学习,统计学等知识,对于大型数据集进行分析,发现规律,预测未来,辅助决策。

    数据建模:Data modeling is a process used to define and analyze data requirements needed to support the business processes within the scope of corresponding information systems in organizations. Therefore, the process of data modeling involves professional data modelers working closely with business stakeholders, as well as potential users of the information system.[源于wikipedia]数据建模是对现实世界各类数据的抽象组织,确定数据库需管辖的范围、数据的组织形式等直至转化成现实的数据库。 建模过程中的主要活动包括:确定数据及其相关过程;定义数据;确保数据的完整性;定义操作过程;选择数据存储技术。数据建模大致分为三个阶段,概念建模阶段,逻辑建模阶段和物理建模阶段。其中概念建模和逻辑建模阶段与数据库厂商毫无关系,换言之,与MySQL,SQL Server,Oracle没有关系。

    数据分析和数据挖掘的关系:从数据量级来看,一般情况下,数据分析的数据量可能并不大,而数据挖掘的数据量极大。从建模条件来看,数据分析是从一个假设出发,需要自行建立方程或模型来与假设吻合,而数据挖掘不需要假设,可以自动建立方程。从分析对象来看,数据分析往往是针对数字化的数据,而数据挖掘能够采用不同类型的数据。从结果来看,数据分析对结果进行解释,呈现出有效信息,数据挖掘的结果不容易解释,对信息进行价值评估,着眼于预测未来,并提出决策性建议。数据挖掘与数据分析两者紧密相连,具有循环递归的关系。推荐阅读《数据分析、数据挖掘、数据统计、OLAP 之间的差异是什么?》

    3、数据库,数据仓库和数据集市的定义和区别

    数据库:数据库是指长期存储在计算机内有组织的、可共享的数据集合。数据库中的数据按一定的数据模型组织、描述和存储,具有较小的冗余度、较高的数据独立性和易扩展性,并可为各种用户共享。数据库理论的研究主要集中于关系的规范化理论、关系数据理论等。近年来,随着人工智能与数据库理论的结合及并行计算机的发展,数据库逻辑演绎和知识推理、并行算法等理论研究,以及演绎数据库系统、知识库系统和数据仓库的研制都已成为新的研究方向。

    数据仓库:数据仓库(Data Warehouse) 是一个面向主题的(SubjectOri2ented) 、集成的( Integrate ) 、相对稳定的(Non -Volatile ) 、反映历史变化( TimeVariant) 的数据集合用于支持管理决策。首先,数据仓库用于支持决策,面向分析型数据处理,其次,数据仓库是对多个异构的数据源有效集成,集成后按照主题进行了重组,并包含历史数据,而且存放在数据仓库中的数据一般不再修改。

    数据集市:为最大限度地实现灵活性,集成的数据仓库的数据应该存储在标准RDBMS(关系数据库管理系统Relational Database Management System) 中,并经过规范的数据库设计,以及为了提高性能而增加一些小结性信息和不规范设计。这种类型的数据仓库设计被称为原子数据仓库。原子数据仓库的子集,又称为数据集市。

    数据库和数据仓库的区别:数据库是面向事务的设计,数据仓库是面向主题设计的。数据库一般存储在线交易数据,数据仓库存储的一般是历史数据。从时间属性来看,数据库保存信息的时候,并不强调一定有时间信息。数据仓库则不同,出于决策的需要,数据仓库中的数据都要标明时间属性。

    数据集市和数据仓库的区别:建议阅读文章《数据仓库和数据集市的区别》

    4、商务智能与大数据的概念及发展概况

    BI(Business Intelligence)即商务智能,它是一套完整的解决方案,用来将企业中现有的数据进行有效的整合,快速准确地提供报表并提出决策依据,帮助企业做出明智的业务经营决策。

    商业智能的概念最早在1996年提出。当时将商业智能定义为一类由数据仓库(或数据集市)、查询报表、数据分析、数据挖掘、数据备份和恢复等部分组成的、以帮助企业决策为目的技术及其应用。而这些数据可能来自企业的CRM、SCM等业务系统。

    主流商业智能产品:Tableau、saiku、kylin、BDP、growingIO、神策、阿里数加等。笔者正在阅读阿里巴巴的 《大数据之路》,后续将结合阿里数加产品整理阅读心得。

    大数据(big data),指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。大数据的5V特点(IBM提出):Volume(大量)、Velocity(高速)、Variety(多样)、Value(低价值密度)、Veracity(真实性)。大数据包括结构化、半结构化和非结构化数据,非结构化数据越来越成为数据的主要部分。

    大数据的发展趋势:数据资源化,大数据与云计算深度结合,科学理论的突破,数据科学和数据联盟的成立,数据泄露泛滥,数据管理成为核心竞争力,数据质量是BI成功的关键,数据生态系统复合化程度加强。

    5、数据处理流程

    需求分析,数据采集,数据预处理,数据分析,数据挖掘,数据可视化,数据服务产品化(模板化)。

    数据产品需求分析:向业务部门进行调研,了解业务需要解决的问题,将业务问题映射成数据分析工作和任务,同时结合平台已有能力,确定数据分析或挖掘方案。

    数据采集:第一步需要定义数据源选择,DBA可以基于数据分析需要,找到相关数据,建立一张数据宽表,将数据仓库的数据引入到这张宽表当中,基于一定的逻辑关系进行汇总计算。这张宽表作为数据分析的基础,然后再依据数据分析需要衍生出一些不同的表单,为数据分析提供干净全面的数据源;

    数据预处理:需要完成数据类型选择,缺失值处理和异常值检测和处理,实现数据标准化;

    数据分析:详见下文,常见数据分析分析方法应用场景和概念;

    数据挖掘:详见下文,结合机器学习的数据挖掘概述;

    数据可视化:详见下文;

    数据服务产品化:将结合阿里巴巴产品做细致分析。

    后续笔者将梳理数据产品设计结构,从数据驱动产品设计,数据分析常用方法,数据分析工具的使用等,感兴趣的朋友可以添加关注。

  • ?

    产品经理如何进行需求采集

    xdcyxj

    展开

    产品经理的工作主要是分析用户需求,发现其背后的原因,从而创造出能够直击用户痛点的产品。但是如何知道用户需求?实际上需求分析还有一个前置步骤,就是需求采集。只有使用科学的采集方法,才能更深入的了解用户的痛点。仅仅靠着拍脑袋想出来的需求,很可能就是做出来的产品没人用,不好用。

    需求采集是什么?

    需求采集实际上就是获取/验证需求的方法。其目的就是通过深入了解分析目标用户,发现他们的痛点。随之而来的才是需求分析,需求转化等其他后置工作。

    如何进行需求分析?

    需求采集的5步:

    确定采集目的选择采集方法制定采集计划执行采集总结分析

    其常用对于用户需求采集的方法有4种:

    用户访谈调查问卷可用性测试数据分析

    下面我会按照需求采集的流程,分别说一下哥哥方法的用法和注意点。

    1. 确定采集目的

    数据采集是要有目的,没有目的的采集通常是盲目的,并且没有办法直戳要害;而且也会因为目的不明确,无法找到合适的数据,因为你不清楚哪些数据能用到,哪些数据用不到,费力不讨好。所以数据采集的第一步就是确定你数据采集的目的。比如,日历用户使用场景的访谈,文档同步可用性测试等等。

    2. 选择采集方法

    可以根据产品开发的阶段和调研目的选择不同的采集方法。

    功能规划阶段:用户访谈,确定产品方向。功能早期阶段:调查问卷,确定需求优先级。功能实施阶段:可用性测试,需求方案校验。功能上线后的优化阶段:数据分析,改进产品,优化体验。

    3. 制定采集计划

    不同的采集方式,有着不同的使用场景和容易存在的问题。

    3.1 用户访谈

    一般采用1对1,或1对多的形式,围绕几个特定的话题,我们问, 用户答,用户说,我们听。作用是研究新产品的方向,或者是因为数据分析发现了现象,探索背后原因。

    言行不一:经常能看到用户言行不一的时候。其原因有的时候用户可能是自己没有考虑,或者是为了迎合调查人员,还有可能是不想回答或者不知道答案随便答的。

    解决方案:遇到这种情况的时候,先不要着急的和用户进行争论,或者指出用户的问题,先记录下来,保持微笑和礼貌。可以侧面多找几个问题问问用户的看法,和当时操作时候的想法。注意其他用户是否存在相同的情况,推测原因。

    样本少,以偏概全:通常是因为成本有限,性价比比较低。

    解决方案:增加样本,先做假设,然后统计变化规律,如果和之前的预计假设偏差值小,就可以停止访谈了。

    偏离方向:一种是因为用户强势,容易把话题带偏了,第二种是访谈人强势,把用户带偏了。

    解决方案:牢记访谈目的,如果发生了话题偏移,尽量扳回来,如果实在不行,则尽快的结束访谈,节约时间进行下一个用户,不要再这个用户上继续花过多的时间。访谈者不能表现出强烈的引导性,主要还是让用户来表达,对于用户的反馈全盘的接受,不能因为不符合你的预期而表现出来。

    访谈目的不明确:没有明确调研目标,为了调研而调研;还有一种就是调研的方向太大,因为问题问得太大的到的反馈效果不好。

    解决方案:确立明确的调研目的,题目不要太大。

    通过用户访谈,我们一般能获得用户信息,包括个人基本信息,特征信息和用户使用产品的偏好。需求信息,包括用户为什么产生这样的需求,通常在什么场景下出现;行为信息,没有现成解决方案用户是怎么解决的?早操作的时候有遇到什么问题?让用户抓狂的点是哪里?最后分析需要解决的就是之前调研需求信息和行为信息的原因是什么。

    3.2 调查问卷

    设计问卷由用户填写,回收问卷,统计用户反馈,以量化数据的方式获取用户需求。通常在需要面对大量用户,或者需要调查的问题并不是很深入的时候选择这种方式。

    时长过长:不管线上还是线下的问卷,时常都不应该超过五分钟。

    题目顺序:调查问卷的题目顺序非常重要,开始选择一些简单不需要思考的问题,中间选择用一点思考或稍微敏感的问题,结尾则可以问一些用户个人信息的问题,这样做的好处就是能够循循渐进,避免了刚开始就要用户的个人信息,而让用户产生抵触心理对问题做出防御姿态,最后就是得到的答案不是用户真实的反馈。

    准确性不够:指的是调查问卷的数据并不能符合真实的情况,原因通常是因为样本过少和题目本身具有引导性。

    解决方案:调查的时候要覆盖目标群体的各类型用户,还有一点就是其调查人群的比例也要尽可能符合真实用户的类型比例。样本过少,没别的办法,就是增加样本。题目引导,则需要对题目本身制定的时候多思考,更改一下题目的顺序,多做几个版本的题目,先在小范围做试答,进行反馈修改后再正式的投入市场。

    3.3 可用性测试

    邀请用户实际使用产品,在用户使用产品的过程中观察用户遇到的问题,从实际使用情况来分析产品体验和用户需求。可用性测试可以提前发现产品设计的问题,优化用户体验,而且有可能在测试的过程中还能发现新的需求。

    晚做不如早做:如果功能已经上线,在做可用性测试,如果原来存在的问题实际上就已经影响到用户了,这就太晚了。

    觉得专业,太过复杂,就不做了:实际上,很多企业都认为可用性测试比较复杂,而且其结果是没办法预估,性价比低,所以通常是有功夫再做,没工夫就不做了。其实是可以根据情况来定,简化步骤,可用性测试能够得到很多数据发现不了的问题,不管结果有多差,怎么都比不做要好。

    测试产品,而不是测试用户:用户来测试之前,明确告知用户测试的目的是发现软件问题,即使用户在使用过程中完不成任务,也是产品的问题,不是用户的问题。

    招募用户:招募的用户尽可能就是以后产品的目标用户,这样的出来的反馈才是最真实有效。

    测试:提前准备测试任务,主要测试产品的核心需求相关功能。测试前要提前告知用户目的,大概的时间和测试任务,让用户心理有数。如果有条件最好是在取得用户同意的情况下进行录像记录过程。

    3.4 数据分析

    通过统计用户日志文件或实际使用数据,采集和分析用户需求。特点是数据来自于真实的用户,是可以控制的,避免了只听用户说的误导,真实的看到了用户的是如何做的。能够验证之前的预想是否正确,起到校正用户和用户需求的作用。

    过于学术,沉迷“科学研究”:数据分析要考虑成本,特别是初创企业,不能每一步都进行数据分析,这样会导致效率比较低。而且数据只能看到现象,但背后的原因还是需要自己去寻找。

    数据不会骗人,但容易误读:人是习惯性的先有了猜想,然后去找数据证明它。这样做很容就变成为了证明自己是对的,出现误读的情况。

    解决方案:保持中立,学习科学家精神,不要为了迎合某一观点,针对观点来找数据。

    提前布局:不要等着想要数据分析的时候在去找数据,而是要提前埋点,这样才能有数据来分析。

    4. 执行采集

    采集的过程中有以下注意点。

    提前向用户说明来意:测试之前提前和用户打好招呼,说明测试的目的,大概花费的时间。让用户放松,征求用户的意见:不要过于严肃,同时调查人员可以选择去用户熟悉的场景来进行测试,让用户保持放松的状态,尽量还原平时用户平时使用产品的场景,如果有录像,一定要提前征求用户的意见。避免引导性的举动:题目和采集过程的接触中尽量不要有引导性的举动,这样可能会造成用户的答案是你想要的答案,而不是用户真实的答案。保持感谢:用户花时间来配合采集,一方面是用户处于对你的相信,还有一点是对于产品的喜爱。所以一定要保持感谢,预算充足的情况下可以准备一些小礼品送给用户。最后的结果如果没有什么特别需要保密的,也可以给用户发一份,并附上感谢,让用户感受到他也在产品里有自己的一份付出。

    5. 整理资料

    采集完了,一定要将资料进行整理规划分析,要不然采集做了等于白做。之前提到过不能光听用户说,要观察用户。有的人就会问,那么我只要看用户怎么做不就好了。为什么还要听用户说呢?其实听用户说和看用户做都非常重要,只看用户如何做,只能看出现象,只有两者结合才能知道背后的原因。

    而且言行不一,也可能是某种功能需求的表现,比如某些隐私对应着选择性展示的功能,就是产品经理发现了用户一些不想说的原因,做了可选择性展示的功能。如果只看用户如何做就没办法做到这么的深入人心。让你的产品通人性,两者缺一不可。

    这里具体的整理方式和方法,打算放在需求分析里面详细说明。

    需求采集有什么好处呢?

    说了这么多,可能觉得步骤非常多,而且很麻烦,但是做需求采集有什么好处呢?最直接的好处就是需求采集能够加深产品经理对目标用户的了解。好的产品经理应该抓住一切机会与目标用户进行接触,你只有接触了才能可能发现一些你坐办公室根本想不到的问题。毕竟一个人的大脑能预想到的情况有限,只有接触了各种各样的用户,你才能发现用户的痛点,然后在今后的工作中去更好地解决他们的问题。

    还有一点好处,通过需求采集,你能发现现有产品的问题,只有通过这些采集手段,把产品存在的问题暴露出来。产品有错误不是大问题,最大的问题就是不知道产品有问题,而产品的问题就是产品的方向标,它能为我们展示产品的优化方向。

    这里说的这个4个采集方法都是面对用户常用的方法,还有其他的一些需求采集的方法,比如说Bug转需求,头脑风暴,需求卡片,竞品分析等等。我会在之后的内容进行整理,有需要的可以私信留言,按照需求的人数我会适当的提前整理。

  • ?

    升级万亿机械加工产业,「智能云科」要做机加工领域的工业互联网平台

    秦飞双

    展开

    2017年中国机加工市场规模达8万亿元,其中1000家的机床生产企业,80万家机床使用企业。庞大的机加工市场同时存在着很大痛点,高端控制系统被国外垄断、客户分散、订单不稳定、设备闲置率高、同质化竞争利润低、人力成本高等,国内的加工制造业已经在外流,行业急需升级。

    智能云科是一家聚焦机加工领域的工业互联网平台公司,由沈阳机床联合神州控股、光大金控于2015年在上海共同投资设立。

    工业互联网平台有很多家在做,可以从以下几个关键维度去快速理解智能云科在做的事情。

    行业方面,智能云科聚焦在机加工领域。服务对象,核心是上游机床厂商、下游加工厂。服务内容,从设备、生产数据联网,到产能交易、设备运维、租赁、供应链金融、工业APP等产业全生命周期服务。

    有了框架,下面来具体看看,智能云科的iSESOL工业互联网平台是怎么做的,如何产生价值。

    可以把智能云科的服务粗略分为两个大类:数据采集联网、数据应用。

    数据采集联网:不止是采集,还能直接产生客户价值

    朱志浩曾带领团队历时7年,于2014年推出了自主研发的机床控制系统i5,并于同年开始销售搭载i5系统的i5智能机床。

    “这件事情的意义,类似于将传统手机升级为智能手机,智能机床通过i5系统,可以快速开发上层应用,从而将宝贵的工业机理、经验持续沉淀下来”朱志浩告诉36氪。

    此前,机床厂商做的是一次性买卖生意,现在通过智能机床,能持续提供增值服务,例如零部件的故障预测,帮助客户及时更换,避免生产故障。这样,设备厂商能够从设备使用全周期的角度做这门生意,提高附加值,促使不断提高产品、服务质量,产生良性循环。

    更进一步,朱志浩希望能把此项能力开放给市面上更多设备制造厂商。2017年,团队将i5机床控制系统进行独立封装,推出i5OS。可以将i5理解成苹果手机专属的iOS系统,而i5OS则是面向所有设备厂商的Android系统。

    智能云科的数据采集联网业务,对于i5智能机床,或者搭载i5OS的设备,可以通过标准接口协议快速获取丰富的加工数据,对于其他机床,智能云科提供iSESOL BOX产品,进行数据采集和联网。

    与市面大多数据采集联网设备不同,iSESOL BOX自带操作系统和边缘计算能力,可以直接支持APP应用,如耗电优化、刀具切削优化、温度补偿等。客户付出了连接成本,可以直接获得相应价值,不是为了连接而连接,从而增强客户买单动力。

    以上说的是设备层面的数据采集和联网问题,而对于设备的使用方加工厂,智能云科提供iSESOL WIS产品帮助中小微加工厂完成企业信息化。

    iSESOL WIS可以理解为轻量化的云MES系统,甚至不需要接入数据采集硬件,直接通过移动设备录入信息方式,将生产过程和结果信息化、可视化。

    “工厂老板最关心的是生产情况如何,哪些订单要交货,已经完成了多少,是否有风险。WIS系统不做很复杂的东西,就聚焦在客户最核心的痛点,让他们用得起。”朱志浩告诉36氪。

    总结来看,智能云科通过i5 OS、iSESOL BOX、iSESOL WIS产品,将设备和生产数据采集联网,并在连接的同时,直接产生了客户价值。

    产业生态应用:基于真实数据,提供精准服务

    有了数据,联了网,这只是开始。

    智能云科提供了工业APP、产能交易、设备运维、租赁、供应链金融等一系列产业生态应用服务。

    工业APP今年很火热,在朱志浩看来,工业互联网平台单纯的汇聚APP没有意义,一定要有承载体。对智能云科来说,承载体就是i5 OS和iSESOL BOX产品,能够与底层制造装备紧密对接,向上为APP提供开发平台。设备商、工厂、研究机构,都可以将自己对于工业机理的理解,以APP的方式沉淀下来,借助平台轻量化、低成本的推广到机加工行业,获取回报。

    基于工厂真实透明的生产数据,可以形成较精准的工厂画像,包括每家工厂擅长加工哪些东西,产能情况,需要哪些工业品,经营状况等。智能云科可以更精准的对接订单加工方和需求方,对接工业品的供应方和购买方,对接金融机构和中小微加工厂等。

    对于设备厂商来说,基于设备数据,可以进行远程运维、分时租赁等服务,降本增效,创新商业模式。

    行业落地和挑战

    智能云科的整套服务覆盖面很广,要怎么逐步实现呢?

    朱志浩告诉36氪,智能云科从2015年成立,先用了3年时间,把核心产品和整套商业模式架构搭建起来,并通过i5数控机床进行了内部试验验证。当前阶段以及2019年要重点实现社会化落地,先以iSESOL BOX和iSESOL WIS为核心业务,把数据问题解决,再不断延伸产业生态服务。

    官方信息显示,截至2018年11月,iSESOL服务范围已涵盖26省、161市,服务企业客户3000余家,已连接智能设备22000多台,累计服务机时5000多千时,覆盖汽车刹车盘、铝雕、消费电子、珠宝等行业。

    36氪还了解到,智能云科目前正在准备A轮融资,总金额在亿元以上。

    目前,国内已有数十家工业互联网平台公司,包括树根互联、徐工信息、海尔、富士康、智能云科等工业背景公司,浪潮、运营商等ICT巨头,阿里等互联网巨头,用友等IT公司,以及众多科技创业公司等。

    智能云科的特点是基于深厚的机加工装备背景,聚焦机加工垂直领域。相比于通用平台,能从机床内部机理入手,更深入的挖掘数据价值。同时具备机加工行业较广泛的客户基础、市场基础(已销售3万台i5智能机床)。

    当然,智能云科也面临着很多挑战,包括其i5 OS以及iSESOL BOX能多快多广的覆盖到行业客户,实现工业互联网平台的构建。以及其他设备厂商的接受意愿,是否有竞争顾虑,是否能接受智能机床的新模式等。

    ——————

    我是36氪记者陈绍元,关注物联网、AI、科技,交流或寻求报道(不收费)加微信:963757163,请注明公司、职位、姓名,否则不加。

  • ?

    浅谈工业生产现场数据采集

    应百招

    展开

    工业生产现场数据采集原则有两点:一是目的性,二是经济性;

    目的性是指在做设备的数据采集之前,先要明确所要采集的数据是否具有可观的价值。工业现场其实已经有很多的数据采集系统了,SCADA、HMI什么的也都是应用很广泛了,但是,其中又有多少数据被充分的分析,挖掘其潜在的价值的呢?

    大部分情况是,采集了数据后并不知道怎么去利用。国内大部分的工业现场还处在解决生产过程可见性的阶段,能够先把数据采集上来是当务之急,至少能够实时地了解到现场都发生了什么。在智能制造背景下,要将目光放长远,在做数据采集之前,尽可能地多去思考一下什么样的数据对我们的业务改进帮助最大,这样也许会让我们在数据采集方面的投资回报率更好看一些。

    经济性是指投资的回报效益。对于工业现场的数据采集,很多人第一个想法就是装传感器。不管什么样的项目,我们首先需要考虑的是投资回报率的问题,装传感器的方式可能是投资最大的一种。因此,做设备层的数据采集,一定要结合我们的数采目标,充分利用设备的现有条件(比如,设备已经具备的上位机系统、已经具备的通讯协议等)用最经济高效的方式来做数采技术路线的设计。

    工业数据采集设备分类:有上位机系统的设备(设备自带的监控系统)、基于非TCP/IP通讯协议的设备、基于TCP/IP通讯协议的设备、不具备通讯接口的设备。

    自动化系统设备数据采集系统采集方法主要是通过Web系统、生产线工作站系统、OPC服务器等配置对生产线上的各个设备的生产数据进行监控。同时将有效数据采集仓储在数据库中。这对整个生产系统进行生产线、工序参数、工作流程、设备参数、设备类型、OPC服务、通讯协议的全方位设置、管理。

    如需增加设备,只要在中心管理系统增加相应的设备类型,配置好相关的采集参数即可,可有效节约成本;生产过程中通过缓存交互数据,不直接和数据库交互,极大的提高了数据采集的性能;通过心跳检测程序,实时反馈生产设备的异常,保证生产数据完整性。

    一种自动化生产线设备数据采集方法,可以是如下步骤:

    1.根据自动化生产线上各种设备的不同协议类型,将支持OPC相关协议的设备与OPC连接;将支持TCP开放协议的设备与生产线工作站系统中的网口交换机连接;将支持COM开放协议的设备与生产线工作站系统中的串口交换机连接;

    2.通过Web系统配置生产线的全局属性;

    3.生产线工作站系统启动时从Web系统中同步本生产线所有相关配置,并存入缓存;

    4.生产线工作站初始化时,根据设备在Web系统的协议类型,连接每个设备,并启用OPC监听、TCP监听或COM监听。对于“基于TCP/IP通讯协议”,比较常用的有OPC Classic、Siemens S7、Modbus-TCP等通用协议,也有设备厂商自行定义的私有协议。这些协议的特点是都是基于TCP/IP协议簇,只是应用层协议不同。采用这些协议的设备一般都会有RJ45的接口,也就是以太网口,都可以直接通过以太网接入到车间网络中。对这些设备的数据采集,我们需要做的就是对上述协议的解析。对于OPC等通用协议,已经有很多成熟的SCADA产品可以利用,近些年,也有很多开源框架、商业化的组件可以应用,比如Eclipse neoSCADA,Kepware等等,都能够在完成上述协议的解析的同时,将其转换为一些IT领域常用的接口(RESTful API),方便其他信息系统的对接。

    5、将监听到的每个设备数据写入工作站数据库。

    设备数据分析,可以通过多种查询工具可以快速查询生产实时数据、相关历史数据。给管理人员重要决策提供有效数据基础。可以对数据进行横向比较,可以对历史数据进行分析。通过系统统计分析没太机器的运转率,故障时间累计以及车间设备总体利用率。系统可以提供柱状图、饼图、报表等分析工具,展现现场设备运转统计分析数据。自动统计每天限的产量数据,可以按照不同的班组、时间段等多种条件进行综合查询。

    同时对于设备的故障管理也可以进行相关数据记录,比如不同的设备及其台号,故障类型、时间段等多种条件进行历史查询赛选。这样可以进行历史数据查询,更好的帮助技术人员进行设备故障原因分分析,提高问题解决效率。

  • ?

    数据采集过程中的常见问题

    占樱

    展开

    经过两周的整理总结,沉淀出来好多数据采集的经验与大家分享。

    前嗅免费模板共享链接:http://forenose/help/collection/template/cases.html

    1.如何进行数据采集?

    ①下载安装软件后,登录到软件上。

    ②准备好模板:在前嗅的官网上下载免费的模板或自己配置好的模板

    ③将下载的官网导入到软件中。

    点击文件---点击导入采集文件(将采集文件导入,自己配置的模板请忽略这一步)

    ④在数据建表中建关联数据表

    选中需要采集模板下的表单---点击创建关联数据表,所创表名不能为汉字,点击确定---在所创数据表前的方框打勾即可关联数据表。详情见下图。

    此时在数据浏览中就存在了刚刚建的关联数据表。

    ⑤进行数据采集。

    在需要进行数据采集的模板前打勾--点击允许采集--点击开始按钮即可进行数据采集。详情见下图。

    ⑥数据预览及导出

    选中关联表---点击刷新按钮即可查看数据---点击导出按钮即可导出数据。详情见下图。

    多种导出方式:

    a.可以将采集到的数据全部导出。

    b.可以将数据分割导出,设置特定数目后数据会分别储存放在文件夹中。

    c.可以将每个字段所采集到的内容分别导出到不同文件夹,方便查看。

    数据导出教程:

    http://forenose/help/guildbook/crawler_new/5-2.html

    2.所采集的网站弹验证码是怎么回事?

    弹验证码分为四种情况:

    ①登录需要验证码:登录时只需要一个验证码,所以直接手动填写配置即可。

    ②多账号登录:每次账号登录都需要验证码,此时应该接第三方打码平台。

    前嗅(forenose)是首个深度大数据专家。

    提供数据采集-分析-处理-管理-营销-应用,自主知识产权的全套大数据产品 。

  • ?

    制造业生产数据采集的作用与意义

    小哨兵

    展开

    制造业生产数据采集的作用与意义导读:制造业是我国国民经济的支柱产业,也是推动工业化的原动力,现代制造业已经并且正在深刻地改变着人们的生产方式、生活方式甚至社会文化。全球经济一体化的趋势愈演愈烈,国际竞争不断加剧,制造业的发展必须不断提高在质量保障、品种多样化、快速设计制造、快速检测响应以及快速重组等方面的要求。于是,“以信息化带动工业化,以工业化促进信息化”被提到了前所未有的高度、深度和广度。

    制造业生产数据采集的作用与意义

    众所周知,制造业的信息化主要包括设计数字化、生产数字化、装备数字化、管理数字化、企业数字化等。信息化的大趋势使世界各国争先恐后的把先进技术和信息化引进到传统工业和制造业。1990 年,美国 AMR(Advanced Manufacturing Research)所提出的制造行业的ERP(Enterprise Resources Planning,企业资源规划)/MES(Manufacturing Execution System,制造执行系统)/PCS(Process Control System,过程控制系统)三层结构,已经成功地在许多行业得到了应用,并被越来越多的企业所认可.

    美国 AMR 研究公司对MES 的定义表述为:MES 是一个常驻工厂层的信息系统,介于企业领导层的计划系统与生产过程的直接工业控制系统之间,它以当前视角向操作人员、管理人员提供生产过程的全部资源(人、设备、材料、工具和客户要求)的数据和信息,其着重点是将信息技术运用于改善制造过程。

    而作为MES中低层的数据采集功能,可以实现对生产现场各种数据的收集、整理工作,是进行物料跟踪、生产计划、产品历史记录维护以及其它生产管理的基础。它可以为企业中其他例如ERP等管理信息系统提供实时数据。另一方面,MES也要从其它管理系统中获取相关的数据以保证MES自身正常运行。因此要满足MES快速、实时的要求,作为各种功能模块运行基础的数据就显得十分重要。一个迅速而可靠的数据采集系统是整个MES能够正常稳定工作的有力保证。

    制造企业面临的数据采集现状

    作为车间底层的数据采集系统,在企业实际生产过程中却存在着许多困难,尤其是在离散企业中由于自动化程度较低,往往存在着以下特点:

    生产过程不可视:主要体现在不能实时了解生产现场中在制品、人员、设备、物料等制造资源和加工任务状态的动态变化。

    生产过程复杂性:由于产品结构和加工工艺的复杂性,造成生产过程中各制造过程的关联性强,生产环境复杂多变(临时插单、材料短缺等) 。

    制造过程信息集成度低:制造过程中的各种信息不能有效进行集成,导致产能不能得到充分利用。

    信息不能有效与上层管理系统进行集成:这种隔断造成生产过程不透明,生产进度、在制品状况、设备利用状况等关键数据不能到达管理层,增加了过程管理和生产决策的复杂性。

    制造过程信息的真实性差:现场数据信息过多依赖人机交互界面通过人工录入,增加了出错的机率。

    制造过程信息的实时性低:作业任务随市场需求的频繁调整变化,不利于制造过程信息的实时采集,再加上制造过程信息交互的速度和效率低下,造成企业对市场变化的响应速度慢。

    企业设计层和管理层到车间层特别是车间设备层的信息采集困难,一方面车间设备层的重要信息难于采集和上传,无法达到对生产过程的监控。另一方面上层系统难以深入到车间和设备层,从而影响管理信息系统的准确运行,使动态信息成为脱离实际的无源之水难于及时下达,从而使整个企业信息化难以产生更大的效益。

    上述特点反映了制造车间迫切需要对制造过程进行信息化的数据采集管理,从而建立一个完整高效的离散制造车间数据采集及其分析处理系统是实现离散车间信息化的基础。数据采集及其分析处理系统的主要功能就是将车间的各种离散数据完整实时的采集到车间数据库中,并进行初步的分析处理,将车间生产的信息实时准确的反馈到车间的管理层,加强管理人员对车间生产现场的监控和管理,并为企业管理人员制定生产计划提供依据。

    华磊迅拓科技专业提供SCADA数据采集监控系统,OrBit-SCADA(Supervisory Control And Data Acquisition)系统是"制造业物联网信息总线"的具体实现,它包含两个层次的含义:一是分步式的实时数据采集系统,即工业通讯与控制的PC上位机系统 ;另一个是生产现场的场景建模和显示系统。

  • ?

    浅析工业数据采集产业发展现状

    卡米尔

    展开

    (一) 工业数据采集产业综述

    1. 市场规模潜力巨大:

    中国作为世界第一制造大国,随着工业互联网市场的不断发展和完善,企业对工业数据采集的实时性、可靠性和专业解决方案需求日益增强,中国工业数据采集市场呈现巨大潜力,相关软硬件和服务提供商迎来了良好的发展机遇。

    2. 市场各方积极参与

    从消化政策、推出工业数据采集解决方案,到发布工业互联网平台,各市场参与方努力寻求业务转型,外资企业和本土企业均在积极部署工业数据采集产品体系和解决方案,谋划市11场布局。

    3. 技术产品和解决方案持续推进与完善

    当前,工业数据采集技术产品和解决方案仍处于发展阶段,但已有部分厂商推出了一些多样化的解决方案,比如通过构建兼容转换协议的技术产品体系,实现工业数据互联互通;或是通过部署边缘计算模块,实现数据在机器设备端的轻量级运算和实时分析。

    点击上方“关注”,共同学习工业互联网相关知识!

    (二) 工业数据采集产业规模和预测

    整体市场情况2017 年,中国工业数据采集产业市场规模达到 570 亿元,同比增长 16.3%。预计未来 2-3 年,中国工业数据采集市场将保持稳定增长趋势。

    图:2015-2020 年中国工业数据采集市场规模

    2. 细分产品市场情况

    图:2017 年中国工业数据采集细分产品市场规模

    备注 1:传感器包括光电传感器、接近传感器、视觉传感器、位移传感器、速度传感器、加速度传感器等。读码设备包括条码设备、射频识别等。工业通讯模块包含工业串口卡、总线卡、串口服务器、工业电源、以太网模块等。

    3. 细分行业市场情况

    图:2017 年中国工业数据采集细分行业市场规模

    点击上方“关注”,共同学习工业互联网相关知识!

    (三) 工业数据采集存在的主要问题

    当前工业数据采集面临的突出问题可以总结为“三不”:不敢传(数据安全问题)、不能传(协议标准不统一)、不需传(本地化和实时性问题),无法支撑实时数据采集和实时分析、智能优化和科学决策。

    (1) 工业数据采集存在数据安全隐患

    工业数据采集会涉及到大量重要工业数据和用户隐私信息,在传输和存储时都会存在一定的数据安全隐患,也存在黑客窃取数据、攻击企业生产系统的风险。急需从技术、管理和法律法规等多方面保障数据安全。

    (2) 工业协议标准不统一且数据开放性不够

    目前在工业数据采集领域,存在 Profibus、Modbus、CAN、LonWorks、HART、Profinet、EthernetIP 等多种工业协议标准,各个自动化设备生产及集成商还会自己开发各种私有的工业协议,各种协议标准不统一、互不兼容;同时很多设备和系统的数据开放性不够,缺乏数据开放接口及文档说明。导致协议适配、协议解析和数据互联互通困难。

    (3) 工业数据采集实时性要求难以保证

    生产线的高速运转,精密生产和运动控制等场景则对数据采集的实时性要求不断提高,传统数据采集技术对于高精度、低时延的工业场景难以保证重要的信息实时采集和上传,无法满足生产过程的实时监控需求。

    (四) 我国工业数据采集产业格局

    当前,工业数据采集发展越来越快,工业互联网的跑道越来越宽,工业自动化企业、网络通信企业、信息技术企业身影已纷纷出现。就当前情况而言,工业自动化企业具备先天竞争优势,起步和前期推广相对容易,可以在原有系统客户上深度耕耘。信息技术企业和网络通信企业在技术架构的高度上更有比较优势,战略构想和规划能力更为突出。

    目前,工业数据采集产业供应侧主要有以下三类企业:

    一是工业自动化企业,从自身核心产品能力出发,主要为工业数据采集提供接入设备,作为工业数据采集的源头,例如15西门子、研华、霍尼韦尔、安控等;

    二是工业网络服务企业,主要为工业数据采集提供工业网络协议转换、传输、安全等配套设备和服务,部分企业从原有优势领域正在积极向制造业领域延伸发展,例如中国电信、中兴通讯、华为等;

    三是工业数据采集解决方案企业,主要提供工业数据采集解决方案、系统开发、项目实施、系统集成等服务,例如北自所、和利时、明匠智能等。

    已阅读完毕,点击上方“关注”,共同学习工业互联网相关知识!

  • ?

    国内五大主流网站内容抓取工具、采集软件大盘点

    ES

    展开

    大数据技术用了多年时间进行演化,才从一种看起来很炫酷的新技术变成了企业在生产经营中实际部署的服务。其中,数据采集产品迎来了广阔的市场前景,无论国内外,市面上都出现了许多技术不一、良莠不齐的采集软件。

    今天,我们将对比国内五大主流采集软件优缺点,帮助你选择最适合的爬虫,体验数据hunting带来的快感。

    国内篇

    1.火车头

    作为采集界的老前辈,我们火车头是一款互联网数据抓取、处理、分析,挖掘软件,可以抓取网页上散乱分布的数据信息,并通过一系列的分析处理,准确挖掘出所需数据。它的用户定位主要是拥有一定代码基础的人群,适合编程老手。

    采集功能完善,不限网页与内容,任意文件格式都可下载具有智能多识别系统以及可选的验证方式保护安全支持PHP和C#插件扩展,方便修改处理数据具有同义,近义词替换、参数替换,伪原创必备技能Conclusion:火车头适用于编程能手,规则编写容易,软件的定位比较专业而且精准化。

    2.八爪鱼

    一款可视化免编程的网页采集软件,可以从不同网站中快速提取规范化数据,帮助用户实现数据的自动化采集、编辑以及规范化,降低工作成本。云采集是它的一大特色,相比其他采集软件,云采集能够做到更加精准、高效和大规模。

    自定义采集过程中,八爪鱼采集器系统自写的Xpath、自动生成的流程,可能无法满足数据采集需求。对数据质量要求高,则需自写Xpath,调成流程图等,以优化规则。

    使用自定义采集的同学,虽然八爪鱼操作简单,比较容易上手。但是,仍需对八爪鱼采集原理有所了解,看完相关教程,循序渐进,成长周期较长。

    可视化操作,无需编写代码,制作规则采集,适用于零编程基础的用户云采集是其主要功能,支持关机采集,并实现自动定时采集

    Conclusion:八爪鱼是一款适合小白用户尝试的采集软件,云功能强大,当然爬虫老手也能开拓它的高级功能。

    3.集搜客

    一款简单易用的网页信息抓取软件,能够抓取网页文字、图表、超链接等多种网页元素。同样可通过简单可视化流程进行采集,服务于任何对数据有采集需求的人群。

    可视化流程操作,与八爪鱼不同,集搜客的流程重在定义所抓取的数据和爬虫路线,八爪鱼的规则流程十分明确,由用户决定软件的每一步操作

    支持抓取在指数图表上悬浮显示的数据,还可以抓取手机网站上的数据

    会员可以互助抓取,提升采集效率,同时还有模板资源可以套用

    Conclusion:集搜客操作较简单,适用于初级用户,功能方面没有太大的特色,后续付费要求比较多。

    4.神箭手云爬虫

    一款新颖的云端在线智能爬虫/采集器,基于神箭手分布式云爬虫框架,帮助用户快速获取大量规范化的网页数据。

    直接接入代理IP,避免IP封锁

    自动登录验证码识别,网站自动完成验证码输入

    可在线生成图标,采集结果以丰富表格化形式展现本地化隐私保护,云端采集,可隐藏用户IP

    Conclusion: 神箭手类似一个爬虫系统框架,具体采集还需用户自写爬虫,需要代码基础。

    5.狂人采集器

    一套专业的网站内容采集软件,支持各类论坛的帖子和回复采集,网站和博客文章内容抓取,分论坛采集器、CMS采集器和博客采集器三类。

    支持对文章内容中的文字、链接批量替换和过滤可以同时向网站或论坛的多个版块一起批量发文具备采集或发帖任务完成后自动关机功能

    Conclusion: 专注论坛、博客文本内容的抓取,对于全网数据的采集通用性不高。

    注:给火车采集器的新手们一点学习建议

    火车采集器是一个非常专业的数据抓取和数据处理软件,对软件使用者有较高的技术要求, 使用者要有基本的HTML基础,能看得懂网页源码,网页结构。

    同时如果用到web发布或数据库发布,则对自己文章系统及数据存储结构要非常了解。

  • ?

    数据产品经理必修课(66):大数据研发之采集技术

    闵问丝

    展开

    既然产品、研发与运营是互联网的三板斧,那么就不得不说说大数据时代的研发。我一直在困惑,究竟应该如何向广大的产品经理同学们讲清楚什么是大数据的研发。说详细了,必然使其困惑,而且我也不一定都能够明了其中的细节;说的粗略了,产品经理同学又会觉得不痛不痒,毫无感觉与世纪效果。再加上,本身打数据的研发就包罗万象,即便是单独成书则废寝忘食不能成也。除此之外,大数据门派众多,云计算、虚拟化、微服务都算是与大数据紧密相关的,那到底什么该讲什么不该讲呢?

    我制定了大致这样的规则,我们想和各位产品经理同学讲一讲大数据的代表性工作,Hadoop平台以及围绕该平台大致需要做的一些事情,我们并不会具体到一种语言,也不会具体到某种技术,而是从宏观的视角,把产品经理在数据上扎的根生出的藤蔓深向原本只有工程师们才能够触及的墙角与远方,并在每一处需要精心雕琢与深究的地方稍加缠绕,略微展开谈一谈这些宏观过程其中的内部机理。还记得我们在第二部分介绍数据挖掘相关技能的时候,我们使用了CRISP-DM的流程来介绍数据挖掘与数据分析的标准化步骤。如果那个时候的介绍看成是逻辑层面的流程的话,我们这里想要沿着物理层面的主线来向数据产品经理同学们展现什么是打数据的研发。具体来说,我们会按照数据采集、数据存储、数据计算以及数据分析这样四个步骤去介绍这些过程在工程师的手中,在他们心爱的服务器上都发生了什么。

    让我们还是先来看看数据采集吧。

    现如今,相信很多人手上的手机已经变成了全屏幕的触屏手机,而如果时光回到十年前,你拿起那个屏幕尺寸更小,手机功能更少的键盘机的话,不知会作何感想。那个时候的手机对于我们来说,只有三个意义:电话、短信、小游戏。如果你的手机可以播放视频,那一定是诺基亚与摩托罗拉的高端机型了。在那个时候,我们通过移动电话设备产生的数据无非也就是通话与短信数据,这些数据存储在三大运营商,他们知道我们在什么时间给谁发短信或者打电话,如果他们乐意,甚至还可以知道我们发了什么,说了什么。那个时候的数据采集量小到可怜,而且大多数还握在运营商手中。

    随着屏幕尺寸的扩大,安卓与iOS的入局,整个手机生态被打破,人们还是习惯于看大屏幕的收集,习惯使用一根手指去戳屏幕,习惯于在自己的电子设备上装上各色花花绿绿的应用,以至于在各种公共场合人们低头猛戳手机,甚至还收获了一个专有的名词叫做“低头族”。这个时候,出现了微信、微博,人们开始习惯使用微信给好友递送消息,而不再使用短信。这样的现象也改造着运营商的业务,以前每个月最需要在意的是套餐中包含多少条短信,而现如今则是每个月的套餐中的流量有多少。尽管运营商还是掌握着我们海量的数据,但是能够收集数据的人再也不止那三家运营商了。手机的生产者需要为手机在出厂的时候生产操作系统,因而他们成为了天然的数据收集方,原则上他们可以了解到你在手机里做的一切,就好比在一个封闭的屋子里装上了一个闭路电视,这个屋子就是该厂商生产的手机,你可以不进去,但是一旦你进去,所有的行为将被监控与知晓,至于这个闭路电视的监控视频内容何时被何人查看则取决于布下该系统的人的意愿罢了。除了这个房屋的建造者,还有很多的家居提供商也具备监控行为的能力,这些家居的提供商就是手机里花红叶绿的各色APP,原则上,只要你使用这样的家居产品,你在使用该产品的行为就会被记录,如果这样的家居公司与房屋的建造公司关系不错,除了能够收集自家家居产品的使用数据之外,还能顺便了解到但凡有本家公司家居产品的屋子里都还有哪些家居产品,甚至连用户是如何使用其他家居产品都是知道的。这样,数据进一步被积累,除了以前的运营商(地皮所有者)之外,手机操作系统厂商(房屋建造者)与手机内应用开发者(家居厂商)都是数据的拥有者。

    原本数据只是一口池塘,池塘中仅有的几条大鱼已经翻不过来身了,而现如今风云突变,池塘变成了湖泊,不仅这几条大鱼能够鱼翔浅底,而且随着湖泊生态的演变,鱼群变得越来越密集,每条鱼都可以自由的吮吸着湖泊中的融氧,变强,变大。就在此时此刻,湖泊的平面再一次的上升,而鱼群们则更加跃跃欲试,这个湖就是我们现在知道的大数据。

    抒情了这么久,只说了数据采集的一半,即可以采集哪些数据。当然,上面是以采集收集的数据为例来进行的说明的,而传统的网页也无非大同小异。可是这些数据究竟是怎么被厂商们采集回去的呢?也就是说到底采集的方法有哪些呢?

    我们大致可以将数据的采集分为两类,一类谓之传送带式,一类谓之土方车式。且听我细细为你道来。

    对于传送带方式的数据采集来说,实际上实在采集的前沿阵地和数据存储的大后方建立了一个传送带,一旦有星星点点的数据被采集回来就会被立即送上传送带,经过一段距离的传输就会被递送到存储的地方存储起来或者是被计算。就好像是在很多煤矿或者石料企业的现场看到一条长长的传送带,前方的挖煤机或者是采石机但凡能够搅下半点原料,这些原料就会被立刻送上传送带,送到后方。尽管在实际的场景中,这些传送带的后方有可能也是一些仓库,但不妨把这些仓库看成是在数据采集档口上的第一道存储服务器罢了。在这样的情况下,运送土方或者数据的通道是一直建立的,存储土方和数据的仓库也是时时刻刻在接受的,只要采集数据的过程不停止,那么运行这个传送带的机器与看守仓库的人就不可以停止与下班,因而在这样的实时数据采集过程中,人的注意力不可以离开,需要一直专注于整个流程,我们称他们是长连接,就好比是人的思想之弦一直紧绷,一刻不松懈的关注者另一端很长时间。与这样方式类似的数据处理形式称之为数据流处理,而打电话就是一种典型的数据流处理形式,在整个打电话的过程中,听话人需要一直关注对方在说什么,甚至需要通过听辨声音来判断通话是否还存在于线上或是已经挂断。

    对于土方车式的数据采集来说,往往是挖掘机把挖掘到的土(数据)放到土方车上,但是这些土方车不会因为有了一抔土就立刻送走离开,而是等车装满后再听从现场指挥的命令按照次序离开并送到指定的地点,这样的方式因为是需要将数据积累到一定的量,因而是一种相较前一种数据采集的方式更加随意的方式,它的随意就体现在数据并不要求实时,而是一段时间发送一次。于是乎,在挖掘机工作的时候,土方车的驾驶员(传送人)与仓库的保管员(存储人)可以稍加休息或是处理其他事情。这种数据采集的模式称之为短链接,顾名思义,人们的神经并不需要死死地盯住一个事情,而是仅仅需要在需要处理的时候响应它,在处理完了之后转而去做别的事情或者处理别人的请求即可。目前大多数的APP内的数据采集使用的就是这样的短链接模式,先将数据积累在本地,然后再一段时间把这些数据递送一次。除此之外,当你访问网页的时候,也是这样的短链接模式,你送给服务器一个URL,告诉他你想要这个网址的内容,服务器找到之后发送给你,但是它并不关心你是否能够收到,只要它一旦发出就去处理别的事情了,除非你再次请求他,否则它也不会再来理你。

    这就是你所应该知道的数据采集过程。

数据采集产品

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP