中企动力 > 商学院 > 产品数据采集
  • ?

    超实用:通过Excel进行数据采集

    雅寒

    展开

    前言

    IBM大中华区总经理胡世忠曾说:数据构成了智慧地球的三大元素——智能化、互联化和物联化,而这三大元素又改变了数据来源、传送方式和利用方式,带来“大数据”这场信息社会的变革。

    从上可见,时代的变革是源于对数据的利用,对企业而言,数据也同样是其发展、转型的命脉。在工作中,我的前辈不止一次地强调,数据是公司的资产,而且举足轻重。我们对待数据,一定要严谨,经得起考验,对自己的数据负责,这是一个数据人的基本要求。

    数据资源

    大数据时代,数据虽然很多,但是也不是随意得来的,需要利用各种渠道和方式获得。不管从哪个角度来说,数据可分为内部数据和外部数据。内部数据是企业在日积月累的经营中得来的,我们应该对这些数据挖掘、收集有价值的东西,形成企业的数据资产。内部数据重在后期的处理和分析上。

    下面先说外部数据的获取方式,以及通过Excel操作来获取外部数据。

    外部数据获取方式

    1、专业网站看数据(某一个行业、某一件产品)2、通过收费渠道买数据(第三方数据平台等)3、通过特殊形式引数据(网站爬虫,统计网站等)4、自身积累数据(时间久、跨度长)

    Excel获取外部数据

    作为一个数据分析师以及想更进一步成长为数据科学家,熟练操作基本的办公软件以及SQL查询是很重要的。请看下面通过Excel获取外部数据的步骤。

    第1步:打开“新建web查询”框。新建Excel工作簿,在打开的工作表中单击“数据”选项卡,然后在“获取外部数据”组中单击“自网站”按钮,如下图。

    第2步:输入网址并选择要导入的表格数据。在弹出的“新建web查询”对话框中的“地址”文本框中复制粘贴上述网页的网址,然后单击“转到”,找到网站中的表格数据后单击表格左上角的箭头→,图标变成选中状态的复选框√。如下图。最后单击下方的“导入”按钮。

    第3步:选择数据的放置区域。点击导入后,Excel会出现“导入数据”对话框,如下图,选中你想放置的单元格,单击“确定”开始导入。

    第4步:美化导入的数据。由于导入的数据多且乱,要调整格式使数据规范,并启用冻结窗格功能方便浏览。如下图。

    好了,上面就是通过Excel操作来获取网站上的外部数据,很简单吧,但网站中的数据并非都是以表格的形式呈现,现在大部分是以json格式呈现,Excel不是万能的,而且现在很多网站需要付费才能导数据(上面说过数据就是企业的资产)。

    小结

    希望通过上面的操作能帮助大家。如果你有什么好的意见,建议,或者有不同的看法,我都希望你留言和我们进行交流、讨论。

    End.

  • ?

    企业进入大数据信息采集时代

    赖梦松

    展开

    做网络营销

    不论是个人还是公司都想要实现产品的渠道拓展和推广宣传

    但绝大多数的企业都不能达成想要的效果

    其实原因有很多

    一、想要做好网络营销

    客户是王道

    没有强大的客户群做后盾

    网络营销的销量不过是空想罢了

    当下客户渠道大多以网络大数据信息采集的方式来获取

    如云速数据挖掘

    通过输入行业关键字

    就能一键采集指定区域的客户信息和联系方式

    省时高效

    二、通过客户信息

    从分考虑分析目标群体的生活轨迹和习惯

    来预测客户下一步的消费行为

    以正确的时间正确的方式传达产品信息

    从而完成营销活动

    三、产品文案的策划一定要以客户需求为重点

    并且简单易懂、快速吸引客户眼球

    才能使转化率达到最佳

  • ?

    浅析工业数据采集产业发展现状

    霍华德

    展开

    (一) 工业数据采集产业综述

    1. 市场规模潜力巨大:

    中国作为世界第一制造大国,随着工业互联网市场的不断发展和完善,企业对工业数据采集的实时性、可靠性和专业解决方案需求日益增强,中国工业数据采集市场呈现巨大潜力,相关软硬件和服务提供商迎来了良好的发展机遇。

    2. 市场各方积极参与

    从消化政策、推出工业数据采集解决方案,到发布工业互联网平台,各市场参与方努力寻求业务转型,外资企业和本土企业均在积极部署工业数据采集产品体系和解决方案,谋划市11场布局。

    3. 技术产品和解决方案持续推进与完善

    当前,工业数据采集技术产品和解决方案仍处于发展阶段,但已有部分厂商推出了一些多样化的解决方案,比如通过构建兼容转换协议的技术产品体系,实现工业数据互联互通;或是通过部署边缘计算模块,实现数据在机器设备端的轻量级运算和实时分析。

    点击上方“关注”,共同学习工业互联网相关知识!

    (二) 工业数据采集产业规模和预测

    整体市场情况2017 年,中国工业数据采集产业市场规模达到 570 亿元,同比增长 16.3%。预计未来 2-3 年,中国工业数据采集市场将保持稳定增长趋势。

    图:2015-2020 年中国工业数据采集市场规模

    2. 细分产品市场情况

    图:2017 年中国工业数据采集细分产品市场规模

    备注 1:传感器包括光电传感器、接近传感器、视觉传感器、位移传感器、速度传感器、加速度传感器等。读码设备包括条码设备、射频识别等。工业通讯模块包含工业串口卡、总线卡、串口服务器、工业电源、以太网模块等。

    3. 细分行业市场情况

    图:2017 年中国工业数据采集细分行业市场规模

    点击上方“关注”,共同学习工业互联网相关知识!

    (三) 工业数据采集存在的主要问题

    当前工业数据采集面临的突出问题可以总结为“三不”:不敢传(数据安全问题)、不能传(协议标准不统一)、不需传(本地化和实时性问题),无法支撑实时数据采集和实时分析、智能优化和科学决策。

    (1) 工业数据采集存在数据安全隐患

    工业数据采集会涉及到大量重要工业数据和用户隐私信息,在传输和存储时都会存在一定的数据安全隐患,也存在黑客窃取数据、攻击企业生产系统的风险。急需从技术、管理和法律法规等多方面保障数据安全。

    (2) 工业协议标准不统一且数据开放性不够

    目前在工业数据采集领域,存在 Profibus、Modbus、CAN、LonWorks、HART、Profinet、EthernetIP 等多种工业协议标准,各个自动化设备生产及集成商还会自己开发各种私有的工业协议,各种协议标准不统一、互不兼容;同时很多设备和系统的数据开放性不够,缺乏数据开放接口及文档说明。导致协议适配、协议解析和数据互联互通困难。

    (3) 工业数据采集实时性要求难以保证

    生产线的高速运转,精密生产和运动控制等场景则对数据采集的实时性要求不断提高,传统数据采集技术对于高精度、低时延的工业场景难以保证重要的信息实时采集和上传,无法满足生产过程的实时监控需求。

    (四) 我国工业数据采集产业格局

    当前,工业数据采集发展越来越快,工业互联网的跑道越来越宽,工业自动化企业、网络通信企业、信息技术企业身影已纷纷出现。就当前情况而言,工业自动化企业具备先天竞争优势,起步和前期推广相对容易,可以在原有系统客户上深度耕耘。信息技术企业和网络通信企业在技术架构的高度上更有比较优势,战略构想和规划能力更为突出。

    目前,工业数据采集产业供应侧主要有以下三类企业:

    一是工业自动化企业,从自身核心产品能力出发,主要为工业数据采集提供接入设备,作为工业数据采集的源头,例如15西门子、研华、霍尼韦尔、安控等;

    二是工业网络服务企业,主要为工业数据采集提供工业网络协议转换、传输、安全等配套设备和服务,部分企业从原有优势领域正在积极向制造业领域延伸发展,例如中国电信、中兴通讯、华为等;

    三是工业数据采集解决方案企业,主要提供工业数据采集解决方案、系统开发、项目实施、系统集成等服务,例如北自所、和利时、明匠智能等。

    已阅读完毕,点击上方“关注”,共同学习工业互联网相关知识!

  • ?

    产品信息 | 移动统计无埋点技术,让数据采集再无障碍

    禹箴

    展开

    手动埋点一直是广大数据工作者们的烦恼之一。也许,您会对下边的对话感到熟悉: 产品:“我们想看看用户在这个页面的访问数据,研发同学千万记得埋点哟” 研发:“埋哪里?埋哪里?没找到呢?(疑惑脸)” 运营:“我们想看看这个button的点击量,亲爱的研发哥哥帮我埋个点吧!” 研发:“新版已经上线啦,再埋点的话需要重新发版,很麻烦的,等下个月吧(郁闷脸)。。。” 产品:”呼叫研发哥哥,麻烦帮我看看这个指标怎么没有统计上呢?“ 研发:“咦?怎么会没数据呢? 完了,发版的时候忘埋点了(惊恐脸)。。。”

    今天起,百度移动统计推出无埋点功能,让这些疑惑、郁闷、惊恐的日常成为过去。只需激活无需埋点,彻底告别繁琐埋点工作。

    百度移动统计无埋点SDK是建立在现有的手动埋点SDK上的功能升级。智能结合手动埋点习惯,避免繁琐接入过程。通过一行代码激活SDK即可采集准确、丰富的用户数据。几乎省去工程师90%工作量,高效完成数据采集操作。

    无埋点可以帮助您: 1、自动收集基本的页面和事件信息,线上简单设置与操控,无需再耗费大量的时间和精力对需要统计的页面和事件挨个单独埋点。 2、自动全量收集数据,无需再次发版。不再为少埋点、漏埋点而发愁。 无埋点SDK的解决方案就在眼前,你还在等什么呢? 现在报名体验(只能新用户申请体验哦)!欢迎发送邮件到apptongji@baidu,机会难得,先到先得!申请时请注明您的姓名、公司职务、app名称、手机等联系方式,对无埋点有任何疑问也欢迎来信咨询,感谢您对百度移动统计的支持!

  • ?

    数据采集过程中的常见问题

    汪尔白

    展开

    经过两周的整理总结,沉淀出来好多数据采集的经验与大家分享。

    前嗅免费模板共享链接:http://forenose/help/collection/template/cases.html

    1.如何进行数据采集?

    ①下载安装软件后,登录到软件上。

    ②准备好模板:在前嗅的官网上下载免费的模板或自己配置好的模板

    ③将下载的官网导入到软件中。

    点击文件---点击导入采集文件(将采集文件导入,自己配置的模板请忽略这一步)

    ④在数据建表中建关联数据表

    选中需要采集模板下的表单---点击创建关联数据表,所创表名不能为汉字,点击确定---在所创数据表前的方框打勾即可关联数据表。详情见下图。

    此时在数据浏览中就存在了刚刚建的关联数据表。

    ⑤进行数据采集。

    在需要进行数据采集的模板前打勾--点击允许采集--点击开始按钮即可进行数据采集。详情见下图。

    ⑥数据预览及导出

    选中关联表---点击刷新按钮即可查看数据---点击导出按钮即可导出数据。详情见下图。

    多种导出方式:

    a.可以将采集到的数据全部导出。

    b.可以将数据分割导出,设置特定数目后数据会分别储存放在文件夹中。

    c.可以将每个字段所采集到的内容分别导出到不同文件夹,方便查看。

    数据导出教程:

    http://forenose/help/guildbook/crawler_new/5-2.html

    2.所采集的网站弹验证码是怎么回事?

    弹验证码分为四种情况:

    ①登录需要验证码:登录时只需要一个验证码,所以直接手动填写配置即可。

    ②多账号登录:每次账号登录都需要验证码,此时应该接第三方打码平台。

    前嗅(forenose)是首个深度大数据专家。

    提供数据采集-分析-处理-管理-营销-应用,自主知识产权的全套大数据产品 。

  • ?

    制造业生产数据采集的作用与意义

    格洛斯特

    展开

    制造业生产数据采集的作用与意义导读:制造业是我国国民经济的支柱产业,也是推动工业化的原动力,现代制造业已经并且正在深刻地改变着人们的生产方式、生活方式甚至社会文化。全球经济一体化的趋势愈演愈烈,国际竞争不断加剧,制造业的发展必须不断提高在质量保障、品种多样化、快速设计制造、快速检测响应以及快速重组等方面的要求。于是,“以信息化带动工业化,以工业化促进信息化”被提到了前所未有的高度、深度和广度。

    制造业生产数据采集的作用与意义

    众所周知,制造业的信息化主要包括设计数字化、生产数字化、装备数字化、管理数字化、企业数字化等。信息化的大趋势使世界各国争先恐后的把先进技术和信息化引进到传统工业和制造业。1990 年,美国 AMR(Advanced Manufacturing Research)所提出的制造行业的ERP(Enterprise Resources Planning,企业资源规划)/MES(Manufacturing Execution System,制造执行系统)/PCS(Process Control System,过程控制系统)三层结构,已经成功地在许多行业得到了应用,并被越来越多的企业所认可.

    美国 AMR 研究公司对MES 的定义表述为:MES 是一个常驻工厂层的信息系统,介于企业领导层的计划系统与生产过程的直接工业控制系统之间,它以当前视角向操作人员、管理人员提供生产过程的全部资源(人、设备、材料、工具和客户要求)的数据和信息,其着重点是将信息技术运用于改善制造过程。

    而作为MES中低层的数据采集功能,可以实现对生产现场各种数据的收集、整理工作,是进行物料跟踪、生产计划、产品历史记录维护以及其它生产管理的基础。它可以为企业中其他例如ERP等管理信息系统提供实时数据。另一方面,MES也要从其它管理系统中获取相关的数据以保证MES自身正常运行。因此要满足MES快速、实时的要求,作为各种功能模块运行基础的数据就显得十分重要。一个迅速而可靠的数据采集系统是整个MES能够正常稳定工作的有力保证。

    制造企业面临的数据采集现状

    作为车间底层的数据采集系统,在企业实际生产过程中却存在着许多困难,尤其是在离散企业中由于自动化程度较低,往往存在着以下特点:

    生产过程不可视:主要体现在不能实时了解生产现场中在制品、人员、设备、物料等制造资源和加工任务状态的动态变化。

    生产过程复杂性:由于产品结构和加工工艺的复杂性,造成生产过程中各制造过程的关联性强,生产环境复杂多变(临时插单、材料短缺等) 。

    制造过程信息集成度低:制造过程中的各种信息不能有效进行集成,导致产能不能得到充分利用。

    信息不能有效与上层管理系统进行集成:这种隔断造成生产过程不透明,生产进度、在制品状况、设备利用状况等关键数据不能到达管理层,增加了过程管理和生产决策的复杂性。

    制造过程信息的真实性差:现场数据信息过多依赖人机交互界面通过人工录入,增加了出错的机率。

    制造过程信息的实时性低:作业任务随市场需求的频繁调整变化,不利于制造过程信息的实时采集,再加上制造过程信息交互的速度和效率低下,造成企业对市场变化的响应速度慢。

    企业设计层和管理层到车间层特别是车间设备层的信息采集困难,一方面车间设备层的重要信息难于采集和上传,无法达到对生产过程的监控。另一方面上层系统难以深入到车间和设备层,从而影响管理信息系统的准确运行,使动态信息成为脱离实际的无源之水难于及时下达,从而使整个企业信息化难以产生更大的效益。

    上述特点反映了制造车间迫切需要对制造过程进行信息化的数据采集管理,从而建立一个完整高效的离散制造车间数据采集及其分析处理系统是实现离散车间信息化的基础。数据采集及其分析处理系统的主要功能就是将车间的各种离散数据完整实时的采集到车间数据库中,并进行初步的分析处理,将车间生产的信息实时准确的反馈到车间的管理层,加强管理人员对车间生产现场的监控和管理,并为企业管理人员制定生产计划提供依据。

    华磊迅拓科技专业提供SCADA数据采集监控系统,OrBit-SCADA(Supervisory Control And Data Acquisition)系统是"制造业物联网信息总线"的具体实现,它包含两个层次的含义:一是分步式的实时数据采集系统,即工业通讯与控制的PC上位机系统 ;另一个是生产现场的场景建模和显示系统。

  • ?

    大数据-产品基础模型

    Heather

    展开

    一、大数据应用思维

    【例1】

    产品经理给大数据部门提了个需求:我想知道所有用户的标签,比如哪些用户喜欢时尚类型的微博、哪些用户是单身狗等,好给这些人针对性推阿里巴巴的广告,而且很急,下个月新版本就要上线。

    大数据部门的程序员们收到需求之后,一分析,数据有好几百TB,一台机器跑要跑7个月(200多天),所以得用分布式计算。于是搞了100台服务器,并把这100台服务器分成两部分,一部分有90台,叫Master,负责划分数据,分配数据处理任务;一部分有10台,叫Worker,负责归并数据块,计算出最终结果。

    服务器搭建好了,架构弄好以后,程序员开始分头写程序,一部分负责写数据文件的划分,把文件分成一小块一小块来处理;一部分负责写计算任务调度,就是把划分好的数据文件分配到90台Master服务器中;一部分负责写归并处理程序,部署到剩下的10台Worker服务器,接收那90台服务器传过来的数据,并计算结果;一部分负责写出错检测,检查哪些机器挂了导致计算任务停止了,一旦发现出错了,把计算任务分配到其他正常的服务器上计算。

    10台Worker服务器根据1,2,3...10,进行了编号,假设每个人的都有一个微博ID(是数字),按照微博ID的个位数来进行划分,比如我ID是 1001,那我的处理结果会在1号服务器,ID是100213,那么处理结果就在3号服务器。

    假设上面的流程都正常,因为机器多了,原本需要200多天的任务,有了100台机器,结果3天就跑完了!得到了这样的微博用户特征(@大师兄[单身概率 88%,科技工作者概率90%,性别男概率100%,本科毕业概率81%,收入水平5000元/月概率 10% ...])。

    二、数据处理的流程

    大数据的数据处理这件事用一种非技术的角度来看的话,可以按处理顺序分为三个部分,第一个部分是数据采集,第二个部分是数据存储,第三个部分是数据分析,这也是大数据搭建的基本产品模型。

    1、数据采集

    ● 基本原则

    全:多种源(客户端、服务端、数据库等),完善的数据源(零售、C端、电商、供应链等)全量而且非抽样

    细:Who、When、Where、How、What

    数据采集最重要的就是数据源,数据源好,后面的事情都很容易。但如果数据源就有问题或是太差不全之类的,后面有些问题用再复杂的算法可能都解决不了,可能都是很难得到正确的结论。所以数据采集处理流程有两个基本的原则,一个是全,一个是细。

    ● 全:就是说我们要拿多种数据源,不能说只拿一个客户端的数据源,服务端的数据源没有拿,数据库的数据源没有拿,做分析的时候没有这些数据你可能是搞歪了。大数据里面讲的是全量,而不是抽样,因为数据之间可能有很大差异。比如纵向里,做全国零售数据分析的时候,不能只把四川或者北京的拿来分析,因为它一定代表不了黑龙江、甘肃等地方,所以必须要全量分析全国数据。横向里,我们在分析某个商品的总的销售情况的时候,我们除了分析线下零售数据还有需要C端外送数据和电商数据,因为一个东西可能在公司的多个业务系统上销售。所以对于多个业务系统的公司,需要每个业务系统涉及的数据都要足够全,不能有任何一个系统有缺失。

    ● 细:其实就是强调多维度,在采集数据的时候尽量把每一个的维度、属性、字段都给它采集过来。比如:像 where、who、how 这些东西给它替补下来,后面分析的时候就跳不出这些能够所选的这个维度,而不是说开始的时候也围着需求。根据这个需求确定了产生某些数据,到了后面真正有一个新的需求来的时候,又要采集新的数据,这个时候整个迭代周期就会慢很多,效率就会差很多,尽量从源头抓的数据去做好采集。

    ● 数据清洗:在数据采集过程种需要对源数据做清洗处理。其实也是对数据做加工的过程,确保命名约定,编码结构,属性维度等一致性。因为本身的源数据会存在垃圾数据,本身也是杂乱的没有很好的逻辑,数据清洗的过程就是让数据更具逻辑性,更干净有序的存储。

    2、数据存储

    ①、数据建模

    数据建模指的是对现实世界各类数据的抽象组织,确定数据库需管辖的范围、数据的组织形式等直至转化成现实的数据库。 将经过系统分析后抽象出来的概念模型转化为物理模型后,在visio或erwin等工具建立数据库实体以及各实体之间关系的过程(实体一般是表)。在软件工程中,数据建模是运用正式的数据建模技术,建立信息系统的数据模型的过程。(百度百科)

    数据模型就是对现实世界的一个抽象化的数据的表示。大数据的数据建模则是基于大数据本身的数据量、数据特征、业务需求、还有自身分析重点和目标做的数据模型。我们可以针对分析的需求对数据重新进行解码,它内容可能是一致的,但是我们的组织方式改变了一下。就拿用户行为这块数据来说,就可以对它进行一个抽象,然后重新把它作为一个判断表。数据建模时常常考虑的有两个概念,一个是维度,一个是指标

    通常各个业务系统,一般前端做一个请求,然后对请求经过处理,再更新到数据库里面去,数据库里面建了一系列的数据表,数据表之间都是很多的依赖关系。这些表一个业务项发展差不多一年以上它可能就牵扯到几十张甚至上百张数据表,然后把这个表直接提供给业务分析人员去使用,理解起来难度是非常大的。数据建模则可以把这些关系重构,让业务人员更容易理解。

    ②、数据仓库

    ● 面向主题:数据仓库是围绕着一些主题,如顾客,供应商,产品,销售等创建的。数据仓库关注决策者的数据建模与分析,排除对决策无用的数据,提供特定简单明确的数据视图。

    ● 集成:构造数据仓库时,数据来源是多种异构的数据源,使用数据清洗和数据集成技术,确保命名约定,编码结构,属性维度等一致性。

    ● 伴随时间变化:数据仓库存储从时间维度提供信息,所以每一条数据必须包含时间维度,同时也就需要各个业务系统在建表时加入“创建时间、修改时间、创建人、修改人、是否删除”五个字段

    ● 非易失:数据仓库不同于普通的业务应用数据,它跟操作环境下的应用数据是分离的,所以它不需要参与事务处理和并发控制。通常它只需要两种数据访问:数据的装入(抽取)和数据访问,不存在数据更新或者数据删除,所以数据修改时需要加入数据修改时间、修改人,数据删除时在数仓标记数据已经删除。

    数据仓库在创建的时候需要分库和分表:创建表时根据数据清洗阶段进行分库,根据主题域进行分表。

    ③、数据集市

    数据集市(Data Mart) ,也叫数据市场,数据集市就是满足特定的部门或者用户的需求,按照多维的方式进行存储,包括定义维度、需要计算的指标、维度的层次等,生成面向决策分析需求的数据立方体。数据中心的重点就在于它迎合了专业用户群体的特殊需求,在分析、内容、表现,以及易用方面。数据中心的用户希望数据是由他们熟悉的术语表现的。

    用通俗的话说数据仓库是为数据集市提供服务,在数据仓库里,每个数据单元都与特定的时间相关。数据仓库包括原子级别的数据和轻度汇总的数据,是面向主题的、集成的、不可更新的(稳定性)、随时间不断变化(不同时间)的数据集合,用以支持经营管理中的决策。而数据集市就是数据仓库的一个子集,他主要面向部门级业务,并且只面向某个特定的主题。为了解决灵活性与性能之间的矛盾,数据集市就是数据仓库体系结构中增加的一种小型的部门或工作组级别的数据仓库。数据集市存储为特定用户预先计算好的数据,从而满足用户对性能的需求。数据集市可以在一定程度上缓解访问数据仓库的瓶颈。

    在数据结构上,数据仓库是面向主题的、集成的数据的集合。而数据集市通常被定义为星型结构或者雪花型数据结构,数据集市一般是由一张事实表和几张维表组成的。

    数据集市特点:

    ● 数据集市的特征包括规模小。

    ● 有特定的应用。

    ● 面向部门。

    ● 由业务部门定义、设计和开发。

    ● 业务部门管理和维护。

    ● 能快速实现。

    ● 购买较便宜。

    ● 投资快速回收。

    ● 工具集的紧密集成。

    ● 提供更详细的、预先存在的、数据仓库的摘要子集。

    ● 可升级到完整的数据仓库。

    3、数据分析

    当数据采集回来并存储好以后就可以在这基础上运用这些数据来做数据分析了,对于互联网产品常用的分析方式有四种:

    ①、多维度分析: 多维事件的分析,对不同维度之间的组合、关系进行分析。

    ②、漏斗分析:对于电商、订单相关的这种行为的产品来说非常重要,要看不同的渠道转化这些东西,一个用户从做第一步操作到后面每一步操作,可能是一个杂的过程。

    ③、留存分析:用户来了之后我们希望他不断的来,不断的进行购买,这就是留存。

    ④、回访分析:回访是留存的一种特别的形式,可以看他一段时间内访问的频次,或者访问的时间段的情况

    上面说的四种分析结合起来去使用,对一个产品的数据支撑、数据驱动的这种深度就要比只是看一个宏观的访问量或者活跃用户数就要深入很多。

  • ?

    产品经理如何进行需求采集

    May

    展开

    产品经理的工作主要是分析用户需求,发现其背后的原因,从而创造出能够直击用户痛点的产品。但是如何知道用户需求?实际上需求分析还有一个前置步骤,就是需求采集。只有使用科学的采集方法,才能更深入的了解用户的痛点。仅仅靠着拍脑袋想出来的需求,很可能就是做出来的产品没人用,不好用。

    需求采集是什么?

    需求采集实际上就是获取/验证需求的方法。其目的就是通过深入了解分析目标用户,发现他们的痛点。随之而来的才是需求分析,需求转化等其他后置工作。

    如何进行需求分析?

    需求采集的5步:

    确定采集目的选择采集方法制定采集计划执行采集总结分析

    其常用对于用户需求采集的方法有4种:

    用户访谈调查问卷可用性测试数据分析

    下面我会按照需求采集的流程,分别说一下哥哥方法的用法和注意点。

    1. 确定采集目的

    数据采集是要有目的,没有目的的采集通常是盲目的,并且没有办法直戳要害;而且也会因为目的不明确,无法找到合适的数据,因为你不清楚哪些数据能用到,哪些数据用不到,费力不讨好。所以数据采集的第一步就是确定你数据采集的目的。比如,日历用户使用场景的访谈,文档同步可用性测试等等。

    2. 选择采集方法

    可以根据产品开发的阶段和调研目的选择不同的采集方法。

    功能规划阶段:用户访谈,确定产品方向。功能早期阶段:调查问卷,确定需求优先级。功能实施阶段:可用性测试,需求方案校验。功能上线后的优化阶段:数据分析,改进产品,优化体验。

    3. 制定采集计划

    不同的采集方式,有着不同的使用场景和容易存在的问题。

    3.1 用户访谈

    一般采用1对1,或1对多的形式,围绕几个特定的话题,我们问, 用户答,用户说,我们听。作用是研究新产品的方向,或者是因为数据分析发现了现象,探索背后原因。

    言行不一:经常能看到用户言行不一的时候。其原因有的时候用户可能是自己没有考虑,或者是为了迎合调查人员,还有可能是不想回答或者不知道答案随便答的。

    解决方案:遇到这种情况的时候,先不要着急的和用户进行争论,或者指出用户的问题,先记录下来,保持微笑和礼貌。可以侧面多找几个问题问问用户的看法,和当时操作时候的想法。注意其他用户是否存在相同的情况,推测原因。

    样本少,以偏概全:通常是因为成本有限,性价比比较低。

    解决方案:增加样本,先做假设,然后统计变化规律,如果和之前的预计假设偏差值小,就可以停止访谈了。

    偏离方向:一种是因为用户强势,容易把话题带偏了,第二种是访谈人强势,把用户带偏了。

    解决方案:牢记访谈目的,如果发生了话题偏移,尽量扳回来,如果实在不行,则尽快的结束访谈,节约时间进行下一个用户,不要再这个用户上继续花过多的时间。访谈者不能表现出强烈的引导性,主要还是让用户来表达,对于用户的反馈全盘的接受,不能因为不符合你的预期而表现出来。

    访谈目的不明确:没有明确调研目标,为了调研而调研;还有一种就是调研的方向太大,因为问题问得太大的到的反馈效果不好。

    解决方案:确立明确的调研目的,题目不要太大。

    通过用户访谈,我们一般能获得用户信息,包括个人基本信息,特征信息和用户使用产品的偏好。需求信息,包括用户为什么产生这样的需求,通常在什么场景下出现;行为信息,没有现成解决方案用户是怎么解决的?早操作的时候有遇到什么问题?让用户抓狂的点是哪里?最后分析需要解决的就是之前调研需求信息和行为信息的原因是什么。

    3.2 调查问卷

    设计问卷由用户填写,回收问卷,统计用户反馈,以量化数据的方式获取用户需求。通常在需要面对大量用户,或者需要调查的问题并不是很深入的时候选择这种方式。

    时长过长:不管线上还是线下的问卷,时常都不应该超过五分钟。

    题目顺序:调查问卷的题目顺序非常重要,开始选择一些简单不需要思考的问题,中间选择用一点思考或稍微敏感的问题,结尾则可以问一些用户个人信息的问题,这样做的好处就是能够循循渐进,避免了刚开始就要用户的个人信息,而让用户产生抵触心理对问题做出防御姿态,最后就是得到的答案不是用户真实的反馈。

    准确性不够:指的是调查问卷的数据并不能符合真实的情况,原因通常是因为样本过少和题目本身具有引导性。

    解决方案:调查的时候要覆盖目标群体的各类型用户,还有一点就是其调查人群的比例也要尽可能符合真实用户的类型比例。样本过少,没别的办法,就是增加样本。题目引导,则需要对题目本身制定的时候多思考,更改一下题目的顺序,多做几个版本的题目,先在小范围做试答,进行反馈修改后再正式的投入市场。

    3.3 可用性测试

    邀请用户实际使用产品,在用户使用产品的过程中观察用户遇到的问题,从实际使用情况来分析产品体验和用户需求。可用性测试可以提前发现产品设计的问题,优化用户体验,而且有可能在测试的过程中还能发现新的需求。

    晚做不如早做:如果功能已经上线,在做可用性测试,如果原来存在的问题实际上就已经影响到用户了,这就太晚了。

    觉得专业,太过复杂,就不做了:实际上,很多企业都认为可用性测试比较复杂,而且其结果是没办法预估,性价比低,所以通常是有功夫再做,没工夫就不做了。其实是可以根据情况来定,简化步骤,可用性测试能够得到很多数据发现不了的问题,不管结果有多差,怎么都比不做要好。

    测试产品,而不是测试用户:用户来测试之前,明确告知用户测试的目的是发现软件问题,即使用户在使用过程中完不成任务,也是产品的问题,不是用户的问题。

    招募用户:招募的用户尽可能就是以后产品的目标用户,这样的出来的反馈才是最真实有效。

    测试:提前准备测试任务,主要测试产品的核心需求相关功能。测试前要提前告知用户目的,大概的时间和测试任务,让用户心理有数。如果有条件最好是在取得用户同意的情况下进行录像记录过程。

    3.4 数据分析

    通过统计用户日志文件或实际使用数据,采集和分析用户需求。特点是数据来自于真实的用户,是可以控制的,避免了只听用户说的误导,真实的看到了用户的是如何做的。能够验证之前的预想是否正确,起到校正用户和用户需求的作用。

    过于学术,沉迷“科学研究”:数据分析要考虑成本,特别是初创企业,不能每一步都进行数据分析,这样会导致效率比较低。而且数据只能看到现象,但背后的原因还是需要自己去寻找。

    数据不会骗人,但容易误读:人是习惯性的先有了猜想,然后去找数据证明它。这样做很容就变成为了证明自己是对的,出现误读的情况。

    解决方案:保持中立,学习科学家精神,不要为了迎合某一观点,针对观点来找数据。

    提前布局:不要等着想要数据分析的时候在去找数据,而是要提前埋点,这样才能有数据来分析。

    4. 执行采集

    采集的过程中有以下注意点。

    提前向用户说明来意:测试之前提前和用户打好招呼,说明测试的目的,大概花费的时间。让用户放松,征求用户的意见:不要过于严肃,同时调查人员可以选择去用户熟悉的场景来进行测试,让用户保持放松的状态,尽量还原平时用户平时使用产品的场景,如果有录像,一定要提前征求用户的意见。避免引导性的举动:题目和采集过程的接触中尽量不要有引导性的举动,这样可能会造成用户的答案是你想要的答案,而不是用户真实的答案。保持感谢:用户花时间来配合采集,一方面是用户处于对你的相信,还有一点是对于产品的喜爱。所以一定要保持感谢,预算充足的情况下可以准备一些小礼品送给用户。最后的结果如果没有什么特别需要保密的,也可以给用户发一份,并附上感谢,让用户感受到他也在产品里有自己的一份付出。

    5. 整理资料

    采集完了,一定要将资料进行整理规划分析,要不然采集做了等于白做。之前提到过不能光听用户说,要观察用户。有的人就会问,那么我只要看用户怎么做不就好了。为什么还要听用户说呢?其实听用户说和看用户做都非常重要,只看用户如何做,只能看出现象,只有两者结合才能知道背后的原因。

    而且言行不一,也可能是某种功能需求的表现,比如某些隐私对应着选择性展示的功能,就是产品经理发现了用户一些不想说的原因,做了可选择性展示的功能。如果只看用户如何做就没办法做到这么的深入人心。让你的产品通人性,两者缺一不可。

    这里具体的整理方式和方法,打算放在需求分析里面详细说明。

    需求采集有什么好处呢?

    说了这么多,可能觉得步骤非常多,而且很麻烦,但是做需求采集有什么好处呢?最直接的好处就是需求采集能够加深产品经理对目标用户的了解。好的产品经理应该抓住一切机会与目标用户进行接触,你只有接触了才能可能发现一些你坐办公室根本想不到的问题。毕竟一个人的大脑能预想到的情况有限,只有接触了各种各样的用户,你才能发现用户的痛点,然后在今后的工作中去更好地解决他们的问题。

    还有一点好处,通过需求采集,你能发现现有产品的问题,只有通过这些采集手段,把产品存在的问题暴露出来。产品有错误不是大问题,最大的问题就是不知道产品有问题,而产品的问题就是产品的方向标,它能为我们展示产品的优化方向。

    这里说的这个4个采集方法都是面对用户常用的方法,还有其他的一些需求采集的方法,比如说Bug转需求,头脑风暴,需求卡片,竞品分析等等。我会在之后的内容进行整理,有需要的可以私信留言,按照需求的人数我会适当的提前整理。

  • ?

    数据产品经理必修课(66):大数据研发之采集技术

    孟黎昕

    展开

    既然产品、研发与运营是互联网的三板斧,那么就不得不说说大数据时代的研发。我一直在困惑,究竟应该如何向广大的产品经理同学们讲清楚什么是大数据的研发。说详细了,必然使其困惑,而且我也不一定都能够明了其中的细节;说的粗略了,产品经理同学又会觉得不痛不痒,毫无感觉与世纪效果。再加上,本身打数据的研发就包罗万象,即便是单独成书则废寝忘食不能成也。除此之外,大数据门派众多,云计算、虚拟化、微服务都算是与大数据紧密相关的,那到底什么该讲什么不该讲呢?

    我制定了大致这样的规则,我们想和各位产品经理同学讲一讲大数据的代表性工作,Hadoop平台以及围绕该平台大致需要做的一些事情,我们并不会具体到一种语言,也不会具体到某种技术,而是从宏观的视角,把产品经理在数据上扎的根生出的藤蔓深向原本只有工程师们才能够触及的墙角与远方,并在每一处需要精心雕琢与深究的地方稍加缠绕,略微展开谈一谈这些宏观过程其中的内部机理。还记得我们在第二部分介绍数据挖掘相关技能的时候,我们使用了CRISP-DM的流程来介绍数据挖掘与数据分析的标准化步骤。如果那个时候的介绍看成是逻辑层面的流程的话,我们这里想要沿着物理层面的主线来向数据产品经理同学们展现什么是打数据的研发。具体来说,我们会按照数据采集、数据存储、数据计算以及数据分析这样四个步骤去介绍这些过程在工程师的手中,在他们心爱的服务器上都发生了什么。

    让我们还是先来看看数据采集吧。

    现如今,相信很多人手上的手机已经变成了全屏幕的触屏手机,而如果时光回到十年前,你拿起那个屏幕尺寸更小,手机功能更少的键盘机的话,不知会作何感想。那个时候的手机对于我们来说,只有三个意义:电话、短信、小游戏。如果你的手机可以播放视频,那一定是诺基亚与摩托罗拉的高端机型了。在那个时候,我们通过移动电话设备产生的数据无非也就是通话与短信数据,这些数据存储在三大运营商,他们知道我们在什么时间给谁发短信或者打电话,如果他们乐意,甚至还可以知道我们发了什么,说了什么。那个时候的数据采集量小到可怜,而且大多数还握在运营商手中。

    随着屏幕尺寸的扩大,安卓与iOS的入局,整个手机生态被打破,人们还是习惯于看大屏幕的收集,习惯使用一根手指去戳屏幕,习惯于在自己的电子设备上装上各色花花绿绿的应用,以至于在各种公共场合人们低头猛戳手机,甚至还收获了一个专有的名词叫做“低头族”。这个时候,出现了微信、微博,人们开始习惯使用微信给好友递送消息,而不再使用短信。这样的现象也改造着运营商的业务,以前每个月最需要在意的是套餐中包含多少条短信,而现如今则是每个月的套餐中的流量有多少。尽管运营商还是掌握着我们海量的数据,但是能够收集数据的人再也不止那三家运营商了。手机的生产者需要为手机在出厂的时候生产操作系统,因而他们成为了天然的数据收集方,原则上他们可以了解到你在手机里做的一切,就好比在一个封闭的屋子里装上了一个闭路电视,这个屋子就是该厂商生产的手机,你可以不进去,但是一旦你进去,所有的行为将被监控与知晓,至于这个闭路电视的监控视频内容何时被何人查看则取决于布下该系统的人的意愿罢了。除了这个房屋的建造者,还有很多的家居提供商也具备监控行为的能力,这些家居的提供商就是手机里花红叶绿的各色APP,原则上,只要你使用这样的家居产品,你在使用该产品的行为就会被记录,如果这样的家居公司与房屋的建造公司关系不错,除了能够收集自家家居产品的使用数据之外,还能顺便了解到但凡有本家公司家居产品的屋子里都还有哪些家居产品,甚至连用户是如何使用其他家居产品都是知道的。这样,数据进一步被积累,除了以前的运营商(地皮所有者)之外,手机操作系统厂商(房屋建造者)与手机内应用开发者(家居厂商)都是数据的拥有者。

    原本数据只是一口池塘,池塘中仅有的几条大鱼已经翻不过来身了,而现如今风云突变,池塘变成了湖泊,不仅这几条大鱼能够鱼翔浅底,而且随着湖泊生态的演变,鱼群变得越来越密集,每条鱼都可以自由的吮吸着湖泊中的融氧,变强,变大。就在此时此刻,湖泊的平面再一次的上升,而鱼群们则更加跃跃欲试,这个湖就是我们现在知道的大数据。

    抒情了这么久,只说了数据采集的一半,即可以采集哪些数据。当然,上面是以采集收集的数据为例来进行的说明的,而传统的网页也无非大同小异。可是这些数据究竟是怎么被厂商们采集回去的呢?也就是说到底采集的方法有哪些呢?

    我们大致可以将数据的采集分为两类,一类谓之传送带式,一类谓之土方车式。且听我细细为你道来。

    对于传送带方式的数据采集来说,实际上实在采集的前沿阵地和数据存储的大后方建立了一个传送带,一旦有星星点点的数据被采集回来就会被立即送上传送带,经过一段距离的传输就会被递送到存储的地方存储起来或者是被计算。就好像是在很多煤矿或者石料企业的现场看到一条长长的传送带,前方的挖煤机或者是采石机但凡能够搅下半点原料,这些原料就会被立刻送上传送带,送到后方。尽管在实际的场景中,这些传送带的后方有可能也是一些仓库,但不妨把这些仓库看成是在数据采集档口上的第一道存储服务器罢了。在这样的情况下,运送土方或者数据的通道是一直建立的,存储土方和数据的仓库也是时时刻刻在接受的,只要采集数据的过程不停止,那么运行这个传送带的机器与看守仓库的人就不可以停止与下班,因而在这样的实时数据采集过程中,人的注意力不可以离开,需要一直专注于整个流程,我们称他们是长连接,就好比是人的思想之弦一直紧绷,一刻不松懈的关注者另一端很长时间。与这样方式类似的数据处理形式称之为数据流处理,而打电话就是一种典型的数据流处理形式,在整个打电话的过程中,听话人需要一直关注对方在说什么,甚至需要通过听辨声音来判断通话是否还存在于线上或是已经挂断。

    对于土方车式的数据采集来说,往往是挖掘机把挖掘到的土(数据)放到土方车上,但是这些土方车不会因为有了一抔土就立刻送走离开,而是等车装满后再听从现场指挥的命令按照次序离开并送到指定的地点,这样的方式因为是需要将数据积累到一定的量,因而是一种相较前一种数据采集的方式更加随意的方式,它的随意就体现在数据并不要求实时,而是一段时间发送一次。于是乎,在挖掘机工作的时候,土方车的驾驶员(传送人)与仓库的保管员(存储人)可以稍加休息或是处理其他事情。这种数据采集的模式称之为短链接,顾名思义,人们的神经并不需要死死地盯住一个事情,而是仅仅需要在需要处理的时候响应它,在处理完了之后转而去做别的事情或者处理别人的请求即可。目前大多数的APP内的数据采集使用的就是这样的短链接模式,先将数据积累在本地,然后再一段时间把这些数据递送一次。除此之外,当你访问网页的时候,也是这样的短链接模式,你送给服务器一个URL,告诉他你想要这个网址的内容,服务器找到之后发送给你,但是它并不关心你是否能够收到,只要它一旦发出就去处理别的事情了,除非你再次请求他,否则它也不会再来理你。

    这就是你所应该知道的数据采集过程。

产品数据采集

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP