中企动力 > 商学院 > 数据采集处理
  • ?

    临床路径电子化中数据采集与预处理方法研究

    引魂

    展开

    导读:在临床路径电子化过程中,提出基于临床数据的采集与预处理方法,为临床路径的优化与构建奠定基础。从临床数据利用角度,开展临床数据采集以及为保证数据质量如何进行数据预处理工作。从数据采集过程中的结构规范、术语规范、数据采集、核查与预处理过程的要素等关键问题提出了处理办法。海量的临床数据为基于临床需求的数据挖掘和数据采集奠定了坚实的基础,也使基于临床数据挖掘方法构建基于循证医学的临床路径成为可能。

    随着各级医院信息化建设的迅猛发展,以纸质表单为主要形式的临床路径管理方式已不能满足数字化管理的要求,临床路径的电子化势在必行。临床路径电子化并不是简单的用电子表单代替纸媒表格,需要与各个临床业务系统在业务层面作交换,在临床决策与多学科协作方面必定要提供足够的支持。

    海量临床数据为开展基于循证的临床路径的实施成为可能。依托于大量的临床证据,做到真正的循证医学,避免了在制定与优化临床路径模板时的随意性。从临床数据利用角度阐述如何开展临床数据采集以及为保证数据质量如何进行数据预处理工作。

    临床数据采集

    数据采集是影响临床研究质量的关键环节之一,临床数据的采集工具电子数据采集系统(electronic data capture,EDC)随着医疗信息化的快速发展目前已经普遍使用。通过EDC实现数据采集具有节约时间和人力物力、提高效率、保证质量和可靠性等优势。临床数据的采集包括标准规范的选择和临床数据的选择。

    标准规范为解决异源异构数据融合的问题,临床数据的多项标准规范应运而生,其中临床数据交换标准协会(Clinical Data Interchange Standards Consortium,CDISC)数据标准涵盖临床试验全流程,并广泛使用和采纳,临床试验的效率和质量也相应提升。CDISC数据标准包括结构规范和术语规范。

    结构规范在数据组织形式中,有两种不同的结构:水平型数据结构和垂直型数据结构。从数据库设计范式角度看,垂直录入才是应该采用的数据录入模式,会更符合数据直接导入的需求。

    术语规范术语规范是临床数据采集与利用的基础,临床术语的应用是临床信息从采集到管理利用的保证数据完整性与规范性的重要环节。目前,临床试验广泛采用的《系统化临床医学术语集》已广泛应用于医疗信息系统中。而中医的临床术语集还在发展、完善阶段,已有专家分析中医临床常用术语质量的基本要求及中医临床常用术语在完整性、规范性、概念关系等方面的常见问题,提出利用本体技术建立中医临床常用术语本体,并总结中医临床常用术语本体构建的关键技术环节。

    支持临床路径电子化的数据采集基于循证的临床路径的制定与优化至少包括以下内容:诊断依据、治疗方案、标准住院日、变异依据、纳入/排除标准。而这些数据包含于以电子病历为核心的电子病历中,临床数据的数据来源及采集要点见表1。

    表1 临床数据来源及采集要点

    注:CPOE:计算机化医生医嘱录入系统, computerized physician order entry; RIS: 放射科管理信息系统, Radiology Information System; PACS: 影像归档和通信系统, Picture archiving and communication system; LIS,实验室信息系统, Laboratorial information system.

    数据核查与预处理

    数据质量核查真实、准确、完整和可靠是保证临床试验数据质量的基本原则。数据核查包括以下内容:违背方案核查、时间窗核查、逻辑核查、阈值范围核查、一致性核查、数据完整性核查等。数据核查后产生的质疑需要反馈给临床监查员或研究者。研究者对质疑做出回答后,数据管理员根据返回质疑答复对数据进行修改。

    数据预处理数据预处理的过程包括缺失值处理和与数据标准化两个过程。

    缺失值处理主要效应指标(有效性和安全性)原则上不应存在缺失值,应尽量避免非随机缺失。一般而言,若能判断数据缺失由完全随机缺失、随机缺失(MAR)造成的,可以采用末次观测值结转、基线观测值结转、均值填补、回归填补、多重填补等多种不同的方法。若是随机缺失或缺失值占的比例不超过5%,则可以不填补。还应简单说明一下不同填补方法的适应情况。需要说明的是,遵循保守原则的缺失数据处理措施更有利于控制潜在偏倚。

    数据标准化 数据标准化过程就是把临床实践中收集的数据与标准字典中的词目进行匹配的过程。当出现的词目不能直接与字典相匹配时可以进行人工编码,对于医学编码员也无法确认的词目,可通过多方沟通以获得确切的编码。

    面对临床路径电子化推广中建模与优化的难题,基于循证的临床路径构建已经成为临床路径研制与推广的重要研究方向。临床数据凝聚了临床经验与科技创新活动的成果,是传播卫生科学技术知识的重要载体,也是国家宝贵的知识财富,临床数据的分析挖掘是实施循证医学研究方法、总结临床诊疗规律、转化隐性的临床诊疗经验为可共享的显性知识的必要途径。只有通过规范的数据采集与预处理方法,才能保证海量的临床数据为基于临床需求的数据挖掘的可行性,也使基于临床数据挖掘方法构建基于循证医学的临床路径成为可能。

    文章来源:《中国数字医学》杂志2018年第02期,作者及单位:王斌 陈迪 曹馨宇 周洪伟 史华新 张妮楠 谢琪,中国中医科学院中医临床基础医学研究所 中国中医科学院广安门医院医保办 中国中医科学院中医药数据中心。

    欢迎关注,CHINC服务号获取最新大会消息

    传播数字医学领域发展最新动态,关注医疗卫生信息化相关资讯。

    长按扫码关注我们

  • ?

    超实用:通过Excel进行数据采集

    雷欧

    展开

    前言

    IBM大中华区总经理胡世忠曾说:数据构成了智慧地球的三大元素——智能化、互联化和物联化,而这三大元素又改变了数据来源、传送方式和利用方式,带来“大数据”这场信息社会的变革。

    从上可见,时代的变革是源于对数据的利用,对企业而言,数据也同样是其发展、转型的命脉。在工作中,我的前辈不止一次地强调,数据是公司的资产,而且举足轻重。我们对待数据,一定要严谨,经得起考验,对自己的数据负责,这是一个数据人的基本要求。

    数据资源

    大数据时代,数据虽然很多,但是也不是随意得来的,需要利用各种渠道和方式获得。不管从哪个角度来说,数据可分为内部数据和外部数据。内部数据是企业在日积月累的经营中得来的,我们应该对这些数据挖掘、收集有价值的东西,形成企业的数据资产。内部数据重在后期的处理和分析上。

    下面先说外部数据的获取方式,以及通过Excel操作来获取外部数据。

    外部数据获取方式

    1、专业网站看数据(某一个行业、某一件产品)2、通过收费渠道买数据(第三方数据平台等)3、通过特殊形式引数据(网站爬虫,统计网站等)4、自身积累数据(时间久、跨度长)

    Excel获取外部数据

    作为一个数据分析师以及想更进一步成长为数据科学家,熟练操作基本的办公软件以及SQL查询是很重要的。请看下面通过Excel获取外部数据的步骤。

    第1步:打开“新建web查询”框。新建Excel工作簿,在打开的工作表中单击“数据”选项卡,然后在“获取外部数据”组中单击“自网站”按钮,如下图。

    第2步:输入网址并选择要导入的表格数据。在弹出的“新建web查询”对话框中的“地址”文本框中复制粘贴上述网页的网址,然后单击“转到”,找到网站中的表格数据后单击表格左上角的箭头→,图标变成选中状态的复选框√。如下图。最后单击下方的“导入”按钮。

    第3步:选择数据的放置区域。点击导入后,Excel会出现“导入数据”对话框,如下图,选中你想放置的单元格,单击“确定”开始导入。

    第4步:美化导入的数据。由于导入的数据多且乱,要调整格式使数据规范,并启用冻结窗格功能方便浏览。如下图。

    好了,上面就是通过Excel操作来获取网站上的外部数据,很简单吧,但网站中的数据并非都是以表格的形式呈现,现在大部分是以json格式呈现,Excel不是万能的,而且现在很多网站需要付费才能导数据(上面说过数据就是企业的资产)。

    小结

    希望通过上面的操作能帮助大家。如果你有什么好的意见,建议,或者有不同的看法,我都希望你留言和我们进行交流、讨论。

    End.

  • ?

    省安监总局安全数据采集管理中心解决方案

    埃斯比约

    展开

    第一部分系统目标

    省安全生产监督管理局安全数据采集管理中心的总体建设目标,就是建设一个对安监网安全巡查的数据进行统一采集、存储、管理的中心平台,实现能够使县市乃至省级安监局相关单位在安监专网网络范围内通过此系统将安全巡查过程中智能安全帽所记录巡查的各类数据(视频、音频和照片)上传到系统平台,进行统一存储管理,便于各县市省级单位同事及领导登录系统后,对上传的各类数据(视频、音频和相片)进行检索、查看、浏览、下载,满足对安监网巡查工作更细致的情况追踪和监控,实现更高效的业务转化。

    系统主要特点

    1、拥有自主研发的智能安全帽,使用该安全帽可实现在巡查工作过程中的全自动巡查记录或重点记录,在不影响巡查工作的各项操作下,实现静默且稳定的图像资料记录和保存,实现巡查工作的忠实记录和保存,以便于巡查工作更好的保存和追踪。

    2、拥有自主研发的智能安全帽数据采集柜,具备智能的门锁技术,实现安全帽和储存柜的互相绑定,安全帽配合采集柜实现设备保存、设备充电、设备数据自动采集三合一功能,大大简化使用流程和提升使用便利性。

    3、采集柜本机具备超大容量存储空间的同时,可实现手动或自动上传备份数据或者传输数据至制定数据位置,实现数据的分布存储或集中存储的不同需求。可根据条件设置自动化执行任务,实现自动定时或针对性备份或传输特定数据,同时不同数据支持互相迁移。

    4、灵活多样、满足多途径的数据检索、统计和再利用能力,通过通用浏览器即可方便访问数据管理平台,实现远程的数据检索、预览、下载或备份。

    5、完善的日志管理和追踪功能,用户在系统中的各项操作均会生成日志记录,方便层层溯源追踪把控。

    6、完善的用户层级和权限管理,上百项细致入微的用户自定义权限内容,精确把控不同用户可在系统中获取的数据及操作权限,方便不同的使用和管理需求。

    7、支持网状模型连接扩展,可无限扩展架构层级,无损添加新节点,满足不断扩张成长的业务需求。

    通过该系统平台的建设,帮助省安监局各地单位建立远程的巡查数据管理入口,实现巡查业务更加精确高效安全的同时,将各地区的数据区块汇总接入,最终建立起属于省安监局单位独有的云端巡查数据管理中心。

    第二部分系统逻辑结构

    该方案可分为两种形成,每种形式各有优势和缺点,可以根据实际的需求情况,采用不同的搭建形式,满足不同的建设目标。、

    一、分布存储独立架构

    该架构下系统包含:一级应用服务器一台运行数据管理中心平台软件;一级数据服务器一台用于备份特殊重要数据满足少量独立存储需求;二级分布式数据采集柜多台。

    通过多台数据采集柜互联构成采集柜网状结构,经由网络统一直接连接到一级应用服务器托管,实现应用服务器对所有网络内的数据采集柜的远程连接、访问和管理,同时一级数据服务器接入应用服务器,作为数据管理平台的备份数据存储中心,常规数据全部储存在区块中各自独立的数据采集柜内,网络内电脑通过浏览器开启数据管理中心后台登陆,即可实现远程的数据访问与管理,并根据应用服务器内的权限层级设定,实现不同的功能和效果。

    结构拓扑图见(图1)

    优点:

    该模式下搭建平台更为简单快速,由于单层结构设计,可以大大免去网络层级的部署和规划,同时简化接入流程,提供快速更高效的平台建设和数据传输流程。数据采集柜接入网络,连接应用服务器即可实现托管。建设简单,相对建设成本较低,满足快速搭建小型网络平台或初期建立平台雏形,后续可方便的升级变换架构,升级成中心存储集群式。

    缺点:

    由于采用较为简单的单层结构,数据全部分布存储于数据采集柜,数据存储较为分散,访问并管理的效率较低,同时由于分布存储的原因,只安排了较小的数据服务器满足低比例的特殊备份需求,大量数据分散存储于不同地区采集柜中,数据产生丢失或者无法访问的风险较高,需要稳定的供电和网络维持基本的连接。同时分布式存储导致的数据访问并发情况较多,对网络的承载压力较大,传输链路较多跳转,导致效率较低。

    二、中心存储集群架构

    该架构下系统包含:一级应用服务器一台运行数据管理中心平台软件;一级数据服务器多台或多级数据服务器多台用于备份特定区块数据满足集群数据存储需求;二级分布式数据采集柜多台。

    通过多台数据采集柜互联构成采集柜网状结构,经由网络连接到区块内独立数据服务器,区块设立可依据地区或者业务规划来定,多区块数据服务器最终通过网络统一连接中心应用服务器,实现应用服务器对所有网络内的数据采集柜和数据服务器都能实现远程连接、访问和管理,设定不同的权限层级可满足区块内数据访问的相对独立和区块间的数据仍能通信的需求,同时通过中心应用服务器设定自动化自定义条件任务,自动执行数据从数据采集柜汇总备份到区块数据服务器进行多层级分布式存储,最终实现数据的多重安全备份,高效汇总和自动化的分配目标。

    结构拓扑图见(图2)

    优点:

    该架构下搭建而成的平台具备多区块分布存储备份,数据永不丢失,安全可靠,同时基于分布式存储技术接入网络后可实现更高效的可访问性和更稳定的数据传输。基于自动化的自定义任务可以在网络闲时自动静默汇总分散于采集柜中的零散数据集中传输至区块内的专用数据服务器进行存储,同时借由数据服务器的高速处理能力,实现更高效的远程访问、预览、下载、传输及检索操作。架构内采集工作、数据存储、中心访问分工明确,互不干扰运行更加稳定,同时可方便的无限拓展数据服务器数量,满足长远的平台成长需求。

    缺点:

    该方案搭建需要配合规划区块,搭建相对独立的数据服务器,同时由于多层级的架构加大了初期建设的工程难度和成本,基于分布式存储的形态需要安排更多的服务器安装空间。

    第三部分系统运行环境

    系统分为采集端CS程序和浏览器BS管理程序两部分。

    系统采集程序运行在windows环境下,支持各种版本的windows系统,数据库支持SQL Server系列的数据库或其它版本的关系型数据库。

    对安全帽采集数据的管理后台使用浏览器,支持目前主流的各种版本的浏览器。

    第四部分产品介绍

    智能安全帽

    l高清宽动态摄像头,支持高清录像

    l开机自动录像,免去繁琐操作

    l机身一体化设计,镜头及照明灯内置,产品更美观

    l高强度复合材料帽身,提供专业的安全帽应有的防护功能

    l简约的功能操作设计,一键开机,一键录像,一键亮灯

    l支持大容量最高128GB存储扩展,满足更持久的录像需求

    数据采集柜

    l高强度框架式机身,抗冲击防腐蚀外壳

    l安全内部排布设计,满足长时间连续稳定运行需求

    l内置键盘鼠标,屏幕支持触摸,多种操作方面满足不同场景需求

    l多设备独立存储仓设计,方便单独存储安全帽以及其他装备。

    l智能电子独立门锁设计,可实现独立开启每个存储仓位。

    l支持多设备同时接入,满足大批量安全帽充电需求同时实现自动化数据采集上传

    l支持网络化运行,可单机使用也可接入网络后交由统一服务器托管,实现多台采集柜互联构建采集网络。

    l主柜6口,副柜10口,最多一主两副一共26口,但实际可用最多22口。

    数据管理平台(服务器)

    lBS轻量化设计架构,通用浏览器即可访问,满足更好的兼容性

    l支持多条件数据检索,满足快速书筛选需求

    l支持多层级网络架构,实现不同的平台建设需求

    l支持用户权限管理,根据实际需求定义用户不同权限实现不同管控

    l远程预览,远程下载,可通过网络随时访问数据并进行管理

    l高度自定义的自动化任务系统,设定周期,时间,人员,单位等条件实现自动化数据备份操作。

    第五部分:产品功能说明

    一、产品示意图

  • ?

    干货丨大数据是如何被采集及应用的

    梅米

    展开

    尽管“大数据”一词近年来屡遭热捧

    但很多人都还不知道什么是大数据

    更不知道大数据有甚卵用

    这两年,发现“大数据”这个词出现的越来越频繁了

    不仅企业,连国家都在部署大数据战略

    一番百度了之后

    Oh~ emmmmmmmmm~ +_+

    还是没搞懂大数据到底是个什么玩意儿

    直到有一天

    我发现一个秘密

    不管我在网上搜索什么

    页面都会跳出我要搜索的相关产品或关联事物

    然后,我恍然大悟!

    所谓大数据,就是算法!

    它能够“算”出我们“心中所想”

    那么问题来了

    大数据技术是如何采集到我们的信息的呢?

    数据采集,又称数据获取,是利用一种装置,从系统外部采集数据并输入到系统内部的一个接口。在互联网行业快速发展的今天,数据采集已经被广泛应用于互联网及分布式领域,比如摄像头,麦克风,都是数据采集工具。

    数据采集系统整合了信号、传感器、激励器、信号调理、数据采集设备和应用软件。在数据大爆炸的互联网时代,数据的类型也是复杂多样的,包括结构化数据、半结构化数据、非结构化数据。结构化最常见,就是具有模式的数据。非结构化数据是数据结构不规则或不完整,没有预定义的数据模型,包括所有格式的办公文档、文本、图片、XML, HTML、各类报表、图像和音频/视频信息等等。大数据采集,是大数据分析的入口,所以是相当重要的一个环节。

    我们首先来了解一下数据采集的三大要点:

    一、数据采集的三大要点

    (1)全面性

    数据量足够具有分析价值、数据面足够支撑分析需求。

    比如对于“查看商品详情”这一行为,需要采集用户触发时的环境信息、会话、以及背后的用户id,最后需要统计这一行为在某一时段触发的人数、次数、人均次数、活跃比等。

    (2)多维性

    数据更重要的是能满足分析需求。灵活、快速自定义数据的多种属性和不同类型,从而满足不同的分析目标。

    比如“查看商品详情”这一行为,通过埋点,我们才能知道用户查看的商品是什么、价格、类型、商品id等多个属性。从而知道用户看过哪些商品、什么类型的商品被查看的多、某一个商品被查看了多少次。而不仅仅是知道用户进入了商品详情页。

    (3)高效性

    高效性包含技术执行的高效性、团队内部成员协同的高效性以及数据分析需求和目标实现的高效性。也就是说采集数据一定要明确采集目的,带着问题搜集信息,使信息采集更高效、更有针对性。此外,还要考虑数据的及时性。

    不同应用领域的大数据其特点、数据量、用户群体均不相同。不同领域根据数据源的物理性质及数据分析的目标采取不同的数据采集方法。

    那么,接下来我们再来了解一下常用的数据采集的方法。

    常用的数据采集方法归结为以下三类:传感器、日志文件、网络爬虫。

    (1)传感器

    传感器通常用于测量物理变量,一般包括声音、温湿度、距离、电流等,将测量值转化为数字信号,传送到数据采集点,让物体有了触觉、味觉和嗅觉等感官,让物体慢慢变得活了起来。

    (2)系统日志采集方法

    日志文件数据一般由数据源系统产生,用于记录数据源的执行的各种操作活动,比如网络监控的流量管理、金融应用的股票记账和 web 服务器记录的用户访问行为。

    很多互联网企业都有自己的海量数据采集工具,多用于系统日志采集,如Hadoop的Chukwa,Cloudera的Flume,Facebook的Scribe等,这些工具均采用分布式架构,能满足每秒数百MB的日志数据采集和传输需求。

    (3)Web 爬虫

    网络爬虫是指为搜索引擎下载并存储网页的程序,它是搜索引擎和 web 缓存的主要的数据采集方式。通过网络爬虫或网站公开API等方式从网站上获取数据信息。该方法可以将非结构化数据从网页中抽取出来,将其存储为统一的本地数据文件,并以结构化的方式存储。它支持图片、音频、视频等文件或附件的采集,附件与正文可以自动关联。

    此外,对于企业生产经营数据上的客户数据,财务数据等保密性要求较高的数据,可以通过与数据技术服务商合作,使用特定系统接口等相关方式采集数据。比如八度云计算的数企BDSaaS,无论是数据采集技术、BI数据分析,还是数据的安全性和保密性,都做的很好。

    数据的采集是挖掘数据价值的第一步,当数据量越来越大时,可提取出来的有用数据必然也就更多。只要善用数据化处理平台,便能够保证数据分析结果的有效性,助力企业实现数据驱动。

  • ?

    智能工厂:你一定不知道的企业数据智能采集与处理办法!

    克里斯汀

    展开

    1787年第一架纺织机的出现,第一次工业革命正式拉开序幕。随着蒸汽驱动机械制造设备的出现,人类进入机械时代。

    火车喷出的浓烟在英格兰风景如画的旷野中升起,19世纪末至20世纪初,第二次工业革命将人类带入自动化世界。

    从20世纪四五十年代以来,原子能、电子计算机、微电子技术、航天技术等领域取得重大突破,第三次的工业革命到来,世界格局发生重组改变。

    现在,工业4.0已经到来,第四次工业革命的目标是工厂智能化,是基于信息融合,大数据、物联网等实现智能制造。

    工业4.0离你的企业实务有多远?智能信息化究竟会给你的企业带来什么样的影响?

    比如,制造企业在进行数据采集和处理时经常会遇到类似的问题:

    数据采集效率低;例如:采购收货采用的是打印送货单的方式收货。数据采集耗时长;例如:从到货点收到数据录入系统耗时长。数据处理不智能;例如:库存不足时系统不会自动预警或者智能性的自动转采购订单。

    制造企业只有软硬件完美结合,用智能信息化系统结合智能硬件设备,最终才能实现工厂智能化。

    采购入库通过扫描送货单上的二维码或者条形码,采集送货单号后匹配后台的采购订单信息,自动抓取采购单信息进行数量确认收货,保存后实时上传后台。生产领料生产领料时,可实时查看现有库存及库位,通过扫描库位上的二维码或者条形码进行智能领料。生产入库生产完成后,录入物料信息自动带出库位信息,将货物移转到仓库后扫描库位上的二维码或者条形码进行智能入库。销售出货销售出货时,通过扫描库位上的二维码或者条形码进行物料及数量的匹配后,进行智能出库。盘点仓库盘点时,采用PDA的方式扫描库位上的二维码或者条形码进行快速盘点。简易报工扫描制令单上的二维码,自动带出工序讯息后维护数量,轻松完成报工。简便追溯客户发现品质疑问产品,用手机或二维码扫描设备扫码产品二维码,即显示该产品的生产相关信息,如:公司,生产班组、作业员、检验员、出厂日期。

    经过信息化管理之后,企业数据实现快速收集以及智能处理。正如正航智能制造解决方案,帮助企业搭建智能管理平台,提升企业生产效率、提高产能、规避错误、放大管理力,通过快速,智能的工作方式帮助企业实现流程的规范化,智能化,最终实现工厂智能化。

  • ?

    好程序员:大数据采集与处理

    Glenna

    展开

    |本文由好程序员特训营编辑

    |作者:好程序员

    1. 大数据处理之一:采集

    大数据的采集是指利用多个数据库来接收发自客户端(Web、App或者传感器形式等)的 数据,并且用户可以通过这些数据库来进行简单的查询和处理工作。比如,电商会使用传统的关系型数据库MySQL和Oracle等来存储每一笔事务数据,除 此之外,Redis和MongoDB这样的NoSQL数据库也常用于数据的采集。

    在大数据的采集过程中,其主要特点和挑战是并发数高,因为同时有可能会有成千上万的用户来进行访问和操作,比如火车票售票网站和淘宝,它们并发的访问量在峰值时达到上百万,所以需要在采集端部署大量数据库才能支撑。并且如何在这些数据库之间进行负载均衡和分片的确是需要深入的思考和设计。

    2. 大数据处理之二:导入/预处理

    虽然采集端本身会有很多数据库,但是如果要对这些海量数据进行有效的分析,还是应该将这些来自前端的数据导入到一个集中的大型分布式数据库,或者分布式存储集群,并且可以在导入基础上做一些简单的清洗和预处理工作。也有一些用户会在导入时使用来自Twitter的Storm来对数据进行流式计算,来满足部分业务的实时计算需求。

    导入与预处理过程的特点和挑战主要是导入的数据量大,每秒钟的导入量经常会达到百兆,甚至千兆级别。

    3. 大数据处理之三:统计/分析

    统计与分析主要利用分布式数据库,或者分布式计算集群来对存储于其内的海量数据进行普通的分析和分类汇总等,以满足大多数常见的分析需求,在这方面,一些实时性需求会用到EMC的GreenPlum、Oracle的Exadata,以及基于 MySQL的列式存储Infobright等,而一些批处理,或者基于半结构化数据的需求可以使用Hadoop。

    统计与分析这部分的主要特点和挑战是分析涉及的数据量大,其对系统资源,特别是I/O会有极大的占用。

    4. 大数据处理之四:挖掘

    与前面统计和分析过程不同的是,数据挖掘一般没有什么预先设定好的主题,主要是在现有数据上面进行基于各种算法的计算,从而起到预测(Predict)的效果,从而实现一些高级别数据分析的需求。比较典型算法有用于聚类的Kmeans、用于 统计学习的SVM和用于分类的NaiveBayes,主要使用的工具有Hadoop的Mahout等。该过程的特点和挑战主要是用于挖掘的算法很复杂,并 且计算涉及的数据量和计算量都很大,常用数据挖掘算法都以单线程为主。

    欢迎关注【“好程序员”百家号】高端IT教育--从平凡到卓越 为梦想而拼搏

  • ?

    数据采集过程中的常见问题

    hahacoon

    展开

    经过两周的整理总结,沉淀出来好多数据采集的经验与大家分享。

    前嗅免费模板共享链接:http://forenose/help/collection/template/cases.html

    1.如何进行数据采集?

    ①下载安装软件后,登录到软件上。

    ②准备好模板:在前嗅的官网上下载免费的模板或自己配置好的模板

    ③将下载的官网导入到软件中。

    点击文件---点击导入采集文件(将采集文件导入,自己配置的模板请忽略这一步)

    ④在数据建表中建关联数据表

    选中需要采集模板下的表单---点击创建关联数据表,所创表名不能为汉字,点击确定---在所创数据表前的方框打勾即可关联数据表。详情见下图。

    此时在数据浏览中就存在了刚刚建的关联数据表。

    ⑤进行数据采集。

    在需要进行数据采集的模板前打勾--点击允许采集--点击开始按钮即可进行数据采集。详情见下图。

    ⑥数据预览及导出

    选中关联表---点击刷新按钮即可查看数据---点击导出按钮即可导出数据。详情见下图。

    多种导出方式:

    a.可以将采集到的数据全部导出。

    b.可以将数据分割导出,设置特定数目后数据会分别储存放在文件夹中。

    c.可以将每个字段所采集到的内容分别导出到不同文件夹,方便查看。

    数据导出教程:

    http://forenose/help/guildbook/crawler_new/5-2.html

    2.所采集的网站弹验证码是怎么回事?

    弹验证码分为四种情况:

    ①登录需要验证码:登录时只需要一个验证码,所以直接手动填写配置即可。

    ②多账号登录:每次账号登录都需要验证码,此时应该接第三方打码平台。

    前嗅(forenose)是首个深度大数据专家。

    提供数据采集-分析-处理-管理-营销-应用,自主知识产权的全套大数据产品 。

  • ?

    数据采集使用与保护隐私如何处理

    香菱

    展开

    全球进入互联网特别是移动互联网时代后,一个巨大进步是一切活动包括政治经济文化娱乐等都在往互联网特别是移动互联网这个舞台上转移。所有社会活动、经济金融交易等都在网络上留下了痕迹或者说有迹可循。这相对于过去在网络线下相比较带来的进步是革命性、历史性、颠覆性的。

    革命性主要在于通过对人们在网路上留下的印记的采集、挖掘、提炼与分析,可以分析出背后许多经济金融文化甚至政治等有巨大价值的东西。思想支配行动,行动又反映思想。从网路上的留印行动中挖掘分析后就可以基本得出其思想所在,从网络上对一个主体各个方面留痕进行大挖掘、大计算、大分析基本就可以摸清楚预测出来这个主体想要什么,需求何在?这就可以分类施策、细分客户、精准营销。这个商业价值,其实不仅是商业价值包括政治文化价值都是无限的。

    我仅从经济学上讲一个例子。此前,马云曾经讲过,大数据、云计算诞生以后,经济或可以进入到计划经济体制里。猛一看,貌似梦想一样,但细细分析似乎也不无道理。计划经济与市场经济都是配置资源的手段。计划经济之所以比市场经济在效率等方面低,弊端多,不在于计划经济体制本身,而在于没有技术等手段与能力来实现计划经济的高效性与准确性。过去往往是拍脑袋搞计划,即使到市场调查,准确性也难以达到。这是问题所在。

    目前有了网络,有了网络上的大数据积累,有了云计算,或给计划经济以重新复活的机会,给了计划经济体制优越性以证明的机会。这种可能性不是没有。插上大数据、云计算翅膀的计划经济或比市场经济更加高效,更加精准,对市场的周期性破坏或就此消失。

    这就是所说的大数据是一座大金库的原因。不过,这个大金库要充分挖掘与发挥出来的话,一个大前提是要对大数据进行充分的采集、挖掘、整理、甄别、分类、分析等。这个大数据中包括你我他几乎全部在网路上的百姓民众消费者。也就是说,每一个在网络上留下印记即数据的你我她他都是被分析的对象,你留下的几乎所有信息都在被采集挖掘分析的范围之内。这就牵扯到另一个问题:隐私保护问题。

    近期,用户在查阅自己的支付宝年度账单时默认勾选“我同意《芝麻服务协议》”这件事引起一阵波澜,蚂蚁金服也回应道歉了。无论处于什么好意,默认勾选“同意”肯定是不合适的。不过,从这件事中的一些争论反应看,确实存在着一些对大数据在采集使用与隐私保护上的较大偏差甚至是糊涂认识。需要以理性的思考予以梳理厘清。

    我的认识是,只要你在网路上留下了印记即数据基本上没有隐私可言。即使在没有网络、都是线下交易活动的过去也基本如此。例如:过去你到银行办理存款贷款汇款,你到房管所办理房子登记过户,你到派出所办理户口入户迁移,你办理入学入托上大学等等都要登记家庭、身份证、电话等基本情况与信息。现在在网络上同样如此。只要存在这些情况,你的信息或者隐私已经裸露出来了。除非你生活在大山深处的世外桃源里。

    当然,在网络时代个人信息与隐私或者裸露的更加严重而已。这里一个关键问题必须甄别清楚,每一个人在网络积累的大数据不让采集挖掘分析使用是绝对不行的。这不是对大数据金矿的极大浪费吗?关键在于如何使用?关键在于不是不让使用而是使用后一定要为客户的隐私以及普通信息数据保密。保密,是问题的关键所在。

    对每一个人数据信息的使用是不可避免的。只要有交易,就一定要使用你的数据。比如,你有贷款信用需求,这个金融交易一定要充分使用你的数据信息的。网络信息如此,线下在银行贷款比如房贷等,对你的个人所有情况、数据信息等几乎是挖地三尺的。关键在于使用以后,不能泄露给第三方,要替交易客户保护好数据信息。所谓的保护隐私数据,主要的问题在这里。

    非金融信用业务也有保护数据信息隐私问题。你去一个网站注册、你想使用共享单车都需要注册相关信息数据的。注册这些数据信息以后,你不能说不让网站等挖掘使用你的数据信息,注册时也等于是一种交易,除非你不注册。关键的问题还在于,网站、共享单车等使用客户数据后,一定要对客户保密。

    这里面牵扯第三方使用数据如何办的问题。我个人认为,牵扯所有经济体的金融信用数据问题,各大平台包括央行在内都可以共享信用等级数据。目的在于形成一种“有信走遍天下,无信寸步难行”的社会氛围与高压态势,使有信用者得以提倡褒扬,无信用者如过街老鼠人人喊打。全社会形成:信用贵如金子,无信耻辱透顶,这才能形成信用的正向激励机制。

    第三方使用其它数据,网站等平台应该通过协议约束征得被采集人的同意。同样,必须有约束条款,第三方也必须给客户数据信息保密。

    总之,大数据这座金矿必须充分利用使用与挖掘开采,不能造成这么宝贵的大数据资源闲置浪费,同时,使用以后关键在于要保护好被采集数据者的数据信息以及隐私。

数据采集处理

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP