中企动力 > 商学院 > 几大数据库
  • ?

    一起来学大数据|数据库和表结构的基本操作

    掌纹

    展开

    上篇文章我们学到了如何安装数据库,下来我们学习数据库的一些基本的操作,其中也包括对表的操作。

    数据库基本操作

    show databases;通过此命令可以实现查看所有的数据 库名称,就像下图,这是默认的一些数据库

    create database dbName ;通过此我们可以在数据库系统中创建一个叫reba的数据库

    create database reba character set utf8 ;这条命令与上述命令类似,我们在上面的基础上加上了对数据库字符编码集的限制,能够保证我们的中文在系统中不会出错。

    use dbName ;在use后面加入数据库的名字,也就是打开数据库。在下面创建表的时候必须先打开数据库,在进行建表操作。

    select database();与show类似,同样是查看数据库,不同的是Select查看的当前所正在使用的数据库名称。

    show create database reba ;这条命令是查看创建数据库reba的时候所使用的字符集。

    drop database dbname;删除数据库的操作,

    数据库中创建一个表,相当于在Java中新建一个User类,然后对其封装,List便是一张数据表。

    List

    1.数据类型

    表中的字段数据类型有很多种,如下图,其实我们常用的有int和char,varchar这几种数据类型。

    表字段数据类型

    在这里有人会问char和varchar有什么区别?

    char是一个定长的字符串,它的长度不会变化,而varchar在小于指定长度的情况下,它的长度会根据存储的长度而改变,是一个可变长度的字符串。

    2.约束

    俗话说的好,没有规矩不成方圆。通过这些约束我们可以实现对数据的规范,方便我们对数据的操作。

    表结构操作

    1-创建表

    在java中我们这样来创建一张表

    class User{

    int age ;

    String name ;}

    类比数据库中,我们使用这样的方法,其实这也是一门语言

    create table t_user2(

    age int ,

    name varchar(100) default ‘lisi’)

    创建表的语法

    表建好之后我们使用desc 表名 来查看表的信息

    查看表的字符编码集就是表的创建语句 show create table 表名;

    2-修改表结构

    在修改表中我们使用关键字alter来对表进行操作,具体的内容如下。

    修改表

    通过这些命令,我们可修改表的列名,表的属性以及添加和删除一列的数据。但是,我们基本不用修改表的做这些命令,迫不得已额尽量别用。

    3.删除表

    删除表我们也是一般不用,其中的语法有:

    drop table 表名;

    TRUNCATE TABLE 表名

    这两种方式前面的是有条件的删除,自动增加的主键不会初始化,而后者是直接全部删除,不可退回,速度快,相当于新建了一张表,这个表与之前的一模一样,而且自增的主键也会从头开始计算。

    之前你可能遇到这样的情况,强迫症的你就得使用第二种方式

    这就是对表的一些基本操作,当然我们这里并没有去写对表的数据进行操作。

    下篇文章我们将会对数据坤单表和多表数据的操作做一个详细的说明,有什么一下下方留言!帮助到你的话,关注一下我哟~谢谢大家支持。

    感谢坚持关注的朋友

    世界很大,幸好有你

    欢迎在评论区留下你的问题或困惑,我将每天与你分享我的观点和心得。

    聚焦最新科技咨讯,探寻未来智能领域,我是女陶。

  • ?

    大数据-数据挖掘概述

    许语琴

    展开

    数据挖掘是指在大量的数据中挖掘出信息,通过认真分析来揭示数据之间有意义的联系、趋势和模式。而数据挖掘技术就是指为了完成数据挖掘任务所需要的全部技术。金融、零售等企业已广泛采用数据挖掘技术,分析用户的可信度和购物偏好等。大数据研究采用数据挖掘技术,但是数据挖掘中的短期行为较多,多数是为某个具体问题研究应用技术,还无统一的理论。传统的数据挖掘技术在数据维度和规模增大时,所需资源呈现指数级增长,所以对PB级以上的大数据还需研究新的方法。

    数据挖掘概述

    数据挖掘是近年来伴随数据库系统的大量建立和万维网的广泛应用而发展起来的一门技术。数据挖掘是交叉性学科,它是数据库技术、机器学习、统计学、人工智能、可视化分析、模式识别等多门学科的融合,如下图所示。

    数据挖掘的几个概念

    数据挖掘

    数据挖掘是指从大量的、不完全的、有噪声的、模糊的、随机的实际数据中,提取隐含其内的、人们实现所不知的,但又是有潜在价值的信息和知识的过程。几点说明如下。

    数据挖掘涉及数据融合、数据分析和决策支持等内容。数据源必须是真实的、大量的、含有噪声的、用户感兴趣的数据。发现的知识要可接受、可理解、可运用,并不要求发现放之四海而皆准的知识,仅支持特定的问题。数据是知识的源泉,将概念、规则、模式、规律和约束等视为知识,这就好像从矿石中采矿或淘金一样,从数据中获取知识。原始数据可以是结构化数据,如关系型数据库中的数据等,也可以是非结构化数据,如文本、图形和图像等,还可以是半结构化数据,如网页等。挖掘知识的方法可以是数学的方法,也可以是非数学的方法;可以是演绎的方法,也可以是归纳的方法。挖掘的知识具有应用的价值,可以用于信息管理、查询优化、决策支持和过程控制等,还可以用于数据自身的维护。数据挖掘是一门交叉学科,将人们对数据的应用从低层次的简单查询,提升到从数据中挖掘知识,提供决策支持。在需求推动下,不同领域的研究者,尤其是数据库技术、人工智能技术、数理统计、可视化技术、并行计算等方面的知识融合后,形成新的研究热点。

    数据的挖掘首先是搜集数据,数据越丰富越好,数据量越大越好,只有获得足够的高质量的数据,才能获得确定的判断,才能产生认知模型,这是量变到质变的过程。由此产生经验,经验的积累就能产生有价值的判断。认知模型是渐进发展的模型,当认识深入以后,将长生更加抽象的模型与许多猜想,通过猜想再扩展模型,从而达到深度学习和深度挖掘。

    2. 数据挖掘分类

    数据挖掘可以分为两类:直接数据挖掘和间接数据挖掘。

    (1)直接数据挖掘

    直接数据挖掘的目标是利用可用的数据建立一个模型,利用这个模型对剩余的数据,对一个特定的变量(可以理解成数据库中标的属性,即列)进行描述。分类、估值、预测属于直接数据挖掘。

    (2)间接数据挖掘

    间接数据挖掘目标中没有选出某一具体的变量,用模型进行描述,而是在所有的变量中建立起某种关系。相关性分组或关联规则、聚类、描述和可视化以及复杂数据类型挖掘。

    3. 数据挖掘技术

    数据挖掘技术是数据挖掘方法的集合,数据挖掘方法众多。根据挖掘任务可将数据挖掘技术分为预测模型发现、聚类分析、分类与回归、关联分析、序列模式发现、依赖关系或依赖模型发现、异常和趋势发现、离群点检测等。根据挖掘对象可分为关系数据库、面向对象数据库、空间数据库、时态数据库、文本数据源、多媒体数据库、异质数据库、遗产数据库以及环球网Web。根据挖掘方法可分为机器学习方法、统计方法、神经网络方法和数据库方法。机器学习方法中,可细分为归纳学习方法(决策树、规则归纳等)、基于范例学习、遗传算法等。统计方法中,可细分为回归分析(多元回归、自回归等)、判别分析(贝叶斯判别、费歇尔判别和非参数判别等)、聚类分析(系统聚类、动态聚类等)、探索性分析(主元分析法、相关分析法等)等。神经网络方法中,可细分为前向神经网络(BP算法等)、自组织神经网络(自组织特征映射、竞争学习等)等。数据库方法主要是多维数据分析或OLAP方法,另外还有面向属性的归纳方法。

    数据挖掘应用了来自其他一些领域的思想与算法,主要包括:

    统计学的抽样、估计和假设检验。人工智能、模式识别和机器学习的搜索算法、建模技术和学习理论。最优化、进化计算、信息论、信号处理、可视化和信息检索。

    其他一些领域的技术也起到重要的支撑作用,需要数据库系统提供有效的存储、索引和查询处理支持。高性能计算技术、并行计算技术、分布式技术也能帮助处理数据,当数据不能集中到一起处理时更是至关重要。

  • ?

    什么叫大数据分析

    祁幻姬

    展开

    大数据行业发展如火如荼,国家政策利好,互联网大佬纷纷在大数据行业布局,我们想让自己的职业生涯在一个朝阳行业发展,肯定又要学习相关技术,让自己与时俱进,但是难就难在大数据是一个新兴事物,目前我国大学的专业里面还鲜少有这个专业,国家刚批的大数据专业,全国目前35个高校,但是从17年开始招生,2021年才有第一批毕业生进入职场,在四年期间,是大数据行业发展的飞速时期,没有行业发展是等着人才进入的,而是需要要虚位以待、蓄势待发,所以在没有高等教育准备好的大数据教育,如何高效的学习大数据,如何快速的与行业发展想契合,那么需要我们成为第一个吃螃蟹的人,作为一个随着大数据行业成长的职业人,首先要知道大数据是个啥?

    大数据(big data),指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。

    那来帮大家分析下:如何高效的学习大数据。

    经常有初学者会问,自己想往大数据方向发展,该学哪些技术,学习路线是什么样的,觉得大数据很火,就业很好,薪资很高……首先,如果你确定了想往这个方面发展,先考虑自己的过去从业经历、专业、兴趣是什么。计算机专业——操作系统、硬件、网络、服务器?软件专业——软件开发、编程、写代码?还是数学、统计学专业——对数据和数字特别感兴趣?

    那么你能找师傅带吗?

    但凡有这种想法的人,或多或少都会存有侥幸之心,或者叫做“天真,单纯”。希望不花一分钱,就能更快速的学到更优质,更实用的技能。

    关于这一点,我只想反问一句你:“如果你是大师,你凭什么愿意带我?”

    其实这就是想告诉你大数据的三个发展方向,平台搭建/优化/运维/监控、大数据开发/设计/架构、数据分析/挖掘。

    先说一下大数据的4V特征:

    数据量大,TB->PB

    数据类型繁多,结构化、非结构化文本、日志、视频、图片、地理位置等;

    商业价值高,但是这种价值需要在海量数据之上,通过数据分析与机器学习更快速的挖掘出来;

    处理时效性高,海量数据的处理需求不再局限在离线计算当中。

    现如今,正式为了应对大数据的这几个特点,开源的大数据框架越来越多,越来越强,先列举一些常见的:

    文件存储:Hadoop HDFS、Tachyon、KFS

    离线计算:Hadoop MapReduce、Spark

    流式、实时计算:Storm、Spark Streaming、S4、Heron

    K-V、NOSQL数据库:HBase、Redis、MongoDB

    资源管理:YARN、Mesos

    日志收集:Flume、Scribe、Logstash、Kibana

    消息系统:Kafka、StormMQ、ZeroMQ、RabbitMQ

    查询分析:Hive、Impala、Pig、Presto、Phoenix、SparkSQL、Drill、Flink、Kylin、Druid

    分布式协调服务:Zookeeper

    集群管理与监控:Ambari、Ganglia、Nagios、Cloudera Manager

    数据挖掘、机器学习:Mahout、Spark MLLib

    数据同步:Sqoop

    任务调度:Oozie

    ······

    第一步:初识Hadoop

    1.1 学会百度与Google

    不论遇到什么问题,先试试搜索并自己解决。

    Google首选,翻不过去的,就用百度吧。

    1.2 参考资料首选官方文档

    特别是对于入门来说,官方文档永远是首选文档。

    相信搞这块的大多是文化人,英文凑合就行,实在看不下去的,请参考第一步。

    1.3 先让Hadoop跑起来

    Hadoop可以算是大数据存储和计算的开山鼻祖,现在大多开源的大数据框架都依赖Hadoop或者与它能很好的兼容。

    关于Hadoop,你至少需要搞清楚以下是什么:

    · Hadoop 1.0、Hadoop 2.0

    · MapReduce、HDFS

    · NameNode、DataNode

    · JobTracker、TaskTracker

    · Yarn、ResourceManager、NodeManager

    自己搭建Hadoop,请使用第一步和第二步,能让它跑起来就行。

    建议先使用安装包命令行安装,不要使用管理工具安装。

    另外:Hadoop1.0知道它就行了,现在都用Hadoop 2.0.

    1.4 尝试使用Hadoop

    · HDFS目录操作命令;

    · 上传、下载文件命令;

    · 提交运行MapReduce示例程序;

    · 打开Hadoop WEB界面,查看Job运行状态,查看Job运行日志。

    · 知道Hadoop的系统日志在哪里。

    1.5了解它们的原理

    MapReduce:如何分而治之;

    HDFS:数据到底在哪里,什么是副本;

    Yarn到底是什么,它能干什么;

    NameNode到底在干些什么;

    ResourceManager到底在干些什么;

    1.6 自己写一个MapReduce程序

    仿照WordCount例子,自己写一个(照抄也行)WordCount程序,

    打包并提交到Hadoop运行。

    不会Java的话,Shell、Python都可以,有个东西叫Hadoop Streaming。

    如果能认真完成了以上几步,恭喜你,你的一只脚已经进来了。

    第二步:更高效的WordCount

    2.1 学点SQL吧

    如果不懂数据库的童鞋先学习使用SQL句。

    2.2 SQL版WordCount

    在1.6中,你写(或者抄)的WordCount一共有几行代码?

    如果用SQL的话:

    SELECT word,COUNT(1) FROM wordcount GROUP BY word;

    这便是SQL的魅力,编程需要几十行,甚至上百行代码,SQL一句就搞定;使用SQL处理分析Hadoop上的数据,方便、高效、易上手、更是趋势。不论是离线计算还是实时计算,越来越多的大数据处理框架都在积极提供SQL接口。

    2.3 安装配置Hive

    Hive算是数据仓库工具,安装不难,网上有很多教程,配置完成后,可以正常进入Hive命令行。

    2.4 试试使用Hive

    尝试在Hive中创建wordcount表,并运行2.2中的SQL语句。在Hadoop WEB界面中找到刚才运行的SQL任务。看SQL查询结果是否和1.4中MapReduce中的结果一致。

    明明写的是SQL,为什么Hadoop WEB界面中看到的是MapReduce任务?

    2.5 学会Hive的基本命令

    创建、删除表;加载数据到表;下载Hive表的数据;并学习更多关于Hive的语法和命令。

    0和Hadoop2.0的区别

    MapReduce的原理(还是那个经典的题目,一个10G大小的文件,给定1G大小的内存,如何使用Java程序统计出现次数最多的10个单词及次数);

    HDFS读写数据的流程;向HDFS中PUT数据;从HDFS中下载数据;

    自己会写简单的MapReduce程序,运行出现问题,知道在哪里查看日志;

    会写简单的SELECT、WHERE、GROUP BY等SQL语句;

    Hive SQL转换成MapReduce的大致流程;

    Hive中常见的语句:创建表、删除表、往表中加载数据、分区、将表中数据下载到本地;

    从上面的学习,你已经了解到,HDFS是Hadoop提供的分布式存储框架,它可以用来存储海量数据,MapReduce是Hadoop提供的分布式计算框架,它可以用来统计和分析HDFS上的海量数据,而Hive则是SQL On Hadoop,Hive提供了SQL接口,开发人员只需要编写简单易上手的SQL语句,Hive负责把SQL翻译成MapReduce,提交运行。

    第三步:把别处的数据搞到Hadoop上

    此处也可以叫做数据采集,把各个数据源的数据采集到Hadoop上。

    3.1 HDFS PUT命令

    put命令在实际环境中也比较常用,通常配合shell、python等脚本语言来使用。建议需熟练掌握。

    3.2 HDFS API

    HDFS提供了写数据的API,自己用编程语言将数据写入HDFS,put命令本身也是使用API。

    实际环境中一般自己较少编写程序使用API来写数据到HDFS,通常都是使用其他框架封装好的方法。比如:Hive中的INSERT语句,Spark中的saveAsTextfile等。

    可以尝试了解原理,试着写几个Demo。

    3.3 Sqoop

    Sqoop是一个主要用于Hadoop/Hive与传统关系型数据库Oracle/MySQL/SQLServer等之间进行数据交换的开源框架。

    就像Hive把SQL翻译成MapReduce一样,Sqoop把你指定的参数翻译成MapReduce,提交到Hadoop运行,完成Hadoop与其他数据库之间的数据交换。

    自己下载和配置Sqoop(建议先使用Sqoop1,Sqoop2比较复杂)。

    了解Sqoop常用的配置参数和方法。

    使用Sqoop完成从MySQL同步数据到HDFS;

    使用Sqoop完成从MySQL同步数据到Hive表;

    PS:如果后续选型确定使用Sqoop作为数据交换工具,那么建议熟练掌握,否则,了解和会用Demo即可。

    3.4 Flume

    Flume是一个分布式的海量日志采集和传输框架,因为“采集和传输框架”,所以它并不适合关系型数据库的数据采集和传输。Flume可以实时的从网络协议、消息系统、文件系统采集日志,并传输到HDFS上。因此,如果你的业务有这些数据源的数据,并且需要实时的采集,那么就应该考虑使用Flume。

    下载和配置Flume。使用Flume监控一个不断追加数据的文件,并将数据传输到HDFS;

    PS:Flume的配置和使用较为复杂,如果你没有足够的兴趣和耐心,可以先跳过Flume。

    3.5 阿里开源的DataX

    之所以介绍这个,是因为以前某公司客户目前使用的Hadoop与关系型数据库数据交换的工具,就是之前基于DataX开发的,个人感觉非常好用。现在DataX已经是3.0版本,支持很多数据源。你也可以在其之上做二次开发。

    PS:有兴趣的可以研究和使用一下,对比一下它与Sqoop。

    至此,你的“大数据平台”应该是这样的:

    第四步:把Hadoop上的数据搞到别处去

    前面介绍了如何把数据源的数据采集到Hadoop上,数据到Hadoop上之后,便可以使用Hive和MapReduce进行分析了。那么接下来的问题是,分析完的结果如何从Hadoop上同步到其他系统和应用中去呢?

    其实此处的方法和第三步基本一致的。

    4.1 HDFS GET命令

    把HDFS上的文件GET到本地。需要熟练掌握。

    4.2 HDFS API

    原理同3.2。

    4.3 Sqoop

    原理同3.3。

    使用Sqoop完成将HDFS上的文件同步到MySQL;

    使用Sqoop完成将Hive表中的数据同步到MySQL;

    4.4 DataX

    原理同3.4

    此时,“你的大数据平台”应该是这样的:

    走完第三步和第四步的流程,那么你应该已经具备以下技能和知识点:

    · 知道如何把已有的数据采集到HDFS上,包括离线采集和实时采集;

    · 知道sqoop(或者还有DataX)是HDFS和其他数据源之间的数据交换工具;

    · 知道flume可以用作实时的日志采集;

    至此,对于大数据平台,应该已经掌握如何搭建Hadoop集群,把数据采集到Hadoop上,使用Hive和MapReduce来分析数据,把分析结果同步到其他数据源。

    接下来的问题就是,Hive使用的越来越多,你会发现很多不愉快的地方,特别是速度慢,

    大多情况下,明明我的数据量很小,它都要申请资源,启动MapReduce来执行。

    第五步:快一点吧,我的SQL

    其实大家都已经发现Hive后台使用MapReduce作为执行引擎,实在是有点慢。因此SQL On Hadoop的框架越来越多,按我的了解,最常用的按照流行度依次为SparkSQL、Impala和Presto.这三种框架基于半内存或者全内存,提供了SQL接口来快速查询分析Hadoop上的数据。

    目前我们的方案使用的是SparkSQL,至于为什么用SparkSQL,原因大概如下:

    · 使用Spark还做了其他事情,不想引入过多的框架;

    · Impala对内存的需求太大,没有过多资源部署;

    5.1 关于Spark和SparkSQL

    什么是Spark,什么是SparkSQL。

    Spark有的核心概念及名词解释。

    SparkSQL和Spark是什么关系,SparkSQL和Hive是什么关系。

    5.2 如何部署和运行SparkSQL

    Spark有哪些部署模式?

    如何在Yarn上运行SparkSQL?

    使用SparkSQL查询Hive中的表。

    PS:Spark不是一门短时间内就能掌握的技术,因此建议在了解了Spark之后,可以先从SparkSQL入手,循序渐进。

    第六步:一夫多妻制

    其实我想说的是数据的一次采集、多次消费。

    在实际业务场景下,特别是对于一些监控日志,想即时的从日志中了解一些指标(关于实时计算,后面步节会有介绍),这时候,从HDFS上分析就太慢了,尽管是通过Flume采集的,但Flume也不能间隔很短就往HDFS上滚动文件,这样会导致小文件特别多。

    为了满足数据的一次采集、多次消费的需求,这里要说的便是Kafka。

    6.1 关于Kafka

    Kafka是一种高吞吐量的分布式发布订阅消息系统,它可以处理消费者规模的网站中的所有动作流数据。这种动作(网页浏览,搜索和其他用户的行动)是在现代网络上的许多社会功能的一个关键因素。这些数据通常是由于吞吐量的要求而通过处理日志和日志聚合来解决。

    6.2 如何部署和使用Kafka

    使用单机部署Kafka,并成功运行自带的生产者和消费者例子。

    使用Java程序自己编写并运行生产者和消费者程序。

    Flume和Kafka的集成,使用Flume监控日志,并将日志数据实时发送至Kafka。

    至此,“大数据平台”应该扩充成这样:

    这时,使用Flume采集的数据,不是直接到HDFS上,而是先到Kafka,Kafka中的数据可以由多个消费者同时消费,其中一个消费者,就是将数据同步到HDFS。

    总结:

    为什么Spark比MapReduce快。

    使用SparkSQL代替Hive,更快的运行SQL。

    使用Kafka完成数据的一次收集,多次消费架构。

    自己可以写程序完成Kafka的生产者和消费者。

    前面的学习已经掌握了大数据平台中的数据采集、数据存储和计算、数据交换等大部分技能,而这其中的每一步,都需要一个任务(程序)来完成,各个任务...

  • ?

    全国首份“中国家庭大数据库”在浙大发布

    Selena

    展开

    浙江24小时-钱江晚报首席记者 王湛

    通讯员 郑淑婧

    “中国家庭大数据库正式开放。”

    12月25日,浙江大学紫金港校区圆正启真酒店的报告厅内响起了掌声。音乐声里,浙江大学常务副校长任少波、浙江大学副校长罗卫东、浙江省社会科学界联合会秘书长谢利根等人戴着红色的围巾,将各自的手掌放在了一个透明的启动球上。

    启动球被点亮了,这意味着我国首个以线下抽样调查数据、互联网大数据和政府政务数据“三位一体”构思布局的数据库——“中国家庭大数据库”,在浙江大学公开发布了。

    供人文社科领域研究者使用的“接地气”的一手资料

    “这次调研不仅让我们获得了专业的数据调查和处理培训,也让我们用行动感知了社会基层,了解了百态的人生。”演讲台上,浙大经济学院的研究生潘治东没有忘记,今年暑假,他在杭州市江干区,拿着早餐、耐着酷暑,带领调查员们到社区和村落入户采集数据的经历。

    如今,他可以亲眼见证,在经过4个月左右的数据清洗后,他与包括安徽大学、福建农林大学学生在内的300多位督导和访员历时两个半月采集的数据被纳入了中国家庭大数据库,成为了可以供我国人文社科领域的研究者们使用的“接地气”的一手资料。

    从2011年至2017年,经过4轮追踪调查,数据库中收集了大量涉及中国城乡家庭基本结构、就业、收支、财富、农业生产经营、土地利用与流转、人口迁移与市民化、金融行为、社会保障、教育等各方面的信息资料。

    2017年的数据涉及中国29个省(市、区)、40011户家庭、127012人(其中农村样本共12732户、81945人),具有全国、省级和副省级城市代表性,并在城镇、农村研究层面具有代表意义。

    “数据是我们的土地。”罗卫东将社会科学研究比作耕地,把学者的科学素养比作农业耕作的技能,而数据则是学者进行社会科学研究的根基,“没有地肯定不行,所以我们建设数据库,其实是在做‘圈地运动’。”

    社会科学研究基础平台主任甘犁认为,尽管中国问题日益受到世界的关注,但在中国社会科学领域,对于微观数据的调查与搜集缺失明显。在浙大公布的“中国家庭大数据”之前,中国没有公开的、由第三方机构提供的全国性的家庭消费、贫困人口、时间使用、出行、教育等多个社会领域的调查数据,这使得现有的研究难以与中国的社会与市场需求相匹配。

    “我们的数据库以线下抽样调查数据作为最主要的数据来源,工作做得非常实,希望能够真正为社会研究和社会决策提供支撑。”罗卫东表示。

    免费向研究人员开放

    如何申请有详细要求

    “中国家庭大数据库”通过网上数据安全平台,免费向校内外研究人员和师生开放数据。利用这些数据,研究人员们究竟可以做些什么呢?

    在浙大向与会者们提供的资料袋中,有一本由浙江大学出版社出版的、厚达305页的蓝皮书。深蓝色封面上,白色的大字写着《中国农村家庭发展报告》(2016)。

    这一本发展报告由浙江大学中国农村家庭研究创新团队所著,于2017年6月10日公开发表,书中使用的数据正是来自于“中国家庭大数据库”中2015年及以前在中国农村家庭追踪调查获得的相关资料。

    通过研究、整理数据,蓝皮书对对中国农村家庭发展状况展开了研究,挖掘出了我国农村社会发展的诸多问题。例如在人口结构方面,中国农村性别失衡现象日趋严重,尤其是0-4岁少儿男女的性别比已达122:100;农村老龄化趋势加剧,老年人口占比已达到15.2%;农村大龄未婚人口比例逐渐上升,“剩男”问题尤其突出。

    在教育方面,中国农村,九年制义务教育效果显著,但仍有9.5%的“90后”未达初中毕业。农村人口受教育程度较低,但改善趋势明显;新生代农民工整体素质明显提高市民化行为也有较大变化;

    在就业与收入方面,农村收入不均日渐严重,收入最高20%家庭占所有家庭总收入的53%;耕地长期流转比例提高趋势明显,跨期限流转现象增加;农民工家庭“离农”趋势十分明显,农地流转与规模化速度加快;农村家庭正规渠信贷需求难满足,民间借贷成主要渠道;新生代农民工劳动供给时间明显下降,加剧人口红利下降速度。

    罗卫东说:“虽然这个报告只用了九牛一毛的数据,但在学术界已经引起了很大的反响。”

    校内外的研究者要如何才能获取数据库中的数据?浙江大学采用国际通行的做法,提供数据共享服务。

    据社会科学研究基础平台提供的《数据使用指导手册》,研究者如有数据使用需求,首先需要提交自己的研究方案,发送申请邮件至rwskdata@zju.edu,提出相关申请。再根据回复邮件提示,提交相关的申请材料。

    收到材料后,浙大社会科学研究基础平台会对有关材料进行审核,审核的结果将会以邮件形式发送给申请人。通过审核的研究者就可以根据邮件提示信息进行相关使用数据的操作了。如果没有通过审核,则需要申请人根据提示的信息修改相应的内容。

    在数据安全平台在线使用数据后,研究人员的数据使用结果会存放在在线平台上。如果需要将数据计算结果下载下来,则需要在平台的“审核外发系统”上提交外发申请,审核通过后方能下载。

    目前,“中国家庭大数据库”的数据仅限于用于学术研究。

  • ?

    服务器常用的数据库有很多,你用到了哪一个?

    鲍老黑

    展开

    服务器托管最常用的数据库有三个,分别是Access、SQL Serve和MySQL,之前比较常用的是Access这种数据库,但是现在MYSQL或者MSSQL是比较常用的,关于这三种数据库的特点和使用方法,我们简单的介绍一下。

    Access一般是使用在小网站上。

    Mssql是比较完善的大型数据库,在windows操作系统下,一般会和NET ASP等程序配合使用。

    Mysql是一个小型免费数据库,它的源代码是公开的,在windows,linux上使用的都比较多,和PHP程序是很好的搭档。

    MySQL是现在比较流行的开放源码SQL数据库管理系统,它是由MySQL AB公司开发、发布并支持的。

    它采用的是完全的多线程编程。我们都知道线程是一种轻量级的进程,它能够灵活地为用户提供服务,也不会占用太多的系统资源。 MySql在不同的操作系统下都可以正常运行,客户链接服务器的口令传送都是被加密的,所以它的权限和口令系统非常灵活而且安全,而且MySql支持主机认证。

    MySql支持所有的ODBC 2.5函数和其他许多函数,并且支持大型的数据库。而且可以方便地支持上千万条记录的数据库。这种数据库比较快速稳定,有强大的查询功能。

    SQLServer是基于服务器端的中型的数据库,可以适合大容量数据的应用,相比之下,它的功能和管理比较强大。而且有比较灵活的后台开发性和强大的可扩展性。SQLServer是一种图形化用户界面,这样管理系统和数据库都更加直观、简单。

    Access我们也可以称之为桌面数据库,数据量少的应用经常使用这种数据库,如果数据比较少或者是单机访问的情况速度比较快,效率也高。但是它有一个缺陷,那就是最多只能同时有4个访问客户端。

    蓝队云有不同地点的机房选择,畅快的网络宽带,资深网络工程师7*24小时不间断技术支持,有效降低企业人力与财力投入,让您无后顾之忧,做甩手掌柜。

  • ?

    大数据时代,关于大数据你到底知道多少?

    抽离

    展开

    大数据时代的生活令人向往,你对客观世界的认识更进一步,所做的决策也不再仅仅依赖主观判断,基于你的一个习惯动作、你的一次消费行为、你的一份就诊记录,都在被巨大的数字网络串联起来。

    《大数据时代:生活、工作与思维的大变革》一书的作者维克托·迈尔·舍恩伯格如是说:“如果你是一个个人,如果你拒绝的话,可能会失去生命,如果是一个国家的话,拒绝大数据时代的话,可能失去这个国家的未来,失去一代人的未来。”

    了解大数据、如何利用巨量资料,成为人人关心的重点议题,对于大数据的定义现在没有统一的定论,但身处大数据领域里的人都同意一点:大数据绝不仅仅是指更多资料而已。

    【怎么利用信息技术等手段处理非结构化和半结构化数据】

    大数据=结构化数据+非结构化数据

    大数据中,结构化数据只占 15% 左右,其余的 85% 都是非结构化的数据,它们大量存在于社交网络、互联网和电子商务等领域。另一方面,也许有 90% 的数据来自开源数据,其余的被存储在数据库中。大数据的不确定性表现在高维、多变和强随机性等方面。股票交易数据流是不确定性大数据的一个典型例子。

    大数据刺激了大量研究问题。非结构化和半结构化数据的个体表现、一般性特征和基本原理尚不清晰,这些都需要通过包括数学、经济学、社会学、计算机科学和管理科学在内的多学科交叉来研究和讨论。给定一种半结构化或非结构化数据,比如图像,如何把它转化成多维数据表、面向对象的数据模型或者直接基于图像的数据模型?值得注意的是,大数据每一种表示形式都仅呈现数据本身的侧面表现,并非全貌。

    由于大数据所具有的半结构化和非结构化特点,基于大数据的数据挖掘所产生的结构化的“粗糙知识”(潜在模式)也伴有一些新的特征。这些结构化的粗糙知识可以被主观知识加工处理并转化,生成半结构化和非结构化的智能知识。寻求“智能知识”反映了大数据研究的核心价值。

    【大数据的4V特点】

    大数据的4V特点:Volume(大量)、Velocity(高速)、Variety(多样)、Veracity(精确)。网络的发展引起了信息量的飞速增长,大数据技术的战略意义不在于掌握庞大的数据信息,而在于对这些含有意义的数据进行专业化处理。换言之,如果把大数据比作一种产业,那么这种产业实现盈利的关键,在于提高对数据的“加工能力”,通过“加工”实现数据的“增值”。

    【大数据与数据仓库、OLAP、数据挖掘技术的关系】

    大数据技术指的是对大量信息进行专业处理、获取具有指导意义的信息以帮助决策的技术,而数据仓库、OLAP(联机分析处理)、数据挖掘技术就是处理和分析“大数据”的主要方法。也就是说,实现大数据的分析和利用需要以数据仓库、OLAP、数据挖掘技术为手段。

    具体来说,当海量数据摆在眼前,针对用户可能关注的方面,按照一定的主题域进行组织,形成数据仓库;再通过联机分析处理(OLAP)对信息的多种可能的观察形式进行快速、稳定一致和交互性的存取,形成多个维度的信息;再通过数据挖掘技术,发现数据内部隐含的规律并展示给用户,以指导用户决策。关系图如下:

    【云计算和大数据的关系】

    云计算,再一次改变了数据的存储和访问方式。在云计算出现之前,数据大多分散存储在每个人的个人电脑、每家企业的服务器中。云计算,尤其是公用云计算,把所有的数据集中存储到“数据中心”,也即所谓的“云端”,用户通过浏览器或者专用应用程序来访问。

    一些大型的网站,通过提供基于“云”的服务,积累了大量的数据,成为事实上的“数据中心”。“数据”是这些大型网站最为核心的资产,他们不惜花费高昂的费用,付出巨大的努力,来存储这些数据,谷歌公司甚至购买了单独的水力发电站,为其庞大的数据中心提供充足的电力。根据一些公开资料显示,谷歌在全球分布着大约36个数据中心。

    近几年,国内各地兴起了建设云计算基地的风潮,客观上为“大数据”的诞生准备了必备的储存空间和访问渠道。各大银行、电信运营商、大型互联网公司、政府各部委等都拥有各自的“数据中心”。绝大多数的银行、电信、互联网公司都已经实现了全国级的数据集中的工作。

    云计算是大数据诞生的前提和必要条件。没有云计算,就会缺少数据集中采集和存储的商业基础,而云计算为大数据提供了存储空间和访问渠道;大数据则是云计算的灵魂和必然的升级方向。

    大数据时代已经来临,不管是日常生活还是工作种种大数据身影都无处不在,可以说是与大家的日常生活息息相关,针对养的环境下,天眼大数据智能系统在我们大力研发中出现了,专业解决各行各业缺少精准客户难题,与推广难题,适用于全国各行各业。让您的营销插上会飞的翅膀,你可不要落后哦!有兴趣的可以和小编一起探讨。

  • ?

    什么是大数据?你需要知道……

    任风雨

    展开

    分析大量数据只是使大数据与以前的数据分析不同的部分原因之一。让我们来从下面三个方面看看。

    我们每天都在吃饭,睡觉,工作,玩耍,与此同时产生大量的数据。根据IBM调研的说法,人类每天生成2.5亿(250亿)字节的数据。 这相当于一堆DVD数据从地球到月球的距离,涵盖我们发送的文本、上传的照片、各类传感器数据、设备与设备之间的通信的所有信息等。

    这也就是为什么“大数据”成为如此常见的流行词的一个重要原因。简单地说,当人们谈论大数据时,他们指的是获取大量数据的能力,分析它,并将其转化为有用的东西。

    1.确切的说,什么是大数据?

    当然,大数据还远远不止这些?

    · 通常从多个来源获取大量数据

    · 不仅仅是大量的数据,而且是不同类型的数据,同时也有多种数据,以及随时间变化的数据,这些数据不需要转换成特定的格式或一致性。

    · 以一种方式分析数据,允许对相同的数据池进行分析,从而实现不同的目的

    · 尽快实现所有这一切

    在早些时候,这个行业提出了一个缩略词来描述这四个方面中的三个:VVV,体积(数量巨大),多样性(不同类型的数据和数据随时间变化的事实)和周转率(速度)。

    2. 大数据与数据仓库:

    VVV的缩写词所忽略的是数据不需要永久更改(转换)的关键概念——进行分析。这种非破坏性分析意味着,组织可以分析相同的数据连接池以不同的目的,并可以收集到不同目的的来源分析数据。

    (备注:数据库连接池负责分配、管理和释放数据库连接,它允许应用程序重复使用一个现有的数据库连接,而不是再重新建立一个;释放空闲时间超过最大空闲时间的数据库连接来避免因为没有释放数据库连接而引起的数据库连接遗漏。这项技术能明显提高对数据库操作的性能。)

    相比之下,数据仓库是专门为特定目的分析特定数据,数据结构化并转换为特定格式,原始数据在该过程中基本上被销毁,用于特定目的,而不是其他被称为提取,转换和加载(ETL)。 数据仓库的ETL方法有限分析具体数据进行具体分析。 当您的所有数据都存在于您的交易系统中时,这是非常好的,但在当今互联网连接的世界中,数据来自无处不在。

    信息是现代企业的重要资源,是企业运用科学管理、决策分析的基础。目前,大多数企业花费大量的资金和时间来构建联机事务处理OLTP的业务系统和办公自动化系统,用来记录事务处理的各种相关数据。据统计,数据量每2~3年时间就会成倍增长,这些数据蕴含着巨大的商业价值,而企业所关注的通常只占在总数据量的2%~4%左右。

    因此,企业仍然没有最大化地利用已存在的数据资源,以至于浪费了更多的时间和资金,也失去制定关键商业决策的最佳契机。于是,企业如何通过各种技术手段,并把数据转换为信息、知识,已经成了提高其核心竞争力的主要瓶颈。

    数据仓库,是为企业所有级别的决策制定过程,提供所有类型数据支持的战略集合。它是单个数据存储,出于分析性报告和决策支持目的而创建。 为需要业务智能的企业,提供指导业务流程改进、监视时间、成本、质量以及控制。数据仓库是决策支持系统(dss)和联机分析应用数据源的结构化数据环境。数据仓库研究和解决从数据库中获取信息的问题。数据仓库的特征在于面向主题、集成性、稳定性和时变性。

    但是,不要认为大数据会使数据仓库过时。大数据系统可以让您在很大程度上处理非结构化数据,但是所得到的查询结果与数据仓库的复杂程度是不一样的。毕竟,数据仓库是为了深入数据而设计的,它之所以能够做到这一点,是因为它已经将所有数据转换成一种一致的格式,让您可以像构建立方体一样进行深入查询。

    多年来,数据仓库供应商一直在优化他们的查询引擎,以回答典型的业务环境问题。大数据可以让你从更多的数据源中获取更多的数据,但分辨率要低一些。因此,在未来一段时间内,我们将与传统的数据仓库一起并存。

    3.技术突破大数据背后

    为了完成大数据量,品种,非破坏性使用和速度的四个方面,包括分布式文件系统(hadoop)的开发,一种意识到不同数据的方法(Google的Map、Reduce以及最近的Apache Spark),以及云/互联网基础设施,用于根据需要访问和移动数据。

    直到大约十几年前,在任何一个时间都不可能操纵比较少的数据。(嗯,我们都认为数据仓库当时是巨大的,随着互联网的产生和连接的数据到处都是这样的背景)。对数据存储的数量和位置的限制、计算能力以及处理来自多个数据源的不同数据格式的能力使得这项任务几乎不可能完成。

    然后,在2003年左右的时间里,Google的研究人员开发了Map、Reduce。 这种编程技术通过首先将数据映射到一系列键/值对来简化处理大数据集,然后对类似的键执行计算以将它们减少到单个值,以数百或数千个低位并行处理每个数据块 成型机。 这种巨大的并行性允许Google从越来越大量的数据中产生更快的搜索结果。

    在2003年,Google创造了两个突破,使得大数据成为可能:一个是Hadoop,它由两个关键服务组成:

    · 使用Hadoop分布式文件系统(HDFS)可靠的数据存储

    · 使用称为Map、Reduce的技术进行高性能并行数据处理。

    Hadoop运行在商品,无共享服务器的集合上。您可以随意添加或删除Hadoop集群中的服务器; 系统检测并补偿任何服务器上的硬件或系统问题。 换句话说,Hadoop是自我修复的。 尽管发生系统更改或故障,它可以提供数据并运行大规模,高性能的处理作业。

    使用Hadoop,仍然需要一种存储和访问数据的方法。 这通常通过诸如MongoDB之类的NoSQL数据库(如CouchDB或Cassandra)完成,该数据库专门处理分布在多台计算机上的非结构化或半结构化数据。与在数据仓库中不同的是,大量数据和类型的数据融合成统一格式并存储在单个数据存储中,这些工具不会改变数据的底层性质或位置 – 电子邮件仍然是电子邮件,传感器数据仍然是 传感器数据 – 可以几乎存储在任何地方。

    尽管如此,在使用多台机器的数据库中存储大量的数据并不是很好,直到你做了一些事情。 这就是大数据分析的原理。像Tableau,Splunk和Jasper BI这样的工具可以让您解析这些数据,以识别模式,提取意义并揭示新的见解。 你所做的事情会因你的需要而有所不同。

  • ?

    盘点丨2017年国内最酷的10家大数据创业公司

    陈子默

    展开

      【IT168 专稿】导语:IDC发布的预测报告显示,到2021年中国数字经济的比重将达55%。中国的人口和经济规模决定了中国的数据资产规模冠于全球。这不仅为大数据技术的发展提供了演练场,同时也提出了更多、更高的要求。

      大数据领域每年都会涌现出大量新的技术,成为大数据获取、治理、存储、分析或可视化的有效手段。而创业公司正在成为大数据技术创新的中坚力量,他们正在不断开发更多更加先进的软件或系统来满足这些大数据需求。

      2017年,国内大数据领域就有这样10家创业公司吸引了我们的注意。(排名不分先后)

      星环

    ▲CEO:孙元浩

      星环的研发团队是国内最早的大数据Apache Hadoop发行版团队,专注于大数据和人工智能基础平台研发,主打产品一站式大数据综合平台(TDH)和通用人工智能平台Sophon。产品虽然源于Hadoop,但超越了Hadoop,特别是在分析型数据库、流处理技术、大规模分析型搜索引擎以及图形化的大数据开发工具套件方面,已经完全重构。

      通过自主研发,星环实现了多项技术的突破, 如基于Hadoop平台构建数据仓库,实现利用Hadoop技术替代传统数据仓库案例;实时计算引擎,融合了低延时的事件驱动机制和复杂批处理编程模型的流处理引擎,支持复杂SQL、CEP复杂时间规则和机器学习,和Spark Streaming相比,星环Slipstream延时低至10ms;大规模搜索引擎,实现PB数量级上秒级延迟,同时具备搜索和统计分析能力。

      2017年发布的TDH5.0,让基于容器化进行部署大数据平台成为可能。Sophon支持图形化拖拽式的统计分布式机器学习和深度学习的模型开发以及自动建模。

      TDH社区版目前向所有人免费开放,在星环官网或腾讯云上都可以下载使用。

      星环成立于2013年,总部位于上海。在Gartner发布的2016版数据仓库及数据管理解决方案市场的魔力象限中,星环是唯一上榜的中国公司。今年10月,在IDC发布的《IDC MarketScape:中国大数据管理平台厂商评估,2017》报告中被评为领导者。

      融资方面,2017年5月,星环完成了由腾讯领投的C轮2.55亿融资。 6月在全球著名的第三方评测组织TPC上发布的TPCx-HS10TB测试结果,位列全球第一。

      百分点

    ▲CEO:苏萌  

      百分点成立于2009年,总部位于北京,是一家大数据与人工智能解决方案提供商。产品线全面涵盖大数据技术、管理、应用各个层面,其核心产品包括技术层的大数据操作系统(BD-OS),管理层的用户画像标签管理系统,以及应用层的推荐引擎、分析引擎和营销引擎。

      2017年12月百分点发布Deep Matrix AI决策系统,通过该系统,用户可以进行复杂业务问题的自动识别、判断并做出前瞻或实时决策。

      从百分点公开案例数据显示, 国家质检总局凭借这套智能决策系统进行召回判断,由每季度组织十多名专家耗费数百小时的会商制度转变为“1人+机器协同”的实时决策。上线1年,百分点这款产品已经处理了1000多起汽车召回案例,也协助完成了5000多万辆汽车的召回。

      在Gartner发布的“2016 China Cool Vendor”评选榜单中,百分点曾作为唯一一家大数据公司入选。2017年,又被APAC CIO Outlook杂志评选为2017年亚太区大数据企业25强。

      在融资方面,百分点已完成D轮融资,累计融资额10亿元人民币,创企业级大数据领域融资最高记录。2017年12月29日,百分点还宣布,全资并购在线调研公司极速洞察。

      与大部分大数据创业公司业务都在国内不同,百分点还在积极开拓海外市场,其产品在非洲、拉美以及更多国家和地区都有落地。

      明略数据

    ▲CEO:吴明辉

      明略数据成立于2014年,总部位于北京,是行业大数据和行业人工智能的解决方案提供商,技术能力较强,无论是大数据还是人工智能,都有自己的核心产品,并由这些产品构成自己的解决方案。

      2017年上半年,明略数据发布了行业人工智能大脑“明智系统”,知识图谱数据库“蜂巢”和智能决策支持问答系统“小明”。通过以上产品,用户可以较为容易的构建特定行业领域的知识图谱,并实现人机交互,从而提高企业决策的精度、速度、敏捷度,降低知识劳动力成本。

      明略数据核心业务有三个板块:公安、金融、工业。虽然不多,但每一个行业做得都很深, 2017年,明略数据获“德勤—华兴中国明日之星”,其公安情报大数据系统还入选数博会“十佳大数据案例”等。

      在融资方面,据了解,明略数据2017年已经完成C轮融资,但并未对外发布,具体金额不详。

      天眼查

    ▲CEO:柳超

      天眼查成立于2014年,是一个以公开数据为切入点,以关系为核心的大数据产品平台。其使命是“通过技术让每个人公平地看清这个世界”。

      目前,天眼查收录了全国超1.4亿家市场主体,80多种数据维度信息。不仅可以可视化呈现复杂的商业关系,还能深度挖掘和分析相关数据,预警风险等。其核心功能为“查公司”、“查老板”、“查关系”。

      天眼查产品能广泛服务于政府机构、泛金融、泛法律、泛商务等领域,应用于金融信贷、风险控制、 项目尽调、商业合作、信用评级、精准决策、客户营销等各类场景。

      融资方面,2017年3月,天眼查完成A轮1.3亿人民币融资,这超过了世界上95%的A轮融资额度,也是商业调查工具行业至今最高额度的投资。

      神策数据

    ▲CEO:桑文锋

      神策数据成立于2015年,总部位于北京,是一家大数据分析服务公司。主打产品神策分析(Sensors Analytics),是一款用户行为分析产品,主要针对营销渠道效果评估、精细化运营改进、产品功能及用户体验优化、辅助管理层决策等典型业务场景。提供私有化部署和SaaS两种部署方式、实现基础数据采集与建模,并可作为 PaaS 平台支持二次开发。

      该公司特色是技术团队对众多开源技术平台进行了重写,如对Impala查询引擎等技术的重构,通过数十万的代码的重写实现了真正海量数据秒级查询,这在国内的大数据领域独树一帜。

      神策分析能有效帮助企业用户节省数据团队与业务团队之间的沟通成本与人力成本,同时使一些不具备设立数据团队的创业公司有了自己的数据资产累积平台,从而提升了企业决策效率。

      融资方面,2017年,神策数据完成1100万美元B轮融资。

      PingCAP

    ▲CEO:刘奇

      PingCAP 是开源的分布式关系型数据库提供商,核心产品 TiDB 是一款定位于在线事务处理/在线分析处理的融合型数据库产品,该产品从根本上解决了传统单机关系型数据库的水平扩展问题。

      TiDB 模型参考了 Google 最新的全球分布式数据库 Spanner/F1,具备一键水平伸缩,强一致性的多副本数据安全,分布式事务,实时 OLAP 等特性,同时兼容 MySQL 协议和生态,迁移便捷,运维成本低。

      据了解,目前准生产测试用户约 500 余家,其中摩拜单车、同程旅游、360 金融、游族网络,去哪儿网等数十家不同行业的领先企业已经应用在实际生产环境,涉及互联网、游戏、金融、政府、电信、制造业等多个领域,帮助企业解决了海量数据存储、超大规模并发访问及交易问题。

      PingCAP 总部位于北京,成立于 2015 年。融资方面,2017 年,PingCAP 完成了 1500 万美元的 B 轮融资;2017年,PingCAP还完成与腾讯云、UCloud 等大型公有云平台深度集成。

      爱可生

    ▲CEO:李恒  

      爱可生成立于2003年,总部位于上海,定位于开源数据库整体解决方案和行业数据应用。相关数据技术已服务于中国银行、招商银行、中国人保、航天科技、金风科技、中国移动等众多金融、智能制造、电力、电信等行业大型企业。

      爱可生的云树产品系列具备自主研发的分布式技术和私有云数据库(RDS)核心技术, 并入围了央采2017年度软件招标名录。 产品满足了金融行业对开源数据库高可用、扩展性、容灾的严苛需求以及金融体系运维体系规范要求。产品已在线上系统中支撑了众多金融等行业的核心交易系统,并支持了数千个开源数据库实例的大体量运维管理。

      行业数据应用方面,爱可生基于对智能制造、电力行业等工业互联网场景需求理解,融合结构化和非结构化的数据处理技术,帮助用户建立统一数据管理和服务平台,在多场景下的基于数据的决策或预测模型已形成可落地的解决方案。

      融资方面,爱可生是新三板创新层企业,2017年完成了B轮融资,融资金额5065万元,投资方为达晨创投、毅达资本以及创合汇。

      2017年,爱可生在“融资中国资本年会”上荣获 “年度最具投资价值新三板公司”。

      瀚思科技

    ▲CEO:高瀚昭

      瀚思科技成立于2014年,总部位于北京,是一家大数据安全公司,拥有整套自主研发的基于大数据的信息安全产品,通过以HanSight Enterprise产品为核心的各个产品相互配合、补充,形成完整的信息分析的平台,来满足用户信息安全需要。

      基于大数据的安全分析, 机器学习的用户行为分析,深度学习的未知病毒木马检测引擎DeepSense等技术,瀚思科技能大量缩减企业威胁的发现和处置时间,并通过自动化分析处置流程提高威胁分析处理效率,帮助企业降低安全风险。

      融资方面,2017年 ,瀚思科技获得国科嘉和、IDG领投资的人民币1亿元B轮融资。

      2017年,瀚思科技入围央采2017年度软件招标名单,并连续三季度入选Cybersecurity Ventures2017网络安全全球500强,在入围的中国安全企业中排名第三,同期入围《安全牛》发布的2017中国网络安全企业50强,位列第38位。

      SequoiaDB巨杉数据库

    ▲CEO:王涛  

      巨杉数据库成立于2011年,总部在广州,是分布式数据库提供商。主要产品有两个:企业级分布式数据库SequoiaDB巨杉数据库,以及分布式企业内容管理软件SequoiaCM。

      其核心数据库产品目前实现了分布式OLTP,分布式对象存储以及分布式NoSQL实现全类型数据的覆盖。技术上具备分布式架构、多模数据管理(Multimodel)、标准化数据访问、数据安全双活容灾、与混合负载HTAP等几个重要的技术特性。

      巨杉一大特点是坚持自主研发, 其产品在稳定性和企业级支持服务、开发应用友好度、性价比和高可用安全等方面的口碑不错。目前其产品不仅在超过20家银行用户上运行。还拥有近百家的企业用户。

      2017年,巨杉数据库入选Gartner数据库报告,这是中国数据库产品的首次入选,一同入选的还有南大通用和阿里云。

      据了解,目前,巨杉数据库除了国内市场外还在积极布局海外市场。

      热云数据

    ▲CEO:白冬立  

      热云数据成立于2013年11月,总部在北京,是一家定位移动互联网领域的第三方大数据服务商。通过精准的人群定位、全面的用户画像及实时的广告效果监测来帮助广告主优化广告投放策略、投放质量、从而节约广告投放成本,提高运营效率。

      自主开发了游戏运营支撑平台、防作弊监测技术、移动广告效果监测平台、用户流失预测模型、移动DMP、移动大数据标签系统、渠道数据分析系统等技术产品。

      热云数据在数据分析技术方面较为领先,独创的防作弊技术、防刷量和去重等机制,能帮助移动互联网企业在投放过程发现作弊和刷量等点击数据,真实反馈用户的真实行为,减少投放浪费,高效获取真实的用户。

      在融资方面,2017年5月热云数据完成B轮1亿元人民币融资。2017年,热云数据还牵头成立了“中国诚信移动广告联盟”-CMAA。

  • ?

    告诉你什么叫“大数据”,这么说你就懂了

    料峭

    展开

    人工智能,互联网+,VR,量子科技,大数据,这是在科技领域最火的几个名词了。

    这里首先先聊聊大数据。

    听名字就大气,大数据就是很多的数据,每个人都有一个单独的“大数据库”,这个“大数据库”就存着你的爱好了,性格了,脾气了,身价了,甚至性取向了。

    互联网时代,你的这些“大数据库”对于某些高科技公司基本就是公开的,它们有这个世界上几乎每个人的数据库档案。这些高科技公司可以通过对你的“大数据库”进行分析,分析你是一个什么样的人,分析你最近缺什么了,分析你最近想买什么了,分析你最近是不是想什么变态的事了。

    分析出来之后,就通过大概率事件,主动向你推荐一些你下一步想要进行的活动。

    比如,你再虚拟购物车里存入了充气娃娃了,安全套了等等,它就会认为你即将可能买这方面的东西,于是就根据你选取商品的品质、价格等,主动给你推荐一个可能是你心里最为理想的店铺。

    这就是大数据最基础的应用。

    大数据不仅仅针对每个人,而是针对这个世界的万事万物。

    想想吧,如果一个人的“大数据库”有1亿的数据量,那么这个世界的万事万物将会有多么大的数据。

    你用微信来记录心情,并且和网友分享图片,此外还有各种语音聊天。全国有数亿像你一样的人在使用微信,每天都有大数据在微信这个平台上跑着。

    你再百度地图定位你的位置,搜寻周围的建筑,每个在百度地图上跳出来的坐标,实际上都是由大数据堆成的。

    大数据时代,也得聊聊量子科技,最近中国研发的光量子计算机,就是实现大数据最有效快捷的方式,因为一台量子计算机的运算速度足以秒杀目前世界上所有最先进的计算机的运算速度之和。

    也就是说量子计算机用0.0000000..............1秒的时间就能把你分析的透亮。

    有点像《鹰眼》里的超级计算机,无论你在世界的哪个角落,我都可以立马找到你,并且用我的牛逼到你无法想象的运算速度,运算并分析出我是不是要毁灭你?用哪种方式毁灭你最便捷?

    这就是人工智能发展到失控的时代了!

  • ?

    浅谈五大常用数据库

    袁怜南

    展开

    数据库是什么呢?数据库(Database)就是按照数据结构来组织、存储和管理数据的建立在计算机存储设备上的仓库,随着科技进步时代发展出现了现在的云数据库,云数据库是指被优化或部署到一个虚拟计算环境中的数据库,可以实现按需付费、按需扩展、高可用性以及存储整合等优势。

    常用数据库

    但是我们常用的数据一般分为五种:(一)、Access(二)SqlServer(三)MySQL(四)Oracle(五)SQLite,那么用户想要选择一个数据库,什么样的数据库才是最能满足用户自身需求的呢?重庆典名科技阿里云授权服务中心小编就为大家来具体分析分析这五款数据库。第一种:Access Access数据库,这款数据库是由微软发布的,是一款关联式数据序管理型系统的数据库,通常是被用来开发Web 应用程序这些应用程序都利用Asp技术在IIs上运行,但是由于Access 是小型的数据库,在很多的使用上都有着局限性,而且如果过多的数据库访问量还会造成数据库的性能极具下降。第二种:Mysql MySQL数据库,这款数据库是一款小型数据库管理系统的数据库,其开发公司是瑞典MySQLAB公司。MySQL被广泛地应用在Internet上的中小型网站中。由于其体积小、速度快、总体拥有成本低,尤其是开放源码这一特点,许多中小型网站为了降低网站总体拥有成本而选择了MySQL作为网站数据库。第三种:SqlServer SqlServer数据库,这款数据库的特点是真正的客户/服务器体系结构,并且出十是图形化的用户界面,使数据库管理方式更加直观和简单。它还提供了丰富的编程接口工具为用户进行程序设计提供了更大的选择余。在使用上也是非常广泛的。第四种:Oracle Oracle数据库,是一款比较典型的客户/服务器(CLIENT/SERVER)或B/S体系结构的数据库之一。ORACLE数据库是目前世界上使用最为广泛的数据库管理系统,作为一个通用的数据库系统,它具有完整的数据管理功能;作为一个关系数据库,它是一个完备关系的产品;作为分布式数据库它实现了分布式处理功能。但它的所有知识,只要在一种机型上学习了ORACLE知识,便能在各种类型的机器上使用它。第五种:SQLite SQLite数据库,这是一款轻型的数据库,是遵守ACID的关联式数据库管理系统,它的设计目标是嵌入式的,而且目前已经在很多嵌入式产品中使用了它,它占用资源非常的低,在嵌入式设备中,可能只需要几百K的内存就够了。这款数据库的运行处理速度比Mysql、PostgreSQL这两款都要快。文章来源于阿里云代理商023阿里云服务器023

几大数据库

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP