- ?
10亿元促进AI、大数据落地商用,盛景和海量大数据合谋的“大事情”
小步调
展开
很多人称2012年为大数据元年,2016年为AI元年。但实际上这是属于行业投资的元年,并不是商用落地的元年。“有多少人工就有多少智能”这句看似玩笑话,却道出新技术落地到商业应用中依旧漫长的路。
为加速AI、大数据落地商用,6月5日,盛景网联联合海量大数据公司合作宣布共建“海量盛景大数据重度孵化加速平台”,同时将共同发起一个一期10亿规模左右的大数据的天使基金,孵化初创大数据企业。
此次合作是行业内两家实力玩家的联手。盛景目前的母基金和直投基金已超100亿,并且作为产业培训机构,拥有累计2万位企业家学员,其中2000家已经挂牌新三板;而海量集团是从1999年就专注于中文智能计算技术和职能应用的公司,海量孵化器从2012年开始运营,有一套完整的创业方法论和重度孵化方法论。
盛景网联与海量大数据的此次合作,希望将海量大数据平台级应用孵化能力和盛景集团投资+产业平台加速能力结合,为创业企业提供大数据技术、创业方法论和教练、产业和市场资源、资本等集成式全程重度孵化和加速服务。孵化出更多海云数据、海云、搜股、海智、易学等优质大数据项目。
加速大数据企业发展和落地商用速度
在发布会上,海量盛景大数据加速平台合伙人王湘云女士归纳盛景在孵化平台方面,将为入孵企业提供四方面服务:第一个方面是认知赋能;第二个方面是资本;第三个方面是市场流量赋能;第四个方面是人才赋能。
认知赋能方面首先是为天使轮和A轮以后的企业,联结全中国50多家最顶尖的A轮机构举办大数据预科班和独角兽成长营服务,来发现和扶持这些最顶尖的初创AI大数据的企业。
在资本赋能方面,盛景嘉成母基金合作的近百家一线基金将对项目进行持续的关注和投资。同时已经与中国前三大的财务顾问公司汉能资本来合资运作了早期A、B轮的财务服务公司,这些财务服务都是帮助和支持AI大数据的企业来获得更好的融资。
在流量赋能方面,帮这些AI大数据公司去找客户,找订单,找渠道的模式和方法。盛景来帮助他们寻找在特定行业、特定区域里的合伙人,我们叫做行业合伙人和城市合伙人。
海量大数据重度孵化平台CEO刘激扬则从生态孵化的角度讲解,“海量盛景大数据重度孵化加速平台”将为创业者提供两个生态,其中一个服务生态,是把财税、法律、工商这些东西整个都接过来,整体来提供一个服务的平台。另外一个叫产业生态,因为海量本身是从事数据挖掘平台的,所以这个平台是这些孵化项目最重要的技术依托平台。
业界要给AI、大数据落地商用的耐心
在AI大数据商业化应用的未来和模式论坛环节,中国唯一的国家级人工智能实验室——清华大学智能技术与系统国家重点实验室主任朱小燕教授表示:“业界和投资人要有一定要给人工智能落地耐心。人工智能技术要商业化应用,第一是场景,第二是产品,第三是技术,好的产品经理能够把应用场景和技术很好的结合,非常稀缺。”
投资了依图科技等知名的AI公司的高榕资本创始合伙人岳斌分享:“我认为今天的人工智能是一个没有权威的时代,商业化应用的落地需要真正足够好的技术。希望海量盛景大数据重度孵化加速平台能够走出来有分量的企业。”
海量大数据重度孵化器入孵企业的成功代表——海云科技董事长冯一村表示:“海云数据启动资金只有几十万元,能够成长到今天,很大程度上受益于海量对我们的孵化、指导和资源的支持。AI大数据创业企业,要对商业化应用场景做深度思考和结合,这正是海量盛景大数据重度孵化加速平台带给AI大数据企业的独到的价值”
产业媒体和智库的代表——亿欧公司副总裁、亿欧智库研究院院长由天宇表示,“最近一两年我们越来越关注人工智能的商业落地,我认为今天很多行业正在经历从线上到线下的过程,我对智能化的理解是由3个词组成的:数据化、自动化、精准化。未来,所有的AI大数据企业都需要在传统产业中找到落地场景。大数据能力的升级是AI必不可少的基础。”
AI与大数据的落地商用发展依旧在路上,而海量孵化器的发展也在不断进化中。从成立之初到去年的10月份,海量孵化器完成了两个轮次的融资,估值超过1亿美元。如今与盛景网联的合作,在帮助大数据企业发展上将更进一步。
- ?
海量大数据平台的运维智能化实践
织音
展开
【IT168 技术】本文根据徐小飞在2018年5月12日【第九届中国数据库技术大会(DTCC)】现场演讲内容整理而成。
讲师简介:
徐小飞,阿里巴巴技术专家,目前就职于阿里计算平台大数据基础工程技术团队,主要负责支撑阿里大数据智能运维体系(公司内部产品名称——Tesla)的建设,团队致力于打造通用的智能化SRE中台,目前该中台运维体系承载阿里10w+规模节点运维工作。
本文摘要:
介绍Tesla如何支撑阿里离线计算和实时计算两大海量大数据平台的标准化日常运维运营,以及探索如何构筑运维领域的知识图谱,打造针对大数据平台和大数据业务的数据化全息投影,实现多维的立体化监控、智能决策分析、自动化执行的运维闭环。Tesla是面向企业级复杂业务系统的数据化驱动运维解决方案,解决方案包含一个统一运维门户(运维工单、运维垂直搜索)和四个运维基础平台(流程平台、配置平台、作业平台、数据平台),集日常运维工单管理、自动化发布变更、统一配置管理、统一任务调度、智能监控告警管理、异常检测预测、故障自愈等。
分享大纲:
·运维新趋势
·Tesla运维解决方案
·DataOps数据化运维
·数据价值转化
·AIOps征程
演讲正文:
大家好,我叫徐小飞,很开心能够有这样的一个机会在这里和大家交流。今天主要给大家介绍一下围绕阿里大数据体系的的运维智能化实践。
我所在的团队叫大数据基础工程技术,通俗点说就是大数据SRE(为什么起基础工程技术这个名字? SRE文化里有个最核心的点就是使用软件工程的思想来解决运维问题),我们团队支撑的是整个阿里大数据生态的运维运营,并沉淀出一套自己的运维解决方案体系——Tesla,这套体系是一个分层体系,包含了面向运维领域功能的运维中台和面向具体大数据平台业务的运维应用。目前Tesla承载了阿里大数据平台及业务共10w+规模节点的日常运维工作。相信了解阿里的人都听过这样一个词——“大中台和小前台”战略,同样在运维领域,我们也是利用这个战略来构筑我们的业务:大中台提供通用的运维领域功能,而小前台可以基于业务场景快速试错、创新。首先我们先看下运维的新趋势。
一.运维新趋势
刚好这几天Google IO大会也正在召开,相信在座的很多同学都会关注,今年的大会中有一个很吸引眼球的话题,就是在开场第一天放出来的两段Demo视频,是个电话录音视频,内容是Google助手帮助客户打电话到发廊或餐厅去做预约。那么亮点在哪里呢?在整个电话预约的过程中,发廊和餐厅的人完全没有感知到和他们交流的是AI机器人。换句话说,AI机器人已经达到了以假乱真的效果,不仅在交流过程中有语气词和思考,而且当话题出现中断时,还会提出反问句,能让话题回到机器人所要的情景进行下去。
Google对外宣称在某些特定领域,例如预约领域,他们已经通过了图灵测试。图灵测试大家可以去了解一下,图灵有一篇针对未来机器智能的论文,一句话解释论文里的图灵测试:当人机交互时,人类完全感觉不到对方是个机器人,那么就标志着进入了机器智能的时代。
大概在三年前,Google提出了AI战略。时至今日,我们看到Google在很多领域都渗透了AI,Google的AI并不是做一个全新的AI产品,而是将AI赋能到它的顶尖产品中。所以,我们表面看到的是预约服务,但其实为了达到这个效果是需要很强大的数据+算法的支撑。我们经常提到的ABC(AI,BigData,Cloud),想要实现AI,前提一定是大数据和云计算,而在运维领域也同样是如此。这两年AIOps特别火,同样地我们认为要实现AIOps,一定是先有运维的数据和计算,就是说从DevOps到AIOps之间,有一段DataOps必经之路。
如何理解DataOps呢?首先,我们要拿数据来感知我们所运维的系统,继而利用数据分析做一些决策,再往下就是去触发自动化的智能闭环。我们认为DataOps中最核心的过程就是运维感知、决策和执行。
我们把无人驾驶和无人运维做了一个类比。无人驾驶也是Google第一个提出来的,现在有很多厂商投身其中,如果细看无人驾驶,其实我们发现与无人运维类似——无人驾驶是在传统汽车上附加智能感知、决策、智能控制系统。但是真正的无人驾驶还没有达到,即使是Tesla(马斯克的特斯拉)也不例外。而终极AIOps想要达到的是也是无人运维的效果,即在DataOps 的感知、决策和执行三个阶段都附加上AI智能。接下来先看下整体的Tesla运维解决方案。
二.Tesla运维解决方案
上面这张图是阿里大数据的体系,左边最底层是基础设施,包含了底层依赖,机房、天基、Staragent;其上有两大基础平台,一个是飞天平台,这是完全自研的,另一个是Hadoop平台。这两套平台之上分别对应的是MaxCompute和StreamCompute两大存储计算平台;再往上是数据应用层。而右边是Tesla大数据运维解决方案,我们可以看到Tesla贯穿了整个阿里的大数据体系,负责从基础设施到基础平台到存储计算平台的所有产品的运维支撑。
简而言之,Tesla就是在为阿里的大数据保驾护航。
MaxCompute是大数据的核心业务,而DataWorks可以理解为是一个面向开发者的前端,是MaxCompute的门户。 MaxCompute基本上承载了集团90%以上的计算和存储。在阿里,凡是和数据打交道同学都会用到DataWorks。StreamCompute承载了集团几十个BU的实时作业。大家可能感触最多的是每年的双11大屏,这背后都是由StreamCompute实时作业传上去的,可以达到秒级、毫秒级。最后是我们内部的机器学习PAI和AnalyticDB。
这张图是Tesla运维解决方案架构图。整个Tesla运维解决方案是一个分层的体系,从SRE中台到SRE应用。整体是一个垂直体系,也可以拿SPI来分,中台最底层是IaaS,IaaS层是最基础的公共集团的设施,之上是核心运维PaaS层,其中包含四大平台+两大类服务。 四大平台与运维人日常的工作相关,分别是配置平台、作业平台、流程事件平台和数据分析平台。再往上就是SaaS层,提供了所有的平台和服务。Tesla平台支撑了阿里大数据的十几个平台,因为每个大数据平台业务产品的运维特性都是不一样的,肯定无法做到一套运维系统支撑所有的产品运维运营,所以我们就采用了分层战略: 运维开发团队提供平台,而针对具体产品的运维应用由SRE同学利用平台去构筑。典型的SRE应用包括常见的集群管理、资源管理、监控告警、故障管理等。在这张图里我们可以看到DataOps体现在数据分析平台这一层。
这张图是应用维度。SRE应用这一层的功能也是分层的,最下面是其所依赖的基础平台,往上是面向业务的功能(包含业务中心、服务管控、平台运营、工具服务、运维中心和运筹优化),利用这些功能向上支撑具体的运维场景(围绕稳定性、成本、质量、效率、安全以及体验的维度),最终服务好业务的各类用户。
在运维/运营平台中抽象出了几块内容,开发框架、资源整合、运维数据化和智能分析。因为最终系统都是相似的,所以我们会给提供前后端框架、服务网关、二方依赖包以及工具插件,业务SRE只需在环境上去获取数据,做数据处理、元数据管理以及提供数据查询的服务。运维数据化(DataOps)就是我们前面提到的,智能分析支撑常见的运维场景,比如最典型的故障处理、监控分析、大促保障以及值班客服等,他们面临的客户是一堆客户,这也是DataOps在SRE应用上的体现。接下来我们重点解释到底什么是DataOps。
三.DataOps数据化运维
什么是DataOps?如何做DataOps?阿里五新战略中有一个新能源,我们认为数据就是新能源,现在已经进入到信息爆炸的时代,大家刷淘宝天猫时的每一次行为都会触发日志,这些日志最终都流到我们的平台里。如此海量的数据,如果能有效的组织管理好,那么就可以从中挖掘出价值,但如果管理不好,就可能会是个大灾难。
算法+技术,再结合数据就会产生新能源,而现在比较通用的数据挑战是我们怎么有效的去收集、清洗数据?如何保证数据的实时性、准确性?如何将无序的、没有结构的数据有序、有结构的分类、组织、存储管理起来?如何通过算法去打通数据,连接、分析数据,并从中提炼出价值?这一系列的问题就是DataOps需要解决的。
什么是数据化运维? 我们这样定义:就是把所有系统的运维数据全部采集起来、真正打通,深度挖掘这些数据的价值,为运维提供数据决策基础和依赖。 从系统“稳定性、成本、效率、安全”多个维度去驱动自动化、智能化的运维运营,从而助力实现真正的AIOps。
相比于传统运维,DataOps的改变可能就是把传统的使用命令、人工决策的运维过程转变成数据+算法的模式。
DataOps是实现AIOps的一个必经之路,是一个运维闭环。如何做数据化运维呢?右边这张图来自《大数据之路》这本书,当然这张图说的是阿里整个的数据中台,阿里数据中台把全公司所有和数据相关的东西都整合了起来,提供了一套统一的数据中台。其中,最下面是数据采集层,往上是数据库同步工具,中间是MaxCompute和StreamCompute,也就是数据存储计算层,最上面是数据服务层和数据应用层。
数据中台中的方案体系是OneData,它是用来规范数据中台,如何维护、组织、管理和使用数据的。OneData之上是OneService,有了这套组织管理和两大计算平台之后,就可以提供各式各样的数据服务,并再向上提供数据应用。在阿里,基本上所有的业务部门都是按照这个套路来做的。
如何做数据化运维?其实就是利用这套大数据体系来构筑大数据的数据化运营体系。这句话可能有点难以理解,更直白一点说,这套体系是由我们来运维保障的,但是过程中我们也利用其来构筑了运维运营体系。因为我们的使命是为阿里大数据保驾护航,而我们的做法也是用阿里大数据来做运维分析,数据化运维分解下来就是运维的数据采集、运维的数据计算、运维的数据服务以及运维的数据应用。
前面讲的是方法论,现在讲讲具体的实操。利用数据中台,我们首先做的是按照OneData规范建立运维的数据仓库,然后把所有运维相关的数据做分类抽象,包含公共数据、业务数据、元数据,runtime实时数据。基于这些数据抽象,我们提供了大量的运维服务和数据服务,比如异常检测分析、故障自愈、可视化流程、运维搜索、运筹优化、全链路诊断以及业务驱动。下面结合几个例子来具体解释下如何做数据化运维。
以全链路分析诊断为例,MaxCompute是一套离线计算平台框架,每天有百万级的任务在跑,这些任务都是由开发同学提交,当作业因为各种原因出现不可预知的错误,大家就会@运维值班人员看看是哪里的问题。后来我们发现,大部分问题是相似的,所以就总结经验,从用户都在这个平台上提交作业到最后执行的每个阶段都去打点、采集分析,做了一套全链路作业诊断工具。
这是一个自助式的全链路诊断产品,提供一个入口,用户只要输入作业ID,我们就能延伸到整个上下游去查询所有的有可能的问题,包括它的资源申请情况、配置是否正确、数据依赖是否都已满足、历史情况如何、是否有长尾倾斜等等。
上图中有我们工具的页面截图,可以看到左边是有分类的,其实在做这个全链路分析工具的时候,我们就把这个场景和去医院体检做了个类比,体检时医生要针对病人的各个环节做判断,然后输出病人的状态,OK还是不OK?如果有问题,立即提出来让病人去某诊室随诊。同样的,我们也是针对作业做了多个维度的检测,而且还会将诊断详情、时间分析、图表分析以及历史对比等,全部都透视给用户。最后的结果报告是用图表分析的,例如稀疏图形资源争抢,毛刺图形部分长尾、任意机器进程CPU消耗分析。
第二个案例场景是硬件自愈,目前我们已经有10万+台物理机了,每天有大量的硬件故障在发生,比如硬盘坏了,主板坏了等等。如果机器比较少,那么我们可能人肉或者直接提单就可以了,但是当量级到了一定程度,每天几十单或者是上百单的硬件故障,这种方式就不适用了。
所以我们就利用这套数据化的思路做了一个硬件自愈的流程。我们也是从服务器上采集到数据,然后流进流计算平台Blink再到数据仓库,做检测分析并得出决策。决策触发流程平台做一些自动化执行的action,调用集群操作系统去做机器维修等。
硬件自愈的本质也是一个三阶段的闭环,在这其中我们的角色有很多。例如有些故障重启一下服务或者双向配置即可解决,而有些故障需要使用万能大法,重启机器才能解决。如果碰到解决不了的问题就要进入无盘状态,去做业务隔离、重新克隆、整机维修,维修完之后自动上线。整套流程全部是自动流转,我们是无人值守的状态。
四.数据价值转化
通过前文的方法论和两个案例,我们大概解释了一下如何做数据化运维,接下来,我们再透视一下数据化运维的本质——从运维数据到知识的价值提取。
这里会涉及到几个概念,数据化运维的前提是先将一切对象数据化,也就是运维的全域数据,构筑完之后,使用知识图谱将这些数据连接起来,之后将数据当做服务提供给人,利用运维搜索去提供一些快速直达的服务。...
- ?
专利产业化助推器:海量大数据孵化器
Petra
展开
中新天津生态城科技主管部门发布《中新天津生态城科技企业奖励实施细则》
资助力度大,助力科企科技创新|海量大数据创业平台
总则
第一条 为贯彻落实天津市、滨海新区关于推进创新驱动发展战略的各项要求,促进科技型中小企业升级发展,进一步加快中新天津生态城(以下简称“生态城”)国家自主创新示范区分园建设,吸引科技创新项目落户,提升企业自主创新能力,营造生态城“大众创业、万众创新”氛围,根据《中新天津生态城科技创新促进暂行办法》(中新天津生态城管理委员会第12号令,以下简称“《办法》”)和《中新天津生态城科技创新促进专项扶持资金管理办法》文件精神,结合生态城实际情况,制定本实施细则。
第二条 本实施细则主要规定《办法》第三章第十四条至第十八条科技企业奖励政策的兑现条件和执行程序。
第三条 中新天津生态城科技主管部门(以下简称“科技主管部门”)作为《办法》的组织、执行、监督和管理部门,负责制定本实施细则,推进《办法》落实。
第四条 《办法》所涉及的各项资助、奖励、补贴的资金按照《中新天津生态城财政资金审批管理办法》中相关规定进行拨付;政策兑现情况由科技主管部门按季度向中新天津生态城管理委员会主任办公会通报。
第五条 享受《办法》中各项资助、奖励、补贴的企业和机构(以下简称“申请者”),须配合相关部门对资金使用情况进行检查和必要的审计.
【科技型中小企业认定奖励】
第六条 《办法》第十四条【科技型中小企业认定奖励】中提到的“科技型中小企业”是指2016年1月1日之后,经天津市科学技术委员会首次认定并获得证书的科技型中小企业(2017年1月1日后称作“科技型企业”)。
第七条 申请《办法》第十四条政策,需满足以下条件:
1.申请者须在生态城注册且具有独立法人资格;
2.申请者为本实施细则第六条规定的天津市科技型中小企业。
第八条 《办法》第十四条奖励标准如下:
1.对符合本实施细则第六条、第七条规定的企业,给予一次性1万元奖励;
2.对符合本实施细则第六条、第七条规定且在生态城实际办公的企业,根据企业近两个会计年度年均销售收入增长情况给予相应创办资助:企业近两个会计年度年均销售收入增长率达到15%-25%(含15%、25%),一次性资助3万元;企业近两个会计年度年均销售收入增长率达到25%(不含25%)以上,一次性资助5万元。
第九条 申请《办法》第十四条政策,需提供以下材料:
1.《科技型中小企业认定奖励申请表》;
2. 天津市科技型中小企业认定证书复印件或带有认定企业编号的天津市科技型中小企业认定表;
3.实际办公企业提供:企业近两个会计年度的财务报表(实际经营期不满三年的按实际经营时间计算)及企业成长性情况说明、办公物业租赁合同,以及出租方出具的发票和企业实际付款凭证;
4.企业专有技术介绍或《自主知识产权情况汇总表》及其相关证明材料;
5.企业营业执照副本复印件;
6.其他证明文件。
【高新技术企业认定奖励】
第十条 《办法》第十五条【高新技术企业认定奖励】中提到的“高新技术企业”是指2016年1月1日之后,通过天津市滨海新区科学技术委员会首次认定并获得证书的天津市市级高新技术企业或经天津市科学技术委员首次认定并获得证书的国家高新技术企业和通过复审或再认定的国家高新技术企业。
第十一条 申请《办法》第十五条政策,需满足以下条件:
1.申请者须在生态城注册且具有独立法人资格;
2.申报者为本实施细则第十条规定的高新技术企业。
第十二条 《办法》第十五条奖励标准如下:
1.首次获批的国家高新技术企业补贴根据《中共天津市委 天津市人民政府关于打造科技小巨人升级版的若干意见》(津党发〔2015〕27号)文件及当年天津市科学技术委员会相关文件进行相应奖励金额匹配,匹配资金最高不超过25万元;
2.对通过复审、再认定的国家高新技术企业,给予一次性10万元奖励;
3.对首次获批的市级高新技术企业,给予一次性5万元奖励;
4.若天津市、滨海新区科学技术委员会出台相应奖励政策,生态城可根据政策对奖励资金进行相应调整。
第十三条 申请《办法》第十五条政策,需提供以下材料:
1.《高新技术企业认定奖励申请表》;
2. 天津市市级高新技术企业认定证书复印件或国家级高新技术企业认定证书复印件;
3.《自主知识产权情况汇总表》及其相关证明材料;
4.企业未来三年企业研发计划书、企业专利申报受理通知书;
5.经审计的企业上一年年度财务报表和企业最近一个季度的财务报表;
7.企业营业执照副本复印件;
7.其他证明文件。
【知识产权奖励】
第十四条 《办法》第十六条【知识产权奖励】中提到的“高新技术企业”包括天津市市级高新技术企业、国家级高新技术企业。
第十五条 申请《办法》第十六条国内知识产权奖励、国际发明专利奖励和参与研制技术标准资助政策,需满足条件如下:
(一)申请《办法》第十六条国内知识产权奖励政策,需满足以下条件:
1.申请国内知识产权授权奖励政策的企业须为在生态城注册并经营三年以上的高新技术企业或科技型中小企业;
2.申请知识产权授权奖励政策的企业须为第一专利权人;
3.申请者每年可享受的该项扶持资金原则上不超过企业上年度主营业务收入的20%。
(二)申请《办法》第十六条国外发明专利奖励政策,需满足以下条件:
1.申请国外发明专利奖励政策的企业须为在生态城注册并经营三年以上的高新技术企业或科技型中小企业;
2.申请知识产权授权奖励政策的企业须为第一专利权人;
3. 经《专利合作条约》和《保护工业产权巴黎公约》途径向国外提交专利发明申请,进入国家阶段并被受理及获得授权的专利;
4.申请者每年可享受的该项扶持资金原则上不超过企业上年度主营业务收入的20%。
(三)申请《办法》第十六条参与研制技术标准资助政策,需满足以下条件:
1.申请参与研制技术标准资助政策的企业须为在生态城注册并经营三年以上的高新技术企业;
2.对于申请参与研制技术标准资助实行“后补助”方式的,应自获得国际、国家、行业和地方技术标准公开发布之日起两年内提起申请;
3.对参与多个标准研制并符合条件的单位一年内受该项资助总额度不超过100万;
4.该技术标准已公开发表。
第十六条 《办法》第十六条奖励标准如下:
1.对符合本细则第十五条规定的企业,除享受国家、天津市和滨海新区专利扶持政策外,对获得发明、实用新型、外观设计授权的企业分别给予3000元/件、1000元/件、500元/件奖励;对获得国内集成电路布图设计、计算机软件著作权和其他类型知识产权的,每件给予奖励500元;
2.对科技型中小企业和高新技术企业通过《专利合作条约》或《保护工业产权巴黎公约》途径向国外提交的发明专利申请,进入国家阶段并被受理,除享受国家、天津市和滨海新区专利扶持政策外,每件一次性奖励2万元。每获得一个国家的授权奖励1万元,最高奖励2万元;
3.对参与研制技术标准,并作为主要起草单位的高新技术企业,对参与国际标准化组织标准研制的最高资助100万元,对参与国家标准研制的最高资助50万元,对参与地方标准及行业标准研制的最高资助20万元。同一企业一年内承担多个标准制定的,择优资助一个。
第十七条 申请《办法》第十六条国内知识产权奖励、国际发明专利奖励和参与研制技术标准资助政策,需提供以下材料:
(一)申请《办法》第十六条国内知识产权和国外发明专利奖励政策,需提供以下材料:
1.《知识产权奖励/标准研制资助申请表》;
2. 天津市市级高新技术企业认定证书复印件或国家级高新技术企业认定证书复印件或天津市科技型中小企业认定证书复印件或带有认定企业编号的天津市科技型中小企业认定表;
3.《知识产权明细表》;
4. 当年获得知识产权授权的相关证明材料;
5.经《专利合作条约》和《保护工业产权巴黎公约》途径向国外提交的发明专利申请需提交的国家阶段被受理的相关证明材料(申请国外发明专利奖励政策时提供);
6.上年度财务审计报告或有税务部门印章的年度纳税申报表复印件;
7.企业营业执照副本复印件;
8.其他证明材料。
(二)申请《办法》第十六条参与研制技术标准资助政策,需提供以下材料:
1.《知识产权奖励/标准研制资助申请表》;
2.天津市市级/国家级高新技术企业认定证书复印件;
3.申请国家、地方及行业标准研制资助的单位应提供相应标准化主管部门或委托管理机构同意立项的文书复印件;
4.申请国际标准研制资助的单位应提供相应标准发布机构的会员或成员证明及由标准发布机构提供的参与相关标准制定的有效证明文件;
5. 申请国际标准研制资助的单位应提供相应标准文件被“三大标准组织”采纳的相关证明,“三大标准组织”包括:国际标准化组织(ISO)、国际电工委员会(IEC)、国际电信联盟(ITU);;
6.标准发布机构批准发布的文本复印件;
7.企业营业执照副本复印件;
8.其他证明文件。
【生态城创新之星奖励】
第十八条 申请《办法》第十七条政策,需满足以下条件:
1.经过生态城组织的创新创业大赛,并获得“生态城创新之星”评选称号的优秀创新项目或企业;
2.申请者为生态城注册企业的,须有三名及以上的工作人员在生态城办公,并在获奖后六个月内提出申请;
3.其他申请者获奖后,须在生态城注册企业后六个月内,以该企业作为主体进行申报,并有三名及以上的工作人员在生态城办公。
第十九条 《办法》第十七条奖励标准如下:
通过生态城创新创业大赛评选出的“生态城创新之星”,根据大赛奖项设置,给予2-50万元奖励。
第二十条 申请《办法》第十七条政策,需提供以下材料:
1.《生态城创新之星奖励补贴申请表》;
2.创新创业大赛获奖证明相关材料;
3.企业营业执照副本复印件;
4.生态城驻区办公人员就业劳动合同登记花名册;
5.其他证明文件。
【科学技术配套奖励】
第二十一条 《办法》第十八条【科学技术配套奖励】中提到的“国家级科学技术奖”是指国家最高科学技术奖、国家自然科学奖、国家技术发明奖、国家科学技术进步奖和中华人民共和国国际科学技术合作奖;“天津市级科学技术奖”是指天津市科技重大成就奖、自然科学奖、技术发明奖、科学技术进步奖和国际科学技术合作奖。
第二十二条 申请《办法》第十八条政策,需满足以下条件:
1.申请者须在生态城注册且具有独立法人资格;
2.申请者当年获得国家级科学技术奖或天津市科学技术奖。
第二十三条《办法》第十八条奖励标准:对获得国家级、天津市级科学技术奖的单位和个人,按国家和天津市的相关政策给予配套资金奖励。
第二十四条 申请《办法》第十八条政策,需提供以下材料:
1.《科学技术奖奖励申请表》;
2. 科学技术奖证书复印件;
3.科学技术奖奖金发放凭证;
4.获得科学技术奖的科技成果复印件;
5.企业营业执照副本复印件;
6.其他证明文件。
【附则】
第二十五条 申请者存在以下行为,经科技主管部门核实并上报生态城管委会批准后停止拨付扶持资金,同时该申请者三年内不得再享受科技扶持政策:
1.申请者存在隐瞒事实、虚构真相或提供虚假申请材料骗取政策扶持;
2.申请者未按科技主管部门要求及时上报相关情况;
3.申请者拒绝配合相关部门检查;
4.申请者违反资金使用规定和要求。
第二十六条 按本实施细则享受扶持资金的企业,自享受年度起,五年内不得注销或迁出生态城。
【税收优惠政策】
税收:生态城享受省级税收权限,扶持力度长达7年。
大数据应用产业孵化基地——海量大数据重度孵化产业基地正式落户中新天津生态城,并于2016年11月正式启动。海量集团旗下包括海量信息技术股份公司、海量重度大数据企业孵化器公司、海量大数据分析学院等。依靠全面细致、环环相扣的创业孵化指导体系,海量的重度孵化近年来取得了非常好的效果。
海量大数据重度孵化器联合IBM、清华大学、中科院等业内资源,以培育大数据领域的高端应用人才为抓手,配套孵化器与众创空间,通过“数据+平台+行业应用+人才培育+创业孵化”的全产业链模式。
入孵的大数据应用企业,将接受海量大数据重度孵化器从产品的创意、品牌、定位、运营、客户选择,乃至创业团队组立、公司组织架构梳理以及资金支持等方面的全流程支持服务。同时,海量大数据重度孵化器也将围绕数据开放、数据交易、数据应用、产业垂直孵化等...
- ?
探寻大数据产业公司:走进海量数据年度股东大会
Zenima
展开
和讯网消息 近年来,大数据在经济社会发展中的作用越来越受到重视。据工信部发布数据显示,大数据产业规模未来两至三年的市场规模的增长率将保持在35%左右,我国数据行业面临前所未有的发展机遇与政策环境。
在A股市场,与大数据相关的上市公司更是多达百余家。其中,有3家公司直接以“数据”作为了证券简称,分别为中昌数据、数据港和海量数据,而后两者均是2017年登陆资本市场的新秀。
今天要关注的这家就是2017年3月上市的公司——海量数据,2018年5月16日下午,海量数据的2017年年度股东大会,在北京市海淀区科大天工大厦B座6层会议室召开。
公司董事长陈志敏、董秘王贵萍及部分高管到现场参与了会议,不过,赴现场参会的中小股东仅2名。
此前公布的年报显示,2017年,海量数据累计实现营业收入51807.83万元,同比增长10.16%;归属于上市公司股东的净利润5688.99万元,同比增长30.47%。
对于上述业绩情况,公司董事长陈志敏坦言,“不是很满意,因为我们还可以做的更好”。在现场,陈志敏还就投资者关心的未来机遇和行业发展等问题,进行了交流分享。
据了解,海量数据作为数据中心解决方案与服务的提供商,主要针对大中型企事业单位的数据中心,搭建 IT 基础设施数据平台,提供相关的数据存储与安全、数据库与数据管理、云计算等方面的解决方案和技术服务。
5月16日晚间,海量数据发布股东大会决议公告,当日股东大会审议的《2017 年年度报告全文及摘要》等9项议案,均获得通过。
二级市场上,截止5月16日收盘,海量数据报42.59元/股,下跌1.41%。
- ?
大数据时代,海量数据应该如何解决存储问题?
Zina
展开
489034603
由于大数据的迅猛发展,数据正在呈指数级增长,各种传感器的剧增,高清晰度的图像和视频都是数据爆炸的原因。腾讯、淘宝掌握了大量的用户数据,力图描绘出用户的整体“画像”。面对大数据的汹涌来袭,传统的数据存储和数据库技术已经难以应对,那么,大数据技术如何存储海量数据并提高系统容错性?目前,较为主流的海量文件存储技术有Google的GFS和Hadoop的HDFS,HDFS是GFS的开源实现。它们均采用分布式存储的方式存储数据,用冗余存储的模式保证数据的可靠性。
下面我们通过几个问题,来让大家更好的了解数据存储应该如何解决?
1、大数据的处理流程包括了哪些环节?每个环节有哪些主要工具?
数据采集: 半结构日志文件可使用flume; 结构化数据可以使用传统的E TL工具如,datastage、kettle 等等
数据存储:hadoop hdfs存储海量数据;也可用传统的oracle、sysbase iq等数据仓库解决方案
数据统计: 使用hive、impala对hadoop进行统计分析;
数据挖掘:可使用mahout进行数据挖掘
2、大数据的数据库相比于传统数据库有何变化?出现了哪些新的大数据的数据管理方式?
量大、结构多样、速度要求高等特点; 出现了以hadoop为代表的分布式存储和nosql等数据存储管理方案
3、大数据工程师应该都知道,现在处理大数据文件的存储,比较典型的有Google的Big Table和Hadoop的HBase,它们有哪些相似点和不同点?
Hadoop的HBase是Google的Big 的开源实现,每个人都可以下载来使用,也可以根据自己需要进行修改和完善
以上都为个人观点,谨供大家参考一下,如果感觉写的可以,即可给自己一个比较准确的定位,为以后的学习找准正确的方向。
另外,如果小伙伴想学习大数据技术,可以加下图片下面的交流群,群里有很多学习视频都可以下载,而且每天大数据架构师马士兵老师都会在群里分享大数据的技术。。
- ?
腾讯大数据高级产品总监:海量数据产生海量价值
素白
展开
腾讯将持续对外输出数据服务能力,”在近日举办的“WISE x 新金融峰会”上,腾讯大数据高级产品总监洪桃李一语道出腾讯大数据的未来发展方向。
在这次大会上,洪桃李还强调,腾讯一直以来都希望把自己的能力对外输出,为业界提供服务。此前腾讯曾先后输出基础设施、腾讯云、支付方面的能力,而数据能力的输出才刚刚开始。所以腾讯很愿意与金融领域那些对数据有需要的公司,一起探讨和实验有哪些机会和空间。
比如腾讯大数据在金融反欺诈方面的运用。在洪桃李看来,现在很多公司都在做大数据,但在机器学习、人工智能算法和模型的运用方面,好像没有太大的门槛了,因为很多算法已经标准化。而各家之间真正的区别是,你有6个特征,60个特征还是600个特征。
具体来说,腾讯的差别主要是对用户数千个特征做分析,而且对用户基于这个设备所做得分析,在腾讯的用户画像里有两万多个特征。其中,大数据团队已经整理了三千多个可以产生价值的特征。
腾讯大数据分析的另一大优势是,除了基于设备、基于用户的特征之外,还会基于用户的行为。因为人的画像是静态的,但是人的行为是动态的,用户在手机上的每一个行为,比如你点开了什么,你输入速度是快是慢,一个页面看了几次,停留了多长时间,在什么时间看了什么。如果在金融反欺诈这一块,腾讯的移动分析应用会基于这些行为做一些分析。但前提是,采集信息前获得了用户的同意。
除了金融反欺诈外,腾讯大数据还希望在精准推荐、营销、智能客服方面有更多的开放和应用。
以下为腾讯大数据高级产品总监洪桃李的演讲实录:
我们一直把腾讯自身的一些能力去做对外的输出,来为业界提供服务。在数据领域刚刚开始,腾讯的能力输出先是从其它能力开始的,比如基础设施、腾讯云、支付,因为数据平台能力的开放刚刚开始没多久,所以我们很愿意与金融领域那些对数据有需要的公司,一起探讨和实验未来有哪些机会和空间。
除了刚刚这些应用,我们还打算推出智能客服产品,目前腾讯理财通已经在使用,但我们也想把这个能力对外输出。当用户来到这里的时候,用自然语言问一个问题,这个产品不仅可以理解用户在说什么,而且还知道是谁,并且不需要问用户的收入多少、学历多高等,只要你来了就知道你是谁,然后给你推荐最精准的东西。
我今天演讲的主题是《More Data More Money》。大数据这两年已经讲了很多,而且每一家都有自己做大数据的方法。腾讯不只在讲大数据,而且是有更多的数据价值输出。那我在这里也表个态,腾讯这两年来一直希望把自身的能力贡献给业界,把自身的能力与各个行业进行结合,这是我们腾讯这几年一直坚持的理念。所以现在在各个领域,包括在金融这个领域,腾讯的大数据,未来能有一些怎样的结合,怎样把这个能力给到大家。
用户无时无刻都在产生数据,如用微信支付,用户可以在路边买包子、面包。用户浏览财经资讯,进行投资理财,可能买一个保险,这都会留下数据。比如支付这个简单的行为,我们做了大量的大数据应用,做了大量风险的识别,比如说用户所处的环境是什么样子的,设备是什么样子的,消费情况是不是正常,跟用户的财富情况是不是匹配,身份有没有冒用,号码有没有被盗等等,这些都是帮助金融识别风险的很核心的东西,在腾讯里面已经真正有了这样海量的应用。
比如说兴趣推荐,现在微信上也正在试验一个新的产品叫看一看,用户可以在微信实验室里找到这个产品。还有其它的快报,还有财经资讯等等,我们都会根据用户的兴趣做推荐。
比如说,我们的一个刚刚提到的精准推荐的能力,这里也提供一个在移动App帮助做精准分析推送的工具。腾讯的移动推送工具,可以在你的App里面,根据用户的属性,根据用户的特征。当然这个用户的属性和特征不只是App用户的,还有我们自身对于用户的理解,来帮助做精准的推荐与精准的营销。还有我们有一个MTA帮助做移动统计分析的,可以在这里自动帮用户打上标签,把用户自动分群、自动分类之后,与你的广告投放、营销等等去打通,来帮助你做智能推荐。所以我们一直把腾讯自身的能力去做对外的输出,来为业界提供服务。当然在数据领域刚刚开始,腾讯的能力输出先是从其它能力开始的,比如基础设施、腾讯云、支付,但数据平台能力的开放才刚刚开始没多久,所以我们很愿意与金融领域那些对数据有需要的公司,一起探讨和实验未来有哪些机会和空间。
比如我们最近正在研究反欺诈的事情,我看到很多做现金贷和消费金融的公司,有做得比较精细的,但更多的做得就比较粗糙。最最简单的就是,我列一些规则,这些规则可能是基于人工的经验来进行的,然后不符合就砍掉,最后剩下的好东西就越来越少。再上面一层可能会有一个打分卡,再然后做一个模型,我听说现在本科生就可以做模型,因为商业的软件已经很成熟了,把特征整理好放进去,线性回归、逻辑回归,模型就出来了,已经没有什么门槛。各家区别可能是,你有6个特征,60个特征还是600个特征。但是我们想一想,我们如果做这件事情的差别是什么?我们对用户的行为,我们对用户数千个特征做分析,我们对用户基于这个设备所做得分析,在我们的用户画像里有两万多个特征,我们现在整理了大概三千多个可以在我们这里使用并产生价值的。第二,除了基于设备,基于用户的特征之外,我们基于行为,因为人的画像是静态的,但是人的行为是动态的。如果在金融反欺诈这一块,我们的移动分析是想基于这些行为做一些分析。但前提是,我们的SDK在你的App里面获得用户同意,让我们采集并做这样一个分析。
除了刚刚这些应用,我们还打算推出智能客服产品,目前腾讯理财通已经在使用,但我们也想把这个能力对外输出。当用户来到这里的时候,用自然语言问一个问题,这个产品不仅可以理解用户在说什么,而且还知道是谁,并且不需要问用户的收入多少、学历多高等,只要你来了就知道你是谁,然后给你推荐最精准的东西。
最后我们还记录用户睡眠、运动等生活习惯方面的数据。我们曾经分析一个用户晚上睡眠时长跟他的金融风险的关系,我们发现确实非常的有用。我想起前面一个投资人说对创业者的期待,希望创业者有良好的生活规律,这个挺有意思的,从大数据里确实发现了这个特点。
所以我今天想要说的就是,腾讯这几年在不断的输出能力,其中数据服务能力的输出才刚刚开始。而且腾讯很愿意跟一些机构来进行探讨,包括在精准推荐、营销、反欺诈、智能客服方面探讨合作。我今天的内容就到这里,希望更多的数据带来更多的财富。
- ?
大数据技术如何提升海量经典空间数据管理能力?
掺杂
展开
很多大数据都具有空间位置信息,这些空间大数据可以通过大数据GIS技术进行高效存储、索引、处理和分析。另一方面,经典GIS所需面对和处理的数据规模也在快速膨胀,对于经典GIS中超大规模数据的处理与分析,同样需要大数据GIS技术作为支撑。经典GIS中常用的缓冲区分析、叠加分析、空间查询等算法都可以通过大数据GIS技术进行分布式重构,用以面向不断膨胀的超大规模数据。
一、经典GIS数据存储方案
在各种GIS项目应用当中,首要设计的就是数据存储方案。在经典GIS当中,典型数据类型包括矢量的点线面数据、影像和栅格数据、地图缓存瓦片数据等类型。在存储引擎类型方面,使用较多的类型包括以PostgreSQL为代表的SQL数据库型存储,以及众多NoSQL型数据库,包括以MongoDB为代表的文档型数据库,以HBase为代表的列存储数据库,以Redis为代表的key-value型数据库等。随着互联网应用的深入,各种NoSQL型数据库得到了快速发展,并具有支持分布式可扩展部署,高性能读写等特征,因此在大数据GIS技术中,有必要对其进行吸收和融合。
在大数据应用中,由于涉及的数据体量巨大,存储和计算环境的部署强调二者的一体化,或者通过计算向数据靠拢来实现高效的数据读写。在海量空间数据场景下,需要通过空间索引技术将节点内的数据尽可能的保持完整性和独立性,尽量避免节点间的数据交换,从而实现高效的分布式计算。
1、PostgreSQL
PostgreSQL是一个功能强大的开源关系型数据库系统。可以支持各种主流操作系统,它完全兼容ACID,完全支持外键,连接,视图,触发器和存储过程(使用多种语言)。在GIS应用当中,可以使用它进行矢量点线面数据,栅格数据的高效存储和查询,由于它完全支持ANSI-SQL:2008标准,因此可以基于其上定制各种业务化的查询和存储过程。另一方面,基于其上的PostGIS数据库可以直接进行空间对象的存储和索引,并支持高效的查询,以OpenStreetMap为代表的很多GIS应用直接基于PostgreSQL引擎之上构建存储层。
2、MongoDB
MongoDB是一个基于分布式存储的NoSQL文档型数据库,它是一个介于关系型数据库和非关系型数据库之间的产品。大多数NoSQL都提供较少的关系型数据库特征,但MongoDB是个例外,其对于SQL查询支持较为丰富。其BSON形式的数据结构非常适合进行缓存瓦片的存储,而缓存瓦片的使用往往也不要求过多的SQL查询语法支持。另一方面,它也同样可以进行矢量点线面的存储,并且内置了Spatial扩展可以支持空间索引和空间查询。
3、HDFS
HDFS是一种分布式文件系统,它虽然不是一种数据库产品,但由于其是Hadoop生态体系的基石,且与Spark技术无缝结合,因此在大数据实施时,经常被用来作为一种通用型存储方案。在大数据GIS当中,其使用方式主要有两类,一种是直接作为文件系统,将csv、json格式的大文件放置其上进行直接存储,另一种是作为Spark计算引擎的存储方案,使用自定义的二进制格式存储空间数据,并进行空间二级索引设计和实现,以高效对接Spark分布式计算。
二、经典GIS数据处理方案
由于各种存储引擎特点不一,因此在项目实施中,如何选择最适合的存储和计算方案,需要与项目的具体使用背景相结合。我们建议从数据规模(千万级、亿级、十亿级还是更大)、数据更新频率(年、月、日还是更小)、数据处理复杂性(SQL查询、空间查询还是复杂空间运算)等几个维度进行综合考量。我们选择了几个较为典型的应用场景,进行具体说明。
1、千万级实时更新
该应用的典型客户为政府各单位的分中心,虽然全国范围内的汇总数据规模庞大,但省市分中心单位维护的子库数据规模在千万级左右。虽然数据规模不大,但是具有业务逻辑复杂,要求实时更新的特点,因此推荐根据业务场景,灵活使用Oracle或UDB数据库型引擎。可以进行实时更新,也可以根据复杂业务进行较复杂的SQL查询检索。并且可以对接Spark计算引擎,进行大规模数据的复杂计算。
2、亿级准实时更新
该应用的典型客户是部委的全国级主中心,从各省市分中心汇总的数据规模可以达到亿级到十亿级规模,更新频率低于分中心的实时业务系统,但也需要具备一些SQL查询能力。此时推荐使用PostgreSQL或MongoDB进行分布式存储,一方面可以支持数据的动态扩展,另一方面也可以支持一定的SQL查询。当然也可以对接Spark计算引擎,进行业务计算。
3、十亿级低频更新
该应用的典型客户也是部委的全国级主中心,可能需要对汇总的多年份历史数据进行时间序列分析或者综合性分析。此时的数据更新频率较低,可能是以年为单位,但总体的数据规模非常庞大,可能达到十亿甚至百亿规模。此时推荐使用HDFS进行数据存储,再对接Spark技术进行分布式计算,对这种超大规模的空间数据进行处理和综合分析。
三、经典GIS应用案例
矢量数据的空间叠加赋值算法,是国土测绘领域这样的大规模矢量数据分析常用功能。SuperMapiObjectsjavaforSpark以该算法为例,讲解大数据技术如何提升经典GIS数据处理和分析性能。矢量数据分析的基础是高效的空间索引,而分布式矢量分析同样需要基于空间索引进行加速。
1、分布式构建空间索引
分布式构建空间索引根据整体流程,又可以细分为索引对象构建,数据集重分区,索引后数据缓存等几个子过程。较常使用的索引类型有均匀格网索引和四叉树索引两种。索引对象构建后可以广播到集群各节点,数据集重分区过程各节点可以获取该对象进行空间对象处理。由于后续的叠加赋值计算需要基于索引后数据进行,所以SuperMapiObjectsjavaforSpark需要把重分区后的数据缓存下来,以kryo序列化的方式将数据缓存到HDFS上。
2、分布式叠加赋值计算
由于在前面的分布式构建索引过程中,SuperMap iObjects java for Spark把按照索引重分区后的数据缓存到了HDFS上,因此在进行叠加赋值计算之前,SuperMap iObjects java for Spark首先需要将数据从HDFS上读取到Spark的RDD中。在读取之后,就可以基于索引后的FeatureRDD进行两图层间的叠加计算了。由于叠加赋值一般涉及被更新数据和更新数据两个数据集,所以SuperMap iObjects java for Spark使用RDD的zipPartitions接口来将两个RDD进行组合。
四、经典GIS性能提升测试
SuperMap iObjects java for Spark使用的测试环境的单节点操作系统为64位Ubuntu 16.04 Linux系统,CPU为英特尔酷睿i7-6700K,四核处理器,主频为4 GHz,硬盘为1 TB,内存为16 GB。Spark集群配置为一个Master节点,四个Woker节点,即五台同配置的PC机环境。使用的Hadoop版本为2.7.3,Spark版本为2.1.0。
测试数据局部放大图
为了保证测试的有效性,SuperMap iObjects java for Spark设计了规模不等的三组矢量数据进行分析计算。A组数据被 更新图层图斑对象数目为10万,更新图层(即提供属性值的图层) 图斑对象数目为80。
两图层数据分布特征为:更新图层的单个矢量面对象面积显著大于被更新图层对象,但二者的总体图斑覆盖范围相近。B组数据被更新图层图斑对象数目为100万,更新图层图斑对象数目为800,两图层数据分布特征与A组数据类似。C组数据被更新图层图斑对象数目为1000万,更新图层图斑对象数目为1万,两图层数据分布特征与A组数据类似。SuperMap iObjects java for Spark将分布式改进后的方法与传统GIS软件的单节点叠加赋值功能进行了性能对比,结果如表1所示。
表1性能测试结果
从测试结果可以看出,基于大数据技术的矢量数据叠加赋值方法,在不同级别的实验数据下,相比传统GIS单节点功能都有更好的性能表现。在小规模数据量(数据A)场景下性能有约33%的提升,在中等规模数据量(数据B)场景下性能有约71%的提升,在大规模数据量(数据C)场景下性能有约90%的提升,图2使用柱状图来更为直观的进行结果展示。
在对常用的GIS核心算法进行分析之后,我们认为:大多数的经典GIS核心算法都可以进行分布式算法改进,即使用大数据技术进行海量空间数据处理和分析的性能提升。目前SuperMap iObjects java for Spark已经完成的算法包括空间查询、叠加分 析、缓冲区分析、属性更新、矢量裁剪等功能,后面还计划针对矢量数据处理,拓扑检查等经典GIS常用功能进行进一步的升级改进。
内容来源:超图
- ?
海量大数据风控,更懂中国借款人
虚浮
展开
“在我们进入之前,整个行业的风控,实行的是人盯人模式,而现在,有了我们的大数据风控服务,放贷的风险降低了,交易的效率呈几何倍提高。”8月2日,在海量大数据CEO办公室,张大春首次向外界介绍了公司的业务、自己对行业的判断。
张大春做的产品叫海量,采用sns、电商、电信、交通出行等大量用户在互联网上的信息来建立数据仓库;配合知识图谱等前端科技,提供反欺诈策略;运用logiatic回归算法加上机器学习建立风险模型;基于NPV、P/L分析方式帮助进行客户细分和风险定价。
简而言之就是帮助信贷机构判断客户能不能借,能借多少?
华丽的团队背景,更懂中国借款人
海量创始人、CEO张大春言行举止透着睿智和谦和,显然是位儒商。
阅读张大春的经历,会感到浓烈的国际范。他先后毕业于美国威斯康辛大学、美国哈佛大学商学院。他先后在美国第一资本银行(Capital One)、美国花旗集团(Citi Cards)、埃森哲管理咨询(Accenture MC)以及国内的平安银行从事风险管理工作。
张大春和他的团队正在改变中国互金行业风控的思维方式和路径选择。凭借美国顶尖银行的高级风险管理岗位的经验,以及多年的中国市场开拓、管理实战经历,海量大数据能为银行和非银信贷机构提供一整套信贷产品互联网风控技术解决方案。
快速分清“好人”“坏人”
无论是互联网金融还是消费金融,从业人员一直在寻找更为靠谱的手段、路径。
新的征信手段,与银行有很大的差异。银行的信用卡部门,信贷审核是基于央行征信报告、社保、学历、工作单位、薪酬水平等容易被验证的变量,而互联网金融、消费金融服务于信用更下沉的人群,包括初入职场的年轻人、蓝领灰领工人、在校大学生、农村居民,由于工作的流动性大,或者社保记录不全,以往的银行征信手段难以涉及。
传统的征信手段、路径,往往是人盯人的“人治”性质,需要业务人员面对面地审查用户的资料,以此做出判断。大致场景是,如果某人需要贷款,会联系放贷方的业务人员,出示身份证,递交相关材料,由业务人员审核真伪,评估放贷有无风险,最终由总部予以批准或者拒绝。全流程的科学性不足。
“1个业务人员1天接受10件申请,已经是很高效率了。”张大春认为,效率太低、安全性太低。而海量大数据可以比人工审核增加至少50%的业务单量,降低20%的逾期率,“简而言之,优点是,降低成本+提高效率+增加利润,在一笔业务的完整周期内(贷前、贷中、贷后),提供一站式的风险管理服务解决方案。”
有测试表明,人盯人的人工审查,在打电话交流上的耗时,平均需要20分钟,而大数据技术可以在1分钟内做出判断,这个用户有没有欺诈的嫌疑?可以放贷多少金额?
风控人员以往需要审核大量纸质材料,来决定是否放款,而借助大数据风控模型的7×24小时不停滚动,可以在两三分钟内完成自动化风控审核,覆盖到传统银行信用卡无法触及的更广阔人群。
大数据并不神秘。人类原本属于“群居动物”,物以类聚、人以群分,“好人”“坏人”都有抱团扎堆的习惯。以贷款为例,当某人在消费金融客户端填好分期贷款申请的那一刻,就揭开了自己所处的巨大的社交图谱网络。在这个网络中,某人与别人可能是互相频繁通电话的强联系,也可能只是浏览过QQ空间的弱联系。
在移动互联时代,没有人可以彻底隐形。借款人在百度曾经浏览过的网页、在淘宝留下的交易记录、手机是白天活跃还是深夜活跃,都可以被抓取,作为评估借款人的数据源,勾勒出一个人的日常生活轨迹。由几亿的数据节点汇聚成的社交图谱网络,让“好人”“坏人”都有迹可循。
“好人”“坏人”是消费金融领域对于信用状况良与不良的借款人的通俗称谓,每个人的社交圈构成、具体的日常行为,在一定程度上决定了这个人的信用度。
张大春及团队,将数据分为两类:结构化数据,由黑名单、申请资料、设备信息、银行卡交易等组成;非结构化数据,由运营商、互联网行为、第三方提供所组成。两类数据可以归并为某用户的身份属性、履约能力、信贷历史、行为特质、消费偏好、社交影响,并进一步显现该用户的行为风险、社交风险、语义风险。上述数据和结论,都将集成模型,快速、便捷地应用于对用户的评判。
对贷前、贷中、贷后实行全覆盖
海量大数据还可以为企业精准营销。张大春介绍,基于调研数据维度,聚类分群,获得客群划分结果;从规模、成长性、开发价值等维度筛选潜在客群;焦点小组访谈,结合定量问卷,详细挖掘和了解潜在客群需求;明确近期开发综合金融产品的组合目标客群。
海量大数据的作用被归纳为:基于海量业务数据,配合知识图谱等前端科技,提供全类型金融产品的反欺诈策略;运用传统逻辑回归算法,辅以机器学习等方法进行信用风险建模,准确预测申请客户的风险等级;通过数据分析帮助企业对客户细分,进行风险定价及续贷提额,充分挖掘客户更大价值,为企业创造更大利益;联合知名资产处置公司,做好风控闭环的最后一步,凭借海量核心技术提高逾期资产回收率。
相比银行信用卡对客户实行的费率一刀切,互金企业和消费金融企业可以借助海量大数据,更加精准地定位风险溢价,可以把社会群体的坏账可能性,由低至高分成50档之多,大数据相当于对一个借款人,进行了全方位的拍照,有的角度显示其是“好人”,有的角度显示其是“坏人”,各种照片叠加,由软件自动决策,这位借款人究竟应该归入哪一档费率。
贷中管理其实很重要,借款人的情况很可能发生变化,需要及时掌握。这时候,海量大数据会提供借款人的还款情况、账单情况、社交情况,将这些参数扔进决策引擎,产生出借款人更多的动态画像。
海量大数据不仅适用于P2P企业等非银信贷机构,也适用于银行等信贷工厂和新兴信贷业务,帮助一线销售、运营、风控、客服、催收,让他们的录单、信审、授信定价、催收、报表等工作更智能、更快、更稳定。
大数据技术处于萌芽期
确有不少业内人士对大数据风控的有效性存疑,行业内真正掌握大数据筛选能力的公司仍在少数。
“很多中小企业还没有使用大数据的意识,或者,有了意识却没有行动起来。”张大春感慨,中国有十几万家的放贷机构,很大一部分仍然奉行经验主义,依赖业务人员的个体素质。“这些机构的放贷、催收环节,风控能力都值得担忧,都容易发生问题,比如,业务员与贷款人士勾结,业务员的直接领导不一定能够及时发现,而负责最终审核的总部,也很难控制。”这些风控不过关的机构,怎么可能做大做强呢。
这就好比相同的疾病,实习医生治不了,主任医生却很拿手,因此,同样的大数据,在不同的分析者手里,效果、结果不一样。这不是大数据的错,而应该检讨分析者的能力,数据量是否足够覆盖,能不能及时更新,以及处于什么情景下,都会产生影响。但是,数据是互联网金融企业的重要资产,已成为行业共识。谁掌握了客户群体的信用基础数据,并能准确分析,谁就可以实现最低成本。
张大春呼吁互联网金融企业、消费金融企业尽早运用大数据技术,为企业的运营增加一件防弹衣、一个加速器。“大数据技术在国内互联网金融行业处于萌芽期,一是存在技术门槛,需要接入大量的外部数据,二是存在分析能力的门槛,需要配备统计、数学、物理等专业背景的员工,需要硕士以上学历。三是风险管理的模型必须经过真实信贷数据校验,我们的模型已经跑了300万人次,实践证明,高效易用,这个在行业里面应该是首屈一指的,当然,酒香也怕巷子深,我们也需要多花时间向银行和非银信贷机构推广。”张大春如实说来。
- ?
海量健康大数据带来投资机遇 哪些公司已布局?
雨安
展开
未来的某一天,智能手表会随时监控你的健康数据。如果数据异常,你专属的机器人能帮你预约到最近的诊疗中心,医生会告诉你是否需要到诊疗中心做进一步的检查。
你甚至不需要取药,药品在24小时内可以送到你家;通过移动互联网还能让机器人帮助你一键做手术......
这个场景正在变成现实。国家卫生健康委员会近日发布了《国家健康医疗大数据标准、安全和服务管理办法(试行)》(简称《试行办法》)。市场人士认为,随着国家政策的强力推进,健康医疗大数据应用已经站到发展的风口上。
健康医疗大数据将实现互联互通
神州数码控股有限公司董事局主席兼首席执行官郭为接受上海证券报采访时表示:《试行办法》的发布,可以推动政府健康医疗信息系统和公众健康医疗数据互联融合、开放共享,真正打破“信息孤岛”。
《试行办法》明确,在推动健康医疗大数据应用发展过程中,严格遵守相关法律法规和文件规定,在强化标准管理和安全管理的基础上,寓管理于服务之中,为提升健康医疗大数据的服务能力和管理水平奠定基础。
在数据采集方面,责任单位要严格执行国家和行业相关标准和程序,要做到标准统一、术语规范、内容准确,并严格实行信息复核终审程序,确保数据质量。
在数据存储方面,健康医疗大数据应当存储在境内,因业务需要向境外提供时,应按相关法律法规和要求进行安全评估审核。
在数据利用方面,责任单位应坚持包容审慎的态度,加强数据的规范应用和服务,推动部分健康医疗大数据在线查询,同时,不得泄露国家秘密、商业秘密和个人隐私,切实保障各相关方合法权益。
在数据共享方面,国家卫生健康委负责建立健康医疗大数据开放共享机制,统筹建设资源目录体系和数据共享交换体系,强化对健康医疗大数据全生命周期的服务与管理。
大数据市场增长潜力巨大
那么,被采集、存储、共享后,健康医疗数据有多大?
医疗行业是数据密集型行业,IDC(国际数据公司)预测,截至2020年医疗数据量将达40万亿GB,是2010年的30倍,同时数据生成和共享速度增加,导致数据加速积累。
图片来源:前瞻产业研究院
我国存在人口基数巨大、医疗资源浪费严重、医疗资源紧缺和配置不合理、医疗支出增长过快、商保发展乏力等问题,医疗大数据的可应用场景丰富且能深度挖掘,因此我国健康医疗大数据市场的增长潜力更大。
根据前瞻产业研究院发布的《2018-2023年全球健康医疗大数据行业发展前景预测与投资战略规划分析报告》分析指出,2015年我国医疗大数据行业市场规模在466亿元左右,未来的上升空间还比较大。
预计到2022年市场规模将达到910亿元。预计健康大数据市场的爆发点即将会来临,投资机会也将显现。
图片来源:前瞻产业研究院
医疗大数据有什么用?
从国外的经验来看,医疗数据应用主要有两个大方向:一个是公共卫生方向;另一个是商业应用方向。
其中,公共卫生方向主要是基于用户行为数据的疾病预测;而商业应用方向形式多样,可以为医疗机构提供治疗方案和治疗效果的比较、临床决策支持和远程病人监控;可以帮助保险公司实现风险控制、识别欺诈和基于医疗质量评估;也可帮助制药企业实现个性化药品研发和精准化营销。
哪些上市公司已布局?
神州控股
郭为对上海证券报记者表示,目前,神州控股医旗下的神州医疗已经和中国医学科学院肿瘤医院、协和医院、上海复旦儿科医院三大国家级的医学中心在临场应用层面开展合作;与中国国家癌症中心(CNCC)、英国公共卫生署(NCRAS)共同签署合作协议,共同推进中英在肿瘤大数据平台建设上开展研究与交流、咨询与培训等多维度的学术合作;与国际知名基因组研发和诊断企业康剑尼科(Congenica)就临床数据和基因组数据的有效、准确分析展开深入合作。
郭为说,“通过这些健康大数据层面的合作,可以把长期医学界积累的宝贵经验,转化成标准化的知识基础,做到数据驱动医疗服务,从而大大提高供给端的服务能力和效率。”
创业软件
创业软件是国内规模较大的医疗大数据企业,年报显示,2017年医疗信息化应用软件业务实现收入5.22亿元,同比增长24%。此外,创业软件重点加强地市级和区县级营销网络的建设,用户数量增长到6000多家,公共卫生项目遍及全国200多个区县。创业软件2017年相继延收购美诺泰科、杭州卓腾,控股梅清数码,新设了医康数据,不断拓展布局。
朗玛信息
目前,39健康网已经形成了医疗健康资讯、“39问医生”、“疾病百科”、“药品通”、“名医在线”等多个板块,并与全国知名三甲医院、知名药企都有着长期稳定的合作关系,从而积累了海量的医疗健康信息。
卫宁健康
公司专业从事医疗卫生领域信息化、数字化的企业,业务覆盖智慧医院、区域卫生、基层卫生、公共卫生、医疗保险、健康服务等领域。截至目前,卫宁健康服务的医疗机构数量超过5000家,是同行业客户覆盖最广的公司之一。
此外,东软集团、浪潮集团、万达信息、易联众、荣科科技等上市公司,通过入股组建中国国家健康医疗大数据股份有限公司,正在健康医疗大数据领域积极拓展。
本文来自上海证券报·中国证券网,创业家系授权发布,略经编辑修改,版权归作者所有,内容仅代表作者独立观点。[ 关注创业家,读懂中国7000种赚钱生意 ]
- ?
大数据不仅仅是海量数据
武栾
展开
大数据如果仅仅是海量的结构性数据,那么解决的办法就比较单一,用户可以通过购买更多的存储设备,提高存储设备的效率等解决此类问题。然而,问题似乎没有那么简单。曾经听到过一个对于大数据所下的定义我觉得比较到位:“大数据其实是海量高维度数据的相关性分析”。什么意思呢,我们慢慢说。
量的积累
当类型复杂的数据汹涌袭来,那么对于用户IT系统的冲击会是另外一种处理方式。有调查发现,这些复杂数据中有85%的数据属于广泛存在于社交网络、物联网、电子商务等之中的非结构化数据。这些非结构化数据的产生往往伴随着社交网络、移动计算和传感器等新的渠道和技术的不断涌现和应用。
如今大数据的概念也存在着很多的炒作和大量的不确定性。有人将很多TB的数据集也称作”大数据”。据市场研究公司IDC统计,数据使用预计将增长44倍,全球数据使用量将达到大约35.2ZB(1ZB=10亿TB)。但是单个数据集的文件尺寸也将增加,导致对更大处理能力的需求以便分析和理解这些数据集。
对大企业而言,大数据的兴起部分是因为计算能力可用更低的成本获得,各类系统如今已能够执行多任务处理。其次,内存的成本也在直线下降,企业可以在内存中处理比以往更多的数据,另外是把计算机聚合成服务器集群越来越简单。IDC认为,这三大因素的结合便催生了大数据。同时,IDC还表示,某项技术要想成为大数据技术,首先必须是成本可承受的,其次是必须满足IBM所描述的三个”V”判据中的两个:多样性(variety)、体量(volume)和速度(velocity)。
多样性是指,数据应包含结构化的和非结构化的数据;体量是指聚合在一起供分析的数据量必须是非常庞大的;速度则是指数据处理的速度必须很快。
Garter表示,全球信息量正在以59%以上的年增长率增长,而量是在管理数据、业务方面的显著挑战,IT领袖必须侧重在信息量、种类和速度上。
量:企业系统内部的数据量的增加是由交易量、其它传统数据类型和新的数据类型引发的。过多的量是一个存储的问题,但过多的数据也是一个大量分析的问题。
种类:IT领袖在将大量的交易信息转化为决策上一直存在困扰:现在有更多类型的信息需要分析,主要来自社交媒体和移动(情景感知)。种类包括表格数据(数据库)、分层数据、文件、电子邮件、计量数据、视频、静态图像、音频、股票行情数据、金融交易和其它更多种类。
速度:这涉及到数据流、结构化记录的创建,以及访问和交付的可用性。速度意味着正在被生成的数据有多快,数据必须被多快地处理以满足需求。
综上所述,大数据的基础是多样的,包括结构和非结构的数据,而软硬件架构的进化使得这样规模的数据处理变成了可能。那么能力有了,怎么来很好的利用能力实现价值呢?
质的变化
虽然大数据是一个重大问题,Gartner分析师表示,真正的问题是让大数据更有意义,在大数据里面寻找模式帮助组织机构做出更好的商业决策。尽管”BigData”可以翻译成大数据或者海量数据,但大数据和海量数据是有区别的。在刚才提到的对于大数据的定义中,海量数据以及处理海量数据的能力目前已经满足,那么什么是高纬度数据的相关性分析呢?
著名的奢侈品品牌Prada在其欧洲门店做过这样一个业务改进,他们在衣服的衣架上安装一个电磁芯片,并在试衣间中安装一套传感器装置,每当衣物被带进试衣间试穿就会被相应计数一次。这样一个简单的改进在于,它使得管理人员能够从数据中找到那些试穿多但是购买少的产品,之所以试穿多购买少说明这种产品一定是看上去不错,但是试穿后会发现一些设计上的瑕疵或者不合理的地方,那么设计人员就会有针对性的修改相关产品,这样做明显提高了门店的销售业绩。
从上面的例子看出,prada的管理人员创造性的创立了一个新的描述产品属性的维度,这就属于维度的提升和创新,这样创新出的维度就是高维度,高维度可能是传统维度汇总后更高粒度的维度,有的可能是创造出来的描述事物的新角度。而把这些维度关联起来进行分析,将事物不同的维度作为因,将因和果关联起来分析,就能更好的了解事物属性。
因此可见,硬件性能的提升,价格的下降,以及高扩展性软件架构的应用,使得企业高效的从更多角度,更高频度的收集并分析业务数据变成了可能。作为技术人员,在大数据时代,我们将应用更加高效的软硬件架构构建我们的平台,而要真正的发挥大数据的威力,从业务方面增强创新和创造能力、创新分析方法,提高分析多样性就显得更加至关重要。
海量大数据
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并