中企动力 > 商学院 > 大数据科研系统
  • ?

    如何利用大数据为您的科研工作装上助推器?盘点3种大数据分析技能

    明亮

    展开

    在调查研究中,常常会遇到很多的大数据分析处理工作,人们需要在这些数据中分析出事物的一些规律,从而找出事物间的客观联系,得出研究理论的实践依据。因此对于科研工作者来说,大数据分析能力是工作中必不可少的技能包之一。下面我们来看,需要那些基本的分析能力呢?

    一、数据可视化

    简单的说就是将数据用图或者表直观展示出来。可以使用Excel中大量的公式函数,通过这些函数执行计算,分析信息并管理电子表格或网页中的数据信息列表与数据资料图表制作。在这个方面事实上,Excel的功能非常强大而且全面,完全可以满足日常工作中图表制作和数据可视化的需求。因此掌握好Excel技能,对大数据的可视化分析是一个很好的帮助。

    我们还可以用ECharts和D3.js 等基于HTML5 的两个纯Javascript图表库,可通过网页编程,在网页上显示出直观、可交互并且可个性化定制的数据可视化图表。具有创新的拖拽重计算、数据视图、值域漫游等特性,还有混搭图表、拖拽重计算、制作数据视图、动态类型切换、图例开关、数据区域选择、值域漫游、多维度堆积等非常丰富的功能。它们的用户体验非常好,不过需要一点网页开发的基础才可以使用。

    二、机器学习

    对于理工科背景的人们来说,这块领域入门还不算太难,首先需要具备了统计学和概率学的基础知识。机器学习的基础包括聚类、时间序列、推荐系统、回归分析、文本挖掘、决策树、支持向量机、贝叶斯分类和神经网络。从这些名词我们可以看到,没有统计学和概率学的基础知识是无法学好机器学习的。在了解基础知识的同时,推荐两个关于机器学习的框架:谷歌的TensorFlow和百度的百度大脑。

    三、算法

    对于大多数人程来说算法经常听人提起,并不会太陌生,比如什么是数据结构,它包括栈、队列、链表、散列表、二叉树、红黑树、B树等等。然后是常用算法包括:排序(插入排序、桶排序、堆排序、快速排序)、最大子数组、最长公共子序列、最短路径和矩阵的存储运算。学好算法有利于更进一步深入学习如何开发程序来分析和处理大数据。

  • ?

    大数据分析科研人才地理分布全景地图

    寻双

    展开

    众所周知,科技是第一生产力。科技兴,则民族兴;科技强,则国家强。

    大家也认同,人才资源是第一资源。人才是创新的根基,创新驱动实质上是人才驱动。

    中国是人口第一大国,也是人力资源大国。据中国科协、科技部的数据, 2014年我国科技人力资源总量达到8100万人,按人头统计我国R&D人员总数为535.1万人,按全时当量统计R&D人员为371.1万人年,均居世界首位。

    随着科研队伍规模快速壮大,我们进入了“不患寡而患不均”的时代,不论是政府、企业还是学术界将关注的焦点逐渐转移到科研队伍的质量和结构问题,有关科研人员的地域分布与流动趋势也愈加成为社会讨论的热点。

    为此,科学家在线联合中国科协创新战略研究院,从大数据的视角,利用可靠的动态实证数据和科学的量化研究方法,深入分析中国科研人员的学术分层、领域分布、机构分布、地理分布及其流动变化趋势,探寻人才结构与科技创新、社会经济发展之间的相互关系,为政府、企业、机构和个人决策提供参考。本报告选取2006-2016年这十年之间有成果产出的科研人员作为分析对象,共计2469025人(约240万人),涉及自然科学、农业科学、医药科学、工程与技术科学、人文与社会科学等所有学科分类。

    “科研人员”是指从事科研活动并取得成果专业技术人员。从职业来看,通常包括科研院所的研究人员,高校教师和研究生,企业的研究开发、设计和工程人员,医疗机构的卫生技术人员等。

    “科研机构”指的是科研人员所在的组织机构。一般来说,科研机构有明确的研究方向和任务、有一定水平的学术带头人和一定数量、质量的研究人员,并且有开展研究工作的基本条件、能长期有组织地从事研究与开发活动。

    “数据来源与研究方法”利用数学建模、数据挖掘和网络关系分析技术,整合众多异构来源数据,构建科研人员数据库。

    下图是科学家在线建立中国科研人员数据库的系统架构。

    一、从“H指数”看科研人员的学术分层

    我们采用 “H指数”方法来计量科研人员的学术水平和能力。一名科学家的H指数是指其发表的N 篇论文中有H篇每篇至少被引h次,而其余N-H篇论文每篇被引均小于或等于H次。

    我们按照H指数将数据库中的科研人员划分为四级:

    1. H指数处于0-5定义为“其初级科研人员”,其人数为1996040人。

    2. H指数处于6-15定义为“中级科研人员”,其人数为425004人。

    3. H指数处于16-25定义为“高级科研人员”,其人数为38699人。

    4. H指数大于25定义为“杰出科研人员”,其人数为9258人。

    各阶层所占总数百分比如图所示:

    全国科研人员按H指数学术能力分层

    数据结果显示,我国科研队伍呈现出典型的金字塔结构:初级层次的科研人员达80%,占绝大多数;而高级和杰出层次的科研人员比例不到2%,可谓凤毛麟角。当前我国科技事业发展正从以跟踪模仿为主的“跟跑”向“并跑”、“领跑”转变,需要大批能够参与全球竞争的高素质人才,这对我国优化科研人员结构提出了更高要求。

    二、近十年中国科研人员数量及层级流动趋势

    近十年来,我国科研人员的总量(注:根据本研究所定义的数量)从06年的不足150万人增至15年的逾240万人,增长了惊人的60%,这反映出我国在建设创新型国家背景下,科研队伍规模快速发展,为产业结构转型升级提供了人才保证和智力支持。从人员分层来看,十年间我国杰出及高级科技人员的数量出现成倍增长,反映出我国近十年来综合科研水平和国际影响力不断上升。如下图所示:

    2006年-2015年我国各层次科研人员变动

    下图以科研人员学术层次为维度,分别展现了2015我国初级、中级、高级、杰出、四种层次的科研人员的地理分布情况。

    2015年我国初级科研人员动态分布图 2015年我国中级科研人员动态分布图 2015年我国高级科研人员动态分布图 2015年我国杰出科研人员动态分布图

    从上图可以看出,我国初级与中级科研人员分布基本趋于一致。分布总体为东密西疏,主要集中于京津冀地区,山东半岛,辽东半岛,长三角地区,珠三角地区以及中原地区,高水平(高级和杰出)科研人员多集中于华北、华东、华南及东北地区。这与我国重点大学、重点科研单位的地理分布保持一致,一定程度上反映了我国在经济和科学教育上的区域不均衡发展,以及我国的科研资源的不均衡分配。

    三、全国各级科研人员的地理分布和动态分析

    我们截取2006、2015年两个时间节点,利用地理信息系统系统,分别对各个阶层的科研人员在全国范围内的空间分布以及流动的情况进行了动态分析。

    初级科研人员:流动变化微乎其微

    2006、2015年初级科研人员地域分布对比

    从上图可以看到,占到全体科研人员总数80%的初级科研人员分布和总体分布是高度类似的。在两个时间节点上,相对于其庞大的基数,其流动变化可以说是微乎其微,在地图上并不能看到很明显的变化。这说明了底层科研人员想要流动上升成为具有学术影响力的科研人员非常困难。

    高级科研人员:区域分布日益均衡

    2006、2015年高级科研人员地域分布对比

    总体上而言,除陕西以外的中西部地区都长期处于高级科研人员匮乏的状况;北京,上海,江苏,广东,陕西,武汉、浙江等地区一直较为稳定处于第一梯队上。北京高级科研人才在2006年占到了全国总数的44%,到2015年,尽管出现幅度下降,仍占27%,一骑绝尘。

    但近十年来,我国高级科研人才在地域上的分布呈现显著的日益均衡发展趋势,各个地区间的相对差距在减小。东北三省所占全国高级科研人员比例逐步增加,从2006年三省合计不足4.2%到了15年的7.4%,增幅可观。同时,在山东、湖南、重庆等地区也观察到了相同的现象。

    杰出科研人员:从沿海到内陆扩散

    2006、2015年杰出科研人员地域分布对比

    从上图可见,在2006年之初,北京、陕西,江苏,上海,黑龙江以外的地区,几乎都未能拥有杰出科研人才。随着时间推移,杰出科研人才渐渐开始从沿海向内陆扩散,相对于高级人才而言,杰出人才的扩散程度更高。而北京杰出科研人才比例上依旧占有主导地位,但是并不像高级人才领域一样占据压倒性优势。上海,江苏两地大有与其分庭抗礼之势。另一方面,广大中西部地区对最高层次的科研人才还是不具备吸引力。

    四、科研人员空间分布研究:

    两极分化严重,不均衡度下降

    我们通过集中度指标及均衡度指标来测算我国科研人员空间分布。其中,集中度指标是用来分析某种经济或科技等活动在地理空间上集中的程度;均衡度指标是用来分析某种经济或科技活动在地里空间上均衡分布的程度。

    假定均衡状态下各省市科研人员平均分布,计算出实际情况下各区域人数和分布的基尼系数,并作出洛伦兹曲线,测算结果显示如下所示:

    高级科研人员空间分布:不均衡性下降

    2006-2015年,高级科研人员地域分布均

    以上两张图是基于2006-2015年我国高级科研人员的地区分布而做出的洛伦兹曲线,可以明显的发现图形中的弓形面积在减小,这也就说明了我国高级科研人员在地区上分布的不均衡在下降。

    杰出科研人员空间分布:不均衡性下降

    2006-2015年我国杰出科研人员地域分布

    2006-2015年,我国杰出科研人员的地区分布的洛伦兹曲线也显现了相同减少的趋势。

    全国科研人员空间分布:

    两极分化严重,层次高者分化明显

    2006-2015年,全国科研人员地域分布

    借助洛伦兹曲线,我们得以计算2006-2015年来,我国高端和杰出科研人才以及总科研人员分布的基尼系数变化,结果如下表:

    2006-2015年,我国高杰出科研人才以及总科研人员分布的基尼系数变化

    由此可见,我国人才分布呈现着极端的两级分化现象,而且层次越高的科研人才两极分化的程度越明显。集中度和基尼系数的测算表明,我国科研人员的区域集中度均较高,区域配置存在较大的不均衡性。尤其是在高端和杰出人才的分布上,存在明显的不平等。而且越是层次高的科研人员分布越是不均衡。

    小结:

    上述数据表明,我国科研人员的区域集中度较高,区域配置存在较大的不均衡性:科研人员多集中在经济发达的东部地区,如北京、江苏、广东、山东、上海等地区,这些地区的经济收入水平相对较高,受强市场竞争力的驱动,企业对创新人才需求旺盛,再加上科研环境和工作条件较优厚,市场对人力资源的配置能力较强,因此,对科技人员的吸引力也更强。中西部由于经济发展水平较低,企业对科技创新的重视程度还不高,政府对科技的投入力度也相对较小,因而致使科研人员的工资待遇、发展机遇和科研环境及创新氛围等均不如东部沿海发达地区,对科技人员的吸引力也较低,导致中西部地区科技人力资源十分缺乏。

    另一方面,科学系统主要按科学家能力的高低和对科学贡献的大小来分配资源和奖励回报。但科研界客观存在资源不平等、产出不平等以及回报不平等。这集中表现为我国的科研人员区域不均衡,无论是质量、数量还是递增,都存在着东强西弱、少数一线城市强多数城市弱的现象。科技人员的不均衡性很大程度上决定了区域科技创新能力的不均衡性,进而传导到经济与社会发展领域,致使区域经济发展和管理呈现出巨大的不均衡性。

    但是,随着时间的推移,这样的不均衡状况有着显著的缩小趋势。这表明随着教育资源进一步的合理化分配,各级政府对科技知识的重视并积极引进人才,各地中小型企业为了突破相关瓶颈而积极招揽人才等,科技人员开始逐渐向二三线城市移动,使得科研人员分布不均衡状况趋于缩小。

    “科学家在线”即是针对我国科研资源及人才分布不均衡现状,通过大数据的精确匹配与线下全流程服务,着力打通科研智力供给与企业市场需求之间的信息壁垒,打破地域限制,为科研技术对接企业需求,为科研人员提供成果转化。欢迎登陆scientistin,注册或认领个人主页,一起为知识寻找价值!

    本文是科学家在线与中国科协创新战略研究院联合撰写的《大数据视角下的中国科研人员状况系列研究报告》中的部分章节,接下来,我们将陆续发布报告的其他内容,从大数据的角度为大家呈现中国科研的发展图景,敬请期待。

  • ?

    科技项目:社会网络大数据分析系统

    两岸

    展开

    1成果简介

    社会网络已经成为覆盖用户最广、传播影响最大、商业价值最高的Web2.0业务,在世界范围内,最著名的社会网络代表是Facebook、Twitter,用户量分别达到12亿、5亿;国内使用人数最多的社会网络工具是新浪微博和腾讯微博,其中新浪微博用户达到5亿,腾讯微博用户超过8亿。社会网络中的巨大用户群每天产生海量的用户数据、关系数据和信息数据,若能够对海量数据进行准确、及时的分析,则会在精确营销、舆情探测以及网络安全等方面创造巨大价值。然而由于社会网络的大数据特性以及分析方面要求准确、及时,目前缺乏融合多项社会网络分析技术的、成熟的社会网络大数据分析系统。

    社会网络分析技术是一项关键技术,也是一项热门的研究,涵盖了社会学、人类学、社会语言学、地理、社会心理学、通信研究、资讯科学、社会网络分析与探勘、组织研究、经济学以及生物学等多个领域,是一项多学科交叉技术。社会网络大数据分析系统要求具有坚实的数据支撑,即数据获取全面、更新及时、获取数量大,也强调多维度、多粒度的分析手段相结合,并对分析速度、可视化以及人机交互等方面都提出很高的要求。

    基于上述现状和挑战,在国家科技支撑项目的资助下,实现基于新浪微博、Twitter等主要社会网络交流工具的大数据分析系统,系统完成从数据获取、数据预处理、数据存储、消息中心、数据分析、结果可视化展示的闭环处理流程,支持多种社会网络(Twitter、新浪微博等)的数据实时、不间断获取,获取数据量在国内外同研究领域处于领先地位;实现整体、个体、群体以及事件的多层次、多粒度分析模式;同时具备良好的人机交互操作界面以及优秀的分析展示效果。

    系统的特点如下:

    多手段数据获取模式融合:采用网络流量分析、API/非API爬虫、元搜索以及增量式爬虫等多手段数据获取模式相结合的方式进行数据实时、不间断获取,保证数据获取全面、更新及时、获取量大;多维度、多粒度数据分析手段结合:系统对社会网络整体、个体、群体、事件四个维度的对象进行分析,并结合基础分析、深度挖掘的多粒度分析手段共同完成社会网络的数据分析;多种关键技术支撑:系统融合机器学习、分布式并行处理、数据挖掘、自然语言处理等多种关键技术,共同保证系统各项功能的稳定、快速实现;优秀的分析展示效果和友好的人机交互操作:借助Gephi工具进行群体、事件等分析效果的可视化展示,可视化效果清晰;操作便捷,实现用户与系统、系统与数据库的无缝连接。

    上述优点表明该系统能够实现从数据获取、数据预处理、数据存储、消息中心、数据分析、结果可视化展示的处理流程,达到完善的功能实现目标和优秀的系统运行效果。查新表明,国内外目前尚未发现有如此功能全面与性能优越的社会网络大数据分析系统。

    性能参数:

    能有效获取社会网络平台的用户数据、关系数据和信息数据,获取覆盖率不低于85%;分布式爬虫支持不少于10个节点,分布式数据库支持不少于5个节点;数据库读/写操作不少于并发1000次,数据预处理效率不小于1000条/秒;数据存储规模不小于7TB;热点信息(个体、群体、事件)发现准确率不低于75%,关键路径发现准确率不低于75%;热点话题发现准确性不低于80%,倾向性言论的发布主体发现准确率不低于75%;信息传播寿命预测准确率不低于80%。

    2应用说明

    2013年9月,利用社会网络大数据分析系统进行数据获取以来,获取Twitter用户数据2.2亿,用户关系数据11.5亿,推文1.2亿,目前数据量仍处于不断高速增长阶段;着重获取社会网络上中国人全集的数据,主要采用基于用户属性、用户关系、用户信息3层过滤机制,通过特定团体获取方式进行获取,中国人用户数据达到63万,用户关系数据510万,推文数据1740万,目前中国人用户数据已趋于稳定,推文数据仍处于快速增长阶段。在获取到的数据基础上,对网络中个体、群体、事件以及整体进行基础分析以及深度挖掘,能够快速识别关键个体、关键群体、热点信息、热点话题,并实现对信息、话题的情感分析、趋势预测等功能,同时也保证分析效果优秀的可视化展示。

    3效益分析

    由于目前国内外尚无同标准产品,而社会网络大数据分析的需求比较迫切,因此本系统具有较大的推广空间。本系统价格每套150万元。而本系统数据积累深厚、运行稳定、分析功能全面、处理速度快、响应时间短。总体上,系统成本低、功能全、速度快,运行费每月在3000元左右,具有明显的经济和技术优势。

    嘿科技时代经过多年的探索和实践,我们与科技,金融,人才等机构建立了良好的关系。探索了技术转移过程中技术供方和需方的不同角度之间的矛盾,致力于建立双方良好的沟通机制,提高技术转移效率,全面推进社会科技水平的提高。您也可以访问嘿科技时代网站了解更多项目内容。

  • ?

    “大数据分析系统国家工程实验室”究竟咋回事,这回终于说清楚了

    车前草

    展开

    作者 | 于泽 (大数网副主编)

    3月29日,国家发改委正式批复,由中国科学院计算技术研究所承建的“大数据分析系统国家工程实验室”(以下简称“实验室”)在京揭牌。

    “大数据分析系统国家工程实验室”揭牌仪式

    实验室重点立足“分析”和“系统”两个关键词(具体后面会讲),是2016年《国家发展和改革委员会办公厅关于请组织申报大数据领域创新能力建设专项的通知》规划的13个国家级大数据实验室中的一个。

    据介绍,实验室由中国科学院计算技术研究所牵头,联合中国科学院大学、中国科学院计算机网络信息中心、曙光信息产业股份有限公司、国创科视科技股份有限公司共同建设。宗旨是产学研结合,使大数据技术更好的落地,推动大数据产业更快的发展。而事实上,这也是《通知》对于国家级大数据实验室的核心要求。

    只热闹不够,重要的是落地

    从13个国家级大数据实验室的设立,不难看出大数据当前的发展热度。而实际上,像这样的指导性文件和规划近两年还有很多,比如《关于运用大数据加强对市场主体服务和监管的若干意见》、《促进大数据发展行动纲要》、《政务信息资源共享管理暂行办法》、《大数据产业“十三五”发展规划》……

    特别需要指出的是2016年10月9日,中央政治局举行集体学习,习近平总书记提出,要实施网络强国战略,建设全国一体化的国家大数据中心,推进技术融合、业务融合、数据融合,实现跨层级、跨地域、跨系统、跨部门、跨业务的协同管理和服务。

    国家对大数据产业的重视程度略见一斑。它不再是产业内少数几个企业在做、在推动的事情,已经上升到了国家层面。换句话说,从上至下,全社会已经充分意识到了数据的价值。

    这很好,重视是做好一件事的前提。但与此同时,光口头上的重视并不能带来实际的价值。数据如果不经过处理,它只是数据,没有意义。

    这正是13个国家级大数据实验室所承担的使命。简而言之,为国家、为产业界趟出一条实践的道路,未来各个实验室在各自细分的领域都是一个样本工程。

    你理解“分析”和“系统”

    这里值得一提的是,相较科研实验室,工程实验室更讲究落地、应用,因此在操作中更讲求产学研的结合。具体到实验室的设置、规划,也能看出这一点。

    从共建成员来看,中国科学院计算技术研究所、中国科学院大学、中国科学院计算机网络信息中心、曙光信息产业股份有限公司和国创科视科技股份有限公司,研、学、产各方都有,而且实力很强。

    以曙光信息产业股份有限公司(以下简称“曙光”)为例,服务器、存储等硬件处于领先地位,特别是在高性能计算领域;软件方面,曙光自主研制的XData大数据平台能够充分融合各种数据资源并进行全方位多层次的智能分析。更为关键的是,曙光的软硬件方案已经在气象、政府、医疗、广电等多个行业得到了实践,这是实验室最迫切需求的。

    从实验室业务建设方向来看,规划了三大平台:大数据分析基础设施平台、软硬一体的大数据开放分析平台、大数据分析示范应用与服务平台,覆盖大数据分析全生命周期的技术与应用环路。

    解释一下实验室的两个关键词“分析”和“系统”。

    分析主要指横向软件层面的。用户需要的不是Hadoop,也不是Spark,而是解决问题的能力,因而实验室要研制的是新一代的数据分析软件栈,是要把各种数据分析平台都囊括其中,做成一个工具集。

    系统狭义的理解纵向软硬件一体的平台。广义的理解如曙光高级副总裁聂华所讲,产学研的搭配、软硬一体的组合、从数据收集分析到应用的全囊括。我理解这是应对大数据时代的一套方法论,让大数据发挥出价值是项系统工程,要系统的对待。

    一切以落地、应用为前提。

    深入行业,应用是根本

    除此之外,总体规划在三大基础平台之上,各共建单位还将分别深入一个细分领域进一步探究大数据的应用。比如曙光就同时挂牌“政府大数据分析系统实验室”,未来将重点开展政府相关行业的大数据智能分析技术与系统的研制。

    为什么会有这样的布局,主要源于两方面的考虑:一是工程实验室本来就致力于实际应用,基础性研究只是手段不是目的,深入行业触及实际应用是必然;二是从共建方的角度考虑,擅长、优势的行业更利于拓展应用。

    再以曙光为例,自其2015年提出“数据中国”战略以来,通过“百城百行”的布局,一张中国云数据服务网络已初现端倪。截止当前已经有近40个城市落地、服务近百行业、部署近千应用。

    从这个角度看,曙光深入政府行业是一种顺其自然。就“政府大数据分析系统实验室”这个小目标而言,曙光有很好的基础。这意味着曙光发展自身业务与建设“政府大数据分析系统实验室”这件事刚好一致,这个过程不会有资源被浪费,相互促进更利于双方面的共同进步。

    如果再放大视角来看,曙光的战略布局与实验室规划的契合度也非常高。实验室所致力的三大平台建设,无论软硬件还是应用,曙光都能提供很好的支撑和促进作用。同时,在这个过程中如聂华所言,将进一步完善曙光自身的大数据理念、架构、技术,推进大数据的理论研究与产业应用,推动业务更好的发展。

    因此,我们有理由相信在实验室近期目标“直接可管理的科学与政府大数据开放资源30-50PB”“分布于50-100个城市的大数据分析云基础设施”和“支撑至少两大领域的示范应用”的规划中,曙光能做出自己的贡献。同时,在更长远的“建设大数据产学研用良性生态系统”的目标中,曙光也能发挥自己应有的价值。

    大数据时代已经来临,其所能带来的产业价值不可估量。而我国的实际情况却是这样,据统计,中国拥有全球14%的数据量,利用率却不到0.4%,待开发的价值可想而知。这对于实验室而言,既是压力也是动力。希望其能化压力为动力,迎难而上,早日让大数据发挥出应有的价值。

  • ?

    360金融徐军:我们的核心竞争力是大数据和人工智能

    重温

    展开

    来源:金融界网站

    美国东部时间12月14日,中国领先的互联网消费金融平台360金融于美国纳斯达克交易所正式挂牌上市,股票代码为“QFIN”,IPO发行价定价为16.5美元。招股书显示,此次募集资金主要用于科技研发和人才培养、品牌推广、潜在收购和战略投资等用途,360金融将抢跑互联网巨头系金融科技平台成为赴美IPO第一股。

    据了解,360金融徐军在上市当天发布了致全员信,表明公司将跨越里程碑,再创新高。同时,徐军围绕360金融如何抵御寒冬成功上市做出了全面复盘,他指出360金融的核心竞争力在于大数据和人工智能两大方面。

    精准定位科技平台 360金融牵手合作伙伴助力普惠金融

    业内人士认为,360金融是一家科技公司,延续了360集团互联网和安全科技的基因,创造了卓越的团队和高效的运营架构,是360集团的金融合作伙伴。得益于清晰准确的定位,360金融在三年多的时间里数据证明了自身强大的发展空间。

    根据招股书披露,360金融自主研发了基于人工智能的风控全流程技术平台,包括Argus智能风控引擎、宇宙魔方(Cosmic Cube)风险定价引擎,以及Cloud Bank系统。截至2018年9月30日,360金融促成贷款的M3+逾期率为0.6%,由于欺诈造成的亏损率仅为0.2%,充分体现出良好的风控实力。

    徐军在致全员信中表示,360金融致力于探索用科技赋能金融行业,从互联网安全延伸探索金融风控反欺诈,从零迈步到先头部队,作为赴美上市的公众公司,更要肩负起更多的责任和挑战,坚守合规经营,携手金融合作伙伴推进金融科技实实在在服务于实体经济。

    发力金融科技赛道 赴美上市挑战与机遇并存

    在2018中国企业领袖年会上,360创始人周鸿祎曾预判,未来五年万户互联时代将加速发展,核心技术的竞争将会持续发酵,只有在人工智能、大数据领域实现了关键技术突破,才有可能实现降维攻击。

    徐军透露,相较于其他拥有互联网背景的金融科技企业,区别在于360金融是一家技术驱动的公司。以长远价值为目标,风物长宜放眼量,相信在资本市场终会体现公司的真实价值。

    结合招股书来看,360金融将自身定位成连接借款用户与金融合作伙伴的科技平台,为资金合作方挖掘和推荐优质借款用户,并帮助其为优质借款用户提供定价合理、方便快捷的信贷解决方案。360金融拥有稳健且多元化的资金渠道,主要包括国有银行和区域性银行等传统金融机构。

    根据Oliver Wyman公司的分析统计,从2018年Q2促成放款额来看,在有互联网技术巨头支持的线上信贷平台中,360金融的业务规模在中国排名前五,前四名依次是蚂蚁金服、微众银行、京东金融和百度金融。

    对此,有行业专家向媒体介绍,360金融成功登陆资本市场,以及上市后的战略部署,对BATJ系金融科技公司的未来上市会产生标杆性示范效应。

  • ?

    用大数据技术搞真实世界研究?素质很重要!

    贲语薇

    展开

    真实世界研究(RWS, Real World Study)是今年医疗界最热门话题。

    2016年12月7日,美国《21世纪治疗法案》中增加了一条修正条款——“利用真实世界证据”提速药品和医疗器械审批。随后,FDA官员又在《新英格兰医学杂志》发表了一篇名为《真实世界证据——它是什么以及它能告诉我们什么》的文章。此后,在几乎所有的医学学术会议上,“真实世界”成为了必备关键词。

    真实世界证据(RWE, Real World Evidence)和临床试验证据有何不同?两者的本质区别在于获取数据场景的不同。RWE源于实际医疗场地或家庭社区等真实医疗场景,而临床试验证据来自于严格受控的科研场景,两者之间的区别并非在于是否存在计划干预实验和是否采用随机化实验设计,而是是否能够反映真实的诊疗过程和真实条件下的患者健康状况。换言之,不管有没有科研目的,医生的每一个诊疗活动所产生的相关记录,患者的每一个检查结果,都可能在合适的时机,被用于RWS。

    《新英格兰医学杂志》-《真实世界证据——它是什么以及它能告诉我们什么》

    真实世界研究需要大数据技术

    真实世界中有价值的医疗信息分布非常广泛,所以,要在真实世界进行信息挖掘,就要尽可能全面地采集信息并进行整合。欧美国家的医疗信息化开展得比较早,北欧有些国家也已经实现了全民健康信息规范化采集,在这些区域开展RWS有较大优势。中国的医疗数据虽早已达EB级别,却被“三座大山”的压制,让数据沉睡不醒——数字化程度不高导致“原材料”缺乏、标准不统一导致数据无法流动、数据孤岛导致数据无法大规模使用。

    大数据技术可以集成多源异构数据并进行强大的统计分析,同时可以对原始数据进行溯源,避免原始数据的错误,提高数据处理效率和准确性。大数据技术的运用正是搬走三座“大山”,开展真实世界研究的最佳基础工具。

    支持RWS的医疗大数据需要怎样的“素质”?

    第一,数据要实现以患者为维度的数据集成和整合,而不是疾病或治疗维度。在传统的病历注册登记研究或临床研究中,一个肿瘤患者的初治和复发情况时长会被割裂为两个病例,那么就很难获得这个患者在真实诊疗中接受治疗和病情转归的情况。哈佛医学院2015年发表的一项RWS就发现胰岛素抵抗和老年痴呆症具有相关性——如果不是将患者所有的诊疗数据都整合在一起,而是仅单独看神经内科收集的老年痴呆症的数据,或单独看内分泌科收集胰岛素抵抗的数据,就难以有这样的发现。

    第二、数据要经过预处理,尤其是被标准化和结构化。想从真实世界研究中获得不同于传统临床研究的“惊喜”,就意味着要有更多的特征变量可直接被终于统计分析。举个栗子,有位医生想做心力衰竭患者出院一年再入院影响因素的研究,首先需要根据Framingham标准筛选到心衰患者,其次再去提取这些患者的特征性变量,最后再分析哪些变量与心衰再入院有相关性。该医院2010年-2015年间有14,985例疑似“心力衰竭”的患者,但绝大多数数据,尤其是Framingham标准所需用到的数据都是非结构化的,需要人工从原始记录中提取。常规操作下这一项工作就需要耗费一个中年资医生两年多的时间。而这位医生所在的医院引进了大数据科研平台(NOVA),该平台在对医院信息系统集成的基础上,还对数据做了预处理,也就是通过归一化技术,把相同意思的词汇归一到标准词上,做标准化处理;通过结构化技术,把医生的长文本描述内容转化为标准的字段和值。比如医生在主诉中记录“胸闷、喘息2小时”,这在平台中就转化成了“胸闷=是,喘息=是”。利用这种技术,医生仅仅用一周时间就完成了患者筛选和数据收集。

    第三、数据来源要尽可能广泛。越是要贴近临床真实情况,反映患者的真实健康状况,越要尽可能全地收集数据。真实世界研究的数据来源非常广泛,可以是患者在门诊、住院、检查、检验、基因、社区健康档案、随访和可穿戴设施等数据,也可以是医保部门、社会机构、公共卫生部门日常监测、记录和保存的数据。比如关节科医生,为了更好地研究患者的康复情况,在收集医院内部数据的基础之上,还设计了一套针对不同类型患者康复数据的收集计划。每一个经过关节科诊治的患者都会根据计划接到随访信息,患者根据医生的治疗计划填写主观量表或上传其他医疗数据,同时还在尝试接入可穿戴设施产生的数据。相信数年积累之后,就会有高水平的RWS产出。

    第四,数据使用者需要具备一定的数据分析建模能力。数据尽可能广泛地被收集,并且被做了一定的预处理,那么可直接被用于统计分析的特征变量动辄成百上千。要想拨开纷杂找规律,统计分析工作量可想而知。如果没有一定的数据分析建模能力,有了数据也难以充分利用。英国的一项研究发现,机器学习算法如随机森林、logistic回归、梯度提升和神经网络等算法可以在没有人类指示的情况下就自动建立心血管疾病相关的预测模型。对疾病的深刻认知和数据分析建模能力,可以赋予真实世界研究更强的发现能力。

    具备上述特征的医疗大数据及其分析技术,是进行真实世界研究的有效保障。医渡云公司的科研大数据平台(NOVA)和专病数据库就能够提供这样的保障。

    作为一家专注于医疗大数据技术的企业,医渡云目前已与上百家最领先的医疗机构达成了战略合作,可支持300-5000-5000-5000-500个医疗信息系统的自动定位和集成,可实现单家医院、医联体、区域内患者数据的集成与整合。简单地说,就是在不泄露患者隐私的基础上,通过算法把一个患者在某个地区合作医院的就诊信息关联起来,接近于还原该地区患者群体的真实诊疗状况。数据经过标准化和结构化处理,可直接用于检索和分析的特征变量超过5000个。在数据处理的基础之上,医渡云还沉淀出了疾病模型,并且构建医学知识图谱,用机器学习的算法去探索传统临床科研难以发现的“秘密”。

    医疗大数据公司如今正如雨后春笋般崛起,越来越多的专家开始利用大数据技术和平台进行真实世界的数据收集和处理。相信不久的将来,中国的海量医疗数据,会在大数据技术的帮助下,爆发出惊人的真实世界研究成果,让我们拭目以待。

    本文作者:刘颖慧

    原呼吸内科主治医师,医学博士。

    现任医渡云医学产品经理,责任产品为专科疾病数据的生产和质控平台。

  • ?

    在科技时代,大数据之魅力

    全艳

    展开

    科技时代的变化万千,互联网时代的助力发展,很多时候改变的不仅仅是一种价值观念,更是生产效率质的提升。那么,在大数据之下,究竟有什么魅力在改变人们的生活呢?

    首先,我们可以想象得是在科技的助力和推动之下,一些软件的开发则是指实质性的代替了人工,提升了工作效率。例如,互联网的发展让人们又进了一个层次。例如,微信营销的裂变,不断向外延升,随之增加了PP助手这一功能。而pp助手最大的作用是,向电脑和安卓、手机端装上该软件,可以起到自动加人的功能。而一个手机,可以登录5个微信号,一个微信号好友在3000人以上。而一台电脑可以控制十余部手机,如此产生裂变,在好友、粉丝多的范围内精准引流,起到精准营销的作用。那么形成庞大大数据系统,那么微众商月入过万、月入十万百万的事情自然是神话般的存在。

    而在大数据之下,可以改变什么首先在于员工和企业的关系被颠覆。那最小的案例来讲,过去企业员工用车,报销流程一般是这样的:垫款打车,留存发票,填写报销单,粘贴发票和报销单,提交上级领导审批,交给公司财务审核,财务将票据归档、存储,然后打款。

    在整个流程范围内,没有其中一方可以从中受益,而更多的是这也是一件很心烦的事情。再从员工的角度来看,垫款会带来一定的经济压力、发票存在遗失的问题、填写报销单会有行程记录混乱的现象,贴票对提高工作效率只有负作用;从财务方来看,对发票的核对及查证耗费了大量时间和精力,而这些过程并没有为公司带来实际价值,还影响了财务人员的工作效率;站在企业的角度,上述流程没有体现任何管理价值,还影响了员工的工作状态,费时费力也未能有所收益。钱包行云的给出的新解读是,让员工、财务和所在企业实现“共赢”。

    现在流行的钱包行云可以通过 “企业预付,员工消费”的创新形式,垂直整合滴滴企业版优质资源,为企业出行提供多种便捷的出行方式,让企业员工在因公出行过程中,无需保留发票、为繁琐的报销流程而烦心,更可实现“乘车后无需付费,由企业账户直接支付车费”的用车体验;而财务人员也不必对着一堆发票“望洋兴叹”,直接通过钱包行云管理后台开取一张公对公发票即可。少了麻烦和繁琐的流程,企业员工的幸福感也被极大的提升。更重要的是,这些操作,在手机上就能“一键完成”。而更多的是作为一款手机上的APP,和其他软件不同,钱包行云整合了用车、订票、订酒店、接送机、订餐、采购等各大APP的功能。这样可以使企业节约消费成本,更精准的获取效益和价值。

    很多人在感叹我们周围的生活变化太快了,而我们身边的变化万千的确让人感慨,很多时候我们要从更深层次的角度出发,思虑在科技和互联网的发展下给人类带来新的机遇和挑战,这样才能更好的造福人类。所以说,永远跟上时代的潮流,永不落后,记得科技的魅力,它永远是助力人类发展的,那样你便不会被淘汰了。


  • ?

    大数据助力科技管理系统升级

    滕芷珊

    展开

    自2014年开始,大数据先后4次出现在政府报告中,2015年8月国务院印发了系统性、权威性的文件,提出了我国大数据的顶层设计。2017年工信部出台了产业规划,提出了明确的时间表和路线图。近日,在贵阳召开的“数博会”作为首个大数据产业博览会,有效地推动了大数据的发展与应用,更好地促进产业升级和结构调整。

    会议期间,在“数博会”的重要学术交流分论坛——大数据科学与工程国际会议上,来自业界的各位专家就大数据带来的技术创新、应用创新、市场创新、商业模式创新等方面问题进行了详细的分析阐述,为用户带来了一场大数据应用分享的饕餮盛宴。

    大数据助力科技管理系统升级

    大数据不仅仅是一场颠覆性的技术革命,更是一种思维方式、行为模式与治理理念的全方位变革,对于创业者而言,大数据带来了巨大的变革潜力和创新空间。

    “在物联网产生之前,或者大的传感器产生之前,我们的采集数据来源于访谈、测量或者是记录在纸上,那个时候我们的数据量比较少,而如今,主要靠科学仪器获取大量源源不断产生的数据,数据产生的量非常大,而且复杂度非常高。”正如中国科学院计算机网络信息中心大数据部主任、CODATA中国委员会秘书长黎建辉所言,从手工记录到仪器采集,大数据的信息量正发生着翻天覆地的变化。

    科学大数据管理的大概流程是:首先从科学仪器产生数据,然后进入实时采集和分析系统进行第一次的过滤和清洗;其次进行存储和分析;最后再发布出来供其他的科学家使用。其中重要数据必须做长期的保存和归档。

    黎建辉表示,科学大数据主要的目的是服务于科学研究,并为相关机构提供详细的表征能力,而其中科学研究的方法(包括对科学大数据的分析和管理的水平)成为科技竞争中的关键部分。

    大数据推动天文学、微生物研究迈入新阶段

    天文学作为一个典型的大数据应用领域,同样需要通过标准化和一系列规范实现全球的天文科学数据的共享与交易。为了解决国际上天文大数据的开放、共享以及数据间的操作,天文学家提出了虚拟天文台的构想,这是一个通过先进的信息技术将全球范围内的研究资源无缝透明连接在一起而形成的数据密集型网络化天文研究与科普教育平台。在谈及大数据对天文学方面的贡献时,中国科学院国家天文台信息与计算中心主任崔辰州表示,探索宇宙的奥秘,大数据正在发挥越来越重要的作用。

    中科院微生物所网络信息中心主任马俊才表示,生物产业是我国的新兴产业,生物产业在未来几年将占到我国GDP的5%到6%。微生物作为最简单的生命体成为生命科学研究不可替代的基本材料, 微生物数据是微生物资源共享和开发的关键环节,数据资源的丰富性、准确性和共享水平决定着整个微生物学领域研究和应用的综合能力。目前,中科院微生物所正在通过研究和开发云环境下微生物数据存储和计算等一系列关键技术,形成完善的微生物数字资源体系、知识发现平台和大数据服务平台,建立具有国际影响力的微生物数据库,实现我国微生物领域数字资源建设的突破。

  • ?

    大数据时代下的科研活动的发展方向

    百合

    展开

    针对大数据时代科研活动的新生知识需求,TIB将其所开展的4个领域的产品研发活动,包括:开放科学(open science)、数据科学(data science)、非文本资源(no-textual materials)和可视化分析(visualization analysis)进行调整拓展,4个领域协同推进数字化/网络化发展。

      开放科学产品线   开放科学是数据驱动科研的最佳实践方法。数据驱动科研的背后,就是要解决一系列针对科研数据的保存、流通、管理、保障等需求和问题。TIB开放科学部门的重点工作是推进开放科学基础设施为依托的科研协同环境。   TIB成立的开放科学实验室(Open Science Lab),长期与包括莱布尼兹研究网络2.0在内的多个提供研究人员或者研究基础设施的机构保持合作关系。   Open Science VIVO Beta(2014年3月至今)利用关联开放数据(linked open data),为科研社群提供协同、一致、多样的信息展示。通过在主要德语研究机构上及时抓取科研活动及成果信息,利用关联数据本体的拓展和对接,实现全欧洲境内科研机构、人员、项目等信息的互联整合。目前该网络内共有597位研究人员、19家机构和766项研究成果。该网络在欧美研究社群中广泛使用。   CoScience(2014年3月-2015年3月)是为帮助科研人员共享科研方法、存储科研经验、推广新兴科研工具的数字化信息服务项目。在项目的两期工程中,共与13家高校图书馆、信息机构和数字化项目达成合作。通过开放平台文档和开放视频讲座两种方式,为科研人员集成经验方法,引导研究人员间的知识共享。

      非文本资源产品线   TIB提出的“超越文本(move beyond text)”战略具有现实意义。图书馆的知识资源仍然是其最重要的资本和基础[15]。大数据时代的推进使得图书馆馆藏资源不仅仅局限于传统的印本资源,而是囊括了具有多种数据类型、地理分布存储的广泛意义的数据资源。   TIB成立的非文本资源部门关注各类数字化科技信息。针对其中的非文本资源开展了一系列搜集、标引、存取和贮藏实践,将非文本资源视作与传统文本资源同质的“文化遗产”。下面分别列举3个重点领域(全维度的科研数据、视听多媒体资料以及3D数据)的相关实践。   RADAR(Research Data Repository)(2013年9月-2016年8月)是依托莱布尼兹信息基础设施建立的一个通用型科研数据知识库,提供多维科研数据保存(最高保存时限15年)、出版、认证和追踪工作。并与图书馆、研究机构、出版商和开放平台进行数据整合,实现科研数据的分布式存储和一体化获取。

      AV-Portal(2014年至今)是一个针对视听多媒體科研数据的分布式集成门户。其视频资源覆盖自然科学和工程等多个学科,对视频质量进行严格控制,视频内容主要涉及计算机可视化、教学资料、仿真模拟、实验过程、访谈和会议记录等。检索视频资源时,可以实现对视频内容的概览、视频语音内容的语种翻译并支持对视频资源每一帧的内容检索。用户可以自由上传资源,资源发布需要审核,部分资源支持开放获取。   DURAARK(Durable Architectural Knowledge)(2013年2月-2016年1月)是一个针对建筑学类3D模型长期保存的数据库。从语义层面对建筑的3D模型资源进行组织和标引工作,建立新的元数据格式对建筑的数据信息以三维立体模型的形式进行长期保存,以期实现对建筑信息多维简便的获取。   数据科学产品线   在TIB开展的数据科学产品开发活动中,大量的成果是以数据科学为工具对数据进行的深度分析与挖掘。在该领域产品研发过程中,TIB同样面对复杂的处理对象——数据类型。与非文本资源产品关注的重点相同,其不仅针对传统文本信息,更重要的是对诸如科研数据、视听内容、3D信息、仿真模块及软件多种数字化的科技数据源进行检索、查询和保存。   基于数据科学领域机器学习、模式识别和统计学方面的工具,TIB针对科研数据的分析、组织和检索工作进行了语义化探索,研究成果多应用于检索工具和系统中。

      AV-Portal是数据科学产品的集大成者。在其两个工作重点:文本(数据)挖掘和知识管理(语义分类、本体等)方面均有所应用。文本挖掘工具主要是对非结构化的数据进行整理,使之结构化并挖掘其中的潜在联系;知识管理则主要对现有馆藏资源进行语义层面的改进。   该门户支持对经过质量控制的科学视频进行包括场景、文字、语音和图像在内的多维度的数据识别,以不同的粒度对对象的不同特征进行分析处理,实现对信息进行快速、一致、交互地存取;从语义层面对资源进行分类组织,扩展检索方法;支持基于DOI的针对科学影片和片段的引用,自制影片及科研辅助资料的上传。多媒体检索方法和语义数据分析的技术使得这些非结构化的资源组织和检索工作得以更好地实现。

  • ?

    大数据与临床科研

    山上石

    展开

    大数据是所涉及的数据量规模巨大到无法通过人工,在合理时间内截取、管理、处理、并整理成为人类所能解读的信息。

    大数据时代的到来,在商业、经济、医学及其他领域中,决策将日益基于数据和分析而作出,而并非基于经验和直觉。

    医疗领域的大数据是指因为临床或者可以需要收集起来的有关健康或者诊疗的信息。其产生来源于日常诊疗过程,其中的数据都是未加修饰的纯天然数据,没有任何排除纳入标准,是一种普查数据。能直接反应临床疗效。

    医疗大数据包括电子病历系统、慢性病及传染病注册登记系统、医疗保险信息系统、出生死亡登记系统等等。对于临床医生最关键的是电子病历系统,该系统包括了人口学特征(性别、年龄)、实验室检查、微生物检测、医嘱、诊疗操作、手术资料和临床转归等信息。

    临床研究大体分为干预性研究和观察性研究。

    干预性研究,又称随机对照临床试验(RCT),需要主动的、有目的地对受试者进行试验干预,一般有严格的纳入排除标准,采用随机化的方法来最大程度地消除混杂因素的干扰。

    目前临床科研面临的困境:RCT与观察性研究两者差别较大,两者干预效应不一致。RCT得出的是一种生物学疗效,这反应了干预手段在严格的实验条件下的生物学作用。这种作用可能很弱或者实际的临床中无法发挥出来,生物学效应不能转化成临床疗效。

    但基于大数据的临床研究(BCT)在未来可能成为一种研究的主流方式与RCT形成互补。

    大数据的临床研究(BCT)其实属于观察性研究,因此必然存在观察性的缺陷,例如存在较多偏绮、混杂因素难以控制、基线资料不均衡等。如果分析了存在偏绮的数据,得出的结论有可能被夸大,目前尚不存在一种万能的统计学解决方案,但视乎可以通过采用随机效应模型或者bootstrap抽样法在一定程度上提高预测模型的准确度。

    如何利用大数据进行临床研究:以MIMIC-II数据库为例

    (1)、MIMIC-II数据库全称为重症监护多参数智能检测数据库II。该数据库是对公众开放的免费数据库,主要用于重症医学的各种临床研究。该数据库包含的信息来自于美国波士顿beth israel deaconess medical center。该数据库是不断更新的,已经收集了3万多ICU患者的住院信息。该数据库信息由人口学特征、实验室检查、液体及药物医嘱、病历信息、心电监护、呼吸波形监护、血压、血氧饱和度和护理记录。

    (2)、MIMIC-II数据库使用步骤:访问网站physionte.org/mimic2/MIMIC-II --注册账号--通过伦理考试--提交申请--下载数据库--安装虚拟机(linux系统、sql语言)--进行临床研究--选择统计方法--对研究结论进行解释--发表论文。

    运用大数据可以进行以下几种类型的研究。

    如何凝练出实际可行的临床研究问题,有两种主要方式:

    (1)、从数据中找灵感。

    (2)、从要研究的内容去找数据。

    数据提取之后,选用你熟悉常用统计软件(SAS,STATA,SPSS,R语言)对数据进行分析,以STATA为例对数据进行调研和分析。

    使用STATA进行大数据分析时主要包括两个部分,数据处理和统计分析。

    数据处理包括:

    (1)、数变量的产生,比如希望把年龄变量转化成二分类变量;

    (2)、数据核查,比如采用sum模块查看是否存在一些不合逻辑的错误值;

    (3)、变量类型的调整,比如有些字符变量转化成数据变量;

    (4)、数据库合并,患者的不同信息往往是存储在不同的关联表格中,需要合并,可以使用stata的merge或append命令执行。统计分析在数据处理的基础上进行,一个完好的数据处理前期准备是进行可靠统计分析的基础。

    (5)、采用do-file方式进行数据统计可以完整记录数据分析的全过程,这样文章修回或发现统计结果错误的时候可以随时查看调用的命令。

    下图是完整的大数据分析流程图

    问答环节

    1、目前各种指南以及高级别循证医学证据是怎么来的?

    答:参考随机对照临床试验及相关的荟萃分析。

    2、目前为什么生物学疗效不能转化为临床疗效?

    答:(1)、RCT条件下干预措施执行比较严格,其中包括纳入的人群(没有大量的合并症和并发症,是所谓的单病种,这就剔除了大量的混杂因素)。

    (2)、RCT有严格的治疗时机,而现实中繁忙的临床工作可能会延误给药时机。

    (3)、RCT一般都在大医院进行,其结果无法推广到中小医院。

    (4)、RCT只是对20%的患者进行研究,不能把这样的结论去治疗其余80%的患者。

    (5)、观察性研究存在选择偏绮、混杂因素难以控制、基线资料不均衡等各种缺点。

大数据科研系统

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP