- ?
《风向》新书发布 揭示AI、大数据等前沿技术趋势
庾书瑶
展开
12月8日,由中国工信出版传媒集团主办,人民邮电出版社、北京信通传媒有限责任公司承办的“《风向》何宝宏新书发布暨思享会”在京举行,来自科技、金融、教育等多个行业的400多位读者参与了此次活动。
人民邮电出版社副社长刘华鲁、中国信息通信研究院院长刘多出席会议并致辞。会上,二十余年互联网研究者何宝宏博士新书《风向》正式发布,何宝宏博士与在场的嘉宾和观众分享了互联网技术背后的至深规律,并对未来几年人工智能、大数据等前沿技术的发展做出了预测。
新书发布仪式照片
《风向》一书预判了人工智能、大数据未来将走向何方
近年来,云计算、大数据、人工智能等技术的发展,让越来越多的人看到了互联网技术对现实世界的颠覆,如何把握互联网技术新风口,已经成为从投资者、企业家、技术人员以及普通老百姓关注的共同的焦点。
会上,何宝宏博士作了一次关于人工智能、大数据、开源等技术的发展规律的专场思想分享,深入浅出地逐一进行了剖析和解读,他大胆预测未来几年几大技术的发展趋势。
他认为,AI 的再次崛起,得益于老算法的新改进,新数据的新应用和老硬件的新应用,目前我们说的AI,实际上多种技术的大合集。今天,我们正在被“算法的偏见”所影响,而未来,算法将比我们自己更了解我们。
他判断,经过 10 余年的发展,云计算已经走过了概念验证(PoC) 的阶段,进入了规模落地期,正在发展成为新的关键信息基础设施。云计算将会像30多年前的TCP/IP那样,改变这个世界。
《风向》的出版恰如其时
互联网正在以前所未有的广度和深度改变我们的生产和生活。以智能手机为代表的智能终端的兴起,电子商务、移动支付等互联网和移动互联网应用的普及,以及人工智能等新一代新通信技术的崛起,正在成为我们这个时代的显著特征。科技和人的关系空间紧密,人工智能、大数据、云计算等技术快速兴起,各类应用层出不穷,更多人则是感慨 “看不见、看不起、看不懂和来不及”。而《风向》一书在2019年年初出版,帮助读者理清迷茫的思路。
何宝宏博士说:“发现、总结和应用规律,同样也可用于去适应技术环境的变化。” 人是一种特别擅长观察变化的动物,但事实上更多的是不变。只有掌握了互联网技术变化后面的规律,在不变的基石上观察变化,才可能会更加淡定和从容。技术巨变,得规律者得生存。
- ?
大数据时代(智能化时代)
塔尔塔尔
展开
信息革命:20世纪40年代中期计算机问世以来,在全世界范围内兴起的第一次信息革命,信息高速公路是一种高速多媒体传输系统,能在全球甚至更大的范围内传输声像图文并茂的多媒体信息。
信息革命指由于信息生产、处理手段的高度发展而导致的社会生产力、生产关系的变革,以互联网于全球化普及为重要标志。
大数据时代(智能化时代)
2011年6月,全球知名咨询公司麦肯锡发布《大数据:下一个竞争、创新和生产力的前沿领域》,麦肯锡称:“数据,已经渗透到当今每一个行业和业务职能领域,成为重要的生产因素。人们对于海量数据的挖掘和运用,预示着新一波生产率增长和消费者盈余浪潮的到来。
进入2012年,大数据(big data)一词越来越多地被提及,人们用它来描述和定义信息爆炸时代产生的海量数据,并命名与之相关的技术发展与创新。
《纽约时报》2012年2月的一篇专栏中称,“大数据”时代已经降临,在商业、经济及其他领域中,决策将日益基于数据和分析而作出,而并非基于经验和直觉。
哈佛大学社会学教授加里·金说:“这是一场革命,庞大的数据资源使得各个领域开始了量化进程,无论学术界、商界还是政府,所有领域都将开始这种进程。”
维克托·迈尔-舍恩伯格,肯尼斯·库克耶著,盛杨燕、周涛译《大数据时代:生活、工作与思维的大变革》(2013年1月)前瞻性地指出,大数据带来的信息风暴正在变革我们的生活、工作和思维,大数据开启了一次重大的时代转型,包括大数据时代的思维变革、商业变革和管理变革。
大数据时代的思维变革
更多:不是随机样本,而是全体数据
更杂:不是精确性,而是混杂性
更好:不是因果关系,而是相关关系.
数据化:DATAFICATION一切皆可量化当文字变成数据当方位变成数据当沟通变成数据世间万物数据化。
价值:VALUE取之不尽用之不绝的数据创新数据的再利用重组数据可扩展数据数据的折旧值数据废气开放数据。
角色定位:ROLE 数据、技术与思维的三足鼎立大数据决定企业竞争力数据科学家的崛起全新的数据中间商大数据思维公司大数据技术公司大数据掌控公司。
企业行政管理机构的设置
组织结构:是指组织的框架体系及其相互关系,它涉及组织内部专业化分工程度、部门的设置、管理幅度和管理层次、集权与分权的程度、职责与职权的设定以及组织成员之间的协调与合作关系等内容。
管理幅度与管理层次
管理幅度:也称管理跨度或管理宽度,是指某一层次上的主管人员直接而有效地管理下属人员的数量。
管理层次:是指组织内部从最高一层管理组织到最低一级管理组织的组织等级。
管理幅度与管理层次之间存在反比关系。管理幅度越大,管理层次就越少;管理幅度越小,管理层次就越多。
企业行政管理人员的基本素质与能力科莱斯平衡记分卡(Careersmart Balanced Score Card),源自哈佛大学教授Robert Kaplan与诺朗顿研究院(Nolan Norton Institute)的执行长David Norton于1990年所从事的「未来组织绩效衡量方法」一种绩效评价体系。平衡计分卡是从财务、客户、内部运营、学习与成长四个角度,将组织的战略落实为可操作的衡量指标和目标值的一种新型绩效管理体系。设计平衡计分卡的目的就是要建立“实现战略制导”的绩效管理系统,从而保证企业战略得到有效的执行。
基本能力:协调能力、人际沟通能力、执行能力、团队协作能力、创新能力。
职责与职权
职权:是指管理职位所固有的发布命令和希望命令得到执行的权力。
职责:是指某项职位应该完成的任务及其责任。
职责与职权必须是对应的,有权无责、有责无权都是不能完成好组织任务的。
- ?
“数聚万物 智启未来”高峰论坛:聚焦人工智能与大数据发展趋势前沿
赵代双
展开
新华网北京6月12日电(记者高璎璎)由清华大学经管学院金融协会主办、清华大学数据科学研究院协办的“数聚万物 智启未来——人工智能与大数据高峰论坛”近日举行。与会嘉宾就“人工智能现状及仿脑人工智能”、“从能听会说到能理解会思考”、“计算机视觉技术在智慧城市建设中的应用”、“未来已来——大数据与人工智能时代中的金融科技”以及“数据驱动创新”等热点话题,进行了分享和讨论。
宋森:深度学习在医疗图像应用领域应用广泛
清华大学脑与智能实验室主任助理宋森主要从事脑科学和人工智能的交叉研究,关注脑科学的研究对人工智能会有什么样的启发。在宋森看来,人工智能这一波主要是基于深度学习,深度学习很关键的一点是基于大数据,目前在基于大数据、特定场景下以及确定性问题上有了非常大的突破,但小数据情况下,与人脑会采用推理、类比等方法应对相比,深度学习经常犯致命错误。下一步,深度学习会往通用性、不确定性,带深度理解的方向发展。
宋森介绍,深度学习在医疗图像的应用领域非常热门,比如谷歌实通过算法对眼底图像实现了自动分析,能够早期发现可能导致失明的糖尿病导致的眼底出血等症状。人工智能也能帮助挖掘信息,提供可能的疾病诊断或治疗的新思路。
江涛:人工智能大量应用在教育、医疗、司法领域
科大讯飞联合创始人、高级副总裁江涛介绍,世界上首部全篇采用人工智能配音的纪录片《创新中国》中,配音恢复了已逝配音艺术家李易的声音,这是通过科大讯飞的语音合成技术实现的。目前科大讯飞的语音识别已经能覆盖22种方言,近一半识别准确率超过90%。而在医学图像理解方面,科大讯飞2017年8月在国际医学影像领域的权威评测LUNA上获得平均召回率94.1%的检测效果,达到三甲医院放射科医生水平。此外,2018年3月2日,科大讯飞“智医助理”人工智能辅助诊疗系统正式开始在合肥庐阳区“实习”,目前已经可以对300余种常见病提供全科医生辅助诊疗,辅助基层全科医生每天完成大量的诊疗工作。
在司法领域,科大讯飞“辅助定性量刑系统”已经通过人工智能辅助检察官进行重大案件复核。扫描输入案件的卷宗信息后,机器能分析出这个案子的证据链是不是完整,证据链中间有没有自相矛盾的内容,类似的案例过去是怎么判的,并找出该案件涉及的全部法条。这一系统并不能替代法官做决策,但能大量减少法官卷宗文书的查阅工作。
陶海:智慧城市要用信息化倒逼流程改造
对于人工智能在智慧城市建设中的应用,北京文安智能技术股份有限公司创始人、董事长陶海认为,智慧城市分为两个层面,感知层和决策层。不过,目前国内不少地方的智慧城市还只停留在更浅层的信息化阶段,尚未达到感知和决策这两个层面。感知层建设的典型应用包括大量的城市道路交通、监控摄像头,通过摄像头将城市中的人和物体数字化。比如进行人脸感知、识别,并进行一定的智能判断,以及把城市的井盖、灯杆等信息都数字化,供城市管理者使用。但真正实现智慧城市,一定要有决策层智能,即对城市状态观测、数字化后实现管理优化,优化环境、优化交通、优化各方面资源配置等。当所有信息都收集了之后,可以实现自动或半自动的城市优化控制。智慧城市先建信息化,用信息化倒逼流程改造。
陶海说,比如在我们服务过的华南地区某中心城市,可以通过智能视频分析检测城市垃圾筒是不是满了,再进行更加合理的人员调配。这就是智能技术减少成本支出的典型应用。
赵磊:我国券商行业IT投入远低于国外水平
谈到大数据与人工智能时代的金融科技,北京根网科技有限公司副总裁赵磊表示,人工智能、大数据未来在金融行业的主要应用还是人机结合。国内券商行业IT投入远低于国外水平,美国的证券公司极其注重IT建设。以高盛和摩根大通为例,高盛2017财年的IT投入达到30亿美金,占营收10%。高盛的33000员工中,有9000多位是工程师和技术人员。而摩根大通2017年IT预算为90亿美元。数据显示,中美两国资本市场2015年总成交额已持平,但证券行业总IT投入差距却高达20倍。此外,我国证券业软件投入占IT总投入比例只有20%左右,远低于国际平均60%的水平。
韩亦舜:大数据在数据采集、存储、应用上值得关注
就数据驱动创新话题,清华大学数据科学研究院执行副院长韩亦舜认为,中国更多的是商业模式的创新,美国则更多是技术的创新。很多时候中国的创新本质上看还是微创新、微集成,把很多已经成熟的技术重新组合在一起。在美国,一个新技术到来以后,其价值很快可以获得上下游认可。而中国投资人很多,评价一个项目时不仅看其技术亮点,可能还要求商业模式要做好,要证明商业模式上各种各样的生产关系都能打通理顺,这对中国创新是比较大的挑战。
韩亦舜表示,大数据在数据采集、数据存储,以及数据应用领域值得关注。在文本挖掘、自然语言方面,都会有一些新的机会,进行一次或者二次的数据采集。而在数据加工和数据应用方面,有很多创新创业的机会。
他建议,一个单位在做大数据或者智能化的过程中,可分为几步:一是要认真看一下自己有哪些数据资产,不要盲目追求大数据;第二是先进行内部整合,比如在公司内部有没有数据共享;第三是价值挖掘。
- ?
重庆西部大数据前沿应用研究院昨日正式开院
惠冥
展开
△昨日,重庆西部大数据前沿应用研究院正式开院。
重庆大数据智能化发展,必须要有相关人才支撑。
昨日,重庆西部大数据前沿应用研究院正式开院,该院将与工商大学合作,培养大数据人才。
数据展示馆“一图看懂大数据”
据了解,西部大数据研究院由渝北区政府与国家信息中心联合打造,是西部地区目前唯一一个全面承接国家信息中心数据、人才和技术资源的产学研智库平台。将为重庆融于国家大数据战略布局,对接国家大数据决策、大数据资源、大数据产业等提供承接平台、技术和智力资源支撑。
如今已进入大数据时代。然而对于不少小伙伴来说,要完全弄懂什么是大数据并不是一件简单的事。如今,西部大数据研究院的可视化展示中心,就能轻松让你看懂大数据。
国家信息中心大数据发展部规划与应用处处长王建冬介绍,“这个大数据展示馆正在打造中。会对大数据应用、全国大数据典型案例进行可视化展示,让普通人也能‘一图看懂大数据’。”
王建冬说,未来还会邀请国内外学术机构和知名企业在渝北区举行仙桃大数据研讨会,打造仙桃数据谷公益化、高端化大数据行业交流平台。
针对重庆本土培养大数据人才
随着网络经济的空前发展,大数据领域需求的岗位逐年增加。
据专业机构调查预测,中国在3至5年内需要有180万人从事大数据相关的岗位,而目前大约有150万的人才缺口。
王建冬介绍,在此次签订的合作协议中,也包括了大数据相关领域应用型人才培养的项目,将主要针对重庆本土培养大数据人才。
王建冬说,西部大数据研究院与重庆工商大学人工智能学院将联合设立大数据应用研究人才实习实训基地。依托现有的相关数据资源,与国内外大数据知名企业联合设立大数据应用研究人才实习实训基地,强化校企大数据人才联合培养。
同时探索建立大数据应用人才定向培训机制。逐步建立由地方政府资助或企业委托,组织开展人才培训的定向合作机制,面向重庆、四川、云南、贵州、陕西等省市,开展大数据应用人才委托定向培训。提升大数据应用人才国际化教育水平。主动融入“一带一路”国家战略,通过与“一带一路”沿线相关国家联合培养、跨国交流等多种形式,提升大数据应用领域人才教育国际合作力度。
建立低收入人群数据库精准帮扶
记者还了解到,渝北区农委将与中联润通开展战略合作,利用大数据和移动互联技术,建设渝北区低收入人群(暨贫困人口)综合管理大数据平台和渝北区精准扶贫大数据决策支持平台,以实现低收入人群和扶贫大数据监测和分析,争取今年8月基本建成两个大数据平台,争取到2019年3月实现与区/县域相关扶贫、低收入人群数据的共享和应用,系统全面建成。
据王建冬介绍,低收入人群(暨贫困人口)综合管理大数据平台主要收集低收入人群的各种数据,包括社保信息、车辆信息等等,为精准帮扶提供数据支撑。“此外,还将通过移动终端定位等技术手段,对扶贫轨迹进行跟踪、监督扶贫款项的使用。”
上游新闻·重庆晨报记者 王淳
- ?
2018数博会5月开幕 多部大数据前沿研究著作将发布
Mostyn
展开
中新网北京3月1日电(记者宋宇晟)2月28日,2018中国国际大数据产业博览会(以下简称数博会)新闻发布会在北京召开。记者获悉,以“数化万物智在融合”为主题的2018数博会将于5月26-29日在贵阳举行。
据悉,2018数博会由中华人民共和国国家发展和改革委员会、工业和信息化部、国家互联网信息办公室、贵州省人民政府主办。参展参会人数预计将超过5万人次,展览面积6万平方米,参展企业超过400家。
记者了解到,2018数博会将围绕数据的“聚、通、用”,集中展示全球近四百家企业关于人工智能、区块链、社会治理、产业创新、智慧城市、共享经济、大数据与实体经济融合、数据安全等方面的应用成果,集中展示大数据收集、储存、整合、管理、应用等方面的前沿技术。
据介绍,会议期间将首次展示对“中国天眼”所接收天文大数据进行处理的超算能力和技术,首次展示5G应用场景体验,首次发布《中国数谷》《块数据4.0》《大数据战略重点实验室》等大数据前沿研究著作,首次发布贵阳市100个大数据应用场景招商信息。会议还将发布全球“十大黑科技”等重大科技成果和国内大数据城市安全指数等行业发展报告。
值得一提的是,在举办数博会的同时,中国电子商务创新发展峰会将同期举办;数博会期间还将召开5场高端主题对话、举行多场专业论坛、设中国国际大数据产业博览会专业展。
此外,2018中国国际大数据融合创新·人工智能全球大赛总决赛将于2018年5月25日在贵州贵阳举行,决赛成果将在数博会期间展示。数博会期间,美国、英国、意大利、印度等国驻华使馆和全球知名企业、全球著名机构还将举办各类主题活动。(完)
来源:中国新闻网
- ?
从四方面推动大数据发展 支持前沿技术创新
碧凡
展开
在23日于福州举行的“数字中国建设峰会”的“大数据分论坛”上,工信部副部长陈肇雄表示,接下来将从四个方面推动大数据发展。
一是推动大数据创新发展,支持前沿技术创新,加快关键产品研发,推进大数据与云计算的深度融合,促进产学研深度融合,造就一批明星企业和人才。
促进大数据创新发展
二是推动大数据融合发展,深挖融合潜力,加快工业互联网、工业大数据建设,培育数据驱动发展新模式、新业态。
三是激发市场活力,鼓励建立大数据公共服务平台,鼓励中小企业深挖细分市场,积极参与数据安全建设,推动大数据企业的国际化发展。
四是推动大数据安全发展、强化保障能力,加强大数据安防产品开发,维护数据的可靠性,构建安全保障体系,建立高效的数据安全管理机制。
- ?
人工智能和大数据 未来最前沿的生产力
不帅
展开
【IT168 资讯】8月5日,许多知名行业技术大咖聚集北京国家会议中心,参加了2017FMI人工智能与大数据高峰论坛。本次论坛主要以人工智能和大数据为主题,结合当代人工智能和大数据的发展,通过第四范式、eBay、饿了么、Admaster、中信通信等知名企业产品技术的分享,洞悉技术与商业未来。
第四范式首席架构师胡时伟谈《机器学习系统和工程方面的优化方向》
作为卓越的人工智能技术与服务提供商,第四范式一直都是人们关注的重点。在本次大会上,胡时伟谈及机器学习系统和工程方面的优化三个优化方向:精细、智能和高效。以工业界应用算法的4个象限为例,介绍了先知平台的主要技术技巧。
先知平台运用GDBT框架可在相同机器相同时间内,用到5到6倍的数据以及多到数十倍或上百倍的规模,在计算力上为算法提供了保障。
eBay李睿解析《NLP在eBay的技术实践》
eBay是2017年BrandZ最具价值全球前100强品牌,而eBay的项目负责人李睿主要负责研究和开发电子商务平台上用到的分类识别算法。在8月5日上午的FMI人工智能与大数据高峰论坛上,李睿主要介绍了NLP在eBay的技术实践。
分类器下的自然语言处理在eBay搜索、类别推荐、产品分辨、机器翻译等的具体运用。eBay通过不断努力把电商做到了世界各地,我们希望eBay以后的发展更加美好。
李嘉璇分享《大规模分布式集群训练在TensorFlow上的实践及演进》
李嘉璇今天的演讲主题包括常见的大规模训练、大规模分布式集群训练的递进式解决方案、TensorFlow和Spark相结合的实践、云深度学习平台的架构设计和实现以及调参经验的分析,满满的都是干货!
李嘉璇还表示,TensorFlow目前正在致力于打造云深度学习平台,这个高性能平台配有多租户认证授权机制、提供模型开发解决方案,旨在给各个业务部门提供一个云深度学习的基础服务。
第四范式创始人、首席研究科学家陈雨强《工业界机器学习痛点及解决思路》
人工智能的兴起是数据量变大、机器性能提升和并行计算发展共同带来的结果,我们工业界的人工智能最需要的是Scalable的系统,而高VC维模型是Scalable的系统必须的。
陈雨强指出,所有的机器学习本身就是一个偏执的,AI没有普及的原因不是效果不够好,而是门槛太高。第四范式一直在为“AI for everyone”不断努力,让工业界所有的地方都能用上人工智能。
饿了么王胤 《高分辨卫星图像深度信息提取》
结合自己原来在Facebook的工作经验,王胤对Facebook中的导航和位置分享功能实现做了详细的介绍。Facebook的上线视频有一个是开源地图,Facebook团队不断通过深度学习模型的改进和深度学习在图像上的应用,将当地开源地图的数据和卫星图像结合,极大地改进了地图的准确度。
Admaster技术副总裁卢亿雷谈数字营销在人工智能领域的实践
卢亿雷在分布式存储和计算、大数据方面有很多项发明专利,也是人工智能技术的常驻嘉宾。人工智能的发展得益于大数据的发展。卢亿雷针对大家对人工智能技术偏差理解、应用技术和场景、算法和模型给大家做了一个简单的介绍。最后,卢亿雷深度讲解了人工智能在数字营销行业的应用。
卢亿雷表示人工智能不等于智能,人工智能主要分为5大块,分别是知识库、搜索技术、推理技术、知识获取技术、系统智能和人工智能。而数字营销真正的智能化是让大家对广告不讨厌,让大家通过营销找到自己想要的产品,这才是人工智能应用到数字营销的真正目的。
中兴通信高级系统架构师刘光聪《TensorFlow on Kubernetes》
中兴通讯是全球领先的综合通信解决方案提供商,公司成立于1985年,可以说是综合通信解决方案提供商的元老。刘光聪通过中兴通信TensorFlow在Kubernetes上的实战案例,分享了TensorFlow高性能集群容器化的一些技术实践。运用TensorFlow整体架构和运行机制,在信箱添加加密算法,制作TensorFlow的容器化,使产品性能得到了很大提升。
中兴通信发展到今天,背后一直都有强大的领导力和技术的支撑,我们期待中兴通信在以后的技术分享中带给我们更大的惊喜。
- ?
掌握hadoop,掌握大数据最前沿科技
缪鸣凤
展开
大数据概念早在1980年,著名未来学家阿尔文·托夫勒提出的概念。2009年美国互联网数据中心证实大数据时代的来临。随着谷歌MapReduce和 GoogleFile System (GFS)的发布,大数据不再仅用来描述大量的数据,还涵盖了处理数据的速度。目前定义:大数据(big data),或称巨量资料,指的是所涉及的资料量规模巨大到无法透过目前主流软件工具在合理时间内获取、管理、处理、并整理为帮助企业经营决策。
hadoop的创始人是Doug Cutting,他是 Lucene、Nutch 、Hadoop 等项目的发起人。这个人很厉害的。他有个女儿,而女儿有个布娃娃,它的名字就叫hadoop,这也是hadoop名字的由来。
简单理解,Hadoop是一个开源的大数据分析软件,或者说编程模式。它是通过分布式的方式处理大数据的,因为开元的原因现在很多的企业或多或少的在运用hadoop的技术来解决一些大数据的问题,在数据仓库方面hadoop是非常强大的。但在数据集市以及实时的分析展现层面,hadoop也有着明显的不足,现在一个比较好的解决方案是架设hadoop的数据仓库而数据集市以及实时分析展现层面使用永洪科技的大数据产品,能够很好地解决hadoop的分时间长以及其他的问题。
人们在谈论Hadoop的时候,常常把它当做单一产品来看待,但事实上它由多个不同的产品共同组成。
Russom说:“Hadoop是一系列开源产品的组合,这些产品都是Apache软件基金会的项目。”
一提到Hadoop,人们往往将其与MapReduce放在一起,但其实HDFS和MapReduce一样,也是Hadoop的基础。
Hadoop是由开源社区和各个厂商共同开发和推动的。具体说来,厂商的Hadoop的产品其结构化和关系性更强一些。
Russom说:“一直以来报表平台、数据集成平台在为更新的平台提供各种各样的接口,Hadoop当然也不例外。”
Russom最无法忍受的,就是人们常常把二者混为一谈。能够对数据集进行管理是数据管理系统很重要的特性之一,这一点HDFS是不具备的。
数据库管理系统中,我们通过查询索引可以实现对数据的随机访问,它往往处理的是结构化的数据,而在Hadoop中不会处理这样的数据类型。
MapReduce早在HDFS出现以前就由Google开发推出。除此之外,诸如MapR一类的厂商一直在宣传MapReduce功能的多样性,无需HDFS支持。
尽管如此,Russom却认为它们具有很好的互补性。HDFS的大部分价值都体现在可层叠到分布式文件系统的工具上。
- ?
案例分析:掌握AI在大数据领域的前沿应用
旧城
展开
鸿侠从什么是数据新能源说起,接着介绍了阿里目前比较成功的两款数据产品,一个是是自动化标签生产,另外一个是大规模分布式知识图谱,以及在此之上的一些重要应用。最后是她对机器学习和人工智能技术对数据新能源产业中有效落地的一些建议和期望。
近日,全球技术学习技术大会首次在京举行,阿里巴巴数据技术及产品部资深算法专家杨红霞(鸿侠)作为特邀嘉宾出席并发表主题演讲。鸿侠从什么是数据新能源说起,接着介绍了阿里目前比较成功的两款数据产品,一个是是自动化标签生产,另外一个是大规模分布式知识图谱,以及在此之上的一些重要应用。最后是她对机器学习和人工智能技术对数据新能源产业中有效落地的一些建议和期望。
下面是基于鸿侠现场演讲内容摘要:
如果大家对阿里巴巴的新闻比较关注,最近可能会频繁听到阿里巴巴谈到“五新”这个词,“五新”中的其中一个概念是新能源。其实新能源就是大数据本身。技术、数据和算法三个方面结合在一起,才可以把数据真正用起来。
大家都知道,Google的数据量很大,但是它的数据源本身其实比较单一。以Google search,Google map等为主导。再来看看Facebook,它更多的是社交行为数据,缺少出行数据、 浏览器数据、或者类似优酷的视听数据。但是,对于阿里来说,上述的这些数据我们都有。我们面临的极大挑战是:怎么样有效的把这些全域数据融合在一起。
首先我们需要把数据有效地收集起来。把数据有效地收集、存储起来之后,接着要做的就是怎么通过算法把这些数据打通,并且真正有效、智能地把这些数据提炼出来。
这是阿里的一个生态体系图。最底层是阿里云,这是我们的一个计算存储框架。上面是阿里妈妈,阿里妈妈是负责整个阿里巴巴计算广告的一个部门,再上面是菜鸟、支付宝和蚂蚁金服。然后是与电商业务相关的,像淘宝网、天猫、聚划算等等,或者是跟文娱相关的,优酷土豆,还有像阿里旅行,口碑之类的业态。
阿里巴巴数据中台要做的事情是什么呢 举一个最简单的例子,之前有一个比较火的电视剧《三生三世》。《三生三世》火热上映的时候,与之相关的商品元素,比如饮食或者穿戴之类的商品,也会瞬间在淘宝网上火爆起来。那么如果我提前就知道某一类人群是《三生三世》的粉丝,我就可以在淘宝网上做非常高效的、准确的定位推广。阿里数据要做的是:把数据真正打通,深度挖掘数据的价值,为业务创新应用提供数据决策基础和依据。
下面具体介绍一下数据融合的技术框架。因为在真正进入算法之前,我们一定要对数据进行非常认真、仔细地进行清洗过程。俗话说,如果你的数据不清洗,其实就是“learn trash from trash”。所以数据本身一定要做得非常干净。
首先来看一下架构图,第一个数据层中有各种各样的数据,比如有消费数据,有广告数据,出行数据等等。把这些数据层经过有效结合在一起之后,接下来得到这种特征层的提取。在阿里数据内部,大概有这样几个比较抽象的维度:像账号设立的静态特征,电商行为的特征,或者设备的特征等等。
在特征层之上,我们会有模型层, 这里面有基于业务规则的模型,也有其他的例如异常检测,有监督或者无监督的学习,然后特征的联合校验等模型。因为我们的数据源非常多,因此我们也可以通过部分的数据源验证另外一个数据源,看数据的增长或者留存是否处于一个正常范围。另外还有一些比较好的方法,比如基于Graph的一些算法,实时的反作弊算法等等。在算法层之上,就是评估层。在评估层内,我们可以判断留下来的数据是否是真正有效的数据。
在上述这些数据层的上面,会有一个应用层,也同时会抽象出一些产品来帮助内部员工或者外部商家进行使用。所以,整个数据中台实际上是从底到上对数据进行清洗的一个架构。
当我们有了非常干净的数据之后,我们要做的就是把数据打通。我刚才说了,阿里生态体系会呈现出几百个不同的数据源,这些数据源本身的数据量非常大,收集模式也各不相同。那么我们是如何进行数据之间的融通的呢
上图是这是我们关于怎么把数据打通的一个技术架构。大家可以看到,整个技术体系都是,先把数据接进来,再通过一些机器学习或者深度学习的办法(像word2ve,node2vec, TFIDF,归一化等)处理特征层,之后映射到一些比较抽象的高纬度Level(比方说像用户的身份信息,网络的环境相似度,文本的相似度,APP相似度等等)。抽象完这些特征层之后,我们究竟怎样去判断。
这期间的方法大致可以分为四种有效的办法:
深度学习的模型
非线性模型
线性模型
图模型
此外,还有一些基于规则的强召回,就是比如说用户有相同的账号登陆不同的地方。这些是所谓的强召回,它可以非常准确地被判断出来。弱召回就是基于算法特征层的这些模型,有效地判断出所有信息是否真正属于同一个自然人。下面,基于刚才的打通融合的数据之后,介绍两个数据应用类产品。
1、自动化标签的生产
在电商业务中,我们想知道这个人背后更多的其他方面的特征。所以,我们会有一个自动化标签生产的体系,快速地进行标签生产。比方说上传一些种子用户,比较类似于像Facebook 的Look alike audience,可以快速在几千万个特征中选出来最重要的那些特征,然后通过最重要的这些特征对于那些还没有打标的庞大人群进行打标。
在阿里数据中台,我们研发了一个叫“自动化标签生产”的体系。这个体系需要满足三个需求:
需求的响应速度一定要快。
标签生产的负荷能力要强。
对于这个标签生产数据源是有一定要求的,就是你要做出判断,不是他上传了一批种子用户,他对某一些标签有需求,我们的数据量,或者数据就一定是足够帮你产生这些标签的。
所以,基于刚才的一些要求,我们推出了“标签工厂”的这一套服务体系。它可以达到几个目的:
降低成本。现在我们有一个可视化界面,只要你上传一个种子用户,按照你自己的要求,大概在一两个小时之内,帮你快速生产标签。
质量。当你在产生第一轮标签的时候,其实更多的还是基于对算法本身的一个评估判断。标签真正上线之后,在业务的指标上面会不停产生反馈,所以我们实时的把这些业务反馈放进在标签生产体系,不停地帮助优化标签的产生。
保证数据安全。
下面具体看一下我们的技术架构:
第一,数据源。你可以认为,整个数据新能源的数据源都是接到下面,经过数据清洗、打通之后,来到一个标签工厂的体系。在标签工厂,首先会进行一定特征学习(feature engineering),比方说有一些像类型判断、分层、降维,因为数据量非常大,通过深度学习,深度表征去学习出特征之间的非线性关系,和它们之间的high order interaction。
接下来就是打标。首先可以传一批种子用户,由于你打标签的这部分种子用户是非常小的一部分用户,所以还涉及到快速扩充Label,或者通过不停的这种adaptive learning去训练完之后,可能通过算法的输出,可以增加一些更有效的确实是能反映出你的Label真实的样本集。
如果你的标准样本很多,很丰富的情况下,你可以用有监督的学习。有监督的学习,其实有线性的、非线性的或者是基于深度学习的。真实情况是有label的sample很少,在更多情况下我们需要使用半监督的算法,例如self-training, co-training等。
2、大规模分布式知识图谱
讲完标签工厂之后,介绍另外一个产品,大规模分布式知识图谱。大规模知识图谱抽象也是一种图计算。首先谈一下基于大规模分布式知识图谱做了哪些工作,以及我们为什么要做这样一件事情。
阿里巴巴的生态非常丰富,而丰富的业态背后给我们数据工作者带来的困难就是,我们常常需要接入各种数据,并将他们有效地管理和整合起来,传统的方法,我们可能需要花几个月,投入几十个人做这样一件事情,对数据进行打标。
但是,假设我们已经知道数据和数据之间的一些关系,而且也知道数据表中哪些表之间调用的血缘关系。那么,如果我只是对调用次数最多的表进行非常精确地打标,然后用基于知识图谱的方法,对剩下的90%表进行推理式的Label打标,就能极大节约了人力成本。所以这就是我们为什么要用知识图谱去做数据接入这样的事情。那么,对于数据管理也是同样的道理。
假如只有1G的数据,你可以很快地回答出数据分布的情况和质量。而我们的现状时,我们的数据达到ZB级别的规模。因此对数据管理来说,挑战不容小觑。同样地来看看数据应用方面的情况。我们基于数据应用,实际上也有一款产品叫做“数据地图”。
数据地图是干什么呢 其实就是当你进行一个查询,在这个产品里会自动帮你反馈出一个最相关的表。延伸开来的是我们想要做得下一步工作:当你下一次进行查询后,能直接返回出相应的SQL,再产生出相应的表和相应的结果——这是我们想做的智能取数。
下面介绍一下知识图谱在数据管理和数据应用方面的落地进展。目前我们开发了一些基于几十万张、上百万张ODPS表的知识图谱。说一下我们的结果:
在数据资产管理中,有一项重要的工作就是判断数据的归属。我们有上百万张的线上表,其中可能有几万张到几十万张的表能够比较清楚判断是属于哪个团队,可以在数据版图上打标。但是,还有上百万张没有打标的表,因为这个表属于异构的。在之前,通过一些人工的规则,它的归属判断准确率大概是55%,而通过前面介绍的知识图谱框架,准确率可以提升到88%。所以,它对数据资产管理的准确性起了显著的提高作用。
接下来讲一下知识图谱在数据应用当中的一个技术框架,其实也是比较类似的:
首先,数据层。因为是一个知识图谱的构建,所以上面要加个辞典层和语义层。再上面就是基于推理层。在推理上,用的方法有大家比较熟悉的像随机游走和延伸等。那基于标注的,我们其实尝试了很多种方法,比方说张量分解等。
目前为止比较成功的是PRA(path rankingalgo),我们研发了几个主流的graph feature model,PRA在大规模分布式知识图谱推理上,在我们的问题中,表现是最好的。什么是PRA,其实是把这些路径抽象出来,然后就是学习一下再推荐这个路径,但是它对于我刚才说的很多文本信息并没有有效的利用起来,比如对于这些表的描述,在最原始的PRA当中路径本身的位置是有考虑进去的,当然我对于这些描述,可能会知道也许这个路径更有效。所以,后来我们看了一下这个Trans系列,其实类似text analysis 中的word2vec vs tfidf。确实在我们整个的刚才说的案例当中也是有比较大的提高。
看一个具体的例子,在数据地图当中,知识图谱到底是怎么工作的:
你打出一个查询,首先就是基本的分词与分析,其实大家可以看到,我们这个场景也是相当于搜索反馈一个结果,但是其实它和传统的搜索是不一样的:传统的搜索像Google、百度,其实它关心的指标是你准确的那个值是不是在TOP5或者TOP10。
但是,我们这个场合下一定要反馈唯一的、准确的表。所以,接下来我们会有一些模板匹配,所以这里非常重要的一部分是人机交互这一块,把人机交互的结果,就是人要告诉你说,这个结果是否是他想到的,然后知识图谱整个刚才的框架有效的结合在一起,然后产生出你真正想找到那张表,然后整个的这个过程,其实这些是一些抽象出来的模板,这些模板可能是不够的。因为随着人的查询越来越多,模板也需要慢慢的扩展。现在我们还是基于一些规则判断一些模板,未来我们也会尝试,让这个机器自动产生一些模板。
所以总结一下,我刚才给大家大概介绍了一下什么叫数据新能源,以及我们在数据新能源上两个成功产品,一个是自动化标签的生产,可以在非常快速的在几个小时之内,为几亿人打上有效的标签,并且快速的验证落地。另外一个是大规模分布式知识图谱,以及两个应用的比较好的产品,一个是数据资产管理,另外一个是数据地图,就是快速的查询这个有效的表。未来我们想做的不只是一个表本身,也许就是一个query对应的sql,对应的你最后的结果。
最后再讲一下我们对于整个工业界中机器学习怎么才能成功落地的一些建议:
第一,必须要有大数据。如果没有大数据,其实很多的挑战你是看不到的。而且大数据本身一定是要丰富多样的,如果数据源本身过于单一,其实对模型的挑战是比较小的。所以你的数据源本身多样性比较要多,机器学习才会发挥出更大的作用;
第二,一定要有计算平台。像现在阿里云给我们提供了一个非常好的保障;
第三,你开发的算法一定是要通用的。就是大家可能是在这个公司工作会发现,每开发一套算法,投入的人力和时间和成本都是比较高的。所以说你的算法本身可延展性一定是要比较好的。
我今天的演讲就到这里。谢谢大家!
文章来源:钱塘大数据交易中心 qtjiaoyi
- ?
大数据的前沿,期待你的观看
孟坤
展开
AIDL系列活动已经成功举办两期,本次主题为《大数据:从理论到应用》由中科院计算所副所长程学旗研究员任学术主任,将于5月12至14日在深圳·深圳大学举办。本次活动四大亮点如下:
1. 主题集中
根据研究报告显示, 62% 的大中型公司希望在未来的两年内能将机器学习用于商业分析。大中型公司认为大数据分析是必须的,并且接受基于大数据分析的新技术。“大数据”可谓火爆了所有企业圈,到底何为大数据?如何应用大数据分析技术来提高企业的核心竞争力?如何利用大数据进行转型?大数据技术的最新进展如何?本次活动将集中回答关于大数据所有你想知道的内容。
2. 内容前沿
本次所有的报告内容,均是大数据领域专家的最新研究进展成果。对于掌握技术发展趋势,把握未来发展方向有重要的指导意义。
3. 兼具理论和实践
本次活动兼具大数据理论基础的讲解和大数据技术的典型应用,不仅对从事科研的工作者有重要的启发,也将指引企业利用大数据进行升级转型。
4. 阵容强大
AIDL3邀请到了中科院计算所副所长程学旗研究员作为学术主任,一众海内外研究机构和企业的一线专家坐镇现场授课,与顶级大牛进行学术、技术交流和思想碰撞。
大数据前沿
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并