- ?
互联网+大数据实现需求和资源最简便的对接
郝晓凡
展开
随着互联网时代的发展。大数据化时代的到来给很多企业带来本质的改变。在制造系统和商业环境变得日益复杂的今天,利用大数据去解决某些问题和积累知识或许是更加高效、便捷的方式。“大数据的目的并不是追求数据量大,而是通过系统式的数据收集和分析手段,实现价值的最大化。所以推动智能制造的并不是大数据本身,而是大数据的分析技术,”数据本身不会说话,也不会直接创造价值,真正为企业带来价值的是数据经过实时分析后及时地流向决策链的各个环节,或是成为面向客户创造价值服务的内容和依据。大数据技术的快速发展,也将用户的行为追踪变得更为便利。
大大神平台采用大数据庞大的用户基数和强大的数据处理能力,将需求方、供应方、资源方通过大数据技术全线打通。使得用户发布的软件需求平台可通过关键词利用大数据智能匹配出产品经理,让符合用户的产品经理从量级和精准度方面脱颖而出。 通过大数据分析精准了解需求者所想要做的软件一个领域和特点,并以此为依据,通过平台进行资源的精准匹配,并最终通过大数据分析精准细致的给出用户满意的效果。
智能匹配:
每一组数据和一个社会现象之间,都存在千线万缕的联系。比如,如果你所写的需求中多次出现商城类型的文字,大数据就会抓取多次出现的关键词,并通过各种数据模型的设计,去分析用户需求的所需要的是那一方面的产品经理。
抓住这一切入点,以“智能大数据”为核心驱动力,平台建立产品经理的专业领域标签、个人简介、擅长行业记录数据库,通过这些数据库预测需求者的所需。大数据时代让我们更容易获取对用户的洞察,当所有的行为和信息都被记下来以后,可能你所需要的产品经理可以被推荐和推荐平台上面的产品。大数据应用在个性化营销方面也可以让我们生活得更轻松。解决电商营销中“如何将推广信息与目标消费匹配”的行业难题。
大数据不仅可以实现需求和资源最简便的对接,实现丰富的智慧流通方式,还可以用更少的精力和成本,获得更优的闲置资产盘活和消费投资效果。
- ?
2020年中国有望成世界第一数据资源大国
冯紫山
展开
《经济参考报》记者从工信部、发改委等部委了解到,两会前后,大数据系列推进政策将密集推出,国家政策将为今年大数据产业的快速成长提供良好的发展环境。
业内预期,我国大数据产业正在从起步阶段步入黄金期,2020年中国有望成世界第一数据资源大国,但数据开放度低、技术薄弱、人才缺失、行业应用不深入等难题亟待解决。
数据成为关键生产要素
新年伊始,中央网信办、国家发改委、工业和信息化部联合印发《公共信息资源开放试点工作方案》,确定在北京、上海、浙江、福建、贵州5省份开展公共信息资源开放试点。
上述方案要求,试点地区要结合实际抓紧制定具体实施方案,明确试点范围,细化任务措施,积极认真有序开展相关工作,着力提高开放数据质量、促进社会化利用,探索建立制度规范,于2018年底前完成试点各项任务。
工信部信软司副司长李冠宇表示,“我国大数据产业顶层设计不断加强,政策机制日益健全。发改委、工信部、网信办等46个部委共同建立了促进大数据发展部际联席会议制度,全国有30多个省市制定实施了大数据相关的政策文件。”
业内预期,2018年,随着国家大数据战略推进实施以及配套政策的贯彻落实,大数据产业发展环境将进一步优化,社会经济各领域对大数据服务的需求将进一步增强,大数据的新技术、新业态、新模式将不断涌现,产业规模将继续保持30%以上的高速增长态势。
记者从工信部了解到,今年,随着八大国家大数据综合实验区建设不断加快,产业发展将推动形成特色领域。围绕京津冀和珠三角跨区域类综合试验区,将更加注重数据要素流通,以数据流引领技术流、物质流、资金流、人才流,支撑跨区域公共服务、社会治理和产业转移,促进区域一体化发展;围绕上海、重庆、河南和沈阳四大区域示范类综合试验区,将更加注重数据资源统筹,加强大数据产业集聚,发挥辐射带动作用,促进区域协同发展,实现经济提质增效;围绕内蒙古基础设施统筹发展类综合试验区,将在充分发挥区域能源、气候、地质等条件基础上,加大资源整合力度,强化绿色集约发展,加强与东、中部产业、人才、应用优势地区合作,实现跨越发展。此外,结合地方产业发展和应用特色,大数据产业集聚区和大数据新型工业化产业示范基地建设也将持续推进。
权威数据显示,预计2020年,我国大数据市场规模将超过8000亿元,未来中国将成为全球数据中心。IT技术的持续创新促使大数据时代加速到来,在此大背景下,数据成为关键的生产要素,预计到2020年,全球的数据总量将达到40ZB,中国的数据量将占全球数据总量的20%,成为世界第一大数据资源大国。
目前,我国大数据产业生态系统日趋完善,大数据技术、交易、开放共享、工业大数据等产业链纵向发展逐步延伸;重点区域产业布局有效推进。在行业应用中,预计到2020年,工业大数据的占比将达到6.64%。
中关村大数据产业联盟副秘书长陈新河表示,中国大数据产业发展呈现出政府与企业联动的态势,近几年国内培育出了一批大数据创新企业,发展势头良好。
在美国纳斯达克上市的中国第一家大数据公司——国双公司财报显示,其净收入增速是行业平均水平的2倍,预计2018年营收将达10亿元。
国双迄今不仅为包括中国政府网、国家发改委、农业部、北京市等在内的3000多家政府网站提供大数据分析服务,还为国家发改委、国家林业局、税务总局等众多单位提供政策大数据互联网分析服务,同时也为旅游、政府招商引资、地方产业促进、电子政务等垂直领域提供大数据整体解决方案。
“在新媒体领域,主要针对传统广电系统新媒体转型、三网融合、三屏互动的需求,提供融合媒体大数据解决方案,为新媒体运营与运维、节目创新、全媒体收视考核及领导决策提供即时的全媒体数据支持。”国双公司有关负责人表示。
中关村大数据产业联盟有关人士表示,国内另外一家大数据创新公司——百分点集团已率先构筑行业领先、涵盖多个行业的人工智能场景解决方案,尤其是工业和政务大数据解决方案,对国内工业和政务大数据转型起到了良好的助推作用。
百分点集团副总裁兼EBG事业部总裁高体伟介绍,百分点智能制造全价值链一体化平台已成功应用于汽车制造、3C制造、消费品制造等众多行业,帮助企业实现设备异常监控与预测、零件生命周期预测、良品保固分析、产品精准营销、个性化推荐,以及产品购买用户的情感分析、产品优化设计、品质追溯查询等,助力制造企业在生产、管理和营销各环节的转型。
据了解,百分点通过对用户数据、日志数据、家电机器状态等数据的分析发现,智能电视用户使用VGA接口的人不到1%,为一家生产制造企业节约几千万元成本。
四大难题亟待破解
去年,菜鸟和顺丰的“数据断交”事件,暴露出大数据发展中的数据共享难题。当前,我国大数据产业正在从起步阶段步入黄金期,数据开放度低、技术薄弱、人才缺失、行业应用不深入等都成为产业发展中亟待解决的问题。
首先,记者通过在贵阳、杭州、北京等地的采访了解到,我国信息数据资源80%以上掌握在各级政府部门手中。近年来,在《关于推进公共信息资源开放的若干意见》《政务信息系统整合共享实施方案》等文件的推动下,政府数据加快了共享开放的步伐,惠民成绩单亮点不断。然而,由于我国大数据发展还处在起步阶段,不少基础性、关键性数据仍被政府部门束之高阁,共享开放程度低,这已经成为现代化治理进程中的“路障”。
据贵州省大数据发展管理局相关负责人介绍,部分政府部门在数据收集的过程中,由于缺乏统一的标准,收集到的数据虽然量大,但质量不高,可利用价值低。据此前媒体报道,长江上游地区一些省份的交通管理部门、运输公司不愿与其他省市共享物流信息,造成联运衔接的信息壁垒,甚至出现了同样1吨货,一百公里公路运费比经济发达地区高60元的现象。
据了解,截至2016年底,广东省全省87个省直部门有6988类数据资源、62332项信息项,居全国各省(区、市)首位。但各部门提出的共享需求仅3649类,省级编目共享仅477类,数据难以真正发挥利民惠民、支撑政府决策的作用。
此外,尽管部分数据已接入共享开放平台,但由于不能被机器读取,成为无法释放应有活力的“休眠数据”。《2017中国地方政府数据开放平台报告》显示,截至去年4月,全国19个地方政府数据开放平台的8398个开放数据中仍有约25%的机器可读性较差。
中国科学院院士、北京大数据研究院院长鄂维南表示, “理论上我国有很多数据,但实际做数据分析会发现利用起来非常困难。”贵阳大数据交易所有关人士透露,不少企业以保护商业机密或节省数据整理成本等为由,不愿意交易自身数据。部分政府部门也缺乏数据公开的动力:有的是因懒政而让数据沉睡,有的则是已经利用数据开展商业化应用,不愿共享。
其二是技术创新滞后。我国大数据产业虽然与国际大数据发展几近步伐相同,但是仍然存在技术及应用滞后的差距,在新型计算平台、分布式计算架构、大数据处理、分析和呈现方面与国外仍存在较大差距,对开源技术和相关生态系统影响力弱。市场上,由于国内大数据企业技术上的不足,用户更加青睐Google、IBM、Oracle、SAP等国外IT企业。
微软大中华区董事长兼CEO柯睿杰认为,数据智能并非那么触手可及。大数据来源众多、数量巨大、形式各异,要从中获得一目了然的信息,就需要真正高效、可靠的数据管理和分析平台。
如何处理巨量数据是中国大数据产业面临的首要技术问题。鄂维南表示,“中国的数据体量特别大,比如,中国的视频比任何国家都要多,这些数据储存困难,需要用的时候往往就没了”。再以基因测序领域为例,中国每年新增的基因组测序原始数据超过20PB(1PB相当于100万GB),面临数据量大、数据处理流程长等技术挑战。
目前,我国大数据技术创新能力还有待提升。《大数据产业发展规划(2016-2020年)》指出,我国在新型计算平台、分布式计算架构、大数据处理、分析和呈现方面与国外仍存在较大差距,对开源技术和相关生态系统影响力弱。同时,大数据应用水平不高。我国发展大数据具有强劲的应用市场优势,但是目前还存在应用领域不广泛、应用程度不深、认识不到位等问题。
“我国大数据在底层技术上和国外差距特别大,技术都来源于谷歌等国外大公司。”国务院发展研究中心信息中心研究处处长李广乾说,很多时候我们的商业模式走在了技术前面,但并没有通过技术手段来推动创新。
第三是人才不足限制了大数据产业创新发展的成效。清华大学计算机系教授武永卫透露的数据显示,未来3至5年,中国需要180万数据人才,但截至目前,中国大数据从业人员只有约30万人。
同时,大数据行业选才的标准也在不断变化。初期,大数据人才的需求主要集中在ETL研发、系统架构开发、数据仓库研究等偏硬件领域,以IT、计算机背景的人才居多。随着大数据往各垂直领域延伸发展,对统计学、数学专业的人才,数据分析、数据挖掘、人工智能等偏软件领域的需求加大。
其四,行业应用不深入。赛迪顾问股份有限公司大数据产业研究中心提供的数据显示,互联网、金融和电信三大领域的大数据应用在各行业总规模中所占比重超过70%;健康医疗领域和交通领域近年不断“上架”新应用,但行业规模占比相对较小;而在其他众多民生领域,大数据应用仍处于浅层次信息化层面,行业发展水平参差不齐。
“目前,大数据在多个行业尚未与业务实现深度融合,应用场景创新不足,大数据技术人员需要提升行业业务知识和经验。”百分点首席数据科学家杜晓梦表示,国内很多行业仍仅在局部业务上使用大数据技术,仅掌握数据挖掘和分析技术,如不能将技术与业务全面、深度地融合,则无法完全发掘出数据应用的真正价值。
顶层设计牵引产业发展
对于数据开放和共享,工信部赛迪研究院软件所所长潘文建议,应建立完善大数据发展协调机制,加快政府数据开放共享,稳步推动公共数据资源开放。同时,统筹规划大数据基础设施建设,推动制定公共信息资源保护和开放的制度性文件,并加强大数据标准化顶层设计,逐步完善标准体系。
在数据共享方面,贵阳大数据交易所已经做出成功的尝试。贵阳市政府有关人士表示,若想打通城市现存的信息壁垒,就要让城市多方资源联动起来,搭建城市数据共享的平台,从而激活大数据价值,充分发挥数据资源整合的优质效应,用信息化手段辅助科学决策。
潘文表示,国家层面应支持大数据共性关键技术研究,加强海量数据存储、数据清洗、数据分析发掘、数据可视化等领域关键技术攻关,并支持自然语言理解、机器学习、深度学习等人工智能技术创新。
记者注意到,在高端人才稀缺的现实情况下,目前国内企业多选择从海外和传统行业挖掘跨界人才,但仍然无法满足国内市场的大量需求。针对大数据人才供应不足的现象,各种培训机构和各大高校也开始强化大数据人才的培养。但培养大数据人才需要时间,短期内大数据领域的高端人才仍然会呈现供不应求的状态。
对于大数据人才建设,多位业内专家表示,应建立适应大数据发展需求的人才培养和评价机制,并建立健全多层次、多类型的大数据人才培养体系。同时,还要完善配套措施,培养大数据领域创新型领军人才,吸引海外大数据高层次人才来华就业、创业。
去年,教育部公布了第二批获准开设“数据科学与大数据技术”的高校名单,加上第一批获批的北京大学、对外经济贸易大学、中南大学,一共有35所高校获批开设该专业。今年开始,部分院校将招收第一届大数据专业本科生。
在行业应用方面,《大数据产业发展规划(2016—2020)》提出,到2020年,大数据相关产品和服务业务收入突破1万亿元,年均复合增长率保持30%左右,大数据在创新创业、政府管理和民生服务等方面广泛深入应用。未来如何在搜集、储存大数据的基础上更好地整合、分析和应用,将成为优化“数据大脑”的重点课题。
清华大学新闻与传播学院教授沈阳表示,目前国内的大数据应用侧重于数据收集,在基础统计分析、风险感知和预测方面还有较大提升空间。同时,也不能在尚未明晰具体业务应用场景的情况下盲目追求大数据,而要以应用场景为牵引,只汇集不分析或者片面追求大而全,都不利于大数据发挥其对生产力提升的促进作用。此外,在大数据广泛运用于创新创业、政府管理和民生服务等方面的同时,也应认识到,大数据对社会的冲击有多大,社会对于大数据发展的回应、规范和约束就应有多大。...
- ?
推动数据资源开放共享,可从哪里入手
妙之
展开
作者:上海社会科学院经济研究所副研究员 陈建华
日前,上海市委书记李强就学习贯彻习近平总书记关于推动长三角更高质量一体化发展的重要指示精神,接受媒体联合采访。他表示,我们计划打造“一个库”,让数据资源更管用。
推动数据资源的开放共享,对于长三角一体化发展有着重要的意义。这是因为,在数字化时代,数据共享共用乃至交易是长三角地区建立分工与协作关系的必要条件。就工作重点而言,需要找到切实有效的推进路径,具体可从两个方面入手:一是消除“数据孤岛”,二是促进数据增值。
消除“孤岛”,让数据连起来
现实中,政府掌握着大量的数据资源,拥有其他社会主体不可比拟的数据资源优势。然而,目前长三角地区的数据共通、共享与共用还存在较大的障碍,“数据孤岛”现象较为普遍。政府的职能部门,如市场监管局、技术监督局、税务局、人民银行、银监会、人力资源和社会保障局、科技局等部门之间的数据对接与共享还存在屏障。各个政府部门建设数据库所采用的技术、平台、标准和网络标准不一,导致许多数据不能共通。同时,政府面对市场主体的服务事项“一网通办”尚未全面形成。
在科技创新的数据资源方面,虽然高校、科研机构和企业之间科技数据“琳琅满目”,但可以利用的数据不多,数据的质量与对接性较差,数据信息没有得到有效整合。同时,长三角不同地区之间的数据共享、共用还存在各种区域性壁垒,数据“画地为牢”现象客观上依然存在。就连较为实用且能便利长三角民众生活的公交“一卡通”,也尚未完全“无缝衔接”。
对此,首要的是积极开放政府数据资源,提高政府职能部门之间、企业之间和具有不同创新资源的主体之间的数据共享广度,促进区域之内形成“数据共享池”。要改变政府职能部门“数据孤岛”现象,立足于数据资源的共享互换,设定相对明确数据标准,实现如市场监管局、技术监督局、税务局、人民银行、银监会、人力资源和社会保障局、科技局等部门之间的数据对接与共享,推进长三角地区在制度创新方面系统集成化,为科技创新提供必要条件。
同时,要促进准确及时的数据信息传递,提高部门条线管理、“一站式”企业网上办事和政府服务项目“一网通办”的网络信息功能,提高数据质量的可靠性、稳定性与权威性,促进数据能更多地反映内容,增加相关信息平台的使用覆盖面,让现存数据“连起来”“用起来”。
长三角地区要抓住大数据时代产业融合发展的机遇,积极有序地开放相关科技数据资源,如高新技术企业名录、技术交易数据、技术成果、新技术新产品、工程中心和重点实验室等数据,使科技数据和创新主体连起来,让企业、创业者和科研机构有机会把已有的科研成果用起来。
具体而言,一要进一步加强不同政府信息平台的部门连接性和数据反映能力的全面性。二要使得不同省市之间的数据实现对接与共享,解决数据“画地为牢”问题,实现数据在长三角地区共享共用。通过数据共享共用,打破长三角地区的行业、部门和区域条块分割状况,打破行业信息、政府部门和区域壁垒,冲破“画地为牢”与“数据孤岛”瓶颈,提高数据资源利用率,优化提高生产效率,推进制度创新与科技创新。
加工“原材料”,让数据用起来
真实、准确和高质量的数据,是长三角地区协同创新的必要条件。长三角地区聚集了大量的企业、银行和研发机构,拥有较多的专业服务机构,企业与社会的数据资源较为丰富。但除去“数据孤岛”弊端之外,长三角地区在数据加工、处理和提炼上还处于较低水平,交易较为粗放和简单,数据利用的广度、深度不足。
特别是,许多大数据交易以单纯的数据“原材料”买卖为主,数据交易过程中缺乏对数据定价的统一标准,部分交易数据存在格式不规范、内容不完整等问题。因此,不仅要加强数据的共享共用,而且要大力进行数据质量提升,使人们可以相对便利地从“数据共享池”中找到自己所需要的信息。
长三角地区应以丰富的数据资源为依托,加强数据二次开发和交易,加大对数据的采集、加工、清洗、存储、分析和应用,实现数据价值增值。要运用大数据技术,利用现有众多信息化平台的数据,促进整个行业形成产业集聚优势。通过规模效应与互补效应,提高数据的集成程度和利用效率,实现数据价值增值。
应以大数据二次开发和交易为基础,促进科技创新专业服务。准确的市场主体信息,能够促进贷款借贷双方的信息对称,为金融风险投资提供可资借鉴的研究报告。同时,以大数据分析为基础,还能推动在长三角地区推行跨省(市)账户开设和存贷款等相关金融服务。
通过数据的加工、清洗与交易,还能促进长三角地区科技创新的中介和评估服务业发展,进而形成全方位、多层次和市场化的科技创新中介和评估服务。
总之,长三角地区可以通过提高数据利用的广度、深度,整合地区和行业的数据信息,破除各种行业壁垒、区域壁垒,优化组合三省一市的科技创新资源,进而进一步发挥区域分工特色与整体效应。按照规划,下一步将联合建设长三角数据中心,把数据格式、口径、目录、接口等统一起来。一方面,要把各自的政务数据、行业数据、社会数据统一按标准进库。另一方面,要依托统一的数据共享平台,实现跨部门、跨省市共享应用。
来源:解放日报
- ?
专访任贤良:数据资源像石油 是一种战略资源
如许
展开
中国网络社会组织联合会最近颇受互联网圈关注。马云、马化腾、李彦宏等6位中国互联网的风云人物任职副会长,身后的企业整体市值数万亿……
作为这个联合会的首任会长——任贤良,从互联网行业的主管部门,到中国最大的互联网联合会,如何理解自己的新角色和新团队呢?5月29日,海外网在第三届海外华文新媒体高峰论坛上,专访了任贤良会长。
“深藏功与名”:联合会最大的权力是服务
海外网:中国网络社会组织联合会(以下简称联合会)从一成立就备受关注,我们总结了几个关键词,“中国首个由网络社会组织自愿结成的全国性组织”“全部由中国互联网领军人物组成的豪华副会长阵容”“入会组织的整体市值破万亿”等等,作为这个联合会的首任会长,对比之前的工作经历,您有什么不一样的体会?
任贤良:非常感谢网友对联合会成立的关注。确实,中国已经是世界互联网大国,我们的网民、网站、网络新媒体等等,都是排在世界数一数二的位置,我们现在有7.7亿网民,数字经济的发展去年年底达到了27万多亿,占到国内生产总值的三分之一。互联网近20年在中国的发展,在深刻影响、改变着我们的生产生活。
前不久,召开了全国网络安全和信息化会议,习近平总书记在这次会上提出了“五个明确”网络强国的战略思想。在5月9日,中国网络社会组织联合会成立,也是为了进一步在建设网络强国战略当中,去落实好习近平总书记网络强国的战略思想,此举得到了互联网企业、网络社会组织的积极响应。网络社会组织和网民、网络企业等等发展的非常快,网络社会组织已经有一千多家,联合会会员单位有300多家。
网民说我们是豪华阵容,联合会的副会长都是网络的大佬,包括BAT,包括中央主要的新闻网站。还有另一些网络社会组织,包括中国互联网协会、中国互联网金融协会等等。联合会的成立是顺应国家互联网发展的大趋势,当好党和政府的助手,延长政府管理的手臂,才成立了这样一个联合型的、枢纽型的、全国性的非盈利联合会。
作为联合会的首任会长,我深感责任重大、使命光荣。从2013年中央网信办成立以来,到去年的12月,我一直在国家互联网办公室担任领导职务。去年两会召开以后,我到了全国人大新组建的社会建设委员会工作,社会建设委员会是人大这一次机构改革新成立的专门委员会,也是为了和总书记提出的政治、经济、社会、文化、生态“五位一体”的思想相一致。现在一切都在网络化,互联网成为我们整个国家治理能力和治理体系现代化非常重要的一个方面。
联合会不是一个权威机关,它的最大权力就是服务,就是给互联网企业、给网民、给网络社会组织搞好服务。一方面把党和政府的声音能够很好的、及时的、全面的、准确的传递给这些互联网;另一方面,也反映好网络社会组织、互联网企业的心声,为他们牵线搭桥,急他们所急,想他们所想,为他们提供更好的服务,助推网络强国战略的落实和推进。和我过去在党和政府部门工作做领导相比,到了联合会有很大不同。联合会不会像国外的非政府组织(NGO),我们不需要去和这些互联网企业、社会组织去争名夺利,我们主要是更好地围绕党和政府的中心工作,服务大局,给网络企业提供牵线搭桥、搞好服务。
在信息送达率层面 手机已远超纸媒电视
海外网:您非常了解中国互联网行业,能否给我们的海外华文媒体支支招,如何在新媒体时代发展壮大?联合会是否会考虑这些海外组织的入会?
任贤良:这次我来出席第三届海外华文新媒体高峰论坛,是一个很好的学习机会。因为无论是海外华文媒体,还是国内的主流媒体、传统媒体,都面临怎么样和新媒体深入融合的课题。
在以互联网为标志的信息爆炸时代,必须适应新媒体新的传播格局的变化,再不能固守一些传播的方式。我知道很多海外华文媒体还是传统媒体,在目前互联网高度发达的形势下,还是因循守旧,再去搞这些老的传播形式,跟不上新的时代发展变化,跟不上新的技术变革,那就会被淘汰。
在技术冲击面前,还是要坚持内容为王,要坚持正确的价值取向,去做好相关的内容。同时得跟上技术发展的变化,要解决好送达率,送达的同时还要讲究阅读,阅读完了最终还有一个点赞。一个小小的手机屏,现在是送达率最高、最好的,据有关机构的统计表明,人们通过“两微一端”在阅读新闻的,达到了41.7%这样高的比率,而在传统媒体只有20%左右,通过纸质的媒体、通过广播电视来浏览新闻、获取新闻信息的非常少,特别是对年轻人更是如此。海外华文媒体要看到这种变化,跟上新媒体发展的步伐。
对海外华文媒体,联合会愿意搭建平台,去促进它们和国内新媒体,和我们的会员单位之间交流、合作。从谋划来讲,联合会主要针对国内互联网企业,对于海外华文媒体作为会员单位,从目前来讲,我们还没有这方面的考虑。
数据资源像石油 是一种战略资源
海外网:网络安全在这个万物互联的时代变得越来越重要,联合会将阿里巴巴、腾讯、京东、百度等几大互联网企业聚集,这些公司掌握了数亿网民的各项数据。在网络安全层面,联合会有什么举措来规范、监督这些企业的网络安全建设吗?
任贤良:这是联合会成立以后的一项重要建设内容。目前,互联网存储技术、计算技术、大数据、云计算不断发展,对于这些巨无霸企业,它们掌握的大数据资源是海量的。今后,企业与企业之间的竞争,国家与国家的竞争,主要是看拥有的数据资源。过去在工业化时代,更多是看你拥有的石油、能源等等资源,现在真正国与国之间的竞争,其实很多是数据资源的竞争,它是一种战略资源。
在这种竞争当中,大数据不断被挖掘,怎样确保数据安全,越来越引起大家重视。因为这不光关系到个人的生命财产安全,甚至关系到一个国家的政治安全、意识形态安全、国家安全。在搜集大数据时怎么样去尊重网民的个人隐私,遵守国家需要的一些数据的安全要求,这对互联网企业,同时对网民也提出了相应的要求。
当然,一方面我们要加强网络安全教育,另一方面确实也要制定相应的法律,比如,2016年6月1日《网络安全法》实施。此外,作为社会建设委员会的副主任委员参加全国两会时,我注意到全国人大代表也有很多的呼吁,就是要加强大数据的安全,提出要进一步推进这方面的立法。
欧洲出台了最严格的关于数据安全的立法,在制定法律的同时,我们还要加强社会的监督、行业的自律。要求企业给网民搭建平台的同时,也要使网民的数据在充分有序流动时确保安全。
虽然刚刚成立,但这已是联合会的一项重要工作内容。
谈中兴事件:要下大力气摆脱被人“卡脖子”的状况
海外网:诚如您说,当前国际的竞争很大程度上是数据的竞争,那么中国互联网想要领跑世界,还需要在哪些方面进行改进?
任贤良:以我们的2G、3G、4G来说,2G、3G的时候是跟跑,4G的时候是并跑,到5G的时候我们可能会领跑。在移动互联网的发展方面,我们确实享受了网民多的红利,7亿多网民,是世界上最多的。因为大家用的多,发现的问题就多,反馈、改进、提高的就多、就快。同样一项技术,网民使用规模的不同,那么数量就完全不一样,改进、提高就大大不同。
这20多年的时间,中国互联网的发展不仅体现在规模上,也体现在质量上,比如我们的超算、量子计算等等,都有很闪亮的突破。但我们在核心技术、关键设备上,以及整个的网络技术生态、体系上,同美国还有一定的差距。前一段时间“中兴事件”,在互联网业界、网民中产生了很大的关注度。正如总书记所说,核心技术是花钱买不来的,是市场换不来的,我们必须做好。特别是核心的芯片技术,我们现在只能规模生产28纳米,国外已经是10纳米和7纳米。有一些东西我们可以设计,但是要真正量化、量产,要有整个的体系来支撑它。
我们还是要加强自主研发,走自主可控的道路,这不仅涉及到经济安全、国防安全,更涉及到国家安全。在驱动整个经济发展中,以信息化来带动现代化上,要做不同的创新,来摆脱受制于人、被别人“卡着脖子”的状况。同时,这样也能够推动改革发展,实现中华民族伟大复兴:通过跟跑、并跑,到创新、实现领跑,在核心技术方面要加大攻关、实现突破,需要下大力气去推动。
多知道点儿:
第三届海外华文新媒体高峰论坛
5月29日,第三届海外华文新媒体高峰论坛在浙江杭州隆重召开。来自全球53个国家和地区的165家海外华文媒体负责人、知名侨领和专家学者逾300人参加论坛。
本届论坛由人民日报社、浙江省人民政府指导,人民日报海外版、杭州市人民政府主办,人民日报海外网、杭州市人民政府外事侨务办公室、中共杭州市委对外宣传办公室承办。
中国网络社会组织联合会
中国网络社会组织联合会5月9日在京成立,任贤良当选为会长,马云、马化腾、刘强东、田舒斌、李彦宏、叶蓁蓁等14人当选为副会长。
当选中国网络社会组织联合会副会长的6人,均为国内互联网行业的头面人物。其中,马云是阿里巴巴集团主要创始人,现担任阿里巴巴集团董事局主席;马化腾是腾讯公司主要创办人之一,现任腾讯公司控股董事会主席兼首席执行官;刘强东现任京东集团董事局主席兼执行官;田舒斌现任新华网股份有限公司党委书记、董事长、总裁;李彦宏是百度公司创始人,现任百度公司董事长兼首席执行官;叶蓁蓁现任人民网总裁。
- ?
大数据资源需求爆发,商业模式需创新——数企BDSaaS
狄丹琴
展开
大数据是什么?投资者眼里是金光闪闪的两个字:资产。比如Facebook上市时,评估机构评定的有效资产中大部分都是其社交网站上的数据;滴滴出行的市场份额能够长期保持,背后也是大数据在发力。
互联网信息化时代,数据资源被越来越多的企业和机构所重视并利用,大数据概念在资本市场上也被炒得如火如荼。越来越多的市场主体期望通过大数据资源来改善经营,开创愈益广阔的新天地,为顺应这一趋势,北京、上海、贵州等地都积极布局大数据交易平台,数据交易日趋活跃,数据库的体量也日益庞大。
八度云计算创始人刘传勇曾公开表示大数据的真谛不在于“大”,而在于“有用”。如果把大数据比作一种产业,那么这种产业实现盈利的关键,在于提高对数据的“加工能力”,通过“加工”实现数据的“增值”。大数据正在“化大为小”,变身一个个APP软件,通过一部智能终端就可以实现对数据的掌控和利用。大数据不仅和人们衣食住行联系的越来越紧密,与企业发展也息息相关。
近年来,随着网络技术的发展,人们的生活逐渐全面向互联网和移动互联网转移,在互联网里,我们面对的、可获取的信息(如商品、资讯、服务)成指数式增长。一部分企业便学会了在巨大的数据库里筛选出其所需要的用户信息,对用户进行数据化“建模画像”,达到精准营销的目的。
据一位技术研发经理透露,其自己所在的网站也会给用户进行“画像”,根据用户信息、订单、行为等等推测出其喜好,再针对性地给出产品,可以极大地提升用户体验。用户画像维度包含多方面,包括:用户个人资料、会员等级、行为、订单特征、其社交网站信息、搜索网站搜索信息、职场网站信息、内部客服信息等。根据大数据分析手段,企业不仅能够针对客户的需求、性别、年龄、消费能力、喜好等标签信息来给予不同的“定制化”服务,甚至还可以根据用户群体的定位来制定不同的定价策略。而所有的这一切,都必须靠数据化技术处理手段来实现。
随着计算机技术的发展,数据量日益增长,现有技术也很难满足业务的发展需求。一方面,尽管市面上企业管理软件层出不穷,但在功能配置上,很多软件都很单一;另一方面,企业在信息化的过程中会根据自身的需求构建各种软件系统,如:OA、CRM、ERP、订单系统、采购系统、库存管理、财务系统等,但软件系统很难做到完全由一家供应商提供,企业也无法在多个系统之间进行数据传递和共享,比如无法从CRM里访问订单数据、无法从OA里访问企业采购数据等,企业各渠道数据信息不共通,形成一个个的“数据孤岛”现象。加之移动端的进一步发展,现有技术也很难满足企业移动办公及数据化分析的多方面管理需求。
为了保证数据的准确性和流动性、同时减少企业维护的工作量,提高企业工作效率,企业迫切需要一项新的软件来做系统集成和整合,把企业各渠道的数据信息整合到一个平台中进行管理和维护。
比如深圳市八度云计算研发的数企BDSaaS企业数据化管理系统,数企BDSaaS系统包含了产品管理、营销管理、客户管理、订单管理及移动办公协同五大子系统,五大子系统里分管采购系统、财务系统、产品库存系统等,五大板块共同促成企业大数据生态闭环,帮助企业实现数据采集,数据存储,数据分析及数据应用。助力企业打破信息孤岛,促使企业内外数据、线上线下数据融合产生化学反应,帮助企业达成数据可视化分析。从内部管理来说,企业通过这些数据可以更加系统化的管理企业,比如洞察员工动态,评估员工的工作能力;从经营业务上来说,企业可以通过数据分析提高管理手段,降低经营成本、洞察客户需求,锁定客户资源、制定精准营销策略等。
移动信息互联时代,大数据资源是一座“富矿”,开掘好了,无疑能使企业发展如虎添翼。当下,正是数据信息高速井喷的巅峰时代,依据传统的人工统计或简单的机器处理不仅耗费企业财力与精力,而且很难让企业数据流通起来。笔者认为,对于企业来说,借助数据化管理软件将企业线上与线下各渠道数据全打通才是关键。
- ?
论大数据的资源管理和调度
红孩儿
展开
互联网公司往往会有各种类型的工作任务,比如有对外提供的各种服务,也有内部的挖掘与数据管理系统。即使是内部数据系统也可能需要多种不同类型的计算系统:适应实时计算的挖掘系统、适合交互杳询场景的系统或者典型的批处理任务。面对多种各具特性的计算系统与框架,比较传统的资源管理方式采用的是静态资源划分方法,即将集群中的所有资源做出静态划分,将划分后的固定的硬件资源指定给固定的计算框架使用,各个框架之间各行其是,互不干扰。
静态资源划分方法是一种非常简便易行的资源管理方式,但是很明显资源的整体利用率不高,经常会出现集群中有些计算系统资源不足,但是有些计算系统存在大量闲置资源的情形。如何设计出好的资源管理与调度的策略和方法,使得整个集群的大量资源在能够实现更高资源利用率的同时加快所有计算任务的整体完成速度,这就是集群资源管理与调度系统的核心目标。
采用独立的资源管理与调度系统有以下好处。
1)集群整体资源利用率高。由于所有资源统一管理与调度,可以根据不同计算任务的及时需要动态分配资源,所以不会出现资源闲而不用。
2)可增加数据共享能力。
3)支持多类型计算框架和多版本计算框架。
一:资源管理抽象模型
模型主要强调三个要素
1)资源组织模型。主要是将集群中当前可用的各种资源采用一定的方式组织起来,以方便后续的资源分配过程。例如将资源组织成多层级队列的方式。
2)调度策略。负责以一定方式将资源分配给提交到系统的任务,常见的调度策略包括FIFO,公平调度,能力调度,延迟调度等。
3)任务组织模型。主要是将多用户提交的多任务通过一定方式组织起来,以方便后续资源分配。
二:设计方法
1)考虑到资源的异质性。比如数据中心的机器很难保证采用完全相同的配置,总会有机器高配置,也会有低配硬件。在做资源分配的时候,必须要考虑这种硬件的资源差异性,一般通过将资源分配单位细粒度划分为较小单元来解决这个问题
2)考虑到数据局部性。因为海量数据分布在大规模集群的不同机器中,如果移动数据会产生大量低效的数据网络传输开销,而计算代码相比而言数量小得多,所以移动计算代码到数据所在地而非移动数据,这一般称为“数据局部性”。
3)抢占式调度和非抢占式调度
4)资源分配粒度。大数据场景下的计算任务往往由两层结构构成:作业级和任务级。一个作业由多个并发的任务构成,任务之间的依赖关系往往形成有向无环图。一般分为全量分配资源和增量分配资源(分配部分资源就可以运行,随着空闲资源的不断出现,可以逐步分配给其他任务以维持运行)。MapReduce的批处理任务就采用了增量分配资源的策略。
5)资源隔离方法。目前对于资源隔离最常用的手段是Linux容器。YARN和Mesos都采用了这种方式。通过隔离可以用来进行资源和进行运行的隔离。
三:资源管理与调度系统范型
目前主要分为三种范型
1)集中式调度器:整个系统中只运行一个全局的中央调度器实例,所有之上的框架或者计算任务的资源请求全部经由中央调度器来满足,因此,整个调度系统缺乏并发性且所有调度逻辑全部由中央调度器来实现。
2)两级调度器:两级调度器将整个系统的调度工作分为两个级别:中央调度器和框架调度器。中央调度器可以看到集群中所有机器的可用资源并管理其状态,它可以按照一定策略将集群中的所有资源分配各个计算框架,中央调度器级别的资源调度是一种粗粒度的资源调度方式,各个计算框架在接收到所需资源后,可以根据自身计算任务的特性,使用自身的调度策略来进一步细粒度地分配从中央调度器获得的各种资源。
3)状态共享调度器:每个计算框架可以看到整个集群的所有资源,并采用互相竞争的方式去获取自己的资源,根据自身特性采取不同的调度策略,同时系统采用了乐观并发控制手段解决不同框架在资源竞争过程中出现的需求冲突。
- ?
大数据分析需要五大基本资源!
翟大有
展开
在网络,移动设备,传感器,社交媒体,交易应用程序,日志文件,大数据等实时数据泛滥的情况下,发现了大量垂直市场应用程序,从诈骗检测到科学研究。无论涉及重大隐私问题或企业困难的挑战如何,仅在2017年,大数据投资就获得超过570亿美元的增长势头。预计未来三年的投资将以约10%的年增长率进行增长。
大数据分析所需的基本资源
大数据咨询已成为软件开发服务提供商的可行选择。无论是营销还是品牌实施的新产品,公司都不会轻易作出决定。当提到任何重大举措时,企业都会寻找他们客户提供的数据,以确保公司正朝着观众遵循的方向发展。
从点击流数据到购物车上的信息,都有大量的材料需要筛选,这就是为什么企业支付高价值的大数据咨询服务才能理解这一切。对于新职业市场的人来说,大数据分析是一个不错的选择。 当然,必须熟悉开始处理数字所需的技能和工具。
大数据分析所需的五个资源如下:
1.完成MATLAB Mastery Bundle
MATLAB或Matrix是一个多范型数字计算空间和编程语言。用外行人的话来说,它是一种工具,它使得编写代码,运行脚本以及执行数据分析和可视化等任务变得轻松易懂,从而解决复杂问题,而这些代码还不那么复杂。
2. Python Power Code BONUS Bundle
市场上有许多重要的编程语言可供选择,数据分析师使用其日常任务和职责中的很多。但是,如果有人要先学习,那就是Python。 Python语言被誉为用户友好型以及直观性。此外,它拥有众多的功能,这使它能够处理数据争夺。 70小时的培训通过展示如何下载,提取,清理,汇总,分析和可视化数据,开始了编程教育。
3.大数据和分析主工具包
数据分析师和高级分析咨询人员使用大量的语言和工具来获取角色,这并不足为奇。这四个模块集合为数据库添加了四个重要的分析工具,即Minitab,SPSS,SAS和R Studio。
4.使用Tableau Desktop 9 Bundle进行数据可视化
通过交互式仪表板分析和呈现数据以完全挖掘信息的主要工具之一是Tableau 9.这个收集将使您了解Tableau。因此,可以开始创建自己的可视化数据。
5.完整介绍R编程包
R的核心是一种统计编程语言,它非常适合挖掘和分析数据。但是,它也具有高级图形和机器学习功能,在数据可视化和集成复杂算法方面提供了一些独特的优势。在五门课程和三本电子书中,收集指导通过要点使用R来充分发挥潜力。
大数据优势
大数据应用程序可让数据科学家,统计人员和其他分析专业人员分析越来越多的结构化数据以及其他形式的数据,而这些数据往往不被传统的商业情报和分析程序所利用。这涵盖了非结构化和半结构化数据的组合,例如互联网点击流数据,网络服务器日志以及来自客户电子邮件的文本,机器数据,社交媒体内容和通过连接的传感器到事物互联网的呼叫细节记录。
在更大的范围内,数据分析技术迎合数据集分析的手段,并最终帮助企业做出充分知情的决策。商业智能查询回答关于业务绩效和操作的基本查询。大数据是一种高级分析,涉及复杂的应用程序元素,如预测模型,统计算法等。
用数据咨询创造新的增长机会
数据分析可以创造大量新的增长机会。此外,它甚至可能会产生一个新的业务类别,例如分析和汇总行业数据的类别。大多数企业将处于大量关于服务和产品,供应商和买家,消费者偏好和意图以及更多信息流的信息中。
各行各业的企业都应该开始大力创造数据功能。除了广泛的数据外,数据的高频率和实时性也是至关重要的。通过数据分析,实践被更广泛地使用。
今天的大数据和分析应用市场真是巨大。世界各地的软件开发服务提供商提供了大量的数据咨询工作。现在,大数据体验意味着更有可能从软件开发组织获得有利可图的工作。市场很大,有一系列的项目,交易,服务和合作关系。咨询服务可能会有所不同,具体取决于组织的特定要求,以及需要利用数据分析和解决方案的功能,这些功能可以简化业务流程。
- ?
加强人文社科数据资源建设与管理
平复
展开
编者按
当前,大数据发展日新月异,随着信息技术和人类生产生活交汇融合,互联网快速普及,全球数据呈现爆发增长、海量集聚的特点,对经济发展、社会治理、人民生活等产生了重大影响。
习近平总书记强调,“要运用大数据提升国家治理现代化水平”“善于获取数据、分析数据、运用数据,是领导干部做好工作的基本功”。本版特推出专题,就如何发挥大数据在人文社会科学研究、新型智库建设等方面的作用展开讨论。
作者:王晓光(武汉大学信息管理学院教授、教育部人文社科重点研究基地武汉大学信息资源研究中心副主任)
近年来,全球范围内掀起一场新的数字革命,人类步入大数据时代。数据正在成为人类社会最重要的资源和资产。大数据给人类社会的各个方面都带来了巨大变化,特别是在科研领域,大数据及其分析工具正在成为人类认识世界和改造世界的重要手段。然而,与自然科学领域相比,人文社科领域对数据资源的使用相对滞后。此前的社会科学研究虽然使用数据,但多数都是小规模抽样数据,而非海量或全量数据。随着社会数字化转型不断深入,数据资源在人文社科研究中的地位不断提升,人文社科研究范式和研究问题发生变革。如何加强人文社科数据资源建设与规范管理,以适应科研数字化转型这一趋势,成为当下值得研究并解决的一大问题。
5月26日,中国国际大数据产业博览会会场外的大数据标识。新华社发
人文社科数据资源建设勃然兴起
与文献信息一样,数据也是学术研究的基础性资源。2009年以来,我国人文社科领域数据资源建设开始加速。人文社科类基金资助的数据资源建设类科研项目也开始直线增长。统计显示,党的十八大以来,与数据资源建设相关的国家社科基金重点和重大项目数量有了显著增长。2017年,国家社科基金重大招标项目中,与数据资源建设有关的,数量更是可观。这些项目主要集中在语言学、历史学、文学、图书情报学等学科,从地域看,主要集中于北京、上海、广东、江苏、浙江等地区。近两年,在专题数据资源快速增长的同时,国内实力领先的研究型高校也纷纷开始建设人文社科数据中心或数据平台,以支撑人文社科研究范式的创新与转型,如清华大学中国经济社会数据中心、北京大学开放研究数据平台、复旦大学社会科学数据平台等。
蓬勃发展的人文社科数据资源建设,昭示着我国人文社科领域的基础研究环境和组织架构都在向数字化方向转型,数据驱动的研究范式正在人文社科领域悄然兴起。伴随此范式的兴起,人文社科领域的开放思维、计算思维、量化思维、协同思维也更加受到学者重视,由此推动了文学领域的大尺度宏观研究、历史领域的长程量化研究、艺术领域的视觉计算研究、文化领域的时空可视化研究等的出现。这些新兴的研究课题都离不开强大的专题数据库和计算平台作保障。人文社科领域的可计算数据资源正伴随数字人文和计算社会科学的发展而发挥着越来越大的学术价值。
诸多不足制约人文社科数据资源建设
数据库建设过程不规范,系统平台可用性不强。目前,很多人文社科数据资源建设都由重大科研项目驱动,有一定的项目实施周期。在现有学术评价体系下,传统的印刷出版物,如专著和论文,是科研成果的首选形式,所以在项目实施过程中,学术研究是核心,这就导致项目团队以项目结题为目标,不太重视数据库建设的规范性和长期性。很多数据库系统选型落后,数据服务平台功能单一,检索效率低下,不支持机器读取和原始下载,系统平台整体上可用性较差,难以满足项目之外用户的实用性需求。
数据资源质量控制不严格,内容可信性较弱。与自然科学类数据相比,人文社科类数据的生命周期较长,史料价值突出,后世使用概率高,所以质量要求更高。然而,由于人文社科领域数据来源广泛,既包括互联网上的用户行为数据,又包括结构化行业统计数据,还有从传统书报刊中抽取的非结构化文本片段,数据模型的差异极大。在数据库设计过程中,由于懂专业领域又懂数据库设计的复合型人才稀少,很多专题数据库的结构设计相当随意,结构十分不规范,常常不合乎数据库设计范式要求。在数据库内容采集过程中,往往也缺少质量控制标准和规范,导致数据内容的可信性与可靠性得不到保障。
数据发布标准不统一,流通共享成本高。数据的自由流通和共建共享是发挥数据资源价值的关键。目前,人文社科数据资源主要由各领域的学术机构自主分散建设,缺乏像图书馆联盟一样的第三方机构进行技术协调。建成以后的数据库在互联网上也是自由发布,标准不一,普遍缺乏便于机器读取和交互操作的数据接口。用户无法查看其详细的数据结构,更无法通过关联数据的方式相互共享链接,由此导致数据难以跨域流通和自动汇聚,语义数据网络也无法通过自动勾连的方式构建和使用。
关键数据资源缺乏界定,数据主权难有保障。随着大数据、物联网和数字中国建设的推进,人文社科领域的数据资源将逐渐从调查获取和人为发布向感知获取与自动发布转换,例如社交媒体数据、金融系统数据、用户隐私数据、商品流通数据等都可以借助网络媒体系统、电子政务系统、电子商务系统,以及日益强大的智慧城市基础运营设施自动获取。这些数据资源中有些属于“关键数据资源”,不仅涉及个人隐私,对于国家数据主权和国家总体安全也有潜在影响,不能随意流通和跨境传输。目前,人文社科领域还没有针对“关键数据资源”的清晰定义,但其潜在安全问题正随着数据资源的快速增长而浮现,有必要未雨绸缪、厘清概念。
提升人文社科数据资源管理规范性的对策建议
发布数据资源建设规范,指导数据资源建设过程。数据资源建设类似于软件开发,过程控制是关键。有必要研究并发布人文社科数据资源建设规范,包括数据资源分类与格式规范、数据资源建设机构资质要求、数据库系统选型要求、内容维护规范和网络发布标准等内容,对人文社科各领域专题数据库和数据平台建设进行全流程指导。
建立数据资源评估标准,保障数据内容质量。对不同领域和不同类型的数据资源制定详细的评估标准,核心是质量评估和价值评估。对不同形式的数据资源进行专家与机器相结合的、传统科学计量与新兴网络计量相结合的评估。将评估结果作为各类数据资源建设项目资助、实施和验收的必要条件,保障人文社科数据资源高质量建设与运营。
探索数据资源长效维护机制,实现数据服务可持续发展。鉴于数据资源运营的高成本特征,有必要探索建立学术机构与出版机构、图书馆机构、数据服务公司联合运营与维护的长效合作机制,通过政府资助、商业销售、托管服务等多种手段实现人文社科数据资源的可持续发展与运营,避免数据资源因为有建设、无服务而“昙花一现”。
建立数据资源管理联盟,促进数据资源开放共享。参照中国高等教育文献保障系统(CALIS),建立数据资源管理联盟。以“智慧数据”的理念,开展数据模型技术研究、数据模型技术应用宣传和培训。鼓励数据资源建设主体利用开放关联数据、知识图谱、简单知识组织系统等新兴语义技术和标准进行数据资源的语义化和关联化发布,整体上提升人文社科数据资源的智慧层次和开放共享水平。
设立数据资源建设专项基金,加大数据资源资助力度。设立国家级、省部级的人文社科数据资源建设专项基金,通过稳定的项目资金支持,提高人文社科数据资源供给水平。在政府相关部门设立专门的全国高校数据资源管理办公室,统筹管理人文社科数据资源建设。
建立数据汇交制度,构建全国统一的人文社科数据资源门户。将公开发布的数据库视为一种正式出版物,建立数据汇交制度和全国统一的人文社科数据资源门户,定期采集各数据库目录数据或原始数据,并进行评估和长期保存。开展数据资源和数据分析工具的应用培训和宣传,推动人文社科领域数据驱动的研究范式发展。
建立“关键数据资源”管控机制,提高数据主权意识。参照出版领域的重大选题审批制度,对有重大社会影响的“关键数据资源”,如哲学、政治、经济、历史、法律等领域的特定主题数据建立分类、公示、审批与审读制度。对“关键数据资源”的流通实施白名单管理,严格控制“关键数据资源”的跨境流通,保障我国的数据主权安全。
《光明日报》( 2018年07月05日 11版)
来源:光明网-《光明日报》
- ?
让数据资源流动和利用起来
阎霆
展开
作者:华东师范大学公共管理学院 聂磊 许多
习近平总书记日前强调,要以推行电子政务、建设智慧城市等为抓手,以数据集中和共享为途径,推动技术融合、业务融合、数据融合,打通信息壁垒,形成覆盖全国、统筹利用、统一接入的数据共享大平台,构建全国信息资源共享体系,实现跨层级、跨地域、跨系统、跨部门、跨业务的协同管理和服务。政府部门作为最大的数据生产者和收集者,掌握着社会绝大部分数据。这些数据不仅有利于政府制定政策、提供公共服务,而且可以促进公民、企业以及其他组织和团体参与公共事务、开发新产品、提供创新服务。《国务院关于印发促进大数据发展行动纲要的通知》明确要求,2018年构建跨部门的政府数据统一共享交换平台,中央政府层面实现数据统一共享交换平台的全覆盖。
要通过数据开放,让数据流动和利用起来,以此推动经济和社会的发展,促进经济增长和社会治理由粗放型向精细型转变升级。要打破“信息壁垒”和“信息孤岛”,安全整合与安全共享数据资源。
具体而言,应出台完善政府大数据使用规则,协调数据端口协议、统一数据输出标准、建立数据共享平台,将各级政府机构的数据库联动起来,保障数据的顺畅调配与整合。尤其是,要从全流程角度综合配置公共服务资源,实现一站式公共服务,让百姓少跑腿、数据多跑路,不断提升公共服务均等化、普惠化和便捷化水平。
同时,还需利用好企业的数据资源。要加强政企合作、多方参与,加快公共服务领域数据集中和共享。对企业数据的利用,应切实保障企业的数据所有权,鼓励企业进行数据资源开发与创新。涉及政府治理的数据资源,应与企业签订合作协议,发挥企业的专长和优势,从而最大限度地实现大数据在满足百姓公共服务需求方面的作用。
充分挖掘并释放数据价值,还离不开公众的深度参与和利用。从价值共创逻辑来看,政府为消费者提供数据服务和产品,而公众作为消费者参与数据的生产过程中,将有助于挖掘和释放政府数据的附加价值,激发公众和企业的创意与智慧,进而获得有巨大潜力或影响力的数据产品和服务。
2009年以来,一些国家围绕政府数据的利用举行竞赛。参赛者包括软件开发者、网页设计师、学者、活动家、教育工作者、学生和新闻工作者,他们都对数据科学有着浓厚的兴趣。以美国纽约市的竞赛为例,它以需求与问题为导向,通过开发技术产品解决纽约民众遇到的问题,涉及就业和经济的流动性、清洁能源和环境、终身学习和健康生活等领域。
上海开放数据创新应用大赛是国内有着较大影响力的数据开发应用竞赛。2015年,该项竞赛将庞大的交通大数据向公众开放,征集改善城市交通、方便民众出行、创新商业模式的应用程序与解决方案,吸引了近3000名选手参加,包括软件工程师、数据分析师、管理咨询师、设计师以及在校学生。
国内外实践表明,借助民众的力量对政府数据进行开发和应用,会创造出更多有价值的服务。更重要的是,通过全社会对数据的再利用,可以创造出新的公共价值、激活社会创新,最大程度地释放数据红利。
从目前政府数据的社会化开发和应用现状来看,总体上社会关注度有限,数据应用度有限,参与度也有限。为更好地适应大数据时代政府治理与公共服务的需求,需要明确以下几个原则:
首先,政策法规是基础保障。对数据共享及开发应用既能起到规范的作用,也可以起到保驾护航的作用,确保其发展沿着既定方向发挥价值和作用。新形势下,有必要在政策法规框架下探索科学的管理方法与机制,厘清数据开发应用过程中的责权利关系以及实施程序。
其次,重视大数据人才培养和技术创新。人才素质、人才数量直接关系数据价值的挖掘和使用效果,进而会影响大数据时代公共服务的质量。很大程度上说,拥有一批具有大数据思维和专业知识的高素质人才队伍,是实现大数据战略的重要保障。
最后,构建有利于政府数据开发利用的孵化环境。虽然与政府数据相关的创新创业项目具有潜在的经济收益,但要想在复杂的商业和市场环境下健康成长,仍需要良好的孵化环境支持。
例如,英国政府专门建立开放数据研究所,积极介入大数据技术领域并给予适当的资金资助。在中国,贵州贵阳市政府通过建立交通大数据孵化器,搭建了集数据、计算、商务为一体的创业孵化平台,为创客研发和设计产品提供计算、存储和网络等资源。
可见,各国各地政府都在通过多种途径培育数据开发应用的孵化环境。下一步,有必要对探索成效进行量化比较,进而推动政策的完善、深化。
来源:解放日报
- ?
一起学大数据|最详细的大数据资源教程,呕心沥血全部分享
庾天亦
展开
跟大家已经分享了这么长时间的大数据文章了,我们的一起来学大数据系列已经将Java和Linux全部做了一次基础的分享。今天,我把我整理的全套大数据资源分享给大家,一起共同学习,记得关注呦。
Java基础
java是大数据的铺垫,是我们学习大数据之前必要的一门必修课。之前我也给大家介绍了一篇文章,就是将为什么要在学大数据之前学习java。
这里是我们Java基础的部分资源。
JavaWeb
web在大数据的可视化中起到了举足轻重的作用,我们分析的数据是干巴巴的,在没有可视化之前。通过JavaWeb的简单学习,我们可以了解前端的一些知识点。
准确的讲我们学习大数据的主要负责的是后台的运行,前端的东西交给前端工程师即可,所以这里我们并不需要学习太深,而且前端东西也比较杂碎,不如花更多的时间去学习我们下面的视频。
三大框架
到这里,我们就进去的java更高一级的学习,通过框架的学习,我们可以达到企业级应用的简单开发。
Linux
linux是大数据的入门基础,在这里我们会学习linux系统的中的详细命令,以及如何去搭建大数据环境的集群,shell编程等等。我们从这里走进大数据的学习。
Hadoop
当数据分析面对的是海量(1T以上)的数据时,普通技术手段难以胜任,就需要更强大的技术手段来实现。
大数据技术的核心,其实就是解决海量数据场景下的数据存储和运算问题;而海量数据场景下的数据存储和运算的核心技术又是:分布式技术。
Scala
Scala是一种多范式的编程语言,类似java的编程语言,集成面向对象编程和函数式编程的各种特性,而且无缝地结合了命令式编程和函数式编程风格。通过学习Scala语言,我们为下面的spark的学习做铺垫。
Spark
Spark 是研发师专门为庞大海量数据处理而设计的快速通用的计算引擎,其是在 Scala 语言中实现的,spark将 Scala 用作其应用程序框架。与 Hadoop 不同,Spark 和 Scala 能够紧密集成,其中的 Scala 可以像操作本地集合对象一样轻松地操作分布式数据集。
上面就是对大数据视频的一些简单的分析,通过这些的学习大家能够基本掌握大数据的内容,最后想成为真正的大师还要勤加练习。
这么多视频也是够大家学习一段时间的了。之后,我还会继续更新文章,大家记得关注哟~
获取方式
1.首先右上角点击【关注】,关注我的百家号~
2、私信我:大数据
明天我单独给发给大家,耐心等待有~如果觉得资源不错,请给个好评,谢谢各位了,来个转发、收藏哦!
感谢坚持关注的朋友~
世界很大,幸好有你~
欢迎在评论区留下你的问题或困惑,我将每天与你分享我的观点和心得。
聚焦最新科技咨讯,探寻未来智能领域,我是女陶Mario
数据资源
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并