中企动力 > 商学院 > 人工数据采集
  • ?

    大数据AI监控系统数据采集流程

    安白

    展开

    随着大数据应用的不断发展和成熟,一些监控系统企业已收获可观的回报。近来,大数据的处理更是发展到了一个更高的新水平,即人工智能(AI)平台的形式。AI平台预计将在未来十年产生重大影响(或颠覆)。在各种技术中,人工智能用于处理海量数据集将前所未有地提升商业智能和分析。

    AI智能机器学习是运用算法来分析数据,并从中学习和做出预测。算法包括决策树学习、聚类、强化学习和归纳逻辑编程。

    人工智能和机器学习现在主要用作研究和网络活动的个人助理,以及完成诸如接电话、做销售预测和驾驶车辆之类的任务。这些技术综合在一个AI平台中时,将显示出巨大的应用前景

    AI平台是一种比传统框架更高效、更智能化的框架。设计得好的话,它可为组织或监控系统企业提供与数据科学家和员工更快、更高效和更有效的协作。它可以帮助以多种方式降低成本——防止重复工作、使简单任务自动化,以及消除一些费用昂贵的活动,例如复制或提取数据等。AI平台还可以提供数据治理,确保由AI科学家和ML工程师组成的团队的最佳实践应用。它还可以帮助确保工作更均匀地分配、更快地完成。

    AI平台一般将其要素组织成五个逻辑层:

    数据和集成层提供对数据的访问。这种访问是至关重要的,因为开发人员不手工编写规则,相反,规则是由AI运用它所访问的数据进行“学习”的。

    实验层允许数据科学家开发、测试和证明假设。设计良好的实验层将提供自动化的特征工程、特征选择和模型选择。

    操作和部署层提供模型治理和部署。正是在这里对模型进行风险评估,允许模型治理团队验证它。这一层提供了跨平台部署各种容器化模型和组件的管理工具。

    智能层提供对人工智能工作的支持(培训活动在实验层进行)。智能层组织和提供智能服务,并且是用于指导服务交付的主要组件。理想情况下,在该层实现诸如动态服务发现之类的概念,以提供支持认知交互的灵活响应平台。

    体验层通过诸如增强现实、会话UI和手势控制之类的技术与用户交互。这一层通常由认知体验团队控制,该团队努力创建丰富且有意义的、由AI技术支持的体验。

    使用人工智能分析大数据可以提供对影响企业的外部和内部机制更深入的理解。采用最新的大数据体系结构和机器学习可以更好地支持人工智能的使用。一个现代的、先进的基于人工智能的平台具有以下特征:

    · AI可以访问所有可用的数据

    · 它从客户或潜在客户的历史中学习

    · 它从以前的类似客户那里获取经验,并展示过去行之有效的策略

    · AI监控和学习,发现人类可能错过的模式

    · AI实时学习,并根据新数据作出实时响应

    · 基于变化的数据提供指导

    · AI融合机器学习

    为了使用先进的AI收获最大的结果,应满足以下三个基本要求:

    一、是分析框架。分析框架是随着时间推移而开发的用于解决特定业务问题(通常是复杂的)的方法。使用分析框架是支持系统的AI和机器学习能力的关键。

    二、是语境。目前AI和机器学习在判断语境方面表现还非常差。AI可以发现趋势,并且从数据中判断发生了什么,但是超越趋势来推荐员工应该做什么,就必须要考虑语境。虽然人们希望AI能够学习如何确定语境,但这目前还不是现实,还需要由人工确定语境并将其添加到模型中。

    三、是适当的技术。与传统的分析系统不同,AI支持的平台必须是可扩展的,以便AI学习和创建解决方案。传统的分析系统会提供对数据的洞察力,而AI会实时地提供建议。

    对于安防监控系统AI,看上去是AI,实际上最后是大数据,大数据才是智能化的基础。人工智能、深度学习、机器学习、大数据应用在安防监控系统AI中, 说到底都是对大数据的采集、建模和应用。本文大致说一下安防监控系统AI中,对于大数据的运用过程与环节,让大家有个大致的印象。

    安防监控系统AI大数据流程三个环节

    1、数据采集

    数据采集,有说数据获取,这是数据的来源,安防监控系统AI中这个数据是来源于视频监控系统中的视频流,当然往大了说安防监控系统,还包括很多内容,但是基本都是以视频监控为核心,这里主要指视频监控系统。

    2、数据预处理

    对于采集到的实时或者历史视频,是只能看不能应用的,要调用就得结构化,先给视频流解码,把视频流还原成一张张图片,再对图片进行预处理。可能不同的公司对预处理包含的步骤内容说法不太一致,我是以安软慧视的技术负责人介绍为准。先对图片进行目标清洗垃圾,清洗掉模糊的、不合尺寸的,目标无法识别的、无目标对象的等等。

    当然,有些场景可能只有这样的图像,这需要用到另外一些图像处理方法,和我们的主题相关但不是一回事。这样我们就可以得到基本符合要求的图像。然后对这些图像中的目标对象进行检测和分割,并改变目标的大小与标准图片大小一致,目标对象包括人形、人脸、车形等,这样就可以拿去训练模型了。

    3、模型训练

    对图片中的目标对象进行识别,提取和构建模型,在安防监控系统AI中,需要的结构化描述是比较具体的,比如对人的描述就包括性别、年龄、发型特征、发饰、上衣款式特征、下衣款式特征、鞋帽款式特征、交通工具特征、随身物品特征、同行人特征等一系列描述。对车的描述包括车牌号码、厂牌、车身颜色、车辆品牌、车辆类型、车辆特征物(如:年检标、挂饰、纸巾盒、遮阳板)等。

    有了这些识别模型,就可以通过语义分析等技术对视频数据进行分类处理存储,并通过后端服务器的智能分析功能进行业务处理,将人、车、物的信息从数据中分离出来。这样公安民警就可以进行快速检索、条件搜图(人)、以图搜图,再配以图片的拍摄地点、时间等数据,就可以进行轨迹查询,再匹配一下大安防监控系统系统中的住宿、手机号码、车票等大数据,基本上嫌疑人就是插翅难逃,这对民警的破案效率将是百千倍的提升。这才是安防监控系统AI真正的价值所在。

    安防监控系统AI数据预处理技术及方法

    目前常见的数据预处理技术

    1)数据清理

    数据清理例程就是通过填写缺失值、光滑噪声数据、识别或者删除离群点,并且解决不一致性来进行“清理数据”。

    2)数据集成

    数据集成过程将来自多个数据源的数据集成到一起。

    3)数据规约

    数据规约是为了得到数据集的简化表示。数据规约包括维规约和数值规约。

    4)数据变换

    通过变换使用规范化、数据离散化和概念分层等方法,使得数据的挖掘可以在多个抽象层面上进行。数据变换操作是提升数据挖掘效果的附加预处理过程。

    数据清理方法

    1)缺失值

    对于缺失值的处理,一般是能补的就想办法把它补上,实在补不上的就丢弃处理。通常的处理方法有:忽略元组、人工填写缺失值、使用一个全局变量填充缺失值、使用属性的中心度量填充缺失值、使用与给定元组属同一类的所有样本的属性均值或中位数、使用最可能的值填充缺失值。

    2)噪声数据

    噪声是被测量变量的随机误差或方差。去除噪声、使数据“光滑”的技术有分箱、回归、离群点分析等。

    3)数据清理过程

    这个环节主要包括数据预处理、清理方法、校验清理方法、执行清理工具及数据归档。数据清理的原理是通过分析“无效数据”产生的原因和存在形式,利用现有的技术手段和方法去清理,将“无效数据”转化为满足数据质量或应用要求的数据,从而提高数据集的数据质量。常用的工具有Excel、Access、SPSS Modeler、SAS、SPSS Statistics等。

    4)模型构建数据统计分析

    数据统计为模型构建提供基础,只有通过数据统计分析探索到了数据中隐藏的规律,深度学习才有意义,人工智能才有可能。数据统计又包括数据分析与结果分析,基本的分析方法有:对比分析法、分组分析法、交叉分析法、因素分析法、结构分析法、漏斗图分析法、矩阵关联分析法、综合评价分析法等。

    高级的分析方法有:主成分分析法、因子分析法、对应分析法、相关分析法、回归分析法、聚类分析法、判别分析法、时间序列等。这些类别并不是独一使用的,往往是混合使用的,然后再通过进一步的分析对比从中挑选某些组合模型。

    5)数据可视化

    数据可视化,就是通过一些可视化图形或者报表形式进行展示,增强对分析结果的理解。再针对结果进行进一步的数据再分析,使得整个业务环节形成闭环。只有闭环的数据才能真正发挥出深度学习的效用。

    安防监控系统AI大数据的应用

    安防监控系统大数据的应用当前是围绕提升破案率和提升警务工作效率为中心的,要想在安防监控系统数据的基础上开发出优秀的应用,必须要深入了解警务工作流程,从接处警、现场勘查、情报研判、应急指挥、关联碰撞、合成作战,再到各类型警用装备间的互联互通,再到各警种间的配合,再到各警种业务数据库间的融合。这些都要有详细地了解,才能发现针对刑侦破案、治安防监控系统控、交通管理的应用间的差异。

    说到底,大数据最终是为应用服务的,只有最后真正提高了公安民警的工作效率和破案率,才能证明安防监控系统AI的价值和意义。这就要求我们既要懂AI业务,又要懂公安业务。脱离了这两者,想让安防监控系统AI得到大面积推广是连想都不要想的。

  • ?

    智能提取数据,跳过人工收集的大坑

    许淇

    展开

    当你的老板让你分析一下这个月业绩下滑的原因时,你是否感到无从下手?临时去收集市场、竞品、客户群的数据会耗费你大量的时间,自然难以高效率地交出成果。

    当毕业论文就快完工时,你是否感到辛辛苦苦码出来的文章却因缺乏数据润色而显得没有说服力,最终不得不一篇篇地查找文献从而选取数据。

    大数据时代,生活中有很多这样的场景会诱发我们对数据的烦恼,其实提取海量数据另有高招,自动化的提取工具火车采集器就能帮助我们跳过人工收集的大坑。

    以企业经营为例,我们日常对数据的收集主要来自于网页,比如企业经营中经常需要获取一些市场统计数据(供求量、份额占比等)、竞品详情数据(价格、销量、评价等)等,这些数据我们都可以从电商网站中进行提取。少量的数据采用人工手动收集,而大量的数据我们就来借助火车采集器。

    如图所示,依次通过网址采集规则——内容采集规则的编写,就可以将京东手机页面的所有商品信息采集下来,包括页面上的品牌、型号、经营店铺、上市时间、颜色、评价、价格、配置参数……只要是我们看得到的数据都可以通过规则来提取,火车采集器的规则是基于源代码提取,仅需简单学习一下即可上手。

    采集结果如上图中所示,其实不仅可以采集,火车采集器还可以将数据进行个性化的处理,使数据更加符合我们的应用标准,也可以导出为我们需要的格式,或者是导入我们的数据库中。

    很多情况下,对数据的提取都不是一项一次性的工作,因为许多数据比如“价格”是根据营销策略而动态变化的,需要实时更新监测。所以我们更加需要一个工具去进行繁琐枯燥的数据更新工作,火车采集器的更新应对策略是设置提取频率,这样在频率范围内每一次提取到的数据就都是当前最新的,满足我们对数据的准确性要求。同时也大大降低了人力和时间的付出,因为智能化的工具比起人工,效率可以达到成千上万倍,每天采集的数据量近几十~几百万条,且无论是文字还是图片、音频文件等都支持高效提取。

    有了海量的数据作支撑,我们再做后续的分析或者其他工作都必然是游刃有余。跳出人工采集的大坑,数据不再是一堆结构复杂、又难觅规律的文件,火车采集器的智能提取让人类的大数据时代变得更加接地气。

  • ?

    任正非:重视数据的录入和采集,这是人工智能和自动化的源头

    云深处

    展开

    题图来源:视觉中国

    今年初,华为总裁任正非在人工智能应用GTS(全球技术服务)研讨会上明确了GTS人工智能对华为的重要意义。

    当时他提出,要实现高质量数据输出,在网规网优等关键场景要敢于投资,以及率先在简工勘和自动化设计方面打歼灭战。

    8月29日,华为专门召开了GTS人工智能实践进展的汇报会。任正非提醒,虽然GTS机器学习有了很大的进步,但仍然需要重视数据的录入和采集,这是人工智能和自动化的源头。

    会议上,任正非对于华为内部人工智能发展提出了三点要求:

    一、聚焦内部效率提升,利用人工智能改变作业模式、简化管理,结合业务场景解决一线实际问题。

    二、围绕业务,持续加大GTS数据系统、AI算法和AI 使能平台的投资。

    三、人工智能未来对内要横向扩张,与周边部门协同产生倍增效益;客户界面升级服务内容,在设备和网络的生命周期内,创造更大的价值。

    会议还透露,华为在全球有460万站点,每年会在100万站点上作业。任正非希望在5G时代,能先把华为的基站连起来。

    任正非提出了加快开发公司统一的人工智能平台要求,部署统一的人工智能训练环境,并期待在2018年首先在GTS实践和应用。(钛媒体记者李程程整理报道)

    附:任正非在GTS人工智能实践进展汇报会上的讲话

    一、聚焦内部效率提升,利用人工智能改变作业模式、简化管理,结合业务场景解决一线实际问题。

    人工智能的核心在于应用,GTS把人工智能作为一个工具,研究海量重复性活动的智能化自动化,提升人的效率和辅助人的工作。从你们的探索来看,实践经验非常重要。

    在人工智能和自动化推动过程中,要关注交付服务流程以及人员思想、行为模式的改变,如果他们还是老一套思路,不重视数据的录入和采集,我们人工智能和自动化就会失去源头,同时要看到人工智能是一个持续演进和迭代的过程,大家在推进过程中要不急不躁,持续改进,关键要抓好数据治理和平台构架设计,保证我们大方向正确,在正确的方向上加快迭代,小步快跑。

    第一,利用人工智能简化站点作业活动,把设计、报告自动化,同时要联合产品线,构建免安装、免调测网络。

    我们在全球有460万站点,每年会在100万站点上作业,任何一次的站点作业都是成本。要通过构建站点信息库,开发站点3D扫描能力,把站点勘测简单化,上站录入表格的时间也就大大节省了。以后的数据录入还可以进一步简化,捆绑一个好的语音系统,现场作业完成了,自己说一遍,表格就自动生成,然后回家把这个表格稍微修改,就能完成交付作业。

    基站设计方案模型很多,现在通过机器学习,实现基站连线图和配置参数的自动化生成,降低对现场工程师的要求。面向未来,要在设备模型归一、免安装、免调测上做研究。5G时代万物互联,能不能先把我们的基站连起来?荒山野岭,咱们有多少站点?应该是数百万个。可以请位快递哥骑个摩托车上山,把基站挂上,通电一开,无线连接所有设备都自动连上了,这样减少了错误,也节省了人工。

    质量检查只要拍个照,通过与标准图样对比,分包商在站点安装的时候就可以检测安装质量的好坏,一次把事情做对,避免了多次上站,节省了工时,提升了效率。不要小看1~2个小时的节省,这是一个点,若是有几十万个站可推广,乘以系数,就有几十万的规模效益。

    第二,网规网优要敢于应用地理、测绘、数学等先进技术和新的业务模式,只要能提升效果,都为我所用。

    网规网优基于数据、算法、成本的影响,选择人工智能突破口,通过“分析机器人”提升人员效率,在无线干扰分析、天馈系统方向角优化调整等方面加强人工智能技术的引入,提升无线网络优化规划效率,同时基于产品数据的虚拟路测是一个方向,不需要路测就可以清楚网络的信号状况,一个城市节省3000公里路测,十几个城市就相当于绕地球一圈。

    人工智能理论是所有人类瑰宝,都可以为我所用,而不只是我们的理论。网规网优是一个基于数据的业务,人工智能也容易发挥效益,所以我们要敢于招一些统计学、系统工程学、哲学、遥感、遥测……等专业的优秀博士、硕士,就像当年我要求招一些地理测绘专业的人员一样,只要实践两年,自然就明白了。

    第三,万亿存量是我们的优势,不断积累小样本,维护模式要从被动问题处理到主动预测预防,并进一步反馈到制造、产品设计,形成闭环改进。

    面对海量的、确定性的重复工作,逐步将复杂的成千上万的场景收敛,通过表格、建模等方法不断的总结提炼经验。就像我年轻的时候,一个庞大的数字设备,出了问题就一次一次的闪灯,从闪灯中慢慢看集中在哪个区,再看电路,一判断,是电阻坏了,然后打开,修好了,这就是小样本!这些小样本提供给你们,你们再归纳、总结,上升到理论高度,就是故障模型。

    维护的最终模式要从被动问题处理走向预测预防为主。问题处理方面,我们至少可以把问题经验库丰富起来,谁暴露的问题最多、解决的最好,也可以搞小奖励。在预测预防方面,通过障碍发现的芯片及批次等相关问题要进一步反馈到公司的制造部门、产品设计环节,从源头上提升设备的稳健性。

    二、围绕业务,持续加大GTS数据系统、AI算法和AI 使能平台的投资。

    第一,行为即记录,记录即数据,构建并持续完善GTS数据系统。

    数据是一门科学,是人工智能的基础,要把业界做得好的方法借鉴过来。GTS沿着作业活动,把作业过程、对象、规则和经验数字化,持续完善GTS的数据系统。各产品线也要把自己的产品数字化,这是服务数字化的基础。要强化云平台基础设施建设,丰富单兵数据采集工具,给每个员工配个数据采集器,员工在现场作业完后,回到驻地处理一下,一按键就发出去了。

    数据要以用促建,利用表格、建模等方法输出作业数据,将高质量的作业数据输出作为作业完成的衡量标准,要形成对工程师高质量作业数据输出的牵引,形成指导和模板。

    第二,算法要服务于业务,算法科学家与熟悉服务场景的工程师紧密配合,在服务客户的战场上提升能力

    人工智能应用是实践科学,在实践和应用当中迭代式前进,效果不是一蹴而就的。实践初期,算法达不到高级工程师的水平也要坚持使用,以人为主,机器为辅,对算法进行持续的训练和提升。

    人工智能开发,算法专家、产品线专家要与GTS业务专家组成混合编队,共同识别实际场景中的AI应用机会、理解业务场景、设计算法模型、优化算法效果。

    第三,加快开发公司统一的人工智能平台,并于2018年首先在GTS实践和应用。

    开发公司统一的人工智能平台,部署统一的人工智能训练环境,首先在GTS实践和应用,把GTS积累的站点作业、网络维护、网规网优领域的算法、知识、方法、经验都固化到这个平台上。

    人工智能平台在GTS的应用要急用先行、小步快跑,聚焦服务场景一个个解决,选择与场景匹配的、相对成熟的算法,快速构筑数据处理、模型训练等工程能力,边战斗边优化,并于2018年将平台部署在GTS系统上。

    三、人工智能未来对内要横向扩张,与周边部门协同产生倍增效益;客户界面升级服务内容,在设备和网络的生命周期内,创造更大的价值。

    第一,自动化也是人工智能,改善一个点,可能有几十万个着力点可推广,就有几十万的倍增效益。

    跨领域也应有着力点进行推广,通过数据互联互通、业务交叉融合,公司很多部门就可以精简了。比如财务在人工智能上也梳理了100多个点,其中有些点和GTS有交互,如项目核算要开票,GTS可以这个点为起点,横向发展到财务那里去。

    我们要矢志不渝地前进,让一些确定性工作自动化、智能化,减少重复劳动。不能总是强调人工智能对模糊问题的判断和处理,为什么对确定性问题就不行呢?自动化也是人工智能。改善一个点,乘以系数,就可能有几十万的倍增效益。GTS人员都应实验性地“洗一次澡”,有些人在循环中变得更厉害,产生新的工作方法,大幅提高工作效率。

    第二,在自身实践成功的基础上,利用数据和智能技术,升级服务内容、构建在线服务模式,解决客户挑战。

    基于万亿存量数据的优势,通过改善自身管理的循环实践,构建全球智能网络大平台,平台的能力再以服务方式向客户开放,并将服务内容扩展到设备和网络的全生命周期,解决客户挑战的同时华为也获得收益。

    站点的选择,能否根据流量预测和动态变化,进行精准的网络规划?几百万台设备,也不能一天二十四小时高速开着,如果能根据流量动态设定产品能耗,是不是就可能极大地提升网络和能源效率?更远的未来,能否将预防预测能力延伸到整个网络,有预见地应对自然灾害、重大事件等带来的挑战。

    我们抓住这些机会,升级服务内容,就可以利用在线服务等手段,在网络全生命周期持续为客户创造价值。

    更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App

  • ?

    富士康高管谈AI:工业数据采集和人工经验转移是最大挑战

    韩青筠

    展开

    9月18日,在2018世界人工智能大会分论坛——青年AI科学家论坛上,富士康工业互联网首席战略官姚忠佑在提到人工智能的时候表示,现在他们沿线所看到最大的两个挑战,其实已经不是在人工智能本身,而是在大量工业数据的采集和让不懂计算机的人都能够有效地转移经验。

    “今天生产线的知识和经验,其实大部分都是累积在生产线上工作的人员的脑子里,如何有效地把这些人的经验用人工智能来储存同时建模是关键。”姚忠佑称。

    他还表示,过去15年富士康成长了50倍,今天如果还要按照这个规模继续成长的话,不可能只是靠人为的管理,必须得彻底融入人工智能技术,把自动化从生产线的层次一直提升到每个工厂,提升到整个集团的企业管理以及整个产业链生态的结合。

    公开资料显示,富士康工业互联网股份有限公司为鸿海精密工业股份有限公司(以下简称“鸿海精密”,股票代码“2317.TW”)子公司,后者创始人为郭台铭。

    随着全球智能手机市场增长放缓,近年来,全球最大的电子产品代工厂——富士康正在寻求转型,全力推进技术变革。

    今年2月2日,富士康集团执行副总裁吕芳铭透露,已经在中国的制造基地中部署了6万台机器人,未来计划增加到20万台。同时,富士康希望在未来几年内在人工智能应用和工业互联网领域投资100亿元新台币(相当于3.4亿美元)。

    除了在中国布局人工智能,富士康还把触角伸到了美国。7月初,美国科技媒体Cult of Mac报道,富士康在硅谷成立了一家新公司——Industrial AI System,开发用于实现工厂生产自动化的人工智能技术。据郭台铭 计介绍,辛辛那提大学工业工程教授李杰(Jay Lee)将成为新公司的合伙人,并计划投资100亿美元在威斯康星州建设生产工厂,再为该公司招聘约100名工程师和深度学习专家。

    在郭台铭的规划中,富士康要做的是“云移物大智网+机器人”。“云”为云计算,“移”为移动,“物”是物联网,“大”即大数据,“智”是人工智能,“网”是工业互联网,再加上机器人。

    今年6月8日,富士康工业互联网股份有限公司登陆上交所,股价上扬一周后一路下滑,目前直逼13.77元的发行价。今年以来,鸿海精密股价也呈下跌态势,截至发稿,股价报76.10台币,市值约为1.32万亿台币。

  • ?

    600%的效率提升,无人机山塘数据采集——颠覆传统人工的高效手段

    陶寻绿

    展开

    背景描述

    近期,宁波山能收到了宁波某水利部门1000座山塘静态影像数据采集项目委托。

    客户起初只是计划通过航拍的手段,仅仅获取目标山塘的静态影像,经深入交流后,山能发现客户的需求远远不止如此。整个项目除了获取水塘的静态影像, 还需要收集水塘的其他信息并呈现(如水塘面积、坝高、坝宽、泄洪道宽度等)。但这些工作的是使用传统人工测量手段进行。

    在宁波山能看来,无人机仅仅用来获取静态影像,那完全没体现出无人机应用的价值,甚至产生价值割裂。

    通过后期处理数据采集过程中所产生的冗余数据,就完全可以满足整个项目的需求,不需要再进行人工传统测量。

    此外,此项目的山塘大部分都位于深山老林,环境复杂不易接近。为接近山塘都须有徒步3~4小时都是常有的事儿。对于人工采集来说,也是巨大的挑战。

    于是宁波山能根据客户的实际需求和实际的作业环境,为客户提供了更为完备、高效的无人机应用方案——无人机采集高空影像数据,对每个山塘建立三维模型。通过对模型进行测量,获取围坝高差、长宽、水域面积、溢洪道宽度等数据,最后生成报告。

    人员与设备

    参与此次任务共计4人,2人一组,基本上都是1名飞手和1名观察员搭配操作。

    飞手基本上会控制飞机在法定的范围内飞行,部分飞行的作业,公司都会统一安排提前向相关部门申报。

    设备使用的是大疆M210行业应用级无人机和大疆P4RTK无人机。

    效果评估

    提交数据后,客户将人工测量与无人机采集的数据进行比对,结果令客户非常满意。传统的现场数据测量转变为内业软件测量,极大的节省人力物力,也可将获取数据进行制表存档。1000座水塘传统人工测量需6个月,而航测只需1个月,航测大大的节省了时间成本,提高了作业效率。

    建立三维模型可应用的数据远大于客户需求。而且所有模型数据均可加载到GIS平台上进行存储、查看和数据处理。相比于传统数据表更为直观,数据量更全面(带地理信息的三维数据),更新更便捷,并且具有很强的二次开发性。

    无人机的应用方向有很多,航测只是其一,想要安全合法的运行无人机还是要符合法规要求。近期无人机相关法规密集出台,体现了国家对无人机行业的重视程度,也希望大家重视安全飞行。

  • ?

    人工智能大火,BasicFinder要做数据采集、加工的送水人

    Vicky

    展开

    本文作者:徐宁、石亚琼

    眼前的女员工,正把手写体的古德文转录为印刷体字母,经过培训,她已经可以熟练操作,每秒钟至少转换1个字母,要知道,即便是在德国,完全认识这种古老字体的人也寥寥无几。之后,转录出的文字会发给OCR(Optical Character Recognitio n,光学字符识别)公司,做为机器训练的数据材料。

    另一边,员工在标记图片中汽车的可行驶区域,之后会用于无人驾驶场景的训练。

    就像传统工厂一样,数据正在流水线上处理,被分块加工。这一切都源于人工智能行业的崛起。Tractica预测,2024年人工智能市场规模将增长至111亿美元。但AI要真正发挥作用,优质的数据必不可少,所以,前端的数据采集、加工环节单拎出来成为了新的机会点。

    其实,数据标注并不算一个完全新兴的产业,成立于1998年的“海天瑞声”已在语音领域耕耘近20年,因为人工智能一词的提出,最早可以追溯到20世纪50年代,不过此前主流技术没有到“深度学习”的阶段,所以数据用的相对较少。目前这个赛道上,成立久的有“数据堂”,早期公司有获得明势资本Pre-A轮融资的“爱数智慧”,完成天使轮融资的“泛涵科技”,获得合力投资数百万天使的“丁火智能”,今天要讲的BasicFinder也是赛道上一员。

    正如上面的场景,数据标记是个重人力的劳动密集型行业。这类公司的关键点就在于——人员效率、交付质量。

    “市面上很多公司都采用众包模式,找人兼职做标记,亚马逊每天会发布任务给墨西哥以及印度兼职人员,但很多高精度工作是不适合众包的。”BasicFinder创始人杜霖告知,BasicFinder采用的是“自营”模式,目前拥有12家下辖数据工厂及2000余名数据操作员,为了保证质量,这些数据工厂有些是参与投资,有些是深度合作,操作员大多是经过培训的打字员,她们技能相对匹配、标记效率又高。杜霖补充,若是音频数据,BasicFinder会挑选听力较好的技术员,筛选通过率仅在30%。

    具体到标记过程,BasicFinder都是流水线式的,从最前端的任务定义、采集数据,到中间的清洗、加工,以及后端的质量检测、训练迭代等全部环节分开作业,并开发了一套系统辅助人工提高效率。

    举几个例子,拿视频标记骨骼来说,系统首先将视频的每帧切成画面,然后把没有人或者身体不全的画面去掉,这就完成了清洗过程。接下来,工人打点标记,若图中人物较多,系统会分割后派给不同标记员,以防单人作业眼花标乱。再比如,无人便利店的项目要求是框出商品,BasicFinder系统会提供辅助线帮人工标记,比无线情况下,至少提升1倍的效率。

    加工完的数据,还面临一道不可缺少的步骤就是校验。相对而言,这是不能标准化的事情,BasicFinder目前用人工复查,跟标记的耗时相比,在1:1——1:3之间。

    最后就是安全层面,杜霖告知,对于客户提供的数据素材,BasicFinder实行“交付即焚”,保证数据不会复用。若企业有非常严格的需求,BasicFinder还提供隔离标记房,数据不会经过BasicFinder服务器,并且房内有监控,客户可随时查看员工作业过程,以及每一台设备的标记情况。

    不仅如此,在前端的采集,BasicFinder也不主张数据复用。“在人脸识别场景中,批量购买超市等摄像头的数据成本很低,但有法律风险,其实侵犯了个人肖像权,BasicFinder的解决方案是,跟每一个员工或者被采集人签订授权协议,即便有公司提出同样的需求,我们会用同样的方法再采集一遍,也不会私下复用。”杜霖强调,BasicFinder的定位不是数据买卖公司,而是在加工的质量上。

    当然,对于一些公开的数据集,比如说景物的识别,BasicFinder也会自建数据库,供企业采购。但实际在人工智能行业里,数据素材可复用的机率相对较低,杜霖补充,“因为每家公司的要求都不一样,同是标记商品,有的公司会要求勾勒轮廓,有的会要求贴边打框,有的精度在10%的误差,有的在5%……”

    值得一提的是,BasicFinder的工具平台正在内部试用中,并将于近期正式对外公布。客户在平台上直接简单组合,填写相关参数,即可以相对精准的定义任务。平台接受到任务后,会按照要求把数据任务轻松分配到数据工厂甚至个人,数据工厂的工人在平台上进行操作,并借助相关的工具提升作业效率,客户在后台就能及时来监控这些信息,不合格的数据也可以及时返工,最后保证会输出质量较高的数据。

    系统之后会不断迭代,无非就是提高效率,问及是否会用机器替代人力进行标记,杜告表示不会,因为人工标记出得数据在误差层面符合正态分布,而机器标记的都是同一水平,用机器生产的数据再训练机器,并不利于AI最后的训练效果。

    至于收费模式,BasicFinder会根据样本耗时估算一个人力成本,走项目制。

    据悉,现阶段,BasicFinder的订单多为数据标注,国内外客户占比接近1:1,包括中科院、搜狗、中国移动、华为、创新工场、云知声、国外知名科研院所等。这些客户多在使用深度学习相关的框架进行研发,因此对数据的需求量较大,客户的算法相对比较成熟,因此任务往往为个性化任务。客户中,最高订单定价在百万元,不少用户会多次下达不同的订单。

    其实对于这一波因为深度学习而兴起的数据服务商来说,最大的潜在威胁很可能并非来自竞品,而是来自于增强学习、迁移学习等算法,后者仅需要少量的数据即可以达到一定的效果。杜霖表示,这方面公司也在密切关注,一方面目前增强学习、迁移学习等算法还不成熟,很难大规模应用;另一方面,这些算法也需要基础的学习数据,同时公司也有可能提供包含人工操作的数据以提供给这些算法。

    BasicFinder注册成立于2015年,目前核心研发团队在20人左右。创始人杜霖是一个连续创业者,在上海交通大学计算机系读大二的时候,就开始了第一次创业经历,当时开发了一款SEM搜索引擎自动化营销工具,后以300万美元的价格打包卖给了一家土耳其电子商务网站。2010年大学毕业后,杜霖从事了数年TMT创投工作。2015年预感到深度学习的潜力及对数据的需求,成立了BasicFinder。公司已经获得过两轮融资,天使轮由个人投资数百万元,2017年3月份,完成了一千多万元pre-A轮融资,计划今年底或明年初再进行A轮融资。

  • ?

    精准数据采集平台+高效营销工具降低人工成本,全面提升销售业绩

    车酬海

    展开

    一台电脑控制50个微信,自动加好友,发朋友圈去做营销,让你的效率及业绩无限倍增。

    一键掌控,批量管理维护;自动化营销,营销效率更快:一台电脑,控制50个微信,大范围营销,维护现有用户,开发更多客户:省人力资源,省人工成本:一台电脑控制50个微信,相当于上百个业务员在自动工作,降低人工成本,提高管理效率。

    量变,产生质变,假设,一个微信号五千个好友,一百个微信,就是五十万个客户群体,一个人,一天让你获得一元的利润,一天就是五十万,如果成交率在1%,就有五万的成交量,如果成交率在千分之一,每天就有五千的成交量,如果你的营销方案实在烂透了,成交率只有万分之一,每天也有五百的订单,说到这里你明白了吗?

    铁拐李精控:

    主要应用行业:

    金融行业应用,

    电话管控日益严格,客户拒接率越来越高,成本上升!

    铁拐李金控提供精准客户数据解决方案,提供高效营销工具,为您提供完美的营销解决方案。

    百度竞价行不通,传单杂志效率低,报纸受众少,铁拐李精控系统是您完美的替代解决方案!

  • ?

    「科技日刊」研究人员开发了种新高质量人工智能训练数据采集方法

    彩虹

    展开

    转载自百家号作者:梦之爱雨

    微软必应团队的研究人员开发了一种为训练机器学习模型生成高质量数据的新方法。在.博客帖子和纸在盐湖城举行的计算机视觉和模式识别会议(CVPR)之前,他们描述了一种能够区分标记准确的数据和标记错误的数据的系统,其一致性令人印象深刻。

    研究人员写道:“获取足够高质量的培训数据往往是构建基于人工智能的服务最具挑战性的部分。”“通常,被人类标记的数据是高质量的(错误相对较少),但代价很高-无论是金钱还是时间。另一方面,自动方法可以大量生成更便宜的数据,但会导致更多的标签错误(“标签噪声”)。“

    正如Bing团队所解释的那样,训练算法需要收集数十万甚至数百万的数据样本,并将这些样本分类-这是一项艰巨的任务,由数据科学家手工完成。一种常用的快捷方式是从搜索引擎中“抓取”数据,方法是列出一个类别列表,对列表中的每一项进行网络搜索,并收集结果。(例如,在构建计算机视觉算法的语料库过程中,您可以对不同种类的食物进行图像搜索。)

    但并不是每个结果都与搜索类别相关,训练数据中的错误会导致机器学习模型中的偏差和不准确。减少错误标记问题的一种方法是训练第二种算法来查找不匹配并纠正它们,但这是一个处理密集型的解决方案;必须为每个类别训练一个模型。

    必应团队的方法采用了一个人工智能模型,可以对错误进行实时校正。在训练过程中,系统的一部分-类嵌入向量-学会自动选择最能代表每个类别的图像。同时,模型的另一部分-查询嵌入向量-学习将示例图像嵌入到同一个向量中。随着训练的进行,系统的设计方法使得类嵌入向量和查询图像向量在图像属于类别的情况下变得越来越相似,如果不是的话,则更接近于类嵌入向量和查询图像向量。

    该系统最终确定了用于为每个类别查找具有高度代表性的图像的模式。研究小组说,它甚至在没有经过人工验证的标签的情况下可靠工作。

    “该方法讨论了…已经被证明是非常有效的,为图像相关的任务产生干净的培训数据,“该小组写道。“我们相信它将是同样有用的…适用于视频、文字或语音。“

人工数据采集

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP