中企动力 > 商学院 > 点云数据
  • ?

    地信位置数据获取新方法—无人机LiDAR

    Faith

    展开

    地理信息是空间信息的一部分。包括卫星导航系统、遥感系统、地理信息系统等在内的地理信息已经无处不在,它渗透到了全球经济的每一个行业、每一个角落。最近几年新兴领域如无人车、无人机、车联网、虚拟现实、增强现实、LBS等等,都与地理信息技术息息相关。地理信息也是智慧城市建设的不可缺乏的核心技术。位置信息是地理信息中非常重要的一项数据,是构建整个地理信息系统的基础。因此如何快速、高精度的获取位置信息是3S界的一项重要任务。无人机LiDAR则是快速获取位置信息的新手段。它集成了高精度IMU、存储控制系统、激光雷达和GPS,是目前集成度最高、最轻巧的系统。 激光扫描仪是以脉冲激光器做为主动探测光源,通过接收目标对激光信号的反射及散射回波,来测量目标的方位和距离,从而得到高精度的三维目标测量信息,形成空间点云模型。

    无人机LiDAR相比于传统的位置信息获取技术具有以下优点

    主动遥感以主动测量方式采用激光测距方法,不依赖自然光;因太阳高度角、植被、大雾、夜间等影响传统航测方式往往无能为力的阴影地区,其获取数据的精度完全不受影响

    高效快速获取数据通过机载、或者无人机平台可以快速高效的获取数据;

    多领域应用由于可以获得三维立体点云,该数据可用于地物测量与分析,包括生产DEM,DSM,地籍测量,电力巡线,林业资源调查,国土资源调查,水利项目,交通路面情况分析;可用于地物真实三维重建,用于数字城市,数字林业,数字文物,数字水利。

    植被穿透能力由于激光雷达具有多次回波特性,激光脉冲在穿越植被空隙时,可返回树冠、树枝、地面等多个高程数据,有效克服植被影响,更精确探测地面真实地形 。除此之外,由于无人机LiDAR的直接测距原理,LiDAR系统测量的位置及高程精度也很高,效果远好于传统位置信息获取方式。世界科技巨头如谷歌、苹果、阿里巴巴、百度、腾讯等,以及炙手可热的Uber、滴滴等新兴科技企业,都设立有专门的地理信息部门。此外,包括通用汽车、空客集团等财富五百强企业中,有超过三分之二的企业在深度应用地理信息技术,以驱动业务增长。其中百度、腾讯等公司都成立了专门的部门利用LiDAR系统获取地信的基础位置信息,LiDAR在地信的应用必然越来越广。

  • ?

    可按需配置的LiDAR系统,帮助3D点云瘦身

    岑迎松

    展开

    不同的应用对3D传感点云的密度要求不同,有些应用需要高密度点云,例如,当你无法再回到测量点获取更多数据时,或者当你需要某3D空间的每一处细节时;而有些应用或许仅需要精简的点云密度就够了,初创企业Terabee正是为此类应用而来。

    据麦姆斯咨询报道,Terabee公司凭借其低成本单像素测距LiDAR(激光雷达)传感器——TeraRanger产品线而广为人知,这款产品可用于机器人定位、测绘、SLAM(即时定位和地图构建)和自动化应用。现在,Terabee带来了TeraRanger Hub Evo,可以提供精简可选的3D点云。

    TeraRanger Hub Evo是一款仅售99美元的小型八边形PCB板,利用它用户可以根据配置需求最多联接8个TeraRanger Evo传感器(这款传感器采用LED进行ToF飞行时间测量,以获得“视场角”,对一定的区域进行测量,而非仅能单点测量)。

    TeraRanger Hub Evo能够为传感器供电、协同数据、防止串扰,并能以毫米精度输出一组距离探测数据。据Terabee介绍,“通过按需配置,客户可以针对感兴趣的区域进行监测、获取数据,创建定制化的点云图,获得最优化的应用”,推荐应用包括机器人、自动化甚至智慧城市等。

    “通过TeraRanger Hub Evo按需采集的精简点云数据,巧妙的回避了更高密度点云图所带来的一系列挑战,”Terabee首席执行官Max Ruffo解释称,“我们非常理解人们总是希望获得更多的点云数据,但是不要忘了,获得的每个点云都需要去进行数据处理。这需要非常复杂的算法和计算机算力,使系统更复杂,需要高度依赖机器学习和人工智能。由此也带来系统计算需求的增长,隐藏失效模式出现的可能性也随之增加。”

    通过演示案例,Terabee介绍了如何设计一款定制化的LiDAR系统,帮助自主移动机器人为运输托盘上的货物绑上胶带。其挑战在于,机器人需要能够以1.3米/秒的速度精确的围绕货物运行,同时应对货物随机的形状,精准地包裹胶带。

    采用8个传感器的TeraRanger Hub Evo与Kinect 3D摄像头采样对比

    其解决方案使用了16个TeraRanger Evo传感器。一个传感器阵列包括了3个侧向传感器,以确保机器人和货物之间保持一定的距离,还有5个面对正前方的传感器,以避免碰撞;第二个传感器阵列包括8个传感器,用于对托盘上的货物进行3D探测。利用这些相对数量较少的传感器所获取的精简点云图,这款机器人便能够避免碰撞托盘上的货物,同时优化行进路径,快速、精准且安全地包裹胶带。

    Ruffo认为Terabee可以沿着这一思路进行更深入地探索,减少传感器数量,带来更精益、更便捷的运算处理。Ruffo称这一多传感器概念已经获得了验证并很受欢迎,用户可以在机器人、自动化到智慧城市的众多应用中利用多传感器系统开发原型产品,或能带来很多超乎预期的用户案例。

    关于Terabee

    Terabee公司2012年始创于法国,作为一家无人机服务公司,开发了基于无人机的先进数据获取和分析技术。公司的用户案例包括,利用无人机为欧洲核子研究中心(European Centre for Nuclear Research, CERN)的大型强子对撞机隧道(对无人机来说,最复杂、最恶劣的应用环境之一),提供全自动飞行检测服务。Terabee采用LED而非激光飞行时间传感技术,树立了光学飞行时间传感的新标准。TeraRanger系列传感器以极其紧凑、轻量化的模组尺寸,提供了卓越的测距性能,并且在所有环境下始终对人眼安全。

    推荐会议:

    2018年3月27日,华强电子网、华强智造、麦姆斯咨询三方联合在深圳举行的“第三届智能硬件创新创业互动论坛-人工智能及3D视觉”,本次盛会将对人工智能和3D视觉领域的硬件、软件、核心算法和应用,以及未来发展趋势进行深入探讨!届时,云从科技、舜宇智能光学等企业将到发表精彩演讲,并拟邀大华、海康威视、法雷奥、百度Apollo、中科凌志、速腾聚创、奥比中光、大族锐波、上海数迹智能等企业到会演讲!

    如果贵司希望通过演讲等方式宣传公司技术和产品(名额有限),请联系这次论坛招商组:

    麦姆斯咨询

    邮箱:GuoLei#MEMSConsulting(#换成@)

  • ?

    电力巡线该怎么做?激光雷达系统可以提高效率7到10倍?

    Dundee

    展开
    华测产品探究所·Innovation

    近年来,随着中国经济建设的高速发展,用电需求高速增长,对电网建设的需求亦日益强烈。与此同时,面对已建成的漫长电力网络,如何有效地对其进行管理,以保证电网的正常运行,确保电力的安全输送,亦显得更加重要。一次停电事故的发生不但给电网经营企业的经济效益带来损失,而且对电力用户和整个社会都将造成严重的影响。

    Part 1 现状及困难

    由于国内电网不断扩大,长距离输电线路如特(超)高压线路增长迅速,而且很多的输电线路分布在崇山峻岭之中,为了日常电力线的维护、更新电力台账数据、防止电力事故的发生等工作,需要对电力线进行日常的巡查工作。

    目前,电力巡线工作主要由电力工人翻山越岭,采用人工观察或者无人机影像查看对现有电力线进行巡查,存在作业强度大、作业周期长,数据不直观、精度低、再利用程度不高以及地形复杂地区难以工作等缺点。

    传统电力巡检方式

    Part 2 项目优势

    1 、应用优势

    机载激光雷达系统由于具有快速获取高精度激光点云和高分辨率数码影像的优点,无论对新建线路的走向选择设计,还是对已建线路的危险点巡线检查、线路资产管理以及各种专业分析,都带来了传统测绘手段所不具备的作业模式和技术优势。其主要应用如下:

    新建线路的验收及原始档案的建立。主要包括:线路通道(树木房屋)、交叉跨越(输电线路、高速、铁路等)、杆塔本体(各部件安全距离、倾斜等)、导地线弧垂及线间距离等。对运行中的输电线路,测量导线与树竹、新建房屋等的安全距离,对树竹的生长趋势进行判断等,大负荷高温等情况导地线弧垂的检测和交叉跨越点线间距的测量。带点作业前校核杆塔各部件之间的安全距离测量。如塔窗结构尺寸、导线间安全距离等。

    2、 设备概况

    机载激光雷达扫描测量系统集成了激光传感器、定位定姿系统、高分辨率数码相机、计算机控制单元、无人机飞行平台等,具有集成度高、质量轻、数据精度高、运行成本低、使用限制少、操作维护简单、快速拆装、方便携带等特点。

    机载激光雷达系统AS-100多平台激光雷达系统参数

    3 、解决方案

    通过无人机搭载激光雷达系统获取真实点云数据,为输电线路监护人员提供数据基础,通过专业电力三维激光点云软件处理,以电力走廊内的关键对象—电力线与电力塔为核心,发现输电线路设施设备异常和隐患,以及线路走廊中被跨越物对线路的威胁。标识高大植被、高层建筑、穿越线路等关注地物,分析相互之间的拓扑关系与相互作用,输出图表提示危险排查区域,检测建筑物、植被、交叉跨越等对线路的距离是否符合运行规范。

    航线规划及数据采集

    航线的规划工作是决定飞行扫描测量成果质量的关键因素,规划完成通过自动或者手动控制的方式,对输电线路进行飞行扫描测量和成像,获得高精度点云和影像数据。

    数据采集 高精度点云数据

    数据分析

    将点云导入到专业电力点云分析软件中进行处理。利用机载激光雷达获取的高精度点云,快速获得高精度三维线路走廊地形地貌、线路设施设备,以及走廊地物(包括电塔、塔杆、挂线点位置、电线弧垂、树木、建筑物等)的精确三维空间信息和三维模型。根据输电线路安全距离的要求,可分析线路走廊内导线与植被、建筑物、交叉跨越等净空距离,进而确定线路运行状态是否安全,并对超过预定安全距离的危险点形成报表并进行标识提示,最大限度的发挥系统的输电能力。

    1、三维立体及快速剖面查看

    电力线路俯视图

    电力线路剖面图

    2、三维量测分析

    实现对线路任意点距离量测、面积量测。能够直接精确测量出输电线路各点的坐标、高程、任意两点间空间距离、任意点高程等;能够精确测量电力线相间距离,为间隔棒的制作与安装提供精确尺度。

    三维量测

    3、滤波与地物分类

    实现激光点云的滤波处理和点云分类,将点云数据划分为地表点云、输电本体点云及走廊内地物点云等几类。提高数据生产效率, 消除了数据滤波以及坐标转换等费时的工作,实现自动化数据处理过程,节省了重要的时间和资源。

    分类后点云

    4. 三维建模

    自动化三维地形重建技术,通过激光点云滤波结果,生成高精度的数字高程模型 DEM,实现线路走廊三维地形还原。

    5. 电力线提取

    利用分类后的线路走廊地物的激光点云,跟踪相邻点云数据,将同一条线路上的点云数据识别出来,并输出矢量化的电力线成果。

    电力线提取

    6. 电力安全运行分析

    直接基于激光点云数据精确量测线路走廊地物(特别是树木、房屋、交叉跨越)到导线的距离是否满足安全运行要求。按照相关标准设置这些地物点到电线的安全距离要求,进而自动进行安全距离检测计算,一旦该类别地物到电线的距离不符合相关要求,则自动报警,汇总输出危险点统计图表,以便于运行维护人员野外现场检修。

    分析统计信息 缺陷点检测交叉跨越

    除了检测当前危险点信息,还可进行风偏、高温、覆冰等模拟分析,查找最大危险点。

    最大风偏覆冰模拟

    Part 3

    总结与展望

    在新的经济及科技环境下,生产效率关乎企业的生存和发展,伴随着电网公司信息化建设的推进以及信息化规划的开始,信息化的推广为提升工作效率和工作质量起到了很大的作用。通过无人机激光雷达进行电力巡线,使得外业巡线水平持续提升,能够改善巡检数据的有效性和准确性,提升业务运作的效率和决策的科学性和准确性,最终提高企业的经济效益。

  • ?

    学点云在线教育直播系统,完美直播外语一对一

    Huo

    展开

    学点云通过技术架构为教育企业提供集视频、语音、文档、课件共享于一体,人人可互动的云端教室;在这样的云端教室里,老师和学生之间可进行实时的互动交流。在线答疑、在线测评等教学环节全部都可以在云端教室完成,从而提升学生的线上学习体验。

    中国小孩子学英语的最好的方法是什么?应该如何起步?

    中国小孩子是处在在非英语环境中学英语,而学习英语最好的方法就是兴趣,小孩做事,基本上是按兴趣来的,所以,提高小孩子学习英语的兴趣是一个首要任务。

    1、学习内容本身要有趣味性,例如故事有趣,难易程度恰当。

    2、学习方法有趣。如果去学校学,老师要有趣,气氛要好。如果家里自学,家长要建立好环境。

    3、增加与外教接触的机会,对于中国儿童接触外教的可能性可以说是非常少,所以家长尽量让孩子能尽可能多的接触外教,最好的解除方法就是选择外语一对一在线直播教育。

    外语线上一对一外教课优势

    1、迅速提高口语交流,及时引导,精准发音。

    启发孩子的口语交流兴趣,第一时间示范、指导孩子的英语发音。让孩子们敢说、想说、会说。

    2. 一对一私教,个性化教学。

    根据芝加哥大学研究数据表明,私人一对一教学比传统课堂教学提升98%的学习效率。

    3. 应用科技手段,减轻学习成本。

    英语在线实时授课,利用线上海外原版多媒体资料进行教学,在提高对学生直观多元语言输入的同时,也免除家长接送孩子学习的负担。

    学点云在线教育直播系统,完美直播外语一对一

    学点云的云端教室系统,主要通过给B端开放API接口和发放SDK包的方式,与教育机构现有的教学管理系统进行对接;同时也可为客户进行定制化开发,支持iOS、Android、Windows、Mac、OTT、Linux等开发平台。

    学点云为正在转型的传统教育企业和新创的在线教育公司提供基于云端的实时互动直播课堂SaaS服务。

  • ?

    点云生物3d打印,迈海材料基因组国际研究院正式成立

    Gijon

    展开

    新材料是人类进步的基石,往往是颠覆性技术的导火索(比如激光晶体、有机发光显示材料和石墨烯等),从而成为世界强国激烈竞争的战略高地。

    美国于2011年6月启动“材料基因组计划”(Material Genome Initiative,MGI),使美国企业以至少2倍于当前的效率加速先进材料的发现、开发、制造和应用。此外,印度、日本和欧洲也在实施其各自的材料基因组计划。我国科技部、中科院、工程院、教育部都启动了材料基因组的论证研究工作。“材料基因组计划”,即像“人类基因组计划”那样举国家之力,探寻颠覆性产品的“材料基因”,加快医疗健康、清洁能源、先进装备和国家安全等领域材料进入市场的速度。

    在华夏幸福、清华产业园、陕西金控等产业资本的支持下,迈海材料基因组国际研究院(MSEA International Institute for Materials Genome)于2017年8月15日在河北省固安新兴产业示范区清华中试孵化基地成立。致力于发展具有国际影响力的,从化学元素开始的结构/功能材料创新设计方法和先进制备技术,实现从微观探索到宏观调控的无缝过渡;开发高通量数据分析模型和计算软件,加快新材料的产业化应用速度;发展满足国家战略新兴产业需求的材料创新与产业平台;促进全球知识的交叉融合,激发创新思想,培养具有国际竞争力的科技精英和领军企业家。

    当前,材料基因组已成为引领新材料研发与产业革新的前沿技术。迈海研究院由千人计划教授为带头人,采用企业化运作模式,联合国内外知名高校、研究机构和顶尖企业组织实施,重点发展医疗健康、清洁能源、智能制造和国家安全四个产业方向。鉴于华夏幸福建设幸福城市的医康养战略规划,首先以医疗健康为切入点,依托点云生物科技有限公司,发展生物医用材料及其高端装备相关产业,通过产业盈利反哺研究院的持续运营,构建创新激励平台,确保在未来的发展中保持领先地位。

    材料基因组的核心宗旨是加速新材料的产业应用,发展颠覆性高科技产品。因此,研究院将围绕最具产业化价值的科技方向,落户若干高科技企业,形成材料基因组产业集群,主要包括材料基因组软件、生物3D打印、特色专科医院、新能源材料和石墨烯产业链等。

    迈海研究院在新材料产业拓展方面的作用主要有两方面:首先,研究院是一个高科技产业统筹平台,通过落户在华夏幸福固安产业园的实体平台,实现材料基因组最前沿科技的知识汇聚,面向全球展示最尖端的材料基因组技术,开展材料基因组技术的教育培训,搭建材料基因组永久会址,占领材料基因组学术高地。其次,研究院本身又是具有核心思想、技术、产品和应用领域(生物医健、清洁能源、智能装备和国家安全)的产业平台,这些产业都属于长周期产业,存续期长。通过材料(Materials)、软件(Software)、装备(Equipment)和应用转化(Applications)技术(简称MSEA,迈海),构成具有强大竞争力的集成化材料基因组生态系统。预计到2020年形成初具规模的产业链布局,主要包括材料基因组软件、新能源材料、低维材料与器件、石墨烯、生物3D打印和特色专科医院等高附加值产业链等,将形成超过10亿级的材料基因组产业集群。

    其中,与会专家分别发表激情洋溢的致辞。迈海材料基因组国际研究院院长、首席科学家冯志强说,对华夏幸福等投资机构的大力支持及对曾庆丰博士所带领的点云团队为研究院的顺利落地表示感谢,并分析了国内外情况,强调要加强国内外技术的交流合作;迈海研究院执行院长、点云生物创始人曾庆丰博士分析了研究院未来的发展规划,将在四大方向--生物中心、能源中心、智造中心、安全中心,依托国际化人才、高校、企业和医疗机构等,共同为先进材料与人类幸福基业贡献力量!华夏幸福基业股份有限公司总裁助理、华夏幸福京南区域事业部产业发展中心常松总经理介绍了华夏幸福的产业规划,表示将全力以赴为引入的企业服务,实现技术创新,实现企业的“中国梦”。最后,河北清华发展研究院总工程师、固安分院曹建国院长介绍了迈海研究院落地情况,表示将整合资源,打造平台,与华夏幸福和研究院共同努力,期待迈海未来的发展会更加辉煌!

    在研究院成立仪式上,来自中外著名大学、研究机构、医院、企业和投资机构的科学家、企业家、投资家、艺术家50多人汇聚一堂,为材料基因组在科学、技术、产业和人才培养层面的健康发展出谋划策,共议协作发展。

    接下来,请您跟随我们的镜头,为您展示迈海材料基因组国际研究院揭牌当日现场盛大开幕情况!

    迈海材料基因组国际研究院成立揭牌仪式现场

    来自西安点云生物

  • ?

    简解Velodyne和Ibeo

    铭记心

    展开

    “三年商用、五年量产”百度的口号还无人车市场回荡,乐视超级汽车、智车优行智能车、长安2000公里路测已紧随其后,加之特斯拉、谷歌、苹果、宝马、沃尔沃、本田、博世甚至腾迅等巨头的参与,一时间无人车行业聚焦资本市场,也吸引了大众的眼球。

    纵观各家无人车,其解决方案大体分为两种,小编也和自己的团队分别与两种流派的公司进行过过沟通,环境探测+自动决策+控制响应是大家普遍认可的技术共识。其中的环境探测部分目前普遍采用激光Lidar或者视觉感知,两者的优缺点就不再赘述。今天小编就激光Lidar的两个主流厂家Velodyne和Ibeo的产品与大家做一个对比探讨:

    美国Velodyne公司致力于专业激光测距仪器的开发和制造,主要产品为激光雷达传感器。我们熟知的谷歌无人车从原型车开始就使用Velodyne的车载激光Lidar。而Ibeo则是一家位于德国汉堡专注于无人驾驶技术整体方案研究的公司。目前Ibeo已经同全球几家主要汽车生产商,如大众、宝马、克莱斯勒在无人车方面建立合作。那么下面我们就来看看两家的产品:

    Velodyne上图的三款产品分别是Velodyne的64线\32线\16线激光Lidar,从产品的技术特点来看,Velodyne的产品一般需要安装在车顶距离地面较高,采用360旋转采集点云数据,视角好但近车身容易产生较大的盲区。所以其优点是点云密集、所采集的数据可以更好的反映3D信息,同样缺点也很明显,主要是探测距离短,一般在100米左右,盲区大(5m),需要配置其他传感器,并且Velodyne的产品不对数据进行处理,这意味着对主处理单元计算资源的占用会较多,与其他传感器的融合工作量也会比较大。而Ibeo的产品从技术指标来看,优缺点也很明显:

    Ibeo的产品一般安装在车身前后和中部,距离地面较低(0.3-0.5m),不存在近车身盲区,测量距离可以到200米,距离远可以更早发现目标。并且由于采用多次(三次)回波技术,抗恶劣天线如灰尘、雾、雪或者雨效果要相对较好。另外从公开资料来看,Velodyne的产品工作温度低温大多是零下10度,而Ibeo可以到零下40度,环境适应性更好。并且Ibeo提供障碍物识别库等辅助功能,与其他传感器的融合性做的更好。但Ibeo单台的探测角度最大只有110度,一般需要多台设备同时工作。目前Ibeo产品主要是8线和4线 ,基于这样的原因,售价也便宜很多。正是基于这样的原因,目前无人车对于环境探测大多采用多类别传感器融合方案。除了激光Lidar之外,还有应对光线条件不好的毫米波雷达、图像识别的摄像头、车道线识别的车道扫描传感器、以及车体姿态位置确定的IMU、GPS以及全面保障的高精地图等等。有了这些多重保障,无人车就能更全面、准确和及时的获取周边环境信息,以迅速做出正确的控制响应。

  • ?

    「PointCNN全面刷新测试记录」山东大学提出通用点云卷积框架

    杰瑞

    展开

    【新智元导读】山东大学李扬彦、卜瑞、孙铭超、陈宝权研究团队近日研究提出的PointCNN是简单通用的点云特征学习架构,基于这一方法一组神经网络模型一举刷新了五个点云基准测试的记录。

    论文地址:https://arxiv.org/abs/1801.07791

    由山东大学提出的PointCNN是一个简单通用的点云特征学习架构。基于这一方法的一组神经网络模型一举刷新了五个点云基准测试的记录。

    CNN成功的关键在于其卷积操作能够很好地从基于规则域表示的数据中提取局部信息。然而,由于点云数据的不规则和无序性,使得卷积操作由于输入数据顺序的不稳定很难直接应用到点云数据上。

    为了解决这个问题,PointCNN提出了一种称为X-变换的方法。X-变换是从输入点学习到的一组权值X,这组权值可以对各点相关联的特征进行重新加权和排列。 X-变换可以实现“随机应变”,即当输入点的顺序变化时, X能够相应地变化,使加权和排列之后的特征近似不变。输入特征在经过X-变换的处理之后能够变成与输入点顺序无关同时也编码了输入点形状信息的归一化的特征。在经过X-变换之后的特征上进行卷积能够极大提高卷积核的利用率, 从而大大提高卷积操作在无序数据上提取特征的能力。

    以下内容是对arxv文章的翻译,原文作者为:李扬彦、卜瑞、孙铭超、陈宝权。

    摘要:将针对规则域数据的CNN推广到可以处理点云数据

    我们提出了一个简单而通用的点云特征学习框架。 CNN成功的关键是卷积算子,它能够利用网格形式密集表示的数据中的局部相关性(如图像)。 然而,点云是不规则的,无序的,因此点对点的特征与点的直接卷积将导致形状信息丢失,还会因为输入点顺序不一致而产生不同的输出。 为了解决这些问题,我们尝试从输入点学习X-变换,然后使用它来加权与排列输入点的特征。这种操作可以把输入点的形状信息编码到特征中,同时把输入特征的顺序归一化到某种潜在的一致的模式。 这种方法是将典型的针对规则域数据的CNN推广到能够处理点云这种非规则无序数据的一种尝试,因此被称为PointCNN。 实验表明,PointCNN在多种具有挑战性的基准数据集和任务上达到了与最先进方法相当或更好的性能。

    背景:认识点云,CNN

    点云(PointCloud)

    点云是一组点的集合,常用来表示自身维度比背景空间纬度低的数据(比如空间中的曲面等)。由于数据较为稀疏,直接采用密集体素的方式,不仅数据量大,而且数据中包含过多的冗余信息,不利于数据特征的提取。不仅如此,大量的3D传感器也采用点云的方式保存数据,数据来源非常广泛。

    卷积神经网络(CNN)

    基于CNN的一系列方法在图像识别中已经取得了巨大的成功,其关键原因就是CNN能够很好地捕捉数据的空间局部特征。

    数学上来讲,CNN中的卷积操作本质上是将输入进行加权求和,结果依赖输入的顺序,即f(a,b)通常不等于f(b,a)。特别地,对于f(a,b,c,d)来讲,如果a被e替换掉,且e顺序在d之后,则替换后的结果f(b,c,d,e)通常会和f(a,b,c,d)有巨大的差异。因此CNN中的卷积操作是对数据输入的顺序是敏感的,对于无序数据则较难提取到有效的特征。

    由于图像表示方式大多为密集阵列式的,像素点之间等距有序地排列在一起,使得基于卷积的一系列操作在图像数据上能够得到统一的输出。最直接的将处理图片的CNN推广到处理三维数据的方式是将三维数据使用三维体素来表达,从而应用三维CNN。然而,三维数据通常较为稀疏,但基于体素的三维CNN难以利用这一特性。点云可以高效表达三维稀疏数据,然而,点云数据中各点之间距离不一, 点的排布也没有顺序(unordered), 无法直接使用CNN进行特征学习。

    PointCNN提供了一个能够高效地从点云中提取特征的方法。

    PointCNN:能够高效地从点云中提取特征

    PointCNN

    PointCNN提出了一个称为X-变换的方法来解决在点云上卷积难以有效实现卷积的问题。

    由于卷积操作本身的有序性,对于上图中ii,iii,iv三组点,如果把它们以i的方式进行卷积操作,会得到以下三个输出。

    对于ii和iii,由于四个点的空间位置不一样,我们希望进行卷积后产生的输出也会不一样。但实际上,直接进行卷积操作时ii和iii都被映射到了同样的位置,因此产生的输出也完全一样,这是不合理的。另一方面,对于iii和iv,其数据完全一致,但由于顺序不一样,进行卷积后结果也通常会不一样,这也不是我们所期望的。因此,直接对无序的点云数据进行卷积并不高效。

    由于点云的无序性特点,PointCNN期望能够得到一种变换,使得

    中,ii和iii不同,且iii和iv相同。

    PointCNN采用了学习权重的方式,这里Xs是一个4x4的矩阵,由a,b,c,d四个点的坐标经过MLP得到,即Xs=MLP(a,b,c,d)。MLP由网络学习得到。

    通过学习,我们期望得到的矩阵能够满足

    ,且

    ,其中

    是和(a,b,c,d)与(c,a,b,d)对应的列变换矩阵,即,使得

    事实上,在实验中,学习到的MLP并不能完全满足上面理想情况下的要求。尽管如此,PointCNN还是得到了良好的效果。

    细节上,PointCNN采用KNN选取临近点进行卷积;将点的坐标信息进行处理添加到特征中作为其一部分;通过随机采样等方式降低数据空间分辨率。

    实验结果

    classification accuracy on ModelNet 40 (91.7%)classification accuracy on ScanNet (77.9%)segmentation part averaged IoU on ShapeNet Parts (86.13%)segmentation mean IoU on S3DIS (62.74%)per voxel labelling accuracy on ScanNet (85.1%)

    特别值得一提的是,在ModelNet40的分类任务上,在只使用32个点作为输入的极端压力测试下,PointCNN仍然能够取得84.4%的准确率,这一结果大幅领先目前已知的其他方法。在这种极端压力测试下,PointCNN的计算量非常小,能够在GTX 1080 GPU上以每帧0.3毫秒的速度进行点云识别。自动驾驶中获取的点云往往非常稀疏,同时对实时性要求极高。该压力测试显示PointCNN有应用于自动驾驶的巨大潜力。

    未来与未来工作展望

    X-变换的进一步理解

    虽然X-Conv是被设计用来进行在三维点云上进行卷积,并且它在实验中展示了最新水准的结果,但是我们对它背后的理论方法仍然知之甚少,尤其是当它被用于深层神经网络上时,我们的理解还十分的有限。

    PointCNN采取了最简单也是最直接的方式来学习X-Conv——用MLP学习变换矩阵。虽然一般的矩阵可以用来实现权值和顺序变换,但是这种方法是否是实现目标的最简形式仍然是不得而知的。实际上,相比于此前的其他方法,PointCNN的参数更少,但还是在部分小规模的数据上表现出了过拟合的问题。X-Conv在带来强大的表征能力的同时,也可能携带了大量额外的自由度,能否找到一种比一般的矩阵更加精炼的可以学习的表达形式,或许是X-Conv发展的方向。

    PointCNN对形状分析的应用

    文章中说明了PointCNN对分类和图像分割问题的特征学习的有效性。我们认为PointCNN学习的特征可以在多种形状分析任务中超过手工设计的特征,例如关键点匹配,形状检索等任务。

    全卷积的PointCNN

    在原本的CNN中运用了全卷积的思想来处理不同大小的图像,PointCNN也应该实现全卷积的方法来处理不同尺度的点云。这篇论文使用了对全卷积方法的几乎最暴力的近似方法,在之后的扩展中,需要更有效的点云索引和内存管理来实现全卷积的X-Conv操作。

    PointCNN还是CNN?

    由于X-Conv是卷积的一种推广,因此,对于相同的数据(但是表达形式不同),PointCNN应该至少不比CNN要差,甚至要更好。为了证明这一点,论文中将PointCNN运用到了MNIST和CIFAR10的点云形式上。在MNIST数据集上,PointCNN达到了所有比较的方法中的最好的效果,而对于没有太多形状信息的CIFAR10数据集上,PointCNN从RGB特征的空间局部相关性中提取特征并且达到了还算不错的效果,但它和基于图片的CNN差距还很大。

    从CIFAR10实验来看。在一般的图像上, CNN仍然是比PointCNN更好的选择。而PointCNN的优势在数据越稀疏的时候越能展现出来。目前并没有一个科学的准则判断是应该将数据表达为规则形式进而应用CNN,还是应该将数据表达为点云形式进而应用PointCNN。有意思的是,部分密集的数据也许可以被稀疏的表达,例如视频通常被表现为密集的三维数据,但是通常在视频帧里面只有少量的像素是逐帧变化的。 PointCNN加上稀疏但不规则表达的视频数据也是一个有趣的方向。

    PointCNN和CNN的结合

    由于三维获取技术的高速发展,越来越多的采集的数据同时具有三维点云和图像,在这种情况下独立运用PointCNN和CNN分别来处理点云和图像数据,再将结果合并用于最后的推理也许是一种方法,但或许可以在更早期将这两种数据融合起来处理。

  • ?

    苹果公司利用点云数据进行物体识别,或用于自动驾驶和机器人产品

    千面狐

    展开

    苹果公司的研究人员正在努力推进让自动驾驶汽车进入公共道路行驶。上周,苹果针对相关的研究发布了基于神经网络去识别激光雷达点云数据中事物要素的一篇学术论文。尽管相关的研究仍处于一个早期阶段,但论文提到,该技术已经可以较为可靠地提高基于LiDAR数据导航的精准度。

    在苹果的这篇论文中提到,准确识别三维点云数据中的事物要素,仍然是当今快速发展的应用技术中的难题之一。无论是自动驾驶汽车,抑或自动化的清扫机器人,再或者其他需要自主导航能力的机器,都将需要更高精度、高效率的环境、包括针对各类物体的识别能力。而且与单纯的基于二维的图像识别能力相比,基于三维点云的数据识别能力往往准确性要更高;但受限于点云的密度差异,密度较低的点云数据在识别方面也往往引发不少问题。

    目前,行之有效的点云数据识别的训练方法,是依靠手工标注特点的方式来进行。例如操作人员会将点云数据从鸟瞰视角进行特点的标注,或者把这些数据三维网格化之后,对每一个立体网格要素进行手动标注。但在苹果的论文中提到,这种标注方式存在着一定的瓶颈,甚至在一定程度上限制了基于LiDAR数据的导航系统对这些三维点云数据的有效利用。

    在苹果的论文中,作者Yin Zhou(一位AI研究员)和Oncel Tuzel(一位机器学习专家)则提出了一种可不断训练的三维点云识别深度架构,该架构名为VoxelNet,其用以在复杂的三维网格要素中,对每一个要素进行自动化的特征标注。

    苹果公司现在利用这种技术手段训练机器从点云数据中去识别汽车、行人和骑自行车的人,在论文中他们提到了该方法的可行性,其性能也优于传统的做法。所以在理论研究之外,利用论文中提到的技术手段,苹果公司目前正在加利福尼亚州进行实际的自动驾驶技术的训练。

    根据今年8月的一份报告,苹果公司计划利用他们自主研发的一系列自动驾驶技术,研发自动驾驶巴士,向硅谷园区里的员工提供接送服务。

    除了应用于自动驾驶领域,该技术可能还将用于AR空间感知、以及其他需要自主导航能力的智能硬件领域。

  • ?

    南加州大学 phd 王薇月:深度学习在点云分割中的应用 | 分享总结

    Selena

    展开

    雷锋网 AI 科技评论按:随着激光雷达,RGBD 相机等 3D 传感器在机器人,无人驾驶领域的广泛应用,深度学习在三维点云数据的研究在近两年取得了广泛关注。点云分割、识别、检测成为学术界、工业界的热门话题之一。

    近期,在 GAIR 大讲堂上,南加州大学计算机系在读博士王薇月分享了其关于点云分割的最新工作。

    王薇月,南加州大学计算机系在读博士,导师是 Ulrich Neumann 教授,主要研究方向为计算机视觉,三维视觉等。其研究工作曾在 CVPR、ICCV、ECCV 等发表。公开课回放链接:http://mooc.ai/open/course/501

    分享题目:深度学习在点云分割中的应用

    分享提纲

    深度学习在点云上的应用。2D 图像的实例分割与物体检测。SGPN [CVPR 2018]:点云的实例分割与物体检测。(SGPN: Similarity Group Proposal Network for 3D Point Cloud Instance Segmentation)RSNet [CVPR 2018]:点云的语义分割。(Recurrent Slice Networks for 3D Segmentation on Point Clouds)

    以下为雷锋网 AI 科技评论整理的分享内容:

    大家好,我是来自南加州大学的在读 phd 王薇月,我的主要研究方向是 computer vision(主要侧重于 3D 的 vision),今天我们介绍的是深度学习在点云分割中的应用。我们知道三维物体和场景有很多种的表达方式,比如 3D 的 mesh,还有 Volumetric data,distance field 等等。点云是比较直接,而且很简单的一种表示方式。首先介绍一下什么是点云(Pinot Cloud),点云是很多三维的点的坐标的集合,这整个集合可以反映场景或者物体的几何信息,在计算机里面,它就是一个 N*3 维的一个矩阵,N 代表的是点的个数,三维就是 x、y、z 的坐标(当然也可以是 N*6,即 x、y、z、r、g、b),随着激光、雷达和深度摄像头等硬件设备的发展,我们就能更好地捕捉 3D 的场景,处理 3D 信息也是现在的一个非常关注、非常火的话题。采集点云的主要方式就是激光雷达、深度摄像头(深度摄像头采集来的 depth map 可以通过照相机的参数计算出 3D 的点云)。我们今天的讲课专注点云的分割。

    所谓点云的分割,今天我想介绍的有两层,一层是语义分割和实例分割,所谓语义分割就是给每个点 assign 一个 label,比如说这个点是桌子还是椅子。实例分割就是在 assign 语义分割的同时,把每个不同的物体给分割出来,比如一个房间里有很多椅子,每个点标 label 成椅子 1、椅子 2。实例分割与物体检测,即 object detection 是紧密相连的,object detection:给一个场景,把你想要的物体检测出来并给一个 bounding box。实例分割是比物体检测要稍微难一点的问题,因为它需要给每个点都要标出来。今天主要介绍在最新的 CVPR 上的两个工作,一个是对点云进行实例分割的网络:similarity group proposal network,还有一个是对点云进行语义分割的网络,recurrent slice network。

    首先介绍 SGPN:实例分割的网络

    在此之前,我想先回顾一下 2D 是怎么做实例分割和物体检测的。

    我们都知道 2D CNN 在物体检测上取得了比较好的成果,就是 R-CNN 一系列的工作,包括 fast R-CNN,都是从 R-CNN 开始的,R-CNN 是使用 selective search 从图片中提取一些用 Region Proposal,然后把每一个 proposal fit 到 CNN 的网络里面,然后再进行分类,它用这种方法来进行物体检测。根据 R-CNN 的工作,faster R-CNN 替代了 selective search,通过 Region Proposal network 来 regress 每个 Region Proposal 的相对 anchor 的 offset 来获取 proposal,然后这整个是一个 end-to-end 的网络,出来的就是一些 pixel 的 bounding box,还有每个 bounding box 代表的每个物体的概率。根据 faster R-CNN 的 ICCV 的 best paper 是 Mask R-CNN,它是通过做图像 level 的实例分割来实现,它们沿用了 faster R-CNN 的 Region Proposal network,然后在生成了 bounding box 的基础上又生成了 object mask,我们也使用这种 Region Proposal 的概念,然后对点云进行分割,随后我会对此进行详细的介绍。

    还有一个相关的工作是 3D 的 deep learning,从 2D 的 CNN 到 3D 的 CNN,最直接的方法就是 Volumetric CNN,当然这个是因为受到 GPU 内存的限制,没有办法做到很高的精度。去年 CVPR 上斯坦福的研究者们提出了 PointNet,是针对 point cloud 的网络,他们把 N*3 的点云 feed 到网络里面,然后在最后一层用 max pooling 提取 global feature,然后把这个 global feature concat 到每一个点云,然后进行分割,我们的网络建立在 pointnet 和它的后续工作 pointnet++的基础上提取出来 feature。

    我们还有一个相关的工作是,deep metric learning,中文:度量学习,在 deep learning 里面比较典型的 metric learning 就是 siamese network,比如说有两张图片,我们想让它做分类的话,同一类在 feature space 里面很相近,不同类就是在 feature space 里面相差比较远,它们的两张图片 feed 到的 CNN,是 share 的 weight,project 到同一个 feature space 上,训练的时候用的是 Hinge Loss(即图右公式)。

    注:公式讲解可回放视频至第 7 分钟查看

    之后会讲我们的工作跟 simaese network 的关系,先简单介绍一下背景,之前说过,我们的任务是想生成一个 instance label 和一个 semantic segmentation label,也就是说对于每个点云有两个 label,一个 label 代表着这个点云是属于椅子 1 还是椅子 2 的,另一个 label 代表它是椅子还是桌子,还是电视等等,背景知识已经介绍完毕了。我们是建立在 pointnet 和 pointnet++基础上进行 feature 提取,然后借用 R-CNN 等工作的 Region Proposal 的思想,提出了一个叫 similarity group proposal 的 network,我们现在把它简化为 SGPN。

    SGPN 的大体思路是这样的,我们首先是用 pointnet 提取 feature,也可用 pointnet++,提起完 feature 之后,之后有 3 部分(下图中间部分),similarity matrix,confidence map,semantic prediction,我下面会对这三个部分进行一一介绍。

    首先是 semantic prediction,semantic prediction 跟 pointnet 的 semantic segmentation 是一样的,对于每个点生成的是一个 classic 的 probability,就是对于每个 class 它的概率是多大,比如说我们有 Np 个点,就生成了 Np*NC 的 matrix,NC 就是有多少个 object class,下面的这个结果就是 semantic prediction 的结果,比如下图(右)黄色区域代表桌子,蓝色区域代表椅子。

    下面来介绍 similarity matrix,similarity matrix 就是对于每一个点,我们想生成 N 个点相对于它的位置,也就是说对于 similarity matrix 是通过 pointnet 生成的那个 feature,我们管它叫 Fsim,通过它进行计算它的 pointwise 的 distance,对于这个 similarity matrix,假设它叫做一个 ij 的元素,Sij 就是 point i 和 point j 在 feature space 的距离,如果它距离越远,说明它们两个就不在同一个 group,如果距离越近,就说明在同一个 group,也就是说如果两个点都是椅子 1 的话,它们

    注:该公式详细解读可回放视频至第 10 分钟查看

    两个在 feature 里的距离比较近。如果椅子 1 和椅子 2 在 feature space 里面距离比较远,或者说它们是椅子和桌子的话,它们两个在 feature space 里面的距离也要非常远。然后,我们有这样一个 Np(点的个数),有这样一个 Np*Np 的 similarity matrix,就是说每一行都可以是一个 group proposal,我们要设一个 threshold,如果小于这个 threshold,对于每一个小于这个 threshold,表示这些点在一个 group 里面,也就是说我们现在有 Np 个 group proposal,现在的问题就是我们怎么去 train 这个 matrix,它的 Ground Truth 是什么?

    我们刚才讲过了 siamese network,就是说两个图片如果是一类的话,就让它们在 feature specs 里面的距离很小。如果它们不是一类的话,就让它们距离比较大,所以我们通过采用这种方式,借用这个思想,来训练我们的 similarity matrix,如果两个点属于不同类的话,我们就让它们的距离很大。如果它们是相同类的话,我们就让它们在 feature specs 里面的距离比较小,我们同样得使用的是 Hingle loss,两个点都是椅子 1 的话,我们就 minimize 这个 term(下图右下公式),在这里介绍一个 double hinge loss,也就是说两个点,一个椅子 1、一个椅子 2 的话,我们让它们的 margin 比 K1 大。如果两个点是一个桌子、一个椅子的话,我们就让它们的距离比 K2 大,在训练的时候 K1 要比 K2 小一点,在实验中我们发现用这种 double hinge loss 的方式,会让结果更好一点,比 K1=K2 的时候结果好一点,这样我们就训练出了 similarity matrix。

    注:该公式详细解读可回放视频至第 12 分钟查看

    大家可以来看一下这些 visualize 的结果,这些代表的是 similarity,越黑的表示 feature specs 它们的距离越近,颜色越浅,就表示它们 feature specs 距离越远。

    注:此处详细讲解可回放视频至第 14 分钟时查看

    介绍完了 similarity matrix,我们再来介绍另一个部分:confidence map。

    因为 similarity matrix 是个 Np*Np 的矩阵,也就是说我们有 Np 个 group proposal,这样就有很多冗余,我们想用这个 confidence map 削减一些 group proposal,confidence map 的定义,也就是说它的 ground truth 是如下定义的。

    对于 similarity matrix 的每一个行,我们是一个 group proposal,对于这一个 group proposal,我们有一个 ground truth,然后我们把这个通过 similarity matrix 预测出来的 prediction 的结果和 ground truth 进行比较,我们计算 IoU,IoU 就是 inter section over union,也就是说,如果 IoU 越大的话,表示这一行,也就是这个 similarity propose 出来的结果更可信。如果 IoU 更小的话,是更不可信的,这样我们就 regress 出来 confident map,然后在这里,我们也 visualize 这些 confidence,颜色越深表示 confidence 越高,颜色越浅表示 confidence 越低,我们可以看到着一些 connection part,连接处的 confidence 比较低,通过这些方式去排除掉一些噪声,相当于在 similarity matrix 的预测削减掉一些 similarity matrix confidence 比较低的 group proposal。

    之后,像 R-CNN、faster R-CNN 它们有一些 post processing,它们会多预测出来一些 region proposal,然后就会用 threshold 的方法去 prove 这些结果,我们也同样用一个比较简单的贪婪法去 prove 这个结果,效果也是非常不错的,对于网络预测出来的一些 group proposal,对于每一个,先 initialize 一个大的 group set,如果这个 group proposal 是没有出现在这个 group set 里面,我们就把它放进去,如果出现了的话,我们就进行下一个,这样就做了一个 post processing,就得到了最终的结果,下面是一些实验结果。

    在介绍实验结果之前,我们先简单介绍一种非常简单的均类方法,就是在所有的点里面选一些种子,然后进行 BFS 去 search 到最近的零点,然后去寻找跟它最近的相同的 label,如果它们有一个 threshold,如果大于这个 threshold 就停止,如果小于这个 threshold,就继续寻找。相同的 label group 起来,就形成了一个新的 instance,就是我们的一个 group,然后通过跟这个方法进行比较,因为在 literature 上面进行点云实例分割的文章比较少,我们就用这种比较简单的方法进行比较。

    可以看到,这个是 stanford 3D indoor semantic dataset 上面,然后我们取得的结果比 seg-cluster 好很多。我们有了 instance segmentation 之后,就很容易得到 3D 的 object detection 结果,因为我们有了每个 instance,每个点的位置,我们就可以计算 bounding box,然后去跟 Ground Truth 的 bounding box 比较,pointnet 也给了一个 framework 去做 instance segmentation,可以看到我们比它们也是好很多。

    注:此放大部分的详细讲解可回放视频至第 19 分钟查看,不同的颜色代表不同的 group,即不同的 instance。

    seg-cluster 有不同的 threshold,hreshold 变大的时候,也就是说两个相同 label 的物体更容易连接在一起,如果 threshold 变小的时候就更不容易连接在一起,threshold 变小的时候,结果就如上图(右部)所示,将它分成了两个部分,但是在 SGPN 中就会避免这个问题,通过 similarity matrix 的方法,建立了上面和下面的联系。

    除此之外,还在 NYU dataset 上面做了实验,因为 NYU 有很多 2D 的图像数据,包括 depth 信息,然后我们通过 2D 的 CNN 去 refine SGPN 的结果,因为通过相机参数,我们可以把深度图像换成点云,也就是说每一个点和每一个图像的坐标是有联系的,于是我们通过几个 CNN layer,然后联系相同的位置的 feature,把 CNN 里的 feature concatenate 到 pointnet 的相同 point 的 feature 里面,然后再进行几个 pointnet 的 layer,再生成 SGPN 的 3 个 sub module 去进行 point 的 instance segmentation,在 NYU 的 dataset 上面。

    这是我们的结果(图上),SGPN 比 seg-cluster 好很多,我们还进行了 3D detection 跟 literature 的比较,因为 literature 有 Ground Truth 的 bounding box,像床、桌子一些大型的物体,它们的 bounding box 是 loose 的,也就是说,扫描的时候只是扫描一部分点,像有些?clusion,像床、桌子这些点其实都很小,存在的我们能看到的点,在点云中其实很少的,所以计算 bounding box,不是很准确,就是一个 tide 的 bounding box,没有办法跟大的 bounding box 去比,所以我们在这里(图右下)只比较了一些小的物体,比 literature 都好一些。

    然后我们看一些更多的 visualize 的 result,这里有在 stanford 3D indoor semanticdataset 上面的,我们还在 scannet 上面做了很多实验,大家感兴趣的话,可以去阅读我们的 paper,有更多的实验和 application study。

    这个工作主要是针对,使用深度学习的方法去做点云的实例分割...

  • ?

    机器感知、三维点云如何与深度学习擦出火花?| ICRA 2018

    徐凌雪

    展开

    雷锋网 AI 科技评论按:ICRA 2018 正于近期在澳大利亚布里斯班举行。ICRA 全称为「IEEE International Conference on Robotics and Automation」(机器人与自动化会议),是机器人技术领域最有影响力的国际学术会议之一。雷锋网 AI 科技评论在去年曾赴新加坡参加 ICRA 2017,并带回融合产业与学术的专题丰富报道。详情可了解去年的 ICRA 2017 大会专题内容:

    根据学术会议惯例,Workshops & Tutorials 将在大会正会前后召开。作为能够给予与会者宏观启迪及学术纵览体验的一项重要议程,持续一整天的 Workshops & Tutorials 自然早早吸引了不少学者前来注册参会。

    今年 ICRA 2018 共有 1 个全天 Tutorials 及 22 个全天 Workshops;此外还有 3 个半天 Tutorials 及 9 个全天 Workshops。雷锋网 AI 科技评论从议程进行不完全统计,机器感知与控制仍然是 ICRA 2018 的关注重点。所有的 Workshops & Tutorials 中有近一半是围绕两个议程的讨论,而基于现实问题的应用探讨(包括道德伦理)也有 5 个相关议题。此外,仿生机器人、人机交互、自主系统构建等话题也是比较热门的关注方向。

    雷锋网 AI 科技评论选取了其中几个研讨内容做简单分享,更详细的研讨内容可参考大会官网中关于 Workshops & Tutorials 的介绍:

    由谷歌大脑两位女研究员 Anelia Angelova 和 Jana Kosecka 组织的 Tutorial「Deep Learning for Robotics Perception」从当前非常流行的一些深度学习网络入手,分享和探讨了机器如何借助机器学习更好感知周围的世界,并根据实际任务做出更加精准的反应。

    值得一提的是,现场还配备了手语翻译人员,可以说是非常人性化了。

    目前机器人需要处理多种感应模式,包括「是什么?在哪里?怎么样?」等问题,这就涉及到非常多的问题,比如三维重建,视觉测距、对象分类、人类/物体的姿态估计、语义分割、匹配,识别和本地化等。也就是说,机器人需要在这个过程中学会如何主动感知和控制。因此,深度学习的流行也为探索这一问题提供了一种值得借鉴和学习的方法。

    最开始,机器人研究者采用神经网络的初衷是为了进行分类特征提取,但目前随着深度学习的广泛应用,数据驱动模式能够构建强大的端到端训练方法,如今已经可以拓展到更多的感知模式和视频检测上,并进一步构建神经网络架构工程在无监督或自我监督的训练方式中。

    在 Tutorial 里,Angelova 先介绍了从视觉领域角度上,机器人在感知领域是如何做探索的。从视觉角度来看,分类与检测是目前机器人学最主要的两个相关问题。

    从分类入手,以 AlexNet、Inception、ResNet、DenseNet 等为代表的深度神经网络,在机器人领域又可分为物体分类及场景识别两种任务;从检测入手,R-CNN、Fast R-CNN、Faster R-CNN 为代表的深度神经网络走的是「Two-stage approaches」,即 Bounding box + classification 的方法;而以 YOLO、SSD、Retinanet 为代表的网络,采用的是「Single-stage approaches」,即 Direct「regression」to locations and classification 的方法。

    基于深度神经网络的准确性及可行性,我们需要肯定深度神经网络对于机器人在感知上的探索。目前已知的一些网络体系架构也在快速发展,通过引入架构,标准的计算机视觉算法能够比较顺畅地应用于机器人技术上。

    随后,基于姿态估计和匹配、场景分割和密集预测、抓取及从视频中学习等四个方面,两位科学家展示了一些具体的研究成果及应用场景。

    在三维点云及即时检测、多任务检测上,深度学习对机器人的研究也有着不少先进成果。Binh-Son Hua1、Duc Thanh Nguyen、Lap-Fai Yu、Sai-Kit Yeung1 及 Daniela Rus 组织了一个名为「Creating Annotated Scene Meshes for Training and Testing Robot Systems」的 Workshop,针对 3D 场景重建和标注的相关进展进行了介绍和探讨。与较为容易获取且数据量庞大的 2D 图像数据集相比,从现实世界中捕获,重建和注释 3D 场景并非一件容易的事情。

    受限于点云本身的无序性,不同设备在不同位置扫描物体所获得的数据不尽相同,数据难以通过端到端方法来处理;点云本身也面临数据缺失的问题,比如被扫描模型往往会被遮挡。

    针对无序点云数据的深度学习方法研究,目前进展还相对缓慢。在 CVPR 2017 上,斯坦福大学提出的 PointNet 是第一种直接处理无序点云数据的深度神经网络。团队通过在每个点训练一个 MLP,把每个点投到一个 1024 维空间上,并采用了 Max Pooling 层做为主要的对称函数,比较好地解决了顺序问题。随后斯坦福大学在 NIPS 2017 上的 Pointnet++,对 PointNet 做出了更多改进。

    在本次 Workshop 中,学者们还探讨了数据捕获,实时和离线重建,自动和交互式注释,质量控制和基准测量指标等目前的热点问题。

    组织者之一的 Daniela Rus 是 MIT 的 CSAIL 主任,在 2016 年的 CCF-GAIR 大会上,Daniela Rus 教授曾经作为大会嘉宾受邀做主题演讲。她曾表示,虽然深度学习已经取得了非常显著的成果,但研究者还面临深度学习的三个挑战。首先是深度学习需要大量的训练数据;其次是深度学习并非永远不会犯错;再者是它的可解释性。

    不论是机器感知,或是以三维点云为代表的技术,在利用深度学习探索的过程中,必然还是会遇到同样的问题。而在深度学习与机器人学的结合中,人与机器人的相互协作与共同进步,也将成为每一年 ICRA 孜孜不倦的目标。「人类和机器人各有擅长的事情,我相信未来会是一个人与机器共同协作,互补对方短板的社会,我们也需要努力去创造这种社会。」

点云数据

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP