- ?
品质管理工作如何借力大数据实现智能化升级?
天津人
展开
近年来,随着互联网、物联网、云计算等信息技术的迅猛发展,数据开始成为各个行业的核心价值之一,对于许多传统制造业而言也是如此,数据的分析利用程度越高,企业运营就会越高效,并最终转化为生产效率的提升。毫无疑问,大数据正在改变着人们的生活与工作方式,也改变着制造企业的运作模式。
马云在2018杭州云栖大会上提到
“在技术变革的大趋势下,
传统靠资源消耗型的企业面临的挑战会越来越大
单纯的工业内部解决方案已经很难提升运营效率,
需要有效的手段让隐形、碎片化的工业问题浮出水面。”
然而
依赖资源消耗只是目前所存在的核心问题之一
传统企业还面临着什么样的挑战?
有哪些行之有效的手段能帮助我们实现转型?
该如何选择最适合自身的数字化发展之路?
传统制造业数字化转型面临的挑战
仍然存在很多纸张记录数据的方式,数据的准确性及时效性无法保证设备缺乏物联能力,数据采集困难;数据系统孤立难以打通,已有数据难以整合与管理;缺少数据的实时监控与SPC分析,不能第一时间了解检查过程是否稳定受控;手工制作报表费时费力,需要完成数据获取、数据拼接、相关计算、格式编辑等诸多工作,还要经常要根据各种要求花大量的时间制作各种报表; 数据利用率低,无法有效地进行分析与改进;历史数据查找追溯困难等;
在行业智能化升级的大趋势背景下
太友公司依据自身优势整合人工智能和数据分析技术,
积极推进基础设施和软件方面的部署
率先推出QCData品质数据管理软件
“QCData”作为智慧科技和数据应用的载体
为制造业提供智能化大数据解决方案
助力企业实现智能化升级
提高数据采集与分析管理效率
确保数据真实性:最大限度地降低人为的数据错误,确保数据真实、可靠;提高质量可追溯性:按照一定逻辑相互关联的数据,帮助进行质量问题的追溯;平台化/体系化:通过联网部署,不同仪器设备的数据能实现共享、互联,不受时间、空间的限制;同仪器设备的数据可统一采集到一张报表,实现单表一步汇总分析,减少报表制作的时间和难度;节省时间:在十几秒中各动生成各种报表,大大缩短报表制作时间;定制灵活:支持二次开发,量身定制以满足您的个性化需求;
完美解决转型之初数据收集与管理困难的问题
&
提高数据分析以及报表管理能力
QCData软件
品质数据管理专家
顺应大数据的潮流,完美解决企业品质数据采集以及分析管理困难的难题,助力企业实现智能化升级!
- ?
这个APP,是高效品质检测人员必备的工作利器!
铁面人
展开
目前,大部分工作的品质管理工作中都普遍面临以下问题:
以纸张的方式作为品质记录;
纸张记录保存占用空间,且难于管理;
历史记录查询困难,费时费力;
检查结果反馈速度慢,数据共享难;
数据利用价值小
针对以上问题,太友科技自主首创研发了一套将平板APP与工厂品质检测及管理工作相结合、符合工厂实际需求的 QSmart QAS品质无纸化系统,做到无纸化办公、节省人力成本, 提高品质检测人员工作效率,同时缩短现场品质问题的反馈时间。
系统作用
实现品质检查的无纸化、信息化,以及提高检查的效率;
加快质量信息的反馈速度及质量信息的数据共享,如通过邮件,微信等方式实现检查结果的实时反馈;
实现品质数据的查询,分析功能,如供应商品质状况汇总分析,详细不良项目汇总分析等;
品质无纸化平台具备良好的扩展性,当需要时,可向供应商及客户延伸;
通过配置无线传输卡尺等硬件,提高检查的效率,进一步提高数据的准确性;
系统组成:APP平板端+WEB端
APP平板端:
1)用于检验单的创建、查询、下载以及上传等;
2)数据录入:a)手工录入:计数型+计量型检测数据;b)自动数据采集:三坐标等检测设备;
WEB端:包括检验单模板的创建、检验单的审核以及各类报表管理等内容;
系统工作流程
系统收益
欲善其事,必先利其器!
QSmart QAS品质无纸化系统,是每一个高效的品质检测人员都应该去利用的。 通过安装个APP,你可以:加强品质控制能力,加快品质问题的信息反馈速度,提升品质数据的分析利用价值,实现品质数据信息化,提升检查效率。
通过平板进行检查及录入数据,实现信息化;
数据保存在数据库中,有需要才打印出报告;
短时间内可查询出历史记录;
可实时反馈检查结果给到相关人员;
提升数据的利用价值,如品质分析,供应商分析等;
- ?
如何高效高质量的收集到自己所需要的资料
傲薇
展开
我记得很多年前,一位朋友非常喜欢买书,然后在天涯的闲闲书话晒书单。于是就有人在下面问:你买那么多书,看得完吗?这位哥们就火了,说:你管那么多,我乐意买。
关于我喜欢收集资料的提问,我的答案也类似。但我与这位朋友不同的是,除了在我乐意之外,还需要加个“我需要”。
我认为收集资料,做好自己的知识管理,是非常必要的一件事。但收集资料不代表能有效收集资料,所以,今天我就我十多年收集资料的心得,谈谈“如何有效收集自己需要的资料”。
实际上,不独我喜欢收集资料,其实任何人都有收集资料的需要,比如新闻事件、评论、分析报告、书籍、观点、数据、案例等等,需要作为自己撰写文章和工作报告的素材。
如果你是个正在研究笔记如何做的人,自然需要去收集如何阅读、如何做笔记、怎样选笔记本、用什么笔等等方面的学习心得,乃至收集印象笔记、有道笔记等方面的资料和评价,方便自己学习和借鉴,支撑自己跟上电子时代阅读的需求。
为了收集的资料以后有用,我们首先不能像个捡垃圾的一样,见什么垃圾都扫,然后丢在自己的电脑硬盘里,或者堆在自己的书架上,而是要让自己参与到资料当中。这个参与的意思,就是要先分辨、筛选,之后,还要在资料下做注解,画重点,整合相关资料,做目的性分类整理等等。
对于以知识为主的工作者来说,收集资料不能是偶一为之,遇到才做的事情,而是要变成一个长期的、持续的习惯。对于一个自己未来需求的话题、专题或者领域,要不断的收集、阅读、理解、内化、整理、归纳、总结,形成一个真正意义上属于自己的资料库。要做到在自己需要的时候,能立刻在自己的资料库中找到资料的能力。
这就是我说的有效收集资料。具体是如何做到的呢?下面是我就我长期收集资料的心得体会,分享一下对我来说,有效的流程。希望对你也能有一点参考作用。
1、让资料来源“个人化”、“自动化”
在搜集资料的时候,我尽量让资料来源个人化和自动化。所谓个人化,就是我只搜集我需要的,对我有价值的,且是独一无二的资源。所谓自动化,就是让这些信息自动汇聚到我这里来,而不是每天花大量的时间到处去搜集。
我认为在海量的信息中,搜集自己需要的资料,最好的方法,还是使用RSS订阅功能。我用这个功能收集研究与主题相关的博客、微信公众号文章与网站上的资讯,我每天大概花20~30分钟快速浏览和检索收集的资讯,然后把觉得合适和有用的,存储在印象笔记中,并顺手用标签标识、分类。
在收集资料的过程中,我一般不会把那些综合性的大媒体当做我的主要资料来源,原因是,我不想让他们替我决定看什么,而是要我自己决定我要看什么。我也不信任微博这类社群性的媒体上的所谓信息,我觉得太杂太多了,太过于分散精力,所以,干脆自己动手搜集自己需要的资讯。
关于书籍和视频类需要存着才能看的大体积资料,我则是重点在百度云和微盘上搜,然后关注。微盘关闭之后,就重点转到了百度云。在百度云上,我关注了大概有100多个我认为符合我要求的视频和资料分享者,这样,我每天不用去再搜,它们就会自动汇聚到我的百度云盘的分享动态里来,这样,我每天只要几分钟就看完所有的资料了,有需要的,就转存,不需要的,就不用管了。
所以,我觉得这个“个人化”和自动化的流程是非常重要的,用RSS的方式,是自己量身定制了一份个人化的报纸,而百度云上筛选和关注的分享者,则是量身定制做了自己的视频库和书库。
关于个人化和自动化收集资料,这只能算是初级搜集方法,如果有更高的要求,还有其它的更加先进的方法,在这里,我暂时先略过,待改天有时间的时候,我再来专门写一写。
2、保持资料来源的活力,让资料具有观点
上面我谈到了,我不太在微博这类社交性媒体上搜集资料,但并不代表着我从不在上面看东西。
为什么我也还是要花时间看社交性媒体呢?原因是,我们不能只封闭在自己的圈子里,闭门造车,我们还需要碰撞,保持观点、思想和资料来源的活力。所以,在微博上和其它是社交性媒体上,我主要还是看一些可以与我的观点形成碰撞的内容。
具体怎么做呢?我一般将其分为三个步骤,我将之命名为观点三部曲:
1)建立个人化的资讯管道:自己的观点
2)阅读社交媒体上的话题:他人的观点
3)突破障碍(翻墙)阅读:世界的观点
所以,我不仅在日常会阅读微博和微信公众号上的资讯,我还会时不时,在需要的时候,用Google来搜集资料。
就我搜集资料而言,我认为上面的三步,缺一不可。这不仅仅是收集资料应该具有的完整结构系统,这其实是对于观点的三个拓展层次,是层层递进的。也可以说是我对于资料的使用顺序,或者说资料产生价值的三个顺序。
所谓自己的观点,就是用RSS自动订阅自己设立的主题内容,阅读自己认同的网站、公众号和自己信任的资讯来源,从而建立一个每天稳定扩充自己的知识管道,让自己可以跟着大家(一些我认同的大牛、可以给我带来新鲜资讯的作者)一起成长,这是建立自己的观点的步骤。
在有了自己的观点之后,了解他人的观点也很重要。毕竟,我们不能只活在自己的世界里,不能只限在自己的观点里,要想不极端,不要陷在自己为是中不再进步,应该主动去多与他人交流,吸收他人的观点,并与他人形成碰撞,这时候,社交性媒体,就是一种很好的载体和获取观点的来源。所以,微博、微信公众号之类,还是要看看的。
为什么我们还需要世界的观点呢?我认为,朋友圈有朋友圈的局限,国家社会有国家社会视野的局限,要能看到更大世界更大范围的资料,我们不仅需要搜集支持自己证据的资料,也需要反证的资料,此时,就只能翻墙去依靠Google来搜资料了,Google的全球搜资料的能力,没有其它工具可以代替,它是有效让我们看到不一样的世界的最好渠道,更加能开拓我们的视野。
3、海量信息,只取自己需要的那一瓢
用RSS确实可以快速、大量收集到自己需要的资讯,但是,如果每天面对几百上千条信息,人是很容易陷入到资讯的海洋里去的。坦白说,所有资讯和文章都读一遍,也是件不大可能的事。
怎么办呢?我一般都是快速扫描标题,标题内容吸引我的,或者是我关注和关心的,我会打开看看,如果标题本身引不起我的注意,我就一眼扫过拉倒。
为了控制自己花在阅读资讯上面的时间,一般的阅读上限,设置为30分钟。超过30分钟,即使阅读不完,也关闭。资料和信息的获取是无限的,自己的精力是有限的,不必担心自己错过了有价值的资料。实际上,每天错过一些好资料,是常态,错过就错过了,没有啥资料是非搜集来不可的,只有搜集来起到作用的资料才有价值。
另外,为了保证搜集来的资料的质量,我一般会在阅读资料的时候,判断信息源的水平,即便是标题吸引人,如果我连续几次阅读下来,觉得同一个资料源的资料太水,我就干脆取消掉,不订阅了。时间要尽量花在有价值的阅读上。
4、阅读时多做笔记,强化资料的参与性
我有读书时做笔记的习惯,我在看到有价值和有启发的文章时,也会顺手做笔记。如果笔记本不带在身边时,我会用易事贴记,记完之后拿回去贴到笔记本上。
如果是纸质的资料和书籍,我在阅读的时候,一般都是直接在上边画重点,边做笔记,这也就是我在开头所说的,搜集资料和阅读要有参与性。
我认为,收集资料的价值,不再与你屯了多少数量,而再与多少资料会对你产生价值。资料如何产生价值呢?就是它对你产生了启发、碰撞,让你思考,能刺激你产生新的想法,或者加固你对某些观点的认同和支持。
如果收集资料的过只是沦为对信息的拷贝、粘贴,或者只是拿回来,存到资料柜里,从此天涯两茫茫,互相都不打招满,这种收集方式,其实是没有价值的,还不如不收集的好。
即便是你收集的时候,是为未来使用做沉淀,那至少你也要分门别类,确认他是属于哪种类型,如果连分类都判断不出来,做不好,而且存进去之后自己找不到,或者要花九牛二虎的力气才能找出来,那么我建议也还是:别收集了。那纯粹就是在谋杀你的生命和时间。
5、排排坐,吃果果,收集资料也要有优先顺序
在收集资料的过程中,你的优先顺序是如何排的?我想每个人的特点不同,排法可能也不同。我的排列顺序是:想法(观点)、文章、数据(文献)、图片、书籍、音视频。
为什么我会把想法列在最前面呢?因为对我来说,收集资料的最主要目的,是为了刺激我的想法,不管是文章也对,书籍也对,或者音视频也对,如果不能刺激我产生想法,我觉得其价值就不是很大。因此,相对于资料的完整性而言,资料组合的完整性更重要。
比如我的想法和观点,或者可以能刺激我产生想法的观点的资料(基本都是文字),我都是优先存在有道笔记和印象笔记中。因为有道笔记和印象笔记是我每天必会打开阅读的(印象笔记主要存与工作有关的资料,有道笔记则存与兴趣有关的资料),所以放在里面方便,利用率也高。
有道笔记和印象笔记都无法存储和不方便调阅的资料,我才存在百度云盘中。比如我在百度云盘收集的5T电子资料中,其中1.5T是书籍,3.5T是音频和视频资料。书籍大多是PDF版,原因是PDF扫描版没有错漏,视频资料大部分是一些我关注领域的课程或者演讲,以及一些我觉得有价值的纪录片。
至于一些我感兴趣的欧美电视剧、电影之类的,以前我存在百度云盘中,后来我觉得这些大多都是些一次性消费的东西,干脆不存了,直接付费到视频网站去看。如果视频网站上也没有,我则会在百度云客户端直接看完拉倒(我关注的人中,有些非常厉害,几乎可以同步分享连视频网站上都没有的最新的欧美电视剧)。
在分门别类存储后,我对需要的资料大致都有印象,在真正需要查阅的时候,我只要搜关键字,他们就出来了。但我基本上看视频的时候少,还是阅读的时候多。我始终认为,文字资料的查阅和存储才是最高效的。视频资料只有在实在找不到文字资料的情况下才用。因为视频资料的查阅是线性的,太浪费时间了。
以上是我的一些资料搜集的方法,希望对你有用。
- ?
首个FDA批准的AI核医学产品上市,来自硅谷的「深透医疗」率先瞄准“AI影像采集”这个风口上的新机会
左小小
展开
核心提示:
FDA获批的第一个应用在核医学上的人工智能产品完全不影响医院本来的运作流程技术最早出自斯坦福大学的实验室AI医学影像已经在风口上火热了两三年。
赛道上竞争者不少,既包括传统医疗器械公司(GPS)、也有IT巨头(IBM、BATK等),还有一众创新企业(依图医疗、汇医慧影、图玛深维、推想科技、深睿医疗、Airdoc、视见医疗、迪英加等)。 据不完全统计,目前我国从事医疗AI研发的企业有120家之多,并诞生了多家独角兽公司。
面对赛道上玩家“扎堆”的景象,36氪近期接触的「深透医疗」则打算“避开拥堵”,切入风口中技术门槛更高、市场规模更大的细分领域——AI影像采集。
虽然市场上AI医学影像公司很多,但玩家们其实只聚集在少数病种的影像分析(肺结节、眼底等细分领域)。根据美国市场的数据,后期影像分析只占整个医学影像市场的10%左右。而「深透医疗」采取的切入口是“影像采集”,在医学影像整体花销中占比90%,市场空间更广阔。由于这个方向的产品研发需要对影像采集、人工智能等多领域的技术要求,目前没有太多AI医学影像公司涉及,直接竞争者较少。
「深透医疗」来自美国硅谷,其技术最早出自斯坦福大学的实验室。该公司成立一年多,在这一年多时间内从licence-in到FDA获批,节奏是比较快的。12月初,该公司产品拿到FDA认证,成为第一个FDA获批的应用在核医学上的人工智能产品,也是FDA批准的针对图像增强的人工智能产品。接下来,该公司打算同时打开美国和中国两个市场。
目前,「深透医疗」已获两轮融资。种子轮来自美国大数据基金Data Collective、真格基金、百度风投、清源创投、Wisemont Capital等。今年5月,完成500万美元的Pre-A轮融资,由美国老牌基金Bessemer Venture Partner与美国大数据基金Data Collective领投,跟投方包括种子轮投资人、Facebook投资人Jim Breyer和Fusion Fund。
市场情况来看,美国一年有超过3000万磁共振检查以及约200万PET检查。其中,MRI磁共振和PET核医学分子影像,这两种影像是价格最贵(美国MRI约为1000美元;PET约为3000美元)且速度最慢的(在美国一般需要30-60分钟)。因为检查速度慢,美国市场上的患者通常需要排队3周,才轮到做检查。速度、成本、安全性是这个市场中亟待解决的痛点。
「深透医疗」就针对MRI磁共振和PET核医学分子影像,通过深度学习和图像重建技术,增强影像质量和效率,从而用更少的时间与剂量获取诊断级别甚至更高质量的医学图像。
具体来说,PET主要适用于检查肿瘤、脑部疾病(如阿兹海默病)。患者需要在机器上一动不动躺半个多小时,才可以完成检查。因为检查时间长,患者的轻微移动还会形成运动伪影。「深透医疗」通过优化数据重建成图像的过程,在保证诊断级别精确度的情况下,使PET加速4倍以上。PET检查会使用放射性试剂,「深透医疗」的技术也可以大幅度地降低放射性试剂剂量,对病人、操作人员以及医院都更为安全。该公司近期获得的FDA批准,就是应用于PET检查的产品。
MRI主要应用于检查脑部、组织等,几乎覆盖了医疗影像可检测的所有病种。与PET类似,「深透医疗」也是通过优化数据重建成图像的过程,在保证图像质量的前提下,使MRI加速4-10倍。MRI检查本身没有辐射,但是很多MRI会用到基于重金属钆的造影剂。美国FDA、欧洲CE以及中国CFDA都对于钆造影剂在人体内沉积问题提出了警告。基于速度的提升,「深透医疗」提供的方案,可以大幅降低MRI的钆使用剂量,从而降低钆在病人体内的沉积。
总结来说,「深透医疗」可以覆盖几乎所有病种,在保证诊断级别的精确度的前提下,使得PET检查加速4倍以上,MRI检查加速4-10倍。
「深透医疗」提供的产品形态是软件,这种软件是与传统的检查仪器配合使用的。目前仪器市场由通用医疗、西门子、飞利浦、东软等影像设备商占据,而「深透医疗」已经与这些公司建立了合作,使得其软件可以兼容各种品牌机器型号,普适性强。
换句话说,传统方式是患者躺在仪器上,由医生通过电脑完成检查;而该公司提供的方式完全不改动患者和医生本来的位置,只是在电脑上增加了兼容的软件,完全不影响医院本来的运作流程,医院也不需要调换设备。
此外,该公司还形成了数据壁垒。「深透医疗」具备斯坦福大学独家授权的3项专利和大量医学影像数据(包括超过200万张MRI、PET/CT、PET/MR影像)。同时,公司已经与UCSF、MD安德森肿瘤医院、梅奥医学中心、RadNet等十几家美国排名靠前的医疗院校、医院及第三方影像中心展开临床合作,累积了更多的跨病种、多模态的数据。在国内,该公司也建立了与301医院、天坛医院的临床科研合作。
为了拓展市场,该公司也在与医疗AI平台公司建立合作,已经与Nuance、intel和NVIDIA等在医疗AI领域布局搭设技术平台架构的大公司展开合作,加入这些公司的产品生态中。
因为刚拿到FDA批准,接下来「深透医疗」将开始落地,主要会选择在大医院、第三方影像中心落地。未来,该公司计划提供更多的产品线,针对MRI的两款产品正在申请FDA,预计明年年初能得到结果。未来产品的发展重心是提高检查速度、提高图像质量。
国内的医疗情况与美国有一些不同,国内情况是采集速度足够快,但采集的数据质量不稳定,效率低。因此该公司针对国内市场的产品会在美国现有产品的基础上,重点来解决在同样或更短的时间内更有效地采集影像数据,提高诊断质量与效率。
对于行业的未来趋势,该公司CTO张涛对36氪说道,“接下来整个AI+医疗行业要攻克的难点就是技术落地,怎么样让技术在应用中真正产生实际价值。AI也有它的限制性,怎么样与现实情况更好地融合,这是行业正在探索的。”
核心团队情况上,创始人及CEO宫恩浩是斯坦福大学电子工程系博士,具备医学与工程复合背景,研究方向为深度学习与医学影像研究,多次获得国际磁共振学会以及北美放射学会研究奖项,并在今年获得福布斯中国“30 under 30”。联合创始人Greg Zaharchuk是斯坦福大学医学院教授、放射科医生、神经影像专家,曾获得美国放射学与生物医学影像研究学会的杰出研究者奖,拥有多项专利。CTO张涛是斯坦福大学电子工程系博士,具有十余年的医学影像科研经验,曾供职于GE Healthcare、MD安德森肿瘤医院。朱立人是圣路易斯华盛顿大学生物医学工程系博士,具备十余年生物医学成像技术研究经验,共有二十余篇论文发表与Science Advances、Nature Biomedical Engineering、Nature Communications等学术期刊。
- ?
使用七牛大数据平台玩转直播实时质量监控
腓特烈西亚
展开
背景
去年( 2016 年)被称为直播元年,各类移动直播平台如雨后春笋冒出,不断满足人们对强交互、高实时性的新媒体载体的要求。直播过程中所涉及的环节众多,诸如推流、网络传输、节点调度、流处理和播放等,要全面地建立起一套能够对各个环节性能进行监控的系统绝非易事。目前七牛直播云已经建立起一套完善的内部数据监控平台,实现了一个智能调度、按需伸缩、高容错的实时流网络,我们称之为 LiveNet。LiveNet 完美解决了直播场景的三高之痛:技术门槛高、成本高、卡顿延时率高。
然而,在实际的客户对接及服务过程中,各式各样的问题仍然不可避免,如直播卡顿、马赛克、花屏、黑屏、杂音、音画不同步等等。这些问题中,有些是传输链路原因,有些是用户的使用姿势引起,有些是参数配置错误所致,也有些是直播 SDK 本身的问题。很多情况下,如果没有足够的数据线索进行支撑,应对线上用户反馈的这类问题,直播平台开发者经常两眼一抹黑,定位问题基本只能靠猜。通常情况下,在直播客户没有建立自己的直播质量监控系统时,七牛云的专业技术服务团队是客户排障的第一选择。针对绝大部分常见的问题,七牛云技术支持能够快速提供排查建议,如帮助查询某路直播流的实时状态,判断主播推流的稳定性。
但是,由于七牛云直播技术支持并没有直接接触到各个直播客户的终端用户,在问题排查过程中难免存在信息不对称的情况,增大沟通的时间成本。特别是当直播客户线上问题集中爆发时,如果直播平台的开发者没有一个系统的途径能够进行自查,势必使得该直播平台的用户体验陡然下降。那么,建立一个直播质量监控系统需要有哪些投入呢?以下我们为您详细解析。
直播质量监控系统
通常来说,如果要建立一套自己的直播质量监控体系,一般要完成以下几个步骤:
在 App 端埋点,收集由直播 SDK 回调的音视频帧率、码率等与直播质量相关的数据,并进行上报;建立一个收点的网关,如果数据量太大,还需要 Kafka 等队列做数据缓存;搭建 HDFS 、 Elasticsearch 等存储服务,将接收的 QoS 数据转存到这些存储系统;搭建一套实时/离线数据流分析服务;数据可视化展示、告警系统。
实现以上功能,不仅需要有一个资深大数据背景的技术团队和客户端团队的支撑以及漫长的开发周期,系统上线后仍需持续投入精力持续维护迭代,以应对诸如逐步上升的数据量;若是对平台的横向扩展能力没考虑周全,众多开源组件崩盘的风险很可能会让之前的投入白费。
那么,有没有一种不需要自己造轮子的途径,去实现绝大部分质量监控功能?如今,我们给出了肯定的回答!借助于七牛大数据平台 Pandora,以及七牛直播云 SDK 所集成的 QoS 质量上报模块,七牛直播云用户能够快速打造一套属于自己的实时直播质量监控系统,并实现各种维度的自定义分析能力。
七牛大数据平台 Pandora
七牛大数据平台 Pandora 是一套面向海量数据,能够让基础技术人员轻松管理大数据传输、计算、存储和分析的大数据 PaaS 平台,提供简单、高效、开放的一站式大数据服务,核心服务及功能包括大数据工作流引擎、时序数据库、日志检索服务、Spark 服务、报表工作室。同时提供了海量离线数据分析等众多大数据分析工具支持,并结合七牛云生态,赋能应用大数据的核心能力,让用户可将资源精力聚焦于业务价值提升而无需担忧复杂的大数据技术和部署运维难题。
直播 QoS
直播质量 (QoS)实时上报模块几乎是每个高品质直播 SDK 的必要组成部分,它对于提升直播 SDK 性能以及直播网络的节点调度策略、链路质量具有重要作用。七牛云直播 SDK 的 QoS 模块使我们可以对终端用户连接的节点进行实时监控,了解其推流失败次数、卡顿次数以及卡顿时长。通过推流性能的实时监控和服务端实时调度系统的结合,可以实现对推流用户线路和节点的调整。
如何启用七牛直播质量监控服务
直播云 SDK 集成 首先,请确保您的直播 App 集成了最新版本的七牛推流/播放 SDK。是的,在移动端,您要做的就是这么简单!
创建 Grafana App
载入我们为您提供的 Grafana 配置 完成以上步骤后,便已万事俱备,只待直播质量日志的持续上报。
至此,您已经可以:
在 Grafana 中观察到精细到每个流的质量变化曲线;通过 Pandora 日志服务 LogDB 所提供的强大日志检索功能,快速回溯追踪每个流或某个用户设备的数据。
Grafana 数据可视化展示
目前,我们为您预先内置了五个直播质量统计场景,分别是推流状态、服务器状态、播放地域统计、播放终端跟踪和地区运营商状态。
推流各质量指标曲线,实时查看每个推流的音视频帧率、码率等指标的变化
地区运营商平均推流质量曲线,可快速了解某地区、某运营商的总体推流状况
播放终端质量曲线,查看总体播放质量变化,或精细到单设备的各项播放指标监控
直播流在某区域运营商的播流质量曲线,让每个流在每个城市、运营商的播放质量都能得到监控
推流加速节点的平均质量曲线,用于帮助判断是否由于推流节点的负载变化导致直播质量的变化
需要指出的是,这些内置场景只是 QoS 数据的一小部分应用,您可以根据需求拓展或增加 Grafana 的 Dashboard,关注您想要的质量维度。
LogDB 直播质量日志检索
事实上,直播质量日志在被可视化呈现之前,会被先导入到 Pandora LogDB 日志检索服务中。您可登录七牛官方网站,在日志检索模块中进行直播质量日志搜索。并且 LogDB 无缝兼容 Elasticsearch 协议,您也可使用我们为您提供的 Kibana 应用玩转日志检索。通过质量日志搜索,您可以进行各种直播问题的查询,如根据某个设备 id 进行单用户的日志回溯,进行用户级别的直播排障。
直播排障
那么,这些可视化图表及日志搜索该如何派上实际用场呢?下面我们就以一个常见的直播排障场景来说明这些数据在定位问题中能够给到直播厂商的帮助,使直播平台的技术人员能够自助快速排障。
假设某个主播向直播平台反馈直播卡顿,那么,直播平台的技术人员首先获取到该主播的流 id,然后在 Grafana 的流状态Dashboard 中,过滤出这个流,发现其推流曲线如下:
从时序图中,可以看到有几个时间点推流的音视频帧率、码率都降为 0,存在一定的波动。那么,这个波动是由什么原因引起的呢?是主播的网络不稳定?主播将直播 App 退至后台进行了其他操作?还是推流的节点负载过重?
为了回答上面的猜测,直播技术客服利用日志检索服务进行更进一步的问题追踪,那便是在 LogDB 中搜索推流 id,回溯主播的推流行为。
通过搜索该主播设备上报的直播质量日志,可以发现,在音视频发送帧率降为 0 的几个时间点,其音视频的编码帧率也为 0,并且视频发送缓冲区的丢帧率为 0,这说明了并非由于主播网络问题导致发送丢帧,而是直播 App 退至后台导致音视频的采集被挂起。此时基本可以判定直播不畅的锅该由主播自己背,平台可以帮助矫正这个主播的使用姿势。
更进一步地,如果全部情况都表明主播的网络质量良好,操作正常,那么可以观察该直播流所连接节点的情况。若该节点其他的流也存在类似的波动,那么证明节点的负载过重,可为这些直播流进行推流节点的调度以优化推流质量。
以上,通过简单的几步查询,直播平台便能自助针对单个用户的问题进行定位排查,极大缩短了线上问题的解决周期,提升平台用户体验。
告警设置
除此之外,我们还为您创建的 Grafana 提供了完善多样的报警功能。使您能够对重点关注的直播质量指标进行监测,主动发现并解决问题。
我们同样以一个场景来说明告警的使用姿势。比如,您可能很关注播放终端的平均接收码率,因为它直接关系着用户观看的视觉体验。假设您期望播放码率的平均值应该在 800Kbps 以上,那么就可针对这个指标设置一个告警监控。如下图:
一旦监测的平均播放码率小于期望值,那么您将收到如下一个报警消息。此时,直播平台运维可快速做出响应,查看问题出现的原因。
啊哈,原来如此!
那么,开通了基于 Pandora 大数据平台的直播质量监控之后,您的客户端质量数据又是如何被实时处理并呈现在您的面前呢?以下便为您揭晓个中奥秘。
过滤用户数据
直播 QoS 数据被客户端上报后会进入收点服务的消息队列(Kafka)中,利用一个内部数据采集服务,我们从消息队列中根据推流域名实时过滤并拉取不同客户的 QoS 数据,转发到对应账号的 Pandora 大数据工作流中。
事实上,Pandora 本身提供了一个强大的通用数据采集工具,它适用于各类日志数据收集场景,比如:10分钟内快速构建能够承载海量数据的 nginx 日志分析与报警平台
Pandora workflow 数据加工
在 logkit 将您直播 QoS 数据上报至 Pandora 时,会自动建立如下一个大数据工作流,目前是将 QoS 数据直接导出至下游的 LogDB 日志检索服务。Pandora 还提供了其他多种导出选择,如导出到七牛对象存储,可将全量日志进行持久化;也可将日志转发到您自己的 HTTP 服务,使直播质量数据在您自己的服务框架中派上用场。
分析维度延展
利用大数据工作流引擎,您可以利用上报到数据源中的 QoS 数据进行更多维度的自定义分析,只需在实时工作流中新建 Transform 计算任务,便能对上报的数据进行进一步的聚合处理,导出更多维度的数据。 例如,我们甚至可以利用 QoS 数据进行活跃用户数这类简单的运营统计分析,只需新建如下一个计算任务,加之简单的一段 SQL 代码,便能计算出各个省份每五分钟内安卓活跃用户的数量。计算结果可选择导出到 LogDB、时序数据库、七牛对象存储或是您本地架设的 HTTP 服务,即将 Pandora 的直播质量分析结果回流到您的平台进行落地。
离线分析
除了利用实时工作流进行分析外,您还可创建离线的 XSpark,分析更多更久的海量数据,详见 「XSpark 使用入门」
后记
如果您已经是七牛直播云的用户,那么只需联系七牛 Pandora 团队申请开通,审核通过之后,我们将为您提供一个开箱即用的直播质量数据监控应用。
如果您使用的是非七牛的直播 SDK,那么,别着急,我们正在准备一个直播数据埋点 SDK,方便您进行相应的自定义直播质量数据上报。为了保障您的数据隐私安全,该 SDK 将全部开源,做到真正开放透明。同样地,欢迎联系我们,与我们交流您所期望的直播质量监控需求。
七牛大数据平台 Pandora 目前处于有限开放阶段 点击咨询申请:http://qiniuyun.mikecrm/ZKDzpwf
- ?
BasicFinder 标注平台数据科学家吴昊:从数据采集与标记行业看数据与深度学习之关系(分享总结)
初曼
展开
雷锋网 AI科级评论按,深度模型在机器学习很多领域都取得了巨大成功,但也对算法的原材料训练数据提出了更多的要求。对于研发高水平的算法,数据的高质量采集、清洗、处理等等对算法效果会有直接影响。
在近期雷锋网 AI研习社的线上分享会,来自 BasicFinder 标注平台的数据科学家吴昊为大家介绍了数据规模、数据质量等与深度学习算法之间的关系,以及为算法做数据准备的一些经验。
吴昊,本科毕业于上海交通大学,硕士毕业于纽约大学,现任 BasicFinder 标注平台数据科学家,专注于数据众包策略研究、深度学习模型数据采集与标记方案咨询及优化。
分享内容:
大家好,我叫吴昊。本科毕业于上海交通大学,研究生毕业于纽约大学。我之前做过两年左右的算法研究工作,我们公司 BasicFinder 平台主要提供一些数据方面的服务,包括采集、标注、清洗、其它别的加工等等。我今天分享的主题是AI数据面面观。
下面是今天分享的目录,分为四部分:
数据规模
数据质量
无监督学习与迁移学习
做算法研发在数据准备方面的注意事项
数据规模
先看数据规模,数据规模与算法模型的容量其实是比较相关的。算法模型的容量越大,就意味着算法能表示相对来说更复杂的关系。
当数据规模相对过大时,在训练过程中容易产生欠学习(underfitting)。另一方面,在数据规模相对过小的情况下,就会产生过学习(overfitting)。
近年来流行的深度学习模型可以拥有非常大的容量,模型中普遍用的神经网络算法,层数可以增加,每层神经元个数可以增加,那么模型的表达能力也会增加。下图是一个例子。此外学术界也会做一些新的研究来增加模型的表达能力。另一方面得益于GPU,比较复杂模型的训练也会比以前快很多。
现在有一个问题,数据更多的话效果就会更好,那么究竟有多好呢?Google的一遍论文解决了这个问题。
这个数据集是ImageNet的两百多倍。随着数据集里样本数量的增多,在COCO上的结果比用之前的数据集至少高出三个点,而在算法的其他方面都没有太多变化。可以看到数据规模的增大对算法的效果提升还是比较明显的。
在工业界,数据规模更容易成为算法研发的关键因素。如果有更多的数据,就可以使用容量更大、更复杂的模型,得到效果更好的算法。当数据大到一定程度,数据和算法之间可以进行反复迭代,形成壁垒,为公司提供竞争力。
数据质量
数据质量会影响算法效果。
对于质量一般的数据,比如经过爬虫得来的数据,经过清洗、处理后,算法效果会有明显提升。如果数据质量已经很高了,再去提升数据质量,算法效果的提升比较有限。
另外还要考虑到成本和收益的权衡问题:想获得质量更高的数据,成本也会更高。
接下来讲一下对数据质量的评估。数据质量评估主要包括两个方面,一是原始采集数据质量,二是数据标注质量。
下面是对原始采集数据质量的评估:
图像、视频:分辨率,清晰度,光照,色彩等
语音:清晰度,背景音等
文本:是否自然语言,是否专业,与主题相关性等
下面是对数据标注质量的评估:
标注正确率(类别数据)
标注精确度(坐标、时间点、个数、文字等)
标注完备性(是否漏,是否重复)
标注一致性(前后规则是否一致)
人工标记的大规模数据一般都会含有噪声,一些经典数据集也含有噪声,例如人脸LFW、MS COCO等,这是不可避免的,不过在可以接受的限度内就行。
无监督学习与迁移学习
接下来谈一下无监督学习与迁移学习,迁移学习已经有一个比较大的数据集作为基础了,再用人工标注一小部分新数据。
对于无监督学习,基本上不需要人工标注,主要是学习数据本身的分布特性。比如说聚类算法,就是试图找出数据集中分布的中心,所以不太需要人工标注。
目前工业界相对来说比较好的结果还是通过监督学习而来,很多都需要大量人工标注的数据。无监督学习和迁移学习在未来还是有待学术界研究,以望更大的突破。另外,在未来数据规模进一步提升的情况下,无监督学习和迁移学习会有更多的用武之地。
数据准备方面的一些经验
最后介绍我们在开展业务中的一些经验。
数据准备最开始是数据获取,数据的获取也分为几种情况,比较常见的是互联网公开获取(公开数据集、爬虫等),除此之外还有专业数据采集。在专业数据采集时,需要考虑采集方式:一是采集内容、采集规模、预算;二是采集过程要尽量与实际使用场景相一致;三是要考虑对数据集的要求,比如多样性;四是采集是否涉及隐私、个人权利如肖像权、著作权等。
最后还有采集时间的要求。
然后是数据清洗。采集来的数据很多都需要清洗,例如爬虫、监控视频等。
数据清洗之后就要进行数据标注,标注的规则要尽可能地详尽、清楚,需要给出文档和例子。专业的标注过程,一般有试标阶段,这个阶段需要详细了解并确定需求。此外,在试标和正式标注过程中也会遇到不确定的情况,需要及时进行沟通,否则可能会影响到整体标注质量。
对于数据标注的方式,以及最终的输出格式,都需要算法研发人员来制定,有可能的话还是尽量使用常见的方式和格式。
数据标记完之后就是数据审查。做审查主要参考对数据质量的要求(正确率、精确度、完备性、一致性等)。审查方式有抽查、排查特殊指标、利用某些特征排查异常值这几种。
结论如下:对于算法来说,数据越多越好、越广越好、越准越好。在现有的情况下,监督学习的效果优于无监督学习/迁移学习。
雷锋网 AI科技评论。
- ?
科工网——质量信息化解决方案过程
伊迪丝
展开
质量信息化解决方案
1、 需求背景
21世纪是质量的世纪,企业能否构建具有竞争力的质量管理平台,并发挥作用,将决定其在21世纪的生存与竞争能力。
企业在建立了质量管理体系并通过认证后,
如何保障管理体系的规范、高效运行?如何全面收集和及时、准确共享产品质量信息?如何利用产品质量信息,对关键质量过程进行监控和预警?如何对质量问题进行闭环跟踪处理?如何及时掌握产品质量状态,实现高效、便捷的质量追溯?如何对产品设计质量进行控制以及进一步改善质量基因?如何对质量信息进行统计分析、深度挖掘。
预防和过程控制是企业质量管理永恒的话题。在信息化时代,构建企业级质量信息化集成平台,是实现企业质量战略和信息化战略的重要举措。
QMAX质量信息化集成平台是安世亚太专门为中国复杂装备研发和制造企业开发的企业级质量管控信息化平台。
QMAX质量信息化集成平台实现质量管理的“知控管谋”和“可视化”;是一个开放的“平台”,能够根据企业业务特点和管理咨询结果进行快速二次开发;也是一个集成的平台,能够与企业其他信息系统进行集成,对质量信息进行集中管理。
针对复杂装备研发和制造企业的运营模式及业务特点,QMAX质量信息化集成平台提供:面向复杂装备研发的质量信息化解决方案、面向复杂装备制造的质量信息化解决方案和面向集团架构的厂所协同质量信息化解决方案。根据行业特点及管理标准的不同,可进一步细分为面向航空、航天、兵器、机车、电子等行业化解决方案。
2、解决方案
(1)、面向复杂装备研发的质量信息化解决方案
面向复杂装备研发的质量信息化解决方案重点体现策划充分、质量预防、过程控制和持续改进的设计思想,是支持产品研制过程质量保证的重要手段。
策划充分——通过对研发过程进行基于WBS工作包的质量策划,形成保证产品质量所需步骤的质量控制点及要求。对策划的结果,采用多层次的图形化面板满足用户对大型复杂系统在研发活动中的多型号、多过程、多专业、多维度的实时质量监控与评估。
质量预防——在项目研制过程中,系统以研发活动中的WBS工作包为主线,实现对设计活动的质量控制要点、历史故障经验等信息的提醒与预防。
过程控制——通过每个工作包所对应的质量控制要求、质量规范和模板,对研发活动进行针对性的检验与过程控制和评审。
持续改进——对控制过程中产生的问题,提供规范化的处理模版,确保问题得到闭环处理,并通过对研制过程全生命周期的评估、监控、追溯体系,实现研制质量的持续改进。
(2)、面向复杂装备制造的质量信息化解决方案
以“知、控、管、谋”为建设目标,实现企业质量管控体系的持续改进。
可知——通过先进的数据采集及系统集成手段,实现对企业产品设计信息、工艺信息、生产加工信息、装配信息、售后反馈信息等质量信息的快速采集与管理,达到信息的可知。可控——通过对关键过程进行规范与控制,实现对外购外协件、生产加工过程、装配过程、审核过程及售后反馈过程的质量状态进行有效的管控。可管——对于过程产生的数据、经验信息进行结构化的组织与整合,实现面向产品的经验库系统,促进产品质量的持续改进、质量数据的查询与追溯;通过协同监控与管理层,实现对质量目标、体系运行状态、质量成本状态、供方质量状态、质量问题状态的可视化、数据化管理。可谋——质量评估与考核的数据,来自于系统各个底层模块,对可视化、数据化、科学化决策提供支持依据
(3)、面向集团架构的厂所协同质量信息化解决方案
打通集团企业内部、集团成员单位之间、外部相关单位之间的质量信息链条,有效消除信息孤岛,促进集团整体质量管控能力的提升。
—通过打造集团与成员单位的质量信息一体化平台,可改变“信息层层汇报”的采集、传递模式,打通上下互通链条,实现信息传递及时、准确、高效、规范、完整。
改变质量信息不能满足全面质量管理需要的局面,实现以数据为依据的决策支持。
实现型号产品协同监控一体化,实现在多场所协同、交叉配套的研制模式下,对型号产品整体质量情况及时了解、快速追溯、准确定位。实现对成员单位进行科学的综合质量考核管理,改变被动与分散化的管理状态,构建以成员单位综合能力评价模型为核心,评价数据真实可靠的新型质量保障体系。实现对重点型号产品、重大质量问题的闭环跟踪管理;通过质量资源管理,进一步促进集团质量经验与资源的流动,实现质量知识有序积累、充分共享和利用。
3、客户价值
实现质量业务流程的有效运行
通过信息化手段,转变传统的质量管理模式,为质量管理人员提供一个基于流程的、电子化及网络化的质量管理工作平台,通过此平台开展日常质量保障、控制和改进工作,实现质量管理工作的在线处理及网络化的动态协同,提高质量工作处理的规范性和工作效率,从而保证质量管理体系的充分性、适宜性和持续有效性。
实现质量信息的有效整合
实现和企业现有信息化系统(如项目管理系统PMP、产品数据管理系统PDM等)及规划中的信息化系统之间的无缝集成,改变质量信息被割裂在多个系统之间的现状,将散落在各系统中的质量信息进行汇总、整合及共享,消除信息孤岛,保证质量信息的完整性、关联性和系统性,为质量信息的有效应用提供坚实的保障。
实现质量信息的高效应用
借助信息化的优势,实现对质量数据的全面采集、系统化组织,结构化存贮、快速查询、智能化统计、多维对分析、准确追溯及灵活打包,充分挖掘数据价值,实现质量数据应用,使质量数据真正成为质量管理的血液,保证质量管理体系的持续有效性。
实现产品全寿命周期的质量控制
利用计算机及网络技术,协助进行设计质量管理、供方质量管理、生质量管理及售后质量管理,在实现对这些过程产品质量进行有效控制的同时,也实现质量信息在这些过程中的贯通和汇总,形成型号产品的完整质量数据包,为产品、过程及质量管理体系的持续改进提供坚实的数据保障。
实现实时的质量协同监控和质量决策
通过使质量信息在质量业务、管理层及质量层之间的纵向贯通、传递和反馈,为企业高层领导(及各层管理人员)提供质量协同、监控及决策手段,包括协助对重要质量问题的协同处理、对质量管理流程运行状态的监控、对质量趋势把握、对影响质量的关键因素的判读及正确质量决策的制定。
4、案例应用
中国某装备集团
(1)、项目背景
中国某装备集团公司成立于1999年7月,是经国务院批准组建的特大型中央企业集团,集团公司主营业务收入、工业企业销售收入、民品销售收入、人均销售收入、人均利税均居国防科技工业第一位,是国防科技工业市场化程度最高、发展速度最快、民品规模最大、军民结合最好的军工集团,成为我国最具活力的军民结合特大型军工集团之一。
(2)、面临挑战
当面对用户对装备产品日趋严苛的质量要求时,集团领导逐渐认识到在积极支持成员单位创新发展的同时,借助信息化手段实现集团层面的质量管控已经刻不容缓。首先,要实现对成员单位质量目标、计划以及重大质量问题等的全面监督和管理,必须建立双向的信息传递系统,实现质量信息数据的上传下达;其次,由于集团与成员单位网络物理隔离,需要中间数据交换平台协助完成系统内数据的双向通信;另外,成员单位内部质量管理过程中又突出存在质量信息采集手段落后、质量数据传递环节不流畅、应用统计技术及统计工具的水平较低、缺少现场质量监控工具等问题,虽然部分成员单位现有系统已经涉及一些质量管理模块,但如何避免重复建设带来的人力物力浪费,妥善解决新系统与现有系统的集成应用等问题……都是项目建设过程中需要重点关注和解决的。
(3)、解决方案
为解决上述问题,企业规划搭建包括集团和成员单位的两级质量管理信息系统,通过系统部署实现集团总部到成员单位的质量管理一体化模式,同时为企业几大业务板块提供质量信息技术支持。
方案优先考虑进行集团级质量管理子系统主要模块开发和建设,包括管理仪表盘、目标计划、月季报、重大质量问题报告和处理、重点产品质量监控、国防质量信息公告、相关标准、质量知识库等;其次进行成员单位级质量管理子系统公共管理模块开发和建设,包括目标管理、计划管理、月季报、质量审核管理、计量管理、试验管理、改进管理、质量文档管理及任务管理的系统建设。方案重点关注集团级质量管理系统建设和成员单位公共功能结果数据的录入。
(4)、运行效果
该项目是“某集团公司信息资源共享平台”的重要建设内容之一。该项目构建一个基于信息化、网络化的质量管理工作平台,为集团总部及成员单位内部和业务相关方提供质量管理、控制和质量监测的数字化管理环境。建立数字化质量业务工作平台,实施范围涵盖整个集团,包括集团总部及42个直属的二级单位,涵盖14个省市自治区;实现集团总部及下属成员质量监测及在线处理、网络化协同,提高质量事件处理的规范性和处理效率,实现质量经验的共享和有效传承。
- ?
承儒夺标“深圳龙华区教学质量数据采集及分析服务项目”
Dong
展开
新学期开学伊始,深圳承儒便凭借着先进的测评技术、丰富的项目经验以及完善周到的服务体系以绝对优势中标“深圳龙华区教学质量数据采集及分析服务项目”。该项目旨在通过对龙华全区的教育数据进行全面采集、进而对数据进行挖掘与分析、最终自动生成适用于龙华区中小学教育体系中不同层级、不同岗位用户的个性化诊断报告,并针对诊断结果智能推送相应的解决方案,从而全面提升深圳龙华区的基础教育教学质量。
通过此次项目的合作,深圳龙华区教育局希望借助互联网的手段,利用大数据与现代测量技术对本区的教育教学进行全面的监测与评估,项目以期建立用“数据说话、用数据决策、用数据管理、用数据创新”的教育管理机制,实现基于数据的科学决策,积极利用分析结果对全区教育教学进行指导。
对不同层级角色而言,
1、帮助学校对教师考核提供科学的依据;
2、帮助学校和教师及时了解教学中的问题和缺陷;
3、帮助学生及时了解学习中的困难和找到有效的解决方法;
4、帮助教师和家长了解学生真实的学业水平和提出宝贵的意见。
按照项目需求,深圳承儒一方面将为深圳龙华区搭建完善的网上阅卷环境并做好各次考试监测的阅卷服务工作,对龙华区包括所有学段(包括小学高学段、初中、高中)、所有科目的多次考试进行扫描及阅卷服务,其中包含有期末测试、抽样测试、中高考(模拟)考试,所涉及的学科包括语、数、英、政、史、地、物、化、生、文综、理综、道德与法制、信息技术、综合活动实践等。
另一方面,深圳承儒将为用户搭建一套功能强大的《教育质量动态监测与评估系统》,并给全区师生提供一套富含测量属性的多达600多万道优质试题的题库系统与在线学习环境。该系统应用现代测量理论,引入“精准评价”和“增值评价”的理念,用具体、明确的量化指标和条理化的信息,取代笼统、模糊和经验式的评价模式。动态地监测和评价教学质量,从而能够通过监测数据跟踪到各层次教育教学质量的进展与变化,科学诊断教育质量问题,提高政府部门的教育决策的科学性。
“十三五”期间,国家在全面提升教育质量、加快推进教育现代化进程等方面提出了更高要求,提出“各级教育部门和学校开展深度数据挖掘与分析,运用互联网、大数据提升教育质量水平”等战略要求。作为“互联网+教育”的先行者,深圳承儒始终高度重视教育发展和创新建设,经过多年的不断耕耘、厚积薄发,深圳承儒拥有行业领先的测评技术,积累了丰富的大数据测评经验,深圳承儒将一直致力于应用大数据与测评技术从学习环境、教育内容供给、教与学方式和管理评价等方面重构教学生态系统。
- ?
「科技日刊」研究人员开发了种新高质量人工智能训练数据采集方法
洪初珍
展开
转载自百家号作者:梦之爱雨
微软必应团队的研究人员开发了一种为训练机器学习模型生成高质量数据的新方法。在.博客帖子和纸在盐湖城举行的计算机视觉和模式识别会议(CVPR)之前,他们描述了一种能够区分标记准确的数据和标记错误的数据的系统,其一致性令人印象深刻。
研究人员写道:“获取足够高质量的培训数据往往是构建基于人工智能的服务最具挑战性的部分。”“通常,被人类标记的数据是高质量的(错误相对较少),但代价很高-无论是金钱还是时间。另一方面,自动方法可以大量生成更便宜的数据,但会导致更多的标签错误(“标签噪声”)。“
正如Bing团队所解释的那样,训练算法需要收集数十万甚至数百万的数据样本,并将这些样本分类-这是一项艰巨的任务,由数据科学家手工完成。一种常用的快捷方式是从搜索引擎中“抓取”数据,方法是列出一个类别列表,对列表中的每一项进行网络搜索,并收集结果。(例如,在构建计算机视觉算法的语料库过程中,您可以对不同种类的食物进行图像搜索。)
但并不是每个结果都与搜索类别相关,训练数据中的错误会导致机器学习模型中的偏差和不准确。减少错误标记问题的一种方法是训练第二种算法来查找不匹配并纠正它们,但这是一个处理密集型的解决方案;必须为每个类别训练一个模型。
必应团队的方法采用了一个人工智能模型,可以对错误进行实时校正。在训练过程中,系统的一部分-类嵌入向量-学会自动选择最能代表每个类别的图像。同时,模型的另一部分-查询嵌入向量-学习将示例图像嵌入到同一个向量中。随着训练的进行,系统的设计方法使得类嵌入向量和查询图像向量在图像属于类别的情况下变得越来越相似,如果不是的话,则更接近于类嵌入向量和查询图像向量。
该系统最终确定了用于为每个类别查找具有高度代表性的图像的模式。研究小组说,它甚至在没有经过人工验证的标签的情况下可靠工作。
“该方法讨论了…已经被证明是非常有效的,为图像相关的任务产生干净的培训数据,“该小组写道。“我们相信它将是同样有用的…适用于视频、文字或语音。“
- ?
太友QCData:助力汽车零部件企业实现高效数据采集与质量管控
Ferdinand
展开
【前言】
汽车制造业是机械制造业的重要组成部分,主要以离散型生产为主,离散型就是将单独的零部件一个一个进行组装最终形成产品,以零部件的拼接为主要的工序。汽车制造业产品的质量在很大程度上是受到零部件采购的质量影响,因此提高零部件采集质量管理,做好零部件的基础工作管理,对于不合格的产品需要进行严格的控制,保证采购零部件的质量。
【案例讲解】:某汽车零部件企业实现高效的数据采集与质量管控
企业背景:该企业是国内专业生产中小型车用发动机及零部件的企业,年产各型号发动机20万台套。
该公司面临的主要挑战包括:
公司质量总部负责协调管理分布在两个不同地方的工厂的质量控制和持续改进工作。两个工厂的生产线和测量车间都有大批用三坐标测量仪(CMM)、圆度仪、影像测量仪等测量得到的数据,但这些数据都分散存储在独立的数据文件中,且格式各不相同,这就给这些数据的利用造成了不小的挑战:
① 往往同一个零件的圆度测量数据文件在一台电脑上,而长度或其他尺寸的测量数据文件在另外一台电脑上,每次进行数据分析时,需要先从各地方归总数据,花很多时间进行整理后才能分析多次这样很容易大减分的。
② 从测量数据产生到形成质量数据分析结果往往需要好长的时间,无法及时了解制程质量状况,预防不合格品的产生。
③ 质量总部的管理人员每次都需要催好多次,才能拿到每个工厂提供的数据和分析结果,无法实时了解每个工厂的质量状况。
【解决方案】
针对此问题,太友科技公司自主研发了一套QCData系统,系统能够自动采集各种仪器上的数据并能将多个仪器设备上的数据同时采集到同一张报表中,消除数据孤岛;同时系统支持SPC实时监控与分析的功能,能够帮助预防不合格品的产生,通过强大的实时监控面板可对测量参数进行实时监控,超规格数据实时,质量总部的管理人员坐在办公室就能了解每个工厂各个生产机台的状态,并可随时查阅相关人员对质量警报的处理进程。
QCData系统具有九大核心优势功能,能够完美解决目前汽车零部件企业所面临的痛点:
① 自动数据采集
② 多类仪器数据采集到同一张报表
③ 杜绝数据作假(多种数据操作权限)
④ 百变报表录入模板
⑤ QC数据挖掘分析
⑥ 多种形式的数据预警(声音、颜色、邮件、微信、报警灯)
⑦ 即可单机使用,又可灵活组网
⑧ 连通MES、ERP系统
⑨ 高性价比的质量解决方案
【成果】:消除了数据孤岛,使测量数据的取用变成了一件轻而易举的事情;提前的质量预警使得停线情况明显减少,产品报废率显著降低;管理人员对各工厂的质量管控更加透明、即时、有效;在十几秒内自动生成各种报表,大大缩短报表制作的时间,提升效率。
质量数据采集
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并