中企动力 > 商学院 > 文本数据采集标注
  • ?

    在这个连开源标注数据集都没有的领域,AI该如何落地?

    忘了爱

    展开

    法律 AI 在目前是有作为的,但需要讲究策略,要有应用场景和适用标准,而且结果要可靠,对用户负责,这才符合法律的基本精神。

    采访 | 微胖

    对于法律科技领域来说,2014 年元旦是一个重要分水岭。

    这一天,最高人民法院《关于人民法院在互联网公布裁判文书的规定》生效实施。即日起, 全国四级法院的生效裁判文书, 除涉及国家秘密、个人隐私、未成年人违法犯罪等特殊情形外, 应当在生效后七日内统一上传至中国裁判文书网。

    「我们承建了裁判文书网的后台。」北京法意科技有限公司常务副总经理陈浩告诉我们。据陈浩回忆,半年多时间,「大概到 2014 年下半年的时候,已经到了几百万量级。」

    有了数据燃料,剩下的就是方法。

    「14 年之后,好多新公司进来。至少,大家的共识是得有数据,没有数据,那个事情做不成。」如今比较活跃的法律 AI 创业公司,比如律品科技、无讼均成立于这一年。

    两年后,中国裁判文书网已经成为全球最大裁判文书公开平台。数据显示,截至 2016 年 8 月 16 日,中国裁判文书网公开的裁判文书超过 2000 万篇,网站访问量突破 20 亿次。

    更多公司开始试水 AI 领域。2016 年,法狗狗和深度好奇成立。一些大公司也开始尝试新技术:华宇设立了子公司华宇元典,而国双和上海百事通等也陆续开始探索人工智能在法律领域的可能性。

    而作为中国裁判文书网承建商的法意科技,算是中国最早涉足法律数据和实证分析的科技公司之一。

    「我们最早源于北京大学的一个科研课题。大家当时在研究法律法规跟案例的关系。裁判文书会引用法律,那么能不能通过案例文本找到被引用的具体法律内容?或者,通过法律条文找到对应案例?」

    那还是 2001 年,陈浩正在北大读研究生。后来,由于研究需要更完整的法规数据库和案例数据库支撑,北大法意成立。2003 年,公司开始做数据库。

    「那时候就是数据量少,没有公开那么多文书,我们也只能尽可能从各种正式渠道采集。我们一直坚持做数据库,当时也没有觉得最新的计算机技术对数据库的建设和应用有多大影响。」

    现在,完全是另一番景象。

    2015 年以来,无论 Yann LeCun、Geoff Hinton 还是 Yoshua Bengio 都开始将关注点转移到自然语言。Yann LeCun 认为,NLP 是深度学习接下来要解决的重要问题,Geoffrey Hinton 则认为未来五年最令人兴奋的领域将是文本和视频理解。

    而国内专业人士在接受我们专访时,也曾表示,「离钱比较近、数据比较丰富、知识结构梳理得比较好的领域」比较适合 NLP 的落地。

    「比如,法律和医疗。它们是接近同构的两个领域,都有大量和用户交互的专家以及规范的领域知识。类似这类有富集的文本、领域知识、交互记录的领域,比较容易取得自然语言理解和相关任务的突破。」深度好奇 CEO 吕正东曾说。

    然而,对于一家深耕法律数据和实证分析领域多年的传统公司来说,除了感受到这波人工智能浪潮带来的压力之外(「产品要更加精致」),同时也感受到了许多概念宣传带来的干扰,还发现了一些令人担忧的现象。陈浩多次表示「法意仍然对人工智能持相对保守的态度」,也反复强调了产品的精准度和行业生态建设等问题。

    以下为采访实录,我们做了不变更原意的编辑。

    我感觉现在行业内好多团队似乎对这个环节的重视程度不够,就是大前提和小前提的正确性。但实际上我感觉这是最关键的问题。

    吴恩达说人工智能是电力,会给很多行业带来巨大变化。您怎么看近些年法律领域的 AI 热?

    现在进入法律领域的资本比过去多很多,但没办法和医疗这样的领域比。

    一方面,对人的价值不同。可能有人一辈子不打官司,但是一辈子进医院的次数就多了。另一方面,投资人的眼光也非常犀利。在人工智能技术落地的难度上,法律可能比医疗还难,因为它涉及价值判断。

    医疗更多的是用感知技术解决诊断数据获取问题。在这些数据基础上,设定医学模型。但在法律领域,一拳打过去,这是故意伤害还是开玩笑?有很多价值判断在里面。即使用 NLP 分析发现两篇文档特别类似,可能就多了一两个字,但法律结论未必一样,还有可能严重不同。在计算机上实现这个,难度很大。

    我们认为,人工智能,某种程度上来说是从几十年前传统的统计学发展下来的,只是现在统计方法有了新变化。有监督学习、无监督学习、半监督学习这些方法,几十年前就有了,只是具体算法不断演进了。

    对应在法律领域内,学者们做研究讲的更多的是实证研究,实证研究用了很多不同的统计方法。在诸如 SPSS 之类的专业统计软件上会看到很多熟悉的机器学习算法。这些模型,有的可能早在 100 年前被研究出来了,一直沿用至今。

    06 年讲深度学习,实际上只是在感知领域效果比较好。在认知领域,没有见到特别成熟的商业应用,至少在法律领域是这样。

    从国外看,不管是英美还是大陆法系,类似的产品其实都很窄,解决的是法律领域里某一个更细分的问题,比如说破产。有个法国公司做了一个离婚模型,做完之后提供给公众服务,大家觉得非常好,好像产业就要变天了,但实际上这就是一个针对某个具体问题的具体模型,可能有商业化包装的成分在里面。

    解决某个点的问题,还不能直接变革庞大的法律体系。当然,不是说这么做没用。像 IBM Watson,被一些专业团队用来做二次的垂直应用(比如 ROSS——微胖注),产生了一系列产品,验证后可能是成功的。这个应该值得大家去思考学习。

    大的方向上,大家肯定是不会存在任何异议,但在具体推进和使用上,还是要有具体的问题意识。从具体问题出发的法律智能化服务路子,可能是对的,我们也在做这方面工作。

    法意做了哪些相关的 AI 产品?

    到底什么样的产品属于人工智能领域,其实不好说。

    比如法律文书生成、合同的合规性审查、文书质量控制、法律风险分析、业务指引等,技术层次很多,不好说是不是都属于人工智能。只能说,计算机在各种模型和算法的支持下,可以输出很多法律服务成果。

    08 年,我们研发了法律文书质量控制软件(「文书纠错系统」),对文书格式规范、表达规范比如语义逻辑、内容完整方面、上下文逻辑方面和法律依据引用等方面进行质量控制。现在,全国大概有 60% 的法院都在用这个服务。

    比如,如果未成年人被判了 300 元罚金,这个软件就会提示错误。因为司法解释规定,未成年人犯罪被判处的罚金不得低于 500 元。这款产品也是通过算法、知识库支撑来实现的。光有知识库还不够,还要有算法库。

    现在,我们在研究法律文书的法律核心问题的识别。

    如果这种复杂又专业的文书来自最高人民法院,出自水平很高的法官,整个核心法律问题的识别,召回率能达到 75%-80% 之间。也就是说,100 篇法律文书,我们能发现 70 多篇文书的核心法律争议焦点。它的提准率,目前水平在 85% 以上。也就是说,发现 70 多个法律问题中,大概有 60 多个问题是精准的法律核心问题。

    不过,面向全国法院的裁判文书后,针对类似的问题,现在的召回率大概只有 30% 多,提准率在 80% 多,提准率相对还是稳定的。

    感觉法意的态度相对比较谨慎,对吧?

    我们的态度一直比较保守。这么多年来,我们的基本经营理念都是坚持准确率指标。

    这些指标要到什么水准,咱们才会认为结果可以接受,这种技术才能被商业化,否则就只是停留在实验室里的东西。我们不习惯对实验室阶段的技术做宣传。

    目前市面上,有些团队在研发类案推送系统,甚至会提供倾向性结论。虽然给这种结论有点风险,但是作为给律师提供法律咨询服务的参考,以及法官作为参考不会不加甄别的接受软件提供的结果,所以,我们觉得这类产品还是很有应用价值的。

    但是,如果把软件提供的法律结论直接提供给老百姓,确实会有很大的风险。

    这么多年,我们也做了很多应用,我们对某些具体问题做了一些深入研究和应用,也出来一些具体结果。这些结果,得到过反复的验证。

    能举个例子吗?

    09、10 年时,我们服务北京大学法学院白建军教授,就最高人民法院的量刑规范化做了一个实证研究的技术支持。

    当时,最高院出了一个量刑指导意见(试行),作为法官量刑自由裁量权的细化指导。白老师想做个实证研究,看看全国一百多家法院试行指导意见之后量刑实践的实际规律是什么。

    我们协助白老师做了分析框架模型的技术处理和数据处理。最高法院调了大概一百多家法院三年来的刑事判决书数据。就这三万多篇文书,按照白老师给的模型,对数据进行自动化处理——把所有判决书中记载人罪单位,全部结构化地提取出来。

    我们结合了一些方法,目的就是实现高精度的结构化的数据输出。因为这种研究,最关键的就是精准度的问题。虽然大家说大数据追求模糊,不追求精确,但是,我觉得在法律领域内,精确性还是不可回避的一个问题,如果不准,这个结论不能作为决策依据。

    高精度地将量刑数据提取出来后,白老师以此为基础做了一个研究报告,提交给了最高院。最高院相关负责人还是比较认可部分结论。

    你看,量刑就是个非常具体的法律问题,要解决的问题也很具体-----整个模型数据的高精度的提取。问题要求的精确程度不同,相对的方法和算法也会有区别。

    所以,我们坚持对类似这样的具体问题进行具体落地处理。然后,注重它的一些指标,主要是召回率和准确率。

    不解决问题的刀不是好刀,还有可能是凶器是吧?我们还是希望能够提供特定场合下的高精度的东西给大家。

    为了严格确保产品质量,还有什么需要特别注意的因素?

    还有一点很重要,判断结论是 A 还是 B 的概率,是有具体的前提的,即影响或控制结论的前提(也就是三段论的大前提和小前提)的精准度。

    这甚至是最重要的问题。但有时候可能会忽视了这个问题,都把焦点放在结论上。结论虽然很重要,但是之前支撑的环境变量和参数如果不准,结论等于没保障。所以,要有标准库或其他方法去验证这些大小前提的精准度。

    比如,没小孩、有家暴,能不能离婚?你告诉他这种情况下,法院判离的概率是 60%。但事实上,判决离婚要考虑的因素不止这两个。还有很多其他因素,比如是不是自由恋爱?法官会考虑其他很多因素。但是,老百姓可能不会输入这个因素,因为他们不懂法律。在缺少这些因素的时候去做算法,结果就会似是而非。前提部分的精准度没有保障,后面就会出问题,甚至会得出截然相反的结论。

    所以从技术实践角度来说,每个环节的精准度都要有一个有效的控制,肯定要采取经过反复验证的算法。

    至于什么样的验证方法最好,没有统一的标准。最高法院也在组织课题研究这些问题。

    在这个领域内,我们把基于规则、基于统计的方法结合在一起,它的效果就非常好。我们精度准确率的输出,基本上都是在 97% 以上。

    法意有用到深度学习技术吗?

    我们也有用到深度学习。之前给研究机构或甲方做的研究,为了控制垂直精准度,不会把太弹性的算法会往里加。弹性的算法(也就是基于统计的一些算法)精准度相对是偏低,但这种偏低的算法加入到你现在算法体系里,会提升算法的宽度。

    比如说,临时有定制的需求,利用现有的成熟算法,两三天就可以训练出一套算法。但是,这套算法的可用性会有问题。现在我们给甲方做的东西都会严格控制精准度。比如裁判文书网。

    但是,我们也没有太快拓展自己业务边界,还是有选择性的在做。我们的共识是,如果精准度可以达到我们预期,这个任务的风险是可控的。

    深度学习技术主要用在哪些方面?

    现在,我们对深度学习中的这些算法,会结合到知识图谱,比如知识规则的抽取,现在用的比较多。

    另一个是文本分类。实际上,我们把它思路转化了一下,我们叫它文本的结构化。

    比如做量刑模型,前提是需要高精度提取量刑情节。某个案件当中,张三犯盗窃、诈骗数罪,是盗窃了 5 万,还是诈骗了 5 万,需要精准提取这样一个文档描述中的数据结果。就这种文档的结构化提取而言,我们用了一些深度学习算法,也结合了一些传统的基于规则的模型做控制。通过评测,效果还不错。

    文本结构化方面用的比较多。但是,用在作为所谓的规则提取,比如说未成年犯罪的罚金不得低于 500 元这种规则的提取,我们也在尝试着采用类似的技术来解决。

    因为法律领域内的文档还是具有很强的领域性、行业特征和受控的特点,它的文本内容、结构和文本内容结构和语义后面蕴涵的信息体系,还是一个相对可控的,容易被结构化。和新闻稿相对开放的特点还是有很大的不同。

    在这个领域内,我们把基于规则、基于统计的方法结合在一起,它的效果就非常好。我们精度准确率的输出,基本上都是在 97% 以上。

    达到这么一个精准率,需要多...

  • ?

    从数据标注切入的「丁火智能」,未来想做的是线上人力平台

    笑槐

    展开

    人工智能公司涌现,产生了海量采集标注需求,Tractica预测,2024年人工智能市场规模将增长至111亿美元。但AI要真正发挥作用,优质的数据必不可少,美国国际数据集团的报告中显示,到2022年,所有数据中将有93%的数据是结构化数据,这些结构化数据都需要结构化标注。所以前端的数据采集、标注环节单拎出来成为了新的机会点。

    目前这个赛道上,成立久的有“数据堂”,早期公司有获得明势资本 Pre-A 轮融资的“爱数智慧”,完成天使轮融资的“泛涵科技”,获得两轮融资的 BasicFinder,“丁火智能”也是赛道上一员。

    丁火智能完成任务的流程是标注-复核-全检。标注任务众包,兼职方多为学生、家庭主妇、白领等,他们前期接受考核培训,根据准确率不同会获得相应权限。系统自动分发任务,准确率高的人被挑选出来作审核人员。数据交付前要复核和百分百全检,目前复核的准确率超过98%,全检的错误率能控制在5%之内。多以接图片为主。

    丁火智能标注仍然以人力为主,并没有使用机器标注。在 CEO 晋明会看来,标注效果怎么样最终还需要人来审核,在人力成熟的条件下,机器只是降低成本的工具,在目前来看,还没到引入机器的地步。机器标准会越来越好,对一些创业公司来说也是机会,但这个机会是属于人工智能公司的机会,算法不断产生结果,人力判断反馈给算法,所以最终来看还是机器辅助人。

    安全性方面,丁火智能会和企业签署保密协议、按照客户要求把数据部署在客户的服务器上,或者是自建标注平台。

    收费模式上,丁火智能分任务类型收费,比如六分钱一个框、两毛钱一个轮廓等。抽佣比例在10%-20%,公司已经盈利,每月收入在10万元以内。

    做数据标注本身的门槛并不高,主要考察的是最后数据的标注质量。丁火智能在管理机制上建立了一套质控体系,通过这套体系将人员筛选出来,正确率高的就做更高级的任务,正确率低就直接被淘汰。

    CEO 晋明会告诉36氪,丁火智能和同行的差异在于,同行的流程是平台-团队-个人,丁火智能是平台-个人,个人通过一套指控体系在内部分化成普通标注人员和审核人员,实际是线下行为在线化,比如整个考核-标注-质检都是线上完成,同行更偏向线下行为。线上的好处就是沉淀数据,知道谁做的好,谁做的不好。从这点来看,丁火智能也可以说是从数据标注切入的线上人力平台,将来线上人力会有自己的评判标准和评判体系、以API的形式输出出去,而这些人力是已经被丁火证明过的优秀的人力,可以应用到更广的范围。

    国外做数据标注的也分两类,一类是众包方式,比如 Mturk(Amazon旗下) 、Spare5在2017年1月获得了 Google 和 Intel 的$1400万投资,累计融资$2725万, CrowdFlower 在2017年6月获得了Microsoft 和 Salesforce 的$2000万投资,累计融资$5800万,这类厂商速度快价格低,但质量无保证;第二类是全职方式,比如 ScaleAPI2017年5月获得了A轮投资$450万,质量高,但是速度慢价格高。

    丁火智能团队目前有3个人。CEO 晋明会硕士学历,负责产品策划、 运营、iOS开发及商务拓展,六年产品经验,五年创业经历;CTO 徐武有十年开发经验,七年创业经历,精通PHP、Python和Java等语 ,负责后台架构、网页及安卓开发。;设计总监徐志诚有六年网页设计经验,五年App设计经验,主导设计过 一个网站、四个App和四套基于微信的商业化系统。

  • ?

    数据分析全流程(内附案例)

    吉雁兰

    展开

    (图片来源于网络)

    作者:苏格兰折耳喵

    来源: 运营喵是怎样炼成的 (yymzylc)

    (温馨提示:图片显示毛糙和不清楚,是分辨率过高的缘故,点击图片,即可看到高清大图。 )

    本文将对一个案例进行从数据采集、数据清洗、数据分析再到数据可视化的全流程分析,力求条理清晰的展现外部数据分析的强大威力。以下是本文的写作框架:

    1 分析背景

    1.1 分析原理---为什么选择分析虎嗅网

    在现今数据爆炸、信息质量良莠不齐的互联网时代,我们无时无刻不身处在互联网社会化媒体的“信息洪流”之中,因而无可避免的被它上面泛滥的信息所“裹挟”,也就是说,社会化媒体上的信息对现实世界中的每个人都有重大影响,社会化媒体是我们间接了解现实客观世界和主观世界的一面窗户,我们每时每刻都在受到它的影响。

    综合上述两类情形,可以得出这样的结论,透过社会化媒体,我们可以观察现实世界:

    由此, 社会化媒体是现实主客观世界的一面镜子,而它也会进一步影响人们的行为,如果我们对该领域中的优质媒体所发布的信息进行分析,除了可以了解该领域的发展进程和现状,还可以对该领域的人群行为进行一定程度的预判。

    鉴于此种情况,作为互联网从业者的笔者想分析一下互联网行业的一些现状,于是想到了虎嗅网。

    虎嗅网创办于2012年5月,是一个聚合优质创新信息与人群的新媒体平台。该平台专注于贡献原创、深度、犀利优质的商业资讯,围绕创新创业的观点进行剖析与交流。虎嗅网 的核心,是关注互联网及传统产业的融合、一系列明星公司(包括公众公司与创业型企业)的起落轨迹、产业潮汐的动力与趋势。

    因此,对该平台上的发布内容进行分析,对于研究互联网的发展进程和现状有一定的实际价值。

    1.2 本文的分析目的

    笔者在本项目中的分析目的主要有4个:

    (1)对虎嗅网内容运营方面的若干分析,主要是对发文量、收藏量、评论量等方面的描述性分析;

    (2)通过文本分析,对互联网行业的一些人、企业和细分领域进行趣味性的分析;

    (3)展现文本挖掘在数据分析领域的实用价值;

    (4)将杂芜无序的结构化数据和非结构化数据进行可视化,展现数据之美。

    1.3 分析方法---分析工具和分析类型

    本文中,笔者使用的数据分析工具如下:

    Python3.5.2(编程语言)

    Gensim(词向量、主题模型)

    Scikit-Learn(聚类和分类)

    Keras(深度学习框架)

    Tensorflow(深度学习框架)

    Jieba(分词和关键词提取)

    Excel(可视化)

    Seaborn(可视化)

    新浪微舆情(情绪语义分析)

    Bokeh(可视化)

    Gephi(网络可视化)

    Plotly(可视化)

    使用上述数据分析工具,笔者将进行2类数据分析:第一类是较为传统的、针对数值型数据的描述下统计分析,如阅读量、收藏量等在时间维度上的分布;另一类是本文的重头戏---深层次的文本挖掘,包括关键词提取、文章内容LDA主题模型分析、词向量/关联词分析、DTM模型、ATM模型、词汇分散图和词聚类分析。

    2 数据采集和文本预处理

    2.1 数据采集

    笔者使用爬虫采集了来自虎嗅网主页的文章(并不是全部的文章,但展示在主页的信息是主编精挑细选的,很具代表性),数据采集的时间区间为2012.05~2017.11,共计41,121篇。采集的字段为文章标题、发布时间、收藏量、评论量、正文内容、作者名称、作者自我简介、作者发文量,然后笔者人工提取4个特征,主要是 时间特征 (时点和周几)和 内容长度特征 (标题字数和文章字数),最终得到的数据如下图所示:

    2.2 数据预处理

    数据分析/挖掘领域有一条金科玉律:“Garbage in, Garbage out”,做好数据预处理,对于取得理想的分析结果来说是至关重要的。本文的数据规整主要是对文本数据进行清洗,处理的条目如下:

    (1) 文本分词

    要进行文本挖掘,分词是最为关键的一步,它直接影响后续的分析结果。笔者使用jieba来对文本进行分词处理,它有3类分词模式,即全模式、精确模式、搜索引擎模式:

    · 精确模式:试图将句子最精确地切开,适合文本分析;

    · 全模式:把句子中所有的可以成词的词语都扫描出来, 速度非常快,但是不能解决歧义;

    · 搜索引擎模式:在精确模式的基础上,对长词再次切分,提高召回率,适合用于搜索引擎分词。

    现以“新浪微舆情专注于社会化大数据的场景化应用”为例,3种分词模式的结果如下:

    【全模式】: 新浪/ 微舆情/ 新浪微舆情/ 专注/于/ 社会化/ 大数据/ 社会化大数据/ 的/ 场景化/ 应用

    【精确模式】: 新浪微舆情/ 专注/于/ 社会化大数据/ 的/ 场景化/ 应用

    【搜索引擎模式】:新浪,微舆情,新浪微舆情,专注,于,社会化,大数据,社会化大数据,的,场景化,应用

    为了避免歧义和切出符合预期效果的词汇,笔者采取的是精确(分词)模式。

    (2) 去停用词

    这里的去停用词包括以下三类:

    标点符号:, 。! /、*+-

    特殊符号:▲等

    无意义的虚词: “the”、“a”、“an”、“that”、“你”、“我”、“他们”、“想要”、“打开”、“可以”等

    (3) 去掉高频词、稀有词和计算Bigrams

    去掉高频词、稀有词是针对后续的主题模型(LDA、ATM)时使用的,主要是为了排除对区隔主题意义不大的词汇,最终得到类似于停用词的效果。

    Bigrams是为了自动探测出文本中的新词,基于词汇之间的共现关系---如果两个词经常一起毗邻出现,那么这两个词可以结合成一个新词,比如“数据”、“产品经理”经常一起出现在不同的段落里,那么,“数据_产品经理”则是二者合成出来的新词,只不过二者之间包含着下划线。

    3 描述性分析

    该部分中,笔者主要对数值型数据进行描述性的统计分析,它属于较为常规的数据分析,能揭示出一些问题,做到知其然。

    3.1 发文数量、评论量和收藏量的变化走势

    从下图可以看出,在2012.05~2017.11期间,以季度为单位,主页的发文数量起伏波动不大,在均值1800上下波动,进入2016年后,发文数量有明显提升。

    此外,一头(2012年第二季)一尾(2017年第四季)因为没有统计完全,所以发文数量较小。

    下图则是该时间段内收藏量和评论量的变化情况,评论量的变化不愠不火,起伏不大,但收藏量一直在攀升中,尤其是在2017年的第二季达到峰值。收藏量在一定程度上反映了文章的干货程度和价值性,读者认为有价值的文章才会去保留和收藏,反复阅读,含英咀华,这说明虎嗅的文章质量在不断提高,或读者的数量在增长。

    3.2 发文时间规律分析

    笔者从时间维度里提取出“周”和“时段”的信息,也就是开题提到的“人工特征”的提取,现在做文章分布数量的在“周”和“时”上的交叉分析,得到下图:

    上图是一个热力图,色块颜色上的由暖到冷表征数值的由大变小。很明显的可以看到,中间有一个颜色很明显的区域,即由“6时~19时”和“周一~周五”围成的矩形,也就是说,发文时间主要集中在工作日的白天。另外,周一到周五期间,6时~7时这个时间段是发文的高峰,说明虎嗅的内容运营人员倾向于在工作日的清晨发布文章,这也符合它的人群定位---TMT领域从业、创业者、投资人,他们中的许多人有晨读的习惯,喜欢在赶地铁、坐公交的过程中阅读虎嗅讯息。发文高峰还有9时-11时这个高峰,是为了提前应对读者午休时间的阅读,还有17时~18时,提前应对读者下班时间的阅读。

    3.3 相关性分析

    笔者一直很好奇,文章的评论量、收藏量和标题字数、文章字数是否存在统计学意义上的相关性关系。基于此,笔者绘制出能反映上述变量关系的两张图。

    首先,笔者做出了标题字数、文章字数和评论量之间的 气泡图 (圆形的气泡被六角星替代,但本质上还是气泡图)。

    上图中,横轴是文章字数,纵轴是标题字数,评论数大小由六角星的大小和颜色所反映,颜色越暖,数值越大,五角星越大,数值越大。从这张图可以看出,文章评论量较大的文章,绝大部分分布于由文章字数6000字、标题字数20字所构成的区域内。虎嗅网上的商业资讯文章大都具有原创、深度的特点,文章篇幅中长,意味着能把事情背后的来龙去脉论述清楚,而且标题要能够吸引人,引发读者的大量阅读,合适长度标题和正文篇幅才能做到这一点。

    接下来,笔者将收藏量、评论量和标题字数、文章字数绘制成一张3D立体图,X轴和Y轴分别为标题字数和正文字数,Z轴为收藏量和评论量所构成的 平面 ,通过旋转这个3维的Surface图,我们可以发现收藏量、评论量和标题字数、文章字数之间的相关关系。

    注意,上图的数值表示和前面几张图一样,颜色上的由暖到冷表示数值的由大到小,通过旋转各维度的截面,可以看到在正文字数5000字以内、标题字数15字左右的收藏量和评论量形成的截面出现“华山式”陡峰,因而这里的收藏量和评论量最大。

    3.4 城市提及分析

    在这里,笔者通过构建一个包含全国1~5线城市的词表,提取出经过预处理后的文本中的城市名称,根据提及频次的大小,绘制出 一张反映城市提及频次的地理分布地图 , 进而间接地了解各个城市互联网的发展状况(一般城市的提及跟互联网产业、产品和职位信息挂钩,能在一定程度上反映该城市互联网行业的发展态势)。

    上图反映的结果比较符合常识,北上深广杭这些一线城市的提及次数最多,它们是互联网行业发展的重镇。值得注意的是,长三角地区的大块区域(长江三角洲城市群,它包含 上海 , 江苏省 的 南京 、 无锡 、 常州 、 苏州 、 南通 、 盐城 、 扬州 、 镇江 、 泰州 , 浙江省 的 杭州 、 宁波 、 嘉兴 、 湖州 、 绍兴 、 金华 、 舟山 、 台州 , 安徽省 的 合肥 、 芜湖 、 马鞍山 、 铜陵 、 安庆 、 滁州 、 池州 、 宣城 )呈现出较高的热度值,直接说明这些城市在虎嗅网各类资讯文章中的提及次数较多,结合国家政策和地区因素,可以这样理解地图中反映的这个事实:

    长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。

    长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。

    接下来,笔者将抽取文本中城市之间的 共现关系 ,也就是城市之间两两同时出现的频率,在一定程度上反映出城市间经济、文化、政策等方面的相关关系,共现频次越高,说明二者之间的联系紧密程度越高,抽取出的结果如下表所示:

    将上述结果绘制成如下动态的流向图:

    由于虎嗅网上的文章大多涉及创业、政策、商业方面的内容,因而这种城市之间的共现关系反映出城际间在资源、人员或者行业方面的关联关系,本动态图中,主要反映的是北上广深杭(网络中的枢纽节点)之间的相互流动关系和这几个一线城市向中西部城市的单向流动情形。流动量大、交错密集的区域无疑是中国最发达的3个城市群和其他几个新兴的城市群:

    京津冀城市群

    长江三角洲城市群

    珠江三角洲城市群

    中原城市群

    成渝城市群

    长江中游城市群

    上面的数据分析是基于数值型数据的描述性分析,接下来,笔者将进行更为深入的文本挖掘。

    4 文本挖掘

    数据挖掘是从有结构的数据库中鉴别出有效的、新颖的、可能有用的并最终可理解的模式;而文本挖掘(在文本数据库也称为文本数据挖掘或者知识发现)是从大量非结构的数据中提炼出模式,也就是有用的信息或知识的半自动化过程。

    本文的文本挖掘部分主要涉及高频词统计/关键词提取/关键词云、文章标题聚类、文章内容聚类、文章内容LDA主题模型分析、词向量/关联词分析、ATM模型、词汇分散图和词聚类分析。

    4.1 关键词提取

    对于关键词提取,笔者没有采取词频统计的方法,因为词频统计的逻辑是:一个词在文章中出现的次数越多,则它就越重要。因而,笔者采用的是 TF-IDF (termfrequency–inverse document frequency)的关键词提取方法:

    它用以评估一字/词对于一个文件集或一个语料库中的其中一份文件的重要程度,字/词的重要性会随着它在文件中出现的次数成正比增加,但同时会随着它在语料库中出现的频率成反比下降。

    由此可见,在提取某段文本的关键信息时,关键词提取较词频统计更为可取,能提取出对某段文本具有重要意义的关键词。

    下面是笔者利用jieba在经预处理...

  • ?

    重磅 | EasyDL新上线定制文本分类等功能

    零乱

    展开

    尊敬的百度AI开放平台用户:

    感谢长期以来各位企业用户与开发者对EasyDL的支持!EasyDL是百度AI开放平台在2017年11月14日正式上线推出的定制化训练和服务平台,通过可视化的便捷操作,并通过少量数据进行训练,即使零算法基础也可定制高精度的AI能力。

    在追求精益求精的道路上,我们从未止步。百度EasyDL在11.30日升级新版,上线了众多开发者期待已久的新功能!

    1、 定制化文本分类正式上线,基于自建分类体系的机器学习方法,实现文本定制分类。

    无论投诉信息、媒体文章、还是文本审核标准,从此都可以个性定制。

    欢迎访问【EasyDL定制化文本分类】随时体验全新功能。

    2、 支持API形式管理数据集,提高训练数据管理效率,优化体验。

    针对需要上传大规模训练数据量的用户,拖拉拽式操作需要往往需要保持网页长时间运行状态,API形式的管理数据集功能的上线,对训练数据集较大的用户来讲,大幅提高了管理数据(特别是上传数据)的便捷性和灵活性。

    在数据集管理中心,增加了调用接口管理数据,点击后可进入数据集增删改查共计6个接口文档。

    3、 大部分模型发布实现免人审,大幅提高模型发布效率。

    长久以来,EasyDL坚持T+0到T+1的审批时效,为进一步提升用户体验,新版升级后,绝大多数模型上线将实现免人审,实现分钟级自动上线。

    4、 图像分类模型支持调参,为高玩用户自助提升模型效果提供一臂之力。

    熟悉EasyDL的朋友会了解,使用EasyDL发布模型无需懂机器学习基础,而由于EasyDL使用的便捷性和高精度的效果,很多有机器学习基础的高玩用户也习惯使用EasyDL来打造AI模型。 本次迭代,也为这类用户群体提供了更为便捷的调参工具。

    通过调节参数,用户可以更灵活地选择数据预处理的方法、自定义训练超参数,进一步提升模型效果。

    已有调参权限的用户,可以在训练模型前选择开启调参:

    5、 数据支持正式上线,大幅降低用户的数据采集及标注成本。

    惊艳的模型效果往往依赖于高质量的训练数据,采集和标注图片的成本无法规避。为降低广大开发者的数据成本,本次正式上线两大核心数据支持方式:

    百度众测:提交具体的数据采集或数据标注要求,由百度众测提供数据服务支持。

    数据服务商:EasyDL已有多家第三方数据服务合作伙伴,可提供包括数据采集、数据标注等多项数据服务。

    所有新功能,欢迎访问EasyDL官网体验。

  • ?

    智博会前夕,这家企业宣布免费为30+中国人工智能提供数据标注服务

    夏青

    展开

    8月23日,为期三天的中国国际智能产业博览会(简称"智博会")即将隆重召开,届时,酷炫狂拽的“黑科技”、科技感十足的人工智能产品,万物互联的智慧体验等新技术、新产品、新应用将纷纷亮相。这些前沿科技的灼热与闪亮的背后,数据作为基础的支持,显得格外重要和可靠。

    说到数据,很多人都会想到北上广,甚至想到被认为是人工智能领域领导者的美国,但谁也想不到,在贵州大山里,隐藏着一家致力于互联网、人工智能等领域的企业——梦动科技,他们拥有1000+人规模的集中化管理的数据采集标注团队,虽身处贵州大山,却一直服务BATJ等互联网巨头企业及垂直领域企业,已经为百度、阿里、京东、HTC、数联铭品等在内20多家名企提供了数以万计的数据加工处理服务。全国政协主席汪洋,中央政治局委员、重庆市委书记陈敏尔,国务委员 公安部部长赵克志、中国工程院倪光南院士等先后到公司视察指导工作,关心鼓励梦动科技快速发展

    梦动科技大数据百鸟河基地梦动科技数据采集标注团队工作场

    然而,这么一群训练有素,服务无人驾驶汽车、人脸识别、智能语音系统(八大语系)、农业种养殖、智能识别的数据标注团队,在重庆智博会开幕前夕,做出了一个让人吃惊的计划,未来三年,免费为30家左右的国内人工智能公司提供数据标注服务。

    免费就等于人力、成本、资源的不断投入,梦动科技葫芦里到底是怎么想的?据团队负责人介绍,梦动科技现在已是千人规模团队,日常工作有一点的富余生产力,他们希望用这些能量去帮助那些在数据标注成本投入大、专业性不够的AI企业,有效促进人工智能行业的健康稳定发展。同时,梦动科技也有自己的“小私心”,他们希望通过这个事情能够宣传自己,认识更多的行业伙伴,抱团取暖,共谋发展。

    梦动科技是由HTC王雪红董事长投资创立,现已拥有千人集中作业的优势和标准化的运营流程、严格的数据安全管理体系,以及近2000个席位,能够有效将数据采集、加工处理的效率提到最大化。

    梦动科技数据采集标注团队工作场景

    梦动科技数据采集标注团队工作场景

    全国政协主席汪洋接见梦动科技投资人

    免费也有条件和门槛的。梦动科技为了把这次“免费标注”做实,他们也根据自身的能力提出了几条限制条件,以达成双方顺畅的合作。免费享受服务企业必须是注册一年以上,并已有明确数据需求规范标准的人工智能商业公司,无人驾驶汽车系统(2D、3D)、图像识别系统、语音识别系统优先服务,以及提供不超过市场价10万RMB的数据标注服务量。申请免费服务的企业只需提出包含数据需求标准规则文本、标准样图的邮件申请,并承诺不把免费标注数据转让给第三方。目前,这次“免费标注”服务已经和北京、上海等6家大数据关联企业开启合作。

  • ?

    如果想做数据标注,你可能会遇到哪些坑?

    何风

    展开

    从事数据标注半年多,从3月份开始,到现在,已经将近半个年多了。

    但是这半年的经历,让自己真实感慨万千,来这里给大家说说如果做数据标注,会遇到哪些坑,让后来想从事的朋友们有个思想上的准备。

    其实坑对于组织者和一线标注是不一样的,这次主要从一线标注的角度讲讲可能会有哪些坑?

    1, 项目周期短

    其实项目周期短,也不是算不上坑,主要是都是短期的数据标注项目,学习成本实在太高。刚学会没多久,打算放手开干的时候,项目没有了!其实赚的钱,还不如耽误的时间成本。时间成本其实是很昂贵的成本!

    2, 长期项目断题

    长期项目的学习复杂难度也很高,目前手头长期的项目,否是需要至少3-6个工作日的培训周期,培训难度大,转正成本高。好不容易稳定下来队伍之后,突然间断题了。对于标注来说,突然间的无所事事,无论是心理上,还是生活压力上,都陡然倍增。本身数据标注就是计件工资,花费了大量的功夫来学习,长时间的断题,严重的话能过把一个标注给整成抑郁症。

    3, 无限返工

    这主要是对于一线质检来说的,质检人员遇到项目发起方,对任务的要求100%正确率的时候,这个问题就凸显了。质检人员保证标注项目的准确是应尽的义务,但是有一个基本情况就是,人就会犯错,人不是机器。项目的100%正确率基本很难保证。但是如果是个一线标注和一线质检,我统计过,如果从事该行业3个月以上之后,无论是质检还是标注,标注的项目的准确率就非常的高,因为标注的结果已经是身体的本能。

    4, 遇到骗子

    我们是经历过断题的煎熬的,断题后为了给大家找项目,各种尝试。当然,肯定还要交学费。最惨痛的学费就是,遇到些不靠谱的公司,干完活了,一句话,质量不合格,提包收回。白白的给人家打工了。这种骗子公司,在贴吧,qq群到处招摇撞骗,以试标的幌子,骗人白干活,还总有人上当。

    站到组织者的角度,其实难度更多了,投资了设备,租房子,花大量时间招募,大量的成本培训,结果还是各种坑。但是发现好多标注公司都在坚持。为什么坚持?

    马云说过:很多人因为看见才相信,只有少数人相信才看见。

    道理也就是这个道理,人工智能行业愈发的发达,在顶层算法确认之后,就需要数据集来辅助算法来深度学习。数据集的采集,清洗,标注就必须要人工来完成,需要我们各位标注成员一起来坚守和努力。

    因为这个信仰,大家还一起坚守。为了家庭,未了自己,为了在人工智能领域有个深化细分的定位!

    只要你卡位完成,分工明确,我相信,一定会在人工智能科技创新在各个领域不断大爆发的情况下获取更多的收益。

    当然为了让大家避免再次走入我们曾经掉入的坑。

    我们精挑细选了4个长期稳定项目。全部都是图片的标注处理,规则明确,返工少,结算及时。我们也把这几个项目用通俗易懂的方式录制了视频资料包括行业内的各种全面技术白皮书。让大家学习下载。关注后,发私信给我,获取资料获取方法!

  • ?

    注意了!贵州大山里1000+人团队免费提供数据标注服务

    冰松鼠

    展开

    在贵州百鸟河数字小镇有一家拥有1000+人的专业数据标注团队,将在未来三年内免费为中国30家人工智能公司提供数据标注服务。

    公司为何要提供免费数据标注服务呢?

    随着人工智能的快速崛起,作为产业链前端的数据标注服务明显供给不足,发展呈现参差不齐的态势。多数人工智能公司对数据需求很急,都由自己的算法工程师和自己标注,既不专业成本也高;梦动科技拥有一千多人的专业数据标注团队,致力于提供高质量、高效率的数据标注服务,打算将团队的富余生产力用来免费服务一部分的人工智能企业;梦动联合创始人农政说:“贵州的人工智能、大数据正在迅速的崛起,在这片土地上的每个个体、每个团体都有责任和义务为其发展做出努力,而公司在自己的专业领域为部分企业提供免费数据标注服务,就是用力所能及的力量为人工智能的发展做贡献”;此外,公司也想获得一个双赢的结果,古时候是酒香不怕巷子深,如今是个酒再香也怕巷子深的时代,公司员工李鸿说:“他们经常接到经过层层转包最后才找到公司的项目,合作者感叹道,找到你们这样专业提供数据标注服务的公司太难了,我们一定要保持长期的合作”。

    梦动科技数据采集标注团队工作场景

    年轻大学生+严格训练组成的千人规模团队

    梦动科技是由华人领袖、台湾HTC董事长王雪红于2014年创立,到目前,公司发展为拥有一千多人规模的团队,团队人员大部分由刚毕业的大学生组成,他们是一群奋发向上的青年,工作认真而努力,在这个山水环抱的小镇上向全世界的人工智能公司提供优质的数据服务。标注员刘宇说,“经过三个月严格的培训,考核合格后,他成了一名专业的数据标注员,数据标注是一项既枯燥又乏味的工作,在这里,他每天都进行着标准化、流程化和规模化的数据批量标注,但是当他想到自己所处理的每一个数据都将和最前沿科技的人工智能联系起来,他就觉得很有成就感。”

    数据标注质量为先,低质量的数据标注可能导致人工智能运行上的很多问题。如不久前,美国特斯拉公司的自动驾驶汽车发生事故,就是因为系统误将前方车辆的蓝色车身识别为蓝天白云,而原因可能就是标注没有做好。数据标注的质量与标注人员息息相关,梦动公司通过培养专业的标注人才队伍,致力于让最专业的人用最专业的工具,在最严谨的工作流程中完成数据标注,并且由高水平的专业人员进行进度与质量的审核与跟踪,严格保证了效率与准确率。

    梦动科技数据采集标注团队工作场景

    致力于人工智能(AI)产业数据服务

    梦动科技定位人工智能数据服务,致力于打造西南最大的人工智能产业服务基地,现已与百度、阿里、京东联合共建了多个大数据人工智能服务基地,并为百度、阿里等多家大数据上市公司提供数以万计的数据标注加工处理,且成功应用于无人驾驶车、百科智能大脑、AI智能机器人等。

    公司创立以来,受到国家和地方政府部门领导、院士学者的高度关注,全国政协主席汪洋,中央政治局委员、重庆市委书记陈敏尔,国务委员、公安部部长赵克志,中央委员会委员、贵州省委书记孙志刚,中国工程院倪光南院士,中国科学院李未院士等先后到公司视察指导,关心鼓励梦动的发展。

    全国政协主席汪洋接见梦动科技投资人

    享受免费标注的条件和要求

    免费数据标注不代表无限制、无范围的为人工智能企业提供免费服务,公司的生产力是有限的,并且还有其他业务需要完成。因此,为了能提供优质、高效的服务,设置了以下几点要求:首先,注册一年以上的具有明确数据需求规范标准的商业公司。其次,提供每家不超过10万元人民币的市场价数据标注服务量。并且,不接收第三方公司的数据需求,也不能把免费标注数据转让给第三方。最后,申请邮件需要包含数据需求标准规则文本和标准样图。

    公司为了更好的协调商业服务单子和免费标注服务,也为了能提供优质、高效、快速的数据标注服务,公司会单独安排了一个团队来负责免费项目,保证项目准时高效的完成。

  • ?

    前嗅:手把手教你数据采集

    刘幻丝

    展开

    ForeSpider 前嗅:手把手教你数据采集

    ForeSpider是一款非常好用的数据采集软件,因为属于专业性工具,除了帮助文档外很少有使用教程。所有有很多人在使用的过程中遇到问题难以解决,今天给大家介绍ForeSpider数据采集系统的使用教程,希望能对大家的工作有所帮助。

    教程的示例网站是大众点评,要得到50页内所有医院名称,该医院评论总数,医院总体星级,各项评分,医院评论的用户名,评论内容,评论时间,用户点评星级,获赞数量和回应数量。

    首先我们先新建一个频道,我给它命名为大众点评,然后在频道配置里输入我们想要爬取数据的网址,需要在频道配置处输入想要得到数据的网址,大众点评需要开启cookie,从右面可以开启,网站不同有的不需要,视情况而定。 现在默认模板(1)就是我们要的网站页面,鼠标放在医院标题处如图,从左下角能看到医院的网址链接。

    现在点一下右上角的采集预览,我们能得到整个页面的所有网页链接,下拉滚动条到这个位置就会发现跟上图相同格式的链接,这就是我们需要的所有医院的链接。

    我们用不到的需要过滤一下,可以通过地址过滤和标题过滤方法筛选。点击软件右上角模板抽取配置里面的链接抽取,里面有地址过滤和标题过滤两个选项,点击地址过滤,软件右下角如图:

    过滤规则选择包含,过滤串内输入想要得到的医院链接,后面这串数字我们用“\d”表示,用“\e”表示结束,例如https://dianping/shop/\d\e,这样就能采集网页内所有这种格式的网页链接。

    当我们想要采集的网页下面有翻页的链接,就必须配置翻页。除了在右上角默认模板处抽取我们想要的得到的医院链接外,还要再新建一个链接抽取,抽取页面翻页的地址。

    我们继续从采集预览处得到翻页的链接,过滤规则选择包含,通过观察发现几个链接的相同点,输入到过滤串里就能得到想要的翻页链接了。

    第一层级的模板建好了,下面我们随便点进一个医院主页内,复制链接建立下一层级模板。在默认模板(2)的示例地址内输入医院主页的链接。

    因为我们需要采集该医院所有用户评论,所以我们找到下面的“更多点评”,通过刚刚地址过滤的方法,过滤出更多点评的链接,并建立模板(3),示例地址输入刚刚过滤的得到的“更多点评”的网址。

    注:点击链接抽取,看左下角关联模板处,一定要关联到下一层级的模板,如果是翻页的链接抽取,要关联自身模板,否则会数据采集失败。这点一定要注意。

    这样模板的基本配置就完成了,下一步是建立表单,下图是我们的需求,红色字体我们能从模板二采集到,蓝色字体我们能从模板三采集到,所以我们需要建立两个表单。

    点击表单配置,新建一个表单,添加一个网页主键如图,一定要勾选索引字段,键值唯一,主键字段三个选项,取值类型选择网页主键点击确定。

    然后添加下一个字段如标题“title”

    取值类型选择“选区内全部文本”,变量类型选择“string”,选择合适的字符长度点击确定。依次建立所有字段。

    这是我建立的两个表单的所有字段,表单名称分别为“大众点评1”、“大众点评2”,建立好以后点击保存即可。点开模板配置,每一个模板对应相应的表单,右键模板二“添加数据抽取”,表单名称选择“大众点评1”。

    同样在模板三处再添加另外一个数据抽取表单,添加好后如下图所示:

    单击“title”,然后按住ctrl键同时鼠标左键点击对应标题,内容过多的话按住shift可以调整内容大小,选好后点击保存。

    全部选取完后点击左上角的文件,然后全部保存。

    下一步点击数据,连接数据库,然后再次点击数据,选择数据表,选择刚刚新建两个数据表的字段后创建表,创建好后勾选并确定,就可以进行数据采集了(如果表单有问题需要更改,改好后需要重新创建表单),速度慢可以点击设置里面的线程设置,设置多线程。

    这只是一个简单的教程,软件还有很多强大的功能,祝大家使用愉快!

  • ?

    云知声数据标注团队:我们是怎样教机器人说话的

    鲍尔芙

    展开

    “如果机器在某些现实的条件下,能够非常好地模仿人回答问题,让提问者在相当长时间里误认它不是机器,那么机器就可以被认为是能够思维的。” — 阿兰·图灵

    人机对话是人类对人工智能最初的设想,也一直是人工智能领域的目标之一。

    即使我们经常听到“这个问题我还没有学会”,但是不可否认,人工智能已经基本实现”可以说话”了。那么,机器人是怎样学习的呢?这就需要提到人工智能需求下诞生的一个新职业,也是人工智能背后的“隐形者”——数据标注专员。

    众所周知,我们教小孩子认识海豚,就要拿海豚的图片告诉他,这是海豚。久而久之,他记住了海豚的特征,当他去动物园看到了海豚,就知道那是海豚。类比机器人,为了让机器人“像人一样说话”,我们先要教它学习,通过大量的学习之后,它才能对事物做出分辨。

    在AI领域,教机器人学习必须有大量的训练集和测试集,训练集通俗说就像是我们学习时做的习题集,测试集像我们考试做的试题。测试集和训练集里的数据必须是支持算法可用的标注数据,而将采集的原始数据变成算法可用数据的过程叫做“数据标注”。即对采集来的文本、图片、语音数据进行梳理、整理、定性的过程。而数据标注专员就成了为人工智能的发展供应重要且源源不断的“数据燃料”的人。

    云知声就有一个庞大的数据标注团队从事数据服务工作,并且,仅有的数据标注团队还在云知声的东南总部厦门公司哦。团队的小伙伴几乎每天默默戴着耳机对着电脑7-8小时,真的是此处无声胜有声!

    数据标注是一项重复且繁琐的工作,如果把人工智能比作金字塔,最顶端的是人工智能应用(比如机器人、无人驾驶等),而最底端的则是数据服务,数据服务既是根基,也是人工智能必要且必不可少的一环。

    数据标注工作真的像是工厂里的流水线操作吗?只是重复性地对数据进行标注吗?

    云知声数据标注团队的负责人许建说,目前人工智能领域对于数据采集和标注的需求量非常大,数据采集后首先进行数据清洗,清洗之后才是数据标注,标注要求尽可能地详尽、清楚,最后的审查阶段对标记的数据进行正确率、精确度、完备性等方面的审查。实际是,数据质量会影响到算法效果,一旦标注人员出现了错误,也会影响到机器犯错。

    目前主要有语音、图像、文本、视频数据的采集标注。云知声日常所涉及的是语音的标注,与智能产品进行语音交互和我们平时与人的交流对话相似,在生活中,你可能突然问你身边的人,“小云,现在几点了”,“现在3点十五分”,“小云”就是唤醒词,“现在几点了”就是命令词,唤醒词和命令词均要采集。为了让即便带有背景嘈杂声、或是略带方言口音也能准确识别,这背后有一个数量庞大的数据训练集支撑。每个语音命令需要采集至少100人的语音数据,既要罗列出所有可能的句子,又要搜集尽可能多的人不同的说话方式,覆盖到地域、性别、各年龄段。

    比如我们的PandoraA1客房智能管家,当查询酒店服务时,就有多种表达方式,“提供什么服务”、“包括哪些服务”、“有哪些服务”、“有什么服务”等。同时,会有严格的性别、年龄段、口音采集人数占比,以保证最终的精准识别。

    对每一个采集的词句,都要做到精细标注,采集的语音需要符合相应的技术要求,标注的时间点要精准控制在100毫秒以内。数据标注的速度决定了AI 产品的研发速度,提高标注的效率也就显得很重要。

    为了配合数据标注团队的工作厦门展厅还藏着一个神秘的声学实验室,这里可以说是整个公司最安静的地方了。

    声学实验室的主要用途是采集原始声音数据,为了贴近产品实际使用场景,整个装修布置符合家居场景。

    实验室采用减振隔声墙体,房间被墙体隔开,墙面、吊顶与外部房间没有任何刚性连接,完全与外界隔绝。墙内的吸声材料主要由多孔的玻璃纤维板组成,具有较好的声音吸收能力,除了吸声材料外,声学实验室四周还布置了窗帘,可以让声音充分扩散,使整个空间内的声场均匀分布。地板采用的是地砖和吸声地毯,实现实验室与建筑基座的分隔,无反射和回声。

    声学实验室内五脏俱全—标准麦克风、高保真音箱、声卡……应有尽有。

    许建说,为了达到设备在实际应用场景中达到最优效果,在声学实验室采集时就要模拟真实环境,需要覆盖不同的噪音、信噪比、距离和角度。

    为了保证支持远讲的语音产品出厂前的效果,在前期的采集阶段就要把产品在实际应用中受到的噪音干扰和不同距离、角度的声音效果考虑进去。

    像我们有些设备是支持5米远讲识别的,就要求录音人距离录音设备一米、三米、五米距离的录音数据,同时会设置0°、-30°、-60°等不同角度的设备叠加采集。经常在采集的过程中根据场景需要加入音乐噪声、电视噪声、办公噪声、室外噪声等,模拟出真实场景的噪音干扰。

    人工智能的发展,催生了数据标注这个新职业,随着人工智能大规模的落地应用,至少在未来的五六年内,人工智能像是一个嗷嗷待哺的婴儿,等待着数据的喂养。数据标注专员赋予冷冰冰的机器以鲜活的“生命”,教他们我们的知识,让他们变得有“温度”。

  • ?

    BasicFinder 标注平台数据科学家吴昊:从数据采集与标记行业看数据与深度学习之关系(分享总结)

    未央

    展开

    雷锋网 AI科级评论按,深度模型在机器学习很多领域都取得了巨大成功,但也对算法的原材料训练数据提出了更多的要求。对于研发高水平的算法,数据的高质量采集、清洗、处理等等对算法效果会有直接影响。

    在近期雷锋网 AI研习社的线上分享会,来自 BasicFinder 标注平台的数据科学家吴昊为大家介绍了数据规模、数据质量等与深度学习算法之间的关系,以及为算法做数据准备的一些经验。

    吴昊,本科毕业于上海交通大学,硕士毕业于纽约大学,现任 BasicFinder 标注平台数据科学家,专注于数据众包策略研究、深度学习模型数据采集与标记方案咨询及优化。

    分享内容:

    大家好,我叫吴昊。本科毕业于上海交通大学,研究生毕业于纽约大学。我之前做过两年左右的算法研究工作,我们公司 BasicFinder 平台主要提供一些数据方面的服务,包括采集、标注、清洗、其它别的加工等等。我今天分享的主题是AI数据面面观。

    下面是今天分享的目录,分为四部分:

    数据规模

    数据质量

    无监督学习与迁移学习

    做算法研发在数据准备方面的注意事项

    数据规模

    先看数据规模,数据规模与算法模型的容量其实是比较相关的。算法模型的容量越大,就意味着算法能表示相对来说更复杂的关系。

    当数据规模相对过大时,在训练过程中容易产生欠学习(underfitting)。另一方面,在数据规模相对过小的情况下,就会产生过学习(overfitting)。

    近年来流行的深度学习模型可以拥有非常大的容量,模型中普遍用的神经网络算法,层数可以增加,每层神经元个数可以增加,那么模型的表达能力也会增加。下图是一个例子。此外学术界也会做一些新的研究来增加模型的表达能力。另一方面得益于GPU,比较复杂模型的训练也会比以前快很多。

    现在有一个问题,数据更多的话效果就会更好,那么究竟有多好呢?Google的一遍论文解决了这个问题。

    这个数据集是ImageNet的两百多倍。随着数据集里样本数量的增多,在COCO上的结果比用之前的数据集至少高出三个点,而在算法的其他方面都没有太多变化。可以看到数据规模的增大对算法的效果提升还是比较明显的。

    在工业界,数据规模更容易成为算法研发的关键因素。如果有更多的数据,就可以使用容量更大、更复杂的模型,得到效果更好的算法。当数据大到一定程度,数据和算法之间可以进行反复迭代,形成壁垒,为公司提供竞争力。

    数据质量

    数据质量会影响算法效果。

    对于质量一般的数据,比如经过爬虫得来的数据,经过清洗、处理后,算法效果会有明显提升。如果数据质量已经很高了,再去提升数据质量,算法效果的提升比较有限。

    另外还要考虑到成本和收益的权衡问题:想获得质量更高的数据,成本也会更高。

    接下来讲一下对数据质量的评估。数据质量评估主要包括两个方面,一是原始采集数据质量,二是数据标注质量。

    下面是对原始采集数据质量的评估:

    图像、视频:分辨率,清晰度,光照,色彩等

    语音:清晰度,背景音等

    文本:是否自然语言,是否专业,与主题相关性等

    下面是对数据标注质量的评估:

    标注正确率(类别数据)

    标注精确度(坐标、时间点、个数、文字等)

    标注完备性(是否漏,是否重复)

    标注一致性(前后规则是否一致)

    人工标记的大规模数据一般都会含有噪声,一些经典数据集也含有噪声,例如人脸LFW、MS COCO等,这是不可避免的,不过在可以接受的限度内就行。

    无监督学习与迁移学习

    接下来谈一下无监督学习与迁移学习,迁移学习已经有一个比较大的数据集作为基础了,再用人工标注一小部分新数据。

    对于无监督学习,基本上不需要人工标注,主要是学习数据本身的分布特性。比如说聚类算法,就是试图找出数据集中分布的中心,所以不太需要人工标注。

    目前工业界相对来说比较好的结果还是通过监督学习而来,很多都需要大量人工标注的数据。无监督学习和迁移学习在未来还是有待学术界研究,以望更大的突破。另外,在未来数据规模进一步提升的情况下,无监督学习和迁移学习会有更多的用武之地。

    数据准备方面的一些经验

    最后介绍我们在开展业务中的一些经验。

    数据准备最开始是数据获取,数据的获取也分为几种情况,比较常见的是互联网公开获取(公开数据集、爬虫等),除此之外还有专业数据采集。在专业数据采集时,需要考虑采集方式:一是采集内容、采集规模、预算;二是采集过程要尽量与实际使用场景相一致;三是要考虑对数据集的要求,比如多样性;四是采集是否涉及隐私、个人权利如肖像权、著作权等。

    最后还有采集时间的要求。

    然后是数据清洗。采集来的数据很多都需要清洗,例如爬虫、监控视频等。

    数据清洗之后就要进行数据标注,标注的规则要尽可能地详尽、清楚,需要给出文档和例子。专业的标注过程,一般有试标阶段,这个阶段需要详细了解并确定需求。此外,在试标和正式标注过程中也会遇到不确定的情况,需要及时进行沟通,否则可能会影响到整体标注质量。

    对于数据标注的方式,以及最终的输出格式,都需要算法研发人员来制定,有可能的话还是尽量使用常见的方式和格式。

    数据标记完之后就是数据审查。做审查主要参考对数据质量的要求(正确率、精确度、完备性、一致性等)。审查方式有抽查、排查特殊指标、利用某些特征排查异常值这几种。

    结论如下:对于算法来说,数据越多越好、越广越好、越准越好。在现有的情况下,监督学习的效果优于无监督学习/迁移学习。

    雷锋网 AI科技评论。

文本数据采集标注

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP