中企动力 > 商学院 > 语音数据采集
  • ?

    谷歌和Mozilla建开源语音数据库,只为让AI们更聪明?

    河流

    展开

    编者按:想要制造完美的语音助手,首先你得有足够大的语音数据库。谷歌与Mozilla都对此有清晰的认识,他们正在展开一场竞赛,收集世界各地不同语言、不同口音人们的语音片段。本文编译自FastCompany原题为“Google, Mozilla, And The Race To Make Voice Data For Everyone”的文章。

    语音控制助手Siri、Alexa、Cortana、谷歌Home有多好,实际上是由驱动设备的数据决定的。训练程序,让它理解用户所说的话,需要许多许多真实世界的样本,也就是人类说话的样本。

    正因如此,在竞争中老牌语音识别技术公司占据优势,因为它们积累了大量样本语音数据,可以用来训练算法。创业公司也想参与竞争,它们必须购买属于自己的语音和音频文件,可能是从现有档案中提取,比如从TED Talk实录中转化过来的300小时语料库。

    卡耐基梅隆大学研究教授Alexander Rudnicky说,开发者要进入语音资料,这些资料长达几百或者几千小时。

    上周四,谷歌开放一个众包全球语音记录数据库。里面有65000段1秒音频,包括全球各地用户所说的简单语音命令,比如是的、不是的、停止、前进等等。就在几周前,开发火狐浏览器的Mozilla也推出一个新项目,名叫Common Voice。它们的目标是构建一个免费使用的众包语音样本数据库,样本来自全球各地,人们所说的样本词汇和句子多种多样。

    谷歌的记录是AIY人工智能项目的一部分,这个项目相当于DIY人工智能项目,有了它制作者用机器学习做实验会变得更容易。软件工程师Pete Warden在声明中介绍说:“我们创造数据的基础架构已经开放,希望能有更多的社区用它制作自己的数据,为那些服务不足的语言和应用创建数据。”

    语音数据的容量超过1GB,谷歌收集了许多语音数据训练AI系统,本次开发的数据只是其中的很小一部分。谷歌还曾开放自动目录助手服务,它是谷歌收集人类语音数据的一种主要方法。

    亚马逊Alexa将用户的查询声音上传到服务器,然后用数据对工具深入训练。苹果让Siri学习新语言和方言,它招募讲话者阅读特定文本短文,当服务将语音转化为文本时,苹果让人翻译音频段落。微软在全球设立模拟部门收集音频段落,用来训练Cortana数字助手。

    所有这些都是悄悄进行的,学术专家、研究人员、竞争对手拿不到数据。正因如此Mozilla才会决定推出Common Voice项目。

    Mozilla新兴技术高级副总裁Sean White说:“根据这些系统开发时,我们发现在算法领域我们可以站在其它人的工作成果之上开发,拿出自己的算法创新成果,然而管理数据、生成数据、聚合数据却是一大挑战。如果你想开发新的语音识别系统,想找到可以使用的高质量数据是一件很难的事。”

    Common Voice邀请每一个人加入,只要能上网、有麦克风就可以阅读特定句子,将简短的语音记录提交上去,所有一切只需要在Web浏览器上点击几下、触击几下就能完成。谷歌的项目大体也是这样运行的,只是Common Voice要求大家提交完整的句子录音,而谷歌只要求提交特定单词或者数字,这些单词和数字在命令中经常使用。句子有的是贡献者提交的对话短语,还有引文,比如电影中出现的话语。Mozilla要求参与者提供一些基本统计信息,比如年龄、性别、所说英语的类型。

    在最开始的57天里项目收集了30.7万段记录,每段语音长3-5秒。Mozilla开放创新团队首席策略师Michael Henretty说,记录加在一起相当于340-510小时的语音,

    Michael Henretty说:“时长已经超过TED演讲,它是现有最大的开源数据库之一。”

    今年晚些时候,Mozilla的目标是推出一个数据库,希望到时里面有10000小时的音频,按照公司的估计,如果数据的数量达到这样的水平,就可以训练高质量现代系统。谷歌刚刚开放的数据库只有18小时记录,Mozilla的数据多得多。

    Rachael Tatman是谷歌数据科学平台Kaggle的一名数据准备分析师,今年她发表一篇论文,介绍了性别、方言对YouTube自动添加字幕的影响。她发现如果说话的是女人或者是来自苏格兰的人,字幕精准度会降低,使用的训练数据不同,不同系统犯的错也不同。

    Tatman说:“如果我听到许多语音,这些语音是弗吉尼亚女人说的,那么我会很熟悉弗尼吉亚女人的声音,至于加州男人说的话精准度就会差一些。”

    现有开源数据库都有自己的偏见,例如,有一个数据库叫作Swithboard会话数据库,它是德仪收集的,现在已经归宾夕法尼亚大学Data Consortium所有,这个数据库对美国中西部的语音存在偏见。在人工智能的其它领域,偏见数据也是一个问题,一些算法识别白人的脸很精准,如果非洲裔美国人在Twitter上用英文发消息,它们却难以理解;科技企业和开源项目对此很担心,它们希望服务多样化。

    Mozilla还会邀请用户对提交的样本进行验证,他们要倾听样本,确保记录正确。

    Tatman说,流行语音助手服务开发商大多没有开放内部记录并非全是因为竞争。有许多询问包含了个人信息,比如互联网搜索记录,发送的文本信息,它可能会泄露用户隐私。个体语音是有特点的,根据语音可以确定个体的身份。

    尽管如此,企业愿意在内部使用数据:苹果之前曾说过,它会保留Siri数据,保留之时会将身份信息剔除,比如ID号码、邮件地址,保留时间最多2年,用来改进算法。

    Tatman说:“你的语音是可以识别的,它是身份信息。”

    Mozilla也在采取措施保护用户隐私,它收集开源语音数据。Mozilla说:“我们花了很大的精力将用户与记录分离,确保里面没有个人身份信息。”

    Mozilla数据库相比现有公共记录(比如TED演讲内容)有一个优势:数据是在用户真正使用语音识别软件的环境下记录的,和Siri、Alexa设备的声音样本相似。

    Rudnicky说:“从根本上讲,他们用浏览器收集数据,也就是说他们收集的数据会有不同的特点,这些特点能够代表目标用户,告诉我们他们是怎样的。我坐在办公室,拿起特殊麦克风,它可能是用于桌面环境的麦克风,以及类似的东西。”

    在刻意的安排下,扬声器、口音多种多样,数据集的规模符合预期,这样一来收集的记录会比现有音频数据更实用,甚至可以与大公司自己使用的数据相提并论。

    Henretty说:“我们正在努力编织一张尽可能大的网。”

    (36氪编译组出品,未经允许严禁出品。编辑:郝鹏程)

  • ?

    云知声数据标注团队:我们是怎样教机器人说话的

    曹乐蕊

    展开

    “如果机器在某些现实的条件下,能够非常好地模仿人回答问题,让提问者在相当长时间里误认它不是机器,那么机器就可以被认为是能够思维的。” — 阿兰·图灵

    人机对话是人类对人工智能最初的设想,也一直是人工智能领域的目标之一。

    即使我们经常听到“这个问题我还没有学会”,但是不可否认,人工智能已经基本实现”可以说话”了。那么,机器人是怎样学习的呢?这就需要提到人工智能需求下诞生的一个新职业,也是人工智能背后的“隐形者”——数据标注专员。

    众所周知,我们教小孩子认识海豚,就要拿海豚的图片告诉他,这是海豚。久而久之,他记住了海豚的特征,当他去动物园看到了海豚,就知道那是海豚。类比机器人,为了让机器人“像人一样说话”,我们先要教它学习,通过大量的学习之后,它才能对事物做出分辨。

    在AI领域,教机器人学习必须有大量的训练集和测试集,训练集通俗说就像是我们学习时做的习题集,测试集像我们考试做的试题。测试集和训练集里的数据必须是支持算法可用的标注数据,而将采集的原始数据变成算法可用数据的过程叫做“数据标注”。即对采集来的文本、图片、语音数据进行梳理、整理、定性的过程。而数据标注专员就成了为人工智能的发展供应重要且源源不断的“数据燃料”的人。

    云知声就有一个庞大的数据标注团队从事数据服务工作,并且,仅有的数据标注团队还在云知声的东南总部厦门公司哦。团队的小伙伴几乎每天默默戴着耳机对着电脑7-8小时,真的是此处无声胜有声!

    数据标注是一项重复且繁琐的工作,如果把人工智能比作金字塔,最顶端的是人工智能应用(比如机器人、无人驾驶等),而最底端的则是数据服务,数据服务既是根基,也是人工智能必要且必不可少的一环。

    数据标注工作真的像是工厂里的流水线操作吗?只是重复性地对数据进行标注吗?

    云知声数据标注团队的负责人许建说,目前人工智能领域对于数据采集和标注的需求量非常大,数据采集后首先进行数据清洗,清洗之后才是数据标注,标注要求尽可能地详尽、清楚,最后的审查阶段对标记的数据进行正确率、精确度、完备性等方面的审查。实际是,数据质量会影响到算法效果,一旦标注人员出现了错误,也会影响到机器犯错。

    目前主要有语音、图像、文本、视频数据的采集标注。云知声日常所涉及的是语音的标注,与智能产品进行语音交互和我们平时与人的交流对话相似,在生活中,你可能突然问你身边的人,“小云,现在几点了”,“现在3点十五分”,“小云”就是唤醒词,“现在几点了”就是命令词,唤醒词和命令词均要采集。为了让即便带有背景嘈杂声、或是略带方言口音也能准确识别,这背后有一个数量庞大的数据训练集支撑。每个语音命令需要采集至少100人的语音数据,既要罗列出所有可能的句子,又要搜集尽可能多的人不同的说话方式,覆盖到地域、性别、各年龄段。

    比如我们的PandoraA1客房智能管家,当查询酒店服务时,就有多种表达方式,“提供什么服务”、“包括哪些服务”、“有哪些服务”、“有什么服务”等。同时,会有严格的性别、年龄段、口音采集人数占比,以保证最终的精准识别。

    对每一个采集的词句,都要做到精细标注,采集的语音需要符合相应的技术要求,标注的时间点要精准控制在100毫秒以内。数据标注的速度决定了AI 产品的研发速度,提高标注的效率也就显得很重要。

    为了配合数据标注团队的工作厦门展厅还藏着一个神秘的声学实验室,这里可以说是整个公司最安静的地方了。

    声学实验室的主要用途是采集原始声音数据,为了贴近产品实际使用场景,整个装修布置符合家居场景。

    实验室采用减振隔声墙体,房间被墙体隔开,墙面、吊顶与外部房间没有任何刚性连接,完全与外界隔绝。墙内的吸声材料主要由多孔的玻璃纤维板组成,具有较好的声音吸收能力,除了吸声材料外,声学实验室四周还布置了窗帘,可以让声音充分扩散,使整个空间内的声场均匀分布。地板采用的是地砖和吸声地毯,实现实验室与建筑基座的分隔,无反射和回声。

    声学实验室内五脏俱全—标准麦克风、高保真音箱、声卡……应有尽有。

    许建说,为了达到设备在实际应用场景中达到最优效果,在声学实验室采集时就要模拟真实环境,需要覆盖不同的噪音、信噪比、距离和角度。

    为了保证支持远讲的语音产品出厂前的效果,在前期的采集阶段就要把产品在实际应用中受到的噪音干扰和不同距离、角度的声音效果考虑进去。

    像我们有些设备是支持5米远讲识别的,就要求录音人距离录音设备一米、三米、五米距离的录音数据,同时会设置0°、-30°、-60°等不同角度的设备叠加采集。经常在采集的过程中根据场景需要加入音乐噪声、电视噪声、办公噪声、室外噪声等,模拟出真实场景的噪音干扰。

    人工智能的发展,催生了数据标注这个新职业,随着人工智能大规模的落地应用,至少在未来的五六年内,人工智能像是一个嗷嗷待哺的婴儿,等待着数据的喂养。数据标注专员赋予冷冰冰的机器以鲜活的“生命”,教他们我们的知识,让他们变得有“温度”。

  • ?

    龙猫数据:AI音箱——唤醒你的智能生活

    世德

    展开

    从谷歌的AlphaGo碾压地球上顶尖的围棋高手开始,人类才如此清晰的认识到人工智能(AI)究竟是一个怎样的存在,万万没想到,电影场景中的那些“超科幻,强人工智能”,已经在现实生活中似种子般悄然生根发芽。

    人工智能目前为止不仅应用到了无人驾驶、无人零售店、智能机器人等领域,还在主打语音交互和物联网的智能音箱设备上施展拳脚。特别是亚马逊Echo,作为智能音箱的开山鼻祖,一经推出,就此解锁了智能音箱领域的大门。

    有人说,智能音箱是AI的下一风口,科技巨头和互联网公司都在抢占高地。为此,龙猫数据盘点了智能音箱的行业趋势和发展现状,看看各家是如何玩转智能音箱的。

    智能音箱,是一个音箱升级的产物,是家庭消费者用语音进行上网的一个工具,比如点播歌曲、上网购物,或是了解天气预报,它也可以对智能家居设备进行控制,比如打开窗帘、设置冰箱温度、提前让热水器升温等。以语音说话为主要交互手段,以音箱为媒介,打通了海量内容,能听,会说,懂你,并对接了服务资源,这才是真正的有“智能”的智能音箱。

    智能家居有那么多的品类,为什么独有智能音箱会如此火爆呢?人机交互由从传统的PC鼠标键盘交互,到触屏交互,再到最新的语音交互(Siri,小爱等等),随着语音语义技术的发展,未来的交互,语音会逐渐成为主流。对于智能家居系统来说,智能音响是未来需求的入口和可互联设备的控制中心,所以基于自然语言的智能AI音箱迅速风靡也就不足为奇了。

    智能音箱是目前智能家居控制最为理想的关键入口,入口往往会决定整个生态系统中智能硬件的选择,必然会选择与之配套的智能家电等硬件,进而影响到相关智能家居产品的生态与销售,于是谷歌、亚马逊、苹果等巨头都在积极扩充自有控制系统的支持品牌阵列。

    从最早的Amazon Echo智能音箱开始,基于alexa语音助手的超强交互一直是智能音箱最为核心的优势,而且Amazon Echo智能音箱在国外已经取得了不错的市场占有率,消费者对于此类产品的认可程度也更高。

    国内智能音箱公司对于产品也有着不同的定位,而这在产品端也有着充分的体现,基本上国内的智能音箱可以分为三大类:

    首先就是小米、阿里、京东、联想等“大公司”,背后通常都有着庞大的商业生态,智能音箱只是为了平台的接入需求,从而推动自身商业生态的建设。从小米推出小米AI音箱,再到阿里的天猫精灵,低价不仅让消费者更加接近智能音箱这类产品,也加深了用户对于人工智能的初始理解,起到了很高的教化市场的作用。消费者对于产品的认识更多的倾向于智能家居的控制平台,而这也是智能音箱之所以被众多平台型公司看重的最主要因素。

    其次则是以Rokid、出门问问、Broadlink等在内的智能硬件公司,他们对于产品更加专注,聚焦在产品功能的提升上面,不仅关注智能音箱的本身,同时将更多的重点放在了语音交互、连接智能家居未来发展上面。

    而第三种则是一是以酷狗潘多拉、喜马拉雅为代表的内容型公司,希望借助智能音箱作为入口来推广背后丰富的内容资源,“智能化”的操作方式显然也有助于提升用户的交互体验,拉近用户与内容之间的距离。

    智能音箱涉及到的关键技术主要是语音是唤醒、语音识别(ASR)、自然语言理解(NLP)、对话管理(DM)、自然语言生成(NLG)、合成语音(TTS)等。

    ▌唤醒

    出于保护用户隐私和减少误识别两个因素的考虑,智能音箱一般在检测到唤醒词之后,才会开始进一步的复杂信号处理(声源定位、波束形成)和后续的语音交互过程。

    ▌语音识别(ASR)

    语音识别的目的是将语音信号转化为文本。语音识别技术相对成熟。目前,基于近场信号的、受控环境(低噪声、低混响)下的标准音语音识别能够达到很的水平。然而在智能音箱开放性的真实环境,语音识别依然是一个不小的挑战,需要接合前端信号处理一起来优化。

    ▌自然语言理解(NLU)

    NLU 作为一个研究课题还远没有被解决。但是在限定领域下,结合良好的产品设计,我们还是能够利用现有技术,做出实用的产品。目前主要分为领域分类,意图分类,实体抽取三个子问题来进行解决。

    ▌对话管理(DM)

    多轮对话对于自然的人工交互非常重要。比如,当我们询问“北京明天的天气怎么?”,之后,更习惯追问“那深圳呢?”而不是重复的说”深圳明天的天气怎么?“不同于纯粹的聊天机器的对话管理,智能音箱的对话管理还有实际的操作功能(查询信息、提供控制指令)

    ▌自然语言生成(NLG)

    目前完全自动化的 NLG 方法还不成熟。实际产品中,多采用预先设计的文本模板来生成文本输出。比如,播放歌曲时,生成语句为:“即将为您播放【歌手名】的【歌曲名】”。

    ▌合成语音(TTS)

    TTS 的终极目标是,使机器能够像人一样朗读任意给定的文本,参数合成和拼接合成是TTS的两种主要合成方法。

    智能音箱使用的体验很大程度上取决于语音识别的准确性,而深度学习识别的准确性主要依赖于模型的优化和数据的规模,而这主要依赖于训练数据的采集和标注。

    龙猫数据在AI数据领域深耕多年,拥有专业的文本、语音采集和标注团队,为智能音箱领域的企业提供了大量高质量、多样性的数据,涉足的如下业务也基本满足了智能音箱各关键技术的数据需求。

    ▌唤醒词采集

    根据客户需求,采集不同地区、语言、性别、年龄、距离、环境的唤醒词语音数据,用于普通话及方言的语音识别开发,准确率达到98%以上。自有专业录音环境及录音设备,能够满足客户低噪音等各种采集需求。

    ▌命令语音采集

    通过众包平台可采集不同场景和环境下的语音数据,覆盖全国各区域人口的发音,录音采集设备是高端智能手机。录音环境均为真实场景,语音数据规模大,可用于真实场景语音识别系统训练、测试、语音分析、混合发音研究等多种用途。

    ▌语音清洗

    为客户提供高准确率的数据清洗服务,可清洗噪音、静音、方言、模糊、敏感词、特定词语等语音数据。

    ▌语音转写

    提供高精度的语音转写服务,融合平台领先的自然语言处理技术支持多场景语音交互转写。通过场景识别优化,为车载导航,智能家居和社交聊天等行业提供语音解决方案,准确率达到90%以上

    ▌文本语义标注

    龙猫数据NLP文字标注是平台核心的功能服务之一,结合专业的标注团队和独特的语义分析技术, 一站式满足用户NLP、转码、抽取、全面数据采集等中文语义分析需求服务,客户能够基于我们的服务实现搜索、推荐、舆情、挖掘等语义分析产品开发应用,也能够通过与我们深入合作定制产品特色的语义分析解决方案。

    龙猫数据借助自身众包模式和技术的优势,不止为智能音箱企业提供了大量的优质数据,还根据客户需求提供定制化的解决方案,做好AI行业的“送水人”。

    我们的服务内容

    我们的服务客户

  • ?

    行业首款智能语音微波炉亮相AWE | 发明 让生活更美的

    申屠莹

    展开

    3月8日,AWE开展首日。汹涌的人潮在美的厨电展馆逗留盘旋。一款微波炉引起了参观者的极大兴趣,现场被围得水泄不通。以至于作为美的厨电事业部微波炉产品部部长的刘波,几次想与新作品合影都未能成功。

    这幕场景,让刘波以及现场所有美的工作人员感到激动和幸福。这款新作品是由美的研发团队甚至动用了美国的研发中心,历时一年多研发而成的智能语音微波炉X3——凝结了当前美的乃至全球微波炉行业最顶级的发明和创造。包括智能语音系统可以实现人机交互、第四代智能变频技术精准控温、海量菜单自由选择等等配置,让微波炉不再是一款冰冷的机器,而是成为一个有智慧、会做美食的厨房精灵。

    这同样让笔者感慨。上个世纪90年代初期,微波炉作为舶来品被引入中国;2000年,美的第一台微波炉下线。中国微波炉发展史发展的25年时间,美的参与了19年的时间。从初期普及的艰辛到后来的价格厮杀,再到2013年停售停产低端微波炉,直至今年年初智能语音X3的问世。美的精彩演绎了一番后来者居上,并主导行业发展的进军路线图。

    其中,建立在消费者洞察基础上的产品的研发,正是美的厨电赢取行业领军地位的核心原因之一。

    一台真正的智能语音微波炉

    “与市面上大量的语音播报、WIFI模块嵌入不同,美的这款X3是一台真正意义上的智能语音微波炉”,美的微波炉产品部部长刘波自豪地告诉记者。

    对于智能家电,用户最为关心的是功能体验的人性化和智能程度。换句话说,智能功能好不好用、管不管用,成为衡量一台智能微波炉的最关键原因。

    在刘波看来,这台搭载美的最先进技术的微波炉,某种意义上就是一只小精灵。它的人机交互水平、自我运算和处理能力,已经完全拟人化,甚至是童话故事里的芝麻开门那样神奇。“你爱美食,你对烹饪一无所知,但只需要对着微波炉说出你的想法,机器就会帮你实现”,刘波风趣的说,“这绝对是君子动口不动手”。

    能够实现这个神奇功能的,源自这款机器的三个重大发明和创新。

    首先是高水平的人机互动水平。这款机器的人机交流是通过语音来实现。其搭载了ChipIntelli&Conexant语音芯片的微波炉,采用深度神经网络(DNN)、全方位唤醒、噪声抑制、回声消除等多种技术,语音识别更精准,即使10米远距离也能准确识别。而且语音数据的采集、计算、决策均在微波炉设备上进行,使得从用户说出命令到执行仅需0.2s~0.8s,无需等待,即刻启动。CI1006芯片支持上百条本地语音词条识别,整个人机交流沟通的水平无基本无迟滞,十分流畅,如同人与人之间的交流对话。

    其次是海量菜单。能帮消费者消费者实现美食愿望的,肯定还要有一个智慧的大脑。这台微波炉的芯片上,储存了10大分类菜单,60道美食菜谱。只需叫出菜谱的名字,微波炉便可自动调节到该菜单所需的模式。消费者无需进行复杂而专业的时间和火候操作,“傻瓜式”操作,便可烹饪出美味的食物。

    在接到指令后,能够烹饪出专业级美食的,当然还离不开精准的火候。采用第四代变频微波技术的X3,微波效率高达70%,“负一度解冻”、瞬间火力180瓦和1200瓦自由切换,微波+烧烤复合功能,使得这台微波炉能够高效完成各种复杂的美食烹饪。值得特别一提的是,第四代变频微波技术,是目前美的在高端微波炉上的标配,这项技术获得57项专利,其中国际专利8项,发明专利25项目,实用新型专利24项。

    智能湿度感应,则是这款微波炉能够烹饪美食的又一项技术发明。通过湿度感应系统,机器自动调节火力和时间,不需要消费者进行操作

    同时,这台机器的人性化设计,无处不在。23L大容量,易清洁腔体,去除油污只需轻轻一擦等等,对改善消费体验,全都是实打实的提升而无一处浮夸。

    发明,源自对消费的深切洞察

    改革开放40年,中国经济发生了翻天覆地的变化。由物质匮乏到物质极大丰富,再从物质极大丰富到物质极大优化,这反应的是消费基本面的不断提升和改善。尤其是最近十年时间,国内消费提档的需求越发明显。有数据统计显示,中国的中产阶层已达2.25亿人,对生活品质和品位的追求,将酝酿出一个又一个风口,给无数个产业带来机会。

    微波炉品类,正是众多产业的典型。

    最近的一次调查显示,尽管目前微波炉普及程度较高,但目前国内以微波炉为烹饪炊具的比例不到40%,大多数消费者仍然只把微波炉作为厨房中实现“加热”功能的配角,而不是承担主要烹饪任务的“主角”。而这恰恰是中国微波炉行业与国外发展最大的不同。

    据了解,北美欧盟的人口总量不到8.5亿,比中国人口总量少近5亿,但他们每年消费微波炉超过5000万台,而国内市场还不到1500万台。美的通过调研发现,发达国家不仅微波炉卖得多,而且微波食品也卖得多。因此,仅仅关注微波炉产品是不够的,还必须关注微波食品。“发达国家的今天,可能就是中国的明天或后天。”

    就国内消费基本面来看,富起来的国人,亟待在消费品质、饮食健康上作出改善。尤其是对担当消费主力军的85后、90后消费者而言,追求享受、注重品位,不愿下厨却对美食极为偏爱,这正是美的厨电发明智能语音微波炉的初心所在。正如前文刘波所述,“我们的研发,正是为了这一批用户而来”,“用个不恰当的描述,消费这件事情,由俭入奢易、由奢入俭难”,“用户一旦对智能的产品产生粘性,整个消费的升级将不可逆,伴随而来的,是产品迅速的迭代和淘汰”。

    在美的看来,从消费需求着手,可以构建出一个巨大的价值链空间,包括食材、食品、器具、服务,立足微波炉制造链,协同上下游的食品链、加工链、服务链,这将是一个从百亿级市场向千亿级市场、甚至万亿级市场的持续升级。

    很显然,立足微波产业,而非是微波炉产品,美的厨电的眼界和思路更为开阔。智能语音微波炉的推出,很可能只是一个序曲。联想到美的厨电2013年便投入1000万元成立国内首家微波食品研究领域的院士工作站——沿着消费需求的提升和改变,美的厨电瞄准的,应是微波产业更大的未来。

    近20年,美的微波炉凭对市场的精准把握决胜

    如前述,中国微波炉产业发展20多年。美的参与了近20年。从2000年第一台微波炉下线,到如今全球累计3亿个消费者家庭。美的微波炉用18年的时间,不仅缔造了一名行业后入者到领军者的征战史,也铸造了微波炉行业的一段辉煌。

    在广东佛山美的厨电事业部的展厅里,一间专门为美的微波炉辟出的展厅记录了这一历史进程。

    从2000年第一台WD7017JX微波炉的不锈钢内胆,17L容积配置,到今天智能语音微波炉X3,从当初的技术引进,博采众长,到今天消化吸收后的自主发明、全球制造。在这一间展厅,美的厨电用一台台微波炉产品为自己的征战史立传。

    就在2017年美的微波炉年度产量3000万台暨全球累计销量突破3亿台的庆典仪式上,美的厨电相关负责人为微波炉的未来豪情万丈,“我们用18年的时间从0做到累计3亿台,接下来,美的要用6年的时间冲击下一个3亿台”。

    在一位与美的厨电关系密切的专业人士看来,长期以来美的微波炉在市场运作中积累的“密切关注需求变化、努力提升技术研发水平和制造水平、灵活调整市场策略”的能力,美的厨电微波炉能够脱颖而出的根本原因,也是未来美的厨电微波炉能够持续领先的根本所在。

    该人士认为,“在微波炉普及的最初几年,美的准确抓住了普及这一需求,利用自身优势,通过规模和速度牢牢站稳了脚跟”,“而如今,国内的提升型需求正在成为风口,美的厨电微波炉自然更会牢牢抓住这一需求变化”

    尤其是自2011年美的集团层面确立“产品领先、效率驱动、全球经营”三大战略主轴以来,作为美的厨电事业部旗下的核心品类之一,美的厨电微波炉早在2010年正式开启了高端品牌和高端产品的“双高战略”,率先抢占了市场先机。此后数年,围绕着微波炉的创新和跨界,美的厨电事业部推出了一款又一款备受市场欢迎的产品。

    由此可见,与全球最为强大的研发团队和智能制造水平的“硬实力”相比,对市场需求的准确洞察、对运营环境的精确把握成为美的厨电微波炉在全球持续开疆拓土的关键。

    就在本文截稿之际,美的厨电智能语音微波炉在各大电商销售平台的销售正如火如荼。作为兼顾改善型、品质型的代表型作品,美的厨电微波炉再一次用自己的实力和眼光,抓住了消费者。正如这款微波炉新品所宣称的,“语音烹饪,唤醒未来”,美的厨电将不断刷新未来的高度。(蔡锦橙)

  • ?

    36氪首发 | 语音合成进入商用落地期,「标贝科技」完成5000万元A轮融资

    布伦达

    展开

    36氪获悉, 国内智能语音交互领域的初创公司「标贝科技」已完成5000万元人民币A轮融资,本轮融资由深创投领投,恒生电子跟投。据悉,本轮投资将会用于拓展业务规模,以及人才梯队建设、前后端系统建设以及新型技术的研发。此前,标贝科技在2017年获得了千万元人民币级别的Pre-A轮融资,由凯泰资本投资。

    标贝科技是36氪持续关注的一家AI公司,成立于2016年2月,最早做数据服务,现已升级,主要做语音合成(TTS)整体解决方案及相关数据服务:所推出的名为“声音超市”的产品,可提供多音色的语音合成服务;数据服务主要包括音库制作、文本标注、评测系统、语音转写、声音采集标注等。

    作为人机交互的重要领域,语音合成技术近两年发展迅速。端对端合成技术,以及神经网络声码器技术的研究成果,使得语音合成的效果大幅提升。语音合成技术的应用也成为这两年智能语音交互领域的一个热点。国外,去年,Google系的Lyerbird推出了一套“只需一分钟的声音样本就能模仿任何人说话”的系统;今年,微软在其公有云平台上推出了语音合成定制服务产品Custom Voice。国内,讯飞推出了“讯飞留声”,只需要10段的声音采集即可完成个人声音的复刻。

    标贝科技是国内语音合成领域以技术见长的创业公司。当下其优势体现在语音合成效果更好,“个性化声音”定制实现周期更短。这与团队技术背景及数据积累有关。数据上,团队此前做语音数据服务,积累了大量的语料数据。同时,研发了高效的数据标注工具,提高了数据标注的效率。技术上,CTO李秀林从事语音行业十余年,曾就职于百度,并带领团队获得百万美元大奖。

    产品方面,今年5月,标贝科技打造了“声音超市”,为客户提供一个可供选择的、所听即所得的声音平台。主要按照API调用、SDK进行收费。目前已为360、网易等提供数据及语音合成技术服务。

    与语音识别、语义理解等智能语音交互的技术相比,语音合成技术被认为是有机会单独存在而无需做全栈的一个方向。且随着技术的成熟,开始在诸如语音交互、有声读物、新媒体、智能客服、泛娱乐领域开始被应用。这也是当前标贝主要商业落地的领域。

    CEO刘博介绍,目前在智能客服领域,标贝已与智齿等建立合作,进入银行和金融机构;在有声读物、新媒体等领域,标贝已与央视、出版社等达成合作;在语音交互领域,标贝的主要客户为智能音箱客户;在泛娱乐领域,也与几个明星工作室达成了合作;整体来看,目前智能客服领域的付费能力更好,预计明年新媒体、有声读物领域的付费能力会有所提升。

    现阶段,标贝科技的主要营收还是来自于数据业务,主要客户包括了阿里、百度、腾讯、搜狗等。根据猎云网的数据,标贝科技已成功为客户提供了总规模约1500小时的IP语音库数据。

    刘博认为,对标贝来说,当下技术与数据两项业务都会是公司重点。数据方面,公司去年开始已将部分资金投入到特色IP声音数据的储备;技术方面,公司目前的时间窗口还有半年左右,明年新的技术会突破。

    当BAT等大厂开始关注到语音合成技术,语音合成的赛道未来竞争也很可能更为激烈。刘博认为,一方面,大公司往往需要做全栈技术,技术上未必有创业公司专注,另一方面,标贝科技目前会从三方面提升竞争力,包括提升数据壁垒、广泛布局声音类型IP、技术上寻求新突破。

  • ?

    智能语音交互:阿里的研究和实践

    瞿香薇

    展开

    云栖TechDay40期,iDST智能语音交互团队总监智捷带来智能语音交互的演讲。本文主要讲解了语音识别的核心组件,语音识别准确率以及影响准确率因素,还分享了iDST智能语音交互以及阿里云的对外输出。

    在众多的人工智能应用中,智能语音交互是大众能够最近距离接触到的一个。从几年前的手机语音助手,到近年来的互联网汽车、智能音箱、电视、IoT设备等,语音交互正以前所未有的深度和广度,融入雨后春笋般涌现的各种智能设备中。国内外各大互联网公司和众多初创企业都瞄准了智能语音交互这一重要领域,并视其为下一个最重要的流量入口和服务分发途径。不仅是在这些新兴领域,智能语音交互还逐步渗透到传统行业内,助力传统服务智能化。本报告将简要介绍智能语音交互的技术现状,以及阿里巴巴在这一领域的已有研究探索和未来展望。

    智能语音交互

    智能语音交互,是阿里巴巴iDST智能语音交互团队的核心智能产品体系,将人工智能、语音识别、语言理解、语音合成、人机交互、知识图谱、大数据深度学习、声纹识别等等无缝结合,专注于各类智能终端的能力供给,提供“能听、会说、懂你”的智能语音交互体验。

    整个东西都是由阿里在自己的平台上,例如基于阿里云计算平台跟大规模弹性服务的平台上进行研发的。我们自己有比较独特的语音深度学习的声学技术,还有比较大规模的语言模型跟解码器技术。语音识别系统是无法为所有场景同时做好服务的,怎么能够在阿里云上做低成本的定制、低成本的服务,这是我们区别于其他单一语音提供商的。我们的产品在阿里内部跟外部都有一些具体的应用。

    所谓智能语音交互,它不单是语音识别或者语音合成的技术问题,更多是“能听、会说、懂你”的智能人机交互体验,形成一个闭环。那么在这当中,最主要就是三个技术,能听就是语音识别,很多像手淘里面的语音搜索,把你说的话转化成为文字,单单说今天机器把语音转换成文字的过程,完全是听见但并没有听懂的过程,所以后面的人工智能再高一层次,怎么去做这种认知,那就涉及到自然语言处理技术了。但是在语音里面用自然语言技术跟通用的自然语言技术又略有区别,例如语言理解他们叫natural language understanding(NLU),我们现在在语音里面做的事情称为spoken language understanding (SLU),首先语音识别本身会产生错误,比如说有一字之差,或者同音不同字的情况会出现,那怎么能够在有语音识别错误的时候很好的来做理解,这就是做口语理解特有的东西。最后还有语音合成,怎么样让机器能够说话,怎么用技术使得它更自然,更像人的自然表达,能够表达出当时说话时候的情绪。

    语音识别的核心组件

    语音识别技术把语音转换成文字有一个最简单的精度度量,就是识别错误率,在中文里面我们通常计算它的字的识别错误率,当Character Error Rate和Word Error Rate降为零的时候,就是一字不差的准确识别了,通过这个指标我们不断的优化语音识别系统。

    数学上来说写上公式如图,我们输入一连串的语音数据,因为语音跟图片不一样,语音是一个连续的信号,所以我们通常都不会识别一个字,都是连续的语音识别,所以你的输入会是一个时间序列,然后输出是一个文本序列。

    比如说我们用词来作为建模单元,那就有一个词序列。语音识别就是根据input,然后找出一个最大可能的词序列output,用公式写出来就可以转换成三项,声学模型、语言模型,还有在所有的词序列当中搜索出一个最大化概率的模块就叫做解码器。那分别是用做什么用呢?

    你有一个语音的特征,通过声学模型就能把这个feature到底是a的概率多一些,还是e的概率多一些刻画出来。现在声学模型在历史上有非常多的数学模型在里面使用。目前最popular的模型就是一些深度学习deep learning 的deep models,就像图中所画,有一个时间信号,每一帧都有它的input feature,然后通过一些DNN或者更复杂的模型,得到声学模型的概率。

    语言模型是说一个词序列到底概率多大,比如说可以去算我要去吃饭的概率,我要去洗澡的可能性,如果要去语音识别就不是一句人话,所以这个分就很低,我要去上班比吃饭更被人说的多一些,所以概率是0.4。这些东西可以通过大量的语料收集,通过语言模型对它进行表征,现在在语音识别里面仍然直接从你看到的语料当中把这些概率数出来。

    如果你去穷举所有的word sequence,运算量是巨大的,甚至是不可能的,怎么能够很高效的把你说的话能够解码出来,解码器现在还没有任何一个开源的解码器,可以跟真正的工业界的解码器比拟,所以这也是整个工业界做语音识别门槛比较高的原因之一,就是解码器技术还没有一个特别好用的工具被广泛的开源出来,这里面会有很多工作需要在大规模的问题当中去锤炼。

    语音识别准确率

    语音识别的准确率也是一个螺旋上升的过程,有的年代因为一些突破性的技术被提出,所以一下就会把错误率给降下来,有的年代一直没有什么好的技术突破,所以准确率是拉平的,图中是两个人打电话交谈的时候,怎么把两边人说的话转换成英文的word,这个录音就是在电话局的交换机地方录的,所以你会得到两个录的输入信号,两个人在交谈,所以这个任务就叫switchboard,错误率越低越好,1993年的时候错误率近乎是100%,那个年代无法做大词汇量的连续语音识别,2000年左右基本上能够做到20多的准确率,这条线连续的变成直线好多年,将近10年的时间没有特别好的技术提出来。

    直到2010年代以后,deep learning技术被微软从学术界学过来,然后不同的研究组都开始关注它,然后DNN模型本身就带来了一个非常大的improvement,当年就从20几的错误率直接拉到了10几的错误率,这是非常大的进展,在微软最新的公布number,他们已经把任务从10几又拉到了5.9这样的程度,当然用了很多模型的combination,跟别的一些技术在一起,整个就是一部逐渐下降的历史。哪些上面有了进步呢?比如说以前的词汇量比较小,就是说能认识的词可能数千个,那现在可能是数十万到一百万个词汇量,以前是比较有限制的一些任务,现在基本上可以随便说,比较自然的讲话,语音识别系统都能够很好的来识别,一开始只能做比较干净的语音,现在我们基本上可以做比较正常的带有一定噪声的语音识别。最开始的时候必须像朗读一样,像老师讲课一样非常好的读出来,那现在可以做比较连续自由的语音。之前是单一语言,现在我们也可以做一些中英文混合的。

    归结起来,技术的进步带来准确率的突飞猛进,把语音识别从一个实验室里面的技术,变成一个大众科技,我觉得总结下来有以下三点是最重要的:

    第一点就是数据闭环。以前我们做语音识别,数据的获得是很不易,你要从街上拉人到录音棚里面去录,然后才能采集数据,但是现在有手机,有各种各样的便携式设备。我们的用户在手机淘宝语音搜索的时候,直接可以把这些数据收上来,一旦做过了标注以后,对语音识别本身的提升非常大。

    第二点就是深度学习的进步。

    第三点就是要有好的运算能力来支撑。

    Switchboard才300小时的训练数据而已,后面有学术界的人给它扩充到了2000小时,现在工业界入门的门槛可能已经是2万小时了,这就是跟数据来源的更广泛、更易得很有关系。

    我们拥有更大更复杂的模型,尤其是深度学习模型的引入,使得在传统年代到现在年代整个的准确率在不断的提升,错误率在不断的下降,在这里面阿里也有自己一些独特的技术,比如LC-BLSTM特别适合于做语音识别任务,阿里很早把这个模型推上线,而且现在大家用手机淘宝里面的语音搜索,云栖大会上所有演讲的实时字幕,这些都是用这个模型产出的语音识别结果。

    运算能力也发展的更强大,比如摩尔定律、GPU,对整个图像领域的deep learning有很大的助力,不管是语音识别还是合成,现在都是用相似的技术来做的。

    有了这些东西以后才能够加快迭代速度,迭代时间直接关系到产品、业务的迭代周期,关系到提高业务性能和扩张产品的时间周期。怎么能够快速提升产品的体验效果,尤其在语音识别上,首先用自己收集的数据,不管你从哪里去找,然后有第一版的模型上线,然后迅速的根据数据闭环,用户在不停的使用,有live数据源源不断的上来,然后马上进行标注,标注完了以后就要有一个部分高效的learning,不管是算法也包括机器本身,怎么在一个分布式的大规模GPU的cluster里面把你的model迅速的建出来,然后马上去换掉线上模型,通过这个过程,你会发现一开始语音识别准确率的提升会是非常明显的,对于图像别的领域也是一样,就是怎么从你的实验室数据进化到用真实数据,然后迅速迭代模型做替换。

    我们有一个多GPU模型训练加速,阿里有一个ODPS的分布式系统,它不光是做CPU的分布式运算,也有GPU的分布式运算跟调度,所以我们基于此做了一个大规模的分布式多机多卡的machine learning的system,然后专门把它用在语音识别上面。我们现在可以做到接近于线性的一个训练加速,当你用16块卡的时候可以得到一个14.3倍的加速,原来用单块卡训一个模型,可能5千小时还是不能算大的训练数据量,那整个多机多卡的训练上去以后,就可能把时间压缩到一天多一点,周期就被大大的加速了,所以我们可以比较快的迭代我们的模型,让用户的体验越来越好。

    影响语音识别率的主要因素

    现在的语音识别仍然没有那么完善,有些因素可以把它变得很差。

    声学模型方面:比如环境因素,像噪音,在非常吵的环境下仍然是一个问题;近远场,如果你对着一个设备在3到5米的距离上面,当距离变长以后,也会很大的影响语音识别的准确率;还有混响,在会议室里面说话的时候就能通过各种墙面跟镜面的反射,有多条路径会把你说的话送到你的麦克风里面,就会有很强的混响,这件事情也会带来语音识别准确率非常大的下降。比如人的因素也是一个方面,方言、口音也是一个比较棘手的问题。

    语言模型方面也同样,语音识别其实是一个强的跟领域相关的通用模型,但它用到例如说医疗领域的时候,那些药的名称、疾病名称,各种专业术语它都是完全不懂的,所以需要很多自动跟半自动的方式,去做一个语言模型上面的提升。

    多语言混读方面,虽然现在部分能解,但是中英文混读仍然是一个非常难的东西,现在还没有一个特别好的方法能够完全解决。

    如果大家关注这个领域,现在97%被认为是一个good number,还有人讲匹敌人类甚至说超越人类这样的判断,阿里始终有一个观点,就是脱离具体场景谈准确率都是耍流氓,语音识别到今天的发展仍是一个非常脆弱的东西,你可以有很高的识别率,在更多的实际应用场景下,当那些不利因素都进来的时候,完全可以从97%变到0%,甚至语音识别的准确率可以是负的。因为所有的增删改都是错,如果你没有说话,语音识别系统因为噪音的关系或者别的关系仍然可以出识别结果,那这个时候去计算准确率会是负的。所以公平来说,现在的语音识别的确取得了非常大的进步,在很多以前不能做的场景下,已经做的非常好了,但是仍然有更多的场景,现在还达不到大家所期望的高准确效果。

    智能语音交互@阿里巴巴iDST

    阿里在2014年底的时候决定很严肃的来看待语音这件事情,过去用PC买淘宝,今天大家更多的用移动设备买淘宝,会不会有一天买淘宝的入口变成物联网IoT,比如说电视、冰箱、音响、汽车,会不会跟互联网的交流不再通过手机而通过更多的设备,所以语音显然是里面一个重要模态。

    我们一开始在集团内部构建基础服务能力,服务于阿里内部各种各样的语音需求,服务完内部以后,都会通过阿里云对外输出,所以现在越来越多的服务外部客户。我们特别重视数据算法跟计算的有机结合,关注交互智能和服务智能。

    手淘里面有一个服务助手叫阿里小蜜的语音识别等都是我们的技术在后面做支撑。还有云栖大会就有专门的上汽荣威互联网汽车的展示,整个车里面的语音交互、导航、听歌等等,现在整个车的业都在向智能化方向发展,例如你开到某一个商场附近,它知道你快到目的地,它就会弹出一个语音消息来问你,例如说某个地方有什么活动,某个停车场今天是免费的,或者说某一个加油站今天92号汽油直降5毛等等,你就跟它说带我去吧,它就真的带你去了,还有一些跟支付相关加油不下车,语音交互显然就是其中能够实现车跟人互动的必由之路。

    什么叫服务智能呢?我们试着把我们的传统行业例如客服的呼叫中心做一些智能化的升级,这是从阿里内部开始做的,阿里跟蚂蚁的客服中心其实每天接的电话数是非常大的,常年雇佣上万人自营跟外包小二在接电话,而且双十一用工量都是陡增的。对此,我们做了智能质检,就是当你有几万人在听电话的时候,你根本不知道你的员工有没有按照你的服务规范在做很好的服务,当时他们只能做到千分之几的抽检。智能质检上...

  • ?

    案例:广发银行——呼叫中心语音大数据分析系统建设

    酆熠彤

    展开

    本篇案例为数据猿推出的大型“金融大数据主题策划”活动(查看详情)第一部分的系列案例/征文;感谢 中金数据 的投递

    作为整体活动的第二部分,2017年6月29日,由数据猿主办,上海金融行业信息协会、互联网普惠金融研究院联合主办,中国信息通信研究院、大数据发展促进委员会、上海大数据联盟、首席数据官联盟、中国大数据技术与应用联盟协办的《「数据猿·超声波」之金融科技·商业价值探索高峰论坛》还将在上海隆重举办【论坛详情丨上届回顾】

    在论坛现场,也将颁发“技术创新奖”、“应用创新奖”、“最佳实践奖”、“优秀案例奖”四大类案例奖

    来源:数据猿丨投递:中金数据

    随着金融结构的业务发展,呼叫中心的规模与日俱增,国内超过千席的呼叫中心不乏少数,银行呼叫中心语音数据体量巨大,是典型的非结构化“大数据”。这些数据内含客户身份信息、偏好选择、服务投诉、业务咨询等重要信息,是银行优化服务质量、提高运营效率,进行营销决策和产品服务设计的重要参考。

    在大数据时代,语音数据变为一种重要业务资产,然而在传统技术条件下,语音数据保存困难,应用成本高,更难谈及进一步挖掘利用。

    以广发银行为例,广发银行是国内最早组建的股份制商业银行之一,拥有坐席数5000余个,处理业务类型共四类,日产生录音文件量在200G以上,年录音文件总量超过90T。预测未来录音数据量的年均增长率可达30%,如此海量的录音数据加剧了录音管理的难度,同时为录音调听、质检带来巨大压力。

    此外,广发银行信用卡中心海量录音数据中蕴藏丰富的客户、市场和服务增值信息,但由于海量录音数据只能依据法规作为证据保存,无法进行有效的充分利用。

    中金数据成立于2005年,注册资本是2.25亿,在北京、上海、烟台三个地方都设有独立的园区,中金数据的业务涵盖了数据中心外包服务,IT运维外包服务及应用开发服务,大数据是其中的一块战略性业务。目前语音大数据分析云产品的交付客户有交通银行、广发银行、大地保险、百年人寿的金融行业客户。

    周期/节奏

    2015年4月成功签订合同,产品同时正式上线,每月或每两月进行版本更新维护,为客户增加新的使用功能,提高工作效率,增强客户使用体验!提升企业敏捷性!

    客户名称/所属分类

    大数据技术服务:广发银行大数据语音分析技术服务

    任务/目标

    广发银行信用卡中心希望针对目前呼叫中心数据量大,一旦出现历史录音调听,需要先找到磁带,导入系统中然后员工再一一听取核对,工作量大且效率非常低,往往找一通电话需要数天甚至几周时间,而且质检覆盖范围小,无法根据客户反馈的问题,及时有效的将相关信息进行结合,更难提及获取语音数据中的潜在市场价值。

    广发银行信用卡中心希望通过使用相关解决方案,解决上述所面临的问题。并且实现语音服务系统的高效录音管理,解决语音文件的存储、调听问题,加强人工服务质检功能,同时对海量数据中的信息进行分析和挖掘,从而更加深入地了解客户、发掘市场、改善服务。

    挑战

    随着国内通信服务及电商行业的发展,录音质检管理日益为行业管理人员和智能语音质检系统提供商所重视,大量埋藏在海量电话录音中的客户需求和重要市场信息,如果都通过传统的人工监听无疑是一个巨大的工程,必将消耗大量的人力物力。同时这项支出还将会随着企业的发展而持续增长。

    所以银行金融业呼叫中心未来的快速稳步发展,尤其是广发银行这种日通话量在100万通的大体量语音数据,迫切需要构筑适合企业的智能语音分析质检系统。

    银行业呼叫中心质量监控管理是对坐席电话营销过程实施全程监控的过程。也是通过对营销代表服务质量的检测和监控,确保公司依法合规经营,防范企业经营风险,同时提升电话营销代表的营销技能和服务水平,保障这一高水平服务的持续实现的过程。另外对客户的需求、客户感受、客户建议等进行分类搜集,实现质量监控工作的综合运维。

    质量监控工作强化电话营销坐席电话销售过程的合规性、完整性、准确性、规范性。所以质检系统要保证录音信息与客户投保信息准确对应。同时为了实现公司电商业务的依法合规经营,广发银行信用卡中心要求录音质检系统还应具备违规风险点报警、服务禁语筛选的功能。

    传统质检质量监控人员每天面对大量的录音,一般是通过听录音进行合规性检查,对于批量录音中其它的重要信息则无法识别、筛选。比如关于客户投诉,有多少来电是投诉服务质量,有多少是不满意产品价格。又如面对突然上升或下滑的业务量,管理者是否能在第一时间作出原因判断,及时提供应对策略?

    所以广发银行信用卡中心要求录音质量管理系统还要有客户感受、客户期望内容搜集,以利于形成客户需求信息积累和产能转化的需求,这对于当时IT技术运维提出了一个不小的难度!

    通过与广发银行信用卡中心项目团队及时沟通,全面掌握客户对语音质检的需求后中金数据为广发银行提供了如下基础服务:

    1.实现语音全量在线存储,可以通过指定内容实现对全量语音的实时检索、调听;

    2.提高质检覆盖率,通过系统实现100%录音质检;

    3.通过系统和人工结合的质检方式提升质检效率;

    4.对电销录音相关数据进行统计和主题分析,针对话术、客户反馈、电销周期、成功情况等综合分析后,优化电销策略;

    针对于客户要求的后期语音分析内容,中金数据利用自有大数据平台,创建大数据语音分析云。将客户整理好的数据统一放到大数据平台进行存储,根据广发银行的需求研发工程师搭建不同的数据模型,定制更详细的语义规则来匹配后期对数据的分析,以及挖掘客户意见和对风险的把控。

    直至现在中金数据仍然每月或每两个月对系统进行巡检,检查系统的运行状况,并在广发银行现场进行支持性的工作,查看数据运行情况以及补充需要更新的数据。在处理事务的过程中广发银行也会提出一些新的需求,当下月再次去现场巡检时,中金数据会将更新后的系统功能带给客户使用。

    经过一次次反复的产品功能更新迭代。目前,中金数据可以为广发银行提供提供每日通话量120万通的语音数据,合计通话时长3万小时,也是业内唯一一家可以提供如此大体量语音数据分析的供应商。同时,系统可以为广发银行信用卡客服中心提供如下基于大数据的语音分析,成功解决了一直困扰广发银行业务开发的难题。

    1.通过数据分析统计,挖掘客户意见和风险,及时调整服务策略,提高客户满意度;

    2.对呼叫中心海量的语音进行价值提取,为产品设计、营销发现并提供有价值信息线索。

    生机存在于困难中,广发银行信用卡呼叫中心,从“成本中心”转变成“价值中心”,再转变为“利润中心”,承担起了更多、更重要的企业战略级任务!我们相信未来就诞生于这种转变过程中。通过我们的方案可以让广发银行从“听得到”到“听得懂”客户心声的有效转变

    实施过程/解决方案

    在经过将近为期一年的严格考察后,广发银行信用卡中心正式与中金数据签订大数据基础平台项目合作协议。为帮助客户中心客户解决上述问题,中金数据以语音数据分析作为项目首期内容。

    中金数据自主研发的“语音大数据分析平台”,依托先进的大数据平台技术,采用语音识别技术对金融机构海量语音内容进行分析识别,以较高的准确率还原出每段录音的具体内容。

    可通过关键词输入实现快速检索,通过语义分析和情绪分析技术,实现语音全覆盖自动质检;通过对大量通话记录和内容进行识别、统计、分析,可在最短时间内了解不同业务的话务结构,定位导致客户投诉、流失、话务异常等问题原因、并预测业务热点趋势,发现潜在客户。利用数据为业务全流程带来新的活力。

    在双方团队的高效协同下,于2015年4月顺利按计划实现广发信用卡中心“语音大数据分析平台”上线。迄今为止项目一二期已经顺利上线,运行状况良好,系统目前实现了主要三大功能模块:录音存管、智能质检、主题分析。

    系统实施的主要架构如下

    系统技术关键点

    1.语音识别。用于建立文本索引,将非结构化的语音文件转换为结构化的索引信息的过程。语音识别引擎具有语法识别、自由说识别、关键词检出和语音质检分析四种识别能力,能够正确识别语音文件从而形成对应的文本内容,并提供静音检测、情绪检测、关键词(服务忌语和业务术语等)和话者分离的识别结果。

    2.智能质检。提供基于角色区分、全文识别、关键词识别、语速检测、静音检测、叠音检测结果等组合的多维度质检;根据业务需要,可对所有的在线录音进行百分之百覆盖的全量自动质检。

    基于说话人区分结果,用户可定义针对坐席或客户的通话内容进行自动质检;

    基于全文识别和关键词识别结果,用户可进行针对坐席通话出现服务禁语、缺少规范用语等通话内容的自动质检;

    基于语速检测结果,用户可进行针对通话人语速过快的自动质检;基于静音检测结果,用户可进行针对通话中长时静音的自动质检;

    基于叠音检测结果,用户进行针对通话人抢插话的自动质检;基于情绪检测结果,用户可进行针对通话中情绪异常自动质检;

    3.文本分析。对电销和客服录音内容及相关数据进行统计和主题分析,针对话术、客户反馈、电销周期、成功情况等综合分析后,优化电销策略和客户服务话术;通过数据分析统计,挖掘客户意见和风险,即使调整服务策略,提高客户满意度;

    系统调听功能界面截图:

    结果/效果总结

    “以前,我们呼叫中心质检都是通过人工抽查的方式来进行的。这种质检方法效率太低且缺乏统一的质检标准,在很大程度上制约了我们质检工作在数量和质量上的突破。另外我们之前的质检大多停留在质检最终结果上,并没有找到导致出现这种结果的导火索。

    譬如导致这种质检结果的坐席客服近期的心理变化,我们不仅在于对质检结果获取和处理方面无从下手外,对于导致质检结果的原因同样不知所措。

    但是使用语音分析云解决方案后,极大提高了在呼叫服务中心在语音转换、存储、调听和质检方面的效率,实现日处理数据时长3万小时,在线数据总量200T,以及年数据量增长率30%的应用结果。

    通过这种方式,我们也可以将近期坐席客服反馈的信息,进行有效的转化,给销售人员提供提供有价值的客户信息,有效节约时间成本,自我价值都有所提高!”——广发银行信用卡中心宣钢炜经理。

    此外,语音大数据分析云作为一种大数据分析产品,可以为广发银行提供一定的业务统计和分析。可实现信用卡中心语音数据的自动化采集与分布式存储,完成语音数据智能统计分析,自动提取有价值的客户信息,因而后续可挖掘的潜力较大。在二期以及后续项目中,双方将基于现有基础,深入探讨如何在数据价值挖掘领域实现更为多元化的合作。

    企业介绍:

    中金数据系统有限公司(中金数据)成立于2005年,是国家高新技术企业,总部设于北京、在烟台、武汉、苏州设有子公司。

    中金数据是业界领先的数据中心与信息系统外包、云计算与大数据应用、灾难备份与业务连续性管理的信息技术基础设施和IT综合服务提供商,致力于社会服务信息化,专注于信息服务的社会化,帮助客户提高信息技术系统和业务运作管理的安全性和效益,提升客户核心竞争力。

    目前,中金数据在北京、烟台、武汉、苏州均已建设高可用性,高安全等级、绿色节能数据中心,且全部为自主投资、自主建设、自主管理、自主运营。十余年来,中金数据以数据中心为基础,以符合国际和国家规范标准体现,在大健康、文化产业、金融行业、出版发行、公共安全及产业互联网领域,与云计算、大数据、移动互联网的应用为增值服务,发展成为业界领先的数据中心外包服务及IT应用综合提供商,客户主要覆盖政府、金融、央企、跨国公司等领域。

    欢迎更多大数据企业、大数据爱好者投稿数据猿,来稿请直接投递至:tougao@datayuan

  • ?

    QQ数据采集软件-QQ营销必备

    George

    展开

    QQ数据采集器-QQ营销必备工具

    导语

    现在是大数据时代,无论做什么营销都需要用到数据。数据是根本,数据能引导你的营销思维。做QQ营销同样需要大量的精准数据,今天小编为大家介绍一款QQ数据采集软件,这款软件既可以采集精准客户QQ,同时也可以采集精准客户QQ群以及QQ群成员。

    软件功能特点

    ⊙支持按关键词采集精准客户qq

    ⊙支持自动检测所采集好友是否为单双向好友

    ⊙支持自动检测所采集qq是否开通临时会话功能

    ⊙支持自动识别qq所在城市、性别。年龄

    ⊙支持按关键词采集精准客户qq群

    ⊙支持自动筛选出群主qq

    ⊙支持自动检测是否可以直接添加qq群

    ⊙支持以文本文档格式导出qq群

    ⊙支持采集qq附近的人(全国定位)

    ⊙支持采集本地好友和群

    ⊙支持采集空间qq

    ⊙支持采集微博听众

    ⊙支持采集企业qq

    ⊙支持论坛qq采集

    软件功能效果展示

    易推客营销软件

  • ?

    中国普通话标准语音三大采集地 第一前推中华文明1800年

    蓝风

    展开

    今日的普通话,由“北京官话”发展而来。上世纪五十年代,在国家制定普通话语言规范过程中,有专家学者来到河北省滦平县金沟屯、火斗山等地开展过语言调查活动,滦平作为“普通话标准语音采集地”,为我国普通话语言规范的制定提供了语言标本。也正因为如此,滦平“方言”成为了最接近普通话语言规范的“方言”。

    具体来说,60年前中国普通话标准语音采集地,是河北省承德市滦平县金沟屯镇金沟屯村、巴克什营、火斗山。其中金沟屯村语言应用最多。出京承高速公路口金沟屯段,一块“普通话语音标本采集地”大型标牌赫然入目。1953年,国家语音工作人员曾先后两次来到河北省滦平县金沟屯镇金沟屯村进行普通话标准音采集。

    3 火斗山乡

    火斗山乡,河北省承德市滦平县辖地。面积162.2平方千米,人口1.43万,辖10个行政村,乡政府驻火斗山村。101国道过境。火斗山乡。辖10个行政村,乡政府驻火斗山村。101国道过境。沿革 1958年属长城公社,1961年析置火斗山公社,1984年改火斗山满族乡(Huodoushan Manzu Xiang)。1997年,面积162.2平方千米,人口14329人。

    自古以来,这里便是中原通往北方草原以及辽西地区的咽喉要塞,先后有肃慎、山戎、东胡、匈奴、乌桓、鲜卑、厍莫奚、契丹、渤海、女真、蒙古、满、汉等在这里开发建设、繁衍生息,山戎民族从商周到战国时期在滦平延续七百余年,形成了鲜明民族特色的山戎文化。

    2 巴克什营镇

    巴克什营镇(满语:baksi)位于河北省承德市西部,属滦平县,面积185.1平方千米,人口17626(2016年)。是河北省委、省政府确定的35个小城镇综合改革试点镇之一,是承德市小城镇建设示范镇。候属燕山山区,大陆性季风气候,平均年降雨量615毫升,光照充足,日照时间长,无霜期180天,平均海拔200米,有效积温3600度,平均气温11.7度。

    滦平县巴克什营镇特殊的地理位置决定了该镇在全县发展和稳定大局中的重要性,他们狠抓奥运安保,维护社会稳定,推动经济发展,以实际行动筑起责任“长城”。随着“迎、创、抓、促”活动的开展、奥运会和残奥会的召开,巴克什营镇安全稳定工作队伍不断壮大。全镇干部职工、村干部、村民小组组长、志愿者和省、市、县驻镇工作人员共755人,工作在安保一线。巴克什营镇被国务院命名为全国重点文物保护单位,国家一级旅游景点,国家级风景区,闻名中外的金山岭长城,坐落于该镇,以雄伟壮观,风景宜人,使游客流连忘返,长城脚下的太子矿泉水伴游客健康长寿。

    1 金沟屯镇

    金沟屯镇,位于滦平县东北部,承德市西北部。面积211.98平方千米,人口17359人(2016年)。辖13个行政村,镇政府驻金沟屯村。滦河北流,处燕山深处。京通铁路、张隆公路贯穿全境。金沟屯镇,北与西沟满族乡接壤,南接张百湾镇,西南接大屯满族乡,东临小营满族乡,西临丰宁满族自治县 波罗诺镇,东北临红旗镇。

    金沟屯曾出土6800多年前的新石器时期红山文化石雕女神像,被誉为“滦河流域的老祖母”“滦平史前东方维纳斯”,金沟屯将中华民族的文明史向前推进了1800年。

    1953年,国家语音工作人员曾先后两次到金沟屯镇金沟屯村进行普通话标准音采集。1955年,国家成立国家语委,制定了语言方案,当时称作官话,普通话的概念后来才有,1958年公布正式方案.方案里,很大程度上都是参照了专家到全国各地去采集语言的结果.其中,金沟屯的语言是应用最多的,金沟屯当时采集的发音,词汇,和普通话最接近.金沟屯普通话发音标准,是中国普通话标准音采集地。

语音数据采集

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP