中企动力 > 商学院 > 集点大数据
  • ?

    吴晓波百匠大集发起大数据匠人评价体系,与茶语共发茶匠榜

    白色

    展开

    2017年11月8日,在新一届的杭州ADM展上,由吴晓波频道发起的“100颗跳动的匠心--百匠大集年度主题日”闪亮登场,开启了一场盛大的匠人狂欢节。

    在主题日活动当天,除了第二期的匠人养成营,吴晓波频道还正式发布了百匠榜年度匠人大奖,致敬新时代的美好匠心。

    而茶语网作为吴晓波·百匠大集的战略合作伙伴,此次也和百匠大集一起,联合发布了百匠榜的第一个专题榜单——茶匠榜。

    此次百匠大集·茶匠榜的发布,也象征着茶语网一直以来对茶及茶周边匠人、品牌等头部资源的深刻布局和多渠道推广、流量分发的阶段性达成——不仅可以整合国内茶界优势推广资源渠道,还能将茶匠人、茶品牌、茶界IP,通过更大众化的、普通人更易接触到的信息渠道资源进行有效推动。

    这是新匠人们的狂欢节

    上午9点整,在杭州杭锅老厂房(城市之星工业遗存保护区)内,主题日活动按时开始。现场座无虚席,气氛热烈有序。

    值得一提的是,担任本次活动的两位主持人都来自百匠大集旗下的匠人,一位是黄酒酿造师陈世海,一位是90后雨伞设计师金宇航。

    在观众的掌声中,百匠大集发起人吴晓波上台发表了《定义匠能:在这个时代如何当一个新匠人》主题演讲,用新审美、新技艺、新连接对工匠精神做了新的表达。并阐述了对匠人进行养成以及赋能所做的事情。

    音乐人朱哲琴、《新周刊》创始人孙冕等嘉宾为匠人颁奖

    紧接着,由茶语网和百匠大集一起联合发布的《茶匠榜》把现场气氛推向了一个小高潮。并且由吴晓波介绍了这个榜单的缘起和推选理由。

    此外,到场嘉宾著名音乐人、跨界艺术家朱哲琴,《新周刊》创始人孙冕,复旦大学管理学院院长陆雄文,宝珀表中华区副总裁廖昱分别为沧泠、西贡火柴、丰收蟹庄、林杰颁发了此次百匠榜年度革新奖、年度探索奖、年度潜心奖、年度传承奖。

    ▲ 著名音乐人、跨界艺术家朱哲琴发表颁奖词

    到底什么人才算是新匠人?

    吴晓波和百匠君曾收到过的问(tiao)题(zhan)包括:

    ▲ 百匠大集发起人吴晓波、茶语网创始人张阳,以及西贡火柴在活动现场交流

    “这款APP把用户体验做到了极致,产品经理算不算匠人?”这个APP指的是微信……

    “我朋友他爸做的产品,绝对符合你们的三新标准,而且已超过欧美日的同类产品。”这位父亲是高铁的总工程师之一……

    “我每天专注烧菜三十年,经常花样翻新,那我能算你们的匠人吗?”这是我妈……

    百匠君经常被问得哑口无言、不得其解。

    年度探索奖获得者西贡火柴与吴晓波合影

    有没有可能制定一套客观的“新匠人标准”来界定什么样的人才算新匠人?是否能用数据来衡量新匠人的价值?为此,百匠君特意去请教了复旦大学管理学院。

    第一个大数据意义上的新匠人评价指数出炉

    复旦管院的陆雄文院长一听,来了兴趣。中国的确还没有这样一套针对新匠人的评价体系。

    复旦大学管理学院院长陆雄文

    于是,陆院长亲自牵头,成立了百匠指数专题研究小组,与百匠大集一起制定了一套匠人评价体系——通过个人价值、市场价值、产业价值和文化价值四个维度,对匠人的品牌价值进行量化评估,从而计算出匠人在创新性、成长性、独特性方面的指数。

    通过这个指数,你可以知道自己作为匠人的价值,以及在匠人群体中所处的位置。这也是国内第一款针对新匠人的数据分析产品。

    “茶匠榜”:百匠榜首个专题榜单

    就在今天,百匠大集联合中国最大的茶类垂直平台茶语网,发布百匠榜的第一个专题榜单——茶匠榜。

    茶语网从1500个茶类匠人中筛选出60多个符合要求的匠人,通过填写问卷、抓取用户评论及其他细致资料,收集到参选匠人及其企业的详细信息,录入新匠人指数的算法中进行排名,最终发布20强榜单。

    这种数据化的匠人评判在茶界还是第一次。

    茶语网为茶匠榜评价指数算法进行有效修正

    在整个茶匠榜的评选过程中,茶语网作为茶类媒体平台头部资源掌控者,以及中国最大的茶类垂直平台对算法的初步结果进行了判断与协助。特别在前期,茶语网提供了大范围的匠人,帮助修正“新匠人评价指数”的算法。

    茶语网深耕茶行业数年,凭借对茶行业的了解、匠人的理解后发现,并不是所有的东西都能被算法覆盖,比如新工艺的市场成长空间等。

    针对算法中的多种参数,茶语网也提出了一些重要的参数,例如“匠人是否非遗”也应该放到评选的参数中。而在推荐的大范围匠人时,也是根据这些匠人在茶语网后台数据的热度指数来参与评选的。

    不仅限于茶类的“茶匠榜”

    本次“茶匠榜”榜单不仅仅局限于茶类,而是涵盖了与茶有关的一切东方生活美学周边产品。

    在这个20人茶匠榜榜单中,既有制茶大师,又有茶器匠人。

    其中,建盏制作艺人林杰和沉香玩家西贡火柴,更是获得了百匠大集年度传承大奖和年度探索大奖。

    事实上,“茶匠榜”同时也是吴晓波频道与茶语网深度合作关系的见证之一。在新中产、新匠人和消费升级的理念上,茶语网和吴晓波频道有着共同认知。如吴晓波所言,新匠服务于正在升级的中产阶层,来自于此,根植于此,求活于此。

    基于这个共识,在东方生活美学的板块,在匠人、匠心,及有匠人精神的产品的发掘和内容创造上,双方将进一步做共同开发。

    茶语网:匠人和茶类的匠心品牌

    作为茶类媒体平台头部资源掌控者,茶语网更擅长在东方生活美学范围内的匠人寻找,和对他们的解析。

    茶语能找到制茶大师和茶器匠人,分享他们的作品,推广他们的技艺。帮助他们去做个人IP的建立和传播,甚至是帮他们做包装、设计,帮他做知识体系的整理打造自己的品牌。

    从某种意义而言,茶语网既是媒体,又是匠人和茶类的匠心品牌。

    而此次茶语网与吴晓波频道的强强联手,无疑将极大增强那些真正“新匠人”的曝光度。据了解,百匠大集和腾讯社交广告部已共同开启了“匠人守护基金”计划,腾讯社交广告部将拿出1000万元基金用于“百匠大集”匠人的社交投放。

    所有匠人均可报名成为匠心基金候选人,其中符合“百匠大集”和腾讯标准的匠人,将获得最高达50万元的基金扶持。

    基金将定向用于腾讯系所有社交网络平台的广告投放,包括朋友圈广告、广点通等等,精准触达到匠人们所需要的用户,促成转化销售。

    此次百匠大集·茶匠榜的发布,也象征着茶语网一直以来对茶及茶周边匠人、品牌等头部资源的深刻布局和多渠道推广、流量分发的阶段性达成——不仅可以整合国内茶界优势推广资源渠道,还能将茶匠人、茶品牌、茶界IP,通过更大众化的、普通人更易接触到的信息渠道资源进行有效推动。

    结语

    吴晓波说新工匠精神是让传统这个上帝先“死掉”再复活,它需要紧跟时代,自我更新审美,用“专心做好一件事”的老实劲儿去为自己的匠心匠能加持。

    那些守在宁静角落里,打磨一个个平凡物件的匠人,没有光打在他们身上,他们自己就在发光。而茶语网和百匠大集,想做的就是为他们再增加一点光源,让他们的世界更亮一些。

    附“茶匠榜”20强名单

    徐凌

    省级非遗大师

    造青品牌创始人

    匠人指数:3.6

    创新性(新):7.8

    独特性(匠):6.7

    * 因公司成立未满三年,成长性数据暂缺

    上榜理由:

    他是龙泉青瓷泰斗徐朝兴之子,省级非遗大师,造青品牌创始人。他家学渊源自幼学艺,却从不以正统为创作桎梏,他注重新意,是少见的介于传统和现代之间的创新者。

    曾平

    吉州窑木叶盏匠人

    匠人指数:3.8

    创新性(新):6.2

    独特性(匠):8.5

    * 因公司成立未满三年,成长性数据暂缺

    上榜理由:

    他是一位80后吉州窑木叶盏匠人,他原本师学雕塑,却被木叶盏深深吸引。他的作品中正通圆、色泽晶莹、叶脉栩栩如生,深受众人喜爱。

    陈成忠、陈铮父子

    父亲福州茉莉花茶窨制工艺非遗传承人

    儿子福州茉莉花茶传统窨制工艺传承大师

    匠人指数:5.3

    创新性(新):5.7

    成长性(工):5.0

    独特性(匠):5.7

    上榜理由:

    父亲是福州茉莉花茶窨制工艺非遗传承人,儿子是福州茉莉花茶传统窨制工艺传承大师,一门双大师,坚持以传统工艺严谨制茶。其茶汤如冰糖,鲜灵馥郁,让我们看到中国茶技艺的传承生生不息。

    西贡火柴·凌鲲

    现代沉香分类标准制定者之一

    匠人指数:5.5

    创新性(新):9.0

    成长性(工):2.0

    独特性(匠):9.0

    上榜理由:

    凌鲲,网名西贡火柴,现代沉香分类标准制定者之一,《美国国家地理》特约摄影师,柴门品牌及小盘香品牌创始人。他的品牌从香型系列到包装视觉,均涵有勇于颠覆和重塑的新匠人精神。

    樊生华、樊雪松父子

    樊生华为非物质文化遗产

    西湖龙井制作技艺传承人

    匠人指数:6.1

    创新性(新):6.0

    成长性(工):6.0

    独特性(匠):6.3

    上榜理由:

    樊生华先生拥有四十余年的制茶经验,为非物质文化遗产西湖龙井制作技艺传承人,曾获“西湖龙井茶炒茶王”“西湖龙井炒茶大师”等称号。樊雪松先生子承父业,协助父亲经营制茶生意。

    陈海标

    斗记茶业创始人

    匠人指数:6.1

    创新性(新):7.8

    成长性(工):4.0

    独特性(匠):8.5

    上榜理由:

    他是普洱茶品牌斗记茶业的创始人,也是品牌的核心技术控制人。十余年陈茶鉴道,他的茶深受行业玩家的追捧。同时陈海标开发的茶品,深度融入年轻化的元素,代表作:柑红柑白茶品,及他与张阳联合开发的挂耳兔挂耳茶。

    戴祥海

    大业茗丰·迎客松品牌领军人

    匠人指数:6.3

    创新性(新):6.3

    成长性(工):6.0

    独特性(匠):6.7

    上榜理由:

    他是“大业茗丰·迎客松”品牌领军人,也是安徽四大名茶——六安瓜片、祁门红茶、黄山毛峰、太平猴魁的传统核心技艺传承人。20余年来,他事茶从商,打造了中华名优茶品展销平台。

    孙洪、孙丹威

    联手打造温和系花茶新品类

    匠人指数:6.5

    创新性(新):8.7

    成长性(工):5.0

    独特性(匠):7.7

    上榜理由:

    孙洪先生,川红集团董事长,川红工夫传统制作技艺非遗传承人;孙丹威女士,国家级茉莉花茶窨制技艺非物质文化遗产传承人。此次两位非遗大师联手打造温和系花茶的新品类,不仅攻克了红茶窨花的技术难题,更是佐证了当代茶人包容并蓄的态度和开创的智慧。

    张笔清

    正山小种红茶制作技艺非遗传承人

    匠人指数:6.6

    创新性(新):6.8

    成长性(工):6.0

    独特性(匠):7.4

    上榜理由:

    他是非物质文化遗产正山小种红茶制作技艺传承人,他的作品“麻粟正山红”在杭州G20峰会中获得各国政要极高评价,被中国茶叶博物馆收藏。

    魏月德

    铁观音(魏荫)第九代嫡传

    国家级非遗乌龙茶铁观音制作技艺传承人

    匠人指数:6.6

    创新性(新):6.7

    成长性(工):5.0

    独特性(匠):9.3

    上榜理由:

    他自小由父辈传教制茶技艺,为铁观音(魏荫)第九代嫡传人、国家级非物质文化遗产乌龙茶铁观音制作技艺代表性传承人。坚持传统正味铁观音制作工艺,致力于对铁观音文化的推广和传播。

    林荣国

    茶文化的极致体验美学名家

    匠人指数:6.7

    创新性(新):7.7

    成长性(工):5.0

    独特性(匠):9.0

    上榜理由:

    他是美学名家,也是台湾著名陶艺家,陶作坊创始人。他研发了天然老岩泥茶器系列,并倡导推广“以器引茶”概念。39年来,他一心投入陶艺学习创作和茶文化的推广。

    林杰

    建窑建盏烧制技艺非遗传承人

    匠人指数:6.7

    创新性(新):8.0

    成长性(工):6.0

    独特性(匠):7.0

    上榜理由:

    他是兼具互联网思维与传统手工艺的80后非遗传承人。他是建窑建盏烧制技艺的非遗传承人。他的作品在保持建盏胎质与釉色灵魂的基础上,加强了实用性,使之更符合现代审美。

    陈麒羽

    山田土创始人

    匠人指数:6.7

    创新性(新):8.0

    成长性(工):5.5

    独特性(匠):7.0

    上榜理由:

    山田土是一个茶品牌,亦是一个找茶的项目,同时也是跨度数年的古茶树保护计划。它让最好的茶,遇见最合适的人。把土地和作物天生的能量、温度,通过最合适的载体与方式,传递到喜欢它的人手中。

    叶丛嘉

    凤凰单丛制作技艺非遗传承人

    潮州工夫茶非遗传承人

    匠人指数:6.9

    创新性(新):6....

  • ?

    大数据十大经典算法

    祖念薇

    展开

    最早提出“大数据”时代到来的是全球知名咨询公司麦肯锡,麦肯锡称:“数据,已经渗透到当今每一个行业和业务职能领域,成为重要的生产因素。人们对于海量数据的挖掘和运用,预示着新一波生产率增长和消费者盈余浪潮的到来。”

    “大数据”在物理学、生物学、环境生态学等领域以及军事、金融、通讯等行业存在已有时日,却因为近年来互联网和信息行业的发展而引起人们关注。大数据作为这个信息时代的产物,我们可能无法掌握这些数据的算法,但是可以了解一下大数据都有哪些算法!

    今天,来为大家详细介绍大数据十大经典算法!

    一、C4.5算法

    C4.5,是机器学习算法中的一个分类决策树算法,它是决策树(决策树也就是做决策的节点间的组织方式像一棵树,其实是一个倒树)核心算法ID3的改进算法,所以基本上了解了一半决策树构造方法就能构造它。决策树构造方法其实就是每次选择一个好的特征以及分裂点作为当前节点的分类条件。

    C4.5相比于ID3改进的地方有:

    1、用信息增益率来选择属性。ID3选择属性用的是子树的信息增益,这里可以用很多方法来定义信息,ID3使用的是熵(entropy,熵是一种不纯度度量准则),也就是熵的变化值.而C4.5用的是信息增益率。对,区别就在于一个是信息增益,一个是信息增益率。

    一般来说率就是用来取平衡用的,就像方差起的作用差不多,比如有两个跑步的人,一个起点是10m/s的人、其10s后为20m/s;另一个人起速是1m/s、其1s后为2m/s。如果紧紧算差值那么两个差距就很大了,如果使用速度增加率(加速度,即都是为1m/s^2)来衡量,2个人就是一样的加速度。因此,C4.5克服了ID3用信息增益选择属性时偏向选择取值多的属性的不足。

    2、在树构造过程中进行剪枝,在构造决策树的时候,那些挂着几个元素的节点,不考虑最好,不然容易导致overfitting。

    3、对非离散数据也能处理。

    4、能够对不完整数据进行处理。

    二、The k-means algorithm 即K-Means算法

    k-means algorithm算法是一个聚类算法,把n的对象根据他们的属性分为k个分割(k

    三、 Support vector machines

    支持向量机,英文为Support Vector Machine,简称SV机(论文中一般简称SVM)。

    它是一种监督式学习的方法,它广泛的应用于统计分类以及回归分析中。支持向量机将向量映射到一个更高维的空间里,在这个空间里建立有一个最大间隔超平面。

    在分开数据的超平面的两边建有两个互相平行的超平面,分隔超平面使两个平行超平面的距离最大化。假定平行超平面间的距离或差距越大,分类器的总误差越小。一个极好的指南是C.J.C Burges的《模式识别支持向量机指南》。van der Walt 和 Barnard 将支持向量机和其他分类器进行了比较。

    四、The Apriori algorithm

    Apriori算法是一种最有影响的挖掘布尔关联规则频繁项集的算法。其核心是基于两阶段频集思想的递推算法。该关联规则在分类上属于单维、单层、布尔关联规则。在这里,所有支持度大于最小支持度的项集称为频繁项集,简称频集。

    五、最大期望(EM)算法

    在统计计算中,最大期望 (EM,Expectation–Maximization)算法是在概率(probabilistic)模型中寻找参数最大似然估计的算法,其中概率模型依赖于无法观测的隐藏变量(Latent Variabl)。最大期望经常用在机器学习和计算机视觉的数据集聚(Data Clustering)领域。

    六、 PageRank

    PageRank是Google算法的重要内容。2001年9月被授予美国专利,专利人是Google创始人之一拉里佩奇(Larry Page)。因此,PageRank里的page不是指网页,而是指佩奇,即这个等级方法是以佩奇来命名的。PageRank根据网站的外部链接和内部链接的数量和质量,衡量网站的价值。

    PageRank背后的概念是,每个到页面的链接都是对该页面的一次投票,被链接的越多,就意味着被其他网站投票越多。这个就是所谓的“链接流行度”——衡量多少人愿意将他们的网站和你的网站挂钩。PageRank这个概念引自学术中一篇论文的被引述的频度——即被别人引述的次数越多,一般判断这篇论文的权威性就越高。

    七、AdaBoost

    Adaboost是一种迭代算法,其核心思想是针对同一个训练集训练不同的分类器(弱分类器),然后把这些弱分类器集合起来,构成一个更强的最终分类器 (强分类器)。其算法本身是通过改变数据分布来实现的,它根据每次训练集之中每个样本的分类是否正确,以及上次的总体分类的准确率,来确定每个样本的权值。将修改过权值的新数据集送给下层分类器进行训练,最后将每次训练得到的分类器融合起来,作为最后的决策分类器。

    八、KNN: k-nearest neighbor classification

    K最近邻(k-Nearest Neighbor,KNN)分类算法,是一个理论上比较成熟的方法,也是最简单的机器学习算法之一。该方法的思路是:如果一个样本在特征空间中的k个最相似(即特征空间中最邻近)的样本中的大多数属于某一个类别,则该样本也属于这个类别。

    九、 Naive Bayes

    在众多的分类模型中,应用最为广泛的两种分类模型是决策树模型(Decision Tree Model)和朴素贝叶斯模型(Naive Bayesian Model,NBC)。 朴素贝叶斯模型发源于古典数学理论,有着坚实的数学基础,以及稳定的分类效率。同时,NBC模型所需估计的参数很少,对缺失数据不太敏感,算法也比较简单。

    理论上,NBC模型与其他分类方法相比具有最小的误差率。但是实际上并非总是如此,这是因为NBC模型假设属性之间相互独立,这个假设在实际应用中往往是不成立的,这给NBC模型的正确分类带来了一定影响。在属性个数比较多或者属性之间相关性较大时,NBC模型的分类效率比不上决策树模型。而在属性相关性较小时,NBC模型的性能最为良好。

    十、 CART: 分类与回归树

    CART, Classification and Regression Trees。在分类树下面有两个关键的思想:第一个是关于递归地划分自变量空间的想法;第二个想法是用验证数据进行剪枝。

    看完之后,哪位小伙伴会其中的1-2个算法的,说出来让小编崇拜一下。

    注:算法来源于网络,本文不作为商业价值,仅供学习参考,如侵犯著作权,请联系作者删除。

  • ?

    大数据时代你的一次访问、一次点击、一次点赞、都是在改变行业

    火凤凰

    展开

    目前,不仅有移动互联网上传的数据,还有航天遥感的数据。当数据量很大的时候,会发现数据的价值没有跟数据量呈正向相关的关系,这就让人们思考,数据怎样产生价值?大数据在智慧城市建设中扮演着怎样的角色呢?大数据凭借其规模性、可再生性、可重复利用性,极大的契合了我国信息化和新型城镇化建设的发展需求。目前,大数据在医疗、金融、农业、民生、公共服务、监管等方面得以广泛的运用,更为区域与城市发展带来新的模式与机遇。

    大数据在智慧医疗、金融、交通、食品、环保、教育等各个领域都发挥着重要作用。作为智慧城市建设领域的领军企业,天夏科技首创的智慧城市2.0系统所包含的各项子系统渗透到了市民生活的各个领域。智慧城市2.0系统平台最突出的特点之一就是能够将大量封闭在相关部门数据库里的信息数据,变成“大数据平台”,从而让城市实现了社会化共享、社会化服务。智慧城市2.0系统平台既做到了信息数据动态实时更新、全面感知,而且能够快速地接入互联网,方便使用。

    同时,能深度融合,把城市的各相关信息融合起来,形成一个社会化的、完整的城市信息。政府在这个平台的基础上可以有效开展城市建设相关工作的深度挖掘与应用,推动城市管理迈向智能化、数字化、信息化。大数据的应用。大数据可应用于各行各业,将人们收集到的庞大数据进行分析整理,实现资讯的有效利用。举个本专业的例子,比如在奶牛基因层面寻找与产奶量相关的主效基因,我们可以首先对奶牛全基因组进行扫描,尽管我们获得了所有表型信息和基因信息,但是由于数据量庞大,这就需要采用大数据技术,进行分析比对,挖掘主效基因。例子还有很多。

    或许一次刷新,一次访问、一次点击、一次点赞、一次在线评论在线发帖在线更新就可以留下数据,被挖掘者收集分析使用,帮助企业分析出某种趋势,完成某项互动或决策。在会奖行业数据同样可以被追踪,所以展会可以获得数据来源,同样企业可以得到数据收集的机会。与IT行业相比较,会展业作为不那么互联的行业,仍存在很高的附属性。

    可以说生活中你用的所有APP所有关于互联网应用都无时无刻的收集你所有的信息。数据便是将你的个人用收集的信息将你刻画的越来越清晰。 拿现在来说,我们每次逛淘宝的时候淘宝就会在你的主页面推荐一些东西。如果细心的人就会发现给你推荐的东西非常适合你。价格合适,而东西正好你想买的。这便是根据你以前阅览的页面店铺以及消费情况而具体推荐的。大数据的出现只会让这个世界越来越好,他将会提供更好的市场空间。虽然不可避免的会出现这样或者那样的问题,但是那次技术革命不出问题,蒸汽革命还影响环境呢!但是对人类的作用也是巨大的,数据也是一样!

  • ?

    以Hadoop入门大数据

    醉阳

    展开

    一、Hadoop简介

    1.什么是Hadoop

    Apache Hadoop project 生产出的用于高可靠、可扩展、分布式计算的开源软件,它允许通过集群的方式使用简单的编程模型分布式处理大数据,它可以从单一的服务器扩展到成千上万的机器,每一台机器都能提供本地计算和存储。Hadoop认为集群中节点故障为常态,它可以自动检测和处理故障节点,所以它不依赖硬件来提供高可用性。简单的说,我们可以用Hadoop分布式存储大量数据,然后根据自己的业务对海量数据进行分布式计算。例如:淘宝网昨天24小时的用户访问量折线图,不同地区、不同时段、不同终端中国Apache Hadoop project 包含的模块Hadoop Common :The common utilities that support the other Hadoop modules.Hadoop Distributed File System (HDFS): 高吞吐分布式文件系统Hadoop YARN: 作业(Job)安排和资源调度平台/框架Hadoop MapReduce: 运行在yarn上的大数据并行计算模型其他相关projectAmbariHBaseHiveSparkZookeeper...

    2.Hadoop产生背景

    Doug Cutting是Lucene、Nutch 、Hadoop等项目的发起人Hadoop最早起源于Nutch。Nutch的设计目的是构建一个大型的全网搜索引擎,包括网页抓取、索引、查询等功能,但随着抓取网页数量的增加,遇到了严重的可扩展性问题:如何解决数十亿网页的存储和索引问题。2003、2004年谷歌发表的两篇论文为该问题提供了可行的解决方案。分布式文件系统(GFS),可用于处理海量网页存储分布式计算框架(MapReduce),可用于海量网页的索引计算问题谷歌在03到06年间连续发表了三篇很有影响力的文章,分别是03年SOSP的GFS,04年OSDI的MapReduce,和06年OSDI的BigTable。SOSP和OSDI都是操作系统领域的顶级会议,在计算机学会推荐会议里属于A类。SOSP在单数年举办,而OSDI在双数年举办。Nutch开发人员完成了相应的开源实现HDFS和MapReduce,并从Nutch中剥离成为独立项目Hadoop,直到2008年,Hadoop成为Apache顶级项目,之后快速发展。到现在hadoop已经形成了完善的生态圈,

    3.Hadoop生态相关

    BDAS(Berkeley Data Analytics Stack),这个伯克利大学提出的关于数据分析的软件栈。从它的视角来看,目前的大数据处理可以分为如以下三个类型。复杂的批量数据处理(batch data processing),通常的时间跨度在数十分钟到数小时之间。基于历史数据的交互式查询(interactive query),通常的时间跨度在数十秒到数分钟之间。基于实时数据流的数据处理(streaming data processing),通常的时间跨度在数百毫秒到数秒之间。

    Hadoop生态圈:

    大数据本身是个很宽泛的概念,Hadoop生态圈(或者泛生态圈)基本上都是为了处理超过单机尺度的数据处理而诞生的。你可以把它比作一个厨房所以需要的各种工具。锅碗瓢盆,各有各的用处,互相之间又有重合。你可以用汤锅直接当碗吃饭喝汤,你可以用小刀或者刨子去皮。但是每个工具有自己的特性,虽然奇怪的组合也能工作,但是未必是最佳选择。大数据,首先你要能存的下大数据。传统的文件系统是单机的,不能横跨不同的机器。HDFS(Hadoop Distributed FileSystem)的设计本质上是为了大量的数据能横跨成百上千台机器,但是你看到的是一个文件系统而不是很多文件系统。比如你说我要获取/hdfs/tmp/file1的数据,你引用的是一个文件路径,但是实际的数据存放在很多不同的机器上。你作为用户,不需要知道这些,就好比在单机上你不关心文件分散在什么磁道什么扇区一样。HDFS为你管理这些数据。存的下数据之后,你就开始考虑怎么处理数据。虽然HDFS可以为你整体管理不同机器上的数据,但是这些数据太大了。一台机器读取成T上P的数据(很大的数据哦,比如整个东京热有史以来所有高清电影的大小甚至更大),一台机器慢慢跑也许需要好几天甚至好几周。对于很多公司来说,单机处理是不可忍受的,比如微博要更新24小时热博,它必须在24小时之内跑完这些处理。那么我如果要用很多台机器处理,我就面临了如何分配工作,如果一台机器挂了如何重新启动相应的任务,机器之间如何互相通信交换数据以完成复杂的计算等等。这就是MapReduce / Tez / Spark的功能。MapReduce是第一代计算引擎,Tez和Spark是第二代。MapReduce的设计,采用了很简化的计算模型,只有Map和Reduce两个计算过程(中间用Shuffle串联),用这个模型,已经可以处理大数据领域很大一部分问题了。那什么是Map什么是Reduce?考虑如果你要统计一个巨大的文本文件存储在类似HDFS上,你想要知道这个文本里各个词的出现频率。你启动了一个MapReduce程序。Map阶段,几百台机器同时读取这个文件的各个部分,分别把各自读到的部分分别统计出词频,产生类似(hello, 12100次),(world,15214次)等等这样的Pair(我这里把Map和Combine放在一起说以便简化);这几百台机器各自都产生了如上的集合,然后又有几百台机器启动Reduce处理。Reducer机器A将从Mapper机器收到所有以A开头的统计结果,机器B将收到B开头的词汇统计结果(当然实际上不会真的以字母开头做依据,而是用函数产生Hash值以避免数据串化。因为类似X开头的词肯定比其他要少得多,而你不希望数据处理各个机器的工作量相差悬殊)。然后这些Reducer将再次汇总,(hello,12100)+(hello,12311)+(hello,345881)= (hello,370292)。每个Reducer都如上处理,你就得到了整个文件的词频结果。这看似是个很简单的模型,但很多算法都可以用这个模型描述了。Map+Reduce的简单模型很黄很暴力,虽然好用,但是很笨重。第二代的Tez和Spark除了内存Cache之类的新feature,本质上来说,是让Map/Reduce模型更通用,让Map和Reduce之间的界限更模糊,数据交换更灵活,更少的磁盘读写,以便更方便地描述复杂算法,取得更高的吞吐量。有了MapReduce,Tez和Spark之后,程序员发现,MapReduce的程序写起来真麻烦。他们希望简化这个过程。这就好比你有了汇编语言,虽然你几乎什么都能干了,但是你还是觉得繁琐。你希望有个更高层更抽象的语言层来描述算法和数据处理流程。于是就有了Pig和Hive。Pig是接近脚本方式去描述MapReduce,Hive则用的是SQL。它们把脚本和SQL语言翻译成MapReduce程序,丢给计算引擎去计算,而你就从繁琐的MapReduce程序中解脱出来,用更简单更直观的语言去写程序了。有了Hive之后,人们发现SQL对比Java有巨大的优势。一个是它太容易写了。刚才词频的东西,用SQL描述就只有一两行,MapReduce写起来大约要几十上百行。而更重要的是,非计算机背景的用户终于感受到了爱:我也会写SQL!于是数据分析人员终于从乞求工程师帮忙的窘境解脱出来,工程师也从写奇怪的一次性的处理程序中解脱出来。大家都开心了。Hive逐渐成长成了大数据仓库的核心组件。甚至很多公司的流水线作业集完全是用SQL描述,因为易写易改,一看就懂,容易维护。自从数据分析人员开始用Hive分析数据之后,它们发现,Hive在MapReduce上跑,真几把慢!流水线作业集也许没啥关系,比如24小时更新的推荐,反正24小时内跑完就算了。但是数据分析,人们总是希望能跑更快一些。比如我希望看过去一个小时内多少人在充气娃娃页面驻足,分别停留了多久,对于一个巨型网站海量数据下,这个处理过程也许要花几十分钟甚至很多小时。而这个分析也许只是你万里长征的第一步,你还要看多少人浏览了跳蛋多少人看了拉赫曼尼诺夫的CD,以便跟老板汇报,我们的用户是猥琐男闷骚女更多还是文艺青年/少女更多。你无法忍受等待的折磨,只能跟帅帅的工程师蝈蝈说,快,快,再快一点!于是Impala,Presto,Drill诞生了(当然还有无数非著名的交互SQL引擎,就不一一列举了)。三个系统的核心理念是,MapReduce引擎太慢,因为它太通用,太强壮,太保守,我们SQL需要更轻量,更激进地获取资源,更专门地对SQL做优化,而且不需要那么多容错性保证(因为系统出错了大不了重新启动任务,如果整个处理时间更短的话,比如几分钟之内)。这些系统让用户更快速地处理SQL任务,牺牲了通用性稳定性等特性。如果说MapReduce是大砍刀,砍啥都不怕,那上面三个就是剔骨刀,灵巧锋利,但是不能搞太大太硬的东西。这些系统,说实话,一直没有达到人们期望的流行度。因为这时候又两个异类被造出来了。他们是Hive on Tez / Spark和SparkSQL。它们的设计理念是,MapReduce慢,但是如果我用新一代通用计算引擎Tez或者Spark来跑SQL,那我就能跑的更快。而且用户不需要维护两套系统。这就好比如果你厨房小,人又懒,对吃的精细程度要求有限,那你可以买个电饭煲,能蒸能煲能烧,省了好多厨具。上面的介绍,基本就是一个数据仓库的构架了。底层HDFS,上面跑MapReduce/Tez/Spark,在上面跑Hive,Pig。或者HDFS上直接跑Impala,Drill,Presto。这解决了中低速数据处理的要求。那如果我要更高速的处理呢?如果我是一个类似微博的公司,我希望显示不是24小时热博,我想看一个不断变化的热播榜,更新延迟在一分钟之内,上面的手段都将无法胜任。于是又一种计算模型被开发出来,这就是Streaming(流)计算。Storm是最流行的流计算平台。流计算的思路是,如果要达到更实时的更新,我何不在数据流进来的时候就处理了?比如还是词频统计的例子,我的数据流是一个一个的词,我就让他们一边流过我就一边开始统计了。流计算很牛逼,基本无延迟,但是它的短处是,不灵活,你想要统计的东西必须预先知道,毕竟数据流过就没了,你没算的东西就无法补算了。因此它是个很好的东西,但是无法替代上面数据仓库和批处理系统。还有一个有些独立的模块是KV Store,比如Cassandra,HBase,MongoDB以及很多很多很多很多其他的(多到无法想象)。所以KV Store就是说,我有一堆键值,我能很快速滴获取与这个Key绑定的数据。比如我用身份证号,能取到你的身份数据。这个动作用MapReduce也能完成,但是很可能要扫描整个数据集。而KV Store专用来处理这个操作,所有存和取都专门为此优化了。从几个P的数据中查找一个身份证号,也许只要零点几秒。这让大数据公司的一些专门操作被大大优化了。比如我网页上有个根据订单号查找订单内容的页面,而整个网站的订单数量无法单机数据库存储,我就会考虑用KV Store来存。KV Store的理念是,基本无法处理复杂的计算,大多没法JOIN,也许没法聚合,没有强一致性保证(不同数据分布在不同机器上,你每次读取也许会读到不同的结果,也无法处理类似银行转账那样的强一致性要求的操作)。但是丫就是快。极快。每个不同的KV Store设计都有不同取舍,有些更快,有些容量更高,有些可以支持更复杂的操作。必有一款适合你。除此之外,还有一些更特制的系统/组件,比如Mahout是分布式机器学习库,Protobuf是数据交换的编码和库,ZooKeeper是高一致性的分布存取协同系统,等等。有了这么多乱七八糟的工具,都在同一个集群上运转,大家需要互相尊重有序工作。所以另外一个重要组件是,调度系统。现在最流行的是Yarn。你可以把他看作中央管理,好比你妈在厨房监工,哎,你妹妹切菜切完了,你可以把刀拿去杀鸡了。只要大家都服从你妈分配,那大家都能愉快滴烧菜。你可以认为,大数据生态圈就是一个厨房工具生态圈。为了做不同的菜,中国菜,日本菜,法国菜,你需要各种不同的工具。而且客人的需求正在复杂化,你的厨具不断被发明,也没有一个万用的厨具可以处理所有情况,因此它会变的越来越复杂。

    Spark生态圈

    谷歌三篇论文(Google File System,Map Reduce,Bigtable)发布后,很多人开始进行学习,并在此基础上开发出各种Hadoop计算平台,进行通用批处理计算(General Batch Processing)。之后,人们针对各种不同的计算模型开发了各种专门系统(Specialized Systems),比如说迭代式的,机器学习的,流处理的,图像的和SQL相关的系统。最后就是Spark,它作为一种通用的统一的计算引擎(General Unified Engine),希望能够一统江湖。从内往外看,生态圈核心是Spark Core,包括各种Spark的各种核心组件,它们能够对内存和硬盘进行操作,或者调用CPU进行计算。紧邻核心圈的是与Spark相关的各类接口,比如Java,Python和R等。这些接口的外部是针对不同类型数据的计算引擎。比如说针对关系型数据进行处理的Spark SQL,针对对流数据进行打包批量处理的Spark Steam,针对Machine Learning相关的库MLib,针对图的GraphX,以及针对大规模数据进行采样和计算从而缩短计算时间的BlinkDB。再往外就是Spark运行的各种场景。比如说单机运行,在Yarn上进行管理运行等等。最外层就涉及基础数据存储。我们可以用文档型数据库,关系型数据库,图数据库等等。所有这些数据存储系统Spark都能访问,这归功于Techyon。它对底层不同的数据存储系统进行封装,提供统一的API进行访问。它还可以看作是是对底层数据的缓存,更多关于Techyon的内容可以参照深入浅出Techyon。Spark生态圈的各个部分跟传统Hadoop系统的对应关系

    Spark对比Hadoop重要优势Spark最重要优点就是快。为什么Spark比较快呢?我们来看看下图。

    传统Hadoop计算过程中,MapReduce任务需要跑很多次,需要多次迭代,每次迭代计算的结果都需要存下来,存到HDFS,而HDFS本身就是一些硬盘,所以本质上就...

  • ?

    数之点点:大数据时代来了,我们应该如何把握机遇?

    Doris

    展开

    过去几年随着社交网络、电子商务和移动互联网的发展,人类社会的数据量迅速激增,据统计目前人类一年产生的数据就相当于人类进入现代化以前所有历史的总和。这个数据量是异常庞大的,它往往以一个新的单位进行计量——“PB”。1个PB有多大呢?它相当于2的50次方个字节。如果你对此没有概念,那么简单来说,《史记》约有52万多汉字,1个PB能够存储至少10亿部《史记》。据统计我国2013年约产生8亿PB的数据量,其中以百度、腾讯、阿里为代表的互联网企业产生约1000个PB的数据量。人类现在正处在一个以“PB”为数据单位的新时代,这个时代被称为Big Data,或者我们现在更为熟悉的名称——大数据。在大数据时代中,人们似乎是淹没在了数据的海洋。说淹没在数据的海洋,实在是低估了海的深度和宽度,也许数据的银河或者宇宙更为合适。

    大数据会怎么样影响我们的生活?简单来说,它会让我们的生活更困难或者更容易——取决于你是否拥有分析大数据的技术。毫无疑问,要想在海量数据中理出头绪不是一件容易的事情,如果你不具备分析数据的能力,大数据会让我们的生活更困难。例如每逢“双十一”,“剁手党”都面临痛苦的抉择:打折的商品实在太多,买什么才好呢?*终一不小心,信用卡刷爆,买了一大堆自己不需要的商品,只得含泪吃半年的“康师傅”。但是更多的时候,大数据会让我们的生活变得容易,因为科技的发展比数据的积累更迅速,过去几年人类已经发明了许多分析数据、处理数据的方法,这些方法已经在为我们服务。

    先来看几个例子。谷歌公司每天都会收到来自全球超过30亿条的搜索指令,经过多年数据的累计,谷歌公司建立了“咳嗽”,“发热”等搜索关键字与流感地区的联系。于是在2009年谷歌成功的在美国预测了冬季流感的传播,并且 到地区和州。2013年奥巴马连任总统,成为首位位依靠大数据当选的美国总统。竞选过程中他的数据挖掘团队为其制定竞选策略,分析选民舆论,使得奥巴马处处占得先机,*终获得胜利。再来看看大家熟悉的电子商务。淘宝、亚马逊或者京东的页面都经过了大数据技术的优化。你所看到的页面都是根据你的购物行为进行显示的。你所希望购买的商品会被显示在*显眼的地方,你喜欢的商品会被推荐给你,你在这些网站购物越多,这种分析就越准确,购物体验也就越流畅。也许今年的“双十一”,电商们会推出一款App,告诉你哪些商品你是不能错过的,这样就不会再发生去年的悲剧啦。

    毫无疑问,大数据正在改变着我们的生活。过去几年无论是医疗、健康、交通、公共安全,还是生活、购物、旅游、娱乐都已经逐渐建立起了大数据的分析系统,无论是国家还是企业对大数据的投入都数以亿计。大数据的应用也从早期的数据密集型行业(例如电信、金融、能源、科研、互联网),逐步向非数据密集型行业扩张。一个路边的奶茶店需要大数据吗?当然需要。借助微信平台,只需要扫一扫二维码,奶茶店就会获得粉丝的关注。有了这些数据不仅可以开展打折促销,还可以通过互动了解用户口味,推出新品。

    那么没有电商经验专心创作内容的自媒体人应该如何进行内容电商的变现,传递有价值的内容,做有效精准的大数据电商呢?

    数之点点创始人林潮新认为,在头部的自媒体如咪蒙,一条,二更,罗辑思维等众所周知的大号,粉丝基数大,专业商业运作团队进入早,所以在盈利方面不存在太大问题。单单微信体系自媒体号,在2000多万个公众号中,数十万粉丝,数百万粉丝的不计其数,这部分群体更需要完成专业而又能形成商业闭环的盈利模式。电商成为了公众号领域除了广告之外很重要的商业化探索。至于未来全民微信公众号电商的走向,他认为传统的电商已经不足以满足微信公众号的需求了,首先我们看看自媒体这个群体,自媒体这个群体主要是通过内容(包括文字、图片、音频、视频甚至直播)等方式展示自己的专业,打造自己的品牌,吸引忠实的粉丝群,顺便做一点自己爱好的事,比如赚钱。通过自媒体的特性,我们知道绝大多数自媒体可能在某个方面挺厉害,比如营销、比如行业资讯,但并非全才,不懂的可能更多。

    如果要做电商,从选品、包装、营销、渠道、售前售后、物流等各方面都需要操心。林潮新发现绝大多数自媒体人却只擅长包装、营销和渠道,其他的完全不懂。自己做产品基本上玩不好,行业内失败例子也很多。那么自媒体想盈利要放弃电商这块吗?

    继而开始深度挖掘自媒体电商这个垂直领域,在历经了1年07个月的系统研发之后,潮谈旗下的拳头产品:数之点点大数据电商变现系统诞生。

    数之点点是上海潮谈科技有限公司经过1年06个月的研发推出的 自媒体轻电商变现的服务系统。其中最大的特色是数之点点完成了货找人的智能商品精准匹配的独立算法。未来极有可能成为所有流量方进行电商变现的标准化底层。顾名思义,数则是data,基于大数据,点点则是动词,意味点点手指,无需重度运营,通过大数据附能进行人工智能精准匹配,即可达到意想不到的惊喜。

  • ?

    12个顶级大数据工具

    范兰

    展开

    【VIP会员服务】小鸟云匠心打造完整的VIP会员服务体系,为国内国际用户提供7*24小时服务支持、0元快速备案、100倍故障赔偿、5天无理由退款等多种服务支持和服务保障让用户尊贵售后服务,让云端部署更轻松、更高效。

    如今,为了满足企业的主要需求,大数据工具正在迅速得到应用。在大数据技术作为概念和业务战略出现的十年中,涌现了执行各种任务和流程的数千种工具。而推出这些工具的提供商都承诺可以为企业节省时间和成本,并发现能够让企业获利的商业洞察力。显然,大数据分析工具的市场正在不断增长。

    许多大数据分析工具最初像大数据软件框架Hadoop一样都是开源项目,但商业实体迅速涌现,为开源产品提供了新工具或商业的支持和开发。

    而在这些工具中选择是一个挑战,特别是许多大数据工具只具有单一用途,而企业需要使用大数据完成许多不同的任务,因此企业的分析工具箱会变得过于充实。根据这个行业领域的专家顾问的建议,以下列出一系列主要的大数据分析工具,并列出三个主要类别。

    如上所述,大数据工具都倾向于单一使用类别,并且有多种使用大数据的方式。所以可以按类别分类,然后分析每个分析工具。

    大数据工具:数据存储和管理

    大数据都是从数据存储开始。这意味着从大数据框架Hadoop开始。它是由Apache Foundation开发的开源软件框架,用在计算机集群上分布式存储非常大的数据集。

    显然,存储对于大数据所需的大量信息至关重要。但更重要的是,需要有一种方式来将所有这些数据集中到某种形成/管理结构中,以产生洞察力。因此,大数据存储和管理是真正的基础,而没有这样的分析平台是行不通的。在某些情况下,这些解决方案包括员工培训。

    而这个领域的主要的大数据工具有:

    1. Cloudera

    基本上,Hadoop增加了一些额外的服务,企业将需要这些服务,因为大数据并不是一个简单的练习。 Cloudera的服务团队不仅可以帮助企业构建大数据集群,还可以帮助培训员工更好地访问数据。

    2. MongoDB

    MongoDB是最流行的大数据数据库,因为它适用于管理大数据经常出现的非结构化数据或频繁更改的数据。

    3. Talend

    作为一家提供广泛解决方案的公司,Talend的产品是围绕集成平台构建的,该平台结合了大数据、云计算、应用程序,以及实时数据集成、数据准备和主数据管理。

    Talend大数据集成包括数据质量和治理功能。

    大数据工具:数据清理

    在企业真正处理大量数据以获取洞察信息之前,先需要对其进行清理、转换并将其转变为可远程检索的内容。大数据集往往是非结构化和无组织的,因此需要进行某种清理或转换。

    在这个时代,数据的清理变得更加必要,因为数据可以来自任何地方:移动网络、物联网、社交媒体。并不是所有这些数据都容易被“清理”,以产生其见解,因此一个良好的数据清理工具可以改变所有的差异。事实上,在未来的几年中,将有效清理的数据视为是一种可接受的大数据系统与真正出色的数据系统之间的竞争优势。

    4. OpenRefine

    OpenRefine是一款易于使用的开源工具,通过删除重复项、空白字段和其他错误来清理凌乱的数据。它是开源的软件,但它有一个可以提供帮助的大型社区。

    5. DataCleaner

    与OpenRefine类似,DataCleaner将半结构化数据集转换为数据可视化工具可读取的干净可读的数据集。该公司还提供数据仓库和数据管理服务。

    6. Microsoft Excel

    人们可以从各种数据源导入数据。Excel对手动数据输入和复制/粘贴操作特别有用。它可以消除重复、查找、替换,拼写检查以及用于转换数据的许多公式。但它很快陷入困境,并不适用于大数据集。

    大数据工具:数据挖掘

    一旦数据被清理并准备好进行检查,就可以通过数据挖掘开始搜索过程。这就是企业进行实际发现、决策和预测的过程。

    数据挖掘在很多方面都是大数据流程的真正核心。数据挖掘解决方案通常非常复杂,但力求提供一个令人关注和用户友好的用户界面,这说起来容易做起来难。数据挖掘工具面临的另一个挑战是:它们的确需要工作人员开发查询,所以数据挖掘工具的能力并不比使用它的专业人员强。

    7. RapidMiner

    RapidMiner是一款易于使用的预测分析工具,具有非常用户友好的可视化界面,这意味着企业无需编写代码,即可运行分析产品。

    8. IBM SPSS Modeler

    IBM SPSS Modeler是一套适用于企业级的高级分析的产品,用于数据挖掘。而IBM的服务和咨询无疑是首屈一指的。

    9. Teradata

    Teradata为数据仓库、大数据和分析以及市场营销应用提供端到端解决方案。这一切意味着企业的业务可以真正成为一个数据驱动的业务,并提供商业服务、咨询、培训和支持。

    像许多当前的大数据工具一样,RapidMiner解决方案也包含云计算解决方案

    大数据工具:数据可视化

    数据可视化是企业的数据以可读的格式显示的方式。这是企业查看图表和图形以及将数据放入透视图中的方法。

    数据的可视化与科学一样,是一种艺术形式。而大数据公司将拥有越来越多的数据科学家和高级管理人员,很重要的一点是可以为员工提供更加广泛的可视化服务。销售代表、IT支持、中层管理等这些团队中的每一个成员都需要理解它,因此重点在于可用性。但是,易于阅读的可视化有时与深度特征集的读取不一致,这成为了数据可视化工具的一个主要挑战。

    10. Tableau

    作为这一领域的领导者之一,其数据可视化工具专注于商业智能,无需编程即可创建各种地图、图表、图形等等。Tableau总共有五款产品,其中有一个名为Tableau Public的免费版本供潜在客户试用。

    11. Silk

    Silk是一种简单版本的Tableau,Silk可让企业将数据可视化为地图和图表,而无需任何编程。它甚至会尝试在第一次加载时自动将数据可视化。它还使得在线发布结果变得容易。

    12. Chartio

    Chartio使用自己的可视化查询语言,只需点击几下即可创建功能强大的仪表板,而无需了解SQL或其他建模语言。与其他不同的是,企业直接连接到数据库,因此不需要数据仓库。

    13. IBM Watson Analytics

    IBM Watson Analytics是机器学习(ML)和人工智能(AI)的结合,可帮助提供智能数据科学助理,为业务分析师和数据科学家提供广泛的数据科学技能集的用户指南。

    三层大数据工具

    普华永道移动数据和分析计划首席技术官Ritesh Ramesh说,就精密程度和市场战略而言,大数据工具分解为三层。

    第一层:也是最大的一层,是一系列开源工具。每家公司都以这种方式开始,像Cloudera和Hortonworks。除了基本的基础设施。服务器和存储之外,价值非常小。大多数云计算厂商已经将这一层实现商品化。

    第二层:这是大多数这些供应商已经意识到需要增加他们的市场份额的地方,他们必须在开放源代码工具之上构建一些专有应用程序,从而与其他供应商区分开。例如,Cloudera公司构建了一些类似于Hadoop内核中的数据科学平台。

    第三层:这些是垂直专用的应用程序。这些公司大多与普华永道、Cognizant或埃森哲等系统集成商合作。这就是真正的价值所在,而且这也是大数据工具制造商非常有效的竞争策略。

    Ramesh说,除了基本功能之外,还有三个工具需求领域。首先是数据处理工具。他说,“数据学习工具是客户进行数据质量和性能分析的工具包中的重要工具,可处理5000万行数据,以发现洞察力。”

  • ?

    集海量大数据所成,百度地图的人工智能是城市交通病解药

    真朋友

    展开

    当汽车越来越多,城市越来越堵时,缓解交通拥堵的方案就会一次次被拿出来实践,然后被贴上失败的标签。首先是倡导了多年但一直没有多少成效的“公交优先、地铁出行”,其次是出现了网约车和共享单车,但是无论轨道交通和公共交通多么发达,无论滴滴打车多么方便,只要汽车数量不减,交通拥堵就不会消失。对于个人而言,关键在于如何从日益拥堵的道路上快速找到一条捷径。这条有效的捷径就是将人工智能技术应用到交通治理。

    实现治堵的基础:海量地图和用户数据生成的实时路况

    地图导航领域已经有了十几年的发展,行业格局也已经比较稳定,不过现在,竞争的核心已经从定位导航能力转向大数据和人工智能技术两项实力。

    随着城市化进程加快、城市汽车保有量只升不降,交通状况复杂性大幅提高,因此,单纯的导航并不足以有效应对瞬息万变的路况。如何实时预测交通拥堵情况,如何提供用户人性化的路线建议,如何让新手快速成为“老司机”,成了地图导航必须要着手解决的问题。而这些前端技术的变革,都离不开数据采集这一基本功。

    在底层数据的获取上,地理信息采集相对复杂,在数据采集上,地图导航都面临同一个问题:采集成本太高,投入太大,更新太难。无奈,只能从技术和人力两方面同时发力。要想实现地图数据的高效生产,就必须依赖自动化的高精采集设备。百度地图是较早实现数据采集高度智能化自动化的地图厂商,通过在顺德建立数据中心,作为“数据大脑”,承担着国内最大的数据采集业务,提高数据采集效率。

    相比于其他地图产品,百度地图的杀手锏是基于人工智能(AI)的图像识别技术。在2016年9月,李彦宏对外展示人工智能的进展时,表示百度地图的采集设备能够自动识别道路特征、建筑轮廓、道路图形标牌、电子眼、警示牌;图像智能识别技术则能够精准识别店铺名称、门牌号、停车场标识,甚至是营业时间。目前,百度地图全流程数据生产自动化程度已超过80%,全景图像的自动化识别提取准确率高达95%。百度地图独创了图像自动识别分析技术,其所覆盖的道路总里程超过670万公里。这样一来,数据采集能力也就大幅度提高了。

    数据采集生产是百度地图数据实力的一个缩影,路况数据生产同理。我们都知道,路况数据生产最重要的标准是实时,现在,与过重测算前方车辆的速度不同,百度地图将重点放在车辆密度反映路况上,因为“车多就意味着路堵”,知道哪个地段车辆多,就引导司机绕开哪个路段,有效解决速度计算强依赖于轨迹速度以及“知道速度快慢,但是不能明确车辆多少”的先天性问题。

    另外,光靠自己一身之力是难以支撑海量数据的持续更新的,必须要将用户的车辆发展成为一个个信息点。

    以往的地图产品想要抓取用户的实时出行状况,大多是通过汽车内置导航和交通部门提供的路况信息,但面对如今多维度多元化的出行方式,这样的方式已经难以适应,必须借助更高效的技术来获取更为精确的实时路况数据,才能真正优化出行。百度地图将目光从“车”转移到“人”上面。具体来说,是利用百度系统的用户规模优势来构建交通运行图景,通过利用百度搜索的资源,百度地图能得数亿级别的用户数;同时,百度地图的O2O功能做得最好,用户在使用百度地图搜索周边内容时,也能给百度地图提供实时的位置信息。

    交通路况能够更实时,意味着交通大数据需要更海量,如何发动上亿的用户主动上传定位、搜索、导航信息,实现数据库秒级更新,是行之有效的方法。比如,百度地图推出了“POI认领”(POI:信息点),目前已经有近150万商户标注、认领POI数据,全球POI总数达1.4亿。这使得百度地图上76%的数据来自创新生态采集模式,让“人人都成为POI采集师”已经逐步成为现实。

    无论是用户大数据、路况大数据,还是POI、道路信息采集,所有维度的地图大数据的价值最终都指向应用。城市“交通病”的解决,不能光停留在限行限号,而是应该让海量交通大数据发挥底层作用。

    借鉴无人驾驶背后的避堵逻辑,人工智能为最佳治堵方案

    无论是汽车还是地图,都有一个远景目标:实现自动驾驶。目前各大互联网巨头都有布局,其中的一个难点就是绘制一份高精地图。与一般的手机不同,高精地图对车辆的定位要求更严,比如要实现更小的定位偏差(李彦宏表示未来地图的精确度将缩短到3厘米),可以定位车辆行驶的车道等等。

    暂且不说自动驾驶何时能真正普及开来,但它也给目前的手机地图一个更新的方向,引导手机地图去满足用户的需求。

    百度地图近段时间推出了不少让人眼前一亮的功能,尤其是极具个性化、智能化的创新尝试:

    1.推出步行AR导航,将步行路线、终点目标与现实场景结合,这能减少在复杂路口走错方向的可能性。

    2.优化首页搜索功能,搜索框后,可以直接点击“家”和“公司”等便捷入口,实现一键导航。

    3.放大导航路口图像,以平面顶视图的形式展示路口状况,便于正确选择方向。

    ……

    而提出这一系列优化服务的目的在于,让一个个用户快速成为“老司机”,将老司机的经验通过地图展示出来,提高他们对路面情况的“感觉”。事实上,给每一个用户更好的出行方案,就有机会减少一辆车的拥堵,给更多的用户更好的方案,就能缓解一个城市的拥堵。所以在路线设计上,新版的百度地图一共提出了6大路线偏好:智能推荐、时间优先、距离优先、躲避拥堵、不走高速、高速优先。满足用户偏好靠的是AI大脑,这六大方案基本上可以涵盖所有的出行需求,及时避免因交通拥堵。

    目前百度地图已经在智能避堵,优化出行方面有所成就,百度地图每日提供的位置服务超过720亿次,每日导航服务超过2亿公里,为用户每天节省出行时间达115万小时。

    作为手机地图的第一梯队,百度地图将发展方向与人工智能牢牢绑定起来,用于革新数据采集方式以及提供更个性化的出行方案。在这个过程中,出行服务的需求者是一个个的用户,交通拥堵的制造者也是一个个的用户,只有将千千万万个用户的数据收集起来,进行分析,才能为每个人提供最便捷的出行方案,才能给城市的交通减轻一丝压力。可以说,缓解交通拥堵,治本还是靠技术的力量,百度地图推出的智能避堵,背后则是人工智能技术的强力支撑。

  • ?

    集客宝:大数据真没你想的那么难搞!

    小男生

    展开

    昨天跟一个做微商的朋友聊天,看他近日生意颇为红火,我不禁疑惑,也没看他发几条朋友圈啊,生意是怎么起来的呢?

    朋友微微一笑道:现在谁还用那种广撒网长刷屏的方式发朋友圈啊!我现在发朋友圈都要分组,朋友圈里大部分人也都是了解的,根据他们平时的购物习惯、消费水平、甚至兴趣爱好给他们分组,然后不同分组的人发送不同的朋友圈,根据他们的特性推送适合他们的商品甚至根据他们的喜好来编辑不同的文案和活动,那种爱贪图小便宜的或者年龄偏大比较注重省钱的,推送一些物美价廉的、性价比较高生活日用小商品,再经常搞个促销活动,他们就很买账;那些比较注重生活品质的,就推送一些质量较好价位稍高的商品,当然这种文案和图片也要做出品质感,活动就可以少一点,因为这批人也不是特别在乎钱,经常做活动反而让人觉得廉价……朋友洋洋洒洒说了一大篇,末了还加上一句,现在人家美女朋友圈发个自拍都要分组的,更何况咱们生意人呢,不能落后啊!

    朋友说的慷慨激昂,我听得也热血沸腾,我说你丫这不就是大数据吗?朋友说是吗是吗?我都这么高级了吗?

    大数据,乍一听起来好像很高深,实时性运算长时段跟踪深度数据解析等等,一堆看得懂又看不懂的名词扑面而来。人人都知道大数据有用,却还不知道怎么用。如今一个小小微商都能把大数据利用的头头是道,而大部分线下实体、商超餐饮,还在无视这新时代的营销利器,任由自己与大数据擦肩而过。

    其实就像上述的那个朋友说的那样,大数据不就是把你的潜在客户的所有信息整合起来,给你做好人群画像分好类,再打包成不同人群的数据包任你去针对不同人群做不同投放的精准营销么?

    说简单点,为什么你打开淘宝总能快速看到自己想买或者感兴趣的商品,打开头条第一眼就看到自己感兴趣的咨询内容,打开视频APP总是在首页就有自己喜欢的剧或者综艺,甚至上一些不知名的网站他们也会给你推送一些最近正在浏览的商品……

    是巧合吗?这就是大数据啊!

    现在线上俨然已经把大数据利用的如火如荼,然而大部分线下店铺还没有搭上这艘快艇,没有追上时代脚步的人,都终将被时代抛弃。

    也有人依然陷在迷茫之中,我知道大数据是怎么回事,但是我该怎么利用呢?难道我也要像微商一个把客户一个一个分组?有没有什么合适的工具?

    有!

    非但有,而且还非常的好用和贴心。

    集客宝大数据营销中心,联手电信、联通、阿里巴巴、高德,给你意想不到的大数据品质服务。

    集客宝大数据营销中心拥有最完善的大数据体系,以及最优质的数据资源。在31省数据集中的基础上,建立了基础产品、标准产品和平台级行业解决方案共三层九大运营产品,受到行业广泛关注和好评。

    集客宝大数据中心依托运营商得天独厚的数据资产优势,以及专业数据处理能力,以企业利益为核心,精准营销为抓手,全行业合作伙伴提供全方位全流程的大数据服务。

    它基于大数据AI模型,多维度分析全方位刻画用户特征,助力企业真实还原客群,通过多重定向服务,实现大数据广告精准投放,有效触达目标客户,无论线上还是户外广告,到店率都得到明显提升。

    当商家苦于想利用大数据获客却不知该如何下手时,与集客宝大数据营销中心通过共建模型的方式进行合作,我们负责实验室环境的搭建,双方共同就数据进行挖掘,挖掘结果回落大数据公司生产环境,由大数据公司统一对外进行服务输出。集客宝通过自身的大数据平台优势,对大数据进行精准分析与排查,提交给您最为精准的意向客户,解决店内的客流问题so easy。

    成功的人,总是走在时代的最前端,利用一切可利用的工具来达到目的,而最容易失败的人,就是那些一直在观望的人。

  • ?

    集客分享重磅推出企业大数据平台

    Wendy

    展开

    亿欧近日消息,集客分享重磅推出企业大数据平台。集客分享认为目前企业面临诸多痛点,限制了企业业绩的快速增长。例如,①获客渠道少成本高效率低;②无法甄别优质销售线索;③销售线索缺乏有效管理;④无法开展专业营销工作;⑤企业内部业务流程割裂。针对企业面临的前2大痛点,2018年7月11日,集客分享历经了为期半年的研发,重大产品“企业大数据”发布上线,为ToB企业量身打造的海量优质销售线索获取平台,助ToB企业实现“线索轻松找,业绩成倍增”。据亿欧了解,集客分享(北京品客互动科技有限公司)是一家营销技术解决方案服务公司,致力于为企业提供“技术+数据+内容”的智能营销解决方案,系统解决企业的获客难题,提高营销转化效果。

  • ?

    微信大数据的集成点--群控系统

    新房客

    展开

    今天,我们讨论一下大数据的集成

    什么叫微信大数据,就是客户信息,大家都知道,不管你是进行什么营销推广,地推,广告,摆摊,自媒体等等都行,最终这个客户数据都会在微信上进行转化,裂变,成交。

    谁能把握微信大数据,就能添加更多的真实客户,再进行客户的转化,变成意向客户,再通过这个营销套路,促进成交。那么也就带来一个重要考虑的点了,并不是人加多了就一定有效的,举个例子,加入你微信5000人,有4000千或者3000都是微商和死粉,那你觉得,你能进行客户转化的几率大不大?我觉得这个微信都废了吧?

    所以,数据很重要,这里下次再给大家介绍一下数据的采集方式,当然,这个是针对没有客户数据的企业或商家而已,像电商企业,电销企业等等这些大企业,这个数据用都用不完,最缺一个数据的二次利用了,好的,先回归主题,那么这个微信大数据到手了,怎么样进行数据集成,二次营销呢?

    一个最好的办法

    那就是微信群控系统

    这里再插入一个题外话,大家都知道,手机群控已经被微信大查封,也就是说不能完全使用了,那么我说的群控当然就不是手机群控了,而是目前处于火热期的精控系统----铁拐李精控系统。它这个我简单的说一下,就一句话,无痕迹,无后台,无硬件,无需手机,跟传统的群控,云控,中控在系统的操作方式,控制方式,运行模式都是完全不一样的。

    这个大家可以了解一下,那我们回归主题。

    那些说到这里,大家应该也明白了,就是将你的所有数据,导入系统,进行自动添加好友的方式,不断的累积客户,在进行营销套路,转化,成交。

    记住一点,没有百分之百的精准客源,如果有,肯定是忽悠你的,即使你能得到精准客源,那这个成本肯定远远大于你产品的价值。往往出现的问题就是成本比收益高。

    只有积累客户,让更多的人看到你的产品,这个量才能起来。酒香不怕巷子深的意思就是喝的人多了,自然会很多人去买,如果你的曝光率不高,你的“酒”再香,也没有用。

集点大数据

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP