中企动力 > 商学院 > 数据采集算法
  • ?

    2017百度最新算法《飓风算法》飓风来袭采集站集体陨落

    郝凌青

    展开

    导读:就在 2017年7月7号,百度在绿萝算法打击超级链接行为和石榴算法提高用户搜索质量之后,在净网方面又放大招,百度开始了一项 飓风算法 的行动。

    喜欢抄袭的网站在听到飓风算法这个消息有没有在颤抖。就在昨天百度把飓风算法实施出来以后,相信有很多人都对百度推出的飓风算法还不是有所了解,那接下来小编就带领大家了解一下什么是飓风算法吧。现在采集手段的常态化的情况下,百度现在也坐不住了。通过一些采集的手段而并没有为用户带来更多的好处,但是百度搜索却在这方面压力甚大。百度高层在打击方面之前也是说说而已并没有采取什么样实际的行动。现在百度工程师们制作了一款打击非法采集的一个手段, 飓风算法 。

    飓风算法是在什么样的情况下所产生的呢?在抄袭手段非常严重的今天,人们只要在百度中随便输入一个关键词都会在百度文库中出现非常多的文章。所以百度在这方面进行了一个严厉打击的手段。飓风算法自然就应运而生。这样做的目的,就是百度在打击恶意抄袭,进行不劳而获的一种手段。他的主要目的就是保护其他网站在自创方面得到更大的优势。在百度搜索中,进行打击一个以采集数据作为网站主要来源的一个手段,也同时将百度搜索从百度文库中彻底的清楚一个比较严重的非法采集链接行为。给进行以原创作为内容的网站的一个自我展示的平台。

    百度通过大数据的采集,进而飓风算法会在一段时间内通过大数据分析会产生一个数据。百度就会针对这些产生出来的数据进行一个相应的处罚。同时根据得到的数据进行一个网站排名的调整,给原创网站进行一个非常大的上升空间。

    如果原创网站的流量有大幅度的降低的现象出现,这样在大数据进行分析的时候进行有所反馈,百度网站会对这个网站进行一个适当的调整。如果这样下去小说网站会受到飓风算法的严重影响,我想会有很多的小说网站会大批量的被制裁。因为一些小说网站它都是进行一个大批量的文字采集过来的,小说情节是不允许出现跳转剧情和随意进行人为更改的。小编不知道在小说网站站长知道这个飓风算法消息的时候,心里是一番什么样的感受。所以可见一些以采集别的网站为生的网站站长压力会有多大。不知道百度网站的工程师在制作这个飓风算法打击的手段的时候有没有想到过这些问题呢?由此可见百度推出飓风算法所打击的严厉之重以及覆盖面之广。这样所带来的影响绝对是好处大于缺点,更加肯定了进行自我原创为生的一些网站的价值。

    百度通过这样一种飓风算法的手段不仅跟上了时代的一个以进行自主创新的潮流,而且也保护了为进行自主创新的网站得到了更大的利益。其实每次都搜索出一个大概的内容,基本上都是大家所知道的知识,就丧失了新鲜感,在支持原创内容的今天,在百度推出飓风算法的第二天,究竟会出现一个怎样的一个意想不到的结果呢?那就让我们看看百度在以后会出现一个怎样的结果吧。

  • ?

    BasicFinder 标注平台数据科学家吴昊:从数据采集与标记行业看数据与深度学习之关系(分享总结)

    忘不了

    展开

    雷锋网 AI科级评论按,深度模型在机器学习很多领域都取得了巨大成功,但也对算法的原材料训练数据提出了更多的要求。对于研发高水平的算法,数据的高质量采集、清洗、处理等等对算法效果会有直接影响。

    在近期雷锋网 AI研习社的线上分享会,来自 BasicFinder 标注平台的数据科学家吴昊为大家介绍了数据规模、数据质量等与深度学习算法之间的关系,以及为算法做数据准备的一些经验。

    吴昊,本科毕业于上海交通大学,硕士毕业于纽约大学,现任 BasicFinder 标注平台数据科学家,专注于数据众包策略研究、深度学习模型数据采集与标记方案咨询及优化。

    分享内容:

    大家好,我叫吴昊。本科毕业于上海交通大学,研究生毕业于纽约大学。我之前做过两年左右的算法研究工作,我们公司 BasicFinder 平台主要提供一些数据方面的服务,包括采集、标注、清洗、其它别的加工等等。我今天分享的主题是AI数据面面观。

    下面是今天分享的目录,分为四部分:

    数据规模

    数据质量

    无监督学习与迁移学习

    做算法研发在数据准备方面的注意事项

    数据规模

    先看数据规模,数据规模与算法模型的容量其实是比较相关的。算法模型的容量越大,就意味着算法能表示相对来说更复杂的关系。

    当数据规模相对过大时,在训练过程中容易产生欠学习(underfitting)。另一方面,在数据规模相对过小的情况下,就会产生过学习(overfitting)。

    近年来流行的深度学习模型可以拥有非常大的容量,模型中普遍用的神经网络算法,层数可以增加,每层神经元个数可以增加,那么模型的表达能力也会增加。下图是一个例子。此外学术界也会做一些新的研究来增加模型的表达能力。另一方面得益于GPU,比较复杂模型的训练也会比以前快很多。

    现在有一个问题,数据更多的话效果就会更好,那么究竟有多好呢?Google的一遍论文解决了这个问题。

    这个数据集是ImageNet的两百多倍。随着数据集里样本数量的增多,在COCO上的结果比用之前的数据集至少高出三个点,而在算法的其他方面都没有太多变化。可以看到数据规模的增大对算法的效果提升还是比较明显的。

    在工业界,数据规模更容易成为算法研发的关键因素。如果有更多的数据,就可以使用容量更大、更复杂的模型,得到效果更好的算法。当数据大到一定程度,数据和算法之间可以进行反复迭代,形成壁垒,为公司提供竞争力。

    数据质量

    数据质量会影响算法效果。

    对于质量一般的数据,比如经过爬虫得来的数据,经过清洗、处理后,算法效果会有明显提升。如果数据质量已经很高了,再去提升数据质量,算法效果的提升比较有限。

    另外还要考虑到成本和收益的权衡问题:想获得质量更高的数据,成本也会更高。

    接下来讲一下对数据质量的评估。数据质量评估主要包括两个方面,一是原始采集数据质量,二是数据标注质量。

    下面是对原始采集数据质量的评估:

    图像、视频:分辨率,清晰度,光照,色彩等

    语音:清晰度,背景音等

    文本:是否自然语言,是否专业,与主题相关性等

    下面是对数据标注质量的评估:

    标注正确率(类别数据)

    标注精确度(坐标、时间点、个数、文字等)

    标注完备性(是否漏,是否重复)

    标注一致性(前后规则是否一致)

    人工标记的大规模数据一般都会含有噪声,一些经典数据集也含有噪声,例如人脸LFW、MS COCO等,这是不可避免的,不过在可以接受的限度内就行。

    无监督学习与迁移学习

    接下来谈一下无监督学习与迁移学习,迁移学习已经有一个比较大的数据集作为基础了,再用人工标注一小部分新数据。

    对于无监督学习,基本上不需要人工标注,主要是学习数据本身的分布特性。比如说聚类算法,就是试图找出数据集中分布的中心,所以不太需要人工标注。

    目前工业界相对来说比较好的结果还是通过监督学习而来,很多都需要大量人工标注的数据。无监督学习和迁移学习在未来还是有待学术界研究,以望更大的突破。另外,在未来数据规模进一步提升的情况下,无监督学习和迁移学习会有更多的用武之地。

    数据准备方面的一些经验

    最后介绍我们在开展业务中的一些经验。

    数据准备最开始是数据获取,数据的获取也分为几种情况,比较常见的是互联网公开获取(公开数据集、爬虫等),除此之外还有专业数据采集。在专业数据采集时,需要考虑采集方式:一是采集内容、采集规模、预算;二是采集过程要尽量与实际使用场景相一致;三是要考虑对数据集的要求,比如多样性;四是采集是否涉及隐私、个人权利如肖像权、著作权等。

    最后还有采集时间的要求。

    然后是数据清洗。采集来的数据很多都需要清洗,例如爬虫、监控视频等。

    数据清洗之后就要进行数据标注,标注的规则要尽可能地详尽、清楚,需要给出文档和例子。专业的标注过程,一般有试标阶段,这个阶段需要详细了解并确定需求。此外,在试标和正式标注过程中也会遇到不确定的情况,需要及时进行沟通,否则可能会影响到整体标注质量。

    对于数据标注的方式,以及最终的输出格式,都需要算法研发人员来制定,有可能的话还是尽量使用常见的方式和格式。

    数据标记完之后就是数据审查。做审查主要参考对数据质量的要求(正确率、精确度、完备性、一致性等)。审查方式有抽查、排查特殊指标、利用某些特征排查异常值这几种。

    结论如下:对于算法来说,数据越多越好、越广越好、越准越好。在现有的情况下,监督学习的效果优于无监督学习/迁移学习。

    雷锋网 AI科技评论。

  • ?

    PDA数据采集原理是什么?

    人英

    展开

      PDA手持终端在各行业应用越来越广,原因就是体积小、重量轻、高性能,适合移动作业,它是将条码扫描装置与数据终端一体化,带有电池可离线操作的终端电脑设备。

      PDA手持终端具备实时采集、自动存储、即时显示、即时反馈、自动处理、自动传输功能,为现场数据的真实性、有效性、实时性、可用性提供了保证。

      PDA手持终端按照采集技术来分,共有五类产品:标准激光PDA手持终端、MEMS PDA手持终端、线性图像PDA手持终端、二维图像PDA手持终端、RFID PDA手持终端

      1) 标准激光PDA手持终端

      标准激光PDA手持终端通过激光光束与振镜配合工作,自动在条码上左右移动光束以读取条码。激光引擎具有多种配置(例如,标准距离、广视角、高密度、远距离和高可见性),以满足不同应用的需要。标准激光PDA手持终端的最大优势在于距离:它们可读取数英尺之外的条形码。事实上,如果打印的标签符号足够大,激光可从 35 英尺(10.7 米)之外进行读取。

      最适合的应用:

      ●扫描仓库和配送中心高层货架上的一维条码

      2)MEMS激光PDA手持终端

      MEMS激光PDA手持终端采用硅芯片代替标准激光扫描器的振镜,因而扫描速率更快,可靠性更高,与标准激光扫描引擎相比具有更大的性能优势。MEMS技术造就出具备全新功能的激光扫描引擎,其中包括更快的扫描速率、体积小型化、出色的耐用性以及无摩擦机械零件,以确保持久性能。其初始扫描速率比现有采用马达的机械式激光扫描器快五倍以上,而在未来的产品中可提高至每秒数千次扫描。

      最适合的应用:

      ●零售、医疗和仓库应用中的标准距离(手臂长度)扫描

      3) 线性图像PDA手持终端

      线性图像PDA手持终端全部采用固定部件,没有任何活动部件,因此与激光扫描器相比更加可靠,而后者则采用快速移动的镜头来在条形码上移动光束。要读取条形码,线性图像PDA手持终端需要采用 LED 发出的光照亮它,并通过镜头将条形码图像聚焦到CCD部件上。

      最适合的应用:

      ●零售 POS

      ●库存管理和指令拣货

      ●生产线补充

      4)二维图像PDA手持终端

      二维图像PDA手持终端可采集二维或线性条形码的图像,并使用先进的解码算法进行处理。这种采集器可对线性条码进行全向读取,因此无需改变标签方位即可扫描。此外,二维图像PDA手持终端还适合读取二维条形码。二维条形码能以更小的空间承载比线性条形码更多的信息,因此非常适合空间有限的应用中,例如印刷电路板生产、医疗和包裹递送等。

      二维图像PDA手持终端可采集实际图像(例如,签名或损坏的货箱),因而成为现场服务、交付凭证及发货/收货应用的理想选择。

      最适合的应用:

      ●通过 3PL 承运商发货和收货

      ●生产跟踪

      ●现场服务和包裹递送

      ●保险

      5) RFID PDA手持终端

      RFID目前属于条形码的补充技术,但有潜力在特定供应链应用中取代条形码技术。在短期内,条形码扫描/RFID读写组合可允许操作人员通过RFID PDA手持终端同时采用两种技术进行工作。

      最适合的应用:

      ●越库

      ●库存管理

      ●供应链跟踪

      ●零件追溯/产品谱系

      ●资产管理

      

  • ?

    APP数据采集是怎么实现的

    梦桃

    展开

    最近半年,我们八爪鱼陆续接到好几个APP数据采集的项目需求,我在群里面,偶尔也看到有些用户在问,有没有APP数据采集的工具。鉴于我们做过的几个APP数据采集项目的经验,我可以告诉大家,现在APP数据采集,市面上还没有通用的工具。我们八爪鱼内部是有一套工具,但由于使用的难度较高,需要编写脚本,所以不对普通用户公开,我们仅接受项目定制。

    虽然不对外公开,但并不妨碍我们将技术分享出来,APP数据采集,一般走以下两种方式:

    1.两种思路

    1. 抓包

    2. HOOK

    2.抓包

    有代码经验或APP开发的同学都很容易理解,其实很多APP,走的都是webservice通讯协议的方式,并且由于是公开数据,而且大部分是无加密的。所以只要对网络端口进行监测,对APP进行模拟操作,即可知道APP里面的数据是如何获取的。

    我们只需要写代码模拟请求,无论POST还是GET,即可得到该请求所返回的信息。再通过对返回的信息结构化解析,即可得到我们想要的数据。

    public static void main(String[] args) {

    Spider.create(new GithubRepoPageProcessor())

    //从https://github/****开始抓

    .addUrl("https://github/****")

    //设置Scheduler,使用Redis来管理URL队列

    .setScheduler(new RedisScheduler("localhost"))

    //设置Pipeline,将结果以json方式保存到文件

    .addPipeline(new JsonFilePipeline("D:\\data\\webmagic"))

    //开启5个线程同时执行

    .thread(5)

    //启动爬虫

    .run();

    }

    以模拟采集“meizu”应用市场为例

    应用市场产品

    抓包返回参数

    整个抓包过程

    3.HOOK技术

    HOOK技术是一种走操作系统内核的技术,由于安卓系统是开源的,所以可以借助一些框架修改内核,从而实现你要的功能。HOOK的形式,我们走的是Xposed框架。Xposed是一款可以在不修改任何其他开发者开发的应用(包括系统服务)的情况下,改变程序运行的一个开源框架服务。基于它可以制作出许多功能强大的模块,以此来达到应用程序按照你的意愿运行的目的。

    如果把安卓手机看做一座城堡,那Xposed可以让你拥有一个上帝视角,城里的运作细节尽收你眼底,还能让你插一手改变城堡的运作规律。

    什么意思呢?简单的说就是你可以通过他,自动化的控制你的APP。如果将我们的APP开在模拟器上,我们可以通过编码,通过他告诉APP这一步干什么,下一步干什么。你把它理解成类似游戏打怪外挂就可以了。

    而他每走一步,APP与服务端交互的数据,均可获取下来。这种方式广泛用于一些成熟的APP。比如某信采集。

    public class HookActivity implements IXposedHookLoadPackage {

    @Override

    public void handleLoadPackage(LoadPackageParam lpparam) throws Throwable {

    final String packageName = lpparam.packageName;

    XposedBridge.log("--------------------: " + packageName);

    try {

    XposedBridge.hookAllMethods

    (Activity.class, "onCreate", new XC_MethodHook() {

    @Override

    protected void afterHookedMethod(MethodHookParam param)

    throws Throwable {

    XposedBridge.log("=== Activity onCreate: " + param.thisObject);

    }

    });

    } catch (Throwable error) {

    XposedBridge.log("xxxxxxxxxxxx: " + error);

    }

    }

    }

    其实我们八爪鱼曾经也想开发一款通用的APP数据采集工具,并且两年前在这块投入研究了小半年,我们做出了一款APP采集脚本编辑工具,可以让一款APP的数据采集项目缩减到3-5天即可开发完成。但我们认为,这个工具需要编写脚本一般用户是比较难上手的,所以仅作为内部项目使用。

    以HOOK某APP为例:

    HOOK指令打开某

    4.这些年走过的坑

    聊完APP采集的思路,我们跟大家分享一些遇过的坑吧,让大家乐一乐

    坑一:签名算法

    以某信的文章列表页及某信息页为例,对其http访问进行抓包,会发现其url的一个核心参数是我们无法知道如何生成的,这就导致,我们不可能直接用该url进行信息爬取;签名算法如果无法破解,HTTP这条路就是死路了。

    坑二:http爬取回来的信息和页面显示不一致

    以某信的某信息页为例,对比直接访问某信页面及http爬取的信息,可明显发现http爬取到的信息较少。造成得两种方式都用,才能既照顾速度又照顾完整性。

    坑三:模拟器中的坑

    APP自动识别你的运行环境进行屏蔽,最厉害的还是某信,连你是用模拟器打开还是真机打开,是什么内核的,全部进行限制。曾经见过牛人,找某手机厂商专门定做真机来配合。

    坑四:帐号的坑

    这个坑就有点大了,要找号、养号,都不是件容易的事情,更惨的是封号,真真让你一夜回到解放前。

  • ?

    数据挖掘十大经典算法——K-means

    蔡依云

    展开

    聚类学习任务

    回顾聚类:聚类算法是要将相似的对象放入同一个聚簇,而将不相似的对象分到不同的聚簇中。

    算法特点:在进行回归、分类等有监督学习任务中要定义类别标签或者目标值,但聚类过程的输入对象没有与之关联的目标信息(即类别标签),所以聚类通常被会归于无监督学习任务。

    适用:众多难以获得标签数据的挖掘应用

    K-means聚类过程描述

    K-means算法的几个疑问

    局限性:K-均值算法依赖于初始值的选取,贪婪下降求解算法仅能取得局部最优解,未必能得到全局最优解。相同数据集如果初始点不同,那么聚类收敛结果相差较大。

    参数K:经常被问到K选择多少更合适,首先,这很困难。一般需要人为指定,如果让代价函数最优那么聚簇个数和数据点个数一样时代价为0,。SAS软件提供立方聚类准则,在代价函数基础上加上复杂性控制,从而确定K值。

    K-means算法的一些缺点

    对比于现在K-means算法的“刚性分配”准则,可以通过“柔性分配”准则,即以一定概率给该模型的各个混合分量,即概率分配到不同的簇。

    K-means算法对于噪声点敏感,特别“过分”的异常点会导致得到的聚类结果几乎不可用。所以在进行K-means算法之前进行异常点剔除是十分必要的。因为均值不是一个非常稳健的统计量(容易受异常点影响)

    K-means算法有时候会产生空聚簇,目前K-means算法的对待办法是从最大的聚簇中随机选取一个点作为新的簇的代表。

    K-means算法对数据要求

    数据集变量属性都为数值型,不能够对名义型数据进行计算。

    无法计算缺失值数据,数据有缺失,必须要首先进行缺失值替换,替换方法依照行业或者挖掘主题来确定,常见有最大值、最小值、平均值,删除变量等方式。

    运行效率不高,对于大数据集的处理较慢,对维度敏感,容易造成“维度再难”,所以聚类算法一般在算法运行前进行特征选择或者主成分分析.

    最近会介绍一些数据挖掘经典算法,感兴趣的同学关注一下,一起学习哦!

  • ?

    大数据算法,也许将塑造更恶劣的互联网世界

    屈凝珍

    展开

    PC时代真正拉开全球普及的大幕,大概要到世纪之交的2000年。在此之前,虽然影视作品深入人心地塑造了很多黑客形象,但人们对电脑的直观认识仍然十分肤浅。真正改变这一现象的动力并不仅仅来自PC自身性能的发展,也来自互联网的推动作用。

    PC+互联网奠定了我们这个时代信息高速公路的基石,在他们铺设交织的信息之路集群上,手机等更轻量级的终端不断发展,终于占据了我们的生活,演化出了现在的大数据算法浪潮。

    大数据算法下 每个人都是有辨识度的节点

    在科技趋势方面,艺术探索总是领先于工程实践乃至社会意识,当站在2018年的我们蓦然回首会发现,十年前乃至二十年前的电影就已经基本预告了AI、大数据等种种“先进科技实践现象”的到来。

    当然,我们现在已经接触到的大数据算法应用,与人们既有的预期还是有相当的不同,仍处在相对早期的发展阶段,但其影响已经开始渗透进入我们们生活的方方面面。

    大数据就是把互联网信息瀑布重新塑形的过程

    首先明确,我们此处提到的大数据算法指代的是互联网信息生产者、中继者等利益主体利用关键数据信息的统计建立对用户的特征分类,描摹具备分析价值的用户画像,从而针对性地采取差异化方式对待的一种策略。

    对于直接生产者来说,谁购买了我的“内容”,我就统计谁的特征,针对性地售卖我的产品。

    对于信息中介者来说,谁使用我们的“服务”,我们就统计谁的信息,针对不同用户采取基于时间、空间等任何有意义的节点来设计我们提供信息的呈现方式和范围。

    大数据算法可能塑造更恶劣的互联网世界

    从严格意义上来讲,这些策略的诞生并不依赖互联网,他们伴随着市场经济的滥觞而出现。商家们一早就自发地开始了解市场偏好,根据不同用户群的特点及来确定经营办法,这是商品社会建立的基石之一。

    不过在一些后发市场,直到几十年前,创始人自己走南闯北的阅历还是提供策略依据的核心要素——参见康师傅红烧牛肉面的口味选择之路。

    互联网打造了人类历史上从未有过的数据采集、流通能力,为信息检索和归纳整理创造了温床。互联网的普及是信息时代的必然事件,基于互联网的大数据算法决策也是互联网自身发展的必然要求。我们要讨论的问题不是这些会不会发生,而是他们演化过程中规则引导缺位时可能会带来的后果。

    —1—

    一叶障目加剧对立

    与冷冰冰的IE 404不同,谷歌浏览器在连接失败时会显示一只比较呆萌的”恐龙“头像,告诉用户如果没有互联网,大家就要倒退回到落后的中生代了。事实上,中生代称霸地球优势种群恐龙总目的灭亡(非鸟恐龙)恰恰和大数据算法可能带来的弊端有很强的可比性。

    Chrome 浏览器对断网者返回“中生代”的嘲讽

    现存高级脊椎动物类群都从两栖类之后的羊膜动物群进化而来,代表恐龙、鳄鱼等的“蜥形动物”和代表哺乳动物的“合弓动物”从很早就分道扬镳。

    恐龙在三叠纪中后期登场,倚仗自己的呼吸效率优势撑过了三叠纪末的艰难时刻,在全球高温湿润、强海侵时期的一亿六千万年内保持了自己的主要特征,一直舒舒服服地生活到了六千五百万年前,旋即在环境巨变惊天动地的的K--T灭绝事件变革中壮烈死去,再也没有能够看到古近纪的太阳。

    恰恰是为蜥形纲——主龙类量身定做的低氧、高温、湿润气候,使得他们的优势特征得以迅速发挥,持续大型化、持续特化。竞争对手合弓动物之前在二叠纪锻炼出来的耐寒能力(高代谢能力)并不入他们的法眼(生物选择没有必要)。

    漫长而固定的环境固化了他们的特征,用进废退的生物本性磨灭了他们的进化之路,最终导致了他们的灭亡。

    非鸟恐龙受环境影响过于特化而灭绝(不仅仅是大型化))

    没错,用进废退,不但是生物进化的本能规律,也是智能生物认识世界的自然规律。

    对于文明时代的个体来说,高度稳定的环境显然不是能够锻炼自己心智和见识的有利因素。历来各国机要人员,“不历州郡,不入台阁”是默认的惯例。如果哪天有重要机构的掌舵人换成了从小养尊处优又没什么见识的年轻人,多半是要出事的,是要步”恐龙王朝“的后尘的。

    早年间互联网的发展确实对普通网民起到了丰富知识层次、扩展视野的作用,同早期恐龙们要面对的复杂自然环境类似。但是经历数十年野蛮生长后,大数据算法终于瓜熟蒂落。在大数据算法的构建过程中,每一个用户都会把自己的关键”喜好“特征毫无防备地贡献出去。

    喜欢看球的朋友会发现自己浏览器和APP的推送头条一直是体育,喜欢财经的永远挑不出金融领域。如果您是喜欢辩论的网民,那么很容易稀里糊涂陷入自我印证立场和攻击别人之间的死循环。

    如果厂家们真的行之有效的玩转了大数据算法,那么坚持”PC 玩游戏就是比主机强的“用户们可能也就再也看不到别人对此的看法。

    大数据会放大台式机 笔记本 果粉 和主机“贱民“之间的对立

    大数据算法发现了你的选择,并且用粘性“智能”的信息流方式把你半永久性地、潜移默化地粘到了那个方向上,这是我们现在已经开始面对的现实。周围都是恒定不变的丛林,其他的观点和信息都被隐藏,长此以往,用户都将成为徜徉在中生代在”自由王国“舒适“吟唱的恐龙大帝,对于自己世界以外的事物漠不关心。

    任何人都有自己的认知盲区,即使是学富五车的大学教授也常常在简单的认知问题上翻船,如果不加限制。”恐龙“与”恐龙“们将进一步强化自己的喜好与对立,社会群体之间的有效沟通将很大程度上被阻断。

    一叶障目不见泰山,这是大数据算法极有可能带来的严重后果。

    —2—

    价格歧视导致不公

    ”十年磨一剑,霜刃未曾试,今日把示君,谁有不平事?“公平自古以来都是人们用户的追求,甚至要高于形式上的平等。平等意味着机会绝对均等,自人们进入国家文明时代以来,大多数人都是安于自己既有命运的,但公平却不一样,他代表着在一套资源配置体系内权利与责任对应的关系。

    世界互联 是双刃剑

    人们不会和爱因斯坦比智力,不会同比尔盖茨比财富,但不能容忍办公室内和资历差不多的人突然暴富或者意外获利。

    如果有一套规则切实确定了体系内不同人的应该有的付出和相应地回报,并且这套规则是大范围内被广泛承认,并且切实运行了很久的,那么任何敢于挑战这种规则的决策都是不明智的。

    很遗憾的是,大数据算法被制造出来,其初衷就是要挑战既有的模糊化(但相对公平)的规则的。数据提供者费劲千辛万苦,耗费了不知道多少Xeon 服务器运算时间来计算的内容,无非是要把自己用户群分类分的更细一些,把他们的决策模型建立的更加拟真一些。如果这些都成功了或者部分地实现了,商家们差别化对待用户的”邪恶“梦想也就差不多成真了。

    被APP识别成土豪 整个世界都跟着涨价是什么体验

    这就是价格歧视。在大数据算法普及前的商品社会中,价格歧视固然同样存在甚至非常明显,但是那已经是约定俗成的规则的一部分,相对透明而为人所熟知,对社会伦理的挑战相对有限。

    举例来说,定位奢侈的商品拒绝讨好主流用户被大家习以为常、高端酒店大堂禁止衣冠不整者入内是社会内多数人都认可的准则(礼仪本身体现着一定的物质、认知和人际资源门槛,从一开始就是人群分类的标志),都是这种规则的体现。

    大数据算法是价格歧视的有力工具

    但当大数据和算法开始入侵商业社会,人们的不适感会骤然爆发。大数据杀熟在敏锐的用户面前已经是现实问题。在相同初始条件时,APP和网页客户端们依据后台已有的数据自动为大家提供了不同的价格、优惠甚至广告引导信息策略。

    一方面,人们开始感到不公平,由此引发的伦理问题非常严重;另一方面,当大数据算法已经开始深度定制对不同人的信息引导(引导就是误导)方案时,用户往往会陷入失去参照系的惶恐中,这是更深层次的市场信心损害。

    当订酒店的APP明明写着很多房源可以免费退订,你退订了两次后就再也看不到类似选项而你的朋友却完全不受限制时,当你的土豪朋友请你吃了两顿大餐,你发现你的点餐APP中推荐饭店、菜单全部变得奢侈而名贵无比时,你应该也是会感到崩溃的。

    而这,只是大数据算法最粗糙模型的初步应用而已。

    —3—

    鹰眼环伺风险重重

    在全球范围内,公共摄像头带来的隐私问题一直饱受争议。人们普遍担忧国家机构以安全为名设计的各种信息(图像)收纳机制会被滥用,导致公民隐私被泄露甚至被不正当利用。在大数据算法开始普及之后,信息的收集与筛选主体开始从主权国家扩散到了成熟的商业公司身上,这方面的社会不信任感会进一步加剧。

    2018没有终结者 但人们仍然担心天网

    世界主要国家都采用了代议制政体,在理论上都对自己的公民负责,人们连对自己选出来的主权国家都不放心,又凭什么对那些掌握用户清晰特征的大数据算法提供者、归纳者放心呢?

    互联网缔造了人类历史上从未有过的庞大数据流,扩充并发展了世界的贸易体系、资源配置体系、知识沟通交流体系,甚至开始蚕食人们的社交网络。

    在海量的数据面前,人们的行为和组织形式变得越来越复杂。在北京纽约这样的都市,街上的路人们普遍对街边的建筑来头毫无所知。那么,普通民众又能有多少精力对自己熟悉领域之外的复杂社会决策系统又多少认知呢?

    即使是主要国家的政府监管机构,由于自身的非营利性、非生产性,对技术理解和商业运营的了解上,也都是跟不上时代潮流的,普遍落后的。连有组织的强力机构往往都对商业公司的决策模式和安保情况后知后觉,指望社会力量自发监控大数据算法运行系统被用于正道无疑是痴人说梦。

    人们担心主权国家 又怎么能相信商业公司的自觉?

    没错,主流的科技企业和跨国公司都在强调自己的社会责任和公益意识,但无论他们拿出盈利剩余的多少部分来贯彻与他们主业不相关的公共事业,都解决不了人们对他们自身的监管问题。

    当一家公司通过你买什么菜、愿意去哪家电影院看电影来推断出你的性格特征、决策心理时,你对他的防护能力是很差的。那么这样有组织的公司获得的数据会被用到什么地方,是否会被交易?这些数据如何得到监管,如何得到尊重,如何保证不被滥用?这是所有人都值得探究的问题。

    社会问题永远不可能靠某些利益主体自发的道德来解决,开发大数据算法的组织、践行使用他们的公司无论如何对外发出皇天后土的誓言也不能解决任何本质问题。

    科技瓶颈需要更高层次的科技发展来解决

    有了这些弊端,我们就不要大数据了吗?这显然是不可能的,技术的推动力量不是人为所能扭转,我们开篇已经说过,这几乎不可避免。要解决这些问题,我们一方面要有认识他们、重视他们的勇气,靠用户舆论和政府监管来纠正商业公司的错误引导,另一方面也要着重发展大数据算法。

    社会发展遇到的瓶颈,只有更高层次的发展才能得到解决;科技进步产生的弊端,也只有更加发达的技术手段才能将其遏制。开放而积极的心态是我们解决大数据算法问题的最重要武器。

  • ?

    实时数据采集 将平台资源匹配

    浑明辉

    展开

    匹配算法实现,通过将用户属性、用户学习状态属性、用户操作行为统计属性与资源属性进行匹配,数据容量大,遥测距离远,人机界面友好,可靠性高的优点,可广泛用于学校和社区小区域范围环境服务。

    也适合于气象、海洋、环境、机场、港口、工及等领域使用.实时数据采集与上传该模块主要功能是通过无线方式获取环境观测站采集的实时数据并显示.数据采集的基本算法如下:首先判断是否到发送数据时间,若到了执行数据发送命令。

    为了方便学习者查找资源以及系统推送资源,须对学习者和资源的属性进行标记,即创建属性元数据.本研究采用标签技术分别建立学习者和资源的属性元数据.学习者的属性标签主要来自于用户注册时的信息(用户属性)、学习者的学习状态属性以及学习者系统操作行为统计属性(对上传、下载、浏览、评论等操作的统计)。

    资源的属性标签主要来自于资源提供者根据学科和关键字分类的标签以及资源使用者对资源的评价、标记等.根据研究性学习的主题、用户学习进度,系统可以将用户可能感兴趣,其他用户感兴趣或评分高、浏览次数多,相同领域的最优资源或相似领域的最佳资源推送给用户,系统根据学习者的学习主题,将平台中评价最高的相关资源、教师指定的资源和拓展的相关资源进行匹配,

数据采集算法

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP