- ?
精选30余款宏基因组分析软件,来自老司机的使用经验总结(上篇)
于四娘
展开
相比于16S的短平快,对于很多微生物组学,尤其是环境微生态方向的科研工作者而言,宏基因组仍然是“啃不动的硬骨头”和“信息分析黑箱子”。
这里,我为大家整理了一些主流和常用的宏基因组分析软件,结合自己的工作经验和其他文献中的报道稍作评述,分享给大家,欢迎补充、指正。
01流程集成
1、MG-RAST
MG-RAST (the Metagenomics RAST) server is an automated analysis platform for metagenomes providing quantitative insights into microbial populations based on sequence data which provides upload, quality control, automated annotation and analysis for prokaryotic metagenomic shotgun samples.
最新版本:
Version 4.02(最近更新时间2017年5月)
参考文献:PMID: 18803844
官网地址:http://metagenomics.anl.gov/
老司机点评
宏基因组因数据量大,很耗费计算资源,自行分析,搭建整个分析流程,时间成本和计算成本都很大,集成软件也很少,值得高兴的是,还是有一款免费的在线分析服务器MG-RAST,只要上传数据(原始下机数据,质控后数据或者组装后的数据均可),就可以进行数据质控和在线分析,还可以跟别人的数据比较。但也有缺憾,一是上传数据很费时,毕竟宏基因组数据量比较大,二是分析结果大概要等一周左右,毕竟宏基因组分析很耗费计算资源的,所以要做好一定的心理准备,三是提供的第三方分析工具太少,分析方法没有更多选择。
02数据质控
基础数据指控
1、FASTX-Toolkit
The FASTX-Toolkit is a collection of command line tools for Short-Reads FASTA/FASTQ files preprocessing.
Version 0.0.13(最近更新时间2010年2月)
参考文献:
Fastx-toolkit. FASTQ/A short-reads pre-processing tools
下载地址:
http://hannonlab.cshl.edu/fastx_toolkit/download.html
官网地址:
http://hannonlab.cshl.edu/fastx_toolkit/
2、NGS QC Toolkit
A toolkit for the quality control (QC) of next generation sequencing (NGS) data.
Version 2.3.3(最近更新时间2014年2月)
参考文献:PMID: 22312429
http://nipgr.res.in/ngsqctoolkit.html
3、Trimmomatic
A flexible trimmer for Illumina Sequence Data.
Version 0.36(最近更新时间2015年3月)
参考文献:PMID: 24695404
http://usadellab.org/cms/?page=trimmomatic
4、Readfq
A very fast multi-line FASTA/Q reader in several programming languages.
最后一次更新在2011年
https://github/cjfields/readfq
去宿主
1、SoapAligner
A member of the SOAP (Short Oligonucleotide Analysis Package). It is an updated version of SOAP software for short oligonucleotide alignment.
Version 2.21(最近更新时间2011年2月)
参考文献:PMID: 26270169
http://soap.genomics.org/soapaligner.html
2、Bowtie
An ultrafast, memory-efficient short read aligner, which aligns short DNA sequences (reads) to the human genome at a rate of over 25 million 35-bp reads per hour.
Bowtie2: Version 2.3.3(最近更新2017年6月)
Bowtie: Version 1.2.1.1(最近更新2017年6月)
参考文献:PMID:19261174
http://sourceforge/projects/bowtie-bio/files/
http://bowtie-bio.sourceforge/index.shtml
宏基因组数据质控一般包括两部分:
一是常规数据质控,包括去除低质量碱基较多的reads、含N碱基达到一定比例的reads、含有接头的reads等并进行统计。这部分的质控软件有很多,FASTX-Toolkit是一个数据质控相关命令行工具集合,包含FASTQ-to-FASTA converter,FASTQ/A Trimmer,FASTQ/A Clipper,FASTQ Quality Filter,FASTQ Quality Trimmer等数据处理常用工具,可自行组合使用。NGS QC Toolkit也是一个命令行工具集,包含:QC Tools,Format-converter Tools,Trimming Tools,Statistics Tools(AvgQuality.pls(AvgQuality.pls(AvgQuality.pl,N50Stat.pl)。此外,像Trimmomatic对illumina这种需要末端截取的数据处理很方便的原始质控软件,上节课介绍过了,这里不多说。readq也是一个很好用的脚本,有C,lua,perl,python 4种版本,速度很快,适合做大数据量的基础质控统计。
除此之外,宏基因组一般可能还需要去除宿主污染(比如肠道样本中的人类基因组信息等)。所以,这里会用到比对软件,比如SoapAligner和Bowtie(1和2),BWA等等,通过与参考基因组比对来剔除掉来源于宿主的信息。在短序列比对中,很显然SoapAligner和Bowtie在速度和资源上都更占优。Bowtie现在有1和2两个版本,2在长度50bp以上序列的准确度提升,目前用的比较多。SOAPaligner也是速度上比较有优势的短序列比对工具,而且占用内存非常小,也因此成为宏基因组去宿主的主流比对软件。
03组 装
1、SOAPdenovo
SOAPdenovo is a novel short-read assembly method that can build a de novo draft assembly for the human-sized genomes, which specially designed to assemble Illumina GA short reads.
Version 2.04(r240最新更新在2015年8月)
参考文献:PMID: 23587118
https://sourceforge/projects/soapdenovo2/files/SOAPdenovo2/
http://soap.genomics.org/soapdenovo.html
2、MEGAHIT
MEGAHIT is a single node assembler for large and complex metagenomics NGS reads, such as soil. Compare to SOAPdenovo, it generates longer contigs and consumes less memory.
Version 1.1.2(最近更新时间2017年8月)
参考文献:PMID: 25609793
https://github/voutcn/megahit
3、IDBA-UD
IDBA-UD is a iterative De Bruijn Graph De Novo Assembler for Short Reads Sequencing data with Highly Uneven Sequencing Depth.
Version 1.1.3(官网上最新1.1.1,github上到1.1.3,最近更新时间2016年7月)
参考文献:PMID:22495754
https://github/loneknightpy/idba/releases
http://i.cs.hku.hk/~alse/hkubrg/projects/idba_ud/
4、SPAdes和metaSPAdes
An assembly toolkit containing various assembly pipelines, which works with Illumina or IonTorrent reads and is capable of providing hybrid assemblies using PacBio, Oxford Nanopore and Sanger reads.
Version 3.11(最新一次更新在2017年9月)
参考文献:PMID: 28298430,PMID: 22506599
http://spades.bioinf.spbau.ru/release3.11.0/
http://cab.spbu.ru/software/spades/
宏基因组的组装软件很多,从老牌的Velvet到国产神器soapdenovo,再到号称soapdenovo升级版的megahit,IDBA-UD,metaSPAdes等等,根据环境中微生物的种类和复杂程度,应用有所不同,这里主要介绍下几个最常用和有亮点的软件。
宏基因组常见组装软件(PMID: 28099457)
宏基因组组装组装难点在于,物种复杂度高导致需要的测序量比较大,需要的计算资源也就比较大,同时导致测序深度不均一,低丰度的物种可能测序深度不够,很难被组装出来,reads利用率不高。
一般来说,中复杂度环境如肠道样品,一般用soapdenovo就足够了,需要内存80G左右。环境样本(如土壤,水体)其复杂度远高于肠道样品,组装软件就需要好好甄选一下了。IDBA-UD适合测序深度不均一的数据,因此从理论上来说是适合宏基因组组装的,尤其是复杂环境(如土壤,水体),但存在资源消耗过高,需要时间过长的问题。MEGAHIT具有资源消耗少,时间消耗短,组装结果优,reads利用率高的特点。
分享一个自己做的软件评测结果,供大家参考:10G土壤样品,IDBA-UD需要内存200-500G,4线程,需要2.5天;MEGAHIT需要内存40-60G,15线程,需要5小时。从组装结果来看,MEGAHIT的组装总长和数目提升2倍,reads利用率提升3倍,scaftigs平均长度,N50,最大长度无明显变化,对后续基因预测数目也有一定的提升。目前MEGAHIT在现有组装软件中,资源消耗基本上是最低的,因此很适合宏基因组中的复杂环境样品。
还有上面介绍过的软件SPAdes,无论单菌、宏基因组还是宏病毒组都表现不错,最新的版本打包了metaSPAdes、plasmidSPAdes、rnaSPAdes等等模块,在今年的一篇测评文章(metaSPAdes: a new versatile metagenomics assembler)中显示即使在复杂环境(土壤),组装效果也大大优于megahit、IDBA-UD等,但遗憾的是没有megahit资源消耗低。此外,SPAdes还支持来自不同平台数据的混装,包括Pacbio、Nanopore等。
有了好的组装结果,宏基因组就成功了一半。
下一期,为大家继续分享基因预测、物种注释、功能注释、binning等内容。
- ?
大数据是什么?超全的大数据分析工具
潮流
展开
大数据是什么?大数据处理分析的工具有哪些?不管是即将学习大数据的人亦或是转型向学大数据的人都想要了解的。
1,什么是大数据
简言之,从各种各样类型的数据中,快速获得有价值信息的能力,就是大数据技术。
2,大数据最核心的价值
大数据最核心的价值就是在于对于海量数据进行存储和分析。相比起现有的其他技术而言,大数据的“廉价、迅速、优化”这三方面的综合成本是最优的。
3,大数据处理分析的六大最好工具
一、 Apache Hadoop
Hadoop 是一个能够对大量数据进行分布式处理的软件框架。Hadoop 是可靠的,因为它假设计算元素和存储会失败,因此它维护多个工作数据副本,确保能够针对失败的节点重新分布处理。Hadoop 是高效的,因为它以并行的方式工作,通过并行处理加快处理速度。Hadoop 还是可伸缩的,能够处理 PB 级数据。此外,Hadoop 依赖于社区服务器,因此它的成本比较低,任何人都可以使用。
Hadoop是一个能够让用户轻松架构和使用的分布式计算平台。用户可以轻松地在Hadoop上开发和运行处理海量数据的应用程序。它主要有以下几个优点:
⒈高可靠性。Hadoop按位存储和处理数据的能力值得人们信赖。
⒉高扩展性。Hadoop是在可用的计算机集簇间分配数据并完成计算任务的,这些集簇可以方便地扩展到数以千计的节点中。
⒊高效性。Hadoop能够在节点之间动态地移动数据,并保证各个节点的动态平衡,因此处理速度非常快。
⒋高容错性。Hadoop能够自动保存数据的多个副本,并且能够自动将失败的任务重新分配。
Hadoop带有用 Java 语言编写的框架,因此运行在 Linux 生产平台上是非常理想的。Hadoop 上的应用程序也可以使用其他语言编写,比如 C++。
二、HPCC
HPCC,High Performance Computing and Communications(高性能计算与通信)的缩写。1993年,由美国科学、工程、技术联邦协调理事会向国会提交了“重大挑战项目:高性能计算与 通信”的报告,也就是被称为HPCC计划的报告,即美国总统科学战略项目,其目的是通过加强研究与开发解决一批重要的科学与技术挑战问题。HPCC是美国 实施信息高速公路而上实施的计划,该计划的实施将耗资百亿美元,其主要目标要达到:开发可扩展的计算系统及相关软件,以支持太位级网络传输性能,开发千兆 比特网络技术,扩展研究和教育机构及网络连接能力。
该项目主要由五部分组成:
1、高性能计算机系统(HPCS),内容包括今后几代计算机系统的研究、系统设计工具、先进的典型系统及原有系统的评价等;
2、先进软件技术与算法(ASTA),内容有巨大挑战问题的软件支撑、新算法设计、软件分支与工具、计算计算及高性能计算研究中心等;
3、国家科研与教育网格(NREN),内容有中接站及10亿位级传输的研究与开发;
4、基本研究与人类资源(BRHR),内容有基础研究、培训、教育及课程教材,被设计通过奖励调查者-开始的,长期 的调查在可升级的高性能计算中来增加创新意识流,通过提高教育和高性能的计算训练和通信来加大熟练的和训练有素的人员的联营,和来提供必需的基础架构来支 持这些调查和研究活动;
5、信息基础结构技术和应用(IITA ),目的在于保证美国在先进信息技术开发方面的领先地位。
三、Storm
Storm是自由的开源软件,一个分布式的、容错的实时计算系统。Storm可以非常可靠的处理庞大的数据流,用于处理Hadoop的批量数据。 Storm很简单,支持许多种编程语言,使用起来非常有趣。Storm由Twitter开源而来,其它知名的应用企业包括Groupon、淘宝、支付宝、阿里巴巴、乐元素、Admaster等等。
Storm有许多应用领域:实时分析、在线机器学习、不停顿的计算、分布式RPC(远过程调用协议,一种通过网络从远程计算机程序上请求服务)、 ETL(Extraction-Transformation-Loading的缩写,即数据抽取、转换和加载)等等。Storm的处理速度惊人:经测 试,每个节点每秒钟可以处理100万个数据元组。Storm是可扩展、容错,很容易设置和操作。
四、Apache Drill
为了帮助企业用户寻找更为有效、加快Hadoop数据查询的方法,Apache软件基金会近日发起了一项名为“Drill”的开源项目。Apache Drill 实现了 Google's Dremel.
据Hadoop厂商MapR Technologies公司产品经理Tomer Shiran介绍,“Drill”已经作为Apache孵化器项目来运作,将面向全球软件工程师持续推广。
该项目将会创建出开源版本的谷歌Dremel Hadoop工具(谷歌使用该工具来为Hadoop数据分析工具的互联网应用提速)。而“Drill”将有助于Hadoop用户实现更快查询海量数据集的目的。
“Drill”项目其实也是从谷歌的Dremel项目中获得灵感:该项目帮助谷歌实现海量数据集的分析处理,包括分析抓取Web文档、跟踪安装在Android Market上的应用程序数据、分析垃圾邮件、分析谷歌分布式构建系统上的测试结果等等。
通过开发“Drill”Apache开源项目,组织机构将有望建立Drill所属的API接口和灵活强大的体系架构,从而帮助支持广泛的数据源、数据格式和查询语言。
五、RapidMiner
RapidMiner是世界领先的数据挖掘解决方案,在一个非常大的程度上有着先进技术。它数据挖掘任务涉及范围广泛,包括各种数据艺术,能简化数据挖掘过程的设计和评价。
功能和特点
免费提供数据挖掘技术和库
100%用Java代码(可运行在操作系统)
数据挖掘过程简单,强大和直观
内部XML保证了标准化的格式来表示交换数据挖掘过程
可以用简单脚本语言自动进行大规模进程
多层次的数据视图,确保有效和透明的数据
图形用户界面的互动原型
命令行(批处理模式)自动大规模应用
Java API(应用编程接口)
简单的插件和推广机制
强大的可视化引擎,许多尖端的高维数据的可视化建模
400多个数据挖掘运营商支持
耶鲁大学已成功地应用在许多不同的应用领域,包括文本挖掘,多媒体挖掘,功能设计,数据流挖掘,集成开发的方法和分布式数据挖掘。
六、 Pentaho BI
Pentaho BI 平台不同于传统的BI 产品,它是一个以流程为中心的,面向解决方案(Solution)的框架。其目的在于将一系列企业级BI产品、开源软件、API等等组件集成起来,方便商务智能应用的开发。它的出现,使得一系列的面向商务智能的独立产品如Jfree、Quartz等等,能够集成在一起,构成一项项复杂的、完整的商务智能解决方案。
Pentaho BI 平台,Pentaho Open BI 套件的核心架构和基础,是以流程为中心的,因为其中枢控制器是一个工作流引擎。工作流引擎使用流程定义来定义在BI 平台上执行的商业智能流程。流程可以很容易的被定制,也可以添加新的流程。BI 平台包含组件和报表,用以分析这些流程的性能。目前,Pentaho的主要组成元素包括报表生成、分析、数据挖掘和工作流管理等等。这些组件通过 J2EE、WebService、SOAP、HTTP、Java、JavaScript、Portals等技术集成到Pentaho平台中来。 Pentaho的发行,主要以Pentaho SDK的形式进行。
Pentaho SDK共包含五个部分:Pentaho平台、Pentaho示例数据库、可独立运行的Pentaho平台、Pentaho解决方案示例和一个预先配制好的 Pentaho网络服务器。其中Pentaho平台是Pentaho平台最主要的部分,囊括了Pentaho平台源代码的主体;Pentaho数据库为 Pentaho平台的正常运行提供的数据服务,包括配置信息、Solution相关的信息等等,对于Pentaho平台来说它不是必须的,通过配置是可以用其它数据库服务取代的;可独立运行的Pentaho平台是Pentaho平台的独立运行模式的示例,它演示了如何使Pentaho平台在没有应用服务器支持的情况下独立运行;Pentaho解决方案示例是一个Eclipse工程,用来演示如何为Pentaho平台开发相关的商业智能解决方案。
Pentaho BI 平台构建于服务器,引擎和组件的基础之上。这些提供了系统的J2EE 服务器,安全,portal,工作流,规则引擎,图表,协作,内容管理,数据集成,分析和建模功能。这些组件的大部分是基于标准的,可使用其他产品替换之。
4. 大数据特点
第一,数据体量巨大。从TB级别,跃升到PB级别。
第二,数据类型繁多,如前文提到的网络日志、视频、图片、地理位置信息,等等。
第三,价值密度低。以视频为例,连续不间断监控过程中,可能有用的数据仅仅有一两秒。
第四,处理速度快。1秒定律。最后这一点也是和传统的数据挖掘技术有着本质的不同。物联网、云计算、移动互联网、车联网、手机、平板电脑、PC以及遍布地球各个角落的各种各样的传感器,无一不是数据来源或者承载的方式。
如果对于大数据还有更多的疑问,可以持续关注作者,也可以留言或者私信问题。
- ?
大数据与临床科研
阿维克修
展开
大数据是所涉及的数据量规模巨大到无法通过人工,在合理时间内截取、管理、处理、并整理成为人类所能解读的信息。
大数据时代的到来,在商业、经济、医学及其他领域中,决策将日益基于数据和分析而作出,而并非基于经验和直觉。
医疗领域的大数据是指因为临床或者可以需要收集起来的有关健康或者诊疗的信息。其产生来源于日常诊疗过程,其中的数据都是未加修饰的纯天然数据,没有任何排除纳入标准,是一种普查数据。能直接反应临床疗效。
医疗大数据包括电子病历系统、慢性病及传染病注册登记系统、医疗保险信息系统、出生死亡登记系统等等。对于临床医生最关键的是电子病历系统,该系统包括了人口学特征(性别、年龄)、实验室检查、微生物检测、医嘱、诊疗操作、手术资料和临床转归等信息。
临床研究大体分为干预性研究和观察性研究。
干预性研究,又称随机对照临床试验(RCT),需要主动的、有目的地对受试者进行试验干预,一般有严格的纳入排除标准,采用随机化的方法来最大程度地消除混杂因素的干扰。
目前临床科研面临的困境:RCT与观察性研究两者差别较大,两者干预效应不一致。RCT得出的是一种生物学疗效,这反应了干预手段在严格的实验条件下的生物学作用。这种作用可能很弱或者实际的临床中无法发挥出来,生物学效应不能转化成临床疗效。
但基于大数据的临床研究(BCT)在未来可能成为一种研究的主流方式与RCT形成互补。
大数据的临床研究(BCT)其实属于观察性研究,因此必然存在观察性的缺陷,例如存在较多偏绮、混杂因素难以控制、基线资料不均衡等。如果分析了存在偏绮的数据,得出的结论有可能被夸大,目前尚不存在一种万能的统计学解决方案,但视乎可以通过采用随机效应模型或者bootstrap抽样法在一定程度上提高预测模型的准确度。
如何利用大数据进行临床研究:以MIMIC-II数据库为例
(1)、MIMIC-II数据库全称为重症监护多参数智能检测数据库II。该数据库是对公众开放的免费数据库,主要用于重症医学的各种临床研究。该数据库包含的信息来自于美国波士顿beth israel deaconess medical center。该数据库是不断更新的,已经收集了3万多ICU患者的住院信息。该数据库信息由人口学特征、实验室检查、液体及药物医嘱、病历信息、心电监护、呼吸波形监护、血压、血氧饱和度和护理记录。
(2)、MIMIC-II数据库使用步骤:访问网站physionte.org/mimic2/MIMIC-II --注册账号--通过伦理考试--提交申请--下载数据库--安装虚拟机(linux系统、sql语言)--进行临床研究--选择统计方法--对研究结论进行解释--发表论文。
运用大数据可以进行以下几种类型的研究。
如何凝练出实际可行的临床研究问题,有两种主要方式:
(1)、从数据中找灵感。
(2)、从要研究的内容去找数据。
数据提取之后,选用你熟悉常用统计软件(SAS,STATA,SPSS,R语言)对数据进行分析,以STATA为例对数据进行调研和分析。
使用STATA进行大数据分析时主要包括两个部分,数据处理和统计分析。
数据处理包括:
(1)、数变量的产生,比如希望把年龄变量转化成二分类变量;
(2)、数据核查,比如采用sum模块查看是否存在一些不合逻辑的错误值;
(3)、变量类型的调整,比如有些字符变量转化成数据变量;
(4)、数据库合并,患者的不同信息往往是存储在不同的关联表格中,需要合并,可以使用stata的merge或append命令执行。统计分析在数据处理的基础上进行,一个完好的数据处理前期准备是进行可靠统计分析的基础。
(5)、采用do-file方式进行数据统计可以完整记录数据分析的全过程,这样文章修回或发现统计结果错误的时候可以随时查看调用的命令。
下图是完整的大数据分析流程图
问答环节
1、目前各种指南以及高级别循证医学证据是怎么来的?
答:参考随机对照临床试验及相关的荟萃分析。
2、目前为什么生物学疗效不能转化为临床疗效?
答:(1)、RCT条件下干预措施执行比较严格,其中包括纳入的人群(没有大量的合并症和并发症,是所谓的单病种,这就剔除了大量的混杂因素)。
(2)、RCT有严格的治疗时机,而现实中繁忙的临床工作可能会延误给药时机。
(3)、RCT一般都在大医院进行,其结果无法推广到中小医院。
(4)、RCT只是对20%的患者进行研究,不能把这样的结论去治疗其余80%的患者。
(5)、观察性研究存在选择偏绮、混杂因素难以控制、基线资料不均衡等各种缺点。
- ?
数据科学如何助力科研?
傅聪健
展开
硬件平台、软件环境和算法模型的一站式支持,可以让各学科的研究都能从数据科学的发展获益。
开放
今天是北得克萨斯大学(University of North Texas, UNT)科研信息技术服务中心(Research IT Services)的开放日(Open House)。
昨天丁老师告诉了我们这个消息。于是今天上午,我们实验室的几个小伙伴,就过来参观学习了。
在工作人员的带领下,我们参观了高性能计算机房。那里面真是壮观。
磁盘阵列都在高速运转。拉开抽屉,里面整整齐齐数十个6TB的硬盘。用户的数据可以同时在上面读取。
走近机架,CPU和GPU们制造的热风铺面而来;旁边就是冷却管线。从一排排服务器中间穿梭,真有冰火两重天的感受。
因为噪声很大,讲解人员不得不提高音量。他告诉我们,因为要保证冷却、供电等设施的持续正常运转,整个建筑的结构都是独特的。单单是买来设备之后做布线,就是一个十足的技术活儿。
10点钟,我们在535房间,听了科研信息技术服务中心4名工作人员联合做的报告。报告的内容,极大地改变了我对服务中心功能的印象。
原本以为,他们不过就是网络管理员。为学校里面的师生,提供基础设施。设置用户账号,预装软件,然后解决一些需要重启电脑之类的问题而已。就像英剧《IT》里面这帮家伙一样。
然而,Richard 用一个案例,说明了他的工作,令我感觉到了震撼。
案例
案例来自于一个研究生,叫做 Sheela ,学生物的。
她自己的 LinkedIn 页面,有不少内容没有更新。当初她给自己的预计,是 2017 年底毕业。
事实上,她不仅没有按照预期时间毕业,而且差点儿就没法毕业了。
她的研究方向是生育。希望对比4种不同的治疗方法,在不同条件下对生育的促进影响。
我是外行,不知道这里面数据采集究竟需要多高的成本。但是 Richard 告诉我们,很贵。
Sheela 用了好几年的时间,终于采集到了 104 个样本,每个样本包括 29 个特征变量。
然后,她就试图采用回归和方差分析(Analysis of variance,ANOVA)的手段,来构造模型。结果发现——一点儿显著关系都没有!这几年白干了。
欲哭无泪啊。
是不是就此放弃毕业呢?
Sheela 跑来服务中心,找到 Richard 所在的数据科学与分析(Data Science and Analysis)部门求援。
Richard 发现,由于数据量小,可能的相互作用和潜在模型数量却很多,因此传统方法不适合这个研究的数据分析。
而 Richard 的爱好,恰好就是玩儿各种新鲜的统计工具。
于是,他很快帮助 Sheela 设定了新的分析思路:基于决策树的监督学习+遗传算法,然后采用 BIC 做模型选择。
Sheela 一听就懵了:这说的都是什么?……
没错,这就是具体研究领域人员面临的现实问题——追踪本领域前沿,已经让他们投入了全部精力。他们没有余力,在研究方法和工具上时刻刷新自己的知识和技能。
但是, Richard 说,数据科学与分析(Data Science and Analysis)部门就是在这种情况下,体现自身价值的。
我们参观了 Richard 的办公室。里面就如同一座小型图书馆,摆满了各种书籍和资料。他平时乐此不疲地追踪数据科学进展,因此对于他来说,新的数据分析思路,其实无非对应着 3.5 个 R 软件包(其中有一个软件包,可视化模块独立,所以他认为算半个)而已。
不过,如果你拿普通的电脑试图做这种数据分析,依然是很困难的。 Richard 的电脑是一台配置不错的 Macbook Pro ,16GB的内存,6核CPU。但是为了帮 Sheela 跑这个分析,连续运转了25个小时,依然看不见尽头。
这时候,高性能计算设备的作用就来了。 Richard 旋即把任务扔到了服务器集群上面,同时使用超过200个核心……就是这样,依然跑了10多个小时,才完成。
出来的结果,让 Sheela 欣喜不已。这是 ROC 曲线图:
那 0.5 个软件包,还顺便把决策树的可视化做了。
在这张图里面,4种不同疗法,在不同的条件下,对应的效果差别,一目了然。
Sheela 不仅顺利毕业,而且还把论文发在了一份很好的期刊上面。
这是个皆大欢喜的结局。
功能
Richard 是这样描述部门使命的:
可以看到,数据科学与分析部门,从软件、硬件、算法和模型构造,全方位为有需要的师生提供支持。
不仅帮助学生搞定毕业论文,他们还和教授们合作,共同申请科研项目经费。
他们还利用教程的方式,把数据科学的基础知识与技能分享给大家。
这种分享,是超越学校范围的,每个人都可以获取。你可以访问这个链接(http://t/ELReEg5),看看他们精心制作的 R 语言教程。
每一段教程里面,都不仅给出了完整的代码,可以拷贝粘贴直接用,而且还有详细的注释,甚至是附带数据的下载链接。
师生们可以根据自己的需求,找到相应的教程,直接应用到自己的研究问题和数据上面。
数据科学与分析部门还会经常提供培训讲座。例如明天,就会有利用服务集群做机器学习和深度学习的教学演示。我听了很兴奋。
Richard 的同事 Jon 介绍说,他们不仅有 R 语言教程,还有 SPSS 和 SAS,甚至是 Latex 的教程。这些教程会经常更新,并且不断补充新的应用场景。
我很兴奋地询问,有没有 Python 教程?
Jon 面露难色,告诉我说“不好意思,我们属于 R 阵营”。
小结
一上午的参观学习,让我们收获良多。令我们印象最深刻的,并不只是那些硬件基础设施,而是这种数据科学对科研的真正有效推动。
数据科学是专业领域,并非每个人都需要成为数据科学家。门槛的降低,可以让更多人应用数据科学提供的便捷工具,来推进自己的科研,尤其是其中的数据分析环节。
更可宝贵的,是这种一站式咨询与合作方式,不仅可以帮助有困难的师生解决燃眉之急,更有助于形成良性互动循环,使得科研项目做大做强。就像下图中展现的一样。
喜欢请点赞和打赏。还可以微信关注和置顶我的公众号“玉树芝兰”(nkwangshuyi)。
如果你对 Python 与数据科学感兴趣,不妨阅读我的系列教程索引贴《如何高效入门数据科学?》,里面还有更多的有趣问题及解法。
- ?
如何利用大数据为您的科研工作装上助推器?盘点3种大数据分析技能
Valentine
展开
在调查研究中,常常会遇到很多的大数据分析处理工作,人们需要在这些数据中分析出事物的一些规律,从而找出事物间的客观联系,得出研究理论的实践依据。因此对于科研工作者来说,大数据分析能力是工作中必不可少的技能包之一。下面我们来看,需要那些基本的分析能力呢?
一、数据可视化
简单的说就是将数据用图或者表直观展示出来。可以使用Excel中大量的公式函数,通过这些函数执行计算,分析信息并管理电子表格或网页中的数据信息列表与数据资料图表制作。在这个方面事实上,Excel的功能非常强大而且全面,完全可以满足日常工作中图表制作和数据可视化的需求。因此掌握好Excel技能,对大数据的可视化分析是一个很好的帮助。
我们还可以用ECharts和D3.js 等基于HTML5 的两个纯Javascript图表库,可通过网页编程,在网页上显示出直观、可交互并且可个性化定制的数据可视化图表。具有创新的拖拽重计算、数据视图、值域漫游等特性,还有混搭图表、拖拽重计算、制作数据视图、动态类型切换、图例开关、数据区域选择、值域漫游、多维度堆积等非常丰富的功能。它们的用户体验非常好,不过需要一点网页开发的基础才可以使用。
二、机器学习
对于理工科背景的人们来说,这块领域入门还不算太难,首先需要具备了统计学和概率学的基础知识。机器学习的基础包括聚类、时间序列、推荐系统、回归分析、文本挖掘、决策树、支持向量机、贝叶斯分类和神经网络。从这些名词我们可以看到,没有统计学和概率学的基础知识是无法学好机器学习的。在了解基础知识的同时,推荐两个关于机器学习的框架:谷歌的TensorFlow和百度的百度大脑。
三、算法
对于大多数人程来说算法经常听人提起,并不会太陌生,比如什么是数据结构,它包括栈、队列、链表、散列表、二叉树、红黑树、B树等等。然后是常用算法包括:排序(插入排序、桶排序、堆排序、快速排序)、最大子数组、最长公共子序列、最短路径和矩阵的存储运算。学好算法有利于更进一步深入学习如何开发程序来分析和处理大数据。
- ?
科研必备!千万专利免费下载!智能分析行业数据!
宋成风
展开
专利信息是丰富的知识宝库。在研究和开发时,研究人员往往需要找出过去的研究专利,并继续在巨人的肩膀上进行研究和开发,从而节省时间,提高效率。但是,如何查询和下载专利信息是目前的一个问题。
今天给大家推荐一个 【全球专利免费检索下载】 网站,优势灰常明显:专利涵盖范围广,多维大数据分析,免费下载无限制。【福利在文末】
详细说来:它涵盖了全球102个国家、地区、组织的专利数据,如中、美、日、韩、欧等。而且这些数据均采购自官方正规渠道,并经过上千名专业数据人员加工形成,保障了数据的准确性、权威性。
单日可下载高达10000篇专利全文PDF文档,还可打包批量下载,满足99.99%用户日常下载需求。
它是国内首个具有军民融合特色的公益性知识产权大数据检索分析系统,可实现全球专利的在线检索、阅读、分析、下载。检索工具大众化、使用简单便捷化。
先给大家展示一下:
根据提示输入检索内容,我输入了干细胞,然后就会有关于干细胞的一些关键词
搜索出来的页面如下,会看到搜索出来的内容后,还可以根据其他条件进行更加精细的搜索和筛选
另外还可以看到有一个统计分析功能。拥有3种专利大数据分析模式:统计分析、关联分析、聚类分析。帮你快速掌握行业动态、 深入分析竞争对手研究现状,协助您进行智慧决策。
案例:加入你在考虑研究方向时,在干细胞和基因编辑之间犹豫,于是你可以查一下这两个领域近年来的专利数量,看看哪个领域更容易出成果。
下面是我查询的关于干细胞和基因编辑两个方向的专利的统计分析:
干细胞近年来专利数量统计分析
基因编辑近年来专利数量统计分析
可以发现基因编辑专利数量呈现明显的上升趋势!
当需要具体了解一个专利,那就可以直接下载了,下载就很简单了,直接点专利后面的PDF即可,我尝试下载了一个(注册一个账号),的确非常简单快速!
福利来啦:
①首先当然会告诉你这个强大的专利数据库的地址
②另外,本文仅仅介绍的是这个数据库的两个功能,还有很多实用的功能,例如居民融合数据库分析、特色行业数据库等等。所以已经为大家准备了数据库的使用指南大全以供大家查询。
③虽然此数据库已拥有8000万的全球专利文件,但是与外文专利的支持相对较少,如果想检索外文专利,可进入美专局、欧专局、日专局、韩专局等官网检索下载。已经为大家整理好了这些网站链接。
总结一下你可以获得的福利包括:
①此专利数据库官网链接:
②数据库使用指南大全:
③外文专利网站大全:
④其他专利网站:
如需下载使用:
(由于百家不允许发链接,请自行百度: SOOIP 官网上即可完成搜索和下载专利全文。)
- ?
免费生物信息学数据分析工具
夏罡
展开
数据分析和作图是科研狗们的必备技能。近几年,随着数据类型的增多,excel、SPSS等常用软件已经不能满足科研需求了。
R语言以其方便、快捷的优势,迅速获得许多编程技术不好的科研狗的青睐。凭借短短几行代码,就能完成各种高大上的数据分析,关键还能做出漂亮的图。
但天天跟代码打交道也颇为头疼,作为一般的科研人员,并不需要完全掌握代码,只要会使用工具就差不多了。
下面小博给大家介绍一个基于云的在线生物信息学数据分析和作图工具:
OmicShare tools,让你从此不跟代码打交道。
OmicShare tools包含37种不同的数据分析作图工具,常用的韦恩图、PCA图、柱形图、火山图等都能找到。
小博试用后发现,OmicShare tools提供详细的教程,确实方便快捷,大概一分钟左右就能做出图,同时提供下载(svg格式)。
Omicshare不仅提供在线工具,还分享很多实用的生物信息学知识,有问题随时找小博!
- ?
图形可视化及数据分析软件 Origin 2017 下载
卫白易
展开
Origin 是一款经典的图形可视化和数据分析软件,是科研人员和工程师常用的高级数据分析和制图工具。是公认的简单易学、操作灵活、功能强大的软件,既可以满足一般用户的制图需要,也可以满足高级用户数据分析、函数拟合的需要。
Origin 具有两大主要功能:数据分析和绘图。Origin的数据分析主要包括统计、信号处理、图像处理、峰值分析和曲线拟合等各种完善的数学分析功能。准备好数据 后,进行数据分析时,只需选择所要分析的数据,然后再选择相应的菜单命令即可。Origin的绘图是基于模板的,Origin本身提供了几十种二维和三维绘图模板,而且允许用户自己定制模板。绘图时只要选择所需要的模板就行。用户可以自定义数学函数、图形样式和绘图模板;可以和各种数据库软件、办公软件、 图像处理软件等方便的连接。
Origin 可导入包括ASCII、Excel、pClamp 在内的多种数据。另外,它可以把Origin图形输出到多种格式的图像文件,譬如JPEG、GIF、EPS、TIFF等等。Origin 支持编程,以方便拓展Origin的功能和执行批处理任务。Origin 有两种编程语言——LabTalk和Origin C。
本次更新为图形可视化及数据分析软件 Origin 2017 破解版。
- ?
研究生科研必备的十款软件,你装了吗?
Zhi
展开
工欲善其事,必先利其器。
操作简单、专业性强、能够节省效率的工具可以让科研工作事半功倍。读研究生的同学们为了顺利毕业,发表一两篇SCI或者够格的国内领域核心期刊的论文,想办法追求高效率的科研是必须的。
以下这十类软件可以大大提高你的工作学习效率,尤其是对科研工作大有裨益:
1)文献阅读器:PDF、超星阅读器、CAJ
PDF一般大家都会有,最常用的阅读电子书软件。但是一般学校都会购买超星和知网数据库,而超星的电子书籍需要下载超星阅读器才可以看,知网的部分文献,尤其是硕博士论文,则要用官方的CAJ阅读器查看。基本上Word再加上这三个,所有文献格式都可以阅读了。
2)文献管理器:Endnote或Zotero
研究生期间除了阅读文献外,还要整理、归纳海量的文献,原始的办法是打印后用笔标记,或者用Word做文献摘抄。前者不环保,后者效率低而且不方便查找文献题录信息。Endnote则可以结合Word处理阅读与管理文献的问题,而且X4以上版本,可以很好的兼容PDF格式,提取文献信息也很迅速。
3)基本办公软件:Office Word、PPT、Excel
Office几乎是电脑的标配,但是Office每一版本功能都不太相同。
Office 07版及其之前的版本,满足基本的需求是没有问题的。但更新到Office 2013版,新增了取色器、PPT形状组合和隐形参考线等功能,可以更加便捷的画出图形,不用担心对不齐,而且让你PPT的配色变得更加高端;Excel图表新增了很多样式,可以一键成图,而且图表样式编辑功能也更强大;Word有了更强的排版功能,新增了继续阅读功能,还可以直接打开PDF文档阅读。选择最新的版本,可以使用更多更加便捷的功能。
4)专业备忘录:奇妙清单
看文献、作报告、做实验、做考察、写项目、写文章……事情一大堆,没有个清单工具,会混乱且容易遗漏,所以清单工具是必不可少的,可以提高做事的效率。当清单的事情一件件完成,特有成就感。当然备忘录也可以,但是这个应用最好的一点是,它有PC版、iPad版、Android版、iPhone版,甚至Kindle版,且支持不同版本间的同步,用起来十分方便。
5)思维导图工具:Mind Manager或X Mind
科研中,我们经常需要梳理前沿领域进展,也需要整理自己的思路, 那么思维导图工具是帮助我们理清思路、头脑风暴、抓住灵感最好的工具了。软件使用起来也非常的简单。而且,当你与导师探讨研究思路的时候,有一个清晰的思维导图作为讨论的基础,会使讨论的针对性和有效性大大提高。至于这两款软件,选其一就好。相对而言Mind Manager会更专业,但是X Mind也够用。
6)作图工具:Origin或SigmaPlot
Origin是国际出版界公认的标准数据处理与科学绘图软件,是一款定位于基础和专业之间的作图软件。相比Matlab,Mathmatica和Maple等极其专业的数据分析与作图软件(需要懂一定的编程、函数和矩阵知识,对使用者要求较高),它的界面简单,操作也容易入门和掌握,但是相比于傻瓜式的Excel作图,Origin又为我们提供了非常多样的数据图表制作样式以及自定义编辑。比如,可以做坐标轴截断图(断点),可以绘制双横坐标,具有多层图形功能还可以合并系列图表等等。所以如果想发好一点的文章,这个是必备中的必备。推荐Origin 8以上版本。
SigmaPlot的功能与Origin非常类似,但是在操作的易用性上会更好,某些样式的图导出后比Origin效果要好,所以可以与Origin互补。
7)流程图:Visio
生命科学研究生经常要绘制一些实验的流程图,比如基因操作的流程图,比如小鼠实验示意图等等。虽然Word和PPT也可以画,但是另存为图片的像素和分辨率有限,有时候达不到期刊图片高清的要求,但是用Visio2013就可以轻松解决啦!
8)数据统计与分析:SPSS或SAS
这两款都是专业的数据分析软件,几乎可以搞定数据统计的一切问题,但是对于编程知识薄弱的生命科学研究僧而言,还是老老实实用只需要基础统计学知识就可以操作的SPSS吧,很多的统计分析可以直接套用样式。推荐SPSS 19以上版本和SAS 9.2以上版本。
9)文章排版:LaTeX
最强大、最专业的排版软件。没有之一。不过要用好它,必须配备一本入门书籍或者网上搜索相关入门教程,如果是写中文论文,那么还需要搞定汉字包。长期以来我们已经被微软惯坏了,稍微操作有点复杂的或者入门有点困难的,我们就不想用了。不过,入门了就会发现,比Word强大多了。不管是段落格式、难搞的公式还是头疼的页眉页脚,都可以轻松解决,达到理想的排版。
10)学术翻译:CNKI翻译助手
CNKI上的例句与词汇均出于学术期刊,而且大多可以追索到对应文献原文。可以帮助搜索到一些专业术语,了解常规表达与用法,顺带着还可以看看国内外相关领域的文献。但是要注意一点的是,由于大部分例句来源国内期刊的英文摘要,所以要警惕某些语句的Chinglish的表达方式。有时候还需要用到有道或者金山翻译来辅助。
特别声明:本文转载仅仅是出于传播信息的需要,并不意味着代表本网站观点或证实其内容的真实性;如其他媒体、网站或个人从本网站转载使用,须保留本网站注明的“来源”,并自负版权等法律责任;作者如果不希望被转载或者联系转载稿费等事宜,请与我们接洽。
语言不过关被拒?美国EditSprings-专业英语润色修改服务专家帮您!
- ?
实用科研软件汇总,你开始用了吗?
董苑睐
展开
软件对科研狗的重要性不言而喻,从最基础的Microsoft Word 到最常用的统计学软件SPSS,都是我们的老朋友。今天小博给大家推荐一些科研实用软件,希望对各位老师有所帮助。
1、文献阅读软件
Mendeley:导入PDF格式的文献时,Mendeley会自动提取英文文献信息,而对于中文文献常出现无法识别的情况。Mendeley同时支持多平台同步,以后再也不怕出门看不了文献了。
Adobe Reader或福昕阅读器:传统的PDF阅读器,可用于阅读文献。
CNKI E-learning:CNKI开发的文献阅读器,可阅读CAJ格式的文献,并且可建立学习单元管理文献。
2、参考文献管理软件
Endnote:目前好评如潮的文献管理软件。常用中文数据库CNKI、万方、维普的文献,均提供Endnote格式以供引用(CBM需使用过滤器,方能使用Endnote格式)。Endnote可与Word连用,直接对论文参考文献进行编辑。对于WPS软件据说也支持,未亲测。
3、论文写作软件
Scrivener:是一个强大的写作工具,支持碎片化写作与论文模板套用,可与word连用。辅助作者完成从作品构思、搜集资料、组织结构、增删修改到排版输出的整个写作流程。
无论是结构化的论文还是信马由缰的随笔,各种写作方式都可以在 Scrivener 中找到适合的工具和功能。需收费,网络上有破解版。
Word:传统论文写作软件。
4、统计分析软件
SPSS/Stata:常用统计学软件,均需要收费,不过目前有很多破解版。
5、论文作图软件
Origin/Gpaph Prism/Adobe Photoshop:常用的论文作图与编辑软件,需收费。
6、其他软件
问卷数据录入软件:Epidada,支持导入到Excel,可限制数值避免错误。
PDF编辑软件:Adobe Acrobat,最好用的PDF编辑与格式转化软件,需收费,也有很多破解版。
微信收藏软件:为知笔记,可记录笔记并支持微信推送添加到为知笔记。
俗话说,工欲善其事必先利其器,对于科研人来说,更需要好的工具,才能事半功倍!
END
科研数据分析软件
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并