,我们看到了基因组测序技术在花费成本和时间上的大幅减少。 在这个由三部分组成的博客中,我们将对基因组测序及其发展潜力做一个简要的介绍。 [5a2b5dr3mk.jpeg] 基因组测序简介 基因组测序就是使用化学方法和记录技术依次(按顺序)读取编码基因组的字符(A,G,C,T)。 [基因测序技术发展简史] 测序技术一直是加速发展的对象。1998年至2001年,人类进行了第一次基因组测序,以2009年的美元为标准它花费了28亿美元。 今天,基因组可以在3天内进行测序,价格大约为1000美元(更多信息,请查阅美国国立卫生研究院:国家人类基因组研究所(NHGRI)> DNA测序成本)。
宿主污染是影响非常大的因素,尤其是病毒检测,由于同一细胞内,病毒基因组与宿主基因组丰度相差太大。如果全部进行测序,很难测序到病毒的序列。 2.1 如何去除宿主污染 宏基因组测序过程中,一些样品往往会包括宿主基因组和一些抑制因子,例如复杂多糖、胆酸盐、脂类和尿酸等,这些都会对测序目标序列造成影响。 尤其是在做病毒宏基因组研究中,由于宿主细胞与微生物细胞二者基因组相差巨大 ,例如一个人细胞包含 3G 数据,而一个病毒细胞可能只有 30K,二者相差 10 万倍,这就导致测序数据中绝大部分都是来源于宿主的序列 .filter.fq.gz #统计过滤前后数变化 seqkit stat /metagenomics/data/PRJEB30781/P10.fastq.gz P10.filter.fq.gz 三、不同测序平台比较 宏基因组测序同样需要考虑不同测序平台的影响,目前主要有二代测序 illumina,华大DNBseq,三代 pacbio 平台以及纳米孔测序平台。
一代测序:桑格尔-双脱氧链终止法读长长(1000bp),准确性高,通量低通过放射性同位素标记的ddNTP,其在DNA合成过程中不能形成磷酸二酯健,可以中断反应二代测序:循环阵列合成测序法读长短,时间段, 一些名词:测序流动槽flowcell:测序反应的载体容器,一个flowcell有8个lanelane:测序反应的平行泳道,试剂添加、洗脱的位置tile:每次荧光扫描的位置,肉眼看不到双端测序:两边各测120 -150bpjunction:双端测序中间一些没有测到的区域flowcell构造:一个lane含有两列,每列有60个tile,每个tile会有不同的cluster,每个tile在一次循环中拍照4次边合成边测序流程 :构建DNA文库:利用超声将DNA分子大段,用酶补齐末端,3‘端加A碱基,再在两端加上互补配对的adapter;上样:lane上的接头应该与待测序列的接头一致;桥式PCR:序列扩增;测序:一次加一个应该 ,用完失效数据产出三代测序:单分子实时DNA测序读长较长,样本制备简单,准确率较低SMRT技术;纳米孔单分子测序技术;
编码基因预测,就是识别基因组序列上所包含的蛋白质编码区域(Coding sequence,CDS),通过在基因组序列上寻找开放阅读框(Open Reading Frame,ORF)实现。 、宏转录组的基因预测。 GeneMark与GeneMark.hmm程序都需要利用序列中核酸使用的频率矩阵作为基础,来预测序列中潜在的编码区域,这些矩阵都是物种特异的。 事实上对于de novo测序可以直接使用GeneMarkS。 基因组分析中使用了GeneMarkS预测编码基因,在宏基因组则使用MetaGeneMark。
2015年以来随着10X Genomics、Drop-seq、Micro-well、Split-seq等技术的出现,彻底降低了单细胞测序的成本门槛。 今天,我们就来说说单细胞测序的整套流程,以单细胞基因组测序为例,主要包括四个步骤: 单细胞分离→全基因组扩增→高通量测序→数据分析。 MDA是目前公认的较好的单细胞基因组扩增技术,样本无需纯化,操作简单,它能对全基因组进行高保真的均匀扩增,扩增出10~100kb大小的片段,能提供大量均一完整的全基因组序列。 ? 3 单细胞全基因组测序 全基因组测序是筛查单细胞SNP(单核苷酸多态性)及CNV(拷贝数变异)的有效手段。 在基因组中,外显子虽然只占其全长的1%,却包含了约85%疾病相关的变异位点,因此,外显子组测序也十分重要。外显子组测序只对外显子进行富集、扩增,所以其相比全基因组测序能更加高效、更利于编码序列的读取。
简介 大多数肿瘤基因组综述类文章,对于数据分析部分只是介绍了基础分析部分,也就是从原始的 fastq 文件通过质控、比对、GATK流程、Call 变异最后得到 vcf 文件和拷贝数变异的结果就结束了。 肿瘤微卫星稳定性分析 微卫星(Microsatellite),基因组中的一类短串联重复DNA序列,一般由1-6个核苷酸组成,呈串联重复排列。由于其核心重复单元重复次数差异,微卫星具有群体多态性。 最初TMB通过全外显子测序(WES)进行检测表征,其本质上认为基因突变仅限于外显子(编码区);后来也有很多文章基于特定 Panel 数据评估 TMB,或者基于 ctDNA 数据评估 bTMB等,原理都一样 肿瘤纯度和倍性评估 通常来说,对肿瘤组织进行测序,往往是一个混合样品,既包括肿瘤细胞也包括正常细胞,因此需要进行肿瘤纯度 purity 的评估。 当从混合样品中提取 DNA 进行测序后,得到的也是一个混合样品的结果。肿瘤不一定是单纯的二倍体了,其本身异质性高,直接分析拷贝数变异,得到的结果并不准确,评估肿瘤倍性 ploidy 也更加必要。
一、案例介绍 1.1 案例介绍 该文章中对 20 个细菌基因组进行测序,每个样本分别进行了 illumina,pacbio 以及 nanopore测序。比较三种数据的拼接结果。 通常只要给软件输入测序的数据,即可拼接出很好的全基因组。 影响基因组拼接的因素很多,包括内在因素来自基因组本身的重复序列,多倍体杂合,还包括外在因素测序错误,测序饱和度等。 1、重复序列是基因组拼接最大的影响因素。 测序准确率越高,选择大 kmer 越好,测序错误率越低,选择小 kmer越好。但实际上还需要综合考虑基因组本身特点,重复率,测序深度等因素,都会对 kmer取值造成一定影响。 如果发现测序拼接得到的基因组中有污染,很难通过生物信息的方法完全进行拆分,建议重新取样测序。 写在最后:有时间我们会努力更新的。
由于基因组本身具有的高度重复序列,多倍体杂合位点,低复杂度区域以及测序错误等诸多条件的影响,基因组拼接一直是一项非常复杂且困难的工作。 尤其是基因组重复序列的影响,一直是二代短读长测序最难解决的问题,尽管后来基于二代测序数据开发除了一些辅助拼接方案,例如大片段文库,Optical mapping光学图谱,三位基因组等辅助方案,都无法彻底解决基因组拼接难题 纳米孔测序的宏基因组拼接,由于测序长度更长,可以直接拼接出一些细菌完整的基因组序列,而这些细菌往往无法通过传统纯培养的方法获得,这为获得无法纯培养样品得到完整基因组序列提供了新思路。 影响基因组拼接的因素很多,包括内在因素来自基因组本身的重复序列,多倍体杂合,还包括外在因素测序错误,测序饱和度等。 三、二代模拟数据宏基因组拼接 3.1 混合模拟数据 人为添加 10 种微生物,其中包括 8 株细菌,两株真菌。
#TCGA]] 但是除了 TCGA 之外,还有很多公共的有组织的大型测序数据集。 其中就包括了,我们之前介绍的 [[MSKCC-肿瘤相关基因组检测公共数据库介绍]] 的数据。 和 TCGA 不同的是,目前的 GENIE 主要包括的还是基因组测序的数据。 里面包括了 1-10 版本中间各个版本的数据。具体的下载网址是:https://www.synapse.org/#!Synapse:syn7222066/wiki/405659 。 但是也由于这个数据集主要还是分析基因肿瘤基因组的变化,另外相对应的临床信息也少一些。所以基本的一些研究也是集中于肿瘤特征性的突变研究上。 其他数据集介绍 测序数据集 [[Met500-肿瘤转移数据集介绍]] [[MSKCC-肿瘤相关基因组检测公共数据库介绍]] [[ENCODE-转录调控必知数据库]] 流调数据集 [[HINTS-美国健康信息趋势调查数据集
有些同学就比较好奇,既然叫做二代测序,那就是还有一代测序喽?当然了,接下来我就一代测序与二代测序原理的差别简单梳理一下,这样你就知道长江后浪推前浪,一代更比一代强。 一代测序 第一代测序是由生物化学家桑格(Frederick Sanger)发明的,因此被称为桑格法测序,也被称为“双脱氧测序”。为什么称为“双脱氧测序”呢,这主要是基于它的测序原理。 二代测序 第二代高通量测序也称为下一代测序技术,相比于第一代测序通量更高、速度更快、成本更低,主要有样本制备、文库构建、测序反应等过程。 下面正式开始建库: 1、 首先把基因组DNA用超声波打断; 2、 打断之后会出现末端不平整的情况,所以我们先要将它补齐成平末端; 3、 补平之后要在3’端使用klenow酶加上一个特异性碱基A; 4、 然后从互补链上开始进行“read2”的测序,测序原理同“read1”测序原理相同。
在前面的直播基因组系列,我们讲解过那些比对不少我们人类的参考基因组序列的数据,其实可以细致的进行探究。 直播】我的基因组(十五):提取未比对的测序数据 这里主要参考这篇文章的图4:http://www.nature.com/ng/journal/v42/n11/figtab/ng.691F4.html 使用 step1:提取比对失败的reads samtools view -f4 jmzeng_recal.bam |perl -alne '{print "\@$F[0]\n$F[9]\n+\n$F[10 Length Distribution Mean sequence length: 164.95 ± 204.44 bp Minimum length: 63 bp Maximum length: 10,187 bp Length range: 10,125 bp Mode length: 150 bp with 16,461 sequences 然后用RNA-SEQ数据来比对验证!
Petersburg Academic University 与美国科学家合作开发的主要应用于小型基因组如细菌,真菌等基因组测序数据的拼接软件。 目前的最新版本 v3.6.2 可以支持常见的 illumina miseq/hiseq 和 ion torrent 测序数据,对单分子测序平台的 pacbio 和 nanopore 的测序数据也能进行拼装 -it --rm -v `pwd`:/spades quay.io/biocontainers/spades:3.12.0--1 bash # 运行一下测试 spades.py --test 拼装基因组
广义宏基因组:泛指研究微生物组的学科—宏基因组学(Metagenomics),狭义仅指宏基因组测,区别于扩增子测序与宏转录组测序,主要分析样品物种组成与功能基因。 2009 年:pacbio 测序仪发布,测序读长增长到 10K 以上。 2010 年:EMP 地球微生物组计划。 七、宏基因组测序与扩增子测序比较 当前宏基因组研究主要包括扩增子测序,宏基因组测序以及宏转录组测序等技术方法。科研人员在进行微生物学研究中经常不知道该选择哪种合适的方法。 16S 测序可以得到物种组成和丰度信息,而宏基因组测序可以得到基因组的序列,可以进行下一步基因组成和功能的分析,如果关注样品中基因表达情况在,则选择宏转录组测序。 宏基因组三种测序技术比较 扩增子测序 宏基因组 宏转录组 研究对象 16S/18S/ITS 等扩增产物 全部 DNA 全部 mRNA 是否需要PCR扩增 需要 不需要 需要 资金成本 较低 较高 较高
人类基因组36bp唯一比对区域大约只占了人基因组大小的71%,因为二代测序短读长的特性,很多非唯一比对区域的特异性不是很好,在这些区域内的变异,不论是点突变还是CNV/SV,其可靠性都不是很高 Encode有一个project,对基因组上的 各种不同长度序列的比对唯一性做了评估。 因为二代测序基本全是基于PCR的测序技术,这些区域本身测序的质量也会差,比对率会降低。在call CNV的时候尤其需要考虑GC校正。 对于WES的CNV分析,本人最近计算了常规的几个WES的靶向区域的平均unique mappability score,并对(做了GC校正后)分析出来的基因组上的log2Ratio的分布做了可视化,将低
肠道微生物的检测方法主要有16S扩增子测序、QPCR、芯片、宏基因组和宏转录组。 1.QPCR(荧光定量pcr) QPCR技术自发明以来像一棵常青树,医院的核酸诊断产品仍以此为主。 检测方法是测16SV4区域,测序深度号称10万(应该是测10万reads的意思),据说采用人工智能技术来预测疾病易感等情况。 4.宏转录组 在微信搜索找到一条投资信息,一个公众号宣传一个名为VE的美国公司,采用宏转录组技术检测肠道微生物,有宏基因组技术的优点,而且忽略90%的管家基因,节约测序成本,潜力巨大的感觉。 检测前会对样品所有DNA(包括人的)全基因组等温扩增,检测限是1000基因组拷贝(2-7pg细菌DNA+10ng人DNA)。 16S扩增子测序 一百到几百元 √一般检测到属 √ √ 相比宏基因组和转录组,信息不够全面,只能预测基因代谢情况 宏基因组 一两千元 √到种 √ √ 成本偏高 宏转录组 几百元 √到种 √ √ 建库可能较复杂
什么是基因组? 基因组是生物体的一套完整的遗传信息。基因组包括创造和维持生命的所有遗传指令和繁殖指令。人类基因组和其他细胞生命形式一样由DNA组成,包括核DNA和线粒体DNA。 药物基因组学是精确医学的一个组成部分。通过结合药理学和基因组学,药物基因组学研究特定药物对一个人的基因组指纹的影响。 全基因组测序是什么? NCI将人类全基因组测序定义为:一种被用于确定个体完整DNA序列(包括非编码序列)中的几乎全部近30亿核苷酸的的实验室方法。该模块的重点是人类的全基因组测序。 全基因组测序原本通过Sanger测序来测序人类基因,这花费了十多年的时间和十多亿美元。现在,我们运用被称为“次代测序”、“大规模平行测序”和“高通量测序”的新技术。 这些新技术较传统Sanger测序可以更快更低廉地对DNA、RNA进行测序,通常大约花费几天和一千美元。参阅《肿瘤组织病理学评估》中的“肿瘤学中的常用病理学检查”一节以获取该技术的更多细节。
一、mock 数据集 人为添加 10 种微生物,其中包括 8 株细菌,两株真菌。分为两种模式,一种按比例平均分配,称为 Even 数据集,8 株细菌各占 8%,2 株真菌各占 4%。 三、centrifuge 物种鉴定 centrifuge 的使用非常简单,输入数据包含测序的数据以及索引文件。 可支持二代和三代测序数据,输入为 fastq 格式文件即可,也支持 fasta 格式以及原始 qseq 格式文件,同时支持pairend 数据,也支持压缩格式。其中索引只写前缀名即可。 centrifuge_report.tsv 1、比对上物种名字,如果鉴定不到种,则上升一级; 2、物种分类 ID; 3、物种分类层级 rank; 4、对应基因组大小 ; 5、比对到的 reads 数目,包括多重比对的结果; 6、唯一比对上的 reads 数目; 7、比对的丰度,比对上区域/基因组长度。
10X genomics单细胞VDJ测序是一种全面的研究免疫组库的方法,能够在单细胞基础上对数百个至数万个人或小鼠的T细胞和B细胞中适应性免疫反应的细胞背景和免疫组库进行同时分析。 之后会用酶进行酶切,得到不同长度的文库,然后末端修复,连上一个A,连接illumina的测序接头就可以上机测序了。 ? 下面是最终上机测序的VDJ文库和mRNA文库 ? 具体包括Illumina P5接头,P5测序引物,16bp Barcode,10bp UMI,13bp Template Switch oligo(TSO)序列,插入cDNA片段,P7测序引物,样本Index 通过建库,PCR扩增,上机测序等步骤,10X系统完成了对样本中存在的VDJ基因重排信息的捕捉,以便查看样本的BCR或TCR丰度和多样性。 如何获取全长VDJ序列 10X VDJ测序可以得到VDJ的全长序列,而VDJ的全长序列一般有~650bp,那么是如何通过2X150bp的reads来实现的呢?
宏病毒组,是一个即要测序宏基因组,又在测序宏转录组的学科,因为病毒有DNA病毒,也有RNA病毒。 在mRNA层面,我们研究的就是宏转录组,这与之前经常用到的转录组技术是类似的,其研究对象中的所有转录的mRNA 此外还有蛋白层面的宏蛋白组和代谢物层面的宏代谢组,他们通常也是之前研究结果的补充,而采用的设备也不同于二代测序 ——有哪些种类的DNA/RNA病毒 宏蛋白组——哪些基因翻译成了蛋白 宏代谢组——有哪些种类的代谢产物 宏表观组——DNA/RNA上那些奇怪的修饰 单菌基因组——某个菌株都有什么基因 泛基因组——某种菌和亲戚间的相同与不同 ;或添加PhiX序列增加测序反应中的多样性 3-10万个。 微生物组技术:扩增子、宏基因组、宏转录组、宏蛋白组、宏代谢组 实验基本思路:取样—提DNA—第一轮PCR—第二轮PCR—测序 分析基本思路:质控—挑选代表序列OTU/ASV—物种注释—生成Feature
研究方法: 病人和样本:116名计划接受系统性姑息治疗的mUC患者的新鲜转移肿瘤活检样本 测序策略:116名患者进行了全基因测序 WGS ,90名患者进行了 RNA测序。 数据处理流程:对于WGS ,测序读长是 2*150,数据处理流程是按 Nature 上泛癌全基因组文章的方法来 Pan-cancer whole-genome analyses of metastatic 显着突变的基因与原发性 UC 中报道的相似,但与基因组亚型不对应。 研究者整合了基因组和转录组数据,为每个转录组亚型和个体患者提出了潜在的治疗选择。 研究结论: 该研究首次基于对116名mUC患者的转移活检样本的全基因组和转录组分析,并且分别定义了mUC的分子亚型。