如何通过全长转录组发表NC、PBJ文章?来看看神奇操作
发布日期:2020-08-17 浏览次数:5619
三代全长转录组在动植物转录本水平研究优势越来越明显,相较于二代测序技术的局限,其超长读长优势,无需组装,直接得到全长基因序列,避免了二代测序数据的拼接错误,在基因结构方面的研究有着无可比拟的优势:像剪接异构体、可变多聚腺苷酸化、基因融合研究;另外还有非编码RNA和基因家族等等。
如何发表一篇高质量全长转录组文章值得我们不断探索。下面小编就给大家梳理剖析一下,咱们用事(案)实(例)说话。
1.构建参考转录本,完善功能基因的注释
现下统计已发表三代测序文章发现,增加的新基因数量在10%以上,而新增转录本的数量则更多,达到45%以上。这说明我们之前使用的参考基因组缺失及未注释大部分转录本和部分基因,从而解释了通过二代测序为什么无法对转录本进行精确定量。
全长转录组测序鉴定得到的全长非冗余转录本,通过与基因组注释的比较分析,筛选新基因、新转录本,统计相关类型和数目。基于这些数据,对基因组注释进行补充和更新,大大提升对重要的功能基因注释。如2019年发表的小麦研究中,研究者发现利用全长转录组测序鉴定得到98,992个非冗余的转录本,其中新基因鉴定到4947个(9.67%),新转录本鉴定到 63358个。
2.lncRNA预测
lncRNA是长度大于200个核苷酸的非编码RNA,在剂量补偿效应、表观遗传调控、细胞周期调控和细胞分化调控等众多生命活动中发挥重要作用。 二代测序Illumina平台有读长的限制(PE150),虽然对定量分析没有影响,但却无法组装成全长序列,而三代超长读长(平均读长10-15K,最长读长80K),可一次将真核生物的全长转录本信息读取完整。如果想要继续研究lncRNA的下游功能,获取其全长序列是必须的,所以想系统研究lncRNA功能,必须选择三代测序。
在甘蓝型油菜(2020)中鉴定到20个已知lncRNA,529个新lncRNA,平均长度1.7 kb,lncRNA具有明显组织特异性。在两个亚基因组中的同源基因分别产生了54和53个lncRNA,结果表明两个亚基因组的贡献是相等的。
3.融合基因分析
融合基因的研究,传统的实验方法或二代高通量测序方法很难鉴定融合基因,三代测序获得的全长转录本能有效地鉴定出融合基因,并通过GO注释初步分析融合基因的功能。还可进一步分析统计发生融合事件的类型和特征,进行可视化展示,如染色体之间的融合基因数目和染色体内部的融合基因数目。对于感兴趣的融合基因,可用RT-PCR或Sanger测序进行实验验证。
4.多聚腺苷酸化(APA)分析
分析鉴定含有poly A位点的基因数目,且依据polyA的数目和位置进行分类和统计来研究APA调控与基因表达之间的关系。。Abdel-Ghany等(2016)对高粱全长转录组分析,发现14550个表达的基因中11013个基因有至少一个polyA位点,其中7700个基因的转录本包含2个及以上多聚腺苷酸化位点,其中,3%在编码区的3’UTR。在另一篇毛竹研究中发现了参与次生生长相关的一些基因(CESA和Csl),其表达受到APA调控。这说明APA可能参与调控细胞壁结构和次生细胞壁的形成。
5.重要基因可变剪切分析
基于三代转录组测序获得的转录本信息,进行可变剪切分析,通常可鉴定得到更多的可变剪切事件和发现更多的可变剪切isoform。在杨树(2019)研究:所有可变剪切事件中,内含子保留(IR)占主导地位,占可变剪切转录本的58.15%~64.2%,与先前注释的转录本相比,在Iso-Seq转录本中发现了更多的可变剪切转录本。在大鼠(2019)海马体组织研究中将全长转录本与参考序列进行比较,约93%的基因位点还存在至少一个新AS事件,61%存在多种新AS事件,未被完全注释。按不同的AS事件类型进行分类,发现转录本5'与3'首尾末端的选择性事件趋于同时发生,类似的,剪接供体和受体位点的选择也趋于同时发生。
6.Nanopore数据定量和差异分析
基于Nanopore测序技术的全长转录组数据,可以对基因或转录本进行定量和差异分析。Byrne等(2017)比较了相同细胞的Illumina和ONT(Oxford Nanopore) RNA-seq基因表达定量结果,二者间具有较高相关性,证实ONT RNAseq方法可进行基因表达定量。进一步比较不同细胞中的Illumina和ONT RNAseq基因表达定量数据显示,ONT RNA-seq可以鉴定不同细胞间表达差异。该研究还通过利用内参对照Spike-in RNA,评估了ONT RNA-seq数据可用于对转录本和isoform进行表达定量。
7.结合二代数据进行转录本差异表达分析
传统的二代转录组数据通常是对基因进行定量,并进行差异表达基因分析。目前,基于全长转录组获得的全长转录本信息,可利用二代转录组数据对转录本进行定量,从转录本水平进行差异表达分析。通过这样的isoforms差异表达量分析结果,结合我们的功能注释分析,就可以找到和研究相关的一些基因了。更加丰富了文章的数据结果,对于转录本表达量的分析也更加准确。
8.重要基因家族分析
对于某些和表型密切相关的重要基因,基于三代转录组测序获得的较完整和较准确的转录本信息,筛选和鉴定同源基因。并提取该基因家族各成员的转录本和氨基酸序列、表达量数据,进行序列结构、保守motif、基因富集、构建系统进化树、表达模式和功能注释等分析。
集思慧远拥有丰富的三代测序项目经验,可以为您提供全面的三代测序研究服务,数据丰富不划水,满足您的需求!助力文章发表!感兴趣的老师同学可以联系我们:025-85381280
参考文献:
【1】Wang B, Tseng E,Regulski M, et al. Unveiling the complexity of the maize transcriptome bysingle-molecule long-read sequencing[J]. Nature communications,2016, 7: 11708.
【2】Chao Q, Gao Z F,Zhang D,et al. The developmental dynamics of the Populus stem transcriptome[J].Plant biotechnology journal, 2019, 17(1): 206-219.
【3】Wang X, You X, et al. Full-length transcriptome reconstruction reveals a large diversity of RNA and protein isoforms in rat hippocampus. Nature Communications, 2019,10:5009 .
【4】A global survey of the transcriptome of the allopolyploid Brassica napus based on single molecule long-read isoform sequencing and Illumina-based RNA-seq data.Plant Journal,2020.
【5】Abdel-Ghany S E,Hamilton M, Jacobi J L, et al. A survey of the sorghum transcriptome usingsingle-molecule long reads[J]. Nature communications, 2016, 7: 11706.

