服务热线:18551854236/ 025-83360120
技术支持

PacBio三代全长测序揭示玉米转录组的复杂性

发布日期:2019-03-18 浏览次数:3365

  研究背景:

  玉米(Zea mays)是全球重要的农作物,也是研究转录组代谢通路的重要遗传模型。玉米基因组于2009年公布,后续利用EST和RNA-Seq数据进行补充注释。然而RNA-Seq中,短读长无法提供转录本全长序列,限制鉴定可变剪接形式。本文用PacBio长读长测序技术,对玉米自交系B73的六个组织(根、幼雌穗、幼雄穗、花粉、胚芽、胚乳)进行全长转录组测序分析,发现57%的转录本是新转录本。玉米基因表达比以往预期的更复杂。


  研究方法:

  材料:

  取玉米自交系B73不同发育阶段的6个组织(根、幼雌穗、幼雄穗、花粉、胚芽、胚乳)。

  研究方法:

  1、提取6个组织的mRNA。根据Barcode建库方案,每种组织来源的RNAs在反转录为cDNA的时候被引入一种特定序列的Barcode,混合后通过片段化筛选,构建6种插入片段文库(<1, 1-2, 2-3, 3-5, 4-6, >5kb)。上机,用47个SMRT Cell,在PacBio RS II平台进行全长转录组测序。

  2、对6个组织进行二代RNA-Seq测序,每个样品三个重复。

  3、通过已发表的甲基化数据,对isoform,lncRNA 和 non-lncRNA区域进行甲基化分析。

  测序策略和分析流程:

  测序:PacBio Iso-Seq; Illumina HiSeq 2000、PE 101bp。

  分析:比对软件:TopHat2、STAR、GMAP;拼接软件:cufflinks2、trinity

  异构体与现有注释基因比对:cuffcompare;ORF预测:EMBOSS

  结果:

  1、PacBio和RefGen_v3异构体比较

  实验发现了111151种独特的转录异构体,对应大约27000个基因。这个数量接近参考基因组注释中转录本数量的两倍。其中3%的异构体来源于全新基因位点的全新转录本。57%的异构体来自于已有的注释基因的全新转录本。

  



 2、全基因组水平不同数据的CIRCOS可视化

  


  A、玉米基因组的染色体组型

  B、比对到RefGen_v3和PacBio数据库的基因密度比较(上圈:RefGen_v3,下圈:PacBio Iso-seq),RefGen_v3基因密度更高。

  C、RefGen_v3和PacBio数据库的亚种密度比较(上圈:RefGen_v3,下圈:PacBio Iso-seq),PacBio Iso-seq密度更高。

  D、CG甲基化水平

  E、CHG甲基化水平

  F、CHH甲基化水平

  G、基因组重复密度

  H、lncRNA密度(lncRNA在着丝粒区域外较丰富,且和低重复率和低CG/CHG甲基化区域有关。)

  I、融合转录本的连锁(紫色:染色体内;暗黄色:染色体间)。更倾向于在染色体间发生,且倾向于在染色体末端发生。


  3、组织特异性异构体和选择性剪接模式

  在6个组织中,花粉的组织特异性的异构体比例更高(9842;61.3%),其次是胚芽(20050;49.2%)、胚乳(12392;46.7%)。根最低(13386;44.6%)。

  用AStalavista软件分析五种主要的可变剪接类型(内含子保留、外显子跳跃、3’端可变剪接、5’端可变剪接、互斥外显子)。主要是内含子保留(40%),其次是3’端可变剪接(19%),外显子跳跃最少(7.8%)。互斥外显子剪接主要集中在胚乳。


  

  4、lncRNA鉴定

  本次分析得到了878个LncRNA,其中11个是已有研究确定的, 另外867个是新发现的LncRNA(平均读长为1.1kb)。



 5、PacBio异构体的验证




  A、PacBio得到的约86%剪接位点也在短读长数据比对到。

  B、比较组织间的剪接类型。

  C、之前报道的错误注释的RGH3基因在全长转录组序列中发现。

  D、之前未发现的CSR1基因在全长转录组序列中发现。


  6、剪接位点的DNA甲基化水平



  A、DNA甲基化水平,结合正义链、反义链。

  B、正义链的DNA甲基化水平。

  C、反义链的DNA甲基化水平。

  D、只有一个异构体基因的DNA甲基化水平。

  E、有两个至十个异构体基因的DNA甲基化水平。

  F、超过20个异构体基因的DNA甲基化水平。


  亮点分析:

  1、用Illumina的HiSeq 2000平台上测序重复样本的RNA,验证和量化PacBio产生的转录本isoform。对于PacBio数据,6种组织中平均86%的剪接位点获得短读长测序的支持。

  2、长片段的转录组数据也帮助修复不正确的基因模型。

  3、DNA甲基化似乎在isoform生成中发挥作用。选择性剪接被受体位点CHG甲基化所抑制,但被供体位点CG甲基化所促进。


  参考文献:

  Bo Wang, Elizabeth Tseng, Michael Regulski, Tyson A. Clark, Ting Hon, et al.

  Unveiling the complexity of the maize transcriptome by single-molecule long-read sequencing.

  NATURE COMMUNICATIONS. 2016, IF= 11.329