PacBio三代全长测序揭示玉米转录组的复杂性
发布日期:2019-03-18 浏览次数:3365
研究背景:
玉米(Zea mays)是全球重要的农作物,也是研究转录组代谢通路的重要遗传模型。玉米基因组于2009年公布,后续利用EST和RNA-Seq数据进行补充注释。然而RNA-Seq中,短读长无法提供转录本全长序列,限制鉴定可变剪接形式。本文用PacBio长读长测序技术,对玉米自交系B73的六个组织(根、幼雌穗、幼雄穗、花粉、胚芽、胚乳)进行全长转录组测序分析,发现57%的转录本是新转录本。玉米基因表达比以往预期的更复杂。
研究方法:
材料:
取玉米自交系B73不同发育阶段的6个组织(根、幼雌穗、幼雄穗、花粉、胚芽、胚乳)。
研究方法:
1、提取6个组织的mRNA。根据Barcode建库方案,每种组织来源的RNAs在反转录为cDNA的时候被引入一种特定序列的Barcode,混合后通过片段化筛选,构建6种插入片段文库(<1, 1-2, 2-3, 3-5, 4-6, >5kb)。上机,用47个SMRT Cell,在PacBio RS II平台进行全长转录组测序。
2、对6个组织进行二代RNA-Seq测序,每个样品三个重复。
3、通过已发表的甲基化数据,对isoform,lncRNA 和 non-lncRNA区域进行甲基化分析。
测序策略和分析流程:
测序:PacBio Iso-Seq; Illumina HiSeq 2000、PE 101bp。
分析:比对软件:TopHat2、STAR、GMAP;拼接软件:cufflinks2、trinity
异构体与现有注释基因比对:cuffcompare;ORF预测:EMBOSS
结果:
1、PacBio和RefGen_v3异构体比较
实验发现了111151种独特的转录异构体,对应大约27000个基因。这个数量接近参考基因组注释中转录本数量的两倍。其中3%的异构体来源于全新基因位点的全新转录本。57%的异构体来自于已有的注释基因的全新转录本。

2、全基因组水平不同数据的CIRCOS可视化

A、玉米基因组的染色体组型
B、比对到RefGen_v3和PacBio数据库的基因密度比较(上圈:RefGen_v3,下圈:PacBio Iso-seq),RefGen_v3基因密度更高。
C、RefGen_v3和PacBio数据库的亚种密度比较(上圈:RefGen_v3,下圈:PacBio Iso-seq),PacBio Iso-seq密度更高。
D、CG甲基化水平
E、CHG甲基化水平
F、CHH甲基化水平
G、基因组重复密度
H、lncRNA密度(lncRNA在着丝粒区域外较丰富,且和低重复率和低CG/CHG甲基化区域有关。)
I、融合转录本的连锁(紫色:染色体内;暗黄色:染色体间)。更倾向于在染色体间发生,且倾向于在染色体末端发生。
3、组织特异性异构体和选择性剪接模式
在6个组织中,花粉的组织特异性的异构体比例更高(9842;61.3%),其次是胚芽(20050;49.2%)、胚乳(12392;46.7%)。根最低(13386;44.6%)。
用AStalavista软件分析五种主要的可变剪接类型(内含子保留、外显子跳跃、3’端可变剪接、5’端可变剪接、互斥外显子)。主要是内含子保留(40%),其次是3’端可变剪接(19%),外显子跳跃最少(7.8%)。互斥外显子剪接主要集中在胚乳。
4、lncRNA鉴定
本次分析得到了878个LncRNA,其中11个是已有研究确定的, 另外867个是新发现的LncRNA(平均读长为1.1kb)。

5、PacBio异构体的验证


A、PacBio得到的约86%剪接位点也在短读长数据比对到。
B、比较组织间的剪接类型。
C、之前报道的错误注释的RGH3基因在全长转录组序列中发现。
D、之前未发现的CSR1基因在全长转录组序列中发现。
6、剪接位点的DNA甲基化水平

A、DNA甲基化水平,结合正义链、反义链。
B、正义链的DNA甲基化水平。
C、反义链的DNA甲基化水平。
D、只有一个异构体基因的DNA甲基化水平。
E、有两个至十个异构体基因的DNA甲基化水平。
F、超过20个异构体基因的DNA甲基化水平。
亮点分析:
1、用Illumina的HiSeq 2000平台上测序重复样本的RNA,验证和量化PacBio产生的转录本isoform。对于PacBio数据,6种组织中平均86%的剪接位点获得短读长测序的支持。
2、长片段的转录组数据也帮助修复不正确的基因模型。
3、DNA甲基化似乎在isoform生成中发挥作用。选择性剪接被受体位点CHG甲基化所抑制,但被供体位点CG甲基化所促进。
参考文献:
Bo Wang, Elizabeth Tseng, Michael Regulski, Tyson A. Clark, Ting Hon, et al.
Unveiling the complexity of the maize transcriptome by single-molecule long-read sequencing.
NATURE COMMUNICATIONS. 2016, IF= 11.329
- 上一篇:桃树12种农艺性状的关联分析
- 下一篇:代谢组学分析揭示绿茶的代谢物和品质的变化

