服务热线:18551854236/ 025-83360120
技术支持

野大麦叶绿体全基因组:基因组组构、密码子使用偏好性、系统发育关系和结构比较分析

发布日期:2021-12-22 浏览次数:4190

文章简介

2021年12月16日,中国农业科学院兰州畜牧医药研究所崔老师团队在《PLoS One》(Q2=3.240)发表题为“Complete chloroplast genome of Hordeum brevisubulatum: Genome organization,synonymous codon usage, phylogenetic relationships, and comparative structure analysis”的研究成果。该研究测序了野大麦叶绿体基因组,通过分析基因组特征,与大麦属其他4中叶绿体基因组比较分析,构建系统发育树研究其基因结构,基因的保守性、寻找适合的物种鉴定标记基因及系统发育关系,为遗传学分子育种奠定一定理论基础。

原文链接:https://doi.org/10.1371/journal.pone.0261196

野大麦是我国北方优良的多年生牧草,用于土壤盐分改良。叶绿体基因组是评估其基因组进化和系统发育关系的理想模型。我们测序组装了野大麦的叶绿体基因组,为遗传学和分子育种进一步研究提供了基础参考。

野大麦(Hordeum brevisubulatum)叶绿体基因组全长137,155 bp,典型的四分结构;注释了130个功能基因,CD4基因在进化过程中丢失。所有注释基因中,16个不同基因含有内含子,ycf3和rps12含有两个内含子。PR2分析五个大麦品种中,大多数基因的编码链偏向于T而非A,除H.bogdanil外其他四个大麦品种则偏向于G而非C.鉴定出52个散在重复序列,182个SSR。另外,每个物种的一些独特SSR可作为进一步研究的分子标记。与其他四种大麦相比H.brevisubulatum与H.bogdanii亲缘关系较近,基因组相对保守。此外反向重复区(IRa和IRb)与其他部分相比差异较小,编码区与非编码区相比相对保守,差异主要在SSC/IR边界

结论

本研究描述了野大麦叶绿体基因组结构,提高我们对cp生物学和遗传多样性的理解,这将促进生物研究和cp基因工程。

研究背景

    土壤盐分严重威胁着植物的生长,所以耐盐植物的培育在盐碱地的开发利用中起着至关重要的作用。野大麦广泛分布于中国北方,因是优良的多年生牧草而闻名。它具有适应性强、家畜适口性好、再生能力强等特点。野大麦也是最耐盐的小麦科植物之一,可用于生态改良土壤。野大麦在中国已经驯化近50年。相比之下,分子育种缩短了育种时间,已广泛应用于各种植物。分子育种以遗传信息为基础,有助于培育出许多高产、优质、抗逆的新品种。目前为止,对野大麦的研究比较少主要关注其生物学特性、耐盐机制和抗病性。缺少野大麦的遗传信息进而减缓不同品种的栽培速度。

     随着高通量测序技术的进步,截至2020年4月初,近22000个叶绿体(cp)基因组已被NCBI收录。叶绿体是独立DNA信息的最重要的质体和半自主细胞器,其基因组保守且相对较小。cp基因组通常在107-218KB之间,典型四分结构中编码120-130个独有基因,有一对反向重复区(IRa和IRb)。大多数高等植物中,cp基因组在基因数量、排列顺序和功能上高度保守。cp基因组信息仅从母本遗传,与核基因组相比,核苷酸替换和基因组结构重排较少。cp基因组作为揭示复杂被子植物家族中基因组进化和系统发育关系的理想模型已广泛用于基因定位、品种鉴定、植物鉴定、植物条形码序列筛选、体遗传学、基因多样性研究、分子辅助育种。

    本文通过二代测序组装注释野大麦叶绿体基因组,分析了散在重复序列和SSR,构建了系统进化树,并与其他四个大麦进行了叶绿体基因组比较分析,研究结果可为今后的其生物学研究和分子育种提供基本遗传参考。

材料和方法

植物材料

2019年从农业部黄土高原生态系统兰州科学观测和试验现场站(36’010N, 103’450E,海拔1700米)中国农业科学院兰州畜牧药学研究所采集新鲜叶片。

DNA提取、测序和组装

CTAB提取DNA,使用Illumina NovaSeq平台对文库进行测序,产生150 bp配对末端读取,获得 6.8 GB 的 clean data ,Bowtie 2 v2.2.4软件组装,获得完整的环状cp基因组序列。

Cp基因组序列的注释与分析

Prodigal (v2.6.3) 预测编码基因、Hmmer v3.1b2 预测Hmmer v3.1b2 ,Aragorn v 1.2.38预测tRNA ,通过Blast 与近源物种H.bogdanii, NC 043839.1)比较校正注释结果。OGDRAW v1.2获得基因组圈图,Perl script MISAV1.0分析SSR,Vmatch v2.3.0分析散在重复序列,Tandem Repeats Finder v. 4.09查找串联重复序列,Parity rule 2分析核苷酸使用偏倚。

系统发育分析

35个物种全基因组包括5种大麦属,构建系统发育树((GTR)+G model)。

基因组结构比较

IRscope tool可视化五个大麦属基因组连接位点边界上的基因。

结果

叶绿体基因组的特征


    全长137,155 bp,IR 区 43,174 bp,LSC 区 81,175 bp,SSC 区 12,806 bp。核苷酸组成偏向A和T, LSC, SSC, 、 IR的AT含量不同但都很丰富,为63.80%,67.91%,56.14%,61.77%。除IR 区外H单链中碱基组成不对称(AT,CG)。在H.bogdanii,H.vulgaresubsp.vulgare,H.vulgare subsp.spontaneum,H.jubatum分别发现50、50、51、51个长度大于300 bp编码序列,加上H.brevisubulatum的cds,进行PR2绘图分析进而显示数据分布在散点图中的四个象限中数值A3/(A3 T3)和G3/(G3 C3)之间的关系(Fig 2A–2E)。沿着纵坐标看五个大麦品种呈现相似的分布,大多数基因位于三、四象限。沿着横坐标,有两种类型的分布,野大麦H.vulgaresubsp.vulgare、H.vulgaresubsp.spontaneum的数量较多,H.brevisubulatum(Fig2A),H.vulgaresubsp.vulgare(Fig 2B)、H.vulgaresubsp.spontaneum(Fig2C)、H.jubatum略多的基因分布GC侧H.bogdanii同样基因的数量分布在两侧。


    野大麦共注释了130个功能基因,包括83 PCGs,39 tRNAs, 8 rRNAs,这些基因分为四类,含量占总基因数量的63.85%、 30.00%、6.15%。IR区有22个基因,包括4 个rRNAs、10 个PCGs、8个 tRNAs。基因组的基因中有16个基因含有一个内含子,其中6个tRNAs、10 个PCGs,ycf3 和 rps12 包含2个内含子。

重复序列和SSR分析

   大麦属物种基因组比较发现五类重复序列,H.jubatum的重复序列数量高、H.vulgaresubsp.vulgare 数量高,串联型、回文型和正向型是最常见的重复序列类型

H.jubatum仅有互补和反向序列。大麦属的物种串联重复数量不超过10bp,正向一半以上在30-35 bp之间,回文多达一半重复在30-35 bp之间。野大麦基因组中除了IR区,发现52个散在重复序列,包括 34个 F, 18 个P,没有F和C。已鉴定的重复序列中,35个长30-39bp,7个长40-49bp,10个的长度超过50bp,最长为157bp。LSC,SSC、 IRa 、 IRb 共有31、 2、 2、 2 种重复。LSC 、 IRa、IRb 有12个重复序列, IRa 和 IRb 有3个重复序列,大多数重复序列位于基因间区和编码区。在内含子有少数重复序列,ropC2基因有最多的重复序列。

    在野大麦中发现182 个SSR,其中发现58个独特的类型分别是19个单核苷酸、5个二核苷酸、23个三核苷酸、9个四核苷酸和1个五核苷酸,120个单核苷酸,占总SSR的66%且只有4个不含A或T; oligo A 和 oligo T分别占总SSR的29%、35%。SSR的数量和类型因物种而异,野大麦最多,H.vulgaresubsp.spontaneum 最少。A15、T14、 T16仅存在野大麦中,T21只存在H.bogdanii,TA7只在H.jubatum中,GCT3、TATT3、TTTG3 仅存在H.vulgaresubsp.spontaneum(Fig 3)。

系统发育分析

    利用已发表的31个小麦族叶绿体基因组与野大麦叶绿体基因组及作为外群的,玉米水稻、高粱构建系统发育树。分析表明大麦属与Aegilops、Triticum,Secale、Thinopyrum、Elymus、Thinopyrum、Eremopyrum亲缘关系较近,H.jubatum、H.brevisubulatu、H.bogdanii、H.vulgaresubs、vulgare、H.vulgaresubsp.spontaneum 聚成亲缘关系较近的大分支,5个大麦属物种分成2个亚族,H.vulgaresubsp.vulgare与H.vulgaresubsp.spontaneum亲缘关系近,与H.jubatum、H.brevisubulatum、H.bogdanii亲缘关系远。分组中野大麦与H.bogdanii聚集在一起。

基因组结构比较分析

    野大麦有大麦属其他基因组比较分析,其基因组、LSC 和SSC 最大,H.vulgaresubsp.vulgare的基因组、LSC 和SSC 最小。野大麦LSC 长 12,806 bp,比H.vulgaresubspvulgare、H.jubatu、H.vulgaresubsp.Spontaneum、H.bogdanii分别长105 bp、140 bp、28 bp、24 bp。野大麦与H.bogdanii、H.vulgaresubsp.vulgare、H.vulgaresubsp.spontaneum的IR长很相近,H.jubatum的较短。H.vulgaresubsp.vulgare的基因组最小,基因含量最多,比其他4个多8-10个基因,并且主要是tRNAs。五个大麦属的物种四个区的GC含量不一样,IR区含量最高。一般来说,LSC和SSC区域比IR区域发散,非编码区域比编码区域发散。

    基因组序列同源性分析表明大麦属5中物种分为3类,H.brevisubulatum与was analogical toH.bogdanii为一类,H.vulgaresubsp.vulgare与H.vulgaresubsp.Spontaneum 为一类,H.jubatum为单独一组。IGS 的trnG-GCC-trnY-GUA,psbM-petN,petN-

trnC-GCA,petA-psbI,ndhC-trnV-UAC,rbcL-pasI,、rpl23-ndhD、ccsA编码区有显著性差异,可作为系统发育研究的标记。H.brevisubulatum和H.bogdanii在IGS 的psbM-petN、petA-psbL、rpl32-trnL-UAG、ccsA-ndhD以及infA、rps3、ccsA 编码区有显著差异。大麦属的5个物种IR编辑分析,LSC/IRb的交界处有七处差异基因rps19、rpl22),IRb/SSC (ndhF、rps15、ndhH),SSC/IRa (ndhH、ndhF、rps15) IRa/LSC(rps19、psbA)。H.vulgare subsp.vulgare、H.jubatum、H.bogdanii ndhH跨 SSC/IRa 且主要在SSC 区,ndhF在 IRb/SSC 边界。H.vulgaresubsp.spontaneum的ndhH横跨IRb/SSC, SSC有975 bp,ndhF在 SSC/IRa边界。H.jubatum.的rps19在SSC区,距IRa/LSC 47 bp

讨论

    陆地植物cp基因组不仅在结构上保守,基因和内含子含量上也保守。一般来说,cp基因组是典型的四方结构,除了IR片段发散,如苜蓿的cp基因组仅包含IR区域的一个拷贝,一些藻类和针叶树没有IP区。本研究的野大麦叶绿体基因组为典型的四分结构,含有108个不同的基因,IR 区有22个基因复制。Tang等人的研究表明在禾本科植物的进化中accD、ycf1和ycf2基因的序列逐渐消失。在大麦属5种物种中,accD 基因缺失,野大麦中仅有ycf1和ycf2片段,H.vulgaresubsp.vulgare、H.jubatum,、H.bogdanii中缺失,这说明基因在进化过程中存在退化。蛋白质编码基因中的内含子缺失通常发生在单子叶植物和真双子叶植物的分支中,如Cicer arietinum、Manihot esculenta、H.vulgare,野大麦中有17个基因含有内含子。与最早分化的被子植物相比,clpP、rpoC1、rpoC2、ycf1基因的内含子缺失。内含子缺失的基因可能赋予野大麦蛋白酶、RNA 聚合酶和核糖体多种功能蛋白质。野大麦高AT含量,由于复制机制、基因定位和转录/非转录链的偏差,链组成不对称普遍存在于原核和真核染色体中。单链中A和T之间以及C和G之间的不对称性在LSC、SSC和cp基因组中很明显。PR2分析进一步证实五个大麦属中物种的,大多数基因在编码链中偏向T而非A,其他四种除了H.bogdanii,码链中对C对G有轻微的偏向。编码链和非编码链之间的不对称性是碱基不对称的主要原因,如转录诱导突变或密码子选择等是造成大部分核苷酸偏斜的原因。

分子标记

    重复序列广泛存在于植物cp基因组中,重复序列的类型、数量和位置因物种而异。大麦属5个种中,H.jubatum 散在重复序列最多,H.bogdanii 最少,H.jubatum 有四种类型,其余的有两种类型。H.brevisubulatum 有最多的串联重复,在 LSC区有52个散在重复,说明它们的分布不均匀。在野大麦叶绿体基因组中rpoC2重复序列最多,仅使用该基因构建新的系统发育树获得类似的系统发育关系。因此推断它可用作进一步研究大麦属物种的潜在分子标记。

    SSRs 在叶绿体中比较丰富,它们由一个或几个连续重复的核苷酸组成。叶绿体是母系遗传,cp基因组中的SSR对群体遗传效应非常敏感,已广泛用于追踪群体中的母体基因流以及群体进化和多态性研究。SSR的数量和类型因物种而异,在大麦属的5个物种中只有五核苷酸型,S.alba 发现2个五核苷酸型和1个六核苷酸型。野大麦叶绿体基因组中,oligo adenine 和 oligo T 占总量的64%,该结构与在S.alba、N.officinale、Raphanus sativus 结果一致。大麦属5个物种中,除H.vulgaresubsp.vulgare外,其他的都有独特的 SSRs作为区分不同物种的分子标记。因此分析SSRs和散在重复序列有一定的生物学意义。本研究研究了野大麦和大麦属其他四种物种的SSR,进一步阐明了其cp基因组特征,为研究突变热点、系统发育研究、物种划分、单倍型识别、群体遗传分析和作物育种提供了强有力证据。

系统进化和基因组结构比较

    cp基因组是研究进化的完美模型,健全的系统发育树有助于改善目标植物,促进可持续保护战略。为了验证野大麦与小麦组其他物种的关系,构建了35个物种的系统发育树,结果阐述了五种大麦属植物间的重要关系,野大麦与H.bogdanii 关系较近,H.vulgaresubsp.vulgare 与H.vulgaresubsp.spontaneum关系较近。通过分析基因组特征、序列同源性和IR边界来比较基因组结构。IR区比LSC和SSC区更保守,编码区比非编码区差异性更小。野大麦、H.vulgaresubsp.vulgare、H.jubatum,、H.bogdanii中ndhH 越过SSC/IRa边界,大麦属五种大麦的基因组大小变异主要是由IR区的变异和SSC/IRa边界的差异,IR区边界的收缩或扩张是普遍存在的,作为解释分类群之间相关性的进化指标,由于在进化过程中的IR边界和收拾,5个大麦种的rps19基因位置发生了显著变化。H.vulgaresubsp.spontaneum, ndhH基因穿过IRb/SSC边界,在SSC/IRa边界有一个推测部分。

小编总结

    本文通过测序组装注释野大麦叶绿体基因组分析它的基本特征,散在重复序列,SSR,系统发育关系。利用与其他4种大麦属物种比较分析研究它们的共有基因,特有基因及基因在进化过程中的保守性和缺失基因(clpP、rpoC1、rpoC、ycf1)。利用IR编辑的收缩扩张研究其主要收缩扩增编辑为SSC/IR以上发现结合注释的SSR,内含子、散在重复序列为进一步研究分子标记开发、系统发育分析奠定了基础。