客户文章丨重测序数据组装注释不同梅子叶绿体基因组揭示种质群体遗传结构
发布日期:2022-08-11 浏览次数:4221
在这给您推荐一个数据再利用的发文章思路:利用重测序研究项目的数据组装注释叶绿体基因组研究种质群体的遗传结构及特征分析。分析其种质群体的基因组特征、分析开发SSR 寻找分子标记、物种系统发育、群体遗传多样性。
目前叶绿体基因组组装大部分都是测序该物种的全基因组数据,然后进行数据质控过滤筛选叶绿体基因组“reads”,获取后对reads进行组装注释分析。
通常数据量一般达到5G左右完全可以组装出完成的叶绿体基因组。根据我司的组装技术和组装经验,如果您重测序的数据达到3G /样以上就可以组装出来完整的叶绿体基因组圈图。
下面给大家分享一篇我们的客户文章。
导读
梅子营养丰富,含有多种生物活性物质和有机酸,具有调节肠胃促进消化的功能,被誉为健康食品。梅子为蔷薇科李属落叶树,原产于中国西南部,在东亚和日本广泛栽培。在中国南方的许多偏远山区,仍有野生日本梅子群落处于自然状态。近年来,学者们在中国川黔滇藏交界的横断山脉和云贵高原对该物种进行调查研究,发现这些地区是梅子的自然分布中心,也是梅子发生自然变异的主要地方,是梅子遗传多样性的中心。野生日本梅子分布在中国各地:长江流域、珠江流域、中国西南部和台湾,自然分布范围内呈现整体连续性和局部不连续格局。
然而,它在不同地区的遗传关系和多样性尚未明确。叶绿体基因组遵循母体单性遗传的方式复制和传递基因组信息,核苷酸置换率适中,基本为单拷贝基因组,可以最大程度保证种群遗传不受附带基因干扰。
叶绿体基因组编码区片段的核苷酸替换率较低且速度较慢,因此常用于比较较高的类群(科和属水平)。相比之下,非编码区替代率高,进化速度快,适合比较较低的类群(种间或亚种)分类。叶绿体基因组编码区片段的核苷酸替换率低且慢,因此常用于比较较高的类群(科和属水平)。
因此,在植物地理起源和进化研究中,叶绿体基因组作为研究遗传关系、基因流动和遗传情况的重要基因组,是高等植物比较基因组学系统发育的重要数据来源。本研究的主要目的是对146个不同种质居群的梅子资源的cp基因组进行测序,从基因组结构、基因数量和功能、重复序列和核苷酸变异等方面进行比较分析。同时,利用146个cp基因组序列的SNP分子标记,探讨不同地理分布梅子资源间的遗传关系和遗传多样性,为梅子的起源和进化提供一定的参考。
论文ID
原名:The analysis of genetic structure and characteristics of the chloroplast genome in different Japanese apricot germplasm populations
译名:不同梅子种质群体叶绿体基因组 遗传结构及特征分析
期刊:BMC Plant Biolog
IF:5.26
发表时间:2022.7
通讯作者:高志红
通讯作者单位:南京农业大学
DOI:10.1186/s12870-022-03731-5
期刊:BMC Plant Biolog
实验设计
技术方法:
利用梅子群体研究的重测序数据组装注释叶绿体基因组实验路线图
实验路线图
结果
146个cp基因组的大小从157,886-158,167 bp不等,都是典型的四分体环状结构:一对反向重复区域(26391 ~ 26395 bp)、小单拷贝区(18992 ~ 19049 bp)、大单拷贝区(86084 ~ 86379 bp)。各cp基因组平均GC含量为36.74%,最高36.75%,最低36.72%。不同区域GC含量存在差异,LSC区为34.53 ~ 34.58%,SSC区为30.22 ~ 30.42%,IR区为42.56 ~ 42.58%。
不同类群叶绿体基因组的长度和GC含量存在一定差异,野生组基因组长为157,886 ~ 158,167, LSC区86,064 ~ 86,379,SSC区18,992 ~ 19,049,IR区26,391 ~ 26,395;GC总含量36.72 ~ 36.75,LSC区34.53 ~ 34.58,SSC区30.32 ~ 30.42,IR区42.56 ~ 42.58。驯化群长157,894 ~ 158,150, LSC区长86107 ~ 86348,SSC区长18,997 ~ 19,049,IR区长26,391 ~ 26,395;总GC含量为36.72 ~ 36.75,LSC34.55 ~ 34.58,SSC30.32 ~ 30.39,IR区42.56 ~ 42.57。繁殖组长157,902 ~ 157,918,LSC区长86114 ~ 86125,SSC区长18,997 ~ 19,020,IR区长26,391;总GC含量36.74,LSC区34.56 ~ 34.58,SSC区30.36 ~ 30.38,IR区42.56 ~ 42.57。
146个叶绿体基因组编码的基因数量相同,共编码130个基因,其中112个是独有的:78个CDS,4个rRNA,30个tRNA。10个CDS各含有1个内含子,6个tRNA有1个内含子,clpP、ycf3有2个内含子。
特别的是rps12是反式剪接,LSC区有5′端外显子,IR区有3′端外显子和内含子。此外所有cp基因组中都存在一个假基因(rps19)。基因按功能分为三类,光合作用有关的有43个独特基因;与cp自动转录和翻译有关的有59个独特基因;10个独特基因主要涉及其他生物合成基因和功能未知的ORF。
叶绿体基因组的重复结构和SSR分析

检测到6种SSR,其中单核苷酸最占优势;六种类型的 SSR中单核苷酸重复是 cp 基因组中最主要类型。所有样本中单核苷酸重复数量下降到四个组:5% 的样本包含 156 次重复,46% 的样本包含 157 个重复,48% 样本包含 158 个重复,1%样本包含 159 个重复。
所有样本中有两种类型的二核苷酸重复序列,99%的样本中有13个重复序列,其余1%的样本中有14个重复序列。三核苷酸重复序列有4种类型:1%的样本中有65个重复,2%的样本中有66个重复,94%的样本中有67个重复,3%的样本中有68个重复。
所有样本均有7个t -核苷酸重复序列。五核苷酸重复有3种类型:3%的样本包含1次重复,12%的样本包含2次重复,85%的样本包含3次重复。六核苷酸重复序列是最不常见的重复类型;含重复序列的样品98%含有1次重复,2%含有2次重复。
所有样本中发现30 bp以上的重复序列以及不同形式的重复序列,如正向、反向和回文,还包括18种不同长度的重复序列。
长度为30 bp的重复最常见,占总重复序列的18.44%;正向占5.16%,回文占13.20%,反向占0.08%。每个样本最多有4个长为30 bp的正向7个正向5个回文;31 bp的重复序列占总重复序列的17.30%,每个样本的最多2个正向,6个回文,1个反向;32 bp的重复占总重复的12.13%,每个样本中有5个正向,2个回文。33 bp重复序列占总重复的13.08%,每个样本最多有5个正向3个回文1个反向;34 bp的重复占总重复的10.17%,最多3个正向,2个回文;35 bp的重复占总重复的4.62%,每个样本最多有2个正向和回文。38 bp占总重复的7.50%,最多正向1个,回文2个。39 bp的占总重复的5.03%,每个样本最多2个正向1个回文。40 bp的重复占总重复7.49%,每个样本最多有2个正向1个回文。41、43、45和56 bp的重复序列仅为正向,分别占总重复序列的0.034、0.44、0.428和0.44%。53 bp的占总重复序列的2.50%。55 bp的仅为回文,占总的0.40%。
叶绿体基因组比较分析

分析了桃树和梅子中KA/KS在所有蛋白编码基因中的替代率,大多数梅子中,ndhI、ccsA、ndhF、rpl22、rbcL、matK和rpoC2基因的KA/KS比例最高。ndhI、ccsA和ndhF基因的值大多大于1,受正向选择。
分析不同地理位置的野生样本中的这些基因,显示大多数野生样品中ndhF基因KA/KS值大于1。
ndhI和ccsA基因的KA/KS值与地理位置有关。ccsA基因在贵州、浙江、福建广东的KA/KS值大于1,而在西藏和云南的KA/KS值小于1。
对146个cp基因组的编码区基因进行核苷酸变异分析,发现42个不同蛋白编码基因存在核苷酸多样性,高核苷酸多样性主要分布在LSC区,而非SSC和IR区。rpl33、psbI、rpl32、rps16-CDS2、rpoC1-CDS1、petD-CDS2、ndhD、ycf1和rps11基因的π值最高;rps33的核苷酸变异性最高。分析了146个cp基因组中所有基因组间区域的核苷酸变异,发现52个基因组间具有核苷酸多样性。与编码区相比,基因间区域的核苷酸多样性较高,其中rps19-psbA、rps3rpl22、ccsA-ndhD、psbhh - petb、rpl14-rpl16、psaJ-rpl33、rpl32-ccsA、matK-rps16和ndhI-ndhA π值最高,rps19-psbA的核苷酸多样性最高。
146个梅子叶绿体基因组的密码子偏好性分析。所有蛋白质编码基因均由 22,722 个22,731 个密码子,AUU 编码的异亮氨酸是最常用的氨基酸使用频率为 977 次。GUG 和 UUG 编码的蛋氨酸是最不常见的氨基酸。梅子中发现AUG编码的蛋氨酸的RSCU值最高,UUG编码的RSCU值最低,约为0.0057。
叶绿体基因组群体结构与系统发育树分析
PCA显示,PCA1、PCA2和PCA3分别占变异量的52.49、22.49和10.83%。类群中西藏、贵州毕节、云南野生材料为近缘类群,贵州荔波野生材料为单一类群。日本、广东、台湾、浙江样品组成一个近缘群,福建野生样品组成了一个近缘群。系统发育树结果显示,146份种质资源被划分为5个分支。A分支由西藏、贵州毕节、云南野生样品、江苏驯化品种组成。B分支包括福建野生种质、1个四川家养品种。C分支包括贵州和广东的野生品种、部分日本育成品种、福建和四川的驯化品种。D分支包括贵州野生品种荔波、湖南、贵州、云南的部分驯化品种。E分支包含台湾、浙江和广东、福建和浙江野生种质的驯化品种以及大部分育成品种。
种群结构分析表明,K=4时贵州、云南、西藏毕节野生种质和江苏驯化品种为第一类;福建野生品种和四川驯化品种为第2类别;第三类是广东、荔波、福建野生品种、福建、四川驯化品种和日本育成品种;荔波、福建、浙江的野生品种,台湾、广东、浙江、云南、贵州和湖南的驯化品种以及日本育种品种构成第四大类别。当K=5时,第4类形成了两类新类别:荔波野生品种与云南、贵州驯化品种合二为一,另一类是福建、浙江的野生品种,台湾、浙江、广东、湖南等地的驯化品种和日本育成品种。当K=6时,第五类别形成了两个新的类别:福建野生种为一类,浙江野生种,台湾、浙江、广东、湖南等地驯化品种和日本育成品种为另一类。结果发现当K=5时,将群体祖先种质遗传组成划分为5类的模型最能反映146份材料的群体遗传结构,这与主成分分析和系统发育树结果一致。
不同种质群体的遗传多样性及单倍型分析
为验证snp的准确性随机选取了一些序列进行PCR验证,结果检测的snp是可靠的。不同组的snp主要分布在LSC和SSC区域;IR区相对保守,未检测到SNP。每组LSC区的snp占总snp的70%以上。全基因组水平上,育种材料中有46个snp,占全部snp的14.15%,驯化材料中有196个snp,占全部snp的60.31%,野生材料中有303个snp,占全部snp的93.23%。基因区,18个SNPs占育种材料的13.63%,69个SNPs占驯化材料的52.27%,128个SNPs占野生材料的96.97%。
野生资源组中snp最多,说明野生资源具有高度多样化的基因库,是有价值的遗传改良资源。146个cp基因组中π值对应的总核苷酸多样性为0.2981 × 10−3;野生组π值为0.3250 × 10−3,而选育和驯化的π值分别为0.2503 × 10−3和0.1057 × 10−3,均显著低于野生组。
基因区核苷酸多样性显示相似的结果,说明野生类群具有较高的遗传多样性。
146个样品中共发现41个单倍型,野生类群鉴定32个单倍型,占所有单倍型的78.05%,26个为野生类群特有。驯化组鉴定出11个单倍型,占所有单倍型的26.83%,5个为唯一单倍型。育种群体鉴定出6个单倍型,占所有单倍型的14.63%,4个单倍型是唯一的。这三个群体共有两个单倍型。野生组的单倍型数显著高于驯化组和繁育组。
为了进一步了解野生居群的单倍型信息,对7个不同地区的100份野生居群样品进行了单倍型分析。结果表明:野生居群共有32个单倍型,其中云南地区单倍型数量最多,鉴定出14个单倍型,占总数的43.75%;贵州次之,8个单倍型,占总数的25%;西藏地区单倍型最少,只有1个,但西藏地区的样本数量也最少。此外,广东地区的单倍型比例也非常高。
结论本研究测序了146个不同地理位置的cp基因组,大小在157,886 ~ 158,167 bp之间,与李属的cp基因组结构和组成相似。
基因组比较分析表明,cp基因组的差异主要是由IR区域的收缩和扩张引起的。ndhI、ccsA和ndhF基因KA/KS比例较高,rpl33和psbI基因及rps19-psbA、rps3-rpl22和ccsA- ndhd基因间区核苷酸多样性最高。
野生群体的遗传多样性和单倍型数均显著高于驯化和育种的种质群体。野生群体中,西南地区遗传多样性最高。本研究提供了丰富的叶绿体基因组资源,为研究梅子的遗传多样性做出了重要贡献。
小编总结
★本文是数据再利用案例:利用梅子群体重测序项目数据组装注释叶绿体基因组发表一篇5+的文章,一个数据从不同角度生信分析获得不同的研究结果,让生信数据最大化利用,揭示叶绿体基因组遗传信息。
通过对100份野生群体、21份驯化群体、25份繁殖群体数据组装出来叶绿体基因组,对其进行基因组特征描述,发现和李属其实物种相似。通过比较基因组学分析发现野生群体的遗传多样性最高,同时还找到最高群体的地理分布。同时利用146个cp基因组序列的SNP分子标记,探讨不同地理分布梅子资源间的遗传关系和遗传多样性,为梅子的起源和进化提供一定的参考。

