服务热线:18551854236/ 025-83360120
技术支持

数据上传|全基因组DNA甲基化原始数据

发布日期:2022-05-06 浏览次数:6181

数据上传|全基因组DNA甲基化原始数据

       全基因组DNA甲基化测序(WGBS)是将重亚硫酸盐处理方法和Illumina高通量测序平台相结合,对有参考基因组的物种在全基因组水平进行高精准甲基化研究。WGBS可以达到单碱基分辨率,精确分析每一个胞嘧啶的甲基化状态,从而构建精细的全基因组DNA甲基化图谱。

下面分享一下全基因组甲基化原始数据在SRA(https://submit.ncbi.nlm.nih.gov/subs/sra/)的上传方法。

一、准备工作

1、NCBI账号注册(此处不再介绍,具体方法见公众号“数据上传|微生物16S/ITS原始数据”、“数据上传|转录组二代原始数据”)

2、上传时需要用到的二代原始数据fastq文件

3、上传信息单内容提供

二、基本信息录入

输入网址https://www.ncbi.nlm.nih.gov/,点击进入“Submit”。如下图所示:

选择“Sequence Read Archive(SRA)”,然后点击“Submit”按钮。如下图所示:

或者输入网址:https://submit.ncbi.nlm.nih.gov/subs/sra/,进入数据上传页面。点击蓝色按钮“New submission”,开始上传流程。如下图所示:

注:带*为必填项,未加*号选项可不填。

1、SUBMITTER 填写提交者个人信息

2、GENERAL INFO 填写基础信息

如果首次提交或者没有申请Bioproject账号,选择NO;未申请BioSample 账号,选择NO。数据释放时间可选择立即释放或者指定时间释放。

3、PROJECT INFO 填写项目信息

填入项目名称、公开描述信息。

4、BIOSAMPLE TYPE 填写样品信息

根据实际情况选择样品的类型,可将拉丁名放入文本框检索,NCBI会根据分类法数据库检索出该物种类型,选择相应的就可以了。

注:进行拉丁名检索时,如果不是NCBI分类法数据库里存在的,则检索不出来。

5、BIOSAMPLE ATTRIBUTE 填写样品属性信息

根据样品类型,下载相对应的excel模板,填写样品信息,或者进行在线填写;多个样品建议使用excel方式填写,然后上传文件。

Excel文件包含有绿色、蓝色、黄色的单元格,绿色为必填项,蓝色为二选一填写项,黄色为可选项;不明确的信息可以使用missing、not collected。此处样品为植物且多个样品同时上传时表格填写示例如下:

填写完成后,在当前页面选择此文档进行上传即可。

6、METADATA 填写数据相关信息

下载excle模板填写数据相关信息,或在线填写。多个样品建议使用excel方式填写,然后上传。

根据实际信息,填写样品的数据类型,填写完成后,在当前页面选择此文档进行上传即可。示例如下:

 注意事项:

1、filename、filename2列所填内容必须与待上传的数据名字一致,否则报错。

2、sample_name需与样品属性表里的*sample_name保持一样。

3、library_ID 必须填写,可与*sample_name保持一样。


三、数据上传

注意事项:

1、上传的每个文件数据必须在SRA_metadata 元数据表里存在,如果上传tar打包文件,需在SRA_metadata 元数据表里列出所有文件名。

2、提交的所有文件名称必须是唯一的

3、可以使用 gzip or bzip2压缩文件进行上传,不可使用zip

 数据上传方法&步骤

可选择在线传输、Aspera命令(windows/Linux)、FTP传输。在线传输速度比较慢,适合小样本的传输;Aspera命令(windows/Linux)、FTP传输适合多样本的传输,且上传速度较快,均可使用。

方法一:使用网页在线传输(不推荐)

选中在线传输按钮后,选择文件Choose files上传即可。

注:上传的文件超过10GB或超过300个,不要采用此方法。

方法二:使用Aspera命令(windows/Linux,此处以windows为例)

选中FTP or Aspera Command Line file preload传输按钮后,点击Aspera command line upload instructions,可见上传的基本命令行。如下图:

1、先安装Aspera插件(如已安装请忽略),登入网址https://submit.ncbi.nlm.nih.gov/subs/sra/下载安装,安装完成(默认安装路径:C:\Users\Administrator\AppData\Local\Programs\Aspera\Aspera Connect\bin)。


2、下载Aspera连接NCBI的密码文件aspera.openssh,即下图的key.file。


3、使用快捷键win+r,在搜索框中输入“cmd”,确定,弹出以下对话框。


4、在界面输入以下命令进入Aspera安装路径。

命令:cd \Users\Administrator\AppData\Local\Programs\Aspera\Aspera Connect\bin

5、根据命令提示,在命令框中输入以下内容:


例:ascp -i F:\data\key_file -QT -l100m -k1 -d F:\test_data subasp@upload.ncbi.nlm.nih.gov:uploads/jshy_genepioneer.cn_DavFqe9W


6、上传完成10分钟后,点击网页上Refrech folders,选择“Use selected folder”按钮,选中test文件,即可查看上传的文件。

方法三:FTP软件上传

选中FTP or Aspera Command Line file preload传输按钮后,点击FTP upload instructions,可查看上传步骤具体说明。如下图:


1、先安装FTP传输软件FileZilla(如已安装请忽略),登入网址:https://filezilla-project.org/download.php?show_all=1 自行下载安装。

2、打开FileZilla软件,输入主机、账号、密码登录,点击快速连接进行登录。


3、进入uploads/jshy-swxx_genepioneer.cn_Ti7LQq7t 目录(不同账号路径不同),如下图:


4、将本地F:\test_data目录数据上传/uploads/jshy-swxx_genepioneer.cn_Ti7LQq7t

NCBI服务器账号目录,如下图:


5、上传完成10分钟后,点击网页上Refrech folders,选择“Use selected folder”按钮,选中test_data文件,即可查看上传的文件。

四:提交&审核

数据信息确认无误,点击“continue“按钮,可查看整体提交信息,确认无误点击Submit进行提交。


提交之后会收到邮件反馈,之后可获得BioProject号和BioSample号。


之后进入审核状态,但审核时间可能较长。显示“Processed”即为审核通过。