SRA Toolkit安装、配置及使用

~~~SRA(Sequence Read Archive)数据库是用于存储二代测序的原始数据的数据库。除了原始序列数据外,SRA现在也存在raw reads在参考基因的比对信息。

根据SRA数据产生的特点,将SRA数据分为四类:

  • Studies 研究课题
  • Experiments 实验设计
  • Runs 测序结果集
  • Samples 样品信息

SRA中数据结构的层次关系为 Studies -> Experiments ->Samples->Runs。

  • Studies是就实验目标而言的,一个study 可能包含多个Experiment。
  • Experiments包含了Sample、DNA source、测序平台、数据处理等信息。
  • 一个Experiment可能包含一个或多个runs。
  • Runs 表示测序仪运行所产生的reads。

SRA数据库用不同的前缀加以区分:

ERP或SRP表示Studies;
SRS 表示 Samples;
SRX 表示 Experiments;
SRR 表示 Runs;

下载数据使用专门的SRA 工具:

1. 下载最新版SRA Toolkit

下载地址:https://github.com/ncbi/sra-tools/wiki/01.-Downloading-SRA-Toolkit(亲测github很多时候打不开)

以Centos为例,直接从NCBI下载安装包
(1)wget "http://ftp-trace.ncbi.nlm.nih.gov/sra/sdk/current/sratoolkit.current-centos_linux64.tar.gz" #会自动下载最新版安装包
(2)tar xvf sratoolkit.current-centos_linux64.tar.gz

2.配置SRA-Toolkit

20221101下载的安装包为sratoolkit.3.0.0-centos_linux64

cd sratoolkit.3.0.0-centos_linux64/bin
./prefech ERR571271
报错信息:This sra toolkit installation has not been configured.
Before continuing, please run: vdb-config --interactive
For more information, see https://www.ncbi.nlm.nih.gov/sra/docs/sra-cloud/

一直以为这些软件不需要安装配置。但被打脸了。重新回到网站找配置说明。
https://github.com/ncbi/sra-tools/wiki/02.-Installing-SRA-Toolkit

第六步即为配置步骤。

image.png
image.png

第一步:按照提示输入vdb-config -i 出来一交互终端。

image.png

第二步:按tab键可以在不同菜单之间切换。

按c直接进入配置信息。然后按o光标停留在第一个choose选项,是存放以后下载的SRA数据。这里需要提前建好一个空文件夹,若文件夹非空,则不会设置成功。
第二个choose存放的是SRA-Toolkit的可执行命令路径。


image.png

第三步:按下a键,再按r选择“report cloud instance identity”。

image.png

第四步:按s保存,按enter。然后点击Esc两次退出。

第四步:设置环境变量

vim ~/.bashrc
在末尾添加:export PATH="$PATH:/home/XXXX/software/sratoolkit.3.0.0-centos_linux64/bin";
source ~/.basrc

设置环境变量,配置完成!!!可正常使用了。若再次安装不同的版本,需要再次设置。

3. 下载数据

  • 下载单个文件ERR571271

$ prefetch ERR571271
程序会自动启动下载。在上面设定的文件夹下生成5个子文件夹。sra文件夹下存放的即为测序下机原始数据。字节数200+M,下载速度还可以,基本在2分钟内下完。

  • 若批量下载一批文件,将需要下载的文件ID存储到一个文本文件里,一行一个ID号。比如文件Download.list

nohup prefetch --option-file Download.list 2>&1 &

  • 若使用parallel并行加速

cat Download.list | parallel prefetch {}

4. 将sra文件转换为fastq文件

SAR Toolkit里提供了fastq-dump、fasterq-dump工具。

$ fastq-dump --split-3 ERR571271.sra -O result
Read 1812467 spots for ERR571271.sra
Written 1812467 spots for ERR571271.sra
或者
$ fasterq-dump --split-3 ERR571271.sra -O result1
spots read : 1,812,467
reads read : 3,624,934
reads written : 3,624,934

--split-3 参数可以把双端测序的reads提取出来,左端标示为*_1.fastq;右端标示为*_2.fastq。

$ ll result/
total 1329432
-rw-rw-r--. 1 XXX XXX 680668110 Nov 2 19:27 ERR571271_1.fastq
-rw-rw-r--. 1 XXX XXX 680668110 Nov 2 19:27 ERR571271_2.fastq


**补充**安装parallel

conda install -c conda-forge parallel

©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

友情链接更多精彩内容