SRA(Sequence Read Archive)数据库是用于存储二代测序的原始数据的数据库。除了原始序列数据外,SRA现在也存在raw reads在参考基因的比对信息。
根据SRA数据产生的特点,将SRA数据分为四类:
- Studies 研究课题
- Experiments 实验设计
- Runs 测序结果集
- Samples 样品信息
SRA中数据结构的层次关系为 Studies -> Experiments ->Samples->Runs。
- Studies是就实验目标而言的,一个study 可能包含多个Experiment。
- Experiments包含了Sample、DNA source、测序平台、数据处理等信息。
- 一个Experiment可能包含一个或多个runs。
- Runs 表示测序仪运行所产生的reads。
SRA数据库用不同的前缀加以区分:
ERP或SRP表示Studies;
SRS 表示 Samples;
SRX 表示 Experiments;
SRR 表示 Runs;
下载数据使用专门的SRA 工具:
1. 下载最新版SRA Toolkit
下载地址:https://github.com/ncbi/sra-tools/wiki/01.-Downloading-SRA-Toolkit(亲测github很多时候打不开)
以Centos为例,直接从NCBI下载安装包
(1)wget "http://ftp-trace.ncbi.nlm.nih.gov/sra/sdk/current/sratoolkit.current-centos_linux64.tar.gz" #会自动下载最新版安装包
(2)tar xvf sratoolkit.current-centos_linux64.tar.gz
2.配置SRA-Toolkit
20221101下载的安装包为sratoolkit.3.0.0-centos_linux64
cd sratoolkit.3.0.0-centos_linux64/bin
./prefech ERR571271
报错信息:This sra toolkit installation has not been configured.
Before continuing, please run: vdb-config --interactive
For more information, see https://www.ncbi.nlm.nih.gov/sra/docs/sra-cloud/
一直以为这些软件不需要安装配置。但被打脸了。重新回到网站找配置说明。
https://github.com/ncbi/sra-tools/wiki/02.-Installing-SRA-Toolkit
第六步即为配置步骤。


第一步:按照提示输入vdb-config -i 出来一交互终端。

第二步:按tab键可以在不同菜单之间切换。
按c直接进入配置信息。然后按o光标停留在第一个choose选项,是存放以后下载的SRA数据。这里需要提前建好一个空文件夹,若文件夹非空,则不会设置成功。
第二个choose存放的是SRA-Toolkit的可执行命令路径。

第三步:按下a键,再按r选择“report cloud instance identity”。

第四步:按s保存,按enter。然后点击Esc两次退出。
第四步:设置环境变量
vim ~/.bashrc
在末尾添加:export PATH="$PATH:/home/XXXX/software/sratoolkit.3.0.0-centos_linux64/bin";
source ~/.basrc
设置环境变量,配置完成!!!可正常使用了。若再次安装不同的版本,需要再次设置。
3. 下载数据
- 下载单个文件ERR571271
$ prefetch ERR571271
程序会自动启动下载。在上面设定的文件夹下生成5个子文件夹。sra文件夹下存放的即为测序下机原始数据。字节数200+M,下载速度还可以,基本在2分钟内下完。
- 若批量下载一批文件,将需要下载的文件ID存储到一个文本文件里,一行一个ID号。比如文件Download.list
nohup prefetch --option-file Download.list 2>&1 &
- 若使用parallel并行加速
cat Download.list | parallel prefetch {}
4. 将sra文件转换为fastq文件
SAR Toolkit里提供了fastq-dump、fasterq-dump工具。
$ fastq-dump --split-3 ERR571271.sra -O result
Read 1812467 spots for ERR571271.sra
Written 1812467 spots for ERR571271.sra
或者
$ fasterq-dump --split-3 ERR571271.sra -O result1
spots read : 1,812,467
reads read : 3,624,934
reads written : 3,624,934
--split-3 参数可以把双端测序的reads提取出来,左端标示为*_1.fastq;右端标示为*_2.fastq。
$ ll result/
total 1329432
-rw-rw-r--. 1 XXX XXX 680668110 Nov 2 19:27 ERR571271_1.fastq
-rw-rw-r--. 1 XXX XXX 680668110 Nov 2 19:27 ERR571271_2.fastq
conda install -c conda-forge parallel