1.下载数据 (Aspera下载老是断开,用prefetch下载也不慢)
1.1 ncbi找到SRR 号
1.2 创建SRR_ACC_LIST.txt 一行一个SRR号
1.3 批量下载 prefetch --option-file SRR_ACC_LIST.txt
1.4 批量将sra文件 转fastq文件 (这次写的slerm,没报错)
nano fastqdump.slerm
由于服务器用户比较多,需要提交后台运行代码,如果可以直接运行不用写slurm
写入
#!/bin/bash
#SBATCH --partition=normal #normal节点或fat节点
#SBATCH -t 6:00:00 #时间,可设可不设
#SBATCH --array=0-5 #6个样本就写到5,16个样本就写到15
#SBATCH --mem=10G #分配多少G
#SBATCH --cpus-per-task=8
#SBATCH --job-name=fastpdump_luly
#SBATCH --nodes=1
libraries=(SRR12606495 SRR12606494 SRR12606496 SRR12606497 SRR12606498 )
prefetch ${libraries[$SLURM_ARRAY_TASK_ID]} -O ./
fastq-dump ./${libraries[$SLURM_ARRAY_TASK_ID]}/${libraries[$SLURM_ARRAY_TASK_ID]}.sra --split-3 --gzip -O ./fastq
##--gzip :输出gz格式压缩文件,节省空间,稍微多费点时间
##-O ${directory} :设置输出的文件间路径,outdirectory改为相应路径
##--split-3 :不知道sra是单端还是双端,默认使用--split-3
2. 过滤
mkdir fastp
nano fastp.slurm
#!/bin/bash
#SBATCH --partition=normal
#SBATCH -t 6:00:00 #时间
#SBATCH --array=0-5 #6个样本就写到5,16个样本就写到15
#SBATCH --mem=10G #分配多少G
#SBATCH --cpus-per-task=8
#SBATCH --job-name=fastp_luly
#SBATCH --nodes=1
libraries=(SRR12606493 SRR12606495 SRR12606494 SRR12606496 SRR12606497 SRR12606498 )
fastp -i /data8/home/jclong1/Liluli/RNA-seq/rnaseq-2/raw_data/fastq/${libraries[$SLURM_ARRAY_TASK_ID]}_1.fastq.gz -o ${libraries[$SLURM_ARRAY_TASK_ID]}_1.out.fq.gz -I /data8/home/jclong1/Liluli/RNA-seq/rnaseq-2/raw_data/fastq/${libraries[$SLURM_ARRAY_TASK_ID]}_2.fastq.gz -O ${libraries[$SLURM_ARRAY_TASK_ID]}_2.out.fq.gz -q 20 -w 8 -n 6 -h ${libraries[$SLURM_ARRAY_TASK_ID]}.html -j ${libraries[$SLURM_ARRAY_TASK_ID]}.json
#-i和-o用来指定read1的输入和输出,而大写的-I和-O(注意是喔,而不是零)则是用于指定read2的输入和输出
sbatch fastp.slurm #提交slurm
squeue #查看
less slurm-数字.out #查看是否有报错
(一般来说,对于二代测序,最好是达到Q20的碱基要在95%以上(最差不低于90%),Q30要求大于85%(最差也不要低于80%)