登录注册写文章

5 Biostar 第五课 FASTA和FASTQ格式

5 Biostar 第五课 FASTA和FASTQ格式

Fasta 和 Fastq格式作为测序分析的基础，绝对是重中之重，所以了解这两个文件的构成和格式就非常重要

Fasta格式

以 > 为header line
另起一行开始序列，序列包含 ATGCN 五种字母。Gap可以用. 或者-来表示

注意，每一行包含的序列不能太长，否则软件搞不定。另外有一些非法字母在里面可能软件会不识别，比较扯淡的是软件有时候不报错，所以一定要了解自己的软件到底可以在多大程度上容忍非法字母。
另外如果序列太长，保证每一行都在同一个长度上wrap，否则也会出问题

另外header line可以包含很多信息

小写字母可能表示重复序列

Fastq格式

这个是从basespace可以下载的数据，当然也可以自己basecall 并 demultiplex后得到

第一行 fastq的header用的是@开头
第二行是测序得到的序列
第三行是加号
第四行是测序质量打分，必须是和第二行同样的长度

其实第四行是phred score，有+33 和 +64 等编码格式

第一行的信息还是很丰富的
1 设备名
2 run id
3 flowcell id
4 flowcell lane
5 tile 号码
6 x坐标
7 y坐标
8 pair里面的1 和 2
9 有无fileter， Y是加过filter了
10 还有index的序列

Phred打分

基本看见阿拉伯数字就说明> Q20
看见英文字母就是> Q30
不知道这样理解对不对呀

获取SRA的数据

命令为
fastq-dump --split-files

看GC content:

seqkit fx2tab --name --only-id --gc viral*.fna.gz

Fastq 去重复

seqkit rmdup --by-seq --ignore-case duplicated-reads.fq.gz > duplicated-reads.uniq.fq.gz

最后编辑于：2017.12.11 14:54:48

©著作权归作者所有,转载或内容合作请联系作者
平台声明：文章内容（如有图片或视频亦包括在内）由作者上传并发布，文章内容仅代表作者本人观点，简书系信息发布平台，仅提供信息存储服务。

推荐阅读更多精彩内容

从零开始完整学习全基因组测序（WGS）数据分析：第2节 FASTA和FASTQ
在WGS数据的分析过程中，我们会接触到许多生物信息学/基因组学领域所特有的数据文件和它们特殊的格式，在这一节中将要...
黄树嘉阅读 13,157评论 0赞 60
分子进化树构建及数据分析方法介绍【转】
首先是方法的选择。基于距离的方法有UPGMA、ME（Minimum Evolution，最小进化法）和NJ（Nei...
相见很不晚阅读 25,286评论 1赞 57

从零开始完整学习全基因组测序（WGS）数据分析：第4节构建WGS主流程
这篇文章很长，超过1万字，是本系列中最重要的一篇，因为我并非只是在简单地告诉大家几条硬邦邦的操作命令。对于新手而言...
黄树嘉阅读 34,777评论 20赞 196
Bioinformatics Data Skills
第十章使用序列数据生物信息学的核心问题之一是处理大量的（通常定义糟糕或模糊）文件格式。久而久之，一些特定的简单...
yangliunk1987阅读 10,629评论 3赞 53
常见的数据格式及数据库The learning notes of the biostar ha...
常见的数据格式 genbank genbank是美国国立卫生研究院维护的基因序列数据库，汇集并注释了所有公开的核酸...
Hypdoctor阅读 5,645评论 0赞 0

赞1赞

赞赏

手机看全文