fastq文件随机取样问题(适于大数据)

3M的reads是指3000000的read num

1G是指总的数据量

涉及到fastq文件(大约13个g)随机取样,看的文献用的seqkit,但我试了几次并没有取到3M的reads,输出的还是原来的文件,后来看了参数,seqkit的-n并不适用于大数据,数据太大就会输出全部的序列,然后我就在算覆盖度等问题,一直在找可替代软件或脚本,然后又尝试了seqtk(之前尝试过)并不是我想要的结果,特别奇怪,输入的是3M的reads,结果输出的只有一半,因为当时也快回来了,然后突然就想通了,我是双端测序,R1和R2加起来不就是3M的reads


看似简单,我却思考了两三个小时,算覆盖度,数据量,中间各种坑,走进了死胡同,还好要下班的时候走出来了,下午又在一直调试我新写的脚本,希望下周组装能提上日程

最后编辑于 :
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

友情链接更多精彩内容