提问|如何批量统计区间测序覆盖度?

项目背景

对bam文件按多种自定义的划窗来统计区间的测序覆盖度。

我的需求

对于同一个bam文件,根据不同分割条件产生的多个bed文件,循环批量计算测序覆盖度。

比如,输入为一个排序后的bam文件(case.sort.bam),以及对基因组进行不同方式的自定义分箱而产生的多个bed文件(100M.bed, 50M_10M.bed, 20M_5M.bed),希望对bed文件做循环批量得到不同分箱条件下同一个bam文件的自定义区间reads数统计。

准备工作

# 使用bedtools对基因组染色体坐标进行窗口划分
# -w定义窗口长度  -s定义划窗步长
bedtools  makewindows -g sizes.genome  -w  100000000 > 100M.bed
bedtools  makewindows -g sizes.genome  -w  50000000 -s 10000000 > 50M_10M.bed
bedtools  makewindows -g sizes.genome  -w  20000000 -s 5000000  > 20M_5M.bed
# bam文件已构建索引
samtools index xxx.sort.bam

bedtools coverage循环时出现问题

# 循环时只有一个样本可以成功产生结果
cat window_list.txt|while read window;do (nohup bedtools coverage -a $window.bed -b $sample.sort.bam > $sample.$window.counts.txt.tmp &) ;done
# 产生三个结果文件,其中两个文件大小为0,里面没有内容
-rw-rw-r-- 1 xpan xpan    0 Aug 10 15:31 case.50M_10M.counts.txt.tmp
-rw-rw-r-- 1 xpan xpan    0 Aug 10 15:31 case.20M_5M.counts.txt.tmp
-rw-rw-r-- 1 xpan xpan 2.3K Aug 10 15:32 case.100M.counts.txt.tmp
# nohup.out中没有报错

我的尝试

# 不循环时是正常的
window=50M_10M
sample=case
bedtools coverage -a $window.bed -b $sample.sort.bam > $sample.$window.counts.txt 
# 产生结果:
-rw-rw-r-- 1 xpan xpan  18K Aug 10 11:50 case.50M_10M.counts.txt
# 单独测试nohup & 语句,也是正常的
nohup bedtools coverage -a $window.bed -b $sample.sort.bam > $sample.$window.counts.txt.tmp &
# 产生结果:
-rw-rw-r-- 1 xpan xpan  18K Aug 10 16:52 case.50M_10M.counts.txt.tmp
# 把每个样本的各种分箱方式都单独运行了一遍,全部都能产生正常结果

为什么单独运行时正常,循环时却只有一个结果正常呢?

换用samtools bedcov后成功了

# 换用samtools bedcov再尝试同样的操作
samtools bedcov $window.bed $sample.sort.bam > $sample.$window.counts.txt.tmp1
# 产生结果:-rw-rw-r-- 1 xpan xpan 1.3K Aug 10 15:47 case.100M.counts.txt.tmp1
# 加上循环
cat window_list.txt|while read window;do (nohup samtools bedcov $window.bed $sample.sort.bam > $sample.$window.counts.txt.tmp1 &) ;done
# 产生三个结果都正常:
-rw-rw-r-- 1 xpan xpan 1.3K Aug 10 15:57  case.100M.counts.txt.tmp1
-rw-rw-r-- 1 xpan xpan  20K Aug 10 15:57  case.20M_5M.counts.txt.tmp1
-rw-rw-r-- 1 xpan xpan  11K Aug 10 15:57  case.50M_10M.counts.txt.tmp1

samtools与bedtools产生不同结果

# samtools bedcov产生的结果只有区间内的reads数,而且和bedtools coverage计算的结果出入还不小
# samtools bedcov结果取前三行展示:
chr1    0   100000000   22300197
chr1    100000000   200000000   22302389
chr1    200000000   248956422   11554278

# bedtools coverage结果取前三行展示:
chr1    0   100000000   182139  5952928 100000000   0.0595293
chr1    100000000   200000000   180032  5266467 100000000   0.0526647
chr1    200000000   248956422   94232   3098065 48956422    0.0632821

samtools bedcovbedtools coverage 计算得到的结果差异非常大!

查了一下之后发现,samtools bedcov的算法是把区间内每个碱基的测序深度加起来,而bedtools coverage直接计算区间内的reads数(见https://www.biostars.org/p/195497/),两者适用于不同的需求。

那么,我的需求基本被解决了,因为两种算法都能够表现测序深度,除以区间长度就得到了平均覆盖率。我的最终目的是比较每个区间的测序深度的相对大小,找到平均覆盖率显著增大的区间。

延伸思考

但是如果我还是想知道开头的那个问题:对同一个样本用不同的分箱方式批量计算区间内的reads数,该怎么实现呢?

另外,bedtools coverage 和 samtools bedcov 这两个工具都不能选择线程数,也不能选择-O输出,用起来略有些不舒服。所以,还有其他更合适的工具推荐吗?

补充说明

有朋友说用bedtools multicov就可以解决问题,那是误解我的需求了。bedtools multicov可以解决多个bam文件+一个bed文件情况下的批量运行问题,但是我的问题是一个bam文件+多个bed文件情况下如何批量运行?

由于我的shell脚本能力还不太过关,自己调试花了大半天也没有找到问题原因,所以发出来请大家一起看看(当众处刑hhh)

期待有大神能给我提示(感激~)

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 213,711评论 6 493
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 91,079评论 3 387
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 159,194评论 0 349
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 57,089评论 1 286
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 66,197评论 6 385
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 50,306评论 1 292
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 39,338评论 3 412
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 38,119评论 0 269
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 44,541评论 1 306
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 36,846评论 2 328
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 39,014评论 1 341
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 34,694评论 4 337
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 40,322评论 3 318
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 31,026评论 0 21
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 32,257评论 1 267
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 46,863评论 2 365
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 43,895评论 2 351