Skip to content
古郡 まさき edited this page Mar 4, 2024 · 4 revisions

Pipeline

Created by Kogoorimasaki on 2024.3.4

  • 环境配置
  • 同源重复序列注释
  • denovo(从头)重复序列注释
  • 重复序列库过滤(可选)
  • 重复序列库合并
  • 最终注释

00.环境配置

以下说明均基于linux,window用户推荐安装wsl后使用

singularity pull EDTA.sif docker://quay.io/biocontainers/edta:2.2.0--hdfd78af_1 mv EDTA.pl Repeat.pl

检查容器是否拉取成功:

singularity exec Repeat.sif RepeatMasker -h

01.同源重复序列注释

选用近缘种的重复序列库先进行注释,观察整体情况,并将输出结果作为参考输入EDTA。如选择大鼠(Rattus):

singularity exec Repeat.sif RepeatMasker -pa 50 -pa 50 -nolow -norna -no_is -gff -species rattus $fasta

02.从头重复序列注释

首先使用RepeatModeler做从头注释

singularity  exec Repeat.sif BuildDatabase -name $name $fasta
singularity  exec Repeat.sif RepeatModeler -pa 80 -database $name

再使用EDTA做从头注释

singularity exec Repeat.sif EDTA.pl  --overwrite 0  --genome GSmole.fasta -t 40  --species others --sensitive 0 --rmout  $fasta.out

$fasta.out为RepeatMasker的输出结果,用于EDTA做参考。

RepeatModerler和RepeatMasker对LINE和SINE的注释效果较好,EDTA对LTR、Helitron、TIR的注释效果较好。

03. 重复序列库过滤(可选)

04. 重复序列库合并

05. 最终注释

Clone this wiki locally