This project is a modular Nextflow pipeline for transcriptome-level comparison of WT vs DMD ΔEx51 mouse tibialis anterior muscle RNA-seq data (single-end).
Source: NCBI GEO/SRA
- GEO series:
GSE156496
https://www.ncbi.nlm.nih.gov/geo/query/acc.cgi?acc=GSE156496 - SRA project:
SRP278118
https://www.ncbi.nlm.nih.gov/sra?term=SRP278118 - Run accessions mapped in this project:
WT1->SRR12478073
https://www.ncbi.nlm.nih.gov/sra/SRR12478073WT2->SRR12478074
https://www.ncbi.nlm.nih.gov/sra/SRR12478074DMD1->SRR12478076
https://www.ncbi.nlm.nih.gov/sra/SRR12478076DMD2->SRR12478077
https://www.ncbi.nlm.nih.gov/sra/SRR12478077
Current samplesheet.csv expects:
sample,fastq_1
WT1,data/WT1_R1.fastq.gz
WT2,data/WT2_R1.fastq.gz
DMD1,data/DMD1_R1.fastq.gz
DMD2,data/DMD2_R1.fastq.gz- Read sample sheet (single-end FASTQ input)
- Run FastQC on raw reads
- Trim reads with fastp
- Quantify transcripts with Salmon
- Aggregate QC with MultiQC
- Build expression matrix from
quant.sffiles
- macOS/Linux
- Java 17+
- Nextflow (DSL2)
- Conda (Miniforge/Anaconda) for
-profile conda
Download transcriptome FASTA (example: Ensembl GRCm39 cDNA) and build Salmon index:
mkdir -p refs
salmon index \
-t refs/Mus_musculus.GRCm39.cdna.all.fa.gz \
-i refs/salmon_index \
-k 31From project directory:
export JAVA_HOME=/Library/Java/JavaVirtualMachines/temurin-17.jdk/Contents/Home
export PATH="$JAVA_HOME/bin:$HOME/miniforge3/bin:$PATH"
nextflow run main.nf \
-profile conda \
--samplesheet samplesheet.csv \
--outdir results \
--salmon_index "$PWD/refs/salmon_index" \
-resumeresults/fastqc/: FastQC reportsresults/fastp/: trimmed FASTQ + fastp reportsresults/salmon/: sample-level*.quant.sfresults/multiqc/: MultiQC reportresults/matrix/expression_matrix.tsv: merged expression table
Large raw data and generated artifacts are intentionally excluded from GitHub, including:
- raw FASTQ files
- Salmon index files
- Nextflow
work/directory - large intermediate result directories