Skip to content

Latest commit

 

History

1 Commit

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 

Repository files navigation

Nextflow RNA-seq pipeline - nf-core/rnaseq + rnafusion

Pipeline RNA-seq baseado no nf-core, cobrindo fluxo completo: download de amostras (SRA/Drive via fetchngs ou rclone), geração automática de samplesheet, alinhamento e quantificação com nf-core/rnaseq (STAR + Salmon), e detecção de fusões gênicas com nf-core/rnafusion.

Desenvolvido para rodar em HPC (PBS) com containers Singularity/Apptainer e, alternativamente, em VM do Google Cloud (setup completo documentado em docs/gcp_setup.md).

Fluxo

FASTQ (SRA via prefetch / Drive via rclone)
     │
     ▼
generate_samplesheet.sh  →  samplesheet.csv (sample,fastq_1,fastq_2,strandedness)
     │
     ▼
nf-core/rnaseq (STAR + Salmon)  →  counts + QC (MultiQC)
     │
     ▼
nf-core/rnafusion (Arriba + STAR-Fusion + FusionCatcher)

Quick start (HPC)

# 1. Ativar ambiente (nós com conda + singularity)
module load anaconda3
source activate nextflow
module load singularity

# 2. Gerar o samplesheet a partir dos FASTQs (padrão *.R1.R2.fastq.gz)
bash scripts/generate_samplesheet.sh /caminho/dos/fastq scripts/samplesheet.csv

# 3. Testar com 2 amostras primeiro
head -n 2 scripts/samplesheet.csv > scripts/samplesheet_test.csv

# 4. Rodar
nextflow run nf-core/rnaseq \
  --input scripts/samplesheet_test.csv \
  --outdir results/rnaseq \
  --fasta /ref/GRCh38.primary_assembly.genome.fa \
  --gtf /ref/gencode.v49.primary_assembly.annotation.gtf \
  --aligner star_salmon \
  --strandedness auto \
  --skip_trimming \
  --save_reference true \
  -profile singularity \
  -resume

Para a corrida completa (reutilizando o índice STAR do teste):

nextflow run nf-core/rnaseq \
  --input scripts/samplesheet.csv \
  --outdir results/rnaseq_full \
  --fasta /ref/GRCh38.primary_assembly.genome.fa \
  --gtf /ref/gencode.v49.primary_assembly.annotation.gtf \
  --star_index results/rnaseq/genome/index/star/ \
  --aligner star_salmon \
  --strandedness auto \
  --skip_trimming \
  --save_reference false \
  -profile singularity \
  -resume

RNA fusion (nf-core/rnafusion)

bash scripts/generate_samplesheet.sh /caminho/dos/fastq scripts/samplesheet_fusion.csv --unstranded

nextflow run nf-core/rnafusion \
  --input scripts/samplesheet_fusion.csv \
  --outdir results/rnafusion \
  --genomes_base /ref/rnafusion \
  --fasta /ref/GRCh38.primary_assembly.genome.fa \
  --gtf /ref/gencode.v49.primary_assembly.annotation.gtf \
  --tools arriba,starfusion,fusioncatcher \
  -profile singularity \
  -resume

Estrutura

rnaseq_nextflow/
  scripts/
    generate_samplesheet.sh   # auto-cria samplesheet a partir de FASTQs
  docs/
    gcp_setup.md              # setup completo de RNA-seq no Google Cloud
  examples/
    samplesheet.csv           # exemplo do formato esperado

Dependências

  • Nextflow (>= 22.x)
  • Singularity/Apptainer (ou Docker) para os containers do nf-core
  • wget para downloads
  • Google Cloud CLI + rclone (apenas para o fluxo da VM, ver docs/gcp_setup.md)

Referências

About

Pipeline nf-core/rnaseq e rnafusion com Nextflow para dados de RNA-seq

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages