Pipeline RNA-seq baseado no nf-core, cobrindo fluxo completo: download de
amostras (SRA/Drive via fetchngs ou rclone), geração automática de
samplesheet, alinhamento e quantificação com nf-core/rnaseq
(STAR + Salmon), e detecção de fusões gênicas com nf-core/rnafusion.
Desenvolvido para rodar em HPC (PBS) com containers Singularity/Apptainer e,
alternativamente, em VM do Google Cloud (setup completo documentado em
docs/gcp_setup.md).
FASTQ (SRA via prefetch / Drive via rclone)
│
▼
generate_samplesheet.sh → samplesheet.csv (sample,fastq_1,fastq_2,strandedness)
│
▼
nf-core/rnaseq (STAR + Salmon) → counts + QC (MultiQC)
│
▼
nf-core/rnafusion (Arriba + STAR-Fusion + FusionCatcher)
# 1. Ativar ambiente (nós com conda + singularity)
module load anaconda3
source activate nextflow
module load singularity
# 2. Gerar o samplesheet a partir dos FASTQs (padrão *.R1.R2.fastq.gz)
bash scripts/generate_samplesheet.sh /caminho/dos/fastq scripts/samplesheet.csv
# 3. Testar com 2 amostras primeiro
head -n 2 scripts/samplesheet.csv > scripts/samplesheet_test.csv
# 4. Rodar
nextflow run nf-core/rnaseq \
--input scripts/samplesheet_test.csv \
--outdir results/rnaseq \
--fasta /ref/GRCh38.primary_assembly.genome.fa \
--gtf /ref/gencode.v49.primary_assembly.annotation.gtf \
--aligner star_salmon \
--strandedness auto \
--skip_trimming \
--save_reference true \
-profile singularity \
-resumePara a corrida completa (reutilizando o índice STAR do teste):
nextflow run nf-core/rnaseq \
--input scripts/samplesheet.csv \
--outdir results/rnaseq_full \
--fasta /ref/GRCh38.primary_assembly.genome.fa \
--gtf /ref/gencode.v49.primary_assembly.annotation.gtf \
--star_index results/rnaseq/genome/index/star/ \
--aligner star_salmon \
--strandedness auto \
--skip_trimming \
--save_reference false \
-profile singularity \
-resumebash scripts/generate_samplesheet.sh /caminho/dos/fastq scripts/samplesheet_fusion.csv --unstranded
nextflow run nf-core/rnafusion \
--input scripts/samplesheet_fusion.csv \
--outdir results/rnafusion \
--genomes_base /ref/rnafusion \
--fasta /ref/GRCh38.primary_assembly.genome.fa \
--gtf /ref/gencode.v49.primary_assembly.annotation.gtf \
--tools arriba,starfusion,fusioncatcher \
-profile singularity \
-resumernaseq_nextflow/
scripts/
generate_samplesheet.sh # auto-cria samplesheet a partir de FASTQs
docs/
gcp_setup.md # setup completo de RNA-seq no Google Cloud
examples/
samplesheet.csv # exemplo do formato esperado
- Nextflow (>= 22.x)
- Singularity/Apptainer (ou Docker) para os containers do nf-core
wgetpara downloads- Google Cloud CLI + rclone (apenas para o fluxo da VM, ver
docs/gcp_setup.md)