Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

ย 

History

3 Commits
ย 
ย 
ย 
ย 
ย 
ย 
ย 
ย 
ย 
ย 
ย 
ย 

Repository files navigation

๐ŸŽป VIOLIN: Spatial Priors via Space Filling Curves for Small and Limited Data Vision Transformers

Official implementation of ICML'26 paper: Spatial Priors via Space Filling Curves for Small and Limited Data Vision Transformers.

VIOLIN illustration

Video: Scanning patterns for Snake, Zig-Zag, Hilbert and Peano curves.

๐Ÿ” Overview

VIOLIN enhances spatial awareness in Vision Transformers (ViTs) by integrating Space Filling Curves (SFCs) into masked attention.
It is compatible with standard ViT architectures and can be used during either pretraining or fine-tuning, with minimal compute overhead.

  • ๐Ÿ” Uses 8 SFCs (Snake, Zig-Zag, Peano, Hilbert and their transposes)
  • ๐Ÿ”ง Drop-in replacement for standard attention (no architectural changes)
  • โš™๏ธ Works with DeiT, and DINO backbones
  • ๐Ÿš€ Improves both supervised and self-supervised performance
  • ๐Ÿ”Œ Plug-and-play: can be used directly during fine-tuning
  • โšก Minimal computational and memory overhead

Setup & Usage

This repo builds on existing ViT training frameworks. Please follow the original repositories (e.g., DeiT, DINO) for environment setup and dependencies.

For fine-tuning, please follow VTAB Evaluation Code.

Run VIOLIN-enhanced models

Each folder contains training scripts with VIOLIN attention:

  • DeiT/: Supervised training (DeiT + VIOLIN)
  • DINO/: Self-supervised training (DINO + VIOLIN)
  • logs/: Logs for all experiments

Checkpoints of all models will be available soon.

Cite as:

@inproceedings{candogan2026spatial,
title={Spatial Priors via Space Filling Curves for Small and Limited Data Vision Transformers},
author={Leyla Naz Candogan and Arshia Afzal and Pol Puigdemont and Volkan Cevher},
booktitle={Forty-third International Conference on Machine Learning},
year={2026},
url={https://openreview.net/forum?id=mLVSIefyWj}
}

About

VIOLIN: Spatial Priors via Space Filling Curves for Small and Limited Data Vision Transformers, ICML 2026

Resources

Stars

Watchers

Forks

Releases

Packages

Contributors

Languages