Official implementation of ICML'26 paper: Spatial Priors via Space Filling Curves for Small and Limited Data Vision Transformers.
VIOLIN enhances spatial awareness in Vision Transformers (ViTs) by integrating Space Filling Curves (SFCs) into masked attention.
It is compatible with standard ViT architectures and can be used during either pretraining or fine-tuning, with minimal compute overhead.
- ๐ Uses 8 SFCs (Snake, Zig-Zag, Peano, Hilbert and their transposes)
- ๐ง Drop-in replacement for standard attention (no architectural changes)
- โ๏ธ Works with DeiT, and DINO backbones
- ๐ Improves both supervised and self-supervised performance
- ๐ Plug-and-play: can be used directly during fine-tuning
- โก Minimal computational and memory overhead
This repo builds on existing ViT training frameworks. Please follow the original repositories (e.g., DeiT, DINO) for environment setup and dependencies.
For fine-tuning, please follow VTAB Evaluation Code.
Each folder contains training scripts with VIOLIN attention:
DeiT/: Supervised training (DeiT + VIOLIN)DINO/: Self-supervised training (DINO + VIOLIN)logs/: Logs for all experiments
Checkpoints of all models will be available soon.
@inproceedings{candogan2026spatial,
title={Spatial Priors via Space Filling Curves for Small and Limited Data Vision Transformers},
author={Leyla Naz Candogan and Arshia Afzal and Pol Puigdemont and Volkan Cevher},
booktitle={Forty-third International Conference on Machine Learning},
year={2026},
url={https://openreview.net/forum?id=mLVSIefyWj}
}
