A complete GPT built entirely on NVIDIA cuTile: declarative GPU kernels in ~20 lines instead of ~150 hand-tuned CUDA, matching PyTorch speed in a ~10MB footprint
deep-learning gpu cuda inference nvidia transformer cuda-kernels gpt cupy gpu-programming kernel-fusion blackwell llm cutile tile-programming
-
Updated
Aug 18, 2026 - Python